
智谱披露国内首个生产级RSI实践:GLM-5.3驱动的Infra Agent在超10万张国产芯片集群上自主优化推理系统,不到两周端到端吞吐提升至基线3.2倍
智谱创始人唐杰披露递归自我改进首个工程化案例:Infra Agent完成GLM-5.3-Flash生产级推理服务从零搭建,KV Transfer并发损失从20%压至1%,单Token成本达主流NVIDIA GPU相当水平,6天Token调用量超62万亿。
【新闻原文】
9月17日,智谱(2513.HK)创始人兼首席科学家唐杰在X平台发表长文并转发智谱技术博客,披露智谱在递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践:由GLM-5.3驱动的Infra Agent(基础设施智能体)在超过10万张国产芯片组成的集群上,从零完成了GLM-5.3-Flash生产级推理服务的设计、调试与优化,实现模型对自身运行系统的反向改进。这是国内大模型厂商首次公开跑进生产环境的RSI案例。
据官方博客,GLM-5.3-Flash从在国产加速器上首次开机到承载全部线上推理流量,用时不到两周,端到端吞吐提升至初始基线的3.2倍,硬件利用效率与单Token成本达到智谱所称的"主流NVIDIA GPU相当水平",并支持1M上下文窗口与多模态请求。此前从未有运营商在国产芯片上部署过如此规模的集群:芯片内存容量与互联带宽受限、新混合架构(稀疏注意力+线性注意力)、算子不完备、许多文档"基本靠猜"。技术栈上,团队实施了以算力换带宽、以通信换显存等定制方案,引入EPD(Encode-Prefill-Decode)分离式架构,并采用ReplaySSM机制、节点内张量并行与INT8/FP8/BF16混合精度缓存。Infra Agent的核心机制是"稠密反馈":将正确性测试、运行日志、执行Trace、微基准与端到端指标整合为可重复工作流,使Agent能够本地验证每一项假设,自主定位性能瓶颈、修改底层代码并迭代——例如将KV Transfer场景中Python GIL导致的并发阻塞损失从超20%压到1%以内,并在KDA Decode算子上获得1.71倍性能提升。目前GLM-5.3-Flash的全部线上推理运行于该系统之上,其以匿名模型Ox-Alpha在OpenCode与OpenRouter上线后,6天Token调用量超62万亿。系统已受真实流量检验。智谱同时划清边界:尚未实现完全自主的RSI,目标设定、边界划分与风险判断仍由人类工程师负责。此外,9月13日智谱宣布完成约50亿美元融资,约60%将投向下一代GLM模型与完全自训练体系。(综合澎湃新闻、科创板日报、智东西报道)
【企服观察】
智谱这次披露的RSI实践,表面上看是一条"AI自我进化"的前沿叙事,但剥开包装看内核,它真正讲的是一件非常务实的事:用AI Agent把基础设施优化的工程成本打下来。对企业服务行业来说,后者才是值得认真对待的部分。
先把事实边界划清楚。智谱自己明确表示尚未实现真正的RSI——目标设定、边界划分、风险判断仍由人类工程师负责,Agent只是在给定边界内完成"优化管道"的闭环。所以把它读成"AI开始自己变强"是过度解读,读成"AI开始自己修管道"更接近事实。而"修管道"这件事,恰恰是过去最贵、最难招、最难留的人才工种:一名资深Infra工程师处理GIL阻塞、算子重排、跨层并发瓶颈,动辄要投入数周时间。现在Infra Agent在不到两周内把10万卡集群的端到端吞吐拉到基线3.2倍,把KV Transfer的并发损失从20%压到1%。如果这类工作能被规模化自动化,模型厂商的人力成本结构会先于硬件成本发生变化——这对整个行业的推理定价都有传导效应。
对国产算力生态而言,这件事的含金量可能比智谱官方表述的还要高。国产芯片长期被诟病的不是单芯片性能,而是软件栈成熟度:算子不完备、文档缺失、生态碎片化,导致"生态差距"被市场当作永久性折价打进估值。智谱用GLM-5.3驱动的Agent在10万张国产卡上从零搭出生产级推理服务,并让单Token成本逼近主流NVIDIA GPU水平——这等于把"生态不成熟"从永久性问题改写为"可工程化修补的差距"。当然,"单Token成本相当"是智谱自有基准下的口径,未公布对标型号与测试集,企业不宜直接采信,但方向性信号是明确的:软件栈差距正在被AI工具链快速填补,评估国产算力方案时应当把这一变量纳入近期而非远期。
从商业模式角度,RSI叙事对智谱自身有直接的经济意义。推理系统的吞吐与单Token成本,是智谱那笔"300亿算力投入、400亿年收益"测算里80%理论推理毛利的前提。模型把自己的推理成本打下来,等于给这笔账补上了一个自我强化的变量。值得玩味的是,智谱一边用Flash系列降本,一边年内第六次提价(GLM-5.3-FlashX定价为Flash的2.5倍)——降本和提价同步发生,说明其成本优势正在转化为对高价值Agent工作负载的定价权。企业采购方需要意识到:头部模型厂商的低价Flash档位是引流资产,价格会随供需波动,长周期合同里的价格条款必须留出调整空间。
对IT企服从业者的行动建议有三条。第一,密切跟踪"Agent做Infra"工具链的产品化进程——如果智谱或同行把Infra Agent能力开放为服务,中小AI服务商将首次有机会以可承受成本运营万卡级推理集群,这会显著降低行业准入门槛。第二,在算力选型评估中引入"软件栈自愈能力"维度:能否自动定位性能瓶颈、自动适配新算子,未来会是比纸面FLOPS更重要的供应商能力指标。第三,理性看待RSI的长期叙事,短期内它不改变任何采购决策,但中期它会重塑推理服务的成本曲线——把2027年的算力预算建立在动态重估之上,而不是今天的价格锚点上。此外,安全维度也应提前布局:模型参与基础设施代码修改,意味着生产环境的变更链路里出现了AI角色,企业自建类似体系时,必须配套自动化回归测试、灰度发布与人工审批节点,把Agent的权限严格限制在可回滚的边界内,避免为效率收益引入不可控的运行风险。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。