
智谱开源GLM-5.3-Flash"牛来"Ox Alpha:320B仅激活18B,定价为Opus 4.8的1/40,10万张国产芯片集群首次承载大规模推理流量
智谱正式上线并开源GLM-5.3-Flash(320B-A18B):AA智能指数57分与Opus 4.8持平,首个稀疏+线性注意力混合架构开源前沿模型;输入0.15美元/输出0.50美元(百万token),定价仅为Opus 4.8的1/40;匿名模型Ox-Alpha"牛来"在OpenCode/OpenRouter 6天消耗20万亿Token、使用量超DeepSeek两倍;服务首次跑在10万张国产芯片(华为/摩尔线程/海光)上。
【新闻原文】8月26日晚,智谱正式上线并开源GLM-5系列首个原生多模态模型GLM-5.3-Flash(320B-A18B),在Artificial Analysis综合智能指数中取得57分,与Claude Opus 4.8得分持平,进入全球前沿模型区间;在自研Z.ai Code Bench体感评估中编程表现与Opus 4.8相当。GLM-5.3-Flash总参数320B、激活18B,全面超越参数量高出一倍的GLM-5.2;架构专为极低成本设计:总参数量与GLM-4.5相当(355B vs 320B),但激活参数量(32B→18B)与层数(92→45)几乎减半,结合30T Token多模态预训练语料实现用更少算力更强性能。GLM-5.3-Flash是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,注意力计算量与KV缓存大小相较GLM-5.3分别降低3.01倍和4.44倍;同时引入流形约束超连接(mHC)提升Scaling能力。定价方面,GLM-5.3-Flash输入0.15美元/百万token、输出0.50美元/百万token、命中缓存输入0.03美元,是GLM-5.3的1/10、限时折扣内为GLM-5.3的1/20、仅为Claude Opus 4.8的1/40。正式发布前,智谱以匿名模型Ox-Alpha(中文社区称"牛来")在OpenCode和OpenRouter进行了大规模测试,6天处理超20万亿Token、刷新双平台历史纪录,OpenRouter使用量超DeepSeek两倍。智谱首次在大规模流量中使用10万张国产芯片集群(华为、摩尔线程、海光)提供服务,端到端性能相比同一硬件初始基线提升3倍,硬件效率和单token成本与主流英伟达GPU相当。该模型视觉编码原生集成、可自主判断何时"观察"并利用视觉反馈指导下一步行动,已在Blender中自主运行16小时搭建出约400平方米的专业主厨自宅与测试厨房。智谱8月27日港股高开8.25%、报1115港元/股,总市值约1116亿港元。
【企服观察】智谱用GLM-5.3-Flash+10万张国产芯片+定价为Opus 4.8的1/40+Ox Alpha"牛来"现象级测试四件套,重新定义了中国前沿大模型的竞争规则——这是2026年下半年国产AI最具结构性意义的一次产品升级,对IT企服行业的启示至少有五点。
第一,"前沿智能+1/40价格"是OpenAI/Anthropic时代定价逻辑的颠覆。GLM-5.3-Flash在Artificial Analysis 57分(持平Opus 4.8)的能力下,价格仅为Opus 4.8的1/40(输入0.15美元 vs约6美元、输出0.50美元 vs约30美元)。这意味着前沿AI智能第一次不必"精打细算地用"——企服公司可以以极低成本把前沿智能嵌入每一个产品、每一次交互、每一个工作流。对企服厂商的启示是:未来企服AI产品定价逻辑必须重构——从"按Token收费"走向"无限Token包+订阅制"、从"按查询收费"走向"按结果/任务收费"、从"按能力分级"走向"全场景前沿能力标配"。提前布局AI定价重构、AI订阅设计、AI Token经济的企服公司,会在AI定价新范式中占据先机。
第二,10万张国产芯片集群承载大规模推理流量是中国算力自主化的"压力测试"成功标志。智谱首次在大规模流量场景下使用10万张国产AI芯片(华为、摩尔线程、海光)+自研高带宽互联网络+SGLang推理引擎,端到端性能相比同一硬件初始基线提升3倍,硬件效率和单token成本与主流英伟达GPU相当。这意味着国产AI芯片在大规模推理场景下已经具备"性能+成本"双重可行性。对企服厂商的启示是:中国AI Infra市场进入"全栈自主"时代——从国产AI芯片、国产服务器、国产存储到国产AI框架、国产推理引擎、国产模型,已经形成端到端可用栈。提前布局国产AI Infra适配、国产AI芯片优化、国产AI模型部署的企服公司,会在中国AI Infra国产化大潮中扮演关键角色。
第三,Ox-Alpha"牛来"6天消耗20万亿Token刷新OpenRouter历史纪录是中国大模型社区运营的范式胜利。智谱以匿名模型Ox-Alpha在OpenCode/OpenRouter做了6天大规模测试,迅速成为当周最受欢迎模型,调用量超DeepSeek两倍。这种"匿名测试+社区引爆+正式发布"的三阶段发布策略,比传统"正式发布+等待社区采用"节奏快10倍。对企服厂商的启示是:未来AI产品发布不再是一次性事件,而是"社区运营+渐进引爆+正式发布"的全周期营销。提前布局AI社区运营、AI模型评测、AI开发者营销的企服公司,会在AI产品社区化运营中拿到红利。
第四,稀疏注意力+线性注意力混合架构是下一代大模型架构的明确方向。GLM-5.3-Flash是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,注意力计算量与KV缓存大小相较GLM-5.3分别降低3.01倍和4.44倍——这意味着长上下文场景(百万Token级)的推理成本可以大幅降低。对企服厂商的启示是:未来长上下文企服应用(代码助手、法律合同审查、金融研报分析、客服全量记录、智能体多步推理)将成为主流,企服产品必须建立"百万Token长上下文+稀疏注意力+成本可控"的技术能力。提前布局长上下文AI产品、稀疏注意力模型适配、AI长上下文场景优化的企服公司,会在AI长上下文时代拿到关键位置。
第五,原生多模态+视觉编码集成+Blender自主16小时建模标志AI Agent工程能力的新标杆。GLM-5.3-Flash把视觉编码原生集成进模型,模型可自主判断何时"观察"并利用视觉反馈指导下一步行动;已在Blender中自主运行16小时搭建出约400平方米的专业主厨自宅与测试厨房;针对金融/法律场景做了专门优化,可完成合同审查批注、律师函起草等任务。这意味着AI Agent已经从"对话+文档"扩展到"视觉+3D+长任务+专业领域"。对企服厂商的启示是:未来企服AI Agent必须建立"原生多模态+长任务执行+垂直领域专精"的三维能力——这是AI Agent从Demo走向生产的关键门槛。提前布局多模态Agent、长任务执行Agent、垂直领域Agent的企服公司,会在Agent 2.0阶段占据有利位置。
总体看,GLM-5.3-Flash+"牛来"+10万国产芯片+1/40定价标志中国AI正式进入"前沿智能+极致性价比+国产算力+社区运营"四维领先阶段。对IT企服公司而言,这是全面重塑企服AI产品力的最佳机会——谁能率先用智谱/阿里/DeepSeek等中国前沿模型重构产品(更便宜、更智能、更国产化、更长上下文),谁就握住了下一个AI企服周期的入场券。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。