中国移动发布国内首个国产GPU+类脑芯片大模型异构混合推理系统:DeepSeek V4 Flash验证,能效提升1倍、成本降40%

中国移动发布国内首个国产GPU+类脑芯片大模型异构混合推理系统:DeepSeek V4 Flash验证,能效提升1倍、成本降40%

qidao123.com企服评测-应用市场2026-09-13T09:00:00.000+080019
2026中国算力大会"算力首创首发发布会"专场上,移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同发布国内首个国产GPU+类脑芯片大模型异构混合推理系统。系统创新实现Transformer模型PD/AF分离推理模式:Attention计算交由国产GPU承载,FFN模块交由类脑芯片处理,充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势;自研模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度与结果聚合。项目已在DeepSeek V4 Flash大模型上完成完整调优验证,相较同类国产GPU算力集群,推理输出和能效均提升1倍以上、业务运营成本降低40%以上,为国内大模型与多智能体应用提供一条自主可控的新算力路径。
【新闻原文】 2026中国算力大会"算力首创首发发布会"专场上,由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同打造的国内首个"国产GPU+类脑芯片"大模型异构混合推理系统正式发布。该系统通过全栈架构创新,让国产芯片高效支撑大模型推理,为国内大模型与多智能体应用提供一条自主可控的新算力路径。 大模型并发服务对吞吐量、能耗成本要求极高,传统单一GPU推理架构面临"内存墙""功耗墙"双重瓶颈,且国内先进制程供给受限,单纯依靠硬件工艺升级提升算力的空间有限。项目团队首次将国产通用GPU与类脑芯片深度融合,创新实现Transformer模型PD/AF分离推理模式:将Attention(注意力)计算与FFN(前馈网络)模块拆分,由不同特性的国产芯片分工处理——Attention计算交由国产GPU承载,FFN模块交由类脑芯片处理,充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势。团队同时自研模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度与结果聚合。项目已在DeepSeek V4 Flash大模型上完成完整调优验证,相较同类国产GPU算力集群,推理输出和能效均提升1倍以上,业务运营成本降低40%以上。该成果是产学研用协同创新的典型实践,打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。 【企服观察】 这条新闻放在今天这个时点,分量不亚于任何一个大模型发布。中国AI产业最硬的约束从来不是模型能力,而是先进制程受限之下的算力供给;而中国移动联合五家机构给出的答案很有启发——既然先进制程短期追不上,那就换一个维度竞争:用系统架构创新,把手里现成的国产芯片"编排"出超越单芯片能力的系统效率。推理输出和能效翻倍、运营成本降低40%,这些数字意味着国产算力第一次在"经济性"这个企业客户最关心的维度上具备了与进口方案正面竞争的底气。 对IT企服行业,这件事有三层含义。第一层,国产算力从"备胎"正式转正为"主力选项"。过去企业上国产芯片最大的心理障碍是"能用但不好用"——算子不全、生态薄弱、迁移成本高。现在运营商级的异构推理平台开始出现,且已经在DeepSeek V4 Flash这种主流开源模型上完成调优验证,意味着企业部署国产算力的技术风险大幅下降。对于数据敏感、预算受限、又希望在国产化赛道拿分的央国企和政府类客户,现在应该启动国产算力POC测试,把迁移成本、性能表现、单位Token成本放进正式的选型评估表,而不是继续观望。 第二层,"混搭异构"会是未来两三年中国算力的主流形态。 Attention交给GPU、FFN交给类脑芯片,这种按算子特性分配硬件的思路,本质上是用软件调度能力换取硬件效率。它预示着未来的企业AI基础设施不再是"买一批同型号GPU"这么简单,而是GPU、NPU、类脑芯片、FPGA混合部署、统一调度。这对企服厂商既是挑战也是机会:挑战是运维复杂度上升,需要既懂芯片特性又懂模型结构的新型架构师;机会是异构资源调度、成本优化咨询、混合云部署这些服务品类会快速长出市场,提前布局的企业服务商会吃到第一波红利。 第三层,运营商正在成为企业AI市场最不能忽视的"新变量"。中国移动成立算力办和Token办两大顶级机构、移动云下沉到推理系统层的动作说明,运营商的野心不只是卖带宽和机柜,而是直接经营"算力+模型+Token"的全栈基础设施。它们的天然优势是网点覆盖、政企关系和资金成本。中小IT服务商与其正面竞争,不如主动"寄生"到运营商生态里:成为移动云、天翼云、华为云的行业交付伙伴、ISV伙伴,借船出海。在算力普惠化的时代,掌握客户场景和交付能力的服务商,永远不缺上游愿意分利的平台方。 最后提醒一点:能效提升1倍、成本下降40%目前是实验室到试点环境的验证数据,大规模商用后的真实表现仍需观察。企业做国产化迁移决策时,务必要求供应商提供与自身业务等量的实测压测报告,把"发布会的PPT指标"和"生产环境的SLA承诺"区分清楚。另外值得注意的关键设计是PD/AF分离这一思路的可复制性:把模型按算子拆开、按硬件特性分工的范式,不只适用于类脑芯片,同样可以推广到NPU、FPGA甚至边缘设备上,这意味着围绕"异构调度"的工具链、中间件和运维服务会形成一个持续的生态位。自主可控是大方向,但落地节奏要用数据说话,一步一步走稳。对于正在做三年IT规划的团队,建议把"国产异构算力适配评估"正式列入技术雷达,哪怕今年不迁移,也要让团队保持对这条技术路线的实战认知,避免三年后被迫紧急换道时的手忙脚乱。

好内容,需要你的鼓励

评论

请评价真实、客观、有价值的内容
0/500

请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。

还没有评论,期待你的第一条客观评价
qidao123.com:企服评测·应用市场·商务社交-IT产业互联网
微信订阅号微信订阅号
微信服务号微信服务号
微信客服微信客服(加群)
小程序小程序
H5H5
关于我们
商务合作
本站浏览量:3672778 ©Copyright 2022-2026 杭州祥升科技有限公司 版权所有浙ICP备20004199号