
Ai2开源Olmo-core 3:把万亿参数MoE训练栈交给小团队,8卡吞吐达旧实现2.7倍
新闻原文
10月1日,非营利机构艾伦人工智能研究院(Ai2)发布并开源Olmo-core 3,一套针对大规模混合专家(MoE)模型重写的开放训练系统。它把MoE训练规模推向万亿参数级,同时保持计算效率,是下一代Olmo模型的核心训练基座之一,代码、技术报告与交互演示同步开放。
MoE用'每次只激活一部分专家'换取更低的单位推理成本,但训练时全部专家仍要驻留显存并参与更新,跨集群把数据路由到正确专家本身也产生通信与协调开销;专家池越大,这部分开销越可能吃掉架构红利。Olmo-core 3正是为补这个洞而设计。
关键架构改动是把并行策略从完全分片数据并行(FSDP,每批数据都要收集、重新分片全部专家权重)换成分布式数据并行(DDP):让专家常驻GPU、把相关数据路由到专家所在卡,省掉反复搬运权重。配合专家并行、流水并行与分布式优化器,模型与训练状态被切分到各GPU,无需每张卡都保留全量与训练状态。
实测中,专家池从8扩到128、每token仍只选4个专家,激活参数维持约3.2B,总参数从46亿增至470亿,训练吞吐下降不到5%;同一基础设施在超过1万亿总参数配置上完成基准测试。在8张NVIDIA B300上,470亿参数MoE每卡每秒处理约5.2万token,为旧FSDP实现(1.94万)约2.7倍。MXFP8低精度格式再带来约21%吞吐提升、峰值显存从103GiB降到95GiB。
企服观察
大模型训练的成本曲线这几年基本把学术实验室和小团队挤出了牌桌——万亿参数训练按亿美元计,能玩的只剩少数大厂。Olmo-core 3把训练基座开源,等于把'怎么训大模型'的方法先公开,模型后到,这本身就是一种开放姿态。
DDP替换FSDP是这次最关键的工程改动。旧方案每批数据都要把全部专家权重收集再分片一遍,开销随批次累积;新方案让专家常驻GPU、把数据路由过去,省掉反复搬运。对MoE这种'专家越多越省算力但路由越贵'的架构,这个补洞直击痛点。
2.7倍吞吐不是小数字。8张B300上470亿参数MoE每卡每秒5.2万token,意味着同样的硬件能多跑近两倍的实验,学术团队的迭代速度直接翻倍。对预算有限、靠grant过日子的研究者,吞吐就是生产力。
专家池8扩到128、总参数46亿到470亿、激活仍约3.2B、吞吐只降不到5%——这条曲线说明MoE的'大总参、小激活'路线在训练侧也能成立。企业若想私有化训练领域模型,这种扩展特性比单纯堆参数重要。
MXFP8低精度再提速21%、显存从103GiB降到95GiB,说明数值格式优化仍有油水。在显存就是宝贵资源的训练场景,省下的8GiB可能就是能不能多放一个专家的区别。这类底层优化,是开源框架最容易被人忽视却最实在的价值。
也要看清边界。Ai2自己承认1.2万亿、2.38万亿的测试用的是随机路由,测的是机器跑多快,不是训出来的模型好不好;且只和自家旧实现比,没给Megatron-Core头对头数据。选型时不要被'万亿参数'晃眼,要看你的真实负载能否复现这些吞吐。
对国内做训练框架和AI基建的团队,启发是:Megatron-Core之外,开源社区终于有了一个一体化的MoE训练替代。中小团队不必被绑死在闭源大厂栈上,可以拿Olmo-core 3做基座,把精力放在自己的数据与领域适配上。
技术报告里记录的'失败'也很值钱:某个路由分数看着更好、实际负载却更偏;给少见专家降学习率没用;通信与计算重叠有时反而更慢。这些踩坑省下其他团队数周时间。开放训练栈的意义,一半在代码,一半在这些经验。
一句话:Olmo-core 3把万亿参数MoE训练从大厂专利,变成小团队也能租卡复现的能力。当训练方法开放,模型能力的扩散会更快,企业自训领域模型的门槛随之下降——这才是对产业更持久的影响。
再看开放策略本身的价值。Ai2不只放出代码,还同时给出技术报告、交互演示和踩坑记录,这等于把'如何训练大MoE'的完整方法论摊开。对比很多只开源权重、不开训练细节的发布,这种开放对行业的实际推动更大——它让后来者能复现、能改进,而不是只能消费一个黑盒结果。
对企业用户,Olmo-core 3最直接的用武之地是领域模型自训。想在自有语料上做一个几百亿参数的行业模型,过去要么用闭源框架被绑死,要么自己啃并行策略;现在可以拿Olmo-core 3起步,把精力放在数据质量与评估上。训练框架开源化,正在把'自研模型'的门槛从大厂专属拉回到一支十人团队可以尝试的范围。
当然,框架开源只是第一步。真实训练还要解决数据清洗、评估体系、集群运维这些同样不轻的活;吞吐数字也只是机器跑分,模型质量仍取决于数据与配方。但方向是对的:当训练栈、权重、评测一起开放,AI的供给会更多元,企业议价权也会随之上升。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。