返回行业动态
算力与基础设施

Ai2 开源 Olmo-core 3:把万亿参数 MoE 训练栈交到小团队手里

艾伦人工智能研究院(Ai2)于 10 月 1 日开源 Olmo-core 3,并附技术报告、交互演示与开源代码。该框架把 MoE 训练从 FSDP 换成 DDP,让专家权重常驻 GPU、把数据路由到专家,避免每批数据反复搬运权重。实验中专家池从 8 扩到 128、总参数从 46 亿增至 470 亿,而每 token 激活参数维持约 32 亿,吞吐下降不到 5%;在 8 张 NVIDIA B300 上,470 亿参数 MoE 每卡每秒处理约 5.2 万 token,为旧实现 1.94 万的约 2.7 倍。官方称该框架已在超过 1 万亿总参数的配置上完成基准测试。

来源:Ai2 官方博客:Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs原标题:Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs查看原文
液冷机房中悬浮的立体发光方块矩阵,象征大规模混合专家模型的专家池与数据路由

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

Ai2 在 10 月 1 日发布 Olmo-core 3,一套重新设计的开放 MoE 训练系统,目标是让混合专家模型的训练规模推到万亿参数级同时不牺牲计算效率。它是下一代 Olmo 模型的核心系统之一,代码、技术报告与交互演示同步开放。官方把它定位为解决一个具体矛盾:MoE 用「每次只激活一部分专家」换取更低的单位推理成本,但训练时全部专家仍要驻留显存并更新,跨集群路由本身还会产生通信开销;专家池越大,这部分开销越可能吃掉架构红利。

关键的架构改动是把并行策略从完全分片数据并行(FSDP)换成分布式数据并行(DDP)。旧方案每批数据都要收集并重新分片全部专家权重;新方案让专家常驻 GPU,把相关数据路由到专家所在卡上,省掉反复搬运。官方同时说明,NVIDIA 的 Megatron-Core 是训练大规模 MoE 的成熟选择,Olmo-core 3 的增量在于把一体化的 MoE 训练栈装进 Olmo 自己的框架,并相对此前的 FSDP 实现提升吞吐。

关键数字

  • 专家扩容:专家池由 8 个增至 128 个,每 token 仍只选 4 个,激活参数固定约 32 亿,总参数容量由 46 亿增至 470 亿,训练吞吐下降不到 5%。
  • 吞吐对比:8 张 NVIDIA B300 上,470 亿参数 MoE 达到每卡每秒约 5.2 万 token,旧实现为 1.94 万,约 2.7 倍。
  • 低精度格式:4 张 B300 上,在前馈与专家间数据传输环节启用 MXFP8,相对 BF16 基线吞吐提升约 21%,峰值活跃显存从约 103 GiB 降至 95 GiB。
  • 大规模配置:1.2 万亿总参数配置在 512 张 B300 上完成测试,每 token 激活约 583.6 亿参数,单卡最高 858 TFLOP/s;使用 DeepEP v2 通信层时测到约 2.38 万亿参数配置。
  • 官方明确这些测试使用随机路由衡量系统吞吐,不代表训练出的模型质量。

工程细节与已知坑

框架组合了三种拆分策略:专家并行把专家分散到不同 GPU,流水线并行把模型层切给不同 GPU 组,分布式优化器则把优化器状态打散,避免每张卡保存完整副本。路由侧做了三项优化:基于 NVSHMEM 的行式专家并行把 token 直接写进专家的输入缓冲区,实现无同步;GPU 常驻路由把元数据留在卡上,CPU 无需等待回传即可排队;分组 GEMM 把小规模专家计算合并执行。检查点采用与并行布局无关的格式,记录全局 FP32 张量,因此训练可以在另一套拓扑上恢复。

技术报告也记录了负面结论,这部分对复现者更有价值:负载均衡分数可能改善而实际负载更不均衡,作者称之为「token 选区操纵」;降低低频专家的学习率没有带来收益;把通信与计算放到不同 GPU 流上重叠,有时反而拖慢端到端训练。此外,Ai2 未随代码发布独立第三方测试,所有吞吐数字均为自测。

为什么重要

万亿参数训练长期以来要求只有少数实验室具备的资源条件,这直接把高校、独立研究者与小型实验室排除在外。MoE 理论上提供了绕行方案,但跨集群协调成本会随规模上升而吞噬优势。把可用的训练栈开源,至少让「看到路线怎么走」不再依赖巨额预算。对国内团队而言,这套实现所依赖的并行与通信优化是通用工程手段,不绑定特定模型,可作为自研栈的对照实现。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

Ai2 开源 Olmo-core 3:万亿参数 MoE 训练栈开放|北京拓实科技