发生了什么
Reflection AI 于 2026 年 10 月 5 日发布公司首个开放权重模型 Beam。它采用稀疏混合专家(MoE)架构,总参数 5010 亿,每个 token 只激活约 230 亿,官方定位是面向企业编码与智能体工作负载的「主力模型」。
- 预训练使用 6144 块英伟达 GB300 NVL72,端到端不足四周,训练 23.8 万亿 token,后期有效算力利用率达 92.3%
- 强化学习阶段另用约 1.05 万块 GB300,跑完超过 1 亿次 rollout,覆盖约 100 万个合成编码、智能体与 STEM 环境
- 采用交错局部与全局注意力、细粒度路由专家与无辅助损失负载均衡,预训练结束时最热专家负载仅为均值的 1.04 倍
- 上下文能力:强化学习阶段最大 256K token,中期训练扩展至 100 万 token,并提供可调推理力度参数
成绩与口径
官方自测中,Beam 在 SWE-Bench Verified 得 80.9 分、Terminal-Bench v2.1 得 80.1 分、SWE-Bench Pro v2-Hard 得 77.2 分、SWE-Bench Multilingual 得 78.0 分。公司称其高级推理成绩与 GLM-5.2 处于同一量级,而推理算力只需后者的三分之一到四分之一。
- 在编码与智能体任务上具备竞争力,但官方承认原始能力仍落后 Kimi K3
- 上述分数全部由厂商自报,尚无第三方独立复现
为什么值得关注
过去一年开放权重模型的性价比标杆主要由中国实验室设定,Beam 是少数由美国团队提出、并把「单位 token 智能成本」作为主要卖点的同类产品。它选择先公布技术报告、再放出权重,也说明厂商在能力扩散与安全缓冲之间仍留有余地。
- 权重、模型卡与配套技术栈计划在 10 月内以 Apache 2.0 许可发布,早期访问采用申请制
- 公司称已通过戴尔 AI Factory 平台验证,并参与美国能源部的 Genesis Mission
不确定之处
目前只有厂商自报的基准表,Beam 的效率优势是否成立,要等权重公开后由外部实验室用统一推理配置验证;MoE 与密集模型之间的直接对比也需要同等条件才有意义。

