发生了什么
9 月 15 日,北京中关村学院与中关村人工智能研究院的研究团队在 arXiv 发布技术报告《A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search》,公开从零训练的 7.39B 参数稠密语言模型 ZGCM-1。与通常只发布最终权重的开源项目不同,该项目同时开放训练与数据处理代码、各阶段数据配方、中间检查点与训练日志,研究者可以追踪能力形成的过程并复现关键实验。
模型规格与训练要点
- 32 层、隐藏维度 4096、词汇表 154880,采用 27 层门控滑动窗口注意力(窗口 128 token)与 5 层全局注意力交替排列的混合架构。
- 预训练两阶段合计约 4.19T token,中训练 600.51B token,上下文按 16K、64K、256K 三阶梯渐进扩展。
- 在 256K 上下文下,混合注意力方案的训练吞吐约为标准全注意力的 3.94 倍,KV Cache 占用降至约六分之一。
- 16K 预训练追平同等 loss 的速度相比 BF16/AdamW 基线提升约 4.2 倍,其中 Muon 优化器贡献约 1.8 倍。
- 中训练阶段把多轮工具交互轨迹重新表述为马尔可夫决策过程的状态—动作转移,对单步决策而非整条轨迹施加监督。
评测表现与已知短板
在团队公布的对比中,ZGCM-1 于 14 项推理评测的同规模模型中平均排名第一,MATH-500 得分 97.13,AIME 2026 得分 75.00,HMMT 2025 得分 70.42。报告同时列出失分项:AIME 2024 为 80.62,低于 DeepSeek-R1-0528-Qwen3-8B 的 83.33;MMLU 为 73.88,低于 Qwen3-8B 的 85.40;LiveCodeBench v6 为 46.86,低于对比模型的 53.57。搜索类任务差距更为明显,BrowseComp 得分 19.43,WebWalkerQA 得分 63.09,说明模型在有标准答案的推理任务上更具优势,在需要自主检索线索的任务上仍有距离。
为什么值得关注
项目真正有价值的部分是工程记录而非单一分数。团队将研发流程拆分为 11 类任务,由 9 名核心贡献者按 L1 至 L5 自主性框架逐项评级:实验监控与部署工程达到 L4,即人给定目标与约束后,智能体可独立规划、执行并根据反馈调整;模型架构设计与学习算法设计仍停留在 L2,研究选题与关键设计决策依旧由人主导。团队还记录了训练中 loss 持续下降但模型能力明显退步的故障,最终定位到数据分片与 shuffle 环节的实际配比漂移。这组结论为「AI 辅助研发究竟能做到多少」提供了相对具体的工程边界,而不是笼统的乐观或悲观判断。
尚待观察
报告中的对比数据由团队自行评测,独立复现结果尚未出现;其评测口径与训练数据去污染流程是否足以排除污染,也需要外部验证。团队表示已在尝试 400B 与 500B 规模,7B 阶段积累的方法能否在更大规模上继续成立,目前尚无结论。

