发生了什么
9 月 20 日,上海大模型企业阶跃星辰正式发布新一代旗舰基座模型 Step 5 Preview。模型即日起通过开放平台全量开放 API,完整权重计划于 10 月 15 日释放。该模型采用稀疏混合专家(MoE)架构,总参数量 6000 亿(600B),每个词元实际激活约 270 亿(27B)参数,占比约 4.5%;支持 100 万词元上下文窗口,原生支持文本与图像输入,定位为面向真实世界智能体任务的主力工作模型。
- 架构与规格:600B 总参数 / 27B 激活参数,92 层窄而深结构,最大输出 64k 词元,单次最多处理 60 张图片
- 定价:每百万词元输入 7 元(缓存命中 0.35 元)、输出 20 元,折合美元约 1.00 / 2.70 美元
- 重点场景:AI 编程、软件工程、专业知识工作与金融研究
关键测评数据
在第三方评测机构 Artificial Analysis 的综合智能指数中,Step 5 Preview 取得 44 分,官方口径为跻身全球开源模型前三。该指数同区间内,月之暗面 Kimi K3 为 44 分,智谱 GLM-5.3 与 Claude Opus 5 为 45 分,GPT-6 Astra 为 53 分。Artificial Analysis 折算的单任务平均成本为 0.71 美元,官方据此宣称在智能水平相当的情况下,完成单一任务的成本约为 Claude Opus 5 的八分之一。
- DeepSWE v1.1 得分 67.7,领先 Kimi K3(67.5)与 GLM-5.3(66.9),低于 GPT-6 Astra(74.1)与 Claude Opus 5(74.0)
- Terminal-Bench v4 仅 33.3 分,明显落后于 GLM-5.3(41.9)、Claude Opus 5(52.3)与 GPT-6 Astra(57.9)
- Agents' Last Exam 命令行子集 29.5 分,高于同表两款国产开源模型;FrontierFinance 金融评测 66.4 分
- 长周期任务:给 24 小时自主优化 H100 上的 MLA 算子,峰值性能推至 508 TFLOPS,高于 Claude Opus 5 的 493 TFLOPS
为什么重要
阶跃星辰把这次发布的核心叙事放在「帕累托前沿」,即在能力、效率与成本之间把边界继续向外推。对企业用户而言,真正变化的是成本结构:智能体任务会把同一份代码库或文档在十几次调用中反复读入上下文,每一步都要调用一次模型,账单按生成式价格结算,大量消耗却发生在「改哪个文件、要不要继续」这类决策上。决定推理开销的是每次被唤醒的激活参数,而非总参数量,这是这一代模型在选型时最容易被误读的一栏。
另一层意义在开源节奏。10 月 15 日权重释放后,社区可以独立复现官方评测,并首次验证两件事:消费级与中型硬件能否承载 6000 亿参数规模的权重,以及微调之后能否守住 44 分这一档位。此前同榜的 Kimi K3 以开源身份报出输入 3 美元、输出 15 美元的标价,说明「开源」并不天然等于低价,它真正降低的是供应商锁定风险。
仍存在的不确定性
- 官方公布的部分成绩来自自建基准(StepCodeBench、FinStepBench),官方亦标注部分评测设置不同、不可直接横向比较
- 「全球开源前三」与「单任务成本八分之一」均为厂商口径或第三方折算结果,尚待独立团队复测
- 权重开源后的实际部署成本取决于显存需求与运维投入,中小机构短期内仍会以 API 调用为主

