发生了什么
Sakana AI 于2026年9月11日发布 Fugu Max 与 Fugu Ultra v2。二者并非两个独立模型,而是同一套多智能体编排架构在两个优化目标下的运行点:Fugu Max 追求「在尽可能低的成本下交付尽可能好的结果」,Fugu Ultra v2 追求「在复杂多步任务上达到尽可能高的能力上限」。两者共用 OpenAI 兼容 API,官方称既有用户只需改动一个模型参数即可切换。
Fugu 的机制是把模型选择从应用代码上移到路由层:请求进入后由编排引擎分析任务意图与难度,把子任务动态分配给池中成本最低且能胜任的开源或专用模型,再汇总结果。Fugu Max 扩展了可编排的模型池,纳入通过 NVIDIA 合作接入的 Nemotron 系列开源模型。Sakana AI 称其技术路线源自 TRINITY 与 Conductor 两项研究方向,路由器通过大规模微调、演化算法与强化学习训练。
官方披露的关键数据
- Fugu Max 定价:每百万输入Token 2美元、输出Token 6美元;官方称输出价格比 Sonnet 5、GPT 5.6 Terra、Kimi K3 低40%至60%。
- Fugu Max 成绩:在 Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 与自研 SWEFish 六项基准上取得最佳总分,并在十项中的七项上扩展了成本-性能帕累托前沿。
- Fugu Ultra v2 成绩:Chartography 得分48.3(官方对比 Opus 5 为27.3),DeepSWE 得分74.3;八项基准中五项最佳或并列最佳。
- 模型池:Ultra v2 的评测结果不含 Fable 5、Fable 5.1 与 GPT-6-Astra,即成绩来自对较小、较便宜模型的编排。
- 可得性:两版本均可通过 Sakana 官方 OpenAI 兼容接口、OpenRouter 与 Vercel AI Gateway 调用,另有每月20、100、200美元的订阅方案。
为什么对企业读者重要
企业落地智能体的主要阻力正在从「能力够不够」转向「单位成本能不能撑住规模」。当一项例行数据查找被交给万亿参数级模型执行时,浪费的是真金白银。Fugu 所代表的编排路线主张:真正的竞争维度是二维的——能力与成本,而不是单一维度的参数规模。这与微软 GitHub Copilot 披露的 HydraFusion 引擎、以及 Cognition 的 Devin Fusion 属同一技术方向,即前沿模型加廉价副手的混合编排。
对采购决策更直接的影响是供应链弹性的变化。因为 Fugu 是一个架构而非单一模型,其可替换的模型池在设计上降低了单一供应商断供或涨价的敞口。这与近期欧洲围绕算力与模型自主性的讨论、以及国内企业对国产化替代的需求形成呼应:中间编排层可能成为调节成本与自主可控程度的重要杠杆。
需要留意的边界
上述定价对比与基准分数均来自 Sakana AI 的发布材料,属于厂商自报口径,尚待独立复现。多智能体编排自身会引入额外延迟与运维复杂度:路由开销、子任务间的上下文传递都可能成为新的故障点。企业更稳妥的做法是先在低关键度的高频任务上试点 Fugu Max,验证单位成本下降幅度与质量波动区间,再考虑在复杂任务上引入 Ultra v2。

