返回行业动态
研究前沿

Sakana AI 发布 Fugu Max 与 Fugu Ultra v2:以多模型编排把成本-性能前沿外推,输出价格低至每百万Token 6美元

日本 Sakana AI 于9月11日发布多智能体编排系统 Fugu 的两个新版本:主打成本效率的 Fugu Max 与主打高难度任务的 Fugu Ultra v2。Fugu Max 定价为每百万输入Token 2美元、每百万输出Token 6美元,官方称较 Sonnet 5、GPT 5.6 Terra 与 Kimi K3 的输出价格低40%至60%,并在六项基准上取得最佳总分。该路线把模型选择从应用代码上移到路由层,为企业规避单一供应商锁定提供了新选项。

来源:Sakana AI 官方发布原标题:Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier查看原文
Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 多模型编排系统

图片来源:北京拓实科技原创(AI 生成配图)

发生了什么

Sakana AI 于2026年9月11日发布 Fugu Max 与 Fugu Ultra v2。二者并非两个独立模型,而是同一套多智能体编排架构在两个优化目标下的运行点:Fugu Max 追求「在尽可能低的成本下交付尽可能好的结果」,Fugu Ultra v2 追求「在复杂多步任务上达到尽可能高的能力上限」。两者共用 OpenAI 兼容 API,官方称既有用户只需改动一个模型参数即可切换。

Fugu 的机制是把模型选择从应用代码上移到路由层:请求进入后由编排引擎分析任务意图与难度,把子任务动态分配给池中成本最低且能胜任的开源或专用模型,再汇总结果。Fugu Max 扩展了可编排的模型池,纳入通过 NVIDIA 合作接入的 Nemotron 系列开源模型。Sakana AI 称其技术路线源自 TRINITY 与 Conductor 两项研究方向,路由器通过大规模微调、演化算法与强化学习训练。

官方披露的关键数据

  • Fugu Max 定价:每百万输入Token 2美元、输出Token 6美元;官方称输出价格比 Sonnet 5、GPT 5.6 Terra、Kimi K3 低40%至60%。
  • Fugu Max 成绩:在 Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 与自研 SWEFish 六项基准上取得最佳总分,并在十项中的七项上扩展了成本-性能帕累托前沿。
  • Fugu Ultra v2 成绩:Chartography 得分48.3(官方对比 Opus 5 为27.3),DeepSWE 得分74.3;八项基准中五项最佳或并列最佳。
  • 模型池:Ultra v2 的评测结果不含 Fable 5、Fable 5.1 与 GPT-6-Astra,即成绩来自对较小、较便宜模型的编排。
  • 可得性:两版本均可通过 Sakana 官方 OpenAI 兼容接口、OpenRouter 与 Vercel AI Gateway 调用,另有每月20、100、200美元的订阅方案。

为什么对企业读者重要

企业落地智能体的主要阻力正在从「能力够不够」转向「单位成本能不能撑住规模」。当一项例行数据查找被交给万亿参数级模型执行时,浪费的是真金白银。Fugu 所代表的编排路线主张:真正的竞争维度是二维的——能力与成本,而不是单一维度的参数规模。这与微软 GitHub Copilot 披露的 HydraFusion 引擎、以及 Cognition 的 Devin Fusion 属同一技术方向,即前沿模型加廉价副手的混合编排。

对采购决策更直接的影响是供应链弹性的变化。因为 Fugu 是一个架构而非单一模型,其可替换的模型池在设计上降低了单一供应商断供或涨价的敞口。这与近期欧洲围绕算力与模型自主性的讨论、以及国内企业对国产化替代的需求形成呼应:中间编排层可能成为调节成本与自主可控程度的重要杠杆。

需要留意的边界

上述定价对比与基准分数均来自 Sakana AI 的发布材料,属于厂商自报口径,尚待独立复现。多智能体编排自身会引入额外延迟与运维复杂度:路由开销、子任务间的上下文传递都可能成为新的故障点。企业更稳妥的做法是先在低关键度的高频任务上试点 Fugu Max,验证单位成本下降幅度与质量波动区间,再考虑在复杂任务上引入 Ultra v2。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 多模型编排系统|北京拓实科技