产品简介
Sakana Fugu 是 Sakana AI 推出的编排型模型。它不是单个大模型,而是一层路由:接到请求后判断任务的难度与类型,再从一批开源和专用模型里挑出合适的组合来回答。2026 年 9 月 11 日这条线被拆成两个方向,Fugu Max 追求同等质量下的最低成本,Fugu Ultra v2 追求复杂多步任务上的最高质量。两者共用同一套编排架构,差别只在调度策略。
从四月的最初实验到九月的这次发布,Fugu 走过了通用可用、领域特化、消费级产品几个阶段,最新的判断是:调度层本身就能超过单个模型。
核心功能
- 一个 API,两个取向:Fugu Max 面向高频、难度参差的生产流水线,尽量把请求分给能解决它的最轻模型;Fugu Ultra v2 面向长链路推理、自主研究与全栈开发,优先调度更强的智能体。模型名分别是 `fugu-max` 与 `fugu-ultra`,用 `reasoning.effort` 参数在 high、xhigh、max 之间切换思考强度。
- 定价落在成本—性能前沿:Fugu Max 输入 $2、输出 $6 每百万 token。Sakana 公布的口径里,它的输出定价比 Sonnet 5、GPT 5.6 Terra、Kimi K3 低 40% 到 60%,并在十项基准的七项上把成本与性能的边界往外推了一格。
- Ultra v2 的成绩集中在难任务:在需要持续推理复杂视觉与结构化数据的 Chartography 上,Fugu Ultra v2 拿到 48.3;软件工程方向的 DeepSWE 拿到 74.3。八项基准里它拿下 GDP.pdf、Chartography、SWEFish、DeepSWE、Toolathon 的最佳或并列最佳,七项进入前二。
- 模型池可换,不绑单一供应商:Fugu Ultra v2 在评测中没有使用 Fable 5、Fable 5.1、GPT-6-Astra 这三款闭源前沿模型,靠池内的开源与专用模型达到上述分数。池子包含 NVIDIA Nemotron 系列,来自与 NVIDIA 的合作。Sakana 把这个设计当作供应链层面的保障,池子可替换意味着单个供应商断供不会让服务停摆。
- 接进现有编码工作流:官方给出一行安装脚本,把 Fugu 挂到 Codex CLI 与 Claude Code 上,装完用 `codex-fugu` 或 `claude-fugu` 启动,支持 Ubuntu 与 macOS。接口层兼容 OpenAI 的 Chat Completions 与 Responses,也兼容 Anthropic Messages,标准 OpenAI SDK 换个 `base_url` 就能用。
- 领域特化版本 Fugu Cyber:面向安全分析、漏洞研究、威胁调查等场景的专用编排版本,CyberGym 上成功率 86.9%,CTI-REALM 上 72.1%。按量计费,需要提交申请说明用途,由 Sakana 团队人工审核后开通。
适合谁用
以下类型的用户会特别受益于 Sakana Fugu:
- 调用量大、单次任务难度波动很大的生产流水线,用 Fugu Max 压成本
- 自主研究、跨文件代码改造、复杂报表推理这类长链路任务,切到 Fugu Ultra v2
- 已经在用 Codex CLI 或 Claude Code 的团队,把它作为第二供应商挂上去做冗余
- 安全团队做漏洞分析与威胁情报归集,用 Fugu Cyber
优点亮点
- 把「选哪个模型」从应用代码挪到路由层,换模型不用改业务逻辑
- 兼容 OpenAI 与 Anthropic 两套接口,迁移成本低
- 模型池可替换,对单一供应商的依赖显著降低
- Max 档的定价在同类前沿能力里处于成本效率一侧
价格与方案
按 token 计费。Fugu Max 输入 $2、输出 $6 每百万 token。Fugu Ultra v2 定位更高,价格随调度到的最强模型浮动。Fugu Cyber 仅支持按量计费。企业如需指定模型池或供应商配置,可以联系 Sakana 定制。
总结与建议
Fugu 的价值不在单项分数,而在把选模型这件事收进了路由层。调用量大、任务难度分布很广的场景,这个抽象能省下真金白银;追求极致质量又不想被单一闭源供应商绑住的场景,Ultra v2 提供了一个可用的选项。需要注意 Ultra v2 的训练截止日期是 2026 年 8 月 28 日,benchmark 分数目前来自 Sakana 自己的发布材料,尚未被第三方独立复现。
版本演进
- Fugu Max / Fugu Ultra v2 (2026-09-11):Fugu Max 扩大模型池至史上最广,输出定价 $6 每百万 token;Fugu Ultra v2 在 Chartography 拿到 48.3、DeepSWE 拿到 74.3
- Sakana Chat & NVIDIA 合作 (2026-08):编排能力进入日常消费级使用,开始接入 NVIDIA Nemotron 开源模型
- 通用可用 & Fugu Ultra v1 (2026-06):证明编排层可以在困难基准上对标闭源前沿模型
- Fugu Beta (2026-04):验证多智能体编排可以作为统一基座模型工作