各厂语言模型

Sakana AI 发布 Fugu Max 与 Fugu Ultra v2:不造更大的模型,而是学会调度一堆模型

2026年9月13日0 次阅读

Sakana AI 发布 Fugu Max 与 Fugu Ultra v2:不造更大的模型,而是学会"调度一堆模型"

大语言模型动态 · 2026年9月11日发布 · Sakana AI多智能体编排开源模型
一句话总结:9月11日,Sakana AI 正式发布 Fugu Max 和 Fugu Ultra v2。它们不是传统意义上的"又一个更大的基座模型",而是一套会动态调度大量开源与专用模型的编排系统——用便宜得多的价格,逼近甚至超过前沿模型的表现。

这是什么?为什么值得关注?

过去十年,AI 行业基本在沿着一条轴赛跑:把模型做得更大、更贵。但 Sakana AI 认为真正重要的前沿是二维的——能力一轴,成本一轴。用一个多万亿参数的大模型去查一条数据,不是智能,是浪费。

Fugu 的思路是:让系统自己判断该派哪台"机器"去干活。简单任务路由给轻量开源模型,复杂任务才动用重装火力。这次的两个新品是同一套编排架构的两种取向:

  • Fugu Max:在最低成本下做到最好的输出——面向预算敏感的日常与编码负载。
  • Fugu Ultra v2:在复杂多步任务上冲到能力天花板——面向自主研究、全栈开发这类硬活。

Fugu Max:更多模型,更少花钱

Fugu Max 整合了迄今最大规模的模型池,包括通过与 NVIDIA 合作接入的 Nemotron 开源系列。它把任务动态路由给"能解决它的最便宜模型",官方给出的关键数据:

$2 / $6
每 1M token 输入 / 输出价格
6 项
基准综合第一(Terminal Bench 2.1、GPQAD、AA-LCR、SWEFish 等)
40-60%
输出价较 Sonnet 5 / GPT 5.6 Terra / Kimi K3 的降幅

在 10 项基准中,Fugu Max 有 7 项扩展了"成本-性能效率前沿"(Pareto frontier)——也就是说,在同等价格档位里,目前没有单一模型能同时做到它的性能和成本。

Fugu Ultra v2:不靠闭源巨兽,也能冲到前沿

旗舰档的 Fugu Ultra v2 主攻持续推理、复杂视觉与结构化数据。官方强调一个关键点:它的模型池里没有 Fable 5、Fable 5.1 和 GPT-6 Astra——也就是说,这些成绩不是靠调用别人的闭源前沿模型刷出来的。

  • 8 项基准中 5 项最佳或并列最佳:GDP.pdf、Chartography、SWEFish、DeepSWE、Toolathon;8 项中 7 项进前二。
  • Chartography(视觉推理与数据解读)拿下 48.3 分,对比 Opus 5 的 27.3 和 Fable 5 的 29.5。
  • DeepSWE(真实软件工程)74.3 分,超过单价贵 3-5 倍的模型。

对企业的实际意义是:编排一个可替换的开源模型池,既能对抗厂商锁定、API 被 revoke、区域服务中断这类风险,又不用在能力上妥协太多。

怎么用?多少钱?

两个模型已于发布当天通过 OpenAI 兼容 API 开放。已经在跑 Fugu 的用户只需改一行参数即可切换到 Max 或 Ultra v2,无需任何迁移工作。

作为参照,Fugu 从 4 月的 beta、6 月正式商用 + Ultra v1、7 月的网络安全特化版 Fugu-Cyber、8 月的 Sakana Chat 与 NVIDIA 合作,到今天的 Max / Ultra v2,一年内走完了从论文设想到企业级产品的路。

对你的意义

如果你是开发者:Fugu Max 给了"前沿级编码/Agent 能力、1/2 到 1/6 价格"的新选项,尤其适合大批量自动化任务。如果你在企业里做技术选型:开源模型编排这条路,第一次在硬基准上证明了自己不必依赖闭源巨兽。对普通读者一句话:AI 竞赛的叙事,可能正在从"谁造的模型最大"转向"谁最会调度一堆模型"。

来源:本文基于 Sakana AI 官方博客一手公告整理,并有多家媒体(Marktechpost、Pondero、AI Weekly 等)与 LLM Gateway 模型时间线交叉印证。

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...