
Fugu Ultra v2 对比 Kimi K3:两款路由器,两种高度
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
这两种系统都是路由器,而这是大多数报道遗漏的第一件事。Kimi K3 是一个拥有 2.8 万亿参数的混合专家模型,每个 token 大约激活 1040 亿参数——这意味着它每生成一个 token,都会做出一次路由决策,从其 896 个专家中选择 16 个来完成工作。Fugu Ultra v2由 Sakana AI 于 2026 年 9 月 11 日发布,则是一个处于完全不同层级的路由器:它接收传入任务,将其拆解,然后把各个部分分派到一组相互独立的模型中。一个在前向传播内部进行路由;另一个则跨模型集群进行路由。理解它们其实是同一理念在两种尺度上的体现,是看清为什么它们的价格在输入上相差 2 倍、在输出上相差 5 倍的最快方式。
这两台路由器,并排放置
• Kimi K3—— Moonshot AI 的旗舰模型,于 2026 年 7 月中旬发布,其开放权重于 2026 年 7 月 27 日公布。即便以 2026 年的标准衡量,其架构也非同寻常:69 个 Kimi Delta Attention 层与 24 个 Gated MLA 层交错排列,采用 Attention Residuals、“Stable LatentMoE”设计,以及一个 4.01 亿参数的 MoonViT-V2 视觉编码器。权重以 MXFP4 格式发布,在量化感知训练下采用 MXFP8 激活。其托管 API 暴露的推理强度只有一个受支持的值—— max.
• Fugu Ultra v2——Sakana AI 的最高能力编排层级,并非通常意义上的基础模型。它是一个兼容 OpenAI 的单一端点,可将任务分解并分派到由开放权重模型和专用模型组成的池中执行。Sakana 表示,Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 被排除在该池之外,并列出训练截止日期为 20260828。官方没有公布参数数量,因为并不存在像 K3 那样可供计数的参数——能力存在于调度策略之中。
结果是,K3 是一个组件,而 Fugu Ultra v2 是一个组装体。这让这种比较变得不寻常:这两者不仅是竞争对手,还可能是潜在的组成成分。像 K3 这样的模型,恰恰是编排器很可能会租用的那种开放权重、长上下文、支持工具调用的系统。Sakana 不公布该池的成员构成,因此 K3 是否在 Fugu Ultra v2 内部尚不可知——但如果确实如此,那么你按 Fugu 费率支付的部分费用,就是加了价的 K3 token。
价格差距究竟是什么
• 输入 — 据报道,Fugu Ultra v2 为每 100 万 5.00 美元(第三方列表;Sakana 的公告页面未公布自身费率),而 Kimi K3 为每 100 万 3.00 美元,缓存命中为 0.30 美元。
• 输出 — 据报道,Fugu Ultra v2 每 1M 收费 $30.00,而 Kimi K3 为每 1M $15.00。价格只有一半,而且这款模型还能下载。
• 缓存输入 — 缓存命中时,Fugu Ultra v2 为每 1M $0.50,而 Kimi K3 为每 1M $0.30。在系统提示词保持稳定的长时间智能体循环中,这一价差会在每一轮中不断累积。
• 上下文分层 — Kimi K3 在其整个 1,048,576 token 的窗口内保持统一,没有长上下文惩罚。Fugu Ultra v2 所报告的、超过约 272,000 输入 token 的层级会将整个请求推高至约 $10.00 / $45.00。
最后一行才是决定实际账单的关键。长时程 agent 运行的大部分生命周期都超过 272K tokens,而这恰恰是 K3 的固定费率保持平稳、Fugu Ultra v2 的费率却翻倍的地方。如果你的工作负载也是这样,那么输入侧的有效差距更接近 3.3×,而不是 1.7×。

他们共有的那一个数字
两家厂商都报告了 DeepSWE,而这一对比对 Fugu 来说,远没有其发布时的宣传口径所暗示的那么有利。Sakana 将 Fugu Ultra v2 列为 74.3。Moonshot 将 Kimi K3 列为 67.5——这是厂商报告的数据,来自模型卡。在编程智能体基准上,这是 6.8 分的差距,确实存在,但这只是已公布的一大套测试中的一项,而且正是 Sakana 以 1.6 分领先 GPT-5.6 Sol 的同一项测试。一个三家不同厂商都集中在七分以内的基准,衡量的是某种真实的东西,但并未决定性地将他们区分开来。
除此之外,两者公布的内容完全不在同一个维度上。Moonshot 的 K3 数据包括 Terminal-Bench 2.1 的 88.3、GPQA Diamond 的 93.5、HLE-Full 的 43.5(使用工具时为 56.0)、SWE-Marathon 的 42.0、OSWorld-Verified 的 84.8 以及 MCPMark-Verified 的 94.5——全部为厂商自报,全部列在模型卡上。Sakana 为 Fugu Ultra v2 列出的八项数据中,包含 SWEFish 和 Toolathon 两项内部基准,而 Sakana 之外的任何人都无法复现它们。
独立来看,其中只有一个得到了任何测量。Kimi K3 在 Artificial Analysis 智能指数 v4.3 上得分为 44——在开源权重模型中排名第二,仅次于 GLM-5.3 的 45——并且在 Vals AI 标准化智能体测试框架下的 SWE-bench Verified 上达到 93.40%,落后于 Claude Opus 5 和 DeepSeek V4 Pro,但差距不大。它还以 1679 Elo 领跑 Frontend Code Arena,领先于 Fable 5 的 1631 和 GPT-5.6 Sol 的 1618。如果你看到 K3 被引用为 57 或 60,那是已被取代的指数标度,不应再重复。
Fugu Ultra v2 没有任何形式的独立评分。它于 2026 年 9 月 11 日发布,Sakana 之外无人运行过它。
速度:一项已测量,一项未测量
Kimi K3 速度很慢,而这是实测结果而非宣称:Artificial Analysis 记录到每秒 37.9 个 token,首 token 时间为 3.80 秒,并将其标记为明显冗长。对于一款围绕长周期智能体编码构建的模型而言,吞吐量是切实的制约——在长循环中,模型速度慢耗费的是实际时间,而不仅仅是金钱。
Sakana 完全没有公布 Fugu Ultra v2 的任何延迟或吞吐量数据。对于一个编排器来说,这可以说是一种坦诚,而非回避,因为响应时间完全取决于它决定调用哪些模型,以及它会进行多少轮处理。但这也意味着,如果不自行测量,你就无法为切换到它所付出的实际耗时建模。对于上一代 Fugu Ultra,测试者曾公开报告运行时间长达近 30 分钟;那是 2026 年 6 月的模型,并不能作为关于 v2 的证据,不过当你做基准测试时,这就是要超越的数字。

开放权重,但有一个值得一读的附加条件
Kimi K3 的权重可下载,这与 Fugu Ultra v2 仅提供托管服务的模式有着本质区别——但其许可证范围比“开放权重”这一说法通常所暗示的要窄。K3 采用的是 Kimi K3 许可证,而非经 OSI 认可的 MIT 或 Apache 授权,而广泛流传的“修改版 MIT”说法也存在争议。条款规定,对于在任意连续十二个月内收入超过 2000 万美元的模型即服务业务,必须与 Moonshot 另行达成协议;此外,对于月活用户超过 1 亿或月收入超过 2000 万美元的产品,还需进行署名。内部使用则获豁免。
所以,诚实的说法是:K3 提供的是你可以持有、检查、微调和自行托管的权重,但须满足以收入为门槛的商业条件。Fugu Ultra v2 这些一概不提供——没有权重,没有可检查的模型池,也不能自行托管——但它也不施加任何收入条件,因为根本没有什么可授权的。这两者中哪一个更宽松,完全取决于你是否属于 K3 许可证所针对的那类公司。
如果计划是自行托管,有一个实际问题需要注意:K3 的检查点大约有 1.5 TB,厂商建议使用 64 个或更多加速器。这里的“开放权重”意味着这是一项推理集群层面的决策,而不是笔记本电脑能承担的事。对大多数团队来说,无论走哪条路,API 都是更稳妥的选择——这也正是首日就支持 vLLM 和 SGLang 比模型下载本身更重要的原因。
我们自己的流量说明了什么
有一个数据点,两家供应商都没有公布,而它的价值远超表面所见:在 OrcaRouter 网关中,Kimi K3 是本文讨论的所有模型里使用量最大的一个,且优势巨大——过去七天处理了约 32.7 亿个 token。
那不是基准测试,也无法判定质量高低。但它是一个大规模样本,反映了当决策除了 token 价格之外不产生任何成本时,开发者实际会作何选择;它表明,K3 凭借 1M 固定费率窗口、开放权重以及在 coding arena 中的强劲排名,已经在真实的长上下文智能体工作中赢得了相当大的份额。Fugu Ultra v2 没有可比的信号,因为它今天才发布。

到达每一个
Kimi K3 已上线 OrcaRouter,采用 Moonshot 自己的费率——每百万输入 token 3.00 美元,缓存命中时 0.30 美元,每百万输出 15.00 美元——零加价透传,因此供应商调价当天就会在这里生效,而无须等待迁移排期。它与目录中其他模型共用同一个基础 URL,且兼容 OpenAI 接口;由于它和其他所有模型一样位于同一网关之后,你可以把它放进故障转移链,或按条件路由到它,而不必把单一供应商硬编码进生产链路。这一点在这里比平时更重要:一个以每秒 37.9 个 token 的速度提供服务的 2.8T 参数模型,正是那种值得在其背后准备备用方案的依赖项。
Fugu Ultra v2 并非由我们提供路由。它可通过 Sakana AI 自有的 OpenAI 兼容 API 获取,该公司表示现有的 Fugu 集成只需更改一个参数即可迁移过去。两个模型使用相同的请求格式,因此将二者置于同一个开关之后的评估只是更换 base-URL,而非重写。
该选哪个
Kimi K3对几乎所有工作负载来说,都是更站得住脚的选择。它的输入和输出价格都只有 Fugu Ultra v2 的一半,在 1M 上下文窗口内表现平稳,没有长上下文性能断崖,在当前 Artificial Analysis 指数中独立评分为 44,可在收入门槛许可下自行部署,并且已经是本次对比中流量最高的模型,优势相当明显。它的代价是速度和啰嗦程度:每秒 37.9 个 token 对于智能体循环来说确实很慢,而如果你是一家大型模型即服务企业,这份许可的约束力可不小。
Fugu Ultra v2如果你想要的正是 Sakana 所兜售的那个特定特性,那它就是值得买的选择——一个能力层级,能把艰难的多步骤工作拆解到一个在结构上排除了前沿厂商的资源池上,这样一来,就没有任何单一上游模型能在你脚下被撤销、重新定价或切断。它相对 K3 的 DeepSWE 优势是真实的,且由厂商报告;它在八项基准中的七项上跻身前两名同样由厂商报告,而且这些测试中有一部分在其他任何地方都不存在。
需要注意的是,这两者都是路由决策,而你被要求选择一种高度。K3 将 token 路由到你可下载并控制的模型内部的专家。Fugu Ultra v2 将任务路由到你无法看到的模型。后者是一个更大、更强大的构想。它也是你只能凭信念接受的那个——而接受这种信念,每个 token 的成本要高出五倍。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
