一张主视觉标题卡,写着“Fugu Max vs Kimi K3”,副标题为“Sakana 偏偏选了这个标尺”,三枚胶囊徽章分别写着“输出 $6.00 vs $15.00”“按输出计低 60%”和“1M 统一价 vs 窗口未公布”,页脚一行写着“Sakana AI,2026 年 9 月 vs Moonshot AI,2026 年 7 月”,右下角是 OrcaRouter 标志。
Guides & Insights

Fugu Max 对决 Kimi K3:Sakana 选了这把标尺,那我们就来读一读

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Sakana AI 为 Fugu Max 发布的定价说明中,正好点名了三款模型来证明其定价合理,而 Moonshot AI 的 Kimi K3 就是其中之一。其说法是,Fugu Max 的输出价格比这三款低 40% 到 60%,这就使 Kimi K3——而不是 Grok 4.6,也不是 Qwen3.8-Max——成为 Sakana 自己挑选出的性价比标杆。对一家厂商来说,这么做实在大方得反常:它递给你一把尺子,还告诉你该握在哪一端。于是本文做了显而易见的事:照它说的握住。Fugu Max 于 2026 年 9 月 11 日发布,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元。Kimi K3 的标价则是 3.00 美元和 15.00 美元。输出价格低 60% 这一说法在算术上没错。这句话没有提到的是:被它压价的那款模型公布了完整的独立实测结果记录,而压价的那款则一份都没公布。

对那句40%到60%的话的审视

• 输入 — Fugu Max 每 100 万 tokens 2.00 美元,而 Kimi K3 每 100 万 tokens 3.00 美元,节省 33%,而非发布稿所主打的 40% 到 60%

• 输出 — Fugu Max 每 100 万 tokens 6.00 美元,而 Kimi K3 每 100 万 tokens 15.00 美元,前者低 60%,为 Sakana 所述范围的上限

• 缓存输入 — Fugu Max 每 100 万 tokens 0.25 美元,对比 Kimi K3 每 100 万 tokens 0.30 美元,差距小到缓存密集型循环不会察觉。

• 上下文窗口 — Fugu Max 在发布说明中未公布数值 vs Kimi K3 1,048,576 tokens

• 长提示词重新定价 —— Fugu Max 未说明档位,而 Kimi K3 在整个窗口区间内价格恒定,任何长度均不收取附加费

• 部署 — Fugu Max 仅通过厂商 API 提供,池成员资格未披露;相比之下,Kimi K3 可按 Kimi K3 License 下载权重

• 独立评估 — Fugu Max 无,且任何 Fugu 模型均不存在 Artificial Analysis 页面;相比之下,Kimi K3 的 Artificial Analysis 智能指数为 44,并在 Vals AI 的 SWE-bench Verified 上取得标准化的 93.40%

注意第一行的形态。那个主打的区间——40% 到 60%——是横跨三家具名竞争对手的范围,而 Kimi K3 正是得出 60 的那一个。单看输入,比较结果是 33%,这仍然是实打实的节省,但已经是另一句话了。这并不是在批评定价——对于一个宣称结果接近前沿水平的系统来说,$2.00 和 $6.00 确实是低数字。它只是在说明:发布稿中究竟是哪个数字在承担说服作用,以及那段话是如何围绕它来组织的。

Kimi K3 以 Moonshot 自身价格收录在我们的目录中——每百万输入 3.00 美元,缓存命中时 0.30 美元,每百万输出 15.00 美元——0% 加价原样传递,因此若 Moonshot 调整定价,新价格当天即在同一密钥上生效,而无需经历迁移周期。这一点在这里比平常更重要,因为上游降价恰恰会侵蚀或扩大这整场对比所依赖的 60% 差距。

尺度发布的内容

Kimi K3 的成绩单与稀疏恰恰相反。Moonshot 自家的模型卡报告称,Terminal-Bench 2.1 为 88.3,GPQA Diamond 为 93.5,HLE-Full 为 43.5,使用工具后升至 56.0,SWE-Marathon 为 42.0,OSWorld-Verified 为 84.8,MCPMark-Verified 为 94.5,DeepSWE 为 67.5。全部由厂商报告,而且数量相当多。

独立层同样存在,而这正是本次对比中关键的部分。Artificial Analysis 在 v4.3 智能指数上给 Kimi K3 打出 44 分——在开放权重模型中位列第二,仅次于 45 分的 GLM-5.3——录得吞吐量为每秒 37.9 个输出 token,首 token 时间为 3.80 秒。Vals AI 的标准化智能体测试框架在 SWE-bench Verified 上将其评为 93.40%,落后于 Claude Opus 5DeepSeek V4 Pro,但差距不大。它还在 Frontend Code Arena 上以 1679 Elo 领跑,领先于 1631 分的 Claude Fable 5 和 1618 分的 GPT-5.6 Sol。有一点需要提醒:如果你看到 Kimi K3 在智能指数上被引为 57 或 60,那些都是 Artificial Analysis 于 2026 年 9 月重新校准量表之前的重述前数据,不应与当前数值并列引用。

同样存在一个使用量信号,而且它来自我们自己的网关,而不是任何人的营销:过去七天里,Kimi K3 通过 OrcaRouter 处理了大约 32.7 亿个 token,是本次对比中所有模型里流量最大的。这并不是一项质量衡量。它是一份很大的样本,说明当选择模型的唯一成本就是 token 价格时,开发者会伸手去用什么;也说明固定的 1M 窗口和开放权重已经在真实的长时程工作中赢得了相当可观的份额。

A two-column scoreboard titled 'Fugu Max vs Kimi K3 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Kimi K3: output price $15.00 per 1M, input price $3.00 per 1M, cached input $0.30 per 1M, context 1M flat with no surcharge, benchmarks Terminal-Bench 2.1 at 88.3, evidence Artificial Analysis Index 44 and SWE-bench Verified 93.40%. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Kimi K3 rows Moonshot-reported and per Artificial Analysis and Vals AI.' OrcaRouter logo bottom-right.

没有数字的记分牌

Sakana 报告称,Fugu Max 在六项基准测试中取得最佳综合得分:Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish。它还表示,Max 在十项基准测试中的七项上拓展了成本-性能帕累托前沿。两者都是关于图表排名的表述。二者都没有附带具体数值、优势幅度或旁边的竞争对手数据。

这两份榜单几乎没有交集,而这正是实际问题所在。Kimi K3 报告 Terminal-Bench 2.1 的成绩为 88.3;Sakana 则表示 Fugu Max 在 Terminal Bench 2.1 上取得最佳总成绩,却没有公布任何可供与之比较的数字。仅这一行就是整场对决最清晰的例证:两家厂商都点名了同一项测试,一家给出了数字,另一家给出的却是“最佳”二字。在 Sakana 公布具体数值之前,没有任何已发布的证据能够回答:在 Sakana 选择作为主打的那项基准测试上,Fugu Max 是否胜过 Kimi K3。

对这次发布,有一种公允的解读值得说明。Fugu Max 是成本档位——与 Fugu Ultra v2 同日发布,而后者是以 $5.00 输入、$30.00 输出进行能力冲刺——它的论点来自一张帕累托图,所主张的是每美元得分,而不是得分本身。按这种框架,单看一个基准测试数字反而是更不诚实的统计口径。问题在于,这次发布还省略了分母:Sakana 自己发布的内容也承认,在任务中途切换模型可能会减少上下文缓存复用,并产生额外的编排 token,同时确认公司没有披露 Max 的缓存命中率或每任务总 token 成本。于是,那个本可裁定成本档位之争的测量指标,恰恰是未被提供的那个。

你能握在手里的重物,或是一个你看不见的池子

这就是这两款产品完全不再具有可比性的地方。

Kimi K3 提供可下载的权重,这是一条真正的逃生通道:如果定价或条款发生变化,该模型可以从你自己的基础设施上提供服务。其许可证的范围比“开放权重”通常所暗示的要窄。它是 Kimi K3 许可证,而非 OSI 批准的授权,而将其反复描述为修改版 MIT 的说法存在争议。条款要求,对于任意连续十二个月内收入超过 2000 万美元的模型即服务业务,必须与 Moonshot 另行达成协议;此外,月活用户超过 1 亿或月收入超过 2000 万美元的产品需进行署名,内部使用则豁免。而实际规模也确凿无疑:该检查点约为 1.5 TB,Moonshot 建议使用 64 个或更多加速器,因此自托管是一个推理集群层面的决策,而非笔记本电脑层面的决策。

Fugu Max 不提供上述任何一项——没有权重,没有可审查的模型池,没有自托管选项——而作为交换,它也不施加任何许可条件,因为根本没有什么可供许可。Sakana 所宣称的益处恰是掌控的反面:一个横跨开放权重模型与专用模型的池子,并在 Max 中通过 NVIDIA Nemotron 系列加以扩展,这意味着任何单一上游供应商的弃用或调价都无法让你的产品垮掉。这是一种切实的对冲。但它同样无法从外部验证,因为其成员构成是刻意不公开的,这也意味着 Fugu Max 的结果带有一个 Kimi K3 的结果所没有的到期日。

开放权重和未公开的池子,是对同一种恐惧的两种不同回答。一个说你可以离开。另一个说,没有什么可离开的。

扁平窗口决定一切的地方

Kimi K3 的 1,048,576 token 上下文是统一费率——没有长上下文档位,任何长度都不收取附加费。Fugu Max 的发布说明完全没有提及窗口,因此没有可供比较的对象,也没有可供规划的依据。对于这两款产品都瞄准的长周期智能体编程而言,会话大部分时间都深处于上下文中,这种不对称性比费率表更重要。

速度是同一个问题的镜像。Kimi K3 每秒 37.9 个 token、首 token 时间 3.80 秒是实测数据,而它确实慢——对于一个围绕长循环构建的模型而言,这确实是一项限制,Artificial Analysis 也指出它明显冗长。Sakana 没有公布 Fugu Max 的延迟或吞吐量数据,对于一个编排器来说,这可以说是诚实而非回避:响应时间取决于它选择哪些模型以及进行多少轮处理。但这意味着,如果不亲自测量,你无法对切换的真实耗时成本进行建模。对于更早的 Fugu Ultra,用户公开报告称运行时间长达 30 分钟。那是 2026 年 6 月的模型,不能作为关于 Max 的证据,但当你做基准测试时,这是需要超越的数字。

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the opening argument about the two-dimensional frontier of capability against cost and the statement that Fugu Max expands the Pareto efficiency frontier by orchestrating Sakana's largest pool of open and specialized models to date.

用 Sakana 自己的话来说,裁决便是如此

Sakana 将 Kimi K3 列为 Fugu Max 价格低于的三款模型之一,而在输出费率上,这一说法成立:6.00 美元对 15.00 美元低了 60%,恰好是所述区间的上限。若按发布声明字面理解,Fugu Max 就是更便宜的产品。

现在,用这份发布所回避的衡量标准来检验一下。Kimi K3 的输入价格贵 33%,输出价格贵 150%——而花了这些钱,你得到的是 100 万 token 的窗口且没有重新定价的断崖、一个在收入门槛许可下可下载的检查点、独立的 Intelligence Index 排名第 44 位、标准化的 SWE-bench Verified 得分 93.40%、Frontend Code Arena 第一名,以及本次对比中所有模型里最庞大的真实流量。Fugu Max 则在 token 的输入端和输出端都给出更低的费率、六项未经量化的基准测试胜利、仅为 K3 一半的缓存费率且未公布命中率,以及一个你无法查看的池子。

坦诚的结论是,Sakana 选择了一把在价格上对自己有利的衡量标尺,却在能力上没给你任何可供核查的东西。如果你的工作负载是高频大批量的,而且你的任务属于协调器能够可靠拆解的那类,那么费率差异就是实打实的钱,Fugu Max 值得做一次限定范围的试点,并且从第一个请求开始就开启 token 计量。如果你需要的是这个季度就能站得住脚的生产决策——一个你可以据此规划的窗口、一个你能拿出手的分数,以及一个即便供应商消失了你仍然能运行的模型——那么答案就是 Kimi K3,而且它已在 OrcaRouter 上以 Moonshot 的标价提供,供应商费率原样透传,未作任何改动。

A screenshot of the OrcaRouter model page for Kimi K3 (English UI, captured September 11, 2026), showing the Featured badge, the identifier kimi/kimi-k3, by MoonshotAI dated 2026-07-15, vision, tools, JSON and reasoning capability tags, a 2.8-trillion-parameter Mixture-of-Experts description, a 1M-token context window with text and image input, list pricing of $3.00 per 1M input tokens and $15.00 per 1M output tokens, traffic of 3,274.3 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.