一张生成的主视觉卡片,标题为“Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base”,引题为“便宜的那个无法回答问题”,标签显示每百万输入 token $0.10 vs $0.06,AA Index 43 对 13,以及可直接作答对基础检查点。
Guides & Insights

Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base:便宜的那个连一个问题都答不上来

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

在采购电子表格最关心的两个数字上,更便宜、更快的模型胜出。Nemotron 3.5 Lightning 30B A3B Base 的运行速度为每秒 298.9 个输出 token,在独立追踪的 142 个模型中是最快的,且每百万输入 token 仅需 0.06 美元,而 Claude Haiku 5.5 为 0.10 美元。同时,正如其名称中的“Base”一词在提醒你的那样,它并不是一个助手。它是一个预训练检查点——没有监督微调,没有强化学习,也没有任何像样的聊天模板——于 2026 年 8 月 11 日以 OpenMDW-1.1 许可证发布,以便其他人可以在此基础上继续构建。Claude Haiku 5.5 于 2026 年 10 月 7 日发布,是一个你可以直接向它提问的成品。拿它们比价格,就像拿面粉的成本和面包的成本相比,而这场对比中有意思的部分,是弄清楚你的工作负载真正需要哪一个。

发布报道里没人把这一点说清楚,因为“比 Claude Haiku 5.5 更便宜、更快”比“更便宜、更快,但不跑一次微调就没法用”更适合做标题。这两种说法都成立。但只有一种有用。

每个模型实际上是什么

Claude Haiku 5.5 — Anthropic,ID claude-haiku-5-5,于 2026 年 10 月 7 日发布。支持文本和图像输入,输出文本。100 万 token 上下文,最大输出 128,000 token(在 Batch API 上通过 beta 标头可达 300,000 token),训练数据截止至 2026 年 6 月,最早退役时间为 2027 年 10 月 7 日。投入程度可在 Low、Medium、High、Xhigh 和 Max 之间调节,默认为 Medium,并默认开启自适应思考。按用量计费的 API,缓存读取为每百万 $0.01,Batch 按半价计费。可通过 Anthropic 的 API 使用,并由此在任何转售 Anthropic 模型的地方提供。

Nemotron 3.5 Lightning 30B A3B Base——NVIDIA,于 2026 年 8 月 11 日发布。这是一个 300 亿参数的混合专家(MoE)检查点,每个 token 约有 30 亿活跃参数,基于 Mamba-2 加 MoE 加注意力机制的技术栈构建,从 Nemotron 3 Ultra 蒸馏而来,并附带 MTP、DFlash 和 DSpark 投机解码。上下文长度可达 100 万 token,不过在单张 H100 上,实际上限约为 256,000。它仅支持文本。权重以 OpenMDW-1.1 许可开放。而且它是一个基础检查点:未经指令微调的原始预训练权重,这意味着它会续写文本,而不是遵循指令。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base — the scoreboard'. Claude Haiku 5.5 reads output speed 243.4 tokens per second, AA Index 43, proprietary weights, instruction-tuned yes, $0.10 per million input and $0.21 per task; the Nemotron column reads output speed 298.9 tokens per second, AA Index 13, weights open under OpenMDW-1.1, instruction-tuned no — base checkpoint, $0.06 per million input and $0.09 per task. A footer notes the Artificial Analysis figures are independently run and the NVIDIA figures are vendor-reported and unreproduced.

• 尺寸,每行一个

• 输入价格 — Claude Haiku 5.5:前 10 万个 token 每百万 0.10 美元,之后每百万 0.50 美元;Nemotron 3.5 Lightning 30B A3B Base 每百万 0.06 美元。

• 输出价格 — 每百万 0.50 美元,至 10 万 tokens 后为 2.50 美元,相比之下为每百万 0.20 美元。

• 每完成一项任务的成本——Claude Haiku 5.5 每项独立索引任务为 $0.21,而 Nemotron 为 $0.09——更便宜的模型不仅在每 token 上更便宜,在每项任务上也更便宜。

• 输出速度 — Claude Haiku 5.5 为每秒 243.4 个 token,在 182 个中排名第九;Nemotron 为每秒 298.9 个 token,在 142 个中排名第一。

• 首词元时间——Claude Haiku 5.5 约为 0.3 秒,相比之下 Nemotron 为 0.54 秒。

• 独立评分 — Claude Haiku 5.5 在 Artificial Analysis Intelligence Index 上得 43 分,在 182 个中排名第二,Max 配置下为 43.40;Nemotron 的指数为 13,在 142 个中排名第二十九。

• 上下文窗口——各 1,000,000 token,在单张 H100 上 Nemotron 实际可用约 256,000。

• 模态 — Claude Haiku 5.5 支持文本和图像输入;Nemotron 仅支持文本。

• 权重 — 在 OpenMDW-1.1 下专有与开放相对,一个总参数 30B、激活参数 3B 的混合 MoE。

• 指令微调 — 在 Claude Haiku 5.5 上存在,在 Base 检查点上缺失。

“Base”问题,直白地陈述

基础检查点预测的是下一个 token。向它提问,它往往会以可能包含此类问题的文档风格继续写下去,而不是回答问题。用“总结这份合同”去提示它,基础模型可能会生成一份法律训练文档的貌似合理的续写,而不是你那份合同的摘要。NVIDIA 之所以单独发布 BF16 检查点,并单独发布指令微调的同系列检查点,正是因为基础权重只是原材料。

在 NVIDIA 的模型卡上——由厂商自行报告,未经独立复现——基础检查点在 MMLU 上得分 78.59,在 MMLU-Pro 上得分 67.94,在 GSM8K 上得分 91.28,在 HumanEval 上得分 77.44,在 100 万 token 上下文下的 RULER 上得分 69.62。其调优同门版本的 Lightning 模型卡报告称,MMLU-Pro 为 81.94,GPQA Diamond 为 75.44,SWE-Bench Verified 为 51.56,PinchBench 为 86%,推理速度比它所取代的模型快约 30%。即便是这些调优后的数字也来自 NVIDIA 自家,而真正适用于本文标题中所指检查点的,是那些基础数字。与之相比,Claude Haiku 5.5 独立测得的 43.40——在 Artificial Analysis 的指数上位列 182 个模型中的第二,而这是一个衡量对象不同的另一套指数——并不能直接比较;准确的解读是:一个 30B 基础检查点和一个成熟的小模型,正由不同的工具、为不同的目的进行衡量。

可以毫无保留地说的是差距的形态。一个在能够回答任何问题之前还需要微调流水线、服务栈和评估工具链的基础检查点,并不能替代每百万 0.10 美元的托管模型。它是为想要自己拥有模型的人准备的起点。

Nemotron 真正胜出的地方,而且这不是安慰奖

速度至上。每秒 298.9 个输出 token 使其在 142 款模型的榜单上位居榜首——比 Claude Haiku 5.5 的 243.4 快 23%。对于延迟敏感的流水线来说,这是真实且可衡量的差异,也正是“Lightning”这个名字出现在包装盒上的原因。

开放权重第二点,而这是更大的一个。在 OpenMDW-1.1 下,你可以下载检查点,在你自己的数据上微调,并自行提供服务。Claude Haiku 5.5 完全无法微调,且无论如何都无法自行托管。对于一个拥有专有任务、不寻常的输入分布,或要求流量绝不离开自身基础设施的合规需求的团队来说,无论基准测试页面怎么说,这一差异都是决定性的。30B 总量、3B 激活也小到足以在经济上可服务——该架构正是为此而设计的。

价格位列第三:每百万输入 $0.06、输出 $0.20,享有 17% 的缓存折扣,每个索引任务 $0.09,约为 Claude Haiku 5.5 的 $0.21 的一半。两个模型都很便宜;Nemotron 更便宜。

Claude Haiku 5.5 胜出之处,即每一个需要给出答案的维度

指令遵循,因为它就是为此而训练的。独立能力,在 Index 上为 43 对 13——在一个给两者都打分的榜单上相差三十分,这是这组对比中最大的此类差距。图像输入,而 Nemotron 完全不接受。最大输出为 128,000 个 token,对比一个未公布的数字,并在 Batch 上提供 300,000 个 token 的 beta 路径。还有努力程度调节旋钮,它让你可以通过降低推理努力程度来收回成本,而不是靠重建模型。

冗长这一提醒在这里是双向的。在 Artificial Analysis 的测试套件中,Claude Haiku 5.5 输出约 4.4 亿个输出 token,而中位数约为 1 亿——它思考得非常多。Nemotron 输出约 1.2 亿个,同一来源称其对于自身规模而言略显冗长。尽管如此,Haiku 5.5 的每任务成本为 0.21 美元,而 Nemotron 为 0.09 美元,所以即便是那个话多的模型也不是昂贵的那个。这说明按 token 计价会朝两个方向产生误导,而按任务计算的数字才是你做预算时应当依据的。

自行托管与单一端点的对比

Nemotron 3.5 Lightning 30B A3B Base 以开放权重形式分发,并由多家推理服务提供商提供服务;NVIDIA 也发布了经过调优的同系列模型。Claude Haiku 5.5 可通过 Anthropic 的 API 使用,并由此在 Anthropic 模型被转售的任何渠道均可获得。两者都不在 OrcaRouter 的产品目录中,我们也不会假装它在——我们从这个邻近区间路由的是anthropic/claude-haiku-4.5、anthropic/claude-sonnet-5.5、anthropic/claude-opus-5.5以及anthropic/claude-fable-5.1,也就是比本文主题更高一档的层级。

这个对比所描述的两种路径在底层管道上确实截然不同,值得一一说明。自托管路径意味着需要一块 GPU、一个服务框架、一项量化决策以及一个运维轮值团队。托管路径则意味着一个密钥和一个模型字符串。OrcaRouter 正是为第二条路径而生:一个 API 接入 200 多个模型,一个密钥、一份账单,按供应商目录价以 0% 加价透传,因此厂商调价当天即生效,底层支持自动故障转移。它不是通往 30B 基础检查点的路径,而购买一台 DGX 级服务器也不是通往托管小模型的路径。

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

谁应该选哪个

如果你的任务定义明确、训练数据足够多到能起作用,而且流量无法离开你自己的基础设施,那么 Nemotron 3.5 Lightning 30B A3B Base 就是更值得琢磨的那个对象:输出速度在 142 个中排名第一,每个 token 的价格只有一半,而且归你所有、任你修改。在盘算能省多少之前,先把微调训练和推理服务的成本算进预算,因为 0.06 美元的输入价格,前提是已经有人完成了把检查点变成助手的那部分工作。

如果你想今天下午就发出提示词并拿到答案,能做这件事的就是 Claude Haiku 5.5——在独立指数上是 43 对 13,支持图像输入,输出上限达 128,000 个 token,而且价格确实很低。这场对比只有在价目表上才显得接近。可一旦任务变成回答问题,而不是续写文档,它就不再显得接近了。

A capture of the Artificial Analysis page for Nemotron 3.5 Lightning showing its Intelligence Index of 13 and rank of 29 of 142, the $0.06 per-million input and $0.20 output pricing, the $0.09 cost per index task, the 298.9 tokens-per-second output speed ranked first of 142, the 0.54-second time to first token, the 1M-token context window, text-only input and open weights.