
Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base:便宜的那个连一个问题都答不上来
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
在采购电子表格最关心的两个数字上,更便宜、更快的模型胜出。Nemotron 3.5 Lightning 30B A3B Base 的运行速度为每秒 298.9 个输出 token,在独立追踪的 142 个模型中是最快的,且每百万输入 token 仅需 0.06 美元,而 Claude Haiku 5.5 为 0.10 美元。同时,正如其名称中的“Base”一词在提醒你的那样,它并不是一个助手。它是一个预训练检查点——没有监督微调,没有强化学习,也没有任何像样的聊天模板——于 2026 年 8 月 11 日以 OpenMDW-1.1 许可证发布,以便其他人可以在此基础上继续构建。Claude Haiku 5.5 于 2026 年 10 月 7 日发布,是一个你可以直接向它提问的成品。拿它们比价格,就像拿面粉的成本和面包的成本相比,而这场对比中有意思的部分,是弄清楚你的工作负载真正需要哪一个。
发布报道里没人把这一点说清楚,因为“比 Claude Haiku 5.5 更便宜、更快”比“更便宜、更快,但不跑一次微调就没法用”更适合做标题。这两种说法都成立。但只有一种有用。
每个模型实际上是什么
Claude Haiku 5.5 — Anthropic,ID claude-haiku-5-5,于 2026 年 10 月 7 日发布。支持文本和图像输入,输出文本。100 万 token 上下文,最大输出 128,000 token(在 Batch API 上通过 beta 标头可达 300,000 token),训练数据截止至 2026 年 6 月,最早退役时间为 2027 年 10 月 7 日。投入程度可在 Low、Medium、High、Xhigh 和 Max 之间调节,默认为 Medium,并默认开启自适应思考。按用量计费的 API,缓存读取为每百万 $0.01,Batch 按半价计费。可通过 Anthropic 的 API 使用,并由此在任何转售 Anthropic 模型的地方提供。
Nemotron 3.5 Lightning 30B A3B Base——NVIDIA,于 2026 年 8 月 11 日发布。这是一个 300 亿参数的混合专家(MoE)检查点,每个 token 约有 30 亿活跃参数,基于 Mamba-2 加 MoE 加注意力机制的技术栈构建,从 Nemotron 3 Ultra 蒸馏而来,并附带 MTP、DFlash 和 DSpark 投机解码。上下文长度可达 100 万 token,不过在单张 H100 上,实际上限约为 256,000。它仅支持文本。权重以 OpenMDW-1.1 许可开放。而且它是一个基础检查点:未经指令微调的原始预训练权重,这意味着它会续写文本,而不是遵循指令。

• 尺寸,每行一个
• 输入价格 — Claude Haiku 5.5:前 10 万个 token 每百万 0.10 美元,之后每百万 0.50 美元;Nemotron 3.5 Lightning 30B A3B Base 每百万 0.06 美元。
• 输出价格 — 每百万 0.50 美元,至 10 万 tokens 后为 2.50 美元,相比之下为每百万 0.20 美元。
• 每完成一项任务的成本——Claude Haiku 5.5 每项独立索引任务为 $0.21,而 Nemotron 为 $0.09——更便宜的模型不仅在每 token 上更便宜,在每项任务上也更便宜。
• 输出速度 — Claude Haiku 5.5 为每秒 243.4 个 token,在 182 个中排名第九;Nemotron 为每秒 298.9 个 token,在 142 个中排名第一。
• 首词元时间——Claude Haiku 5.5 约为 0.3 秒,相比之下 Nemotron 为 0.54 秒。
• 独立评分 — Claude Haiku 5.5 在 Artificial Analysis Intelligence Index 上得 43 分,在 182 个中排名第二,Max 配置下为 43.40;Nemotron 的指数为 13,在 142 个中排名第二十九。
• 上下文窗口——各 1,000,000 token,在单张 H100 上 Nemotron 实际可用约 256,000。
• 模态 — Claude Haiku 5.5 支持文本和图像输入;Nemotron 仅支持文本。
• 权重 — 在 OpenMDW-1.1 下专有与开放相对,一个总参数 30B、激活参数 3B 的混合 MoE。
• 指令微调 — 在 Claude Haiku 5.5 上存在,在 Base 检查点上缺失。
“Base”问题,直白地陈述
基础检查点预测的是下一个 token。向它提问,它往往会以可能包含此类问题的文档风格继续写下去,而不是回答问题。用“总结这份合同”去提示它,基础模型可能会生成一份法律训练文档的貌似合理的续写,而不是你那份合同的摘要。NVIDIA 之所以单独发布 BF16 检查点,并单独发布指令微调的同系列检查点,正是因为基础权重只是原材料。
在 NVIDIA 的模型卡上——由厂商自行报告,未经独立复现——基础检查点在 MMLU 上得分 78.59,在 MMLU-Pro 上得分 67.94,在 GSM8K 上得分 91.28,在 HumanEval 上得分 77.44,在 100 万 token 上下文下的 RULER 上得分 69.62。其调优同门版本的 Lightning 模型卡报告称,MMLU-Pro 为 81.94,GPQA Diamond 为 75.44,SWE-Bench Verified 为 51.56,PinchBench 为 86%,推理速度比它所取代的模型快约 30%。即便是这些调优后的数字也来自 NVIDIA 自家,而真正适用于本文标题中所指检查点的,是那些基础数字。与之相比,Claude Haiku 5.5 独立测得的 43.40——在 Artificial Analysis 的指数上位列 182 个模型中的第二,而这是一个衡量对象不同的另一套指数——并不能直接比较;准确的解读是:一个 30B 基础检查点和一个成熟的小模型,正由不同的工具、为不同的目的进行衡量。
可以毫无保留地说的是差距的形态。一个在能够回答任何问题之前还需要微调流水线、服务栈和评估工具链的基础检查点,并不能替代每百万 0.10 美元的托管模型。它是为想要自己拥有模型的人准备的起点。
Nemotron 真正胜出的地方,而且这不是安慰奖
速度至上。每秒 298.9 个输出 token 使其在 142 款模型的榜单上位居榜首——比 Claude Haiku 5.5 的 243.4 快 23%。对于延迟敏感的流水线来说,这是真实且可衡量的差异,也正是“Lightning”这个名字出现在包装盒上的原因。
开放权重第二点,而这是更大的一个。在 OpenMDW-1.1 下,你可以下载检查点,在你自己的数据上微调,并自行提供服务。Claude Haiku 5.5 完全无法微调,且无论如何都无法自行托管。对于一个拥有专有任务、不寻常的输入分布,或要求流量绝不离开自身基础设施的合规需求的团队来说,无论基准测试页面怎么说,这一差异都是决定性的。30B 总量、3B 激活也小到足以在经济上可服务——该架构正是为此而设计的。
价格位列第三:每百万输入 $0.06、输出 $0.20,享有 17% 的缓存折扣,每个索引任务 $0.09,约为 Claude Haiku 5.5 的 $0.21 的一半。两个模型都很便宜;Nemotron 更便宜。
Claude Haiku 5.5 胜出之处,即每一个需要给出答案的维度
指令遵循,因为它就是为此而训练的。独立能力,在 Index 上为 43 对 13——在一个给两者都打分的榜单上相差三十分,这是这组对比中最大的此类差距。图像输入,而 Nemotron 完全不接受。最大输出为 128,000 个 token,对比一个未公布的数字,并在 Batch 上提供 300,000 个 token 的 beta 路径。还有努力程度调节旋钮,它让你可以通过降低推理努力程度来收回成本,而不是靠重建模型。
冗长这一提醒在这里是双向的。在 Artificial Analysis 的测试套件中,Claude Haiku 5.5 输出约 4.4 亿个输出 token,而中位数约为 1 亿——它思考得非常多。Nemotron 输出约 1.2 亿个,同一来源称其对于自身规模而言略显冗长。尽管如此,Haiku 5.5 的每任务成本为 0.21 美元,而 Nemotron 为 0.09 美元,所以即便是那个话多的模型也不是昂贵的那个。这说明按 token 计价会朝两个方向产生误导,而按任务计算的数字才是你做预算时应当依据的。
自行托管与单一端点的对比
Nemotron 3.5 Lightning 30B A3B Base 以开放权重形式分发,并由多家推理服务提供商提供服务;NVIDIA 也发布了经过调优的同系列模型。Claude Haiku 5.5 可通过 Anthropic 的 API 使用,并由此在 Anthropic 模型被转售的任何渠道均可获得。两者都不在 OrcaRouter 的产品目录中,我们也不会假装它在——我们从这个邻近区间路由的是anthropic/claude-haiku-4.5、anthropic/claude-sonnet-5.5、anthropic/claude-opus-5.5以及anthropic/claude-fable-5.1,也就是比本文主题更高一档的层级。
这个对比所描述的两种路径在底层管道上确实截然不同,值得一一说明。自托管路径意味着需要一块 GPU、一个服务框架、一项量化决策以及一个运维轮值团队。托管路径则意味着一个密钥和一个模型字符串。OrcaRouter 正是为第二条路径而生:一个 API 接入 200 多个模型,一个密钥、一份账单,按供应商目录价以 0% 加价透传,因此厂商调价当天即生效,底层支持自动故障转移。它不是通往 30B 基础检查点的路径,而购买一台 DGX 级服务器也不是通往托管小模型的路径。

谁应该选哪个
如果你的任务定义明确、训练数据足够多到能起作用,而且流量无法离开你自己的基础设施,那么 Nemotron 3.5 Lightning 30B A3B Base 就是更值得琢磨的那个对象:输出速度在 142 个中排名第一,每个 token 的价格只有一半,而且归你所有、任你修改。在盘算能省多少之前,先把微调训练和推理服务的成本算进预算,因为 0.06 美元的输入价格,前提是已经有人完成了把检查点变成助手的那部分工作。
如果你想今天下午就发出提示词并拿到答案,能做这件事的就是 Claude Haiku 5.5——在独立指数上是 43 对 13,支持图像输入,输出上限达 128,000 个 token,而且价格确实很低。这场对比只有在价目表上才显得接近。可一旦任务变成回答问题,而不是续写文档,它就不再显得接近了。

