
Claude Haiku 5.5 對決 Nemotron 3.5 Lightning 30B A3B Base:便宜的那個答不出問題
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
採購試算表最在意的兩個數字上,較便宜又較快的模型勝出。Nemotron 3.5 Lightning 30B A3B Base 的輸出速度達每秒 298.9 個詞元,是獨立追蹤的 142 個模型中最快的,而每百萬輸入詞元只收 0.06 美元,對比 Claude Haiku 5.5 的 0.10 美元。同時,正如它名字裡的「Base」在提醒你的,它並不是一個助理。它是一個預訓練檢查點——沒有監督式微調、沒有強化學習、沒有像樣的對話範本——於 2026 年 8 月 11 日以 OpenMDW-1.1 授權釋出,好讓其他人能在此基礎上繼續開發。Claude Haiku 5.5 於 2026 年 10 月 7 日推出,是一個你可以直接向它提問的完成品。拿它們比價格,就像拿麵粉的成本跟麵包的成——而這場對決真正有趣的地方,在於弄清楚你的工作負載到底需要哪一個。
在發布報導中,沒有人把這一點說清楚,因為「比 Claude Haiku 5.5 更便宜、更快」比「更便宜、更快,但沒有跑過一次微調就無法使用」更適合當標題。這兩種說法都是真的。只有其中一種有用。
每個模型實際上是什麼
Claude Haiku 5.5 — Anthropic,ID claude-haiku-5-5,於 2026 年 10 月 7 日發布。輸入文字與影像,輸出文字。100 萬 token 上下文,最大輸出 128,000 token(在 Batch API 上透過 beta 標頭可達 300,000),訓練資料截止於 2026 年 6 月,退役時間不早於 2027 年 10 月 7 日。可調整的 effort 等級分為 Low、Medium、High、Xhigh 與 Max,預設為 Medium,並預設啟用自適應思考。API 按用量計費,快取讀取每百萬 token 0.01 美元,Batch 為半價。可透過 Anthropic 的 API 使用,並藉此在轉售 Anthropic 模型的所有通路上提供。
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA,於 2026 年 8 月 11 日發表。這是一個 300 億參數的混合專家(MoE)檢查點,每個 token 約有 30 億個活躍參數,建構於 Mamba-2 加上 MoE 再加上注意力機制的堆疊之上,並由 Nemotron 3 Ultra 蒸餾而來,隨附 MTP、DFlash 與 DSpark 推測解碼。其上下文可達 100 萬個 token,不過在單張 H100 上,實際上限約為 256,000。它僅支援文字。權重以 OpenMDW-1.1 開放釋出。而且它是基礎檢查點:未經指令微調的原始預訓練權重,這意味著它會接續文字,而不是遵循指令。

• 尺寸,每行一項
• 輸入價格 — Claude Haiku 5.5 每百萬個 token 為 $0.10,累計至 100K 個 token 後為 $0.50;Nemotron 3.5 Lightning 30B A3B Base 每百萬個為 $0.06。
• 輸出價格 — 每百萬 $0.50,適用於最多 10 萬個 token,之後為 $2.50;相較之下為每百萬 $0.20。
• 每完成一項任務的成本 — Claude Haiku 5.5 每項獨立索引任務為 $0.21,相較於 Nemotron 的 $0.09 — 較便宜的模型不只是每個 token 更便宜,每項任務也更便宜。
• 輸出速度 — Claude Haiku 5.5 為每秒 243.4 個權杖,在 182 個中排名第九;Nemotron 為每秒 298.9 個權杖,在 142 個中排名第一。
• 首個權杖時間——Claude Haiku 5.5 約 0.3 秒,相較於 Nemotron 的 0.54 秒。
• 獨立評分 — Claude Haiku 5.5 的 Artificial Analysis Intelligence Index 為 43,在 182 個中排名第二,Max 配置下為 43.40;Nemotron 的 Index 為 13,在 142 個中排名第二十九。
• 上下文視窗 — 各為 1,000,000 個 token,而在單張 H100 上,Nemotron 實際可用的約為 256,000 個。
• 模態 — Claude Haiku 5.5 支援文字與圖像輸入;Nemotron 則僅支援文字。
• 權重 — 在 OpenMDW-1.1 下,專有 vs. 開放,總參數量 30B、活躍參數 3B 的混合 MoE。
• 指令微調 — 存在於 Claude Haiku 5.5,不存在於基礎檢查點。
平實陳述的「Base」問題
基礎檢查點會預測下一個詞元。向它提問時,它往往會以可能包含這類問題的文件風格接續文本,而不是回答問題。用「總結這份合約」提示它,基礎模型可能會產生一段法律訓練文件中看似合理的接續內容,而不是你的合約摘要。NVIDIA 之所以另外發布獨立的 BF16 檢查點,以及獨立的指令微調同系列模型,正是因為基礎權重只是原料。
在 NVIDIA 自家的模型卡上——由供應商自行報告,未經獨立重現——基礎檢查點在 MMLU 上得分 78.59,在 MMLU-Pro 上 67.94,在 GSM8K 上 91.28,在 HumanEval 上 77.44,並在 1M 詞元下的 RULER 上 69.62。微調後同系列模型的 Lightning 卡報告 MMLU-Pro 81.94、GPQA Diamond 75.44、SWE-Bench Verified 51.56,以及 PinchBench 上的 86%,推論速度比它所取代的模型快約 30%。即使是微調後的數字也是 NVIDIA 自家的,而基礎數字才是適用於本文標題所指檢查點的數字。相較之下,Claude Haiku 5.5 經獨立測得的 43.40——在 Artificial Analysis 指數上於 182 個中排名第二,那是一個衡量不同事物的不同指數——並非可直接比較;誠實的解讀是,一個 30B 基礎檢查點和一個完成的小型模型,正被不同的工具、為了不同的目的而評分。
可以不加任何但書地說的是,這個落差的形狀。一個基礎檢查點,在它能回答任何問題之前,還需要微調流程、服務堆疊和評估框架,並不能替代以每百萬 0.10 美元計價的託管模型。對於想擁有這個模型的人來說,它是一個起點。
Nemotron 真正勝出的地方,而這並不是安慰獎
速度優先。每秒 298.9 個輸出 token,讓它在 142 款模型的排行榜上名列前茅——比 Claude Haiku 5.5 的 243.4 快 23%。對於延遲敏感的管線來說,這是真實且可量測的差異,而這也是「Lightning」這個名字會出現在包裝盒上的原因。
開放權重是第二點,而這是更重要的一點。在 OpenMDW-1.1 之下,你可以下載檢查點、用自己的資料對它進行微調,並自行部署服務。Claude Haiku 5.5 完全無法微調,而且無論出價多少都無法自行託管。對於有專有任務、特殊輸入分佈,或是有合規要求而必須確保流量永遠不離開自家基礎架構的團隊而言,這項差異是決定性的,無論基準測試頁面上怎麼說。總參數 30B、活躍參數 3B 也小到足以在經濟上提供服務——這個架構正是為此而設計的。
價格第三:每百萬輸入 $0.06、輸出 $0.20,享有 17% 快取折扣,每項索引任務 $0.09,大約是 Claude Haiku 5.5 的 $0.21 的一半。兩款模型都很便宜;Nemotron 更便宜。
在 Claude Haiku 5.5 勝出的地方,也就是每一個需要給出答案的面向
指令遵循能力,因為它已為此受過訓練。獨立能力,在 Index 上為 43 對 13——在同時評比兩者的榜單上呈現三十分的差距,也是這組比較中最大的此類落差。圖像輸入,而 Nemotron 完全不接受這項輸入。最大輸出為 128,000 個 token,對比一項未公布的數字,並在 Batch 上提供 300,000 個 token 的 beta 途徑。還有努力程度旋鈕,讓你能藉由降低推理投入程度來換回成本,而不是靠重建模型。
關於冗長度的這項但書在這裡是雙向的。在 Artificial Analysis 的測試套件中,Claude Haiku 5.5 輸出約 4.4 億個詞元,而中位數大約是 1 億個——它的思考量極大。Nemotron 輸出約 1.2 億個,同一來源形容這對其規模而言略嫌冗長。儘管如此,Haiku 5.5 每項任務的成本是 0.21 美元,而 Nemotron 是 0.09 美元,所以即使是那個話多的模型也不是昂貴的那一個。這告訴你的是,每詞元價格會朝兩個方向產生誤導,而該以每項任務的數字來編列預算。
自架與單一端點
Nemotron 3.5 Lightning 30B A3B Base 以開放權重形式發佈,並由多家推論服務供應商提供服務;NVIDIA 亦發佈了經調校的同系列模型。Claude Haiku 5.5 可透過 Anthropic 的 API 使用,並由此在任何轉售 Anthropic 模型的地方提供。兩者都不在 OrcaRouter 的目錄中,我們也不會假裝它們在——我們從這個鄰近範圍所路由的是 anthropic/claude-haiku-4.5、anthropic/claude-sonnet-5.5、anthropic/claude-opus-5.5 以及 anthropic/claude-fable-5.1,也就是本文主題再上一層的級別。
這項比較所描述的兩條路徑,底層管線確實截然不同,值得一一點名。自架路徑代表的是一張 GPU、一套推論服務框架、一個量化決策,以及一組輪班的維運人力。託管路徑代表的則是一組金鑰和一個模型字串。OrcaRouter 正是為第二條路徑而生:一個 API 串接 200 多個模型,一組金鑰、一份帳單,供應商定價原價轉嫁、零加成,因此廠商的降價當天就能生效,並在底層具備自動容錯移轉。它並不是通往 30B 基礎檢查點的途徑,而買一台 DGX 等級的機器也不是通往託管小型模型的途徑。

誰應該選哪個
如果你的任務定義明確、訓練資料量大到足以發揮作用,而且你的流量不能離開自家基礎架構,那麼 Nemotron 3.5 Lightning 30B A3B Base 就是更有意思的選擇:輸出速度在 142 個之中最快、每 token 價格只要一半,而且任由你修改。在計算省下的成本之前,先為微調執行與服務成本編列預算,因為 $0.06 的輸入費率假設已經有人做完把檢查點變成助理所需的工作。
如果你想在今天下午送出提示並取得答案,Claude Haiku 5.5 就是能做到的那個——獨立指數上拿下 43 分對 13 分、支援圖像輸入、128,000 token 的輸出上限,而且價格確實很低。這種比較只有在價目表上才看起來接近。一旦任務是回答問題,而不是續寫文件,它就不再看起來接近了。

