
Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base:安いほうは質問に答えられない
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
調達スプレッドシートが最も気にする2つの数値では、より安くて速いモデルの勝ちだ。Nemotron 3.5 Lightning 30B A3B Baseは毎秒298.9出力トークンで動作し、独立して追跡された142モデルの中で最速であり、入力トークン100万あたり$0.06で、Claude Haiku 5.5の$0.10に対抗する。また、その名前に含まれる「Base」という言葉が警告しているとおり、これはアシスタントではない。これは事前学習済みチェックポイントであり、教師ありファインチューニングも、強化学習も、名に値するチャットテンプレートもない。2026年8月11日にOpenMDW-1.1ライセンスで公開され、他の人々がその上に構築できるようにしたものだ。2026年10月7日にリリースされたClaude Haiku 5.5は、質問を送れる完成品だ。両者を価格で比較するのは、小麦粉のコストとパンのコストを比べるようなもので、この対決の面白いところは、あなたのワークロードが実際にどちらを必要としているかを見極めることにある。
ローンチ報道では誰もその点をはっきりとは言わない。なぜなら「Claude Haiku 5.5より安くて速い」のほうが、「安くて速く、ファインチューニングを実行しなければ使えない」よりも見出しとして優れているからだ。どちらの主張も真実ではある。役に立つのは片方だけだ。
各モデルの正体
Claude Haiku 5.5 — Anthropic、ID claude-haiku-5-5、2026年10月7日リリース。入力はテキストと画像、出力はテキスト。コンテキスト長1Mトークン、最大出力128,000トークン(Batch APIではベータヘッダーにより300,000)、2026年6月のトレーニングカットオフ、提供終了は2027年10月7日以降。調整可能なエフォートはLow、Medium、High、Xhigh、Maxで、デフォルトはMedium、適応的思考はデフォルトで有効。従量課金API、キャッシュ読み取りは100万あたり$0.01、Batchは半額。AnthropicのAPIを通じて利用可能で、そこから、Anthropicのモデルが再販売されている場所ならどこでも利用できます。
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA、2026年8月11日発表。トークンあたり約30億のアクティブパラメータを持つ300億パラメータのハイブリッドMixture-of-Expertsチェックポイントで、Mamba-2 + MoE + アテンションのスタック上に構築され、Nemotron 3 Ultraから蒸留され、MTP、DFlash、DSparkによる投機的デコーディングを備えて提供される。コンテキストは100万トークンまで及ぶが、単一のH100では約256,000が実用上の上限となる。テキスト専用である。重みはOpenMDW-1.1の下でオープンになっている。そしてこれはベースチェックポイントである。つまり、指示チューニングを一切施していない生の事前学習済み重みであり、指示に従うのではなくテキストを補完するものである。

• 寸法はそれぞれ1行ずつ
• 入力価格 — Claude Haiku 5.5は100万トークンあたり$0.10(10万トークンまで)、その後$0.50;Nemotron 3.5 Lightning 30B A3B Baseは100万トークンあたり$0.06。
• 出力価格 — 100万トークンあたり$0.50(100Kトークンまで)、その後は$2.50。対して100万トークンあたり$0.20。
• 完了したタスクあたりのコスト — Claude Haiku 5.5 では独立したインデックスタスク1件あたり $0.21 に対し、Nemotron は $0.09 — 安価なモデルはトークンあたりだけでなく、タスクあたりでも安価である。
• 出力速度 — Claude Haiku 5.5 は毎秒 243.4 トークンで 182 中 9 位、Nemotron は毎秒 298.9 トークンで 142 中 1 位。
• 最初のトークンまでの時間 — Claude Haiku 5.5では約0.3秒、Nemotronでは0.54秒。
• 独立スコア — Claude Haiku 5.5のArtificial Analysis Intelligence Indexは43で、182中2位、Max構成では43.40。NemotronはIndex 13で、142中29位。
• コンテキストウィンドウ — それぞれ1,000,000トークン、単一のH100上でNemotronには実用上およそ256,000。
• モダリティ — Claude Haiku 5.5 はテキストと画像を入力対応、Nemotron はテキストのみ。
• 重み — OpenMDW-1.1 の下でプロプライエタリ対オープン、総パラメータ30B・アクティブ3BのハイブリッドMoE。
• インストラクションチューニング — Claude Haiku 5.5 には存在するが、Base チェックポイントには存在しない。
「Base」問題の平易な説明
ベースチェックポイントは次のトークンを予測する。それに質問を投げかけると、答える代わりに、そうした質問を含んでいるかもしれない文書のスタイルでテキストを続けることがよくある。「この契約を要約して」とプロンプトを与えると、ベースモデルはあなたの契約の要約ではなく、法律関連の学習文書のありそうな続きを生成することがある。NVIDIAが別個のBF16チェックポイントと、別個の指示チューニング済みの兄弟モデルを公開しているのは、まさにベースの重みが原材料だからである。
NVIDIA自身のモデルカード上では——ベンダー報告であり、独立に再現されたものではない——ベースチェックポイントは、MMLUで78.59、MMLU-Proで67.94、GSM8Kで91.28、HumanEvalで77.44、100万トークン時のRULERで69.62を記録している。チューニングされた兄弟モデルに関するLightningのカードは、MMLU-Pro 81.94、GPQA Diamond 75.44、SWE-Bench Verified 51.56、PinchBenchで86%を報告しており、置き換えたモデルより推論が約30%高速だとしている。チューニング後の数値でさえNVIDIA自身のものであり、ベースの数値こそが、この記事のタイトルに記されたチェックポイントに当てはまる数値だ。それらと比べると、Claude Haiku 5.5の独立測定値43.40——Artificial Analysisの指数で182中2位、別のものを測る異なる指数——は直接比較できるものではなく、正直に読めば、30Bのベースチェックポイントと完成した小型モデルは、異なる目的のために異なる評価手段で採点されているということだ。
無条件に言えるのは、その隔たりの形である。何かを答える前にファインチューニングのパイプライン、サービングスタック、評価ハーネスを必要とするベースチェックポイントは、100万トークンあたり0.10ドルのホスト型モデルの代わりにはならない。それは、モデルを自分で所有したい人にとっての出発点なのだ。
Nemotronが真に勝る点、そしてそれは慰めの賞ではない
スピードが第一。毎秒298.9出力トークンは、142モデルのボードで首位に立ちます——Claude Haiku 5.5の243.4より23%高速です。レイテンシに敏感なパイプラインにとって、これは実際に測定可能な差であり、だからこそ「Lightning」という名が箱に記されているのです。
オープンウェイトは2番目、そしてこちらがより重要な点です。OpenMDW-1.1 のもとでは、チェックポイントをダウンロードし、自社のデータでファインチューニングし、自分でホストして提供できます。Claude Haiku 5.5 はファインチューニングが一切できず、いくら費用を払ってもセルフホストはできません。独自のタスク、特殊な入力分布、あるいはトラフィックが自社インフラから一切外に出ないことを求めるコンプライアンス要件を抱えるチームにとって、ベンチマークのページに何が書かれていようと、この違いは決定的です。総パラメータ30Bでアクティブ3Bという構成も、経済的に提供できるほど十分に小さい——アーキテクチャはまさにそのために設計されています。
3番目の価格:100万あたり入力$0.06、出力$0.20で、17%のキャッシュ割引とインデックスタスクあたり$0.09が付いており、Claude Haiku 5.5の$0.21のおよそ半分です。どちらのモデルも安価ですが、Nemotronの方がさらに安価です。
Claude Haiku 5.5が勝利を収める領域、それは答えを必要とするあらゆる次元である
指示追従性は、そのためにトレーニングされているからです。独立した能力では、Index 43 対 13 — 両方を採点したボード上で30ポイントの差であり、この比較セットの中で最大のその種の差です。画像入力は、Nemotron がまったく受け付けません。最大出力は128,000トークンで、非公開の数値に対して、Batchでは300,000トークンのベータ経路があります。そしてエフォートダイヤルは、モデルを再構築するのではなく、推論エフォートを下げることでコストを取り戻せます。
冗長性に関する注意点は、ここでは諸刃の剣だ。Artificial Analysisのベンチマークスイートでは、Claude Haiku 5.5は約4億4,000万出力トークンを生成し、これは中央値のおよそ1億トークンに対してのもので、実に大量に「考える」。Nemotronは約1億2,000万トークンを生成し、同じ情報源はそれを、その規模としてはやや冗長だと表現している。それでもHaiku 5.5のタスクあたりコストは0.21ドルで、Nemotronの0.09ドルに対してのものであるため、おしゃべりなモデルであっても高コストな方ではない。これが示しているのは、トークンあたりの価格はどちらの方向にも誤解を招き、予算を立てる基準にすべきはタスクあたりの数値だということだ。
セルフホスティング対単一エンドポイント
Nemotron 3.5 Lightning 30B A3B Base はオープンウェイトとして配布され、複数の推論プロバイダーによって提供されています。NVIDIA もチューニング済みの兄弟モデルを公開しています。Claude Haiku 5.5 は Anthropic の API を通じて利用でき、そこから Anthropic のモデルが再販されるあらゆる場所で入手できます。どちらも OrcaRouter のカタログにはなく、そうでないふりはしません——この界隈から当社がルーティングしているのはanthropic/claude-haiku-4.5、anthropic/claude-sonnet-5.5、anthropic/claude-opus-5.5、およびanthropic/claude-fable-5.1、つまり本記事の主題より1つ上のティアです。
この比較で述べられている2つの道筋は、根本的に異なる仕組みを持っており、それぞれに名前を付けておく価値があります。セルフホストの道筋とは、GPU、サービングフレームワーク、量子化の判断、そして運用ローテーションを意味します。ホスト型の道筋とは、キーとモデル文字列を意味します。OrcaRouterは2つ目の道筋のために存在します:200以上のモデルに対応する1つのAPI、1つのキー、1つの請求、プロバイダーの定価を0%のマークアップでそのまま渡すため、ベンダーの値下げが当日に反映され、その下で自動フェイルオーバー。これは30Bベースチェックポイントへの道筋ではなく、DGXクラスの筐体を購入することも、ホスト型の小規模モデルへの道筋ではありません。

誰がどれを選ぶべきか
タスクが明確に定義されていて、学習データが重要になるほど十分に大きく、トラフィックを自社インフラの外に出せないなら、Nemotron 3.5 Lightning 30B A3B Base はより興味深い対象だ。出力速度は142中最速で、トークンあたりの価格は半分、しかも自分で改変できる。節約分を数える前に、ファインチューニング実行とサービングの費用を見込んでおけ。$0.06 の入力料金は、チェックポイントをアシスタントに変える作業を誰かがすでに済ませていることを前提としているからだ。
今日の午後にプロンプトを送って回答を得たいなら、それを可能にするのは Claude Haiku 5.5 だ — 独立系インデックスで 43 対 13、画像入力、128,000 トークンの出力上限、そして本当に小さい価格。比較が近く見えるのは価格表の上だけだ。文書を続けることではなく質問に答えることが課題になった瞬間、それは近く見えなくなる。

