
Claude Haiku 5.5 vs Gemma 4 12B:手元に置ける重みのモデル 対 ベンダーAPI
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Claude Haiku 5.5 と Gemma 4 12B は、実際には同じ枠を争っているわけではない。それを最速で見て取る方法は一行に尽きる。一方は Apache-2.0 の重みとして提供され、ダウンロードして量子化し、自分のハードウェアで実行できる。もう一方は API の背後にしか存在しない。Claude Haiku 5.5 は 2026年10月7日に登場し、小規模ティアが叩き出せるスコアを即座に塗り替えた — 独立系の Artificial Analysis Intelligence Index で 43。Gemma 4 12B は同じランキングで 14 だ。その差は膨大だが、ほとんどのチームが最終的に両者のどちらかを選ぶことになる理由はそこではない。
その選択は通常、ベンチマークが参照される前に迫られます。ベンダーにトークンを送信できない規制下のパイプライン、信頼できる外向き通信のないエッジボックス、ミリ秒単位で測られるレイテンシ予算、あるいはクローズドAPIでは決して満たせないファインチューニング要件です。これらのどれも自分に当てはまらないなら、答えは接戦にはなりません。どれか一つでも当てはまるなら、スコア差は問題にならなくなり、デプロイ上の制約がすべてを決めます。
取締役会が測定した内容と、その時期
以下の独立系の数値はArtificial Analysisによるもので、ベンダー料金はAnthropicとGoogle自身のドキュメントに基づいています。これらは2種類の異なる数値であり、全体を通してそのように表示されています。

• 独立したスコア — Intelligence Index で Claude Haiku 5.5 が 43 を記録し、182 モデル中 2 位。Gemma 4 12B(Reasoning)は 14 で、同クラス 142 モデル中 21 位。その差は 29 ポイント。
• 100万トークンあたりの入力価格 — Claude Haiku 5.5 は100,000トークンまで$0.10、それを超えると$0.50、Gemma 4 12B は$0.10。
• 100万トークンあたりの出力価格 — Claude Haiku 5.5 は10万トークンまで0.50ドル、それを超えると2.50ドル;Gemma 4 12B は0.30ドル。
• コンテキストウィンドウ — Claude Haiku 5.5 は 1,000,000 トークン、Gemma 4 12B は 262,000 トークン。
• スループット — Claude Haiku 5.5 では毎秒 240.4 出力トークン、Gemma 4 12B では 113.1、初回トークンまでの時間は 2.48 秒。
• 完了した Index タスク 1 件あたりのコスト — Claude Haiku 5.5 で $0.21。Gemma 4 12B はトークン単価が十分に安いため、ボードの混合値は 100 万トークンあたり $0.12 になるが、そこから導き出されるタスクあたりコストは、この比較を決めるべき数値ではない。
• 重み — Gemma 4 12B は Apache 2.0、ダウンロード可能、約120億パラメータの dense モデル。Claude Haiku 5.5 はプロプライエタリであり、重みの公開はなく、予定もない。
• 登場からの期間 — Gemma 4 12B は 2026 年 6 月から公開されています。Claude Haiku 5.5 は本稿執筆時点で公開から 2 日です。
差は29ポイントで、価格差はほとんどない
もう一度、2つの価格行を見てください。入力はどちらも$0.10、出力は$0.30対$0.50です。Gemma 4 12Bのほうが安く、その差はトークン数に埋もれてしまうほど小さいものです。Claude Haiku 5.5は新しいトークナイザーを採用しているため、同じテキストが約30%多くのトークンになります。そのため、Gemma側の出力レートで40%という生の優位性も、実際の請求額ではほぼ相殺されます。
つまり、Index スコアで29ポイント劣るモデルにほぼ同じ料金を払っているか、29ポイント上回るモデルにほぼ同じ料金を払っているかは、どちらの列を先に読むかで変わるということだ。これが正直な捉え方であり、率直に言うべきだ。両方のモデルが実行できるあらゆるタスクにおいて、Claude Haiku 5.5 は定価でより良い買い物であり、小さい方のモデルにどれだけプロンプトエンジニアリングを施しても埋まらない差で優れている。
したがって、興味深い問いは「どちらが優れているか」ではない。それは「私のキューにあるタスクのうち、Gemma 4 12B が失敗するのはどれか」であり、その答えだけがこの比較を決める。
APIにはできない、ウェイトがもたらしてくれるもの

ダウンロードしたモデルは別種の資産であり、その利点は漸進的なものではなく構造的なものである。
• データ境界 — Gemma 4 12B では、ベンダーが一切介在しません。医療、法務、防衛、金融のワークロードにおいて、多くの場合、重要な要件はそれだけであり、どれほどスコアが高くても API が受け入れ可能になることはありません。
• 変動費ではなく固定費 — 12Bのdenseモデルを4ビットに量子化すれば、最新のアクセラレータ1基に余裕をもって収まる。そうなれば、トークンあたりの限界費用は電気代になり、ワークロードはメーターではなくマシンを基準にサイジングできる。
• 外部送信なし、ネットワーク遅延なし — オンプレミスの12Bモデルは、何もこの筐体から出ないためミリ秒で応答します。ベンダーAPIは往復遅延と、エッジ配備にはまったく存在しないコールドスタートのテールを負担します。
• ファインチューニングと蒸留 — 自分のデータで Gemma 4 12B を適応させ、アダプターを出荷し、それを凍結できます。Anthropic が Haiku 級モデルのファインチューニングをいつか許可するかどうかは、それを前提にロードマップを組めるようなものではありません。
• ロードマップの下支えとなる最低ライン — 重みがあなたの足元から非推奨にされることはない。Anthropic は、2027年10月7日より前に Claude Haiku 5.5 を廃止しないことを約束している。これは寛大だが、日付の付いた約束は、やはり日付の付いた約束にすぎない。
• モダリティは、奇妙なことに — ボードには Gemma 4 12B がテキスト、画像、音声、動画を入力として受け取り、テキストを出力すると記録されている。これは Claude Haiku 5.5 のテキストと画像よりも広い入力範囲だ。別途文字起こしサービスなしで音声を取り込むローカルパイプラインにとって、それは API 側にはない実際の機能である。

12Bが接触で生き残れない場面
29ポイントの差を測るのと同じボードは、小規模な密なモデルがうまくできない事柄も記録しており、それらを飛ばすのは不誠実だろう:
• 長いコンテキスト — 1,000,000 に対して 262,000 トークン。コードベースや1年分の記録を1つのプロンプトに詰め込むパイプラインは、Gemma 4 12B では見込みがなく、それを検索ループに分割すると、より大きなウィンドウなら避けられたはずのエンジニアリングが追加される。
• エージェント型およびコンピュータ利用作業 — 小規模モデルの失敗が静かで高くつくタスクのクラス。Anthropic自身のベンダー報告によるClaude Haiku 5.5の数値では、OSWorld 2.1が72.4%であるのに対し、前世代のHaikuは15.7%でした。Indexが14の12Bモデルはその仕事に適したツールではなく、ここでのベンダー数値は、独立した実行がそれらを再現していないという事実を考慮しても、有用なシグナルです。
• 共有フリートでの秒間スループット — ホスト型インスタンスで毎秒113トークンなら問題ありませんが、セルフホストする理由は速度ではなく、単一Gのデプロイではさらに遅くなります。
• 誰もあなたのフォールバックにはならない — 本番環境で Gemma 4 12B を実行するなら、自社ハードウェアの停止はあなたの停止であり、自分で構築しない限りフェイルオーバー先となる第2のプロバイダーは存在しない。
それらのどちらかを1つのエンドポイント経由で実行する
OrcaRouterは本日、Gemma 4 31BとGemma 4 26B-A4Bをカタログに掲載しており、Googleの定価、マークアップ0%で提供しています。ただし12Bは含まれていません。これを暗示するのではなく、はっきりと述べておく価値があります。12Bはベンダー自身の配布チャネルや複数のサードパーティプラットフォームから入手できます。Claude Haiku 5.5も同様にまだカタログには掲載されていません。AthropicのAPIや主要なクラウドから利用可能です。
ルーターが実際に提供するのは、この比較が本当に求めている形です。安価なローカルモデルと高価な API モデルの賢明な配備は分岐ではなく、ルートです。Gemma 4 12B またはホスト型の Gemma 4 バリアントが簡単な大多数に応答し、品質または長さの条件に引っかかったリクエストは Anthropic のレッグへエスカレーションします。Claude Haiku 4.5、Claude Sonnet 5.5、Claude Opus 5.5 が現在カタログに揃っています。そのため、小規模ティアのレッグが利用可能になる前にさえ、エスカレーション経路を構築し負荷テストできます。OrcaRouter では、その構成はルーティング DSL 式と自動フェイルオーバーであり、保守するサービスではなく、プロバイダーの定価が 0% のマークアップでそのまま渡されるため、どのレッグの価格変更も発生した当日に反映されます。
そのルール
制約によって除外されない限り、Claude Haiku 5.5 を選んでください。ほぼ同じ定価で、Gemma 4 12B を Index ポイントで 29 ポイント上回り、100万トークンのコンテキストを扱え、両方が試せるあらゆるタスクでより強力なモデルです。この比較で 12B が実力で勝つパターンはありません。
制約そのものが要点となるとき、つまりトークンが自社環境の外に出られないとき、予算が従量メーターではなくマシンそのものであるとき、ファインチューニングが必要なとき、あるいは料金表や提供終了日ではなく重みを手元に置く必要があるときは、Gemma 4 12B を選びましょう。それらは好みではなく要件であり、要件に対して29ポイントの差は単に決め手となる数字ではありません。
