
Kolibri 対 Gemma 4 12B:780億パラメータ 対 12、そしてスコアを持つのはそのうち一方だけ
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 218 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
KolibriとGemma 4 12Bは、オープンウェイトの公開では通常、対等な条件で比較させてくれないスペクトルの両端だ。Aleph AlphaのKolibriは2026年10月3日に登場した。総パラメータ数781億、トークンあたり34億6,000万のアクティブパラメータ、検証済みの1,048,576トークン文脈ウィンドウ、ドイツ語と英語のみ、Apache 2.0。Gemma 4 12Bは2026年6月3日に登場した。密なパラメータ数119億5,000万、262,144トークン文脈ウィンドウ、テキスト、画像、音声、動画入力、Apache 2.0。そのうち一方には独立した、公に再現可能なスコアがある。もう一方にはベンダーのベンチマーク表がある。この非対称性はこの比較の脚注ではない。それこそがこの比較なのだ。なぜなら、購入者が気にする他のすべて——タスクあたりのコスト、ワットあたりの品質、自分の文書で機能するかどうか——は、そこを通って決まるからだ。
比較の構図についても、同じように率直に述べるべきです。78Bモデルと12Bモデルを並べる見出しは、誤った結論を招きかねません。両者は競合相手ではありません。一方は、顧客が自ら所有するラック上でドイツの公共部門および産業分野の文書業務を目的とした78 GBのデプロイメントです。他方は、ラップトップで動作し、独立したインデックス14を備える120億パラメータの統合マルチモーダルモデルです。以下では、それぞれが実際に何のためのものか、公表された数値によって両者を順位付けできる場合とできない場合、そして独立したスコアを持たないことの代償について述べます。
ここで信頼できる唯一の数字、そして信頼できない唯一の数字
Artificial AnalysisはGemma 4 12Bを、その推論構成で測定しました。彼らのモデルページで公開されている結果が、基準として用いるべきものです:
• インテリジェンス — Artificial Analysis Intelligence Indexは14で、これはトップクラス帯に位置づけられ、その比較における142モデル中21位、同等モデルの中央値は8です。
• 速度 — 毎秒112.5出力トークン、スピード表示で142台中21位、同程度のモデルの中央値である91トークンを上回っています。
• 価格 — 入力100万トークンあたり$0.10、出力100万トークンあたり$0.30で、同社のページでは、同規模・同クラスのモデルの中央値である$0.03と$0.15に対してやや高価であると指摘されています。
• 仕様 — 262,144トークンのコンテキスト、総パラメータ数12B、Apache 2.0、テキスト・画像・音声・動画入力、テキスト出力。
Artificial Analysis自身の総括的な評決は、リーダーボードのページとしては異例なほど率直であり、繰り返す価値がある。Gemma 4 12Bは知能の面で最先端モデルの一つに入るが、同程度のサイズの他のオープンウェイトモデルと比べるといくらか高価だ。これは、どちらのベンダーにも利害関係を持たない第三者による、実際的で独立した再現可能な評価である。
Kolibri には同等のものは存在しない。それ用の Artificial Analysis のモデルページはなく、執筆時点で第三者が評価スイートを再現した例もない。存在するのは Aleph Alpha 自身の比較表であり、そこでは Kolibri はタスクスイート全体で英語平均 75.5、ドイツ語平均 70.8 を記録している。これらはベンダーが選んだベンチマーク群に対する、ベンダーが作成したハーネス上での、推論エフォート high における非加重のパーセンテージ平均である。これらは Intelligence Index ではなく、この2つの数値を相互に換算したり、並べて比較したりすることはできない。「Kolibri 75.5 対 Gemma 14」をランキングとして提示する者は、一方の尺度上のパーセンテージと、もう一方の尺度上のスコアを比較している。正直な立場としては、Gemma 4 12B の品質は測定されているが、Kolibri の品質は主張されているにすぎない。
ベンダー表で実際にできるのは、行を横にたどることだ。Google自身の、12BのMixture-of-Experts兄弟モデルであるGemma 4 26B-A4B ITは、Aleph Alphaの表に英語71.9、ドイツ語66.3で現れ、どちらもKolibriを下回っている。それが、入手可能な中でクロスチェックに最も近いものであり、同じ但し書きが付く。ベンダーのハーネス、ベンダーの数値。それは弱いシグナルであり、証拠ではない。

Dense 12B 対 sparse 78B は、見た目ほどミスマッチではない
トークンごとに実際に何が計算されるかを考慮すると、アーキテクチャの差はパラメータの差よりも大きい。
• トークンあたりの計算量 — Gemma 4 12B は、トークンごとに119.5億個のパラメータをすべて活性化します。Kolibri は 78,103,074,560 個のうち 3,457,573,120 個を活性化し、モデルのおよそ22分の1にあたります。各層では384個中、共有エキスパート1個とルーティングされたエキスパート6個を使用します。
• メモリ — トレードオフは逆方向に働き、しかも苛烈だ。bfloat16 の Gemma 4 12B では、重みがおよそ 24 GB になる。Kolibri のカードでは、FP8 の重みがおよそ 78 GB となり、最低でも A100 80 GB カード 2 枚、H100 SXM5 2 枚、H200 1 枚、B200 1 枚、または B300 1 枚が必要になる。
• アテンション — Gemma 4は、ローカルなスライディングウィンドウアテンションと完全なグローバルアテンションのハイブリッドを使用し、最終層は常にグローバルです。Kolibriは、50の全MoE層にわたって、スライディングウィンドウとグループ化クエリを4:1で分割して使用します。
• コンテキスト — Gemma 4 12B では 262,144 トークン、Kolibri ではネイティブで 262,144。位置スケーリングなしで 1,048,576 まで検証済み。
「78B対12B」という正直な捉え方は、Kolibriが活性化コストで勝ち、重みのフットプリントで負けるというもので、どちらの利点も無償ではない。トークンあたり34.6億パラメータを活性化するスパースモデルでも、780億個すべてをメモリに保持しなければならない。だからこそ、導入の最低要件はコンシューマー向けカード1枚ではなく、80GBアクセラレータ2基になる。Gemma 4 12Bは逆のトレードオフを取る。トークンごとにモデルのはるかに大きな割合が発火するが、個人が購入できるハードウェアに収まる。
Kolibri 側にはドイツ語固有のちょっとした事情があり、それはランキングではなく計算を変える。そのトークナイザーは、Aleph Alpha 自身の測定によれば、ドイツ語のウェブテキストで 1 トークンあたり平均 4.90 バイトであり、Gemini の 4.13、Qwen3.5~3.8 ファミリーの 4.17、GPT-5 の 4.35 と対照的だ。ドイツ語文書あたりのトークン数が少ないことは推論コストの直接的な削減であり、何百万件ものドイツ語行政テキストというワークロードでは、その効果は数インデックスポイント分よりも価値がある可能性がある。しかも、これは完全にベンダーによる報告である。

それぞれが実際に見ることができるもの
ここが、この比較がもはや接戦ではなくなる地点であり、それは品質に関する主張ではなく仕様上の事実だ。Gemma 4 12B は統合マルチモーダルモデルである。そのモデルカードには、エンコーダを持たないアーキテクチャが説明されている。生の画像パッチと音声波形を言語モデルの埋め込み空間へ直接投影し、テキスト・画像・音声・動画を入力としてテキストを出力する。別個のエンコーダを用意することなく、コンシューマー向けデバイスで動作するように作られている。
Kolibriはテキストを2言語で読み、それ以外は何もしない。Aleph Alphaはそれを、意図的に広さよりも深さとして位置づけている。幅広い多言語の混成ではなく、厳選された2言語だ。ビジョンタワーも、音声経路も、動画もない。あなたのワークロードにスキャンしたフォーム、録音した通話、機器の写真が含まれるなら、ベンチマークの行が何と言おうと、Gemma 4 12Bが候補であり、Kolibriは候補ではない。あなたのワークロードが、建物の外に決して出してはならないドイツ語と英語の文書のコーパスであるなら、逆の方がより真に近い——ただし、「建物の外に出ない」という要件はGemma 4 12Bでも満たされることに注意してほしい。重みがApache 2.0でダウンロード可能だからだ。
どちらが安いかは、何を買うかによって異なります。
この2つのモデルは、互いに換算できない通貨で価格が付けられている。Gemma 4 12Bには市場レートがある。Artificial Analysisが複数のプロバイダーを横断して計測したところ、100万トークンあたり0.10ドルと0.30ドルで、ルーティングされたエンドポイントのMoEティアではさらに安い。Kolibriにはレートがまったくない。Aleph Alphaがその推論を販売していないためだ。リリースされたのは重み、技術報告書、モデルカードである。
• ホステッドルート上の Gemma 4 12B — Artificial Analysis の数値では、入力100万トークンあたり $0.10、出力100万トークンあたり $0.30。当社独自のカタログでは、MoE の兄弟モデルである Gemma 4 26B-A4B IT が入力 $0.06、出力 $0.33、262,144トークンのウィンドウで掲載されており、より大規模な dense モデルの Gemma 4 31B IT は $0.13 と $0.38 です。これらはプロバイダーの定価をそのまま通したもので、当社が一切上乗せしない唯一の数字です。
• 自社ハードウェアで Kolibri を動かす場合 — 78 GB の重み、ベンダーの aleph-alpha-inference パッケージに付属する vLLM プラグイン、そして最低でも H200 または B200 が 1 台、あるいは H100 SXM5 が 2 台。コストは設備投資、ラックスロット、vLLM デプロイを運用できる人材であり、生成するトークン数に応じて償却されます。
それは同じ購入ではなく、「どちらが安いか」という比較でもない。問われているのは、そのワークロードにハードウェアを自前で持つことを正当化できる形があるかどうかだ。固定された機密性の高い文書コーパスを大量に処理するチームなら、セルフホスト側がはるかに有利になり得る。1日数百万トークン程度モデルを呼び出すプロダクト機能を構築しているチームは、ほとんどそうはならない。
実用的な中間策が一つあります。Gemma ティアは現在 OrcaRouter 上にあり、他のすべてと同じ OpenAI 互換エンドポイントで、プロバイダー間のフェイルオーバーに対応し、プロバイダーの定価がトークンごとに何も上乗せされずにそのまま適用されます。これにより、78 GB のソブリン展開が正当化されるかどうかを判断する前に、ホスト型ルート上で実際のトークン量を安価に測定できます。それが何ではないかは、はっきり言っておく価値があります。当社は Kolibri をルーティングしていません。ベンダー名とモデル名のあらゆる綴りでカタログを調査しましたが、そこには存在しません。現時点でそれを呼び出す唯一の方法はセルフホスティングです。

誰がどれを選ぶべきか
決定ルールは、3行で述べられるほど短い。
ドイツ語と英語以外のテキストが必要なら、導入を決める前に測定済みの品質数値が必要なら、すでに持っているハードウェアでモデルを動かす必要があるなら、あるいはラックを所有するよりトークンをレンタルしたいなら、Gemma 4 12B を選びましょう。2つのうち、独立したスコア、公開された速度、市場価格を備えているのはこれだけです。
あなたの要件が、重み、学習データの来歴、エネルギー消費量、ライセンスのすべてが文書化され、自社の境界内に展開され、ドイツ語の行政文書向けに作られたトークナイザーと、規制されたワークフローが依拠できる回答を控える挙動を備えた780億パラメータの推論モデルであるなら、Kolibriを選んでください。それは狭いターゲットであり、Aleph Alphaは意図的にそこを狙いました。
発表記事で見たベンチマークの1行を根拠に、どちらかを選んではいけない。Gemma 4 12Bの14は第三者が行った測定であり、あなたにも確認できる。Kolibriの75.5はその作者が主張したもので、現在それを反証できる唯一の人物は、H100を2基と文書コーパスを持つ顧客だけだ。
