タイトルカードには「Kolibri vs Solar Mini 4」と表示され、サブタイトルは「同じ3Bのアクティブ予算、大きく異なる2つの賭け」、さらに2行の細かい注記として「Kolibri — 合計78.1B、Apache 2.0の重み、セルフホスト」と「Solar Mini 4 — 合計35B、クローズド、ホスト型API」があり、白い背景に柔らかなブルーとシアンのグラデーションアクセント、右下にOrcaRouterのロゴが配置されている。
Guides & Insights

Kolibri vs Solar Mini 4:同じ3Bアクティブ予算、まったく異なる2つの賭け

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2つのモデルは17日違いで出荷され、どちらもトークンあたりおよそ30億のアクティブパラメータを使うように調整されているが、実際に導入する立場からすると、これ以上ないほど似ていない。Aleph AlphaのKolibriは、Apache-2.0の重みによる781億パラメータで、自分でダウンロードして自分で提供するものだ。ホスト型エンドポイントは存在せず、今日時点で、どこにも独立したスコアが一つも存在しない。UpstageのSolar Mini 4は350億パラメータで、まったくダウンロードできない。従量課金制エンドポイントとしてのみ存在し、すでにArtificial Analysis Intelligence Index 24.05を持っている。アクティブパラメータ数は、それぞれを動かすのにいくらかかるかを教えてくれる。その数についてそれ以外のことは、始めるのにいくらかかるかを教えてくれない。

合計がこれほど乖離する理由 — ほぼ同じアクティブスライスで78.1B対35B — は、どちらもスパースなMixture-of-Experts設計であり、2つのラボが、エキスパート容量をどれだけ予備として保持するかについて正反対の判断を下したことにある。Kolibriは384個のエキスパートを搭載し、トークンごとに1個の共有エキスパート+6個のエキスパートにルーティングする。Solar Mini 4は35B/3Bの分割を開示しているが、エキスパート数については何も明かしていない。2つのモデルが同じアクティブ値で宣伝されている場合、あなたのハードウェア費用を決めるのはアクティブ値ではなくパラメータ総数だ — そしてここでは、同じ公称計算予算のもとで2.2倍の差がある。

それぞれが実際に何なのか

• 総パラメータ数 — Kolibri 78.10B、Mini 4 35B

• トークンあたりのアクティブパラメータ — Kolibri 3.46B 対 Solar Mini 4 3B

• 重み — Kolibri は Apache 2.0、完全な重みを Hugging Face で公開、一方 Solar Mini 4 は非公開で API のみ

• コンテキスト — Kolibri 1,048,576 トークン検証済み vs Solar Mini 4 512K(Upstage のドキュメントによる)、Artificial Analysis のモデルカードによると 1,048,576

• 最大出力 — Kolibri はベンダーによる上限なし、Solar Mini 4 は 128,000 トークン

• 言語 — Kolibri のドイツ語と英語 対 Solar Mini 4 の英語、韓国語、日本語

• 知識カットオフ — Kolibri 2026年6月18日 vs Solar Mini 2026年2月4日

• 提供方法 — Kolibriのセルフホスト(vLLM)対 UpstageのConsole、Playground、およびオンプレミスでホストされるSolar Mini 4

• 独立評価 — Kolibri は未公開、Solar Mini 4 は AA Intelligence Index 24.05

Kolibri:780億パラメータ、そしてラボの外でそれを評価した人は誰もいない

Aleph Alphaは2026年10月3日、ドイツ再統一の日に意図的に合わせて、新ファミリーの第1弾かつKolibri Originの後継としてKolibriを公表した。モデルカードは、何が投入されたかについて異例なほど率直だ。事前学習に20兆トークン、ミッドトレーニングに3.44兆トークン、長コンテキスト学習に2010億トークン。768台のB200 GPUで21日間にわたって実行され、計算量はおよそ6.4×10²³ FLOPs、消費電力は約950 MWh。ベンダーは障害件数も進んで明かしている——計画外の中断が38回、およそ10,000 GPU時間あたり1回——これはラボが通常は省く類の数字だ。

Screenshot of Aleph Alpha's newsroom post “Kolibri Has Landed”, showing the 03/10/2026 release date, the line about releasing on the Day of German Reunification, and the architecture comparison table between Kolibri and Kolibri Origin.

アーキテクチャは明快なスパースMoEの話だ。50層で、スライディングウィンドウアテンション(512トークンのウィンドウ)とグローバルアテンションの比率は4:1で、グローバルアテンションは5層ごとにのみ発動する。128×128ブロックスケーリングを用いたFP8重みと、FP8 KVキャッシュ。比較すると、Kolibri Originは128エキスパートを8幅でルーティングし、エキスパート隠れ次元は768幅、すべての層でフルアテンションを使用し、2024年9月で打ち切られた英語データで訓練されていた。Kolibriは384エキスパートを6幅でルーティングし、隠れ次元は512幅へ移行し、両方の言語のカットオフを2026年6月18日まで押し上げる。

ドイツ語パイプラインは、他ではなかなか手に入らない、本当に難しい部分だ。Aleph Alphaは独自のUniBPEトークナイザーを訓練し、ドイツ語テキストを1トークンあたり4.90バイトと報告している。これに対してGPT-5は4.35、Qwen3.5は4.17、Geminiは4.13だ。これは、あらゆるフロンティア多言語モデルよりも優れたドイツ語圧縮を主張するトークナイザーであり、ソブリンデプロイの売り込みを支える具体的な仕組みである。ドイツ語文書あたりのトークン数が少なければ、課金されるトークン数も少なくなり、同じハードウェア上で実効ウィンドウがより長くなる。

Kolibriについて存在するあらゆる性能数値は、Aleph Alpha自身のモデルカードに由来しており、そのように読まれるべきです。ベンダーが報告した表では、Kolibriは英語評価で総合75.5、ドイツ語で70.8、英語のGPQA Diamondで84.3に対してドイツ語で81.3、英語のHumanity's Last Examで21.5に対してドイツ語で15.9、SWE-Bench Verifiedで66.4、LiveCodeBench v6で85.9、AA-LCRで68.3となっています。これらは未監査の数値です。Kolibri用のArtificial Analysisページは存在しません — トラッカーのモデルURLは404を返します — したがって、あの表のどの数値も独立に再現されておらず、あなたが読んでいるこの記事によってそれが実際以上に確固たるものになることはありません。

このカードが確かなものにするのは、サービングの話だ。ハードウェアの最低要件は、A100 80GB を 2 基、H100 SXM5 を 2 基、または H200、B200、B300 のいずれか 1 基だ。公開されている vLLM レシピでは、これを --kv-cache-dtype fp8 と専用の推論用およびツール呼び出し用パーサーを使って実行し、temperature 1.0、top-p 0.97、top-k 128、そして reasoning_effort ダイヤルで none、low、medium、high に設定できる。78B モデルを 100 万トークンの検証済みコンテキストでサービングする B300 1 基が、このオファーの具体的な形だ。マシンを購入すれば、あとはトークンごとの限界費用を自分で負担することになる。

Solar Mini 4:3Bのアクティブスライスは購入するのではなくレンタルする

Solar Mini 4は2026年9月22日に登場しました — スナップショット solar-mini4-260922、エイリアス solar-mini4 — Upstageのエージェント指向小型モデルとして。総パラメータ数35B、アクティブ3B、ナレッジカットオフは2026年2月、対応言語は英語・韓国語・日本語で、チャット、推論、構造化出力、ツール呼び出しの各モードを備えています。UpstageのConsoleとPlaygroundから、またオンプレミス展開でも利用できますが、重みのダウンロードはなく、確認できるライセンスもありません。Upstageのドキュメントには「Data not collected」とも記載されており、実際のトラフィックを前に置くのであれば、重要となるコンプライアンス上の一文はこれです。

Screenshot of Upstage's Console documentation page for Solar Mini 4, showing the snapshot identifier solar-mini4-260922, the release date 2026-09-22, 35B total and 3B active parameters, a 512K context window with 128K maximum output, the list price of $0.10 per million input, $0.40 per million output and $0.01 per million cached, and the note “Data not collected”.

Kolibriとは異なり、Solar Mini 4は独立したハーネスによる評価を経ている。Artificial AnalysisはそのIntelligence Indexを24.05とし、実測でTerminal-Bench 4.0は1.01%、SciCodeは47.6%、AA-LCRは83.3%、Humanity's Last Examは25.8%としている。Upstageのローンチ投稿は、24.1を3Bのアクティブパラメータを持つモデルの中で最高のIndexとして位置づけ、Qwen3.6 35B A3Bの18、Nemotron 3.5 Lightningの13を上回るとしている——この位置づけは、その範囲内では公正であり、注目すべきは、それが聞こえるとおりまさに狭いということだ。なぜならそれは、小規模モデル一般についてではなく、3Bアクティブクラスについての主張だからである。

この予算をどう組むべきかを左右する指標は Index ではない。Artificial Analysis のタスク別コスト内訳では、Solar Mini 4 の Intelligence-Index タスクあたりのコストはおよそ $0.36 で、そのうち約 $0.30、つまりおよそ 82% を占めるのはプロンプトキャッシュ書き込みである。キャッシュ読み取りは $0.03、生成出力はわずか $0.035 にすぎない。このモデルはタスクあたり約 88,300 の出力トークンを生成し、そのうち約 71,600 は推論トークンである。言い換えれば、これは安価なモデルであり、その請求額の大半を占めるのは長いコンテキストの書き直しであって、書き戻すトークンではない。評価あたりのコストは Terminal-Bench 4.0 の $1.63 から AA-Briefcase の $0.95 まで幅がある。初回チャンクまでの時間は 1.58 秒で、出力速度の中央値は毎秒 198 トークンである。

それぞれの道の代償

Solar Mini 4は現在、定価では提供されていません。Upstage自身の料金ページには、日付入りの段階的価格表が掲載されています。100万入力あたり$0.03、キャッシュ済み$0.003、出力$0.12 — 70%のローンチ割引 — 2026年10月10日UTCまで、その後10月11日から$0.05 / $0.005 / $0.20、そして最終的に10月23日から定価$0.10 / $0.01 / $0.40です。Upstageのローンチ投稿では、割引は料金ページ自体のスケジュールよりも大まかに説明されています。上記の段階表は日付が明記された版であり、計画を立てる際に基準にすべきものです。最も急激な割引がどこに位置するかに注目してください。キャッシュ済み入力は入力単価の10分の1まで下がり、これはまさに、上記のキャッシュ書き込みコストプロファイルが課金対象としている、長期間安定したコンテキストのワークロードに報いるものです。

Kolibriの価格は発注書そのものだ。比較すべき100万トークンあたりの料金は存在しない。なぜならホスト型の従量メーターがないからだ。支払うのはGPUと電気代であり、ベンダーが公開している唯一のコスト指標はトレーニング実行そのもの、つまりモデルを生成するのに約950 MWhかかるということだ。すでに推論能力を自前で持っているなら、Kolibriのトークンあたり限界費用は電気代に近づく。持っていなければ、参入チケットはA100を2基積んだマシン以上だ。これは、100万トークン単位で呼び出し、明日には呼び出しをやめられるモデルとは根本的に異なる種類のコミットメントであり、まさにこの2つの選択肢が突きつける実際の決断である。

重なる部分と、比較が破綻する部分

• アクティブコンピュート — ほぼ同一:トークンあたり3.46B対3B

・そこから導かれるすべて —— 比較できない。二つのうち検証された証拠があるのは一方だけだから

• 最高測定スコア — Solar Mini 4 の監査済み指数は 24.05、Kolibri はベンダー表のみで監査済みスコアは一切ありません

• ドイツ語 — Kolibriは2つのうちそれ用に訓練された唯一のもので、トークンあたり4.90バイトです;Solar Mini 4はそれを記載していません。

• 韓国語と日本語 — Solar Mini 4 は両方を記載、Kolibri はどちらも記載なし

• 長いコンテキスト — Kolibri は 1,048,576 トークン全体を検証する。Solar Mini 4 の公式ドキュメントは 512K と記載しているが、Artificial Analysis のカードは 1M としているため、上限はベンダー依存として扱う

• 最初のトークンまでの時間 — Solar Mini 4 は数分です。サインアップするだけだからです。Kolibri は数日です。筐体をラックに設置する必要があるからです

• コストモデル — トークン単位、割引ラダーに応じて低下、資本+電力に対して

正直なまとめを言えば、これはリーダーボードで決着をつけるような対決ではない。Kolibriのベンダー表には、独自の比較セットまで含まれている——GLM-4.7 Flash 30B-A3Bは英語総合64.7、Nemotron 3 Nano 30B-A3Bは65.6、Qwen3.5 35B-A3Bは74.7、Qwen3.6 35B-A3Bは71.4、Gemma 4 26B-A4B ITは71.9で、いずれもKolibri自身の75.5と比べられている——そしてそれらの行はすべてAleph Alpha自身の数値であり、同じラボが自社のハーネスで実行したものだ。これは3Bアクティブ近傍の有用な地図ではある。しかし独立したランキングではない。

もしあなたが今日求めているのが、ある鍵上の3B-activeなMoEなら

この比較に出てくるどちらのモデルも OrcaRouter 上にはなく、その理由を正確に説明する価値があります。Kolibri にはまだいかなる種類のホスト型推論もありません。重みと vLLM のレシピだけなので、ルーターが指し示す先が何もないのです。Solar Mini 4 は Upstage と、Upstage 自身のオンプレミスチャネルによって提供されています。当社はそれをルーティングしておらず、Upstage のモデルは一切ルーティングしていません。どちらかが必要なら、ベンダー自身から入手することになります。

私たちが扱うルートは、その周辺クラス——これら2つのモデルが競合しているスパースな小型MoEの枠組みです。Gemma 4 26B-A4B ITはカタログ上、100万トークンあたり入力$0.06、出力$0.33、262,144トークンのウィンドウで提供されています。Qwen3.5 35B-A3Bは$0.057 / $0.459、Qwen3.6 35B-A3Bは$0.248 / $1.485で、262,144トークンのウィンドウと最大出力65,536トークンを備えています。これらは上の2つのモデルが行っているのと同じトレードオフ——小型モデル並みの価格で3B~4Bのアクティブスライスを買う——であり、1つのAPIキーで利用でき、プロバイダーの定価が0%のマークアップでそのまま適用されるため、ベンダーの価格変更は次回の契約更新時ではなく発表当日に請求へ反映されます。自動フェイルオーバーはここでは通常以上に重要です。実績のないスパースモデルを評価しているとき、同じキーの背後にある第2のルートが、悪い午後を障害に変えないようにしてくれます。

A two-column comparison scoreboard titled “Kolibri vs Solar Mini 4 — the scoreboard”. The Kolibri column lists total parameters 78.1B, 3.46B active per token, Apache 2.0 downloadable weights, 1,048,576-token context, German and English, and no independent score published. The Solar Mini 4 column lists total parameters 35B, 3B active per token, closed API-only weights, a 512K-per-docs / 1M-per-Artificial-Analysis context, English, Korean and Japanese, and an Artificial Analysis Intelligence Index of 24.05. A footer line reads “Kolibri figures are Aleph Alpha's own, unaudited; Solar Mini 4 figures per Artificial Analysis and Upstage.”

何をすべきか、そして何に注目すべきか

ドイツ語または英語がワークロードで、データを自社ラックの外に出せず、78BをFP8で提供するためのGPUをすでに持っている(または購入する意思がある)なら、Kolibriを選んでください。その構成では、この2つのモデルの中で選択肢にすらなる唯一のものであり、トークンあたり4.90バイトのドイツ語トークナイザーを備えた1Mトークンの検証済みコンテキストは、ベンダー測定値であるにせよ、実際の利点です。今週中に本番環境に入りたい場合、ロードマップに韓国語または日本語がある場合、ワークロードがキャッシュ割引の恩恵を受けられる長く安定したコンテキストである場合は、Solar Mini 4を選んでください。予算は出力トークンではなく、キャッシュ書き込みに割り当ててください。

両者にとって未解決の問いは同じであり、それは能力の問題ではなく証拠の問題だ。Kolibri の 75.5 と 84.3 は Aleph Alpha 自身のハーネスによる Aleph Alpha 自身の数値であり、独立したトラッカーがそれを実行するまで、それらを引用する者はラボを引用しているにすぎない。Solar Mini 4 の 24.05 は本物で再現もされているが、Index はまだ割引ラダーの途中にあるモデルのスナップショットであり、定価は10月23日まで登場しない。Kolibri の最初の独立評価に注目し、ラダーが尽きた後に Solar Mini 4 が実際いくらになるかにも注目せよ——なぜなら $0.10 / $0.40 では、3B スライスを借りる経済性は、今日提示されている $0.03 / $0.12 とは異なって見えるからだ。