
Kolibri解説:Aleph Alpha、Apache 2.0の下で78Bの独英モデルを公開
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 218 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
アレフ・アルファはKolibriを2026年10月3日に公開した。781億パラメータのMixture-of-Expertsモデルで、トークンあたり34.6億パラメータを活性化し、検証済みのコンテキストウィンドウは1,048,576トークン、Apache 2.0ライセンスの下で完全な重みをHugging Faceで配布している。ハイデルベルクの研究所はドイツ再統一の日にこれを公開し、テクニカルレポート、ドイツ語と英語のモデルカード、そしてこのモデルがどのように訓練されたかについての異例なほど詳細な記述を同時に発表した。アレフ・アルファ自身のドキュメント全体を通じて比較対象とされているモデルはKolibri Origin — 2026年6月11日に事前学習を完了しながら一度も一般公開されなかった、306億パラメータ・32.7億活性の前身モデルである。3か月違いの2つのモデル、そしてその隔たりこそが、このリリースで最も興味深い点だ。
Kolibri を注意深く読む価値があるのは、それが利用可能な中で最強のモデルだからではない。Aleph Alpha 自身の比較表でもそうではなく、それについては後述する。注目すべきは、欧州のラボがこの規模のオープンウェイトモデルをそもそもリリースしたことであり、学習パイプライン、データの来歴、エネルギー数値が併せて公開され、ライセンスも特注の研究ライセンスではなく Apache 2.0 に設定されたことだ。「データはどこへ行くのか」から調達ルールが始まるチームにとって、その組み合わせこそが製品なのだ。
仕様書、そして重要な2つの数字
以下はすべて、Aleph Alpha が重みとともに公開したモデルカードからのものであり、まだどれも独立に再現されておらず、執筆時点では Kolibri に関する Artificial Analysis の行は存在しません。
• 総パラメータ数 — 78,103,074,560、トークンあたりの有効パラメータ数は 3,457,573,120、比率はおよそ 22.6 対 1。
• アーキテクチャ — 50層のトランスフォーマーで、全層がMixture-of-Experts、層あたり384のエキスパート(1つは共有、6つはルーティング)、そしてスタック全体でスライディングウィンドウアテンションとグループ化クエリアテンションの4:1の混合。
• コンテキスト — 16,384トークンで学習し、65,536で中間学習を行い、ネイティブの262,144まで拡張。位置エンコーディングはスライディングウィンドウ層にのみ適用されるため、Aleph Alphaは位置スケーリングなしでウィンドウを拡張できると述べており、最大1,048,576トークンまで品質とサービング効率を検証済み。レイテンシに敏感な作業や複雑なタスクでは、262,144以下に留めることをカードは推奨している。
• 精度 — 128×128 ブロックの FP8 重みと動的に量子化されたアクティベーションを使用し、FP8 KV キャッシュで評価。埋め込み、LM ヘッド、ノルム、MoE ルーターは bfloat16 のままとする。
• 推論 — 4段階のエフォートレベル(なし、低、中、高)。チャットテンプレートで設定されます。
• ツール呼び出し — はい、Hermes スタイルで、重みと同じリポジトリに同梱されている vLLM パーサー付き。
• 言語 — ドイツ語と英語のみ、それ以外はありません。これは省略ではなく設計上の選択として明言されています。
• トレーニング — フィルタリング済みの二言語コーパスで20兆の事前学習トークン。内訳はおおよそ英語62.5パーセント、ドイツ語23.9パーセント、コード13.6パーセントで、さらに3.44兆の中間学習トークンと、長コンテキスト拡張用の2010億トークン。
• 計算 — 96台のHGXノードにまたがる768基のNVIDIA B200を使用し、事前学習に21日間、511時間、392,000 GPU時間、報告値で6.4×10²³ FLOPs。中間学習では5日間と90,000 GPU時間が追加され、長コンテキスト拡張では13時間と10,000 GPU時間が追加された。
• エネルギー — データセンターのオーバーヘッドを含め、事前学習、中間学習、長文脈学習を対象とした推定9.5×10² MWh。ただし教師ありファインチューニングと強化学習は除く。
• ライセンス — Apache 2.0。許容使用に関する付帯条項なし、月間アクティブユーザーのしきい値なし、別途の商用条件なし。
その行のうち2つは、購入者が二度読むべきものだ。アクティブパラメータ数は推論時にコストを払う対象であり、総計780億のうち34.6億がアクティブというのは、かなり攻めたスパース化比率だ。これこそ、この規模のモデルを2基のGPUでなんとか提供できる唯一の理由である。また、コンテキストの数値は、ネイティブ262,144、検証済み1,048,576と記載されており、このリリースに関するほとんどの報道で見かけるような単なる「1M context」よりも慎重な主張になっている。

2つのモデル、3か月違い
Kolibriは、Aleph Alphaが自社の「Model Factory」と呼ぶものから生まれた2番目のモデルであり、同社が公開したタイムラインは、このリリースに関するほとんどの報道が飛ばしてしまう部分だ。
学習パイプラインの作業は2026年1月に始まった。Kolibri Originは2026年6月11日に目標規模で事前学習を完了した — 総パラメータ数306億、アクティブ32.7億、65,536トークンのコンテキストウィンドウ、7.51兆学習トークン、50層(うち2層がdense、48層がMoE)、単一の推論モード。これは社内で検証され、一般公開されることはなかった。Kolibriは2026年9月11日に事前学習を完了した。
• パラメータ — 合計30.6B、アクティブ3.27B(比較対象は合計78.1B、アクティブ3.46B)。
• コンテキスト — 事前学習コンテキストはOriginで8,192トークン、Kolibriでは16,384トークン、そして最終的にネイティブの262,144。
• データ — Origin 上での 7.51 兆事前学習トークン(20 兆に対して)、パイプラインがフィルタリング、重複排除、キュレーションした 200 兆超の生プールから抽出。
• アーキテクチャ — Origin上の2つの高密度層と48のMoE層に対し、50のMoE層、変更されたアテンション設計、3倍のエキスパート数、より高いスパース性、そして置き換えられたルーティングアルゴリズム。
• 推論 — Originでは1つのモード、それに対してKolibriではなし、低、中、高。
• リリース — Origin は一般公開なし、Kolibri は 2026年10月3日。
最も大きく動く数値はタスクスイートのもので、そこでは同じ評価ハーネスが両モデルを採点した。ポストトレーニングスイートのドイツ語平均では、Origin が 46.4、Kolibri が 70.8 を記録し、英語平均では 54.1 対 75.5 だった。ドイツ語での AIME 2025 では、73.5 対 87.5。ベンダーが業種別セットとして公開している社内の顧客プロキシベンチマークでは、自動車サプライヤー・スイートが 0.72 から 0.99 に、半導体が 0.35 から 0.80 に、ドイツ公共部門が 0.54 から 0.75 に、産業用ドライブ技術が 0.31 から 0.60 に、航空宇宙が 0.14 から 0.59 に上昇した。
これらの内部向け業界別数値は、ベンダーが運営し、ベンダーが構築し、ベンダーの顧客を中心に設計された評価スイートによるものなので、スコアではなく意図の説明として扱ってください。これを公開する意味は、そのモデルが何に向けて最適化されたかを説明することにあります。すなわち、リーダーボードではなく、規制業界の一連の文書です。

ここではドイツ語は言語タグではなく、デザイン上の決定です。
ほとんどの「多言語」モデルカードは、たまたまドイツ語がいくらか含まれた学習ミックスを意味する。これは逆のやり方で作られており、そのカードは仕組みについて具体的に述べている。
Aleph Alphaは、小規模なプロキシモデル実験から、混合データ中のドイツ語データが約20パーセントであるときに最良の結果が得られることを発見しました。これは、20兆トークンの実行では、4兆のドイツ語トークンを見つけることを意味していました。重複排除およびフィルタリングされたオープンなドイツ語データセットは、3900億トークンをもたらしましたが、目標には桁違いに及びませんでした。それは3つの方法でギャップを埋めました。1つは、Common Crawlのフィルターをドイツ語向けに特別に再調整することです。これにより、1.3兆のユニークなオーガニックトークンが生成されました。2つ目は、既存のドイツ語文書を百科事典スタイルの項目、質疑応答の対話、テキストパッセージに言い換えることで、約1兆以上を生成し、単一最大のドイツ語ソースとなりました。3つ目は翻訳で、これはKolibri Originでのみ使用され、Kolibriでは省略されました。ドイツ語は最終的に2.4兆トークンのユニークなプールとなり、その80パーセントは社内でキュレーションまたは生成され、アップサンプリング後の事前学習トークンの21.3パーセントを占めました。
フィルターの詳細は引用に値する。なぜならそれは、実際にドイツ語で訓練したラボでしか表面化しない類のことだからだ。標準的な言語データパイプラインは、長い単語が多すぎる文書を除外する——しかしドイツ語の行政文章は、平均単語長に関する英語の上限を日常的に超えているため、デフォルト設定は公的行政が書く文体を静かに削除してしまう。明らかな商業的帰結は、既製の英語フィルターで訓練されたモデルには、言うに足るドイツ語の法律・行政語彙がまったくなく、しかもそのことを教えてくれるベンチマークは存在しないということだ。
トークナイザーも同じ扱いを受ける。Aleph Alphaは、UniBPEと呼ぶ新しい手法を用いて、12万8千トークンの語彙を持つドイツ語・英語のバイリンガルトークナイザーを訓練した。これはバイトペア符号化のボトムアップ統合を維持しつつ、ユニグラム目的関数で統合を選択する。ドイツ語のウェブテキストで、1トークンあたり平均4.90バイトと報告しており、GPT-5の4.35、Geminiの4.13、Qwen3.5–3.8の4.17、GLM 5.3の3.93、DeepSeek V4の3.72、Kimi K3の3.28を上回る——いずれもベンダー自身の比較におけるベンダー報告値である。1トークンあたりのテキスト量が増えれば、タスクあたりのトークン数は減り、これは品質に関する主張ではなく推論コストへの直接的な効果であり、文書処理ワークロード全体で複利的に効いてくる種類の効率向上である。
ベンダーの表では解決しないこと
Aleph Alphaは14のモデルを対象としたポストトレーニングの比較を公開した。そしてそれは、対象をおだてない分、ほとんどのローンチ時の表よりも役に立つ。
同じハーネス上で、Kolibriを推論エフォート高に設定した場合、Qwen3.8 27Bは英語平均で80.2を記録し、Kolibriの75.5を上回り、ドイツ語平均では79.9対70.8となっています。また、GPQA Diamond、LiveCodeBench v6、SWE-Bench Verified、および2つの長文コンテキストベンチマークでもリードしています。Nemotron 3 Super 120B-A12Bは英語で73.0を記録し、Kolibriの75.5に対してより差は小さく、AIME 2025では先行しています。Gemma 4 26B-A4B ITは2つの平均で71.9と66.3を記録しています。
リリースについての正直な要約は「最先端」ではない。そうではなく、Kolibri はトークンあたり30億~120億のパラメータを活性化するモデル群の中間に位置し、はるかに小さいモデルには明確に勝り、自身の表のほとんどの行では、Alibaba の密な27Bパラメータモデルに負けている一方で、活性化するパラメータはおよそ8分の1である、ということだ。これに対する Aleph Alpha の枠組みは、品質対 GPU あたり毎秒デコードトークン数のパレートフロンティアである。比較したモデルの中で、同じサービングコストでより高い品質を提供するものも、より低いコストで同じ品質を提供するものもない。それが問いただすべき主張であり、能力の主張ではなく、サービング経済性の主張である。
これらの数値はどれも独立に検証されていない。Kolibri に関する Artificial Analysis の項目はなく、評価フレームワークを第三者が再現したものもなく、バーティカルベンチマークはベンダーが作成したものである。この比較はまた、構造上、ある方向では Kolibri に有利に、別の方向では不利に働いている。14 個のモデルはすべて、同一のプロンプトと few-shot 設定で Aleph Alpha 独自のハーネスを通して実行された。これは正しいやり方ではあるが、それでも一つのラボのハーネスにすぎない。このセクションの数値はすべて、他の誰かが実行して検証するまでは、ベンダー報告値として扱うこと。

それを実行するのに必要なもの
Kolibriはラップトップで動かせるモデルではありません。FP8ウェイトのモデルメモリは約78 GBで、カードの最小構成はA100 80 GBカード2枚、H100 SXM5 2枚、H200 1枚、B200 1枚、またはB300 1枚です。推奨構成はH100 SXM5 2枚、H200 2枚、B200 1枚、またはB300 1枚です。
これを提供するには、Kolibri vLLM プラグインを提供し、サポートする vLLM のバージョンを固定する aleph-alpha-inference パッケージをインストールするか、コンテナイメージ ghcr.io/aleph-alpha/aleph-alpha-inference をプルします。そこからは、FP8 KV キャッシュ、Kolibri 推論パーサー、Kolibri ツール呼び出しパーサーを使った標準的な vLLM の呼び出しになります。262,144 トークンを超えるコンテキストには、明示的な maximum-model-length フラグと position-embedding のオーバーライドが必要です。推奨のサンプリングパラメータは、temperature 1.0、top-p 0.97、top-k 128 です。
APIサーフェスはOpenAI互換であり、これは聞こえ以上に重要だ。推論エフォートはreasoning_effort値としてチャットテンプレート経由で渡され、ツール呼び出しは標準のtoolsフィールドに出力される。すでにchat-completions形式を扱っているチームなら、ラッパーレイヤーなしで、既存のコードを自社の建物内にあるマシン上のKolibriエンドポイントに向けることができる。
コリブリにまだないもの
4つの欠落は、率直に述べておく価値がある。なぜなら、ローンチ時の報道はそれらを飛ばしがちだからだ。
• 独立した評価は存在しない。Artificial AnalysisにはKolibriのモデルページがなく、ベンダーのベンチマーク表を再現したものを公開した第三者もいない。
• ベンダーによるホスト型エンドポイントは提供されていません。このリリースはウェイトと技術レポートであり、モデルとともに公開された資料には、Kolibri 向けの Aleph Alpha API SKU は存在しません。
• OrcaRouter 上にルートはなく、当社が名前を挙げるようなアグリゲーターにも存在しません。ベンダープレフィックスとモデル名のあらゆる表記でカタログを調査しましたが、Kolibri は見つかりません。したがって、それを呼び出したい場合は、78 GB をダウンロードし、vLLM エンドポイントをご自身で実行することになります。当社がそれを提供しているかのように示唆するよりは、そう明言したいと考えます。
• マルチモーダル入力はなし。テキスト入力、テキスト出力、2言語。それがこのラボが広さより深さを取るために交わした取引であり、文書処理の導入先としてはおそらく正しい選択だろうが、紛れもない境界ではある。
今日本当に必要なのが、GPU を 2 枚買わずに呼び出せる小規模な Mixture-of-Experts モデルだというなら、Gemma 4 MoE ティアは、すでにルーティング済みエンドポイント上にある中で最も近い選択肢です。26B-A4B バリアントで入力 100 万トークンあたり $0.06、出力 100 万トークンあたり $0.33、コンテキストウィンドウは 262,144 トークンです。セルフホストの 78B ソブリン展開とそれを天秤にかける人にとって、有用な比較はベンチマークの行ではなく、78 GB の VRAM と、トークン単位の料金項目をめぐる調達の会話です。OrcaRouter はそのティアを OpenAI 互換の 1 つのキーでルーティングし、プロバイダーの定価をそのまま通して何も上乗せしませんこれは、そのワークロードがハードウェアを自前で持つ価値があるかどうかを知るための安上がりな方法です。
Kolibri自体は、より興味深い成果物だ。Apache 2.0の下で公開された780億パラメータのドイツ語・英語モデルで、データパイプライン、トークナイザー手法、エネルギー値、そして3か月にわたる反復の経緯が重みと並んで公開されていることは、通常の重み公開とは異なる種類のリリースだ——開示は製品の一部であり、それについてのブログ記事ではない。パレートの主張が成り立つかどうかは、今やH100を2枚とストップウォッチを持つ人々にとっての問題であり、その答えはモデルカードを書いた誰かから出てくるものではない。
