
Kolibri初日:Aleph Alphaが独英の780億重みを公開、反応はエビデンスを先走っている
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 217 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Aleph AlphaがKolibriを公開してから24時間、その反応は一本の線に固まってしまい、その線を一度分解してみる価値がある。ハイデルベルクのラボは2026年10月3日、781億パラメータのMixture-of-ExpertsモデルをApache 2.0の下でHugging Faceに公開し、同日の朝に自社のニュースルームと自社アカウントから発表した。そして翌日までにAI関連フィードで流れていた要約はこうだった——総パラメータ78B、トークンあたり3.46Bがアクティブ、Apache 2.0の下でのオープンウェイト、ドイツ語と英語向けに構築。この文のどの節もリポジトリから確認できる。ほとんど語られていないのは、このリリースのどの部分が測定された事実であり、どの部分が著者らが自らのモデルについて述べた主張——ハイデルベルクの外では誰も実行していないもの——なのか、ということだ。この隔たりこそが初日の物語であり、見出しの数字よりも重要である。
まずタイムラインから見ていこう。というのも、驚くほど多くの反応がこれを謎めいた静かな公開として扱っていたが、そうではなかったからだ。Hugging Face のリポジトリ Aleph-Alpha/Kolibri-1 は 2026年10月2日 05:54:02 UTC に作成され、モデルカードには公開日として10月3日と明記されており、ベンダーのニュースルーム投稿は同じ朝 08:43:53 GMT に配信された——ドイツ再統一の日であり、ラボが明らかに選んだ日付だ。Aleph Alpha 自身のアカウントも数分以内にこの件を投稿した。報道解禁もローンチイベントもなかった。おそらくそこから「静かなリリース」という捉え方が生まれたのだろうが、ベンダーのニュースルーム投稿、技術レポート、公式発表は静かな公開ではない。それらは、一般の AI プレスがその当日に単に取り上げなかっただけの、通常のリリースだ。
反応が繰り返している数字
3.46Bアクティブが誰もが引用する数字なのは、このリリースの中で、購入者が所有しなければならないものを変える唯一の数値だからだ。Kolibriは50層のトランスフォーマーで、各層がmixture-of-expertsであり、1層あたり384のエキスパート、うち1つが共有、6つがルーティングされ、総パラメータ数は78,103,074,560に及ぶ。トークンごとにそのうち3,457,573,120を活性化する——スパース率はおよそ22.6対1。これにより、780億パラメータのモデルが、ラックではなくH100 2基で提供可能になる。そしてこれが、このリリースにおける最も重大な主張である。
その周囲には、他の主要な数値が並んでいる。それらはすべて、独立した実行によるものではなく、モデルカードに由来する:
• コンテキスト — 16,384トークンで学習され、65,536で中間学習、262,144がネイティブで、1,048,576まで検証済み。カードは、レイテンシーに敏感な作業では262,144以下にとどまることを推奨している。要約で目にする単なる「1M context」は検証済みの上限であり、ネイティブウィンドウではないことに注意してください。
• 精度 — 128x128ブロックのFP8重みと動的に量子化された活性化を使用し、FP8 KVキャッシュで評価。埋め込み、LMヘッド、ノルム、MoEルーターはbfloat16のまま。
• 推論 — 4段階のエフォートレベル — なし、低、中、高 — チャットテンプレートで設定され、Hermes 形式のツール呼び出しと、重みと同じリポジトリに同梱された vLLM パーサーを備えています。
• 言語 — ドイツ語と英語、それ以外はありません。
• トレーニング — フィルタリングされたバイリンガルコーパス(およそ英語62.5%、ドイツ語23.9%、コード13.6%)にわたる20兆の事前学習トークン、さらに3.44兆の中間学習トークンと、長コンテキスト拡張用の2010億トークン。
• 計算資源とエネルギー — 96台のHGXノードにわたる768基のNVIDIA B200、21日間の事前学習で511時間および392,000 GPU時間、報告されている6.4×10^23 FLOPs、データセンターのオーバーヘッドを含む推定9.5×10^2 MWh、ただし教師ありファインチューニングと強化学習を除く。
• ライセンス — Apache 2.0。許容使用に関する付帯条項なし、月間アクティブユーザーのしきい値なし、別途の商用条件なし。
誰も検証していない2つの主張
これは、反応が飛ばしてしまった初日の部分であり、Kolibri が重要なのか、それとも単に興味深いだけなのかを決める部分だ。
最初のものは、サービング経済性に関する主張だ。Aleph Alphaの主張の立て方は、Kolibriが入手可能な中で最強のモデルだというものではない——ラボ自身の比較表でもそうではなく、ラボもそう述べている。その主張の立て方は、GPUあたり1秒あたりのデコード済みトークン数に対する品質のパレートフロンティアに沿って、同じサービングコストでより高い品質を届けるモデル、またはより低いコストで同じ品質を届けるモデルは、比較対象の中に存在しない、というものだ。それは特定のハードウェア上のスループットに関する主張であり、ストップウォッチと2台のH100を持つ第三者だけが決着をつけられる、まさにその種の主張だ。誰もそれをしていない。2026年10月4日時点でKolibriに関するArtificial Analysisの項目はなく、評価ハーネスの第三者による再現もない。
第二はトークナイザーに関する主張です。Aleph Alphaは、UniBPEと呼ぶ手法を用いて12万8,000トークンの語彙を持つドイツ語・英語のバイリンガルトークナイザーを訓練し、ドイツ語のウェブテキストにおいて1トークンあたり平均4.90バイトを報告しています。これに対して、GPT-5は4.35、Geminiは4.13、Qwen 3.5-3.8は4.17、GLM 5.3は3.93、DeepSeek V4は3.72、Kimi K3は3.28です。これらの数値はすべてベンダー自身によるもので、ベンダー自身のコーパス上で測定され、ベンダーが選んだ競合他社と比較したものです。1トークンあたりのテキスト量が多いことは、品質に関する主張というよりも、実際の推論コストに効く効果であり、それが成り立つなら、あらゆる文書処理ワークロードにわたって積み重なって効いてきます——しかしそれは1つのラボによる測定であって、ベンチマーク結果ではありません。
ドイツ語が要点であり、それはこのリリースで最も興味深いエンジニアリングです。
ほとんどの「多言語」モデルカードは、たまたまドイツ語を含んでいたトレーニングミックスについて述べている。これはその逆のやり方で構築されており、そのカードは仕組みについて異例なほど具体的だ。
小規模なプロキシモデル実験により、Aleph Alpha はデータ混合におけるドイツ語データの目標をおよそ20パーセントと定め、これは20兆トークンの学習では4兆個のドイツ語トークンを見つけることを意味していた。重複排除とフィルタリングを施したオープンなドイツ語データセットが供給したのは3900億トークンで、一桁足りなかった。同ラボは三つの方法で不足を埋めた。第一に、Common Crawl のフィルターをドイツ語向けに特化して再調整し、これにより1.3兆個のユニークな有機的トークンが生成された。第二に、既存のドイツ語文書を百科事典の項目、質疑応答の対話、テキストの一節へと言い換えることにより、さらに約1兆トークンが生まれ、これが単一最大のドイツ語ソースとなった。第三に翻訳で、これは前身モデルでは使われたが、Kolibri では意図的に除外された。ドイツ語は最終的に2.4兆トークンのユニークなプールとなり、その80パーセントは社内でキュレーションまたは生成されたもので、アップサンプリング後には事前学習トークンの21.3パーセントを占めた。
フィルターの細部は、実際にドイツ語で訓練したラボでしか表面化しない類のものだ。標準的な言語データパイプラインは、長すぎる語が多すぎる文書を捨てる。だがドイツ語の行政文は、平均語長に関する英語の上限を日常的に超えているため、デフォルト設定は、公的行政が書く際のレジスターを静かに削除してしまう。既製の英語フィルターで訓練されたモデルには、ドイツ語の法務・行政語彙はほとんどないに等しく、どんなベンチマークもそのことを教えてはくれない。
比較表が実際に示していること
Aleph Alphaは14モデルを対象にしたポストトレーニング比較を公開した。これは大半のローンチ表より有用だ。対象をお世辞にしないからである。Kolibriを推論エフォートhighに設定した同一ハーネス上で、Qwen3.8 27Bは英語平均でKolibriの75.5に対して80.2、ドイツ語平均で70.8に対して79.9を記録し、GPQA Diamond、LiveCodeBench v6、SWE-Bench Verified、および両方のロングコンテキストベンチマークでリードしている。Nemotron 3 Super 120B-A12Bは英語でKolibriの75.5に対して73.0。Gemma 4 26B-A4B ITは2つの平均で71.9と66.3。
つまり、このリリースについての正直なまとめは「最先端」ではない。Kolibriは、トークンあたり30億~120億個のパラメータを活性化するモデル群のちょうど中位に位置し、はるかに小さいモデルには明らかに勝り、自身の表のほとんどの行で、パラメータのおよそ8分の1を活性化している一方で、Alibabaの270億パラメータDenseモデルに負けている、ということだ。経済性がそのギャップを救うかどうかがParetoの主張であり、そのParetoの主張は未検証だ。

今日、実際にそれをどう呼ぶか
ベンダーが提供するホスト型エンドポイントはありません。リリースは重みと技術レポートのみで、公開されている資料の中にKolibri向けのAleph Alpha API SKUはありません。また、OrcaRouterにはそのためのルートもありません。ベンダープレフィックスとモデル名のあらゆる綴りでカタログを調べましたが、Kolibriはそこにありません。したがって、今日これを呼び出すには、約78 GBのFP8重みをダウンロードし、自分でvLLMエンドポイントを実行する必要があります。その方法はaleph-alpha-inferenceパッケージか、公開されているコンテナイメージを使うことです。
それは実際の調達判断であって、脚注ではない。そしてここにこそ、たとえ自分がホストしないモデルであっても、ルーティング層が存在価値を持つ場面がある。セルフホストの78Bソブリン・デプロイを検討している人が行うべき正直な比較は、ベンチマークの数値の並びではない。78 GBのVRAMと調達の会話を、他人が所有するハードウェア上のトークン単位の課金項目と突き合わせることだ。今月本当に必要なのが、GPUを2枚買わずに呼び出せる小規模なMixture-of-Expertsモデルなら、Gemma 4 26B-A4Bティアが、すでにルーティング済みエンドポイント上にある最も近い存在だ。入力100万トークンあたり$0.06、出力100万トークンあたり$0.33、コンテキストウィンドウは262,144トークンで、OrcaRouterはそのティアを1つのOpenAI互換キー プロバイダーの定価で、何も上乗せせずにルーティングする。それが、ハードウェアが届く前に、そのワークロードがハードウェアを所有するに値するかどうかを安く見極める方法だ。

注目すべき点、そして判断を変えるもの
3つのこと、どれだけ状況を大きく動かすかの順に。
カードの推奨構成である2基のH100での独立したスループット測定は、Paretoの主張を裏付けるか、あるいは否定することになる。それは、このリリースの中で、仕様書の焼き直しではなく、本当に目新しい唯一の主張である。ドイツ語と英語のタスクスイート平均の独立した再現は、Qwen3.8 27Bとの差がベンダー自身の表が示唆するほど狭いのか、それともさらに狭いのかを教えてくれる。そして、翻訳された汎用ベンチマークではなく、実際の行政文書を用いたドイツ語評価は、このリリースが実際に何のために作られたかを試すことになるが、それを現在測定しているリーダーボードは存在しない。
それらのうちのどれかが実現するまでは、正しい捉え方はリポジトリ自体が裏付けているものだ。Kolibriは欧州のラボによる本物のオープンウェイト公開であり、欧州のラボがこれまで提供したことのない規模で、既存のどの企業も匹敵しなかったApache 2.0条件を備え、重みと同時にデータパイプラインが公開され、見出しの数字よりも興味深い2モデル反復のストーリーがある。また現時点では、最も引用される数値が著者自身に由来するモデルでもある。これらの文はどちらも初日から真実であり、反応が見落としたのは2番目の方だ。

