
Kolibri対Qwen 3.8:ドイツのモデルが自らの土俵で敗れる、それこそが要点だ
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 218 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
のローンチを報じたほとんどの記事が省いた一文から始めよう。Kolibriアレフ・アルファが2026年10月3日、自社モデルとともに公開したベンチマークの表で、最も頻繁に比較対象とされているのは、欧州のライバルでもなく、米国のライバルでもない。それはQwen3.8 27B、すなわち同ベンダーのこの世代におけるオープンウェイト階層にあたり、2026年8月13日に公開されたモデルだ。そしてアレフ・アルファ自身が示した数値の上では、これが勝っている。Qwen3.8 27Bは、Kolibriに75.5と70.8を与えるのと同じ評価スイートにおいて、英語平均で80.2、ドイツ語平均で79.9を記録する。GPQA Diamondでは89.2対84.3でリードする。LiveCodeBench v6では93.8対85.9でリードする。SWE-Bench Verifiedでは72.6対66.4でリードし、長文コンテキストの2つのベンチマークでも、LongBench Proで76.9対64.5、AA-LCRで81.3対68.3とリードする。270億パラメータのデンス型中国製モデルが、ドイツのラボによって評価され、そのラボの780億パラメータの旗艦モデルを、自らの表の大半で打ち負かしているのだ。これはスキャンダルではない。これはこのリリースで最も有用な事実である。なぜなら、Kolibriが実際のところ何のためのモデルなのか、という問いを突きつけるからだ。
比較を先に進める前に一点確認しておきたい。というのも「Qwen 3.8」はモデル単体ではなくファミリーを指す名称であり、ここではその区別が重要になるからだ。Qwen3.8-MaxはAlibabaのホスト型フラッグシップで、2026年8月3日から提供されており、100万トークンのコンテキストウィンドウを備え、価格は入力100万トークンあたり$2.00、出力は$6.00。Qwen3.8-27Bはオープンウェイト層で、2026年8月13日にリリースされ、ウィンドウは262,144トークン。Qwen3.8-Flashは大量利用向け層で、2026年8月26日にリリースされ、100万トークンのウィンドウを持ち、価格ははるかに安い。そして無印のQwen3.8 — 2026年7月19日に2.4兆パラメータのオープンウェイト・フラッグシップとして発表されたもの — は未リリースであり、カタログの追跡ページと発表記事として存在するだけだ。以下で扱うのは、重みをダウンロードして実行できる方、つまり27Bである。
コリブリが実際に優位に立つのはどこか、同じ表から読み取れる
KolibriがQwen3.8 27Bを上回っている行は、無作為に散らばっているわけではない。それらは固まって集まっており、その集まりこそが製品なのだ。
• 回答留保 — RGB Negative では、Kolibri は 85.6 対 70.6 のスコアを記録します。コンテキストに答えが含まれていない場合、Kolibri がその旨を答える頻度ははるかに高くなります。
• 制約下でのツール呼び出し — τ²-bench telecom では 94.7 対 82.5、自動車サプライヤー業界向けの業種特化スイートでは 99.0 対 97.3。
• 非常に長いコンテキスト — 24kトークン超のディストラクタがないSealQAでは、100.0 対 94.4。
• ドイツ語サービングの経済性 — ドイツ語ウェブテキストにおいてトークンあたり平均4.90バイトのバイリンガルトークナイザー。Aleph Alpha自身の測定では、Qwen3.5–3.8ファミリーは4.17です。ドイツ語文書あたりのトークン数が少ないことは、請求書には現れ、ベンチマークのどの行にも現れない直接的な推論コスト削減です。
その4つのうち3つは、能力ではなく振る舞いに関するものだ。棄権、制約付きツール呼び出し、そして根拠に基づく長文脈検索は、あなたの組織自身の資料を読み、その資料が質問に答えていないときにはそう認めることが期待されるモデルに必要なものだ。Aleph Alphaはその賭けを中心にリリース全体を組み立てており、表はその賭けが当たりつつあることを示している。

Qwen3.8 27B が勝っている行は、幅広さに関するものだ。両言語の知識、大学院レベルの科学問題、競技プログラミング、リポジトリレベルのソフトウェアエンジニアリング、長文理解。低いトークン単価でオープンウェイトの強力な汎用モデルを必要としているなら、Qwen3.8 27B のほうが優れたモデルであり、そのことはベンダー自身の表が示している。
その見方は裏付けられているが、Kolibriの見方はそうではない。Artificial AnalysisはQwen3.8 27Bを、そのXhigh推論構成で独自に測定し、その比較の142モデル中1位となるIntelligence Index 34、毎秒45.4出力トークン、256,000トークンのコンテキスト、Apache 2.0ライセンスを報告している。彼らの注記は、お馴染みの意味で手厳しい——インデックス評価中に生成されたトークンが2億で、中央値8,200万に対して非常に冗長であり、遅い——しかし、スコア自体は相手側の第三者測定である。KolibriにはArtificial Analysisのページが一切ない。したがって、この比較で最強のモデルは独立に検証されており、弱い方についてはベンダーの言葉だけである。これは、初代欧州フラッグシップが通常位置づけられるのとは逆である。
逆方向を向いた2種類のサプライチェーンに関する主張
これらのリリースはどちらも、モデルがどこから来たのかをめぐる主張であり、両者の主張は鏡像の関係にある。
Aleph Alphaの事例は、来歴を機能にしたものだ。Kolibriはドイツのチームによって、ドイツとフィンランドにあるインフラ上で、EU法およびドイツ法の下で訓練された。カードは事前学習ミックス——20兆トークン、内訳はおよそ62.5パーセントが英語、23.9パーセントがドイツ語、13.6パーセントがコード——中間学習と長コンテキストの予算、正確な計算構成(768台のNVIDIA B200を96台のHGXノードにわたり21日間)、データセンターのオーバーヘッドを含む推定9.5×10² MWhのエネルギーを開示している。訓練手法は層のレベルに至るまで記載している。50層のMixture-of-Expertsトランスフォーマーで、スライディングウィンドウ対grouped-query attentionの分割比は4:1、384エキスパートにわたりMuonとExact Quantile Balancingを適用し、1つは共有、6つはルーティングされる。78 GBのダウンロードに添付された1万2000語の開示情報、そしてEUの汎用AI行動規範に対する署名者としての立場を明記している。
アリババのケースは種類が異なる。「あらゆる決定を説明できる」ではなく、「ここに重みがある、持っていけ」というものだ。Apacheライセンスのオープンウェイトは、その規模と品質によってQwenを世界中で事実上のデフォルトとし、100をはるかに超える言語をカバーする248,077トークンの語彙、そしてほぼすべての推論スタックがすぐにサポートするほど長くそれらのチェックポイントを中心に調整されてきたサービングエコシステムを備えている。そこでの主権の議論は可用性に関するものである。ベンダーがモデルを撤回することはできない。なぜなら、あなたはすでにファイルを持っているからだ。
どちらの主張も誠実であり、それぞれ異なる不安に応えている。バーデン=ヴュルテンベルクの公共部門の調達担当者は管轄権と監査可能性を懸念しており、Kolibriはその懸念に向けられている。ナイロビやサンパウロの研究グループは、自分たちが支払えない通貨でのクレジットカードの向こうにモデルが閉ざされていることを懸念しており、オープンなQwenの重みはその懸念に向けられている。誠実でないのは、どちらかが能力比較であるかのように装うことだ。能力表はすでに答えを出しているのだから。

ライセンスのギャップは実際に存在するが、聞こえるほど大きなものではない
KolibriはApache 2.0です。Qwen3.8 27BはApacheライセンスのオープンウェイトです。どちらにも、利用に関する追加条項も、月間アクティブユーザー数の閾値も、別途の商用条件もありません。これにより両者は少数派のグループに位置づけられ、商用利用の前に法務レビューを必要としないことを意味します。
両者を分かつのは、ライセンスに続くすべてだ。Kolibriは、ベンダー提供のvLLMプラグインとパーサーパッケージ、コンテナイメージ、チャットテンプレートを通じて設定可能な4段階の推論エフォートレベル、明示的な棄権動作、そして推奨されるサンプリング設定を備えて登場する。Qwen3.8 27Bは、Transformers、vLLM、SGLangがすでにサービング方法を心得ている重みとして登場し、ツール呼び出し形式については、より広範なエコシステムが何か月もかけて対応してきた。
デプロイ用ハードウェアも同じ傾向で異なります。KolibriのFP8重みは約78GBのフットプリントで、最低構成はA100 80GBカード2枚、H100 SXM5 2枚、H200 1台、B200 1台、またはB300 1台です。Qwen3.8 27Bのbfloat16は重みがおよそ54GBで、フル精度なら80GBアクセラレータ1基、量子化ビルドならかなり少ない容量で済みます。ドイツ語モデルはより多くのハードウェアを必要とし、その割に得られるベンチマークは少なくなります。それが悪い取引となるのは、ベンチマークを買っている場合だけです。
値札が教えてくれることと教えてくれないこと
Kolibriには価格がない。Aleph AlphaがKolibriの推論を販売していないからだ。リリースされたのは重み、技術レポート、そしてモデルカードであり、ホスト型のSKUは存在しない。Kolibriに関するコスト数値はすべて、自分で行うハードウェア償却の計算である。
Qwen3.8は公開価格が3つのティアに分かれており、セルフホスティングとレンタルを比較検討するチームにとって重要なのは中間のティアだ。
• Qwen3.8-Max — 入力トークン100万あたり$2.00、出力$6.00、100万トークンのコンテキスト、キャッシュ読み取りは$0.25、2026年8月3日リリース。
• Qwen3.8-27B — 入力 $0.33、出力 $2.40、262,144トークンのコンテキスト、2026年8月13日リリース。これはオープンウェイトなので、自分で実行したくない場合に支払う価格がこれにあたります。
• Qwen3.8-Flash — 入力$0.15、出力$0.47、100万トークンのコンテキストウィンドウ、2026年8月26日リリース。
これらはOrcaRouter におけるプロバイダーの定価であり、トークン単位で何も上乗せせずそのまま通したものです。これは、セルフホストの展開が元を取れるかどうかが問われる場面で役立つ性質です。ハードウェアに投資する前に、ホスト型の各ティアで実際のトークン量を測ることができます。当社はマージンを上乗せしていないため、ベンダーの値下げは当日中に当社側でも反映されます。Qwen3.8 の3つのティアはすべて、プロバイダー間の自動フェイルオーバーを備えた1つの OpenAI 互換キーで本日からルーティング可能です。また、近日登場予定の2.4兆パラメータの Qwen3.8 には、配信しているふりをするプレースホルダーではなく、重みの到着を待つカタログページが用意されています。
Kolibri はルーティングできません。あらゆるベンダー名・モデル名の表記でカタログを調べましたが、存在しません。そのため、それを呼び出す唯一の方法は 78 GB のダウンロードです。ドイツのモデルがあなたのワークロードにいくらかかるのかを知りたいなら、答えはラック 1 台と vLLM を動かせる人材であり、現在、第三者から他の見積もりを取ることはできません。

誰がどれを買うべき?
判断の分かれ目は品質ではない。その問題はベンダー自身の比較表によってすでにAlibaba有利に決着しているからだ。分かれ目は、どのリスクに対する保険を買うのかという点にある。
• 拘束的な制約が法域、来歴の文書化、または監査可能性である場合は、Kolibri を選んでください — トレーニングデータがどこから来たのか、コンピュートがどこで実行され、どの法の下で行われたのかを答えられる必要があり、ワークロードが自社の境界内で処理されるドイツ語と英語の文書である場合です。そのためには機能面での割増料金を支払っており、その割増は上の表にはっきり表れています。
• 拘束条件が費用対効果、言語の広さ、エコシステムのサポートのいずれかであるなら、Qwen3.8 27B を選びましょう。Aleph Alpha 自身の評価においてより強力なモデルであり、Apache ライセンスで提供され、単一のアクセラレータ上で動作し、自分で実行したくない場合には、ホスト型ティアが100万入力トークンあたり $0.33 から利用できます。
• ワークロードに規制対象の中核と一般的な周辺部があるなら、両方を同じアーキテクチャで検討しよう。建物の外に出せない文書はセルフホストのKolibriエンドポイントへ、要約・翻訳・コード作業は1000トークンあたり0.3セントのルーティングされたQwen3.8ティアへ。APIキーは1つ、ルーティングルールも1つ、プロバイダの定価はそのまま適用され、フェイルオーバーも自動で処理される——これは、この2つのどちらかを選び、もう一方の存在をなかったことにするより、はるかに有用な体制だ。
