
Kolibri vs LFM2.5 2.6B Base:スマホサイズのチェックポイントに挑む78Bのソブリンデプロイ
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 218 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
置くKolibriの隣にLFM2.5 2.6B Base誰もが思い浮かべる読み方はダビデとゴリアテだ。781億パラメータ対26.9億パラメータ、2基のGPUというデプロイ下限対、Liquid AIがスマホで動くと語るモデル。だがその明白な読み方は間違っている。しかも、予想される方向とは逆の向きに間違っている。このどちらも、今日あなたがタスクを指し示して使えるモデルではない。Kolibriは、Aleph Alphaが2026年10月3日に公開したもので、完全なポストトレーニング済みの、ツール呼び出しに対応したドイツ語・英語アシスタントであり、サービング用プラグインと推奨サンプリング設定を備えている。LFM2.5 2.6B Baseは、Liquid AIが2026年8月初旬に公開した事前学習済みチェックポイントで、指示チューニングは一切施されておらず、ファインチューニングされることを前提にリリースされている。一方はあなたがデプロイする製品であり、もう一方は素材である。両者の品質を比較するのはカテゴリー錯誤であり、興味深い問いは、あなたのプロジェクトが実際に必要としているのはどちらの種類の素材か、という点である。
この2つの間で、実際の調達のほとんどを左右する差は、パラメータではない。それはライセンスだ。KolibriはApache 2.0の下で提供されている。LFM2.5 2.6B Baseは、特注のライセンスであるLFM Open License v1.0の下で提供されており(モデルカードでは「license: other」と分類されている)、その違いこそが、エンジニアリングチームではなく法務チームに持ち込まれるものだ。
「オープンウェイト」の2つの異なる意味
どちらのモデルも、重みをダウンロードして実行できる。その後、何を許されるかが両者の分かれ目だ。
• Kolibri — Apache 2.0、許容使用に関する付帯条項なし、ユーザー数閾値なし、別途の商用条件なし。Aleph Alphaのカードが記しているのは、同ラボがEU GPAI行動規範の署名機関であるという点のみだ。
• LFM2.5 2.6B Base — LFM Open License v1.0は、OSI標準のライセンスではなく、Liquid AI独自のライセンスです。これは、ポストトレーニング済みのLFM2.5 2.6Bとファミリーの残りに適用される同じライセンスです。
研究チームにとっては、どちらでも構わない。調達文書で自社のライセンス上の立場を明示しなければならない企業にとっては、一方は既知の数量であり、他方は誰かが読まなければならない文書である。それは実際のコストであり、トークンが一つも生成される前に支払われ、どんなベンチマーク表にも見えてこない。
同じカテゴリには2つ目の区別があり、それはLiquid AI自身のカードが特に力を入れて示しているものだ。Baseはアシスタントではない。指示チューニングを一切備えていない。つまり、プロンプトに従うことも、回答を控えることも、ツール呼び出しを出力することも、話題にとどまることもない——弱いからではなく、そのように訓練されたことがないからだ。カードには、大規模なファインチューニングを必要とするタスクにのみ推奨されると明確に書かれている。言語特化型またはドメイン特化型のアシスタント、独自データでの学習、あるいは新しいポストトレーニング手法の実験などだ。ベースチェックポイントから下流のすべて——教師ありファインチューニング、教師の専門化、オンポリシー蒸留、エージェント型強化学習——は購入者が自分で解決すべき問題である。Kolibriは、それらすべてがすでに済んだ状態で、4段階の推論エフォートレベルを備え、重みの隣に同梱されたHermesスタイルのツール呼び出しパーサーとともに登場する。
各サイズで実際に何が得られるか
表面的な枠組みを取り除けば、その二つのモデルは正反対の制約に最適化されている。
• パラメータ — Kolibri では総計 78,103,074,560、トークンあたり有効 3,457,573,120 であるのに対し、LFM2.5 Base では総計 26.9 億。LFM2.5 Base は、均一なブロックのトランスフォーマーではなく、22 個の二重ゲート付きショート畳み込みブロックと 8 個のグループ化クエリ・アテンション層からなるハイブリッドスタックを使用している。
• コンテキスト — LFM2.5 Baseでは131,072トークン。これに対し、Kolibriでは262,144トークンのネイティブウィンドウ、さらにその先で検証済みの1,048,576トークン。
• トレーニングデータ — LFM2.5 Baseでは34兆トークン、Kolibriでは20兆トークン。Kolibriはフィルタリングと重複排除の後、200兆を超える生のプールから抽出されたもので、そのうち13.6%がコードだった。
• 言語 — LFM2.5 Baseではアラビア語、中国語、日本語、韓国語、タイ語、ベトナム語を含む16言語であるのに対し、Kolibriでは明示的な設計によりドイツ語と英語のわずか2言語です。
• メモリ — LFM2.5 Base には GGUF、ONNX、MLX ビルドが併せて公開されており、エッジ展開向けに設計されています。Kolibri の FP8 重みは約 78 GB のフットプリントで、最低でも A100 カード 2 枚、H100 SXM5 2 枚、H200 1 枚、B200 1 枚、または B300 1 枚が必要です。
それら5行をまとめて読めば、全体像はもはや偏って見えなくなる。Liquid AIのモデルは、3桁小さいハードウェアで10倍の言語をカバーしている。Aleph Alphaのモデルは2つの言語をカバーし、コンテキストウィンドウは8倍長く、その専門性の深さは自社の業界特化型評価の中でしか見えてこない。どちらかが他方の劣化版というわけではない。両者は異なる問いへの答えであり、その問いとは「サーバーなしで実行できるか」と「ドイツの規制当局への提出書類を論理的に読み解けるか」である。

それらのうち、測定されたスコアを持つのは1つだけであり、それはBaseではない
ここに、そのペアリングが隠している部分がある。Artificial Analysis には確かに LFM2.5-2.6B のモデルページがある——ただし、ポストトレーニング済みモデルのもので、Base ではない。そのページには Intelligence Index 8 が報告されており、同クラス49モデル中9位、128,000トークンのコンテキスト、27億パラメータ、LFM Open License v1.0 を備えている。それは控えめなスコアであり、正直なスコアでもある。このモデルは測定され、実質ゼロの価格が付けられ、あるがまま——小さな推論モデルとして評価されている。
Baseチェックポイントにはスコアがなく、持ちようもありません。Intelligence Indexは、モデルを推論タスクと知識タスクに対して実行することで算出されます。インストラクション・チューニングが施されていないチェックポイントは、そうしたタスクにおいて意味のある振る舞いを示しません。Liquid AIはこれについて評価表を公開しておらず、その不在はこの成果物についての表明であり、リリースの欠落ではありません。
Kolibriの立ち位置はまた異なっており、誤読されやすいため正確に述べておく価値がある。KolibriについてもArtificial Analysisのページは存在しない——我々が確認したところ、このモデルはその比較にまったく含まれていない。存在するのはAleph Alpha自身のポストトレーニング表であり、そこではKolibriは同社のハーネス全体で英語平均75.5、ドイツ語平均70.8を記録し、前身であるKolibri Originの54.1と46.4と対比されている。これらはベンダーが実行した数値であり、ベンダーが構築した評価スイートによるもので、Intelligence Indexに換算することはできない。したがって、この見出しにある2つのモデルのうち、一方には姉妹バージョンの独立したスコアがあり、もう一方にはベンダーの表があり、比較されている当の成果物のどちらにも独立した測定はまったくない。

レコメンデーションを変える兄弟
LFM2.5 2.6B Base をそれ単体で判断するのは、Liquid AI のリリースを評価する間違った方法だ。なぜなら Base は事後学習済みの LFM2.5 2.6B を支えるために存在し、両者はセットで提供されるからだ。ファインチューニングのパイプラインを書くつもりがないなら、Base はあなたのモデルではない — 事後学習済みの兄弟のほうがあなたのモデルであり、自分でホストする場合、トークンあたり実質無料という公表価格と公開スコアを備えているのはそちらだ。
それは、KolibriがKolibri Originとの間に持つ関係と同じであり、Aleph Alphaがタイムラインを公開したのだから、この比較には価値がある。Originは2026年6月11日に306億パラメータ、アクティブ32.7億で事前学習を完了し、公開されることはなかった。Kolibriは2026年9月11日に781億で完了し、10月3日に公開された。2つのモデル、3か月、そのうち1つは社内専用だ。Liquid AIの同等の分割は両方とも公開されている。Baseと事後学習済みが並び、llama.cpp、ONNX Runtime、AppleのMLX向けの量子化ビルドがネイティブチェックポイントとともに公開されている。ファインチューニングを計画しているなら、その周辺ツールはベンチマークの1行よりも価値がある。なぜなら、自分でやらなければならない作業がどれだけあるかを決めるからだ。
要件別:何をデプロイするか
これは勝者というより、短い判断リストに要約される。
• サーバーなしでモデルを実行しなければならない場合 — スマートフォン、ノートパソコン、工場内の機器の上で — LFM2.5 2.6B Base は、2つの中で候補にすらなり得る唯一のものであり、実際に始めるならポストトレーニング済みの LFM2.5 2.6B です。Kolibri はどの量子化でもそこでは実行できません。
• ワークロードが自社の境界内で行うドイツ語または英語の文書推論であり、規制対象データの制約と棄権動作の必要性を伴う場合、LFM2.5 Base は適切な形の成果物ではなく、Kolibri はまさにそこを狙っています — ただし、80 GB のアクセラレータを 2 基用意でき、1 行で説明できるライセンス上の立場を受け入れられる場合に限ります。
• ドイツ語と英語以上が必要なら、Liquid AIのファミリーは2.6Bで16言語をカバーしており、その規模では言語カバレッジの議論は逆転する。
• 今四半期に実運用できるアシスタントが必要で、ポストトレーニングのパイプラインを回したくないなら、Kolibri はポストトレーニング済みです。LFM2.5 Base はそうではなく、LFM2.5 のポストトレーニング済みモデルは、Kolibri の安価版ではなく、Kolibri よりもずっと小規模なアシスタントです。
ワークロードが本当に中間に位置するチーム——月に数十億トークン、中程度のコンテキスト、ハードウェアを自社で所有すべき規制要件もない——にとって、どちらも最初に手を伸ばすものではありません。4B未満のモデルはセルフホストが安価で、大規模にルーティングするには扱いにくいものです。デプロイの運用コストがトークン料金を上回ることがあるからです。78Bモデルは逆の問題です。実際にルーティングされるのはその中間のティアであり、そのティアは本日OrcaRouterで利用できます。Qwen3.5 35B-A3Bは入力100万トークンあたり$0.057、出力$0.459、Qwen3.8-Flashは$0.15と$0.47で100万トークンのコンテキスト、あるいはmixture-of-expertsのGemma 4 26B-A4B ITは$0.06と$0.33です。これらはプロバイダーの定価をそのまま通したもので、トークンあたり何も上乗せされていません。フェイルオーバー付きの1つのOpenAI互換キーで、ファインチューニングプロジェクトかラックのいずれかに本格的に取り組む前に、実際のトークン量を測定したいチームにとって、これらは正直な答えです。
提供していないものについて明確にしておくと、現時点では Kolibri も LFM2.5 2.6B Base も OrcaRouter 上でルーティング可能ではありません。両方について、あらゆるベンダー名・モデル名の表記でカタログを調べましたが、どちらもそこにはありません。Kolibri はセルフホスト専用であり、LFM2.5 Base はファインチューニング用のアーティファクトで、API の背後に置かれることを想定したものではありません。

たった一行でわかる選択
Kolibriは、完成済みでライセンス供与され、文書化された780億パラメータのドイツ語・英語推論モデルであり、実行にはアクセラレータ2基を要する。LFM2.5 2.6B Baseは、未完成の26.9億パラメータ多言語出発点であり、ファインチューニングパイプラインを要し、ポケットに収まる。両者のパラメータ比は29対1で、これはこの記事で最も情報量の少ない数字だ。
