
TwIL-LM3-Pro 対 LFM2.5 2.6B Base:一方は完成品、もう一方は出発点
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
公開されている比較で最も露わなのは、TwIL-LM3-ProとLFM2.5 2.6B Baseの間の比較について、webAI が 2.6B に対する比較をまったく公開していないという点だ。webAI の Track A と Track B の表では、その 3.66B の形式論理特化モデルを、自社の Granite ベース、VibeThinker-3B、Qwen3-8B、Qwen3.5-4B、Llama-3.2-3B、gpt-oss-120b といったさまざまな相手と戦わせており、Liquid AI の項目として選ばれているのは LFM2.5-8B-A1B であって、2.6B ではない。表に実際に登場する 2.6B は `LFM2-2.6B`、つまり前世代であり、別の事前学習実行による別モデルだ。この省略は見落としではない。LFM2.5 2.6B Base は指示チューニングされていない事前学習済みチェックポイントであり、指示追従ベンチマークはそれが受けるために作られたテストではない。
つまりこのページは、完成した成果物と原材料を比較している。Aion風の枠組み——一方のモデルにはスコアがあり、他方にはない——は当てはまるが、その理由はより具体的でより興味深い。一方は事後学習されてマージされ、他方は意図的に事後学習の手前で止まっており、それらを説明する2つの文書は意図的に異なる問いに答えている。
同じ測定ではない2つのパラメータ数
TwIL-LM3-Proは3.66Bパラメータのdenseモデルで、すべてのパラメータがトークンごとに有効です。これは`ibm-granite/granite-4.2-3b`から、LoRAファインチューニング、マルチパス蒸留、チェックポイント融合、ベースへ戻すWiSE-FTマージ、エントロピー重み付きGRPO段階を経て派生したもので、webAIが提供した成果物はマージ済みポリシーであり、LoRAアダプタではないため、単体で動作します。
LFM2.5 2.6B Baseは、30層にわたる26.9億パラメータで構成されています。22の二重ゲート付きショートコンボリューションブロックが、8つのグループ化クエリアテンション層と交互に配置されています。このコンボリューション/アテンションのハイブリッド設計はLiquidのオンデバイスアーキテクチャであり、このファミリーのスループット数値が単にパラメータ数の関数ではなく、現状の値になっている理由でもあります。34兆トークンでトレーニングされ、語彙数は128,000トークン、コンテキストウィンドウは131,072トークンです。
この2つのカウントは互いに約36%以内に収まっており、まったく異なるアーキテクチャを通じて導き出されたものなので、「3.66Bが2.69Bを上回る」もその逆も、品質に関する主張としては何の意味も持たない。webAI自身のモデルカードは、トークナイザー間でコーパスのパープレキシティを比較することを避けている点で、このことを遠回しに示している——TwIL-LM3-Proの語彙数は100,352、LFM2.5-2.6Bの語彙数は128,000であり、パープレキシティはトークン単位である。
「Base」が削除するもの、そしてそれがスコアボードを変える理由
Liquid AIはLFM2.5 2.6Bを2つの形で公開している。一般的なエージェントハーネスにおけるエージェント的ワークロード向けに調整された事後学習済みチェックポイントと、それ自身のモデルカードで「事前学習済みのテキスト専用チェックポイントであり、すべてのLFM2.5-2.6B派生モデルの作成に用いられる」と説明されているBaseだ。Baseはファインチューニングの入力であって、製品ではない。インストラクションチューニングも、まともなチャットテンプレートも、公開された評価もない。ベースモデルを指示追従タスクで評価するのは、間違ったものを測っているからだ。
TwIL-LM3-Proの立場は逆である。その価値のすべてはポストトレーニングのスタックにある。webAIの報告によれば、同社独自のハーネス上で、このパイプラインはドメイン内マクロゲートをそのベースの0.4313から0.5539へ引き上げ、一方でホールドアウトの10データセットマクロは崩壊せず横ばい(0.7942から0.7901)だった。ホールドアウトの保持こそが専門特化型ポストトレーニングの難しい部分であり、まさにBaseが答えを出せない部分である。
ここもまた、webAIの表のサイズ比較が生きてくる場面だ。TwIL-LM3-Proは、両方のホールドアウトマクロでLFM2.5-8B-A1Bを上回っていると報告されている——10データセットのセットでは0.7901対0.7884、14のセットでは0.7425対0.7378——しかもそのMoEモデルのパラメータ数の半分未満で。これは紛れもない同一条件での結果であり、まさにLFM2.5-8B-A1Bがインストラクションハーネスを通して実行できるポストトレーニング済みモデルだからこそ得られるものだ。Baseにはそれができない。だから2.6Bには列が与えられなかったのだ。
揃える価値のある寸法
• パラメータ — TwIL-LM3-Pro 3.66B dense 対 LFM2.5 2.6B Base 2.69B(30 層:22 conv + 8 GQA)。
• ポストトレーニング — LoRA SFT、蒸留、WiSE-FT マージ、およびステップ 2580 での GRPO と、なしの場合との比較。Base は設計上、事前学習の出力です。
• コンテキストウィンドウ — どちらも131,072トークン、それぞれのベースから継承。
• 語彙 — 100,352 トークン 対 128,000、これが両者のパープレキシティを比較できない理由である。
• 言語 — 英語のみ 対 17言語(アラビア語、中国語、日本語、韓国語、スペイン語、タイ語を含む)。
• 思考フォーマット — TwIL-LM3-Pro はデフォルトで `<think>` ブロックを出力し、長々と推論する(ドメイン内では平均1,902トークン、生成の24.2%が長さ上限に達する)。一方、指示フォーマットがまったくないベースチェックポイントとは対照的である。
• ライセンス — webAI Non-Commercial License ver. 1.0 対 LiquidのLFM Open License v1.0
• 何のためのものか — 形式論理の推論エンドポイントか、それともファインチューニングの出発点か。
コンテキスト行には、両モデルが添えている脚注を付すべきだ。それぞれが事前学習から131,072トークンを引き継いでおり、どちらのベンダーも長いコンテキストでの挙動を検証していない——TwIL-LM3-Proのカードには、公表されたすべてのスコアが8,192トークンのウィンドウ内で測定されたと記されている。ここで一致している数値は継承されたものであって、実証されたものではない。
ライセンス、およびそれぞれの法的な用途
TwIL-LM3-ProのwebAI非商用ライセンスは、研究および個人利用を許可し、収益を生み出す用途での導入にはwebAIとの別途契約を必要とします。LFM2.5 2.6B Baseは、Liquid独自のLFM Open License v1.0の下で提供されており、Hugging Face APIはこれを標準のSPDX識別子ではなく`license: other`として報告します — これを前提に計画を立てる前にライセンスファイルを読んでください。というのも、その条件は一般に知られたテンプレートではなくLiquid独自のものだからです。
どちらのライセンスも Apache 2.0 ではなく、「オープンウェイト」を「商用利用に寛容」の同義語として扱うのは誤りだ。両者の実務上の違いは、ライセンスが何を保護しているかにある。非商用の研究者はどちらも使えるが、製品を作っている企業はどちらも確認する必要があり、そして Base の目的そのもの——他社の製品にファインチューニングされて組み込まれること——が、その厳密な条件を一見した以上に重大なものにしている。
それぞれがスタック内のどこに属するか
The Base は、トレーニングするつもりなら正しい選択です。あなたの問題が狭いラベリングタスクであれ、ドメイン固有の分類ヘッドであれ、あるいは数千件のラベル付き例でのファインチューニングであれ、広範な多言語語彙とスループットのために設計されたハイブリッド conv アーキテクチャを備えた 2.69B の事前学習済みチェックポイントから始めることは、堅実なエンジニアリング上の判断です。そして、スキップすることになるポストトレーニングのコストは、その代わりにあなたが意図的に支払っているコストなのです。
TwIL-LM3-Pro は、学習を行う予定がなく、タスクがすでに形式論理である場合に適した選択です。含意ラベル付け、Lean 文の形式化、意味解析、証明批評は、そのパイプライン全体が狙っていたタスクであり、マージと強化学習の段階をすでに経たチェックポイントから始めれば、これを再現するのが本当に難しい部分——ドメイン内で性能を伸ばしつつ、ホールドアウト・スイートの水準を維持すること——を省けます。
誤りは、「3.66B post-trained specialist」を「2.69B base checkpoint」よりも厳密に優れていると読み取ってしまうことだ。両者は同じ生産ラインの異なる段階にある。
彼らに仕えるのか、それとも彼らの周りで仕えるのか
今日、どちらのモデルもOrcaRouterのカタログにおけるルートではありません。それぞれ理由は異なります。TwIL-LM3-Proは非商用ライセンスで、ホストされたエンドポイントはありません。LFM2.5 2.6B Baseはファインチューニング用の成果物であり、誰もそれを推論エンドポイントとして故意に提供することはないでしょう。ルーターがその真価を発揮するのは一層上、スペシャリストをとりまく作業においてです。すなわち、Baseをファインチューニングする際に使うトレーニングデータの生成とフィルタリング、形式論理モデルに与えるプロンプトの拡張、そして出力の採点です。これらはテキスト呼び出しであり、200以上のモデルに対してプロバイダーの定価で0%のマークアップを加えた、OpenAI互換の単一エンドポイントを介して実行されます。そのため、プロバイダーの値下げは当日に反映され、データ生成モデルの別のものへの切り替えは、2つ目のベンダー関係ではなく設定の編集になります。
自動フェイルオーバーは、ファインチューニングパイプラインでは通常よりも重要です、なぜなら80%で失敗するバッチジョブは実行全体を無駄にするからです。生成モデル間で1つのキーを使い、プロバイダーエラー時に再発行するフォールバックを備えることは、3つのAPI統合よりも小規模なインフラです。

どちらかは、あなたの意図によって決まります。
トレーニングするなら、Base を選んでください。形式論理について推論し、ライセンスがあなたの使用を許可しているなら、TwIL-LM3-Pro を選んでください。今日、指示追従型の小規模モデルが必要で、どちらの制約にも当てはまらないなら、LFM2.5 2.6B の事後学習済みの兄弟モデル — Liquid がまさにその目的で公開しているモデル — を使って、何はともあれ予定していたファインチューニングには Base を残しておいてください。


