
Ember-1 対 LFM2.5 2.6B Base:完成した振る舞い 対 未加工の基盤
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
Ember-1もLFM2.5 2.6B Baseも、すぐに手に取って使えるモデルではなく、しかも両者は正反対の理由で使いものにならない。Fireworks Researchが2026年9月23日に公開したEmber-1は、Moonshot AIのKimi K3に特化した派生モデルで、同ラボが約40%少ないトークンでK3の精度に到達するよう再学習したものだ。完成された振る舞いであり、ベンダー自身のサーバーレスプラットフォーム上でリサーチプレビューとしてのみ利用でき、重みも公開価格もない。Liquid AIが2026年8月4日に公開したLFM2.5 2.6B Baseは、LFM Open License v1.0の下で提供される2.69Bパラメータの事前学習済みチェックポイントで、指示チューニングは一切施されておらず、あなたの質問に答えるのではなくあなたのテキストを続けてしまう。生の基盤であり、今日ダウンロードでき、意図的に未完成のままだ。両者を並べて読むことは、効率の利得が今どこから来るのかについてなされている2つの主張を見て取る良い方法だ。
両方のモデルが答えている質問
どちらのリリースも同じ前提に立っている。モデルを大きくすることで得られる安上がりな勝利はほぼ取り尽くされ、興味深い仕事は、モデルがすでに持っているものをどう使うかに移った、という前提だ。この2つのラボは、それに異なる答えを出している。Fireworks Researchは既存のフロンティアモデルを手に取り、その振る舞いを変えた。Liquid AIは小さなモデルをゼロから作り、スケールを変えた。どちらも新しいアーキテクチャの話ではなく、どちらもリーダーボードの首位を狙っているわけではない。
Ember-1の答え:モデルは維持し、振る舞いを再学習させる
Ember-1はKimi K3のアーキテクチャには手を加えず、特定の非効率性を攻める。推論モデルは生成トークンの90%以上を内部の熟考に費やすことがあり、マルチターンのエージェントループでは、それらのトレースが再生され、後続の各ターンで再課金される。Fireworks Researchは、その結果生じるコンテキスト増大をターン数に対してほぼ二次関数的だと説明している。同研究所の主張は、K3の推論がタスクに必要な長さよりも長く、その過剰分は回答を変えずに削除できるというものだ。自社のサーバーレス学習スタック上で50以上の学習実験と200以上の評価を実施したと報告し、7つのベンチマークと2つの顧客本番トラフィックセットで精度を落とさずに推論長が35~50%減少したと述べている。これらはすべてベンダーによる報告であり、再現されていない。
結果は、見出しの数字が隠してしまう形で不均一になっている。Ember-1のトークン削減率は、Terminal Bench 2.1での51.9%からτ-2 Bench Airlineでの5.9%まで幅がある。ある顧客の本番コーディングA/Bでは、出力トークンが49.3Kから29.9Kに減少し、スコアは0.751に対して0.753を維持した——推論トークンは71.3%削減された。これは、あるワークロード形状には大きな効果があり、別のものにはほとんど見えない効果だということであり、考える量を減らすのではなく、考えすぎるのをやめるように訓練されたモデルから期待される通りのことだ。

LFM2.5 2.6B Baseの答え:スケールを変え、レシピはそのまま
LFM2.5 2.6B Baseは別の種類の賭けである。これはLiquid AIの小規模でのハイブリッドアーキテクチャだ。30層のうち22層がデュアルゲート付きショートコンボリューションブロックで、8層がグループ化クエリアテンション層であり、16言語にわたる約34兆トークンでトレーニングされ、131,072トークンのコンテキストウィンドウを持つ。チェックポイント全体は2.69Bの密なパラメータであり、コストに関する会話がトークンについてではなく、空いている単一のGPUはどれかということについてになるほど小さい。
それが異例なのは、意図的にやっていないことにある。命令チューニングが施されていない。これこそが「Base」という接尾辞の趣旨そのものだ。質問を渡せば、それに答えるのではなく、質問の文体でテキストを続けてしまう。Liquid AI自身のモデルカードは、大規模なファインチューニングを必要とするタスクにこれを使うことを推奨している。また、公開された評価も存在しない。そしてそれは見落としではない。ベースチェックポイントを命令追従ベンチマークで評価しても何も測れない。なぜなら、測定対象の振る舞いはまだ学習されていないからだ。
対比、次元ごとに1行
• 概要 — Ember-1:推論を短縮した、Kimi K3の再学習派生版。LFM2.5 2.6B Base:指示チューニングを行っていない、ゼロから事前学習されたチェックポイント。
• パラメータ — Ember-1: 非公開、Kimi K3 から継承。LFM2.5 2.6B Base: 2.69B dense。
• 重み — Ember-1:公開なし。LFM2.5 2.6B Base:LFM Open License v1.0 の下で利用可能。
• 価格 — Ember-1:公開なし。ベンチマークのドル換算には Kimi K3 の料金表を使用。LFM2.5 2.6B Base:無料ダウンロード、ハードウェアはご自身で用意。
• コンテキスト — Ember-1: プレビュー版では未公開。LFM2.5 2.6B Base: 131,072トークン。
• 公開評価 — Ember-1: 7つのベンチマークと2つのA/Bテスト、すべてベンダー実施。LFM2.5 2.6B Base: 設計上、なし。
• 最終的に得られるもの — Ember-1:K3レベルの精度でより短い推論を生成するエンドポイント。LFM2.5 2.6B Base:その振る舞いがトレーニング次第で決まる出発点。
二つの異なる種類の欠落
これら2つのリリースにおけるギャップは対称的に見えるが、実際にはそうではない。LFM2.5 2.6B Base に評価がないのは、成果物そのものの性質である。ベースチェックポイントには採点すべき挙動がなく、指示チューニングが欠けているのは不足ではなく、文書化された特徴である。この不在は商業的な不確実性を生まない。なぜなら、購入するのはライセンスが付随したファイルであり、ダウンロードが完了した瞬間に納品物は完成するからである。
Ember-1に欠けている要素は、本当に未解決のままだ。公開価格が存在しないため、コストの主張は、予算を立てる基準となる料金ではなく、Kimi K3の料金表に対する算術にすぎない。重みの公開もないため、このモデルは、ベンダーが提供を続けるという決断より長く存続することはできない。そして、アクセス期間は一時的だと説明されている。Fireworks Researchは自社の研究リリースを、恒久性がコミュニティの需要にかかっている2週間のサーバーレスウィンドウとして位置づけている。来月には存在しないかもしれないプレビューは、単に実証されていないだけのプレビューとは別物であり、発表に含まれる2件目の顧客A/B — タスクあたりのトークン数がおよそ35%少ない — は、ラボが何を期待しているかを示すものであって、11月にもまだ利用可能であることを示すものではない。
その非対称性こそが、「どちらがより準備できているか」に対する正直な答えだ。どちらも、そのまま本番環境の依存として組み込めるという意味では準備ができていない。LFM2.5 2.6B Base は素材としては完成しており、モデルとしては未完成だ。Ember-1 はモデルとしては完成しており、サービスとしては未完成だ。

今四半期、それぞれをどうするか
ファインチューニングのパイプラインがあり、クリーンなラベルの付いた狭いタスクを扱うのであれば、LFM2.5 2.6B Base は二者のうちより予測しやすい方です。チェックポイントは小さく、ライセンスは寛容で、アーキテクチャは推論時に効率的になるよう設計されており、それを有用なものに変える作業——教師ありファインチューニング、評価セット、サービングスタック——は、あなたがすでにエンドツーエンドで担っている作業です。いずれにせよ、あなたは自分で評価を実行することになります。Liquid AI が何も公開していないからです。
推論トークンが請求額の大部分を占めるホスト型エージェントのワークロードがあるなら、Ember-1はコスト方程式における実際の項に対処するものであり、2週間をかける価値がある。適切なテストは、現行システムに対するシャドウトラフィックだ。実際のリクエストの一部を両方に送り、出力を比較し、本番の結果には手を付けない。これはまた、このリリースに対する独立した批判的報道が与えた助言でもあり、同時に公正な警告も伴っていた。熟考を圧縮すると、モデルが必要としていたステップを失うリスクがあり、エージェントにおいては、それは誤った文ではなく、後になって誤ったツール呼び出しとして現れる。
どちらのモデルもOrcaRouter上にはありません。これら2つの成果物——1つのパイプラインにおける小さなファインチューニング可能なモデルと大規模なホスト型推論器——ではなく、パターンをテストしたいのであれば、まさにそれがルーティングDSLの目的です:複数のモデルを1回の呼び出しにまとめるそして、それぞれが得意な部分を処理できるようにし、その背後には1つのキーと1つの請求。ここでの比較は、両方の特定のエンドポイントが手の届かないところにあっても、アーキテクチャレベルで行う価値があります。
取引、一度述べた
Ember-1 は、振る舞いの確実性と供給の不確実性を売りにしている。品質は慎重に論じられ、可用性は明示的に条件付きであるモデルだ。LFM2.5 2.6B Base は、供給の確実性と振る舞いの不確実性を売りにしている。常に手元にあるファイルであり、その能力は、あなたがそれに施したトレーニングのみによって決まる。サービング上の問題を抱え、トレーニング能力のないチームは、プレビューを注視し、それが恒久的なものになることを願うべきだ。トレーニング能力があり、タスクが狭いチームは、ベースをダウンロードし、誰かのロードマップを待つのをやめるべきだ。

この組み合わせが本当に示しているのは、「効率」がもはや一つのことを意味しなくなったということです。Ember-1 にとっては、他人のハードウェア上で同じ品質をより少ないトークンで実現することを意味します。LFM2.5 2.6B Base にとっては、ハードウェアがもはや他人のものではなくなるほど十分に小さいモデルを意味します。どちらも優れた答えであり、互いに置き換え可能なものではありません。
