
Ember-1がKimi K3の推論を40%削減 — そして細かい但し書きこそが本題だ
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
引用される数字は40%だ。Fireworks Researchは2026年9月23日にEmber-1を公開し、Moonshot AIのKimi K3の特化型派生モデルであり、K3の精度を維持しながら、そこに到達するのに必要なトークン数をおよそ40%削減すると説明した。これは現実的で、異例なほど具体的な主張であり、それには3つのものが付随している。トークン削減の列を備えた完全なベンチマーク表、本番のコーディングトラフィックからの顧客による2件のA/Bテスト、そして一般提供ではないリリースステータスだ。Ember-1は研究プレビューとして、ベンダー自身のサーバーレスプラットフォーム上で公開されており、2週間のアクセス期間と、需要次第で恒久提供が決まるという条件が付いている。このうちどの部分が出荷済み製品で、どの部分がよく論証された研究結果なのかを見極めることが、この検討の全体だ。
何より先に片付けておく価値のある名前の衝突がもう一つあります。Ember という別のオープン研究プロジェクト(v0.1.5、Slow Lit Labs による)は、2026年をかけて長期的な一貫性評価を発表していましたが、このモデルとは一切関係ありません。Ember が同一の推論設定で Qwen3-8B を上回れなかったという話を目にしたなら、それはそのプロジェクトについてのものです。ここで扱う Ember-1 は、Fireworks Research による Kimi K3 の派生モデルです。
Ember-1とは一体何なのか
Ember-1 は新しいアーキテクチャではなく、新しいベースモデルでもない。それは Kimi K3 であり、より簡潔に推論するよう再訓練されたものである。Fireworks Research は、自社のサーバーレス訓練スタック上で 50 を超える訓練実験と 200 を超える評価を実施し、数学、コーディング、指示追従、会話、検索、ツール使用、ソフトウェアエンジニアリングにわたり、答えを変えない推論を除去することを明示的な目標とした。同ラボによれば、7 つのベンチマークと 2 つの顧客本番トラフィックセットにわたり、精度を損なわずに推論長を 35~50% 削減できる可能性があるという。これらの数値はすべてベンダー報告であり、独立に再現されていない。執筆時点で、第三者が Ember-1 の実行結果を公表した例はない。
この枠組みが重要になるのは、明白な代替手段がすでに存在していたからだ。Kimi K3には推論エフォート設定が搭載されており、より少ないトークンで済ませる安直な方法はエフォートを下げることだ。Fireworks Researchはそれを試したが、低設定では品質を犠牲にしすぎたと述べている——これは、推論モデルでエフォートレベルを調整したことがある人なら誰でも見覚えのある結果だ。Ember-1の主張は、エフォートのダイヤルは粗く、再トレーニングは細かいというものだ。

なぜ推論トークンはこれほどの労力に値するのか
推論モデルの請求額を支配するのは、その回答ではない。Fireworks Researchは、K3がユーザーに見えるものを書き出す前に、生成トークンの90%以上を内部推論に費やすことがあると指摘している。単一のリクエストでは、それは単に高コストなだけだ。マルチターンのエージェントループでは、これが複合的に増大する。なぜなら、各ターンで以前の会話が再生されるため、先行ターンの推論トレースが後続の呼び出しごとに再読込され、再課金されるからだ。Fireworks Researchは、コンテキストがターン数とともにほぼ二次関数的に増大すると説明している。これこそが今回のリリースの実際の狙いであり、主要指標が品質の飛躍ではなく約40%のトークン削減である理由でもある。
この仕組みはリスクも説明する。無駄な熟考を削る圧縮はただで済むが、モデルが必要としていたステップを削る圧縮はそうはいかない。過度に積極的な推論削減について広く報告されている失敗モードは、モデルが中間チェックを飛ばして結論に飛びつくことであり、エージェントではそれは誤った文としてではなく、ずっと後になって誤ったツール呼び出しとして現れる。Fireworks Research が同等の品質を繰り返し強調しているのは、その懸念への答えのように読める。そして A/B の数値は、それに対する証拠に最も近いものだ — ただし、テストセット、合格基準、サンプルサイズがいずれも主張している当事者によって選ばれたという、いつもの但し書き付きではある。
来歴付きのベンチマークシート
これらはFireworks Researchの数値であり、再現されたものではない。右側の列はじっくり読む価値がある部分だ。各スコアを、K3 Maxと比べてどれだけのトークンとドルを要したかと対応させている。
• Terminal Bench 2.1(n=89)— Ember-1 82.0% 対 K3 Max 80.9%、K3 High 77.6%、K3 Low 76.4%;トークン数は51.9%少なく、タスクあたり$23.10削減。
• SWE-bench Verified(n=500)— Ember-1 92.2% 対 K3 Max 93.2%、トークン数は15.5%少なく、タスクあたり$68.10削減。
• SWE-Interact(n=75)— Ember-1 20.0% 対 K3 Max 21.3%、K3 High 13.3%、K3 Low 6.7%、トークン数は32.5%少ない。
• DeepSWE 1.1(n=113) — Ember-1 75.2% 対 K3 Max 66.4%、トークン数は23.7%少なく、タスクあたり$126.90安い。
• τ-2 Bench Airline(n=50)— Ember-1 66% 対 K3 Max 64%、K3 High と Low はいずれも 64%;トークン数は 5.9% 少なく、タスクあたり $0.30 安い。
際立っている点が2つある。第一に、Ember-1はTerminal Bench 2.1とDeepSWE 1.1では完全に勝利し、SWE-bench VerifiedとSWE-Interactでは僅差で敗れている——これは、能力を失ったというよりも、どのタスクに熟考を費やすかが変わったモデルと整合するパターンだ。第二に、トークン節約量は極端に不均一である。Terminal Benchでは51.9%なのに対し、τ-2 Airlineでは5.9%だ。Ember-1が何を学んだにせよ、それは思考に対する一律40%の削減ではない。見出しの「約40%」は、おおよそ6%から約52%に及ぶ幅の平均であり、ワークロードがτ-2 Airlineに似ているチームはそれを実感できると期待すべきではない。
本番環境の A/B テストのほうが、より説得力のある証拠だ。まさにそれらがベンチマークとして作られたものではないからである。ある顧客のコーディングワークロードでは、Ember-1 は K3 の 0.751 に対して 0.753 を記録し、23.8 に対して 21.4 ステップで、49.3K に対して 29.9K の出力トークンを生成した。推論トークンは 71.3% 削減、総トークンは 39% 削減で、品質はほぼ同等だった。2 社目の顧客では、同等の品質で 1 タスクあたりのトークン数が約 35% 少なかった。また Fireworks Research によれば、まず自社の内部コーディングおよびコワーキングトラフィックで切り替えを実施し、報告されている結果では誰も気づかなかったという。これらはすべてベンダー報告として扱うべきだが、ベンダー報告の中でも最も強い形として扱うべきだ。A/B 選好とタスク完了データは、リーダーボードよりも操作しにくい。
もう一つ、DoximityのBedside Benchにおける評価がある。これは10カテゴリーにわたる医師検証済みの臨床症例500例を用いたもので、そこでFireworks Researchは、Ember-1がタスク当たりコストで新たなパレートフロンティアを打ち立てたと主張し、GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5を含むオープンおよびクローズドモデルと比較している。これはパレート上の位置に関するベンダー主張であり、単一のスコアではなく二次元のトレードオフについての主張であり、その価値は背後にあるコスト前提次第でしかない。それらの前提はKimi K3の公開API料金表に由来する。ここで、読者が今日実際に検証できる話の部分に移る。

ベースモデルは、すでにルーティングできる部分です。
Ember-1 のコストに関する主張はすべて、Kimi K3 の公表レートを基準に測られている。Kimi K3 は OrcaRouter で公開中で、100万入力トークンあたり $3.00、100万キャッシュ済み入力トークンあたり $0.30、100万出力トークンあたり $15.00、コンテキストウィンドウは 1,048,576 トークンです。これは Fireworks Research の比較で使われているのと同じ料金表であり、それらのトークン削減列の節約額が、ベンダー内部のコストモデルではなく、自分で確認できる数値に基づいて計算されていることを知っておく価値があります。
Ember-1自体はOrcaRouterには載っていません。入手できるのはベンダー自身のサーバーレスプラットフォームを通じた研究用プレビューとしてのみで、Fireworks Researchはその価格を公表していません。そのため、ベンチマーク表のドル金額は、存在するEmber-1の料金表からではなく、K3の料金とトークン数から導出されたものです。関心があるのが計算そのものであれば、正直な進め方は、今日時点でK3のルートでワークロードの価格を見積もり、トークン削減率を切り替えによって得られる可能性のあるものの上限と見なし、節約分を金額としてモデル化する前に公表された料金を待つことです。
この点でOrcaRouterが役立つのがヘッジの部分だ。2週間のアクセス期間を伴うリサーチプレビューは、本番の経路をそれに賭けることなく試してみたいモデルまさにそのものだが、別の契約を結ばずにそうする方法は、呼び出している他のすべてと同じエンドポイントの背後に置くことだ。OrcaRouterは200以上のモデルを自動フェイルオーバー付きの単一APIの背後で提供しているので、来月には利用できなくなっていると判明するプレビューモデルも、移行ではなくルーティングの変更で済む。Ember-1に関してそれが必須というわけではない——しかし、2週間の期間があるからといって、それが不要だという理由にもならない。
このリリースをどうするか
すでにKimi K3をエージェントループで動かしているなら、Ember-1の数値はあなたの請求額をそのまま表している。マルチターン・リプレイ問題は現実に存在し、長いエージェント実行では支配的なコストであり、回答を変えずに自身のトレースを短縮するモデルは、評価に時間をかける価値がある。正しいテストはベンチマーク表ではない。あなた自身のトラフィックをシャドーで実行することだ — 実際のリクエストの一部を両方のモデルに送り、出力を比較し、何も変更する前に1、2週間は本番の結果をそのままにしておく。それはこのリリースを批判的に読む読者自身も与えている助言でもあり、妥当だ。
低熟考のワークロードを実行する場合、あるいは短い単一ターン呼び出しが大部分を占めるワークロードの場合、節約分はほぼ帳消しになり、τ-2 Airline の行が現実的な期待値になる。また、本番運用レベルの確約 —— 価格、サービスレベル、6か月後もエンドポイントが存在するという保証 —— が必要なら、Ember-1 はまだそれを提供していない。これは研究プレビューであり、その恒久性は Fireworks Research が明示的に需要次第としている。今後1か月で興味深いのは、この2週間のウィンドウが恒久的な提供オプションになるかどうか、そして第三者が数値のいずれかを再現するかどうかだ。そのどちらかが起きるまでは、これは読むには強い結果だが、予算を組む土台にするには弱い結果だ。

そのどれも、この仕事を軽んじる意味に取るべきではない。推論を除きながら精度を落とさないことは、推論を加えるよりも難しい問題であり、それを自前のモデルを学習するのではなく他社のフロンティアモデルの上で行うことは、2026年の能力開発の多くが取ってきた形だ。Ember-1は、Fireworks Researchが継続シリーズになると述べているものの最初のリリースであり、そのテンプレート——すでに優れたモデルを取り、その振る舞いのある一軸を再学習させ、差分をトークンで売る——は、この特定のプレビューがどう着地するかに関係なく、注目に値する。
