生成されたタイトルカードには「Ember-1 vs Qwen3.8-Max」と表示され、サブ見出しは「トークンを倹約する派生モデル 対 フラッグシップ」。その上に2枚のカード:Ember-1 —「トークン数40%削減を主張」、「価格は非公開」;Qwen3.8-Max —「入力2ドル、出力6ドル」、「100万トークンのコンテキスト」。
Guides & Insights

Ember-1 対 Qwen3.8-Max:フラッグシップに対するトークン節約型の派生モデル

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この対決に登場する2つのモデルはどちらも、同じベンチマークで実際の数値を出している。それでも、何の決着もつかない。Ember-1は、Moonshot AIのKimi K3に対するFireworks Researchの特化派生モデルで、2026年9月23日に公開され、Terminal Bench 2.1で82.0%を報告し、ベースモデルが消費するトークンのおよそ半分で済む。Qwen3.8-MaxAlibabaの旗艦だ — 約2.4兆パラメータのスパースMixture-of-Expertsモデルで、トークンあたり約950億が活性化し、2026年8月3日から一般提供されており、同じベンチマークで86.6%を報告している。これらの数値はいずれもベンダー報告であり、両ラボとも独自のハーネスを実行しており、公開されていない2つの評価設定の間の4.6ポイント差は判決ではない。比較できるのは金額であり、そこがこの対決を面白くする。一方のモデルの主張全体は、不要なトークンにお金を払うべきではないというもので、もう一方は100万トークンあたり入力2ドル、出力6ドルという価格の旗艦だ。

各モデルの正体

Ember-1は、アーキテクチャ上のいかなる意味でも新しいモデルではない。より簡潔に推論するよう再トレーニングされたKimi K3であり、Fireworks Researchが自社のサーバーレストレーニングスタック上で、50回を超えるトレーニング実験と200回を超える評価を通じて構築した。このラボの主張は、K3の推論はタスクが必要とするよりも長く、その余分は回答を変えずに除去できるというものだ。推論の長さは、7つのベンチマークと2件の顧客本番A/Bテストにわたって、精度を損なうことなく35~50%減少した。これはベンダー自身のサーバーレスプラットフォーム上でリサーチプレビューとして利用可能で、重みは公開されておらず、価格も公開されていない。

Qwen3.8-Maxは、まったく別種の存在である。Alibabaのフロンティアティアであり、テキスト・画像・動画入力をネイティブにマルチモーダル対応し、100万トークンのコンテキストウィンドウを備え、ローンチ以降2度刷新されている。2026年9月2日にはコーディングとプロフェッショナルなオフィス業務を狙ったポストトレーニング更新が、2026年9月22日にはより高速なサービングティアが発表された。AlibabaはこれをGPT-5.5Claude Opus 4.7、Gemini 3.1 Proに対抗するものとして位置づけており、公表された評価シートはその野望を反映している——GPQA Diamond 92.6、OSWorld-Verified 86.1、SWE-bench Pro 67.7、PaperBench 93.0、IFBench 82.8、Humanity's Last Exam 43.6、いずれもベンダー報告値である。

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

レートカードを並べて表示

一方には価格があり、もう一方にはない。これが最初の実用的な非対称性だ。

• 入力 — Ember-1: 公開されているものはなし。ベンチマークシートは Kimi K3 の料金表からドルを算出します。Qwen3.8-Max: OrcaRouter では100万トークンあたり $2.00。

• 出力 — Ember-1: 公表なし。Qwen3.8-Max: 100万トークンあたり6.00ドル。

• キャッシュ済み入力 — Ember-1:該当なし。Qwen3.8-Max:キャッシュ読み取りは100万トークンあたり$0.25で、これは入力料金の8分の1にあたり、同じコンテキストを毎ターン再送信するエージェントループにおいて極めて重要です。

• コンテキストウィンドウ — Ember-1: プレビュー版では未公開。そのベースモデルは1,048,576トークンを搭載。Qwen3.8-Max: 1,000,000トークン。

• マルチモーダル対応 — Ember-1: テキスト。Qwen3.8-Max: テキスト、画像、動画を入力し、テキストを出力。

• 重み — Ember-1: なし。Qwen3.8-Max: オープンウェイトのリリースは存在するが、テキスト専用であり、提供されているエンドポイントが持つ完全なコンテキストウィンドウと視覚入力が欠けている。

• アクセス — Ember-1:リサーチプレビュー、2週間のサーバーレス提供期間、恒久提供は需要次第。Qwen3.8-Max:一般提供中で価格も設定済み。

何かをモデリングする前に、Qwen3.8-Maxの料金について1点だけ注意してください。Alibabaは、このモデルの提供パッケージをリリース以来たびたび改定しており、国際料金表が8月の公表価格と常に一致してきたわけではありません。$2.00と$6.00を、当社プラットフォームにおける現在のルート価格として扱ってください。当社プラットフォームはプロバイダーの定価をマークアップなしでそのまま反映するため、ベンダー側の変更は当日に反映されます。予算を確定する前に料金表を確認してください。

ベンチマーク比較が機能しない理由

Ember-1の82.0%とQwen3.8-Maxの86.6%はどちらもTerminal Bench 2.1であり、そのため両者は比較可能に見えるが、比較可能ではない。Ember-1のシートは、Fireworks Researchが評価したKimi K3の派生モデルに対する数値を、89サンプルで報告しており、トークンとコストの差分も付属している。Qwen3.8-Maxの数値はAlibaba自身の評価シートから来ている。異なるラボ、異なるハーネス、異なるエージェントスキャフォールドであり、しかもスキャフォールドの選択だけでスコアが数ポイント動くベンチマークでは、4.6ポイントの差は方法論のノイズフロア内にある。

Ember-1のシートから読み取れるのはトークン列であり、それはモデルが変更するように訓練された唯一のものだ。自身のベースと比較すると、Ember-1はTerminal Bench 2.1でトークン消費が51.9%少なく、SWE-Interactで32.5%少なく、DeepSWE 1.1で23.7%少なく、τ-2 Bench Airlineではわずか5.9%少ない。このばらつきこそが正直な見出しだ。熟考を削るモデルは、ベースモデルが考えすぎるベンチマークでは多大な価値があるが、そうでないベンチマークではほとんど価値がない。そして、自分のワークロードを測定しなければ、自分がどちらの種類のワークロードなのかは分からない。

完了したタスクあたりのコスト、順を追って算出

これを実際に決める計算は次のとおりです。Ember-1 には料金がないため、Ember-1 のコストの代用として Kimi K3 の公表料金を使います。Kimi K3 は入力トークン100万個あたり $3.00、キャッシュ済みが $0.30、出力が $15.00 — まさに Fireworks Research が自社の比較で用いた料金表です。Qwen3.8-Max は入力が $2.00、出力が $6.00 で、キャッシュ読み取りは $0.25 です。

入力側では、Qwen3.8-Max はすでに3分の1安い。出力側では、トークンあたり2.5倍安い。つまり、Ember-1 のトークン削減は固定された請求額と競争しているのではなく、効率化の取り組みが行われる前からトークンあたりでより安いフラッグシップと競争しているのだ。Fireworks Research 自身の本番A/Bテストでは、出力トークンが49.3Kから29.9Kに減少し、合計39%の削減となった。これを Qwen3.8-Max の出力料金に当てはめると、同じ39%の節約になるが、それは K3 の$15料金に同じ割合を適用した場合よりも絶対額の利得は小さい。

Ember-1の効率性をめぐる主張は、それ自身のベースモデルと比較して測る場合に最も強くなり、リリースが打ち出しているのはまさにその主張である。Qwen3.8-Maxとの比較では、比較の軸は1ドル当たりの能力に移る。そこでは、フラッグシップのより大きなコンテキスト、マルチモーダル入力、有償での提供が反論材料となり、そしてそれに決着をつける直接対決を公表した者は誰もいない。

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

私たち自身のルーティングデータが示すもの

ここに関与する3つのモデルのうち2つはOrcaRouter上の稼働中ルートであり、これによってベンチマーク表には決して含まれない視点が得られる。Qwen3.8-Maxは、1,000,000トークンのコンテキストで提供され、初回トークン遅延の中央値は約2.0秒、過去7日間で毎秒約52.7出力トークン、エラー率は約4.2%だ。Kimi K3 — Ember-1のベースモデルであり、Ember-1が主張するあらゆる削減効果の基準点 — は、1,048,576トークンのコンテキスト、遅延中央値は約8.0秒、毎秒約43.6出力トークン、エラー率は約0.27%で、トラフィックは実質的により多い。Ember-1自体はOrcaRouter上にはない。

その数字は判断の枠組みを変える。Kimi K3は最初のトークンまでの時間が大幅に長く、出力トークンあたりのコストはQwen3.8-Maxのおよそ2倍だが、はるかに重い負荷の下でもエラー率はずっと低い。K3をトークン節約型にした派生版はコスト差を縮めるが、レイテンシの差は埋まらない。推論を短くしても短縮されるのは生成フェーズであり、待ち行列ではないからだ。あなたのワークロードがコスト重視ではなくレイテンシ重視なら、今日においてはフラッグシップのほうが優れた選択であり、効率性の話は的外れだ。

どちらをルーティングしますか

Qwen3.8-Max は、コンテキストウィンドウ、マルチモーダル入力、公開価格、そして予算を計上できるサービスが必要なときにルーティングしてください。構造上、2つのうちより安全な選択肢です。一般提供されており、価格が設定され、エンドポイントを最新に保ってきた実績のあるベンダーによって2か月で2回更新されています。

長いエージェントループ内の推論トークンが請求額の大部分を占め、自前のハードウェアではなくホスト型モデルを利用している場合は、Ember-1 を試す価値があります。適切な検証方法は、プレビューで与えられる2週間を使い、本番トラフィックに対してシャドー実行し、リクエストあたりのトークン数ではなく、完了したタスクあたりのトークン数を測定することです。すべきでないのは、ワークロードによって6%から52%まで変動する40%という数値だけを根拠に、旗艦モデルの同等の代替としてこれを入れ替えることです。

本当の問いが「Kimi K3を動かし続けるべきかどうか」にあるのなら、それはプレビューなしで今日すぐに答えられます。Kimi K3もQwen3.8-Maxも、一つのキーの背後でOrcaRouter上にあり、プロバイダーのリスト価格のままでマークアップなし、プロバイダー間の自動フェイルオーバーも備わっています。両方で自分のワークロードのコストを比較するのは、調達プロジェクトではなくルーティングの変更にすぎません。そしてそれは、Ember-1に関するどんな効率性の主張も、ラボの数字ではなく自分の数字で測定可能にしてくれるベースラインを与えてくれます。

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

正直にまとめると、これら2つのモデルは異なる制約に合わせて最適化されている。Qwen3.8-Max は入手可能な中で最も高性能なものになるよう作られ、それに見合った価格が付けられている。一方 Ember-1 は、すでに高価なモデルの実行コストを下げるために作られている。どちらも正当な選択であり、この対決に明確な判定を下しにくいのは、派生モデルの節約効果が、フラッグシップによって実質的に大きく下回られている料金表を基準に定義されているからだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新