生成されたタイトルカード。見出しは「GPT-6 Astra Ultrafast vs MiMo v2.6 Pro Ultraspeed」、サブ見出しは「同じ手口、二つの異なる取引」、2枚のカードには「価格倍率: 6倍 vs 10倍」と「速度の主張: 8倍 vs 20倍」、フッターには「ベンダー報告の数値、2026年9月〜10月」と書かれている。
Guides & Insights

GPT-6 Astra Ultrafast 対 Xiaomi MiMo v2.6 Pro Ultraspeed:同じ作戦、二つの異なるディール

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2つのラボが同じ2週間のうちに同じ戦略を実行した。興味深いのは、彼らがそれを、顧客が何を購入しているかについて正反対の前提の上で実行したことだ。GPT-6 Astra Ultrafastは、Ultrafastサービング層を通じて販売されるベンダーのフラッグシップだ——2026年9月3日にリリースされたモデルで、この層は2026年9月29日から広く利用可能になり、NVIDIAの10月1日の投稿でBlackwell GPU上で動作すると名指しされた。Xiaomi MiMo v2.6 Pro UltraspeedはXiaomi版で、2026年9月22日にリリースされた。MiMo-V2.6-Proと同じ1.02兆パラメータのチェックポイントを、より高速に、標準料金の約10倍で提供する。

一方はフロンティアモデルを呼び出すための最速の手段だ。もう一方は現存する最も安価な高速ティアである。これらは通常の意味での競合ではない——100万トークンあたり300ドルのクローズドな旗艦モデルと、100万トークンあたり8.70ドルのオープンウェイトモデルのどちらを選ぶかなど、よほど奇妙なアプリケーションを書かなければならないだろう。この組み合わせに一ページを割く価値があるのは、どちらもモデルではなく速度ティアであるため、両者を比較すると、速度ティアが突きつける一つの問いが浮き彫りになるからだ。それは、いったい何に対してその何倍の料金を払っているのか、ということだ。

どちらのティアも同じ非物を売っている

どちらの名称もチェックポイントではない。ここはローンチ時の報道がとかく曖昧にしがちな部分であり、機械的に扱う価値がある。

• その名前が指すもの — GPT-6 Astra Ultrafast は、リクエストフィールド service_tier: "ultrafast" を設定した GPT-6 Astra です。リクエスト内のモデル ID は依然として gpt-6-astra です。Xiaomi MiMo v2.6 Pro Ultraspeed は、より高速な経路で提供される MiMo-V2.6-Pro チェックポイントであり、独自の料金項目として価格が設定されています。

• 何が変わるのか — バッチ処理、投機的デコーディング、ハードウェア割り当て、同時実行数の上限、接続処理。重みとあなたのHTTPリクエストの間にあって、重みの内部には何もないものすべてです。

• 変わらないもの — それは答えです。同じ設定の同じチェックポイントは、異なるレートでも同じコンテンツを生成するはずです。同一の入力に対して同じモデルの2つのレーンが食い違うなら、それは報告すべき欠陥であり、あなたが購入した能力ではありません。

• この比較でそれが重要な理由 — どちらのティアも自社の標準プランに対するベンチマーク改善を謳っていないため、購入の判断はすべて、節約できる秒数に対するトークンあたりの価格という一点に集約される。つまり、この2つの契約は評価ではなく算数によって決まるということだ。

ただし、この構図には一つの非対称性がある。それはティアの違いではない。XiaomiのUltraSpeedはオープンライセンスのモデル上に成り立っている——Xiaomi自身のモデルカードによれば、MiMo-V2.6のウェイトはMITライセンスを有し、このファミリーはそのRLトレーニング環境とともにリリースされた。OpenAIのUltrafastは、APIを通じてしか到達できないクローズドなフラッグシップ上に成り立っている。オープンウェイトに対して速度倍率を支払うのは可逆的な決定だ。チェックポイントはいつでも自分でホストできる。クローズドなフラッグシップに対して同じことをするのは、可逆的ではない。

A screenshot of the XiaomiMiMo/MiMo-V2.6-Pro-RL model card on Hugging Face, showing 64 likes, the TextGeneration, Transformers, Safetensors, English, Chinese, conversational, custom_code, 8-bit precision and fp8 tags, an MIT licence tag, a Safetensors model size of 524B params and the model card's opening description of MiMo-V2.6-Pro-RL as the flagship checkpoint of the MiMo-V2.6 series, covering native omnimodal input and 1M-token context.

2つの価格倍率と、それらが買うもの

ここが、このペアが対称でなくなるポイントだ。両側の数字が異常にきれいなのは、各ベンダーが絶対額ではなく倍数で値付けしたためである。

• GPT-6 Astra Ultrafast — 標準ティアの$10.00と$50.00に対して、入力トークン100万個あたり$60.00、キャッシュ済み入力$6.00、キャッシュ書き込み$75.00、出力$300.00。すべての列で一律6.00xです。入力トークン272,000を超えると$120.00と$450.00に段階的に上がります。標準ティアはOpenAIの定価で当社のカタログに公開されており、フラッグシップに到達する最も安価な方法です。

• Xiaomi MiMo v2.6 Pro Ultraspeed — 100万トークンあたり入力$4.35、出力$8.70(標準のProレーンは$0.44と$0.87)。これは入力で約9.9倍、出力ではちょうど10倍です。

• それらの倍率にまつわる速度の主張 — OpenAIとNVIDIAはいずれも、Astra Ultrafastのトークン生成速度をAstra標準モード比で「最大8倍」と上限設定している。Xiaomi自身の資料では、標準Proサービス比で最大20倍の出力速度を主張しているが、同じモデルについて同日に記載された第三者のカタログでは約10倍とされている。これら二つの数値を整合させる測定結果は公表されていない。

• 倍率と速度の比率 — OpenAIの6倍の価格は公称上限8倍をもたらすので、このティアの価格は下回っている。誰の数字を信じるかによるが、Xiaomiの10倍の価格は公称上限10倍から20倍をもたらすので、ベンダーの上限ではこの取引は有利であり、低い方の数字ではまったくのトントンである。

それが両者を比べる上で意思決定に最も直結する唯一の違いだが、その差は見出しの価格が示唆するほど大きくはない。各ベンダーの公称値で削減レイテンシー1単位あたりに見ると、Astra Ultrafast は2つの契約のうちより優れている。処理トークン1単位あたりでは、Xiaomi UltraSpeed は Ultrafast の料金に対して入力で約14倍安く、出力で約34倍安く、Astraの標準レーンより2倍から6倍安い——ただしそれは別のモデルであり、かなり性能の低いモデルでもあり、それが実際にあなたが行っているトレードオフだ。Xiaomi自身のこのファミリーのモデルカードは、独立した総合スコアではなく、アーキテクチャと学習に関する事実を公開しており、OpenAIのフラッグシップが測定されている指標からの値は、それについてはまったく公表されていない。

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes on the 10% regional-processing uplift and on GPT-5.6 Sol's promotional pricing running at least through November 21, 2026.

2社のベンダーが開示することを選んだ内容

スピードティアは性能テストというよりも開示テストである。なぜなら、その主張を検証するために必要なもの——明示された同時実行数におけるレイテンシ分布——は、完全にベンダーの手中にあるからだ。

NVIDIAの10月1日の投稿は、Astraティアの背後にある最も具体的な公開声明であり、そこで示されているのは測定値ではなく帰属情報だ。Blackwell GPU、OpenAI APIおよび対象となるChatGPT WorkとCodexユーザーへの提供、そしてそのループを説明する2人のOpenAIエンジニアである。OpenAIの推論責任者であるPhilippe Tilletは、Astraは「その知識を、NVIDIAハードウェアを魅力的にする高性能カーネルへと変える」ことができると述べている。OpenAIのコンピュート担当最高技術責任者であるUday Ruddarrajuは、「私たちは自社の内部モデルを使ってNVIDIA GPU上の推論を最適化した」と述べている。どちらの文にも、このティアのスループット数値は付いていない。8xは単独で存在し、「最大」以外の限定は付いていない。

Xiaomi の開示は逆方向へ進んだ——強化学習環境とコードを含むトレーニングの経済性を公表し、そのモデルカードにはサービングに関する事実ではなくアーキテクチャに関する事実が載っている。UltraSpeed ティア自体は 20x という主張を伴い、公開されたレイテンシ曲線はなかった。つまり、スピードティアが答えるために存在する問いについては、両ベンダーとも等しく役に立たず、そこでの引き分けが正直な発見である。

本当にどうしても必要な場合に選ぶこと

この2つのティアはそれほど重なっていないので、どちらが勝ちかを選ぶというよりは、自分の購入がその2つのうちどちらなのかを見極めることが肝心だ。

エージェント的な作業で、モデルの選択がすでに決まっているなら、Astra Ultrafast を選びましょう。40,000出力トークンのジョブは $2.00 から $12.00 になり、フロンティアモデル品質をより高速に得る唯一の方法はこのティアです。OpenAI 自身のドキュメントは運用上の前提条件を明示しており、WebSockets を「特に、多数のツール呼び出しを素早く連続して行うエージェント的アプリケーションに」推奨し、「永続接続がなければ、ネットワークオーバーヘッドがレイテンシ改善を減少させ得る」と警告しています。このティアをオンにしても、その下でリクエストごとの HTTP のままにしておけば、速度向上のほんの一部のために6倍の料金を支払うことになります。組み込む前に知っておく価値があるのは、このティアは米国データレジデンシーとグローバル処理のみをサポートし、EU やその他の非米国地域の処理エンドポイントはなく、本来ならより多くの枠が適用されるアカウントでも、初期レート制限は低く設定されて開始されたという点です。

自分でホストできるパイプラインにとってモデルがコモディティ的な入力であるなら、MiMo v2.6 Pro Ultraspeedを選べ。MITライセンスのおかげで、標準のProレーンだけが唯一のフォールバックではない——セルフホスティングという選択肢がある。$4.35と$8.70なら十分に安く、より高速なティアはタスクごとに正当化するのではなく、投機的に有効化するだけの価値がある。また、その100万トークンのコンテキストはフラッグシップと同等だ。ただし、自分が何を買っているのかは理解しておこう。フロンティアに後れを取るモデルに対しておよそ10倍の料金を払うということで、これは大量抽出には正しいトレードオフであり、回答品質がワークフローを左右するような用途には誤ったトレードオフだ。

どちらの高速ティアもOrcaRouter上にはなく、これは暗にほのめかすのではなく明言する価値がある。OrcaRouter上にあるのはopenai/gpt-6-astraだ — 標準ティアのフラッグシップで、100万トークンあたり$10.00と$50.00、長コンテキスト時は$20.00と$75.00、コンテキスト長1,050,000トークン、最大出力128,000トークン、OpenAI互換エンドポイント経由となる。Xiaomiのモデルはここには一切ホストされていないため、MiMo-V2.6-ProとそのUltraSpeedレーンはXiaomi自身のAPIといくつかのサードパーティプラットフォームを通じてしか利用できない。この比較における200以上のモデルを擁するエンドポイントの実用的な用途は、高速ティアへのアクセスではない。高価なレーンがその何倍もの価格に見合う働きをしているかを知りたいとき、同じクレデンシャルと同じキーを使い、次のリクエストで同じプロンプトをより安価なモデルに送って確かめられる、ということだ。それが利用可能な中で最も安価な実験であり、この問いに答えてくれる唯一の手段だ — なぜなら、測定せずに答えを出せるようなレイテンシ曲線を公開したベンダーは一つもないからだ。

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

正直な読解

両社はこの3週間でレイテンシに関する料金表を出したが、どちらも測定値を出していない。この対称性こそがこの話の本質であり、実務上の帰結がある。今日あなたが行動の根拠にできる数字は価格だけであり、それは異例なほど情報量が多い。なぜなら両社とも、あつらえの数字ではなくきれいな倍数で値付けしたからだ。

OpenAIの高速ティアは自社の標準料金の6倍の費用がかかり、上限は8だと主張している。Xiaomiのそれは自社の標準料金の10倍で、上限は10から20の間だと主張している——どちらの数字を信じるかによる。ベンダー自身の数字を算術として読むと、両者はほぼ互角だ。OpenAIのティアは、価格1単位あたり1.33単位の速度に相当する主張上の上限が得られる計算になり、同じ勘定ではXiaomiのティアは1.0から2.0の間になる。そして両方が正当化できるのは、この2つのティアが、互いの選択肢を真剣に検討することなど決してない異なる買い手層に売られているからだ。また、価格はどちらの取引でも今日監査可能な唯一の部分でもある。料金表は公表された事実であり、レイテンシーの主張はそうではないからだ。