生成されたヒーロータイトルカード。見出しは「GPT-6 Luna vs Grok 4.6」、サブタイトルは「価格は20倍、そして20万トークンでの崖」、フッターは「価格はOpenAIとxAIによるもの、指数値はArtificial Analysisによるもの」、OrcaRouterのロゴは右下に合成されている。
Guides & Insights

GPT-6 Luna 対 Grok 4.6:価格差は20倍、そして本当の違いはウィンドウだ

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

同じページに並べればGPT-6 LunaGrok 4.6、最初の比較はおのずと見えてくる。Luna の価格は入力100万トークンあたり $0.10、出力100万トークンあたり $0.50。Grok 4.6 は $2.00 と $6.00 で、キャッシュ読み取りは $0.50。入力で20倍、出力で12倍、そしてベンダーのモデルではキャッシュ入力料金が50倍高い。これが表示価格であり、表示価格の上では答えは僅差ではない。

この記事の残りを書く価値があるのは、この2つのモデルが価格よりも構造的な何かについて見解を異にしているからだ。Grok 4.6は50万トークンのコンテキストウィンドウを備え、プロンプトが20万トークンを超えるとリクエスト全体の価格を再計算する。GPT-6 Lunaは105万トークンを備え、27万2000で再価格設定する。どちらのしきい値も限界料率ではなく崖であり、片方を超えると、線を超えた部分だけではなく、リクエスト全体が高い方の数値で請求される。この2つの崖がどこにあるか、そしてそれぞれの誤った側にある長文コンテキストのワークロードに何が起こるかが、この比較では20倍という見出しの数字よりも多くのことを決める。

2つのモデル、大きく異なる2つの姿勢

Grok 4.6は、2026年8月12日リリースのxAIのモデルであり、汎用フロンティアモデルだ。テキスト入力、テキスト出力、500,000トークンのウィンドウ、独立系ボードで高エフォート時に公表されたタスクあたりコスト$1.86、実測で毎秒57.7出力トークンの速度を備えている。多くのことを得意とし、ベンダーが素早くリリースしているため、チームが採用するタイプのモデルである。

GPT-6 Lunaは正反対の姿勢だ。OpenAIは2026年9月22日に、GPT-6ファミリーのボリューム層として、$2.00/$10.00のGPT-6 Solの下、そして$10.00/$50.00のフラッグシップGPT-6 Astraの下に位置する形でリリースした。テキストと画像を入力し、テキストを出力、1,050,000トークンのウィンドウで最大入力922,000トークン、出力上限128,000トークン、推論ラダーはnoneからlow、medium、high、xhigh、maxまであり、デフォルトはmedium。誰もその広さゆえに採用するモデルではない。ワークロードの下に置くモデルである。

正直に言えば、問うべきは「どちらが優れているか」ではない。「あなたの持つ仕事の形に合わせて価格がつけられているのはどちらか」であり、その二つの形は本当に別物なのです。

カードを1行ずつ

1次元につき1行、それぞれ両側をオン:

• 入力 1Mあたり — GPT-6 Luna $0.10 対 Grok 4.6 $2.00

• 出力 100万トークンあたり — GPT-6 Luna $0.50 対 Grok 4.6 $6.00

• 100万あたりのキャッシュ入力 — GPT-6 Luna $0.01 対 Grok 4.6 $0.50、自身の入力料金の10分の1 対 xAIの4分の1

• 長コンテキスト閾値 — GPT-6 Luna 272,000入力トークン 対 Grok 4.6 200,000プロンプトトークン

• 長文コンテキスト料金 — GPT-6 Luna はリクエスト全体を $0.20 入力、$0.75 出力、$0.02 キャッシュに再価格設定するのに対し、Grok 4.6 はリクエスト全体を $4.00 入力、$12.00 出力、$1.00 キャッシュに再価格設定する

• コンテキストウィンドウ — GPT-6 Luna 1,050,000トークン 対 Grok 4.6 500,000トークン

• 最大出力 — GPT-6 Luna 128,000トークン 対 Grok 4.6:カード上に別個の上限として公開されていない

• インテリジェンス指数、独立系 — GPT-6 Luna 37(最大エフォート時)対 Grok 4.6 44(高エフォート時)、指数リビジョン v4.3.2 にて

• デフォルトエフォートスコア — GPT-6 Luna はデフォルトのmediumで29、Grok 4.6はmediumで43。これはボードでも測定されています

• Indexタスクあたりのコスト、独立 — 高エフォート時でGPT-6 Luna約$0.07に対しGrok 4.6は$1.86

インデックス実行時の出力トークン数 — GPT-6 Luna 150M 対 Grok 4.6 94M、ボード中央値88Mに対して

• 出力速度、独立 — GPT-6 Luna 153.9トークン/秒 対 Grok 4.6 57.7トークン/秒(高負荷時)

• 初回トークンまでの時間、単独 — Grok 4.6 は38.63秒、エンドツーエンドは47.31秒;GPT-6 Luna は、ユーザーが待てる時間で初回トークンを返す

• サイバー能力、独立系 — Grok 4.6 は同ボードのサイバー評価で57点を獲得。比較可能な GPT-6 Luna の数値は公表されていない

• OrcaRouterについて — GPT-6 Lunaは当社のカタログにありませんが、Grok 4.6はxAIの定価でルーティング可能です

Generated two-column scoreboard titled 'GPT-6 Luna vs Grok 4.6 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, Long-context threshold 272,000, Context 1,050,000, AA Index 37 at max effort, Cost per index task $0.07. Right column Grok 4.6 rows: Price in/out $2.00 / $6.00, Cached input $0.50, Long-context threshold 200,000, Context 500,000, AA Index 44 at high effort, Cost per index task $1.86. Footer: 'Prices per OpenAI and xAI; index figures per Artificial Analysis.'

20万対27万2千、それが議論のすべてだ

2つのウィンドウの隣にある2つのしきい値を読むと、比較はひとりでに再編成される。

Grok 4.6の崖は、500,000トークンのウィンドウ内の200,000トークン地点、つまり40%の位置にある。GPT-6 Lunaのそれは1,050,000のうち272,000、つまり26%の地点だ。つまり、より安価なモデルは価格の切り替わりが始まるのが遅いだけでなく、しきい値を超えてからウィンドウが尽きるまでの余裕が2倍以上あるということだ。

具体的には、45万トークンのリクエストは両方のモデルに収まる。GPT-6 Luna では、ロングコンテキスト階層の $0.20 と $0.75 で課金される。Grok 4.6 では $4.00 と $12.00 で課金される。これは同じプロンプトに対して、入力で20倍、出力で16倍だ。しかも、それは Grok 4.6 が処理できるリクエストなので、この選択は理論上のものではなく現実のものだ。

逆のケースこそが人々の意表を突く。190,000トークンのリクエストはどちらのしきい値も下回り、両方で標準料金が適用される。$0.10/$0.50 対 $2.00/$6.00 で、ちょうど20倍と12倍だ。210,000トークンのリクエストはGrok 4.6のラインを上回り、GPT-6 Lunaのラインを下回る。Grok 4.6では$4.00/$12.00、Lunaでは$0.10/$0.50で請求され、40倍と24倍の差が、プロンプト長の20,000トークン差だけで生じる。どちらのモデルにも変更はない。

それは Grok 4.6 を避ける理由ではない。プロンプトが実際どこに着地するのかを知る理由である。なぜなら、平均 180,000 トークンで 220,000 まで急増するワークロードは、2 つの異なる料金表を支払っており、それが最初に起きた月には請求エラーに見えるだろうからだ。

独立取締役会で価格差がもたらすもの

Grok 4.6は高エフォートでArtificial Analysis Intelligence Indexにおいて44を記録する。GPT-6 Lunaは最大エフォートで37を記録する。7点差。だがその複合指標では、1点は再実行時のノイズの範囲内にすぎず、さらに完了タスクあたりのコストでは両モデルに約26倍の差がある。1.86ドル対約0.07ドルだ。

その一対の数値については、分けて考える価値のある二つの点がある。

最初の点はエフォートのデフォルトです。GPT-6 Lunaの37は最大エフォートの数値であり、そのデフォルトはmediumで、そこでは29を記録します。Grok 4.6の44は高エフォートの数値であり、ボードはmediumでも測定しており、そこでは43を記録します。したがって、デフォルト設定での条件を揃えた比較は29対43、つまり14ポイントであり、7ポイントではありません。そして、14ポイントのバージョンこそが、両方を展開して何も変更しないチームが実際に経験するものです。Grok 4.6は高からmediumに移行すると1ポイント失います。GPT-6 Lunaは8ポイント失います。エフォートダイヤルは、高価なモデルにかかるコストよりも、安価なモデルにはるかに大きなコストを課します。そして、その非対称性は主要な指数値では見えません。

第二は冗長性であり、ここでは方向性が価格比の示唆するものとは逆になっている。GPT-6 Lunaはインデックスを完了するのに1億5000万出力トークンを生成した。Grok 4.6は9400万だった。出力トークンあたりのコストが12分の1のモデルが、より低いスコアに到達するために60%多いトークンを費やした。出力価格ベースのカードでは、それがタスクあたりコストの26倍の差と、より小さな差との違いであり、定価だけに基づく比較が低価格帯に有利に働きすぎる理由でもある。

Grok 4.6も同じボードでサイバー能力スコア57を公表している。比較可能なGPT-6 Lunaの数値は存在しないため、その次元は片側しかない——だが、これはあなたのワークロードがセキュリティツールに関わる場合に重要になる種類の指標であり、より安価なモデルにそれが欠けていることは、仮定で埋めるべき空白ではなく情報である。

レイテンシー、ここでは二つが近くなく、同じ方向でもない

Grok 4.6の独立したレイテンシ数値は、高エフォート時に最初のトークンまで38.63秒、エンドツーエンドで47.31秒です。それは、話す前に本格的な推論を行うモデルの数値であり、カーソルを眺めている人間と両立するものではありません。当社のモデルに関する独自のリストでは、7日間のウィンドウで、最初のトークンまでの時間のp50が6.71秒、p95が10.00秒と記録されています。これは応答内の異なる時点を測定しており、独立した数値とは比較できません — この2つの数値は矛盾しているのではなく、異なる問いに答えているのです。

GPT-6 Lunaは毎秒153.9出力トークンで動作し、最初のトークンを返す速さはインタラクティブな画面の背後に収まるほどです。高エフォート時のスループットはGrok 4.6の約3倍です。バッチジョブにとって、この差は実時間が短くなるという程度の利便性にすぎません。しかしユーザーが待っているものにとっては、製品とプロトタイプを分ける差になります。

この組み合わせは異例で、率直に名付ける価値がある。安いモデルが速い方で、高いモデルが遅い方であり、高いモデルは同等の計算量で総合スコアが7ポイント上回っている。これは、一度じっくり考えるために作られたモデルと、何度も素早く答えるために作られたモデルの特徴だ。ワークロードがタスクあたり1回の呼び出しなら、Grok 4.6のレイテンシは許容できる。タスクあたり1000回の呼び出しなら、そうではない。

xAI側で実際にあなたが買っているものとは何か

Grok 4.6は、完了したタスク1件あたりのコストがGPT-6 Lunaのおよそ26倍で、同じ努力量ではインデックスが7ポイント上回っている。汎用のワークロードにとっては割の悪い交換レートであり、特定の種類の作業にとっては妥当な交換レートだ。

それを正当化する理由は3つある。サイバースコア57は、GPT-6 Lunaが対応するものを公表していない能力だ。Lunaの1億5000万に対して9400万トークンのインデックス実行は、出力がパーサーではなく人間に消費されるあらゆるタスクにおいて、実質的な簡潔さの優位性である。そして、このモデルは8月12日から本番稼働しており、GPT-6 Lunaが存在してきた期間より6週間長い——これはベンチマークではないが、実績ではあり、すでにそれに向けて構築してきたチームにとって、離れる際の移行コストは、離れることの代償の一部である。

それに対して、GPT-6 Lunaの主張の要は、主に20倍という料金にあるのではない。それは、100万トークンのウィンドウ内にある272,000トークンの閾値、推論を完全に停止するよう指示できる能力、100万トークンあたり1セントのキャッシュ入力料金、そしてエンドポイントではなくコンポーネントとして使えるようにするスループット値である。これらは低価格帯の構造的特性であり、反対側の指標上の優位がどれほど大きくても、それらを置き換えることはできない。

それらのうち1つ、または両方を実行する

Grok 4.6はxAIの定価でOrcaRouter上にあります、パススルー価格設定のもとでは、ベンダーの料金改定はリセラーが再交渉するのを待つことなく、その日のうちに当社側に反映されます。自動フェイルオーバーは、このモデルに限って言えば、その価値を十分に発揮する部分です。500,000トークンのウィンドウに200,000トークンの崖があるというのは、リクエストが時折その境界線の反対側に落ちてしまうようなワークロードであり、デプロイなしでアップストリーム間を移動するルートは、1トークンあたりの1セントの何分の一よりも価値があります。

GPT-6 Lunaは本稿執筆時点で当社のカタログにはなく、OpenAI自身のAPIを通じて利用できます。したがって、両方を求めるチームは、Grok 4.6用のキー1つと、すでにOpenAI用に使用しているキーを併用することになります。この組み合わせに適合するのはルーティングDSLです: トークン閾値を超えるプロンプトを、その閾値をクリアするモデルへ送り、それ未満のものは12分の1の価格のモデルへ送るというルールは、アプリケーション内の分岐ではなく設定として表現できます — これは、閾値がこれら2つのように一般的なプロンプトサイズに近い場合に重要です。

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

どちらを、そしていつ

ワークロードが大量で、プログラムが消費するもので、短いなら、GPT-6 Luna を選ぼう。分類、抽出、ルーティング、大量要約、エージェントの内側ループ。$0.10/$0.50、キャッシュ読み取りは1セントで、同じエフォートで7インデックスポイントのために完了タスクあたり26倍のコストがかかるモデルと比べれば、計算は接戦とはほど遠い。effort パラメータは明示的に設定すること — デフォルトは medium で、見出しの 37 は最大エフォート時の数値 — そして長い呼び出しは 272,000 トークン未満に抑えること。

サイバー能力が必要なら、出力を人間が読み、その簡潔さに対価を払う価値があるなら、あるいはGPT-6 Lunaが対応できるものの、その長さでの振る舞いを最初に知るチームにはなりたくない30万~50万トークンのワークロードがあるなら、Grok 4.6を選べ。20万トークンの崖は明示的に予算に組み込み、高エフォート設定で対話型インターフェースの背後に置いてはいけない——最初のトークンまで38秒というのはレイテンシの数字ではなく、そのモデルが何のためにあるかについての表明だ。

この比較が招く誤りは、20倍のレートを意思決定そのものとして扱ってしまうことだ。それは、あるワークロード形状にとっては意思決定である。もう一方にとっては、意思決定は200,000トークンと272,000トークンの時点でなされ、価格比は後から読む細部にすぎない。

Screenshot of the OrcaRouter model page for Grok 4.6 showing the xAI vendor label, list pricing of $2.00 input and $6.00 output per 1M tokens, a 500,000-token context window, recorded latency statistics, an uptime chart, and the provider routing section.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新