
GPT-6.1 Sol 対 Grok 4.7:この中で最も安い出力単価、そして最も高くつく会話
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Grok 4.7は、xAIによるGrok 4.6の後継モデルで、2026年9月21日に、入力100万トークンあたり$2.00、出力100万トークンあたり$6.00で登場した。GPT-6.1 Solは、OpenAIの中位モデル刷新版で、8日後の9月29日に、入力$2.00、出力$10.00で登場した。入力料金は同一で、出力料金はGrok 4.7のほうが40%安く、そしてほとんどの比較はそこで止まる。そこで止めるのは間違いだ。なぜなら、同じ独立系の評価機関が今や両モデルをエンドツーエンドで測定しており、Grok 4.7はArtificial Analysis Intelligence Indexを完了するのに約2億4,000万出力トークンを消費したのに対し、GPT-6.1 Solは6,700万だったからだ。安い方の料金に3.5倍の量を掛け合わせると、トークンあたりの価格が低いモデルの完了タスクあたりコストは$3.74となり、$0.72と対照的だ。
8日違いの2つのモデル、そして逆転する料金表
Grok 4.7はxAI最強のコーディングおよびナレッジワークモデルです。ベンダー自身の記載によると、50万トークンのコンテキストウィンドウ、1回の応答で最大45万出力トークン、テキスト・画像・ファイル入力、そして推論エフォートを以下から設定できます:low、medium(デフォルト)、high、xhigh。xAIはパラメータ数を開示しておらず、事前学習のカットオフは2026年6月と報告され、8月まで補足学習が行われています。
GPT-6.1 Solは、OpenAIによるGPT-6 Solティアのワンバンプ更新版で、GPT-6 Astraの下、GPT-6 Lunaの上に位置します。コンテキストは1,050,000トークンで、Grokのおよそ2倍です。出力上限は128,000トークンで、Grokのおよそ3分の1です。知識カットオフは2026年4月30日で、テキスト、画像、ファイル入力は同じです。その推論ラダーはlowからmaxまでで、デフォルトはmediumであり、noneはまったく受け付けなくなりました。
1次元につき1行、それぞれ両側をオン:
• 入力 — GPT-6.1 Sol は 100万トークンあたり $2.00、Grok 4.7 も 100万トークンあたり $2.00 で同一
• 出力 — GPT-6.1 Sol は 100万トークンあたり $10.00、Grok 4.7 は 100万トークンあたり $6.00。Grok が 40% 安い
• キャッシュ入力 — GPT-6.1 Sol は 100万トークンあたり $0.10、Grok 4.7 は 100万トークンあたり $0.50。Sol が 5 分の 1 の価格で、出力の行が示唆する内容とは正反対
• コンテキストウィンドウ — 1,050,000 トークン対 500,000
• 1 回の応答での最大出力 — 128,000 トークン対公称 450,000
• 長コンテキスト段階 — 入力トークンが 272,000 を超えるとリクエスト全体が再価格設定され、入力とキャッシュが 2 倍、出力が 1.5 倍になるのに対し、入力トークンが 200,000 を超えると全レートが 2 倍(これもリクエスト全体に適用)
• 推論エフォート — low、medium(デフォルト)、high、xhigh、max 対 low、medium(デフォルト)、high、xhigh
• 重みとパラメータ — 非公開、未開示 対 非公開、未開示。どちらもチェックポイントは手に入らない
• 公開されている最大エフォートでのインテリジェンス指数 — GPT-6.1 Sol は max で 51.8、Grok 4.7 は xhigh で 46.4
• インデックスタスクあたりのコスト(独自算出) — $0.72 対 $3.74
• インデックス実行時の出力トークン数 — 6,700 万 対 2 億 4,000 万、ボードの中央値は約 8,100 万
そのリストの2行が比較のすべてだ。Grok 4.7の出力レートは確かに低く、キャッシュの行は確かに5倍高い。そして、測定されるために3.5倍のトークンを生成した。料金表だけを読めば、一方の方向を示す。測定結果はもう一方を、5倍の差で示している。

Grok 4.7が実際に先行している点
この記事を圧勝として扱うのは不誠実だろう。なぜなら Grok 4.7 は実際の評価で勝っているからだ。Artificial Analysis v4.3.2 で公表されている最大エフォートで並べてスコアリングすると — Grok は xhigh、Sol は max、これは全体を通して心に留めておく価値のある設定の違いである:
• GDPval-AA v2.1 — Grok 4.7 Elo 1715.4 対 GPT-6.1 Sol Elo 1575.1。経済的に価値のある知識業務における140ポイントのEloリードであり、より安価な料金体系のモデルにとって単独の勝利としては最大のものです。
• AutomationBench-AA — Grok 4.7 0.6556 対 GPT-6.1 Sol 0.6487。実質的には引き分けで、名目上はGrokのものです。
• SciCode — Grok 4.7 0.5741 対 GPT-6.1 Sol 0.5417。科学的コーディングにおける3.2ポイントのリード。
• Terminal-Bench 4.0 — Grok 4.7 0.2576 対 GPT-6.1 Sol 0.5606。30ポイントの劣勢で、この組み合わせでは最大の差。
• Humanity's Last Exam — Grok 4.7 0.4314 対 GPT-6.1 Sol 0.5292。
• AA-LCR v1.1、長文脈推論 — Grok 4.7 0.7667 対 GPT-6.1 Sol 0.83。
• AA-Omniscience — Grok 4.7 32.0 対 GPT-6.1 Sol 41.5。
• GDP.pdf — Grok 4.7 0.20 対 GPT-6.1 Sol 0.31。
• CritPt — Grok 4.7 0.1771 対 GPT-6.1 Sol 0.3171。
9つの評価のうち3つはGrok 4.7の勝利か引き分けで、最も異論を唱えにくいものも含まれる。GDPval-AAは経済的に価値のあるプロフェッショナル業務を値付けするよう設計されており、140ポイントのEloリードはノイズではない。あなたのワークロードがGDPvalの想定する種類のもの——文書重視の分析、プロフェッショナルな成果物、正解のある判断——であるなら、料金表がより安いモデルは中立ボード上でもより優れたモデルであり、タスク当たりコストのペナルティはそのために支払う代償だ。
xAI自身のローンチ数値は大きく、すべてのベンダーのローンチ数値と同様、再現されていない。CursorBench 4.0は46.3%、xhighでGrok 4.6の40.4%に対して;Terminal-Bench 4.0は38.0%対20.3%で、リリースで主張された単一最大の向上;DeepSWE v1.1は71.0%、highで65.2%に対して;EEBenchは64.0%対53.0%。これらはxAIのハーネス、xAIの設定、xAIの報告である——そして注意すべきは、38.0%というTerminal-Bench 4.0の主張が、同じモデル、同じベンチマークにおける独立系ボードの0.2576と対比されるという点であり、これはベンダーのチューニング済み構成と中立の最大努力実行との間に予想すべき種類の不一致である。
OpenAIのGPT-6.1 Solに関する数値も同様に割り引いて受け止めるべきであり、同じ弱点を抱えている。この比較でどちらのベンダーも算出していない唯一の数値は、完了したタスクあたりのコストだ。それはスコア表ではなく、測定されたトークン消費量から計算されるからである。生き残るのはその数値だ。
なぜ2億4000万トークンが決め手となるのか
Artificial Analysisは自身の要約でGrok 4.7の冗長さについて述べており、そのインデックス実行を支えるトークン数が証拠となっている。出力トークンは2億4000万で、ボード中央値の約8100万に対して、同じスイート上の典型的なモデルが生み出す量のおよそ3倍だ。GPT-6.1 Solの6700万は中央値を大きく下回る。この2つの比率を組み合わせると——価格0.6倍で量は3.6倍——安い出力単価は請求額を小さくしているのではなく、より多くのトークンを買っているのであり、まさにタスクあたり$3.74対$0.72というコスト差が示すとおりの姿だ。
キャッシュは効果の大きさを変えるが、その方向は変えない。そして、これが人々がつまずく細部だ。Grok 4.7のキャッシュ済み入力は100万あたり$0.50で、Solの$0.10に対して5倍高い。長いエージェント履歴と繰り返されるシステムプロンプトが乗るラインではなおさらだ。したがって、大きく安定したプレフィックスの再読み込みが支配的なワークロードでは、$6対$10が示唆するよりも両モデルは近くなり、さらにGrokの冗長性が上乗せされると、入力レートが示唆するよりも差が広がる。ここではキャッシュのラインとトークンのラインが同じ方向を指しており、これは異例で、この組み合わせを料金表が示唆するよりもクリーンなものにしている。
長文コンテキスト条項は、それぞれ異なる時点で発動するため、別々に見積もる価値がある。GPT-6.1 Sol は入力トークンが272,000を超えるとリクエスト全体を再価格設定し、Grok 4.7 も200,000を超えると同様だ。250,000トークンの呼び出しでは、Grok はすでに倍額 — 4.00ドルと12.00ドル、キャッシュ読み取りは1.00ドル — となっている一方、Sol は依然として標準の2.00ドルと10.00ドルのままだ。200,000から272,000トークンの間では、料金表が安いほうのモデルのほうが大差で高くつき、この帯域は文書作業ではよくある。
Grokがスコアではなく構造において真に優位に立つのは、出力の上限だ。最大45万トークンの応答は、Solの12万8000トークンに対して、まったく別クラスの成果物である。生成されたコードベース全体、長い文字起こし、一冊の本に相当する統合を、1回の呼び出しで。今日、出力上限にぶつかっているなら、その一行が比較を決め、上記のコスト計算は一切当てはまらない——相手のモデルが持たない能力は、どんなレートであっても買うことはできない。
両方とも1つのキーにあり、それが便利な点です
Grok 4.7はOrcaRouter上でxAI自身の定価のまま提供されています。100万トークンあたり$2.00と$6.00、キャッシュ読み取りは$0.50、200,000トークンの時点で$4.00と$12.00になる段階も、xAIの記載どおりにそのまま適用されます。またGPT-6.1 Solはリリース日にOpenAIの価格で当社のルートに登場しました。$2.00と$10.00、キャッシュ入力は$0.10、272,000トークンの段階も変更ありません。どちらにも上乗せはありません。当プラットフォームはプロバイダーの定価をマークアップせずそのまま通すため、どちらかのベンダーが値下げすれば、そちらで有効になる同じ日にここでも有効です。二重請求も、間に入る再販業者もありません。

この特定のペアについては、利便性よりも価値がある。2つのモデルは得意分野について見解を異にしている — Grok 4.7 はプロフェッショナル業務の Elo と科学的コーディングで優位に立ち、GPT-6.1 Sol はターミナル実行、事実の信頼性、長コンテキスト検索で優位に立つ — そしてそれらのワークロードの境界は、ベンチマークで見えるようになるより先に、あなた自身のトラフィックの中に見えてくる。GDPval 的なリクエストを一方へ、長期的なエージェント実行をもう一方へ送り、単一のエンドポイントの背後に置き、両者にまたがる自動フェイルオーバーと、デプロイではなく設定で変更できるルーティングルールを備えることは、その境界を見つけるための評価プロジェクトよりも安価な方法だ。モデルフュージョン、つまりモデルのパネルが一緒に回答する方式は、リクエストごとに選ぶこと自体を避けたい場合にプラットフォームが提供するもう一つの選択肢だ。

その電話
• 長出力のエージェント型・ターミナル作業、キャッシュ済みプレフィックスのループ — GPT-6.1 Sol。Terminal-Bench 4.0で30ポイント、キャッシュ行は5分の1の安さ、完了したタスクあたりのコストも5分の1。
• 専門的なナレッジワーク、文書分析、判断タスク — Grok 4.7。GDPval-AA Eloで140ポイントのリードという強みによるもので、トークン費用は想定ではなく予算に組み込まれている。
• 科学的コーディング — Grok 4.7が僅差で、ベンチマークのSciCode部門において。自分のスイートで確認を。3.2ポイントは、別のプロンプトセットなら動きうる範囲内だ。
• 128,000出力トークンを超える単一応答 — Grok 4.7、そしてこれを代替できる算術は存在しない。
• 入力トークンが200,000から272,000のリクエスト — GPT-6.1 Sol。Grok 4.7はリクエスト全体をすでに倍にしてしまっているが、Solはそうではないから。
• 可能な限り最も安い会話 — この2つのどちらでもない。どちらもフロンティア価格のモデルでフロンティア級のトークン消費量を持つ。比較すべきは、どちらがあなたのタスクを完了するかであって、どちらが抽象的に安いかではない。
• 「Grokのほうがトークンあたり安い」で比較が終わるなら — それは一歩早く終わりすぎている。次の一歩はトークン数であり、それは2億4,000万対67だ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
