「GPT-6.1 Sol vs Qwen3.8-Max」というタイトルの生成ヒーローカード。角丸のパネルが2つ並び、左は「GPT-6.1 Sol」で「OpenAI - 2026年9月29日リリース」「100万トークンあたり入力$2.00/出力$10.00」「タスクあたり$0.72」「AA Index 51.8」を列挙。右は「Qwen3.8-Max」で「Alibaba - 2026年8月3日リリース」「100万トークンあたり入力$2.00/出力$6.00」「タスクあたり$5.41」「AA Index 45.4」を列挙。その下に「同じ入力価格。請求額は7.5倍。」というストリップ。フッターは「数値: Artificial Analysis v4.3.2.」、右下にOrcaRouterのロゴ。
Guides & Insights

GPT-6.1 Sol 対 Qwen3.8-Max:価格表ではなく、請求書

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

夜間のリポジトリメンテナンスジョブを1つ取り上げ、1か月間毎晩1回実行し、そこにGPT-6.1 SolとQwen3.8-Maxを順番に投入してみよう。Artificial Analysisのv4.3.2のタスク別数値では、GPT-6.1 Solはその30夜で21.72ドル、Qwen3.8-Maxは162.27ドルかかる。つまり月140.55ドル、年およそ1,690ドルの差であり、しかもそのジョブのトークンあたりの価格表は、入力2.00ドル・出力10.00ドル対入力2.00ドル・出力6.00ドルとなっている。100万トークンあたりの料金は入力では互いに誤差の範囲内で、中国製モデルは出力で40%安い。それでも請求額は7.5倍異なる。ベンダーがGPT-6.1 Solをリリースしたのは2026年9月29日で、Qwen3.8-Maxは2026年8月3日から稼働している。

その差は価格設定のトリックでもなければ、ベンチマークの産物でもない。この比較が語り得るすべてがそこにあり、それはどの料金表にも載っていない一つの数字から生じている。

各モデルの説明

GPT-6.1 SolはOpenAIの現在の推論・コーディング向けフラッグシップであり、それが取って代わるGPT-6 Solの1週間後に、同じ$2.00 / $10.00の定価、$0.10のキャッシュ入力レート、1,050,000トークンのコンテキストウィンドウで登場した。エージェント作業向けに販売されており、当社のモデルカードにあるbest-forタグにはreasoning、coding、agenticと記載され、最上位ティアの品質スコアを備えている。

Qwen3.8-MaxはAlibabaのエージェント向けフラッグシップだ——クローズドなAPI専用モデルで、テキスト、画像、動画を入力として受け取り、100万トークンのコンテキストを保持する。より小型のQwenシリーズと異なり、このモデルは重みを公開していない。Artificial Analysisでは、インテリジェンス指数45.42で147モデル中17位、コーディング指数76.2は同分野で9位に位置する。弱いモデルではない。ただ、考えさせるには高くつくモデルなのだ。

料金表に載っていない番号

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysisは、Qwen3.8-Maxについてタスクあたり107,730個の出力トークンを記録しており、そのうち70,830個が推論トークンです。GPT-6.1 Solは38,128個の出力トークンを生成し、そのうち25,190個が推論トークンです。この中国モデルは、同じ質問に答えるために2.8倍のトークンを書き込み、しかもトークンあたり40%少ないコストでそれらを書いています。

• タスクあたりの出力トークン数 — 38,128 対 107,730、Qwen は 2.8 倍多く出力

• うち推論 — 25,190 対 70,830

• タスクあたりのコスト — $0.724 対 $5.409、Qwenは7.5倍のコストがかかる

• タスクあたりの所要時間 — 640秒 対 2,152秒;約11分 対 約36

• 最初の回答トークンまでの時間 — 332.0秒 対 55.1秒

• インテリジェンス指数 — 51.83 対 45.42

• コンテキストウィンドウ — 1,050,000 対 1,000,000 トークン

• 受け付ける入力 — テキスト、画像、ファイル 対 テキスト、画像、動画

掛け算をすれば、割引は消えてしまう。40%低い単価で3倍近いトークンを出力するモデルは、安くはならない——出力だけで約1.7倍のコストがかかり、入力、キャッシュ読み取り、そして有益な回答の長さを考慮に入れたタスクあたりの実測値では、真の倍率は7.5になる。

第四行と第五行に注目してください。この二つは逆方向を指しており、合わせることでQwen3.8-Maxとは何かが説明されます。GPT-6.1 Solが5分半かかるところを、これは55秒で最初のトークンを返し、続いてOpenAIのモデルなら11分で終わるタスクの完了に36分を費やします。つまり、すぐに話し始め、とてつもなく長く考えるモデルです。ストリーミングで回答が返るチャットインターフェースなら、それは応答性の良さとして映ります。無人で走らせる夜間ジョブなら、それは料金を支払っている実時間でもあります。

Qwen3.8-Maxが本当に一歩先を行く3つの点

インデックスの差はスイート全体で6.4ポイントであり、これはまるで一律であるかのように引用されがちな類の数値だ。しかし実際はそうではなく、その不一致こそが示唆に富む:

• GPQA Diamond — Qwen3.8-Max 0.9283 対 GPT-6.1 Sol は今回の実行では未公開

• GDPval — 1,671.4 vs 1,575.09

• Terminal-Bench 2.1 — 0.8876 対 今回の実行では未公開

• AutomationBench — 0.5619 対 0.6487

• SciCode — 今回の実行では未公開、GPT-6.1 Sol は 0.5417

• CritPT — 0.1771 対 0.3171

Qwen3.8-Maxは、大学院レベルの科学問題と職業タスクのサンプルで勝利している。これは同世代のモデルとしては実際に意味のある結果であり、そのコーディング指数が138中9位に位置する理由でもある。より難度の高い研究隣接の評価では敗れている——CritPTでは14ポイント差——そしてAutomationBenchでは8.7ポイント差で敗れており、これは無人でのコンピュータ作業に最も近い評価だ。その2つのうち、どちらが自分のワークロードにとってより重要だと考えるかが、実際の判断である。6.4ポイントという見出しの数字は、意見の相違を平均したものであって、判定ではない。

追加トークンがもたらすもの、もたらさないもの

長い推論トレースは、定義上、無駄ではない。難しいタスクに70,830トークンの熟考を費やすモデルは、短いモデルが飛ばしている何かを行っているのであり、Qwen3.8-Maxが優位に立つ評価では、その熟考が理由である可能性が高い。失敗モードは、難しいタスクだけでなく、あらゆるタスクでその代償を払うことだ。推論トークン数は、質問の難易度ではなく、モデルのキャリブレーションの特性であり、一行の抽出を考えすぎるモデルは、その分をあなたに請求してくる。

自分のタスクのどれがどれなのかを見極める方法は、モデルの選択をグローバルなものとして扱うのをやめることです。そこで、設定変更の部分に話が移ります。

GPT-6.1 Solに関する当社独自のモデルカードには、対象の提供数値が記載されています。すなわち、$2.00 / $10.00の料金、1,050,000トークンのコンテキストウィンドウ、最初のトークンまでのp50が4.54秒、そしてアプリケーションが実際にルーティングの際に参照する価格設定と同じページに保存されたArtificial Analysisインデックスブロックです。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

一つのキー、一つのメーター、二つのモデル

両方のモデルは単一のOrcaRouterエンドポイントから利用できます——200以上のモデルに対応する1つのAPIで、プロバイダーの定価が0%のマークアップでそのまま適用されます。Qwen3.8-MaxのOrcaRouterカードには、提供レートが、1,000,000トークンのコンテキストウィンドウ、テキスト/画像/動画の入力モダリティ、7日間で1億1,014万トークンというボリュームと並んで記載されています——アプリケーションがルーティングの判断に用いる数字が、記事が論じている数字の隣に置かれているのです。このパススルーは特にQwen3.8-Maxにとって重要です。なぜなら、その経済性が出力トークンのボリュームに支配されているモデルは、ベンダーがいつでも価格を改定できるモデルであり、パススルーのメーターがあれば、その変更はリセラーの都合ではなく、Alibabaが公表したその日にあなたの請求書へと届くからです。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

ここでルーティング層のより興味深い使い方はルーティング DSL であり、アプリケーション全体でひとつのモデルを選ぶのではなく、複数のモデルをひとつの呼び出しに組み合わせることができます。夜間ジョブを分割しましょう。安価なモデルが分類と抽出を行い、GPT-6.1 Sol が推論と検証のステップを担い、Qwen3.8-Max は、その長い熟考と GPQA クラスの科学的能力が実際に答えを変えるタスクのために取っておきます。残りは自動フェイルオーバーがカバーします——実行中にプロバイダーが劣化した場合、リクエストはバッチ全体を失敗させるのではなく、移動します。

これらのどちらも、モデルを選ぶ理由にはならない。それらがあるからこそ、一度選んだらそれに縛られて生きていかなくてよいのだ。

その判断、そして注目すべき点

7.5倍のコストは、熟考がそれに見合う場合にのみ払うべきだ。汎用的な夜間ジョブでは、1タスクあたり0.724ドルのGPT-6.1 Solが擁護できるデフォルトであり、年間1,690ドルは現実の数字だ。タスクが検証可能な答えを伴うハードサイエンスや職業的推論である場合、GPQA DiamondでのQwen3.8-Maxの0.9283はトークンに見合う価値がある——それが同モデルがより得意とする具体的な点だ。

注目すべきは、Alibabaが価格を改定するかどうかだ。$2.00/$6.00の2.8×トークンモデルは、トークンこそが希少なものであるかのように価格付けされている。だがモデル自身の挙動がトークンを潤沢にする。出力レートが大きく動けば、本記事の計算もそれに連動して動き、パススルー・メーターがそれが起きたその日にそれを示してくれる。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新