
GPT-6 Sol 対 Qwen3.8-Max:クローズドモデルが太刀打ちできないたった一つの分野
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ほぼすべての比較はGPT-6 SolとQwen3.8-Maxの間でコストによって決まるが、そのほぼすべてが同じ方向にコストを誤る。Qwen3.8-Max——ベンダーのホステッド・フラッグシップ——は、2026年8月3日の一般提供開始以来、入力100万トークンあたり$2.00、出力100万トークンあたり$6.00に価格設定されており、日付入りのQwen3.8-Max-0902スナップショットは9月2日に登場した。GPT-6 Solは2026年9月22日に一般提供を開始し、入力$2.00、出力$10.00だった。入力価格は同一で、Qwen3.8-Maxの料金表では出力が40%安い——そして、独立系ハーネスでは、タスクを完了するコストがおよそ5倍になる。
しかし、コスト論がずっと埋もれさせてきた、より明確な第二の違いがある。そしてそれこそが、一部のワークロードを実際に左右するものだ。Qwen3.8-Maxは動画を受け付ける。GPT-6 Solは受け付けない。これは価格の話でもベンチマークの話でもない。一方のモデルが備え、もう一方が近づくことすらできない能力であり、この対決において、どれほどトークン効率を改善しても埋められない唯一の部分なのだ。

2つのフラッグシップ、2つの異なる形
Qwen3.8-Maxは、約2.4兆パラメータのスパースなMixture-of-Expertsモデルで、クエリごとに約950億パラメータが有効になる。本番稼働中のホスト型モデルとしてはKimi K3に次ぐ第2位の規模である。コンテキストウィンドウは100万トークン、出力上限は131,072トークン。入力モダリティはテキスト、画像、動画で、low、medium、extra-highの推論エフォートに対応し、構造化出力とツール呼び出しもサポートする。ホスト版のフラッグシップはオープンウェイトではなく、同世代のダウンロード可能な成果物は、独自の制約を持つ別個のリリースである。
GPT-6 Solはテキストと画像を入力とし、テキストを出力します。そのウィンドウは1,050,000トークンで、最大入力は922,000トークン、出力上限は128,000トークン、価格は一律$2.00と$10.00、キャッシュ読み取りは$0.20、キャッシュ書き込みは$2.50で、入力トークンが272,000を超えるリクエスト全体は$4.00と$15.00に再価格設定されます。クローズドかつ単一識別子であり、OpenAIはこの料金をプロモーションではなく恒久的なものと説明しています。
ウィンドウの数値は互いに約7%以内に収まっており、出力の上限も同じ帯域にある。唯一の構造的な隔たりはモダリティのリストであり、しかもそれは一方方向にしか及ばない。
一行ずつ
• 入力 — GPT-6 Sol は100万トークンあたり$2.00、Qwen3.8-Max も100万トークンあたり$2.00。見出しの数字は同一だ
• 出力 — GPT-6 Sol は100万トークンあたり10.00ドル、Qwen3.8-Max は100万トークンあたり6.00ドル;Alibabaの料金は40%低い
• キャッシュ入力 — 暗黙的キャッシュ読み取りでは、GPT-6 Sol が100万トークンあたり $0.20、Qwen3.8-Max が100万トークンあたり $0.25 であるのに対し、明示的キャッシュ読み取りは $0.17、明示的キャッシュ書き込みは $2.50
• コンテキストウィンドウ — GPT-6 Sol 1,050,000トークン 対 Qwen3.8-Max 1,000,000トークン
• 最大出力 — GPT-6 Sol 128,000トークン 対 Qwen3.8-Max 131,072トークン
• 入力モダリティ — GPT-6 Sol はテキストと画像、Qwen3.8-Max はテキスト、画像、動画
• 長文コンテキストの処理 — GPT-6 Solは、272,000入力トークンを超えるリクエスト全体を、入力およびキャッシュ料率2倍、出力1.5倍で再価格設定する。一方、Qwen3.8-Maxはウィンドウ全体を通じて一律の料金階層であり、これはQwenの料金表がわずかに安いだけでなく構造的に優れている唯一の点である
• 推論の労力 — GPT-6 Sol のなし、低、中(デフォルト)、高、超高、最大 対 Qwen3.8-Max の低、中、極高
• 知識カットオフ — GPT-6 Sol 2026年4月20日 対 Qwen3.8-Max は単一の日付としては公開されていない
• 日付付きスナップショット — GPT-6 Sol は単一のローリング識別子であるのに対し、Qwen3.8-Max-0902 は同じ価格で2026年9月2日の固定リビジョンとして利用可能
長コンテキストの料金項目は、通常よりもっと注目に値する。GPT-6 Solの割増料金はリクエスト全体に適用される段階なので、900,000トークンのエージェント実行では、すべてのトークンに対して$4.00と$15.00が課金される。Qwen3.8-Maxはウィンドウ全体にわたって1つの料金階層を課金する。272,000トークンを超える領域で動くワークロードでは、この2つの料金表はまったく比較にならなくなる——見出し上で安いモデルのほうが、大差で高くつくモデルになり、その差の方向はコンテキストがどこにあるかによって完全に決まる。

料金表は40%安いと言っている。ハーネスは請求額が5倍だと言っている。
Artificial Analysisは、Qwen3.8-Max-0902をIntelligence Indexスコア45と測定した。完了したインデックスタスク1件あたり$5.41のコストで、実行全体で1億9,000万の出力トークンを生成した。その要約では、このモデルを「著しく遅く、非常に冗長」と表現している。GPT-6 Solは48を記録し、1タスクあたり$1.06、7,700万の出力トークンだった。
その3つのペアをまとめて読むと、対戦の輪郭が見えてくる。Qwenはインデックスで3ポイント下回り、生成したトークンは2.5倍、完了したタスク1件あたりのコストは約5倍——しかも、その出力が40%安い料金表での話だ。からくりは明白だ。出力100万トークンあたり$6.00では、1億9,000万トークンは、入力を数える前の出力だけでインデックス実行1回につき$1.14かかる。100万トークンあたり$10.00なら、Solの7,700万トークンは$0.77だ。安い単価は、請求額を小さくしているのではなく、より多くのトークンを買っているのだ。
これは9月のモデル群全体に見られる同じパターンであり、これら2つのモデルに固有の事実というより、規則として述べる価値がある。トークンあたりの料金表では、モデルが2.5倍のトークン数を出力するなら、出力40%割引には何の価値もない。完了したタスクあたりのコストだけが、唯一生き残る数字である。
アリババが公開したもの、そして工数設定の問題
アリババ自身のベンチマーク表は、この比較の中で最も長く、最も比較しにくい。ベンダー報告の数値では、Qwen3.8-MaxはPaperBenchとIFBenchで先行し、SWE-bench ProとHumanity's Last Examでは後れを取っている。また、その推論エフォート尺度——低・中・超高——は、OpenAIの6段階尺度に直接対応するものではない。超高で公表されたスコアは、中で公表されたスコアと同じ製品ではなく、どちらのベンダーも、比較チャート上の特定の数値をどちらが生み出したのかを示していない。
それが、ここでどちらか一方のベンダーの表に頼れない正直な理由だ。Alibabaの数値はAlibabaのハーネスでAlibabaのエフォート設定で実行されており、OpenAIの数値はOpenAIのもので実行されている。Artificial Analysisの数値が存在するのは、まさにそのどちらも直接対決には使えないからであり、上記ではそれらが用いられている。
再現性は実際の機能であり、その価格はゼロだ
日付入りスナップショットは、この比較の中で最も過小評価されている項目です。Qwen3.8-Max-0902 は 2026年9月2日時点で固定されたリビジョンであり、Alibaba によればベースモデルと同じ能力と価格を備えています。これを固定するということは、ある火曜日からある木曜日の間に、エンドポイントの背後にあるモデルがあなたの知らぬ間に変わることはない、ということです。
GPT-6 Solには相当するものがありません。これは単一のローリング識別子です — 同じモデルページがデフォルトのスナップショットを保持し、日付付きのバリアントはありません — つまり、9月にベンチマークしたものが11月に呼び出しているものと同じである保証はありません。ほとんどのチームにとっては問題ありません。出力を生成したものを示さなければならない規制されたパイプラインにとっては、それは実際の違いであり、Alibabaが無料で提供し、OpenAIはまったく提供していないものです。
決めるのはビデオのラインです。
ここまでの内容はすべて比較です。この部分は違います。入力に動画が含まれる場合——画面録画、検査映像、講義の収録など、情報が静止フレームではなく動きの中にあるもの——Qwen3.8-Max はそれをネイティブに受け付けますが、GPT-6 Sol にはそこへ至る道がありません。モダリティをプロンプトで回避することはできません。動画を画像に前処理して同じものを得ることもできません。時間的情報こそが要点であり、テキストベンチマーク上の指標スコアがどれほど高くても、あなたのタスクが実際に必要とする入力の代わりにはならないからです。
逆のケースもまた言及に値する。そこでは比較が一方に偏ることがなくなるからだ。入力がテキストと画像であれば、Solはタスクあたりのコストが安く、中立ボードでは4ポイント先行し、キャッシュ読み取りでも安い。動画機能はあなたに有利な決め手にはならず、単に使われていないだけだ。
2つの別々の答えがある意思決定をルーティングする

これは、適切なアーキテクチャが本当に1つではなく2つのモデルになる組み合わせであり、その理由は、分割が難易度ではなく入力モダリティによるからだ。動画を取り込んでテキストについて推論するパイプラインには両方が必要であり、ルーティング規則は判断に委ねられるものではなくリクエストの特性である。
Qwen3.8-MaxはOrcaRouterのカタログに掲載されています — 日付付きの qwen/qwen3.8-max-0902 スナップショットはルーティング可能で、パススルーモデルの下ではAlibabaの定価で、つまりAlibabaの料金変更が同日に当社側で有効になる、再販業者が再交渉した後ではなく。GPT-6 Solは本稿執筆時点で当社のカタログにはなく、OpenAI自身のAPIを通じて到達可能です。ルーティングDSLはこの特定のケースに適合する部分です:動画を含むリクエストを一方に、それ以外を他方に送るルールは、まさにそのためのものであり、自動フェイルオーバーにより、モダリティ分岐が単一障害点になることはありません。
それぞれが優位に立つところ
• 動画入力、テキスト出力 — Qwen3.8-Max、そして比較する対抗馬すらない。
• テキストと画像を入力、指標は完了したタスクあたりのコスト — 独立系ハーネスで GPT-6 Sol、およそ 5 倍。
• キャッシュ済みプレフィックスの処理 — GPT-6 Sol。そのキャッシュ読み取りはわずかに安価で、トークン量は半分未満です。
• 入力トークンが272,000を超えるリクエスト — Qwen3.8-Max。Solによるリクエスト全体の再価格設定は、この比較における単一最大のコスト差であり、表面上の料金レートには見えてきません。
• 再現可能なピン留め — Qwen3.8-Max-0902 は追加コストがかからず、2つのうち唯一の固定リビジョンです。
• SWE-bench Pro で Qwen が先行しているグラフを見せられたなら、それをどのハーネスが生成し、どのエフォート設定で出したものかを確認してください。独立系ボードでは、総合スコアで Qwen は3ポイント遅れており、ベンダーの表は互いに同じ尺度ではありません。
この記事で比較したモデル3
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
