
GPT-6対Qwen 3.8 Max:片方は動画を扱い、片方はより長く書く
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
GPT-6 SolとQwen3.8 Maxは同じ入力料金、100万トークンあたり2.00ドルを課金し、その後、価格表だけでは見えてこない2つの軸で分かれる。Qwen3.8 Maxは、2026年8月3日から一般提供でホストされており、2つのうち動画を受け付ける唯一のモデルだ。その入力モダリティはテキスト、画像、動画であり、GPT-6 Solはテキスト、画像、ファイルを受け付ける。GPT-6 Solは、ベンダーが2026年9月22日に出荷したもので、2つのうち公開された出力上限(128,000トークン)を持つ唯一のモデルであり、背後にコンシューマー向けの接点を持つ唯一のモデルでもある——10月7日のChatGPT展開によって、このモデルは週間12億人以上のユーザーの前に登場した。
つまり、振り分けの判断基準はどちらがより強力かということではない。あなたの入力が動画かどうか、そして出力が長いかどうかだ。
ビデオが最初の分岐点です
多くのモデル比較は価格とベンチマークに帰着しますが、今回の比較には構造上の決定的な違いがあり、それによって価格やベンチマークは二次的なものになります。あなたのパイプラインが動画を取り込む場合——監視映像、録画された会議、スポーツや講義の素材、製品デモのリール——Qwen3.8 Max はそのクリップをリクエスト内に取り込めます。同モデルのカードには入力モダリティとしてテキストや画像と並んで動画が記載されており、最大100万トークンのウィンドウに対応しています。これは動画の場合、別個の抽出ステージではなく、フレームサンプリングと文字起こしを1回の呼び出しで行えることを意味します。GPT-6 Sol にはそれができません。同モデルのモダリティはテキスト、画像、ファイルであり、カードに動画入力はなく、どれほどプロンプトエンジニアリングを重ねてもそれを代替することはできません。
そのたった一行が動画パイプラインの候補リストを決めるが、それは料金表には表れない。2つのモデルが真に相互に置き換え可能なのはテキストと画像の作業であり、以下に示す価格とベンチマークの比較が当てはまるのも、まさにそこだ。
動画に関する主張について、正直にひとつ注記しておきます。モダリティは文書化されていますが、スキーマはそうではありません。どちらのベンダーのカタログ記載にも、解像度、フレームレート、クリップ長の制限は明記されていません。つまり「動画をサポート」とは、その入力タイプが存在するという意味であり、特定のクリップがあなたの必要な品質で取り込まれるという意味ではありません。それを前提に構築する前に、自分の映像でテストしてください。
出力側は逆方向に動作します
要求を逆にすると、優位性は反転する。GPT-6 Solは1レスポンスあたり最大128,000トークンの最大出力を公表している。Qwen3.8 Maxのカードはコンテキストウィンドウを公表しているが、最大出力の数値は公表していない。そのため、厳格な出力上限に対して予算を組むシステムは、ベンダーのデータからそれを読み取ることができない——これはいくつかのホスティングプラットフォームのカードにも見られる欠落であり、無制限とみなすのではなく不明として扱う価値がある。
公表されているのは出力側の価格であり、それは動画とは逆である。Qwen3.8 Max は100万出力トークンあたり6.00ドル、GPT-6 Sol は10.00ドルで、このモデルが書き出すすべてのトークンで40%割引になる。出力負荷の高いワークロード、つまり長文生成や構造化データのシリアライズでは、Qwen3.8 Max の方が単位あたり実質的に安く、入力価格が同一であってもそれは変わりない。
また、Qwen3.8 Maxのカードには単一の入力料金のみが記載されており、長文コンテキスト向けの料金区分は文書化されていない。一方、GPT-6 Solは、入力トークンが272,000を超えるリクエスト全体を、入力$4.00、出力$15.00に再価格設定する。OpenAIのモデルページにはこのルールが明記されている。つまり、このしきい値を超えるプロンプトは、リクエスト全体に対して入力料金とキャッシュ料金が2倍、出力が1.5倍で課金される。272,000トークンを超えるプロンプトでは、GPT-6 Solの実効入力料金は2倍の$4.00になる一方、Qwen3.8 Maxは$2.00のままである。ここでも、見かけ上は同等だった入力料金の関係が逆転する。
独立した取締役会が述べていること
Artificial Analysisは両方のモデルを掲載しており、総合指標ではGPT-6 Solが先行している一方、個別のテストではいくつか逆の結果が出ている。以下の数値はすべて評価者によるもので、ベンダーによるものではない。
• インテリジェンス指数:GPT-6 Sol 47.6、Qwen3.8 Max 45.4 — GPT-6 Solが約2ポイント先行
• コーディング指数:Qwen3.8 Max 76.2でトップ10入り。GPT-6 Solのコーディングプロファイルは同程度だが、Qwenのエントリーの方がより強い順位を持つ
• GPQA Diamond:Qwen3.8 Max 92.8%、同じテストファミリーではGPT-6 Solの数値の方が高い
• Humanity's Last Exam:Qwen3.8 Max 43.1%、GPT-6 Sol 47.9%
• 長コンテキスト想起:Qwen3.8 Max 80.3%、GPT-6 Sol 83.7%
• SciCode:Qwen3.8 Max 52.1%、GPT-6 Sol 57.6%
• エージェント型ツール使用:Qwen3.8 Maxはterminal-bench v2.1で88.8%、tau-bankingで47.8%と、どちらも強力
パターンは、GPT-6 Solが一般的な推論の複合指標と科学・記憶テストで勝利する一方、Qwen3.8 Maxがより鋭いコーディングおよびツール使用モデルであるということです。2つの注意点が当てはまり、それらは飾りではありません。第一に、これらの指数値は異なる日付に評価されたため、リビジョン間の2ポイントは再実行が生み出す変動の範囲内であり、確定した差ではありません。第二に、Qwen3.8 Maxの公開数値は、Alibabaのエンドポイントで提供されるモデルに対する評価者の実行結果であり、ベンダーは2026年9月2日に日付付きスナップショット Qwen3.8 Max (0902) を同じ $2.00 / $6.00 の料金で提供しました — スナップショットを固定する場合は、スコアを引用する前にどちらを呼び出しているかを確認してください。

OpenAIの10月7日のロールアウトが加えるもの
ChatGPTのリリースは能力の事実というより配布の事実だが、読者が「GPT-6」という言葉で意味するものを変える。2026年10月7日、OpenAIはGPT-6をIntelligent UI機能のもとでChatGPTに展開し始めた。まずChatタブがPlus、Pro、Business、Enterpriseに到達し、FreeとGoは10月8日からそれに続いた。エンタープライズでの利用可否は職場の管理者設定に依存する。WorkとCodexを支えるモデルは変更されなかった。
この比較では2つの点が重要だ。ChatGPTの体験は、有料のコンシューマー向けティアではGPT-6 Solによって提供されている——つまり、10億人以上が出会うGPT-6は、API経由で呼び出すのと同じモデルであり、別個のチェックポイントではない。そしてGPT-6は単一のモデルではなくファミリーだ。GPT-6 AstraはSolの上位に位置し、価格は$10.00 / $50.00、GPT-6 Lunaは下位に位置し、$0.10 / $0.50だ。比較でどのティアかを明示せずに「GPT-6」をQwen3.8 Maxと対置する場合、通常はデフォルトでSolと比較しており、最強の主張をしたいときはAstraと比較している。ティアを明記することが、公正な比較と修辞的な比較の分かれ目だ。
コストは、料率ではなく形状に基づいて測定される
入力料金は並んでおり、出力料金は分かれているため、どちらが勝者になるかは入力トークン数と出力トークン数の比率に完全に左右される。各ベンダーの公表料金に基づいて計算した場合(キャッシュを除く):
・動画と文字起こしの分析(入力500K、出力6K):Qwen3.8 Max ≈ $1.04、GPT-6 Sol は該当なし — 動画入力なし
・文書分析(入力250K、出力5K):Qwen3.8 Max ≈ $0.53、GPT-6 Sol は272のしきい値までは ≈ $0.55、リクエスト全体が再価格設定されるとさらに高くなる
・長文生成(入力40K、出力80K):Qwen3.8 Max ≈ $0.56、GPT-6 Sol ≈ $0.88
・バランスの取れたエージェントループ(入力60K、出力20K):Qwen3.8 Max ≈ $0.24、GPT-6 Sol ≈ $0.32
結果の構図は安定している。同じトークン構成であれば、Qwen3.8 Max のほうが安価なモデルだ。入力単価は並んでおり、出力単価はより低いからである。GPT-6 Sol の反論は価格の話ではまったくない。それは推論の総合評価、コンシューマー向けサーフェスでの検証、そして予算策定を容易にする文書化された出力上限である。
カードには書かれていないので、触れておく価値のある運用上の注意点が一つある。10月の最初の1週間にOrcaRouterのプレイグラウンドで計測したところ、Qwen3.8 Maxルートのファーストトークン遅延の中央値は約5,809ms、出力は毎秒およそ50トークンで、エラー率は低かった。同じ期間のGPT-6 Solルートはスループットは速かったが、エラー率はかなり高かった。これらは共有ルートにおける観測結果であってベンダーのSLAではなく、週ごとに変動する——だからこそ、どちらのモデルのカードを信じるのではなく、自分のトラフィックを計測すべきだという論拠になるのだ。
両方を1つのキーで実行する
動画制作を一方に、推論負荷の高い作業をもう一方に抱えるチームにとって現実的な答えは、どちらのモデルも完全に勝ることはなく、両方がスタックに属するというものです。まさにそれがゲートウェイの役割です。OrcaRouter では qwen/qwen3.8-max と GPT-6 Sol の両方が、1 つの OpenAI 互換 API の背後にある同じカタログ内のライブルートであり、プロバイダーの定価でマークアップ 0% — そのため Alibaba や OpenAI の価格改定は、次回の請求書照合時ではなく当日に反映されます。また、ベンダーごとに別々の認証情報セットや SDK パスはありません。
ここでは2つの機能が特定の役割を果たします。自動フェイルオーバーは、あるプロバイダーのルートが劣化したときにパイプラインを稼働させ続けます同じ計測ウィンドウ内でこれら2つのルートがどれほど異なる挙動を示したかを踏まえると、これはきわめて重要です。そしてルーティングDSLを使えばリクエストに判断を委ねられます:動画入力を伴うものはすべてQwen3.8 Maxに送り、長いコンテキストの推論作業はGPT-6 Solに送りトラフィックが変化したときに手作業で変更しなければならないハードコードされたモデルIDの代わりに、入力モダリティとリクエストサイズに関する述語に選択を任せられます。

手短に言えば、入力に動画が含まれるなら、2つの中でそれを受け取れるのは Qwen3.8 Max だけであり、リクエストが決まっていればどのトークン構成でも安価なモデルだ。あなたの仕事がテキストと画像の推論で、長く上限のある出力と、検証済みのコンシューマーグレードの既定値を必要とするなら、GPT-6 Sol は総合指標でより強い札であり、文書化された出力上限を持つ方だ。両方が必要な場合はルーティングし、ルーティングキーはリリースサイクルではなくリクエストのモダリティにしよう。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
