
Qwen 3.8 vs GPT-5.6:両方に価格が付いた今、勝つのはどちらか?
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
アリババが2026年7月19日に上海でQwen3.8-Maxをプレビューしたとき、コミュニティは即座に反応しました。この2.4兆パラメータのモデルは「GPT-5.6より先を行き、Fable 5にわずかに及ばない」とされていました。OpenAIのGPT-5.6は旗艦構成のSolにおいて、独立系のArtificial Analysis Intelligence IndexでFable 5に1ポイント及ばず第2位に位置しています。そのため、公表された数値を何も伴わない大きな主張でした。
それ以来、2つのことが変わった。Qwen3.8-Maxは2026年8月3日に一般提供が開始され、実際の料金表と実際のベンチマーク表を伴って登場した。そして7月31日、OpenAIはGPT-5.6ファミリー全体の価格を引き下げた——Terraは$2 / $12に、Lunaは$0.20 / $1.20に、Solはプレミアム層のまま変更なし。したがって、この対戦はもはやリーダーボードに対する主張ではなく、実際に比較できる、価格設定され文書化された2つのモデルなのだ。
開発者へのメモ — このような主張を検証する最速の方法は、両方を自分のプロンプトで実行することです。OrcaRouterは200以上のモデルを1つのOpenAI互換エンドポイントの背後で提供しているため、2つのSDKを接続することなく、同じタスクでQwen 3.8 MaxとGPT-5.6を競わせることができます。
TL;DR の結論。GA時点のQwen3.8-Maxは攻撃的な価格設定 —$2 / $6 per 1M、1Mトークンでフラット — これは GPT-5.6 Terra と同じ入力価格でありながら、Terra の出力コストの半額、Sol よりはるかに低価格です。同社が自己申告する数値も強力です(GPQA Diamond 92.6、Terminal-Bench 2.1 86.6)。しかし、GPT-5.6 Sol は本番運用を左右する2つの点で依然として勝っています。すなわち、それは監査済みの2位(Artificial Analysis Intelligence Index(約59))であり、そしてそれは高速 — Cerebras ハードウェア上で毎秒最大750トークン。Qwen3.8-Max はどの独立評価者からもスコアを得ていません。したがって、Qwen はワンショット品質で GPT-5.6 に匹敵する可能性が高く、出力価格では Terra を明らかに上回りますが、GPT-5.6 は第三者による検証とスループットで勝っています。そしてそのスループットが、しばしば全てを決します。
重要なポイント
• Qwen3.8-Maxは2026年8月3日よりGAで、公開価格は$2 / $6(100万トークンあたり、100万トークンの全コンテキストにわたって一律)です。
• GPT-5.6 Terra と比較すると(OpenAI の7月31日の値下げ後は $2 / $12)、Qwen は入力料金が同等で、出力料金は半額です。 Sol と比較すると、Qwen は大幅に安価です。
• GPT-5.6 Sol は #2 として監査されており、これは AA Intelligence Index(約59)に基づくものであり、Artificial Analysis は、それが最も難しいSTEM問題でリードしていると指摘しています。Qwen3.8-Max はまだスコア未取得です(AA と LMArena によって)。
• 速度が最も際立つ違いです。GPT-5.6はCerebras上で最大毎秒750トークンに達します。Qwenはプレビュー版の実地テストでは最も遅いモデルでしたが、これはGA提供前の所見であり、再テストが必要です。
• Qwenのベンダーテーブルは信頼できるが査読を経ていない: GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1、FrontierSWE 73.5(前身モデルの40.7から上昇)。
• オープン性が両者を永久に分かつ: Qwenは今週中にオープンウェイトを約束し、さらに約17GB VRAMのQwen3.8-27Bも提供する。GPT-5.6はクローズドでAPI専用である。
精度に関する注記: Qwen3.8-Max の品質数値はすべて Alibaba が報告したものであり、第三者による検証は行われていません。GPT-5.6 の数値は Artificial Analysis によるもので、OpenAI 自身の報告とは異なる場合があります。GPT-5.6 ファミリーの料金は、OpenAI の 2026 年 7 月 31 日時点の値下げを反映しています。Qwen の料金は GA レートカードに基づいており、7 月のプレビュー割引に優先します。
スペックと価格、並べて比較
これが確かなデータです。各数値はその出典が明記されています。
• メーカー / ステータス — Qwen3.8-Max: Alibaba; GA(2026年8月3日); GPT-5.6 Sol: OpenAI; クローズドフラッグシップ(Sol / Terra / Luna の各バリアント)
• アーキテクチャ — Qwen3.8-Max: 合計約2.4T、スパースMoE(アクティブパラメータ数は未公表のまま);GPT-5.6 Sol: 非公開;アーキテクチャは非開示
• コンテキストウィンドウ — Qwen3.8-Max: 1Mトークン(思考時は983,616、最大出力は131,072);GPT-5.6 Sol: 長コンテキスト向けフラッグシップ
• AA Intelligence Index — Qwen3.8-Max:未スコア;GPT-5.6 Sol:~59 — #2(Artificial Analysis)
• 検証済みの強み — Qwen3.8-Max: 第三者によるものはなし。GPT-5.6 Sol: 最難関のSTEM問題をリード (Artificial Analysis)
• ベンダー報告の強み — Qwen3.8-Max: GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1(Alibaba報告);GPT-5.6 Sol: 該当なし
• 速度 — Qwen3.8-Max: p50 TTFT 1.64s(OrcaRouter 7日間テレメトリー);プレビューのハンズオンテストでは最も遅いモデル;GPT-5.6 Sol: Cerebrasで最大750 tok/s(Artificial Analysis)
• 料金(入力 / 出力)— Qwen3.8-Max: $2.00 / $6.00100万トークンあたり、フラット;キャッシュ入力 $0.25;GPT-5.6: Terra $2 / $12、Luna $0.20 / $1.20、Sol プレミアム(Fable の AA あたりコストの約 1/3)
• オープンウェイト — Qwen3.8-Max: 今週中に提供予定(ライセンスは未定);GPT-5.6: なし — クローズド / API限定
この比較を形作るものは二つあり、その両方が7月以降に新たに生じたものである。
まず、価格をめぐる話は、単に安いというだけではなく、実に興味深いものになった。7月の時点では、Qwenの優位性は予算に組み込めないほどの割引だった。今や比較は具体的になり、ティアごとに結果が分かれる。Terra($2 / $12)と比較すると、Qwenは入力レートを完全に一致させ、出力レートを半分にする——これは、出力が支出の大半を占める推論中心の作業では真の利点だ。Luna($0.20 / $1.20)と比較すると、Qwenは10倍高く、大量の単純タスクにはLunaの方が適している。Solと比較すると、Qwenの方がはるかに安い。つまり「どちらが安いか」の答えは、どのGPT-5.6を指すかによって3つに分かれる——率直に言えば、OpenAIの7月31日の値下げでその差はかなり縮まった。
第二に、速度面は依然として両者の差が最も大きく開く点であり、OpenAIに有利なままである。Artificial Analysisによると、GPT-5.6 SolはCerebras製シリコン上で毎秒最大750トークンを処理する。AlibabaのGA資料には、Qwen3.8-Maxがそのようなスループット向けに設計されていることを示すものは何もない。プレビュー期に「使った中で最も遅いモデル」と評したレビュアーが測定していたのは、まさにスループットが累積する長時間のエージェント実行だった。ワークロードがインタラクティブ、エージェント型、または高ボリュームであれば、品質の議論に至る前に、その差が勝負を決めかねない。

証明:GAベンチマーク表が解決することと解決しないこと
AlibabaがGAで数値を公開する決定は、プレビュー版に比べて大きな改善だ。プレビュー版では、コミュニティの「GPT-5.6を上回る」という主張は、公開された何ものにも基づいていなかった。その表は強力だ:GPQA Diamond 92.6は大学院レベルの科学において、PaperBench 93.0は研究結果の再現において、Terminal-Bench 2.1 86.6は実シェルの操作において、OSWorld-Verified 86.1はデスクトップGUIの操作において。世代間のコーディングの飛躍が際立っている — FrontierSWE 73.5は前モデルの40.7に対して、そしてDeepSWE 1.1 56.6は21.6に対してである。
この表がGPT-5.6の比較を決着させるものではないのには、2つの理由がある。
第一は来歴(provenance)です。すべての数値は、Alibabaが独自のハーネスで生成したものです。ベンダーの表はサンプリングではなく選抜されたものです——つまり、あるラボは自社が好成績に見えるベンチマークのみを公表し、残りは省略します。対照的に、OpenAIの#2 Intelligence Indexランキングは、結果に利害関係を持たない評価者によって付与されました。特筆すべきことに、Artificial AnalysisはGPT-5.6 Solが最も難しいSTEM問題をリードしていると明示的に評価しています。これはまさに、QwenのGPQA Diamond 92.6が主張する領域です。そして、これらの主張のうち一つは検証済みです。
第二に、Alibaba自身の最も弱いスコアが雄弁に物語っている。IFBench 82.8——制約下での指示追従——は同表の中で最低スコアであり、プレビュー時代に一貫して見られた批判と正確に一致する。すなわち、このモデルは過剰に出力し、範囲を逸脱し、誰も求めていないものを付け加える。それはデモでは魅力的だが、出力が100万トークンあたり6ドルで課金され、正確な形式が必要な場合には高くつく。下流のステップが出力を解析するエージェント型パイプラインでは、指示追従の規律はGPQAの1ポイントよりも重要である。
アンカーとして:前世代のQwen3.7-Maxがスコアしたのは46で、AA Intelligence Index上ではGPT-5.6 Solの約59に対するものである。一世代で13ポイント差を詰めるのは、並外れた飛躍だろう。可能性はある—アリババ自身のFrontierSWEがほぼ倍増していることは実際の進歩を示唆している—しかし、審判が数値を投稿するまで、「GPT-5.6を上回る」というのは結果ではなく、未証明の主張に留まる。

実際のコスト: 各ティアにわたる具体例
文書分析や多段階計画に典型的な形として、1回の呼び出しにつき10万トークンのコンテキストを送信し、1万トークンの出力を生成する推論エージェントを考えてみましょう。
• Qwen3.8-Max: 0.1M × $2 = $0.20、プラス 0.01M × $6 = $0.06。 ≈ $0.26 / コール。
• GPT-5.6 Terra:0.1M × $2 = $0.20、プラス0.01M × $12 = $0.12。1コールあたり≈ $0.32。
• GPT-5.6 Luna: 0.1M × $0.20 = $0.02、プラス0.01M × $1.20 = $0.012。≈ 1コールあたり$0.03。
• 1日あたり5,000コールの場合: Qwen ≈ $1,300、Terra ≈ $1,600、Luna ≈ $160。
学べる教訓は二つある。Terraに対しては、Qwenの節約効果は確かにあるが控えめで、この形状では約19%であり、QwenがFable 5やSolのようなプレミアムモデルに対して享受する桁違いの優位性には遠く及ばない。OpenAIが構造的に割高だと考えていた人は、考えを改めるべきだ。7月31日の値下げが、ミッドティアにおけるQwenの価格優位性を中和する作業のほとんどを既に成し遂げていたからだ。
Qwen が大きく差をつけるのは、長いコンテキストとキャッシングです。$2/$6 のレートは 1M トークンのウィンドウ全体でフラットなので、90万トークンのプロンプトは短いプロンプトと同じトークン単価になり、多くの競合他社は長い入力を割増しています。そして、キャッシュ済み入力は$0.25 per 1Mで、繰り返しコンテキストのワークロードでは入力側を8分の1に削減します。上記の呼び出しは、コンテキストがキャッシュされると、$0.26 から約 $0.09 に下がります。エージェントが毎ターンほぼ安定したコンテキストを読み直すなら、持続的な優位性はそこにあります—表面的なレートではありません。
開放性と27Bの兄弟モデル
GPT-5.6は決してセルフホスト可能にはならないだろう。Qwen3.8-Maxは可能性がある——Alibabaは重みが今週中に公開されると述べている——しかし、フラッグシップは現実的な目標ではない。4ビット量子化で約1.2TB、H200あたり約141GBと比較すると、8基以上の最高級アクセラレータが必要となり、さらにアクティブパラメータ数がまだ非公開であるため、それによって得られるスループットをモデル化することすらできない。また、ライセンス文書もまだ存在しないため、商用利用の可否は正式には未確定のままである。
同時に発表されたQwen3.8-27Bは、Qwenに対する関心が生の能力よりも制御にある人にとって、より重要なリリースです。また、オープンウェイトでもあり、伝えられるところでは約17GBのVRAM——これはハイエンドなコンシューマーカード1枚分に相当し——、2.4Tフラッグシップでは決してあり得ない形での真のオンプレミスオプションです。データレジデンシーが必要でQwenとGPT-5.6を比較検討しているなら、評価すべきモデルは27Bです。
よくある質問
Qwen 3.8はGPT-5.6より優れていますか?
存在するエビデンスに基づけば、そうは言えない。AlibabaのGAテーブルは強力だが(GPQA Diamond 92.6、Terminal-Bench 2.1 86.6)、完全に自己申告であり、独立した評価機関がこのモデルを採点したことはない。GPT-5.6 Solは監査済みのインテリジェンス指数で第2位(約59)を獲得し、Artificial Analysisによると最難関のSTEM問題でトップ、さらに最大750トークン/秒で動作する。証明力と速度の点でGPT-5.6が勝る。
「Qwen 3.8はGPT-5.6より進んでいる」という主張は本当ですか?
それはコミュニティの評判として始まり、今もなお未検証のままです。GAではAlibaba自身のベンチマーク表が示されたものの、第三者によるスコアはありません — Artificial AnalysisとLMArenaは未評価のままです。前モデルのQwen3.7-MaxはSolの約59に対して46を記録したため、その主張が文字通り成り立つには非常に大きな一世代分の飛躍が必要です。
Qwen 3.8 と GPT-5.6 では、どちらが安いですか?
ティアによって異なりますが、OpenAIが値下げした7月31日に答えは変わりました。Qwen3.8-Maxは1Mあたり$2/$6です。GPT-5.6 Terraは$2/$12 — 入力は同じで出力が2倍なので、そこではQwenが勝ります。Lunaは$0.20/$1.20で、Qwenより約10倍安いです。Solはプレミアムなので、QwenはSolよりはるかに安いです。
どちらが速いですか?
GPT-5.6は、スループットにおいて決定的に優れている。Artificial Analysisは、Cerebrasハードウェア上で毎秒最大750トークンを報告している。Qwen3.8-Maxは、OrcaRouterの7日間のテレメトリーにおいて、p50のtime-to-first-tokenが1.64秒であることを示している。しかし、プレビュー時代のレビュアーは、長いエージェント構築において非常に遅いと感じていた——その発見はGAサービングより前のものであり、再テストに値する。
I don't have specific information about a model called "Qwen 3.8 Max" or its preview status. I'd recommend checking the official Qwen blog or documentation for the latest updates on model releases and availability.
はい、2026年8月3日です。現在は公開された料金表と、OpenAIおよびDashScope互換のエンドポイントがあります。そのため、90%割引というQoderクレジットキャンペーンの7月時点の枠組みは、もはや販売方法を説明するものではありません。
OpenAIの料金を回避するために、Qwen 3.8をセルフホストできますか?
現実的には、これはフラッグシップではありません。ウェイトは今週中に公開される予定ですが、ライセンスは未公開です。4ビット量子化で約1.2TBのサイズになるため、H200クラスのGPUが8台以上必要になります。同時に発表されたQwen3.8-27Bは、VRAM約17GBと報告されており、こちらが現実的な選択肢です。
今日はどちらを使うべきですか?
GPT-5.6 Solは、遅延に敏感な処理、インタラクティブな用途、または監査済みの品質が重要な推論重視のタスクに最適です。Lunaは、高ボリュームの単純なタスク向けで、圧倒的に最も安価です。Qwen3.8-Maxは、長いコンテキストとプロンプトキャッシングがコストの大部分を占める場合に適しています。その固定1Mトークンレートと$0.25のキャッシュ入力が、このオファーの中でも最も強力な部分です。
結論
Qwen 3.8 vs GPT-5.6は、7月時点よりも互角の戦いであり、価格面でもQwenファンが期待していたほど一方的ではありません。Qwen3.8-MaxはGAで、実際の価格設定、信頼できる自己申告のベンチマーク表、そして1Mトークンのフラットレートと低コストのキャッシングを備えて登場し、長いコンテキストの作業に真に魅力的です。これらはプロモーション上の利点ではなく、構造上の利点です。
しかし、OpenAIの7月31日の値下げは、ミッドティアにおけるコスト面の主張を弱めた——Terraは現在、入力においてQwenに並んでいる——そしてGPT-5.6は依然として、決定的な2つの特性を保持している:結果に利害関係のない評価者による監査済みの2位ランキング、そしてQwenが近づく兆候を一切示していない、毎秒750トークンまでのスループットだ。注目すべき2つのイベント:Qwen3.8-Maxの初の独立したインテリジェンス・インデックススコア、そしてライセンス付きでのウェイト公開。それまでは、特性に応じてルーティングせよ——スピードと証明が重要な場合はGPT-5.6、コンテキスト長とキャッシュヒットがコストを支配する場合はQwen——そして自分のプロンプトで検証せよ。

この記事で比較したモデル3
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
