生成されたヒーロータイトルカード。見出しは「GPT-6 Luna vs Qwen3.8-Max」、サブタイトルは「ここで最も安いモデルは動画を見るものではない」、フッターには「価格はOpenAIおよびAlibaba Cloudによる、指数値はArtificial Analysisによる」と記載され、OrcaRouterのロゴが右下に合成されている。
Guides & Insights

GPT-6 Luna 対 Qwen3.8-Max:この比較の中で最も安価なモデルが、動画を視聴できる唯一のモデルでもある

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この組み合わせに対する明白な捉え方は間違っている。Qwen3.8-Maxは100万入力トークンあたり2.00ドル、100万出力トークンあたり6.00ドル、キャッシュ読み取りは0.25ドルで掲載されている。GPT-6 Lunaは0.10ドルと0.50ドル、キャッシュ読み取りは1セントで掲載されている。入力では20倍、出力では12倍、キャッシュ入力では50倍 — 価格差があまりに大きいため、比較は始まる前から決着がついたように見える。

決着はついていない。なぜなら、2つのモデルは同じリクエストを争っているわけではないからだ。Qwen3.8-Maxはテキスト、画像、動画を受け付け、その131,072トークンの出力上限はGPT-6 Lunaの128,000をわずかに上回る。GPT-6 Lunaはテキストと画像のみを受け付ける。Alibabaのモデルは独立系Intelligence Indexで58点——エージェント部門で同クラス首位——を記録し、GPT-6 Lunaは最大エフォート時で37点、デフォルトで29点だ。一方はオープンウェイトの系譜と動画入力モダリティを備えたフラッグシップ。もう一方は速度指標と1セントのキャッシュレートを備えたボリューム層だ。価格差は同じものに対する割引ではなく、2つの異なるものの説明なのだ。

この二つはそれぞれ何か

Qwen3.8-MaxはAlibabaの3.8世代のフラッグシップであり、Maxクラスのチェックポイントです。その基盤モデル — Qwen3.8-2.4T-A95B — は2026年8月12日にカスタムライセンスの下で一般公開され、MaxクラスのQwenとして初めてオープンウェイトを備えたものとなりました。ホスト版のフラッグシップ自体は、独立委員会によって依然としてプロプライエタリとして掲載されています。1,000,000トークンのコンテキストウィンドウ、131,072トークンの出力上限、テキスト・画像・動画の入力、そして低・中・超高で選択可能な推論エフォートを備えています。ピン留めされたQwen3.8-Max-0902リビジョンが同じ価格で利用可能で、これは実際の運用上の価値がある小さなディテールです。

GPT-6 Lunaは、2026年9月22日からのOpenAIの効率ティアで、$2.00/$10.00のGPT-6 Solの下、$10.00/$50.00のフラッグシップGPT-6 Astraの下に位置する。テキストと画像を入力、テキストを出力し、1,050,000トークンのウィンドウ、最大入力922,000、出力上限128,000トークン、エフォートはnoneからlow、medium、high、xhigh、maxまであり、デフォルトはmedium。クローズド、単一識別子、APIキーを持つ誰でも利用可能。

一方は動画を受け付け、基本形でダウンロードできる。もう一方は画像を受け付け、高速だ。どちらも大量に使われることを想定した価格になっている。これら二つの文の重なりは、価格比が示唆するよりも小さい。

カードを1行ずつ

1次元につき1行、それぞれ両側をオン:

• 100万あたりの入力 — GPT-6 Luna $0.10 対 Qwen3.8-Max $2.00

• 出力 100万トークンあたり — GPT-6 Luna $0.50 対 Qwen3.8-Max $6.00

• 100万あたりのキャッシュ入力 — 暗黙的キャッシュ読み取りで GPT-6 Luna $0.01 対 Qwen3.8-Max $0.25、明示的キャッシュ読み取りは $0.17、明示的キャッシュ書き込みは $2.50

• ロングコンテキスト条項 — GPT-6 Luna は 272,000 入力トークンを超えると、入力とキャッシュを 2 倍にし、出力を 1.5× に引き上げ、これをリクエスト全体に適用する。一方 Qwen3.8-Max はウィンドウ全体を通じて一律のティアであり、これは Qwen のカードがわずかに安いというより、構造的に優れている唯一の点だ

• コンテキストウィンドウ — GPT-6 Luna 1,050,000トークン 対 Qwen3.8-Max 1,000,000トークン

• 最大出力 — {{1}}GPT-6 Luna{{/1}} 128,000トークン 対 {{2}}Qwen3.8-Max{{/2}} 131,072トークン

入力モダリティ — GPT-6 Luna はテキストと画像、Qwen3.8-Max はテキスト、画像、動画

• 推論エフォート — GPT-6 Luna なし、低、中(デフォルト)、高、xhigh、最大 対 Qwen3.8-Max 低、中、超高

• インテリジェンス指数、独立系 — 最大エフォート時の GPT-6 Luna 37 対 Qwen3.8-Max 58

• Agentic Index(独立系)— Qwen3.8-Max は 58 で同クラス首位、比較可能な GPT-6 Luna の数値は未公表

• デフォルトエフォートスコア — デフォルトのミディアム設定時の GPT-6 Luna 29 対 最大設定で測定した Qwen3.8-Max

• Indexタスクあたりのコスト、独立 — GPT-6 Luna 約0.07ドル に対し Qwen3.8-Max は5.41ドル

• GDPval、独立系 — Qwen3.8-Maxはタスクあたり64ターンでElo 1,739、その評価では完了タスク1件あたりおよそ1.14ドルに相当する。比較可能なGPT-6 Lunaの実行結果は公開されていない

• AA-Omniscience でのハルシネーション率 — Qwen3.8-Max は40%、前世代の23%からの悪化。GPT-6 Luna は77%、93%から低下

• 日付付きスナップショット — GPT-6 Luna は単一のローリング識別子であるのに対し、Qwen3.8-Max-0902 は同一価格で 2026年9月2日時点の固定リビジョンとして利用可能

• 重み — GPT-6 Luna は非公開、API のみ。対して Qwen3.8-Max は、ベースとなる Qwen3.8-2.4T-A95B チェックポイントが 2026年8月12日以降カスタムライセンスの下で公開されている一方、ホスト版のフラッグシップはプロプライエタリとして記載されている

• OrcaRouterでは — GPT-6 Lunaは当社のカタログにない一方、Qwen3.8-MaxはAlibabaの定価でルーティング可能

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

ビデオは機能ラインではなく、異なるワークロードです。

モダリティ行は、価格行よりも多くの実際の比較を左右する行であり、通常はチェックボックスとして読まれます。

Qwen3.8-Maxは動画を扱えます。GPT-6 Lunaは扱えません。画面録画、製品デモ、講義の収録、防犯カメラの映像、UIウォークスルーについてパイプラインで推論する必要があるなら、比較はそこで終わり、20倍の価格差は無意味になります。あなたは高い選択肢と安い選択肢を選んでいるのではなく、選択肢があるものと選択肢がないものを選んでいるのです。フレームを抽出して画像として渡すのは回避策であり、等価なものではありません。それを自作したことのある人なら誰でも、コストと品質の両方における違いを知っています。

あなたのパイプラインがテキストと画像であれば、モダリティの線は沈黙し、価格の線がものを言う。それが正直な分かれ目であり、このページの他の何かを読む前に、自分がそのどちら側にいるのかを率直に言ってしまう価値がある。

エージェント能力の差は現実にあり、それは価格差のうち高くつく半分だ

Qwen3.8-Maxは独立系Intelligence Indexで58を記録する。GPT-6 Lunaは最大エフォートで37、デフォルトのmediumで29を記録する。条件を揃えた場合は21ポイント、デフォルトでは29ポイント——1ポイントが再実行のノイズの範囲内に収まるような複合指標において、その規模の差はノイズではない。

Qwen3.8-Maxの位置づけは、エージェント的作業に集中している。独立系のAgentic Indexでは58点を獲得して同クラス首位、GDPvalでは1タスクあたり64ターンでElo 1,739を記録している。最後の数値が示唆的なのは、それが64回の連続する意思決定を通じてタスクを維持するモデルを測定したものであり、しかも値札が付いてくるからだ。その評価で完了タスク1件あたりおよそ$1.14である。これをGPT-6 Lunaのインデックスタスクあたり約$0.07のコストと比べると、正直なところ、Qwenが高価だという話ではない。Qwenははるかに難しいことを求められ、それを成し遂げているのだ。

系論として、GPT-6 Lunaの21ポイントの不足も、あなたのワークロード全体に均等に分布しているわけではない。短く、明確に定義され、プログラムが消費するタスク——このフィールドを抽出する、このチケットを分類する、このリクエストをルーティングする——では、両モデルはほぼ常に同じ使用可能な回答を生成し、指数の差はあなたの評価では見えなくなる。最後にチェックポイントがある64の連続したアクションを必要とするタスクでは、その差は完了することと途中で静かに停止することの違いであり、それはQwen3.8-Maxが作られたタスクであり、GPT-6 Lunaはそうではなかった。

一つの数字は逆方向に作用しており、埋もれさせるのではなく明言されるべきだ。Qwen3.8-Maxのオムニサイエンス・ボードにおけるハルシネーション率は40%で、前世代の23%から上昇している——大幅な後退であり、ベンチマーク上の一行としてではなく、本番環境で自信満々の誤答として現れる種類のものだ。GPT-6 Lunaは77%で、93%から低下している。どちらの数値も絶対値としては高く、この指標では安価なモデルのほうが依然として2モデルのうちで悪い。どちらの数値も、一方のモデルを好む理由にはならない。どちらも、捏造された事実が高くつくあらゆる場面で、人間または検証者をループに入れておく理由になる。

長文コンテキストの条項こそ、Qwenが構造面で勝利する唯一の行だ

GPT-6 Lunaには、Qwen3.8-Maxにはない条項がある。272,000入力トークンを超えるリクエストは、入力料金とキャッシュ料金の2倍、出力料金の1.5倍で課金され、その適用は基準を超えた部分ではなくリクエスト全体に及ぶ。GPT-6 Lunaでの300,000トークンの呼び出しは、28,000トークン超過したために、300,000トークンすべてが入力100万トークンあたり0.20ドルで課金される。同じ文書を2回の呼び出しに分割すれば、プロンプトを変更せずにコストは半減する。

Qwen3.8-Maxは、その100万トークンの全コンテキストウィンドウにわたって価格が変動しない。真に巨大な単一リクエストの場合、これにより出力価格の12倍の差は見かけよりも小さくなり、逆転することさえあり得る。272,000入力トークンを超えると、GPT-6 Lunaの実効入力レートは2倍の$0.20になり、出力レートは$0.75に上昇する。これに対してQwenは$2.00と$6.00で変動しない。差は入力で20倍から10倍に、出力で12倍から8倍に縮まる。依然として大きい——しかし、300,000トークンの作業コンテキストを持つ可能性が最も高いワークロードは、まさに両ベンダーが販売対象としているエージェント型のものであり、それらを運用するチームこそが気づくチームである。

もう一つの構造的な項目は、固定されたリビジョンだ。Qwen3.8-Max-0902 はローリング識別子と同じ価格で利用できる。つまり、モデルの更新をまたいで再現可能な挙動を必要とするチームは、追加料金を払うことなくそれを手に入れられる。GPT-6 Luna には同等のものがない。それは料金表では小さな一行であり、ポストモーテムでは大きな一行である。

それらのうち1つ、または両方を実行する

Qwen3.8-MaxはAlibabaの定価でOrcaRouter上でご利用いただけます。パススルー価格設定のため、ベンダーの料金変更は当日中に当社側でも反映されます。当社のルーティングレイヤーには、この特定のモデルにふさわしい特徴が2つあります。1つは自動フェイルオーバーです。公開されたオープンウェイトのベースを持つホステッド・フラッグシップは、単一ベンダーのクローズドモデルよりも上流プロバイダーが多く、そのうちの1つが劣化する可能性も高まるからです。もう1つはピン留めリビジョンの処理で、ルートがQwen3.8-Max-0902を明示的に保持できるようにします。来週にローリング識別子が何に解決されるかをそのまま引き継ぐのではなく。

GPT-6 Luna は本稿執筆時点で当社のカタログにはなく、OpenAI 独自の API を通じて利用されます。そのため、両方を必要とするチームは、Qwen3.8-Max 用に1つのキーを、OpenAI 用にすでに使用しているものと併せて使います。これはまた、ルーティング DSL が静的な分割よりも価値を持つ組み合わせでもあります。なぜなら、2つのモデル間の境界は好みではなく、モダリティチェックと長さチェックだからです。動画を含むリクエストは、他に処理できるものがないため Qwen3.8-Max に送られ、272,000 入力トークンを超えるリクエストは、他方のモデルの価格クリフによりそちらではより高くつくため Qwen3.8-Max に送られ、それ以外はすべて、価格が20分の1のモデルに送られます。これはルールであり、アプリケーションの分岐ではなく設定に属します。

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

どちらを、そしていつ

次のいずれかに当てはまるなら、Qwen3.8-Maxを選ぼう。パイプラインに動画入力が必要な場合。リクエストが日常的に272,000入力トークンを超え、その定額ティアがGPT-6 Lunaの再価格設定を上回る場合。出力が128,000トークンを超える場合。あなたの作業が、検証可能なエンドポイントを伴う長期的なエージェント実行であり、エージェントボードでの58、および1タスクあたり64ターンでのGDPvalにおける1,739 Eloが決め手となる証拠である場合。あるいは、再現性のために固定リビジョンが必要で、その対価を払う用意がある場合 — ただし、ローリング識別子と同じ価格であるなら、それは払う用意がないということだ。

それらのいずれも当てはまらず、ワークロードが大量・プログラム消費型・テキストと画像・短めであれば、GPT-6 Lunaを選ぼう。分類、抽出、ルーティング、一括要約、慎重な答えよりも速い答えを必要とするエージェントの内側のループ。$0.10/$0.50で、キャッシュ読み取りが1セント、完了タスクあたりのコストがQwen3.8-Maxのおよそ15分の1なら、計算は比べものにならない。effortパラメータは明示的に設定しよう——デフォルトはmediumで、見出しの37は最大エフォート値だ——そして長い呼び出しは272,000トークンの線の正しい側に収めておこう。

この比較が招く誤りは、20倍という入力価格を判定と読んでしまうことにある。それはある一つのワークロード形態についての判定であり、もう一方を決める三つの行については何も語っていない。すなわち、そのリクエストが動画を含むか、272,000トークンを超えるか、そして回答が64段階の連続ステップを生き延びなければならないかどうかである。

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新