
GPT-6 Astra vs Qwen3.8-Max:2つのエージェント型フラッグシップと、それぞれの細則
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
2026年9月には「エージェンティック・フラッグシップ」に関する2つのストーリーがあり、その両方の主役はGPT-6 AstraとQwen3.8-Maxである。OpenAIは9月3日、コンピューター利用、ソフトウェアエンジニアリング、科学、サイバーセキュリティの分野で世界最高だと同社が主張するモデルとしてGPT-6 Astraを発表した。一方、8月3日から提供されているAlibabaのQwen3.8-Maxは、最強の中国ラボのエージェンティック・フラッグシップであり、Artificial Analysisがそのエージェンティック指数で業界の最上位に位置づけるモデル、そして最先端の自律作業に関する主張に対する、オープンエコシステム側で最も近い競争相手でもある。どちらも本当に強力であり、どちらも精査すると縮むような派手な数字を掲げて売り出されている。OpenAIの99.9%というARC-AGI-3の結果は、ARC Prizeが独自の中立ハーネスで実行すると62.7%に落ちる。Qwen3.8-Maxのエージェンティックな優秀さには、独立に測定された幻覚の悪化と、前身モデルが14ターンで完了したタスクに64ターンと1ドル以上を費やす癖が伴っている。これは2つのモデルの比較であり、同時にベンチマークの読み方の比較でもある。
2つの見出し
OpenAIがGPT-6 Astraで掲げる売りは、適用範囲の広さと自律性だ。単一のモデルがブラウザを操作し、コードの記述と修正を行い、科学的分析を実行し、さらに——これが他に類を見ない点だが——新種のセキュリティ脆弱性を、OpenAI自身がPreparedness Frameworkの下でモデル全体を「クリティカル」と評価し、最も高性能な設定を審査済みパートナーに限定するほど確実に発見する。発表資料では、ExploitBenchで完璧な100%、FrontierMath Tier 4で97.6%、GPQA Diamondで96.0%、ARC-AGI-3で飽和スコアを達成したと主張している。一方、AlibabaのQwen3.8-Maxの売りは、より焦点が絞られているが、明確だ。$2/$6という価格で、独立したエージェント評価においてトップかそれに迫るスコアを記録するエージェント型の実働モデルであり、基盤となる重みはブラックボックスに閉じ込められるのではなく、(独自ライセンスの下で)公開されているのだ。
独立したスコアボードが示すもの
Artificial Analysisは現在、GPT-6 Astra(最大版)のIntelligenceスコアを61と評価しており、追跡対象の202モデル中8位。Qwen3.8-MaxはIntelligence 58で24位となっている。この3ポイントの差は、価格差よりも小さく、各ベンダーのマーケティングにおける差よりも小さい。AAの別のエージェント指標では、Qwen3.8-Maxは58を記録し、プロプライエタリな最前線モデルの最高水準に並んでいる。一方、AAはGPT-6 Astraのエージェント指標をまだ公開していない。率直に言えば、純粋な測定知能においてこの2つは僅差の隣人であり、OpenAIの発表資料における「世界で最も知能の高いモデル」という位置づけは、AAの独立した評価が示すところではない。
• 知能 — GPT-6 Astra (max):AA Intelligence 61、順位 #8/202。Qwen3.8-Max:AA Intelligence 58、順位 #24/202;AA Agentic 58。
• リスト価格 — GPT-6 Astra: $10.00 / $50.00(1Mあたり)、キャッシュ読み出しは$1.00、272Kトークンを超える入力は2×。Qwen3.8-Max: $2.00 / $6.00(1Mあたり)、キャッシュ読み出しは$0.25。
• コンテキスト / 出力 — GPT-6 Astra: 1.05M in / 128K out。Qwen3.8-Max: 1M in / ~128K out。
• エージェント的エビデンス — GPT-6 Astra: ARC-AGI-3 99.9%(OpenAIハーネス)対62.7%(ARC Prize標準ハーネス);WANDR 0.682 @ $11.98/タスク(Perplexity社報告)。Qwen3.8-Max: AA GDPval 1,739 Elo(64ターン/タスク、約$1.14/タスク);Code Arena WebDev #1(1,691 Elo)。
• 独立したレッドフラグ — GPT-6 Astra:ChatGPTのモデルピッカーにはまだ未搭載、APIは段階的リリース、監視可能性に関する譲歩。Qwen3.8-Max:AA-Omniscienceのハルシネーション率が前世代の23%から40%に悪化(リグレッション)。
• 重み — GPT-6 Astra: プロプライエタリ。Qwen3.8-Max: Maxクラスのチェックポイント(Qwen3.8-2.4T-A95B)で、8月12日からカスタムライセンスのもとで公開されている。AAは、ホストされているフラッグシップモデルを引き続きプロプライエタリとして分類している。

注釈付き細則
まずARC-AGI-3の数値を見てみましょう。というのも、それは「数値が真実でありつつ誤解を招く」ことの最も明確な例だからです。OpenAIは自社のプロバイダーアダプターハーネス——モデルに合わせて調整された環境——において、GPT-6 Astraで99.9%を報告しています。一方、ベンチマークを管理する組織であるARC Prizeは、プロバイダーに依存しない標準ハーネスでGPT-6 Astraを実行し、62.7%を測定しました。どちらも最先端ですが、モデルの製作者が管理しないハーネスでの99.9%という数値は存在しません。同様の注意が、PerplexityのWANDRスコア0.682にも当てはまります。これはPerplexityが記録した中で最高値ですが、GPT-6 Astraを自社製品に統合している企業が測定したものであり、商業的な利害が絡んでいます。このパターンには名前を付ける価値があります。OpenAIの最も華々しい数値はすべて、OpenAIまたはそのパートナーが管理するハーネスから生まれており、完全に独立した唯一の数値——AAのIntelligence 61——は、ただ優秀であるにすぎません。
Qwen3.8-Maxの但し書きは逆方向を指している。つまり、その強みは独立に測定され、弱みもまた独立に測定されている。1,739 EloというGDPvalスコアは本物だ。だがArtificial Analysisの実行結果を見ると、Qwen3.8-Maxはそのスコアに到達するため64ターンとタスクあたり約1.14ドルを費やしており、前世代は14ターンと0.53ドルだった。これは努力税である。このモデルは推論トークンを支払ってエージェント性能の天井を買っているのであり、トークン単位で支払う人にとっては無視できない問題だ。さらに、AAのOmniscience評価では、前世代のQwenと比べてハルシネーションが23%から40%へ悪化したと測定された。これは、自信に満ちた誤答が最も高くつく、まさに自律的で多段階のワークロードに対する、真に独立した警告である。64ターンをかけて自らを誤りへと追い込むモデルは、製造元が監視可能性の低下を認めるモデルよりも、解き放っても明らかに安全とは言えない。

価格、導入、そして正直な選び方
価格面では、比較にならない。Qwen3.8-Maxは、100万トークンあたり入力$2.00/出力$6.00で、GPT-6 Astraの入力価格の5分の1、出力価格の8分の1だ。さらに、1Mトークンのコンテキストを備えており、Astraのロングプロンプト追加料金はかからない。展開のしやすさでも、今週はQwen3.8-Maxにさらなる優位性がある。本日呼び出し可能であり、OrcaRouter上でAlibabaのリスト価格にて稼働しており、0%マークアップかつ自動フェイルオーバー付きで透過的に提供されている。GPT-6 Astraは、まだ段階的に展開中で、9月4日時点では大半のユーザーがChatGPTで選択できず、OpenAI自身のAPIと主要クラウドマーケットプレイス経由でアクセス可能であり、アクセス範囲は広がりつつある。エージェント型パイプラインを構築するチームにとっての実際的なパターンは、今日呼び出せるモデルにワークロードを置き、もう一方を注視すべきベンチマークとして扱うことだ。もし「エージェント型」という主張を信じるのではなく評価したいなら、ルーティング層こそがそのためのツールである。OrcaRouterでは、Qwen3.8-Max、Kimi K3、Grok 4.6、その他200以上のモデルが1つのキーの背後に配置されており、ルーティングDSLを使えば、それら複数のモデルを1回の呼び出しに合成できる——そうすれば、候補となる各モデルに対して自分自身のタスクスイートを実行し、2社の細かい規定に基づいて選ぶのではなく、自分の手で結果を確認できる。
この対戦が提起し続ける2つの疑問
なぜOpenAIはARC-AGI-3で99.9%と報告するのに、ARC Prizeは62.7%と測定するのか? それは、両者が同じテストではないからだ。OpenAIのプロバイダーアダプター用ハーネスは、GPT-6 Astraが本番環境で呼び出される方法に合わせて構成されたベンチマークのバージョンである。一方、ARC Prizeの標準ハーネスは、あらゆるモデルを公平に比較するために設計された中立な構成である。62.7%という結果は、「このモデルを自分で呼び出したらどうなるか」に一般化できるものであり、それでもARC Prizeがそのハーネスで記録した最高スコアである。
{{1}}Qwen3.8-Maxはオープンウェイトですか? 部分的にそうです。ただし、ライセンス上の注意点があります。{{/1}}{{2}}Alibabaは8月12日、MaxクラスのチェックポイントであるQwen3.8-2.4T-A95Bをカスタムライセンスの下で公開しました。ウェイトはダウンロードできますが、より小型のQwen3.8-27Bが備えるApache-2.0方式のオープン性はなく、Artificial Analysisはホストされているフラッグシップを依然としてプロプライエタリとしてリストアップしています。{{/2}}{{3}}あなたの要件が「自分が支払ったモデルとまったく同じものを実行できること」であるなら、その区別は重要です。{{/3}}{{4}}あなたの要件が「アーキテクチャを調べて、それに近いバリアントをセルフホストできること」であるなら、Qwen3.8-Maxは条件を満たしますが、GPT-6 Astraは満たしません。{{/4}}
要点
GPT-6 Astraを選ぶべきなのは、それが現在唯一提供している特定の機能——オフェンシブセキュリティ業務、最先端の科学的推論、最も困難な自律型コンピュータ利用タスク——が必要で、かつ組織がそのゲーティングを通過でき、価格を負担できる場合だ。Qwen3.8-Maxを選ぶべきなのは、今週中に実際にデプロイできるトップクラスのエージェント型モデルを、$2/$6で、ウェイトを脱出ハッチとして、そしてテストすべきと判明した幻覚リグレッションを伴って手に入れたい場合だ。より広い教訓は、まさに細則そのものにある。2026年9月、二大「エージェント型」フラッグシップは、どちらのメーカーも完全には制御していないヘッドライン数値を謳って販売されており、合理的な購入者はハーネスを読み、ターンを数え、自社のタスクを実行してから、どちらを選ぶかを決める。

この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
