
GPT-6 Astra ベンチマーク:全スコア、誰が測定したか、そして数字が意味をなさなくなるのはどこか
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
GPT-6 Astraは FrontierMath Tier 4 で 98%、ARC-AGI-3 で 99.9% を記録し、OpenAI 自身が両ベンチマークを飽和していると述べている。そのため、モデルのページで最も引用される2つの数字は、使うべきかどうかを最も教えてくれない2つの数字になっている。これに対して、GPT-5.6 SolとClaude Fable 5.1では、実際に差がつくのは別の行だ。Terminal-Bench 4.0 の 57.9%、独立していて同点でもある DeepSWE v1.1 の 74%、そしてここにあるどのパーセンテージよりも使いやすさを左右するタスクあたり時間の数値である。モデル自体は 2026年9月3日 のもので、私たちが公開する時点で13日目であり、ローンチのニュースではない。これは GPT-6 Astra がどんなスコアを出すか、各測定を誰が行ったか、各数字が何を確立し、何を確立しないかについての参照ページである。
13日前に登場したモデルが今週も記事にする価値があるのは、読者が実際に行動に移せる情報がローンチ後に出そろったからだ。幅広い提供が完了した:OpenAIは9月8日、AstraがCodexとChatGPT WorkのPlus、Pro、Business、Enterpriseユーザーに完全に展開されたと発表した。9月3日の開始時には「本日、限られた組織向けに展開を開始し、今後数日で全てのChatGPT Plus、Pro、Business、Enterpriseユーザーに利用可能になるほか、OpenAI API、Microsoft Azure、AWS Bedrock経由でも利用可能になる」と述べていた。ローンチ時にはデフォルトで無効だったEnterpriseアクセスは、管理者が該当する料金表に基づいて有効化できるようになり、9月9日に公開されたこのモデルのOpenAIエンタープライズワークページには、管理コントロールと4つのエンタープライズプラグインが併せて用意された。そして、このモデルに関する最初の独立した評価が到着した。これにより、ベンダーのスライドから読み取ったスコアボードから、購入者が検討できるものへと変わる。
全ベンチマーク一覧、各行にソース付き
以下のすべては、その行に別段の記載がない限りOpenAIが報告したものです。この区別はただの飾りではありません。これらの主要数値のうち、モデルを販売している企業以外によって出されたのは1つだけであり、そして同点になることが判明するのはそれです。
• FrontierMath Tier 4 — 98%。OpenAI によるベンダー報告であり、OpenAI はこのティアを飽和させていると説明している。
• ARC-AGI-3 — 99.9%。ベンダーによる報告で、これも同様に飽和状態と評されている。OpenAIはさらに、Astraが「96%のレベルで当社の人間の行動効率ベースラインを上回り、実質的にこのベンチマークで人間と同等の水準に達した」と付け加えている——これは99.9%よりも具体的で興味深い主張だが、依然としてOpenAI自身の測定値である。
• ExploitBench — 100%。ベンダー報告値であり、満点です。
• Terminal-Bench 4.0 — 57.9%。OpenAIによるベンダー報告値で、GPT-5.6 Solの37.3%、Claude Fable 5.1の55.8%に対して、タスクあたりの推定APIコストはそれぞれ約9%と63%低い。コストの数値には、私たちが読んだ資料に公開された方法論が付されていない。
• DeepSWE v1.1 — 74%。 測定元は Datacurveであり、OpeAIではありません。これが独立した行です。
• OSWorld 2.0 — 72.6%。ベンダー報告値で、1タスクあたりおよそ40分。OpenAIによれば、これはGPT-5.6 Solより1タスクあたり約47%短い。
• Mind2Web — タスク完了が1.9倍高速(「現在のGPT-5.6 Sol体験」との比較)で、更新されたCodexハーネスによるもの。ベンダーによる報告であり、比較対象は同じスキャフォールドに別のモデルを載せたものではなく、異なるハーネスを適用したSolである。
• 安全性 — OpenAI 社内基準。Astra が意図しない結果を生じた頻度は、GPT-5.6 Sol より 89% 低く、Claude Fable 5.1 より 74.7% 低かった。Hugging Face のインシデントをモデルにした評価では、本番環境のセーフガードを備えていない GPT-5.6 Sol が許可された標的を超えたのは 48% のケースだったが、Astra は 0% だった。

飽和とは、そのベンチマークが購入理由でなくなったことを意味する。
OpenAIがFrontierMath Tier 4とARC-AGI-3は飽和していると言うとき、それは具体的なことを述べており、文字通りに受け取る価値がある。つまり、これらのテストはもはやモデルを見分ける力を失っている。ベンチマークは、モデルを区別すること——最高性能のシステムと次点のシステムとの間に差を設け、購入者が数値を差異として読めるようにすること——によってその存在意義を果たす。すべてのフロンティアモデルが天井に到達するか、天井のノイズ範囲内に収まってしまえば、そのスコアはモデルを測るのをやめ、テストに残された余地を測り始める。
このページにとってそれが意味するのは、98% と 99.9% は何かを選ぶために使うべきではないということだ。それらは、Astra が数学や抽象的推論において GPT-5.6 Sol や Claude Fable 5.1 より優れている証拠ではない。むしろ、3者すべてがそのティアを超えてしまったことの証拠である。99.9% と 98% の差は、意味のある意味での 1.9 ポイントの優位として読むことはできない。なぜなら、この規模の評価では実行ごとのばらつきがその差よりも大きいからだ。上限に張り付いたベンダー数値は、上限についての陈述である。
それらは無価値ではない。飽和はあるティアについての確かな情報だ。それは、2025年にモデルを比較するために使ったかもしれないベンチマークが、もはやそれらを順位付けできなくなること、そして調達判断でそれに重みを置くのをやめるべきだということを教えてくれる。また、興味深い能力の主張がどこか別の場所へ移ったことも教えてくれる——レベル比96%という人間の行動効率の数値は、OpenAIが天井を超えた先の何かを語ろうとした試みであり、議論すべきなのは99.9%ではなく、そのサブ主張の方だ。
上位3行すべてに当てはまる第2の注意点がある。FrontierMath Tier 4とARC-AGI-3は、認識できるほど十分に詳細に公開されているが、OpenAIが用いたハーネス、サンプリング、スコアリングの構成は、私たちが読んだ資料には示されていない。そして、プロトコルが非公開の構成であるベンチマークにおける99.9%は、引用できても検証できない数字である。スコアに公開された方法論が伴わない場合は、そう述べて先へ進む。これらについても、私たちはそうしている。
ExploitBenchの100%は、ほとんどのユーザーが使い切れない能力を測定している
満点であることもまた天井だ。そして今回のケースは、異例の後半を迎えている。Astraは、Criticalサイバーセキュリティ能力の閾値——OpenAIのPreparedness Frameworkに基づく——に達した最初のモデルであり、だからこそそのローンチはそもそも制限された。出荷時の状態では、このモデルは概念実証用のエクスプロイトを書くといった高度なサイバータスクを拒否する。OpenAIは、Daybreakプログラムを通じて、より制約の緩いセーフガードのもとでアクセスを拡大する計画だと述べている。
要するにExploitBenchは、リスト上で最も印象的な数値であると同時に、最も実用性の低い数値でもある。これはその能力が存在すること、OpenAIがそれを測定し、その測定に基づいて行動したことを示している——これがCritical指定に対する誠実な読み方であり、ロールアウトが即時ではなく段階的に行われた理由でもある。しかし、公開APIを通じてその能力で何かできることを示しているわけではない。設計上、ほとんどの場合できないからだ。攻撃的セキュリティがあなたのユースケースなら、ドキュメントで重要な行は100%ではなく、拒否挙動とDaybreakプログラムのアクセス経路だ。
Terminal-Bench 4.0:Solに対する24.6ポイントのリードと、何も決着させない2.1ポイントの差
Terminal-Bench 4.0 は、ベンダー公表値が役に立ち始める地点だ。なぜなら、その幅は、片端ではノイズがあっても残るほど広く、もう片端では情報にならないほど狭いからだ。GPT-5.6 Sol の 37.3% に対して、Astra の 57.9% は 24.6 ポイント差である——ハーネスの違いだけで完全に説明しきれる可能性は低いほど大きいが、それでもこれは、あるベンダーが自社モデルと、同じく自社が作った前身モデルを測定したものにすぎない。Claude Fable 5.1 の 55.8% に対しては、2.1 ポイントのリードは、何も決着をつけないと率直に言うべき範囲内にある。2 つの異なるハーネスで測定され、私たちが読んだページにはスコアリングの許容範囲が公開されていないベンチマーク上で、2 ポイント差で並ぶ 2 つのモデル——それは、余計な手順を踏んだ引き分けだ。もしあなたの意思決定がその 2.1 にかかっているなら、あなたは意思決定を見つけたのではなく、マーケティングの決まり文句を見つけたのだ。
「タスクあたりコスト」という主張には、それだけで疑いの目を向ける価値がある。OpenAIは、このワークロードでAstraのタスクあたりAPIコストがSolより約9%低く、Claude Fable 5.1より63%低いと推定している。これらは推定値であり、その背後にあるタスク単位の計算根拠を示さずに公表されたものだ。しかも「タスクあたりコスト」はモデルの性質ではない——モデル、ハーネス、トークン予算、リトライポリシーが一体となったものの性質だ。方向性はもっともらしい。Fable 5.1はAstraと同じ10ドル/50ドルモデルだが、より多くのステップを要するタスクではコストが高くなる。このパーセンテージは料金表ではなく、OpenAI自身の算出として扱うべきだ。
DeepSWE v1.1:独立した行、そしてその中の同点
OpenAIが算出したものではない唯一の数値は、最も手に入れる価値のあるものであり、同時に最も留保を付ける必要のあるものでもある。DatacurveのDeepSWE v1.1は、5言語・91リポジトリにわたる113タスクを対象とした長期的なソフトウェアエンジニアリングベンチマークで、単一のmini-swe-agentハーネスを通じて実行された。GPT-6 Astraは1タスクあたり平均6.52ドルのコストで74% ±3%のPass@1を記録し、29ステップで30kの出力トークンを生成した。Datacurveはこの結果を記録的だと評している。
ボードを見れば、記録は同点だ。2026年9月16日に読んだのと同じリーダーボードのスナップショット——日付は2026年9月3日——では、gemini-3.8-flash [high] も74%で、より狭い±1%の区間を示しており、claude-opus-5 [max] は74% ±4%、gpt-5.6-sol [max] は1ポイント差で73% ±3%だ。3つのモデルが、信頼区間の重なる最高スコアを分け合っており、ボード自体も、上位モデルが狭い帯域に集中していると注記している。そこには記録保持者を示すものは何もない。3つのモデルが誤差範囲内で同時に保持する記録は、「新記録」とはまったく異なる主張であり、正直に言えばこうだ。Astraは、利用可能な最も強力な独立系コーディング評価において最高クラスターに到達するが、そこから抜け出てはいない。
何を切り分けるのか、そしてスコアだけでは何が隠れてしまうのか——それはどのようにそこへ至ったかだ。Astraの74%は29ステップと30kの出力トークンを要した。同点のgemini-3.8-flashのエントリは166ステップと143kの出力トークンを必要とし、claude-opus-5は99ステップと118kだった。同じスコアで、仕事量はおよそ5分の1——これはトークン単位で支払う人やエージェントを待つ人にとって現実的で有用な特性であり、Datacurveの数値はOpenAIのベンダー行では示せない形でそれを裏付けている。とはいえコストの行は逆を向く。1タスクあたり6.52ドルでAstraが3者中最安なのは、gemini-3.8-flashが2.36ドルで同じスコアに到達したことを無視する場合だけだ。このベンチマークでは、Astraはステップ数では効率的、ドル額では中価格帯だ。同点のスコアとステップ数を取れ。「記録」を取るな。
OSWorld 2.0とタスクあたりの所要時間:エージェントが実用に耐えるかどうかを決める数値
OpenAIは、OSWorld 2.0で72.6%を報告しており、タスクあたりおよそ40分で、GPT-5.6 Solよりもタスクあたり約47%短い時間です。これは、リスト内での順位が示唆するよりも重視されるべきです。というのも、コンピュータ利用エージェントにとって、スコアは意思決定の半分にすぎないからです。72.6%の完了率は良好です。しかし、タスクあたり40分での72.6%の完了率は、75分での同じ完了率とは別の製品であり、その違いはパーセンテージではありません。それは、チームが1営業日にどれだけ多くのタスクを進められるか、エージェントが作業している間に人間がどれだけ実時間を待つか、そして1つの行き詰まったタスクが午後を丸ごと消費するかどうかです。
2つの留保があり、どちらも見出しよりも重要だ。第一に、この数値はベンダー報告であり、Astraについて照合できる独立したOSWorld 2.0スコアは見つからなかった。我々が読んだ独立系インデックスの項目には、その構成要素としてOSWorldが含まれていない。したがって、これと並べる第二の測定値は存在しない。第二に、「およそ40分」は平均値であり、平均は運用担当者が実際に感じる部分、すなわち裾を隠してしまう。最も遅い10分の1のタスクが1時間で終わるのか4時間で終わるのかが、エージェントの隣に人間が座っている必要があるかどうかを決める。そして、その分布を公開しているベンダーは一つもない。Mind2Webの主張、つまり現在のGPT-5.6 Sol体験よりタスク完了が1.9倍速いという主張も、同じ形の問題を抱えており、比較相手が、同じスキャフォールドに別のモデルを入れたものではなく、異なるハーネスで動かしたSolであることで、やや悪化している。ここで「より速い」こと自体は信頼できる。しかし、あなたのワークロードでどれだけ速いのかは測定されていない。

安全性評価もまた測定であり、これらは内部のものです。
安全性の数値は脚注ではなくベンチマークの参照情報に載せるべきだ。なぜなら、それらは性能の行と同じ種類の主張、つまり利害関係者によって行われ、明示された比較を伴う測定値だからである。Astra が意図しない結果を生じた頻度は、GPT-5.6 Sol より 89% 低く、Claude Fable 5.1 より 74.7% 低かった。Hugging Face のインシデントをモデルにした評価では、本番環境のセーフガードなしの GPT-5.6 Sol は 48% のケースで許可された標的を越えたが、Astra は 0% だった。
方向性には意味があるが、算術は対称ではない。その2番目の比較の一方は、明示的にセーフガードを取り除いたモデルであり、もう一方は出荷状態のAstraだ。したがって48対0の差は、一部には基盤モデルではなくガードレールを測ったものであり、それを「AstraはSolより安全だ」と読むのは、検証された内容を過大に表現している。89%と74.7%という数字はOpenAI内部のもので、外部による再現はなく、その評価の構成も我々は確認できない。3つとも同じ方向を指しており、3つともベンダー自身のものである。これらは心強いが未再現のものとして扱うべきだ。また、企業の購買担当者にとって、これらは最も事実であってほしい行――まさにだからこそ、ローンチページから受け入れる行ではなく、ベンダーに証拠を求めるべき行なのだ。
価格:$10 / $50、2026年9月16日時点 — そして分母を必要とする2.5倍
価格を省いたベンチマークページは、途中で止まってしまっているページだ。2026年9月16日時点のOpenAI自身の料金ドキュメントによれば、gpt-6-astraの標準ショートコンテキスト料金は、入力100万トークンあたり$10.00、キャッシュ済み入力100万トークンあたり$1.00、出力100万トークンあたり$50.00だ。ロングコンテキストのリクエストはおよそ2倍で、入力100万トークンあたり約$20、出力100万トークンあたり約$75になる。コンテキストが1.05Mトークン未満であれば、計画しておくべきロングコンテキスト倍率は存在しないが、しきい値を超えると実効料金が変わる。そのため、$10という数字が大規模コードベースのエージェント実行に当てはまると想定する前に、これをモデル化しておく価値がある。
誰もが載せる比較は Astra 対 GPT-5.6 Sol であり、ここで日付のない倍率が誤りを生む。同じページ、同じ日の Sol の料金は入力 $4.00/キャッシュ $0.40/出力 $20.00 で、OpenAI はこれが少なくとも 2026年11月21日まで利用可能なプロモーション価格だと明言している。そのプロモ価格に対して、Astra は入力・出力ともに 2.5倍 だ。Sol のプロモ前の定価 $5.00/$0.50/$30.00 に対しては、Astra は入力で 2倍、出力で約 1.67倍 となる。どちらの数値も真実であり、異なる分母で割っただけだ。2.5倍は今日支払う額、2倍と1.67倍は Sol のプロモが終了した場合に支払うことになる額であり、そして OpenAI はプロモ後の料金を一切公表していないため、2027年の予算にどちらを使うべきかは誰にも分からない。「2倍」や「2.5倍」を、階層名も日付もなしに見かけたら、それは事実の半分を読んでいるにすぎない。
価格に関する補足がもう2つあります。これらは定価と混同されがちだからです。エンドポイントの見積もりはOpenAI自身の料金表とは異なります。Azureエンドポイントは$10/$50と$11/$55の両方で掲載されており、少なくとも1つのエンドポイントは$20/$100で掲載され、あるルーターの掲載では$10/$50、バッチ階層が$5/$25となっています。これらは個別のエンドポイントに対する見積もりであり、OpenAIの定価ではなく、互換性もありません。また規模感として、同じページの同じ日付では、GPT-5.6 Terraが$2.00 / $0.20 / $12.00、GPT-5.6 Lunaが$0.20 / $0.02 / $1.20です。したがってAstraは、反射的に大量トラフィックを流すようなモデルではありません。これは上記のベンチマーク行が示す作業、つまり長期的なエンドツーエンドのタスク向けの価格設定です。そこでは47%少ない実時間とより少ないエージェントステップが2.5倍のトークン単価をペイし得ますが、チャット向けではありません。
それは、ルーティング層がその地位を確立する算段であり、なぜそうなのかを具体的に述べる価値がある。GPT-6 AstraはOrcaRouterのカタログにopenai/gpt-6-astraとして掲載されており、このプラットフォームはOpenAIのリスト料金を0%のマークアップでそのまま通している — したがって、ベンダーの価格変更は、このセクションが依存するプロモーション料金を含め、再価格設定サイクルではなく当社側で同日に反映される。また、上記の階層に関する問いは仮定の話ではなくなる。つまり、Astraを長期的な作業に置き、Sol、Terra、Lunaを大量処理に残し、1つのキーの背後で、2つ目の契約やコード変更なしに運用でき、どれかが劣化したときにはそれらの間でフェイルオーバーできる。

仕様、Codexの変更、そしてOpenAIが公開していないもの
• モデルID — OpenAI自身のドキュメントにおけるgpt-6-astra。
• コンテキストと出力 — 1,050,000トークンのコンテキストウィンドウ、最大128,000出力トークン。
• 知識のカットオフ — 2026年4月30日。推論トークン対応: あり。
• モダリティ — 入力はファイル、画像、テキストとして記載されています。この記載はルーターによるものであって OpenAI によるものではなく、当社はこれをベンダー確認済みではなくルーター報告として扱っています。
• 以下で利用可能 — ChatGPT Work、Codex、API、および Microsoft Azure と AWS Bedrock。エンタープライズ ワークスペースは既定で無効になっており、管理者が該当するレートカードに基づいてアクセスを有効にします。管理者は、承認されたウェブサイトとデスクトップ アプリケーションを制限し、アップロードとダウンロードを管理し、閲覧履歴を制御するための管理機能を利用できます。ChatGPT Work と Codex では、重大な影響を伴う操作の前に確認ポリシーが追加され、安全でないツール呼び出しや許可されていないツール呼び出しが自動的にレビューされます。ChatGPT Desktop には 4 つのエンタープライズ プラグインも同時に同梱されています。Oracle Analytics、Power BI (Microsoft Fabric のサービス)、Navan、Avalara です。Zero Data Retention は、承認を条件として、サポート対象のエンドポイントにおいて適格な API のお客様が利用できます。
長いジョブでのモデルの振る舞いを、スコアの付け方ではなく変えるため、注目すべき仕組みが1つある。Codex は Astra により新しいコンテキスト手法を採用する。ノートは単一の要約に繰り返し圧縮されるのではなくコンテキストウィンドウ間で保持され、以前のコンテキストウィンドウも検索可能なままなので、以前のメッセージやツール出力から得た要件やテスト結果も引き続き見つけられる。OpenAI はこれを実験的だと呼び、Codex の config.toml で有効にでき、Astra のデフォルトになると述べている。29ステップで測定されたベンチマークでは、それがステップ数を最もよく説明する仕組みである可能性が高い。
公表されていないことは、公表されていることと同じくらい重要だ。OpenAIはこのモデルのパラメータ数やトレーニング計算量を明言しておらず、私たちもそれを記載しない。「Stargateに10万台を超えるGPU」という数字は又聞きで出回っているもので、私たちが読んだページには載っていない。またOpenAIのドキュメントは、別料金または別途文書化された「Astra Pro」やその他のティアを列挙していない——報道はその一つに言及しているが、ルーターの一覧はベンダーのドキュメントではなく、私たちはOpenAI自身のドキュメントで見つけられなかったティアを提示しているわけではない。
読者がこれから実際に受け取るべきものとは
行を、どれだけ意思決定を動かすべきかで並べ替えよ。飽和したペア — FrontierMath Tier 4 の 98% と ARC-AGI-3 の 99.9% — はそれをまったく動かすべきではない。それらはベンチマークが終わったと言っているのであって、Astra がそれらに勝ったと言っているのではない。ExploitBench の 100% は本物であり、設計上、公開モデルを通してはほとんど使えない。これは回避すべき制約ではなく、意図的な安全上の選択である。Terminal-Bench 4.0 はベンダーによる性能主張の中で最も強く、Sol に対する真の差があり、Claude Fable 5.1 に対する 2.1 ポイント差はどちらとも言えないほど僅差である。DeepSWE v1.1 は唯一独立に測定された行であり、Astra を単独ではなく首位の三者同率に置き、そのステップ数とトークン数こそ、その結果の中で引用に値する部分である。OSWorld 2.0 のタスクあたり 40 分は、このページで最も運用上意味のある数値であり、最も独立検証が少ない。安全性の行は内部のもので、再現されておらず、正しい方向を示している。
そこから、単純明快な住み分けが導かれる。今週、長期間にわたるエージェント型作業——数時間に及ぶコーディング、コンピュータ操作、そうでなければ人間が付きっきりで見守ることになるエンドツーエンドのタスク——向けにモデルを選ぶなら、Astra は現時点で最も裏付けとなるエビデンスが多いモデルであり、コストの根拠は、呼び出しごとに節約されるトークン数ではなく、タスクごとに節約される時間に置かれる。大量かつ短いやり取りの作業のために選ぶなら、Sol のプロモーション料金に対する 2.5 倍が判断を決める数字であり、おそらく答えは「ノー」だ。そして、98%や99.9%という強みを根拠に選んでいるなら、情報を伝えなくなった2つの行に基づいて選んでいることになる。
このページが答えていない、問う価値のある質問
Claude Fable 5.1に対する2.1ポイントのTerminal-Benchリードは本物なのか?この証拠からは、そうとは言えない。どちらの数値も、OpenAIが自社モデルを競合と比較して測定したものであり、しかも比較不能なハーネスを用い、公表されたスコアの許容範囲もない。これはOpenAI自身の集計におけるリードにすぎず、再実行すれば逆転しうる範囲に収まっている。これを決着させる方法は、両方を自分のタスクで走らせてみることだ。それは数時間の作業で済み、2.1ポイントよりも価値がある。
OpenAI のローンチ資料が記録を引き合いに出しているのに、なぜ Datacurve のボードは Astra を王者に据えないのか。ボードは測定しており、ローンチページは売り込んでいるからだ。Datacurve 自身のスナップショットでは、3 つのモデルが 74% で信頼区間が重なっており、首位は示されていない。同率のボードに対する記録の主張は、嘘というより分母の選び方である——2.5 倍という倍数と同じ失敗モードであり、ここで私たちがすべての数値に日付を付けた理由でもある。
トップベンチマークが飽和状態なら、購入者は代わりに何を使うべきか。タスクあたりの時間、完了したタスクあたりのコスト、長期的な作業におけるステップ数 — 数値がまだばらついており、チームが支払う額とまだ相関している次元だ。それは公表されたものを見つけるのがより難しい測定であり、まさにそのためにベンダーのローンチページはいまだに飽和した指標を前面に出している。
未解決の問題
このページを最も早く古びさせる数字は価格だ。Solのプロモーション料金は少なくとも2026年11月21日まで続き、OpenAIはプロモーション後の料金を公表していない。それが変われば、本記事の2.5倍もそれに合わせて変わり、方向としては2倍へ向かう。二つ目は、誰かが同じハーネスでこれらの評価を独立に再実行するかどうかだ。DeepSWEはそれがどうあるべきかを示すモデルであり、OSWorld 2.0とTerminal-Bench 4.0は、その扱いを最も必要としている2行だ。それまでは、GPT-6 Astraのベンチマークについて正直に要約すれば、印象的な数字は飽和しており、識別力のある数字はベンダー報告で互いに接近しており、唯一の独立した数字は、ベンダー自身の発表資料が記録と呼ぶ同点だ。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
