
GPT-6.1 Sol、初の独立スコアが判明:Astraに0.84ポイント差、タスクコストは4分の1未満
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 397 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- xAISpaceXAI: Grok 4.62026-08-1244知能77コーディング
に関するあらゆる記事はGPT-6.1 Sol、2026年9月29日の OpenAI の DevDay リリースから数日のうちに公開されたもの——本ブログも含めて——いずれも同じ但し書きを添えていた。能力値はベンダー自身によるもので、第三者によるモデルの採点はまだ行われていない、というものだ。その但し書きは今や古くなった。Artificial Analysis は Intelligence Index に GPT-6.1 Sol の行を持ち、最大推論エフォートで実行されており、これはこのモデルの短い歴史の中で OpenAI が算出しなかった最初の数値である。それは 51.8 で、GPT-6 Astraの 52.7、GPT-6 Solの 47.5 に対するもの——$10/$50 のフラッグシップとの差は 1 ポイント未満、GPT-6.1 Sol が置き換えるモデルからは 4.3 ポイントの上昇だ。この行を興味深いものにしているのは、その隣にある数値である。このボードは各スコアの背後にある評価実行の価格を示しており、GPT-6.1 Sol のインデックス実行はタスクあたり $0.72 だったのに対し、Astra は $3.26 だった。0.84 ポイントのために 4.5 倍の金額——これが比較のすべてを一行に凝縮したものであり、そしてそれは今や、ベンダーによる位置づけではなく、実測された一行である。
その行自体と、それが実行された環境

Artificial Analysisは、Intelligence Indexを10の評価を組み合わせた総合指標として公開しており、2026年9月30日に稼働していたバージョンはv4.3.2だった — AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。本記事に登場する3つのOpenAIモデルはすべてこの同じバージョンに基づいているため、以下の比較は、ベンダー自身の発表表では決してそうならない形の、同一条件比較になっている。このボードはまた、そのモデルについて把握しているリリース日 — 2026-09-29、DevDayの日付 — を記録し、それをmax-effort構成で評価している。これは、ページが自身の見出しで挙げている設定である。
• インテリジェンス指数 — GPT-6.1 Sol(max)は51.8、GPT-6 Astra(max)は52.7、GPT-6 Sol(max)は47.5。
• インデックスタスクあたりのコスト — GPT-6.1 Solは0.72ドル、Astraは3.26ドル、GPT-6 Solは1.05ドル。これは、インデックス評価を1回フルで実行するのにいくらかかったかについてのボード自身の数字であり、料金表ではない。
• 実行で消費した出力トークン — GPT-6.1 Solは6,720万、Astraは6,000万、GPT-6 Solは7,680万。AA自身の解説では、ボード中央値の8,200万に対して6,700万を「かなり簡潔」と評しており、これは置き換えるモデルに対する、より地味な2つ目の勝利である。
• 出力速度 — GPT-6.1 Solは毎秒66.8トークン、Astraは57.0、GPT-6 Solは76.2。
• ボードが掲載している価格 — GPT-6.1 Solは100万トークンあたり入力2.00ドル、出力10.00ドル、キャッシュ済み入力は0.10ドル、キャッシュ書き込みは2.50ドル。これら4つの数字はベンダーの価格ページと完全に一致しており、この行で最も劇的でなく最も有用な点はそこにある。すでに引用した料率の独立したリストであるということだ。
数字が弾薬として使われる前に、一つ前置きを。AAのインデックスは10件の評価で構成されており、OpenAIが自社の発表の冒頭に掲げた評価——DeepSWE v1.1、OSWorld 2.0、Terminal-Bench Science 0.1——はそこに含まれていない。AAは独自のAutomationBench派生版を運用しているが、これはベンダーが引用したAutomationBenchの版と同じハーネスではない。したがって、独立した記録はローンチ投稿の4つの主要主張を裏付けるものでも反証するものでもない。それは大きく異なるタスク群を測定しており、あの特定の文に対する判定というより、モデルの輪郭に対するセカンドオピニオンとして読む価値がある。
Astraは依然として、1ポイント未満の差で、4.5倍の金額を払って勝っている。

両モデルはともにエフォートの階段を公開しており、ボードは今や双方の各段についてスコアと実行コストを公表している。並べてみると、その階段は単一の見出し比較では示せないことを物語っている。GPT-6.1 Solの最良構成は、Astraの最良構成と競合しているのではない。Astraの2番目に良い構成と競合しているのだ。
• GPT-6.1 Sol, max — 51.8、インデックスタスクあたり$0.72。GPT-6 Astra, max — 52.7、$3.26。
• GPT-6.1 Sol, xhigh — 51.0、$0.39。GPT-6 Astra, xhigh — 52.4、$2.31。
• GPT-6.1 Sol, high — 50.2、$0.32。GPT-6 Astra, high — 50.9、$1.73。
• GPT-6.1 Sol, medium — 47.8、$0.21。GPT-6 Astra, medium — 49.6、$1.54。
• GPT-6.1 Sol, low — 42.1、$0.13。GPT-6 Astra, low — 45.8、$0.82。
Astraはあらゆる段階でリードしており、それはこの対決を正直に要約したものであり、同時にその最も面白くない部分でもある。面白いのは交換レートだ。GPT-6.1 Solのベストを上回る、最も安価なAstra構成を求めるなら、それはxhighのAstraだ。スコアは52.4対51.8、価格は2.31ドル対0.72ドル。これは評価実行1回あたり1.59ドル多く支払って、インデックスポイント0.56分を得るということだ。スコアの1パーセント未満のために、コストはおよそ3.2倍になる。逆に動かしてGPT-6.1 Solをxhighまで下げると、0.8ポイントを犠牲にする一方で請求額は0.39ドルに下がる。これはAstraのxhighより5.9倍安く、Astraの最大エフォート実行の9分の1だ。
同じラダーには、Astraを最大エフォートで購入することに反対する第二の読み方がある。Astraの下位4段はすべてそのmaxより安く、xhighはmaxより0.29ポイント低いだけだ——実行コストを29%削減する代わりに、スコアは0.5%強しか落ちない。このペアに関する調達の会話が「Astraをmaxで」から始まり「Astraは4.5倍のコスト」で終わるなら、Astra自身のより安い段を比較から外していることになる。
6件の評価はAstraへ、2件はGPT-6.1 Solへ、2件は引き分け
総合スコアは分裂を隠している。最大努力で評価ごとに採点すると、GPT-6.1 Sol は一様にわずかに劣る Astra ではない——2つの点では優れ、6つの点では劣る。
• GDPval-AA — GPT-6.1 Sol は Elo 1575.1 対 Astra の 1541.9 で、専門業務タスクでは 33 ポイントのリード。これは、より安価なモデルにとって最大の単独の独立した勝利です。
• AA-LCR v1.1、長文コンテキスト推論 — 0.830 対 0.807。GPT-6.1 Sol がリード。
• AA-Briefcase v1.1 — Elo 1564.2 対 1568.9。Astra が 4.7 上回る。
• AutomationBench-AA — 0.649 対 0.685。Astra が 3.6 ポイント上回る。
• Terminal-Bench 4.0 — 0.561 対 0.591。Astra が 3.0 ポイント上回る。
• SciCode — 0.542 対 0.565。Astra が 2.3 ポイント上回る。
• Humanity's Last Exam — 0.529 対 0.547。Astra が 1.8 ポイント上回る。
• AA-Omniscience — 41.5 対 43.4。Astra が 1.9 ポイント上回る。
• GDP.pdf と CritPt — それぞれ 0.310 と 0.317 で、両モデルとも完全な同点。
それらの行のうち2つは、リスト内での位置が示す以上に価値がある。GDPval-AAのマージンは、より安価なモデルの優位性がハーネスの変更に耐えられるほど大きい唯一の箇所であり、それはまさにベンダーのポジショニング文言が主張するワークロード——プロフェッショナルで文書の多い仕事——に当てはまる。そして、2つの完全な同点は最も差の小さい評価にあり、これは0.84ポイントの総合的な差が、個別には33ポイントの勝利から3.6ポイントの敗北までの範囲に及ぶ行から組み立てられていることを思い出させる。
従来のモデルと比較すると、その向上は確かなものだが、一様ではない
すでに本番環境でGPT-6 Solを運用している人にとって重要な比較は、6.1 Solが自らの前身に対して行う比較であり、その点について独立した記録はベンダーの投稿よりも鋭い。10件の評価のうち8件は改善する。2件は後退する。
• SciCode — GPT-6.1 Solは0.542を記録し、GPT-6 Solは0.576だった。新しいモデルは科学的コードにおいて3.5ポイント劣っている。
• AA-LCR v1.1 — 6.1 Solは0.830、GPT-6 Solは0.837。長文コンテキスト評価において、紙一重だが、方向は逆。
• AA-Omniscience — 41.5対27.1。これはこの行で最大の変動だ。知識評価で14.4ポイントの上昇であり、そのセットでの正答率は0.545から0.621へ上昇している。
• 同じセットでのハルシネーション率 — GPT-6.1 Solは0.543で、GPT-6 Solの0.601から低下し、依然としてGPT-6 Astraの0.513を上回っている。AA-Omniscienceはスコアを「正解」と「自信満々の誤り」に分けるが、その内訳こそが6.1リフレッシュの存在意義だ。Solよりも意味のある程度に不誠実さが少ないモデルであり、それでも3モデルの中で最も不誠実である。
• Terminal-Bench 4.0 — 0.561対0.439、12.2ポイントの向上。 AA-Briefcase — Elo 1482.8から1564.2。 GDP.pdf — 0.248から0.310。
解釈としては、これは推論の刷新というより、知識とツールの刷新だった。最も大きく動いた評価は、物事を知っていて、それをでっち上げないことを評価するものだ。下落した評価は、狭く技術的なものだ。キャッシュ節約のために 6.1 Sol に移行した人は、知識の向上をボーナスとして得るものであり、それが自分が実行するすべてのハーネスに及ぶと想定すべきではない。
取締役会がそれをどこに位置づけるか、そしてその上に何があるか

リーダーボードのデフォルトのIntelligence Index順では、最大エフォートのGPT-6 Astraが7位、最大エフォートのGPT-6.1 Solが10位、最大エフォートのGPT-6 Solが20位に位置する。GPT-6.1 Solより上の9行は、2つのAstra構成、3つのClaude Opus 5.5構成、1つのClaude Sonnet 5.5構成、2つのClaude Fable 5.1構成だ。つまり、GPT-6.1 Solが最も近い位置にあるモデルは自ファミリーのフラッグシップであり、その順位で実際に置き換えたモデルは、13位下にある自身の前身である。
エフォート設定を外すと、順位はコスト計画にとって重要な形で圧縮される。GPT-6.1 Sol は xhigh で13位、high で15位、medium で19位、low で35位なのに対し、Astra は high で14位、medium で16位、low で26位に位置する。言い換えれば、GPT-6.1 Sol の xhigh はボード上で Astra の high より上位であり、GPT-6.1 Sol の medium は Astra の low より上位だ。少なくともこの2つの中では、ここではエフォートの方がモデル選択よりも大きなレバーになる。
その番号、正直どうすればいいんだろう
この行が検証したベンダーの主張は、GPT-6.1 Solがフラッグシップとほぼ同等の性能を約5分の1の価格で実現するというものだった。その文の独立したバージョンは次のとおりである。フラッグシップとの差は0.84インデックスポイント以内であり、そのスコアの背景にある評価実行にかかったコストはフラッグシップの22%だった。これは主張に十分近く、誰もそれによって誤解されたと感じるべきではない。そして、買い手にとって重要なあらゆる面で「未検証」よりも強い陈述である。
この行が行わないのは、あなたのワークロードの価格設定です。インデックスの実行はタスクの特定の組み合わせであり、実際の数値を決めるのは、あなた自身のトークンプロファイルに対するレートカードです。だからこそ、キャッシュの行こそがモデル化すべき対象なのです。GPT-6.1 Solのキャッシュ入力$0.10に対してAstraは$1.00 — これはインデックススコアが一切触れない10倍の差です。当社側でも同じパススルーが適用されます。OrcaRouterはGPT-6 Astra、GPT-6 Sol、GPT-6 LunaをOpenAI自身の定価で、マークアップを一切加えずに提供しています。そのため、ベンダーの料率が動けば、二つ目の契約を待つことなく当社側の料率もそれに合わせて動きます。GPT-6.1 Solは当社のルートにはありません — 公開カタログについては「モデルが見つかりません」を返しており、openai/gpt-6.1-sol本日時点で、提供できないモデルを正直に説明する方法はありません。今すぐ1つのAPIキーで買えるものは、ベンチマークが実際に議論しているあのペアです — 最も困難な作業にはAstra、大量処理にはSol — プロバイダーの定価はマークアップなしでパススルーされ、いずれかのプロバイダーがエラーを起こした際にはプロバイダー間で自動フェイルオーバーします。
この点をさらに鋭くするには、2つのことが必要だ。同じモデルに対する2つ目の独立したハーネスがあれば、GDPval-AAの優位がモデル固有の性質なのか、それともその評価固有のものなのかが分かる。そしてそれは、この行で欠けている最も有用な単一のデータ点だ。また、272,000トークンの長コンテキスト階層を独立に測定することは、もう1つの総合点よりも重要になる。というのも、このファミリーの価格が安くなくなるのはまさにそこだからだ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
