GPT-Live-1 Speech to Speech Indexの記事のタイトルカード。上位3スコアを表示:GPT-Live-1とGPT-6 Astra(medium effort)が81.5、Grok Voice Think Fast 2.0 Highが81.3、GPT-Live-1とGPT-5.6 Sol(low effort)が80.1。
Guides & Insights

GPT-Live-1、81.5でSpeech to Speech Indexの首位に —— だがその順位はバックエンドのもの

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

GPT-Live-1は、2026年7月8日にChatGPT内で最初に搭載された全二重音声モデルで、現在はArtificial Analysis Speech to Speech Indexで81.5を記録して首位に立っている。この行が存在するのは、このモデルが思考を行う先としてGPT-6 Astraを指定されたからにほかならない。同じ音声フロントエンドを、委任バックエンドにGPT-5.6 Solを使い、低い推論エフォートで実行すると、80.1で3位となる。2位は81.3でGrok Voice Think Fast 2.0 Highのものだ。

数字の前に、正直なことを2つ。このモデルは新しいものではない。GPT-Live-1は、ChatGPTのデフォルト音声として2か月を過ごした後、2026年9月10日に開発者向けAPIに到達した。新しいのは、9月15日時点の測定として、外部の評価者がこのモデルを採点したという点だ。これは、これまでのこのモデルに関するあらゆる記事に欠けていた唯一のもので、私たち自身の記事も含まれる。そこでは、入手できる数字といえばOpenAIが自社について公表したものだけだった。そして、2位との0.2ポイント差は、GPT-Live-1自身の2つの構成の間にある1.4ポイントの差よりも小さい。これがこの表で最も有用な数字だ。

つまり「GPT-Live-1は最高の音声モデルだ」という見出しは、この指標が述べていることとは必ずしも一致しない。指標が述べているのは、GPT-Live-1にGPT-6 Astraを中程度のエフォートで組み合わせたものが0.2ポイント差で最高だということであり、バックエンドの選択は、競合するどのモデルよりも結果を大きく左右するということだ。

インデックスが実際に測定しているもの

Artificial Analysis は Speech to Speech Index を、4つの要素の等加重合成として構築している。すなわち、Big Bench Audio で測定される Speech Reasoning、τ-Voice で測定される Agentic Performance、ペアワイズの人間選好 Elo である Arena Preference、そして Task Success Rate だ。4要素すべてが利用可能なモデルのみが指数値を受け取り、それ以外はすべてダッシュで表示される。そのため、表の行数はスコア数よりはるかに多い。指数自体は2026年6月23日に開始され、その後2回改訂されており、直近では Conversational Dynamics を Task Success に差し替えた。したがって、ある改訂版のスコアは別の改訂版のスコアと厳密には比較できない。

ランキングを読む際には、さらに2つの方法論上の詳細が重要です。Arena Elo は、モデルが初めて公開可能になった時点の値で凍結されるため、選好コンポーネントは、今日最高であることよりも、早く登場したことを評価します。また、この指標は単一のモデルではなくシステム全体を採点します。GPT-Live-1 の場合、その数値は音声フロントエンドと、処理を委ねるバックエンドモデルを合わせたものを対象にしています。これは意図的な設計上の選択であり、同じモデルが異なるスコアで2回登場する理由でもあります。

公開時点のフィールドの先頭:

• GPT-Live-1 (Astra, medium) — インデックス81.5、首位

• Grok Voice Think Fast 2.0 High — インデックス 81.3、2位

• GPT-Live-1(Sol、low) — インデックス80.1、3位

• GPT-Realtime-2.1 High — インデックス73.9、4位

• GPT-Realtime-2 High — 指数 73.6、5位

• Grok Voice Think Fast 1.0 — インデックス72.3、6位

• Gemini 3.1 Flash Live High — インデックス71.5、7位

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

参考までに言えば、GPT-Live-1 が置き換えるモデルは、それより 7.6 ポイント下に位置している。それは紛れもない世代間の差であり、議論の余地はない。

0.2ポイントの勝利は、まさに1つのコンポーネントによるものだ

複合スコアを分解すると、上位2モデルは同じ種類のモデルには見えなくなる。各構成要素について、Artificial Analysisによれば:

• エージェント性能(τ-Voice)— GPT-Live-1 67.9% 対 Grok Voice Think Fast 2.0 High 56.5%

• 音声推論(Big Bench Audio)— 90% 対 97%

• タスク成功率 — 87.4% 対 94.6%

• アリーナElo — 1048 対 1011

• 初回音声までの時間 — 1.34秒 vs 0.70秒

• 1時間あたりのコスト、バックエンド込み — $5.83 対 $4.80

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

GPT-Live-1は6つの行のうち2つで勝ち、4つで負けているが、それでも指標では首位に立つ。その算術は謎ではない。τ-Voiceの差は11.4ポイントで、表にある他のどの差よりもはるかに大きく、等しい重み付けの下では、それが合成スコアを首位ラインの向こうへ引きずり込む。率直に言えば、GPT-Live-1はより優れたエージェントであり、Grok Voice Think Fast 2.0 Highはより優れた聞き手であり、より速いほうだ——そして指標は、GPT-Live-1が得意とするものに、それを1位にするのに十分なほど大きな重みをたまたま置いているのだ。

あなたの製品が予約・解決・取引を行う音声エージェントなら、11.4ポイントのτ-Voiceのリードが、あなたの体験を予測する数字だ。あなたの製品が、瞬時に感じられ、ユーザーを決して遮ってはならない会話なら、0.70秒の初回音声までの時間が、あなたの体験を予測する数字であり、Grokがそれを約2倍の差で制している。規制対象のタスク実行には、第二の警告がある。Grokの94.6%というタスク成功率は、表示されている表の中で最高であり、GPT-Live-1の87.4%は、およそ8件に1件のタスクが完了しないことを意味する。どちらも前世代からの改善だ。どちらも解決済みの問題ではない。

#1 の行はモデルではなく、ルーティング設定です

ここに、リーダーボードの順位よりも注目に値する部分がある。GPT-Live-1は全二重の音声レイヤーであり、聞くこと、話すこと、割り込み、ターンテイキングを自ら処理し、会話が続く間、推論、ツール呼び出し、検索を別のバックエンドモデルに委任する。Artificial Analysisはそれらの組み合わせのうち2つを別々のエントリーとして採点した。medium effortのAstraは81.5を出した。low effortのSolは80.1を出した。

その1.4ポイントの開きこそが物語っている。1位と2位の差は0.2ポイント。GPT-Live-1のスコアが付いた2つの構成の差は、その7倍だ。それらの行の間で音声モデルについては何も変わっていない——変わったのは、思考を担っていたモデルと、そのエフォートレベルだけだった。システムを順位付けするリーダーボードは、構成こそが製品であると、正確に告げている。

これは私たち自身の報道も修正することになる。2026年9月11日、私たちはこの指数でGPT-Live-1を69.8%と記録し、GPT-Realtime-2.1とGrokの両方に後れを取っていた。それは当時利用可能だった測定値であり、ある合理的な結論を支持していた——OpenAIが構築したのは最高の会話の仕組みであり、最高の音声エージェントではなかった、という結論だ。この指数には現在、委任されたGPT-Live-1の構成が2つ、81.5と80.1で掲載されている。Artificial Analysisは変更履歴を公開しておらず、8月に指数の構成要素を改訂しているため、以前の数値がスコア未算出または部分的にしかスコアが算出されていない構成だったのか、それとも旧来の重み付けでの実行だったのかを断言することはできない。観察できるのは、委任されたペアリングが現在それぞれ独立した完全な行として表示されていること、そしてそれらがそうなったときに答えが変わったことだ。

実用的な結論は、「どの音声モデルか」は誤った問いであり、「どの音声モデルに、どのバックエンドを、どの程度のエフォートで組み合わせるか」が正しい問いだということです。それはルーティングの問いであり、まさに私たち自身の製品が答えるために存在する問いです。 OrcaRouterは、GPT-Live-1の委任バックエンドであるGPT-6 Astraを、200以上の他のモデルと同じOpenAI互換エンドポイントを通じて公開しています。したがって、思考レイヤーの差し替えは統合ではなくモデルIDの変更です。その ルーティングDSL は、複数のモデルを1回の呼び出しに組み合わせ、自動フェイルオーバーにより、実績のない組み合わせが本番の賭けになることはありません — バックエンドが劣化した場合、リクエストは失敗するのではなく別の場所に送られます。私たちが行わないことについて正確に言うと、GPT-Live-1自体は私たちのカタログにはなく、私たちはそれを提供していません。その委任先のバックエンドは別問題です。

これの1時間あたりの費用はいくらですか

GPT-Live-1のフロントエンドは音声1分あたり0.05ドルで課金され、秒単位で請求されるため、オープン回線1時間で3.00ドルになります。それは請求額のすべてではありません。委任された推論、ツール呼び出し、ウェブ検索は、バックエンドモデルが課金するレートで別途従量課金されます。Artificial Analysisは総額を測定しており、だからこそそのコスト列を使うべきです:

• GPT-Live-1(Sol、low)— 1時間あたり$4.47

• Grok Voice Think Fast 2.0 High — 1時間あたり4.80ドル

• GPT-Live-1(Astra、medium) — 1時間あたり5.83ドル

• GPT-Realtime-2.1 High — 1時間あたり$10.75

ランキング首位のものは、現在の3つの選択肢の中で最も高価であり、勝利した構成は3位になった構成より1時間あたり30%も高い。逆に読むと、その内訳は示唆に富む。1時間ごとのうち3.00ドルは音声レイヤーで、残り — Solでは1.47ドル、Astraでは2.83ドル — はバックエンドトークンだ。思考レイヤーは請求額の3分の1から2分の1の間にあり、リーダーボードが脚注扱いするコンポーネントとしては大きな割合だ。

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

とはいえ、それが置き換えるモデルと比べると、ファミリー全体でおよそ半額だ。毎分0.05ドルのフロントエンドは、パッケージの作り直しではなく、本物の値下げである。バックエンドのトークンはバックエンド料金で課金されるため、GPT-Live-1導入のコストは主に、どの推論モデルにルーティングするかで決まる。バックエンドにはOpenAI自身のモデルも、サードパーティのモデルも使える。OrcaRouterでは、そうしたバックエンドはプロバイダーの表示価格のままマークアップ0%でパススルーされるので、思考レイヤーにおけるベンダーの価格変更は、次の請求サイクルではなく当日に反映される。

インデックスが解決しないこと

推測ではなく情報源によって明示された3つの注意点がある。GPT-Live-1の両エントリとGrok Voice Think Fast 2.0 Highは、いずれも単一試行に基づくものとしてフラグが立てられている。0.2ポイントの判断には根拠として薄く、再実行すれば、どちらのモデルにも何も変化がないまま1位と2位が入れ替わりうる。Arena Eloは、指摘されているとおり、各モデルの最初の公表可能な測定時点で凍結されていた。そして、この指標には、これらのシステムが長時間の通話でどう振る舞うかに関する項目がない。構成要素は設計上短い時間軸のものである一方、本番環境で音声エージェントを実際に使い物にならなくする故障モードは、20分の会話にわたるドリフトである。

別途、インデックスではなくベンダーから:GPT-Live-1のAPIは、画像入力や動画入力なし、構造化出力なし、無料枠なしで提供開始され、そのレート制限は1分あたりのリクエスト数ではなく同時セッション数でカウントされます。これらはローンチ時点の制約であり、すでに変わっている可能性があります。それらを前提に設計する前に確認してください。

これをどうすればいいですか

今週、モデルではなくアーキテクチャを選ぶなら、このインデックスはエージェント作業では委任パターンを、レイテンシではカスケードパターンを評価します。GPT-Live-1 の 81.5 は、会話と推論を分離することが、タスクを完了する音声エージェントにとって正しい構成であることを示す、これまでで最も強力な証拠です。Grok Voice Think Fast 2.0 High の 81.3 は、最初の音声まで 0.70 秒、タスク成功率 94.6% を伴い、委任型の構成が機能する唯一のものではないこと——そして、まだ最速ではないこと——を示す最も強力な証拠です。

数字から導かれる判断は、見た目よりも安くつく。GPT-Live-1の両方の構成と、6つの構成要素のうち4つでそれに勝ったモデルは、時間あたり1.36ドル以内の差に収まっている。その差なら、正しい行動はリーダーボードを読むのをやめ、自分の文字起こしを両方に通してみることだ。指標はトレードオフの形を教えてくれるが、あなたのユーザーがそのどちら側にいるかまでは教えてくれない。

その数字が招く疑問

GPT-Live-1は今、最高の音声モデルですか?

総合スコアで見れば、その通りです — 0.2ポイント差で、しかも単一の試行に基づいています。コンポーネント別で見ると、何を構築しているかによって完全に異なります。エージェント性能とアリーナ選好ではリードし、音声推論、タスク成功率、初回音声出力までの時間では劣っています。1つの11.4ポイントのコンポーネント優位に支えられた0.2ポイントの総合リードは、正当化できる1位ではありますが、決定的な1位ではありません。

81.5を出すにはGPT-6 Astraを使わなければならないのですか?

その正確な行について言えば、はい — 81.5 は、Astra を中程度の推論エフォートで構成した GPT-Live-1 のものです。低エフォートの Sol は、80.1 で 1 時間あたり 1.36 ドル安いという記録済みの代替案です、また、OpenAI はサードパーティ製モデルをバックエンドとして持ち込むことをサポートしているため、リーダーボードのエントリは唯一の選択肢ではなく、曲線上の 2 点です。どの組み合わせがあなたのワークロードに最適かは、公開インデックスがあなたに代わって答えられるものではありません。

なぜ同じモデルが、以前の記事では69.8、今回の記事では81.5というスコアになったのでしょうか。

2つの数値は別々のものを対象にしている。以前の読み取りでは、GPT-Live-1 をインデックス上で単一のエントリとして位置づけていた。現在の表では、その2つの委任構成を、別々の完全にスコア付けされた行として掲載しており、Astra のペアリングは 81.5、Sol のペアリングは 80.1 となっている。Artificial Analysis は8月にインデックスの構成要素を改訂しており、変更履歴を公開していない。したがって、差分はモデルが改善した証拠としてではなく、測定対象が変わったものとして扱い、委任を行うモデルの単一の総合スコアは、構成についての記述として扱うこと。