
GPT-Live-1がAPIに登場:全二重音声が1分0.05ドル、GPT-Realtime-2.1からのドロップイン移行パスなし
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
GPT-Live-1 は9月10日時点で API に登場しており、予算を実際に作り変える数字はベンチマークではなく課金単位だ。OpenAI の全二重音声モデルは現在、音声1分あたり一律0.05ドルで、秒単位で課金される。一方、比較対象となっている GPT-Realtime-2.1 は音声トークンで計量され、入力100万トークンあたり32ドル、出力100万トークンあたり64ドルだった。モデル自体は新しくない。GPT-Live-1 は2026年7月8日に ChatGPT 内で Advanced Voice Mode の後継として提供開始された。新しいのは、開発者がついにこれを呼び出せること、そしてその呼び出し方が、ほとんどのチームがすでに持っている Realtime 統合とはほとんど似ても似つかないことだ。OpenAI 自身のドキュメントでは、音声レイヤーを別個の推論バックエンドと組み合わせており、公開されている WebRTC の例では、そのバックエンドは GPT-5.6 Terra である。
9月10日にリリースされたもの、されなかったもの
APIサーフェスは設計上狭くなっています。モデルIDは gpt-live-1 の1つだけで、これはそれ自体のデフォルトスナップショットでもあります — 固定すべき日付付きバリアントはありません。エンドポイントも1つだけで、Live Sessions エンドポイントは v1/live/sessions にあります。OpenAIOpenAI のプラットフォーム上のその他はすべて、このモデルでは無効化されています:Chat Completions、Responses、Realtime(翻訳および文字起こしのバリアントを含む)、Assistants、Batch、ファインチューニング、埋め込み、画像または動画の生成、音声スピーチまたは文字起こしのエンドポイント、モデレーションのいずれもありません。
入力と出力は音声とテキストです。ストリーミングと関数呼び出しはサポートされていますが、構造化出力、ファインチューニング、予測出力はサポートされていません。画像と動画の入力は明示的にサポートされていません — そのため、OpenAIOpenAI が予告していた「動画付き音声」サーフェスはこのリリースには含まれません。Free ティアではまったく呼び出せず、レート制限は 1 分あたりのリクエスト数ではなく同時セッション数で測定されます。Tier 1 では 25、Tier 2 から Tier 5 ではそれぞれ 50、200、300、500 に増加します。

その同時実行の枠組みは、これがプラグイン互換の代替品ではないことを示す最初の手がかりです。同時進行のライブ会話数で計られるレート制限は、OpenAIOpenAIがスケールの単位を何だと考えているかを示しています。電話回線であって、リクエストではありません。
価格変更こそが、より地味でありながら、より重大な本題である
分単位の一律課金は、まさに大きな転換だ。トークン従量制では、1件の通話を予測する前に音声の消費をモデル化しなければならなかった——1秒の無音が何トークンかかるか、エージェントに被せて話し続ける発信者が出力の長さをどう変えるか、といったことを。1分あたり$0.05なら、計算は掛け算だけに還元される:
• 5分間のサポート通話 — 音声通話時間で$0.25
• 10分の通話 — $0.50
• 1日あたり1,000件の通話で平均4分 — 1日200ドル、月額およそ6,000ドル
• 連続通話1時間 — $3.00
3つの詳細がその点をより明確にします。第1に、通話時間は次の1分単位に切り上げられないため、40秒の通話はまるまる5セントではなく約3.3セントの費用になります。第2に、セッション初期化では冒頭で音声通話時間15秒分が請求されますが、これは後続の通話時間料金から相殺されるもので、上乗せされるのではありません。そのため、15秒未満の通話でも15秒分の料金になります。第3に、音声は請求額の半分にすぎません。バックエンドの推論モデル、そのツール呼び出し、およびWeb検索は、そのモデルの通常料金で別途請求されます。つまり、委譲先を最先端の推論モデルに向け、毎ターン検索させる場合、「安価な音声モデル」を使っていても高額な通話になり得るのです。
その2メートルの構造こそ、ルーティングが単なる便利機能ではなくなる場所です。OrcaRouterでは、GPT-Live-1セッションのバックエンド側は、ただの別のモデル呼び出しにすぎません — おおよそ11社のアップストリームプロバイダーから集めた190のモデルが1つのキーの背後にあり、プロバイダーの定価をそのままゼロマークアップで提供し、選択したバックエンドがエラーを返したりタイムアウトした場合には自動フェイルオーバーが働きます。音声レイヤーそのものをルーティングすることはできません。Live SessionsエンドポイントはOpenAIOpenAI専用だからです。しかし、音声レイヤーが委任するものすべてをルーティングすることは確実にできます。それこそが、発信者がどれだけ深く考えるかに応じてスケールする半分なのです。
WebRTC限定 — あなたのRealtimeコードが移植できない理由
これが移行に伴う実務上のコストであり、ほとんどのローンチ報道はそれに触れていない。GPT-Live-1 のセッションは WebRTC 上で動作し、既存の多くの Realtime 統合が基盤としている WebSocket トランスポートは使われない。GPT-Live モデル ID で古い経路を試すと、セッションには WebRTC が必要だとはっきり告げるエラーが返ってくる。
OpenAIOpenAIのWebRTCガイドによるハンドシェイク:ブラウザはRTCPeerConnectionを開き、マイクのトラックを接続し、データチャンネルを開き、オファーを送信する前にリスナーを登録し、ローカル記述を設定し、ICE収集を待ち、オファーを自分のサーバーに送信します。次にサーバーは呼び出します:POST /v1/live/sessionsを、セッション設定とともに、さらに transport: { type: "webrtc", sdp: ... }。成功するとHTTP 201が返され、session.idとtransport.sdp、ブラウザはこれをリモート記述として適用します。メディアはネゴシエートされたトラック上を流れ、データチャンネル — ラベル oai-events — はトランスクリプト、セッション更新、委任された作業を運びます。通話を終了するには、送信するものは session.close です。そして、session.closed が到着するまで読み続けます。
モニターに貼っておく価値のある注意点が2つあります。HTTP 呼び出し自体がセッションを開始するので、次のものも送信してはいけません: session.start をデータチャネルで。また、そのチャネル経由で入力音声を追加したり、出力音声のデルタを待ったりしないでください — audio.format を設定から外し、SDP に処理させてください。サーバーの例では、リクエスト本文を 64 KB に制限し、ICE 収集は 10 秒後、セッションのファイナライズは 15 秒後にタイムアウトします。
そのどれも難しいことではありません。すべてが新しいコードです。あなたの製品がターン制のリアルタイムエージェントなら、GPT-Live-1 への移行はモデルIDの差し替えではなく、トランスポートの書き直しに加えてデリゲーションの書き直しです。午後の作業ではなく、スプリントとして工数を見積もる価値があります。
ベンチマーク、そしてそれらすべてを実行したのは誰か
以下のすべての数値はOpenAIOpenAI自身によるもので、APIリリース時に公開されたものであり、執筆時点では誰も独立に再現していない。この但し書きは、ここでは通常以上に重要である。というのも、差分が十分に大きいため、確定した事実として引用されかねないからだ。

• 全二重インタラクティビティ — GPT-Live-1 80.1% 対 GPT-Realtime-2.1 の 45.4%
• ターンテイキング遅延 — 0.8秒 対 1.4秒
• ツール呼び出し精度 — 87% 対 60%
• 銀行向け音声サポートベンチマーク、合格率 — 32% 対 12.4%
最後の行を2回読んでほしい。32%の合格率は12.4%からの大幅な改善であり、それでもその評価でシステムがタスクのおよそ3分の2を失敗したことを意味する。インタラクティブ性とツール呼び出しの飛躍こそ、真に異なる製品を物語るものだ。銀行の数字のほうは、音声エージェントが規制対象のワークフローを無人で処理するにはまだどれほど遠いかを正直に示している。
顧客の証拠はベンチマーク表よりも薄いが、同じ方向を指している。Yelpは電話による予約にGPT-Live-1を使用しており、CTOのAlex Levy氏が通話対応の改善について言及している。語学学習プラットフォームのSpeakは、以前のターン制システムよりも割り込みが80%近く少なかったと報告した——結果に利害関係を持つ企業による自己申告の数字であり、それでも入手可能な最も具体的な導入実績の数値である。
音声レイヤーはフロントエンドです。頭脳はあなたが選びます
アーキテクチャ上の賭けは委譲であり、これは今回のリリースの中でルーティング層が自然に収まる部分です。GPT-Live-1は深い思考を行いません。呼び出し元が推論、検索、またはツールを必要とする質問をすると、モデルはタスクを非同期の境界を越えて別のバックエンドに渡し、そのバックエンドは音声会話が続く間も作業を続け、準備ができたら答えを会話に折り戻します。
設定は明示的であり、ドキュメントの例を注意深く読む価値があります。model: "gpt-live-1" と instructions に加えて、セッションはdelegation という型の responses オブジェクトを保持しており、その内部の responses ブロックには、バックエンドモデル、それ自体の instructions、そのツール — 例では web_search を使用 — 、そして tool_choice が指定されています。OpenAIOpeopenAI の公開 WebRTC の例では、そのバックエンドモデルは GPT-5.6 Terra です。

それがこの設計の本当の主張です。バックエンドを差し替えれば、音声モデルを再トレーニングしなくても音声体験はより賢くなる。また、委任バックエンドは音声レイヤーとは違って移植可能だということも意味します。OrcaRouter は gpt-live-1 を取り扱っていません。Live Sessions エンドポイントは OpenAI 専用で、当社はそれを一切ルーティングしていません。しかし委任の半分は Responses API を話し、その半分は完全にあなたが選べます。GPT-5.6 Terra は OrcaRouter 上で OpenAIOpe nAI の定価で稼働中です — 入力100万トークンあたり $2.00、出力100万トークンあたり $12.00、Responses エンドポイントも公開されているので、OpenAIOpe nAI 自身の例にあるまさにそのモデルが、2つ目の契約や SDK なしで1回の呼び出しで使えます。
実際には、これによってバックエンドの選択が設定作業に変わります。1行を編集して通話ごとの請求額を確認するだけで、実際の通話トラフィック上で安価な推論モデルと最先端モデルをA/Bテストできます。あるいは、委任モデルを自動フェイルオーバーの背後に置き、上流側の一時的な不調で電話回線まで一緒にダウンしないようにすることもできます。1分あたり0.05ドルを支払っている音声レイヤーはそのままの位置に残ります。それが委任するものはすべて、11社の上流プロバイダーによる約190のモデルにまたがって、1つのキーを通じて、プロバイダーの定価で、マークアップゼロで実行されます。
まだ足りないものは何か
• 画像や動画の入力はなし — 静止画と画面共有は今回のリリースには含まれていないため、旧来のChatGPTモードが依然として備えるマルチモーダル音声サーフェスは未対応のままとなる
• 構造化出力なし — エージェントがスキーマ検証済みのツール引数を必要とする場合、その検証は音声レイヤーではなく、バックエンドモデル側で行う必要があります
• 無料枠でのアクセスはなく、ファインチューニングも不可 — コストもカスタマイズも有料プランから
• 見出しに挙げたどの数値についても第三者による独立した検証はなし — 上記の数値はすべてベンダー自身が実施したもの
• Tier 1 における同時セッション数の上限は 25 — パイロット運用には余裕があるが、初日を迎えるコールセンターには厳しい
誰が動くべきで、誰が待つべきか
テレフォニー——予約回線、アポイント予約、一次サポート——を構築していて、現在のスタックが定番のASR→LLM→TTSカスケードなら、今すぐ動きましょう。レイテンシと割り込み処理こそ、そのパイプラインが失っているものであり、分あたりの価格はスプレッドシートに入れられるほど予測可能で、OpenAIOpenAI自身のドキュメントにはコピーできるTwilio形式のサーバー例まで載っています。すでにRealtimeモデルを採用していて、あなたの製品がターン制ではなく本当に対話的なものであるなら、こちらも今すぐ動きましょう。割り込み処理はGPT-Realtime-2.1が最も苦手としていた部分だからです。
統合がターン制で動作しているなら、待ってください。トランスポートの書き換えは実際の作業であり、エンドポイントはそれ以外を何もサポートしておらず、既存の WebSocket コードを維持する移行パスもありません。ユースケースが構造化されたツール出力または動画入力に依存している場合も同様に待ってください。ここにはどちらも存在しません。
今後数週間の注目点は、80.1%というインタラクティブ性の数値が初めて独立に再現されるかどうか、$0.05の料金が導入価格なのかどうか、より小型のGPT-Live-1 miniがコンシューマー側でそうだったようにAPIでも利用可能になるのかどうか、そして画像と画面入力がその差を埋めるのかどうかだ。外部のラボがその評価を実施するまでは、正直にまとめれば、これはこれまで開発者向けに出荷された中で最も高性能な音声モデルだが、その主張の裏付けは、それを販売している人々によって書かれている。
