『GPT-Live-1 vs Cartesia Sonic 3.6』のヒーロータイトルカード。サブタイトルは「最高の音質に聞こえる声は、あなたの声が聞こえる声ではない」。3枚のカードを掲げ、それぞれに「Cartesia Sonic 3.6:Elo 1,275、Artificial Analysisの音声アリーナ両方で1位」「GPT-Live-1:Speech to Speech Indexで70.3%、14中同率6位」「評価ボードが異なるのは、測っているものが違うから」と記され、その下のフッター帯には「アリーナ数値はArtificial Analysisによる。GPT-Live-1のインタラクティブ性数値はOpenAI報告。」とある。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

GPT-Live-1 対 Cartesia Sonic 3.6:首位のTTSボードは割り込みを測定していない

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Cartesia Sonic 3.6は現在、Artificial Analysisの2つのテキスト読み上げアリーナの両方で首位に立っています — Provider VoiceボードでElo 1,275、Controlled Voiceボードでも1位で、より大きなプラットフォームを擁するあらゆる商用エンジンを上回っています。GPT-Live-1はどちらでもランクインしていません。テキスト読み上げモデルではないからです。同モデルは、別のArtificial AnalysisボードであるSpeech to Speech Indexで14台中同率6位、70.3%です。この2つの事実を合わせて読むと、これらの製品の実際の違いが浮かび上がります。Sonic 3.6は非常に高い確率でより優れた音声であり、GPT-Live-1は2つのうち、発信者が話し始めたことと止めたことを聞き取れる唯一の製品です。

どちらも稼働中で、どちらも商用利用可能だ — Sonic 3.6 は Cartesia 自身の API で、安定版スナップショットが2026年8月27日に公開されて以来、GPT-Live-1 は OpenAI の開発者 API で、2026年9月10日以降、音声1分あたり0.05ドルで提供されている。両者を選ぶことは品質の判断ではない。それは、音声エージェントのどちらの半分を買っているのかという判断だ。

2つの舞台、2つの問い、そして分断が現実である理由

Artificial Analysisは、どちらのEloを引き合いに出される前に理解しておく価値のある方法で音声ボードを運営している。Provider Voiceアリーナは、各ベンダー自身のネイティブ音声を使ってエンジンを順位付けする——実際にすぐ使える状態で得られる音声を測定しており、それは購入者が気にする数値だ。Controlled Voiceアリーナは、すべてのモデルを同じ8つの参照音声にクローンし、聴き手が音声の才能ではなく合成エンジンを比較できるようにする。Sonic 3.6は両方をリードしており、これは聞こえほど珍しいことだ。2026年の大半を通じて、この2つのボードは異なる王者を擁してきた。

どちらのボードにも、モデルが中断されるサンプルは1つも含まれていない。それらは、音声が単独で聞き手にどう聞こえるかを測定している。Speech to Speech Index は別の作りだ — 音声推論、エージェント性能、アリーナ選好、タスク成功率を1つの数値に重み付けし、ネイティブに音声対音声であるモデルしか受け入れない。Cartesia はそこにエントリーがない。Sonic 3.6 が悪いからではなく、テキスト読み上げエンジンには提出するものがないからだ。

つまり、1,275と70.3%は競合する数字ではなく、それらを同じ一本の線上に並べる比較は、静かにあなたに嘘をついている。両者がそろって示しているのは、品質がもはやこの判断を左右する軸ではなくなったということだ。

A screenshot of the Artificial Analysis Speech to Speech Index chart, ranking fourteen natively speech-to-speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7% and Gemini 2.5 Flash at 52.8%. A companion panel charts cost per hour of input audio across the same field.

次元ごとに

• 種類 — GPT-Live-1: 全二重の音声対音声、ループ全体を単一モデルで処理 対 Cartesia Sonic 3.6: ストリーミング音声合成、エージェント向けに Ink-2 音声認識と組み合わせ

• 独立した品質 — GPT-Live-1: Speech to Speech Indexで70.3%、14中同率6位。一方、Cartesia Sonic 3.6: Provider Voiceボードで1,755サンプルから1,275 Elo、さらにControlled Voiceボードでも1位

• 割り込み処理 — GPT-Live-1: モデルの特性であり、1秒間に何度も、ターンを譲るかどうかを判断する。一方、Cartesia Sonic 3.6: 統合パターンであり、クライアントが合成コンテキストをキャンセルし、単語レベルのタイムスタンプに依拠して適切なタイミングでカットする。

• 価格 — GPT-Live-1: 音声1分あたり$0.05、秒単位で請求、推論バックエンドは別途従量課金 vs Cartesia Sonic 3.6: クレジットプランで100万文字あたり約$49、さらにエージェント通話時間1分あたり$0.06、Cartesia電話番号1分あたり$0.014

• レイテンシ — GPT-Live-1:モデルレベルの数値は公表されていない。ターン交代レイテンシは、OpenAI自身のテストで0.798秒とされている。一方、Cartesia Sonic 3.6は初回音声出力までの時間が90ミリ秒未満(ベンダー公表値であり、エンドツーエンドで独立に測定されたものではない)。

• スループット — GPT-Live-1:同時セッション数は、tier 1で25、tier 5で500が上限で、無料枠はなし。一方、Cartesia Sonic 3.6:1秒あたり約132文字で、同じ比較条件下ではElevenLabsのv3の約2倍のレート、無料枠は月間20,000クレジット

• 言語 — GPT-Live-1:ローンチ時の対応範囲では主要言語以外での流暢さが不均一。一方 Cartesia Sonic 3.6:61 のロケールにわたる 44 言語で、今回のリリースではオリヤー語とウルドゥー語が追加されました

• 音声コントロール — GPT-Live-1:12種類のプリセット、プロンプティングによるトーンとペース、クローニング非対応 vs Cartesia Sonic 3.6:500以上のプリセット音声、インスタントクローニング、上位ティアでのプロフェッショナルクローニング、単語と音素のタイムスタンプ、そしてSSML非対応 — モデルはテキスト自体からペースを適応させる

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Cartesia Sonic 3.6 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Voices: 12 presets, no cloning'. The right column, labelled Cartesia Sonic 3.6, reads 'Kind: streaming text-to-speech', 'Price: ~$49 per 1M characters, plus $0.06 per agent minute', 'Time to first audio: under 90 ms, vendor-stated', 'Throughput: ~132 characters per second', 'Independent score: 1,275 Elo, #1 on the AA Provider Voice arena', 'Voices: 500+ presets, cloning, word timestamps'. The footer reads 'Sonic 3.6 latency vendor-stated; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

バージインはアーキテクチャの機能であり、チェックボックスではない

この比較について購入検討者が最もよくある誤りは、割り込み対応をブール値として捉えてしまうことです。Cartesiaのドキュメントは自社方式の仕組みについて率直で、発信者がエージェントに被せて話したとき、クライアントは現在の合成コンテキストに対するキャンセルを送信し、WebSocket接続で返される単語レベルのタイムスタンプによって、正しい音節で再生を停止できます。これは優れた設計であり、今日のほとんどの実運用音声エージェントがバージインを処理する方法でもあります。

それは依然として、話すのをやめるという判断を、音声アクティビティ信号を使い、ラウンドトリップが許すどんな遅延であれ、あなたのアプリケーションが下す設計です。GPT-Live-1 はその判断をモデルの内部に移します。聞き続けるか、一時停止するか、ターンを取るか、それとも相手に譲るかを絶えず判断しており、だからこそ OpenAI 自身の数値は、Full Duplex Bench v1.5 において、GPT-Realtime-2.1 の 45.4% に対して 80.1% のインタラクティビティを報告し、ターンテイキング遅延は 1.41 秒に対して 0.798 秒となっています。これらの数値は OpenAI 自身のもので、リリース時に公開されたものであり、同社外の誰によっても再現されていません — しかし、その背後にあるアーキテクチャ上の違いに異論はなく、それはカスケードがチューニングによって近似できない唯一の点です。

カスケードが強みを発揮するのは、文より下流のすべての工程だ。Cartesiaの90ミリ秒未満という初回音声出力までの時間はベンダー公表値であり、モデルを測ったものであって、会話を測ったものではない。発信者が体感する数値には、音声認識、ターン検出、言語モデルの生成時間、ネットワーク転送、音声バッファリングも含まれる。まさにそれが、各段階を制御する必要があるときにカスケードを構築する価値がある理由だ。単純なターンには高速な小型モデル、難しいターンにはフロンティアモデル、そして決して待たせない音声合成器である。

その中間段階は、どちらのスタックにおいても真にポータブルな唯一の部分であり、通話の品質とコストの両方を決める部分でもある。およそ 11社の上流プロバイダーが提供する190モデルが、プロバイダーの定価で、マークアップゼロの1つのOrcaRouterキーの背後に位置し、ルーティングDSLを使えば、単一のエンドポイントが簡単なターンを安価なモデルに送り、複雑なターンをフロンティアモデルへエスカレートできる — これはボイスエージェントが実際に望むパターンを、最も変動の大きい段階に適用したものだ。Sonic 3.6もGPT-Live-1もルーティングレイヤーを介して到達することはできない。ボイスレイヤーは各ベンダーに属している。

A screenshot of Cartesia's official Sonic 3.6 product page, showing the post title 'Introducing Sonic-3.6' dated Aug 27, 2026, the claim that listeners preferred it in up to 93% of blind head-to-head tests across fifteen locales, and the statement that Sonic-3.6 'takes #1 on the Artificial Analysis leaderboard across both the controlled and provider voice boards'. Below it, an embedded Controlled Voice leaderboard lists Sonic 3.6 first ahead of Sonic 3.5, Eleven v3, StepAudio 2.5 and Realtime TTS 1.5.

資金を運用する

2つの料金モデルは一致していないので、換算はきちんと行う価値があります。音声はおよそ毎分150語で、英語は1語あたり平均約5.5文字なので、1分の音声出力は約800~900文字になります。100万文字あたり49ドルでは、Cartesiaの音声合成は音声1分あたり約4セントかかります。

続いて、カスケードの残りがやってくる。Cartesia は音声エージェントの通話時間1分につき0.06ドル、同社の電話番号を使う場合は1分につき0.014ドルを、文字数に加えて請求する。さらに音声認識と、テキスト用の言語モデルを追加すれば、誰かが難しいことを口にする前に1分10セントを超える。GPT-Live-1 の音声1分0.05ドルは、聞き取り、ターンテイキング、発話をカバーし、委譲された推論はバックエンドモデルの通常料金で別途請求される——検索が1回か2回付く予約通話では、それは丸め誤差ではなく、実際に無視できない数字になる。

分岐点は通話量と難易度にある。短く、反復的で、通話量の多い通話——確認、通知、単純な検索——はカスケードに有利だ。なぜなら、台本どおりの質問に答える安価なモデルは、この比較で最も安価なものだからだ。発信者が台本から外れる、エージェントに被せて話す、話の途中で気が変わるといった通話は、エンドツーエンドモデルに有利だ。なぜなら、そこでのカスケードの失敗モードは、誤った回答ではなく、ぎこちない回答だからだ。

どちらを選ぶべきですか

利用可能な中で最高スコアの音声を求め、会話ロジックを自分で担う用意があるなら、Cartesia Sonic 3.6 を選びましょう。ナレーション、大量のスクリプト化されたエージェント、既存の音声認識パイプラインを持つチーム、そして正確な割り込み処理を可能にする単語レベルのタイムスタンプを必要とする人にとって、これは最適な選択です。無料枠、500以上の音声、クローニング、44言語、両方の品質ランキングでの首位が得られ、しかもすべての段階を自分で管理できます。

割り込みが製品そのものなら、GPT-Live-1 を選べ。遮られて話をかぶせられるのが例外ではなく通常のケースであり、誰もまだ尋ね終えていない文に対して 90 ミリ秒で応答を始めるよりも 0.8 秒のターン引き継ぎのほうが勝る、あらゆる場面で。12 種類の音声を備え、クローニングができず、クローズドでホスト型の分単位課金モデルを受け入れ、その独立した品質スコアが中位であることも受け入れる。

1,275を70.3%と突き合わせて、これで決着と思う誘惑に駆られる。だがそうではない。そして、その二つの数字の違いこそが議論のすべてだ。一方は声がどう聞こえるかを測り、もう一方は話しかける価値があるかどうかを測っている。