「GPT-Live-1 vs Qwen-Audio-3.0-TTS」のヒーロータイトルカード。サブタイトルは「片方は会話をし、片方はスクリプトを読み上げる」。バッジには「代替品ではない——仕事も請求も別物」とあり、3枚のカードは次のとおり: 「Qwen-Audio-3.0-TTS Plus — Elo 1,232、AA Provider Voice Arena で4位、100万文字あたり$27.6」、「GPT-Live-1 — 音声1分あたり$0.05、全二重、回線を1時間開いて$3.00」、「落とし穴 — ナレーター側で毎秒およそ16文字、テキスト入力で音声出力」。その下のフッターストリップには「Qwen の数値は Artificial Analysis による。GPT-Live-1 の数値は Ope​nAI の報告による。」とある。OrcaRouter のロゴは右下に合成されている。
Guides & Insights

GPT-Live-1 vs Qwen-Audio-3.0-TTS:会話とナレーターは同じ項目ではない

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る
A two-column scoreboard titled 'GPT-Live-1 vs Qwen-Audio-3.0-TTS - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Input: audio and text', 'Price: $0.05 per voice minute', 'Interruption handling: native', 'Voices: 12, no cloning', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Qwen-Audio-3.0-TTS: 'Job: text-to-speech rendering', 'Input: text only', 'Price: $27.6 per 1M characters, about $1.66 per hour of audio', 'Interruption handling: not applicable, it never hears', 'Voices: 16 languages, cloning from short samples', 'Independent score: Elo 1,232, fourth on the AA Provider Voice Arena'. Footer: 'Qwen pricing and Elo per Artificial Analysis; GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced.'

GPT-Live-1とQwen-Audio-3.0-TTSを音声1時間あたりの価格で並べてみると、その差は決定的に見える。AlibabaのQwen-Audio-3.0-TTS-Plusは100万文字あたり$27.6で音声を生成し、音声1時間あたりおよそ$1.66になる。一方、OpenAIのGPT-Live-1は、連続したオープン回線1時間に$3.00を請求する。ナレーターのほうが安い、だからナレーターの勝ち——ただし、これは間違った比較であり、それが間違っている理由こそ、この対決から誰もが得られる最も有用なものだ。Qwen-Audio-3.0-TTSはテキスト読み上げモデルだ。GPT-Live-1は全二重の会話モデルだ。一方はあなたが書いたものを読み上げる。もう一方は、あなたが話し終えたかどうかを1秒に何度も判断しなければならない。

一方はレンダリングし、一方は対話する

テキスト読み上げは、テキストを受け取って音声を返します。入力音声はなく、発言の順番もなく、遮られるという概念もなく、返すべき文字起こしもありません。モデルは何も聞いていないからです。そのコストモデルは印刷機のようなものです。ページを入れれば音声が出てくる。重要な数字は品質とスループットの2つだけで、どちらも出荷前に測ることができます。

全二重会話モデルは、出力音声を生成しながら入力音声を処理する。その役割には、言葉とは無関係な会話の要素も含まれる —— ユーザーが間を置けば同様に間を置き、「yeah」のようなあいづちを割り込みとして扱わずに続け、文の途中で発話権を譲り、会話の流れを途切れさせずにツール呼び出しを実行する。GPT-Live-1はそのすべてを行い、セッションとともに音声認識の文字起こしを返す。それができるのは、ずっと聞いていたからにほかならない。

あなたの製品が記事を読み上げたり、ドキュメントを音声に変換したり、動画にナレーションを付けたりするなら、GPT-Live-1 は1時間あたり4倍の価格払うには不適切なツールです。あなたの製品が電話に出るなら、Qwen-Audio-3.0-TTS はパイプラインの3分の1にすぎず、会話にするには依然としてASRモデルと言語モデルが必要です。

{{1}}Qwen-Audio-3.0-TTS{{/1}}が真に最良の答えとなる場面

Alibabaのモデルを支持する論拠はマーケティングではない。2026年7月20日にAlibabaのTongyi Labによってリリースされ、Alibaba Cloud Model Studioを通じてホスト型のクローズドAPIとして公開されたPlusティアは、登場時にArtificial Analysisのテキスト読み上げアリーナで首位を獲得した。しかし、リーダーボードは動く標的であり、これは動いた。2026年9月時点で、Qwen-Audio-3.0-TTS-PlusはProvider Voice Arenaで4位に位置し、2,306サンプルでEloは1,232。Cartesia Sonic 3.6の1,275、Inworld Realtime TTS-2の1,244、SpeechifyのSimba 3.2の1,233の後塵を拝している。これら3モデルは、同モデルより後に出荷された8月と7月のモデルだ。20以上中の4位で、首位は失われたが価格優位は保たれている。それでも依然として強い立場だ。ただ、それはローンチ時の報道が描いた立場ではない。

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured September 2026, showing the top four: Cartesia Sonic 3.6 first at Elo 1,275 and $49.0 per million characters, Inworld Realtime TTS-2 second at 1,244, SpeechifyAI Simba 3.2 third at 1,233, and Alibaba's Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,232 with a confidence interval of -14/14, 2,306 samples, a July 2026 release and $27.6 per million characters.

対応する16言語のうち10言語で首位に立ち、中国語の20方言地域を追加し、短いサンプルからの音声クローニング(クロスリンガルクローニングを含む)に対応し、86個のインライン感情・話し方タグを備えています。

注意事項は、それを踏まえて計画を立てられるほど具体的だ。

• スループット — Plus は毎秒およそ16文字を生成するのに対し、Simba 3.2 は30.2、Gemini 3.1 Flash TTS は27、Sonic 3.5 は約120です。バッチレンダリングではこれは見えませんが、ライブ製品ではバッファを決める数字になります。

• 価格ドキュメント — 広く引用されている100万文字あたり$27.6は、Aliba​ba自身の価格ページのすべてのスナップショットと一致するわけではなく、同ページでは時点によって両方の階層でより低い金額が記載されていたこともあります。予測する前に、リーダーボードの数値ではなく、アカウントレベルで現在の数値を確認してください。

• ボイスライブラリ — 16言語をサポートしているにもかかわらず、公開されているプリセット音声はほぼ中国語と英語のみです。残りの14言語は、既製品としてではなくクローニングのワークフローを通じて利用できます。

• 機能ゲーティング — 86個のインライン感情タグは単方向ストリーミングモードでのみ動作するため、表現力の制御はすべての統合経路で維持されるわけではありません。

• 階層 — Flash はリアルタイム用途で約 300 ms の初回パケット遅延を目標としています。Plus は品質重視の階層です。これらは同じ名前を持つ別の製品であり、間違った方を選ぶのはよくある最初のミスです。

カスケード請求書の正直な版

1時間あたりの比較が省いているものはこれだ。TTSモデル上に構築された会話型製品はカスケードである。ASRモデルが発話者の音声をテキストに変え、言語モデルが何を言うかを決め、TTSモデルがそれを話す。3つのベンダー、3つの請求書、合算される3つのレイテンシ予算、そして韻律が死ぬ各境界でのハンドオフ。TTSの区間は音声1時間につき1.66ドルかかるかもしれない。金と間違いが実際にあるのは他の2つの区間だ——そしてカスケードモデルは、すでに話している文の途中のポーズを聞き取れない。

GPT-Live-1は3つの要素を1つのセッションと1つのメーターに集約し、音声は1分あたり$0.05で、推論バックエンドは別途課金される。その請求を正確に保つ2つの仕様がある。セッション初期化では、最初に15秒分の音声が課金されるが、これは後の通話時間に加算されるのではなく、その分から差し引かれる。さらにバックエンドは2つ目のメーターだ。委任された推論呼び出し、ツール呼び出し、ウェブ検索はすべて、そのモデルの通常料金で課金される。したがって、委任先を毎ターン検索する最先端の推論モデルに向けると、安価な音声レイヤーの背後で高額な呼び出しが発生する。

独立系の評価ボードがこの2つについて述べていることは、まさに両者が異なるものを測っており、どちらも自らの対象をよくは描かないという点で参考になる。Qwen-Audio-3.0-TTS-Plusは品質で4位、スループットではほぼ最下位だ。GPT-Live-1はArtificial AnalysisのSpeech to Speech Indexで11台中7位の69.8%——置き換えるGPT-Realtime-2.1の73.9%に後れを取っている——一方、同インデックスの入力音声1時間あたりコスト帯では最安側にあり、GPT-Realtime-2.1の$10.75に対して$4.42で課金されている。どちらのモデルも、それぞれのカテゴリーの首位を獲得してはいない。どちらも、打ち負かすために作られた相手より安い。

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with companion cost and speed charts showing GPT-Live-1 at $4.42 per hour of input audio and 0.78 seconds to first audio.

その2つ目のメーターこそ、ルーティング層が最適化ではなく設計上の判断になる場所です。OrcaRouter は GPT-Live-1 も Qwen-Audio-3.0-TTS も搭載していません。どちらの場合も音声レイヤーは当社の手の届く範囲の外にあり、その部分は一切ルーティングしていません。しかし推論レッグは違います。11 の上流プロバイダーからの約 190 モデルがプロバイダー表示価格のままマークアップゼロの1つのキーの背後にあり、プロバイダーの値下げは次の契約更新時ではなく当日に反映されます。カスケードにとって、これは中間レッグを丸ごとカバーします。2 つの ASR オプションと 3 つの推論モデルを 1 つのエンドポイントの背後に置き、実トラフィックで相互に A/B テストし、自動フェイルオーバーに上流の不調な午後を吸収させて、通話を落とさずに済ませることができます。

ボイスクローニングは、Qwen-Audio-3.0-TTS の最も商業的に有用な機能であり、最大のコンプライアンス対応領域でもある。10秒の参照音声があれば、話者を言語をまたいで再現でき、これはローカリゼーションにとって変革をもたらす一方、身元が重要となるあらゆる場面ではリスク要因となる。Ope​nAI は GPT-Live-1 を、クローニングもカスタムボイスも一切なしでリリースした——選べる API ボイスは 12 種類だけで、それがすべてだ。

その非対称性は、機能比較では素通りしやすいが、リスクレビューでは素通りしにくい。12種類あるベンダーボイスのうちの1つでしか話さない製品は、「それは誰の声で、誰がそれに同意したのか」という問いへの答えが、サンプルから任意の声を再現できる製品よりもはるかに短くて済む。クローニングが必要なら、パイプラインの決定はすでにあなたのために下されており、問いはそれを何が統治するのかになる。必要ないなら、GPT-Live-1の制約は、あなたが構築せずに済んだコントロールとして読む価値がある。

どちらを買うべきか

出力がコンテンツ、つまりナレーション、ローカライズ、アクセシビリティ音声、吹き替え、または音声より先にテキストが存在し、レンダリング1時間あたりの品質が指標となるあらゆるワークフローであるなら、Qwen-Audio-3.0-TTSを購入してください。リアルタイム再生が必要ならFlashから始め、声自体が成果物ならPlusに移行し、クローニングのワークフローはプリセット音声とは別に価格設定してください。

入力が人間であるなら、GPT-Live-1を購入してください。サポート窓口、予約フロー、受付面談など、モデルが文の途中で話している間にユーザーの最初の音節が届き、システムが話し手ではなく聞き手のように振る舞わなければならないあらゆる場面に向いています。音声1時間あたりのコストは高くなりますが、2つのうち中断できるのはこれだけです。

この二つは、ライバルであるよりもはるかに頻繁に補完関係にある。多くの製品は、Qwen-Audio-3.0-TTS にドキュメントを読み上げさせ、その後に続く通話を双方向モデルに処理させたいと考えている。両者が共有すべきでないもの、それはコストモデルだ。音声1時間あたりという指標が正しいのは、そのうちの一方だけである。