
GPT-Live-1 vs Breeze TTS 2:リリースできないオープンウェイト音声のリーダー
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
Breeze TTS 2は、Artificial AnalysisのProvider Voices Speech Arenaで最高評価のオープンウェイトのテキスト読み上げモデルであり、Elo 1,205を保持し、100を超える評価対象システムの中で総合7位につけている——ウェイトを公開している商用ライセンスのあらゆるエンジンよりも上位だ。そのウェイトは2026年8月25日以降ダウンロード可能である。また、それらのウェイトに付属するライセンスの下では、製品で使用することはできない。GPT-Live-1はあらゆる面で正反対のトレードオフだ。クローズドで、ホスト型で、2026年9月10日にOpenAIの開発者APIで利用可能になって以来、音声1分あたり0.05ドルで課金され、2つのうち通話者が割り込むのを聞き取れる唯一のものである。
その2つの文を隣り合わせに並べれば、この比較はほとんどのモデル同士の対決よりも速く決着がつく。これは、どちらがより良い音声を合成するかをめぐる戦いではない。あなたが買っているのは声なのか、それとも会話なのか、そして「オープン」があなたが想定していた意味を指すのかをめぐる戦いなのだ。
それらは同じ種類のものではない。そして、まさにそこが要点なのだ。
Breeze TTS 2は、BreezeBlueという約15人規模のスタートアップによる30億パラメータのテキスト読み上げモデルだ。テキストを入力すると音声が出てくる。何も聞こえない。ターンという概念がないため、ターンがいつ終わるべきかについて意見を持たない。WebSocketでストリーミングすると、テキストの生成が終わる前に音声を出し始める。これは音声エージェントのテンポをタイトに保つのに本当に役立つが、いつ話すかの判断は、そのテキストを書いた何かによってなされている。
GPT-Live-1は全二重の音声対音声モデルです。音声とテキストが入力され、音声とテキストが出力されます。そしてモデルは1秒間に何度も、聞き続けるか、一時停止するか、ターンを取るか、譲るかを判断します。OpenAI自身のFull Duplex Bench v1.5の数値は、リリースとともに公開され、社外では再現されていませんが、その対話性を80.1%としており、GPT-Realtime-2.1の45.4%と対比されています。ターン交代のレイテンシは0.798秒で、1.41秒と対比されています。
その非対称性は Breeze TTS 2 への批判ではない。それは、それぞれがスタック内のどこに属するかについての警告だ。カスケード——音声認識が言語モデルに供給し、言語モデルが音声合成器に供給する——を構築しているなら、Breeze TTS 2 はその最後の3分の1の候補だ。GPT-Live-1 を購入するなら、ループ全体を購入し、それとともにターンテイキングのロジックも引き渡すことになる。
次元ごとに
• インタラクションモデル — GPT-Live-1:全二重、ネイティブ割り込み、発話中も聞き取り 対 Breeze TTS 2:ストリーミング音声合成、音声入力は一切なし
• 重み — GPT-Live-1: クローズド、ホスト型のみ、単一のモデルIDで日付付きスナップショットなし 対して Breeze TTS 2: 2026年8月25日以降 Hugging Face で3Bパラメータ、PyTorch推論コード Apache-2.0
• ライセンス — GPT-Live-1:OpenAI の API 経由の商用条件で、確認すべきものはありません。一方、Breeze TTS 2:重み、ファインチューニング、LoRA、マージ、量子化、セルフホスト出力を対象とする研究用・非商用ライセンス
• 価格単位 — GPT-Live-1:音声1分あたり0.05ドル、秒単位で請求、推論バックエンドは別途従量課金。一方、Breeze TTS 2:ホスト型エンドポイントでは100万文字あたり34ドル、公開されている最上位プランでは28ドルまで段階的に下がります
• 品質エビデンス — GPT-Live-1:Artificial Analysis Speech to Speech Indexで70.3%、採点対象14モデル中同率6位。対するBreeze TTS 2:Provider Voices arenaで1,205 Elo、総合7位、オープンウェイトモデル中1位(Artificial Analysis調べ)
• 言語 — GPT-Live-1: 主要言語以外での流暢さのばらつきが、ローンチ時の報道で一貫して指摘されている。これはベンダーが主張する Breeze TTS 2: 50 との比較であり、モデルカードには英語と中国語向けと記載されている
• 音声コントロール — GPT-Live-1: 12種類のAPI音声、プロンプトでトーンとペースを操作、クローニングは一切なし vs Breeze TTS 2: 参照音声によるクローニング、参照不要の音声デザイン、音声ディレクション、インラインのボーカルイベント
• スループット — GPT-Live-1:同時セッション数で計量され、tier 1では25、tier 5では500が上限で、無料枠はなし。一方、Breeze TTS 2:Artificial Analysisの計測で毎秒およそ45文字と、複数の商用競合製品より遅く、長文の処理では重要な差となる

ライセンスのほうがリーダーボードよりも多くの仕事をしている
BreezeBlue自身のモデルカードはこの点について異例なほど率直で、それは同社の功績と言える。推論コードはApache-2.0だ。重みと、それらをセルフホストして生成するあらゆる出力は研究用途であり、商用展開には有料のホスト型サブスクリプションか書面による許諾のいずれかが必要となる。この制限は派生モデル、LoRA、マージ、量子化にまで明示的に及び、人々が通常手を伸ばす抜け穴をふさいでいる。
「オープンウェイトのリーダー」という位置づけには、見出しがめったに添えない限定条件が必要だ。Breeze TTS 2 がオープンなのは、ダウンロードして中身を調べ、ベンチマークを取り、評価のために自分のハードウェア上で実行できるという意味においてだ。スタートアップが BreezeBlue に支払うか、法務レビューを買うかのどちらかをせずに、その上に製品を築けるという意味ではオープンではない。オープンウェイトという言葉で人々が意味する三つのことのうち、二つ——検証可能性とコスト——は得られる。三つ目——出荷する自由——は得られない。
それは GPT-Live-1 のようなモデルとの実質的な違いだ。そこではライセンスの問いは「許可してもらえるか」ではなく「いくらか」になる。どちらも最終的には請求書に行き着く。ただ、片方だけはその前に弁護士の意見書に行き着く。

この2つの価格単位は比較できないので、計算は以下のとおりです
1分あたり0.05ドルと100万文字あたり34ドルは、別世界のものに見える。実際に別世界だからだ。比較するには換算が必要だ。音声は1分あたりおよそ150語で進み、英語では空白を含めて数えると1語あたり平均約5.5文字なので、1分の音声出力はおよそ800〜900文字になる。Breeze TTS 2の100万文字あたり34ドルなら、1分あたりの合成は約3セント——生の音声ではGPT-Live-1の5セントより安い。
その比較は、その直後に崩れてしまう。GPT-Live-1の5セントには聞き取りも含まれているからだ。さらに同モデルは、通話者の文字起こしも行い、いつターンが終わるかを判断し、割り込みも処理している。カスケードなら、そうした作業をどこか別のところから調達しなければならない。音声認識モデル、ターン検出モデル、そしてBreeze TTS 2が読み上げるテキストを生成するための言語モデルである。これらを足すと、カスケードの3セントの音声合成は、通常はエンドツーエンドモデルの請求額より大きい請求額の下に収まることになる。
正直に要約すると、より安価な音声はBreeze TTS 2であり、より安価な会話はGPT-Live-1であり、それら二つの主張の差こそが、音声エージェントに実際にかかるコストのすべてである。

彼らが実際に会うことになる場所
今日、電話エージェントを構築していて、単一ベンダーのエンドツーエンドスタックにコミットしたくないチームは、まさにこのカスケードを組み上げるだろう。口にはBreeze TTS 2または同等のエンジン、耳には別の何か、思考にはルーティングされた言語モデルを。この3つのうち最後のものは、最も頻繁に変わる部分だ——品質が最も速く向上し、コストが最も大きく変動し、今四半期に勝つモデルが次の四半期に勝つモデルであることはほとんどない。
そのレイヤーは通常のAPI呼び出しであり、このスタックの中で移植性を保つ価値がある唯一の部分です。およそ11社のアップストリームプロバイダーによる190のモデルが、プロバイダー定価・マークアップなしの単一のOrcaRouterキーの背後に位置しているため、音声エージェントの背後にある推論モデルの差し替えは、統合プロジェクトではなく設定変更で済みます。また自動フェイルオーバーにより、タイムアウトしたバックエンドが通話を切断してしまうのを防ぎます。GPT-Live-1のLive Sessionsエンドポイントも、Breeze TTS 2のホスト型APIも、その方法では到達できません。この比較における音声レイヤーはルーティングレイヤーの手の届かない範囲にあり、そうではないかのように示唆するのではなく、その点を明確にしておく価値があります。
どちらを選ぶべきですか
会話そのものが製品で、ホスト型のクローズドなフロントエンドを受け入れられるなら、GPT-Live-1 を選んでください。予約受付ライン、一次サポート、発信者がエージェントに被せて話すことが例外ではなく通常の出来事となるあらゆる業務。あなたが購入しているのは割り込みへの対応力であり、それを予測可能な分単位の料金で購入しています。その一方で、その背後にある推論が、あなたが調整する部分です。
検査可能な音声が必要なら、合成が多数のコンポーネントの1つにすぎない製品を構築しているなら、あるいはGPT-Live-1がまったく提供していないクローニングと音声設計が必要なら、Breeze TTS 2を選んでください。重みが研究用であること、50言語という主張はベンダーによる主張であり、カードには2言語用とタグ付けされていること、レイテンシの数値は独立した監査ではなく、ウォームアップ済みのファストパス上でのBreezeBlue自身の測定値であることを承知の上で臨んでください。
これを品質コンテストとして捉える直感は、間違った直感だ。Breeze TTS 2 は、それが競う土俵のほぼ頂点にいる。そして GPT-Live-1 は、そもそもまったく別の土俵で競っている。実際にコストがかかる意思決定は、その両者の根底にある——思考を担うのはどのモデルか、そして、それについて午後のうちに考えを変えられるかどうかだ。
