Breeze TTS 2 — 1,215 Elo を達成した新しいオープンウェイト TTS リーダー。再生成されたイラスト。
Guides & Insights

Breeze TTS 2: 新しいオープンウェイトTTSリーダー、Elo 1,215

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Breeze TTS 2は、Artificial AnalysisのProvider Voices Speech Arenaにおいて、オープンウェイトの音声合成モデルとして首位に立った。そのEloは1,215で、従来のオープンウェイト部門トップだったFish Audio S2 Proに90ポイント差をつけ、100以上の評価対象システムの中でも総合6位にランクされている。このランキング掲載は、BreezeBlueが2026年8月中旬にモデルを公開して以来主張してきたこと、すなわち「従業員約15人の新興企業が作った、わずか2週間の音声モデルが、商用テキスト読み上げの最前線に並べる」という点を、初めて第三者機関が裏付けたものとなった。オープンウェイトは2026年8月25日にHugging Faceで公開され、その1日以内にアリーナの結果が続いた。Breeze TTS 2が今後どのような評価を得ようとも、もはや単なるベンダーの約束ではない。それを示すEloを実際に獲得したのだ。

実際に何が起こったのか、順番に

ここで時間軸が重要なのは、3週間前にはほとんどの人が耳にしたこともなかった企業から「オープンウェイトのリーダーボード」という投稿が届く理由を説明しているからだ。BreezeBlueは、中国有数のAI研究所の元テクニカル共同創業者であるYang Bin氏によって、Yuanjing CapitalとRedpoint Chinaが主導する600万ドルのシードラウンドを基に設立された。このモデルは、3つの明確なマイルストーンを経てきた:

• 2026年8月7日 — BreezeBlueは、Hugging Face上に、音声デザイン、音声ディレクション、遅延評価のための独自のテキスト読み上げベンチマークスイートを公開しました。

• 2026年8月16〜17日 — 同社は、インタラクティブメディア向けのリアルタイム・フラッグシップ音声モデルとしてBreeze TTS 2を正式に発表し、1M文字あたり34ドルでホステッドAPIを公開した。

• 2026年8月25日 — 重みとPyTorch推論コードが、Hugging Face上でBreezeBlue/Breeze-TTS-2としてオープンソース化されました。これは、研究および非商用ライセンスの下での3Bパラメータのモデルです。

Artificial Analysis Provider Voices ランキングは、オープンウェイトの公開から数日以内に公開されました。このアリーナはブラインドのサイドバイサイドリスニングでモデルを評価するため、1,215 Elo は BreezeBlue 自身が実行したベンチマークではなく、実際のサンプルを比較したリスナーたちによる判断の蓄積であり、それはまさに、この若いモデルに最も欠けているものです。

スコアボード

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• Arenaランク — Provider Voicesで総合6位、オープンウェイトモデルの中では1位で、Fish Audio S2 Pro(1,125 Elo)を上回っています。

• Elo — 1,215、95%信頼区間は約±17(Artificial Analysis、2026年8月下旬時点)。

• 言語 — BreezeBlueによると50。モデルカードは英語と中国語でタグ付けされています。

• 価格 — BreezeBlueのホステッドエンドポイントでは100万文字あたり34ドル。オープンウェイトは無料でダウンロード可能だが、非商用ライセンスが適用される。

• 速度 — Artificial Analysisの測定では毎秒約45文字で、複数の競合モデルより遅く、長文タスクでは重要な点です。

• レイテンシ — 40ms未満のストリーミングレイテンシ(BreezeBlueによると、ベンダー公表値であり独立した計測ではない)。

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

Breeze TTS 2 が実際に違う点

Elo は見出しを飾るが、製品としての主張はスコアよりも興味深い。Breeze TTS 2 は、ほとんどのテキスト読み上げモデルが後回しにしている2つのアイデアを中心に構築されている:音声デザインと音声ディレクション。音声デザインはゼロショットかつ参照不要である。つまり、自然言語で音声を説明する(「温かみのある、40代半ばの、ほんの少し南部なまりがあり、ドライな機知を備えたナレーター」など)と、モデルはスタジオ録音や参照クリップなしでその音声を生成する。音声ディレクションは、話者の音色と発話意図を切り離すため、モデルが別のキャラクターに寄ってしまうことなく、皮肉っぽく、囁くように、または急いだ調子で台詞を読ませることができる。BreezeBlue は、同じ話者同一性が変化後も保たれると述べており、自社の音声ディレクションベンチマークでは、話者類似度 0.67 SPK_SIM (ベンダー報告値) を報告している。

これらの2つの機能は、Breeze TTS 2の想定市場を示しています。プレス資料は明確です。ビデオゲームのキャラクター、デジタルコンパニオン、ナラティブストーリーテリング、放送ドラマ、バーチャルストリーマー——長編・役割主導・多キャラクター音声であり、単なる別のナレーションAPIではありません。同社は、コミュニティとスタジオが制作した15,000以上のキャラクターボイスを収録したコンパニオンボイスライブラリ「Voice Galaxy」を提供しており、BreezeBlueのデモリールは10分以上に及ぶ多キャラクターのファンラジオドラマです。自社で公開したベンチマーク(ベンダー報告、未再現)では、Breeze TTS 2はテキスト読み上げのVoice Designベンチマークで第1位を主張しており、Role FitスコアはMiMo-V2.5-TTSの72.78に対して78.02、Voice Direction複合スコアは4.25です。

ライセンスのアスタリスク

「オープンウェイト」という言葉がマーケティング用語として独り歩きする前に、モデルカードを読んでほしい。Breeze TTS 2は3Bパラメータ、safetensors、F32/BF16を備え、そしてソースコードはApache 2.0です。ただし、ウェイト、派生モデル、セルフホストされた出力は、breezeblue-research-and-non-commercial-licenseの下で、研究および非商用の目的にのみライセンスされます。つまり、ここでの「オープンウェイト」は「製品に無料で使える」という意味ではありません。ライセンスの文面上、商用セルフホスティングは許可されていません。商用の道はホスト型API(1M文字あたり34ドル)です。これは2026年の他のいくつかのオープンリリースと同じ形です。研究用には検査とセルフホストが可能ですが、収益を生む利用はベンダー自身のエンドポイントに留保されています。

これほど若いモデルにとってルーターが重要な理由

Breeze TTS 2に関する今の正直なリスクは、品質ではなく、モデルの年齢だ。公開から10日、ウェイトの公開からは2日しか経っていない。プロダクションチームは、そこから移行する手段なしに、これほど新しいモデルに音声パイプラインを賭けるべきではない。ルーティングレイヤーが存在するのは、まさにこの障害モードを吸収するためだ。ベンダーのエンドポイントを数あるルートの1つとして扱うゲートウェイ経由でBreeze TTS 2を評価すれば、今日のEloリーダーが手に入り、APIが劣化した際にはフォールバックプロバイダーへの自動フェイルオーバーが働き、公開から1週間のモデルにリグレッションが出た場合も1行の変更で対処できる。これは、ルーティングDSLがどのモデルにも適用するのと同じ規律だ。代替モデルと組み合わせ、インターフェースを安定に保ち、モデルを基幹に据える前に実力を証明させる。このシリーズのどのモデルも、まだOrcaRouter自体にはルーティングされていない。だから正直なアドバイスとしては、Breeze TTS 2を既に稼働中のゲートウェイに配線し、Eloが成熟して信頼性を増すまで、現在のプロバイダーを並行して稼働させ続けることだ。

次に見るもの

「Provider Voices #1-open-weights 枠が今日の話題ですが、このモデルにとっては2つのアリーナのうち弱い方です。Artificial Analysis の Controlled Voice アリーナでは、全モデルが同じ固定参照ボイスで比較されますが、Breeze TTS 2 はオープンウェイトモデルの中で Elo 1,002 で第3位(Mistral の Voxtral の 1,010 に次ぐ)、全体39モデル中16位です。プロバイダーボイススコア(1,215、オープン1位)とコントロールドボイススコア(1,002、オープン3位)の差は注目に値します。これは、Breeze TTS 2 の強みが自社で設計したボイスに集中していることを示唆しており、それはまさに製品の主張そのものであり、独立系ベンチマークが圧力をかけ続けるべき主張でもあります。コントロールドボイスの Elo がプロバイダーボイスの数値に近づくか、商用ライセンスが厳しくなるか緩くなるか、そして何よりも、BreezeBlue 独自のスイートの外でボイスデザインとボイスディレクションのベンチマークを再現する人が現れるかどうか、注視すべきです。」

1か月前には存在していなかったモデルでありながら、Breeze TTS 2はすでに、テキスト読み上げモデルが獲得し得る最も有用なものを手にしている。それは、マーケティングと一致する独立したスコアだ。それがインタラクティブ製品のデフォルト音声になるかどうかは、次のEloアップデート次第ではなく、ライセンスとセルフホスティングの展開にかかっている。だが、今週時点で、オープンウェイトのテキスト読み上げには新しいリーダーが登場しており、そのモデルはまだ生後2週間だ。

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.