「Gemini 3.8 TTS vs Inworld Realtime TTS-2」の生成されたヒーローカードは、白背景に柔らかな青とシアンのグラデーションアクセントを備えています。左側のカード「Gemini 3.8 Flash TTS」には、Elo 1,260で2位、8つのアリーナボイス、130言語対応と主張、100万文字あたり$16.50(正規化)が記載されています。右側のカード「Inworld Realtime TTS-2」には、Elo 1,245で4位、8つのアリーナボイス、英語のみ、100万文字あたり$20.80(正規化)、およびControlled Voice Arenaでの1位が記載されています。フッター行には「EloはArtificial Analysis Provider Voice Arena、2026年9月による。価格はGoogleとInworldによる。」とあります。OrcaRouterのロゴが右下隅に合成されています。
Guides & Insights

Gemini 3.8 TTS vs Inworld Realtime TTS-2:どのスコアボードを信じるかで答えは変わる

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

並べてみるとGemini 3.8 Flash TTSInworld Realtime TTS-2を Artificial Analysis Provider Voice Arena 上で隣り合わせに置けば、答えは明白に見える。ランク2対ランク4、Elo 1,260対1,245、アリーナ音声はそれぞれ8種類、正規化した100万文字あたりの価格は$16.50対$20.80。ベンダーは順位でも価格でも勝っており、しかも15ポイントの差はいずれにせよ両方の行の信頼区間の内側に収まっている。

Artificial Analysisが公開しているもう一方のボードに移ると、順位が逆転する。Inworld Realtime TTS-2がControlled Voice ArenaでElo 1,123を記録して首位に立ち、そのFlash版は1,075だ。それは丸め誤差ではない。勝っているモデルが違うのであり、その理由は、この2つのボードが同じものを測定しているわけではないからだ。製品のために音声を選ぶなら、あなたのユースケースが実際に問うているのはその2つの質問のどちらなのかを知ることが、判断のすべてだ。

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Inworld Realtime TTS-2, showing Provider Arena position (rank 2, Elo 1,260 against rank 4, Elo 1,245), Controlled Arena position (not top ranked against rank 1 at Elo 1,123), price ($16.50 against $20.80 per 1M characters), languages (130 claimed against English only), cloning path (a 30-second sample against 5 to 15 seconds) and dialogue (two speakers against a single voice).

二つの板、二つの異なる問い

Provider Voice Arenaは、モデル自身が持つネイティブ音声——つまりベンダーが提供しホストしている音声——を評価します。Controlled Voice Arenaは音声を一定に保ち、自分のものではない音声で話すよう求められたときに各モデルがどれだけうまく機能するかを評価します。審査員も同じ、同じ種類のブラインド比較、違うのは変数だけです。

その区別は、2つの異なる役割に対応しています:

• プロバイダーランキングは「このモデルはそのまま使って良い音がするか」に答えるものだ。固定されたナレーターボイスのセットを同梱して出荷され、何もクローンしない製品にとっては、それが適切な評価軸である。

• 統制ランキング(Controlled ranking)は「このモデルは音声仕様に従っているか」に答える。音声が顧客のものである製品——クローン化されたブランドボイス、ライセンス契約した俳優、テナントごとのアイデンティティ——にとって、それは適切なリーダーボードだ。

Googleのモデルは1つ目のリーダーボードで首位に立っている。Inworldのモデルは2つ目で首位に立っている。どちらの文も同時に真であり、どちらも矛盾ではない。だからこそ、「どのTTSモデルが最高か」という単一の答えは、たいてい書き手が片方のリーダーボードだけを選び、もう片方を見なかったというしるしなのだ。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Inworld Realtime TTS-2 at rank 4 with an Elo of 1,245, with Inworld Realtime TTS-2 Flash further down at 1,210 and Gemini 3.8 Flash-Lite TTS at rank 6.

Inworldのナンバーワンの地位が実際に何を意味するのか

1位のControlled結果とは、指示への忠実性に関する主張であり、指示への忠実性こそが、クローニングがそもそも使用可能かどうかを決める性質である。

Inworldのクローニング経路には2つの形態がある。インスタントクローニングは短いサンプルから機能する — ベンダーが示す数値は5〜15秒の参照音声 — そしてプロフェッショナルクローニング層はベータ版で、10分程度を必要とする。どちらもベンダー報告であり、アリーナによって独立に検証されたものではない。アリーナが測定するのは、モデルが声を獲得した後の振る舞いであり、それを生成したクローニング工程の品質ではない。

このファミリーに付随するレイテンシーに関する主張も、同じカテゴリーに属する。Flash 版のファーストバイト値——第三者による測定で報告された25ミリ秒——と、フルモデルの p99 値は Inworld 自身によるものであり、アリーナはどちらについても何も言っていない。これらはリアルタイム志向のモデルとしてはもっともらしく、かつ未検証である。そして、それがこれらを扱う正しいやり方だ。

要するに実践的な読み方はこうだ。あなたの製品が音声をクローンするなら、2つのスコアのうちより関連性が高いのはInworldのControlledの結果であり、Providerランクが低くても失格にならないのはそのためだ。製品がクローンしないなら、その優位性はあなたには見えず、読むべきはProviderボードのほうである。

価格のはしごは3段階で、安いほうはサブスクリプションです。

1つの価格と1つの価格を比較しても、この対決は正しく評価できません。なぜなら、Inworldには単一の価格があるのではなく、価格の階段があるからです。

• オンデマンド — リアルタイムTTS-2は100万文字あたり25.00ドル、Flashは15.00ドル。これは従量課金の利用者が目にする料金であり、ベンダー自身が公表している数値です。

• Creator プラン — 同じ2つのモデルで $20.00 と $10.00。従量課金ではなくプランにコミットすることで 20% と 33% の割引になる。ベンダー報告によるもので、コミット前に実際の料金ページで再確認する価値が最も高い段階だ。プランの条件は定価よりも動きが速いからである。

• 正規化 — アリーナの100万文字あたりの換算では、Realtime TTS-2が$20.80、Flashが$10.40となり、これはどちらのベンダーの見積もりではなく、ボード側の計算によるものです。

それに対して、Googleの料金はトークン単位でプロモーション価格です。入力テキスト100万トークンあたり0.50ドル、出力音声100万トークンあたり9.00ドルで、2026年12月31日まで、その後は18.00ドルです。Flash-Lite TTSは0.50ドルと6.00ドル、その後は12.00ドルです。正規化すると、16.50ドルと11.00ドルになります。

A screenshot of Inworld's text-to-speech product page, showing the Realtime TTS-2 and TTS-2 Flash model cards, the instant and professional voice cloning tiers, per-million-character pricing, and usage statistics including 642,022,085 characters used and 223,764 minutes generated.

二つを合わせて読むと、見えてくる構図は「Google のほうが安い」よりも興味深い。本日公表されている数字で見る限り、Flash TTS は3モデルの中で最も安く、Inworld の Flash 版は2番目に安い。この2つの Flash モデルは差が十分に小さいため、音声とテキストの比率が少し変わるだけで、どちらの請求額が低くなるかは逆転し得る。2027年1月1日に Google の料金が2倍になると、順位は固まり、Inworld がその料金体系のどの段階でも、より安い選択肢になる。9月にこの2つを比較し、12月に契約を決める人は、間違った数字を比較していることになる。

それぞれがより良い答えとなる場面

2つのモデルは品質の面で十分に拮抗しているため、差別化要因は構造的なものになる。したがって、正直に言えば、答えは判定ではなく条件のリストである。

音声を自分で選べるなら、Gemini 3.8 Flash TTS を選びましょう。文章による説明からの音声デザイン、1回の呼び出しでの2話者対話、ターン単位のスタイリング、そして Google 自身の集計によるこの2つの中で最も広い言語カバレッジ — この比較で Inworld はそのいずれにも匹敵しません。また、今日時点でより安価なモデルでもあり、その兄弟である Flash-Lite は同じ API 内で2つ目の価格帯を提供します。

音声が顧客自身のものである場合には、Inworld Realtime TTS-2 を選びましょう。最上位の Controlled Voice 行、参照音声わずか数秒で測られる即時クローニング経路、より多くを必要とするケース向けのプロフェッショナルクローニング階層、そしてベンダーが公表するファーストバイトの主張に裏付けられたリアルタイム志向 — ただし、その主張はベンダーのものであるという但し書き付きです。ベンダー自身のドキュメントにより英語のみであり、それ以外が必要な場合には厳しい制約となります。

これらのモデルはいずれもOrcaRouterがホストしているものではありません。そう示唆するのではなく、はっきりそう述べておく価値があります。Gemini 3.8 Flash TTSを呼び出す場所はGoogle自身のAPIと、Googleが9月23日に挙げた各サーフェスであり、Inworld Realtime TTS-2を呼び出す場所はInworld自身のプラットフォームです。OrcaRouterが担うのは、その選択を取り巻くすべてです — 200以上のモデルを単一のキーの背後でプロバイダーの定価で、マークアップなしで利用でき、1月の改定のようなベンダーの料金変更も当社側では当日に反映されます。自動フェイルオーバーがあるため評価済みのモデルが本番環境の依存先である必要はなく、単一の音声で作業全体を担えない場合にモデルを1回の呼び出しに組み合わせるためのルーティングDSLも備わっています。

これら両方を候補に残しておく理由は、1月の料率変更と「Controlled 対 Provider」の区別が、答えの変わり得る互いに別個の2つの理由だからである。どちらか一方しか呼び出せないパイプラインは、どちらにも追随できない。