
Gemini 3.8 TTS 対 Cartesia Sonic 3.6:13 Eloポイントと16ドル
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
Artificial Analysisのブラインド投票リーダーボードで最も順位が近い2つのテキスト読み上げモデルは、順位が1つ違い、価格が16ドル離れており、そしてこの2つの差は互いに逆方向を指している。Cartesia Sonic 3.6は、1,757サンプルにわたるProvider Voice Arena Elo 1,273で1位に位置する。Gemini 3.8 Flash TTSは、1,999サンプルにわたる1,260で2位に位置する。Eloの差は13ポイント——両者について公表されている信頼区間の内側に収まる——であり、価格差は逆方向に開いており、Geminiが100万文字あたり33.00ドルであるのに対しCartesiaは49.00ドルだ。この2つのどちらを選ぶにせよ、正直に言えば、リーダーボードでは判別できない品質差に対して100万文字あたり16ドルを支払っているということになる。
それが判断のすべてであり、ここは腰を据えて考える価値がある。というのも、どちらのモデルも新しすぎて、ほかにほとんど何も測定されていないからだ。Cartesia Sonic 3.6 は2026年8月に登場した。Gemini 3.8 Flash TTS は2026年9月23日に登場した。どちらもアリーナ投票以外に公開された独立系ベンチマークはなく、アリーナ投票では両者が統計的に同点で首位に並んでいる。
リーダーボードが実際に示していること
Artificial Analysis Provider Voice Arenaは、ここでは有用なボードです。なぜなら、各プロバイダー自身のネイティブ音声を、他のすべてのプロバイダーの音声とブラインドのペアワイズ投票で比較するからです。これは、「どの製品の音がより良いか」という問いに対して、音声を統制したボードよりも公平な比較です。なぜなら、各ベンダーが実際に出荷している音声をそのまま出荷できるからです。
• 第1位 — Cartesia Sonic 3.6、Elo 1,273(17ポイント間隔)、1,757サンプル、アリーナボイス8種、2026年8月リリース、100万文字あたり49.0ドル。
• 2位 — Gemini 3.8 Flash TTS、Elo 1,260(信頼区間17ポイント)、1,999サンプル、アリーナ音声8種、2026年9月リリース、100万文字あたり33.0ドル。
• ランク3 — Alibaba Qwen-Audio-3.0-TTS-Plus、Elo 1,259、1,447サンプル、15種類のアリーナボイス、100万文字あたり27.6ドル。
• 参考までに、4位から9位は — Inworld Realtime TTS-2 が 1,245、SpeechifyAI Simba 3.2 が 1,237、Google Gemini 3.8 Flash-Lite TTS が 1,235、VUI Labs Luna TTS が 1,230、Inworld Realtime TTS-2 Flash が 1,210、BreezeBlue Breeze TTS 2 が 1,204。
区間を読むと、上位3つは互いに重なり合っています。Sonic 3.6 の 1,273 は17ポイントの幅を持ち、Gemini の 1,260 も同じ幅を持っています。それらの範囲はほぼ全幅にわたって重なっています。1,259 の Qwen-Audio-3.0-TTS-Plus は両方と重なっています。このボードは、これまでに収集されたサンプルにおいて、これら3つが盲検の選好では区別できず、それらの間の順序は安定した証拠ではないと示しています。
サンプル数も、その差を説明できるほどには離れていない——Cartesia が 1,757 に対して Gemini が 1,999 だ。どちらも数千の下位範囲にあり、モデルをある帯域に位置づけるには十分だが、その帯域内で隣接するものを区別するには足りない。

その16ドルはどこから来るのか
Cartesia自身の料金ページでは、Sonicの100万文字あたりの料金は公開されていません。同社は分数がバンドルされたサブスクリプション階層を販売しています — Freeは0ドルで20,000クレジット、Sonic 3.6でおよそ27分、Proは5ドルで100,000クレジット、およそ133分、Startupは49ドルで125万クレジット、およそ1,667分、Scaleは299ドルで800万クレジット、およそ10,667分 — さらに同時実行数の上限はそれぞれ2、3、5、15で、音声ローカライズは追加アクセント1つにつき225クレジット、ボイスエージェントの通話時間は1分あたり0.06ドル、テレフォニーは1分あたり0.014ドルです。
つまり、100万文字あたり49.00ドルというのは、Cartesiaが自社の単位で示している定価ではありません。これはArtificial Analysisが、ボードがそもそも価格で順位付けできるように、Cartesiaのクレジットを共通の基準に正規化したものです。比較ボードがそうするのは正当なことですし、入手できる唯一の同一条件で比較可能な数値でもあります。ただし、そのためCartesiaの数値は換算レートであり、Geminiの数値は公表されたレートだということになります。
Googleの料金は明快です。Gemini 3.8 Flash TTSは、2026年12月31日まで、入力テキスト100万トークンあたり0.50ドル、出力音声100万トークンあたり9.00ドルを課金し、その後は1.00ドルと18.00ドルになります。音声は1秒あたり25トークンで計量されるため、音声出力料金は発話1秒あたり約0.02セントに換算されます。より安価な兄弟モデルのFlash-Lite TTSは、同じ1秒25トークンで音声100万トークンあたり6.00ドルであり、Artificial Analysisはこれを100万文字あたり22.10ドル相当、順位6、Elo 1,235と評価しています。

• 100万文字あたりの料金 — Cartesia Sonic 3.6 $49.00 対 Gemini 3.8 Flash TTS $33.00 対 Gemini 3.8 Flash-Lite TTS $22.10。
• アリーナElo — 1,273 対 1,260 対 1,235、上位2つはいずれも17ポイント間隔。
• アリーナボイス — 8 vs 8 vs 8.
• サンプル — 1,757 vs 1,999 vs 2,000
• 可用性 — Cartesiaのホステッドベータ版 vs Google自身のGemini Developer API、一般提供。
• ウェイト・リリース — 両方ともクローズ済み。どちらもダウンロードできません。
価格比較が隠している部分
「100万文字あたり」は便利な単位ですが、どちらの製品もそのように課金しているわけではありません。
Cartesia の単位はサブスクリプションに対するクレジットで、階層ごとに同時実行数の上限が付いています。つまり、次の1,000文字の限界費用は上限に達するまでゼロで、上限に達した後は次の上位階層の費用になります。上限が予測できるワークロードにとっては、これは文字単価が示唆するよりも有利な取引です — あなたが買っているのは消費量ではなく、ヘッドルームです。急増するワークロードにとっては不利です。Free 階層の同時実行数2と Pro の3は、価格ではなく堅い壁だからです。
Geminiの課金単位はトークンで、呼び出しごとに計量され、公表された同時実行数の上限はなく、Standard、Batch and Flex、Priorityという3つのサービス階層が異なる料金で用意されています。Batch and FlexはFlash TTSの音声料金を100万トークンあたり$4.50へ半減させ、Priorityは$16.20へ引き上げます。これははるかにきめ細かいコストモデルであり、Googleの料金設定が通常報いるもの、つまりジョブが対話型かバッチかを事前に把握していることを報います。
したがって、どちらが安いかは、音声ワークロードがサブスクリプション型か従量課金型かにかかっています。Cartesiaの料金体系は、安定した上限のあるボリュームを持つ製品向けに設定されています。Geminiの料金体系は、分類可能な消費向けに設定されています。
Cartesiaが依然として持っている、Googleが持っていないもの
2つあって、どちらも音声モデルではなく音声プロダクトであることについてです。
Cartesiaはテレフォニーと音声エージェントのインフラを直接販売しています。テレフォニーは1分あたり$0.014、音声エージェントの通話時間は1分あたり$0.06、音声ローカライゼーションは追加アクセントごとに225クレジットです。電話エージェントを構築しているなら、それは一箇所で購入できるスタックです。Gemini 3.8 Flash TTSは音声合成エンドポイントであり、音声を返して終了します。トランスポート、ターン検出、テレフォニーは自分で用意するか、他のベンダーから組み合わせて調達することになります。

Cartesiaはリーダーボードに載っている期間もより長い。8月のリリースがGoogleの9月に対してであることは、そのサンプル数のより多くが確定版に対して蓄積されたことを意味するのに対し、9月の開始はまだ投票を集めている途中だ。モデルのEloは最初の1週間では、同じモデルの1か月後のEloよりもノイズの多い推定値であり、そのことは、この13ポイントの差をCartesiaを裏付ける証拠として読むことには不利に働く。
Googleが持っていてCartesiaが持っていないもの
言語対応範囲が最も分かりやすい点です。{{Flash TTS}}は自動検出に対応し130言語を処理しますが、{{Flash-Lite}}は101言語です。{{Cartesia}}のローカライズモデルは加算式で、ベース音声にアクセントを1つ225クレジットで追加購入する仕組みです。これは異なるアプローチであり、言語数が片手で数えられる範囲を超えるとコスト曲線も変わってきます。
2つ目はデリバリー(話し方・演じ方)の領域です。Gemini 3.8 Flash TTS では、俳優を演出するのと同じ感覚でセリフを指示し、1回の呼び出しの中で2人の話者によるシーンを演出し、非言語的なキュー——<laughs>、<sigh>、<gasp>、|mhm|、|yeah|——をスクリプトに直接書き込むことができます。さらに、自然言語による説明からの音声デザインや、同意確認付きの30秒サンプルからの音声複製、出力へのSynthIDウォーターマークとC2PAクレデンシャルの付与にも対応しています。ボイスリミックスは近日提供予定とされています。
そして、それはベータ版ではなく一般提供されています。Cartesia Sonic 3.6はホスト型ベータ版であり、これは負荷がかかった状態でのエンドポイントに対するベンダー自身の自信についての表明です。
実際にどちらに電話すべきか
ワークロードが予測可能な量の電話エージェントで、電話、同時実行、音声合成を単一ベンダーから得たいなら、Cartesia Sonic 3.6 は筋の通った選択であり、16ドルの差額は、自分で3社を組み合わせずに済ませるための対価だ。
もしあなたのワークロードが、すでに運用している製品内での音声合成——ナレーション、アクセシビリティレイヤー、サポートボットの声、130言語のローカライゼーション——であるなら、Gemini 3.8 Flash TTS は文字あたりのコストが安く、言語カバレッジが広く、話し方の制御がより細かく、一般提供されています。Elo の差は、それに反対する根拠にはなりません。なぜなら、その Elo の差は統計的に実在しないからです。
3つの中で最も安いものをボードのトップに置きたいなら、対応言語リストが短くてもよいのであれば、Gemini 3.8 Flash-Lite TTSは100万オーディオトークンあたり$6.00で、1,235位で6つ下に位置する——その差もまたノイズの範囲内だ。
どちらを選んでも、選んだものそのものよりも移行パスが重要です。どちらのモデルも新しく、どちらのベンダーもまだ調整を続けているからです。OrcaRouter はそのヘッジになります。1つのキーで200以上のモデルをプロバイダー定価のまま、マークアップなしで利用でき、どちらかのラボが値下げすれば、更新時ではなくその日のうちに請求に反映されます。合成呼び出しが失敗した場合の自動フェイルオーバー、そしてバッチジョブは一方のモデルへ、インタラクティブな呼び出しはもう一方へ送りたいときのためのルーティング DSL も備えています。当社は Cartesia Sonic 3.6 や Gemini 3.8 の TTS エンドポイントをホストしていません — Cartesia の合成は同社独自の製品であり、Gemini の音声モデルは Google の API から提供されています — しかし、テキストレイヤーとフェイルオーバーパスは当社のものであり、まさにその部分が、まったく新しいモデルを安心して試せるようにしてくれるのです。
注目すべきは次回のArtificial Analysisの改訂だ。Gemini 3.8 Flash TTSが、サンプル数が成熟した段階でその13ポイント差を埋めれば、価格差はトレードオフではなくなり、単純明快な答えになる。埋められなければ、Cartesiaが品質の王冠を、Googleが価格の王冠を保持し続け、選択肢は今とまったく同じところにとどまる。すなわち、電話機能が付属するサブスクリプションか、130言語が付属する従量制か、だ。
