「ElevenLabs Eleven v4 vs Cartesia Sonic 3.6」のヒーローカード。2枚のスコアカードを備える:ElevenLabs Eleven v4 は Elo 1,319、ランク1、100万文字あたり $80.00。Cartesia Sonic 3.6 は Elo 1,276、ランク2、100万文字あたり $49.00。キャプションは「39%安い音声に対して43 Eloポイントの差」。フッター:「Provider Voice Arena、Artificial Analysis による、2026年9月」。OrcaRouter のロゴは右下隅に配置されます。
Guides & Insights

Eleven v4 対 Cartesia Sonic 3.6:39%安価な音声に対する43ポイントのElo差

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ElevenLabs Eleven v4は、Artificial AnalysisのProvider Voice ArenaでCartesia Sonic 3.6を43 Eloポイント上回っている——1,319対1,276——。Controlled Voiceのボードでも勝利しており、Sonic 3.6の4位に対して2位につけている。一方、価格では逆方向に大差で負けている。100万文字あたり80.00ドル対49.00ドル、さらにローンチ期間中のベンダー自身の料金表における1文字あたりの単価では約9倍だ。スコアボードは明確なのに、それでも判断が下せない稀有な対決である。なぜなら、この2つのモデルは本当に同じ仕事を争っているわけではないからだ。

A two-column scoreboard for ElevenLabs Eleven v4 and Cartesia Sonic 3.6. Eleven v4: Provider Voice rank 1 Elo 1,319; Controlled Voice rank 2 Elo 1,157; $80.00 per 1M chars; $0.022 per 1K until Oct 12; 90-plus languages; latency not stated for v4. Sonic 3.6: Provider Voice rank 2 Elo 1,276; Controlled Voice rank 4 Elo 1,138; $49.00 per 1M chars; $0.049 per 1K; 44 languages; sub-90 ms. Footer: 'Elo and board prices per Artificial Analysis; rate cards and specs vendor-reported.'

各モデルとは何か、それぞれ1段落で

ElevenLabs Eleven v4は9月28日に、同社の旗艦音声合成モデルとして、Eleven v4 Turboとともにリリースされた。ドキュメントによれば、90以上の言語に対応し、1リクエストあたり10,000文字の入力上限があり、話者識別が安定したマルチスピーカー対話、改善されたIPA音素サポート、話し方をスクリプトに直接書き込めるインライン指示を備えている。ボイスクローンは10秒の音声から即時クローンを作成でき、その上位にはプロフェッショナル向けティアがある。

Cartesia Sonic 3.6は、Cartesiaが速度と自然さを重視して位置づけているモデルラインの現行リリースです。同社の製品ページでは、これを最速かつ最も自然なテキスト読み上げモデルと称し、90ミリ秒未満のレイテンシ、44言語にわたるネイティブ多言語対応、10秒の音声からのボイスクローニング、カスタム発音辞書、そしてHIPAA、SOC 2 Type 2、GDPR、PCIにわたるコンプライアンス対応を挙げています。両ベンダーとも自社モデルのレイテンシ値を公表していますが、どちらの数値も独立に検証されておらず、同じ方法で測定されたものでもありません。

スコアボード、次元ごとに

• ブラインドでの選好、各ベンダー自身の音声 — Eleven v4 が1位、Elo 1,319 に対し Sonic 3.6 が2位、Elo 1,276。43ポイント差。

ブラインド選好、マッチングされたクローン音声 — Eleven v4 は2位、Elo 1,157 対 Sonic 3.6 は4位、Elo 1,138。19ポイント差で、最初のものより小さい。

• アリーナの価格正規化、100万文字あたり — Eleven v4 $80.00 対 Sonic 3.6 $49.00。リーダーボードの共通分母で見ると、Sonic は39%安い。

• ベンダー料金表、1,000文字あたり — Eleven v4 は $0.022(プロモーション価格)、10月12日以降は $0.08 となるのに対し、Sonic 3.6 は $0.049。プロモーション終了後は Sonic のほうが39%安い。

• 言語カバレッジ、ベンダー記載 — Eleven v4 は90以上、Sonic 3.6 は44。約2倍。

• リクエストあたりの入力上限 — Eleven v4 は 10,000 文字、Sonic 3.6 は製品ページに記載なし。

• レイテンシ、ベンダー公表値 — Eleven v4 Turbo は最初の音声出力までの中央値が約150 ms、Sonic 3.6 は90 ms未満。繰り返しになるが、テスト条件は異なる。

• ボイスクローニング — どちらも10秒の音声から、どちらもより高度なプロフェッショナル層で。

• 列挙コントロール — Eleven v4 は IPA 音素入力とプロフェッショナルクローン層をドキュメント化しており、Sonic 3.6 はカスタム発音辞書をドキュメント化している。

• コンプライアンス体制 — Sonic 3.6 は HIPAA、SOC 2 Type 2、GDPR、PCI を明記しています。ElevenLabs はコンプライアンスをモデルページとは別に記載しており、v4 の隣に対応するリストを掲載していません。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, Cartesia Sonic 3.6 second at Elo 1,276 with $49.0, and Google Gemini 3.8 Flash TTS third at Elo 1,267 with $16.5, each with its sample count, confidence interval, arena voice count and release month.

それらの行のうち2つは、実際のプロジェクトを左右するものだ。Eloの差は、ベンダー音声のボードでは43ポイント、クローン音声のボードでは19ポイントで、話者を固定するとSonicのラインは半分以上縮まる。これは、チューニングは競争力があるのに、デフォルトのボイスキャストはそうではないモデルの特徴であり、この対戦におけるSonicの問題は合成品質ではなく提示方法にあることを示している。

なぜ価格差は見かけほど大きくないのか

見出しの料金比較は、どちら向きにも誤解を招く。Eleven v4の1,000文字あたり0.022ドルは10月12日が期限のプロモーション価格であり、その期間を過ぎても残る数字は0.08ドルで、これはSonic 3.6の料金表を60%以上上回る。しかしアリーナ正規化はプロモーションを考慮しない。モデルを定価で価格評価し、80.00ドル対49.00ドルという結果になる。これこそ11月になっても依然として正しい比較だ。

2つ目の厄介な点があります。Cartesiaは製品ページで文字あたりの料金を公表していないため、$0.049という数字はベンダーではなくアリーナの正規化に由来しており、2つの計量は正確には一致しない可能性があります — 正規化はプロバイダーがどのように課金するかについて仮定を置くものです。順序は信頼できるものとし、正確なパーセンテージは概算として扱ってください。

500万文字を処理する1か月分では、Eleven v4 はプロモーション料金で110ドル、10月12日以降は400ドル。Sonic 3.6 は245ドル。したがって、今後2週間は Eleven v4 のコストが Sonic の半分以下だが、それ以降は63%高くなる。今日調達比較を作成して来月に提出する人は、どの料金を使ったかを明記しない限り、これを逆に理解してしまう。

Sonic 3.6が正解となるセグメント

アリーナのボードが重要なものを測定していない本番環境の音声ワークロードが存在し、Sonic 3.6 はそれらのために作られています。

リアルタイム会話エージェントは最も明白な例だ。90ミリ秒未満のレイテンシは、電話エージェントにおいてマーケティング用の数字ではない。それは、割り込みが処理されたと感じられるか、通話が切れたように感じられるかの違いであり、ElevenLabsはEleven v4自体について同等の数値を公表していない——Turboティアについて、最初の発話までの中央値約150ミリ秒という数値のみを公表している。エージェントのソケット予算が厳しいなら、43 Eloポイントはミリ秒よりもあなたにとって価値が低いかもしれず、自分自身のバージイン・テストのほうがどんなリーダーボードよりも早く決着をつけるだろう。

規制対象のデプロイは2番目です。Cartesiaは製品ページでHIPAA、SOC 2 Type 2、GDPR、PCIを明記しています。コンプライアンス一覧はEloではなく、それで代用することはできません。医療または決済のレビュー担当者があなたのリリース経路にいるなら、スコアボードのその行は他の9つを上回ります。

A screenshot of Cartesia's Sonic product page, captured in English, headed 'Sonic: The fastest and most natural text to speech model' with the claim 'Ranked #1 for naturalness, sub-90ms latency, and natively multilingual across 44 languages', a 'Try Sonic-3.6' button, an 'American English / Jacqueline' voice picker over a support-call sample, a 'Ranked #1 in Speech Arena leaderboard & Speech to Text leaderboard by Artificial Analysis' panel, and a 'Built for Voice Agents' tab strip spanning Naturalness, Reliability, Speed, Scalability, Multilingual, Consistency and Cost.

決定論的な発音が3つ目であり、これが最も微妙だ。{{1}}Eleven v4{{/1}}の文書化されたIPA音素入力は強みだが、{{2}}Sonic 3.6{{/2}}のカスタム発音辞書こそ、製品名の語彙が大きいチームがすでに構築していることが多いワークフローだ。辞書の移植は実際に手間のかかる作業であり、自分たちが所有する成果物をそのまま消費できるモデルのほうが有利なスタートを切れる。

Eleven v4 が単純に優れたモデルである場面

とはいえ、これらのボードも何かを測っており、Eleven v4 は両方で勝利した。Provider Voice では、推定の裏付けとなる1,674サンプルを伴い、Sonic 3.6 を43ポイントリードしている。そして前のフラッグシップである ElevenLabs Eleven v3 は1,169で、Sonic 3.6 の107ポイント後方に位置する。つまり ElevenLabs は、リードを守ったのではなく、一世代で実際の差を埋めたということだ。

言語数は明白な勝ちだ。90以上対44はおよそ2倍で、英語といくつかの言語を超えて出荷する場合、それは品質ではなくカバレッジの問題だ — Sonic 3.6は一部のロケールでは音声をまったく持たないかもしれない。さらに、複数話者の対話処理とインラインの話し方指示は、真の能力差だ。脚本に笑いを書き込むことはSonic 3.6が文書化していないワークフローであり、それを持たないモデルでその効果を再現するには後処理か別テイクが必要で、そのコストはEloの差が示唆するよりも大きい。

どちらかを実行すること、そしてサポートできない部分

OrcaRouterはこれらのモデルのどちらもホストしていません。ElevenLabsとCartesiaは当社のカタログには含まれていないため、この比較の内容を当社経由で呼び出すことはできず、「OrcaRouterで使うにはどうすればよいのか」という問いに対する正直な答えは、できない、ベンダーに直接問い合わせてください、ということになります。当社が対応しているのは、音声スタックが単一のプロバイダーではなく複数のプロバイダーにまたがってしまうケースです。200を超えるモデルに対して単一のAPIキーを使い、プロバイダーの定価を0%のマークアップでそのまま適用するため、ベンダーの価格変更は発効したその日に当社側でも反映されます。同じ月の文字数に110ドルを払うか400ドルを払うかで決まる判断において、このタイミングは小さなことではありません。

音声パスが顧客向けであり、途切れることが許されない場合、自動フェイルオーバーは、一方が劣化したときにトラフィックを正常なアップストリームへ移します。これが、2週間のプロモーション期間を活用する価値のあるパターンです。つまり、統合を書き換えることなく、2週間は本番環境をより安価なモデルに向け、料金が元に戻ったら戻すことができます。

誰が切り替えるべきか、誰が待つべきか

製品がどう聞こえるかで評価されるなら、20数言語を超えて提供しているなら、あるいはユーザーがベンダーに選ばれた声をそのまま聞くなら、Eleven v4 に切り替えてください。その最後のグループこそが Provider Voice ボードが代表する対象であり、そこでのギャップはどの行よりも大きいのです。

レイテンシ予算の下でリアルタイム会話を運用している場合、コンプライアンス審査担当者があなたのスタックを承認している場合、または再構築する余裕のない発音辞書を持っている場合は、Sonic 3.6 を使い続けてください。これら3つの項目では、Sonic は遅れているわけではありません。公表された回答がある唯一の選択肢なのです。

待って、どちらの場合でも、あなたの判断が価格に依存するなら。2週間後、Eleven v4の料金表はほぼ4倍に変わり、Sonic 3.6の料金表は変わらない。今日書かれた比較は、10月中旬には誤りだと読まれるだろう。Eloの順序は依然として成り立つ。金額はそうではない。