ElevenLabs Eleven v4 対 SpeechifyAI Simba 3.2 の生成ヒーローカード。2枚のスコアカードを備える:Eleven v4 は Elo 1,319、ランク1、100万文字あたり $80.00。Simba 3.2 は Elo 1,240、ランク7、100万文字あたり $6.58。キャプションは「約12倍の価格に対して79のEloポイント」。フッター:「Provider Voice Arena、Artificial Analysis による、2026年9月」。OrcaRouter のロゴは右下隅に配置されている。
Guides & Insights

Eleven v4 対 Simba 3.2:12倍のコストがかかる79ポイントの差

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Artificial AnalysisのProvider Voice Arenaでは、ElevenLabs Eleven v4がElo 1,319で1位、そしてSpeechifyAI Simba 3.2は1,240で7位 — 79ポイント差、トップ10の幅がわずか113ポイントのボードで。価格はまったくそこまで近くない。ElevenLabsの新フラッグシップ(2026年9月28日リリース)は100万文字あたり80.00ドル、Simba 3.2は6.58ドル。これはおよそ12倍の差で、トップ10内の任意の2モデル間で最大の価格対品質スプレッドだ。その差が好機か罠かは、2つのうちどちらを置き換えるかによって完全に決まる。

取締役会を正しく読み解く

意思決定に持ち込む価値のある数字は、あの二つの見出し数値だけではない。選好ボード上の順位は動く標的であり、各推定値の周りの区間こそが、その並びのどれだけがシグナルなのかを教えてくれる。

• ElevenLabs Eleven v4 — 1位、Elo 1,319、±19、登場回数1,674回、アリーナボイス8種類、100万文字あたり80.00ドル、2026年9月28日リリース

• SpeechifyAI Simba 3.2 — 7位、Elo 1,240、±14、2,535回登場、8つのアリーナボイス、100万文字あたり$6.58、2026年7月1日リリース

• SpeechifyAI Simba 3.0 — Elo 1,123、100万文字あたり6.58ドル、2026年2月19日リリース

A generated scoreboard comparing ElevenLabs Eleven v4 and SpeechifyAI Simba 3.2 across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 7 / 1,240), interval and samples (plus or minus 19 on 1,674 against plus or minus 14 on 2,535), board price ($80.00 against $6.58 per 1M characters), rate card ($0.022 per 1K characters until October 12 against $6.58 per 1M unchanged), arena voices (8 against 8) and release date (September 28, 2026 against July 1, 2026). Footer: 'Ranks, Elo, intervals and board prices per Artificial Analysis, Sept 2026.' The OrcaRouter logo sits in the bottom-right corner.

そこから2つのことが導かれる。第一に、Eleventh v4 の区間はおよそ 1,300 から 1,338、Simba 3.2 のそれは約 1,226 から 1,254 で、両範囲は約46ポイントの明確な間隔で隔てられているため、順序はコイン投げではない。第二に、より有用なのは、Simba 3.2 が同一のボード価格(1,240 対 1,140)で Simba 3.0 よりちょうど100 Eloポイント改善したことだ。SpeechifyAI は世代的な向上を実現しながら料金を上げなかった。これは、ElevenLabs が今回のローンチで行ったこととは正反対である。

A screenshot of Artificial Analysis' Provider Voice Arena leaderboard. ElevenLabs Eleven v4 is first at Elo 1,319 with an interval of plus or minus 19, 1,674 samples, eight arena voices and $80.0 per 1M characters. Cartesia Sonic 3.6 is second at 1,276, Google Gemini 3.8 Flash TTS third at 1,267 and $16.5, Google Gemini 3.8 Flash-Lite TTS sixth at 1,241 and $11.0, and SpeechifyAI Simba 3.2 seventh at Elo 1,240 with an interval of plus or minus 14, 2,535 samples, eight arena voices, released Jul 2026 at $6.6 per 1M characters.

12倍の価格で買えるもの、具体的には

Elo値は抽象的な部分です。こちらは予算項目に計上できる部分です。月に500万文字——完成した音声でおよそ100時間分——での比較は、次のようになります:

• ローンチ期間中のEleven v4は、1,000文字あたり0.022ドル — 月額110ドル

• Eleven v4 はリスト価格で、10月12日以降は1,000文字あたり$0.08 — 月額$400

• Simba 3.2、ボードの正規化価格で100万あたり6.58ドル — 月約33ドル

• ElevenLabs Eleven v3、前世代のフラッグシップは、1,000文字あたり$0.08 — 月額$400

2週間の間、その差は3倍だ。10月12日以降は12倍になり、そこに留まる。なぜなら、ボード上の100万あたり$80.00はプロモーションではなく定価だからだ。今週書かれた比較で、プロモーション価格を通常価格であるかのように引用しているものは、10月中旬には誤りとなっており、しかもElevenLabsが安く見える方向に誤っている。

Simba 3.2 が正解となるのはどこか

ボード上で7位は悪いモデルではない。GoogleのGemini 3.1 Flash TTSより上で、ElevenLabs自身のv3 Conversationalの1,197より上、Cartesiaの前世代Sonic 3.5の1,185より上だ。3つのワークロードが、それを明白な選択肢にしている。

A screenshot of Artificial Analysis' Simba 3.2 model page, titled Simba 3.2 Quality Elo, Speed & Price Analysis, credited to SpeechifyAI with an Elo of 1,239.94. The Provider Voice Arena Preference Elo bar chart shows Simba 3.2 highlighted in blue at 1,240 in the middle of the row, with Eleven v4 at 1,319 at the left, and the model selector reads '27 of 96 models'.

長尺のボリュームが第一だ。オーディオブックの過去カタログ、ポッドキャストのアーカイブ、アクセシビリティ向け読み上げは文字単位で課金され、秒ではなく何時間もの単位で評価される。100万文字あたり$6.58なら、さらに100時間分を加える限界費用は取るに足らないが、$80.00では決してそうはならない。79ポイントの選好ギャップは、聞き比べればリスナーが気づく違いだ。6時間のナレーションともなれば、大半のリスナーは請求額のほうにはあまり気づかない。

Default-cast ワークロードは2番目にあり、ここでリーダーボードの構成が重要になります。Provider Voice は各ベンダーをそのベンダー自身の音声を使って測定するため、Simba 3.2 の順位は、独自のキャラクターを備えた8つのアリーナ音声によって獲得されたものです。あなたの製品がベンダーの選んだ音声をそのまま搭載しているなら、リーダーボードが測定したものとまったく同じものを購入していることになり、それは最高位の代替製品の7分の1の価格で購入していることになります。

すでに統合済みのSimbaデプロイメントが3番目です。Simba 3.0を使っているなら、3.2へのアップグレードは、レートが一切変わらず、おそらく統合にも変更がないままで、100 Eloポイントに相当します。これはこの比較全体の中で唯一最良の価格性能の一手であり、ElevenLabsも私たちも関与していません。

追加の12回が省略できない場合

Simba 3.2が埋めない隔たりは、アリーナが採点できない隔たりだ。この2つのモデルを分かつのは、2つの能力差である。

脚本の演出指示が最も明確だ。Eleven v4 は、テキストに演技を書き込めるインライン音声タグを文書化している——[笑う]、[ささやく]、[フランス語訛りで怒りながら言う]——に加えて、自然言語による演出プロンプトや、カスタム発音のための国際音声記号(IPA)対応の改善もある。それを備えていないモデルで再現しようとすれば、テイク2、人間の編集者、あるいは別の声が必要になる。それらは、文字数の差よりも1時間あたりのコストが高くつく。

言語カバレッジが2点目です。Eleven v4は、10,000文字の入力上限に対して90以上の言語を記載しています。SpeechifyAIはSimba 3.2について、当社が検証できた同等のカウントを示しています。したがって、この比較はElevenLabsに有利な未証明か、証明済みのどちらかとして扱ってください。もしあなたの製品が24のロケールで提供されているなら、どちらかのモデルにそれらの音声があると想定する前に、自分のリストでカバレッジを確認してください。

第三の違いは、リーダーボード上では見えないものなので、取り上げる価値がある。Eleven v4 のインスタントクローニングは、10秒の音声から動作する。ベンダー提供のキャストを使うのではなく、特定の人物をクローンすることを軸にワークフローを組んでいるなら、必要なサンプル長の基準は79 Eloポイントよりも重要であり、それは音声APIに一般的な特性ではなく、モデルごとに確認しなければならない事実だ。

ルーティングの疑問に、正直に答える

SpeechifyAI Simba 3.2も、ElevenLabsのどのモデルも、OrcaRouterのカタログにはありません。当社を通じて呼び出せるものはここには何もなく、その両方にアクセスするのにふさわしい場所はベンダー自身のAPIです — SimbaならSpeechifyAIの、Eleven v4ならElevenLabsの。私たちは、比較をセールストークに飾り立てるよりも、そう率直に言いたいと思います。

1つのキーが本当に元を取れるのは、ローンチ後の2週間だ。その時期、まともなエンジニアリング上の答えは「両方を自社のスクリプトで動かして、そこから判断する」になる。2社のベンダーにまたがってこれを行うには、通常、1つの比較ポイントを得る前に、2つのアカウント、2つの請求関係、2つのリクエスト形式が必要になる。1つのAPIキーが200以上のモデルにまたがり、プロバイダーの定価を0%のマークアップでそのまま渡すことで、そのセットアップコストを取り除く。そして、自動フェイルオーバーがあれば、試用中のモデルを、本番パスにとって単一障害点にすることなく、その背後に置ける。

誰が切り替えるべきで、誰は一切動くべきではないのか

音声品質が製品の決め手なら、Eleven v4 に切り替えよう。ユーザーがあなたの選んでいないデフォルト音声を耳にする場合、スクリプトに演技指示を書き込む必要がある場合、またはクローニングのワークフローがソース音声の秒数で測られる場合だ。79ポイントの差は現実であり、その背後にある能力差は数字が示すより大きい。予算は1,000文字あたり0.08ドルで組むこと。0.022ドルではない。

大量の音声を制作しているなら、Simba 3.2 のままにしておきましょう。長編ナレーション、アーカイブ系コンテンツ、何時間もの音声にわたって文字単価が積み上がるようなものすべてです。ランキング首位は諦めることになりますが、報酬のおよそ12分の11は確保できます。そして Simba 3.0 を使っているなら、まず 3.2 にアップグレードして再測定してください — タダで得られる100 Eloポイントは、この比較のどちらの側が提供しているものよりも良いリターンです。

すべきでないのは、この記事だけで判断することです。ここまで述べてきたすべての正直な限界は、アリーナがベンダー音声に対するブラインドの選好をある一時点で測定しているという点にあり、さらにElevenLabsの料金表は10月12日に変更されます。本番経路を移す前に、その日付以降に、ご自身の月間文字数を使って計算をやり直してください。