
Eleven v4がVoice Arenaを制覇:ElevenLabsの新フラッグシップが実際に勝ち取ったもの
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 983 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 196 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
ElevenLabs Eleven v4は9月28日に登場し、Artificial AnalysisのProvider Voice ArenaでElo 1,319を獲得して首位に立った。43ポイント差でCartesia Sonic 3.6の1,276を上回り、52ポイント差でGoogle Gemini 3.8 Flash TTSの1,267を上回った。同じボードでは、100万文字あたり80.00ドルで、トップ10の中で最も高価なモデルでもある。そして2つ目のアリーナ——各ベンダー自身の音声セットではなくクローン音声から構築された方——では、まったく勝てていない。4分の1の価格のモデルに次ぐ2位で終わる。どちらも事実であり、このローンチで役立つのは、あなたのユースケースがどちらに属するかを見極めることだ。
9月28日に実際にリリースされたのは何ですか?
ElevenLabsが一般提供を開始したのは1つではなく2つのモデルだ。ElevenLabs Eleven v4はフラッグシップの合成モデルであり、同社はこれを最も感情表現豊かだと評しており、ドキュメントでは1リクエストあたりの入力上限を10,000文字、対応言語を90以上と定めている。ElevenLabs Eleven v4 Turboは低遅延の兄弟モデルだ。同じく90以上の言語に対応し、上限は10,000文字で、スクリプト自体に話し方の指示——笑い声、ささやき、通話中のブザー音——を書き込めるインライン音声タグをサポートしている。どちらも初日から同社のエージェント、クリエイティブ、APIの各サーフェスで利用可能であり、これはv3世代よりも速い展開だ。
発表ページには機能一覧が載っており、注目すべきことに価格は載っていない。ElevenLabsは、新しいアーキテクチャ、トーン・ペーシング・キャラクターのより良い扱い、話者アイデンティティが安定したより信頼性の高い複数話者ダイアログ、改善されたIPA音素入力、そして既存のプロフェッショナルクローンティアに加えて10秒の音声から作られるインスタント音声クローンについて説明している。そこに唯一ある数字は、聴取者に関する主張だ。ベンダーによれば、ブラインド比較ではおよそ4分の3のケースでv4が好まれたという。それはベンダー側の数値であり、再現されておらず、以下のボードの数字の代わりに読むのではなく、それと並べて読むべきものだ。
価格が実際にどこにあるのか — API価格ページ — の方がより重要な文書であり、それについてはさらに下で扱われています。手短に言うと、今回のローンチは値上げではありません。
二つの基板、二つの異なる答え
Artificial Analysisは2つの音声アリーナを運営しており、これらは互いの変種ではありません。Provider Voiceでは、リスナーが各ベンダー独自の音声を比較します。Controlled Voiceは、すべての参加者に対して同じ8つの音声(米国4つ、英国4つ)をクローンするため、話者は一定に保たれ、モデルのみが変化します。優れたデフォルト音声キャストを持つモデルは、最初のアリーナで勝ち、2番目のアリーナで負けることがあります。Eleven v4がまさにその例です。
• Provider Voice、Eleven v4 — ランキング1位、Elo 1,319、100万文字あたり$80.00、1,674サンプル、8つのアリーナボイス、2026年9月
• プロバイダー音声、Cartesia Sonic 3.6 — ランク2、Elo 1,276、$49.00
• プロバイダー: Voice、Google Gemini 3.8 Flash TTS — 3位、Elo 1,267、$16.50
• Provider Voice、以前のフラッグシップである ElevenLabs Eleven v3 — 18位、Elo 1,169、$100.00
• 制御された音声、Alibaba Qwen-Audio-3.1-TTS-Plus — 1位、Elo 1,178
• Controlled Voice、Eleven v4 — 2位、Elo 1,157、$80.00
• Controlled Voice、Cartesia Sonic 3.6 — 4位、Elo 1,138
• コントロールされた音声、ElevenLabs Eleven v3 — ランク7、Elo 1,073
• Controlled Voice、Google Gemini 3.8 Flash TTS — 13位、Elo 1,048
• Provider Voice のオープンウェイト部門で最高のエントリー — Breeze TTS 2、Elo 1,206、$34.00

系譜の跳躍は、すでにElevenLabsを使っている人にとって最大の見出しだ。同じボード上で自社の前身と比べると、Eleven v4はProvider Voiceで150 Eloポイント、Voice Voiceで84ポイントを獲得している。これは調整版ではなく世代交代の動きであり、しかもベンダーが声を選べるボードのほうが改善幅は大きい。これは、新しいデフォルトのキャストが利得の実質的な一部であることを正直に言い表したものだ。

数値化できない発音ボード
Artificial Analysis は実際に Pronunciation Robustness セクションを実施しており、出回っているランキング概要が Eleven v4 をその首位としているため、きちんと説明する価値がある。このボードは、レビュアーが正しく発音されたと判定したハイライト付きスパンの割合を測定し、クリップごとに最大3名のレビュアーを配置し、プロンプトは書かれたとおりに送信される — 数字の展開もテキスト正規化もない。これはサブカテゴリに分かれており、この設計の要点は、話す前に「Dr.」や「$4.50」を黙って書き換えるモデルが意図的に低いスコアになることだ。
そのボードが、私たちが読むことのできた表示において公表していないのは、モデルごとの引用可能な数値スコアです。したがって、そこには Eleven v4 について引用できる数値はなく、1,319 という Elo は、アリーナの選好——リスナーがその音声をどれほど好んだか——に属するもので、発音精度に対するものではありません。この二つが混同されているように見えるなら、それこそが混同です。このローンチから言える擁護可能な主張は、数字が伴うものです。Provider Voice では 1,319 で1位、Controlled Voice では 1,157 で2位です。
あなたの請求にとって本当のニュースは、開始時の割引です
ElevenLabsは新しいモデルをリリースすると同時に価格を改定し、その割引はそれだけで購入判断を変えうるほど大きい。API価格ページでは、Eleven v4は1,000文字あたり$0.022で掲載され、提示された定価は$0.08 — 72%削減 — であり、Eleven v4 Turboは$0.011で掲載され、定価は$0.04である。どちらも同じ期間が適用される。プロモーションは10月12日まで実施される。その後、数字は元に戻り、戻ったv4価格はElevenLabs自身のv3の現在の価格$0.08の2倍になる。プロモーション価格ではなく、プロモーション終了後の数字を基準に計画せよ。
今回の価格改定により、文字単位で見た競合製品に対するv4の位置づけも変わる。これはアリーナ正規化ですでに100万文字あたり80.00ドルと示されている。そこではSonic 3.6が49.00ドル、Breeze TTS 2が34.00ドル、Qwen-Audio-3.0-TTS-Plusが19.30ドル、Gemini 3.8 Flash TTSが16.50ドルだ。プロモーション料金では、100万文字あたり22ドルのEleven v4がSonic 3.6を完全に下回る。リスト料金では、これは一覧の中で断トツに最も高価な音声だ。Q1の予算を組む人は、2番目の数字に目を向けるべきだ。

試算した1か月分を見れば、その価格差は具体的になる。500万文字——中規模の製品でおよそ100時間分の音声に相当する——の場合、ウィンドウ期間中の Eleven v4 は110ドルかかる。元に戻された $0.08 では400ドルだ。Sonic 3.6 は245ドル。Gemini 3.8 Flash TTS は82.50ドル。同じ1か月を ElevenLabs 自社の v3 で処理した場合も400ドルになる。ここにこのローンチの根底にある奇妙な事実がある。次の2週間、新しいフラッグシップはそれが置き換えるモデルより安く、ウィンドウが閉じる日には安くなくなり、ただより優れているだけになる。
レイテンシーに関する主張はベンダーによるものであり、階層によって異なります。
ElevenLabsはレイテンシの数値をモデルファミリーごとではなくティアごとに公表しており、それらは独立したものではなく同社が測定したものです。Eleven v4 Turboは、推論の中央値が約100 ms、最初の音声出力までの時間の中央値が約150 msと記載されており、2026年9月に測定されたものです。Eleven v3 Conversationalは約280 ms、旧FlashおよびTurboティアは約75 msと記載されています。ドキュメントは、Eleven v4自体については同等の数値を公表していません。リアルタイムエージェントを構築していて、テストではなく仕様書を読むのであれば、まさにそのティアが欲しくなるはずです。
CartesiaはSonicについて90ミリ秒未満のレイテンシを謳い、自然さで首位と説明している。10秒の音声からのボイスクローニング、カスタム発音辞書、HIPAA、SOC 2 Type 2、GDPR、PCIをカバーするコンプライアンス体制を備えるという。これらはベンダーが自社の製品ページで述べている主張であり、ElevenLabsのレイテンシ階層の数値と同じカテゴリーの証拠であって、アリーナのEloと置き換えられるものではない。両ベンダーが直接比較できるのは、リーダーボード上だけである。
それがあなたをどこに導くのか、そして試す方法
製品用に声を選んでいて、ユーザーが耳にするのがデフォルトのキャストだというなら、重要なのはProvider Voiceの結果であり、Eleven v4がそれを獲得したばかりだ。2週間限定の割引付きである。特定の人物の声をクローンしていて、すべての候補モデルが同じ8人の話者を再現するよう求められているなら、重要なのはControlled Voiceボードであり、Eleven v4は2位だ。首位からEloで21差、しかも定価では文字あたりのコストが4倍以上になる。どちらの結果も間違いではない。それらは異なる問いへの答えであり、2つ目の問いこそ、実運用の音声クローン作業の大半が実際に問うている問いなのだ。
OrcaRouterはElevenLabsやCartesia、その他これらのボードに掲載されているベンダーをホストしていないため、当社経由で呼び出せるものはここにはなく、そうであるかのような示唆も行いません。当社が提供するのは、あなたの音声スタックが複数のプロバイダーにまたがることになった場合に役立つ周辺の配管です:200以上のモデルにまたがる1つのAPIキーで、プロバイダーの定価を0%のマークアップでそのまま適用そのため、ベンダーの値下げ——今回のようなプロモーション期間を含む——は、次の請求サイクルではなく当日中に当社側で反映されます。音声パスが本番環境で重要な場合、自動フェイルオーバーが、いずれかが劣化したときに健全なアップストリームへ切り替えますこれは、リリースをそのエンドポイントに賭けることなく、まったく新しいエンドポイントをテストする実用的な方法です。
手帳に書き入れるべき日付は10月12日だ。その日、Eleven v4は現時点で最安の優れた音声であることをやめ、最も高価なものになる。そして、そのことに言及せずに100万あたり22ドルと引用している今週書かれた比較は、3週間後に再実行すべき比較だ。
