ElevenLabs Eleven v4 向けに生成されたヒーローカード。2つのパネルで構成され、左側には [laughs]、[whispers]、[said angrily in French accent] などのインライン音声タグを示すスクリプトブロック、右側にはランク1、Elo 1,319、100万文字あたり$80.00、Artificial Analysis の Provider Voice Arena での登場回数1,674回を表示するパネルがあり、フッターには「Provider Voice rank, Elo and price per Artificial Analysis, September 2026; tag syntax and latency vendor-documented.」と記されている。OrcaRouter のロゴは右下隅に配置されている。
Engineering & Research

Eleven v4のオーディオタグと10秒クローン:パイプラインで何が変わるのか

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

最も重大な点は、ElevenLabs Eleven v4のEloではない。それは、モデルが台本に書かれた演出指示を読み取ることだ — [笑う]、[ささやく]、[ため息をつく]、[フランス語なまりで怒って言う]、さらには[小雨] — そして、ElevenLabs Eleven v4 Turboは、同日にリリースされた低遅延の兄弟モデルで、同じタグに従う。最初の発話までの中央値時間はベンダーが約150msとしている。両モデルは2026年9月28日に一般提供を開始した。Artificial Analysis' Provider Voice Arenaでは、すでにEleven v4を1位に置き、1,674回の登場でElo 1,319、ボード価格は100万文字あたり80.00ドル。ランキングは見出しだ。演出指示の構文と10秒クローンこそ、あなたが構築しなければならないものを変える部分だ。

A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.

2モデル、1回のリリース、異なる役割

ElevenLabsは2026年9月28日に2つのエンドポイントをリリースしましたが、それらは速度切り替え付きの同じ製品ではありません。ElevenLabs Eleven v4は表現力豊かなモデルです。90以上の言語、リクエストあたり10,000文字の上限、カスタム発音のための国際音声記号サポートの改善、そして同社によればシーン全体で話者のアイデンティティを保持するマルチスピーカー対話を備えています。ElevenLabs Eleven v4 Turboは90以上の言語と10,000文字の上限を維持しつつ、エージェント向けに調整されています。発表では、ElevenLabsが2026年9月に測定した推論レイテンシの中央値約100 ms、最初の発話までの時間の中央値約150 msが引用されています。

A screenshot of the ElevenLabs models documentation page, flagship Text to Speech section. Eleven v4 is described as the most emotive, high quality speech synthesis model, with exceptional voice cloning capabilities, 90+ languages supported, a 10,000 character limit and support for natural multi-speaker dialogue. Eleven v4 Turbo is described as the most emotive, real-time speech synthesis model, with ultra-low latency (median inference latency of ~100ms), exceptional voice cloning capabilities, 90+ languages supported and audio tags for fine-grained control. Below them the page lists Eleven v3, Eleven v3 Conversational, Eleven Multilingual v2 and Eleven Flash v2.5.

応答性に関する疑問——フラッグシップモデルは電話エージェントに十分な速さなのか——に公表された答えはない。ElevenLabs が示しているレイテンシ値は Turbo のもので、Eleven v4 自体のものではない。また、この2つは1つのモデルに2つの名前が付いているのではなく、別個のエンドポイントだ。エージェントの最初の音声までの許容時間が 200 ms なら、ドキュメントに載っているエンドポイントは Turbo であり、フラッグシップモデルではない。

タグは実際のインターフェースであり、実際の依存関係でもある

インライン音声タグは音声合成にとって新しいものではありませんが、ここでの有用な変化は指示への追従精度です。発表によると、Eleven v4 は従来のモデルよりも音声タグや自然言語による指示プロンプトに正確に従い、これにより後から音声を編集することなく、笑い声、ささやき、あるいは特定のアクセントでの話し方を指示できるようになります。

そこから3つの実用的な帰結が続くが、それらはデモリールよりも重要だ:

• あなたのスクリプトは、文字列ではなく、テンプレート化された成果物になります。タグはあなたのコンテンツパイプラインにおけるトークンです。信頼できないテキストが通される可能性があるならエスケープが必要であり、あなたのCMS、翻訳レイヤー、そして差分レビューを生き延びなければなりません。[ささやき]を落とした翻訳者は、公演を音もなく変えてしまったのです。

• タグ追従性は、バージョンが紐づいたベンダーの主張にすぎない。この世代が前世代よりもタグにうまく従うという主張はElevenLabs自身によるもので、ElevenLabsが検証したものであり、言語をまたいで同一に成り立つわけではない。それを前提にスタイルガイドを作る前に、自分のスクリプトと自分のロケールで検証すること。

• 効果音タグ(例:[light rain] や [phone buzzing])は、音声ポストプロダクションの作業の一部をテキストプロンプトへと移す。これは測定に値するコストシフトだ。タグがフォーリーの収録を置き換えるなら安価だが、何も置き換えず分散を増やすだけなら、それはあなたのQAにおける新たな故障モードである。

10秒という数字がオンボーディングを変える

このリリースのInstant Voice Cloningは、10秒の音声から高忠実度で声をキャプチャし、その上位にはプロフェッショナルクローニングティアが引き続き利用可能です。10秒は十分に短いため、ワークフローのステップを一つにまとめます。同意取得、サンプルアップロード、最初の合成が、スタジオなしで、スマートフォンで、一度に実行できます。

同意の問題はサンプルが増えても小さくならない。むしろ大きくなる。説得力のあるクローンを作るためのハードルが、誰でも録音できるクリップにまで下がったからだ。自分が所有していない声をクローンしているなら、コンプライアンス上の問いに答える責任は、今やAPI呼び出しの前段で完全にあなたにある — モデルはあなたが求めたとおりに動く。10秒という数字は、許可証ではなく運用上のしきい値として扱うこと。

ウィンドウが開いている間にかかるコスト

ElevenLabsはローンチ時に価格を改定し、今日ページに表示されているのはそのプロモーション価格です。API価格表では、Eleven v4は1,000文字あたり$0.022と、表示されている定価$0.08に対して設定されており、Eleven v4 Turboは$0.011で$0.04に対して設定されています。どちらにも同じラベルが付いています:10月12日まで72%オフ。同じページでは、前世代のフラッグシップであるEleven v3が1,000文字あたり$0.08と価格設定されています。

• アリーナ上のボード価格、100万文字あたり — Eleven v4 は $80.00、そのボードのトップ10で最高額。

• ベンダー料金表、1千文字あたり — 10月12日までは0.022ドル、その後は0.08ドル。

• これが実際に意味するのは、スクリプトを多用する月で500万文字の場合、同じエンドポイントと同じコードで、適用期間中は110ドル、その後は400ドルかかるということだ。

A screenshot of the ElevenLabs API pricing page filtered to ElevenAPI. Four Text to Speech columns are shown: v4 at $0.022 with $0.08 struck through, v4 Turbo at $0.011 with $0.04 struck through, both carrying a '72% off until Oct 12' badge, Eleven v3 at $0.08 and Eleven v3 Conversational at $0.04 per 1K characters. The v4 column lists audio tags for fine-grained control and 90+ languages supported; the Turbo column lists ultra-low latency (~100ms) and v4 expressiveness tuned for latency; the v3 column lists 70+ languages and a 5,000 character limit. The cost calculator below prices a Starter plan at $6 per month with 272.727k characters of TTS (v4) included.

今日ページに載っている数字を基準に第1四半期の予算を組んでいる人は、2週間で失効する数字を基準にしていることになる。$0.08を使うこと。

このようなローンチで、ルーターがその価値を発揮する場面

OrcaRouterはElevenLabsをホストしていないため、今回のローンチで当社を通して呼び出せるものは何もなく、そうであるかのように示唆することもありません — Eleven v4を呼び出す場所はElevenLabs自身のAPIです。ローンチ後の2週間で単一のキーが本当に役立つのは比較です。新しいフラッグシップが現在運用しているものより優れているかどうかを判断するなら、リーダーボード上ではなく自分のスクリプトで両者をA/B比較したいはずです。そして、それを2つのベンダーにまたがって行うということは、答えを得る前に2つのアカウント、2つの請求関係、2つの統合経路が必要になるということです。

当社が対応するのは、まさにそうしたケースです。1つのAPIキーで200以上のモデルを利用でき、プロバイダーの定価は0%のマークアップでそのまま適用されます。そのため、期限付きのプロモーション期間を含むベンダーの価格変更も、次の請求サイクルではなく当日中に当社側で有効になります。音声経路が顧客対応である場合、自動フェイルオーバーが、あるエンドポイントが劣化したときにトラフィックを正常な上流へ移動させます。これにより、リリースをそのモデルに賭けることなく、まったく新しいモデルを試せます。

まず何をテストし、何を無視すべきか

3つのチェックは、どんなランキングよりも多くを教えてくれます。まず、現実的な範囲で最も長いスクリプトを10,000文字の上限に通し、継ぎ目がどこに来るかを見てください。上限はリクエストごとに適用され、複数話者の対話が最も分割されやすい機能です。次に、タグ付きの自分の文を5つ、v4とv4 Turboの両方に入れて、表現力重視のエンドポイントと低遅延エンドポイントの間でタグの効き方のずれを聴き比べてください。両者は別々のモデルであり、一方で意図どおりに効くタグが、もう一方でも同じように効くとは限りません。第三に、実際の月間文字数の見積もりは$0.022ではなく$0.08で計算してください。次の四半期はその数字で動くのですから。

発表にある約75%というブラインド選好の数値はベンダーによる測定であり、私たちはそれを別の何かにすり替えるつもりはありません。このローンチで独立した数値は、ボード上のものです。1,674回の登場でElo 1,319の首位、そしてそれを中心とする約±19ポイントの区間です。それは実際のボード上での強い結果です。それは仕様ではなく、あなたのタグ構文が翻訳パスを経ても生き残るかどうかを教えてくれるものでもありません。