Сгенерированная hero-карточка для ElevenLabs Eleven v4 с двумя панелями: слева — блок скрипта с инлайновыми аудиотегами, такими как [laughs], [whispers] и [said angrily in French accent]; справа — панель с надписью «ранг 1, Elo 1 319, 80,00 $ за 1 млн символов и 1 674 появления на Provider Voice Arena от Artificial Analysis», а в нижнем колонтитуле — «Ранг Provider Voice, Elo и цена по данным Artificial Analysis, сентябрь 2026; синтаксис тегов и задержка задокументированы производителем». Логотип OrcaRouter расположен в правом нижнем углу.
Engineering & Research

Аудиотеги Eleven v4 и десятисекундные клоны: что меняется в вашем пайплайне

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самое значимое вElevenLabs Eleven v4 — не его Elo. Дело в том, что модель читает режиссёрские указания, записанные в сценарии, — [смеётся], [шёпотом], [вздыхает], [сказано сердито с французским акцентом], даже [лёгкий дождь] — и то, что ElevenLabs Eleven v4 Turbo, низколатентный собрат, выпущенный в тот же день, следует тем же тегам при медианном времени до первой речи, которое вендор оценивает примерно в 150 мс. Оба стали общедоступны 28 сентября 2026 года. Provider Voice Arena от Artificial Analysis уже ставит Eleven v4 на 1-е место с Elo 1 319 по 1 674 появлениям, при цене на площадке $80.00 за миллион символов. Рейтинг — это главная новость. Синтаксис режиссёрских указаний и десятисекундное клонирование — это то, что меняет то, что вам приходится создавать.

A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.

Две модели, один запуск, разные задачи

28 сентября 2026 года ElevenLabs выпустила два эндпоинта, и это не один и тот же продукт с переключателем скорости. ElevenLabs Eleven v4 — это выразительная модель: более 90 языков, ограничение в 10 000 символов на запрос, улучшенная поддержка Международного фонетического алфавита для пользовательского произношения и диалог с несколькими говорящими, который, по словам компании, сохраняет идентичность говорящего на протяжении сцены. ElevenLabs Eleven v4 Turbo сохраняет более 90 языков и ограничение в 10 000 символов, но оптимизирована для агентов — в анонсе приводятся медианная задержка инференса около 100 мс и медианное время до первого звука речи около 150 мс, по измерениям ElevenLabs в сентябре 2026 года.

A screenshot of the ElevenLabs models documentation page, flagship Text to Speech section. Eleven v4 is described as the most emotive, high quality speech synthesis model, with exceptional voice cloning capabilities, 90+ languages supported, a 10,000 character limit and support for natural multi-speaker dialogue. Eleven v4 Turbo is described as the most emotive, real-time speech synthesis model, with ultra-low latency (median inference latency of ~100ms), exceptional voice cloning capabilities, 90+ languages supported and audio tags for fine-grained control. Below them the page lists Eleven v3, Eleven v3 Conversational, Eleven Multilingual v2 and Eleven Flash v2.5.

На вопрос о быстроте реакции — достаточно ли флагман быстр для телефонного агента — опубликованного ответа нет. ElevenLabs приводит показатели задержки для Turbo, а не для самого Eleven v4, и это два разных эндпоинта, а не одна модель под двумя названиями. Если бюджет вашего агента — 200 мс до первого аудио, то Turbo — это эндпоинт в документации, а флагман — нет.

Теги — это настоящий интерфейс и настоящая зависимость.

Встроенные аудиотеги не новы для синтеза речи, но полезное изменение здесь — точность соблюдения. В анонсе говорится, что Eleven v4 следует аудиотегам и указаниям на естественном языке точнее, чем предыдущие модели, и что именно так можно задать смех, шёпот или подачу с определённым акцентом без последующего редактирования аудио.

Из этого следуют три практических следствия, и они важнее, чем демонстрационные ролики:

• Ваш сценарий становится шаблонизированным артефактом, а не строкой. Тег — это токен в вашем конвейере контента: его нужно экранировать, если через него когда-либо проходит недоверенный текст, и ему нужно пережить вашу CMS, ваш слой перевода и ваше diff-ревью. Переводчик, который опускает [шёпотом], незаметно изменил спектакль.

• Соблюдение тегов — это заявление вендора с привязкой к версии. Утверждение, что это поколение соблюдает теги лучше предыдущего, принадлежит самой ElevenLabs, проверено самой ElevenLabs, и оно не будет одинаково верным для разных языков. Проверяйте на собственных скриптах и в собственных локалях, прежде чем строить на этом руководство по стилю.

• Теги звуковых эффектов, такие как [лёгкий дождь] или [жужжание телефона] переносят часть работы по постпродакшену звука в текстовый промпт. Это смещение затрат, которое стоит измерить: если тег заменяет проход фоли, это дёшево; если он не заменяет ничего и лишь добавляет вариативность, это новый режим отказа в вашем QA.

Десять секунд — это число, которое меняет онбординг.

Функция мгновенного клонирования голоса в этом выпуске захватывает голос с высокой точностью по десяти секундам аудио, при этом профессиональный уровень клонирования по-прежнему доступен выше него. Десяти секунд достаточно мало, чтобы сократить один этап рабочего процесса: получение согласия, загрузка образца и первый синтез могут произойти за один сеанс, на телефоне, без студии.

Проблема согласия не уменьшается вместе с образцом. Она растёт, потому что планка для создания убедительного клона опустилась до клипа, который может записать кто угодно. Если вы клонируете голоса, которые вам не принадлежат, вопрос соблюдения требований теперь полностью за вами, и отвечать на него нужно до вызова API — модель сделает то, о чём вы попросите. Воспринимайте десятисекундный показатель как операционный порог, а не как разрешительную бумажку.

Сколько это стоит, пока окно открыто

ElevenLabs пересмотрела цены на запуске, и промо-тариф — это тот, что указан на странице сегодня. В таблице цен API Eleven v4 указан по цене $0.022 за 1000 символов против заявленной цены $0.08, а Eleven v4 Turbo — по $0.011 против $0.04. На обоих одна и та же пометка: скидка 72% до 12 октября. На той же странице указана цена предыдущего флагмана, Eleven v3, — $0.08 за 1000 символов.

• Цена на табло на арене, за миллион символов — Eleven v4 $80.00, самая высокая в первой десятке этого табло.

• Тарифная карта поставщика, за тысячу символов — $0,022 до 12 октября, затем $0,08.

• Что это означает на практике: месяц с интенсивным использованием скриптов объёмом пять миллионов символов стоит $110 в течение этого окна и $400 после него — на той же конечной точке с тем же кодом.

A screenshot of the ElevenLabs API pricing page filtered to ElevenAPI. Four Text to Speech columns are shown: v4 at $0.022 with $0.08 struck through, v4 Turbo at $0.011 with $0.04 struck through, both carrying a '72% off until Oct 12' badge, Eleven v3 at $0.08 and Eleven v3 Conversational at $0.04 per 1K characters. The v4 column lists audio tags for fine-grained control and 90+ languages supported; the Turbo column lists ultra-low latency (~100ms) and v4 expressiveness tuned for latency; the v3 column lists 70+ languages and a 5,000 character limit. The cost calculator below prices a Starter plan at $6 per month with 272.727k characters of TTS (v4) included.

Все, кто верстает бюджет на Q1, ориентируясь на сегодняшнюю цифру на странице, закладывают в бюджет цифру, которая устареет через две недели. Используйте $0.08.

Где роутер заслуживает своё место в таком запуске

OrcaRouter не размещает ElevenLabs, поэтому в этом запуске нет ничего, что можно было бы вызывать через нас, и мы не станем намекать на обратное — вызывать Eleven v4 следует через собственный API ElevenLabs. А вот для чего один ключ действительно полезен в течение двух недель после запуска — так это для сравнения. Если вы решаете, превосходит ли новый флагман то, что вы уже используете, вам нужно сравнить эти два варианта методом A/B на собственных скриптах, а не по таблице лидеров, а для этого при работе с двумя поставщиками понадобятся два аккаунта, две схемы оплаты и два пути интеграции, прежде чем вы получите ответ.

Именно такой случай мы и обрабатываем: один API-ключ для более 200 моделей с передачей цен из прайс-листов провайдеров при наценке 0%, поэтому изменение цены поставщиком — включая промо-период с датой окончания — становится актуальным у нас в тот же день, а не в следующем цикле выставления счетов. Там, где голосовой канал обращён к клиентам, автоматическое переключение при сбое перенаправляет трафик на работоспособный вышестоящий сервис, когда один эндпоинт деградирует; именно так можно протестировать совершенно новую модель, не рискуя из-за неё релизом.

Что тестировать в первую очередь, а что игнорировать

Три проверки скажут вам больше, чем любой рейтинг. Во-первых, пропустите ваш самый длинный реалистичный сценарий через лимит в 10 000 символов и посмотрите, где пройдут швы — лимит действует на запрос, а диалог нескольких говорящих — это функция, которую он вероятнее всего разорвёт. Во-вторых, пропустите пять своих собственных предложений с тегами и через v4, и через v4 Turbo и послушайте, нет ли расхождения в соблюдении тегов между выразительной и низколатентной конечной точкой; это отдельные модели, и тег, который срабатывает на одной, может сработать иначе на другой. В-третьих, оценивайте свой фактический месячный объём символов по цене $0.08, а не $0.022, потому что именно на это число будет опираться ваш следующий квартал.

Цифра ~75% слепого предпочтения в анонсе — это измерение вендора, и мы не собираемся выдавать её за что-то другое. Независимое число в этом запуске — то, что на табло: первое место с 1 319 Elo при 1 674 появлениях и интервал примерно ±19 пунктов вокруг него. Это сильный результат на настоящем табло. Это не спецификация, и он не скажет вам, переживёт ли ваш синтаксис тегов проход перевода.