Wygenerowana karta hero dla ElevenLabs Eleven v4 z dwoma panelami: po lewej blok skryptu pokazujący wbudowane tagi audio, takie jak [laughs], [whispers] i [said angrily in French accent]; po prawej panel z pozycją 1, Elo 1 319, 80,00 USD za 1 mln znaków i 1 674 wystąpieniami w Provider Voice Arena firmy Artificial Analysis, a w stopce widnieje napis „Ranking Provider Voice, Elo i cena według Artificial Analysis, wrzesień 2026; składnia tagów i opóźnienie udokumentowane przez dostawcę”. Logo OrcaRouter znajduje się w prawym dolnym rogu.
Engineering & Research

Tagi audio w Eleven v4 i klony dziesięciosekundowe: co się zmienia w Twoim pipeline

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najważniejsze w ElevenLabs Eleven v4nie jest jego Elo. Chodzi o to, że model odczytuje wskazówki reżyserskie zapisane w scenariuszu — [śmiech], [szept], [westchnienie], [powiedziane ze złością z francuskim akcentem], nawet [lekki deszcz] — i że ElevenLabs Eleven v4 Turbo, niskolatencyjny bliźniak wypuszczony tego samego dnia, obsługuje te same tagi przy medianie czasu do pierwszego słowa, którą dostawca szacuje na około 150 ms. Oba weszły do ogólnej dostępności 28 września 2026 r. Artificial Analysis' Provider Voice Arena ma już Eleven v4 na 1. miejscu z Elo 1 319 w 1 674 występach, przy cenie na tablicy 80,00 USD za milion znaków. Ranking to nagłówek. Składnia wskazówek i dziesięciosekundowy klon to część, która zmienia to, co musisz zbudować.

A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.

Dwa modele, jedna premiera, różne zadania

ElevenLabs udostępnił dwa endpointy 28 września 2026 r. i nie są to ten sam produkt z przełącznikiem szybkości. ElevenLabs Eleven v4 jest modelem ekspresyjnym: ponad 90 języków, limit 10 000 znaków na żądanie, ulepszona obsługa Międzynarodowego Alfabetu Fonetycznego dla niestandardowych wymów oraz dialog wielu mówców, który według firmy zachowuje tożsamość mówcy w całej scenie. ElevenLabs Eleven v4 Turbo zachowuje ponad 90 języków i limit 10 000 znaków, ale jest dostrojony dla agentów — w ogłoszeniu podano medianę opóźnienia wnioskowania około 100 ms i medianę czasu do pierwszego dźwięku mowy około 150 ms, zmierzone przez ElevenLabs we wrześniu 2026 r.

A screenshot of the ElevenLabs models documentation page, flagship Text to Speech section. Eleven v4 is described as the most emotive, high quality speech synthesis model, with exceptional voice cloning capabilities, 90+ languages supported, a 10,000 character limit and support for natural multi-speaker dialogue. Eleven v4 Turbo is described as the most emotive, real-time speech synthesis model, with ultra-low latency (median inference latency of ~100ms), exceptional voice cloning capabilities, 90+ languages supported and audio tags for fine-grained control. Below them the page lists Eleven v3, Eleven v3 Conversational, Eleven Multilingual v2 and Eleven Flash v2.5.

Pytanie o responsywność — czy flagowiec jest wystarczająco szybki dla agenta telefonicznego — nie ma opublikowanej odpowiedzi. ElevenLabs podaje wartości opóźnień dla Turbo, a nie dla samego Eleven v4, a te dwa są odrębnymi punktami końcowymi, a nie jednym modelem pod dwiema nazwami. Jeśli Twój agent ma budżet 200 ms do pierwszego dźwięku, Turbo jest punktem końcowym w dokumentacji, a flagowiec nie.

Tagi to prawdziwy interfejs i prawdziwa zależność.

Śródwierszowe znaczniki audio nie są nowością w syntezie mowy, ale użyteczną zmianą jest tutaj dokładność ich przestrzegania. Ogłoszenie mówi, że Eleven v4 dokładniej niż wcześniejsze modele przestrzega znaczników audio i poleceń sterujących w języku naturalnym oraz że właśnie w ten sposób sterujesz śmiechem, szeptem lub sposobem wypowiedzi w konkretnym akcencie, bez późniejszej edycji audio.

Wynikają z tego trzy praktyczne konsekwencje, które mają większe znaczenie niż filmy demonstracyjne:

• Twój skrypt staje się artefaktem szablonowym, a nie ciągiem znaków. Tag to token w Twoim potoku treści: wymaga escapowania, jeśli kiedykolwiek przepuszczany jest niezaufany tekst, i musi przetrwać Twój CMS, Twoją warstwę tłumaczeniową oraz przegląd diffów. Tłumacz, który pomija [szeptem], zmienił występ po cichu.

• Przestrzeganie tagów to twierdzenie dostawcy przypisane do konkretnej wersji. Twierdzenie, że ta generacja lepiej przestrzega tagów niż poprzednia, pochodzi od ElevenLabs i zostało przetestowane przez ElevenLabs, ale nie będzie działać identycznie w różnych językach. Zweryfikuj to na własnych skryptach i w swoich lokalizacjach, zanim oprzesz na tym przewodnik po stylu.

• Tagi efektów dźwiękowych, takie jak [lekki deszcz] lub [brzęczenie telefonu] przenoszą część pracy nad postprodukcją dźwięku do promptu tekstowego. To przesunięcie kosztów warte zmierzenia: jeśli tag zastępuje przebieg foley, jest tani; jeśli niczego nie zastępuje i tylko dodaje wariancji, to nowy tryb awarii w Twojej kontroli jakości.

Dziesięć sekund to liczba, która zmienia onboarding

Instant Voice Cloning w tym wydaniu odwzorowuje głos z wysoką wiernością na podstawie dziesięciu sekund audio, a profesjonalny poziom klonowania pozostaje dostępny powyżej. Dziesięć sekund to wystarczająco krótko, że eliminuje to jeden etap przepływu pracy: uzyskanie zgody, przesłanie próbki i pierwsza synteza mogą odbyć się podczas jednej sesji, na telefonie, bez studia.

Problem zgody nie maleje wraz z próbką. Rośnie, ponieważ poprzeczka do stworzenia przekonującego klonu spadła do klipu, który każdy może nagrać. Jeśli klonujesz głosy, których nie posiadasz, kwestia zgodności spoczywa teraz w całości na Tobie i musisz ją rozstrzygnąć przed wywołaniem API — model zrobi to, o co go poprosisz. Traktuj liczbę dziesięciu sekund jako próg operacyjny, a nie przepustkę.

Ile to kosztuje, gdy okno jest otwarte

ElevenLabs zmienił ceny przy premierze, a promocyjna stawka to ta, którą można zobaczyć dziś na stronie. W tabeli cen API Eleven v4 widnieje w cenie 0,022 USD za 1000 znaków wobec podanej ceny katalogowej 0,08 USD, a Eleven v4 Turbo na 0,011 USD wobec 0,04 USD. Oba mają tę samą etykietę: 72% zniżki do 12 października. Ta sama strona wycenia poprzedni flagowy model, Eleven v3, na 0,08 USD za 1000 znaków.

• Cena w rankingu na arenie, za milion znaków — Eleven v4 80,00 USD, najwyższa w pierwszej dziesiątce tego rankingu.

Cennik dostawcy, za tysiąc znaków — 0,022 USD do 12 października, potem 0,08 USD.

• Co to oznacza w praktyce — miesiąc intensywnie obciążony skryptami z pięcioma milionami kosztuje 110 USD podczas wydarzenia i 400 USD po nim, na tym samym endpoincie z tym samym kodem.

A screenshot of the ElevenLabs API pricing page filtered to ElevenAPI. Four Text to Speech columns are shown: v4 at $0.022 with $0.08 struck through, v4 Turbo at $0.011 with $0.04 struck through, both carrying a '72% off until Oct 12' badge, Eleven v3 at $0.08 and Eleven v3 Conversational at $0.04 per 1K characters. The v4 column lists audio tags for fine-grained control and 90+ languages supported; the Turbo column lists ultra-low latency (~100ms) and v4 expressiveness tuned for latency; the v3 column lists 70+ languages and a 5,000 character limit. The cost calculator below prices a Starter plan at $6 per month with 272.727k characters of TTS (v4) included.

Każdy, kto planuje budżet na Q1 na podstawie liczby widniejącej dziś na stronie, planuje budżet na podstawie liczby, która wygaśnie za dwa tygodnie. Użyj 0,08 USD.

Gdzie router zyskuje swoje miejsce w takiej premierze

OrcaRouter nie hostuje ElevenLabs, więc w tej premierze nie ma nic, co można by wywołać przez nas, i nie będziemy sugerować inaczej — miejscem, w którym można wywołać Eleven v4, jest własne API ElevenLabs. To, do czego pojedynczy klucz jest naprawdę przydatny w ciągu dwóch tygodni po premierze, to porównanie. Jeśli decydujesz, czy nowy flagowiec przewyższa to, co już używasz, chcesz porównać oba w trybie A/B na własnych skryptach, a nie na tabeli liderów, a zrobienie tego u dwóch dostawców oznacza dwa konta, dwie relacje rozliczeniowe i dwie ścieżki integracji, zanim uzyskasz odpowiedź.

To właśnie ten przypadek obsługujemy: jeden klucz API do ponad 200 modeli z cenami katalogowymi dostawców przekazywanymi przy 0% marży, dzięki czemu zmiana ceny przez dostawcę — w tym okno promocyjne z datą wygaśnięcia — jest widoczna po naszej stronie tego samego dnia, a nie dopiero w kolejnym cyklu rozliczeniowym. Gdy ścieżka głosowa jest skierowana do klienta, automatyczne przełączanie awaryjne przenosi ruch do zdrowego systemu nadrzędnego, gdy jeden punkt końcowy zaczyna działać gorzej — i właśnie tak można przetestować zupełnie nowy model, nie ryzykując przy tym premiery produktu.

Co testować najpierw, a co ignorować

Trzy testy powiedzą Ci więcej niż jakikolwiek ranking. Po pierwsze, przepuść swój najdłuższy realistyczny scenariusz przez limit 10 000 znaków i zobacz, gdzie wypadną miejsca podziału — limit dotyczy pojedynczego żądania, a dialog wielomówcowy to funkcja, która najprawdopodobniej zostanie przez niego podzielona. Po drugie, wprowadź pięć własnych zdań z tagami zarówno do v4, jak i v4 Turbo, i nasłuchuj dryfu przestrzegania między endpointem ekspresyjnym a endpointem o niskiej latencji; to osobne modele, a tag, który zadziała w jednym, może nie zadziałać identycznie w drugim. Po trzecie, wyceń swój rzeczywisty miesięczny wolumen znaków na 0,08 USD, a nie na 0,022 USD, ponieważ to liczba, na której opiera się Twój następny kwartał.

Podany w ogłoszeniu wskaźnik ~75% preferencji w ciemno to pomiar dostawcy i nie zamierzamy przerabiać go na coś innego. Niezależną liczbą w tej premierze jest ta na tablicy wyników: pierwsze miejsce z 1319 Elo przy 1674 wystąpieniach oraz przedział około ±19 punktów wokół niej. To mocny wynik na prawdziwej tablicy wyników. To nie jest specyfikacja i nie powie ci, czy twoja składnia tagów przetrwa przebieg tłumaczenia.