Karta hero dla „Eleven v4 na szczycie Voice Arena”: tabela rankingowa z ElevenLabs Eleven v4 na 1. miejscu i wynikiem Elo 1,319, Cartesia Sonic 3.6 na 2. miejscu i wynikiem Elo 1,276, Google Gemini 3.8 Flash TTS na 3. miejscu i wynikiem Elo 1,267, ElevenLabs Eleven v3 na 18. miejscu i wynikiem Elo 1,169 oraz wstęga z napisem „72% zniżki do 12 października”. Stopka: „Dostawca: Voice Arena, według Artificial Analysis, wrzesień 2026.” Logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

Eleven v4 na szczycie Voice Arena: Co właściwie osiągnął nowy flagowy produkt ElevenLabs

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

ElevenLabs Eleven v4 pojawił się 20 września i od razu trafił na szczyt Voice Arena z wynikiem Elo 1319 — o 29 punktów przed Cartesia Sonic 3.6 i przed Gemini 3.8 Flash. Jest także, przy cenie 80,00 USD rocznie na tej samej arenie, najdroższym modelem w pierwszej dziesiątce. A na tej drugiej arenie — tej zbudowanej z klonowanych głosów, a nie z własnego zestawu głosów każdego dostawcy — nie pojawia się wcale na czele: zadebiutował na drugim miejscu, za modelem, który kosztuje jedną czwartą tego. Obie te rzeczy są prawdą, a część tej premiery polega na ustaleniu, pod którą z nich podlega twój przypadek użycia.

Co faktycznie wysłano 28 września?

ElevenLabs wprowadził do ogólnej dostępności dwa modele, a nie jeden. ElevenLabs Eleven v4 to flagowy model syntezy — firma nazywa go swoim najbardziej emocjonalnym, a jej dokumentacja ustala limit danych wejściowych na 10 000 znaków na żądanie i pokrycie językowe na ponad 90 języków. ElevenLabs Eleven v4 Turbo to bliźniaczy model o niskich opóźnieniach: te same ponad 90 języków, limit 10 000 znaków oraz obsługa wbudowanych znaczników audio, które pozwalają wpisać wskazówkę dotyczącą sposobu wypowiedzi bezpośrednio w skrypt — śmiech, szept, brzęczenie w linii. Oba działają w powierzchniach agentowych, kreatywnych i API firmy od pierwszego dnia, co jest szybszym wdrożeniem niż to, które przypadło w udziale generacji v3.

Strona ogłoszenia to miejsce, w którym znajduje się lista funkcji, a co istotne, nie cennik. ElevenLabs opisuje nową architekturę, lepszą obsługę tonu, tempa i charakteru, bardziej niezawodny dialog wielu mówców ze stabilną tożsamością mówcy, ulepszone wprowadzanie fonemów IPA oraz natychmiastowe klony głosu tworzone z dziesięciu sekund dźwięku obok istniejącego poziomu profesjonalnego klonowania. Jedyną liczbą na niej jest twierdzenie dotyczące słuchaczy: dostawca twierdzi, że w porównaniach w ciemno wersja v4 była preferowana w około trzech czwartych przypadków. To liczba dostawcy, niepowtórzona, którą należy czytać obok poniższych liczb z tablicy, a nie zamiast nich.

Miejsce, w którym faktycznie znajdują się ceny — strona cennika API — to dokument o większym znaczeniu, a omówiono go dalej. W skrócie: ta premiera nie jest podwyżką cen.

Dwie tablice, dwie różne odpowiedzi

Artificial Analysis prowadzi dwie areny mowy i nie są one wariantami jedna drugiej. W Provider Voice słuchacze porównują głosy należące do każdego dostawcy. Controlled Voice klonuje te same osiem głosów — cztery amerykańskie, cztery brytyjskie — dla każdego uczestnika, dzięki czemu mówca pozostaje ten sam, a zmienia się tylko model. Model ze świetną domyślną obsadą głosową może wygrać pierwszą i przegrać drugą. Eleven v4 robi dokładnie to.

• Provider Voice, Eleven v4 — pozycja 1, Elo 1319, 80,00 USD za milion znaków, 1674 próbki, osiem głosów areny, wrzesień 2026

• Głos dostawcy, Cartesia Sonic 3.6 — miejsce 2, Elo 1,276, 49,00 USD

• Provider Voice, Google Gemini 3.8 Flash TTS — 3. miejsce, Elo 1 267, 16,50 $

• Provider Voice, poprzedni flagowy model ElevenLabs Eleven v3 — 18. miejsce, Elo 1169, 100,00 USD

• Kontrolowany głos, Alibaba Qwen-Audio-3.1-TTS-Plus — miejsce 1, Elo 1178

• Kontrolowany Głos, Eleven v4 — miejsce 2, Elo 1 157, 80,00 $

• Controlled Voice, Cartesia Sonic 3.6 — miejsce 4, Elo 1138

• Kontrolowany głos, ElevenLabs Eleven v3 — miejsce 7, Elo 1,073

• Kontrolowany głos, Google Gemini 3.8 Flash TTS — pozycja 13, Elo 1048

• Najlepsza pozycja open-weights w Provider Voice — Breeze TTS 2, Elo 1 206, 34,00 USD

A single-column scoreboard card for ElevenLabs Eleven v4 with six rows: 'Provider Voice rank: 1 (Elo 1,319)', 'Controlled Voice rank: 2 (Elo 1,157)', 'Board price: $80.00 per 1M characters', 'Rate card: $0.022 per 1K characters until Oct 12', 'Languages and cap: 90-plus, 10,000 characters', 'Latency: not stated for v4 itself'. Footer: 'Elo and board prices per Artificial Analysis; rate card and specs vendor-documented.'

Skok w linii rozwojowej to najważniejsza informacja dla każdego, kto już korzysta z ElevenLabs: w porównaniu z własnym poprzednikiem w tym samym rankingu Eleven v4 zyskuje 150 punktów Elo w kategorii Provider Voice i 84 w kategorii Controlled Voice. To przeskok o generację, a nie runda dostrajania, a poprawa jest większa w rankingu, w którym dostawca może wybierać głosy — co jest uczciwym sposobem powiedzenia, że jego nowa domyślna obsada głosów jest realną częścią tego wzrostu.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, 1,674 samples and a -19/19 confidence interval, Cartesia Sonic 3.6 second at Elo 1,276 and $49.0, Google Gemini 3.8 Flash TTS third at Elo 1,267 and $16.5, and ElevenLabs Eleven v3 eighteenth at Elo 1,169 and $100.0, under columns for samples, arena voices, release month and API pricing.

Tablica wymowy, której nie możemy przypisać liczby

Artificial Analysis rzeczywiście prowadzi sekcję Pronunciation Robustness i warto ją rzetelnie opisać, ponieważ krążące podsumowanie rankingu przedstawia Eleven v4 jako zajmujący w niej pierwsze miejsce. Ranking mierzy odsetek wyróżnionych fragmentów, które recenzenci uznali za poprawnie wymówione, przy maksymalnie trzech recenzentach na klip, a prompty są wysyłane dokładnie tak, jak zostały zapisane — bez rozwijania liczb, bez normalizacji tekstu. Jest podzielony na podkategorie, a sedno tego rozwiązania polega na tym, że model, który po cichu przepisuje „Dr.” lub „$4.50” przed wypowiedzeniem, celowo wypada słabo.

To, czego ranking nie publikuje w wersji, którą mogliśmy odczytać, to cytowalny wynik liczbowy dla każdego modelu. Nie ma więc tam liczby, którą można by podać dla Eleven v4, a Elo 1 319 dotyczy preferencji w arenie — tego, jak słuchaczom podobał się głos — a nie dokładności wymowy. Jeśli widzisz te dwie rzeczy zlane w jedną, to właśnie jest to zlanie. Twierdzenie z tej premiery, którego można bronić, to to z liczbami: pierwsze miejsce w Provider Voice z wynikiem 1 319, drugie w Controlled Voice z wynikiem 1 157.

Rabat na start to prawdziwa wiadomość dla Twojego rachunku

ElevenLabs zmienił ceny nowych modeli w tym samym momencie, w którym je udostępnił, a zniżka jest wystarczająco duża, by sama w sobie zmienić decyzję zakupową. Na stronie cennika API Eleven v4 widnieje w cenie 0,022 USD za tysiąc znaków wobec podanej ceny katalogowej 0,08 USD — obniżka o 72% — a Eleven v4 Turbo widnieje w cenie 0,011 USD wobec 0,04 USD. Oba obowiązują w tym samym oknie: promocja trwa do 12 października. Potem liczby wracają do poprzednich wartości, a przywrócona cena v4 jest dwukrotnie wyższa niż koszt własnego v3 ElevenLabs, który dziś wynosi 0,08 USD. Planuj na podstawie stawki po promocji, a nie tej promocyjnej.

Zmiana cen przesuwa także pozycję v4 względem konkurencji w przeliczeniu na znak, co normalizacja areny już pokazuje na poziomie 80,00 USD za milion. Sonic 3.6 kosztuje tam 49,00 USD, Breeze TTS 2 — 34,00 USD, Qwen-Audio-3.0-TTS-Plus — 19,30 USD, a Gemini 3.8 Flash TTS — 16,50 USD. W cenie promocyjnej Eleven v4 po 22 USD za milion jest zdecydowanie tańszy od Sonic 3.6. W cenie katalogowej jest najdroższym głosem w zestawieniu, i to o dużą różnicę. Każdy, kto planuje budżet na I kwartał, powinien brać pod uwagę drugą liczbę.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v4 row at $0.022 per 1K characters with a struck-through $0.08 and a '72% off until Oct 12' badge, and the Eleven v4 Turbo row at $0.011 with a struck-through $0.04, alongside the v3 row at $0.08 and the Eleven v3 Conversational row at $0.04.

Przeliczony miesiąc pokazuje różnicę w konkretnych liczbach. Przy pięciu milionach znaków — średniej wielkości produkt czytający około stu godzin mowy — Eleven v4 w okresie promocyjnym kosztuje $110. Przy przywróconej stawce $0.08 kosztuje $400. Sonic 3.6 kosztuje $245. Gemini 3.8 Flash TTS kosztuje $82.50. Ten sam miesiąc na własnym v3 ElevenLabs kosztuje również $400, co jest osobliwym faktem leżącym u podstaw tej premiery: przez najbliższe dwa tygodnie nowy flagowiec jest tańszy niż model, który zastępuje, a w dniu zamknięcia okna przestaje być tańszy i staje się po prostu lepszy.

Deklaracja dotycząca opóźnienia pochodzi od dostawcy i zależy od poziomu.

ElevenLabs publikuje dane dotyczące opóźnień dla poszczególnych poziomów, a nie dla poszczególnych rodzin modeli, i są to pomiary wykonane przez firmę, a nie niezależne. Dla Eleven v4 Turbo podaje się około 100 ms mediany wnioskowania i około 150 ms mediany czasu do pierwszego dźwięku mowy, zmierzonych we wrześniu 2026 r. Dla Eleven v3 Conversational podaje się około 280 ms, a dla starszych poziomów Flash i Turbo około 75 ms. Dokumentacja nie podaje równoważnej wartości dla samego Eleven v4, czyli poziomu, którego chciałbyś użyć, jeśli budujesz agenta czasu rzeczywistego i czytasz specyfikację, a nie testujesz.

Cartesia twierdzi, że Sonic ma opóźnienie poniżej 90 ms, i opisuje go jako sklasyfikowanego na pierwszym miejscu pod względem naturalności, z klonowaniem głosu na podstawie dziesięciu sekund nagrania, niestandardowymi słownikami wymowy oraz zestawem zgodności obejmującym HIPAA, SOC 2 Type 2, GDPR i PCI. To są własne twierdzenia dostawcy na jego własnej stronie produktu — ta sama kategoria dowodów co liczby dotyczące poziomów opóźnienia ElevenLabs i nie można ich utożsamiać z rankingiem Elo areny. Bezpośrednie porównanie tych dwóch dostawców jest możliwe tylko na listach rankingowych.

Co to dla ciebie oznacza i jak tego spróbować

Jeśli wybierasz głos do produktu, w którym domyślna obsada to to, co słyszą Twoi użytkownicy, to wynik Provider Voice jest tym, który ma znaczenie, a Eleven v4 właśnie go zdobył — z rabatem na dwa tygodnie. Jeśli klonujesz głos konkretnej osoby i każdy model kandydujący ma za zadanie odtworzyć tych samych ośmiu mówców, to tablica Controlled Voice jest tą, która ma znaczenie, a Eleven v4 jest drugi — 21 punktów Elo za liderem i, w cenie katalogowej, ponad czterokrotnie wyższy koszt na znak. Żaden wynik nie jest błędny; to odpowiedzi na różne pytania, a to drugie jest pytaniem, które w rzeczywistości zadaje większość produkcyjnych prac nad klonowaniem głosu.

OrcaRouter nie hostuje ElevenLabs, Cartesia ani żadnego z pozostałych dostawców obecnych na tych rankingach, więc nie ma tu niczego, co można by wywoływać przez nas, i nie będziemy sugerować, że jest inaczej. Oferujemy natomiast otaczającą infrastrukturę, jeśli Twój stack głosowy ostatecznie obejmuje wielu dostawców: jeden klucz API dla ponad 200 modeli, z cenami katalogowymi dostawców przekazywanymi przy 0% marży, więc obniżka ceny dostawcy — w tym okno promocyjne takie jak to — obowiązuje u nas tego samego dnia, a nie dopiero w kolejnym cyklu rozliczeniowym. Tam, gdzie ścieżka głosowa ma kluczowe znaczenie dla produkcji, automatyczne przełączanie awaryjne przenosi ruch do zdrowego dostawcy nadrzędnego, gdy jeden ulegnie degradacji, co jest praktycznym sposobem na przetestowanie zupełnie nowego punktu końcowego bez ryzykowania na nim wydania.

Data do zanotowania w kalendarzu to 12 października. To wtedy Eleven v4 przestaje być najtańszym dobrym głosem na rynku i staje się tym najdroższym, a każde porównanie napisane w tym tygodniu, które podaje 22 dolary za milion, nie wspominając o tym, jest porównaniem, które powinieneś powtórzyć za trzy tygodnie.