Karta główna dla „ElevenLabs Eleven v4 vs Cartesia Sonic 3.6” z dwiema kartami wyników: ElevenLabs Eleven v4 z Elo 1319, pozycja 1 i 80,00 USD za 1 mln znaków; Cartesia Sonic 3.6 z Elo 1276, pozycja 2 i 49,00 USD za 1 mln znaków; z podpisem „43 punkty Elo w zestawieniu z o 39% tańszym głosem”. Stopka: „Provider Voice Arena, według Artificial Analysis, wrzesień 2026”. Logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

Eleven v4 vs Cartesia Sonic 3.6: 43-punktowa różnica Elo w starciu z 39% tańszym głosem

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

ElevenLabs Eleven v4 plasuje się 43 punkty Elo powyżej Cartesia Sonic 3.6 w Provider Voice Arena Artificial Analysis — 1 319 do 1 276 — i wygrywa także na tablicy Controlled Voice, zajmując drugie miejsce w porównaniu z czwartym miejscem Sonic 3.6. Przegrywa natomiast pod względem ceny, i to w drugą stronę, z dużą różnicą: 80,00 USD za milion znaków w porównaniu z 49,00 USD, oraz około dziewięciokrotnie wyższa stawka za znak na własnych cennikach dostawców w oknie premiery. To rzadkie starcie, w którym wyniki są jednoznaczne, a decyzja wciąż nie jest, ponieważ oba modele tak naprawdę nie konkurują o to samo zadanie.

A two-column scoreboard for ElevenLabs Eleven v4 and Cartesia Sonic 3.6. Eleven v4: Provider Voice rank 1 Elo 1,319; Controlled Voice rank 2 Elo 1,157; $80.00 per 1M chars; $0.022 per 1K until Oct 12; 90-plus languages; latency not stated for v4. Sonic 3.6: Provider Voice rank 2 Elo 1,276; Controlled Voice rank 4 Elo 1,138; $49.00 per 1M chars; $0.049 per 1K; 44 languages; sub-90 ms. Footer: 'Elo and board prices per Artificial Analysis; rate cards and specs vendor-reported.'

Czym jest każdy model, po jednym akapicie na każdy

ElevenLabs Eleven v4 zadebiutował 28 września jako flagowy model syntezy mowy tej firmy, obok Eleven v4 Turbo. Dokumentacja podaje, że obsługuje ponad 90 języków, limit 10 000 znaków na żądanie, dialog wielu mówców ze stabilną tożsamością mówiącego, ulepszoną obsługę fonemów IPA oraz wbudowane dyrektywy, które pozwalają zapisać sposób wypowiedzi w skrypcie. Klonowanie głosu działa już od dziesięciu sekund nagrania w przypadku natychmiastowych klonów, a powyżej tego dostępny jest poziom profesjonalny.

Cartesia Sonic 3.6 to obecne wydanie linii modeli, którą Cartesia pozycjonuje pod kątem szybkości i naturalności. Jej własna strona produktu nazywa go najszybszym i najbardziej naturalnym modelem zamiany tekstu na mowę, deklaruje opóźnienie poniżej 90 ms, natywną wielojęzyczność w 44 językach, klonowanie głosu z dziesięciu sekund nagrania audio, niestandardowe słowniki wymowy oraz zestaw zgodności obejmujący HIPAA, SOC 2 Type 2, RODO i PCI. Obaj dostawcy publikują dane o opóźnieniach dla własnych modeli; żaden z tych zestawów nie został niezależnie zweryfikowany i nie są one mierzone w ten sam sposób.

Tablica wyników, wymiar po wymiarze

• Ślepa preferencja, własne głosy każdego dostawcy — Eleven v4 pozycja 1, Elo 1319 vs Sonic 3.6 pozycja 2, Elo 1276. Różnica 43 punktów.

• Preferencja w ślepym teście, dopasowane sklonowane głosy — Eleven v4 miejsce 2, Elo 1157 vs Sonic 3.6 miejsce 4, Elo 1138. Różnica 19 punktów, mniejsza niż w pierwszym przypadku.

• Normalizacja ceny Arena, za milion znaków — Eleven v4 $80.00 vs Sonic 3.6 $49.00. Sonic jest o 39% tańszy według wspólnego mianownika tablicy.

• Cennik stawek dostawcy za tysiąc znaków — Eleven v4 $0,022 w promocji, $0,08 po 12 października vs Sonic 3.6 $0,049. Sonic jest o 39% tańszy po zakończeniu promocji.

• Pokrycie językowe, udokumentowane przez dostawcę — Eleven v4 ponad 90 vs Sonic 3.6 44. Mniej więcej dwukrotnie więcej.

• Limit danych wejściowych na żądanie — Eleven v4 10 000 znaków, natomiast Sonic 3.6: nie podano na stronie produktu.

• Opóźnienie, deklarowane przez dostawcę — Eleven v4 Turbo około 150 ms mediany do pierwszego dźwięku vs Sonic 3.6 poniżej 90 ms. Znów inne testy.

• Klonowanie głosu — oba z dziesięciu sekund audio, oba w wyższym planie profesjonalnym.

• Kontrola wyliczania — Eleven v4 dokumentuje wprowadzanie fonemów IPA oraz profesjonalny poziom klonowania; Sonic 3.6 dokumentuje niestandardowe słowniki wymowy.

• Poziom zgodności — Sonic 3.6 podaje HIPAA, SOC 2 Type 2, RODO i PCI. ElevenLabs podaje informacje o swojej zgodności osobno od strony modelu i nie umieszcza pasującej listy obok v4.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, Cartesia Sonic 3.6 second at Elo 1,276 with $49.0, and Google Gemini 3.8 Flash TTS third at Elo 1,267 with $16.5, each with its sample count, confidence interval, arena voice count and release month.

Dwa z tych wierszy to te, które decydują o rzeczywistych projektach. Różnica w Elo wynosi 43 punkty na tablicy głosów dostawcy i 19 na tablicy głosów sklonowanych — wiersz Sonic skraca się o ponad połowę, gdy mówcy pozostają niezmienni. To znak charakterystyczny modelu, którego dostrajanie jest konkurencyjne, a domyślny zestaw głosów już nie, i wskazuje, że problemem Sonic w tym starciu jest prezentacja, a nie jakość syntezy.

Dlaczego różnica cen jest mniejsza, niż się wydaje

Porównanie stawek prezentowanych w nagłówkach wprowadza w błąd w obie strony. Stawka 0,022 USD za tysiąc znaków w Eleven v4 to liczba promocyjna z datą ważności 12 października; liczba, która przetrwa to okno, to 0,08 USD, czyli ponad 60% więcej niż w cenniku Sonic 3.6. Normalizacja areny nie przejmuje się jednak promocją: wycenia modele według ich stawek cennikowych i daje 80,00 USD wobec 49,00 USD, a to porównanie pozostanie prawdziwe jeszcze w listopadzie.

Jest jeszcze druga komplikacja. Cartesia nie publikuje na swojej stronie produktu stawki za znak, więc liczba $0,049 pochodzi z normalizacji areny, a nie od dostawcy, i oba mierniki mogą nie zgadzać się dokładnie — normalizacja przyjmuje założenia co do tego, jak dostawca nalicza opłaty. Kolejność należy traktować jako wiarygodną, a dokładne wartości procentowe jako przybliżone.

Przykładowy miesiąc przy pięciu milionach znaków: Eleven v4 według stawki promocyjnej kosztuje $110, a po 12 października $400. Sonic 3.6 kosztuje $245. Zatem przez najbliższe dwa tygodnie Eleven v4 kosztuje mniej niż połowę kosztu Sonic, a po tym czasie jest o 63% droższy. Każdy, kto dziś pisze porównanie zakupowe i wyśle je w przyszłym miesiącu, wyciągnie odwrotny wniosek, chyba że poda, której stawki użył.

Segment, w którym poprawną odpowiedzią jest Sonic 3.6

Istnieją produkcyjne obciążenia głosowe, w których rankingi arena nie mierzą tego, co naprawdę ma znaczenie, a Sonic 3.6 został stworzony właśnie dla nich.

Agenci konwersacyjni działający w czasie rzeczywistym są najoczywistszym przypadkiem. Opóźnienie poniżej 90 ms w agencie telefonicznym nie jest liczbą marketingową; to różnica między tym, że przerwanie wydaje się obsłużone, a tym, że odczuwa się je jak zerwane połączenie, a ElevenLabs nie publikuje żadnej równoważnej wartości dla samego Eleven v4 — jedynie dla poziomu Turbo, wynoszącej około 150 ms mediany do pierwszego dźwięku mowy. Jeśli budżet gniazd twojego agenta jest napięty, 43 punkty Elo mogą być dla ciebie warte mniej niż milisekundy, a twoje własne testy przerywania rozstrzygną to szybciej niż jakikolwiek ranking.

Regulowane wdrożenie jest drugie. Cartesia podaje na stronie produktu HIPAA, SOC 2 Type 2, GDPR i PCI. Lista zgodności to nie ranking Elo i nie można jej zastąpić rankingiem Elo; jeśli w Twoim procesie wydania uczestniczy recenzent ds. opieki zdrowotnej lub płatności, ten wiersz tablicy wyników przeważa nad pozostałymi dziewięcioma.

A screenshot of Cartesia's Sonic product page, captured in English, headed 'Sonic: The fastest and most natural text to speech model' with the claim 'Ranked #1 for naturalness, sub-90ms latency, and natively multilingual across 44 languages', a 'Try Sonic-3.6' button, an 'American English / Jacqueline' voice picker over a support-call sample, a 'Ranked #1 in Speech Arena leaderboard & Speech to Text leaderboard by Artificial Analysis' panel, and a 'Built for Voice Agents' tab strip spanning Naturalness, Reliability, Speed, Scalability, Multilingual, Consistency and Cost.

Deterministyczna wymowa jest trzecia — i bardziej subtelna. Udokumentowane wprowadzanie fonemów IPA w Eleven v4 to atut, ale niestandardowe słowniki wymowy w Sonic 3.6 to sposób pracy, który zespoły z dużymi słownikami nazw produktów zwykle już mają zbudowany. Przeniesienie słownika to prawdziwa praca; model, który korzysta z artefaktu, który już posiadasz, ma przewagę na starcie.

Gdzie Eleven v4 jest po prostu lepszym modelem

Mimo wszystko rankingi coś mierzą i Eleven v4 zwyciężył w obu. W Provider Voice wyprzedza Sonic 3.6 o 43 punkty, przy 1 674 próbkach stojących za tym szacunkiem, a poprzedni flagowiec — ElevenLabs Eleven v3 z wynikiem 1169 — plasuje się 107 punktów za Sonic 3.6, co oznacza, że ElevenLabs w ciągu jednej generacji nadrobił realną lukę, zamiast bronić prowadzenia.

Liczba języków to drugie jednoznaczne zwycięstwo. Ponad 90 wobec 44 to mniej więcej dwukrotnie więcej, a w przypadku produktu trafiającego poza angielski i garść języków europejskich jest to kwestia pokrycia językowego, a nie jakości — Sonic 3.6 może w ogóle nie mieć głosu dla niektórych z Twoich lokalizacji. A obsługa dialogów z wieloma mówcami oraz wbudowane dyrektywy sposobu wypowiedzi to prawdziwa różnica w możliwościach: wpisanie śmiechu do skryptu to przepływ pracy, którego Sonic 3.6 nie dokumentuje, a odtworzenie tego efektu na modelu, który tego nie potrafi, oznacza postprocessing albo drugie podejście, co kosztuje więcej, niż sugeruje różnica w Elo.

Uruchamianie któregokolwiek z nich i część, z którą nie możemy pomóc

OrcaRouter nie hostuje żadnego z tych modeli. ElevenLabs i Cartesia nie znajdują się w naszym katalogu, więc nic z tego porównania nie może być wywołane przez nas, a uczciwa odpowiedź na pytanie „jak mam to uruchomić na OrcaRouter" brzmi: nie możesz — musisz udać się do dostawcy. Zajmujemy się natomiast przypadkiem, gdy stos mowy obejmuje kilku dostawców zamiast jednego: jeden klucz API dla ponad 200 modeli, z cenami katalogowymi dostawców przekazywanymi przy 0% marży, dzięki czemu zmiana ceny u dostawcy obowiązuje po naszej stronie tego samego dnia, w którym wchodzi w życie. W przypadku decyzji, która zależy od tego, czy płacisz 110 czy 400 dolarów za te same znaki w danym miesiącu, ten czas nie jest drobiazgiem.

Gdy ścieżka głosowa jest widoczna dla klienta i nie może zostać przerwana, automatyczne przełączanie awaryjne przenosi ruch do zdrowego elementu nadrzędnego, gdy jeden z nich ulegnie degradacji. To właśnie ten wzorzec sprawia, że dwutygodniowe okno promocyjne warto wykorzystać: możesz na dwa tygodnie skierować produkcję na tańszy model bez przepisywania integracji, a następnie wrócić, gdy stawka wróci do poprzedniego poziomu.

Kto powinien przejść, a kto powinien poczekać

Przełącz się na Eleven v4, jeśli Twój produkt jest oceniany na podstawie tego, jak brzmi, jeśli dostarczasz go w ponad dwudziestu kilku językach lub jeśli Twoi użytkownicy słyszą ten głos, który wybrał dla nich dostawca — ta ostatnia grupa to dokładnie ci, których reprezentuje tablica Provider Voice, a luka jest tam największa spośród wszystkich wierszy.

Pozostań przy Sonic 3.6, jeśli prowadzisz rozmowy w czasie rzeczywistym w ramach budżetu opóźnień, jeśli recenzent ds. zgodności zatwierdzi Twój stack albo jeśli masz słownik wymowy, którego nie możesz sobie pozwolić odbudować. W tych trzech wierszach Sonic nie pozostaje w tyle; to jedyna opcja z opublikowaną odpowiedzią.

Zaraz, w obu przypadkach, jeśli twoja decyzja zależy od ceny. Za dwa tygodnie cennik Eleven v4 zmieni się niemal czterokrotnie, a cennik Sonic 3.6 nie, a porównanie napisane dziś w połowie października będzie już błędne. Kolejność Elo nadal się utrzyma. Kwoty już nie.