
Eleven v4 vs Qwen Audio 3.1: Najtańszy głos na planszy wygrał
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 982 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 197 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Na tablicy, na której każdy uczestnik otrzymuje te same osiem sklonowanych głosów, Alibaba Qwen-Audio-3.1-TTS-Pluszajął pierwsze miejsce z wynikiem Elo 1178, a ElevenLabs Eleven v4zajął drugie miejsce z wynikiem 1157. Model, który wygrał, kosztuje 19,30 USD za milion znaków na tej tablicy. Model, który zajął drugie miejsce, kosztuje 80,00 USD. To 21-punktowa różnica w jakości i czterokrotna różnica w cenie, wskazujące w przeciwnych kierunkach, i to najciekawszy wynik całego tygodnia premiery — ciekawszy niż pierwsze miejsce, które ElevenLabs zajął na drugiej arenie, bo tam kolejność jest konwencjonalna, a zwycięzca to najdroższy głos w pierwszej dziesiątce.
Dwa rankingi nie są wymienne, a powód, dla którego to starcie wygląda tak, jak wygląda, tkwi wyłącznie w tym, na który z nich spojrzysz. W Provider Voice słuchacze oceniają własne głosy każdego dostawcy. Controlled Voice klonuje te same osiem głosów — cztery z USA, cztery z Wielkiej Brytanii — dla każdego modelu, więc nikt nie wygrywa dzięki swojej domyślnej obsadzie głosowej. ElevenLabs wygrywa pierwszy o 61 punktów. Alibaba wygrywa drugi o 21 punktów. Żaden z tych rankingów nie jest błędny, a to ten drugi przewiduje produkt, który trafi na rynek ze sklonowanym głosem marki.

Tablica wyników sterowana głosem, w całości
• Preferencja w testach ślepych, dopasowane klony — Qwen-Audio-3.1-TTS-Plus miejsce 1, Elo 1,178, 19,30 USD za milion znaków vs Eleven v4 miejsce 2, Elo 1,157, 80,00 USD.
• Preferencja w testach w ciemno, własne głosy każdego dostawcy — Eleven v4 miejsce 1, Elo 1319 vs Qwen-Audio-3.0-TTS-Plus miejsce 4, Elo 1258. 61-punktowa różnica w drugą stronę.
• Cena, normalizacja areny — Qwen 19,30 USD vs Eleven v4 80,00 USD. Qwen jest o 76% tańszy.
• Cena, cennik dostawcy — Eleven v4: 0,022 USD za tysiąc znaków w promocji, a po 12 października 0,08 USD. Własnego cennika Qwen Audio 3.1 nie mogliśmy odczytać, więc normalizacja areny to jedyna cena, według której możemy porównywać.
• Wersja na każdej płytce — 3.1 na Controlled Voice, 3.0 na Provider Voice. To są różne modele, a płytki nie są zamienne.
• Pozycja 3.0 w Controlled Voice — miejsce 5, Elo 1124, ta sama cena 19,30 USD. Wydanie 3.1 jest warte o 54 Elo więcej niż jego poprzednik przy identycznej cenie.
• Wcześniejsze generacje Qwena w Provider Voice — Qwen3 TTS Flash miejsce 79, Elo 944; Qwen3 TTS miejsce 82, Elo 930.
• Poprzedni flagowy model ElevenLabs w Controlled Voice — Eleven v3 miejsce 7, Elo 1 073.
• Kontrola poprawności wykresu słupkowego grupowanego — ośmiokierunkowy rozrzut od miejsca 1 do miejsca 10 w Controlled Voice wynosi 121 Elo. 21-punktowa przewaga Qwen nad Eleven v4 to mniej niż jedna piąta zakresu całej stawki, co jest właściwą skalą, w jakiej należy ją utrzymywać.

Tam dwa wiersze wykonują większość pracy. Pierwszy to porównanie wersji 3.0 i 3.1: Alibaba przesunęła się o 54 punkty Elo w ramach jednego podbicia wersji, nie zmieniając przy tym w ogóle ceny. To szybsze tempo niż 84-punktowe przejście ElevenLabs z v3 do v4, a to oznacza, że konkretna kolejność w rankingu w tym artykule to migawka, którą obaj dostawcy aktywnie przetasowują.
Drugi to całkowity rozrzut 121 punktów. 21-punktowa luka w rankingu, którego użyteczny zakres wynosi około 120 punktów, to realna, ale skromna różnica — mniej więcej tej samej wielkości co różnica między własnym 3.1 Qwena a jego 3.0. Jeśli Twój przypadek użycia dotyczy języka, dla którego nie dostrajano żadnego z tych modeli, ten margines spokojnie mieści się w zakresie, który kilka trudnych skryptów testowych może odwrócić.
Problem z wersją, którego nikt nie zgłasza
Krążący wynik, że „Eleven v4 jest drugi w Controlled Voice”, jest trafny i niepełny, a to pominięcie ma znaczenie dla każdego, kto planuje na jego podstawie. Model znajdujący się nad Eleven v4 na tej tablicy to wydanie 3.1 firmy Alibaba. Pozycja Qwen na tablicy Provider Voice to z kolei wydanie 3.0 — model 3.1 nie pojawia się w górnych wierszach tej tablicy według naszego odczytu. Zatem dwa nagłówki — „Eleven v4 jest numerem jeden” i „Eleven v4 jest numerem dwa” — to stwierdzenia o dwóch różnych modelach Qwen w dwóch różnych zadaniach, a wersja Qwen, która pokonała go na jednej tablicy, nie jest tą wersją Qwen, którą pokonał na drugiej.
To nie jest żadna zagrywka wymierzona w któregokolwiek z dostawców; to powód, by nie ufać żadnemu jednozdaniowemu podsumowaniu tygodnia takiego jak ten. Jeśli wybierasz między tymi dwoma systemami, porównaniem, którego potrzebujesz, jest 3.1 kontra v4 na własnym sklonowanym głosie, we własnym języku — a żaden z dostawców tego nie opublikował.
Co możemy, a czego nie możemy powiedzieć o Qwen Audio 3.1
Uczciwość wobec dowodów jest tu warta więcej niż pełna tabela specyfikacji, więc oto granica tego, na czym opiera się ten artykuł. Z tablic aren mamy dla Qwen-Audio-3.1-TTS-Plus: Elo kontrolowanego głosu na poziomie 1178, normalizację ceny na poziomie 19,30 USD za milion znaków oraz fakt, że jest to bieżące wydanie w linii, której poprzednia wersja uzyskała wynik o 54 punkty niższy przy tej samej cenie.
Nie mamy i nie będziemy zgadywać: jego pokrycia językowego, jego opóźnienia, jego limitu danych wejściowych na żądanie, tego, czy obsługuje wbudowane dyrektywy sposobu wypowiedzi, czy oferuje klonowanie głosu poza ośmioma głosami areny, ani tego, co nalicza według własnego cennika. To wszystko jest udokumentowane dla Eleven v4 — ponad 90 języków, limit 10 000 znaków, tagi audio, dziesięciosekundowe natychmiastowe klony, obsługa fonemów IPA — a ich brak po stronie Qwen to luka w tym, co jest publicznie czytelne, a nie zarzut wobec modelu. Decyzja zakupowa podjęta wyłącznie na podstawie tego artykułu byłaby decyzją podjętą na podstawie dwóch liczb.

Jeden kontrast jednak przetrwa to ograniczenie, ponieważ obie strony są podane przez dostawcę albo obie przez ranking. W przypadku ceny normalizacja rankingu jest wspólnym mianownikiem i faworyzuje Qwen o 76%. W przypadku jakości przy dopasowanych mówcach ten sam ranking faworyzuje Qwen o 21 Elo. Te dwa wiersze są porównywalne. Wszystko inne tutaj nie jest, a artykuł nie będzie udawał, że jest inaczej.
Dlaczego kontrolowana rada powinna mieć większe znaczenie niż zwykle
Większość porównań głosów domyślnie opiera się na tym, jaki ranking stawia na szczycie model, który już lubisz. W tym starciu istnieje uzasadniony powód, by preferować Controlled Voice, i jest on konkretny, a nie ogólny.
Alibaba i ElevenLabs konkurują ze sobą diametralnie różnymi atutami. Przewagą ElevenLabs jest biblioteka głosów zbudowana przez lata starannie dobieranej obsady; przewagą Alibaby jest organizacja badawcza, która w szybkim tempie udostępnia kolejne wersje modeli. Ranking, który pozwala każdemu uczestnikowi wystawić własne głosy, mierzy bibliotekę w takim samym stopniu jak syntezator, a na tym rankingu ElevenLabs wygrywa o 61 punktów. Usuń biblioteki z równania — te same osiem sklonowanych głosów dla wszystkich — a przewaga przechodzi w inne ręce. Jeśli głos, który słyszą Twoi użytkownicy, jest klonem konkretnej osoby, nie kupujesz biblioteki ElevenLabs, więc to ranking o kontrolowanych warunkach opisuje Twój zakup. Jeśli wybierasz z menu gotowych głosów, jest odwrotnie, a 61-punktowa przewaga Eleven v4 jest liczbą, która się liczy.
Istnieje drugi, mniej wygodny powód, by przywiązywać wagę do kontrolowanego wyniku. Ranking głosów dostawców premiuje wyrazistą domyślną obsadę, a wyrazista obsada może polaryzować w sposób, który przeciętne Elo ukrywa — to, co dla jednego słuchacza jest pełne charakteru, dla innego jest afektowane. Ranking klonowanych głosów z dopasowanymi mówcami całkowicie usuwa tę zmienną, co czyni go bardziej powtarzalnym pomiarem z tych dwóch.
Uruchamianie któregokolwiek z nich i to, co faktycznie kierujemy
OrcaRouter nie hostuje ani modeli mowy ElevenLabs, ani modeli Alibaba. Żaden z tych dostawców nie znajduje się w naszym katalogu, więc nie ma możliwości wywołania któregokolwiek z nich za naszym pośrednictwem, a ten artykuł nie będzie sugerował inaczej — w przypadku obu udajesz się do własnego API dostawcy i kilku platform zewnętrznych.
To, co faktycznie obejmujemy, to warstwa powyżej. Jeśli Twój stos mowy to jeden węzeł w większym potoku, udostępniamy ponad 200 modeli za jednym kluczem API, z cenami cennikowymi dostawców przekazywanymi bez marży (0%), więc zmiana ceny u któregokolwiek dostawcy — w tym okno promocyjne ElevenLabs i znacznie wyższa cena cennikowa, która po nim następuje 12 października — jest odzwierciedlana po naszej stronie w dniu, w którym następuje, a nie w kolejnym cyklu rozliczeniowym. W przypadku decyzji, która opiera się na stosunku cen 4:1, ten moment przesądza o tym, czy porównanie dobrze się zestarzeje, czy w ciągu trzech tygodni będzie wyglądać na błędne.
A tam, gdzie ścieżka głosowa nie może zawieść, automatyczne przełączanie awaryjne przenosi ruch do zdrowego upstreamu zamiast powodować błąd żądania. W starciu tak wyrównanym pod względem jakości i tak nierównym pod względem ceny, rozsądną architekturą jest umieszczenie obu modeli za jednym punktem końcowym, a routing decyduje o podziale — a nie stały wybór dokonany na podstawie migawki tabeli liderów, którą obaj dostawcy unieważnią w ciągu kwartału.
Werdykt i jego data ważności
Wybierz Qwen-Audio-3.1-TTS-Plus, jeśli klonujesz głos i pilnujesz kosztów. Jest pierwszy w rankingu, w którym mówcy pozostają ci sami, kosztuje około jednej czwartej ceny, a jego linia przesuwa się szybciej — 54 Elo w jednym kroku wersji przy niezmienionej stawce sugeruje, że następna wersja jest lepszym zakładem niż obecna na papierze.
Wybierz Eleven v4, jeśli Twoi użytkownicy słyszą standardowe głosy, jeśli potrzebujesz pokrycia w językach, które możesz zweryfikować przed wydaniem, lub jeśli udokumentowany zestaw funkcji — znaczniki audio, kontrola fonemów, żądania o długości 10 000 znaków, dziesięciosekundowe klony — wykonuje w Twoim produkcie pracę, której nie mierzą rankingi arena. Jego 61-punktowa przewaga w rankingu głosów dostawców nie jest bez znaczenia, a dwie funkcje, które możesz wpisać do skryptu, to możliwości, a nie wyniki.
Wyznacz datę przeglądu. Alibaba przesunęła się o 54 punkty Elo w ramach aktualizacji wersji w tym cyklu, a ElevenLabs przesunął się o 84 punkty Elo w całej generacji, a promocyjna stawka Eleven v4 wygasa 12 października. Cokolwiek to porównanie mówi dziś, dwa fakty, które najprawdopodobniej je odwrócą — wydanie 3.2 i cofnięta cena — oba nastąpią przed końcem kwartału.
