Karta hero porównująca Qwen-Audio-3.1-TTS z ElevenLabs Eleven v3, wymieniająca 16 języków Qwen plus 20 dialektów, 70% obniżkę ceny i brak wyniku areny w porównaniu z 74 językami ElevenLabs, około 100 dolarów za milion znaków i Elo 1168, nad wstęgą z napisem „Ogłoszono na Apsara, 23 września 2026”.
Guides & Insights

Qwen-Audio-3.1 kontra ElevenLabs: obniżka ceny o 70% spotyka dotychczasowego lidera

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dostawca obniżył cenę swojego API Qwen-Audio-3.1-TTS o około 70% 23 września 2026 r., ogłaszając to na scenie podczas konferencji Apsara w Hangzhou wraz z czterema innymi modelami mowy. Ta jedna liczba jest powodem, dla którego warto napisać to porównanie: ElevenLabs Eleven v3 był domyślnym produkcyjnym głosem dla większości zachodnich zespołów przy efektywnej stawce blisko 100 USD za milion znaków, a wiarygodny konkurent właśnie wycenił to samo zadanie na ułamek tej kwoty, jednocześnie poszerzając pokrycie językowe. Oba systemy nie są równoważne — Qwen-Audio-3.1-TTS to API dostępne wyłącznie jako usługa hostowana, oferowane przez należące do dostawcy Tongyi Lab, z mniejszym ekosystemem głosów, podczas gdy ElevenLabs to pełna platforma treści z najgłębszą biblioteką głosów w branży. Ale jeśli o twojej decyzji kiedykolwiek decydował rachunek, arytmetyka zmieniła się w tym tygodniu.

Co faktycznie zostało wydane 23 września?

Qwen-Audio-3.1 to nie jeden model. To odświeżenie całego stosu mowy Alibaby obejmujące pięć modeli, a poziomy mają znaczenie, ponieważ mają różne ceny i różne zadania:

Qwen-Audio-3.1-TTS — bezpośredni następca modelu syntezy, z którego korzysta większość zespołów. Dodaje siedem języków, co daje w sumie 16, zachowuje 20 regionów dialektalnych chińskiego, wprowadza naturalne międzjęzykowe przenoszenie barwy głosu (jeden głos prowadzony przez mandaryński, kantoński, angielski i japoński), sterowanie emocjami, tempem i stylem wypowiedzi za pomocą instrukcji oraz radzi sobie z zaszumionym, z pogłosem lub w inny sposób słabym audio referencyjnym bez osobnego trybu odszumiania.

Qwen-Audio-3.1-TTS-Next — nowy poziom i inny produkt. Alibaba nazywa go modelem „Audiogen": generuje głos, efekty dźwiękowe i tło dźwiękowe w jednym przebiegu na podstawie tekstu, znaczników czasu i dźwięku referencyjnego. Dialog wielu mówców, podcasty, pejzaże dźwiękowe filmowe i telewizyjne, wyjście 48 kHz. Zgodnie z dokumentacją Model Studio Alibaba Cloud przyjmuje do 3000 znaków danych wejściowych, ogranicza generowane audio do 240 sekund w przypadku podcastów i 120 sekund w pozostałych przypadkach, działa z szybkością 3 żądań na sekundę i zwraca WAV, MP3 lub PCM.

Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next i Qwen-Audio-3.1-Realtime — odpowiednio rozpoznawanie mowy, rozumienie dźwięku (emocje, muzyka, dźwięki otoczenia, lokalizacja zdarzeń) oraz konwersacja w trybie pełnego dupleksu. To właśnie Realtime Alibaba wprowadza do sprzętu: Qwen Office, Qoder, QwenNote A2, biurkowy robot QwenNote Eva i okulary Qwen AI.

Obniżki cen objęły całą linię produktów, nie tylko TTS: synteza potaniała o około 70%, czas rzeczywisty o około 85%, a rozpoznawanie nawet o 95%. Alibaba udostępniła także Qwen-Audio-Agent na zasadach open source, framework do budowania agentów głosowych działających w czasie rzeczywistym, i zaprezentowała Qwen3.8-LiveTranslate z opóźnieniem poniżej 2,5 sekundy.

A screenshot of Alibaba Cloud Model Studio's English documentation site showing the reference page for qwen3.8-livetranslate-flash-realtime, a real-time audio and video translation model that accepts audio and images and outputs text and audio across 60 input languages and 29 speech output languages, under an Apsara 2026 Conference banner, with the Speech-to-Speech branch of the navigation listing the qwen-audio-3.0 realtime models.

Tablica wyników

A two-column scoreboard for Qwen-Audio-3.1-TTS and ElevenLabs Eleven v3 across price, languages, weights, voice library, delivery control and arena score, with a footer stating that the Qwen figures are vendor-reported and unscored and the ElevenLabs figures are per Artificial Analysis.

Cena — Qwen-Audio-3.1-TTS: około 70% poniżej poprzedniej generacji Qwen-Audio, w której poziom 3.0 Plus kosztował blisko 27,60 USD za 1 mln znaków, a poziom Flash około 15 USD. ElevenLabs Eleven v3: około 100 USD za 1 mln znaków według danych Artificial Analysis, a Flash około 50 USD.

Języki — Qwen-Audio-3.1-TTS: 16 języków oraz 20 chińskich regionów dialektowych. ElevenLabs Eleven v3: 74 języki.

Wagi — Qwen-Audio-3.1-TTS: zamknięty, hostowany wyłącznie w Alibaba Cloud Model Studio. ElevenLabs Eleven v3: zamknięty, dostępny wyłącznie jako usługa hostowana.

Biblioteka głosów — Qwen-Audio-3.1-TTS: natywne klonowanie oraz transfer barwy głosu między językami; brak porównywalnego publicznego marketplace'u. ElevenLabs: największa współdzielona biblioteka głosów w branży, a także natychmiastowe klonowanie na podstawie około 30 sekund nagrania.

Kontrola sposobu mówienia — Qwen-Audio-3.1-TTS: emocje, tempo i styl sterowane instrukcjami, dziedziczące 86 wbudowanych tagów sposobu mówienia wprowadzonych w wersji 3.0. ElevenLabs Eleven v3: tagi audio oraz otaczająca je platforma (dubbing, agenci, studio).

Niezależny benchmark — Qwen-Audio-3.1-TTS: na razie brak. ElevenLabs Eleven v3: 1168 Elo w rankingu Provider Voice Arena od Artificial Analysis na sierpień 2026 r.

Tam, gdzie pretendent naprawdę wygrywa

Trzy rzeczy, a tylko jedna z nich to cena.

Cena, oczywiście. Obniżka o 70% w stosunku do dominującego na rynku rozwiązania kosztującego 100 dolarów za milion znaków to nie różnica w zaokrągleniu. To różnica między produktem, na którym robisz prototypy, a produktem, który wdrażasz dla każdego użytkownika. Jeśli generujesz narrację na dużą skalę, roczna oszczędność nie jest pozycją w budżecie, o którą musisz walczyć wewnętrznie — ona broni się sama.

Chiński, jednoznacznie. Dwadzieścia chińskich regionów dialektalnych to fosa, do której nic, co oferuje ElevenLabs, się nie zbliża. Jeśli Twój produkt obsługuje użytkowników z Chin kontynentalnych, użytkowników mówiących po kantońsku albo publiczność diaspory, która w połowie zdania przełącza się między językami, porównanie jest rozstrzygnięte, zanim się zacznie.

Międzyjęzykowy transfer barwy głosu. Qwen-Audio-3.1-TTS bierze jeden głos i naturalnie przenosi go przez język mandaryński, kantoński, angielski i japoński. To konkretna możliwość z konkretnym zastosowaniem — jeden głos marki, który przetrwa zmianę języka — i jest to prawdziwy czynnik wyróżniający dla każdego, kto lokalizuje jednego prezentera, zamiast obsadzać nowego na każdym rynku.

Gdzie ElevenLabs wciąż wygrywa, i to nie jest nawet blisko

Zakres językowy to pierwsza rzecz, i to największa. Siedemdziesiąt cztery języki kontra szesnaście to nie luka, którą zamkniesz ogłoszeniem cenowym. Jeśli wydajesz produkt po polsku, turecku, wietnamsku i portugalsku, ElevenLabs obsługuje cię już dziś, a Qwen-Audio-3.1-TTS nie.

Drugi to ekosystem. ElevenLabs nie jest endpointem syntezy; to platforma treści. Wspólna biblioteka głosów, którą można licencjonować zamiast klonować, przepływy pracy dubbingu, infrastruktura agentów, produkt studyjny, udokumentowana powierzchnia API, za którą stoją lata bibliotek klienckich. Migracja z tego to projekt, a nie zmiana konfiguracji, a zespoły, które na tym zbudowały, dokładnie wiedzą, z czego by zrezygnowały.

Trzecia rzecz jest czymś, co trudniej nazwać, a mimo to warto ją nazwać: odczucie naturalności w przypadku pojedynczego angielskiego głosu. Synteza Qwen historycznie była znakomita w przypadku chińskiego, a jedynie bardzo dobra w przypadku angielskiego, i choć wydanie 3.1 twierdzi, że poprawia obsługę wielu języków, nie ma jeszcze niezależnego testu odsłuchowego nowego modelu. Każdy, kto mówi ci, że wie, jak brzmi nowy głos Qwen po angielsku, zgaduje.

Liczba, której nikt nie powinien jeszcze cytować

To jest ta część historii, która zostanie przekręcona w relacjach, więc oto ona wprost. Qwen-Audio-3.1-TTS jest bez niezależnego wyniku benchmarku. Jego poprzednik, Qwen-Audio-3.0-TTS-Plus, miał 1234 Elo na tablicy liderów Provider Voice Arena serwisu Artificial Analysis według stanu na połowę sierpnia 2026 r., plasując się między drugim a piątym miejscem na tej liście. Qwen-Audio-3.1-TTS nie został jeszcze dodany do żadnej areny. Wszystkie twierdzenia o jakości w materiałach premierowych Alibaby pochodzą od dostawcy i nie zostały odtworzone.

To nie czyni tych twierdzeń fałszywymi. Czyni je niezweryfikowanymi i oznacza, że uczciwe ujęcie tego starcia w tej chwili jest takie: jeden model z ceną i bez wyniku, przeciwko jednemu modelowi z wynikiem i znacznie wyższą ceną. Wszystko, co wykracza poza to, to spekulacja przebrana w szaty benchmarku.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in its August 2026 state, ranking text-to-speech models by Elo: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,234 and ElevenLabs Eleven v3 at 1,168.

Ta sama zasada dotyczy opóźnień. Podawana przez Alibabę kluczowa wartość czasu do pierwszego tokena dla części ASR w tej rodzinie — 92 milisekundy — pochodzi z własnego testu wysokiej współbieżności firmy dla specyfikacji 0,6B, a nie z testów zewnętrznych; analizy opublikowane od czasu premiery wskazują, że ASR i TTS to osobne produkty w potoku, a nie jeden model end-to-end, a doniesienia społeczności opisują narastanie opóźnień w długich dialogach w schemacie pseudostrumieniowania. Liczby dotyczące opóźnień podawane przez dostawcę dla całej tej rodziny traktuj jako wartości graniczne, a nie jako zmierzone doświadczenie.

Ile w praktyce warta jest obniżka ceny

Weź realistyczne obciążenie: produkt, który syntezuje 20 milionów znaków narracji miesięcznie w języku angielskim i mandaryńskim. Przy stawce ElevenLabs Eleven v3 wynoszącej około 100 USD za milion znaków daje to około 2000 USD miesięcznie, czyli 24 000 USD rocznie. Przy stawce Qwen-Audio-3.0-TTS-Plus wynoszącej około 27,60 USD za milion ten sam wolumen wynosił już około 552 USD miesięcznie. Zastosuj ~70% obniżkę ogłoszoną przez Alibaba 23 września, a to samo obciążenie spadnie do niskich setek dolarów miesięcznie.

Żadna z tych liczb nie jest ceną katalogową, na podstawie której możesz podpisać umowę — ElevenLabs rozlicza w kredytach w ramach poziomów subskrypcji, a obniżki Alibaby to procentowe redukcje stawek, które różnią się w zależności od regionu i poziomu. Ale kształt tego porównania jest jednoznaczny i to na tym kształcie opierasz budżet.

Jedna uwaga warta podkreślenia dla każdego, kto starannie to modeluje: Alibaba Cloud zmienił sposób rozliczania transkrypcji w czasie rzeczywistym w węźle singapurskim z pomiaru opartego na czasie trwania na pomiar oparty na tokenach, przy stawce 0,93 USD za milion tokenów wejściowych i 0,70 USD za milion tokenów wyjściowych. Rozliczanie tokenowe jest mniej przewidywalne niż rozliczanie czasowe, gdy nie masz kontroli nad tym, ile tokenów powstanie z danego fragmentu audio, a szum, cisza i kontekst wielu tur — wszystko to zawyża zużycie tokenów. Obniżka o 70% ogłoszona w nagłówkach nie przekłada się automatycznie na 70% oszczędności w Twoim konkretnym ruchu.

Jak faktycznie uruchomić przełącznik

Jeśli to oceniasz, warto wiedzieć, ile czasu inżynierskiego kosztuje cię migracja. Oba modele to zamknięte, hostowane API, więc tak czy inaczej integrujesz się z punktem końcowym HTTP, a praca sprowadza się do klienta, polityki ponawiania i zestawu głosów — nie do przeprojektowania architektury.

Tu właśnie pomaga kształt OrcaRouter, ale najpierw jedna szczera uwaga: nie routujemy Qwen-Audio-3.1-TTS ani żadnego modelu Qwen-Audio. Punkty końcowe mowy Alibaby są poza naszym zakresem, podobnie jak ElevenLabs. To, co obejmujemy, to warstwa wnioskowania wokół nich — jeden klucz API dla ponad 200 modeli tekstowych przy 0% marży, czyli cena katalogowa dostawcy przekazywana wprost, więc obniżka ceny u dostawcy obowiązuje u nas tego samego dnia, a nie po cyklu zmiany cennika. Dla zespołów budujących aplikację, która napędza pipeline mowy — streszczacz, generator skryptów, planer treści — oznacza to jedną umowę zamiast kilku, automatyczne przełączanie awaryjne, gdy upstream zawodzi oraz DSL routingu do łączenia modeli w jedno wywołanie. Nie oznacza to jednak, że przez nas wywołujesz głos Qwena. Kto twierdzi inaczej, nie przeczytał katalogu.

Kto powinien się ruszyć, a kto powinien czekać

Przechodź teraz, jeśli w Twoim obciążeniu pracą pierwszeństwo ma język chiński, jeśli obsługa dialektów znajduje się na Twojej liście wymagań, jeśli koszt przy dużym wolumenie jest ograniczeniem, które trzymało Cię przy tańszym, ale gorszym głosie, albo jeśli potrzebujesz jednego głosu marki, który przetrwa zmianę języka. Cennik z 23 września sprawia, że trudno podważyć tę kalkulację, a jakość języka chińskiego była konkurencyjna już wcześniej.

Zaczekaj, jeśli wypuszczasz produkt w więcej niż około szesnastu językach, jeśli Twój produkt opiera się na licencjonowanej bibliotece głosów, a nie na klonowaniu, jeśli mocno angażujesz się w narzędzia platformy do dubbingu lub agentów, albo jeśli Twój proces zakupowy wymaga niezależnej oceny jakości przed zatwierdzeniem. Żadna z tych rzeczy nie jest trwałą blokadą, ale żadnej z nich nie rozwiązała obniżka ceny.

I zwróć uwagę szczególnie na jedno: czy Qwen-Audio-3.1-TTS pojawi się na arenie testów odsłuchowych w ciemno. W momencie, gdy to nastąpi, to porównanie przestaje dotyczyć ceny i liczby języków, a zaczyna dotyczyć tego, czy tańszy głos jest rzeczywiście równie dobry. To jest pytanie, na które premiera nie odpowiedziała.