
HeyGen Voice vs Qwen-Audio-3.0-TTS: Za co płacisz w Elo i który tier Qwen faktycznie zbenchmarkowałeś
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Najpierw wykonaj obliczenia, bo są mniej jednostronne, niż sugeruje tablica wyników. Qwen-Audio-3.0-TTS-Plus kosztuje 19,30 USD za milion znaków na platformie Model Studio — stawka publikowana przez dostawcę. HeyGen Voice wynosi 30,00 USD za milion znaków na własnym wykresie cenowym Artificial Analysis, liczba, którą serwis wylicza na podstawie cennika kredytów HeyGen, ponieważ publiczna strona z cennikiem HeyGen sprzedaje kredyty, nie podając, ile zużywa jedna generacja głosu. Tymczasem różnica w kontrolowanym głosie między nimi wynosi 79 Elo: HeyGen Voice zdobył 1,202 w arenie, która utrzymuje wszystkie osiem głosów referencyjnych na stałym poziomie, a Qwen-Audio-3.0-TTS-Plus 1,123. Tańszy model plasuje się więc znacznie za lepszym, stosunek między nimi wynosi około 1,55×, a tylko jedna z tych dwóch cen jest liczbą firmowaną przez dostawcę, który ją sprzedaje.
Pułapka w nazwie
Zanim jednak przejdziesz do czegokolwiek z tego, ustal właściwy tier, bo to rodzina, która chętnie pozwoli ci benchmarkować niewłaściwy model. Znaczenie mają tu dwa wpisy Alibaba i nie można ich używać zamiennie.
Qwen-Audio-3.0-TTS-Plus to model, z którym porównuje się ten artykuł. Uzyskuje wynik 1 123 na tablicy kontrolnej — siódmy z czterdziestu dwóch — oraz 1 264 na tablicy Provider Voices, gdzie zajmuje szóste miejsce na dziewięćdziesiąt sześć. To prawdziwy, aktualny, strumieniowy produkt TTS z publikowaną stawką 19,30 USD za milion znaków.
Qwen-Audio-3.1-TTS-Plus to jego następny poziom i to on zajmuje drugie miejsce na kontrolowanej tablicy z wynikiem 1,186 — model, który przy debiucie był najbliżej pokonania HeyGen Voice. Jego stawka jest podana na tym samym poziomie $19.30, choć dokumentacja Alibaba ostrzega, że różne wersje modeli wymagają dopasowanych głosów, więc „ta sama cena, nowszy poziom” nie oznacza „gotowej podmiany”.
Każdy, kto przeczyta „#1 przed Qwen”, a następnie przetestuje Qwen-Audio-3.0-TTS, będzie testować model słabszy o 63 punkty Elo od tego, którego dotyczył nagłówek. Spór o tier jest wart 63 punkty, co jest większe niż różnica między HeyGen Voice a trzecim miejscem.
Tablica wyników

• Elo kontrolowanego głosu (te same 8 sklonowanych głosów) — HeyGen Voice: 1 202, #1 z 42. Qwen-Audio-3.0-TTS-Plus: 1 123, #7.
Elo głosów dostawców (natywne) — Qwen-3.0-TTS-1,264, # z 96. HeyGen: niesklasyfikowany.
• Cena za 1 mln znaków — Qwen-Audio-3.0-TTS-Plus: 19,30 USD, opublikowana przez dostawcę w Alibaba Cloud. HeyGen Voice: 30,00 USD według własnego przeliczenia cen kredytów przez arenę; HeyGen nie publikuje stawki za głos.
• Koszt 100 godzin narracji — Qwen-Audio-3.0-TTS-Plus: około 926 USD przy ~480 000 znaków na godzinę mowy. HeyGen Voice: około 1440 USD według przelicznika areny wynoszącego 30,00 USD — wartość wyliczona, a nie zacytowana.
• Sterowanie głosem — Qwen-Audio-3.0-TTS-Plus: instrukcji parametr, tagi emocji i języka, klonowanie głosu i projektowanie głosu. HeyGen Voice: projektowanie głosu z tekstu na podstawie opisu o długości do 1000 znaków, natychmiastowy klon, profesjonalny klon trenowany na ponad 20 minutach nagrań.
• Wyjście — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 i Opus do 48 kHz, z możliwością regulacji szybkości, wysokości tonu, głośności i przepływności. HeyGen Voice: prędkość 0,5–1,5 i wysokość tonu ±50 półtonów na żądanie.

Co faktycznie daje ci inżynieria Alibaba
Rodzina Qwen-Audio-3.0-TTS to produkt strumieniowy i dokumentacja jest napisana w tym duchu. Żądania są przesyłane przez protokół WebSocket współdzielony z CosyVoice, z run-task, continue-task i finish-task oraz towarzyszącym im przepływem zdarzeń task-started, result-generated, task-finished i task-failed. Anulowanie jest obsługiwane w każdym modelu Qwen-Audio-TTS, zarówno w regionie Pekin, jak i Singapur, za pomocą streaming_cancel(). Wyjście osiąga 48 kHz, a formaty obejmują Opus, co ma znaczenie, jeśli dźwięk trafia do przeglądarki lub rozmowy telefonicznej, a nie do pliku WAV.
Dwa szczegóły w tej dokumentacji łatwo przeoczyć, a ich późne odkrycie jest kosztowne. Tagi Emotion i rich language dotyczą tylko warstw Plus i Flash — nie całej rodziny — i działają wyłącznie w trybie strumieniowania jednokierunkowego. A klucze API różnią się między regionami Singapur i Pekin, a przestrzenie robocze są adresowane pod adresami URL w formie wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Klucze regionalne to szczegół konfiguracji, dopóki pewnego dnia nie staną się awarią.
HeyGen to inny kształt produktu: API v3 w stylu REST, w którym POST /v3/voices/speech renderuje mowę, GET /v3/voices wyświetla katalog za filtrem engine, a projektowanie głosu zwraca do trzech uszeregowanych propozycji na podstawie promptu tekstowego z ziarnem zapewniającym powtarzalność. Dokumentacja ujawnia też, że filtr engine przyjmuje wartości spoza własnych HeyGen — więc HeyGen chętnie skieruje cię przez swoje API do zewnętrznego silnika głosu. Dostawca, który udostępnia model konkurenta jako opcję do wyboru, mówi coś o tym, gdzie upatruje własnej siły.

Dokąd trafia 79 Elo
79-punktowa różnica na kontrolowanej tablicy jest znacząca — większa niż 16-punktowa przewaga dzieląca HeyGen Voice od drugiego miejsca i mniej więcej równa odległości między trzecim a ósmym miejscem w tej stawce. Jest też mierzona na jednej osi.
Kontrolowana arena klonuje osiem głosów i utrzymuje je w niezmiennej formie. Nie mówi nic o opartej na instrukcjach powierzchni sterowania, którą udostępnia Qwen, nic o wyjściu Opus 48 kHz przez anulowalny WebSocket i nic o wdrożeniu regionalnym. To są właściwości inżynieryjne i właśnie dlatego zespół budujący centrum kontaktowe w języku mandaryńskim nie przeszedłby na model, który uzyskuje o 79 punktów wyższy wynik na ośmiu angielskojęzycznych głosach referencyjnych.
To, co ten kontrolowany wynik faktycznie mówi, jest węższe, ale wciąż użyteczne: gdy oba silniki otrzymają ten sam sklonowany głos, słuchacze woleli renderowanie HeyGen Voice. Jeśli Twój produkt klonuje głosy, to jest Twoja oś. Jeśli Twój produkt wybiera głos z katalogu i strumieniuje go do rozmowy, ranking dostawców jest bliższy Twojej rzeczywistości — a tam HeyGen Voice nie ma żadnej pozycji, podczas gdy Qwen-Audio-3.0-TTS-Plus zajmuje szóste miejsce na dziewięćdziesiąt sześć.
Argument cenowy, potraktowany poważnie
Przy 19,30 USD za milion znaków Qwen-Audio-3.0-TTS-Plus kosztuje mniej więcej połowę ceny planu ElevenLabs za 40 USD i około 40% ceny Cartesia Sonic 3.6 wynoszącej 49 USD. W przypadku 100 godzin narracji — około 48 milionów znaków przy typowym tempie mówienia — daje to kwotę rzędu 926 USD. Ten sam wolumen w Eleven v4 Turbo kosztowałby około 1920 USD, a w Sonic 3.6 około 2352 USD. HeyGen Voice przy stawce 30,00 USD w Arena plasuje się blisko 1440 USD: między najtańszą półką a dwoma dotychczasowymi graczami, bliżej środka niż góry.
Ta arytmetyka niesie ze sobą zastrzeżenie, którego pozostałe nie potrzebują. 19,30 USD to własna opublikowana stawka Alibaby. 30,00 USD to przeliczenie przez Artificial Analysis systemu kredytowego, którego HeyGen nigdy nie przełożył na znaki, więc jest to szacunek w dobrej wierze, a nie wycena. Jeśli rzeczywisty stosunek znaków przypadających na kredyt jest gorszy niż zakłada wykres, przewaga 79 punktów Elo kosztuje więcej niż sugerowane 1,55×; jeśli jest lepszy — mniej. Model, którego cenę trzeba wywnioskować, to model, na którym prowadzisz pilotaż na zmierzonym wycinku ruchu, a nie taki, który przyjmujesz jako standard. To nie jest krytyka silnika — to opis informacji dostępnych 10 października 2026 r.
Decydowanie
Wybierz Qwen-Audio-3.0-TTS-Plus, gdy o decyzji decydują koszty i infrastruktura strumieniowania. Poniżej 20 USD za milion znaków, anulowalny WebSocket z wyjściem Opus 48 kHz, parametr instrukcji i tagi emocji oraz szóste miejsce w rankingu dostawców czynią go najbardziej ekonomicznym dobrze ocenianym głosem w tym porównaniu. Wybierz jednak poziom 3.1, jeśli chcesz model, który faktycznie zajął drugie miejsce w kontrolowanym rankingu, i zweryfikuj listę głosów, zanim założysz, że zamiana jest bezpłatna.
Przetestuj HeyGen Voice, gdy wierność klonowania jest produktem. Jeden mówca, wiele kwestii, głos, który za każdym razem musi być *tym* głosem — to oś, którą mierzy kontrolowana tablica wyników, i oś, na której wiedzie prym w całej dziedzinie. Zaplanuj okres pomiarowy w budżecie, ponieważ model kredytowy oznacza, że prawdziwy koszt poznasz, przetwarzając własny tekst, a nie czytając kartę stawek.
I całkowicie zignoruj to porównanie, jeśli obciążenie jest chińskojęzyczne i w czasie rzeczywistym. Żadna z liczb Elo nie została zmierzona na Twoich głosach, w Twoim języku, przy Twoim budżecie opóźnień.
Utrzymywanie obu dostępnych
To jedno z takich zestawień, w których warstwa routingu zasługuje na swoje miejsce, a nie jest tylko dokładką. Jeden klucz API obejmujący oba podmioty — cena katalogowa dostawcy przekazywana bez marży, więc opublikowane 19,30 USD Alibaby to kwota, którą płacisz, a zmiana ceny Qwen obowiązuje tego samego dnia — usuwa potrzebę wybierania zwycięzcy, zanim masz dowody. Automatyczne przełączanie awaryjne obejmuje oczywiste ryzyko w potoku głosowym, w którym zatrzymany strumień jest słyszalny dla słuchacza, a DSL routingu pozwala kierować narrację masową do taniego silnika, a linie krytyczne dla klonowania do tego, który ma o 79 punktów lepszy wynik, bez dwóch bibliotek klienckich i dwóch relacji rozliczeniowych. Wartość OrcaRoutera nie polega tutaj na tym, że hostuje model głosowy; polega na tym, że sprawia, iż koszt ustalenia, którego z nich chcesz, jest praktycznie zerowy.
Otwarte pytania
Trzy rzeczy rozstrzygnęłyby tę kwestię. Stawka za głos na własnej stronie z cennikiem HeyGen zamieniłaby 30,00 USD, które wylicza arena, w liczbę, którą można zweryfikować. Wpis HeyGen na tablicy Provider Voices powiedziałby nam, czy przewaga głosów klonowanych utrzyma się wśród głosów natywnych — test, który Qwen-Audio-3.0-TTS-Plus przechodzi na szóstym miejscu spośród dziewięćdziesięciu sześciu. A wynik w kategorii kontrolowanego głosu dla Qwen-Audio-3.1-TTS-Plus przeciwko HeyGen Voice po większej liczbie głosów powiedziałby nam, czy 16 Elo to stabilne uszeregowanie. Do tego czasu: Qwen jest wycenioną, strumieniowalną, dobrze plasującą się opcją; HeyGen Voice jest opcją z wyższym wynikiem, której nie da się wycenić; a poziom, który poddajesz benchmarkowi, ma większe znaczenie niż nagłówek, który czytasz.
