
HeyGen Voice debiutuje na 1. miejscu w Controlled Voice TTS Arena — pokonując Qwen i ElevenLabs w zakresie klonowanych głosów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
9 października 2026 r. Artificial Analysis dodał HeyGen Voice do swojej areny Controlled Voice i model od razu trafił na jej szczyt. HeyGen Voice — pierwszy model zamiany tekstu na mowę od HeyGen oceniany na tej tablicy — uzyskał wynik 1 202 Elo, wyprzedzając Qwen-Audio-3.1-TTS-Plus z wynikiem 1 186 i Eleven v4 Turbo od ElevenLabs z 1 167. Cartesia Sonic 3.6, który prowadzi w otwartej tablicy Provider Voices tej witryny, zajmuje tutaj piąte miejsce z wynikiem 1 143. To autentyczny wynik na tablicy rankingowej stworzonej po to, by wyeliminować największy pojedynczy czynnik zakłócający w ocenie głosu, a jednocześnie wynik o bardzo konkretnym znaczeniu, które łatwo nadinterpretować: HeyGen Voice to najlepszy głos w tej arenie na ośmiu sklonowanych głosach referencyjnych, ale jeszcze nie zmierzony zwycięzca tablicy obejmującej dziewięćdziesiąt sześć modeli.
Co mierzy Controlled Voice board i dlaczego to ma znaczenie
Artificial Analysis prowadzi dwa rankingi mowy i odpowiadają one na różne pytania. Arena Provider Voices pozwala każdemu dostawcy udostępnić własne natywne głosy — dopracowane głosy demonstracyjne, które firma wybiera, aby ją reprezentowały — i klasyfikuje modele pod względem tego, jak dobrze brzmią. Jej ranking jest szeroki i dojrzały: dziewięćdziesiąt sześć pozycji, z Eleven v4 Turbo na czele z 1 328 Elo i Cartesia Sonic 3.6 na czwartym miejscu z 1 280.
Arena Controlled Voice robi coś węższego i — dla każdego, kto wprowadza produkt na rynek — bardziej przydatnego. Każdy model w niej generuje mowę na podstawie tych samych ośmiu sklonowanych głosów — czterech z USA i czterech z Wielkiej Brytanii — więc porównanie nie polega na tym, „czyj marketingowy głos jest ładniejszy”, ale na tym, „jak każdy silnik radzi sobie z tym samym głosem, tym samym tekstem i tymi samymi warunkami nagrania”. To najbliższe temu, co branża ma do testu silnika na równych zasadach, a nie do pokazowej rolki, i to właśnie ten ranking ma znaczenie, jeśli planujesz sklonować głos i przekazać go modelowi TTS.
HeyGen Voice jest teraz na czele. Przewaga wynosi 16 Elo nad Qwen-Audio-3.1-TTS-Plus i 35 nad Eleven v4 Turbo, przy raportowanym 95-procentowym przedziale ufności wynoszącym około od 1185 do 1219 dla wyniku HeyGen. Szesnaście punktów Elo to realna różnica, ale nie przepaść — w tak gęstym rankingu to różnica między pierwszym a drugim miejscem, a nie między użytecznym a bezużytecznym.

Gdzie HeyGen Voice nie jest jeszcze sklasyfikowany
Uczciwą stroną tego wyniku jest to, że HeyGen Voice w ogóle nie pojawia się na tablicy Provider Voices, a jego nieobecność nie jest sygnałem dotyczącym jakości. Artificial Analysis zauważa, że modele mogą zostać pominięte, ponieważ nie mają jeszcze wystarczającej liczby głosów. Model mający kilka dni, z jedną inaczej ocenianą areną za sobą, po prostu nie zgromadził liczby anonimowych słuchaczy, jakiej wymaga większa tablica.
Zatem prawidłowy odczyt na 10 października 2026 r. jest następujący: HeyGen Voice to najwyżej sklasyfikowany głos w kontrolowanym porównaniu sklonowanych głosów, a wobec szerszej stawki – niewiadoma. Kto cytuje „najlepszy model TTS na świecie” na podstawie tej liczby, ten cytuje mniejszy ranking, niż sugeruje to zdanie.

Dwie liczby za Elo
• Kontrolowane Elo głosu — HeyGen Voice: 1 202 (95% przedział ufności około 1 185–1 219). Qwen-Audio-3.1-TTS-Plus: 1 186. Eleven v4 Turbo: 1 167.
• Elo głosów dostawców — HeyGen Voice: brak na liście (niewystarczająca liczba głosów). Eleven v4 Turbo: 1328 na pozycji nr 1. Sonic 3.6: 1280 na pozycji nr 4.
• Miejsce w kontrolowanym zestawieniu — HeyGen Voice: #1 z 42 sklasyfikowanych pozycji (#42 to OpenVoice v2 z wynikiem 812).
• Cena według przelicznika areny — HeyGen Voice: 30,00 USD za 1 mln znaków, własne przeliczenie cen kredytów HeyGen przez arenę. Qwen-Audio-3.1-TTS-Plus: 19,30 USD za 1 mln znaków. Eleven v4 Turbo: 40,00 USD za 1 mln znaków.
• Kotwica Elo — OpenAudio S1 to stały punkt odniesienia na poziomie 1000, więc HeyGen Voice znajduje się 202 punkty powyżej kotwicy.
• Kto jeszcze znajduje się w pierwszej piątce — Eleven v4 z wynikiem 1160 i Sonic 3.6 z 1143 dopełniają pierwszą piątkę za liderami.

Co tak naprawdę wypuścił HeyGen
Silnikiem stojącym za tym wpisem jest wewnętrzny TTS HeyGen, udostępniony w firmowym API v3. GET /v3/voices przyjmuje filtr engine, którego wartości obejmują orca — własny silnik głosowy HeyGen — obok starfish oraz przekazywania do głosów ElevenLabs. Renderowanie mowy odbywa się przez POST /v3/voices/speech; dostrajanie dla poszczególnych żądań udostępnia speed od 0,5 do 1,5 oraz pitch od −50 do +50 półtonów, ze wskazówką locale w formacie BCP-47.
Katalog obejmuje ponad 300 gotowych głosów w kilkudziesięciu językach. Głosy niestandardowe występują w trzech wariantach: projektowanie tekstu na głos, które generuje do trzech uszeregowanych propozycji na podstawie opisu o długości do 1000 znaków, natychmiastowy klon z pojedynczego nagrania oraz profesjonalny klon wytrenowany na co najmniej dwudziestu minutach materiału audio. Ten ostatni to część, którą ranking Controlled Voice w praktyce poddaje testom obciążeniowym — te osiem głosów referencyjnych to klony, a jakość klonowania to punkt, w którym silniki TTS się różnią.
Silniki są również wymieniane w dokumentacji jako możliwe do wyboru dla poszczególnych głosów, co oznacza, że HeyGen nie zmusza cię do korzystania z jego modelu: możesz przez jego API kierować ruch do silnika głosowego innej firmy, jeśli wolisz taki. To dostawca, który nie stawia wszystkiego na własny model, i warto o tym wiedzieć, gdy czytasz twierdzenie o „głosie nr 1” dotyczące HeyGen.
Co to zmienia dla każdego, kto wybiera głos
Z nadejściem wyniku kontrolowanego głosu wiążą się trzy praktyczne konsekwencje i żadna z nich nie jest „przełączeniem wszystkiego”.
Po pierwsze, jeśli twoim przypadkiem użycia jest sklonowany głos marki — jeden mówca, wiele kwestii — to teraz jest to ranking, który warto przeczytać, a HeyGen Voice to model, który warto przetestować w pierwszej kolejności. Ranking, który utrzymuje głos na stałym poziomie, mierzy to, co faktycznie będziesz robić.
Po drugie, jeśli Twoim przypadkiem użycia jest szeroka obsada postaci brzmiących jak rodzimi użytkownicy w językach, których nie obejmuje Twój klon, tablica Provider Voices i jej dziewięćdziesiąt sześć wpisów wciąż stanowią właściwy punkt odniesienia, a HeyGen Voice nie ma tam jeszcze żadnej pozycji w rankingu. Nic w wyniku klonowania głosu nie mówi, jak silnik radzi sobie ze stu odrębnymi głosami.
Po trzecie, cena ma teraz liczbę, ale nie taką, którą opublikował dostawca. Arena podaje HeyGen Voice po 30,00 USD za 1 mln znaków — to konwersja systemu kredytów wykonana przez Artificial Analysis, której strona samego HeyGen nigdy nie przekłada na stawkę za głos. To stawia nowego lidera poniżej 40,00 USD Eleven v4 Turbo i powyżej 19,30 USD z poziomu Qwen — cenę ze środka stawki przypisaną do wyniku na pierwszym miejscu, i to wyliczoną, a nie zacytowaną.
Pytanie o routing
Wybór głosu ma właściwość, której nie ma większość wyborów modeli: błąd jest słyszalny dla użytkownika końcowego w obrębie jednej sylaby. Dzięki temu migrację można tanio przetestować, ale drogo kosztuje pomyłka na produkcji. Uruchomienie nowego silnika za tym samym interfejsem co dotychczasowy — jedna powierzchnia API, jeden klucz, cena katalogowa dostawcy przekazywana bez narzutu, z automatycznym przełączeniem awaryjnym do drugiego dostawcy głosu, gdy żądanie zawiedzie — to sposób, aby uzyskać prawdziwą odpowiedź o własnym dźwięku zamiast odpowiedzi z wykresu Elo o ośmiu głosach referencyjnych. Warstwa routingu OrcaRouter istnieje dokładnie dla takiego typu decyzji: postaw pretendenta na ułamku ruchu, utrzymuj dotychczasowego w gotowości, a przełączenie awaryjne niech pokryje okno, w którym nowy model jest niesprawdzony. Tabela liderów podpowiada, gdzie szukać. Nie potrafi jednak powiedzieć ci, jak brzmi twój skrypt.
Co obejrzeć dalej
Dwie liczby rozstrzygną tę historię. Pierwsza to, czy HeyGen Voice zgromadzi wystarczająco głosów, by wejść do rankingu Provider Voices, i gdzie trafi w porównaniu z wynikiem 1 328 Eleven v4 Turbo — modelu, który przewodzi temu rankingowi, ale pozostaje w tyle w kontrolowanej arenie, co jest dokładnie tą luką, którą oba rankingi mają ujawniać. Druga to, czy HeyGen opublikuje własną stawkę za głos, dzięki czemu $30.00 wyliczone przez arenę będzie można porównać z liczbą dostawcy, a nie wywnioskować z kredytów. Dopóki nie istnieją obie, debiut na #1 w kontrolowanym rankingu jest mocnym twierdzeniem o jakości klonowanego głosu i otwartym pytaniem o wszystko inne.
