Wygenerowana karta hero zatytułowana „HeyGen Voice vs Sesame Preview”, zestawiająca udokumentowane API mowy posiadające zmierzone Elo z konsumenckim demo bez publicznego punktu końcowego, oznaczona datą Artificial Analysis z 9 października 2026 r. Logo OrcaRouter pojawia się w prawym dolnym rogu.
Guides & Insights

HeyGen Voice kontra Sesame Preview: głos, który możesz kupić, przeciwko głosowi, z którym możesz tylko rozmawiać

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

To nie jest porównanie modeli, a udawanie, że jest inaczej, byłoby jedynym prawdziwym błędem, jaki można tu popełnić. HeyGen Voice to silnik API — sklasyfikowany na pierwszym miejscu w Controlled Voice arena Artificial Analysis z wynikiem 1,202 Elo, udostępniany przez endpointy v3 HeyGen, sprzedawany za kredyty, możliwy do sklonowania z jednego nagrania. Sesame Preview to darmowy konsumencki asystent głosowy, do którego docierasz, otwierając stronę internetową i rozmawiając z jedną z czterech nazwanych person, bez publicznego endpointu, bez identyfikatora modelu i bez ceny, za którą można go wynająć. Jeden z nich możesz wysłać do produkcji. Drugi jest powodem, dla którego wiesz, jak brzmi dobry głos konwersacyjny, i nigdy nie tym, co wdrażasz.

Czym każdy z nich właściwie jest

Sesame Preview to demonstracja mowy konwersacyjnej. Docierasz do niej przez własną witrynę firmy, rozmawiasz z Mayą, Milesem, Simone lub Charliem, a to doświadczenie jest celowo zoptymalizowane pod kątem życzliwości i ekspresyjności — firma mówi o tym wprost, opisując, dlaczego towarzysze zachowują się tak, jak się zachowują. Obecnie jest dostępny wyłącznie w języku angielskim, a zespół zauważa, że wielojęzyczność pojawia się przypadkowo wskutek zanieczyszczenia danych i „nie działa jeszcze dobrze”, a rozszerzenie poza dwadzieścia języków to plan na przyszłość. Sposób, w jaki firma sama to ujmuje, wciąż się kształtuje: „Jeszcze do tego nie doszliśmy”.

Pod demem kryje się Conversational Speech Model, multimodalna architektura tekstowo-mowy zbudowana z dwóch autoregresyjnych transformerów w stylu Llama. Występuje w trzech rozmiarach — Tiny ze szkieletem 1B i dekoderem 100M, Small przy 3B i 250M, Medium przy 8B i 300M — a każdy trenowano przy długości sekwencji 2048 tokenów, czyli około dwóch minut dźwięku, przez pięć epok na około milionie godzin głównie angielskiej mowy. Kluczowe komponenty badawcze są udostępnione jako open source na licencji Apache 2.0 i istnieje dla nich repozytorium GitHub. Demo — to, co ludzie faktycznie chwalą — nie jest tym. Demo nie ma publicznego API.

HeyGen Voice to odwrotna sytuacja. Nie ma darmowej aplikacji konsumenckiej do wypróbowania; jest udokumentowane API z katalogiem głosów, punktem końcowym syntezy mowy, ścieżkami klonowania i rachunkiem. Nie można natomiast otworzyć go w przeglądarce i ot tak sobie z nim porozmawiać.

Dlaczego właściwie porównuje się te dwa

Porównuje się je, ponieważ oba są podawane jako dowód, że syntetyczna mowa przekroczyła pewną granicę. Sesame Preview zrewidował oczekiwania co do tego, jak może brzmieć audio konwersacyjne — reakcje, gdy się pojawił, dotyczyły tego, jak bardzo brzmiał jak człowiek, a nie jak silnik zamiany tekstu na mowę. Wynik HeyGen Voice – 1 202 – na kontrolowanej tablicy wyników to ta sama teza w formie liczbowej: pierwsze miejsce wśród czterdziestu dwóch wpisów, gdy każdy model mówi tymi samymi ośmioma sklonowanymi głosami referencyjnymi.

Różnica polega na tym, co można później zrobić z tym twierdzeniem. Pozycja na tablicy jest odtwarzalna, testowalna i przypisana do endpointu. Wrażenie z demo nie ma żadnej z tych cech — a co ważne, Sesame Preview w ogóle nie pojawia się na kontrolowanej tablicy, więc nie ma żadnego Elo, z którym można by porównać 1202. Porównanie, które ludzie chcą przeprowadzić, jest niedostępne — nie dlatego, że Sesame je przegrał, ale dlatego, że model nigdy nie został zgłoszony.

Tablica wyników

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Kontrolowane Elo głosu — HeyGen Voice: 1202, nr 1 z 42. Sesame Preview: nie na liście.

• Dostęp — HeyGen Voice: udokumentowane API v3, POST /v3/voices/speech. Sesame Preview: konsumencka aplikacja webowa i aplikacja na iOS; brak publicznego endpointu.

• Cena — HeyGen Voice: 30,00 USD za 1 mln znaków według własnego przeliczenia cen kredytów przez arenę; HeyGen nie publikuje stawki za głos. Sesame Preview: bezpłatny i nie można go kupić za żadną cenę.

• Wybór głosu — HeyGen Voice: ponad 300 gotowych głosów, projektowanie głosu na podstawie opisu tekstowego, natychmiastowe i profesjonalne klonowanie. Sesame Preview: cztery stałe persony.

• Języki — HeyGen Voice: „dziesiątki języków”, liczba nieujawniona. Sesame Preview: tylko angielski, a wsparcie wielojęzyczne osiąga dziś słabe wyniki według samej firmy.

• Otwarte wagi — HeyGen Voice: brak. Sesame Preview: CSM udostępniony na licencji Apache 2.0 w rozmiarach 1B, 3B i 8B.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

Szczegół Apache 2.0 jest tym, który się liczy

Pod werdyktem „brak API” kryje się fakt, że Sesame udostępniło model badawczy na licencji Apache 2.0 — licencji permisywnej, w trzech rozmiarach, z wariantem 1B wystarczająco małym, by działać bez centrum danych. To zasadniczo odmienna propozycja od demo i jedyna droga, dzięki której cokolwiek przypominającego głos Sesame Preview trafia do wydanego produktu.

Dwa zastrzeżenia trzymają to w ryzach. Udostępnione komponenty CSM to artefakty badawcze: firma zaznacza, że modele obsługują treść mowy, ale nie strukturę konwersacji, i wskazuje w pełni duplexowe modele jako przyszły kierunek prac — udostępnione wagi nie są więc interaktywnym doświadczeniem. A backbone 8B uruchamiany lokalnie to inna struktura kosztów niż 19,30 USD za milion znaków hostowanej inferencji, którą to stawkę pobiera najtańszy rywal z najwyższej półki w arenie. Samodzielny hosting nie ma rachunku za znak, ale ma bardzo realny rachunek za godzinę GPU.

Dla twórcy to nadaje pytaniu nowe ramy. Jeśli w Sesame Preview wrażenie zrobiła na tobie rozmowa, otwarte wagi ci jej nie dają. Jeśli wrażenie zrobiła na tobie jakość głosu samego modelu mowy, mogą ci ją dać — a to da się przetestować w sposób, w jaki demo nie.

Jak wygląda wysyłka w HeyGen Voice

Praktyczne różnice są zwyczajne. API HeyGen przyjmuje wybór głosu, tekst oraz opcjonalną prędkość od 0,5 do 1,5 i wysokość tonu w zakresie ±50 półtonów, z BCP-47 lokalizacją — podpowiedź. Głosy niestandardowe powstają na trzy sposoby: oparta na opisie ścieżka projektowa, która zwraca maksymalnie trzy uszeregowane opcje z promptu ograniczonego do 1000 znaków, natychmiastowy klon z jednego nagrania oraz profesjonalny klon trenowany na co najmniej dwudziestu minutach. Filtr silnika na punkcie końcowym głosów również akceptuje silniki inne niż HeyGen, więc platforma nie jest zamkniętym ogrodem wokół własnego modelu.

Nic z tego nie istnieje po stronie Sesame i nie jest to wadą Sesame Preview — taka jest natura tej rzeczy. Demo zoptymalizowane, by pokazać, co jest możliwe, nie powinno podlegać SLA.

Rachunek jest jednak tą łagodniejszą połową. HeyGen sprzedaje kredyty — 600 za 29 USD/mies., 1000 za 49 USD, 1500 za 149 USD — i podaje, że zużycie zależy od modelu, czasu trwania i złożoności, nie publikując przy tym stawki za głos. Podawane przez arenę 30,00 USD za milion znaków to przeliczenie tych kredytów przez Artificial Analysis, a nie cytat z HeyGen. Zatem model, który możesz wdrożyć, ma cenę, ale opartą na cudzej arytmetyce — co jest argumentem za pilotażem opartym na pomiarach, a nie krytyką tego silnika.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

Co właściwie zrobić z demem, które podziwiasz

Przydatnym posunięciem jest rozdzielenie dwóch rzeczy, które demonstruje Sesame Preview. Zachowanie konwersacyjne — naprzemienność, pamięć, poczucie rozmowy z kimś — jest produktem systemu, który nie został wydany i nie ma punktu końcowego. Jakość mowy to ta część, za którą stoją wagi Apache 2.0, oraz ta, którą możesz ocenić na własnym audio, nie pytając nikogo o pozwolenie.

Dla wszystkich przypadków pośrednich ścieżka migracji jest ta przyziemna: wdrożyć na silniku, który ma API i miejsce w rankingu, oraz zaprojektować tak, aby przyjęcie modelu Sesame, jeśli kiedykolwiek zostałby wydany komercyjnie, było zmianą konfiguracji, a nie przepisaniem od zera. To oznacza abstrakcję nad dostawcą głosu od pierwszego dnia — jeden interfejs, jeden klucz, silnik wybierany w konfiguracji. Warstwa routingu OrcaRouter została stworzona dokładnie do tego: wielu dostawców za jednym punktem końcowym w cenie katalogowej dostawcy bez marży, automatyczne przełączanie awaryjne, gdy dostawca zawiedzie, oraz DSL routingu, który pozwala podmienić silnik stojący za głosem bez dotykania kodu aplikacji. Nie chodzi o to, że hostuje model Sesame — nie robi tego — ale o to, że w dniu, w którym głos, który podziwiasz, stanie się dostępny do kupienia, koszt jego wypróbowania powinien być jedną linijką w pliku konfiguracyjnym.

Uczciwe zamknięcie

Sesame Preview nie jest konkurentem HeyGen Voice i nie należy go oceniać jako takiego. To darmowa, wyłącznie angielskojęzyczna demonstracja z czterema personami, która przypadkiem zresetowała oczekiwania wobec konwersacyjnego audio i przypadkiem udostępniła wagi badawcze na permisywnej licencji w trzech rozmiarach. HeyGen Voice to najwyżej sklasyfikowany silnik na jedynym rankingu mowy, który utrzymuje stały głos, sprzedawany przez API, które możesz wywołać już dziś, w cenie, której jeszcze nie możesz obliczyć.

Jeśli potrzebujesz głosu, który możesz wypuścić w tym kwartale, wybór nie jest między tymi dwoma — jest między HeyGen Voice a pozostałymi płatnymi silnikami na arenie. Jeśli czekasz na Sesame, czekaj na wagi, nie na aplikację.