
HeyGen Voice kontra Sesame Preview: głos, który możesz kupić, przeciwko głosowi, z którym możesz tylko rozmawiać
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
To nie jest porównanie modeli, a udawanie, że jest inaczej, byłoby jedynym prawdziwym błędem, jaki można tu popełnić. HeyGen Voice to silnik API — sklasyfikowany na pierwszym miejscu w Controlled Voice arena Artificial Analysis z wynikiem 1,202 Elo, udostępniany przez endpointy v3 HeyGen, sprzedawany za kredyty, możliwy do sklonowania z jednego nagrania. Sesame Preview to darmowy konsumencki asystent głosowy, do którego docierasz, otwierając stronę internetową i rozmawiając z jedną z czterech nazwanych person, bez publicznego endpointu, bez identyfikatora modelu i bez ceny, za którą można go wynająć. Jeden z nich możesz wysłać do produkcji. Drugi jest powodem, dla którego wiesz, jak brzmi dobry głos konwersacyjny, i nigdy nie tym, co wdrażasz.
Czym każdy z nich właściwie jest
Sesame Preview to demonstracja mowy konwersacyjnej. Docierasz do niej przez własną witrynę firmy, rozmawiasz z Mayą, Milesem, Simone lub Charliem, a to doświadczenie jest celowo zoptymalizowane pod kątem życzliwości i ekspresyjności — firma mówi o tym wprost, opisując, dlaczego towarzysze zachowują się tak, jak się zachowują. Obecnie jest dostępny wyłącznie w języku angielskim, a zespół zauważa, że wielojęzyczność pojawia się przypadkowo wskutek zanieczyszczenia danych i „nie działa jeszcze dobrze”, a rozszerzenie poza dwadzieścia języków to plan na przyszłość. Sposób, w jaki firma sama to ujmuje, wciąż się kształtuje: „Jeszcze do tego nie doszliśmy”.
Pod demem kryje się Conversational Speech Model, multimodalna architektura tekstowo-mowy zbudowana z dwóch autoregresyjnych transformerów w stylu Llama. Występuje w trzech rozmiarach — Tiny ze szkieletem 1B i dekoderem 100M, Small przy 3B i 250M, Medium przy 8B i 300M — a każdy trenowano przy długości sekwencji 2048 tokenów, czyli około dwóch minut dźwięku, przez pięć epok na około milionie godzin głównie angielskiej mowy. Kluczowe komponenty badawcze są udostępnione jako open source na licencji Apache 2.0 i istnieje dla nich repozytorium GitHub. Demo — to, co ludzie faktycznie chwalą — nie jest tym. Demo nie ma publicznego API.
HeyGen Voice to odwrotna sytuacja. Nie ma darmowej aplikacji konsumenckiej do wypróbowania; jest udokumentowane API z katalogiem głosów, punktem końcowym syntezy mowy, ścieżkami klonowania i rachunkiem. Nie można natomiast otworzyć go w przeglądarce i ot tak sobie z nim porozmawiać.
Dlaczego właściwie porównuje się te dwa
Porównuje się je, ponieważ oba są podawane jako dowód, że syntetyczna mowa przekroczyła pewną granicę. Sesame Preview zrewidował oczekiwania co do tego, jak może brzmieć audio konwersacyjne — reakcje, gdy się pojawił, dotyczyły tego, jak bardzo brzmiał jak człowiek, a nie jak silnik zamiany tekstu na mowę. Wynik HeyGen Voice – 1 202 – na kontrolowanej tablicy wyników to ta sama teza w formie liczbowej: pierwsze miejsce wśród czterdziestu dwóch wpisów, gdy każdy model mówi tymi samymi ośmioma sklonowanymi głosami referencyjnymi.
Różnica polega na tym, co można później zrobić z tym twierdzeniem. Pozycja na tablicy jest odtwarzalna, testowalna i przypisana do endpointu. Wrażenie z demo nie ma żadnej z tych cech — a co ważne, Sesame Preview w ogóle nie pojawia się na kontrolowanej tablicy, więc nie ma żadnego Elo, z którym można by porównać 1202. Porównanie, które ludzie chcą przeprowadzić, jest niedostępne — nie dlatego, że Sesame je przegrał, ale dlatego, że model nigdy nie został zgłoszony.
Tablica wyników

• Kontrolowane Elo głosu — HeyGen Voice: 1202, nr 1 z 42. Sesame Preview: nie na liście.
• Dostęp — HeyGen Voice: udokumentowane API v3, POST /v3/voices/speech. Sesame Preview: konsumencka aplikacja webowa i aplikacja na iOS; brak publicznego endpointu.
• Cena — HeyGen Voice: 30,00 USD za 1 mln znaków według własnego przeliczenia cen kredytów przez arenę; HeyGen nie publikuje stawki za głos. Sesame Preview: bezpłatny i nie można go kupić za żadną cenę.
• Wybór głosu — HeyGen Voice: ponad 300 gotowych głosów, projektowanie głosu na podstawie opisu tekstowego, natychmiastowe i profesjonalne klonowanie. Sesame Preview: cztery stałe persony.
• Języki — HeyGen Voice: „dziesiątki języków”, liczba nieujawniona. Sesame Preview: tylko angielski, a wsparcie wielojęzyczne osiąga dziś słabe wyniki według samej firmy.
• Otwarte wagi — HeyGen Voice: brak. Sesame Preview: CSM udostępniony na licencji Apache 2.0 w rozmiarach 1B, 3B i 8B.

Szczegół Apache 2.0 jest tym, który się liczy
Pod werdyktem „brak API” kryje się fakt, że Sesame udostępniło model badawczy na licencji Apache 2.0 — licencji permisywnej, w trzech rozmiarach, z wariantem 1B wystarczająco małym, by działać bez centrum danych. To zasadniczo odmienna propozycja od demo i jedyna droga, dzięki której cokolwiek przypominającego głos Sesame Preview trafia do wydanego produktu.
Dwa zastrzeżenia trzymają to w ryzach. Udostępnione komponenty CSM to artefakty badawcze: firma zaznacza, że modele obsługują treść mowy, ale nie strukturę konwersacji, i wskazuje w pełni duplexowe modele jako przyszły kierunek prac — udostępnione wagi nie są więc interaktywnym doświadczeniem. A backbone 8B uruchamiany lokalnie to inna struktura kosztów niż 19,30 USD za milion znaków hostowanej inferencji, którą to stawkę pobiera najtańszy rywal z najwyższej półki w arenie. Samodzielny hosting nie ma rachunku za znak, ale ma bardzo realny rachunek za godzinę GPU.
Dla twórcy to nadaje pytaniu nowe ramy. Jeśli w Sesame Preview wrażenie zrobiła na tobie rozmowa, otwarte wagi ci jej nie dają. Jeśli wrażenie zrobiła na tobie jakość głosu samego modelu mowy, mogą ci ją dać — a to da się przetestować w sposób, w jaki demo nie.
Jak wygląda wysyłka w HeyGen Voice
Praktyczne różnice są zwyczajne. API HeyGen przyjmuje wybór głosu, tekst oraz opcjonalną prędkość od 0,5 do 1,5 i wysokość tonu w zakresie ±50 półtonów, z BCP-47 lokalizacją — podpowiedź. Głosy niestandardowe powstają na trzy sposoby: oparta na opisie ścieżka projektowa, która zwraca maksymalnie trzy uszeregowane opcje z promptu ograniczonego do 1000 znaków, natychmiastowy klon z jednego nagrania oraz profesjonalny klon trenowany na co najmniej dwudziestu minutach. Filtr silnika na punkcie końcowym głosów również akceptuje silniki inne niż HeyGen, więc platforma nie jest zamkniętym ogrodem wokół własnego modelu.
Nic z tego nie istnieje po stronie Sesame i nie jest to wadą Sesame Preview — taka jest natura tej rzeczy. Demo zoptymalizowane, by pokazać, co jest możliwe, nie powinno podlegać SLA.
Rachunek jest jednak tą łagodniejszą połową. HeyGen sprzedaje kredyty — 600 za 29 USD/mies., 1000 za 49 USD, 1500 za 149 USD — i podaje, że zużycie zależy od modelu, czasu trwania i złożoności, nie publikując przy tym stawki za głos. Podawane przez arenę 30,00 USD za milion znaków to przeliczenie tych kredytów przez Artificial Analysis, a nie cytat z HeyGen. Zatem model, który możesz wdrożyć, ma cenę, ale opartą na cudzej arytmetyce — co jest argumentem za pilotażem opartym na pomiarach, a nie krytyką tego silnika.

Co właściwie zrobić z demem, które podziwiasz
Przydatnym posunięciem jest rozdzielenie dwóch rzeczy, które demonstruje Sesame Preview. Zachowanie konwersacyjne — naprzemienność, pamięć, poczucie rozmowy z kimś — jest produktem systemu, który nie został wydany i nie ma punktu końcowego. Jakość mowy to ta część, za którą stoją wagi Apache 2.0, oraz ta, którą możesz ocenić na własnym audio, nie pytając nikogo o pozwolenie.
Dla wszystkich przypadków pośrednich ścieżka migracji jest ta przyziemna: wdrożyć na silniku, który ma API i miejsce w rankingu, oraz zaprojektować tak, aby przyjęcie modelu Sesame, jeśli kiedykolwiek zostałby wydany komercyjnie, było zmianą konfiguracji, a nie przepisaniem od zera. To oznacza abstrakcję nad dostawcą głosu od pierwszego dnia — jeden interfejs, jeden klucz, silnik wybierany w konfiguracji. Warstwa routingu OrcaRouter została stworzona dokładnie do tego: wielu dostawców za jednym punktem końcowym w cenie katalogowej dostawcy bez marży, automatyczne przełączanie awaryjne, gdy dostawca zawiedzie, oraz DSL routingu, który pozwala podmienić silnik stojący za głosem bez dotykania kodu aplikacji. Nie chodzi o to, że hostuje model Sesame — nie robi tego — ale o to, że w dniu, w którym głos, który podziwiasz, stanie się dostępny do kupienia, koszt jego wypróbowania powinien być jedną linijką w pliku konfiguracyjnym.
Uczciwe zamknięcie
Sesame Preview nie jest konkurentem HeyGen Voice i nie należy go oceniać jako takiego. To darmowa, wyłącznie angielskojęzyczna demonstracja z czterema personami, która przypadkiem zresetowała oczekiwania wobec konwersacyjnego audio i przypadkiem udostępniła wagi badawcze na permisywnej licencji w trzech rozmiarach. HeyGen Voice to najwyżej sklasyfikowany silnik na jedynym rankingu mowy, który utrzymuje stały głos, sprzedawany przez API, które możesz wywołać już dziś, w cenie, której jeszcze nie możesz obliczyć.
Jeśli potrzebujesz głosu, który możesz wypuścić w tym kwartale, wybór nie jest między tymi dwoma — jest między HeyGen Voice a pozostałymi płatnymi silnikami na arenie. Jeśli czekasz na Sesame, czekaj na wagi, nie na aplikację.
