
Eleven v4 vs Sesame Preview: To nie jest takie porównanie, jak myślisz
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 982 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 197 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Wyszukiwanie ElevenLabs Eleven v4w zestawieniu z Sesame Previewzwraca mnóstwo stron, które z chęcią wrzucą je do tabeli. Prawie wszystkie z nich porównują produkt do benchmarku i zestawiają to z demem, a tabela jest najmniej użyteczną rzeczą na stronie. Eleven v4 to ogólnodostępny model syntezy mowy z API, cennikiem i opublikowaną pozycją w rankingu areny. Sesame Preview to darmowy konsumencki asystent głosowy, który odpowiada, gdy stukniesz w link. To nie dwie opcje tego samego zakupu, a uczciwa wersja tego artykułu mówi o tym, którą z tych dwóch opcji naprawdę chcesz — bo odpowiedź zależy od pytania, którego nie zadaje strona marketingowa żadnego z dostawców.

Czym właściwie jest Eleven v4
ElevenLabs udostępnił Eleven v4 i Eleven v4 Turbo 28 września jako produkcyjne endpointy. Eleven v4 obsługuje ponad 90 języków, limit 10 000 znaków na żądanie, dialog z wieloma mówcami ze stabilną tożsamością mówcy, wbudowane dyrektywy sposobu wypowiedzi, ulepszoną obsługę fonemów IPA oraz natychmiastowe klonowanie głosu z dziesięciu sekund dźwięku. Zajmuje pierwsze miejsce w Provider Voice Arena firmy Artificial Analysis z wynikiem Elo 1 319 na podstawie 1 674 próbek, a drugie w rankingu Controlled Voice z wynikiem 1 157. W cenniku API widnieje stawka 0,022 USD za tysiąc znaków w ramach promocji kończącej się 12 października, po czym wraca do 0,08 USD — tej samej stawki, jaką miał poprzedni ElevenLabs Eleven v3.
Każdą część tego akapitu można zweryfikować. Jest tam identyfikator modelu, udokumentowany limit danych wejściowych, opublikowana cena za znak, informacja o wycofaniu starszych poziomów Turbo oraz niezależny wpis w rankingu z przedziałem ufności. Tak wygląda model, który można kupić.

Czym właściwie jest Sesame Preview
Sesame Preview to demonstracja dla konsumentów. To asystent głosowy, do którego można dotrzeć przez własną stronę firmy, z niewielką obsadą postaci o imionach — Maya, Miles, Simone i Charlie — pamięcią konwersacyjną przenoszącą się między sesjami, wyszukiwaniem w sieci, notatkami i przypomnieniami oraz podsumowaniem po rozmowie. Jest bezpłatny. Sesje po zalogowaniu trwają około pół godziny; sesje gościa — około pięciu minut. Obsługuje wyłącznie język angielski. A Sesame jasno stwierdza, że nie wykonuje zadań: sedno demonstracji tkwi w teksturze rozmowy, a nie w agencie, który rezerwuje twoje spotkanie.
W tym porównaniu liczy się to, czego brakuje. Nie ma identyfikatora modelu, punktu końcowego, tabeli stawek, limitu danych wejściowych, względem którego można projektować, ani ogłoszonej daty dla modelu produkcyjnego. Opublikowana linia badawcza Sesame to osobna sprawa — model mowy konwersacyjnej z otwartymi wagami i kontekstem 4K — i nie jest to ten sam system, z którym rozmawiasz w Preview. Tak więc to, co w każdej tabeli porównawczej nosi nazwę „Sesame Preview”, jest produktem, z którym nie można się zintegrować, a to, co można pobrać, nie jest tym produktem.
Dlaczego nie mogą współdzielić tablicy wyników?
Arena kontrolowanego głosu w Artificial Analysis to, co ta dziedzina ma najbliższego neutralnemu pomiarowi, a Sesame Preview się na niej nie znajduje. Nie znajduje się też na tablicy głosów dostawców. Nie ma tam Elo, liczby głosów ani normalizacji cen — i nie ma sposobu, by go uzyskać, ponieważ ranking wymaga wywoływalnego endpointu i ceny za jednostkę, a Sesame Preview nie ma ani jednego, ani drugiego.
Zatem każda tabela, w której te dwa elementy są zestawione obok siebie, wypełnia kolumnę Sesame danymi z prezentacji produktu. Porównywanie endpointu za 80 dolarów za milion znaków z darmowym demem internetowym pod kątem „naturalności” nie jest porównaniem; to błąd kategorii z dziurą w kształcie Elo. Jeśli jakaś strona ogłasza zwycięzcę w tym pojedynku, wymyśliła podstawę tego twierdzenia.
To, co można uczciwie powiedzieć, to to, czym każde z nich próbuje być. Eleven v4 jest zoptymalizowany, by na dużą skalę zamieniać scenariusz w występ przez API, za każdym razem z tym samym głosem. Sesame Preview jest zoptymalizowany, by sprawić, że obca osoba poczuje, jakby rozmawiała z kimś, raz, w karcie przeglądarki.
Jedyne miejsce, w którym porównanie jest prawdziwe
Pod tym wyszukiwaniem kryje się prawdziwe pytanie, a dotyczy ono otwartych wag. Jeśli tak naprawdę chcesz model mowy, który możesz pobrać i uruchomić samodzielnie, flagowy produkt żadnego z dostawców nie jest odpowiedzią — stack ElevenLabs jest zamknięty, a system Sesame, który możesz uruchomić, to model badawczy z kontekstem 4K, a nie asystent.
Do tego zadania użytecznym punktem odniesienia są tablice areny: Breeze TTS 2 to najwyżej sklasyfikowany model open-weights w Provider Voice, z Elo 1 206 i 34,00 USD za milion znaków, a w stawce 92 modeli na tej tablicy jest 16 modeli open-weights. To 113 punktów za Eleven v4 i znacznie przed linią Qwen3 TTS z wynikami 944 i 930. Jeśli Twój projekt ma działać na własnym sprzęcie, porównaniem, które warto przeprowadzić, jest Eleven v4 kontra Breeze TTS 2 — a nie kontra demo w przeglądarce — i kompromis jest tu realny: rezygnujesz z około stu punktów Elo oraz przepływu pracy z tagami audio, a zyskujesz kontrolę nad całym stosem.

Wybieranie, biorąc pod uwagę, do czego służy każdy z nich
• Jeśli budujesz produkt, który mówi — Eleven v4, przez API, według cennika. Z Sesame Preview nie da się niczego zintegrować, więc nie ma go w tej decyzji.
• Jeśli chcesz mieć demo konwersacyjne, żeby pokazać komuś, jak to jest z AI głosowym — Sesame Preview, i jest darmowe, co jest całym argumentem za nim.
• Jeśli oceniasz zakres emocjonalny, zanim zdecydujesz się na dostawcę — liczby, które warto wziąć pod uwagę, to Elo 1 319 Eleven v4 w rankingu głosów dostawców i 1 157 w rankingu głosów sklonowanych, z zastrzeżeniem, że ta druga dotyczy produktu z klonowanym głosem marki.
• Jeśli potrzebujesz mowy w językach innych niż angielski — Eleven v4 deklaruje ponad 90; Sesame Preview obsługuje wyłącznie angielski i wyraźnie to zaznacza.
• Jeśli potrzebujesz, aby model faktycznie coś robił — w tym zestawieniu żaden z nich. Sesame Preview celowo nie wykonuje zadań, a Eleven v4 to silnik syntezy, który wymaga wokół siebie własnego stacku.
• Jeśli potrzebujesz uruchomić to lokalnie — żadne z nich. Breeze TTS 2 to punkt odniesienia z otwartymi wagami.
• Jeśli koszt jest czynnikiem decydującym — Eleven v4 kosztuje 0,022 USD za tysiąc znaków do 12 października i 0,08 USD po tej dacie, a Sesame Preview jest darmowy, ponieważ nie jest produktem, który można kupić. Darmowe demo nie jest tańszą opcją; to inna kategoria.
Jedno, co łączy oba, to problem z datą. Promocyjna cena Eleven v4 wygasa 12 października, co zmienia jego koszt niemal czterokrotnie. Sesame nie podało żadnej daty dla modelu produkcyjnego, co jest innym rodzajem niepewności — Preview może zostać zastąpione już w przyszłym miesiącu albo pozostać bez zmian przez rok, a nie ma sposobu, by planować wokół premiery, której nikt nie zaplanował.
Jeśli Twój stack ostatecznie obejmuje więcej niż jednego dostawcę rozwiązań głosowych
OrcaRouter nie hostuje ani ElevenLabs, ani Sesame, więc w tym artykule nie ma nic, co moglibyście wywołać przez nas, i nie będziemy sugerować inaczej. Zajmujemy się warstwą ponad stosem, który już jest wielodostawcowy. Jeden klucz API sięga do ponad 200 modeli, a ceny katalogowe dostawców są przekazywane dalej przy 0% marży, więc zmiana ceny po stronie dostawcy — a okno promocyjne związane z tą premierą jest tego żywym przykładem — trafia na naszą stronę tego samego dnia, a nie dopiero przy następnej fakturze. Tam, gdzie ścieżka mowy jest widoczna dla klienta, automatyczne przełączanie awaryjne przenosi ruch do sprawnego dostawcy, gdy któryś zaczyna zawodzić, dzięki czemu możesz odsłuchać nowy punkt końcowy na prawdziwym ruchu, nie stawiając na szali wydania.
Co zabrać ze sobą
Eleven v4 to model, który możesz kupić, zmierzyć i na którym możesz polegać, a obecnie znajduje się na szczycie tablicy głosów dostawców z dwutygodniową obniżką ceny. Sesame Preview to darmowy eksperyment w zakresie wrażenia konwersacyjnego, dostępny tylko w języku angielskim, z limitem trzydziestu minut i nie jest czymś, na czym można budować. Powód, dla którego pojawiają się w tych samych wynikach wyszukiwania, jest taki, że oba są głosową AI i oba są nowe — a nie, że którekolwiek z nich jest alternatywą dla drugiego.
Jeśli trafiłeś tutaj, aby wybrać między nimi, przydatna zmiana perspektywy jest taka: nie wybierasz modelu głosu. Decydujesz, czy wypuszczasz produkt, czy testujesz demo, a tylko jedna z tych decyzji ma przypisany cennik. Jeśli to produkt, przeczytaj liczby Eleven v4 i przeczytaj je ponownie 13 października, kiedy wygaśnie stawka promocyjna, a porównanie z każdym innym dostawcą na liście się zmieni.
