Wygenerowana karta hero dla „Gemini 3.8 TTS vs Sesame Preview” na białym tle z delikatnymi niebiesko-cyjanowymi akcentami gradientowymi. Lewa karta „Gemini 3.8 Flash TTS” zawiera: Elo 1260 na pozycji 2, 8 głosów Arena, punkt końcowy API i 16,50 USD za 1 mln znormalizowanych znaków; prawa karta „Sesame” dzieli się na „Aplikacja Preview — bezpłatna, tylko w języku angielskim, brak API, brak identyfikatora modelu” oraz „Checkpoint CSM-1B — Apache 2.0, 2 mld parametrów, szkielet Llama”. Wiersz stopki brzmi: „Elo według Artificial Analysis Provider Voice Arena, wrzesień 2026; szczegóły CSM-1B zgodnie z jej kartą modelu”. Logo OrcaRouter zostało nałożone w prawym dolnym rogu.
Guides & Insights

Gemini 3.8 TTS kontra Sesame Preview: Jedno z nich to plik do pobrania, drugie to aplikacja

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Wyszukaj porównanie między Gemini 3.8 Flash TTS a Sesame Preview a znajdziesz mnóstwo tekstów, które traktują je jako dwa produkty z tej samej kategorii. Nie są nimi, a różnica nie jest szczegółem technicznym. Gemini 3.8 Flash TTS to punkt końcowy API: ma identyfikator modelu, opublikowany cennik, wiersz w rankingu na pozycji 2 z Elo 1260 na podstawie 1999 próbek w Artificial Analysis Provider Voice Arena oraz udokumentowany format żądań. Sesame Preview to darmowa konsumencka aplikacja asystenta głosowego z nazwanymi agentami, rozmowami wieloturowymi i limitem czasu połączenia wynoszącym 30 minut. Nie ma API, identyfikatora modelu, planu rozliczeniowego ani wyniku w tym rankingu.

Jedynym artefaktem Sesame, na którym można faktycznie budować, jest znowu coś innego: CSM-1B, checkpoint Apache 2.0 na Hugging Face, który generuje kody audio z tekstu za pomocą backbone'u Llama i dekodera audio Mimi. To nie jest głos, o którym ludzie mówią, gdy opisują, jak ludzko brzmi ta aplikacja. Porównanie sprowadza się więc do pytania, na które można odpowiedzieć: chcesz wynająć model mowy czy chcesz go pobrać?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

Dwie rzeczy zwane Sesame, a tylko jedną z nich można zbudować

Nazewnictwo jest źródłem większości zamieszania, więc oddziel je, zanim pójdziesz dalej.

• Sesame Preview — aplikacja. Darmowa w użyciu, agenci o imionach Maya, Miles, Simone i Charlie, rozmowa wieloturowa z kontekstem utrzymującym się między turami, wyszukiwanie w internecie i przypomnienia jako możliwości, tylko w języku angielskim, limit 30 minut na połączenie. Nie ma powierzchni dla programistów: nie ma względem czego się uwierzytelniać, nie ma czego mierzyć, nie ma punktu końcowego do wywołania.

• CSM-1B — punkt kontrolny. Opublikowany na Hugging Face pod sesame/csm-1b na licencji Apache 2.0, z szkieletem Llama i mniejszym dekoderem, który generuje kody audio Mimi. Około 2 miliardów parametrów, angielski, wagi F32, działa przez Hugging Face Transformers. Karta modelu odnotowuje, że wariant 1B został udostępniony w marcu 2025, a natywne wsparcie dla Transformers pojawiło się w maju 2025.

Te dwie rzeczy łączy firma i wspólny rodowód badawczy — i na tym ta relacja się w zasadzie kończy. Aplikacja jest produktem; checkpoint to artefakt badań, które ją poprzedzały. Recenzenci chwalący pamięć konwersacyjną aplikacji opisują system z wyszukiwaniem i zarządzaniem stanem wokół modelu mowy, a nie właściwość checkpointu 2B, który można pobrać.

Co właściwie znajduje się w punkcie kontrolnym?

CSM-1B to model zamiany tekstu na mowę w sensie architektonicznym, który ma znaczenie dla każdego, kto planuje go uruchomić: przyjmuje tekst oraz kontekst audio jako dane wejściowe i emituje kody audio RVQ, które dekoder zamienia na przebieg fali. Praktyczne fakty z karty modelu:

• Licencja — Apache 2.0. To najbardziej doniosłe zdanie na tej stronie. W przeciwieństwie do licencji na wagi przeznaczonych wyłącznie do badań, Apache 2.0 pozwala na użycie komercyjne bez odrębnej umowy, co czyni CSM-1B jednym z niewielu naprawdę użytecznych otwartych checkpointów mowy.

• Rozmiar — około 2B parametrów w F32. Wystarczająco duży, by potrzebować prawdziwego sprzętu do czegokolwiek współbieżnego, wystarczająco mały, by działać na pojedynczym akceleratorze na potrzeby developmentu.

• Język — angielski, zgodnie z kartą. To nie jest model wielojęzyczny.

• Trakcja — 141 461 pobrań w ostatnim miesiącu w momencie pisania, przy około 245 000 polubień w repozytorium. To szeroko stosowany checkpoint jak na standardy otwartych modeli mowy i najsilniejszy argument za tym, że artefakt ma rzeczywistą bazę użytkowników niezależną od rozgłosu aplikacji.

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

To, czego karta ci nie daje, to twierdzenia o jakości, które mógłbyś porównać z czymkolwiek. Nie ma wiersza w arenie, żadnego benchmarku dostawcy odtworzonego przez stronę trzecią ani opublikowanej oceny tego, jak wyniki checkpointu mają się do wyników aplikacji. Każdy, kto mówi ci, że model do pobrania brzmi jak aplikacja, wnioskuje to z nazwy.

Dlaczego nie ma bezpośredniego porównania i dlaczego nie jest to luka badawcza

Nie ma porównania Gemini 3.8 TTS z Sesame Preview w rankingach, ponieważ nie może ono istnieć. Arena klasyfikuje modele, sprawiając, że słuchacze porównują klipy wygenerowane przez hostowany endpoint. Jedna strona tej pary nie ma endpointu, więc nie można jej zgłosić.

Warto to precyzyjnie ująć, ponieważ „nie istnieje bezpośrednie porównanie” jest często opisywane tak, jakby brakowało danych. Danych nie brakuje. Są niezdefiniowane. Te dwie porównywane rzeczy nie mają wspólnej mierzalnej płaszczyzny:

• Gemini 3.8 Flash TTS jest oceniany na podstawie swoich natywnych, hostowanych głosów. Sesame Preview nie ma w tym sensie natywnych głosów, które można by oceniać — ma agentów.

• Gemini 3.8 Flash TTS publikuje cennik w tokenach. Sesame Preview jest darmowy i nic nie publikuje, ponieważ nie ma czego rozliczać.

• Gemini 3.8 Flash TTS przyjmuje skrypt i zwraca audio. Sesame Preview przyjmuje rozmowę i zwraca rozmowę, z dowolnym wyszukiwaniem i pamięcią, które aplikacja nakłada na wierzch.

Najbliżej miarodajnego porównania jest zestawienie Gemini 3.8 Flash TTS z CSM-1B, a nawet ono jest nierówne: jedno ma niezależne Elo i cennik dostawcy, drugie nie ma ani jednego, ani drugiego. Porównywać można natomiast kształt zobowiązania — API rozliczane za użycie kontra checkpoint do pobrania — a takie porównanie nie potrzebuje tabeli liderów.

Jedyna strona tego, na której są liczby

Wszystko, co ilościowe w tym zestawieniu, leży po stronie Google, co samo w sobie jest sednem sprawy.

W Artificial Analysis Provider Voice Arena, według danych z 24 września 2026 r., Gemini 3.8 Flash TTS zajmuje 2. miejsce z Elo 1 260 na podstawie 1 999 próbek i 8 głosów areny; wydano go 23 września 2026 r. Jego pokrewny model Gemini 3.8 Flash-Lite TTS zajmuje 6. miejsce z wynikiem 1 235. Google rozlicza Flash TTS stawką 0,50 USD za milion wejściowych tokenów tekstowych i 9,00 USD za milion wyjściowych tokenów audio do 31 grudnia 2026 r., a następnie 18,00 USD; Flash-Lite TTS – 0,50 USD i 6,00 USD, a następnie 12,00 USD. Artificial Analysis normalizuje te stawki do 16,50 USD i 11,00 USD za milion znaków, aby można je było umieścić w tym samym rankingu co modele rozliczane w innych jednostkach. Ta normalizacja to wynik obliczeń rankingu, a nie cytat z Google.

W przeciwieństwie do tego CSM-1B nie ma ceny, ponieważ nie ma licznika. Ma liczbę pobrań, licencję i liczbę parametrów. Jeśli twoje ramy decyzyjne wymagają Elo, to porównanie nie dostarczy go dla strony Sesame, a uczciwy wniosek jest taki, że dwie opcje są oceniane według różnych kryteriów, a nie że jedna z nich jest nieudowodniona.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

Jeśli tym, czego chciałeś, było doświadczenie aplikacji

Wiele osób szukających tego porównania wcale nie wybiera modelu. Używały aplikacji Sesame, spodobało im się to, jak odczuwalna była rozmowa, i chcą tego we własnym produkcie. To inny problem, a pobranie tego nie rozwiąże.

To, że aplikacja działa tak, jak działa, w większości nie wynika z modelu mowy. Trwały kontekst między turami, decyzja o wyszukaniu informacji w sieci w trakcie rozmowy, moment, w którym odzywa się agent — to orkiestracja, a żadna z tych rzeczy nie mieści się w checkpoincie 2B. Pobranie CSM-1B daje ci głos. Zbudowanie zachowania aplikacji na jego podstawie to twoja inżynieria, a limit 30 minut na rozmowę i brak API oznaczają, że nie możesz też wynająć gotowej wersji.

Jeśli chodziło Ci o model mowy, który możesz wywołać, szczera odpowiedź brzmi: Gemini 3.8 Flash TTS to opcja z udokumentowanym interfejsem, opublikowaną ceną, niezależnym wynikiem i dialogiem dwóch mówców w jednym żądaniu. Jeśli chodziło Ci o wagi, które możesz zachować, CSM-1B na licencji Apache 2.0 jest tym z dwóch, który możesz faktycznie mieć — a kompromis polega na tym, że sam zapewniasz sprzęt, stos serwujący i wszelkie gwarancje jakości.

OrcaRouter nie hostuje żadnego z nich. Model Google’a jest wywoływany przez własne API Google i powierzchnie wymienione w jego ogłoszeniu z 23 września; CSM-1B to checkpoint, który sam uruchamiasz. OrcaRouter jest po to, by stanowić warstwę ponad tym wyborem: ponad 200 modeli za jednym kluczem w cenie katalogowej dostawcy bez narzutu, dzięki czemu zmiana stawek dostawcy obowiązuje tego samego dnia, automatyczne przełączanie awaryjne dzięki czemu eksperymentalna trasa nie jest zależnością produkcyjną, oraz DSL routingu, który komponuje modele w jedno wywołanie, gdy pojedynczy głos nie wystarcza do całego zadania.

Krótka wersja tego porównania jest taka, że to właściwie nie jest porównanie. Jedna strona ma cennik i Elo; druga ma licencję i liczbę pobrań. Wybierz tę, której kolumnę możesz faktycznie wypełnić.