Eine generierte Hero-Karte für 'Gemini 3.8 TTS vs. Sesame Preview' auf weißem Hintergrund mit sanften blau-cyanfarbenen Verlaufsakzenten. Die linke Karte 'Gemini 3.8 Flash TTS' listet Elo 1.260 auf Rang 2, 8 Arena-Stimmen, einen API-Endpunkt und 16,50 $ pro 1 Mio. Zeichen normalisiert; die rechte Karte 'Sesame' teilt sich in 'Preview-App – kostenlos, nur Englisch, keine API, keine Modell-ID' und 'CSM-1B-Checkpoint – Apache 2.0, 2 Mrd. Parameter, Llama-Backbone' auf. Eine Fußzeile lautet 'Elo laut Artificial Analysis Provider Voice Arena, Sept. 2026; CSM-1B-Details laut zugehöriger Modellkarte.' Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Gemini 3.8 TTS vs. Sesame Preview: Eines davon ist ein Download, das andere ist eine App

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Suche nach einem Vergleich zwischen Gemini 3.8 Flash TTS und Sesame Preview und du wirst reichlich Texte finden, die sie als zwei Produkte derselben Kategorie behandeln. Sie sind es nicht, und der Unterschied ist keine bloße technische Feinheit. Gemini 3.8 Flash TTS ist ein API-Endpunkt: Er hat eine Modellkennung, eine veröffentlichte Preisliste, einen Bestenlisten-Eintrag auf Rang 2 mit einem Elo-Wert von 1.260 über 1.999 Stichproben in der Artificial Analysis Provider Voice Arena und ein dokumentiertes Anfrageformat. Sesame Preview ist eine kostenlose Sprachassistenten-App für Endverbraucher mit benannten Agenten, Multi-Turn-Gesprächen und einer Obergrenze von 30 Minuten pro Anruf. Sie hat keine API, keine Modell-ID, keinen Abrechnungsplan und keinen Score auf dieser Bestenliste.

Das eine Sesame-Artefakt, auf dem man tatsächlich aufbauen kann, ist wieder etwas ganz anderes: CSM-1B, ein Apache-2.0-Checkpoint auf Hugging Face, der aus Text mithilfe eines Llama-Backbones und eines Mimi-Audiodecoders Audiocodes erzeugt. Es ist nicht die Stimme, von der die Leute reden, wenn sie beschreiben, wie menschlich die App klingt. So mündet der Vergleich in eine beantwortbare Frage: Will man ein Sprachmodell mieten oder will man eines herunterladen?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

Zwei Dinge, die Sesame heißen, und nur eines davon lässt sich bauen

Die Namensgebung ist die Ursache für den größten Teil der Verwirrung, also trennen Sie sie, bevor Sie weitergehen.

• Sesame Preview — die App. Kostenlos nutzbar, Agenten namens Maya, Miles, Simone und Charlie, mehrstufige Konversation mit Kontext, der über die Turns hinweg erhalten bleibt, Websuche und Erinnerungen als Funktionen, nur Englisch, eine Obergrenze von 30 Minuten pro Anruf. Es gibt keine Entwickleroberfläche: nichts, wogegen man sich authentifizieren kann, nichts zum Abrechnen, kein Endpunkt zum Aufrufen.

• CSM-1B — der Checkpoint. Veröffentlicht auf Hugging Face unter sesame/csm-1b mit einer Apache-2.0-Lizenz, einem Llama-Backbone und einem kleineren Decoder, der Mimi-Audiocodes erzeugt. Rund 2 Milliarden Parameter, Englisch, F32-Gewichte, und es läuft über Hugging Face Transformers. Die Modellkarte verzeichnet, dass die 1B-Variante im März 2025 erschien und native Transformers-Unterstützung im Mai 2025 kam.

Diese beiden teilen sich ein Unternehmen und eine Forschungslinie, und damit hat es mit der Beziehung auch schon ungefähr sein Bewenden. Die App ist ein Produkt; der Checkpoint ist ein Artefakt aus der Forschung, die der App vorausging. Rezensenten, die das Konversationsgedächtnis der App loben, beschreiben ein System mit Retrieval und State-Management rund um ein Sprachmodell, nicht eine Eigenschaft des 2B-Checkpoints, den man herunterladen kann.

Was steckt eigentlich in dem Checkpoint?

CSM-1B ist im architektonischen Sinne, der für alle relevant ist, die planen, es auszuführen, ein Text-to-Speech-Modell: Es nimmt Text und Audiokontext als Eingabe und gibt RVQ-Audiocodes aus, die der Decoder in eine Wellenform umwandelt. Die praktischen Fakten aus der Modellkarte:

• Lizenz — Apache 2.0. Dies ist die bei Weitem folgenreichste Zeile auf der Seite. Anders als reine Forschungs-Lizenzen für Modellgewichte erlaubt Apache 2.0 die kommerzielle Nutzung ohne separate Vereinbarung, was CSM-1B zu einem der wenigen wirklich nutzbaren offenen Sprach-Checkpoints macht.

• Größe — etwa 2 Mrd. Parameter bei F32. Groß genug, dass für alles, was parallel läuft, echte Hardware nötig ist, klein genug, um für die Entwicklung auf einem einzelnen Beschleuniger zu laufen.

• Sprache — Englisch, laut der Karte. Kein mehrsprachiges Modell.

• Verbreitung — zum Zeitpunkt des Verfassens 141.461 Downloads im letzten Monat, bei rund 245.000 Likes auf dem Repository. Das ist nach Maßstäben offener Sprachmodelle ein weithin genutzter Checkpoint, und es ist das stärkste Argument dafür, dass das Artefakt eine echte Nutzerbasis hat, unabhängig von der Presse der App.

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

Was die Karte nicht liefert, ist eine Qualitätsaussage, die Sie mit irgendetwas vergleichen können. Es gibt keine Arena-Zeile, keinen von Dritten reproduzierten Anbieter-Benchmark und keine veröffentlichte Bewertung dazu, wie sich die Ausgabe des Checkpoints zur Ausgabe der App verhält. Wer Ihnen erzählt, das herunterladbare Modell klinge wie die App, leitet das lediglich aus dem Namen ab.

Warum es keinen Head-to-Head-Vergleich gibt und warum das keine Forschungslücke ist

Auf den Ranglisten gibt es keinen Vergleich zwischen Gemini 3.8 TTS und Sesame Preview, weil es keinen geben kann. Die Arena bewertet Modelle, indem Hörer Clips vergleichen, die von einem gehosteten Endpunkt erzeugt wurden. Eine Seite dieser Paarung hat keinen Endpunkt und kann daher nicht eingetragen werden.

Das ist es wert, präzise zu sein, denn „es gibt keinen Head-to-Head-Vergleich“ wird oft so dargestellt, als fehlten die Daten. Sie fehlen nicht. Sie sind undefiniert. Die beiden Dinge, die verglichen werden, haben keine gemeinsame messbare Oberfläche:

• Gemini 3.8 Flash TTS wird anhand seiner nativen gehosteten Stimmen bewertet. Sesame Preview hat in diesem Sinne keine nativen Stimmen, die bewertet werden könnten – es hat Agenten.

• Gemini 3.8 Flash TTS veröffentlicht eine Preisliste in Tokens. Sesame Preview ist kostenlos und veröffentlicht nichts, denn es gibt nichts abzurechnen.

• Gemini 3.8 Flash TTS nimmt ein Skript entgegen und gibt Audio zurück. Sesame Preview nimmt eine Konversation entgegen und gibt eine Konversation zurück – mit welcher Retrieval- und Memory-Schicht auch immer die App obendrauf legt.

Am nächsten an einen legitimen Vergleich heran kommt der zwischen Gemini 3.8 Flash TTS und CSM-1B, und selbst der ist ungleich: Das eine hat einen unabhängigen Elo-Wert und eine Preisliste des Anbieters, das andere hat beides nicht. Was man vergleichen kann, ist die Form der Bindung — eine API mit verbrauchsabhängiger Abrechnung gegenüber einem herunterladbaren Checkpoint — und dieser Vergleich braucht keine Rangliste.

Die einzige Seite hiervon, auf der Zahlen stehen

Alles Quantitative in dieser Paarung liegt auf Googles Seite – was selbst der Punkt ist.

Auf der Artificial Analysis Provider Voice Arena, erfasst am 24. September 2026, liegt Gemini 3.8 Flash TTS auf Rang 2 mit einem Elo von 1.260 über 1.999 Stichproben und 8 Arena-Stimmen, veröffentlicht am 23. September 2026. Sein Schwestermodell Gemini 3.8 Flash-Lite TTS liegt auf Rang 6 mit 1.235. Google berechnet für Flash TTS 0,50 $ pro Million eingegebene Text-Token und 9,00 $ pro Million ausgegebene Audio-Token bis zum 31. Dezember 2026, danach 18,00 $, wobei Flash-Lite TTS 0,50 $ und 6,00 $ kostet, danach 12,00 $; Artificial Analysis normalisiert diese auf 16,50 $ bzw. 11,00 $ pro Million Zeichen, damit sie in einer Rangliste mit Modellen verglichen werden können, die in anderen Einheiten abrechnen. Diese Normalisierung ist die Arithmetik der Rangliste, kein Google-Zitat.

Dagegen hat CSM-1B keinen Preis, weil es keinen Zähler hat. Es hat eine Downloadzahl, eine Lizenz und eine Parameteranzahl. Wenn dein Entscheidungsrahmen ein Elo benötigt, wird dieser Vergleich keines für die Sesame-Seite liefern, und die ehrliche Schlussfolgerung ist, dass die beiden Optionen nach unterschiedlichen Kriterien bewertet werden und nicht, dass eine von ihnen unbewiesen ist.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

Wenn du das App-Erlebnis wolltest

Viele Leute, die diesen Vergleich suchen, wählen überhaupt kein Modell. Sie haben die Sesame-App verwendet, mochten, wie sich die Konversation anfühlte, und wollen das in ihrem Produkt. Das ist ein anderes Problem, und der Download wird es nicht lösen.

Was dafür sorgt, dass sich die App so anfühlt, wie sie sich anfühlt, ist größtenteils nicht das Sprachmodell. Persistenter Kontext über Gesprächsrunden hinweg, die Entscheidung, mitten im Gespräch das Web zu durchsuchen, das Timing, wann ein Agent spricht – das ist Orchestrierung, und nichts davon steckt in einem 2B-Checkpoint. Wenn du CSM-1B herunterlädst, bekommst du eine Stimme. Das Verhalten der App darauf aufzubauen, ist deine Ingenieursleistung, und die 30-Minuten-Grenze für Anrufe und das Fehlen einer API bedeuten, dass du die fertige Version auch nicht mieten kannst.

Wenn du ein Sprachmodell wolltest, das du aufrufen kannst, dann ist die ehrliche Antwort, dass Gemini 3.8 Flash TTS die Option mit einer dokumentierten Schnittstelle, einem veröffentlichten Preis, einer unabhängigen Bewertung und Zwei-Sprecher-Dialog in einer einzigen Anfrage ist. Wenn du Gewichte wolltest, die du behalten kannst, ist CSM-1B unter Apache 2.0 von den beiden dasjenige, das du tatsächlich halten kannst – und der Kompromiss ist, dass du die Hardware, den Serving-Stack und jede Qualitätsgarantie selbst bereitstellst.

OrcaRouter hostet keines von beiden. Googles Modell wird über Googles eigene API und die in seiner Ankündigung vom 23. September genannten Oberflächen aufgerufen; CSM-1B ist ein Checkpoint, den Sie selbst ausführen. Wofür OrcaRouter gedacht ist, ist die Ebene über dieser Wahl: über 200 Modelle hinter einem einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, sodass eine Preisänderung eines Anbieters am selben Tag wirksam wird, automatisches Failover sodass eine experimentelle Route keine Produktionsabhängigkeit ist, und eine Routing-DSL, die Modelle zu einem einzigen Aufruf zusammenführt, wenn eine einzelne Stimme nicht die ganze Aufgabe abdeckt.

Die Kurzfassung dieses Vergleichs ist, dass es eigentlich kein Vergleich ist. Die eine Seite hat eine Preisliste und einen Elo-Wert; die andere hat eine Lizenz und eine Downloadzahl. Nimm die, deren Spalte du tatsächlich ausfüllen kannst.