Eine generierte Hero-Karte für „Gemini 3.8 Live vs. Gemini 3.8 TTS" auf weißem Hintergrund mit weichen blau-cyanfarbenen Farbverlaufsakzenten. Eine linke Spalte mit der Überschrift „Wird über die Live API ausgeliefert" listet „gemini-3.8-live", „hört und spricht", „Audio rein, Audio raus" auf; eine rechte Spalte mit der Überschrift „Wird über die TTS-Endpunkte ausgeliefert" listet „gemini-3.8-flash-tts", „liest geschriebenen Text", „Text rein, Audio raus" auf. Eine Fußzeile lautet: „Keines davon heißt Gemini 3.8 TTS." Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Gemini 3.8 Live vs. Gemini 3.8 TTS: Eine Konversationsschleife und eine Vorlesestimme teilen sich einen Generationsnamen

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Gemini 3.8 Live ist ein Speech-to-Speech-Modell, das am 15. September 2026 als gemini-3.8-live und gemini-3.8-live-extended-thinking veröffentlicht wurde. „Gemini 3.8 TTS“ ist überhaupt kein Modell – es ist der Sammelbegriff, den die Launch-Berichterstattung, einschließlich des eigenen Beitragstitels von Google, für das Paar von Text-to-Speech-Endpunkten verwendet, die am 23. September 2026 als gemini-3.8-flash-tts und gemini-3.8-flash-lite-tts erschienen sind. Das ist also keine übliche Versus-Seite, auf der zwei Produkte um eine Aufgabe kämpfen. Es ist eine Seite über zwei Aufgaben, die sich eine Generationsnummer teilen, und über den konkreten Fehler, den Leute machen, wenn sie die Wörter „Live“ und „TTS“ als zwei Varianten derselben Sache behandeln.

Der Fork, den die gemeinsame Generationsnummer verbirgt

Googles Dokumentation zur Sprachgenerierung zieht selbst die Grenze, und der Satz ist leicht zu überlesen: „Die TTS-Funktion unterscheidet sich von der Sprachgenerierung, die über die Live API bereitgestellt wird.“ Dieselbe Passage erklärt, warum, und der Grund ist struktureller Natur, nicht eine Frage der Qualität. Die Live API ist für „interaktives, unstrukturiertes Audio sowie multimodale Ein- und Ausgaben“ ausgelegt. TTS über die Gemini API „ist auf Szenarien zugeschnitten, die eine exakte Textrezitation mit feingranularer Steuerung erfordern.“ Ein späterer Hinweis macht die Eingabeform explizit: Die TTS-Modelle nehmen nur Text entgegen und geben nur Audio zurück.

Diese einzige Einschränkung – Text rein, Audio raus, kein Audio-Eingang – ist der gesamte Vergleich. Ein Gemini 3.8 Live-Modell hört die Person, die mit ihm spricht. Ein Gemini 3.8 Flash TTS- oder Flash-Lite TTS-Modell hört nie jemanden; es liest eine Zeichenkette und trägt sie vor. Alles Weitere folgt daraus: Die Benchmarks, die für das eine existieren, sind für das andere bedeutungslos, die Preisgestaltung wird in unterschiedlichen Einheiten abgerechnet, und die Fehlermodi sind überhaupt nicht vergleichbar.

Das ist wichtig, weil die beiden Anwendungsfälle von außen identisch aussehen. Ein Voice-Agent und eine Narration-Pipeline geben am Ende beide menschlich klingende Sprache aus. Nur eine von ihnen kann unterbrochen werden.

Wo „Gemini 3.8 TTS" tatsächlich aufgelöst wird

Öffne die Tabelle der unterstützten Modelle für die Sprachgenerierung der Gemini API und du findest vier TTS-Einträge und keinen Eintrag namens Gemini 3.8 TTS. Zwei davon gehören zu dieser Generation: Gemini 3.8 Flash TTS, Modell-ID gemini-3.8-flash-tts, mit 130 Sprachen, und Gemini 3.8 Flash-Lite TTS, Modell-ID gemini-3.8-flash-lite-tts, mit 101 Sprachen. Die anderen beiden – Gemini 3.1 Flash TTS Preview und Gemini 2.5 Pro Preview TTS – sind die Preview-Generation, die Flash-Lite ersetzt.

Wenn jemand also „Gemini 3.8 TTS“ sagt, meint er normalerweise den Flash-Tier, denn das ist der, den der Launch-Post zuerst nennt und den das Arena-Board am höchsten einstuft. Wenn man es über einen Live-Sprachagenten sagt, bezieht man sich auf nichts, denn das, was man will, liegt auf einem anderen Endpunkt mit einem anderen Namen und einem anderen Eingabekontrakt.

Es gibt eine dritte Kollision, die es wert ist, benannt zu werden, denn sie bringt die schlechtesten Ratschläge hervor. Gemini 3.8 Live ist kein Text-to-Speech-Modell mit Zusatzfunktionen. Es ist ein Speech-to-Speech-Modell, und der Grund, warum es pro Einheit mehr kostet, ist, dass es pro Einheit mehr Arbeit leistet: Zuhören, Schlussfolgern mitten in der Äußerung, Umgang mit Unterbrechungen und – in der Variante Extended Thinking – Abwägen, bevor es antwortet.

Die einzige Nummer, die wirklich vergleicht

Qualitätswerte lassen sich nicht zwischen diesen beiden Familien übertragen; es gibt kein einzelnes Board, das einen Erzähler und einen Gesprächspartner auf derselben Achse bewertet. Geld lässt sich durchaus übertragen, sobald man die Einheit ehrlich wählt, und die ehrliche Einheit für alles, was Stimme betrifft, ist die Audio-Stunde.

• Abrechnung nach Eingabe — Gemini 3.8 Live wird pro Minute Audio abgerechnet, 0,005 $ pro Minute Eingang und 0,018 $ pro Minute Ausgang, gegenüber Gemini 3.8 Flash TTS, das pro Million Audio-Tokens abgerechnet wird, 9,00 $ bis zum 31. Dezember 2026 und 18,00 $ danach
• Abrechnung nach Ausgabe — Gemini 3.8 Live kostet für Zwei-Wege-Audio zum Listenpreis etwa 1,38 $ für eine Stunde gleichzeitiger Ein- und Ausgabe, vor jeglichem Prompt-Caching, gegenüber Gemini 3.8 Flash TTS, das ein Einweg-Stream ist, und eine Million Zeichen fertiger Sprachausgabe kommen nach der Normalisierung von Artificial Analysis auf 16,5 $
• Texteingabe — Gemini 3.8 Live rechnet Text und Audio auf getrennten Posten ab, 0,75 $ pro Million Text-Tokens Eingang und 4,50 $ Ausgang, gegenüber den TTS-Endpunkten, die Texteingabe mit 0,50 $ pro Million Tokens abrechnen
• Flash-Lite-Stufe — Gemini 3.8 Live hat kein günstigeres Geschwistermodell; die Wahl ist Live oder Extended Thinking, gegenüber Gemini 3.8 Flash-Lite TTS, das mit 6,00 $ und dann 12,00 $ pro Million Audio-Tokens gelistet ist, mit Artificial Analysis bei 11,0 $ pro Million Zeichen
• Eingabeform — Gemini 3.8 Live Audio, Video und Text ein, Audio aus, gegenüber den TTS-Endpunkten Text ein, Audio aus

Die Live-Zahl ist unsere eigene Berechnung auf Basis von Googles veröffentlichten Minutenpreisen, nicht eine von Google veröffentlichte Stundenangabe. Die Zeichenwerte stammen aus der Normalisierung von Artificial Analysis und sind diejenigen, die man zitieren sollte, wenn man Synthese-Stufen vergleicht. Beachten Sie, dass das eigene Speech to Speech-Board von Artificial Analysis für die Live-Modelle eine separate Spalte mit den Kosten pro Stunde Eingangsaudio enthält – rund $3.50 für Gemini 3.8 Live und $0.84 für die Extended Thinking-Variante –, was wiederum eine andere Normalisierung ist und nicht gegen die Minutenpreisliste aufgestellt werden sollte, als wären die beiden dieselbe Messgröße.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

Was geht kaputt, wenn du das Falsche wählst

Die Fehlermodi sind aufschlussreich, weil sie so verschieden sind.

Rufen Sie einen TTS-Endpunkt auf, wenn Sie eigentlich eine Konversationsschleife bräuchten – und nichts schlägt fehl. Die Anfrage liefert gültiges Audio zurück. Sie erhalten eine flüssige, gut vorgelesene Antwort auf eine feste Zeichenfolge und dann Stille – weil nie etwas zugehört hat. Teams entdecken das, wenn sie ihren ersten Barge-in-Test bauen und feststellen, dass der „Nutzer“ warten muss, bis der vollständige Clip zu Ende ist, bevor der nächste Turn beginnen kann. Eine Konversation nachträglich auf einen Synthese-Endpunkt nachzurüsten bedeutet, Spracherkennung, eine Turn-Taking-Strategie und einen Unterbrechungsmechanismus darum herum zu ergänzen – und dann hat man eine Kaskade neu aufgebaut und bezahlt für zwei Modelle statt für eines.

Rufen Sie einen Live-Endpoint auf, wenn Sie Erzählung brauchen – und schon zahlen Sie für eine Fähigkeit, die Sie nicht nutzen. Ein Live-Modell wird in beide Richtungen abgerechnet, weil es beide Richtungen erwartet. Bei einem Hörbuch oder einem Voiceover für ein Trainingsvideo ist die Eingabeseite ein Skript, das sich nie ändert, und das Modell muss nie etwas hören. Sie kaufen eine Konversationsschleife, um ein Dokument laut vorzulesen.

Der eine Fall, in dem die Wahl wirklich schwierig ist, ist die Kaskade: Erkennung, dann Reasoning, dann Synthese. Diese Architektur ist nicht obsolet, und für viele Produktionssysteme ist sie immer noch die richtige, weil sie es dir erlaubt, jede Stufe unabhängig auszutauschen und für jede einen anderen Anbieter zu wählen. Sie kostet dich Latenz, und sie kostet dich die Prosodie, die ein einzelnes End-to-End-Modell über eine Turn-Grenze hinweg beibehält. Der Trade-off ist in beide Richtungen real.

Wo die Route bereits existiert

OrcaRouter bietet weder die Gemini 3.8 Live-Endpunkte noch die 3.8 TTS-Endpunkte an, und das sollte vor allem anderen zum Routing gesagt werden, denn bei einem so breiten Katalog liegt die gegenteilige Annahme nahe. Was der Katalog aber sehr wohl enthält, ist der Rest der Familie — google/gemini-3.8-flash gehört zu den 28 Google-Modellen und zu über 200 Modellen insgesamt, mit einem einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlag.

Das ist speziell für die Kaskade wichtig. Wenn Ihre Architektur aus Erkennung, dann Reasoning und dann Synthese besteht, ist die Reasoning-Stufe diejenige, in der sich ein einzelner Schlüssel über viele Anbieter hinweg auszahlt, denn sie ist die Stufe, die Sie am häufigsten austauschen, und die Stufe, bei der eine Preissenkung eines Anbieters noch am selben Tag auf Ihrer Rechnung ankommen sollte statt erst bei der nächsten Vertragsverlängerung. Sie ist außerdem die Stufe, in der sich automatisches Failover bezahlt macht: Eine Kaskade hat drei Stellen, an denen sie brechen kann, und die mittlere ist am günstigsten redundant auszulegen.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

Eine kurze Entscheidungsregel

Wenn das Modell auf etwas reagieren muss, das ihm nicht bereits als Text vorliegt, möchten Sie Gemini 3.8 Live, und Sie sollten mit Googles Minutenpreisen für Audio kalkulieren und damit rechnen, dass Sie darüber nachdenken müssen, welche der beiden Varianten Sie brauchen. Wenn der Text bereits geschrieben ist und die Aufgabe darin besteht, ihn vorzutragen, möchten Sie Gemini 3.8 Flash TTS oder Flash-Lite TTS, und Sie sollten pro Million Zeichen kalkulieren und die Stufe nach Sprachabdeckung auswählen und danach, ob die Qualitätslücke den Preisunterschied wert ist.

Und wenn Sie gebeten werden, „Gemini 3.8 Live und Gemini 3.8 TTS“ zu vergleichen, als wären es zwei Produkte, ist das erste Sinnvolle, was Sie tun können, zu fragen, welcher Endpunkt gemeint ist. Der Name im Briefing lässt sich nicht eindeutig einem einzigen zuordnen, und die Antwort verändert die Architektur, nicht nur die Rechnung.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.