
Gemini 3.8 Live mit Live Avatar: Google verpasst seinem Sprachmodell ein Gesicht
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 36 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 181 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking wurden am 15. September 2026 veröffentlicht — die beiden nativen Live-Dialog-Endpunkte, die Google in der API des Anbieters freigeschaltet hat, einer auf Latenz optimiert und einer auf eingehendes Abwägen. Am 24. September kündigte das Unternehmen Gemini 3.8 Live mit Live Avatar an, das nahezu Echtzeit-Videogenerierung mit derselben Sprachschleife kombiniert, sodass das Modell ein Gesicht hat, während es spricht. An den beiden Modell-IDs hat sich nichts geändert. Geändert hat sich, wie das Gespräch aussehen darf, und — was noch weitreichender ist — was das Modell mit dem Gespräch tun darf, während es noch läuft.
Was wurde am 24. September tatsächlich ausgeliefert?
Der DeepMind-Beitrag ist kurz und konkret, und es lohnt sich, zu trennen, was er behauptet, von dem, was er bedeutet. Live Avatar, in Googles eigenen Worten, „verleiht der konversationellen KI von Gemini eine visuelle Präsenz nahezu in Echtzeit“, indem es Echtzeit-Videogenerierung mit dem bestehenden Sprach-Stack kombiniert. Das Unternehmen beschreibt präzise Lippensynchronisation, natürliche Mimik und flüssigen Sprecherwechsel und nennt zwei Einsatzbeispiele: Kundenservice und interaktive Walkthroughs. Dann folgt der Satz, der für alle, die einen Build planen, am wichtigsten ist – „Ab heute ist Gemini 3.8 Live mit Live Avatar in Gemini Enterprise verfügbar.“
Das ist die ganze Verfügbarkeitsgeschichte. Live Avatar ist keine Gemini-API-Modell-ID. Die Audiomodell-Liste der API enthält weiterhin gemini-3.8-live und gemini-3.8-live-extended-thinking und keine Avatar-Zeile, und die Preistafel enthält keinen Posten für Avatare. Das Feature kommt innerhalb von Gemini Enterprise, was bedeutet, dass das Publikum für die Ankündigung Unternehmenskäufer und die Entwickler sind, die in deren Auftrag integrieren, nicht der einzelne Entwickler, der heute die Live API mit einem Schlüssel aufruft.
Zwei der Behauptungen im Beitrag sind es wert, genau zitiert zu werden, denn beide sind stärker als die übliche Sprache bei Produktstarts. Die erste: Live Avatar „bietet native mehrsprachige Sprach-zu-Sprach-Synchronisation“ und „kann nahtlos zwischen 97 Sprachen wechseln, ohne die Videoqualität zu beeinträchtigen oder visuellen Drift zu verursachen.“ Die Zahl 97 entspricht derselben Sprachenanzahl, die die Markteinführung am 15. September für die zugrunde liegenden Live-Dialogmodelle beansprucht hat, es handelt sich also um die bestehende Mehrsprachigkeitsbehauptung, neu formuliert mit einer zusätzlichen Einschränkung – die Lippensynchronisation und die Gesichtsanimation müssen mithalten, wenn die Sprache mitten im Satz wechselt. Die zweite: Alle Ausgaben sind mit SynthID wassergezeichnet, „direkt in die Audio- und Videoausgabe eingewoben“. Beide Spuren, nicht nur die Stimme.
Die wirklich neue Fähigkeit ist die in der Mitte.
Wenn man über die visuellen Aspekte hinwegliest, ist der interessanteste Absatz der über Tool-Aufrufe. Google sagt, Live Avatar basiere auf „asynchronem Tool-Calling“, das „Tool-Aufrufe auslösen und Daten im Hintergrund abrufen kann, während der aktive Dialog fortgesetzt wird, und dabei komplexe Aufgaben bewältigt, während ein ununterbrochener Gesprächsfluss sichergestellt wird“. Das konkrete Beispiel ist der Check-in eines Hotelgastes, bei dem das Modell im Hintergrund Tools aufruft und weiter redet.
Das ist ein echter architektonischer Unterschied zu der Request-Response-Form, auf die die meisten Voice-Integrationen ausgelegt sind, und es ist der Teil, der mit Kosten verbunden ist. Asynchrone Ausführung bedeutet, dass das Modell Arbeit verrichtet, die das Transkript nicht zeigt. In einer Text-Pipeline würden Sie den Tool-Aufruf als einen Turn sehen. Hier geschieht er unterhalb einer Konversation, die noch läuft, was dieselben Fragen aufwirft, die jede nebenläufige Ausführung aufwirft: Was passiert, wenn der Tool-Aufruf mitten im Satz stillschweigend fehlschlägt, und woher weiß die anrufende Person davon? Googles Beitrag sagt es nicht, und die Model Card ist die Stelle, an der man danach suchen sollte. Behandeln Sie die Behauptung vom „ununterbrochenen Gesprächsfluss“ als vom Anbieter berichtet und von keiner uns auffindbaren dritten Partei getestet.
Voreingestellte Avatare und die Allowlist, die die interessante Hälfte einschränkt
Die Individualisierung hat zwei Stufen, und nur eine davon ist allgemein verfügbar. Jede Unternehmensbereitstellung erhält „eine Bibliothek vielfältiger, voreingestellter Avatare“. Benutzerdefinierte Avatare – die „aus einem hochwertigen Referenzbild“ generiert werden und dabei „Referenzähnlichkeit, Markenstil oder Charakteridentität bewahren“ – sind hinter einer Zugangssperre, und Google sagt es unverblümt: „Die Erstellung benutzerdefinierter Avatare ist derzeit nur über Enterprise-Allowlisting verfügbar.“
Die Fähigkeit, die die meisten Teams tatsächlich wollen, nämlich die, mit der ein Avatar zu einer Marke oder einer namentlich genannten Figur passen kann, ist genau die, die man nicht im Self-Service nutzen kann. Wenn Ihr Plan von einem synthetischen Presenter abhängt, der wie Ihr Maskottchen aussieht, warten Sie auf eine Allowlist-Entscheidung und nicht auf ein Modell-Release. Das ist eine Beschaffungstatsache, keine technische, und es ist die Art von Sache, die einem still und leise ein Quartal nach hinten verschiebt.

Wo es im Verhältnis zum Rest der Zeile sitzt
Der Live Avatar kam nicht in eine leere Produktfamilie, und die Position, die er einnimmt, lässt sich am leichtesten im Vergleich zu den Geschwistern erkennen, die in derselben Zeitspanne von zwei Wochen auf den Markt kamen.
• Wird bereitgestellt als — Gemini 3.8 Live mit Live Avatar ist eine Enterprise-Funktion innerhalb von Gemini Enterprise, im Gegensatz dazu sind Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking Gemini-API-Endpunkte mit Modell-IDs und veröffentlichten Minutentarifen
• Von Entwicklern aufrufbar — Live Avatar nein, keine Modell-ID und keine Tarifzeile; im Gegensatz dazu die beiden Live-Endpunkte: ja, gemini-3.8-live und gemini-3.8-live-extended-thinking
• Ausgabe — Live Avatar Audio plus synchronisiertes Video; im Gegensatz dazu die Live-Endpunkte nur Audio
• Sprachangabe — Live Avatar 97 Sprachen mit Lip-Sync und Ausdruckskontinuität; im Gegensatz dazu die Live-Endpunkte 97 Sprachen mit automatischer Umschaltung mitten im Gespräch
• Wasserzeichen — Live Avatar SynthID sowohl auf der Audio- als auch auf der Videospur; im Gegensatz dazu die Live-Endpunkte SynthID auf generiertem Audio
Die beiden Live-Endpunkte selbst sind das gut dokumentierte Paar. Unabhängige Messungen zeigen sie auf manchen Achsen weit auseinander und auf anderen dicht beieinander: Im Artificial Analysis Speech to Speech Index liegt Gemini 3.8 Live Extended Thinking (High) bei 82,6 gegenüber Gemini 3.8 Live bei 76,0 – eine Lücke, die überwiegend auf der Qualität des logischen Schlussfolgerns statt auf der Gesprächsdynamik beruht, wobei sich bei Letzterer die Reihenfolge umkehrt. Die eigenen Zahlen von Google weisen sie mit 68,6 % und 30,1 % bei der Aufgabenabschlussrate von τ-Voice und mit 98 % und 92 % bei Big Bench Audio aus. Live Avatar erbt jeweils denjenigen der beiden, den man darunter aufruft, und erbt auch dessen Preisgestaltung, denn der Avatar ist eine Präsentationsschicht über derselben Konversationsschleife.

Was dies nicht ändert
Es macht die Modelle nicht besser. Live Avatar ist eine Präsentations- und Orchestrierungsschicht: Die Qualitätswerte für Gemini 3.8 Live sind die, die sie am 15. September waren, und wer die stärkere der beiden Varianten braucht, muss weiterhin Extended Thinking wählen und dessen Latenz akzeptieren. Es bringt kein Video in die API. Und es ändert nichts am Preis für das Sprechen mit dem Modell, der weiterhin nach den Minuten-Audio-Tarifen der Live API abgerechnet wird — $0.005 pro Minute Audio-Eingang und $0.018 pro Minute Audio-Ausgang —, wobei die Videogenerierung des Avatars öffentlich nicht bepreist ist, weil sie nicht separat verkauft wird.
Was es verändert, ist die Menge an Produkten, die ohne eine separate Rendering-Schicht gebaut werden können. Ein Support-Agent, der zuvor sprach und ein leeres Panel auf dem Bildschirm zurückließ, kann nun ein Gesicht halten, während er arbeitet, und die Arbeit, die er im Hintergrund verrichtet, ist nicht mehr als tote Luft sichtbar. Das ist eine bedeutende Veränderung der Gestalt einer Schnittstelle und eine maßvolle Veränderung des zugrunde liegenden Modells. Beides kann gleichzeitig wahr sein.

Worauf zu achten ist, und ein Hinweis zum Routing
Drei Dinge würden dies von einer Ankündigung zu einer Entscheidung für den Bau machen. Das Allowlisting für benutzerdefinierte Avatare müsste geöffnet werden, denn voreingestellte Avatare sind eine Demo und benutzerdefinierte Avatare sind ein Produkt. Der Video-Track müsste einen Preis bekommen, denn niemand kann die Unit Economics auf einem nicht bepreisten Output modellieren. Und ein Avatar-Endpunkt müsste in der Modellliste der API auftauchen, denn das ist der Unterschied zwischen einer Enterprise-Funktion und etwas, das ein Entwickler heute Abend aufrufen kann.
Auf unserer eigenen Seite gibt es einen Punkt, der präzise benannt werden sollte, weil man leicht das Gegenteil annimmt: OrcaRouter routet die Gemini 3.8 Live-Endpunkte oder Live Avatar nicht, und nichts hier sollte als Behauptung gelesen werden, dass er es doch täte. Was wir anbieten, ist der Rest von Googles 3.8-Reihe – google/gemini-3.8-flash unter anderem – zusammen mit einem Katalog von mehr als 200 Modellen über einen einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlag. Wenn Live Avatar Ihre Architektur in Richtung eines Agenten lenkt, der darüber nachdenken muss, was der Kunde gesagt hat, dann ist die Reasoning-Hälfte dieses Stacks die Hälfte, die Sie heute konsolidieren können.
