Eine generierte Hero-Karte für „Gemini 3.8 Live with Live Avatar“ auf weißem Hintergrund mit sanften blau- und cyanfarbenen Gradientakzenten. Drei gestapelte Karten zeigen: „15. Sept. 2026 — Gemini 3.8 Live und 3.8 Live Extended Thinking erscheinen auf der Live API“, „24. Sept. 2026 — Live Avatar angekündigt, Gemini Enterprise“ und „Heute — Avatar ist eine Enterprise-Fähigkeit, keine Modell-ID“. Eine Fußzeile lautet: „Termine laut Google DeepMind.“ Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Gemini 3.8 Live mit Live Avatar: Google verpasst seinem Sprachmodell ein Gesicht

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking wurden am 15. September 2026 veröffentlicht — die beiden nativen Live-Dialog-Endpunkte, die Google in der API des Anbieters freigeschaltet hat, einer auf Latenz optimiert und einer auf eingehendes Abwägen. Am 24. September kündigte das Unternehmen Gemini 3.8 Live mit Live Avatar an, das nahezu Echtzeit-Videogenerierung mit derselben Sprachschleife kombiniert, sodass das Modell ein Gesicht hat, während es spricht. An den beiden Modell-IDs hat sich nichts geändert. Geändert hat sich, wie das Gespräch aussehen darf, und — was noch weitreichender ist — was das Modell mit dem Gespräch tun darf, während es noch läuft.

Was wurde am 24. September tatsächlich ausgeliefert?

Der DeepMind-Beitrag ist kurz und konkret, und es lohnt sich, zu trennen, was er behauptet, von dem, was er bedeutet. Live Avatar, in Googles eigenen Worten, „verleiht der konversationellen KI von Gemini eine visuelle Präsenz nahezu in Echtzeit“, indem es Echtzeit-Videogenerierung mit dem bestehenden Sprach-Stack kombiniert. Das Unternehmen beschreibt präzise Lippensynchronisation, natürliche Mimik und flüssigen Sprecherwechsel und nennt zwei Einsatzbeispiele: Kundenservice und interaktive Walkthroughs. Dann folgt der Satz, der für alle, die einen Build planen, am wichtigsten ist – „Ab heute ist Gemini 3.8 Live mit Live Avatar in Gemini Enterprise verfügbar.“

Das ist die ganze Verfügbarkeitsgeschichte. Live Avatar ist keine Gemini-API-Modell-ID. Die Audiomodell-Liste der API enthält weiterhin gemini-3.8-live und gemini-3.8-live-extended-thinking und keine Avatar-Zeile, und die Preistafel enthält keinen Posten für Avatare. Das Feature kommt innerhalb von Gemini Enterprise, was bedeutet, dass das Publikum für die Ankündigung Unternehmenskäufer und die Entwickler sind, die in deren Auftrag integrieren, nicht der einzelne Entwickler, der heute die Live API mit einem Schlüssel aufruft.

Zwei der Behauptungen im Beitrag sind es wert, genau zitiert zu werden, denn beide sind stärker als die übliche Sprache bei Produktstarts. Die erste: Live Avatar „bietet native mehrsprachige Sprach-zu-Sprach-Synchronisation“ und „kann nahtlos zwischen 97 Sprachen wechseln, ohne die Videoqualität zu beeinträchtigen oder visuellen Drift zu verursachen.“ Die Zahl 97 entspricht derselben Sprachenanzahl, die die Markteinführung am 15. September für die zugrunde liegenden Live-Dialogmodelle beansprucht hat, es handelt sich also um die bestehende Mehrsprachigkeitsbehauptung, neu formuliert mit einer zusätzlichen Einschränkung – die Lippensynchronisation und die Gesichtsanimation müssen mithalten, wenn die Sprache mitten im Satz wechselt. Die zweite: Alle Ausgaben sind mit SynthID wassergezeichnet, „direkt in die Audio- und Videoausgabe eingewoben“. Beide Spuren, nicht nur die Stimme.

Die wirklich neue Fähigkeit ist die in der Mitte.

Wenn man über die visuellen Aspekte hinwegliest, ist der interessanteste Absatz der über Tool-Aufrufe. Goog​le sagt, Live Avatar basiere auf „asynchronem Tool-Calling“, das „Tool-Aufrufe auslösen und Daten im Hintergrund abrufen kann, während der aktive Dialog fortgesetzt wird, und dabei komplexe Aufgaben bewältigt, während ein ununterbrochener Gesprächsfluss sichergestellt wird“. Das konkrete Beispiel ist der Check-in eines Hotelgastes, bei dem das Modell im Hintergrund Tools aufruft und weiter redet.

Das ist ein echter architektonischer Unterschied zu der Request-Response-Form, auf die die meisten Voice-Integrationen ausgelegt sind, und es ist der Teil, der mit Kosten verbunden ist. Asynchrone Ausführung bedeutet, dass das Modell Arbeit verrichtet, die das Transkript nicht zeigt. In einer Text-Pipeline würden Sie den Tool-Aufruf als einen Turn sehen. Hier geschieht er unterhalb einer Konversation, die noch läuft, was dieselben Fragen aufwirft, die jede nebenläufige Ausführung aufwirft: Was passiert, wenn der Tool-Aufruf mitten im Satz stillschweigend fehlschlägt, und woher weiß die anrufende Person davon? Googles Beitrag sagt es nicht, und die Model Card ist die Stelle, an der man danach suchen sollte. Behandeln Sie die Behauptung vom „ununterbrochenen Gesprächsfluss“ als vom Anbieter berichtet und von keiner uns auffindbaren dritten Partei getestet.

Voreingestellte Avatare und die Allowlist, die die interessante Hälfte einschränkt

Die Individualisierung hat zwei Stufen, und nur eine davon ist allgemein verfügbar. Jede Unternehmensbereitstellung erhält „eine Bibliothek vielfältiger, voreingestellter Avatare“. Benutzerdefinierte Avatare – die „aus einem hochwertigen Referenzbild“ generiert werden und dabei „Referenzähnlichkeit, Markenstil oder Charakteridentität bewahren“ – sind hinter einer Zugangssperre, und Goog​le sagt es unverblümt: „Die Erstellung benutzerdefinierter Avatare ist derzeit nur über Enterprise-Allowlisting verfügbar.“

Die Fähigkeit, die die meisten Teams tatsächlich wollen, nämlich die, mit der ein Avatar zu einer Marke oder einer namentlich genannten Figur passen kann, ist genau die, die man nicht im Self-Service nutzen kann. Wenn Ihr Plan von einem synthetischen Presenter abhängt, der wie Ihr Maskottchen aussieht, warten Sie auf eine Allowlist-Entscheidung und nicht auf ein Modell-Release. Das ist eine Beschaffungstatsache, keine technische, und es ist die Art von Sache, die einem still und leise ein Quartal nach hinten verschiebt.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

Wo es im Verhältnis zum Rest der Zeile sitzt

Der Live Avatar kam nicht in eine leere Produktfamilie, und die Position, die er einnimmt, lässt sich am leichtesten im Vergleich zu den Geschwistern erkennen, die in derselben Zeitspanne von zwei Wochen auf den Markt kamen.

• Wird bereitgestellt als — Gemini 3.8 Live mit Live Avatar ist eine Enterprise-Funktion innerhalb von Gemini Enterprise, im Gegensatz dazu sind Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking Gemini-API-Endpunkte mit Modell-IDs und veröffentlichten Minutentarifen
• Von Entwicklern aufrufbar — Live Avatar nein, keine Modell-ID und keine Tarifzeile; im Gegensatz dazu die beiden Live-Endpunkte: ja, gemini-3.8-live und gemini-3.8-live-extended-thinking
• Ausgabe — Live Avatar Audio plus synchronisiertes Video; im Gegensatz dazu die Live-Endpunkte nur Audio
• Sprachangabe — Live Avatar 97 Sprachen mit Lip-Sync und Ausdruckskontinuität; im Gegensatz dazu die Live-Endpunkte 97 Sprachen mit automatischer Umschaltung mitten im Gespräch
• Wasserzeichen — Live Avatar SynthID sowohl auf der Audio- als auch auf der Videospur; im Gegensatz dazu die Live-Endpunkte SynthID auf generiertem Audio

Die beiden Live-Endpunkte selbst sind das gut dokumentierte Paar. Unabhängige Messungen zeigen sie auf manchen Achsen weit auseinander und auf anderen dicht beieinander: Im Artificial Analysis Speech to Speech Index liegt Gemini 3.8 Live Extended Thinking (High) bei 82,6 gegenüber Gemini 3.8 Live bei 76,0 – eine Lücke, die überwiegend auf der Qualität des logischen Schlussfolgerns statt auf der Gesprächsdynamik beruht, wobei sich bei Letzterer die Reihenfolge umkehrt. Die eigenen Zahlen von Google weisen sie mit 68,6 % und 30,1 % bei der Aufgabenabschlussrate von τ-Voice und mit 98 % und 92 % bei Big Bench Audio aus. Live Avatar erbt jeweils denjenigen der beiden, den man darunter aufruft, und erbt auch dessen Preisgestaltung, denn der Avatar ist eine Präsentationsschicht über derselben Konversationsschleife.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

Was dies nicht ändert

Es macht die Modelle nicht besser. Live Avatar ist eine Präsentations- und Orchestrierungsschicht: Die Qualitätswerte für Gemini 3.8 Live sind die, die sie am 15. September waren, und wer die stärkere der beiden Varianten braucht, muss weiterhin Extended Thinking wählen und dessen Latenz akzeptieren. Es bringt kein Video in die API. Und es ändert nichts am Preis für das Sprechen mit dem Modell, der weiterhin nach den Minuten-Audio-Tarifen der Live API abgerechnet wird — $0.005 pro Minute Audio-Eingang und $0.018 pro Minute Audio-Ausgang —, wobei die Videogenerierung des Avatars öffentlich nicht bepreist ist, weil sie nicht separat verkauft wird.

Was es verändert, ist die Menge an Produkten, die ohne eine separate Rendering-Schicht gebaut werden können. Ein Support-Agent, der zuvor sprach und ein leeres Panel auf dem Bildschirm zurückließ, kann nun ein Gesicht halten, während er arbeitet, und die Arbeit, die er im Hintergrund verrichtet, ist nicht mehr als tote Luft sichtbar. Das ist eine bedeutende Veränderung der Gestalt einer Schnittstelle und eine maßvolle Veränderung des zugrunde liegenden Modells. Beides kann gleichzeitig wahr sein.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

Worauf zu achten ist, und ein Hinweis zum Routing

Drei Dinge würden dies von einer Ankündigung zu einer Entscheidung für den Bau machen. Das Allowlisting für benutzerdefinierte Avatare müsste geöffnet werden, denn voreingestellte Avatare sind eine Demo und benutzerdefinierte Avatare sind ein Produkt. Der Video-Track müsste einen Preis bekommen, denn niemand kann die Unit Economics auf einem nicht bepreisten Output modellieren. Und ein Avatar-Endpunkt müsste in der Modellliste der API auftauchen, denn das ist der Unterschied zwischen einer Enterprise-Funktion und etwas, das ein Entwickler heute Abend aufrufen kann.

Auf unserer eigenen Seite gibt es einen Punkt, der präzise benannt werden sollte, weil man leicht das Gegenteil annimmt: OrcaRouter routet die Gemini 3.8 Live-Endpunkte oder Live Avatar nicht, und nichts hier sollte als Behauptung gelesen werden, dass er es doch täte. Was wir anbieten, ist der Rest von Googles 3.8-Reihe – google/gemini-3.8-flash unter anderem – zusammen mit einem Katalog von mehr als 200 Modellen über einen einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlag. Wenn Live Avatar Ihre Architektur in Richtung eines Agenten lenkt, der darüber nachdenken muss, was der Kunde gesagt hat, dann ist die Reasoning-Hälfte dieses Stacks die Hälfte, die Sie heute konsolidieren können.