
Gemini 3.8 Live Extended Thinking vs. Gemini 3.8 Live: Das Vierfache für die 38 Punkte zahlen, auf die es ankommt
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zwei Modelle, ein Launch, eine Preisliste und eine Entscheidung, die die meisten Berichte in dieselbe Richtung falsch darstellen. Gemini 3.8 Live Extended Thinking und Gemini 3.8 Livewurden gemeinsam am 15. September 2026 veröffentlicht, beide basieren auf Gemini 3 Pro, beide unterstützen 97 Sprachen mit automatischem Wechsel mitten im Gespräch, beide nehmen visuelle Eingaben nahezu in Echtzeit entgegen, beide versehen generiertes Audio mit SynthID mit einem Wasserzeichen. Im zusammengesetzten Speech-to-Speech-Index, den Artificial Analysis veröffentlicht, liegen sie 6,6 Punkte auseinander – 82,6 gegenüber 76,0. Bei den stündlichen Audiokosten, die dasselbe Board misst, liegen sie etwas mehr als viermal auseinander.
Keine der beiden ist die Zahl, die Ihre Architektur bestimmen sollte. Die Zahl, die es sollte, ist 38: die Lücke zwischen den beiden bei τ-Voice, der agentischen Task-Completion-Komponente, bei der die Reasoning-Variante 68,6 % der simulierten Kundenservice-Szenarien löst und die Standardvariante 30,1 %. Sie entscheiden sich nicht zwischen einem guten Modell und einem besseren. Sie entscheiden sich zwischen einer konversationellen Schnittstelle und einem Reasoning-System, das eben auch spricht, und der Preisunterschied ist das am wenigsten Interessante an dieser Entscheidung.
Die Preisspanne – in den Einheiten, in denen Sie tatsächlich abgerechnet werden
Fangen wir mit der Rechnung an, denn das ist der Teil, den die Leute richtig verstehen und dann übergewichten. Beide Modelle haben denselben veröffentlichten Tarif über die Live API: 0,005 $ pro Minute Audioeingabe und 0,018 $ pro Minute Audioausgabe, und auf der Extended-Thinking-Seite enthalten diese Ausgabe-Tokens das Denken. Dieselbe Karte, dieselben Tarife, keine separate Premium-Stufe fürs Reasoning.
Die Divergenz zeigt sich, sobald man Arbeit statt Minuten misst. Die Spalte „Kosten pro Stunde Eingabe-Audio“ von Artificial Analysis – die Kosten für die Bearbeitung einer festen 40-Fragen-Teilmenge von Big Bench Audio, auf einen Stundenwert normalisiert – ordnet die beiden Modelle in völlig unterschiedliche Kategorien ein:
• Gemini 3.8 Live Extended Thinking (High) — 3,50 $ pro Stunde Eingabe-Audio, nach der eigenen Messung von Artificial Analysis
• Gemini 3.8 Live — $0,84 pro Stunde, der niedrigste bezahlte Satz auf diesem Board
• GPT-Live-1 (Astra-Backend, mittlerer Aufwand) — 5,83 $ pro Stunde, sodass die Reasoning-Variante das Modell, das sie schlägt, immer noch um rund 40 % unterbietet
• Grok Voice Think Fast 2.0 High — 4,80 $ pro Stunde
• GPT-Realtime-2.1 High — 10,75 $ pro Stunde
Das ist die Gabelung: das Vierfache der stündlichen Audio-Kosten bei identischem veröffentlichtem Minutenpreis, weil die Reasoning-Variante mehr Tokens verbraucht, um dieselbe Menge an Zuhören zu bewältigen. Die 0,84 US-Dollar des Standardmodells sind kein Rabatt, sie sind der Tiefstwert des gesamten Tableaus.
Was man für die 38 Punkte bekommt
Zerlegt man das Zusammengesetzte, sehen die beiden Modelle nicht mehr wie ein Paar aus:
• Sprache-zu-Sprache-Index — Gemini 3.8 Live Extended Thinking (High) 82,6 vs. Gemini 3.8 Live 76,0
• Agentische Leistung (Aufgabenabschluss bei τ-Voice) — 68,6 % vs. 30,1 %
• Sprachschlussfolgerung (Big Bench Audio) — 98 % vs. 92 %
• Gesprächsdynamik — 91,9 % vs. 96,1 %
• Arena-Präferenz (Elo) — 990 vs. 1083
• Aufgaben-Erfolgsrate — 89,1 % vs. 93,2 %
• Zeit bis zum ersten Audio — 1,35 s vs. 1,18 s
• Kosten pro Stunde für Eingabe-Audio — 3,50 $ vs. 0,84 $
Liest man das ehrlich, gewinnt das günstigere Modell vier der acht Zeilen. Es ist schneller bis zum ersten Audio, von der Arena bevorzugt, schließt mit höherer Wahrscheinlichkeit eine oberflächliche Aufgabe ab und wird bei der Gesprächsdynamik besser bewertet – Letzteres ist kein Trostpreis, denn Gesprächsdynamik ist das, was ein Anrufer bemerkt. Was es nicht kann, ist, eine Aufgabe mit Schritten zu beenden. 31,1 Prozent gegenüber 68,6 % ist die größte einzelne Lücke in dieser Veröffentlichung, und sie trifft auf die eine Achse, die einen Agenten von einer Schnittstelle trennt.
Zwei Vorbehalte zu diesen Zeilen. Der Arena-Präferenzwert im Index wird an dem Punkt eingefroren, an dem ein Modell veröffentlichungsfähig wird; er ist also eine Momentaufnahme und kein fortlaufender Elo-Wert — lesen Sie ihn als zeitpunktbezogene Bewertung und nicht als das Live-Diagramm der Speech Agent Arena. Und die Spitze des τ-Voice-Boards ist eng: Die Reasoning-Variante mit 68,6 % führt GPT-Live-1 mit 67,9 % (Astra-Backend, mittlerer Aufwand) um 0,7 Punkte an, während GPT-Live-1 (Sol, geringer Aufwand) mit 59,3 % und Grok Voice Think Fast 2.0 High mit 56,5 % dahinter liegen. Der Vorsprung von 0,7 Punkten gegenüber GPT-Live-1 liegt im Rauschen. Die 38-Punkte-Lücke innerhalb dieses Paares hingegen nicht.

Die anderen 4x: Was Sie die Reasoning-Stufe im Code kostet
In diesem Release gibt es einen zweiten Fork, und er erscheint auf keiner Bestenliste. Die beiden Modelle sind nicht ohne Weiteres austauschbar, weil die Reasoning-Variante den Vertrag ändert, den Ihr Client erfüllen muss.
Beim Standardmodell Gemini 3.8 Live verhält sich so, wie es ein Live-API-Client erwartet: Hintergrund-Tool- und API-Aufrufe laufen, während das Modell weiter spricht, und turnComplete: true markiert weiterhin das Ende eines Turns. Es gibt keine Thinking-Level-Einstellung zur Auswahl, weil es nichts separat zu konfigurieren gibt – das Modell antwortet, und wenn es geantwortet hat, ist der Turn beendet.
Bei Gemini 3.8 Live Extended Thinking ändern sich drei Dinge gleichzeitig:
• Funktionsaufrufe sind immer asynchron. Eine blockierende Tool-Deklaration stellt sich nicht höflich in die Warteschlange – sie gibt einen harten Fehler zurück. Jedes Tool-Schema, das du für das Standardmodell geschrieben hast, muss als nicht blockierend neu deklariert werden.
• Ein neues Statusfeld trägt den tatsächlichen Zustand. Clients müssen interaction_statusstatt turnComplete: Das Feld zeigt IN_PROGRESS, während das Modell noch nachdenkt oder ein Tool noch läuft, und geht erst zu IDLE über, wenn die gesamte Aufgabe abgeschlossen ist. Ein Turn kann enden, während die Aufgabe noch nicht beendet ist.
• Die Denktiefe ist ein Regler. Das Modell bietet konfigurierbare Denkstufen – niedrig, mittel und hoch – und die 82,6 und 68,6 Werte auf der Tafel sind die (Hoch) Konfiguration. Der Wechsel zu niedrig verändert sowohl die Qualität als auch die Token-Kosten, und nichts im Index sagt Ihnen, was niedrig Sie bei der Aufgabenbewältigung kostet.
Dieser dritte Punkt ist die Migrationsfalle. Weil Extended Thinking auf der Leitung genauso antwortet wie das Standardmodell, bis ein Tool-Aufruf ins Spiel kommt, kann ein Team die Modell-ID austauschen, eine funktionierende Demo sehen und den asynchronen Vertrag erst in der Produktion entdecken, wenn ein Buchungstool statt eines Ergebnisses einen Fehler zurückgibt. Rechnen Sie das Client-Refactoring zusätzlich zum 4×-Audio-Tarif ein; bei einer ausgereiften Integration ist es die größere der beiden Kosten.
Welche davon deine Workload tatsächlich anfordert
Der saubere Weg, das zu entscheiden, ist zu fragen, wofür die Session gedacht ist – nicht, wie schlau du sie haben möchtest.
Nimm Gemini 3.8 Live, wenn das Gespräch das Ergebnis ist. Antworten, einen Gesprächsfaden halten, eine Nachricht entgegennehmen, einen Anrufer qualifizieren, freundlich und schnell und günstig sein. Bei 0,84 $ pro Stunde Eingabe-Audio ist es das günstigste kompetente Sprachmodell, das derzeit irgendjemand veröffentlicht, es wird von der Arena bevorzugt, es ist zuverlässiger bei oberflächlichen Aufgaben und es ist 170 Millisekunden schneller bis zum ersten Audio — ein Unterschied, den ein Anrufer spürt. Das Einzige, was man akzeptieren muss, ist die Obergrenze: 30,1 % bei der Bewältigung mehrstufiger Aufgaben bedeuten, dass es Arbeit mit Schritten nicht abschließen wird, und keine noch so ausgefeilte Prompt-Entwicklung verschiebt diese Zahl.
Nehmen Sie Gemini 3.8 Live Extended Thinking, wenn die Sitzung eine Aufgabe hat. Buchungen, Änderungen, Stornierungen, die Klärung eines Kontoproblems, das Begleiten eines Anrufers durch einen mehrstufigen Prozess, während er wartet. Das ist die 38-Punkte-Marke, und sie ist 3,50 $ pro Stunde wert – was, wohlgemerkt, immer noch günstiger ist als beide Modelle, die es in der Gesamtwertung übertrifft. Sie erhalten außerdem das Sprechverhalten, das die Wartezeit erträglich macht: Dieses Modell denkt und spricht gleichzeitig, sodass der Anrufer, wenn es etwas nachschlägt, statt Stille „Lass mich das kurz prüfen …“ und laufende Fortschrittsmeldungen hört, während es vorangeht. Das ist dasselbe Problem, das Vollduplex-Architekturen lösen, indem sie das Audio nie stoppen; Googles Antwort besteht darin, während der Arbeit einfach weiterzusprechen.
Noch zwei Zeilen, die es abzuwägen gilt. Google meldet außerdem 35,1 % für das Extended-Thinking-Modell im τ³-Banking-Leaderboard von Sierra, gegenüber 32,0 % für GPT-Live-1 Astra – eine vom Anbieter gemeldete Zahl, hinter der keine unabhängige Messung steht, und in absoluten Zahlen ernüchternd, denn 35,1 % bedeuten, dass das beste Modell auf diesem Board bei ungefähr zwei von drei realistischen Banking-Aufgabenversuchen scheitert. Und der zweite Platz des Standardmodells in der Speech Agent Arena, den Google in eigenen Unterlagen anführt, ist ein echtes Ergebnis auf einem anderen Board, das Präferenz statt Aufgabenerfüllung misst. Beide Aussagen treffen zu. Zusammen besagen sie, dass man sich mit dem günstigen Modell sehr gut unterhalten kann und dass das teure Modell das einzige der beiden ist, dem man Arbeit geben kann.
Beide ausführen, ohne zwei Integrationen
Der praktische Einwand gegen all das ist, dass die Auswahl je Workload die Pflege zweier Pfade bedeutet. Das muss nicht sein. Beide Varianten sitzen vor derselben Backend-Klasse – Hintergrund-Tool-Ausführung und mehrstufige Planung laufen letztlich auf gewöhnliche Textmodell-Aufrufe hinaus –, und in dieser Schicht liegt Ihre Kostenvarianz, und hier ist das Umschalten günstig.
OrcaRouter bietet 190 Modelle über einen einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, sodass eine Preisänderung eines Anbieters bei uns noch am selben Tag wirksam wird und nicht erst bei der nächsten Vertragsverlängerung. Bei einem Stack, der zwischen einer günstigen Konversationsebene und einer teuren Reasoning-Ebene routet, sind die zwei entscheidenden Eigenschaften, dass das Delegationsziel im laufenden Datenverkehr ausgetauscht werden kann ohne die Sprachintegration anzufassen, und dass automatisches Failover eine Sitzung am Leben hält, wenn ein Backend einen Fehler wirft oder in einen Timeout läuft. Um genau zu sein, was wir hosten und was nicht: die Endpunkte Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking sind nicht auf unserem Router — diese stammen aus Googles eigener API, in der Gemini API, der Live API und Google AI Studio. Die Textmodelle, an die diese Agenten ihre Arbeit abgeben, sind sehr oft genau solche – Gemini 3.8 Flash gehört dazu.
Wo sich jedes Modell auf dem Brett befindet
Der folgende Screenshot wurde am 16. September 2026 aufgenommen, und der obere Teil des Speech to Speech Index lautet wie folgt:
• Gemini 3.8 Live Extended Thinking (High) — 82,6, erster Platz
• GPT-Live-1 (Astra-Backend, mittlerer Aufwand) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (Sol-Backend, geringer Aufwand) — 80.1
• Gemini 3.8 Live — 76,0, fünfter Platz
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
Ein Hinweis zur Namensgebung, während Sie diese Liste lesen: Das (High)-Suffix, das in der Berichterstattung an dieses Modell angehängt wird, ist ein Konfigurationslabel für den Reasoning-Aufwand, keine separate Veröffentlichung. Es ist dieselbe Konvention, die das Board für Grok Voice Think Fast 2.0 High und GPT-Realtime-2.1 High verwendet.

Was ist noch nicht committet?
Eines an diesem Paar lässt sich leicht falsch verstehen, daher ist es sinnvoll, es klar auszusprechen: Keines der beiden Modelle ist im vertraglichen Sinne allgemein verfügbar, obwohl beide bepreist und dokumentiert sind.
Entwickler erhalten Gemini 3.8 Live in der Gemini API, der Live API und Google AI Studio unter der ID gemini-3.8-live; Unternehmen erhalten eine private Vorschau in Gemini Enterprise, wobei Gemini Enterprise for Customer Experience als „demnächst verfügbar“ aufgeführt ist; Verbraucher erhalten es in Search Live. Gemini 3.8 Live Extended Thinking bietet dieselbe Entwickleroberfläche unter gemini-3.8-live-extended-thinking, plus einen breiteren Weg für Verbraucher — Gemini Live, Docs Live für Google AI Pro- und Ultra-Abonnenten sowie Gmail Live und Keep Live für alle Google AI-Abonnenten. Workspace-Geschäftskunden sind als „demnächst verfügbar“ aufgeführt.
Was fehlt, ist genau das, was ein Unternehmen braucht, bevor es darauf eine Umsatzlinie aufbaut: eine General-Availability-Zusage, eine veröffentlichte Uptime-Zahl und einen Tarif, den Google zuzusichern versprochen hat. Die Preise sind veröffentlicht, und Preview-Preise neigen dazu, sich zu verschieben. Bauen Sie jetzt einen Prototyp, planen Sie die Migration und unterschreiben Sie kein Verfügbarkeitsziel, das Ihnen nicht genannt wurde.

Die Entscheidung, die dieses Paar tatsächlich aufwirft, ist enger, als der Index vermuten lässt, und sie ist keine Qualitätsleiter. Wenn die Aufgabe Ihres Agenten darin besteht zu reden, ist das günstige Modell kein Kompromiss – es ist das bessere Produkt zum niedrigeren Preis, und der viermal günstigere Tarif ist ein Bonus und nicht das Argument. Wenn die Aufgabe Ihres Agenten darin besteht, etwas zu erledigen, ist die Reasoning-Variante die einzige der beiden, der die Aufgabe überhaupt übertragen werden kann, und 3,50 $ pro Stunde sind ein Rundungsfehler gegenüber einer Buchung, die andernfalls fehlschlägt. Der Fehler, den es zu vermeiden gilt, ist, sich in der Mitte zu treffen: für Reasoning-Tiefe bei einer Arbeitslast zu bezahlen, die nie mehr als eine gute Unterhaltung brauchte – was passiert, wenn ein Team die 6,6-Punkte-Lücke im Gesamtwert liest und nie bis zur 38 herunterscrollt.
