Hero-Titelkarte für Gemini 3.8 Live Extended Thinking vs. GPT-Live-1, die die beiden Sprachmodelle mit 1,1 Indexpunkten Abstand und unterschiedlichen Abrechnungsmodellen zeigt.
Guides & Insights

Gemini 3.8 Live Extended Thinking vs. GPT-Live-1: Ein 1,1-Punkte-Gleichstand und zwei unterschiedliche Rechnungen

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Beim Gesamtwert ist das ein Gleichstand. Gemini 3.8 Live Extended Thinkingliegt bei 82,6 im Speech-to-Speech-Index von Artificial Analysis; GPT-Live-1liegt mit seinem Astra-Backend bei mittlerem Reasoning-Aufwand bei 81,5. Bei der darunterliegenden agentischen Komponente – der Aufgabenbewältigung bei τ-Voice – beträgt der Abstand 0,7 Punkte, 68,6 % gegenüber 67,9 %. Bei der Reasoning-Komponente ist er größer und verläuft in die andere Richtung: 97,7 % bei Big Bench Audio für das Gemini-Modell, 90,1 % für GPT-Live-1. Nichts an dieser Spanne übersteht einen zweiten Benchmark-Durchlauf, und nichts davon ist das, worauf Sie Ihre Entscheidung stützen sollten.

Was diese beiden trennt, ist nicht die Qualität. Es ist die Tatsache, dass sie sich darüber uneinig sind, was ein Voice-Agent ist, wer das Denken übernimmt und – der Teil, der zuerst die Budgetlinie trifft – wie die Sitzung abgerechnet wird. Gemini 3.8 Live Extended Thinking rechnet nach Audio-Token ab und denkt in demselben Modell, das spricht. GPT-Live-1 berechnet einen Pauschalpreis für die Sitzungszeit, egal ob jemand spricht oder nicht, und übergibt das eigentliche Denken an ein separates Textmodell, das Sie auswählen und separat bezahlen. Das sind zwei verschiedene Produkte, die dieselbe Benchmark-Punktzahl tragen, und welches passt, hängt von einer Frage ab, die das Leaderboard nie stellt: Wie sieht ein durchschnittlicher Anruf auf Ihrer Leitung aus?

Der 1,1-Punkte-Gleichstand und wo er tatsächlich bricht

Beginne mit den Zahlen, denn die Dünnheit der Schlagzeile ist der Punkt:

Sprache-zu-Sprache-Index — Gemini 3.8 Live Extended Thinking (Hoch) 82,6 vs. GPT-Live-1 (Astra-Backend, mittlerer Aufwand) 81,5

Agentische Performance (Aufgabenabschluss bei τ-Voice) — 68,6 % vs. 67,9 %, wobei GPT-Live-1 bei 59,3 % liegt, wenn es das Sol-Backend mit geringem Aufwand ausführt

Sprachliches Schlussfolgern (Big Bench Audio) — 97,7 % vs. 90,1 %, die einzige Komponente, bei der die Lücke kein Rauschen ist

Komplexe Banking-Workflows (Sierra τ³-Banking, vom Anbieter gemeldet) — 35,1 % vs. 32,0 %

Zeit bis zum ersten Audio — 1,35 s gegenüber 1,24–1,34 s über die API

Gemessene Kosten pro Stunde — 3,50 $ vs. 5,83 $ für die Astra-Konfiguration, beides basierend auf der Input-Audio-Messung von Artificial Analysis

Die ehrliche Lesart ist, dass die beiden Modelle beim Gesamtwert nicht zu unterscheiden sind, beim Sprachschluss jedoch schon, wo das Gemini-Modell mit fast acht Punkten führt, und ebenso bei den Kosten, wo es mit rund 40 % führt. Wo GPT-Live-1 die Nase vorn hat, sind die Teile des Erlebnisses, die ein Benchmark kaum bewerten kann: Es ist wirklich vollduplex, hört zu, während es spricht, sendet Backchannels und entscheidet mehrmals pro Sekunde, ob es reden oder abgeben soll. Gemini 3.8 Live Extended Thinking ist turnbasiert. Dasselbe zugrunde liegende Problem – ein Anrufer, der im Schweigen hängt, während der Agent arbeitet – löst es stattdessen durch Erzählen: Es denkt und spricht gleichzeitig, mit Hinweisen wie „Lass mich das kurz prüfen …“, während die Aufgabe läuft.

Beide Ansätze halten die Leitung am Leben. Sie fühlen sich unterschiedlich an. Nur einer von ihnen taucht in einem Index auf.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

Zwei Abrechnungsmodelle – und warum die Preisliste in die Irre führt

Dies ist der Abschnitt, der die meisten Deployments entscheidet, und genau den überspringt die Coverage.

Gemini 3.8 Live Extended Thinking wird so abgerechnet, wie ein Token-Modell abgerechnet wird. Über die Live API liegen die veröffentlichten Preise bei $3.00 pro Million Audio-Eingabe-Tokens – rund $0.005 pro Minute Audio-Eingabe – und $12.00 pro Million Audio-Ausgabe-Tokens, rund $0.018 pro Minute, wobei Thinking-Tokens in dieser Ausgabe mitgezählt werden. Sie zahlen für Audio, das sich bewegt. Ein Anrufer, der pausiert, nachdenkt oder in die Warteschleife gesetzt wird, kostet Sie nichts, solange er still ist.

GPT-Live-1 wird so abgerechnet, wie eine Telefonleitung abgerechnet wird. Es werden pauschal 0,05 $ pro Minute Sitzungszeit berechnet, sekundengenau abgerechnet, unabhängig davon, wer spricht oder ob überhaupt jemand spricht. Das Reasoning-Backend ist nicht enthalten: Das Textmodell, das die Denkarbeit leistet, und alle Tools, die es aufruft, werden separat zusätzlich abgerechnet. So wird aus einem Nennpreis von 0,05 $ ein Gesamtbetrag von rund 4,47 $ pro Stunde auf dem Sol-Backend und 5,83 $ pro Stunde bei Astra medium, gemessen von Artificial Analysis.

Vergleicht man sie direkt, ist der naive Vergleich – 0,018 $ gegen 0,05 $ pro Minute, eine 2,8-fache Lücke – in beide Richtungen falsch. Die gemessenen Stundenwerte beziffern die tatsächliche Lücke auf 3,50 $ gegen 5,83 $, näher an 1,7×. Doch das Session-Clock-Modell verändert nicht nur die Höhe Ihrer Rechnung, sondern auch ihre Form: Bei GPT-Live-1 folgen Ihre Kosten der Anrufdauer, sodass eine Leitung mit langen, ruhigen, inhaltsarmen Anrufen – eine Support-Warteschlange, ein Verifizierungsschritt, eine IVR-Übergabe – genauso viel kostet wie eine dichte Leitung. Auf der Gemini-Seite folgen die Kosten dem Audio, Stille ist also kostenlos und Weitschweifigkeit nicht. Rechnen Sie mit Ihrer eigenen durchschnittlichen Anruflänge, bevor Sie mit einem Minutenpreis rechnen, denn diese Zahl entscheidet, welches für Sie günstiger ist, und sie fällt für eine Buchungsleitung und eine Triage-Leitung nicht gleich aus.

Wo das Denken stattfindet

Der zweite strukturelle Unterschied ist die Delegation, und sie ist der Punkt, der bestimmt, wie viel von diesem Stack sich tatsächlich austauschen lässt.

GPT-Live-1 ist ein Frontend. Es verarbeitet das Duplex-Audio, und wenn eine Anfrage echtes Reasoning erfordert, übergibt es die Arbeit an ein separates Backend-Modell — GPT-5.5 und GPT-6 Astra sind beide als Backends dokumentiert — mit Selektoren für den Reasoning-Aufwand, mit denen Sie wählen können, wie viel von diesem Backend Sie kaufen möchten. Deshalb listet das Board GPT-Live-1 zweimal mit unterschiedlichen Punktzahlen auf: 81,5 auf Astra bei mittlerem Aufwand, 80,1 auf Sol bei niedrigem. Diese 1,4-Punkte-Spanne zwischen seinen eigenen beiden Konfigurationen ist größer als der 1,1-Punkte-Abstand zwischen den beiden Modellen in diesem Duell, was Ihnen zeigt, dass auf der OpenAI-Seite die Konfiguration, die Sie wählen, mehr zählt als der Anbieter, den Sie wählen.

Gemini 3.8 Live Extended Thinking denkt in demselben Modell, das spricht. Es gibt kein separates Backend zur Auswahl und keine separate Abrechnung dafür; der Kompromiss ist, dass man die Tiefe mit Denkstufen – niedrig, mittel und hoch – im selben Modell abstimmt, und die Werte 82,6 und 68,6 gelten für die (Hoch)-Konfiguration. Die Ausführung von Hintergrund-Tools und APIs läuft auf beiden Seiten asynchron, sodass keines der Modelle hängen bleibt, während es arbeitet.

Eine praktische Konsequenz: Weil die Intelligenz von GPT-Live-1 ein eingekauftes Textmodell hinter einem Sprach-Frontend ist, verschiebt sich seine Qualitätsobergrenze, wenn OpenAI ein Textmodell auf den Markt bringt – nicht, wenn ein Sprachmodell erscheint. Die Obergrenze von Gemini 3.8 Live Extended Thinking verschiebt sich, wenn Google das Audiomodell neu trainiert. Wenn Sie eine Zwei-Jahres-Wette auf eine Sprachplattform setzen, ist dieser Unterschied in der Upgrade-Kadenz mehr Nachdenken wert als 1,1 Indexpunkte.

Welche Wechselkosten auch immer – egal, welchen Weg Sie wählen

Keines von beiden ist ein reiner Modell-ID-Austausch, und Teams, die es dafür halten, erfahren es in der Produktion. Der Wechsel zu Gemini 3.8 Live Extended Thinking bedeutet, einen anderen Turn-Vertrag zu akzeptieren: Funktionsaufrufe sind immer asynchron, daher liefert eine blockierende Tool-Deklaration einen harten Fehler zurück, statt in die Warteschlange zu gehen, und Clients müssen das Feld interaction_status lesen — IN_PROGRESS während noch nachgedacht wird oder ein Tool läuft, IDLE nur, wenn die gesamte Aufgabe abgeschlossen ist — statt darauf zu vertrauen, dass turnComplete bedeutet, die Arbeit sei erledigt. Der Wechsel zu GPT-Live-1 bedeutet, dessen Backend-Auswahl-Infrastruktur und eine zweite Abrechnungsebene zu übernehmen und mit einer API zu leben, die erst am 10. September 2026 allgemein für Entwickler verfügbar wurde, nachdem sie am 8. Juli in ChatGPT debütierte — die Third-Party-Tools, SDKs und Observability-Lösungen rund um sie sind also Monate alt, nicht Jahre. In welche Richtung Sie sich auch bewegen: Kalkulieren Sie den Integrationsaufwand neben der Token-Rechnung ein. In einem ausgereiften Voice-Stack ist das Refactoring meist der größere der beiden Posten.

Wie man einen Vergleich wie diesen durchführt, ohne darauf zu wetten

Der vernünftige Weg, eine 1,1-Punkte-Frage zu klären, ist, beide auf Ihrem eigenen Traffic laufen zu lassen, und das Unangenehme daran ist, dass dies normalerweise zwei Integrationen, zwei Verträge und zwei Sätze Zugangsdaten bedeutet. Es muss nicht zwei Architekturen bedeuten. In beiden dieser Systeme ist das Sprach-Frontend eine dünne Schicht über gewöhnlichen Textmodell-Aufrufen – bei GPT-Live-1 ist das explizit, und auf der Gemini-Seite wird die Ausführung von Hintergrund-Tools auf dieselbe Weise aufgelöst – und diese Textschicht ist der Ort, an dem Ihre Kostenvarianz sitzt und an dem ein Wechsel wirklich günstig ist.

OrcaRouter bietet 190 Modelle über einen einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, sodass eine Preisänderung beim Anbieter bei uns noch am selben Tag live ist und nicht erst zur nächsten Vertragsverlängerung. Für einen Voice-Stack sind die beiden entscheidenden Eigenschaften, dass das Delegationsziel im Live-Verkehr ausgetauscht werden kann, ohne die Voice-Integration anzufassen, und dass automatisches Failover einen Anruf am Leben hält, wenn ein Backend fehlschlägt oder in einen Timeout läuft — was es ermöglicht, eine unerprobte Konfiguration im Echtverkehr zu erproben, ohne eine Produktionsleitung dahinterzusetzen. Um genau zu sein, was wir hosten und was nicht: Weder der Gemini 3.8 Live Extended Thinking Endpoint noch der GPT-Live-1 Endpoint befindet sich auf unserem Router — diese stammen aus den eigenen APIs von Google und OpenAI. Die Textmodelle, an die sie delegieren, sind sehr oft auf unserem Router vertreten, darunter Gemini 3.8 Flash.

Die Spitze des Boards, und wie wenig sie sich einpendelt.

Die folgende Aufnahme wurde am 16. September 2026 gemacht:

Gemini 3.8 Live Extended Thinking (High) — 82,6, erster Platz

GPT-Live-1 (Astra-Backend, mittlerer Aufwand) — 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (Sol-Backend, geringer Aufwand) — 80.1

• Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

Drei Dinge, die Beachtung verdienen. Erstens liegen zwischen dem ersten und dem dritten Platz 1,3 Punkte und zwischen dem ersten und dem fünften 6,6, sodass die Spitze dieses Boards ein Gedränge ist, keine Rangliste. Zweitens ist das Modell im Titel dieses Vergleichs nicht der fünftplatzierte Gemini-Eintrag – das ist das Standard-Gemini-3.8-Live, ein anderes und deutlich günstigeres Produkt, das nicht mit der hier verglichenen Reasoning-Variante verwechselt werden sollte. Drittens gibt es einen Präzedenzfall dafür, jeden einzelnen Indexwert als vorläufig zu betrachten: xAI meldete im Juli 82,9 für Grok Voice Think Fast 2.0, und dieses Modell wird in diesem Board mit 81,3 geführt. Von Anbietern gemeldete Indexwerte überstehen nicht immer den Kontakt mit einem Live-Leaderboard. Die τ-Voice-Werte von 68,6 % und 67,9 % stehen jetzt auf einem öffentlichen Board, das unter dem eigenen Harness von Artificial Analysis läuft, sodass sie belegt und nicht nur behauptet sind – aber ein Unterschied von 0,7 Punkten zwischen zwei Modellen auf demselben Harness ist kein Unterschied. Überprüfen Sie ihn mit Ihrem eigenen Traffic oder ignorieren Sie ihn.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Eine weitere Zahl, die in die Entscheidung einkalkuliert werden sollte, weil sie die unangenehmste in diesem Vergleich ist: Google meldet 35,1 % für Gemini 3.8 Live Extended Thinking im τ³-Banking-Leaderboard von Sierra, gegenüber 32,0 % für GPT-Live-1 Astra. Diese Zahlen sind vom Anbieter gemeldet, nicht reproduziert, und sie beschreiben eine Welt, in der der führende Sprachagent in diesem Leaderboard bei etwa zwei von drei realistischen Banking-Aufgabenversuchen scheitert. Wenn Ihr Agent regulierte, mehrstufige Arbeit erledigen muss, ist keines dieser Modelle ausgereift – und ein Vorsprung von 3,1 Punkten in diesem Benchmark ist kein Grund, einen Anbieter auszuwählen, sondern ein Grund, einen Menschen in den Prozess einzubeziehen.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

Also: Wenn Konversationsnatürlichkeit das Produkt ist und Ihre Calls kurz und dicht sind, ist das Vollduplex-Verhalten von GPT-Live-1 ein echter Vorteil, den der Index nicht sehen kann, und die Abrechnung nach Sitzungsuhr ist bei dieser Call-Länge vertretbar. Wenn Calls lang, ruhig oder variabel sind oder wenn Sprachschlussfolgerung und Kosten pro Stunde dominieren, liegt Gemini 3.8 Live Extended Thinking bei den Komponenten vorn, die zählen, und ist dabei etwa 40 % günstiger pro Stunde – mit der Einschränkung, dass es turn-basiert ist, sich für Unternehmen noch in der Vorschau befindet und ein Client-Refactoring erfordert, bevor es Ihre Tools ausführt. Was nichts davon rechtfertigt, ist, eines der beiden aufgrund von 1,1 Indexpunkten zu wählen. Nach den verfügbaren Belegen ist der ehrliche Grund, zwischen diesen beiden zu wählen, das Abrechnungsmodell und die darunterliegende Architektur, und beides sind Dinge, die Sie diese Woche an Ihrem eigenen Traffic messen können.

Bei OrcaRouter hält automatisches Failover einen Anruf am Leben, wenn bei einem Backend ein Fehler auftritt oder es zu einem Timeout kommt.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert