Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe – welchen Endpunkt Ihre App aufrufen sollte

Neu generierte Abbildung.
Guides & Insights

Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: Welchen Endpunkt sollte Ihre App aufrufen?

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Als Go​ogle am 26. August 2026 die Ge​mini-3.5-Transcribe-Familie einführte, kamen zwei Modelle auf den Markt, die sich Namen und Mission teilen, aber für verschiedene Phasen eines Gesprächs gebaut sind: Ge​mini 3.5 Transcribe Live, der Streaming-Endpunkt über die Live-API, und Ge​mini 3.5 Transcribe, der Endpunkt für vorab aufgezeichnete Inhalte über die Interactions-API. Der Fehler, den die meisten Teams in der ersten Woche machen, ist, dies als ein Modell mit zwei Schaltflächen zu behandeln. Es handelt sich um zwei SKUs – unterschiedliche APIs, unterschiedliche Preise, unterschiedliche harte Grenzen – und der Genauigkeitsvergleich zwischen ihnen ist kein fairer Kampf, denn sie werden nach unterschiedlichen Regeln gemessen. Dieser Artikel stellt die beiden nebeneinander, damit die Entscheidung von Ihrer Workload abhängt und nicht von einer Bestenliste.

Die beiden auf einen Blick

• API — Ge​mini 3.5 Transcribe Live läuft auf der Live-API (WebSocket, bidirektionales Streaming) vs Ge​mini 3.5 Transcribe auf der Interactions-API (Datei rein, Transkript raus).

• Job — Live-Gespräch, Untertitelung, Sprachagenten vs. Besprechungen, Anrufprotokolle, Archiv-Audio.

• Genauigkeit — 4,0 % WER streaming vs. 2,6 % WER non-streaming, laut Artificial Analysis, zitiert von Go​ogle; unterschiedliche Messverfahren, nicht direkt vergleichbar.

• Latenz — ein endgültiges Transkript 0,40 s nach Ende der Sprache im Vergleich zur Stapelverarbeitung einer vollständigen Datei.

• Sitzung — 10-Minuten-Obergrenze pro Live-Sitzung gegenüber Dateien mit bis zu 60 Minuten (30 Minuten mit aktivierter Diarisierung und Zeitstempeln).

• Sprecher — keine auf der Streaming-Seite, hingegen bis zu drei Sprecher mit Wort-Zeitstempeln auf der vorab aufgezeichneten Seite.

• Preis — Mischpreis: etwa 0,009 $ pro Minute gegenüber etwa 0,005 $ pro Minute.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

Die Architekturentscheidung: Interactions API oder Live API

Beide Modelle gehören zur Go​ogle-Ge​mini-Audio-Familie und befinden sich beide in der öffentlichen Vorschau. Der Unterschied beginnt beim Transport. gemini-3-5-transcribe-live öffnet einen WebSocket und hält ihn offen: Rohe Audiodaten werden kontinuierlich gestreamt – das übliche Format sind 16-kHz- oder 24-kHz-16-Bit-PCM-Blöcke – und das Modell liefert Teiltranskripte, während Sie sprechen, sowie für jede Äußerung ein endgültiges Transkript, wenn die Sprache endet. gemini-3-5-transcribe nimmt eine vollständige Datei, verarbeitet sie und gibt das fertige Transkript mit Sprecherzuordnung und Wort-Zeitstempeln zurück.

Die Transportentscheidung bestimmt alles andere. Wenn Ihr Produkt Wörter so wiedergibt, wie sie gesprochen werden – eine Live-Untertitelung, ein Sprachagent, der die Absicht mitten im Satz erkennt, ein Anrufassistent, der handelt, während der Anruf läuft – befinden Sie sich auf dem Live-Pfad. Wenn Ihr Produkt eine Aufzeichnung erstellt – ein Besprechungsprotokoll, ein Anrufprotokoll, ein Archiv – befinden Sie sich auf dem Interactions-Pfad. Die Verwirrung entsteht dadurch, dass beide Text erzeugen; der Unterschied besteht darin, ob der Text ein Echtzeit-Zustand oder ein endgültiges Artefakt ist.

Genauigkeit: Die Streaming-Steuer ist real.

Artificial Analysis, das unabhängige Benchmark-Unternehmen, dessen Zahlen Go​ogle in seinem Launch-Beitrag zitiert, misst eine durchschnittliche Wortfehlerrate von 4,0 % für den Streaming-Endpoint und 2,6 % für den Non-Streaming-Endpoint. Beim multilingualen FLEURS-Benchmark berichtet Go​ogle 5,50 % Streaming gegenüber 5,04 % Non-Streaming. Die 2,6-%-Kennzahl platziert Ge​mini 3.5 Transcribe beim Start auf Platz 5 der AA-WER-Rangliste, hinter ElevenLabs Scribe v2 mit 2,2 % und Microsofts MAI-Transcribe-1.5 mit 2,4 % – das sind AAs Messungen, nicht die Behauptungen von Go​ogle.

Die Streaming-Zahl ist {{1}}keine schlechtere Version desselben Tests{{/1}}. Sie ist ein {{2}}anderes Regime{{/2}}: Das Modell legt sich auf {{3}}Wörter{{/3}} fest, bevor es das {{4}}Satzende{{/4}} gehört hat, und es bezahlt {{5}}dafür{{/5}}. Wählen Sie zwischen den beiden nicht nach {{6}}Genauigkeit allein{{/6}}, denn bei {{7}}einer beliebigen Arbeitslast{{/7}} könnte die Lücke {{8}}umschlagen{{/8}}. Entscheiden Sie anhand der {{9}}Einschränkungen{{/9}}: Der Streaming-Endpunkt hat ein {{10}}10-Minuten-Sitzungslimit{{/10}}, {{11}}keine Sprecher-Diarisierung{{/11}} und {{12}}keine Zeitstempel{{/12}}; der {{13}}Endpunkt für vorab aufgezeichnete Dateien{{/13}} verarbeitet {{14}}stundenlange Dateien{{/14}}, ordnet Äußerungen {{15}}bis zu drei Sprechern{{/15}} zu und liefert {{16}}Zeitstempel auf Wortebene{{/16}}. Wenn Ihre App {{17}}Sprecherkennzeichnungen{{/17}} benötigt, ist das Streaming-Modell {{18}}schlicht nicht in der Lage, die Aufgabe zu erfüllen{{/18}}, egal wie gut seine {{19}}WER{{/19}} ist.

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

Was sie teilen

Die beiden Endpunkte teilen sich die „intelligente Transkriptions“-Engine, und bei den gemeinsamen Funktionen ist die Wahl zwischen ihnen neutral:

• 85+ Sprachen mit automatischer Erkennung, einschließlich Sprachwechsel mitten im Stream auf dem Live-Pfad.

• Bereinigung von Unflüssigkeiten — Füllwörter entfernt, Selbstkorrekturen aufgelöst („Dienstag — nein, Mittwoch" ergibt den korrigierten Tag).

• Auto-Formatierung — Zeichensetzung, Groß-/Kleinschreibung und Absatzstruktur werden auf die Ausgabe angewendet.

• Benutzerdefinierter Wortschatz – bis zu 1.000 Begriffe für Fachjargon und Produktnamen, wobei die Google-Dokumentation für beste Ergebnisse etwa 100 empfiehlt.

Ein Vorbehalt, der für beide gilt: Die „intelligente" Bereinigung, die die Ausgabe lesbar macht, ist eine Designentscheidung, die zulasten der wortgetreuen Wiedergabe geht. Unbeholfene Formulierungen werden geglättet; der Text ist die Interpretation der Absicht durch das Modell, kein Gerichtsprotokoll. Für exakte Transkripte benötigen Sie eine wörtliche Option, wo eine solche angeboten wird, und Sie sollten das Verhalten in jedem Fall anhand Ihrer eigenen Audiodateien überprüfen.

Kosten pro Minute: das Live-Premium

Go​ogle bepreist Audio in Token mit 25 Audio-Token pro Sekunde, bei einer Ausgabe von ungefähr 175 Text-Token pro Minute Transkript. Zu Listenpreisen betragen die gemischten Kosten pro Minute Audio etwa $0.005 für gemini-3-5-transcribe und etwa $0.009 für gemini-3-5-transcribe-live – Eingabe bei $2 gegenüber $3.50 pro Million Token, Ausgabe bei $12 gegenüber $21 pro Million Token. Beide haben heute eine kostenlose Stufe.

Das Premium-Paket erkauft den Echtzeit-Pfad, nicht mehr Genauigkeit: Sie zahlen etwa 80 % mehr pro Minute für den Streaming-Endpunkt, und er transkribiert mit einer höheren WER. Das ist die ehrliche Darstellung. Das vorab aufgezeichnete Modell ist sowohl günstiger als auch genauer; das Streaming-Modell existiert, weil einige Produkte nicht warten können, bis die Datei vollständig verarbeitet ist.

Auf welchem Endpunkt solltest du aufbauen?

• Live-Untertitel und Untertitel — Ge​mini 3.5 Transcribe Live, und prüfen Sie das No-Timestamps-Limit, wenn Sie zeitlich abgestimmte Ausgaben benötigen.

• Sprachagenten — Ge​mini 3.5 Transcribe Live zur Absichtserkennung mitten im Satz; planen Sie das 10-Minuten-Limit für lange Sitzungen ein.

• Meetings, Interviews, Archivierung — Ge​mini 3.5 Transcribe, mit 2,6% WER, Sprecherzuordnung und Zeitstempeln auf Wortebene.

• Post-Call-Analysen — Ge​mini 3.5 Transcribe für die fertige Aufzeichnung; Ge​mini 3.5 Transcribe Live nur, wenn die Analyse während des Anrufs laufen muss.

• Langes durchgehendes Audio — Ge​mini 3.5 Transcribe, denn eine 60-minütige Datei schlägt das manuelle Zusammenstückeln von zehnminütigen Live-Sitzungen.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

Die Ebene über dem Transkript

Keines der Modelle wird von OrcaRouter gehostet – wir routen heute keine Sprach-zu-Text-Verarbeitung, und Sie rufen für beide Endpunkte direkt die API von Go​ogle auf. Die Aufgabe einer Routing-Schicht in einer Sprach-Pipeline besteht darin, oberhalb des Transkripts zu sitzen: der Zusammenfasser, der Entitätsextraktor, das Aktionspunkt-Modell, das einen Stream in eine Entscheidung verwandelt. Genau in dieser Schicht verdient OrcaRouter seine Daseinsberechtigung – eine API für über 200 Modelle zum Listenpreis der Anbieter ohne Aufschlag, automatisches Failover zwischen den Anbietern und eine Routing-DSL, die mehrere Modelle zu einem einzigen Aufruf kombiniert. Wählen Sie den Transkriptions-Endpunkt je nach Arbeitslast und führen Sie dann das Modell, das das Transkript liest, hinter einem einzigen Schlüssel aus.

Fazit

Ge​mini 3.5 Transcribe Live und Ge​mini 3.5 Transcribe gehören zur gleichen Familie und sind unterschiedliche Produkte. Wählen Sie Live, wenn das Transkript vor Ende des Gesprächs vorliegen muss und Sie mit einer 10-minütigen Sitzung, ohne Sprecherkennzeichnung und ohne Zeitstempel leben können. Wählen Sie Transcribe, wenn die Ausgabe eine Aufzeichnung ist und Genauigkeit und Zuordnung wichtiger sind als Geschwindigkeit – es ist günstiger, genauer und weitaus weniger eingeschränkt. Die einzige falsche Antwort ist anzunehmen, dass ein Endpunkt beides erledigt.