
Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: Welchen Endpunkt sollte Ihre App aufrufen?
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligenz49Coding
Als Google am 26. August 2026 die Gemini-3.5-Transcribe-Familie einführte, kamen zwei Modelle auf den Markt, die sich Namen und Mission teilen, aber für verschiedene Phasen eines Gesprächs gebaut sind: Gemini 3.5 Transcribe Live, der Streaming-Endpunkt über die Live-API, und Gemini 3.5 Transcribe, der Endpunkt für vorab aufgezeichnete Inhalte über die Interactions-API. Der Fehler, den die meisten Teams in der ersten Woche machen, ist, dies als ein Modell mit zwei Schaltflächen zu behandeln. Es handelt sich um zwei SKUs – unterschiedliche APIs, unterschiedliche Preise, unterschiedliche harte Grenzen – und der Genauigkeitsvergleich zwischen ihnen ist kein fairer Kampf, denn sie werden nach unterschiedlichen Regeln gemessen. Dieser Artikel stellt die beiden nebeneinander, damit die Entscheidung von Ihrer Workload abhängt und nicht von einer Bestenliste.
Die beiden auf einen Blick
• API — Gemini 3.5 Transcribe Live läuft auf der Live-API (WebSocket, bidirektionales Streaming) vs Gemini 3.5 Transcribe auf der Interactions-API (Datei rein, Transkript raus).
• Job — Live-Gespräch, Untertitelung, Sprachagenten vs. Besprechungen, Anrufprotokolle, Archiv-Audio.
• Genauigkeit — 4,0 % WER streaming vs. 2,6 % WER non-streaming, laut Artificial Analysis, zitiert von Google; unterschiedliche Messverfahren, nicht direkt vergleichbar.
• Latenz — ein endgültiges Transkript 0,40 s nach Ende der Sprache im Vergleich zur Stapelverarbeitung einer vollständigen Datei.
• Sitzung — 10-Minuten-Obergrenze pro Live-Sitzung gegenüber Dateien mit bis zu 60 Minuten (30 Minuten mit aktivierter Diarisierung und Zeitstempeln).
• Sprecher — keine auf der Streaming-Seite, hingegen bis zu drei Sprecher mit Wort-Zeitstempeln auf der vorab aufgezeichneten Seite.
• Preis — Mischpreis: etwa 0,009 $ pro Minute gegenüber etwa 0,005 $ pro Minute.

Die Architekturentscheidung: Interactions API oder Live API
Beide Modelle gehören zur Google-Gemini-Audio-Familie und befinden sich beide in der öffentlichen Vorschau. Der Unterschied beginnt beim Transport. gemini-3-5-transcribe-live öffnet einen WebSocket und hält ihn offen: Rohe Audiodaten werden kontinuierlich gestreamt – das übliche Format sind 16-kHz- oder 24-kHz-16-Bit-PCM-Blöcke – und das Modell liefert Teiltranskripte, während Sie sprechen, sowie für jede Äußerung ein endgültiges Transkript, wenn die Sprache endet. gemini-3-5-transcribe nimmt eine vollständige Datei, verarbeitet sie und gibt das fertige Transkript mit Sprecherzuordnung und Wort-Zeitstempeln zurück.
Die Transportentscheidung bestimmt alles andere. Wenn Ihr Produkt Wörter so wiedergibt, wie sie gesprochen werden – eine Live-Untertitelung, ein Sprachagent, der die Absicht mitten im Satz erkennt, ein Anrufassistent, der handelt, während der Anruf läuft – befinden Sie sich auf dem Live-Pfad. Wenn Ihr Produkt eine Aufzeichnung erstellt – ein Besprechungsprotokoll, ein Anrufprotokoll, ein Archiv – befinden Sie sich auf dem Interactions-Pfad. Die Verwirrung entsteht dadurch, dass beide Text erzeugen; der Unterschied besteht darin, ob der Text ein Echtzeit-Zustand oder ein endgültiges Artefakt ist.
Genauigkeit: Die Streaming-Steuer ist real.
Artificial Analysis, das unabhängige Benchmark-Unternehmen, dessen Zahlen Google in seinem Launch-Beitrag zitiert, misst eine durchschnittliche Wortfehlerrate von 4,0 % für den Streaming-Endpoint und 2,6 % für den Non-Streaming-Endpoint. Beim multilingualen FLEURS-Benchmark berichtet Google 5,50 % Streaming gegenüber 5,04 % Non-Streaming. Die 2,6-%-Kennzahl platziert Gemini 3.5 Transcribe beim Start auf Platz 5 der AA-WER-Rangliste, hinter ElevenLabs Scribe v2 mit 2,2 % und Microsofts MAI-Transcribe-1.5 mit 2,4 % – das sind AAs Messungen, nicht die Behauptungen von Google.
Die Streaming-Zahl ist {{1}}keine schlechtere Version desselben Tests{{/1}}. Sie ist ein {{2}}anderes Regime{{/2}}: Das Modell legt sich auf {{3}}Wörter{{/3}} fest, bevor es das {{4}}Satzende{{/4}} gehört hat, und es bezahlt {{5}}dafür{{/5}}. Wählen Sie zwischen den beiden nicht nach {{6}}Genauigkeit allein{{/6}}, denn bei {{7}}einer beliebigen Arbeitslast{{/7}} könnte die Lücke {{8}}umschlagen{{/8}}. Entscheiden Sie anhand der {{9}}Einschränkungen{{/9}}: Der Streaming-Endpunkt hat ein {{10}}10-Minuten-Sitzungslimit{{/10}}, {{11}}keine Sprecher-Diarisierung{{/11}} und {{12}}keine Zeitstempel{{/12}}; der {{13}}Endpunkt für vorab aufgezeichnete Dateien{{/13}} verarbeitet {{14}}stundenlange Dateien{{/14}}, ordnet Äußerungen {{15}}bis zu drei Sprechern{{/15}} zu und liefert {{16}}Zeitstempel auf Wortebene{{/16}}. Wenn Ihre App {{17}}Sprecherkennzeichnungen{{/17}} benötigt, ist das Streaming-Modell {{18}}schlicht nicht in der Lage, die Aufgabe zu erfüllen{{/18}}, egal wie gut seine {{19}}WER{{/19}} ist.

Was sie teilen
Die beiden Endpunkte teilen sich die „intelligente Transkriptions“-Engine, und bei den gemeinsamen Funktionen ist die Wahl zwischen ihnen neutral:
• 85+ Sprachen mit automatischer Erkennung, einschließlich Sprachwechsel mitten im Stream auf dem Live-Pfad.
• Bereinigung von Unflüssigkeiten — Füllwörter entfernt, Selbstkorrekturen aufgelöst („Dienstag — nein, Mittwoch" ergibt den korrigierten Tag).
• Auto-Formatierung — Zeichensetzung, Groß-/Kleinschreibung und Absatzstruktur werden auf die Ausgabe angewendet.
• Benutzerdefinierter Wortschatz – bis zu 1.000 Begriffe für Fachjargon und Produktnamen, wobei die Google-Dokumentation für beste Ergebnisse etwa 100 empfiehlt.
Ein Vorbehalt, der für beide gilt: Die „intelligente" Bereinigung, die die Ausgabe lesbar macht, ist eine Designentscheidung, die zulasten der wortgetreuen Wiedergabe geht. Unbeholfene Formulierungen werden geglättet; der Text ist die Interpretation der Absicht durch das Modell, kein Gerichtsprotokoll. Für exakte Transkripte benötigen Sie eine wörtliche Option, wo eine solche angeboten wird, und Sie sollten das Verhalten in jedem Fall anhand Ihrer eigenen Audiodateien überprüfen.
Kosten pro Minute: das Live-Premium
Google bepreist Audio in Token mit 25 Audio-Token pro Sekunde, bei einer Ausgabe von ungefähr 175 Text-Token pro Minute Transkript. Zu Listenpreisen betragen die gemischten Kosten pro Minute Audio etwa $0.005 für gemini-3-5-transcribe und etwa $0.009 für gemini-3-5-transcribe-live – Eingabe bei $2 gegenüber $3.50 pro Million Token, Ausgabe bei $12 gegenüber $21 pro Million Token. Beide haben heute eine kostenlose Stufe.
Das Premium-Paket erkauft den Echtzeit-Pfad, nicht mehr Genauigkeit: Sie zahlen etwa 80 % mehr pro Minute für den Streaming-Endpunkt, und er transkribiert mit einer höheren WER. Das ist die ehrliche Darstellung. Das vorab aufgezeichnete Modell ist sowohl günstiger als auch genauer; das Streaming-Modell existiert, weil einige Produkte nicht warten können, bis die Datei vollständig verarbeitet ist.
Auf welchem Endpunkt solltest du aufbauen?
• Live-Untertitel und Untertitel — Gemini 3.5 Transcribe Live, und prüfen Sie das No-Timestamps-Limit, wenn Sie zeitlich abgestimmte Ausgaben benötigen.
• Sprachagenten — Gemini 3.5 Transcribe Live zur Absichtserkennung mitten im Satz; planen Sie das 10-Minuten-Limit für lange Sitzungen ein.
• Meetings, Interviews, Archivierung — Gemini 3.5 Transcribe, mit 2,6% WER, Sprecherzuordnung und Zeitstempeln auf Wortebene.
• Post-Call-Analysen — Gemini 3.5 Transcribe für die fertige Aufzeichnung; Gemini 3.5 Transcribe Live nur, wenn die Analyse während des Anrufs laufen muss.
• Langes durchgehendes Audio — Gemini 3.5 Transcribe, denn eine 60-minütige Datei schlägt das manuelle Zusammenstückeln von zehnminütigen Live-Sitzungen.

Die Ebene über dem Transkript
Keines der Modelle wird von OrcaRouter gehostet – wir routen heute keine Sprach-zu-Text-Verarbeitung, und Sie rufen für beide Endpunkte direkt die API von Google auf. Die Aufgabe einer Routing-Schicht in einer Sprach-Pipeline besteht darin, oberhalb des Transkripts zu sitzen: der Zusammenfasser, der Entitätsextraktor, das Aktionspunkt-Modell, das einen Stream in eine Entscheidung verwandelt. Genau in dieser Schicht verdient OrcaRouter seine Daseinsberechtigung – eine API für über 200 Modelle zum Listenpreis der Anbieter ohne Aufschlag, automatisches Failover zwischen den Anbietern und eine Routing-DSL, die mehrere Modelle zu einem einzigen Aufruf kombiniert. Wählen Sie den Transkriptions-Endpunkt je nach Arbeitslast und führen Sie dann das Modell, das das Transkript liest, hinter einem einzigen Schlüssel aus.
Fazit
Gemini 3.5 Transcribe Live und Gemini 3.5 Transcribe gehören zur gleichen Familie und sind unterschiedliche Produkte. Wählen Sie Live, wenn das Transkript vor Ende des Gesprächs vorliegen muss und Sie mit einer 10-minütigen Sitzung, ohne Sprecherkennzeichnung und ohne Zeitstempel leben können. Wählen Sie Transcribe, wenn die Ausgabe eine Aufzeichnung ist und Genauigkeit und Zuordnung wichtiger sind als Geschwindigkeit – es ist günstiger, genauer und weitaus weniger eingeschränkt. Die einzige falsche Antwort ist anzunehmen, dass ein Endpunkt beides erledigt.
