
Intelligente Transkription mit Gemini 3.5 Transcribe
- 智谱NEUZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 pro 1 Mio. Tokens
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
Gemini 3.5 Transcribe ging am 26. August 2026 in die öffentliche Vorschau und ist das erste Google-Spracherkennungsmodell, das tatsächlich als Gemini-Modell verkauft wird: Man ruft es über die Gemini-API mit einer Modell-ID auf, das Audio wird in Token abgerechnet, und Google beziffert die Kosten pro Audiominute auf seiner Preisseite. Dieses letzte Detail geht in der Berichterstattung für Verbraucher unter. Die Geschichten zum Starttag drehen sich um das Entfernen von Füllwörtern und die Sprachbearbeitung in Gboard, aber was sich für Entwickler tatsächlich geändert hat, ist, dass die Transkription nun auf derselben API-Oberfläche sitzt wie der Rest der Gemini-Produktlinie – mit Sprecherzuordnung und Wort-Zeitstempeln im Basismodell statt in einem separaten Zusatzmodul. Dieser Beitrag liest sich wie eine API-Referenz, denn genau diese Lücke lässt die erste Welle der Berichterstattung offen.
Zwei Vorbehalte vorab, damit die folgenden Zahlen nicht in die Irre führen. Google bezeichnet Gemini 3.5 Transcribe nicht als „das genaueste Sprach-zu-Text-Modell, das wir haben“ – die Behauptung ist, dass es das präziseste Modell für intelligente Sprachinteraktionen ist, was eine andere Behauptung ist, und dieser Unterschied ist wichtig, wenn man die WER-Zahlen liest. Und alles hier beschreibt eine öffentliche Vorschau: die beiden Modell-IDs, die Preise und die Benchmark-Zahlen entsprechen dem, was Google heute ausliefert, und alles kann sich vor der allgemeinen Verfügbarkeit (GA) ändern.
Die zwei API-Pfade – und die Modell-IDs, die man sich merken sollte.
Gemini 3.5 Transcribe wird als zwei Endpunkte ausgeliefert, und die Wahl des richtigen ist die erste architektonische Entscheidung, die ein Team trifft:
• gemini-3-5-transcribe – der Pfad für vorab aufgezeichnete Audiodaten über die Interactions API. Senden Sie eine Datei und erhalten Sie das Transkript mit Sprecherzuordnung (bis zu drei Sprechern; mehr als drei sind experimentell) und Wort-für-Wort-Zeitstempeln. Dies ist das Arbeitstier für Batch- und asynchrone Verarbeitung.
• gemini-3-5-transcribe-live — der Echtzeit-Pfad über die Live-API. Bidirektionales Streaming mit Latenzen unter einer Sekunde, ausgerichtet auf Live-Gespräche, Untertitelung und sprachgesteuerte Schnittstellen.
Die Aufteilung spiegelt wider, wie der Rest der Gemini-Audio-Familie strukturiert ist, und das ist wichtig, denn „live“ ist eine eigene SKU mit eigenem Preis. Mehrere frühe Einschätzungen dieser Markteinführung gehen davon aus, dass ein Modell beides kann; das ist nicht der Fall.

Was "intelligente Transkription" tatsächlich bedeutet
Googles Ankündigungsbeitrag stellt dies als einen Schritt über die phonetische Genauigkeit hinaus in Richtung Verständnis dar. Die Funktionen, die sich aus dieser Rahmung ergeben, sind zu bewerten, nicht die Rahmung selbst:
• Umgang mit Disfluenzen – „ähm“ und „äh“ werden weggelassen, und Selbstkorrekturen werden aufgelöst. „Lass uns am Dienstag treffen – nein, am Mittwoch“ wird als der korrigierte Tag transkribiert, nicht als Transkript eines Fehlstarts. Das ist eine Entscheidung, die das Modell trifft, und genau in diesem Sinne nennt Google es intelligent.
• Automatische Formatierung — die Ausgabe erfolgt als formatierter Text: Zeichensetzung, Groß-/Kleinschreibung und Absatzstruktur werden angewendet, nicht als roher Token-Stream.
• Multi-Sprecher-Identifizierung — bis zu drei Sprecher werden in vorab aufgezeichnetem Audio mit Wort-Zeitstempeln zugeordnet; bei drei oder mehr Sprechern ist die Funktion experimentell. Dies ist im Basismodell enthalten und nicht Teil eines separaten Diarisierungsdienstes.
• Benutzerdefiniertes Vokabular — Sie können die Erkennung auf Fachjargon, Produktnamen und ungewöhnliche Schreibweisen ausrichten, indem Sie ein Vokabular bereitstellen, was den Mechanismus für vertikale Domänen darstellt.
• 85+ Sprachen — automatische Erkennung, mit expliziter Hervorhebung regionaler Akzente und Dialekte.
• Function Calling — das Modell kann Aufgaben wie Bildgenerierung oder Dateianalyse an andere Gemini-Modelle delegieren, wodurch Transkription zu einem Bestandteil eines größeren Agenten wird, anstatt nur ein Endschritt zu sein.
• Entitätserfassung — Google gibt eine starke Leistung bei verrauschten, realen Audiodaten und bei alphanumerischen Entitäten wie Postleitzahlen und Bestell-IDs an.
Die Presseberichterstattung hat zudem ein Kontextfenster von 96.000 Token (etwa eine Stunde Meeting-Audio ohne Aufteilung) und Emotionserkennung gemeldet. Beides passt zur Launch-Rahmung, aber die von Google veröffentlichte Modellkarte hebt diese Punkte nicht hervor, daher sollten sie bis zum Erscheinen eines GA-Datenblatts als berichtet und nicht als bestätigt behandelt werden.

Die Genauigkeitszahlen, beschriftet
Die von Google zitierten WER-Werte stammen von Artificial Analysis: eine durchschnittliche Wortfehlerrate von 4,0 % für Streaming- und 2,6 % für Nicht-Streaming-Transkription. Beim mehrsprachigen FLEURS-Benchmark gibt Google 5,50 % WER für Streaming und 5,04 % für Nicht-Streaming an. Google beansprucht außerdem eine 70-prozentige Verbesserung der Zeit bis zur endgültigen Transkription gegenüber seinem Vorgänger Chirp 3.
Die ehrliche Lesart: Das sind unabhängige Messungen in dem Sinne, dass Artificial Analysis nicht Google ist, aber es sind von Google ausgewählte Messungen, veröffentlicht in Googles eigener Ankündigung, von einem Modell, das erst seit einem Tag aufrufbar ist. Niemand außerhalb von Google hat bisher einen adversarischen Direktvergleich mit den Open-Weight-Modellen durchgeführt, mit denen die meisten Teams es vergleichen, und die Einführungsmaterialien enthalten keinen direkten Vergleich mit der Whisper-Familie oder NVIDIAs Parakeet-Linie. Die Angabe „70 % schneller als Chirp-3“ ist eine Herstellerbehauptung, Punkt. Behandeln Sie 2,6 % und 4,0 % als starke frühe Signale, nicht als gesicherte Fakten.
Was es kostet
Die Preisseite von Google führt für jedes Modell sowohl Tokens als auch geschätzte Audiominuten auf. Für gemini-3-5-transcribe ergibt sich bei Listenpreisen ein Mischpreis von etwa 0,005 $ pro Audiominute – Eingabe etwa 0,003 $/Min, Ausgabe etwa 0,002 $/Min. Für gemini-3-5-transcribe-live liegt der Mischpreis bei etwa 0,009 $ pro Minute. Beide Modelle haben derzeit eine kostenlose Stufe.
Diese Pro-Minuten-Zahlen sind Schätzungen, die aus einer angenommenen Token-Rate abgeleitet sind (25 Audio-Token pro Sekunde Eingabe, 175 Text-Token pro Minute Ausgabe), sie verschieben sich also, wenn Google die Token-Abrechnung ändert. Was feststeht, ist das Prinzip: Der Listenpreis ist der Preis. Genau nach diesem Prinzip arbeitet ein Pass-through-Router wie OrcaRouter — 0% Aufschlag, Listenpreis des Anbieters wird durchgereicht — wenn Google also die Transkriptionspreise während des Preview-to-GA-Zeitraums senkt, ist die Senkung bei uns am selben Tag live, nicht erst nachdem ein Wiederverkäufer eine Preistabelle aktualisiert.
Wo es ausgerollt wird
Für Entwickler bedeutet die öffentliche Vorschau heute zwei Oberflächen: die Gemini API in Google AI Studio und die Gemini Enterprise Agent Platform für Unternehmens-Workloads. Auf der Verbraucherseite treibt Gemini 3.5 Transcribe bereits die Rambler-Diktierfunktion in Gboard auf Android an und die Gemini-App auf macOS. Chrome ist als Nächstes dran – Talk-to-Type in jedem Web-Feld – gefolgt von Search Live, Gemini Live, Docs, Keep und Gmail. Für ein Team, das es evaluiert, ist die praktische Antwort einfacher: Es ist heute aus Code aufrufbar, auf Englisch, in den Regionen, in denen die Gemini API verfügbar ist.

Was das für Ihre Pipeline bedeutet
Das wirklich Neue ist keine WER-Zahl. Es ist, dass Google jetzt Transkription mit den beiden Funktionen, die Teams zuvor selbst zusammengestellt haben – Sprecherlabels und wortgenaue Zeitstempel –, im Basismodell und auf einer Gemini-API-Oberfläche anbietet, die Funktionsaufrufe unterstützt. Wenn Sie eine Pipeline für diarisierte Meeting-Notizen aus einem einfachen Transkriptor, einem separaten Diarisierer und einem Formatierungsschritt aufgebaut haben, ist dies das erste Google-Modell, das diese Schritte zusammenführt. Die offene Frage ist, wie sich die 2,6 % Nicht-Streaming-WER auf Ihrem eigenen Audio schlägt, und bis eine unabhängige Reproduktion vorliegt, ist der verantwortungsvolle Schritt für ein Produktionsteam, eine echte Stichprobe über die API zu schicken, anstatt mit Googles gewählten Benchmarks zu kalkulieren. Für die LLM-Arbeit, die auf dem Transkript aufbaut – Zusammenfassung, strukturierte Extraktion, Aktionspunkte – ist das die Ebene, auf der Routing seinen Wert beweist, und sie ist die Ebene, die OrcaRouter abdeckt: eine API für über 200 Modelle, automatisches Failover über Anbieter hinweg und eine Routing-DSL, die mehrere Modelle zu einem einzigen Aufruf kombiniert. Den Transkriptionsschritt selbst sollten Sie mit Ihrem eigenen Audio testen, bevor Sie irgendeiner Schlagzeilen-Zahl vertrauen.
