Hero-Titelkarte für „Intelligente Transkription mit Gemini 3.5 Transcribe“, die eine Schallwellenform zeigt, die sich in formatierten Text verwandelt, einen Globus mit 85+ Sprachen, Sprecherlabel-Chips, die Schlagzeilenzahlen 2,6 % WER (Non-Streaming) und ~0,005 $/min (gemischt) sowie das OrcaRouter-Logo in der unteren rechten Ecke.
Engineering & Research

Intelligente Transkription mit Gemini 3.5 Transcribe

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Gemini 3.​5 Transcribe ging am 26. August 2026 in die öffentliche Vorschau und ist das erste Go​ogle-Spracherkennungsmodell, das tatsächlich als G​emini-Modell verkauft wird: Man ruft es über die G​emini-API mit einer Modell-ID auf, das Audio wird in Token abgerechnet, und Go​ogle beziffert die Kosten pro Audiominute auf seiner Preisseite. Dieses letzte Detail geht in der Berichterstattung für Verbraucher unter. Die Geschichten zum Starttag drehen sich um das Entfernen von Füllwörtern und die Sprachbearbeitung in Gboard, aber was sich für Entwickler tatsächlich geändert hat, ist, dass die Transkription nun auf derselben API-Oberfläche sitzt wie der Rest der G​emini-Produktlinie – mit Sprecherzuordnung und Wort-Zeitstempeln im Basismodell statt in einem separaten Zusatzmodul. Dieser Beitrag liest sich wie eine API-Referenz, denn genau diese Lücke lässt die erste Welle der Berichterstattung offen.

Zwei Vorbehalte vorab, damit die folgenden Zahlen nicht in die Irre führen. Go​ogle bezeichnet Gemini 3.​5 Transcribe nicht als „das genaueste Sprach-zu-Text-Modell, das wir haben“ – die Behauptung ist, dass es das präziseste Modell für intelligente Sprachinteraktionen ist, was eine andere Behauptung ist, und dieser Unterschied ist wichtig, wenn man die WER-Zahlen liest. Und alles hier beschreibt eine öffentliche Vorschau: die beiden Modell-IDs, die Preise und die Benchmark-Zahlen entsprechen dem, was Go​ogle heute ausliefert, und alles kann sich vor der allgemeinen Verfügbarkeit (GA) ändern.

Die zwei API-Pfade – und die Modell-IDs, die man sich merken sollte.

Gemini 3.5 Transcribe wird als zwei Endpunkte ausgeliefert, und die Wahl des richtigen ist die erste architektonische Entscheidung, die ein Team trifft:

• gemini-3-5-transcribe – der Pfad für vorab aufgezeichnete Audiodaten über die Interactions API. Senden Sie eine Datei und erhalten Sie das Transkript mit Sprecherzuordnung (bis zu drei Sprechern; mehr als drei sind experimentell) und Wort-für-Wort-Zeitstempeln. Dies ist das Arbeitstier für Batch- und asynchrone Verarbeitung.

• gemini-3-5-transcribe-live — der Echtzeit-Pfad über die Live-API. Bidirektionales Streaming mit Latenzen unter einer Sekunde, ausgerichtet auf Live-Gespräche, Untertitelung und sprachgesteuerte Schnittstellen.

Die Aufteilung spiegelt wider, wie der Rest der G​emini-Audio-Familie strukturiert ist, und das ist wichtig, denn „live“ ist eine eigene SKU mit eigenem Preis. Mehrere frühe Einschätzungen dieser Markteinführung gehen davon aus, dass ein Modell beides kann; das ist nicht der Fall.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

Was "intelligente Transkription" tatsächlich bedeutet

Googles Ankündigungsbeitrag stellt dies als einen Schritt über die phonetische Genauigkeit hinaus in Richtung Verständnis dar. Die Funktionen, die sich aus dieser Rahmung ergeben, sind zu bewerten, nicht die Rahmung selbst:

• Umgang mit Disfluenzen – „ähm“ und „äh“ werden weggelassen, und Selbstkorrekturen werden aufgelöst. „Lass uns am Dienstag treffen – nein, am Mittwoch“ wird als der korrigierte Tag transkribiert, nicht als Transkript eines Fehlstarts. Das ist eine Entscheidung, die das Modell trifft, und genau in diesem Sinne nennt Go​ogle es intelligent.

• Automatische Formatierung — die Ausgabe erfolgt als formatierter Text: Zeichensetzung, Groß-/Kleinschreibung und Absatzstruktur werden angewendet, nicht als roher Token-Stream.

• Multi-Sprecher-Identifizierung — bis zu drei Sprecher werden in vorab aufgezeichnetem Audio mit Wort-Zeitstempeln zugeordnet; bei drei oder mehr Sprechern ist die Funktion experimentell. Dies ist im Basismodell enthalten und nicht Teil eines separaten Diarisierungsdienstes.

• Benutzerdefiniertes Vokabular — Sie können die Erkennung auf Fachjargon, Produktnamen und ungewöhnliche Schreibweisen ausrichten, indem Sie ein Vokabular bereitstellen, was den Mechanismus für vertikale Domänen darstellt.

• 85+ Sprachen — automatische Erkennung, mit expliziter Hervorhebung regionaler Akzente und Dialekte.

• Function Calling — das Modell kann Aufgaben wie Bildgenerierung oder Dateianalyse an andere G​emini-Modelle delegieren, wodurch Transkription zu einem Bestandteil eines größeren Agenten wird, anstatt nur ein Endschritt zu sein.

• Entitätserfassung — Go​ogle gibt eine starke Leistung bei verrauschten, realen Audiodaten und bei alphanumerischen Entitäten wie Postleitzahlen und Bestell-IDs an.

Die Presseberichterstattung hat zudem ein Kontextfenster von 96.000 Token (etwa eine Stunde Meeting-Audio ohne Aufteilung) und Emotionserkennung gemeldet. Beides passt zur Launch-Rahmung, aber die von Google veröffentlichte Modellkarte hebt diese Punkte nicht hervor, daher sollten sie bis zum Erscheinen eines GA-Datenblatts als berichtet und nicht als bestätigt behandelt werden.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

Die Genauigkeitszahlen, beschriftet

Die von Go​ogle zitierten WER-Werte stammen von Artificial Analysis: eine durchschnittliche Wortfehlerrate von 4,0 % für Streaming- und 2,6 % für Nicht-Streaming-Transkription. Beim mehrsprachigen FLEURS-Benchmark gibt Go​ogle 5,50 % WER für Streaming und 5,04 % für Nicht-Streaming an. Go​ogle beansprucht außerdem eine 70-prozentige Verbesserung der Zeit bis zur endgültigen Transkription gegenüber seinem Vorgänger Chirp 3.

Die ehrliche Lesart: Das sind unabhängige Messungen in dem Sinne, dass Artificial Analysis nicht Go​ogle ist, aber es sind von Google ausgewählte Messungen, veröffentlicht in Go​ogles eigener Ankündigung, von einem Modell, das erst seit einem Tag aufrufbar ist. Niemand außerhalb von Go​ogle hat bisher einen adversarischen Direktvergleich mit den Open-Weight-Modellen durchgeführt, mit denen die meisten Teams es vergleichen, und die Einführungsmaterialien enthalten keinen direkten Vergleich mit der Whisper-Familie oder NVIDIAs Parakeet-Linie. Die Angabe „70 % schneller als Chirp-3“ ist eine Herstellerbehauptung, Punkt. Behandeln Sie 2,6 % und 4,0 % als starke frühe Signale, nicht als gesicherte Fakten.

Was es kostet

Die Preisseite von Google führt für jedes Modell sowohl Tokens als auch geschätzte Audiominuten auf. Für gemini-3-5-transcribe ergibt sich bei Listenpreisen ein Mischpreis von etwa 0,005 $ pro Audiominute – Eingabe etwa 0,003 $/Min, Ausgabe etwa 0,002 $/Min. Für gemini-3-5-transcribe-live liegt der Mischpreis bei etwa 0,009 $ pro Minute. Beide Modelle haben derzeit eine kostenlose Stufe.

Diese Pro-Minuten-Zahlen sind Schätzungen, die aus einer angenommenen Token-Rate abgeleitet sind (25 Audio-Token pro Sekunde Eingabe, 175 Text-Token pro Minute Ausgabe), sie verschieben sich also, wenn Go​ogle die Token-Abrechnung ändert. Was feststeht, ist das Prinzip: Der Listenpreis ist der Preis. Genau nach diesem Prinzip arbeitet ein Pass-through-Router wie OrcaRouter — 0% Aufschlag, Listenpreis des Anbieters wird durchgereicht — wenn Go​ogle also die Transkriptionspreise während des Preview-to-GA-Zeitraums senkt, ist die Senkung bei uns am selben Tag live, nicht erst nachdem ein Wiederverkäufer eine Preistabelle aktualisiert.

Wo es ausgerollt wird

Für Entwickler bedeutet die öffentliche Vorschau heute zwei Oberflächen: die G​emini API in Go​ogle AI Studio und die G​emini Enterprise Agent Platform für Unternehmens-Workloads. Auf der Verbraucherseite treibt Gemini 3.​5 Transcribe bereits die Rambler-Diktierfunktion in Gboard auf Android an und die G​emini-App auf macOS. Chrome ist als Nächstes dran – Talk-to-Type in jedem Web-Feld – gefolgt von Search Live, G​emini Live, Docs, Keep und Gmail. Für ein Team, das es evaluiert, ist die praktische Antwort einfacher: Es ist heute aus Code aufrufbar, auf Englisch, in den Regionen, in denen die G​emini API verfügbar ist.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Was das für Ihre Pipeline bedeutet

Das wirklich Neue ist keine WER-Zahl. Es ist, dass Go​ogle jetzt Transkription mit den beiden Funktionen, die Teams zuvor selbst zusammengestellt haben – Sprecherlabels und wortgenaue Zeitstempel –, im Basismodell und auf einer G​emini-API-Oberfläche anbietet, die Funktionsaufrufe unterstützt. Wenn Sie eine Pipeline für diarisierte Meeting-Notizen aus einem einfachen Transkriptor, einem separaten Diarisierer und einem Formatierungsschritt aufgebaut haben, ist dies das erste Go​ogle-Modell, das diese Schritte zusammenführt. Die offene Frage ist, wie sich die 2,6 % Nicht-Streaming-WER auf Ihrem eigenen Audio schlägt, und bis eine unabhängige Reproduktion vorliegt, ist der verantwortungsvolle Schritt für ein Produktionsteam, eine echte Stichprobe über die API zu schicken, anstatt mit Go​ogles gewählten Benchmarks zu kalkulieren. Für die LLM-Arbeit, die auf dem Transkript aufbaut – Zusammenfassung, strukturierte Extraktion, Aktionspunkte – ist das die Ebene, auf der Routing seinen Wert beweist, und sie ist die Ebene, die OrcaRouter abdeckt: eine API für über 200 Modelle, automatisches Failover über Anbieter hinweg und eine Routing-DSL, die mehrere Modelle zu einem einzigen Aufruf kombiniert. Den Transkriptionsschritt selbst sollten Sie mit Ihrem eigenen Audio testen, bevor Sie irgendeiner Schlagzeilen-Zahl vertrauen.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube