Hero-Titelkarte für „Gemini 3.5 Transcribe vs. Whisper Large v3 Turbo“ mit dem Untertitel „Muss die Baseline ersetzt werden?“: links eine verwaltete API-Karte mit der Beschriftung Gemini 3.5 Transcribe bei 2,6 % WER (Non-Streaming), rechts eine Open-Weight-Karte mit der Beschriftung Whisper Large v3 Turbo bei 2,1 % LibriSpeech clean, mit MIT-Badge und 809M-Tag, sowie das OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Gemini 3.5 Transcribe vs. Whisper Large v3 Turbo: Muss die Baseline ersetzt werden?

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Für einen großen Teil der Branche steht „speech-to-text“ standardmäßig für Whisper Large v3 Turbo, und Gemini 3.5 Transcribe ist das erste Google-Transkriptionsmodell, das ausdrücklich als Herausforderer dieser Basislinie vermarktet wird statt als generische Sprach-API. Gemini 3.5 Transcribe, seit dem 26. August 2026 in öffentlicher Vorschau, betrachtet Transkription neu als Denkaufgabe – es verarbeitet Selbstkorrekturen, formatiert die Ausgabe, ordnet Sprecher zu und ruft eigenständig andere Gemini-Modelle auf. Whisper Large v3 Turbo ist eine Destillation von Whisper Large-v3 durch OpenAI mit 809 Millionen Parametern, MIT-lizenziert, selbst hostbar, für 99 Sprachen geeignet und je nach Hardware etwa vier- bis achtmal schneller als das Modell, aus dem es destilliert wurde. Das eine ist eine verwaltete Intelligenzschicht für Audio; das andere ist eine kostenlose, gut verstandene Komponente, die Sie überall ausführen, wo Sie möchten. Die Frage, die diese Seite beantworten soll, ist enger und nützlicher als „Welches ist besser?“: Wann ist die Basislinie nicht mehr gut genug?

Die Baseline, falls du vergessen hast, wie gut sie ist.

Whisper Large v3 Turbo verdient seinen Standardstatus, daher kommt zuerst das Argument dafür:

• Es läuft überall — MIT-Lizenz, offene Gewichte, installierbar auf einem Laptop, einer einzelnen GPU oder einer serverlosen Funktion. Kein Anbieter, kein Zähler, keine Daten, die Ihr Netzwerk verlassen.

• Es ist schnell — der destillierte Decoder (32 Encoder-Schichten, 4 Decoder-Schichten statt 32) macht es auf typischer Hardware etwa viermal schneller als Whisper Large-v3, auf mancher sogar noch mehr, wobei die Genauigkeit größtenteils erhalten bleibt. Ope​nAI selbst gibt etwa das Achtfache auf einer A100 an.

Es deckt 99 Sprachen für die Transkription ab, eine breitere Liste als die 85+ von Gemini 3.5 Transcribe.

Seine Genauigkeit ist gut dokumentiert: 2,1 % WER auf LibriSpeech test-clean, 4,2 % auf test-other, 9,1 % auf Common Voice English – Zahlen, die seit Jahren in der Community reproduziert wurden.

Das Ökosystem ist riesig — faster-whisper, whisper.cpp, ONNX-Exporte und jedes Inferenz-Framework, das du bereits verwendest. Wenn du ein Modell ausführen kannst, dann auch dieses.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

Für die Batch-Transkription von Englisch und englischnahen Inhalten in großem Maßstab ist Whisper Large v3 Turbo aus strukturellen Gründen der Platzhirsch, die keine Benchmark-Lücke leicht umstoßen kann: Es ist kostenlos, es gehört Ihnen, und es ist überall.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Was Gemini 3.5 Transcribe zusätzlich bietet

Der Wert des verwalteten Herausforderers liegt nicht darin, dass er bei sauberem Englisch die Baseline schlägt – das ist ein Kampf, den die Zahlen noch nicht einmal sauber entscheiden können. Sein Wert liegt in der Arbeit oberhalb der Wörter, die Whisper ausdrücklich nicht leistet:

• Sprecherzuordnung — bis zu drei Sprecher mit Wort-für-Wort-Zeitstempeln, im Basismodell. Whisper transkribiert einen einzigen Sprachstrom; es hat kein Konzept davon, wer was gesagt hat.

• {{1}}Intelligente Formatierung{{/1}} — {{2}}Unflüssigkeiten entfernt, Selbstkorrekturen aufgelöst, Zeichensetzung und Groß- und Kleinschreibung angewendet{{/2}}. Whisper gibt die Wörter so wieder, wie sie gesprochen wurden, einschließlich aller Ähs und Ähms.

• Benutzerdefiniertes Vokabular — bevorzugt Fachjargon und ungewöhnliche Schreibweisen. Whisper hat keinen solchen Mechanismus; Sie müssen nachbearbeiten oder feinabstimmen.

• Funktionsaufruf — das Transkript kann an andere G​emini-Modelle übergeben werden, sodass die Transkription zu einem Schritt in einer Agent-Pipeline wird und nicht zur Endausgabe.

• Lange Sitzungen — etwa eine Stunde Audio in einem Durchgang (laut Presseberichten 96K-Kontext) gegenüber Whispers praktischer Notwendigkeit, lange Dateien in Blöcke aufzuteilen und zusammenzusetzen.

Das ist ein anderes Produkt. Es ist das, was Google mit „intelligenter Transkription“ meint, und es ist der Teil des Vergleichs, der nicht von Benchmark-Arithmetik abhängt.

Die Genauigkeitsfrage, die noch niemand sauber beantworten kann

Die Kernzahlen der beiden Modelle lassen sich nicht wirklich direkt gegenüberstellen. Gemini 3.​5 Transcribe weist eine nicht-Streaming-WER von 2,6 % auf, eine Messung von Artificial Analysis, die von Go​ogle zitiert wird und über 85+ Sprachen berechnet wurde. Whisper Large v3 Turbo erreicht 2,1 % auf LibriSpeech test-clean, ein englischer Benchmark aus Ope​nAIs eigenem Distillations-Paper, der vielfach repliziert wurde. Verschiedene Korpora, unterschiedliche Sprachabdeckung, verschiedene Anbieter. Was sich ehrlich sagen lässt: Bei sauberem Englisch liegen die offene Baseline und der verwaltete Herausforderer plausibel in derselben Größenordnung, und der Vorteil des verwalteten Modells liegt in seinen mehrsprachigen und strukturellen Funktionen, nicht in einem nachgewiesenen englischen WER-Sieg. Go​ogles Launch-Materialien enthalten keinen direkten Vergleich mit Modellen der Whisper-Familie, und ein unabhängiger adversarischer Vergleich existiert noch nicht, da Gemini 3.​5 Transcribe erst seit einem Tag öffentlich ist. Bis ein solcher Vergleich auftaucht, bleibt die Genauigkeitskrone unvergeben, und jeder Artikel – einschließlich dieses – der auf Basis dieser beiden Zahlen einen WER-Sieger ausruft, greift zu weit.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Kosten: kostenlos auszuführen, gegenüber 0,005 $ pro Minute

{{1}}Whisper Large v3 Turbo{{/1}} hat Hardwarekosten, aber keinen Nutzungszähler. Wenn Sie es auf einer GPU ausführen, die Sie bereits besitzen, sind die Grenzkosten pro transkribierter Minute nahezu null; mieten Sie eine GPU, zahlen Sie schlicht die Instanzkosten, solange sie läuft. {{2}}Gemini 3.​5 Transcribe{{/2}} verlangt grob 0,005 $ pro Minute Audio im Durchschnitt, wobei die Live-SKU bei etwa 0,009 $ pro Minute liegt und eine kostenlose Stufe verfügbar ist. Bei tausend Stunden Audio sind das etwa 300 $ auf dem {{3}}G​emini{{/3}}-Zähler gegenüber ein paar Dollar GPU-Zeit auf der offenen Basislinie. Diese Lücke ist die eigentliche Kostengeschichte dieses Vergleichs und der Grund, warum die Basislinie ihren Status als Standard für hochvolumige englische Batch-Arbeit noch lange behalten wird. Die Kostenrechnung des verwalteten Modells geht nur dann auf, wenn die Funktionen, die es bündelt — Diarisierung, Formatierung, Vokabularsteuerung — selbst Engineering-Zeit kosten würden, um sie auf Whisper aufzusetzen.

Sprachen und Streaming

Whisper Large v3 Turbo listet 99 Sprachen gegenüber G​eminis 85+ auf, aber die praktische Realität der Mehrsprachigkeit sieht anders aus: Whisper transkribiert alle 99 in einem Durchgang ohne automatische Erkennung, und seine Genauigkeit leidet am stärksten bei ressourcenarmen und verrauschten Sprachen – die Kehrseite eines destillierten Modells. G​emini erkennt automatisch aus seinen 85+ Sprachen, und Go​ogle hebt regionale Akzente und Dialekte hervor. Für Streaming hat Whisper kein natives Echtzeitmodell; Echtzeit-Bereitstellungen nutzen faster-whisper und ähnliche Frameworks auf eigener Hardware, während Gemini 3.​5 Transcribe einen speziell entwickelten Live-Endpunkt bietet – mit behaupteter Sub-Sekunden-Latenz und entsprechendem Preis. Wenn Ihre Arbeitslast live und mehrsprachig ist, ist der verwaltete Endpunkt einfacher zu betreiben; wenn sie Batch und Englisch ist, ist das offene Basismodell günstiger.

Das Urteil, so wie es ist

Whisper Large v3 Turbo bleibt die richtige Standardwahl für die Stapeltranskription von englischem Audio in großem Maßstab, für alles, was auf Ihrer eigenen Infrastruktur laufen muss, und für Teams, die ein eingefrorenes, auditierbares Artefakt wünschen. Gemini 3.​5 Transcribe ist die richtige Wahl, wenn das Transkript mehr als nur Wörter sein muss — Sprecherkennzeichnungen, saubere Formatierung, Fachvokabular, mehrsprachige Abdeckung oder ein Agenten-Hook — und wenn Sie bereit sind, für diese Funktionen zu zahlen. Die beiden koexistieren, und das Muster, das die Koexistenz günstig macht, ist eine Routing-Grenze: das Transkriptionsmodell, das zum Audio passt, und dann die LLM-Schicht, die entscheidet, was mit dem Text geschieht. Genau diese Schicht betreibt OrcaRouter — eine API für über 200 Modelle, automatisches Failover über Anbieter hinweg und eine Routing-DSL, um mehrere Modelle in einem einzigen Aufruf zu kombinieren. Keines der beiden Sprachmodelle wird auf unserer Seite gehostet; die Transkriptionswahl liegt zwischen Ihrer GPU und Go​ogles Zähler, und beide werden noch lange Bestand haben.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube