
MAI-Transcribe-2-Streaming vs. Gemini 3.5 Transcribe Live: Gleiche 9 $, andere Abwägung
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 221 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
MAI-Transcribe-2-Streaming und Gemini 3.5 Transcribe Live kosten gleich viel und beruhen auf gegensätzlichen Theorien darüber, wofür ein Streaming-Transkriptor da ist. Beide liegen bei ungefähr 9,00 $ pro 1.000 Minuten gestreamtem Audio. Microsofts Modell, veröffentlicht am 1. Oktober 2026, ist ein Präzisionsinstrument: eine beanspruchte Streaming-Wortfehlerrate von 2,5 % bei 0,13 Sekunden bis zum Endtranskript, laut Microsofts eigener Darstellung an erster Stelle bei der Genauigkeit sowohl für End- als auch für Teiltranskripte, gemessen anhand der Streaming-Methodik von Artificial Analysis, aber noch nicht als Zeile auf diesem Board verzeichnet. Das andere Modell, seit dem 26. August 2026 in öffentlicher Vorschau und über die Live-API bereitgestellt, ist ein Abdeckungsinstrument: 85+ Sprachen mit Umschalten mitten im Stream, eine kostenlose Stufe und eine Streaming-Wortfehlerrate von 4,00 % bei 0,40 Sekunden – der Wert, den Artificial Analysis dafür misst. Keines ist die offensichtliche Wahl, und der Grund dafür ist, dass sie nicht wirklich um dieselbe Arbeitslast konkurrieren.
Hier ist der direkte Vergleich, so wie die Zahlen tatsächlich lauten – vom Anbieter gemeldete Zahlen sind gekennzeichnet, Tracker-Zahlen sind zugeordnet, und die Punkte, an denen ein Modell in einer Dimension gewinnt, die das andere überhaupt nicht bestreitet.
Die einzeilige Version
• Genauigkeit und Latenz – MAI-Transcribe-2-Streaming, nach den veröffentlichten Zahlen. Microsoft behauptet 2,5 % Streaming-WER bei 0,13 Sekunden bis zum finalen Transkript, den ersten Platz bei der Genauigkeit sowohl bei finalen als auch bei partiellen Transkripten und 2,5 % beim ersten partiellen Transkript bei 0,12 Sekunden. Dagegen führt Artificial Analysis Gemini 3.5 Transcribe Live mit 4,00 % bei 0,40 Sekunden. Microsofts beanspruchter Vorsprung beträgt 1,5 Punkte, und die Zeit bis zum endgültigen Transkript ist etwa dreimal kürzer. Der Vorbehalt ist, dass der Tracker MAI-Transcribe-2-Streaming selbst noch nicht aufgeführt hat – der aktuelle Spitzenreiter der Bestenliste ist Grok Voice Transcribe 2.0 mit 2,73 % und 0,49 Sekunden, während Muse Voice Transcribe bei 3,06 % und 0,16 Sekunden liegt –, sodass die 2,5 % ein Anbieterwert sind, der vor dem Hintergrund eines Feldes gelesen wird, das der Tracker tatsächlich misst. Auf der Achse, die beide Modelle veröffentlichen, ist es keine knappe Entscheidung, aber nur eine Seite davon ist unabhängig veröffentlicht.
• Sprachbreite — Gemini 3.5 Transcribe Live. Über 85 Sprachen mit automatischer Erkennung und der Möglichkeit, die Sprache mitten im Stream zu wechseln, ohne die Sitzung neu zu starten – Googles zentrale Aussage für die Live API. MAI-Transcribe-2-Streaming deckt 60 Sprachen mit automatischer kontinuierlicher Spracherkennung ab. Microsofts Untergrenze ist höher; Googles Obergrenze ist weiter, und die Lücke von 25 Sprachen betrifft überwiegend Sprachen, in denen ein einsprachiges Streaming-Modell überhaupt nicht nutzbar ist.
• Sitzungsform — Gemini 3.5 Transcribe Live, und das ist ein zweischneidiges Schwert. Die Live API ist eine WebSocket-Sitzung, die auf 10 Minuten begrenzt ist, was für einen Turn eines Voice-Agents in Ordnung ist, für ein einstündiges Meeting aber unangenehm; Microsoft veröffentlicht für sein Streaming-Modell keine vergleichbare Sitzungsobergrenze, was wichtig ist, wenn Ihre Arbeitseinheit ein Anruf und nicht ein Gesprächs-Turn ist.
• Einstiegskosten — Gemini 3.5 Transcribe Live. Es gibt eine kostenlose Stufe, und Googles kombinierter Satz beläuft sich beim tokenbasierten Preismodell auf etwa $0,009 pro Minute. Microsofts $0,54 pro Audio-Stunde sind ein Einführungspreis, der laut Microsoft bis zum Jahresende gilt, wobei kein Standardpreis bekannt gegeben wurde — dieselbe Struktur wie bei seiner Batch-Einführung im September.

Warum die Genauigkeitslücke größer ist, als sie aussieht
Eine Wortfehlerraten-Lücke von 1,5 Punkten klingt wie ein Rundungsunterschied, bis man sie beziffert. Bei 4,00 % Streaming-WER macht Gemini 3.5 Transcribe Live ungefähr 40 Wörter pro 1.000 falsch; bei den von Microsoft beanspruchten 2,5 % macht MAI-Transcribe-2-Streaming 25 falsch. Bei den Volumina, die eine Echtzeit-Pipeline produziert – eine Support-Organisation, die monatlich 5.000 Stunden Anrufe abwickelt, entspricht das 300.000 Minuten, mehr als 45 Millionen Wörtern bei Konversationsgeschwindigkeit – bedeutet diese Spanne jährlich Millionen falscher Wörter, konzentriert auf die Entitäten, auf die nachgelagerte Systeme angewiesen sind: Kontonamen, Ticketnummern, Dosierungen, Adressen.
Der Latenzunterschied ist der schwieriger zu verkaufende Punkt. Ein Unterschied von 0,13 Sekunden gegenüber 0,40 Sekunden nach dem Ende des Sprechens ist in einem Live-Untertitelstream wahrnehmbar – unter etwa 0,2 Sekunden wirkt er simultan, und eine Drittelsekunde wirkt, als würde das Transkript dem Sprecher hinterherjagen – aber in einem Agent-Assist-Panel, das sich auf einer menschlichen Zeitskala aktualisiert, ist er nicht wahrnehmbar. Wenn Ihr Konsument eine mitlesende Person ist, ist Microsofts Latenzvorsprung das Produkt. Wenn Ihr Konsument ein Modell ist, das das endgültige Transkript bekommt, wenn der Turn endet, ist er eine Zahl.
Beide Zahlen tragen denselben Vorbehalt, und es lohnt sich, ihn einmal festzuhalten: Dies sind Zahlen aus einem einzigen Lauf von einem Tracking-Board mit 37 Modellen, und der Abstand zwischen Platz eins und Platz drei auf diesem Board liegt unter einem Punkt. Ein erneuter Lauf kann die Spitze der Streaming-Bestenliste so durcheinanderwirbeln, wie es ein Zwei-Punkte-Abstand auf dem Batch-Board nicht kann. Auch Microsofts 2,5 % stehen noch überhaupt nicht auf dem Board – es ist eine Herstellerangabe, gemessen nach der Methodik des Trackers, was etwas anderes ist als eine Zeile, die der Tracker veröffentlicht.
Die Grenzen sind dort, wo die Entscheidung tatsächlich liegt.
Feature-Grenzen scheiden diese beiden schneller als Benchmarks, und sie verlaufen in entgegengesetzte Richtungen.
Gemini 3.5 Transcribe Live bringt drei dokumentierte Einschränkungen mit: eine Obergrenze von 10 Minuten pro Sitzung bei der Live API, keine Sprecherdiarisierung und keine Zeitstempel auf Wortebene. Die erste ist architektonisch bedingt – beim Streaming über eine WebSocket-Sitzung gibt es konstruktionsbedingt eine Obergrenze – und bedeutet, dass langformatige Live-Transkription über Sitzungen hinweg zusammengesetzt werden muss, wobei die Behandlung der Nahtstellen Ihnen überlassen bleibt. Die beiden anderen sind absolut: Wenn Ihr Produkt Sprache einem Sprecher zuordnen oder ein Wort mit einem Zeitstempel für Suche oder Untertitel-Synchronisierung versehen muss, leistet Gemini 3.5 Transcribe Live das zu keinem Preis.
Die Einschränkungen von MAI-Transcribe-2-Streaming sind weniger gut dokumentiert, was selbst eine Information ist. Microsoft erhebt für das Streaming-Modell keinen Anspruch auf Diarisierung und auch keinen auf Wort-Zeitstempel; das Batch-MAI-Transcribe-2 bündelt Diarisierung und liefert Zeitstempel auf Wortebene, aber das ist das Batch-Produkt, und anzunehmen, dass die Streaming-SKU diese übernimmt, ist genau die Art von Schlussfolgerung, die Launch-Materialien verhindern sollen. Was Microsoft hingegen beansprucht, sind 60 Sprachen mit kontinuierlicher Sprachenerkennung und eine Platzierung an der Pareto-Front bei Genauigkeit versus Latenz – beides Herstelleraussagen, mit denen die Daten des Trackers konsistent sind.
Die ehrliche Funktionsbewertung lautet also: Keines der beiden Streaming-Modelle veröffentlicht Diarisierung oder Wort-Zeitstempel. Gemini 3.5 Transcribe Live hat eine veröffentlichte Sitzungsobergrenze und eine kostenlose Tarifstufe; MAI-Transcribe-2-Streaming hat eine veröffentlichte Anzahl von Sprachen und keine veröffentlichte Obergrenze. Wenn zu Ihren Anforderungen Diarisierung gehört, ist keines von beiden die Antwort, und Sie haben es mit einer Batch-Transkription zu tun, der eine Streaming-Schicht vorangestellt wurde.
Was die Preisparität Ihnen wirklich verrät
Dass zwei Anbieter aus entgegengesetzten Richtungen beim selben Preis von 9 $ pro 1.000 Minuten ankommen, ist die interessanteste Tatsache in diesem Vergleich. Google erreichte dies über tokenbasierte Preisgestaltung in einer Sitzung der Live API: Audio-Eingang zu 3,50 $ pro Million Tokens, Text-Ausgang zu 21 $ pro Million und ein grober Verbrauch von 175 Text-Tokens pro Minute, was gemischt auf etwa 0,009 $ pro Minute hinausläuft. Microsoft erreichte dies, indem es einen Pauschalpreis von 0,54 $ pro Audio-Stunde für ein Modell in einer Familie aufführte, deren Batch-Schwestermodell bei 0,10 $ liegt. Das eine ist eine verbrauchsabhängig abgerechnete Echtzeit-Sitzung; das andere ist ein pauschaler Minutenpreis mit einem Einführungsrabatt.
Diese Strukturen verhalten sich unterschiedlich, wenn man skaliert. Ein Pauschaltarif ist vorhersehbar und leicht zu budgetieren; eine nach Token abgerechnete Sitzung richtet sich danach, wie viel das Modell antwortet und wie lange die Sitzung ungenutzt geöffnet bleibt. Für eine Pipeline mit hohem Volumen ist der Pauschaltarif die freundlichere Rechnung; für einen Prototyp oder ein Feature mit geringem Volumen sind der kostenlose Tarif und die Abrechnung pro Token der freundlichere Einstieg.

Was keine der beiden Strukturen ändert, ist die Ebene über dem Transkript. Ganz gleich, welches Modell es erzeugt: Ein Live-Transkript ist Eingabe für Zusammenfassung, Klassifizierung, Redaktion und Routing, und diese Schritte haben ihre eigenen Kosten- und Qualitätskurven – sie laufen in der Regel über mehrere Modelle statt nur über eines. Genau diese Ebene deckt OrcaRouter ab: eine API über 200+ Modelle, die Listenpreise der Anbieter mit 0 % Aufschlag durchgereicht, automatisches Failover und eine Routing-DSL, die ein Transkript je nach Workload an verschiedene Modelle weiterleiten kann. Weder MAI-Transcribe-2-Streaming noch Gemini 3.5 Transcribe Live steht auf dieser Liste – sie werden über Microsofts bzw. Googles eigene Speech-Stacks bereitgestellt –, und es geht nicht darum, sie zu routen, sondern darum, alles, was ihnen nachgelagert ist, portabel zu halten.

Welches soll man wählen?
Wählen Sie MAI-Transcribe-2-Streaming, wenn Genauigkeit und Stabilisierungszeit das Produkt sind: Live-Untertitel, die ein Mensch liest, Echtzeit-Compliance- oder Qualitätsbewertung, bei der eine falsch verstandene Entität Kosten verursacht, oder lange Sitzungen, die Sie wegen der 10-Minuten-Obergrenze von Gemini zusammenfügen müssten. Wählen Sie Gemini 3.5 Transcribe Live, wenn Abdeckung das Produkt ist: ein globaler Einsatz über Sprachen hinweg, die Sie nicht im Voraus aufzählen können, Sprachwechsel mitten im Stream oder ein Prototyp, bei dem das kostenlose Kontingent und die tokenbasierte Abrechnung die Bindung entfallen lassen. Teams, die beides brauchen, sitzen nicht fest – die beiden sind unterschiedliche APIs mit unterschiedlichen Sitzungsmodellen, und die ehrliche Architektur besteht darin, nach Workload zu routen, statt sich auf eine zu standardisieren.
Die Aussage, die man aus diesem Vergleich mitnehmen sollte, ist nicht, dass Microsoft gewonnen hat. Sie ist, dass Streaming-Transkription jetzt zwei glaubwürdige Frontier-Optionen zu identischen Preisen bietet, was bedeutet, dass sich die Entscheidung von „Was ist verfügbar“ zu „Was diese spezifische Arbeitslast braucht“ verschoben hat. Das ist ein besseres Problem, das man haben kann.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
