Artikel-Hero-Karte mit der Aufschrift „MAI-Transcribe-2-Streaming ist live“, dem Badge „NEUES MODELL · MICROSOFT AI“ und dem Untertitel „Microsoft holt sich mit 2,5 % WER die Krone für Streaming-Transkripte“, mit einer Statistikleiste, die eine Streaming-Wortfehlerrate von 2,5 % bei 0,13 s nach Ende der Sprache anzeigt, auf der Karte gekennzeichnet als Microsofts Angabe und als Nummer eins sowohl bei finalen als auch bei partiellen Transkripten; 60 Sprachen mit automatischer kontinuierlicher Sprachdetektion; und 9,00 $ pro 1.000 Minuten, beschrieben als 0,54 $ pro Audio-Stunde als Einführungspreis bis 2026; über einem Farbverlauf von Weiß nach Blau mit dem OrcaRouter-Logo unten rechts.
Guides & Insights

MAI-Transcribe-2-Streaming ist live: Microsoft holt sich mit 2,5 % WER die Krone bei Streaming-Transkripten

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

MAI-Transcribe-2-Streaming ist die Antwort von Microsoft AI auf die eine Frage, die seine September-Veröffentlichung offen ließ, und sie wurde in 28 Tagen beantwortet. MAI-Transcribe-2-Streaming wurde am 1. Oktober 2026 veröffentlicht und ist ein Echtzeit-Sprache-zu-Text-Modell, das transkribiert, während die Wörter eintreffen, statt erst, nachdem die Datei fertig ist. Microsoft sagt, es liege bei der AA-WER-Streaming-Evaluierung von Artificial Analysis sowohl bei finalen als auch bei partiellen Transkripten bei der Genauigkeit auf Platz eins, mit einer Wortfehlerrate von 2,5 %, wobei das finale Transkript 0,13 Sekunden nach Ende des Sprechens vorliegt. Das ist eine Herstellerangabe auf Grundlage der Methodik eines Trackers und keine Zeile, die der Tracker veröffentlicht – zum Zeitpunkt des Verfassens enthalten die 37 Modelle des Boards es nicht, und das Modell, das es verdrängen würde, ist Gro​k Voice Transcribe 2.0 (Streaming) mit 2,73 % und 0,49 Sekunden. Das Modell, auf dem es basiert, MAI-Transcribe-2, wurde am 3. September als Batch-Modell mit 2,0 % WER ohne Echtzeit-SKU veröffentlicht; die Streaming-Variante schließt diese Lücke, ohne viel von der Genauigkeit aufzugeben, die die Batch-Version bemerkenswert machte. Was es jedoch aufgibt, ist der Preis: Streaming kostet zum Start das 5,4-Fache des Batch-Tarifs.

Die Darstellung, die Microsoft anstrebt, ist ein kompletter Durchmarsch auf der Streaming-Bestenliste. Die Darstellung, die die Zahlen stützen, ist enger und interessanter – ein Modell, das beansprucht, gleichzeitig bei Genauigkeit und Latenz zu führen, an einer Front, an der der genaueste Eintrag der Bestenliste viermal langsamer zum Ergebnis kommt als ihre schnellsten und keiner dieser schnellen unter 3 % Wortfehlerrate liegt, preislich auf Augenhöhe mit dem Platzhirsch statt darunter. Hier ist der Launch, wie er ablief, mit gekennzeichneten Herstellerangaben.

Was Microsoft am 1. Oktober ausgeliefert hat

MAI-Transcribe-2-Streaming wird über Microsofts Speech-Stack im Azure AI Speech-Dienst bereitgestellt, mit Dokumentation unter dem eigenen Modellnamen und demselben API-only-Distributionsmodell ohne Gewichte wie die Batch-Version. Es transkribiert 60 Sprachen mit automatischer kontinuierlicher Sprachidentifikation, sodass eine Sitzung, die mitten im Stream die Sprache wechselt, nicht im Voraus deklariert werden muss. Microsoft positioniert es auf der Pareto-Grenze zwischen Genauigkeit und Latenz des Streaming-Charts von Artificial Analysis — die eigene Lesart des Anbieters bezüglich der Daten des Trackers und die Lesart, die der Chart des Trackers selbst stützt.

Das Streaming-Modell war nicht die gesamte Veröffentlichung. Microsoft lieferte daneben zwei Voice-Modelle aus: MAI-Voice-2.1, das 23 Sprachen über 26 Locales abdeckt, und MAI-Voice-2.1-Flash, das bis zu 45 Sekunden Audio bei rund 150 ms Latenz verarbeitet. Als Set gelesen ist der Release vom 1. Oktober ein vollständiger Echtzeit-Konversations-Stack – hören, verstehen, sprechen – statt der Einführung eines einzelnen Modells.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Streaming-Bestenliste wird gelesen

AA-WER Streaming misst pro Modell zwei Dinge: wie fehlerhaft das fertige Transkript ist und wie lange es nach dem Stopp des Sprechers dauert, bis es fertig ist. Microsofts Behauptung lautet, dass MAI-Transcribe-2-Streaming bei beidem führt: 2,5 % Wortfehlerrate beim endgültigen Transkript 0,13 Sekunden nach Sprachende und dieselben 2,5 % beim ersten partiellen Transkript bei 0,12 Sekunden, was laut Microsoft bei beiden in puncto Genauigkeit den ersten Platz bedeutet. Das ist als Herstellerangabe zu lesen – zum Zeitpunkt der Erstellung hat das eigene Streaming-Board des Trackers das Modell noch nicht eingetragen, es gibt also keine unabhängige MAI-Transcribe-2-Streaming-Zeile zum Ablesen. Was das Board jedoch zeigt, ist das Feld, das es zu schlagen behauptet, und dieses Feld liegt enger beieinander, als eine „Krone“-Rahmung nahelegt:

• Grok Voice Transcribe 2.0 — 2,73 % WER des endgültigen Transkripts bei 0,49 Sekunden nach Sprachende, laut Artificial Analysis, und der aktuelle Spitzenreiter in der Rangliste. Das liegt 0,23 Punkte hinter den von Microsoft angegebenen 2,5 % und ist rund viermal langsamer, bis es sich einpendelt – der Unterschied zwischen einer Untertitelung, die mithält, und einer, die hinterherhinkt.

• Muse Voice Trans — 3,06 % bei 0,16 Sekunden, laut Artificial Analysis. Der nächstbeste Wettbewerber bei der Latenz: etwa 30 Millisekunden dahinter und 0,5 Punkte schlechter bei der Genauigkeit als Microsofts Angabe.

• ElevenLabs Scribe v2 Realtime — 3,59 % bei 0,14 Sekunden, laut Artificial Analysis. Bei der Geschwindigkeit praktisch gleichauf, bei der Genauigkeit mehr als einen Punkt zurück.

• Gemini 3.5 Transcribe Live — 4,00 % Streaming-WER bei 0,40 Sekunden, der Wert, den Artificial Analysis veröffentlicht hat und den Google für sein eigenes Live-API-Modell anführt. Das ist eine Lücke von 1,5 Punkten, und genau auf diesen Vergleich zielt diese Veröffentlichung ab.

Die Spalte für erste Teiltranskripte ist die Stelle, an der die Behauptung am wenigsten dem Rest des Boards ähnelt. Im selben Tracker liegen die ersten Teiltranskripte von Grok Voice Transcribe 2.0 bei 3,36 % und die von Gemini 3.5 Transcribe Live bei 5,77 % — Teiltranskripte sollten schlechter sein als das finale Transkript, oft um einen Prozentpunkt oder mehr, weil sich das Modell festlegt, bevor der Satz endet. Ein erstes Teiltranskript, das der finalen Zahl entspricht, ist der wirklich ungewöhnliche Teil von Microsofts Launch, und es ist der Teil, den die eigenen Daten des Trackers noch nicht bestätigen können. Führe es als Behauptung auf, bis eine Zeile existiert.

Der ehrliche Vorbehalt lautet, dass 0,13 Sekunden und 0,16 Sekunden für einen Menschen, der Untertitel liest, dasselbe Produkterlebnis sind, und 2,5 % gegenüber den 2,73 %, die derzeit das Leaderboard anführen, bedeuten etwa 2 Fehler pro 1.000 Wörter. Ein Vorsprung dieser Größe ist real, aber klein, und ob es ein Vorsprung ist, den man spüren kann, hängt von der Arbeitslast ab. Wo es wirklich weh tut, ist der Tail: Ein Contact-Center-Stream, der acht Stunden am Tag mit 2,73 % gegenüber 2,5 % läuft, bedeutet Zehntausende zusätzliche falsche Wörter pro Jahr, und Wortfehler in einem Transkript sind nicht gleichmäßig verteilt – sie häufen sich genau bei den Eigennamen und Zahlen, die ein Transkript nützlich machen.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

Was man für 9,00 $ pro 1.000 Minuten bekommt

Streaming kostet mehr als Batch, und Microsoft hat es an der Spitze der Echtzeit-Tarifstufe statt darunter eingepreist. MAI-Transcribe-2-Streaming wird mit 0,54 US-Dollar pro Audio-Stunde gelistet, was 9,00 US-Dollar pro 1.000 Minuten gestreamtem Audio entspricht; dies wird als Einführungspreis bezeichnet, der bis Ende des Jahres gilt. Zum Vergleich: Das Batch-MAI-Transcribe-2 kostet 0,10 US-Dollar pro Audio-Stunde – 1,67 US-Dollar pro 1.000 Minuten –, sodass Echtzeit-Transkription für dieselbe zugrunde liegende Familie rund 5,4-mal so viel wie der dateibasierte Tarif kostet und 0,5 Punkte mehr Wortfehler aufweist. Das ist kein Aufschlag, den Microsoft verheimlicht; es ist der ehrliche Preis für eine dauerhafte Verbindung und ein Teiltranskript, das stimmen muss, bevor der Satz beendet ist.

Gegenüber dem Rest der Streaming-Kategorie fällt das Bild gemischt aus. MAI-Transcribe-2-Streaming liegt gleichauf mit Gemini 3.5 Transcribe Live bei rund 9 $ pro 1.000 Minuten – genauer, zum gleichen Preis. Es liegt über ElevenLabs Scribe v2 Realtime und Deepgram Flux bei etwa 6,50 $ pro 1.000 Minuten, über Cartesia Ink-2 bei etwa 4 $ und bei rund dem Dreifachen von Muse Voice Transcribe mit etwa 3 $. Der Launch ist also ein Spiel um Genauigkeit und Latenz bei Preisparität, kein Preiskrieg; Teams, die bereits ein günstigeres Streaming-Modell einsetzen, werden Dollar gegen WER-Punkte eintauschen.

Dieser Trade verdient es, präzise benannt zu werden, denn es ist derselbe Trade, den der Batch-Launch umgekehrt hat. Im September machte Microsoft Genauigkeit günstig. Im Oktober ließ es Echtzeit-Genauigkeit dasselbe kosten wie die aller anderen. Wenn Ihre Pipeline Transkripte nur irgendwann braucht, ändert der 1. Oktober nichts an Ihrer Rechnung. Wenn sie sie braucht, während das Gespräch noch läuft, hat sich das Kalkül soeben zur Qualität verschoben.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

Der Aufbau auf einem Transkript ist die andere Hälfte dieser Entscheidung, und hier zahlt sich eine Multi-Modell-Schicht aus. Ein Echtzeit-Transkript ist selten das Ende der Pipeline – es wird zusammengefasst, bewertet, durchsucht, weitergeleitet und eskaliert, und diese Schritte erfordern unterschiedliche Modelle zu unterschiedlichen Kosten. OrcaRouter existiert für diese Schicht: eine API über 200+ Modelle, Listenpreise der Anbieter ohne Aufschlag (0 % Markup) durchgereicht, automatisches Failover und eine Routing-DSL, die ein Live-Transkript an ein Modell zur Compliance-Prüfung und an ein anderes für Besprechungsnotizen senden kann, ohne eine zweite Integration. MAI-Transcribe-2-Streaming selbst steht nicht auf dieser Liste – es wird über Microsofts eigenen Speech-Stack bereitgestellt –, aber das von ihm erzeugte Streaming-Transkript ist genau die Art von hochvolumigem, latenzempfindlichem Input, die dafür spricht, die darüber liegende Schicht modellagnostisch zu halten.

Was ist noch nicht bewiesen?

Drei Punkte sind wirklich offen. Erstens die Diarisierung: Das Batch-Modell bündelt Sprecherzuordnung, ohne veröffentlichte Diarisierungsfehlerrate, und Microsofts Streaming-Material erhebt überhaupt keinen Anspruch auf Diarisierung — für ein Echtzeitmodell, das Live-Agent-Assist oder Untertitel speist, ist Wer-was-gesagt oft die Funktion, die mehr zählt als die reine WER. Zweitens die multilinguale Aufschlüsselung: Die Angabe von 60 Sprachen mit automatischer kontinuierlicher Sprachdetektion ist eine weitreichende Behauptung, und die Latenz eines Streaming-Modells pro Sprache kann deutlich stärker variieren als die seines Batch-Pendants, weil die Qualität von Teiltranskripten davon abhängt, wie schnell sich das Modell auf eine Sprache festlegt. Microsoft hat keine Streaming-Tabelle pro Sprache veröffentlicht. Drittens: Die Streaming-WER wird auf sauberem Benchmark-Audio gemessen; der Fehlermodus, der realen Deployments schadet, ist ein verrauschter Far-Field-Stream, und am Tag der Markteinführung lag kein unabhängiger Far-Field-Streaming-Vergleich vor.

Wo es deinen Stack verlässt

Das Interessante an diesem Launch ist nicht, dass Microsoft das genaueste Streaming-Transkript hat. Es ist die Taktung: Batch im September, Streaming im Oktober, in derselben Familie, auf derselben Docs-Oberfläche, mit einer Preisstruktur, die nun 1,67 $ bis 9,00 $ pro 1.000 Minuten für dieselbe zugrunde liegende Fähigkeit abdeckt. Das gibt Teams zum ersten Mal eine echte Wahl – nur dort für Echtzeit zu bezahlen, wo Echtzeit zählt, und alles andere im Batch zu verarbeiten –, aber es bedeutet auch, dass die Transkriptionsschicht jetzt etwas ist, das man pro Workload abstimmt, statt sie einmal zu standardisieren.

Liest man die Schlagzeilenbehauptung wörtlich, hält sie als Anbieteraussage stand: Microsoft sagt, {{1}}MAI-Transcribe-2-Streaming{{/1}} sei sowohl bei der Genauigkeit des finalen Transkripts als auch beim ersten Teiltranskript an erster Stelle, und es liege auf der Pareto-Frontier. Die Einschränkungen: Das Board des Trackers hat das Modell noch nicht eingetragen, der Vorsprung, den es gegenüber dem aktuellen Spitzenreiter beansprucht, ist klein genug, um bei einem erneuten Durchlauf zu verschwinden, der Preisvorteil ist null, und die Diarisierungs-Story wurde noch nicht erzählt. Das sind die Dinge, auf die man achten sollte, nicht die Krone.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert