Hero-Karte des Artikels mit der Aufschrift „MAI-Transcribe-2-Streaming vs MAI-Transcribe-2“, dem Badge „GLEICHE FAMILIE · ZWEI PREISSTUFEN“ und dem Untertitel „Zahlen Sie das 5,4-Fache für Timing auf Wortebene“, aufgebaut als zwei Modellnamens-Karten, getrennt durch ein VS-Badge, mit einer Chip-Leiste, die $9,00 gegenüber $1,67 pro 1.000 Minuten zeigt, einer angegebenen Wortfehlerrate von 2,5 % gegenüber einer auditierten 2,0 %, 0,13 s bis zum finalen Transkript gegenüber ungefähr 411-facher Echtzeit sowie Zeitstempeln plus Diarisierung nur in der Batch-Stufe, über einem Verlauf von Weiß zu Blau mit dem OrcaRouter-Logo unten rechts.
Guides & Insights

MAI-Transcribe-2-Streaming vs. MAI-Transcribe-2: 5,4× für Timing auf Wortebene zahlen

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

MAI-Transcribe-2-Streaming und MAI-Transcribe-2 gehören derselben Modellfamilie an, die auf zwei Preistarife aufgeteilt ist, und die Aufteilung ist klar genug, um damit zu planen. MAI-Transcribe-2 wurde am 3. September 2026 als Batch-Modell veröffentlicht: 2,0 % Wortfehlerrate auf dem Non-Streaming-Board von Artificial Analysis, rund 411× Echtzeit und 0,10 $ pro Audio-Stunde – etwa 1,67 $ pro 1.000 Minuten. MAI-Transcribe-2-Streaming wurde am 1. Oktober 2026 als Echtzeit-Variante veröffentlicht: eine angegebene Streaming-Wortfehlerrate von 2,5 % bei 0,13 Sekunden bis zum finalen Transkript, was Microsoft als ersten Platz bei der Genauigkeit sowohl bei finalen als auch bei partiellen Transkripten beschreibt, gemessen nach der Streaming-Methodik von Artificial Analysis, statt bislang als Zeile im Board des Trackers aufgeführt zu werden. 0,54 $ pro Audio-Stunde – etwa 9,00 $ pro 1.000 Minuten. Dieselben 60 Sprachen, derselbe Vertrieb ausschließlich über API, keine veröffentlichten Gewichte. Streaming kostet das 5,4-Fache des Batch-Tarifs und nach Microsofts eigenen Zahlen 0,5 Punkte Genauigkeit. Ob das ein Schnäppchen oder eine Steuer ist, hängt einzig und allein von einer Frage ab: Muss irgendetwas in Ihrer Pipeline das Transkript haben, bevor der Satz zu Ende ist?

Da die beiden Modelle von einem Anbieter und einer Dokumentationsoberfläche stammen, ist der Vergleich ungewöhnlich sauber – kein Raten über Funktionsparität, keine Abweichung bei Benchmark-Versionen, kein „deren Zahlen versus unsere Zahlen“. Ein einzelner Anbieter bepreist zwei Geschwindigkeiten derselben Fähigkeit, und die interessante Aufgabe besteht darin, herauszufinden, welche Workloads die günstige Stufe tatsächlich abdeckt.

Die Familie, in zwei Reihen

• MAI-Transcribe-2 — Batch-Verarbeitung, vorab aufgezeichnetes Audio, veröffentlicht am 3. September 2026. 2,0 % AA-WER, Zweiter in der Nicht-Streaming-Bestenliste von Artificial Analysis. Etwa 411× Echtzeit, ebenfalls Zweiter. 0,10 $ pro Audio-Stunde, etwa 1,67 $ pro 1.000 Minuten, als zeitlich begrenztes Angebot bis zum Jahresende, ohne veröffentlichten Standardpreis. Bündelt Sprecherdiarisierung und liefert Zeitstempel auf Wortebene. 60 Sprachen mit automatischer Sprachidentifikation.

• MAI-Transcribe-2-Streaming — kontinuierliche Echtzeit-Transkription im WebSocket-Stil, veröffentlicht am 1. Oktober 2026. Microsoft berichtet von 2,5 % WER beim finalen Transkript 0,13 Sekunden nach Ende des Sprechens und von denselben 2,5 % beim ersten Teiltranskript nach 0,12 Sekunden, was das Unternehmen als Premiere bei der Genauigkeit für beides beschreibt — eine Anbieterangabe, gemessen nach der Streaming-Methodik von Artificial Analysis, obwohl zum Zeitpunkt der Erstellung das eigene Board des Trackers (37 Modelle) das Modell noch nicht aufgeführt hat und sein aktueller Spitzenreiter Grok Voice Transcribe 2.0 mit 2,73 % und 0,49 Sekunden ist. 0,54 US-Dollar pro Audio-Stunde, etwa 9,00 US-Dollar pro 1.000 Minuten, Einführungspreis bis zum Jahresende. 60 Sprachen mit automatischer kontinuierlicher Sprachdetektion. Keine veröffentlichte Angabe zur Diarisierung, keine veröffentlichte Angabe zu Wort-Zeitstempeln.

Die eine Asymmetrie, die nicht mit Geschwindigkeit oder Preis zu tun hat, ist die Leistungsfähigkeit: Beim Batch-Modell sind Diarisierung und Wort-Zeitstempel dokumentierte Funktionen, beim Streaming-Modell nicht. Das wiegt schwerer als die Genauigkeitslücke von 0,5 Punkten, und es ist der Grund, warum viele Teams am Ende beide einsetzen werden.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Was 5,4× tatsächlich bringt

Bei 1,67 $ pro 1.000 Minuten ist die Batch-Transkription in dieser Genauigkeitsstufe an der Grenze nahezu kostenlos. Bei 9,00 $ pro 1.000 Minuten ist Streaming ein echter Kostenposten – ungefähr die Kosten, dasselbe Audio fünfmal zu transkribieren, plus einen halben Genauigkeitspunkt. Die Frage ist also nicht, ob Echtzeit mehr wert ist, sondern welche konkreten Minuten sie benötigen.

Die Workloads, bei denen es eindeutig so ist: Live-Untertitel, die eine Person liest, während der Sprecher spricht, wobei 0,13 Sekunden gegenüber dem Dateiende das gesamte Produkt ausmachen; Echtzeit-Agentenunterstützung und Compliance-Bewertung, bei denen eine Intervention, die erst nach Ende des Anrufs eintrifft, wertlos ist; und interaktive Sprachanwendungen, bei denen ein Turn nicht abgeschlossen werden kann, bevor das Transkript abgeschlossen ist. In allen drei Fällen ist das Batch-Modell keine günstigere Option, sondern schlicht keine Option – es gibt keinen Preis, zu dem Post-hoc-Transkription zu Echtzeit wird.

Die Workloads, für die es eindeutig nicht gilt: Meeting- und Anrufaufzeichnungen, die im Nachhinein verarbeitet werden, Medienarchive, Contact-Center-Batch-QA, Compliance-Überprüfung abgeschlossener Anrufe, Podcast- und Video-Untertitelung. Genau das sind die Pipelines, für die die 411-fache Echtzeit und der Tarif von 1,67 $ des Batch-Modells entwickelt wurden, um zu gewinnen, und 5,4× zu zahlen, um ein paar hundert Millisekunden von einem Transkript abzuschneiden, das niemand vor morgen liest, ist schlichte Verschwendung. Fügt man die Funktionen Diarisierung und Wort-Zeitstempel hinzu – das Batch-Modell hat sie dokumentiert, das Streaming-Modell nicht –, wird das Post-hoc-Argument stärker, nicht schwächer.

Der interessante Mittelweg ist der, wo die beiden sich wirklich ergänzen: Streaming für die Live-Oberfläche und Batch für das Archiv laufen lassen. Ein Support-Anruf, der in Echtzeit transkribiert wird, um ein Agent-Assist-Panel zu versorgen, und dann über Nacht im Batch erneut transkribiert wird, um das Archivtranskript mit Diarisierung und Zeitstempeln zu erzeugen, kostet einen kleinen Aufpreis gegenüber Batch allein und liefert beide Verhaltensweisen. Dieses Muster wurde erst im September möglich, und das Oktober-Release ist das, was es vollendet.

Wo sich die Zweiteilungsstruktur zeigt

Zwei Dinge an dieser Familie verdienen Beachtung, weil sie strukturell und nicht bloß beiläufig sind.

Erstens ist die Genauigkeitshierarchie gegenüber dem üblichen Muster umgekehrt. Streaming-Modelle zahlen normalerweise einen erheblichen Genauigkeitsmalus für Echtzeitausgabe; hier beträgt der Malus 0,5 Punkte, von 2,0 % auf dem Batch-Board bis zu behaupteten 2,5 % auf dem Streaming-Board. Microsoft brachte ein Echtzeitmodell nach eigenen Zahlen bis auf einen halben Punkt an sein Batch-Flaggschiff heran, was – wenn es Bestand hat – die eigentliche technische Leistung des Oktober-Release ist, nicht die Spitzenplatzierung, die ein guter erneuter Lauf verschieben könnte und die der Tracker noch nicht bestätigt hat.

Zweitens ist auch die Preisgestaltung gegenüber dem üblichen Muster umgekehrt. Anbieter gewähren üblicherweise einen Rabatt auf die höhere Volumenstufe; Microsoft setzte den Preis für Streaming auf das 5,4-Fache von Batch und beließ beide auf Einführungspreisen, die zum gleichen Zeitpunkt auslaufen. Das wirkt weniger wie ein bewusster Streaming-Aufschlag und eher wie zwei separate Markteinführungen, die jeweils einen Einführungsrabatt tragen, ohne dass für eine der beiden ein Standardpreis veröffentlicht wurde. Teams, die ein Budget für 2027 planen, sollten beide Zahlen als vorläufig betrachten — die 1,67 $ und die 9,00 $ sind beide als zeitlich begrenzt gekennzeichnet, und für keine von beiden wurde ein Nachfolgepreis angekündigt.

A generated two-column scoreboard card titled 'One family, two divisions' contrasting MAI-Transcribe-2 (batch) — non-streaming, 2.0% AA-WER at #2, roughly 411x real time at #2, $1.67 per 1,000 minutes ($0.10 per audio-hour), bundled diarization, returned word timestamps, 60 languages with automatic ID, released September 3, 2026 — with MAI-Transcribe-2-Streaming — streaming, 2.5% claimed word error rate, 0.13s to final transcript, $9.00 per 1,000 minutes ($0.54 per audio-hour), diarization not published, word timestamps not published, 60 languages with continuous detection, released October 1, 2026, with the OrcaRouter logo bottom right.

Was ist noch nicht bewiesen?

Die offenen Fragen zum Batch-Modell aus September sind weiterhin ungeklärt: keine veröffentlichte Diarisierungsfehlerrate, keine Aufschlüsselung nach Sprachen hinter der 60-Sprachen-Angabe und ein Aktionspreis, ohne dass ein Nachfolger genannt wird. Das Streaming-Modell fügt eine weitere hinzu, die spezifisch für Echtzeitarbeit ist — Streaming-WER wird auf sauberem Audio gemessen, und die Qualität von Teiltranskripten in einem verrauschten Fernfeld-Stream ist der Fehlermodus, der im Einsatz am wichtigsten ist und vom Markteinführungsmaterial am wenigsten abgedeckt wird. Außerdem erbt es die Knappheit auf dem Streaming-Board: Die Top Drei auf dem 37-Modell-Board des Trackers liegen innerhalb eines Bruchteils eines Punkts auseinander, „Erster“ ist also ein Zustand, den ein erneuter Durchlauf ändern kann — und Microsofts Erster ist eher eine Behauptung als eine Zeile.

Die Frage auf Familienebene ist allerdings die, die man im Auge behalten sollte. Microsoft verkauft dieselbe Fähigkeit jetzt zu zwei Preisen, die fünfmal auseinanderliegen, wobei dem teuren Tarif zwei Funktionen fehlen, die der günstige Tarif dokumentiert. Wenn Diarisierung und Wort-Zeitstempel auf der Streaming-SKU erscheinen, verringert sich die Lücke auf eine reine Abwägung zwischen Latenz und Preis, was eine deutlich einfachere Entscheidung ist. Wenn nicht, ist die Zweiteilung dauerhaft, und Architekturen sollten darum herum gebaut werden.

Was das für einen Transkriptions-Stack bedeutet

A generated routing card titled 'Which minutes go on which tier' splitting workloads into a streaming column (live captions a person reads while the speaker talks, real-time agent assist, compliance or quality scoring that must land before the call ends, interactive voice turns) and a batch column (meeting and call recordings processed after the fact, media archives, contact-centre batch QA, podcast and video captioning, anything needing bundled diarization or word-level timestamps), with a note that a stream-and-reprocess pattern covers both and a footer stating that neither tier is on OrcaRouter and both are served through Microsoft's own speech stack, with the OrcaRouter logo bottom right.

Die praktische Konsequenz ist, dass Transkription im September aufhörte, ein einzelner Posten zu sein, und im Oktober zu einer Routing-Entscheidung wurde. Eine Pipeline, die früher auf eine einzige API setzte, will jetzt Streaming für die Live-Oberfläche, Batch für die Aufzeichnung und eine Regel dafür, welches Audio welchen Pfad nimmt – und diese Regel ist selbst ein Routing-Problem, was eine seltsame Menge an Komplexität ist, die in einem einzigen Release-Zyklus eines Anbieters landet.

Am härtesten trifft es das, was über dem Transkript liegt. Ganz gleich, welche Stufe den Text erzeugt, wird dieser Text anschließend zusammengefasst, klassifiziert, geschwärzt und geroutet, und diese Schritte laufen auf Sprachmodellen mit eigenen Latenz- und Kostenprofilen — ein Live-Transkript will ein schnelles, günstiges Modell, ein archiviertes kann sich ein stärkeres leisten. OrcaRouter deckt genau diese Ebene ab: eine API über 200+ Modelle hinweg, Anbieter-Listenpreise, zu 0 % Aufschlag durchgereicht, automatisches Failover und eine Routing-DSL, die ein Modell pro Workload statt pro Pipeline auswählt. Weder MAI-Transcribe-2-Streaming noch MAI-Transcribe-2 stehen auf dieser Liste — beide werden über Microsofts eigenen Speech-Stack bereitgestellt —, doch eine zweigeteilte Transkriptionsschicht ist das bislang stärkste Argument dafür, alles, was ihr nachgelagert ist, portabel zu halten.

Die ehrliche Zusammenfassung: Streaming ist kein besseres MAI-Transcribe-2, sondern ein zweites Produkt zu einem zweiten Preis. Kaufen Sie es für die Minuten, die wirklich in Echtzeit erfolgen müssen, belassen Sie den Rest in der günstigen Tarifstufe, und planen Sie ein, dass beide Tarife neu bepreist werden, wenn die Einführungsphase endet.