
MAI-Transcribe-2 ist live: Microsofts 0,10-Dollar-pro-Stunde-Vorstoß, um die Spracherkennung zu dominieren.
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 ist das Modell, auf das Microsoft AI setzt, um Sprach-zu-Text in ein Massengut statt in ein Premium-Feature zu verwandeln, und die Zahlen, mit denen es veröffentlicht wurde, sind so konstruiert, dass sie genau dieses Argument untermauern. Am 3. September 2026 in der öffentlichen Vorschau auf Microsoft Foundry, im MAI Playground und über Microsofts eigene API-Oberflächen veröffentlicht, ist MAI-Transcribe-2 das dritte Microsoft-Sprachmodell innerhalb von fünf Monaten – nach MAI-Transcribe-1 im April zu 0,36 US-Dollar pro Audiostunde und MAI-Transcribe-1.5 im Juni – und das erste, das alle verwalteten Konkurrenten, die es nennt, in den beiden Kennzahlen übertrifft, nach denen Teams tatsächlich einkaufen. Auf dem Non-Streaming-Wortfehlerraten-Leaderboard von Artificial Analysis liegt es mit 2,0 % AA-WER auf Platz zwei und mit etwa 411× Echtzeit ebenfalls auf Platz zwei, was es zusammen an die Pareto-Frontier aus Genauigkeit und Geschwindigkeit bringt: Auf dieser Liste ist kein Modell gleichzeitig genauer und schneller. Der Startpreis unterbietet den Preis seines Vorgängers um etwa 72 %.
Das „schnellste, genaueste und günstigste Spracherkennungsmodell der Welt“ ist Microsofts eigene Schlagzeile für das Release, und sie verdient es, mit den Sternchen des Quellmaterials gelesen zu werden. Dies ist die Geschichte des Releases, wie es tatsächlich ablief – mit gekennzeichneten Herstellerangaben und separat ausgewiesenen Teilen, die noch eines Beweises bedürfen.
Was Microsoft tatsächlich ausgeliefert hat
MAI-Transcribe-2 ist ein vortrainiertes, batchorientiertes Transkriptionsmodell, das gezielt auf lange Audioinhalte ausgelegt ist – Besprechungen, Anrufe, Medienarchive, Contact-Center-Aufzeichnungen. Microsoft positioniert es genau für die Workloads, bei denen Durchsatz und Kosten pro Minute im Vordergrund stehen. Es transkribiert in 60 Sprachen mit automatischer Spracherkennung, umfasst Sprecherdiarisierung, die Wörter der richtigen Person zuordnet, liefert Wortzeitstempel und unterstützt Keyword-Biasing für Namen, Abkürzungen und Fachterminologie. Zwei konfigurierbare Transkriptionsstile decken die übliche Unterscheidung ab: „verbatim“ (wörtlich), das Füllwörter und Fehlstarts für compliancegerechte Transkripte beibehält, und „clean“ (bereinigt), das Disfluenzen für Untertitel und Notizen entfernt. Microsoft hebt außerdem Code-Switching bei gemischtsprachiger Rede wie Hinglish und Spanglish hervor sowie die Robustheit bei verrauschten realen Audiodaten.

Die Verfügbarkeits-Story zählt genauso viel wie die Feature-Liste. Microsoft versteckt dies nicht hinter seinem Enterprise-Sprach-Stack: Das Modell ist heute im MAI Playground demonstrierbar und wird über Microsoft Foundry in der öffentlichen Vorschau bereitgestellt, wobei die Foundry-Dokumentation unter dem Azure AI Speech-Dienst zu finden ist. Das ist eine bewusste Distributionsentscheidung – das Frontier-Modell dorthin zu bringen, wo ein Entwickler es mit einem Schlüssel abrufen kann, und nicht dorthin, wo erst ein Enterprise-Verkaufszyklus es genehmigen muss. Microsoft hat keine Gewichte veröffentlicht, und nichts im Launch-Material deutet darauf hin, dass es das tun wird.
Die Überschrift wörtlich gelesen
„Am schnellsten, am genauesten und am günstigsten der Welt“ sind drei Behauptungen unterschiedlicher Stärke, und der Launch-Post selbst schwächt zwei davon stillschweigend ab. Die ehrliche Version jeder einzelnen:
• Genauigkeit — Auf dem Leaderboard von Artificial Analysis belegt MAI-Transcribe-2 mit einem AA-WER von 2,0 % den zweiten Platz, nicht den ersten; auch Microsofts eigener Text nennt den zweiten Platz. Die Formulierung „most accurate“ ist nur haltbar, wenn man sie versteht als „unter den verwalteten Batch-APIs, die auf diesem Niveau liegen“, und selbst dann ist es eine Behauptung über ein vier Tage altes Modell, keine gefestigte Krone. Microsoft meldet separat, dass es beim mehrsprachigen FLEURS-Benchmark mit einer durchschnittlichen WER von 5,2 % über seine 60 Sprachen den ersten Platz belegt; diese Zahl stammt aus Microsofts Ankündigungsbeitrag und wurde noch nicht für jede Sprache unabhängig neu hergeleitet.
• Geschwindigkeit — Laut Artificial Analysis arbeitet MAI-Transcribe-2 mit etwa 411× Echtzeit und belegt damit den zweiten Platz auf dieser Liste. Merkwürdigerweise nennt Microsofts eigene Ankündigung nie die absolute Zahl; sie führt stattdessen verständlichere relative Multiplikatoren an — „bis zu 10× schnellere Verarbeitung als führende Konkurrenten, insbesondere bei langen Audioinhalten“, und konkret 10× schneller als OpenAIs GPT-Transcribe, 7× schneller als ElevenLabs' Scribe v2 und 5× schneller als Gemini 3.5 Transcribe. Diese Verhältnisse sind Microsofts Darstellung derselben Daten von Artificial Analysis, und die Basiswerte sind von Bedeutung: „5× schneller als Gemini 3.5 Transcribe“ klingt nach einer geringen Lücke, bis man es in Minuten Rechenzeit pro Stunde Audio umrechnet.
• Am günstigsten – Das ist nur innerhalb zweier klar von Microsoft genannter Grenzen wahr. Der Tarif von 0,10 $ ist ein „zeitlich begrenztes Angebot bis zum Jahresende“, und nirgendwo im Einführungsmaterial wird ein Standardpreis nach Aktionsende genannt. Außerdem ist es das günstigste unter den hochpräzisen verwalteten APIs; ein selbst gehostetes offenes Modell wie Whisper Large v3 Turbo transkribiert praktisch nur zum Preis des Stroms. Das Commodity-Argument ist real – es ist nur enger als die Schlagzeile.

Was man für 1,67 $ pro 1.000 Minuten bekommt
Bei einem Preis von 0,10 $ pro Audio-Stunde kostet MAI-Transcribe-2 etwa 1,67 $ pro 1.000 Minuten Audio. Der Vergleich, der diese Zahl greifbar macht, ist der mit den anderen verwalteten Transkriptions-APIs, die bei der Genauigkeit konkurrieren. GPT-Transcribe listet mit 4,50 $ pro 1.000 Minuten; Gemini 3.5 Transcribe kostet in der Pre-Recorded-Stufe auf Basis von Googles tokenbasierter Preisgestaltung ungefähr 5 $ pro 1.000 Minuten; Scribe v2 von ElevenLabs liegt noch höher. Bei 1.000 Stunden Audio pro Monat – einer ernsthaften, aber nicht enormen Arbeitslast in Contact-Centern oder im Medienbereich – liegt die Preisdifferenz zwischen MAI-Transcribe-2 zum Frühbucherpreis und GPT-Transcribe zum Listenpreis in der Größenordnung von 170 $ pro Monat, Monat für Monat, bevor sich irgendein Genauigkeitsunterschied auswirkt. Das ist die Preisdifferenz, die dafür sorgt, dass Transkription aufhört, ein Kostenposten zu sein, den Teams optimieren, und anfängt, ein Kostenposten zu sein, den sie ignorieren.
Zwei Einschränkungen gehören in denselben Atemzug genannt. Erstens: Ein Aktionspreis ist ein Preisexperiment, bis er keins mehr ist. Teams, die ein Produkt auf den 0,10-$-Satz aufbauen, sollten wissen, dass der Standardsatz nicht bekannt gegeben wird, und die ehrliche Planungszahl für ein Budget 2027 liegt irgendwo zwischen dem Einführungsangebot und dem, was Microsoft nennt, wenn das Angebot ausläuft. Zweitens: „Am günstigsten in dieser Genauigkeitsstufe“ sagt nichts über die Gesamtbetriebskosten aus – das Modell ist nur über eine API verfügbar, daher ist der Vergleich, der für Teams mit hohem Volumen zählt, 1,67 $ pro 1.000 Minuten gegenüber den vollständigen Kosten für den Betrieb eines eigenen Stacks mit offenen Gewichten, nicht nur gegenüber anderen APIs.
Auf eine Anzeigetafel komprimiert sieht die Startposition wie folgt aus — jede untenstehende Zahl trägt das im obigen Text zugeordnete Quellenlabel.

Was ist noch nicht bewiesen?
So detailliert die Launch-Ankündigungen auch sind, drei Dinge bleiben wirklich offen. Erstens Streaming: MAI-Transcribe-2 ist ein Batch-Modell, Microsofts Geschwindigkeitserzählung dreht sich um den Dateidurchsatz, und es wurde keine Echtzeit-SKU angekündigt oder demonstriert – die „411ד ist keine Latenzzahl für Live-Transkription. Zweitens die Diarisierungsqualität: Die Sprecherzuordnung ist gebündelt, aber Microsoft veröffentlicht keine Diarisierungsfehlerrate, und genau diese Funktion wird bei unabhängigen Tests wahrscheinlich schlechter abschneiden als die WER. Drittens die mehrsprachige Aufschlüsselung: Ein einzelner FLEURS-Durchschnitt über 60 Sprachen kann große sprachspezifische Schwankungen verbergen, und Microsoft hat die Tabelle für die einzelnen Sprachen nicht veröffentlicht. Jeder dieser Punkte ist ein Grund, warum die Geschichte am vierten Tag noch nicht abgeschlossen ist.
Wo es Ihren Transkriptions-Stack verlässt
Nichts davon erfordert, sich heute für MAI-Transcribe-2 zu entscheiden – genau deshalb verdient die Preisgestaltung die Aufmerksamkeit von Teams, die nicht auf der Suche nach einem neuen Anbieter sind. Speech-to-Text ist selten das Ende einer Pipeline: Transkripte werden zusammengefasst, in Aktionen umgesetzt, durchsucht und weitergeleitet, und genau in dieser nachgelagerten Ebene beweist ein Multi-Modell-Setup seinen Wert. Eine Plattform wie OrcaRouter existiert für diese Hälfte des Stacks: eine einzige API für über 200 Modelle, Listenpreise der Anbieter ohne Aufschlag, automatisches Failover und eine Routing-DSL, mit der ein Transkript je nach Arbeitslast an ein anderes Modell übergeben werden kann – Besprechungsprotokolle an einen Summarizer, Compliance-Prüfung an einen anderen – ohne eine zweite Integration. MAI-Transcribe-2 selbst steht heute nicht auf dieser Liste; es läuft über Microsofts eigene API und die Drittanbieter-Plattformen, die Microsoft aufführt. Doch der Commodity-Preis, den es gerade gesetzt hat, ist das bisher überzeugendste Argument dafür, den Teil oberhalb des Transkripts modellagnostisch zu gestalten.
Der Einführungspreis ist das eigentliche Signal. Microsoft versucht nicht, bei der Sprach-zu-Text-Erkennung allein über Funktionen zu gewinnen — es will hohe Genauigkeit so günstig machen, dass die Kategorie kein eigener Kostenpunkt mehr ist. MAI-Transcribe-2 verdient die Aufmerksamkeit, die es bekommt; man lese nur „am schnellsten, am genauesten und am günstigsten der Welt" mit den drei Sternchen: Platz zwei beim AA-WER, Aktionspreise bis zum Jahresende und eine Streaming-Geschichte, die noch nicht erzählt wurde.
