Artikel-Hero-Card mit der Aufschrift „MAI-Transcribe-2 Is Live", dem Badge „NEWS · MICROSOFT AI" und dem Untertitel „Microsofts Angebot für 0,10 $ pro Stunde, um Speech-to-Text zu beherrschen", mit einer Statistikleiste, die eine AA-WER von 2,0 % (#2 laut Artificial Analysis), eine Geschwindigkeit von ~411-facher Echtzeit (#2) und einen Einführungspreis von 0,10 $ pro Stunde zeigt, auf einem Weiß-zu-Blau-Verlauf mit dem OrcaRouter-Logo unten rechts.
Guides & Insights

MAI-Transcribe-2 ist live: Microsofts 0,10-Dollar-pro-Stunde-Vorstoß, um die Spracherkennung zu dominieren.

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

MAI-Transcribe-2 ist das Modell, auf das Microsoft AI setzt, um Sprach-zu-Text in ein Massengut statt in ein Premium-Feature zu verwandeln, und die Zahlen, mit denen es veröffentlicht wurde, sind so konstruiert, dass sie genau dieses Argument untermauern. Am 3. September 2026 in der öffentlichen Vorschau auf Microsoft Foundry, im MAI Playground und über Microsofts eigene API-Oberflächen veröffentlicht, ist MAI-Transcribe-2 das dritte Microsoft-Sprachmodell innerhalb von fünf Monaten – nach MAI-Transcribe-1 im April zu 0,36 US-Dollar pro Audiostunde und MAI-Transcribe-1.5 im Juni – und das erste, das alle verwalteten Konkurrenten, die es nennt, in den beiden Kennzahlen übertrifft, nach denen Teams tatsächlich einkaufen. Auf dem Non-Streaming-Wortfehlerraten-Leaderboard von Artificial Analysis liegt es mit 2,0 % AA-WER auf Platz zwei und mit etwa 411× Echtzeit ebenfalls auf Platz zwei, was es zusammen an die Pareto-Frontier aus Genauigkeit und Geschwindigkeit bringt: Auf dieser Liste ist kein Modell gleichzeitig genauer und schneller. Der Startpreis unterbietet den Preis seines Vorgängers um etwa 72 %.

Das „schnellste, genaueste und günstigste Spracherkennungsmodell der Welt“ ist Microsofts eigene Schlagzeile für das Release, und sie verdient es, mit den Sternchen des Quellmaterials gelesen zu werden. Dies ist die Geschichte des Releases, wie es tatsächlich ablief – mit gekennzeichneten Herstellerangaben und separat ausgewiesenen Teilen, die noch eines Beweises bedürfen.

Was Microsoft tatsächlich ausgeliefert hat

MAI-Transcribe-2 ist ein vortrainiertes, batchorientiertes Transkriptionsmodell, das gezielt auf lange Audioinhalte ausgelegt ist – Besprechungen, Anrufe, Medienarchive, Contact-Center-Aufzeichnungen. Microsoft positioniert es genau für die Workloads, bei denen Durchsatz und Kosten pro Minute im Vordergrund stehen. Es transkribiert in 60 Sprachen mit automatischer Spracherkennung, umfasst Sprecherdiarisierung, die Wörter der richtigen Person zuordnet, liefert Wortzeitstempel und unterstützt Keyword-Biasing für Namen, Abkürzungen und Fachterminologie. Zwei konfigurierbare Transkriptionsstile decken die übliche Unterscheidung ab: „verbatim“ (wörtlich), das Füllwörter und Fehlstarts für compliancegerechte Transkripte beibehält, und „clean“ (bereinigt), das Disfluenzen für Untertitel und Notizen entfernt. Microsoft hebt außerdem Code-Switching bei gemischtsprachiger Rede wie Hinglish und Spanglish hervor sowie die Robustheit bei verrauschten realen Audiodaten.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

Die Verfügbarkeits-Story zählt genauso viel wie die Feature-Liste. Microsoft versteckt dies nicht hinter seinem Enterprise-Sprach-Stack: Das Modell ist heute im MAI Playground demonstrierbar und wird über Microsoft Foundry in der öffentlichen Vorschau bereitgestellt, wobei die Foundry-Dokumentation unter dem Azure AI Speech-Dienst zu finden ist. Das ist eine bewusste Distributionsentscheidung – das Frontier-Modell dorthin zu bringen, wo ein Entwickler es mit einem Schlüssel abrufen kann, und nicht dorthin, wo erst ein Enterprise-Verkaufszyklus es genehmigen muss. Microsoft hat keine Gewichte veröffentlicht, und nichts im Launch-Material deutet darauf hin, dass es das tun wird.

Die Überschrift wörtlich gelesen

„Am schnellsten, am genauesten und am günstigsten der Welt“ sind drei Behauptungen unterschiedlicher Stärke, und der Launch-Post selbst schwächt zwei davon stillschweigend ab. Die ehrliche Version jeder einzelnen:

• Genauigkeit — Auf dem Leaderboard von Artificial Analysis belegt MAI-Transcribe-2 mit einem AA-WER von 2,0 % den zweiten Platz, nicht den ersten; auch Microsofts eigener Text nennt den zweiten Platz. Die Formulierung „most accurate“ ist nur haltbar, wenn man sie versteht als „unter den verwalteten Batch-APIs, die auf diesem Niveau liegen“, und selbst dann ist es eine Behauptung über ein vier Tage altes Modell, keine gefestigte Krone. Microsoft meldet separat, dass es beim mehrsprachigen FLEURS-Benchmark mit einer durchschnittlichen WER von 5,2 % über seine 60 Sprachen den ersten Platz belegt; diese Zahl stammt aus Microsofts Ankündigungsbeitrag und wurde noch nicht für jede Sprache unabhängig neu hergeleitet.

• Geschwindigkeit — Laut Artificial Analysis arbeitet MAI-Transcribe-2 mit etwa 411× Echtzeit und belegt damit den zweiten Platz auf dieser Liste. Merkwürdigerweise nennt Microsofts eigene Ankündigung nie die absolute Zahl; sie führt stattdessen verständlichere relative Multiplikatoren an — „bis zu 10× schnellere Verarbeitung als führende Konkurrenten, insbesondere bei langen Audioinhalten“, und konkret 10× schneller als OpenAIs GPT-Transcribe, 7× schneller als ElevenLabs' Scribe v2 und 5× schneller als Gemini 3.5 Transcribe. Diese Verhältnisse sind Microsofts Darstellung derselben Daten von Artificial Analysis, und die Basiswerte sind von Bedeutung: „5× schneller als Gemini 3.5 Transcribe“ klingt nach einer geringen Lücke, bis man es in Minuten Rechenzeit pro Stunde Audio umrechnet.

• Am günstigsten – Das ist nur innerhalb zweier klar von Microsoft genannter Grenzen wahr. Der Tarif von 0,10 $ ist ein „zeitlich begrenztes Angebot bis zum Jahresende“, und nirgendwo im Einführungsmaterial wird ein Standardpreis nach Aktionsende genannt. Außerdem ist es das günstigste unter den hochpräzisen verwalteten APIs; ein selbst gehostetes offenes Modell wie Whisper Large v3 Turbo transkribiert praktisch nur zum Preis des Stroms. Das Commodity-Argument ist real – es ist nur enger als die Schlagzeile.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

Was man für 1,67 $ pro 1.000 Minuten bekommt

Bei einem Preis von 0,10 $ pro Audio-Stunde kostet MAI-Transcribe-2 etwa 1,67 $ pro 1.000 Minuten Audio. Der Vergleich, der diese Zahl greifbar macht, ist der mit den anderen verwalteten Transkriptions-APIs, die bei der Genauigkeit konkurrieren. GPT-Transcribe listet mit 4,50 $ pro 1.000 Minuten; Gemini 3.5 Transcribe kostet in der Pre-Recorded-Stufe auf Basis von Googles tokenbasierter Preisgestaltung ungefähr 5 $ pro 1.000 Minuten; Scribe v2 von ElevenLabs liegt noch höher. Bei 1.000 Stunden Audio pro Monat – einer ernsthaften, aber nicht enormen Arbeitslast in Contact-Centern oder im Medienbereich – liegt die Preisdifferenz zwischen MAI-Transcribe-2 zum Frühbucherpreis und GPT-Transcribe zum Listenpreis in der Größenordnung von 170 $ pro Monat, Monat für Monat, bevor sich irgendein Genauigkeitsunterschied auswirkt. Das ist die Preisdifferenz, die dafür sorgt, dass Transkription aufhört, ein Kostenposten zu sein, den Teams optimieren, und anfängt, ein Kostenposten zu sein, den sie ignorieren.

Zwei Einschränkungen gehören in denselben Atemzug genannt. Erstens: Ein Aktionspreis ist ein Preisexperiment, bis er keins mehr ist. Teams, die ein Produkt auf den 0,10-$-Satz aufbauen, sollten wissen, dass der Standardsatz nicht bekannt gegeben wird, und die ehrliche Planungszahl für ein Budget 2027 liegt irgendwo zwischen dem Einführungsangebot und dem, was Microsoft nennt, wenn das Angebot ausläuft. Zweitens: „Am günstigsten in dieser Genauigkeitsstufe“ sagt nichts über die Gesamtbetriebskosten aus – das Modell ist nur über eine API verfügbar, daher ist der Vergleich, der für Teams mit hohem Volumen zählt, 1,67 $ pro 1.000 Minuten gegenüber den vollständigen Kosten für den Betrieb eines eigenen Stacks mit offenen Gewichten, nicht nur gegenüber anderen APIs.

Auf eine Anzeigetafel komprimiert sieht die Startposition wie folgt aus — jede untenstehende Zahl trägt das im obigen Text zugeordnete Quellenlabel.

A single-column scoreboard titled 'MAI-Transcribe-2 — the scoreboard' listing AA-WER 2.0% (#2 per Artificial Analysis), speed ~411x real time (#2), price $1.67 per 1,000 minutes early-bird through 2026, 60 languages with automatic language ID, bundled diarization with unpublished error rate, and no streaming SKU announced, with the OrcaRouter logo bottom right.

Was ist noch nicht bewiesen?

So detailliert die Launch-Ankündigungen auch sind, drei Dinge bleiben wirklich offen. Erstens Streaming: MAI-Transcribe-2 ist ein Batch-Modell, Microsofts Geschwindigkeitserzählung dreht sich um den Dateidurchsatz, und es wurde keine Echtzeit-SKU angekündigt oder demonstriert – die „411ד ist keine Latenzzahl für Live-Transkription. Zweitens die Diarisierungsqualität: Die Sprecherzuordnung ist gebündelt, aber Microsoft veröffentlicht keine Diarisierungsfehlerrate, und genau diese Funktion wird bei unabhängigen Tests wahrscheinlich schlechter abschneiden als die WER. Drittens die mehrsprachige Aufschlüsselung: Ein einzelner FLEURS-Durchschnitt über 60 Sprachen kann große sprachspezifische Schwankungen verbergen, und Microsoft hat die Tabelle für die einzelnen Sprachen nicht veröffentlicht. Jeder dieser Punkte ist ein Grund, warum die Geschichte am vierten Tag noch nicht abgeschlossen ist.

Wo es Ihren Transkriptions-Stack verlässt

Nichts davon erfordert, sich heute für MAI-Transcribe-2 zu entscheiden – genau deshalb verdient die Preisgestaltung die Aufmerksamkeit von Teams, die nicht auf der Suche nach einem neuen Anbieter sind. Speech-to-Text ist selten das Ende einer Pipeline: Transkripte werden zusammengefasst, in Aktionen umgesetzt, durchsucht und weitergeleitet, und genau in dieser nachgelagerten Ebene beweist ein Multi-Modell-Setup seinen Wert. Eine Plattform wie OrcaRouter existiert für diese Hälfte des Stacks: eine einzige API für über 200 Modelle, Listenpreise der Anbieter ohne Aufschlag, automatisches Failover und eine Routing-DSL, mit der ein Transkript je nach Arbeitslast an ein anderes Modell übergeben werden kann – Besprechungsprotokolle an einen Summarizer, Compliance-Prüfung an einen anderen – ohne eine zweite Integration. MAI-Transcribe-2 selbst steht heute nicht auf dieser Liste; es läuft über Microsofts eigene API und die Drittanbieter-Plattformen, die Microsoft aufführt. Doch der Commodity-Preis, den es gerade gesetzt hat, ist das bisher überzeugendste Argument dafür, den Teil oberhalb des Transkripts modellagnostisch zu gestalten.

Der Einführungspreis ist das eigentliche Signal. Microsoft versucht nicht, bei der Sprach-zu-Text-Erkennung allein über Funktionen zu gewinnen — es will hohe Genauigkeit so günstig machen, dass die Kategorie kein eigener Kostenpunkt mehr ist. MAI-Transcribe-2 verdient die Aufmerksamkeit, die es bekommt; man lese nur „am schnellsten, am genauesten und am günstigsten der Welt" mit den drei Sternchen: Platz zwei beim AA-WER, Aktionspreise bis zum Jahresende und eine Streaming-Geschichte, die noch nicht erzählt wurde.