Artikel-Hero-Karte mit der Aufschrift „Grok Voice Transcribe 2.0 vs. Muse Voice Transcribe“, dem Badge „MODELLVERGLEICH“ und dem Untertitel „eine 17-Tage-Herrschaft und eine Viertelsekunde“, mit Chips mit den Aufschriften 2,7 % vs. 3,1 % finale WER, 0,49 s vs. 0,16 s nach dem Sprechen, 0,20 $ vs. 0,18 $ pro Streaming-Stunde und Batch zum halben Preis, über einem Weiß-zu-Blau-Verlauf mit dem OrcaRouter-Logo unten rechts.
Guides & Insights

Grok Voice Transcribe 2.0 vs Muse Voice Transcribe: Eine 17-tägige Herrschaft und eine Viertelsekunde

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 1. September 2026 sagte Meta, Muse Voice Transcribe habe mit einer finalen Wortfehlerrate von 3,1 % den ersten Platz in der Streaming-Spracherkennungs-Evaluierung von Artificial Analysis belegt, und diese Behauptung blieb siebzehn Tage lang unangefochten. Am 18. September veröffentlichte SpaceXAI Grok Voice Transcribe 2.0 mit 2,7 % auf derselben Rangliste und übernahm den Platz. Zwei Modelle, eine Rangliste, siebzehn Tage dazwischen – und der interessantere Vergleich ist nicht der 0,4-Punkte-Unterschied bei der Genauigkeit, denn Metas Modell finalisiert einen Satz immer noch rund dreimal schneller: 0,16 Sekunden nach Ende des Sprechens gegenüber 0,49 Sekunden bei Grok Voice Transcribe 2.0. Muse Voice Transcribe ist ein Echtzeit-Audiowahrnehmungsmodell, das von Meta Superintelligence Labs entwickelt wurde, um in Metas eigenen Produkten zu laufen, wo eine Viertelsekunde den Unterschied ausmacht zwischen einem Assistenten, der präsent wirkt, und einem, der langsam wirkt. Grok Voice Transcribe 2.0 ist eine Transkriptions-API, die dafür gebaut wurde, von jedem aufgerufen zu werden, zu einem Preis, der Batch-Arbeit praktikabel macht. Beide Zahlen wurden am Tag der Markteinführung von den Anbietern gemeldet, und nur eine der beiden wurde seitdem unabhängig in einer öffentlichen Rangliste platziert.

Was die Rangliste jetzt tatsächlich aussagt

Das AA-WER Streaming board ist eine gewichtete Kombination – AA-AgentTalk zu 50 %, VoxPopuli zu 25 %, Earnings22 zu 25 %, rund acht Stunden überwiegend agentenähnliches englisches Audio – und beide Modelle werden daran gemessen, was dies zu dem seltenen direkten Vergleich macht, bei dem die Zahlen zumindest vergleichbar sind. Seite an Seite, einschließlich der vom Anbieter gemeldeten Zahlen:

• Endgültige Transkriptgenauigkeit — Grok Voice Transcribe 2.0 bei 2,7 % WER vs. Muse Voice Transcribe bei 3,1 %

• Genauigkeit des ersten partiellen Transkripts — 3,4 % vs. 3,6 %

• Zeit bis zum ersten Teil — 0,49 Sekunden vs. 0,13 Sekunden

• Zeit nach Ende des Sprechens bis zum endgültigen Transkript — 0,49 Sekunden vs. 0,16 Sekunden

• Sprecherdiarisierungs-Fehlerrate — enthalten, kein Wert veröffentlicht gegenüber einem Durchschnitt von 17,5 % in Metas Evaluierung

Lesen Sie die Genauigkeitszeilen und die Latenzzeilen getrennt, denn sie weisen in entgegengesetzte Richtungen und beide sind wahr. Bei der Genauigkeit liegen die beiden Modelle bei Endtranskripten innerhalb von vier Zehntelpunkten voneinander und bei ersten Teiltranskripten innerhalb von zwei Zehntelpunkten — eine Lücke, die klein genug ist, dass sie sich mit der nächsten Veröffentlichung eines der beiden Unternehmen umkehren wird, und klein genug, dass kein vernünftiger Mensch deswegen zwischen ihnen wählen sollte. Bei der Latenz sind sie nicht nah beieinander. Das Modell von Meta liefert ein Teiltranskript in etwa einer Achtelsekunde und finalisiert in etwa einer Sechstelsekunde, gegenüber etwa einer halben Sekunde in beide Richtungen bei dem von SpaceXAI.

Das ist der gesamte Vergleich in einer Zeile: Grok Voice Transcribe 2.0 setzte Latenz ein, um Genauigkeit zu erkaufen, und Muse Voice Transcribe tat das Gegenteil. SpaceXAI senkte seine First-Partial-Fehlerrate von 18,3 % in Version 1.0 auf 3,4 % in 2.0, und der Preis dafür war, bei derselben Messgröße von 0,25 Sekunden auf 0,49 Sekunden zu steigen. Metas Modell wurde in die andere Richtung konstruiert, mit 80-Millisekunden-Audiochunks und einer durch Reinforcement Learning gelernten adaptiven Verzögerung, die entscheidet, wie lange gewartet wird, bevor man sich auf Text festlegt – ein Mechanismus, dessen ganzer Zweck es ist, die Genauigkeit zu halten, während die Festlegung auf Text schnell bleibt. Keine der beiden Entscheidungen ist ein Fehler. Sie sind Antworten auf unterschiedliche Fragen.

Welche Frage du stellst

Wenn das Transkript einen Sprachagenten speist, der innerhalb einer Gesprächspause antworten muss, sind 0,16 Sekunden und 0,49 Sekunden unterschiedliche Produkte. Der menschliche Sprecherwechsel toleriert eine Lücke von ein paar hundert Millisekunden, bevor die Interaktion anfängt, sich falsch anzufühlen, und das Latenzbudget wird geteilt — Transkription, dann Reasoning, dann Sprachsynthese. Ein Modell, das ein finales Transkript in einer Sechstelsekunde zurückgibt, lässt Raum für den Rest der Pipeline; eines, das eine halbe Sekunde braucht, verbraucht den größten Teil des Budgets, bevor das Modell überhaupt über etwas nachgedacht hat. Dafür hat Meta es gebaut, und deshalb läuft das Modell in Meta AI auf dem Mac und in Muse Code, statt vorrangig als Endpunkt für die Pipelines anderer angeboten zu werden.

Wenn das Transkript ein Dokument ist – eine Anrufaufzeichnung, eine Besprechung, eine Videobibliothek, ein Compliance-Archiv –, dann sind eine halbe Sekunde nichts, die Genauigkeitslücke weiterhin nichts, und die einzige Zahl, die zählt, ist die, was eine Stunde Audio kostet. Und genau hier gehen die beiden stark auseinander – und zwar in eine Richtung, die Menschen überrascht, die nur die Streaming-Rate betrachten.

Im Batch zum halben Preis, im Streaming ein Zehntel mehr.

Meta führt Muse Voice Transcribe mit 0,18 $ pro Stunde Audio auf, oder 3,00 $ pro 1.000 Minuten. Grok Voice Transcribe 2.0 wird mit 0,10 $ pro Stunde für Batch und 0,20 $ pro Stunde für Streaming aufgeführt. Also:

• Streaming — Grok Voice Transcribe 2.0 für 0,20 $ pro Stunde im Vergleich zu Muse Voice Transcribe für 0,18 $, Meta ist also etwa 10 % günstiger

• Batch oder aufgezeichnet – 0,10 $ pro Stunde vs. 0,18 $, SpaceXAI ist also 44 % günstiger

• Im Listenpreis enthalten — Diarisierung, Wortzeitstempel mit Konfidenz, Schlüsselbegriff-Bevorzugung und inverse Textnormalisierung auf der SpaceXAI-Seite vs. Streaming-Transkription, Diarisierung und Endpunkterkennung als ein Modell auf Metas Seite

• Kostenloser Tarif oder Selbst-Hosting — weder noch, in beiden Punkten

Ein Team, das ausschließlich streamt, sollte preislich zwischen ihnen indifferent sein und sollte nach der Latenz entscheiden – was auf Meta hinausläuft. Ein Team mit nennenswertem Volumen an aufgezeichnetem Audio sollte sich die Batch-Zeile ansehen, denn 0,08 $ pro Stunde summieren sich: 5.000 Stunden im Monat kosten bei dem einen 500 $ und bei dem anderen 900 $, und der Genauigkeitsunterschied zwischen ihnen ist kleiner als die Rundung bei jeder der beiden Zahlen.

Die Lizenzsituation ist in der entscheidenden Hinsicht identisch und in der nicht entscheidenden Hinsicht unterschiedlich. Beide sind Closed-Weights – Muse Voice Transcribe ist proprietär und nur über die gehostete API von Meta verfügbar, und Grok Voice Transcribe 2.0 ist eine kommerzielle API ohne Download. Keines von beiden ist eine Option, wenn Ihre Anforderung lautet, dass Audio niemals die Infrastruktur verlässt, die Sie kontrollieren, und beide setzen Sie dem Risiko aus, dass ein Anbieter den Preis, die Modellversion oder den Stilllegungsplan unter Ihnen ändert. Das ist eine reale Überlegung und keine hypothetische: Grok Voice Transcribe 1.0 befindet sich bereits auf dem Auslaufpfad, weniger als zwei Wochen nachdem sein Nachfolger veröffentlicht wurde.

Screenshot of the Meta AI research post titled 'Introducing Muse Voice Transcribe', dated September 1, 2026 and marked a four minute read, showing the headline and an interactive demo card labelled 'Click to start transcribing' with the caption 'Experience Muse Voice Transcribe in real time', above the opening line describing the model as Meta's first real-time audio perception model.

Diarisierung, das Feature, mit dem keiner von beiden wirbt

Beide Modelle übernehmen die Sprecherzuordnung in einem einzigen Durchgang, was vor zwei Jahren noch ein separates System war, das nachträglich angeflanscht wurde, und der Vergleich hier ist ungewöhnlich konkret, weil Meta eine Zahl veröffentlichte und SpaceXAI nicht.

Meta meldet eine durchschnittliche Diarisierungsfehlerrate von 17,5 % in seiner Evaluierung, verarbeitet 20 oder mehr Sprecher ohne Nachbearbeitung und behandelt sie als Teil des Streaming-Modells statt als nachgelagerten Schritt – das „Wer hat was gesagt“ kommt mit dem Text statt danach. Das ist im Streaming-Kontext wirklich schwierig, wo ein Sprecherwechsel erst identifizierbar ist, wenn man genug davon gehört hat, und 17,5 % ist eine echte Zahl mit einem echten Vorbehalt: Sie ist Metas eigene, gemittelt über einen Evaluierungssatz, den Meta ausgewählt hat.

Das Modell von SpaceXAI beinhaltet Diarisierung ohne zusätzliche Kosten und unterstützt außerdem bis zu acht unabhängige Audiokanäle in einer einzigen Anfrage, was ein anderer Weg ist, dasselbe Problem zu lösen – wenn Ihr Audio als separate Kanäle pro Teilnehmer eingeht, was bei Contact-Center-Telefonie oft der Fall ist, ist die Kanaltrennung zuverlässiger als die Diarisierung und benötigt überhaupt keine Fehlerrate. Wenn Ihr Audio als ein gemischter Stream eingeht, sind Sie von der Qualität der Diarisierung abhängig, und nur einer dieser beiden Anbieter hat Ihnen gesagt, wie hoch diese ist.

Es gibt einen erwähnenswerten Unterschied zweiter Ordnung: Muse Voice Transcribe behandelt Diarisierung, Transkription und Endpunkterkennung als ein einziges Modell, das eine einzige Ausgabe erzeugt, was bedeutet, dass die Komponenten nicht unabhängig voneinander ausfallen können. Grok Voice Transcribe 2.0 ermöglicht es Ihnen, Kanäle, Schlüsselbegriffe und Diarisierung als separate Stellschrauben zu behandeln. Ein einzelnes Modell ist einfacher zu betreiben und schwerer zu debuggen.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7%, first partial 3.4%, time after speech 0.49s, diarization included with no figure published, streaming $0.20 per hour, batch $0.10 per hour. The right column gives Muse Voice Transcribe the rows: final WER 3.1%, first partial 3.6%, time after speech 0.16s, diarization error 17.5% average, streaming $0.18 per hour, no batch tier published. A footer reads 'Both sets of figures vendor-reported at launch; Grok accuracy independently placed on Artificial Analysis.'

Sprachen, und wo die beiden Modellkarten nicht mehr vergleichbar sind

Meta hat Muse Voice Transcribe auf mehr als 70 Sprachen trainiert und 25 davon zum Start umfassend verifiziert, mit nativem Code-Switching innerhalb und zwischen Sätzen sowie Unterstützung für Audio, das länger als eine Stunde ist. Grok Voice Transcribe 2.0 übernimmt die automatische Sprachenerkennung mit Wechsel mitten in der Aufnahme und wendet inverse Textnormalisierung an – gesprochene Datumsangaben, Währungen, Telefonnummern und E-Mail-Adressen werden in schriftlicher Form wiedergegeben – über 25 Sprachen hinweg.

Die Überschneidung betrifft die 25 umfassend verifizierten Sprachen auf der einen Seite und die 25 Normalisierungssprachen auf der anderen, und die beiden Mengen sind nicht dieselben 25, und keiner der Anbieter hat die Liste veröffentlicht. „70+ trainierte Sprachen“ und „25 Sprachen mit Formatierungsunterstützung“ sind keine vergleichbaren Aussagen und sollten nicht voneinander abgezogen werden. Was sich sagen lässt, ist, dass Meta eine breitere Mehrsprachigkeitsaussage trifft und SpaceXAI eine engere, aber operativere: Die Sprache zu erkennen, ist Grundvoraussetzung, und das, was das Modell gehört hat, so zu formatieren, dass ein nachgelagertes System es parsen kann, ist der Teil, der Integrationen scheitern lässt, wenn er fehlt.

Die Wahl – und der Grund, warum sie vielleicht nicht von dir getroffen werden kann.

Zieht man das Marketing ab, reduziert sich die Entscheidung auf drei Sätze. Wählen Sie Muse Voice Transcribe, wenn das Transkript live innerhalb eines Gesprächs genutzt wird, denn 0,16 Sekunden sind kein Detail. Wählen Sie Grok Voice Transcribe 2.0, wenn Sie aufgezeichnetes Audio in großen Mengen haben, denn die Hälfte des Batch-Preises ist ebenfalls kein Detail. Wenn Sie keinen der beiden Extremfälle brauchen, entscheiden Sie sich anhand dessen, was Sie sonst einschränkt – Region, Vertrag, bestehende Integration –, denn der Genauigkeitsunterschied gibt nicht den Ausschlag.

Die Komplikation besteht darin, dass eines dieser beiden Modelle nicht wirklich im üblichen Sinne zum Verkauf steht. Muse Voice Transcribe existiert, damit Metas eigener Assistent schnell wirkt, und es ist über die Meta Model API hauptsächlich deshalb verfügbar, weil Meta entschieden hat, dass der Ökosystemwert der Sichtbarkeit den Wert der Exklusivität übersteigt. Das könnte sich ändern, und zwar schnell: Meta hat in derselben Woche die Connector-Plattform von Muse für Drittanbieter-Entwickler geöffnet, was bedeutet, dass das Unternehmen in seinen eigenen Vertriebskanal investiert und nicht darin, ein neutraler Anbieter für die Systeme aller anderen zu sein. Eine Produktionsabhängigkeit von einem internen Modell eines Wettbewerbers aufzubauen ist eine Wette darauf, dass sich die Bedingungen nicht ändern, und diese Wette hat eine schlechte historische Bilanz.

Diese Asymmetrie ist das Argument dafür, keinen der beiden fest zu verdrahten. OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel bereit, mit automatischem Failover über Anbieter hinweg und 0 % Aufschlag auf den Listenpreis des Anbieters – wenn also SpaceXAI den Standard auf 2.0 umstellt und 1.0 einstellt oder wenn Meta seine Speech-API neu positioniert, ist die Änderung ein Modell-String statt ein Migrationsprojekt. Für eine Kategorie, in der der Marktführer in drei Wochen zweimal gewechselt hat, ist die Routing-Schicht der Teil des Stacks, der stabil sein sollte, und das Modell der Teil, der es nicht sein sollte.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Eine Sache, die man im kommenden Monat beobachten sollte: ob Artificial Analysis Muse Voice Transcribe auf dem Streaming-Board erneut misst, nachdem Grok Voice Transcribe 2.0 es verdrängt hat. Metas 3,1 % und SpaceXAIs 2,7 % wurden beide zum Start gemeldet, aber nur SpaceXAIs Wert wurde unabhängig eingeordnet. Wenn Metas Zahl standhält, wenn jemand sie nachmisst, ist der Genauigkeitsunterschied so klein, wie er aussieht, und der Latenzunterschied entscheidet alles. Wenn nicht, dann war die siebzehntägige Herrschaft die ganze Geschichte.