Eine generierte Hero-Titelkarte mit der Überschrift „StepAudio 3 ASR vs Whisper Large v3 Turbo" und dem Untertitel „1,7 Prozent gegenüber 4,6 Prozent, und es gibt keinen direkten Vergleichstest", über der Fußzeile „StepAudio laut Artificial Analysis; Whisper laut Hugging Face."
Guides & Insights

StepAudio 3 ASR vs. Whisper Large v3 Turbo: 1,7 % gegenüber 4,6 %, und niemand hat den Test durchgeführt

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der gewünschte Vergleich existiert nicht. StepAudio 3 ASR und Whisper Large v3 Turbo liegen auf demselben Artificial Analysis AA-WER-Index für nicht-streamingbasiertes Speech-to-Text – 1,7 % Wortfehlerrate gegenüber Werten im Bereich von 4 bis 5,5 % – und Stand Ende September 2026 hat niemand einen Direktvergleich mit identischem Audiomaterial veröffentlicht. Nicht StepFun, nicht die Whisper-Maintainer, nicht ein unabhängiges Labor. Die eigene Dokumentation von StepFun vergleicht mit Doubao ASR 2.0, Seed 2.0 Lite und HY3.0 ASR Preview, allesamt chinesische ASR-Produkte. Auf der Whisper-Seite veröffentlicht überhaupt kein Anbieter Vergleiche, weil Whisper Large v3 Turbo seit Jahren herunterladbar ist und seine Zahlen davon abhängen, wer es bereitstellt.

Diese Seite liefert also die ehrliche Version: Sie liest das eine Board, das beides misst, trennt Vergleichbares von Nicht-Vergleichbarem und sagt klar, wo die Belege enden. Die kurze Antwort lautet: Der Unterschied bei der Genauigkeit ist real und rund drei Punkte groß, und der Unterschied bei allem anderen – Preis, Lizenz, Einsatzfähigkeit – verläuft in die andere Richtung und ist größer.

Was jedes einzelne tatsächlich ist

StepAudio 3 ASR ist ein gehostetes Transkriptionsmodell, das StepFun am 15. September 2026 als Teil der aus fünf Modellen bestehenden Audiofamilie StepAudio 3 veröffentlicht hat. Es wird über einen einzigen Streaming-Endpunkt erreicht, der während der Dekodierung inkrementellen Text und am Ende ein finales Transkript zurückgibt. StepFun beschreibt es als Transkription mit einem angehängten Sprachmodell für den Kontext, optimiert für Audio in den Bereichen Medizin, Recht, Finanzen, Automotive und Programmierung sowie für Eingaben, die herkömmliche Erkennungssysteme überfordern – geflüsterte Sprache, schnelle Sprache, verbundene Sprache, Gesang und Audio mit Musik im Hintergrund. Es gibt keine offenen Gewichte, keinen On-Premise-Pfad und keine Self-Hosting-Option – unabhängig von der Tarifstufe. Der veröffentlichte Listenpreis beträgt 2,8 Yuan pro Stunde, etwa 6,67 US-Dollar pro 1.000 Minuten auf der eigenen Preisachse des Leaderboards.

Whisper Large v3 Turbo ist ein Modell mit offenen Gewichten, das OpenAI unter der MIT-Lizenz veröffentlicht hat: 809 Millionen Parameter, 99 Sprachen, ein beschnittenes und feinabgestimmtes Derivat von Whisper large-v3 mit reduzierten Decoder-Schichten. Es wurde millionenfach heruntergeladen, wird von einer langen Liste von Plattformen kommerziell angeboten und lässt sich auf eigener Hardware ausführen. Diese letzte Eigenschaft ist der ganze Vergleich, und sie ist der Grund, warum die Genauigkeitslücke nicht die einzige Zahl ist, die zählt.

Das eine Board, das beides misst

Der AA-WER-Index von Artificial Analysis gibt den Prozentsatz falsch transkribierter Wörter an; niedriger ist besser, und Version 2 davon kombiniert drei Datensätze: AA-AgentTalk zu 50 %, VoxPopuli-Cleaned-AA zu 25 % und Earnings22-Cleaned-AA zu 25 %. Die Nicht-Streaming-Ansicht zeigt 36 der 71 Modelle, die er verfolgt. Beide Modelle erscheinen darin, was mehr ist, als die meisten Vergleiche von sich behaupten können.

Lesen Sie sie so, wie das Board sie auflistet:

• StepAudio 3 ASR — 1,7 % AA-WER, ca. 6,67 $ pro 1.000 Minuten Audio

• Whisper Large v3 Turbo, ein gehosteter Endpunkt — 4,6 % AA-WER, etwa 0,67 $ pro 1.000 Minuten

• Whisper Large v3 Turbo, ein zweiter gehosteter Endpunkt — 5,5 % AA-WER, etwa 15,00 $ pro 1.000 Minuten

• Whisper Large v3, eine andere Generation mit offenen Gewichten — 4,1 % an einem Endpunkt, 10,1 % an einem anderen

• StepAudio 2.5 ASR, StepFuns vorherige Generation — 4,7%

Die letzten beiden Zeilen auf dem Board sind die lehrreichsten, und sie haben überhaupt nichts mit StepFun zu tun. Dieselben offenen Whisper-Gewichte erzielen 4,1 % an einem Endpunkt und 10,1 % an einem anderen. Das ist eine Spanne von 6 Punkten bei identischen Parametern, die vollständig durch Unterschiede beim Serving entsteht: Chunking-Strategie, Hardware, Dekodierungskonfiguration und die Art und Weise, wie jeder Host Audio verarbeitet, das länger ist als seine internen Grenzen. Die Fußnote des Boards selbst sagt genau das und merkt an, dass bei einem seiner Datensätze die Audiodaten einiger Modelle wegen Zeitlimits in etwa neun Minuten lange Abschnitte und die anderer in etwa dreißig Sekunden lange Abschnitte aufgeteilt werden.

Was bedeutet, dass der Vergleich „StepAudio 3 ASR vs. Whisper Large v3 Turbo“ eigentlich zwei aufeinandergestapelte Vergleiche sind. Das Modell gegen die Gewichte und das Modell gegen den Endpunkt, den man zufällig gebenchmarkt hat. Der zweite variiert stärker als der erste.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

Woher die Genauigkeitslücke kommt und wie sehr man ihr vertrauen kann

Drei Punkte Wortfehlerrate sind eine große Lücke in einem Bereich, in dem die fünf besten Systeme innerhalb von 0,6 Punkten voneinander liegen. Es ist außerdem die einzige Zahl in diesem Vergleich, die eine dritte Partei gemessen hat, und sie ist mit realen Vorbehalten verbunden, die in beide Richtungen wirken.

Gegenüber StepAudio 3 ASR: Die Zahl ist ein kombinierter Index, und die Mischung besteht zu 50 % aus AA-AgentTalk – einem Datensatz für Agentengespräche. Ein Modell, das für domänenspezifische Transkription optimiert ist und dem ein LLM für den Kontext beigefügt wurde, ist für diese Art von Audio gut geeignet. Gewichtet man den Index stärker in Richtung vorgelesener Sprache oder Nachrichtensendungen, könnte die Rangfolge enger zusammenrücken. Außerdem gibt es nach wie vor keinen veröffentlichten technischen Bericht für das ASR-Modell, keinen freigegebenen Testsatz, keine Decoding-Konfiguration und kein reproduzierbares Protokoll von jemandem außerhalb von StepFun.

Im Vergleich zu Whisper Large v3 Turbo: Die 4,6 % sind die Zahl eines einzelnen gehosteten Endpunkts, keine Eigenschaft des Modells. Die Gewichte sind fest und öffentlich; die Punktzahl ist es nicht. Ein Team, das dieselben Gewichte sorgfältig betreibt, mit domänengerechtem Chunking und einer guten Decoder-Konfiguration, kann deutlich besser abschneiden als die Board-Zeile – und ein Team, das sie nachlässig betreibt, kann schlechter abschneiden als die 10,1 %, die die andere Open-Weights-Generation gemeldet hat. Die ehrliche Zusammenfassung ist, dass die Open-Weights-Seite dieses Vergleichs einen Boden hat, den man messen kann, und eine Decke, die man sich erst verdienen muss.

Es fehlt die Zahl, die den Ausschlag geben würde: beide Systeme, ein Audioset, ein Dekodierprotokoll, veröffentlicht. Niemand hat es durchgeführt, und bis das jemand tut, ist „1,7 % vs. 4,6 %“ eher ein Vergleich zweier unter unterschiedlichen Bedingungen durchgeführter Messungen als eine Messung zweier Systeme gegeneinander.

Die anderen vier Dimensionen, in denen Whisper mit größerem Vorsprung gewinnt

Genauigkeit ist die Dimension, in der StepFun gewinnt. Bei den übrigen Punkten auf der Liste ist das Open-Weights-Modell nicht annähernd so gut, und genau diese entscheiden darüber, ob ein Deployment überhaupt möglich ist:

• Lizenz und Gewichte — MIT-lizenzierte offene Gewichte mit 809 Mio. Parametern gegenüber einer gehosteten API, bei der in keiner Stufe Gewichte veröffentlicht werden.

• Bereitstellung — selbst gehostet, vor Ort, air-gapped oder über eine von Dutzenden kommerziellen Plattformen im Vergleich zu nur StepFuns API.

• Kostenuntergrenze – etwa 0,67 $ pro 1.000 Minuten bei einem gehosteten Endpunkt und noch niedriger, wenn Sie es selbst betreiben, gegenüber etwa 6,67 $ pro 1.000 Minuten zum veröffentlichten Tarif des Anbieters.

• Datenresidenz — das Audio verlässt niemals die Infrastruktur, die Sie kontrollieren, vs. Audio, das an einen Drittanbieter-Endpunkt gesendet wird.

• Integrationsrisiko — das Modell kann Ihnen nicht entzogen, neu bepreist oder abgekündigt werden, weil Sie die Gewichte besitzen, im Gegensatz zu einem gehosteten Tarif, der sich mit einer Preisliste ändern kann.

• Verhalten bei langen Audiodateien — das Chunking liegt in deiner Entscheidung und kann pro Datei angepasst werden, im Gegensatz zu dem, was der Endpunkt des Anbieters intern tut, was nicht dokumentiert ist.

Diese Preisdifferenz beträgt gegenüber dem günstigeren Whisper-Endpunkt grob zehn zu eins, und sie ist das Spiegelbild dessen, was sich innerhalb von StepFuns eigener Produktlinie abgespielt hat: Das Modell, das dieses ersetzt, StepAudio 2.5 ASR, war mit 0,15 Yuan pro Stunde gelistet, und die aktuelle Tarifstufe wird mit 2,8 gelistet. StepFun erhöhte den Transkriptionstarif auf etwa das Neunzehnfache, um Genauigkeit zu erkaufen, was es in einem anderen Markt ansiedelt als ein selbst gehostetes Open-Weights-Modell und nicht als eine teurere Version davon.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

Welches du wählen solltest

Der Split ist sauberer als bei den meisten Direktduellen:

• Nehmen Sie Whisper Large v3 Turbo, wenn das Audio gewöhnlich ist, die Lautstärke hoch ist, die Daten Ihre Infrastruktur nicht verlassen können oder die Bereitstellung dauerhaft und preisstabil sein muss. Die MIT-Lizenz bedeutet, dass die Entscheidung bei Ihnen liegt, sie rückgängig zu machen, und niemand sie zurücknehmen kann.

• Verwenden Sie StepAudio 3 ASR, wenn das Audio wirklich schwierig ist – akzentbehaftet, geflüstert, gesungen oder mit Musik darunter – oder wenn die Domäne eine der fünf ist, für die StepFun optimiert wurde. Dafür zahlt man den Aufpreis, und bei solchem Audio ist eine Genauigkeitslücke von drei Prozentpunkten der Unterschied zwischen einem brauchbaren Transkript und einem manuellen Korrekturdurchlauf.

• Entscheiden Sie sich nicht ausschließlich für einen von beiden, wenn Sie nicht wissen, um welche Art von Audio es sich bei Ihrem handelt. Die Kosten eines Irrtums sind asymmetrisch: Der Open-Weights-Pfad lässt sich auf Ihrer eigenen Hardware für den Preis einer GPU-Stunde testen, und der gehostete Pfad kostet nichts zum Ausprobieren, bindet Sie aber an einen Tarif, den Sie nicht kontrollieren können.

Das Argument für einen Hybrid ist hier stärker als in den meisten Vergleichen, und der Grund dafür ist die Streuung der Endpunkte auf dem Board. Weil dieselben Whisper-Gewichte je nachdem, wer sie bereitstellt, zwischen 4,1 % und 10,1 % erreichen, besteht der praktische Schritt darin, den Open-Weights-Pfad über mehr als einen Host zu leiten, statt sich auf einen festzulegen — genau das ermöglicht automatisches Failover, und es ist derselbe Mechanismus, mit dem man ein gehostetes Modell vor einen Produktionspfad setzen kann, ohne den Pfad darauf zu verwetten.

Wie dies in einen Stack passt und was wir anbieten und was nicht

Was auch immer Sie für die Transkription wählen, das Transkript landet irgendwo. Ein Summarizer, eine strukturierte Extraktion, eine Compliance-Prüfung, ein Suchindex – diese Aufrufe landen bei gewöhnlichen Textmodellen, und sie sind der Teil der Rechnung, der mit der Nutzung statt mit Audiominuten skaliert. StepFuns eigenes Echtzeitmodell wirbt mit Tool-Calling und asynchroner Ausführung langer Aufgaben, was bedeutet, dass selbst die Audioebene ständig Arbeit an etwas weitergibt, das kein Audiomodell ist.

Um den Geltungsbereich ausdrücklich klarzustellen, denn andernfalls könnte leicht der gegenteilige Eindruck entstehen: Weder StepAudio 3 ASR noch Whisper Large v3 Turbo sind auf OrcaRouter. StepAudio wird über die eigene API von StepFun erreicht, und die Whisper-Gewichte können Sie selbst ausführen oder auf eine Hosting-Plattform bringen. Was OrcaRouter bereitstellt, ist die Delegationsschicht, in die das Transkript einspeist — fast 200 Textmodelle hinter einer API, mit automatischem Failover, sodass ein nachgelagerter Aufruf nicht an einem einzigen Anbieter scheitert, einer Routing-DSL, die mehrere Modelle zu einem Aufruf zusammenfügt, und Modellfusion, wenn das Urteilsvermögen eines Modells nicht ausreicht. Wenn ein Anbieter einen Preis veröffentlicht, wird dieser Listenpreis ohne Aufschlag durchgereicht, sodass eine Preisänderung Ihre Rechnung am Tag ihrer Ankündigung erreicht — was, da dieser Vergleich einen Anbieter enthält, der seinen Transkriptionstarif in einem einzigen Release um das Neunzehnfache erhöht hat, kein hypothetischer Vorteil ist.

Wenn Sie kurz davor sind, echtes Geld für die Genauigkeitsfrage auszugeben, ist die günstige Reihenfolge diese: Lassen Sie die Open-Weights-Modelle zuerst auf Ihrem eigenen Audio laufen, weil Sie es können und weil die Zahl, die Sie erhalten, relevanter sein wird als die jedes beliebigen Leaderboards. Entscheiden Sie dann, ob die verbleibende Lücke das Zehnfache des Tarifs wert ist. Die meisten Teams werden feststellen, dass es sich für einen Teil ihres Traffics lohnt und für den Rest nicht, und das ist eher ein Routing-Problem als eine Modellwahl.

Was würde es klären

Ein veröffentlichter Test. Beide Systeme, dasselbe Audio, dasselbe Dekodierungsprotokoll, eine ehrliche Aufteilung zwischen vorgelesener Sprache, Konversationsaudio und den schwierigen Fällen, für die StepFun angibt, optimiert zu haben. Bis es das gibt, ist der Vergleich auf der einen Seite ein Drittanbieter-Index und auf der anderen Seite eine Reihe offener Gewichte mit einem variablen Score, und die einzige verantwortungsvolle Art, ihn zu lesen, ist als Ausgangspunkt und nicht als Antwort.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.