
StepAudio 3 ASR vs. StepAudio 3: Es gibt kein Modell mit diesem Namen
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Wenn du nach StepAudio 3 suchst, findest du eine Familie, kein Modell. Die Audio-Veröffentlichung von StepFun vom 15. September 2026 brachte fünf Produkte unter diesem Namen heraus – Realtime, ASR, Text-to-Speech, Gen und Music – und das Transkriptionsprodukt darunter, StepAudio 3 ASR, ist dasjenige, das seitdem in den Bestenlisten nach oben klettert. Die Stufe, die die eigene Dokumentation von StepFun als das bisher größte ASR-Modell des Unternehmens bezeichnet, ist StepAudio 3 ASR Max, und das dialogorientierte Schwestermodell, mit dem es sich ein Backbone teilt, ist StepAudio 3 Realtime. Wenn du versuchst, „StepAudio 3 ASR“ mit „StepAudio 3“ zu vergleichen, vergleichst du ein Produkt mit einer Produktlinie, und die Antwort hängt ganz davon ab, welches der drei du eigentlich gemeint hast.
Diese Seite klärt das. Sie ist kein Marketing-Vergleich – sie ist die Abgrenzung, die Sie brauchen, bevor Sie irgendein StepAudio 3-Datenblatt korrekt lesen können, denn die drei oben genannten Namen stehen für unterschiedliche Preise, unterschiedliche Endpunkte und unterschiedliche Ausfallarten.
Warum ist der Name mehrdeutig?
StepFun hat den gesamten Audio-Stack an einem Tag veröffentlicht, und die Namenskonvention machte den Familiennamen zum Wortstamm jedes Produktnamens. Auf einer Launch-Folie ist das ordentlich und überall sonst ungeschickt. Das bedeutet, dass eine Suche nach dem Familiennamen eine Mischung aus fünf verschiedenen Produkten zurückgibt, und eine mit „StepAudio 3“ beschriftete Benchmark-Zeile könnte plausibel jedes von ihnen sein.
Die praktische Konsequenz ist, dass man einer Schlagzeile nicht entnehmen kann, welche Sache gemessen wurde. Ein Beitrag, der sagt „StepAudio 3 führt die Transkriptions-Bestenliste an“, beschreibt StepAudio 3 ASR. Ein Beitrag, der sagt „StepAudio 3 gewinnt bei der Konversationsdynamik“, beschreibt StepAudio 3 Realtime. Beides ist wahr, es sind unterschiedliche Produkte, und sie sind nicht austauschbar.
Speziell innerhalb der ASR-Linie gibt es eine zweite Unklarheit. StepFuns Dokumentation bezeichnet eine ASR-Max-Stufe als sein bisher größtes ASR-Modell, mit eigener Preisgestaltung und eigenem Endpunkt, während die öffentlichen Leaderboard-Zeilen die schlichtere Bezeichnung tragen. Herauszufinden, ob es sich dabei um eine SKU unter zwei Namen oder um zwei SKUs handelt, ist das Nützlichste, was diese Seite leisten kann, und der nächste Abschnitt tut genau das.
Die drei Dinge, die der Name bedeuten kann
• StepAudio 3 ASR — das Transkriptionsprodukt. Ein Streaming-Endpunkt, der beim Dekodieren inkrementellen Text und am Ende ein endgültiges Transkript zurückgibt. StepFun beschreibt es als Transkription mit einem für den Kontext angebundenen Sprachmodell, abgestimmt auf Audio aus Medizin, Recht, Finanzwesen, Automotive und Programmierung sowie auf schwierige Eingaben wie geflüsterte Sprache, schnelle Sprache, verbundene Sprache, Gesang und Hintergrundmusik. Es ist das Modell, das im AA-WER-Index von Artificial Analysis für nicht-streamingbasierte Sprache-zu-Text-Transkription bei einer Wortfehlerrate von 1,7 % liegt.
• StepAudio 3 ASR Max — die Stufe, die StepFuns Dokumentation als sein bislang größtes ASR-Modell bezeichnet. Es trägt den veröffentlichten Listenpreis von 2,8 Yuan pro Stunde. Es ist kein günstigerer Transkribierer; es ist die Spitze der ASR-Reihe.
• StepAudio 3 Realtime — das Vollduplex-Konversationsmodell. Es arbeitet direkt auf der Sprache statt eine Kette aus Transkription und anschließender Schlussfolgerung durchlaufen zu lassen, und die Transkription fällt dabei als Nebenprodukt an. Es ist kein ASR-Produkt, und seine Genauigkeit bei Transkriptionsaufgaben entspricht nicht dem, worauf es abgestimmt wurde.
Alles andere in der Familie — TTS, Gen, Music — ist eine völlig andere Aufgabe und sollte in einem Transkriptionsvergleich überhaupt nicht auftauchen.
Sind ASR und ASR Max dasselbe Modell?
Die Beweislage deutet auf Ja, und die Überprüfung ist reine Arithmetik. StepFun gibt die Stufe ASR Max mit 2,8 Yuan pro Stunde an. Umgerechnet zu ungefähr 7,1 Yuan pro Dollar sind das etwa 0,39 $ pro Stunde oder rund 6,6 $ pro 1.000 Minuten. Artificial Analysis listet das Modell in seiner Rangliste mit 6,67 $ pro 1.000 Minuten auf. Zwei unabhängig veröffentlichte Zahlen – eine aus der Preisliste des Anbieters, eine von der Rangliste eines Drittanbieters – liegen nur einen Cent auseinander. Das ist genau das, was man erwarten würde, wenn die Zeile in der Rangliste und der Listenpreis für ASR Max dieselbe SKU beschreiben.
Es lohnt sich, präzise zu sein, was das beweist und was nicht. Es beweist, dass die Preisachse der Bestenliste und die Preisliste des Anbieters dasselbe Produkt zum selben Preis beschreiben. Es beweist nicht, dass die 1,7 % der Bestenliste an genau dem Endpunkt gemessen wurden, den du aufrufen würdest, weil die Bestenliste weder ihre Decoding-Konfiguration noch den Endpunkt veröffentlicht, den sie aufgerufen hat. Also: dasselbe Produkt, sehr wahrscheinlich; dieselben Messbedingungen, nicht verifiziert.
Sicher ist der Generationssprung innerhalb der Produktlinie. StepAudio 2.5 ASR liegt auf demselben Board bei 4,7 % bei 0,15 Yuan pro Stunde. Die aktuelle Stufe liegt bei 1,7 % bei 2,8 Yuan pro Stunde. Das ist eine Reduzierung der Wortfehlerrate um 64 % für rund das Neunzehnfache des Preises – der schärfste Kompromiss in der Familie und derjenige, der entscheidet, ob sich das Upgrade lohnt.

Die Dimensionen, die sich tatsächlich unterscheiden
Sobald die Namensgebung geklärt ist, reduziert sich der Vergleich auf eine kurze Liste. Das sind diejenigen, die eine Entscheidung verändern:
• Genauigkeit — StepAudio 3 ASR bei 1,7 % AA-WER im Nicht-Streaming-Betrieb vs. StepAudio 2.5 ASR bei 4,7 % auf demselben Board. Gemessen von Artificial Analysis, nicht von StepFun.
• Preis — 2,8 Yuan pro Stunde gegenüber 0,15 Yuan pro Stunde. Beides Listenpreise der Anbieter, beide aktuell. Etwa das 19-Fache.
• Gewichte — für beide ausschließlich gehostete API. Keine offenen Gewichte irgendwo in der Familie, kein On-Premises-Pfad, keine Self-Hosting-Option in irgendeiner Tarifstufe.
• Endpoint-Form — ein einzelner Streaming-Transkriptionsendpunkt, der inkrementellen und finalen Text zurückgibt, gegenüber derselben Form in der vorherigen Generation. Am Integrationsmodell hat sich nichts geändert, sodass eine Migration ein Austausch der Modellkennung statt einer Neuimplementierung ist.
• Tuning für schwierige Audiodaten — StepAudio 3 ASR ist explizit auf geflüsterte, schnelle, verbundene und gesungene Sprache sowie auf Audio mit Musik im Hintergrund abgestimmt. Dieses Tuning ist das Produkt; die vorherige Generation wurde nicht dafür entwickelt.
• Vom Anbieter beanspruchte Domänengewinne — StepFun meldet Rückgänge: Chinesisch um 9,3 %, Englisch um 25,0 %, Dialekte um 22,3 %, Vertikalen um 42,1 % und Code-Switching um 27,9 % Generation über Generation. Vom Anbieter gemeldet und nicht reproduziert, daher als richtungsweisend zu behandeln.
Bemerkenswert ist, was in dieser Liste fehlt: Kontextlänge, Unterstützung von Audioformaten, maximale Audiodauer und eine Modellkennung. StepFuns öffentliche Dokumentation für dieses Modell gibt sie nicht an, und wer diese Zahlen zitiert, zitiert etwas anderes.
ASR vs. Realtime ist der Vergleich, den Leute wirklich brauchen
Wenn Sie sich zwischen Transkriptionsprodukten entscheiden und nicht zwischen Generationen, ist das interessante Duell nicht ASR gegen ASR Max – es ist ASR gegen Realtime. StepFuns eigenes technisches Material besagt, dass die beiden ihre Pretraining- und Midtraining-Phasen teilen und nur beim überwachten Fine-Tuning voneinander abweichen. Gleiche Basis, anderes Fine-Tuning, anderes Produkt.
Diese einzelne Tatsache hat eine praktische Bedeutung. Die Wortfehlerrate von 1,7 % ist eine Eigenschaft des ASR-Fine-Tunings. Sie ist kein Versprechen in Bezug auf das Echtzeitmodell, das auf Gesprächswechsel, den Umgang mit Unterbrechungen und das Schlussfolgern aus Sprache statt auf Transkriptionsgenauigkeit optimiert ist. Wenn Ihre Architektur als Nebeneffekt eines Live-Gesprächs transkribiert, kaufen Sie nicht die 1,7 % – Sie kaufen ein Konversationsmodell, das zufällig Text ausgibt.
Das Umgekehrte gilt ebenfalls und ist weniger offensichtlich: Weil sie sich ein Backbone teilen, ist das ASR-Modell kein kleines Spezialmodell, das an die Familie angeflanscht wurde. Es ist ein System derselben Größenordnung, nur anders feinabgestimmt. Deshalb liegt die ASR-Rate nahe bei der des restlichen Familienangebots und nicht am billigen Ende des Marktes.
Was ist damit zu tun, wenn du eins auswählst?
Drei Fragen klären es. Brauchen Sie ein Transkript oder brauchen Sie eine Unterhaltung? Wenn es um ein Transkript geht, ist StepAudio 3 ASR das Produkt, und der Familienname ist Rauschen. Wenn es um eine Unterhaltung geht, wollen Sie StepAudio 3 Realtime, und Sie sollten überhaupt keine ASR-Benchmarks lesen. Und wenn Sie ein Transkript von wirklich schwierigem Audio brauchen – akzentbehaftet, geflüstert, gesungen oder mit Musik darunter –, dann ist der 19-fache Aufpreis der Preis für die Stufe, die dafür optimiert wurde, und der ehrliche Test ist Ihr eigenes Audio und nicht ein gemischter Index.
Die Entscheidung, die man leicht falsch trifft, besteht darin, die Transkriptionsschicht als dauerhaft zu behandeln. Was auch immer Sie wählen, das Transkript ist eine Eingabe für etwas anderes – einen Summarizer, eine strukturierte Extraktion, eine Compliance-Prüfung, einen Suchindex – und diese Aufrufe landen bei gewöhnlichen Textmodellen. Das ist die Schicht, die mit der Nutzung statt mit Audiominuten skaliert, und sie ist die Schicht, die von Anfang an portabel bleiben sollte. OrcaRouter stellt fast 200 Textmodelle hinter einer einzigen API bereit, mit automatischem Failover über Anbieter hinweg, einer Routing-DSL, die mehrere zu einem einzigen Aufruf zusammenführt, und Modellfusion, wenn das Urteilsvermögen eines einzelnen Modells nicht ausreicht. Wenn ein Anbieter einen Tarif veröffentlicht, wird dieser Listenpreis ohne Aufschlag weitergegeben, sodass eine Preisänderung auf der Textseite Ihre Rechnung am Tag ihrer Ankündigung erreicht.
Um den Geltungsbereich klarzustellen: Da es auf dieser Seite um eine Familie geht, die wir nicht anbieten, gibt es keinen StepAudio 3-Endpunkt auf OrcaRouter. Die Transkriptions- und Sprachmodelle werden über StepFuns eigene API erreicht. Was OrcaRouter bereitstellt, ist die Reasoning-Schicht nach dem Transkript – dort ist eine Wechselentscheidung günstig zu treffen und teuer aufzuschieben.

Was niemand geklärt hat
Die Namensfrage lässt sich klären. Die Leistungsbehauptung noch nicht. Es gibt immer noch keinen veröffentlichten technischen Bericht für das ASR-Modell, kein veröffentlichtes Testset, keine Dekodierungskonfiguration und kein reproduzierbares Protokoll von irgendjemandem außerhalb von StepFun, und die eigenen Vergleiche des Anbieters richten sich gegen andere chinesische ASR-Produkte statt gegen das etablierte Open-Weights-Modell. Die 1,7 % sind eine echte Messung durch Dritte auf einem zusammengeführten Index aus drei Datensätzen; alles andere an diesem Modell ist eine Behauptung des Anbieters.
Zwei Dinge würden das Bild verändern. Ein direkter Vergleich mit Whisper Large v3 Turbo auf identischem Audiomaterial, den bisher niemand veröffentlicht hat. Und ein Preis für den Rest der Familie – vier der fünf StepAudio 3-Modelle befanden sich zum Marktstart noch in einer zeitlich begrenzten kostenlosen Vorschau-Preisgestaltung, und nur Transkription und Synthese hatten veröffentlichte Preise, was bedeutet, dass die Preisliste, die man heute einsehen kann, zwei von fünf Produkten abdeckt.

Das ist die Ebene, die mit der Nutzung statt mit Audiominuten skaliert, und es ist die Ebene, die es wert ist, von Anfang an portabel gehalten zu werden. automatisches Failover über Anbieter hinweg, eine Routing-DSL, die mehrere zu einem einzigen Aufruf zusammenführt, und Modellfusion, wenn das Urteil eines Modells nicht ausreicht.
