
StepAudio 3 ASR vs StepAudio 3: Er is geen model met die naam
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zoek naar StepAudio 3 en je vindt een familie, niet een model. StepFuns audio-release van 15 september 2026 bracht vijf producten onder die naam — Realtime, ASR, tekst-naar-spraak, Gen en Music — en het transcriptieproduct daartussen, StepAudio 3 ASR, is degene die sindsdien de ranglijsten beklimt. De variant die StepFuns eigen documentatie zijn grootste ASR-model tot nu toe noemt, is StepAudio 3 ASR Max, en het conversationele broertje waarmee het een backbone deelt, is StepAudio 3 Realtime. Als je "StepAudio 3 ASR" probeert te vergelijken met "StepAudio 3", vergelijk je een product met een productlijn, en het antwoord hangt er volledig van af welke van de drie je eigenlijk bedoelde.
Deze pagina lost dat op. Het is geen marketingvergelijking — het is de disambiguatie die je nodig hebt voordat je een specificatieblad van StepAudio 3 correct kunt lezen, omdat de drie bovenstaande namen verschillende prijzen, verschillende endpoints en verschillende faalmodi met zich meebrengen.
Waarom de naam ambigu is
StepFun bracht de hele audiostream in één dag uit, en de naamgevingsconventie maakte de familienaam de stam van elke productnaam. Dat is netjes op een lanceringsdia en onhandig overal elders. Het betekent dat een zoekopdracht naar de familienaam een mix van vijf verschillende producten oplevert, en een benchmarkrij met het label "StepAudio 3" zou aannemelijk elk van hen kunnen zijn.
De praktische consequentie is dat je aan een kop niet kunt zien welk ding werd gemeten. Een bericht dat zegt "StepAudio 3 staat bovenaan de transcriptie-ranglijst" beschrijft StepAudio 3 ASR. Een bericht dat zegt "StepAudio 3 wint op conversationele dynamiek" beschrijft StepAudio 3 Realtime. Beide zijn waar, het zijn verschillende producten, en ze zijn niet uitwisselbaar.
Er is specifiek binnen de ASR-lijn een tweede ambiguïteit. De documentatie van StepFun verwijst naar een ASR Max-tier als zijn grootste ASR-model tot nu toe, met een eigen prijsstelling en een eigen endpoint, terwijl de rijen in het openbare leaderboard het eenvoudigere label dragen. Uitzoeken of dat één SKU onder twee namen is of twee SKU's, is het nuttigste wat deze pagina kan doen, en de volgende sectie doet dat.
De drie dingen die de naam kan betekenen
• StepAudio 3 ASR — het transcriptieproduct. Een streaming-endpoint dat incrementele tekst retourneert terwijl het decodeert en aan het einde een definitief transcript. StepFun beschrijft het als transcriptie met een taalmodel eraan gekoppeld voor context, afgestemd op medische, juridische, financiële, automotive- en programmeeraudio, en op moeilijke inputs zoals gefluisterde spraak, snelle spraak, aaneengesloten spraak, zang en achtergrondmuziek. Het is het model dat op 1,7% woordfoutpercentage staat op de AA-WER-index van Artificial Analysis voor niet-streamende spraak-naar-tekst.
• StepAudio 3 ASR Max — het niveau dat volgens StepFun's documentatie zijn grootste ASR-model tot nu toe is. Het hanteert het gepubliceerde lijsttarief van 2,8 yuan per uur. Het is geen goedkopere transcriptietool; het is het topmodel in de ASR-reeks.
• StepAudio 3 Realtime — het full-duplex gespreksmodel. Het redeneert rechtstreeks over spraak in plaats van een keten van eerst transcriberen en dan redeneren te doorlopen, en het transcribeert als bijproduct daarvan. Het is geen ASR-product, en de nauwkeurigheid bij transcriptietaken is niet waarop het is afgestemd.
Al het andere binnen de familie — TTS, Gen, Music — is een totaal andere taak en zou helemaal niet in een transcriptievergelijking moeten voorkomen.
Zijn ASR en ASR Max hetzelfde model?
Het bewijs wijst op ja, en de controle is rekenkundig. StepFun vermeldt de ASR Max-tier tegen 2,8 yuan per uur. Omgerekend tegen ongeveer 7,1 yuan per dollar is dat ongeveer $0,39 per uur, of ruwweg $6,6 per 1.000 minuten. Artificial Analysis vermeldt het model op zijn leaderboard tegen $6,67 per 1.000 minuten. Twee onafhankelijk gepubliceerde cijfers, één uit de prijslijst van de leverancier en één van de ranglijst van een derde partij, die binnen één cent van elkaar uitkomen. Dat is wat je zou verwachten als de rij op het leaderboard en het ASR Max-lijsttarief dezelfde SKU beschrijven.
Het is de moeite waard om precies te zijn over wat dat wel en niet bewijst. Het bewijst dat de prijsas van het leaderboard en de tariefkaart van de leverancier hetzelfde product tegen dezelfde prijs beschrijven. Het bewijst niet dat de 1,7% van het leaderboard is gemeten op precies het endpoint dat jij zou aanroepen, omdat het board zijn decoderingsconfiguratie of het endpoint dat het heeft gebruikt niet publiceert. Dus: hetzelfde product, zeer waarschijnlijk; dezelfde meetomstandigheden, niet geverifieerd.
Wat zeker is, is de generatiesprong binnen de lijn. StepAudio 2.5 ASR staat op 4,7% op dezelfde benchmark tegen 0,15 yuan per uur. Het huidige niveau is 1,7% tegen 2,8 yuan per uur. Dat is een verlaging van het woordfoutpercentage met 64% voor ongeveer negentien keer dat tarief — de scherpste afweging in de familie en degene die bepaalt of de upgrade de moeite waard is.

De dimensies die daadwerkelijk verschillen
Zodra de naamgeving is vastgesteld, beperkt de vergelijking zich tot een korte lijst. Dit zijn de punten die een beslissing veranderen:
• Nauwkeurigheid — StepAudio 3 ASR met 1,7% AA-WER non-streaming versus StepAudio 2.5 ASR met 4,7% op hetzelfde leaderboard. Gemeten door Artificial Analysis, niet door StepFun.
Prijs — 2,8 yuan per uur versus 0,15 yuan per uur. Beide zijn de lijsttarieven van de leverancier, beide actueel. Ongeveer 19x.
• Gewichten — voor beide alleen een gehoste API. Geen open gewichten, waar dan ook in de familie, geen on-premise-traject, geen self-hostingoptie op welk niveau dan ook.
• Vorm van het endpoint — één streaming-transcriptie-endpoint dat incrementele en definitieve tekst retourneert versus dezelfde vorm in de vorige generatie. Er is niets veranderd aan het integratiemodel, dus een migratie is het omwisselen van een model-ID in plaats van een herschrijving.
• Tuning voor moeilijke audio — StepAudio 3 ASR is expliciet afgestemd op gefluisterde, snelle, aaneengeschakelde en gezongen spraak en op audio met muziek eronder. Die afstemming is het product; de vorige generatie was daar niet voor gebouwd.
• Door de leverancier geclaimde domeinwinsten — StepFun rapporteert een daling van 9,3% voor Chinees, 25,0% voor Engels, 22,3% voor dialecten, 42,1% voor verticalen en 27,9% voor code-switching, generatie-op-generatie. Door de leverancier gerapporteerd en niet gereproduceerd, dus beschouw ze als richtinggevend.
Opvallend afwezig in die lijst: contextlengte, ondersteuning voor audioformaten, maximale audioduur en een modelidentificatie. De openbare documentatie van StepFun voor dit model vermeldt deze niet, en wie die cijfers citeert, citeert iets anders.
ASR versus Realtime is de vergelijking die mensen echt nodig hebben
Als je kiest tussen transcriptieproducten in plaats van tussen generaties, is de interessante confrontatie niet ASR tegenover ASR Max, maar ASR tegenover Realtime. StepFuns eigen technische materiaal zegt dat de twee hun pretrainings- en midtrainingsfasen delen en alleen tijdens de supervised fine-tuning uiteenlopen. Dezelfde basis, een andere fine-tune, een ander product.
Dat enkele feit heeft een praktische betekenis. Het woordfoutpercentage van 1,7% is een eigenschap van de ASR-finetune. Het is geen belofte over het realtime-model, dat optimaliseert voor beurtwisseling, omgaan met onderbrekingen en redeneren over spraak in plaats van voor transcriptienauwkeurigheid. Als je architectuur transcripten produceert als neveneffect van een livegesprek, dan koop je niet die 1,7% — je koopt een gespreksmodel dat toevallig tekst produceert.
Het omgekeerde is ook waar en minder voor de hand liggend: omdat ze een backbone delen, is het ASR-model geen klein specialistisch model dat aan de familie is vastgeschroefd. Het is een systeem van dezelfde schaal, alleen anders fine-tuned. Daarom ligt het ASR-tarief dicht bij dat van de rest van de familie, en niet in de buurt van de goedkope kant van de markt.
Wat te doen met dit als je er één kiest
Drie vragen geven de doorslag. Heb je een transcript nodig, of heb je een gesprek nodig? Als je een transcript nodig hebt, is StepAudio 3 ASR het product en is de familienaam ruis. Als je een gesprek wilt, wil je StepAudio 3 Realtime en zou je helemaal geen ASR-benchmarks moeten lezen. En als je een transcript nodig hebt van echt moeilijke audio — met accent, gefluisterd, gezongen, of met muziek eronder — dan is de 19x-premie de prijs van de tier die daarvoor is afgestemd, en de eerlijke test is je eigen audio in plaats van een gemengde index.
De beslissing die je makkelijk verkeerd neemt, is de transcriptielaag als permanent te beschouwen. Wat je ook kiest, het transcript is input voor iets anders — een samenvatter, een gestructureerde extractie, een compliancecontrole, een zoekindex — en die aanroepen komen terecht bij gewone tekstmodellen. Dat is de laag die meeschaalt met gebruik in plaats van met audiominuten, en het is de laag die het waard is om vanaf het begin portable te houden. OrcaRouter zet bijna 200 tekstmodellen achter één API met automatische failover tussen providers, een routing-DSL die er meerdere samenvoegt in één aanroep, en modelfusie wanneer het oordeel van één model niet volstaat. Waar een provider een tarief publiceert, wordt die lijstprijs zonder markup doorgegeven, zodat een prijswijziging aan de tekstkant je factuur bereikt op de dag dat die wordt aangekondigd.
Even duidelijk over de scope, aangezien deze pagina gaat over een familie die wij niet bedienen: geen enkel StepAudio 3-endpoint staat op OrcaRouter. De transcriptie- en voicemodellen worden bereikt via de eigen API van StepFun. Wat OrcaRouter aanbiedt, is de redeneerlaag stroomafwaarts van het transcript, en dat is waar een overstapbeslissing goedkoop is om te nemen en duur om uit te stellen.

Wat niemand heeft beslecht
De naamgeving valt te verklaren. De prestatieclaim nog niet. Er is nog steeds geen gepubliceerd technisch rapport voor het ASR-model, geen vrijgegeven testset, geen decoderingsconfiguratie en geen reproduceerbaar protocol van iemand buiten StepFun, en de eigen vergelijkingen van de leverancier zijn tegen andere Chinese ASR-producten gericht in plaats van tegen de gevestigde open-weights-concurrent. De 1,7% is een echte meting door een derde partij op een samengestelde index van drie datasets; al het andere aan dit model is een leveranciersclaim.
Twee dingen zouden het beeld veranderen. Een directe vergelijking met Whisper Large v3 Turbo op identieke audio, die niemand heeft gepubliceerd. En een tarief voor de rest van de familie — vier van de vijf StepAudio 3-modellen vielen bij de lancering nog onder een tijdelijke gratis preview-prijs, en alleen transcriptie en synthese hadden gepubliceerde tarieven, wat betekent dat de prijslijst die je vandaag kunt lezen twee van de vijf producten dekt.

Dat is de laag die meeschaalt met gebruik in plaats van met audiominuten, en het is de laag die het waard is om vanaf het begin portabel te houden. automatische failover tussen providers, een routing-DSL die meerdere combineert tot één enkele aanroep, en modelfusie wanneer het oordeel van één model niet volstaat.
