
StepAudio 3 ASR vs Whisper Large v3 Turbo: 1,7% tegen 4,6%, en niemand heeft de test uitgevoerd
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
De vergelijking die je wilt, bestaat niet. StepAudio 3 ASR en Whisper Large v3 Turbostaan op dezelfde Artificial Analysis AA-WER-index voor niet-streaming spraak-naar-tekst — een woordfoutpercentage van 1,7% tegenover cijfers in de orde van 4 tot 5,5% — en sinds eind september 2026 heeft niemand een rechtstreekse vergelijking gepubliceerd op identieke audio. Niet StepFun, niet de Whisper-onderhouders, niet een onafhankelijk lab. De eigen documentatie van StepFun benchmarkt tegen Doubao ASR 2.0, Seed 2.0 Lite en HY3.0 ASR Preview, allemaal Chinese ASR-producten. Aan de Whisper-kant publiceert geen enkele leverancier vergelijkingen, omdat Whisper Large v3 Turbo al jaren te downloaden is en de cijfers ervan afhangen van wie het serveert.
Dus deze pagina doet de eerlijke versie: ze leest het ene bord dat beide meet, scheidt wat vergelijkbaar is van wat niet, en zegt ronduit waar het bewijs ophoudt. Het korte antwoord is dat de kloof in nauwkeurigheid reëel is en ongeveer drie punten breed, en de kloof op al het andere — prijs, licentie, inzetbaarheid — loopt de andere kant op en is groter.
Wat elk ervan eigenlijk is
StepAudio 3 ASR is een gehost transcriptiemodel dat StepFun op 15 september 2026 heeft uitgebracht als onderdeel van de uit vijf modellen bestaande StepAudio 3-audiofamilie. Het is bereikbaar via één streaming-endpoint dat tijdens het decoderen incrementele tekst retourneert en aan het einde een definitief transcript. StepFun beschrijft het als transcriptie met een taalmodel eraan gekoppeld voor context, afgestemd op medische, juridische, financiële, automotive- en programmeeraudio en op invoer die conventionele herkenners laat stuklopen — gefluisterde spraak, snelle spraak, aaneengesloten spraak, zang en audio met muziek eronder. Er zijn geen open gewichten, geen on-premise-traject en op geen enkel niveau een self-hostingoptie. Het gepubliceerde lijsttarief is 2,8 yuan per uur, ongeveer $6,67 per 1.000 minuten op de eigen prijsas van het leaderboard.
Whisper Large v3 Turbo is een model met open gewichten dat door OpenAI onder de MIT-licentie is gepubliceerd: 809 miljoen parameters, 99 talen, een gesnoeide en fine-getunede afgeleide van Whisper large-v3 waarbij het aantal decoderlagen is teruggebracht. Het is miljoenen keren gedownload, wordt commercieel aangeboden via een lange lijst platforms en kan op je eigen hardware draaien. Die laatste eigenschap vormt de hele vergelijking, en het is de reden waarom de nauwkeurigheidskloof niet het enige getal is dat ertoe doet.
Het enige board dat beide meet
De AA-WER-index van Artificial Analysis rapporteert het percentage woorden dat onjuist is getranscribeerd; lager is beter, en versie 2 ervan combineert drie datasets: AA-AgentTalk met 50%, VoxPopuli-Cleaned-AA met 25% en Earnings22-Cleaned-AA met 25%. De niet-streamingweergave toont 36 van de 71 modellen die hij volgt. Beide modellen komen erin voor, wat meer is dan de meeste vergelijkingen kunnen beweren.
Lees zoals het bestuur ze opsomt:
• StepAudio 3 ASR — 1,7% AA-WER, ongeveer $6,67 per 1.000 minuten audio
Whisper Large v3 Turbo, één gehoste endpoint — 4,6% AA-WER, ongeveer $0,67 per 1.000 minuten
• Whisper Large v3 Turbo, een tweede gehost endpoint — 5,5% AA-WER, ongeveer $15,00 per 1.000 minuten
• Whisper Large v3, een andere generatie met open gewichten — 4,1% op één endpoint, 10,1% op een ander
• StepAudio 2.5 ASR, de vorige generatie van StepFun — 4,7%
De laatste twee regels op het bord zijn het meest leerzaam, en ze gaan helemaal niet over StepFun. Dezelfde open Whisper-gewichten scoren 4,1% op het ene endpoint en 10,1% op het andere. Dat is een verschil van 6 punten bij identieke parameters, volledig veroorzaakt door verschillen in serving: chunkingstrategie, hardware, decoderingsconfiguratie en hoe elke host audio verwerkt die langer is dan zijn interne limieten. De voetnoot van het bord zelf zegt dat ook, en merkt op dat voor een van zijn datasets de audio van sommige modellen vanwege tijdslimieten wordt opgedeeld in stukken van ongeveer negen minuten en die van andere in stukken van ongeveer dertig seconden.
Wat betekent dat de vergelijking "StepAudio 3 ASR vs Whisper Large v3 Turbo" eigenlijk twee gestapelde vergelijkingen is. Het model tegen de gewichten, en het model tegen welk endpoint je toevallig hebt gebenchmarkt. De tweede varieert meer dan de eerste.

Waar de nauwkeurigheidskloof vandaan komt, en hoeveel je ervan kunt vertrouwen
Een verschil van drie punten in het woordfoutpercentage is een grote kloof in een vakgebied waar de vijf beste systemen binnen 0,6 punt van elkaar liggen. Het is ook het enige getal in deze vergelijking dat door een derde partij is gemeten, en het komt met reële kanttekeningen die beide kanten op snijden.
Tegen StepAudio 3 ASR: het cijfer is een samengestelde index, en de samenstelling is 50% AA-AgentTalk — een dataset met agentgesprekken. Een model dat is afgestemd op domeinspecifieke transcriptie, met een LLM eraan gekoppeld voor context, is goed geschikt voor dat type audio. Herweeg de index naar voorgelezen spraak of nieuwsuitzendingen, en de rangorde zou strakker kunnen worden. Er is ook nog steeds geen gepubliceerd technisch rapport voor het ASR-model, geen vrijgegeven testset, geen decoderingsconfiguratie en geen reproduceerbaar protocol van iemand buiten StepFun.
Vergeleken met Whisper Large v3 Turbo: de 4,6% is het cijfer van één gehost endpoint, niet een eigenschap van het model. De gewichten zijn vast en openbaar; de score niet. Een team dat dezelfde gewichten zorgvuldig draait, met domeingeschikte chunking en een goede decoderconfiguratie, kan beduidend beter uitkomen dan de rij op het scorebord — en een team dat ze onzorgvuldig draait, kan slechter uitkomen dan de 10,1% die de andere open-weights-generatie neerzette. De eerlijke samenvatting is dat de open-weights-kant van deze vergelijking een ondergrens heeft die je kunt meten en een bovengrens die je moet verdienen.
Wat ontbreekt is het getal dat het zou beslechten: beide systemen, één audioset, één decoderingsprotocol, gepubliceerd. Niemand heeft het uitgevoerd, en totdat iemand dat doet, is "1,7% vs 4,6%" een vergelijking van twee metingen onder verschillende omstandigheden in plaats van een meting van twee systemen tegen elkaar.
De andere vier dimensies, waar Whisper met een grotere marge wint
Nauwkeurigheid is de dimensie waarin StepFun wint. Op de rest van de lijst komt het open-weightsmodel niet in de buurt, en het zijn juist deze die bepalen of een deployment überhaupt mogelijk is:
• Licentie en gewichten — MIT-gelicentieerde open gewichten met 809M parameters vs. een gehoste API waarbij op geen enkel niveau gewichten worden gepubliceerd.
• Implementatie — self-hosted, on-premise, air-gapped, of via een van de tientallen commerciële platforms versus alleen StepFun's API.
• Kostenondergrens — ongeveer $0,67 per 1.000 minuten op één gehost eindpunt, en nog lager als u het zelf draait, tegenover ongeveer $6,67 per 1.000 minuten tegen het gepubliceerde tarief van de leverancier.
• Gegevensresidentie — de audio verlaat nooit de infrastructuur die u beheert, versus audio die naar een eindpunt van een derde partij wordt verzonden.
• Integratierisico — het model kan niet onder u vandaan worden teruggetrokken, opnieuw worden geprijsd of worden afgeschaft, omdat u de gewichten bezit tegenover een gehost tarief dat kan veranderen met een prijslijst.
• Gedrag bij lange audio — het opdelen in chunks is jouw beslissing en kan per bestand worden afgestemd, tegenover wat de endpoint van de leverancier intern doet, wat niet gedocumenteerd is.
Dat prijsverschil is ongeveer tien tegen een ten opzichte van het goedkopere Whisper-endpoint, en het is het spiegelbeeld van wat er binnen de eigen lijn van StepFun is gebeurd: het model dat dit vervangt, StepAudio 2.5 ASR, stond op 0,15 yuan per uur, en het huidige niveau staat op 2,8. StepFun verhoogde het transcriptietarief met ongeveer een factor negentien om nauwkeurigheid te kopen, wat het in een andere markt plaatst dan een zelfgehost open-weights-model, in plaats van een duurdere versie daarvan.

Welke je zou moeten kiezen
De split is zuiverder dan de meeste rechtstreekse confrontaties:
• Kies Whisper Large v3 Turbo als de audio gewoon is, het volume hoog is, de data je infrastructuur niet mag verlaten, of als je wilt dat de deployment permanent en prijsstabiel is. De MIT-licentie betekent dat de beslissing aan jou is om terug te draaien en niemand kan die van je afnemen.
• Kies StepAudio 3 ASR als de audio echt moeilijk is — met accent, gefluisterd, gezongen of met muziek eronder — of als het domein een van de vijf is waarvoor StepFun is afgestemd. Dat is wat je met de premiumversie koopt, en bij zulke audio is een nauwkeurigheidsverschil van drie punten het verschil tussen een bruikbaar transcript en een handmatige correctieronde.
• Kies geen van beide uitsluitend als je niet weet welke van de twee jouw audio is. De kosten van een verkeerde keuze zijn asymmetrisch: het open-weights-pad kan op je eigen hardware worden getest voor de prijs van een GPU-uur, en het gehoste pad kost niets om te proberen, maar bindt je aan een tarief dat je niet kunt beheersen.
Het argument voor een hybride is hier sterker dan in de meeste vergelijkingen, en de reden is de spreiding tussen endpoints op het bord. Omdat dezelfde Whisper-gewichten, afhankelijk van wie ze serveert, ergens tussen 4,1% en 10,1% scoren, is de praktische stap om het open-weights-pad over meer dan één host te routeren in plaats van je aan één host te binden — dat is wat automatische failover je geeft, en het is hetzelfde mechanisme waarmee je een gehost model vóór een productiepad kunt zetten zonder het pad eraan op te hangen.
Hoe dit in een stack past, en wat we wel en niet serveren
Wat je ook kiest voor transcriptie, het transcript belandt ergens. Een samenvatter, een gestructureerde extractie, een compliancecontrole, een zoekindex — die aanroepen komen terecht bij gewone tekstmodellen, en dat is het deel van de rekening dat meeschaalt met gebruik in plaats van met audiominuten. StepFuns eigen realtime-model adverteert tool calling en asynchrone uitvoering van langdurige taken, wat betekent dat zelfs de audiolaag voortdurend werk doorgeeft aan iets dat geen audiomodel is.
Om expliciet te zijn over de scope, want het zou makkelijk zijn om iets anders te suggereren: noch StepAudio 3 ASR noch Whisper Large v3 Turbo is te vinden op OrcaRouter. StepAudio bereik je via de eigen API van StepFun, en de Whisper-gewichten kun je zelf draaien of naar een hostingplatform brengen. Wat OrcaRouter biedt, is de delegatielaag waar het transcript naartoe gaat — bijna 200 tekstmodellen achter één API, met automatische failover zodat een downstream-aanroep niet sterft door één enkele provider, een routing-DSL die meerdere modellen in één aanroep samenbrengt, en modelfusie wanneer het oordeel van één model niet toereikend is. Waar een provider een tarief publiceert, wordt die lijstprijs zonder opslag doorgegeven, zodat een prijswijziging je factuur bereikt op de dag dat die wordt aangekondigd — wat, gezien het feit dat deze vergelijking een leverancier bevat die zijn transcriptietarief in één release met factor negentien verhoogde, geen hypothetisch voordeel is.
Als je op het punt staat echt geld uit te geven aan de nauwkeurigheidskwestie, is de goedkope volgorde deze: laat de open gewichten eerst op je eigen audio draaien, omdat dat kan en omdat het getal dat je krijgt relevanter zal zijn dan dat van welk leaderboard dan ook. Besluit dan of het gat dat overblijft tien keer het tarief waard is. De meeste teams zullen merken dat het de moeite waard is voor een deel van hun verkeer en niet voor de rest, en dat is eerder een routeringsprobleem dan een modelkeuze.
Wat zou het beslechten?
Eén gepubliceerde test. Beide systemen, dezelfde audio, hetzelfde decoderingsprotocol, een eerlijke opsplitsing tussen voorgelezen spraak, gespreksaudio en de moeilijke gevallen waarvoor StepFun claimt te zijn afgestemd. Zolang die niet bestaat, is de vergelijking aan de ene kant een index van derden en aan de andere kant een verzameling open gewichten met een variabele score, en de enige verantwoorde manier om die te lezen is als een uitgangspunt, niet als een antwoord.

