Ett genererat hero-titelkort med rubriken 'StepAudio 3 ASR vs Whisper Large v3 Turbo' och underrubriken '1,7 procent mot 4,6 procent, och inget head-to-head-test finns', ovanför sidfoten 'StepAudio enligt Artificial Analysis; Whisper enligt Hugging Face.'
Guides & Insights

StepAudio 3 ASR vs. Whisper Large v3 Turbo: 1,7 % mot 4,6 %, och ingen har kört testet

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Jämförelsen du vill ha finns inte. StepAudio 3 ASR och Whisper Large v3 Turboligger på samma Artificial Analysis AA-WER-index för icke-strömmande tal-till-text — 1,7 % ordfelsfrekvens mot siffror i intervallet 4 till 5,5 % — och i slutet av september 2026 har ingen publicerat en direkt jämförelse på identiskt ljud. Inte StepFun, inte Whisper-underhållarna, inte ett oberoende laboratorium. StepFuns egen dokumentation benchmarkar mot Doubao ASR 2.0, Seed 2.0 Lite och HY3.0 ASR Preview, alla kinesiska ASR-produkter. Whisper-sidan har ingen leverantör som publicerar jämförelser alls, eftersom Whisper Large v3 Turbo har varit nedladdningsbar i flera år och dess siffror beror på vem som tillhandahåller den.

Så den här sidan gör den ärliga versionen: den läser den enda resultattavlan som mäter båda, skiljer det jämförbara från det som inte är det och säger rakt ut var bevisen tar slut. Det korta svaret är att gapet i noggrannhet är verkligt och ungefär tre punkter brett, och gapet på allt annat – pris, licens, driftsättbarhet – går åt andra hållet och är större.

Vad var och en faktiskt är

StepAudio 3 ASR är en hostad transkriptionsmodell som släpptes av StepFun den 15 september 2026 som en del av den fem modeller stora ljudfamiljen StepAudio 3. Den nås via en enda strömmande slutpunkt som returnerar inkrementell text under avkodningen och en slutlig transkription i slutet. StepFun beskriver den som transkribering med en språkmodell kopplad för kontext, finjusterad för medicinskt, juridiskt, finansiellt, fordons- och programmeringsljud samt för indata som bryter konventionella igenkännare – viskande tal, snabbt tal, sammanhängande tal, sång och ljud med musik under. Det finns inga öppna vikter, ingen lokal driftsättning och inget alternativ för egen hosting på någon nivå. Det publicerade listpriset är 2,8 yuan per timme, cirka 6,67 USD per 1 000 minuter på leaderboardens egen prisaxel.

Whisper Large v3 Turbo är en modell med öppna vikter som publicerats av OpenAI under MIT-licensen: 809 miljoner parametrar, 99 språk, en beskuren och finjusterad avledning av Whisper large-v3 med färre dekoderlager. Den har laddats ner miljontals gånger och tillhandahålls kommersiellt av en lång rad plattformar och kan köras på din egen hårdvara. Den sista egenskapen är hela jämförelsen, och det är anledningen till att noggrannhetsgapet inte är det enda talet som spelar roll.

Det enda kortet som mäter båda

AA-WER-indexet från Artificial Analysis rapporterar andelen ord som transkriberats felaktigt; lägre är bättre, och version 2 av det kombinerar tre datamängder: AA-AgentTalk till 50 %, VoxPopuli-Cleaned-AA till 25 % och Earnings22-Cleaned-AA till 25 %. Den icke-strömmande vyn visar 36 av de 71 modeller som den följer. Båda modellerna finns med där, vilket är mer än vad de flesta jämförelser kan hävda.

Läs som styrelsen listar dem:

• StepAudio 3 ASR — 1,7 % AA-WER, ungefär 6,67 USD per 1 000 minuter ljud

• Whisper Large v3 Turbo, en hostad endpoint — 4,6 % AA-WER, cirka 0,67 USD per 1 000 minuter

• Whisper Large v3 Turbo, en andra hostad slutpunkt — 5,5 % AA-WER, cirka 15,00 USD per 1 000 minuter

• Whisper Large v3, en annan generation med öppna vikter — 4,1 % på en slutpunkt, 10,1 % på en annan

• StepAudio 2.5 ASR, StepFuns tidigare generation – 4,7 %

De två sista raderna är de mest lärorika på tavlan, och de handlar inte alls om StepFun. Samma öppna Whisper-vikter får 4,1 % på en slutpunkt och 10,1 % på en annan. Det är en spridning på 6 punkter med identiska parametrar, helt och hållet orsakad av skillnader i serving: chunkningsstrategi, hårdvara, avkodningskonfiguration och hur varje värd hanterar ljud som är längre än dess interna gränser. Tavlans egen fotnot säger lika mycket och noterar att för en av dess datamängder blir vissa modellers ljud chunkat till ungefär nio minuter och andra till ungefär trettio sekunder på grund av tidsgränser.

Vilket innebär att jämförelsen "StepAudio 3 ASR vs Whisper Large v3 Turbo" egentligen är två jämförelser ovanpå varandra. Modellen mot vikterna, och modellen mot vilken endpoint du råkade benchmarka. Den andra varierar mer än den första.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

Varifrån noggrannhetsgapet kommer, och hur mycket man bör lita på det

Tre procentenheter i ordfelsfrekvens är ett stort avstånd i ett område där de fem bästa systemen ligger inom 0,6 procentenheter från varandra. Det är också det enda talet i den här jämförelsen som en tredje part har mätt, och det kommer med verkliga förbehåll som drar åt båda hållen.

Jämfört med StepAudio 3 ASR: siffran är ett sammansatt index, och blandningen består till 50 % av AA-AgentTalk – ett dataset för agentkonversationer. En modell anpassad för domänspecifik transkribering med en LLM kopplad för kontext är väl lämpad för den typen av ljud. Viktar man om indexet mot uppläst tal eller nyhetssändningar skulle rangordningen kunna stramas åt. Det finns fortfarande ingen publicerad teknisk rapport för ASR-modellen, inget släppt testset, ingen avkodningskonfiguration och inget reproducerbart protokoll från någon utanför StepFun.

Jämfört med Whisper Large v3 Turbo: de 4,6 % är siffran för en hostad endpoint, inte en egenskap hos modellen. Vikterna är fasta och offentliga; poängen är det inte. Ett team som kör samma vikter noggrant, med domänanpassad chunkning och en bra dekoderkonfiguration, kan hamna betydligt bättre än resultattavlans rad — och ett team som kör dem slarvigt kan hamna sämre än de 10,1 % som den andra generationen med öppna vikter redovisade. Den ärliga sammanfattningen är att sidan med öppna vikter i denna jämförelse har ett golv man kan mäta och ett tak man måste förtjäna.

Det som saknas är den siffra som skulle avgöra saken: båda systemen, en och samma ljuduppsättning, ett och samma avkodningsprotokoll, publicerat. Ingen har kört det, och tills någon gör det är ”1,7 % vs 4,6 %” en jämförelse av två mätningar gjorda under olika förhållanden snarare än en mätning där två system ställs mot varandra.

De andra fyra dimensionerna, där Whisper vinner med större marginal

Noggrannhet är den dimension där StepFun vinner. På resten av listan är modellen med öppna vikter inte ens nära, och det är dessa som avgör om en driftsättning överhuvudtaget är möjlig:

• Licens och vikter — MIT-licensierade öppna vikter med 809M parametrar vs ett hostat API utan publicerade vikter på någon nivå.

• Distribution – egen drift, lokalt installerad, i isolerat nätverk eller via någon av dussintals kommersiella plattformar jämfört med enbart StepFuns API.

• Kostnadsgolv – cirka 0,67 USD per 1 000 minuter på en hostad endpoint, och ännu lägre om du kör den själv, jämfört med cirka 6,67 USD per 1 000 minuter enligt leverantörens publicerade pris.

• Datahemvist — ljudet lämnar aldrig infrastruktur som du kontrollerar, jämfört med ljud som skickas till en slutpunkt hos tredje part.

• Integrationsrisk — modellen kan inte dras tillbaka, prissättas om eller avvecklas under dig, eftersom du innehar vikterna till skillnad från en hostad taxa som kan ändras med en prislista.

• Beteende för långa ljud — uppdelning i chunkar är ditt beslut och kan ställas in per fil, till skillnad från vad leverantörens endpoint gör internt, vilket inte är dokumenterat.

Den prisskillnaden är ungefär tio mot ett jämfört med den billigare Whisper-slutpunkten, och den är spegelbilden av vad som hände inom StepFuns egen produktlinje: modellen som den här ersätter, StepAudio 2.5 ASR, listades till 0,15 yuan per timme, och den nuvarande nivån listas till 2,8. StepFun höjde transkriberingstaxan med omkring nitton gånger för att köpa sig noggrannhet, vilket placerar den på en annan marknad än en självhostad modell med öppna vikter snarare än en dyrare version av den.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

Vilken du bör välja

Uppdelningen är renare än de flesta head-to-heads:

• Ta Whisper Large v3 Turbo om ljudet är vanligt, volymen är hög, data inte får lämna din infrastruktur, eller du behöver att driftsättningen är permanent och prisstabil. MIT-licensen innebär att det är du som kan ändra beslutet och ingen kan ta tillbaka det.

• Använd StepAudio 3 ASR om ljudet verkligen är svårt – med brytning, viskande tal, sång eller musik i bakgrunden – eller om domänen är en av de fem som StepFun har finjusterat för. Det är vad man betalar premium för, och på sådant ljud är en noggrannhetsskillnad på tre procentenheter skillnaden mellan en användbar transkription och en manuell korrigeringsrunda.

• Välj ingen av dem uteslutande om du inte vet vilken som är din audio. Kostnaden för att ha fel är asymmetrisk: open-weights-vägen kan testas på din egen hårdvara för priset av en GPU-timme, och den hostade vägen kostar inget att prova men binder dig vid en taxa som du inte kan styra.

Argumentet för en hybrid är starkare här än i de flesta jämförelser, och anledningen är slutpunktsspridningen på resultattavlan. Eftersom samma Whisper-vikter får mellan 4,1 % och 10,1 % beroende på vem som serverar dem, är det praktiska draget att routa open weights-spåret över fler än en värd i stället för att binda sig till en — vilket är vad automatisk failover ger dig, och det är samma mekanism som låter dig sätta en hostad modell framför en produktionsväg utan att satsa produktionsvägen på den.

Hur detta passar in i en stack, och vad vi serverar och inte serverar

Vad du än väljer för transkribering hamnar transkriptet någonstans. En sammanfattare, en strukturerad extraktion, en efterlevnadskontroll, ett sökindex – dessa anrop landar hos vanliga textmodeller, och de är den del av fakturan som skalas med användning snarare än med ljudminuter. StepFuns egen realtidsmodell annonserar verktygsanrop och asynkron körning av långa uppgifter, vilket innebär att även ljudlagret ständigt lämnar över arbete till något som inte är en ljudmodell.

För att vara tydlig med omfattningen, eftersom det vore lätt att antyda något annat: varken StepAudio 3 ASR eller Whisper Large v3 Turbo finns på OrcaRouter. StepAudio nås via StepFuns eget API, och Whisper-vikterna är dina att köra själv eller ta med till en hostingplattform. Det OrcaRouter tillhandahåller är det delegeringslager som transkriptionen matar — nästan 200 textmodeller bakom ett enda API, med automatisk redundansväxling så att ett nedströmsanrop inte dör med en enda leverantör, ett routing-DSL som komponerar flera modeller till ett anrop, och modellfusion när en enda modells bedömning inte räcker. När en leverantör publicerar ett pris förs listpriset vidare utan påslag, så en prisändring når din faktura samma dag som den tillkännages — vilket, med tanke på att den här jämförelsen innehåller en leverantör som höjde sin transkriptionsavgift nittonfaldigt i en enda version, inte är en hypotetisk fördel.

Om du är på väg att lägga riktiga pengar på noggrannhetsfrågan är den billiga sekvensen denna: kör de öppna vikterna på din egen ljuddata först, eftersom du kan det, och eftersom siffran du får kommer att vara mer relevant än någon resultattavlas. Bestäm sedan om gapet som kvarstår är värt tio gånger priset. De flesta team kommer att upptäcka att det är värt det för en del av deras trafik men inte för resten, och att det är ett routingproblem snarare än ett modellval.

Vad skulle avgöra det?

Ett publicerat test. Båda systemen, samma ljud, samma avkodningsprotokoll, en ärlig uppdelning mellan uppläst tal, samtalsljud och de svåra fall som StepFun påstår sig ha finjusterat för. Tills det finns är jämförelsen ett tredjepartsindex på ena sidan och en uppsättning öppna vikter med en varierande poäng på den andra, och det enda ansvarsfulla sättet att läsa den är som en utgångspunkt snarare än ett svar.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.