
StepAudio 3 ASR vs StepAudio 3: Det finns ingen modell med det namnet
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sök efter StepAudio 3 och du hittar en familj, inte en modell. StepFuns ljudsläpp den 15 september 2026 placerade fem produkter under det namnet – Realtime, ASR, text-till-tal, Gen och Music – och transkriptionsprodukten bland dem, StepAudio 3 ASR, är den som har klättrat på resultattavlor sedan dess. Den nivå som StepFuns egen dokumentation kallar sin hittills största ASR-modell är StepAudio 3 ASR Max, och det samtalsinriktade syskonet som den delar en stomme med är StepAudio 3 Realtime. Om du försöker jämföra "StepAudio 3 ASR" mot "StepAudio 3", jämför du en produkt mot en produktlinje, och svaret beror helt på vilken av de tre du faktiskt menade.
Den här sidan reder ut det. Det är inte en marknadsföringsjämförelse – det är den särskiljning du behöver innan du kan läsa något specifikationsblad för StepAudio 3 korrekt, eftersom de tre namnen ovan har olika priser, olika slutpunkter och olika felmoder.
Varför namnet är tvetydigt
StepFun släppte hela ljudstacken på en dag, och namnkonventionen gjorde familjenamnet till stammen i varje produktnamn. Det är snyggt på en lanseringsslide och klumpigt överallt annars. Det innebär att en sökning på familjenamnet returnerar en blandning av fem olika produkter, och en benchmark-rad märkt "StepAudio 3" skulle rimligen kunna vara vilken som helst av dem.
Den praktiska konsekvensen är att man inte kan avgöra utifrån en rubrik vilken sak som mättes. Ett inlägg som säger "StepAudio 3 toppar transkriptionstopplistan" beskriver StepAudio 3 ASR. Ett inlägg som säger "StepAudio 3 vinner på samtalsdynamik" beskriver StepAudio 3 Realtime. Båda är sanna, de är olika produkter, och de är inte utbytbara.
Det finns en andra tvetydighet specifikt inom ASR-linjen. StepFuns dokumentation hänvisar till en ASR Max-nivå som dess största ASR-modell hittills, med egen prissättning och egen endpoint, medan raderna i den offentliga topplistan bär den enklare beteckningen. Att reda ut huruvida dessa är en SKU under två namn eller två SKU:er är det mest användbara den här sidan kan göra, och nästa avsnitt gör det.
De tre sakerna som namnet kan betyda
• StepAudio 3 ASR — transkriptionsprodukten. En strömmande slutpunkt som returnerar inkrementell text i takt med att den avkodar och en slutlig transkription i slutet. StepFun beskriver den som transkription med en språkmodell kopplad för kontext, finjusterad för medicinskt, juridiskt, finansiellt, fordons- och programmeringsljud, samt för svåra indata som viskande tal, snabbt tal, sammanhängande tal, sång och bakgrundsmusik. Det är modellen som ligger på 1,7 % ordningsfel... felkvot i ord på Artificial Analysiss AA-WER-index för icke-strömmande tal-till-text.
• StepAudio 3 ASR Max — den nivå som StepFuns dokumentation kallar sin största ASR-modell hittills. Den har det publicerade listpriset på 2,8 yuan per timme. Den är inte en billigare transkriberare; den är toppen av ASR-serien.
• StepAudio 3 Realtime — den full-duplexa samtalsmodellen. Den resonerar direkt över tal i stället för att köra en kedja där den först transkriberar och sedan resonerar, och den transkriberar som en biprodukt av detta. Det är inte en ASR-produkt, och dess noggrannhet vid transkriberingsuppgifter är inte vad den trimmades för.
Allt annat i familjen — TTS, Gen, Music — är en helt annan uppgift och bör inte förekomma i en transkriberingsjämförelse över huvud taget.
Är ASR och ASR Max samma modell?
Bevisen pekar mot ja, och kontrollen är ren aritmetik. StepFun listar ASR Max-nivån till 2,8 yuan per timme. Omräknat till ungefär 7,1 yuan per dollar blir det cirka 0,39 dollar per timme, eller ungefär 6,6 dollar per 1 000 minuter. Artificial Analysis listar modellen på sin topplista till 6,67 dollar per 1 000 minuter. Två oberoende publicerade siffror, en från leverantörens prislista och en från tredjepartens topplista, som ligger inom en cent från varandra. Det är vad man skulle förvänta sig om raden i topplistan och ASR Max listpris beskriver samma SKU.
Det är värt att vara precis om vad det där bevisar och inte bevisar. Det bevisar att topplistans prisaxel och leverantörens prislista beskriver samma produkt till samma pris. Det bevisar inte att topplistans 1,7 % mättes på den exakta endpoint du skulle anropa, eftersom tavlan inte publicerar sin avkodningskonfiguration eller den endpoint den träffade. Så: samma produkt, mycket troligt; samma mätförhållanden, inte verifierade.
Det som är säkert är generationssprånget inom produktlinjen. StepAudio 2.5 ASR ligger på 4,7 % på samma resultattavla till 0,15 yuan per timme. Den aktuella nivån ligger på 1,7 % vid 2,8 yuan per timme. Det är en minskning av ordfelsfrekvensen med 64 % för ungefär nitton gånger priset – den skarpaste avvägningen i familjen och den som avgör om uppgraderingen är värd det.

De dimensioner som faktiskt skiljer sig
När namngivningen är avgjord kollapsar jämförelsen till en kort lista. Det här är de som förändrar ett beslut:
• Noggrannhet — StepAudio 3 ASR vid 1,7 % AA-WER i icke-strömmande läge jämfört med StepAudio 2.5 ASR vid 4,7 % på samma resultattavla. Mätt av Artificial Analysis, inte av StepFun.
• Pris — 2,8 yuan per timme mot 0,15 yuan per timme. Båda är leverantörslistpriser, båda gällande. Ungefär 19 gånger.
• Vikter — endast hostat API för båda. Inga öppna vikter någonstans i familjen, ingen on-premise-väg, inget alternativ för självhosting på någon nivå.
• Endpointens utformning – en enda strömmande transkriberingsslutpunkt som returnerar inkrementell och slutlig text jämfört med samma utformning i den tidigare generationen. Inget med integrationsmodellen har ändrats, så en migrering är ett byte av modellidentifierare snarare än en omskrivning.
• Justering för svårt ljud — StepAudio 3 ASR är uttryckligen optimerad för viskat, snabbt, sammanhängande och sjunget tal och för ljud med musik i bakgrunden. Den optimeringen är själva produkten; den tidigare generationen byggdes inte för det.
• Leverantörspåstådda domänvinster – StepFun rapporterar att kinesiska minskar med 9,3 %, engelska med 25,0 %, dialekter med 22,3 %, vertikaler med 42,1 % och kodväxling med 27,9 % generation över generation. Leverantörsrapporterat och ej reproducerat, så behandla dem som vägledande.
Anmärkningsvärt nog saknas i den listan: kontextlängd, stöd för ljudformat, maximal ljudlängd och en modellidentifierare. StepFuns offentliga dokumentation för denna modell anger dem inte, och den som citerar dessa siffror citerar något annat.
ASR vs Realtime är jämförelsen som folk faktiskt behöver
Om du väljer mellan transkriptionsprodukter snarare än mellan generationer är den intressanta jämförelsen inte ASR mot ASR Max – utan ASR mot Realtime. StepFuns eget tekniska material säger att de två delar sina förtränings- och mellanträningsfaser och skiljer sig åt endast under övervakad finjustering. Samma bas, olika finjustering, olika produkt.
Det enda faktumet har en praktisk tolkning. Ordfelsfrekvensen på 1,7 % är en egenskap hos ASR-finjusteringen. Det är inte ett löfte om realtidsmodellen, som optimerar för turtagning, hantering av avbrott och resonemang över tal snarare än för transkriptionsnoggrannhet. Om din arkitektur transkriberar som en bieffekt av ett samtal i realtid köper du inte 1,7 % — du köper en samtalsmodell som råkar avge text.
Det omvända är också sant och mindre uppenbart: eftersom de delar en gemensam bas är ASR-modellen inte en liten specialistmodell som skruvats på familjen. Det är samma skala på systemet, finjusterat på ett annat sätt. Det är därför ASR-priset ligger nära resten av familjen snarare än vid den billiga änden av marknaden.
Vad ska du göra med det här om du väljer en?
Tre frågor avgör saken. Behöver du en transkription eller behöver du ett samtal? Om en transkription: StepAudio 3 ASR är produkten och familjenamnet är brus. Om ett samtal: du vill ha StepAudio 3 Realtime och bör inte alls läsa ASR-benchmarks. Och om du behöver en transkription av verkligt svårt ljud – med brytning, viskat, sjunget eller med musik under – är 19x-premien priset för den nivå som har trimmats för det, och det ärliga testet är ditt eget ljud snarare än ett sammanvägt index.
Det beslut som är lätt att fatta fel är att betrakta transkriptionslagret som permanent. Vad du än väljer är transkriptet indata till något annat – en sammanfattare, en strukturerad extraktion, en efterlevnadskontroll, ett sökindex – och de anropen landar hos vanliga textmodeller. Det är lagret som skalas med användning snarare än med ljudminuter, och det är lagret som är värt att hålla portabelt från början. OrcaRouter sätter nästan 200 textmodeller bakom ett enda API med automatisk redundansväxling mellan leverantörer, ett routing-DSL som komponerar flera till ett enda anrop, och modellfusion när en enda modells omdöme inte räcker. Där en leverantör publicerar ett pris förs det listpriset vidare utan påslag, så en prisändring på textsidan når din faktura samma dag som den tillkännages.
För att vara tydlig med omfattningen, eftersom den här sidan handlar om en familj som vi inte erbjuder: ingen StepAudio 3-endpoint finns på OrcaRouter. Transkriberings- och röstmodellerna nås via StepFuns eget API. Det som OrcaRouter tillhandahåller är resonemangslagret nedströms transkriptionen, vilket är där ett växlingsbeslut är billigt att fatta och dyrt att skjuta upp.

Det som ingen har avgjort
Namngivningen går att reda ut. Prestandapåståendet gör det inte, ännu. Det finns fortfarande ingen publicerad teknisk rapport för ASR-modellen, inget släppt testset, ingen avkodningskonfiguration och inget reproducerbart protokoll från någon utanför StepFun, och leverantörens egna jämförelser är mot andra kinesiska ASR-produkter snarare än mot den etablerade aktören med öppna vikter. De 1,7 % är en verklig tredjepartsmätning på ett sammanslaget index över tre datamängder; allt annat om den här modellen är leverantörens påståenden.
Två saker skulle förändra bilden. En direkt jämförelse mot Whisper Large v3 Turbo på identiskt ljud, vilket ingen har publicerat. Och ett pris för resten av familjen — fyra av de fem StepAudio 3-modellerna hade fortfarande tidsbegränsat gratis förhandsvisningspris vid lanseringen, och endast transkribering och syntes hade publicerade priser, vilket innebär att prislistan du kan läsa idag täcker två av fem produkter.

Det är det skiktet som skalar med användning snarare än med ljudminuter, och det är skiktet som är värt att hålla portabelt från början. automatisk redundansväxling mellan leverantörer, ett routing-DSL som sammanfogar flera till ett enda anrop, och modellfusion när en enda modells bedömning inte räcker.
