Una card del titolo hero generata con il titolo "StepAudio 3 ASR vs StepAudio 3" e il sottotitolo "Uno è un modello. L'altro sono cinque prodotti con un solo nome", sopra il piè di pagina "Dati StepFun come pubblicati a settembre 2026."
Guides & Insights

StepAudio 3 ASR vs StepAudio 3: Non esiste un modello con quel nome

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Cerca StepAudio 3 e troverai una famiglia, non un modello. La pubblicazione audio di StepFun del 15 settembre 2026 ha riunito cinque prodotti sotto quel nome — Realtime, ASR, sintesi vocale, Gen e Music — e il prodotto di trascrizione tra di essi, StepAudio 3 ASR, è quello che da allora continua a scalare le classifiche. La versione che la documentazione di StepFun stessa definisce il suo più grande modello ASR fino ad oggi è StepAudio 3 ASR Max, e la variante conversazionale con cui condivide l'architettura di base è StepAudio 3 Realtime. Se stai cercando di confrontare "StepAudio 3 ASR" con "StepAudio 3", stai confrontando un prodotto con una linea di prodotti, e la risposta dipende interamente da quale dei tre intendevi davvero.

Questa pagina risolve la questione. Non è un confronto di marketing — è la disambiguazione di cui hai bisogno prima di poter leggere correttamente qualsiasi scheda tecnica di StepAudio 3, perché i tre nomi sopra comportano prezzi diversi, endpoint diversi e modalità di errore diverse.

Perché il nome è ambiguo

StepFun ha rilasciato l'intera stack audio in un giorno, e la convenzione di denominazione ha reso il nome della famiglia la radice di ogni nome di prodotto. È ordinato su una slide di lancio e scomodo ovunque altrove. Significa che una ricerca del nome della famiglia restituisce un misto di cinque prodotti diversi, e una riga di benchmark etichettata "StepAudio 3" potrebbe plausibilmente essere uno qualsiasi di essi.

La conseguenza pratica è che non si può capire da un titolo quale cosa sia stata misurata. Un post che dice «StepAudio 3 guida la classifica di trascrizione» descrive StepAudio 3 ASR. Un post che dice «StepAudio 3 vince sulle dinamiche conversazionali» descrive StepAudio 3 Realtime. Entrambe le affermazioni sono vere, si tratta di prodotti diversi e non sono intercambiabili.

C'è una seconda ambiguità proprio all'interno della linea ASR. La documentazione di StepFun fa riferimento a un livello ASR Max come al suo modello ASR più grande fino ad oggi, con un proprio prezzo e un proprio endpoint, mentre le righe della classifica pubblica riportano l'etichetta più semplice. Stabilire se si tratti di un unico SKU sotto due nomi o di due SKU distinti è la cosa più utile che questa pagina possa fare, e la sezione successiva lo fa.

Le tre cose che il nome può significare

StepAudio 3 ASR — il prodotto di trascrizione. Un endpoint in streaming che restituisce testo incrementale mentre decodifica e una trascrizione finale alla fine. StepFun lo descrive come trascrizione con un modello linguistico collegato per il contesto, ottimizzato per audio medico, legale, finanziario, automobilistico e di programmazione, e per input difficili come parlato sussurrato, parlato veloce, parlato connesso, canto e musica di sottofondo. È il modello che si colloca all'1,7% di tasso di errore per parola sull'indice AA-WER di Artificial Analysis per la conversione da parlato a testo non in streaming.

StepAudio 3 ASR Max — il livello che la documentazione di StepFun definisce il suo più grande modello ASR fino ad oggi. Ha una tariffa di listino pubblicata di 2,8 yuan all'ora. Non è un trascrittore più economico; è il vertice della linea ASR.

StepAudio 3 Realtime — il modello conversazionale full-duplex. Ragiona direttamente sul parlato invece di eseguire una catena "trascrivi e poi ragiona", e trascrive come sottoprodotto di ciò. Non è un prodotto ASR, e la sua accuratezza nei compiti di trascrizione non è ciò per cui è stato ottimizzato.

Tutto il resto della famiglia — TTS, Gen, Music — è un lavoro del tutto diverso e non dovrebbe affatto comparire in un confronto di trascrizione.

ASR e ASR Max sono lo stesso modello?

Le prove indicano di sì, e il controllo è aritmetico. StepFun elenca il livello ASR Max a 2,8 yuan all'ora. Convertito a circa 7,1 yuan per dollaro, sono circa 0,39 $ all'ora, ovvero all'incirca 6,6 $ per 1.000 minuti. Artificial Analysis elenca il modello nella sua classifica a 6,67 $ per 1.000 minuti. Due cifre pubblicate in modo indipendente, una dal listino prezzi del fornitore e una dalla classifica di terze parti, che si collocano entro un centesimo l'una dall'altra. È ciò che ti aspetteresti se la riga della classifica e la tariffa di listino di ASR Max descrivono lo stesso SKU.

Vale la pena essere precisi su ciò che questo dimostra e su ciò che non dimostra. Dimostra che l'asse dei prezzi della classifica e il tariffario del fornitore descrivono lo stesso prodotto allo stesso prezzo. Non dimostra che il 1,7% della classifica sia stato misurato esattamente sull'endpoint che chiameresti, perché la classifica non pubblica la sua configurazione di decodifica né l'endpoint che ha raggiunto. Quindi: stesso prodotto, molto probabilmente; stesse condizioni di misurazione, non verificate.

Ciò che è certo è il salto generazionale all'interno della linea. StepAudio 2.5 ASR si attesta al 4,7% sulla stessa classifica a 0,15 yuan all'ora. Il livello attuale è dell'1,7% a 2,8 yuan all'ora. Si tratta di una riduzione del 64% del tasso di errore sulle parole a fronte di una tariffa circa diciannove volte superiore — il compromesso più netto della famiglia e quello che decide se l'aggiornamento vale la pena.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

Le dimensioni che effettivamente differiscono

Una volta stabilito il nome, il confronto si riduce a una breve lista. Questi sono quelli che cambiano una decisione:

• Accuratezza — StepAudio 3 ASR all'1,7% di AA-WER non streaming rispetto a StepAudio 2.5 ASR al 4,7% nella stessa classifica. Misurato da Artificial Analysis, non da StepFun.

• Prezzo — 2,8 yuan all'ora rispetto a 0,15 yuan all'ora. Entrambe tariffe di listino del fornitore, entrambe attuali. Circa 19 volte.

• Pesi — solo API ospitata per entrambi. Nessun peso aperto in tutta la famiglia, nessun percorso on-premise, nessuna opzione di self-hosting a qualsiasi livello.

• Forma dell'endpoint — un unico endpoint di trascrizione in streaming che restituisce testo incrementale e finale rispetto alla stessa forma della generazione precedente. Nulla del modello di integrazione è cambiato, quindi una migrazione è uno scambio di identificatore del modello anziché una riscrittura.

• Tuning per audio difficile — StepAudio 3 ASR è ottimizzato esplicitamente per parlato sussurrato, veloce, connesso e cantato, e per audio con musica di sottofondo. Quel tuning è il prodotto; la generazione precedente non era stata creata per questo.

• Guadagni di dominio dichiarati dal fornitore — StepFun riporta per il cinese un calo del 9,3%, per l'inglese del 25,0%, per i dialetti del 22,3%, per i verticali del 42,1% e per il code-switching del 27,9% rispetto alla generazione precedente. Dati dichiarati dal fornitore e non riprodotti, quindi vanno considerati solo indicativi.

Assenti in modo evidente da quell'elenco: lunghezza del contesto, supporto dei formati audio, durata massima dell'audio e un identificatore del modello. La documentazione pubblica di StepFun per questo modello non li indica, e chiunque citi quei numeri sta citando qualcos'altro.

ASR vs Realtime è il confronto di cui le persone hanno davvero bisogno

Se stai scegliendo tra prodotti di trascrizione invece che tra generazioni, il confronto interessante non è ASR contro ASR Max — è ASR contro Realtime. Il materiale tecnico di StepFun stesso afferma che i due condividono le fasi di pretraining e midtraining e divergono solo durante il fine-tuning supervisionato. Stessa base, fine-tuning diverso, prodotto diverso.

Quel singolo dato ha una lettura pratica. Il tasso di errore sulle parole dell'1,7% è una proprietà del fine-tuning ASR. Non è una promessa sul modello in tempo reale, che è ottimizzato per l'alternanza dei turni, la gestione delle interruzioni e il ragionamento sul parlato, piuttosto che per l'accuratezza della trascrizione. Se la tua architettura trascrive come effetto collaterale di una conversazione dal vivo, non stai comprando l'1,7% — stai comprando un modello conversazionale che emette testo per caso.

Vale anche il contrario, ed è meno ovvio: poiché condividono una spina dorsale, il modello ASR non è un piccolo modello specialistico avvitato alla famiglia. È un sistema della stessa scala, messo a punto in modo diverso. Ecco perché la tariffa ASR è vicina a quella del resto della famiglia invece che alla fascia economica del mercato.

Cosa fare con questo se ne stai scegliendo uno

Tre domande risolvono la questione. Ti serve una trascrizione o ti serve una conversazione? Se ti serve una trascrizione, StepAudio 3 ASR è il prodotto e il nome della famiglia è solo rumore. Se ti serve una conversazione, vuoi StepAudio 3 Realtime e non dovresti affatto leggere i benchmark ASR. E se ti serve una trascrizione di audio davvero difficile — con accento, sussurrato, cantato o con musica sotto — il premium di 19x è il prezzo del livello messo a punto per questo, e il test onesto è il tuo audio, piuttosto che un indice combinato.

La decisione in cui è facile sbagliare è trattare il livello di trascrizione come permanente. Qualunque cosa tu scelga, la trascrizione è un input per qualcos'altro — un riassuntore, un'estrazione strutturata, un controllo di conformità, un indice di ricerca — e quelle chiamate finiscono su modelli di testo ordinari. È il livello che scala con l'utilizzo anziché con i minuti audio, ed è il livello che vale la pena mantenere portabile fin dall'inizio. OrcaRouter mette quasi 200 modelli di testo dietro un'unica API con failover automatico tra provider, un DSL di routing che ne compone diversi in un'unica chiamata e la fusione di modelli quando il giudizio di un solo modello non è sufficiente. Dove un provider pubblica una tariffa, quel prezzo di listino viene trasferito senza ricarichi, così una variazione di prezzo sul lato testo raggiunge la tua fattura il giorno in cui viene annunciata.

Per essere chiari sull'ambito, dato che questa pagina riguarda una famiglia che non serviamo: nessun endpoint di StepAudio 3 è presente su OrcaRouter. I modelli di trascrizione e voce si raggiungono tramite l'API di StepFun. Ciò che OrcaRouter offre è il livello di ragionamento a valle della trascrizione, ovvero il punto in cui una decisione di passaggio è economica da prendere e costosa da rimandare.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

Ciò che nessuno ha risolto

La questione della denominazione è risolvibile. La dichiarazione sulle prestazioni non lo è, non ancora. Non c'è ancora un rapporto tecnico pubblicato per il modello ASR, né un test set rilasciato, né una configurazione di decodifica, né un protocollo riproducibile da parte di alcuno al di fuori di StepFun, e i confronti dello stesso fornitore sono con altri prodotti ASR cinesi piuttosto che con l'incumbent open-weights. L'1,7% è una misurazione reale di terze parti su un indice misto di tre dataset; tutto il resto su questo modello è una dichiarazione del fornitore.

Due cose cambierebbero il quadro. Un confronto diretto con Whisper Large v3 Turbo sugli stessi audio, che nessuno ha pubblicato. E una tariffa per il resto della famiglia — quattro dei cinque modelli StepAudio 3 erano ancora offerti in anteprima gratuita a tempo limitato al lancio, e solo trascrizione e sintesi avevano tariffe pubblicate, il che significa che il listino prezzi che puoi leggere oggi copre due dei cinque prodotti.

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

Questo è lo strato che scala con l'utilizzo anziché con i minuti audio, ed è lo strato che vale la pena mantenere portabile fin dall'inizio. failover automatico tra provider, un DSL di routing che ne combina diversi in un'unica chiamata, e la fusione di modelli quando il giudizio di un singolo modello non è sufficiente.