Una card del titolo hero generata con il titolo 'StepAudio 3 ASR vs Whisper Large v3 Turbo' e il sottotitolo '1,7 per cento contro 4,6 per cento, e non esiste alcun test di confronto diretto', sopra il footer 'StepAudio secondo Artificial Analysis; Whisper secondo Hugging Face.'
Guides & Insights

StepAudio 3 ASR vs Whisper Large v3 Turbo: 1,7% contro 4,6%, e nessuno ha eseguito il test

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il confronto che cerchi non esiste. StepAudio 3 ASR e Whisper Large v3 Turbo si trovano sullo stesso indice Artificial Analysis AA-WER per la trascrizione vocale non in streaming — 1,7% di tasso di errore sulle parole contro cifre comprese tra il 4 e il 5,5% — e a fine settembre 2026 nessuno ha pubblicato un confronto testa a testa su audio identici. Non StepFun, non i manutentori di Whisper, non un laboratorio indipendente. La documentazione di StepFun stessa esegue benchmark rispetto a Doubao ASR 2.0, Seed 2.0 Lite e HY3.0 ASR Preview, tutti prodotti ASR cinesi. Dal lato Whisper non c'è alcun fornitore che pubblichi confronti, perché Whisper Large v3 Turbo è scaricabile da anni e i suoi numeri dipendono da chi lo serve.

Quindi questa pagina fa la versione onesta: legge l'unica classifica che misura entrambe le cose, separa ciò che è comparabile da ciò che non lo è e dice chiaramente dove le prove si esauriscono. La risposta breve è che il divario sull'accuratezza è reale ed è largo circa tre punti, mentre il divario su tutto il resto — prezzo, licenza, deployabilità — va nella direzione opposta ed è più ampio.

Cosa sia in realtà ognuno

StepAudio 3 ASR è un modello di trascrizione ospitato rilasciato da StepFun il 15 settembre 2026 come parte della famiglia audio StepAudio 3, composta da cinque modelli. È raggiungibile tramite un unico endpoint di streaming che restituisce testo incrementale durante la decodifica e una trascrizione finale al termine. StepFun lo descrive come trascrizione con un modello linguistico collegato per il contesto, ottimizzato per audio medico, legale, finanziario, automobilistico e di programmazione e per input che mettono in crisi i riconoscitori convenzionali — parlato sussurrato, parlato veloce, parlato connesso, canto e audio con musica in sottofondo. Non ci sono pesi aperti, né una soluzione on-premise, né un'opzione di self-hosting per nessun livello. La tariffa di listino pubblicata è di 2,8 yuan all'ora, circa 6,67 $ per 1.000 minuti sull'asse dei prezzi della classifica stessa.

Whisper Large v3 Turbo è un modello a pesi aperti pubblicato da OpenAI con licenza MIT: 809 milioni di parametri, 99 lingue, un derivato potato e messo a punto di Whisper large-v3 con i layer del decoder ridotti. È stato scaricato milioni di volte ed è erogato commercialmente da un lungo elenco di piattaforme e può essere eseguito sul proprio hardware. Quest'ultima proprietà è l'intero confronto, ed è il motivo per cui il divario di accuratezza non è l'unico numero che conta.

L'unica tavola che misura entrambi

L'indice AA-WER di Artificial Analysis riporta la percentuale di parole trascritte in modo errato, un valore più basso è meglio, e la sua versione 2 combina tre dataset: AA-AgentTalk al 50%, VoxPopuli-Cleaned-AA al 25% e Earnings22-Cleaned-AA al 25%. La visualizzazione non-streaming mostra 36 dei 71 modelli monitorati. Entrambi i modelli vi compaiono, cosa che la maggior parte dei confronti non può affermare.

Leggi come il consiglio li elenca:

• StepAudio 3 ASR — 1,7% AA-WER, circa $6,67 per 1.000 minuti di audio

• Whisper Large v3 Turbo, un endpoint ospitato — 4,6% AA-WER, circa 0,67 $ per 1.000 minuti

• Whisper Large v3 Turbo, un secondo endpoint ospitato — 5,5% AA-WER, circa 15,00 $ per 1.000 minuti

• Whisper Large v3, una diversa generazione di pesi aperti — 4,1% su un endpoint, 10,1% su un altro

• StepAudio 2.5 ASR, la generazione precedente di StepFun — 4,7%

Le ultime due righe sono le più istruttive della classifica, e non riguardano affatto StepFun. Gli stessi pesi aperti di Whisper ottengono 4,1% su un endpoint e 10,1% su un altro. È una differenza di 6 punti su parametri identici, prodotta interamente da differenze nel serving: strategia di chunking, hardware, configurazione di decodifica e modo in cui ciascun host gestisce audio più lungo dei propri limiti interni. La nota a piè di pagina della classifica lo dice chiaramente, osservando che, per uno dei suoi dataset, l'audio di alcuni modelli viene suddiviso in chunk di circa nove minuti e quello di altri in chunk di circa trenta secondi a causa dei limiti di tempo.

Il che significa che il confronto "StepAudio 3 ASR vs Whisper Large v3 Turbo" è in realtà due confronti sovrapposti. Il modello contro i pesi, e il modello contro qualunque endpoint tu abbia usato per il benchmark. Il secondo varia più del primo.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

Da dove deriva il divario di accuratezza e quanto fidarsene

Tre punti di tasso di errore sulle parole sono un divario notevole in un campo in cui i primi cinque sistemi si collocano entro 0,6 punti l'uno dall'altro. È anche l'unico numero di questo confronto ad essere stato misurato da una terza parte, e comporta avvertenze concrete che vanno in entrambe le direzioni.

Contro StepAudio 3 ASR: il dato è un indice composito, e la composizione è per il 50% AA-AgentTalk — un dataset di conversazioni tra agenti. Un modello ottimizzato per la trascrizione specifica di dominio con un LLM collegato per il contesto è ben adatto a quel tipo di audio. Se si ripondera l'indice verso parlato letto o notizie radiotelevisive, la classifica potrebbe farsi più serrata. Inoltre, non esiste ancora alcun rapporto tecnico pubblicato per il modello ASR, nessun test set rilasciato, nessuna configurazione di decodifica e nessun protocollo riproducibile da parte di chiunque al di fuori di StepFun.

Rispetto a Whisper Large v3 Turbo: il 4,6% è il numero di un endpoint ospitato, non una proprietà del modello. I pesi sono fissi e pubblici; il punteggio non lo è. Un team che esegue gli stessi pesi con attenzione, con un chunking adatto al dominio e una buona configurazione del decoder, può ottenere risultati sensibilmente migliori della riga della classifica — e un team che li esegue con leggerezza può ottenere risultati peggiori del 10,1% registrato dall'altra generazione open-weights. Il riassunto onesto è che il lato open-weights di questo confronto ha un limite inferiore che puoi misurare e un limite superiore che devi guadagnarti.

Quello che manca è il numero che lo risolverebbe: entrambi i sistemi, un set audio, un protocollo di decodifica, pubblicati. Nessuno l'ha eseguito, e finché qualcuno non lo farà, "1.7% vs 4.6%" è un confronto tra due misurazioni effettuate in condizioni diverse piuttosto che una misurazione di due sistemi l'uno contro l'altro.

Le altre quattro dimensioni, dove Whisper vince di più

L'accuratezza è la dimensione in cui StepFun vince. Sul resto della lista il modello open-weights non si avvicina, e sono queste le dimensioni che decidono se un deployment è possibile o meno:

• Licenza e pesi — pesi aperti con licenza MIT con 809M parametri contro un'API ospitata senza pesi pubblicati a nessun livello.

• Distribuzione — self-hosted, on-premise, air-gapped, oppure tramite una qualsiasi delle decine di piattaforme commerciali, contro solo l'API di StepFun.

• Costo minimo — circa 0,67 $ per 1.000 minuti su un endpoint ospitato, e ancora meno se lo gestisci tu stesso, contro circa 6,67 $ per 1.000 minuti alla tariffa pubblicata dal fornitore.

• Residenza dei dati — l'audio non lascia mai un'infrastruttura sotto il tuo controllo, a differenza dell'audio inviato a un endpoint di terze parti.

• Rischio di integrazione — il modello non può essere ritirato, riprezzato o deprecato alle tue spalle, perché possiedi i pesi, a differenza di una tariffa in hosting che può cambiare con un listino prezzi.

• Comportamento con audio lunghi — il chunking è una tua decisione e può essere regolato per singolo file, invece di quello che fa internamente l'endpoint del fornitore, che non è documentato.

Quel divario di prezzo è all'incirca di dieci a uno rispetto all'endpoint Whisper più economico, ed è l'immagine speculare di ciò che è accaduto all'interno della stessa linea di StepFun: il modello che questo sostituisce, StepAudio 2.5 ASR, era listato a 0,15 yuan all'ora, mentre il livello attuale è listato a 2,8. StepFun ha aumentato la tariffa di trascrizione di circa diciannove volte per comprare accuratezza, il che lo colloca in un mercato diverso da un modello open-weights self-hosted, piuttosto che in una versione più costosa di esso.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

Quale dovresti scegliere

La separazione è più netta di quella della maggior parte dei testa a testa:

• Scegli Whisper Large v3 Turbo se l'audio è ordinario, il volume è alto, i dati non possono uscire dalla tua infrastruttura, oppure se hai bisogno che il deployment sia permanente e con un prezzo stabile. La licenza MIT significa che la decisione resta tua e puoi cambiarla, e nessuno può toglierti questa possibilità.

• Scegli StepAudio 3 ASR se l'audio è davvero difficile — con accento marcato, sussurrato, cantato o con della musica sotto — oppure se il dominio è uno dei cinque per cui StepFun è ottimizzato. È questo che giustifica il costo premium, e su quell'audio un divario di accuratezza di tre punti è la differenza tra una trascrizione utilizzabile e una passata di correzione manuale.

• Non scegliere né l'una né l'altra, in modo esclusivo, se non sai quale sia il tuo audio. Il costo di sbagliare è asimmetrico: il percorso open-weights può essere testato sul tuo hardware al prezzo di un'ora di GPU, e il percorso hosted non costa nulla provare ma ti vincola a una tariffa che non puoi controllare.

L'argomento a favore di un ibrido è più forte qui che nella maggior parte dei confronti, e la ragione è la dispersione degli endpoint sul tabellone. Poiché gli stessi pesi di Whisper totalizzano ovunque tra il 4,1% e il 10,1% a seconda di chi li serve, la mossa pratica è instradare il percorso open-weights su più di un host anziché impegnarsi su uno solo — che è ciò che ti offre il failover automatico, ed è lo stesso meccanismo che ti consente di mettere un modello ospitato davanti a un percorso di produzione senza scommettere il percorso su di esso.

Come questo si inserisce in uno stack, e cosa serviamo e cosa non serviamo

Qualunque cosa scegliate per la trascrizione, la trascrizione finisce da qualche parte. Un riassuntore, un'estrazione strutturata, un controllo di conformità, un indice di ricerca — quelle chiamate finiscono su modelli di testo ordinari, e sono la parte della bolletta che scala con l'utilizzo anziché con i minuti di audio. Il modello realtime di StepFun pubblicizza il tool calling e l'esecuzione asincrona di attività lunghe, il che significa che persino il livello audio passa costantemente lavoro a qualcosa che non è un modello audio.

Per essere espliciti sull'ambito, perché sarebbe facile lasciar intendere il contrario: né StepAudio 3 ASR né Whisper Large v3 Turbo sono su OrcaRouter. StepAudio si raggiunge tramite l'API proprietaria di StepFun, e i pesi di Whisper sono tuoi da eseguire o da portare su una piattaforma di hosting. Ciò che OrcaRouter offre è il livello di delega a cui si alimenta la trascrizione — quasi 200 modelli testuali dietro un'unica API, con failover automatico così che una chiamata a valle non muoia con un singolo provider, un DSL di routing che compone più modelli in un'unica chiamata e la fusione di modelli quando il giudizio di un solo modello non basta. Dove un provider pubblica una tariffa, quel prezzo di listino viene passato senza ricarico, quindi una variazione di prezzo arriva sulla tua fattura il giorno in cui viene annunciata — il che, dato che questo confronto contiene un fornitore che ha aumentato la tariffa di trascrizione di diciannove volte in una sola release, non è un vantaggio ipotetico.

Se stai per spendere soldi veri sulla questione dell'accuratezza, la sequenza economica è questa: esegui prima i pesi aperti sul tuo audio, perché puoi farlo, e perché il numero che otterrai sarà più pertinente di quello di qualsiasi classifica. Poi decidi se il divario che rimane vale dieci volte la tariffa. La maggior parte dei team scoprirà che vale la pena per una fetta del proprio traffico e non per il resto, e questo è un problema di routing più che una scelta di modello.

Cosa lo risolverebbe

Un test pubblicato. Entrambi i sistemi, lo stesso audio, lo stesso protocollo di decodifica, una suddivisione onesta tra parlato letto, audio conversazionale e i casi difficili per cui StepFun sostiene di aver ottimizzato. Finché non esisterà, il confronto è un indice di terze parti da un lato e un insieme di pesi aperti con un punteggio variabile dall'altro, e l'unico modo responsabile di leggerlo è come un punto di partenza anziché una risposta.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.