
MAI-Transcribe-2 vs Muse Voice Transcribe: La stessa settimana, due scommesse opposte sull'audio
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0455Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0247Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0247Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0157Intelligenza82Codice
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2646Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1849Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1541Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1251Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0547Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligenza69Codice
La settimana del 1º settembre 2026 ha visto l'uscita di due modelli vocali da due laboratori di frontiera, e MAI-Transcribe-2 e Muse Voice Transcribe vanno letti come risposte opposte alla domanda su dove debba risiedere l'intelligenza audio. {{1}}Muse Voice Transcribe, rilasciato da Meta Superintelligence Labs il 1º settembre, è un modello di percezione audio in tempo reale: trascrive, separa più di venti parlanti e rileva quando un parlante ha finito di parlare, tutto in un unico passaggio in streaming su blocchi di 80 millisecondi di audio dal vivo, e si piazza in cima alla classifica speech-to-text in streaming su cui è stato misurato.{{/1}} {{2}}MAI-Transcribe-2, rilasciato da Microsoft due giorni dopo, il 3 settembre, è la scommessa opposta: un motore batch che non insegue affatto la latenza in tempo reale e riversa invece tutte le sue energie nella trascrizione di file preregistrati, con il miglior tasso di errore sulle parole nella classifica non-streaming indipendente, a circa 411× la velocità reale, per circa 1,67 dollari ogni 1.000 minuti.{{/2}} {{3}}Confrontarli fianco a fianco come "modelli di trascrizione" nasconde la decisione vera, che riguarda il momento nella vita dell'audio in cui ti servono le parole: mentre sta accadendo, o dopo che è finito.{{/3}}
Due prodotti puntati in momenti diversi
Muse Voice Transcribe è progettato per il momento in cui l'audio è ancora in corso. È un modello multimodale autoregressivo della famiglia Muse di Meta che fonde tre compiti in un'unica passata: riconoscimento automatico del parlato, diarizzazione dei parlanti per più di venti interlocutori e rilevamento della fine dell'intervento (endpointing), ovvero l'individuazione del momento in cui un parlante ha smesso di parlare così che il sistema possa rispondere. Meta riferisce che la trascrizione finale arriva circa 0,16 secondi dopo che un parlante smette di parlare, con un tasso di errore sulle parole del 3,1% sulle trascrizioni finali e del 3,6% sulle prime trascrizioni parziali — dati pubblicati da Meta il giorno del lancio, citando la classifica streaming di Artificial Analysis e non riprodotti in modo indipendente al momento della stesura di questo articolo. Gestisce audio di durata superiore a un'ora in un unico flusso, cambia lingua a metà frase ed è stato addestrato su oltre 70 lingue, di cui 25 verificate approfonditamente al lancio. Il suo prezzo è di $3,00 per 1.000 minuti di audio, circa $0,18 all'ora, tramite la Meta Model API. Meta ha confermato che i pesi non verranno resi open source.
MAI-Transcribe-2 è progettato per il momento in cui l'audio è già un file. Il modello di Microsoft registra un AA-WER del 2,0% nella classifica non-streaming di Artificial Analysis — secondo posto, e il miglior risultato tra le API batch gestite — e opera a circa 411× il tempo reale, che è una misura di throughput, non una promessa di latenza. Trascrive in 60 lingue con identificazione automatica della lingua, include la diarizzazione dei parlanti, timestamp a livello di parola, keyword biasing e stili verbatim versus clean, e gestisce il code-switching come Hinglish e Spanglish. È disponibile tramite Microsoft Foundry in public preview e nel MAI Playground a 0,10 $ per ora audio come offerta di lancio a tempo limitato fino alla fine dell'anno, senza alcun prodotto streaming annunciato. Il post di lancio di Microsoft lo posiziona esplicitamente per audio long-form e batch — i carichi di lavoro in cui la bassa latenza di un modello streaming è inutile ma il suo costo al minuto non lo è.

Perché i due numeri di accuratezza non sono in conflitto
L'istinto naturale è confrontare il 2,0% con il 3,1% e decretare un vincitore, ma sarebbe sbagliato due volte. Primo: i numeri misurano compiti diversi — il 2,0% di MAI-Transcribe-2 è l'accuratezza non in streaming su audio preregistrato, dove il modello può vedere l'intero file; il 3,1% di Muse Voice Transcribe è l'accuratezza in streaming sui trascritti finali, ottenuta con il vincolo di trascrivere mentre l'audio arriva. Lo streaming è il problema più difficile, ed è per questo che la classifica dello streaming e quella del non streaming sono separate e con punteggi distinti. Secondo: le etichette hanno pesi diversi — il dato di MAI-Transcribe-2 è una misurazione Artificial Analysis del modello, mentre quello di Muse Voice Transcribe è ciò che Meta ha riportato il giorno del lancio come misurazione di Artificial Analysis, quindi dichiarato dal fornitore e non verificato in modo indipendente. La dichiarazione onesta è che entrambi i modelli sono candidati credibili al vertice delle rispettive classifiche, e nessuno dei due numeri dice nulla sull'altro ambito.
La diarizzazione è il vero cuore del confronto, perché è l'unica funzionalità presente in entrambi i prodotti e quella in cui le loro ambizioni differiscono in modo evidente. Muse Voice Transcribe separa più di venti parlanti come funzionalità di streaming di base, con Meta che dichiara un tasso medio di errore di diarizzazione del parlante del 17,5%, contro un intervallo concorrente che cita compreso tra il 21,1% e il 28,6% — anche in questo caso dati dichiarati da Meta e non verificati. Anche MAI-Transcribe-2 include la diarizzazione, ma Microsoft non pubblica alcun limite massimo di parlanti e nessun tasso di errore di diarizzazione. Per una chiamata tra due interlocutori, entrambi i prodotti sono adeguati e la differenza è irrilevante. Per un focus group di dodici persone o la registrazione di una tavola rotonda, Muse Voice Transcribe è l'unico dei due a dichiarare persino il proprio limite massimo di parlanti, e la diarizzazione non misurata di MAI-Transcribe-2 è il motivo principale in assoluto per testarlo prima di affidargli l'audio più difficile.
Il confronto prezzi che ha senso
Sul prezzo i due sono più vicini di quanto suggerisca la contrapposizione batch-versus-streaming: 1,67 $ per 1.000 minuti (MAI-Transcribe-2, early-bird) e 3,00 $ per 1.000 minuti (Muse Voice Transcribe) si collocano entrambi nella fascia bassa dei servizi di trascrizione vocale gestiti. Il confronto ha senso solo all'interno della stessa corsia. Per la trascrizione batch di file preregistrati, MAI-Transcribe-2 costa meno della metà del modello nativo per lo streaming, offrendo al contempo il miglior WER non-streaming — ma instraderesti file registrati verso Muse Voice Transcribe solo se volessi specificamente la sua pipeline di streaming, che non è il modo efficiente di processare un archivio. Per l'audio di riunioni in diretta, Muse Voice Transcribe è l'unico prodotto di questo articolo che funziona davvero, e la sua tariffa di 3,00 $ è inferiore a quella delle altre API di trascrizione in tempo reale contro cui è stato lanciato — Gemini 3.5 Transcribe Live a circa 9 $ per 1.000 minuti, GPT Live Transcribe a 17 $ — aggiungendo peraltro una diarizzazione per oltre venti parlanti che quei prodotti non eguagliano. La conclusione onesta sul fronte prezzi è che Meta ha fissato un prezzo basso per lo streaming e Microsoft uno ancora più basso per il batch, ed entrambi i valori sono prezzi da era promozionale, destinati a cambiare quando ciascun fornitore comunicherà la propria tariffa standard.

Quale per quale audio?
Se il tuo audio è in diretta — riunioni trascritte in tempo reale, agenti vocali, sottotitoli dal vivo, qualsiasi cosa in cui le parole servono mentre vengono pronunciate — Muse Voice Transcribe è la scelta giusta, e non c'è paragone. È l'unico modello di streaming qui; separa più di venti parlanti in un'unica passata ed è stato prezzato per vincere in quel segmento fin dal primo giorno. I suoi punti deboli sono quelli da portarsi dietro in una prova: i dati su accuratezza e diarizzazione sono riportati da Meta, e un modello di streaming vecchio di una settimana non ha ancora mostrato come si comporta con l'audio caotico che esiste al di fuori dei benchmark di lancio.
Se il tuo audio è già sotto forma di file — archivi, registrazioni di chiamate, librerie multimediali, qualsiasi cosa elaborata in blocco — MAI-Transcribe-2 è la scelta migliore su ogni asse che conta: WER misurato più basso, circa un ordine di grandezza in più di throughput e un prezzo per 1.000 minuti inferiore a quello del modello streaming. I suoi rischi sono l'immagine speculare di quelli di Muse: lanciato da quattro giorni, nessuna SKU streaming, qualità della diarizzazione non misurata e una tariffa early-bird dietro cui si cela un prezzo standard non comunicato.
La pagina di lancio di Microsoft che presenta MAI-Transcribe-2 elenca le funzionalità incluse da Microsoft che il rivale dello streaming non offre nella stessa passata, ed è il documento da consultare quando si decide quali affermazioni riguardano la superficie del prodotto e quali sono ancora promesse di benchmark.

E se la trascrizione è solo la prima metà della pipeline, la scelta tra queste due soluzioni conta meno della scelta che fai al livello superiore. L'audio delle riunioni dal vivo trascritto da Muse Voice Transcribe richiede comunque riepilogo, estrazione delle azioni da intraprendere e preparazione dei follow-up prima di essere utile; le chiamate archiviate trascritte da MAI-Transcribe-2 devono comunque poter essere cercate, oscurate o instradate verso il giusto sistema a valle. È a quel livello che una piattaforma multi-modello dimostra il proprio valore: l'API unica di OrcaRouter su oltre 200 modelli, con i prezzi di listino dei provider applicati senza alcun ricarico, consente a quel lavoro a valle di chiamare un modello diverso per ogni carico di lavoro tramite un'unica integrazione. Così, qualunque sia il modello vocale a vincere la tua sperimentazione, lo stack sopra la trascrizione non deve essere ricostruito per passare da un modello all'altro. Né Muse Voice Transcribe né MAI-Transcribe-2 figurano oggi in quell'elenco: entrambi vivono sulle API dei rispettivi fornitori. La scommessa che questa settimana si è davvero risolta è più circoscritta e più utile: la trascrizione in tempo reale e quella batch sono appena diventate abbastanza economiche perché a fare la differenza non siano più le parole — è ciò che ne fai.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
