
Muse Voice Transcribe è disponibile: il primo modello di percezione audio in tempo reale di Meta
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Muse Voice Transcribe, il primo modello di percezione audio in tempo reale dei Meta Superintelligence Labs, è stato lanciato il 1° settembre 2026 e ha un prezzo che sembra uno spoiler: 3,00 $ per 1.000 minuti di audio — circa 0,18 $ l'ora — sulla Meta Model API. In un unico passaggio in streaming fa ciò che la maggior parte degli stack di trascrizione divide tra tre sistemi: riconoscimento automatico del parlato, diarizzazione dei parlanti su più di 20 voci e endpointing, ovvero il compito di stabilire quando un parlante ha davvero finito di parlare invece di essersi semplicemente fermato a metà pensiero. Meta afferma che il modello è in cima alla leaderboard di streaming speech-to-text di Artificial Analysis, con un tasso di errore sulle parole del 3,1% nelle trascrizioni finali, consegnate 0,16 secondi dopo che il parlante smette di parlare.
Quell'ultimo numero ha bisogno di un'etichetta onesta prima di fare qualsiasi lavoro: è la dichiarazione del giorno del lancio di Meta, che punta a una classifica indipendente, per un modello che era chiamabile da meno di un giorno quando è stato pubblicato l'annuncio. Nessuno fuori dal laboratorio ha ancora riprodotto il 3,1%, e la pretesa di accuratezza è una cosa, mentre il resto del discorso — oltre 70 lingue addestrate, code-switching nativo, "ritardo adattivo" appreso tramite rinforzo — è un insieme separato di dichiarazioni del fornitore che si trova nella stessa barca. Tutto in questo post è lo stato del modello al primo giorno, con i numeri del fornitore etichettati come numeri del fornitore.
I numeri che contano dal primo giorno
• Prezzo: $3,00 per 1.000 minuti audio (circa $0,18 per ora audio) sull'API Meta Model, con prezzi inferiori a ogni importante API di trascrizione in streaming che monitoriamo.
• Affermazione di accuratezza — 3,1% WER sulle trascrizioni finali a 0,16 secondi dopo la fine del parlato; 3,6% WER sulle prime trascrizioni parziali a 0,13 secondi. Riportato dal fornitore, citando la classifica di streaming di Artificial Analysis.
• Diarizzazione — 20+ parlanti, emessa in streaming senza un passaggio separato di post-elaborazione (Meta riporta un tasso medio di errore di diarizzazione del 17,5%).
• Lingue — addestrato su oltre 70; 25 "ampiamente verificate" al lancio; code-switching senza soluzione di continuità all'interno e tra le frasi.
Contesto — gestisce audio più lungo di un'ora; bias linguistico, per parole chiave e contestuale per domini ricchi di gergo.

Cosa significa "modello di percezione audio" qui.
L'architettura è la storia. Muse Voice Transcribe consuma audio in blocchi da 80 millisecondi e trasmette le parole non appena si stabilizzano, ed è questo che "tempo reale" significa in pratica. La parte interessante è come decide quando impegnare una parola. Piuttosto che un budget di latenza fisso — il classico compromesso in cui un riconoscitore o si impegna presto e tira a indovinare, oppure aspetta più a lungo e tergiversa — il modello usa quella che Meta chiama "adaptive delay": procede rapidamente nel parlato facile e trattiene più contesto audio per le parole su cui è meno sicuro. La politica di ritardo stessa è stata appresa tramite reinforcement learning, quindi il modello bilancia efficacemente velocità e accuratezza parola per parola, invece di applicare un'unica impostazione globale.
È questa distinzione che spinge Meta a definire Muse Voice Transcribe un "modello di percezione audio" piuttosto che un modello ASR. Il flusso di output è una singola trascrizione in tempo reale che trasporta anche chi sta parlando e quando l'enunciato è completo — tre etichette che i sistemi di streaming di solito assemblano incollando un riconoscitore a un rilevatore di attività vocale e a un modello di diarizzazione, ciascuno dei quali aggiunge la propria latenza e le proprie modalità di errore.

Diarizzazione ed endpointing, integrati
La diarizzazione dei parlanti è la parte che merita un esame più attento, perché è la funzionalità in cui i prodotti di streaming più spesso esagerano. Meta afferma che il modello separa oltre 20 parlanti in una singola registrazione e riporta un tasso medio di errore di diarizzazione del 17,5%, che contrappone a un intervallo del 21,1–28,6% attribuito ai sistemi concorrenti. Entrambi i numeri sono pubblicati dal fornitore il giorno del lancio e nessuna valutazione indipendente ha ancora confermato il 17,5%. Ciò che è strutturalmente reale è che la diarizzazione avviene all'interno dello stesso passaggio di streaming del riconoscimento — non esiste un secondo passaggio del tipo "carica l'audio, attendi, ricevi i parlanti", ed è questa scelta progettuale che rende plausibile il tracciamento di oltre 20 parlanti in un contesto live.
L'endpointing è la capacità più discreta e probabilmente la più utile. Le API di trascrizione che espongono ASR in streaming grezzo costringono il chiamante a implementare da sé il rilevamento della fine dell'enunciato, motivo per cui gli agenti vocali interrompono così spesso le persone o lasciano vuoti di silenzio. Muse Voice Transcribe decide quando un turno è completo ed emette quel confine come parte del flusso, così un'applicazione riceve un segnale pulito che dice "questo parlante ha finito" senza costruire un livello VAD.
L'affermazione multilingue, leggila attentamente.
Meta ha addestrato il modello su oltre 70 lingue, ma al lancio ne valida 25. Sono cose diverse: "addestrato su" significa che i dati le includevano; "verificato estesamente" è il sottoinsieme che Meta supporta davvero con test interni. Per l'uso in produzione, l'elenco delle 25 lingue verificate è la copertura reale, ed è bene conoscere il divario tra 70 e 25 prima di instradare 40 lingue attraverso il sistema. Ciò che è davvero insolito è la questione del code-switching: il modello è progettato per cambiare lingua a metà frase e a metà enunciato senza che glielo si chieda, un vero punto dolente nelle regioni multilingue e qualcosa che la maggior parte dei prodotti ASR monolingue semplicemente non può fare. Il biasing linguistico, per parole chiave e contestuale completa il quadro della personalizzazione: puoi orientare il riconoscimento verso un vocabolario di dominio, che è la funzionalità che rende l'ASR in streaming utilizzabile nelle code mediche, legali e di assistenza.
Tre superfici, un modello
Muse Voice Transcribe si presenta su tre ambiti contemporaneamente. Quello a pagamento è la Meta Model API a $3,00 per 1.000 minuti audio. Quello consumer è Meta AI per Mac, dove tenendo premuto il tasto Fn si detta in qualsiasi applicazione: la risposta di Meta alla dettatura integrata di Apple e la distribuzione reale più visibile del modello fin dal primo giorno. Quello per sviluppatori è Muse Code, l'agente di codifica di Meta, dove i comandi vocali guidano sessioni multi-agente e flussi di refactoring. Un unico modello che alimenta una funzione di dettatura e un agente di codifica è la versione trasformata in prodotto della proposta "un modello in streaming, molte superfici".
Ciò che il prezzo sottocota
A 0,18 dollari per ora audio, Muse Voice Transcribe batte il settore della trascrizione in streaming sul prezzo di listino. Il set di confronto, come lo monitoriamo noi: Google Gemini 3.5 Transcribe Live costa circa 9 dollari per 1.000 minuti, ElevenLabs Scribe v2 Realtime è quotato a 6,50 dollari per 1.000 minuti, Cartesia Ink-2 a 4,00 dollari, e OpenAI GPT Live Transcribe a 17,00 dollari. Questi sono i numeri pubblicati dai fornitori, e diversi di quei modelli hanno prove indipendenti di accuratezza che Muse non ha ancora: la leadership di prezzo dal primo giorno non equivale a una classifica consolidata. Ma un modello di streaming con diarizzazione e rilevamento di fine turno integrati, che viene offerto a circa un quinto o un decimo del prezzo delle API di streaming esistenti, è il tipo di numero che comunque resetta le aspettative.

Le oneste avvertenze
Muse Voice Transcribe è proprietario e i pesi non sono pubblicati — l'opzione "eseguilo da solo" non esiste, e non c'è un percorso a pesi aperti per audit o fine-tuning. L'affermazione sull'accuratezza risale al giorno del lancio e non è stata replicata. Le 25 lingue verificate potrebbero non corrispondere alla cifra di 70+ lingue "su cui è stato addestrato" per quanto riguarda la copertura a basse risorse. E il benchmark di diarizzazione, per quanto promettente, è una misurazione del fornitore finché un'esecuzione indipendente non lo conferma. Per i team il cui unico requisito è una trascrizione batch accurata di audio preregistrato, esistono ancora opzioni più economiche e meglio verificate — la proposta dello streaming riguarda l'interazione in tempo reale, non il superare il mondo della trascrizione batch sul costo per ora audio.
Cosa guardare dopo
Quattro elementi decideranno se questo lancio sarà un momento o una tendenza. Primo, se la classifica streaming di Artificial Analysis includerà davvero Muse Voice Transcribe al #1 dopo la verifica indipendente — l'affermazione del giorno del lancio richiede una voce definitiva in classifica. Secondo, se la diarizzazione di 20+ parlanti sopravvive al contatto con riunioni reali e rumorose. Terzo, se l'interfaccia di dettatura Mac di Meta si traduce in adozione dell'API da parte degli sviluppatori. Quarto, come risponderanno gli incumbent sul prezzo, perché un modello streaming con diarizzazione ed endpointing a $0,18 all'ora esercita una pressione evidente su tutti i modelli con prezzi superiori. Quando Meta aprirà il modello ad altri partner di servizio, un gateway pass-through come OrcaRouter — che inoltra i prezzi di listino dei provider con markup allo 0% — mostrerebbe la stessa cifra di $3,00 per 1.000 minuti, senza ricarichi da rivenditore, il giorno stesso in cui arriverà. Fino ad allora, l'unico posto per chiamare Muse Voice Transcribe è l'API di Meta stessa.
