
Muse Voice Transcribe: il modello di trascrizione vocale in streaming di Meta, spiegato
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 1009 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 195 tok/s
- OrcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Muse Voice Transcribe è il modello di trascrizione vocale in streaming di Meta. Viene eseguito su Meta Model API a 0,18 $ per ora di audio, con l'ID del modello muse-voice-transcribe-1.0, e il prezzo è lo stesso sia che tu trasmetta audio in diretta sia che gli passi una registrazione già pronta. Ciò che lo rende meritevole di una pagina di riferimento invece di un semplice controllo del prezzo in una riga è dove avviene il lavoro: l'attribuzione degli interlocutori per più di venti voci e il rilevamento della fine del parlato vengono eseguiti all'interno del modello di riconoscimento, non in una passata in batch aggiunta alla fine dello stream. È solo trascrizione da parlato a testo — la documentazione per sviluppatori di Meta lo afferma senza mezzi termini: non sintetizza il parlato e non fornisce un'API di conversazione speech-to-speech.
Questa è la pagina su cui arriva un lettore dopo aver cercato il nome stesso del modello, quindi è costruita per essere la risposta stabile a due domande — che cos'è questo modello e quanto costa un'ora di audio — anziché un annuncio. Una data va messa agli atti prima di ogni altra cosa, perché è un fatto riguardante il modello e non il motivo per cui la pagina esiste: Meta Superintelligence Labs ha presentato Muse Voice Transcribe il 2026-09-01, nel post di annuncio datato Presentiamo Muse Voice Transcribe — il post che un lettore può ancora raggiungere tramite l'indice del blog di Meta, anche se non risponde più sul proprio URL. Tutto ciò che segue è stato letto sulle pagine di Meta il 2026-09-29, principalmente la pagina del modello e la documentazione speech-to-text e panoramica dell'API. Dove Meta non pubblica una cifra, questa pagina lo dice invece di ricorrere a un valore sostitutivo.
Cos'è, nei termini di Meta
La documentazione di Meta apre la propria descrizione senza giri di parole: "Muse Voice Transcribe è il modello speech-to-text di Meta su Meta Model API. Trascrive audio dal vivo o una registrazione esistente, con rilevamento dei turni di parola, etichette dei parlanti e bias del vocabolario." La pagina di panoramica comprime lo stesso concetto in una sola frase: diarizzazione dei parlanti in streaming, endpointing nativo e rilevamento dell'attività vocale, bias contestuale e per parole chiave, e 25 lingue valutate con commutazione di codice. Quindi l'output è un unico flusso di trascrizione che porta con sé tre etichette contemporaneamente: le parole, chi sta parlando e se l'enunciato è terminato. È la combinazione che la maggior parte degli stack di produzione attualmente mette insieme da un riconoscitore, più un rilevatore separato di attività vocale, più un modello di diarizzazione separato, ognuno con il proprio budget di latenza.
La pagina del modello di Meta lo presenta come "latenza competitiva e accuratezza della trascrizione in streaming con attribuzione in tempo reale per oltre 20 parlanti", e la documentazione per sviluppatori descrive il campo di output come "Testo della trascrizione con tempistiche a livello di turno ed etichette opzionali dei parlanti". Da ciò derivano due cose, ed entrambe contano più dell'inquadramento:
• È un modello audio-in, text-out. Non è né text-in né text-out, e Meta dichiara esplicitamente che non è un generatore vocale.
• È prima di tutto un modello di streaming. Il percorso in tempo reale non è un wrapper attorno al percorso del file; è una sessione WebSocket con i propri eventi, modalità e limiti, descritti di seguito.
Quanto costa un'ora di audio
La pagina del modello Meta per Muse Voice Transcribe indica il prezzo come "Crea con un singolo modello a $0.18/ora", e la sua tabella delle specifiche elenca muse-voice-transcribe-1.0 a $0.18 all'ora di audio e $3.00 per 1,000 minuti. Si tratta di due formulazioni in unità diverse della stessa tariffa, ed entrambe sono stampate sulla pagina di Meta stessa, nella versione letta il 2026-09-29. La documentazione per gli sviluppatori indica la stessa tariffa in un terzo modo: "Il prezzo è $0.18 all'ora di audio elaborato". Nessuna cifra di questa pagina è ripresa da una pagina dei prezzi di Meta, perché non esiste una pagina dei prezzi di Meta leggibile da consultare: la documentazione rimanda la tariffa a una pagina "Pricing and rate limits" che risponde Questa pagina non è disponibile nella versione letta il 2026-09-29, quindi la pagina del modello è la fonte ufficiale di riferimento per la tariffa, ed è l'unica utilizzata qui.
Il dettaglio di fatturazione si trova nella documentazione per sviluppatori e vale la pena conoscerlo prima di dimensionare un carico di lavoro:
• Lo streaming e il non-streaming costano lo stesso. Non c'è alcun sovrapprezzo per l'endpoint in tempo reale.
• L'elaborazione con conservazione zero dei dati ha un prezzo pari a quello del livello Standard, secondo la documentazione — non è una voce di sovrapprezzo.
• La fatturazione arrotonda per difetto ai secondi interi, quindi un turno di due secondi viene fatturato come due secondi e non tre.
• I malfunzionamenti che si verificano prima che venga prodotta una trascrizione non vengono fatturati, e nemmeno 429 le risposte con limite di frequenza
• I crediti gratuiti esistono a livello di piattaforma, non a livello di modello. La documentazione speech-to-text di Meta termina il suo paragrafo sui prezzi con la frase "Platform free-tier credits apply." È l'unica dicitura che accenni a qualcosa di gratuito nelle pagine dedicate a questo modello, ed è volutamente non specifica: rimanda a un sistema di crediti della piattaforma invece di promettere una quota gratuita per la trascrizione, e non viene riportato alcun importo, durata o regola di ammissibilità. Leggila come un credito che può ridurre una fattura, non come un livello gratuito per il modello. La dichiarazione di Meta rivolta ai consumatori secondo cui il suo agente personale è "gratuito per la maggior parte di ciò di cui le persone hanno bisogno" è una frase separata riguardante l'app Muse e non si estende a Model API.
Esempio pratico, perché il costo orario è difficile da percepire: un'intervista registrata di due ore costa 0,36 $ di trascrizione. Mille ore di audio di chiamate — all'incirca il volume mensile di un contact center di medie dimensioni — sono 180 $. A quella scala, la tariffa è l'intero argomento, e una tariffa è anche l'unica cosa che può muoversi sotto di te: la pagina di Meta è l'autorità in merito, e se la cifra cambia lì, cambia qui.
L'interfaccia di streaming, endpoint per endpoint
This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.
• Audio in diretta — wss://api.meta.ai/v1/asr/realtime. Il trasporto è WebSocket, e il dettaglio sull'autenticazione è una trappola: ci si autentica nel frame di handshake e l'Authorizationheader viene ignorato. L'handshake deve essere il primo frame di testo JSON e deve arrivare entro 10 secondi. Una sessione dura fino a 60 minuti, un nuovo WebSocket crea una nuova sessione e non esiste alcun token di ripresa.
• Registrazioni — POST https://api.meta.ai/v1/asr/transcribe. Caricamento multipart, e questo effettua davvero l'autenticazione con l'Authorization header. L'input è limitato: solo WAV PCM mono a 16 bit a 16 o 24 kHz. I limiti sono 32 MB per corpo e 10 minuti di audio per richiesta.
All'interno della sessione in tempo reale, tre modalità cambiano ciò che ricevi. PUSH_TO_TALK è la modalità predefinita ed esegue la trascrizione a turno singolo. ENDPOINTING fornisce confini di turno rilevati dal modello, un turno per ciascun segmento vocale rilevato, emettendo speechStart, ripetuti transcript, speechEnd e speechComplete eventi — con l'avvertenza che speechEnd non è la trascrizione. DIARIZATION aggiunge il rilevamento e l'attribuzione automatici del parlante, emettendo speaker eventi con etichette come A e B. Le trascrizioni parziali arrivano o cumulative, dove ogni parziale sostituisce il precedente, o come delta.
Due dettagli operativi della stessa documentazione sono facili da trascurare e costosi da scoprire in produzione:
• La diarizzazione segnala un possibile nuovo parlatore anziché un chiaro punto di fine del parlato, e Meta dichiara che non è ottimizzata per l'uso a bassa latenza con comandi vocali. Considera le etichette come identificatori validi solo nell'ambito della sessione — A in una sessione non è la stessa persona di A nella successiva.
• I turni possono sovrapporsi, quindi lo stato per turno dovrebbe essere indicizzato sull'identificatore del turno anziché sull'ordine di arrivo.
• I limiti massimi pubblicati per tenant sono 128 stream simultanei e 16.000 stream all'ora.
Cosa viene eseguito all'interno del modello e cosa sostituisce
La pagina del modello di Meta fa un'affermazione specifica sull'architettura, non sui punteggi: "L'attribuzione dei parlanti per oltre 20 voci e il rilevamento della fine del parlato avvengono all'interno del modello di riconoscimento" — e la contrappone esplicitamente a una passata in batch alla fine del flusso audio. La differenza pratica è che non c'è una seconda fase da attendere. Le etichette dei parlanti e i confini dei turni arrivano sullo stesso flusso delle parole, così un agente vocale a valle o una superficie di didascalie in tempo reale ottiene un turno completo e un'identità senza un passaggio di post-elaborazione.
Le altre capacità che Meta documenta come presenti nel modello:
• Endpointing nativo e rilevamento dell'attività vocale, così non esegui il tuo VAD davanti all'API. Nella formulazione della documentazione, ottieni una trascrizione completa per ogni enunciato senza eseguire il tuo rilevamento dell'attività vocale, e un fine del parlato rilevato non termina la sessione.
• Biasing contestuale e per parole chiave, senza fine-tuning. La pagina del modello di Meta descrive un'accuratezza mantenuta "tramite biasing contestuale e per parole chiave, senza fine-tuning", che è la funzionalità che rende l'ASR in streaming utilizzabile su vocabolario di dominio — nomi di farmaci, simboli ticker, SKU di prodotti — piuttosto che sulla media della lingua generale. La documentazione è precisa sui limiti: le parole chiave influenzano il riconoscimento ma non garantiscono una grafia esatta, e sia le parole chiave sia il bias linguistico sono fissati all'avvio della sessione.
• 25 lingue valutate con il code-switching. La documentazione le elenca: arabo, bengalese, olandese, inglese, francese, tedesco, ebraico, hindi, indonesiano, italiano, giapponese, kannada, coreano, malese, cinese mandarino, marathi, polacco, portoghese, spagnolo, tagalog, tamil, telugu, thai, turco e vietnamita. Il code-switching — a metà frase e a metà enunciato, senza che venga detto quale lingua sta per arrivare — è la capacità che i riconoscitori monolingua non possono offrire strutturalmente. Un'avvertenza da tenere presente: il bias linguistico è un elenco di lingue, non un contesto in forma libera, e non obbliga il modello a usarle.
Il post di annuncio datato va oltre: afferma che il modello è stato addestrato su oltre 70 lingue, di cui 25 "ampiamente verificate" — secondo quanto dichiarato dal fornitore — e l'elenco delle 25 verificate è il sottoinsieme su cui Meta si impegna. È questa la copertura su cui pianificare, non le 70.
I limiti documentati
Una pagina di riferimento vale solo quanto i vincoli che stampa, e Meta ne stampa diversi.
• Timestamp a livello di turno, non a livello di parola. Sia la pagina del modello sia la documentazione lo dichiarano chiaramente: "Restituisce timestamp a livello di turno, ma non timestamp a livello di parola." I turni contengono orari di inizio e fine in millisecondi. Se il tuo prodotto necessita di un click-to-seek per ogni singola parola — evidenziazione karaoke, instradamento basato sulla confidenza per parola, allineamento forzato — questo è il modello sbagliato e nessuna quantità di prompt engineering può cambiarlo.
• Nessun punteggio di confidenza, nessun rilevamento di eventi sonori, nessun rilevamento delle emozioni, nessuna riformattazione della trascrizione. Meta le elenca tutte e quattro come non disponibili. Ottieni parole, turni, tempi ed etichette dei parlanti, e nulla su quanto il modello sia sicuro.
• Nessuna sintesi vocale e nessuna API di conversazione da voce a voce. È solo in una direzione.
• I formati audio accettati nel percorso file sono pochi. WAV PCM mono a 16 bit, 16 o 24 kHz. Qualsiasi altro formato deve essere convertito prima del caricamento.
Pesi aperti, e la confusione su Muse Glimmer
Muse Voice Transcribe è proprietario e viene erogato tramite l'API — non è un rilascio open-weight, e la documentazione di Meta non sostiene mai il contrario. Questo è importante perché i lettori attribuiscono al nome sbagliato il percorso open-weight della famiglia Muse. Muse Glimmer è quel percorso: la documentazione di Meta lo descrive come un modello multimodale open-weight distillato da Muse Spark, distribuito con una licenza permissiva Apache 2.0, che si scarica e si esegue sul proprio hardware tramite un runtime come vLLM, SGLang, llama.cpp o ExecuTorch. Muse Voice Transcribe è raggruppato nella stessa pagina con Muse Spark, Muse Image e SAM tra i modelli che si chiamano anziché scaricare.
Quindi: nessun peso per Muse Voice Transcribe, nessuna opzione self-hosted, nessun modo per sottoporlo ad audit o metterlo a punto. Se una pagina ti dice il contrario, l'ha confuso con Muse Glimmer. Quando i pesi di un modello non sono pubblicati, la piattaforma di serving è tutto quello che c'è da sapere — ed è di questo che parla la sezione successiva.
Come un cliente lo raggiunge
La Model API di Meta è progettata per essere inserita nei client che già possiedi. L'affermazione del fornitore, stampata sulla pagina di panoramica dell'API, è che Model API «è compatibile in modalità drop-in con le librerie client compatibili con OpenAI e Anthropic, e con le CLI agente compatibili con OpenAI. Imposta l'URL di base del tuo client, aggiungi la tua chiave e mantieni il resto del tuo codice». In generale, per Model API vengono offerte tre forme di richiesta — la Responses API, la Chat Completions API e la Messages API — così un'integrazione esistente di solito ha una superficie corrispondente senza bisogno di riscritture. Una cautela sull'ambito: quella frase sulla compatibilità e quelle tre forme sono capacità di Model API nel suo complesso, non righe stampate sulla pagina del modello di Muse Voice Transcribe. Il quickstart della pagina del modello è più ristretto — dice solo che «punta il tuo client esistente compatibile con OpenAI a Meta Model API», e che avrai una prima richiesta funzionante in meno di cinque minuti.
Una lacuna onesta che vale la pena segnalare in una pagina di riferimento: la documentazione di Meta per questo modello non indica alcuna libreria client ufficiale per Muse Voice Transcribe, e la sua pagina «Client libraries» si trova nella sezione SAM invece che in quella Voice. Quello che la guida speech-to-text ti offre invece è un elenco concreto di dipendenze — Python 3.9 o versione successiva con i pacchetti websockets e sounddevice — più un cookbook sui fondamenti dell'API vocale. Quindi l'affermazione di sostituibilità immediata descrive in generale la superficie di richiesta di Model API; l'endpoint ASR in tempo reale è di per sé un WebSocket con le proprie regole di handshake e nessun wrapper documentato.

Ciò che Meta non ha pubblicato
L'assenza di un benchmark è un fatto relativo alla documentazione, quindi qui viene dichiarata come tale. La pagina del modello di Meta per Muse Voice Transcribe non contiene alcuna tabella di accuratezza stampata: le sue evidenze di accuratezza sono fornite come tre risorse immagine — una classifica del tasso di errore di parole in streaming, un confronto del tasso di errore di diarizzazione e un indice di accuratezza in streaming — senza cifre nel testo estraibile. La pagina del modello stessa non fornisce alcun tasso di errore di parole, alcun tasso di errore di diarizzazione e alcuna suddivisione lingua per lingua.
Il post di annuncio riporta effettivamente cifre dichiarate dal fornitore, tra cui un tasso di errore sulle parole in streaming e un tasso medio di errore di diarizzazione, e sono i numeri che abbiamo riportato quando il modello è stato lanciato; sono misurazioni di Meta stessa e restano non riprodotte da terzi. Questa pagina non riesegue quel confronto, perché rieseguire un benchmark del fornitore del giorno di rilascio su una pagina di riferimento spaccerebbe una cifra non riprodotta come dato assodato. Ciò che si può dire chiaramente è più limitato: Meta non pubblica alcuna valutazione testa a testa contro un rivale nominato, a parità di sforzo e di ambiente di valutazione, per questo modello, quindi qualsiasi confronto si legga ovunque è un confronto tra numeri di fornitori raccolti in condizioni diverse.
Una data resta anche volutamente non stabilita. La pagina del modello non riporta alcuna data di rilascio — il suo unico indicatore di versione è il -1.0 nell'id del modello. La data 2026-09-01 in questo articolo proviene da quel post di annuncio datato, ed è usata qui per datare il modello anziché per riportare un evento.


Chi dovrebbe usarlo, e chi no
Il caso d'uso di Muse Voice Transcribe è ristretto e solido: audio in tempo reale in cui servono parole, identità dell'oratore e fine dei turni sullo stesso flusso, a un prezzo abbastanza basso da poterlo eseguire in modo continuo anziché su richiesta. Agenti vocali, sottotitoli in tempo reale, intelligence per riunioni e chiamate, dettatura e trascrizione ad alto volume sono i carichi di lavoro che Meta cita, e sono i carichi di lavoro per cui l'interfaccia è effettivamente modellata: un WebSocket di 60 minuti con modalità di endpointing ed etichette dell'oratore con ambito di sessione.
Le argomentazioni contrarie sono altrettanto specifiche. Se hai bisogno di timestamp a livello di parola, confidenza per parola, rilevamento di eventi sonori o emozioni, o riformattazione della trascrizione, questo modello non li ha, e si tratta di un'assenza documentata piuttosto che di un bug. Se il tuo audio arriva in formati diversi da WAV mono a 16 bit a 16 o 24 kHz e stai usando l'endpoint file, paghi un passaggio di conversione che non pagheresti altrove. E se la tua esigenza è la trascrizione in batch di registrazioni archiviate dove l'accuratezza è l'unico asse, la proposta dello streaming non ti offre nulla — il prezzo è lo stesso su entrambi i percorsi, quindi stai pagando per una funzionalità in tempo reale che non userai.
L'unica cosa da controllare prima di impegnarti in un percorso di produzione è la cifra che questa pagina esiste per fornire, ed è l'unica cifra che può cambiare senza che il modello cambi affatto: $0,18 per ora di audio, come riportato oggi sulla pagina del modello di Meta stessa. La pagina di Meta è quella che fa testo in merito. Quando si muove, tutto ciò che è dimensionato su di essa — il mese da mille ore, il costo per intervista, l'aritmetica costruire-o-comprare — si muove con essa.
