
MAI-Transcribe-2 È Live: la mossa di Microsoft da $0,10 all'ora per conquistare il riconoscimento vocale
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 è il modello su cui Microsoft AI punta per trasformare il riconoscimento vocale in una commodity piuttosto che in una funzionalità premium, e i numeri con cui è stato lanciato sono pensati per sostenere questa tesi. Rilasciato il 3 settembre 2026 in anteprima pubblica su Microsoft Foundry, MAI Playground e le superfici API di Microsoft, MAI-Transcribe-2 è il terzo modello di riconoscimento vocale di Microsoft in cinque mesi — dopo MAI-Transcribe-1 ad aprile a 0,36 $ per ora audio e MAI-Transcribe-1.5 a giugno — e il primo che supera tutti i rivali gestiti che menziona nelle due metriche su cui i team fanno realmente la spesa. Nella classifica non-streaming del word-error-rate di Artificial Analysis si attesta al 2,0% di AA-WER, al secondo posto, e a circa 411× il tempo reale, anche qui al secondo posto, il che insieme lo colloca sulla frontiera di Pareto accuratezza-velocità: in quella classifica, nessun modello è sia più accurato sia più veloce. Il prezzo di lancio è inferiore di circa il 72% rispetto al suo predecessore.
Il "modello di riconoscimento vocale più veloce, più accurato ed economico al mondo" è il titolo che Microsoft stessa ha dato al rilascio, e merita di essere letto con gli asterischi del materiale originale. Questa è la storia del lancio come è realmente avvenuto, con le affermazioni del fornitore etichettate e le parti che necessitano ancora di prove separate.
Ciò che Microsoft ha effettivamente rilasciato
MAI-Transcribe-2 è un modello di trascrizione per audio pre-registrato, orientato all'elaborazione batch e progettato specificamente per contenuti di lunga durata: riunioni, chiamate, archivi multimediali, registrazioni di contact center. Microsoft lo posiziona esattamente sui carichi di lavoro in cui a dominare sono produttività e costo al minuto. Trascrive in 60 lingue con identificazione automatica della lingua, include la diarizzazione dei parlanti che attribuisce le parole alla persona giusta, fornisce timestamp a livello di parola e supporta il keyword biasing per nomi, abbreviazioni e terminologia di settore. Due stili di trascrizione configurabili coprono la classica suddivisione: "verbatim", che conserva riempitivi e falsi inizi per trascrizioni di livello compliance, e "clean", che elimina le disfluenze per sottotitoli e note. Microsoft sottolinea inoltre il code-switching nel parlato multilingue misto, come Hinglish e Spanglish, e la robustezza su audio reale e disturbato.

La storia della disponibilità conta tanto quanto l'elenco delle funzionalità. Microsoft non la sta bloccando dietro il suo stack vocale enterprise: il modello è dimostrabile oggi dal MAI Playground e servito tramite Microsoft Foundry in anteprima pubblica, con la documentazione di Foundry ospitata sotto il servizio Azure AI Speech. Questa è una scelta di distribuzione deliberata — mettere il modello di frontiera dove uno sviluppatore può usarlo con una chiave, non dove un ciclo di vendita enterprise deve prima approvarlo. Microsoft non ha pubblicato i pesi, e nulla nel materiale di lancio suggerisce che lo farà.
Leggere il titolo alla lettera
"Il più veloce, il più preciso e il più economico del mondo" sono tre affermazioni di diversa forza, e il post di lancio stesso ne ridimensiona silenziosamente due. La versione onesta di ciascuna:
• Precisione — Nella classifica di Artificial Analysis, MAI-Transcribe-2 si colloca al secondo posto con un AA-WER del 2,0%, non al primo; anche il testo di Microsoft parla di secondo posto. L'espressione «più accurato» regge solo se la si legge come «tra le API batch gestite che si attestano a questo livello», e anche in questo caso è un'affermazione relativa a un modello uscito da quattro giorni, non un titolo consolidato. Microsoft riferisce separatamente che MAI-Transcribe-2 è prima nel benchmark multilingue FLEURS, con un WER medio del 5,2% nelle sue 60 lingue — un dato che proviene dal post di lancio di Microsoft e che non è stato ancora ricalcolato in modo indipendente lingua per lingua.
• Velocità — Secondo Artificial Analysis, MAI-Transcribe-2 gira a circa 411× il tempo reale, secondo in quella classifica. Curiosamente, l'annuncio di Microsoft non riporta mai il numero assoluto; preferisce invece moltiplicatori relativi più accattivanti — "elaborazione fino a 10× più veloce rispetto ai principali concorrenti, soprattutto per audio di lunga durata", e in particolare 10× più veloce di GPT-Transcribe di OpenAI, 7× più veloce di Scribe v2 di ElevenLabs e 5× più veloce di Gemini 3.5 Transcribe. Questi rapporti sono l'inquadramento che Microsoft dà degli stessi dati di Artificial Analysis, e i tassi di base contano: "5× più veloce di Gemini 3.5 Transcribe" sembra un divario modesto finché non lo si traduce in minuti di calcolo per ogni ora di audio.
• Il più economico — Vero solo entro due limiti, come Microsoft afferma chiaramente. La tariffa di $0,10 è un’offerta a tempo limitato fino alla fine dell’anno, e nessun prezzo standard post-promozione è indicato nel materiale di lancio. Ed è il più economico tra le API gestite ad alta accuratezza; un modello open source self-hosted come Whisper Large v3 Turbo trascrive comunque a un costo che, di fatto, equivale a quello dell’elettricità. L’argomento della commodity è reale — è solo più ristretto del titolo.

Cosa si ottiene con $1,67 per 1.000 minuti
Con un prezzo di $0,10 per ora audio, MAI-Transcribe-2 costa circa $1,67 per 1.000 minuti di audio. Il confronto che rende questa cifra davvero concreta è con le altre API di trascrizione gestite che competono sull'accuratezza. GPT-Transcribe è in listino a $4,50 per 1.000 minuti; il piano pre-registrato di Gemini 3.5 Transcribe equivale a circa $5 per 1.000 minuti con la tariffazione a token di Google; Scribe v2 di ElevenLabs ha un listino ancora più alto. Su 1.000 ore di audio al mese — un carico di lavoro serio ma non enorme per contact center o media — il divario tra MAI-Transcribe-2 alla tariffa early-bird e GPT-Transcribe al listino è dell'ordine di $170 al mese, ogni mese, ancor prima di considerare qualsiasi differenza di accuratezza. È questo il divario di prezzo che fa sì che la trascrizione smetta di essere una voce di costo che i team ottimizzano e diventi una voce di costo che ignorano.
Due avvertenze vanno menzionate insieme. Primo, un prezzo promozionale è un esperimento di prezzo finché non smette di esserlo: i team che costruiscono un prodotto sulla tariffa da $0,10 dovrebbero sapere che la tariffa standard non è stata resa pubblica, e la cifra onesta da mettere a budget per il 2027 si colloca da qualche parte tra l'offerta di lancio e ciò che Microsoft indicherà alla scadenza dell'offerta. Secondo, "il più economico a questo livello di accuratezza" non dice nulla sul costo totale di proprietà — il modello è disponibile solo via API, quindi il confronto che conta per i team ad alto volume è quello tra $1,67 per 1.000 minuti e il costo a pieno carico della gestione del proprio stack open-weights, e non solo quello con altre API.
Ridotto a un tabellone, lo schieramento di partenza si presenta così: ogni cifra riportata di seguito reca l'etichetta della fonte ad essa associata nel corpo del testo precedente.

Cosa non è ancora stato dimostrato?
Per quanto specifiche siano le affermazioni del lancio, tre cose sono davvero aperte. La prima è lo streaming: MAI-Transcribe-2 è un modello batch, la storia di Microsoft sulla velocità riguarda il throughput dei file, e nessuna SKU in tempo reale è stata annunciata o dimostrata — il "411×" non è un numero di latenza per la trascrizione live. La seconda è la qualità della diarizzazione: l'attribuzione dei parlanti è inclusa, ma Microsoft non pubblica alcun tasso di errore di diarizzazione, ed è la funzionalità che con maggiore probabilità apparirà peggiore nei test indipendenti rispetto al WER. La terza è la ripartizione multilingue: una singola media FLEURS su 60 lingue può nascondere un'ampia varianza tra le singole lingue, e Microsoft non ha pubblicato la tabella per lingua. Ciascuno di questi è un motivo per cui la storia non è conclusa al quarto giorno.
Dove lascia il tuo stack di trascrizione
Nessuna di queste cose richiede di scegliere MAI-Transcribe-2 oggi, ed è proprio per questo che il prezzo merita l'attenzione dei team che non sono alla ricerca di un nuovo fornitore. Il riconoscimento vocale raramente è la fine di una pipeline: le trascrizioni vengono riassunte, elaborate, cercate e instradate, ed è in quel livello a valle che una configurazione multi-modello dimostra il proprio valore. Una piattaforma come OrcaRouter esiste per quella metà dello stack: un'unica API su oltre 200 modelli, prezzi di listino del fornitore applicati con markup 0%, failover automatico e un DSL di routing che consente a una trascrizione di alimentare un modello diverso per ogni carico di lavoro — i verbali delle riunioni a un riassuntore, la revisione di conformità a un altro — senza una seconda integrazione. MAI-Transcribe-2 stesso oggi non è in quell'elenco; vive sull'API proprietaria di Microsoft e sulle piattaforme di terze parti elencate da Microsoft. Ma il prezzo commodity che ha appena fissato è il miglior argomento finora per costruire la parte sopra la trascrizione in modo indipendente dal modello.
Il prezzo di lancio è il segnale rivelatore. Microsoft non cerca di vincere nello speech-to-text solo con le funzionalità — vuole rendere l'elevata accuratezza così economica che la categoria smette di essere una voce di spesa. MAI-Transcribe-2 merita l'attenzione che sta ricevendo; basta leggere "il più veloce, il più accurato e il più economico del mondo" con i tre asterischi annessi: secondo nell'AA-WER, prezzi promozionali fino a fine anno e una storia di streaming che non è ancora stata raccontata.
