Hero card dell'articolo con il titolo 'MAI-Transcribe-2 Is Live', il badge 'NEWS · MICROSOFT AI' e il sottotitolo 'La scommessa di Microsoft da $0,10 l'ora per conquistare il riconoscimento vocale', con una striscia di statistiche che mostra AA-WER 2,0% (#2 secondo Artificial Analysis), velocità ~411x rispetto al tempo reale (#2) e un prezzo di lancio di $0,10 l'ora, su un gradiente da bianco a blu con il logo OrcaRouter in basso a destra.
Guides & Insights

MAI-Transcribe-2 È Live: la mossa di Microsoft da $0,10 all'ora per conquistare il riconoscimento vocale

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

MAI-Transcribe-2 è il modello su cui Microsoft AI punta per trasformare il riconoscimento vocale in una commodity piuttosto che in una funzionalità premium, e i numeri con cui è stato lanciato sono pensati per sostenere questa tesi. Rilasciato il 3 settembre 2026 in anteprima pubblica su Microsoft Foundry, MAI Playground e le superfici API di Microsoft, MAI-Transcribe-2 è il terzo modello di riconoscimento vocale di Microsoft in cinque mesi — dopo MAI-Transcribe-1 ad aprile a 0,36 $ per ora audio e MAI-Transcribe-1.5 a giugno — e il primo che supera tutti i rivali gestiti che menziona nelle due metriche su cui i team fanno realmente la spesa. Nella classifica non-streaming del word-error-rate di Artificial Analysis si attesta al 2,0% di AA-WER, al secondo posto, e a circa 411× il tempo reale, anche qui al secondo posto, il che insieme lo colloca sulla frontiera di Pareto accuratezza-velocità: in quella classifica, nessun modello è sia più accurato sia più veloce. Il prezzo di lancio è inferiore di circa il 72% rispetto al suo predecessore.

Il "modello di riconoscimento vocale più veloce, più accurato ed economico al mondo" è il titolo che Microsoft stessa ha dato al rilascio, e merita di essere letto con gli asterischi del materiale originale. Questa è la storia del lancio come è realmente avvenuto, con le affermazioni del fornitore etichettate e le parti che necessitano ancora di prove separate.

Ciò che Microsoft ha effettivamente rilasciato

MAI-Transcribe-2 è un modello di trascrizione per audio pre-registrato, orientato all'elaborazione batch e progettato specificamente per contenuti di lunga durata: riunioni, chiamate, archivi multimediali, registrazioni di contact center. Microsoft lo posiziona esattamente sui carichi di lavoro in cui a dominare sono produttività e costo al minuto. Trascrive in 60 lingue con identificazione automatica della lingua, include la diarizzazione dei parlanti che attribuisce le parole alla persona giusta, fornisce timestamp a livello di parola e supporta il keyword biasing per nomi, abbreviazioni e terminologia di settore. Due stili di trascrizione configurabili coprono la classica suddivisione: "verbatim", che conserva riempitivi e falsi inizi per trascrizioni di livello compliance, e "clean", che elimina le disfluenze per sottotitoli e note. Microsoft sottolinea inoltre il code-switching nel parlato multilingue misto, come Hinglish e Spanglish, e la robustezza su audio reale e disturbato.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

La storia della disponibilità conta tanto quanto l'elenco delle funzionalità. Microsoft non la sta bloccando dietro il suo stack vocale enterprise: il modello è dimostrabile oggi dal MAI Playground e servito tramite Microsoft Foundry in anteprima pubblica, con la documentazione di Foundry ospitata sotto il servizio Azure AI Speech. Questa è una scelta di distribuzione deliberata — mettere il modello di frontiera dove uno sviluppatore può usarlo con una chiave, non dove un ciclo di vendita enterprise deve prima approvarlo. Microsoft non ha pubblicato i pesi, e nulla nel materiale di lancio suggerisce che lo farà.

Leggere il titolo alla lettera

"Il più veloce, il più preciso e il più economico del mondo" sono tre affermazioni di diversa forza, e il post di lancio stesso ne ridimensiona silenziosamente due. La versione onesta di ciascuna:

• Precisione — Nella classifica di Artificial Analysis, MAI-Transcribe-2 si colloca al secondo posto con un AA-WER del 2,0%, non al primo; anche il testo di Microsoft parla di secondo posto. L'espressione «più accurato» regge solo se la si legge come «tra le API batch gestite che si attestano a questo livello», e anche in questo caso è un'affermazione relativa a un modello uscito da quattro giorni, non un titolo consolidato. Microsoft riferisce separatamente che MAI-Transcribe-2 è prima nel benchmark multilingue FLEURS, con un WER medio del 5,2% nelle sue 60 lingue — un dato che proviene dal post di lancio di Microsoft e che non è stato ancora ricalcolato in modo indipendente lingua per lingua.

• Velocità — Secondo Artificial Analysis, MAI-Transcribe-2 gira a circa 411× il tempo reale, secondo in quella classifica. Curiosamente, l'annuncio di Microsoft non riporta mai il numero assoluto; preferisce invece moltiplicatori relativi più accattivanti — "elaborazione fino a 10× più veloce rispetto ai principali concorrenti, soprattutto per audio di lunga durata", e in particolare 10× più veloce di GPT-Transcribe di OpenAI, 7× più veloce di Scribe v2 di ElevenLabs e 5× più veloce di Gemini 3.5 Transcribe. Questi rapporti sono l'inquadramento che Microsoft dà degli stessi dati di Artificial Analysis, e i tassi di base contano: "5× più veloce di Gemini 3.5 Transcribe" sembra un divario modesto finché non lo si traduce in minuti di calcolo per ogni ora di audio.

• Il più economico — Vero solo entro due limiti, come Microsoft afferma chiaramente. La tariffa di $0,10 è un’offerta a tempo limitato fino alla fine dell’anno, e nessun prezzo standard post-promozione è indicato nel materiale di lancio. Ed è il più economico tra le API gestite ad alta accuratezza; un modello open source self-hosted come Whisper Large v3 Turbo trascrive comunque a un costo che, di fatto, equivale a quello dell’elettricità. L’argomento della commodity è reale — è solo più ristretto del titolo.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

Cosa si ottiene con $1,67 per 1.000 minuti

Con un prezzo di $0,10 per ora audio, MAI-Transcribe-2 costa circa $1,67 per 1.000 minuti di audio. Il confronto che rende questa cifra davvero concreta è con le altre API di trascrizione gestite che competono sull'accuratezza. GPT-Transcribe è in listino a $4,50 per 1.000 minuti; il piano pre-registrato di Gemini 3.5 Transcribe equivale a circa $5 per 1.000 minuti con la tariffazione a token di Google; Scribe v2 di ElevenLabs ha un listino ancora più alto. Su 1.000 ore di audio al mese — un carico di lavoro serio ma non enorme per contact center o media — il divario tra MAI-Transcribe-2 alla tariffa early-bird e GPT-Transcribe al listino è dell'ordine di $170 al mese, ogni mese, ancor prima di considerare qualsiasi differenza di accuratezza. È questo il divario di prezzo che fa sì che la trascrizione smetta di essere una voce di costo che i team ottimizzano e diventi una voce di costo che ignorano.

Due avvertenze vanno menzionate insieme. Primo, un prezzo promozionale è un esperimento di prezzo finché non smette di esserlo: i team che costruiscono un prodotto sulla tariffa da $0,10 dovrebbero sapere che la tariffa standard non è stata resa pubblica, e la cifra onesta da mettere a budget per il 2027 si colloca da qualche parte tra l'offerta di lancio e ciò che Microsoft indicherà alla scadenza dell'offerta. Secondo, "il più economico a questo livello di accuratezza" non dice nulla sul costo totale di proprietà — il modello è disponibile solo via API, quindi il confronto che conta per i team ad alto volume è quello tra $1,67 per 1.000 minuti e il costo a pieno carico della gestione del proprio stack open-weights, e non solo quello con altre API.

Ridotto a un tabellone, lo schieramento di partenza si presenta così: ogni cifra riportata di seguito reca l'etichetta della fonte ad essa associata nel corpo del testo precedente.

A single-column scoreboard titled 'MAI-Transcribe-2 — the scoreboard' listing AA-WER 2.0% (#2 per Artificial Analysis), speed ~411x real time (#2), price $1.67 per 1,000 minutes early-bird through 2026, 60 languages with automatic language ID, bundled diarization with unpublished error rate, and no streaming SKU announced, with the OrcaRouter logo bottom right.

Cosa non è ancora stato dimostrato?

Per quanto specifiche siano le affermazioni del lancio, tre cose sono davvero aperte. La prima è lo streaming: MAI-Transcribe-2 è un modello batch, la storia di Microsoft sulla velocità riguarda il throughput dei file, e nessuna SKU in tempo reale è stata annunciata o dimostrata — il "411×" non è un numero di latenza per la trascrizione live. La seconda è la qualità della diarizzazione: l'attribuzione dei parlanti è inclusa, ma Microsoft non pubblica alcun tasso di errore di diarizzazione, ed è la funzionalità che con maggiore probabilità apparirà peggiore nei test indipendenti rispetto al WER. La terza è la ripartizione multilingue: una singola media FLEURS su 60 lingue può nascondere un'ampia varianza tra le singole lingue, e Microsoft non ha pubblicato la tabella per lingua. Ciascuno di questi è un motivo per cui la storia non è conclusa al quarto giorno.

Dove lascia il tuo stack di trascrizione

Nessuna di queste cose richiede di scegliere MAI-Transcribe-2 oggi, ed è proprio per questo che il prezzo merita l'attenzione dei team che non sono alla ricerca di un nuovo fornitore. Il riconoscimento vocale raramente è la fine di una pipeline: le trascrizioni vengono riassunte, elaborate, cercate e instradate, ed è in quel livello a valle che una configurazione multi-modello dimostra il proprio valore. Una piattaforma come OrcaRouter esiste per quella metà dello stack: un'unica API su oltre 200 modelli, prezzi di listino del fornitore applicati con markup 0%, failover automatico e un DSL di routing che consente a una trascrizione di alimentare un modello diverso per ogni carico di lavoro — i verbali delle riunioni a un riassuntore, la revisione di conformità a un altro — senza una seconda integrazione. MAI-Transcribe-2 stesso oggi non è in quell'elenco; vive sull'API proprietaria di Microsoft e sulle piattaforme di terze parti elencate da Microsoft. Ma il prezzo commodity che ha appena fissato è il miglior argomento finora per costruire la parte sopra la trascrizione in modo indipendente dal modello.

Il prezzo di lancio è il segnale rivelatore. Microsoft non cerca di vincere nello speech-to-text solo con le funzionalità — vuole rendere l'elevata accuratezza così economica che la categoria smette di essere una voce di spesa. MAI-Transcribe-2 merita l'attenzione che sta ricevendo; basta leggere "il più veloce, il più accurato e il più economico del mondo" con i tre asterischi annessi: secondo nell'AA-WER, prezzi promozionali fino a fine anno e una storia di streaming che non è ancora stata raccontata.