
MAI-Transcribe-2 vs Muse Voice Transcribe: Dezelfde week, twee tegengestelde gokken op audio
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0455Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0247Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0247Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0157Intelligentie82Coderen
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2646Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1541Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1251Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0547Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligentie69Coderen
De week van 1 september 2026 leverde twee spraakmodellen op van twee toonaangevende labs, en MAI-Transcribe-2 en Muse Voice Transcribe zijn het best te begrijpen als tegenovergestelde antwoorden op de vraag waar audio-intelligentie thuishoort. Muse Voice Transcribe, op 1 september uitgebracht door Meta Superintelligence Labs, is een realtime-audioperceptiemodel: het transcribeert, onderscheidt meer dan twintig sprekers en detecteert wanneer een spreker is uitgesproken — allemaal in één streaming doorgang over chunks van 80 milliseconden live audio — en het voert de ranglijst voor streaming spraak-naar-tekst aan waarop het werd gemeten. MAI-Transcribe-2, twee dagen later (op 3 september) door Microsoft uitgebracht, is de tegenovergestelde gok: een batch-engine die live-latentie helemaal niet najaagt en in plaats daarvan al zijn energie steekt in het transcriberen van vooraf opgenomen bestanden, met het laagste woordfoutpercentage op de onafhankelijke niet-streaming-ranglijst, ruwweg 411× realtime, voor ongeveer $1,67 per 1.000 minuten. Een head-to-head-vergelijking van de twee modellen als 'transcriptiemodellen' verhult de werkelijke beslissing: die draait om het moment in het bestaan van een audio-opname waarop je de woorden nodig hebt — terwijl de opname wordt gemaakt, of nadat deze is afgelopen.
Twee producten gericht op verschillende momenten
Muse Voice Transcribe is ontworpen voor het moment dat de audio nog loopt. Het is een autoregressief multimodaal model in Meta's Muse-familie dat drie taken in één doorgang combineert: automatische spraakherkenning, sprekersdiarisatie voor meer dan twintig sprekers en endpointing, het detecteren dat een spreker is gestopt met praten zodat het systeem kan reageren. Meta meldt dat het definitieve transcript ongeveer 0,16 seconde nadat een spreker stopt wordt opgeleverd, met een woordfoutpercentage van 3,1% op die definitieve transcripten en 3,6% op de eerste gedeeltelijke transcripten — cijfers die Meta op de lanceringsdag publiceerde onder verwijzing naar het streaming leaderboard van Artificial Analysis en die op het moment van schrijven nog niet onafhankelijk waren gereproduceerd. Het kan audio van langer dan een uur in één stream verwerken, schakelt midden in een zin over naar een andere taal en is getraind op meer dan 70 talen, waarvan er bij de lancering 25 uitgebreid zijn gevalideerd. De prijs is $3,00 per 1.000 minuten audio, ongeveer $0,18 per uur, via de Meta Model API. Meta heeft bevestigd dat de gewichten niet openbaar worden gemaakt.
MAI-Transcribe-2 is gebouwd voor het moment dat de audio al een bestand is. Microsofts model behaalt een AA-WER van 2,0% op het niet-streaming leaderboard van Artificial Analysis — tweede plaats, en het beste cijfer onder de beheerde batch-API's — en draait op ongeveer 411× real time, wat een doorvoercijfer is, geen latentiebelofte. Het transcribeert in 60 talen met automatische taalherkenning, bundelt sprekersdiarisatie, tijdstempels op woordniveau, trefwoordbias en letterlijke versus opgeschoonde stijlen, en ondersteunt codewisseling zoals Hinglish en Spanglish. Het is beschikbaar via Microsoft Foundry in openbare preview en in de MAI Playground voor $0,10 per audio-uur als tijdelijke introductieaanbieding tot het einde van het jaar, zonder dat er een streamingproduct is aangekondigd. Het lanceringsbericht van Microsoft positioneert het expliciet voor long-form en batch-audio — de workloads waarbij de lage latentie van een streamingmodel niets oplevert, maar de kosten per minuut wél meetellen.

Waarom de twee nauwkeurigheidscijfers elkaar niet tegenspreken
Het natuurlijke instinct is om 2,0% met 3,1% te vergelijken en een winnaar aan te wijzen, maar dat zou dubbel verkeerd zijn. Ten eerste meten de cijfers verschillende taken: de 2,0% van MAI-Transcribe-2 is de nauwkeurigheid zonder streaming voor vooraf opgenomen audio, waarbij het model het hele bestand kan bekijken; de 3,1% van Muse Voice Transcribe is de nauwkeurigheid met streaming voor definitieve transcripten, die zijn gemaakt onder de beperking dat er wordt getranscribeerd terwijl de audio binnenkomt. Streaming is het moeilijkere probleem; daarom zijn de ranglijst voor streaming en de ranglijst voor niet-streaming aparte ranglijsten met aparte scores. Ten tweede wegen de labels niet even zwaar: het cijfer van MAI-Transcribe-2 is een meting van het model door Artificial Analysis, terwijl dat van Muse Voice Transcribe een rapport van Meta op de lanceerdag is over wat Artificial Analysis heeft gemeten – door de leverancier gerapporteerd en niet gereproduceerd. De eerlijke uitspraak is dat beide modellen geloofwaardige koplopers zijn op hun respectievelijke ranglijsten, en geen van beide cijfers vertelt je iets over de andere categorie.
Diarisatie is waar de echte vergelijking ligt, want het is de enige functie die beide producten bevatten en de enige waarin hun ambities zichtbaar verschillen. Muse Voice Transcribe onderscheidt meer dan twintig sprekers als kern-streamingmogelijkheid, waarbij Meta een gemiddelde foutscore voor sprekerdiarisatie van 17,5% rapporteert tegenover een door haar aangehaald concurrentenbereik van 21,1% tot 28,6% — wederom door Meta gerapporteerd en ongeverifieerd. MAI-Transcribe-2 bundelt diarisatie ook, maar Microsoft publiceert geen sprekersmaximum en helemaal geen foutscore voor diarisatie. Voor een gesprek tussen twee partijen zijn beide producten prima en is het verschil niet van belang. Voor een focusgroep van twaalf personen of een paneelopname is Muse Voice Transcribe de enige van de twee waarvan het multi-speakermaximum zelfs maar is vermeld, en de niet-gemeten diarisatie van MAI-Transcribe-2 is de allerbelangrijkste reden om het te testen voordat u er uw lastigere audio aan toevertrouwt.
De prijsvergelijking die zinvol is
Qua prijs liggen de twee dichter bij elkaar dan de tweedeling batch-versus-streaming doet vermoeden: $1,67 per 1.000 minuten (MAI-Transcribe-2, early-bird) en $3,00 per 1.000 minuten (Muse Voice Transcribe) zitten allebei aan de goedkope kant van beheerde spraakherkenning. De vergelijking is alleen zinvol binnen hetzelfde marktsegment. Voor batchtranscriptie van vooraf opgenomen audio kost MAI-Transcribe-2 minder dan de helft van de prijs van het streaming-native model, terwijl het een beter niet-streaming-WER heeft — maar je zou opgenomen bestanden alleen naar Muse Voice Transcribe sturen als je specifiek de streaming-pipeline wilde gebruiken, en dat is niet de efficiënte manier om een archief te verwerken. Voor live-audio van vergaderingen is Muse Voice Transcribe het enige product in dit artikel dat überhaupt werkt; het tarief van $3,00 onderbiedt de andere realtime-transcriptie-API's waartegen het bij de lancering moest concurreren — Gemini 3.5 Transcribe Live op ongeveer $9 per 1.000 minuten, GPT Live Transcribe op $17 — terwijl het ook sprekerdiarisatie voor meer dan twintig sprekers biedt, iets wat die producten niet evenaren. De eerlijke prijsconclusie is dat Meta de streamingprijs laag heeft gezet en Microsoft de batchprijs nog lager, en beide bedragen zijn promotionele prijzen die zullen verschuiven zodra elke leverancier zijn standaardtarief bekendmaakt.

Welke voor welke audio
Als je audio live is — vergaderingen die in realtime worden getranscribeerd, spraakagenten, live-ondertiteling, alles waarbij woorden nodig zijn terwijl ze worden uitgesproken — dan is Muse Voice Transcribe de beste keuze, en het is niet eens spannend. Het is het enige streamingmodel in dit overzicht, het onderscheidt meer dan twintig sprekers in dezelfde doorgang, en het was vanaf dag één geprijsd om dat marktsegment te veroveren. De zwakke punten zijn waar je tijdens een proef op moet letten: de cijfers voor nauwkeurigheid en diarisatie zijn door Meta gerapporteerd, en een streamingmodel dat pas een week oud is, heeft nog niet laten zien hoe het zich gedraagt op de rommelige audio die buiten de benchmarks van de lancering voorkomt.
Als je audio al bestanden betreft — archieven, gespreksopnames, mediabibliotheken, kortom alles wat in bulk wordt verwerkt — is MAI-Transcribe-2 op elke as die ertoe doet de betere keuze: lagere gemeten WER, ruwweg een orde van grootte meer doorvoer en een prijs per 1.000 minuten onder die van het streamingmodel. De risico's zijn het spiegelbeeld van die van Muse: vier dagen oud, geen streaming-SKU, ongemeten diarizationkwaliteit en een vroegboektarief met een niet bekendgemaakte standaardprijs erachter.
De Microsoft-lanceringspagina die MAI-Transcribe-2 introduceert, somt functies op die Microsoft bundelt en die de streamingconcurrent niet in dezelfde doorgang aanbiedt. Het is hét document dat u moet raadplegen wanneer u wilt bepalen welke beweringen daadwerkelijke productfunctionaliteit betreffen en welke nog louter benchmarkbeloften zijn.

En als het transcript slechts de eerste helft van je pipeline is, doet de keuze tussen deze twee er minder toe dan de keuze die je daarboven maakt. Live vergaderaudio die door Muse Voice Transcribe is getranscribeerd, is pas bruikbaar nadat deze is samengevat, actiepunten zijn geëxtraheerd en een follow-up is opgesteld; gearchiveerde gesprekken die door MAI-Transcribe-2 zijn getranscribeerd, moeten nog worden doorzocht, geschoond of naar het juiste downstreamsysteem doorgestuurd. Dat is de laag waar een multi-modelplatform zijn waarde bewijst: met de ene API van OrcaRouter voor 200+ modellen, waarbij de lijstprijzen van providers zonder opslag worden doorberekend, kan dat downstreamwerk via één integratie per workload een ander model aanroepen. Welk spraakmodel er ook als winnaar uit je pilot komt, de stack boven het transcript hoeft dus niet te worden herbouwd om over te schakelen. Noch Muse Voice Transcribe, noch MAI-Transcribe-2 staat vandaag op die lijst; beide draaien op de eigen API's van hun leveranciers. De weddenschap die deze week daadwerkelijk is beslecht, is smaller en nuttiger: realtime- en batchtranscriptie zijn beide net goedkoop genoeg geworden dat het onderscheidende vermogen niet langer in de woorden zit — maar in wat je ermee doet.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
