
VibeVoice-ASR-Streaming-7B versus GPT-Transcribe: een live-sessiecontrolepunt afgezet tegen OpenAI's bestandsendpoint
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
De twee modellen op deze pagina zijn geen rivalen zoals hun namen suggereren — ze zijn gebouwd voor verschillende momenten in het leven van een audio-opname, en de eerlijke vergelijking draait om de vraag in welk stadium je product zich bevindt. GPT Transcribe is het asynchrone transcriptie-endpoint van OpenAI: je uploadt een voltooid bestand, het verwerkt ongeveer 34× sneller dan realtime en retourneert een transcript, voor $0,0045 per minuut audio, met een onafhankelijk gemeten woordfoutpercentage van 3,31% op de AA-WER-benchmark van Artificial Analysis. VibeVoice-ASR-Streaming-7B is het tegenovergestelde: de streaming-checkpoint van Microsoft Research, die op 2 september 2026 onder een MIT-licentie geruisloos naar Hugging Face is geüpload, is gebouwd om audio te transcriberen terwijl die nog binnenkomt — een WebSocket-sessie die tekst in blokken uitzendt naarmate de opname groeit. Ze alleen op nauwkeurigheid vergelijken zou betekenisloos zijn, want de ene kant heeft een gecontroleerd cijfer en de andere kant heeft in het geheel geen cijfer in tekstvorm gepubliceerd.
Alles hieronder is dienovereenkomstig gelabeld. De GPT Transcribe-cijfers zijn OpenAI's gepubliceerde prijs en Artificial Analysis' onafhankelijke meting, beide in het publieke domein sinds de lancering van het model op 28 juli 2026. De VibeVoice-ASR-Streaming-7B-kant is wat er uit de repository te weten valt — de checkpointconfiguratie, de modelkaart en Microsofts streamingdocumentatie — omdat geen derde partij het heeft gebenchmarkt en Microsoft geen streaming woordfoutpercentage in leesbare tekst heeft opgenomen.
Twee verschillende momenten in het leven van audio
GPT Transcribe is ontworpen voor opnames die al hebben plaatsgevonden. Het endpoint van OpenAI accepteert audiobestanden tot 25 MB in de gebruikelijke formaten — mp3, mp4, mpeg, mpga, m4a, wav, webm — en levert na verwerking het volledige transcript op, ongeveer 34× realtime, dus een opname van een uur wordt binnen een paar minuten verwerkt. Het is de batch-route, en OpenAI prijst het dienovereenkomstig: $0.0045 per audiominuut, ongeveer $0.27 per audio-uur. Als uw behoefte echt live is, verkoopt OpenAI een apart model daarvoor — GPT Live Transcribe voor $0.017 per minuut, bijna vier keer de batchprijs — dat het dichtst in de buurt komt van wat VibeVoice-ASR-Streaming-7B doet aan de kant van OpenAI.
VibeVoice-ASR-Streaming-7B heft dat onderscheid in de andere richting op: het is een streaming-checkpoint dat ook hele bestanden aankan. De preprocessorconfiguratie toont het live-contract: audio die binnenkomt op 24 kHz, 3.200× gecomprimeerd tot een tokenstroom van 7,5 Hz, en vervolgens verwerkt in blokken van 22 frames met een lookahead van 4 frames — zo'n 2,9 seconden audio per blok, met ruwweg een halve seconde context uit de toekomst — waarbij tekst wordt gegenereerd zodra elk blok wordt afgerond. De sessiecontext wordt via de KV-cache doorgegeven, waardoor een lange sessie niet vanaf nul hoeft te worden herberekend. De gedocumenteerde serving-route (een vLLM-plugin) biedt een WebSocket-streamingeindpunt voor livesessies en een eindpunt voor het transcriberen van hele bestanden; dezelfde gewichten bedienen dus beide vormen. Maar het bestaansrecht van het model is de live-vorm, en er is geen afrekening per minuut omdat er geen gehoste API is. Jij zorgt voor de GPU.

Het bewijsregister is eenzijdig.
GPT Transcribe is een van de grondiger doorgemeten transcriptie-API's in productie. Artificial Analysis noteert een woordfoutpercentage van 3.31% op AA-WER — negende van de circa vijftig gevolgde systemen — met een bekend zwak punt verborgen in de subscores: op de bewust akoestisch moeilijke Earnings22-set zakt het naar 6.10%. Dat zijn gecontroleerde, reproduceerbare cijfers van een neutraal leaderboard, die gepaard gaan met beperkingen die zelf ook gedocumenteerd zijn. Het model werd 25% goedkoper gelanceerd dan zijn voorganger GPT-4o Transcribe en scoort ongeveer 0.7 punt beter op dezelfde benchmark.
VibeVoice-ASR-Streaming-7B heeft nergens een vergelijkbaar cijfer. De modelkaart bevat een evaluatiecijfer als afbeelding en het technische rapport van Microsoft is een pdf, maar er is geen citeerbaar streaming-WER- of latentiecijfer in proza, en niets dat onafhankelijk te controleren valt. Het enige numerieke anker in de VibeVoice-familie is de door de leverancier gerapporteerde tabel van de batch-VibeVoice-ASR-modelkaart — een gemiddelde WER van 7,77% over acht Engelse testsets en 2,20% op LibriSpeech clean — die het niet-streamingmodel beschrijft en niet mag worden gelezen als de nauwkeurigheid van dit checkpoint. Als uw aankoopbeslissing een cijfer nodig heeft dat u tegenover een collega kunt verdedigen, heeft slechts één kant van deze vergelijking er een.
Wat elk teruggeeft naast het gewone transcript
De twee modellen pakken context op verschillende manieren aan, en dat is waar de functievergelijking interessant wordt. De pitch van GPT Transcribe is context-hinting: je kunt een vrije beschrijving van de opname meegeven, een lijst met trefwoorden en eigennamen, en een lijst met verwachte talen. OpenAI meldt dat op zijn Context-Aware ASR-benchmark de semantische nauwkeurigheid verbeterde van 41,6% zonder context naar 45,2% met context. Het retourneert ook de gedetecteerde taal. Wat het niet doet is sprekerdiarisatie of tijdstempels op woordniveau — OpenAI verwijst voor die functies naar afzonderlijke modellen — dus een transcript van een vergadering komt terug als één ongedifferentieerde muur van tekst, tenzij je de sprekerlaag zelf bouwt.
VibeVoice-ASR-Streaming-7B doet de tegenovergestelde gok. De modelkaart claimt streaming-uitvoer met sprekerstoewijzing — wie zei wat, gegenereerd zodra het chunk wordt verwerkt — plus aangepaste hotwords via een contextprompt (de CLI-vlag is --context_info). Dat is de functionaliteit die GPT Transcribe expliciet weglaat, en dat is de reden waarom de twee modellen niet uitwisselbaar zijn voor live-audio met meerdere sprekers. Het tegenwicht is verificatie: de ontbrekende functies van GPT Transcribe zijn een gedocumenteerde productbeslissing, terwijl de geclaimde sprekerstoewijzing van VibeVoice een verklaring op de modelkaart is die door geen enkele onafhankelijke test is bevestigd. Beide kanten verschillen ook ten aanzien van tijdstempels — noch de een noch de ander biedt tijdstempels op woordniveau op het vergeleken pad, hoewel het batchmodel van de VibeVoice-familie deze wel biedt.

Prijsvormen en de eigendomsvraag
De kostenstructuren kunnen nauwelijks meer van elkaar verschillen, en geen van beide is strikt beter. GPT Transcribe is een API met betalen per gebruik: $0,27 per audio-uur, geen infrastructuur, geen GPU, 25 MB per aanvraag, en de operationele garanties van OpenAI — de prijs van het niet zelf draaien van een spraakmodel. VibeVoice-ASR-Streaming-7B kost $0 voor de gewichten, maar ruwweg 18 GB aan bf16 vóór KV-cache; dat betekent een GPU uit de 24 GB-klasse, de microsoft/VibeVoice-democode of de vLLM-plugin, en je eigen monitoring en opschaling. De MIT-licentie is het verschil dat zich niet in een prijs per minuut laat vangen: de gewichten zijn van jou om te houden, te finetunen en te draaien op hardware die jij beheert, zonder meter per gebruiker en zonder 25 MB-plafond.
Taaldekking is het punt waar beide partijen vager zijn dan kopers zouden willen. VibeVoice-ASR-Streaming-7B vermeldt 10 talen in zijn modelkaart — Engels, Chinees, Spaans, Portugees, Duits, Japans, Koreaans, Frans, Russisch, Italiaans — tegenover de 50+ van de batch VibeVoice-ASR. OpenAI publiceert geen vergelijkbare geverifieerde talenlijst voor GPT Transcribe; het meldt sterke resultaten voor 22 Common Voice-talen in zijn lanceringsmateriaal, en de bij Earnings22 vastgestelde akoestische zwakke plek herinnert eraan dat 'ondersteund' en 'kan omgaan met ruisige audio in die taal' verschillende claims zijn. Als je een brede taaldekking nodig hebt, lost geen van beide lijsten het op — test je daadwerkelijke dialecten.

De kern van de zaak: kies per baan, niet per score.
Kies GPT Transcribe wanneer de audio een voltooid bestand is, wanneer je een gedocumenteerd nauwkeurigheidscijfer met bekende beperkingen wilt, of wanneer het niet zelf draaien van je eigen spraakinfrastructuur $0,27 per uur waard is — en combineer het alleen met GPT Live Transcribe als realtime levering de bijna 4× zo hoge prijs rechtvaardigt. Kies VibeVoice-ASR-Streaming-7B wanneer de taak live is en meerdere sprekers omvat, wanneer je wilt dat het transcript binnenkomt terwijl het gesprek nog gaande is, wanneer streaminguitvoer met sprekerattributie een functie is die je wilt evalueren, of wanneer open gewichten en controle over je gegevens belangrijker zijn dan een gemeten benchmark.
Een structurele opmerking voor teams die op een van beide voortbouwen: de transcriptielaag is niet iets dat OrcaRouter vandaag de dag routeert — geen van de spraak-naar-tekstmodellen op deze pagina staat in zijn catalogus, dus de ASR-keuze blijft volledig aan jullie. Wat routing jullie wel oplevert, is de laag boven het transcript. Een live-transcriptiefeed is pas nuttig als er iets op inspeelt — de samenvatter, de waarschuwingsregel, de planner van de voice-agent — en dat is de stack die OrcaRouter ontsluit met één API voor meer dan 200 modellen tegen de lijstprijzen van de providers, zonder opslag, plus automatische failover. Het patroon dat een onbewezen checkpoint als VibeVoice-ASR-Streaming-7B betaalbaar maakt om uit te proberen is precies dit: houd het endpoint dat jullie transcripten verwerkt verwisselbaar, en een model dat nog geen benchmark heeft kan jullie verkeer verdienen of verliezen op basis van het bewijs uit jullie eigen audio in plaats van op een claim bij de lancering.
