
Maak kennis met Qwen3.8-LiveTranslate: de halve seconde die AI-interpretatie op menselijk tempo brengt
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-LiveTranslate is op 19 september 2026 uitgebracht, en de hele aankondiging komt neer op één aftrekking. Gemiddelde lagging — LAAL, de gemiddelde afwijking tussen het moment waarop een woord de mond van een spreker verlaat en de vertaling ervan het oor van de luisteraar bereikt — daalt van 2,8 seconden in de vorige generatie naar 2,3 seconden. Professionele menselijke tolken werken met een oor-tot-stem-spanne van ongeveer 2 tot 3 seconden. Dat is het hele verhaal: niet dat een machine sneller is geworden, maar dat de vertraging nu binnen de bandbreedte ligt waarin luisteraars een machine helemaal niet meer opmerken. De cijfers bij de lancering stellen de FLEURS-vertaalkwaliteit van de vorige generatie op 83,0 xCOMET-XXL; voor deze wordt 85,7 geclaimd. Beide cijfers zijn van de leverancier, geproduceerd met de eigen evaluatieopzet van de leverancier, en geen enkele onafhankelijke partij heeft ze nog gereproduceerd — wat de allerbelangrijkste kanttekening in dit artikel is.
Wat deze release de moeite waard maakt om verder te lezen dan de kop, is het mechanisme. Qwen verlaagde de latentie niet door een snellere herkenner of een slankere synthesizer te maken. Het verwijderde de naden ertussen.
Wat er echt is veranderd: de naden zijn verdwenen
Klassieke simultaanvertolking is een pijplijn in drie fasen die al een decennium op dezelfde manier in elkaar wordt gezet: automatische spraakherkenning transcribeert de stream, machinevertaling zet het transcript om, en tekst-naar-spraak leest het resultaat hardop voor. Elke fase is een apart model met een eigen latentiebudget, en bij elke overdracht gaat iets verloren — prosodie bij de eerste, sprekeridentiteit bij de derde, en een vaste paar honderd milliseconden bij elke grens waar een module moet wachten tot er genoeg tokens zijn om zeker te zijn.
Qwen3.8-LiveTranslate vervangt die cascade door wat de leverancier een Interleave-architectuur noemt, gebouwd op een Hybrid MoE-backbone, opgesplitst in twee samenwerkende modules:
• Thinker — schikt video, audio, brontekst en vertaling in één enkele causale reeks, afgewisseld in tijdsvolgorde, en levert begrip plus vertaling end-to-end op in één enkele doorgang in plaats van in drie.
• Talker — neemt de vertaalde tekst samen met de originele audio en synthetiseert spraak die het timbre van de oorspronkelijke spreker behoudt, zodat de nagesynchroniseerde stem herkenbaar is als die van de persoon die heeft gesproken.
De architectonische bewering is dat omdat herkenning, vertaling en synthese één kader voor sequentiemodellering delen in plaats van berichten over modulegrenzen heen door te geven, het systeem stopt met het tweemaal per uiting betalen van de intermodulaire belasting. Dat is een plausibele verklaring voor waar de 0,5 seconden vandaan kwamen, en het is ook precies het soort bewering dat goedkoop is om te doen en duur om te verifiëren. Behandel het als de uitleg van de leverancier, niet als een vaststaand resultaat.
De drie capaciteiten die werkelijk nieuw zijn
Taaldekking is niet veranderd: 60 brontalen worden herkend, 29 zijn beschikbaar voor gesproken uitvoer — dezelfde aantallen als bij Qwen3.5-LiveTranslate. De interessante toevoegingen gaan allemaal over wat er gebeurt wanneer meer dan één persoon praat.
• Realtime sprekerdiarisatie — elke zin wordt aan een spreker toegewezen op het moment dat ze wordt uitgesproken, en de replicatie van stemtimbre wordt beschreven als stabieler bij beurtwisselingen. Qwen meldt zelf een diarisatiefoutpercentage van 9,7% op zijn eigen lange testset met meerdere sprekers, tegenover 30,6% voor Seed LiveInterpret 2.0. Beide cijfers zijn afkomstig van Qwen.
• Bron en vertaling in hetzelfde frame — het model genereert het originele transcript en de vertaalde tekst op één tijdlijn, wat een tweetalig ondertitelpaar op het scherm mogelijk maakt zonder een tweede uitlijningsronde.
• Disambiguatie over lange context — eerdere context wordt meegenomen, zodat namen, aanspreekvormen en domeintermen consistent blijven. Dit is in de praktijk het belangrijkste: de klassieke fout bij simultaanvertolking is niet een verkeerd woord, maar dat dezelfde persoon op drie verschillende manieren wordt weergegeven in één vergadering.
Diarisatie is hier het echt onderscheidende element. Gemini 3.5 Live Translate, Google's concurrerende realtime spraak-naar-spraakmodel, heeft aantoonbaar moeite met beurtwisseling — het kan worstelen om te weten wanneer een spreker daadwerkelijk is gestopt. Qwen claimt de tegenovergestelde eigenschap als een functie. Geen van beide bedrijven heeft een rechtstreekse vergelijking gepubliceerd die uitsluitsel zou geven.

Benchmarkclaims eerlijk lezen
Qwen is getest op twee sets, en het is de moeite waard ze te scheiden, omdat ze verschillende dingen meten.
• FLEURS, 70 taalrichtingen — de publieke, veelgebruikte meertalige audiobenchmark. Qwen claimt de leiding over zowel zijn voorganger als over wat het de huidige mainstream realtime-tolksystemen noemt, op het gebied van vertaalkwaliteit, gemiddelde vertraging, nauwkeurigheid van spraakherkenning en kwaliteit van spraaksynthese. De vergelijking 85,7 tegen 83,0 xCOMET-XXL staat hier.
• Omnilingua-MSpeaker, 14 taalrichtingen — Qwens eigen evaluatieset voor lange audio met meerdere sprekers. Het bedrijf beweert betere getrouwheid, vloeiendheid en beknoptheid, plus een lagere diarisatiefout. Een benchmark die door de leverancier is gebouwd, is niet waardeloos, maar is ook geen bewijs: hij is ontworpen door de mensen wier model erop wordt beoordeeld.
De eerlijke samenvatting is dat FLEURS echt en openbaar is, dus de 85,7 is ten minste in principe controleerbaar; Omnilingua-MSpeaker is dat niet, dus de diarisatiewinst is een bewering totdat iemand het opnieuw uitvoert. Geen enkele derde partij heeft op het moment van schrijven Qwen3.8-LiveTranslate-cijfers gepubliceerd, en het model is nog maar een paar uur oud.
Wat de API kost, en één getal dat je zal bijten
Qwen3.8-LiveTranslate heeft gesloten gewichten en is alleen via API beschikbaar. Het draait via een WebSocket Realtime API onder de model-ID qwen3.8-livetranslate-flash-realtime, niet via een gewoon HTTP-endpoint. De prijs wordt per miljoen tokens gerekend, en omdat audiotokens een hoge dichtheid hebben, lijken de gepubliceerde tarieven verbazingwekkend naast die van tekstmodellen, totdat je je herinnert wat een audiotoken is:
• Regio Singapore — audio-invoer $7,50, afbeeldingsinvoer $0,55, tekstuitvoer $20,00, audio-uitvoer $30,00 per miljoen tokens.
• Beijing-regio — ¥40 audio-invoer, ¥3,3 beeldinvoer, ¥100 tekstuitvoer, ¥160 audio-uitvoer per miljoen tokens, wat tegen de huidige koersen neerkomt op ongeveer $5,65 / $0,47 / $14,13 / $22,61.
• Context — 53.248 tokens in totaal, opgesplitst in 49.152 maximale invoer en 4.096 maximale uitvoer.
• Snelheidslimieten — 10 verzoeken per minuut en 100.000 tokens per minuut, identiek in beide regio's.
Die snelheidslimiet is het getal dat onderstreept moet worden. Tien verzoeken per minuut is royaal voor een handvol vergaderruimtes en lang niet genoeg voor een contactcenter-implementatie of een live-uitzending met duizenden gelijktijdige streams. Qwen heeft de interface vrijwel tegen dezelfde prijs gehouden als de vorige generatie — de tarieven in Peking zijn ongewijzigd en Singapore is marginaal goedkoper — maar een model dat architectonisch klaar is voor opschaling wordt ingericht als een preview. Iedereen die productieverkeer plant, moet het plafond van 10 RPM als de bindende beperking beschouwen, niet de prijs per token.

Het aanroepen ervan is niet hetzelfde als het aanroepen van een chatmodel.
De Realtime API is event-driven, wat een ander mentaal model is dan een completion-endpoint. Je opent een socket, ontvangt session.created, en stuurt vervolgens een session.update event om de sessie te configureren voordat er audio in het spel is.
• target_language is vereist en moet worden ingesteld vóór de eerste audiochunk — er is geen impliciet standaarddoel.
• source_language is optioneel en wordt standaard automatisch gedetecteerd.
• output_modalities selecteert ["text"] voor alleen transcript of ["text","audio"] voor vertaalde spraak.
• input_audio_buffer.appendvervoert base64-gecodeerde PCM-chunks omhoog; response.text.delta en response.audio.delta komen terug omlaag, waarbij response.done het einde van een beurt markeert.
Twee praktische opmerkingen. Ten eerste kan een browser geen Authorization-header instellen bij een WebSocket-handshake, dus de verbinding moet aan de serverzijde worden geopend en de audio via je eigen socket naar de client worden doorgestuurd — dit is niet iets dat je rechtstreeks in een front-end aansluit. Ten tweede waarschuwt Qwen expliciet dat de set van parameters en gebeurtenissen verschilt van de vorige generatie LiveTranslate, dus elke code die voor Qwen3.5-LiveTranslate is geschreven, moet opnieuw worden gecontroleerd in plaats van alleen opnieuw te worden gericht. Er draait een gratis proef-endpoint op omni.qwen.ai/live-translate als je de vertraging wilt horen voordat je engineeringtijd investeert.
Wat het bewust niet doet
Qwen noemt een reeks mogelijkheden als niet beschikbaar, en de lijst is verhelderend. Geen functieaanroepen. Geen gestructureerde uitvoer. Geen webzoekopdracht. Geen prefixvoortzetting, contextcaching of batch-inferentie. Geen fine-tuning.
Dit is een specialist, geen generalist met de pet van een tolk op. Het draait je agent-loop niet, en het is niet het model dat de vergadering samenvat. Ontwerp daarom dienovereenkomstig: de tolk produceert een transcript en een vertaalde audiostream, en alles wat daarop volgt — de actiepuntenextractor, de woordenlijsthandhaver, de CRM-writeback — is het werk van een apart tekstmodel.
Die scheiding is waar een router zijn bestaansrecht verdient. Qwen3.8-LiveTranslate zelf is beschikbaar via de eigen API van de leverancier en verschillende platforms van derden; het staat vandaag niet in de catalogus van OrcaRouter, en we gaan niet doen alsof dat wel zo is. Wat OrcaRouter wél heeft, is de omliggende stack — inclusief Alibaba's eigen Qwen3.8-Max-vlaggenschipmodel, een sparse mixture-of-experts-model met 2,4 biljoen parameters en een context van 1M tokens tegen $2,00 per miljoen input en $6,00 per miljoen output, gefactureerd tegen de lijstprijs van de aanbieder, zonder enige doorgerekende markup. Het achter één endpoint en één sleutel houden van de interpreter en de modellen die zijn output consumeren, betekent dat de transcriptpijplijn geen tweede contract nodig heeft wanneer je de samenvatter vervangt, en automatische failover houdt de downstreamhelft van het systeem in leven wanneer één aanbieder hapert — wat, bij 10 verzoeken per minuut, een scenario is waarop je beter kunt anticiperen dan het te ontdekken.

Wat nu te kijken
Twee dingen zouden deze release veranderen van een goed beargumenteerde bewering in een vaststaand feit. Het eerste is een onafhankelijke latentiemeting: LAAL is een goed gedefinieerde metriek, en iedereen met het trial-endpoint en een stopwatchopstelling kan een getal produceren dat Qwen niet zelf heeft opgesteld. Het tweede is Qwens eigen aangekondigde roadmap — dichter naar de latentieondergrens toe werken, langetermijngeheugen over sessies heen, en dekking van long-tailtalen en regionale dialecten. Het long-tailpunt is het punt waaraan we hen moeten houden, want 60 brontalen is een respectabel aantal dat stilletjes de meeste sprekers ter wereld uitsluit, en de kloof tussen een demo die werkt in Mandarijn en Engels en een die werkt in Yoruba of Quechua is waar realtime-interpretatieproducten historisch gezien zijn blijven steken.
Voorlopig is de redelijke positie dat Qwen3.8-LiveTranslate het eerste simultaanvertolkingsmodel is waarvan het belangrijkste cijfer wordt afgezet tegen menselijke tolken in plaats van tegen zijn eigen voorganger — en die framing is een veel moeilijkere test om te halen dan de test die ze vervangt. Het heeft die test nog niet gehaald. Het heeft zich er alleen vrijwillig voor gemeld.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
