Titelkaart met de tekst 'Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate' en de ondertitel 'De een levert een getal, de ander levert een kaart'.
Guides & Insights

Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate: de een levert een getal, de ander levert een kaart

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De twee toonaangevende modellen voor realtime spraakvertaling zijn het er niet over eens waarop ze gemeten willen worden, en dat meningsverschil is nuttiger dan welke specificatievergelijking dan ook. Qwen3.8-LiveTranslate, uitgebracht op 19 september 2026, komt met één hard cijfer: een gemiddelde vertraging van 2,3 seconden, tegen 2,8 in de vorige generatie. Gemini 3.5 Live Translate, het speech-to-speechmodel van de leverancier dat in juni 2026 werd aangekondigd en nog steeds een preview-model-ID draagt, komt met bereik — meer dan 70 talen, automatische detectie, wisselen midden in een gesprek en integratie in de Translate- en Meet-apps van de leverancier. Het ene bedrijf publiceerde een latentiecijfer waarop het kan worden afgerekend. Het andere publiceerde een aantal talen. Als je tussen hen moet kiezen, is het belangrijker om te begrijpen waarom dat verschillende soorten beloften zijn dan welke lijst langer is.

Twee architecturen die het alleen over het doel eens zijn

Beide modellen bestaan om hetzelfde gedrag te elimineren: de beurtelingse vertaler die wacht tot je een zin hebt afgemaakt voordat hij iets zegt. Die pauze is wat machine-interpretatie als machine-interpretatie doet aanvoelen.

Qwen3.8-LiveTranslate bereikt dit met een Interleave-architectuur op een Hybride MoE-backbone, opgesplitst in een Thinker-module die audio, video, brontekst en vertaling samenvoegt tot één causale sequentie, en een Talker-module die de vertaling opnieuw synthetiseert in het timbre van de oorspronkelijke spreker. De bewering is dat het samenvouwen van herkenning, vertaling en synthese in één enkele sequentie de latentie en het semantische verlies wegneemt die een drietraps-pijplijn bij elke modulegrens betaalt.

Gemini 3.5 Live Translate neemt dezelfde end-to-endpositie in, maar dan vanuit de andere richting: het is gebouwd op Gemini 3 Pro als een native audio-naar-audiomodel, dat continu streamt via de Gemini Live API in plaats van een discrete ASR → MT → TTS-cascade uit te voeren. In de praktijk houd je een persistente bidirectionele WebSocket vast, stuur je audiochunks van 100 ms omhoog en haal je vertaalde audiochunks omlaag. Geen van beide modellen doet het oude. Beide doen nu het nieuwe. De verschillen zitten allemaal in de details van de tweede orde.

De latentievergelijking is niet het gelijkspel dat het lijkt.

Google beschrijft Gemini 3.5 Live Translate als een toepassing die "een paar seconden achter" de spreker blijft. Het heeft voor het model geen LAAL-cijfer gepubliceerd, of enige andere benoemde, reproduceerbare latentiemetriek. Qwen heeft 2,3 seconden gepubliceerd en gedefinieerd wat dat betekent.

Deze asymmetrie wordt steevast afgevlakt tot "beide liggen rond de twee tot drie seconden." Die lezing wordt door niets ondersteund wat een van beide bedrijven heeft gezegd. De formulering van Google is verenigbaar met 2 seconden en verenigbaar met 4; het bedrijf heeft simpelweg geweigerd zich te laten vastpinnen. De vergelijking die vandaag daadwerkelijk kan worden gemaakt, is:

Gepubliceerde latentiemetriek — Qwen3.8-LiveTranslate: LAAL 2,3 s, door de leverancier gerapporteerd. Gemini 3.5 Live Translate: geen gepubliceerd.

Onafhankelijke latentiemeting — geen van beide, voor geen van beide modellen. Geen enkele derde partij heeft een rechtstreekse vergelijking gepubliceerd.

De eerlijke conclusie is dat Qwen op het gebied van latentie een falsifieerbare bewering heeft gedaan en Google een vage. Dat is een punt in het voordeel van Qwen wat transparantie betreft, en precies nul punten in het voordeel van Qwen wat prestaties betreft, totdat iemand beide meet. Als latentie de beslissende factor is voor jouw implementatie, ondersteunt de huidige stand van het bewijs geen aankoopbeslissing in welke richting dan ook.

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: latency LAAL 2.3s, languages 60 source and 29 spoken, speaker ID real-time diarization, input audio plus image, status generally available, watermark none stated. Gemini 3.5 Live Translate column: latency not published, languages 70-plus supported, speaker ID weak turn-taking, input audio only, status preview, watermark SynthID on all audio. Footer reads 'Qwen figures vendor-reported; Gemini per Google docs. No independent head-to-head.'

60 talen tegenover 70-plus is het verkeerde scorebord.

De taaltellingen worden voortdurend geciteerd en ze misleiden in beide richtingen.

Qwen3.8-LiveTranslate herkent 60 brontalen en produceert gesproken output in 29 daarvan. Gemini 3.5 Live Translate ondersteunt meer dan 70 talen met automatische detectie, en in Google Meet breidt dat uit naar meer dan 2.000 taalcombinaties, waar het vorige maximum op het Engels gebaseerde vertaling naar vijf talen was.

Lees het tweede getal aandachtig voordat je het als een drievoudige overwinning beschouwt. Het cijfer van meer dan 2.000 van Google telt geordende paren — elke brontaal gekruist met elke doeltaal — wat een legitieme en oprecht nuttige maatstaf voor dekking is, maar niet vergelijkbaar met een telling voor één enkele taal. En de lijst van Google is weliswaar breder, maar sterk gericht op talen met grote sprekersaantallen: Afrikaans, Arabisch, Bengaals, Nederlands, Engels, Frans, Duits, Hindi, Indonesisch, Italiaans, Japans, Koreaans, Maleis, Perzisch, Pools, Portugees, Russisch, Spaans, Swahili, Tamil, Telugu, Thai, Turks, Oekraïens, Urdu, Vietnamees, Zoeloe. De 29 talen met gesproken uitvoer van Qwen zijn nog beperkter, en geen van beide leverancierslijsten is een serieus antwoord op de lange staart — de regionale dialecten en talen met weinig hulpbronnen waar vertaalhulpmiddelen van oudsher het moeilijkst tekortschieten. Beide bedrijven zeggen eraan te werken. Geen van beide heeft het geleverd.

Waar de twee daadwerkelijk uiteenlopen: de kamer vol mensen.

Het enige punt waarop de modellen werkelijk uiteenlopende beloftes doen, is het omgaan met meerdere sprekers, en dat is het verschil dat het vaakst bepalend zal zijn voor een echte implementatie.

Qwen3.8-LiveTranslate wordt geleverd met realtime sprekerdiarisatie: elke zin wordt aan een spreker toegewezen zodra die binnenkomt, en stemreplicatie wordt beschreven als stabiel bij beurtwisselingen. Qwen rapporteert zelf een diarisatiefoutpercentage van 9,7% op zijn eigen lange testset met meerdere sprekers, tegenover 30,6% voor Seed LiveInterpret 2.0 — een leveranciersvergelijking op een door de leverancier uitgevoerde evaluatie, dus beschouw het als een bewering met een cijfer eraan vast in plaats van als een resultaat. Het model levert ook brontekst en vertaling op dezelfde tijdlijn, en dat is wat gesynchroniseerde tweetalige ondertiteling mogelijk maakt zonder een aparte uitlijningsstap.

Gemini 3.5 Live Translate legt de tegenovergestelde nadruk. De gedocumenteerde sterkte is het behoud van prosodie — het behouden van de toonhoogte, het tempo, de intonatie en het emotionele register van de spreker, zodat de vertaalde stem het gevoel van het origineel overbrengt. De gedocumenteerde zwakke punten zijn precies waar diarisatie zou helpen: inconsistente stemkloning die na lange pauzes kan afdrijven of op het verkeerde geslacht kan uitkomen, zwakke beurtwisseling zonder duidelijk signaal voor het einde van een zin, moeite met sterke accenten en met nauw verwante talenparen zoals Spaans en Portugees, en een onvolmaakte omgang met achtergrondgeluid. Google beperkt pure audiosessies bovendien tot 15 minuten, tenzij verlengd, en voorziet elke gegenereerde audiostream van een SynthID-watermerk dat momenteel niet kan worden verwijderd.

Toewijzing aan meerdere sprekers — Qwen: realtime diarisatie, naar verluidt 9,7% DER. Gemini: gedocumenteerd zwakke beurtwisseling, geen claim over diarisatie.

Stemgetrouwheid — Qwen: reproductie van het brontimbre via de Talker-module. Gemini: behoud van prosodie, toonhoogte en tempo; gedocumenteerde kloondrift.

Tweetalige uitvoer — Qwen: bron en vertaling worden op dezelfde tijdlijn weergegeven. Gemini: optionele transcriptie van invoer en uitvoer, per sessie geconfigureerd.

Watermerken — Qwen: niets vermeld. Gemini: SynthID op alle gegenereerde audio, geen verwijderingspad.

Sessieduur — Qwen: niet vermeld. Gemini: limiet van 15 minuten voor pure audiosessies.

Invoertypen — Qwen: audio en afbeelding. Gemini: alleen audio, geen tekstinvoer.

Screenshot of Google's own Gemini Live API documentation for live translation, showing the speech-to-speech streaming setup, the supported-language list, and the documented session constraints for the preview model.

Wat het daadwerkelijk kost om elk ervan te laten draaien

Qwen3.8-LiveTranslate wordt per miljoen tokens geprijsd via de WebSocket Realtime API. In de regio Singapore: $7,50 audio-invoer, $0,55 afbeeldingsinvoer, $20,00 tekstuitvoer, $30,00 audiouitvoer. In Peking: ¥40 / ¥3,3 / ¥100 / ¥160 per miljoen — ongeveer $5,65 / $0,47 / $14,13 / $22,61. De context bedraagt 53.248 tokens en de snelheidslimiet is 10 verzoeken per minuut en 100.000 tokens per minuut in beide regio's.

Dat plafond van 10 RPM is het meest ingrijpende getal op de tariefkaart. De commerciële voorwaarden van Gemini 3.5 Live Translate worden niet op dezelfde manier gepubliceerd, wat op zichzelf een signaal is over de volwassenheid: Google distribueert het via de Live API en AI Studio in openbare preview, Google Meet in een privépreview voor geselecteerde Workspace-klanten, en de Translate-app op Android en iOS. Preview-prijzen en preview-snelheidslimieten kunnen zonder kennisgeving worden gewijzigd, en Google heeft zich niet vastgelegd op een GA-datum.

Dus de kostenvergelijking gaat op dit moment tussen een model met een gepubliceerde prijs en een harde limiet op gelijktijdigheid, en een model zonder gepubliceerde prijs en met een niet-gespecificeerd plafond. Als je dit kwartaal unit economics wilt modelleren, is slechts één van beide budgetteerbaar.

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint and the published per-million-token pricing for audio input, image input, text output and audio output.

Wat een onafhankelijke test zou moeten aantonen

Alles hierboven is gebaseerd op de eigen aankondigingen van de twee leveranciers, omdat niemand deze modellen tegen elkaar heeft laten draaien. Een resultaat dat deze vergelijking daadwerkelijk zou beslechten, vereist vier dingen, en geen daarvan bestaat vooralsnog:

• LAAL is op beide modellen op dezelfde manier gemeten, met dezelfde audio, in dezelfde taalparen — Qwens 2,3 s-waarde kan niet worden vergeleken met iets wat Google heeft geweigerd te vermelden.

• Diarisatiefoutpercentage op een gedeeld corpus met meerdere sprekers, niet op Qwens eigen Omnilingua-MSpeaker-set.

• Stabiliteit van stemklonen tijdens lange sessies, wat precies het punt is waar Gemini's eigen documentatie drift signaleert en Qwen zijn sterkste claim maakt.

• Gedrag bij de gelijktijdigheidslimieten — of Qwen's 10 RPM standhoudt onder echte vergaderbelasting en of Gemini's previewquota het contact met productie overleven.

Zolang die test niet bestaat, is de verdedigbare positie beperkt: Qwen heeft meer gepubliceerd en specifiekere dingen beloofd; Google heeft bredere taaldekking en een distributievoetafdruk die geen enkel model dat uitsluitend via een API beschikbaar is, kan evenaren.

Welke moet je kiezen?

Richt je op de vorm van je probleem, niet op het scorebord, want het scorebord is nog niet betrouwbaar.

Als je workload meerdere partijen omvat en attributie belangrijk is — vergadertranscriptie, een panel, een rechtszaal, alles waarbij weten wie een vertaalde zin heeft gezegd deel uitmaakt van de waarde — dan is Qwen3.8-LiveTranslate de enige van de twee die deze capaciteit claimt, en Gemini's gedocumenteerde zwakte bij beurtwisseling wijst dezelfde kant op. Als je workload draait om brede taalondersteuning, op consumenten is gericht en al binnen het ecosysteem van Google valt, dan zijn de meer dan 70 talen van Gemini 3.5 Live Translate en de aanwezigheid ervan in de Translate-app en Meet voordelen die geen enkele API-only concurrent op het gebied van distributie kan evenaren.

Als je een product bouwt in plaats van een demo koopt, let dan op het feit dat beide smalle specialisten zijn. Geen van beide draait een agent-loop, geen van beide vat samen, en Qwen3.8-LiveTranslate ondersteunt expliciet geen function calling, geen gestructureerde output, geen context-caching en geen fine-tuning. De tolk vormt de voorkant van je pipeline, niet het geheel ervan. OrcaRouter is vandaag niet de plek om een van beide vertaalmodellen aan te roepen — geen van beide staat in onze catalogus, en dat zeggen we liever dan iets anders te suggereren. Wat wij wel bieden is de helft van de stack die het transcript consumeert: één sleutel voor meer dan 200 modellen tegen de listprijs van de provider, met nul doorgerekende markup, zodat de samenvatter, de glossary-handhaver of de downstream-agent die dat transcript leest kan worden omgewisseld of overgenomen door een fallback zonder dat je een tweede leverancierscontract hoeft aan te raken.

De onderkant ervan

Qwen3.8-LiveTranslate en Gemini 3.5 Live Translate liggen op de fundamentele punten zo dicht bij elkaar dat de marketing het onderscheidende element is geworden: de een publiceerde een latentiecijfer en een tariefkaart, de ander een taalkaart en een ecosysteem. Geen van beide heeft zich aan een onafhankelijke test onderworpen. De versie van deze confrontatie die het lezen waard is, is degene die wordt geschreven nadat iemand beide op dezelfde audio heeft laten draaien — en gezien hoe snel deze categorie beweegt, is dat misschien niet ver weg meer.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt