Titelkaart met de tekst 'Qwen3.8-LiveTranslate vs Qwen 3.8' en de ondertitel 'Een naamsbotsing, geen eerlijke strijd'.
Guides & Insights

Qwen3.8-LiveTranslate vs Qwen 3.8: een naamconflict, geen eerlijke strijd

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zoek naar een van deze modellen en je krijgt het andere te zien. Qwen3.8-LiveTranslate, uitgebracht op 19 september 2026, en Qwen3.8-Max — het model dat de meeste mensen bedoelen wanneer ze "Qwen 3.8" zonder suffix schrijven, algemeen beschikbaar sinds 3 augustus 2026 en vernieuwd als Qwen3.8-Max-0902 op 2 september — delen een generatieprefix en vrijwel niets anders. De ene is een systeem voor simultaanvertaling dat audio inneemt en vertaalde audio en tekst teruggeeft, gefactureerd via een WebSocket onder de ID qwen3.8-livetranslate-flash-realtime. De andere is een generalist met 2,4 biljoen parameters, een sparse mixture-of-experts, met een contextvenster van 1M tokens, die helemaal niets kan horen. Ze tegenover elkaar zetten is een categoriefout, en het feit dat zoveel mensen bij die fout uitkomen is het werkelijke verhaal hier: de leverancier levert nu minstens vier verschillende dingen onder de naam Qwen 3.8, en het naamgevingsschema vertelt je niet welke je wilt.

Wat elk daadwerkelijk is

De Qwen 3.8-generatie werd in de tweede helft van 2026 in lagen uitgebracht, en die lagen zijn niet uitwisselbaar.

Qwen3.8-Max is het gehoste vlaggenschip: een sparse MoE-model met ruwweg 2,4 biljoen totale parameters en ongeveer 95 miljard actieve per forward pass, een context van 1 miljoen tokens, en tekst-, beeld- en video-invoer met tekstuele uitvoer. De prijs bedraagt $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens, met cache-reads tegen $0,250 per miljoen. Door de leverancier gerapporteerde scores plaatsen het op 86,6 op Terminal-Bench 2.1, 92,6 op GPQA Diamond, 67,7 op SWE-bench Pro en 43,6 op Humanity's Last Exam.

Qwen3.8-2.4T-A95B is de open-weight release van dezelfde generatie, gepubliceerd op 12 augustus 2026: 512 gerouteerde experts over 92 lagen, waarvan 69 lagen lineaire attention gebruiken, en ongeveer 4,89 TB aan gewichten. Het is het model dat de meeste mensen bedoelen met "Qwen 3.8" wanneer ze het hebben over zelf iets draaien in plaats van een API aan te roepen.

Qwen3.8-27B is de kleine open checkpoint in dezelfde familie, en Qwen3.8-LiveTranslate is de specialist — een tolk met Interleave-architectuur, gebouwd op een hybride MoE Thinker–Talker-ontwerp, met 60 herkende brontalen en 29 beschikbaar voor gesproken output.

De as die hen scheidt is niet grootte. Het is modaliteit. Qwen3.8-Max heeft geen audiotoevoerpad en helemaal geen audio-uitvoer. Aan het model vragen om een livegesprek te interpreteren is geen kwestie van het beter prompten; dat vermogen zit niet in het model.

Het specificatiecontrast

Naast elkaar gelegd, overlappen de twee modellen nauwelijks op enige dimensie die een koper iets kan schelen:

Primaire taak — Qwen3.8-LiveTranslate: gelijktijdige spraak-naar-spraakinterpretatie. Qwen3.8-Max: algemeen redeneren, coderen, agentisch en multimodaal tekstwerk.

Invoermodaliteit — Qwen3.8-LiveTranslate: audio en afbeelding. Qwen3.8-Max: tekst, afbeelding en video.

Uitvoermodaliteit — Qwen3.8-LiveTranslate: tekst en gesynthetiseerde audio. Qwen3.8-Max: alleen tekst.

Contextvenster — Qwen3.8-LiveTranslate: 53,248 tokens (49,152 in / 4,096 uit). Qwen3.8-Max: 1,000,000 tokens.

Gewichten — Qwen3.8-LiveTranslate: gesloten, alleen via API. Qwen3.8-Max: gehost, met het open zustermodel Qwen3.8-2.4T-A95B dat onder dezelfde generatie is gepubliceerd.

Snelheidslimieten — Qwen3.8-LiveTranslate: 10 verzoeken en 100.000 tokens per minuut. Qwen3.8-Max: standaard gehoste doorvoer, geen realtime limiet per verzoek.

Het verschil in context is wat mensen verrast. Qwen3.8-Max bevat een miljoen tokens; de interpreter heeft ongeveer vijf procent daarvan. Maar een realtime-interpreter heeft geen lange context nodig — hij heeft een kort geheugen nodig, en een heel snel geheugen. De bovengrens van 49.152 tokens voor invoer is afgestemd op het meedragen van de laatste paar minuten van een gesprek om namen en terminologie consistent te houden, wat precies de taak is die "long-context disambiguation" doet. De interpreter beoordelen op zijn contextgetal is als een racemotor beoordelen op zijn brandstoftank.

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: primary job live interpretation, input audio plus image, output text plus audio, context 53,248 tokens, weights closed and API-only, audio in and out $7.50 and $30.00. Qwen3.8-Max column: primary job general reasoning, input text plus image plus video, output text only, context 1,000,000 tokens, weights hosted with the open sibling 2.4T-A95B, text in and out $2.00 and $6.00. Footer reads 'LiveTranslate per Alibaba Cloud; Qwen3.8-Max per OrcaRouter. Neither independently audited.'

Waarom de prijsvergelijking een valstrik is

Op per-miljoen-tokenbasis lijkt de tolk dramatisch duurder dan het vlaggenschip: $7,50 per miljoen audio-invoertokens tegen $2,00 per miljoen tekst-invoertokens, en $30,00 per miljoen audio-uitvoer tegen $6,00 per miljoen tekst-uitvoer.

Die vergelijking is zinloos, en het is de meest voorkomende fout die over deze klasse modellen wordt gemaakt. Audio- en teksttokens zijn niet dezelfde eenheid. Spraak wordt gecodeerd naar audiotokens met een dichtheid die geen enkele relatie heeft met dezelfde inhoud wanneer die wordt uitgeschreven — een minuut gesprek verbruikt enorm veel meer audiotokens dan het transcript ervan aan teksttokens verbruikt, en de uitvoeraudio voegt daar nog een tweede stroom bovenop toe. Het naast elkaar weergeven van de twee snelheden impliceert een kostenverhouding die in de praktijk niet bestaat.

Het structurele verschil is belangrijker dan het prijsverschil. Qwen factureert de interpreter per token, terwijl een groot deel van de realtime-spraakmarkt per minuut van een sessie factureert. Die twee prijsmodellen gedragen zich volledig anders naarmate je audio stiller wordt, je sessies korter worden of je sprekers pauzeren — een meter per minuut rekent voor stilte, en een meter per token niet. Als je een kostenmodel bouwt, is de vraag niet welk tarief lager is; het is welke meter de vorm van jouw gebruik bestraft. En let op de regioopsplitsing: de prijzen in Peking bedragen ¥40 / ¥3,3 / ¥100 / ¥160 per miljoen voor respectievelijk audio-invoer, afbeeldingsinvoer, tekstuitvoer en audio-uitvoer, aanzienlijk onder de tarieven in Singapore, en dat is precies het soort verschil dat pas zichtbaar wordt wanneer je de twee regel voor regel vergelijkt.

Nog een punt in het voordeel van de tolk qua kosten: Qwen hield deze tarieven nagenoeg onveranderd ten opzichte van Qwen3.5-LiveTranslate, met Beijing ongewijzigd en Singapore iets goedkoper. Een nieuwe generatie die zonder prijsverhoging verschijnt, is niet de norm in deze markt.

Open gewichten versus alleen API is de echte scheidslijn

Als je tussen deze twee kiest op principiële gronden in plaats van op basis van capaciteiten, is licentieverlening de beslissende factor.

Qwen3.8-Max is beschikbaar als gehoste oplossing, en de Max-klasse-gewichten van deze generatie zijn in augustus open-source gemaakt als Qwen3.8-2.4T-A95B. Dat pad bestaat, maar het is geen vrijblijvende optie: 4,89 TB aan gewichten is datacenterhardware, en de open-weight-licentie vereist dat organisaties die in een periode van twaalf maanden meer dan $50 miljoen verdienen, een commerciële licentie van Alibaba Cloud verkrijgen.

Qwen3.8-LiveTranslate heeft zo'n pad niet. Het is closed-weight en uitsluitend via API beschikbaar, bereikbaar via een WebSocket Realtime API die vereist dat target_languagewordt ingesteld in een session.update-event voordat er ook maar enige audio wordt verplaatst, en die geen functieaanroepen, geen gestructureerde uitvoer, geen contextcaching, geen batchinferentie en geen fine-tuning ondersteunt. Als het uw vereiste is om de interpreter op uw eigen hardware te draaien, dan voldoet dit model daar niet aan en geen enkele hoeveelheid engineering zal dat veranderen.

Dat is belangrijk voor een specifiek soort koper: degene die audio niet naar een derde partij kan sturen — een ziekenhuis, een advocatenkantoor, een overheidscontractant. Voor alle anderen is de praktische vraag of de tolk goed genoeg is om de afhankelijkheid te rechtvaardigen, en het antwoord daarop is een meting die Qwen nog niemand heeft toegestaan te verrichten.

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint, the required target_language session parameter, and the published per-million-token rates.

Kiezen op functie, niet op naam

Het juiste antwoord op "Qwen3.8-LiveTranslate of Qwen 3.8" is dat je waarschijnlijk het antwoord op een andere vraag nodig hebt.

• Als de taak live-interpretatie is — een vergadering, een gesprek, een uitzending — kan slechts één van deze dat doen, en dat is niet het vlaggenschip.

• Als de taak is samenvatten wat er is gezegd, actiepunten eruit halen, vragen over het transcript beantwoorden of de follow-up schrijven — dan kan alleen het vlaggenschip dat, en dat is de interpreter niet.

• Als de taak beide is, bouw je een pijplijn, en betaal je twee leveranciers met twee contracten en twee sets inloggegevens, tenzij je bewust consolideert.

Dat derde geval is het gebruikelijke geval, en daar houdt het draaien van beide helften achter één enkel endpoint op een gemak te zijn en begint het architectuur te worden. Qwen3.8-Max staat op OrcaRouter tegen de lijstprijs van de provider van $2,00 per miljoen input en $6,00 per miljoen output met nul opslag doorgegeven, zodat een prijsverlaging van Qwen uw factuur dezelfde dag bereikt in plaats van bij de volgende contractverlenging, en automatische failover betekent dat de samenvattingshelft van de pijplijn niet wegvalt wanneer één provider een slecht uur heeft.

Om expliciet te zijn over de andere helft, omdat het onderscheid ertoe doet: Qwen3.8-LiveTranslate staat niet in onze catalogus. Het is beschikbaar via de eigen Model Studio API van Alibaba en het proef-endpoint van de leverancier op omni.qwen.ai/live-translate, en we gaan niet suggereren dat we een model routeren dat we niet routeren. Wat je vandaag achter één sleutel kunt zetten, is de downstream-stack — de modellen die consumeren wat de interpreter produceert.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

Het naamgevingsprobleem is de eigenlijke bevinding.

Vier modellen, één prefix, geen suffixconventie waarop een lezer kan vertrouwen. "Qwen 3.8" verwijst naar het gehoste vlaggenschip, de open 2,4T-checkpoint, het kleine 27B-model, of de interpreter, afhankelijk van wie typt en wat diegene het laatst heeft gelezen. De gepubliceerde benchmarktabellen helpen niet, omdat het vlaggenschip ze heeft en de interpreter ze grotendeels niet heeft: Qwen3.8-Max kan op Terminal-Bench of GPQA Diamond worden geplaatst, terwijl het bewijs voor Qwen3.8-LiveTranslate bestaat uit een gemiddelde vertraging van 2,3 seconden, een door de leverancier gerapporteerde 85,7 xCOMET-XXL op FLEURS, en een zelfgerapporteerd diarisatiefoutpercentage van 9,7% zonder onafhankelijke replicatie.

De vergelijking die deze pagina wil beantwoorden, is eigenlijk een waarschuwing. Voordat je Qwen 3.8 met iets vergelijkt, moet je vaststellen welke Qwen 3.8 je bedoelt. Als het audio als invoer neemt, is het de interpreter, en het is een specialist die je voor één taak koopt. Als het video als invoer neemt, is het het vlaggenschip, en het is een generalist die je voor de andere twintig koopt. Elke evaluatie die ze door elkaar haalt, levert een conclusie op die over geen van beide gaat.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt