
Qwen3.8-LiveTranslate vs Qwen 3.8: een naamconflict, geen eerlijke strijd
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zoek naar een van deze modellen en je krijgt het andere te zien. Qwen3.8-LiveTranslate, uitgebracht op 19 september 2026, en Qwen3.8-Max — het model dat de meeste mensen bedoelen wanneer ze "Qwen 3.8" zonder suffix schrijven, algemeen beschikbaar sinds 3 augustus 2026 en vernieuwd als Qwen3.8-Max-0902 op 2 september — delen een generatieprefix en vrijwel niets anders. De ene is een systeem voor simultaanvertaling dat audio inneemt en vertaalde audio en tekst teruggeeft, gefactureerd via een WebSocket onder de ID qwen3.8-livetranslate-flash-realtime. De andere is een generalist met 2,4 biljoen parameters, een sparse mixture-of-experts, met een contextvenster van 1M tokens, die helemaal niets kan horen. Ze tegenover elkaar zetten is een categoriefout, en het feit dat zoveel mensen bij die fout uitkomen is het werkelijke verhaal hier: de leverancier levert nu minstens vier verschillende dingen onder de naam Qwen 3.8, en het naamgevingsschema vertelt je niet welke je wilt.
Wat elk daadwerkelijk is
De Qwen 3.8-generatie werd in de tweede helft van 2026 in lagen uitgebracht, en die lagen zijn niet uitwisselbaar.
Qwen3.8-Max is het gehoste vlaggenschip: een sparse MoE-model met ruwweg 2,4 biljoen totale parameters en ongeveer 95 miljard actieve per forward pass, een context van 1 miljoen tokens, en tekst-, beeld- en video-invoer met tekstuele uitvoer. De prijs bedraagt $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens, met cache-reads tegen $0,250 per miljoen. Door de leverancier gerapporteerde scores plaatsen het op 86,6 op Terminal-Bench 2.1, 92,6 op GPQA Diamond, 67,7 op SWE-bench Pro en 43,6 op Humanity's Last Exam.
Qwen3.8-2.4T-A95B is de open-weight release van dezelfde generatie, gepubliceerd op 12 augustus 2026: 512 gerouteerde experts over 92 lagen, waarvan 69 lagen lineaire attention gebruiken, en ongeveer 4,89 TB aan gewichten. Het is het model dat de meeste mensen bedoelen met "Qwen 3.8" wanneer ze het hebben over zelf iets draaien in plaats van een API aan te roepen.
Qwen3.8-27B is de kleine open checkpoint in dezelfde familie, en Qwen3.8-LiveTranslate is de specialist — een tolk met Interleave-architectuur, gebouwd op een hybride MoE Thinker–Talker-ontwerp, met 60 herkende brontalen en 29 beschikbaar voor gesproken output.
De as die hen scheidt is niet grootte. Het is modaliteit. Qwen3.8-Max heeft geen audiotoevoerpad en helemaal geen audio-uitvoer. Aan het model vragen om een livegesprek te interpreteren is geen kwestie van het beter prompten; dat vermogen zit niet in het model.
Het specificatiecontrast
Naast elkaar gelegd, overlappen de twee modellen nauwelijks op enige dimensie die een koper iets kan schelen:
• Primaire taak — Qwen3.8-LiveTranslate: gelijktijdige spraak-naar-spraakinterpretatie. Qwen3.8-Max: algemeen redeneren, coderen, agentisch en multimodaal tekstwerk.
• Invoermodaliteit — Qwen3.8-LiveTranslate: audio en afbeelding. Qwen3.8-Max: tekst, afbeelding en video.
• Uitvoermodaliteit — Qwen3.8-LiveTranslate: tekst en gesynthetiseerde audio. Qwen3.8-Max: alleen tekst.
• Contextvenster — Qwen3.8-LiveTranslate: 53,248 tokens (49,152 in / 4,096 uit). Qwen3.8-Max: 1,000,000 tokens.
• Gewichten — Qwen3.8-LiveTranslate: gesloten, alleen via API. Qwen3.8-Max: gehost, met het open zustermodel Qwen3.8-2.4T-A95B dat onder dezelfde generatie is gepubliceerd.
• Snelheidslimieten — Qwen3.8-LiveTranslate: 10 verzoeken en 100.000 tokens per minuut. Qwen3.8-Max: standaard gehoste doorvoer, geen realtime limiet per verzoek.
Het verschil in context is wat mensen verrast. Qwen3.8-Max bevat een miljoen tokens; de interpreter heeft ongeveer vijf procent daarvan. Maar een realtime-interpreter heeft geen lange context nodig — hij heeft een kort geheugen nodig, en een heel snel geheugen. De bovengrens van 49.152 tokens voor invoer is afgestemd op het meedragen van de laatste paar minuten van een gesprek om namen en terminologie consistent te houden, wat precies de taak is die "long-context disambiguation" doet. De interpreter beoordelen op zijn contextgetal is als een racemotor beoordelen op zijn brandstoftank.

Waarom de prijsvergelijking een valstrik is
Op per-miljoen-tokenbasis lijkt de tolk dramatisch duurder dan het vlaggenschip: $7,50 per miljoen audio-invoertokens tegen $2,00 per miljoen tekst-invoertokens, en $30,00 per miljoen audio-uitvoer tegen $6,00 per miljoen tekst-uitvoer.
Die vergelijking is zinloos, en het is de meest voorkomende fout die over deze klasse modellen wordt gemaakt. Audio- en teksttokens zijn niet dezelfde eenheid. Spraak wordt gecodeerd naar audiotokens met een dichtheid die geen enkele relatie heeft met dezelfde inhoud wanneer die wordt uitgeschreven — een minuut gesprek verbruikt enorm veel meer audiotokens dan het transcript ervan aan teksttokens verbruikt, en de uitvoeraudio voegt daar nog een tweede stroom bovenop toe. Het naast elkaar weergeven van de twee snelheden impliceert een kostenverhouding die in de praktijk niet bestaat.
Het structurele verschil is belangrijker dan het prijsverschil. Qwen factureert de interpreter per token, terwijl een groot deel van de realtime-spraakmarkt per minuut van een sessie factureert. Die twee prijsmodellen gedragen zich volledig anders naarmate je audio stiller wordt, je sessies korter worden of je sprekers pauzeren — een meter per minuut rekent voor stilte, en een meter per token niet. Als je een kostenmodel bouwt, is de vraag niet welk tarief lager is; het is welke meter de vorm van jouw gebruik bestraft. En let op de regioopsplitsing: de prijzen in Peking bedragen ¥40 / ¥3,3 / ¥100 / ¥160 per miljoen voor respectievelijk audio-invoer, afbeeldingsinvoer, tekstuitvoer en audio-uitvoer, aanzienlijk onder de tarieven in Singapore, en dat is precies het soort verschil dat pas zichtbaar wordt wanneer je de twee regel voor regel vergelijkt.
Nog een punt in het voordeel van de tolk qua kosten: Qwen hield deze tarieven nagenoeg onveranderd ten opzichte van Qwen3.5-LiveTranslate, met Beijing ongewijzigd en Singapore iets goedkoper. Een nieuwe generatie die zonder prijsverhoging verschijnt, is niet de norm in deze markt.
Open gewichten versus alleen API is de echte scheidslijn
Als je tussen deze twee kiest op principiële gronden in plaats van op basis van capaciteiten, is licentieverlening de beslissende factor.
Qwen3.8-Max is beschikbaar als gehoste oplossing, en de Max-klasse-gewichten van deze generatie zijn in augustus open-source gemaakt als Qwen3.8-2.4T-A95B. Dat pad bestaat, maar het is geen vrijblijvende optie: 4,89 TB aan gewichten is datacenterhardware, en de open-weight-licentie vereist dat organisaties die in een periode van twaalf maanden meer dan $50 miljoen verdienen, een commerciële licentie van Alibaba Cloud verkrijgen.
Qwen3.8-LiveTranslate heeft zo'n pad niet. Het is closed-weight en uitsluitend via API beschikbaar, bereikbaar via een WebSocket Realtime API die vereist dat target_languagewordt ingesteld in een session.update-event voordat er ook maar enige audio wordt verplaatst, en die geen functieaanroepen, geen gestructureerde uitvoer, geen contextcaching, geen batchinferentie en geen fine-tuning ondersteunt. Als het uw vereiste is om de interpreter op uw eigen hardware te draaien, dan voldoet dit model daar niet aan en geen enkele hoeveelheid engineering zal dat veranderen.
Dat is belangrijk voor een specifiek soort koper: degene die audio niet naar een derde partij kan sturen — een ziekenhuis, een advocatenkantoor, een overheidscontractant. Voor alle anderen is de praktische vraag of de tolk goed genoeg is om de afhankelijkheid te rechtvaardigen, en het antwoord daarop is een meting die Qwen nog niemand heeft toegestaan te verrichten.

Kiezen op functie, niet op naam
Het juiste antwoord op "Qwen3.8-LiveTranslate of Qwen 3.8" is dat je waarschijnlijk het antwoord op een andere vraag nodig hebt.
• Als de taak live-interpretatie is — een vergadering, een gesprek, een uitzending — kan slechts één van deze dat doen, en dat is niet het vlaggenschip.
• Als de taak is samenvatten wat er is gezegd, actiepunten eruit halen, vragen over het transcript beantwoorden of de follow-up schrijven — dan kan alleen het vlaggenschip dat, en dat is de interpreter niet.
• Als de taak beide is, bouw je een pijplijn, en betaal je twee leveranciers met twee contracten en twee sets inloggegevens, tenzij je bewust consolideert.
Dat derde geval is het gebruikelijke geval, en daar houdt het draaien van beide helften achter één enkel endpoint op een gemak te zijn en begint het architectuur te worden. Qwen3.8-Max staat op OrcaRouter tegen de lijstprijs van de provider van $2,00 per miljoen input en $6,00 per miljoen output met nul opslag doorgegeven, zodat een prijsverlaging van Qwen uw factuur dezelfde dag bereikt in plaats van bij de volgende contractverlenging, en automatische failover betekent dat de samenvattingshelft van de pijplijn niet wegvalt wanneer één provider een slecht uur heeft.
Om expliciet te zijn over de andere helft, omdat het onderscheid ertoe doet: Qwen3.8-LiveTranslate staat niet in onze catalogus. Het is beschikbaar via de eigen Model Studio API van Alibaba en het proef-endpoint van de leverancier op omni.qwen.ai/live-translate, en we gaan niet suggereren dat we een model routeren dat we niet routeren. Wat je vandaag achter één sleutel kunt zetten, is de downstream-stack — de modellen die consumeren wat de interpreter produceert.

Het naamgevingsprobleem is de eigenlijke bevinding.
Vier modellen, één prefix, geen suffixconventie waarop een lezer kan vertrouwen. "Qwen 3.8" verwijst naar het gehoste vlaggenschip, de open 2,4T-checkpoint, het kleine 27B-model, of de interpreter, afhankelijk van wie typt en wat diegene het laatst heeft gelezen. De gepubliceerde benchmarktabellen helpen niet, omdat het vlaggenschip ze heeft en de interpreter ze grotendeels niet heeft: Qwen3.8-Max kan op Terminal-Bench of GPQA Diamond worden geplaatst, terwijl het bewijs voor Qwen3.8-LiveTranslate bestaat uit een gemiddelde vertraging van 2,3 seconden, een door de leverancier gerapporteerde 85,7 xCOMET-XXL op FLEURS, en een zelfgerapporteerd diarisatiefoutpercentage van 9,7% zonder onafhankelijke replicatie.
De vergelijking die deze pagina wil beantwoorden, is eigenlijk een waarschuwing. Voordat je Qwen 3.8 met iets vergelijkt, moet je vaststellen welke Qwen 3.8 je bedoelt. Als het audio als invoer neemt, is het de interpreter, en het is een specialist die je voor één taak koopt. Als het video als invoer neemt, is het het vlaggenschip, en het is een generalist die je voor de andere twintig koopt. Elke evaluatie die ze door elkaar haalt, levert een conclusie op die over geen van beide gaat.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
