
Tencent HY4 Preview vs Qwen3.8-Max: De open-gewicht-krachtmeting van augustus
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Tencent HY4 Preview vs Qwen3.8-Max is de botsing waar deze maand op afstevende. Alibaba's Qwen3.8-Max werd op 3 augustus algemeen beschikbaar en werd op 12 augustus de eerste Max-klasse Qwen met open gewichten; Tencent HY4 Preview verscheen vanochtend, 25 dagen later, met een lanceerkaart die Qwen3.8-Max rechtstreeks noemt — Tencent rapporteert HY4 Preview op 74,1 bij Toolathlon-Verified, vóór Qwen3.8-Max op die benchmark. Beide zijn Chinese vlaggenschepen met open gewichten, beide zijn scherp geprijsd, en slechts één ervan heeft onafhankelijke scores.
De twee modellen worden door meer dan alleen schaal van elkaar gescheiden — Qwen3.8-Max heeft 2,4 biljoen parameters tegenover de 770 miljard van HY4 Preview — maar op de agentische benchmarks die voor een koper belangrijk zijn, mikken ze op hetzelfde doel: werk met een lange horizon waarbij een model leest, tools aanroept en iteratief te werk gaat zonder menselijke tussenkomst. Dat is precies het terrein waar de open-weight generatie van augustus probeert te bewijzen dat ze gesloten frontier-modellen kan vervangen, en Tencent's eerste zet was het onder vuur nemen van de grootste open release van de maand.
Het scorebord

• Schaal — HY4 Preview 770B totaal / 49B actief vs Qwen3.8-Max 2.4T totaal / ~95B actief
• Context — HY4 Preview >1M tokens vs Qwen3.8-Max 1M tokens op de API (262K native in open weights, uitbreidbaar tot ~1.01M)
• Prijs per 1M — HY4 Preview ¥6 in / ¥18 uit (≈$0.85 / $2.50) vs Qwen3.8-Max $2.00 in / $6.00 uit, cache-uitlezingen $0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (door leverancier gerapporteerd) vs Qwen3.8-Max 86.6
• Modaliteit — beide zijn tekst-only in hun open-weight-vormen; Qwen3.8-Max API voegt beeld- en video-invoer toe, HY4 Preview preview doet dat niet.
• Onafhankelijke score — HY4 Preview geen vs Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58
De twee kaarten vertellen hetzelfde verhaal vanuit tegenovergestelde kanten. Op Terminal-Bench 2.1 worden de 86.6 van Qwen3.8-Max en de 85.4 van HY4 Preview gescheiden door anderhalve punt — één punt in het voordeel van Qwen, en het HY4-cijfer is niet gecontroleerd. Op prijs is HY4 Preview goedkoper op zowel input als output per token. Op verificatie heeft Qwen3.8-Max een onafhankelijke Intelligence Index van 58 en een Agentic Index van 58; HY4 Preview heeft niets anders dan zijn eigen publiciteit. De spreiding is het klassieke patroon van een uitdager die met betere prijzen en onbewezen beweringen aankomt tegenover een geverifieerde gevestigde partij.
De Toolathlon-claim lezen
Toolathlon-Verified meet de betrouwbaarheid van agentisch toolgebruik — hoe consistent een model een tool door een volledige taak stuurt met fouten, herstel en meerstapsaanroepen. De 74,1 van Tencent mikt rechtstreeks op het sterkste onderdeel van het profiel van Qwen3.8-Max, want Qwens Agentic Index van 58 en de 86,1 op OSWorld-Verified zijn de cijfers die de agentische pitch van Alibaba geloofwaardig maakten. Qwen3.8-Max scoort ook 82,8 op IFBench (instructie-opvolging) en 93,0 op PaperBench (agentisch werk op onderzoeksniveau), beide hoger dan modellen als GPT-5.6 Sol op de eigen tabellen van de leverancier. Dus koos Tencent voor de enige benchmark waarop het een directe overwinning op het grootste open model van de maand claimt — en die claim is op dit moment even verifieerbaar als elke andere rij van een enkele leverancier: helemaal niet.
Geverifieerd vs door leverancier gerapporteerd
Dit is de as waarop de vergelijking het minst eerlijk is, en het is de moeite waard om de asymmetrie expliciet te benoemen. De Intelligence Index van 58 van Qwen3.8-Max komt van Artificial Analysis, de Agentic Index van 58 komt eveneens van Artificial Analysis, en dezelfde onafhankelijke testomgevingen die deze scores opleverden, brachten ook de zwakke punten in kaart: een hallucinatiepercentage van 40% op AA-Omniscience, tegenover 23% bij de vorige generatie, en maar liefst 64 agentische beurten per taak — het model werkt hard, en je betaalt voor elke beurt. Tencent HY4 Preview heeft niets van die instrumentatie. De sterke punten zijn beweringen, en de faalwijzen — Tencent zelf wijst op lang nadenken en overmatige zelfverificatie — zijn erkenningen, geen metingen.
Voor een team dat tussen de twee kiest, is de verificatiekloof niet abstract. Het gedrag van Qwen3.8-Max van 64 beurten per taak is een echte, gemeten kostendrijver: tegen $2/$6 is het in sommige externe vergelijkingen nog steeds de duurste agent per voltooide taak, en teams hebben gerapporteerd dat het aantal beurten het prijsvoordeel uitholt. Het equivalente gedrag van HY4 Preview is onbekend — het zou per taak goedkoper kunnen zijn dan de al lage prijs per token doet vermoeden, of de gewoonte van zelfverificatie zou het verschil kunnen opslokken. Niemand kan je nog vertellen welke, omdat niemand buiten Tencent het heeft uitgevoerd.
Prijs en de praktische aspecten van open-weights
Per token is HY4 Preview goedkoper aan beide kanten van de balans: ¥6/¥18 tegenover Qwen3.8-Max's $2,00/$6,00, en cache-hits voor ¥0,3 tegenover $0,25. Dat maakt HY4 Preview het goedkoopste open-gewicht vlaggenschip op zowel input als output, punt uit. Maar 'open gewichten' brengt twee verschillende soorten kleine lettertjes met zich mee. Qwen3.8-Max's open-gewicht release — de Qwen3.8-2.4T-A95B — is alleen-tekst met denken verplicht ingeschakeld, een native context van 262K in plaats van de API's 1M, en een aangepaste licentie met schaalniveau-voorwaarden: vermelding van de modelnaam vereist bij meer dan 100M maandelijkse gebruikers, en een aparte licentie voor grote Model-as-a-Service-bedrijven. Tencent HY4 Preview's gewichten staan sinds vanmorgen op HuggingFace, ModelScope en GitHub, maar de exacte licentievoorwaarden en of de gewichten overeenkomen met de aangeboden API zijn niet met die duidelijkheid vermeld. Beide modellen zijn downloadbaar; geen van beide is zomaar in te zetten.
De bottom line
Qwen3.8-Max is de veiligere keuze op elk punt waar verificatie veiligheid oplevert: onafhankelijk beoordeeld op intelligentie en agentisch werk, bekende faalwijzen, een vastgelegde licentie en drie weken feedback uit de productie. Het is ook de duurdere keuze per token, en het gemeten turn-zware gedrag is een bekend kostenrisico. Tencent HY4 Preview is de waardegok: goedkoper op zowel input als output, een vergelijkbare Terminal-Bench-claim en een directe Toolathlon-Verified-claim tegen {{1}}Qwen{{/1}} — allemaal op dag één ongeverifieerd. Als je deze week een open-weightmodel in productie neemt, is Qwen3.8-Max de verdedigbare keuze en hij is live op OrcaRouter tegen {{2}}Alibaba{{/2}}'s lijstprijs — $2.00/$6.00, zonder opslag doorberekend. HY4 Preview is het evaluatieproject: draai het via Tencent's eigen API tegen je eigen Toolathlon-achtige taken, houd het productiepad op het geverifieerde model, en wanneer de onafhankelijke scores binnenkomen — of wanneer HY4 Preview een router bereikt en het tarief van ¥6/¥18 op dezelfde dag wordt doorberekend — is de wissel een routeringsregel, geen herschrijving.


Wat te kijken
• De eerste onafhankelijke run van HY4 Preview op een agentic harness. De Toolathlon-geverifieerde 74.1 is het getal waarmee Tencent wil winnen; een externe Agentic Index zou de bevestiging zijn.
• Het gemeten aantal turns van HY4 Preview. De 64 turns per taak van Qwen3.8-Max zijn het waarschuwende voorbeeld; of HY4 Preview per voltooide taak goedkoper is, is het hele economische argument.
• De licentievoorwaarden voor de gewichten. Die bepalen of "open" "bruikbaar op jouw schaal" betekent voor HY4 Preview, zoals de licentievoorwaarden van Qwen3.8-Max dat deden voor Alibaba's model.
• Of een van de leveranciers opnieuw de prijs verlaagt. In een maand waarin twee open-weight vlaggenschepen met agressieve prijsstelling werden uitgebracht, maakt de doorberekening op een router elke verdere prijsverlaging dezelfde dag zichtbaar.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
