
Tencent HY4 Preview vs Kimi K3: De blindtest die Tencent koos om te publiceren
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Tencent HY4 Preview tegen Kimi K3 is de enige wedstrijd in de lancering van dit model die Tencent zelf heeft gekozen om uit te voeren. In de interne blinde test — 163 engineers, 203 engineeringtaken, beoordeeld op een vierpuntsschaal — scoorde HY4 Preview 2,99/4,00 tegenover de 2,94 van Kimi K3, en de kop van Tencent noemde het een overwinning. De kleine lettertjes van die overwinning zijn het waard om langzaam te lezen: HY4 Preview versloeg Kimi K3 bij 51,2% van de taken, eindigde gelijk bij 7,9%, en verloor bij 40,9%. Een netto winstpercentage van 10 punten is reëel, maar het is een smalle marge tegen een model met een derde van het totale aantal parameters en minder dan de helft van de actieve parameters — en de hele test is uitgevoerd door Tencent.
Kimi K3 is Moonshots open-weight-vlaggenschip met 2,8 biljoen parameters, het grootste open model dat ooit is uitgebracht, en het referentiepunt waaraan elk Chinees lab zich sinds 16 juli meet. Tencent koos het als tegenstander omdat het de open-weight-standaard is — wat de taak van dit artikel ongewoon concreet maakt: lees de enige rechtstreekse vergelijking die de uitdager zelf aandroeg, en bepaal wat die waard is.
De benchmark die Tencent koos om te publiceren
De blinde test werd beoordeeld door Tencents eigen ingenieurs op Tencents eigen engineeringtaken, en dat is het eerste wat je moet relativeren. Een door het bedrijf samengestelde taakset is precies de omgeving waarin een nieuw model zijn beste prestatie kan neerzetten. Zelfs als we dat toegeven, is de vorm van het resultaat veelzeggend: 51,2% overwinningen tegen 40,9% verliezen is een bescheiden marge, en het gelijkspelpercentage van 7,9% betekent dat de modellen bij de meeste taken goed aan elkaar gewaagd zijn. Bij de moeilijke taken, de taken waarop een frontiermodel zich onderscheidt, zit de kloof waar die altijd zit — en Tencents kop, „iets voor op Kimi K3", is eerlijk geformuleerd, iets wat niet elk lab publiceert.
Schaal is geen lot.
De parametervergelijking maakt het resultaat indrukwekkend óf verdacht, afhankelijk van je voorkennis. Kimi K3 telt 2,8 biljoen parameters in totaal met 104 miljard actief — 896 experts, 16 actief per token — en is getraind om altijd aan te staan met een zichtbare chain-of-thought. HY4 Preview telt 770 miljard in totaal met 49 miljard actief, een derde van de totale schaal en minder dan de helft van de actieve rekenkracht. Dat een kleiner model een nipte overwinning boekt op een groter model in een blinde test is de richting waarin het hele open-weight-veld zich beweegt — Qwen3.8-Max, op 2,4T, en GLM-5.2, op 753B, leveren al maanden strijd op agentische benchmarks — dus het resultaat is aannemelijk, niet buitenissig. Het is bovendien, cruciaal, door niemand buiten Tencent geverifieerd.
Het scorebord

• Schaal — HY4 Preview 770B totaal / 49B actief vs Kimi K3 2.8T totaal / 104B actief
• Context — HY4 Preview >1M tokens versus Kimi K3 1M tokens
• Prijs per 1M — HY4 Preview ¥6 in / ¥18 uit (≈$0,85 / $2,50) vs Kimi K3 $3,00 in / $15,00 uit, cache-hits $0,30
• Modaliteit — HY4 Preview alleen-tekst vs Kimi K3 native afbeelding- en video-invoer
• Redeneren — HY4 Preview zonder gepubliceerde modus vs Kimi K3 met altijd-aan redeneren en gestreamde chain-of-thought
• Onafhankelijke score — HY4 Preview geen vs Kimi K3 AA Intelligence Index 57, top-3 wereldwijd bij release
Op de rijen waar beide kanten een getal rapporteren, clusteren de modellen. Tencent rapporteert HY4 Preview op 37.1 op APEX-Agents, vrijwel gelijk aan Kimi K3's 37.2 — een bijna-gelijkspel dat het blindtest-scorebord zou voorspellen. HY4 Preview's Toolathlon-Verified 74.1 en DeepSWE 64.3 hebben in mijn handen geen Kimi K3-equivalent, en Kimi K3's FrontierSWE 81.2, ProgramBench 77.8 en BrowseComp 91.2 hebben geen HY4 Preview-equivalent. Het scorebord geeft eerlijk aan dat de twee kaarten nauwelijks overlappen, wat op zichzelf een waarschuwing is om de rijen van geen van beide leveranciers als een volledige beschrijving van het model te beschouwen.
Visie is het grootste echte verschil
Voor een ontwikkelaar die vandaag tussen de twee kiest, is het structurele verschil niet intelligentie — het is de invoermodaliteit. Kimi K3 is native multimodaal: het verwerkt beeld- en video-invoer via de MoonViT-V2-encoder en behoort tot de beste open modellen voor visuele taken, met een tweede plaats wereldwijd op de vision-arena. Tencent HY4 Preview is in deze preview alleen-tekst, en Tencent heeft aangegeven dat vision moet wachten op de volledige release. Elke workload die screenshots, UI-begrip of visuele gronding nodig heeft, is standaard voor Kimi K3, ongeacht wat de blinde test zegt over technisch schrijven. Als je werk puur code, documenten en terminaluitvoer betreft, maakt het verschil niet uit; zodra een taak inhoudt dat er naar iets gekeken moet worden, bepaalt het de uitkomst van de vergelijking.
De kostenkwestie
Per token is HY4 Preview aanzienlijk goedkoper: ruwweg $0,85/$2,50 tegenover Kimi K3's $3,00/$15,00, met cache-hits op ¥0,3 (ongeveer vier cent) tegenover $0,30. Maar de twee modellen vertonen tegenovergesteld tokengedrag dat het verschil verkleint. Kimi K3 redeneert altijd door en streamt zijn chain-of-thought, wat het aantal output-tokens bij elk verzoek opdrijft; recensenten hebben opgemerkt dat het model langzamer is — ongeveer 62 tokens per seconde — en token-intensief voor agent-loops. HY4 Preview, volgens Tencent's eigen release-aantekening, "neigt naar overdreven lang denken en buitensporige zelfverificatie" bij complexe taken. Beide verbruiken extra output-tokens; HY4 Preview rekent er alleen minder voor. Een eerlijke vergelijking is kosten per voltooide taak, en niemand buiten Tencent heeft die van HY4 Preview nog gemeten.
Het vonnis
Tencent HY4 Preview is de goedkopere, kleinere, ongeverifieerde uitdager die een kleine voorsprong in blinde tests claimt op de open-gewichtenstandaard; Kimi K3 is de grotere, geverifieerde, vision-capabele gevestigde partij die vier tot vijf keer zoveel per token kost en een onafhankelijke Intelligence Index van 57 heeft. Geen van beide modellen heeft een volledig onafhankelijke benchmarkkaart — de belangrijkste scores van Kimi K3 worden ook door Moonshot gerapporteerd, hoewel de Index 57 dat niet is. Als je workload multimodaal is, is Kimi K3 de enige keuze in deze vergelijking. Gaat het om tekst en engineering, dan is HY4 Preview de voordelige gok met een echte, zij het door de leverancier uitgevoerde, head-to-head op zijn naam, en de goedkope route is om Kimi K3 op de productiesleutel te routeren — het is live op OrcaRouter tegen Moonshots catalogusprijs van $3,00/$15,00, zonder opslag doorgegeven — terwijl je HY4 Preview via Tencents eigen API op shadow-workloads draait. Wanneer HY4 Preview een router bereikt, zullen dezelfde sleutel en dezelfde failover-regels voor beide modellen gelden, en wordt Tencents tarief van ¥6/¥18 ongewijzigd doorgegeven.


Wat te kijken
• Een onafhankelijke heruitvoering van de blinde-testtaken. Het winstpercentage van 51,2% is de meest toetsbare claim in deze lancering, en een testopstelling van derden zou het binnen een week kunnen beslechten.
• Of HY4 Preview vision uitbrengt vóór de volledige Hy4-release. Dat is wat dit van een puur tekstuele waardevergelijking naar een echte vlaggenschipstrijd zou veranderen.
Kosten-per-voltooide-taak op standaard agentische harnesses. Beide modellen zijn token-intensief; wie goedkoper is per afgeronde taak wint het productieargument.
• Kimi K3's reactie op de prijsdruk. Als Moonshot de uitvoerprijs van $15 verlaagt, keert het frame 'goedkope uitdager versus dure standaard' om.
