Een hero-titelkaart voor de vergelijking 'Tencent HY4 Preview vs Kimi K3'. Een centrale scorebordachtige kaart toont 'Interne blinde test, 4-puntsschaal' met links 'Tencent HY4 Preview 2.99' en rechts 'Kimi K3 2.94'. Linkerkaart 'Tencent HY4 Preview' vermeldt '770B / 49B actief, open gewichten', '¥6 / ¥18 per 1M', 'Preview met alleen tekst'. Rechterkaart 'Kimi K3' vermeldt '2.8T / 104B actief, open gewichten', '$3.00 / $15.00 per 1M', 'Native vision, AA Index 57'. Een voettekst luidt: 'Blinde test uitgevoerd door Tencent met 163 ingenieurs over 203 taken; resultaten door leverancier gerapporteerd.' Het OrcaRouter-logo is in de rechteronderhoek samengesteld.
Guides & Insights

Tencent HY4 Preview vs Kimi K3: De blindtest die Tencent koos om te publiceren

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Tencent HY4 Preview tegen Kimi K3 is de enige wedstrijd in de lancering van dit model die Tencent zelf heeft gekozen om uit te voeren. In de interne blinde test — 163 engineers, 203 engineeringtaken, beoordeeld op een vierpuntsschaal — scoorde HY4 Preview 2,99/4,00 tegenover de 2,94 van Kimi K3, en de kop van Tencent noemde het een overwinning. De kleine lettertjes van die overwinning zijn het waard om langzaam te lezen: HY4 Preview versloeg Kimi K3 bij 51,2% van de taken, eindigde gelijk bij 7,9%, en verloor bij 40,9%. Een netto winstpercentage van 10 punten is reëel, maar het is een smalle marge tegen een model met een derde van het totale aantal parameters en minder dan de helft van de actieve parameters — en de hele test is uitgevoerd door Tencent.

Kimi K3 is Moonshots open-weight-vlaggenschip met 2,8 biljoen parameters, het grootste open model dat ooit is uitgebracht, en het referentiepunt waaraan elk Chinees lab zich sinds 16 juli meet. Tencent koos het als tegenstander omdat het de open-weight-standaard is — wat de taak van dit artikel ongewoon concreet maakt: lees de enige rechtstreekse vergelijking die de uitdager zelf aandroeg, en bepaal wat die waard is.

De benchmark die Tencent koos om te publiceren

De blinde test werd beoordeeld door Tencents eigen ingenieurs op Tencents eigen engineeringtaken, en dat is het eerste wat je moet relativeren. Een door het bedrijf samengestelde taakset is precies de omgeving waarin een nieuw model zijn beste prestatie kan neerzetten. Zelfs als we dat toegeven, is de vorm van het resultaat veelzeggend: 51,2% overwinningen tegen 40,9% verliezen is een bescheiden marge, en het gelijkspelpercentage van 7,9% betekent dat de modellen bij de meeste taken goed aan elkaar gewaagd zijn. Bij de moeilijke taken, de taken waarop een frontiermodel zich onderscheidt, zit de kloof waar die altijd zit — en Tencents kop, „iets voor op Kimi K3", is eerlijk geformuleerd, iets wat niet elk lab publiceert.

Schaal is geen lot.

De parametervergelijking maakt het resultaat indrukwekkend óf verdacht, afhankelijk van je voorkennis. Kimi K3 telt 2,8 biljoen parameters in totaal met 104 miljard actief — 896 experts, 16 actief per token — en is getraind om altijd aan te staan met een zichtbare chain-of-thought. HY4 Preview telt 770 miljard in totaal met 49 miljard actief, een derde van de totale schaal en minder dan de helft van de actieve rekenkracht. Dat een kleiner model een nipte overwinning boekt op een groter model in een blinde test is de richting waarin het hele open-weight-veld zich beweegt — Qwen3.8-Max, op 2,4T, en GLM-5.2, op 753B, leveren al maanden strijd op agentische benchmarks — dus het resultaat is aannemelijk, niet buitenissig. Het is bovendien, cruciaal, door niemand buiten Tencent geverifieerd.

Het scorebord

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Schaal — HY4 Preview 770B totaal / 49B actief vs Kimi K3 2.8T totaal / 104B actief

• Context — HY4 Preview >1M tokens versus Kimi K3 1M tokens

• Prijs per 1M — HY4 Preview ¥6 in / ¥18 uit (≈$0,85 / $2,50) vs Kimi K3 $3,00 in / $15,00 uit, cache-hits $0,30

• Modaliteit — HY4 Preview alleen-tekst vs Kimi K3 native afbeelding- en video-invoer

• Redeneren — HY4 Preview zonder gepubliceerde modus vs Kimi K3 met altijd-aan redeneren en gestreamde chain-of-thought

• Onafhankelijke score — HY4 Preview geen vs Kimi K3 AA Intelligence Index 57, top-3 wereldwijd bij release

Op de rijen waar beide kanten een getal rapporteren, clusteren de modellen. Tencent rapporteert HY4 Preview op 37.1 op APEX-Agents, vrijwel gelijk aan Kimi K3's 37.2 — een bijna-gelijkspel dat het blindtest-scorebord zou voorspellen. HY4 Preview's Toolathlon-Verified 74.1 en DeepSWE 64.3 hebben in mijn handen geen Kimi K3-equivalent, en Kimi K3's FrontierSWE 81.2, ProgramBench 77.8 en BrowseComp 91.2 hebben geen HY4 Preview-equivalent. Het scorebord geeft eerlijk aan dat de twee kaarten nauwelijks overlappen, wat op zichzelf een waarschuwing is om de rijen van geen van beide leveranciers als een volledige beschrijving van het model te beschouwen.

Visie is het grootste echte verschil

Voor een ontwikkelaar die vandaag tussen de twee kiest, is het structurele verschil niet intelligentie — het is de invoermodaliteit. Kimi K3 is native multimodaal: het verwerkt beeld- en video-invoer via de MoonViT-V2-encoder en behoort tot de beste open modellen voor visuele taken, met een tweede plaats wereldwijd op de vision-arena. Tencent HY4 Preview is in deze preview alleen-tekst, en Tencent heeft aangegeven dat vision moet wachten op de volledige release. Elke workload die screenshots, UI-begrip of visuele gronding nodig heeft, is standaard voor Kimi K3, ongeacht wat de blinde test zegt over technisch schrijven. Als je werk puur code, documenten en terminaluitvoer betreft, maakt het verschil niet uit; zodra een taak inhoudt dat er naar iets gekeken moet worden, bepaalt het de uitkomst van de vergelijking.

De kostenkwestie

Per token is HY4 Preview aanzienlijk goedkoper: ruwweg $0,85/$2,50 tegenover Kimi K3's $3,00/$15,00, met cache-hits op ¥0,3 (ongeveer vier cent) tegenover $0,30. Maar de twee modellen vertonen tegenovergesteld tokengedrag dat het verschil verkleint. Kimi K3 redeneert altijd door en streamt zijn chain-of-thought, wat het aantal output-tokens bij elk verzoek opdrijft; recensenten hebben opgemerkt dat het model langzamer is — ongeveer 62 tokens per seconde — en token-intensief voor agent-loops. HY4 Preview, volgens Tencent's eigen release-aantekening, "neigt naar overdreven lang denken en buitensporige zelfverificatie" bij complexe taken. Beide verbruiken extra output-tokens; HY4 Preview rekent er alleen minder voor. Een eerlijke vergelijking is kosten per voltooide taak, en niemand buiten Tencent heeft die van HY4 Preview nog gemeten.

Het vonnis

Tencent HY4 Preview is de goedkopere, kleinere, ongeverifieerde uitdager die een kleine voorsprong in blinde tests claimt op de open-gewichtenstandaard; Kimi K3 is de grotere, geverifieerde, vision-capabele gevestigde partij die vier tot vijf keer zoveel per token kost en een onafhankelijke Intelligence Index van 57 heeft. Geen van beide modellen heeft een volledig onafhankelijke benchmarkkaart — de belangrijkste scores van Kimi K3 worden ook door Moonshot gerapporteerd, hoewel de Index 57 dat niet is. Als je workload multimodaal is, is Kimi K3 de enige keuze in deze vergelijking. Gaat het om tekst en engineering, dan is HY4 Preview de voordelige gok met een echte, zij het door de leverancier uitgevoerde, head-to-head op zijn naam, en de goedkope route is om Kimi K3 op de productiesleutel te routeren — het is live op OrcaRouter tegen Moonshots catalogusprijs van $3,00/$15,00, zonder opslag doorgegeven — terwijl je HY4 Preview via Tencents eigen API op shadow-workloads draait. Wanneer HY4 Preview een router bereikt, zullen dezelfde sleutel en dezelfde failover-regels voor beide modellen gelden, en wordt Tencents tarief van ¥6/¥18 ongewijzigd doorgegeven.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

Wat te kijken

• Een onafhankelijke heruitvoering van de blinde-testtaken. Het winstpercentage van 51,2% is de meest toetsbare claim in deze lancering, en een testopstelling van derden zou het binnen een week kunnen beslechten.

• Of HY4 Preview vision uitbrengt vóór de volledige Hy4-release. Dat is wat dit van een puur tekstuele waardevergelijking naar een echte vlaggenschipstrijd zou veranderen.

Kosten-per-voltooide-taak op standaard agentische harnesses. Beide modellen zijn token-intensief; wie goedkoper is per afgeronde taak wint het productieargument.

• Kimi K3's reactie op de prijsdruk. Als Moonshot de uitvoerprijs van $15 verlaagt, keert het frame 'goedkope uitdager versus dure standaard' om.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube