
Tencent Hy4 Preview is open: een 770B MoE met een context van een miljoen tokens voor ¥6 per miljoen invoertokens
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Tencent Hy4 Preview, uitgebracht en als open source beschikbaar gesteld op 28 augustus 2026, is het derde vlaggenschipmodel van Tencent in zes maanden, en het is het model dat ophoudt een onderzoeksmijlpaal te zijn en een prijsgebeurtenis wordt. Het is een mixture-of-experts-model met 770 miljard parameters — 49 miljard actief per token — en een native contextvenster van een miljoen tokens, uitgebracht onder de Apache License 2.0 in zowel BF16 als FP8, vandaag te downloaden van Hugging Face, GitHub, ModelScope en GitCode. En Tencent prijst het op 6 yuan per miljoen invoertokens en 18 yuan per miljoen uitvoertokens, ongeveer US$ 0,83 en US$ 2,50, wat een open-weight-model van topniveau onder bijna elk gesloten frontier-model op de markt plaatst. Eén release, drie gezichten: open gewichten die je zelf kunt draaien, een API op Tencent Cloud's TokenHub, en dezelfde gewichten die al live zijn in Tencent's eigen producten, WorkBuddy, CodeBuddy, Yuanbao en ima. Dit is wat er daadwerkelijk is uitgebracht, wat Tencent beweert dat het scoort, en wat nog niemand heeft geverifieerd.
Het technische verhaal telt zwaarder dan het aantal parameters, omdat elk onderdeel een hefboom is voor de kosten. Het model is 78 lagen diep: de eerste laag is een standaard dicht feed-forward-netwerk, en de overige 77 zijn MoE-lagen met elk 256 gerouteerde experts plus één gedeelde expert, die per token de top-8 gerouteerde experts activeren. Die grofweg 16:1-sparsityratio is wat een 770B-model betaalbaar maakt om te draaien — slechts een 49B-deel doet daadwerkelijk werk voor elk willekeurig token. Een speciale multi-token-predictionlaag (10B parameters, 0.7B actief) maakt speculatieve decodering mogelijk, en de attention-stack gebruikt gated DeepSeek Sparse Attention met een IndexCache om het geheugengebruik voor lange contexten in toom te houden. Het redeneren is omschakelbaar tussen een langdenkende code>high/code> modus en een tokenbesparende code>no_think/code> modus. Dit zijn de details die bepalen of de geadverteerde prijs het contact met een echte workload overleeft, niet of het model een haiku kan schrijven.
Het specificatieblad, geannoteerd
Lees de release notes regel voor regel, want elke regel verandert stilletjes wat een open-weight model mag doen.
• Parameters — 770B in totaal, 49B actief per token, een sparsity-ratio van ~16:1 die de servingkosten binnen het bereik houdt dat een klein team zich daadwerkelijk kan veroorloven.
• Context — een native venster van 1.048.576 tokens, vier keer Hy3's 256K. Een volledige repository, een refactor van meerdere bestanden, een financieel pakket van 72 documenten — problemen die in één verzoek passen.
• Licentie — Apache License 2.0 voor zowel het BF16-origineel als de FP8-gekwantificeerde release, wat betekent dat self-hosting, fine-tuning en commercieel gebruik mogelijk zijn zonder een propriëtaire clausule.
• Inferentiestack — Tencent noemt vLLM en SGLang als de ondersteunde serving-frameworks, de twee waar het open-weight-ecosysteem zich daadwerkelijk op standaardiseert.
• API — Het TokenHub-eindpunt van Tencent Cloud voor ¥6 per miljoen invoertokens, ¥18 per miljoen uitvoertokens, ¥0,3 per miljoen bij cache-hits.
• Productintegratie — dezelfde gewichten die Tencent levert in WorkBuddy, CodeBuddy (nationaal en internationaal), Yuanbao en ima, zijn de gewichten die je kunt ophalen en draaien. CodeBuddy krijgt bij de lancering een gratis proefperiode van twee weken voor het model.
Tencent rapporteert ook een inference-engineeringcijfer dat zelden een lanceernotitie haalt: een end-to-end doorvoerverbetering van 31,8% door operatorfusie en communicatieoptimalisatie. Dat is het soort detail dat een model dat een lab als onderzoeksartefact uitbrengt, onderscheidt van een model waarvan een bedrijf verwacht dat het productieverkeer erop afkomt. Op dag één is het ook precies het soort bewering dat niemand buiten Tencent nog heeft gemeten.
De scores die het vermelden waard zijn
Elke benchmark die Tencent voor Tencent Hy4 Preview publiceerde, is door de leverancier gerapporteerd — uitgevoerd op Tencent's eigen evaluatieopstelling, niet gereproduceerd door een onafhankelijk laboratorium, en het model is nog geen dag openbaar. Lees ze als het plafond waarvan Tencent gelooft dat het het heeft bereikt.

Het belangrijkste cijfer is Terminal Bench 2.1, een test van hoe goed een model een echte terminal bedient tijdens het coderen. Tencent rapporteert 85,4, een score die volgens het bedrijf gelijk staat aan Claude Opus 5, DeepSeek V4 Pro voorbijgaat en 14,6 punten boven zijn eigen voorganger Hy3 uitkomt. Dat ene getal moet heel wat dragen — het is de bewering die een open-weight model op gelijke hoogte plaatst met de duurste gesloten frontier-modellen op een zware agentische codeertest — en het is de bewering die de meeste behoefte heeft aan onafhankelijke bevestiging. De rest van de interne tabel: DeepSWE springt van 28,0 op Hy3 naar 64,3, wat Tencent omschrijft als 'de kloof met eersteklas modellen geleidelijk verkleinen'; Toolathlon-Verified, een test voor het aanroepen van tools, komt uit op 74,1; APEX-Agents pass@1 staat op 37,1, een haar achter Kimi K3's 37,2; SWE-bench Pro op 65,7 en SWE-bench Multilingual op 82,9. In een aparte interne blinde test beoordeelden 163 experts 203 engineeringtaken met een gemiddelde score van 2,99 op 4,00, waarmee ze GLM-5.3's 2,92 en Kimi K3's 2,94 nipt voorbijgingen.
Twee patronen vallen op. Ten eerste heeft elke sterke score betrekking op agentisch engineeringwerk — terminalbesturing, het aanroepen van tools, taken op repository-schaal — en geen enkele op algemene chat of kennis, in lijn met Tencents positionering van het model als "gebouwd voor productiviteit" op het gebied van software-engineering, kantoor- en data-analyse, game-ontwikkeling en wetenschappelijk onderzoek. Ten tweede is Tencent er zorgvuldig in om DeepSWE en de rest te beschrijven als het verkleinen, niet het dichten, van hiaten. De enige eenduidige, verkoopbare gelijkwaardigheidsclaim is het gelijkspel op Terminal Bench 2.1, en dat is de claim die het meest de moeite waard is om met je eigen workload te testen.
Wat ¥6 per miljoen daadwerkelijk oplevert
Pricing is waar de release ophoudt interessant te zijn en disruptief begint te worden. Voor 18 yuan per miljoen outputtokens — ongeveer US$ 2,50 — kost een lange agentische codeersessie die een miljoen outputtokens verbrandt ruwweg een tiende van wat dezelfde sessie kost op een toonaangevend gesloten frontiermodel, en de cache-hit-rate van 0,3 yuan maakt de opnieuw verzonden systeemprompts en conversatieprefixen van een agentische lus dramatisch goedkoper dan de caching van de meeste concurrenten. Tencents eigen demo laat het model in één enkele doorgang door 72 financiële documenten werken; tegen deze tarieven is zo'n batch een betaalbare dagelijkse klus in plaats van een budgetpost.
Dit is ook waar de routinglaag de rekensom verandert, en het is de moeite waard om hier precies over te zijn. OrcaRouter routeert Tencent Hy4 Preview nog niet — Tencent heeft dit model nog niet opengesteld voor inferentieplatforms van derden, dus draait het op het TokenHub-eindpunt van Tencent Cloud en op zelf gehoste implementaties van de open gewichten, en we beweren niet te leveren wat we niet leveren. Maar de discipline die een prijsverlaging relevant maakt, is dezelfde waarop de rest van de catalogus draait: OrcaRouter geeft de lijstprijzen van providers door zonder opslag, dus wanneer een leverancier een token op 6 yuan prijst, is het bedrag dat u aan onze kant betaalt 6 yuan, geen doorverkochte en met opslag verhoogde versie ervan — en op de dag dat een leverancier een prijs wijzigt, is de wijziging dezelfde dag live aan onze kant. Eén API voor 200+ modellen, automatische failover tussen providers wanneer er een hapert, en een routing-DSL om modellen te combineren tot één enkele aanroep: dat is het mechanisme dat Tencent Hy4 Preview zal ondersteunen op het moment dat Tencent het openstelt, en het is het mechanisme dat u nu al kunt gebruiken om een nieuw, onbewezen model naast een bewezen model te draaien zonder uw productietraject op een van beide te verwedden.

De beweringen die een tweede lezing verdienen
Twee dingen in het lanceermateriaal gaan over hoe het model is gebouwd, niet over wat het scoorde, en ze verdienen afzonderlijke aandacht.
De eerste is de zelfverbeteringslus. Tencent zegt dat Tencent Hy4 Preview deelnam aan zijn eigen onderzoek en ontwikkeling — het werd gebruikt om de trainingsmethoden, datastrategie, evaluatiesystemen en low-level operatoren te optimaliseren die het hebben voortgebracht. Dat is een eerste recursieve zelfverbeteringscyclus: een model dat helpt bij het ontwerpen van de volgende versie van zichzelf, en Tencent dat het publiceert als een geleverde functionaliteit. Het is een grote bewering, en het is volledig zelfgerapporteerd.
Het tweede is een wiskundig resultaat. Tencent meldt dat het model de bekende ondergrens van het Blaschke–Lebesgue-probleem heeft verlegd — een al lang openstaande vraag in de convexmeetkunde over het lichaam van constante breedte met minimaal volume — van 0,380799 naar 0,41104, waarmee het binnen ongeveer 2% van het Meissner-tetraëdervermoeden komt. Tencent meldt ook een versnelling van 2,0x op een simulatie van een fosfolipidedubbellaag met 32.512 atomen, tot 54,9 milliseconden per stap. Resultaten als deze leveren een model normaal gesproken een eigen paper op; hier zijn het bullet points bij de lancering, en net als al het andere op dag één zijn het Tencent's eigen beweringen.
De eerlijke hiaten
Tencent somt de bekende beperkingen duidelijk op. Er is geen visuele of multimodale invoer — Tencent Hy4 Preview is een tekstmodel, punt uit, dus alles wat met afbeeldingen of video te maken heeft, hoort bij een ander model thuis. Tencent wijst ook op traag startgedrag bij complexe taken — lang nadenken vóór de eerste uitvoer — en een neiging tot overmatige zelfcontrole, die tokens verbrandt door werk dat al is gedaan opnieuw te controleren. Die combinatie is precies verkeerd voor latentiegevoelige chat en precies acceptabel voor offline batch-engineeringwerk, wat je vertelt waar Tencent verwacht dat je het draait.
En de belangrijkste afwezigheid is verificatie. Er zijn nog geen onafhankelijke scores voor Tencent Hy4 Preview — niet op een openbaar leaderboard, niet van een extern evaluatielab. Het model is te nieuw. De interne blinde expert-test is een nuttig signaal over hoe Tencent's eigen reviewers het zien ten opzichte van GLM-5.3 en Kimi K3, maar het zijn Tencent's reviewers op Tencent's taken. Alles boven het specificatieblad is een bewering die wacht op een controle.

Hoe je het vandaag daadwerkelijk kunt proberen
De praktische weg is kort. Haal de weights op van Hugging Face, GitHub, ModelScope of GitCode en serveer ze met vLLM of SGLang; roep de TokenHub-API van Tencent Cloud aan als je een gehost eindpunt wilt tegen de lijstprijs; of gebruik het in CodeBuddy of WorkBuddy, waar Tencent een gratis proefperiode van twee weken aanbiedt. De gratis toegang tot het Hy3-model loopt tot en met 30 september, en de cadans van Tencent — ongeveer één grote iteratie per twee maanden — wijst op een volledige Hy4-release die niet ver achter de preview ligt.
De eerlijke samenvatting: een open-weight model met 770B parameters en een context van een miljoen tokens voor ¥6 per miljoen inputtokens is vandaag de dag echt bestaand, en de sterkste benchmark die eraan wordt gekoppeld is een claim van een leverancier over een gelijkspel met een gesloten frontiermodel dat nog niemand heeft gereproduceerd. Download het, draai de test waar je echt om geeft, en laat het bewijs beslissen of de prijs het verhaal blijft.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
