{{1}}Hero-titelkaart voor Tencent Hy4 Preview. Een gecentreerde titel luidt 'Tencent Hy4 Preview — open weights, dag-nul vLLM'. Een ondertitelregel luidt '770B MoE · 49B actief · 1M context'. Vier spec-chips luiden 'Open weights (Apache 2.0)', 'vLLM + SGLang op dag nul', '8x GPU serving (FP8)', '¥6 / ¥18 per MTok'. Een voettekstregel luidt 'Uitgebracht op 28 aug 2026 · Draait in vLLM'. Het OrcaRouter-logo is rechtsonder samengesteld.{{/1}}
Guides & Insights

Tencent Hy4 Preview draait vanaf dag één in vLLM: de 770B Open-Weight-MoE die je daadwerkelijk kunt serveren

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Toen Tencent Hy4 Preview op 28 augustus 2026 werd gelanceerd, deed het iets wat de meeste vlaggenschepen van topklasse op dag één overslaan: het werd in uitvoerbare staat geleverd. Naast de open gewichten publiceerden Tencent en het vLLM-team een vooraf gebouwde Docker-image, een officieel servingrecept en voegden ze frameworkondersteuning toe in vLLM zelf, zodat het grootste opengewichtmodel dat de Hunyuan-lijn heeft voortgebracht — 770 miljard parameters in totaal, 49 miljard actief per token — binnen enkele uren na de aankondiging achter een OpenAI-compatibel endpoint op je eigen GPU's draaide. Dat verhaal over de runtime vanaf dag nul is het nieuws waar deze post over gaat, want "draait in vLLM" is geen voetnoot voor een model van deze omvang. Het is het verschil tussen een persbericht en iets dat je in productie kunt nemen.

De rest van de lancering is het gebruikelijke pakket in previewvorm, en de kanttekeningen zijn net zo belangrijk als de cijfers. Tencent noemt Tencent Hy4 Preview een vroege iteratie, bestempelt overdreven lang redeneren en buitensporige zelfverificatie als bekend gedrag, en publiceert een benchmarktabel die volledig op eigen rapportage is gebaseerd — geen onafhankelijk laboratorium heeft het model nog beoordeeld, en op het moment van schrijven is het twee dagen oud. Niets daarvan verandert de praktische conclusie: de gewichten zijn Apache 2.0, het contextvenster is 1 miljoen tokens, en de vLLM-ondersteuning vanaf dag één betekent dat het self-hosting-traject reëel is in plaats van toekomstmuziek.

Wat Tencent Hy4 Preview eigenlijk is

Tencent positioneert Tencent Hy4 Preview als de opvolger van Hy3 (295B totaal, 256K context), met ongeveer verdubbeling van actieve capaciteit en verviervoudiging van het contextvenster. De architectuur is het waard om regel voor regel te lezen, omdat elke regel verandert wat een open-weight model op jouw hardware mag doen.

Architectuur — Mixture-of-Experts met 770B totale parameters en 49B actief per token over 78 lagen. De eerste laag is dense; de andere 77 routeren elk token door 256 gerouteerde experts plus één gedeelde expert, waarbij de top 8 wordt geactiveerd. Die ongeveer 16:1 schaarsteverhouding is wat de inferentiekosten binnen een bereik houdt dat een serieus team daadwerkelijk kan draaien.

• Contextvenster — 1.048.576 tokens native, een van de breedste van alle open-weightmodellen. Een volledige repository, een multi-file refactor, een lange documentbatch: problemen die in één enkele aanvraag passen.

• Attention — Gated DeepSeek Sparse Attention (Gated DSA) met IndexCache, een sparse-attention-ontwerp dat op slechts 21 van de 78 lagen een verse sparse index berekent en die op de andere 57 hergebruikt. Daarom is het serveren ervan niet zomaar 'een grotere vLLM' — er is een backend nodig die sparse attention begrijpt.

• Ingebouwde speculatieve decodering — een MTP-laag (multi-token predictie) van in totaal ongeveer 10B / 0,7B actieve parameters bevindt zich in het model, zodat vLLM en SGLang tokens kunnen opstellen zonder dat u een apart draftmodel hoeft te hosten.

• Gewichten — Apache 2.0, in zowel BF16- als FP8-checkpoints, gepubliceerd op Hugging Face, ModelScope, GitCode en CNB.

Wat "day-zero vLLM" eigenlijk betekent

De gemergde framework-ondersteuning op de lanceringsdag is de concrete gebeurtenis achter het signaal — de vLLM-wijziging die Tencent Hy4 Preview toevoegt (PR #54160) landde in hetzelfde tijdvenster als de release, en het officiële recept richt zich op vLLM 0.29.0 of nieuwer. In de praktijk betekent dat het serving-pad één commando is, geen week aan kernel-debugging.

docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview

De vlaggen doen ertoe, en elke vlag verwijst naar iets in het model in plaats van louter standaardtekst te zijn:

• --attention-backend FLASHMLA_SPARSE — vereist, niet optioneel. De Gated DSA sparse attention van Tencent Hy4 Preview draait niet correct op de standaard dense backends, en deze vlag is wat het officiële recept instelt.

• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — schakelt de ingebouwde MTP-laag van het model in voor speculatieve decodering, drie concept-tokens vooruit. Geen afzonderlijk conceptmodel om te implementeren.

• --tool-call-parser hy_v4 en --reasoning-parser hy_v4 — de aangepaste parsers die de server vertellen hoe Tencent Hy4 Preview tool-aanroepen en zijn chain-of-thought produceert, waarbij --enable-auto-tool-choice het model laat beslissen wanneer het tools aanroept.

Tencent beveelt temperature 0.9 en top_p 1.0 aan voor sampling. De redenering standaard op een 'high' effort chain-of-thought gericht op wiskunde, programmeren en complexe taken; als je een direct antwoord wilt zonder het lange denkproces, geef je een no_think reasoning effort op in het verzoek in plaats van gewichten te wisselen.

A screenshot of the official vLLM recipe page for tencent/Hy4-preview (recipes.vllm.ai/tencent/Hy4-preview, captured August 30, 2026). It shows the model spec chips '770B | 49B | 1,048,576 ctx | vLLM 0.29.0+', a note describing the built-in 10B MTP layer for speculative decoding and the hy_v4 tool/reasoning parsers, and the prebuilt docker run command with --tensor-parallel-size 8, --attention-backend FLASHMLA_SPARSE, and the hy_v4 parsers.

Dag-nul-ondersteuning is niet alleen voor vLLM, wat op zichzelf opmerkelijk is voor een zo verse release. SGLang bracht dezelfde dag een voorgebouwde multi-architectuur-image uit (lmsysorg/sglang:hy4-preview) met NEXTN-achtige speculatieve decodering, en het Ascend-ecosysteem kreeg 0-day-ondersteuning via vLLM-Ascend met W8A8-gekwantiseerde gewichten op 16 Atlas 800I A3 NPU's. Open-gewicht-releases doen er vaak weken over voordat het serving-ecosysteem ze bijbeent; deze deed er uren over.

De scores die het vermelden waard zijn

Elke benchmark die Tencent voor Tencent Hy4 Preview heeft gepubliceerd, is door de leverancier gerapporteerd — uitgevoerd op Tencent's eigen evaluatie-opstelling, niet gereproduceerd door enig onafhankelijk laboratorium, en het model is al twee dagen openbaar. Beschouw ze als het plafond waarvan Tencent gelooft dat het is bereikt, niet als vaststaand feit. Onafhankelijke verificatie zal er pas zijn als een derde partij het uitvoert; niets op de openbare ranglijsten weerspiegelt dit model nog.

A single-model scoreboard titled 'Tencent Hy4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (Apache 2.0)', 'Price: ¥6 / ¥18 per MTok (¥0.3 cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 30, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Het hoofdcijfer is Terminal Bench 2.1, een test van hoe goed een model een echte terminal aanstuurt tijdens het coderen. Tencent rapporteert Tencent Hy4 Preview op 85,4, waarvan het beweert dat het gelijkstaat aan Claude Opus 5 en DeepSeek V4 Pro passeert, en dat het zijn eigen voorganger Hy3 met 14,6 punten verslaat. Dat ene cijfer draagt de release — het is de bewering die een open-weight model op gelijke hoogte plaatst met de duurste gesloten frontier-modellen op een zware agentic-codeertest — en het is de bewering die het meest behoefte heeft aan onafhankelijke bevestiging.

De rest van de interne tabel, allemaal Tencent's eigen cijfers: DeepSWE, een software-engineeringbenchmark, stijgt van 28,0 op Hy3 naar 64,3. SWE-bench Pro komt uit op 65,7 en SWE-bench Multilingual op 82,9. Op Toolathlon-Verified, een test voor het aanroepen van tools, rapporteert Tencent 74,1, waarmee het volgens het bedrijf Qwen 3.8 Max en GPT-5.6 Sol overtreft en Kimi K3 en Claude Opus 5 benadert. Op APEX-Agents pass@1 komt het uit op 37,1, een haar achter Kimi K3's 37,2. En in een afzonderlijke interne blinde evaluatie beoordeelden 163 door Tencent aangetrokken experts 203 engineeringtaken met 2,99 op 4,00, nipt beter dan GLM-5.3's 2,92 en Kimi K3's 2,94.

Twee patronen zijn het vermelden waard. Elk sterk cijfer heeft betrekking op agentisch engineeringwerk — terminalbesturing, toolaanroeping, taken op repositoryschaal — en geen enkel op generieke kennis of redenering, wat past bij de productiviteitspositionering in plaats van toeval te zijn. En Tencent beschrijft DeepSWE en de andere als het verkleinen, niet het dichten, van hiaten; de enige zuivere, verkoopbare gelijkwaardigheidsclaim is de gelijke score op Terminal Bench 2.1, en dat is de claim die het meest de moeite waard is om met je eigen workload te testen.

Wat het daadwerkelijk kost om te draaien

De rekenkundige realiteit van zelf hosten is het eerste punt dat we eerlijk onder ogen moeten zien. Dit is geen model voor één GPU en het is geen desktopmodel. De FP8-checkpoint bevat bijna een terabyte aan gewichten, en het officiële recept gaat uit van tensorparallellisme van 8 — acht GPU's met hoge bandbreedte en snelle interconnecties (de referentiehardware van Tencent voor FP8 is 8×B300, terwijl volledige BF16 16×B200 vereist). Als je die voetafdruk niet hebt, zul je het niet goedkoop zelf kunnen hosten, en de sparse-attention-backend betekent dat er geen omweg is rond het geheugen voor de KV-cache bij een 1M-tokencontext.

Een toevoeging tijdens de lanceerweek verandert een deel van die rekensom voor teams die de open gewichten willen zonder de voetafdruk van een vlaggenschip. Het Hy-team van Tencent leverde een gecomprimeerde GGUF-build van Tencent Hy4 Preview, waarmee de ~1,5 TB BF16-release werd teruggebracht tot ongeveer 200 GiB met een per-laag gemengd kwantiseringsschema dat het MIX-STQ1_0 noemt — bulk-expert-tensoren dalen naar ongeveer 1,3 bits, terwijl lagen die cruciaal zijn voor de residustroom een hogere precisie behouden. In Tencent's eigen evaluaties is de nauwkeurigheidsverandering klein — SWE-bench Multilingual van 82,9 naar 81,3, MCP Atlas van 83,7 naar 83,2, IFBench van 73,5 naar 72,5 — een afweging die de leverancier bijna verliesvrij noemt. Dat zijn de cijfers van Tencent op de opstelling van Tencent, tot nu toe niet onafhankelijk gereproduceerd. Een model van 200 GiB is nog steeds geen single-GPU-model, maar het is een aanzienlijk kleinere gok dan een checkpoint van bijna een terabyte aan FP8, en het brengt het pad van open gewichten binnen bereik van een kleinere multi-GPU-node dan het acht-B300-recept veronderstelt.

Het API-pad is waar de prijs interessant wordt. Op TokenHub van Tencent Cloud staat Tencent Hy4 Preview vermeld op 6 yuan (~US$ 0,83) per miljoen invoertokens, 18 yuan (~US$ 2,50) per miljoen uitvoertokens en 0,3 yuan (~US$ 0,04) per miljoen tokens voor cache-hits. Uitvoer van ongeveer $ 2,50 per miljoen ligt ver onder de uitvoerprijs van $ 25 per miljoen van een toonaangevend gesloten frontier-model, en het goedkope cache-hit-tarief maakt lange agentische lussen — waarbij dezelfde systeemprompt en gespreksprefixen voortdurend opnieuw worden verzonden — buitengewoon betaalbaar.

Tencent biedt ook twee weken gratis toegang tot Tencent Hy4 Preview binnen WorkBuddy en CodeBuddy zolang het model nieuw is, dus de goedkoopste manier om het deze week uit te proberen is gratis — en WorkBuddy is waar de positionering op productiviteit concreet wordt. In elk WorkBuddy-gesprek schakelt de modelkiezer tussen Hy3 en Hy4 preview, dus de splitsing tussen kantoorproductiviteit en analysetaken aan de ene kant en coderen aan de andere kant is een keuze per taak in plaats van een implementatiebeslissing. Die splitsing komt overeen met waar Tencent het model op richtte, en praktijktests in WorkBuddy laten zien dat het complexe artefacten in één keer produceert — een speelbaar low-poly gameprototype op basis van één enkele prompt, een volledige kwartaalreview samengesteld uit tien bijlagen zonder enige handmatige tussenkomst, en, in de testdemo die deze week circuleerde, een zwart-gatsimulatie. Dit zijn community-waarnemingen in Tencent's eigen app in plaats van leveranciersbenchmarks — maar het zijn de eerste praktijksignalen van wat het model doet bij echte meerstapstaken, en ze zijn gratis te reproduceren voordat je iets uitgeeft.

De kostenbeslissing is precies waar een routinglaag de cijfers verandert, en we zullen eerlijk zijn over onze eigen rol daarin: OrcaRouter routet Tencent Hy4 Preview nog niet, omdat Tencent dit model niet heeft opengesteld voor third-party inferentieplatforms — het draait op Tencent Cloud's eigen TokenHub-endpoint en op zelf gehoste implementaties van de open gewichten, en we beweren niet te leveren wat we niet leveren. Wat de routinglaag toevoegt, is het beslissingskader eromheen. Als je kiest tussen een 8-GPU-node en een API, geldt dezelfde doorgeefdiscipline waar de rest van de catalogus op draait op de dag dat Tencent dit opent: OrcaRouter geeft de lijstprijzen van providers door zonder opslag, dus een prijsverlaging van een leverancier is dezelfde dag bij ons live in plaats van dat die wordt doorverkocht en opgeslagen. En voor een model van twee dagen oud waarvan het enige bewijs de benchmarks van de leverancier zijn, is automatische failover de veilige manier om het te testen — zet het bewezen model op je kritieke pad en Tencent Hy4 Preview ernaast, wissel in bij taken waar het kostenprofiel wint en val terug op het moment dat dat niet zo is, alles via één API en één sleutel.

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent Hy4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

De grenzen die niet op een specsheet passen

Tencent vermeldt de bekende beperkingen duidelijk, en ze zouden elke implementatiebeslissing moeten vormgeven. Tencent Hy4 Preview is een tekstmodel, punt uit — geen visuele of multimodale invoer — dus alles wat met beeld of video te maken heeft, hoort op een ander model thuis. Tencent wijst ook op trage start bij complexe taken (lang nadenken vóór de eerste output) en een neiging tot overmatige zelfcontrole, waarbij tokens worden verbruikt om werk dat al gedaan is opnieuw te controleren. Die combinatie is precies verkeerd voor latentiegevoelige chat en precies acceptabel voor offline batch-engineeringwerk, wat je vertelt waar Tencent verwacht dat je het draait.

Twee beweringen in het lanceermateriaal verdienen afzonderlijke aandacht, omdat ze gaan over hoe het model is gebouwd, niet over wat het scoorde. Tencent zegt dat Tencent Hy4 Preview heeft deelgenomen aan zijn eigen ontwikkeling — het hielp bij het optimaliseren van de trainingsmethoden, datastrategie, evaluatiekaders en low-level operatoren die het hebben voortgebracht, een vroege recursieve zelfverbeteringslus — en dat het autonoom zijn eigen inferentiesysteem heeft geoptimaliseerd voor een end-to-end doorvoerwinst van 31.8% ten opzichte van de basislijn. Op wetenschappelijk vlak meldt Tencent dat het de bekende ondergrens van het Blaschke–Lebesgue-probleem in de convexe meetkunde heeft verbeterd van 0.380799 naar 0.41104, en een 2.0x versnelling van een simulatie van een fosfolipidedubbellaag met 32,512 atomen tot 54.9 milliseconden per stap. Net als al het andere op dag één zijn dit Tencent's eigen beweringen.

En de belangrijkste afwezigheid is verificatie. Er zijn nog nergens onafhankelijke scores voor Tencent Hy4 Preview — niet op een openbaar leaderboard, niet van een evaluatielab van derden, geen Artificial Analysis-vermelding. Het model is daarvoor te nieuw. De interne blinde expertentest is een nuttig signaal over hoe Tencent's eigen beoordelaars het zien tegenover GLM-5.3 en Kimi K3, maar het zijn Tencent's beoordelaars die Tencent's taken beoordelen. Alles wat boven het specificatieblad uitgaat, is een bewering die wacht op een controle.

Wie moet deze week Tencent Hy4 Preview draaien?

Het eerlijke antwoord valt deze week uiteen in drie groepen, en één daarvan heeft helemaal geen hardware nodig. Als je alleen wilt ervaren wat Tencent Hy4 Preview doet, is de gratis WorkBuddy-toegang de snelste weg — geen GPU, geen API-sleutel, open een gesprek, zet de modelselector op Hy4 preview en geef het een Work- of Coding-taak. Als je GPU's hebt en engineering-workloads batchgewijs draait — langdurige agentische taken, analyse op repository-schaal, offline evaluatie — dan is het model nu een serieuze test waard: de gewichten zijn open, het contextvenster is op repository-schaal, het vLLM-pad is één enkele opdracht, en de GGUF-build van de lanceerweek verlaagt de hardware-drempel voor een proefrun. Als je latency-gevoelige productiechat draait, of iets multimodaals, of iets waarbij je je geen model kunt veroorloven waarvan het enige bewijs de eigen benchmarks van de leverancier zijn, wacht dan — Tencent heeft sinds februari ongeveer elke twee maanden een nieuwe versie uitgebracht, en het heeft al gezegd dat de volgende batch Hy4-modellen eraan komt, dus de preview is uitdrukkelijk een vroege iteratie.

Voor alle anderen is de nuttige benadering een routeringspatroon: bewijs het naast een model dat je al vertrouwt, tegen kosten waar je vanaf kunt stappen, en schaal het alleen waar de cijfers standhouden op je eigen workload. Dat is waarvoor een router bestaat — op de dag dat Tencent dit model openstelt voor inferentie door derden, voegt het zich bij de catalogus met één API, meer dan 200 modellen en doorberekening van de lijstprijs, net als alle andere, en de failover- en compositietools zullen al klaarstaan. Tot die tijd staan de gewichten op Hugging Face, draait de API op Tencent Cloud en is de gratis proefversie in WorkBuddy — en aan de bewering dat een open-gewichtenmodel de top bereikte van agentisch coderen, is eindelijk een specifiek getal verbonden. Het getal is van Tencent. De test is van jou.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube