
Tencent Hy4 Preview körs i vLLM från dag ett: Den 770B open-weight MoE-modell du faktiskt kan servera
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
När Tencent Hy4 Preview lanserades den 28 augusti 2026 gjorde den något som de flesta frontier-class-flaggskepp hoppar över på dag ett: den levererades körbar. Tillsammans med de öppna vikterna publicerade Tencent och vLLM-teamet en förbyggd Docker-avbild, ett officiellt serveringsrecept och sammanfogat ramverksstöd i själva vLLM, så att den största modellen med öppna vikter som Hunyuan-linjen har producerat – 770 miljarder totala parametrar, 49 miljarder aktiva per token – låg bakom en OpenAI-kompatibel slutpunkt på dina egna GPU:er inom några timmar efter tillkännagivandet. Den där dag-noll-körtidsberättelsen är nyheten som det här inlägget handlar om, eftersom ”körs i vLLM” inte är en fotnot för en modell av den här storleken. Det är skillnaden mellan ett pressmeddelande och en sak du kan sätta i produktion.
Resten av lanseringen är det vanliga förhandsvisningspaketet, och förbehållen betyder lika mycket som siffrorna. Tencent kallar Tencent Hy4 Preview för en tidig iteration, flaggar alltför långt resonemang och överdriven självverifiering som känt beteende, och publicerar en benchmarktabell som är helt självrapporterad — inget oberoende labb har testat den ännu, och modellen är två dagar gammal i skrivande stund. Inget av det förändrar den praktiska huvudrubriken: vikterna är Apache 2.0, kontextfönstret är 1 miljon tokens, och vLLM-stödet från dag ett innebär att självhosting-vägen är verklig snarare än önsketänkande.
Vad Tencent Hy4 Preview faktiskt är
Tencent positionerar Tencent Hy4 Preview som efterträdare till Hy3 (295B totalt, 256K kontext), vilket ungefär fördubblar den aktiva kapaciteten och fyrdubblar kontextfönstret. Arkitekturen är värd att läsa rad för rad, eftersom varje rad förändrar vad en modell med öppna vikter får göra på din hårdvara.
Arkitektur — Mixture-of-Experts med 770B parametrar totalt och 49B aktiva per token över 78 lager. Det första lagret är tätt; de övriga 77 dirigerar varje token genom 256 dirigerade experter plus en delad expert och aktiverar de 8 bästa. Den ungefärliga sparsitetskvoten på 16:1 är vad som håller inferenskostnaden inom ett intervall som ett seriöst team faktiskt kan köra.
• Kontextfönster — 1,048,576 token inbyggt, ett av de bredaste av alla modeller med öppna vikter. Ett komplett repository, en refaktorisering av flera filer, en sats med långa dokument: problem som ryms i en enda begäran.
{{1}}Attention — Gated DeepSeek Sparse Attention (Gated DSA) med IndexCache{{/1}}, en sparse-attention-design som beräknar ett nytt sparse-index på endast 21 av de 78 lagren och återanvänder det på de övriga 57. Därför räcker det inte med en "större vLLM" för att servera den — det krävs en backend som förstår sparse attention.
• Inbyggd spekulativ avkodning – ett MTP-lager (multi-token prediction) med cirka 10B totalt / 0,7B aktiva parametrar sitter inuti modellen, så att vLLM och SGLang kan drafta tokenar utan att du behöver driva en separat draftmodell.
• Vikter — Apache 2.0, i både BF16- och FP8-checkpoints, publicerade på Hugging Face, ModelScope, GitCode och CNB.
Vad "day-zero vLLM" faktiskt betyder
Sammanslaget ramverksstöd på lanseringsdagen är den konkreta händelsen bakom signalen — vLLM-ändringen som lägger till Tencent Hy4 Preview (PR #54160) landade i samma fönster som lanseringen, och det officiella receptet riktar sig mot vLLM 0.29.0 eller nyare. I praktiken innebär det att serving-sökvägen är ett enda kommando, inte en veckas kärnfelsökning.
docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview
Flaggorna har betydelse, och varje flagga mappar till något i modellen snarare än att vara standardtext:
• --attention-backend FLASHMLA_SPARSE — krävs, inte valfritt. Tencent Hy4 Previews Gated DSA sparse attention fungerar inte korrekt med de förvalda täta backends, och denna flagga är vad det officiella receptet anger.
--speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — aktiverar modellens inbyggda MTP-lager för spekulativ avkodning, tre utkast-token i förväg. Ingen separat utkastmodell att distribuera.
• --tool-call-parser hy_v4 och --reasoning-parser hy_v4 — de anpassade parser som talar om för servern hur Tencent Hy4 Preview avger verktygsanrop och sin tankekedja, med --enable-auto-tool-choice som låter modellen avgöra när den ska anropa verktyg.
Tencent rekommenderar temperature 0.9 och top_p 1.0 för sampling. Reasoning har som standard en chain-of-thought med "hög" ansträngning, riktad mot matematik, kodning och komplexa uppgifter; om du vill ha ett direkt svar utan det långa tänkandet, skickar du med en no_think reasoning-ansträngning i förfrågan istället för att byta vikter.

Stöd från dag ett är inte enbart vLLM, vilket i sig är anmärkningsvärt för en så färsk release. SGLang lanserade en förbyggd multi-arkitektur-image (lmsysorg/sglang:hy4-preview) med spekulativ avkodning i NEXTN-stil samma dag, och Ascend-ekosystemet fick 0-dagarsstöd via vLLM-Ascend med W8A8-kvantiserade vikter över 16 Atlas 800I A3 NPU:er. Open-weight-utgåvor tar ofta veckor för serveringsekosystemet att komma ikapp; den här tog timmar.
Poängen värda att citera
Varje benchmark som Tencent publicerat för Tencent Hy4 Preview är leverantörsrapporterad – körd på Tencents egen utvärderingsmiljö, inte reproducerad av något oberoende labb, och modellen har varit offentlig i två dagar. Läs dem som det tak Tencent anser sig ha nått, inte som etablerad fakta. Oberoende verifiering kommer inte att finnas förrän en tredje part kör modellen; ingenting på de offentliga ledartavlorna återspeglar denna modell ännu.

Huvudsiffran är Terminal Bench 2.1, ett test av hur väl en modell hanterar en riktig terminal under kodning. Tencent rapporterar att Tencent Hy4 Preview får 85,4, vilket företaget hävdar innebär ett oavgjort resultat med Claude Opus 5 och att den slår DeepSeek V4 Pro, samt att den överträffar sin egen föregångare Hy3 med 14,6 poäng. Den enda siffran bär hela releasen – det är påståendet som placerar en open-weight-modell i paritet med de dyraste stängda frontmodellerna på ett svårt agentiskt kodningstest – och det är påståendet som mest behöver oberoende bekräftelse.
Resten av den interna tabellen, alla Tencents egna siffror: DeepSWE, en benchmark för mjukvaruteknik, hoppar från 28,0 på Hy3 till 64,3. SWE-bench Pro landar på 65,7 och SWE-bench Multilingual på 82,9. På Toolathlon-Verified, ett verktygsanropstest, rapporterar Tencent 74,1, vilket enligt företaget överträffar Qwen 3.8 Max och GPT-5.6 Sol och närmar sig Kimi K3 och Claude Opus 5. På APEX-Agents pass@1 hamnar man på 37,1, strax bakom Kimi K3:s 37,2. Och i en separat intern blindutvärdering betygsatte 163 Tencent-rekryterade experter 203 ingenjörsuppgifter till 2,99 av 4,00, och slår därmed GLM-5.3:s 2,92 och Kimi K3:s 2,94.
Två mönster är värda att notera. Varje stark siffra gäller agentiskt ingenjörsarbete — terminalstyrning, verktygsanrop, uppgifter i repositorieskala — och ingen gäller generell kunskap eller resonemang, vilket passar produktivitetspositioneringen snarare än att vara en slump. Och Tencent beskriver DeepSWE och de andra som att minska, inte stänga, klyftor; det enda rena, säljbara paritetspåståendet är oavgjort på Terminal Bench 2.1, och det är det påstående som är mest värt att testa med din egen arbetsbelastning.
Vad det faktiskt kostar att driva
Det första att vara ärlig om är självhostningskalkylen. Det här är inte en modell för en enda GPU och inte en skrivbordsmodell. FP8-checkpointen är nära en terabyte vikter, och den officiella metoden förutsätter tensorparallellism på 8 – åtta GPU:er med hög bandbredd och snabba interconnects (Tencents referenshårdvara för FP8 är 8×B300, medan full BF16 kräver 16×B200). Om du inte har den utrustningen kommer du inte att kunna självhosta den billigt, och sparse-attention-backenden innebär att det inte finns någon genväg förbi minnet för KV-cachen i en 1M-tokenkontext.
Ett tillägg under lanseringsveckan ändrar en del av den ekvationen för team som vill ha öppna vikter utan flaggskeppsformatet. Tencents Hy-team levererade en komprimerad GGUF-bygge av Tencent Hy4 Preview och pressade ned ~1,5 TB BF16-utgåvan till cirka 200 GiB med ett per-lager blandat kvantiseringsschema som de kallar MIX-STQ1_0 — bulk-expert-tensorerna sjunker till ungefär 1,3 bitar medan lager som är kritiska för residualströmmen behåller högre precision. I Tencents egna utvärderingar är noggrannhetsförändringen liten — SWE-bench Multilingual 82.9 till 81.3, MCP Atlas 83.7 till 83.2, IFBench 73.5 till 72.5 — en avvägning som leverantören kallar nästan förlustfri. Det är Tencents siffror på Tencents uppställning, ännu inte oberoende reproducerade. En 200 GiB-modell är fortfarande inte en modell för en enda GPU, men det är en betydligt mindre satsning än en FP8-checkpoint på nära en terabyte, och det gör vägen med öppna vikter tillgänglig för en mindre multi-GPU-nod än vad receptet med åtta B300 förutsätter.
API-sökvägen är där priset blir intressant. På Tencent Clouds TokenHub listas Tencent Hy4 Preview till 6 yuan (~0,83 USD) per miljon inmatade tokens, 18 yuan (~2,50 USD) per miljon utmatade tokens och 0,3 yuan (~0,04 USD) per miljon tokens för cacheträffar. Utmatning på ungefär 2,50 USD per miljon ligger långt under de 25 USD per miljon som ett ledande slutet frontlinjemodell tar för utmatning, och den billiga cacheträffsatsen gör långa agentiska loopar – där samma systemprompt och konversationsprefix skickas om ständigt – ovanligt prisvärda.
Tencent erbjuder också två veckors fri åtkomst till Tencent Hy4 Preview i WorkBuddy och CodeBuddy medan modellen är ny, så det billigaste sättet att prova den den här veckan är gratis – och det är i WorkBuddy som produktivitetspositioneringen blir konkret. I alla WorkBuddy-konversationer växlar modellväljaren mellan Hy3 och Hy4 Preview, så uppdelningen mellan kontorsproduktivitet och analysarbete å ena sidan och kodning å den andra är ett val per uppgift snarare än ett beslut om driftsättning. Den uppdelningen matchar den inriktning Tencent har gett modellen, och praktiska tester i WorkBuddy visar att den klarar komplexa artefakter i ett enda steg – en spelbar prototyp av ett low-poly-spel från en enda prompt, en fullständig kvartalsvis verksamhetsgenomgång sammanställd från tio bilagor utan några manuella ingrepp, och, i testdemon som cirkulerade den här veckan, en simulering av ett svart hål. Det här är observationer från communityn på Tencents egen app snarare än leverantörsriktmärken – men de är de första praktiska signalerna på vad modellen gör i verkliga flerstegsuppgifter, och de är gratis att reproducera innan du spenderar något.
Kostnadsbeslutet är precis där ett routinglager förändrar kalkylen, och vi kommer att vara ärliga med vår egen del i det: OrcaRouter routar ännu inte Tencent Hy4 Preview, eftersom Tencent inte har öppnat den här modellen för tredjepartsinferensplattformar — den körs på Tencents egen TokenHub-slutpunkt och på självhostade distributioner av de öppna vikterna, och vi gör inte anspråk på att servera det vi inte serverar. Det routinglagret tillför är beslutsramverket runt omkring. Om du väljer mellan en 8-GPU-nod och ett API, gäller samma pass-through-disciplin som resten av katalogen bygger på den dag Tencent öppnar upp detta: OrcaRouter förmedlar leverantörernas listpriser utan påslag, så en prissänkning från en leverantör är live hos oss samma dag i stället för att säljas vidare med påslag. Och för en två dagar gammal modell vars enda bevis är leverantörens benchmarkresultat, är automatisk failover det säkra sättet att testa den — placera den beprövade modellen på din kritiska sökväg och Tencent Hy4 Preview bredvid den, växla in på uppgifter där dess kostnadsprofil vinner och växla tillbaka i samma ögonblick som den inte gör det, allt genom ett API och en nyckel.

Gränserna som inte får plats på ett specifikationsblad
Tencent listar de kända begränsningarna rakt på sak, och de bör forma varje driftsättningsbeslut. Tencent Hy4 Preview är en ren textmodell, punkt slut — inget vision- eller multimodalt inflöde — så allt som rör bild eller video hör hemma på en annan modell. Tencent flaggar också för långsam start vid komplexa uppgifter (långt tänkande innan första utdata) och en tendens att öververifiera sig själv, vilket bränner tokens på att dubbelkolla arbete som redan utförts. Den kombinationen är precis fel för latenskänslig chatt och precis tolerabel för offline batch-ingenjörsarbete, vilket talar om var Tencent förväntar sig att du kör den.
Två påståenden i lanseringsmaterialet förtjänar särskild uppmärksamhet eftersom de handlar om hur modellen byggdes, inte vad den presterade. Tencent säger att Tencent Hy4 Preview deltog i sin egen utveckling – den hjälpte till att optimera träningsmetoderna, datastrategin, utvärderingsramverken och de lågnivåoperatorer som producerade den, en tidig rekursiv självförbättringsslinga – och att den självständigt optimerade sitt eget inferenssystem för en 31,8 % end-to-end-genomströmningsökning jämfört med baslinjen. På den vetenskapliga sidan rapporterar Tencent att man flyttade fram den kända nedre gränsen för Blaschke–Lebesgue-problemet inom konvex geometri från 0,380799 till 0,41104, och en 2,0x snabbning av en simulering av ett fosfolipiddubbelskikt med 32 512 atomer, ned till 54,9 millisekunder per steg. Liksom allt annat på lanseringsdagen är detta Tencents egna uppgifter.
Och den viktigaste avsaknaden är verifiering. Det finns inga oberoende resultat för Tencent Hy4 Preview någonstans ännu – inte på en offentlig topplista, inte från ett tredjepartsutvärderingslabb, inte en Artificial Analysis-post. Modellen är för ny för det. Det interna expertblindtestet är en användbar signal om hur Tencents egna bedömare ser den mot GLM-5.3 och Kimi K3, men det är Tencents bedömare på Tencents uppgifter. Allt utöver specifikationsbladet är ett påstående som väntar på en kontroll.
Vem ska köra Tencent Hy4 Preview den här veckan?
Det ärliga svaret delas in i tre grupper den här veckan, och en av dem kräver ingen hårdvara alls. Om du bara vill känna på vad Tencent Hy4 Preview gör, är den kostnadsfria WorkBuddy-åtkomsten den snabbaste vägen — ingen GPU, ingen API-nyckel, öppna en konversation, byt modellväljaren till Hy4 preview och ge den en Work- eller Coding-uppgift. Om du har GPU:er och kör engineering-arbetsbelastningar i batch — långsiktiga agentiska uppgifter, analys i repository-skala, offlineutvärdering — är modellen värd ett seriöst test just nu: vikterna är öppna, kontextfönstret är i repository-skala, vLLM-vägen är ett enda kommando, och GGUF-bygget från lanseringsveckan sänker hårdvarutröskeln för en provkörning. Om du kör latenskänslig produktionschatt, eller något multimodalt, eller något där du inte har råd med en modell vars enda bevis är leverantörens egna riktmärken, vänta — Tencent har itererat ungefär varannan månad sedan februari, och de har redan sagt att nästa batch av Hy4-modeller är på väg, så previewen är uttryckligen en tidig iteration.
För alla andra är den användbara hållningen ett routingmönster: bevisa det bredvid en modell du redan litar på, till en kostnad du kan gå ifrån, och skala det bara där siffrorna håller för din egen arbetsbelastning. Det är vad en router finns för — den dag Tencent öppnar den här modellen för tredjepartsinferens ansluter den till katalogen med ett API, över 200 modeller och listprisgenomsläpp precis som alla andra, och redundans- och kompositionsverktygen kommer redan att finnas på plats. Tills dess ligger vikterna på Hugging Face, API:et på Tencent Cloud och gratisprovet i WorkBuddy — och påståendet att en modell med öppna vikter nådde toppskiktet av agentisk kodning har äntligen en specifik siffra kopplad till sig. Siffran är Tencents. Testet är ditt.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
