Hero-titelkort för 'Tencent HY4 Preview vs tencent-hy3'. En rubrik lyder 'Sex gånger priset — och vad språnget faktiskt ger'. Vänster panel 'Tencent HY4 Preview' (NYTT FLAGGSKEPP, 28 aug 2026) med chips '770B / 49B MoE', '1M kontext', 'DeepSWE 64.3'. Höger panel 'tencent-hy3' (BEVISAD ARBETSHÄST) med chips '295B / 21B MoE', '256K kontext', 'DeepSWE 28.0'. En sidfot lyder 'Pris ¥6/¥18 vs ¥1/¥4 per MTok. Prestandasiffror enligt leverantör.'
Guides & Insights

Tencent HY4 Preview vs tencent-hy3: Sex gånger priset, och vad språnget faktiskt ger

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Tencent HY4 Preview är den första modellen i Hunyuan-familjen som medvetet får sin föregångare att framstå som billig: Tencent listar den till sex gånger tencent-hy3:s inmatningspris och fyra och en halv gånger dess utmatningspris, och lanseringsmaterialet hävdar att premiumpriset är välförtjänt. Släppt och open-sourcad den 28 augusti 2026 rapporterar Tencent HY4 Preview en programvaruteknikpoäng på DeepSWE som mer än fördubblar Hy3:s 28,0, en terminalhanterande 85,4 på Terminal-Bench 2.1, och ett kontextfönster som hoppar från 256K till över en miljon tokens. tencent-hy3, som blev officiell den 6 juli, är familjens mogna arbetshäst – 295B totala parametrar, 21B aktiva, en fjärdedel av kontexten, och en prislapp närmare ett avrundningsfel. Det här är ingen tävling som specifikationsbladet lämnar jämn. Frågan är om gapet är värt pengarna för det du faktiskt kör, och svaret varierar beroende på arbetsbelastning.

Poängtavlan: där de två faktiskt skiljer sig åt.

Alla riktmärken i Tencents material är leverantörsrapporterade — körda på Tencents egna utvärderingsmiljöer vid varje modellslansering, ej reproducerade av ett oberoende labb, och för flaggskeppet har modellen varit offentlig i mindre än en dag. Betrakta poängen som det tak Tencent tror sig ha nått, och väg mönstret tyngre än någon enskild siffra. Mönstret är omisskännligt, och det är koncentrerat till agentiskt ingenjörsarbete snarare än allmän kunskap:

• DeepSWE — Tencent HY4 Preview: 64,3. tencent-hy3: 28,0. Detta är det största enskilda hoppet i parningen, en mer än fördubbling på ett benchmark för mjukvaruutveckling i repository-skala, och det är siffran som skiljer en chattmodell från en modell som du ger en hel kodbas.

• Terminal-Bench 2.1 — Tencent HY4 Preview: 85,4, vilket Tencent säger matchar Claude Opus 5 och slår DeepSeek V4 Pro. tencent-hy3: 71,7 enligt vad som rapporterades vid lanseringen i juli. Att driva en riktig terminal till slutförande i flerstegsuppgifter är precis den typ av långsiktigt arbete som Hy3 var svagast på.

• Toolathlon-Verified — Tencent HY4 Preview: 74,1, vilket Tencent uppger överträffar Qwen 3.8 Max och GPT-5.6 Sol. Ingen jämförbar Hy3-siffra publicerades.

• Internt blindtest — {{1}}163 experter betygsatte 203 ingenjörsuppgifter med 2,99/4,00 för Tencent HY4 Preview, något före GLM-5.3:s 2,92 och Kimi K3:s 2,94.{{/1}} {{2}}Detta är Tencents granskare på Tencents uppgifter; behandla det som vägledande.{{/2}}

A two-column comparison scoreboard titled 'Tencent HY4 Preview vs tencent-hy3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active params: 770B / 49B', 'Context window: 1M', 'DeepSWE: 64.3', 'Terminal-Bench 2.1: 85.4', 'Input price per MTok: ¥6 (~$0.85)', 'Output price per MTok: ¥18 (~$2.50)'. Right column 'tencent-hy3': 'Total / active params: 295B / 21B', 'Context window: 256K', 'DeepSWE: 28.0', 'Terminal-Bench 2.1: 71.7', 'Input price per MTok: ¥1 (~$0.14)', 'Output price per MTok: ¥4 (~$0.56)'. A footer reads 'Benchmarks vendor-reported by Tencent at each model's launch.'

Den röda tråden: vinsterna ligger i terminalstyrning, verktygsanrop och uppgifter på repositorieskala — den produktivitetspositionering som Tencent har drivit sedan Hy3, nu med beräkningskraften som stöd.

Prispremien, rad för rad

Här slutar jämförelsen att handla om skryt. Tencents listpriser, per miljon tokens:

• Input — Tencent HY4 Preview: 6 yuan (~US$0.85). tencent-hy3: 1 yuan (~US$0.14). Sex gånger.

• Utdata — Tencent HY4 Preview: 18 yuan (~US$2,50). tencent-hy3: 4 yuan (~US$0,56). Fyra och en halv gånger.

• Cacheträff — Tencent HY4 Preview: 0,3 yuan. tencent-hy3: 0,25 yuan. Nästan samma, vilket spelar större roll än det verkar, eftersom agentiska loopar ständigt skickar om samma systemprompt och konversationsprefix.

Kör en realistisk agentisk kodningsarbetsbelastning genom den kombinerade siffran — säg 20 miljoner inmatningstokens och 4 miljoner utmatningstokens i månaden, en budget för en upptagen enmansutvecklaragent. Tencent HY4 Preview: 120 yuan plus 72 yuan, cirka 192 yuan (~27 US-dollar). tencent-hy3: 20 yuan plus 16 yuan, cirka 36 yuan (~5 US-dollar). Flaggskeppet kostar fem-plus gånger så mycket att köra vid samma tokenmix — och det kommer att begära fler utmatningstokens per uppgift, eftersom det tänker längre.

Det är inte en anledning att undvika Tencent HY4 Preview; DeepSWE-hoppet är exakt den typen av kapacitet som ett premium finns till för att köpas. Det är en anledning att prissätta arbetsbelastningen innan du dirigerar till den. Och det är här routinglagret förtjänar sin plats: tencent-hy3 finns redan på OrcaRouter till leverantörens listpris — 0 % påslag, så siffran du ser är den levererande leverantörens eget pris, inte en återförsåld och pålagd version av det — med automatisk failover mellan leverantörer, och en leverantörs prisändring går live hos oss samma dag.

Fyra gånger så mycket kontext, dubbelt så mycket aktiv beräkningskraft.

- Arkitektur — Tencent HY4 Preview: 770B totalt, 49B aktiv MoE. tencent-hy3: 295B totalt, 21B aktiv. Flagskeppsmodellen lägger ungefär 2,3 gånger så mycket beräkningskraft på varje token.

• Kontextfönster — Tencent HY4 Preview: över 1M tokens. tencent-hy3: 256K. Ett helt arkiv eller en batch med finansiella dokument får plats i flaggskeppets fönster som en enda begäran; på Hy3 kräver samma jobb uppdelning (chunking), hämtning (retrieval) eller en agentloop.

• Resonemangskontroll — tencent-hy3 har en per-förfrågan-inställning för reasoning_effort (no_think, low, high) samt ett spekulativt avkodningslager som håller det snabbt. Tencent HY4 Preview, enligt Tencent själva, tenderar till långt tänkande innan första utdata och öververifierar sig på komplexa uppgifter — vilket bränner tokens på att dubbelkolla arbete som den redan har gjort.

Den där sista raden är den underskattade skillnaden för latenskänslig användning. Hy3 kan instrueras att svara direkt; Tencent HY4 Preview, åtminstone i den här tidiga formen, kan ofta inte låta bli att tänka. För en chatt med låg latens eller en extraktionspipeline med hög genomströmning är flaggskeppets extra kapacitet bortkastad och dess extra tänkande är en kostnad. För ett offline-batchjobb inom teknik är kostnaden precis det som ger det bättre svaret.

Förhandsvisningsskatten: vad Hy3 fortfarande har

"Preview" ingår i namnet Tencent HY4 Preview, och det beter sig därefter. Det finns ingen vision eller multimodal inmatning – modellen är textbaserad, så allt som är relaterat till bild eller video ligger kvar på den modell du redan använder för det. Den två veckor långa gratisprenumerationen på WorkBuddy och CodeBuddy är ett smakprov, inte en plan. Tencent har varit tydliga med att detta är en tidig iteration av Hy4, med förbättringar av förträning och efterträning som fortfarande kommer, i en takt som har producerat en större version ungefär varannan månad sedan februari. Oberoende riktmärken för flaggskeppet: inga ännu, någonstans.

tencent-hy3 är motsatsen till allt detta. Det är en officiell, stabil version som har varit i produktion sedan juli. Dess kostnadsfria nivå löper till den 30 september. Dess resonemangsnivåer ger dig en ratt snarare än ett temperament, och dess spekulativa avkodningslager och 21B aktiva parametrar gör det till den billiga, snabba, förutsägbara hälften av denna familj — modellen du pekar på standardvägen och glömmer bort.

Screenshot of Tencent's official Hugging Face model card for the Hy4 Preview release, showing the model's open-weights download options, the 770B-parameter mixture-of-experts specification, and the million-token context window.

Vem ska välja vilken

Välj Tencent HY4 Preview när uppgiften är i fokus — en svår mjukvaruutvecklingsuppgift, ett sammanhang i repositorieskala, ett agentiskt arbetsflöde där ett bättre svar motiverar en fem gånger så hög tokenkostnad och du har råd med latensen hos en modell som tänker innan den talar. Välj tencent-hy3 när begränsningen är i fokus — hög genomströmning, låg latens, en snäv budget, eller vilken uppgift som helst där du vill att modellen ska svara snarare än att tänka efter.

Det praktiska mönstret för en sådan kombination är eskalering: dirigera den billiga, kontrollerbara modellen på standardsökvägen och eskalera till flaggskeppsmodellen endast när uppgiften kräver det. Det är vad OrcaRouters routing-DSL är till för — att komponera flera modeller till ett enda anrop så att policyn är konfiguration snarare än kod — och automatisk failover innebär att Hy3:s väg fortsätter att betjäna även när en leverantör försämras. OrcaRouter dirigerar ännu inte Tencent HY4 Preview; Tencent har inte öppnat modellen för tredjepartsinferens, så för närvarande körs den på leverantörens egen Tencent Cloud TokenHub-endpoint och på självhostade distributioner av de öppna vikterna. tencent-hy3 finns å andra sidan i katalogen idag till leverantörens listpris — och den dag flaggskeppsmodellen öppnas upp, placeras den i samma routinglager på samma sätt, vilket gör bytet från en modell till den andra till en ändring på en rad i stället för en omskrivning.

Screenshot of the OrcaRouter model page for tencent/hy3, showing its provider list price and availability through the one-API routing catalog — the half of this family that can be routed today.

Slutsatsen är tråkig på bästa sätt: flaggskeppet är värt premien för exakt det arbete det är prissatt för, och arbetshästen är fortfarande rätt val för allt som bara behöver bli gjort. Den sexfaldiga prisskillnaden är verklig, 28-till-64 DeepSWE-skillnaden är verklig, och ingen av dem tar ut den andra — du måste bara veta vilken du köper.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube