Ett hero-titelkort för jämförelsen 'Tencent HY4 Preview vs GPT-5.6 Sol'. En central höjdpunkt har texten 'Toolathlon-Verified 74.1 – öppenviktspåståendet mot frontlinjen', med anteckningen 'Tencent rapporterar att dess modell ligger före GPT-5.6 Sol i agentisk verktygsanrop'. Vänstra kortet 'Tencent HY4 Preview' listar 'Öppna vikter, 770B / 49B aktiva', '¥6 / ¥18 per 1M', 'Inga oberoende poäng'. Högra kortet 'GPT-5.6 Sol' listar 'Stängt API, OpenAI-flaggskepp', '$4 / $20 bas per 1M', 'Terminal-Bench 2.1: 88.8'. En sidfot har texten 'HY4 Preview-siffror leverantörsrapporterade; Sol-siffror allmänt reproducerade'. OrcaRouter-logotypen är placerad i det nedre högra hörnet.
Guides & Insights

Tencent HY4 Preview vs GPT-5.6 Sol: Påståendet om verktygsanrop som ställer Open Weights mot frontier

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Tencent HY4 Preview är den första open-weight-modellen på månader vars lanseringskort uttryckligen hävdar en seger över GPT-5.6 Sol. Siffran i fråga är Toolathlon-Verified, ett riktmärke för agentisk verktygsanrop, där Tencent rapporterar HY4 Preview på 74,1 – före Qwen3.8-Max och, enligt Tencents egen jämförelse, före GPT-5.6 Sol. På alla andra dimensioner är de två modellerna inte riktigt jämlikar: GPT-5.6 Sol är Ope​nAI:s stängda, flaggskeppsmodell av frontier-klass, oberoende uppmätt, och Tencent HY4 Preview är en förhandsversion med öppna vikter på 770 miljarder parametrar som släpptes i morse med en leverantörsrapporterad resultatrapport och ingen tredjepartsverifiering.

Så den intressanta frågan är inte ”vilken modell som är smartare” — det är huruvida en utmanare med öppna vikter till ungefär en sjättedel av Sols ingångspris trovärdigt kan göra anspråk på en bit av frontlinjen, och vad ett team bör göra med ett anspråk som för närvarande är overifierbart.

Påståendet som gör detta till en riktig match

Toolathlon-Verified mäter hur tillförlitligt en modell driver ett verktyg genom en hel agentisk uppgift — läser resultat, bestämmer nästa anrop, återhämtar sig från fel — snarare än hur väl den skriver en enskild funktion. Det spelar roll eftersom den största delen av den verkliga API-utgiften på frontmodeller går till agentloopar, inte till engångssvar. Tencents 74,1 på det riktmärket är det specifika påståendet som förde HY4 Preview in i GPT-5.6 Sols konversation, och det är värt att stanna upp en stund vid: det är den typen av siffra som, om den håller vid oberoende replikering, gör kostnadsdiskussionen mellan öppna vikter och stängda frontmodeller verklig. Om den inte håller blir det ännu ett leverantörsresultat som försvinner under en tredjeparts testmiljö.

Två sätt att köpa intelligens

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Parametrar — HY4 Preview 770B totalt / 49B aktiva, öppna vikter jämfört med GPT-5.6 Sol, parameterantal ej offentliggjort, stängt API

• Kontext — HY4 Preview >1M tokens jämfört med GPT-5.6 Sol 1.05M tokens, 128K max utdata

• Pris per 1M — HY4 Preview ¥6 in / ¥18 ut (≈$0,85 / $2,50) jämfört med GPT-5.6 Sol $4,00 / $20,00 på basnivån, stigande till $8,00 / $30,00 för stora kontextförfrågningar, cacheläsningar $0,40

• Inmatningsmodaliteter — HY4 Preview endast text i denna förhandsversion vs GPT-5.6 Sol text- och bildinmatning

• Resonemangslägen — HY4 Preview saknar publicerad motsvarighet till GPT-5.6 Sol:s Ultra-läge (upp till 16 parallella subagenter) och Max resonemangsansträngning.

• Oberoende verifiering — HY4 Preview har ännu ingen, medan GPT-5.6 Sol finns på varje större ledartavla, med en 1.05M-kontext-rankning i toppskiktet av sammansatta långkontext-tester.

Priskolumnen är där hela matchen avgörs. På basnivån kostar GPT-5.6 Sol $4.00 för en miljon inmatningstokens och $20.00 för en miljon utmatningstokens. Tencent HY4 Preview kostar ungefär $0.85 och $2.50 vid nuvarande växelkurser. För en arbetsbelastning som förflyttar många utmatningstokens — vilket agentisk kodning gör — prissätts den öppna viktmodellen till ungefär en åttondel av den stängda, och den skillnaden kvarstår även med förbehållet att Sols siffror kommer med mycket mer verifiering bakom sig.

Där GPT-5.6 Sol fortfarande har övertaget.

Verifiering är den första fördelen. GPT-5.6 Sol har varit allmänt tillgänglig sedan 9 juli och oberoende uppmätt sedan: 88.8 på Terminal-Bench 2.1 vid basresonemang, 91.9 i Ultra-läge, 53.6 på Agents' Last Exam (ett rekord vid lansering), 94.6 på GPQA Diamond och 64.6 på SWE-bench Pro. Ope​nAI rapporterar också en förbättring på 54 % i token-effektivitet för agentiska programmeringsuppgifter jämfört med sitt eget tidigare flaggskepp. Det är siffror som du kan hitta återgivna utanför Ope​nAIs egen dokumentation, vilket är exakt den egenskap som Tencent HY4 Preview saknar idag.

Förmåga är den andra fördelen, och den är strukturell snarare än marginell. GPT-5.6 Sol accepterar bildinmatning; HY4 Preview är enbart text i denna förhandsversion, där Tencent medger att bildstöd får vänta till den fullständiga lanseringen. GPT-5.6 Sol levereras med Ultra-läge – en multi-agentkonfiguration som koordinerar parallella subagenter till tre till fyra gånger tokenkostnaden, användbar för just de långsiktiga ingenjörsuppgifter där de två modellerna faktiskt skulle konkurrera. Och Sols vägar för datoranvändning och programmatiska verktygsanrop är dokumenterade, använda i produktionsskala och belastningstestade. Tencents Toolathlon-Verified-påstående, om det går att replikera, minskar verktygsanvändningsklyftan; det sluter inte de multimodala eller multi-agent-klyftorna, vilket HY4 Preview inte försöker göra.

Där HY4 Preview verkligen är intressant

Lägg benchmark-teatern åt sidan, och tre verkliga saker återstår. För det första priset: vid ¥6/¥18 — ungefär $0,85/$2,50 — underbjuder Tencent alla västerländska frontmodeller på output-tokens med en faktor fyra till åtta, och underbjuder sina egna kinesiska open-weight-konkurrenter på input. För det andra de öppna vikterna: en 49B-aktiv MoE kan driftsättas på en enda nod på ett sätt som Sols icke-offentliggjorda arkitektur aldrig kommer att kunna, och vikterna finns redan på HuggingFace, ModelScope och GitHub. För det tredje kontexten och den tekniska utvecklingsbanan: DeepSWE 64.3 och ett kontextfönster på över 1M riktar sig mot samma långsiktiga agentiska arbetsbelastningar som Sols Ultra-läge siktar på, till en bråkdel av kostnaden.

Den ärliga reservationen är att inget av detta har överlevt kontakt med en oberoende benchmark. Självoptimeringsberättelsen som Tencent berättar — en 31,8-procentig förbättring av genomströmningen från början till slut, tack vare att modellen itererar på sin egen inferensstack — är internt uppmätt. Blindtestsegern över GLM 5.3 och Kimi K3 är internt genomförd. Allt intressant med HY4 Preview är idag ett påstående.

Beslutet

Om du bygger ett produktionssystem idag är GPT-5.6 Sol det försvarbara valet, och det nås via OrcaRouter till Ope​nAI:s eget nivåbaserade listpris — $4.00/$20.00 på basnivån, $8.00/$30.00 däröver, vidarebefordrat utan påslag, så alla leverantörsprisändringar är levande hos oss samma dag. Om ditt arbetsflöde är agentbaserat och verktygstungt innebär nivåstrukturen att du bör kontrollera dina faktiska inmatningsstorlekar mot $272K-token-tröskeln snarare än att anta ett fast pris.

Om du är villig att genomföra en skuggutvärdering är HY4 Preview tillräckligt billig för att vara värd en riktig sådan: dirigera din verktygsanropsbelastning genom Sol idag, kör samma prompts mot HY4 Preview via Tencents eget API och jämför resultaten på dina egna Toolathlon-liknande uppgifter. Och om de oberoende resultaten landar där Tencent säger att de kommer att göra, är bytesvägen kort — den öppna viktmodellen placeras i en router och din failover-regel byter endpoints, med leverantörens ¥6/¥18-taxa oförändrad. Det är den ärliga strukturen i denna matchning: en verifierad frontier-modell du kan bygga på idag, som möter en overifierad öppen utmanare som är tillräckligt billig att testa och positionerad för att göra prissamtalet till en fråga om hela klassen av öppna viktmodeller.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

Vad du ska titta på

• Den första oberoende replikeringen av Toolathlon-Verified. Om en tredjepartsharness bekräftar HY4 Preview i 70-spannet, kollapsar argumentet att "öppna vikter inte kan utföra agentisk verktygsanvändning".

• Huruvida Tencent lanserar vision före den fullständiga Hy4-releasen. Text-only begränsar HY4 Preview till en strikt delmängd av de arbetsbelastningar som GPT-5.6 Sol hanterar.

• De faktiska token-kostnaderna från HY4 Previews tendens att tänka länge. Vid ¥18 per miljon utdata äter den mångordiga självverifieringen upp prisfördelen snabbare än på en $20-modell.

• Huruvida Sols differentierade prissättning får ännu en sänkning innan Hy4 lanseras fullt ut. Genomsläppet på en router innebär att en nedgång syns samma dag.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube