
Tencent HY4 Preview vs GPT-5.6 Sol: Påståendet om verktygsanrop som ställer Open Weights mot frontier
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Tencent HY4 Preview är den första open-weight-modellen på månader vars lanseringskort uttryckligen hävdar en seger över GPT-5.6 Sol. Siffran i fråga är Toolathlon-Verified, ett riktmärke för agentisk verktygsanrop, där Tencent rapporterar HY4 Preview på 74,1 – före Qwen3.8-Max och, enligt Tencents egen jämförelse, före GPT-5.6 Sol. På alla andra dimensioner är de två modellerna inte riktigt jämlikar: GPT-5.6 Sol är OpenAI:s stängda, flaggskeppsmodell av frontier-klass, oberoende uppmätt, och Tencent HY4 Preview är en förhandsversion med öppna vikter på 770 miljarder parametrar som släpptes i morse med en leverantörsrapporterad resultatrapport och ingen tredjepartsverifiering.
Så den intressanta frågan är inte ”vilken modell som är smartare” — det är huruvida en utmanare med öppna vikter till ungefär en sjättedel av Sols ingångspris trovärdigt kan göra anspråk på en bit av frontlinjen, och vad ett team bör göra med ett anspråk som för närvarande är overifierbart.
Påståendet som gör detta till en riktig match
Toolathlon-Verified mäter hur tillförlitligt en modell driver ett verktyg genom en hel agentisk uppgift — läser resultat, bestämmer nästa anrop, återhämtar sig från fel — snarare än hur väl den skriver en enskild funktion. Det spelar roll eftersom den största delen av den verkliga API-utgiften på frontmodeller går till agentloopar, inte till engångssvar. Tencents 74,1 på det riktmärket är det specifika påståendet som förde HY4 Preview in i GPT-5.6 Sols konversation, och det är värt att stanna upp en stund vid: det är den typen av siffra som, om den håller vid oberoende replikering, gör kostnadsdiskussionen mellan öppna vikter och stängda frontmodeller verklig. Om den inte håller blir det ännu ett leverantörsresultat som försvinner under en tredjeparts testmiljö.
Två sätt att köpa intelligens

Parametrar — HY4 Preview 770B totalt / 49B aktiva, öppna vikter jämfört med GPT-5.6 Sol, parameterantal ej offentliggjort, stängt API
• Kontext — HY4 Preview >1M tokens jämfört med GPT-5.6 Sol 1.05M tokens, 128K max utdata
• Pris per 1M — HY4 Preview ¥6 in / ¥18 ut (≈$0,85 / $2,50) jämfört med GPT-5.6 Sol $4,00 / $20,00 på basnivån, stigande till $8,00 / $30,00 för stora kontextförfrågningar, cacheläsningar $0,40
• Inmatningsmodaliteter — HY4 Preview endast text i denna förhandsversion vs GPT-5.6 Sol text- och bildinmatning
• Resonemangslägen — HY4 Preview saknar publicerad motsvarighet till GPT-5.6 Sol:s Ultra-läge (upp till 16 parallella subagenter) och Max resonemangsansträngning.
• Oberoende verifiering — HY4 Preview har ännu ingen, medan GPT-5.6 Sol finns på varje större ledartavla, med en 1.05M-kontext-rankning i toppskiktet av sammansatta långkontext-tester.
Priskolumnen är där hela matchen avgörs. På basnivån kostar GPT-5.6 Sol $4.00 för en miljon inmatningstokens och $20.00 för en miljon utmatningstokens. Tencent HY4 Preview kostar ungefär $0.85 och $2.50 vid nuvarande växelkurser. För en arbetsbelastning som förflyttar många utmatningstokens — vilket agentisk kodning gör — prissätts den öppna viktmodellen till ungefär en åttondel av den stängda, och den skillnaden kvarstår även med förbehållet att Sols siffror kommer med mycket mer verifiering bakom sig.
Där GPT-5.6 Sol fortfarande har övertaget.
Verifiering är den första fördelen. GPT-5.6 Sol har varit allmänt tillgänglig sedan 9 juli och oberoende uppmätt sedan: 88.8 på Terminal-Bench 2.1 vid basresonemang, 91.9 i Ultra-läge, 53.6 på Agents' Last Exam (ett rekord vid lansering), 94.6 på GPQA Diamond och 64.6 på SWE-bench Pro. OpenAI rapporterar också en förbättring på 54 % i token-effektivitet för agentiska programmeringsuppgifter jämfört med sitt eget tidigare flaggskepp. Det är siffror som du kan hitta återgivna utanför OpenAIs egen dokumentation, vilket är exakt den egenskap som Tencent HY4 Preview saknar idag.
Förmåga är den andra fördelen, och den är strukturell snarare än marginell. GPT-5.6 Sol accepterar bildinmatning; HY4 Preview är enbart text i denna förhandsversion, där Tencent medger att bildstöd får vänta till den fullständiga lanseringen. GPT-5.6 Sol levereras med Ultra-läge – en multi-agentkonfiguration som koordinerar parallella subagenter till tre till fyra gånger tokenkostnaden, användbar för just de långsiktiga ingenjörsuppgifter där de två modellerna faktiskt skulle konkurrera. Och Sols vägar för datoranvändning och programmatiska verktygsanrop är dokumenterade, använda i produktionsskala och belastningstestade. Tencents Toolathlon-Verified-påstående, om det går att replikera, minskar verktygsanvändningsklyftan; det sluter inte de multimodala eller multi-agent-klyftorna, vilket HY4 Preview inte försöker göra.
Där HY4 Preview verkligen är intressant
Lägg benchmark-teatern åt sidan, och tre verkliga saker återstår. För det första priset: vid ¥6/¥18 — ungefär $0,85/$2,50 — underbjuder Tencent alla västerländska frontmodeller på output-tokens med en faktor fyra till åtta, och underbjuder sina egna kinesiska open-weight-konkurrenter på input. För det andra de öppna vikterna: en 49B-aktiv MoE kan driftsättas på en enda nod på ett sätt som Sols icke-offentliggjorda arkitektur aldrig kommer att kunna, och vikterna finns redan på HuggingFace, ModelScope och GitHub. För det tredje kontexten och den tekniska utvecklingsbanan: DeepSWE 64.3 och ett kontextfönster på över 1M riktar sig mot samma långsiktiga agentiska arbetsbelastningar som Sols Ultra-läge siktar på, till en bråkdel av kostnaden.
Den ärliga reservationen är att inget av detta har överlevt kontakt med en oberoende benchmark. Självoptimeringsberättelsen som Tencent berättar — en 31,8-procentig förbättring av genomströmningen från början till slut, tack vare att modellen itererar på sin egen inferensstack — är internt uppmätt. Blindtestsegern över GLM 5.3 och Kimi K3 är internt genomförd. Allt intressant med HY4 Preview är idag ett påstående.
Beslutet
Om du bygger ett produktionssystem idag är GPT-5.6 Sol det försvarbara valet, och det nås via OrcaRouter till OpenAI:s eget nivåbaserade listpris — $4.00/$20.00 på basnivån, $8.00/$30.00 däröver, vidarebefordrat utan påslag, så alla leverantörsprisändringar är levande hos oss samma dag. Om ditt arbetsflöde är agentbaserat och verktygstungt innebär nivåstrukturen att du bör kontrollera dina faktiska inmatningsstorlekar mot $272K-token-tröskeln snarare än att anta ett fast pris.
Om du är villig att genomföra en skuggutvärdering är HY4 Preview tillräckligt billig för att vara värd en riktig sådan: dirigera din verktygsanropsbelastning genom Sol idag, kör samma prompts mot HY4 Preview via Tencents eget API och jämför resultaten på dina egna Toolathlon-liknande uppgifter. Och om de oberoende resultaten landar där Tencent säger att de kommer att göra, är bytesvägen kort — den öppna viktmodellen placeras i en router och din failover-regel byter endpoints, med leverantörens ¥6/¥18-taxa oförändrad. Det är den ärliga strukturen i denna matchning: en verifierad frontier-modell du kan bygga på idag, som möter en overifierad öppen utmanare som är tillräckligt billig att testa och positionerad för att göra prissamtalet till en fråga om hela klassen av öppna viktmodeller.


Vad du ska titta på
• Den första oberoende replikeringen av Toolathlon-Verified. Om en tredjepartsharness bekräftar HY4 Preview i 70-spannet, kollapsar argumentet att "öppna vikter inte kan utföra agentisk verktygsanvändning".
• Huruvida Tencent lanserar vision före den fullständiga Hy4-releasen. Text-only begränsar HY4 Preview till en strikt delmängd av de arbetsbelastningar som GPT-5.6 Sol hanterar.
• De faktiska token-kostnaderna från HY4 Previews tendens att tänka länge. Vid ¥18 per miljon utdata äter den mångordiga självverifieringen upp prisfördelen snabbare än på en $20-modell.
• Huruvida Sols differentierade prissättning får ännu en sänkning innan Hy4 lanseras fullt ut. Genomsläppet på en router innebär att en nedgång syns samma dag.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
