
Tencent HY4 Preview vs GPT-5.6 Sol: De tool-calling-claim die open gewichten tegen de frontier plaatst
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Tencent HY4 Preview is het eerste open-weight model in maanden waarvan de introductiekaart expliciet een overwinning op GPT-5.6 Sol claimt. Het getal in kwestie is Toolathlon-Verified, een benchmark voor agentic tool-calling, waarin Tencent voor HY4 Preview 74,1 rapporteert — vóór Qwen3.8-Max en, volgens de eigen vergelijking van Tencent, vóór GPT-5.6 Sol. Op alle andere vlakken zijn de twee modellen niet echt aan elkaar gewaagd: GPT-5.6 Sol is OpenAI's gesloten, toonaangevende, onafhankelijk gemeten frontiermodel, en Tencent HY4 Preview is een open-weight preview van 770 miljard parameters die vanochtend is uitgebracht met een door de leverancier gerapporteerde scorekaart en zonder verificatie door derden.
De interessante vraag is dus niet "welk model is slimmer" — het is de vraag of een open-gewichten-uitdager tegen ruwweg een zesde van Sols invoerprijs geloofwaardig aanspraak kan maken op een stuk van de frontlinie, en wat een team moet doen met een bewering die op dit moment niet verifieerbaar is.
De claim die dit een echte wedstrijd maakt.
Toolathlon-Verified meet hoe betrouwbaar een model een tool aanstuurt tijdens een volledige agentische taak — resultaten lezen, de volgende aanroep bepalen, herstellen van fouten — in plaats van hoe goed het een enkele functie schrijft. Dat is belangrijk omdat het grootste deel van de echte API-uitgaven aan frontier-modellen naar agent-loops gaat, niet naar one-shot-completions. De 74,1 van Tencent op die benchmark is de specifieke bewering die HY4 Preview in het gesprek van GPT-5.6 Sol plaatste, en het is de moeite waard om er even bij stil te staan: het is het soort getal dat, als het standhoudt bij onafhankelijke replicatie, het kostenverhaal van open-weights versus gesloten frontier-modellen concreet maakt. Als het geen stand houdt, wordt het weer een leveranciersscorecard die verdampt onder een testopstelling van derden.
Twee manieren om intelligentie te kopen

• Parameters — HY4 Preview 770B totaal / 49B actief, open gewichten vs GPT-5.6 Sol, aantal parameters niet bekendgemaakt, gesloten API
• Context — HY4 Preview >1M tokens vs GPT-5.6 Sol 1.05M tokens, 128K maximale output
• Prijs per 1M — HY4 Preview ¥6 input / ¥18 output (≈$0.85 / $2.50) versus GPT-5.6 Sol $4.00 / $20.00 in de basistier, oplopend tot $8.00 / $30.00 voor grote contextverzoeken, cache-uitlezingen $0.40
• Invoermodaliteiten — HY4 Preview alleen tekst in deze preview vs GPT-5.6 Sol tekst- en beeldinvoer
• Redeneringsmodi — HY4 Preview: geen gepubliceerd equivalent vs. GPT-5.6 Sol's Ultra-modus (tot 16 parallelle subagenten) en Max-redeneringsinspanning
• Onafhankelijke verificatie — HY4 Preview: nog geen; GPT-5.6 Sol: aanwezig op elk belangrijk leaderboard, met een 1.05M-context-ranking in de topcategorie van samengestelde long-context tests.
De prijskolom is waar de hele vergelijking zich afspeelt. Op het basistier kost GPT-5.6 Sol $4,00 per miljoen inputtokens en $20,00 per miljoen outputtokens. Tencent HY4 Preview kost ongeveer $0,85 en $2,50 tegen de huidige wisselkoersen. Voor een workload die veel outputtokens verplaatst — wat agentische codering doet — is het open-weight model geprijsd op ruwweg een achtste van het gesloten model, en dat verschil blijft bestaan, zelfs met het voorbehoud dat de cijfers van Sol veel meer verificatie achter zich hebben.
Waar GPT-5.6 Sol nog steeds het voordeel heeft
Verificatie is het eerste voordeel. GPT-5.6 Sol is sinds 9 juli algemeen beschikbaar en sindsdien onafhankelijk gemeten: 88.8 op Terminal-Bench 2.1 bij basisredenering, 91.9 in Ultra-modus, 53.6 op Agents' Last Exam (een record bij de release), 94.6 op GPQA Diamond, en een 64.6 op SWE-bench Pro. OpenAI rapporteert ook een 54% verbetering in token-efficiëntie bij agentische programmeertaken ten opzichte van zijn eigen vorige vlaggenschip. Dat zijn cijfers die je gereproduceerd kunt vinden buiten de eigen documentatie van OpenAI, precies de eigenschap die Tencent HY4 Preview vandaag de dag mist.
Capability is de tweede troef, en die is structureel in plaats van marginaal. GPT-5.6 Sol accepteert beeldinvoer; HY4 Preview is in deze preview uitsluitend tekst, waarbij Tencent erkent dat vision op de volledige release zal moeten wachten. GPT-5.6 Sol wordt geleverd met Ultra mode — een multi-agentconfiguratie die parallelle subagents coördineert tegen drie tot vier keer de tokenkosten, nuttig voor precies de langetermijn-engineeringtaken waar de twee modellen daadwerkelijk zouden concurreren. En de computer-use- en programmatische tool-calling-paden van Sol zijn gedocumenteerd, op productieschaal ingezet en onder belasting getest. De Toolathlon-Verified-claim van Tencent verkleint, als die repliceert, de tool-use-kloof; die sluit de multimodale of multi-agentkloven niet, die HY4 Preview niet probeert te dichten.
Waar HY4 Preview echt interessant is
Zet het benchmarktheater opzij, en er blijven drie echte dingen over. Ten eerste de prijs: met ¥6/¥18 — ongeveer $0.85/$2.50 — onderbiedt Tencent elk Westers frontier-model op output-tokens met een factor vier tot acht, en onderbiedt het zijn eigen Chinese open-weight-concurrenten op input. Ten tweede de open weights: een 49B-actieve MoE is op een enkele node inzetbaar op een manier die voor Sol's niet-openbaar gemaakte architectuur nooit zal gelden, en de weights staan al op HuggingFace, ModelScope en GitHub. Ten derde de context en het technische traject: DeepSWE 64.3 en een contextvenster van 1M+ zijn gericht op dezelfde langetermijn-agentische workloads waar Sol's Ultra-modus op mikt, tegen een fractie van de kosten.
De eerlijke kanttekening is dat niets hiervan het contact met een onafhankelijke benchmark heeft overleefd. Het zelfoptimalisatieverhaal dat Tencent vertelt — een end-to-end doorvoerwinst van 31,8% doordat het model op zijn eigen inferentiestack itereert — is intern gemeten. De overwinning in de blindtest op GLM 5.3 en Kimi K3 is intern uitgevoerd. Alles wat interessant is aan HY4 Preview is op dit moment nog een bewering.
De beslissing
Als je vandaag een productiesysteem bouwt, is GPT-5.6 Sol de verdedigbare keuze, en het is bereikbaar via OrcaRouter tegen OpenAI's eigen getrapte lijstprijs — $4,00/$20,00 op het basistarief, $8,00/$30,00 daarboven, doorgegeven zonder opslag, dus elke wijziging van de leveranciersprijs is dezelfde dag live aan onze kant. Als je workflow agentisch en tool-zwaar is, betekent de getrapte structuur dat je je werkelijke invoergroottes moet controleren tegen de drempel van $272K tokens in plaats van uit te gaan van een vast tarief.
Als je bereid bent een schaduwevaluatie uit te voeren, is HY4 Preview goedkoop genoeg om een echte evaluatie de moeite waard te maken: route je tool-calling-workload vandaag nog via Sol, draai dezelfde prompts tegen HY4 Preview via Tencent's eigen API en vergelijk op je eigen Toolathlon-achtige taken. En als de onafhankelijke scores uitkomen waar Tencent zegt dat ze zullen uitkomen, is het omschakeltraject kort — het open-weight-model schuift in een router en je failover-regel wisselt endpoints om, waarbij het tarief van de leverancier van ¥6/¥18 ongewijzigd wordt doorberekend. Dat is de eerlijke opzet van deze vergelijking: een geverifieerd frontier-model waar je vandaag op kunt bouwen, tegenover een ongeverifieerde open uitdager die goedkoop genoeg is om te testen en gepositioneerd om het prijsgesprek over de hele open-weight-klasse te laten gaan.


Wat te kijken
• De eerste onafhankelijke replicatie van Toolathlon-Verified. Als een third-party harness bevestigt dat HY4 Preview een score in de 70 haalt, stort het argument "open weights kunnen geen agentic tool use" in elkaar.
• Of Tencent visie uitbrengt vóór de volledige Hy4-release. Tekst-alleen beperkt HY4 Preview tot een strikte subset van de workloads die GPT-5.6 Sol aankan.
• De daadwerkelijke tokenrekeningen van HY4 Preview's neiging tot lang denken. Bij ¥18 per miljoen output vreet uitgebreide zelfverificatie het prijsvoordeel sneller op dan bij een model van $20.
• Of de getrapte prijsstelling van Sol nog een verlaging krijgt vóór de volledige lancering van Hy4. De doorvoer op een router betekent dat een daling dezelfde dag zichtbaar is.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
