Een hero-titelkaart voor de vergelijking 'Tencent HY4 Preview vs GPT-5.6 Sol'. Een centrale highlight luidt 'Toolathlon-Verified 74.1 - de open-gewichtenclaim tegen de frontier', geannoteerd 'Tencent rapporteert dat zijn model voorloopt op GPT-5.6 Sol bij agentische tool-calling'. Linkerkaart 'Tencent HY4 Preview' vermeldt 'Open gewichten, 770B / 49B actief', '¥6 / ¥18 per 1M', 'Geen onafhankelijke scores'. Rechterkaart 'GPT-5.6 Sol' vermeldt 'Gesloten API, OpenAI-vlaggenschip', '$4 / $20 basis per 1M', 'Terminal-Bench 2.1: 88.8'. Een voettekst luidt 'HY4 Preview-cijfers zijn door de leverancier gerapporteerd; Sol-cijfers zijn breed gereproduceerd.' Het OrcaRouter-logo is rechtsonder in de hoek geplaatst.
Guides & Insights

Tencent HY4 Preview vs GPT-5.6 Sol: De tool-calling-claim die open gewichten tegen de frontier plaatst

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Tencent HY4 Preview is het eerste open-weight model in maanden waarvan de introductiekaart expliciet een overwinning op GPT-5.6 Sol claimt. Het getal in kwestie is Toolathlon-Verified, een benchmark voor agentic tool-calling, waarin Tencent voor HY4 Preview 74,1 rapporteert — vóór Qwen3.8-Max en, volgens de eigen vergelijking van Tencent, vóór GPT-5.6 Sol. Op alle andere vlakken zijn de twee modellen niet echt aan elkaar gewaagd: GPT-5.6 Sol is Ope​nAI's gesloten, toonaangevende, onafhankelijk gemeten frontiermodel, en Tencent HY4 Preview is een open-weight preview van 770 miljard parameters die vanochtend is uitgebracht met een door de leverancier gerapporteerde scorekaart en zonder verificatie door derden.

De interessante vraag is dus niet "welk model is slimmer" — het is de vraag of een open-gewichten-uitdager tegen ruwweg een zesde van Sols invoerprijs geloofwaardig aanspraak kan maken op een stuk van de frontlinie, en wat een team moet doen met een bewering die op dit moment niet verifieerbaar is.

De claim die dit een echte wedstrijd maakt.

Toolathlon-Verified meet hoe betrouwbaar een model een tool aanstuurt tijdens een volledige agentische taak — resultaten lezen, de volgende aanroep bepalen, herstellen van fouten — in plaats van hoe goed het een enkele functie schrijft. Dat is belangrijk omdat het grootste deel van de echte API-uitgaven aan frontier-modellen naar agent-loops gaat, niet naar one-shot-completions. De 74,1 van Tencent op die benchmark is de specifieke bewering die HY4 Preview in het gesprek van GPT-5.6 Sol plaatste, en het is de moeite waard om er even bij stil te staan: het is het soort getal dat, als het standhoudt bij onafhankelijke replicatie, het kostenverhaal van open-weights versus gesloten frontier-modellen concreet maakt. Als het geen stand houdt, wordt het weer een leveranciersscorecard die verdampt onder een testopstelling van derden.

Twee manieren om intelligentie te kopen

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• Parameters — HY4 Preview 770B totaal / 49B actief, open gewichten vs GPT-5.6 Sol, aantal parameters niet bekendgemaakt, gesloten API

• Context — HY4 Preview >1M tokens vs GPT-5.6 Sol 1.05M tokens, 128K maximale output

• Prijs per 1M — HY4 Preview ¥6 input / ¥18 output (≈$0.85 / $2.50) versus GPT-5.6 Sol $4.00 / $20.00 in de basistier, oplopend tot $8.00 / $30.00 voor grote contextverzoeken, cache-uitlezingen $0.40

• Invoermodaliteiten — HY4 Preview alleen tekst in deze preview vs GPT-5.6 Sol tekst- en beeldinvoer

• Redeneringsmodi — HY4 Preview: geen gepubliceerd equivalent vs. GPT-5.6 Sol's Ultra-modus (tot 16 parallelle subagenten) en Max-redeneringsinspanning

• Onafhankelijke verificatie — HY4 Preview: nog geen; GPT-5.6 Sol: aanwezig op elk belangrijk leaderboard, met een 1.05M-context-ranking in de topcategorie van samengestelde long-context tests.

De prijskolom is waar de hele vergelijking zich afspeelt. Op het basistier kost GPT-5.6 Sol $4,00 per miljoen inputtokens en $20,00 per miljoen outputtokens. Tencent HY4 Preview kost ongeveer $0,85 en $2,50 tegen de huidige wisselkoersen. Voor een workload die veel outputtokens verplaatst — wat agentische codering doet — is het open-weight model geprijsd op ruwweg een achtste van het gesloten model, en dat verschil blijft bestaan, zelfs met het voorbehoud dat de cijfers van Sol veel meer verificatie achter zich hebben.

Waar GPT-5.6 Sol nog steeds het voordeel heeft

Verificatie is het eerste voordeel. GPT-5.6 Sol is sinds 9 juli algemeen beschikbaar en sindsdien onafhankelijk gemeten: 88.8 op Terminal-Bench 2.1 bij basisredenering, 91.9 in Ultra-modus, 53.6 op Agents' Last Exam (een record bij de release), 94.6 op GPQA Diamond, en een 64.6 op SWE-bench Pro. Ope​nAI rapporteert ook een 54% verbetering in token-efficiëntie bij agentische programmeertaken ten opzichte van zijn eigen vorige vlaggenschip. Dat zijn cijfers die je gereproduceerd kunt vinden buiten de eigen documentatie van Ope​nAI, precies de eigenschap die Tencent HY4 Preview vandaag de dag mist.

Capability is de tweede troef, en die is structureel in plaats van marginaal. GPT-5.6 Sol accepteert beeldinvoer; HY4 Preview is in deze preview uitsluitend tekst, waarbij Tencent erkent dat vision op de volledige release zal moeten wachten. GPT-5.6 Sol wordt geleverd met Ultra mode — een multi-agentconfiguratie die parallelle subagents coördineert tegen drie tot vier keer de tokenkosten, nuttig voor precies de langetermijn-engineeringtaken waar de twee modellen daadwerkelijk zouden concurreren. En de computer-use- en programmatische tool-calling-paden van Sol zijn gedocumenteerd, op productieschaal ingezet en onder belasting getest. De Toolathlon-Verified-claim van Tencent verkleint, als die repliceert, de tool-use-kloof; die sluit de multimodale of multi-agentkloven niet, die HY4 Preview niet probeert te dichten.

Waar HY4 Preview echt interessant is

Zet het benchmarktheater opzij, en er blijven drie echte dingen over. Ten eerste de prijs: met ¥6/¥18 — ongeveer $0.85/$2.50 — onderbiedt Tencent elk Westers frontier-model op output-tokens met een factor vier tot acht, en onderbiedt het zijn eigen Chinese open-weight-concurrenten op input. Ten tweede de open weights: een 49B-actieve MoE is op een enkele node inzetbaar op een manier die voor Sol's niet-openbaar gemaakte architectuur nooit zal gelden, en de weights staan al op HuggingFace, ModelScope en GitHub. Ten derde de context en het technische traject: DeepSWE 64.3 en een contextvenster van 1M+ zijn gericht op dezelfde langetermijn-agentische workloads waar Sol's Ultra-modus op mikt, tegen een fractie van de kosten.

De eerlijke kanttekening is dat niets hiervan het contact met een onafhankelijke benchmark heeft overleefd. Het zelfoptimalisatieverhaal dat Tencent vertelt — een end-to-end doorvoerwinst van 31,8% doordat het model op zijn eigen inferentiestack itereert — is intern gemeten. De overwinning in de blindtest op GLM 5.3 en Kimi K3 is intern uitgevoerd. Alles wat interessant is aan HY4 Preview is op dit moment nog een bewering.

De beslissing

Als je vandaag een productiesysteem bouwt, is GPT-5.6 Sol de verdedigbare keuze, en het is bereikbaar via OrcaRouter tegen Ope​nAI's eigen getrapte lijstprijs — $4,00/$20,00 op het basistarief, $8,00/$30,00 daarboven, doorgegeven zonder opslag, dus elke wijziging van de leveranciersprijs is dezelfde dag live aan onze kant. Als je workflow agentisch en tool-zwaar is, betekent de getrapte structuur dat je je werkelijke invoergroottes moet controleren tegen de drempel van $272K tokens in plaats van uit te gaan van een vast tarief.

Als je bereid bent een schaduwevaluatie uit te voeren, is HY4 Preview goedkoop genoeg om een echte evaluatie de moeite waard te maken: route je tool-calling-workload vandaag nog via Sol, draai dezelfde prompts tegen HY4 Preview via Tencent's eigen API en vergelijk op je eigen Toolathlon-achtige taken. En als de onafhankelijke scores uitkomen waar Tencent zegt dat ze zullen uitkomen, is het omschakeltraject kort — het open-weight-model schuift in een router en je failover-regel wisselt endpoints om, waarbij het tarief van de leverancier van ¥6/¥18 ongewijzigd wordt doorberekend. Dat is de eerlijke opzet van deze vergelijking: een geverifieerd frontier-model waar je vandaag op kunt bouwen, tegenover een ongeverifieerde open uitdager die goedkoop genoeg is om te testen en gepositioneerd om het prijsgesprek over de hele open-weight-klasse te laten gaan.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

Wat te kijken

• De eerste onafhankelijke replicatie van Toolathlon-Verified. Als een third-party harness bevestigt dat HY4 Preview een score in de 70 haalt, stort het argument "open weights kunnen geen agentic tool use" in elkaar.

• Of Tencent visie uitbrengt vóór de volledige Hy4-release. Tekst-alleen beperkt HY4 Preview tot een strikte subset van de workloads die GPT-5.6 Sol aankan.

• De daadwerkelijke tokenrekeningen van HY4 Preview's neiging tot lang denken. Bij ¥18 per miljoen output vreet uitgebreide zelfverificatie het prijsvoordeel sneller op dan bij een model van $20.

• Of de getrapte prijsstelling van Sol nog een verlaging krijgt vóór de volledige lancering van Hy4. De doorvoer op een router betekent dat een daling dezelfde dag zichtbaar is.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube