
GPT-6 Astra vs Tencent HY4 Preview: Het ene model heeft een audittrail en het andere heeft een benchmarktabel
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Tencent HY4 Preview en GPT-6 Astra zijn de twee goedkoopste routes naar near-frontier agentic coding die vandaag beschikbaar zijn als je de cijfers van de leveranciers zelf leest, en het zijn de twee minst vergelijkbare modellen in die categorie als je die van iemand anders leest. Tencent HY4 Preview werd op 28 augustus 2026 uitgebracht en open-source gemaakt onder Apache 2.0, voor $0,834 per miljoen inputtokens en $2,501 per miljoen outputtokens, met een mixture-of-experts-architectuur van 770 miljard parameters, een contextvenster van meer dan een miljoen tokens en een uitvoerplafond van 64.000 tokens. GPT-6 Astra is algemeen beschikbaar sinds 3 september 2026 voor $10,00 en $50,00, met een venster van 1.050.000 tokens en een maximale uitvoer van 128.000. De sterke punten van Astra worden onderbouwd door acht gepubliceerde evaluaties van derden; die van HY4 Preview worden onderbouwd door Tencents eigen terminal-, tool-calling- en blindevaluatieruns, en door niets anders. Die asymmetrie betekent niet dat het goedkopere model zwakker is. Het betekent dat van deze twee vergelijkingen er één te controleren valt en de andere geloofd moet worden, en dat de praktische beslissingen daarmee samenhangen.
Wat de Apache 2.0-release je daadwerkelijk oplevert
De licentie is het deel van deze krachtmeting dat een prijstabel niet kan uitdrukken. Tencent HY4 Preview is geen gehoste teaser met open-weight-branding — de gewichten zijn downloadbaar van Hugging Face, GitHub, ModelScope en GitCode, wat betekent dat het model elke beslissing van Tencent over zijn eigen prijsstelling, zijn eigen endpoint of zijn eigen blijvende interesse om het te blijven aanbieden, overleeft.
• Architectuur — 770B totale parameters, 49B actief per token, 78 lagen, 256 gerouteerde experts plus één gedeelde expert, en een native multi-tokenvoorspellingslaag voor speculatieve decodingbr /> • Servingkenmerken — 54,6 outputtokens per seconde en een mediane tijd tot het eerste token van 6,26 seconden, gemeten over de routes van OrcaRouter gedurende een rollend venster van zeven dagenbr /> • Context en bovengrens — een venster van 1.048.576 tokens tegenover een maximale output van 64.000 tokensbr /> • Invoeroppervlak — alleen tekst; geen afbeelding, geen bestand, geen audiobr /> • Redeneerbesturing — drie niveaus: hoog, laag en geen, met hoog als standaard, plus een gedocumenteerde aanbeveling voor sampling met temperatuur 0,9 en top_p 1,0br /> • Betrouwbaarheid — een foutpercentage van 2,8% over hetzelfde venster van zeven dagen, tegenover 10,3% op de Astra-route
Dat laatste paar getallen is het meest bruikbare op deze pagina, en het is het soort cijfer dat geen enkele leverancier over zijn eigen model publiceert. De onafhankelijke benchmarkscores van Astra zijn hoger en zijn route heeft de afgelopen week ongeveer één op de tien verzoeken laten mislukken, terwijl een model zonder enige onafhankelijke scores één op de vijfendertig heeft laten mislukken. Geen van beide cijfers is een uitspraak over de modellen zelf — foutpercentages meten de route, de snelheidslimieten en de upstream, niet de gewichten — maar het zijn de cijfers die een productiesysteem daadwerkelijk ervaart.

Waar de cijfers van Tencent kunnen worden vergeleken met die van iemand anders
Voor zover het gepubliceerde bewijs reikt, is dit een werkelijk ongewone kans: Astra en HY4 Preview hebben beide een Terminal-Bench 2.1-cijfer, en slechts één daarvan is door de leverancier gerapporteerd.
• Terminal-Bench 2.1, waarbij een echte terminal wordt aangestuurd — GPT-6 Astra 88,4, onafhankelijk geëvalueerd; Tencent HY4 Preview 85,4, gerapporteerd door de leverancierbr /> • Tool-calling — Astra 41,4 op τ²-Banking, onafhankelijk geëvalueerd; HY4 Preview 74,1 op Toolathlon-Verified, gerapporteerd door de leverancier, op een andere testbr /> • Software-engineering — HY4 Preview 64,3 op DeepSWE, een stijging van 28,0 ten opzichte van zijn voorganger Hy3, gerapporteerd door de leverancierbr /> • Agenttaken — HY4 Preview 37,1 pass@1 op APEX-Agents, gerapporteerd door de leverancierbr /> • Menselijke voorkeur — een gemiddelde van 2,99 op 4,00 over 203 engineeringtaken die door 163 experts zijn beoordeeld, uitgevoerd door de leverancier, tegenover GLM-5.3 met 2,92 en Kimi K3 met 2,94br /> • Onafhankelijke index — GPT-6 Astra 54,7 op de Intelligence Index en 96,1 op GPQA Diamond, van derden; voor HY4 Preview bestaat geen gelijkwaardige index
De Terminal-Bench-rij is degene die het waard is om bij stil te staan. Een verschil van 3 punten tussen een onafhankelijke 88,4 en een door de leverancier gerapporteerde 85,4 valt ruim binnen het bereik dat een andere harness, een ander scaffold of een andere samplingtemperatuur kan opleveren, wat betekent dat de eerlijke lezing niet is "Astra is drie punten beter", maar "het goedkoopste open-weight model in deze categorie claimt pariteit, en die claim is op zijn minst plausibel". Tencents eigen framing is op dit punt zorgvuldig: het beschrijft DeepSWE als "geleidelijk de kloof verkleinen" in plaats van dichten, en de enige zuivere pariteitsclaim — het gelijkspel op Terminal-Bench met een top gesloten model van een andere leverancier — is precies de claim die het meest gebaat is bij een tweede meting.
Er is ook een verandering die het weten waard is, omdat die de economie verandert en niet de scores. Op 7 september 2026 doorvoerde Tencent een optimalisatie in de live preview-build waarvan het bedrijf zegt dat die het aantal redeneerstappen en het tokenverbruik per taak bij complex werk vermindert. Omdat het model per token factureert, verlaagt een lager aantal tokens per voltooide taak de kosten van de taak, ook al is het tarief per token niet veranderd. De omvang van die besparing is Tencents eigen meting en niemand buiten Tencent heeft die gereproduceerd — maar het mechanisme is reëel en het is de reden dat een preview die in augustus werd uitgebracht in oktober wezenlijk goedkoper kan zijn om te draaien dan de introductietekst bij de lancering suggereerde.
Het plafond van 64.000 tokens is de specificatie die de implementaties bepaalt.
Halverwege het specificatieblad staat de beperking die het eerst toeslaat, en dat is niet kwaliteit. De maximale output van HY4 Preview is 64.000 tokens tegenover 128.000 van Astra, voor een model waarvan het opgegeven doel codingagents en lange tool-use-ketens is. Een gegenereerd bestand, een patch voor meerdere bestanden, een lang gestructureerd rapport — dit zijn de outputs die tegen een plafond aanlopen, en bij een agent-run is de fout niet een iets slechter antwoord, maar een afgekapt antwoord dat de omringende pipeline moet detecteren en afhandelen.
Beide modellen verwerken ongeveer een miljoen tokens aan invoer, dus voor het lezen van documenten is het echt gelijkspel. Het verschil zit volledig aan de generatiekant, en het is een factor twee in plaats van een afrondingsfout. Tel daar het verschil in invoeroppervlak bij op — Astra accepteert afbeeldingen en bestanden, HY4 Preview is alleen tekst — en het beeld dat ontstaat is een duidelijke taakverdeling in plaats van een rangorde: het open-weightmodel voor agent-loops met tekst in, tekst uit, waarbij het eindproduct een tool call of een diff is, en het gesloten model voor alles wat naar iets moet kijken of iets lang moet schrijven.
Wat 20× de uitvoersnelheid oplevert, regel voor regel
• Invoerprijs — Tencent HY4 Preview $0,834 per 1M vs. GPT-6 Astra $10,00, ongeveer 12×br /> • Uitvoerprijs — HY4 Preview $2,501 per 1M vs. Astra $50,00, ongeveer 20×br /> • Gecachte invoer — HY4 Preview $0,042 per 1M vs. Astra $1,00, ongeveer 24×br /> • Stap voor lange verzoeken — Astra herprijst het hele verzoek boven 272.000 invoertokens naar $20,00 en $75,00; de kaart van HY4 Preview heeft geen equivalente stapbr /> • Effectief invoertarief bij een prompt van 400.000 tokens — HY4 Preview ongewijzigd op $0,834 vs. Astra $20,00, ongeveer 24×br /> • Kosten per miljoen tokens van een gewone agent-loop, verhouding invoer/uitvoer van 4:1 — HY4 Preview ongeveer $1,17 vs. Astra ongeveer $18,00br /> • Kosten van een maand met 100 miljoen tokens bij dezelfde verhouding — HY4 Preview ongeveer $117 vs. Astra ongeveer $1.800
De regel voor gecachte invoer is degene die het slechtst schaalt voor de dure kant, omdat agent-lussen bij elke beurt dezelfde systeemprompt en gespreksprefix opnieuw verzenden. Bij $0,042 tegenover $1,00 zijn de goedkoopste tokens van een lange lus 24 keer goedkoper op het Tencent-model, precies de workload waarin een klein verschil per token het snelst cumuleert. Kosten per taak, de maatstaf die dit zuiver zou beslechten, wordt helemaal niet door Tencent gepubliceerd — dus de enige manier om het getal te krijgen dat ertoe doet, is beide modellen door je eigen takenverzameling te laten lopen en het usage-object te lezen.

Wat een router hier toevoegt, met de foutpercentages in de hand
Beide modellen staan in de OrcaRouter-catalogus — tencent/hy4-preview en openai/gpt-6-astra — achter één OpenAI-compatibel endpoint, elk tegen het eigen lijsttarief van de provider, met 0% opslag doorgegeven. Dat laatste detail weegt bij dit tweetal zwaarder dan bij de meeste, want het lijsttarief van het Tencent-model wordt in yuan gepubliceerd: de dollarbedragen hierboven zijn het omgerekende tarief dat je daadwerkelijk ziet, niet een doorverkoopmarge, en als Tencent de prijs wijzigt, is die wijziging hier dezelfde dag live in plaats van bij de volgende contractvernieuwing.
De routing-DSL is waar de twee modellen ophouden alternatieven te zijn. De natuurlijke regel hiervoor is escalatie op uitvoer: stuur de loop naar het goedkope model, en wanneer een antwoord terugkomt dat is afgekapt tegen het plafond van 64.000 tokens of je controle niet doorstaat, probeer die stap dan opnieuw met openai/gpt-6-astra, dat twee keer zoveel ruimte voor uitvoer heeft. Automatische failover is de andere helft van het argument, en die is niet theoretisch wanneer een van de twee routes de afgelopen week bij één op de tien verzoeken een fout gaf — een lange agent-run die aan één model vastzit, sterft met zijn opgebouwde context, en geen van deze twee modellen is goedkoop genoeg om per ongeluk helemaal vanaf het begin opnieuw te draaien.

Wat zou deze vergelijking veranderen?
Drie dingen, in volgorde van hoeveel impact ze zouden hebben. Een onafhankelijke evaluatie van HY4 Preview — het model is al zes weken openbaar, heeft geen index van derden, geen gereproduceerd Terminal-Bench-cijfer en geen kostencijfer per taak, en de enige door de leverancier uitgevoerde blinde evaluatie is de enige data over menselijke voorkeuren die bestaat. Een gepubliceerde kostprijs per voltooide taak voor beide modellen, die elke ratio in dit artikel zou vervangen door één getal. En een beslissing van Tencent over inferentie door derden, want Apache 2.0-gewichten kunnen door iedereen worden geserveerd, en zodra concurrerende hosts HY4 Preview opzetten, wordt de prijs aan de goedkope kant van deze vergelijking een marktprijs in plaats van een lijstprijs.
Tot die tijd is de bruikbare samenvatting nauwer dan de lanceringspost van beide leveranciers en eerlijker dan een scorebord: GPT-6 Astra is het model waarvan de capaciteitsclaims zijn gecontroleerd, met een twee keer zo hoog uitvoerplafond en een route die één op de tien verzoeken laat mislukken. Tencent HY4 Preview is het model waarvan de capaciteitsclaims niet zijn gecontroleerd, met een gepubliceerde architectuur, een open licentie, een derde van de prijs en een veel lager foutenpercentage over hetzelfde venster. Als je werk tekst-in, tekst-uit is en binnen 64.000 gegenereerde tokens past, is het goedkopere model geen compromis — het is het juiste antwoord, en de audittrail is het enige dat je opgeeft.
De natuurlijke regel voor dit paar is escalatie op output: stuur de loop naar het goedkope model, en wanneer een antwoord terugkomt dat is afgekapt tegen het plafond van 64.000 tokens of je schemacontrole niet doorstaat, probeer die stap dan opnieuw met openai/gpt-6-astra, dat twee keer zoveel uitvoerruimte heeft.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
