Gegenereerde hero-kaart met de titel Claude Sonnet 5.5 vs Tencent HY4 Preview, ondertitel: beide labs verkopen de tokenrekening, met drie statistiekkaarten: outputprijs per 1M $10,00 vs $2,50, gewichten closed vs Apache 2.0, en gemeten outputsnelheid 138,7 vs 22,3 tokens per seconde, met een footer met de prijs en snelheid van Tencent HY4 Preview volgens de catalogus van OrcaRouter, leverancierslijst 6 / 18 yuan per miljoen; Claude Sonnet 5.5 volgens Anthropic.
Guides & Insights

Claude Sonnet 5.5 vs Tencent HY4 Preview: Beide labs verkopen de tokenrekening

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee lanceringen, zes weken uit elkaar, die dezelfde belofte doen in andere bewoordingen. De claim van de leverancier is dat Claude Sonnet 5.5, uitgebracht op 28 september 2026, "tot 30% minder per taak" kost dan Claude Sonnet 5 bij ongewijzigde tarieven per token. De tweede claim is dat de optimalisatie van 7 september aan de gehoste build van Tencent HY4 Preview, voor het eerst uitgebracht en open-source gemaakt op 28 augustus 2026, redeneerstappen en tokenverbruik per taak vermindert bij dezelfde taakkwaliteit. Geen van beide leveranciers heeft een prijs verhoogd of verlaagd om die claim te doen. Beide vertellen je dat de tokens nu het product zijn, en het interessante deel van deze vergelijking is dat slechts één van de twee claims kan worden vergeleken met een gepubliceerd cijfer per taak — omdat slechts één van deze twee modellen een onafhankelijke meting heeft om het daaraan te toetsen.

Die asymmetrie is geen verwijt aan Tencent. HY4 Preview heeft geen modelpagina bij Artificial Analysis, geen onafhankelijke Intelligence Index-score en geen kosten-per-taakcijfer van welke derde partij dan ook. Wat het wel heeft, is een benchmarktabel van de leverancier — Terminal-Bench 2.1 op 85,4, DeepSWE 64,3, een interne blinde evaluatie over 203 engineeringtaken waarin het gemiddeld 2,99 scoorde tegenover GLM-5.3 met 2,92 en Kimi K3 met 2,94 — en een publiek debuut op de WebDev Arena-ranglijst op basis van stemmen van het publiek, waar Tencent meldt dat het rond de vijfde plaats in het algemeen en de derde plaats onder open-weightmodellen uitkomt. Dat zijn allemaal echte signalen. Geen ervan is een kosten-per-taak, wat betekent dat het exacte getal waarop beide leveranciers concurreren, voor HY4 Preview niet beschikbaar is.

Wat elke partij daadwerkelijk heeft uitgebracht

T​encent HY4 Preview is een mixture of experts met 770 miljard parameters en 49 miljard actieve per token, 78 lagen, 256 gerouteerde experts plus één gedeelde expert, een native MTP-laag voor speculatieve decoding, en een contextvenster dat een miljoen tokens overschrijdt. Het is bewust alleen voor tekst ontworpen — T​encent bouwde het voor codeeragenten, complex toolgebruik en productiviteitswerk, niet voor afbeeldingen — en het gebruikt standaard zwaar redeneren, met drie configureerbare niveaus (hoog, laag, geen) en een door de leverancier aanbevolen sampling-instelling van temperatuur 0,9 en top_p 1,0. De gewichten zijn Apache 2.0 en downloadbaar van Hugging Face, GitHub, ModelScope en GitCode. T​encent wees oorspronkelijk op twee ruwe kantjes in de preview: langer dan nodig nadenken en het eigen werk overmatig verifiëren, en de update van 7 september richt zich precies daarop.

Claude Sonnet 5.5 is het tweede 5.5-generatiemodel van A​nthropic en het model dat A​nthropic positioneert als de beste combinatie van snelheid en intelligentie in de line-up. Een context van één miljoen tokens, 128.000 uitvoertokens synchroon en 300.000 via de Message Batches API, tekst-, afbeeldings- en bestandsinvoer, adaptief denken bij selecteerbare inspanning, een kennisafsluitdatum van juni 2026, zero-dataretentie beschikbaar vanaf de lancering, en een ondergrens voor uitfasering van 28 september 2027. De tariefkaart is ongewijzigd ten opzichte van Claude Sonnet 5: $2,00 per miljoen input, $10,00 per miljoen output, $0,20 voor cachereads en $2,50 voor cachewrites. Gesloten gewichten, Anthro​pic API plus Bedrock, Goo​gle Cloud en Microsoft Foundry.

Leg de twee tegen elkaar aan en de posities zijn bijna symmetrisch:

• Prijs — Claude Sonnet 5.5 $2,00 in / $10,00 uit per miljoen vs. Tencent HY4 Preview $0,83 in / $2,50 uit in onze catalogus, uit een leverancierslijst van ¥6 / ¥18

• Cache-leesbewerkingen — Claude Sonnet 5.5 $0,20 per miljoen vs Tencent HY4 Preview $0,042 per miljoen in onze catalogus

• Gewichten — Claude Sonnet 5.5 gesloten vs Tencent HY4 Preview Apache 2.0, downloadbaar

• Context — Claude Sonnet 5.5 1.000.000 tokens vs Tencent HY4 Preview 1.048.576 tokens, in de praktijk identiek

• Maximale output — Claude Sonnet 5.5 128.000 synchroon, 300.000 bij Batches tegenover Tencent HY4 Preview 64.000 in onze catalogus

• Invoermodaliteit — Claude Sonnet 5.5 tekst, afbeelding en bestand vs Tencent HY4 Preview alleen tekst

• Onafhankelijke scores — Claude Sonnet 5.5 Intelligence Index 56 tegen $7,60 per taak, revisie v4.3.2 vs Tencent HY4 Preview: niets gepubliceerd

• Gemeten uitvoersnelheid — Claude Sonnet 5.5 138,7 tokens/sec vs. Tencent HY4 Preview 22,3 tokens/sec op ons eigen verkeer

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

De bewering die beide labs doen, en waarom een van hen controleerbaar is

Het "30% minder per taak" van Anthropic en het "minder redeneerstappen, lager tokenverbruik" van Tencent zijn hetzelfde engineeringproject, vanuit twee richtingen beschreven: zorg dat het model minder tokens verbruikt om tot hetzelfde antwoord te komen. Anthropic zegt expliciet dat de tarieven niet zijn veranderd, wat betekent dat elke besparing per taak uit tokenaantallen moet komen — en de onafhankelijke leaderboard laat je de vorm van het probleem zien in plaats van de omvang van de oplossing. Claude Sonnet 5.5 genereert 410 miljoen outputtokens in de Intelligence Index-evaluatie, tegenover 117 miljoen voor MiniMax M3 en 77 miljoen voor Grok 4.5. Het is een verbose model, gemeten, op een leaderboard dat het aantal publiceert. Wat de verbetering van 30% ten opzichte van Claude Sonnet 5 ook inhoudt, ze wordt toegepast op een zeer grote basis.

Voor HY4 Preview bestaat er geen openbaar equivalent cijfer. Tencents eigen optimalisatienota is de enige beschrijving ervan, en daarin wordt het resultaat zonder getal vermeld: minder beurten, minder invoer- en uitvoertokens, dezelfde kwaliteit, gevalideerd aan de hand van benchmarkmetrieken en menselijke evaluatie in een dubbele ronde. Dat is een leveranciersclaim in de strikte zin — gesteld, plausibel, niet gereproduceerd — en hier wordt dat ook zo bestempeld. Een previewmodel adopteren op grond van de token-economieclaim van een leverancier, terwijl de token-economie nu juist hetgeen is dat je van buitenaf niet kunt meten, is precies de gok die een previewrelease je vraagt te wagen.

Nog een complicatie is het weten waard voordat iemand een self-hosted deployment rond die optimalisatie plant. Tencents wijziging van 7 september geldt voor de build die Tencent op zijn eigen gehoste endpoints aanbiedt. De open-weight-snapshot is niet vernieuwd — de laatste wijzigingsdatum van de Hugging Face-repository is nog steeds 28 augustus — dus een self-hosted kopie van de gewichten draait het oorspronkelijke gedrag met langere redenering dat de previewnotities signaleerden. De geoptimaliseerde versie en de downloadbare versie zijn niet hetzelfde artefact.

Waar de open gewichten wél lonen, is op dezelfde plek waar ze dat altijd doen: een deployment die geen API kan aanroepen. Een model met 770B parameters en 49B actief is een datacenterbeslissing, niet een werkstationbeslissing, dus dit is niet het verhaal van de laptopklasse dat een 30B-model vertelt — maar voor een koper die het model binnen zijn eigen perimeter nodig heeft, is Apache 2.0 op die schaal een optie die Claude Sonnet 5.5 tegen geen enkele prijs biedt.

Een preview uitproberen zonder daarvoor een productiepad op het spel te zetten.

Previewmodellen zijn het geval waarin routing ophoudt een kostenoptimalisatie te zijn en een vorm van risicobeheersing wordt. De reden om een preview-build achter een router te zetten in plaats van die rechtstreeks aan te roepen, is dat een preview wordt gedefinieerd door de mogelijkheid dat deze onder je verandert, en de twee dingen die je van de laag ervoor wilt, zijn een procentuele verdeling en iets om de fouten op te vangen.

Dat is de vorm die OrcaRouter biedt: één OpenAI-compatibel endpoint dat meer dan 200 modellen dekt, de lijstprijs van de provider doorgegeven zonder enige opslag, automatische failover tussen upstreamproviders, en een routing-DSL om calls uit meerdere modellen samen te stellen. Tencent HY4 Preview is hier vandaag routeerbaar als tencent/hy4-preview tegen $0,83 input en $2,50 output per miljoen tokens met $0,042 cache-reads over het venster van 1.048.576 tokens — dezelfde build, tegen het tarief van de provider, bereikbaar met de sleutel die je al voor al het andere in de catalogus gebruikt. Claude Sonnet 5 is hier ook routeerbaar, tegen A​nthropics $2,00 en $10,00, en dat is het al sinds 30 juni; het is een voor de hand liggende failoverpartner terwijl een model dat één dag oud is productiebewijs opbouwt.

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5 zelf staat niet in onze catalogus. Het is gisteren uitgekomen, de route ernaartoe is de eigen API van Anthropic, en deze pagina zal niet het tegendeel suggereren — de kern van het routeringsadvies is dat de veilige manier om een gloednieuwe tier in productie te draaien is om er een deel van het verkeer naartoe te sturen met iets bewezen erachter, en dat werkt alleen als beide uiteinden van de constructie zich ergens bevinden dat je vanaf één plek kunt bereiken. HY4 Preview verwerkt hier wekelijks 372 duizend tokens aan verkeer, wat een preview van twee dagen oud laat zien voordat iemand zich eraan heeft verbonden; Claude Sonnet 5 verwerkt sinds 30 juni wekelijks 7,9 miljoen, en dat is het verschil tussen een kandidaat en een ondergrens.

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

Waar het geld daadwerkelijk naartoe gaat

Puur qua tarieven is HY4 Preview vier keer goedkoper op output dan Claude Sonnet 5.5 en bijna vijf keer goedkoper op cache-reads, en hij heeft hetzelfde venster. Wat de metingen betreft, genereert Claude Sonnet 5.5 zes keer sneller output op ons eigen verkeer — 138,7 tokens per seconde tegenover 22,3 — wat het soort kloof is dat een viervoudig tariefvoordeel omzet in een veel kleiner voordeel in kloktijd, en af en toe in een verlies, als er rekening wordt gehouden met wachtrijvorming.

Tussen die twee feiten berust de beslissing op vier vragen die alleen de lezer kan beantwoorden. Heeft het werk een afbeelding of een bestand in de prompt nodig? HY4 Preview ondersteunt alleen tekst en daarmee is de discussie ten einde. Moet het een softwaretaak met meerdere stappen voltooien, waarbij de score van HY4 Preview op Terminal-Bench 2.1, 85,4, het eigen cijfer van Tencent is en niet is gereproduceerd? Dan is de previewstatus het risico dat je aanvaardt, en is de optimalisatie van 7 september het waard om opnieuw te testen in plaats van erop te vertrouwen. Moet de workload binnen je eigen perimeter draaien? Dan zijn de Apache 2.0-gewichten de doorslaggevende factor. En is het samengestelde capaciteitsniveau belangrijker dan het tarief? Dan is de onafhankelijk gemeten 56 van Claude Sonnet 5.5 het cijfer om af te wegen, tegen $7,60 per Index-taak, met de kanttekening dat er aan de Tencent-kant geen equivalent cijfer bestaat om het mee te vergelijken.

Wat beide lanceringen echt aantonen, is dat de frontier tariefkaarten voorbij is. Twee labs, met zes weken ertussen, brachten modellen uit en zetten in op tokenverbruik per taak in plaats van prijs per miljoen tokens, en het praktische gevolg voor een koper is dat het bruikbare cijfer niet langer op de prijspagina van een van beide leveranciers staat. Het is het aantal tokens dat je eigen werklast produceert, gemeten op beide modellen, en het is het enige cijfer in dit artikel dat geen van beide leveranciers je kan geven.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt