
Claude Sonnet 5.5 vs Tencent HY4 Preview: Båda labben säljer tokennotan
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 931 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 192 tok/s
- OrcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Två lanseringar, sex veckor isär, med samma löfte i olika ordalag. Leverantörens påstående är att Claude Sonnet 5.5, som släpptes den 28 september 2026, kostar "upp till 30 % mindre per uppgift" än Claude Sonnet 5 vid oförändrade priser per token. Det andra påståendet är att optimeringen den 7 september av den hostade versionen av Tencent HY4 Preview, som först släpptes och gjordes tillgänglig med öppen källkod den 28 augusti 2026, minskar antalet resonemangssteg och tokenförbrukningen per uppgift vid samma uppgiftskvalitet. Ingen av leverantörerna höjde eller sänkte ett pris för att kunna göra det påståendet. Båda säger till dig att tokens är produkten nu, och det intressanta med den här duellen är att bara ett av de två påståendena kan kontrolleras mot en publicerad siffra per uppgift — eftersom bara en av dessa två modeller har en oberoende mätning att kontrollera det mot.
Den asymmetrin är inte en kritik mot Tencent. HY4 Preview har ingen modellsida hos Artificial Analysis, inget oberoende Intelligence Index-poäng och ingen siffra för kostnad per uppgift från någon tredje part. Vad den har är en leverantörens benchmarktabell — Terminal-Bench 2.1 på 85,4, DeepSWE 64,3, en intern blindutvärdering över 203 ingenjörsuppgifter där den snittade 2,99 mot GLM-5.3 på 2,92 och Kimi K3 på 2,94 — och en offentlig, publikröstad debut på WebDev Arena-tavlan, där Tencent rapporterar att den landade runt femte plats totalt och tredje bland modeller med öppna vikter. Alla dessa är verkliga signaler. Ingen av dem är en kostnad per uppgift, vilket innebär att det exakta tal som båda leverantörerna tävlar om är, för HY4 Preview, otillgängligt.
Vad varje sida faktiskt levererade
Tencent HY4 Preview är en expertblandning med 770 miljarder parametrar, 49 miljarder aktiva per token, 78 lager, 256 routade experter plus en delad expert, ett inbyggt MTP-lager för spekulativ avkodning och ett kontextfönster som klarar över en miljon tokens. Den är endast för text till sin konstruktion — Tencent byggde den för kodningsagenter, komplex verktygsanvändning och produktivitetsarbete, inte för bilder — och den använder tungt resonemang som standard, med tre konfigurerbara nivåer (hög, låg, ingen) och en leverantörsrekommenderad samplingsinställning på temperature 0,9 och top_p 1,0. Vikterna är Apache 2.0 och kan laddas ner från Hugging Face, GitHub, ModelScope och GitCode. Tencent flaggade ursprungligen två skavanker i förhandsversionen: att den lade onödigt lång tid på att tänka och öververifierade sitt eget arbete, och uppdateringen den 7 september riktar sig precis mot just dessa.
Claude Sonnet 5.5 är Anthropics andra modell i 5.5-generationen och den som Anthropic positionerar som den bästa kombinationen av hastighet och intelligens i sortimentet. En miljon tokens i kontext, 128 000 utdatatokens synkront och 300 000 i Message Batches API, text-, bild- och filindata, adaptivt tänkande vid valbar ansträngningsnivå, en kunskapsgräns i juni 2026, noll datalagring tillgänglig från lansering och ett tidigaste avvecklingsdatum den 28 september 2027. Prislistan ändrades inte från Claude Sonnet 5: 2,00 USD per miljon indata, 10,00 USD per miljon utdata, 0,20 USD för cacheläsningar och 2,50 USD för cacheskrivningar. Slutna vikter, Anthropic API plus Bedrock, Google Cloud och Microsoft Foundry.
Ställ de två mot varandra och positionerna är nästan symmetriska:
• Pris — Claude Sonnet 5.5 $2,00 in / $10,00 ut per miljon jämfört med Tencent HY4 Preview $0,83 in / $2,50 ut i vår katalog, från en leverantörslista på ¥6 / ¥18
• Cache-läsningar — Claude Sonnet 5.5 $0,20 per miljon jämfört med Tencent HY4 Preview $0,042 per miljon i vår katalog
• Vikter — Claude Sonnet 5.5 slutna vs Tencent HY4 Preview Apache 2.0, nedladdningsbara
• Kontext — Claude Sonnet 5.5 1 048 576 tokens mot Tencent 1 048 576 tokens, i praktiken identiska
• Maximal utdata — Claude Sonnet 5.5 128 000 synkront, 300 000 vid Batches mot Tencent HY4 Preview 64 000 i vår katalog
Indatamodalitet – Claude Sonnet 5.5 text, bild och fil mot Tencent HY4 Preview endast text
Oberoende poäng — Claude Sonnet 5.5 Intelligensindex 56 till $7,60 per uppgift, revision v4.3.2 mot Tencent HY4 Preview inga publicerade
• Uppmätt utdatahastighet — Claude Sonnet 5.5 138,7 tokens/sek vs Tencent HY4 Preview 22,3 tokens/sek på vår egen trafik

Påståendet som båda labben kommer med, och varför ett av dem går att kontrollera
Anthropics "30 % mindre per uppgift" och Tencents "färre resonemangssteg, lägre tokenförbrukning" är samma ingenjörsprojekt beskrivet från två håll: att få modellen att göra av med färre tokens för att nå samma svar. Anthropic är tydliga med att taxorna inte ändrades, vilket innebär att varje besparing per uppgift måste komma från tokenantal — och den oberoende resultattavlan låter dig se problemets form snarare än åtgärdens storlek. Claude Sonnet 5.5 genererar 410 miljoner utdatatokens i Intelligence Index-utvärderingen, jämfört med 117 miljoner för MiniMax M3 och 77 miljoner för Grok 4.5. Det är en mångordig modell, mätt, på en resultattavla som publicerar siffran. Oavsett vad 30 %-förbättringen jämfört med Claude Sonnet 5 innebär, tillämpas den på en mycket stor bas.
För HY4 Preview finns ingen motsvarande siffra offentligt. Tencents egen optimeringsnot är den enda redogörelsen för det, och den anger resultatet utan en siffra: färre turer, lägre input- och output-tokens, samma kvalitet, validerat genom benchmarkmått och mänsklig utvärdering i två pass. Det är ett leverantörspåstående i strikt mening – uttalat, rimligt, icke reproducerat – och det betecknas som sådant här. Att anta en förhandsvisningsmodell på grundval av en leverantörs påstående om tokenekonomi, när tokenekonomin är det man inte kan mäta utifrån, är precis den satsning en förhandsversion ber dig att göra.
Ytterligare en komplikation är värd att känna till innan någon planerar en självhostad driftsättning runt den optimeringen. Tencents ändring den 7 september gäller den build som Tencent levererar på sina egna hostade endpoints. Snapshoten med öppna vikter uppdaterades inte – Hugging Face-repots senaste ändringsdatum är fortfarande den 28 augusti – så en självhostad kopia av vikterna kör det ursprungliga beteendet med längre resonemang som förhandsversionsanteckningarna flaggade. Den optimerade versionen och den nedladdningsbara versionen är inte samma artefakt.
Där de öppna vikterna faktiskt lönar sig är på samma plats som de alltid gör: en driftsättning som inte kan anropa ett API. En modell med 770B parametrar och 49B aktiva är ett datacenterbeslut snarare än ett arbetsstationsbeslut, så detta är inte den laptop-klasshistoria som en 30B-modell berättar — men för en köpare som behöver modellen inom sin egen perimeter är Apache 2.0 i den skalan ett alternativ som Claude Sonnet 5.5 inte erbjuder till något pris.
Testar en förhandsversion utan att satsa en produktionsväg på den
Förhandsgranskningsmodeller är fallet där routning slutar vara en kostnadsoptimering och blir en riskkontroll. Anledningen till att sätta en förhandsgranskningsversion bakom en router i stället för att anropa den direkt är att en förhandsgranskning definieras av möjligheten att förändras under fötterna på dig, och de två sakerna du vill ha från lagret framför den är en procentuell uppdelning och något som fångar upp felen.
Det är formen OrcaRouter erbjuder: en OpenAI-kompatibel endpoint som täcker över 200 modeller, leverantörens listpris vidaresänt utan påslag, automatisk failover mellan uppströmsleverantörer, och en routing-DSL för att komponera anrop av flera modeller. Tencent HY4 Preview går att routa här redan i dag som tencent/hy4-preview till $0,83 för indata och $2,50 för utdata per miljon tokens med $0,042 för cacheläsningar över dess fönster på 1 048 576 tokens — samma build, till leverantörens pris, nåbar med den nyckel du redan använder för allt annat i katalogen. Claude Sonnet 5 går också att routa här, till Anthropics $2,00 och $10,00, och har varit det sedan 30 juni; den är en självklar failover-partner medan en endagsgammal modell samlar produktionsbevis.

Claude Sonnet 5.5 finns inte med i vår katalog. Den släpptes i går, vägen till den är Anthropics eget API, och den här sidan kommer inte att föreslå något annat — poängen med rådgivningen om routning är att det säkra sättet att köra en helt ny nivå i produktion är att ge den en del av trafiken med något beprövat bakom sig, och det fungerar bara när båda ändarna av upplägget finns någonstans du kan nå från en och samma plats. HY4 Preview bär 372 tusen tokens i trafik per vecka här, vilket är vad en två dagar gammal förhandsversion ser ut som innan någon har satsat på den; Claude Sonnet 5 har burit 7,9 miljoner per vecka sedan den 30 juni, och det är skillnaden mellan en kandidat och ett golv.

Vart pengarna faktiskt går
Enbart sett till priser är HY4 Preview fyra gånger billigare på utdata än Claude Sonnet 5.5 och nästan fem gånger billigare på cacheläsningar, och den matchar fönstret. På den uppmätta sidan genererar Claude Sonnet 5.5 utdata sex gånger snabbare i vår egen trafik – 138,7 tokens per sekund mot 22,3 – vilket är den sorts klyfta som förvandlar en fyrdubbel prisfördel till en mycket mindre fördel i verklig tid, och ibland till en förlust, när köbildning räknas in.
Mellan dessa två fakta vilar beslutet på fyra frågor som bara läsaren kan svara på. Behöver arbetet en bild eller en fil i prompten? HY4 Preview är endast text och därmed är diskussionen över. Behöver det slutföra en programvaruuppgift i flera steg, där HY4 Previews Terminal-Bench 2.1-poäng på 85.4 är Tencents eget nummer och inte reproducerat? Då är förhandsvisningsstatusen den risk du accepterar, och optimeringen den 7 september är värd att testa om snarare än att lita på. Måste arbetsbelastningen köras inom din egen perimeter? Då är Apache 2.0-vikterna det avgörande faktumet. Och spelar den sammansatta kapacitetsnivån större roll än priset? Då är Claude Sonnet 5.5:s oberoende uppmätta 56 det nummer som ska vägas, till $7.60 per Index-uppgift, med förbehållet att det inte finns någon motsvarande siffra på Tencent-sidan att jämföra med.
Vad båda lanseringarna verkligen visar är att frontlinjen har lämnat prislistorna bakom sig. Två labb, med sex veckors mellanrum, släppte modeller och lyfte fram tokenförbrukning per uppgift i stället för pris per miljon, och den praktiska konsekvensen för en köpare är att det användbara talet inte längre finns på någon av leverantörernas prissidor. Det är antalet token som din egen arbetsbelastning producerar, mätt på båda modellerna, och det är den enda siffran i den här artikeln som ingen av leverantörerna kan ge dig.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
