En hero-titelkort för jämförelsen 'Tencent HY4 Preview vs Qwen3.8-Max'. En central banner lyder 'Augusti månads open-weight-shootout', med anteckningen 'Två open-weight-flaggskepp, 25 dagar isär'. Vänster kort 'Tencent HY4 Preview' listar '770B / 49B aktiva, lanserad 28 aug', '¥6 / ¥18 per 1M', 'Inga oberoende poäng'. Höger kort 'Qwen3.8-Max' listar '2.4T / ~95B aktiva, lanserad 3 aug', '$2.00 / $6.00 per 1M', 'AA Index 58'. En sidfot lyder 'HY4 Preview-siffror rapporterade av leverantören; Qwen3.8-Max-poäng enligt Artificial Analysis.' OrcaRouter-logotypen är placerad i det nedre högra hörnet.
Guides & Insights

Tencent HY4 Preview mot Qwen3.8-Max: Augusti-duellen för öppna viktmodeller

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Tencent HY4 Preview mot Qwen3.8-Max är den kollision som den här månaden har byggt upp till. Ali​babas Qwen3.8-Max blev allmänt tillgänglig den 3 augusti och blev den första Qw​en i Max-klassen med öppna vikter den 12 augusti; Tencent HY4 Preview landade i morse, 25 dagar senare, med ett lanseringskort som direkt namnger Qwen3.8-Max — Tencent rapporterar HY4 Preview på 74,1 på Toolathlon-Verified, före Qwen3.8-Max på det benchmarket. Båda är kinesiska flaggskepp med öppna vikter, båda är prissatta för att sälja, och bara en av dem har oberoende resultat.

De två modellerna skiljs åt av mer än bara skala — Qwen3.8-Max har 2,4 biljoner parametrar mot HY4 Preview:s 770 miljarder — men på de agentiska riktmärken som spelar roll för en köpare siktar de på samma mål: långsiktigt arbete där en modell läser, anropar verktyg och itererar utan en människa i loopen. Det är precis det område där augustgenerationen med öppna vikter försöker bevisa att den kan ersätta slutna frontmodeller, och Tencents första drag var att sikta in sig på månadens största öppna release.

Resultattavlan

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Skala — HY4 Preview 770B totalt / 49B aktiva vs Qwen3.8-Max 2.4T totalt / ~95B aktiva

• Kontext — HY4 Preview >1M tokens jämfört med Qwen3.8-Max 1M tokens på API:et (262K nativa i öppna vikter, kan utökas till ~1.01M)

• Pris per 1M — HY4 Preview ¥6 in / ¥18 ut (≈$0,85 / $2,50) jämfört med Qwen3.8-Max $2,00 in / $6,00 ut, cacheläsningar $0,25

• Terminal-Bench 2.1 — HY4 Preview 85.4 (leverantörsrapporterad) mot Qwen3.8-Max 86.6

• Modalitet — båda är endast textbaserade i sina open-weight-varianter; Qwen3.8-Max API lägger till bild- och videoinmatning, HY4 Preview-förhandsversionen gör inte det.

• Oberoende poäng — HY4 Preview ingen vs Qwen3.8-Max AA Intelligensindex 58, Agentindex 58

De två korten berättar samma historia från motsatta håll. På Terminal-Bench 2.1 skiljs Qwen3.8-Max:s 86,6 och HY4 Preview:s 85,4 åt med en och en halv poäng — en poäng till Qw​ens fördel, och HY4-siffran är inte granskad. När det gäller pris är HY4 Preview billigare per token, både på input och output. När det gäller verifiering har Qwen3.8-Max ett oberoende Intelligence Index på 58 och ett Agentic Index på 58; HY4 Preview har inget annat än sina egna pressmeddelanden. Skillnaden är det klassiska mönstret av en utmanare som anländer med bättre priser och obevisade påståenden mot en verifierad etablerad aktör.

Att läsa Toolathlon-påståendet

Toolathlon-Verified mäter tillförlitligheten hos agentisk verktygsanvändning — hur konsekvent en modell driver ett verktyg genom en hel uppgift med fel, återhämtning och flerstegsanrop. Tencents 74.1 riktas direkt mot den starkaste delen av Qwen3.8-Max profil, eftersom Qw​ens Agentic Index på 58 och dess OSWorld-Verified 86.1 är de siffror som gjorde Ali​babas agentiska anspråk trovärdiga. Qwen3.8-Max rapporterar också 82.8 på IFBench (instruktionsföljning) och 93.0 på PaperBench (forskningsklassat agentiskt arbete), och överträffar därmed modeller som GPT-5.6 Sol på leverantörens egna tabeller. Så Tencent valde det enda benchmark där företaget hävdar en direkt seger över månadens största öppna modell — och påståendet är för närvarande lika verifierbart som någon annan enskild leverantörsrad: inte alls.

Verifierad vs leverantörsrapporterad

Detta är den axel där matchen är minst rättvis, och asymmetrin är värd att vara tydlig med. Qwen3.8-Max:s Intelligence Index på 58 kommer från Artificial Analysis, dess Agentic Index på 58 kommer från Artificial Analysis, och samma oberoende testmiljöer som gav den dessa poäng mätte också dess svagheter: en 40-procentig hallucinationsfrekvens på AA-Omniscience, upp från 23 % i föregående generation, och hela 64 agentiska steg per uppgift — modellen arbetar hårt, och du betalar för varje steg. Tencent HY4 Preview har ingen sådan instrumentering. Dess styrkor är påståenden, och dess felsätt — Tencent själva flaggar långt tänkande och överdriven självverifiering — är medgivanden, inte mätningar.

För ett team som väljer mellan de två är verifieringsgapet inte abstrakt. Qwen3.8-Max:s beteende med 64 varv per uppgift är en verklig, uppmätt kostnadsdrivare: till $2/$6 är den fortfarande den dyraste agenten per slutförd uppgift i vissa tredjepartsjämförelser, och team har rapporterat att antalet varv urholkar dess prisfördel. HY4 Previews motsvarande beteende är okänt – den kan vara billigare per uppgift än dess redan låga pris per token antyder, eller så kan dess självverifieringsvana äta upp skillnaden. Ingen kan ännu tala om för dig vilket, eftersom ingen utanför Tencent har kört den.

Pris och de praktiska aspekterna med öppna vikter

Per token är HY4 Preview billigare på båda sidorna av balansräkningen: ¥6/¥18 mot Qwen3.8-Max:s $2,00/$6,00, och cache-träffar på ¥0,3 mot $0,25. Det gör HY4 Preview till den billigaste open-weight-flaggskeppsmodellen på både input och output, punkt slut. Men "open weights" kommer med två olika uppsättningar finstilt text. Qwen3.8-Max:s open-weights-utgåva — Qwen3.8-2.4T-A95B — är endast text med forcerat tänkande, inbyggd kontext på 262K istället för API:ets 1M, och en anpassad licens med skalningsvillkor: krav på visning av modellnamn över 100 miljoner månatliga användare, och en separat licens för stora Model-as-a-Service-företag. Tencent HY4 Preview:s vikter finns på HuggingFace, ModelScope och GitHub från och med i morse, men dess exakta licensvillkor och huruvida vikterna matchar det serverade API:et har inte angivits med samma tydlighet. Båda modellerna är nedladdningsbara; ingen av dem är trivial att integrera.

Slutsatsen

Qwen3.8-Max är det säkrare valet på alla sätt där verifiering ger säkerhet: oberoende bedömd på intelligens och agentiskt arbete, kända felmoder, en fastställd licens och tre veckors produktionsåterkoppling. Det är också det dyrare valet per token, och dess uppmätta turn-tunga beteende är en känd kostnadsrisk. Tencent HY4 Preview är värdeinsatsen: billigare på både input och output, ett jämförbart Terminal-Bench-påstående och ett direkt Toolathlon-Verified-påstående mot Qw​en — allt detta overifierat från dag ett. Om du sätter en open-weight-modell i produktion den här veckan är Qwen3.8-Max det försvarbara valet och den är live på OrcaRouter till Ali​babas listpris — $2.00/$6.00, genomfakturerat utan påslag. HY4 Preview är utvärderingsprojektet: kör det genom Tencents eget API mot dina egna uppgifter i Toolathlon-stil, behåll produktionsvägen på den verifierade modellen, och när de oberoende resultaten landar — eller när HY4 Preview når en router och dess ¥6/¥18-pris blir en samma-dags-genomfakturering — är bytet en routingregel, inte en omskrivning.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

Vad du ska titta på

• Den första oberoende körningen av HY4 Preview på en agentisk harness. Toolathlon-Verified 74.1 är siffran som Tencent vill vinna; ett tredjeparts Agentic Index skulle vara bekräftelsen.

• HY4 Preview:s uppmätta turantal. Qwen3.8-Max:s 64 turer per uppgift är en varningshistoria; huruvida HY4 Preview är billigare per slutförd uppgift är hela det ekonomiska argumentet.

• Licensvillkoren för vikterna. De kommer att avgöra om ”öppen” betyder ”användbar i din skala” för HY4 Preview, precis som villkoren i Qwen3.8-Max-licensen gjorde för Ali​babas modell.

• Huruvida någon av leverantörerna sänker priset igen. I en månad där två flaggskepp med öppna vikter lanserades med aggressiv prissättning, gör pass-through på en router att ytterligare sänkningar syns samma dag.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube