
GPT-6 Astra vs Tencent HY4 Preview: En modell har ett granskningsspår och den andra har en benchmarktabell
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Tencent HY4 Preview och GPT-6 Astra är de två billigaste vägarna till agentisk kodning nära frontlinjen som finns i dag, om man läser tillverkarnas egna siffror, och de är de två minst jämförbara modellerna i den klassen om man läser någon annans. Tencent HY4 Preview släpptes och gjordes till öppen källkod den 28 augusti 2026 under Apache 2.0, för 0,834 USD per miljon indatatokens och 2,501 USD per miljon utdatatokens, med en arkitektur av typen mixture-of-experts med 770 miljarder parametrar, ett kontextfönster som överstiger en miljon tokens och ett utdatatak på 64 000 tokens. GPT-6 Astra har varit allmänt tillgänglig sedan den 3 september 2026 för 10,00 och 50,00 USD, med ett fönster på 1 050 000 tokens och maxutdata på 128 000. Astras styrkor backas upp av åtta publicerade tredjepartsutvärderingar; HY4 Previews styrkor backas upp av Tencents egna körningar för terminal, verktygsanrop och blindutvärdering, och av ingenting annat. Den asymmetrin betyder inte att den billigare modellen är svagare. Det betyder att en av dessa två jämförelser kan kontrolleras och den andra måste man tro på, och de praktiska besluten skiljer sig därför åt.
Vad Apache 2.0-versionen faktiskt ger dig
Licensen är den del av den här jämförelsen som en pristabell inte kan uttrycka. Tencent HY4 Preview är inte en hostad teaser med open-weight-varumärkning — vikterna kan laddas ner från Hugging Face, GitHub, ModelScope och GitCode, vilket innebär att modellen överlever varje beslut Tencent fattar om sin egen prissättning, sin egen endpoint eller sitt fortsatta intresse av att tillhandahålla den.
• Arkitektur — 770B totala parametrar, 49B aktiva per token, 78 lager, 256 routade experter plus en delad expert, och ett inbyggt lager för multi-token-prediktion för spekulativ avkodningbr /> • Serveringsegenskaper — 54,6 utdatatoken per sekund och en median på 6,26 sekunder till första token, mätt över OrcaRouters rutter under ett rullande sjudagarsfönsterbr /> • Kontext och tak — ett fönster på 1 048 576 token mot en maximal utdata på 64 000 tokenbr /> • Indatayta — endast text; ingen bild, ingen fil, inget ljudbr /> • Resonemangsstyrning — tre nivåer, hög, låg och ingen, med hög som standard, plus en dokumenterad samplingsrekommendation på temperature 0.9 och top_p 1.0br /> • Tillförlitlighet — en felfrekvens på 2,8 % under samma sjudagarsfönster, mot 10,3 % på Astra-rutten
Det där sista paret siffror är det mest handlingsbara på den här sidan, och det är den typ av siffra som ingen leverantör publicerar om sin egen modell. Astras oberoende benchmarkpoäng är högre, och dess rutt har under den senaste veckan misslyckats med ungefär en förfrågan av tio, medan en modell helt utan oberoende poäng har misslyckats med en av trettiofem. Ingen av siffrorna säger något om modellerna själva – felfrekvenser mäter rutten, hastighetsgränserna och uppströmmen, inte vikterna – men det är de siffror ett produktionssystem faktiskt upplever.

Där Tencents siffror kan jämföras med någon annans
Detta är, så långt de publicerade beläggen räcker, en genuint ovanlig möjlighet: Astra och HY4 Preview har båda ett värde för Terminal-Bench 2.1, och bara en av dem är rapporterad av leverantören.
• Terminal-Bench 2.1, körning av en riktig terminal — GPT-6 Astra 88,4, oberoende utvärderad; Tencent HY4 Preview 85,4, leverantörsrapporteradbr /> • Verktygsanrop — Astra 41,4 på τ²-Banking, oberoende utvärderad; HY4 Preview 74,1 på Toolathlon-Verified, leverantörsrapporterad, i ett annat testbr /> • Mjukvaruutveckling — HY4 Preview 64,3 på DeepSWE, upp från 28,0 hos föregångaren Hy3, leverantörsrapporteradbr /> • Agentuppgifter — HY4 Preview 37,1 pass@1 på APEX-Agents, leverantörsrapporteradbr /> • Mänsklig preferens — i genomsnitt 2,99 av 4,00 över 203 ingenjörsuppgifter bedömda av 163 experter, leverantörsutförd, mot GLM-5.3 på 2,92 och Kimi K3 på 2,94br /> • Oberoende index — GPT-6 Astra 54,7 Intelligence Index och 96,1 GPQA Diamond, tredjepart; inget motsvarande index finns för HY4 Preview
Raden för Terminal-Bench är den som är värd att uppehålla sig vid. En skillnad på 3 punkter mellan ett oberoende 88,4 och ett av leverantören rapporterat 85,4 ligger väl inom det intervall som en annan testram, ett annat scaffold eller en annan samplingstemperatur kan ge, vilket innebär att den ärliga tolkningen inte är "Astra är tre punkter bättre" utan "den billigaste modellen med öppna vikter i den här nivån gör anspråk på likvärdighet, och anspråket är åtminstone rimligt". Tencents egen formulering är försiktig på denna punkt: den beskriver DeepSWE som att gapet "gradvis minskar" snarare än att det sluts, och dess enda tydliga likvärdighetsanspråk – det delade resultatet på Terminal-Bench med en främsta modell med stängda vikter från en annan leverantör – är precis det anspråk som mest behöver en andra mätning.
Det finns också en förändring som är värd att känna till, eftersom den förändrar ekonomin snarare än poängen. Den 7 september 2026 rullade Tencent ut en optimering i live-förhandsvisningsbygget som enligt företaget minskar antalet resonemangssteg och tokenförbrukningen per uppgift vid komplext arbete. Eftersom modellen debiterar per token sänker färre tokens per slutförd uppgift kostnaden för uppgiften även om priset per token inte har ändrats. Storleken på den besparingen är Tencents egen mätning och ingen utanför Tencent har reproducerat den – men mekanismen är verklig, och det är anledningen till att en förhandsversion som släpptes i augusti kan vara väsentligt billigare att driva i oktober än vad dess lanseringstext antydde.
Taket på 64 000 token är specifikationen som avgör driftsättningar
Halvvägs ner i specifikationsbladet finns begränsningen som biter först, och det är inte kvaliteten. HY4 Previews maximala utdata är 64 000 tokens mot Astras 128 000, på en modell vars angivna syfte är kodningsagenter och långa kedjor av verktygsanvändning. En genererad fil, en patch över flera filer, en lång strukturerad rapport – det är dessa utdata som når ett tak, och vid en agentkörning är felet inte ett något sämre svar, utan ett trunkerat sådant som den omgivande pipelinen måste upptäcka och hantera.
Båda modellerna tar emot ungefär en miljon tokens i indata, så dokumentläsningsfallet är verkligen oavgjort. Skillnaden ligger helt på genereringssidan, och den är en faktor två snarare än ett avrundningsfel. Lägg till skillnaden i indatayta – Astra tar emot bilder och filer, HY4 Preview är endast text – och bilden som framträder är en tydlig arbetsfördelning snarare än en rangordning: modellen med öppna vikter för agentloopar med text in, text ut, där leveransen är ett verktygsanrop eller en diff, och den slutna modellen för allt som måste titta på något eller skriva något långt.
Vad 20× utdatahastigheten ger, rad för rad
• Indatapris – Tencent HY4 Preview $0,834 per 1 miljon vs GPT-6 Astra $10,00, cirka 12×br /> • Utdatapris – HY4 Preview $2,501 per 1 miljon vs Astra $50,00, cirka 20×br /> • Cachad indata – HY4 Preview $0,042 per 1 miljon vs Astra $1,00, cirka 24×br /> • Steg för långa förfrågningar – Astra ändrar priset för hela förfrågan över 272 000 indatatoken till $20,00 och $75,00; HY4 Previews kort har inget motsvarande stegbr /> • Effektiv indatatakt för en prompt på 400 000 token – HY4 Preview oförändrad vid $0,834 vs Astra $20,00, cirka 24×br /> • Kostnad per miljon token för en vanlig agentloop, 4:1 indata till utdata – HY4 Preview ungefär $1,17 vs Astra ungefär $18,00br /> • Kostnad för en månad med 100 miljoner token vid samma förhållande – HY4 Preview ungefär $117 vs Astra ungefär $1 800
Raden för cachad indata är den som skalar sämst för den dyra sidan, eftersom agentloopar skickar om samma systemprompt och konversationsprefix vid varje tur. Vid $0.042 mot $1.00 är en lång loops billigaste tokens 24 gånger billigare i Tencent-modellen, vilket är precis den arbetsbelastning där en liten skillnad per token förstärks snabbast. Kostnad per uppgift, det mått som skulle avgöra saken på ett entydigt sätt, publiceras inte alls av Tencent — så det enda sättet att få fram siffran som spelar roll är att köra båda modellerna genom din egen uppsättning uppgifter och läsa av usage-objektet.

Vad en router tillför här, med felfrekvenserna i hand
Båda modellerna finns i OrcaRouter-katalogen – tencent/hy4-preview och openai/gpt-6-astra – bakom en enda OpenAI-kompatibel slutpunkt, vardera till leverantörens eget listpris, vidarefört med 0 % påslag. Den sista detaljen har större betydelse för just det här paret än för de flesta, eftersom Tencent-modellens listpris anges i yuan: dollarsiffrorna ovan är den omräknade kurs du faktiskt ser, inte ett återförsäljarpåslag, och om Tencent ändrar priset slår ändringen igenom här samma dag i stället för vid nästa kontraktsförnyelse.
Routnings-DSL:en är där de två modellerna slutar vara alternativ. Den naturliga regeln för det här paret är eskalering på utdata: skicka loopen till den billiga modellen, och när ett svar kommer tillbaka trunkerat mot taket på 64 000 tokens eller misslyckas i din schemakontroll, försök igen med det steget mot openai/gpt-6-astra, som har dubbelt så mycket utrymme för utdata. Automatisk failover är den andra halvan av argumentet, och den är inte teoretisk när en av de två vägarna har gett fel på en av tio förfrågningar den senaste veckan — en lång agentkörning låst till en enda modell dör med sin ackumulerade kontext, och ingen av dessa modeller är tillräckligt billig för att av misstag köras om från början.

Vad skulle ändra denna jämförelse
Tre saker, i ordning efter hur mycket de skulle förändra läget. En oberoende utvärdering av HY4 Preview – modellen har varit offentlig i sex veckor, har inget tredjepartsindex, inget reproducerat Terminal-Bench-nummer och ingen kostnadssiffra per uppgift, och den enda leverantörsdrivna blindutvärderingen är den enda datan om mänskliga preferenser som existerar. En publicerad kostnad per slutförd uppgift för båda modellerna, vilket skulle ersätta varje kvot i den här artikeln med ett enda tal. Och ett Tencent-beslut om tredjepartsinferens, eftersom Apache 2.0-vikter kan serveras av vem som helst, och i samma stund som konkurrerande värdar driftsätter HY4 Preview blir priset på den billiga sidan av den här jämförelsen en marknad i stället för en prislista.
Fram till dess är den användbara sammanfattningen snävare än endera leverantörens lanseringsinlägg och ärligare än en resultattavla: GPT-6 Astra är modellen vars kapacitetspåståenden har granskats, med dubbelt så högt utdatatak och en rutt som har misslyckats med var tionde förfrågan. Tencent HY4 Preview är modellen vars kapacitetspåståenden inte har granskats, med en publicerad arkitektur, en öppen licens, en tredjedel av priset och en mycket lägre felfrekvens under samma fönster. Om ditt arbete är text in, text ut och ryms inom 64 000 genererade tokens, är den billigare modellen inte en kompromiss – det är rätt svar, och revisionsspåret är det enda du ger upp.
Den naturliga regeln för detta par är eskalering på utdata: skicka loopen till den billiga modellen, och när ett svar kommer tillbaka trunkerat mot taket på 64 000 tokens eller misslyckas i din schemakontroll, försök igen med det steget mot openai/gpt-6-astra, som har dubbelt så mycket utrymme för utdata.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
