Ett hero-titelkort för jämförelsen 'Tencent HY4 Preview vs Kimi K3'. Ett centralt kort i resultattavlestil visar 'Intern blindtest, 4-gradig skala' med 'Tencent HY4 Preview 2.99' till vänster och 'Kimi K3 2.94' till höger. Det vänstra kortet 'Tencent HY4 Preview' listar '770B / 49B aktiva, öppna vikter', '¥6 / ¥18 per 1M', 'Endast textförhandsvisning'. Det högra kortet 'Kimi K3' listar '2.8T / 104B aktiva, öppna vikter', '$3.00 / $15.00 per 1M', 'Inbyggd vision, AA Index 57'. En sidfot lyder 'Blindtest genomfört av Tencent med 163 ingenjörer över 203 uppgifter; resultaten är leverantörsrapporterade.' OrcaRouter-logotypen är placerad i det nedre högra hörnet.
Guides & Insights

Tencent HY4 Preview mot Kimi K3: Blindtestet Tencent valde att publicera

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Tencent HY4 Preview vs Kimi K3 är den enda matchningen vid lanseringen av denna modell som Tencent själv valde att köra. I sitt interna blindtest — 163 ingenjörer, 203 ingenjörsuppgifter, bedömda på en fyrgradig skala — fick HY4 Preview 2,99/4,00 mot Kimi K3:s 2,94, och Tencents rubrik kallade det en seger. Det finstilta i den segern är värt att läsa långsamt: HY4 Preview slog Kimi K3 på 51,2 % av uppgifterna, oavgjort på 7,9 % och förlorade på 40,9 %. En nettovinst på 10 procentenheter är verklig, men det är en knapp fördel mot en modell med en tredjedel av det totala antalet parametrar och mindre än hälften av de aktiva parametrarna — och hela testet genomfördes av Tencent.

Kimi K3 är Moonshots flaggskepp med öppna vikter och 2,8 biljoner parametrar, den största öppna modellen som någonsin släppts, och referenspunkten som varje kinesiskt labb har mätt sig mot sedan den 16 juli. Tencent valde den som motståndare eftersom den är standarden för öppna vikter — vilket gör den här artikelns uppgift ovanligt konkret: läs den enda head-to-head-jämförelsen som utmanaren frivilligt ställde upp på, och avgör vad den är värd.

Det riktmärke Tencent valde att publicera

Blindtestet bedömdes av Tencents egna ingenjörer på Tencents egna ingenjörsuppgifter, vilket är det första man ska bortse från. En av företaget kuraterad uppgiftsuppsättning är precis den miljö där en ny modell kan visa sitt bästa möjliga resultat. Även om man medger det, är resultatets form informativ: 51,2% vinster mot 40,9% förluster är en blygsam marginal, och 7,9% oavgjorda innebär att modellerna är nära matchade på de flesta uppgifterna. På de svåra uppgifterna, de där en frontmodell särskiljer sig, är gapet där det alltid är — och Tencents rubrik, ”något före Kimi K3,” är ärligt formulerad, vilket inte är vad varje labb publicerar.

Skala är inte öde

Parameterjämförelsen gör resultatet antingen imponerande eller misstänkt, beroende på dina förhandsuppfattningar. Kimi K3 har 2,8 biljoner totala parametrar med 104 miljarder aktiva — 896 experter, 16 aktiva per token — och den tränades för att alltid resonera med exponerad chain-of-thought. HY4 Preview har 770 miljarder totalt med 49 miljarder aktiva, en tredjedel av den totala skalan och mindre än hälften av den aktiva beräkningskraften. En mindre modell som tar en knapp seger i ett blindtest över en större är den riktning som hela open-weight-fältet har rört sig mot — Qwen3.8-Max, med 2,4 biljoner, och GLM-5.2, med 753 miljarder, har växlat slag på agentiska benchmarks i månader — så resultatet är trovärdigt snarare än osannolikt. Det är också, avgörande nog, inte verifierat av någon utanför Tencent.

Resultattavlan

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Skala — HY4 Preview 770B totalt / 49B aktiva jämfört med Kimi K3 2.8T totalt / 104B aktiva

• Kontext — HY4 Preview >1M tokens vs Kimi K3 1M tokens

• Pris per 1M — HY4 Preview ¥6 in / ¥18 ut (≈$0,85 / $2,50) jämfört med Kimi K3 $3,00 in / $15,00 ut, cache-träffar $0,30

• Modalitet — HY4 Preview endast text vs Kimi K3 nativ bild- och videoinmatning

• Resonemang — HY4 Preview har inget publicerat läge, medan Kimi K3 har alltid påslaget resonemang med strömmad tankekedja.

• Oberoende poäng — HY4 Preview: ingen vs Kimi K3 AA: Intelligence Index 57, topp tre globalt vid lanseringen.

På de rader där båda sidor rapporterar ett nummer klusterar modellerna. Tencent rapporterar HY4 Preview på 37,1 i APEX-Agents, i princip jämn med Kimi K3:s 37,2 – ett nära oavgjort resultat som blindtestresultattavlan skulle förutspå. HY4 Previews Toolathlon-Verified 74,1 och DeepSWE 64,3 har ingen motsvarighet hos Kimi K3 i mina händer, och Kimi K3:s FrontierSWE 81,2, ProgramBench 77,8 och BrowseComp 91,2 har ingen motsvarighet hos HY4 Preview. Resultattavlan är ärlig med att de två korten knappt överlappar, vilket i sig är en varning för att behandla någon av leverantörernas rader som en fullständig beskrivning av modellen.

Vision är den största verkliga skillnaden

För en utvecklare som väljer mellan de två idag är den strukturella skillnaden inte intelligens — det är inmatningsmodalitet. Kimi K3 är nativt multimodal: den tar emot bild- och videoinmatning via sin MoonViT-V2-encoder och är bland de bästa öppna modellerna på bilduppgifter, rankad tvåa globalt på vision-arenan. Tencent HY4 Preview är endast text i denna förhandsversion, och Tencent har sagt att vision måste vänta till fullversionen. Alla arbetsuppgifter som kräver skärmbilder, UI-förståelse eller visuell grundning tillfaller Kimi K3 som standard, oavsett vad det blinda testet säger om teknisk text. Om ditt arbete är rent kod, dokument och terminalutdata spelar skillnaden ingen roll; i samma ögonblick en uppgift innebär att titta på något, avgör det mötet.

Kostnadsfrågan

Per token är HY4 Preview dramatiskt billigare: ungefär $0.85/$2.50 mot Kimi K3:s $3.00/$15.00, med cacheträffar på ¥0.3 (cirka fyra cent) mot $0.30. Men de två modellerna har motsatt tokenbeteende som minskar gapet. Kimi K3 resonerar alltid på och streamar sin tankekedja, vilket blåser upp utdatatoken för varje begäran; granskare har noterat att modellen är långsammare – cirka 62 tokens per sekund – och tokenkrävande för agentloopar. HY4 Preview, enligt Tencent s egen releaseanteckning, "tenderar mot alltför långt tänkande och överdriven självverifiering" vid komplexa uppgifter. Båda förbränner extra utdatatoken; HY4 Preview tar bara mindre betalt för dem. En rättvis jämförelse är kostnad per slutförd uppgift, och ingen utanför Tencent har mätt HY4 Previews sådan ännu.

Domen

Tencent HY4 Preview är den billigare, mindre, overifierade utmanaren som gör anspråk på en snäv fördel i blindtester gentemot open-weight-standarden; Kimi K3 är den större, verifierade, etablerade aktören med bildförståelse som kostar fyra till fem gånger så mycket per token och har ett oberoende Intelligence Index på 57. Inget av modellernas benchmark-kort är helt oberoende – Kimi K3:s huvudresultat är också Moonshot-rapporterade, även om dess Index 57 inte är det. Om din arbetsbelastning är multimodal är Kimi K3 det enda valet i den här jämförelsen. Om det handlar om text och ingenjörsarbete är HY4 Preview värdevalet med en verklig, om än leverantörsdriven, head-to-head-jämförelse i bagaget, och den billiga vägen är att routa Kimi K3 på produktionsnyckeln – den är live på OrcaRouter till Moonshots listpris på 3,00/15,00 dollar, utan påslag – medan du kör HY4 Preview genom Tencents eget API på skuggarbetsbelastningar. När HY4 Preview når en router kommer samma nyckel och samma failover-regler att hantera båda, och Tencents ¥6/¥18-taxa kommer att föras vidare oförändrad.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

Vad du ska titta på

• En oberoende omkörning av blindtestuppgifterna. Vinstfrekvensen på 51,2 % är det enskilt mest testbara påståendet i den här lanseringen, och en tredjepartstestrigg skulle avgöra det inom en vecka.

• Huruvida HY4 Preview inkluderar vision före den fullständiga Hy4-lanseringen. Det är vad som skulle förvandla detta från en renodlad värdejämförelse till en äkta flaggskeppsstrid.

• Kostnad per slutförd uppgift på standardiserade agentiska testmiljöer. Båda modellerna är token-tunga; den som är billigast per färdig uppgift vinner produktionsargumentet.

• Kimi K3:s svar på prispressen. Om Moonshot sänker utmatningspriset på $15, vänder ramen "billig utmanare mot dyr standard".

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube