Ett genererat hero-titelkort för 'Nex-N2.5 Pro vs Kimi K3' med undertexten 'Matchen där nykomlingens eget benchmarkkort agerar domare', ett stort avrundat dokument märkt 'LEVERANTÖRENS BENCHMARKKORT' med två modellkolumner och raden 'Pro ligger efter K3 på de flesta gemensamma raderna' ovanför, med OrcaRouter-logotypen inkomponerad längst ner till höger.
Guides & Insights

Nex-N2.5 Pro vs Kimi K3: mötet där nykomlingens eget benchmark-kort dömer

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Titta på de siffror som Nex-N2.5 Pro och Kimi K3 har gemensamma, så ser du vem som levererat dem. Nex-AGI:s Nex-N2.5 Pro – den multimodala agenten med 397 miljarder parametrar, varav cirka 17 miljarder aktiva, som introducerades den 8 september 2026 med vikter som fortfarande är märkta ”kommer snart” – publicerar en benchmarktabell som listar Moonshot AI:s Kimi K3 direkt i samma kolumner. Kimi K3 är Moonshots flaggskepp med öppna vikter på 2,8 biljoner parametrar, lanserat den 16 juli 2026, med en kontext på en miljon tokens, fullständiga vikter under en modifierad MIT-licens elva dagar senare och 57 poäng på Artificial Analysis Intelligence Index, vilket gör den till den främsta modellen med öppna vikter på topplistan. Och rad efter rad i den tabellen hamnar Nex-N2.5 Pro efter Kimi K3: Terminal-Bench 2.1 på 82,7 mot K3:s 88,3, BrowseComp 89,7 mot 91,2, SWE-Bench Pro 61,2 mot 63,3, AutomationBench 44,2 mot 46,7. När en leverantör skriver ut sin egen modells siffror bredvid den nuvarande ledaren bland modeller med öppna vikter och den egna modellen förlorar de flesta raderna, är det mest intressanta i den här jämförelsen att tabellen förmodligen talar sanning.

Det är den ovanliga formen på den här jämförelsen. Vanligtvis är en nykomlings kort det ställe där man ska leta efter spin. Här är kortet det närmaste någon av modellerna har till en ärlig domare, eftersom Nex-AGI inte hade någon anledning att publicera en tabell som nedgraderar sin egen Pro-nivå — och raderna där Pro faktiskt slår K3 är exakt de rader där en liten, specialbyggd computer-use-modell borde slå en mycket större generalist. Så den verkliga frågan som den här sidan besvarar är smalare och mer användbar än "vilken är bättre": överlever Nex-N2.5 Pros påstådda nisch — agentisk prestanda nära K3 med ungefär en sjättedel av de aktiva parametrarna — kontakten med det faktum att Kimi K3 redan finns, redan har sina vikter ute och redan är modellen att slå?

Motståndaren, i sin helhet.

Kimi K3 är inte en nischmodell, vilket är precis varför den är rätt måttstock. Den är Moonshots flaggskepp: totalt 2,8 biljoner parametrar, varav 104 miljarder aktiva, i en Stable LatentMoE-design; en kontext på 1M tokens med en utdatabudget därefter; inbyggd förståelse för text, bild och video; alltid påslaget resonemang; och öppna vikter som vem som helst med tillräckligt med hårdvara faktiskt kan köra. Dess oberoende ställning är stark – med 57 på Intelligence Index (Artificial Analysis) toppar den alla andra modeller med öppna vikter, och den noterade 1 679 i Elo på Frontend Code Arena, före Claude Fable 5 och GPT-5.6 Sol – medan priset, 3,00 dollar per miljon input-tokens och 15,00 dollar per miljon output-tokens, med 0,30 dollar för cachad input, ligger i premiumskiktet bland modeller med öppna vikter. Kimi K3 är precis så som ”frontier and open” ser ut när tillverkaren inte kompromissar om skalan: den kostar mer per token än stängda konkurrenter som GPT-5.6 Sol när det gäller utdata, den är dyr att drifta, och det är mycket svårt att argumentera emot den på leaderboarderna.

Utmanarens aritmetik

Nex-N2.5 Pro försöker inte överskala Kimi K3. Den försöker överträffa den i tjänst. Nex-AGI har eftertränat Pro-nivån från en Qwen3.5-härstamning till en visionsnativ agent för att styra datorer och webbläsare, och dess argument är effektivitet: 397B totalt / ~17B aktiva, ett 262K-sammanhang och ett recept för distribution på en enda nod med 8×H100, jämfört med K3:s 2.8T / 104B aktiva och den typ av serverflotta som en sådan modell kräver. Det underförstådda argumentet är att en specialist med 17B aktiva parametrar, tränad specifikt för agentloopen med visuell återkoppling, kan leverera större delen av en generalists agentiska prestanda med 104B aktiva parametrar till en bråkdel av serveringskostnaden. På Nex-AGI:s eget kort är påståendet trovärdigt men ofullständigt: Pro slår eller matchar K3 på OSWorld-G (87.4 vs 79.6) och OmniDoc (92.2 vs 91.1), och förlorar resten av de gemensamma raderna med ensiffriga marginaler — en 397B-modell som förlorar mot en 2.8T-modell med 3 till 6 poäng på kodning och webbläsaranvändning är, om det stämmer, precis den effektivitetshistoria Nex vill berätta.

Om det stämmer. Vart och ett av dessa siffror är Nex-AGI:s egna, åtminstone delvis framtagna genom dess interna NexCUA-miljö, och Nex-N2.5 Pro kan inte oberoende verifieras i dag eftersom dess vikter inte går att ladda ner – Hugging Face-repositoriet innehåller en README, en figurmapp och en banner med texten ”weights are coming soon”, inget mer. Samma förbehåll gäller för K3-siffrorna som kortet redovisar, vilka Nex mestadels hämtade från Moonshots publicerade rapporter i stället för att mäta själva. Vad Nex-AGI:s tabell fastställer är inte vem som vinner; det är att Nex-AGI:s egna ingenjörer, som valde benchmarkarna och testmiljön, inte kunde få sin Pro-nivå att slå Kimi K3 på de flesta gemensamma områdena. Det är en mer användbar uppgift än något enskilt resultat, eftersom den sätter en övre gräns för hur mycket marknadsföringen kan överdriva.

A comparison scoreboard for Nex-N2.5 Pro and Kimi K3: Nex-N2.5 Pro rows 'Total / active: 397B / ~17B', 'Weights: coming soon', 'Context: 262K', 'Price: no rate card (free preview)', 'Terminal-Bench 2.1: 82.7 (Nex-reported)', 'OSWorld-2: 56.4 (Nex-reported)'; Kimi K3 rows 'Total / active: 2.8T / 104B', 'Weights: open, Modified MIT', 'Context: 1M', 'Price: $3 / $15, cache $0.30', 'Terminal-Bench 2.1: 88.3 (Moonshot)', 'OSWorld-2: 58.3 (Nex-compiled)'; footer 'All figures vendor-reported; Kimi K3 AA Index 57 per Artificial Analysis.'

Rader som spelar roll, sida vid sida

Skala — Nex-N2.5 Pro: 397B totalt / ~17B aktiva, multimodal i Qwen3.5-familjen. Kimi K3: 2.8T totalt / 104B aktiva, Stable LatentMoE, multimodal.

Vikter — Nex-N2.5 Pro: utlovade, inte levererade ("kommer snart" på kortet). Kimi K3: publicerad 27 juli under Modified MIT — nedladdningsbar idag.

Kontext — Nex-N2.5 Pro: 262K. Kimi K3: 1M tokens, till fast pris.

Pris — Nex-N2.5 Pro: ingen prislista ännu; webbaserad förhandsvisning är gratis. Kimi K3: $3.00 / $15.00 per miljon, cachad input $0.30.

Oberoende ställning — Nex-N2.5 Pro: inget ännu. Kimi K3: AA Intelligence Index 57, bästa open-weight-modellen på listan.

Kodning (leverantörskort) — Nex-N2.5 Pro: Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2. Kimi K3: 88.3 och 63.3 på samma rader.

GUI / datoranvändning — Nex-N2.5 Pro: OSWorld-G 87,4 (slår K3 på sitt eget kort), OSWorld-2 56,4. Kimi K3: OSWorld-G 79,6, OSWorld-2 58,3 (Nex-kompilerad).

Fotavtryck för egen drift — Nex-N2.5 Pro: receptet är en enda nod med 8×H100 när vikterna väl har landat. Kimi K3: 2,8 biljoner parametrar — en servingflotta, inte en enda nod.

Vad "open" betyder olika i varje kolumn

Ordet "open" gör väldigt olika jobb på de två sidorna, och det avgör den här uppgörelsen mer än något riktmärke. Kimi K3 är öppen i den bemärkelse som spelar roll operativt: vikterna ligger på hubben under en tämligen tillåtande Modified MIT-licens, resonemangsspåren är exponerade i streaming-API:et, och ett företag med datastyrningsrestriktioner kan köra den på hårdvara de kontrollerar och granska vad modellen tänkte. Den är öppen på ett sätt som kostar dig — en 2,8T-modell kräver seriös infrastruktur — men alternativet finns idag. Nex-N2.5 Pro är öppen i avsiktens bemärkelse: Nex-AGI säger att familjens vikter kommer att släppas som öppen källkod, och det mindre syskonet Nex-N2.5 Mini levererade faktiskt Apache-2.0-vikter på lanseringsdagen. Pros är inte ute, dess licens är annonserad på kortet men ännu inte bindande för något nedladdningsbart, och tills en checkpoint finns är "open" en punkt på färdplanen snarare än en egenskap hos modellen. För ett team som väljer mellan de två är det inte en fotnot — det är skillnaden mellan en modell du kan äga den här månaden och en modell du blivit lovad att du kan äga.

Utvärdering utan att vänta på en nedladdningsknapp

Du behöver inte låsa detta beslut förrän vikterna för Nex-N2.5 Pro släpps, och routinglagret är där du kör experimentet billigt. Kimi K3 finns på OrcaRouter till Moonshots listpris — $3.00 / $15.00, 0 % påslag, priset förs vidare och uppdateras samma dag som Moonshot ändrar det — så den ledande modellen med öppna vikter är ett knapptryck bort, bredvid de andra 200+ modellerna i katalogen. Nex-N2.5 Pro erbjuds inte av oss, så att prova den idag innebär Nex-AGI:s värdbaserade förhandsvisning och senare din egen stack med åtta H100:er. Mönstret som passar: lägg arbetet med långt kontext och omfattande granskning på Kimi K3 via den enda slutpunkt du redan använder, peka en testbranch mot förhandsvisningen av Nex-N2.5 Pro, och låt automatisk failover dirigera runt den som försämras — vilket är exakt så du jämför en lanserad frontier-modell med en utmanare vars vikter ännu inte är släppta, utan att satsa din produktion på någon av dem. När vikterna för Pro väl landar är verifieringen enkel: kör de delade raderna som ett oberoende labb kan reproducera och se om berättelsen om effektivitet med 17B aktiva parametrar överlever utanför Nex-AGI:s eget testramverk.

A screenshot of the Hugging Face 'Files and versions' tab for nex-agi/Nex-N2.5-Pro (captured September 9, 2026), showing the model header with Text Generation and Transformers tags, 'License: apache-2.0', and a file tree listing only figures, .gitattributes and README.md - no model weight shards, confirming the Pro checkpoint is not yet published.A screenshot of the OrcaRouter model page for kimi/kimi-k3 (captured September 9, 2026), showing the Kimi K3 card under vendor MoonshotAI with model id kimi/kimi-k3, a 1M-token context, text + image input and text output, vision/tools/reasoning chips, and a 'Public benchmarks by MoonshotAI' note dated 2026-07-15.

Var matchen landar

{{1}}Mot den största modellen med öppna vikter som någonsin lanserats behöver Nex-N2.5 Pro inte vinna generalistkriget för att vara värd att följa — den behöver vinna serveringskostnadsargumentet, och dess eget kort antyder att argumentet är verkligt men obevisat.{{/1}} {{2}}Kimi K3 är det säkra och verkligt starka valet idag: öppna vikter, toppen av indexet för öppna vikter, en kontext på en miljon token, och ett pris du kan budgetera mot, till kostnaden av infrastruktur som bara blir svårare ju mer modellen växer.{{/2}} {{3}}Nex-N2.5 Pro är effektivitetssatsningen: nära-K3 agentiska rader till en sjättedel av de aktiva parametrarna på en enda nod, enligt en leverantörs tabell för en modell som inte har lanserats.{{/3}} {{4}}Välj Kimi K3 när du vill ha frontmodellen du faktiskt kan äga och granska just nu.{{/4}} {{5}}Håll ögonen på Nex-N2.5 Pro för den dag då dess vikter landar och någon oberoende kör de delade raderna — för om en agent med 17B aktiva verkligen håller sig inom några få poäng från en flaggskeppsmodell med 104B aktiva när det gäller datoranvändning, så är det resultatet som förändrar serveringsmatematiken för varje öppen agent efter den.{{/5}}