Ett genererat hero-kort som jämför Intern-S2-397B och Kimi K3, som till vänster visar en vetenskaplig litteratursida med ett molekylärt diagram som matar in ett open-weights-kort med 403 miljarder parametrar, och till höger ett långt dokumentband som matar in en flaggskeppsmodell med 2,8 biljoner parametrar och en kontextmätare på 1M, med OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

Intern-S2-397B vs Kimi K3: Den 397B stora vetenskapsmodellen och den 2,8T stora resonemangsjätten

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Intern-S2-397B och Kimi K3 står på motsatta sidor av linjen för öppna vikter som kommer att definiera resten av 2026: den nedladdningsbara vetenskapliga specialisten kontra den oberoende bevisade långkontextgeneralisisten. Intern-S2-397B är den 403 miljarder parametrar stora vetenskapliga multimodala modellen som InternLM släppte under Apache-2.0 den 13 september 2026 – ingen prislista, ingen oberoende poäng och en visionsväg tränad på råa sidor av vetenskaplig litteratur. Kimi K3 är Moonshot AI:s 2,8 biljoner parametrar stora mixture-of-experts-flaggskepp som lanserades i juli 2026 för 3,00 USD per miljon indatatokens och 15,00 USD per miljon utdatatokens, öppnade sina vikter den 27 juli under en modifierad MIT-licens och har genomgått sex veckor av oberoende utvärdering. Det ovanliga med denna matchning är att båda modellerna har samma långsiktiga ambition – att fortsätta arbeta sig igenom en stor, rörig uppgift – och löser den i motsatta riktningar.

Båda ambitiösa, motsatta mekanismer

Ambitionen är gemensam: varje modell vill vara den som fortsätter när uppgiften är lång. De uppnår det på olika sätt, och skillnaden är arkitektonisk.

Kimi K3:s svar är kontext. Ett fönster på 1 048 576 token för både indata och utdata innebär att ett helt kodarkiv, ett helt datarum eller en agentloop i femtio steg kan rymmas i en och samma konversation. Moonshots Mooncake-inferensstack uppges upprätthålla cacheträffrekvenser över 90 % vid kodarbetsbelastningar, vilket är vad som gör ett utdatapris på 15 dollar per miljon överlevnadsbart i praktiken. Kimi K3 exponerar en reasoning_effort-kontroll på översta nivån och accepterar inga samplingsparametrar, resonerar med maximalt djup som standard och förväntar sig att du återger tidigare reasoning_content och tool_calls ordagrant i verktygsloopar över flera turer, annars försämras kvaliteten.

Intern-S2-397B:s svar är specialisering plus kontroll på viktnivå. Dess kontext – 256K textresonemang och 64K multimodalt, båda siffrorna från modellkortet – är en annan kategori av fönster, tillräckligt för en omfattande artikel eller en lång forskningssession men inte för en arbetsuppsättning på en miljon token. Vad den erbjuder i stället är en visionväg som läser vetenskaplig litteratur nativt – figurer, layout, symbolisk notation och prosa tillsammans – och en tidsserieindata som producerar prognoser, tillsammans med ett tänkande som är aktiverat som standard och växlingsbart per begäran. Om din långa uppgift är vetenskaplig tränades modellen för exakt det; om din långa uppgift är en kodbas är detta inte modellen med fönstret på en miljon token för det.

• Kontext — Kimi K3: 1 048 576 tokens in och ut mot Intern-S2-397B: 256K text / 64K multimodal.

• Skala — Kimi K3: 2,8T totalt, ~104B aktiva per token mot Intern-S2-397B: 403B totalt, 512 experter / 10 aktiva.

• Kontrollpanel — Kimi K3: reasoning_effort-reglage, inga samplingsparametrar vs Intern-S2-397B: enable_thinking-växel plus full kontroll på viktnivå under Apache-2.0.

• Indata — Kimi K3: text, bild vs Intern-S2-397B: text, bild, tidsserier.

• Vikter — Kimi K3: öppna under Modified MIT (27 juli) vs Intern-S2-397B: öppna under Apache-2.0 (13 september).

• Oberoende bevis — Kimi K3: sex veckor av tredjepartsresultat jämfört med Intern-S2-397B: inga ännu.

Bevisasymmetrin är den verkliga skillnaden

Kimi K3 har genomgått oberoende granskning och kommit ut med resultat som du kan bygga vidare på. Artificial Analysis placerar den i mitten av 40-spannet på sitt nuvarande Intelligence Index, med ett GPQA Diamond i början av 90-spannet, ett HLE i mitten av 40-spannet, en oberoende uppmätt återkallelse över lång kontext på 88,7 och en kodningspoäng i mitten av 70-spannet. Den håller förstaplatsen i Frontend Code Arena (Elo i 1670-spannet) och noterade 91,2 på BrowseComp, den högsta siffran på det långsiktiga benchmarket för informationshämtning – även om Moonshot själva varnar för att K3 "fortfarande ligger efter de mest kraftfulla proprietära modellerna", och flera av dess rader från lanseringsdagen är fortfarande leverantörsrapporterade.

Intern-S2-397B:s bevis är dess egen lanseringstabell, körd genom OpenCompass, VLMEvalKit och AgentCompass, publicerad timmar innan du läser detta. Varje siffra är leverantörens egen och oreproducerad: MMLU Pro 89.77, MMMU Pro 81.68, HMMT-2026 93.56, SWE-bench-Pro 68.54 och TerminalBench 2.1 på 64.04 – en siffra som kortet visar förlorar mot en äldre sluten generation med bred marginal. Dess vetenskapliga rader är siffrorna som gör en specialists sak: 55.71 på Biology-Instructions, 63.28 på SciReasoner 1.5, 53.95 på Mol-Instructions, 62.35 på MolecularIQ. De två bevisbaserna berör inte varandra, vilket är anledningen till att den ärliga inramningen av denna matchning inte är ”vem vinner” utan ”vilken typ av bevis behöver din arbetsbelastning”.

A generated two-column scoreboard titled 'Intern-S2-397B vs Kimi K3 — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Biology-Instructions 55.71 vendor-reported. Right column 'Kimi K3': Weights Modified MIT open; Scale 2.8T total, ~104B active; Context 1M tokens in and out; Inputs text, image; Independent score AA Index mid-40s, long-context recall 88.7; Price .00 / 5.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Kimi K3 figures per Artificial Analysis and Moonshot AI.'

Vad var och en kostar, utgåvan med öppna vikter

Båda modellerna har öppna vikter, vilket förändrar kostnadsfrågan från den vanliga historien om förbrukningsbaserad kontra gratis till en jämförelse av två hostingalternativ. Kimi K3 har ett publicerat API-pris – $3,00 / $15,00 per miljon tokens enligt Moonshots listpris, vidarefakturerat via OrcaRouter med 0 % påslag, med prissättning för cacheläsning ovanpå – och den går även att ladda ner: en utgåva med öppna vikter på 96 shards som kräver hårdvara i supernode-klass, 64 eller fler acceleratorer, för att kunna serva. Den praktiska målgruppen för en självhostad K3 är team med datacenterbudgetar. Intern-S2-397B har inget publicerat API-pris alls; modellkortet pekar på det officiella Intern-API:t, och den verkliga ekonomin är den för självhostning: cirka 807 GB vikter fördelade över 188 shards i BF16, en rejäl multi-GPU-nod, med ett FP8-bygge som minskar utrymmesbehovet med ungefär hälften.

Båda modellerna kan anropas genom samma söm om du routar: Kimi K3 finns på OrcaRouter till Moonshots listpris med 0 % påslag, medan Intern-S2-397B inte är routad – en helt ny Apache-2.0-checkpoint, din väg till den är leverantörens eget API eller en egenhostad driftsättning. Routingvärdet i den här matchningen ligger i att hålla den långkontextiga generalisttrafiken på nyckeln du redan har och det vetenskapliga batcharbetet på modellen du kör, med automatisk failover mellan de två. DSL:en gör den gränsen till en konfiguration i stället för en andra integration.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.

Domen

Välj Kimi K3 när jobbet är generalistarbete med lång kontext – kodning av hela kodbaser, långvariga agentloopar, kunskapsarbete som kräver en miljon tokens i arbetsminne – och du vill ha en oberoende resultattavla bakom det. Det är modellen med starkast underbyggnad i alla avseenden, dess öppna vikter är verkliga (Modified MIT, 27 juli), och om du redan driver infrastruktur av supernodklass är kostnadsekonomin per token med cachelagring fördelaktig.

Välj Intern-S2-397B när uppgiften är vetenskaplig: figurtäta artiklar, molekylära diagram, skannad litteratur, tidsseriesignaler och data som måste stanna innanför din perimeter eller vikter som du vill finjustera på proprietära resultat. Apache-2.0 gör det möjligt, vilket inget hyrt API kan, och de vetenskapliga raderna i modellkortet är en annan art än vad en generalist någonsin har tränats för. Budgetera för hårdvaran, kör din egen utvärdering och behandla varje publicerad siffra om den som ett påstående tills någon utanför InternLM reproducerar en.

A screenshot of the OrcaRouter model page for Kimi K3 at orcarouter.ai/models/kimi/kimi-k3, captured September 13, 2026, showing the model listing with its provider MoonshotAI, 1,048,576-token context window, and .00 / 5.00 per-million-token pricing displayed alongside the surrounding catalogue.