Een gegenereerde hero-kaart die Intern-S2-397B en Kimi K3 vergelijkt, met links een wetenschappelijke literatuurpagina met een moleculair diagram dat een open-weights-kaart met 403 miljard parameters voedt, en rechts een lang documentlint dat een vlaggenschipmodel met 2,8 biljoen parameters met een 1M-contextmeter voedt, met het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Intern-S2-397B vs Kimi K3: Het 397B-wetenschapsmodel en de 2,8T-redeneergigant

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Intern-S2-397B en Kimi K3 staan aan weerszijden van de open-weightsgrens die de rest van 2026 zal bepalen: de downloadbare wetenschappelijke specialist tegenover de onafhankelijk bewezen generalist met lange context. Intern-S2-397B is het wetenschappelijke multimodale model met 403 miljard parameters dat InternLM op 13 september 2026 onder Apache-2.0 uitbracht — geen tariefkaart, geen onafhankelijke score, en een visietraject dat is getraind op ruwe pagina's uit de wetenschappelijke literatuur. Kimi K3 is Moonshot AI's mixture-of-experts-vlaggenschip met 2,8 biljoen parameters dat in juli 2026 werd gelanceerd tegen $3,00 per miljoen inputtokens en $15,00 per miljoen outputtokens, op 27 juli zijn gewichten vrijgaf onder een aangepaste MIT-licentie, en zes weken onafhankelijke evaluatie achter de rug heeft. Het ongewone aan deze confrontatie is dat beide modellen dezelfde langetermijnambitie hebben — blijven doorwerken aan een grote, rommelige taak — en die in tegengestelde richtingen oplossen.

Beide ambitieuze, tegengestelde mechanismen

De ambitie is gedeeld: elk model wil datgene zijn dat blijft doorgaan wanneer de taak lang is. Ze bereiken het op verschillende manieren, en het verschil is architectonisch.

Het antwoord van Kimi K3 is context. Een venster van 1.048.576 tokens op zowel input als output betekent dat je een hele repository, een hele dataroom of een agentlus van vijftig stappen in één gesprek kwijt kunt. De Mooncake-inferentiestack van Moonshot houdt naar verluidt cache-hitpercentages boven 90% vast bij codewerklasten, waardoor een outputprijs van $15 per miljoen in de praktijk levensvatbaar wordt. Kimi K3 biedt een top-level reasoning_effort-instelling en accepteert geen samplingparameters, redeneert standaard op maximale diepte, en verwacht dat je eerdere reasoning_content en tool_calls woordelijk opnieuw afspeelt in multi-turn tool-loops, anders gaat de kwaliteit achteruit.

Het antwoord van Intern-S2-397B is specialisatie plus controle op gewichtsniveau. De context — 256K tekstredenering en 64K multimodaal, beide cijfers uit de modelkaart — is een andere venstercategorie, genoeg voor een omvangrijk artikel of een lange onderzoekssessie, maar niet voor een werkset van een miljoen tokens. Wat het in plaats daarvan biedt, is een visuele route die wetenschappelijke literatuur native leest — figuren, lay-out, symbolische notatie en proza samen — en een tijdreeksinvoer die voorspellingen produceert, naast een denkmodus die standaard aan staat en per verzoek kan worden in- of uitgeschakeld. Als je langdurige taak wetenschappelijk is, is het model precies daarvoor getraind; als je langdurige taak een codebase is, is dit niet het model met het miljoen-tokenvenster daarvoor.

• Context — Kimi K3: 1.048.576 tokens in- en uitvoer vs. Intern-S2-397B: 256K tekst / 64K multimodaal.

• Schaal — Kimi K3: 2,8T totaal, ~104B actief per token vs. Intern-S2-397B: 403B totaal, 512 experts / 10 actief.

• Bedieningsoppervlak — Kimi K3: reasoning_effort-draaiknop, geen samplingparameters vs Intern-S2-397B: enable_thinking-schakelaar plus volledige controle op gewichtsniveau onder Apache-2.0.

• Invoer — Kimi K3: tekst, afbeelding vs Intern-S2-397B: tekst, afbeelding, tijdreeksen.

• Gewichten — Kimi K3: open onder Modified MIT (27 juli) vs Intern-S2-397B: open onder Apache-2.0 (13 september).

• Onafhankelijk bewijs — Kimi K3: zes weken aan scores van derden tegenover Intern-S2-397B: nog geen.

De asymmetrie in bewijs is het werkelijke verschil

Kimi K3 is door de onafhankelijke mangel gehaald en is eruit gekomen met scores waarop je kunt bouwen. Artificial Analysis plaatst het in de midden-40 op de huidige Intelligence Index, met een GPQA Diamond in de lage 90, een HLE in de midden-40, een onafhankelijk gemeten long-context recall van 88,7 en een codeerscore in de midden-70. Het bezet de eerste plaats op de Frontend Code Arena (Elo in de 1670) en behaalde 91,2 op BrowseComp, het hoogste cijfer op die long-horizon retrievalbenchmark — hoewel Moonshot zelf waarschuwt dat K3 "nog steeds achterloopt op de krachtigste propriëtaire modellen", en verschillende van de rijen die bij de lancering werden gepubliceerd, blijven door de leverancier gerapporteerd.

Het bewijs van Intern-S2-397B is zijn eigen lancerings­tabel, gedraaid via OpenCompass, VLMEvalKit en AgentCompass, gepubliceerd uren voordat u dit leest. Elk getal is van de leverancier zelf en niet gereproduceerd: MMLU Pro 89,77, MMMU Pro 81,68, HMMT-2026 93,56, SWE-bench-Pro 68,54 en TerminalBench 2.1 op 64,04 — een cijfer waarvan de kaart toont dat het met ruime marge verliest van een oudere gesloten generatie. De wetenschappelijke rijen zijn de cijfers die het pleidooi voor een specialist onderbouwen: 55,71 op Biology-Instructions, 63,28 op SciReasoner 1.5, 53,95 op Mol-Instructions, 62,35 op MolecularIQ. De twee bewijsbases raken elkaar niet, en daarom is de eerlijke framing van deze confrontatie niet "wie wint", maar "welk soort bewijs heeft uw workload nodig."

A generated two-column scoreboard titled 'Intern-S2-397B vs Kimi K3 — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Biology-Instructions 55.71 vendor-reported. Right column 'Kimi K3': Weights Modified MIT open; Scale 2.8T total, ~104B active; Context 1M tokens in and out; Inputs text, image; Independent score AA Index mid-40s, long-context recall 88.7; Price .00 / 5.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Kimi K3 figures per Artificial Analysis and Moonshot AI.'

Wat elk kost, open-weights-editie

Beide modellen hebben open gewichten, wat de kostenkwestie verandert van het gebruikelijke verhaal van verbruiksgebaseerd versus gratis in een vergelijking van twee hostingproposities. Kimi K3 heeft een gepubliceerde API-prijs — $3,00 / $15,00 per miljoen tokens tegen de lijstprijs van Moonshot, doorgegeven op OrcaRouter met 0% opslag, met cacheleesprijzen daarbovenop — en het is ook downloadbaar: een open-gewichtenrelease met 96 shards die hardware van supernode-klasse nodig heeft, 64 of meer accelerators, om te serveren. Het praktische publiek voor een zelfgehoste K3 zijn teams met datacenterbudgetten. Intern-S2-397B heeft helemaal geen gepubliceerde API-prijs; de modelkaart verwijst naar de officiële Intern API, en de echte economie is die van self-hosting: ongeveer 807 GB aan gewichten over 188 shards in BF16, een serieuze multi-GPU-node, waarbij een FP8-build de geheugenvoetafdruk ongeveer halveert.

Beide modellen zijn via dezelfde interface aanroepbaar als je routeert: Kimi K3 staat op OrcaRouter tegen Moonshots lijstprijs met 0% opslag, terwijl Intern-S2-397B niet wordt gerouteerd — een gloednieuwe Apache-2.0-checkpoint, waarbij je route ernaartoe de eigen API van de leverancier of een zelfgehoste deployment is. De waarde van routering in deze matchup is dat je het generalistische lange-contextverkeer op de sleutel houdt die je al hebt en het wetenschappelijke batchwerk op het model dat je draait, met automatische failover tussen de twee. De DSL maakt van die grens een configuratie in plaats van een tweede integratie.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.

Het vonnis

Kies Kimi K3 wanneer de taak lang-context generalistisch werk is — coderen over een hele repository, langdurige agent-loops, kenniswerk dat een miljoen tokens aan werkgeheugen nodig heeft — en je een onafhankelijk scorebord erachter wilt. Het is in elk opzicht het model met de sterkere onderbouwing, zijn open gewichten zijn echt (Modified MIT, 27 juli), en als je al infrastructuur van supernode-klasse draait, zijn de kosten per token met caching gunstig.

Kies Intern-S2-397B wanneer de taak wetenschappelijk is: figurenrijke papers, moleculaire diagrammen, gescande literatuur, tijdreekssignalen, en data die binnen je perimeter moeten blijven of gewichten die je wilt fine-tunen op propriëtaire resultaten. Apache-2.0 maakt dat mogelijk, geen enkele gehuurde API doet dat, en de wetenschappelijke rijen in de kaart zijn een ander soort dan waarvoor een generalist ooit is getuned. Begroot de hardware, voer je eigen evaluatie uit, en beschouw elk gepubliceerd cijfer erover als een claim totdat iemand buiten InternLM er een reproduceert.

A screenshot of the OrcaRouter model page for Kimi K3 at orcarouter.ai/models/kimi/kimi-k3, captured September 13, 2026, showing the model listing with its provider MoonshotAI, 1,048,576-token context window, and .00 / 5.00 per-million-token pricing displayed alongside the surrounding catalogue.