
Intern-S2-397B vs Kimi K3: Het 397B-wetenschapsmodel en de 2,8T-redeneergigant
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Intern-S2-397B en Kimi K3 staan aan weerszijden van de open-weightsgrens die de rest van 2026 zal bepalen: de downloadbare wetenschappelijke specialist tegenover de onafhankelijk bewezen generalist met lange context. Intern-S2-397B is het wetenschappelijke multimodale model met 403 miljard parameters dat InternLM op 13 september 2026 onder Apache-2.0 uitbracht — geen tariefkaart, geen onafhankelijke score, en een visietraject dat is getraind op ruwe pagina's uit de wetenschappelijke literatuur. Kimi K3 is Moonshot AI's mixture-of-experts-vlaggenschip met 2,8 biljoen parameters dat in juli 2026 werd gelanceerd tegen $3,00 per miljoen inputtokens en $15,00 per miljoen outputtokens, op 27 juli zijn gewichten vrijgaf onder een aangepaste MIT-licentie, en zes weken onafhankelijke evaluatie achter de rug heeft. Het ongewone aan deze confrontatie is dat beide modellen dezelfde langetermijnambitie hebben — blijven doorwerken aan een grote, rommelige taak — en die in tegengestelde richtingen oplossen.
Beide ambitieuze, tegengestelde mechanismen
De ambitie is gedeeld: elk model wil datgene zijn dat blijft doorgaan wanneer de taak lang is. Ze bereiken het op verschillende manieren, en het verschil is architectonisch.
Het antwoord van Kimi K3 is context. Een venster van 1.048.576 tokens op zowel input als output betekent dat je een hele repository, een hele dataroom of een agentlus van vijftig stappen in één gesprek kwijt kunt. De Mooncake-inferentiestack van Moonshot houdt naar verluidt cache-hitpercentages boven 90% vast bij codewerklasten, waardoor een outputprijs van $15 per miljoen in de praktijk levensvatbaar wordt. Kimi K3 biedt een top-level reasoning_effort-instelling en accepteert geen samplingparameters, redeneert standaard op maximale diepte, en verwacht dat je eerdere reasoning_content en tool_calls woordelijk opnieuw afspeelt in multi-turn tool-loops, anders gaat de kwaliteit achteruit.
Het antwoord van Intern-S2-397B is specialisatie plus controle op gewichtsniveau. De context — 256K tekstredenering en 64K multimodaal, beide cijfers uit de modelkaart — is een andere venstercategorie, genoeg voor een omvangrijk artikel of een lange onderzoekssessie, maar niet voor een werkset van een miljoen tokens. Wat het in plaats daarvan biedt, is een visuele route die wetenschappelijke literatuur native leest — figuren, lay-out, symbolische notatie en proza samen — en een tijdreeksinvoer die voorspellingen produceert, naast een denkmodus die standaard aan staat en per verzoek kan worden in- of uitgeschakeld. Als je langdurige taak wetenschappelijk is, is het model precies daarvoor getraind; als je langdurige taak een codebase is, is dit niet het model met het miljoen-tokenvenster daarvoor.
• Context — Kimi K3: 1.048.576 tokens in- en uitvoer vs. Intern-S2-397B: 256K tekst / 64K multimodaal.
• Schaal — Kimi K3: 2,8T totaal, ~104B actief per token vs. Intern-S2-397B: 403B totaal, 512 experts / 10 actief.
• Bedieningsoppervlak — Kimi K3: reasoning_effort-draaiknop, geen samplingparameters vs Intern-S2-397B: enable_thinking-schakelaar plus volledige controle op gewichtsniveau onder Apache-2.0.
• Invoer — Kimi K3: tekst, afbeelding vs Intern-S2-397B: tekst, afbeelding, tijdreeksen.
• Gewichten — Kimi K3: open onder Modified MIT (27 juli) vs Intern-S2-397B: open onder Apache-2.0 (13 september).
• Onafhankelijk bewijs — Kimi K3: zes weken aan scores van derden tegenover Intern-S2-397B: nog geen.
De asymmetrie in bewijs is het werkelijke verschil
Kimi K3 is door de onafhankelijke mangel gehaald en is eruit gekomen met scores waarop je kunt bouwen. Artificial Analysis plaatst het in de midden-40 op de huidige Intelligence Index, met een GPQA Diamond in de lage 90, een HLE in de midden-40, een onafhankelijk gemeten long-context recall van 88,7 en een codeerscore in de midden-70. Het bezet de eerste plaats op de Frontend Code Arena (Elo in de 1670) en behaalde 91,2 op BrowseComp, het hoogste cijfer op die long-horizon retrievalbenchmark — hoewel Moonshot zelf waarschuwt dat K3 "nog steeds achterloopt op de krachtigste propriëtaire modellen", en verschillende van de rijen die bij de lancering werden gepubliceerd, blijven door de leverancier gerapporteerd.
Het bewijs van Intern-S2-397B is zijn eigen lanceringstabel, gedraaid via OpenCompass, VLMEvalKit en AgentCompass, gepubliceerd uren voordat u dit leest. Elk getal is van de leverancier zelf en niet gereproduceerd: MMLU Pro 89,77, MMMU Pro 81,68, HMMT-2026 93,56, SWE-bench-Pro 68,54 en TerminalBench 2.1 op 64,04 — een cijfer waarvan de kaart toont dat het met ruime marge verliest van een oudere gesloten generatie. De wetenschappelijke rijen zijn de cijfers die het pleidooi voor een specialist onderbouwen: 55,71 op Biology-Instructions, 63,28 op SciReasoner 1.5, 53,95 op Mol-Instructions, 62,35 op MolecularIQ. De twee bewijsbases raken elkaar niet, en daarom is de eerlijke framing van deze confrontatie niet "wie wint", maar "welk soort bewijs heeft uw workload nodig."

Wat elk kost, open-weights-editie
Beide modellen hebben open gewichten, wat de kostenkwestie verandert van het gebruikelijke verhaal van verbruiksgebaseerd versus gratis in een vergelijking van twee hostingproposities. Kimi K3 heeft een gepubliceerde API-prijs — $3,00 / $15,00 per miljoen tokens tegen de lijstprijs van Moonshot, doorgegeven op OrcaRouter met 0% opslag, met cacheleesprijzen daarbovenop — en het is ook downloadbaar: een open-gewichtenrelease met 96 shards die hardware van supernode-klasse nodig heeft, 64 of meer accelerators, om te serveren. Het praktische publiek voor een zelfgehoste K3 zijn teams met datacenterbudgetten. Intern-S2-397B heeft helemaal geen gepubliceerde API-prijs; de modelkaart verwijst naar de officiële Intern API, en de echte economie is die van self-hosting: ongeveer 807 GB aan gewichten over 188 shards in BF16, een serieuze multi-GPU-node, waarbij een FP8-build de geheugenvoetafdruk ongeveer halveert.
Beide modellen zijn via dezelfde interface aanroepbaar als je routeert: Kimi K3 staat op OrcaRouter tegen Moonshots lijstprijs met 0% opslag, terwijl Intern-S2-397B niet wordt gerouteerd — een gloednieuwe Apache-2.0-checkpoint, waarbij je route ernaartoe de eigen API van de leverancier of een zelfgehoste deployment is. De waarde van routering in deze matchup is dat je het generalistische lange-contextverkeer op de sleutel houdt die je al hebt en het wetenschappelijke batchwerk op het model dat je draait, met automatische failover tussen de twee. De DSL maakt van die grens een configuratie in plaats van een tweede integratie.

Het vonnis
Kies Kimi K3 wanneer de taak lang-context generalistisch werk is — coderen over een hele repository, langdurige agent-loops, kenniswerk dat een miljoen tokens aan werkgeheugen nodig heeft — en je een onafhankelijk scorebord erachter wilt. Het is in elk opzicht het model met de sterkere onderbouwing, zijn open gewichten zijn echt (Modified MIT, 27 juli), en als je al infrastructuur van supernode-klasse draait, zijn de kosten per token met caching gunstig.
Kies Intern-S2-397B wanneer de taak wetenschappelijk is: figurenrijke papers, moleculaire diagrammen, gescande literatuur, tijdreekssignalen, en data die binnen je perimeter moeten blijven of gewichten die je wilt fine-tunen op propriëtaire resultaten. Apache-2.0 maakt dat mogelijk, geen enkele gehuurde API doet dat, en de wetenschappelijke rijen in de kaart zijn een ander soort dan waarvoor een generalist ooit is getuned. Begroot de hardware, voer je eigen evaluatie uit, en beschouw elk gepubliceerd cijfer erover als een claim totdat iemand buiten InternLM er een reproduceert.

