
Intern-S2-397B vs. Kimi K3: Das 397B-Wissenschaftsmodell und der 2,8T-Reasoning-Riese
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Intern-S2-397B und Kimi K3 stehen auf entgegengesetzten Seiten der Open-Weights-Linie, die den Rest von 2026 definieren wird: der herunterladbare wissenschaftliche Spezialist gegenüber dem unabhängig geprüften Langkontext-Generalisten. Intern-S2-397B ist das wissenschaftliche multimodale Modell mit 403 Milliarden Parametern, das InternLM am 13. September 2026 unter Apache-2.0 veröffentlichte – ohne Preisliste, ohne unabhängigen Score und mit einem Vision-Pfad, der auf rohen Seiten wissenschaftlicher Literatur trainiert wurde. Kimi K3 ist das Flaggschiff-Modell von Moonshot AI als Mixture-of-Experts mit 2,8 Billionen Parametern, das im Juli 2026 zu 3,00 US-Dollar pro Million Input-Tokens und 15,00 US-Dollar pro Million Output-Tokens startete, am 27. Juli seine Gewichte unter einer Modified-MIT-Lizenz öffnete und sechs Wochen unabhängiger Evaluation hinter sich hat. Das Ungewöhnliche an diesem Duell ist, dass beide Modelle dieselbe Ambition bei langen Horizonten haben – an einer großen, unübersichtlichen Aufgabe weiterzuarbeiten – und sie auf entgegengesetzte Weise einlösen.
Beide ambitioniert, gegensätzliche Mechanismen
Der Ehrgeiz ist derselbe: Jedes Modell möchte das sein, das weitermacht, wenn die Aufgabe lang ist. Sie erreichen es auf unterschiedliche Weise, und der Unterschied ist architektonisch.
Kimi K3s Antwort ist Kontext. Ein 1.048.576-Token-Fenster sowohl für Eingabe als auch Ausgabe bedeutet, dass ein ganzes Repository, ein kompletter Datenraum oder eine 50-stufige Agent-Schleife in einer einzigen Konversation Platz finden können. Moonshots Mooncake-Inferenz-Stack hält Berichten zufolge bei Coding-Workloads Cache-Trefferraten von über 90 % aufrecht, wodurch ein Ausgabepreis von 15 Dollar pro Million in der Praxis tragbar wird. Kimi K3 bietet eine übergeordnete reasoning_effort-Steuerung und akzeptiert keine Sampling-Parameter, führt standardmäßig Reasoning mit maximaler Tiefe aus und erwartet, dass du vorherige reasoning_content und tool_calls in Multi-Turn-Tool-Schleifen wörtlich erneut übermittelst, andernfalls verschlechtert sich die Qualität.
Die Antwort von Intern-S2-397B lautet: Spezialisierung plus Kontrolle auf Gewichtsebene. Sein Kontext – 256K für Text-Reasoning und 64K für multimodale Eingaben, beides Zahlen aus der Model Card – ist eine andere Kategorie von Fenster: groß genug für ein umfangreiches Paper oder eine lange Forschungssitzung, aber nicht für ein Working Set von einer Million Token. Was es stattdessen bietet, ist ein Vision-Pfad, der wissenschaftliche Literatur nativ liest – Abbildungen, Layout, symbolische Notation und Fließtext zusammen – sowie eine Zeitreihen-Eingabe, die Prognosen erzeugt, daneben ein Denkmodus, der standardmäßig aktiv und pro Anfrage umschaltbar ist. Wenn es bei Ihrer langen Aufgabe um Wissenschaft geht, wurde das Modell genau dafür trainiert; wenn es bei Ihrer langen Aufgabe um eine Codebasis geht, ist dies nicht das Modell mit dem Million-Token-Fenster dafür.
• Kontext — Kimi K3: 1.048.576 Tokens Eingabe und Ausgabe vs. Intern-S2-397B: 256K Text / 64K multimodal.
• Skalierung — Kimi K3: 2,8 Bio. gesamt, ~104 Mrd. aktiv pro Token vs. Intern-S2-397B: 403 Mrd. gesamt, 512 Experten / 10 aktiv.
• Steueroberfläche — Kimi K3: reasoning_effort-Regler, keine Sampling-Parameter vs. Intern-S2-397B: enable_thinking-Schalter plus vollständige Kontrolle auf Gewichtsebene unter Apache-2.0.
• Eingaben — Kimi K3: Text, Bild vs. Intern-S2-397B: Text, Bild, Zeitreihe.
• Gewichte — Kimi K3: offen unter Modified MIT (27. Juli) vs. Intern-S2-397B: offen unter Apache-2.0 (13. September).
• Unabhängige Belege — Kimi K3: sechs Wochen Bewertungen von Drittanbietern vs. Intern-S2-397B: noch keine.
Die Asymmetrie der Beweislage ist der eigentliche Unterschied.
Kimi K3 hat den unabhängigen Härtetest durchlaufen und dabei Werte erzielt, auf die man bauen kann. Artificial Analysis ordnet es auf seinem aktuellen Intelligence Index im mittleren 40er-Bereich ein, mit einem GPQA Diamond im niedrigen 90er-Bereich, einem HLE im mittleren 40er-Bereich, einem unabhängig gemessenen Long-Context-Recall von 88,7 und einem Coding-Score im mittleren 70er-Bereich. Es hält den Spitzenplatz in der Frontend Code Arena (Elo im 1670er-Bereich) und erzielte 91,2 bei BrowseComp, dem höchsten Wert in diesem Long-Horizon-Retrieval-Benchmark – allerdings warnt Moonshot selbst, dass K3 „immer noch hinter den leistungsstärksten proprietären Modellen zurückliegt“, und mehrere seiner Zeilen vom Launch-Tag weiterhin Anbieterangaben sind.
Die Belege für Intern-S2-397B sind seine eigene Launch-Tabelle, die durch OpenCompass, VLMEvalKit und AgentCompass gelaufen ist und Stunden, bevor Sie dies lesen, veröffentlicht wurde. Jede Zahl stammt vom Anbieter selbst und wurde nicht unabhängig reproduziert: MMLU Pro 89,77, MMMU Pro 81,68, HMMT-2026 93,56, SWE-bench-Pro 68,54 und TerminalBench 2.1 bei 64,04 – ein Wert, bei dem die Karte laut Darstellung mit großem Abstand gegen eine ältere geschlossene Generation verliert. Seine wissenschaftlichen Zeilen sind die Zahlen, die den Fall für einen Spezialisten begründen: 55,71 bei Biology-Instructions, 63,28 bei SciReasoner 1.5, 53,95 bei Mol-Instructions, 62,35 bei MolecularIQ. Die beiden Evidenzgrundlagen berühren sich nicht, weshalb die ehrliche Einordnung dieses Duells nicht lautet: „Wer gewinnt“, sondern: „Welche Art von Evidenz benötigt Ihr Workload?“

Was jedes kostet, Open-Weights-Edition
Beide Modelle haben offene Gewichte, was die Kostenfrage vom üblichen Gegensatz zwischen nutzungsabhängiger Abrechnung und kostenloser Nutzung in einen Vergleich zweier Hosting-Optionen verwandelt. Kimi K3 hat einen veröffentlichten API-Preis – 3,00 $ / 15,00 $ pro Million Token auf Moonshots Liste, auf OrcaRouter mit 0 % Aufschlag weitergegeben, zuzüglich Cache-Read-Preisen – und ist außerdem herunterladbar: ein Open-Weights-Release mit 96 Shards, für dessen Betrieb Hardware der Supernode-Klasse, 64 oder mehr Beschleuniger, erforderlich ist. Die praktische Zielgruppe für ein selbst gehostetes K3 sind Teams mit Rechenzentrums-Budgets. Intern-S2-397B hat überhaupt keinen veröffentlichten API-Preis; die Modellkarte verweist auf die offizielle Intern-API, und die eigentliche Wirtschaftlichkeit liegt beim Selbsthosting: rund 807 GB Gewichte über 188 Shards in BF16, ein ernstzunehmender Multi-GPU-Knoten, wobei ein FP8-Build den Platzbedarf um etwa die Hälfte reduziert.
Beide Modelle sind über dieselbe Schnittstelle aufrufbar, wenn du routest: Kimi K3 ist auf OrcaRouter zum Listenpreis von Moonshot mit 0 % Aufschlag verfügbar, während Intern-S2-397B nicht geroutet wird — ein brandneuer Apache-2.0-Checkpoint, und dein Weg dorthin führt über die API des Anbieters selbst oder über ein selbst gehostetes Deployment. Der Mehrwert des Routings in diesem Duell besteht darin, den Traffic des Long-Context-Generalisten auf dem Schlüssel zu halten, den du bereits hast, und die wissenschaftliche Batch-Arbeit auf dem Modell laufen zu lassen, das du betreibst — mit automatischem Failover zwischen beiden. Die DSL macht diese Grenze zu einer Konfiguration statt zu einer zweiten Integration.

Das Urteil
Wählen Sie Kimi K3, wenn es sich um langkontextige Generalistenarbeit handelt – Coding über ein ganzes Repository, langanhaltende Agent-Schleifen, Wissensarbeit, die eine Million Tokens Arbeitsgedächtnis erfordert – und Sie ein unabhängiges Scoreboard dahinter wollen. Es ist das in jeder Hinsicht besser belegte Modell, seine offenen Gewichte sind real (Modified MIT, 27. Juli), und wenn Sie bereits Infrastruktur der Supernode-Klasse betreiben, ist die Token-Ökonomie mit Caching günstig.
Wählen Sie Intern-S2-397B, wenn die Aufgabe wissenschaftlich ist: abbildungsreiche Paper, Moleküldiagramme, gescannte Literatur, Zeitreihensignale und Daten, die innerhalb Ihres Perimeters bleiben müssen, oder Gewichte, die Sie auf proprietären Ergebnissen feinabstimmen möchten. Apache-2.0 macht das möglich, keine gemietete API schafft das, und die wissenschaftlichen Zeilen in der Karte sind eine andere Spezies als das, worauf ein Generalist jemals abgestimmt wurde. Rechnen Sie die Hardware ins Budget ein, führen Sie Ihre eigene Evaluierung durch und behandeln Sie jede veröffentlichte Zahl darüber als Behauptung, bis jemand außerhalb von InternLM eine davon reproduziert.

