Eine generierte Hero-Karte, die Intern-S2-397B und Intern-S2 Mobius vergleicht: links ein großes wissenschaftliches multimodales MoE mit 403 Milliarden Parametern und einer mit „flagship 397B" beschrifteten Literaturseiten-Eingabe, rechts ein kompakter Reasoner mit 35 Milliarden Parametern, einem gemeinsamen Speicherblock und einer Iterationsschleife, beschriftet mit „Mobius-v0", mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Intern-S2-397B vs. Intern-S2 Mobius: Das 397B-Flaggschiff und der 35B-Reasoner

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Intern-S2-397B und Intern-S2 Mobius sind beide InternLM-Modelle, beide Apache-2.0, beide heißen Intern-S2, und unter dem Namen könnten sie kaum unterschiedlicher sein. Intern-S2-397B ist das Flaggschiff: ein Mixture-of-Experts-Modell mit 403 Milliarden Parametern für wissenschaftliche Intelligenz und Langhorizont-Agenten, das InternLM am 13. September 2026 veröffentlichte. Intern-S2 Mobius ist ein Reasoning-Experiment mit 35 Milliarden Parametern, das am 29. Juli 2026 erschien, auf der Mobius-v0-Architektur mit einem global geteilten Speicher und iterierenden Reasonern aufbaut und kontinuierlich von Qwen3.5-35B vortrainiert wurde. Die Namenskollision ist der ganze Grund, warum es diesen Vergleich geben muss, denn eine Suche nach „Intern-S2 Review“ wird beide Modelle zutage bringen, und die beiden sind in keiner Richtung Ersatz füreinander.

Zwei Architekturen, zwei Aufgaben

Intern-S2-397B ist ein konventioneller Transformer-MoE, breit dort, wo es zählt: 60 Schichten, 512 Experten mit 10 aktiven pro Token, ein 256K-Text-Reasoning-Kontext und ein 64K-multimodaler sowie eine Eingabeoberfläche, die Text, Bild und Zeitreihen aufnimmt. Sein Vortrainingsparadigma liest rohe Seiten wissenschaftlicher Literatur – Abbildungen, Layout, symbolische Notation und Prosa zusammen –, und sein Reinforcement Learning erstreckt sich über mehr als zwanzig wissenschaftliche Domänen, dazu Langhorizont-Agententraining in Sandbox-Umgebungen. Es ist ein Spezialist, der zugleich ein allgemeines Modell ist: MMLU Pro 89.77, MMMU Pro 81.68, SWE-bench-Pro 68.54 auf seiner eigenen Model Card, alle von InternLM berichtet und nicht reproduziert.

Intern-S2 Mobius ist eine andere Wette auf eine andere Frage. Statt Wissensspeicherung und Reasoning-Berechnung Schicht für Schicht zu verbinden, hält die Mobius-v0-Architektur ein global geteiltes Memory aus Wissensvektoren bereit und lässt mehrere Reasoner dagegen iterieren, wodurch verborgene Zustände über hochdichte kontinuierliche Repräsentationen verfeinert werden. Das Verkaufsargument ist Inferenzeffizienz: eine nahezu 4-fache End-to-End-Beschleunigung gegenüber der Qwen3.5-35B-Baseline, von der es abstammt, bei vergleichbaren oder stärkeren Reasoning-Werten. Das ist eine Durchsatzbehauptung über eine bestimmte Baseline – und eine Anbieterbehauptung, ohne unabhängige Reproduktion –, aber sie ist der Grund, warum das Modell existiert.

• Architektur — Intern-S2-397B: Standard-Transformer-MoE, 60 Schichten, 512 Experten / 10 aktiv vs. Intern-S2 Mobius: Mobius-v0, geteilter Speicher + iterierende Reasoner.

• Skalierung — Intern-S2-397B: 403B insgesamt, ~807 GB an Gewichten in BF16 vs. Intern-S2 Mobius: 35B insgesamt.

• Abstammung — Intern-S2-397B: ursprüngliches wissenschaftliches Vor-Trainings-Paradigma vs. Intern-S2 Mobius: kontinuierlich vortrainiert aus Qwen3.5-35B.

• Eingaben — Intern-S2-397B: Text, Bild, Zeitreihen vs. Intern-S2 Mobius: Text, Bild.

• Kontext — Intern-S2-397B: 256K Text / 64K multimodal vs. Intern-S2 Mobius: noch keine unabhängig angegebene Kontextgröße.

• Geschwindigkeitsangabe — Intern-S2-397B: keine beworbene Angabe vs. Intern-S2 Mobius: nahezu 4-fache Ende-zu-Ende-Reasoning-Beschleunigung gegenüber der Qwen3.5-35B-Baseline, vom Anbieter angegeben.

• Unabhängige Belege — keines der beiden Modelle hat eine Bewertung von Drittanbietern.

Welche Nummer gehört zu welchem Modell?

Die Namenskollision wird zu einer praktischen Gefahr, sobald man einen Testbericht liest. Eine Benchmark-Behauptung zu „Intern-S2“ – MMLU Pro 89.77, HMMT-2026 93.56, Biology-Instructions 55.71 – bezieht sich auf das 397B-Flaggschiff, denn das ist das Modell, zu dem die Markteinführungstabelle gehört. Eine Durchsatzbehauptung zu „Intern-S2“ – die nahezu 4-fache Beschleunigung – bezieht sich auf Mobius, denn das ist das Modell, dessen Architektur auf Inferenzeffizienz ausgelegt ist. Prüfen Sie die Parameteranzahl, bevor Sie eine der beiden Zahlen zitieren. Ein Testbericht, der sagt „Intern-S2 ist 4x schneller“, und einer, der sagt „Intern-S2 schlägt Grok 4.6 auf TerminalBench“, handeln von verschiedenen Modellen, und die zweite Behauptung hält nicht einmal der eigenen Anbietertabelle stand.

Was die Beleglage betrifft, wurde keines der beiden Modelle von jemandem außerhalb von InternLM getestet. Die Karte des Flaggschiffs ist eine Anbieter-Benchmark-Tabelle, die durch OpenCompass, VLMEvalKit und AgentCompass gelaufen ist; die Mobius-Karte ist eine Beschreibung plus eine Beschleunigungsangabe gegenüber einer Baseline, von der das Modell feinabgestimmt wurde. Das Fehlen unabhängiger Überprüfung wiegt hier schwerer als in den meisten Vergleichen, weil die stärksten Behauptungen der beiden Modelle auf völlig unterschiedlichen Achsen liegen – Fähigkeit für das eine, Durchsatz für das andere – und keine der beiden Achsen bisher eine externe Messung hat.

Welches soll ausgeführt werden?

Führen Sie Intern-S2-397B aus, wenn die Aufgabe wissenschaftliches Verständnis ist: das Lesen eines abbildungsreichen Papers, das Analysieren eines Moleküldiagramms, das Vorhersagen aus einem Zeitreihensignal oder das Betreiben eines langen Agenten, der eine Forschungsaufgabe durcharbeiten muss. Es ist das Modell, um das es in der Berichterstattung dieser Woche geht, und seine allgemeinen Werte sind respektabel genug, dass Sie kein One-Trick-Pony kaufen. Der Preis ist Hardware: Ein 403B-Checkpoint braucht einen ernsthaften Multi-GPU-Knoten, und wenn Sie keinen besitzen, ist die offizielle Intern API die Alternative.

Ziehen Sie Intern-S2 Mobius in Betracht, wenn es um umfangreiches Reasoning auf Hardware geht, die Sie bereits besitzen, und Ihnen die Kosten pro Token wichtiger sind als ein bis zwei Punkte beim Benchmark-Ergebnis. Ein 35B-Modell mit einem plausiblen 4-fachen Durchsatzvorteil gegenüber seiner Baseline ist ein wirklich interessantes Angebot für den Serving-Betrieb – aber validieren Sie die Geschwindigkeitssteigerung an Ihren eigenen Traces, bevor Sie darauf aufbauen, denn außerhalb von InternLM hat sie noch niemand reproduziert. Wie auch immer: Kennzeichnen Sie das Modell in jeder Ausarbeitung ausdrücklich, denn der Name allein verrät nicht mehr, welches Sie meinen.

A generated two-column scoreboard titled 'Intern-S2-397B vs Intern-S2 Mobius — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0; Scale 403B total MoE, 512 experts / 10 active; Context 256K text / 64K multimodal; Inputs text, image, time series; Purpose scientific intelligence + long-horizon agents; Independent score none yet. Right column 'Intern-S2 Mobius': Weights Apache-2.0; Scale 35B; Context not yet independently stated; Inputs text, image; Purpose efficient reasoning, ~4x speedup claim; Independent score none yet. Footer reads 'Both models' figures are InternLM's own, unreproduced.'A screenshot of the Hugging Face collection page for internlm's Intern-S2, captured September 13, 2026, listing internlm/Intern-S2 and internlm/Intern-S2-Mobius alongside the Intern-S2-Preview-397B and FP8 variants, showing the family lineage and that the collection was updated within the last 24 hours.A screenshot of the Hugging Face model card for internlm/Intern-S2-Mobius, captured September 13, 2026, showing the model as a 35B foundation model on the Mobius-v0 architecture with Apache-2.0 licence, the description of its globally shared Memory and iterating Reasoners, and the note that it was continual-pretrained from Qwen3.5-35B with a nearly 4x inference speedup reported.