Eine generierte Hero-Karte, die Intern-S2-397B und Qwen3.8-Max vergleicht und links einen offenen wissenschaftlichen Checkpoint mit einer Figure-Page-Eingabe und einem Apache-2.0-Badge zeigt und rechts einen abgerechneten Flagship-Endpunkt mit einer Rate-Card-Kachel mit der Aufschrift $2 / $6 und einem 1M-Token-Kontextmesser, mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Intern-S2-397B vs. Qwen3.8-Max: Zwei chinesische Flaggschiffe, gegensätzliche wirtschaftliche Wetten

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Intern-S2-397B und Qwen3.8-Max sind die beiden folgenreichsten chinesischen Flaggschiff-Starts Anfang September 2026, und sie sind gegensätzliche wirtschaftliche Wetten eingegangen. Intern-S2-397B, das 403-Milliarden-Parameter-Modell für wissenschaftliche multimodale Aufgaben, das das InternLM-Team des Shanghai AI Laboratory am 13. September unter Apache-2.0 veröffentlichte, wettet darauf, dass offene Gewichte der Weg sind, wissenschaftliche und agentische Workloads zu gewinnen: kein Preis pro Token, Gewichte auf Hugging Face und die eigene Hardware als Zähler. Qwen3.8-Max, Alibabas Flaggschiff mit 2,4 Billionen Parametern, das am 3. August allgemein verfügbar wurde und am 2. September aktualisiert wurde, wettet auf eine kostenpflichtige API zu 2,00 US-Dollar pro Million Eingabe-Token und 6,00 US-Dollar pro Million Ausgabe-Token bei einem Kontext von 1 Mio. Token, wobei offene Gewichte eine Woche nach der allgemeinen Verfügbarkeit erscheinen und ein unabhängiger Artificial-Analysis-Score bereits vorliegt. Bei diesem Duell geht es weniger darum, wessen Benchmarks gewinnen, als vielmehr darum, welche Wette – Eigentum oder ein nutzungsabhängig abgerechneter Endpunkt – zum Zuschnitt Ihrer Workload passt.

Zwei Flaggschiffe, zwei Wetten

Qwen3.8-Max ist Alibabas leistungsfähigste Stufe in der Qwen-Reihe, ein dünnbesetztes Mixture-of-Experts-Modell mit insgesamt 2,4 Billionen Parametern und etwa 95 Milliarden pro Token aktivierten Parametern, verteilt über 512 Experten, von denen 10 aktiv sind, plus ein gemeinsam genutzter. Es verfügt über ein Kontextfenster von 1 Mio. Token (983.616 Token bei aktiviertem Thinking in der gehosteten API), eine Ausgabeobergrenze von 131.072 Token, Text-, Bild- und Videoeingabe und wird über einen OpenAI-kompatiblen Endpunkt bereitgestellt. Seine prägendste Preisentscheidung ist eine Flatrate: derselbe Preis von 2,00 $ / 6,00 $, egal ob Ihr Prompt 5.000 oder 900.000 Token umfasst, wobei gecachte Eingaben günstiger bepreist werden – kein Langkontext-Zuschlag, genau der Hebel, für den die meisten Wettbewerber weiterhin extra berechnen. Alibaba positioniert es in seinem eigenen Migrationsleitfaden direkt gegen GPT-5.5, Claude Opus 4.7 und Gemini 3.1 Pro.

Intern-S2-397B ist ein Flaggschiff anderer Art. Es ist ein Mixture-of-Experts-Modell mit 60 Schichten und 512 Experten (10 pro Token aktiv), einem 256K-Kontext für Textschlussfolgerungen und 64K für multimodale Inhalte, einer Eingabeoberfläche aus Text, Bild und Zeitreihen sowie einem Pretraining-Paradigma, das rohe Seiten wissenschaftlicher Literatur liest – Abbildungen, Layout, symbolische Notation und Prosa –, anstatt zuerst Text herauszuparsen. Sein Reinforcement Learning erstreckt sich über mehr als zwanzig wissenschaftliche Domänen, und es wurde für langhorizontige Agentenarbeit in Sandbox-Umgebungen trainiert. Seine Preisgestaltung ist keine Preisliste, sondern deren Fehlen: Hosten Sie die Apache-2.0-Gewichte selbst, oder fordern Sie Zugang zur offiziellen Intern API an.

• Preis — Intern-S2-397B: keine Preisliste; selbst hosten oder Intern-API vs. Qwen3.8-Max: 2,00 $ / 6,00 $ pro 1M pauschal, gecachte Eingabe niedriger.

• Skalierung — Intern-S2-397B: 403B gesamt, 512 Experten / 10 aktiv vs. Qwen3.8-Max: 2,4T gesamt, 95B aktiv, 512 Experten / 10 + 1 geteilt.

• Kontext — Intern-S2-397B: 256K Text / 64K multimodal vs. Qwen3.8-Max: 1M Tokens, Flatrate.

• Eingaben — Intern-S2-397B: Text, Bild, Zeitreihen vs. Qwen3.8-Max: Text, Bild, Video.

• Gewichte — Intern-S2-397B: Apache-2.0, am Veröffentlichungstag offen vs. Qwen3.8-Max: benutzerdefinierte Qwen3.8-Max-Lizenz, geöffnet am 12. August nach GA.

• Unabhängige Bewertung — Intern-S2-397B: noch keine vs. Qwen3.8-Max: AA Intelligence Index 40, GPQA Diamond 92.7.

Beide Tabellen sind Anbietertabellen, und nur eine hat einen Schiedsrichter.

Beide Modelle wurden mit von Anbietern durchgeführten Benchmark-Tabellen eingeführt, was die Disziplin bei der Quellenauswahl identisch und die Erfolgsbilanz unterschiedlich macht. Die unabhängigen Zahlen von Qwen3.8-Max haben sich seitdem angesammelt: Artificial Analysis führt es mit 40 auf seinem aktuellen Intelligence Index, mit einem GPQA Diamond von 92,7, einem HLE von 43,0 und einem unabhängigen Coding-Score von 71,8, bei Kosten von etwa 2,67 $ pro Index-Aufgabe auf der aktuellen Skala. Das sind gemessene Zahlen von einem Drittanbieter-Tracker – der erste echte Schiedsrichter, den eines dieser beiden Flaggschiffe je hatte.

Die Belege von Intern-S2-397B sind seine eigene Modellkarte, die durch OpenCompass, VLMEvalKit und AgentCompass gelaufen ist und zusammen mit den Gewichten veröffentlicht wurde: MMLU Pro 89,77, MMMU Pro 81,68, HMMT-2026 93,56, SWE-bench-Pro 68,54 und TerminalBench 2.1 mit 64,04 – ein Wert, bei dem die Karte selbst zeigt, dass er gegen eine ältere geschlossene Generation verliert. Seine wissenschaftlichen Zeilen sind der Grund, warum es das Spezialisten-Argument gibt: Biology-Instructions 55,71, SciReasoner 1.5 63,28, Mol-Instructions 53,95, MolecularIQ 62,35. Jeder einzelne davon ist InternLMs eigen und nicht reproduziert. Nebeneinandergelegt erzählen die beiden Evidenzbasen dieselbe Geschichte aus entgegengesetzten Richtungen: Das eine Modell ist ein Spezialist mit respektablen allgemeinen Zeilen und ohne externe Messung, das andere ist ein Generalist mit einer unabhängigen Bewertung und ohne wissenschaftliche Feinabstimmung.

A generated two-column scoreboard titled 'Intern-S2-397B vs Qwen3.8-Max — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Price self-host or Intern API. Right column 'Qwen3.8-Max': Weights custom Qwen3.8-Max licence, opened Aug 12; Scale 2.4T total, 95B active; Context 1M flat-rate tokens; Inputs text, image, video; Independent score AA Index 40, GPQA 92.7; Price $2.00 / $6.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Qwen3.8-Max figures per Artificial Analysis and Alibaba.'

Was die Geldformen tatsächlich kaufen

Der pauschale $2 / $6-Tarif ist das Markenzeichen von Qwen3.8-Max, und es lohnt sich, genau darzulegen, was er bringt. Ein Repo-Analyse-Agent, der 200.000 Eingabe-Tokens Codekontext in einem einzigen Aufruf durchschickt, zahlt denselben Preis pro Token wie bei einem kurzen Chat – keinen Aufpreis für lange Prompts – und mit Caching senkt ein stabiler Codekontext den effektiven Eingabepreis bei wiederkehrendem Traffic drastisch. Das Modell ist außerdem als Open Weights unter der maßgeschneiderten Lizenz von Alibaba abrufbar, die kommerzielle Nutzung mit Namensnennung sowie skalenabhängige Hürden oberhalb von 100 Millionen MAU oder 20 Millionen US-Dollar Monatsumsatz erlaubt und eine separate Vereinbarung für große Unternehmen im Model-as-a-Service-Geschäft vorsieht.

Die Ökonomie von Intern-S2-397B ist die umgekehrte: überhaupt keine Verbrauchsmessung, dafür aber eine Investitionsausgabe. Die Gewichte umfassen in BF16 rund 807 GB verteilt auf 188 Shards – ein ernstzunehmender Multi-GPU-Knoten –, wobei ein FP8-Build den Footprint um etwa die Hälfte reduziert. Wenn Sie diese Kapazität bereits besitzen, nähern sich die Grenzkosten der nächsten wissenschaftlichen Abfrage den Stromkosten, und das ist die Wette: Eigentum macht den Spezialisten an der Grenze günstig. Wenn Sie die Hardware nicht besitzen, ist das „kostenlose“ Modell ein Pilot, und die offizielle Intern-API ist die einzige Alternative mit Verbrauchsabrechnung.

Die beiden Flaggschiffe können sich eine Naht teilen, wenn du routest. Qwen3.8-Max läuft auf OrcaRouter zu Alibabas Listenpreis, durchgereicht mit 0 % Aufschlag, sodass der Pauschaltarif von 2 $ / 6 $ und jede künftige Preissenkung hier am selben Tag ankommen. Intern-S2-397B wird nicht geroutet – es ist ein brandneuer Checkpoint, und dein Weg dorthin führt über die API des Anbieters oder ein selbst gehostetes Deployment. Schicke den allgemeinen, videofähigen Traffic mit langem Kontext an das abgerechnete Modell über den Schlüssel, den du bereits hast; behalte die wissenschaftliche Stapelverarbeitung auf dem Modell, das du selbst betreibst; lass das automatische Failover einspringen, wenn der Endpunkt einer der beiden Seiten ungesund ist. Die Grenze ist eher eine Routing-Regel als eine zweite Integration.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the feature blocks covering scientific-literature pre-training and multi-domain scientific reinforcement learning.

Das Urteil

Wählen Sie Qwen3.8-Max für allgemeines Reasoning und videofähige Produktionsarbeit, wo ein Pauschalpreis für eine Million Token alles unterbietet, was Rivalen verlangen, und wo eine unabhängige Rangliste das Risiko verringert, darauf aufzubauen. Seine Gewichte sind offen genug, um unter einer Lizenz relevant zu sein, deren Bedingungen die meisten Teams erfüllen, und sein $2 / $6-Tarif ist der aggressivste Preis auf dem Markt unter den Frontier-Flaggschiffen.

Wählen Sie Intern-S2-397B für wissenschaftliche Workloads – abbildungsdichte Papers, Moleküldiagramme, Zeitreihensignale –, bei denen die Eingabe auf eine Weise multimodal ist, für die ein Generalist nie optimiert wurde, und bei denen Datenresidenz oder Feintuning auf proprietären Ergebnissen Apache-2.0 zur entscheidenden Eigenschaft macht. Kalkulieren Sie die Hardware ein, führen Sie Ihre eigene Evaluierung durch und behandeln Sie seine Zahlen als Behauptungen, bis ein unabhängiger Schiedsrichter auftritt.

Die ehrliche Zusammenfassung lautet, dass diese beiden Flaggschiffe nicht wirklich Ersatz füreinander sind. Das eine ist ein eigenes wissenschaftliches Instrument mit achtbarer allgemeiner Leistungsfähigkeit; das andere ist ein gemieteter, unabhängig bewerteter Generalist mit Pauschalpreis und einem beiläufigen Interesse an Wissenschaft. Teams, die beides brauchen, sollten die Grenze als Routing-Entscheidung behandeln – und sollten ihre eigenen Evals auf Intern-S2-397B erneut laufen lassen, bevor sie irgendeiner Zahl auf den Folien eines der beiden Anbieter glauben.

A screenshot of the OrcaRouter model page for Qwen3.8-Max at orcarouter.ai/models/qwen/qwen3.8-max, captured September 13, 2026, showing the model listing with its provider Qwen, 1M-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.