
Intern-S2 vs. GPT-5.6 Sol: Der kostenlose Checkpoint und das 30-Dollar-Flaggschiff
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Die Preiszeile in diesem Vergleich wirkt auf den ersten Blick absurd. Intern-S2, ein multimodales Modell mit 397 Milliarden Parametern, das InternLM heute unter Apache-2.0 veröffentlicht hat, kostet nichts zum Herunterladen und nichts pro Abfrage, sobald man die Hardware besitzt, um es auszuführen. GPT-5.6 Sol, OpenAIs Flaggschiff-Reasoning-Tier, wird mit 5,00 $ pro Million Eingabe-Token und 30,00 $ pro Million Ausgabe-Token auf OpenAIs Basis-Tier gelistet — allerdings beträgt der Werbepreis, den OpenAI seit Ende Juli fährt und den unsere eigene Modellseite derzeit anzeigt, 4,00 $ Eingabe und 20,00 $ Ausgabe. Das ist eine echte Lücke, und es ist das Erste, was jedem auffällt — und es ist zugleich die am wenigsten nützliche Tatsache im Vergleich, denn das 30-Dollar-Modell und das kostenlose konkurrieren nicht um dieselbe Arbeit. GPT-5.6 Sol ist das Tier, auf das OpenAI zeigt, wenn das schwierigste Reasoning, das Ihre Anwendung je versuchen wird, korrekt zurückkommen muss. Intern-S2 ist ein wissenschaftliches Instrument mit einem Vision-Pfad, der auf rohen Literaturseiten trainiert wurde, und einem Prognose-Kopf für Zeitreihensignale. Die Frage ist nicht, welches billiger ist. Sie lautet, welches Ihre Workload tatsächlich braucht, und ob das „kostenlose“ wirklich kostenlos ist.
Was die Anbietertabelle Ihnen verrät – und was nicht
InternLM hat Intern-S2 gegen GPT-5.5 gebencht, nicht gegen GPT-5.6 Sol. Das sollte vor allem anderen klargestellt werden, denn jede kursierende Behauptung „Intern-S2 schlägt GPT“ ist ein Vergleich mit der vorherigen OpenAI-Generation, und jede Seite, die es als Sol-Ergebnis darstellt, extrapoliert. Die GPT-5.6-Familie umfasst außerdem drei Stufen – Sol für die schwierigsten Aufgaben, Terra für ausgewogene Produktion, Luna für hohes Volumen – und OpenAI hat ihre Preise aktiv angepasst, sodass eine aus einem September-Artikel zitierte Sol-Zahl bereits veraltet sein kann.
Was der Vergleich des Anbieters tatsächlich belegt – mit dem bleibenden Vorbehalt, dass jede Intern-S2-Zahl von InternLM selbst stammt und nicht reproduziert wurde:
• Molekülstruktur-Reasoning — Intern-S2 62,35 auf MolecularIQ vs. GPT-5.5s 76,41. Intern-S2 verliert.
• Wissenschaftliche Werkzeugnutzung — Intern-S2 66,76 bei TOMG-Bench vs. GPT-5.5 mit 69,89. Eine knappe Niederlage.
• Bio-molekulare Anweisung — Intern-S2 53,95 vs. 40,49. Ein klarer Sieg für Intern-S2.
• Oberstufenmathematik — Intern-S2 93,56 bei HMMT-2026 gegenüber 97,06 von GPT-5.5. Intern-S2 verliert.
• Allgemeinwissen — Intern-S2 89,77 bei MMLU Pro vs. 88,20. Ein knapper Sieg für Intern-S2.
• Multimodales Wissen — Wert von 81,68 bei MMMU Pro.
• Terminal-Beherrschung — GPT-5.5 79,40 bei TerminalBench 2.1 gegenüber Intern-S2 64,04. Ein Rückstand von fünfzehn Punkten.
Selbst gegen ein um eine Generation älteres OpenAI-Modell verliert Intern-S2 mehr allgemeine Zeilen, als es gewinnt, und gewinnt bei den wissenschaftlichen. Gegen Sol – eine Stufe, die ausdrücklich über GPT-5.5 für die schwierigsten Denkaufgaben positioniert ist – wird die allgemeine Lücke mit ziemlicher Sicherheit größer. Nichts in den Belegen stützt die Annahme, dass der kostenlose Checkpoint bei allgemeinen Fähigkeiten mit dem kostenpflichtigen Flaggschiff konkurrenzfähig ist, und die ehrliche Einordnung ist, dass Intern-S2 ein Spezialist ist, der im Allgemeinen respektabel und in seinem Bereich exzellent ist.
„Free" ist eine Investitionsausgabe, kein Rabatt.
Dass Intern-S2 keine Lizenzkosten verursacht, ist real, aber das ist nicht dasselbe wie kostenlose Inferenz, und hier wird der Vergleich praktisch. Ein Checkpoint mit 403 Milliarden Parametern benötigt einen ernstzunehmenden Multi-GPU-Knoten, um bereitgestellt zu werden. Wenn Sie diese Kapazität bereits besitzen und sie nicht vollständig ausgelastet ist, liegen die Grenzkosten der nächsten wissenschaftlichen Anfrage nahe bei den Stromkosten – was eine wirklich starke wirtschaftliche Position ist und der Grund, warum es offene Gewichte gibt. Wenn Sie diese Kapazität nicht besitzen, bedeutet „kostenlos“ den Kauf oder die Miete von Hardware, und die Rechnung ändert sich vollständig.
Die Wirtschaftlichkeit von GPT-5.6 Sol ist genau umgekehrt. Es gibt keine Hardware zu kaufen und kein Modell zu betreiben. Sie zahlen den nutzungsabhängigen Tarif – 5,00 $ pro Million Input-Tokens und 30,00 $ pro Million Output-Tokens in der Basisstufe, oder den Aktionspreis von 4,00 $/20,00 $, der derzeit auf unserer Modellseite gilt – und das Modell kommt mit einem Kontextfenster von 1,05 Mio. Tokens, einer Output-Obergrenze von 128K, Vision, Tools und der gesammelten Zuverlässigkeit eines Flaggschiffs, das seit dem Start seiner API am 9. Juli 2026 im Produktivbetrieb läuft. Die Ultrafast-Vorschau, die Sol auf Wafer-Scale-Hardware mit bis zu 750 Output-Tokens pro Sekunde ausführt, rückt dasselbe Modell in Richtung latenzkritischer Workloads, ist allerdings auf eine kleine Kundengruppe beschränkt und hat keinen veröffentlichten Preis. Was Sie mit den 30 $ kaufen, ist nicht nur Leistungsfähigkeit – es ist die Abwesenheit eines Betriebsteams.
• Gewichte — Intern-S2 Apache-2.0, herunterladbar vs. GPT-5.6 Sol geschlossen, nur per API.
• Kostenprofil — Investitionsausgaben für einen 403B-Checkpoint bei Intern-S2 oder getaktete offizielle Intern-API vs. GPT-5.6 Sol 5,00 $ / 30,00 $ pro Million Listenpreis, 4,00 $ / 20,00 $ Aktionspreis.
• Kontext / Ausgabe — Intern-S2 bis zu 256K Text, 64K multimodal evaluiert; Ausgabe unveröffentlicht vs. GPT-5.6 Sol ~1,05M Kontext, 128K Ausgabe.
• Eingaben — Intern-S2 Text, Bild, Zeitreihen vs. GPT-5.6 Sol Text und Bild.
• Unabhängige Bewertung — Intern-S2 bislang keine vs. GPT-5.6 Sol, Top-Tier-Flaggschiff mit einer langen öffentlichen Evaluierungshistorie.
• Geschwindigkeitsklasse — Intern-S2 hardwaregebunden vs. GPT-5.6 Sol Ultrafast preview mit bis zu 750 Ausgabe-Tokens pro Sekunde, laut Herstellerangabe.

Wo der kostenlose Checkpoint wirklich gewinnt
Es gibt drei Situationen, in denen Intern-S2 Sol schlägt, ohne dass ein Benchmark im Spiel ist.
Der erste Punkt ist die Datenresidenz. GPT-5.6 Sol ist eine geschlossene API – jede Anfrage verlässt Ihre Infrastruktur und läuft durch die Systeme von OpenAI, unterliegt dabei OpenAIs Inhaltsrichtlinie. Intern-S2 unter Apache-2.0 kann air-gapped in einer regulierten Umgebung betrieben werden, mit Daten, die rechtlich nicht an einen Drittanbieter-Endpunkt gesendet werden dürfen. Für ein Pharmalabor, ein Krankenhaussystem oder einen Verteidigungsauftragnehmer ist diese Eigenschaft kein Feature; sie ist die gesamte Beschaffungsentscheidung, und keine noch so große Leistungsfähigkeit von Sol kann sie ersetzen.
Der zweite Punkt ist die Modalität. Intern-S2 akzeptiert Zeitreihen-Eingaben und erzeugt Prognosen; außerdem liest es rohe Seiten wissenschaftlicher Literatur als native visuelle Darstellung statt als extrahierten Text. Sol verarbeitet Text und Bilder. Wenn es sich bei Ihren Daten um eine Seismographenspur, eine Lastkurve oder ein gescanntes Paper mit vielen Abbildungen handelt, hat Intern-S2 einen Pfad, den Sol nicht hat, und die Zeile „Biology-Instructions“ des Anbieters (55,71 gegenüber 10,52 bei GPT-5.5) ist die Zahl, die das widerspiegelt.
Der dritte Punkt ist Fine-Tuning. Sie können die Gewichte von Intern-S2 nehmen und mit Ihren eigenen proprietären experimentellen Daten trainieren und dieses Modell dann für immer behalten. Mit Sol ist das zu keinem Preis möglich. Für ein Team, dessen Wettbewerbsvorteil ein spezialisierter Datensatz ist, kann ein anpassbarer offener Checkpoint mehr wert sein als ein stärkeres eingefrorenes Modell.

Beide ausführen, ohne auszuwählen
Die Teams, die das Beste aus dieser Paarung herausholen, behandeln sie nicht als Gabel. Sie leiten die allgemeine, latenzempfindliche und hochriskante Argumentation an GPT-5.6 Sol weiter – das auf OrcaRouter zu OpenAI-Listenpreis mit 0% Aufschlag läuft, auf demselben Schlüssel wie über 200 andere Modelle, sodass eine Preisänderung von Sol noch am selben Tag durchgereicht wird und eine schlechte Anbieterstunde durch automatisches Failover abgedeckt wird – und sie behalten die wissenschaftlichen Batch-Arbeiten auf Intern-S2, wo immer sie sie ausführen. Die Routing-DSL macht diese Grenze explizit: schwierige allgemeine Argumentation geht den einen Weg, Dokumenten- und Signalanalyse den anderen, und die Aufteilung ist eine Konfiguration statt einer zweiten Integration.
Intern-S2 ist nicht auf OrcaRouter; es ist ein noch am selben Tag veröffentlichter Apache-2.0-Checkpoint, und der Weg dorthin führt über die API des Anbieters selbst oder ein selbst gehostetes Deployment. Sol ist über den Schlüssel erreichbar. Zwischen den beiden ist die praktische Architektur für eine wissenschaftsintensive Anwendung ein Endpunkt für die Frontier-Aufrufe und ein Deployment für den Spezialisten – mit der Option, später eine der beiden Seiten zu verlagern.

Das Urteil
Wenn Sie die anspruchsvollste Denkleistung benötigen, die Ihre Anwendung je versuchen wird, sie in einem einzigen API-Aufruf möchten und bereit sind, dafür den verbrauchsabhängig abgerechneten Flaggschiff-Tarif zu zahlen, dann ist GPT-5.6 Sol die Antwort – und ein noch am selben Tag veröffentlichter offener Checkpoint ändert daran nichts. Nichts in InternLMs eigener Tabelle zeigt, dass Intern-S2 bei der allgemeinen Leistungsfähigkeit mit einem aktuellen OpenAI-Flaggschiff mithält; der Vergleich wurde gegen die vorherige Generation durchgeführt, und das offene Modell verlor in den meisten allgemeinen Zeilen weiterhin.
Wenn Ihre Workload wissenschaftlich ist, Ihre Daten Ihre Infrastruktur nicht verlassen dürfen oder Sie anhand proprietärer experimenteller Ergebnisse feinabstimmen müssen, ist Intern-S2 das Modell, das diese Dinge überhaupt kann – und seine Apache-2.0-Lizenz bedeutet, dass die Version, die Sie validieren, die Version ist, die Sie behalten. Planen Sie die Hardware ein, rechnen Sie damit, Ihre eigene Evaluierung durchzuführen, und behandeln Sie jede veröffentlichte Zahl darüber als Behauptung, bis jemand außerhalb von InternLM eine davon reproduziert.
Für die Frontier-Aufrufe neben allem, was Sie selbst hosten: Über 200 weitere Modelle halten das geschlossene Flaggschiff auf einem einzigen Schlüssel zum Listenpreis des Anbieters, sodass sich die spezialisierte Bereitstellung und das nutzungsabhängig abgerechnete Modell per Routing-Regel austauschen lassen.
