Eine generierte Hero-Karte, die Intern-S2 und Gemini 3.1 Pro vergleicht, mit einer wissenschaftlichen Abbildungsseite und einem Diagramm, die links ein multimodales Modell speisen, und vier Eingabesymbolen für Bild, Audio, Video und Text um eine geschlossene API-Karte rechts, beschriftet mit dem Kontrast zwischen Apache-2.0-wissenschaftlicher Multimodalität und einem geschlossenen allgemeinen multimodalen Flaggschiff mit 1M-Kontext, mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Intern-S2 vs. Gemini 3.1 Pro: Das multimodale Kräftemessen, das InternLM tatsächlich gemessen hat

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die meisten Vergleiche in dieser Serie erfordern das Zusammenfügen der Behauptungen zweier Anbieter. Dieser nicht. Intern-S2, das heute von InternLM veröffentlichte multimodale Modell mit 397 Milliarden Parametern unter Apache-2.0, und Gemini 3.1 Pro, Googles Flaggschiff-Reasoning-Modell, erscheinen beide als gemessene Spalten in derselben Benchmark-Tabelle – was dies zum fairsten direkten Vergleich im Set macht und, nicht zufällig, zu dem, bei dem das offene Modell am meisten zu erklären hat. Gemini 3.1 Pro liest Text, Bilder, Audio und Video, hat einen 1-Mio.-Token-Kontext und ist seit seinem Eintritt in die Vorschau am 19. Februar 2026 von unabhängigen Laboren und Produktionsverkehr auseinandergenommen worden. Intern-S2 liest Text, Bilder und Zeitreihen, wurde heute Morgen auf Hugging Face hochgeladen und hat keinerlei Bewertung von Drittanbietern. In den Zeilen, in denen beide gemessen wurden, gewinnt Googles Modell mehrheitlich.

Beide lesen Bilder. Dort endet die Ähnlichkeit.

Das Wort „multimodal“ lässt diese Modelle ebenbürtig klingen. Sie sind es nicht, und der Unterschied liegt darin, worauf jedes einzelne ausgelegt wurde zu schauen.

Der Vision-Pfad von Intern-S2 wurde darauf trainiert, rohe Seiten wissenschaftlicher Literatur – Abbildungen, Gleichungen, Strukturdiagramme, Layout – als eine einzige gemeinsame Repräsentation aufzunehmen, statt zuerst Text herauszuparsen. Seine multimodalen Benchmarks sind wissenschaftlich: biologische Mikroskopie-VQA, Fernerkundung, wissenschaftliche Diagramm-Fragebeantwortung. Es akzeptiert außerdem Zeitreihendaten und kann Vorhersagen erstellen – ein Eingabetyp, den kaum ein allgemeines Flaggschiffmodell überhaupt verarbeitet.

Die Multimodalität von Gemini 3.1 Pro ist universell einsetzbar und in ihrer Art breiter gefächert: Text, Bild, Audio und Video in einem einzigen Modell, ausgerichtet auf die gesamte Bandbreite produktiver Aufgaben, bei denen man ein Modell auf eine Datei ansetzt und eine Frage stellt. Eine Meeting-Aufzeichnung, ein UI-Screenshot, ein Diagramm in einem PDF, ein Videoclip – alles völlig legitim, alles mit sechs Monaten öffentlicher Evaluierung im Rücken.

Wenn es sich bei Ihrer Eingabe um eine wissenschaftliche Abbildung handelt, wurde Intern-S2 eigens dafür entwickelt und hat die Herstellerzahlen, um für sich zu argumentieren. Wenn es sich bei Ihrer Eingabe um etwas anderes handelt, unterstützt Gemini 3.1 Pro Audio und Video, und Intern-S2 unterstützt keines von beiden. Das klärt einen großen Teil der Fragen der Art „Welches sollte ich verwenden?“ bevor Preis oder Benchmarks ins Spiel kommen, und wer Ihnen sagt, die beiden seien austauschbar, hat die Eingabeliste nicht gelesen.

Was die geteilte Tabelle zeigt, ehrlich gelesen

Da InternLM beide einem Benchmark unterzogen hat, ist dies einer der wenigen Fälle, in denen ein direkter Vergleich legitim ist und nicht erst zusammengestellt wurde. Der Vorbehalt ist unverändert und sollte einmal ausgesprochen werden: Jede Intern-S2-Zahl ist vom Anbieter gemeldet, von InternLM mit seinem eigenen Harness über OpenCompass, VLMEvalKit und AgentCompass ermittelt, ohne unabhängige Reproduktion. Die Zahlen von Gemin​i in dieser Tabelle stammen ebenfalls aus dem Durchlauf des Vergleichs durch InternLM, obwohl Gemin​i außerhalb davon auf eine umfangreiche unabhängige Bilanz verweisen kann.

• Multimodales Wissen — Gemini 3.1 Pro 83,99 bei MMMU Pro vs. Intern-S2 81,68.

• Wissenschaftliche Diagramm-QA — Gemini 3.1 Pro 71,18 bei ChartQAPro vs. Intern-S2 71,12. Ein totes Rennen auf zwei Dezimalstellen genau.

• Fernerkundung — Gemini 3.1 Pro 54,27 auf XLRS-Bench vs. Intern-S2 51,38.

• Mikroskopie-VQA — Gemini 3.1 Pro 71,02 auf MicroVQA vs. Intern-S2 69,67.

• Wissenschaftliche multimodale Aufgaben — Intern-S2 60,74 bei SFE vs. Gemini 3.1 Pro 59,57. Intern-S2s einziger multimodaler Sieg.

• Allgemeinwissen — Gemini 3.1 Pro 91,00 bei MMLU Pro vs. Intern-S2 89,77.

• Oberstufenmathematik — Gemini 3.1 Pro 94,70 bei HMMT-2026 vs. Intern-S2 93,56.

• Schlussfolgerungsfähigkeit in wissenschaftlicher Literatur — Intern-S2 55,71 bei Biology-Instructions vs. Gemini 3.1 Pro 13,87, und 53,95 vs. 38,84 bei Mol-Instructions.

• Aufgaben aus Wissenschafts-Olympiaden — Intern-S2 87,00 bei FrontierScience-Olympiad vs. Gemini 3.1 Pro 79,00.

• Terminal-Beherrschung — Gemini 3.1 Pro 73,80 auf TerminalBench 2.1 vs. Intern-S2 64,04.

Die ehrliche Lesart: Gemini 3.1 Pro gewinnt die breiten multimodalen Zeilen mit knappen Vorsprüngen, Intern-S2 gewinnt die tiefgehenden Zeilen zur wissenschaftlichen Fachliteratur mit enormen Vorsprüngen, und keines der Ergebnisse ist überraschend angesichts dessen, worauf jeweils trainiert wurde. Die Knappheit der multimodalen Niederlagen ist wohl der interessantere Befund – dass ein am selben Tag veröffentlichter offener Checkpoint bei MMMU Pro und ChartQAPro innerhalb von zwei Punkten von einem sechs Monate alten geschlossenen Flaggschiff landet, ist für InternLM ein stärkeres Ergebnis als jeder seiner spektakulären Wissenschaftswerte.

Kontext, Ausgabe und die Vorschaufrage

Die Geschichte mit langen Eingaben teilt sich sauber auf. Gemini 3.1 Pro verfügt über ein 1-Mio.-Token-Kontextfenster mit einer Ausgabeobergrenze von 64K – genug für eine Sammlung langer Dokumente und eine substanzielle Antwort. Intern-S2 wird mit bis zu 256K Token für Textschlussfolgerungen und 64K für multimodale Aufgaben evaluiert und gibt keine Obergrenze für die Ausgabe an; betrachten Sie sein nutzbares Fenster als kleiner als das von Gemin​i, bis es jemand unabhängig misst.

Es gibt einen operativen Vorbehalt auf Google-Seite, der in jeden ehrlichen Vergleich gehört. Gemini 3.1 Pro ist noch ein Preview-Modell, kein GA-Release. Preview-Modelle gehen mit geringeren Zuverlässigkeitserwartungen einher, und ein 7-Tage-Fehlerraten-Panel auf einer Modellseite ist eine ständige Erinnerung daran, die Instabilität zu umgehen, statt einen kritischen Pfad darauf aufzubauen. Intern-S2 ist eine vollständige Apache-2.0-Veröffentlichung mit Gewichten, die man pinnen kann – was das brandneue offene Modell kontraintuitiv zum operativ stabileren der beiden macht, und zwar im wichtigsten Sinne: Niemand kann es unter dir ändern.

• Kontext — Intern-S2 256K Text / 64K multimodal evaluiert vs. Gemini 3.1 Pro 1M Token.

• Eingaben — Intern-S2 Text, Bild, Zeitreihen vs. Gemini 3.1 Pro Text, Bild, Audio, Video.

• Gewichte — Intern-S2 Apache-2.0, herunterladbar vs. Gemini 3.1 Pro geschlossen.

• Reife — Intern-S2 ist wenige Stunden alt, kein unabhängiger Score gegenüber Gemini 3.1 Pro Preview seit Februar 2026, umfangreich und unabhängig getestet.

• Preis — Intern-S2: keine öffentliche Preisliste; Selbst-Hosting oder offizielle Intern API vs. Gemini 3.1 Pro 2,00 $ Eingabe / 12,00 $ Ausgabe pro Million, bei über 200K Eingabe-Tokens steigend auf 4,00 $/18,00 $.

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

Preis und wo jeder Einzelne lebt

Gemini 3.1 Pro berechnet in der Standardstufe 2,00 $ pro Million Eingabe-Token und 12,00 $ pro Million Ausgabe-Token und steigt auf 4,00 $/18,00 $, sobald eine Anfrage 200K Eingabe-Token überschreitet – ein Long-Context-Aufschlag, der genau dann zuschlägt, wenn Sie das 1M-Fenster nutzen, das die Wahl rechtfertigt. Es ist auf OrcaRouter zu genau diesem Listenpreis routbar, mit 0 % Aufschlag weitergegeben, auf einem Schlüssel, der auch über 200 weitere Modelle verfügt; die Weitergabe ist hier wichtig, weil eine Preisanpassung von Google noch am selben Tag bei uns ankommt und nicht erst nach einem Neuberechnungszyklus. Die Routing-DSL ist der nützliche Teil für genau dieses Duell: Sie können Bild- und Videoarbeit an Gemini 3.1 Pro und wissenschaftliche Dokumentenstapel an ein selbst gehostetes Intern-S2 senden und beides hinter einem Endpunkt halten, ohne einen zweiten Vertrag oder eine Codeänderung.

Für Intern-S2 gibt es keinen veröffentlichten API-Preis. Das Selbsthosting der Apache-2.0-Gewichte ist der Weg, den die meisten Teams tatsächlich einschlagen werden, und bei 403B Parametern ist es eine echte Hardware-Verpflichtung. Die offizielle Intern-API existiert für Teams, die lieber keine GPUs betreiben möchten, doch ohne öffentliche Preisliste ist der Kostenvergleich mit den 2 $/12 $ von Gemin​i kein Vergleich, den man auf dem Papier anstellen kann – man muss ein Kontingent anfragen und die Rechnung selbst machen.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

Der Anruf.

Wählen Sie Gemini 3.1 Pro, wenn Sie ein allgemeines multimodales Modell benötigen, das Audio und Video verarbeitet, eine Million Token umfasst, über Monate unabhängiger Validierung verfügt und heute pro Token gemietet werden kann. Es ist das besser belegte und breiter leistungsfähige Modell, und das Preview-Abzeichen ist eher ein Zuverlässigkeitsvorbehalt als ein Fähigkeitsvorbehalt.

Wählen Sie Intern-S2, wenn Ihre multimodale Eingabe wissenschaftlich ist und Ihre Daten Ihre Infrastruktur nicht verlassen dürfen. Es ist das einzige der beiden, das rohe Literaturseiten nativ liest, aus Zeitreihensignalen Prognosen erstellt und unter einer permissiven Lizenz auf proprietären experimentellen Daten feinabgestimmt werden kann. Akzeptieren Sie, dass Sie die erste Person sind, die es ausführt, und dass die Benchmark-Tabelle, die dafür argumentiert, von den Personen geschrieben wurde, die es entwickelt haben.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

Keines der beiden Modelle geht hier eindeutig als Sieger hervor, und die Tabelle belegt das besser, als es ein Urteil könnte. Das eine ist ein Generalist, der zufällig gut in der Wissenschaft ist; das andere ist ein wissenschaftliches Instrument, das zufällig bei allgemeiner multimodaler Arbeit konkurrenzfähig ist – und bei einem noch am selben Tag veröffentlichten Open-Release ist „konkurrenzfähig“ das überraschendere Ergebnis.

Um beide Hälften dieses Vergleichs ohne einen zweiten Vertrag abzudecken: Ein API-Schlüssel, der über 200 Modelle abdeckt bringt das geschlossene multimodale Flaggschiff und jede Alternative hinter einen einzigen Endpunkt, sodass Sie Bild- und Videoarbeit über den einen Weg und Dokumenten-Batches über den anderen routen können.