
Intern-S2 vs Gemini 3.1 Pro: de multimodale vergelijking die InternLM daadwerkelijk heeft gemeten
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
De meeste vergelijkingen in deze reeks vereisen dat je de claims van twee leveranciers aan elkaar naait. Deze niet. Intern-S2, het Apache-2.0-multimodale model met 397 miljard parameters dat InternLM vandaag heeft uitgebracht, en Gemini 3.1 Pro, het vlaggenschip-redeneermodel van Google, staan beide als gemeten kolommen in dezelfde benchmarktabel — wat dit de eerlijkste rechtstreekse vergelijking in de set maakt en, niet toevallig, degene waarbij het open model het meest te verantwoorden heeft. Gemini 3.1 Pro leest tekst, afbeeldingen, audio en video, heeft een context van 1 miljoen tokens, en is sinds het op 19 februari 2026 in preview ging door onafhankelijke labs en productieverkeer uit elkaar getrokken. Intern-S2 leest tekst, afbeeldingen en tijdreeksen, is vanmorgen naar Hugging Face geüpload en heeft geen enkele score van derden. Op de rijen waar beide zijn gemeten, wint het model van Google vaker wel dan niet.
Beide lezen afbeeldingen. Daar houdt de gelijkenis op.
Het woord "multimodaal" laat deze modellen als gelijken klinken. Ze zijn geen gelijken, en het verschil zit erin waarnaar elk van hen gebouwd is om te kijken.
Het visuele pad van Intern-S2 is getraind om ruwe pagina's uit wetenschappelijke literatuur — figuren, vergelijkingen, structuurdiagrammen, lay-out — als één gedeelde representatie te verwerken, in plaats van eerst tekst eruit te parsen. De multimodale benchmarks zijn wetenschappelijk: biologische microscopie-VQA, remote sensing, het beantwoorden van vragen over wetenschappelijke grafieken. Het accepteert ook tijdreeksgegevens en kan voorspellingen produceren, een invoertype dat vrijwel geen enkel algemeen vlaggenschipmodel überhaupt aankan.
De multimodaliteit van Gemini 3.1 Pro is voor algemene doeleinden en breder van aard: tekst, beeld, audio en video, in één model, gericht op het volledige scala aan productietaken waarbij je een model op een bestand richt en een vraag stelt. Een vergaderopname, een UI-screenshot, een grafiek in een PDF, een videoclip — allemaal toegestaan, allemaal met zes maanden publieke evaluatie achter de rug.
Als je invoer een wetenschappelijke figuur is, is Intern-S2 daar speciaal voor gebouwd en beschikt het over de cijfers van de leverancier om zijn zaak te bepleiten. Is je invoer iets anders, dan ondersteunt Gemini 3.1 Pro audio en video, en Intern-S2 ondersteunt geen van beide. Dat lost een groot deel van de vragen "welke moet ik gebruiken" op voordat prijs of benchmarks in beeld komen, en wie je vertelt dat de twee uitwisselbaar zijn, heeft de invoerlijst niet gelezen.
Wat de gedeelde tafel toont, eerlijk gelezen
Omdat InternLM beide heeft gebenchmarkt, is dit een van de weinige plekken waar een directe vergelijking legitiem is in plaats van samengesteld. De kanttekening is onveranderd en het is de moeite waard die één keer te vermelden: elk cijfer voor Intern-S2 is door de leverancier gerapporteerd, uitgevoerd door InternLM op zijn eigen harness via OpenCompass, VLMEvalKit en AgentCompass, zonder onafhankelijke reproductie. De cijfers van Gemini in die tabel komen ook uit de uitvoering van de vergelijking door InternLM, hoewel Gemini daarbuiten een uitgebreide onafhankelijke staat van dienst heeft.
• Multimodale kennis — Gemini 3.1 Pro 83,99 op MMMU Pro vs Intern-S2 81,68.
• QA van wetenschappelijke grafieken — Gemini 3.1 Pro 71,18 op ChartQAPro versus Intern-S2 71,12. Een nek-aan-nekrace tot op twee decimalen.
• Teledetectie — Gemini 3.1 Pro 54,27 op XLRS-Bench vs. Intern-S2 51,38.
• Microscopie-VQA — Gemini 3.1 Pro 71,02 op MicroVQA vs. Intern-S2 69,67.
• Wetenschappelijke multimodale taken — Intern-S2 60,74 op SFE vs Gemini 3.1 Pro 59,57. Intern-S2's enige multimodale overwinning.
• Algemene kennis — Gemini 3.1 Pro 91,00 op MMLU Pro vs. Intern-S2 89,77.
• Wiskunde op de middelbare school — Gemini 3.1 Pro 94.70 op HMMT-2026 vs. Intern-S2 93.56.
• Redeneren over wetenschappelijke literatuur — Intern-S2 55,71 op Biology-Instructions vs Gemini 3.1 Pro 13,87, en 53,95 vs 38,84 op Mol-Instructions.
• Wetenschapsolympiadevraagstukken — Intern-S2 87,00 op FrontierScience-Olympiad vs. Gemini 3.1 Pro 79,00.
• Terminalbeheersing — Gemini 3.1 Pro 73,80 op TerminalBench 2.1 versus Intern-S2 64,04.
De eerlijke lezing: Gemini 3.1 Pro wint de brede multimodale rijen met kleine marges, Intern-S2 wint de diepe rijen voor wetenschappelijke literatuur met enorme marges, en geen van beide resultaten is verrassend gezien waarop elk is getraind. De geringheid van de multimodale verliezen is misschien wel de interessantere bevinding — een op dezelfde dag uitgebracht open checkpoint dat binnen twee punten van een zes maanden oud gesloten vlaggenschipmodel uitkomt op MMMU Pro en ChartQAPro is een sterker resultaat voor InternLM dan welk van zijn overweldigende wetenschapscijfers dan ook.
Context, uitvoer en de previewvraag
Het verhaal over lange input valt netjes uiteen. Gemini 3.1 Pro heeft een contextvenster van 1M tokens met een uitvoerplafond van 64K — genoeg voor een lange documentenset en een omvangrijk antwoord. Intern-S2 wordt geëvalueerd tot 256K tokens voor tekstredenering en 64K voor multimodale taken, en maakt geen uitvoerplafond bekend; beschouw het bruikbare venster als kleiner dan dat van Gemini totdat iemand het onafhankelijk meet.
Er is één operationele kanttekening aan de Google-kant die in elke eerlijke vergelijking thuishoort. Gemini 3.1 Pro is nog steeds een previewmodel, geen GA-release. Voor previewmodellen gelden lagere betrouwbaarheidsverwachtingen, en een paneel met foutpercentages over 7 dagen op een modelpagina is een blijvende herinnering om instabiliteit te omzeilen in plaats van er een kritiek pad bovenop te bouwen. Intern-S2 is een volledige Apache-2.0-release met gewichten die je kunt vastpinnen — wat, tegenintuïtief, het gloednieuwe open model het operationeel stabielere van de twee maakt in de zin die het meest telt: niemand kan het onder je vandaan veranderen.
• Context — Intern-S2 256K tekst / 64K multimodaal geëvalueerd vs Gemini 3.1 Pro 1M tokens.
• Invoer — Intern-S2 tekst, afbeelding, tijdreeks vs Gemini 3.1 Pro tekst, afbeelding, audio, video.
• Gewichten — Intern-S2 Apache-2.0, downloadbaar vs. Gemini 3.1 Pro gesloten.
• Volwassenheid — Intern-S2 is pas enkele uren oud, geen onafhankelijke score ten opzichte van Gemini 3.1 Pro preview sinds februari 2026, uitgebreid en onafhankelijk getest.
• Prijs — Intern-S2 heeft geen openbare tariefkaart; zelf hosten of de officiële Intern API versus Gemini 3.1 Pro $2,00 input / $12,00 output per miljoen, oplopend tot $4,00/$18,00 boven 200K inputtokens.

Prijs en waar elk zich bevindt
Gemini 3.1 Pro rekent $2,00 per miljoen inputtokens en $12,00 per miljoen outputtokens op de standaardlaag, en gaat naar $4,00/$18,00 zodra een aanvraag de 200K inputtokens overschrijdt — een long-context-toeslag die precies toeslaat wanneer je het venster van 1M gebruikt dat de keuze ervoor rechtvaardigt. Het is routeerbaar op OrcaRouter tegen diezelfde lijstprijs, doorgegeven met 0% markup, op een sleutel die ook 200-plus andere modellen draagt; de pass-through is hier van belang omdat een prijswijziging van Google dezelfde dag bij ons doorwerkt in plaats van na een herprijzingscyclus. De routing-DSL is het nuttige onderdeel voor deze specifieke combinatie: je kunt beeld- en videowerk naar Gemini 3.1 Pro sturen en batches wetenschappelijke documenten naar een zelfgehoste Intern-S2, en beide achter één endpoint houden zonder een tweede contract of codewijziging.
Intern-S2 heeft geen gepubliceerde API-prijs. Het zelf hosten van de Apache-2.0-gewichten is de route die de meeste teams daadwerkelijk zullen nemen, en met 403B parameters is het een serieuze hardware-investering. De officiële Intern API bestaat voor teams die liever geen GPU's willen draaien, maar zonder een openbare tariefkaart kun je de kostenvergelijking met Gemini's $2/$12 niet op papier maken — je moet om quota vragen en zelf de rekensom maken.

De oproep
Kies Gemini 3.1 Pro als je een algemeen multimodaal model nodig hebt dat audio en video aankan, een miljoen tokens ondersteunt, maanden van onafhankelijke validatie achter de rug heeft en vandaag al per token gehuurd kan worden. Het is het model met de betere onderbouwing en de bredere capaciteiten, en de preview-badge is een kanttekening bij de betrouwbaarheid, niet bij de capaciteiten.
Kies Intern-S2 als je multimodale input wetenschappelijk is en je data je infrastructuur niet kunnen verlaten. Het is de enige van de twee die ruwe literatuurpagina's native leest, voorspellingen doet op basis van tijdreekssignalen, en kan worden fijnafgestemd op propriëtaire experimentele data onder een permissieve licentie. Accepteer dat je de eerste persoon bent die het draait, en dat de benchmarktabel die ervoor pleit, is geschreven door de mensen die het hebben gemaakt.

Geen van beide modellen wint dit overtuigend, en de tabel bewijst dat beter dan een oordeel zou kunnen. Het ene is een generalist die toevallig goed is in wetenschap; het andere is een wetenschappelijk instrument dat toevallig competitief is op algemeen multimodaal werk — en bij een open release op dezelfde dag is "competitief" het verrassendere resultaat.
Om beide helften van deze vergelijking zonder een tweede contract te kunnen vasthouden: één API-sleutel die meer dan 200 modellen dekt plaatst het gesloten multimodale vlaggenschip en elk alternatief achter één endpoint, zodat je beeld- en videowerk de ene kant op kunt routeren en documentbatches de andere kant op.
