Ett genererat hjältekort som jämför Intern-S2 och Gemini 3.1 Pro, med en vetenskaplig figursida och ett diagram som matar en multimodal modell till vänster, och fyra inmatningsikoner för bild, ljud, video och text runt ett stängt API-kort till höger, märkt med kontrasten mellan Apache-2.0-vetenskaplig multimodalitet och ett stängt allmänt multimodalt flaggskepp med 1M-kontext, med OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Intern-S2 vs Gemini 3.1 Pro: Den multimodala duellen som InternLM faktiskt mätte

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

De flesta av jämförelserna i den här serien kräver att man syr ihop två leverantörers påståenden. Den här gör det inte. Intern-S2, den 397 miljarder parametrar stora Apache-2.0-multimodala modellen som InternLM släppte idag, och Gemini 3.1 Pro, Goog​les flaggskeppsresonemangsmodell, förekommer båda som uppmätta kolumner i samma benchmarktabell – vilket gör detta till den mest rättvisa duellen i uppsättningen och, inte helt oväntat, den där den öppna modellen har mest att svara för. Gemini 3.1 Pro läser text, bilder, ljud och video, har ett 1M-token-kontextfönster och har slitits isär av oberoende labb och produktionstrafik sedan den gick in i förhandsversion den 19 februari 2026. Intern-S2 läser text, bilder och tidsserier, laddades upp till Hugging Face i morse och har inget tredjepartspoäng av något slag. På de rader där båda mättes vinner Goog​les modell fler av dem än den förlorar.

Båda läser bilder. Det är där likheten slutar.

Ordet "multimodal" får dessa modeller att låta som jämbördiga. De är inte jämbördiga, och skillnaden ligger i vad var och en byggdes för att titta på.

Intern-S2:s visionsbana tränades för att ta in råa sidor av vetenskaplig litteratur – figurer, ekvationer, strukturdiagram, layout – som en enda delad representation i stället för att först extrahera text. Dess multimodala riktmärken är vetenskapliga: VQA för biologisk mikroskopi, fjärranalys, frågebesvarande om vetenskapliga diagram. Den tar även emot tidsseriedata och kan producera prognoser, vilket är en indatatyp som nästan ingen allmän flaggskeppsmodell hanterar överhuvudtaget.

Gemini 3.1 Pros multimodalitet är generell och bredare till sin karaktär: text, bild, ljud och video i en och samma modell, inriktad på hela spannet av produktionsuppgifter där man riktar en modell mot en fil och ställer en fråga. En mötesinspelning, en skärmbild av ett användargränssnitt, ett diagram i en PDF, ett videoklipp – allt är möjligt, allt med sex månaders offentlig utvärdering bakom sig.

Om din indata är en vetenskaplig figur är Intern-S2 specialbyggd för det och har leverantörens siffror för att argumentera för sin sak. Om din indata är något annat tar Gemini 3.1 Pro emot ljud och video, och Intern-S2 tar inte emot något av dem. Det avgör en stor del av frågorna om ”vilken ska jag använda” innan pris eller benchmarkresultat kommer in i bilden, och den som säger att de två är utbytbara har inte läst indatalistan.

Vad den gemensamma tabellen visar, ärligt läst

Eftersom InternLM har benchmarkat båda är detta ett av de få ställen där en direkt jämförelse är berättigad snarare än sammanställd. Förbehållet är oförändrat och värt att säga en gång: varje mätvärde för Intern-S2 är rapporterat av leverantören och framtaget av InternLM i deras egen testmiljö via OpenCompass, VLMEvalKit och AgentCompass, utan någon oberoende reproduktion. Gemin​is mätvärden i den tabellen kommer också från InternLMs körning av jämförelsen, även om Gemin​i har en omfattande oberoende historik utanför den jämförelsen.

• Multimodal kunskap — Gemini 3.1 Pro 83,99 på MMMU Pro mot Intern-S2 81,68.

• QA för vetenskapliga diagram — Gemini 3.1 Pro 71,18 på ChartQAPro mot Intern-S2 71,12. Dött lopp på två decimaler.

• Fjärranalys — Gemini 3.1 Pro 54,27 på XLRS-Bench mot Intern-S2 51,38.

• Mikroskopi-VQA — Gemini 3.1 Pro 71,02 på MicroVQA mot Intern-S2 69,67.

• Vetenskapliga multimodala uppgifter — Intern-S2 60,74 på SFE mot Gemini 3.1 Pro 59,57. Intern-S2:s enda multimodala vinst.

• Allmän kunskap — Gemini 3.1 Pro 91,00 på MMLU Pro mot Intern-S2 89,77.

• Matematik på gymnasienivå — Gemini 3.1 Pro 94,70 på HMMT-2026 mot Intern-S2 93,56.

• Resonemang kring vetenskaplig litteratur — Intern-S2 55,71 på Biology-Instructions jämfört med Gemini 3.1 Pro 13,87, och 53,95 mot 38,84 på Mol-Instructions.

• Naturvetenskapsolympiadproblem — Intern-S2 87,00 i FrontierScience-Olympiad mot Gemini 3.1 Pro 79,00.

• Terminalbemästring — Gemini 3.1 Pro 73,80 på TerminalBench 2.1 mot Intern-S2 64,04.

Den ärliga tolkningen: Gemini 3.1 Pro vinner de breda multimodala raderna med knappa marginaler, Intern-S2 vinner de djupa raderna för vetenskaplig litteratur med enorma marginaler, och inget av resultaten är förvånande med tanke på vad respektive modell tränades på. Att de multimodala förlusterna är så knappa är möjligen det mer intressanta fyndet – att en öppen checkpoint släppt samma dag hamnar inom två poäng från en sex månader gammal sluten flaggskeppsmodell på MMMU Pro och ChartQAPro är ett starkare resultat för InternLM än någon av dess förkrossande vetenskapssiffror.

Kontext, utdata och förhandsgranskningsfrågan

Historien om långa indata delar sig tydligt. Gemini 3.1 Pro har ett kontextfönster på 1M tokens med ett tak för utdata på 64K – tillräckligt för en lång dokumentuppsättning och ett omfattande svar. Intern-S2 utvärderas vid upp till 256K tokens för textresonemang och 64K för multimodalt, och publicerar inget tak för utdata; betrakta dess användbara fönster som mindre än Geminis tills någon mäter det oberoende.

Det finns en operativ varning på Googles sida som hör hemma i varje ärlig jämförelse. Gemini 3.1 Pro är fortfarande en förhandsvisningsmodell, inte en GA-version. Förhandsvisningsmodeller har lägre förväntningar på tillförlitlighet, och en panel för felkvot över 7 dagar på en modellsida är en ständig påminnelse om att dirigera runt instabilitet snarare än att bygga en kritisk väg ovanpå den. Intern-S2 är en fullständig Apache-2.0-utgåva med vikter du kan låsa — vilket, kontraintuitivt nog, gör den splitternya öppna modellen till den operativt mer stabila av de två i den bemärkelse som betyder mest: ingen kan ändra den under dig.

• Kontext — Intern-S2 256K text / 64K multimodal utvärderad mot Gemini 3.1 Pro 1M tokens.

• Indata – Intern-S2: text, bild, tidsserier vs Gemini 3.1 Pro: text, bild, ljud, video.

• Vikter — Intern-S2 Apache-2.0, nedladdningsbara mot Gemini 3.1 Pro som är sluten.

• Mognad — Intern-S2 är bara timmar gammal, ingen oberoende poäng mot Gemini 3.1 Pro preview sedan februari 2026, hårt och oberoende testad.

• Pris — Intern-S2 har ingen offentlig prislista; egen hosting eller officiellt Intern API jämfört med Gemini 3.1 Pro 2,00 USD indata / 12,00 USD utdata per miljon, som stiger till 4,00/18,00 USD över 200K indatatokens.

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

Pris och var var och en bor

Gemini 3.1 Pro kostar $2,00 per miljon input-tokens och $12,00 per miljon output-tokens på standardnivån, och stiger till $4,00/$18,00 när en förfrågan passerar 200 000 input-tokens – en premie för lång kontext som biter precis när du använder det 1M-fönster som gör att valet är motiverat. Den kan routas på OrcaRouter till samma listpris, vidarebefordrat med 0 % påslag, på en nyckel som även omfattar 200-plus andra modeller; att priset förs vidare spelar roll här eftersom en prisförändring från Goog​le landar hos oss samma dag i stället för efter en omprissättningscykel. Routing-DSL:en är den användbara delen för just den här matchningen: du kan skicka bild- och videouppgifter till Gemini 3.1 Pro och satser med vetenskapliga dokument till en självhostad Intern-S2, och hålla båda bakom en och samma endpoint utan ett andra avtal eller någon kodändring.

Intern-S2 har inget publicerat API-pris. Att självhosta Apache-2.0-vikterna är den väg de flesta team faktiskt kommer att ta, och med 403B parametrar är det ett rejält hårdvaruåtagande. Det officiella Intern-API:et finns för team som hellre inte kör GPU:er, men utan ett offentligt prisblad är kostnadsjämförelsen med Gemin​is $2/$12 inte något man kan göra på papper — man måste begära kvot och räkna själv.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

Samtalet

Välj Gemini 3.1 Pro om du behöver en generell multimodell som hanterar ljud och video, rymmer en miljon tokens, har månader av oberoende validering och kan hyras per token i dag. Den är den bättre underbyggda och mer brett kapabla modellen, och förhandsgranskningsmärket är ett förbehåll om tillförlitlighet snarare än om kapacitet.

Välj Intern-S2 om din multimodala indata är vetenskaplig och dina data inte får lämna din infrastruktur. Det är den enda av de två som läser råa litteratursidor inbyggt, gör prognoser från tidsseriesignaler och kan finjusteras på proprietära experimentdata under en tillåtande licens. Acceptera att du är den första personen som kör den, och att benchmarktabellen som talar för den skrevs av dem som skapade den.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

Ingen av modellerna vinner detta rakt av, och tabellen bevisar det bättre än en dom skulle kunna. Den ena är en generalist som råkar vara bra på vetenskap; den andra är ett vetenskapligt instrument som råkar vara konkurrenskraftigt inom allmänt multimodalt arbete – och vid en öppen lansering samma dag är "konkurrenskraftig" det mer överraskande resultatet.

För att rymma båda halvorna av den här jämförelsen utan ett andra avtal: en API-nyckel som täcker över 200 modeller placerar den slutna multimodala flaggskeppsmodellen och alla alternativ bakom en och samma slutpunkt, så att du kan dirigera bild- och videoarbete åt ena hållet och dokumentbatchar åt det andra.