
Intern-S2 vs Gemini 3.1 Pro: il confronto multimodale che InternLM ha effettivamente misurato
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
La maggior parte dei confronti in questa serie richiede di mettere insieme le dichiarazioni di due fornitori. Questo no. Intern-S2, il modello multimodale Apache-2.0 da 397 miliardi di parametri rilasciato oggi da InternLM, e Gemini 3.1 Pro, il modello di ragionamento di punta di Google, compaiono entrambi come colonne misurate nella stessa tabella di benchmark — il che rende questo il confronto testa a testa più equo del set e, non a caso, quello in cui il modello aperto ha più da giustificare. Gemini 3.1 Pro legge testo, immagini, audio e video, gestisce un contesto di 1M token ed è stato analizzato a fondo da laboratori indipendenti e dal traffico di produzione da quando è entrato in anteprima il 19 febbraio 2026. Intern-S2 legge testo, immagini e serie temporali, è stato caricato su Hugging Face questa mattina e non ha alcun punteggio di terze parti di alcun tipo. Nelle righe in cui entrambi sono stati misurati, il modello di Google ne vince più di quante ne perda.
Entrambi leggono le immagini. È qui che finisce la somiglianza.
La parola "multimodale" fa sembrare questi modelli alla pari. Non lo sono, e la differenza sta in ciò che ciascuno è stato costruito per osservare.
Il percorso di visione di Intern-S2 è stato addestrato a consumare pagine grezze di letteratura scientifica — figure, equazioni, diagrammi strutturali, impaginazione — come un'unica rappresentazione condivisa, invece di estrarre prima il testo. I suoi benchmark multimodali sono scientifici: VQA di microscopia biologica, telerilevamento, risposta a domande su grafici scientifici. Accetta anche dati di serie temporali e può produrre previsioni, un tipo di input che quasi nessun modello di punta generalista gestisce affatto.
La multimodalità di Gemini 3.1 Pro è di uso generale e più ampia per tipo: testo, immagini, audio e video, in un unico modello, pensata per l'intera gamma di attività di produzione in cui si indica un file a un modello e si pone una domanda. Una registrazione di una riunione, uno screenshot dell'interfaccia utente, un grafico in un PDF, una clip video — tutto è valido, tutti con sei mesi di valutazione pubblica alle spalle.
Se il tuo input è una figura scientifica, Intern-S2 è stato progettato appositamente per questo e ha i numeri del fornitore per sostenerne le ragioni. Se il tuo input è qualsiasi altra cosa, Gemini 3.1 Pro accetta audio e video, mentre Intern-S2 non accetta né gli uni né gli altri. Questo risolve gran parte delle domande su «quale dovrei usare» prima che prezzo o benchmark entrino in gioco, e chiunque ti dica che i due sono intercambiabili non ha letto l’elenco degli input.
Ciò che mostra la tavola condivisa, letto onestamente
Poiché InternLM ha sottoposto entrambi a benchmark, questo è uno dei pochi casi in cui un confronto diretto è legittimo anziché assemblato. L'avvertenza è invariata e vale la pena affermarla una volta: ogni cifra di Intern-S2 è riportata dal fornitore, eseguita da InternLM sul proprio harness tramite OpenCompass, VLMEvalKit e AgentCompass, senza alcuna riproduzione indipendente. Le cifre di Gemini in quella tabella provengono anch'esse dall'esecuzione del confronto da parte di InternLM, sebbene Gemini abbia un ampio track record indipendente al di fuori di essa.
• Conoscenza multimodale — Gemini 3.1 Pro 83.99 su MMMU Pro vs Intern-S2 81.68.
• QA su grafici scientifici — Gemini 3.1 Pro 71,18 su ChartQAPro contro Intern-S2 71,12. Un testa a testa fino alla seconda cifra decimale.
• Telerilevamento — Gemini 3.1 Pro 54,27 su XLRS-Bench vs Intern-S2 51,38.
• VQA di microscopia — Gemini 3.1 Pro 71,02 su MicroVQA vs Intern-S2 69,67.
• Compiti scientifici multimodali — Intern-S2 60,74 su SFE vs Gemini 3.1 Pro 59,57. L'unica vittoria multimodale di Intern-S2.
• Conoscenze generali — Gemini 3.1 Pro 91.00 su MMLU Pro vs Intern-S2 89.77.
• Matematica delle scuole superiori — Gemini 3.1 Pro 94,70 su HMMT-2026 contro Intern-S2 93,56.
• Ragionamento sulla letteratura scientifica — Intern-S2 55,71 su Biology-Instructions vs Gemini 3.1 Pro 13,87, e 53,95 vs 38,84 su Mol-Instructions.
• Problemi delle Olimpiadi della scienza — Intern-S2 87,00 su FrontierScience-Olympiad vs Gemini 3.1 Pro 79,00.
• Padronanza del terminale — Gemini 3.1 Pro 73,80 su TerminalBench 2.1 contro Intern-S2 64,04.
La lettura onesta: Gemini 3.1 Pro vince le ampie righe multimodali con margini ristretti, Intern-S2 vince le righe della letteratura scientifica approfondita con margini enormi, e nessuno dei due risultati è sorprendente considerando ciò su cui ciascuno è stato addestrato. La ristrettezza dei margini di sconfitta nel multimodale è probabilmente il risultato più interessante — un checkpoint open rilasciato nello stesso giorno che si colloca entro due punti da un flagship closed di sei mesi su MMMU Pro e ChartQAPro è un risultato più forte per InternLM di qualsiasi suo clamoroso numero scientifico.
Contesto, output e la domanda di anteprima
La questione degli input lunghi si divide nettamente. Gemini 3.1 Pro dispone di una finestra di contesto di 1M token con un tetto di output di 64K — abbastanza per un lungo insieme di documenti e una risposta sostanziosa. Intern-S2 è valutato fino a 256K token per il ragionamento testuale e 64K per il multimodale, e non pubblica un tetto di output; considera la sua finestra utilizzabile più piccola di quella di Gemini finché qualcuno non la misura in modo indipendente.
C'è un avvertimento operativo dal lato Google che va incluso in qualsiasi confronto onesto. Gemini 3.1 Pro è ancora un modello in anteprima, non una release GA. I modelli in anteprima comportano aspettative di affidabilità inferiori, e un pannello del tasso di errore a 7 giorni su una pagina di modello è un promemoria costante ad aggirare l'instabilità invece di costruirci sopra un percorso critico. Intern-S2 è una release completa sotto Apache-2.0, con pesi che puoi fissare — il che, controintuitivamente, rende il nuovissimo modello aperto il più stabile operativamente dei due nel senso che conta di più: nessuno può cambiartelo sotto i piedi.
• Contesto — Intern-S2 256K testo / 64K multimodale valutato rispetto a Gemini 3.1 Pro 1M token.
• Input — Intern-S2 testo, immagini, serie temporali vs Gemini 3.1 Pro testo, immagini, audio, video.
• Pesi — Intern-S2 Apache-2.0, scaricabili vs Gemini 3.1 Pro chiuso.
• Maturità — Intern-S2 ha poche ore di vita, nessun punteggio indipendente rispetto a Gemini 3.1 Pro preview da febbraio 2026, ampiamente e indipendentemente testato.
• Prezzo — Intern-S2 nessun listino prezzi pubblico; self-hosting o API Intern ufficiale vs Gemini 3.1 Pro $2,00 input / $12,00 output per milione, che sale a $4,00/$18,00 oltre 200K token di input.

Prezzo e dove vive ciascuno
Gemini 3.1 Pro fattura 2,00 $ per milione di token di input e 12,00 $ per milione di token di output sul tier standard, passando a 4,00/18,00 $ quando una richiesta supera i 200K token di input — un sovrapprezzo per il contesto lungo che si fa sentire esattamente quando usi la finestra da 1M che ne giustifica la scelta. È instradabile su OrcaRouter a quello stesso prezzo di listino, passato attraverso con 0% di markup, su una chiave che porta anche oltre 200 altri modelli; il pass-through qui conta perché una variazione di prezzo di Google arriva dalla nostra parte lo stesso giorno, anziché dopo un ciclo di riprezzamento. Il DSL di routing è la parte utile per questo specifico abbinamento: puoi inviare il lavoro su immagini e video a Gemini 3.1 Pro e i lotti di documenti scientifici a un Intern-S2 self-hosted, e tenere entrambi dietro un unico endpoint senza un secondo contratto o una modifica al codice.
Intern-S2 non ha un prezzo API pubblicato. L'auto-hosting dei pesi Apache-2.0 è la strada che la maggior parte dei team seguirà davvero e, con 403 miliardi di parametri, rappresenta un impegno hardware concreto. L'API ufficiale di Intern esiste per i team che preferiscono non gestire GPU, ma senza un listino pubblico il confronto dei costi con i $2/$12 di Gemini non è qualcosa che si possa fare sulla carta: bisogna chiedere una quota e fare i conti da soli.

La chiamata
Scegli Gemini 3.1 Pro se ti serve un modello multimodale generico che accetta audio e video, supporta un milione di token, ha mesi di validazione indipendente e può essere noleggiato a token già oggi. È il modello con più prove a supporto e più ampiamente capace, e il badge di anteprima è un avvertimento sull'affidabilità, non sulle capacità.
Scegli Intern-S2 se il tuo input multimodale è scientifico e i tuoi dati non possono lasciare la tua infrastruttura. È l'unico dei due che legge nativamente le pagine grezze della letteratura, fa previsioni da segnali di serie temporali e può essere messo a punto su dati sperimentali proprietari sotto una licenza permissiva. Accetta di essere la prima persona a eseguirlo e che la tabella di benchmark che lo sostiene è stata scritta dalle persone che l'hanno creato.

Nessuno dei due modelli vince nettamente, e la tabella lo dimostra meglio di quanto potrebbe fare un verdetto. Uno è un generalista che si dà il caso sia bravo in ambito scientifico; l’altro è uno strumento scientifico che si dà il caso sia competitivo sul lavoro multimodale generale — e in un rilascio aperto nello stesso giorno, «competitivo» è il risultato più sorprendente.
Per tenere insieme entrambe le metà di questo confronto senza un secondo contratto: una sola chiave API che copre oltre 200 modelli mette il flagship multimodale proprietario e ogni alternativa dietro un unico endpoint, così puoi instradare il lavoro su immagini e video da una parte e i lotti di documenti dall'altra.
