Una hero card generata che confronta Intern-S2 e Gemini 3.1 Pro, mostrando, sulla sinistra, una pagina con una figura scientifica e un grafico che alimentano un modello multimodale, e, sulla destra, quattro icone di input per immagine, audio, video e testo attorno a una scheda API chiusa, etichettata con il contrasto tra multimodalità scientifica Apache-2.0 e un flagship multimodale generale chiuso con contesto da 1M, con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Intern-S2 vs Gemini 3.1 Pro: il confronto multimodale che InternLM ha effettivamente misurato

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La maggior parte dei confronti in questa serie richiede di mettere insieme le dichiarazioni di due fornitori. Questo no. Intern-S2, il modello multimodale Apache-2.0 da 397 miliardi di parametri rilasciato oggi da InternLM, e Gemini 3.1 Pro, il modello di ragionamento di punta di Goog​le, compaiono entrambi come colonne misurate nella stessa tabella di benchmark — il che rende questo il confronto testa a testa più equo del set e, non a caso, quello in cui il modello aperto ha più da giustificare. Gemini 3.1 Pro legge testo, immagini, audio e video, gestisce un contesto di 1M token ed è stato analizzato a fondo da laboratori indipendenti e dal traffico di produzione da quando è entrato in anteprima il 19 febbraio 2026. Intern-S2 legge testo, immagini e serie temporali, è stato caricato su Hugging Face questa mattina e non ha alcun punteggio di terze parti di alcun tipo. Nelle righe in cui entrambi sono stati misurati, il modello di Goog​le ne vince più di quante ne perda.

Entrambi leggono le immagini. È qui che finisce la somiglianza.

La parola "multimodale" fa sembrare questi modelli alla pari. Non lo sono, e la differenza sta in ciò che ciascuno è stato costruito per osservare.

Il percorso di visione di Intern-S2 è stato addestrato a consumare pagine grezze di letteratura scientifica — figure, equazioni, diagrammi strutturali, impaginazione — come un'unica rappresentazione condivisa, invece di estrarre prima il testo. I suoi benchmark multimodali sono scientifici: VQA di microscopia biologica, telerilevamento, risposta a domande su grafici scientifici. Accetta anche dati di serie temporali e può produrre previsioni, un tipo di input che quasi nessun modello di punta generalista gestisce affatto.

La multimodalità di Gemini 3.1 Pro è di uso generale e più ampia per tipo: testo, immagini, audio e video, in un unico modello, pensata per l'intera gamma di attività di produzione in cui si indica un file a un modello e si pone una domanda. Una registrazione di una riunione, uno screenshot dell'interfaccia utente, un grafico in un PDF, una clip video — tutto è valido, tutti con sei mesi di valutazione pubblica alle spalle.

Se il tuo input è una figura scientifica, Intern-S2 è stato progettato appositamente per questo e ha i numeri del fornitore per sostenerne le ragioni. Se il tuo input è qualsiasi altra cosa, Gemini 3.1 Pro accetta audio e video, mentre Intern-S2 non accetta né gli uni né gli altri. Questo risolve gran parte delle domande su «quale dovrei usare» prima che prezzo o benchmark entrino in gioco, e chiunque ti dica che i due sono intercambiabili non ha letto l’elenco degli input.

Ciò che mostra la tavola condivisa, letto onestamente

Poiché InternLM ha sottoposto entrambi a benchmark, questo è uno dei pochi casi in cui un confronto diretto è legittimo anziché assemblato. L'avvertenza è invariata e vale la pena affermarla una volta: ogni cifra di Intern-S2 è riportata dal fornitore, eseguita da InternLM sul proprio harness tramite OpenCompass, VLMEvalKit e AgentCompass, senza alcuna riproduzione indipendente. Le cifre di Gemini in quella tabella provengono anch'esse dall'esecuzione del confronto da parte di InternLM, sebbene Gemini abbia un ampio track record indipendente al di fuori di essa.

• Conoscenza multimodale — Gemini 3.1 Pro 83.99 su MMMU Pro vs Intern-S2 81.68.

• QA su grafici scientifici — Gemini 3.1 Pro 71,18 su ChartQAPro contro Intern-S2 71,12. Un testa a testa fino alla seconda cifra decimale.

• Telerilevamento — Gemini 3.1 Pro 54,27 su XLRS-Bench vs Intern-S2 51,38.

• VQA di microscopia — Gemini 3.1 Pro 71,02 su MicroVQA vs Intern-S2 69,67.

• Compiti scientifici multimodali — Intern-S2 60,74 su SFE vs Gemini 3.1 Pro 59,57. L'unica vittoria multimodale di Intern-S2.

• Conoscenze generali — Gemini 3.1 Pro 91.00 su MMLU Pro vs Intern-S2 89.77.

• Matematica delle scuole superiori — Gemini 3.1 Pro 94,70 su HMMT-2026 contro Intern-S2 93,56.

• Ragionamento sulla letteratura scientifica — Intern-S2 55,71 su Biology-Instructions vs Gemini 3.1 Pro 13,87, e 53,95 vs 38,84 su Mol-Instructions.

• Problemi delle Olimpiadi della scienza — Intern-S2 87,00 su FrontierScience-Olympiad vs Gemini 3.1 Pro 79,00.

• Padronanza del terminale — Gemini 3.1 Pro 73,80 su TerminalBench 2.1 contro Intern-S2 64,04.

La lettura onesta: Gemini 3.1 Pro vince le ampie righe multimodali con margini ristretti, Intern-S2 vince le righe della letteratura scientifica approfondita con margini enormi, e nessuno dei due risultati è sorprendente considerando ciò su cui ciascuno è stato addestrato. La ristrettezza dei margini di sconfitta nel multimodale è probabilmente il risultato più interessante — un checkpoint open rilasciato nello stesso giorno che si colloca entro due punti da un flagship closed di sei mesi su MMMU Pro e ChartQAPro è un risultato più forte per InternLM di qualsiasi suo clamoroso numero scientifico.

Contesto, output e la domanda di anteprima

La questione degli input lunghi si divide nettamente. Gemini 3.1 Pro dispone di una finestra di contesto di 1M token con un tetto di output di 64K — abbastanza per un lungo insieme di documenti e una risposta sostanziosa. Intern-S2 è valutato fino a 256K token per il ragionamento testuale e 64K per il multimodale, e non pubblica un tetto di output; considera la sua finestra utilizzabile più piccola di quella di Gemini finché qualcuno non la misura in modo indipendente.

C'è un avvertimento operativo dal lato Google che va incluso in qualsiasi confronto onesto. Gemini 3.1 Pro è ancora un modello in anteprima, non una release GA. I modelli in anteprima comportano aspettative di affidabilità inferiori, e un pannello del tasso di errore a 7 giorni su una pagina di modello è un promemoria costante ad aggirare l'instabilità invece di costruirci sopra un percorso critico. Intern-S2 è una release completa sotto Apache-2.0, con pesi che puoi fissare — il che, controintuitivamente, rende il nuovissimo modello aperto il più stabile operativamente dei due nel senso che conta di più: nessuno può cambiartelo sotto i piedi.

• Contesto — Intern-S2 256K testo / 64K multimodale valutato rispetto a Gemini 3.1 Pro 1M token.

• Input — Intern-S2 testo, immagini, serie temporali vs Gemini 3.1 Pro testo, immagini, audio, video.

• Pesi — Intern-S2 Apache-2.0, scaricabili vs Gemini 3.1 Pro chiuso.

• Maturità — Intern-S2 ha poche ore di vita, nessun punteggio indipendente rispetto a Gemini 3.1 Pro preview da febbraio 2026, ampiamente e indipendentemente testato.

• Prezzo — Intern-S2 nessun listino prezzi pubblico; self-hosting o API Intern ufficiale vs Gemini 3.1 Pro $2,00 input / $12,00 output per milione, che sale a $4,00/$18,00 oltre 200K token di input.

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

Prezzo e dove vive ciascuno

Gemini 3.1 Pro fattura 2,00 $ per milione di token di input e 12,00 $ per milione di token di output sul tier standard, passando a 4,00/18,00 $ quando una richiesta supera i 200K token di input — un sovrapprezzo per il contesto lungo che si fa sentire esattamente quando usi la finestra da 1M che ne giustifica la scelta. È instradabile su OrcaRouter a quello stesso prezzo di listino, passato attraverso con 0% di markup, su una chiave che porta anche oltre 200 altri modelli; il pass-through qui conta perché una variazione di prezzo di Goog​le arriva dalla nostra parte lo stesso giorno, anziché dopo un ciclo di riprezzamento. Il DSL di routing è la parte utile per questo specifico abbinamento: puoi inviare il lavoro su immagini e video a Gemini 3.1 Pro e i lotti di documenti scientifici a un Intern-S2 self-hosted, e tenere entrambi dietro un unico endpoint senza un secondo contratto o una modifica al codice.

Intern-S2 non ha un prezzo API pubblicato. L'auto-hosting dei pesi Apache-2.0 è la strada che la maggior parte dei team seguirà davvero e, con 403 miliardi di parametri, rappresenta un impegno hardware concreto. L'API ufficiale di Intern esiste per i team che preferiscono non gestire GPU, ma senza un listino pubblico il confronto dei costi con i $2/$12 di Gemin​i non è qualcosa che si possa fare sulla carta: bisogna chiedere una quota e fare i conti da soli.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

La chiamata

Scegli Gemini 3.1 Pro se ti serve un modello multimodale generico che accetta audio e video, supporta un milione di token, ha mesi di validazione indipendente e può essere noleggiato a token già oggi. È il modello con più prove a supporto e più ampiamente capace, e il badge di anteprima è un avvertimento sull'affidabilità, non sulle capacità.

Scegli Intern-S2 se il tuo input multimodale è scientifico e i tuoi dati non possono lasciare la tua infrastruttura. È l'unico dei due che legge nativamente le pagine grezze della letteratura, fa previsioni da segnali di serie temporali e può essere messo a punto su dati sperimentali proprietari sotto una licenza permissiva. Accetta di essere la prima persona a eseguirlo e che la tabella di benchmark che lo sostiene è stata scritta dalle persone che l'hanno creato.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

Nessuno dei due modelli vince nettamente, e la tabella lo dimostra meglio di quanto potrebbe fare un verdetto. Uno è un generalista che si dà il caso sia bravo in ambito scientifico; l’altro è uno strumento scientifico che si dà il caso sia competitivo sul lavoro multimodale generale — e in un rilascio aperto nello stesso giorno, «competitivo» è il risultato più sorprendente.

Per tenere insieme entrambe le metà di questo confronto senza un secondo contratto: una sola chiave API che copre oltre 200 modelli mette il flagship multimodale proprietario e ogni alternativa dietro un unico endpoint, così puoi instradare il lavoro su immagini e video da una parte e i lotti di documenti dall'altra.