
Intern-S2 vs Gemini 3.1 Pro : le duel multimodal qu'InternLM a réellement mesuré
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
La plupart des confrontations de cette série nécessitent de recoller les affirmations de deux fournisseurs. Ce n'est pas le cas ici. Intern-S2, le modèle multimodal Apache-2.0 de 397 milliards de paramètres publié aujourd'hui par InternLM, et Gemini 3.1 Pro, le modèle de raisonnement phare de Google, apparaissent tous deux comme colonnes mesurées dans le même tableau de benchmark — ce qui en fait le face-à-face le plus équitable de la série et, pas par hasard, celui où le modèle ouvert a le plus de comptes à rendre. Gemini 3.1 Pro lit le texte, les images, l'audio et la vidéo, dispose d'un contexte de 1 M de tokens, et a été passé au crible par des laboratoires indépendants et le trafic de production depuis son entrée en preview le 19 février 2026. Intern-S2 lit le texte, les images et les séries temporelles, a été mis en ligne sur Hugging Face ce matin, et n'a aucun score tiers, quel qu'il soit. Sur les lignes où les deux ont été mesurés, le modèle de Google en remporte plus qu'il n'en perd.
Tous deux lisent des images. C’est là que la ressemblance s’arrête.
Le mot « multimodal » donne à ces modèles l'air d'être des pairs. Ils ne le sont pas, et la différence tient à ce que chacun a été conçu pour regarder.
La branche vision d'Intern-S2 a été entraînée à consommer des pages brutes de littérature scientifique — figures, équations, diagrammes structurels, mise en page — comme une représentation partagée unique plutôt que d'en extraire d'abord le texte. Ses benchmarks multimodaux sont scientifiques : VQA de microscopie biologique, télédétection, questions-réponses sur des graphiques scientifiques. Il accepte également des données de séries temporelles et peut produire des prévisions, un type d'entrée que presque aucun modèle phare généraliste ne gère du tout.
La multimodalité de Gemini 3.1 Pro est polyvalente et plus étendue par nature : texte, image, audio et vidéo, au sein d’un seul modèle, destinée à toute la gamme des tâches de production où l’on pointe un modèle vers un fichier et où l’on pose une question. Un enregistrement de réunion, une capture d’écran d’interface utilisateur, un graphique dans un PDF, un clip vidéo : tout est bon, tous avec six mois d’évaluation publique derrière eux.
Si votre entrée est une figure scientifique, Intern-S2 a été conçu spécialement pour cela et dispose des chiffres du fournisseur pour défendre sa cause. Si votre entrée est autre chose, Gemini 3.1 Pro prend en charge l’audio et la vidéo, tandis qu’Intern-S2 ne prend en charge ni l’un ni l’autre. Cela résout une grande partie des questions « lequel dois-je utiliser » avant même que le prix ou les benchmarks n’entrent en jeu, et quiconque vous dit que les deux sont interchangeables n’a pas lu la liste des entrées.
Ce que montre la table partagée, lu honnêtement
Comme InternLM a évalué les deux, c'est l'un des rares cas où une comparaison directe est légitime plutôt que reconstituée. La réserve reste inchangée et mérite d'être énoncée une fois : chaque chiffre d'Intern-S2 est déclaré par le fournisseur, produit par InternLM sur son propre harnais via OpenCompass, VLMEvalKit et AgentCompass, sans reproduction indépendante. Les chiffres de Gemini dans ce tableau proviennent aussi de l'exécution de la comparaison par InternLM, bien que Gemini dispose d'un vaste historique indépendant en dehors de celle-ci.
• Connaissances multimodales — Gemini 3.1 Pro 83,99 sur MMMU Pro contre Intern-S2 81,68.
• QA sur les graphiques scientifiques — Gemini 3.1 Pro 71,18 sur ChartQAPro contre Intern-S2 71,12. Une égalité parfaite à deux décimales près.
• Télédétection — Gemini 3.1 Pro 54,27 sur XLRS-Bench contre Intern-S2 51,38.
• VQA en microscopie — Gemini 3.1 Pro 71,02 sur MicroVQA vs Intern-S2 69,67.
• Tâches multimodales scientifiques — Intern-S2 60,74 sur SFE contre Gemini 3.1 Pro 59,57. La seule victoire multimodale d'Intern-S2.
• Connaissances générales — Gemini 3.1 Pro 91,00 sur MMLU Pro contre Intern-S2 89,77.
• Mathématiques au lycée — Gemini 3.1 Pro 94,70 sur HMMT-2026 contre Intern-S2 93,56.
• Raisonnement sur la littérature scientifique — Intern-S2 55.71 sur Biology-Instructions vs Gemini 3.1 Pro 13.87, et 53.95 vs 38.84 sur Mol-Instructions.
• Problèmes d'olympiades scientifiques — Intern-S2 87,00 sur FrontierScience-Olympiad vs Gemini 3.1 Pro 79,00.
• Maîtrise du terminal — Gemini 3.1 Pro 73,80 sur TerminalBench 2.1 contre Intern-S2 64,04.
Lecture honnête : Gemini 3.1 Pro remporte les lignes multimodales générales avec des marges étroites, Intern-S2 remporte les lignes de littérature scientifique pointue avec des écarts énormes, et aucun des deux résultats n’est surprenant compte tenu de ce sur quoi chacun a été entraîné. Que les défaites multimodales se jouent sur des écarts si étroits est sans doute le constat le plus intéressant — un checkpoint ouvert sorti le jour même, à moins de deux points d’un modèle phare fermé vieux de six mois sur MMMU Pro et ChartQAPro, est un résultat plus fort pour InternLM que n’importe lequel de ses scores scientifiques spectaculaires.
Contexte, sortie et la question d’aperçu
Le dossier des entrées longues se scinde nettement. Gemini 3.1 Pro dispose d’une fenêtre de contexte de 1 M de tokens avec un plafond de sortie de 64 K — assez pour un long ensemble de documents et une réponse substantielle. Intern-S2 est évalué jusqu’à 256 K tokens pour le raisonnement textuel et 64 K pour le multimodal, et ne publie pas de plafond de sortie ; considérez sa fenêtre utilisable comme plus petite que celle de Gemini jusqu’à ce que quelqu’un la mesure indépendamment.
Il existe une mise en garde opérationnelle du côté de Google qui a sa place dans toute comparaison honnête. Gemini 3.1 Pro est encore un modèle en preview, pas une version GA. Les modèles en preview s'accompagnent d'attentes de fiabilité plus faibles, et un tableau des taux d'erreur sur 7 jours sur la page d'un modèle rappelle en permanence qu'il faut contourner l'instabilité plutôt que de bâtir un chemin critique dessus. Intern-S2 est une version complète sous Apache-2.0 avec des poids que vous pouvez épingler — ce qui, contre-intuitivement, fait du tout nouveau modèle ouvert le plus stable opérationnellement des deux, au sens qui compte le plus : personne ne peut le modifier sous vos pieds.
• Contexte — Intern-S2 256K texte / 64K multimodal évalué par rapport à Gemini 3.1 Pro 1M tokens.
• Entrées — Intern-S2 texte, image, séries temporelles vs Gemini 3.1 Pro texte, image, audio, vidéo.
• Poids — Intern-S2 Apache-2.0, téléchargeables, contre Gemini 3.1 Pro fermé.
• Maturité — Intern-S2 vieux de quelques heures, aucun score indépendant face à Gemini 3.1 Pro preview depuis février 2026, testé de manière approfondie et indépendante.
• Prix — Intern-S2 : aucune grille tarifaire publique ; auto-hébergement ou API Intern officielle vs Gemini 3.1 Pro 2,00 $ en entrée / 12,00 $ en sortie par million, passant à 4,00 $/18,00 $ au-delà de 200K jetons d’entrée.

Prix et où chacun vit
Gemini 3.1 Pro facture 2,00 $ par million de tokens d'entrée et 12,00 $ par million de tokens de sortie sur le niveau standard, passant à 4,00 $/18,00 $ dès qu'une requête franchit 200 K tokens d'entrée — une prime de contexte long qui mord exactement au moment où vous utilisez la fenêtre de 1 M qui justifie de le choisir. Il est routable sur OrcaRouter à ce même prix catalogue, répercuté avec 0 % de marge, sur une clé qui porte aussi plus de 200 autres modèles ; la répercussion compte ici parce qu'une variation tarifaire de Google atterrit de notre côté le jour même, plutôt qu'après un cycle de re-tarification. Le DSL de routage est la partie utile pour cet appariement précis : vous pouvez envoyer le travail d'image et de vidéo vers Gemini 3.1 Pro et les lots de documents scientifiques vers un Intern-S2 auto-hébergé, et garder les deux derrière un seul point de terminaison, sans second contrat ni modification de code.
Intern-S2 n’a pas de tarif API publié. L’auto-hébergement des poids Apache-2.0 est la voie que la plupart des équipes vont réellement emprunter, et à 403 milliards de paramètres, c’est un véritable engagement matériel. L’API Intern officielle existe pour les équipes qui préfèrent ne pas faire tourner de GPU, mais sans grille tarifaire publique, la comparaison des coûts avec les 2 $/12 $ de Gemini n’est pas une comparaison que l’on peut faire sur le papier — il faut demander un quota et faire le calcul soi-même.

L'appel
Choisissez Gemini 3.1 Pro si vous avez besoin d’un modèle multimodal généraliste qui prend en charge l’audio et la vidéo, gère un million de tokens, bénéficie de mois de validation indépendante et peut être loué au token dès aujourd’hui. C’est le modèle le mieux étayé et le plus largement capable, et le badge d’aperçu est une mise en garde sur la fiabilité plutôt que sur les capacités.
Choisissez Intern-S2 si vos entrées multimodales sont scientifiques et que vos données ne peuvent pas quitter votre infrastructure. C’est le seul des deux à lire nativement des pages de littérature brute, à faire des prévisions à partir de signaux de séries temporelles et à pouvoir être affiné sur des données expérimentales propriétaires sous une licence permissive. Acceptez d’être la première personne à l’exécuter, et que le tableau de benchmarks qui plaide en sa faveur a été écrit par ceux qui l’ont conçu.

Aucun des deux modèles ne l'emporte de manière absolue, et le tableau le prouve mieux que ne le ferait un verdict. L'un est un généraliste qui se trouve être bon en science ; l'autre est un instrument scientifique qui se trouve être compétitif sur le travail multimodal général — et lors d'une publication ouverte le jour même, « compétitif » est le résultat le plus surprenant.
Pour tenir les deux moitiés de cette comparaison sans un second contrat : une clé API couvrant plus de 200 modèles place le fleuron multimodal propriétaire et toutes les alternatives derrière un seul point de terminaison, ce qui vous permet d'orienter le travail d'image et de vidéo d'un côté et les lots de documents de l'autre.
