
Intern-S2-397B vs Grok 4.6 : qui peut tourner les manettes ?
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Intern-S2-397B et Grok 4.6 sont sortis à environ un mois d'intervalle et répondent à la même question de fond de manières opposées : qui a le droit de contrôler le raisonnement. Grok 4.6, le fleuron de xAI mis en service le 12 août 2026, vous vend une molette — un contrôle configurable de l'effort de raisonnement sur une API fermée facturée 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie, avec une fenêtre de 500 000 jetons et les outils côté serveur de xAI facturés en supplément. Intern-S2-397B, le modèle scientifique multimodal de 403 milliards de paramètres que l'équipe InternLM du Shanghai AI Laboratory a publié sous Apache-2.0 le 13 septembre 2026, vous remet la machine entière — les poids, la bascule de réflexion, la voie vision, la tête pour séries temporelles — et attend que vous l'exécutiez vous-même. L'un se loue avec des réglages ; l'autre vous appartient en propre. La comparaison qui compte ici n'est pas de savoir lequel obtient de meilleurs scores dans un tableau de benchmarks ; c'est de savoir de quel type de contrôle votre charge de travail a réellement besoin, et combien coûte chaque type.
Deux cadrans différents
La façon la plus propre de distinguer ces deux-là est de regarder où résident les contrôles de raisonnement. Grok 4.6 expose un réglage d'effort de raisonnement via l'API de xAI, et autour de celui-ci gravite une suite d'outils côté serveur — appel de fonctions, recherche web, recherche X, exécution de code — que xAI exploite et facture séparément. Vous ajustez l'effort, vous enchaînez les outils qu'il vous fournit, et vous ne touchez jamais à un poids. Le comportement du modèle est la propriété de xAI et le problème de xAI ; votre levier est un paramètre dans la requête.
Intern-S2-397B vous offre un ensemble différent de leviers, et ils se situent plus bas dans la pile. La réflexion est activée par défaut et vous la désactivez par requête avec enable_thinking=False. Comme le modèle est sous Apache-2.0, vous pouvez également récupérer les poids et affiner le comportement de raisonnement lui-même sur vos propres données, puis servir le résultat sur LMDeploy, vLLM ou SGLang. Sa surface d'entrée est plus large qu'une API texte et image : il accepte des signaux de séries temporelles et produit des prévisions, une capacité actuellement intégrée uniquement via LMDeploy, et il a été entraîné pour le travail d'agent à long horizon dans des environnements isolés. Le compromis est tout aussi clair — ce niveau de contrôle n'a de sens que si vous êtes prêt à exploiter le matériel et la pile de service qui vont avec.
• Contrôle du raisonnement — Grok 4.6 : réglage de l'effort de raisonnement sur une API fermée vs Intern-S2-397B : bascule enable_thinking plus contrôle complet au niveau des poids sous Apache-2.0.
• Outils — Grok 4.6 : la recherche web côté serveur de xAI, la recherche X et l'exécution de code, facturées séparément vs Intern-S2-397B : appel d'outils que vous connectez vous-même, plus un chemin de prévision de séries temporelles via LMDeploy.
• Entrées — Grok 4.6 : texte, image, fichier vs Intern-S2-397B : texte, image, séries temporelles.
• Contexte — Grok 4.6 : 500 000 tokens contre Intern-S2-397B : 256 K de raisonnement textuel, 64 K multimodal, les deux chiffres provenant de la fiche du modèle.
• Prix — Grok 4.6 : 2,00 $ / 6,00 $ par million, avec un palier à 4,00 $ / 12,00 $ au-delà de 200 K tokens, contre Intern-S2-397B : aucune grille tarifaire ; auto-hébergement ou API Intern officielle.
Ce que les chiffres couvrent réellement
Chaque chiffre d’Intern-S2-397B ci-dessous est propre à InternLM, obtenu via OpenCompass, VLMEvalKit et AgentCompass, et publié en même temps que les poids, sans reproduction indépendante. Les chiffres de Grok 4.6 sont d’une autre nature : ils se sont accumulés via l’arène publique et Artificial Analysis après la mise en service du modèle, si bien qu’ils portent un label de tiers.
Du côté des mesures indépendantes, Grok 4.6 se situe à 44 dans l’actuel Artificial Analysis Intelligence Index, avec un GPQA Diamond de 94,9, un Humanity's Last Exam de 61,0 et un score de codage de 76,8, et Artificial Analysis situe son chiffre TerminalBench 2.1 près de 80,3. Du côté du fournisseur, la fiche d’Intern-S2-397B annonce 89,77 sur MMLU Pro, 93,56 sur HMMT-2026, 81,68 sur MMMU Pro et 68,54 sur SWE-bench-Pro, aux côtés de lignes scientifiques où il semble appartenir à une autre espèce : 55,71 sur Biology-Instructions, 63,28 sur SciReasoner 1.5, 53,95 sur Mol-Instructions, 62,35 sur MolecularIQ. Le seul chiffre du tableau du fournisseur qui devrait faire tiquer un concepteur d’agents est TerminalBench 2.1 à 64,04 — un chiffre que les créateurs du modèle eux-mêmes indiquent comme très nettement inférieur à celui d’une génération fermée plus ancienne, et cela précisément dans le créneau du travail en terminal où excelle un modèle frontière loué comme Grok 4.6.
Interprétez cette séparation comme un portrait, non comme un classement. Intern-S2-397B est un spécialiste scientifique qui est aussi un modèle généraliste compétent ; Grok 4.6 est un généraliste qui s’intéresse passagèrement à la science. Que les lignes scientifiques soient déséquilibrées est attendu — aucun modèle généraliste phare n’a été pré-entraîné sur des pages brutes de littérature scientifique réunissant à la fois figures, mise en page et notation symbolique, et c’est précisément le paradigme autour duquel Intern-S2-397B est construit. Rien dans l’une ou l’autre base de preuves ne soutient que « Intern-S2-397B est aussi bon que Grok 4.6 pour un raisonnement arbitraire », et rien dans les preuves relatives à Grok 4.6 ne suggère qu’il a été ajusté pour l’analyse de séquences multi-omiques.
Le prix du contrôle
Grok 4.6 a un prix que vous pouvez mettre dans un tableur : 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie, avec un tarif qui monte à 4,00 $ / 12,00 $ dès qu'une invite dépasse 200 000 jetons, et un niveau de priorité optionnel pour des réponses plus rapides. Il est disponible via OrcaRouter au prix catalogue de xAI, répercuté avec 0 % de marge, donc un changement de tarif chez xAI arrive ici le jour même sans delta d'intermédiaire — le cadran que vous louez reste au prix fixé par le fournisseur.
Intern-S2-397B n’a aucun tarif par token publié. La fiche du modèle renvoie à une API Intern officielle, mais l’économie que les gens veulent réellement comparer est celle des versions auto-hébergées : un checkpoint de 403 B de paramètres, environ 807 Go de poids répartis sur 188 shards en BF16, donc un nœud multi-GPU sérieux, la version FP8 réduisant à peu près de moitié l’empreinte. Si vous disposez déjà de cette capacité, le coût marginal de la prochaine requête scientifique s’approche de celui de l’électricité, et c’est tout l’intérêt de la position Apache-2.0. Si vous ne disposez pas de cette capacité, le modèle « gratuit » est un pilote de dépenses d’investissement, pas une ligne budgétaire.
Ce qu’un routeur apporte dans cette configuration précise, c’est la jointure plutôt que le prix. Grok 4.6 repose sur la clé que vous avez déjà pour le trafic de production général ; Intern-S2-397B n’est pas routé sur OrcaRouter — c’est un tout nouveau checkpoint, et votre chemin vers lui passe par l’API propre au fournisseur ou par un déploiement auto-hébergé. Routez le raisonnement général et sensible à la latence vers le modèle facturé à l’usage, gardez le travail par lots scientifique sur le modèle que vous exécutez, et laissez le basculement automatique vous couvrir lorsque le point de terminaison de l’un ou l’autre côté est défaillant. La frontière entre eux devient une règle de routage plutôt qu’une seconde intégration.

Lequel choisir
Choisissez Grok 4.6 lorsque la tâche est générale, que le raisonnement doit revenir vite et juste, et que vous ne voulez pas posséder la pile qui le produit. Sa fenêtre de 500 K, son score mesuré de 94,9 à GPQA Diamond et sa suite d’outils sont des fonctionnalités de production, et le tarif de 2 $/6 $ est ce que vous payez pour ne rien avoir à exploiter.
Choisissez Intern-S2-397B lorsque l’entrée est scientifique — un article dense en figures, un diagramme moléculaire, un signal de série temporelle — et lorsque le raisonnement doit s’effectuer sur des données qui ne peuvent pas quitter votre environnement, ou sur un comportement que vous souhaitez fine-tuner vous-même. Apache-2.0 rend cela possible ; aucune API louée ne le fait. Prévoyez un budget pour le matériel, ne vous attendez pas à un tableau de scores indépendant avant un moment, et considérez chaque chiffre sur sa fiche comme une affirmation jusqu’à ce que quelqu’un d’extérieur à InternLM en reproduise un.


