
Intern-S2-397B vs Kimi K3 : le modèle scientifique 397B et le géant de raisonnement 2,8T
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Intern-S2-397B et Kimi K3 se situent de part et d’autre de la frontière des poids ouverts qui définira le reste de 2026 : le spécialiste scientifique téléchargeable face au généraliste à long contexte éprouvé de façon indépendante. Intern-S2-397B est le modèle multimodal scientifique de 403 milliards de paramètres qu’InternLM a publié sous Apache-2.0 le 13 septembre 2026 — aucune grille tarifaire, aucun score indépendant, et un volet vision entraîné sur des pages brutes de littérature scientifique. Kimi K3 est le modèle phare de type mélange d’experts de 2,8 billions de paramètres de Moonshot AI, lancé en juillet 2026 à 3,00 $ par million de tokens d’entrée et 15,00 $ par million de tokens de sortie, qui a ouvert ses poids le 27 juillet sous une licence MIT modifiée et a fait l’objet de six semaines d’évaluation indépendante. Ce qui est inhabituel dans cette confrontation, c’est que les deux modèles ont la même ambition à long horizon — continuer à travailler sur une tâche vaste et désordonnée — et la résolvent dans des directions opposées.
Tous deux ambitieux, mécanismes opposés
L’ambition est partagée : chaque modèle veut être ce qui continue quand la tâche est longue. Ils y parviennent différemment, et la différence est architecturale.
La réponse de Kimi K3, c'est le contexte. Une fenêtre de 1 048 576 tokens en entrée comme en sortie signifie qu'un dépôt entier, une data room entière ou une boucle d'agent de cinquante étapes peut tenir dans une seule conversation. La pile d'inférence Mooncake de Moonshot maintiendrait des taux de succès du cache supérieurs à 90 % sur les charges de travail de codage, ce qui explique comment un prix de sortie de 15 $ par million devient viable en pratique. Kimi K3 expose un contrôle reasoning_effort de premier niveau et n'accepte aucun paramètre d'échantillonnage, raisonne à profondeur maximale par défaut, et attend de vous que vous rejouiez verbatim les reasoning_content et tool_calls précédents dans les boucles d'outils multi-tours, sous peine de dégradation de la qualité.
La réponse d’Intern-S2-397B, c’est la spécialisation plus un contrôle au niveau des poids. Son contexte — 256K de raisonnement textuel et 64K multimodal, deux chiffres issus de la fiche du modèle — relève d’une autre catégorie de fenêtre : suffisante pour un article substantiel ou une longue session de recherche, mais pas pour un ensemble de travail d’un million de tokens. Ce qu’il offre à la place, c’est une capacité de vision qui lit nativement la littérature scientifique — figures, mise en page, notation symbolique et texte courant ensemble — et une entrée de séries temporelles qui produit des prévisions, avec en plus une réflexion activée par défaut et commutable à la demande. Si votre tâche longue est scientifique, le modèle a été entraîné exactement pour cela ; si votre tâche longue est une base de code, ce n’est pas le modèle doté de la fenêtre d’un million de tokens pour cela.
Contexte — Kimi K3 : 1 048 576 jetons en entrée et en sortie contre Intern-S2-397B : 256 K de texte / 64 K multimodal.
• Échelle — Kimi K3 : 2,8 billions de paramètres au total, ~104 milliards actifs par token, contre Intern-S2-397B : 403 milliards au total, 512 experts / 10 actifs.
• Surface de contrôle — Kimi K3 : cadran reasoning_effort, aucun paramètre d’échantillonnage vs Intern-S2-397B : bascule enable_thinking ainsi qu’un contrôle complet au niveau des poids sous Apache-2.0.
• Entrées — Kimi K3 : texte, image vs Intern-S2-397B : texte, image, séries temporelles.
• Poids — Kimi K3 : ouvert sous licence MIT modifiée (27 juillet) vs Intern-S2-397B : ouvert sous Apache-2.0 (13 septembre).
• Preuves indépendantes — Kimi K3 : six semaines de scores tiers vs Intern-S2-397B : aucun pour l'instant.
L’asymétrie des preuves est la véritable différence.
Kimi K3 est passé au crible indépendant et en ressort avec des scores sur lesquels vous pouvez vous appuyer. Artificial Analysis le place dans les 45 sur son Intelligence Index actuel, avec un GPQA Diamond dans les 90, un HLE dans les 45, un rappel de contexte long mesuré indépendamment de 88,7, et un score de codage dans les 75. Il occupe la première place sur le Frontend Code Arena (Elo dans les 1670) et a obtenu 91,2 sur BrowseComp, le chiffre le plus élevé sur ce benchmark de récupération à long horizon — bien que Moonshot lui-même prévienne que K3 « reste à la traîne des modèles propriétaires les plus puissants », et que plusieurs des lignes publiées le jour de son lancement restent rapportées par le fournisseur.
Les preuves d’Intern-S2-397B sont son propre tableau de lancement, exécuté via OpenCompass, VLMEvalKit et AgentCompass, publié quelques heures avant que vous ne lisiez ceci. Chaque chiffre est celui du fournisseur et n’a pas été reproduit : MMLU Pro 89,77, MMMU Pro 81,68, HMMT-2026 93,56, SWE-bench-Pro 68,54, et TerminalBench 2.1 à 64,04 — un chiffre que la fiche présente comme perdant face à une génération fermée plus ancienne, avec une large marge. Ses lignes scientifiques sont les chiffres qui font l’argumentaire d’un spécialiste : 55,71 sur Biology-Instructions, 63,28 sur SciReasoner 1.5, 53,95 sur Mol-Instructions, 62,35 sur MolecularIQ. Les deux bases de preuves ne se recoupent pas, c’est pourquoi la formulation honnête de cette confrontation n’est pas « qui gagne » mais « de quel type de preuves votre charge de travail a besoin ».

Ce que chacun coûte, édition open-weights
Les deux modèles sont à poids ouverts, ce qui transforme la question du coût : de l’habituel scénario facturation à l’usage contre gratuité, on passe à une comparaison de deux propositions d’hébergement. Kimi K3 a un prix d’API publié — 3,00 $ / 15,00 $ par million de tokens au tarif catalogue de Moonshot, répercuté sur OrcaRouter à 0 % de marge, avec en plus une tarification de lecture du cache — et il est également téléchargeable : une version open-weights en 96 shards qui nécessite du matériel de classe supernode, 64 accélérateurs ou plus, pour être servi. Le public réel d’un K3 auto-hébergé, ce sont les équipes disposant de budgets de datacenter. Intern-S2-397B n’a aucun prix d’API publié ; la fiche du modèle renvoie vers l’API Intern officielle, et l’économie réelle est celle de l’auto-hébergement : environ 807 GB de poids répartis sur 188 shards en BF16, un véritable nœud multi-GPU, avec une version FP8 qui réduit l’empreinte d’environ moitié.
Les deux modèles sont appelables via la même interface si vous effectuez le routage : Kimi K3 est disponible sur OrcaRouter au prix catalogue de Moonshot, avec 0 % de marge, tandis qu'Intern-S2-397B n'est pas routé — un tout nouveau checkpoint Apache-2.0, votre voie d'accès étant l'API du fournisseur lui-même ou un déploiement auto-hébergé. La valeur du routage dans cette confrontation consiste à garder le trafic généraliste à long contexte sur la clé que vous possédez déjà et les traitements par lots scientifiques sur le modèle que vous exploitez, avec un basculement automatique entre les deux. Le DSL fait de cette frontière un élément de configuration plutôt qu'une seconde intégration.

Le verdict
Choisissez Kimi K3 lorsque la tâche relève du travail généraliste à long contexte — codage sur un dépôt entier, boucles d’agents soutenues, travail intellectuel nécessitant un million de jetons de mémoire de travail — et que vous voulez un tableau de bord indépendant derrière. C’est le modèle le mieux étayé par les preuves à tous égards, ses poids ouverts sont réels (Modified MIT, 27 juillet), et si vous exploitez déjà une infrastructure de classe supernode, l’économie par jeton avec mise en cache est favorable.
Choisissez Intern-S2-397B lorsque la tâche est scientifique : articles riches en figures, diagrammes moléculaires, littérature numérisée, signaux de séries temporelles, et données qui doivent rester à l’intérieur de votre périmètre ou des poids que vous voulez affiner sur des résultats propriétaires. Apache-2.0 rend cela possible, aucune API louée ne le fait, et les lignes scientifiques de la fiche sont d’une espèce différente de ce pour quoi un généraliste a jamais été entraîné. Prévoyez le budget pour le matériel, réalisez votre propre évaluation, et considérez chaque chiffre publié à son sujet comme une affirmation jusqu’à ce que quelqu’un d’extérieur à InternLM en reproduise un.

