
Intern-S2-Mobius : le modèle 35B qui sépare la connaissance du raisonnement
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 par million de tokens · 56 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 201 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOUVEAUAnthropic: Claude Opus 52026-07-2461Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1651Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1557Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligence77Code
- grokxAI: Grok 4.52026-07-0854Intelligence72Code
- tencentTencent: Hy32026-07-0641Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1651Intelligence69Code60Maths
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligence61Code61Maths
L'équipe InternLM du Shanghai AI Laboratory a discrètement publié Intern-S2-Mobius, un modèle de fondation à poids ouverts de 35B qui fait quelque chose que presque aucun autre modèle publié ne fait : il cesse de stocker les connaissances dans ses couches. Au lieu de la disposition standard d'un Transformer — où chaque couche porte son propre bloc feed-forward rempli de faits mémorisés — Mobius extrait toutes ces connaissances dans une Memory globalement partagée et laisse un petit nombre de Reasoners l'interroger à plusieurs reprises. Le gain annoncé n'est pas un score de benchmark plus élevé. C'est la vitesse : les mêmes réponses en environ un tiers à un cinquième des jetons de raisonnement, et jusqu'à 4,6 fois le débit de requêtes. Ce guide explique ce qu'est réellement Mobius, ce que son fichier de configuration révèle mais que la fiche du modèle ne montre pas, ce que les benchmarks publiés montrent ligne par ligne — y compris les deux lignes où il perd — où l'affirmation "4x plus rapide" tient et où elle s'évapore, et à qui cela devrait réellement importer.
Note d'exactitude : chaque chiffre ci-dessous provient de la propre fiche du modèle InternLM, de ses chiffres publiés de performance et d'efficacité, de son guide de déploiement et des fichiers de configuration du modèle sur Hugging Face. Il n'existe, au moment de la rédaction, aucune évaluation indépendante d'Intern-S2-Mobius par un tiers — ce dernier ne figure sur aucun classement indépendant, n'est déployé par aucun fournisseur d'inférence, et son compteur de téléchargements est toujours à zéro. Traitez tous les chiffres comparatifs comme des données déclarées par le fournisseur jusqu'à ce que quelqu'un les reproduise. Les spécifications et le code d'un modèle aussi nouveau évoluent vite ; vérifiez avant de construire.
TL;DR. Intern-S2-Mobius est un modèle de fondation multimodal de 35 milliards de paramètres, sous licence Apache 2.0, pré-entraîné en continu à partir de Qwen3.5-35B, puis post-entraîné par apprentissage supervisé (SFT) et apprentissage par renforcement. Sa nouveauté est d'ordre architectural : la conception Mobius-v0 remplace le stockage de connaissances feed-forward lié aux couches par une mémoire globalement partagée de 2 560 experts, interrogée par quatre blocs Reasoner empilés qui peuvent atteindre des connaissances au-delà de leur propre profondeur (Backward Residual Connection) et affiner les états cachés par itération latente récurrente avant le décodage (Dynamic Latent Reasoning). Dans l'évaluation menée par InternLM lui-même, le modèle bat le baseline Qwen3.5-35B dont il est issu sur sept des neuf benchmarks généraux (moyenne de 67,88 contre 65,05) et l'écrase sur les tâches scientifiques (52,14 contre 18,20), tout en produisant des traces de raisonnement environ 1,5 fois plus courtes en moyenne — 4,6 fois plus courtes sur MMLU Pro, 5,0 fois plus courtes sur GPQA Diamond. C'est de cette compression des traces que vient le gain de débit : 2,9× à une taille de lot de 16, jusqu'à 4,6× à 256. Les bémols sont bien réels : le modèle perd sur les deux benchmarks de raisonnement les plus difficiles (HLE et UGD hard), le gain de débit disparaît en grande partie sur les mathématiques de compétition, et personne hors du laboratoire n'a rien vérifié.
Points clés
• Version orientée architecture : Mobius-v0 dissocie les vecteurs de connaissance des opérateurs de raisonnement — une mémoire partagée de 2 560 experts desservant quatre blocs de raisonnement, au lieu de 40 couches accumulant chacune leurs propres connaissances FFN.
L'argument, c'est l'efficacité, pas l'intelligence : la longueur moyenne de sortie chute d'environ 1,5x et le débit de requêtes augmente de 2,9x à batch 16 à 4,6x à batch 256 par rapport à la référence Transformer.
• Il surpasse véritablement son propre modèle de base : 67.88 contre 65.05 en moyenne sur les tâches générales, remportant MMLU Pro (89.05 contre 85.31), AIME 2026 (95.31 contre 92.08) et HMMT 2026 (85.51 contre 78.50).
• Mais il perd là où la délibération importe le plus : HLE 19.11 contre 22.40 et UGD hard 73.02 contre 78.02 — les deux évaluations les plus difficiles de l’ensemble, toutes deux remportées par le Transformer simple.
• Le bond en sciences est le plus grand résultat individuel : Biology-Instructions 51,40 contre 3,77, Mol-Instructions 45,73 contre 21,70, MolecularIQ 59,29 contre 29,13.
• Ouvert mais non disponible : poids Apache 2.0 sur Hugging Face, aucun fournisseur d'inférence ne l'héberge, ~73 Go de poids bfloat16 — l'auto-hébergement est actuellement le seul moyen de l'exécuter.
Ce qu'est réellement Intern-S2-Mobius
Intern-S2-Mobius est un modèle de fondation de 35B publié par internlm, l'organisation Hugging Face derrière la série Intern du Shanghai AI Laboratory. Les poids ont été mis en ligne sur Hugging Face le 29 juillet 2026, et le dépôt GitHub associé — README, guide de déploiement et un rapport technique complet au format PDF — a été rendu public le 5 août 2026. Il est publié sous licence Apache 2.0, ce qui est à peu près aussi permissif que possible pour des poids ouverts : utilisation commerciale, modification et redistribution sont toutes autorisées.
Ce n'est pas un fine-tuning. C'est un pré-entraînement continu avec chirurgie d'architecture. InternLM a pris Qwen3.5-35B — le modèle open-weight de 35B à mélange d'experts d'Alibaba, publié le 4 mars 2026 — a restructuré la manière dont le modèle stocke et accède aux connaissances, et a poursuivi le pré-entraînement du résultat, puis a appliqué un fine-tuning supervisé et un apprentissage par renforcement par-dessus. Cette lignée est importante pour interpréter les benchmarks : chaque comparaison publiée par InternLM oppose Mobius au modèle exact à partir duquel il a été développé, ce qui constitue l'ablation la plus propre possible du changement d'architecture et aussi, commodément, la comparaison la plus susceptible de le flatter.
Le modèle est multimodal. Hugging Face le classe comme image-texte-texte, et la configuration confirme un encodeur visuel complet ainsi qu'un traitement de jetons vidéo. Il est également, à en juger par ce qui accompagne les poids, clairement destiné à la science — plus de détails ci-dessous.
L'architecture Mobius, en langage simple
Un transformateur conventionnel entrelace deux tâches à chaque couche. L’attention déplace l’information entre les jetons ; le réseau feed-forward (ou, dans un modèle de mélange d’experts, un ensemble de FFN experts) stocke les connaissances. Parce que le FFN se trouve à l’intérieur de la couche, les connaissances qu’il détient ne sont accessibles qu’à cette profondeur. Un fait appris dans la couche 30 ne peut pas être consulté par le raisonnement qui se déroule dans la couche 5. L’information circule vers l’avant, couche par couche, et c’est le seul chemin.
Mobius brise ce lien. InternLM décrit trois conséquences.
Séparation connaissance-raisonnement. Le stockage FFN propre à chaque couche est remplacé par une mémoire globalement partagée. Plutôt que 40 couches possédant chacune une partie des connaissances du modèle, il existe un pool unique que chaque étape de raisonnement peut adresser. L'argument d'InternLM est que cela améliore la compression des connaissances — les mêmes faits n'ont pas besoin d'être réappris de manière redondante à plusieurs profondeurs — et donne à chaque Reasoner un espace de connaissances beaucoup plus vaste que ce qu'un FFN d'une seule couche pourrait offrir.
Connexion résiduelle arrière. Comme la mémoire est partagée, les étapes de raisonnement superficiel et profond atteignent toutes deux le même référentiel. L'accès aux connaissances ne suit plus strictement un flux avant. Une étape superficielle peut mobiliser quelque chose qui, dans une pile standard, n'aurait été disponible que trente couches plus loin. InternLM affirme que cela permet au modèle de composer les connaissances à travers les profondeurs avec plus de flexibilité et, surtout, de synthétiser des informations utiles en moins d'étapes de raisonnement. Cette dernière clause constitue l'ensemble de la thèse de la publication.
Raisonnement latent dynamique. Au lieu d'externaliser chaque étape de délibération sous forme de jetons de chaîne de pensée visibles, Mobius affine ses états cachés continus par une itération latente récurrente avant de décoder quoi que ce soit. Une partie de la « réflexion » se produit dans l'espace de représentation interne du modèle plutôt que dans le texte généré, et la quantité de ce calcul interne est allouée dynamiquement par jeton. L'effet pratique est que le modèle doit écrire moins de mots pour parvenir à la même conclusion — et puisque la génération est autorégressive et sérialisée, écrire moins de mots est le moyen le plus direct de rendre un modèle de raisonnement plus rapide.
En somme, le pitch est un modèle de raisonnement qui réfléchit plus et tape moins.

Ce que révèle le fichier de configuration
La fiche du modèle décrit l'architecture en prose. Le code>config.json/code> la rend concrète, et il contient plusieurs nombres à connaître.
• Quatre Reasoners sur 40 couches. La configuration texte déclare 40 couches cachées mais seulement quatre blocs. Les 40 couches sont organisées en quatre étages de Reasoner qui itèrent sur la Mémoire partagée, plutôt que quarante unités indépendantes de connaissances-plus-attention.
• 2 560 experts. Voici la Mémoire partagée rendue littérale. Mobius embarque 2 560 experts, avec 8 activés par jeton, une taille intermédiaire par expert minuscule de 512, et un expert partagé en plus. Pour l'échelle, son homologue Intern-S2-Preview utilise 256 experts. Un ensemble dix fois plus grand d'experts bien plus petits, c'est exactement à quoi ressemble « un stock global de connaissances au lieu de FFN par couche » lorsqu'on l'écrit sous forme de configuration.
• 35B sur la boîte, ~36B sur le disque, ~3B actifs. La fiche du modèle indique 35B ; le lecteur safetensors de Hugging Face rapporte 36B paramètres ; l'index des poids totalise 72,96 Go en bfloat16, ce qui donne environ 36,5B. Le guide de déploiement est le plus précis : il qualifie la version de 30B-A3B modèle — environ 3B paramètres actifs par jeton. Comme pour tout MoE épars, vous payez pour l'ensemble des poids en mémoire et vous obtenez un calcul de petit modèle par jeton.
• Attention hybride, 3:1. La liste des couches alterne trois couches d'attention linéaire pour une couche d'attention complète, sur toute la profondeur — dix couches d'attention complète sur 40. L'attention linéaire empêche la mémoire long-contexte et le calcul d'exploser ; les couches d'attention complète périodiques préservent le rappel exact que l'attention purement linéaire abandonne. Les couches linéaires utilisent un noyau de convolution de largeur 4 et un état SSM en float32, la recette désormais standard de style gated-delta.
• Contexte de 256K. Les embeddings de position maximaux sont de 262,144. Notez l'écart entre ce que l'architecture prend en charge et la manière dont elle a été évaluée : InternLM a effectué ses benchmarks textuels à 128K, et à 64K sur MMLU Pro, SimpleQA et HLE. Un plafond de 256K n'est pas la même chose que 256K de qualité validée.
• Une tête de prédiction multi-tokens intégrée. Il existe un module MTP à une couche avec ses propres 256 experts. Ce n'est pas un simple ornement — le guide de déploiement recommande d'utiliser le décodage spéculatif MTP avec quatre jetons candidats, si bien qu'une partie des performances constatées en conditions réelles vient du décodage spéculatif, et non de l'architecture seule.
• Une véritable tour de vision. Un encodeur visuel à 27 couches et 1152 dimensions cachées, avec une taille de patch de 16, une fusion spatiale 2x2 et un patch temporel pour la vidéo, se projetant dans le flux textuel à 2048 dimensions avec RoPE multimodal entrelacé. Images et vidéo en entrée, texte en sortie.
• Autres précisions pour les curieux : 16 têtes d'attention avec une dimension de tête de 256, 2 têtes clé-valeur (attention par regroupement de requêtes agressive), des sorties d'attention à porte, un facteur rotatif partiel de 0,25, un thêta de RoPE de 10 millions et un vocabulaire de 251 392 jetons.
Les benchmarks, ligne par ligne
InternLM a été évalué avec OpenCompass et une comparaison unique a été publiée : Intern-S2-Mobius-35B contre Qwen3.5-35B, le modèle à partir duquel il a été pré-entraîné en continu. Neuf benchmarks généraux, trois benchmarks scientifiques.
Sur les tâches générales, Mobius gagne sept fois sur neuf. MMLU Pro — connaissances multi-domaines larges avec des distracteurs plus difficiles que le MMLU original — obtient 89,05 contre 85,31, un gain de 3,7 points et le résultat de connaissances le plus net de l'ensemble. GPQA Diamond, des questions scientifiques de niveau postuniversitaire écrites pour être à l'épreuve de Google, est essentiellement une égalité à 80,81 contre 80,24. IMO Bench, des mathématiques de niveau olympiade, obtient 81,25 contre 77,50. AIME 2026, l'American Invitational Mathematics Examination, obtient 95,31 contre 92,08. HMMT 2026, le Harvard-MIT Mathematics Tournament, est le plus grand écart en mathématiques, à 85,51 contre 78,50. AMO obtient 58,00 contre 50,00. Et SimpleQA — le rappel factuel à réponse courte, le benchmark qui mesure le plus directement si un modèle sait réellement des choses — passe de 21,39 à 28,90, une amélioration relative de 35 % qui est la preuve la plus probante de l'argument d'InternLM selon lequel « la mémoire partagée compresse mieux les connaissances ».
Puis les deux pertes, et ce sont les lignes intéressantes. UGD hard va dans l'autre sens : 73.02 pour Mobius contre 78.02 pour la ligne de base, un déficit de cinq points. Et HLE — Humanity's Last Exam, l'évaluation générale la plus difficile largement utilisée, où les modèles de pointe obtiennent encore des scores entre 10 et 30 — est de 19.11 contre 22.40. Le Transformer standard gagne de 3.3 points sur le benchmark spécifiquement conçu pour exiger le plus de raisonnement.
Ce schéma n'est pas du bruit, et il n'est pas caché : InternLM l'a publié. L'interprétation la plus plausible est que le raisonnement latent est une compression, et que la compression est avec pertes à la queue de distribution. Intérioriser la délibération dans des états cachés continus fonctionne à merveille lorsque la délibération repose fortement sur la récupération d'informations ou suit une forme familière — ce qui décrit MMLU Pro, SimpleQA et la plupart des mathématiques de compétition. Sur les problèmes qui exigent véritablement de longues chaînes de pensée exploratoires avec correction d'erreurs, la trace explicite token par token semble encore valoir son coût. La moyenne globale — 67,88 contre 65,05 — est une vraie victoire, mais c'est une moyenne qui dissimule un compromis, pas une amélioration uniforme.
Les résultats scientifiques représentent une différence d'une tout autre échelle. Biology-Instructions passe de 3,77 à 51,40. Mol-Instructions, qui couvre la compréhension et la génération moléculaires, passe de 21,70 à 45,73. MolecularIQ passe de 29,13 à 59,29. La moyenne est de 52,14 contre 18,20. Des chiffres comme 3,77 qui grimpent à 51,40 ne sont pas des victoires d'architecture ; ils sont la marque d'un entraînement ciblé sur des tâches que le modèle de référence n'a tout simplement jamais appris à accomplir. Un score inférieur à 4 % pour Qwen3.5-35B sur Biology-Instructions signifie qu'il ne comprend pas le format de la tâche, pas qu'il est mauvais en biologie. Lisez ces trois lignes comme « InternLM a ajouté une spécialisation scientifique », ce qui est réellement précieux et constitue tout l'intérêt de la gamme Intern-S — mais ne l'attribuez pas à l'architecture Mobius.
Où « 4x plus rapide » est réel, et où ce n'est pas le cas
L'affirmation d'efficacité est la raison pour laquelle ce modèle existe, elle mérite donc une lecture attentive. Le titre d'InternLM est « accélération d'inférence de bout en bout de près de 4 fois ». Le chiffre de débit publié est plus informatif que le titre, et plus honnête.
Mesuré comme débit de requêtes selon la taille du batch, en moyenne sur les benchmarks, Mobius surpasse la baseline Transformer de 2.9x pour un batch de 16 et 4.6x pour un batch de 256. L'écart se creuse avec la taille du batch, ce qui est attendu quand le gain provient de la génération de moins de jetons par requête : plus vous regroupez de requêtes, plus les étapes de décodage économisées se cumulent. Le titre « près de 4x » est un point médian d'une fourchette, pas une constante.
Décomposons les choses par benchmark et le tableau devient plus net. Sur MMLU Pro et GPQA Diamond, Mobius est nettement plus rapide à chaque taille de lot — les courbes de débit se séparent immédiatement et continuent à diverger. Sur IMO Bench, il est en tête de manière constante mais modérée. Sur AIME 2026 et HMMT 2026, le Transformer de base est en réalité plus rapide aux tailles de lot intermédiaires, Mobius ne prenant l’avantage qu’à partir du lot 256. Sur les mathématiques de compétition les plus difficiles, l’avantage de débit est nul ou pire sur une grande partie de la plage de fonctionnement utile.
Pourquoi ? Parce que le débit suit la compression des traces presque parfaitement. La longueur moyenne de sortie sur les benchmarks chute d'environ 1,5x, passant d'environ 20 400 jetons à environ 13 200. Mais cette moyenne couvre une énorme plage : 4,6x plus court sur MMLU Pro (environ 1 100 jetons contre 5 150) et 5,0x plus court sur GPQA Diamond (environ 2 600 contre 12 900), contre seulement 1,4x sur IMO Bench, 1,5x sur AIME 2026, et 1,2x sur HMMT 2026. Là où le modèle peut compresser sa réflexion, il file. Là où le problème exige 24 000 jetons de dérivation quoi qu'il arrive, il ne le peut pas, et les surcoûts de l'architecture se manifestent à la place.
La traduction pratique : si votre charge de travail ressemble à de la récupération de connaissances, des questions à choix multiples, des questions-réponses techniques ou de la classification, l'accélération est importante et immédiate. Si votre charge de travail est une dérivation mathématique ou scientifique difficile, prévoyez à peu près une parité et soyez agréablement surpris. Quiconque cite « 4 fois plus rapide » comme propriété générale du modèle cite une moyenne de deux comportements très différents.

La stack scientifique cachée dans la liste des fichiers
L'un des éléments les plus révélateurs de cette version ne se trouve pas du tout dans la fiche du modèle — il se trouve dans la liste des fichiers du dépôt. Aux côtés des fichiers de tokenizer habituels, Intern-S2-Mobius est livré avec trois tokenizers spécialisés supplémentaires : code>tokenizer_PROT.model/code> pour les séquences protéiques, code>tokenizer_SMILES.model/code> pour les structures moléculaires en notation SMILES, et code>tokenizer_XNA.model/code> pour les séquences d'acides nucléiques. Il y a aussi un tableau NumPy égaré de données sismiques qui traîne dans le dépôt.
Des tokenizers dédiés aux protéines, aux molécules et à l'ADN/ARN ne sont pas quelque chose que l'on ajoute à la légère. Ils signifient que le modèle a été entraîné à lire ces types de séquences comme des entrées à part entière, plutôt que comme du texte ordinaire qui contient des lettres par hasard. C'est ce qui fait passer un score de 3,77 à 51,40 sur Biology-Instructions, et cela place Mobius dans la même famille que son jumeau Intern-S2-Preview, qui a ajouté les modalités de séries temporelles et de vision et qui, selon InternLM, a été le premier modèle open-source doté d'une capacité de génération de structures cristallines de matériaux.
Si vous êtes un développeur généraliste, c'est anecdotique. Si vous travaillez en biologie computationnelle, en chémoinformatique ou en science des matériaux, c'est peut-être la ligne la plus importante de cet article : il s'agit d'un petit modèle auto-hébergeable sous licence Apache-2.0 qui parle nativement le SMILES et la séquence protéique.
Sa place dans la famille Intern
La gamme Intern-S est la série multimodale scientifique du Shanghai AI Laboratory. Intern-S1 a établi le format. Intern-S1-Pro l'a porté à la classe du billion de paramètres. Intern-S2-Preview, publié peu avant Mobius, est le pari de l'efficacité : un modèle de 36B au total, 3B actifs, avec 256 experts et un contexte de 262K, dont InternLM affirme qu'il égale le S1-Pro à l'échelle du billion sur les tâches scientifiques professionnelles essentielles — soit une réduction d'environ 30x du nombre de paramètres pour des capacités scientifiques comparables.
Intern-S2-Mobius est une troisième chose : une version d'architecture portant le nom Intern-S2. Le « v0 » dans Mobius-v0 a un rôle bien réel dans cette appellation — c'est la première itération publique d'un design, pas une ligne de produits mature. Il se connecte à ArchSpace, la plateforme ouverte d'InternLM pour valider les innovations en architecture de LLM, dont l'objectif déclaré est de « transformer l'exploration de l'architecture des LLM en connaissances réutilisables pour la communauté », avec évaluation par les pairs et résultats publiés, y compris négatifs. Mobius est ce à quoi ressemble ce programme lorsqu'une proposition passe d'une sonde à l'échelle 1B à un modèle de 35B que vous pouvez réellement télécharger. Un rapport technique complet est livré avec le dépôt GitHub pour ceux qui veulent les dérivations.
Sous cet angle, les deux pertes aux benchmarks sont un atout de la version, pas une honte. C'est un laboratoire qui publie honnêtement une expérience d'architecture, y compris ses régressions.
Comment l'exécuter
Intern-S2-Mobius est pris en charge par trois piles d'inférence, et le guide de déploiement fournit des invocations fonctionnelles pour chacune.
LMDeploy est la voie recommandée et la seule que le guide présente sur un seul GPU : servez avec le backend PyTorch, code>--trust-remote-code/code>, un parallélisme de tenseurs de 1, et le décodage spéculatif MTP activé via l'algorithme spéculatif qwen3_5_mtp avec quatre jetons de brouillon. vLLM est présenté avec un parallélisme de tenseurs de 2, l'analyseur de raisonnement qwen3, l'analyseur d'appels d'outils qwen3_coder, le choix automatique d'outil, et le décodage spéculatif MTP avec quatre jetons spéculatifs. Transformers fonctionne pour l'inférence de base via code>AutoModelForImageTextToText/code> avec code>trust_remote_code=True/code> et bfloat16 — notez que le modèle fournit un code de modélisation personnalisé, donc l'exécution de code à distance est obligatoire, et la configuration cible Transformers 5.2.
Les paramètres d'échantillonnage recommandés par InternLM sont une température de 0,8, un top-p de 0,95, un top-k de 50 et un min-p de 0,0 — plus chauds que les réglages quasi-gloutons que la plupart des modèles de raisonnement préfèrent, ce qui mérite d'être respecté plutôt que d'être écrasé par habitude.
Côté matériel : environ 73 Go de poids en bfloat16, plus le cache KV et les activations, font qu'un seul accélérateur de 80 Go est juste, tandis qu'une seule carte de 141 Go est confortable — c'est sans doute pourquoi l'exemple vLLM utilise deux GPU alors que l'exemple LMDeploy suppose un seul gros GPU. Le travail sur de longs contextes fera grimper ces besoins. Activez MTP — le guide le recommande explicitement, et une part significative de l'accélération annoncée se trouve là, plutôt que dans l'architecture de base.
La mise en garde pratique la plus importante : aucun fournisseur d'inférence n'héberge actuellement ce modèle. Le panneau des fournisseurs d'inférence de Hugging Face l'indique clairement, et le compteur de téléchargements était toujours à zéro au moment où ce texte a été écrit. Il n'y a ni point de terminaison API, ni prix par million de tokens, ni moyen géré de l'essayer. L'auto-hébergement est la seule option aujourd'hui.

Qui devrait réellement s'en soucier
1. Équipes exécutant des charges de travail de raisonnement à grand volume et axées sur la récupération.
Voici le profil pour lequel l’architecture a été conçue. Si vous servez de grands lots de Q&A techniques, d’analyse de documents, d’extraction structurée ou de classification de type QCM via un modèle de raisonnement, et que votre facture est dominée par des tokens de raisonnement que vous ne montrez jamais à l’utilisateur, un modèle qui arrive à la même réponse avec un cinquième des tokens représente une réduction directe des coûts. Les chiffres MMLU Pro et GPQA — des traces 4,6x et 5,0x plus courtes avec une précision égale ou supérieure — correspondent exactement à ce profil. Testez-le sur votre propre trafic avant d’y croire, mais le mécanisme est solide et l’incitation est importante.
2. Groupes de science computationnelle
Tokeniseurs pour protéines natives, SMILES et acides nucléiques, ainsi que des gains mesurés importants sur les benchmarks de biologie et de molécules, dans un modèle sous licence Apache 2.0 qui tient sur un ou deux GPU. Pour un laboratoire qui a besoin que les données restent sur site et ne peut pas envoyer de structures moléculaires à une API commerciale, cette combinaison est rare. La gamme Intern-S évoluait dans cette direction, et Mobius en est le point d’entrée le moins cher à ce jour.
3. Chercheurs et observateurs d’architecture.
Le découplage connaissance-raisonnement et le raisonnement latent sont des axes de recherche actifs depuis un certain temps ; très peu ont été validés à 35B et publiés ouvertement avec les cas d'échec intacts. Si vous vous intéressez à la suite des architectures post-Transformer, le rapport technique et les deux lignes perdantes sont plus intéressants que le score moyen. ArchSpace est explicitement conçu pour rendre ce type de résultat réutilisable.
Qui ne devrait pas s'en préoccuper, du moins pas encore : toute personne à la recherche d'un assistant généraliste de production. Il n'y a pas de point de terminaison hébergé, pas d'évaluation indépendante, pas d'outillage écosystémique, et pas d'antécédents. Ce n'est pas une critique du modèle — c'est une description d'une version de recherche vieille d'une semaine.
Comment cela s'intègre dans une pile de production
Le classement honnête d'Intern-S2-Mobius aujourd'hui est candidat à l'évaluation, et non modèle par défaut. Il s'agit d'un artefact de recherche non hébergé, non vérifié, âgé d'une semaine, avec une architecture véritablement intéressante et une force très spécifique — un raisonnement économe en tokens sur des tâches axées sur la récupération — ainsi qu'une réelle spécialisation dans les données de séquences scientifiques.
Un modèle sensé consiste à garder votre trafic de production sur un point d'accès neutre vis-à-vis des fournisseurs, comme OrcaRouter, qui vous offre une API compatible OpenAI pour de nombreux modèles, et à déployer Mobius séparément sur vos propres GPU pour la niche étroite où il pourrait gagner. Mesurez ce qui compte vraiment pour ce modèle : non pas la précision seule, mais les jetons dépensés par réponse correcte. C'est l'axe que Mobius optimise, et c'est l'axe que la plupart des bancs d'évaluation ignorent. S'il tient sur votre charge de travail, vous disposez d'une voie auto-hébergée peu coûteuse à exécuter et sans entraves juridiques. Dans le cas contraire, vous avez perdu une journée de temps GPU et votre chemin de production n'a jamais bougé.
La même logique s'applique en sens inverse si un fournisseur finit par l'héberger : un routeur permet de tester en A/B un nouveau modèle contre le modèle existant sans rien réécrire, ce qui est exactement la bonne manière d'adopter une architecture que personne n'a testée de manière indépendante.
Limitations et mises en garde
Commençons par le plus important : il n'existe aucune vérification indépendante des chiffres de cet article. Chaque benchmark, chaque courbe de débit et chaque comparaison de longueur de tokens provient d'InternLM. La comparaison est également structurellement favorable — Mobius n'est mesuré que par rapport à la baseline spécifique à partir de laquelle il a été continuellement pré-entraîné, et non par rapport à la frontière actuelle, et le post-entraînement supplémentaire en SFT et RL signifie que la comparaison n'est pas une ablation d'architecture propre même si elle est présentée comme telle. Une partie du gain est due à Mobius ; une autre simplement à davantage d'entraînement.
Les régressions sont réelles et elles concernent les tâches les plus difficiles. Perdre 3,3 points sur HLE et 5 points sur UGD hard, tout en gagnant sur presque tout ce qui est plus facile, constitue une signature cohérente et légèrement préoccupante pour un modèle dont l'argument de vente est l'efficacité du raisonnement.
Sur le plan opérationnel, la friction est significative. Le code de modélisation personnalisé implique code>trust_remote_code/code> et une version de pointe de Transformers. Les frameworks qui le prennent en charge doivent être assez récents pour savoir ce qu'est un code>interns2_mobius/code>, et le guide d'InternLM lui-même avertit que ce sont des configurations de référence en cours de développement actif. Environ 73 Go de poids, ce n'est pas un modèle pour ordinateur portable. Il n'y a pas d'API hébergée, pas de tarification, pas de limites de débit et pas de SLA — parce qu'il n'y a pas de service.
Enfin, notons ce qui n'a pas été publié : aucun résultat de benchmark multimodal malgré un encodeur visuel complet, aucune évaluation en contexte long malgré un plafond de 256K, aucun benchmark de code du tout, aucune évaluation de sécurité ou d'alignement, et aucune comparaison avec un autre modèle que Qwen3.5-35B. Pour un déploiement à usage général, ce sont de grandes zones vides. Pour un article d'architecture avec poids joints, ils sont simplement hors du champ — c'est la bonne façon de comprendre cette publication.
FAQ
Qu'est-ce que Intern-S2-Mobius ?
Un modèle de fondation multimodal de 35 milliards de paramètres, sous licence Apache 2.0, issu de l'équipe InternLM du Shanghai AI Laboratory, construit sur l'architecture Mobius-v0 qui sépare le stockage des connaissances du calcul de raisonnement. Il a été pré-entraîné en continu à partir de Qwen3.5-35B, puis post-entraîné par SFT et apprentissage par renforcement, et publié sur Hugging Face le 29 juillet 2026.
Qu'est-ce qui rend l'architecture Mobius différente ?
Les transformateurs classiques stockent les connaissances dans un bloc feed-forward à l'intérieur de chaque couche, de sorte que les connaissances ne sont accessibles qu'à la profondeur où elles se trouvent. Mobius remplace cela par une mémoire partagée globalement — 2 560 experts dans la configuration publiée — que quatre blocs Reasoner interrogent à plusieurs reprises, permettant un accès aux connaissances à travers les profondeurs et laissant une partie de la délibération se dérouler dans des états cachés continus plutôt que dans des jetons de chaîne de pensée générés.
Intern-S2-Mobius est-il vraiment 4x plus rapide ?
En moyenne et pour des tailles de lot importantes, approximativement oui : InternLM mesure un débit de requêtes 2.9x supérieur pour un lot de 16, qui passe à 4.6x pour un lot de 256. Mais cela varie énormément selon la tâche. Sur MMLU Pro et GPQA Diamond, le gain est important quelle que soit la taille du lot ; sur les mathématiques de compétition AIME et HMMT, le Transformer de référence est en réalité plus rapide pour les tailles de lot intermédiaires. L'accélération dépend de la mesure dans laquelle le modèle peut raccourcir sa trace de raisonnement.
Comment se compare-t-il à Qwen3.5-35B ?
Il remporte sept des neuf benchmarks généraux pour une moyenne de 67,88 contre 65,05, dont MMLU Pro (89,05 contre 85,31), AIME 2026 (95,31 contre 92,08), HMMT 2026 (85,51 contre 78,50) et SimpleQA (28,90 contre 21,39). Il perd UGD hard (73,02 contre 78,02) et HLE (19,11 contre 22,40). Sur les tâches scientifiques, il est loin devant — 52,14 de moyenne contre 18,20.
Puis-je utiliser Intern-S2-Mobius via une API ?
Pas actuellement. Aucun fournisseur d'inférence ne l'héberge, il n'y a pas de tarification publiée, et Hugging Face ne répertorie aucun déploiement. L'auto-hébergement avec LMDeploy, vLLM ou Transformers est la seule façon de l'exécuter aujourd'hui.
Quel matériel faut-il pour l'exécuter ?
Les poids occupent environ 73 Go en bfloat16, prévoyez donc un accélérateur de classe 141 Go ou deux GPU de 80 Go, plus une marge pour le cache KV. L'exemple LMDeploy d'InternLM utilise un parallélisme de tenseurs de 1 ; son exemple vLLM utilise 2. Il est recommandé d'activer le décodage spéculatif MTP avec quatre jetons candidats.
Quelle est sa longueur de contexte ?
La configuration prend en charge 262 144 jetons (256K). Notez qu'InternLM a été évalué à 128K sur la plupart des benchmarks textuels et à 64K sur MMLU Pro, SimpleQA et HLE ; la qualité validée à 256K complet n'a donc pas été démontrée.
Est-ce que c'est multimodal ?
Oui. Hugging Face le classe comme image-text-to-text, et la configuration inclut un encodeur visuel à 27 couches avec gestion des jetons vidéo. Cependant, InternLM n'a publié aucun résultat de benchmark multimodal avec cette version, de sorte que la capacité de vision n'est pas documentée en pratique.
Pourquoi inclut-il des tokeniseurs de protéines et de SMILES ?
Parce que la gamme Intern-S est une famille de modèles scientifiques. Des tokenizers dédiés aux séquences de protéines, à la notation moléculaire SMILES et aux acides nucléiques signifient que le modèle lit ces formats comme des types d'entrée natifs, ce qui explique pourquoi il obtient un score de 51.40 sur Biology-Instructions alors que la référence obtient 3.77.
La licence est-elle vraiment Apache 2.0 ?
Oui — Apache 2.0, avec le fichier de licence dans le dépôt. L'utilisation commerciale, la modification et la redistribution sont autorisées, ce qui est nettement plus permissif que de nombreuses versions open-weight de grands laboratoires.
Devrais-je l'utiliser en production ?
Pas encore. Il a une semaine, n'est pas hébergé, n'a été vérifié par aucun tiers, et il lui manque des évaluations en codage, multimodal, contexte long et sécurité. Traitez-le comme un candidat à l'évaluation pour le raisonnement économe en jetons ou le travail sur les séquences scientifiques, maintenez le trafic de production sur des modèles établis via un point de terminaison indépendant du fournisseur, et revenez-y lorsque des chiffres indépendants existeront.
En résumé
Intern-S2-Mobius est l’une des sorties de modèles les plus véritablement intéressantes de l’année, et presque rien de cela n’a à voir avec ses scores. InternLM a pris une idée architecturale réelle — cesser de lier les connaissances aux couches, les placer dans une mémoire partagée unique, et laisser le modèle effectuer une partie de son raisonnement dans l’espace latent plutôt qu’en tokens — l’a étendue à 35B, l’a entraînée correctement, et a publié les poids sous licence Apache 2.0, accompagnés du rapport technique et des résultats qui n’ont pas été en sa faveur. Le mécanisme d’efficacité est lisible et les preuves sont cohérentes entre elles : les traces deviennent en moyenne 1,5 fois plus courtes et jusqu’à 5 fois plus courtes sur les tâches à forte intensité de connaissances, et le débit augmente exactement dans la proportion que l’on prédirait à partir de cela.
Les mises en garde sont tout aussi claires. Personne en dehors du Shanghai AI Laboratory n'a vérifié le moindre chiffre. La comparaison se fait par rapport à la base du modèle lui-même et inclut un post-entraînement supplémentaire, ce n'est donc pas l'ablation propre à laquelle elle ressemble. L'accélération disparaît en grande partie sur les mathématiques difficiles. Le modèle perd sur les deux benchmarks de raisonnement les plus exigeants de son propre tableau. Et il n'y a aucun moyen de l'essayer sans louer des GPU.
Donc : pas un modèle à déployer cette semaine, mais très certainement un à surveiller, et une option réellement attrayante pour deux publics spécifiques — les équipes dont la facture de raisonnement est dominée par des jetons que personne ne lit, et les groupes scientifiques qui ont besoin d'un petit modèle sous licence permissive, parlant nativement le langage des protéines et des molécules. Gardez la pile de production sur des modèles éprouvés via un point de terminaison neutre vis-à-vis des fournisseurs comme OrcaRouter, déployez Mobius sur votre propre matériel pour le cas précis, et mesurez les jetons par réponse correcte plutôt que la seule précision. Si l'architecture résiste à un examen indépendant, Mobius-v0 sera retenu moins comme un modèle de 35B que comme le numéro de version précédant celui qui comptait.
