Une carte hero générée comparant Intern-S2-397B et Qwen3.8-Max, montrant à gauche un checkpoint scientifique ouvert avec une entrée de page de figure et un badge Apache-2.0, et à droite un endpoint phare facturé à l'usage avec une tuile de grille tarifaire affichant $2 / $6 et un compteur de contexte de 1 M de tokens, avec le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Intern-S2-397B vs Qwen3.8-Max : deux fleurons chinois aux paris économiques opposés

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Intern-S2-397B et Qwen3.8-Max sont les deux lancements phares chinois les plus déterminants du début septembre 2026, et ils ont pris des paris économiques opposés. Intern-S2-397B, le modèle multimodal scientifique de 403 milliards de paramètres que l’équipe InternLM du Shanghai AI Laboratory a publié sous Apache-2.0 le 13 septembre, parie que des poids ouverts sont le moyen de s’imposer sur les charges de travail scientifiques et agentiques : aucun prix par token, des poids sur Hugging Face, et votre propre matériel comme compteur. Qwen3.8-Max, le fleuron d’Alibaba de 2,4 billions de paramètres, passé en disponibilité générale (GA) le 3 août et actualisé le 2 septembre, parie sur une API payante à 2,00 $ par million de tokens d’entrée et 6,00 $ par million de tokens de sortie sur un contexte de 1 M de tokens, avec des poids ouverts arrivant une semaine après la GA et un score indépendant d’Artificial Analysis déjà enregistré. Leur confrontation porte moins sur la question de savoir quels benchmarks l’emportent que sur celle de savoir quel pari — la propriété ou un point de terminaison facturé à l’usage — correspond au profil de votre charge de travail.

Deux fleurons, deux paris

Qwen3.8-Max est le niveau de capacité le plus élevé d'Ali​baba dans la gamme Qw​en, un modèle à mélange d'experts clairsemé comptant 2,4 billions de paramètres au total et environ 95 milliards activés par token sur 512 experts, avec 10 actifs plus un partagé. Il dispose d'une fenêtre de contexte de 1 M de tokens (983 616 tokens avec la réflexion activée dans l'API hébergée), d'un plafond de sortie de 131 072 tokens, d'entrées texte, image et vidéo, et il est servi via un point de terminaison compatible OpenAI. Son positionnement tarifaire distinctif repose sur un tarif forfaitaire : les mêmes 2,00 $ / 6,00 $, que votre prompt fasse 5 000 ou 900 000 tokens, avec une entrée mise en cache facturée moins cher — aucun supplément pour le contexte long, ce qui est exactement le levier que la plupart des concurrents facturent encore. Ali​baba le positionne directement face à GPT-5.5, Claude Opus 4.7 et Gemini 3.1 Pro dans son propre guide de migration.

Intern-S2-397B est un flagship d'un autre genre. C'est un modèle à mélange d'experts comptant 60 couches et 512 experts (10 actifs par token), avec un contexte de raisonnement de 256K pour le texte et de 64K pour le multimodal, une surface d'entrée composée de texte, d'images et de séries temporelles, et un paradigme de pré-entraînement qui lit des pages brutes de littérature scientifique — figures, mise en page, notation symbolique et prose — plutôt que d'en extraire d'abord le texte. Son apprentissage par renforcement couvre plus de vingt domaines scientifiques, et il a été entraîné pour le travail d'agent à long horizon dans des environnements sandbox. Sa tarification n'est pas une grille tarifaire, mais son absence : auto-hébergez les poids Apache-2.0, ou demandez l'accès à l'API Intern officielle.

• Prix — Intern-S2-397B : pas de grille tarifaire ; auto-hébergement ou API Intern face à Qwen3.8-Max : $2.00 / $6.00 par 1M en tarif fixe, entrée mise en cache moins chère.

• Échelle — Intern-S2-397B : 403B au total, 512 experts / 10 actifs vs Qwen3.8-Max : 2,4T au total, 95B actifs, 512 experts / 10 + 1 partagé.

• Contexte — Intern-S2-397B : 256K de texte / 64K multimodal contre Qwen3.8-Max : 1M de tokens, tarif forfaitaire.

• Entrées — Intern-S2-397B : texte, image, séries temporelles vs Qwen3.8-Max : texte, image, vidéo.

• Poids — Intern-S2-397B : Apache-2.0, ouverts le jour de la sortie vs Qwen3.8-Max : licence personnalisée Qwen3.8-Max, ouverts le 12 août après la GA.

• Score indépendant — Intern-S2-397B : aucun pour l'instant vs Qwen3.8-Max : AA Intelligence Index 40, GPQA Diamond 92,7.

Les deux tables sont des tables de fournisseurs, et une seule a un arbitre.

Les deux modèles ont été lancés avec des tableaux de référence produits par les fournisseurs, ce qui rend la discipline de sourcing identique et le bilan différent. Depuis, les chiffres indépendants de Qwen3.8-Max se sont accumulés : Artificial Analysis le place à 40 sur son indice d’intelligence actuel, avec un GPQA Diamond de 92,7, un HLE de 43,0 et un score de codage indépendant de 71,8, pour un coût d’environ 2,67 $ par tâche d’indice sur l’échelle actuelle. Ce sont des chiffres mesurés par un traqueur tiers — le premier véritable arbitre qu’ait eu l’un ou l’autre de ces deux modèles phares.

La preuve d’Intern-S2-397B est sa propre fiche, établie via OpenCompass, VLMEvalKit et AgentCompass, publiée aux côtés des poids : MMLU Pro 89,77, MMMU Pro 81,68, HMMT-2026 93,56, SWE-bench-Pro 68,54, et TerminalBench 2.1 à 64,04, un chiffre que la fiche elle-même donne perdant face à une génération fermée plus ancienne. Ses lignes scientifiques sont la raison d’être de l’argument du spécialiste : Biology-Instructions 55,71, SciReasoner 1.5 63,28, Mol-Instructions 53,95, MolecularIQ 62,35. Chacune de ces lignes est propre à InternLM, non reproduite. Mises côte à côte, les deux bases de preuves racontent la même histoire dans des directions opposées : un modèle est un spécialiste avec des lignes générales respectables et aucune mesure externe, l’autre est un généraliste avec un score indépendant et aucun ajustement scientifique.

A generated two-column scoreboard titled 'Intern-S2-397B vs Qwen3.8-Max — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Price self-host or Intern API. Right column 'Qwen3.8-Max': Weights custom Qwen3.8-Max licence, opened Aug 12; Scale 2.4T total, 95B active; Context 1M flat-rate tokens; Inputs text, image, video; Independent score AA Index 40, GPQA 92.7; Price $2.00 / $6.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Qwen3.8-Max figures per Artificial Analysis and Alibaba.'

Ce que les formes d'argent achètent réellement

Le tarif forfaitaire de 2 $ / 6 $ est la signature de Qwen3.8-Max, et il vaut la peine de préciser ce qu'il permet d'obtenir. Un agent d'analyse de dépôt qui fait passer 200 000 jetons d'entrée de contexte de code en un seul appel paie le même tarif par jeton qu'une courte conversation — sans supplément pour prompt long — et avec la mise en cache, un contexte de code stable fait chuter considérablement le prix effectif d'entrée sur le trafic répété. Le modèle peut aussi être appelé en tant que poids ouverts sous la licence personnalisée d'Alibaba, qui autorise l'utilisation commerciale avec attribution, plus des seuils basés sur l'échelle au-delà de 100 millions d'utilisateurs actifs mensuels ou de 20 millions de dollars de revenus mensuels, et un accord séparé pour les grandes entreprises de modèle en tant que service.

L’économie d’Intern-S2-397B est l’inverse : aucun compteur du tout, mais une dépense en capital. Les poids font environ 807 Go en BF16 répartis sur 188 shards — un sérieux nœud multi-GPU — avec une version FP8 qui réduit l’empreinte d’environ la moitié. Si vous disposez déjà de cette capacité, le coût marginal de la prochaine requête scientifique s’approche de celui de l’électricité, et c’est le pari : la possession rend le spécialiste bon marché à la marge. Si vous ne possédez pas le matériel, le modèle « gratuit » est un pilote, et l’API Intern officielle est la seule alternative facturée à l’usage.

Les deux modèles phares peuvent partager une seule couture si vous les routez. Qwen3.8-Max est disponible sur OrcaRouter au prix catalogue d'Alibaba répercuté à 0 % de marge, donc le tarif fixe de 2 $ / 6 $ et toute future baisse de prix arrivent ici le jour même. Intern-S2-397B n'est pas routé — c'est un tout nouveau checkpoint, et votre chemin vers lui passe par l'API propre au fournisseur ou un déploiement auto-hébergé. Envoyez le trafic général, compatible vidéo et à long contexte vers le modèle facturé à l'usage, sur la clé que vous avez déjà ; gardez le travail par lots scientifique sur le modèle que vous exécutez ; laissez le basculement automatique vous couvrir lorsque le point de terminaison de l'un ou l'autre côté est défaillant. La frontière est une règle de routage plutôt qu'une seconde intégration.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the feature blocks covering scientific-literature pre-training and multi-domain scientific reinforcement learning.

Le verdict

Choisissez Qwen3.8-Max pour le raisonnement général et les travaux de production compatibles avec la vidéo, où un tarif forfaitaire pour un million de tokens bat tout ce que facturent ses concurrents, et où un classement indépendant réduit le risque de bâtir sur lui. Ses poids sont suffisamment ouverts pour compter, sous une licence dans le périmètre de laquelle la plupart des équipes se trouvent déjà, et son tarif de 2 $ / 6 $ est le prix le plus agressif du tableau parmi les modèles phares de la frontière.

Choisissez Intern-S2-397B pour les charges de travail scientifiques — articles riches en figures, diagrammes moléculaires, signaux de séries temporelles — là où l'entrée est multimodale d'une manière pour laquelle un généraliste n'a jamais été ajusté, et où la résidence des données ou le fine-tuning sur des résultats propriétaires fait d'Apache-2.0 la propriété décisive. Prévoyez un budget pour le matériel, réalisez votre propre évaluation et traitez ses chiffres comme des affirmations jusqu'à ce qu'un arbitre indépendant apparaisse.

Le résumé honnête, c’est que ces deux modèles phares ne sont pas vraiment des substituts. L’un est un instrument scientifique en propre, doté de capacités générales respectables ; l’autre est un généraliste loué, évalué de façon indépendante, à tarif forfaitaire et avec un intérêt passager pour la science. Les équipes qui ont besoin des deux devraient considérer la frontière comme une décision de routage — et devraient relancer leurs propres évaluations sur Intern-S2-397B avant de croire le moindre chiffre sur la diapositive de l’un ou l’autre des fournisseurs.

A screenshot of the OrcaRouter model page for Qwen3.8-Max at orcarouter.ai/models/qwen/qwen3.8-max, captured September 13, 2026, showing the model listing with its provider Qwen, 1M-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.