
Nex-N2.5 Pro contre Kimi K3 : le duel où la propre fiche de benchmark du nouveau venu fait office d’arbitre.
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0455Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0247Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0157Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2646Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligence75Code
- obsidianQwen3.8 27B2026-08-1541Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1251Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0547Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligence49Code
Vérifiez les chiffres que Nex-N2.5 Pro et Kimi K3 ont en commun et vous remarquerez qui les a fournis. Le Nex-N2.5 Pro de Nex-AGI — l'agent multimodal à 397 milliards de paramètres, environ 17 milliards actifs, présenté le 8 septembre 2026 avec des poids encore marqués « à venir » — publie un tableau de benchmarks qui liste le Kimi K3 de Moonshot AI directement dans les mêmes colonnes. Kimi K3 est le modèle phare open-weight à 2,8 billions de paramètres que Moonshot a publié le 16 juillet 2026, avec un contexte d'un million de jetons, des poids complets sous licence MIT modifiée onze jours plus tard, et un score de 57 à l'Artificial Analysis Intelligence Index qui en fait le meilleur modèle open-weight du classement. Et, ligne après ligne de ce tableau, le Nex-N2.5 Pro est distancé par le Kimi K3 : Terminal-Bench 2.1 à 82,7 contre 88,3 pour le K3, BrowseComp 89,7 contre 91,2, SWE-Bench Pro 61,2 contre 63,3, AutomationBench 44,2 contre 46,7. Quand un éditeur affiche les chiffres de son propre modèle à côté de ceux du leader actuel des modèles open-weight et que son modèle perd la plupart des lignes, le plus intéressant dans cette confrontation est que le tableau dit probablement la vérité.
C’est la forme inhabituelle de cette comparaison. En général, la fiche d’un nouveau venu est l’endroit où chercher la propagande. Ici, la fiche est ce que l’un ou l’autre modèle a de plus proche d’un arbitre honnête, car Nex-AGI n’avait aucune raison de publier un tableau qui rétrograde son propre niveau Pro — et les lignes où Pro bat K3 sont exactement celles où un petit modèle conçu pour l’utilisation d’ordinateur devrait battre un généraliste bien plus volumineux. La véritable question à laquelle cette page répond est donc plus étroite et plus utile que « lequel est meilleur » : la niche revendiquée par Nex-N2.5 Pro — des performances agentiques proches de K3 avec environ un sixième des paramètres actifs — résiste-t-elle au fait que Kimi K3 existe déjà, a déjà publié ses poids, et est déjà le modèle à battre ?
L'adversaire, en entier
Kimi K3 n'est pas un modèle de niche, et c'est précisément pour cela qu'il constitue le bon étalon. C'est le modèle phare de Moonshot : 2,8 T de paramètres au total, dont 104 B actifs sous une architecture Stable LatentMoE, un contexte d'un million de jetons avec un budget de sortie à la hauteur, une compréhension native du texte, des images et des vidéos, un raisonnement toujours actif, et des poids ouverts que toute personne disposant d'assez de matériel peut réellement exécuter. Sa position indépendante est solide — l'indice d'intelligence de 57 (Artificial Analysis) surpasse tous les autres modèles à poids ouverts, et il a enregistré 1 679 Elo sur le Frontend Code Arena, devant Claude Fable 5 et GPT-5.6 Sol — tandis que son prix, 3,00 $ par million de jetons en entrée et 15,00 $ par million en sortie, avec 0,30 $ pour l'entrée en cache, se situe dans le haut de la gamme des poids ouverts. Kimi K3 est ce à quoi ressemble « frontière et ouvert » lorsque le fournisseur ne fait aucun compromis sur l'échelle : il coûte plus cher par jeton en sortie que des rivaux fermés comme GPT-5.6 Sol, il est coûteux à servir, et il est très difficile de contester ses résultats dans les classements.
L'arithmétique du challenger
Nex-N2.5 Pro ne cherche pas à surpasser Kimi K3 en termes d’échelle, mais en termes de service rendu. Nex-AGI a post-entraîné le niveau Pro à partir d’une base issue de la lignée Qwen3.5 pour en faire un agent natif de la vision, capable d’utiliser des ordinateurs et des navigateurs. Son argument, c’est l’efficacité : 397B au total / ~17B actifs, un contexte de 262K, et un déploiement sur un nœud unique de 8×H100 — face au 2,8T / 104B actifs de K3 et au parc de serveurs qu’exige un modèle de cette taille. La thèse implicite est qu’un spécialiste à 17B actifs, entraîné spécifiquement pour la boucle d’agent à retour visuel, peut fournir l’essentiel des performances agentiques d’un généraliste à 104B actifs, pour une fraction du coût de service. Sur la propre fiche de Nex-AGI, l’affirmation est plausible mais partielle : Pro bat ou égale K3 sur OSWorld-G (87,4 contre 79,6) et OmniDoc (92,2 contre 91,1), et perd les autres lignes communes par un écart à un chiffre — un modèle de 397B qui perd face à un modèle de 2,8T de 3 à 6 points en codage et en navigation, c’est, si c’est vrai, exactement l’histoire d’efficacité que Nex veut raconter.
Si c'est vrai. Chacun de ces chiffres est propre à Nex-AGI, produit au moins en partie via son harnais interne NexCUA, et Nex-N2.5 Pro ne peut pas être vérifié indépendamment aujourd'hui, car ses poids ne sont pas téléchargeables — le dépôt Hugging Face contient un README, un dossier de figures et une bannière « weights are coming soon », rien de plus. La même réserve s'applique aux chiffres côté K3 que la fiche affiche, dont la plupart ont été compilés par Nex à partir des rapports publiés par Moonshot plutôt que mesurés par ses soins. Ce que le tableau de Nex-AGI établit n'est pas qui gagne ; c'est que les propres ingénieurs de Nex-AGI, en choisissant les benchmarks et le harnais, n'ont pas pu faire battre Kimi K3 par leur gamme Pro sur la plupart des terrains communs. C'est une donnée plus utile que n'importe quel score isolé, car elle fixe une limite supérieure à l'exagération possible du marketing.

Les lignes qui comptent, côte à côte
• Échelle — Nex-N2.5 Pro : 397B au total / ~17B actifs, multimodal de la lignée Qwen3.5. Kimi K3 : 2,8T au total / 104B actifs, Stable LatentMoE, multimodal.
• Poids — Nex-N2.5 Pro : promis, non livré (« bientôt disponible » sur la carte). Kimi K3 : publié le 27 juillet sous licence MIT modifiée — téléchargeable dès aujourd'hui.
• Contexte — Nex-N2.5 Pro : 262K. Kimi K3 : 1M tokens, à prix fixe.
• Prix — Nex-N2.5 Pro : pas encore de grille tarifaire ; aperçu hébergé gratuit. Kimi K3 : $3.00 / $15.00 par million, entrée en cache $0.30.
• Classement indépendant — Nex-N2.5 Pro : aucun pour l'instant. Kimi K3 : AA Intelligence Index 57, meilleur modèle open-weight du classement.
• Codage (cartes fournisseurs) — Nex-N2.5 Pro : Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2. Kimi K3 : 88.3 et 63.3 sur les mêmes lignes.
• GUI / utilisation de l'ordinateur — Nex-N2.5 Pro : OSWorld-G 87,4 (bat K3 sur sa propre carte), OSWorld-2 56,4. Kimi K3 : OSWorld-G 79,6, OSWorld-2 58,3 (compilé par Nex).
• Empreinte de l'auto-hébergement — Nex-N2.5 Pro : recette sur nœud unique 8×H100 une fois les poids publiés. Kimi K3 : 2.8T — une flotte de serveurs, pas un nœud unique.
Ce que « open » signifie différemment dans chaque colonne
Le mot « open » ne fait pas du tout le même travail des deux côtés, et c'est lui qui décide de cette confrontation plus que n'importe quel benchmark. Kimi K3 est open au sens qui compte sur le plan opérationnel : les poids sont disponibles sur le hub sous une licence MIT modifiée, plutôt permissive ; les traces de raisonnement sont exposées dans l'API de streaming ; une entreprise soumise à des contraintes de gouvernance des données peut l'exécuter sur du matériel qu'elle contrôle et auditer ce que le modèle pensait. Il est open d'une manière qui a un coût — un modèle à 2,8 T de paramètres exige une infrastructure conséquente — mais l'option existe dès aujourd'hui. Nex-N2.5 Pro est open au sens de l'intention : Nex-AGI affirme que les poids de la famille seront publiés en open source, et le plus petit membre de cette famille, Nex-N2.5 Mini, est, lui, bel et bien sorti avec des poids sous licence Apache-2.0 dès le jour du lancement. Les poids de Pro, en revanche, ne sont pas encore sortis ; la licence, annoncée sur la fiche du modèle, ne s'applique encore à rien de téléchargeable, et tant qu'aucun checkpoint n'existe, « open » relève davantage de la feuille de route que d'une propriété du modèle. Pour une équipe qui doit choisir entre les deux, ce n'est pas une simple note de bas de page — c'est la différence entre un modèle que vous pouvez posséder dès ce mois-ci et un modèle qui ne vous est que promis.
Évaluer sans attendre un bouton de téléchargement
Vous n'avez pas à verrouiller cette décision jusqu'à ce que les poids de Nex-N2.5 Pro soient publiés, et c'est au niveau de la couche de routage que l'expérience se joue à moindre coût. Kimi K3 est sur OrcaRouter au prix catalogue de Moonshot — 3,00 $ / 15,00 $, marge de 0 %, prix répercuté et mis à jour le jour même où Moonshot le change — si bien que le leader des modèles à poids ouverts est à une seule touche, à côté des plus de 200 autres modèles du catalogue. Nex-N2.5 Pro n'est pas distribué par nos soins ; l'essayer aujourd'hui implique donc la préversion hébergée par Nex-AGI, puis plus tard votre propre pile de huit H100. Le schéma qui convient : confier les travaux à long contexte et à forte exigence d'audit à Kimi K3 via le point de terminaison unique que vous utilisez déjà, pointer une branche de test vers la préversion de Nex-N2.5 Pro, et laisser le basculement automatique contourner celui des deux qui se dégrade — c'est exactement ainsi que l'on compare un modèle de pointe déjà disponible à un challenger dont les poids sont encore attendus, sans engager votre environnement de production en faveur de l'un ou de l'autre. Quand les poids de Pro seront enfin publiés, la vérification est simple : exécuter les lignes partagées qu'un laboratoire indépendant peut reproduire et voir si l'histoire d'efficacité des 17B actifs survit en dehors du harnais de Nex-AGI.


Où se situe l'affiche
Face au plus grand modèle open-weights jamais commercialisé, Nex-N2.5 Pro n'a pas besoin de gagner la guerre des généralistes pour mériter l'attention : il doit gagner l'argument du coût d'inférence, et sa propre fiche suggère que cet argument est réel, mais non prouvé. Kimi K3 est aujourd'hui le choix sûr et réellement solide : poids ouverts, en tête de l'indice open-weights, un contexte d'un million de tokens, et un coût que l'on peut budgéter — au prix d'une infrastructure qui ne se complique qu'à mesure que le modèle grandit. Nex-N2.5 Pro est le pari de l'efficacité : des scores agentiques proches de K3 avec un sixième des paramètres actifs sur un seul nœud, selon le tableau d'un fournisseur à propos d'un modèle qui n'a pas encore été lancé. Choisissez Kimi K3 lorsque vous voulez le modèle de frontière que vous pouvez vraiment posséder et auditer dès aujourd'hui. Surveillez Nex-N2.5 Pro, jusqu'au jour où ses poids seront publiés et où un tiers indépendant fera tourner les mêmes benchmarks — car si un agent à 17B actifs reste bien à quelques points d'un vaisseau amiral à 104B actifs sur l'utilisation d'ordinateur, alors c'est ce résultat qui changera la donne du coût d'inférence pour tous les agents open qui suivront.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
