Une carte de titre principale pour 'Nex-N2.5 Mini' avec le sous-titre 'Poids ouverts dès le lancement - le petit agent d'utilisation de l'ordinateur', des pastilles 'APACHE-2.0', '35B AU TOTAL / ~3B ACTIFS' et '262K CONTEXTE', et un ruban 'ENTRÉE IMAGE + TEXTE - RÉFÉRENCE 2x H100', avec le logo OrcaRouter incrusté en bas à droite.
Guides & Insights

Nex-N2.5 Mini : les poids ouverts disponibles dès le lancement — l'agent d'utilisation d'ordinateur le plus compact de Nex-AGI est la porte d'entrée

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le moyen de savoir si les agents ouverts d’utilisation d’ordinateur sont prêts est désormais un modèle que l’on peut télécharger le jour même de son annonce. Nex-AGI a présenté sa famille Nex-N2.5 le 8 septembre 2026 — trois niveaux agentiques, Nex-N2.5 Mini, Nex-N2.5 Pro et Nex-N2.5 Max — et le niveau qui se télécharge et s’exécute directement est le plus petit. Nex-N2.5 Mini, dont les poids Apache-2.0 sont en ligne sur Hugging Face en seize fragments BF16, compte environ 35 milliards de paramètres, avec ~3 milliards actifs par jeton selon les annonces, et propose un déploiement de référence sur deux H100. Son homologue multimodal plus grand, Nex-N2.5 Pro, est toujours marqué « bientôt disponible » au moment de la rédaction, tandis que Nex-N2.5 Max, exclusivement textuel et fort de 1,6 billion de paramètres, est également en ligne mais exige seize H200 répartis sur deux nœuds avant de pouvoir fonctionner. Pour quiconque teste la thèse derrière cette famille — à savoir que des modèles agentiques ouverts peuvent tenir la route dans une utilisation prolongée d’un ordinateur, plutôt que de se contenter de répondre à des questions — la Mini est le point d’entrée.

Qui est Nex-AGI ? Le nom est nouveau, et le lancement a tout d’une première sortie publique. La couverture de l’annonce décrit l’initiative comme une collaboration entre plusieurs organisations de Shanghai — Shanghai Innovation Institute, Shanghai Qiji Zhifeng, Mosi Intelligence et Kuafu Technology — la famille étant positionnée comme open source et l’équipe opérant sous le compte @NexEcosystem. Selon la fiche du modèle, Nex-N2.5-mini et Nex-N2.5-Pro s’inscrivent dans la continuité des « fondations multimodales de Nex-N2 », la version précédente de Nex dont les poids sont déjà ouverts. Ce qui est véritablement nouveau ici, c’est le cadrage : Nex-AGI affirme avoir construit ces modèles pour des tâches à long horizon dans des environnements réels — utiliser un ordinateur, piloter un navigateur, exécuter et tester du code, et corriger le cap en fonction de ce qu’il voit à l’écran — et elle a publié les poids pour rendre cette affirmation vérifiable.

Trois niveaux, une annonce

La famille se divise par échelle et par modalité, et les différences comptent plus que le nom partagé :

• Nex-N2.5 Mini — environ 35B au total / ~3B actifs, un modèle multimodal acceptant des images et du texte, destiné à l’utilisation visuelle d’ordinateur, à la navigation et aux tâches nécessitant un retour d’interface. Le déploiement de référence est un nœud unique équipé de deux H100.

• Nex-N2.5 Pro — annoncé à 397B au total / ~17B actifs, également multimodal, pour des charges de travail plus lourdes d’utilisation d’ordinateur. Le déploiement de référence est de huit H100. Ses poids n’étaient pas téléchargeables au lancement.

• Nex-N2.5 Max — 1,6 T au total / ~49 B actifs, texte uniquement, et selon Nex-AGI, son « premier effort complet de post-entraînement à l’échelle du mille milliards de paramètres ». La fiche indique qu’il est construit sur une base DeepSeek-V4-Pro-Base. Le déploiement de référence est de 16×H200 sur deux nœuds.

Les trois sont des modèles à mélange d'experts. Les Mini et Pro s'appuient sur la famille de modèles Qwen3.5 — les documents de lancement de Nex-AGI décrivent les deux comme post-entraînés à partir de variantes Qwen3.5, et la propre configuration de la Mini porte une étiquette d'architecture qwen3_5_moe — tandis que Max fait figure d'exception avec sa base DeepSeek. La famille ne repose donc pas sur une seule recette déclinée en trois tailles, mais sur deux recettes : les niveaux multimodaux «faire des choses à l'écran» partagent une même lignée, et le géant du raisonnement textuel relève d'une autre.

Ce qu'est réellement le Nex-N2.5 Mini qui a été expédié

Le dépôt Hugging Face pour nex-agi/Nex-N2.5-mini est un véritable checkpoint téléchargeable, pas un espace réservé — 16 shards safetensors pour environ 70 Go au total, BF16, licence Apache-2.0, créé pour la première fois le 8 septembre. Le fichier de configuration est suffisamment précis pour concevoir en conséquence :

• Architecture — Qwen3_5MoeForConditionalGeneration, la famille qwen3_5_moe, avec une pile de vision : la fiche le catégorise comme image-text-to-text, et le dépôt fournit preprocessor_config.json en plus de la configuration texte.

• Configuration — 40 couches, dimension cachée de 2048, attention à requêtes groupées avec 16 têtes de requête et 2 têtes KV, vocabulaire de 248 320.

• MoE — 256 experts routés avec 8 actifs par jeton plus un expert partagé, taille intermédiaire 512 — le profil à activation éparse qui permet de faire tourner un modèle de classe « 35B » avec ~3B de paramètres actifs sur deux H100.

• Contexte — max_position_embeddings de 262 144 jetons dans la configuration publiée, le même chiffre de 262 K qui apparaît dans les recettes de déploiement de la famille.

• Poids et licence — BF16, Apache-2.0, non restreint ; le dépôt pointe également vers un miroir ModelScope et vers une organisation GitHub (nex-agi) qui contient les recettes de déploiement de la famille.

La documentation de déploiement de Nex-AGI est la partie que la plupart des versions open source ratent, et celle-ci réussit exceptionnellement bien. Le Mini est servi via une image Docker SGLang personnalisée (nexagi/sglang:v0.5.18-nex-patch) sur un nœud unique avec deux H100 utilisant le parallélisme tensoriel 2. L'échantillonnage recommandé est une température de 0,7, top_p de 0,95, top_k de 40. L'appel d'outils passe par le parseur qwen3_coder de SGLang, et le modèle expose trois modes de raisonnement via un champ reasoning_effort — « none » pour la non-pensée, « medium » (le défaut adaptatif) et « high » pour la pensée toujours active. Pour un petit modèle agentique, ce contrôle du mode de pensée fait la différence entre une boucle d'agent utilisable et une boucle lente, et il est intégré dans la recette de service plutôt que laissé à l'utilisateur.

A single-column scoreboard titled 'Nex-N2.5 Mini - the scoreboard' with rows 'Params: 35B total / ~3B active (vendor-reported)', 'Architecture: qwen3_5_moe MoE - 256 experts / 8 active', 'Context: 262,144 tokens', 'Input: image + text', 'License: Apache-2.0 - BF16 weights live' and 'OSWorld-Verified: 71.2 (vendor-reported)', with a footer 'Specs from the HF config; benchmarks are Nex-AGI-reported, no independent run yet.'

Poids : ce qui est réellement téléchargeable

L’état des trois niveaux au jour du lancement mérite d’être précisé, car l’annonce et les dépôts ne cadrent pas tout à fait. Au moment où j’écris ceci, le modèle Mini est entièrement téléchargeable sous licence Apache-2.0 — c’est sur lui que se base cet article. Nex-N2.5 Max est également disponible ; son dépôt Hugging Face contient 644 fragments safetensors, bien que reproduire sa configuration à un billion de paramètres soit un projet 16×H200. Nex-N2.5 Pro est le seul qui manque à l’appel : son dépôt Hugging Face existe, mais il ne contient que le README et des figures, aucun fragment de modèle, et la fiche indique toujours que les poids vont arriver. Si le niveau qui vous intéresse est le grand modèle multimodal, c’est le retard à surveiller — les documents de lancement décrivent Pro comme le modèle le plus puissant de la famille pour l’utilisation d’ordinateur, et c’est celui que vous ne pouvez pas encore exécuter localement.

A screenshot of the Hugging Face repository page for nex-agi/Nex-N2.5-mini (captured September 9, 2026), showing the model header with Text Generation / Transformers / Safetensors / qwen3_5_moe / image-text-to-text / conversational tags and 'License: apache-2.0', and the Files & versions tree for the main branch listing config.json, README.md, chat_template.jinja and the figures directory.

Les chiffres que Nex-AGI a rapportés — et la réserve qui les accompagne

La fiche modèle de Nex-AGI comprend un tableau de benchmark complet pour le Mini, et chaque chiffre qui y figure provient des propres rapports du fournisseur. Aucune exécution indépendante n’avait été publiée au moment de la rédaction, et la fiche précise que les scores proviennent des classements officiels des benchmarks et des derniers rapports d’évaluation lorsque disponibles, ainsi que des propres évaluations de Nex-AGI ailleurs. Les résultats de codage ont été produits avec le harnais NexAU de l’équipe ; les résultats d’utilisation de l’ordinateur et du navigateur ont utilisé le harnais NexCUA, qui, selon la fiche, sera open-sourcé. Traitez les lignes principales comme le meilleur cas d’un fournisseur jusqu’à ce qu’une partie neutre les reproduise.

Dans ce cadre, les lignes rapportées pour le Mini sont : côté travail sur le texte et le code, Terminal-Bench 2.1 à 73.4, SWE-Bench Pro à 43.8, DeepSWE v1.1 à 36.1, AutomationBench v1.0.6 à 32.3, Toolathlon Verified à 54.6, BrowseComp à 83.4, et un score GDPval-AA v2 de 1446. Sur le volet multimodal/utilisation de l’ordinateur, les résultats qui attirent l’attention sont OSWorld-Verified à 71.2, WebArena-Verified à 63.4, WebTest à 48.6 (exécuté en mode oracle sur la base de listes de contrôle de vérité terrain), OSWorld-G à 82.9 et OmniDoc à 89.7, ainsi que les résultats plus modestes d’OSWorld-2 (30.5) et de Vision2Web (52.9).

Deux notes de lecture. Premièrement, OSWorld-Verified et OSWorld-2 sont des suites différentes — l'une est un sous-ensemble vérifié, évalué à partir de l'état final de l'environnement, l'autre une exécution plus récente et généralement plus sévère — donc un 71.2 sur l'une et un 30.5 sur l'autre ne sont pas contradictoires ; ce sont des tests différents, et le propre tableau de Nex les conserve dans des colonnes séparées. Deuxièmement, dans chaque ligne du tableau de la famille, le Mini obtient des scores inférieurs à Pro et Max, et le haut de chaque colonne revient à un modèle de pointe établi comme Claude Opus 5 ou GPT-5.6 Sol. L'histoire du Mini n'est pas qu'il bat les modèles de pointe ; c'est qu'un modèle ouvert à ~3B de paramètres actifs rapporte des scores compétitifs sur des benchmarks d'utilisation d'ordinateur avec une empreinte de deux H100. Que cela tienne ou non, c'est précisément la question à laquelle les poids ouverts vous permettent de répondre vous-même.

Test du Nex-N2.5 Mini aujourd'hui

La recette à deux H100 fait du Mini le moyen le moins cher d’expérimenter concrètement l’affirmation centrale de la famille. Comme l’architecture est un Qwen3.5-MoE standard doté d’un analyseur d’appels d’outils qwen3_coder, elle se charge dans le fork SGLang de Nex-AGI sans code d’inférence personnalisé, et les réglages recommandés sont publiés plutôt que de devoir être découverts par rétro-ingénierie. Ce qu’il faut honnêtement attendre avant de commencer, c’est qu’un checkpoint vieux d’un jour avec un harnais de test tout neuf est une expérience, pas une dépendance. Les téléchargements sur le dépôt Mini n’atteignent pas encore la dizaine, et aucun tiers n’avait publié d’évaluation indépendante quand ces lignes ont été écrites — ce qui est l’état normal pour un modèle sorti la veille, et la raison pour laquelle l’empreinte à deux H100 importe : vous pouvez mener l’expérience vous-même cette semaine au lieu d’attendre que quelqu’un d’autre le fasse.

A screenshot of the nex-agi collections page on Hugging Face (captured September 9, 2026), showing the Nex-N2.5 collection 'updated about 7 hours ago' with the three model entries nex-agi/Nex-N2.5-Max (Text Generation, 1.6T), nex-agi/Nex-N2.5-Pro and nex-agi/Nex-N2.5-mini, alongside the earlier Nex-N2, Nex-N1.1 and Nex-N1 collections listed on the left.

Si vous préférez comparer le Mini aux agents de pointe dans son propre tableau de référence plutôt que de régler manuellement un seul déploiement, c'est là qu'une couche de routage montre sa valeur. Lorsqu'un fournisseur hébergé répertorie Nex-N2.5 Mini — et que les acteurs en place auxquels il est comparé sont déjà accessibles via des routeurs — une seule API couvrant plus de 200 modèles, avec les prix catalogue du fournisseur répercutés à 0 % de marge et un basculement automatique, est le moyen économique d'exécuter la même tâche sur plusieurs d'entre eux sans deuxième intégration. Sur OrcaRouter, c'est la configuration standard pour chaque modèle que nous routons : la même clé, le même format d'appel, le prix du vendeur sans aucun ajout. C'est ce qui importe le plus pour un modèle non éprouvé comme celui-ci, car le basculement est ce qui vous permet de l'essayer sur un chemin réel sans miser le chemin sur lui.

Qui devrait tirer ces poids ?

Récupérez-les si votre travail porte sur les agents d'utilisation d'ordinateur, l'automatisation de navigateur ou l'utilisation d'outils guidée par le visuel, et que vous voulez un modèle auto-hébergeable sous licence permissive à comparer aux leaders hébergés. La licence Apache-2.0 élimine les frictions habituelles pour une publication d'un laboratoire chinois, l'empreinte de deux H100 est à la portée d'une équipe sérieuse travaillant sur les agents, et le contrôle de l'effort de raisonnement, accompagné d'un véritable analyseur d'appels d'outils, en fait un banc d'essai crédible plutôt qu'un jouet. Attendez en revanche si vous avez besoin du modèle d'utilisation d'ordinateur le plus puissant de la famille — c'est le rôle de Pro, et ce sont les poids de Pro qui sont encore en attente. Et gardez l'étiquette du fournisseur sur chaque ligne de benchmark jusqu'à ce qu'une exécution indépendante les confirme : un score de 71,2 sur OSWorld-Verified pour un modèle ouvert à ~3B de paramètres actifs est une affirmation frappante, et c'est exactement le genre d'affirmation qui vaut la peine d'être vérifiée dans votre propre infrastructure de test avant de bâtir dessus.

À surveiller ensuite. La publication des poids de Pro est le signal le plus important — elle fait passer la famille de « Mini plus un géant à mille milliards de paramètres » à la gamme complète que décrivent les documents de lancement. La deuxième est l’ouverture en open source du harnais NexCUA, sans laquelle les chiffres d’utilisation d’ordinateur ne peuvent pas être reproduits de manière indépendante selon le même protocole. La troisième est la première exécution neutre, qu’elle vienne d’Artificial Analysis, d’un laboratoire universitaire ou d’un praticien qui publie sa reproduction OSWorld-Verified. Lorsque l’un de ces trois éléments se produira, la question posée par ce lancement — à savoir si les modèles agentiques ouverts ont réellement comblé l’écart avec les solutions hébergées d’utilisation d’ordinateur — cessera d’être une affaire de tableaux des fournisseurs.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement