
Nex-N2.5 Pro vs Claude Opus 5 : Nex-AGI a choisi l'étalon, et l'étalon a gagné
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0455Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0247Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0157Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2646Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligence75Code
- obsidianQwen3.8 27B2026-08-1541Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1251Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0547Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligence49Code
Nex-AGI a choisi l'étalon, et l'étalon a gagné. Lorsque l'alliance de modèles ouverts basée à Shanghai a présenté Nex-N2.5 Pro le 8 septembre 2026, le tableau d'utilisation informatique de la fiche du modèle plaçait Claude Opus 5 dans la colonne de comparaison et Nex-N2.5 Pro dans la case du concurrent : 68,3 pour Claude Opus 5 contre 56,4 pour Nex-N2.5 Pro sur OSWorld-2, les deux chiffres étant exactement ceux que Nex-AGI avait imprimés sur sa propre fiche. Les classements indépendants ont depuis élargi plutôt que réduit l'écart — l'instantané OSWorld 2.0 de BenchLM daté du 29 août classe Claude Opus 5 premier parmi les quinze modèles qu'il répertorie, à 70,6. Concéder douze points au leader du classement sur le benchmark que vous avez choisi de publier n'est pas la chorégraphie de lancement habituelle, c'est pourquoi la partie intéressante de Nex-N2.5 Pro contre Claude Opus 5 n'est pas le score. C'est ce que représentent réellement les deux côtés de ce score : un modèle ouvert d'utilisation informatique de 397 milliards de paramètres que personne en dehors de l'alliance n'a encore pu exécuter ou vérifier, et le fleuron fermé d'Anthropic qui domine le benchmark et qui transporte le trafic de production depuis fin juillet.
Le résumé honnête, d'emblée : il ne s'agit pas d'une rivalité entre deux grandeurs mesurées, car un seul camp a été mesuré par quelqu'un d'autre que son créateur. Nex-N2.5 Pro est un modèle à mélange d'experts épars — environ 17 milliards de paramètres actifs sur un total de 397 milliards — post-entraîné à partir de la lignée Qwen3.5, et qui vise directement l'exploitation à long terme d'ordinateurs et de navigateurs avec une boucle de rétroaction visuelle. Il est aujourd'hui proposé via des points de terminaison hébergés gratuitement, liens Nex-AGI inclus dans sa fiche de modèle, tandis que les poids Apache-2.0 sur lesquels la famille est fondée restent marqués « à venir », sans date. Claude Opus 5 est le fer de lance de production d'Anthropic pour les travaux exigeants de raisonnement, de codage et d'agentique — un modèle fermé doté d'un contexte d'un million de jetons, d'un cadran de pensée adaptative, d'un prix documenté, et fort de semaines d'entrées aux classements publics et de trafic de production derrière lui. Tous les avantages de ce face-à-face tiennent à l'un de ces deux faits : un modèle est exécutable et vérifiable, et l'autre n'est ni l'un ni l'autre.
Le critère de référence sur lequel les deux parties s'accordent
Les benchmarks d’utilisation d’ordinateur récompensent le même comportement que ces modèles sont conçus pour vendre : un agent qui regarde un écran, décide d’une action, l’exécute, puis lit l’écran modifié pour vérifier si l’action a fonctionné. Nex-N2.5 Pro est architecturé autour de cette boucle exactement — la vision n’y est pas une modalité d’entrée greffée, c’est le canal de retour sur lequel l’agent s’appuie pour vérifier. Claude Opus 5 traite cette même boucle comme une charge de travail parmi beaucoup d’autres, mais il se trouve qu’il y excelle, et c’est précisément pourquoi Nex-AGI l’a utilisé comme point de référence en premier lieu.
Les deux chiffres ne proviennent pas, à strictement parler, du même harnais. Nex-AGI a produit ses chiffres OSWorld-2 via son propre harnais d'évaluation NexCUA, qu'elle affirme vouloir rendre open source mais qu'elle n'a pas encore publié, et le 56,4 pour Nex-N2.5 Pro est un chiffre du fournisseur non reproduit. Le 70,6 de Claude Opus 5 sur BenchLM est un relevé tiers d'OSWorld 2.0, daté du 29 août 2026, et il concorde avec le 68,3 que Nex-AGI cite elle-même à partir des sources du leaderboard. Des harnais différents et des versions de benchmark légèrement différentes font que l'écart exact — douze points sur la propre fiche de Nex-AGI, plus près de quatorze sur BenchLM — doit être lu comme une indication de tendance. Mais il n'est pas contesté que Nex-N2.5 Pro, selon les meilleurs chiffres disponibles d'un côté comme de l'autre, se situe en dessous de l'agent de pointe actuel pour l'utilisation d'ordinateur.

Deux réponses à « puis-je l'exécuter aujourd'hui »

Voici la bifurcation qui décide réellement de la comparaison pour une équipe opérationnelle, et elle ne joue pas en faveur du nouveau venu. La fiche Hugging Face de Nex-N2.5 Pro arbore toujours une bannière annonçant que les poids seront bientôt disponibles sous licence Apache-2.0, sans date de sortie associée. Les seules versions réellement accessibles sont les endpoints hébergés gratuits vers lesquels Nex-AGI renvoie depuis la fiche — interrogeables, certes, mais propriété d’un tiers, sans prix catalogue, sans conditions de service sur lesquelles une équipe puisse fonder sa planification et sans aucun moyen de reproduire un seul résultat de benchmark sur votre propre matériel. Quand les poids finiront par arriver, la recette de déploiement documentée se résume à un nœud unique équipé de huit H100 sous une image SGLang personnalisée — une empreinte réelle, mais classique pour un MoE de 397B, et c’est exactement ce qui rend intéressante la conception à 17B actifs. En attendant, Nex-N2.5 Pro est une préversion que l’on peut interroger, pas un modèle sur lequel bâtir.
Claude Opus 5 est exactement l'opposé sur chacune de ces lignes. Il est disponible via l’API d’Anthropic et sur des plateformes de routage depuis le 24 juillet, son prix est public et stable, ses poids sont fermés et le resteront, et chacun de ses chiffres peut être vérifié aujourd’hui en l’exécutant. L’écosystème qui l’entoure — Claude Code, les outils MCP et l’essaim d’agents de production qui le martèlent depuis six semaines — est précisément le bilan accumulé qu’un modèle vieux d’un jour ne peut pas revendiquer. Pour une équipe dont l’exigence est que « le modèle doit fonctionner au trimestre prochain », ce bilan est tout ce qui compte.
La fiche technique, telle quelle.
Mettez les deux enveloppes côte à côte :
• Publié — Nex-N2.5 Pro : 8 septembre 2026 (endpoints hébergés opérationnels, poids en attente). Claude Opus 5 : 24 juillet 2026, disponibilité générale.
• Échelle — Nex-N2.5 Pro : 397B au total / ~17B actifs (MoE). Claude Opus 5 : nombre de paramètres non divulgué.
• Modalité — Nex-N2.5 Pro : texte et image en entrée, texte en sortie, la vision occupant une place centrale dans sa boucle d'utilisation d'ordinateur. Claude Opus 5 : texte et image en entrée, texte en sortie, avec une solide capacité d'analyse visuelle.
• Contexte / sortie — Nex-N2.5 Pro : contexte de 262 144 tokens, longueur de service documentée. Claude Opus 5 : contexte de 1 M de tokens, plafond de sortie de 128 K tokens.
• Contrôle du raisonnement — Nex-N2.5 Pro : un commutateur reasoning_effort avec none / medium (adaptatif, par défaut) / high. Claude Opus 5 : pensée adaptative par défaut avec un réglage explicite d’effort de faible à maximum.
• Poids — Nex-N2.5 Pro : Apache-2.0, bientôt disponible, sans date. Claude Opus 5 : fermé.
• Prix par million de jetons — Nex-N2.5 Pro : offre hébergée gratuite, aucun prix catalogue publié. Claude Opus 5 : $5.00 en entrée / $25.00 en sortie, $0.50 pour les lectures en cache, $6.25 pour les écritures en cache.
Les capacités sont suffisamment différentes pour que la fiche technique fasse un vrai travail de distinction : Opus 5 apporte une fenêtre d'un million de jetons et un plafond de sortie de 128K aux longues sessions d'agent, tandis que le contexte de 262K de Nex-N2.5 Pro et son offre gratuite conviennent mieux à l'automatisation à plus petite échelle pilotée par écran. Aucune de ces spécifications ne rend l'autre redondante ; les modèles divergent sur ce qu'un agent doit faire de son contexte.
Lire honnêtement le tableau des scores de Nex-AGI
Le reste de la fiche mérite d'être lu avec le même filtre. Les autres lignes d'utilisation d'ordinateur du Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — ainsi que ses lignes de codage — Terminal-Bench 2.1 à 82.7, SWE-Bench Pro à 61.2, BrowseComp à 89.7 — sont toutes des mesures du fournisseur obtenues via le harnais de l'alliance, non reproduites au cours des 48 premières heures. La seule conclusion qu'un lecteur neutre peut tirer de la fiche est que Nex-AGI considère le Nex-N2.5 Pro comme un modèle solide d'utilisation d'ordinateur de milieu de gamme, qui reste derrière l'agent de pointe sur la ligne qui compte le plus. C'est un positionnement cohérent, voire prudent, pour un modèle ouvert de 397B. C'est aussi une affirmation qui attend un second laboratoire.
L'argent, quand un côté n'a pas de prix.
Il n'y a pas de comparaison de prix honnête à faire ici, car un seul côté a un prix. L'offre gratuite hébergée de Nex-N2.5 Pro ne vous apprend rien sur la valeur du modèle — les points de terminaison d'aperçu gratuits sont la façon dont les fournisseurs collectent du trafic et des retours, et Nex-AGI n'a publié aucun tarif payant par jeton pour la famille. Claude Opus 5 coûte 5,00 $ par million de jetons d'entrée et 25,00 $ par million de jetons de sortie au prix catalogue d'Anthropic, avec des lectures de cache à 0,50 $, et c'est ce montant qu'un budget doit absorber. Si vous payez cette facture aujourd'hui pour des agents d'utilisation d'ordinateur et que vous voulez savoir si un modèle ouvert à 17B de paramètres actifs pourrait faire le même travail à moindre coût, la réponse est : peut-être, mais vous ne pouvez le savoir qu'à la publication des poids et à l'exécution par un tiers indépendant. La comparaison de prix est reportée, pas tranchée, et traiter un point de terminaison gratuit comme une preuve de faible coût serait une erreur de catégorie.

Ce que vous pouvez faire dès aujourd'hui, c'est mettre en place le test A/B pour le jour où cela deviendra possible. Claude Opus 5 est sur OrcaRouter au prix catalogue d'Anthropic — soit les mêmes 5,00 $ / 25,00 $, répercutés sans marge, de sorte qu'une facture ici correspond à celle d'Anthropic et évolue le jour où celle d'Anthropic évolue. Une seule clé API le place derrière le même endpoint que 200+ autres modèles, avec bascule automatique en cas de défaillance d'un fournisseur et le DSL de routage si vous voulez Opus pour les appels difficiles et un modèle moins cher pour les appels courants. Nex-N2.5 Pro n'est pas sur OrcaRouter — nous avons vérifié notre répertoire de modèles avant d'écrire, et aucun modèle nex-agi n'y est encore répertorié. Le jour où un fournisseur le proposera au prix catalogue, il apparaîtra ici le même jour, et la comparaison honnête que cet article ne peut pas encore effectuer deviendra une règle de routage plutôt qu'une migration.
Qui devrait agir, et qui devrait attendre
Si votre équipe fait tourner aujourd'hui des charges de travail de production en computer-use ou en codage agentique et a besoin d'un modèle au prix connu, au profil de défaillance connu et à l'historique indépendant, Claude Opus 5 est le choix rationnel dans ce face-à-face, et rien dans les 48 premières heures de Nex-N2.5 Pro ne change cela. Si votre équipe évalue des modèles ouverts de computer-use pour une future implémentation, Nex-N2.5 Pro mérite une place sur la liste de surveillance : un MoE multimodal de 397B, avec une empreinte d'auto-hébergement raisonnable et un profil de benchmarks de milieu de gamme crédible, est exactement le type de modèle ouvert qui redessine une courbe de coûts — à condition que les poids arrivent réellement et que les chiffres de la fiche technique résistent à une évaluation indépendante. La position rationnelle est les deux à la fois : garder le leader éprouvé sur le chemin critique, et laisser au jour où les poids arriveront le soin de décider si le nouveau venu mérite un essai. C'est la seule comparaison de ce face-à-face qui n'a pas encore eu lieu — et c'est celle qui comptera réellement.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
