Hero « Nex-N2.5 Pro vs GPT-5.6 Sol » — une carte-titre générée affichant « Nex-N2.5 Pro vs GPT-5.6 Sol », avec pour sous-titre « Un modèle ouvert d’un jour face au record de production le plus profond du secteur » et pour surtitre « OpenAI vs Nex-AGI — septembre 2026 ».
Guides & Insights

Nex-N2.5 Pro vs GPT-5.6 Sol : le numéro du fabricant du nouveau venu est à la traîne de celui, indépendant, du titulaire.

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Prenez le seul benchmark où les deux ont un chiffre et mettez-les côte à côte : l'ordre est mauvais pour un lancement. La fiche produit de Nex-AGI donne au Nex-N2.5 Pro un score de 56,4 sur OSWorld-2, mesuré sur le harnais NexCUA maison de l'alliance, que le public n'a pas vu. Le classement OSWorld 2.0 de BenchLM, mis à jour le 29 août, place GPT-5.6 Sol à 62,6 — un chiffre indépendant qui bat sans appel le chiffre annoncé par le fabricant du nouveau venu. Sur le terrain de prédilection du modèle vieux d'un jour — l'utilisation d'ordinateur par lecture d'écran, la seule chose pour laquelle il a été conçu — le généraliste mature auquel on le compare n'a même pas besoin d'un astérisque pour l'emporter. Le duel Nex-N2.5 Pro / GPT-5.6 Sol n'est pas serré sur la moindre dimension mesurée par quelqu'un d'autre que le fabricant du nouveau venu. C'est une étude de cas sur ce que vaut un bilan en conditions réelles, et elle vaut la peine d'être lue pour cette seule raison.

Les deux modèles ne sont guère rivaux dans leur intention. Nex-N2.5 Pro, annoncé le 8 septembre 2026, est un modèle sparse mixture-of-experts de 397 milliards de paramètres, dont environ 17 milliards de paramètres actifs, multimodal (texte et image en entrée, texte en sortie), post-entraîné à partir de la lignée Qwen3.5, et conçu pour piloter des ordinateurs et des navigateurs via une boucle de rétroaction visuelle. Ses poids sous licence Apache-2.0 sont toujours marqués « bientôt disponibles » sur Hugging Face, et ses seules versions opérationnelles sont des endpoints hébergés gratuitement que Nex-AGI référence depuis sa fiche modèle. GPT-5.6 Sol est le modèle phare d'OpenAI pour « le travail le plus difficile » — raisonnement profond multi-étapes, ingénierie logicielle à grande échelle et flux de travail agentiques à long horizon — dans l'API depuis le 9 juillet, à poids fermés, et porte désormais le poids d'avoir été la référence de pointe jusqu'à ce qu'OpenAI lance GPT-6 Astra le 3 septembre. Là où Nex-N2.5 Pro est un spécialiste qui n'a pas encore publié ses propres poids, GPT-5.6 Sol est un généraliste éprouvé qui alimente depuis deux mois le trafic de production le plus exigeant de l'industrie.

GPT-5.6 Sol est le modèle avec un fichier.

Commencez par ce que Sol possède et que Nex-N2.5 Pro n’a pas : un historique. Depuis le 9 juillet, GPT-5.6 Sol a été testé sur des bancs d’essai indépendants, soumis à des assauts de la part de chercheurs en sécurité, et intégré à des frameworks d’agents et à des flux de travail Codex. Ses mesures indépendantes sont approfondies et publiques : 61 sur l’Artificial Analysis Intelligence Index en raisonnement maximal, 88,0 sur Terminal-Bench 2.1 et 73,0 sur DeepSWE, mesurés par le même banc d’essai indépendant, ainsi qu’une vitesse de sortie mesurée d’environ 71 tokens par seconde, pour un coût d’environ 0,95 $ par tâche de l’Intelligence Index. Rien de tout cela ne le rend imbattable — OpenAI a depuis positionné GPT-6 Astra au-dessus — mais chacun de ces chiffres est une mesure produite par quelqu’un d’autre qu’OpenAI. Nex-N2.5 Pro n’a aucune entrée indépendante où que ce soit, pour une raison structurelle : personne en dehors de l’alliance ne peut l’exécuter.

Le seul benchmark où les deux ont un nombre.

La comparaison OSWorld est la lecture la plus nette disponible ; elle mérite donc que ses réserves soient énoncées avant de l'utiliser. Le score de 56.4 de Nex-N2.5 Pro est la propre mesure de Nex-AGI sur OSWorld-2 via son harnais NexCUA. Le score de 62.6 de GPT-5.6 Sol provient du classement OSWorld 2.0 de BenchLM, un instantané tiers daté du 29 août 2026, qui répertorie quinze modèles et place Claude Opus 5 premier à 70.6, GPT-5.6 Sol deuxième à 62.6 et GPT-5.6 Terra troisième à 50.2. « OSWorld-2 » et « OSWorld 2.0 » sont étroitement apparentés, mais il n'est pas prouvé qu'ils soient identiques ; l'écart exact de quatre à six points doit donc être lu comme une indication de direction plutôt que comme une valeur précise. Ce qui survit aux réserves, c'est l'ordre : selon le meilleur chiffre que chaque camp peut produire, un score indépendant pour Sol bat un score du fournisseur pour Nex sur le benchmark que Nex a choisi de publier. Un nouvel entrant dont le score est inférieur au score indépendant du titulaire n'a pas présenté d'argument convaincant pour justifier un changement.

A two-column scoreboard titled 'Nex-N2.5 Pro vs GPT-5.6 Sol — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Weights Apache-2.0 pending; OSWorld 2.0 56.4 vendor-reported; AA Index no score yet; Context 262,144; Price free hosted / no list. Right column GPT-5.6 Sol: Released Jul 9 2026; Weights closed; OSWorld 2.0 62.6 independent; AA Index 61 (max); Context ~1.05M; Price $4.00 / $20.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Sol OSWorld per BenchLM Aug 29 and Index per Artificial Analysis.'

Spec envelopes

Le reste de la fiche technique va dans le même sens :

Publié — Nex-N2.5 Pro : 8 septembre 2026 (endpoints hébergés en ligne, poids en attente). GPT-5.6 Sol : 9 juillet 2026, généralement disponible.

Échelle — Nex-N2.5 Pro : 397B au total / ~17B actifs (MoE). GPT-5.6 Sol : nombre de paramètres non divulgué.

Modalité — Nex-N2.5 Pro : texte et image en entrée, texte en sortie, boucle de vision pour utilisation d'ordinateur. GPT-5.6 Sol : texte, image et fichier en entrée, texte en sortie, avec appel d'outils et mode JSON.

Contexte / sortie — Nex-N2.5 Pro : contexte de 262 144 jetons. GPT-5.6 Sol : contexte d’environ 1,05 M de jetons, plafond de sortie de 128 000 jetons.

Contrôle du raisonnement — Nex-N2.5 Pro : aucun / moyen (adaptatif, par défaut) / élevé. GPT-5.6 Sol : effort de raisonnement jusqu’au maximum, plus un niveau de traitement rapide distinct.

Poids — Nex-N2.5 Pro : Apache-2.0, bientôt disponible. GPT-5.6 Sol : fermé.

Prix par 1M de tokens — Nex-N2.5 Pro : offre hébergée gratuite, sans prix catalogue. GPT-5.6 Sol : $4.00 / $20.00 (prix catalogue promotionnel depuis le 21 août), $0.40 pour l’entrée en cache, passage à $8.00 / $30.00 au-delà de 272K tokens d’entrée.

La fenêtre de contexte d’environ 1,05 M de jetons de Sol et son plafond de sortie de 128 K éclipsent la fenêtre de 262 K de Nex-N2.5 Pro pour les travaux à long horizon, et le prix de Sol, bien que loin d’être bon marché, est un chiffre arrêté qu’un budget peut modéliser. Le niveau gratuit de Nex-N2.5 Pro est le seul chiffre en sa faveur, et ce n’est pas un prix.

Ce que vaut un score vieux d'un jour

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Chaque affirmation de benchmark associée à Nex-N2.5 Pro — OSWorld-2 à 56.4, Terminal-Bench 2.1 à 82.7, SWE-Bench Pro à 61.2, BrowseComp à 89.7 — partage une même propriété : c'est Nex-AGI qui l'a produite, via un harnais que l'alliance promet de rendre open source mais n'a pas encore publié. Aucun de ces chiffres n'a été reproduit de manière indépendante, et aucun ne peut l'être : les poids ne sont pas téléchargeables, et aucune date n'est accolée à la bannière « coming soon ». C'est un point qui compte davantage dans cette confrontation que dans la plupart des autres, car le modèle auquel Nex-N2.5 Pro est comparé possède le plus long palmarès indépendant de l'industrie. Lorsque l'ensemble des preuves du challenger est autodéclaré et que celui de l'acteur établi ne l'est pas, la charge de la preuve incombe entièrement au challenger, et un endpoint gratuit ne l'en décharge pas. Dès que les shards arrivent et qu'un laboratoire indépendant fait tourner Nex-N2.5 Pro, les chiffres de cet article deviennent vérifiables et la comparaison devient réelle. D'ici là, « score vieux d'un jour » est l'expression exacte — un score qui ne peut être inspecté sur un modèle qui ne peut pas être exécuté.

Le prix, l’itinéraire et la forme de la décision.

C'est sur le coût que la comparaison est la plus difficile entre les deux offres, car une seule des deux a un prix. Le tarif de 4,00 $ / 20,00 $ de GPT-5.6 Sol est le prix catalogue promotionnel d'OpenAI, en vigueur depuis le 21 août et annoncé pour durer au moins jusqu'au 21 novembre, contre 5,00 $ / 30,00 $ auparavant — une baisse qui a rendu le modèle phare nettement plus abordable pour les travaux agentiques à grand volume, et qu'un routeur en mode pass-through répercute le jour même où OpenAI la met en œuvre. Sol est sur OrcaRouter à ce prix catalogue, sans marge ; les niveaux batch et rapide y sont accessibles avec la même clé API que 200+ autres modèles, si bien qu'une équipe peut router vers Sol les requêtes qui nécessitent la profondeur d'OpenAI, et tout le reste vers des modèles moins chers. Nex-N2.5 Pro n'a pas de prix catalogue ; il n'offre que ses endpoints hébergés gratuits, ce qui est une bonne façon d'évaluer un modèle, mais une mauvaise base pour un budget de production. On ne peut ni planifier une dépense autour d'un chiffre qui n'existe pas, ni planifier une architecture autour de poids qui n'ont pas été publiés.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), marked FEATURED, showing the header stats $4.00 input and $20.00 output per million tokens and the byline 'by OpenAI - 2026-07-09'.

La décision que ce face-à-face impose en réalité porte sur le risque, pas sur la capacité. Si vous avez besoin d'un modèle qui sera encore là au prochain trimestre, avec un prix connu, un profil de défaillance connu et des mois de tests contradictoires derrière lui, GPT-5.6 Sol est le choix rationnel — et le lancement par OpenAI de GPT-6 Astra juste au-dessus ne fait que renforcer cette conclusion, car Sol est désormais le cheval de bataille éprouvé, avec une baisse de prix qui vise précisément le volume de production. Si vous construisez des agents d'utilisation d'ordinateur sur des poids ouverts et que vous pouvez vous permettre d'attendre quelque chose de vérifiable, Nex-N2.5 Pro vaut la peine d'être surveillé — un spécialiste multimodal à 17 milliards de paramètres actifs est exactement le type de modèle qui a maintes fois cassé les prix de la frontière fermée. Mais « surveiller » est le mot clé. Sur toutes les dimensions mesurées par quelqu'un d'autre que son fabricant, Nex-N2.5 Pro reste à la traîne du modèle qui détient le fichier, et tant que les poids ne sont pas publiés, la comparaison s'arrête là.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube