Titre pour 'GPT-5 Codex vs GPT-5.6 Sol — Le spécialiste du code contre le vaisseau amiral qui l'a avalé' : grand titre bleu marine, ligne de sous-titre, et deux cartes arrondies — GPT-5 Codex (1,25 $ / 10 $ par 1M · spécialiste du code) et GPT-5.6 Sol (5 $ / 30 $ par 1M · généraliste phare) — avec le logo OrcaRouter composé en bas à droite.
Guides & Insights

GPT-5 Codex vs GPT-5.6 Sol : le spécialiste du codage contre le fleuron qui l'a dévoré

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Lorsque O​penAI a lancé la famille G​PT-​5.6 le 9 juillet 2026, l'entreprise a discrètement retiré l'application Codex autonome et intégré le mode agent de codage dans ChatGPT. La page du modèle qu'O​penAI a écrite pour GPT-5.6 Sol ressemblait alors à une description de poste tirée d'un spécialiste du codage — « raisonnement profond en plusieurs étapes, ingénierie logicielle à grande échelle et flux de travail agentiques à long horizon. » Ainsi, le duel entre GPT-5 Codex et GPT-5.6 Sol n'est pas un simple combat de spécifications. C'est le spécialiste qui se demande si le modèle phare, qui vient d'absorber la catégorie de produits qu'il représentait, l'a également rendu redondant.

La réponse courte est non — mais la raison est plus intéressante que « Codex est toujours bon ». GPT-5 Codex reste disponible sur l'API à 1,25 $ par million de jetons d'entrée et 10 $ par million de sortie : un agent d'ingénierie logicielle spécialement conçu, optimisé pour l'automatisation CLI, IDE et GitHub, avec des scores mesurés indépendamment. GPT-5.6 Sol coûte quatre fois plus cher en entrée et trois fois plus cher en sortie (5 $ / 30 $) et est le nouveau fleuron généraliste, avec des chiffres de codage supérieurs — mais principalement rapportés par le fournisseur. Ce que cette paire met réellement en jeu, c'est le prix, le contexte et la différence entre un spécialiste et un généraliste qui code bien. Tout ce qui suit est étiqueté par source.

Ce qu'est chaque modèle

GPT-5 Codex est exactement ce que dit sa page modèle : « une version spécialisée de GPT-5 optimisée pour l’ingénierie logicielle et les flux de travail de codage. » Sorti en septembre 2025, c’est le modèle API derrière l’agent de codage d’O​penAI — celui qui construit des projets de zéro, travaille sur des fonctionnalités, refactore à grande échelle, révise le code et planifie des modifications multi-fichiers avec un curseur d’effort de raisonnement réglable. Il accepte des entrées texte et image (captures d’écran pour le travail d’interface), dispose d’un contexte de 400K tokens, d’un plafond de sortie de 128K, et est explicitement destiné aux applications de codage agentiques : CLI, extensions IDE, GitHub et tâches cloud.

GPT-5.6 Sol est le niveau phare de la série G​PT-​5.6, sortie le 9 juillet 2026 avec une date limite de connaissances de février 2026. C’est le modèle vers lequel O​penAI dirige les travaux généraux les plus difficiles : raisonnement multi-étapes approfondi, ingénierie logicielle à grande échelle, agents à long horizon, utilisation de l’ordinateur et un mode de raisonnement multi-agents « ultra ». Sa fenêtre de contexte est de 1,05 million de jetons — 2,6 fois celle de GPT-5 Codex — avec le même plafond de sortie de 128 000 jetons, et il accepte des entrées texte, image et fichier. Sol fonctionne également dans ChatGPT, de sorte que lorsque O​penAI parle de « Codex » au sens produit aujourd’hui, cela désigne généralement Sol effectuant du travail de codage agentique.

Prix : un écart de 4x / 3x qui se réduit mais ne se comble jamais.

Les chiffres clés, tous deux transmis au prix catalogue du fournisseur : GPT-5 Codex à 1,25 $ / 10 $ par million de tokens (lecture du cache 0,125 $) ; GPT-5.6 Sol à 5 $ / 30 $ (lecture du cache 0,50 $). Cela représente quatre fois le prix d'entrée et trois fois le prix de sortie. Sur une journée de codage classique de dix millions de tokens avec une répartition 75/25 entre entrée et sortie, GPT-5 Codex facture environ 34 $ ; GPT-5.6 Sol facture environ 112 $. L'écart n'est pas théorique.

Deux éléments le réduisent. Premièrement, la mise en cache : les deux modèles facturent l’entrée en cache bien en dessous de l’entrée fraîche, et les boucles d’agents relisent constamment le même contexte de dépôt, de sorte qu’une grande partie des jetons peut profiter du tarif réduit. Deuxièmement, l’efficacité : O​penAI affirme que la génération 5.6 termine les tâches agentiques avec environ 54 % de jetons de sortie en moins que la génération précédente. Si Sol n’a besoin que de la moitié des jetons de sortie pour la même tâche, l’écart par tâche passe d’environ 3,3x à environ 2x — une économie réelle, mais qui n’efface pas une différence de prix d’entrée de 4x, et une affirmation d’efficacité rapportée par O​penAI plutôt que mesurée indépendamment.

Sol propose également un tarif d'entrée par paliers : sur la page du modèle OrcaRouter, son tarif de base de 5 $ / 30 $ s'applique aux requêtes allant jusqu'à 32K jetons d'entrée, et les requêtes plus volumineuses sont facturées au palier supérieur de 10 $ / 45 $. C'est la taxe sur les contextes longs — exactement les requêtes qu'un agent de gros dépôt effectue. La comparaison pratique des prix dépend donc encore plus de la charge de travail que ne le suggère le titre de 3-4x.

The OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the flagship description, $5.00 input / $30.00 output per 1M tokens, the 1.05M-token context window, and seven-day telemetry (p50 TTFT 3.82s, ~465 tok/s, 39.0M tokens/7d).

Contexte et comment les appeler

Le fossé de contexte est le deuxième vrai séparateur. 400 000 jetons couvrent une base de code substantielle, et Codex, étant un spécialiste, a été conçu pour être efficace dans cette fenêtre. Mais un contexte Sol de 1,05 million de jetons change ce que l'on peut donner à un modèle : un monorepo entier, de longues traces d'agent, un wiki d'onboarding plus le code. Pour les équipes qui envoient des référentiels entiers en une seule requête, la fenêtre plus large fait la différence entre « le modèle peut voir les fichiers pertinents » et « le modèle peut voir les fichiers pertinents plus tout ce qui les importe ». C'est aussi la différence entre un jeton d'entrée à 1,25 $ et un à 5 $, ce qui explique pourquoi la décision relative au contexte est une décision de coût.

Les deux modèles parlent les mêmes deux formes d'API — OpenAI Chat Completions et l'API Responses — et les deux prennent en charge l'appel d'outils/fonctions et les sorties structurées. Sur OrcaRouter, les deux se trouvent derrière un seul point de terminaison compatible OpenAI, donc passer de l'un à l'autre est un changement de nom de modèle, pas un changement d'intégration.

Là où les benchmarks divergent — et la note d'honnêteté

Le chiffre intéressant est que les deux modèles ne partagent quasiment aucun benchmark. GPT-5 Codex a des scores véritablement indépendants : Artificial Analysis le mesure avec un indice d'intelligence de 36,1 et un indice de codage de 38,9, avec un indice de mathématiques de 98,7, LiveCodeBench à 84,0 et SWE-Bench Verified à 74,5 pour cent. Les chiffres phares de GPT-5.6 Sol — Terminal-Bench 2.1 à 88,8, un indice d'agent de codage Artificial Analysis de 80 en raisonnement maximal, Agents' Last Exam à 53,6 — sont ceux qu'OpenAI a publiés au lancement et n'ont pas été reproduits par un évaluateur indépendant. « 88,8 contre 84,0 » n'est pas un combat équitable, car l'un de ces chiffres est audité et l'autre est l'affirmation du fournisseur. Le résumé honnête : Sol est d'une génération plus récente et son plafond est clairement plus élevé, mais le seul score de codage que l'un ou l'autre modèle possède et qu'un laboratoire indépendant a vérifié appartient au spécialiste moins cher et plus ancien.

Comparison scoreboard for GPT-5 Codex vs GPT-5.6 Sol. Left column GPT-5 Codex: Input price $1.25/1M, Output price $10.00/1M, Context 400K, Released Sep 2025, Coding bench LiveCodeBench 84.0, Cache read $0.125. Right column GPT-5.6 Sol: Input price $5.00/1M, Output price $30.00/1M, Context 1.05M, Released Jul 2026, Coding bench Terminal-Bench 2.1 88.8, Cache read $0.50. Footer: 'Codex figures per Artificial Analysis; Sol figures OpenAI-reported.' OrcaRouter logo composited bottom-right.

Il existe aussi un benchmark qu'OpenAI elle-même conteste. Sur SWE-Bench Pro, GPT-5.6 Sol obtient 64,6 % tandis que Claude Fable 5 est en tête avec 80 — et OpenAI a publiquement remis en cause la validité de ce benchmark. Sur ce point, le signal intéressant n'est pas le score, mais le fait qu'un fournisseur majeur affirme désormais que son propre mauvais résultat est la faute du benchmark. Pour une équipe de développement, c'est un rappel de tester le modèle sur votre propre dépôt avant de faire confiance à un quelconque classement, y compris le nôtre.

Vitesse : l'avertissement concernant le trafic

Sur la télémétrie de sept jours d'OrcaRouter, GPT-5.6 Sol affiche un délai médian jusqu'au premier jeton de 3,82 secondes et environ 465 jetons de sortie par seconde, sur un trafic de 39 millions de jetons. La page de GPT-5 Codex est toujours en « collecte » de télémétrie — son trafic via le routeur est trop faible pour qu'il y ait quoi que ce soit à moyenner pour l'instant. Ce faible trafic est en soi une information : aux yeux du marché, le travail sur l'API d'agent de codage est déjà passé à des modèles plus récents. Cela ne signifie pas que GPT-5 Codex est lent ou cassé ; cela signifie que la question « lequel est le plus rapide » ne peut pas être résolue à partir des données du routeur tant que quelqu'un n'aura pas fait passer un volume réel de trafic.

Laquelle devriez-vous choisir ?

Choisissez GPT-5 Codex si…

Votre charge de travail est véritablement orientée code : vous exécutez un agent qui modifie du code, révise des pull requests, refactorise, écrit des tests et travaille dans un environnement IDE ou CLI. Vous voulez la concentration d'un spécialiste, un coût quatre fois inférieur, et le seul score de codage vérifié indépendamment dans cette confrontation. GPT-5 Codex est également le bon choix si vous voulez la sémantique d'agent-codeur d'O​penAI — le curseur d'effort de raisonnement, la boucle d'utilisation des outils — sans payer le prix des modèles phares pour des capacités générales dont vous n'aurez pas besoin.

Choisissez GPT-5.6 Sol si…

Votre travail mêle codage, raisonnement général exigeant, agents à long horizon, utilisation d'ordinateur ou entrées riches en fichiers — ou vous voulez tout simplement un produit phare pour tout faire. Le contexte de 1,05 M, le mode ultra multi-agents, l'entraînement plus récent et l'intégration des produits ChatGPT et Codex jouent tous en faveur de Sol. Ses résultats de codage sont supérieurs sur le papier, et sur un benchmark auquel le fournisseur croit, c'est le meilleur agent de codage qu'OpenAI ait lancé. Vous payez trois à quatre fois plus par jeton pour cette polyvalence ; l'efficacité en jetons réduit l'écart sur les tâches où Sol gagne effectivement.

La réponse est souvent les deux — routez selon la tâche

Comme les deux sont disponibles sur OrcaRouter avec une marge de 0 %, la configuration la plus robuste ne relève pas du choix. Orientez le volume de tâches de codage vers GPT-5 Codex — le spécialiste à $1.25 / $10 — et faites remonter uniquement les tâches qui nécessitent l'ampleur d'un modèle phare vers GPT-5.6 Sol à $5 / $30. Une seule clé API, un point de terminaison compatible O​penAI, un changement de nom de modèle lors de l'acheminement, et un basculement automatique si un fournisseur connaît une mauvaise heure. La répercussion des prix est importante d'une manière spécifique ici : les $1.25 / $10 et $5 / $30 que vous budgétez sont les prix catalogue des fournisseurs, donc une future baisse de prix d'O​penAI est active sur notre point de terminaison le jour même où elle est annoncée, et votre logique d'acheminement n'a pas à changer.

The OrcaRouter model page for GPT-5 Codex (openai/gpt-5-codex), showing the $1.25 input / $10.00 output per 1M pricing, the 400K-token context window, the description of the specialized software-engineering model, and 'Collecting...' telemetry placeholders on thin traffic.

Questions que cela soulève

Est-ce que GPT-5.6 Sol a remplacé GPT-5 Codex ?

Dans le produit, oui — l'application Codex autonome a été fusionnée dans ChatGPT lors du lancement de la version 5.6, et Sol est le moteur qui exécute le mode agent de codage là-bas. Dans l'API, non : GPT-5 Codex est toujours un modèle actif et servi, avec son propre prix, et de nombreux pipelines d'agents l'utilisent encore car il est conçu sur mesure et peu coûteux.

Le code de Sol est-il vraiment meilleur que celui de Codex ?

Sur les chiffres qu'O​penAI a publiés, oui — Terminal-Bench 2.1 à 88.8 contre 84.0 pour Codex sur LiveCodeBench — mais ce sont des benchmarks différents, et les chiffres de Sol sont fournis par le fournisseur tandis que ceux de Codex sont mesurés indépendamment. Testez sur votre propre dépôt ; c'est le seul score qui compte.

Pourquoi quelqu'un exécuterait-il encore GPT-5 Codex ?

Prix et adéquation. À un quart du prix d'entrée de Sol, un pipeline d'agent de codage dédié qui n'a jamais besoin de l'étendue du modèle phare général permet d'économiser de l'argent réel par million de jetons, et la spécialisation du modèle réduit le façonnage de prompt nécessaire pour le garder sur des tâches de codage.

La raison pour laquelle cet affrontement mérite d'être considéré est que O​penAI a intégré la réponse dans son propre produit. L'entreprise a passé un an à vendre un spécialiste du codage, puis l'a absorbé dans un produit phare généraliste qui code suffisamment bien pour revendiquer la couronne du spécialiste — tout en laissant le spécialiste sur l'API à une fraction du prix. Ce n'est pas une astuce ; c'est le prix plancher pour « nous voulons l'agent de codage sans payer pour le produit phare ». GPT-5 Codex est le spécialiste bon marché, ciblé et mesuré indépendamment. GPT-5.6 Sol est le produit phare plus récent, plus vaste et plus cher, dont vous devriez vérifier les affirmations en matière de codage sur votre propre travail. La plupart des équipes de production découvriront que la réponse honnête est les deux — et avec les deux sur un seul endpoint de passage, le routage entre eux est une configuration, pas une migration.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube