Carte de titre principale indiquant « GPT-6 vs DeepSeek V4 Pro », avec une puce indiquant « GPT-6 dans ChatGPT pour tous 2026-10-07 », deux lignes de prix indiquant « GPT-6 Sol 2 $ / 10 $ » et « DeepSeek V4 Pro 0,66 $ / 1,98 $ en période de pointe », une puce indiquant « DeepSeek : poids MIT, sortie max 384K », et un pied de page indiquant « Les éléments rapportés par le fournisseur sont signalés dans le texte ; chiffres d'index selon Artificial Analysis. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

GPT-6 vs DeepSeek V4 Pro : l'un que vous pouvez louer à n'importe qui, l'autre que vous pouvez ramener chez vous

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il y a exactement une chose que vous pouvez faire avec DeepSeek V4 Pro et que vous ne pouvez pas faire avec GPT-6 Sol : l'emmener chez vous. DeepSeek V4 Pro est un modèle phare de type mélange d'experts sous licence MIT — 1 600 milliards de paramètres au total, 49 milliards actifs par token — publié le 13 août 2026, et son checkpoint est téléchargeable. GPT-6 Sol est un modèle à poids fermés, livré par Ope​nAI le 22 septembre 2026, et depuis le 7 octobre 2026, c'est aussi le modèle qui sous-tend les offres payantes du déploiement mondial de ChatGPT auprès de plus de 1,2 milliard d'utilisateurs hebdomadaires.

Tout le reste dans cette comparaison dépend de quel compteur vous lisez. Sur la grille tarifaire, les deux sont séparés d’un facteur quatre. Sur ce qu’a réellement coûté la production d’une réponse finie sur la suite indépendante, ils sont séparés d’un facteur 1,55. Sur l’Intelligence Index, les lignes semblent séparées de seize points et, selon la méthodologie documentée par l’évaluateur lui-même, ne sont pas du tout soustractibles. Déterminer lequel de ces trois nombres devrait guider une décision, c’est tout l’enjeu, et la réponse diffère selon que vous choisissez un fournisseur ou que vous choisissez un fichier.

Ce qu’est chaque modèle, en un paragraphe chacun

GPT-6 Sol est le niveau intermédiaire de la gamme GPT-6 d’Ope​nAI — en dessous du fleuron GPT-6 Astra, au-dessus du modèle économique GPT-6 Luna — avec une fenêtre de contexte de 1 050 000 jetons, un plafond de sortie de 128 000 jetons, une entrée texte, image et fichier, un appel d’outils natif, des sorties structurées et un effort de raisonnement sélectionnable sur cinq niveaux, de faible à max. C’est le niveau vers lequel Ope​nAI oriente ChatGPT Plus, Pro, Business et Enterprise, et il est facturé 2,00 $ par million de jetons d’entrée et 10,00 $ par million de jetons de sortie, avec un palier de contexte long qui applique un nouveau prix à l’ensemble de la requête, à 4,00 $ et 15,00 $, une fois que le prompt dépasse 272 000 jetons d’entrée.

DeepSeek V4 Pro est un modèle phare exclusivement textuel avec une fenêtre de 1 048 576 jetons et une sortie maximale de 384 000 jetons — trois fois le plafond de GPT-6 Sol — et aucune vision, à aucun prix. La documentation API de DeepSeek elle-même l'affiche à 0,66 $ par million de jetons d'entrée et 1,98 $ par million de jetons de sortie pendant les heures de pointe, réduits de moitié à 0,33 $ et 0,99 $ en heures creuses, avec des succès de cache à 0,022 $ en heures creuses. Les heures de pointe sont de 01:00 à 04:00 et de 06:00 à 10:00 UTC en semaine ; tout le reste, y compris les week-ends et les jours fériés chinois, est en heures creuses.

Les trois mètres

Commencez par celui qui est le plus cité, car c’est celui qui est le plus souvent cité sans son contexte. Artificial Analysis attribue à DeepSeek V4 Pro un score de 36,0 et à GPT-6 Sol un score de 47,6 sur l’Intelligence Index v4.3.2. Onze points et demi, c’est le genre d’écart qui met fin à une comparaison.

Cela ne devrait pas être le cas, et l’évaluateur le dit lui-même. Artificial Analysis ne compare les modèles à poids ouverts qu’à d’autres modèles à poids ouverts de la même classe de taille, avec un seuil à 150 milliards de paramètres, et les modèles propriétaires dans une fourchette de prix selon un ratio combiné de 3:1 entre entrées et sorties. Ce sont deux groupes de pairs différents qui produisent deux échelles différentes. Un 36 et un 47,6 sur des lignes adjacentes d’un même tableau ne constituent pas une comparaison directe, et la position honnête est de le dire plutôt que de soustraire l’un de l’autre et de qualifier le résultat de capacité.

A screenshot of the Artificial Analysis leaderboard showing the rows around DeepSeek V4 Pro, with MiMo-V2.6-Flash at 38 and $0.06 per index task, Claude Haiku 5.5 (high) at 38 and $0.08, and DeepSeek V4 Pro 0813 (max) at 36 and $0.67, each row carrying its creator, index, cost per task, output speed and latency columns.

Les deux compteurs qui sont comparables disent quelque chose de plus utile :

• Prix mixte à 3:1 — GPT-6 Sol 4,00 $ par 1 M contre DeepSeek V4 Pro 0,99 $ aux tarifs de pointe, ou 0,50 $ hors pointe ; un écart de 4× à 8× selon le moment où vous l’exécutez
• Coût par tâche d’indexation terminée — GPT-6 Sol 1,04 $ contre DeepSeek V4 Pro 0,67 $ ; un écart de 1,55×
• Tokens de sortie générés sur l’ensemble de la suite — GPT-6 Sol 76,8 M contre DeepSeek V4 Pro 162,9 M, donc le modèle à bas coût écrit 2,1× plus pour accomplir le même travail
• Sortie maximale — DeepSeek V4 Pro 384 000 tokens contre GPT-6 Sol 128 000 ; un plafond de 3×
• Entrée multimodale — GPT-6 Sol accepte le texte, les images et les fichiers contre DeepSeek V4 Pro texte uniquement
• Poids — DeepSeek V4 Pro sous licence MIT et téléchargeable contre GPT-6 Sol fermé

A two-column comparison scoreboard for GPT-6 Sol and DeepSeek V4 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against DeepSeek V4 Pro at 36.0, $0.67 and 384,000 tokens, with input and output prices of $2.00/$10.00 against $0.66/$1.98 and an MIT-weights row. A footer reads "Index figures per Artificial Analysis v4.3.2; row scored in different peer groups, not subtractable."

Les quatrième et cinquième lignes expliquent la deuxième. Un écart affiché de 4× qui se réduit à 1,55× sur du travail réel, voilà ce qui se passe quand le modèle le moins cher est aussi le plus verbeux : DeepSeek V4 Pro a émis 2,1× plus de tokens de sortie que GPT-6 Sol sur le même ensemble d'évaluation. La verbosité est un multiplicateur de coût qui n'apparaît jamais sur une page de tarifs, et c'est le chiffre le plus sous-estimé de cette confrontation.

Là où le modèle ouvert gagne véritablement

Deux endroits, et tous deux sont structurels plutôt que marginaux.

Le plafond de sortie est le premier. 384 000 jetons contre 128 000, c’est une différence d’un facteur trois, et il détermine des catégories entières de travail : générer un grand artefact structuré en un seul appel, écrire un long document sans chaînage, produire une refactorisation majeure en une seule réponse. GPT-6 Sol ne peut pas faire cela à aucun prix, car la limite n’est pas un palier de facturation — c’est le maximum du modèle.

L'utilisation agentique d'outils arrive en deuxième position, sur une mesure spécifique. DeepSeek V4 Pro obtient 96,2 % sur τ²-Bench, l'évaluation de l'utilisation agentique d'outils, et c'est le chiffre que DeepSeek met en tête de sa propre fiche. C'est aussi le nombre que répète l'entrée de catalogue OrcaRouter du modèle, qui est la version de l'affirmation que nos propres lecteurs rencontreraient. Le chiffre comparable de GPT-6 Sol sur τ²-Bench n'est pas publié sur le même tableau, donc considérez la comparaison comme indicative : sur le seul benchmark que DeepSeek a choisi de mettre en avant, le modèle ouvert est en tête du domaine, et le modèle fermé n'a pas mis de chiffre dans la même colonne.

Et celui de la propriété, qui n'est pas du tout un benchmark. Un checkpoint MIT téléchargeable signifie que vous pouvez exécuter le modèle sur votre propre matériel, garder une requête hors du réseau de quiconque, l'affiner, épingler une version et savoir qu'elle sera encore là dans trois ans. Aucun fournisseur ne peut le déprécier, en modifier le prix ou le retirer d'une grille tarifaire. Pour une catégorie d'acheteurs — les industries réglementées, quiconque a une contrainte de résidence des données, quiconque a été échaudé par la mise à la retraite d'un modèle — cela vaut plus que onze points d'indice.

Là où GPT-6 Sol gagne, et ce n’est pas seulement l’indice

Terminal-Bench 4.0 est la ligne la moins flatteuse de la fiche de DeepSeek V4 Pro : 14,1 % contre 43,9 % pour GPT-6 Sol. Ce n'est pas un écart d'arrondi, et cela dessine un profil bien réel — le modèle ouvert est solide en orchestration d'outils multi-tours et faible sur le travail terminal de longue haleine dont sont faits les agents de codage modernes. Si votre charge de travail correspond à un agent qui doit maintenir une session shell pendant vingt minutes, cette seule évaluation est plus prédictive de votre expérience que ne l'est le composite de l'indice.

La multimodalité est le deuxième point. DeepSeek V4 Pro fonctionne en entrée texte, sortie texte. GPT-6 Sol prend en charge les images et les fichiers, et ce n’est pas une simple case à cocher — le travail professionnel à forte intensité documentaire implique des captures d’écran, des pages scannées, des diagrammes et des PDF, et un modèle uniquement textuel ne peut pas du tout entrer dans cette catégorie.

Le troisième est ce qui s'est passé cette semaine. GPT-6 est arrivé dans l'onglet Chat de ChatGPT pour Plus, Pro, Business et Enterprise le 7 octobre, Free et Go suivant à partir du 8 octobre, avec une capacité qu'OpenAI appelle Intelligent UI — des réponses qui composent du texte, des visuels, des graphiques, des formulaires et des contrôles tactiles pour chaque question, au lieu de se rabattre par défaut sur de la prose. C'est une interface, pas une fonctionnalité d'API, et cela ne change pas une ligne de votre code d'intégration. Ce que cela change, c'est le choix par défaut ambiant : le modèle que votre équipe a déjà ouvert dans un onglet de navigateur est désormais GPT-6, et le travail de prototypage s'oriente vers le modèle auquel elle peut accéder sans clé. Rapporté par le fournisseur et non reproduit, OpenAI affirme également que GPT-6 au niveau Extra High commence à répondre aussi vite que GPT-5.6 au niveau Medium, et que GPT-6 Instant commence à répondre 44 % plus tôt aux questions reposant sur la recherche.

Exécuter l'un, ou exécuter les deux

Si ce duo en particulier est plus facile à couvrir que la plupart des autres, c'est que les deux modèles figurent au même catalogue. OrcaRouter achemine GPT-6 Sol et DeepSeek V4 Pro — ainsi que plus de 200 autres modèles — via un seul point de terminaison compatible Ope​nAI, sur une seule clé, à 0 % de marge au-dessus du prix catalogue du fournisseur. C'est ce passage direct qui rend la structure heures pleines/heures creuses lisible plutôt que mystérieuse : la réduction de moitié en heures creuses de Dee​pSeek est celle du fournisseur, nous n'y touchons pas, et lorsqu'un fournisseur modifie ses tarifs, le changement est effectif ici le jour même.

C'est aussi là que la décision liée à la fenêtre de pointe devient une décision de routage. Le tarif hors pointe de DeepSeek V4 Pro est la moitié de son tarif de pointe, et les fenêtres de pointe correspondent à des heures UTC fixes. Un traitement par lots qui peut être déplacé mérite d'être planifié autour de ces fenêtres, et un chemin sensible à la latence mérite d'en rester à l'écart. Avec les deux modèles derrière une seule clé, la répartition relève de la configuration plutôt que d'un second contrat fournisseur : acheminez le travail en volume et à sortie longue vers DeepSeek V4 Pro hors pointe, acheminez le trafic multimodal et à forte composante de raisonnement vers GPT-6 Sol, et laissez le basculement automatique couvrir une limite de débit d'un côté ou de l'autre plutôt que de la découvrir en production.

A screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 release date, a 1.05M-token context window, a 128K-token maximum output, text, image and file input and tool calling, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

Ce que je ferais réellement

Si vous avez besoin d’images, de fichiers ou d’un score de raisonnement de pointe et que vous achetez une API, GPT-6 Sol est la réponse, et les onze points d’indice sont largement hors sujet — le portail multimodal tranche avant que les benchmarks n’aient voix au chapitre. Si vous avez besoin d’une sortie de 384 000 tokens, d’une licence que vous pouvez conserver, d’un déploiement sur site ou du coût par tâche terminée le plus bas du tableau, DeepSeek V4 Pro l’emporte, et l’écart d’indice est l’affaire d’un autre groupe de pairs.

Ce que je ne ferais pas, c’est interpréter 36 face à 47,6 comme un écart de capacités et acheter sur cette base. Les mesures comparables — 0,67 $ contre 1,04 $ par tâche, et une différence de verbosité de 2,1× dissimulée dans un écart affiché de 4× — racontent une histoire bien plus proche que ne le font les lignes de l’indice, et ce sont elles qui apparaissent sur une facture.

Ce qu'il faut surveiller ensuite, c'est de savoir si DeepSeek comble l'écart sur Terminal-Bench lors d'une mise à jour de V4 Pro, car c'est la seule mesure où le modèle ouvert semble vraiment en retard plutôt que simplement noté différemment. GPT-6, pour sa part, vient de cesser d'être un choix pour devenir une option par défaut, et il est difficile de contester une option par défaut, même quand le benchmark dit le contraire.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement