
GPT-6.1 Sol vs DeepSeek V4 Pro : trois mètres, trois réponses différentes
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Demandez à quelle distance GPT-6.1 Sol et DeepSeek V4 Pro se trouvent l'un de l'autre, et la réponse honnête est que cela dépend du compteur que vous lisez, et les trois compteurs sont en désaccord bien plus que la plupart des comparaisons de modèles, qui ne s'accordent sur rien. Sur le prix par million de jetons, pondéré selon un ratio entrée-sortie de 3:1, ils sont à 4,00 $ contre 0,99 $ — un facteur de quatre. Sur ce qu'a réellement coûté l'exécution de la même suite d'évaluation, ils sont à 0,72 $ contre 0,67 $ par tâche — sept pour cent. Sur l'Artificial Analysis Intelligence Index, ils sont à 51,8 contre 36 — seize points, ce qui semble décisif jusqu'à ce que l'on regarde à quoi chaque chiffre a été comparé, car la méthodologie de cet évaluateur place les deux modèles dans des ligues différentes. GPT-6.1 Sol a été publié le 29 septembre 2026 à 2,00 $ en entrée et 10,00 $ en sortie, avec une fenêtre de 1 050 000 jetons. DeepSeek V4 Pro est un modèle phare de type mélange d'experts sous licence MIT, avec 1,6 billion de paramètres dont 49 milliards actifs, publié le 13 août 2026 à 0,66 $ et 1,98 $, avec une fenêtre de 1 048 576 jetons. L'un est un modèle textuel que vous pouvez télécharger. L'autre voit des images. Déterminer lequel des trois compteurs doit réellement vous guider, c'est tout l'enjeu.
La ligne d’index n’est pas la comparaison qu’elle semble être.
Commencez par le nombre qui est le plus souvent cité, car c’est celui qui est le plus souvent cité à tort.
Artificial Analysis publie sa méthodologie en même temps que son classement, et deux phrases y sont importantes ici. Les modèles à poids ouverts, dit-elle, ne sont comparés qu'à d'autres modèles à poids ouverts de la même classe de taille — minuscule, petite, moyenne, grande, avec la limite à 150 milliards de paramètres. Les modèles propriétaires sont quant à eux comparés sur une fourchette de prix, selon un ratio pondéré de 3:1 entre les entrées et les sorties. Ce sont deux groupes de comparaison différents. DeepSeek V4 Pro 0813 est à poids ouverts — la FAQ de l'évaluateur le dit elle-même et renvoie aux poids publiés — et avec 1,6 billion de paramètres au total, il se situe dans la classe des grands modèles à poids ouverts. GPT-6.1 Sol est propriétaire et est évalué par rapport à des modèles de sa propre fourchette de prix.
Un 51,8 et un 36 placés dans des lignes adjacentes d’un même tableau ne constituent donc pas une comparaison directe. Ils correspondent à un score face à un ensemble de pairs et à un score face à un autre, ce qui explique précisément pourquoi les chiffres de coût par tâche sont comparables et les nombres bruts de l’indice ne le sont pas. Si vous voulez savoir si DeepSeek V4 Pro est bon pour un modèle téléchargeable, 36 est le nombre qui répond à cette question. Si vous voulez savoir comment il se comporte face à un modèle de pointe hébergé, la colonne de l’indice ne vous le dira pas, et c’est un cas où la chose honnête à faire est de le dire plutôt que de soustraire 36 de 51,8 et d’appeler cela un écart.
Ce qui peut être comparé sans ambiguïté : les cartes de tarification, les limites de contexte et de sortie, les listes de modalités, et le coût d’exécution de la même suite d’évaluation — car ce dernier chiffre est un décompte d’un travail identique, et non un score.
Ce que disent les compteurs bruts

• Prix d'entrée — GPT-6.1 Sol 2,00 $ vs DeepSeek V4 Pro 0,66 $ par million de tokens
• Prix de sortie — GPT-6.1 Sol 10,00 $ vs DeepSeek V4 Pro 1,98 $, passant à 1,32 $ et 3,96 $ dans deux fenêtres UTC de quatre heures en semaine
• Lecture du cache — GPT-6.1 Sol 0,10 $ contre DeepSeek V4 Pro 0,022 $ par million de tokens ; les deux mettent en cache, et le côté le moins cher est encore 4,5× moins cher
• Coût par tâche d'index — GPT-6.1 Sol 0,72 $ vs DeepSeek V4 Pro 0,67 $
• Tokens de sortie émis sur la suite d’indices — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M
• Sortie maximale — DeepSeek V4 Pro 384 000 jetons vs GPT-6.1 Sol 128 000 jetons
• Modalités — GPT-6.1 Sol prend en charge le texte, les images et les fichiers ; DeepSeek V4 Pro ne prend en charge que le texte
Les quatrième et cinquième lignes forment la paire intéressante. DeepSeek V4 Pro émet 2,4 fois plus de tokens sur la même suite et revient tout de même 7 % moins cher par tâche, parce que son tarif de sortie est un cinquième de celui de GPT-6.1 Sol. Voilà à quoi ressemble un modèle piloté par le prix lorsqu'on mesure la sortie plutôt que le tarif : la verbosité est bien réelle, et elle n'annule pas l'avantage. La fenêtre horaire est l'astérisque. Deux créneaux de quatre heures en semaine — 40 des 168 heures que compte une semaine — doublent le tarif affiché, qui passe à 1,32 $ et 3,96 $, et ce supplément s'applique aux mêmes tokens qui, sans cela, seraient les moins chers sur l'une ou l'autre carte.
Ce que le modèle moins cher ne fait pas
Trois choses, et chacune est une limite absolue plutôt qu’un compromis.
Il ne voit pas. DeepSeek V4 Pro fonctionne en entrée texte, sortie texte. Pas de captures d’écran, pas de PDF scannés, pas de lecture de graphiques, pas de diagramme dans un ticket. L’utilisation d’un ordinateur et les flux de travail à forte composante documentaire — exactement les charges de travail pour lesquelles GPT-6.1 Sol est positionné — sont hors de portée, quel que soit le prix. Si votre pipeline achemine déjà les images vers un modèle de vision, ce n’est pas un problème ; sinon, c’est la contrainte décisive.
Il n’a pas de cadence de publication qui permette de planifier. Le nom « deepseek-v4-pro » renvoie au build 0813 depuis août, et cela ne s’est pas fait dans le calme : le fournisseur a annoncé le retrait de ce build pour le 14 septembre, a retiré l’annonce deux jours avant la date, et a continué de servir l’API avec une facturation inchangée. Notre propre catalogue le liste encore comme le modèle phare, avec le même contexte, le même plafond de sortie et la même limite de concurrence. Un fournisseur capable de retirer une annonce de dépréciation en deux jours peut aussi refuser de le faire ; la conclusion opérationnelle n’est pas que le modèle est instable, mais que le nom est un pointeur, et épingler le comportement à un identifiant de build plutôt qu’à un nom de route est l’assurance à moindre coût.
Il ne porte pas les connaissances environnantes. GPT-6.1 Sol est âgé de huit jours et a déjà une configuration indépendante publiée ; DeepSeek V4 Pro dispose d’un historique d’évaluation plus long et d’une base de praticiens bien plus large, y compris une pile de service publiée et des travaux tiers sur le débit. Pour un déploiement auto-hébergé, cet ensemble de documents vaut plus que la ligne d’index, car c’est ce que l’on consulte lorsque le modèle se comporte étrangement sur votre matériel plutôt que sur un benchmark.
Quand le compteur quatre fois moins cher n’est pas le bon compteur
Si le modèle bon marché était simplement moins bon sur tous les plans, cet article serait court. Le fait embarrassant, c'est que les deux affichent 7 % d'écart par tâche sur un travail identique, et un écart de 2,4× dans la quantité de texte produite pour y parvenir. Cela signifie que le compteur de tokens mélangés — celui qui indique 4× — mesure une différence que, dans la plupart des cas, vous ne payez pas, parce qu'il tarife un mélange de tokens que vous n'enverrez peut-être jamais. Et le compteur d'indice, celui qui indique 16 points, mesure sur deux groupes de pairs et ne peut pas être soustrait.
Ainsi, la répartition pratique n’est pas « modèle de pointe pour le travail difficile, modèle bon marché pour le travail facile ». C’est un découpage par modalité et un découpage par volume. Tout ce qui contient une image va à GPT-6.1 Sol, et de même pour tout ce dont la réponse est courte et où le raisonnement est la partie coûteuse — ses cinq niveaux d’effort, de faible à max avec moyen par défaut, vous permettent d’acheter du raisonnement sans acheter de la prose, et son entrée mise en cache à $0.10 rend une longue invite répétée bon marché. Tout ce qui est uniquement textuel, à gros volume et tolérant une réponse plus longue — classification, extraction, summarisation, génération en masse dans un budget de sortie de 384,000 tokens — va à DeepSeek V4 Pro, idéalement en dehors des deux fenêtres UTC.
Les deux sur une seule touche, et le split est une ligne de config.
Les deux modèles sont disponibles sur OrcaRouter aux tarifs publiés par leurs fournisseurs respectifs, sans rien ajouter : GPT-6.1 Sol à 2,00 $ / 10,00 $, passant à 4,00 $ / 15,00 $ au-delà de 272 000 jetons de prompt, et DeepSeek V4 Pro à 0,66 $ / 1,98 $, avec les deux fenêtres horaires conservées comme indiqué. Une seule clé, une seule facture, un seul point de terminaison compatible OpenAI pour les deux.
C’est la raison pour laquelle la répartition ci-dessus mérite d’être consignée par écrit plutôt que de faire l’objet de discussions. Une répartition par modalité peut s’exprimer sous forme de règle de routage : les requêtes contenant des images sont dirigées vers le modèle de vision, et le gros du texte va vers le modèle bon marché, sans modification de l’application ; si une route se dégrade, le basculement redirige l’appel au lieu de le faire échouer. Et comme les deux se trouvent sur le même point de terminaison, la comparaison de prix qui compte vraiment — la vôtre, sur votre trafic, selon votre répartition de jetons — peut être produite à partir de vos propres factures plutôt que de la moyenne d’une suite de benchmarks.


Le verdict, en une ligne, est que l'interprétation quatre fois moins chère est celle dont il faut se méfier, et l'interprétation à sept pour cent est celle qu'il faut vérifier. Quatre fois, c'est ce que dit le compteur mixte à propos d'un mélange de tokens que vous n'envoyez peut-être pas. Sept pour cent, c'est ce que la même évaluation a coûté aux deux, et cela s'accompagne d'une différence de verbosité de 2,4× intégrée d'emblée. Les seize points sont réels, mais ils s'étendent aussi sur deux groupes de pairs, et la contrainte qui décide réellement de la plupart des déploiements de ce duo n'est pas du tout un nombre : l'un de ces modèles peut lire une capture d'écran, et l'autre non.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
