
OpenAI o3 vs DeepSeek V4 Pro : L'ère du raisonnement premium s'arrête là où commence l'écart de prix.
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Le face-à-face entre OpenAI o3 et DeepSeek V4 Pro est vraiment une collision de deux chiffres. OpenAI o3, publié le 16 avril 2025, était la référence en matière de raisonnement premium — le modèle pour lequel on payait le prix fort quand le coût d'une mauvaise réponse était plus élevé que celui des jetons. DeepSeek V4 Pro, qui est devenu GA en tant que build 0813 le 13 août 2026 après une sortie discrète en soirée et un déploiement qui comprenait une annonce retirée et des poids réuploadés, est le modèle qui a fait passer ce premium pour une erreur de catégorie : un indice indépendant au-dessus de celui de o3, à environ un cinquième du prix, avec des poids ouverts en prime. Et la collision est horodatée, car OpenAI o3 quitte ChatGPT le 26 août 2026, ses instantanés API suivent le 11 décembre, et chaque semaine de comparaison favorise le modèle qui, lui, ne va pas disparaître.
Deux modèles sortis à un an d'écart en philosophie
o3 est le fleuron du raisonnement pur : un modèle fermé entraîné à réfléchir longtemps avant de répondre, avec une fenêtre de contexte de 200 000 tokens, jusqu’à 100 000 tokens de sortie et une entrée d’images intégrée à sa chaîne de pensée. Selon les chiffres d’OpenAI, il a placé la barre pour 2025 — 96,7 % sur AIME 2024, 87,7 % sur GPQA Diamond, 69,1 % sur SWE-bench Verified sans échafaudage, un Elo Codeforces de 2727 — puis OpenAI a réduit son prix de 10/40 $ à 2/8 $ par million de tokens, prix auquel il se situe encore. DeepSeek V4 Pro relève d’une tout autre économie : un modèle à mélange d’experts de 1 600 milliards de paramètres avec environ 49 milliards de paramètres actifs par token, une fenêtre de contexte d’un million de tokens, une sortie maximale de 384 000 tokens, une entrée de texte uniquement et — nouveauté de la version GA 0813 — une pile de post-entraînement reconstruite, ainsi qu’une intégration native de l’API Responses et de Codex qui a fait passer ses scores d’agent de 12,8 lors de l’aperçu à 62,7 sur DeepSWE. Il est également à poids ouverts : le checkpoint DeepSeek-V4-Pro-0813 est téléchargeable sur Hugging Face sous licence MIT, après un premier chaos de 24 heures où la bannière de sortie a été retirée et où les poids ont brièvement renvoyé une 404 avant qu’une configuration corrigée ne soit remise en ligne.
L'écart de coût en chiffres réels
Les grilles tarifaires font la majeure partie de l'argumentation à elles seules :
OpenAI o3 — 2,00 $ par million de tokens d’entrée, 8,00 $ par million de tokens de sortie, 0,50 $ par million de tokens d’entrée en cache. Les jetons de raisonnement sont facturés au tarif des tokens de sortie, donc une question difficile consomme des jetons de réflexion avant la réponse.
• DeepSeek V4 Pro — 0,435 $ par million de tokens d’entrée (cache miss), 0,003625 $ par million de tokens en cas de cache hit, 0,87 $ par million de tokens de sortie aujourd’hui. La sortie est environ 4,6× moins chère que o3, l’entrée en cache hit est effectivement gratuite.
• La mise en garde avec une date — l'augmentation de prix prévue par DeepSeek le 17 août fait passer la sortie de V4 Pro de 6 yuans à 27 yuans par million aux heures de pointe (13,5 hors pointe) et l'entrée en cas d'échec de cache de 3 à 9 yuans. Même au nouveau tarif de pointe, la sortie ne représente qu'une petite fraction des 8 $ de o3. La fenêtre pour construire au tarif actuel se mesure en jours, ce qui fait lui-même partie du calcul de migration.
L'économie par bonne réponse rend le propos plus net. Les jetons de raisonnement cachés d'o3 signifient que son coût réel par réponse difficile est plusieurs fois supérieur à son tarif de sortie. DeepSeek V4 Pro raisonne également, et sa réflexion est facturée comme sortie aussi, mais à 0,87 $, la dépense absolue est une erreur d'arrondi par rapport à une session o3 qui réfléchit pendant une minute et demie. Le cadre de coût d'agent utilisé par DeepSeek au lancement — environ un écart de prix par tâche de 45× par rapport à la frontière fermée — surestime le cas d'o3 spécifiquement, mais la tendance n'est pas contestée : il s'agit d'un écart de 4 à 10× en coût effectif selon la charge de travail.
Où se situe réellement l'écart de qualité
Le score qui compte le plus est celui qui est indépendant. Sur l'indice d'intelligence d'Artificial Analysis, DeepSeek V4 Pro affiche 53 et se classe n°2 parmi les 104 modèles que répertorie actuellement cet indice ; o3 se situe autour de 30 — un écart de plus de 20 points sur le même banc d'essai. C'est le résumé le plus net qui soit de l'état dans lequel deux années de progrès ont laissé le fleuron du raisonnement premium : il n'est plus seulement moins cher ; il est battu sur l'agrégat indépendant.
Le tableau benchmark par benchmark est plus désordonné et mérite des étiquettes honnêtes. Les chiffres phares de DeepSeek V4 Pro en matière d'agents — Terminal-Bench 2.1 à 87,9, CyberGym à 83,3, DeepSWE à 62,7, AutomationBench devant la frontière fermée — sont les propres affirmations de DeepSeek issues du lancement du 0813, non reproduites de manière indépendante à l'heure où nous écrivons, et l'épisode de mauvaise configuration du déploiement signifie que personne ne peut être certain que l'API servait les poids corrigés finaux lorsque les premiers chiffres de tiers ont été collectés. Les benchmarks de lancement d'o3 sont tout aussi rapportés par le fournisseur, mais ils ont été partiellement validés par des retests indépendants en 2025, lorsqu'il menait réellement les classements de raisonnement. En mathématiques et en raisonnement pur, le bilan publié d'o3 semble toujours meilleur que celui de DeepSeek V4 Pro — les forces de DeepSeek sont l'utilisation agentique d'outils, le codage et les tâches à long horizon, ce qui constitue une suite de tests différente des olympiades de mathématiques qu'o3 dominait.

Ce que o3 fait encore mieux
Deux éléments survivent intacts à la comparaison. Premièrement, les mathématiques et le raisonnement soigné : les 96.7% d'AIME et 87.7% de GPQA d'o3 restent supérieurs à tout ce que DeepSeek V4 Pro a publié, et si votre charge de travail est une preuve difficile ou un problème de compétition, o3 — tant qu'il fonctionne encore — est la réponse la plus sûre. Deuxièmement, le raisonnement sur image : o3 peut réfléchir à une capture d'écran ou à un diagramme dans sa chaîne de pensée, tandis que DeepSeek V4 Pro est uniquement textuel ; la version 0813 n'a ajouté aucun encodeur visuel, et si votre tâche nécessite que le modèle lise une image, DeepSeek V4 Pro ne remplace pas o3 dans ce domaine. Aucun de ces avantages n'est une raison de rester sur un modèle en fin de vie, mais ils sont tous deux des raisons d'être honnête sur le fait que la migration n'est pas une pure mise à niveau.
L'autre chose à noter est la différence concernant les poids ouverts, ce qui n'a rien à voir avec un benchmark. o3 était fermé et est maintenant en train d'être absorbé jusqu'à disparaître ; vous ne pouvez pas le faire tourner sur votre propre matériel. Le checkpoint 0813 de DeepSeek V4 Pro vous appartient, définitivement, sous licence MIT — les mêmes poids, le même modèle à 1,6 billion de paramètres, auto-hébergeable si vous disposez des ~1,5 téraoctets de matériel nécessaires. Pour les équipes qui ont été échaudées par leur dépendance à un modèle fermé qu'un fournisseur pouvait retirer, c'est une réponse structurelle au problème exact que pose la retraite d'o3.
Migration de la charge de travail
Pour l'équipe API qui arrive après o3, DeepSeek V4 Pro est l'endroit le moins cher où atterrir et, sur le travail agentique et de codage qui constitue en réalité l'essentiel de l'utilisation de l'API, c'est rarement une régression. Les vrais pièges sont opérationnels, pas qualitatifs : V4 Pro est plafonné à 500 requêtes simultanées sur l'API officielle, un plafond que vous atteindrez avec une flotte d'agents, et son prix change le 17 août. Ces deux points sont exactement ce à quoi sert une couche de routage.
Sur OrcaRouter, DeepSeek V4 Pro est servi au prix catalogue du fournisseur, répercuté sans marge — ainsi, les 0,44 $ / 0,87 $ actuels sont disponibles ici le même jour que chez DeepSeek, et lorsque le barème pointe/hors pointe du 17 août entrera en vigueur, il sera répercuté ici le même jour également. Une même clé donne également accès au reste de cette cohorte de remplacement d'o3, et le basculement automatique est la solution propre à la limite de 500 requêtes simultanées : pointez un chemin de production vers V4 Pro ainsi qu'un second modèle sur la même clé, et laissez le routeur absorber le plafond. OpenAI o3 lui-même n'est pas sur cette clé — il reste disponible via l'API propre d'OpenAI et plusieurs plateformes tierces jusqu'à la date limite de l'instantané du 11 décembre.

Qui les maths favorisent
Pour ceux dont la charge de travail o3 est du codage, des boucles d'agent ou du traitement de contexte long, les calculs ne sont pas serrés : DeepSeek V4 Pro bat o3 sur l'indice indépendant, coûte une fraction du prix, et ses poids ouverts signifient que cette dépendance particulière ne peut pas vous être retirée du jour au lendemain. Les équipes qui ont une raison légitime de garder o3 en vie pour l'instant sont les plus restreintes — le raisonnement mathématique pur difficile, et tout ce qui repose sur la réflexion image d'o3 — et même celles-ci devraient tester des remplaçants sur des charges réelles avant décembre, car la date limite ne se soucie pas de votre cas particulier. L'ère du raisonnement premium qu'o3 a définie s'est terminée avec son annonce de retrait ; DeepSeek V4 Pro se trouve simplement être l'endroit où se trouve le siège le moins cher de la prochaine ère.

Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
