
OpenAI o3 vs DeepSeek V4 Pro: L'era del ragionamento premium finisce dove si apre il divario di prezzo
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
Il confronto tra OpenAI o3 e DeepSeek V4 Pro è davvero uno scontro tra due numeri. OpenAI o3, rilasciato il 16 aprile 2025, era il punto di riferimento per il ragionamento premium: il modello per cui si pagava di più quando il costo di una risposta sbagliata era superiore al costo dei token. DeepSeek V4 Pro, passato alla disponibilità generale come build 0813 il 13 agosto 2026 dopo un rilascio serale in sordina e una distribuzione che ha incluso un annuncio ritirato e pesi ricaricati, è il modello che ha fatto sembrare quel premium un errore di categoria: un indice indipendente che si colloca sopra quello di o3, a circa un quinto del prezzo, per di più con pesi aperti. E la collisione è timestampata, perché OpenAI o3 lascia ChatGPT il 26 agosto 2026, i suoi snapshot API seguono l'11 dicembre, e ogni settimana del confronto favorisce il modello che non sta andando via.
Due modelli usciti a distanza di un anno in filosofia.
o3 è l'ammiraglia del puro ragionamento: un modello chiuso addestrato a pensare a lungo prima di rispondere, con una finestra di contesto di 200K, fino a 100K di output e input di immagini integrato nella sua catena di pensiero. Secondo i dati della stessa OpenAI ha fissato il livello per il 2025 — 96,7% su AIME 2024, 87,7% su GPQA Diamond, 69,1% su SWE-bench Verified senza scaffolding, un Elo Codeforces di 2727 — e in seguito OpenAI ha ridotto il prezzo da $10/$40 a $2/$8 per milione di token, prezzo a cui si trova ancora. DeepSeek V4 Pro ha un'economia completamente diversa: un modello mistura di esperti da 1,6 trilioni di parametri con circa 49 miliardi attivi per token, una finestra di contesto di 1 milione di token, output massimo di 384K, solo input testuale e — introdotta con la build GA 0813 — uno stack post-addestramento ricostruito più l'integrazione nativa con Responses-API e Codex, che ha fatto balzare i punteggi del suo agente dal 12,8 della preview al 62,7 su DeepSWE. È anche open-weights: il checkpoint DeepSeek-V4-Pro-0813 è scaricabile su Hugging Face con licenza MIT, dopo un caotico primo giorno in cui il banner di rilascio è stato rimosso e i pesi sono andati brevemente in 404 prima di una nuova pubblicazione con config corretta.
Il divario dei costi in cifre reali
Le schede tariffarie fanno gran parte della discussione da sole:
• OpenAI o3 — $2.00 per milione di input, $8.00 per milione di output, $0.50 per input in cache. I token di reasoning vengono fatturati come output, quindi una domanda difficile consuma token di pensiero prima della risposta.
DeepSeek V4 Pro — $0,435 per milione di input (cache miss), $0,003625 per cache hit, $0,87 per milione di output oggi. L'output è circa 4,6× più economico di o3, mentre l'input con cache hit è di fatto gratuito.
• L'avvertenza con una data — l'aumento di prezzo previsto da DeepSeek per il 17 agosto porta l'output di V4 Pro da 6 yuan a 27 yuan per milione nelle ore di punta (13,5 fuori punta) e l'input con cache-miss da 3 a 9 yuan. Anche con la nuova tariffa di punta, l'output costa una piccola frazione degli 8$ di o3. La finestra per costruire sulla tariffa attuale si misura in giorni, e questo è già parte del calcolo di migrazione.
L'economia per risposta corretta rende il punto più incisivo. I token di ragionamento nascosti di o3 implicano che il suo costo reale per risposta difficile equivalga a diversi multipli della sua tariffa di output. Anche DeepSeek V4 Pro ragiona, e il suo pensiero viene anch'esso fatturato come output, ma a $0.87 la spesa assoluta è un errore di arrotondamento rispetto a una sessione o3 che pensa per un minuto e mezzo. L'inquadramento del costo agente usato da DeepSeek al lancio — circa un divario di 45× nel prezzo per attività rispetto alla frontiera chiusa — è sovrastimato se riferito specificamente a o3, ma la direzione non è in discussione: si tratta di un divario di 4–10× nel costo effettivo a seconda del carico di lavoro.
Dove si colloca realmente il divario di qualità
{{1}}Il punteggio che conta di più è quello indipendente.{{/1}} {{2}}Nell'Intelligence Index di Artificial Analysis, DeepSeek V4 Pro registra 53 e si classifica al #2 dei 104 modelli che l'indice elenca attualmente; o3 si attesta intorno a 30 — un distacco di oltre 20 punti sullo stesso harness.{{/2}} {{3}}Questa è la sintesi più chiara in assoluto di dove due anni di progressi hanno lasciato il flagship del reasoning premium: non viene più semplicemente sottoquotato sul prezzo; viene battuto sull'aggregato indipendente.{{/3}}
Il quadro per singolo benchmark è più caotico e richiede etichette oneste. I numeri di punta degli agenti di DeepSeek V4 Pro — Terminal-Bench 2.1 a 87,9, CyberGym a 83,3, DeepSWE a 62,7, AutomationBench davanti alla frontiera chiusa — sono dichiarazioni della stessa DeepSeek provenienti dal lancio del 0813, non riprodotte in modo indipendente al momento in cui scriviamo, e l'episodio di configurazione errata del rollout significa che nessuno può essere certo che l'API stesse servendo i pesi finali corretti quando sono stati raccolti i primi numeri di terze parti. I benchmark di lancio di o3 sono altrettanto dichiarati dal fornitore, ma sono stati in parte validati da test indipendenti già nel 2025, quando o3 era davvero in testa alle classifiche di ragionamento. In matematica e ragionamento puro, il record pubblicato di o3 appare ancora migliore di quello di DeepSeek V4 Pro — i punti di forza di DeepSeek sono l'uso agenziale di strumenti, la programmazione e i compiti a lungo orizzonte, che sono una suite di test diversa dalle olimpiadi di matematica dominate da o3.

Cosa o3 fa ancora meglio
Due cose sopravvivono intatte al confronto. Primo, la matematica e il ragionamento accurato: il 96,7% di AIME e l'87,7% di GPQA di o3 restano al di sopra di qualsiasi cosa DeepSeek V4 Pro abbia pubblicato, e se il tuo carico di lavoro è una dimostrazione complessa o un problema di competizione, o3 — finché è ancora in funzione — è la risposta più sicura. Secondo, il ragionamento sulle immagini: o3 può ragionare su uno screenshot o un diagramma all'interno della sua catena di pensiero, mentre DeepSeek V4 Pro è solo testo; la build 0813 non ha aggiunto alcun encoder visivo, e se il tuo compito richiede che il modello legga un'immagine, DeepSeek V4 Pro non è un sostituto di o3 in quell'ambito. Nessuno dei due vantaggi è un motivo per restare su un modello in fase di ritiro, ma entrambi sono motivi per essere onesti sul fatto che la migrazione non è un puro miglioramento.
L'altra cosa degna di nota è la differenza dei pesi aperti, che non è affatto un benchmark. o3 era chiuso e ora viene consolidato fino a scomparire; non puoi mantenerlo in esecuzione sul tuo hardware. Il checkpoint 0813 di DeepSeek V4 Pro è tuo, permanentemente, con licenza MIT — gli stessi pesi, lo stesso modello da 1,6 trilioni di parametri, auto-ospitato se hai l'hardware di circa 1,5 terabyte per gestirlo. Per i team che sono stati scottati dipendendo da un modello chiuso che un fornitore poteva ritirare, questa è una risposta strutturale all'esatto problema posto dal ritiro di o3.
Migrazione del carico di lavoro
Per il team API che arriva da o3, DeepSeek V4 Pro è il posto più economico dove atterrare e, sul lavoro agentico e di codifica che costituisce la maggior parte dell'uso effettivo delle API, raramente è un downgrade. I veri problemi sono operativi, non di qualità: V4 Pro è limitato a 500 richieste concorrenti sull'API ufficiale, un tetto che raggiungerai con una flotta di agenti, e i suoi prezzi cambiano il 17 agosto. Entrambe queste cose sono esattamente ciò a cui serve un livello di routing.
Su OrcaRouter, DeepSeek V4 Pro viene offerto al prezzo di listino del provider, applicato con un markup dello 0% — quindi gli odierni $0,44/$0,87 sono disponibili qui lo stesso giorno in cui lo sono su DeepSeek, e quando arriverà la programmazione picco/valle del 17 agosto, verrà rispecchiata qui lo stesso giorno. Una sola chiave dà accesso anche al resto di questa coorte di modelli che sostituiscono o3, e il failover automatico è la soluzione pulita al tetto di 500 richieste concorrenti: indirizza un percorso di produzione verso V4 Pro più un secondo modello sulla stessa chiave e lascia che il router assorba il tetto. OpenAI o3 stesso non è su quella chiave — rimane disponibile tramite l'API di OpenAI e diverse piattaforme di terze parti fino alla scadenza dello snapshot dell'11 dicembre.

Chi favoriscono i calcoli
Per chiunque abbia un workload su {{1}}o3{{/1}} fatto di coding, cicli di agenti o elaborazione di lunghi contesti, non c'è partita: {{2}}DeepSeek V4 Pro{{/2}} batte {{3}}o3{{/3}} nell'indice indipendente, costa una frazione di quella cifra e i suoi pesi aperti significano che questa particolare dipendenza non può esserti ritirata da sotto i piedi. I team che hanno un motivo genuino per tenere in vita {{4}}o3{{/4}} per ora sono quelli di nicchia — ragionamento di matematica pura e dura, e qualsiasi cosa costruita sul pensiero per immagini di {{5}}o3{{/5}} — e anche loro dovrebbero testare le alternative su carichi di lavoro reali prima di dicembre, perché la scadenza non si cura del tuo caso limite. L'era del ragionamento premium che {{6}}o3{{/6}} ha definito è terminata con l'annuncio del suo ritiro; {{7}}DeepSeek V4 Pro{{/7}} è semplicemente dove si trova il posto più economico della prossima era.

Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
