Card hero dell'articolo che riporta 'OpenAI o3 vs DeepSeek V4 Pro' con il badge 'CONFRONTO MODELLI' e il sottotitolo 'L'era del reasoning premium finisce dove si apre il divario di prezzo', con un'icona di etichetta premium a sinistra e un'icona di monete a destra, e il logo OrcaRouter in basso a destra.
Guides & Insights

OpenAI o3 vs DeepSeek V4 Pro: L'era del ragionamento premium finisce dove si apre il divario di prezzo

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il confronto tra Ope​nAI o3 e DeepSeek V4 Pro è davvero uno scontro tra due numeri. Ope​nAI o3, rilasciato il 16 aprile 2025, era il punto di riferimento per il ragionamento premium: il modello per cui si pagava di più quando il costo di una risposta sbagliata era superiore al costo dei token. DeepSeek V4 Pro, passato alla disponibilità generale come build 0813 il 13 agosto 2026 dopo un rilascio serale in sordina e una distribuzione che ha incluso un annuncio ritirato e pesi ricaricati, è il modello che ha fatto sembrare quel premium un errore di categoria: un indice indipendente che si colloca sopra quello di o3, a circa un quinto del prezzo, per di più con pesi aperti. E la collisione è timestampata, perché Ope​nAI o3 lascia ChatGPT il 26 agosto 2026, i suoi snapshot API seguono l'11 dicembre, e ogni settimana del confronto favorisce il modello che non sta andando via.

Due modelli usciti a distanza di un anno in filosofia.

o3 è l'ammiraglia del puro ragionamento: un modello chiuso addestrato a pensare a lungo prima di rispondere, con una finestra di contesto di 200K, fino a 100K di output e input di immagini integrato nella sua catena di pensiero. Secondo i dati della stessa Ope​nAI ha fissato il livello per il 2025 — 96,7% su AIME 2024, 87,7% su GPQA Diamond, 69,1% su SWE-bench Verified senza scaffolding, un Elo Codeforces di 2727 — e in seguito Ope​nAI ha ridotto il prezzo da $10/$40 a $2/$8 per milione di token, prezzo a cui si trova ancora. DeepSeek V4 Pro ha un'economia completamente diversa: un modello mistura di esperti da 1,6 trilioni di parametri con circa 49 miliardi attivi per token, una finestra di contesto di 1 milione di token, output massimo di 384K, solo input testuale e — introdotta con la build GA 0813 — uno stack post-addestramento ricostruito più l'integrazione nativa con Responses-API e Codex, che ha fatto balzare i punteggi del suo agente dal 12,8 della preview al 62,7 su DeepSWE. È anche open-weights: il checkpoint DeepSeek-V4-Pro-0813 è scaricabile su Hugging Face con licenza MIT, dopo un caotico primo giorno in cui il banner di rilascio è stato rimosso e i pesi sono andati brevemente in 404 prima di una nuova pubblicazione con config corretta.

Il divario dei costi in cifre reali

Le schede tariffarie fanno gran parte della discussione da sole:

OpenAI o3 — $2.00 per milione di input, $8.00 per milione di output, $0.50 per input in cache. I token di reasoning vengono fatturati come output, quindi una domanda difficile consuma token di pensiero prima della risposta.

DeepSeek V4 Pro — $0,435 per milione di input (cache miss), $0,003625 per cache hit, $0,87 per milione di output oggi. L'output è circa 4,6× più economico di o3, mentre l'input con cache hit è di fatto gratuito.

• L'avvertenza con una data — l'aumento di prezzo previsto da DeepSeek per il 17 agosto porta l'output di V4 Pro da 6 yuan a 27 yuan per milione nelle ore di punta (13,5 fuori punta) e l'input con cache-miss da 3 a 9 yuan. Anche con la nuova tariffa di punta, l'output costa una piccola frazione degli 8$ di o3. La finestra per costruire sulla tariffa attuale si misura in giorni, e questo è già parte del calcolo di migrazione.

L'economia per risposta corretta rende il punto più incisivo. I token di ragionamento nascosti di o3 implicano che il suo costo reale per risposta difficile equivalga a diversi multipli della sua tariffa di output. Anche DeepSeek V4 Pro ragiona, e il suo pensiero viene anch'esso fatturato come output, ma a $0.87 la spesa assoluta è un errore di arrotondamento rispetto a una sessione o3 che pensa per un minuto e mezzo. L'inquadramento del costo agente usato da DeepSeek al lancio — circa un divario di 45× nel prezzo per attività rispetto alla frontiera chiusa — è sovrastimato se riferito specificamente a o3, ma la direzione non è in discussione: si tratta di un divario di 4–10× nel costo effettivo a seconda del carico di lavoro.

Dove si colloca realmente il divario di qualità

{{1}}Il punteggio che conta di più è quello indipendente.{{/1}} {{2}}Nell'Intelligence Index di Artificial Analysis, DeepSeek V4 Pro registra 53 e si classifica al #2 dei 104 modelli che l'indice elenca attualmente; o3 si attesta intorno a 30 — un distacco di oltre 20 punti sullo stesso harness.{{/2}} {{3}}Questa è la sintesi più chiara in assoluto di dove due anni di progressi hanno lasciato il flagship del reasoning premium: non viene più semplicemente sottoquotato sul prezzo; viene battuto sull'aggregato indipendente.{{/3}}

Il quadro per singolo benchmark è più caotico e richiede etichette oneste. I numeri di punta degli agenti di DeepSeek V4 Pro — Terminal-Bench 2.1 a 87,9, CyberGym a 83,3, DeepSWE a 62,7, AutomationBench davanti alla frontiera chiusa — sono dichiarazioni della stessa DeepSeek provenienti dal lancio del 0813, non riprodotte in modo indipendente al momento in cui scriviamo, e l'episodio di configurazione errata del rollout significa che nessuno può essere certo che l'API stesse servendo i pesi finali corretti quando sono stati raccolti i primi numeri di terze parti. I benchmark di lancio di o3 sono altrettanto dichiarati dal fornitore, ma sono stati in parte validati da test indipendenti già nel 2025, quando o3 era davvero in testa alle classifiche di ragionamento. In matematica e ragionamento puro, il record pubblicato di o3 appare ancora migliore di quello di DeepSeek V4 Pro — i punti di forza di DeepSeek sono l'uso agenziale di strumenti, la programmazione e i compiti a lungo orizzonte, che sono una suite di test diversa dalle olimpiadi di matematica dominate da o3.

A two-column scoreboard for OpenAI o3 vs DeepSeek V4 Pro: left column o3 shows $2/$8 pricing, 200K context, closed weights, Artificial Analysis Index around 30, math-and-reasoning strength, retiring August 26 2026; right column DeepSeek V4 Pro shows $0.44/$0.87 pricing today, 1M context, MIT open weights, Artificial Analysis Index 53 (#2 of 104), agentic-and-coding strength, GA August 13 2026. Footer: o3 figures partly independent; DeepSeek agent benchmarks vendor-reported. OrcaRouter logo bottom-right.

Cosa o3 fa ancora meglio

Due cose sopravvivono intatte al confronto. Primo, la matematica e il ragionamento accurato: il 96,7% di AIME e l'87,7% di GPQA di o3 restano al di sopra di qualsiasi cosa DeepSeek V4 Pro abbia pubblicato, e se il tuo carico di lavoro è una dimostrazione complessa o un problema di competizione, o3 — finché è ancora in funzione — è la risposta più sicura. Secondo, il ragionamento sulle immagini: o3 può ragionare su uno screenshot o un diagramma all'interno della sua catena di pensiero, mentre DeepSeek V4 Pro è solo testo; la build 0813 non ha aggiunto alcun encoder visivo, e se il tuo compito richiede che il modello legga un'immagine, DeepSeek V4 Pro non è un sostituto di o3 in quell'ambito. Nessuno dei due vantaggi è un motivo per restare su un modello in fase di ritiro, ma entrambi sono motivi per essere onesti sul fatto che la migrazione non è un puro miglioramento.

L'altra cosa degna di nota è la differenza dei pesi aperti, che non è affatto un benchmark. o3 era chiuso e ora viene consolidato fino a scomparire; non puoi mantenerlo in esecuzione sul tuo hardware. Il checkpoint 0813 di DeepSeek V4 Pro è tuo, permanentemente, con licenza MIT — gli stessi pesi, lo stesso modello da 1,6 trilioni di parametri, auto-ospitato se hai l'hardware di circa 1,5 terabyte per gestirlo. Per i team che sono stati scottati dipendendo da un modello chiuso che un fornitore poteva ritirare, questa è una risposta strutturale all'esatto problema posto dal ritiro di o3.

Migrazione del carico di lavoro

Per il team API che arriva da o3, DeepSeek V4 Pro è il posto più economico dove atterrare e, sul lavoro agentico e di codifica che costituisce la maggior parte dell'uso effettivo delle API, raramente è un downgrade. I veri problemi sono operativi, non di qualità: V4 Pro è limitato a 500 richieste concorrenti sull'API ufficiale, un tetto che raggiungerai con una flotta di agenti, e i suoi prezzi cambiano il 17 agosto. Entrambe queste cose sono esattamente ciò a cui serve un livello di routing.

Su OrcaRouter, DeepSeek V4 Pro viene offerto al prezzo di listino del provider, applicato con un markup dello 0% — quindi gli odierni $0,44/$0,87 sono disponibili qui lo stesso giorno in cui lo sono su DeepSeek, e quando arriverà la programmazione picco/valle del 17 agosto, verrà rispecchiata qui lo stesso giorno. Una sola chiave dà accesso anche al resto di questa coorte di modelli che sostituiscono o3, e il failover automatico è la soluzione pulita al tetto di 500 richieste concorrenti: indirizza un percorso di produzione verso V4 Pro più un secondo modello sulla stessa chiave e lascia che il router assorba il tetto. Ope​nAI o3 stesso non è su quella chiave — rimane disponibile tramite l'API di Ope​nAI e diverse piattaforme di terze parti fino alla scadenza dello snapshot dell'11 dicembre.

Screenshot of the Artificial Analysis model page for o3 showing its rank of #107/182 on the Intelligence Index, a score of 31 (below the median of 35), a 200K-token context window, $2.00 per 1M input and $8.00 per 1M output pricing, and a 118 tokens-per-second speed reading.

Chi favoriscono i calcoli

Per chiunque abbia un workload su {{1}}o3{{/1}} fatto di coding, cicli di agenti o elaborazione di lunghi contesti, non c'è partita: {{2}}DeepSeek V4 Pro{{/2}} batte {{3}}o3{{/3}} nell'indice indipendente, costa una frazione di quella cifra e i suoi pesi aperti significano che questa particolare dipendenza non può esserti ritirata da sotto i piedi. I team che hanno un motivo genuino per tenere in vita {{4}}o3{{/4}} per ora sono quelli di nicchia — ragionamento di matematica pura e dura, e qualsiasi cosa costruita sul pensiero per immagini di {{5}}o3{{/5}} — e anche loro dovrebbero testare le alternative su carichi di lavoro reali prima di dicembre, perché la scadenza non si cura del tuo caso limite. L'era del ragionamento premium che {{6}}o3{{/6}} ha definito è terminata con l'annuncio del suo ritiro; {{7}}DeepSeek V4 Pro{{/7}} è semplicemente dove si trova il posto più economico della prossima era.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro showing a 1M-token context window, 384K max output, $0.44 per 1M input and $0.88 per 1M output tokens, and Tools/JSON/Reasoning capability chips.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube