Card del titolo per 'GPT-5 Codex vs GPT-5.6 Sol — Lo specialista del coding vs l'ammiraglia che l'ha fagocitato': grande titolo blu navy, riga del sottotitolo e due card arrotondate — GPT-5 Codex ($1,25 / $10 per 1M · specialista del coding) e GPT-5.6 Sol ($5 / $30 per 1M · generalista di punta) — con il logo OrcaRouter composto in basso a destra.
Guides & Insights

GPT-5 Codex vs GPT-5.6 Sol: lo specialista del codice contro l'ammiraglia che lo ha divorato

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Quando O​penAI ha rilasciato la famiglia G​PT-​5.6 il 9 luglio 2026, ha ritirato silenziosamente l'app autonoma Codex e ha integrato in ChatGPT la modalità agente di coding. La pagina del modello che O​penAI ha scritto per GPT-5.6 Sol sembrava una descrizione del lavoro presa da uno specialista del coding — «ragionamento multi-step profondo, ingegneria del software su larga scala e workflow agentici a lungo orizzonte.» Quindi il confronto tra GPT-5 Codex e GPT-5.6 Sol non è una banale sfida di specifiche. È lo specialista che chiede se il prodotto di punta che ha appena assorbito la sua categoria di prodotto lo abbia anche reso superfluo.

La risposta breve è no — ma il motivo è più interessante di «Codex è ancora valido». GPT-5 Codex resta disponibile sull'API a $1,25 per milione di token in input e $10 per milione di token in output: un agente di ingegneria del software progettato appositamente, ottimizzato per l'automazione di CLI, IDE e GitHub, con punteggi misurati in modo indipendente. GPT-5.6 Sol costa il quadruplo in input e il triplo in output ($5 / $30) ed è il più recente modello di punta generale, con risultati di coding più alti — ma per lo più dichiarati dal fornitore. Ciò che conta davvero in questa accoppiata è il prezzo, il contesto e la differenza tra uno specialista e un generalista che programma bene. Tutto ciò che segue riporta la propria fonte.

Cosa è ciascun modello

GPT-5 Codex è esattamente ciò che dice la sua pagina del modello: "una versione specializzata di GPT-5 ottimizzata per l'ingegneria del software e i flussi di lavoro di codifica." Rilasciato a settembre 2025, è il modello API dietro l'agente di codifica di OpenAI — quello che crea progetti da zero, implementa funzionalità, esegue refactoring su larga scala, revisiona il codice e pianifica modifiche multi-file con una manopola regolabile per lo sforzo di ragionamento. Accetta input di testo e immagini (screenshot per il lavoro UI), ha un contesto di 400K token, un tetto massimo di output di 128K, ed è esplicitamente pensato per applicazioni di codifica agentica: CLI, estensioni IDE, GitHub e attività cloud.

G​PT-​5.6 Sol è il livello di punta della serie G​PT-​5.6, rilasciato il 9 luglio 2026 con un cutoff delle conoscenze di febbraio 2026. È il modello a cui O​penAI affida il lavoro generale più difficile: ragionamento profondo multi-step, ingegneria software su larga scala, agenti a lungo orizzonte, uso del computer e una modalità di ragionamento "ultra" multi-agente. Il suo contesto è di 1,05M token — 2,6 volte quello di GPT-5 Codex — con lo stesso limite massimo di output di 128K, e accetta input di testo, immagini e file. Sol funziona anche all'interno di ChatGPT, quindi quando oggi O​penAI parla di "Codex" in senso di prodotto, di solito intende Sol che svolge lavoro di coding agentico.

Prezzo: un divario di 4x / 3x che si riduce ma non si colma mai

I numeri principali, entrambi calcolati al prezzo di listino del fornitore: GPT-5 Codex a $1,25 / $10 per milione di token (lettura cache $0,125); GPT-5.6 Sol a $5 / $30 (lettura cache $0,50). Ciò equivale a quattro volte il prezzo di input e tre volte il prezzo di output. In una giornata di codifica tipica di dieci milioni di token con una ripartizione 75/25 tra input e output, GPT-5 Codex fattura circa $34; GPT-5.6 Sol fattura circa $112. Il divario non è teorico.

Due fattori lo restringono. Primo, la cache: entrambi i modelli prezzano l'input in cache ben al di sotto dell'input fresco, e i cicli degli agenti rileggono costantemente lo stesso contesto del repository, quindi una grande parte dei token può sfruttare la fascia economica. Secondo, l'efficienza: O​penAI afferma che la generazione 5.6 completa compiti agentici con circa il 54% di token di output in meno rispetto alla generazione precedente. Se Sol richiede solo la metà dei token di output per lo stesso lavoro, il divario per compito si riduce da circa 3,3x a circa 2x — un vero risparmio, ma che non elimina una differenza di prezzo dell'input di 4x, e un'affermazione di efficienza riportata da O​penAI piuttosto che misurata in modo indipendente.

Sol offre anche un prezzo di input a scaglioni: nella pagina del modello di OrcaRouter, la tariffa base di $5 / $30 si applica a richieste fino a 32K token di input, mentre le richieste più grandi vengono fatturate alla fascia superiore di $10 / $45. Questa è la tassa per il contesto lungo — esattamente le richieste che fa un agente per grandi repository. Quindi il confronto pratico dei prezzi dipende dal carico di lavoro ancora più di quanto suggerisca il titolo di 3-4x.

The OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the flagship description, $5.00 input / $30.00 output per 1M tokens, the 1.05M-token context window, and seven-day telemetry (p50 TTFT 3.82s, ~465 tok/s, 39.0M tokens/7d).

Contesto e come chiamarli

Il divario di contesto è il secondo vero elemento di separazione. 400K token coprono una base di codice considerevole, e Codex, essendo uno specialista, è stato progettato per essere efficiente all'interno di quella finestra. Ma un contesto da 1,05M token cambia ciò che puoi dare a un modello: un intero monorepo, lunghe tracce di agenti, una wiki di onboarding più il codice. Per i team che inseriscono interi repository in una singola richiesta, la finestra più ampia fa la differenza tra "il modello può vedere i file pertinenti" e "il modello può vedere i file pertinenti più tutto ciò che li importa." È anche la differenza tra un token di input da $1,25 e uno da $5, motivo per cui la decisione sul contesto è una decisione sui costi.

Entrambi i modelli parlano le stesse due forme API — O​penAI Chat Completions e la Responses API — ed entrambi supportano tool/function calling e output strutturati. Su OrcaRouter, entrambi si trovano dietro un unico endpoint compatibile con O​penAI, quindi passare da uno all'altro è un cambio di nome del modello, non un cambio di integrazione.

Dove i benchmark divergono — e la nota sull'onestà

Il dato interessante è che i due modelli non condividono quasi nessun benchmark. GPT-5 Codex ha punteggi genuinamente indipendenti: Artificial Analysis lo misura con un Intelligence Index di 36.1 e un Coding Index di 38.9, con un Math Index di 98.7, LiveCodeBench a 84.0 e SWE-Bench Verified al 74.5 percento. I numeri di punta di GPT-5.6 Sol — Terminal-Bench 2.1 a 88.8, un Artificial Analysis Coding Agent Index di 80 in max reasoning, Agents' Last Exam a 53.6 — sono quelli che O​penAI ha pubblicato al lancio e non sono stati riprodotti da un valutatore indipendente. "88.8 contro 84.0" non è una gara equa, perché uno di quei numeri è verificato e l'altro è un'affermazione del fornitore. La sintesi onesta: Sol è di una generazione più recente e il suo tetto è chiaramente più alto, ma l'unico punteggio di coding che uno dei due modelli possieda e che un laboratorio indipendente abbia verificato appartiene allo specialista più economico e più vecchio.

Comparison scoreboard for GPT-5 Codex vs GPT-5.6 Sol. Left column GPT-5 Codex: Input price $1.25/1M, Output price $10.00/1M, Context 400K, Released Sep 2025, Coding bench LiveCodeBench 84.0, Cache read $0.125. Right column GPT-5.6 Sol: Input price $5.00/1M, Output price $30.00/1M, Context 1.05M, Released Jul 2026, Coding bench Terminal-Bench 2.1 88.8, Cache read $0.50. Footer: 'Codex figures per Artificial Analysis; Sol figures OpenAI-reported.' OrcaRouter logo composited bottom-right.

Esiste anche un benchmark che la stessa O​penAI contesta. Su SWE-Bench Pro, GPT-5.6 Sol ottiene il 64,6 per cento, mentre Claude Fable 5 è in testa con 80 — e O​penAI ha pubblicamente messo in dubbio la validità del benchmark. In quel caso, il segnale interessante non è il punteggio, ma il fatto che un produttore di punta ora sostiene che il proprio basso risultato sia colpa del benchmark. Per un team di sviluppo, questo è un promemoria a testare il modello sul proprio repository prima di fidarsi di qualsiasi classifica, inclusa la nostra.

Velocità: l'avvertenza sul traffico

Nella telemetria di sette giorni di OrcaRouter, GPT-5.6 Sol mostra una mediana del tempo al primo token di 3,82 secondi e circa 465 token di output al secondo, su 39 milioni di token di traffico. La pagina di GPT-5 Codex sta ancora “raccogliendo” telemetria — il suo traffico attraverso il router è così esiguo che non c'è ancora nulla da mediare. Quel traffico esiguo è di per sé un'informazione: agli occhi del mercato, il lavoro sull'API per agenti di codifica si è già spostato su modelli più recenti. Non significa che GPT-5 Codex sia lento o rotto; significa che “quale sia più veloce” non è una domanda a cui si può rispondere con i dati del router finché qualcuno non vi fa passare un volume reale.

Quale dovresti scegliere?

Scegli GPT-5 Codex se…

Il tuo carico di lavoro è davvero {{1}}fatto di codice{{/1}}: gestisci un agente che modifica codice, rivede pull request, esegue refactoring, scrive test e lavora dentro un IDE o un harness CLI. Vuoi la {{2}}concentrazione dello specialista{{/2}}, l'input {{3}}quattro volte più economico{{/3}} e {{4}}l'unico punteggio di coding verificato in modo indipendente in questo confronto{{/4}}. GPT-5 Codex è anche la scelta giusta se vuoi la {{5}}semantica da agente-coder di O​penAI{{/5}} — la manopola dello sforzo di ragionamento, il ciclo d'uso degli strumenti — senza pagare prezzi da flagship per capacità generali che non userai.

Scegli GPT-5.6 Sol se…

Il tuo lavoro mescola coding con ragionamento generale complesso, agenti a lungo orizzonte, uso del computer o input basati su file — oppure vuoi semplicemente un unico prodotto di punta per tutto. Il contesto da 1.05M, la modalità ultra multi-agente, l'addestramento più recente e l'integrazione con i prodotti ChatGPT e Codex favoriscono tutti Sol. I suoi numeri di coding sono più alti sulla carta e, su un benchmark in cui il vendor crede, è il miglior agente di coding che O​penAI abbia mai rilasciato. Stai pagando da tre a quattro volte di più per token per questa ampiezza; la questione dell'efficienza dei token riduce il divario sui compiti in cui Sol vince davvero.

La risposta è spesso entrambe le cose — instrada in base all'attività.

Poiché entrambi sono attivi su OrcaRouter con margine zero, la configurazione più solida non è affatto una scelta. Punta il volume orientato al coding su GPT-5 Codex — lo specialista da $1,25 / $10 — ed esegui l'escalation solo dei task che richiedono l'ampiezza di un modello di punta verso GPT-5.6 Sol a $5 / $30. Una sola API key, un unico endpoint compatibile O​penAI, un cambio di nome del modello quando instradi, e failover automatico se un provider ha un'ora difficile. Il pass-through conta in un modo specifico qui: i $1,25 / $10 e $5 / $30 che budgetizzi sono i prezzi di listino dei provider, quindi un futuro taglio dei prezzi di O​penAI è attivo sul nostro endpoint lo stesso giorno in cui viene annunciato, e la tua logica di routing non deve cambiare.

The OrcaRouter model page for GPT-5 Codex (openai/gpt-5-codex), showing the $1.25 input / $10.00 output per 1M pricing, the 400K-token context window, the description of the specialized software-engineering model, and 'Collecting...' telemetry placeholders on thin traffic.

Domande che questo solleva

GPT-5.6 Sol ha sostituito GPT-5 Codex?

Sì, nel prodotto: l'app standalone di Codex è stata integrata in ChatGPT con il lancio della versione 5.6, e Sol è il motore che alimenta la modalità coding-agent al suo interno. Nell'API, invece, no: GPT-5 Codex è ancora un modello attivo e servito, con un proprio prezzo, e molte pipeline di agenti continuano a utilizzarlo perché è progettato appositamente ed è economico.

Il codice di Sol è davvero migliore di quello di Codex?

Sui numeri pubblicati da OpenAI, sì — Terminal-Bench 2.1 a 88.8 contro LiveCodeBench di Codex a 84.0 — ma sono benchmark diversi, e i dati di Sol sono dichiarati dal vendor mentre quelli di Codex sono misurati in modo indipendente. Testa sul tuo repository; è l'unico punteggio che conta.

Perché qualcuno dovrebbe ancora usare GPT-5 Codex?

Prezzo e adattamento. A un quarto del prezzo di input di Sol, una pipeline dedicata per agenti di codifica che non necessita mai dell'ampiezza del modello ammiraglia generale fa risparmiare denaro reale per milione di token, e la focalizzazione dello specialista significa meno modellazione dei prompt per mantenerlo sul lavoro di codifica.

Il motivo per cui questo confronto merita attenzione è che O​penAI ha integrato la risposta nel proprio prodotto. L'azienda ha passato un anno a vendere uno specialista del codice, per poi assorbirlo in un flagship generalista che scrive codice abbastanza bene da conquistare la corona dello specialista — lasciando comunque lo specialista sull'API a una frazione del prezzo. Non è un trucco: è il prezzo minimo per "vogliamo l'agente di codifica senza pagare il flagship". GPT-5 Codex è lo specialista economico, mirato e misurato in modo indipendente. GPT-5.6 Sol è il flagship più recente, più ampio e più costoso, le cui affermazioni sul codice dovresti verificare sul tuo lavoro. La maggior parte dei team di produzione scoprirà che la risposta onesta è entrambi — e con entrambi su un unico endpoint pass-through, il routing tra i due è una configurazione, non una migrazione.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube