
GPT-5.6 Sol API: come chiamarla, quanto costa e quando fare downgrade
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 58 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 372 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
To call the GPT-5.6 Sol API you send model: "gpt-5.6-sol" to https://api.openai.com/v1/chat/completions — or to the Responses API, the recommended route for new builds — and you are billed $5 per million input tokens and $30 per million output. The same model id works through any OpenAI-compatible gateway: GPT-5.6 Sol on OrcaRouter passes that list price through with $0 per-token markup, and with bring-your-own-key the request bills your existing account directly. Sol is the flagship tier of the GPT-5.6 family, released July 9, 2026, with a ~1.05M-token context window. The decision that actually matters is not which dialect you call but whether the task earns the $30 output rate — this guide covers the exact request shapes, the reasoning dial that controls the real cost, and the honest case for routing volume elsewhere.
I due dialetti e l'unico id del modello
La maggior parte dei tutorial su GPT-5.6 Sol mostra un solo dialetto e si ferma lì. Ce ne sono due, ed entrambi raggiungono gli stessi pesi.
• Chat Completions — /v1/chat/completions. POST to https://api.openai.com/v1/chat/completions with an Authorization: Bearer header carrying your OpenAI key. The body takes model: "gpt-5.6-sol", a messages array, and your chosen reasoning effort. This is the dialect the standard OpenAI Python and TypeScript SDKs send by default.
• Responses API — client.responses.create. Lo stesso ID del modello con una nuova struttura di richiesta: un singolo input campo e un reasoning blocco ({"effort": "high"}) invece dell'array messages. OpenAI lo consiglia per le nuove applicazioni perché accetta i parametri di reasoning direttamente e restituisce i token di reasoning come output di prima classe — e il livello di effort più alto è disponibile solo qui.
• Fissa il livello. L'alias semplice gpt-5.6 instrada a Sol oggi, ma un alias è esattamente ciò che un fornitore cambia quando esce una nuova ammiraglia. Passare gpt-5.6-sol esplicitamente significa che ogni chiamata dichiara il proprio costo, ed è l'id che ogni gateway si aspetta.
Cosa ottieni — e il selettore che decide la tua bolletta
GPT-5.6 Sol è il flagship di OpenAI incentrato sul ragionamento: una finestra di contesto di ~1,05M di token, un massimo di 128K token in output, un knowledge cutoff al 16 febbraio 2026 e input di testo, immagini e file con output di testo. Nella classifica indipendente di Artificial Analysis registra un AA Intelligence Index di 61 e un punteggio AA Coding di 77, con un punteggio SWE-bench Pro del 64,6%, misurato in modo indipendente da llm-stats — è il numero del coding quello che la community degli agenti cita davvero.

Il pensiero è attivato per impostazione predefinita, e il parametro dello sforzo di ragionamento è la leva più grande sia sulla latenza che sul costo:
• Sei livelli — none, low, medium, high, xhigh, max. none disattiva il ragionamento per le attività meccaniche; max è per problemi ad alto costo di errore ed è disponibile solo tramite l'API Responses.
• Inizia dal livello medio e sali di un livello alla volta. Il tutorial di apidog su GPT-5.6 osserva che molti carichi di lavoro GPT-5.5 mantengono la propria qualità un livello inferiore sulla famiglia 5.6 — misura la qualità prima di pagare per più ragionamento.
• La modalità Pro è un'impostazione, non un modello. Imposta reasoning.mode: "pro" e il modello dà priorità alla qualità delle risposte rispetto alla velocità. Il prezzo e l'ID del modello non cambiano.
• Verbosità — basso, medio (predefinito), alto — controlla la lunghezza dell'output indipendentemente dal ragionamento.
• I token di reasoning vengono fatturati come output a 30 dollari per milione. Sui prompt difficili a xhigh o max, il reasoning interno può dominare la fattura — la parte nascosta della tariffazione dei modelli di reasoning che il prezzo di listino non mostra mai.
Quanto costa davvero Sol
Il prezzo base di Sol è rimasto invariato dopo il taglio dei prezzi di OpenAI del 30 luglio 2026: $5 per milione di token di input e $30 per milione di token di output. Il taglio ha colpito i due livelli più economici — GPT-5.6 Terra è sceso a $2 / $12 e GPT-5.6 Luna a $0.20 / $1.20 — il che è importante qui perché è il confronto esatto che ti dice quando Sol è un overkill.

Tre modificatori cambiano il tasso effettivo:
• Cache dei prompt. L'input riutilizzato viene fatturato a circa $0.50 per milione per una lettura in cache — 90% in meno rispetto all'input non in cache — e le scritture in cache vengono fatturate a $6.25 per milione (1,25 volte la tariffa dell'input non in cache). La cache è implicita per impostazione predefinita e può essere resa esplicita tramite prompt_cache_options con un ttl; il prefisso in cache richiede almeno 1.024 token e rimane caldo per almeno 30 minuti.
• Livelli di contesto lungo. Superata una certa dimensione di input, Sol passa a $10 / $45 per milione. Alcuni prompt molto lunghi spostano silenziosamente il tuo prezzo medio.
• Tutto ciò che il modello emette è output. Ciò include i token di ragionamento interno, quindi nelle chiamate con un uso intensivo del ragionamento la componente di output è quella su cui si concentra il costo.
Una fattura concreta: una richiesta da 100K token che produce 20K token di output costa $0.50 per l'input e $0.60 per l'output — $1.10 senza cache. Se quel prompt da 100K viene servito dalla cache alla chiamata successiva, il costo dell'input scende a circa $0.05 e il giro completo si assesta intorno a $0.65. In un lungo loop di agenti che riutilizza lo stesso system prompt tutto il giorno, la cache fa la differenza tra Sol conveniente e no.
Sol esegue esperimenti di calcolo quantistico: il resoconto di OpenAI
La più forte risposta attuale a ciò che la tariffa di $5 / $30 compra è un caso d'uso che OpenAI stessa ha pubblicato l'8 settembre 2026 — un post ufficiale, “Come GPT-5.6 Sol aiuta a eseguire esperimenti di calcolo quantistico,” e riguarda l'applicazione del modello a hardware di laboratorio reale piuttosto che a un altro benchmark di codifica. In esso, OpenAI descrive Beatriz Yankelevich, una studentessa di dottorato del gruppo Engineering Quantum Systems Group (EQuS) del MIT — un laboratorio che studia qubit superconduttori raffreddati a temperature vicine allo zero assoluto — che collega GPT-5.6 Sol, eseguito tramite Codex, al software che coordina le misurazioni sui suoi chip. Date le competenze specifiche per le misurazioni e gli obiettivi di progettazione del chip, GPT-5.6 Sol ha scelto i parametri di misura, ha pilotato l'hardware, ha analizzato i dati di ritorno e ha deciso cosa perfezionare o salvare. Su un chip a sei qubit non calibrato ha completato la sequenza di calibrazione standard con un intervento minimo del ricercatore: ha trovato la frequenza di transizione di ciascun qubit, ha calibrato gli impulsi che controllano e leggono il qubit, e ha misurato per quanto tempo il qubit conservava l'informazione quantistica.
OpenAI è trasparente riguardo al limite, e la precisazione va letta insieme all'affermazione: quando i segnali sperimentali erano deboli o rumorosi, Sol impiegava più tempo per trovare parametri utilizzabili e talvolta aveva bisogno di un ricercatore esperto per essere indirizzato. Considera il post come riportato da OpenAI — un case study del fornitore piuttosto che un benchmark indipendente — e prendi il suo segnale reale come profilo del carico di lavoro. EQuS ora consente agli agenti di eseguire la caratterizzazione di routine dei chip durante la notte, un lavoro che in precedenza richiedeva diversi giorni del tempo di un ricercatore per chip. Questa è la forma di compito per cui esiste il quadrante del ragionamento: cicli lunghi, multi-step, con uso di strumenti, in cui il modello decide cosa fare dopo e una mossa sbagliata è costosa. Sono anche gli stessi gpt-5.6-sol pesi che ottieni tramite l'API — Codex è l'infrastruttura, non un modello diverso.
Un unico endpoint, oltre 200 modelli
If you are reading a GPT-5.6 Sol API guide you already have an integration or are about to write one, and the real question is how many more you want to maintain. OrcaRouter puts 200+ models behind one OpenAI-compatible endpoint: the same base URL (https://api.orcarouter.ai/v1), the same client, and a different model id per model — openai/gpt-5.6-sol today, a cheaper tier or a different family when the workload stops earning Sol's rate, all without a code change.

La parte economica è quella onesta. OrcaRouter aggiunge $0 per token — i $5 / $30 sulla pagina del modello sono la tariffa di OpenAI in pass-through, e una modifica del prezzo del fornitore è attiva dal nostro lato il giorno stesso in cui viene annunciata. porta-la-tua-chiave è un'opzione di prima classe: consegna la tua chiave OpenAI esistente, mantieni i tuoi limiti di frequenza e i tuoi crediti, e OpenAI ti fattura direttamente. Le salvaguardie — uno scudo PII e una policy sui contenuti — vengono applicate prima che la richiesta venga fatturata, non dopo. Il DSL di routing compone il failover così un modello più economico risponde quando Sol va in errore o quando la forma del tuo traffico lo consente.
Quando Sol è nel tier sbagliato
Essere l'ammiraglia non equivale a essere la scelta giusta per ogni chiamata, e ci sono tre casi in cui la tariffa da $5 / $30 perde.
• Chiamate ad alto volume e basso rischio. Una pipeline di classificazione o estrazione che elabora 10M token di input al mese costa $50 su Sol contro $2 su GPT-5.6 Luna — stesso endpoint, stessa chiave, un solo cambio di id. Luna a $0.20 / $1.20 ha un prezzo pensato esattamente per questo tipo di lavoro.
• Ragionamento di fascia media che non richiede profondità di frontiera. GPT-5.6 Terra a $2 / $12 si colloca tra la fascia volume e quella flagship. Il consiglio del tutorial di apidog è la scelta predefinita più sensata: prototipare su Terra, passare a Sol solo dove Terra fallisce in modo misurabile, e spingere i percorsi stabili ad alto volume fino a Luna.
• Il confine di ciò che possiamo promettere. OrcaRouter instrada e fattura; OpenAI esegue i pesi. L'endpoint, il ricarico zero, il failover e i guardrail sono nostri, ma la qualità dell'inferenza e il comportamento di sicurezza sono di OpenAI, e con BYOK il denaro va direttamente a loro. Questo è l'accordo, detto chiaramente: paghi comunque la tariffa del provider, e la domanda è se un solo endpoint per 200+ modelli ne valga la pena.
Il risultato finale
Chiama l'API GPT-5.6 Sol con Chat Completions se hai un client OpenAI esistente, e con l'API Responses se stai sviluppando da zero — l'ID del modello gpt-5.6-sol, la tariffa $5 / $30, e la stessa manopola di ragionamento in entrambi i casi. È il modello giusto quando il compito è difficile, il contesto è lungo, e l'output vale $30 per milione di token — e il modello sbagliato quando il compito è di routine, dove Terra e Luna costano una frazione del prezzo. La configurazione più pulita è quella che ti consente di cambiare idea: un endpoint, la tua chiave, margine $0, e un ID modello che puoi sostituire il giorno in cui cambia il carico di lavoro.
GPT-5.6 Sol è disponibile su OrcaRouter al prezzo di listino OpenAI di $5 / $30 con markup di $0 per token — porta la tua chiave OpenAI esistente e il provider ti fattura direttamente. Inizia con GPT-5.6 Sol su OrcaRouter — un solo endpoint, nessuna seconda integrazione.
