Una scheda di titolo che confronta GPT-5.6 Luna e Claude Haiku 4.5, mostrando Luna con un Indice di Intelligenza di 38, una finestra di contesto di 1M token e un prezzo di $0,20 per l'input e $1,20 per l'output per milione di token, contro Haiku 4.5 con un Indice di Intelligenza di 18, un contesto di 200K token e un prezzo di $1,00 per l'input e $5,00 per l'output.
Guides & Insights

GPT-5.6 Luna vs Claude Haiku 4.5: fascia economica, due bollette molto diverse

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

GPT-5.6 Luna e Claude Haiku 4.5 sono i livelli economici di due diverse famiglie di frontiera, e il divario tra loro dipende interamente da quale numero si guarda. Sul prezzo di listino è una disfatta: 0,20 $ per milione di token in input contro 1,00 $. Sul costo per attività completata dell'Intelligence Index di Artificial Analysis, è 0,18 $ contro 0,21 $ — una differenza di circa il 14%. Gli stessi due modelli, due risposte oneste, e il motivo per cui divergono è la cosa più utile da capire prima di sceglierne uno.

In breve: Luna è il modello più forte sulla carta e il più veloce in termini di throughput, ma ragiona a lungo e te lo fa pagare. Haiku 4.5 è più vecchio, ha una portata più limitata ed è considerevolmente più prevedibile in quanto costerà una richiesta. Quale di questi aspetti conti di più è una proprietà del tuo carico di lavoro, non dei modelli.

A colpo d'occhio

Fornitore — Open​AI vs Anth​hropic

Rilasciato — 9 luglio 2026 vs 15 ottobre 2025

Finestra di contesto — 1M token vs 200K token

Output massimo — 128K token vs 64K token

Input — testo, immagine e file vs testo, immagine e PDF

Prezzo per milione di token — 0,20 $ in input / 1,20 $ in output rispetto a 1,00 $ in input / 5,00 $ in output

Artificial Analysis Intelligence Index — 38, 4º su 177 vs 18, 138º su 200 (entrambi in configurazione di ragionamento)

Costo per attività dell'Intelligence Index — 0,18 $ vs 0,21 $

Velocità di output — 109,4 token/sec contro 84,7 token/sec

Controllo del ragionamento — una manopola dello sforzo da nessuno a massimo vs pensiero esteso abilitato manualmente, senza parametro di sforzo

Data limite affidabile delle conoscenze — febbraio 2026 vs febbraio 2025 (dati di addestramento fino a luglio 2025)

Impegno al pensionamento — nessuno pubblicato vs non prima del 15 ottobre 2026

Dove GPT-5.6 Luna vince davvero

Screenshot of an Artificial Analysis head-to-head between GPT-5.6 Luna (max) and Claude 4.5 Haiku (Reasoning). The Intelligence Index row reads 38 against 18, AA-Briefcase 1339 against 614, GDPval-AA v2 1489 against 854, AutomationBench-AA 50% against 3%, Terminal-Bench v4.0 12% against 0%, SciCode 54% against 42%, Humanity's Last Exam 39% against 10%, GDPpdf 24% against 4%, CritPt 21% against 0%, AA-Omniscience -10 against -4, and AA-LCR v1.1 84% against 74%. The Cost section shows a blended price per 1M tokens of $0.174 against $0.77.

Capacità, con un ampio margine. Un Indice di Intelligenza di 38 contro 18 non è una gara equilibrata. Luna supera Haiku nel punteggio composito che Artificial Analysis costruisce a partire da valutazioni di ragionamento, conoscenza, matematica e programmazione, e lo fa pur essendo il modello più economico per token. Chi ha confrontato per l'ultima volta queste due famiglie sull'indice pre-settembre — in cui Luna registrava 51 e 52 — dovrebbe notare che l'intera scala è stata ricalcolata a settembre 2026, e il vantaggio di Luna è sopravvissuto al ricalcolo.

Il contesto, cinque volte tanto. Una finestra da 1M di token contro 200K decide da sola un'intera categoria di lavoro: passaggi sull'intero repository, insiemi di documenti lunghi, trascrizioni estese di agenti che su Haiku richiederebbero una summarizzazione. Se la tua applicazione è definita da quanto contesto deve contenere, il confronto finisce qui.

Margine di output, raddoppiato. Un massimo di 128K token di output rispetto a 64K conta per la generazione di testi lunghi e per i cicli agentici che restituiscono piani strutturati anziché risposte di una sola riga.

Throughput. 109,4 token di output al secondo contro 84,7 rappresenta una differenza concreta per le interfacce in streaming, anche se non è la stessa cosa della reattività — vedi la sezione sulla latenza qui sotto.

Il prezzo, sull'etichetta. Cinque volte più economico in input e circa quattro volte più economico in output non è un errore di arrotondamento, e per i lavori con output breve è l'intera decisione.

Dove Claude Haiku 4.5 merita ancora il suo posto

Costo prevedibile. Il reasoning di Haiku 4.5 è un extended thinking che si attiva manualmente. Se lasciato disattivato, risponde direttamente e fattura in modo prevedibile. La manopola dell'effort di GPT-5.6 Luna arriva fino al massimo, e ogni passo verso l'alto significa più token di output alla tariffa di output. Un team che vuole un tetto di costo dichiarabile in anticipo troverà Haiku più facile da valutare, anche a un prezzo di listino più alto.

La configurazione non di ragionamento è davvero economica da eseguire. Artificial Analysis assegna alla configurazione non di ragionamento di Claude 4.5 Haiku un Intelligence Index di 15, senza alcun dato pubblicato sul costo per attività, ed è una scelta ragionevole per lavori in cui l'asticella è semplicemente "analizzare correttamente questo": classificazione delle intenzioni, estrazione di campi, decisioni di instradamento, triage della moderazione. Su questi compiti il divario di indice tra 15 e 38 è in gran parte irrilevante, perché a nessuno dei due modelli viene chiesto di ragionare.

Il caching e gli sconti batch sono maturi. Haiku 4.5 offre uno sconto del 90% sulla lettura della cache dei prompt e uno sconto del 50% sulla Batch API. Luna ha un'economia della cache comparabile, quindi siamo più vicini a un pareggio che a un vantaggio — ma se la tua pipeline già raggruppa tramite gli strumenti di Anthropic, il costo di migrazione per abbandonare Haiku è un costo reale, e non emergerà in alcun benchmark.

Un track record operativo. Haiku 4.5 è in produzione da ottobre 2025 e reca un impegno di dismissione pubblicato non prima del 15 ottobre 2026. Luna ha due mesi. Per un carico di lavoro in cui il modello è un dettaglio più che il prodotto, una storia produttiva di undici mesi vale qualcosa che un benchmark non può esprimere.

È il modello più veritiero, sull'unico asse che lo misura. Il confronto testa a testa di Artificial Analysis mette Luna in vantaggio su quasi ogni riga di capacità: AA-Briefcase 1.339 contro 614, GDPval-AA v2 1.489 contro 854, AutomationBench-AA 50% contro 3%, Humanity's Last Exam 39% contro 10%, GDPpdf 24% contro 4%. L'eccezione è AA-Omniscience, che penalizza le risposte sbagliate date con sicurezza su domande di conoscenza: Luna ottiene -10, contro il -4 di Haiku. Un punteggio negativo significa che la penalità per allucinazione supera il credito di accuratezza, e la penalità di Luna è maggiore. Un indice composito più alto non è la stessa cosa di una risposta più affidabile, e sull'unica valutazione creata per separare queste due cose, il modello più vecchio se la cava meglio.

Il calcolo dei costi su un carico di lavoro reale

Prendi una pipeline che consuma 100M token di input ed emette 20M token di output al mese.

GPT-5.6 Luna — 100 × $0.20 = $20, più 20 × $1.20 = $24. Totale $44 al mese.

Claude Haiku 4.5 — 100 × $1.00 = $100, più 20 × $5.00 = $100. Totale $200 al mese.

A quei rapporti Luna costa circa 4,5 volte meno, e questo è il calcolo che pubblica la maggior parte dei confronti. Ora cambia un'ipotesi. Se lo sforzo di ragionamento di Luna viene aumentato, i suoi token di output aumentano, e l'output è il lato costoso — a $1,20 costa sei volte quanto l'input. Spingi Luna al punto in cui emette 150M token di output per lo stesso volume di lavoro, come fa sul set di valutazione di Artificial Analysis, e i $44 diventano comodamente oltre $180. Il fattore 4,5x crolla verso la parità.

La lezione non è che Luna sia costosa. È che il vantaggio di prezzo di Luna è funzione di quanto parla, che è un parametro che controlli tu. Abbassa il ragionamento per estrazione e classificazione e lo sconto è reale. Lascialo al massimo per tutto e hai comprato un modello più capace a un prezzo che non assomiglia più al suo prezzo di listino.

Latenza, e un numero di cui non dovresti fidarti

Le cifre pubblicate sul tempo al primo token per questi due modelli sono quasi inutili, e vale la pena capire perché. Su Artificial Analysis, le configurazioni di ragionamento di entrambi i modelli mostrano latenze al primo token nell'ordine delle decine o addirittura delle centinaia di secondi, perché l'harness non emette un token finché il modello non ha terminato il ragionamento. Quella cifra misura l'impostazione della valutazione, non la reattività del modello.

La telemetria di routing è una fonte migliore, perché misura il modello in produzione. I dati di OrcaRouter stesso collocano GPT-5.6 Luna a una mediana di 1,83 secondi al primo token e un 95º percentile di 10,00 secondi, contro Claude Haiku 4.5 a 3,81 secondi di mediana e 9,47 secondi al 95º percentile. Letto correttamente, ciò dice che i due sono più vicini di quanto suggeriscano le classifiche: Luna vince sulla richiesta tipica, e le code sono entro circa mezzo secondo l'una dall'altra. Se la vostra preoccupazione è il caso peggiore anziché la media, c'è molto poco tra loro.

Quale scegliere?

Scegli GPT-5.6 Luna se gestisci contesti lunghi, se l'attività trae vantaggio da un vero ragionamento, se l'output è lungo o strutturato, oppure se vuoi il modello più potente disponibile nella fascia di prezzo più bassa. È anche la scelta più naturale se il resto del tuo stack si basa già sul comportamento della famiglia Open​AI.

Scegli Claude Haiku 4.5 se il tuo lavoro produce output brevi e ad alto volume, se hai bisogno di un tetto di costo che puoi dichiarare prima che la richiesta venga eseguita, se la tua pipeline è già costruita attorno al batching e alla cache di Anth​hropic, o se preferisci un modello con una storia produttiva e un ciclo di vita pubblicato rispetto a uno che ha due mesi di vita.

Non scegliere né l'uno né l'altro per un'attività in cui basterebbe un piccolo modello di ragionamento o un classificatore fine-tuned. Gran parte del traffico che questi due livelli assorbono è costituito da classificazione ed estrazione che costerebbero meno su qualcosa di più mirato — e il modello più economico è sempre quello di cui non avevi bisogno.

Eseguire entrambi su una sola chiave

Screenshot of the OrcaRouter model page for Claude Haiku 4.5, showing the model identifier anthropic/claude-haiku-4.5, a release date of 2025-10-15, a 200K-token context window, 64K maximum output, input pricing of $1.00 per million tokens, output pricing of $5.00, a median time to first token of 3.81 seconds and a 95th percentile of 9.47 seconds.

Il confronto smette di essere esclusivo nel momento in cui entrambi sono raggiungibili tramite un unico endpoint. Su OrcaRouter, Claude Haiku 4.5 e GPT-5.6 Luna stanno dietro lo stesso URL di base compatibile con OpenAIuna sola API per oltre 200 modelli, una chiave, una sola voce di fatturazione, nessun secondo contratto e nessuna modifica al codice oltre all'identificatore del modello. Per una decisione di livello di cui non sei ancora sicuro, questo trasforma una migrazione in un valore di configurazione.

Due funzionalità fanno qui il lavoro vero. Il failover automatico tra provider significa che un tier a basso costo può reggere il traffico di produzione senza dipendere da un unico fornitore — utile quando il modello è abbastanza economico da ricevere migliaia di chiamate all'ora invece di una sola importante. E il DSL di routing ti permette di comporre una chiamata a partire da più modelli: instrada verso Luna la maggior parte delle richieste, quelle più semplici, escala il resto a GPT-5.6 Terra e mantieni Haiku 4.5 nel pool come fallback quando vuoi la risposta di un secondo fornitore anziché un nuovo tentativo.

Verifica la tariffa per token in tempo reale su GPT-5.6 Luna e Claude Haiku 4.5 prima di destinarne una a un percorso di produzione — entrambe le tariffe vengono trasferite con uno 0% di ricarico, quindi cambiano il giorno stesso in cui le modifica il fornitore, e i tracker di prezzi di terze parti accumulano giorni o settimane di ritardo.

Domande che meritano davvero una risposta

GPT-5.6 Luna è davvero cinque volte più economico di Claude Haiku 4.5? Sui token di input, sì — 0,20 $ contro 1,00 $. Sul costo per portare a termine la stessa attività valutata, no: 0,18 $ contro 0,21 $. Il divario tra queste due affermazioni è la verbosità di Luna. Per completare lo stesso lavoro produce all'incirca il doppio dei token di output rispetto a Haiku, e i token di output costano sei volte i token di input. Per le risposte brevi il prezzo di listino è in gran parte onesto. Per i lavori ad alto contenuto di ragionamento, no.

Posso regolare il costo allo stesso modo su entrambi? No, ed è la differenza più sottostimata tra i due. Luna espone una manopola del reasoning effort con impostazioni da none fino a max, quindi costo e qualità si bilanciano esplicitamente a ogni richiesta. L'extended thinking di Haiku 4.5 o è attivo, con un budget di token, oppure non lo è — non esiste un parametro effort. Se il controllo dei costi per singola richiesta ti sta a cuore, solo uno di questi due ti offre quella leva.

E per un classificatore ad alto volume che effettua qualche milione di chiamate al giorno? Nessuno dei due modelli ha bisogno del ragionamento per questo. Esegui Haiku 4.5 con il pensiero esteso disattivato, oppure Luna con l'effort impostato su none, e confrontali in termini di latenza e lunghezza dell'output anziché sull'indice composito — a quel punto le domande rilevanti sono quanto rapidamente arriva il primo token e quanti token richiede la risposta, e i benchmark di intelligenza smettono di discriminare tra i due.

A two-column comparison scoreboard for GPT-5.6 Luna and Claude Haiku 4.5. Luna's column reads Intelligence Index 38, context window 1M tokens, price $0.20/$1.20, cost per index task $0.18, output speed 109.4 tokens per second, reasoning control an effort dial from none to max. Haiku 4.5's column reads Intelligence Index 18, context window 200K tokens, price $1.00/$5.00, cost per index task $0.21, output speed 84.7 tokens per second, reasoning control extended thinking on or off.

Quale sarà ancora qui tra un anno?Claude Haiku 4.5 ha un impegno pubblicato a non essere ritirato prima del 15 ottobre 2026. OpenAI non pubblica una data equivalente per GPT-5.6 Luna, e sopra la linea GPT-5.6 c'è già una generazione più recente, GPT-6 Astra. Nessuna delle due è un motivo per evitare Luna, ma se la tua roadmap presuppone un orizzonte di pianificazione di undici mesi, è un motivo per mantenere l'identificatore del modello nella configurazione anziché codificato in modo fisso.

Tariffa in tempo reale per token per GPT-5.6 Luna sulla stessa chiave, trasferita al 0% di ricarico e senza alcun secondo rapporto di fatturazione.

Tariffa per token in tempo reale per Claude Haiku 4.5 sullo stesso endpoint, così i due livelli possono essere confrontati senza un secondo contratto.