
Claude Haiku 5.5 vs GPT-6 Luna: stesso prezzo di listino, il triplo della bolletta
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Claude Haiku 5.5 e GPT-6 Luna hanno lo stesso prezzo sulla carta: 0,10 $ per milione di token in input e 0,50 $ per milione di token in output, gli stessi due numeri fino al centesimo, da due fornitori che raramente concordano su qualcosa. Il post di lancio di Anthropic riporta persino i punteggi di Luna nella colonna accanto alla propria, cosa che i fornitori non fanno con i modelli che considerano non minacciosi.
Le due schede divergono su tutto ciò che l'etichetta nasconde. Luna mantiene quella tariffa fino a 272.000 token prima di aumentare; Claude Haiku 5.5 scatta a 100.000. Claude Haiku 5.5 ottiene 43,40 sull'Artificial Analysis Intelligence Index v4.3.2 contro il 38,12 di Luna — e costa $0,21 per attività Index completata contro i $0,07 di Luna. Stesso prezzo, bolletta tripla, cinque punti di intelligenza in più. Questo è l'intero compromesso, ed è più pulito della maggior parte dei confronti testa a testa in questa fascia.
Due carte, fianco a fianco
Per milione di token in dollari statunitensi, dalle tariffe pubblicate di Anthropic e OpenAI come riportate nel nostro catalogo, con misurazioni indipendenti attribuite ad Artificial Analysis. Memorizzato nella cache il 2026-10-08.

• Input — Claude Haiku 5.5 $0,10 fino a 100.000 token, $0,50 oltre. GPT-6 Luna $0,10 fino a 272.000 token, $0,20 oltre.
• Output — Claude Haiku 5.5 $0,50 fino a 100.000 token, $2,50 al di sopra. GPT-6 Luna $0,50 fino a 272.000 token, $0,75 al di sopra.
• Input e scritture in cache — entrambi a 0,01 $ e 0,125 $ sotto la prima soglia, con Claude Haiku 5.5 che passa a 0,05 $ e 0,625 $ oltre 100.000 token e GPT-6 Luna a 0,02 $ e 0,25 $ oltre 272.000.
• Contesto e output — 1M token per entrambi; 128.000 di output massimo per entrambi. Questi due hanno davvero la stessa forma.
• Pensiero — adattivo su entrambi, entrambi con un parametro effort. L'effort predefinito di Claude Haiku 5.5 è medio; non tutti i punteggi pubblicati sono a quell'impostazione.
• Punteggio indipendente — Claude Haiku 5.5 (Max) 43,40, secondo su 182 modelli. GPT-6 Luna (Max) 38,12, ottavo su 182.
• Costo indipendente per attività — $0.21 contro $0.07.
• Velocità — 241,9 token di output al secondo contro 129,4, misurata dallo stesso valutatore.
La soglia è dove sta la differenza
Entrambi i fornitori hanno creato un listino prezzi a due livelli. L'hanno fatto in punti molto diversi, e la collocazione conta molto più del numero in cima.
Lo scaglione di Anthropic si attesta a 100.000 token. Al di sotto paghi $0,10 e $0,50; al di sopra, cinque volte e cinque volte — $0,50 e $2,50. Anthropic afferma che i prompt sotto la soglia costituivano circa il 90% delle richieste al suo precedente modello Haiku, che è il mix di traffico proprio del fornitore e una descrizione ragionevole dei carichi di lavoro con chiamate brevi in generale.
Lo scatto di OpenAI si colloca a 272.000 token. Al di sotto, $0,10 e $0,50 — identici a quelli di Anthropic. Al di sopra, $0,20 e $0,75, un raddoppio e un aumento del 50%. È uno scatto molto più graduale e inizia quasi tre volte più in là.
Prendi un prompt da 200.000 token, una dimensione plausibile per una pipeline di documenti lunghi e del tutto ragionevole per una finestra da 1M token. Su Claude Haiku 5.5 quella richiesta viene fatturata alla seconda fascia: $0,50 in input, $2,50 in output. Su GPT-6 Luna è ancora la prima fascia: $0,10 in input, $0,50 in output. Cinque volte la tariffa di input e cinque volte la tariffa di output, sulla stessa richiesta, tra due modelli con lo stesso prezzo di listino. Non è una sfumatura: per un carico di lavoro con prompt lunghi è l'intero confronto.
Perché la stessa tariffa produce una bolletta tre volte più alta
Il costo per attività è il numero che dovrebbe decidere una pipeline ad alto volume, e qui i due modelli divergono in un modo che il listino prezzi non riesce a spiegare.
Artificial Analysis colloca GPT-6 Luna (Max) a $0,07 per compito dell'Intelligence Index e Claude Haiku 5.5 (Max) a $0,21 — un fattore di tre, su tariffe di listino identiche, per una differenza di punteggio di 5,28 punti. La causa è sulla stessa pagina e non è sottile. Claude Haiku 5.5 ha generato 440 milioni di token di output durante l'esecuzione dell'Indice rispetto a una mediana di 100 milioni, e il valutatore lo definisce molto verboso. GPT-6 Luna ha generato 140 milioni rispetto alla stessa mediana di 100 milioni, descritto come alquanto verboso. Tre volte i token di output sono tre volte il conto quando l'output è il contatore che domina.
Gli stessi numeri di Anthropic puntano nella stessa direzione. I grafici costo/accuratezza del fornitore tracciano Haiku 5.5 lungo l'intero intervallo di sforzo, e la frase in evidenza del lancio è che Sonnet 5.5 e Opus 5.5 restano le scelte migliori per il lavoro complesso di coding agentico, mentre Haiku 5.5 è posizionato invece per compaction, sintesi e subagenti. Più piccolo è il lavoro, meno di quel problema di verbosità ti accolli — che è esattamente il carico di lavoro per cui il modello è stato costruito, e precisamente il carico di lavoro in cui un divario di costo triplo vale la pena di essere verificato sui tuoi log, piuttosto che su quelli di una classifica.
Un'altra voce sul registro, dalla documentazione di Anthropic anziché da quella dell'evaluator: Claude Haiku 5.5 usa il tokenizer più recente condiviso con Claude 4.7 e successivi, quindi lo stesso testo vale circa il 30% di token in più rispetto al precedente Haiku. La tariffa è la stessa di Luna; il tokenizer no.

Cosa dice la stessa tabella di Anthropic su Luna
La pagina di lancio di Anthropic presenta GPT-6 Luna come una colonna nella sua tabella di benchmark, e il modo onesto di riportarlo è con l'attribuzione allegata: queste sono valutazioni di Anthropic, eseguite sull'harness di Anthropic, contro il modello di un concorrente. Sono riportate dal fornitore, non riprodotte in modo indipendente, e un fornitore che esegue la propria suite contro i punteggi di un rivale è un confronto da soppesare anziché accettare.
• Lavoro intellettuale — GDPval-AA v2.1 a 1620 per Claude Haiku 5.5 contro 1437 per GPT-6 Luna. AA-Briefcase v1.1 a 1578 contro 1336.
• Uso del computer — sottoinsieme offline di OSWorld 2.1 al 72,4% contro il 48,9%.
• Programmazione agentica — Terminal-Bench 4.0 al 39,2% rispetto al 16,4%; FrontierCode 1.1 (Main) al 46,4% rispetto al 42,4%.
• Ragionamento visivo — Chartography al 46,4% senza strumenti contro il 29,1%.
Nel sistema di test interno del fornitore, Claude Haiku 5.5 è in testa in ogni riga. Nella classifica indipendente è in testa con un margine più ridotto — 43,40 contro 38,12 — che è il rapporto abituale tra la tabella di un fornitore e quella di una terza parte, e il motivo per cui entrambe sono riportate qui. Le due concordano sulla direzione e divergono sull'entità.
Il disegno di legge è il voto decisivo
Metti a confronto i quattro fatti che contano davvero e la scelta smette di essere incerta per la maggior parte dei carichi di lavoro.
GPT-6 Luna costa meno per attività completata di un fattore tre nella misurazione indipendente, il suo primo livello di prezzo arriva diciotto volte più avanti nella finestra di contesto, i suoi tassi di superamento della soglia sono inferiori su entrambi i misuratori, ed è l'unico dei due la cui penalità sul contesto lungo è un raddoppio anziché un passo di cinque volte. Claude Haiku 5.5 è avanti sull'intelligenza misurata di un margine reale e modesto, più veloce di quasi due volte sull'output e — sull'harness dello stesso fornitore, dove il divario è più ampio — avanti su ogni riga di benchmark pubblicata.
Se le tue chiamate sono brevi, se il throughput è il vincolo, o se la differenza di qualità emerge nella tua valutazione, paga il triplo. Se le tue chiamate sono lunghe, se sono generate automaticamente e non vengono mai lette da un essere umano, o se stai eseguendo un livello di classificazione che scatta un milione di volte al giorno, gli stessi $0,10 e $0,50 ti garantiranno, sull'altro fronte, una fattura pari a un terzo, e la capacità a cui rinunci è di cinque punti in una classifica in cui entrambi i modelli si trovano vicino alla vetta.
Chiamare uno dei due da un unico posto
La cosa utile di un confronto così ravvicinato è che non dovresti dover credere sulla parola a nessuno, nemmeno a noi. GPT-6 Luna è oggi nel catalogo OrcaRouter alla tariffa del provider con 0% di ricarico — la stessa struttura tariffaria riportata sopra, passata così com'è anziché aggregata — e lo stesso vale per Claude Sonnet 5.5 e Claude Opus 5.5, il che rende un test di escalation da un segmento economico a un livello intermedio una configurazione anziché un progetto. Una chiave, un SDK, failover automatico sotto il cofano, e il DSL di routing se l'escalation appartiene alla rotta anziché alla tua applicazione.
Claude Haiku 5.5 non è ancora nel catalogo. Dirlo chiaramente è più utile che lasciar intendere il contrario: il lato Luna di questo confronto è contattabile da noi stamattina, e il lato Anthropic va raggiunto presso Anthropic finché non lo sarà più.

Cosa cambierebbe la risposta
Due cose, ed entrambe vale la pena osservarle piuttosto che stimarle.
Il primo è se la verbosità si sposta. Il costo per attività di Claude Haiku 5.5 è funzione di quanti token spende per risposta con effort al massimo, e il parametro effort è la leva su questo. Un team che fissa effort a un livello inferiore — il default del modello stesso è medium, non max — vedrà un valore di costo per attività più vicino a quello di Luna e anche un punteggio più vicino a quello di Luna. Il trade-off è disponibile; quanto valga è una questione che riguarda la tua eval, non il modello.
Il secondo è se i numeri indipendenti del costo per attività reggono man mano che entrambi i modelli accumulano più esecuzioni misurate. Un singolo posizionamento in classifica è un'istantanea, e un divario di tre volte che compare in un'unica istantanea vale la pena confermarlo rispetto alla tua fattura prima di ricostruire una pipeline attorno a esso. È a questo che serve l'endpoint condiviso.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
