
Claude Haiku 5.5 vs GPT-6 Luna Pro: Un modello contro una modalità
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Un lato di questo confronto è un modello, e l'altro è un'impostazione. Claude Haiku 5.5 è entrato in disponibilità generale il 7 ottobre 2026 a 0,10 $ per milione di token di input e 0,50 $ per milione di output, su Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform su AWS. GPT-6 Luna Pro non è affatto un modello: il modo per raggiungerlo è chiamare GPT-6 Luna — attivo dal 22 settembre 2026 allo stesso prezzo di 0,10 $ e 0,50 $ — con reasoning.mode impostato su pro invece di standard. Non esiste gpt-6-luna-pro identificatore sulla pagina dei modelli di OpenAI. Quindi l'inquadramento onesto di questo confronto non è "quale modello vince" ma "qual è il modo migliore per spendere dieci centesimi per milione di token di input": un modello piccolo con una manopola dell'effort, o un modello più grande eseguito in una modalità che fa più lavoro e ti fattura i token che non ti mostra. Per lavori brevi e ad alto volume la risposta è di solito la prima. Per lavori difficili e occasionali può essere la seconda — e il numero che lo decide, OpenAI non l'ha pubblicato.
Che cos'è "pro", meccanicamente
La guida al ragionamento di OpenAI afferma che i modelli GPT-5.6 e GPT-6 supportano due modalità nell'API Responses, standard (predefinita) e pro, selezionabili tramite reasoning.mode. La modalità è un controllo diverso da reasoning.effort: la modalità decide quanto lavoro svolge il modello prima di impegnarsi in una risposta, l'effort decide quanto ragionamento avviene all'interno della modalità scelta. I valori di effort documentati di GPT-6 Luna sono none, low, medium (predefinito), high, xhigh e max, e ognuno di essi può essere combinato con la modalità pro.
Sulla fatturazione la guida è esplicita e leggermente controintuitiva. La modalità Pro aggrega tutto il lavoro del modello dietro la risposta finale e fattura quei token "alle tariffe standard per token del modello selezionato". Non c'è alcun sovrapprezzo pro sul listino prezzi. Il costo appare come volume, perché la modalità pro "svolge più lavoro del modello rispetto alla modalità standard, aumentando l'utilizzo dei token e il costo" — e i token di ragionamento vengono fatturati come token di output pur comparendo solo nell'oggetto usage sotto output_tokens_details.reasoning_tokens. Se non si legge quel campo, l'aumento è invisibile finché non arriva la fattura.
Da ciò derivano due confronti, che è bene tenere distinti. Rispetto a GPT-6 Luna in modalità standard, la modalità pro è lo stesso modello con un moltiplicatore sconosciuto sul consumo di token. Rispetto a Claude Haiku 5.5, è anche un modello diverso su una scala diversa — 1.050.000 token di contesto contro 1M, un tetto di input di 922.000 token e una data limite delle conoscenze al 18 maggio 2026, su un tier che la documentazione di lancio di Anthropic stessa colloca leggermente al di sopra di Haiku nei lavori agentici complessi. Le due differenze vanno nella stessa direzione sul costo e in direzioni opposte sulla capacità, ed è per questo che nessuna delle due può essere desunta da un listino prezzi.
Le schede tariffarie, fianco a fianco
Entrambi i modelli vengono fatturati in due fasce, e le soglie si trovano in punti diversi — il che conta più della tariffa di facciata, perché entrambe le tariffe di facciata sono identiche.
• Input — Claude Haiku 5.5 0,10 $ per milione fino a 100.000 token, 0,50 $ oltre. GPT-6 Luna 0,10 $ fino a 272.000 token, 0,20 $ oltre.
• Output — Claude Haiku 5.5 0,50 $ fino a 100.000 token, 2,50 $ oltre. GPT-6 Luna 0,50 $ fino a 272.000 token, 0,75 $ oltre.
• Memorizzazione in cache — Claude Haiku 5.5: letture dalla cache a $0.01 e scritture a $0.125 sotto la soglia, $0.05 e $0.625 sopra. GPT-6 Luna: letture dalla cache a $0.01 e scritture a $0.125 sotto 272.000 token, $0.02 e $0.25 oltre.
• Contesto e output — 1M token e 128.000 di output massimo per Claude Haiku 5.5; 1.050.000 token con un limite di input di 922.000 token e 128.000 massimi per GPT-5 Luna.
• Ragionamento — adattivo su entrambi. Claude Haiku 5.5 usa per impostazione predefinita un impegno medio; GPT-6 Luna usa per impostazione predefinita un impegno medio e la modalità standard, con la modalità pro come opt-in aggiuntivo.
• Sconti per batch e caching — Claude Haiku 5.5 applica uno sconto del 50% sull'API Message Batches; GPT-6 Luna applica uno sconto del 50% su Batch e Flex, il doppio in Fast mode, e aggiunge un supplemento del 10% per l'elaborazione regionale.
L'unico elemento che non ha la stessa forma è il tokenizer. La documentazione di Anthropic nota che Claude Haiku 5.5 utilizza il tokenizer più recente, condiviso con Claude 4.7 e versioni successive, quindi lo stesso testo conta circa il 30% di token in più rispetto a Claude Haiku 4.5. Ciò non cambia la tariffa; cambia la rapidità con cui un prompt raggiunge la soglia dei 100.000 token, ed è una differenza di costo reale che nessun listino prezzi mostra. Un prompt da 90.000 token ne misura circa 117.000 e paga $0,50 per milione di token di input invece di $0,10 — una tariffa cinque volte superiore per un prompt che sembra essere comodamente al di sotto della soglia.
Quanto costa la modalità pro, nelle uniche unità che chiunque può usare
Poiché il moltiplicatore non è pubblicato, la cosa utile da dichiarare è quanto costa ogni token aggiuntivo, e poi cosa fanno gli intervalli plausibili su grandi volumi.
• Con GPT-6 Luna a $0,50 per milione di token di output, ogni 10.000 token di output extra per attività costa $0,005. Se esegui 100.000 attività al giorno, quell’incremento è di un miliardo di token in più — circa $500 al giorno, ovvero $15.000 al mese, su un modello il cui prezzo di richiamo è di dieci centesimi per milione di token di input.
• Per dare un'idea della scala, GPT-6 Luna al massimo sforzo consuma già 140 milioni di token di output eseguendo l'Intelligence Index, contro una mediana di 100 milioni, che il valutatore descrive come alquanto prolisso. La tabella di lancio di Anthropic, eseguita sull'harness di Anthropic, colloca GPT-6 Luna al 16,4% su Terminal-Bench 4.0 e al 42,4% su FrontierCode 1.1, contro il 39,2% e il 46,4% di Claude Haiku 5.5 — dati dichiarati dal fornitore, la suite di un solo fornitore, il modello di un concorrente.
• Sulla classifica indipendente l'ordinamento è più ristretto. Artificial Analysis assegna a Claude Haiku 5.5, con Max effort, 43 sull'Intelligence Index v4.3.2, al secondo posto su 182, e a GPT-6 Luna (Max) 38, all'ottavo posto su 182. Entrambi i valori sono in modalità standard, con Max effort. Non esiste alcuna valutazione indipendente di GPT-6 Luna in modalità pro: la sua pagina non riporta alcuna voce pro, e Artificial Analysis non ne fornisce alcuna.
Il problema strutturale della modalità pro è l'interazione tra gli ultimi due punti. L'intero vantaggio di costo di GPT-6 Luna rispetto a Claude Haiku 5.5 deriva dall'efficienza dei token — 140 milioni di token di output contro 440 milioni per la stessa suite, a tariffe identiche, motivo per cui la stessa eval costa $0,07 per attività da una parte e $0,21 dall'altra. La modalità pro è, per definizione, una modalità che emette più token. Attivarla significa disattivare ciò che rendeva il modello economico in questo confronto, e il moltiplicatore che direbbe di quanto non è pubblicato. Non è un argomento secondo cui la modalità pro sia un cattivo affare — sui compiti difficili più lavoro è di solito lavoro migliore — è un argomento secondo cui la modalità pro compete sulla capacità, non sul prezzo, e andrebbe valutata rispetto ai modelli di fascia media ai cui prezzi si avvicina, piuttosto che rispetto alla fascia economica in cui si colloca.

Dove ciascuno vince davvero
Riducila alla decisione e la divisione è netta, anche se nessuna delle due parti è priva di riserve.
Claude Haiku 5.5 domina la fascia economica. È più veloce in entrambi i sensi che contano: 241,9 token di output al secondo misurati da Artificial Analysis contro 123,0 di GPT-6 Luna, e un tempo al token di 295 secondi nell'esecuzione dell'Index, che è il prodotto di quanto a lungo pensa prima di rispondere con sforzo Max, non un dato di rete. Il suo listino raggiunge il secondo scaglione a 100.000 token, e il suo tokenizer gonfia i prompt di circa il 30%, quindi i carichi di lavoro con prompt lunghi pagano più di quanto il prezzo esposto suggerisca su entrambi i fronti. Quello che dà in cambio è un vantaggio di intelligenza di cinque punti sull'indice indipendente e un selettore dello sforzo — da Low a Max — che è il controllo dei costi più utile che uno dei due fornitori abbia rilasciato con questi lanci. Fissare lo sforzo verso il basso è il modo in cui si baratta parte di quel vantaggio di cinque punti per un costo per attività più vicino a quello di GPT-6 Luna.
GPT-6 Luna Pro domina la fascia più impegnativa, con un conto non quantificato. Il modello sottostante costa meno per token oltre i 272.000 token di input di quanto costi Claude Haiku 5.5 oltre i 100.000, di un fattore due e mezzo sull'input e tre e un terzo sull'output, e il suo primo livello arriva diciotto volte più avanti nella finestra di contesto. La modalità Standard è misurabilmente più economica per attività completata. La modalità Pro scambia questo con più lavoro per risposta alle stesse tariffe, e se batta Claude Haiku 5.5 con impegno Max o un modello di fascia media su una determinata attività è una domanda a cui nessun numero pubblicato risponde. Il modo per rispondere è eseguire l'attività in entrambi i modi e leggere il campo dei token di ragionamento.

Provare l'uno o l'altro senza puntarci sopra
La parte scomoda di questo confronto è che il suo numero più importante — il costo reale della modalità pro — può essere prodotto solo facendo passare il tuo traffico attraverso di essa, e il costo effettivo del modello più piccolo dipende da dove finiscono i tuoi prompt rispetto a una soglia di 100.000 token dopo la ritokenizzazione. Entrambi sono problemi di misurazione, ed entrambi costano meno su un endpoint condiviso che su due client di fornitori diversi.
GPT-6 Luna è oggi nel catalogo di OrcaRouter al prezzo di listino del provider con 0% di ricarico trasferito, quindi la baseline in modalità standard per questo confronto è richiamabile con una sola chiave e una variazione di prezzo del fornitore arriva dalla nostra parte lo stesso giorno, anziché al ciclo di fatturazione successivo. Claude Haiku 5.5 non è ancora nel catalogo; il tier Anthropic che instradiamo oggi è Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5, il che rende un test di escalation da una gamba economica fino a un tier intermedio una regola di routing anziché una modifica al codice. Il failover automatico sottostante è ciò che consente a un modello vecchio di due giorni di sostenere traffico di produzione mentre lo stai ancora misurando: un provider che inizia a fallire viene aggirato anziché far cadere la richiesta, ed è la differenza tra un pilot che puoi avviare questa settimana e un cutover che devi pianificare.
Che cosa lo risolve
Tre cose, in ordine di quanto cambierebbero la risposta. Se OpenAI pubblicasse un moltiplicatore di token per la modalità pro, o uno slug pro con una propria voce di prezzo, l'incognita centrale si trasformerebbe in aritmetica. Se Artificial Analysis rieseguisse GPT-6 Luna in modalità pro a sforzo equivalente, lo farebbe dal lato indipendente. E una seconda esecuzione indipendente di Claude Haiku 5.5 a medium anziché a Max ti direbbe quanto costa davvero il modello con la sua impostazione predefinita, che è la configurazione che la maggior parte delle persone userà in produzione — il valore di $0.21 per attività riportato in classifica è un dato relativo allo sforzo Max, e Max non è l'impostazione predefinita.
Fino ad allora il riassunto accurato è limitato. Claude Haiku 5.5 è un modello che puoi chiamare, prezzare e valutare oggi, e ai volumi per cui è pensato il suo livello è la risposta più economica con un modo documentato per spendere ancora meno. GPT-6 Luna Pro è una configurazione di un modello che puoi chiamare, il suo tariffario non è il problema, il suo consumo di token non è verificato, e l'intera giustificazione a suo favore si basa su attività abbastanza difficili che spendere più token è il punto. Acquistalo per quelle attività, misuralo prima di farlo, e non inserirlo in un percorso ad alto volume finché qualcuno non pubblica il moltiplicatore.

