
Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: Il più economico non riesce a rispondere a una domanda
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Sui due numeri a cui un foglio di calcolo per gli acquisti tiene di più, vince il modello più economico e più veloce. Nemotron 3.5 Lightning 30B A3B Base gira a 298,9 token di output al secondo, il più veloce tra 142 modelli monitorati in modo indipendente, e costa 0,06 $ per milione di token di input rispetto ai 0,10 $ di Claude Haiku 5.5. Inoltre, come ti avverte la parola "Base" nel suo nome, non è un assistente. È un checkpoint pre-addestrato — nessun fine-tuning supervisionato, nessun apprendimento per rinforzo, nessun template di chat degno di questo nome — pubblicato con licenza OpenMDW-1.1 l'11 agosto 2026, così che altre persone possano costruirci sopra. Claude Haiku 5.5, rilasciato il 7 ottobre 2026, è un prodotto finito a cui puoi inviare una domanda. Confrontarli sul prezzo è come confrontare il costo della farina con il costo del pane, e la parte interessante di questa sfida è capire quale dei due serva effettivamente al tuo carico di lavoro.
Nessuno nei resoconti del lancio dice chiaramente quella parte, perché «più economico e più veloce di Claude Haiku 5.5» è un titolo migliore di «più economico, più veloce e non utilizzabile senza un ciclo di fine-tuning». Entrambe le affermazioni sono vere. Solo una delle due è utile.
Cosa è realmente ciascun modello
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, rilasciato il 7 ottobre 2026. Testo e immagini in input, testo in output. Contesto di 1M token, output massimo di 128.000 token (300.000 dietro un header beta sull'API Batch), cutoff di addestramento: giugno 2026, ritiro non prima del 7 ottobre 2027. Sforzo regolabile tra Low, Medium, High, Xhigh e Max, con valore predefinito Medium, con pensiero adattivo attivo per impostazione predefinita. API a consumo, letture dalla cache a 0,01 $ per milione, Batch a metà tariffa. Disponibile tramite l'API di Anthropic e, da lì, ovunque i modelli di Anthropic vengano rivenduti.
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, annunciato l'11 agosto 2026. Un checkpoint ibrido mixture-of-experts da 30 miliardi di parametri con circa 3 miliardi di parametri attivi per token, costruito su uno stack Mamba-2 più MoE più attention, distillato da Nemotron 3 Ultra e distribuito con decodifica speculativa MTP, DFlash e DSpark. Il contesto arriva a 1M di token, anche se circa 256.000 rappresenta il limite pratico su una singola H100. È solo testo. I pesi sono aperti con licenza OpenMDW-1.1. Ed è un checkpoint di base: pesi pre-addestrati grezzi senza instruction tuning, il che significa che completa il testo anziché seguire istruzioni.

• Le dimensioni, una riga ciascuna
• Prezzo di input — Claude Haiku 5.5: 0,10 $ per milione fino a 100K token, poi 0,50 $; Nemotron 3.5 Lightning 30B A3B Base 0,06 $ per milione.
• Prezzo di output — 0,50 $ per milione fino a 100K token, poi 2,50 $, contro 0,20 $ per milione.
• Costo per compito completato — 0,21 $ per compito di indicizzazione indipendente per Claude Haiku 5.5, contro 0,09 $ per Nemotron — il modello più economico costa meno per compito, non solo per token.
• Velocità di output — 243,4 token al secondo per Claude Haiku 5.5, nono su 182; 298,9 token al secondo per Nemotron, primo su 142.
• Tempo al primo token — circa 0,3 secondi per Claude Haiku 5.5, contro 0,54 secondi per Nemotron.
• Punteggio indipendente — Artificial Analysis Index 43 per Claude Haiku 5.5, secondo su 182, con il Max 43.40; Index 13 per Nemotron, ventiquattresimo su 142.
• Finestra di contesto — 1.000.000 di token ciascuna, con circa 256.000 utilizzabili per Nemotron su una singola H100.
• Modalità — testo e immagine in input per Claude Haiku 5.5; solo testo per Nemotron.
• Pesi — proprietari contro open ai sensi di OpenMDW-1.1, un MoE ibrido da 30B totali e 3B attivi.
• Instruction tuning — presente su Claude Haiku 5.5, assente sul checkpoint Base.
Il problema "Base", detto chiaramente
Un checkpoint di base predice il token successivo. Se gli poni una domanda, spesso continuerà il testo nello stile di un documento che potrebbe contenere una domanda del genere, invece di rispondere. Se gli dai il prompt "Riassumi questo contratto", un modello di base potrebbe produrre una plausibile continuazione di un documento di addestramento legale anziché un riassunto del tuo. NVIDIA pubblica un checkpoint BF16 separato e sibling separati ottimizzati per le istruzioni proprio perché i pesi di base sono materia prima.
Sulla scheda modello di NVIDIA stessa — riportati dal fornitore, non riprodotti in modo indipendente — il checkpoint di base ottiene 78,59 su MMLU, 67,94 su MMLU-Pro, 91,28 su GSM8K, 77,44 su HumanEval e 69,62 su RULER a 1M token. La scheda Lightning per la versione ottimizzata riporta MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 e 86% su PinchBench, con un'inferenza circa il 30% più veloce rispetto al modello che ha sostituito. Persino i numeri della versione ottimizzata sono di NVIDIA, e i numeri di base sono quelli che si applicano al checkpoint indicato nel titolo di questo articolo. Rispetto a essi, il 43,40 misurato in modo indipendente di Claude Haiku 5.5 — secondo su 182 nell'indice di Artificial Analysis, un indice diverso che misura cose diverse — non è direttamente comparabile, e la lettura onesta è che un checkpoint di base da 30B e un modello piccolo finito vengono valutati da strumenti diversi per scopi diversi.
Ciò che si può dire senza riserve è la forma del divario. Un checkpoint di base che necessita di una pipeline di fine-tuning, di uno stack di serving e di un harness di valutazione prima di rispondere a qualsiasi cosa non è un sostituto di un modello ospitato a $0,10 per milione. È un punto di partenza per chi vuole possedere il modello.
Dove Nemotron vince davvero, e non è un premio di consolazione
Prima la velocità. 298,9 token di output al secondo lo pongono in cima a una classifica di 142 modelli — il 23% più veloce dei 243,4 di Claude Haiku 5.5. Per una pipeline sensibile alla latenza, è una differenza reale e misurabile, ed è il motivo per cui il nome "Lightning" è sulla confezione.
Pesi aperti secondo, e questo è il punto più importante. Con OpenMDW-1.1 puoi scaricare il checkpoint, eseguire il fine-tuning sui tuoi dati e servirlo autonomamente. Claude Haiku 5.5 non può essere sottoposto a fine-tuning in alcun modo e non può essere ospitato autonomamente a nessun prezzo. Per un team con un compito proprietario, una distribuzione di input insolita o un requisito di conformità che prevede che il traffico non lasci mai la propria infrastruttura, questa differenza è decisiva indipendentemente da ciò che dicono le pagine dei benchmark. Un modello da 30B totali con 3B attivi è anche abbastanza piccolo da essere economicamente erogabile — l'architettura è progettata esattamente per questo.
Terzo prezzo: $0,06 per l'input e $0,20 per l'output per milione, con uno sconto cache del 17% e $0,09 per attività di indicizzazione, è circa la metà dei $0,21 di Claude Haiku 5.5. Entrambi i modelli sono economici; Nemotron è più economico.
Dove Claude Haiku 5.5 vince, ovvero in ogni dimensione che richiede una risposta
Capacità di seguire le istruzioni, perché è stato addestrato per farlo. Capacità indipendente, all'Indice 43 contro 13 — un divario di trenta punti su una classifica che ha valutato entrambi, il divario più ampio di questo insieme di confronti. Input di immagini, che Nemotron non accetta affatto. Output massimo a 128.000 token contro un dato non pubblicato, con un percorso beta da 300.000 token su Batch. E il selettore dell'effort, che ti permette di recuperare costo riducendo lo sforzo di ragionamento invece di ricostruire il modello.
L'avvertenza sulla verbosità vale in entrambe le direzioni, qui. Nella suite di Artificial Analysis, Claude Haiku 5.5 genera circa 440 milioni di token di output rispetto a una mediana di circa 100 milioni — pensa parecchio. Nemotron ne genera circa 120 milioni, che la stessa fonte descrive come alquanto verboso per le sue dimensioni. Il costo per attività di Haiku 5.5 è comunque di 0,21 $ contro i 0,09 $ di Nemotron, quindi persino il modello più chiacchierone non è quello costoso. Ciò che questo ti dice è che i prezzi per token traggono in inganno in entrambe le direzioni, e il numero per attività è quello su cui basare il budget.
Self-hosting rispetto a un singolo endpoint
Nemotron 3.5 Lightning 30B A3B Base è distribuito come pesi aperti ed è servito da diversi provider di inferenza; NVIDIA pubblica anche i fratelli ottimizzati. Claude Haiku 5.5 è disponibile tramite l'API di Anthropic e, da lì, ovunque i modelli di Anthropic vengano rivenduti. Nessuno dei due è nel catalogo di OrcaRouter, e non fingeremo il contrario — ciò che instradiamo da questo quartiere è anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 e anthropic/claude-fable-5.1, il livello superiore rispetto all'oggetto di questo articolo.
I due percorsi descritti da questo confronto hanno meccanismi davvero diversi, e vale la pena nominarli. Il percorso self-hosted significa una GPU, un framework di serving, una decisione di quantizzazione e un turno di ops. Il percorso hosted significa una chiave e una stringa di modello. OrcaRouter esiste per il secondo percorso: un'unica API per oltre 200 modelli, una chiave e una fattura, il prezzo di listino del provider passato con markup 0%, così uno sconto del fornitore è attivo lo stesso giorno, con failover automatico al di sotto. Non è una via verso un checkpoint base da 30B, e comprare una macchina di classe DGX non è una via verso un modello piccolo hosted.

Chi dovrebbe scegliere cosa
Se il tuo compito è ben definito, i tuoi dati di addestramento sono abbastanza grandi da contare e il tuo traffico non può lasciare la tua infrastruttura, Nemotron 3.5 Lightning 30B A3B Base è l'oggetto più interessante: il più veloce tra 142 come velocità di output, a metà del prezzo per token e puoi modificarlo. Prevedi nel budget l'esecuzione del fine-tuning e il costo di serving prima di contare i risparmi, perché la tariffa di input di $0.06 presuppone che qualcuno abbia già fatto il lavoro che trasforma un checkpoint in un assistente.
Se vuoi inviare un prompt e ottenere una risposta questo pomeriggio, Claude Haiku 5.5 è quello che lo fa — 43 sull'indice indipendente contro 13, input di immagini, un tetto di output di 128.000 token e un prezzo davvero contenuto. Il confronto sembra vicino solo su un listino prezzi. Smette di sembrare vicino nel momento in cui il compito è rispondere a una domanda anziché continuare un documento.

