Ett genererat hero-kort med titeln "Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base" och kickern "DEN BILLIGA KAN INTE SVARA PÅ EN FRÅGA" samt chips som visar $0.10 mot $0.06 per miljon indatatoken, AA Index 43 mot 13 och svarsredo mot bas-checkpoint.
Guides & Insights

Claude Haiku 5.5 mot Nemotron 3.5 Lightning 30B A3B Base: Den billiga kan inte svara på en fråga

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

På de två siffror som ett inköpskalkylark bryr sig mest om vinner den billigare och snabbare modellen. Nemotron 3.5 Lightning 30B A3B Base kör i 298,9 utdatatokens per sekund, snabbast av 142 modeller som följs oberoende, och kostar 0,06 dollar per miljon indatatokens mot Claude Haiku 5.5:s 0,10. Den är också, som ordet ”Base” i namnet varnar dig om, inte en assistent. Den är en förtränad checkpoint – ingen övervakad finjustering, ingen förstärkningsinlärning, ingen chattmall värd namnet – publicerad under licensen OpenMDW-1.1 den 11 augusti 2026 så att andra kan bygga vidare på den. Claude Haiku 5.5, som släpptes den 7 oktober 2026, är en färdig produkt som du kan skicka en fråga till. Att jämföra dem på pris är som att jämföra priset på mjöl med priset på bröd, och det intressanta med den här duellen är att komma fram till vilken av dem din arbetsbelastning faktiskt behöver.

Ingen i lanseringsbevakningen säger den delen tydligt, eftersom ”billigare och snabbare än Claude Haiku 5.5” är en bättre rubrik än ”billigare, snabbare och inte användbar utan en finjusteringskörning”. Båda påståendena är sanna. Bara ett av dem är användbart.

Vad varje modell faktiskt är

Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, släppt den 7 oktober 2026. Text och bild in, text ut. 1M-tokenkontext, maximal utdata på 128 000 token (300 000 bakom en beta-header i Batch-API:et), träningsavgränsning i juni 2026, avveckling tidigast den 7 oktober 2027. Justerbar ansträngningsnivå över Low, Medium, High och Max, med Medium som standard, och adaptivt tänkande påslaget som standard. Mätbaserat API, cacheläsningar till 0,01 USD per miljon, Batch till halva priset. Tillgänglig via Anthropics API och därifrån överallt där Anthropics modeller återförsäljs.

Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, tillkännagavs den 11 augusti 2026. En hybrid mixture-of-experts-checkpoint med 30 miljarder parametrar och omkring 3 miljarder aktiva parametrar per token, byggd på en stack med Mamba-2 plus MoE plus attention, destillerad från Nemotron 3 Ultra, och levereras med MTP, DFlash och DSpark spekulativ avkodning. Kontexten sträcker sig till 1M tokens, även om cirka 256 000 är det praktiska taket på en enskild H100. Den är endast för text. Vikterna är öppna under OpenMDW-1.1. Och det är en bascheckpoint: råa förtränade vikter utan instruktionsträning, vilket innebär att den slutför text i stället för att följa instruktioner.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base — the scoreboard'. Claude Haiku 5.5 reads output speed 243.4 tokens per second, AA Index 43, proprietary weights, instruction-tuned yes, $0.10 per million input and $0.21 per task; the Nemotron column reads output speed 298.9 tokens per second, AA Index 13, weights open under OpenMDW-1.1, instruction-tuned no — base checkpoint, $0.06 per million input and $0.09 per task. A footer notes the Artificial Analysis figures are independently run and the NVIDIA figures are vendor-reported and unreproduced.

• Måtten, en rad vardera

• Indatapris — Claude Haiku 5.5 0,10 $ per miljon upp till 100 000 token, därefter 0,50 $; Nemotron 3.5 Lightning 30B A3B Base 0,06 $ per miljon.

• Utpris — 0,50 $ per miljon upp till 100 000 tokens, därefter 2,50 $, mot 0,20 $ per miljon.

• Kostnad per slutförd uppgift — 0,21 USD per oberoende indexuppgift för Claude Haiku 5.5, mot 0,09 USD för Nemotron — den billigare modellen är billigare per uppgift, inte bara per token.

• Utdatningshastighet — 243,4 tokens per sekund för Claude Haiku 5.5, nionde av 182; 298,9 tokens per sekund för Nemotron, första av 142.

• Tid till första token – cirka 0,3 sekunder för Claude Haiku 5.5, jämfört med 0,54 sekunder för Nemotron.

• Oberoende poäng — Artificial Analysis Intelligence Index 43 för Claude Haiku 5.5, tvåa av 182, med Max-konfigurationen på 43,40; index 13 för Nemotron, tjugonionde av 142.

• Kontextfönster — 1 000 000 tokens vardera, med ungefär 256 000 praktiskt användbara för Nemotron på ett enda H100.

• Modaliteter – text och bild som indata för Claude Haiku 5.5; endast text för Nemotron.

• Vikter — proprietära kontra öppna under OpenMDW-1.1, en hybrid-MoE med 30B totalt och 3B aktiva.

• Instruktionsfinjustering – finns i Claude Haiku 5.5, saknas i bascheckpointen.

”Base”-problemet, uttryckt i klartext

En bascheckpoint förutspår nästa token. Ställ en fråga till den och den fortsätter ofta texten i stil med ett dokument som skulle kunna innehålla en sådan fråga, i stället för att svara. Ge den prompten "Summarise this contract" och en basmodell kan producera en rimlig fortsättning på ett juridiskt träningsdokument i stället för en sammanfattning av ditt. NVIDIA publicerar en separat BF16-checkpoint och separata instruktionstränade syskon just för att basvikterna är råmaterial.

På NVIDIAs eget modellkort — leverantörsrapporterat, inte oberoende reproducerat — får bascheckpointen 78,59 på MMLU, 67,94 på MMLU-Pro, 91,28 på GSM8K, 77,44 på HumanEval och 69,62 på RULER vid 1M tokens. Lightning-kortet för den finjusterade syskonmodellen rapporterar MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 och 86 % på PinchBench, med ungefär 30 % snabbare inferens än modellen den ersatte. Även de finjusterade siffrorna är NVIDIAs egna, och det är bassiffrorna som gäller för den checkpoint som nämns i den här artikelns rubrik. Jämfört med dem är Claude Haiku 5.5:s oberoende uppmätta poäng på 43,40 — tvåa av 182 på Artificial Analysis-index, ett annat index som mäter andra saker — inte direkt jämförbar, och den ärliga tolkningen är att en 30B-bascheckpoint och en färdig liten modell poängsätts av olika instrument för olika syften.

Det som kan sägas utan förbehåll är gapets form. En bascheckpunkt som behöver en finjusteringspipeline, en serveringsstack och ett utvärderingsramverk innan den svarar på något är inte en ersättning för en hostad modell för 0,10 dollar per miljon. Den är en utgångspunkt för någon som vill äga modellen.

Där Nemotron verkligen vinner, och det är inte ett tröstpris

Snabbhet först. 298,9 utdatatokens per sekund placerar den högst upp på en resultattavla med 142 modeller – 23 % snabbare än Claude Haiku 5.5:s 243,4. För en latenskänslig pipeline är det en verklig, mätbar skillnad, och det är anledningen till att namnet "Lightning" står på förpackningen.

Öppna vikter kommer på andra plats, och det här är den större punkten. Under OpenMDW-1.1 kan du ladda ner checkpointen, finjustera den på dina egna data och köra den själv. Claude Haiku 5.5 kan inte finjusteras alls och kan inte självhostas till något pris. För ett team med en proprietär uppgift, en ovanlig indatafördelning eller ett efterlevnadskrav på att trafiken aldrig lämnar den egna infrastrukturen är den skillnaden avgörande, oavsett vad benchmarksidorna säger. En modell med 30B totalt och 3B aktiva parametrar är också tillräckligt liten för att kunna driftas ekonomiskt — arkitekturen är designad för exakt det.

Pris tredje: 0,06 USD i indata och 0,20 USD i utdata per miljon, med 17 % cacherabatt och 0,09 USD per indexuppgift, är ungefär hälften av Claude Haiku 5.5:s 0,21 USD. Båda modellerna är billiga; Nemotron är billigare.

Där Claude Haiku 5.5 vinner, vilket är varje dimension som kräver ett svar

Instruktionsföljning, eftersom den har tränats för det. Oberoende förmåga, på Index 43 mot 13 – en trettiopoängsskillnad på en resultattavla som poängsatte båda, vilket är den största sådana skillnaden i den här uppsättningen jämförelser. Bildinmatning, vilket Nemotron inte accepterar alls. Maximal utdata på 128 000 tokens mot en opublicerad siffra, med en betaväg på 300 000 tokens i Batch. Och ansträngningsratten, som låter dig få tillbaka kostnad genom att sänka resonemangsansträngningen i stället för att bygga om modellen.

Mångordigheten skär åt båda hållen här. I Artificial Analysis testsvit avger Claude Haiku 5.5 cirka 440 miljoner utdatatokens mot en median på ungefär 100 miljoner – den tänker väldigt mycket. Nemotron avger cirka 120 miljoner, vilket samma källa beskriver som något mångordigt för sin storlek. Haiku 5.5:s kostnad per uppgift är ändå 0,21 dollar mot Nemotrons 0,09 dollar, så inte ens den pratsamma modellen är den dyra. Vad det säger dig är att priser per token vilseleder åt båda hållen, och att det är siffran per uppgift man ska gå efter.

Självhosting kontra en slutpunkt

Nemotron 3.5 Lightning 30B A3B Base distribueras som öppna vikter och tillhandahålls av flera inferensleverantörer; NVIDIA publicerar också de finjusterade syskonmodellerna. Claude Haiku 5.5 är tillgänglig via Anthropics API och därifrån, varhelst Anthropics modeller säljs vidare. Ingen av dem finns i OrcaRouters katalog, och vi tänker inte låtsas något annat — det vi dirigerar från det här området är anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 och anthropic/claude-fable-5.1, nivån över den här artikelns ämne.

De två vägarna som den här jämförelsen beskriver har genuint olika infrastruktur, och det är värt att namnge dem. Den självhostade vägen innebär en GPU, ett serveringsramverk, ett kvantiseringsbeslut och en ops-rotation. Den hostade vägen innebär en nyckel och en modellsträng. OrcaRouter finns för den andra vägen: ett API för 200+ modeller, en nyckel och en faktura, leverantörens listpris som förs vidare med 0 % påslag så att en leverantörsprissänkning är live samma dag, med automatisk failover i botten. Det är inte en väg till en 30B-bascheckpunkt, och att köpa en DGX-klassad maskin är inte en väg till en hostad liten modell.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

Vem ska välja vilken

Om din uppgift är väldefinierad, din träningsdata tillräckligt stor för att spela roll och din trafik inte får lämna din egen infrastruktur, är Nemotron 3.5 Lightning 30B A3B Base det mer intressanta objektet: snabbast av 142 i utdatahastighet, halva priset per token och din att modifiera. Budgetera för finjusteringskörningen och serveringskostnaden innan du räknar in besparingarna, eftersom indatapriset på $0.06 förutsätter att någon redan har gjort arbetet som gör en checkpoint till en assistent.

Om du vill skicka en prompt och få ett svar i eftermiddag är Claude Haiku 5.5 den som gör det — 43 på originalindexet mot 13, bildinmatning, ett utdatatak på 128 000 token och ett pris som är riktigt lågt. Jämförelsen ser bara jämn ut i en prislista. Den slutar se jämn ut i samma stund som uppgiften är att svara på en fråga i stället för att ta fram ett dokument.

A capture of the Artificial Analysis page for Nemotron 3.5 Lightning showing its Intelligence Index of 13 and rank of 29 of 142, the $0.06 per-million input and $0.20 output pricing, the $0.09 cost per index task, the 298.9 tokens-per-second output speed ranked first of 142, the 0.54-second time to first token, the 1M-token context window, text-only input and open weights.