
Claude Haiku 5.5 mot Nemotron 3.5 Lightning 30B A3B Base: Den billiga kan inte svara på en fråga
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
På de två siffror som ett inköpskalkylark bryr sig mest om vinner den billigare och snabbare modellen. Nemotron 3.5 Lightning 30B A3B Base kör i 298,9 utdatatokens per sekund, snabbast av 142 modeller som följs oberoende, och kostar 0,06 dollar per miljon indatatokens mot Claude Haiku 5.5:s 0,10. Den är också, som ordet ”Base” i namnet varnar dig om, inte en assistent. Den är en förtränad checkpoint – ingen övervakad finjustering, ingen förstärkningsinlärning, ingen chattmall värd namnet – publicerad under licensen OpenMDW-1.1 den 11 augusti 2026 så att andra kan bygga vidare på den. Claude Haiku 5.5, som släpptes den 7 oktober 2026, är en färdig produkt som du kan skicka en fråga till. Att jämföra dem på pris är som att jämföra priset på mjöl med priset på bröd, och det intressanta med den här duellen är att komma fram till vilken av dem din arbetsbelastning faktiskt behöver.
Ingen i lanseringsbevakningen säger den delen tydligt, eftersom ”billigare och snabbare än Claude Haiku 5.5” är en bättre rubrik än ”billigare, snabbare och inte användbar utan en finjusteringskörning”. Båda påståendena är sanna. Bara ett av dem är användbart.
Vad varje modell faktiskt är
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, släppt den 7 oktober 2026. Text och bild in, text ut. 1M-tokenkontext, maximal utdata på 128 000 token (300 000 bakom en beta-header i Batch-API:et), träningsavgränsning i juni 2026, avveckling tidigast den 7 oktober 2027. Justerbar ansträngningsnivå över Low, Medium, High och Max, med Medium som standard, och adaptivt tänkande påslaget som standard. Mätbaserat API, cacheläsningar till 0,01 USD per miljon, Batch till halva priset. Tillgänglig via Anthropics API och därifrån överallt där Anthropics modeller återförsäljs.
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, tillkännagavs den 11 augusti 2026. En hybrid mixture-of-experts-checkpoint med 30 miljarder parametrar och omkring 3 miljarder aktiva parametrar per token, byggd på en stack med Mamba-2 plus MoE plus attention, destillerad från Nemotron 3 Ultra, och levereras med MTP, DFlash och DSpark spekulativ avkodning. Kontexten sträcker sig till 1M tokens, även om cirka 256 000 är det praktiska taket på en enskild H100. Den är endast för text. Vikterna är öppna under OpenMDW-1.1. Och det är en bascheckpoint: råa förtränade vikter utan instruktionsträning, vilket innebär att den slutför text i stället för att följa instruktioner.

• Måtten, en rad vardera
• Indatapris — Claude Haiku 5.5 0,10 $ per miljon upp till 100 000 token, därefter 0,50 $; Nemotron 3.5 Lightning 30B A3B Base 0,06 $ per miljon.
• Utpris — 0,50 $ per miljon upp till 100 000 tokens, därefter 2,50 $, mot 0,20 $ per miljon.
• Kostnad per slutförd uppgift — 0,21 USD per oberoende indexuppgift för Claude Haiku 5.5, mot 0,09 USD för Nemotron — den billigare modellen är billigare per uppgift, inte bara per token.
• Utdatningshastighet — 243,4 tokens per sekund för Claude Haiku 5.5, nionde av 182; 298,9 tokens per sekund för Nemotron, första av 142.
• Tid till första token – cirka 0,3 sekunder för Claude Haiku 5.5, jämfört med 0,54 sekunder för Nemotron.
• Oberoende poäng — Artificial Analysis Intelligence Index 43 för Claude Haiku 5.5, tvåa av 182, med Max-konfigurationen på 43,40; index 13 för Nemotron, tjugonionde av 142.
• Kontextfönster — 1 000 000 tokens vardera, med ungefär 256 000 praktiskt användbara för Nemotron på ett enda H100.
• Modaliteter – text och bild som indata för Claude Haiku 5.5; endast text för Nemotron.
• Vikter — proprietära kontra öppna under OpenMDW-1.1, en hybrid-MoE med 30B totalt och 3B aktiva.
• Instruktionsfinjustering – finns i Claude Haiku 5.5, saknas i bascheckpointen.
”Base”-problemet, uttryckt i klartext
En bascheckpoint förutspår nästa token. Ställ en fråga till den och den fortsätter ofta texten i stil med ett dokument som skulle kunna innehålla en sådan fråga, i stället för att svara. Ge den prompten "Summarise this contract" och en basmodell kan producera en rimlig fortsättning på ett juridiskt träningsdokument i stället för en sammanfattning av ditt. NVIDIA publicerar en separat BF16-checkpoint och separata instruktionstränade syskon just för att basvikterna är råmaterial.
På NVIDIAs eget modellkort — leverantörsrapporterat, inte oberoende reproducerat — får bascheckpointen 78,59 på MMLU, 67,94 på MMLU-Pro, 91,28 på GSM8K, 77,44 på HumanEval och 69,62 på RULER vid 1M tokens. Lightning-kortet för den finjusterade syskonmodellen rapporterar MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 och 86 % på PinchBench, med ungefär 30 % snabbare inferens än modellen den ersatte. Även de finjusterade siffrorna är NVIDIAs egna, och det är bassiffrorna som gäller för den checkpoint som nämns i den här artikelns rubrik. Jämfört med dem är Claude Haiku 5.5:s oberoende uppmätta poäng på 43,40 — tvåa av 182 på Artificial Analysis-index, ett annat index som mäter andra saker — inte direkt jämförbar, och den ärliga tolkningen är att en 30B-bascheckpoint och en färdig liten modell poängsätts av olika instrument för olika syften.
Det som kan sägas utan förbehåll är gapets form. En bascheckpunkt som behöver en finjusteringspipeline, en serveringsstack och ett utvärderingsramverk innan den svarar på något är inte en ersättning för en hostad modell för 0,10 dollar per miljon. Den är en utgångspunkt för någon som vill äga modellen.
Där Nemotron verkligen vinner, och det är inte ett tröstpris
Snabbhet först. 298,9 utdatatokens per sekund placerar den högst upp på en resultattavla med 142 modeller – 23 % snabbare än Claude Haiku 5.5:s 243,4. För en latenskänslig pipeline är det en verklig, mätbar skillnad, och det är anledningen till att namnet "Lightning" står på förpackningen.
Öppna vikter kommer på andra plats, och det här är den större punkten. Under OpenMDW-1.1 kan du ladda ner checkpointen, finjustera den på dina egna data och köra den själv. Claude Haiku 5.5 kan inte finjusteras alls och kan inte självhostas till något pris. För ett team med en proprietär uppgift, en ovanlig indatafördelning eller ett efterlevnadskrav på att trafiken aldrig lämnar den egna infrastrukturen är den skillnaden avgörande, oavsett vad benchmarksidorna säger. En modell med 30B totalt och 3B aktiva parametrar är också tillräckligt liten för att kunna driftas ekonomiskt — arkitekturen är designad för exakt det.
Pris tredje: 0,06 USD i indata och 0,20 USD i utdata per miljon, med 17 % cacherabatt och 0,09 USD per indexuppgift, är ungefär hälften av Claude Haiku 5.5:s 0,21 USD. Båda modellerna är billiga; Nemotron är billigare.
Där Claude Haiku 5.5 vinner, vilket är varje dimension som kräver ett svar
Instruktionsföljning, eftersom den har tränats för det. Oberoende förmåga, på Index 43 mot 13 – en trettiopoängsskillnad på en resultattavla som poängsatte båda, vilket är den största sådana skillnaden i den här uppsättningen jämförelser. Bildinmatning, vilket Nemotron inte accepterar alls. Maximal utdata på 128 000 tokens mot en opublicerad siffra, med en betaväg på 300 000 tokens i Batch. Och ansträngningsratten, som låter dig få tillbaka kostnad genom att sänka resonemangsansträngningen i stället för att bygga om modellen.
Mångordigheten skär åt båda hållen här. I Artificial Analysis testsvit avger Claude Haiku 5.5 cirka 440 miljoner utdatatokens mot en median på ungefär 100 miljoner – den tänker väldigt mycket. Nemotron avger cirka 120 miljoner, vilket samma källa beskriver som något mångordigt för sin storlek. Haiku 5.5:s kostnad per uppgift är ändå 0,21 dollar mot Nemotrons 0,09 dollar, så inte ens den pratsamma modellen är den dyra. Vad det säger dig är att priser per token vilseleder åt båda hållen, och att det är siffran per uppgift man ska gå efter.
Självhosting kontra en slutpunkt
Nemotron 3.5 Lightning 30B A3B Base distribueras som öppna vikter och tillhandahålls av flera inferensleverantörer; NVIDIA publicerar också de finjusterade syskonmodellerna. Claude Haiku 5.5 är tillgänglig via Anthropics API och därifrån, varhelst Anthropics modeller säljs vidare. Ingen av dem finns i OrcaRouters katalog, och vi tänker inte låtsas något annat — det vi dirigerar från det här området är anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 och anthropic/claude-fable-5.1, nivån över den här artikelns ämne.
De två vägarna som den här jämförelsen beskriver har genuint olika infrastruktur, och det är värt att namnge dem. Den självhostade vägen innebär en GPU, ett serveringsramverk, ett kvantiseringsbeslut och en ops-rotation. Den hostade vägen innebär en nyckel och en modellsträng. OrcaRouter finns för den andra vägen: ett API för 200+ modeller, en nyckel och en faktura, leverantörens listpris som förs vidare med 0 % påslag så att en leverantörsprissänkning är live samma dag, med automatisk failover i botten. Det är inte en väg till en 30B-bascheckpunkt, och att köpa en DGX-klassad maskin är inte en väg till en hostad liten modell.

Vem ska välja vilken
Om din uppgift är väldefinierad, din träningsdata tillräckligt stor för att spela roll och din trafik inte får lämna din egen infrastruktur, är Nemotron 3.5 Lightning 30B A3B Base det mer intressanta objektet: snabbast av 142 i utdatahastighet, halva priset per token och din att modifiera. Budgetera för finjusteringskörningen och serveringskostnaden innan du räknar in besparingarna, eftersom indatapriset på $0.06 förutsätter att någon redan har gjort arbetet som gör en checkpoint till en assistent.
Om du vill skicka en prompt och få ett svar i eftermiddag är Claude Haiku 5.5 den som gör det — 43 på originalindexet mot 13, bildinmatning, ett utdatatak på 128 000 token och ett pris som är riktigt lågt. Jämförelsen ser bara jämn ut i en prislista. Den slutar se jämn ut i samma stund som uppgiften är att svara på en fråga i stället för att ta fram ett dokument.

