Een gegenereerde herokaart met de titel 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base', met de kicker 'DE GOEDKOPE KAN GEEN VRAAG BEANTWOORDEN' en chips met de tekst $ 0,10 vs $ 0,06 per miljoen inputtokens, AA Index 43 tegen 13, en antwoordgereed tegenover basis-checkpoint.
Guides & Insights

Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: De goedkope kan geen vraag beantwoorden

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op de twee getallen waar een inkoopspreadsheet het meest om geeft, wint het goedkopere en snellere model. Nemotron 3.5 Lightning 30B A3B Base haalt 298,9 outputtokens per seconde, het snelste van 142 onafhankelijk gevolgde modellen, en kost $0,06 per miljoen invoertokens tegenover $0,10 voor Claude Haiku 5.5. Het is ook, zoals het woord "Base" in de naam je waarschuwt, geen assistent. Het is een vooraf getraind checkpoint — geen supervised fine-tuning, geen reinforcement learning, geen chat-sjabloon dat de naam waard is — gepubliceerd onder de OpenMDW-1.1-licentie op 11 augustus 2026, zodat anderen erop kunnen voortbouwen. Claude Haiku 5.5, uitgebracht op 7 oktober 2026, is een afgewerkt product waaraan je een vraag kunt stellen. Ze op prijs vergelijken is als de kosten van meel vergelijken met de kosten van brood, en het interessante deel van deze confrontatie is uitzoeken welke jouw workload nu echt nodig heeft.

Niemand in de berichtgeving over de lancering zegt dat deel duidelijk, omdat "goedkoper en sneller dan Claude Haiku 5.5" een betere kop is dan "goedkoper, sneller en niet bruikbaar zonder een fine-tuning-run." Beide beweringen zijn waar. Slechts één ervan is nuttig.

Wat elk model daadwerkelijk is

Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, uitgebracht op 7 oktober 2026. Tekst en afbeeldingen in, tekst uit. Context van 1M tokens, maximale uitvoer van 128.000 tokens (300.000 achter een bèta-header op de Batch API), trainingsafsluitdatum juni 2026, buitengebruikstelling niet eerder dan 7 oktober 2027. Instelbare inspanning van Low, Medium, High, Xhigh en Max, standaard Medium, met adaptief denken standaard ingeschakeld. API met verbruiksmeting, cache-leesbewerkingen tegen $0,01 per miljoen, Batch tegen half tarief. Beschikbaar via Anthropic's API en van daaruit overal waar Anthropic's modellen worden doorverkocht.

Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, aangekondigd op 11 augustus 2026. Een hybride mixture-of-experts-checkpoint van 30 miljard parameters met ongeveer 3 miljard actieve parameters per token, gebouwd op een stack van Mamba-2 plus MoE plus attention, gedistilleerd uit Nemotron 3 Ultra, en geleverd met MTP, DFlash en DSpark speculative decoding. De context loopt tot 1M tokens, hoewel ongeveer 256.000 het praktische plafond is op één enkele H100. Het is alleen tekst. De gewichten zijn open onder OpenMDW-1.1. En het is een base-checkpoint: ruwe vooraf getrainde gewichten zonder instruction tuning, wat betekent dat het tekst aanvult in plaats van instructies op te volgen.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base — the scoreboard'. Claude Haiku 5.5 reads output speed 243.4 tokens per second, AA Index 43, proprietary weights, instruction-tuned yes, $0.10 per million input and $0.21 per task; the Nemotron column reads output speed 298.9 tokens per second, AA Index 13, weights open under OpenMDW-1.1, instruction-tuned no — base checkpoint, $0.06 per million input and $0.09 per task. A footer notes the Artificial Analysis figures are independently run and the NVIDIA figures are vendor-reported and unreproduced.

• De afmetingen, één per regel

• Invoerprijs — Claude Haiku 5.5 $0,10 per miljoen tot 100K tokens, daarna $0,50; Nemotron 3.5 Lightning 30B A3B Base $0,06 per miljoen.

• Uitvoerprijs — $0,50 per miljoen tot 100K tokens, daarna $2,50, tegenover $0,20 per miljoen.

• Kosten per voltooide taak — $0,21 per onafhankelijke indextaak voor Claude Haiku 5.5, tegenover $0,09 voor Nemotron — het goedkopere model is goedkoper per taak, niet alleen per token.

• Uitvoersnelheid — 243,4 tokens per seconde voor Claude Haiku 5.5, negende van 182; 298,9 tokens per seconde voor Nemotron, eerste van 142.

• Tijd tot eerste token — ongeveer 0,3 seconde voor Claude Haiku 5.5, tegenover 0,54 seconde voor Nemotron.

• Onafhankelijke score — Artificial Analysis Intelligence Index 43 voor Claude Haiku 5.5, tweede van 182, met de Max-configuratie op 43,40; Index 13 voor Nemotron, negenentwintigste van 142.

• Contextvenster — elk 1.000.000 tokens, waarvan ongeveer 256.000 praktisch bruikbaar voor Nemotron op één enkele H100.

• Modaliteiten — tekst en afbeelding als invoer voor Claude Haiku 5.5; alleen tekst voor Nemotron.

• Gewichten — propriëtair versus open onder OpenMDW-1.1, een hybride MoE met 30B totaal en 3B actief.

• Instruction tuning — aanwezig op Claude Haiku 5.5, afwezig op het Base-checkpoint.

Het "Base"-probleem, eenvoudig gesteld

Een basis-checkpoint voorspelt het volgende token. Stel het een vraag en het zal de tekst vaak voortzetten in de stijl van een document dat zo'n vraag zou kunnen bevatten, in plaats van te antwoorden. Geef het de prompt "Vat dit contract samen" en een basismodel produceert mogelijk een plausibele voortzetting van een juridisch trainingsdocument in plaats van een samenvatting van het uwe. NVIDIA publiceert een apart BF16-checkpoint en aparte instructie-afgestemde zustermodellen, precies omdat de basisgewichten grondstof zijn.

Op NVIDIA's eigen modelkaart — door de leverancier gerapporteerd, niet onafhankelijk gereproduceerd — scoort het basischeckpoint 78,59 op MMLU, 67,94 op MMLU-Pro, 91,28 op GSM8K, 77,44 op HumanEval en 69,62 op RULER bij 1M tokens. De Lightning-kaart voor het getunede zustermodel meldt MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 en 86% op PinchBench, met ongeveer 30% snellere inferentie dan het model dat het vervangt. Zelfs de getunede cijfers zijn van NVIDIA zelf, en de basiscijfers zijn degene die van toepassing zijn op het checkpoint dat in de titel van dit artikel wordt genoemd. Daartegenover is Claude Haiku 5.5's onafhankelijk gemeten 43,40 — tweede van 182 op de index van Artificial Analysis, een andere index die andere dingen meet — niet direct vergelijkbaar, en de eerlijke lezing is dat een 30B-basischeckpoint en een afgerond klein model door verschillende instrumenten voor verschillende doeleinden worden beoordeeld.

Wat zonder voorbehoud gezegd kan worden, is de vorm van de kloof. Een basis-checkpoint dat een fine-tuningpijplijn, een servingstack en een evaluatieharnas nodig heeft voordat het ook maar iets kan beantwoorden, is geen vervanging voor een gehost model tegen $0,10 per miljoen. Het is een startpunt voor iemand die het model zelf wil bezitten.

Waar Nemotron echt wint, en het is geen troostprijs

Snelheid voorop. 298,9 outputtokens per seconde zet het bovenaan een ranglijst van 142 modellen — 23% sneller dan de 243,4 van Claude Haiku 5.5. Voor een latentiegevoelige pipeline is dat een echt, meetbaar verschil, en het is de reden dat de naam "Lightning" op de doos staat.

Open weights ten tweede, en dit is de belangrijkere. Onder OpenMDW-1.1 kun je het checkpoint downloaden, het fine-tunen op je eigen data en het zelf hosten. Claude Haiku 5.5 kan helemaal niet worden gefine-tuned en kan tegen geen enkele prijs zelf worden gehost. Voor een team met een propriëtaire taak, een ongebruikelijke inputdistributie of een compliancevereiste dat verkeer hun eigen infrastructuur nooit verlaat, is dat verschil beslissend, ongeacht wat de benchmarkpagina's zeggen. Een 30B-totaal met 3B actief is ook klein genoeg om economisch te kunnen worden geserveerd — de architectuur is precies daarvoor ontworpen.

Ten derde, de prijs: $0,06 input en $0,20 output per miljoen, met 17% cachekorting en $0,09 per indextaak, is ongeveer de helft van de $0,21 van Claude Haiku 5.5. Beide modellen zijn goedkoop; Nemotron is goedkoper.

Waar Claude Haiku 5.5 wint, en dat is op elke dimensie die een antwoord vereist.

Instructieopvolging, omdat het daarvoor is getraind. Onafhankelijke capaciteit, op Index 43 tegen 13 — een gat van dertig punten op een board waarop beide een score kregen, het grootste dergelijke gat in deze reeks vergelijkingen. Beeldinvoer, die Nemotron helemaal niet accepteert. Maximale uitvoer van 128.000 tokens tegen een niet-gepubliceerd cijfer, met een bètapad van 300.000 tokens op Batch. En de inspanningsregelaar, waarmee je kosten kunt terugwinnen door de redeneerinspanning te verlagen in plaats van door het model opnieuw op te bouwen.

De kanttekening over breedsprakigheid snijdt hier naar twee kanten. In de suite van Artificial Analysis produceert Claude Haiku 5.5 ongeveer 440 miljoen outputtokens tegenover een mediaan van ongeveer 100 miljoen — het model denkt heel wat af. Nemotron produceert ongeveer 120 miljoen, wat dezelfde bron omschrijft als wat breedsprakig voor zijn omvang. De kosten per taak van Haiku 5.5 bedragen niettemin $0,21 tegenover $0,09 voor Nemotron, dus zelfs het breedsprakige model is niet het dure model. Wat dat je leert, is dat prijzen per token in beide richtingen misleidend zijn, en dat het getal per taak het getal is waarop je je budget moet baseren.

Zelf hosten versus één endpoint

Nemotron 3.5 Lightning 30B A3B Base wordt gedistribueerd als open gewichten en aangeboden door meerdere inference-providers; NVIDIA publiceert ook de getunede zustermodellen. Claude Haiku 5.5 is beschikbaar via de API van Anthropic en van daaruit overal waar de modellen van Anthropic worden doorverkocht. Geen van beide staat in de catalogus van OrcaRouter, en we zullen niet doen alsof dat wel zo is — wat wij uit deze hoek routeren is anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 en anthropic/claude-fable-5.1, het niveau boven het onderwerp van dit artikel.

De twee paden die deze vergelijking beschrijft, hebben werkelijk een verschillende infrastructuur, en het is de moeite waard ze te benoemen. Het zelf-gehoste pad betekent een GPU, een serving-framework, een kwantisatiebeslissing en een operations-roulatie. Het gehoste pad betekent een sleutel en een model-string. OrcaRouter bestaat voor het tweede pad: één API voor meer dan 200 modellen, één sleutel en één factuur, de lijstprijs van de provider doorgegeven tegen 0% marge, zodat een korting van een leverancier dezelfde dag live staat, met automatische failover eronder. Het is geen route naar een 30B-basis-checkpoint, en het kopen van een machine uit de DGX-klasse is geen route naar een gehost klein model.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

Wie moet welke kiezen

Als je taak goed is afgebakend, je trainingsgegevens groot genoeg zijn om ertoe te doen en je verkeer je eigen infrastructuur niet kan verlaten, is Nemotron 3.5 Lightning 30B A3B Base het interessantere object: snelste van 142 qua uitvoersnelheid, de helft van de prijs per token, en jij kunt hem aanpassen. Begroot de fine-tuningrun en de serveerkosten voordat je de besparingen meetelt, want het inputtarief van $0.06 veronderstelt dat iemand al het werk heeft gedaan dat van een checkpoint een assistent maakt.

Als je vanmiddag een prompt wilt versturen en een antwoord wilt krijgen, is Claude Haiku 5.5 degene die dat doet — 43 op de onafhankelijke index tegenover 13, beeldinvoer, een uitvoerplafond van 128.000 tokens en een prijs die echt laag is. Alleen op een prijslijst lijkt de vergelijking nipt. Ze lijkt niet langer nipt op het moment dat de taak is om een vraag te beantwoorden in plaats van een document voort te zetten.

A capture of the Artificial Analysis page for Nemotron 3.5 Lightning showing its Intelligence Index of 13 and rank of 29 of 142, the $0.06 per-million input and $0.20 output pricing, the $0.09 cost per index task, the 298.9 tokens-per-second output speed ranked first of 142, the 0.54-second time to first token, the 1M-token context window, text-only input and open weights.