Eine generierte Hero-Karte mit dem Titel „Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base“, mit dem Kicker „DAS GÜNSTIGE KANN KEINE FRAGE BEANTWORTEN“ und Chips mit der Aufschrift 0,10 $ vs. 0,06 $ pro Million Input-Tokens, AA Index 43 gegenüber 13 und antwortbereit gegenüber Basis-Checkpoint.
Guides & Insights

Claude Haiku 5.5 vs. Nemotron 3.5 Lightning 30B A3B Base: Der Günstige kann keine Frage beantworten

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Bei den beiden Zahlen, auf die es in einer Beschaffungstabelle am meisten ankommt, gewinnt das günstigere und schnellere Modell. Nemotron 3.5 Lightning 30B A3B Base läuft mit 298,9 Ausgabe-Tokens pro Sekunde, ist damit das schnellste von 142 unabhängig erfassten Modellen und kostet 0,06 $ pro Million Eingabe-Tokens gegenüber 0,10 $ bei Claude Haiku 5.5. Es ist außerdem – wie das Wort „Base“ in seinem Namen Sie warnt – kein Assistent. Es ist ein vortrainierter Checkpoint – kein überwachtes Fine-Tuning, kein Reinforcement Learning, keine Chat-Vorlage, die den Namen verdient –, der am 11. August 2026 unter der OpenMDW-1.1-Lizenz veröffentlicht wurde, damit andere darauf aufbauen können. Claude Haiku 5.5, veröffentlicht am 7. Oktober 2026, ist ein fertiges Produkt, an das Sie eine Frage senden können. Sie beim Preis zu vergleichen ist wie ein Vergleich der Mehlkosten mit den Brotkosten, und der interessante Teil dieses Duells ist herauszufinden, welche von beiden Ihre Workload tatsächlich braucht.

Niemand in der Berichterstattung zum Start sagt diesen Teil deutlich, weil „günstiger und schneller als Claude Haiku 5.5“ eine bessere Schlagzeile ist als „günstiger, schneller und ohne einen Fine-Tuning-Durchlauf nicht nutzbar“. Beide Aussagen sind wahr. Nur eine davon ist nützlich.

Was jedes Modell tatsächlich ist

Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, veröffentlicht am 7. Oktober 2026. Text und Bild als Eingabe, Text als Ausgabe. Kontext von 1 Mio. Token, maximale Ausgabe von 128.000 Token (300.000 hinter einem Beta-Header in der Batch-API), Trainings-Cutoff Juni 2026, Außerbetriebnahme frühestens am 7. Oktober 2027. Einstellbarer Aufwand über Low, Medium, High, Xhigh und Max, standardmäßig Medium, mit standardmäßig aktiviertem adaptiven Denken. API mit nutzungsbasierter Abrechnung, Cache-Lesevorgänge zu 0,01 $ pro Million, Batch zum halben Tarif. Verfügbar über die API von Anthropic und von dort aus überall dort, wo Anthropics Modelle weiterverkauft werden.

Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, angekündigt am 11. August 2026. Ein hybrider Mixture-of-Experts-Checkpoint mit 30 Milliarden Parametern und etwa 3 Milliarden aktiven Parametern pro Token, aufgebaut auf einem Stack aus Mamba-2 plus MoE plus Attention, destilliert aus Nemotron 3 Ultra und ausgeliefert mit spekulativem Decoding von MTP, DFlash und DSpark. Der Kontext reicht bis zu 1 Mio. Token, wobei etwa 256.000 die praktische Obergrenze auf einer einzelnen H100 ist. Es ist ausschließlich textbasiert. Die Gewichte sind offen unter OpenMDW-1.1. Und es ist ein Basis-Checkpoint: rohe vortrainierte Gewichte ohne Instruction-Tuning, was bedeutet, dass es Text vervollständigt, statt Anweisungen zu befolgen.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base — the scoreboard'. Claude Haiku 5.5 reads output speed 243.4 tokens per second, AA Index 43, proprietary weights, instruction-tuned yes, $0.10 per million input and $0.21 per task; the Nemotron column reads output speed 298.9 tokens per second, AA Index 13, weights open under OpenMDW-1.1, instruction-tuned no — base checkpoint, $0.06 per million input and $0.09 per task. A footer notes the Artificial Analysis figures are independently run and the NVIDIA figures are vendor-reported and unreproduced.

• Die Abmessungen, jeweils eine Zeile

• Eingabepreis — Claude Haiku 5.5 0,10 $ pro Million bis 100K Token, danach 0,50 $; Nemotron 3.5 Lightning 30B A3B Base 0,06 $ pro Million.

• Ausgabepreis — 0,50 $ pro Million bis 100K Tokens, danach 2,50 $, gegenüber 0,20 $ pro Million.

• Kosten pro abgeschlossener Aufgabe — 0,21 $ pro unabhängiger Index-Aufgabe für Claude Haiku 5.5, gegenüber 0,09 $ für Nemotron — das günstigere Modell ist nicht nur pro Token, sondern auch pro Aufgabe günstiger.

• Ausgabegeschwindigkeit — 243,4 Token pro Sekunde für Claude Haiku 5.5, Platz 9 von 182; 298,9 Token pro Sekunde für Nemotron, Platz 1 von 142.

• Zeit bis zum ersten Token — etwa 0,3 Sekunden für Claude Haiku 5.5, gegenüber 0,54 Sekunden für Nemotron.

Unabhängige Bewertung — Artificial Analysis Intelligence Index 43 für Claude Haiku 5.5, Zweiter von 182, mit der Max-Konfiguration bei 43.40; Index 13 für Nemotron, Neunundzwanzigster von 142.

• Kontextfenster — jeweils 1.000.000 Token, wovon etwa 256.000 für Nemotron auf einer einzelnen H100 praktisch nutzbar sind.

• Modalitäten — Text und Bild als Eingabe für Claude Haiku 5; nur Text für Nemotron.

• Gewichte — proprietär gegenüber offen unter OpenMDW-1.1, ein hybrides MoE mit 30B Gesamt- und 3B aktiven Parametern.

• Instruction-Tuning — vorhanden bei Claude Haiku 5.5, nicht vorhanden beim Base-Checkpoint.

Das „Base“-Problem, klar formuliert

Ein Basis-Checkpoint sagt das nächste Token voraus. Stellen Sie ihm eine Frage, und es wird oft den Text im Stil eines Dokuments fortsetzen, das eine solche Frage enthalten könnte, anstatt zu antworten. Prompten Sie es mit „Fassen Sie diesen Vertrag zusammen“, und ein Basismodell erzeugt möglicherweise eine plausible Fortsetzung eines juristischen Trainingsdokuments anstatt einer Zusammenfassung Ihres Vertrags. NVIDIA veröffentlicht einen separaten BF16-Checkpoint und separate instruktionsoptimierte Geschwistermodelle genau deshalb, weil die Basisgewichte Rohmaterial sind.

Auf NVIDIAs eigener Modellkarte – vom Anbieter gemeldet, nicht unabhängig reproduziert – erzielt der Basis-Checkpoint 78,59 bei MMLU, 67,94 bei MMLU-Pro, 91,28 bei GSM8K, 77,44 bei HumanEval und 69,62 bei RULER mit 1M Tokens. Die Lightning-Karte für das feinabgestimmte Schwestermodell meldet MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 und 86 % bei PinchBench, mit etwa 30 % schnellerer Inferenz als das Modell, das ersetzt wurde. Selbst die feinabgestimmten Zahlen sind NVIDIAs eigene, und die Basis-Zahlen sind diejenigen, die für den im Titel dieses Artikels genannten Checkpoint gelten. Ihnen gegenübergestellt sind die unabhängig gemessenen 43,40 von Claude Haiku 5.5 – auf Platz zwei von 182 im Index von Artificial Analysis, einem anderen Index, der andere Dinge misst – nicht direkt vergleichbar, und die ehrliche Lesart ist, dass ein 30B-Basis-Checkpoint und ein fertiges kleines Modell mit unterschiedlichen Instrumenten für unterschiedliche Zwecke bewertet werden.

Was ohne Einschränkung gesagt werden kann, ist die Form der Lücke. Ein Basis-Checkpoint, der eine Fine-Tuning-Pipeline, einen Serving-Stack und einen Evaluierungs-Harness braucht, bevor er überhaupt etwas beantwortet, ist kein Ersatz für ein gehostetes Modell für 0,10 $ pro Million. Er ist ein Ausgangspunkt für jemanden, der das Modell selbst besitzen möchte.

Wo Nemotron wirklich gewinnt – und das ist kein Trostpreis

Geschwindigkeit zuerst. 298,9 Ausgabe-Tokens pro Sekunde bringen es an die Spitze eines Rankings mit 142 Modellen – 23 % schneller als die 243,4 von Claude Haiku 5.5. Für eine latenzempfindliche Pipeline ist das ein echter, messbarer Unterschied, und es ist der Grund dafür, dass der Name „Lightning“ auf der Verpackung steht.

Zweitens: offene Gewichte – und das ist der größere Punkt. Unter OpenMDW-1.1 können Sie den Checkpoint herunterladen, ihn mit Ihren eigenen Daten feinabstimmen und selbst bereitstellen. Claude Haiku 5.5 lässt sich überhaupt nicht feinabstimmen und kann zu keinem Preis selbst gehostet werden. Für ein Team mit einer proprietären Aufgabe, einer ungewöhnlichen Eingabeverteilung oder einer Compliance-Anforderung, dass der Datenverkehr die eigene Infrastruktur nie verlässt, ist dieser Unterschied entscheidend, unabhängig davon, was die Benchmark-Seiten sagen. Ein 30B-Modell mit 3B aktiven Parametern ist außerdem klein genug, um wirtschaftlich betreibbar zu sein – die Architektur ist genau dafür ausgelegt.

Preis an dritter Stelle: 0,06 $ Eingabe und 0,20 $ Ausgabe pro Million, mit 17 % Cache-Rabatt und 0,09 $ pro Index-Aufgabe, ist etwa halb so viel wie die 0,21 $ von Claude Haiku 5.5. Beide Modelle sind günstig; Nemotron ist günstiger.

Wo Claude Haiku 5.5 gewinnt – und zwar in jeder Dimension, die eine Antwort erfordert

Instruktionsbefolgung, weil es dafür trainiert wurde. Eigenständige Fähigkeit, mit Index 43 gegenüber 13 – eine Dreißig-Punkte-Lücke auf einem Board, das beide bewertet hat, die größte derartige Lücke in dieser Vergleichsgruppe. Bildeingabe, die Nemotron überhaupt nicht akzeptiert. Maximale Ausgabe von 128.000 Tokens gegenüber einem nicht veröffentlichten Wert, mit einem Beta-Pfad von 300.000 Tokens bei Batch. Und der Effort-Regler, mit dem man Kosten zurückgewinnen kann, indem man den Reasoning-Aufwand senkt, statt das Modell neu aufzubauen.

Der Vorbehalt zur Ausführlichkeit wirkt hier in beide Richtungen. In der Benchmark-Suite von Artificial Analysis erzeugt Claude Haiku 5.5 etwa 440 Millionen Ausgabe-Tokens gegenüber einem Median von rund 100 Millionen – es denkt sehr viel. Nemotron erzeugt etwa 120 Millionen, was dieselbe Quelle als für seine Größe etwas weitschweifig beschreibt. Die Kosten pro Aufgabe von Haiku 5.5 liegen dennoch bei 0,21 US-Dollar gegenüber 0,09 US-Dollar bei Nemotron, sodass selbst das geschwätzige Modell nicht das teure ist. Das zeigt, dass Preise pro Token in beide Richtungen in die Irre führen und die Pro-Aufgabe-Zahl diejenige ist, an der man sich für das Budget orientieren sollte.

Self-Hosting versus ein einziger Endpunkt

Nemotron 3.5 Lightning 30B A3B Base wird als offenes Gewicht vertrieben und von mehreren Inferenzanbietern bereitgestellt; NVIDIA veröffentlicht außerdem die abgestimmten Geschwistermodelle. Claude Haiku 5.5 ist über Anthropics API verfügbar und von dort aus überall dort, wo Anthropics Modelle weiterverkauft werden. Keines von beiden steht im Katalog von OrcaRouter, und wir werden nichts anderes vorgeben — was wir aus dieser Nachbarschaft routen, sind anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 und anthropic/claude-fable-5.1, die Stufe über dem Gegenstand dieses Artikels.

Die beiden Wege, die dieser Vergleich beschreibt, haben wirklich unterschiedliche Infrastruktur, und es lohnt sich, sie zu benennen. Der selbst gehostete Weg bedeutet eine GPU, ein Serving-Framework, eine Quantisierungsentscheidung und eine Ops-Rotation. Der gehostete Weg bedeutet einen Schlüssel und einen Modell-String. OrcaRouter existiert für den zweiten Weg: eine API für über 200 Modelle, ein Schlüssel und eine Rechnung, Anbieter-Listenpreis ohne Aufschlag durchgereicht, sodass eine Anbieter-Preissenkung noch am selben Tag live ist, mit automatischem Failover darunter. Es ist kein Weg zu einem 30B-Basis-Checkpoint, und der Kauf einer Box der DGX-Klasse ist kein Weg zu einem gehosteten kleinen Modell.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

Wer sollte welche auswählen?

Wenn Ihre Aufgabe klar definiert ist, Ihre Trainingsdaten groß genug sind, um ins Gewicht zu fallen, und Ihr Datenverkehr Ihre eigene Infrastruktur nicht verlassen darf, ist Nemotron 3.5 Lightning 30B A3B Base das interessantere Objekt: der schnellste von 142 bei der Ausgabegeschwindigkeit, zum halben Preis pro Token und Ihnen zur Anpassung überlassen. Planen Sie das Budget für den Fine-Tuning-Lauf und die Serving-Kosten ein, bevor Sie mit den Einsparungen rechnen, denn der Eingabepreis von 0,06 $ setzt voraus, dass jemand bereits die Arbeit erledigt hat, die aus einem Checkpoint einen Assistenten macht.

Wenn Sie einen Prompt senden und noch heute Nachmittag eine Antwort erhalten möchten, ist Claude Haiku 5.5 das Modell, das das schafft – 43 auf dem unabhängigen Index gegenüber 13, Bildeingabe, eine Ausgabeobergrenze von 128.000 Token und ein Preis, der wirklich niedrig ist. Der Vergleich wirkt nur auf einer Preisliste knapp. Er wirkt nicht mehr knapp, sobald die Aufgabe darin besteht, eine Frage zu beantworten statt ein Dokument fortzusetzen.

A capture of the Artificial Analysis page for Nemotron 3.5 Lightning showing its Intelligence Index of 13 and rank of 29 of 142, the $0.06 per-million input and $0.20 output pricing, the $0.09 cost per index task, the 298.9 tokens-per-second output speed ranked first of 142, the 0.54-second time to first token, the 1M-token context window, text-only input and open weights.