
Claude Haiku 5.5 vs. Qwen3.8-Flash-Next: Das Open-Weight-Modell ist nicht das günstige
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Die Intuition besagt, dass ein Open-Weight-Modell aus Alibabas Flash-Tier ein geschlossenes kleines Modell von Anthropic beim Preis unterbieten wird, und bei den beiden auf dem Preisschild stehenden Zahlen tut es das auch: Qwen3.8-Flash-Next wird auf Alibabas eigener API für 0,15 US-Dollar pro Million Eingabe-Tokens und 0,47 US-Dollar pro Million Ausgabe-Tokens angeboten – gegenüber 0,10 und 0,50 US-Dollar für Claude Haiku 5.5. Lässt man jedoch beide gegen dieselbe Benchmark-Suite laufen, kippt die Reihenfolge. Artificial Analysis misst Claude Haiku 5.5 bei Max-Aufwand mit 0,21 US-Dollar pro abgeschlossener Intelligence-Index-Aufgabe; Qwen3.8-Flash-Next kostet bei derselben Messung 0,37 US-Dollar und erzielt dabei einen um drei Punkte niedrigeren Wert. Das günstigere Preisschild gehört dem Modell mit der höheren Rechnung, und der Grund ist derselbe, der die meisten dieser Vergleiche entscheidet: Die Tarifkarte ist nicht der Preis, und das Open-Weight-Modell verdient seinen Unterhalt an anderer Stelle als über eine Rechnung für eine verwaltete API. Genau dieses „woanders“ ist das eigentliche Thema dieses Duells.
Was jedes einzelne ist
Die beiden landeten im Abstand von sechs Wochen und sind nicht dieselbe Art von Artefakt.
• Claude Haiku 5.5 – ein Modell mit geschlossenen Gewichten, veröffentlicht am 7. Oktober 2026, auf der Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry und Claude Platform on AWS. 1M-Token-Kontext, bis zu 128.000 Ausgabe-Tokens auf der synchronen Messages API, adaptives Denken mit einem Aufwandsregler von Niedrig bis Max und einem Standardwert von Mittel, ein Wissensstichtag im Juni 2026 und eine Preisliste, die bei 100.000 Tokens staffelt.
• Qwen3.8-Flash-Next — ein Mixture-of-Experts-Modell mit offenen Gewichten, veröffentlicht am 26. August 2026 unter der Lizenz qwen-community-1.0, von Alibaba als experimentelle Vorschau auf die Architektur beschrieben, die Qwen4 zugrunde liegen wird. Es speichert 125 Mrd. Parameter des Hauptmodells plus eine separate 51 Mrd. große N-Gramm-Einbettungstabelle — insgesamt etwa 176 Mrd., bevor ein 4 Mrd. großes Multi-Token-Prediction-Modul hinzukommt — und aktiviert 6 Mrd. pro Token, mit 512 Experten, Top-10-Routing und 48 Schichten. Es bietet nativ einen Kontextumfang von 262.144 Token, erweiterbar auf 1 Mio. mit YaRN, und akzeptiert Text-, Bild- und Videoeingaben.
• Qwen3.8-Flash — das bereitgestellte kommerzielle Pendant, ebenfalls seit dem 26. August 2026 auf Alibabas QwenCloud live, für $0,16 pro Million Eingabe-Token und $0,47 pro Million Ausgabe-Token mit einem standardmäßigen 1-Mio.-Token-Kontext. Es lohnt sich, es von Flash-Next getrennt zu halten: Das eine ist ein Checkpoint, den man herunterladen und inspizieren kann, das andere ist ein bepreister verwalteter Endpunkt.
Der Unterschied zwischen den letzten beiden ist der eigentliche Grund, warum dieser Vergleich interessant ist. Claude Haiku 5.5 und Qwen3.8-Flash-Next konkurrieren nur in sehr wenigen Punkten, weil nur eines von ihnen auf eigener Hardware ausgeführt werden kann.
Der maßvolle Gesetzentwurf, der in die andere Richtung weist
Alle folgenden unabhängigen Werte stammen von Artificial Analysis zum Intelligence Index v4.3.2. Die Preislisten von Anthropic und Alibaba sind die eigenen veröffentlichten Preise der Anbieter.
• Intelligence Index — Claude Haiku 5.5 bei Max effort 43, Zweiter von 182 Modellen. Qwen3.8-Flash-Next 40, Sechster von 117 in seiner Klasse. Drei Punkte Abstand, zu Anthropics Gunsten.
• Kosten pro Aufgabe — 0,21 $ gegenüber 0,37 $. Das pro Token teurere Modell ist 43 % günstiger pro erledigter Aufgabe.
• Ausgabe-Tokens beim Index-Durchlauf — 440 Millionen für Claude Haiku 5.5 und 240 Millionen für Qwen3.8-Flash-Next, beide gegenüber einem Median von 100 Millionen. Das Qwen-Modell ist der effizientere Schreiber und dennoch die teurere Aufgabe, was zeigt, dass die Lücke nicht allein am Token-Volumen liegt, sondern an der Mischung aus Eingabe und Bewertung, die der Evaluator anwendet.
• Ausgabegeschwindigkeit — 241,9 Token pro Sekunde gegenüber 56,0. Claude Haiku 5.5 ist bei derselben Messung mehr als viermal schneller, und seine Zeit bis zum ersten Token von 295 Sekunden bei diesem Lauf ist ein Artefakt des Denkens bei maximaler Anstrengung und keine Netzwerkkennzahl; die Zeit bis zum ersten Token von Qwen3.8-Flash-Next beträgt 2,53 Sekunden.
• Form der Preistabelle — Claude Haiku 5.5 springt bei 100.000 Tokens von $0,10 und $0,50 auf $0,50 und $2,50. Qwen3.8-Flash bleibt unabhängig von der Länge konstant bei $0,16 und $0,47, was bei langen Prompts ein echter Vorteil ist und der einzige Punkt, an dem das Preisschild-Argument den Kontakt mit einem langen Dokument übersteht.
• Tokenisierer — Claude Haiku 5.5 verwendet den neueren Tokenisierer, der auch in Claude 4.7 und späteren Versionen zum Einsatz kommt, sodass derselbe Text als rund 30 % mehr Tokens zählt als beim vorherigen Haiku. Das bläht Prompts in Richtung der 100.000-Token-Schwelle auf; es stammt aus Anthropics eigener Dokumentation und spricht genau im Fall langer Prompts gegen das Modell – also dort, wo der Qwen-Pauschaltarif am besten aussieht.
Der Kompromiss sieht also so aus: mehr pro Token zahlen, dafür eine schnellere, etwas klügere Antwort bekommen, die pro abgeschlossener Aufgabe weniger kostet – mit einer Tarifklippe, die man bei langen Eingaben im Auge behalten sollte. Oder weniger pro Token zahlen und ein langsameres Modell bekommen, das pro abgeschlossener Aufgabe mehr kostet – mit einem konstanten Tarif und einem nativen Fenster von 262.144 Token.


Wo die offenen Gewichte tatsächlich das Kalkül verändern
Alles oben vergleicht zwei Managed-APIs, und das ist der Vergleich, den Qwen3.8-Flash-Next nicht gewinnen sollte. Sein Argument ist, dass es nicht gemietet werden muss.
• Serving-Unterstützung ab Tag eins. SGLang hat eine Cookbook-Seite und ein dediziertes Image veröffentlicht; vLLM bietet einen Build dafür, während der Pull Request für die Architektur-Unterstützung noch offen ist. NVIDIA hat beide plus TensorRT LLM auf einem GB300 NVL72-Rack validiert, und NeMo deckt das Fine-Tuning ab.
• Die Hardware-Hürde für einen 176B-Checkpoint ist niedrig. Die 51B-N-Gramm-Embedding-Tabelle kann im Host-Speicher statt im VRAM liegen, weil ihre Lookup-Adressen im Voraus bekannt sind und vorab geladen werden können. Dadurch lässt sich das Modell auf DGX-Spark-Clustern und 4×RTX PRO 6000 Workstations ausführen, und noch am selben Tag veröffentlichte Community-Quantisierungen – 1-Bit-Builds, die in 75 GB RAM passen und etwa 80 % der vollen Genauigkeit erreichen – bringen es auf Hardware, die ein kleines Team besitzt.
• Fine-Tuning ist verfügbar. Nicht im Sinne einer gehosteten Tuning-API: Die Gewichte gehören Ihnen, unter einer Community-Lizenz mit den üblichen Bedingungen, und die Architektur ist in einem technischen Bericht dokumentiert, der die Ablationen und die negativen Ergebnisse veröffentlicht.
• Das Fenster ist kleiner, als es aussieht. 262.144 n, mit YaRN auf 1 Mio. erweiterbar – gegenüber 1 Mio. nativ bei Claude Haiku 5.5, ohne Rope-Scaling-Einschränkung. Bei den Langdokument-Workloads, bei denen der pauschale Qwen-Tarif am attraktivsten ist, ist das Modell, das das Dokument tatsächlich aufnehmen kann, das andere.
• Die Benchmark-Ergebnisse stammen vom Anbieter. Alibabas eigene Tabelle platziert Flash-Next bei DeepSWE 1.1 (58,7 gegenüber 54,4), SWE-bench Pro (62,5 gegenüber 56,0) und GPQA Diamond (91,7 gegenüber 90,8) vor DeepSeek-V4-Flash-0731 und bei NL2Repo-Bench (48,1 gegenüber 54,2) dahinter – Repository-Level-Codegenerierung, die einzige agentische Dimension, in der das kleinere Modell nicht mithält. Nichts davon wurde von Dritter Seite reproduziert, und das Modell ist sechs Wochen alt.
Das ist die ehrliche Grenze zwischen den beiden. Claude Haiku 5.5 ist ein nach Verbrauch abgerechneter Dienst mit einer festen Qualitätsobergrenze und ohne operative Oberfläche. Qwen3.8-Flash-Next ist ein Artefakt, dessen Kostenkurve sich nach unten in Richtung des Strompreises krümmt und dessen Qualitätsobergrenze das ist, was man selbst bereitstellen kann, plus das Risiko einer nicht reproduzierten Benchmark-Tabelle und einer Architektur, die noch von den Runtimes absorbiert wird.
Der realistische Weg zur Entscheidung
Drei Fragen klären es, und nur die erste dreht sich um Benchmarks.
Haben Sie GPUs, oder möchten Sie welche? Falls nicht, ist der Self-Hosting-Fall theoretisch und der obige Managed-Vergleich die ganze Geschichte – und er geht bei Kosten pro Aufgabe, Geschwindigkeit und Punktzahl an Claude Haiku 5.5, mit der Einschränkung, dass sein 100.000-Token-Schritt lange Prompts bestraft. Wenn Sie jedoch Beschleuniger haben, die unter einem Auslastungsziel liegen, ist Qwen3.8-Flash-Next eines der wenigen offenen Modelle, bei denen ein Decode mit 6B aktiven Parametern wirklich günstig in großem Umfang zu betreiben ist, und die Zahl von 0,37 $ pro Aufgabe ist nicht mehr die relevante Zahl.
Wie lang ist der durchschnittliche Prompt? Dies ist der einzige Punkt, an dem das Preisschild-Argument gilt. Unter 100.000 Tokens – nach einem Tokenizer, der um etwa 30 % aufbläht – ist Claude Haiku 5.5 bei jedem Meter günstiger. Darüber ist die Pauschale von 0,16 $ und 0,47 $ die bessere Karte, und ihr Vorteil wächst mit der Länge bis hin zum nativen Fenster von 262.144 Tokens, jenseits dessen die YaRN-Erweiterung ein anderes Engineering-Problem ist.
Wie hoch ist die Toleranz des Workloads gegenüber Latenzschwankungen? 241,9 Ausgabe-Tokens pro Sekunde gegenüber 56,0 sind eine große Kluft, und ein selbst gehostetes Deployment bringt zusätzlich Warteschlangenverzögerungen mit sich. Ein Live-Support- oder Browser-steuernder Agent – die Workloads, die Anthropic für diese Stufe nennt – wird den Unterschied spüren.
Für alle, die die zweite und dritte Frage beantworten wollen, anstatt über sie nachzudenken, ist das günstigste Instrument ein gemeinsamer Endpunkt. Qwen3.8-Flash-Next ist noch nicht im Katalog von OrcaRouter, und Claude Haiku 5.5 ebenfalls nicht; das Qwen-Schwestermodell, das wir tatsächlich routen, ist Qwen3.8-Flash, zum Listenpreis des Anbieters mit 0 % Aufschlag, der durchgereicht wird, was das nächstgelegene angebotene Äquivalent zu dem Modell in diesem Vergleich und die richtige Ausgangsbasis für einen Kostentest mit langen Prompts ist. Auf der Anthropic-Seite sind Claude Haiku 4.5, Claude Sonnet 5.5 und Claude Opus 5.5 heute alle über denselben Schlüssel aufrufbar, sodass ein Zwei-Generationen-Preisexperiment eher eine Konfiguration als ein zweiter Vertrag ist — und weil die Preisgestaltung durchgereicht statt gemischt ist, schlägt eine Anbieter-Preissenkung auf einem der beiden Wege noch am selben Tag, an dem sie angekündigt wird, bei uns durch. Automatisches Failover ist es, was das Experiment sicher auf echtem Traffic laufen lässt: ein Vorschaumodell oder eine nicht reproduzierte Benchmark-Tabelle ist genau der Fall, in dem man eine Route auf etwas Neues richtet, während ein vertrauenswürdiges Modell dahinter sitzt.
Was würde die Antwort ändern?
Zwei Dinge, beide überprüfbar. Das erste ist eine unabhängige Evaluierung von Qwen3.8-Flash-Next auf einem Evaluierungs-Harness, auf dem auch Claude Haiku 5.5 läuft — die Anbietertabelle vergleicht mit DeepSeek, und die 40 des unabhängigen Leaderboards ist eine einzelne Platzierung. Ein Coding-Score auf Repository-Ebene ist die Zeile, auf die man achten sollte, denn bei NL2Repo hat das Modell bereits gezeigt, dass es hinterherhinkt. Das zweite ist, ob die Runtime-Arbeit landet: Die vLLM-Unterstützung wird noch über offene Pull Requests zusammengeführt, und bis es so weit ist, ist das Selbsthosting dieser Architektur eher eine Übung für Teams, denen so etwas Spaß macht, als ein unterstützter Weg.
Bis dahin ist die Zusammenfassung kurz. Qwen3.8-Flash-Next ist das interessantere Modell, wenn man es besitzen möchte, und das teurere, wenn man es mieten möchte. Claude Haiku 5.5 ist der günstigere, schnellere, höher bewertete verwaltete Endpunkt, mit einer Preisliste, die alles Lange bestraft. Entscheiden Sie danach, ob Sie Tokens oder einen Checkpoint kaufen — und wenn Sie Tokens kaufen, beachten Sie, dass das Open-Weight-Modell nicht der Rabatt ist, den Sie angenommen haben.

