
Claude Haiku 5.5 vs. Qwen3.8-Flash-Next: Drei Cent Unterschied pro Token, achtundsiebzig pro fertiggestelltem Auftrag.
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Legt man die beiden Preislisten nebeneinander, wirken sie, als stammten sie aus derselben Besprechung. Claude Haiku 5.5 kostet 0,10 $ für Input und 0,50 $ für Output. Qwen3.8-Flash-Next kostet 0,15 $ für Input und 0,47 $ für Output. Das Modell des Anbieters ist beim Input ein Drittel günstiger und beim Output sechs Prozent teurer. Keiner der beiden Anbieter hat diese Form zufällig gewählt, und keiner hat eine Vergleichsnotiz veröffentlicht, die erklärt, worauf sie abzielten – doch die Arithmetik einer gemischten 3:1-Arbeitslast macht die Absicht erkennbar, und sie lässt die beiden in dieser gesamten Stufe preislich am nächsten beieinanderliegen.
Dort endet die Ähnlichkeit. Claude Haiku 5.5 ist ein geschlossenes API-Modell, das am 07.10.2026 mit einem Fenster von einer Million Token und einer Ausgabe von 128.000 Token auf den Markt kam. Qwen3.8-Fast-Next ist ein Open-Weights-Modell mit 180 Milliarden Parametern, davon 6 Milliarden aktive Parameter, dessen Gewichte auf Hugging Face unter der Qwen Community License 1.0 liegen, und mit einem veröffentlichten Kontextfenster, über das seine eigene Checkpoint-Konfiguration und das unabhängige Board nicht vollständig übereinstimmen. Veröffentlicht am 26.08.2026, ist es weder neu noch exotisch für alle, die in diesem Segment bauen.
Die beiden werden absichtlich gemeinsam bepreist. Was Ihnen die Tarifkarten nicht verraten können, ist, dass sie für unterschiedliche Aufgaben gebaut sind und dass das in einer Tabellenkalkulation günstiger wirkende von beiden im Betrieb das teurere ist.
Die Arithmetik, die die Preisgestaltung verrät
Kombiniert man die beiden Preise in einem üblichen Verhältnis von 3:1 zwischen Eingabe und Ausgabe – dem Verhältnis, bei dem sich der meiste Chat- und Code-Assist-Traffic einpendelt –, ergeben sich 0,20 $ pro Million Tokens für Claude Haiku 5.5 und 0,23 $ pro Million für Qwen3.8-Flash-Next. Anthropics Modell ist bei dieser Kombination etwa 13 % günstiger, was ein kleinerer Unterschied ist, als die Eingabespalte nahelegt, und ein größerer, als es die Ausgabespalte tut.
Vertauscht man das Verhältnis, verschiebt sich die Position. Bei 1:1 liegen die beiden bei 0,30 $ und 0,31 $ pro Million — ein Gleichstand innerhalb eines Rundungsfehlers. Bei 1:3, output-dominiert, kommt Claude Haiku 5.5 auf 0,40 $ und Qwen3.8-Flash-Next auf 0,39 $, ein Sieg um einen Cent für Qwen und das einzige Verhältnis, bei dem das Modell von Anthropic nicht das günstigere der beiden ist.
Es gibt keine einzige ehrliche Antwort auf die Frage, welches günstiger ist, und jeder Vergleich, der eine liefert, wählt stellvertretend für die Leserschaft ein Verhältnis. Vertretbar ist Folgendes: Die Tarifkarte von Claude Haiku 5.5 ist auf eingabelastigen Traffic ausgerichtet, die von Qwen3.8-Flash-Next auf ausgabelastigen Traffic, und die drei Cent pro Million Tokens, die sie bei einem Verhältnis von 3:1 trennen, sind die engste Annäherung an Anthropics Zahl, die in dieser Stufe bisher jemand erreicht hat. Das ist eine bewusste Positionierung, egal, was die Launch-Materialien sagen.
Unser Katalog führt Qwen3.8-Flash-Next mit $0,15 für Input und $0,47 für Output pro Million Tokens sowie einem Cache-Input-Tarif von $0,0184. Die $0,15 und $0,47 sind dieselben Werte, die Artificial Analysis als Listenpreis des Anbieters verzeichnet, was die Durchleitungsvereinbarung ergeben soll.
Was ein Tag mit echtem Volumen tatsächlich kostet
Nehmen wir eine Pipeline, die täglich 10 Millionen Eingabe-Tokens und 2 Millionen Ausgabe-Tokens verarbeitet. Das ist ein kleiner Produktions-Workload, der bei typischen Prompt-Längen bequem in die erste Preisstufe fällt.
• Eingabekosten — 1,00 $ pro Tag bei Claude Haiku 5.5, 1,50 $ pro Tag bei Qwen3.8-Flash-Next.
• Ausgabekosten — 1,00 $ pro Tag mit Claude Haiku 5.5, 0,94 $ pro Tag mit Qwen3.8-Flash-Next.
Tagesgesamtbetrag — 2,00 $ gegenüber 2,44 $. Bei dieser Größenordnung liegen sie etwa 160 $ pro Jahr auseinander, bzw. etwa 3,7 Cent pro Million Token.
Wende nun die beiden Anpassungen an, die die Tarifkarte auslässt, und die Richtung kehrt sich um.
Erstens verwendet Claude Haiku 5.5 den neueren Tokenizer, den er sich mit Claude 4.7 und späteren Versionen teilt, der laut Anthropics eigener Dokumentation für denselben Text etwa 30 % mehr Token ansetzt als das Modell, das er ersetzt. Wenn es sich bei Ihrer Eingabe um englische Prosa der Art handelt, an der diese Tokenzahlen gemessen wurden, liegt der effektive Eingabepreis nicht bei $0.10 – er liegt eher bei $0.13 pro Million Wörter Text, was ihn bis auf zwei Cent an Qwen3.8-Flash-Next heranbringt, statt ein Drittel darunter zu liegen.
Zweitens, und gewichtiger: Claude Haiku 5.5 ist weitschweifig. Artificial Analysis verzeichnete für dieses Modell 162.164 Output-Tokens beim Durchlauf des Intelligence Index, gegenüber 107.884 für Qwen3.8-Flash-Next. Wenn dieses Verhältnis bei Ihrer Arbeitslast gilt statt des abstrakten 3:1, ist die obige Output-Zeile nicht mehr $1,00 gegenüber $0,94, sondern eher $1,50 gegenüber $0,94 — und die Tagessumme kippt zugunsten von Qwen.
Keine der beiden Anpassungen ist für sich allein ausschlaggebend. Zusammen sind sie der Unterschied zwischen zwei Modellen, die nur einen Rundungsfehler voneinander entfernt sind, und einem Qwen3.8-Flash-Next, das sich deutlich günstiger betreiben lässt; und die einzige Möglichkeit herauszufinden, welcher Fall zutrifft, ist, Tokens in Ihrem Traffic zu zählen, statt von der Preistabelle aus zu argumentieren.

Wo die Flatrate nicht mehr flach aussieht
Der Preis von Claude Haiku 5.5 weist eine Stufe auf, der von Qwen3.8-Flash-Next nicht.
• Preis — Claude Haiku 5.5 0,10 $ Eingabe / 0,50 $ Ausgabe pro Million Tokens bis zu 100.000 Tokens Prompt, danach 0,50 $ / 2,50 $ darüber; Qwen3.8-Flash-Next 0,15 $ / 0,47 $ pauschal.
• Zwischengespeicherte Eingabe — 0,01 $ zum Lesen und 0,125 $ zum Schreiben für Claude Haiku 5.5; 0,016 $ zum Lesen und 0,23 $ zum Schreiben für Qwen3.8-Flash-Next.
Kontext – eine Million Tokens für Claude Haiku 5.5. Bei Qwen3.8-Flash-Next hängt die Zahl davon ab, wen man fragt: Qwen gibt ein Fenster von einer Million Tokens an, die eigene Konfiguration des Checkpoints begrenzt die Positionseinbettungen auf 262.144, und Artificial Analysis verzeichnet die evaluierte Konfiguration mit 256.000.
• Maximale Ausgabe — 128.000 Tokens für Claude Haiku 5.5; 131.072 in unserem Katalogeintrag für Qwen3.8-Flash-Next.
• Eingabemodalität — Text und Bilder für Claude Haiku 5.5; Text für Qwen3.8-Flash-Next.
• Veröffentlichung — 2026-10-07 für Claude Haiku 5.5, 2026-08-26 für Qwen3.8-Flash-Next.
• Gewichte — proprietär, nur über API für Claude Haiku 5.5; offene Gewichte unter der Qwen Community License 1.0 für Qwen3.8-Flash-Next.
Drei dieser Zeilen laufen der Preisüberschrift zuwider, und der Sprung bei der Prompt-Länge ist der schärfste. Unter 100.000 Prompt-Tokens ist Claude Haiku 5.5 das günstigere Modell in beiden Tarifzeilen. Darüber verfünffacht sich Anthropics Input-Tarif, und Qwen3.8-Flash-Next behält einen 3,3×-Vorteil beim Input und einen 5,3×-Vorteil beim Output. Die Schwelle deckt sich in etwa damit, wo die Kontextfenster ohnehin auseinandergehen – eine Million Tokens für das eine Modell, 262.144 für das andere –, sodass eine Pipeline, die das lange Fenster braucht, zugleich die Pipeline ist, die den Tarif der zweiten Stufe zahlt, um es zu bekommen.
Das ist keine Kritik an der Preisgestaltung; nach Prompt-Länge gestaffelte Tarife sind eine übliche Art, ein Long-Context-Modell abzurechnen. Es ist eine Warnung bezüglich des Vergleichs. Ein direkter Vergleich, der mit Prompts von 8.000 Tokens arbeitet, beschreibt ein bestimmtes Preispärchen. Dieselben beiden Modelle mit Prompts von 400.000 Tokens sind ein völlig anderes Paar, und das günstigere im zweiten Fall war das teurere im ersten.
Was die Anbietertabellen darunter aussagen
Keiner der Anbieter hat die Evaluierungs-Suite des jeweils anderen ausgeführt, daher beschränkt sich das gemeinsame Bild auf die Zeilen, die Artificial Analysis bei beiden gemessen hat.
• Intelligence Index v4.3.2 — 43,40 für Claude Haiku 5.5 (Max) gegenüber 39,82 für Qwen3.8-Flash-Next. Ein Vorsprung von 3,57 Punkten für Anthropic, die größte zusammengesetzte Differenz in dieser Reihe.
• Kosten pro abgeschlossener Index-Aufgabe — 0,21 $ gegenüber 0,37 $ auf demselben Board.
• Aufgabenzeit — 424,6 Sekunden gegenüber 1.524,3 Sekunden.
• Terminal Bench 4.0 — 0,3283 gegenüber 0,2525. Claude Haiku 5.5 mit 7,6 Punkten Vorsprung.
• SciCode — 0,5498 gegenüber 0,5058. Claude Haiku 5,5 um 4,4 Punkte.
• Humanity's Last Exam — 0,4439 gegenüber 0,3804. Claude Haiku 5.5 um 6,4 Punkte.
• AutomationBench, Teilpunktzahl — 0,3541 gegenüber 0,5591. Qwen3.8-Flash-Next um 20,5 Punkte.
Sechs Zeilen gehen an Anthropic, einige davon deutlich, und eine Zeile an Qwen mit 20 Punkten Vorsprung. Das Muster ist dasselbe, das sich durch diesen gesamten Preisbereich zieht: Anthropics kleines Modell ist stärker beim Reasoning, bei Wissenschaft sowie bei den Kosten und der Latenz bis zur Antwort und schwächer darin, eine mehrstufige Aufgabe bis zum Abschluss zu bringen. Qwen3.8-Flash-Next ist das Gegenteil.
Der Abstand zwischen der Composite- und der agentischen Zeile ist hier ungewöhnlich groß — 3,57 Punkte in die eine Richtung, 20,5 in die andere —, was dieses Paar zum am wenigsten mehrdeutigen im Band auf dieser Achse macht. Wenn Ihre Arbeit aus einer einzigen schwierigen Frage besteht, die einmal beantwortet wird, liegt Claude Haiku 5.5 bei jeder Kennzahl vorn, die Ihnen auffallen wird. Wenn Ihre Arbeit ein Agent ist, der abschließen muss, liegt Qwen3.8-Flash-Next in der einzigen Zeile vorn, die das vorhersagt, und zwar um mehr als das Fünffache des Composite-Abstands.

Die 180 Milliarden Parameter, die du halten kannst
Die Zeile, die diesen Vergleich für viele Teams entscheidet, steht überhaupt nicht in der Benchmark-Tabelle.
Qwen3.8-Flash-Next ist ein Modell mit spärlicher Mixture-of-Experts-Architektur, insgesamt 180 Milliarden Parameter und 6 Milliarden aktive – ein Verhältnis, das den pro Token aufgewendeten Rechenaufwand relativ zur Gesamtkapazität des Modells bescheiden hält. Es ist unter der Qwen Community License 1.0 veröffentlicht, die Artificial Analysis als kommerzielle Lizenz und nicht als permissive Lizenz führt; diese Unterscheidung sollte man lesen, bevor man damit plant, denn eine Community-Lizenz ist nicht MIT und bringt eigene Bedingungen zu Weitergabe und Skalierung mit sich. Es kann heruntergeladen, selbst gehostet, an einen Checkpoint gebunden, quantisiert und feinabgestimmt werden, vorbehaltlich dieser Bedingungen.
Claude Haiku 5.5 kann nichts davon sein. Es ist proprietär, nur über eine API zugänglich, ohne veröffentlichte Parameteranzahl, ohne Lizenz und ohne Repository. Anthropic verpflichtet sich, es bis mindestens 2027-10-07 aufrufbar zu halten, was eine reale und konkrete Garantie ist – aber eine Garantie zur Verfügbarkeit ist ein anderes Produkt als die Gewichte selbst.
Die praktische Konsequenz gilt in beide Richtungen, und es lohnt sich, sie klar auszusprechen, statt sie als Werbung für die eine oder andere Seite zu formulieren. Teams, die Inferenz innerhalb ihrer eigenen Tenancy, einen festen Checkpoint, gegen den sie einen Diff erstellen können, oder die Möglichkeit benötigen, auf Domänendaten feinabzustimmen, wählen nicht anhand von Indexpunkten zwischen diesen beiden Modellen. Sie wählen Qwen3.8-Flash-Next, weil die andere Option das, was sie brauchen, zu keinem Preis bietet. Teams, die einen verwalteten Endpunkt mit einer veröffentlichten Systemkarte, einem dokumentierten Evaluationsset und einer Zusage zur Außerbetriebnahme benötigen, wählen die andere Richtung, und die Gewichte sind kein Merkmal, das sie verwenden wollten.
Betreiben der Pauschal-Seite
Eine Anmerkung zum Namen. Das unabhängige Board führt dieses Modell als Qwen3.8-Flash-Next; unser eigener Katalog führt dieselbe Veröffentlichung unter dem kürzeren Anbieternamen Qwen3.8 Flash, zu den identischen $0.15 / $0.47 mit einem Preis von $0.0184 für gecachte Eingaben, und verweist in seinem Repository auf die am 2026-08-26 veröffentlichten Hugging Face-Gewichte. Wo die unten stehenden Zahlen von Artificial Analysis stammen, gehören sie zu dem Eintrag, den sie Qwen3.8-Flash-Next nennt. Die beiden sind dasselbe Modell; das Board führt einfach den längeren seiner Namen.
Qwen3.8-Flash-Next ist im OrcaRouter-Katalog zum Listenpreis des Anbieters mit 0 % Aufschlag, durchgereicht statt vermischt — die oben genannten $0,15 und $0,47 sind also die auf der Rechnung ausgewiesenen Sätze, und eine Änderung seitens Qwen schlägt am selben Tag bei uns durch statt erst bei einer späteren Neubepreisung. Claude Sonnet 5.5 und Claude Opus 5.5 sind ebenfalls im Katalog, wodurch der Eskalationspfad von einem kleinen Modell zu einem Mid-Tier-Modell von Anthropic zu einer Routing-Konfiguration statt zu einer zweiten Integration wird. Eine API für über 200 Modelle, ein Schlüssel, automatisches Failover darunter, und die Routing-DSL, wenn die Kostenobergrenze in die Route statt in den Anwendungscode gehört.
Claude Haiku 5.5 ist nicht im Katalog. Es ist über Anthropics eigene API erreichbar, und den Anthropic-Teil dieses Vergleichs bieten wir heute nicht an – das sollte man lieber so sagen, als es im Unklaren zu lassen.

Welches von beiden, und aus welchen Gründen?
Wenn Ihr Traffic eingabelastig ist, Ihre Prompts unter 100.000 Token liegen und Sie für echtes Volumen zahlen, ist Claude Haiku 5.5 das günstigere Modell bei beiden Tariflinien und das mit der höheren Punktzahl bei sechs der sieben gemeinsamen Messgrößen – mit der Einschränkung, dass sowohl der 30-prozentige Tokenizer-Unterschied als auch Anthropics Weitschweifigkeit einen Rabatt schmälern, der auf der Preisliste größer aussieht als auf der Rechnung.
Wenn Ihr Traffic output-lastig ist, Ihre Prompts lang genug sind, um den Schwellenwert von Anthropic zu überschreiten, oder Sie die Flatrate für die Prognose benötigen, ist Qwen3.8-Flash-Next günstiger – beim Output oberhalb der Stufe mitunter um den Faktor fünf – und es ist das Modell, das die Agentic-Completion-Zeile um 20 Punkte gewinnt.
Wenn Sie die Gewichte brauchen, ist der Vergleich nicht knapp, und der Preis spielt dabei keine Rolle.
Die beiden Karten liegen bei einer 3:1-Mischung nur drei Cent pro Million Token auseinander, nah genug, dass der Preis nicht ausschlaggebend sein sollte. Ausschlaggebend ist, in welchem dieser drei Absätze Sie sich befinden, und das ist eine Frage Ihrer Pipeline und nicht eines der beiden Modelle.
