Eine generierte Hero-Karte mit dem Titel „Claude Haiku 5.5 vs. Qwen3.8 27B“ und dem Kicker „OFFENE GEWICHTE VS. DIE API“, die Claude Haiku 5.5 mit Eingabe $0,10, Ausgabe $0,50 und Index 43,40 gegenüber Qwen3.8 27B mit Eingabe $0,50, Ausgabe $3,00 und Index 33,70 zeigt, über einem Balken mit der Aufschrift „Kosten pro abgeschlossener Aufgabe $0,21 vs. $1,01“.
Engineering & Research

Claude Haiku 5.5 vs. Qwen3.8 27B: Ein klarer Durchmarsch auf der API und warum die offenen Gewichte noch existieren

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die meisten Vergleiche in dieser Reihe laufen auf einen Kompromiss hinaus. Dieser hier nicht, und das Fehlen eines Kompromisses ist selbst der Befund. Claude Haiku 5.5, veröffentlicht am 7. Oktober 2026, schlägt Qwen3.8 27B, das dichte 27B-Modell mit offenen Gewichten vom 14. August 2026, beim zusammengesetzten Intelligenzwert, bei den Kosten pro Token, bei den Kosten pro abgeschlossener Aufgabe, beim Kontextfenster, bei der Antwortobergrenze, beim agentischen Programmieren und in den Zeilen zum wissenschaftlichen Schlussfolgern – und das über eine einzige proprietäre API, die keine Hardware erfordert. Die eine Zeile, die Qwen3.8 27B klar für sich entscheidet, ist die Videoeingabe, und die andere ist eine Lizenz.

Das ist kein Grund, das Modell abzuschreiben, denn eine Apache-2.0-Lizenz und eine Video-Modalität sind keine Trostpreise. Es ist ein Grund, präzise darzulegen, warum jemand die Open-Weights-Seite wählen würde, und aufzuhören, so zu tun, als ginge es bei der Argumentation um Benchmarks.

Die Zahlen, mit denen beide Modelle tatsächlich ausgeführt wurden

Pro Million Token in US-Dollar. Die Preise des Anbieters stammen aus seiner eigenen Preisdokumentation; die gemeinsamen Messwerte sind der Artificial Analysis Intelligence Index v4.3.2, gelesen am 2026-10-08, beide in ihrer höchsten veröffentlichten Aufwandskonfiguration.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• Eingabe — Claude Haiku 5.5 $0,10 bis 100.000 Token und darüber $0,50; Qwen3.8 27B $0,50 zum vom Board erfassten Drittanbietertarif.

• Ausgabe — Claude Haiku 5.5 0,50 $ bis zu 100.000 Token und 2,50 $ darüber; Qwen3.8 27B 3,00 $.

• Zwischengespeicherte Eingabe — Claude Haiku 5.5 $0.01 und $0.05, ein Rabatt von 90 %; Qwen3.8 27B $0.10, ein Rabatt von 80 %.

• Unabhängige Punktzahl — 43,40 für Claude Haiku 5.5 (Max) gegenüber 33,70 für Qwen3.8 27B (Xhigh). Eine Differenz von 9,70 Punkten, die größte in dieser Charge.

• Kosten pro abgeschlossener Aufgabe — 0,21 $ gegenüber 1,01 $, im selben Evaluierungslauf. Eine 4,7-fache Differenz, zugleich die größte hier.

• Kontext und Ausgabe — 1 Mio. Tokens und eine Antwort-Obergrenze von 128.000 Tokens für Claude Haiku 5.5; ein 256K-Token-Kontext für Qwen3.8 27B.

• Modalität — beide nehmen Text und Bilder entgegen und geben Text zurück. Qwen3.8 27B fügt Videoeingabe hinzu; Claude Haiku 5.5 nicht.

• Gewichte — Qwen3.8 27B ist ein dichtes Modell mit 27B Parametern unter Apache 2.0 und herunterladbar. Claude Haiku 5.5 ist proprietär und nur über API verfügbar.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

Warum die Lücke pro Aufgabe viermal so groß ist wie die Lücke pro Token

Die Preisliste zeigt bereits eine 5-fache Eingabedifferenz und eine 6-fache Ausgabedifferenz zugunsten des Anbieters, die Richtung steht also außer Frage. Bemerkenswert ist, dass der Wert pro Aufgabe kleiner als der Wert pro Token ist, was das Gegenteil dessen ist, was bei den anderen Paarungen in diesem Stapel geschah, und der Grund ist aufschlussreich.

Claude Haiku 5.5 erzeugt pro Aufgabe des Intelligence Index 162.164 Ausgabe-Tokens – 129.047 für Reasoning und 33.118 für die Antwort. Qwen3.8 27B erzeugt 66.797, aufgeteilt in 47.711 für Reasoning und 19.087 für die Antwort. Das Modell des Anbieters verbraucht pro Aufgabe 2,4-mal so viele Tokens, sodass sich sein 6-facher Vorteil bei der Ausgaberate auf einen 4,7-fachen Vorteil pro Aufgabe reduziert. Er ist immer noch enorm. Er ist nur nicht die Zahl, mit der die Preisliste wirbt.

Die Blend-Mathematik ist ein saubererer Weg, um die Form davon zu erkennen. Bei einer eingabelastigen 7:2:1-Mischung – der Gewichtung, die der meiste Produktionsverkehr tatsächlich hat – kommt Claude Haiku 5.5 auf $0,077 pro Million Tokens gegenüber $0,470 für Qwen3.8 27B. Bei einer ausgewogenen 1:1-Mischung sind es $0,30 gegenüber $1,75. Die 100.000-Token-Klippe des Anbieters ist das Einzige, was dies jemals schließt: Danach werden die Messwerte von Claude Haiku 5.5 zu $0,50 und $2,50 für die gesamte Anfrage, und die beiden Modelle treffen sich bei ungefähr demselben Preis – an diesem Punkt zahlen Sie einen 9,7-Punkte-Score-Aufschlag für nichts.

Wo die Anbieterkarte und das unabhängige Board nicht übereinstimmen

Das ist die Zeilengruppe, bei der es sich lohnt, zu verweilen, denn die eigene Modellkarte von Qwen3.8 27B liest sich erheblich stärker als die unabhängigen Messungen, und genau dieser Unterschied ist der Grund, warum eine Behauptung wie „ein 27B-Modell, das es mit viel größeren aufnimmt“ eine zweite Quelle braucht.

Die vom Anbieter selbst veröffentlichten Zahlen, wie sie auf unserer Katalogseite für das Modell aufgeführt sind, umfassen 90,3 bei LiveCodeBench v6, 89,2 bei GPQA Diamond, 84,3 bei OSWorld-Verified und 79,0 bei QwenSWEBench. Dabei handelt es sich um vom Anbieter gemeldete und nicht reproduzierte Werte, und sie beschreiben ein Modell, das weit über seiner Gewichtsklasse mithalten kann.

In einem unabhängigen Testlauf von Artificial Analysis erzielt Qwen3.8 27B 0.0556 bei Terminal-Bench 4.0, 0.4664 bei SciCode, 0.3392 bei Humanity's Last Exam und 1423.21 bei GDPval-AA v2.1. Stellt man die 0.0556 neben die 84.3, die die Herstellerkarte für OSWorld meldet, ist die Art der Abweichung klar: Bei agentischen Arbeiten am Computer und im Terminal ordnet das unabhängige Board dieses Modell ungefähr dort ein, wo ein dichtes 27B-Modell hingehört – die Herstellerkarte hingegen nicht.

Zwei Zeilen gehen jedoch in die andere Richtung, und sie sind aus demselben Grund erwähnenswert. Qwen3.8 27B erzielt 0,4824 auf AutomationBench gegenüber den 0,3541 von Claude Haiku 5.5 – ein unabhängiger Sieg von 12,8 Punkten bei dem, was auf beiden Boards einem Business-Automation-Benchmark am nächsten kommt. Das ist eine echte Zahl aus demselben Lauf, in der Zeile, die dem am nächsten liegt, wofür Leute tatsächlich kleine Modelle einsetzen.

Die ehrliche Lesart ist nicht „Der Anbieter hat alles aufgebläht.“ Sondern: Eine Modellkarte misst die Aufgaben, die ihre Autor:innen ausgewählt haben, das unabhängige Board misst einen festen Satz, und die Stärken von Qwen3.8 27B stehen auf der Liste des Anbieters und nicht auf der des Boards.

Die Wirtschaftlichkeit ändert sich, wenn Sie die Hardware besitzen.

Jeder oben genannte Preis ist ein API-Preis, und für Qwen3.8 27B ist das der falsche Rahmen.

Dies ist ein dichtes 27B-Modell unter Apache 2.0. Es passt auf einen einzelnen modernen Beschleuniger bei der Quantisierung, die die meisten Teams akzeptieren würden, was bedeutet, dass die Grenzkosten eines Tokens aufhören, der Zähler eines Anbieters zu sein, und zu Ihrer eigenen Auslastung werden. Deshalb unterscheidet sich der Preis für einen Aufruf je nach Host in einer Weise, wie es keines der proprietären Modelle in diesem Vergleich je könnte: Das Board verzeichnet einen Drittanbieter-Tarif von 0,50 $ Eingabe und 3,00 $ Ausgabe, und der OrcaRouter-Katalog führt es zu 0,33 $ Eingabe und 2,40 $ Ausgabe ganz ohne Cache-Lese-Zeile, weil wir die Gewichte auf unserer eigenen Infrastruktur ausführen, statt den Endpunkt von jemand anderem weiterzuverkaufen.

Für ein Team, das bereits für GPUs bezahlt, ist der Vergleich nicht 0,21 $ gegenüber 1,01 $ pro Aufgabe. Es ist der vom Anbieter in Rechnung gestellte Satz gegenüber den inkrementellen Kosten einer Anfrage auf Hardware, die Ihnen gehört, und das sind unterschiedliche Zahlen. Das ist das Argument für die Open-Weights-Seite, und es ist das einzige, das den Kontakt mit der Benchmark-Tabelle übersteht.

Es gibt eine zweite, weniger offensichtliche Konsequenz daraus, dass die Lizenz Apache 2.0 ist: Das Modell kann in ein Produkt eingebettet, auf den eigenen Datenverkehr feinabgestimmt, an eine bestimmte Revision gebunden und bis hinunter zu den Gewichten überprüft werden. Nichts davon ist zu irgendeinem Preis von einem proprietären API-only-Modell erhältlich, und für regulierte Workloads ist es häufig die entscheidende Einschränkung statt einer Präferenz.

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

Einen von beiden anrufen

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 ist nicht im Katalog. Es ist direkt über die API des Anbieters sowie über AWS, Azure und die großen Cloud-Plattformen erreichbar, und das ist die korrekte Aussage. Was der Katalog aus dem Sortiment des Anbieters führt, ist Claude Sonnet 5.5 und Claude Opus 5.5, was den Eskalationspfad von einem selbst gehosteten kleinen Modell hin zu einem gehosteten agentischen Modell der Mittelklasse zu einer Routing-Änderung statt zu einer zweiten Integration macht — automatisches Failover liegt in beiden Fällen darunter.

Das Urteil, das ungewöhnlich einseitig ist

Als API-Aufruf für Text oder Bilder gewinnt Claude Haiku 5.5 diesen Vergleich in jeder Zeile, in der es nicht um Lizenzierung geht. 9,7 Indexpunkte, 4,7-mal günstiger pro erledigter Aufgabe, ein viermal so großes Kontextfenster, die doppelte Antwortobergrenze und ein fünf- bis sechsmal niedrigerer Preis im Kurz-Prompt-Bereich. Es gibt kein Workload-Shape-Argument, das Qwen3.8 27B beim Preis rettet, denn der Nachteil des Anbieters — hoher Verbrauch von Ausgabe-Tokens — ist weit weniger wert als sein Tarifvorteil.

Was es rettet, ist alles, was der API-Preis nicht erfasst: eine Lizenz, die Weiterverbreitung erlaubt, Gewichte, die man selbst halten und pinnen kann, Video-Eingabe und ein selbst gehosteter Weg, bei dem die Kosten pro Token Ihre eigene Hardware sind statt die Grafikkarte eines Anbieters. Wenn Sie die günstigste Möglichkeit suchen, Text zu klassifizieren, zu extrahieren, zusammenzufassen und weiterzuleiten, ist Claude Haiku 5.5 die Antwort, und der Abstand ist alles andere als knapp. Wenn Sie ein Modell suchen, das Sie in Ihr eigenes Produkt stecken können, auf Ihrer eigenen Hardware, unter Ihrer eigenen Auditierung, dann ist die Benchmark-Lücke seit mehreren Absätzen nicht mehr die Frage.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert