
Qwen3.8-27B vs. Qwen 3.8: Gleiche Generation, eine GPU gegen ein Rack
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Diese Woche hat Alibaba Qwen3.8-27B auf die Schnellinferenz-Spur von Cerebras gesetzt – das erste Mal, dass das dichte 27B-Modell eine wirklich schnelle gehostete Option hat – und Artificial Analysis hat endlich beide Seiten dieses Duells erfasst. Qwen3.8-27B erreicht 34 Punkte im AA Intelligence Index. Qwen 3.8, also der offene Kern, den die meisten meinen, wenn sie den Namen ohne Suffix schreiben, erreicht 40. Diese beiden Zahlen setzen einen Vergleich neu auf, der in der Berichterstattung zum August-Start vollständig auf die Angaben des Anbieters angewiesen war.
Das Modell hinter dem eigenständigen Namen „Qwen 3.8“ ist Qwen3.8-2.4T-A95B: die 2,4-Billionen-Parameter-Mixture-of-Experts-Gewichte, die Alibaba unter einer individuellen Lizenz veröffentlicht hat. Qwen3.8-27B ist das dichte Mitglied derselben Generation – rund 27 Milliarden Parameter, Apache 2.0, für eine einzelne GPU ausgelegt. Sie teilen den Familiennamen, die native Kontextlänge von 262K und ein Startfenster. Alles andere an ihnen ist ein Lehrstück in Gegensätzen: Eines kann man besitzen, das andere kann man nur mieten. Hier ist, wofür jedes von beiden tatsächlich gedacht ist, jetzt, da beide unabhängige Zahlen haben.
Dieselbe Generation, gegensätzliche Formen
Qwen3.8-27B ist ein denses Modell — 27B Parameter (28B inklusive Vision-Encoder), 64 Layer, ein hybrider Attention-Stack aus 48 Gated-DeltaNet-Linear-Attention-Layern gegenüber 16 Full-Attention-Layern. Diese Hybridität ist der Grund, warum ein 27B-Modell 262.144 Token nativen Kontext tragen kann. Qwen3.8-2.4T-A95B ist die Flaggschiff-Architektur: 2,4T Gesamtparameter, etwa 95B aktiv pro Token, 92 Layer mit 512 Experten pro Layer und 69 dieser 92 Layer mit Linear-Attention. Derselbe Trick, neunzigfacher Footprint.
• Architektur — Qwen3.8-27B: 27B dicht, jedes Token aktiviert das gesamte Modell. Qwen3.8-2.4T-A95B: 2,4T gesamt / ~95B aktive MoE.
• Kontext — beide 262K nativ; die 1M-Erweiterung des 27B gibt es nur gehostet, das 2.4T erreicht gemessen ~984K.
• Eingabe — Qwen3.8-27B: Text, Bild und Video. Qwen3.8-2.4T-A95B: nur Text, Denkmodus fest aktiviert.
• Lizenz — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: eigene Qwen3.8-Max-Lizenz.
• Gewichte — Qwen3.8-27B: 55,6 GB BF16, quantisiert zu einem ~16 GB großen Q4-Build. Qwen3.8-2.4T-A95B: ~2,4 TB BF16, ein GPU-Rack, kein Desktop.
• Wo man ihnen begegnet — Qwen3.8-27B: selbst gehostet oder günstig gemietet. Qwen3.8-2.4T-A95B: gemietet, weil kein vernünftiger Mensch das Rack besitzt.
Endlich unabhängige Zahlen
Jeder im August erschienene Vergleichsbeitrag über Qwen3.8-27B trug denselben Vorbehalt: „noch keine unabhängigen Scores“. Das stimmt nicht mehr. Artificial Analysis hat beide Modelle mit Stand dieser Woche gemessen, und die Form der Daten ist wirklich interessant.
Auf dem Intelligence Index erreicht Qwen3.8-2.4T-A95B 40 Punkte und rangiert damit auf Platz 4 von 113 in seiner Klasse. Qwen3.8-27B erreicht 34 Punkte – womit es in seiner Open-Weights-Größenklasse von 4–40B auf Platz 1 von 140 Modellen steht, eine wirklich starke Leistung für ein dichtes 27B-Modell. Beide sind laut unabhängiger Messung langsam: 39,0 Ausgabe-Tokens pro Sekunde beim 27B und 38,1 beim 2.4T, gegenüber einem Klassenmedian von etwa 90. Beide sind wortreich; das 27B erzeugt über die Index-Läufe hinweg etwa 200 Mio. Ausgabe-Tokens, gegenüber einem Klassenmedian von 68 Mio. Keines von beiden ist ein Frontier-Modell, das Schlagzeilen macht; beide sind Arbeitspferde, und laut Index ist das 2.4T mit klarem Abstand das stärkere Arbeitspferd.

Die Preisgestaltung auf unabhängiger Seite erzählt in Dollar dieselbe Geschichte. Artificial Analysis bepreist das 27B mit 0,50 $ pro Million Input-Tokens und 3,00 $ pro Million Output-Tokens für den gehosteten Build von Qwen Cloud (90 % Cache-Rabatt) und das 2.4T mit 2,00 $ / 6,00 $ (88 % Cache-Rabatt). Kosten pro Intelligence-Index-Aufgabe: 0,82 $ für das 27B gegenüber 2,16 $ für das 2.4T. Das kleinere Modell ist pro Einheit Intelligenz günstiger im Betrieb – und beide sind relativ zu ihrer Geschwindigkeitsklasse teuer, weil beide Reasoning-Modelle sind, die Output-Tokens verbrauchen.
Alles andere — SWE-bench Pro 61,7, DeepSWE 1.1 42,2, LiveCodeBench v6 90,3 für das 27B-Modell; die 86,6 von Terminal-Bench 2.1 und 67,7 bei SWE-bench Pro des 2.4T — bleibt anbieterseitig gemeldet, nicht reproduziert und wird in diesem Beitrag durchgängig entsprechend gekennzeichnet. Die oben genannten AA-Indizes sind die unabhängige Untergrenze unter alldem.
Was das Börsenlisting von Cerebras ändert
Am 12. September 2026 gab das Qwen-Konto bekannt, dass Qwen3.8-27B jetzt auf Cerebras läuft; sein Katalogeintrag ist unter dem Banner „Qwen 3.8 27B ist jetzt auf Cerebras PayGo verfügbar“ live. Cerebras führt es mit 0,99 US-Dollar pro Million Eingabe-Token und 1,49 US-Dollar pro Million Ausgabe-Token auf der Hardware der WSE-Klasse auf, mit der das Unternehmen in puncto Geschwindigkeit seinen Namen gemacht hat. Damit erhält das 27B etwas, das der 2,4T-Kern nie hatte: eine Überholspur.

Das ist wichtig, weil langsam und geschwätzig von Anfang an der eine echte Kritikpunkt beim 27B war. Auf dem unabhängigen Prüfstand schafft es 39 t/s; in unserer eigenen Serving-Telemetrie hat es ~154 Ausgabe-Token pro Sekunde bei einer p50-Latenz bis zum ersten Token von 4,48 s erzielt – und jetzt konkurriert ein zweiter Anbieter auf genau dieser Achse. Der 2.4T dagegen hat überhaupt keine Schnellspur: Bei 38 t/s zahlt man Frontier-Preise für Mittelfeld-Geschwindigkeit, und der einzige Ausweg ist ein gemieteter GPU-Cluster, auf dem man die offenen Gewichte selbst laufen lässt.
Drei Spuren für das 27B, eine für das 2.4T
Ab heute ist das dichte 27B auf drei Arten mietbar, und die Preisspanne lohnt einen Blick, bevor Sie sich entscheiden:
• Self-Hosted-Schiene — Qwen3.8-27B ist live auf OrcaRouter für 0,33 $ / 2,40 $ pro Million, betrieben auf unserer eigenen Infrastruktur. Günstigster Input am Markt dafür, ~154 Tok/s Output, 262K Kontext.
• Anbieter-Lane — der gehostete Build von Qwen Cloud, 0,50 $ / 3,00 $ pro Million mit dem 1M-Token-Kontext und 90 % Cache-Rabatt.
• Schnellspur — Cerebras PayGo, 0,99 $ / 1,49 $ pro Million, positioniert auf Geschwindigkeit statt auf Preis.

Das 2,4T-Open-Core hat keine entsprechende Spanne. Die Flaggschiff-API, die dieselbe Architektur bedient – Qwen3.8-Max –, kostet 2,00 $ / 6,00 $ pro Million, und das ist die Zahl, die gilt, egal ob man sie Max oder Open Core nennt. Führt man stattdessen die Gewichte aus, verschiebt sich die Wirtschaftlichkeit hin zur Hardware: Das 2,4T-Modell braucht ~2,4 TB an BF16-Gewichten und einen Multi-GPU-Knoten – eine Kapitalentscheidung, die niemand leichtfertig trifft. Eine 24-GB-GPU betreibt den Q4-Build des 27B-Modells zu Grenzkosten, die sich auf null runden.
Das durchgerechnete Beispiel, das für die meisten Teams den Ausschlag gibt: 100 Mio. Input- und 20 Mio. Output-Tokens pro Tag. Beim 2-$/6-$-Tarif des 2.4T sind das etwa 320 $ pro Tag, ~117.000 $ pro Jahr. Beim 27B mit unseren 0,33 $/2,40 $ sind es etwa 81 $ pro Tag — und bei der selbst gehosteten Kopie ist es der Strompreis. Das 2.4T verschafft Ihnen einen echten Qualitätsvorsprung, AA 40 gegen 34. Ob dieser Vorsprung eine fünfstellige Monatsrechnung wert ist, ist die ganze Frage, die diese Paarung aufwirft.
Wo sie wirklich auseinandergehen
Abgesehen vom Index entscheiden drei praktische Unterschiede darüber, welche Variante zu einer gegebenen Workload passt.
Multimodale Eingabe ist der sauberste Filter. Qwen3.8-27B liest Text, Bilder und Video – Screenshots, Diagramme, Dokumente mit Abbildungen, Videoframes landen alle im selben 262K-Fenster. Qwen3.8-2.4T-A95B ist aggressiv text-only. Wenn Ihre Eingabe irgendetwas Visuelles enthält, ist das 2.4T disqualifiziert, unabhängig von seinem höheren Index.
Die Denksteuerung steht an zweiter Stelle. Der Reasoning-Modus des 27B lässt sich pro Anfrage abschalten, was bei latenzempfindlicher Extraktion wichtig ist, bei der eine Gedankenkette reiner Overhead ist; außerdem wird reasoning_effort verfügbar gemacht. Der 2.4T-Kern kann das Denken nicht abschalten — jede Antwort beginnt mit einem think>-Block, und man bezahlt für diese Tokens, ob man sie wollte oder nicht. Die Flaggschiff-API behebt das, aber der offene Kern nicht.
Die Lizenzierung steht an dritter Stelle, und im großen Maßstab ist sie still von Bedeutung. Apache 2.0 für das 27B ist der permissive Standard: ändern, weiterverbreiten, kommerzialisieren, Patentgewährung inklusive. Das 2.4T wird unter einer benutzerdefinierten Qwen3.8-Max-Lizenz ausgeliefert – im Geiste permissiv, aber es sind Alibabas Bedingungen, kein Community-Standard, und es lohnt sich, die Datei zu lesen, bevor man ein Produkt darauf aufbaut.
Routing der Entscheidung
Beide Seiten dieses Duells sind über einen einzigen OrcaRouter-Schlüssel erreichbar, und genau das macht die Frage „Welchen nehme ich?“ günstig empirisch beantwortbar. Qwen3.8-27B ist live als qwen/qwen3.8-27b zum Listenpreis des Anbieters ohne Aufschlag, und die Flaggschiff-API, die auf demselben 2,4T-Kern aufbaut, ist live als qwen/qwen3.8-max für $2,00 / $6,00 pro Million — Alibabas eigener Tarif, direkt durchgereicht, sodass jede Preisänderung eines Anbieters hier noch am selben Tag live ist.
Dieselbe 2.4T-Architektur als herunterladbare Gewichte ist nichts, was wir anbieten — wenn du den offenen Kern heute über eine API willst, ist die Flaggschiff-Spur der praktische Weg dorthin, und qwen/qwen3.8 ist vorverdrahtet, um sich einzuschalten in dem Moment, in dem ein Anbieter die offenen Gewichte bereitstellt. Eine Routing-Regel, die den visuellen und latenzempfindlichen Verkehr an qwen/qwen3.8-27b und den anspruchsvollen Reasoning-Teil an qwen/qwen3.8-max schickt, kostet nichts einzurichten und wechselt automatisch zwischen Anbietern. Ein Schlüssel, kein zweiter Vertrag, und die Aufteilung ist eine Konfigurationsänderung statt einer Neuarchitektur — der günstigste Weg zu testen, ob dir die zusätzlichen sechs Indexpunkte des 2.4T 5,67 US-Dollar pro Million Ausgabe-Tokens wert sind.
Wer sollte welche auswählen?
• Wählen Sie Qwen3.8-27B, wenn Ihre Eingabe Bilder oder Videos enthält, wenn Sie einen Denkmodus möchten, den Sie abschalten können, wenn Sie eine 24-GB-GPU besitzen oder dies planen, oder wenn Ihr Ausgabenvolumen pro Token groß genug ist, dass 0,33 $/2,40 $ gegenüber 2,00 $/6,00 $ das ganze Argument ist.
• Wähle Qwen 3.8 (den 2,4T-Kern), wenn du nur mit Text arbeitest, den stärksten unabhängigen Reasoning-Wert der Familie willst (AA 40) und die 2-$/6-$-Rate — oder die Kosten für den Betrieb eines GPU-Node — bequem in dein Budget passen.
• Wählen Sie beide, wenn Ihr Traffic beide Profile abdeckt: Routen Sie über das Gateway, lassen Sie den Router nach Modalität und Schwierigkeit aufteilen und ändern Sie Ihre Meinung, wenn der nächste Checkpoint oder Preis eines der beiden Modelle verfügbar wird.
Das Urteil
Der Name Qwen 3.8 stand schon immer für zwei Produkte, die vorgaben, eine Familie zu sein, und jetzt haben beide unabhängige Zahlen, über die man streiten kann. Qwen3.8-2.4T-A95B ist das stärkere Gehirn, nur Text, teuer und unbestreitbar profitabel bei $2/$6. Qwen3.8-27B ist das einsetzbare – multimodal, Apache 2.0, selbst hostbar, und seit dieser Woche hat es endlich auch eine schnelle Schiene. Die Indexlücke ist real: 40 gegen 34. Der Preisunterschied ebenfalls: rund das Fünffache der Kosten pro Token, wenn man das 2.4T als API betreibt. Für die meisten Teams geht es bei der Entscheidung nicht um die sechs Indexpunkte. Es geht darum, ob Sie Token kaufen oder Hardware kaufen – und das 27B ist das einzige der beiden, mit dem Sie die Hardware kaufen können.
