
Qwen3.8-27B: Das kompakte multimodale Modell in Alibabas Qwen3.8-Reihe
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 316 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 196 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Qwen3.8-27B ist das dichte Single-Node-Mitglied von Alibabas Qwen3.8-Generation: ein natives Vision-Language-Modell mit 27 Milliarden Parametern, veröffentlicht auf Hugging Face unter Apache 2.0, das Text, Bilder und Videos annimmt und Text mit einem Kontextfenster von 262.144 Token zurückgibt. Dies ist die Referenzseite für dieses Modell – die kanonische Beschreibung dessen, was es ist, was ein Aufruf kostet und was es leisten kann – und es lohnt sich, vorab zu sagen, warum es eine Seite für ein Modell gibt, dessen Gewichte erstmals im August 2026 und nicht in den letzten sieben Tagen erschienen sind. Wir berichten nicht über einen Launch. Wir beantworten eine bestehende Frage: Leser erreichen uns wegen des Namens „Qwen3.8-27B“ tausendfach im Monat, und bis jetzt hat keine unserer Seiten diese Antwort geliefert. Die Veröffentlichung des Modells selbst, datiert auf Qwens Karte und von Artificial Analysis als 2026-08-14 erfasst, ist eine Tatsache, die diese Seite nutzt, um das Modell zu datieren, kein Ereignis, über das sie berichtet.
Lesen Sie das als die Ausnahme, die es ist: Bei einer strengen Auslegung der Sieben-Tage-Regel ist ein Modell von Mitte August 2026 nicht aktuell, und dieser Beitrag würde als Nachricht übersprungen. Die Rechtfertigung ist hier eine andere. Es handelt sich um eine Referenzseite, deren Zahlen anhand von Qwens eigener Modellkarte, der Lizenzdatei des Repositorys, der Preisliste von Qwen Cloud und Artificial Analysis am 28.09.2026 verifiziert wurden und deren Daseinsberechtigung die Suchnachfrage ist, die wir am selben Tag aus erster Hand gemessen haben. Es ist keine zweite Ankündigung, und niemand sollte es als eine solche lesen.
Wo 27B in der Qwen3.8-Reihe einzuordnen ist
Die Qwen3.8-Generation ist nicht ein einzelnes Modell, und das Größen-Suffix ist der eigentliche Sinn des Namens. Die eigenen Repository-Notizen von Qwen quer durch die Familie machen die Aufteilung explizit:
• Qwen3.8-27B — 27B dichte Parameter, native Bild- und Videoeingabe, Apache 2.0. Das bereitstellungsfreundliche Mitglied: ein Modell, das auf einer einzelnen GPU oder einem kleinen Node laufen kann, und das Thema dieser Seite.
• Qwen3.8-Max, aufgebaut auf Qwen3.8-2.4T-A95B — 2,4 Billionen Parameter insgesamt, davon 95 Mrd. aktiv, das Modell der Qwen-Max-Klasse, das Alibaba in dieser Generation erstmals geöffnet hat. Sein Repository trägt eine maßgeschneiderte qwen3.8-max-Lizenz statt Apache 2.0.
• Qwen3.8-Flash-Next — die experimentelle Architekturvorschau, die laut Qwen Qwen4 zugrunde liegen wird, veröffentlicht unter der qwen-community-1.0 Lizenz. Das gehostete Qwen3.8-Flash baut darauf auf.
„27B“ ist also keine Ausstattungsvariante des Max-Modells; es ist die Größenklasse, die ein einzelnes Team tatsächlich bedienen kann. Was Alibaba nach eigenen Angaben übernimmt, ist das Trainingsrezept: Die Modellkarte beschreibt Qwen3.8-27B als Modell, das die Fortschritte der Generation beim Coding, bei professioneller Arbeit, in der Forschung und bei agentischen Aufgaben mit langem Zeithorizont aufnimmt und sie in einen dichten Checkpoint komprimiert.

Die Architektur, die Qwen veröffentlicht
Jede der folgenden Abbildungen stammt aus der Modellkarte unter Qwen/Qwen3.8-27B, bei der es sich um die eigene Dokumentation des Anbieters handelt:
• Parameter — 27B, wie vermarktet. Die eigenen safetensors-Metadaten des Repositorys summieren sich auf 27.781.427.952 Parameter in BF16 über 18 Shards, also rund 27,8B, sobald der Vision-Turm mitgezählt wird. Ein Mixture-of-Experts gibt es hier nicht: Alle Parameter sind bei jedem Token aktiv.
• Form — 64 Schichten, versteckte Dimension 5.120, Feed-Forward-Zwischendimension 17.408, Token-Embedding und LM-Ausgabe 248.320 (aufgefüllt).
• Hybrid-Attention — das Layout, das Qwen ausgibt, ist 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): drei Linear-Attention-Blöcke für jeden Full-Attention-Block, ein Verhältnis von 3:1. Gated DeltaNet betreibt 48 Linear-Attention-Heads für V und 16 für QK bei Kopfdimension 128; Gated Attention betreibt 24 Query-Heads gegenüber 4 KV-Heads bei Kopfdimension 256, mit einer Rotary-Dimension von 64. Dieses Verhältnis ist es, was ein 262K-Fenster bei einem 27B-Modell bezahlbar macht, und es ist dieselbe Linie, die Qwen3.8-Flash-Next mit Sparse Attention erweitert.
• Multi-Token-Vorhersage — die Karte gibt an, dass das Modell mit MTP über mehrere Schritte trainiert wird, der Drafting-Trick, der die Generierung in MTP-fähigen Serving-Stacks beschleunigt.
• Denksteuerung — der Denkmodus ist standardmäßig aktiviert und kann pro Anfrage deaktiviert werden. reasoning_effort akzeptiert xhigh (die Standardeinstellung), medium oder low, und preserve_thinking ist standardmäßig aktiviert, sodass Denkspuren über mehrere Turns hinweg erhalten bleiben, statt neu generiert zu werden.
Kontextfenster und Ausgabeobergrenze
Die Modellkarte gibt an, dass 262.144 Token nativ unterstützt werden und mit RoPE-Skalierung (YaRN) auf 1.000.000 erweiterbar sind. Die eigene Serving-Empfehlung von Qwen für lange agentische Läufe innerhalb dieses 1-Mio.-Rahmens besteht darin, bis zu 262.144 Token für Reasoning-Inhalt und bis zu 131.072 Token für die finale Antwort zuzulassen — die Obergrenze ist eine Serving-Konfiguration, keine feste Eigenschaft des Checkpoints.
Zwei Fenster sollte man auseinanderhalten, weil sie leicht verwechselt werden. Offene Gewichte laufen nativ mit 262.144; die gehostete Version auf Qwen Cloud, die die Modellkarte als noch ausstehend beschreibt („der Dienst kommt bald“), ist auf der Modellseite von Qwen Cloud mit einem Kontext von 1M, maximal 991K Eingabe, maximal 131K Ausgabe und einem maximalen Reasoning-Budget von 262K aufgeführt. Das Datenblatt des gehosteten Produkts ist nicht das Datenblatt des Checkpoints.
Modalitäten: Was hineingeht und was herauskommt
Eingabe sind Text, Bild und Video; Ausgabe ist nur Text. Die Modellkarte bezeichnet Qwen3.8-27B als „ein natives Vision-Sprachmodell, das Bilder und Videos versteht“, und der Beispielcode verarbeitet alle drei Eingabetypen. Es gibt keine Audioeingabe, keine Bilderzeugung und keine Sprachausgabe. Der Modelleintrag von Artificial Analysis für denselben Checkpoint bestätigt das Modalitätenspektrum – Bild, Video und Text rein, Text raus –, was eine nützliche zweite Einschätzung ist, weil es nicht Alibabas eigene Seite ist.
Was die Apache-2.0-Veröffentlichung tatsächlich erlaubt
Die Lizenz ist keine Zusammenfassung in einem Blogbeitrag; das Repository enthält den Text der Apache License, Version 2.0 selbst, und die Metadaten der Karte geben an license: apache-2.0. Was das gewährt, wenn man den Lizenztext liest: eine unbefristete, weltweite, gebührenfreie Urheberrechtslizenz, um das Werk und seine Derivate zu reproduzieren, abgeleitete Werke davon zu erstellen, öffentlich anzuzeigen, unterzulizenzieren und zu verbreiten, sowie eine Patentlizenz von Mitwirkenden — wobei die kommerzielle Nutzung zu den zulässigen Zwecken gehört und es keine Einschränkung des Nutzungsbereichs, keine Schwelle für die Anzahl der Nutzer und keine separate kommerzielle Vereinbarung gibt. Apache 2.0 ist zudem permissiv in dem Sinne, der für den Vertrieb von Produkten relevant ist: abgeleitete Gewichte dürfen unter anderen Bedingungen weitergegeben werden, sofern Sie die Lizenz- und Namensnennungshinweise beibehalten und angeben, was Sie geändert haben (Abschnitte 4a–4c). Abschnitt 6 gewährt keine Rechte am Namen Qwen oder an Marken, daher kann sich ein Apache-2.0-Fork nicht als Qwen vermarkten.
Der Vergleich innerhalb der Familie ist aufschlussreich, und er ist eher aus den Repositories als aus der Berichterstattung ersichtlich: Der 2.4T-A95B-Checkpoint bezeichnet sich selbst als Sonstiges mit einer qwen3.8-max-Lizenz, und Qwen3.8-Flash-Next verwendet qwen-community-1.0. Das 27B ist dasjenige der drei, das unter reinem Apache 2.0 kommt.
Die unabhängige Benchmark-Position
Artificial Analysis hat das Modell getestet, und sein Ergebnis sollte von Alibabas eigener Tabelle getrennt betrachtet werden, weil die beiden unterschiedliche Fragen beantworten. Der unabhängige Index, gemessen in der xhigh-Konfiguration:
• Intelligence Index 33,7 — der bei Artificial Analysis hinterlegte Wert, den deren Modellseite gerundet auf 34 ausgibt. Es werden zwei Ränge veröffentlicht, und sie messen unterschiedliche Grundgesamtheiten: Die eigene Zusammenfassungskachel jener Seite setzt das Modell auf Platz 1 von 142 Modellen in seiner Größenklasse, bei dem Vergleich innerhalb derselben Größenklasse, den der Tooltip der Seite beschreibt, während die aus Artificial Analysis stammende Zeile unseres Katalogs Platz 45 von 145 verzeichnet, was etwa dem 67. Perzentil entspricht. Keiner der beiden Ränge bezieht sich auf dasselbe Feld wie der andere, also betrachten Sie sie nicht als ein und dieselbe Zahl in zwei Formaten.
• Coding-Index 68,1 — in unserem Katalog geführt mit artificialanalysis.ai als genannter Quelle, auf Platz 35 von 138 im Pool dieses Index gelistet. Das Modell liegt beim Coding höher als bei allgemeiner Intelligenz, was mit der Form der eigenen Tabelle des Anbieters übereinstimmt.
• Aufwandsstufen, gleiche Testumgebung — das Senken des Reasoning-Aufwands verschiebt den Index deutlich: 33,7 bei xhigh, 27,6 bei medium, 26,2 bei low, und 20,2 bei vollständig ausgeschaltetem Reasoning. Das ist eine gemessene Spanne von 13,5 Punkten und das konkreteste Argument dafür, den Aufwand pro Workload statt pro Modell abzustimmen.
• Wo die beiden Quellen übereinstimmen und sich widersprechen — auf GPQA Diamond meldet die Karte von Alibaba 89,2 und Artificial Analysis misst 90,5. Bei Humanity's Last Exam meldet die Karte 30,8 und Artificial Analysis 33,9. Nah beieinander, aber nicht dieselbe Zahl, und das ist normal: unterschiedliche Testumgebungen, unterschiedliche Durchläufe. Eine Warnung gehört in den Artikel statt in eine Fußnote — kein Drittanbieter hat einen direkten Vergleich zwischen Qwen3.8-27B und einem der Modelle in der Vergleichstabelle von Alibaba veröffentlicht, die mit angeglichenem Aufwand und identischer Testumgebung ausgeführt wurden, sodass jeder modellübergreifende Vergleich auf dieser Seite ein Vergleich getrennter Messungen ist, kein Ergebnis.

Was Qwen berichtet und wie man es liest
Die Modellkarte enthält rund zwei Dutzend Bewertungen mit Vergleichsspalten für Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B und Opus4.6 Max. Alles davon ist vom Anbieter angegeben und nicht reproduziert – Alibabas eigene Evaluierung, gedruckt von Alibaba –, und mehrere Zeilen verwenden eine Claude-Code-Harness, bewertet von einem GPT-5.4-Build, wie die Fußnoten der Karte angeben. Die zentralen Anbieterzahlen, auf dieser Basis:
• Agentisches Terminal-Coding — Terminal Bench 2.1 (Terminus) 73,0, gegenüber 63,4 für das Qwen3.6-27B, das es ersetzt, wobei Opus4.6 Max die Zeile mit 78,2 anführt.
• Agentisches Coding — SWE-bench Pro 61.7, QwenSWEBench 79.0, DeepSWE 1.1 42.2, NL2Repo-Bench 42.3, LiveCodeBench v6 90.3.
• Agenten und Büroarbeit — CoWorkBench 70,7, JobBench 33,4, Agents' Last Exam 42,9 nach Punktzahl (Pass@1 20,4).
• Allgemeines Schlussfolgern — GPQA Diamond 89,2, HLE 30,8, IFBench 79,5. Opus4.6 Max führt beide Reasoning-Zeilen in der Tabelle des Anbieters an, mit 91,3 und 40,0.
• Vision und Computernutzung — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.
Die ehrliche Zusammenfassung dieser Tabelle ist enger gefasst, als es die Tabelle erscheinen lässt. Gegenüber ihrem direkten Vorgänger sind die Zugewinne groß und konsistent — QwenSWEBench 79,0 gegenüber 49,3, DeepSWE 42,2 gegenüber 13,3 — und das ist eine Aussage über eine Generation der Rezeptänderung. Gegenüber den Frontier-Modellen in den benachbarten Spalten gewinnt sie bei einigen Zeilen und verliert bei anderen, nach Alibabas eigenen Zahlen, durch Alibabas eigene Wahl des Harness.
Es ausführen.
Die Gewichte bestehen aus 18 BF16-Shards im Transformers-Format, und die Karte führt Hugging Face Transformers, vLLM, SGLang und TokenSpeed als unterstützte Stacks auf. Die Pfade für lokale Bereitstellung und Quantisierung haben wir separat beschrieben, und genau dort gehören diese Details hin: Qwen3.8-27B auf Ollama für einen lokalen Daemon, und der Benchmark-Rundgang für die vollständige Bewertungsübersicht, einschließlich dessen, was sich gegenüber Qwen3.6-27B geändert hat. Diese Seite konzentriert sich auf das Modell selbst.
Qwen3.8-27B in unserem Katalog
Auf OrcaRouter sind heute zwei Karten live, Seite an Seite, und beide wurden am 2026-09-28 erneut gelesen, bevor dieser Absatz geschrieben wurde. qwen/qwen3.8-27b wird mit $0.33 pro Million Input-Token und $2.40 pro Million Output-Token gelistet, mit dem vollständigen 262.144-Token-Fenster, Text-, Bild- und Videoeingabe sowie den als Parameter offengelegten Oberflächen für Reasoning, Tools, strukturierte Ausgabe und JSON. Sein Schwestermodell obsidian/Qwen3.8-27B – dieselben Gewichte, in Block-FP8 bereitgestellt, wobei der Vision-Tower mit voller Präzision beibehalten wird, und, in den Worten der Karte selbst, „darauf ausgelegt, direkte, vollständige Antworten über eine breite Palette von Prompts hinweg zu liefern“ – wird mit $0.40 für Input und $4.21 für Output gelistet. Beide sind über chat completions und die Responses API ansprechbar, sodass ein Dokumentenparsing- oder Screenshot-Job auf eines der beiden Modelle unter einem Schlüssel und einem Endpunkt gerichtet werden kann, ohne zweiten Vertrag und ohne Codeänderung.
Um das einzuordnen: Unser eigener Playground hat in den letzten sieben Tagen 105,1 Millionen Token durch qwen/qwen3.8-27b geschickt, mit einer medianen Zeit bis zum ersten Byte von 3,8 Sekunden und einer Fehlerquote von 3,3 % im selben Zeitraum. Das sind unsere Serving-Zahlen, kein Urteil über das Modell.

Die Suchen, die hierher führen
Die Nachfrage hinter dieser Seite ist dünn verteilt und liegt knapp außerhalb des Klicks. In den 28 Tagen bis zum 25.09.2026 verzeichnete unsere Property 8.931 Impressionen und 273 Klicks über 69 verschiedene exakte Schreibweisen des Modellnamens – „qwen3.8 27b“, „qwen3.8-27b“, „qwen 3.8 27b“ und Dutzende weitere Arten, dieselben drei Tokens zu schreiben. Unsere beste Position bei den größten Schreibweisen lag zwischen 9,0 und 10,6. Das sind Positionen, die wir durch andere Seiten zufällig innehatten, und genau das ist das Problem, das eine kanonische Seite behebt: Auf Platz neun steht man auf der Seite, und niemand klickt. Die einzige Stelle, an der der Traffic konvertiert, ist nicht-englischsprachig – eine russischsprachige Schreibweise des Namens liegt bei uns auf Position 1,8 und konvertiert zu 14,4 %.
Nichts davon ist ein Beleg über das Modell. Es ist ein Beleg dafür, was Menschen tippen, und es ist der Grund, warum die Seite existiert.
Was es bringt: ein dichtes 27B-Modell mit einem recht ungewöhnlichen Attention-Layout, einer permissiven Lizenz, nativem Videoverständnis, Apache-2.0-Bedingungen, die es erlauben, ein Derivat auszuliefern, ein unabhängiges Ranking im oberen Viertel dessen, was es misst, und eine Anbietertabelle, die gegenüber seinem Vorgänger stark und gegenüber der Frontier gemischt ausfällt. Die offene Frage ist die, die noch niemand außerhalb von Alibaba beantworten kann — wie sich der gehostete 1M-Token-Pfad im Produktivbetrieb verhält und ob die Flash-Next-Architektur in einem Modell dieser Größe landet.
Der 2.4T-A95B-Kern hinter Qwen3.8-Max ist im selben Katalog live: qwen/qwen3.8-maxfür $2.00 / $6.00 pro Million Tokens, falls das 27B nicht die Größe ist, die Sie brauchen.
