Titelkarte für den Qwen3.8-27B-Benchmark-Überblick, die eine Benchmark-Berichtskarte mit einem Siegel mit der Aufschrift OPEN WEIGHTS und Symbolen für Programmierung, Durchsatz, Vision, langen Kontext und lokale Hardware zeigt, mit Chips mit der Aufschrift 27B DENSE, 262K CONTEXT und APACHE 2.0.
Guides & Insights

Qwen3.8-27B Benchmarks: Die vollständige Tabelle, mit den beigefügten Einschränkungen

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Qwen/Qwen3.8-27B erzielt 73,0 bei Terminal-Bench 2.1, 61,7 bei SWE-bench Pro, 90,3 bei LiveCodeBench v6 und 84,3 bei OSWorld-Verified – und jede dieser Zahlen stammt von Alibaba selbst. Das Open-Weights-Modell mit 27 Milliarden Parametern erschien am 14. August 2026 unter Apache 2.0 auf Hugging Face und holte innerhalb seiner ersten zwei Wochen drei unabhängige Ergebnisse von Drittanbietern ein: den Platz #1 bei den Open-Weights-Modellen auf Harveys Legal-Agent-Benchmark, in einer Studie des Legal-KI-Unternehmens Harvey und des Speicherunternehmens Engram; einen Gesamtrang #9 auf Code Arenas WebDev-Bestenliste, das einzige Modell seiner Größenklasse in den Top 10, laut Alibabas Ankündigung vom 25. August; und, angekündigt am 26. August, den Platz #1 bei den Open-Weights-Modellen auf Arena.ais Image-to-WebDev-Bestenliste, insgesamt auf Rang #7 mit einem gemeldeten Wert von 1.574. Diese Seite ist die vollständige, mit Quellen belegte Übersicht: alle 25 offiziellen Benchmarks aus der Modellkarte, was sich gegenüber seinem Vorgänger Qwen3.6-27B geändert hat, was ein unabhängiger AMD-Durchsatztest gemessen hat, jene Ergebnisse zu Legal Agent und Webdev-Arena sowie welche Behauptungen Sie weiterhin als vorläufig betrachten sollten.

Eine Leseanleitung vor den Zahlen: „offiziell" bedeutet hier Alibabas Bewertung, die auf der Modellkarte bei Qwen/Qwen3.8-27B angegeben ist. Sie stammt vom Anbieter und wurde nicht unabhängig reproduziert. „Unabhängig" bedeutet, dass jemand außerhalb des Labors gemessen hat — bisher umfasst das einen Hardware-Durchsatztest, eine Agentenstudie im Rechtsbereich und Platzierungen auf zwei der Webentwicklungs-Bestenlisten von Arena.ai, Code Arenas WebDev und der Image-to-WebDev-Arena. Benchmarks, bei denen die Testumgebung (Harness) eine Rolle spielt, sind inline gekennzeichnet.

Das Modell, eine Zeile pro Spec.

• 27B dichte Parameter (28B inklusive des Vision-Encoders), 64 Schichten, Hidden Size 5120.

• Hybride Attention — 48 Gated-DeltaNet-Linear-Attention-Schichten plus 16 Full-Attention-Schichten, ein 3:1-Verhältnis — was es ermöglicht, ein 262K-Token-Fenster kostengünstig zu betreiben.

• 262.144 Token nativer Kontext, erweiterbar auf 1.000.000 mit YaRN-Skalierung.

• Native Bild- und Videoeingabe (Textausgabe), Apache-2.0-Gewichte, etwa 55,6 GB in BF16.

Die Kurzfassung: Dies ist das Modell, das die Erkenntnisse, die Alibaba beim Bau des Qwen3.8-Max mit 2,4 Billionen Parametern gewonnen hat, in etwas komprimieren soll, das eine einzelne GPU ausführen kann.

Die Scorecard: jeder Benchmark auf der Modellkarte

Alle unten aufgeführten Werte stammen aus dem von Alibaba veröffentlichten Modellblatt vom 14. August, wobei der Qwen3.6-27B-Wert, den das Modell ersetzt, in Klammern angegeben ist.

Programmierung. Terminal-Bench 2.1 (agentisches Terminal-Codieren) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Die Läufe von SWE-bench Pro und QwenSWEBench verwendeten den Claude Code Harness, laut einer Fußnote auf der Modellkarte — das sollte man im Hinterkopf behalten, bevor man sie mit einem Modell vergleicht, das mit einem anderen Harness bewertet wurde.

Langfristige Agenten und Büroarbeit. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / score 42.9 (10.6 / 27.3).

Schlussfolgerung und Wissen. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench Instruktionsbefolgung 79.5 (69.1). HLE wird von GPT-4o bewertet, laut der Karte.

Vision und Computernutzung. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 mit CI / 90.0 ohne (85.1); BabyVision 85.6 mit CI / 65.7 ohne (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). „CI“ ist Alibabas Inferenzzeit-Verbesserung; die Lücke zwischen ein- und ausgeschaltetem Zustand ist die aussagekräftigste Zahl auf der Karte darüber, wie viel Punktzahl man mit zusätzlicher Inferenz-Rechenleistung erkaufen kann.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Was hat sich tatsächlich gegenüber Qwen3.6-27B geändert?

Jeder Benchmark auf der Karte ist gestiegen, aber die Abweichungen sind nicht einheitlich – und die Form der Verbesserung ist die eigentliche Geschichte. Die Zuwächse konzentrieren sich auf agentisches Kodieren und Computernutzung, nicht auf Wissensabruf:

• DeepSWE 1.1 (agentisches Codieren) 13.3 → 42.2, ungefähr ein 3-facher Sprung

• QwenSWEBench 49,3 → 79,0

• Punktzahl beim Agents' Last Exam: 27,3 → 42,9

• OSWorld-Verified 63.9 → 84.3 und AndroidWorld 70.3 → 81.9

• BabyVision (mit CI) 28.9 → 85.6 — der größte relative Zuwachs auf der Tabelle

Unterdessen bewegte sich GPQA Diamond 87,8 → 89,2 und RealWorldQA 84,1 → 85,9: real, aber klein. Dies ist kein Release, das in allem schlauer ist. Es ist ein Release, das sich gezielt an Agenten richtet, die Bildschirme lesen, Werkzeuge nutzen und über viele Schritte hinweg Code schreiben.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Seit diese Seite online gegangen ist, ist die wichtigste Entwicklung rechtlicher, nicht technischer Natur. Alibaba hat angekündigt, dass Qw​en3.8-27B beim Legal-Agent-Benchmark von Harvey das Open-Weight-Modell auf Platz 1 sei — eine Ranglisten-Angabe vom Anbieter selbst, die also als Alibaba-Aussage zu betrachten ist. Dahinter steht eine Studie, die nicht von Alibaba stammt: Harvey, das Legal-AI-Unternehmen, und Engram, ein KI-Speicher-Startup, haben eine synthetische Anwaltskanzlei namens Calderwood & Harkness aus über 100 Millionen Tokens aus rund 10.000 Dokumenten und 266 Rechtssachen aufgebaut und anschließend Qw​en3.8-27B mit parametrischem Speicher, komprimierten Notizen und einem Abruf-Tool darauf angepasst.

Bei 250 Rechtsaufgaben erreichte das angepasste 27B-Modell durchschnittlich 67 % und lag damit vor jedem anderen im Test untersuchten Modell – einschließlich Claude Opus 4.8 – und bei strenger Alles-oder-nichts-Korrektheit führte es mit 30 % zu 25 % gegenüber Opus 4.8, bei etwa 0,13 $ pro Abfrage gegenüber 1,32 $ für Opus 4.8. Diese Zahlen stammen von Harvey/Engram und wurden noch nicht unabhängig reproduziert. Vor dem Training mit den eigenen Dokumenten der Kanzlei erzielte dasselbe Modell nur 4,7 % bei kanzleispezifischen Fragen; nach dem Studium derselben 72,6 %.

Lies die #1 mit einem großen Vorbehalt: Das Modell, das die Benchmark anführte, hatte den Testkorpus zuvor studiert und wurde an den 100M Tokens der Firma angepasst, bevor es bewertet wurde. Das macht dies zu einer Demonstration dessen, was die 27B mit domänenspezifischem Feintuning aufnehmen kann, nicht zu einem Ergebnis für die unveränderten Apache-2.0-Gewichte auf einem neutralen Prüfstand – und es deckt eine Domäne ab, nämlich Recht, nicht die allgemeine Qualität. Was es aber stützt, ist die Botschaft hinter dem Tweet: Eine 27B, die klein genug ist, um auf einem lokalen Rechner zu laufen, ist stark genug für professionelle Arbeit, sobald sie das richtige Wissen hat.

Das zweite unabhängige Ergebnis: insgesamt #9 auf Code Arenas WebDev

Das zweite unabhängige Ergebnis betrifft die Programmierung, und es ist der Grund, warum diese Seite am 25. August geändert wurde. Code Arena ist die Webentwicklungs-Bestenliste von Arena.ai — das Projekt, das früher als WebDev Arena bekannt war, auf der Website, die früher als LMArena bekannt war —, auf der Nutzer echte Apps mit anonymisierten Modellpaaren erstellen und darüber abstimmen, welches Ergebnis sie lieber veröffentlichen würden. Auf dieser öffentlichen Bestenliste steht Qw​en3.8-27B insgesamt auf Platz 9 mit einer Punktzahl von 1595 — das einzige Modell seiner Größenklasse in den Top 10.

{{1}}Die Platzierung ist der unabhängige Teil – sie steht auf einer Drittanbieter-Rangliste, die jeder öffnen kann. Die dazugehörige Schlagzeile stammt von Alibaba: Die Darstellung als „einziges kleines Modell in den Top 10“ und die begleitenden Platzierungen stammen aus Qw​ens Ankündigung vom 25. August. Sie sind es wert, mit diesem Etikett wiederholt zu werden. Das 27B-Modell rangiert sechs Plätze unter dem weitaus größeren Qwen3.8-Max (das die Ankündigung insgesamt auf Platz 3 setzt) und deutlich vor dem ähnlich großen Gemma 4-31B (das dieselbe Ankündigung auf Platz 80 setzt). Der Punkt ist nicht, dass ein 27B-Modell die Spitzenmodelle beim Erstellen von Web-Apps schlägt; es geht darum, dass ein Modell, das klein genug ist, um auf einer einzigen GPU zu laufen, in den Top Ten einer blinden Coding-Arena liegt, deren übrige Teilnehmer viel größere Modelle sind.{{/1}}

Das dritte unabhängige Ergebnis: #1 offenes Modell auf Arena.ais Image-to-WebDev

Das dritte unabhängige Ergebnis traf am 26. August ein, und es ist das bislang stärkste für ein Modell dieser Größe. Image-to-WebDev ist das Schwester-Board des WebDev von Code Arena auf Arena.ai — die Arena, in der ein Modell einen Screenshot oder eine andere visuelle Referenz erhält und daraus eine funktionierende Weboberfläche erstellen muss, wobei blinde menschliche Wähler das Ergebnis auswählen, das sie eher veröffentlichen würden. Auf dieser öffentlichen Rangliste belegt Qw​en3.8-27B Platz #1 unter den offenen Modellen und Platz #7 insgesamt, mit einem gemeldeten Arena-Score von 1.574.

Die Platzierung ist der unabhängige Teil — sie steht auf einem Drittanbieter-Ranking, das jeder öffnen kann. Die Schlagzeile dazu stammt von Alibaba: Die Ankündigung des Qw​en-Teams vom 26. August bezeichnet das 27B-Modell in diesem Test als „auf Augenhöhe mit Modellen, die 100-mal so groß sind“ — ein Vergleich, den das Ranking nicht dokumentiert. Und ein Präferenz-Ranking ist kein Urteil über die Codequalität — die Image-to-WebDev-Stimmen messen, welche Ausgabe ein Mensch eher ausliefern würde, nicht ob das HTML sicher, barrierefrei oder wartbar ist. Was das Ergebnis aber belegt, ist, dass ein 27B-Modell mit offenen Gewichten jetzt sein gesamtes offenes Feld darin anführt, ein Bild in eine Seite zu verwandeln — genau die Fähigkeit, auf der eine wachsende Kategorie von Produkten namens „Screenshot zu Site“ aufbaut.

Die ehrlichen Lücken: wo es noch verliert, und die methodischen Einschränkungen

Gegenüber der Spitze ist das Bild schmeichelhaft, aber nicht einseitig. Wo sich Qwen3.8-27B und Claude Opus 4.6 Max überschneiden, gewinnt Qwen die Mehrheit – SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench und den gesamten Vision-Block. Gegen Metas Muse Glimmer-30B, den natürlichen Konkurrenten der lokalen Klasse, gewinnt es alle acht überlappenden Benchmarks klar. Aber es verliert weiterhin gegen Claude Opus 4.6 Max bei Terminal-Bench 2.1 (73.0 vs. 78.2), GPQA Diamond (89.2 vs. 91.3), Humanity's Last Exam (30.8 vs. 40.0) und NL2Repo-Bench (42.3 vs. 47.6). Wenn Ihre Arbeitslast das schwerste Frontier-Denken umfasst – Frontier-Mathematik, massiv multidisziplinäre Fragen – ist die 27B noch nicht so weit.

Drei Vorbehalte, bevor Sie irgendetwas davon zitieren. Erstens: Die Modellkarten-Tabelle oben stammt weiterhin vollständig von Alibaba – es gibt noch keinen Artificial-Analysis-Index für die 27B. Es liegen nun drei unabhängige Drittanbieter-Ergebnisse vor, aber jedes ist eng begrenzt: Das Code-Arena-Ranking misst das Erstellen von Web-Apps anhand von Text-Prompts, das Image-to-WebDev-Ranking misst die Umwandlung eines Screenshots in eine funktionierende Seite, beide bewertet durch blinde Abstimmungen über anonymisierte Ausgaben, und die Harvey-Studie zum Legal-Agent deckt eine einzelne Domäne mit einem für den Test trainierten Modell ab. Keines davon ist ein Lauf mit den Original-Gewichten über eine Allzweck-Testumgebung. Zweitens: Die Modellkarte verwendet das Claude-Code-Harness für SWE-bench Pro und QwenSWEBench sowie einen GPT-4o-Judge für Humanity's Last Exam – Vergleiche mit Modellen, die auf anderen Setups ausgewertet wurden, werden die Zahlen verändern. Drittens: Alibabas MathVision-Lauf verwendete einen festen Prompt, während die Konkurrenz die bessere von zwei Varianten erhielt. Das bedeutet nicht, dass die Ergebnisse falsch sind; es bedeutet, dass sie eine Obergrenze darstellen, keine Untergrenze, bis unabhängige Labore das Modell auf neutralen Allzweck-Testumgebungen ausführen.

Was es braucht, um es zu betreiben

Qw​en3.8-27B ist ein lokales Modell, das die Bedeutung von „Performance“ verändert: Durchsatz auf der eigenen Hardware statt einer Preistafel. Die BF16-Gewichte umfassen etwa 55,6 GB; auf 4 Bit quantisiert passt es auf eine 24-GB-Karte wie eine RTX 3090 oder 4090. AMD lieferte am Erscheinungstag Day-0-Support, und die eigenen llama.cpp/Vulkan-Messungen des Unternehmens — August 2026, Durchschnitt aus drei oder mehr Läufen — beziffern die Leistung auf 24,5 Tokens/s bei einem Ryzen AI Max+ 395 und 51,8 Tokens/s bei einer Radeon AI PRO R9700 mit 32 GB, auf Systemen mit mehr als etwa 24 GB variablem Grafikspeicher oder VRAM. Community-Tests des FP8-Builds auf einer NVIDIA GH200 hielten 10 gleichzeitige Anfragen mit 262K-Kontext und einer Time-to-First-Token unter 10 ms aufrecht. Die eigenen Zahlen werden abweichen — das sind die GPUs von jemand anderem —, aber das Muster ist real: Dies ist die erste Qw​en-Veröffentlichung dieser Klasse, die nicht nur in einem Review, sondern auf einer einzelnen Workstation läuft.

Freie Gewichte oder eine kostenpflichtige API?

Die Entscheidung, die dieses Modell erzwingt, ist die zwischen lokal und gehostet: Die Gewichte kosten nichts, aber deine GPUs sind nicht kostenlos. Selbsthosting bedeutet, den Chip zu besitzen — eine 24-GB-Karte, wenn du 4-Bit-Quantisierung und langsamere Generierung akzeptierst, etwas Größeres, wenn du den vollen 262K-Kontext in voller Qualität willst. Die gehostete Alternative auf OrcaRouter kostet 0,33 $ pro Million Input-Tokens und 2,40 $ pro Million Output-Tokens, mit demselben 262K-Kontext, Bild- und Videoeingabe sowie einer p50-Zeit bis zum ersten Token von 225 ms, gemessen über die letzten sieben Tage — keine GPU zu kaufen, kein VRAM zu hüten. Die Rechnung ist die, die du bei offenen Gewichten immer machst: der Token-Durchsatz, den du tatsächlich brauchst, mal deine Kosten pro Token, gegen den Festpreis einer Karte. Bei dauerhaft hohem Volumen gewinnt Selbsthosting; bei stoßweisem oder mäßigem Volumen schlägt die Zahlung von 0,33 $/2,40 $ den Kauf von Chips, die du meistens ungenutzt lässt.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Fazit

Qwen3.8-27B ist das stärkste Open-Weights-Modell, das Alibaba in dieser Größenklasse veröffentlicht hat – laut Alibabas eigenen Zahlen: Tabellenführer bei Agentic Coding, Computer Use und Vision Reasoning, mit einem 262K-Kontextfenster und Gewichten unter Apache 2.0. Die Scorecard ist jedoch mit Vorbehalt zu lesen – jede Zahl auf der Model Card stammt vom Anbieter, ist harness-spezifisch und bislang nicht unabhängig reproduziert, und die Frontier-Modelle gewinnen weiterhin die schwierigsten Reasoning-Benchmarks. Wenn Sie entscheiden, ob Sie das Modell selbst hosten oder als API aufrufen, behandeln Sie die Benchmark-Tabelle als Versprechen, die AMD-Durchsatzzahlen als erste unabhängige Hardware-Messung, das Harvey-Legal-Agent-Ergebnis als erstes unabhängiges Zeichen dafür, dass die Fähigkeit des Modells außerhalb von Alibabas eigenen Harnesses Bestand hat, und die beiden Webdev-Arena-Platzierungen – #9 insgesamt im WebDev von Code Arena und #1 offenes Modell im Image-to-WebDev von Arena.ai – als erste unabhängige Bestätigungen dieser Fähigkeit durch Coding-Leaderboards. Wir werden diese Seite aktualisieren, sobald weitere unabhängige Labore Ergebnisse veröffentlichen.