Titelkarte für den Qwen3.8-27B-Benchmark-Überblick, die eine Benchmark-Berichtskarte mit einem Siegel mit der Aufschrift OPEN WEIGHTS und Symbolen für Programmierung, Durchsatz, Vision, langen Kontext und lokale Hardware zeigt, mit Chips mit der Aufschrift 27B DENSE, 262K CONTEXT und APACHE 2.0.
Guides & Insights

Qwen3.8-27B Benchmarks: Die vollständige Tabelle, mit den beigefügten Einschränkungen

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Qwen3.8-27B erzielt 73,0 im Terminal-Bench 2.1, 61,7 im SWE-bench Pro, 90,3 im LiveCodeBench v6 und 84,3 bei OSWorld-Verified — und jede dieser Zahlen stammt von Alibaba selbst. Das Open-Weights-Modell mit 27 Milliarden Parametern erschien am 14. August 2026 unter Apache 2.0 auf Hugging Face, und Stand 15. August hat niemand außerhalb von Alibaba seine Qualität unabhängig bewertet. Diese Seite ist die vollständige, mit Quellen belegte Übersicht: alle 25 offiziellen Benchmarks aus der Modellkarte, was sich gegenüber seinem Vorgänger Qwen3.6-27B geändert hat, was ein unabhängiger AMD-Durchsatztest gemessen hat und welche Behauptungen Sie als vorläufig betrachten sollten.

Ein Leseleitfaden vor den Zahlen: „offiziell“ bedeutet hier Alibabas Bewertung auf der Modellkarte zu Qwen/Qwen3.8-27B. Sie wird vom Anbieter gemeldet und ist nicht reproduziert. „Unabhängig“ bedeutet, dass jemand außerhalb des Labors gemessen hat – bisher gilt das nur für den Hardware-Durchsatz, nicht für irgendeinen Qualitätswert. Benchmarks, bei denen die Testumgebung (der Harness) von Bedeutung ist, sind inline gekennzeichnet.

Das Modell, eine Zeile pro Spec.

• 27B dichte Parameter (28B inklusive des Vision-Encoders), 64 Schichten, Hidden Size 5120.

• Hybride Attention — 48 Gated-DeltaNet-Linear-Attention-Schichten plus 16 Full-Attention-Schichten, ein 3:1-Verhältnis — was es ermöglicht, ein 262K-Token-Fenster kostengünstig zu betreiben.

• 262.144 Token nativer Kontext, erweiterbar auf 1.000.000 mit YaRN-Skalierung.

• Native Bild- und Videoeingabe (Textausgabe), Apache-2.0-Gewichte, etwa 55,6 GB in BF16.

Die Kurzfassung: Dies ist das Modell, das die Erkenntnisse, die Alibaba beim Bau des Qwen3.8-Max mit 2,4 Billionen Parametern gewonnen hat, in etwas komprimieren soll, das eine einzelne GPU ausführen kann.

Die Scorecard: jeder Benchmark auf der Modellkarte

Alle unten aufgeführten Werte stammen aus dem von Alibaba veröffentlichten Modellblatt vom 14. August, wobei der Qwen3.6-27B-Wert, den das Modell ersetzt, in Klammern angegeben ist.

Programmierung. Terminal-Bench 2.1 (agentisches Terminal-Codieren) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Die Läufe von SWE-bench Pro und QwenSWEBench verwendeten den Claude Code Harness, laut einer Fußnote auf der Modellkarte — das sollte man im Hinterkopf behalten, bevor man sie mit einem Modell vergleicht, das mit einem anderen Harness bewertet wurde.

Langfristige Agenten und Büroarbeit. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / score 42.9 (10.6 / 27.3).

Schlussfolgerung und Wissen. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench Instruktionsbefolgung 79.5 (69.1). HLE wird von GPT-4o bewertet, laut der Karte.

Vision und Computernutzung. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 mit CI / 90.0 ohne (85.1); BabyVision 85.6 mit CI / 65.7 ohne (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). „CI“ ist Alibabas Inferenzzeit-Verbesserung; die Lücke zwischen ein- und ausgeschaltetem Zustand ist die aussagekräftigste Zahl auf der Karte darüber, wie viel Punktzahl man mit zusätzlicher Inferenz-Rechenleistung erkaufen kann.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Was hat sich tatsächlich gegenüber Qwen3.6-27B geändert?

Jeder Benchmark auf der Karte ist gestiegen, aber die Abweichungen sind nicht einheitlich – und die Form der Verbesserung ist die eigentliche Geschichte. Die Zuwächse konzentrieren sich auf agentisches Kodieren und Computernutzung, nicht auf Wissensabruf:

• DeepSWE 1.1 (agentisches Codieren) 13.3 → 42.2, ungefähr ein 3-facher Sprung

• QwenSWEBench 49,3 → 79,0

• Punktzahl beim Agents' Last Exam: 27,3 → 42,9

• OSWorld-Verified 63.9 → 84.3 und AndroidWorld 70.3 → 81.9

• BabyVision (mit CI) 28.9 → 85.6 — der größte relative Zuwachs auf der Tabelle

Unterdessen bewegte sich GPQA Diamond 87,8 → 89,2 und RealWorldQA 84,1 → 85,9: real, aber klein. Dies ist kein Release, das in allem schlauer ist. Es ist ein Release, das sich gezielt an Agenten richtet, die Bildschirme lesen, Werkzeuge nutzen und über viele Schritte hinweg Code schreiben.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Die ehrlichen Lücken: wo es noch verliert, und die methodischen Einschränkungen

Gegenüber der Spitzenklasse ist das Bild schmeichelhaft, aber nicht einseitig. Wo sich Qwen3.8-27B und Claude Opus 4.6 Max überschneiden, gewinnt Qwen die Mehrheit — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench und den gesamten Vision-Block. Gegenüber Metas Muse Glimmer-30B, dem natürlichen Rivalen in der lokalen Klasse, gewinnt es alle acht überlappenden Benchmarks eindeutig. Aber es verliert weiterhin Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) und NL2Repo-Bench (42.3 vs 47.6) an Claude Opus 4.6 Max. Wenn Ihre Workload aus dem härtesten Frontier-Reasoning besteht — Frontier-Mathematik, massiv multidisziplinäre Fragen — ist die 27B noch nicht so weit.

Drei Vorbehalte, bevor Sie irgendetwas davon zitieren. Erstens: Nichts davon ist unabhängig verifiziert; es gibt keinen Artificial-Analysis-Index und keinen LMArena-Lauf für die 27B zum Stand 15. August, und Alibabas eigene Harnesses sind nicht diejenigen, die Dritte verwenden werden. Zweitens: Die Modellkarte verwendet die Claude-Code-Harness für SWE-bench Pro und QwenSWEBench sowie einen GPT-4o-Judge für Humanity's Last Exam – Vergleiche mit Modellen, die auf anderen Setups bewertet wurden, werden die Zahlen verschieben. Drittens: Alibabas MathVision-Lauf verwendete einen festen Prompt, während die Konkurrenz die höhere von zwei Varianten erhielt. Nichts davon bedeutet, dass die Ergebnisse falsch sind; es bedeutet, dass sie eine Obergrenze und keine Untergrenze darstellen, bis jemand anderes das Modell ausführt.

Was es braucht, um es zu betreiben

Qwen3.8-27B ist ein lokales Modell, das die Bedeutung von „Performance“ verändert: Durchsatz auf der eigenen Hardware statt einer Preistabelle. Die BF16-Gewichte umfassen etwa 55,6 GB; auf 4-Bit quantisiert passt es auf eine 24-GB-Karte wie eine RTX 3090 oder 4090. AMD bot am Veröffentlichungstag Day-0-Support und die eigenen llama.cpp/Vulkan-Messungen – August 2026, gemittelt aus drei oder mehr Läufen – ergaben 24,5 Token/s auf einem Ryzen AI Max+ 395 und 51,8 Token/s auf einer Radeon AI PRO R9700 mit 32 GB, auf Systemen mit mehr als etwa 24 GB variablem Grafikspeicher oder VRAM. Community-Tests des FP8-Builds auf einem NVIDIA GH200 hielten zehn gleichzeitige 262K-Kontextanfragen mit einer Time-to-First-Token von unter 10 ms aus. Ihre eigenen Werte werden abweichen – das sind die GPUs von jemand anderem –, aber das Muster ist real: Dies ist die erste Qwen-Veröffentlichung dieser Klasse, die nicht nur in einem Testbericht, sondern auf einer einzelnen Workstation läuft.

Freie Gewichte oder eine kostenpflichtige API?

Die Entscheidung, die dieses Modell erzwingt, ist die zwischen lokal und gehostet: Die Gewichte kosten nichts, aber deine GPUs sind nicht kostenlos. Selbsthosting bedeutet, den Chip zu besitzen — eine 24-GB-Karte, wenn du 4-Bit-Quantisierung und langsamere Generierung akzeptierst, etwas Größeres, wenn du den vollen 262K-Kontext in voller Qualität willst. Die gehostete Alternative auf OrcaRouter kostet 0,33 $ pro Million Input-Tokens und 2,40 $ pro Million Output-Tokens, mit demselben 262K-Kontext, Bild- und Videoeingabe sowie einer p50-Zeit bis zum ersten Token von 225 ms, gemessen über die letzten sieben Tage — keine GPU zu kaufen, kein VRAM zu hüten. Die Rechnung ist die, die du bei offenen Gewichten immer machst: der Token-Durchsatz, den du tatsächlich brauchst, mal deine Kosten pro Token, gegen den Festpreis einer Karte. Bei dauerhaft hohem Volumen gewinnt Selbsthosting; bei stoßweisem oder mäßigem Volumen schlägt die Zahlung von 0,33 $/2,40 $ den Kauf von Chips, die du meistens ungenutzt lässt.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Fazit

Qwen3.8-27B ist das stärkste Open-Weights-Modell, das Alibaba in dieser Größenklasse veröffentlicht hat — nach Alibabas eigenen Zahlen: Tabellenführer bei Agentic Coding, Computer Use und Vision-Reasoning, mit einem 262K-Kontextfenster und Apache-2.0-Gewichten. Die Scorecard ist mit Vorbehalt zu lesen: Jede Kennzahl stammt vom Anbieter, ist harness-spezifisch und bislang nicht unabhängig reproduziert, und die Spitzenmodelle gewinnen weiterhin die schwierigsten Reasoning-Benchmarks. Wenn Sie entscheiden, ob Sie es selbst hosten oder per API aufrufen, behandeln Sie die Benchmark-Tabelle als Versprechen und die AMD-Durchsatzwerte als die einzige unabhängige Messung, die es heute gibt. Wir aktualisieren diese Seite an dem Tag, an dem ein unabhängiges Labor einen Score veröffentlicht.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

Kontaktiere uns

Community beitreten

DiscordEmailXGitHubYouTube