Hero-Titelkarte für den Qwen3.8-27B-Testbericht mit dem Titel „Qwen3.8-27B Review“ und dem Untertitel „Das Open-Weight-27B, das Opus für zu Hause ist – gegen den Hype getestet“, die ein Open-Weights-Badge, ein Apache-2.0-Badge und ein Icon-Set für GPU und Server auf einem sauberen weißen Hintergrund mit sanften blauen Farbverlaufsakzenten zeigt.
Guides & Insights

Qwen3.8-27B Review: das Open-Weight-27B-Modell, das „Opus für zu Hause" ist — gegen den Hype getestet

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Qwen3.8 27B ist das beste Open-Weight-27B, das du derzeit selbst hosten kannst, und das ist nicht besonders knapp. Die Gewichte wurden am 14. August 2026 unter Apache 2.0 veröffentlicht: ein dichtes 27B-Modell (28B, wenn man den Vision-Encoder mitzählt) mit 262K nativem Kontext, nativem Bild- und Video-Input und vom Hersteller gemeldeten Agentic-Coding-Werten auf oder über Cla​ude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Der Preis ist der Clou: null. Lade 55,6 GB herunter und starte es. Auch die Einschränkungen sind real — unabhängige Tests zeigen, dass es etwa dreimal langsamer und token-hungriger ist als sein Vorgänger, jeder Benchmark auf der Karte stammt noch immer von Ali​baba, und der 1M-Kontext ist nur im gehosteten Modus verfügbar. Fazit: Wenn du eine GPU mit 24 GB+ hast und eine Leistungsfähigkeit nahe der Spitze ohne verbrauchsabhängige Abrechnung willst, hoste es selbst — aber geh es mit dem Wissen an, wo genau die Zahlen weich sind.

Fazit zuerst: Sollten Sie Qwen3.8 27B verwenden?

Kurzantwort — ja für lokale und private Workloads; warten Sie auf Zahlen von Drittanbietern, bevor Sie eine Beschaffungsentscheidung treffen. Qwen3.8 27B ist das seltene Modell, bei dem die offenen Gewichte das Produkt sind und die API der Komfort ist. Da die Lizenz Apache 2.0 ist, ist der Preis pro Token dauerhaft null, sobald Sie die Hardware haben, und nichts, was Sie darauf aufbauen, kann nachträglich neu lizenziert oder in Rechnung gestellt werden. Was Sie aufgeben, sind Geschwindigkeit, Verifizierung und Komfort.

Wenn Sie bereits Qwen3.6-27B ausführen und damit zufrieden sind, ist das Upgrade real, aber zeitlich nicht kostenlos. Wenn Sie von der Qwen3.8-Max-Veröffentlichung hierhergekommen sind, ist dies das kleinere, selbst hostbare Mitglied derselben Generation – ein anderes Werkzeug für eine andere Aufgabe.

Die wichtigsten Fakten, geprüft am 15. August 2026

Veröffentlicht — die Gewichte wurden am 14. August 2026 unter Qwen/Qwen3.8-27B auf Hugging Face veröffentlicht, gespiegelt auf ModelScope; die zeitzonenbezogene Berichterstattung nennt auch den 13. August, und die Veröffentlichung erfolgte etwa eine Woche nach der Ankündigung der Qwen3.8-Generation.

Lizenz — Apache 2.0: herunterladen, modifizieren, weiterverbreiten, kommerzielle Nutzung, mit ausdrücklicher Patenterteilung. Dauerhaft.

Parameter — 27B dicht (28B einschließlich des Vision-Encoders), 64 Schichten, verborgene Größe 5.120, Vokabular 248.320.

Architektur — hybride Aufmerksamkeit: 48 Gated-DeltaNet-Linear-Attention-Schichten gegenüber 16 vollständigen Gated-Attention-Schichten (ein 3:1-Verhältnis). Deshalb kann ein dichtes 27B-Modell 262K Token nativen Kontexts verarbeiten.

Kontext — 262.144 Token nativ; erweiterbar auf 1.000.000 über YaRN auf der gehosteten Version.

Eingabe — native Bilder und Videos neben Text; gibt Text zurück. Der Vision-Encoder ist der Grund, warum die Parameteranzahl 28B beträgt.

Denken — Denkmodus standardmäßig aktiviert und pro Anfrage deaktivierbar; reasoning_effort (niedrig/mittel/hoch) und preserve_thinking für lange Agentenläufe.

Gewichte — 55,6 GB an BF16-Safetensors in 18 Shards; FP8 und Community-GGUFs sind ebenfalls enthalten.

Die obigen Spezifikationen stammen aus der Hugging-Face-Modellkarte und der Konfiguration für Qwen3.8 27B, die heute gelesen wurden. Die Benchmark-Angaben stammen von Alibaba; bis heute hat kein unabhängiges Labor sie reproduziert.

Worin Qwen3.8 27B wirklich gut ist

Der stärkste Fall ist agentische Softwareentwicklung. Ali​baba berichtet über einen 3x-Sprung bei DeepSWE 1.1 gegenüber dem vorherigen 27B (42.2 vs. 13.3) und einen Score über Cla​ude Opus 4.6 Max auf SWE-bench Pro (61.7 vs. 53.4). Das sind die Zahlen, die ihm den Spitznamen „Opus at home“ eingebracht haben – ein dichtes 27B, das Coding-Arbeit nahe am Spitzenniveau auf Hardware leistet, die man tatsächlich besitzen kann.

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

Drei Dinge neben den nackten Zahlen machen es zu einem vertretbaren Kauf:

Nativ multimodal. Bild- und Videoeingabe, Textausgabe – ein Dokument mit Diagrammen oder ein Video-Walkthrough ist kein separates Modell. Die visuellen Reasoning-Werte (85,6 bei aktiviertem Chain-of-Thought-Feature, 94,6 visuelle Mathematik, beide vom Anbieter gemeldet) sind der Punkt, an dem der Vision-Encoder seinen Wert beweist.

262K nativer Kontext. Langfristige Agentenaufgaben, große Codebasen und mehrstündige Transkripte passen in ein einziges Fenster. Das hybride Linear-Attention-Design hält die KV-Kosten dieses Kontexts niedriger als bei einem reinen Full-Attention-Modell gleicher Größe.

Kostenlose, dauerhafte Gewichte. Das ist der ganze Sinn dieser Kategorie: Ein Closed-API-Modell wird gemietet; Qwen3.8 27B ist Eigentum. Bei 4-Bit läuft es auf einer 24-GB-Karte (RTX 3090/4090-Klasse), und AMD hat Day-0-Support bereitgestellt (bis zu 24,5 Token/s auf einem Ryzen AI Max+ 395 und 51,8 Token/s auf einer Radeon AI PRO R9700, laut AMDs eigenem Blog).

Wo die Bewertung unschön wird: Geschwindigkeit, Tokens und Verifizierung

Unabhängige Tests sind bisher nur der Testaufbau eines einzelnen Testers, kein Labor – aber es ist das beste Signal, das wir haben. Beim Vergleich von Qwen3.8 27B mit Qwen3.6-27B bei zehn realen Aufgaben (bewertet von GPT-5.5 über die llmcompare-Umgebung) gewann die 3.8 neun von zehn und erzielte durchschnittlich 8,838 gegenüber 6,862 – „einen der beeindruckendsten Intelligenzsprünge“, die der Tester gesehen hatte. Sie verbrauchte außerdem fast dreimal so viele Token und war erheblich langsamer; eine Aufgabe dauerte etwa 600 % länger. Der Qualitätssprung ist also real, und das gilt auch für den Preis in Echtzeit.

Vier weitere Dinge, die dagegen sprechen:

Noch keine Benchmarks von Drittanbietern. Jede im Artikel genannte Kennzahl wurde von Ali​baba gemeldet und hat den Stand vom 15. August. Die Anbieterkarte ist detailliert, aber eine Reproduktion durch ein unabhängiges Labor hat nicht stattgefunden. Wenn Ihre Entscheidung von verifizierten Zahlen abhängt, warten Sie darauf – die Gewichte sind dann immer noch vorhanden.

Die VRAM-Untergrenze ist real. BF16 benötigt eine GPU der 80-GB-Klasse. Um auf eine 24-GB-Karte zu passen, muss man 4-Bit verwenden, und Community-Berichte (dev.to-Kommentarthread, Tage nach der Veröffentlichung) besagen, dass quantisierte Builds „nach langem Kontext den Fokus verlieren“. Offizielle Gewichte, wenn du den VRAM hast; quantisierte, wenn nicht.

Der 1M-Kontext ist nur in der gehosteten Version verfügbar. Die offenen Gewichte sind auf 262K begrenzt. Die Erweiterbarkeit auf 1M ist ein gehostetes Feature von Qwen Cloud, nicht etwas, das eine lokale Kopie von Haus aus bietet.

„Beats Opus" braucht Einschränkungen. Agentic Benchmarks belohnen harness-spezifisches Verhalten, und ein Top-Kommentar unter dem dev.to-Launchbeitrag brachte es unverblümt auf den Punkt: „Im realen Einsatz schlagen sie Opus nicht." Behandelt die Bestenliste im besten Fall als Obergrenze, nicht als Versprechen.

Wie es sich in die Qwen 3.8-Familie einfügt

im Vergleich zu Qwen3.6-27B – dieselbe Hardwareklasse und 262K-Kontext, aber ein großer Fähigkeitssprung auf Kosten von Geschwindigkeit und Tokeneffizienz. Wenn Sie bereits 3.6 ausführen und durch den Durchsatz begrenzt sind, ist ein Bleiben vertretbar.

vs Qwen3-Coder-30B-A3B — der Coder ist ein MoE mit etwa 3,3B aktiven Parametern, der viel schneller läuft (~90–110 Tokens/s). Das dichte 27B-Modell ist pro Token langsamer, erbt aber die agentischen Vorteile der Generation; wenn die Software-Engineering-Werte des 27B bei unabhängigen Tests Bestand haben, schrumpft die Rolle des Coder-30B.

vs Qwen3.8-Max — das 2.4T-MoE-Flaggschiff ist ein Rechenzentrumsmodell (nur per API, laut veröffentlichten Berichten etwa $2/$6 pro Million Tokens) mit 1M Kontext und Video. Die 27B ist die einsetzbare Variante. Sie beantworten unterschiedliche Fragen.

Kosten: die Frage lokal versus API, geklärt

Bei einem geschlossenen Modell vergleichst du die Preise pro Token. Bei Qwen3.8 27B kostet das marginale Token nichts auf deiner eigenen Hardware — der eigentliche Preis ist die anfängliche GPU und deine Zeit. Bei 4-Bit ist das eine 24-GB-Karte; bei BF16 ist es eine Maschine der 80-GB-Klasse. Wenn du das Modell nur bewerten musst oder dir die Hardware fehlt, gibt es den gehosteten Weg: OrcaRouter listet jetzt Qwen3.8 27B mit einem kostenlosen, ratenbegrenzten Tarif, der 0 $ berechnet und bei Überschreitung des Limits HTTP 429 zurückgibt, sowie einem kostenpflichtigen Tarif von 0,33 $ pro Million Input-Token und 2,40 $ pro Million Output-Token (Stand: 15. August). Die gehostete Version von Qwe​n Cloud mit dem 1M-Kontext ist als „coming soon“ markiert.

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

Die ehrliche Einordnung: Bei einem Open-Weights-Modell ist ein Anbieter eine Annehmlichkeit, keine Abhängigkeit. Die kostenlose Stufe ist die günstigste Möglichkeit, um zu entscheiden, ob ein 55,6-GB-Download sich lohnt. Aber hast du dich erst einmal entschieden, sind die Gewichte die Hauptsache – und sie sind kostenlos.

Wie man es tatsächlich ausprobiert

Schnellste Evaluierung — nutze die kostenlose, ratenbegrenzte gehostete Stufe; wenn sie beantwortet, was du brauchst, bist du fertig und es kostet nichts.

Echter Test auf deiner Hardware — lade ein Community-GGUF herunter (der Q4_K_M-Build ist etwa 17 GB groß und passt auf eine 24-GB-Karte) und führe es in llama.cpp oder Ollama aus. Übergib die Jinja-Chatvorlage, sonst antwortet dir das Modell in Thought-Tags. Für Vision mit einem GGUF benötigst du außerdem die separate mmproj-Datei. Unser Runbook zum lokalen Ausführen von Qwen3.8 27B führt dich Schritt für Schritt durch.

Volle Präzision — huggingface-cli download Qwen/Qwen3.8-27B auf eine GPU der 80-GB-Klasse.

Überprüfe, was du heruntergeladen hast — prüfe, dass der Herausgeber die Qwe​n-Org ist, und validiere Shards gegen crc32.txt; Nachahmer-Repos sind vor der Veröffentlichung aufgetaucht.

Wann diese Bewertung falsch ist (und wer Qwen3.8 27B überspringen sollte)

Sie haben keine GPU und werden keine mieten. Die kostenlose Stufe ist ratenbegrenzt und die kostenpflichtige Stufe kostet $0.33/$2.40 pro Million – ein kleines API-Modell könnte Sie günstiger und zuverlässiger bedienen. Dieses Modell ist für Leute, die die Inferenz selbst betreiben möchten.

Sie benötigen ein SLA.Die gehostete Stufe ist erst wenige Tage alt; die heute abgerufene OrcaRouter-Modellseite zeigt über die letzten sieben Tage eine Fehlerrate von 33,3 % und eine p50-Latenz von 225 ms für das erste Token. Das ist ein brandneues Modell unter früher Last und kein Produktionsvertrag. Selbst-Hoster sollten ihren Download-Commit fixieren und einen Fallback bereithalten.

Sie benötigen verifizierte Benchmarks für eine Kaufentscheidung. Vom Anbieter gemeldete Zahlen sind allenfalls richtungsweisend, aber nicht beschaffungstauglich. Warten Sie auf eine unabhängige Reproduktion.

Ein 262K-Kontext mit Open Weights reicht nicht aus. Die 1M-Erweiterung ist derzeit nur in der gehosteten Version verfügbar.

Durchsatz ist Ihr Engpass. Bulk-Zusammenfassungen oder große Batches werden zum Problem: Dies ist ein dichtes 27B-Modell, das außerdem etwa 3x so viele Token verbraucht wie sein Vorgänger. Für günstige Massenverarbeitung ist ein kleineres oder schnelleres Modell die bessere Wahl.

Du bist auf einer 12-GB-Karte. 2-Bit-GGUFs quetschen sich mit sichtbarem Qualitätsverlust hinein; das ist nicht das Modell für dich.

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

Das Fazit

Qwen3.8 27B ist das stärkste Open-Weights-27B-Modell, das es heute gibt, und es ist unter Apache 2.0 für immer kostenlos. Wenn du eine GPU mit 24 GB+ hast und agentisches Coding, 262K Kontext und nativen Bild-/Video-Input ohne verbrauchsabhängige Abrechnung möchtest, dann ist das der richtige Kauf. Die Gründe, abzuwarten, sind ebenso konkret: Du brauchst eine unabhängige Benchmark-Bestätigung, eine SLA, einen Open-Weights-Kontext von mehr als 262K oder einen höheren Durchsatz, als dir ein dichtes 27B-Modell bietet. Das Modell ist draußen, die Gewichte sind echt und die Zahlen sind gut – denk nur daran, wessen Zahlen es sind.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

Kontaktiere uns

Community beitreten

DiscordEmailXGitHubYouTube