Ein Titelkärtchen für den Artikel „Qwen3.8-27B VRAM-Anforderungen“, das einen GPU-Chip mit einem ~17-GB-Speicherlabel und Quantisierungs-Badges für Q4_K_M, Q6_K und Q8_0 zeigt.
Guides & Insights

Qwen3.8-27B VRAM-Anforderungen: Wie viel Hardware Sie wirklich benötigen

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Rund 17 GB VRAM ist die Zahl, die für Qwen3.8-27B kursiert — Unsloths Daniel Han sagte, das Modell {{1}}sollte bei der Veröffentlichung mit ungefähr 17 GB VRAM auskommen{{/1}} — und es lohnt sich, genau zu klären, was das ist und was nicht. Es handelt sich um eine Projektion basierend auf dem Vorgänger der 27B, nicht um eine Spezifikation von Alibaba, da das Modell noch nicht veröffentlicht wurde; das offizielle Repository wurde für {{2}}die Woche vom 10. August 2026{{/2}} angekündigt und war zum Zeitpunkt der Erstellung dieses Artikels noch nicht verfügbar. Dieser Artikel unterteilt die VRAM-Frage in das, womit du planen kannst, was wirklich unsicher ist und wie sich die Zahl mit deiner Quantisierung, deinem Kontextfenster und deiner Laufzeitumgebung verändert.

Die ehrliche Antwort zuerst

Es gibt noch keine offizielle Hardware-Spezifikation für Qwen3.8-27B. Alles unten basiert auf Projektionen von Qwen3.6-27B, dem Modell, das die 27B-Version ablöst – gleiche Parameteranzahl, wahrscheinlich dieselbe Hybridarchitektur und die beste verfügbare Referenz für die Dimensionierung. Behandeln Sie die Zahlen als Planungsrahmen, nicht als Anforderungsliste. Die ersten echten Messungen werden innerhalb von Tagen nach der Veröffentlichung der Gewichte von den Entwicklern der Quantisierungs- und Inferenz-Frameworks kommen, und auf diese Werte sollten Sie Ihren Kauf stützen.

Die Quant-Leiter

Wie viel VRAM Sie benötigen, hängt fast ausschließlich davon ab, welche Quantisierung Sie ausführen. Ausgehend von der von der Community gemessenen Qwen3.6-27B-Tabelle:

• Q4_K_M — etwa 16 GB VRAM. Der Sweet Spot für 24-GB-Karten und wahrscheinlich die Quelle der „17-GB“-Angabe. Standard der meisten Teams.

• Q3_K_M / IQ3 — etwa 13 GB VRAM. Passt auf 16-GB- und sogar 12-GB-Karten, mit einem sichtbaren Qualitätsabfall.

• Q6_K — ungefähr 21 GB VRAM. Nahezu verlustfrei und passt knapp, aber tatsächlich auf eine 24-GB-Karte.

• Q8_0 — ungefähr 27–30 GB VRAM. Für 48-GB-Karten, bei denen Sie das letzte Quäntchen Qualität herausholen möchten.

• FP8-Serving — etwa 27 GB VRAM für die Gewichte, weshalb eine einzelne L40S die gängige Wahl für Inference-GPUs ist.

• Volle Präzision (BF16) — etwa 54 GB VRAM. Realistisch gesehen eine Karte der H100-Klasse, und der Bereich, in dem die Leute aufhören, es „lokal“ zu nennen.

Die Kurzfassung: Eine 24-GB-GPU ist die sichere Wahl für dieses Modell, eine 16-GB-Karte kann es nur ausführen, wenn man die niedrigen Quantisierungen akzeptiert, und alles mit 8 GB oder weniger ist raus, es sei denn, das Modell erweist sich als deutlich schlanker als sein Vorgänger.

An infographic titled 'Qwen3.8-27B - the quant ladder' listing six quantization tiers with VRAM figures: Q3_K_M ~13 GB, Q4_K_M ~16 GB, Q6_K ~21 GB, Q8_0 ~27-30 GB, FP8 serving ~27 GB, BF16 full ~54 GB, with the Q4_K_M row highlighted as the sweet spot for 24 GB cards.

Die Variable, die niemand zitiert: Kontextlänge

Jede Zahl oben bezieht sich auf einen moderaten Kontext. Der VRAM-Verbrauch skaliert mit dem Kontext, weil der KV-Cache neben den Gewichten liegen muss. Bei Qwen3.6-27B lief ein 2K-Kontext mit etwa 11 GB, ein 32K-Kontext trieb dieselbe Quantisierung auf über 14 GB, und 128K mehr als verdoppelte den Cache-Speicherbedarf. Wenn Qwen3.8-27B ein großes natives Kontextfenster beibehält – und die Qwe​n-Generation tendiert in diese Richtung – plane ein paar GB Puffer über die Quantisierungsgröße hinaus ein oder begrenze den Kontext in der Laufzeitkonfiguration. Eine Kontextlänge zu wählen, die man tatsächlich nicht nutzt, ist der häufigste Grund, warum Teams am Ende eine größere Grafikkarte kaufen, als sie benötigen.

Der Joker der Hybrid-Architektur

Qwen3.6-27B war ein hybrides Modell: Nur 16 seiner 65 Schichten nutzten einen traditionellen KV-Cache, während 48 einen festen rekurrenten Zustand verwendeten. Das Ergebnis war ein etwa viermal geringerer KV-Speicherbedarf als bei einem dichten Modell derselben Größe – was zu einem großen Teil erklärt, warum sich ein 27B wie ein Modell für eine 24-GB-Karte anfühlte und nicht wie eines für 48 GB. Wenn Qwen3.8-27B das hybride Design beibehält (wahrscheinlich, aber unbestätigt), wird die obige Kontextlängen-Rechnung freundlicher, als sie aussieht. Der Haken ist die Laufzeitunterstützung: Ein llama.cpp- oder vLLM-Build, der die rekurrenten Schichten nicht implementiert, meldet einen viel höheren Speicherverbrauch. Prüfe, welche Laufzeiten die Unterstützung bereits integriert haben, bevor du annimmst, dass die Projektionen gelten.

Welche GPUs funktionieren tatsächlich

Konkret für die üblichen Karten:

• RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M bequem, Q6_K wenn du bereit bist zu quetschen. Das ist die Zielgruppe.

• RTX 3060 / 4060 Ti 16 GB — nur IQ4- oder Q3-Klasse-Quants, mit bescheidenem Kontext. Brauchbar, nicht angenehm.

• 12-GB-Karten — Q3_K_M in reduzierter Qualität. Gut für Experimente, nicht für den Produktivbetrieb.

• Apple Silicon – ein 24-GB-Mac führt dieselben Q4-Dateien über MLX oder llama.cpp aus; die 16-GB-Basismodelle geraten ins Swap-Thrashing und sind praktisch raus, ebenso wie sie es schon bei Qwen3.6-27B waren.

• 48 GB und mehr (A6000, L40S, Dual-Karten-Setups) — Q8_0- oder FP8-Serving mit echter Reserve.

An infographic titled 'Context vs VRAM' comparing the same Q4 quant at 2K context (~11 GB) versus 32K context (~14 GB+), with a tip box advising to cap context at what you actually use.

Oder die GPU ganz überspringen

Wenn die Hardware-Rechnung für Sie nicht aufgeht, muss das Modell es auch nicht. OrcaRouter ist eine API für über 200 Modelle – einschließlich der Qwe​n-Familie – und gibt den Listenpreis des Anbieters ohne Aufschlag weiter, sodass Qwen3.8-Max derzeit $2.00 pro Million Input-Tokens und $6.00 pro Million Output-Tokens kostet, genau wie auf der eigenen Preisseite des Anbieters. Die 27B selbst wird ein lokales Modell sein, aber sobald ihre Gewichte veröffentlicht werden und sie Vertrauen gewinnt, wird derselbe Schlüssel zu jedem Anbieter weiterleiten, der sie hostet – Sie können jetzt bereits mit dieser Generation entwickeln und den GPU-Reseller-Markt überhaupt nicht berühren.

OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the NEW FEATURED badge, Vision and Tools capabilities, $2.00 per million input tokens and $6.00 per million output tokens, a p50 time-to-first-token of 4.84 seconds, a 1M-token context window, and OpenAI-compatible API code samples.

Das Fazit zur Hardware-Frage: Planen Sie mit 16 GB für einen komfortablen 4-Bit-Betrieb, mit 24 GB sind Sie auf der sicheren Seite und haben Spielraum für Kontext und höhere Quantisierungen, und behandeln Sie alle hier genannten Zahlen als vorläufig, bis das Repository erscheint und die ersten echten Messwerte vorliegen. Die Prognose von „17 GB“ ist eine vernünftige Planungsgröße — nur ist sie noch keine Tatsache.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

Kontaktiere uns

Community beitreten

DiscordEmailXGitHubYouTube