
Qwen3.8-27B auf vLLM: Bereitstellung in der Produktion auf einer oder zwei GPUs
- obsidianNEUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 pro 1 Mio. Tokens · 42 tok/s
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-1326 tok/s
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaNEUMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenNEUQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 3320 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
- tencentTencent: Hy32026-07-0642Intelligenz59Coding
Ja — Qwen3.8 27B läuft heute in Produktion auf vLLM, und in den meisten Fällen auf einer einzelnen GPU. Die relevante Version ist vLLM 0.17.0 oder neuer: Sie enthält das offizielle Rezept, die Hybrid-Attention-Kernel, die dieses Modell benötigt, sowie einen OpenAI-kompatiblen /v1-Endpunkt. Für eine Blackwell-GPU verwenden Sie das NVFP4-Quant — vLLMs eigenes Rezept misst es bei 24,6 GiB VRAM bei Tensor-Parallel-Größe 1. Für eine einzelne 48-GB-Karte verwenden Sie FP8. Volles BF16, ein 51,7-GB-Checkpoint, benötigt eine 80-GB-GPU oder zwei 48-GB-Karten mit Tensor-Parallel. Die genauen Befehle finden Sie unten; der erste ist ein Einzeiler.
Alles hier wurde am 15. August 2026 verifiziert, am dritten Tag, an dem die Gewichte live waren. Architektur, Kontext und Lizenz stammen aus der Modellkarte von Qwen3.8 27B auf Hugging Face; die Checkpoint-Größe ist die Summe der 18 Safetensors-Shards des Repos; die vLLM-Befehle und die 24,6-GiB-Angabe stammen von vLLMs eigener Rezeptseite für dieses Modell. Qwen3.8 27B ist Alibabas dichtes multimodales Modell mit 27 Milliarden Parametern — Apache-2.0-Gewichte, veröffentlicht am 13.–14. August — und da die Gewichte offen sind, kannst du es selbst bereitstellen, anstatt Tokens zu mieten. Um genau diesen Fork geht es in diesem Artikel eigentlich.
Die Fakten, die zählen, mit Quellen
• Architektur — 27B dicht (27,8B inklusive Vision-Turm und aufgefülltem Vokabular), 64 Schichten, verborgene Dimension 5.120, Vokabular 248.320. Offizielle Modellkarte, heute verifiziert.
• Attention — hybrid: 16 Full-Attention-Layer, 48 lineare Gated-DeltaNet-Layer in einem 3:1-Blockmuster. Nur 16 Layer behalten einen wachsenden Key-Value-Cache; die anderen 48 behalten stattdessen einen rekurrenten Zustand fester Größe.
• Kontext — 262.144 Tokens nativ, erweiterbar auf etwa 1M über YaRN-RoPE-Skalierung. Modellkarte, heute verifiziert.
• Eingabe— nativer Text, Bild und Video; Textausgabe. vLLM stellt alle drei über die Standard-Chat-Completions-API bereit, ohne separate Projektordatei.
• Lizenz — Apache 2.0. Allein diese Tatsache ist der Grund, warum die Frage „selbst hosten vs. Tokens mieten“ überhaupt existiert.
• Gewichte — das BF16-Checkpoint umfasst insgesamt 51,7 GB über 18 Safetensors-Shards (Hugging Face, heute verifiziert). Qwen veröffentlicht außerdem FP8- und NVFP4-Checkpoints, die für vLLM entwickelt wurden.
• vLLM-Anforderung — 0.17.0 oder neuer, mit transformers ≥ 5.8.0. vLLMs Rezeptseite, heute verifiziert. ‚Jedes vLLM‘ ist keine sichere Anweisung; die Kernel der rekurrenten Schicht sind das, was die neue Version hinzufügt.
• Multi-Token-Vorhersage — ein Draft-Head für spekulative Dekodierung ist im Checkpoint enthalten, sodass kein separates Draft-Modell benötigt wird. vLLM dokumentiert das Flag; eine unabhängige Beschleunigungsmessung gibt es noch nicht.
Die GPU-Leiter — welches Quant auf welcher Grafikkarte
Drei Serving-Formate decken den praktischen Bereich ab. Wähle anhand der VRAM, die du tatsächlich hast, nicht nach „best quant“.
• NVFP4 — insgesamt 24,6 GiB (Gewichte plus einem FP8-KV-Cache) gemäß vLLM-Rezept bei TP1. Passt auf eine einzelne GPU der Blackwell-Klasse — in der Praxis eine 32GB RTX 5090 oder eine B200. Dies ist der Weg mit der geringsten Latenz und derjenige, der den meisten Kontext pro Karte behält: Das vLLM-Rezept berichtet eine KV-Token-Kapazität von 6,6 M selbst bei der 1M-Kontexterweiterung.
• FP8 — etwa 26 GB an Gewichten. Eine 48-GB-Karte (L40S, RTX A6000, RTX 6000 Ada) bedient es mit Platz für Kontext; zwei 48-GB-Karten im Tensor-Parallel-Betrieb geben Spielraum für längeren Kontext oder höhere Parallelität. vLLMs eigenes Rezept führt FP8 mit TP4 über ein Vier-GPU-GB300-Tray aus, wenn Sie den größtmöglichen KV-Cache wünschen.
• BF16 — 51,7 GB Gewichte, also eine einzelne 80-GB-GPU (H100, A100 80GB, B200, GB300) oder zwei 48-GB-Karten bei TP2. Dies ist die Option mit Referenzpräzision, und es ist diejenige, die der untenstehende Befehl zur Erweiterung des 1M-Kontexts tatsächlich verwendet.
• MXFP4 — nicht auf NVIDIA verwenden. Dem MXFP4-Pfad von vLLM fehlt derzeit die Unterstützung für die Linear-Methode; dieselben Gewichte werden als NVFP4 veröffentlicht, also dem Format, das das NVIDIA-Rezept tatsächlich verwendet.

Führe es aus — die vLLM-Befehle
Die Standardeinstellung für eine Einzel-GPU mit niedriger Latenz (NVFP4, eine Blackwell-GPU), wörtlich aus vLLMs Rezept:
vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
Der FP8-Befehl aus demselben Rezept (TP4, ein GB300-Tray, größter KV-Cache):
vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3
Für zwei 48GB-Karten behalten Sie den FP8-Befehl bei und setzen Sie --tensor-parallel-size 2 statt 4.
Hängen Sie dies an einen der beiden Befehle an, um MTP-Spekulativ-Decoding zu aktivieren:
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
Die 1M-Kontext-Erweiterung (ebenfalls aus vLLMs Rezept):
vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

Point any OpenAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.
Was vLLMs eigene Seiten versprechen und was nicht
• Noch keine Durchsatzzahlen für 27B. Stand 15. August veröffentlicht die vLLM-Rezeptseite keine Durchsatz- oder Latenz-Benchmarks für Qwen3.8 27B. Die kursierende Zahl von „über 4.000 Token pro Sekunde pro GPU“ gehört zum Qwen3.8 2.4T-A95B auf einem 72-GPU-GB300-NVL72-Rack, stammt vom Anbieter und gilt nicht für dieses Modell. Von der Community kursierende Token-pro-Sekunde-Zahlen für GGUF unter llama.cpp oder Ollama betreffen eine andere Laufzeitumgebung und eine andere Arbeitslast als das vLLM-Serving.
• Die Behauptung über den günstigen KV-Cache ist laufzeitabhängig. Die Model-Card besagt, dass nur 16 von 64 Schichten einen Cache behalten, aber das hilft nur, wenn die Serving-Engine die Gated-DeltaNet-Schichten tatsächlich implementiert. vLLM 0.17+ ist die Version, die das tut; deshalb ist der Versions-Pin das Erste in diesem Artikel und nicht eine Fußnote.
• MTP ist eingebaut, wird hier aber nicht gemessen. Der Draft-Head befindet sich im Checkpoint, und vLLM dokumentiert das Flag, aber niemand hat bisher eine unabhängige Beschleunigungszahl für dieses 27B auf vLLM veröffentlicht. Planen Sie, es an Ihrem eigenen Traffic zu messen.
• NVIDIA ist der erprobte Weg. Das Rezept von vLLM ist für NVIDIA-GPUs geschrieben (NVFP4 und FP8). Der Einsatz dieses Hybrid-Attention-Modells auf AMD Instinct oder Intel Gaudi ist nach wie vor Neuland, und dieser Artikel tut nicht so, als wäre es anders.
Bedienen Sie es selbst oder mieten Sie die Token
Hier übernimmt Apache 2.0 die Arbeit. Es gibt keine Lizenzgebühr pro Token für Qwen3.8 27B, also ist die einzige echte Frage, ob Sie die Hardware besitzen oder die Tokens mieten.
• Self-Hosting (dieser Artikel) — Sie zahlen einmal für die GPU, und jedes Token danach ist kostenlos. Eine RTX 5090, die Sie bereits besitzen, macht den NVFP4-Befehl zu einem Endpunkt mit null Grenzkosten, ohne dass Daten das Gerät verlassen. Wenn Sie die GPU mieten müssen, sind eine Cloud-5090 oder ein Paar A6000s der Kostenpunkt, und das ganze Argument trägt nur, wenn Sie die Karte bereits haben oder das anhaltende Volumen vorweisen können.
• Tokens mieten — da die Gewichte offen sind, läuft es auf mehreren Hosts, und die Preisuntergrenze sind die Hardwarekosten. Qwen3.8 27B ist heute auf OrcaRouter live, zu 0,33 $ pro Million Input-Tokens und 2,40 $ pro Million Output — ohne Händleraufschlag, da OrcaRouter die offenen Gewichte auf eigener Infrastruktur betreibt — und dieselben offenen Gewichte finanzieren eine limitierte kostenlose Stufe, die 0 $ pro Anfrage verlangt und HTTP 429 zurückgibt, sobald das Limit überschritten ist. Ein repräsentativer Monat mit 10 Millionen Tokens und 70 % Input kostet etwa 9,51 $ in der kostenpflichtigen Stufe.
• Die Entscheidungsregel — wenn du die GPU bereits besitzt, hoste selbst. Wenn du eine kaufen oder mieten müsstest, amortisiert sich die API bei Nebenprojekt-Volumen schnell, und derselbe OpenAI-kompatible Client zeigt auf beide Endpunkte, sodass sich der Code nicht ändert, wenn du wechselst.

Wenn vLLM die falsche Antwort ist
• Du bist eine einzelne Person an einem Laptop — vLLM ist eine Serving-Engine, keine Desktop-Anwendung. Für eine lokale Einzelnutzung ist llama.cpp oder Ollama mit einem Q4-GGUF-Modell einfacher und benötigt eine 24-GB-Grafikkarte, keine Blackwell-GPU; unser Leitfaden how-to-run-Qwen3.8-27B-locally geht diesen Weg von Anfang bis Ende durch.
• Sie benötigen garantierten Durchsatz ohne Betriebsaufwand — Selbsthosting bedeutet, dass Sie Paging, Queueing und Failover selbst übernehmen. Wenn „Die API ist down“ kein Satz sein soll, den Sie in Ihrem Wortschatz haben möchten, mieten Sie stattdessen die Tokens und lassen Sie jemand anderen die Flotte betreiben.
• Man braucht wirklich den vollen ~1M Kontext in Spitzenqualität — das ist die Aufgabe des Qwen3.8 2.4T-A95B, der mit vLLM oder SGLang über ein 72-GPU-GB300-NVL72-Rack bereitgestellt wird. Qwen3.8 27B wird auf ein oder zwei GPUs nicht mithalten können; unser Serving-Artikel zur 2.4T erklärt, warum dieses Modell eine andere Problemklasse darstellt.
• Du bist auf einer älteren 24-GB-Karte — NVFP4 ist ein Blackwell-Format; auf Ampere- (RTX 3090) oder Ada-Karten (RTX 4090) mit 24 GB ist der FP8-Pfad die vLLM-Option, und darüber hinaus ist eine GGUF-Quantisierung unter llama.cpp der pragmatische Endpunkt. Dasselbe Modell auf einer 24-GB-Karte ist eine andere Geschichte.
• Sie müssen maximale Nebenläufigkeit auf einer einzelnen Karte bedienen – die oben genannten Single-GPU-Standardwerte sind der Ausgangspunkt, nicht die Produktionsform. Passen Sie --max-num-seqs, den KV-Cache und die MTP-Konfiguration an Ihren eigenen Request-Mix an, bevor Sie es als abgeschlossen betrachten.
Fazit
Qwen3.8 27B ist das seltene, dichte 27B-Modell, das vLLM in Produktion auf einer einzelnen GPU ausführt. Aktualisieren Sie auf vLLM 0.17.0+, ziehen Sie das NVFP4-Quant für eine 32-GB-Blackwell-Karte mit 24,6 GiB, das FP8-Quant für eine 48-GB-Karte oder zwei im Tensor-Parallelbetrieb, und reservieren Sie BF16 für eine 80-GB-GPU. Die Befehle sind Einzeiler, der Endpunkt ist OpenAI-kompatibel, und da die Gewichte unter Apache 2.0 lizenziert sind, können Sie es selbst betreiben oder für 0,33 $/2,40 $ pro Million Tokens mit einer kostenlosen Stufe mieten – derselbe Client-Code in beiden Fällen. Das Einzige, was noch niemand hat, ist eine unabhängige Durchsatzzahl für die 27B auf vLLM, also planen Sie nach dem Booten eine Benchmarking-Stunde ein, bevor Sie jemandem eine Latenzzahl versprechen.
