
Qwen3.8-27B di vLLM: Menyajikannya dalam Produksi di Satu atau Dua GPU
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1 juta token · 42 tok/s
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1326 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenBARUQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 3320 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
Ya — {{2}}Qwen3.8 27B berjalan dalam produksi di vLLM saat ini{{/2}}, {{3}}dan dalam sebagian besar kasus pada satu GPU{{/3}}. Versi yang berlaku adalah {{4}}vLLM 0.17.0 atau lebih baru{{/4}}: {{5}}versi ini menyertakan resep resmi{{/5}}, {{6}}kernel hybrid-attention yang dibutuhkan model ini{{/6}}, serta {{7}}endpoint /v1 yang kompatibel dengan OpenAI{{/7}}. {{8}}Untuk satu GPU Blackwell{{/8}}, {{9}}jalankan kuantisasi NVFP4{{/9}} — {{10}}resep vLLM sendiri mengukurnya pada 24,6 GiB VRAM dengan tensor-parallel size 1{{/10}}. {{11}}Untuk satu kartu 48GB{{/11}}, {{12}}jalankan FP8{{/12}}. {{13}}BF16 penuh{{/13}}, {{14}}checkpoint 51,7GB{{/14}}, {{15}}membutuhkan satu GPU 80GB atau dua kartu 48GB dalam tensor-parallel{{/15}}. {{16}}Perintah persisnya ada di bawah{{/16}}; {{17}}yang pertama adalah perintah satu baris{{/17}}.
Semua hal di sini diverifikasi pada 15 Agustus 2026, hari ketiga bobot tersebut dirilis. Arsitektur, konteks, dan lisensi berasal dari kartu model Qwen3.8 27B di Hugging Face; ukuran checkpoint adalah jumlah dari 18 shard safetensors pada repositori tersebut; perintah vLLM dan angka 24.6 GiB berasal dari halaman resep vLLM sendiri untuk model ini. Qwen3.8 27B adalah model multimodal dense 27 miliar parameter milik Alibaba — bobot berlisensi Apache 2.0, dirilis 13–14 Agustus — dan karena bobotnya terbuka, Anda dapat menjalankannya sendiri alih-alih menyewa token. Fork itulah yang sebenarnya dibahas dalam artikel ini.
Fakta-fakta yang penting, dengan sumber-sumbernya.
• Arsitektur — 27B padat (27,8B dengan menghitung menara visi dan kosakata dengan padding), 64 lapisan, ukuran tersembunyi 5.120, kosakata 248.320. Kartu model resmi, diverifikasi hari ini.
• Attention — hibrida: 16 lapisan full-attention, 48 lapisan linear Gated DeltaNet dalam pola blok 3:1. Hanya 16 lapisan yang menyimpan cache key-value yang terus bertambah; 48 lainnya menyimpan status berulang berukuran tetap sebagai gantinya.
• Konteks — 262.144 token secara native, dapat diperluas hingga sekitar 1M melalui penskalaan YaRN RoPE. Kartu model, diverifikasi hari ini.
• Masukan — teks, gambar, dan video native; keluaran teks. vLLM menyediakan ketiganya melalui API chat-completions standar, tanpa file proyektor terpisah.
• Lisensi — Apache 2.0. Fakta tunggal inilah yang menyebabkan pertanyaan "menjalankan sendiri vs menyewa token" ada sama sekali.
• Bobot — total checkpoint BF16 mencapai 51,7GB di 18 shard safetensors (Hugging Face, diverifikasi hari ini). Qwen juga menerbitkan checkpoint FP8 dan NVFP4 yang dibuat untuk vLLM.
• persyaratan vLLM — 0.17.0 atau lebih baru, dengan transformers ≥ 5.8.0. Halaman resep vLLM, diverifikasi hari ini. "VLLM apa pun" bukan instruksi yang aman; kernel lapisan berulang itulah yang ditambahkan oleh versi baru.
• Prediksi multi-token — kepala draf speculative-decoding disertakan di dalam checkpoint, sehingga Anda tidak memerlukan model draf terpisah. vLLM mendokumentasikan flag tersebut; belum ada angka percepatan independen.
Tangga GPU — quant mana di kartu mana
Tiga format penyajian mencakup rentang praktis. Pilih berdasarkan VRAM yang benar-benar Anda miliki, bukan berdasarkan "quant terbaik".
• NVFP4 — total 24.6 GiB (bobot ditambah cache KV FP8), sesuai resep vLLM pada TP1. Muat di satu GPU kelas Blackwell — dalam praktiknya, RTX 5090 32GB atau B200. Ini adalah jalur dengan latensi terendah dan yang menyimpan konteks terbanyak per kartu: resep vLLM melaporkan kapasitas 6.6M token KV bahkan pada ekstensi konteks 1M.
• FP8 — sekitar 26GB bobot. Satu kartu 48GB (L40S, RTX A6000, RTX 6000 Ada) mampu menjalankannya dengan ruang konteks yang memadai; dua kartu 48GB dalam tensor-parallel memberikan kelonggaran untuk konteks yang lebih panjang atau konkurensi yang lebih tinggi. Resep vLLM sendiri menjalankan FP8 pada TP4 di seluruh tray GB300 empat-GPU saat Anda menginginkan cache KV sebesar mungkin.
• BF16 — 51,7GB bobot, sehingga satu GPU 80GB (H100, A100 80GB, B200, GB300) atau dua kartu 48GB pada TP2. Ini adalah opsi presisi referensi, dan itulah yang digunakan oleh perintah ekstensi konteks 1M di bawah ini.
• MXFP4 — jangan gunakan pada NVIDIA. Jalur MXFP4 vLLM saat ini belum memiliki dukungan metode linear; bobot yang sama diterbitkan sebagai NVFP4, yang merupakan format yang sebenarnya digunakan oleh resep NVIDIA.

Jalankan itu — perintah vLLM
Default GPU tunggal dengan latensi rendah (NVFP4, satu GPU Blackwell), persis dari resep vLLM:
vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
Perintah FP8 dari resep yang sama (TP4, satu baki GB300, cache KV terbesar):
vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3
Untuk dua kartu 48GB, pertahankan perintah FP8 dan setel --tensor-parallel-size 2, bukan 4.
Tambahkan ini ke salah satu perintah untuk mengaktifkan MTP speculative decoding:
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
Ekstensi konteks 1M (juga dari resep vLLM):
vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

Point any OpenAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.
Apa yang dijanjikan dan tidak dijanjikan oleh halaman-halaman vLLM sendiri
• Belum ada angka throughput untuk 27B.Per tanggal 15 Agustus, halaman resep vLLM tidak memublikasikan tolok ukur throughput atau latensi untuk Qwen3.8 27B. Angka "4,000+ token per detik per GPU" yang beredar adalah milik Qwen3.8 2.4T-A95B pada rak GB300 NVL72 dengan 72 GPU, dilaporkan oleh vendor, dan bukan untuk model ini. Angka token per detik dari komunitas yang akan Anda lihat beredar untuk GGUF di bawah llama.cpp atau Ollama — runtime yang berbeda dan beban kerja yang berbeda dari serving vLLM.
• Klaim bahwa KV-cache murah bergantung pada runtime.Kartu model mengatakan hanya 16 dari 64 lapisan yang menyimpan cache, tetapi itu hanya membantu jika mesin penyajian benar-benar mengimplementasikan lapisan Gated DeltaNet. vLLM 0.17+ adalah versi yang melakukannya; itulah sebabnya pin versi adalah hal pertama dalam artikel ini, bukan catatan kaki.
• MTP sudah terpasang tetapi belum diukur di sini. Kepala draf ada di checkpoint dan vLLM mendokumentasikan flag tersebut, tetapi belum ada yang menerbitkan angka percepatan independen untuk 27B ini di vLLM. Rencanakan untuk mengukurnya pada lalu lintas Anda sendiri.
• NVIDIA adalah jalur yang teruji. Resep vLLM ditulis untuk GPU NVIDIA (NVFP4 dan FP8). Penerapan model attention hibrida ini di AMD Instinct atau Intel Gaudi masih sangat baru (bleeding-edge), dan artikel ini tidak berpura-pura sebaliknya.
Sajikan sendiri, atau sewa tokennya
Di sinilah Apache 2.0 melakukan tugasnya. Tidak ada biaya lisensi per-token untuk Qwen3.8 27B, jadi satu-satunya pertanyaan yang sebenarnya adalah apakah Anda memiliki perangkat kerasnya atau menyewa token.
• Self-host (artikel ini) — Anda membayar GPU sekali, dan setiap token setelahnya gratis. RTX 5090 yang sudah Anda miliki menjadikan perintah NVFP4 sebagai endpoint dengan biaya marjinal nol, tanpa ada data yang keluar dari mesin. Jika Anda harus menyewa GPU, 5090 cloud atau sepasang A6000 akan menjadi item biaya, dan argumen ini hanya berlaku jika Anda memang sudah memiliki kartu tersebut atau volume penggunaan yang berkelanjutan.
• Sewa tokennya — karena bobotnya terbuka, beberapa host menjalankannya, dan batas bawah harganya adalah biaya perangkat keras. Qwen3.8 27B tersedia hari ini di OrcaRouter dengan $0,33 per juta token input dan $2,40 per juta token output — tanpa markup vendor yang perlu diteruskan, karena OrcaRouter menjalankan bobot terbuka di infrastrukturnya sendiri — dan bobot terbuka yang sama mendanai tingkat gratis dengan batas laju, yang mengenakan $0 per permintaan dan mengembalikan HTTP 429 saat Anda melewati batasnya. Sebulan representatif dengan 10 juta token pada 70% input membutuhkan biaya sekitar $9,51 di tingkat berbayar.
• Aturan keputusannya — jika Anda sudah memiliki GPU, self-host. Jika Anda harus membeli atau menyewanya, API akan mencapai titik impas dengan cepat pada volume proyek sampingan, dan klien yang kompatibel dengan OpenAI yang sama menunjuk ke endpoint mana pun, sehingga kode tidak berubah saat Anda berpindah.

Ketika vLLM adalah jawaban yang salah
• Anda adalah satu orang di laptop — vLLM adalah mesin serving, bukan aplikasi desktop. Untuk penggunaan lokal satu pengguna, llama.cpp atau Ollama dengan Q4 GGUF lebih sederhana dan membutuhkan kartu 24GB, bukan GPU Blackwell; panduan how-to-run-Qwen3.8-27B-locally kami memandu proses tersebut dari awal hingga akhir.
• Anda membutuhkan throughput terjamin dengan nol operasi — hosting sendiri berarti paging, antrean, dan failover sepenuhnya menjadi tanggung jawab Anda. Jika "API-nya down" bukan kalimat yang ingin ada dalam kosakata Anda, sewalah tokennya dan biarkan orang lain yang menjalankan armadanya.
• Anda benar-benar membutuhkan konteks ~1M penuh dengan kualitas kelas frontier — itulah tugas Qwen3.8 2.4T-A95B, yang dilayani oleh vLLM atau SGLang di rak GB300 NVL72 dengan 72 GPU. Qwen3.8 27B pada satu atau dua GPU tidak akan mampu menandinginya; artikel penyajian kami tentang 2.4T menjelaskan mengapa model tersebut adalah kelas masalah yang berbeda.
• Anda menggunakan kartu 24GB yang lebih lama — NVFP4 adalah format Blackwell; pada kartu 24GB Ampere (RTX 3090) atau Ada (RTX 4090), jalur FP8 adalah opsi vLLM, dan di luarnya, kuantisasi GGUF di bawah llama.cpp adalah titik berhenti yang pragmatis. Model yang sama pada kartu 24GB adalah cerita yang berbeda.
• Anda harus melayani konkurensi maksimum pada satu kartu — default GPU tunggal di atas adalah titik awal, bukan bentuk produksi. Sesuaikan --max-num-seqs, cache KV, dan konfigurasi MTP dengan campuran permintaan Anda sendiri sebelum Anda menyebutnya selesai.
Intinya
Qwen3.8 27B adalah model padat 27B yang langka yang dilayani vLLM pada satu GPU dalam produksi. Perbarui ke vLLM 0.17.0+, tarik quant NVFP4 untuk kartu Blackwell 32GB pada 24.6 GiB, quant FP8 untuk satu kartu 48GB atau dua dalam tensor-parallel, dan cadangkan BF16 untuk GPU 80GB. Perintahnya satu baris, endpoint-nya kompatibel dengan OpenAI, dan karena bobotnya berlisensi Apache 2.0, Anda dapat menyajikannya sendiri atau menyewanya dengan harga $0.33/$2.40 per juta token dengan tingkat gratis — kode klien yang sama untuk keduanya. Satu hal yang belum dimiliki siapa pun adalah angka throughput independen untuk 27B di vLLM, jadi sediakan satu jam benchmarking setelah Anda menyalakannya sebelum menjanjikan angka latensi kepada siapa pun.
