
ข้อกำหนด VRAM ของ Qwen3.8-27B: คุณต้องใช้ฮาร์ดแวร์เท่าไรกันแน่
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 2382 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
ตัวเลขประมาณ 17 GB VRAM คือตัวเลขที่ถูกกล่าวถึงสำหรับ Qwen3.8-27B — Daniel Han จาก Unsloth กล่าวว่ามัน "ควรจะพอดีกับ VRAM ประมาณ 17GB เมื่อเปิดตัว" — และเราควรจะเจาะจงให้ชัดเจนว่าตัวเลขนี้คืออะไรและไม่ใช่อะไร มันเป็นการคาดการณ์โดยอิงจากรุ่นก่อนหน้าของ 27B ไม่ใช่สเปกจาก Alibaba เพราะโมเดลยังไม่ได้เปิดตัวจริง; คลังเก็บอย่างเป็นทางการถูกสัญญาว่าจะปล่อยในสัปดาห์ของวันที่ 10 สิงหาคม 2026 และยังไม่ปรากฏในเวลาที่เขียนบทความนี้ บทความนี้แบ่งคำถามเรื่อง VRAM ออกเป็นสิ่งที่คุณสามารถวางแผนได้ สิ่งที่ไม่แน่นอนอย่างแท้จริง และวิธีที่ตัวเลขเปลี่ยนแปลงไปตาม quantization, context window, และ runtime ของคุณ
คำตอบที่ตรงไปตรงมามาก่อน
ยังไม่มีสเปกฮาร์ดแวร์อย่างเป็นทางการสำหรับ Qwen3.8-27B ทุกอย่างด้านล่างเป็นการคาดการณ์จาก Qwen3.6-27B ซึ่งเป็นโมเดลที่รุ่น 27B ต่อยอดมา — จำนวนพารามิเตอร์เท่ากัน สถาปัตยกรรมไฮบริดที่น่าจะเหมือนกัน และเป็นสิ่งที่ใกล้เคียงที่สุดที่ใช้เป็นข้อมูลอ้างอิงสำหรับขนาด ให้ถือว่าตัวเลขเหล่านี้เป็นกรอบสำหรับวางแผน ไม่ใช่เอกสารข้อกำหนด การวัดค่าจริงชุดแรกจะมาจากผู้พัฒนาควอนไทเซอร์และผู้ดูแลเฟรมเวิร์กสำหรับอินเฟอเรนซ์ภายในไม่กี่วันหลังปล่อยน้ำหนักโมเดล และตัวเลขเหล่านั้นคือสิ่งที่คุณควรใช้ตัดสินใจก่อนสั่งซื้อ
บันไดควอนต์
จำนวน VRAM ที่คุณต้องการขึ้นอยู่กับ quantization ที่คุณใช้เป็นหลักเกือบทั้งหมด โดยเริ่มจากตาราง Qwen3.6-27B ที่ชุมชนวัดไว้:
• Q4_K_M — ใช้ VRAM ประมาณ 16 GB เป็นจุดลงตัวของการ์ด 24 GB และน่าจะเป็นที่มาของตัวเลข "17 GB" ที่ว่านี้ ถือเป็นค่าเริ่มต้นของทีมส่วนใหญ่
• Q3_K_M / IQ3 — ประมาณ 13 GB VRAM รองรับการ์ด 16 GB และแม้แต่ 12 GB แต่คุณภาพลดลงอย่างเห็นได้ชัด
• Q6_K — {{1}}ใช้ VRAM ประมาณ 21 GB{{/1}}. {{2}}แทบไม่สูญเสียคุณภาพ{{/2}} และพอดีกับการ์ด 24 GB อย่างแท้จริงแต่ก็กระชับพอตัว
• Q8_0 — VRAM ประมาณ 27–30 GB สำหรับการ์ด 48 GB ที่ต้องการคุณภาพที่ดีที่สุดเท่าที่จะได้
• การให้บริการ FP8 — ใช้ VRAM ประมาณ 27 GB สำหรับน้ำหนักโมเดล ซึ่งเป็นเหตุผลที่ L40S หนึ่งตัวจึงเป็นตัวเลือก GPU ที่นิยมสำหรับการทำ inference
• ความแม่นยำเต็ม (BF16) — ประมาณ 54 GB VRAM ตามความเป็นจริงต้องใช้การ์ดระดับ H100 และเป็นจุดที่ผู้คนเริ่มหยุดเรียกมันว่า "local"
สรุปสั้นๆ: GPU ขนาด 24 GB คือตัวเลือกที่ซื้อมาใช้ได้อย่างปลอดภัยสำหรับโมเดลนี้ การ์ด 16 GB จะรันได้ก็ต่อเมื่อยอมรับควอนต์ต่ำ และการ์ด 8 GB หรือน้อยกว่านั้นหมดสิทธิ์ เว้นแต่โมเดลจะออกมาเบากว่ารุ่นก่อนหน้าอย่างเห็นได้ชัด

ตัวแปรที่ไม่มีใครอ้างถึง: ความยาวบริบท
ตัวเลขทุกตัวด้านบนเป็นสำหรับบริบทที่พอประมาณ VRAM จะปรับตามบริบทเนื่องจาก KV cache ต้องอยู่ร่วมกับน้ำหนัก (weights) บน Qwen3.6-27B บริบท 2K ใช้ประมาณ 11 GB บริบท 32K ทำให้ quant เดิมเกิน 14 GB และ 128K ทำให้พื้นที่ cache เพิ่มขึ้นมากกว่าสองเท่า หาก Qwen3.8-27B ยังคงมีหน้าต่างบริบทดั้งเดิมที่ใหญ่ — และเจเนอเรชันของ Qwen ก็มีแนวโน้มไปในทางนั้น — ให้วางแผนพื้นที่เผื่อสองสาม GB เหนือขนาด quant หรือจำกัดบริบทในคอนฟิกของ runtime การเลือกความยาวบริบทที่คุณไม่ได้ใช้จริงเป็นวิธีที่พบได้บ่อยที่สุดที่ทีมต้องซื้อการ์ดที่ใหญ่เกินความจำเป็น
ตัวแปรที่ไม่แน่นอนของสถาปัตยกรรมแบบไฮบริด
Qwen3.6-27B เป็นโมเดลไฮบริด: มีเพียง 16 จาก 65 เลเยอร์ที่ใช้แคช KV แบบดั้งเดิม ขณะที่ 48 เลเยอร์ใช้สถานะแบบเวียนเกิดคงที่ ผลลัพธ์คือใช้หน่วยความจำ KV น้อยกว่าโมเดลแบบหนาแน่นที่มีขนาดเท่ากันประมาณสี่เท่า ซึ่งเป็นส่วนสำคัญที่ทำให้โมเดล 27B ให้ความรู้สึกเหมือนโมเดลที่รันบนการ์ด 24 GB มากกว่าการ์ด 48 GB หาก Qwen3.8-27B ยังคงดีไซน์แบบไฮบริด (เป็นไปได้ แต่ยังไม่ได้รับการยืนยัน) คณิตศาสตร์เรื่องความยาวคอนเทกซ์ข้างต้นจะเป็นมิตรกว่าที่เห็น ข้อติดขัดคือการรองรับของรันไทม์: บิลด์ของ llama.cpp หรือ vLLM ที่ไม่ใช้เลเยอร์แบบเวียนเกิดจะรายงานการใช้หน่วยความจำที่สูงกว่ามาก ตรวจสอบว่ารันไทม์ใดรองรับการรวมโค้ดแล้ว ก่อนที่จะสมมติว่าการคาดการณ์ยังคงใช้ได้
GPU ตัวไหนที่ใช้งานได้จริง
อย่างเป็นรูปธรรม สำหรับการ์ดทั่วไป:
• RTX 4090 / 3090 / 5090 (24 GB) — รัน Q4_K_M ได้สบายๆ ส่วน Q6_K ก็ได้ถ้ายอมบีบให้พอดี นี่คือกลุ่มเป้าหมาย
• RTX 3060 / 4060 Ti 16 GB — รองรับเฉพาะควอนต์ระดับ IQ4 หรือ Q3 เท่านั้น พร้อมคอนเท็กซ์ขนาดพอประมาณ ใช้งานได้ แต่ไม่น่าพอใจ
• การ์ด 12 GB — Q3_K_M ที่คุณภาพลดลง เหมาะสำหรับการทดลอง แต่ไม่เหมาะสำหรับการให้บริการ
• Apple Silicon — Mac ขนาด 24 GB รันไฟล์ Q4 ชุดเดียวกันผ่าน MLX หรือ llama.cpp; แต่รุ่นพื้นฐาน 16 GB จะทำให้เกิด swap-thrash และแทบจะใช้งานไม่ได้จริง เช่นเดียวกับกรณีของ Qwen3.6-27B
• 48 GB ขึ้นไป (A6000, L40S, การตั้งค่าการ์ดคู่) — Q8_0 หรือ FP8 สำหรับการให้บริการพร้อมเฮดรูมจริง

หรือข้าม GPU ไปเลย
ถ้าการคำนวณฮาร์ดแวร์ไม่ลงตัวสำหรับคุณ โมเดลก็ไม่จำเป็นต้องรันบนฮาร์ดแวร์ของคุณ OrcaRouter เป็น API เดียวที่ครอบคลุมโมเดลมากกว่า 200 รายการ — รวมถึงตระกูล Qwen ด้วย — และส่งผ่านราคารายการของผู้ให้บริการโดยไม่บวกมาร์กอัป ดังนั้น Qwen3.8-Max ในตอนนี้จึงมีค่าใช้จ่าย $2.00 ต่อล้านอินพุตโทเคน และ $6.00 ต่อล้านเอาต์พุตโทเคน ซึ่งเท่ากับราคาบนหน้าราคาของผู้จำหน่ายเอง โมเดล 27B เองจะเป็นโมเดลที่รันในเครื่อง แต่เมื่อมีการปล่อยน้ำหนักของโมเดลและโมเดลได้รับความไว้วางใจ คีย์เดียวกันก็จะถูกส่งต่อไปยังผู้ให้บริการรายใดก็ตามที่โฮสต์โมเดลนี้ — คุณสามารถเริ่มพัฒนาโดยใช้เจนเนอเรชันนี้ได้เลย โดยไม่ต้องไปยุ่งกับตลาดขายต่อ GPU เลย

สำหรับคำถามเรื่องฮาร์ดแวร์ สรุปคือ: วางแผนไว้ที่ 16 GB สำหรับการรันแบบ 4-bit ที่สบายๆ, 24 GB เพื่อความปลอดภัยและเผื่อพื้นที่สำหรับ context และ quant ที่สูงขึ้น และให้ถือว่าตัวเลขทุกตัวที่นี่เป็นเพียงการประมาณจนกว่า repository จะเผยแพร่และมีการวัดจริงครั้งแรกออกมา การคาดการณ์ที่ "17 GB" เป็นตัวเลขที่สมเหตุสมผลสำหรับการวางแผน — แต่ยังไม่ใช่ข้อเท็จจริง
