
ข้อกำหนด VRAM ของ Qwen3.8-27B: คุณต้องใช้ฮาร์ดแวร์เท่าไรกันแน่
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 931 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 192 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1177 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 70 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
ตัวเลขประมาณ 17 GB VRAM คือตัวเลขที่ถูกกล่าวถึงสำหรับ Qwen3.8-27B — Daniel Han จาก Unsloth กล่าวว่ามัน "ควรจะพอดีกับ VRAM ประมาณ 17GB เมื่อเปิดตัว" — และเราควรจะเจาะจงให้ชัดเจนว่าตัวเลขนี้คืออะไรและไม่ใช่อะไร มันเป็นการคาดการณ์โดยอิงจากรุ่นก่อนหน้าของ 27B ไม่ใช่สเปกจาก Alibaba เพราะโมเดลยังไม่ได้เปิดตัวจริง; คลังเก็บอย่างเป็นทางการถูกสัญญาว่าจะปล่อยในสัปดาห์ของวันที่ 10 สิงหาคม 2026 และยังไม่ปรากฏในเวลาที่เขียนบทความนี้ บทความนี้แบ่งคำถามเรื่อง VRAM ออกเป็นสิ่งที่คุณสามารถวางแผนได้ สิ่งที่ไม่แน่นอนอย่างแท้จริง และวิธีที่ตัวเลขเปลี่ยนแปลงไปตาม quantization, context window, และ runtime ของคุณ
คำตอบที่ตรงไปตรงมามาก่อน
ยังไม่มีสเปกฮาร์ดแวร์อย่างเป็นทางการสำหรับ Qwen3.8-27B ทุกอย่างด้านล่างเป็นการคาดการณ์จาก Qwen3.6-27B ซึ่งเป็นโมเดลที่รุ่น 27B ต่อยอดมา — จำนวนพารามิเตอร์เท่ากัน สถาปัตยกรรมไฮบริดที่น่าจะเหมือนกัน และเป็นสิ่งที่ใกล้เคียงที่สุดที่ใช้เป็นข้อมูลอ้างอิงสำหรับขนาด ให้ถือว่าตัวเลขเหล่านี้เป็นกรอบสำหรับวางแผน ไม่ใช่เอกสารข้อกำหนด การวัดค่าจริงชุดแรกจะมาจากผู้พัฒนาควอนไทเซอร์และผู้ดูแลเฟรมเวิร์กสำหรับอินเฟอเรนซ์ภายในไม่กี่วันหลังปล่อยน้ำหนักโมเดล และตัวเลขเหล่านั้นคือสิ่งที่คุณควรใช้ตัดสินใจก่อนสั่งซื้อ
บันไดควอนต์
จำนวน VRAM ที่คุณต้องการขึ้นอยู่กับ quantization ที่คุณใช้เป็นหลักเกือบทั้งหมด โดยเริ่มจากตาราง Qwen3.6-27B ที่ชุมชนวัดไว้:
• Q4_K_M — ใช้ VRAM ประมาณ 16 GB เป็นจุดลงตัวของการ์ด 24 GB และน่าจะเป็นที่มาของตัวเลข "17 GB" ที่ว่านี้ ถือเป็นค่าเริ่มต้นของทีมส่วนใหญ่
• Q3_K_M / IQ3 — ประมาณ 13 GB VRAM รองรับการ์ด 16 GB และแม้แต่ 12 GB แต่คุณภาพลดลงอย่างเห็นได้ชัด
• Q6_K — {{1}}ใช้ VRAM ประมาณ 21 GB{{/1}}. {{2}}แทบไม่สูญเสียคุณภาพ{{/2}} และพอดีกับการ์ด 24 GB อย่างแท้จริงแต่ก็กระชับพอตัว
• Q8_0 — VRAM ประมาณ 27–30 GB สำหรับการ์ด 48 GB ที่ต้องการคุณภาพที่ดีที่สุดเท่าที่จะได้
• การให้บริการ FP8 — ใช้ VRAM ประมาณ 27 GB สำหรับน้ำหนักโมเดล ซึ่งเป็นเหตุผลที่ L40S หนึ่งตัวจึงเป็นตัวเลือก GPU ที่นิยมสำหรับการทำ inference
• ความแม่นยำเต็ม (BF16) — ประมาณ 54 GB VRAM ตามความเป็นจริงต้องใช้การ์ดระดับ H100 และเป็นจุดที่ผู้คนเริ่มหยุดเรียกมันว่า "local"
สรุปสั้นๆ: GPU ขนาด 24 GB คือตัวเลือกที่ซื้อมาใช้ได้อย่างปลอดภัยสำหรับโมเดลนี้ การ์ด 16 GB จะรันได้ก็ต่อเมื่อยอมรับควอนต์ต่ำ และการ์ด 8 GB หรือน้อยกว่านั้นหมดสิทธิ์ เว้นแต่โมเดลจะออกมาเบากว่ารุ่นก่อนหน้าอย่างเห็นได้ชัด

ตัวแปรที่ไม่มีใครอ้างถึง: ความยาวบริบท
ตัวเลขทุกตัวด้านบนเป็นสำหรับบริบทที่พอประมาณ VRAM จะปรับตามบริบทเนื่องจาก KV cache ต้องอยู่ร่วมกับน้ำหนัก (weights) บน Qwen3.6-27B บริบท 2K ใช้ประมาณ 11 GB บริบท 32K ทำให้ quant เดิมเกิน 14 GB และ 128K ทำให้พื้นที่ cache เพิ่มขึ้นมากกว่าสองเท่า หาก Qwen3.8-27B ยังคงมีหน้าต่างบริบทดั้งเดิมที่ใหญ่ — และเจเนอเรชันของ Qwen ก็มีแนวโน้มไปในทางนั้น — ให้วางแผนพื้นที่เผื่อสองสาม GB เหนือขนาด quant หรือจำกัดบริบทในคอนฟิกของ runtime การเลือกความยาวบริบทที่คุณไม่ได้ใช้จริงเป็นวิธีที่พบได้บ่อยที่สุดที่ทีมต้องซื้อการ์ดที่ใหญ่เกินความจำเป็น
ตัวแปรที่ไม่แน่นอนของสถาปัตยกรรมแบบไฮบริด
Qwen3.6-27B เป็นโมเดลไฮบริด: มีเพียง 16 จาก 65 เลเยอร์ที่ใช้แคช KV แบบดั้งเดิม ขณะที่ 48 เลเยอร์ใช้สถานะแบบเวียนเกิดคงที่ ผลลัพธ์คือใช้หน่วยความจำ KV น้อยกว่าโมเดลแบบหนาแน่นที่มีขนาดเท่ากันประมาณสี่เท่า ซึ่งเป็นส่วนสำคัญที่ทำให้โมเดล 27B ให้ความรู้สึกเหมือนโมเดลที่รันบนการ์ด 24 GB มากกว่าการ์ด 48 GB หาก Qwen3.8-27B ยังคงดีไซน์แบบไฮบริด (เป็นไปได้ แต่ยังไม่ได้รับการยืนยัน) คณิตศาสตร์เรื่องความยาวคอนเทกซ์ข้างต้นจะเป็นมิตรกว่าที่เห็น ข้อติดขัดคือการรองรับของรันไทม์: บิลด์ของ llama.cpp หรือ vLLM ที่ไม่ใช้เลเยอร์แบบเวียนเกิดจะรายงานการใช้หน่วยความจำที่สูงกว่ามาก ตรวจสอบว่ารันไทม์ใดรองรับการรวมโค้ดแล้ว ก่อนที่จะสมมติว่าการคาดการณ์ยังคงใช้ได้
GPU ตัวไหนที่ใช้งานได้จริง
อย่างเป็นรูปธรรม สำหรับการ์ดทั่วไป:
• RTX 4090 / 3090 / 5090 (24 GB) — รัน Q4_K_M ได้สบายๆ ส่วน Q6_K ก็ได้ถ้ายอมบีบให้พอดี นี่คือกลุ่มเป้าหมาย
• RTX 3060 / 4060 Ti 16 GB — รองรับเฉพาะควอนต์ระดับ IQ4 หรือ Q3 เท่านั้น พร้อมคอนเท็กซ์ขนาดพอประมาณ ใช้งานได้ แต่ไม่น่าพอใจ
• การ์ด 12 GB — Q3_K_M ที่คุณภาพลดลง เหมาะสำหรับการทดลอง แต่ไม่เหมาะสำหรับการให้บริการ
• Apple Silicon — Mac ขนาด 24 GB รันไฟล์ Q4 ชุดเดียวกันผ่าน MLX หรือ llama.cpp; แต่รุ่นพื้นฐาน 16 GB จะทำให้เกิด swap-thrash และแทบจะใช้งานไม่ได้จริง เช่นเดียวกับกรณีของ Qwen3.6-27B
• 48 GB ขึ้นไป (A6000, L40S, การตั้งค่าการ์ดคู่) — Q8_0 หรือ FP8 สำหรับการให้บริการพร้อมเฮดรูมจริง

หรือข้าม GPU ไปเลย
ถ้าการคำนวณฮาร์ดแวร์ไม่ลงตัวสำหรับคุณ โมเดลก็ไม่จำเป็นต้องรันบนฮาร์ดแวร์ของคุณ OrcaRouter เป็น API เดียวที่ครอบคลุมโมเดลมากกว่า 200 รายการ — รวมถึงตระกูล Qwen ด้วย — และส่งผ่านราคารายการของผู้ให้บริการโดยไม่บวกมาร์กอัป ดังนั้น Qwen3.8-Max ในตอนนี้จึงมีค่าใช้จ่าย $2.00 ต่อล้านอินพุตโทเคน และ $6.00 ต่อล้านเอาต์พุตโทเคน ซึ่งเท่ากับราคาบนหน้าราคาของผู้จำหน่ายเอง โมเดล 27B เองจะเป็นโมเดลที่รันในเครื่อง แต่เมื่อมีการปล่อยน้ำหนักของโมเดลและโมเดลได้รับความไว้วางใจ คีย์เดียวกันก็จะถูกส่งต่อไปยังผู้ให้บริการรายใดก็ตามที่โฮสต์โมเดลนี้ — คุณสามารถเริ่มพัฒนาโดยใช้เจนเนอเรชันนี้ได้เลย โดยไม่ต้องไปยุ่งกับตลาดขายต่อ GPU เลย

สำหรับคำถามเรื่องฮาร์ดแวร์ สรุปคือ: วางแผนไว้ที่ 16 GB สำหรับการรันแบบ 4-bit ที่สบายๆ, 24 GB เพื่อความปลอดภัยและเผื่อพื้นที่สำหรับ context และ quant ที่สูงขึ้น และให้ถือว่าตัวเลขทุกตัวที่นี่เป็นเพียงการประมาณจนกว่า repository จะเผยแพร่และมีการวัดจริงครั้งแรกออกมา การคาดการณ์ที่ "17 GB" เป็นตัวเลขที่สมเหตุสมผลสำหรับการวางแผน — แต่ยังไม่ใช่ข้อเท็จจริง
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
