
Qwen3.8-27B GGUF: ควรดาวน์โหลด Quant แบบใดสำหรับ GPU ของคุณ
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
ดาวน์โหลดแพ็ก unsloth/Qwen3.8-27B-GGUF และจับคู่ไฟล์กับการ์ดที่คุณมีจริง นั่นคือคำตอบทั้งหมด: GPU 24GB (RTX 4090 หรือ 3090) ควรเลือก Q4_K_M ที่ 17.1GB; GPU 16GB ควรเลือก IQ4_XS ที่ 15.7GB (หรือ Q3_K_M ที่ 13.8GB ถ้าต้องการพื้นที่บริบทเพิ่มเติม); GPU 12GB จำกัดเฉพาะไฟล์ 2-bit, UD-IQ2_XXS ที่ 9.0GB, และนั่นคือการประนีประนอมที่คุณควรยอมรับอย่างรู้เท่าทัน Qwen3.8 27B — โมเดลหนาแน่น 27 พันล้านพารามิเตอร์ของ Alibaba, น้ำหนักภายใต้สัญญาอนุญาต Apache 2.0 เผยแพร่เมื่อวันที่ 13–14 สิงหาคม 2026 — รันในเครื่องได้ด้วยต้นทุนต่ำผิดปกติ เพราะแอตเทนชันแบบไฮบริดแคชเพียง 16 จาก 64 เลเยอร์ ดังนั้นควอนไทซ์ 4-bit บน GPU 24GB จึงรองรับบริบท 32K–64K โทเคนได้อย่างสบาย และ GGUF เป็นเส้นทางเดียวที่ต้นทุนส่วนเพิ่มเป็นศูนย์: ไม่ต้องใช้ API key, ไม่มีค่าใช้จ่ายต่อโทเคน, ไม่มีข้อมูลออกจากเครื่องของคุณ.
เกี่ยวกับแหล่งข้อมูล: สถาปัตยกรรม หน้าต่างบริบท และใบอนุญาตเป็นข้อมูลทางการ จากโมเดลการ์ดของ Qwen3.8 27B บน Hugging Face ตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026 ขนาดไฟล์ GGUF มาจากคลังเก็บ GGUF ของ unsloth และ ggml-org ในวันเดียวกัน คำแนะนำ VRAM ต่อ GPU เป็นคำแนะนำอย่างเป็นทางการของ unsloth การประมาณค่าไบต์ของ KV-cache และตัวเลข tokens-per-second วัดโดยชุมชนในช่วงวันแรกหลังการเปิดตัว ไม่ใช่สเปกจากผู้ผลิต เกณฑ์มาตรฐานทุกอันที่ระบุด้านล่างนี้รายงานโดย Alibaba และยังไม่มีการทำซ้ำเพื่อยืนยัน
ตัวเลือกไฟล์ หนึ่งบรรทัดต่อ quant
• UD-IQ2_XXS — 9.0GB — เป็นตัวเลือกเดียวที่พอดีสำหรับการ์ด 12GB คาดว่าจะสูญเสียคุณภาพอย่างเห็นได้ชัด
• UD-Q2_K_XL — 10.7GB — การ์ด 12GB แทบไม่เหลือคอนเท็กซ์ให้ใช้งานเลย
• Q3_K_M — 13.8GB — การ์ด 16GB ที่ต้องการพื้นที่เหลือสำหรับ context.
• IQ4_XS — 15.7GB — การ์ด 16GB: ควอนต์ที่ใหญ่ที่สุดที่พอดีทั้งชุด
• Q4_K_M — 17.1GB — การ์ดจอ 24GB: จุดที่ลงตัว และไฟล์ที่บทความนี้แนะนำให้คุณใช้
• Q5_K_M — 19.8GB — 24GB โดยแลกพื้นที่บริบทกับคุณภาพที่ดีขึ้นเล็กน้อย
• Q6_K — 22.9GB — พอดีกับ 24GB ถ้าบีบหน่อย; แทบไม่สูญเสีย
• Q8_0 — 29.0GB — 32GB, การแยกบนการ์ดสองใบ หรือการออฟโหลดไปยัง CPU.
• BF16 — 54.7GB — สำหรับการ์ดเซิร์ฟเวอร์และระบบ CPU ที่มี RAM สูง ให้ความแม่นยำระดับอ้างอิง
สองแพ็ค สองขนาด Q4_K_M: ของ unsloth คือ 17.1GB; ของ ggml-org คือ 19.0GB แพ็คของ unsloth ใช้ quantization แบบ Dynamic V3.0 (preview) สำหรับไฟล์ UD-* และเป็นแพ็คที่แอปท้องถิ่นส่วนใหญ่ใช้เป็นค่าเริ่มต้น; แพ็คของ ggml-org มาพร้อม K-quants มาตรฐาน รวมถึง head การทำ multi-token-prediction แยกต่างหากที่ใช้สำหรับ speculative decoding Q4_K_M ตัวไหนก็ใช้ได้ — ความต่างคือขนาดไม่กี่ร้อยเมกะไบต์กับไฟล์ MTP

ทำไม 27B นี้ถึงพอดีกับการ์ดที่เล็กกว่าส่วนใหญ่
Qwen3.8 27B มี 64 ชั้น แต่มีเพียง 16 ชั้นที่ใช้ full attention (การสนใจแบบเต็ม) อีก 48 ชั้นใช้ Gated DeltaNet linear attention ซึ่งเก็บสถานะ recurrent ขนาดคงที่ แทนที่จะเป็น cache ของ key-value ที่เพิ่มขึ้นเรื่อย ๆ รูปแบบบล็อกใน model card เองคือ 3×(Gated DeltaNet → FFN) ต่อ 1×(Gated Attention → FFN) — อัตราส่วนไฮบริด 3:1 ผลในทางปฏิบัติ: KV cache มีขนาดประมาณหนึ่งในสี่ของที่โมเดล dense ขนาด 27B ทั่วไปต้องใช้สำหรับ context เดียวกัน การวัดจากชุมชนในสัปดาห์นี้ระบุว่า cache อยู่ที่ประมาณ 0.5GB ที่ context 8K, 2.0GB ที่ 32K และ 16.4GB ที่หน้าต่าง native เต็ม 262K นั่นกลับคำแนะนำทั่วไป — งบ VRAM ส่วนใหญ่ไปที่น้ำหนัก (weights) ไม่ใช่ context และการ์ด 24GB สามารถรัน Q4_K_M กับ context 64K–96K ได้โดยไม่ต้องกังวล คุณสามารถลดขนาด cache ลงได้อีกด้วยแฟล็ก --cache-type-k ของ llama.cpp ซึ่งทำการ quantize ตัว cache เอง

กับดักสามอย่างที่จะทำให้คุณพลาดท่าในวันแรก
• llama.cpp บิลด์เก่าปฏิเสธไฟล์นี้ GGUF ลงทะเบียนสถาปัตยกรรม qwen35 ใหม่ คุณจึงต้องใช้บิลด์ปัจจุบัน — ทุกอย่างที่มาจากก่อนสัปดาห์ที่เผยแพร่จะปฏิเสธไม่โหลดไฟล์พร้อมข้อผิดพลาดด้านสถาปัตยกรรม อัปเดต llama.cpp ก่อน แล้วค่อยดาวน์โหลด
• กับดักเทมเพลต. เทมเพลตแชท Jinja อย่างเป็นทางการจะครอบทุกเทิร์นของแอสซิสแตนต์ด้วยบล็อก think แม้ว่าเทรซการให้เหตุผลจะว่างเปล่า ซึ่งทำให้เกิดบล็อกซ้อนกันและประวัติถูกตัดทอนในแชทหลายเทิร์น — ดูเหมือนว่าโมเดลลืมสิ่งที่คุณพูด เรียกใช้ llama.cpp ด้วย --jinja และควรเลือกแพ็กที่มาพร้อมกับ chat_template.jinja ที่แก้ไขแล้ว
• Vision จำเป็นต้องใช้ไฟล์แยกต่างหากข้อความใช้งานได้ทันที รูปภาพและวิดีโอจะไม่ทำงานใดๆ อย่างเงียบๆ เว้นแต่คุณจะโหลด mmproj projector ซึ่งมีขนาดประมาณ 0.9GB ด้วย ไฟล์นี้ไม่ได้อยู่ในรายการบนหน้า GGUF repo ของ unsloth — ให้ไปดาวน์โหลดจาก base repository หรือ ggml-org pack หากคุณวางแผนที่จะป้อนเอกสารหรือภาพหน้าจอ ให้เพิ่ม --mmproj ต่อท้ายคำสั่งเซิร์ฟเวอร์
รันมัน: คำสั่ง
llama.cpp, เมื่อคุณมี build ปัจจุบัน:
llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0
...และเพิ่ม --mmproj Qwen3.8-27B-mmproj-bf16.gguf หากคุณต้องการใช้ระบบประมวลผลภาพ
Ollama หากคุณต้องการรายการไลบรารี: ให้ใช้คำสั่ง ollama pull qwen3.8:27b จากนั้น ollama run qwen3.8:27b. LM Studio และ Unsloth Desktop จะตรวจจับเทมเพลตแชทและการออฟโหลด RAM ให้อัตโนมัติ — เป็นเส้นทางที่ยุ่งยากน้อยที่สุดสำหรับการรันครั้งแรก
Local กับ API: เศรษฐศาสตร์ที่ตรงไปตรงมา
GGUF คือทางเลือกฟรี: ต้นทุนส่วนเพิ่มเป็นศูนย์ ไม่มีข้อจำกัดเรื่องอัตราการใช้งาน ไม่มีอะไรออกจากเครื่องของคุณ แต่มันไม่ใช่ทางที่ถูกในแง่ต้นทุนรวม — คุณต้องจัดหา GPU ขนาด 24GB เอง (RTX 3090 มือสองหรือ RTX 4090 ใหม่ บวกค่าไฟ) และไฟล์ 2-bit บนการ์ด 12GB ก็ให้ประสบการณ์ที่ด้อยคุณภาพ
เส้นทาง API นี้มีอยู่เพราะน้ำหนัก (weights) เป็น Apache 2.0 ดังนั้นต้นทุนส่วนเพิ่มในการให้บริการจึงเกือบเป็นศูนย์ และใครก็สามารถโฮสต์ได้ Qwen3.8 27B เปิดใช้งานบน OrcaRouter แล้ววันนี้ในราคา $0.33 ต่อล้านโทเค็น input และ $2.40 ต่อล้าน output — ราคารายการของผู้ให้บริการส่งผ่านโดยไม่มีมาร์กอัป — และเนื่องจากน้ำหนักเป็นแบบเปิด ยังมีชั้นฟรีแบบจำกัดอัตราที่คิดเงิน $0 ต่อคำขอ และคืน HTTP 429 เมื่อคุณเกินขีดจำกัด เดือนตัวอย่างที่ใช้ 10 ล้านโทเค็น โดยเป็น input 70% จะอยู่ที่ประมาณ $9.51 บนชั้นแบบชำระเงิน หากคุณมี GPU อยู่แล้ว การรันในเครื่องชนะเรื่องต้นทุน หากไม่มี การเช่าโทเค็นดีกว่าซื้อการ์ดสำหรับโปรเจกต์รอง

เมื่อคำแนะนำนี้ไม่ถูกต้อง
Q4_K_M บน 24GB เป็นค่าเริ่มต้น ไม่ใช่คำตอบสากล เลือกอย่างอื่นเมื่อ:
• คุณต้องการคุณภาพสูงสุดบนเซิร์ฟเวอร์หรือเวิร์กสเตชัน — Q8_0 ที่ 29GB หรือ BF16 ที่ 54.7GB พร้อมออฟโหลดผ่าน CPU และ RAM ไม่ใช่ไฟล์ 4-bit
• คุณกำลังใช้การ์ด Blackwell RTX 50-series — เวอร์ชัน NVFP4 เร็วกว่าประมาณ 1.5 เท่าใน VRAM 24GB เท่าเดิม และใช้ FP8 KV cache เพื่อรองรับบริบทที่ยาวขึ้น บนการ์ด 5090 NVFP4 ชนะ GGUF ทุกรุ่นในโมเดลนี้
• คุณต้องใช้บริบท 262K เต็มรูปแบบ — ต้องเผื่อแคชประมาณ 16GB เพิ่มจากน้ำหนักโมเดล ซึ่งทำให้การ์ด 24GB ลดลงเหลือ Q3_K_M หรือบังคับให้ใช้ KV quantization.
• หากคุณพึ่งพาการถอดรหัสแบบคาดการณ์ล่วงหน้า — ให้เลือกแพ็ก ggml-org ซึ่งยังคงส่วนหัวการคาดการณ์หลายโทเค็นไว้; โมเดลควอนไทซ์บางตัวตัดส่วนนี้ทิ้งเพื่อประหยัดพื้นที่ประมาณ 0.5GB.
• คุณมีเพียง 12GB — คำตอบที่ตรงไปตรงมา: โมเดล 27B แบบ 2-bit นั้นแย่กว่าอย่างเห็นได้ชัดเมื่อเทียบกับโมเดลเดียวกันที่รันอย่างถูกต้อง ลองใช้ API ฟรีก่อนที่จะตัดสินใจติดตั้งแบบ 2-bit ในเครื่อง; ถ้ามันดีพอ GGUF ก็รอได้จนกว่าฮาร์ดแวร์จะตามทัน
บรรทัดล่าง
Qwen3.8 27B คือ 27B ที่หายากซึ่งใส่ในการ์ด 24GB ได้พอดีโดยไม่ต้องประนีประนอม: ดาวน์โหลด Q4_K_M ขนาด 17.1GB, ใช้ llama.cpp บิลด์ปัจจุบัน และ KV cache ที่ถูกพอจนคอนเท็กซ์ยาวแทบไม่มีค่าใช้จ่าย หากคุณมีฮาร์ดแวร์ ก็ดาวน์โหลดไฟล์นั้นมาใช้ อย่าลืมว่า vision ต้องใช้ mmproj แยกต่างหาก และเตรียมพบกับกับดักเทมเพลตในครั้งแรกที่บทสนทนาหลายเทิร์นดูเหมือนขี้ลืม หากคุณไม่มีฮาร์ดแวร์ โมเดลเดียวกันนี้มี API ราคา $0.33/$2.40 พร้อมระดับฟรีที่จำกัดอัตราการใช้งาน จึงไม่มีเหตุผลใดที่จะรันไฟล์ 2-bit ที่คุณไม่พอใจ GGUF คือเส้นทางฟรี แต่มันไม่ใช่เส้นทางเดียวอีกต่อไป
