การ์ดไตเติลฮีโร่ที่แสดงข้อความ Qwen3.8-27B GGUF พร้อมคำบรรยายว่า 'quant ที่เหมาะสมกับ GPU ของคุณ' ไอคอนดาวน์โหลด และชิปไฟล์สำหรับ Q4_K_M 17.1GB และ UD-IQ2 9.0GB
Guides & Insights

Qwen3.8-27B GGUF: ควรดาวน์โหลด Quant แบบใดสำหรับ GPU ของคุณ

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ดาวน์โหลดแพ็ก unsloth/Qwen3.8-27B-GGUF และจับคู่ไฟล์กับการ์ดที่คุณมีจริง นั่นคือคำตอบทั้งหมด: GPU 24GB (RTX 4090 หรือ 3090) ควรเลือก Q4_K_M ที่ 17.1GB; GPU 16GB ควรเลือก IQ4_XS ที่ 15.7GB (หรือ Q3_K_M ที่ 13.8GB ถ้าต้องการพื้นที่บริบทเพิ่มเติม); GPU 12GB จำกัดเฉพาะไฟล์ 2-bit, UD-IQ2_XXS ที่ 9.0GB, และนั่นคือการประนีประนอมที่คุณควรยอมรับอย่างรู้เท่าทัน Qwen3.8 27B — โมเดลหนาแน่น 27 พันล้านพารามิเตอร์ของ Ali​baba, น้ำหนักภายใต้สัญญาอนุญาต Apache 2.0 เผยแพร่เมื่อวันที่ 13–14 สิงหาคม 2026 — รันในเครื่องได้ด้วยต้นทุนต่ำผิดปกติ เพราะแอตเทนชันแบบไฮบริดแคชเพียง 16 จาก 64 เลเยอร์ ดังนั้นควอนไทซ์ 4-bit บน GPU 24GB จึงรองรับบริบท 32K–64K โทเคนได้อย่างสบาย และ GGUF เป็นเส้นทางเดียวที่ต้นทุนส่วนเพิ่มเป็นศูนย์: ไม่ต้องใช้ API key, ไม่มีค่าใช้จ่ายต่อโทเคน, ไม่มีข้อมูลออกจากเครื่องของคุณ.

เกี่ยวกับแหล่งข้อมูล: สถาปัตยกรรม หน้าต่างบริบท และใบอนุญาตเป็นข้อมูลทางการ จากโมเดลการ์ดของ Qwen3.8 27B บน Hugging Face ตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026 ขนาดไฟล์ GGUF มาจากคลังเก็บ GGUF ของ unsloth และ ggml-org ในวันเดียวกัน คำแนะนำ VRAM ต่อ GPU เป็นคำแนะนำอย่างเป็นทางการของ unsloth การประมาณค่าไบต์ของ KV-cache และตัวเลข tokens-per-second วัดโดยชุมชนในช่วงวันแรกหลังการเปิดตัว ไม่ใช่สเปกจากผู้ผลิต เกณฑ์มาตรฐานทุกอันที่ระบุด้านล่างนี้รายงานโดย Ali​baba และยังไม่มีการทำซ้ำเพื่อยืนยัน

ตัวเลือกไฟล์ หนึ่งบรรทัดต่อ quant

UD-IQ2_XXS — 9.0GB — เป็นตัวเลือกเดียวที่พอดีสำหรับการ์ด 12GB คาดว่าจะสูญเสียคุณภาพอย่างเห็นได้ชัด

UD-Q2_K_XL — 10.7GB — การ์ด 12GB แทบไม่เหลือคอนเท็กซ์ให้ใช้งานเลย

Q3_K_M — 13.8GB — การ์ด 16GB ที่ต้องการพื้นที่เหลือสำหรับ context.

IQ4_XS — 15.7GB — การ์ด 16GB: ควอนต์ที่ใหญ่ที่สุดที่พอดีทั้งชุด

Q4_K_M — 17.1GB — การ์ดจอ 24GB: จุดที่ลงตัว และไฟล์ที่บทความนี้แนะนำให้คุณใช้

Q5_K_M — 19.8GB — 24GB โดยแลกพื้นที่บริบทกับคุณภาพที่ดีขึ้นเล็กน้อย

Q6_K — 22.9GB — พอดีกับ 24GB ถ้าบีบหน่อย; แทบไม่สูญเสีย

Q8_0 — 29.0GB — 32GB, การแยกบนการ์ดสองใบ หรือการออฟโหลดไปยัง CPU.

BF16 — 54.7GB — สำหรับการ์ดเซิร์ฟเวอร์และระบบ CPU ที่มี RAM สูง ให้ความแม่นยำระดับอ้างอิง

สองแพ็ค สองขนาด Q4_K_M: ของ unsloth คือ 17.1GB; ของ ggml-org คือ 19.0GB แพ็คของ unsloth ใช้ quantization แบบ Dynamic V3.0 (preview) สำหรับไฟล์ UD-* และเป็นแพ็คที่แอปท้องถิ่นส่วนใหญ่ใช้เป็นค่าเริ่มต้น; แพ็คของ ggml-org มาพร้อม K-quants มาตรฐาน รวมถึง head การทำ multi-token-prediction แยกต่างหากที่ใช้สำหรับ speculative decoding Q4_K_M ตัวไหนก็ใช้ได้ — ความต่างคือขนาดไม่กี่ร้อยเมกะไบต์กับไฟล์ MTP

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

ทำไม 27B นี้ถึงพอดีกับการ์ดที่เล็กกว่าส่วนใหญ่

Qwen3.8 27B มี 64 ชั้น แต่มีเพียง 16 ชั้นที่ใช้ full attention (การสนใจแบบเต็ม) อีก 48 ชั้นใช้ Gated DeltaNet linear attention ซึ่งเก็บสถานะ recurrent ขนาดคงที่ แทนที่จะเป็น cache ของ key-value ที่เพิ่มขึ้นเรื่อย ๆ รูปแบบบล็อกใน model card เองคือ 3×(Gated DeltaNet → FFN) ต่อ 1×(Gated Attention → FFN) — อัตราส่วนไฮบริด 3:1 ผลในทางปฏิบัติ: KV cache มีขนาดประมาณหนึ่งในสี่ของที่โมเดล dense ขนาด 27B ทั่วไปต้องใช้สำหรับ context เดียวกัน การวัดจากชุมชนในสัปดาห์นี้ระบุว่า cache อยู่ที่ประมาณ 0.5GB ที่ context 8K, 2.0GB ที่ 32K และ 16.4GB ที่หน้าต่าง native เต็ม 262K นั่นกลับคำแนะนำทั่วไป — งบ VRAM ส่วนใหญ่ไปที่น้ำหนัก (weights) ไม่ใช่ context และการ์ด 24GB สามารถรัน Q4_K_M กับ context 64K–96K ได้โดยไม่ต้องกังวล คุณสามารถลดขนาด cache ลงได้อีกด้วยแฟล็ก --cache-type-k ของ llama.cpp ซึ่งทำการ quantize ตัว cache เอง

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

กับดักสามอย่างที่จะทำให้คุณพลาดท่าในวันแรก

llama.cpp บิลด์เก่าปฏิเสธไฟล์นี้ GGUF ลงทะเบียนสถาปัตยกรรม qwen35 ใหม่ คุณจึงต้องใช้บิลด์ปัจจุบัน — ทุกอย่างที่มาจากก่อนสัปดาห์ที่เผยแพร่จะปฏิเสธไม่โหลดไฟล์พร้อมข้อผิดพลาดด้านสถาปัตยกรรม อัปเดต llama.cpp ก่อน แล้วค่อยดาวน์โหลด

กับดักเทมเพลต. เทมเพลตแชท Jinja อย่างเป็นทางการจะครอบทุกเทิร์นของแอสซิสแตนต์ด้วยบล็อก think แม้ว่าเทรซการให้เหตุผลจะว่างเปล่า ซึ่งทำให้เกิดบล็อกซ้อนกันและประวัติถูกตัดทอนในแชทหลายเทิร์น — ดูเหมือนว่าโมเดลลืมสิ่งที่คุณพูด เรียกใช้ llama.cpp ด้วย --jinja และควรเลือกแพ็กที่มาพร้อมกับ chat_template.jinja ที่แก้ไขแล้ว

Vision จำเป็นต้องใช้ไฟล์แยกต่างหากข้อความใช้งานได้ทันที รูปภาพและวิดีโอจะไม่ทำงานใดๆ อย่างเงียบๆ เว้นแต่คุณจะโหลด mmproj projector ซึ่งมีขนาดประมาณ 0.9GB ด้วย ไฟล์นี้ไม่ได้อยู่ในรายการบนหน้า GGUF repo ของ unsloth — ให้ไปดาวน์โหลดจาก base repository หรือ ggml-org pack หากคุณวางแผนที่จะป้อนเอกสารหรือภาพหน้าจอ ให้เพิ่ม --mmproj ต่อท้ายคำสั่งเซิร์ฟเวอร์

รันมัน: คำสั่ง

llama.cpp, เมื่อคุณมี build ปัจจุบัน:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...และเพิ่ม --mmproj Qwen3.8-27B-mmproj-bf16.gguf หากคุณต้องการใช้ระบบประมวลผลภาพ

Ollama หากคุณต้องการรายการไลบรารี: ให้ใช้คำสั่ง ollama pull qwen3.8:27b จากนั้น ollama run qwen3.8:27b. LM Studio และ Unsloth Desktop จะตรวจจับเทมเพลตแชทและการออฟโหลด RAM ให้อัตโนมัติ — เป็นเส้นทางที่ยุ่งยากน้อยที่สุดสำหรับการรันครั้งแรก

Local กับ API: เศรษฐศาสตร์ที่ตรงไปตรงมา

GGUF คือทางเลือกฟรี: ต้นทุนส่วนเพิ่มเป็นศูนย์ ไม่มีข้อจำกัดเรื่องอัตราการใช้งาน ไม่มีอะไรออกจากเครื่องของคุณ แต่มันไม่ใช่ทางที่ถูกในแง่ต้นทุนรวม — คุณต้องจัดหา GPU ขนาด 24GB เอง (RTX 3090 มือสองหรือ RTX 4090 ใหม่ บวกค่าไฟ) และไฟล์ 2-bit บนการ์ด 12GB ก็ให้ประสบการณ์ที่ด้อยคุณภาพ

เส้นทาง API นี้มีอยู่เพราะน้ำหนัก (weights) เป็น Apache 2.0 ดังนั้นต้นทุนส่วนเพิ่มในการให้บริการจึงเกือบเป็นศูนย์ และใครก็สามารถโฮสต์ได้ Qwen3.8 27B เปิดใช้งานบน OrcaRouter แล้ววันนี้ในราคา $0.33 ต่อล้านโทเค็น input และ $2.40 ต่อล้าน output — ราคารายการของผู้ให้บริการส่งผ่านโดยไม่มีมาร์กอัป — และเนื่องจากน้ำหนักเป็นแบบเปิด ยังมีชั้นฟรีแบบจำกัดอัตราที่คิดเงิน $0 ต่อคำขอ และคืน HTTP 429 เมื่อคุณเกินขีดจำกัด เดือนตัวอย่างที่ใช้ 10 ล้านโทเค็น โดยเป็น input 70% จะอยู่ที่ประมาณ $9.51 บนชั้นแบบชำระเงิน หากคุณมี GPU อยู่แล้ว การรันในเครื่องชนะเรื่องต้นทุน หากไม่มี การเช่าโทเค็นดีกว่าซื้อการ์ดสำหรับโปรเจกต์รอง

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

เมื่อคำแนะนำนี้ไม่ถูกต้อง

Q4_K_M บน 24GB เป็นค่าเริ่มต้น ไม่ใช่คำตอบสากล เลือกอย่างอื่นเมื่อ:

คุณต้องการคุณภาพสูงสุดบนเซิร์ฟเวอร์หรือเวิร์กสเตชัน — Q8_0 ที่ 29GB หรือ BF16 ที่ 54.7GB พร้อมออฟโหลดผ่าน CPU และ RAM ไม่ใช่ไฟล์ 4-bit

คุณกำลังใช้การ์ด Blackwell RTX 50-series — เวอร์ชัน NVFP4 เร็วกว่าประมาณ 1.5 เท่าใน VRAM 24GB เท่าเดิม และใช้ FP8 KV cache เพื่อรองรับบริบทที่ยาวขึ้น บนการ์ด 5090 NVFP4 ชนะ GGUF ทุกรุ่นในโมเดลนี้

คุณต้องใช้บริบท 262K เต็มรูปแบบ — ต้องเผื่อแคชประมาณ 16GB เพิ่มจากน้ำหนักโมเดล ซึ่งทำให้การ์ด 24GB ลดลงเหลือ Q3_K_M หรือบังคับให้ใช้ KV quantization.

หากคุณพึ่งพาการถอดรหัสแบบคาดการณ์ล่วงหน้า — ให้เลือกแพ็ก ggml-org ซึ่งยังคงส่วนหัวการคาดการณ์หลายโทเค็นไว้; โมเดลควอนไทซ์บางตัวตัดส่วนนี้ทิ้งเพื่อประหยัดพื้นที่ประมาณ 0.5GB.

คุณมีเพียง 12GB — คำตอบที่ตรงไปตรงมา: โมเดล 27B แบบ 2-bit นั้นแย่กว่าอย่างเห็นได้ชัดเมื่อเทียบกับโมเดลเดียวกันที่รันอย่างถูกต้อง ลองใช้ API ฟรีก่อนที่จะตัดสินใจติดตั้งแบบ 2-bit ในเครื่อง; ถ้ามันดีพอ GGUF ก็รอได้จนกว่าฮาร์ดแวร์จะตามทัน

บรรทัดล่าง

Qwen3.8 27B คือ 27B ที่หายากซึ่งใส่ในการ์ด 24GB ได้พอดีโดยไม่ต้องประนีประนอม: ดาวน์โหลด Q4_K_M ขนาด 17.1GB, ใช้ llama.cpp บิลด์ปัจจุบัน และ KV cache ที่ถูกพอจนคอนเท็กซ์ยาวแทบไม่มีค่าใช้จ่าย หากคุณมีฮาร์ดแวร์ ก็ดาวน์โหลดไฟล์นั้นมาใช้ อย่าลืมว่า vision ต้องใช้ mmproj แยกต่างหาก และเตรียมพบกับกับดักเทมเพลตในครั้งแรกที่บทสนทนาหลายเทิร์นดูเหมือนขี้ลืม หากคุณไม่มีฮาร์ดแวร์ โมเดลเดียวกันนี้มี API ราคา $0.33/$2.40 พร้อมระดับฟรีที่จำกัดอัตราการใช้งาน จึงไม่มีเหตุผลใดที่จะรันไฟล์ 2-bit ที่คุณไม่พอใจ GGUF คือเส้นทางฟรี แต่มันไม่ใช่เส้นทางเดียวอีกต่อไป

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube