
Qwen3.8-27B กับ Unsloth: รัน ควอนไทซ์ หรือ Fine-Tune ในเครื่อง
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 ต่อ 1 ล้านโทเค็น · 18 tok/s
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
ใช่ — Unsloth รัน Qwen3.8 27B ได้ และเป็นวิธีที่เร็วที่สุดในการนำโมเดล Apache-2.0 ตัวใหม่ของ Alibaba มาไว้บน GPU ของคุณเอง คำตอบทั้งหมดในบรรทัดเดียว: เปิด Unsloth Studio ค้นหา "Qwen3.8 27B" แล้วเลือก UD-Q4_K_XL (17.9GB)บนการ์ด 24GB แล้วแชทได้ในเวลาไม่ถึงนาที เบื้องหลังการคลิกนั้น Unsloth ปล่อยสามอย่างในสัปดาห์เดียวกับที่ปล่อย weights ออกมา (13–14 สิงหาคม 2026): unsloth/Qwen3.8-27B-GGUFชุดที่สร้างบน quantization แบบ Unsloth Dynamic V3.0 (preview) รองรับเต็มรูปแบบใน Unsloth Studio และ Desktop และ v0.1.800-betaรุ่นที่มาพร้อม GGUF export, การตรวจจับ imatrix และการปรับปรุง VRAM-fit นอกจากนี้ยัง fine-tune โมเดลได้ — Unsloth อ้างว่าฝึกได้เร็วขึ้น 2 เท่า ใช้ VRAM น้อยลง 70% Qwen3.8 27B เป็น vision-language model แบบ dense ที่มีพารามิเตอร์ 27 พันล้าน ใช้ hybrid attention ที่คง full attention ไว้เพียง 16 จาก 64 ชั้น ซึ่งเป็นเหตุผลที่ไฟล์ 4-bit ใส่ลงในการ์ดที่โมเดล 27B ส่วนใหญ่ใส่ไม่ลง
ในเรื่องแหล่งข้อมูล: ข้อเท็จจริงของตัวโมเดลเป็นข้อมูลทางการ จากโมเดลการ์ดของ Qwen3.8 27B บน Hugging Face ตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026 การรองรับของ Unsloth ขนาดควอนไทซ์ ความต้องการ VRAM และคำสั่งติดตั้ง อ้างอิงจากบันทึกการเผยแพร่และเอกสารของ Unsloth ในวันเดียวกัน ราคา API เป็นราคาสดจากแคตตาล็อกของ OrcaRouter ในวันเดียวกัน คำกล่าวอ้างของ Unsloth เรื่อง "2× faster, 70% less VRAM" และ "by far the strongest model for its size" เป็นคำกล่าวอ้างจากผู้จำหน่าย ไม่ได้ผ่านการพิสูจน์ซ้ำโดยอิสระ
ความหมายของ "Qwen3.8 + Unsloth": สี่สิ่งที่แตกต่างกัน
Unsloth คือสี่สิ่งที่แยกจากกัน และผลการค้นหาด้วยคำค้นหาก็ปนกันไปหมด การรู้ว่าคุณต้องการอันไหนคือครึ่งหนึ่งของการตั้งค่า:
• unsloth/Qwen3.8-27B-GGUF — ไฟล์น้ำหนักแบบควอนไทซ์บน Hugging Face มี 21 quants และ vision projector สร้างด้วย Dynamic V3.0 (พรีวิว) ไม่ใช่ Dynamic 2.0 รุ่นเก่า (ซึ่งประกาศเมื่อ 24 เมษายน 2025 และมีมาก่อนโมเดลนี้) นี่คือวิธี "ดาวน์โหลดไฟล์" ซึ่งใช้ได้จาก llama.cpp บิลด์ใดก็ได้
• Unsloth Studio — แอปเบราว์เซอร์ที่คุณติดตั้งหรือรันได้จาก Hugging Face Space ค้นหาโมเดลในฮับ คลิกควอนต์ แชทพร้อมเครื่องมือ ไม่ต้องตั้งค่าเทมเพลตหรือพารามิเตอร์การอนุมานด้วยตนเอง
• Unsloth Desktop — แอป GUI ในเครื่องสำหรับ macOS, Windows และ Linux ที่รวม Studio และการฝึกโมเดลเข้าด้วยกัน นี่คือที่ที่การปรับแต่งแบบ "เร็วกว่า 2 เท่า ใช้ VRAM น้อยลง 70%" ทำงานอยู่
• ไลบรารี Python ของ unsloth — from unsloth import FastLanguageModel ซึ่งเป็น QLoRA fine-tuning API ที่ใช้ใน notebooks และสคริปต์
บันทึกประจำรุ่น v0.1.800-beta ของ Unsloth ภายใต้ชื่อ "Release Qwen3.8 27B" ระบุว่า Qwen3.8 27B และ Qwen3.8-2.4T-A95B ที่มีพารามิเตอร์ 2.4T "สามารถรันในเครื่องได้แล้วใน Unsloth" โดยที่ 27B "รันบนแรม 17GB ผ่าน Unsloth Dynamic GGUFs" และ "คุณยังสามารถปรับแต่ง (fine-tune) Qwen3.8 27B ใน Unsloth ได้" ในรุ่นเดียวกันนี้ยังเพิ่ม NVFP4 quants, ตรวจสอบพื้นที่ดิสก์ก่อนส่งออก GGUF, ตรวจจับการรองรับ imatrix GGUF จริงใน Studio, และทำให้ inference เร็วขึ้นถึง 10% บน GGUF พร้อมขีดจำกัด VRAM ที่ปรับได้

เลือก quant ตาม VRAM ไม่ใช่ตามความรู้สึก
ตารางหน่วยความจำของ Unsloth คือ RAM รวมบวก VRAM (หรือหน่วยความจำรวม) และเป็นแนวทางอย่างเป็นทางการ Qwen3.8 27B แบบ 4 บิตต้องใช้ 17–19GB; RTX 4090 24GB, RTX 5080 หรือ Mac หน่วยความจำรวม 24GB คือขั้นต่ำที่ใช้งานได้จริงสำหรับการตั้งค่า 4 บิตที่สะดวก สามตัวเลือกที่ครอบคลุมเกือบทุกคน:
• 12GB → UD-IQ2_XXS ขนาด 9.0GB — เป็นไฟล์เดียวที่พอดีทั้งไฟล์; คาดว่าจะมีการสูญเสียคุณภาพอย่างเห็นได้ชัด โปรดเลือกตัวเลือกนี้โดยรู้ถึงผลที่ตามมา
• 16GB → UD-Q3_K_XL ที่ 13.4GB — ไฟล์ 3-bit ที่ดีที่สุด ตามตัวเลือกของ Unsloth เอง
• 24GB → UD-Q4_K_XL ขนาด 17.9GB — ไฟล์ 4-bit ที่แนะนำและคำตอบเริ่มต้นของบทความนี้
• 48–64GB → UD-Q8_K_XL ที่ 31.5GB — แทบไม่สูญเสียบนเวิร์กสเตชันหรือระบบ GPU คู่
บันไดเต็มรูปแบบ จากรายการไฟล์ unsloth/Qwen3.8-27B-GGUF และเอกสารของ Unsloth ทั้งสองตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026: UD-Q8_K_XL 31.5GB, UD-Q6_K_XL 25.9GB, UD-Q5_K_XL 20.2GB, UD-Q4_K_XL 17.9GB, UD-Q3_K_XL 13.4GB, UD-Q2_K_XL 10.7GB, UD-IQ3_XXS 11.9GB, UD-IQ2_M 10.3GB, UD-IQ2_XXS 9.0GB. K-quants มาตรฐาน (Q4_K_M 17.1GB, Q8_0 29.0GB) ก็มีเช่นกัน และแพ็กมาพร้อมกับ vision projector (mmproj-BF16, 931MB) เพื่อให้รูปภาพและวิดีโอใช้งานได้หากคุณโหลดมันขึ้นมา Unsloth เรียกบันไดทั้งหมดนี้ว่า "Dynamic V3.0 (preview)" — ซึ่งใหม่กว่า Dynamic 2.0 ที่คุณจะเห็นในเอกสารเก่า ๆ ซึ่งถูกสร้างขึ้นสำหรับโมเดลที่เผยแพร่เมื่อกว่าหนึ่งปีก่อนหน้านั้น

รันมันด้วย Unsloth ในสามนาที
วิธีคลิกเดียว: บน macOS หรือ Linux รัน `curl -fsSL https://unsloth.ai/install.sh | sh` จากนั้นใช้ `unsloth studio -p 8888` แล้วเปิด `http://127.0.0.1:8888` บน Windows ใช้ `irm https://unsloth.ai/install.ps1 | iex` หากคุณไม่อยากติดตั้งอะไรเลย สตูดิโอของ Unsloth ก็เผยแพร่เป็น Hugging Face Space ด้วยเช่นกัน — เปิดในเบราว์เซอร์ ค้นหา "Qwen3.8 27B" แล้วเลือกควอนไทเซชันตามหน่วยความจำที่คุณมี สตูดิโอจะปรับพารามิเตอร์การสุ่มตัวอย่างและเทมเพลตแชทให้อัตโนมัติ ย้ายไปใช้ RAM เมื่อ VRAM ไม่พอ และตรวจจับการตั้งค่า multi-GPU — ส่วนที่ว่า "ไม่ต้องตั้งค่า" นั้นเป็นเรื่องจริง และเป็นวิธีที่เร็วที่สุดในการรันโมเดลของสัปดาห์นี้
เส้นทางแบบใช้ไฟล์ก่อน หากคุณใช้ llama.cpp อยู่แล้ว: ดาวน์โหลด quant หนึ่งตัวแล้วรันได้โดยตรง คำสั่งเหล่านี้เป็นคำสั่งของ Unsloth เอง ซึ่งตรวจสอบกับเอกสารของพวกเขาแล้ว:
hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"
./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
ค่าการสุ่มตัวอย่างเหล่านั้นคือการตั้งค่าโหมดการคิดที่แนะนำในโมเดลการ์ด เปลี่ยน --include glob เป็น *UD-Q3_K_XL* บนการ์ด 16GB และเพิ่ม --mmproj โดยชี้ไปที่ mmproj-BF16.gguf ของแพ็กหากคุณต้องการความสามารถด้านภาพ ข้อควรระวัง: llama.cpp ต้องเป็น build ที่ทันสมัย — ไฟล์นี้ลงทะเบียนสถาปัตยกรรม qwen35 ใหม่ และเวอร์ชันใดก็ตามที่มาก่อนสัปดาห์ที่วางจำหน่ายจะไม่ยอมโหลดมัน
ปรับแต่งมันด้วย Unsloth
การปรับแต่งละเอียดคือจุดที่ Unsloth สร้างชื่อเสียง: ไลบรารีอ้างว่าฝึกได้เร็วกว่า 2 เท่าและใช้ VRAM น้อยลง 70% เมื่อเทียบกับ Transformers + PEFT มาตรฐาน ซึ่งทำให้ QLoRA บนโมเดล 27B เป็นไปได้บนการ์ดสำหรับผู้ใช้ทั่วไป จุดเริ่มต้นสำหรับการปรับแต่งละเอียดคือที่เก็บแบบธรรมดาunsloth/Qwen3.8-27Bซึ่งเป็นที่เก็บ (หน้าไฟล์ safetensors, 28B) ไม่ใช่ชุด GGUF รูปแบบ QLoRA มาตรฐานของ Unsloth ที่ใช้กับโมเดลนี้:
นำเข้า FastLanguageModel จาก unsloth
model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)
model = FastLanguageModel.get_peft_model(model, r=16)
จากนั้นก็ใช้ลูป trl.SFTTrainer มาตรฐานบนชุดข้อมูลของคุณ โค้ดส่วนนั้นเป็นรูปแบบ QLoRA มาตรฐานจากเอกสารของ Unsloth — ข้ออ้างเรื่อง benchmark การฝึกเป็นของ Unsloth เอง ไม่ใช่สิ่งที่ฉันทำซ้ำ — และมีข้อควรระวังสองข้อ: เคอร์เนลของ Unsloth จะแพตช์เลเยอร์ทรานส์ฟอร์เมอร์ของข้อความ ดังนั้นควรวางแผนจัดการวิทัศน์เอนโค้ดเดอร์แยกต่างหาก และรักษาแพ็กเกจ unsloth ไว้ที่เวอร์ชันปัจจุบัน เพราะสถาปัตยกรรมนี้เพิ่งออกมาได้ไม่กี่วัน และการไม่ตรงกันของเวอร์ชันจะทำให้เกิดข้อผิดพลาดชัดเจน
สิ่งที่ Unsloth Studio จัดการให้คุณ
การรัน GGUF ด้วยตนเองหมายถึงการต้องคอยจัดสมดุลอย่างระมัดระวังระหว่างขนาด context, การ offload RAM และการเรียกใช้เครื่องมือ Studio ลดความยุ่งยากทั้งหมดนั้นลงเป็นค่าเริ่มต้น โดยมันจะกำหนดขนาด context จากหน่วยความจำที่ว่างจริง ๆ ปลดโมเดล vision ที่ไม่ได้ใช้ออกจากแรมเพื่อเพิ่ม VRAM สำหรับแชตหรือเทรน ตรวจจับรูปแบบการจัดวางแบบ multi-GPU และเชื่อมต่อเว็บเซิร์ช การเรียกใช้โค้ด และการเชื่อมต่อ agent (Claude Code, Codex, MCP) ให้พร้อมใช้งานได้ทันที เวอร์ชัน v0.1.800-beta ยังปรับปรุงจุดที่เคยสร้างปัญหาในการใช้งานจริงให้แน่นขึ้น: การส่งออก GGUF ตอนนี้จะตรวจสอบพื้นที่ดิสก์ก่อนเริ่ม merge ที่ยาวนาน แทนที่จะพังกลางคัน, Studio ตรวจสอบได้ว่า GGUF ที่กำลังส่งออกนั้นรองรับ imatrix จริงหรือไม่ (เพื่อไม่ให้คุณเสียเวลา run ไปเปล่า ๆ) และการ์ดป้องกันหน่วยความจำจะไม่จอง GPU memory เกินความจำเป็นอีกต่อไป สำหรับโมเดลที่เพิ่งเปิดตัวได้สามวัน "no-config" ทำงานได้จริง ๆ
Local ฟรี vs API เสียเงิน: เศรษฐศาสตร์ที่ตรงไปตรงมา
ความแตกต่างหลักระหว่าง Unsloth และ API ไม่ใช่เรื่องของคุณภาพ — แต่เป็นเรื่องของใครเป็นเจ้าของฮาร์ดแวร์ {{1}}Unsloth คือเส้นทางฟรี: {{/1}}ต้นทุนส่วนเพิ่มต่อโทเคนเป็นศูนย์ {{2}}ไม่มีอะไรหลุดออกจากเครื่องของคุณ {{/2}}{{3}}ไม่มีขีดจำกัดอัตราการเรียกใช้ {{/3}}และควบคุมน้ำหนัก (weights) ได้อย่างเต็มที่ {{4}}มันไม่ได้ฟรีในเชิงสัมบูรณ์: {{/4}}คุณต้องจัดหา GPU และค่าไฟฟ้าเอง {{5}}และไฟล์ 2-bit บนการ์ด 12GB คือประสบการณ์ที่ถูกประนีประนอม {{/5}}{{6}}Qwen3.8 27B เป็นโมเดลแบบ dense และรองรับภาพ {{/6}}ดังนั้น 4-bit จึงมีน้ำหนัก 17.9GB ก่อนคิดบริบท (context) {{7}}ตัวเครื่องคือราคาค่าเข้าใช้งาน {{/7}}
เส้นทาง API นี้มีอยู่เพราะน้ำหนักโมเดลเป็น Apache-2.0 จึงใครก็ได้ที่สามารถโฮสต์ได้ด้วยต้นทุนส่วนเพิ่มเกือบเป็นศูนย์ Qwen3.8 27B อยู่ในแคตตาล็อกของ OrcaRouter ในวันนี้ที่ $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านโทเคนเอาต์พุต ซึ่งเป็นโมเดลที่โฮสต์เองบนโครงสร้างพื้นฐานของเราเอง — ไม่มีราคาผู้จำหน่ายให้ส่งผ่าน — พร้อมหน้าต่างบริบท 262K โทเคน และรองรับอินพุตที่เป็นข้อความ รูปภาพ และวิดีโอ เนื่องจากน้ำหนักเปิดเผย จึงมีชั้นฟรีแบบจำกัดอัตราที่คิด $0 ต่อคำขอด้วย เดือนที่มีการใช้งาน 10 ล้านโทเคน โดยมีสัดส่วนอินพุต 70% จะมีค่าใช้จ่ายประมาณ $9.51 ในชั้นแบบชำระเงิน หากคุณมีการ์ด 24GB อยู่แล้ว การรันในเครื่องชนะในเรื่องต้นทุน หากไม่มี การเช่าโทเคนในอัตรานั้นดีกว่าซื้อการ์ดสำหรับโปรเจกต์ข้างเคียง และชั้นฟรีคือวิธีที่ตรงไปตรงมาในการทดสอบโมเดลก่อนที่คุณจะลงทุนซื้อฮาร์ดแวร์

เมื่อ Unsloth คือคำตอบที่ผิด
Unsloth Studio และ GGUF pack เป็นตัวเลือกที่เหมาะสมสำหรับเครื่องเดียว แต่ไม่เหมาะสมเมื่อ:
• คุณมีการ์ด Blackwell RTX 50-series. ควอนต์ของ unsloth/Qwen3.8-27B-NVFP4 เร็วกว่า BF16 ประมาณ 1.5× ใน VRAM เดียวกัน และใช้ FP8 KV cache เพื่อบริบทที่ยาวขึ้น เส้นทางนั้นทำงานผ่าน vLLM หรือ SGLang ไม่ใช่ GGUF และไม่ใช่ Studio.
• คุณต้องใช้หน้าต่างเนทีฟเต็มรูปแบบขนาด 262K หรือส่วนขยาย YaRN ขนาด 1M ในการผลิต โมเดลวิชันแบบหนาแน่นที่บริบทยาวนั้นหนัก การปรับขนาดบริบทของ Unsloth จะยินดีรันด้วยขนาดที่สั้นลงให้คุณ แต่สแตกการให้บริการที่มีการจัดการ KV อย่างเหมาะสมยังดีกว่าแอปในเครื่อง
• คุณกำลังให้บริการผู้ใช้จำนวนมาก Unsloth เป็นแอปพลิเคชันและไลบรารีสำหรับปรับแต่งโมเดลที่ทำงานในเครื่อง ไม่ใช่เซิร์ฟเวอร์แบบ multi-tenant สำหรับการทำงานพร้อมกัน การปรับขนาดอัตโนมัติ และการรับประกันเวลาทำงาน คุณควรใช้เอนด์พอยต์ที่โฮสต์ไว้
• คุณไม่มี GPU เลย คำตอบที่ตรงไปตรงมา: โมเดล 27B แบบ 2-bit บนการ์ด 12GB ให้ผลลัพธ์ที่แย่กว่าโมเดลเดียวกันที่ให้บริการอย่างเหมาะสมอย่างเห็นได้ชัด ใช้ API ฟรีก่อน หากเพียงพอแล้ว ค่อยซื้อฮาร์ดแวร์เมื่อการใช้งานพิสูจน์แล้วว่าคุ้มค่า
• คุณต้องการปรับแต่งฝั่งภาพ การเร่งความเร็วของ Unsloth กำหนดเป้าหมายที่ชั้นทรานส์ฟอร์มเมอร์ข้อความ ส่วนการปรับแต่งแบบมัลติโมดัลเต็มรูปแบบต้องใช้สแตกที่แตกต่างกัน
บรรทัดล่าง
Qwen3.8 27B กับ Unsloth เป็นปัญหาที่แก้สำเร็จแล้วในสัปดาห์นี้: ติดตั้ง Studio เลือก UD-Q4_K_XL สำหรับการ์ด 24GB (UD-Q3_K_XL สำหรับ 16GB, UD-IQ2_XXS สำหรับ 12GB) แล้วโมเดลก็ทำงานได้โดยไม่ต้องตั้งค่าใดๆ และไม่มีการคิดเงินต่อ token เส้นทาง fine-tuning เป็นของจริง และความเร็วที่ Unsloth อ้างคือเหตุผลที่ทำให้ 27B QLoRA ใช้งานได้จริงบนการ์ดใบเดียว รู้ไว้ว่าบันได quantization คือ Dynamic V3.0 (พรีวิว) ไม่ใช่ Dynamic 2.0 ตามที่บทความเก่าๆ อธิบาย; อัปเดต llama.cpp ให้ทันสมัยอยู่เสมอ; และถ้าคุณไม่มีฮาร์ดแวร์เป็นของตัวเอง น้ำหนักโมเดลเดียวกันนี้มี API ราคา $0.33/$2.40 พร้อมระดับจำกัดอัตราการใช้งานฟรี — ดังนั้นจึงไม่มีเหตุผลที่จะรันไฟล์ 2-bit ที่คุณไม่พอใจ Local เป็นเส้นทางฟรี และเป็นครั้งแรกในคลาสน้ำหนักนี้ที่มันยังเป็นเส้นทางง่ายอีกด้วย
