การ์ดไตเติลหลักที่แสดงข้อความ Qwen3.8-27B พร้อมด้วย Unsloth โดยมีคำบรรยายว่า 'รัน ควอนไทซ์ หรือฟายจูนในเครื่องของคุณ' ไอคอนหน้าต่างเทอร์มินัล และชิปที่อ่านว่า 'UD-Q4_K_XL 17.9GB' และ 'Studio no-config'
Guides & Insights

Qwen3.8-27B กับ Unsloth: รัน ควอนไทซ์ หรือ Fine-Tune ในเครื่อง

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ใช่ — Unsloth รัน Qwen3.8 27B ได้ และเป็นวิธีที่เร็วที่สุดในการนำโมเดล Apache-2.0 ตัวใหม่ของ Alibaba มาไว้บน GPU ของคุณเอง คำตอบทั้งหมดในบรรทัดเดียว: เปิด Unsloth Studio ค้นหา "Qwen3.8 27B" แล้วเลือก UD-Q4_K_XL (17.9GB)บนการ์ด 24GB แล้วแชทได้ในเวลาไม่ถึงนาที เบื้องหลังการคลิกนั้น Unsloth ปล่อยสามอย่างในสัปดาห์เดียวกับที่ปล่อย weights ออกมา (13–14 สิงหาคม 2026): unsloth/Qwen3.8-27B-GGUFชุดที่สร้างบน quantization แบบ Unsloth Dynamic V3.0 (preview) รองรับเต็มรูปแบบใน Unsloth Studio และ Desktop และ v0.1.800-betaรุ่นที่มาพร้อม GGUF export, การตรวจจับ imatrix และการปรับปรุง VRAM-fit นอกจากนี้ยัง fine-tune โมเดลได้ — Unsloth อ้างว่าฝึกได้เร็วขึ้น 2 เท่า ใช้ VRAM น้อยลง 70% Qwen3.8 27B เป็น vision-language model แบบ dense ที่มีพารามิเตอร์ 27 พันล้าน ใช้ hybrid attention ที่คง full attention ไว้เพียง 16 จาก 64 ชั้น ซึ่งเป็นเหตุผลที่ไฟล์ 4-bit ใส่ลงในการ์ดที่โมเดล 27B ส่วนใหญ่ใส่ไม่ลง

ในเรื่องแหล่งข้อมูล: ข้อเท็จจริงของตัวโมเดลเป็นข้อมูลทางการ จากโมเดลการ์ดของ Qwen3.8 27B บน Hugging Face ตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026 การรองรับของ Unsloth ขนาดควอนไทซ์ ความต้องการ VRAM และคำสั่งติดตั้ง อ้างอิงจากบันทึกการเผยแพร่และเอกสารของ Unsloth ในวันเดียวกัน ราคา API เป็นราคาสดจากแคตตาล็อกของ OrcaRouter ในวันเดียวกัน คำกล่าวอ้างของ Unsloth เรื่อง "2× faster, 70% less VRAM" และ "by far the strongest model for its size" เป็นคำกล่าวอ้างจากผู้จำหน่าย ไม่ได้ผ่านการพิสูจน์ซ้ำโดยอิสระ

ความหมายของ "Qwen3.8 + Unsloth": สี่สิ่งที่แตกต่างกัน

Unsloth คือสี่สิ่งที่แยกจากกัน และผลการค้นหาด้วยคำค้นหาก็ปนกันไปหมด การรู้ว่าคุณต้องการอันไหนคือครึ่งหนึ่งของการตั้งค่า:

unsloth/Qwen3.8-27B-GGUF — ไฟล์น้ำหนักแบบควอนไทซ์บน Hugging Face มี 21 quants และ vision projector สร้างด้วย Dynamic V3.0 (พรีวิว) ไม่ใช่ Dynamic 2.0 รุ่นเก่า (ซึ่งประกาศเมื่อ 24 เมษายน 2025 และมีมาก่อนโมเดลนี้) นี่คือวิธี "ดาวน์โหลดไฟล์" ซึ่งใช้ได้จาก llama.cpp บิลด์ใดก็ได้

Unsloth Studio — แอปเบราว์เซอร์ที่คุณติดตั้งหรือรันได้จาก Hugging Face Space ค้นหาโมเดลในฮับ คลิกควอนต์ แชทพร้อมเครื่องมือ ไม่ต้องตั้งค่าเทมเพลตหรือพารามิเตอร์การอนุมานด้วยตนเอง

Unsloth Desktop — แอป GUI ในเครื่องสำหรับ macOS, Windows และ Linux ที่รวม Studio และการฝึกโมเดลเข้าด้วยกัน นี่คือที่ที่การปรับแต่งแบบ "เร็วกว่า 2 เท่า ใช้ VRAM น้อยลง 70%" ทำงานอยู่

ไลบรารี Python ของ unsloth — from unsloth import FastLanguageModel ซึ่งเป็น QLoRA fine-tuning API ที่ใช้ใน notebooks และสคริปต์

บันทึกประจำรุ่น v0.1.800-beta ของ Unsloth ภายใต้ชื่อ "Release Qwen3.8 27B" ระบุว่า Qwen3.8 27B และ Qwen3.8-2.4T-A95B ที่มีพารามิเตอร์ 2.4T "สามารถรันในเครื่องได้แล้วใน Unsloth" โดยที่ 27B "รันบนแรม 17GB ผ่าน Unsloth Dynamic GGUFs" และ "คุณยังสามารถปรับแต่ง (fine-tune) Qwen3.8 27B ใน Unsloth ได้" ในรุ่นเดียวกันนี้ยังเพิ่ม NVFP4 quants, ตรวจสอบพื้นที่ดิสก์ก่อนส่งออก GGUF, ตรวจจับการรองรับ imatrix GGUF จริงใน Studio, และทำให้ inference เร็วขึ้นถึง 10% บน GGUF พร้อมขีดจำกัด VRAM ที่ปรับได้

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

เลือก quant ตาม VRAM ไม่ใช่ตามความรู้สึก

ตารางหน่วยความจำของ Unsloth คือ RAM รวมบวก VRAM (หรือหน่วยความจำรวม) และเป็นแนวทางอย่างเป็นทางการ Qwen3.8 27B แบบ 4 บิตต้องใช้ 17–19GB; RTX 4090 24GB, RTX 5080 หรือ Mac หน่วยความจำรวม 24GB คือขั้นต่ำที่ใช้งานได้จริงสำหรับการตั้งค่า 4 บิตที่สะดวก สามตัวเลือกที่ครอบคลุมเกือบทุกคน:

12GB → UD-IQ2_XXS ขนาด 9.0GB — เป็นไฟล์เดียวที่พอดีทั้งไฟล์; คาดว่าจะมีการสูญเสียคุณภาพอย่างเห็นได้ชัด โปรดเลือกตัวเลือกนี้โดยรู้ถึงผลที่ตามมา

16GB → UD-Q3_K_XL ที่ 13.4GB — ไฟล์ 3-bit ที่ดีที่สุด ตามตัวเลือกของ Unsloth เอง

24GB → UD-Q4_K_XL ขนาด 17.9GB — ไฟล์ 4-bit ที่แนะนำและคำตอบเริ่มต้นของบทความนี้

48–64GB → UD-Q8_K_XL ที่ 31.5GB — แทบไม่สูญเสียบนเวิร์กสเตชันหรือระบบ GPU คู่

บันไดเต็มรูปแบบ จากรายการไฟล์ unsloth/Qwen3.8-27B-GGUF และเอกสารของ Unsloth ทั้งสองตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026: UD-Q8_K_XL 31.5GB, UD-Q6_K_XL 25.9GB, UD-Q5_K_XL 20.2GB, UD-Q4_K_XL 17.9GB, UD-Q3_K_XL 13.4GB, UD-Q2_K_XL 10.7GB, UD-IQ3_XXS 11.9GB, UD-IQ2_M 10.3GB, UD-IQ2_XXS 9.0GB. K-quants มาตรฐาน (Q4_K_M 17.1GB, Q8_0 29.0GB) ก็มีเช่นกัน และแพ็กมาพร้อมกับ vision projector (mmproj-BF16, 931MB) เพื่อให้รูปภาพและวิดีโอใช้งานได้หากคุณโหลดมันขึ้นมา Unsloth เรียกบันไดทั้งหมดนี้ว่า "Dynamic V3.0 (preview)" — ซึ่งใหม่กว่า Dynamic 2.0 ที่คุณจะเห็นในเอกสารเก่า ๆ ซึ่งถูกสร้างขึ้นสำหรับโมเดลที่เผยแพร่เมื่อกว่าหนึ่งปีก่อนหน้านั้น

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

รันมันด้วย Unsloth ในสามนาที

วิธีคลิกเดียว: บน macOS หรือ Linux รัน `curl -fsSL https://unsloth.ai/install.sh | sh` จากนั้นใช้ `unsloth studio -p 8888` แล้วเปิด `http://127.0.0.1:8888` บน Windows ใช้ `irm https://unsloth.ai/install.ps1 | iex` หากคุณไม่อยากติดตั้งอะไรเลย สตูดิโอของ Unsloth ก็เผยแพร่เป็น Hugging Face Space ด้วยเช่นกัน — เปิดในเบราว์เซอร์ ค้นหา "Qwen3.8 27B" แล้วเลือกควอนไทเซชันตามหน่วยความจำที่คุณมี สตูดิโอจะปรับพารามิเตอร์การสุ่มตัวอย่างและเทมเพลตแชทให้อัตโนมัติ ย้ายไปใช้ RAM เมื่อ VRAM ไม่พอ และตรวจจับการตั้งค่า multi-GPU — ส่วนที่ว่า "ไม่ต้องตั้งค่า" นั้นเป็นเรื่องจริง และเป็นวิธีที่เร็วที่สุดในการรันโมเดลของสัปดาห์นี้

เส้นทางแบบใช้ไฟล์ก่อน หากคุณใช้ llama.cpp อยู่แล้ว: ดาวน์โหลด quant หนึ่งตัวแล้วรันได้โดยตรง คำสั่งเหล่านี้เป็นคำสั่งของ Unsloth เอง ซึ่งตรวจสอบกับเอกสารของพวกเขาแล้ว:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

ค่าการสุ่มตัวอย่างเหล่านั้นคือการตั้งค่าโหมดการคิดที่แนะนำในโมเดลการ์ด เปลี่ยน --include glob เป็น *UD-Q3_K_XL* บนการ์ด 16GB และเพิ่ม --mmproj โดยชี้ไปที่ mmproj-BF16.gguf ของแพ็กหากคุณต้องการความสามารถด้านภาพ ข้อควรระวัง: llama.cpp ต้องเป็น build ที่ทันสมัย — ไฟล์นี้ลงทะเบียนสถาปัตยกรรม qwen35 ใหม่ และเวอร์ชันใดก็ตามที่มาก่อนสัปดาห์ที่วางจำหน่ายจะไม่ยอมโหลดมัน

ปรับแต่งมันด้วย Unsloth

การปรับแต่งละเอียดคือจุดที่ Unsloth สร้างชื่อเสียง: ไลบรารีอ้างว่าฝึกได้เร็วกว่า 2 เท่าและใช้ VRAM น้อยลง 70% เมื่อเทียบกับ Transformers + PEFT มาตรฐาน ซึ่งทำให้ QLoRA บนโมเดล 27B เป็นไปได้บนการ์ดสำหรับผู้ใช้ทั่วไป จุดเริ่มต้นสำหรับการปรับแต่งละเอียดคือที่เก็บแบบธรรมดาunsloth/Qwen3.8-27Bซึ่งเป็นที่เก็บ (หน้าไฟล์ safetensors, 28B) ไม่ใช่ชุด GGUF รูปแบบ QLoRA มาตรฐานของ Unsloth ที่ใช้กับโมเดลนี้:

นำเข้า FastLanguageModel จาก unsloth

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

จากนั้นก็ใช้ลูป trl.SFTTrainer มาตรฐานบนชุดข้อมูลของคุณ โค้ดส่วนนั้นเป็นรูปแบบ QLoRA มาตรฐานจากเอกสารของ Unsloth — ข้ออ้างเรื่อง benchmark การฝึกเป็นของ Unsloth เอง ไม่ใช่สิ่งที่ฉันทำซ้ำ — และมีข้อควรระวังสองข้อ: เคอร์เนลของ Unsloth จะแพตช์เลเยอร์ทรานส์ฟอร์เมอร์ของข้อความ ดังนั้นควรวางแผนจัดการวิทัศน์เอนโค้ดเดอร์แยกต่างหาก และรักษาแพ็กเกจ unsloth ไว้ที่เวอร์ชันปัจจุบัน เพราะสถาปัตยกรรมนี้เพิ่งออกมาได้ไม่กี่วัน และการไม่ตรงกันของเวอร์ชันจะทำให้เกิดข้อผิดพลาดชัดเจน

สิ่งที่ Unsloth Studio จัดการให้คุณ

การรัน GGUF ด้วยตนเองหมายถึงการต้องคอยจัดสมดุลอย่างระมัดระวังระหว่างขนาด context, การ offload RAM และการเรียกใช้เครื่องมือ Studio ลดความยุ่งยากทั้งหมดนั้นลงเป็นค่าเริ่มต้น โดยมันจะกำหนดขนาด context จากหน่วยความจำที่ว่างจริง ๆ ปลดโมเดล vision ที่ไม่ได้ใช้ออกจากแรมเพื่อเพิ่ม VRAM สำหรับแชตหรือเทรน ตรวจจับรูปแบบการจัดวางแบบ multi-GPU และเชื่อมต่อเว็บเซิร์ช การเรียกใช้โค้ด และการเชื่อมต่อ agent (Claude Code, Codex, MCP) ให้พร้อมใช้งานได้ทันที เวอร์ชัน v0.1.800-beta ยังปรับปรุงจุดที่เคยสร้างปัญหาในการใช้งานจริงให้แน่นขึ้น: การส่งออก GGUF ตอนนี้จะตรวจสอบพื้นที่ดิสก์ก่อนเริ่ม merge ที่ยาวนาน แทนที่จะพังกลางคัน, Studio ตรวจสอบได้ว่า GGUF ที่กำลังส่งออกนั้นรองรับ imatrix จริงหรือไม่ (เพื่อไม่ให้คุณเสียเวลา run ไปเปล่า ๆ) และการ์ดป้องกันหน่วยความจำจะไม่จอง GPU memory เกินความจำเป็นอีกต่อไป สำหรับโมเดลที่เพิ่งเปิดตัวได้สามวัน "no-config" ทำงานได้จริง ๆ

Local ฟรี vs API เสียเงิน: เศรษฐศาสตร์ที่ตรงไปตรงมา

ความแตกต่างหลักระหว่าง Unsloth และ API ไม่ใช่เรื่องของคุณภาพ — แต่เป็นเรื่องของใครเป็นเจ้าของฮาร์ดแวร์ {{1}}Unsloth คือเส้นทางฟรี: {{/1}}ต้นทุนส่วนเพิ่มต่อโทเคนเป็นศูนย์ {{2}}ไม่มีอะไรหลุดออกจากเครื่องของคุณ {{/2}}{{3}}ไม่มีขีดจำกัดอัตราการเรียกใช้ {{/3}}และควบคุมน้ำหนัก (weights) ได้อย่างเต็มที่ {{4}}มันไม่ได้ฟรีในเชิงสัมบูรณ์: {{/4}}คุณต้องจัดหา GPU และค่าไฟฟ้าเอง {{5}}และไฟล์ 2-bit บนการ์ด 12GB คือประสบการณ์ที่ถูกประนีประนอม {{/5}}{{6}}Qwen3.8 27B เป็นโมเดลแบบ dense และรองรับภาพ {{/6}}ดังนั้น 4-bit จึงมีน้ำหนัก 17.9GB ก่อนคิดบริบท (context) {{7}}ตัวเครื่องคือราคาค่าเข้าใช้งาน {{/7}}

เส้นทาง API นี้มีอยู่เพราะน้ำหนักโมเดลเป็น Apache-2.0 จึงใครก็ได้ที่สามารถโฮสต์ได้ด้วยต้นทุนส่วนเพิ่มเกือบเป็นศูนย์ Qwen3.8 27B อยู่ในแคตตาล็อกของ OrcaRouter ในวันนี้ที่ $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านโทเคนเอาต์พุต ซึ่งเป็นโมเดลที่โฮสต์เองบนโครงสร้างพื้นฐานของเราเอง — ไม่มีราคาผู้จำหน่ายให้ส่งผ่าน — พร้อมหน้าต่างบริบท 262K โทเคน และรองรับอินพุตที่เป็นข้อความ รูปภาพ และวิดีโอ เนื่องจากน้ำหนักเปิดเผย จึงมีชั้นฟรีแบบจำกัดอัตราที่คิด $0 ต่อคำขอด้วย เดือนที่มีการใช้งาน 10 ล้านโทเคน โดยมีสัดส่วนอินพุต 70% จะมีค่าใช้จ่ายประมาณ $9.51 ในชั้นแบบชำระเงิน หากคุณมีการ์ด 24GB อยู่แล้ว การรันในเครื่องชนะในเรื่องต้นทุน หากไม่มี การเช่าโทเคนในอัตรานั้นดีกว่าซื้อการ์ดสำหรับโปรเจกต์ข้างเคียง และชั้นฟรีคือวิธีที่ตรงไปตรงมาในการทดสอบโมเดลก่อนที่คุณจะลงทุนซื้อฮาร์ดแวร์

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

เมื่อ Unsloth คือคำตอบที่ผิด

Unsloth Studio และ GGUF pack เป็นตัวเลือกที่เหมาะสมสำหรับเครื่องเดียว แต่ไม่เหมาะสมเมื่อ:

คุณมีการ์ด Blackwell RTX 50-series. ควอนต์ของ unsloth/Qwen3.8-27B-NVFP4 เร็วกว่า BF16 ประมาณ 1.5× ใน VRAM เดียวกัน และใช้ FP8 KV cache เพื่อบริบทที่ยาวขึ้น เส้นทางนั้นทำงานผ่าน vLLM หรือ SGLang ไม่ใช่ GGUF และไม่ใช่ Studio.

คุณต้องใช้หน้าต่างเนทีฟเต็มรูปแบบขนาด 262K หรือส่วนขยาย YaRN ขนาด 1M ในการผลิต โมเดลวิชันแบบหนาแน่นที่บริบทยาวนั้นหนัก การปรับขนาดบริบทของ Unsloth จะยินดีรันด้วยขนาดที่สั้นลงให้คุณ แต่สแตกการให้บริการที่มีการจัดการ KV อย่างเหมาะสมยังดีกว่าแอปในเครื่อง

คุณกำลังให้บริการผู้ใช้จำนวนมาก Unsloth เป็นแอปพลิเคชันและไลบรารีสำหรับปรับแต่งโมเดลที่ทำงานในเครื่อง ไม่ใช่เซิร์ฟเวอร์แบบ multi-tenant สำหรับการทำงานพร้อมกัน การปรับขนาดอัตโนมัติ และการรับประกันเวลาทำงาน คุณควรใช้เอนด์พอยต์ที่โฮสต์ไว้

คุณไม่มี GPU เลย คำตอบที่ตรงไปตรงมา: โมเดล 27B แบบ 2-bit บนการ์ด 12GB ให้ผลลัพธ์ที่แย่กว่าโมเดลเดียวกันที่ให้บริการอย่างเหมาะสมอย่างเห็นได้ชัด ใช้ API ฟรีก่อน หากเพียงพอแล้ว ค่อยซื้อฮาร์ดแวร์เมื่อการใช้งานพิสูจน์แล้วว่าคุ้มค่า

คุณต้องการปรับแต่งฝั่งภาพ การเร่งความเร็วของ Unsloth กำหนดเป้าหมายที่ชั้นทรานส์ฟอร์มเมอร์ข้อความ ส่วนการปรับแต่งแบบมัลติโมดัลเต็มรูปแบบต้องใช้สแตกที่แตกต่างกัน

บรรทัดล่าง

Qwen3.8 27B กับ Unsloth เป็นปัญหาที่แก้สำเร็จแล้วในสัปดาห์นี้: ติดตั้ง Studio เลือก UD-Q4_K_XL สำหรับการ์ด 24GB (UD-Q3_K_XL สำหรับ 16GB, UD-IQ2_XXS สำหรับ 12GB) แล้วโมเดลก็ทำงานได้โดยไม่ต้องตั้งค่าใดๆ และไม่มีการคิดเงินต่อ token เส้นทาง fine-tuning เป็นของจริง และความเร็วที่ Unsloth อ้างคือเหตุผลที่ทำให้ 27B QLoRA ใช้งานได้จริงบนการ์ดใบเดียว รู้ไว้ว่าบันได quantization คือ Dynamic V3.0 (พรีวิว) ไม่ใช่ Dynamic 2.0 ตามที่บทความเก่าๆ อธิบาย; อัปเดต llama.cpp ให้ทันสมัยอยู่เสมอ; และถ้าคุณไม่มีฮาร์ดแวร์เป็นของตัวเอง น้ำหนักโมเดลเดียวกันนี้มี API ราคา $0.33/$2.40 พร้อมระดับจำกัดอัตราการใช้งานฟรี — ดังนั้นจึงไม่มีเหตุผลที่จะรันไฟล์ 2-bit ที่คุณไม่พอใจ Local เป็นเส้นทางฟรี และเป็นครั้งแรกในคลาสน้ำหนักนี้ที่มันยังเป็นเส้นทางง่ายอีกด้วย

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube