
Qwen3.8-27B สำหรับการเขียนโค้ด: สิ่งที่คาดหวังได้ก่อนที่น้ำหนักโมเดลจะถูกปล่อยออกมา
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 ต่อ 1 ล้านโทเค็น
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 2401 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
หากคุณรันโมเดลในเครื่องสำหรับการเขียนโค้ด ตัวเลขที่สำคัญที่สุดจากการเปิดตัว Qwen3.8 ของ Alibaba เมื่อวันที่ 3 สิงหาคม 2026 ไม่ใช่ตัวเลขพาดหัว 2.4 ล้านล้านพารามิเตอร์ของ Qwen3.8-Max — แต่เป็นคะแนน FrontierSWE ที่พุ่งขึ้นจาก 40.7 ในรุ่นก่อนหน้ามาเป็น 73.5 ในรุ่นนี้ การพุ่งขึ้นครั้งนั้นเกิดขึ้นในรุ่นเรือธง โมเดลที่อาจนำความสามารถบางส่วนมาสู่ฮาร์ดแวร์ของคุณเองก็คือ Qwen3.8-27B สมาชิก open-weights ขนาดประมาณ 27 พันล้านพารามิเตอร์ของตระกูล Qwen3.8 ซึ่งประกาศในวันเดียวกันและยังไม่สามารถดาวน์โหลดได้ ณ เวลาที่เขียนบทความนี้ บทความนี้คือบทความสรุปสิ่งที่เรารู้จนถึงตอนนี้ ไม่ใช่รีวิว: ยังไม่มีใครนอกห้องปฏิบัติการของ Alibaba ที่ได้รัน Qwen3.8-27B ยังไม่มี official model card และการดาวน์โหลดใดๆ ที่อ้างว่าเป็นโมเดลนี้ในตอนนี้ก็เป็นเพียงตัวแทนหรือการอัปโหลดโดยบุคคลที่สาม
นี่คือจุดเริ่มต้นที่ตรงไปตรงมาสำหรับใครก็ตามที่วางแผนจะตั้งค่าระบบโค้ดดิ้งเฉพาะที่รอบๆ 27B: จุดเด่นของรุ่นเรือธงยังเป็นข้อมูลที่รายงานโดยผู้ผลิตจนกว่าจะมีการทดสอบอิสระออกมา สเปกของ 27B เองยังไม่ได้รับการยืนยัน และสิ่งเดียวที่เราวัดได้ในวันนี้คือรุ่นก่อนหน้าอย่าง Qwen3.6-27B — ซึ่งเป็นหนึ่งในโมเดลโค้ดดิ้งเฉพาะที่ที่ดีที่สุดของปี 2026 อยู่แล้ว นั่นคือเส้นฐานที่รุ่นนี้ต้องเอาชนะให้ได้ และมันก็เป็นเส้นฐานที่สูงมาก
ทำไม 27B ถึงเป็นโมเดลที่เหล่านักเขียนโค้ดให้ความสำคัญจริงๆ
Qwen3.8-Max คือโมเดลระดับดาตาเซ็นเตอร์: เป็น mixture-of-experts ที่มีพารามิเตอร์ 2.4T โดยมีพารามิเตอร์ที่ทำงานจริงประมาณ 95 พันล้านตัว รองรับบริบท 1M-token และไม่มีเส้นทางสำหรับผู้ใช้ทั่วไปที่จะรันในเครื่องของตัวเอง Qwen3.8-27B คือการเดิมพันที่ตรงกันข้าม — โมเดล open-weight ระดับ ~27B ที่ออกแบบมาสำหรับ GPU ตัวเดียว วางตำแหน่งเป็นเวอร์ชันที่โฮสต์เองได้ของเจนเนอเรชันนี้ สำหรับกลุ่มนักพัฒนา 27B คือผลิตภัณฑ์ ส่วน Max คือข้อพิสูจน์ว่าการฝึกฝนของเจนเนอเรชันนี้ทำให้เกิดบางสิ่งขึ้นมาจริง
สิ่งที่ว่า "บางอย่าง" นั้น ตามการประเมินของอาลีบาบาเอง: Terminal-Bench 2.1 ได้ 86.6 (เพิ่มขึ้นจาก 74.5 ของ Qwen 3.7 Max), SWE-bench Pro ได้ 67.7, PaperBench ได้ 93.0 และการกระโดดของ FrontierSWE จาก 40.7 เป็น 73.5 ซึ่งบ่งชี้ถึงการเปลี่ยนแปลงแบบก้าวกระโดดในงานเขียนโค้ดแบบเอเจนต์ระยะยาว — โมเดลทำงานกับงานใน repository แบบหลายขั้นตอนได้เอง แทนที่จะตอบพรอมป์เดี่ยว ๆ ผู้ติดตามอิสระวัด Qwen3.8-Max ได้ดัชนี Artificial Analysis Coding อยู่ที่ 71.8 และดัชนี Intelligence อยู่ที่ 58.1 ดังนั้นรุ่นนี้จึงเป็นของจริงแม้จะตัดการตลาดของอาลีบาบาออกไปแล้วก็ตาม ตัวเลขเหล่านั้นไม่ได้ส่งต่อไปยังรุ่น 27B โดยตรง แต่มันคือเหตุผลที่ทำให้รุ่น 27B เป็นโมเดลเขียนโค้ดท้องถิ่นที่ถูกจับตามองมากที่สุดในช่วงครึ่งหลังของปี 2026: โมเดลขนาดเล็กที่สืบทอดการปรับปรุงเชิงเอเจนต์แม้เพียงเสี้ยวเดียว จะนิยามความหมายของ "การเขียนโค้ดท้องถิ่นที่ดี" ที่สเกล 27B ขึ้นมาใหม่

รุ่นก่อนหน้าสร้างมาตรฐานไว้: Qwen3.6-27B
Qwen3.6-27B คือโมเดลที่เป็นพื้นฐานของการคาดการณ์ทั้งหมดสำหรับ 3.8 27B เพราะมันเป็นคลาสเดียวกันและมีฟิสิกส์เดียวกัน มันเป็นโมเดล dense ขนาด 27B ที่มีบริบทดั้งเดิม 262K มีทั้งโหมดคิดและโหมดไม่คิด รองรับการป้อนข้อความ ภาพ และวิดีโอโดยตรง และอยู่ภายใต้ลิขสิทธิ์ Apache 2.0 มันได้ชื่อเสียงในฐานะโมเดลเขียนโค้ดในเครื่อง ไม่ใช่เพราะชนะทุกเบนช์มาร์ก แต่เพราะเป็นโมเดลที่ใหญ่ที่สุดที่ยังพอรันบน GPU ทั่วไปในคุณภาพที่ใช้งานได้จริง — ซึ่งคือจุดบนเส้นโค้งขนาดและคุณภาพที่คุณหยุดแลกความสามารถกับฮาร์ดแวร์
นี่คือหน้าต่างบริบทของ 3.8-27B: มันต้องดีอย่างน้อยเท่า 3.6-27B ในต้นทุนฮาร์ดแวร์เท่าเดิม และ ideally ดีกว่าในงานแบบ agentic เพราะนั่นคือเหตุผลเดียวที่ซื่อสัตย์ที่จะเปลี่ยน ถ้ามันทำคะแนนเท่า 3.6 ในการเขียนโค้ดดิบ และเพิ่มความสามารถแบบ agentic ของรุ่นใหม่ มันก็จะกลายเป็นตัวเลือกท้องถิ่นเริ่มต้น ถ้ามันแค่วิ่งซ้ำคะแนนเดิม การอัปเกรดก็ถือว่าเล็กน้อยมาก
ความเป็นจริงด้านฮาร์ดแวร์: 16 GB คือคำถามที่ผิด
เนื่องจากไม่มีสเปกอย่างเป็นทางการ การคาดการณ์ VRAM จึงอ้างอิงจากการวัดผลของ Qwen3.6-27B และสรุปตามจริงก็คือ การควอนไทซ์แบบ 4 บิตต้องใช้การ์ดระดับ 24 GB ไม่ใช่ 16 GB ที่ระดับ Q4_K_M น้ำหนักโมเดลอยู่ที่ประมาณ 16–17 GB ซึ่งฟังดูเหมือนการ์ด 16 GB จะใส่ได้ — จนกระทั่งแคช KV และโอเวอร์เฮดของโมเดลผลักความต้องการจริงขึ้นไปที่ประมาณ 20–24 GB คำแนะนำเชิงปฏิบัติจากบทความของ Alibaba Cloud เองนั้นตรงไปตรงมา: Q4_K_M ไม่พอดีกับ GPU 16 GB ในการใช้งานจริง ตัวเลขจากชุมชนอยู่ที่ประมาณ:
• Q3_K_M — น้ำหนักประมาณ 13 GB ใช้กับการ์ด 12–16 GB ได้ แต่คุณภาพลดลง
• Q4_K_M — น้ำหนัก ~16–17 GB ในทางปฏิบัติจริงคือ 20–24 GB เมื่อรวมบริบท — จุดที่เหมาะสมที่สุดสำหรับ RTX 3090/4090
• Q6_K — ~21–22 GB, แทบไม่สูญเสียคุณภาพบนการ์ด 24 GB
• Q8_0 — ~28.6 GB ต้องการ 32 GB
• BF16 ความแม่นยำเต็มรูปแบบ — ประมาณ 54–56 GB เกินความสามารถของ GPU ระดับผู้บริโภคทุกตัว
Unsloth ได้สาธิตบิลด์ 4-bit ที่ทำงานบนหน่วยความจำประมาณ 17 GB ซึ่งสอดคล้องกับโมเดล ~27B ที่ระดับ 4-bit — ให้ถือว่านั่นคือค่าขั้นต่ำสำหรับเวิร์กโหลดแบบไม่มีคอนเท็กซ์และถูกตัดทอน ไม่ใช่ตัวเลขสำหรับการผลิตจริง หากคุณกำลังวางแผนจัดซื้อฮาร์ดแวร์ ให้วางแผนโดยอิงการ์ดหน่วยความจำ 24 GB
Toolchain: สิ่งที่มาวันแรกเทียบกับสัปดาห์ที่สอง
เมื่อน้ำหนักโมเดลถูกปล่อยออกมา การสนับสนุนไม่ได้มาถึงพร้อมกันทั้งหมด เอ็นจินให้บริการอย่าง vLLM และ SGLang โดยทั่วไปจะรวมการสนับสนุนภายในไม่กี่วันหลังจากการเปิดตัวของ Alibaba ซึ่งเป็นวิธีที่ผู้โฮสต์เองจะได้รับเอนด์พอยต์ที่เข้ากันได้กับ OpenAI อย่างรวดเร็ว การควอนไทซ์ GGUF และ AWQ จากชุมชนล่าช้าไปหนึ่งถึงสองสัปดาห์ ซึ่งหมายความว่าประสบการณ์ "ดึงแล้วรัน" ผ่านเครื่องมือที่ใช้ llama.cpp (Ollama, LM Studio) จะตามหลังน้ำหนักดิบ — และหาก 27B ใช้สถาปัตยกรรมใหม่จริง ๆ ร่วมกับ Max แทนที่จะใช้โครงสร้างแบบ 3.6 เดิม ก็คาดว่าเครื่องมือจะใช้เวลานานขึ้น ในหนึ่งถึงสองสัปดาห์แรก เส้นทางที่เร็วที่สุดคือการใช้ vLLM กับน้ำหนักที่ไม่ผ่านการควอนไทซ์ ไม่ใช่การดึงด้วยคำสั่งเดียว

โมเดล 27B ทำอะไรได้จริงบ้างสำหรับงานแบบเอเจนต์
ตั้งความคาดหวังให้ถูกต้อง: การสาธิตอัตโนมัติ 16 วัน — Qwen3.8 ของ Alibaba ที่สร้าง harness สำหรับเอเจนต์ที่วิวัฒน์ตนเองได้จากคอมมิตหลายร้อยครั้งโดยไม่มีการแทรกแซงจากมนุษย์ — เป็นการสาธิตเรือธง โมเดล 27B จะไม่ทำแบบนั้นได้ สิ่งที่โมเดลเขียนโค้ดระดับ 27B ในเครื่องทำได้ดีอย่างเห็นได้ชัด จากประสบการณ์ของชุมชนกับ Qwen3.6-27B และ Qwen3-Coder-30B-A3B คือ:
• จัดเตรียมและคัดกรอง tickets ระบุสาเหตุต้นตอ และวางรากฐานเพื่อให้โมเดลที่แข็งแกร่งกว่าทำงานให้สำเร็จ
• จัดการการรีแฟกเตอร์ทั้งระดับ repository และลูปการเรียกใช้เครื่องมือได้ด้วยความเร็วแบบอินเทอร์แอคทีฟ
• รันปริมาณการเขียนโค้ดในแต่ละวันบนเครื่องของคุณ — ข้อมูลยังคงอยู่ในเครื่องของคุณ และค่าใช้จ่ายคงที่
• รักษาอัตราความสำเร็จ ~50/50 ในการแก้ไขบั๊กที่ซับซ้อนอย่างแท้จริงให้สมบูรณ์ — ดีพอที่จะมีประโยชน์ แต่ไม่น่าเชื่อถือพอที่จะเป็นเอเจนต์เพียงตัวเดียวของคุณ
27B เป็นโมเดลสำหรับงานปริมาณสูงพร้อมกับมีส่วนการตัดสินใจในกรณีท้ายๆ มันจะยอดเยี่ยมในช่วงกลางของงานที่มีปริมาณสูง และจะผิดพลาดในสิบเปอร์เซ็นต์ที่ยากที่สุด นั่นไม่ใช่ข้อบกพร่อง แต่คือการออกแบบ
สร้างรอบ ๆ มัน: แยกทราฟฟิก
แผนการที่ทีมส่วนใหญ่เลือกใช้คือการแยก: โมเดล local 27B จัดการกับปริมาณงาน — การสร้างโค้ดประจำ, โบยเลอร์เพลต, การรีแฟกเตอร์, การแก้ไขแบบ lint — และโมเดล frontier แบบโฮสต์จัดการกับส่วนยากที่คุณภาพเพิ่มขึ้นอีกไม่กี่จุดก็คุ้มกับค่าใช้จ่าย API วิธีที่สะอาดในการใช้งานการแยกนี้คือผ่านเราเตอร์ เพราะทั้งสองฝ่ายล้มเหลวในอัตราที่ต่างกัน และคุณไม่ต้องการให้ไปป์ไลน์เอเจนต์ของคุณติดขัดกับคอขวดของ local หรือปัญหาขัดข้องของผู้ให้บริการ
นั่นคือเวิร์กโฟลว์ที่ OrcaRouter สร้างขึ้นมา Qwen3.8-Max ทำงานอยู่ที่นั่นในราคารายการของผู้ให้บริการ — 2 ดอลลาร์ต่อล้านโทเคนอินพุต 6 ดอลลาร์ต่อล้านเอาต์พุต — ส่งผ่านโดยไม่บวกกำไรเพิ่ม ดังนั้นเมื่อ Alibaba ลดอัตรา ค่าใช้จ่ายของคุณก็ลดลงในวันเดียวกัน คุณชี้เอนด์พอยต์ที่เข้ากันได้กับ OpenAI หนึ่งตัวไปที่การแยกเส้นทาง ส่งส่วนท้ายที่ยากไปยัง Qwen3.8-Max เก็บ 27B ในเครื่องสำหรับปริมาณมากเมื่อน้ำหนักโมเดลมาถึง และปล่อยให้ระบบ failover อัตโนมัติจับผู้ให้บริการที่ช้าหรือล้มเหลวโดยไม่ต้องแก้โค้ด คุณประเมิน 27B บนฮาร์ดแวร์ของคุณเองในขณะที่เส้นทางการผลิตยังทำงานอยู่ — โมเดลที่ยังไม่ได้รับการพิสูจน์จะไม่กลายเป็นจุดล้มเหลวจุดเดียว

สิ่งที่ควรตรวจสอบในวันที่น้ำหนักลดลง
เมื่อ official repository ปรากฏบน Hugging Face หรือ ModelScope ให้ตรวจสอบสิ่งเหล่านี้ก่อนที่จะสร้างอะไรก็ตามบนพื้นฐานของมัน:
• รีโพนี้อยู่ในองค์กร Qwen อย่างเป็นทางการ — ไม่ใช่ mirror หรือผู้แอบอ้างชื่อ
• ไฟล์ LICENSE มีอยู่จริง และตรงกับสัญญาอนุญาตที่บันทึกการเผยแพร่กล่าวอ้าง
การ์ดโมเดลเปิดเผยหน้าต่างบริบท สถาปัตยกรรม (Dense หรือ MoE) และโหมดการคิด
• การรันอิสระครั้งแรกต้องปรากฏบน Terminal-Bench หรือ Artificial Analysis — คำกล่าวอ้างของผู้จำหน่ายก็ยังคงเป็นคำกล่าวอ้างของผู้จำหน่ายจนกว่าจะถึงเวลานั้น
• รองรับ GGUF แล้วใน llama.cpp และรันไทม์ท้องถิ่นที่คุณชื่นชอบ
ในประเด็นสุดท้ายนั้น ระเบียบวินัยจากก่อนหน้านี้ยังคงใช้บังคับ: จนกว่าการรันโดยอิสระจะยืนยันถึงผลลัพธ์ด้านการเขียนโค้ด ให้ถือว่าคำมั่นสัญญาที่สืบทอดมาจาก FrontierSWE เป็นเหตุผลสำหรับการทดสอบ ไม่ใช่เหตุผลสำหรับการนำออกใช้งาน
ความคาดหวังที่กล่าวอย่างยุติธรรม: Qwen3.8-27B เป็นรีลีสโมเดลเขียนโค้ดท้องถิ่นที่ดูมีอนาคตที่สุดของปี 2026 บนกระดาษ — พื้นฐาน 27B ที่พิสูจน์แล้ว รวมถึงความก้าวหน้าจากการฝึกแบบเอเจนต์อีกรุ่นหนึ่ง ด้วยต้นทุนฮาร์ดแวร์ที่คอมมูนิตี้รู้วิธีจ่ายอยู่แล้ว ไม่ว่าจะเวิร์กจริงหรือไม่ก็ขึ้นอยู่กับเนื้อหาในค่าน้ำหนักจริงๆ ติดตามรีโพอย่างเป็นทางการ อ่านใบอนุญาต แล้วให้เบนช์มาร์กอิสระตัวแรกเป็นผู้ชี้ขาด จนกว่าจะถึงตอนนั้น Qwen3.6-27B ยังคงครองที่นั่ง และเรือธงแบบโฮสต์พร้อมจัดเส้นทางจะรับภาระส่วนที่ยากไปก่อน
