การ์ดฮีโร่แสดงข้อความ 'Qwen3.8-27B for Coding' พร้อมคำบรรยายใต้ 'สิ่งที่คาดหวังก่อนที่น้ำหนักจะถูกปล่อย' ชิปสำหรับ 'น้ำหนักแบบเปิดประมาณ 27B', 'การเขียนโค้ดแบบเอเจนต์' และ 'ประกาศเมื่อ 3 ส.ค. 2026' โดยมีโลโก้ OrcaRouter อยู่ที่มุม
Engineering & Research

Qwen3.8-27B สำหรับการเขียนโค้ด: สิ่งที่คาดหวังได้ก่อนที่น้ำหนักโมเดลจะถูกปล่อยออกมา

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

หากคุณรันโมเดลในเครื่องสำหรับการเขียนโค้ด ตัวเลขที่สำคัญที่สุดจากการเปิดตัว Qwen3.8 ของ Alibaba เมื่อวันที่ 3 สิงหาคม 2026 ไม่ใช่ตัวเลขพาดหัว 2.4 ล้านล้านพารามิเตอร์ของ Qwen3.8-Max — แต่เป็นคะแนน FrontierSWE ที่พุ่งขึ้นจาก 40.7 ในรุ่นก่อนหน้ามาเป็น 73.5 ในรุ่นนี้ การพุ่งขึ้นครั้งนั้นเกิดขึ้นในรุ่นเรือธง โมเดลที่อาจนำความสามารถบางส่วนมาสู่ฮาร์ดแวร์ของคุณเองก็คือ Qwen3.8-27B สมาชิก open-weights ขนาดประมาณ 27 พันล้านพารามิเตอร์ของตระกูล Qwen3.8 ซึ่งประกาศในวันเดียวกันและยังไม่สามารถดาวน์โหลดได้ ณ เวลาที่เขียนบทความนี้ บทความนี้คือบทความสรุปสิ่งที่เรารู้จนถึงตอนนี้ ไม่ใช่รีวิว: ยังไม่มีใครนอกห้องปฏิบัติการของ Alibaba ที่ได้รัน Qwen3.8-27B ยังไม่มี official model card และการดาวน์โหลดใดๆ ที่อ้างว่าเป็นโมเดลนี้ในตอนนี้ก็เป็นเพียงตัวแทนหรือการอัปโหลดโดยบุคคลที่สาม

นี่คือจุดเริ่มต้นที่ตรงไปตรงมาสำหรับใครก็ตามที่วางแผนจะตั้งค่าระบบโค้ดดิ้งเฉพาะที่รอบๆ 27B: จุดเด่นของรุ่นเรือธงยังเป็นข้อมูลที่รายงานโดยผู้ผลิตจนกว่าจะมีการทดสอบอิสระออกมา สเปกของ 27B เองยังไม่ได้รับการยืนยัน และสิ่งเดียวที่เราวัดได้ในวันนี้คือรุ่นก่อนหน้าอย่าง Qwen3.6-27B — ซึ่งเป็นหนึ่งในโมเดลโค้ดดิ้งเฉพาะที่ที่ดีที่สุดของปี 2026 อยู่แล้ว นั่นคือเส้นฐานที่รุ่นนี้ต้องเอาชนะให้ได้ และมันก็เป็นเส้นฐานที่สูงมาก

ทำไม 27B ถึงเป็นโมเดลที่เหล่านักเขียนโค้ดให้ความสำคัญจริงๆ

Qwen3.8-Max คือโมเดลระดับดาตาเซ็นเตอร์: เป็น mixture-of-experts ที่มีพารามิเตอร์ 2.4T โดยมีพารามิเตอร์ที่ทำงานจริงประมาณ 95 พันล้านตัว รองรับบริบท 1M-token และไม่มีเส้นทางสำหรับผู้ใช้ทั่วไปที่จะรันในเครื่องของตัวเอง Qwen3.8-27B คือการเดิมพันที่ตรงกันข้าม — โมเดล open-weight ระดับ ~27B ที่ออกแบบมาสำหรับ GPU ตัวเดียว วางตำแหน่งเป็นเวอร์ชันที่โฮสต์เองได้ของเจนเนอเรชันนี้ สำหรับกลุ่มนักพัฒนา 27B คือผลิตภัณฑ์ ส่วน Max คือข้อพิสูจน์ว่าการฝึกฝนของเจนเนอเรชันนี้ทำให้เกิดบางสิ่งขึ้นมาจริง

สิ่งที่ว่า "บางอย่าง" นั้น ตามการประเมินของอาลีบาบาเอง: Terminal-Bench 2.1 ได้ 86.6 (เพิ่มขึ้นจาก 74.5 ของ Qwen 3.7 Max), SWE-bench Pro ได้ 67.7, PaperBench ได้ 93.0 และการกระโดดของ FrontierSWE จาก 40.7 เป็น 73.5 ซึ่งบ่งชี้ถึงการเปลี่ยนแปลงแบบก้าวกระโดดในงานเขียนโค้ดแบบเอเจนต์ระยะยาว — โมเดลทำงานกับงานใน repository แบบหลายขั้นตอนได้เอง แทนที่จะตอบพรอมป์เดี่ยว ๆ ผู้ติดตามอิสระวัด Qwen3.8-Max ได้ดัชนี Artificial Analysis Coding อยู่ที่ 71.8 และดัชนี Intelligence อยู่ที่ 58.1 ดังนั้นรุ่นนี้จึงเป็นของจริงแม้จะตัดการตลาดของอาลีบาบาออกไปแล้วก็ตาม ตัวเลขเหล่านั้นไม่ได้ส่งต่อไปยังรุ่น 27B โดยตรง แต่มันคือเหตุผลที่ทำให้รุ่น 27B เป็นโมเดลเขียนโค้ดท้องถิ่นที่ถูกจับตามองมากที่สุดในช่วงครึ่งหลังของปี 2026: โมเดลขนาดเล็กที่สืบทอดการปรับปรุงเชิงเอเจนต์แม้เพียงเสี้ยวเดียว จะนิยามความหมายของ "การเขียนโค้ดท้องถิ่นที่ดี" ที่สเกล 27B ขึ้นมาใหม่

Scoreboard titled 'Qwen3.8-27B for coding - what is known' listing: status announced, weights not yet downloadable; class approx 27B, successor to Qwen3.6-27B; 4-bit VRAM 16-24 GB projected; Terminal-Bench 2.1 (Max) 86.6 vendor-reported; FrontierSWE (Max) 73.5 up from 40.7; independent coding score none yet.

รุ่นก่อนหน้าสร้างมาตรฐานไว้: Qwen3.6-27B

Qwen3.6-27B คือโมเดลที่เป็นพื้นฐานของการคาดการณ์ทั้งหมดสำหรับ 3.8 27B เพราะมันเป็นคลาสเดียวกันและมีฟิสิกส์เดียวกัน มันเป็นโมเดล dense ขนาด 27B ที่มีบริบทดั้งเดิม 262K มีทั้งโหมดคิดและโหมดไม่คิด รองรับการป้อนข้อความ ภาพ และวิดีโอโดยตรง และอยู่ภายใต้ลิขสิทธิ์ Apache 2.0 มันได้ชื่อเสียงในฐานะโมเดลเขียนโค้ดในเครื่อง ไม่ใช่เพราะชนะทุกเบนช์มาร์ก แต่เพราะเป็นโมเดลที่ใหญ่ที่สุดที่ยังพอรันบน GPU ทั่วไปในคุณภาพที่ใช้งานได้จริง — ซึ่งคือจุดบนเส้นโค้งขนาดและคุณภาพที่คุณหยุดแลกความสามารถกับฮาร์ดแวร์

นี่คือหน้าต่างบริบทของ 3.8-27B: มันต้องดีอย่างน้อยเท่า 3.6-27B ในต้นทุนฮาร์ดแวร์เท่าเดิม และ ideally ดีกว่าในงานแบบ agentic เพราะนั่นคือเหตุผลเดียวที่ซื่อสัตย์ที่จะเปลี่ยน ถ้ามันทำคะแนนเท่า 3.6 ในการเขียนโค้ดดิบ และเพิ่มความสามารถแบบ agentic ของรุ่นใหม่ มันก็จะกลายเป็นตัวเลือกท้องถิ่นเริ่มต้น ถ้ามันแค่วิ่งซ้ำคะแนนเดิม การอัปเกรดก็ถือว่าเล็กน้อยมาก

ความเป็นจริงด้านฮาร์ดแวร์: 16 GB คือคำถามที่ผิด

เนื่องจากไม่มีสเปกอย่างเป็นทางการ การคาดการณ์ VRAM จึงอ้างอิงจากการวัดผลของ Qwen3.6-27B และสรุปตามจริงก็คือ การควอนไทซ์แบบ 4 บิตต้องใช้การ์ดระดับ 24 GB ไม่ใช่ 16 GB ที่ระดับ Q4_K_M น้ำหนักโมเดลอยู่ที่ประมาณ 16–17 GB ซึ่งฟังดูเหมือนการ์ด 16 GB จะใส่ได้ — จนกระทั่งแคช KV และโอเวอร์เฮดของโมเดลผลักความต้องการจริงขึ้นไปที่ประมาณ 20–24 GB คำแนะนำเชิงปฏิบัติจากบทความของ Alibaba Cloud เองนั้นตรงไปตรงมา: Q4_K_M ไม่พอดีกับ GPU 16 GB ในการใช้งานจริง ตัวเลขจากชุมชนอยู่ที่ประมาณ:

• Q3_K_M — น้ำหนักประมาณ 13 GB ใช้กับการ์ด 12–16 GB ได้ แต่คุณภาพลดลง

• Q4_K_M — น้ำหนัก ~16–17 GB ในทางปฏิบัติจริงคือ 20–24 GB เมื่อรวมบริบท — จุดที่เหมาะสมที่สุดสำหรับ RTX 3090/4090

• Q6_K — ~21–22 GB, แทบไม่สูญเสียคุณภาพบนการ์ด 24 GB

• Q8_0 — ~28.6 GB ต้องการ 32 GB

• BF16 ความแม่นยำเต็มรูปแบบ — ประมาณ 54–56 GB เกินความสามารถของ GPU ระดับผู้บริโภคทุกตัว

Unsloth ได้สาธิตบิลด์ 4-bit ที่ทำงานบนหน่วยความจำประมาณ 17 GB ซึ่งสอดคล้องกับโมเดล ~27B ที่ระดับ 4-bit — ให้ถือว่านั่นคือค่าขั้นต่ำสำหรับเวิร์กโหลดแบบไม่มีคอนเท็กซ์และถูกตัดทอน ไม่ใช่ตัวเลขสำหรับการผลิตจริง หากคุณกำลังวางแผนจัดซื้อฮาร์ดแวร์ ให้วางแผนโดยอิงการ์ดหน่วยความจำ 24 GB

Toolchain: สิ่งที่มาวันแรกเทียบกับสัปดาห์ที่สอง

เมื่อน้ำหนักโมเดลถูกปล่อยออกมา การสนับสนุนไม่ได้มาถึงพร้อมกันทั้งหมด เอ็นจินให้บริการอย่าง vLLM และ SGLang โดยทั่วไปจะรวมการสนับสนุนภายในไม่กี่วันหลังจากการเปิดตัวของ Alibaba ซึ่งเป็นวิธีที่ผู้โฮสต์เองจะได้รับเอนด์พอยต์ที่เข้ากันได้กับ OpenAI อย่างรวดเร็ว การควอนไทซ์ GGUF และ AWQ จากชุมชนล่าช้าไปหนึ่งถึงสองสัปดาห์ ซึ่งหมายความว่าประสบการณ์ "ดึงแล้วรัน" ผ่านเครื่องมือที่ใช้ llama.cpp (Ollama, LM Studio) จะตามหลังน้ำหนักดิบ — และหาก 27B ใช้สถาปัตยกรรมใหม่จริง ๆ ร่วมกับ Max แทนที่จะใช้โครงสร้างแบบ 3.6 เดิม ก็คาดว่าเครื่องมือจะใช้เวลานานขึ้น ในหนึ่งถึงสองสัปดาห์แรก เส้นทางที่เร็วที่สุดคือการใช้ vLLM กับน้ำหนักที่ไม่ผ่านการควอนไทซ์ ไม่ใช่การดึงด้วยคำสั่งเดียว

Screenshot of the official Qwen Studio blog post 'Qwen3.8-Max: A New Bar for Coding and Cowork', dated 2026/08/03, announcing the Qwen3.8 generation.

โมเดล 27B ทำอะไรได้จริงบ้างสำหรับงานแบบเอเจนต์

ตั้งความคาดหวังให้ถูกต้อง: การสาธิตอัตโนมัติ 16 วัน — Qwen3.8 ของ Alibaba ที่สร้าง harness สำหรับเอเจนต์ที่วิวัฒน์ตนเองได้จากคอมมิตหลายร้อยครั้งโดยไม่มีการแทรกแซงจากมนุษย์ — เป็นการสาธิตเรือธง โมเดล 27B จะไม่ทำแบบนั้นได้ สิ่งที่โมเดลเขียนโค้ดระดับ 27B ในเครื่องทำได้ดีอย่างเห็นได้ชัด จากประสบการณ์ของชุมชนกับ Qwen3.6-27B และ Qwen3-Coder-30B-A3B คือ:

• จัดเตรียมและคัดกรอง tickets ระบุสาเหตุต้นตอ และวางรากฐานเพื่อให้โมเดลที่แข็งแกร่งกว่าทำงานให้สำเร็จ

• จัดการการรีแฟกเตอร์ทั้งระดับ repository และลูปการเรียกใช้เครื่องมือได้ด้วยความเร็วแบบอินเทอร์แอคทีฟ

• รันปริมาณการเขียนโค้ดในแต่ละวันบนเครื่องของคุณ — ข้อมูลยังคงอยู่ในเครื่องของคุณ และค่าใช้จ่ายคงที่

• รักษาอัตราความสำเร็จ ~50/50 ในการแก้ไขบั๊กที่ซับซ้อนอย่างแท้จริงให้สมบูรณ์ — ดีพอที่จะมีประโยชน์ แต่ไม่น่าเชื่อถือพอที่จะเป็นเอเจนต์เพียงตัวเดียวของคุณ

27B เป็นโมเดลสำหรับงานปริมาณสูงพร้อมกับมีส่วนการตัดสินใจในกรณีท้ายๆ มันจะยอดเยี่ยมในช่วงกลางของงานที่มีปริมาณสูง และจะผิดพลาดในสิบเปอร์เซ็นต์ที่ยากที่สุด นั่นไม่ใช่ข้อบกพร่อง แต่คือการออกแบบ

สร้างรอบ ๆ มัน: แยกทราฟฟิก

แผนการที่ทีมส่วนใหญ่เลือกใช้คือการแยก: โมเดล local 27B จัดการกับปริมาณงาน — การสร้างโค้ดประจำ, โบยเลอร์เพลต, การรีแฟกเตอร์, การแก้ไขแบบ lint — และโมเดล frontier แบบโฮสต์จัดการกับส่วนยากที่คุณภาพเพิ่มขึ้นอีกไม่กี่จุดก็คุ้มกับค่าใช้จ่าย API วิธีที่สะอาดในการใช้งานการแยกนี้คือผ่านเราเตอร์ เพราะทั้งสองฝ่ายล้มเหลวในอัตราที่ต่างกัน และคุณไม่ต้องการให้ไปป์ไลน์เอเจนต์ของคุณติดขัดกับคอขวดของ local หรือปัญหาขัดข้องของผู้ให้บริการ

นั่นคือเวิร์กโฟลว์ที่ OrcaRouter สร้างขึ้นมา Qwen3.8-Max ทำงานอยู่ที่นั่นในราคารายการของผู้ให้บริการ — 2 ดอลลาร์ต่อล้านโทเคนอินพุต 6 ดอลลาร์ต่อล้านเอาต์พุต — ส่งผ่านโดยไม่บวกกำไรเพิ่ม ดังนั้นเมื่อ Alibaba ลดอัตรา ค่าใช้จ่ายของคุณก็ลดลงในวันเดียวกัน คุณชี้เอนด์พอยต์ที่เข้ากันได้กับ OpenAI หนึ่งตัวไปที่การแยกเส้นทาง ส่งส่วนท้ายที่ยากไปยัง Qwen3.8-Max เก็บ 27B ในเครื่องสำหรับปริมาณมากเมื่อน้ำหนักโมเดลมาถึง และปล่อยให้ระบบ failover อัตโนมัติจับผู้ให้บริการที่ช้าหรือล้มเหลวโดยไม่ต้องแก้โค้ด คุณประเมิน 27B บนฮาร์ดแวร์ของคุณเองในขณะที่เส้นทางการผลิตยังทำงานอยู่ — โมเดลที่ยังไม่ได้รับการพิสูจน์จะไม่กลายเป็นจุดล้มเหลวจุดเดียว

Screenshot of the OrcaRouter model page for Qwen3.8 Max showing model ID qwen/qwen3.8-max, $2.00 per 1M input tokens, p50 TTFT 4.84 s, and a code sample.

สิ่งที่ควรตรวจสอบในวันที่น้ำหนักลดลง

เมื่อ official repository ปรากฏบน Hugging Face หรือ ModelScope ให้ตรวจสอบสิ่งเหล่านี้ก่อนที่จะสร้างอะไรก็ตามบนพื้นฐานของมัน:

• รีโพนี้อยู่ในองค์กร Qwen อย่างเป็นทางการ — ไม่ใช่ mirror หรือผู้แอบอ้างชื่อ

• ไฟล์ LICENSE มีอยู่จริง และตรงกับสัญญาอนุญาตที่บันทึกการเผยแพร่กล่าวอ้าง

การ์ดโมเดลเปิดเผยหน้าต่างบริบท สถาปัตยกรรม (Dense หรือ MoE) และโหมดการคิด

• การรันอิสระครั้งแรกต้องปรากฏบน Terminal-Bench หรือ Artificial Analysis — คำกล่าวอ้างของผู้จำหน่ายก็ยังคงเป็นคำกล่าวอ้างของผู้จำหน่ายจนกว่าจะถึงเวลานั้น

• รองรับ GGUF แล้วใน llama.cpp และรันไทม์ท้องถิ่นที่คุณชื่นชอบ

ในประเด็นสุดท้ายนั้น ระเบียบวินัยจากก่อนหน้านี้ยังคงใช้บังคับ: จนกว่าการรันโดยอิสระจะยืนยันถึงผลลัพธ์ด้านการเขียนโค้ด ให้ถือว่าคำมั่นสัญญาที่สืบทอดมาจาก FrontierSWE เป็นเหตุผลสำหรับการทดสอบ ไม่ใช่เหตุผลสำหรับการนำออกใช้งาน

ความคาดหวังที่กล่าวอย่างยุติธรรม: Qwen3.8-27B เป็นรีลีสโมเดลเขียนโค้ดท้องถิ่นที่ดูมีอนาคตที่สุดของปี 2026 บนกระดาษ — พื้นฐาน 27B ที่พิสูจน์แล้ว รวมถึงความก้าวหน้าจากการฝึกแบบเอเจนต์อีกรุ่นหนึ่ง ด้วยต้นทุนฮาร์ดแวร์ที่คอมมูนิตี้รู้วิธีจ่ายอยู่แล้ว ไม่ว่าจะเวิร์กจริงหรือไม่ก็ขึ้นอยู่กับเนื้อหาในค่าน้ำหนักจริงๆ ติดตามรีโพอย่างเป็นทางการ อ่านใบอนุญาต แล้วให้เบนช์มาร์กอิสระตัวแรกเป็นผู้ชี้ขาด จนกว่าจะถึงตอนนั้น Qwen3.6-27B ยังคงครองที่นั่ง และเรือธงแบบโฮสต์พร้อมจัดเส้นทางจะรับภาระส่วนที่ยากไปก่อน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube