
รีวิว Qwen3.8-27B: โมเดลโอเพนเวตขนาด 27B ที่เป็น "Opus ฉบับบ้านๆ" — ทดสอบเทียบกับกระแส hype
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 ต่อ 1 ล้านโทเค็น · 22 tok/s
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
Qwen3.8 27Bเป็น open-weights 27B ที่ดีที่สุดที่คุณสามารถโฮสต์เองได้ในตอนนี้ และยังห่างชั้นมาก น้ำหนักถูกปล่อยเมื่อวันที่ 14 สิงหาคม 2026 ภายใต้ Apache 2.0: โมเดล dense 27B (28B หากนับ vision encoder) มี context ตามธรรมชาติ 262K รองรับ input ภาพและวิดีโอตามธรรมชาติ และคะแนน agentic-coding ที่ผู้ผลิตระบุว่าอยู่ในระดับเท่ากับหรือสูงกว่า Claude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3 ราคาหลักคือศูนย์: ดาวน์โหลด 55.6 GB แล้วรันได้เลย ข้อควรระวังก็มีจริงเช่นกัน — การทดสอบอิสระพบว่ามันช้ากว่ารุ่นก่อนประมาณสามเท่าและกินโทเค็นมากกว่า ทุก benchmark บนการ์ดยังคงเป็นข้อมูลที่รายงานโดย Alibaba และ context 1M เป็นฟีเจอร์สำหรับเวอร์ชันโฮสต์เท่านั้น สรุป: หากคุณมี GPU 24 GB ขึ้นไปและต้องการความสามารถใกล้เคียง frontier โดยไม่ต้องเสียเงินตามปริมาณการใช้งาน ก็โฮสต์เองได้เลย — แต่ควรรู้ไว้ก่อนว่าตัวเลขส่วนใดบ้างที่ยังไม่แข็งแรง
คำตัดสินก่อน: คุณควรใช้ Qwen3.8 27B หรือไม่?
คำตอบสั้น ๆ — ใช่สำหรับเวิร์กโหลดในเครื่องและส่วนตัว รอตัวเลขจากบุคคลที่สามก่อนตัดสินใจจัดซื้อ Qwen3.8 27Bเป็นโมเดลที่หายากซึ่ง open weights คือตัวผลิตภัณฑ์ และ API คือความสะดวกสบาย เนื่องจากใบอนุญาตเป็น Apache 2.0 ราคาต่อโทเคนจึงเป็นศูนย์ถาวรเมื่อคุณมีฮาร์ดแวร์แล้ว และไม่มีอะไรที่คุณสร้างบนนั้นจะถูกออกใบอนุญาตใหม่หรือเรียกเก็บเงินย้อนหลัง สิ่งที่คุณเสียไปคือความเร็ว การตรวจสอบ และความสะดวก
ถ้าคุณใช้งาน Qwen3.6-27B อยู่แล้วและพอใจกับมัน การอัปเกรดนั้นมีจริงแต่ไม่ฟรีในแง่ของเวลาที่ใช้จริง หากคุณมาที่นี่จากการเปิดตัว Qwen3.8-Max นี่คือสมาชิกที่เล็กกว่าและโฮสต์เองได้ในรุ่นเดียวกัน — เครื่องมือที่แตกต่างสำหรับงานที่แตกต่าง
ข้อเท็จจริงโดยย่อ ตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026
• เผยแพร่ — น้ำหนักโมเดลเปิดให้ใช้งานเมื่อวันที่ 14 สิงหาคม 2026 ที่ Qwen/Qwen3.8-27B บน Hugging Face และมีมิเรอร์บน ModelScope; รายงานที่อ้างอิงเขตเวลาระบุวันที่ 13 สิงหาคมเช่นกัน และการเผยแพร่ครั้งนี้เกิดขึ้นหลังจากเจนเนอเรชัน Qwen3.8 ถูกประกาศไปประมาณหนึ่งสัปดาห์
• สัญญาอนุญาต — Apache 2.0: ดาวน์โหลด แก้ไข แจกจ่าย ใช้ในเชิงพาณิชย์ได้ พร้อมการให้สิทธิ์สิทธิบัตรอย่างชัดแจ้ง ถาวร
• พารามิเตอร์ — dense ขนาด 27B (28B หากนับรวม vision encoder), 64 เลเยอร์, hidden size 5,120, ขนาดคำศัพท์ 248,320.
• สถาปัตยกรรม — ความสนใจแบบไฮบริด: เลเยอร์ Gated DeltaNet แบบ linear-attention 48 ชั้น เทียบกับเลเยอร์ Gated Attention เต็มรูปแบบ 16 ชั้น (อัตราส่วน 3:1) นี่คือเหตุผลที่โมเดลแบบหนาแน่น 27B สามารถรองรับโทเคนบริบทดั้งเดิมได้ 262K
• บริบท — รองรับ 262,144 โทเค็นโดยกำเนิด; ขยายได้ถึง 1,000,000 ผ่าน YaRN ในเวอร์ชันโฮสต์
• อินพุต — รองรับภาพและวิดีโอโดยตรงควบคู่กับข้อความ; ส่งคืนข้อความ ตัวเข้ารหัสภาพคือสาเหตุที่จำนวนพารามิเตอร์แสดงเป็น 28B
• การคิด — โหมดการใช้เหตุผลเปิดอยู่โดยค่าเริ่มต้น และสามารถปิดได้ตามคำขอ; reasoning_effort (ต่ำ/กลาง/สูง) และ preserve_thinking สำหรับการรันเอเจนต์ระยะยาว.
• น้ำหนัก — BF16 safetensors ขนาด 55.6 GB แบ่งเป็น 18 ชาร์ด; FP8 และ GGUFs จากชุมชนก็มีมาให้ด้วย
สเปกด้านบนมาจากการ์ดโมเดลและคอนฟิกของ Hugging Face สำหรับ Qwen3.8 27B ซึ่งอ่านเมื่อวันนี้ ข้ออ้างเรื่อง benchmark เป็นข้อมูลที่ Alibaba รายงานเอง ณ วันนี้ยังไม่มีห้องปฏิบัติการอิสระใดทำซ้ำผลดังกล่าวได้
สิ่งที่ Qwen3.8 27B ทำได้ดีอย่างแท้จริง
กรณีที่แข็งแกร่งที่สุดคือวิศวกรรมซอฟต์แวร์แบบเอเจนต์ Alibaba รายงานการเพิ่มขึ้น 3 เท่าบน DeepSWE 1.1 เมื่อเทียบกับรุ่น 27B ก่อนหน้า (42.2 เทียบกับ 13.3) และได้คะแนนสูงกว่า Claude Opus 4.6 Max บน SWE-bench Pro (61.7 เทียบกับ 53.4) นี่คือตัวเลขที่ทำให้มันได้รับฉายาว่า "Opus at home" — โมเดล 27B แบบ dense ที่ทำงานเขียนโค้ดระดับใกล้แนวหน้าบนฮาร์ดแวร์ที่บุคคลธรรมดาสามารถเป็นเจ้าของได้จริง

นอกเหนือจากตัวเลขดิบแล้ว ยังมีอีกสามสิ่งที่ทำให้การซื้อนี้สมเหตุสมผล:
• มัลติโมดัลแบบเนทีฟ. รองรับอินพุตรูปภาพและวิดีโอ เอาต์พุตเป็นข้อความ — เอกสารที่มีไดอะแกรมหรือวิดีโอแนะนำการใช้งานไม่ใช่โมเดลแยกต่างหาก คะแนนการให้เหตุผลทางภาพ (85.6 เมื่อเปิดใช้คุณสมบัติ chain-of-thought, 94.6 สำหรับคณิตศาสตร์ภาพ ทั้งคู่รายงานโดยผู้จำหน่าย) คือจุดที่ตัวเข้ารหัสภาพพิสูจน์คุณค่าของมัน
• 262K บริบทดั้งเดิม. งานเอเจนต์ระยะยาว โค้ดเบสขนาดใหญ่ และบทถอดความหลายชั่วโมงสามารถอยู่ในหน้าต่างเดียวได้ การออกแบบไฮบริดลิเนียร์-แอตเทนชันทำให้ต้นทุน KV ของบริบทนั้นต่ำกว่าโมเดลที่ใช้ full-attention เพียงอย่างเดียวที่มีขนาดเท่ากัน
• น้ำหนักโมเดลฟรีและถาวร นี่คือประเด็นหลักของหมวดหมู่นี้: โมเดล API แบบปิดเป็นแบบเช่า; Qwen3.8 27B เป็นของคุณ ที่ 4-bit มันรันบนการ์ด 24 GB (ระดับ RTX 3090/4090) และ AMD ให้การสนับสนุน Day-0 (สูงสุด 24.5 tokens/s บน Ryzen AI Max+ 395 และ 51.8 tokens/s บน Radeon AI PRO R9700 ตามบล็อกของ AMD เอง)
จุดที่รีวิวเริ่มแย่ลง: ความเร็ว โทเคน และการตรวจสอบ
การทดสอบอิสระในตอนนี้เป็นเพียงชุดทดสอบของคนคนเดียว ไม่ใช่ห้องปฏิบัติการ — แต่มันเป็นสัญญาณที่ดีที่สุดที่เรามี การรันQwen3.8 27BเทียบกับQwen3.6-27Bบนงานจริงสิบงาน (ตัดสินโดย GPT-5.5 ผ่านชุดทดสอบ llmcompare) รุ่น 3.8 ชนะเก้าในสิบงาน และได้คะแนนเฉลี่ย 8.838 เทียบกับ 6.862 — "หนึ่งในการเพิ่มพูนความฉลาดที่น่าประทับใจที่สุด" ที่ผู้ทดสอบเคยเห็น นอกจากนี้ยังใช้โทเคนเกือบสามเท่าและช้ากว่าอย่างเห็นได้ชัด งานหนึ่งใช้เวลานานขึ้นประมาณ 600% ดังนั้นการเพิ่มขึ้นของคุณภาพเป็นเรื่องจริง และราคาที่ต้องจ่ายในแง่เวลาจริงก็เป็นเรื่องจริงเช่นกัน
อีกสี่อย่างที่เอาไว้ตำหนิมัน:
• ยังไม่มีเกณฑ์วัดประสิทธิภาพจากบุคคลที่สาม ตัวเลขหลักทุกตัวในบทความนี้เป็นข้อมูลที่ Alibaba รายงาน ณ วันที่ 15 สิงหาคม การ์ดข้อมูลผู้จำหน่ายมีรายละเอียดครบถ้วน แต่ยังไม่มีการทดสอบซ้ำโดยห้องปฏิบัติการอิสระ หากการตัดสินใจของคุณขึ้นอยู่กับตัวเลขที่ผ่านการตรวจสอบแล้ว ก็ควรรอไว้ก่อน — น้ำหนักโมเดลจะยังอยู่ตรงนั้น
• VRAM ขั้นต่ำมีจริง BF16 ต้องการ GPU ระดับ 80 GB เพื่อให้พอดีกับการ์ด 24 GB คุณต้องรันแบบ 4-bit และรายงานจากชุมชน (กระทู้คอมเมนต์บน dev.to หลังปล่อยไม่กี่วัน) ระบุว่าบิวด์แบบ quantized 'เสียโฟกัสเมื่อคอนเทกซ์ยาว' ใช้เวตอย่างเป็นทางการหากมี VRAM เพียงพอ; ใช้แบบ quantized หากไม่มี
• บริบท 1M ใช้งานได้เฉพาะผ่านโฮสต์เท่านั้น. น้ำหนักเปิดจำกัดสูงสุดที่ 262K ส่วนค่าที่ขยายได้ถึง 1M เป็นฟีเจอร์ของ Qwen Cloud ที่โฮสต์ให้ใช้ ไม่ใช่สิ่งที่เวอร์ชันที่รันในเครื่องจะทำได้ทันทีโดยไม่ต้องตั้งค่า.
• "Beats Opus" ต้องมีข้อแม้. เกณฑ์วัดแบบเอเจนต์ให้รางวัลกับพฤติกรรมเฉพาะของชุดทดสอบ และคอมเมนต์ยอดนิยมบนโพสต์เปิดตัวที่ dev.to พูดตรงๆ ว่า "พวกมันไม่ได้เหนือกว่า Opus ในการใช้งานจริง." จงมองกระดานคะแนนเป็นขีดจำกัดบนในวันที่ดี ไม่ใช่คำสัญญา.
มันวางตัวอย่างไรในตระกูล Qwen 3.8
• เทียบกับ Qwen3.6-27B — ฮาร์ดแวร์คลาสเดียวกันและคอนเท็กซ์ 262K เท่าเดิม แต่ความสามารถก้าวกระโดดขึ้นอย่างมาก แลกมาด้วยความเร็วและประสิทธิภาพการใช้โทเคน หากคุณรัน 3.6 อยู่แล้วและมีข้อจำกัดด้านธรุปพุต การอยู่กับเวอร์ชันเดิมก็ถือว่าสมเหตุสมผล
• เทียบกับ Qwen3-Coder-30B-A3B — Coder เป็น MoE ที่มีพารามิเตอร์ที่ใช้งานจริงประมาณ 3.3B พันล้านตัว และทำงานได้เร็วกว่ามาก (~90–110 โทเคนต่อวินาที) โมเดล 27B แบบ dense นั้นช้ากว่าต่อโทเคน แต่สืบทอดประโยชน์ด้าน agentic ของเจนเนอเรชันนี้ หากคะแนนด้านวิศวกรรมซอฟต์แวร์ของรุ่น 27B ยังคงดีภายใต้การทดสอบอิสระ บทบาทของ Coder-30B ก็จะลดลง
• เทียบกับ Qwen3.8-Max — โมเดลเรือธง MoE ขนาด 2.4T เป็นโมเดลสำหรับดาตาเซ็นเตอร์ (ใช้ผ่าน API เท่านั้น ราคาประมาณ $2/$6 ต่อล้านโทเคนตามที่เผยแพร่) มีบริบท 1M และรองรับวิดีโอ ส่วนรุ่น 27B เป็นรุ่นที่นำไปปรับใช้ได้จริง ทั้งสองตอบคำถามคนละแบบ
ค่าใช้จ่าย: คำถามระหว่างโลคัลกับ API ยุติแล้ว
สำหรับโมเดลแบบปิด คุณเปรียบเทียบราคาต่อโทเค็น. สำหรับ Qwen3.8 27B ต้นทุนส่วนเพิ่มของโทเค็นบนฮาร์ดแวร์ของคุณเองคือศูนย์ — ราคาที่แท้จริงคือค่า GPU ล่วงหน้าและเวลาของคุณ ที่ 4-bit นั่นคือการ์ด 24 GB; ที่ BF16 คือเครื่องระดับ 80 GB หากคุณเพียงแค่ต้องการประเมินโมเดล หรือคุณไม่มีฮาร์ดแวร์ เส้นทางโฮสต์ก็มีอยู่: ตอนนี้ OrcaRouter แสดงรายการ Qwen3.8 27B ด้วยระดับฟรีที่จำกัดอัตรา ซึ่งเรียกเก็บเงิน $0 และคืน HTTP 429 เมื่อเกินขีดจำกัด รวมถึงระดับจ่ายเงินที่ $0.33 ต่อล้านโทเค็นนำเข้า และ $2.40 ต่อล้านโทเค็นส่งออก (ตรวจสอบเมื่อ 15 สิงหาคม) เวอร์ชันโฮสต์ของ Qwen Cloud ที่มีบริบท 1M ถูกระบุว่า "เร็ว ๆ นี้"

การวางกรอบอย่างตรงไปตรงมาคือ: สำหรับโมเดลแบบเปิดน้ำหนัก ผู้ให้บริการคือความสะดวก ไม่ใช่สิ่งที่ต้องพึ่งพา ระดับฟรีคือวิธีที่ถูกที่สุดในการตัดสินใจว่าการดาวน์โหลด 55.6 GB คุ้มค่าหรือไม่ แต่เมื่อคุณตัดสินใจแล้ว น้ำหนักคือสิ่งสำคัญ — และมันฟรี
วิธีลองใช้งานจริง
• การประเมินที่เร็วที่สุด — ลองใช้เทียร์โฮสต์ฟรีที่มีการจำกัดอัตราการใช้งาน; ถ้ามันตอบสิ่งที่คุณต้องการได้ คุณก็ถือว่าเสร็จสิ้นโดยไม่เสียค่าใช้จ่ายใด ๆ
• ทดสอบจริงบนฮาร์ดแวร์ของคุณ — ดาวน์โหลด GGUF จากชุมชน (บิลด์ Q4_K_M มีขนาดประมาณ 17 GB และพอดีกับการ์ด 24 GB) แล้วรันด้วย llama.cpp หรือ Ollama ส่ง Jinja chat template หรือโมเดลจะตอบคุณใน thought tags สำหรับ vision จาก GGUF คุณยังต้องใช้ไฟล์ mmproj แยกต่างหาก รันบุ๊กของเราสำหรับการรัน Qwen3.8 27B ในเครื่องจะอธิบายทีละขั้นตอน
• ความแม่นยำเต็มรูปแบบ — ดาวน์โหลด Qwen/Qwen3.8-27B ด้วยคำสั่ง huggingface-cli ลงบน GPU ระดับ 80 GB.
• ตรวจสอบสิ่งที่คุณดาวน์โหลด — ตรวจสอบว่าผู้เผยแพร่คือ Qwen org และตรวจสอบ shards กับ crc32.txt; มี repo ที่หน้าตาคล้ายกันปรากฏก่อนการเผยแพร่
เมื่อบทวิจารณ์นี้ผิด (และใครควรข้าม Qwen3.8 27B)
• คุณไม่มี GPU และจะไม่เช่ามัน ระดับฟรีถูกจำกัดอัตราการใช้งาน และระดับเสียเงินอยู่ที่ $0.33/$2.40 ต่อล้าน — โมเดล API ขนาดเล็กอาจให้บริการคุณได้ถูกกว่าและน่าเชื่อถือกว่า โมเดลนี้เหมาะสำหรับคนที่ต้องการเป็นเจ้าของการอินференซ์
• คุณต้องมี SLA โฮสต์เทียร์เพิ่งเปิดใช้งานไม่กี่วัน หน้าโมเดล OrcaRouter ที่อ่านวันนี้แสดงอัตราความผิดพลาด 33.3% ในเจ็ดวันล่าสุด และเวลา latency ของโทเค็นแรกที่ p50 เท่ากับ 225 ms นั่นคือโมเดลใหม่ภายใต้โหลดช่วงแรก ไม่ใช่สัญญาสำหรับการใช้งานจริง ผู้ที่โฮสต์เองควรปักหมุด commit ที่ดาวน์โหลดไว้และเก็บทางเลือกสำรองไว้
• คุณจำเป็นต้องมีผลการวัดประสิทธิภาพที่ได้รับการตรวจสอบแล้วสำหรับการตัดสินใจซื้อ ตัวเลขที่ผู้จำหน่ายรายงานมีประโยชน์เพียงแค่บอกทิศทางเท่านั้น ไม่ได้มีคุณภาพพอสำหรับการจัดซื้อ ควรรอผลการทดสอบซ้ำโดยอิสระ
• คอนเท็กซ์ 262K แบบโอเพนเวตส์ยังไม่เพียงพอ ส่วนขยาย 1M ในวันนี้มีเฉพาะแบบโฮสต์เท่านั้น
• ทรูพุตคือคอขวดของคุณ การสรุปแบบเป็นชุดใหญ่หรือแบตช์ขนาดใหญ่จะส่งผลเสีย: นี่คือโมเดล 27B แบบ Dense ที่กินโทเคนมากกว่ารุ่นก่อนประมาณ 3 เท่า สำหรับงานปริมาณมากที่เน้นความคุ้มค่า โมเดลที่เล็กกว่าหรือเร็วกว่าจะดีกว่า
• คุณใช้การ์ด 12 GB อยู่ โมเดล GGUF แบบ 2-bit พอจะใส่เข้าไปได้ แต่คุณภาพลดลงอย่างเห็นได้ชัด; โมเดลนี้ไม่เหมาะกับคุณ

สรุป
Qwen3.8 27B เป็นโมเดล open-weights ขนาด 27B ที่แข็งแกร่งที่สุดในปัจจุบัน และฟรีตลอดไปภายใต้ Apache 2.0 หากคุณมี GPU 24 GB+ และต้องการ agentic coding, คอนเท็กซ์ 262K, และการรับอินพุตรูปภาพ/วิดีโอแบบเนทีฟโดยไม่ต้องจ่ายตามการใช้งาน นี่คือตัวที่ควรซื้อ เหตุผลที่จะรอไว้ก็เป็นรูปธรรมไม่แพ้กัน: คุณต้องการการยืนยัน benchmark จากภายนอก, SLA, คอนเท็กซ์ open-weights มากกว่า 262K, หรือปริมาณงานที่สูงกว่าที่ dense 27B ให้ได้ โมเดลออกมาแล้ว, เวตมีจริง, และตัวเลขก็ดี — เพียงจำไว้ว่าตัวเลขเหล่านั้นเป็นของใคร
