
การวัดประสิทธิภาพของ Qwen3.8-27B: ตารางฉบับเต็ม พร้อมข้อควรระวังที่แนบมา
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
Qwen3.8-27Bทำคะแนน Terminal-Bench 2.1 ได้ 73.0, SWE-bench Pro ได้ 61.7, LiveCodeBench v6 ได้ 90.3 และ OSWorld-Verified ได้ 84.3 — และตัวเลขทุกตัวนั้นเป็นของ Alibaba เอง โมเดลเปิดน้ำหนัก 27 พันล้านพารามิเตอร์นี้เผยแพร่บน Hugging Face เมื่อวันที่ 14 สิงหาคม 2026 ภายใต้สัญญา Apache 2.0 และ ณ วันที่ 15 สิงหาคม ยังไม่มีใครนอก Alibaba ที่ให้คะแนนคุณภาพของมันอย่างอิสระ หน้านี้คือสรุปแบบครบถ้วนพร้อมแหล่งอ้างอิง: เบนช์มาร์กทางการทั้ง 25 รายการจาก model card, สิ่งที่เปลี่ยนแปลงไปเมื่อเทียบกับรุ่นก่อนหน้า Qwen3.6-27B, ผลการทดสอบปริมาณงานอิสระจาก AMD, และข้ออ้างใดที่คุณควรถือเป็นเพียงข้อมูลเบื้องต้น
คู่มือการอ่านก่อนตัวเลข: "ทางการ" ในที่นี้หมายถึงการประเมินของ Alibaba ที่พิมพ์บนการ์ดโมเดลที่ Qwen/Qwen3.8-27B. รายงานดังกล่าวมาจากผู้ผลิตและไม่มีการตรวจสอบซ้ำ "อิสระ" หมายถึงบุคคลภายนอกห้องปฏิบัติการเป็นผู้วัดผล — จนถึงตอนนี้ใช้กับปริมาณงานฮาร์ดแวร์เท่านั้น ไม่ใช่คะแนนคุณภาพใดๆ เกณฑ์มาตรฐานที่ต้องคำนึงถึงชุดทดสอบ (harness) จะถูกทำเครื่องหมายไว้ในตัวข้อความ.
โมเดล หนึ่งบรรทัดต่อสเปก
• พารามิเตอร์แบบหนาแน่น 27B (รวมตัวเข้ารหัสวิทัศน์แล้ว 28B), 64 ชั้น, ขนาดซ่อน 5120
• แอตเทนชันแบบผสม — เลเยอร์แอตเทนชันเชิงเส้น Gated DeltaNet 48 ชั้น บวกกับเลเยอร์แอตเทนชันแบบเต็ม 16 ชั้น ในอัตราส่วน 3:1 — ซึ่งเป็นสิ่งที่ทำให้หน้าต่างขนาด 262K โทเคนสามารถรันได้ในต้นทุนที่ย่อมเยา
• บริบทดั้งเดิม 262,144 โทเคน ขยายได้ถึง 1,000,000 ด้วยการปรับสเกล YaRN
รองรับการรับอินพุตรูปภาพและวิดีโอโดยตรง (เอาต์พุตเป็นข้อความ), น้ำหนักโมเดลภายใต้สัญญาอนุญาต Apache 2.0, ขนาดประมาณ 55.6GB ในรูปแบบ BF16
พูดแบบสั้น ๆ: นี่คือโมเดลที่ตั้งใจจะนำสิ่งที่ Alibaba เรียนรู้จากการสร้าง Qwen3.8-Max ซึ่งมีพารามิเตอร์ 2.4 ล้านล้านตัว มาบีบอัดให้เป็นสิ่งที่ GPU เพียงตัวเดียวสามารถรันได้
ตารางคะแนน: ทุกเกณฑ์มาตรฐานบนการ์ดโมเดล
คะแนนทั้งหมดด้านล่างนี้เป็นคะแนนที่ Alibaba รายงานจากเอกสารข้อมูลโมเดลวันที่ 14 สิงหาคม โดยคะแนน Qwen3.6-27B ที่โมเดลนี้แทนที่แสดงอยู่ในวงเล็บ
การเขียนโค้ด Terminal-Bench 2.1 (การเขียนโค้ดเทอร์มินัลแบบเอเจนต์) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9) การรัน SWE-bench Pro และ QwenSWEBench ใช้ฮาร์เนส Claude Code ตามเชิงอรรถของโมเดลการ์ด — ควรระลึกไว้ก่อนเปรียบเทียบกับโมเดลที่ให้คะแนนด้วยฮาร์เนสที่แตกต่างกัน
เอเจนต์ระยะยาวและงานสำนักงาน CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / คะแนน 42.9 (10.6 / 27.3).
การใช้เหตุผลและความรู้ GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench การทำตามคำสั่ง 79.5 (69.1). HLE ถูกประเมินโดย GPT-4o ตามการ์ด.
วิสัยทัศน์และการใช้งานคอมพิวเตอร์ OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 ด้วย CI / 90.0 โดยไม่ใช้ (85.1); BabyVision 85.6 ด้วย CI / 65.7 โดยไม่ใช้ (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1) "CI" คือการเพิ่มประสิทธิภาพแบบ inference-time ของ Alibaba; ช่องว่างระหว่างสถานะเปิดและปิดคือตัวเลขที่ให้ข้อมูลมากที่สุดเพียงตัวเดียวบนการ์ดเกี่ยวกับคะแนนที่คุณสามารถซื้อได้ด้วยการคำนวณ inference เพิ่มเติม

สิ่งที่เปลี่ยนแปลงจริงเมื่อเทียบกับ Qwen3.6-27B
การวัดประสิทธิภาพทุกตัวบนการ์ดใบนี้เพิ่มขึ้น แต่ความแตกต่างไม่ได้สม่ำเสมอ — และรูปแบบของการปรับปรุงนั้นคือเรื่องราวที่แท้จริง จุดที่ได้ประโยชน์กระจุกตัวอยู่ที่การเขียนโค้ดแบบเอเจนต์และการใช้งานคอมพิวเตอร์ ไม่ใช่การเรียกคืนความรู้:
• DeepSWE 1.1 (การเขียนโค้ดแบบเอเจนต์) 13.3 → 42.2 ซึ่งเพิ่มขึ้นประมาณ 3 เท่า
• QwenSWEBench 49.3 → 79.0
• Agents' Last Exam คะแนน 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 และ AndroidWorld 70.3 → 81.9
• BabyVision (ด้วย CI) 28.9 → 85.6 — การเพิ่มขึ้นเชิงสัมพัทธ์ที่มากที่สุดบนการ์ด
ในขณะเดียวกัน GPQA Diamond เคลื่อนจาก 87.8 → 89.2 และ RealWorldQA จาก 84.1 → 85.9: จริงแต่เล็กน้อย นี่ไม่ใช่การเปิดตัวที่ "ฉลาดขึ้นทุกอย่าง" แต่เป็นการเปิดตัวที่มุ่งเป้าไปที่เอเจนต์ที่อ่านหน้าจอ ใช้เครื่องมือ และเขียนโค้ดในหลายขั้นตอน

ช่องว่างที่ต้องยอมรับอย่างตรงไปตรงมา: จุดที่ยังพ่ายแพ้ และข้อควรระวังด้านระเบียบวิธี
เมื่อเทียบกับระดับแนวหน้า ภาพที่ออกมาดูดีแต่ไม่ใช่ด้านเดียว ในจุดที่ Qwen3.8-27B และ Claude Opus 4.6 Max ทับซ้อนกัน Qwen ชนะส่วนใหญ่ — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench และกลุ่มวิทัศน์ทั้งหมด เมื่อเทียบกับ Muse Glimmer-30B ของ Meta ซึ่งเป็นคู่แข่งระดับท้องถิ่นตามธรรมชาติ มันชนะทั้งแปดเกณฑ์ที่ทับซ้อนกันอย่างขาดลอย แต่ก็ยังแพ้ Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) และ NL2Repo-Bench (42.3 vs 47.6) ให้กับ Claude Opus 4.6 Max หากงานของคุณคือการให้เหตุผลระดับแนวหน้าที่ยากที่สุด — คณิตศาสตร์ระดับแนวหน้า คำถามหลากหลายสาขาอย่างยิ่ง — 27B ยังไปไม่ถึงจุดนั้น
ก่อนที่คุณจะอ้างอิงสิ่งเหล่านี้ มีข้อควรระวังสามประการ ประการแรก ไม่มีสิ่งใดได้รับการตรวจสอบโดยอิสระ ยังไม่มีดัชนี Artificial Analysis และไม่มีการรัน LMArena สำหรับ 27B ณ วันที่ 15 สิงหาคม และชุดทดสอบของ Alibaba เองก็ไม่ใช่ชุดที่บุคคลที่สามจะใช้ ประการที่สอง การ์ดโมเดลใช้ชุดทดสอบ Claude Code สำหรับ SWE-bench Pro และ QwenSWEBench และใช้ผู้ตัดสิน GPT-4o สำหรับ Humanity's Last Exam — การเปรียบเทียบกับโมเดลที่ให้คะแนนด้วยชุดทดสอบอื่น ๆ จะทำให้ตัวเลขเปลี่ยนไป ประการที่สาม การรัน MathVision ของ Alibaba ใช้พรอมป์ตแบบคงที่ ในขณะที่คู่แข่งได้ค่าที่สูงกว่าระหว่างสองตัวแปร ทั้งหมดนี้ไม่ได้หมายความว่าผลลัพธ์ผิด แต่มันหมายความว่ามันเป็นเพดาน ไม่ใช่พื้น จนกว่าคนอื่นจะรันโมเดลนี้
สิ่งที่ต้องใช้ในการรันมัน
Qwen3.8-27B เป็นโมเดลท้องถิ่น (local model) ซึ่งเปลี่ยนความหมายของ "ประสิทธิภาพ": คือปริมาณงานบนฮาร์ดแวร์ของคุณเอง แทนที่จะเป็นป้ายราคา น้ำหนัก BF16 อยู่ที่ประมาณ 55.6GB; เมื่อควอนไทซ์เป็น 4 บิต พอดีกับการ์ด 24GB เช่น RTX 3090 หรือ 4090 AMD เปิดตัวการสนับสนุน Day-0 ในวันวางจำหน่าย และการวัดผลของตัวเองด้วย llama.cpp/Vulkan — สิงหาคม 2026, เฉลี่ยสามครั้งขึ้นไป — ระบุไว้ที่ 24.5 tokens/s บน Ryzen AI Max+ 395 และ 51.8 tokens/s บน Radeon AI PRO R9700 ที่มี 32GB บนระบบที่มีหน่วยความจำกราฟิกแปรผันหรือ VRAM มากกว่าประมาณ 24GB การทดสอบของชุมชนกับบิลด์ FP8 บน NVIDIA GH200 รองรับคำขอ 10 รายการพร้อมกันในบริบท 262K โดยมีเวลาไปยังโทเค็นแรก (time-to-first-token) ต่ำกว่า 10ms ตัวเลขของคุณเองอาจแตกต่างกัน — เพราะนั่นคือ GPU ของคนอื่น — แต่รูปร่างนั้นเป็นจริง: นี่คือการเปิดตัว Qwen ครั้งแรกในคลาสนี้ที่ทำงานได้ ไม่ใช่แค่ในรีวิว บนเวิร์กสเตชันเครื่องเดียว
เวทฟรี หรือ API แบบเสียเงิน?
การตัดสินใจที่โมเดลนี้บังคับให้คุณทำ คือการแบ่งระหว่างระบบท้องถิ่นกับระบบโฮสต์: ตัวน้ำหนัก (weights) ไม่มีค่าใช้จ่าย แต่ GPU ของคุณไม่ฟรี การโฮสต์เองหมายถึงการเป็นเจ้าของซิลิคอน — การ์ด 24GB หนึ่งใบถ้าคุณยอมรับการควอนไทซ์แบบ 4 บิตและการสร้างข้อความที่ช้าลง หรืออะไรที่ใหญ่กว่านั้นถ้าคุณต้องการบริบท 262K เต็มรูปแบบที่คุณภาพเต็ม ทางเลือกแบบโฮสต์บน OrcaRouter คิดราคา $0.33 ต่อล้านโทเคนนำเข้า และ $2.40 ต่อล้านโทเคนส่งออก พร้อมบริบท 262K เท่ากันและอินพุตรูปภาพบวกวิดีโอ และค่า p50 ของเวลาจนถึงโทเคนแรกที่ 225ms ซึ่งวัดในเจ็ดวันที่ผ่านมา — ไม่ต้องซื้อ GPU ไม่ต้องดูแล VRAM เลขคณิตก็คือแบบที่คุณทำกับโอเพนเวตเสมอ: ปริมาณโทเคนที่คุณต้องการจริงคูณด้วยต้นทุนต่อโทเคน เทียบกับราคาแบนของการ์ด ที่ปริมาณการใช้งานต่อเนื่องสูง การโฮสต์เองชนะ; ที่ปริมาณแบบกระชุหรือปานกลาง การจ่าย $0.33/$2.40 ดีกว่าการซื้อซิลิคอนที่คุณปล่อยว่างเป็นส่วนใหญ่

บรรทัดล่าง
Qwen3.8-27B เป็นโมเดลโอเพนเวตที่แข็งแกร่งที่สุดที่ Alibaba เปิดตัวในคลาสขนาดนี้ ตามตัวเลขของ Alibaba เอง: ครองอันดับหนึ่งในตารางด้านการเขียนโค้ดแบบเอเจนต์ (agentic coding) การใช้คอมพิวเตอร์ (computer use) และการให้เหตุผลเชิงวิทัศน์ (vision reasoning) พร้อมหน้าต่างบริบท 262K และน้ำหนักโมเดลแบบ Apache 2.0 การอ่านตารางคะแนนอย่างถูกต้องต้องดูแบบมีเงื่อนไข — ตัวเลขทุกรายการมาจากการรายงานของผู้ผลิต จำเพาะกับชุดทดสอบ และยังไม่มีการยืนยันซ้ำ และโมเดลระดับแนวหน้าเองก็ยังชนะเบนช์มาร์กการให้เหตุผลที่ยากที่สุด หากคุณกำลังตัดสินใจว่าจะโฮสต์เองหรือเรียกใช้เป็น API ให้มองตารางเบนช์มาร์กว่าเป็นคำสัญญา และมองตัวเลขทรูพุตของ AMD ว่าเป็นการวัดผลอิสระเพียงอย่างเดียวที่มีอยู่ในตอนนี้ เราจะอัปเดตหน้านี้ในวันที่ห้องแล็บอิสระเผยแพร่คะแนน
