การ์ดไตเติลสำหรับการสรุปผลเบนช์มาร์ก Qwen3.8-27B แสดงการ์ดรายงานผลเบนช์มาร์กพร้อมตราประทับที่เขียนว่า OPEN WEIGHTS และไอคอนสำหรับการเขียนโค้ด ปริมาณงาน การมองเห็น บริบทระยะยาว และฮาร์ดแวร์ในเครื่อง พร้อมชิปที่เขียนว่า 27B DENSE, 262K CONTEXT และ APACHE 2.0
Guides & Insights

การวัดประสิทธิภาพของ Qwen3.8-27B: ตารางฉบับเต็ม พร้อมข้อควรระวังที่แนบมา

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Qwen3.8-27Bทำคะแนน Terminal-Bench 2.1 ได้ 73.0, SWE-bench Pro ได้ 61.7, LiveCodeBench v6 ได้ 90.3 และ OSWorld-Verified ได้ 84.3 — และตัวเลขทุกตัวนั้นเป็นของ Alibaba เอง โมเดลเปิดน้ำหนัก 27 พันล้านพารามิเตอร์นี้เผยแพร่บน Hugging Face เมื่อวันที่ 14 สิงหาคม 2026 ภายใต้สัญญา Apache 2.0 และ ณ วันที่ 15 สิงหาคม ยังไม่มีใครนอก Alibaba ที่ให้คะแนนคุณภาพของมันอย่างอิสระ หน้านี้คือสรุปแบบครบถ้วนพร้อมแหล่งอ้างอิง: เบนช์มาร์กทางการทั้ง 25 รายการจาก model card, สิ่งที่เปลี่ยนแปลงไปเมื่อเทียบกับรุ่นก่อนหน้า Qwen3.6-27B, ผลการทดสอบปริมาณงานอิสระจาก AMD, และข้ออ้างใดที่คุณควรถือเป็นเพียงข้อมูลเบื้องต้น

คู่มือการอ่านก่อนตัวเลข: "ทางการ" ในที่นี้หมายถึงการประเมินของ Alibaba ที่พิมพ์บนการ์ดโมเดลที่ Qwen/Qwen3.8-27B. รายงานดังกล่าวมาจากผู้ผลิตและไม่มีการตรวจสอบซ้ำ "อิสระ" หมายถึงบุคคลภายนอกห้องปฏิบัติการเป็นผู้วัดผล — จนถึงตอนนี้ใช้กับปริมาณงานฮาร์ดแวร์เท่านั้น ไม่ใช่คะแนนคุณภาพใดๆ เกณฑ์มาตรฐานที่ต้องคำนึงถึงชุดทดสอบ (harness) จะถูกทำเครื่องหมายไว้ในตัวข้อความ.

โมเดล หนึ่งบรรทัดต่อสเปก

• พารามิเตอร์แบบหนาแน่น 27B (รวมตัวเข้ารหัสวิทัศน์แล้ว 28B), 64 ชั้น, ขนาดซ่อน 5120

• แอตเทนชันแบบผสม — เลเยอร์แอตเทนชันเชิงเส้น Gated DeltaNet 48 ชั้น บวกกับเลเยอร์แอตเทนชันแบบเต็ม 16 ชั้น ในอัตราส่วน 3:1 — ซึ่งเป็นสิ่งที่ทำให้หน้าต่างขนาด 262K โทเคนสามารถรันได้ในต้นทุนที่ย่อมเยา

• บริบทดั้งเดิม 262,144 โทเคน ขยายได้ถึง 1,000,000 ด้วยการปรับสเกล YaRN

รองรับการรับอินพุตรูปภาพและวิดีโอโดยตรง (เอาต์พุตเป็นข้อความ), น้ำหนักโมเดลภายใต้สัญญาอนุญาต Apache 2.0, ขนาดประมาณ 55.6GB ในรูปแบบ BF16

พูดแบบสั้น ๆ: นี่คือโมเดลที่ตั้งใจจะนำสิ่งที่ Alibaba เรียนรู้จากการสร้าง Qwen3.8-Max ซึ่งมีพารามิเตอร์ 2.4 ล้านล้านตัว มาบีบอัดให้เป็นสิ่งที่ GPU เพียงตัวเดียวสามารถรันได้

ตารางคะแนน: ทุกเกณฑ์มาตรฐานบนการ์ดโมเดล

คะแนนทั้งหมดด้านล่างนี้เป็นคะแนนที่ Alibaba รายงานจากเอกสารข้อมูลโมเดลวันที่ 14 สิงหาคม โดยคะแนน Qwen3.6-27B ที่โมเดลนี้แทนที่แสดงอยู่ในวงเล็บ

การเขียนโค้ด Terminal-Bench 2.1 (การเขียนโค้ดเทอร์มินัลแบบเอเจนต์) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9) การรัน SWE-bench Pro และ QwenSWEBench ใช้ฮาร์เนส Claude Code ตามเชิงอรรถของโมเดลการ์ด — ควรระลึกไว้ก่อนเปรียบเทียบกับโมเดลที่ให้คะแนนด้วยฮาร์เนสที่แตกต่างกัน

เอเจนต์ระยะยาวและงานสำนักงาน CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / คะแนน 42.9 (10.6 / 27.3).

การใช้เหตุผลและความรู้ GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench การทำตามคำสั่ง 79.5 (69.1). HLE ถูกประเมินโดย GPT-4o ตามการ์ด.

วิสัยทัศน์และการใช้งานคอมพิวเตอร์ OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 ด้วย CI / 90.0 โดยไม่ใช้ (85.1); BabyVision 85.6 ด้วย CI / 65.7 โดยไม่ใช้ (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1) "CI" คือการเพิ่มประสิทธิภาพแบบ inference-time ของ Alibaba; ช่องว่างระหว่างสถานะเปิดและปิดคือตัวเลขที่ให้ข้อมูลมากที่สุดเพียงตัวเดียวบนการ์ดเกี่ยวกับคะแนนที่คุณสามารถซื้อได้ด้วยการคำนวณ inference เพิ่มเติม

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

สิ่งที่เปลี่ยนแปลงจริงเมื่อเทียบกับ Qwen3.6-27B

การวัดประสิทธิภาพทุกตัวบนการ์ดใบนี้เพิ่มขึ้น แต่ความแตกต่างไม่ได้สม่ำเสมอ — และรูปแบบของการปรับปรุงนั้นคือเรื่องราวที่แท้จริง จุดที่ได้ประโยชน์กระจุกตัวอยู่ที่การเขียนโค้ดแบบเอเจนต์และการใช้งานคอมพิวเตอร์ ไม่ใช่การเรียกคืนความรู้:

• DeepSWE 1.1 (การเขียนโค้ดแบบเอเจนต์) 13.3 → 42.2 ซึ่งเพิ่มขึ้นประมาณ 3 เท่า

• QwenSWEBench 49.3 → 79.0

• Agents' Last Exam คะแนน 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 และ AndroidWorld 70.3 → 81.9

• BabyVision (ด้วย CI) 28.9 → 85.6 — การเพิ่มขึ้นเชิงสัมพัทธ์ที่มากที่สุดบนการ์ด

ในขณะเดียวกัน GPQA Diamond เคลื่อนจาก 87.8 → 89.2 และ RealWorldQA จาก 84.1 → 85.9: จริงแต่เล็กน้อย นี่ไม่ใช่การเปิดตัวที่ "ฉลาดขึ้นทุกอย่าง" แต่เป็นการเปิดตัวที่มุ่งเป้าไปที่เอเจนต์ที่อ่านหน้าจอ ใช้เครื่องมือ และเขียนโค้ดในหลายขั้นตอน

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

ช่องว่างที่ต้องยอมรับอย่างตรงไปตรงมา: จุดที่ยังพ่ายแพ้ และข้อควรระวังด้านระเบียบวิธี

เมื่อเทียบกับระดับแนวหน้า ภาพที่ออกมาดูดีแต่ไม่ใช่ด้านเดียว ในจุดที่ Qwen3.8-27B และ Claude Opus 4.6 Max ทับซ้อนกัน Qwen ชนะส่วนใหญ่ — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench และกลุ่มวิทัศน์ทั้งหมด เมื่อเทียบกับ Muse Glimmer-30B ของ Meta ซึ่งเป็นคู่แข่งระดับท้องถิ่นตามธรรมชาติ มันชนะทั้งแปดเกณฑ์ที่ทับซ้อนกันอย่างขาดลอย แต่ก็ยังแพ้ Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) และ NL2Repo-Bench (42.3 vs 47.6) ให้กับ Claude Opus 4.6 Max หากงานของคุณคือการให้เหตุผลระดับแนวหน้าที่ยากที่สุด — คณิตศาสตร์ระดับแนวหน้า คำถามหลากหลายสาขาอย่างยิ่ง — 27B ยังไปไม่ถึงจุดนั้น

ก่อนที่คุณจะอ้างอิงสิ่งเหล่านี้ มีข้อควรระวังสามประการ ประการแรก ไม่มีสิ่งใดได้รับการตรวจสอบโดยอิสระ ยังไม่มีดัชนี Artificial Analysis และไม่มีการรัน LMArena สำหรับ 27B ณ วันที่ 15 สิงหาคม และชุดทดสอบของ Alibaba เองก็ไม่ใช่ชุดที่บุคคลที่สามจะใช้ ประการที่สอง การ์ดโมเดลใช้ชุดทดสอบ Claude Code สำหรับ SWE-bench Pro และ QwenSWEBench และใช้ผู้ตัดสิน GPT-4o สำหรับ Humanity's Last Exam — การเปรียบเทียบกับโมเดลที่ให้คะแนนด้วยชุดทดสอบอื่น ๆ จะทำให้ตัวเลขเปลี่ยนไป ประการที่สาม การรัน MathVision ของ Alibaba ใช้พรอมป์ตแบบคงที่ ในขณะที่คู่แข่งได้ค่าที่สูงกว่าระหว่างสองตัวแปร ทั้งหมดนี้ไม่ได้หมายความว่าผลลัพธ์ผิด แต่มันหมายความว่ามันเป็นเพดาน ไม่ใช่พื้น จนกว่าคนอื่นจะรันโมเดลนี้

สิ่งที่ต้องใช้ในการรันมัน

Qwen3.8-27B เป็นโมเดลท้องถิ่น (local model) ซึ่งเปลี่ยนความหมายของ "ประสิทธิภาพ": คือปริมาณงานบนฮาร์ดแวร์ของคุณเอง แทนที่จะเป็นป้ายราคา น้ำหนัก BF16 อยู่ที่ประมาณ 55.6GB; เมื่อควอนไทซ์เป็น 4 บิต พอดีกับการ์ด 24GB เช่น RTX 3090 หรือ 4090 AMD เปิดตัวการสนับสนุน Day-0 ในวันวางจำหน่าย และการวัดผลของตัวเองด้วย llama.cpp/Vulkan — สิงหาคม 2026, เฉลี่ยสามครั้งขึ้นไป — ระบุไว้ที่ 24.5 tokens/s บน Ryzen AI Max+ 395 และ 51.8 tokens/s บน Radeon AI PRO R9700 ที่มี 32GB บนระบบที่มีหน่วยความจำกราฟิกแปรผันหรือ VRAM มากกว่าประมาณ 24GB การทดสอบของชุมชนกับบิลด์ FP8 บน NVIDIA GH200 รองรับคำขอ 10 รายการพร้อมกันในบริบท 262K โดยมีเวลาไปยังโทเค็นแรก (time-to-first-token) ต่ำกว่า 10ms ตัวเลขของคุณเองอาจแตกต่างกัน — เพราะนั่นคือ GPU ของคนอื่น — แต่รูปร่างนั้นเป็นจริง: นี่คือการเปิดตัว Qwen ครั้งแรกในคลาสนี้ที่ทำงานได้ ไม่ใช่แค่ในรีวิว บนเวิร์กสเตชันเครื่องเดียว

เวทฟรี หรือ API แบบเสียเงิน?

การตัดสินใจที่โมเดลนี้บังคับให้คุณทำ คือการแบ่งระหว่างระบบท้องถิ่นกับระบบโฮสต์: ตัวน้ำหนัก (weights) ไม่มีค่าใช้จ่าย แต่ GPU ของคุณไม่ฟรี การโฮสต์เองหมายถึงการเป็นเจ้าของซิลิคอน — การ์ด 24GB หนึ่งใบถ้าคุณยอมรับการควอนไทซ์แบบ 4 บิตและการสร้างข้อความที่ช้าลง หรืออะไรที่ใหญ่กว่านั้นถ้าคุณต้องการบริบท 262K เต็มรูปแบบที่คุณภาพเต็ม ทางเลือกแบบโฮสต์บน OrcaRouter คิดราคา $0.33 ต่อล้านโทเคนนำเข้า และ $2.40 ต่อล้านโทเคนส่งออก พร้อมบริบท 262K เท่ากันและอินพุตรูปภาพบวกวิดีโอ และค่า p50 ของเวลาจนถึงโทเคนแรกที่ 225ms ซึ่งวัดในเจ็ดวันที่ผ่านมา — ไม่ต้องซื้อ GPU ไม่ต้องดูแล VRAM เลขคณิตก็คือแบบที่คุณทำกับโอเพนเวตเสมอ: ปริมาณโทเคนที่คุณต้องการจริงคูณด้วยต้นทุนต่อโทเคน เทียบกับราคาแบนของการ์ด ที่ปริมาณการใช้งานต่อเนื่องสูง การโฮสต์เองชนะ; ที่ปริมาณแบบกระชุหรือปานกลาง การจ่าย $0.33/$2.40 ดีกว่าการซื้อซิลิคอนที่คุณปล่อยว่างเป็นส่วนใหญ่

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

บรรทัดล่าง

Qwen3.8-27B เป็นโมเดลโอเพนเวตที่แข็งแกร่งที่สุดที่ Alibaba เปิดตัวในคลาสขนาดนี้ ตามตัวเลขของ Alibaba เอง: ครองอันดับหนึ่งในตารางด้านการเขียนโค้ดแบบเอเจนต์ (agentic coding) การใช้คอมพิวเตอร์ (computer use) และการให้เหตุผลเชิงวิทัศน์ (vision reasoning) พร้อมหน้าต่างบริบท 262K และน้ำหนักโมเดลแบบ Apache 2.0 การอ่านตารางคะแนนอย่างถูกต้องต้องดูแบบมีเงื่อนไข — ตัวเลขทุกรายการมาจากการรายงานของผู้ผลิต จำเพาะกับชุดทดสอบ และยังไม่มีการยืนยันซ้ำ และโมเดลระดับแนวหน้าเองก็ยังชนะเบนช์มาร์กการให้เหตุผลที่ยากที่สุด หากคุณกำลังตัดสินใจว่าจะโฮสต์เองหรือเรียกใช้เป็น API ให้มองตารางเบนช์มาร์กว่าเป็นคำสัญญา และมองตัวเลขทรูพุตของ AMD ว่าเป็นการวัดผลอิสระเพียงอย่างเดียวที่มีอยู่ในตอนนี้ เราจะอัปเดตหน้านี้ในวันที่ห้องแล็บอิสระเผยแพร่คะแนน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube