การ์ดไตเติลสำหรับการสรุปผลเบนช์มาร์ก Qwen3.8-27B แสดงการ์ดรายงานผลเบนช์มาร์กพร้อมตราประทับที่เขียนว่า OPEN WEIGHTS และไอคอนสำหรับการเขียนโค้ด ปริมาณงาน การมองเห็น บริบทระยะยาว และฮาร์ดแวร์ในเครื่อง พร้อมชิปที่เขียนว่า 27B DENSE, 262K CONTEXT และ APACHE 2.0
Guides & Insights

การวัดประสิทธิภาพของ Qwen3.8-27B: ตารางฉบับเต็ม พร้อมข้อควรระวังที่แนบมา

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Qwen/Qwen3.8-27B ทำคะแนน Terminal-Bench 2.1 ได้ 73.0, SWE-bench Pro ได้ 61.7, LiveCodeBench v6 ได้ 90.3 และ OSWorld-Verified ได้ 84.3 — และตัวเลขทุกตัวนั้นเป็นของอาลีบาบาเอง โมเดลโอเพนเวตขนาด 27 พันล้านพารามิเตอร์เปิดตัวบน Hugging Face เมื่อวันที่ 14 สิงหาคม 2026 ภายใต้สัญญาอนุญาต Apache 2.0 และภายในสองสัปดาห์แรกก็ได้รับผลการทดสอบจากบุคคลที่สามที่เป็นอิสระสามรายการ: อันดับ #1 โมเดลโอเพนเวตบน Harvey's Legal Agent benchmark จากการศึกษาที่ดำเนินการโดยบริษัท legal-AI ชื่อ Harvey และบริษัทหน่วยความจำ Engram; อันดับ #9 โดยรวมบนลีดเดอร์บอร์ด WebDev ของ Code Arena ซึ่งเป็นโมเดลเดียวในระดับขนาดเดียวกันที่ติดท็อป 10 ตามประกาศของอาลีบาบาเมื่อวันที่ 25 สิงหาคม; และประกาศเมื่อวันที่ 26 สิงหาคม อันดับ #1 โมเดลโอเพนเวตบนลีดเดอร์บอร์ด Image-to-WebDev ของ Arena.ai โดยติดอันดับ #7 โดยรวมด้วยคะแนนที่รายงานไว้ที่ 1,574 หน้านี้คือสรุปที่สมบูรณ์พร้อมแหล่งอ้างอิง: เบนช์มาร์กอย่างเป็นทางการทั้งหมด 25 รายการจากโมเดลการ์ด สิ่งที่เปลี่ยนแปลงไปจากรุ่นก่อนหน้าอย่าง Qwen3.6-27B ผลการทดสอบทรูพัตอิสระของ AMD วัดค่าได้เท่าไร ผลลัพธ์จากเว็บเดฟอารีนาและเอเจนต์กฎหมายเหล่านั้น และข้ออ้างใดที่คุณควรยังคงถือเป็นข้อมูลเบื้องต้น

คำแนะนำการอ่านก่อนถึงตัวเลข: "official" ในที่นี้หมายถึงการประเมินของ Alibaba ที่พิมพ์ไว้บนการ์ดโมเดลที่ Qwen/Qwen3.8-27B เป็นข้อมูลที่รายงานโดยผู้ผลิตและยังไม่มีการตรวจสอบซ้ำ "Independent" หมายถึงมีคนนอกห้องแล็บเป็นผู้วัดผล — ซึ่งจนถึงตอนนี้ครอบคลุมการทดสอบปริมาณงานฮาร์ดแวร์ การศึกษาเอเจนต์ในโดเมนกฎหมาย และการติดอันดับบนลีดเดอร์บอร์ดการพัฒนาเว็บของ Arena.ai สองรายการ ได้แก่ Code Arena's WebDev และ Image-to-WebDev arena ชุดทดสอบที่โครงสร้างการทดสอบ (harness) มีความสำคัญจะถูกทำเครื่องหมายกำกับไว้ในข้อความ

โมเดล หนึ่งบรรทัดต่อสเปก

• พารามิเตอร์แบบหนาแน่น 27B (รวมตัวเข้ารหัสวิทัศน์แล้ว 28B), 64 ชั้น, ขนาดซ่อน 5120

• แอตเทนชันแบบผสม — เลเยอร์แอตเทนชันเชิงเส้น Gated DeltaNet 48 ชั้น บวกกับเลเยอร์แอตเทนชันแบบเต็ม 16 ชั้น ในอัตราส่วน 3:1 — ซึ่งเป็นสิ่งที่ทำให้หน้าต่างขนาด 262K โทเคนสามารถรันได้ในต้นทุนที่ย่อมเยา

• บริบทดั้งเดิม 262,144 โทเคน ขยายได้ถึง 1,000,000 ด้วยการปรับสเกล YaRN

รองรับการรับอินพุตรูปภาพและวิดีโอโดยตรง (เอาต์พุตเป็นข้อความ), น้ำหนักโมเดลภายใต้สัญญาอนุญาต Apache 2.0, ขนาดประมาณ 55.6GB ในรูปแบบ BF16

พูดแบบสั้น ๆ: นี่คือโมเดลที่ตั้งใจจะนำสิ่งที่ Alibaba เรียนรู้จากการสร้าง Qwen3.8-Max ซึ่งมีพารามิเตอร์ 2.4 ล้านล้านตัว มาบีบอัดให้เป็นสิ่งที่ GPU เพียงตัวเดียวสามารถรันได้

ตารางคะแนน: ทุกเกณฑ์มาตรฐานบนการ์ดโมเดล

คะแนนทั้งหมดด้านล่างนี้เป็นคะแนนที่ Alibaba รายงานจากเอกสารข้อมูลโมเดลวันที่ 14 สิงหาคม โดยคะแนน Qwen3.6-27B ที่โมเดลนี้แทนที่แสดงอยู่ในวงเล็บ

การเขียนโค้ด Terminal-Bench 2.1 (การเขียนโค้ดเทอร์มินัลแบบเอเจนต์) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9) การรัน SWE-bench Pro และ QwenSWEBench ใช้ฮาร์เนส Claude Code ตามเชิงอรรถของโมเดลการ์ด — ควรระลึกไว้ก่อนเปรียบเทียบกับโมเดลที่ให้คะแนนด้วยฮาร์เนสที่แตกต่างกัน

เอเจนต์ระยะยาวและงานสำนักงาน CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / คะแนน 42.9 (10.6 / 27.3).

การใช้เหตุผลและความรู้ GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench การทำตามคำสั่ง 79.5 (69.1). HLE ถูกประเมินโดย GPT-4o ตามการ์ด.

วิสัยทัศน์และการใช้งานคอมพิวเตอร์ OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 ด้วย CI / 90.0 โดยไม่ใช้ (85.1); BabyVision 85.6 ด้วย CI / 65.7 โดยไม่ใช้ (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1) "CI" คือการเพิ่มประสิทธิภาพแบบ inference-time ของ Alibaba; ช่องว่างระหว่างสถานะเปิดและปิดคือตัวเลขที่ให้ข้อมูลมากที่สุดเพียงตัวเดียวบนการ์ดเกี่ยวกับคะแนนที่คุณสามารถซื้อได้ด้วยการคำนวณ inference เพิ่มเติม

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

สิ่งที่เปลี่ยนแปลงจริงเมื่อเทียบกับ Qwen3.6-27B

การวัดประสิทธิภาพทุกตัวบนการ์ดใบนี้เพิ่มขึ้น แต่ความแตกต่างไม่ได้สม่ำเสมอ — และรูปแบบของการปรับปรุงนั้นคือเรื่องราวที่แท้จริง จุดที่ได้ประโยชน์กระจุกตัวอยู่ที่การเขียนโค้ดแบบเอเจนต์และการใช้งานคอมพิวเตอร์ ไม่ใช่การเรียกคืนความรู้:

• DeepSWE 1.1 (การเขียนโค้ดแบบเอเจนต์) 13.3 → 42.2 ซึ่งเพิ่มขึ้นประมาณ 3 เท่า

• QwenSWEBench 49.3 → 79.0

• Agents' Last Exam คะแนน 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 และ AndroidWorld 70.3 → 81.9

• BabyVision (ด้วย CI) 28.9 → 85.6 — การเพิ่มขึ้นเชิงสัมพัทธ์ที่มากที่สุดบนการ์ด

ในขณะเดียวกัน GPQA Diamond เคลื่อนจาก 87.8 → 89.2 และ RealWorldQA จาก 84.1 → 85.9: จริงแต่เล็กน้อย นี่ไม่ใช่การเปิดตัวที่ "ฉลาดขึ้นทุกอย่าง" แต่เป็นการเปิดตัวที่มุ่งเป้าไปที่เอเจนต์ที่อ่านหน้าจอ ใช้เครื่องมือ และเขียนโค้ดในหลายขั้นตอน

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

ตั้งแต่หน้านี้เผยแพร่ การพัฒนาที่สำคัญที่สุดคือด้านกฎหมาย ไม่ใช่ด้านเทคนิค Alibaba ประกาศว่า Qw​en3.8-27B เป็นโมเดลโอเพนเวตอันดับ 1 ในเกณฑ์ชี้วัด Legal Agent ของ Harvey — เป็นการอ้างอันดับจากผู้จำหน่ายเอง จึงควรถือว่าเป็นถ้อยแถลงของ Alibaba ผลลัพธ์ที่อยู่เบื้องหลังคืองานวิจัยที่ไม่ใช่ของ Alibaba: Harvey บริษัทเอไอด้านกฎหมาย และ Engram สตาร์ทอัพด้านหน่วยความจำเอไอ ได้สร้างสำนักงานกฎหมายจำลองชื่อ Calderwood & Harkness จากโทเคนมากกว่า 100 ล้าน ในเอกสารประมาณ 10,000 ชิ้นและคดี 266 คดี จากนั้นได้ปรับ Qw​en3.8-27B ให้เข้ากับมันด้วยหน่วยความจำแบบพารามิเตอร์ บันทึกย่อแบบบีบอัด และเครื่องมือดึงข้อมูล

ในงานด้านกฎหมาย 250 งาน โมเดล 27B ที่ปรับแต่งแล้วมีค่าเฉลี่ย 67% นำหน้าโมเดลทุกรุ่นที่ถูกทดสอบในงานศึกษา — รวมถึง Claude Opus 4.8 — และในด้านความถูกต้องแบบ all-or-nothing ที่เข้มงวด มันนำ Opus 4.8 ที่ 30% ต่อ 25% ด้วยต้นทุนประมาณ $0.13 ต่อคำสั่ง เทียบกับ $1.32 สำหรับ Opus 4.8 ตัวเลขเหล่านั้นรายงานโดย Harvey/Engram ยังไม่ถูกทำซ้ำอย่างอิสระ ก่อนการฝึกด้วยเอกสารภายในของบริษัท โมเดลเดียวกันได้คะแนนเพียง 4.7% สำหรับคำถามเฉพาะของบริษัท หลังจากศึกษาพวกมันแล้ว ได้ 72.6%

อ่าน #1 โดยมีข้อควรระวังใหญ่: โมเดลที่ติดอันดับสูงสุดในเกณฑ์มาตรฐานได้ศึกษาคลังข้อมูลทดสอบมาก่อน โดยถูกปรับแต่งบน 100M โทเคนของบริษัทก่อนที่จะถูกประเมิน นั่นทำให้สิ่งนี้เป็นการสาธิตว่าตัว 27B สามารถดูดซับความรู้ได้มากเพียงใดเมื่อมีการปรับแต่งเฉพาะโดเมน ไม่ใช่คะแนนสำหรับน้ำหนัก Apache-2.0 ที่เป็นสต็อกบนชุดทดสอบที่เป็นกลาง — และมันครอบคลุมเพียงโดเมนเดียวคือกฎหมาย ไม่ใช่คุณภาพทั่วไป สิ่งที่มันสนับสนุนคือจุดขายเบื้องหลังทวีต: 27B ที่เล็กพอจะรันบนเครื่องท้องถิ่นนั้นแข็งแกร่งพอสำหรับงานระดับมืออาชีพเมื่อมีความรู้ที่ถูกต้อง

ผลลัพธ์อิสระที่สอง: อันดับ #9 โดยรวมบน WebDev ของ Code Arena

ผลลัพธ์อิสระประการที่สองเป็นผลลัพธ์ด้านการเขียนโค้ด และนี่คือเหตุผลที่หน้านี้เปลี่ยนไปเมื่อวันที่ 25 สิงหาคม Code Arena คือกระดานผู้นำการพัฒนาเว็บของ Arena.ai — โครงการที่เคยรู้จักในชื่อ WebDev Arena บนเว็บไซต์ที่เคยรู้จักในชื่อ LMArena — ที่ผู้ใช้สร้างแอปจริงด้วยคู่โมเดลที่ไม่เปิดเผยชื่อ และโหวตว่าผลลัพธ์ใดที่พวกเขาอยากจะส่งมอบมากกว่า บนกระดานผู้นำสาธารณะนั้น Qw​en3.8-27B อยู่อันดับที่ 9 โดยรวมด้วยคะแนน 1595 เป็นโมเดลเดียวในกลุ่มขนาดเดียวกันที่อยู่ในสิบอันดับแรก

การจัดอันดับนี้เป็นส่วนที่อิสระ — มันอยู่บนลีดเดอร์บอร์ดของบุคคลที่สามที่ใครก็เปิดดูได้ พาดหัวที่อยู่รอบๆ นั้นเป็นการกล่าวโดย Alibaba: กรอบ "โมเดลเล็กเพียงตัวเดียวใน 10 อันดับแรก" และตำแหน่งประกอบ มาจากประกาศของ Qwen เมื่อวันที่ 25 สิงหาคม สิ่งเหล่านี้ควรพูดซ้ำพร้อมกับป้ายกำกับนั้น โมเดล 27B อยู่อันดับต่ำกว่า Qwen3.8-Max ที่ใหญ่กว่ามากถึง 6 อันดับ (ซึ่งประกาศระบุว่าอยู่อันดับ #3 โดยรวม) และนำหน้า Gemma 4-31B ที่มีขนาดใกล้เคียงกันอย่างมาก (ซึ่งประกาศเดียวกันระบุว่าอยู่อันดับ #80) ประเด็นไม่ใช่ว่า 27B เอาชนะโมเดลระดับแนวหน้าในการสร้างเว็บแอป แต่เป็นว่าโมเดลที่เล็กพอจะรันบน GPU ตัวเดียว อยู่ใน 10 อันดับแรกของสนามแข่งขันเขียนโค้ดแบบปกปิด ซึ่งผู้ร่วมแข่งขันคนอื่นๆ ล้วนเป็นโมเดลที่ใหญ่กว่ามาก

ผลลัพธ์อิสระชิ้นที่สาม: โมเดลโอเพนอันดับ #1 บน Image-to-WebDev ของ Arena.ai

ผลลัพธ์อิสระชุดที่สามมาถึงในวันที่ 26 สิงหาคม และเป็นผลลัพธ์ที่แข็งแกร่งที่สุดเท่าที่เคยมีมาสำหรับโมเดลขนาดนี้ {{1}}Image-to-WebDev เป็นบอร์ดพี่น้องของ WebDev ของ Code Arena บน Arena.ai — แอรีนาที่โมเดลจะได้รับภาพหน้าจอหรือภาพอ้างอิงอื่นๆ แล้วต้องเปลี่ยนให้เป็นเว็บอินเทอร์เฟซที่ใช้งานได้ โดยมีมนุษย์ผู้โหวตแบบไม่เห็นต้นทางเลือกผลลัพธ์ที่พวกเขาอยากจะนำไปใช้งานจริง{{/1}} {{2}}บนลีดเดอร์บอร์ดสาธารณะนั้น Qw​en3.8-27B ครองอันดับ #1 ในบรรดาโมเดลโอเพน และอันดับ #7 โดยรวม ด้วยคะแนนแอรีนาที่รายงานไว้ที่ 1,574{{/2}}

ตำแหน่งที่ปรากฏเป็นส่วนที่เป็นอิสระ — มันอยู่บนลีดเดอร์บอร์ดของบุคคลที่สามที่ใครก็สามารถเปิดดูได้ หัวข้อข่าวที่รายล้อมนั้นมาจากการระบุของ Alibaba: ประกาศของทีม Qwen เมื่อวันที่ 26 สิงหาคม ระบุว่าโมเดล 27B "ทัดเทียมกับโมเดลที่มีขนาดใหญ่กว่า 100 เท่า" ในการทดสอบนี้ ซึ่งเป็นการเปรียบเทียบที่ลีดเดอร์บอร์ดไม่ได้บันทึกไว้ และการจัดอันดับความชอบไม่ใช่การตัดสินคุณภาพของโค้ด — คะแนนโหวต Image-to-WebDev วัดว่าเอาต์พุตใดที่มนุษย์อยากนำไปใช้มากกว่า ไม่ใช่ว่า HTML นั้นปลอดภัย เข้าถึงได้ หรือบำรุงรักษาได้หรือไม่ สิ่งที่ผลลัพธ์นี้ยืนยันคือ โมเดลน้ำหนักเปิดขนาด 27B ขณะนี้เป็นผู้นำในบรรดาโมเดลเปิดทั้งหมดในด้านการเปลี่ยนภาพให้เป็นหน้าเว็บ ซึ่งเป็นทักษะที่กลุ่มผลิตภัณฑ์ "screenshot to site" ที่กำลังเติบโตสร้างบนพื้นฐานนี้

ช่องว่างที่ต้องยอมรับอย่างตรงไปตรงมา: จุดที่ยังพ่ายแพ้ และข้อควรระวังด้านระเบียบวิธี

เมื่อเทียบกับรุ่นระดับแนวหน้า ภาพที่ได้ก็ดูดีแต่ก็ไม่ได้มีด้านเดียว ตรงที่ Qw​en3.8-27B และ Claude Opus 4.6 Max ทับซ้อนกัน Qw​en ชนะส่วนใหญ่ — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench และกลุ่มงานด้านวิทัศน์ทั้งหมด เมื่อเทียบกับ Muse Glimmer-30B ของ Meta ซึ่งเป็นคู่แข่งระดับท้องถิ่นโดยธรรมชาติ มันชนะทั้งแปดเบนช์มาร์กที่ทับซ้อนกันอย่างขาดลอย แต่ก็ยังแพ้ Terminal-Bench 2.1 (73.0 ต่อ 78.2), GPQA Diamond (89.2 ต่อ 91.3), Humanity's Last Exam (30.8 ต่อ 40.0) และ NL2Repo-Bench (42.3 ต่อ 47.6) ให้กับ Claude Opus 4.6 Max ถ้างานของคุณคือการให้เหตุผลระดับแนวหน้าที่ยากที่สุด — คณิตศาสตร์ระดับแนวหน้า คำถามที่ครอบคลุมหลายสาขาวิชาอย่างมาก — 27B ก็ยังไปไม่ถึงจุดนั้น

ข้อควรระวังสามประการก่อนที่คุณจะอ้างอิงสิ่งเหล่านี้ ประการแรก ตารางในโมเดลการ์ดด้านบนยังคงเป็นข้อมูลที่รายงานโดย Alibaba ทั้งหมด — ยังไม่มีดัชนี Artificial Analysis สำหรับรุ่น 27B ขณะนี้มีผลการทดสอบจากบุคคลที่สามอิสระสามรายการ แต่แต่ละรายการมีขอบเขตจำกัด: การจัดอันดับ Code Arena วัดการสร้างเว็บแอปจากพรอมต์ข้อความ การจัดอันดับ Image-to-WebDev วัดการเปลี่ยนภาพหน้าจอเป็นหน้าเว็บที่ใช้งานได้ ทั้งสองถูกตัดสินโดยการโหวตแบบปกปิดบนผลลัพธ์ที่ไม่ระบุชื่อ และการศึกษาด้านเอเจนต์กฎหมายของ Harvey ครอบคลุมเพียงโดเมนเดียวกับโมเดลที่ฝึกมาเพื่อการทดสอบนั้น ไม่มีรายการใดเป็นการรันน้ำหนักของโมเดลมาตรฐานบนชุดทดสอบอเนกประสงค์ ประการที่สอง โมเดลการ์ดใช้ชุดทดสอบ Claude Code สำหรับ SWE-bench Pro และ QwenSWEBench และใช้ผู้ตัดสิน GPT-4o สำหรับ Humanity's Last Exam — การเปรียบเทียบกับโมเดลที่ให้คะแนนบนชุดทดสอบอื่นจะทำให้ตัวเลขเปลี่ยนไป ประการที่สาม การรัน MathVision ของ Alibaba ใช้พรอมต์คงที่ ในขณะที่คู่แข่งได้รับค่าที่สูงกว่าจากสองรูปแบบ ทั้งหมดนี้ไม่ได้หมายความว่าผลลัพธ์ผิด; แต่หมายความว่ามันเป็นเพดาน ไม่ใช่พื้น จนกว่าห้องปฏิบัติการอิสระจะรันโมเดลบนชุดทดสอบอเนกประสงค์ที่เป็นกลาง

สิ่งที่ต้องใช้ในการรันมัน

Qw​en3.8-27B เป็นโมเดลท้องถิ่น ซึ่งเปลี่ยนความหมายของ "ประสิทธิภาพ" ไปจากเดิม: เป็นปริมาณงานบนฮาร์ดแวร์ของคุณเอง แทนที่จะเป็นป้ายราคา น้ำหนัก BF16 อยู่ที่ประมาณ 55.6GB; เมื่อควอนไทซ์เป็น 4 บิต ก็พอดีกับการ์ด 24GB เช่น RTX 3090 หรือ 4090 AMD ปล่อยการสนับสนุน Day-0 ในวันเปิดตัว และการวัดของ llama.cpp/Vulkan ของตัวเอง — สิงหาคม 2026 เฉลี่ยจากการรันสามครั้งขึ้นไป — อยู่ที่ 24.5 โทเคน/วินาที บน Ryzen AI Max+ 395 และ 51.8 โทเคน/วินาที บน Radeon AI PRO R9700 ขนาด 32GB บนระบบที่มีหน่วยความจำกราฟิกแบบแปรผันหรือ VRAM มากกว่าประมาณ 24GB การทดสอบของชุมชนสำหรับบิลด์ FP8 บน NVIDIA GH200 รองรับคำขอ 262K คอนเทกซ์พร้อมกัน 10 รายการ โดยมีเวลา-ถึง-โทเคนแรกต่ำกว่า 10ms ตัวเลขของคุณจะต่างออกไป — นั่นคือ GPU ของคนอื่น — แต่ภาพรวมนั้นเป็นจริง: นี่คือการเปิดตัว Qw​en ครั้งแรกในคลาสนี้ที่ทำงานได้ ไม่ใช่แค่ในรีวิว บนเวิร์กสเตชันเครื่องเดียว

เวทฟรี หรือ API แบบเสียเงิน?

การตัดสินใจที่โมเดลนี้บังคับให้คุณทำ คือการแบ่งระหว่างระบบท้องถิ่นกับระบบโฮสต์: ตัวน้ำหนัก (weights) ไม่มีค่าใช้จ่าย แต่ GPU ของคุณไม่ฟรี การโฮสต์เองหมายถึงการเป็นเจ้าของซิลิคอน — การ์ด 24GB หนึ่งใบถ้าคุณยอมรับการควอนไทซ์แบบ 4 บิตและการสร้างข้อความที่ช้าลง หรืออะไรที่ใหญ่กว่านั้นถ้าคุณต้องการบริบท 262K เต็มรูปแบบที่คุณภาพเต็ม ทางเลือกแบบโฮสต์บน OrcaRouter คิดราคา $0.33 ต่อล้านโทเคนนำเข้า และ $2.40 ต่อล้านโทเคนส่งออก พร้อมบริบท 262K เท่ากันและอินพุตรูปภาพบวกวิดีโอ และค่า p50 ของเวลาจนถึงโทเคนแรกที่ 225ms ซึ่งวัดในเจ็ดวันที่ผ่านมา — ไม่ต้องซื้อ GPU ไม่ต้องดูแล VRAM เลขคณิตก็คือแบบที่คุณทำกับโอเพนเวตเสมอ: ปริมาณโทเคนที่คุณต้องการจริงคูณด้วยต้นทุนต่อโทเคน เทียบกับราคาแบนของการ์ด ที่ปริมาณการใช้งานต่อเนื่องสูง การโฮสต์เองชนะ; ที่ปริมาณแบบกระชุหรือปานกลาง การจ่าย $0.33/$2.40 ดีกว่าการซื้อซิลิคอนที่คุณปล่อยว่างเป็นส่วนใหญ่

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

ประเด็นสำคัญ

Qwen3.8-27B เป็นโมเดลโอเพนเวตที่แข็งแกร่งที่สุดที่ Alibaba เคยเปิดตัวในขนาดคลาสนี้ ตามตัวเลขของ Alibaba เอง: ดีที่สุดในตารางสำหรับ agentic coding, computer use และ vision reasoning พร้อมหน้าต่างบริบท 262K และน้ำหนัก Apache 2.0 การอ่านสกอร์การ์ดอย่างถูกต้องเป็นแบบมีเงื่อนไข — ทุกตัวเลขในโมเดลการ์ดเป็นข้อมูลที่ผู้ขายรายงาน จำเพาะต่อชุดทดสอบ และยังไม่มีการทำซ้ำ และโมเดลระดับแนวหน้ายังคงชนะเบนช์มาร์กด้านการใช้เหตุผลที่ยากที่สุด หากคุณกำลังตัดสินใจว่าจะโฮสต์เองหรือเรียกใช้เป็น API จงถือว่าตารางเบนช์มาร์กเป็นคำมั่นสัญญา ตัวเลขปริมาณงานของ AMD เป็นการวัดฮาร์ดแวร์อิสระครั้งแรก ผลลัพธ์ Harvey legal-agent เป็นสัญญาณอิสระแรกที่ความสามารถของโมเดลยังคงอยู่ภายนอกชุดทดสอบของ Alibaba เอง และการจัดอันดับ webdev-arena สองรายการ — อันดับ #9 โดยรวมใน Code Arena's WebDev และอันดับ #1 โมเดลโอเพนใน Arena.ai's Image-to-WebDev — เป็นการยืนยันจากลีดเดอร์บอร์ดด้านการเขียนโค้ดอิสระครั้งแรกของความสามารถดังกล่าว เราจะอัปเดตหน้านี้เมื่อห้องแล็บอิสระอื่นๆ เผยแพร่คะแนนเพิ่มเติม

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube