
การวัดประสิทธิภาพของ Qwen3.8-27B: ตารางฉบับเต็ม พร้อมข้อควรระวังที่แนบมา
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Qwen/Qwen3.8-27B ทำคะแนน Terminal-Bench 2.1 ได้ 73.0, SWE-bench Pro ได้ 61.7, LiveCodeBench v6 ได้ 90.3 และ OSWorld-Verified ได้ 84.3 — และตัวเลขทุกตัวนั้นเป็นของอาลีบาบาเอง โมเดลโอเพนเวตขนาด 27 พันล้านพารามิเตอร์เปิดตัวบน Hugging Face เมื่อวันที่ 14 สิงหาคม 2026 ภายใต้สัญญาอนุญาต Apache 2.0 และภายในสองสัปดาห์แรกก็ได้รับผลการทดสอบจากบุคคลที่สามที่เป็นอิสระสามรายการ: อันดับ #1 โมเดลโอเพนเวตบน Harvey's Legal Agent benchmark จากการศึกษาที่ดำเนินการโดยบริษัท legal-AI ชื่อ Harvey และบริษัทหน่วยความจำ Engram; อันดับ #9 โดยรวมบนลีดเดอร์บอร์ด WebDev ของ Code Arena ซึ่งเป็นโมเดลเดียวในระดับขนาดเดียวกันที่ติดท็อป 10 ตามประกาศของอาลีบาบาเมื่อวันที่ 25 สิงหาคม; และประกาศเมื่อวันที่ 26 สิงหาคม อันดับ #1 โมเดลโอเพนเวตบนลีดเดอร์บอร์ด Image-to-WebDev ของ Arena.ai โดยติดอันดับ #7 โดยรวมด้วยคะแนนที่รายงานไว้ที่ 1,574 หน้านี้คือสรุปที่สมบูรณ์พร้อมแหล่งอ้างอิง: เบนช์มาร์กอย่างเป็นทางการทั้งหมด 25 รายการจากโมเดลการ์ด สิ่งที่เปลี่ยนแปลงไปจากรุ่นก่อนหน้าอย่าง Qwen3.6-27B ผลการทดสอบทรูพัตอิสระของ AMD วัดค่าได้เท่าไร ผลลัพธ์จากเว็บเดฟอารีนาและเอเจนต์กฎหมายเหล่านั้น และข้ออ้างใดที่คุณควรยังคงถือเป็นข้อมูลเบื้องต้น
คำแนะนำการอ่านก่อนถึงตัวเลข: "official" ในที่นี้หมายถึงการประเมินของ Alibaba ที่พิมพ์ไว้บนการ์ดโมเดลที่ Qwen/Qwen3.8-27B เป็นข้อมูลที่รายงานโดยผู้ผลิตและยังไม่มีการตรวจสอบซ้ำ "Independent" หมายถึงมีคนนอกห้องแล็บเป็นผู้วัดผล — ซึ่งจนถึงตอนนี้ครอบคลุมการทดสอบปริมาณงานฮาร์ดแวร์ การศึกษาเอเจนต์ในโดเมนกฎหมาย และการติดอันดับบนลีดเดอร์บอร์ดการพัฒนาเว็บของ Arena.ai สองรายการ ได้แก่ Code Arena's WebDev และ Image-to-WebDev arena ชุดทดสอบที่โครงสร้างการทดสอบ (harness) มีความสำคัญจะถูกทำเครื่องหมายกำกับไว้ในข้อความ
โมเดล หนึ่งบรรทัดต่อสเปก
• พารามิเตอร์แบบหนาแน่น 27B (รวมตัวเข้ารหัสวิทัศน์แล้ว 28B), 64 ชั้น, ขนาดซ่อน 5120
• แอตเทนชันแบบผสม — เลเยอร์แอตเทนชันเชิงเส้น Gated DeltaNet 48 ชั้น บวกกับเลเยอร์แอตเทนชันแบบเต็ม 16 ชั้น ในอัตราส่วน 3:1 — ซึ่งเป็นสิ่งที่ทำให้หน้าต่างขนาด 262K โทเคนสามารถรันได้ในต้นทุนที่ย่อมเยา
• บริบทดั้งเดิม 262,144 โทเคน ขยายได้ถึง 1,000,000 ด้วยการปรับสเกล YaRN
รองรับการรับอินพุตรูปภาพและวิดีโอโดยตรง (เอาต์พุตเป็นข้อความ), น้ำหนักโมเดลภายใต้สัญญาอนุญาต Apache 2.0, ขนาดประมาณ 55.6GB ในรูปแบบ BF16
พูดแบบสั้น ๆ: นี่คือโมเดลที่ตั้งใจจะนำสิ่งที่ Alibaba เรียนรู้จากการสร้าง Qwen3.8-Max ซึ่งมีพารามิเตอร์ 2.4 ล้านล้านตัว มาบีบอัดให้เป็นสิ่งที่ GPU เพียงตัวเดียวสามารถรันได้
ตารางคะแนน: ทุกเกณฑ์มาตรฐานบนการ์ดโมเดล
คะแนนทั้งหมดด้านล่างนี้เป็นคะแนนที่ Alibaba รายงานจากเอกสารข้อมูลโมเดลวันที่ 14 สิงหาคม โดยคะแนน Qwen3.6-27B ที่โมเดลนี้แทนที่แสดงอยู่ในวงเล็บ
การเขียนโค้ด Terminal-Bench 2.1 (การเขียนโค้ดเทอร์มินัลแบบเอเจนต์) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9) การรัน SWE-bench Pro และ QwenSWEBench ใช้ฮาร์เนส Claude Code ตามเชิงอรรถของโมเดลการ์ด — ควรระลึกไว้ก่อนเปรียบเทียบกับโมเดลที่ให้คะแนนด้วยฮาร์เนสที่แตกต่างกัน
เอเจนต์ระยะยาวและงานสำนักงาน CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / คะแนน 42.9 (10.6 / 27.3).
การใช้เหตุผลและความรู้ GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench การทำตามคำสั่ง 79.5 (69.1). HLE ถูกประเมินโดย GPT-4o ตามการ์ด.
วิสัยทัศน์และการใช้งานคอมพิวเตอร์ OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 ด้วย CI / 90.0 โดยไม่ใช้ (85.1); BabyVision 85.6 ด้วย CI / 65.7 โดยไม่ใช้ (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1) "CI" คือการเพิ่มประสิทธิภาพแบบ inference-time ของ Alibaba; ช่องว่างระหว่างสถานะเปิดและปิดคือตัวเลขที่ให้ข้อมูลมากที่สุดเพียงตัวเดียวบนการ์ดเกี่ยวกับคะแนนที่คุณสามารถซื้อได้ด้วยการคำนวณ inference เพิ่มเติม

สิ่งที่เปลี่ยนแปลงจริงเมื่อเทียบกับ Qwen3.6-27B
การวัดประสิทธิภาพทุกตัวบนการ์ดใบนี้เพิ่มขึ้น แต่ความแตกต่างไม่ได้สม่ำเสมอ — และรูปแบบของการปรับปรุงนั้นคือเรื่องราวที่แท้จริง จุดที่ได้ประโยชน์กระจุกตัวอยู่ที่การเขียนโค้ดแบบเอเจนต์และการใช้งานคอมพิวเตอร์ ไม่ใช่การเรียกคืนความรู้:
• DeepSWE 1.1 (การเขียนโค้ดแบบเอเจนต์) 13.3 → 42.2 ซึ่งเพิ่มขึ้นประมาณ 3 เท่า
• QwenSWEBench 49.3 → 79.0
• Agents' Last Exam คะแนน 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 และ AndroidWorld 70.3 → 81.9
• BabyVision (ด้วย CI) 28.9 → 85.6 — การเพิ่มขึ้นเชิงสัมพัทธ์ที่มากที่สุดบนการ์ด
ในขณะเดียวกัน GPQA Diamond เคลื่อนจาก 87.8 → 89.2 และ RealWorldQA จาก 84.1 → 85.9: จริงแต่เล็กน้อย นี่ไม่ใช่การเปิดตัวที่ "ฉลาดขึ้นทุกอย่าง" แต่เป็นการเปิดตัวที่มุ่งเป้าไปที่เอเจนต์ที่อ่านหน้าจอ ใช้เครื่องมือ และเขียนโค้ดในหลายขั้นตอน

ผลลัพธ์อิสระครั้งแรก: #1 โมเดลโอเพนเวทบนเกณฑ์ชี้วัด Legal Agent ของ Harvey
ตั้งแต่หน้านี้เผยแพร่ การพัฒนาที่สำคัญที่สุดคือด้านกฎหมาย ไม่ใช่ด้านเทคนิค Alibaba ประกาศว่า Qwen3.8-27B เป็นโมเดลโอเพนเวตอันดับ 1 ในเกณฑ์ชี้วัด Legal Agent ของ Harvey — เป็นการอ้างอันดับจากผู้จำหน่ายเอง จึงควรถือว่าเป็นถ้อยแถลงของ Alibaba ผลลัพธ์ที่อยู่เบื้องหลังคืองานวิจัยที่ไม่ใช่ของ Alibaba: Harvey บริษัทเอไอด้านกฎหมาย และ Engram สตาร์ทอัพด้านหน่วยความจำเอไอ ได้สร้างสำนักงานกฎหมายจำลองชื่อ Calderwood & Harkness จากโทเคนมากกว่า 100 ล้าน ในเอกสารประมาณ 10,000 ชิ้นและคดี 266 คดี จากนั้นได้ปรับ Qwen3.8-27B ให้เข้ากับมันด้วยหน่วยความจำแบบพารามิเตอร์ บันทึกย่อแบบบีบอัด และเครื่องมือดึงข้อมูล
ในงานด้านกฎหมาย 250 งาน โมเดล 27B ที่ปรับแต่งแล้วมีค่าเฉลี่ย 67% นำหน้าโมเดลทุกรุ่นที่ถูกทดสอบในงานศึกษา — รวมถึง Claude Opus 4.8 — และในด้านความถูกต้องแบบ all-or-nothing ที่เข้มงวด มันนำ Opus 4.8 ที่ 30% ต่อ 25% ด้วยต้นทุนประมาณ $0.13 ต่อคำสั่ง เทียบกับ $1.32 สำหรับ Opus 4.8 ตัวเลขเหล่านั้นรายงานโดย Harvey/Engram ยังไม่ถูกทำซ้ำอย่างอิสระ ก่อนการฝึกด้วยเอกสารภายในของบริษัท โมเดลเดียวกันได้คะแนนเพียง 4.7% สำหรับคำถามเฉพาะของบริษัท หลังจากศึกษาพวกมันแล้ว ได้ 72.6%
อ่าน #1 โดยมีข้อควรระวังใหญ่: โมเดลที่ติดอันดับสูงสุดในเกณฑ์มาตรฐานได้ศึกษาคลังข้อมูลทดสอบมาก่อน โดยถูกปรับแต่งบน 100M โทเคนของบริษัทก่อนที่จะถูกประเมิน นั่นทำให้สิ่งนี้เป็นการสาธิตว่าตัว 27B สามารถดูดซับความรู้ได้มากเพียงใดเมื่อมีการปรับแต่งเฉพาะโดเมน ไม่ใช่คะแนนสำหรับน้ำหนัก Apache-2.0 ที่เป็นสต็อกบนชุดทดสอบที่เป็นกลาง — และมันครอบคลุมเพียงโดเมนเดียวคือกฎหมาย ไม่ใช่คุณภาพทั่วไป สิ่งที่มันสนับสนุนคือจุดขายเบื้องหลังทวีต: 27B ที่เล็กพอจะรันบนเครื่องท้องถิ่นนั้นแข็งแกร่งพอสำหรับงานระดับมืออาชีพเมื่อมีความรู้ที่ถูกต้อง
ผลลัพธ์อิสระที่สอง: อันดับ #9 โดยรวมบน WebDev ของ Code Arena
ผลลัพธ์อิสระประการที่สองเป็นผลลัพธ์ด้านการเขียนโค้ด และนี่คือเหตุผลที่หน้านี้เปลี่ยนไปเมื่อวันที่ 25 สิงหาคม Code Arena คือกระดานผู้นำการพัฒนาเว็บของ Arena.ai — โครงการที่เคยรู้จักในชื่อ WebDev Arena บนเว็บไซต์ที่เคยรู้จักในชื่อ LMArena — ที่ผู้ใช้สร้างแอปจริงด้วยคู่โมเดลที่ไม่เปิดเผยชื่อ และโหวตว่าผลลัพธ์ใดที่พวกเขาอยากจะส่งมอบมากกว่า บนกระดานผู้นำสาธารณะนั้น Qwen3.8-27B อยู่อันดับที่ 9 โดยรวมด้วยคะแนน 1595 เป็นโมเดลเดียวในกลุ่มขนาดเดียวกันที่อยู่ในสิบอันดับแรก
การจัดอันดับนี้เป็นส่วนที่อิสระ — มันอยู่บนลีดเดอร์บอร์ดของบุคคลที่สามที่ใครก็เปิดดูได้ พาดหัวที่อยู่รอบๆ นั้นเป็นการกล่าวโดย Alibaba: กรอบ "โมเดลเล็กเพียงตัวเดียวใน 10 อันดับแรก" และตำแหน่งประกอบ มาจากประกาศของ Qwen เมื่อวันที่ 25 สิงหาคม สิ่งเหล่านี้ควรพูดซ้ำพร้อมกับป้ายกำกับนั้น โมเดล 27B อยู่อันดับต่ำกว่า Qwen3.8-Max ที่ใหญ่กว่ามากถึง 6 อันดับ (ซึ่งประกาศระบุว่าอยู่อันดับ #3 โดยรวม) และนำหน้า Gemma 4-31B ที่มีขนาดใกล้เคียงกันอย่างมาก (ซึ่งประกาศเดียวกันระบุว่าอยู่อันดับ #80) ประเด็นไม่ใช่ว่า 27B เอาชนะโมเดลระดับแนวหน้าในการสร้างเว็บแอป แต่เป็นว่าโมเดลที่เล็กพอจะรันบน GPU ตัวเดียว อยู่ใน 10 อันดับแรกของสนามแข่งขันเขียนโค้ดแบบปกปิด ซึ่งผู้ร่วมแข่งขันคนอื่นๆ ล้วนเป็นโมเดลที่ใหญ่กว่ามาก
ผลลัพธ์อิสระชิ้นที่สาม: โมเดลโอเพนอันดับ #1 บน Image-to-WebDev ของ Arena.ai
ผลลัพธ์อิสระชุดที่สามมาถึงในวันที่ 26 สิงหาคม และเป็นผลลัพธ์ที่แข็งแกร่งที่สุดเท่าที่เคยมีมาสำหรับโมเดลขนาดนี้ {{1}}Image-to-WebDev เป็นบอร์ดพี่น้องของ WebDev ของ Code Arena บน Arena.ai — แอรีนาที่โมเดลจะได้รับภาพหน้าจอหรือภาพอ้างอิงอื่นๆ แล้วต้องเปลี่ยนให้เป็นเว็บอินเทอร์เฟซที่ใช้งานได้ โดยมีมนุษย์ผู้โหวตแบบไม่เห็นต้นทางเลือกผลลัพธ์ที่พวกเขาอยากจะนำไปใช้งานจริง{{/1}} {{2}}บนลีดเดอร์บอร์ดสาธารณะนั้น Qwen3.8-27B ครองอันดับ #1 ในบรรดาโมเดลโอเพน และอันดับ #7 โดยรวม ด้วยคะแนนแอรีนาที่รายงานไว้ที่ 1,574{{/2}}
ตำแหน่งที่ปรากฏเป็นส่วนที่เป็นอิสระ — มันอยู่บนลีดเดอร์บอร์ดของบุคคลที่สามที่ใครก็สามารถเปิดดูได้ หัวข้อข่าวที่รายล้อมนั้นมาจากการระบุของ Alibaba: ประกาศของทีม Qwen เมื่อวันที่ 26 สิงหาคม ระบุว่าโมเดล 27B "ทัดเทียมกับโมเดลที่มีขนาดใหญ่กว่า 100 เท่า" ในการทดสอบนี้ ซึ่งเป็นการเปรียบเทียบที่ลีดเดอร์บอร์ดไม่ได้บันทึกไว้ และการจัดอันดับความชอบไม่ใช่การตัดสินคุณภาพของโค้ด — คะแนนโหวต Image-to-WebDev วัดว่าเอาต์พุตใดที่มนุษย์อยากนำไปใช้มากกว่า ไม่ใช่ว่า HTML นั้นปลอดภัย เข้าถึงได้ หรือบำรุงรักษาได้หรือไม่ สิ่งที่ผลลัพธ์นี้ยืนยันคือ โมเดลน้ำหนักเปิดขนาด 27B ขณะนี้เป็นผู้นำในบรรดาโมเดลเปิดทั้งหมดในด้านการเปลี่ยนภาพให้เป็นหน้าเว็บ ซึ่งเป็นทักษะที่กลุ่มผลิตภัณฑ์ "screenshot to site" ที่กำลังเติบโตสร้างบนพื้นฐานนี้
ช่องว่างที่ต้องยอมรับอย่างตรงไปตรงมา: จุดที่ยังพ่ายแพ้ และข้อควรระวังด้านระเบียบวิธี
เมื่อเทียบกับรุ่นระดับแนวหน้า ภาพที่ได้ก็ดูดีแต่ก็ไม่ได้มีด้านเดียว ตรงที่ Qwen3.8-27B และ Claude Opus 4.6 Max ทับซ้อนกัน Qwen ชนะส่วนใหญ่ — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench และกลุ่มงานด้านวิทัศน์ทั้งหมด เมื่อเทียบกับ Muse Glimmer-30B ของ Meta ซึ่งเป็นคู่แข่งระดับท้องถิ่นโดยธรรมชาติ มันชนะทั้งแปดเบนช์มาร์กที่ทับซ้อนกันอย่างขาดลอย แต่ก็ยังแพ้ Terminal-Bench 2.1 (73.0 ต่อ 78.2), GPQA Diamond (89.2 ต่อ 91.3), Humanity's Last Exam (30.8 ต่อ 40.0) และ NL2Repo-Bench (42.3 ต่อ 47.6) ให้กับ Claude Opus 4.6 Max ถ้างานของคุณคือการให้เหตุผลระดับแนวหน้าที่ยากที่สุด — คณิตศาสตร์ระดับแนวหน้า คำถามที่ครอบคลุมหลายสาขาวิชาอย่างมาก — 27B ก็ยังไปไม่ถึงจุดนั้น
ข้อควรระวังสามประการก่อนที่คุณจะอ้างอิงสิ่งเหล่านี้ ประการแรก ตารางในโมเดลการ์ดด้านบนยังคงเป็นข้อมูลที่รายงานโดย Alibaba ทั้งหมด — ยังไม่มีดัชนี Artificial Analysis สำหรับรุ่น 27B ขณะนี้มีผลการทดสอบจากบุคคลที่สามอิสระสามรายการ แต่แต่ละรายการมีขอบเขตจำกัด: การจัดอันดับ Code Arena วัดการสร้างเว็บแอปจากพรอมต์ข้อความ การจัดอันดับ Image-to-WebDev วัดการเปลี่ยนภาพหน้าจอเป็นหน้าเว็บที่ใช้งานได้ ทั้งสองถูกตัดสินโดยการโหวตแบบปกปิดบนผลลัพธ์ที่ไม่ระบุชื่อ และการศึกษาด้านเอเจนต์กฎหมายของ Harvey ครอบคลุมเพียงโดเมนเดียวกับโมเดลที่ฝึกมาเพื่อการทดสอบนั้น ไม่มีรายการใดเป็นการรันน้ำหนักของโมเดลมาตรฐานบนชุดทดสอบอเนกประสงค์ ประการที่สอง โมเดลการ์ดใช้ชุดทดสอบ Claude Code สำหรับ SWE-bench Pro และ QwenSWEBench และใช้ผู้ตัดสิน GPT-4o สำหรับ Humanity's Last Exam — การเปรียบเทียบกับโมเดลที่ให้คะแนนบนชุดทดสอบอื่นจะทำให้ตัวเลขเปลี่ยนไป ประการที่สาม การรัน MathVision ของ Alibaba ใช้พรอมต์คงที่ ในขณะที่คู่แข่งได้รับค่าที่สูงกว่าจากสองรูปแบบ ทั้งหมดนี้ไม่ได้หมายความว่าผลลัพธ์ผิด; แต่หมายความว่ามันเป็นเพดาน ไม่ใช่พื้น จนกว่าห้องปฏิบัติการอิสระจะรันโมเดลบนชุดทดสอบอเนกประสงค์ที่เป็นกลาง
สิ่งที่ต้องใช้ในการรันมัน
Qwen3.8-27B เป็นโมเดลท้องถิ่น ซึ่งเปลี่ยนความหมายของ "ประสิทธิภาพ" ไปจากเดิม: เป็นปริมาณงานบนฮาร์ดแวร์ของคุณเอง แทนที่จะเป็นป้ายราคา น้ำหนัก BF16 อยู่ที่ประมาณ 55.6GB; เมื่อควอนไทซ์เป็น 4 บิต ก็พอดีกับการ์ด 24GB เช่น RTX 3090 หรือ 4090 AMD ปล่อยการสนับสนุน Day-0 ในวันเปิดตัว และการวัดของ llama.cpp/Vulkan ของตัวเอง — สิงหาคม 2026 เฉลี่ยจากการรันสามครั้งขึ้นไป — อยู่ที่ 24.5 โทเคน/วินาที บน Ryzen AI Max+ 395 และ 51.8 โทเคน/วินาที บน Radeon AI PRO R9700 ขนาด 32GB บนระบบที่มีหน่วยความจำกราฟิกแบบแปรผันหรือ VRAM มากกว่าประมาณ 24GB การทดสอบของชุมชนสำหรับบิลด์ FP8 บน NVIDIA GH200 รองรับคำขอ 262K คอนเทกซ์พร้อมกัน 10 รายการ โดยมีเวลา-ถึง-โทเคนแรกต่ำกว่า 10ms ตัวเลขของคุณจะต่างออกไป — นั่นคือ GPU ของคนอื่น — แต่ภาพรวมนั้นเป็นจริง: นี่คือการเปิดตัว Qwen ครั้งแรกในคลาสนี้ที่ทำงานได้ ไม่ใช่แค่ในรีวิว บนเวิร์กสเตชันเครื่องเดียว
เวทฟรี หรือ API แบบเสียเงิน?
การตัดสินใจที่โมเดลนี้บังคับให้คุณทำ คือการแบ่งระหว่างระบบท้องถิ่นกับระบบโฮสต์: ตัวน้ำหนัก (weights) ไม่มีค่าใช้จ่าย แต่ GPU ของคุณไม่ฟรี การโฮสต์เองหมายถึงการเป็นเจ้าของซิลิคอน — การ์ด 24GB หนึ่งใบถ้าคุณยอมรับการควอนไทซ์แบบ 4 บิตและการสร้างข้อความที่ช้าลง หรืออะไรที่ใหญ่กว่านั้นถ้าคุณต้องการบริบท 262K เต็มรูปแบบที่คุณภาพเต็ม ทางเลือกแบบโฮสต์บน OrcaRouter คิดราคา $0.33 ต่อล้านโทเคนนำเข้า และ $2.40 ต่อล้านโทเคนส่งออก พร้อมบริบท 262K เท่ากันและอินพุตรูปภาพบวกวิดีโอ และค่า p50 ของเวลาจนถึงโทเคนแรกที่ 225ms ซึ่งวัดในเจ็ดวันที่ผ่านมา — ไม่ต้องซื้อ GPU ไม่ต้องดูแล VRAM เลขคณิตก็คือแบบที่คุณทำกับโอเพนเวตเสมอ: ปริมาณโทเคนที่คุณต้องการจริงคูณด้วยต้นทุนต่อโทเคน เทียบกับราคาแบนของการ์ด ที่ปริมาณการใช้งานต่อเนื่องสูง การโฮสต์เองชนะ; ที่ปริมาณแบบกระชุหรือปานกลาง การจ่าย $0.33/$2.40 ดีกว่าการซื้อซิลิคอนที่คุณปล่อยว่างเป็นส่วนใหญ่

ประเด็นสำคัญ
Qwen3.8-27B เป็นโมเดลโอเพนเวตที่แข็งแกร่งที่สุดที่ Alibaba เคยเปิดตัวในขนาดคลาสนี้ ตามตัวเลขของ Alibaba เอง: ดีที่สุดในตารางสำหรับ agentic coding, computer use และ vision reasoning พร้อมหน้าต่างบริบท 262K และน้ำหนัก Apache 2.0 การอ่านสกอร์การ์ดอย่างถูกต้องเป็นแบบมีเงื่อนไข — ทุกตัวเลขในโมเดลการ์ดเป็นข้อมูลที่ผู้ขายรายงาน จำเพาะต่อชุดทดสอบ และยังไม่มีการทำซ้ำ และโมเดลระดับแนวหน้ายังคงชนะเบนช์มาร์กด้านการใช้เหตุผลที่ยากที่สุด หากคุณกำลังตัดสินใจว่าจะโฮสต์เองหรือเรียกใช้เป็น API จงถือว่าตารางเบนช์มาร์กเป็นคำมั่นสัญญา ตัวเลขปริมาณงานของ AMD เป็นการวัดฮาร์ดแวร์อิสระครั้งแรก ผลลัพธ์ Harvey legal-agent เป็นสัญญาณอิสระแรกที่ความสามารถของโมเดลยังคงอยู่ภายนอกชุดทดสอบของ Alibaba เอง และการจัดอันดับ webdev-arena สองรายการ — อันดับ #9 โดยรวมใน Code Arena's WebDev และอันดับ #1 โมเดลโอเพนใน Arena.ai's Image-to-WebDev — เป็นการยืนยันจากลีดเดอร์บอร์ดด้านการเขียนโค้ดอิสระครั้งแรกของความสามารถดังกล่าว เราจะอัปเดตหน้านี้เมื่อห้องแล็บอิสระอื่นๆ เผยแพร่คะแนนเพิ่มเติม
