การ์ดหัวเรื่องหลักสำหรับรีวิว Qwen3.8-27B ชื่อเรื่อง 'Qwen3.8-27B Review' พร้อมคำบรรยายว่า 'โมเดลโอเพนเวท 27B ที่เป็น Opus ฉบับบ้าน ๆ — ทดสอบกับกระแส hype' แสดงป้ายโอเพนเวท ป้าย Apache 2.0 และชุดไอคอน GPU และเซิร์ฟเวอร์ บนพื้นหลังสีขาวสะอาดพร้อมไล่เฉดสีฟ้าอ่อน
Guides & Insights

รีวิว Qwen3.8-27B: โมเดลโอเพนเวตขนาด 27B ที่เป็น "Opus ฉบับบ้านๆ" — ทดสอบเทียบกับกระแส hype

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Qwen3.8 27Bเป็น open-weights 27B ที่ดีที่สุดที่คุณสามารถโฮสต์เองได้ในตอนนี้ และยังห่างชั้นมาก น้ำหนักถูกปล่อยเมื่อวันที่ 14 สิงหาคม 2026 ภายใต้ Apache 2.0: โมเดล dense 27B (28B หากนับ vision encoder) มี context ตามธรรมชาติ 262K รองรับ input ภาพและวิดีโอตามธรรมชาติ และคะแนน agentic-coding ที่ผู้ผลิตระบุว่าอยู่ในระดับเท่ากับหรือสูงกว่า Cla​ude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3 ราคาหลักคือศูนย์: ดาวน์โหลด 55.6 GB แล้วรันได้เลย ข้อควรระวังก็มีจริงเช่นกัน — การทดสอบอิสระพบว่ามันช้ากว่ารุ่นก่อนประมาณสามเท่าและกินโทเค็นมากกว่า ทุก benchmark บนการ์ดยังคงเป็นข้อมูลที่รายงานโดย Ali​baba และ context 1M เป็นฟีเจอร์สำหรับเวอร์ชันโฮสต์เท่านั้น สรุป: หากคุณมี GPU 24 GB ขึ้นไปและต้องการความสามารถใกล้เคียง frontier โดยไม่ต้องเสียเงินตามปริมาณการใช้งาน ก็โฮสต์เองได้เลย — แต่ควรรู้ไว้ก่อนว่าตัวเลขส่วนใดบ้างที่ยังไม่แข็งแรง

คำตัดสินก่อน: คุณควรใช้ Qwen3.8 27B หรือไม่?

คำตอบสั้น ๆ — ใช่สำหรับเวิร์กโหลดในเครื่องและส่วนตัว รอตัวเลขจากบุคคลที่สามก่อนตัดสินใจจัดซื้อ Qwen3.8 27Bเป็นโมเดลที่หายากซึ่ง open weights คือตัวผลิตภัณฑ์ และ API คือความสะดวกสบาย เนื่องจากใบอนุญาตเป็น Apache 2.0 ราคาต่อโทเคนจึงเป็นศูนย์ถาวรเมื่อคุณมีฮาร์ดแวร์แล้ว และไม่มีอะไรที่คุณสร้างบนนั้นจะถูกออกใบอนุญาตใหม่หรือเรียกเก็บเงินย้อนหลัง สิ่งที่คุณเสียไปคือความเร็ว การตรวจสอบ และความสะดวก

ถ้าคุณใช้งาน Qwen3.6-27B อยู่แล้วและพอใจกับมัน การอัปเกรดนั้นมีจริงแต่ไม่ฟรีในแง่ของเวลาที่ใช้จริง หากคุณมาที่นี่จากการเปิดตัว Qwen3.8-Max นี่คือสมาชิกที่เล็กกว่าและโฮสต์เองได้ในรุ่นเดียวกัน — เครื่องมือที่แตกต่างสำหรับงานที่แตกต่าง

ข้อเท็จจริงโดยย่อ ตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026

เผยแพร่ — น้ำหนักโมเดลเปิดให้ใช้งานเมื่อวันที่ 14 สิงหาคม 2026 ที่ Qwen/Qwen3.8-27B บน Hugging Face และมีมิเรอร์บน ModelScope; รายงานที่อ้างอิงเขตเวลาระบุวันที่ 13 สิงหาคมเช่นกัน และการเผยแพร่ครั้งนี้เกิดขึ้นหลังจากเจนเนอเรชัน Qwen3.8 ถูกประกาศไปประมาณหนึ่งสัปดาห์

สัญญาอนุญาต — Apache 2.0: ดาวน์โหลด แก้ไข แจกจ่าย ใช้ในเชิงพาณิชย์ได้ พร้อมการให้สิทธิ์สิทธิบัตรอย่างชัดแจ้ง ถาวร

พารามิเตอร์ — dense ขนาด 27B (28B หากนับรวม vision encoder), 64 เลเยอร์, hidden size 5,120, ขนาดคำศัพท์ 248,320.

สถาปัตยกรรม — ความสนใจแบบไฮบริด: เลเยอร์ Gated DeltaNet แบบ linear-attention 48 ชั้น เทียบกับเลเยอร์ Gated Attention เต็มรูปแบบ 16 ชั้น (อัตราส่วน 3:1) นี่คือเหตุผลที่โมเดลแบบหนาแน่น 27B สามารถรองรับโทเคนบริบทดั้งเดิมได้ 262K

บริบท — รองรับ 262,144 โทเค็นโดยกำเนิด; ขยายได้ถึง 1,000,000 ผ่าน YaRN ในเวอร์ชันโฮสต์

อินพุต — รองรับภาพและวิดีโอโดยตรงควบคู่กับข้อความ; ส่งคืนข้อความ ตัวเข้ารหัสภาพคือสาเหตุที่จำนวนพารามิเตอร์แสดงเป็น 28B

การคิด — โหมดการใช้เหตุผลเปิดอยู่โดยค่าเริ่มต้น และสามารถปิดได้ตามคำขอ; reasoning_effort (ต่ำ/กลาง/สูง) และ preserve_thinking สำหรับการรันเอเจนต์ระยะยาว.

น้ำหนัก — BF16 safetensors ขนาด 55.6 GB แบ่งเป็น 18 ชาร์ด; FP8 และ GGUFs จากชุมชนก็มีมาให้ด้วย

สเปกด้านบนมาจากการ์ดโมเดลและคอนฟิกของ Hugging Face สำหรับ Qwen3.8 27B ซึ่งอ่านเมื่อวันนี้ ข้ออ้างเรื่อง benchmark เป็นข้อมูลที่ Ali​baba รายงานเอง ณ วันนี้ยังไม่มีห้องปฏิบัติการอิสระใดทำซ้ำผลดังกล่าวได้

สิ่งที่ Qwen3.8 27B ทำได้ดีอย่างแท้จริง

กรณีที่แข็งแกร่งที่สุดคือวิศวกรรมซอฟต์แวร์แบบเอเจนต์ Ali​baba รายงานการเพิ่มขึ้น 3 เท่าบน DeepSWE 1.1 เมื่อเทียบกับรุ่น 27B ก่อนหน้า (42.2 เทียบกับ 13.3) และได้คะแนนสูงกว่า Cla​ude Opus 4.6 Max บน SWE-bench Pro (61.7 เทียบกับ 53.4) นี่คือตัวเลขที่ทำให้มันได้รับฉายาว่า "Opus at home" — โมเดล 27B แบบ dense ที่ทำงานเขียนโค้ดระดับใกล้แนวหน้าบนฮาร์ดแวร์ที่บุคคลธรรมดาสามารถเป็นเจ้าของได้จริง

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

นอกเหนือจากตัวเลขดิบแล้ว ยังมีอีกสามสิ่งที่ทำให้การซื้อนี้สมเหตุสมผล:

มัลติโมดัลแบบเนทีฟ. รองรับอินพุตรูปภาพและวิดีโอ เอาต์พุตเป็นข้อความ — เอกสารที่มีไดอะแกรมหรือวิดีโอแนะนำการใช้งานไม่ใช่โมเดลแยกต่างหาก คะแนนการให้เหตุผลทางภาพ (85.6 เมื่อเปิดใช้คุณสมบัติ chain-of-thought, 94.6 สำหรับคณิตศาสตร์ภาพ ทั้งคู่รายงานโดยผู้จำหน่าย) คือจุดที่ตัวเข้ารหัสภาพพิสูจน์คุณค่าของมัน

262K บริบทดั้งเดิม. งานเอเจนต์ระยะยาว โค้ดเบสขนาดใหญ่ และบทถอดความหลายชั่วโมงสามารถอยู่ในหน้าต่างเดียวได้ การออกแบบไฮบริดลิเนียร์-แอตเทนชันทำให้ต้นทุน KV ของบริบทนั้นต่ำกว่าโมเดลที่ใช้ full-attention เพียงอย่างเดียวที่มีขนาดเท่ากัน

น้ำหนักโมเดลฟรีและถาวร นี่คือประเด็นหลักของหมวดหมู่นี้: โมเดล API แบบปิดเป็นแบบเช่า; Qwen3.8 27B เป็นของคุณ ที่ 4-bit มันรันบนการ์ด 24 GB (ระดับ RTX 3090/4090) และ AMD ให้การสนับสนุน Day-0 (สูงสุด 24.5 tokens/s บน Ryzen AI Max+ 395 และ 51.8 tokens/s บน Radeon AI PRO R9700 ตามบล็อกของ AMD เอง)

จุดที่รีวิวเริ่มแย่ลง: ความเร็ว โทเคน และการตรวจสอบ

การทดสอบอิสระในตอนนี้เป็นเพียงชุดทดสอบของคนคนเดียว ไม่ใช่ห้องปฏิบัติการ — แต่มันเป็นสัญญาณที่ดีที่สุดที่เรามี การรันQwen3.8 27BเทียบกับQwen3.6-27Bบนงานจริงสิบงาน (ตัดสินโดย GPT-5.5 ผ่านชุดทดสอบ llmcompare) รุ่น 3.8 ชนะเก้าในสิบงาน และได้คะแนนเฉลี่ย 8.838 เทียบกับ 6.862 — "หนึ่งในการเพิ่มพูนความฉลาดที่น่าประทับใจที่สุด" ที่ผู้ทดสอบเคยเห็น นอกจากนี้ยังใช้โทเคนเกือบสามเท่าและช้ากว่าอย่างเห็นได้ชัด งานหนึ่งใช้เวลานานขึ้นประมาณ 600% ดังนั้นการเพิ่มขึ้นของคุณภาพเป็นเรื่องจริง และราคาที่ต้องจ่ายในแง่เวลาจริงก็เป็นเรื่องจริงเช่นกัน

อีกสี่อย่างที่เอาไว้ตำหนิมัน:

ยังไม่มีเกณฑ์วัดประสิทธิภาพจากบุคคลที่สาม ตัวเลขหลักทุกตัวในบทความนี้เป็นข้อมูลที่ Alibaba รายงาน ณ วันที่ 15 สิงหาคม การ์ดข้อมูลผู้จำหน่ายมีรายละเอียดครบถ้วน แต่ยังไม่มีการทดสอบซ้ำโดยห้องปฏิบัติการอิสระ หากการตัดสินใจของคุณขึ้นอยู่กับตัวเลขที่ผ่านการตรวจสอบแล้ว ก็ควรรอไว้ก่อน — น้ำหนักโมเดลจะยังอยู่ตรงนั้น

VRAM ขั้นต่ำมีจริง BF16 ต้องการ GPU ระดับ 80 GB เพื่อให้พอดีกับการ์ด 24 GB คุณต้องรันแบบ 4-bit และรายงานจากชุมชน (กระทู้คอมเมนต์บน dev.to หลังปล่อยไม่กี่วัน) ระบุว่าบิวด์แบบ quantized 'เสียโฟกัสเมื่อคอนเทกซ์ยาว' ใช้เวตอย่างเป็นทางการหากมี VRAM เพียงพอ; ใช้แบบ quantized หากไม่มี

บริบท 1M ใช้งานได้เฉพาะผ่านโฮสต์เท่านั้น. น้ำหนักเปิดจำกัดสูงสุดที่ 262K ส่วนค่าที่ขยายได้ถึง 1M เป็นฟีเจอร์ของ Qwen Cloud ที่โฮสต์ให้ใช้ ไม่ใช่สิ่งที่เวอร์ชันที่รันในเครื่องจะทำได้ทันทีโดยไม่ต้องตั้งค่า.

"Beats Opus" ต้องมีข้อแม้. เกณฑ์วัดแบบเอเจนต์ให้รางวัลกับพฤติกรรมเฉพาะของชุดทดสอบ และคอมเมนต์ยอดนิยมบนโพสต์เปิดตัวที่ dev.to พูดตรงๆ ว่า "พวกมันไม่ได้เหนือกว่า Opus ในการใช้งานจริง." จงมองกระดานคะแนนเป็นขีดจำกัดบนในวันที่ดี ไม่ใช่คำสัญญา.

มันวางตัวอย่างไรในตระกูล Qwen 3.8

เทียบกับ Qwen3.6-27B — ฮาร์ดแวร์คลาสเดียวกันและคอนเท็กซ์ 262K เท่าเดิม แต่ความสามารถก้าวกระโดดขึ้นอย่างมาก แลกมาด้วยความเร็วและประสิทธิภาพการใช้โทเคน หากคุณรัน 3.6 อยู่แล้วและมีข้อจำกัดด้านธรุปพุต การอยู่กับเวอร์ชันเดิมก็ถือว่าสมเหตุสมผล

เทียบกับ Qwen3-Coder-30B-A3B — Coder เป็น MoE ที่มีพารามิเตอร์ที่ใช้งานจริงประมาณ 3.3B พันล้านตัว และทำงานได้เร็วกว่ามาก (~90–110 โทเคนต่อวินาที) โมเดล 27B แบบ dense นั้นช้ากว่าต่อโทเคน แต่สืบทอดประโยชน์ด้าน agentic ของเจนเนอเรชันนี้ หากคะแนนด้านวิศวกรรมซอฟต์แวร์ของรุ่น 27B ยังคงดีภายใต้การทดสอบอิสระ บทบาทของ Coder-30B ก็จะลดลง

เทียบกับ Qwen3.8-Max — โมเดลเรือธง MoE ขนาด 2.4T เป็นโมเดลสำหรับดาตาเซ็นเตอร์ (ใช้ผ่าน API เท่านั้น ราคาประมาณ $2/$6 ต่อล้านโทเคนตามที่เผยแพร่) มีบริบท 1M และรองรับวิดีโอ ส่วนรุ่น 27B เป็นรุ่นที่นำไปปรับใช้ได้จริง ทั้งสองตอบคำถามคนละแบบ

ค่าใช้จ่าย: คำถามระหว่างโลคัลกับ API ยุติแล้ว

สำหรับโมเดลแบบปิด คุณเปรียบเทียบราคาต่อโทเค็น. สำหรับ Qwen3.8 27B ต้นทุนส่วนเพิ่มของโทเค็นบนฮาร์ดแวร์ของคุณเองคือศูนย์ — ราคาที่แท้จริงคือค่า GPU ล่วงหน้าและเวลาของคุณ ที่ 4-bit นั่นคือการ์ด 24 GB; ที่ BF16 คือเครื่องระดับ 80 GB หากคุณเพียงแค่ต้องการประเมินโมเดล หรือคุณไม่มีฮาร์ดแวร์ เส้นทางโฮสต์ก็มีอยู่: ตอนนี้ OrcaRouter แสดงรายการ Qwen3.8 27B ด้วยระดับฟรีที่จำกัดอัตรา ซึ่งเรียกเก็บเงิน $0 และคืน HTTP 429 เมื่อเกินขีดจำกัด รวมถึงระดับจ่ายเงินที่ $0.33 ต่อล้านโทเค็นนำเข้า และ $2.40 ต่อล้านโทเค็นส่งออก (ตรวจสอบเมื่อ 15 สิงหาคม) เวอร์ชันโฮสต์ของ Qwe​n Cloud ที่มีบริบท 1M ถูกระบุว่า "เร็ว ๆ นี้"

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

การวางกรอบอย่างตรงไปตรงมาคือ: สำหรับโมเดลแบบเปิดน้ำหนัก ผู้ให้บริการคือความสะดวก ไม่ใช่สิ่งที่ต้องพึ่งพา ระดับฟรีคือวิธีที่ถูกที่สุดในการตัดสินใจว่าการดาวน์โหลด 55.6 GB คุ้มค่าหรือไม่ แต่เมื่อคุณตัดสินใจแล้ว น้ำหนักคือสิ่งสำคัญ — และมันฟรี

วิธีลองใช้งานจริง

การประเมินที่เร็วที่สุด — ลองใช้เทียร์โฮสต์ฟรีที่มีการจำกัดอัตราการใช้งาน; ถ้ามันตอบสิ่งที่คุณต้องการได้ คุณก็ถือว่าเสร็จสิ้นโดยไม่เสียค่าใช้จ่ายใด ๆ

ทดสอบจริงบนฮาร์ดแวร์ของคุณ — ดาวน์โหลด GGUF จากชุมชน (บิลด์ Q4_K_M มีขนาดประมาณ 17 GB และพอดีกับการ์ด 24 GB) แล้วรันด้วย llama.cpp หรือ Ollama ส่ง Jinja chat template หรือโมเดลจะตอบคุณใน thought tags สำหรับ vision จาก GGUF คุณยังต้องใช้ไฟล์ mmproj แยกต่างหาก รันบุ๊กของเราสำหรับการรัน Qwen3.8 27B ในเครื่องจะอธิบายทีละขั้นตอน

ความแม่นยำเต็มรูปแบบ — ดาวน์โหลด Qwen/Qwen3.8-27B ด้วยคำสั่ง huggingface-cli ลงบน GPU ระดับ 80 GB.

ตรวจสอบสิ่งที่คุณดาวน์โหลด — ตรวจสอบว่าผู้เผยแพร่คือ Qwe​n org และตรวจสอบ shards กับ crc32.txt; มี repo ที่หน้าตาคล้ายกันปรากฏก่อนการเผยแพร่

เมื่อบทวิจารณ์นี้ผิด (และใครควรข้าม Qwen3.8 27B)

คุณไม่มี GPU และจะไม่เช่ามัน ระดับฟรีถูกจำกัดอัตราการใช้งาน และระดับเสียเงินอยู่ที่ $0.33/$2.40 ต่อล้าน — โมเดล API ขนาดเล็กอาจให้บริการคุณได้ถูกกว่าและน่าเชื่อถือกว่า โมเดลนี้เหมาะสำหรับคนที่ต้องการเป็นเจ้าของการอินференซ์

คุณต้องมี SLA โฮสต์เทียร์เพิ่งเปิดใช้งานไม่กี่วัน หน้าโมเดล OrcaRouter ที่อ่านวันนี้แสดงอัตราความผิดพลาด 33.3% ในเจ็ดวันล่าสุด และเวลา latency ของโทเค็นแรกที่ p50 เท่ากับ 225 ms นั่นคือโมเดลใหม่ภายใต้โหลดช่วงแรก ไม่ใช่สัญญาสำหรับการใช้งานจริง ผู้ที่โฮสต์เองควรปักหมุด commit ที่ดาวน์โหลดไว้และเก็บทางเลือกสำรองไว้

คุณจำเป็นต้องมีผลการวัดประสิทธิภาพที่ได้รับการตรวจสอบแล้วสำหรับการตัดสินใจซื้อ ตัวเลขที่ผู้จำหน่ายรายงานมีประโยชน์เพียงแค่บอกทิศทางเท่านั้น ไม่ได้มีคุณภาพพอสำหรับการจัดซื้อ ควรรอผลการทดสอบซ้ำโดยอิสระ

คอนเท็กซ์ 262K แบบโอเพนเวตส์ยังไม่เพียงพอ ส่วนขยาย 1M ในวันนี้มีเฉพาะแบบโฮสต์เท่านั้น

ทรูพุตคือคอขวดของคุณ การสรุปแบบเป็นชุดใหญ่หรือแบตช์ขนาดใหญ่จะส่งผลเสีย: นี่คือโมเดล 27B แบบ Dense ที่กินโทเคนมากกว่ารุ่นก่อนประมาณ 3 เท่า สำหรับงานปริมาณมากที่เน้นความคุ้มค่า โมเดลที่เล็กกว่าหรือเร็วกว่าจะดีกว่า

คุณใช้การ์ด 12 GB อยู่ โมเดล GGUF แบบ 2-bit พอจะใส่เข้าไปได้ แต่คุณภาพลดลงอย่างเห็นได้ชัด; โมเดลนี้ไม่เหมาะกับคุณ

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

สรุป

Qwen3.8 27B เป็นโมเดล open-weights ขนาด 27B ที่แข็งแกร่งที่สุดในปัจจุบัน และฟรีตลอดไปภายใต้ Apache 2.0 หากคุณมี GPU 24 GB+ และต้องการ agentic coding, คอนเท็กซ์ 262K, และการรับอินพุตรูปภาพ/วิดีโอแบบเนทีฟโดยไม่ต้องจ่ายตามการใช้งาน นี่คือตัวที่ควรซื้อ เหตุผลที่จะรอไว้ก็เป็นรูปธรรมไม่แพ้กัน: คุณต้องการการยืนยัน benchmark จากภายนอก, SLA, คอนเท็กซ์ open-weights มากกว่า 262K, หรือปริมาณงานที่สูงกว่าที่ dense 27B ให้ได้ โมเดลออกมาแล้ว, เวตมีจริง, และตัวเลขก็ดี — เพียงจำไว้ว่าตัวเลขเหล่านั้นเป็นของใคร

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube