
Qwen3.8-Flash-Next เทียบกับ Qwen3.8-27B: Qwen4-preview MoE ปะทะกับม้าศึกโอเพนเวต
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 578 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 182 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
สิ่งที่น่าแปลกใจเกี่ยวกับ Qwen3.8-Flash-Next ไม่ใช่ว่า Alibaba อ้างว่าโมเดลที่เปิดใช้งานเพียง 6 พันล้านพารามิเตอร์ต่อโทเคนสามารถเอาชนะโมเดลเปิดส่วนใหญ่ได้ — แต่เป็นการที่การให้บริการโมเดลนี้ต้องใช้หน่วยความจำมากกว่าโมเดล dense ขนาด 27 พันล้านพารามิเตอร์ที่ถูกนำมาเปรียบเทียบด้วย Qwen3.8-Flash-Next ซึ่งเปิดซอร์สเมื่อวันที่ 26 สิงหาคม 2026 ในฐานะตัวอย่างสถาปัตยกรรม Qwen4 เก็บตารางค้นหา N-gram ขนาด 51 พันล้านพารามิเตอร์ไว้ใน RAM ของระบบแทนที่จะเป็น VRAM ส่วน Qwen3.8-27B ซึ่งเป็นโมเดล dense แบบมัลติโมดัลภายใต้สัญญาอนุญาต Apache-2.0 ที่เปิดตัวในกลางเดือนสิงหาคมและเป็นโมเดลน้ำหนักเปิดหลักของรุ่น Qwen 3.8 ปัจจุบัน สามารถใส่ในการ์ดจอขนาด 24GB เพียงใบเดียวที่ความแม่นยำ 4-bit ในแผ่น benchmark ของ Alibaba เอง MoE ตัวใหม่เอาชนะ 27B ได้ใน 21 จาก 22 benchmark ที่เปรียบเทียบ แต่จากหลักฐานอิสระ — อันดับใน arena การศึกษาของตัวแทนกฎหมาย การวัดปริมาณงานจากบุคคลที่สาม — มีเพียง 27B เท่านั้นที่มีหลักฐานเหล่านี้ การรวมกันนั้นคือการตัดสินใจทั้งหมด
การจับคู่ในหนึ่งบรรทัด: สมาชิกแบบ open-weight ที่รองรับทั้งข้อความและภาพสองตัวจากรุ่นเดียวกัน มี native context 262K เท่ากัน ทั้งคู่ออกแบบมาให้ทำงานนอกศูนย์ข้อมูล — และต่างกันที่สถาปัตยกรรม ใบอนุญาต ราคา และเรื่องราวที่ได้รับการตรวจสอบมากเพียงใด Qwen3.8-Flash-Next คือโมเดล MoE แบบ sparse ที่แสดงตัวอย่างทุกอย่างที่คาดว่า Qwen4 จะสืบทอด ส่วน Qwen3.8-27B เป็นโมเดลแบบ dense ที่บีบอัดสิ่งที่ Alibaba เรียนรู้จากการสร้างโมเดลเรือธง 2.4T ให้อยู่ในสิ่งที่ GPU ตัวเดียวสามารถรันได้ การเลือกระหว่างสองตัวนี้จึงเกี่ยวกับความสามารถน้อยกว่า — Alibaba กล่าวว่าตัว preview ยังนำหน้า — และเกี่ยวกับว่าคุณจะเชื่อเอกสารจากผู้จำหน่ายที่เพิ่งออกมาเพียงวันเดียวมากกว่าโมเดลที่ชุมชนได้แยกแยะวิเคราะห์ไปแล้ว
กระดานคะแนน
เริ่มจากที่มาของข้อมูลก่อน: ตัวเลขทุกตัวของ Qwen3.8-Flash-Next ด้านล่างนี้เป็นของ Alibaba เอง เพิ่งออกมาได้หนึ่งวันและยังไม่มีการพิสูจน์ซ้ำ ส่วนการอ้างสิทธิ์ benchmark ระดับพาดหัวของ Qwen3.8-27B ก็เป็นข้อมูลที่ Alibaba รายงานเช่นกัน แต่รุ่น 27B มาพร้อมผลลัพธ์จากแหล่งอิสระ — การจัดอันดับในเวทีที่วัดความชอบของมนุษย์ การศึกษาในโดเมนกฎหมาย และการวัดปริมาณงาน (throughput) ของ AMD — ซึ่งเวอร์ชันพรีวิวเทียบไม่ได้
• จำนวนพารามิเตอร์ทั้งหมด — Qwen3.8-Flash-Next: MoE 125B + N-gram 51B + MTP (จัดเก็บ ~180B), ใช้งาน 6B. Qwen3.8-27B: dense ~27B (28B รวม vision encoder), ใช้งานทั้งหมด
• สถาปัตยกรรม — Qwen3.8-Flash-Next: Qwen4 พรีวิว — Qwen Sparse Attention สลับกับ Gated DeltaNet, gated residual, N-gram embeddings, ฝึกด้วย Muon Qwen3.8-27B: ชั้น linear-attention แบบ GDN 48 ชั้น บวกกับชั้น full-attention 16 ชั้น (3:1), แบบ dense
• บริบท — ทั้ง 262,144 โทเคนแบบเนทีฟ รองรับการขยายเป็น 1M ผ่าน YaRN
• รูปแบบ — ทั้งคู่รับข้อความ รูปภาพ และวิดีโอเป็นอินพุต และส่งกลับเป็นข้อความ
• ใบอนุญาต — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.
• ราคา — Qwen3.8-Flash-Next: $0.16 / $0.47 ต่อ 1M (ประกาศแล้ว; ยังไม่เปิดให้บริการ production API) Qwen3.8-27B: $0.33 / $2.40 ต่อ 1M ใช้งานได้วันนี้
• พื้นที่ที่ใช้เมื่อรัน — Qwen3.8-Flash-Next: ตาราง 51B ในแรมโฮสต์, หน่วยความจำระบบ ~96GB บวกกับ GPU ใดๆ; FP8 ~186GB, Q4 GGUF ~82GB. Qwen3.8-27B: BF16 ~55.6GB, 4-bit พอดีกับการ์ดจอ 24GB
• หลักฐานอิสระ — Qwen3.8-Flash-Next: ยังไม่มี Qwen3.8-27B: โมเดลเปิดอันดับ 1 บน Arena.ai Image-to-WebDev, อันดับ 9 โดยรวมบน Code Arena WebDev, อันดับ 1 โมเดลโอเพนเวทบนเกณฑ์วัด Legal Agent ของ Harvey, ปริมาณงานที่วัดโดย AMD

จากตัวเลขของอาลีบาบาเอง พรีวิวชนะแทบทุกอย่าง
การเปรียบเทียบที่อาลีบาบาเผยแพร่ระบุว่า Qwen3.8-Flash-Next ได้คะแนนเท่ากันหรือดีกว่าใน 21 จาก 22 เกณฑ์มาตรฐานด้านภาษาและวิทัศน์เมื่อเทียบกับ Qwen3.8-27B และชัยชนะเหล่านี้ไม่ใช่เพียงผิวเผิน SWE-bench Pro 62.5 เทียบกับ 61.7 เป็นการนำที่เล็กน้อย แต่ DeepSWE 58.7 เทียบกับ 42.2, JobBench 55.7 เทียบกับ 33.4 และ CoWorkBench 73.9 เทียบกับ 70.7 เป็นช่องว่างที่แท้จริงในงานด้าน agentic และสำนักงานซึ่งระดับ flash tier ตั้งเป้าไว้ ตัวเลขเด่นของพรีวิว — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — ยังผ่านแถวที่สอดคล้องกันของรุ่น 27B บนตารางของอาลีบาบาเช่นกัน นี่คือวิทยานิพนธ์ของการเผยแพร่นี้ที่แสดงเป็นข้อมูล: ความสามารถด้านการให้เหตุผลและการเขียนโค้ดส่วนใหญ่ของไลน์ Qwen 3.8 ที่ใหญ่กว่า ในสัดส่วนเพียงเล็กน้อยของพลังประมวลผลที่ใช้งานจริง
เก็บป้ายกำกับไว้กับประโยคนั้น สิ่งเหล่านี้เป็นการประเมินของ Alibaba เอง จากเครื่องมือทดสอบของ Alibaba เอง โดยในกรณีของพรีวิวนั้นมีอายุหนึ่งวัน และไม่ได้ทำซ้ำสำหรับทั้งคู่ การแยกชิ้นส่วนสถาปัตยกรรม KGP Talkie ที่ติดอันดับสำหรับการเปรียบเทียบนี้ได้ข้อสรุปในรูปแบบเดียวกัน แต่ก็อ้างอิงจากเอกสารของผู้จำหน่ายรายเดียวกัน ตารางของผู้จำหน่ายคือคำมั่นสัญญา ไม่มีสิ่งใดในย่อหน้านี้ได้รับการยืนยันอย่างอิสระ
สิ่งที่ 27B มีที่ Flash-Next ไม่มี: หลักฐาน
นี่คือจุดที่การเผชิญหน้าไม่เอียงข้างอีกต่อไป Qwen3.8-27B ใช้เวลาสองสัปดาห์ในที่สาธารณะ และชุมชนได้สร้างข้อมูลจุดอิสระสามจุด บนกระดานผู้นำ Image-to-WebDev ของ Arena.ai — การโหวตโดยมนุษย์แบบไม่เห็นชื่อว่าผู้ชมอยากส่งออกผลลัพธ์ใดในสองผลลัพธ์ที่ไม่ระบุตัวตน — 27B อยู่อันดับ #1 ในบรรดาโมเดลโอเพ่น และ #7 โดยรวม ด้วยคะแนนที่รายงานว่า 1,574 บนกระดาน Code Arena WebDev ที่เป็นพี่น้องกัน มันอยู่อันดับ #9 โดยรวมที่ 1,595 เป็นโมเดลเดียวในระดับขนาดเดียวกันที่อยู่ในสิบอันดับแรก Harvey บริษัท AI ด้านกฎหมาย และ Engram ริเริ่มการศึกษาบริษัทกฎหมายสังเคราะห์ที่ทำให้ 27B ที่ปรับแต่งแล้วอยู่ด้านบนสุดของเกณฑ์ชี้วัดเอเจนต์กฎหมายของพวกเขา — โดยมีข้อแม้ว่าโมเดลได้ศึกษาชุดทดสอบมาก่อนหน้านี้ ซึ่งทำให้เป็นการสาธิตขีดความสามารถในการปรับแต่ง (fine-tuning) มากกว่าคะแนนสำหรับน้ำหนักเริ่มต้น AMD เผยแพร่การวัดปริมาณงาน Day-0: 24.5 tokens/s บน Ryzen AI Max+ 395 และ 51.8 tokens/s บน Radeon AI PRO R9700 ไม่มีสิ่งใดเหล่านี้เป็นคะแนนคุณภาพเอนกประสงค์ — ยังไม่มีดัชนี Artificial Analysis สำหรับ 27B — แต่แต่ละอย่างเป็นบุคคลที่สามที่รันโมเดลจริง
Qwen3.8-Flash-Next ไม่มีสิ่งเหล่านั้นเลย ตาราง benchmark ทั้งหมดเป็นของ Alibaba ซึ่งเพิ่งเกิดขึ้นไม่กี่ชั่วโมงก่อนเขียนบทความนี้ และไม่มีห้องปฏิบัติการอิสระแห่งใดสามารถทำซ้ำได้แม้แต่แถวเดียว นั่นไม่ใช่ข้อกล่าวหา แต่เป็นนิยามของการเปิดตัวในวันแรก แต่นี่คือความไม่สมมาตรที่ควรกำหนดทางเลือก: เวอร์ชัน preview นำหน้าในตัวเลขเพียงชุดเดียวที่มีอยู่ และตัวเลขทุกตัวนั้นเขียนโดยผู้จำหน่ายที่อยากให้คุณเชื่อ
ฟอร์กการปรับใช้งาน
ความแตกต่างในทางปฏิบัติระหว่างสองโมเดลนี้คือว่าพารามิเตอร์อยู่ที่ไหน และมันเป็นตัวกำหนดว่าคุณต้องใช้ฮาร์ดแวร์อะไร Qwen3.8-Flash-Next จงใจย้ายตาราง N-gram embedding ขนาด 51B ไปไว้ในหน่วยความจำของโฮสต์ (host memory) ซึ่งสามารถดึงข้อมูลล่วงหน้าแบบอะซิงโครนัสได้ — นั่นคือเหตุผลที่มันเพิ่มความจุพารามิเตอร์ 51B โดยไม่เพิ่มการคำนวณต่อโทเคน ผลที่ตามมาคือโมเดลนี้จะไม่พอดีกับการ์ดสำหรับผู้บริโภคขนาด 24GB เหมือนที่ Qwen ในเครื่องเคยพอดีมาก่อน การประมาณจากชุมชนระบุว่า Q4 GGUF มีขนาดรวมประมาณ 82GB (น้ำหนักหลักประมาณ 58GB บวกกับตารางค้นหา 24GB), บิลด์ FP8 อยู่ที่ประมาณ 186GB, BF16 อยู่ที่ประมาณ 360GB; สูตรที่ใช้งานได้คือเครื่องที่มีแรมระบบประมาณ 96GB ประกอบกับการ์ดจอใดก็ได้ที่รันโมเดลแอคทีฟ 6B ข้อได้เปรียบคือการคำนวณต่อโทเคนมีต้นทุนต่ำ — ซึ่งเป็นเดิมพันทั้งหมดของสถาปัตยกรรมนี้ — และบริบทยาว 1M โทเคนยังคงมีราคาเหมาะสม เนื่องจากเลเยอร์ GDN บีบอัดประวัติแทนที่จะเพิ่มขนาดแคช KV
Qwen3.8-27B เป็นโมเดลที่กลับกัน: เป็นแบบ dense กล่าวคือทุกโทเคนต้องใช้พารามิเตอร์ทั้งหมด 27B แต่มีขนาดเล็กพอที่จะรันบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว น้ำหนักแบบ BF16 มีขนาดประมาณ 55.6GB; ที่ 4-bit สามารถรันบนการ์ด 24GB เช่น RTX 3090 หรือ 4090 และการวัดของ AMD แสดงว่ามันทำความเร็วได้ 24.5 ถึง 51.8 โทเคนต่อวินาทีบนฮาร์ดแวร์ระดับ AI Max-class และ Radeon PRO หากข้อจำกัดคือเวิร์กสเตชันเครื่องเดียว 27B คือรุ่นที่เหมาะจริงๆ หากข้อจำกัดคือต้นทุนต่อโทเคนในระดับใหญ่ Flash-Next คือรุ่นที่ชนะในเชิงทฤษฎี
ทางแยกราคา
ราคา API บอกเล่าเรื่องเดียวกันจากอีกด้านหนึ่ง Qwen3.8-27B เปิดให้บริการบน OrcaRouter วันนี้ที่ $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านโทเคนเอาต์พุต โดยส่งผ่านราคารายการของผู้ให้บริการมาโดยไม่มีส่วนเพิ่ม — ตัวเลือกโฮสต์เองถูกทำให้เรียกใช้ได้ โดยไม่ต้องซื้อ GPU Qwen3.8-Flash-Next ยังไม่ได้ถูกจัดเส้นทางไปที่ใด: น้ำหนักเปิดเท่านั้นที่เป็นหนทางเดียวจนกว่า Qwen3.8-Flash เวอร์ชันผลิตจะเปิดบน QwenCloud API ที่ราคาที่ประกาศไว้ $0.16/$0.47 เมื่อ API นั้นเปิด การส่งผ่านเดียวกันนี้จะทำให้ราคา $0.16/$0.47 มาอยู่ฝั่งเราในวันเดียวกัน บนคีย์เดียวกับรุ่น 27B พร้อมการเฟลโอเวอร์อัตโนมัติระหว่างทั้งสอง — ดังนั้นวิธีนำสถาปัตยกรรมที่เพิ่งเกิดหนึ่งวันมาใช้จึงไม่ใช่การทุ่มโปรดักชันให้เสี่ยงกับมัน แต่คือการส่งปริมาณทราฟิกบางส่วนไปยังมัน โดยให้โมเดลที่พิสูจน์แล้วเป็นตัวสำรอง เลเยอร์การจัดเส้นทางยังสามารถวางอยู่หน้าโมเดลที่คุณโฮสต์เอง ซึ่งเป็นหนทางปฏิบัติในการประเมินน้ำหนักเปิดของ Flash-Next ในวันนี้โดยไม่ต้องทำอินทิเกรชันครั้งที่สอง

จะรันอันไหน
เลือก Qwen3.8-Flash-Next หากคุณอยากลองทิศทาง Qwen4 ในตอนนี้ หากปริมาณงานของคุณสูงพอที่ $0.16/$0.47 เทียบกับ $0.33/$2.40 เป็นตัวเลขที่มีนัยสำคัญจริง หรือหากคุณมี RAM พอที่จะโฮสต์เองและไม่รู้สึกอึดอัดกับเอกสารจากผู้จำหน่าย เลือก Qwen3.8-27B หากคุณต้องการเงื่อนไข Apache-2.0 การ์ด 24GB ใบเดียว โมเดลที่เรียกใช้ได้ในวันนี้ หรือหลักฐานอิสระในระดับใดก็ตาม — เพราะมันเป็นเพียงหนึ่งในสองตัวที่เคยถูกใช้งานโดยคนนอก Alibaba

ภาพแคปเจอร์สองภาพด้านบนคือพื้นผิวสาธารณะของแต่ละฝั่ง: รายการ OrcaRouter ที่ Qwen3.8-27B เปิดให้เรียกใช้งานได้แล้ววันนี้ในราคา $0.33/$2.40 และการ์ดโมเดล Qwen/Qwen3.8-Flash-Next บน Hugging Face
และการปิดท้ายอย่างตรงไปตรงมาก็คือคำถาม เพราะหลักฐานที่มีอยู่นั้นเพิ่งเกิดขึ้นเพียงวันเดียว: แบบจำลองที่เปิดใช้พารามิเตอร์ 6 พันล้านตัวจะรักษาผลชนะ 21 จาก 22 ไว้ได้หรือไม่ภายใต้การทำซ้ำอย่างอิสระ หรือว่าตาราง N-gram ที่ทำให้มันตอบสนองได้อย่างคล่องตัวนั้นคือสิ่งที่ล้มเหลวเมื่อใช้งานจริง? 27B ผ่านการตรวจสอบจากชุมชนมาแล้วสองสัปดาห์ Flash-Next อยู่ในจุดที่ 27B เคยอยู่เมื่อสองสัปดาห์ก่อน — ซึ่งเป็นเหตุผลที่ดีที่สุดในการใช้งานทั้งสองควบคู่กันแทนที่จะเลือกเพียงอย่างเดียว
