Qwen3.8-Flash-Next เทียบกับ Qwen3.8-27B — Qwen4-preview โมเดล MoE ปะทะม้าศึก open-weights ภาพประกอบที่สร้างใหม่
Guides & Insights

Qwen3.8-Flash-Next เทียบกับ Qwen3.8-27B: Qwen4-preview MoE ปะทะกับม้าศึกโอเพนเวต

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สิ่งที่น่าแปลกใจเกี่ยวกับ Qwen3.8-Flash-Next ไม่ใช่ว่า Alibaba อ้างว่าโมเดลที่เปิดใช้งานเพียง 6 พันล้านพารามิเตอร์ต่อโทเคนสามารถเอาชนะโมเดลเปิดส่วนใหญ่ได้ — แต่เป็นการที่การให้บริการโมเดลนี้ต้องใช้หน่วยความจำมากกว่าโมเดล dense ขนาด 27 พันล้านพารามิเตอร์ที่ถูกนำมาเปรียบเทียบด้วย Qwen3.8-Flash-Next ซึ่งเปิดซอร์สเมื่อวันที่ 26 สิงหาคม 2026 ในฐานะตัวอย่างสถาปัตยกรรม Qwen4 เก็บตารางค้นหา N-gram ขนาด 51 พันล้านพารามิเตอร์ไว้ใน RAM ของระบบแทนที่จะเป็น VRAM ส่วน Qw​en3.8-27B ซึ่งเป็นโมเดล dense แบบมัลติโมดัลภายใต้สัญญาอนุญาต Apache-2.0 ที่เปิดตัวในกลางเดือนสิงหาคมและเป็นโมเดลน้ำหนักเปิดหลักของรุ่น Qw​en 3.8 ปัจจุบัน สามารถใส่ในการ์ดจอขนาด 24GB เพียงใบเดียวที่ความแม่นยำ 4-bit ในแผ่น benchmark ของ Alibaba เอง MoE ตัวใหม่เอาชนะ 27B ได้ใน 21 จาก 22 benchmark ที่เปรียบเทียบ แต่จากหลักฐานอิสระ — อันดับใน arena การศึกษาของตัวแทนกฎหมาย การวัดปริมาณงานจากบุคคลที่สาม — มีเพียง 27B เท่านั้นที่มีหลักฐานเหล่านี้ การรวมกันนั้นคือการตัดสินใจทั้งหมด

การจับคู่ในหนึ่งบรรทัด: สมาชิกแบบ open-weight ที่รองรับทั้งข้อความและภาพสองตัวจากรุ่นเดียวกัน มี native context 262K เท่ากัน ทั้งคู่ออกแบบมาให้ทำงานนอกศูนย์ข้อมูล — และต่างกันที่สถาปัตยกรรม ใบอนุญาต ราคา และเรื่องราวที่ได้รับการตรวจสอบมากเพียงใด Qwen3.8-Flash-Next คือโมเดล MoE แบบ sparse ที่แสดงตัวอย่างทุกอย่างที่คาดว่า Qwen4 จะสืบทอด ส่วน Qwen3.8-27B เป็นโมเดลแบบ dense ที่บีบอัดสิ่งที่ Alibaba เรียนรู้จากการสร้างโมเดลเรือธง 2.4T ให้อยู่ในสิ่งที่ GPU ตัวเดียวสามารถรันได้ การเลือกระหว่างสองตัวนี้จึงเกี่ยวกับความสามารถน้อยกว่า — Alibaba กล่าวว่าตัว preview ยังนำหน้า — และเกี่ยวกับว่าคุณจะเชื่อเอกสารจากผู้จำหน่ายที่เพิ่งออกมาเพียงวันเดียวมากกว่าโมเดลที่ชุมชนได้แยกแยะวิเคราะห์ไปแล้ว

กระดานคะแนน

เริ่มจากที่มาของข้อมูลก่อน: ตัวเลขทุกตัวของ Qwen3.8-Flash-Next ด้านล่างนี้เป็นของ Alibaba เอง เพิ่งออกมาได้หนึ่งวันและยังไม่มีการพิสูจน์ซ้ำ ส่วนการอ้างสิทธิ์ benchmark ระดับพาดหัวของ Qwen3.8-27B ก็เป็นข้อมูลที่ Alibaba รายงานเช่นกัน แต่รุ่น 27B มาพร้อมผลลัพธ์จากแหล่งอิสระ — การจัดอันดับในเวทีที่วัดความชอบของมนุษย์ การศึกษาในโดเมนกฎหมาย และการวัดปริมาณงาน (throughput) ของ AMD — ซึ่งเวอร์ชันพรีวิวเทียบไม่ได้

• จำนวนพารามิเตอร์ทั้งหมด — Qwen3.8-Flash-Next: MoE 125B + N-gram 51B + MTP (จัดเก็บ ~180B), ใช้งาน 6B. Qwen3.8-27B: dense ~27B (28B รวม vision encoder), ใช้งานทั้งหมด

• สถาปัตยกรรม — Qwen3.8-Flash-Next: Qwen4 พรีวิว — Qwen Sparse Attention สลับกับ Gated DeltaNet, gated residual, N-gram embeddings, ฝึกด้วย Muon Qwen3.8-27B: ชั้น linear-attention แบบ GDN 48 ชั้น บวกกับชั้น full-attention 16 ชั้น (3:1), แบบ dense

• บริบท — ทั้ง 262,144 โทเคนแบบเนทีฟ รองรับการขยายเป็น 1M ผ่าน YaRN

• รูปแบบ — ทั้งคู่รับข้อความ รูปภาพ และวิดีโอเป็นอินพุต และส่งกลับเป็นข้อความ

• ใบอนุญาต — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.

• ราคา — Qwen3.8-Flash-Next: $0.16 / $0.47 ต่อ 1M (ประกาศแล้ว; ยังไม่เปิดให้บริการ production API) Qw​en3.8-27B: $0.33 / $2.40 ต่อ 1M ใช้งานได้วันนี้

• พื้นที่ที่ใช้เมื่อรัน — Qwen3.8-Flash-Next: ตาราง 51B ในแรมโฮสต์, หน่วยความจำระบบ ~96GB บวกกับ GPU ใดๆ; FP8 ~186GB, Q4 GGUF ~82GB. Qw​en3.8-27B: BF16 ~55.6GB, 4-bit พอดีกับการ์ดจอ 24GB

• หลักฐานอิสระ — Qwen3.8-Flash-Next: ยังไม่มี Qwen3.8-27B: โมเดลเปิดอันดับ 1 บน Arena.ai Image-to-WebDev, อันดับ 9 โดยรวมบน Code Arena WebDev, อันดับ 1 โมเดลโอเพนเวทบนเกณฑ์วัด Legal Agent ของ Harvey, ปริมาณงานที่วัดโดย AMD

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

จากตัวเลขของอาลีบาบาเอง พรีวิวชนะแทบทุกอย่าง

การเปรียบเทียบที่อาลีบาบาเผยแพร่ระบุว่า Qwen3.8-Flash-Next ได้คะแนนเท่ากันหรือดีกว่าใน 21 จาก 22 เกณฑ์มาตรฐานด้านภาษาและวิทัศน์เมื่อเทียบกับ Qw​en3.8-27B และชัยชนะเหล่านี้ไม่ใช่เพียงผิวเผิน SWE-bench Pro 62.5 เทียบกับ 61.7 เป็นการนำที่เล็กน้อย แต่ DeepSWE 58.7 เทียบกับ 42.2, JobBench 55.7 เทียบกับ 33.4 และ CoWorkBench 73.9 เทียบกับ 70.7 เป็นช่องว่างที่แท้จริงในงานด้าน agentic และสำนักงานซึ่งระดับ flash tier ตั้งเป้าไว้ ตัวเลขเด่นของพรีวิว — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — ยังผ่านแถวที่สอดคล้องกันของรุ่น 27B บนตารางของอาลีบาบาเช่นกัน นี่คือวิทยานิพนธ์ของการเผยแพร่นี้ที่แสดงเป็นข้อมูล: ความสามารถด้านการให้เหตุผลและการเขียนโค้ดส่วนใหญ่ของไลน์ Qw​en 3.8 ที่ใหญ่กว่า ในสัดส่วนเพียงเล็กน้อยของพลังประมวลผลที่ใช้งานจริง

เก็บป้ายกำกับไว้กับประโยคนั้น สิ่งเหล่านี้เป็นการประเมินของ Alibaba เอง จากเครื่องมือทดสอบของ Alibaba เอง โดยในกรณีของพรีวิวนั้นมีอายุหนึ่งวัน และไม่ได้ทำซ้ำสำหรับทั้งคู่ การแยกชิ้นส่วนสถาปัตยกรรม KGP Talkie ที่ติดอันดับสำหรับการเปรียบเทียบนี้ได้ข้อสรุปในรูปแบบเดียวกัน แต่ก็อ้างอิงจากเอกสารของผู้จำหน่ายรายเดียวกัน ตารางของผู้จำหน่ายคือคำมั่นสัญญา ไม่มีสิ่งใดในย่อหน้านี้ได้รับการยืนยันอย่างอิสระ

สิ่งที่ 27B มีที่ Flash-Next ไม่มี: หลักฐาน

นี่คือจุดที่การเผชิญหน้าไม่เอียงข้างอีกต่อไป Qw​en3.8-27B ใช้เวลาสองสัปดาห์ในที่สาธารณะ และชุมชนได้สร้างข้อมูลจุดอิสระสามจุด บนกระดานผู้นำ Image-to-WebDev ของ Arena.ai — การโหวตโดยมนุษย์แบบไม่เห็นชื่อว่าผู้ชมอยากส่งออกผลลัพธ์ใดในสองผลลัพธ์ที่ไม่ระบุตัวตน — 27B อยู่อันดับ #1 ในบรรดาโมเดลโอเพ่น และ #7 โดยรวม ด้วยคะแนนที่รายงานว่า 1,574 บนกระดาน Code Arena WebDev ที่เป็นพี่น้องกัน มันอยู่อันดับ #9 โดยรวมที่ 1,595 เป็นโมเดลเดียวในระดับขนาดเดียวกันที่อยู่ในสิบอันดับแรก Harvey บริษัท AI ด้านกฎหมาย และ Engram ริเริ่มการศึกษาบริษัทกฎหมายสังเคราะห์ที่ทำให้ 27B ที่ปรับแต่งแล้วอยู่ด้านบนสุดของเกณฑ์ชี้วัดเอเจนต์กฎหมายของพวกเขา — โดยมีข้อแม้ว่าโมเดลได้ศึกษาชุดทดสอบมาก่อนหน้านี้ ซึ่งทำให้เป็นการสาธิตขีดความสามารถในการปรับแต่ง (fine-tuning) มากกว่าคะแนนสำหรับน้ำหนักเริ่มต้น AMD เผยแพร่การวัดปริมาณงาน Day-0: 24.5 tokens/s บน Ryzen AI Max+ 395 และ 51.8 tokens/s บน Radeon AI PRO R9700 ไม่มีสิ่งใดเหล่านี้เป็นคะแนนคุณภาพเอนกประสงค์ — ยังไม่มีดัชนี Artificial Analysis สำหรับ 27B — แต่แต่ละอย่างเป็นบุคคลที่สามที่รันโมเดลจริง

Qwen3.8-Flash-Next ไม่มีสิ่งเหล่านั้นเลย ตาราง benchmark ทั้งหมดเป็นของ Alibaba ซึ่งเพิ่งเกิดขึ้นไม่กี่ชั่วโมงก่อนเขียนบทความนี้ และไม่มีห้องปฏิบัติการอิสระแห่งใดสามารถทำซ้ำได้แม้แต่แถวเดียว นั่นไม่ใช่ข้อกล่าวหา แต่เป็นนิยามของการเปิดตัวในวันแรก แต่นี่คือความไม่สมมาตรที่ควรกำหนดทางเลือก: เวอร์ชัน preview นำหน้าในตัวเลขเพียงชุดเดียวที่มีอยู่ และตัวเลขทุกตัวนั้นเขียนโดยผู้จำหน่ายที่อยากให้คุณเชื่อ

ฟอร์กการปรับใช้งาน

ความแตกต่างในทางปฏิบัติระหว่างสองโมเดลนี้คือว่าพารามิเตอร์อยู่ที่ไหน และมันเป็นตัวกำหนดว่าคุณต้องใช้ฮาร์ดแวร์อะไร Qwen3.8-Flash-Next จงใจย้ายตาราง N-gram embedding ขนาด 51B ไปไว้ในหน่วยความจำของโฮสต์ (host memory) ซึ่งสามารถดึงข้อมูลล่วงหน้าแบบอะซิงโครนัสได้ — นั่นคือเหตุผลที่มันเพิ่มความจุพารามิเตอร์ 51B โดยไม่เพิ่มการคำนวณต่อโทเคน ผลที่ตามมาคือโมเดลนี้จะไม่พอดีกับการ์ดสำหรับผู้บริโภคขนาด 24GB เหมือนที่ Qw​en ในเครื่องเคยพอดีมาก่อน การประมาณจากชุมชนระบุว่า Q4 GGUF มีขนาดรวมประมาณ 82GB (น้ำหนักหลักประมาณ 58GB บวกกับตารางค้นหา 24GB), บิลด์ FP8 อยู่ที่ประมาณ 186GB, BF16 อยู่ที่ประมาณ 360GB; สูตรที่ใช้งานได้คือเครื่องที่มีแรมระบบประมาณ 96GB ประกอบกับการ์ดจอใดก็ได้ที่รันโมเดลแอคทีฟ 6B ข้อได้เปรียบคือการคำนวณต่อโทเคนมีต้นทุนต่ำ — ซึ่งเป็นเดิมพันทั้งหมดของสถาปัตยกรรมนี้ — และบริบทยาว 1M โทเคนยังคงมีราคาเหมาะสม เนื่องจากเลเยอร์ GDN บีบอัดประวัติแทนที่จะเพิ่มขนาดแคช KV

Qwen3.8-27B เป็นโมเดลที่กลับกัน: เป็นแบบ dense กล่าวคือทุกโทเคนต้องใช้พารามิเตอร์ทั้งหมด 27B แต่มีขนาดเล็กพอที่จะรันบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว น้ำหนักแบบ BF16 มีขนาดประมาณ 55.6GB; ที่ 4-bit สามารถรันบนการ์ด 24GB เช่น RTX 3090 หรือ 4090 และการวัดของ AMD แสดงว่ามันทำความเร็วได้ 24.5 ถึง 51.8 โทเคนต่อวินาทีบนฮาร์ดแวร์ระดับ AI Max-class และ Radeon PRO หากข้อจำกัดคือเวิร์กสเตชันเครื่องเดียว 27B คือรุ่นที่เหมาะจริงๆ หากข้อจำกัดคือต้นทุนต่อโทเคนในระดับใหญ่ Flash-Next คือรุ่นที่ชนะในเชิงทฤษฎี

ทางแยกราคา

ราคา API บอกเล่าเรื่องเดียวกันจากอีกด้านหนึ่ง Qwen3.8-27B เปิดให้บริการบน OrcaRouter วันนี้ที่ $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านโทเคนเอาต์พุต โดยส่งผ่านราคารายการของผู้ให้บริการมาโดยไม่มีส่วนเพิ่ม — ตัวเลือกโฮสต์เองถูกทำให้เรียกใช้ได้ โดยไม่ต้องซื้อ GPU Qwen3.8-Flash-Next ยังไม่ได้ถูกจัดเส้นทางไปที่ใด: น้ำหนักเปิดเท่านั้นที่เป็นหนทางเดียวจนกว่า Qwen3.8-Flash เวอร์ชันผลิตจะเปิดบน QwenCloud API ที่ราคาที่ประกาศไว้ $0.16/$0.47 เมื่อ API นั้นเปิด การส่งผ่านเดียวกันนี้จะทำให้ราคา $0.16/$0.47 มาอยู่ฝั่งเราในวันเดียวกัน บนคีย์เดียวกับรุ่น 27B พร้อมการเฟลโอเวอร์อัตโนมัติระหว่างทั้งสอง — ดังนั้นวิธีนำสถาปัตยกรรมที่เพิ่งเกิดหนึ่งวันมาใช้จึงไม่ใช่การทุ่มโปรดักชันให้เสี่ยงกับมัน แต่คือการส่งปริมาณทราฟิกบางส่วนไปยังมัน โดยให้โมเดลที่พิสูจน์แล้วเป็นตัวสำรอง เลเยอร์การจัดเส้นทางยังสามารถวางอยู่หน้าโมเดลที่คุณโฮสต์เอง ซึ่งเป็นหนทางปฏิบัติในการประเมินน้ำหนักเปิดของ Flash-Next ในวันนี้โดยไม่ต้องทำอินทิเกรชันครั้งที่สอง

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

จะรันอันไหน

เลือก Qwen3.8-Flash-Next หากคุณอยากลองทิศทาง Qwen4 ในตอนนี้ หากปริมาณงานของคุณสูงพอที่ $0.16/$0.47 เทียบกับ $0.33/$2.40 เป็นตัวเลขที่มีนัยสำคัญจริง หรือหากคุณมี RAM พอที่จะโฮสต์เองและไม่รู้สึกอึดอัดกับเอกสารจากผู้จำหน่าย เลือก Qw​en3.8-27B หากคุณต้องการเงื่อนไข Apache-2.0 การ์ด 24GB ใบเดียว โมเดลที่เรียกใช้ได้ในวันนี้ หรือหลักฐานอิสระในระดับใดก็ตาม — เพราะมันเป็นเพียงหนึ่งในสองตัวที่เคยถูกใช้งานโดยคนนอก Alibaba

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

ภาพแคปเจอร์สองภาพด้านบนคือพื้นผิวสาธารณะของแต่ละฝั่ง: รายการ OrcaRouter ที่ Qw​en3.8-27B เปิดให้เรียกใช้งานได้แล้ววันนี้ในราคา $0.33/$2.40 และการ์ดโมเดล Qwen/Qwen3.8-Flash-Next บน Hugging Face

และการปิดท้ายอย่างตรงไปตรงมาก็คือคำถาม เพราะหลักฐานที่มีอยู่นั้นเพิ่งเกิดขึ้นเพียงวันเดียว: แบบจำลองที่เปิดใช้พารามิเตอร์ 6 พันล้านตัวจะรักษาผลชนะ 21 จาก 22 ไว้ได้หรือไม่ภายใต้การทำซ้ำอย่างอิสระ หรือว่าตาราง N-gram ที่ทำให้มันตอบสนองได้อย่างคล่องตัวนั้นคือสิ่งที่ล้มเหลวเมื่อใช้งานจริง? 27B ผ่านการตรวจสอบจากชุมชนมาแล้วสองสัปดาห์ Flash-Next อยู่ในจุดที่ 27B เคยอยู่เมื่อสองสัปดาห์ก่อน — ซึ่งเป็นเหตุผลที่ดีที่สุดในการใช้งานทั้งสองควบคู่กันแทนที่จะเลือกเพียงอย่างเดียว

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube