พบกับ Qwen3.8-Flash — โมเดล MoE แบบมัลติโมดัลโอเพนเวตที่แสดงตัวอย่างสถาปัตยกรรม Qwen4 ภาพประกอบที่สร้างขึ้นใหม่
Guides & Insights

พบกับ Qwen3.8-Flash: โมเดล MoE แบบมัลติโมดัลแบบเปิดน้ำหนัก (open-weight) ที่แสดงตัวอย่างสถาปัตยกรรม Qwen4 — ราคา $0.15/$0.47 ต่อ 1 ล้านโทเคนบน QwenCloud

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 26 สิงหาคม 2026 ทีม Qwen ได้เปิดเผยน้ำหนักโมเดลเบื้องหลัง Qwen3.8-Flash เป็นโอเพนซอร์ส — เผยแพร่บน Hugging Face และ ModelScope ภายใต้ชื่อ Qwen3.8-Flash-Next — และเปิดตัวโมเดลสำหรับการผลิตที่ใช้ชื่อ Qwen3.8-Flash บน API ของ QwenCloud พร้อมยืนยันราคาอย่างเป็นทางการในวันถัดมา ตัวเลขที่โดดเด่น — ซึ่งได้รับการยืนยันอย่างเป็นทางการในประกาศของอาลีบาบาเองเมื่อวันที่ 28 สิงหาคม — คือโมเดลมัลติโมดัลแบบ mixture-of-experts ที่มีพารามิเตอร์ 125 พันล้านตัว แต่เปิดใช้งานเพียงประมาณ 6 พันล้านพารามิเตอร์ต่อโทเคน คิดเป็นความเบาบางราว 95% สร้างขึ้นบนสถาปัตยกรรมที่อาลีบาบาระบุอย่างชัดเจนว่าเป็นตัวอย่างเบื้องต้นของเจนเนอเรชัน Qwen4 API สำหรับการผลิตใช้งานได้จริงบน QwenCloud ในราคา 0.15 ดอลลาร์ต่อล้านโทเคนขาเข้า 0.47 ดอลลาร์ต่อล้านโทเคนขาออก และ 0.016 ดอลลาร์ต่อล้านโทเคนเมื่อ命中แคช — เป็นวิธีที่ถูกที่สุดในการรันสิ่งที่มีโครงสร้างสืบเชื้อสายจากโมเดลเรือธงถัดไปของอาลีบาบา และเป็นครั้งแรกที่ห้องแล็บเผยแพร่ตัวอย่างสถาปัตยกรรมเป็นโอเพนเวตสาธารณะก่อนที่โมเดลทั้งตระกูลจะเกิดขึ้นจริง

ตัวเลขหนึ่งตัวมีน้ำหนักมากกว่าสเปกอื่นๆ ทั้งหมด: 6B Qwen3.8-Flash ไม่ได้ความสามารถมาจากขนาดอันมหึมา — แต่มาจากจุดที่มันเลือกทุ่มพลังการประมวลผล ตัวหลักแบบ MoE ขนาด 125B, ตาราง N-gram embedding ขนาด 51B และโมดูล multi-token-prediction ขนาดเล็ก เก็บพารามิเตอร์เกือบ 180B ไว้บนดิสก์ แต่แต่ละโทเคนถูกส่งผ่านเพียงแค่ 6B จากทั้งหมดเท่านั้น นี่คือเดิมพันที่ทั้งรีลีสนี้ตั้งอยู่ และเป็นเหตุผลที่ค่าใช้จ่ายในการเทรนลดลงมาได้มากขนาดนี้

สิ่งที่ส่งมอบจริง

Qwen3.8-Flash ที่ไม่มีคำต่อท้าย (suffix) คือโมเดลที่เข้าสู่ระบบการผลิตแล้ว ซึ่งตอนนี้เปิดใช้งานบน QwenCloud API และภายในผลิตภัณฑ์ Qwen Office ของ Alibaba; โดยมาพร้อมกับบริบทเริ่มต้น 1M โทเคนและเครื่องมือในตัว ในราคา $0.15/$0.47 ต่อล้านโทเคน และการ cache hit ที่ $0.016 เมื่อวันที่ 28 สิงหาคม รายการช่องทางที่รองรับได้ขยายกว้างขึ้น: ตามประกาศของ Alibaba ตอนนี้ Qwen3.8-Flash ยังใช้งานได้ผ่าน OpenCode Go ซึ่งเป็นบริการสมัครสมาชิกแบบอัตราคงที่ของเอเจนต์เขียนโค้ดโอเพนซอร์สบนเทอร์มินัล — รายการโมเดลของ OpenCode เองระบุว่าเป็น qwen3.8-flash ในอัตรา $0.15/$0.47 ต่อล้านโทเคนเท่าเดิม

A screenshot of the official Qwen Studio blog post 'Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency' (captured August 27, 2026), showing the Qwen Studio navigation bar, the article headline, and the 'Now Open Weights' announcement banner.

การประกาศอย่างเป็นทางการของ Qw​en Studio กล่าวถึงการปล่อย open-weights ว่าเป็นคำเชิญสู่ระบบนิเวศ: ส่งการเปลี่ยนแปลงเชิงโครงสร้างออกมาแต่เนิ่นๆ เพื่อให้ชุมชนและสแตกการอนุมานสามารถปรับตัวได้ก่อนที่ไลน์อัป Qwen4 เต็มรูปแบบจะถูกสร้างขึ้น สัญญาณแรกที่พิสูจน์ว่าวิธีนี้ได้ผลคือ SGLang — เอ็นจิ้นการอนุมานที่ backed โดย LMSYS — เผยแพร่การสนับสนุนวันแรก (day-0) สำหรับ Qwen3.8-Flash-Next ในวันเดียวกัน โดยโมเดลยังถูกกำหนดค่าสำหรับ Transformers, vLLM และ TokenSpeed

สถาปัตยกรรมคือเรื่องเล่า

นี่ไม่ใช่โมเดลรุ่น Qwen 3.8 ที่ถูกย่อขนาดลง Qwen3.8-Flash แนะนำการเปลี่ยนแปลงสี่อย่างที่ทีมบอกว่าตระกูล Qwen4 จะสืบทอด และแต่ละอย่างมุ่งเป้าไปที่คอขวดที่แตกต่างกัน

• Attention — Gated DeltaNet รวมกับ Qwen Sparse Attention Gated DeltaNet (GDN) บีบอัดประวัติให้อยู่ในสถานะขนาดคงที่ในสามในสี่เลเยอร์ ทำให้โมเดลไม่ต้องอ่านทุกอย่างซ้ำในทุกขั้นตอน จากนั้น QSA มองบริบทระยะยาวเป็นปัญหาการค้นหา โดยตัวจัดทำดัชนีน้ำหนักเบาจะรวมลำดับเป็นไมโครบล็อก ให้คะแนนความสำคัญระดับบล็อก และนำความสนใจไปยังพื้นที่ที่เกี่ยวข้องมากที่สุด จากการวัดของ Alibaba เคอร์เนลความสนใจ QSA ทำความเร็ว prefill ได้เร็วกว่าถึง 7.6 เท่า และ decode เร็วกว่า 4.9 เท่า ที่บริบท 1M โทเคน (ตามที่ผู้ขายรายงาน)

• เรซิดิว — เกตเรซิดิว กระแสเรซิดิวเส้นเดียวแยกเป็นสี่กิ่งขนานที่มีการเกตแบบรายองค์ประกอบ (element-wise) ทำให้เครือข่ายตัดสินใจต่อโทเค็นได้ว่าแต่ละกิ่งควรอ่านและเขียนมากเพียงใด กิ่งหนึ่งกลายเป็นช่องสัญญาณระยะไกลที่เชื่อมเลเยอร์แอตเทนชันชั้นต้นเข้ากับเลเยอร์ลึก สถานะเรซิดิวถูกเก็บในรูปแบบ FP8 เพื่อลดแบนด์วิดท์หน่วยความจำ

• Embedding — N-gram embeddings. ตารางค้นหา (lookup table) ที่มีพารามิเตอร์ 51B โดยใช้โทเค็นปัจจุบันและหลายโทเค็นก่อนหน้าเป็นคีย์ (key) ช่วยเพิ่มความจุโดยไม่เพิ่มการคำนวณต่อโทเค็น และเนื่องจากตารางนี้สามารถเก็บในหน่วยความจำโฮสต์และถูกโหลดล่วงหน้าแบบอะซิงโครนัสได้ จึงไม่กินหน่วยความจำ GPU อย่างถาวร

• ตัวเพิ่มประสิทธิภาพ — Muon. พารามิเตอร์เชิงเส้น 2D ขนาดใหญ่ (attention, GDN, ผู้เชี่ยวชาญ MoE) ฝึกด้วย Muon ในขณะที่ embeddings, เราเตอร์ และส่วน low-rank ของ Gated Residual ยังคงใช้ AdamW; ทีมงานได้ปรับกฎการสเกลใหม่สำหรับสถาปัตยกรรมใหม่โดยอิงจากการผสมผสานนี้

A single-column spec-sheet scoreboard titled 'Qwen3.8-Flash — the scoreboard' with the subtitle 'The 6B-active MoE that previews Qwen4', six rows reading 'Params: 125B MoE + 51B N-gram (~180B stored)', 'Active per token: ~6B (<5% activation)', 'Architecture: Qwen4 preview (QSA + GDN, gated residual, Muon)', 'Context: 262K native / 1M via YaRN', 'Price: $0.16 / $0.47 per 1M tokens', 'Open weights: Qwen3.8-Flash-Next (FP8 build available)', and a footer 'Benchmark figures vendor-reported; pricing as announced by Alibaba'; the OrcaRouter logo is composited in the bottom-right corner.

สำหรับนักพัฒนาแล้ว สองอย่างนี้มีความสำคัญในทันที: attention stack คือเหตุผลที่บริบท 1M token สามารถเป็นค่าเริ่มต้นได้แทนที่จะเป็นเป้าหมายที่ต้องพยายามให้ถึง และตาราง N-gram คือเหตุผลที่โมเดล 125B ยังคงสามารถให้บริการได้อย่างกระชับ ส่วนที่เหลือเป็นเนื้อหาตัวอย่างสำหรับ Qwen4 — ซึ่งนั่นคือวิธีที่ Alibaba วางตำแหน่งมันไว้อย่างชัดเจน

เอกสารเกณฑ์มาตรฐานที่ติดฉลากอย่างตรงไปตรงมา

ตัวเลขทุกตัวในส่วนนี้เป็นการประเมินของ Alibaba เอง ซึ่งผ่านมาเพียงหนึ่งวันและยังไม่มีการทำซ้ำโดยห้องปฏิบัติการอิสระใดๆ ในช่วงเวลาที่เขียนบทความนี้ ถือเป็นเพียงข้ออ้างเชิงทิศทาง ไม่ใช่ผลลัพธ์ที่ชี้ขาด ในชุดการประเมินของ Alibaba Qwen3.8-Flash-Next (6B active) ได้คะแนน SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5 และ MathVision 95.7 พร้อมคะแนน JobBench 55.7 — และเวอร์ชันฐาน Qwen3.8-Flash-Next-Base ได้รับรายงานว่าเป็นโมเดลโอเพนที่ดีที่สุดใน 8 จาก 14 เกณฑ์ชี้วัดในการเปรียบเทียบแบบตัวต่อตัว รวมถึง MMLU-Pro, SuperGPQA, BBH และ MMMU

การอ้างสิทธิ์เรื่องการจัดวางในกลุ่มผลิตภัณฑ์ของ Alibaba ควรถูกติดป้ายว่ามันคืออะไร — การอ้างสิทธิ์ บริษัทกล่าวว่า Qwen3.8-Flash เอาชนะ Claude Opus 4.6 ได้ 9.1 คะแนนบน SWE-bench Pro และประมาณ 20 คะแนนบน JobBench และเข้าใกล้ Claude Opus 4.8 มากขึ้น ทุกรายงานมาจากผู้ขาย ยังไม่มีการทำซ้ำผลโดยอิสระ สิ่งที่ตรวจสอบได้โดยอิสระในวันนี้มีขอบเขตแคบกว่า: เปิดเผยค่าน้ำหนักแล้ว สแตกการอนุมานรันได้แล้ว และ SGLang ปล่อยการรองรับในวันเดียวกัน การทำซ้ำผลชุดเกณฑ์มาตรฐานโดยอิสระจะเกิดขึ้นในอีกไม่กี่วัน ไม่ใช่หลายสัปดาห์

ค่าใช้จ่ายเท่าไร

การกำหนดราคาเป็นส่วนที่ตรวจสอบได้ง่ายที่สุด เพราะเป็นราคาที่ประกาศออกมา มากกว่าเป็น benchmark — และในวันที่ 27 สิงหาคม Alibaba ยืนยันอัตราราคาของ QwenCloud สำหรับใช้งานจริงอย่างเป็นทางการ: $0.15 ต่อล้านโทเคนนำเข้า $0.47 ต่อล้านโทเคนส่งออก และ $0.016 ต่อล้านสำหรับ cache hits โดยอัตราในประเทศจีนอยู่ที่ ¥0.8/¥2.7/¥0.1 ตัวเลข cache hit คือสิ่งที่สำคัญสำหรับเวิร์กโหลดแบบ agentic: เอเจนต์แบบ long-context ที่อ่านประวัติขนาดใหญ่ซ้ำในทุกเทิร์นจะจ่ายเพียงเศษสตางค์สำหรับการอ่านซ้ำ ซึ่งเป็นเวิร์กโหลดที่ Qwen4-preview attention stack ตั้งเป้าไว้พอดี สื่อจีนรายงานเปรียบเทียบราคาที่เป็นหัวข้อข่าวกับคู่แข่งในทันที — คิดเป็นประมาณหนึ่งในสามของราคาที่ DeepSeek-V4-Flash เรียกเก็บ และเป็นเพียงเศษเล็กน้อยเมื่อเทียบกับโมเดลปิดระดับแนวหน้า (frontier closed models) ในการคิดบัญชีของ Alibaba เอง การเทรนครั้งนั้นมีต้นทุนประมาณหนึ่งในเก้าของ Qwen3.7-Plus และความได้เปรียบเชิงโครงสร้างนั้นเองที่ทำให้ราคา API อยู่ระดับที่เป็นอยู่

เมื่อเทียบกับ Qw​en 3.8 รุ่นอื่นๆ ในตระกูลเดียวกัน ช่องว่างนั้นชัดเจนมาก: Qwen3.8-Max รุ่นเรือธงคิดอัตรา $2.00 และ $6.00 ต่อล้านโทเค็น และตอนนี้เปิดให้ใช้งานบน OrcaRouter แล้วที่ราคารายการของผู้ให้บริการโดยไม่มีการบวกเพิ่มใดๆ ตอนนี้ที่ API ของ Qwen3.8-Flash เวอร์ชันโปรดักชันเปิดแล้ว การส่งผ่านราคาแบบเดียวกันก็ใช้กับอัตราอย่างเป็นทางการที่ $0.15/$0.47 และอัตราการเข้าถึงแคชที่ $0.016 เช่นกัน — เลเยอร์การจัดเส้นทางคือความแตกต่างระหว่างการอ่านข่าวเรื่องการลดราคากับการมีราคานั้นในคอนฟิกจริง โมเดลทั้งสองใช้คีย์เดียว มีการสลับไปมาระหว่างกันเมื่อเกิดข้อผิดพลาด และไม่ต้องมีสัญญาเพิ่มเติม

“preview of Qwen4” หมายความว่าอะไร

อ่านประกาศตามตัวอักษรแล้วเดิมพันก็ชัดเจน: นี่ไม่ใช่ระดับใหม่ของ {{1}}{{KEEP}}Qw​en 3.8{{/KEEP}}{{/1}} — แต่เป็นสถาปัตยกรรมของ {{2}}{{KEEP}}Qwen4{{/KEEP}}{{/2}} ที่ถูกส่งออกมาก่อนกำหนด ภายใต้แบรนด์อันเป็นเกราะป้องกันของโมเดลที่เล็กกว่าและราคาถูกกว่า เหตุผลที่ทำแบบนั้นก็สมเหตุสมผล: เฟรมเวิร์ก, quantization และรูปแบบการ deploy ล้วนต้องใช้เวลาให้เติบโตเต็มที่ และโมเดลแบบ 6B-active ก็เป็นหนทางต้นทุนต่ำให้ชุมชนได้ทดสอบความเครียด {{3}}{{KEEP}}GDN + QSA{{/KEEP}}{{/3}} ในระดับใหญ่ ก่อนที่ Alibaba จะต่อยอดสร้างของแพงขึ้นไปบนนั้น อีกด้านหนึ่งคือ {{4}}{{KEEP}}Qwen3.8-Flash{{/KEEP}}{{/4}} เวอร์ชันโปรดักชันเป็น API ที่สร้างบนสถาปัตยกรรมซึ่งระบบนิเวศในวงกว้างยังคงตรวจสอบอยู่ ผู้ใช้ช่วงแรก โดยโครงสร้างแล้ว ก็คือชุดทดสอบ

เส้นทางที่รวดเร็วในการลองใช้

วันนี้คุณมีสี่ทางเลือกที่สมจริง ตัวเลือกแรกคือโฮสต์โมเดลโอเพนเวทด้วยตัวเองผ่าน vLLM, SGLang, Transformers หรือ TokenSpeed — บิลด์ FP8 เป็นจุดเริ่มต้นที่สมเหตุสมผลสำหรับสิ่งใดก็ตามที่น้อยกว่าโหนดเต็ม ตัวเลือกที่สองคือเรียกใช้ API ของ QwenCloud ซึ่งเปิดให้บริการแล้วในอัตราอย่างเป็นทางการที่ $0.15/$0.47 โดยการเข้าถึงแคชมีค่าใช้จ่าย $0.016 ตัวเลือกที่สามคือใช้ภายใน OpenCode Go ซึ่งเป็นการสมัครสมาชิกแบบอัตราคงที่ของเอเจนต์เขียนโค้ดเทอร์มินัลโอเพนซอร์ส ที่เพิ่ม Qwen3.8-Flash ในสัปดาห์นี้ (ประกาศโดย Alibaba เมื่อวันที่ 28 สิงหาคม ยืนยันในรายการโมเดลของ OpenCode เอง) หรือตัวเลือกสุดท้ายคือเรียกใช้ Flash เวอร์ชันโปรดักชันผ่านเราเตอร์ในแบบที่คุณเรียกใช้ Qwen3.8-Max อยู่แล้ว โดยส่งผ่านอัตราอย่างเป็นทางการโดยไม่มีมาร์กอัปเพิ่มเติม — ไม่ต้องดูแลการผสานรวมแบบเฉพาะกิจ

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the model description stating the artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default and built-in tools, plus License 'qwen-community-1.0', Model size 180B params, Tensor type BF16, and 2,551 downloads last month.

คำถามปลายเปิดคือคำถามที่จริงใจ: โมเดลที่เปิดใช้งานพารามิเตอร์ 6 พันล้านตัวจะยืนหยัดในระบบการผลิตจริงสำหรับปริมาณงานที่หลากหลายได้หรือไม่ หรือแผ่นเกณฑ์มาตรฐานที่วันนี้ดูเหมือนเพิ่งสร้างเมื่อวานจะยังคงดูเป็นเช่นนั้นในอีกหนึ่งเดือนข้างหน้า นั่นไม่ใช่เหตุผลที่จะรอ — แต่เป็นเหตุผลที่จะวางไว้เบื้องหลังระบบเฟลโอเวอร์มากกว่าจะวางไว้หน้าสแต็กทั้งหมดของคุณ น้ำหนักโมเดลถูกปล่อยออกมาแล้ว ราคาถูกกำหนดไว้แล้ว และสถาปัตยกรรมคือทิศทางที่อาลีบาบาประกาศไว้ อีกไม่กี่สัปดาห์ข้างหน้าจะตัดสินว่า 6B เพียงพอแล้วหรือไม่

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube