
Qwen3.8-Flash-Next เปิดตัวแล้ว: Alibaba ส่งมอบสถาปัตยกรรม Qwen4 ก่อนที่ Qwen4 จะมีอยู่จริง
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 84 tok/s
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
Qwen3.8-Flash-Next ในที่สุดก็มีตัวเลขที่ Alibaba ไม่ได้สร้างขึ้นเอง — และตัวเลขเหล่านั้นไม่ได้บอกในแบบที่เรื่องเล่าฉบับที่ดังก้องที่สุดบอก บน Artificial Analysis Intelligence Index ซึ่งปรับปรุงใหม่เป็น v4.3 เมื่อวันที่ 7 กันยายน รุ่นพรีวิวแบบเปิดน้ำหนักของ Alibaba ได้ 40 คะแนน และอยู่อันดับที่ 5 จาก 113 โมเดลในกลุ่มการเปรียบเทียบของตน DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — โมเดลที่มันถูกนำมาเปรียบเทียบด้วยอยู่เสมอ — ได้ 35 คะแนน และอยู่อันดับที่ 9 นั่นไม่ใช่ความเสมอกัน แต่เป็นการนำอยู่ห้าคะแนนของโมเดลที่เล็กกว่า ยิ่งไปกว่านั้น มันยังเป็นกระดานคะแนนแบบกว้างและเป็นอิสระชุดแรกที่ไปถึงโมเดลซึ่งตัวเลขที่เผยแพร่มีเพียงของผู้ขายเองจนถึงเดือนนี้ ตัวโมเดลเองไม่ใช่ของใหม่: น้ำหนักโมเดลเปิดให้ใช้งานจริงบน Hugging Face เมื่อวันที่ 24 สิงหาคม และการเปิดตัวอย่างเป็นทางการบน ModelScope ก็เกิดขึ้นเมื่อวันที่ 26 สิงหาคม สิ่งที่เปลี่ยนไปในเดือนนี้คือตอนนี้ผู้อ่านสามารถตรวจสอบข้อกล่าวอ้างได้ แทนที่จะเชื่อไปเฉย ๆ
เหตุที่ทำให้ต้องกลับมาดูโพสต์นี้มาจาก @teortaxesTex บน X ซึ่งถามว่า preview นี้ถูกให้ความสนใจน้อยกว่าที่ควรอย่างเงียบ ๆ หรือไม่: โดยอ้างว่าอยู่ในระดับเดียวกับ DeepSeek V4 Flash 0731 บน Artificial Analysis โดย "เล็กกว่าเกือบ 4 เท่า" และมี "พารามิเตอร์ที่ใช้งานจริงน้อยกว่าเกือบ 3 เท่า" ข้อกล่าวอ้างสองในสามข้อนั้นไม่อาจยืนหยัดเมื่อเทียบกับข้อมูลที่เผยแพร่ — และการแก้ไขนี้กลับเป็นผลดีต่อโมเดล เพราะเมื่อดูจากตัวเลขที่สำคัญ preview กลับนำหน้าคู่เปรียบเทียบ ไม่ได้อยู่ในระดับเดียวกัน
เริ่มจากขนาดก่อน ตรงนี้ตัวเลขไม่กำกวม Qwen3.8-Flash-Next เก็บพารามิเตอร์ราว 180B — เป็นโครง mixture-of-experts ขนาด 125B บวกตาราง embedding แบบ n-gram แยกต่างหากอีก 51B และชั้น multi-token-prediction อีกประมาณ 4B — และเปิดใช้งาน 6B ต่อโทเคน DeepSeek V4 Flash 0731 เก็บ 284B และเปิดใช้งาน 13B นี่คือตัวเลขบนโมเดลการ์ดของ Qwen และในเอกสารของ DeepSeek และเป็นตัวเลขที่ Artificial Analysis ระบุไว้ในหน้าของทั้งสองโมเดล อัตราส่วนที่ได้คือ1.6xในด้านพารามิเตอร์ที่จัดเก็บ และ2.2xในด้านพารามิเตอร์ที่เปิดใช้งาน นี่เป็นเรื่องราวเรื่องประสิทธิภาพที่แท้จริง และเป็นเหตุผลว่าทำไมสถาปัตยกรรมนี้จึงสำคัญ — แต่มันไม่ใช่ 4x และไม่ใช่ 3x เราไม่พบตัวเลขที่ตีพิมพ์ที่ไหนเลยที่สนับสนุนตัวคูณที่มากกว่านั้น หากเจตนาหมายถึงขนาดหน่วยความจำที่ใช้ตอนให้บริการ ไม่ใช่จำนวนพารามิเตอร์ ตัวเลขนั้นก็ไม่ได้ตีพิมพ์เช่นกัน
มีการประกาศอะไร
Alibaba ประกาศเปิดตัวสถาปัตยกรรม Qwen4 ก่อนที่จะเปิดตัวโมเดล Qwen4 เสียอีก Qwen3.8-Flash-Next — โมเดล open-weight แบบมัลติโมดัลที่ใช้ mixture-of-experts ซึ่งสร้างบนสถาปัตยกรรมรุ่นถัดไปที่จะขับเคลื่อนตระกูล Qwen4 — เปิดตัวออกมาเป็นสองขั้นตอน: รีโพซิทอรีอย่างเป็นทางการ Qwen/Qwen3.8-Flash-Next เริ่มเปิดใช้งานบน Hugging Face เมื่อวันที่ 24 สิงหาคม สองวันก่อนการเปิดตัวบน ModelScope ที่ตัวจับเวลาของทีเซอร์ชี้ไป การเปิดตัวอย่างเป็นทางการบน ModelScope เกิดขึ้นเมื่อวันที่ 26 สิงหาคม เวลา 23:00 UTC+08:00 โดยราคาของตัวแปร Qwen3.8-Flash ที่ให้บริการถูกกำหนดในเวลาเดียวกัน ข้อกล่าวอ้างพาดหัวบนการ์ดโมเดล ซึ่งถูกพูดถึงเรื่อยมาตั้งแต่นั้น คือโมเดลที่เปิดใช้งานพารามิเตอร์ 6B ต่อโทเคนสามารถเอาชนะ Claude Opus 4.6 Max ได้ใน 8 จาก 9 เบนช์มาร์กที่เทียบเคียงกัน บนตารางของ Alibaba เอง Alibaba ยังคงย้ำว่าตระกูล Qwen4 แบบเต็มจะตามมาทีหลัง
ถ้าคุณยังไม่ได้ติดตามจังหวะของ Alibaba ในเดือนนี้ จุดอ้างอิงคือ Qwen3.8-Max — เรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ที่เปิดตัวเมื่อวันที่ 3 สิงหาคม และเปิดซอร์สในชื่อ Qwen3.8-2.4T-A95B ภายในไม่ถึงสองสัปดาห์ต่อมา น้ำหนักของ Qwen3.8-Flash-Next ก็เปิดให้ใช้ในเวลาไม่ถึงหนึ่งเดือนหลังจากนั้น แล็บเดียวกันที่ปล่อยโมเดลน้ำหนักเปิดขนาด 2.4 ล้านล้านพารามิเตอร์ ตอนนี้กำลังแจกสถาปัตยกรรมสำหรับรุ่นถัดไป ก่อนที่เรือธงของเจเนอเรชันนั้นจะถูกตั้งชื่อเสียอีก

ส่วนที่คุ้มค่าที่จะอ่านซ้ำคือกรอบความคิดของ Alibaba เอง โมเดลนี้ถูกอธิบายว่าสร้างขึ้นบนสถาปัตยกรรมรุ่นถัดไป "ที่จะขับเคลื่อนตระกูล Qwen4 ที่กำลังจะมาถึง" — และไม่ใช่ Qwen4 เองอย่างชัดเจน เหตุผลที่ Alibaba ระบุคือการเปลี่ยนแปลงทางสถาปัตยกรรมควรอยู่ในมือของชุมชนก่อนที่ตระกูลจะมาถึง เพื่อให้รันไทม์ การควอนไทซ์ และแอปพลิเคชันพร้อมเมื่อของจริงเปิดตัว นั่นคือจุดยืนทางการตลาด แต่ก็เป็นความมุ่งมั่นทางเทคนิคเช่นกัน: เปิดตัวอย่างส่วนที่ยากก่อน แล้วพาชุมชนไปด้วย
สิ่งที่โมเดลการ์ดชี้ชัดได้ และสิ่งที่ชี้ชัดไม่ได้:
• ยืนยันแล้ว ตามบัตรข้อมูลโมเดลอย่างเป็นทางการ: Qwen3.8-Flash-Next เป็นโมเดล open-weight, multimodal และเป็นโมเดล mixture-of-experts บนสถาปัตยกรรม Qwen4 — บัตรข้อมูลระบุว่ามันคือ "ตัวอย่างเชิงทดลองของสถาปัตยกรรมที่จะเป็นรากฐานของ Qwen4"
ยืนยันแล้ว ตาม model card และ config: การเปลี่ยนแปลงสถาปัตยกรรมหลักสองอย่าง — Gated Delta Network (GDN) และ Qwen Sparse Attention (QSA) — ภายในไฮบริด 48 ชั้นที่ใช้ linear-attention 36 ชั้นเทียบกับ full-attention 12 ชั้น
• ยืนยันจากรีโพซิทอรี: พารามิเตอร์ทั้งหมด 125B โดยเปิดใช้งาน 6B ต่อโทเคน (ผู้เชี่ยวชาญ 512 ราย, 10 รายที่ถูกเลือกเส้นทาง บวกหนึ่งรายที่ใช้ร่วมกัน) — Artificial Analysis ระบุเป็น 180B เมื่อนับตาราง embedding n-gram ขนาด 51B แยกต่างหากและเลเยอร์ MTP รวมเข้าไปด้วย — ด้วยบริบทแบบเนทีฟขนาด 262,144 โทเคนที่ขยายได้ถึง 1,000,000 ภายใต้ Qwen Community License 1.0
• ไม่ใช่เรื่องที่ยังไม่ได้รับการยืนยันอีกต่อไป: ตอนนี้โมเดลได้รับการให้คะแนนอย่างอิสระแล้ว ถึงสองครั้ง ตารางของ Alibaba ยังคงเป็นของผู้ขายเองและยังไม่ถูกทำซ้ำ แต่ก็ไม่ใช่หลักฐานชิ้นเดียวในห้องอีกต่อไป
ผลคะแนนอิสระชุดแรกออกมาแล้ว — และบอกว่า "นำอยู่" ไม่ใช่ "เสมอกัน"
Artificial Analysis เปิดตัว Intelligence Index v4.3 เมื่อวันที่ 7 กันยายน และการให้คะแนนใหม่คือเหตุผลที่ทำให้ทั้งหมดนี้เปรียบเทียบกันได้เลย การอัปเดต v4.3 แทนที่ Terminal-Bench v2.1 ด้วย Terminal-Bench v4.0 ที่ยากกว่ามาก และสลับ τ³-Banking เป็น AutomationBench-AA ซึ่งเป็นเบนช์มาร์กเวิร์กโฟลว์แบบเอเจนต์ที่สร้างขึ้นร่วมกับ Zapier บนชุดทดสอบส่วนตัวที่กันไว้จำนวน 657 งาน น้ำหนักของชุดทดสอบส่วนตัวที่กันไว้เพิ่มขึ้นเป็น 45% จุดประสงค์ที่ระบุไว้คือเพื่อหยุดไม่ให้กลุ่มแนวหน้าปั่นดัชนี และผลกระทบต่อคะแนนนั้นมีมาก: GPT-6 Astra และ Claude Fable 5.1 สองผู้นำ ต่างได้คะแนนอยู่ที่ 53 ทั้งที่เคยได้คะแนนในหลักหกสิบตามมาตรวัดเดิม
เรื่องนี้สำคัญเมื่อคุณอ่านตัวเลขจากคอมมูนิตี้ ตัวเลข "56 ต่อ 52" ที่ถูกเผยแพร่สำหรับ Qwen3.8-Flash-Next และ DeepSeek V4 Flash 0731 ในช่วงต้นเดือนกันยายนนั้นคำนวณบนดัชนีเวอร์ชันก่อน v4.3; ภายใต้ v4.3 คู่นี้อยู่ที่ 40 และ 35 การยกชุดใดชุดหนึ่งมาเทียบกับอีกชุดหนึ่งคือการเปรียบเทียบข้อสอบคนละชุดกัน
บนดัชนีปัจจุบัน นี่คือวิธีที่โมเดลทั้งสองเปรียบเทียบกันจริง ๆ ในการประเมินของ Artificial Analysis เอง:
• ดัชนีสติปัญญา — Qwen3.8-Flash-Next 40 (อันดับ 5 จาก 113 ในคลาส) เทียบกับ DeepSeek V4 Flash 0731 (การให้เหตุผล, ความพยายามสูงสุด) 35 (อันดับ 9 จาก 113)
• งานความรู้แบบเอเจนต์ — AA-Briefcase 1587 เทียบกับ 1259; GDPval-AA v2 1647 เทียบกับ 1468; AutomationBench-AA 56% เทียบกับ 54%
เทอร์มินัลและการเขียนโค้ด — Terminal-Bench v4.0 25% เทียบกับ 12%; SciCode 51% เทียบกับ 50%
• การให้เหตุผลทั่วไปและเชิงวิทยาศาสตร์ — Humanity's Last Exam 38% เทียบกับ 39%; CritPt 11% เทียบกับ 17%; GDP.pdf 16% เทียบกับ 11%; AA-LCR v1.1 80% เทียบกับ 80%
• การระลึกข้อเท็จจริงเทียบกับการแต่งเรื่อง — AA-Omniscience −10 เทียบกับ −14 ซึ่งเป็นความได้เปรียบสี่คะแนนให้กับ Qwen พรีวิว
• ราคา — $0.15 ต่ออินพุตหนึ่งล้านโทเคน / $0.47 ต่อเอาต์พุตหนึ่งล้านโทเคน เทียบกับ $0.44 / $1.32; แบบผสม $0.0882 ต่อล้านโทเคน เทียบกับ $0.2298 ค่าใช้จ่ายต่อหนึ่งงาน Intelligence Index: $0.37 เทียบกับ $0.22
• ความเร็วและความหน่วง — 53 โทเคนเอาต์พุตต่อวินาที เทียบกับ 210; เวลาถึงโทเคนแรก 2.80 วินาที เทียบกับ 0.98 วินาที; การตอบสนองตั้งแต่ต้นจนจบ 49.76 วินาที เทียบกับ 12.88 วินาที; เวลาต่องาน 1,572.60 วินาที เทียบกับ 221.65 วินาที
• การใช้โทเคน — 108k โทเคนเอาต์พุตต่องาน เทียบกับ 62k ซึ่งในจำนวนนั้น 72k เป็นโทเคนสำหรับการให้เหตุผล เทียบกับ 45k Artificial Analysis เรียกพรีวิวนี้ว่า “ช่างพูดมากเป็นพิเศษ” และ “ช้ากว่าค่าเฉลี่ย”
• บริบทและขนาด — 256k โทเค็น เทียบกับ 1,000k; 180B ทั้งหมด / 6B ที่ใช้งานอยู่ เทียบกับ 284B / 13B
เมื่ออ่านรวมกันแล้ว นั่นคือคำตอบที่คมชัดกว่า "ระดับเดียวกัน" Qwen3.8-Flash-Next ชนะในข้อโต้แย้งเรื่องความแม่นยำและประสิทธิภาพในเกือบทุกแกนที่ Artificial Analysis วัด — เป็นโมเดลที่ได้คะแนนสูงกว่า มีขนาดเล็กกว่า และมีค่าใช้จ่ายต่อโทเคนเพียงประมาณหนึ่งในสาม DeepSeek V4 Flash 0731 ชนะในข้อโต้แย้งเรื่องการใช้งานจริงไปเลย: อัตราการประมวลผลสูงกว่า 4 เท่า ความหน่วงแบบ end-to-end เพียงหนึ่งในสี่ ใช้เวลาจริงน้อยกว่า 7 เท่าต่องานที่ทำเสร็จแต่ละงาน และมีหน้าต่างบริบทมากกว่า 4 เท่า และในเรื่องต้นทุน ต่อหนึ่งงานที่ทำเสร็จ — ตัวเลขที่ไม่พังแม้โทเคนจะเยิ่นเย้อ — DeepSeek เป็นโมเดลที่ถูกกว่า โดยอยู่ที่ $0.22 เทียบกับ $0.37 แม้ว่าราคาที่ติดป้ายจะสูงกว่าก็ตาม หากคำว่า "underhyped" หมายถึง "ดีกว่าที่ชื่อเสียงบอกในแง่คุณภาพต่อพารามิเตอร์" ป้ายนั้นก็ยุติธรรม แต่หากหมายถึง "คุณควรเปลี่ยนมาใช้ตัวนี้แทน" คอลัมน์ความเร็วและความหน่วงกลับบอกเป็นอย่างอื่น

นอกจาก Artificial Analysis แล้ว ยังมีหลักฐานอิสระจากที่อื่นด้วย ฮาร์เนสของบุคคลที่สามชื่อ smf-bench ได้เผยแพร่การรัน "Official A" เมื่อวันที่ 5 กันยายน: Qwen3.8-Flash-Next ในรูปแบบควอนไทซ์ NVFP4 ของ NVIDIA บน DGX Spark เครื่องเดียว โดยปิดโหมดคิด ทำคะแนนได้ 137 จาก 157 (87.3%) พร้อม 30 จาก 30 อย่างสมบูรณ์ในส่วนการเขียนโค้ด เทียบกับ 117 จาก 157 สำหรับการรัน DeepSeek V4 Flash Vision-Exp บน Spark สองเครื่องด้วยฮาร์เนส 157 การทดสอบเดียวกัน นั่นเป็นฮาร์เนสเดียวบนเครื่องประเภทเดียว และไม่ใช่สิ่งทดแทนการประเมินแบบครอบคลุม — แต่เป็นจุดข้อมูลที่สองที่ชี้ไปในทิศทางเดียวกัน และมาจากบุคคลที่ไม่มีส่วนได้ส่วนเสียกับผู้จำหน่ายรายใดเลย
สถาปัตยกรรม Qwen4 จริงๆ แล้วคืออะไร
สองกลไกเป็นผู้ขับเคลื่อนเรื่องราว กลไกแรก GDN — Gated Delta Network — คือเลเยอร์ linear-attention ของ Alibaba ในขณะที่ transformer มาตรฐานเก็บ key-value cache ที่เติบโตตามความยาวลำดับ เลเยอร์ GDN จะรักษา recurrent state ขนาดคงที่และอัปเดตด้วยกฎ gating ที่เรียนรู้ได้; สายการพัฒนาสืบเนื่องผ่าน DeltaNet และ Mamba-2 ประโยชน์ที่ได้คือสิ่งที่ขับเคลื่อนสาย Qwen อย่างเงียบ ๆ ตั้งแต่ Qwen3-Next: บริบทยาวยังคงมีต้นทุนต่ำเพราะ state ไม่เติบโต ในขณะที่เลเยอร์ full-attention ส่วนน้อยยังคงอยู่ในส่วนผสมเพื่อทำการดึงข้อมูลที่แม่นยำซึ่ง linear attention ทำได้ไม่ดี ในรุ่นปัจจุบัน ส่วนผสมนั้นอยู่ที่ประมาณสามเลเยอร์ GDN ต่อหนึ่งเลเยอร์ full-attention — การวิเคราะห์ของชุมชนต่อ checkpoint Qwen3.8-2.4T-A95B นับได้ 69 เลเยอร์ GDN เทียบกับ 23 เลเยอร์ attention Qwen3.8-Flash-Next แสดงการแบ่งสามต่อหนึ่งแบบเดียวกัน: 36 เลเยอร์ linear-attention เทียบกับ 12 เลเยอร์ full-attention
ตัวที่สอง QSA — Qwen Sparse Attention — เป็นชิ้นส่วนใหม่จริง ๆ และคำอธิบายสาธารณะเกี่ยวกับมันยังมีน้อย: การ์ดโมเดลระบุเพิ่มเติมว่ามันทำงานในระดับ micro-block ด้วยงบประมาณ 512 บล็อก / 2048 โทเคน แต่ยังไม่มีเอกสารทางเทคนิคฉบับเต็ม ความขาดแคลนรายละเอียดนี้เองก็เป็นส่วนหนึ่งของรูปแบบดังกล่าว การพรีวิว Qwen3-Next ในช่วงปลายปี 2025 ได้แนะนำ Gated DeltaNet พร้อมเอกสารที่บางเบาแบบเดียวกัน และสถาปัตยกรรมนี้ก็ได้รับการระบุรายละเอียดอย่างครบถ้วนก็ต่อเมื่อซีรีส์ Qwen3.5 นำมาใช้ สำหรับผู้อ่าน ข้อสรุปที่นำไปปฏิบัติได้ก็เหมือนกันทั้งสองครั้ง: canary ของสถาปัตยกรรมจะปรากฏขึ้นก่อน ส่วนเอกสารและโมเดลสำหรับโปรดักชันจะตามมาทีหลัง
แผนการที่เคยได้ผลมาแล้วครั้งหนึ่ง
Alibaba เคยใช้กลยุทธ์แบบนี้มาก่อน และมันได้ผล ในปลายปี 2025 Qwen3-Next ได้พรีวิว Gated DeltaNet และสถาปัตยกรรมแบบผสมระหว่าง attention เชิงเส้นกับ attention แบบเต็มรูปแบบ เมื่อซีรีส์ Qwen3.5 เปิดตัว มันได้นำพิมพ์เขียวนั้นมาใช้ในวงกว้าง — และการผสมผสานนี้ได้สืบทอดต่อเนื่องมาถึงรุ่น Qwen3.8 นับตั้งแต่นั้น รวมถึงเรือธงขนาด 2.4T เหตุผลที่แบบอย่างนี้สำคัญในที่นี้คือจังหวะเวลาที่มันสื่อ ควรคาดว่าจะได้เห็นครอบครัว Qwen4 แบบเต็มหลังการพรีวิวนี้ ไม่ใช่ภายในพรีวิวนี้; หากช่องว่างของ Qwen3-Next พอเป็นเครื่องบ่งชี้ได้ ระยะห่างระหว่าง "นี่คือสถาปัตยกรรม" กับ "นี่คือครอบครัว" นั้นวัดกันเป็นเดือน ไม่มีอะไรในโมเดลการ์ดยืนยันเรื่องนั้น — มันเป็นการอนุมานจากรูปแบบที่ Alibaba ได้ทำมาแล้วสองครั้ง
สิ่งที่เรายังไม่รู้
สิ่งที่ไม่ทราบได้ลดน้อยลงแล้ว แต่ก็ยังไม่หายไป:
• ตารางเบนช์มาร์กของผู้ขายยังคงเป็นของผู้ขายเอง Artificial Analysis ได้ให้คะแนนโมเดลนี้อย่างอิสระแล้ว ซึ่งช่วยปิดช่องว่างที่ใหญ่ที่สุดในความครอบคลุมการเปิดตัว — แต่คำกล่าวอ้างหลักของ Alibaba เอง ที่ว่าโมเดลนี้เอาชนะ Claude Opus 4.6 Max ได้ใน 8 จาก 9 เบนช์มาร์กที่เปรียบเทียบได้ กลับอาศัยการประเมินภายในของ Alibaba เอง (CoWorkBench, JobBench, AndroidWorld) ควบคู่ไปกับแบบสาธารณะ และไม่มีอันใดเลยที่ถูกทำซ้ำโดยบุคคลที่สาม
• พรีวิวนี้เป็นโมเดลเดียวกันกับตัวที่ให้บริการจริงหรือไม่ การ์ดนี้ระบุว่า Qwen3.8-Flash-Next เป็นพรีวิวทดลองแบบโอเพนเวต ขณะที่เวอร์ชันที่ให้บริการจริงในโปรดักชัน — Qwen3.8-Flash ของ Qwen Cloud — เพิ่มบริบทเริ่มต้น 1,000,000 โทเคนและเครื่องมือในตัว ยังไม่มีการระบุว่าโมเดลที่ให้บริการนั้นเป็นสถาปัตยกรรมเดียวกันภายใต้หน้าต่างบริบทที่ใหญ่กว่าหรือไม่ และคะแนนอิสระข้างต้นเป็นของพรีวิวแบบโอเพนเวต ไม่ใช่โมเดล API ที่ให้บริการ
• สัญญาอนุญาตนี้เป็นที่รู้จักและเป็นสัญญาอนุญาตจริง: Qwen Community License 1.0 อนุญาตให้ใช้ในเชิงพาณิชย์ รวมถึงการขายงานดัดแปลง แต่กำหนดให้ต้องมีข้อตกลงเชิงพาณิชย์แยกต่างหากกับ Alibaba หากคุณดำเนินธุรกิจ Model-as-a-Service หรือผู้ช่วยงาน AI ที่มีรายได้และจำนวนผู้ใช้ที่ใช้งานต่อเดือนเกินเกณฑ์ที่กำหนด ไม่เหมือนกับสัญญาอนุญาต Qwen3.8-Max ที่กำหนดเงื่อนไขตามรายได้ แต่ก็ควรอ่านก่อนจะนำเวตไปสร้างต่อยอด
• รายงานภาคสนามหนึ่งฉบับที่ควรค่าแก่การตั้งข้อสังเกต: บทความเมื่อวันที่ 6 กันยายนเกี่ยวกับบิลด์ NVFP4 ของชุมชน บันทึกความล้มเหลวในการเรียกใช้เครื่องมือแบบมีไวยากรณ์กำกับ เมื่อเปิดใช้งานทั้ง thinking และ multi-token prediction พร้อมกัน โดยสืบย้อนไปถึงเส้นทางการถอดรหัสแบบมีข้อจำกัดของ xgrammar นี่เป็นบั๊กขณะรันไทม์ในบิลด์ชุมชนแบบควอนไทซ์ ไม่ใช่คุณสมบัติของโมเดล — แต่หากฮาร์เนสการประเมินของคุณพึ่งพาการเรียกใช้เครื่องมือแบบมีไวยากรณ์กำกับ สิ่งนี้คือสิ่งแรกที่ควรทดสอบ
ครอบครัวที่ทำงานเป็นรอบสองสัปดาห์
จังหวะโดยรอบเป็นเรื่องราวในตัวเอง Qwen3.8-Max เรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ เปิดตัวเมื่อวันที่ 3 สิงหาคม; Qwen3.8-2.4T-A95B แบบน้ำหนักเปิดตามมาในวันที่ 12–13 สิงหาคม; Qwen3.8-27B ฟรีภายใต้ Apache-2.0 มาถึงในอีกไม่กี่วันถัดมา; และตอนนี้ ก่อนที่เดือนจะจบ สถาปัตยกรรมของรุ่นถัดไปกำลังถูกพรีวิว — และถูกทดสอบประสิทธิภาพอย่างอิสระในอีกหนึ่งสัปดาห์ต่อมา ไม่มีแล็บอื่นใดในขณะนี้ที่กำลังพัฒนาซ้ำด้วยจังหวะเวลาเช่นนี้ สำหรับผู้อ่านที่กำลังเลือกโมเดล ผลที่ตามมาในทางปฏิบัติคือ "Qwen ที่ดีที่สุด" เป็นเป้าหมายที่เคลื่อนที่ — และส่วนต่างระหว่างรุ่นต่าง ๆ กำลังมาถึงเร็วกว่าที่ระบบนิเวศโดยรอบมักจะปรับตัว การซื้อการตัดสินใจแทนที่จะซื้อโมเดลกลายเป็นทางเลือกที่ป้องกันได้มากขึ้นเรื่อย ๆ
สิ่งที่นักพัฒนาควรทำในตอนนี้
ตัวเลขประสิทธิภาพเปลี่ยนการคำนวณเรื่องการให้บริการในเครื่องมากกว่าตัวการเปิดตัวเสียอีก โมเดลที่ active 6B ซึ่งได้คะแนน 40 บนดัชนีปัจจุบันนั้นบีบอัดได้ การควอนไทซ์ NVFP4 อย่างเป็นทางการของ NVIDIA คือตัวที่การรัน smf-bench เมื่อวันที่ 5 กันยายนใช้ และบิลด์ NVFP4 กับ FP8 จากชุมชนที่นอกเหนือจากนั้นก็หมุนเวียนอยู่แล้ว ซึ่งนั่นคือสิ่งที่ทำให้การดีพลอยโมเดลที่จัดเก็บ 180B บนคลาส GPU เดียวเป็นไปได้เลย ข้อแม้ยังคงเดิม — นี่คือพรีวิวที่ยังไม่ผ่านการพิสูจน์ ตารางของผู้ขายยังไม่ถูกทำซ้ำ และรูปร่างของคะแนนอิสระ (แข็งแกร่งในงานองค์ความรู้และงานเทอร์มินัล อ่อนกว่าในการสร้าง repo ระยะยาวและอัตราการผ่านของเอเจนต์แบบครั้งเดียว) หมายความว่าจุดอ่อนของโมเดลปรากฏขึ้นตรงจุดที่การเปลี่ยนแปลงโค้ดโปรดักชันอยู่พอดี ลองรันสำเนาความเสี่ยงต่ำของเวิร์กโหลดจริงกับมันก่อนที่มันจะไปแตะอะไรที่สำคัญ และปล่อยให้ automatic failover ซับช่วงเวลาที่พรีวิวทำงานผิดพลาด
ในเรื่องราคา ภาพที่คลุมเครือตอนเปิดตัวตอนนี้ชัดเจนแล้ว Artificial Analysis ระบุว่าอัตราการให้บริการของพรีวิวอยู่ที่ 0.15 ดอลลาร์ต่อล้านโทเคนอินพุต และ 0.47 ดอลลาร์ต่อล้านโทเคนเอาต์พุต เทียบกับ 0.44 และ 1.32 ดอลลาร์สำหรับ DeepSeek V4 Flash 0731 — อยู่ในระดับเดียวกันกับ Qwen3.8-Flash ที่ให้บริการอยู่ ซึ่ง Qwen Cloud ระบุไว้ที่ ¥1 และ ¥3 (ประมาณ 0.16 และ 0.47 ดอลลาร์) ส่วนเวอร์ชันโปรดักชันคือตัวที่คุณเรียกใช้ได้จริงในวันนี้ โดยถูกเราเตอร์ที่นี่เป็น qwen/qwen3.8-flash และ OrcaRouter ส่งผ่านราคาตามที่ผู้ขายกำหนดโดยบวกราคาเพิ่ม 0% ดังนั้นเมื่อ Alibaba เปลี่ยนตัวเลขนั้น ปลายทางก็จะเปลี่ยนตามในวันเดียวกัน เช่นเดียวกับโมเดลเปรียบเทียบในบทความนี้ — DeepSeek V4 Flash 0731 ถูกเราเตอร์เป็น deepseek/deepseek-v4-flash-0731 ในราคาตามที่ผู้ให้บริการกำหนด ซึ่งทำให้ครึ่งหนึ่งว่าด้วยต้นทุนต่อโทเคนของการเปรียบเทียบข้างต้นสามารถทดสอบกับทราฟฟิกของคุณเองได้ แทนที่จะทดสอบกับจำนวนโทเคนของเบนช์มาร์ก สิ่งที่ไม่ได้ถูกเราเตอร์ที่นี่ คือตัวพรีวิว Flash-Next แบบเปิดน้ำหนักเอง: ถ้าจะใช้มันวันนี้ คุณต้องดึงเวตลงมาและให้บริการเอง ซึ่งเป็นเหตุผลว่าทำไมเรื่องการควอนไทซ์ข้างต้นจึงสำคัญกว่าราคาตามที่ผู้ขายกำหนด เพดานที่เจเนอเรชันนี้ต้องก้าวข้ามยังคงมองเห็นได้ที่ปลายทางเดียวกัน: Qwen3.8-Max (qwen/qwen3.8-max) อยู่ที่ 2.00 ดอลลาร์ต่อล้านโทเคนอินพุต และ 6.00 ดอลลาร์ต่อล้านโทเคนเอาต์พุต โดยส่งผ่านในราคาตามที่ผู้ขายกำหนดเช่นกัน

ลำดับการปฏิบัติจริงไม่ได้เปลี่ยนไปมากนัก แต่ความมั่นใจที่อยู่เบื้องหลังนั้นเปลี่ยนไปแล้ว หากคุณต้องการเวอร์ชันโปรดักชันที่พร้อมให้บริการโดยไม่ต้องดึงเวต 100GB Qwen3.8-Flash ก็เรียกใช้ได้แล้วในราคาตามลิสต์ หากคุณต้องการสถาปัตยกรรม — GDN, QSA, ตาราง n-gram, เทคนิค offload ต่างๆ — เวตนั้นดาวน์โหลดได้ และรันไทม์ก็พร้อมแล้ว: vLLM ให้บริการมันได้ตั้งแต่วันแรกด้วยเส้นทาง offload ที่เก็บตาราง embedding n-gram ขนาด 51B พารามิเตอร์ไว้ในหน่วยความจำโฮสต์แทนที่จะอยู่ใน VRAM ถาวร, SGLang และ TensorRT-LLM อยู่ในรายการ Day 0 ของ NVIDIA และไลบรารีของ Ollama มีบิลด์ MLX ที่คุณดึงได้บน Apple Silicon สิ่งเดียวที่ต้องเลิกทำคือการมองว่าโมเดลนี้เป็น unknowns ด้านคุณภาพ ตอนนี้มันถูกวัดแล้ว และผลการวัดก็ออกมาดี
สิ่งที่ควรดูต่อไป
• ตัวเลขอิสระจะยังคงอยู่หรือไม่เมื่อดัชนีพัฒนาจนสมบูรณ์ คะแนน 40 ของ Qwen3.8-Flash-Next มาพร้อมกับค่าใช้จ่ายโทเคนที่สูงผิดปกติ โดยใช้ไป 245 ล้านโทเคนในการรันดัชนี เทียบกับค่ามัธยฐานที่ 140 ล้าน และหมายเหตุของ Artificial Analysis เองก็เรียกมันว่า "ยาวเกินจำเป็นมาก" คะแนนที่ได้จากการให้เหตุผลยาวนานขึ้นก็ยังเป็นคะแนนอยู่ แต่เป็นประเภทที่เปลี่ยนแปลงได้เมื่อการประเมินเปลี่ยนไป การปรับปรุงดัชนีครั้งถัดไปคือบททดสอบจริงว่าคะแนน 40 เป็นระดับที่แท้จริงหรือเป็นเพียงค่าสูงสุดเฉพาะที่
• ว่า Qwen3.8-Flash ที่ให้บริการอยู่นั้นได้คะแนนแยกต่างหากหรือไม่ ตัวเลขอิสระทุกตัวในชิ้นนี้เป็นของพรีวิวแบบน้ำหนักเปิด ส่วนเวอร์ชันสำหรับใช้งานจริงที่มีคอนเท็กซ์ 1M และเครื่องมือในตัวไม่มีคะแนนอิสระเป็นของตัวเอง และหากมันเป็นสถาปัตยกรรมเดียวกันภายใต้คอนเท็กซ์ที่ยาวกว่า นั่นก็เป็นการประเมินราคาถูกที่ใครสักคนควรเผยแพร่ออกมา
• การรองรับงานเสิร์ฟแบบ day-0 จะทำได้จริงแค่ไหนในทางปฏิบัติ — ตัวเลข throughput ของ GB300 ที่ผู้ขายระบุไว้ก็ยังคงเป็นเพียงตัวเลขที่ผู้ขายระบุเท่านั้น และการกำหนดค่า TP4 expert-parallel กับ KV-offload ก็ยังใหม่พอที่จะเปราะบาง
• Alibaba จะรอนานแค่ไหนก่อนที่ตระกูล Qwen4 แบบเต็มจะตามพรีวิวมา
ส่วนที่เราได้รู้กันมาจนถึงตอนนี้ของเรื่องนี้ได้ปิดลงไปเกือบหมดแล้ว เอกสารสเปกเปิดเผยต่อสาธารณะแล้ว น้ำหนักโมเดลดาวน์โหลดได้แล้ว สถาปัตยกรรมได้รับการยืนยันแล้ว ตัวแปร Qwen3.8-Flash ที่ให้บริการก็ออนไลน์อยู่บนโฮสต์ API ในราคาตามรายการแล้ว และโมเดลนี้ก็ได้รับการให้คะแนนอย่างอิสระจากสองฝ่ายที่แยกกัน โดยโมเดลที่เล็กกว่าชนะในด้านคุณภาพ ส่วนโมเดลที่ใหญ่กว่าชนะในด้านอัตราการประมวลผล สิ่งที่ยังเปิดอยู่คือว่า preview ที่มีพารามิเตอร์ทำงาน 6B จะ generalize ไปได้ไกลเกินกว่า benchmark ที่มันถูกปรับจูนมาให้สอดคล้องหรือไม่ และ Alibaba จะรอนานแค่ไหนก่อนที่ตระกูล Qwen4 ตัวเต็มจะตามออกมา คำถามข้อสุดท้ายนั้นยังคงเป็นคำถามที่การเปิดตัวครั้งนี้ทิ้งไว้โดยไม่ตอบ และยังคงเป็นคำถามที่จะสำคัญที่สุด
การเปรียบเทียบในบทความนี้4
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
