
Qwen3.8-Flash-Next เปิดตัว: เจาะลึกพรีวิวสถาปัตยกรรม Qwen4 ของ Alibaba
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
เอกสารที่มีประโยชน์ที่สุดที่ Alibaba เผยแพร่เมื่อวันที่ 26 สิงหาคม 2026 ไม่ใช่ชุดข่าว แต่เป็นรายงานทางเทคนิค Qwen3.8-Flash-Next โมเดลแบบผสมของผู้เชี่ยวชาญ (mixture-of-experts) แบบ multimodal และเปิดน้ำหนักที่เผยแพร่ในวันนั้น มาพร้อมกับเอกสารชื่อ "On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability" และรายงานนี้คือเรื่องราวหลัก มันทำสิ่งที่การเปิดตัวของผู้ขายแทบไม่เคยทำ: มันเผยแพร่ผลการตัดตอน (ablations) ผลลัพธ์เชิงลบ และการทดลองสูตรการฝึกอบรม จากนั้นก็เชื่อมโยงผลการค้นพบแต่ละอย่างเข้ากับสถาปัตยกรรมของตระกูล Qwen4 ซึ่งโมเดลนี้ตั้งใจที่จะเปิดตัวให้เห็นตัวอย่าง
สิ่งที่จัดส่งจริงในวันที่ 26 สิงหาคม
ตัวโมเดลเองถือว่าพอประมาณเมื่อเทียบกับมาตรฐานปี 2026 ของ Qwen และนั่นก็เป็นความตั้งใจ Qwen3.8-Flash-Next เก็บพารามิเตอร์หลักของโมเดล 125B พร้อมกับตาราง n-gram embedding แยกต่างหากอีก 51B — รวมประมาณ 176B ก่อนที่จะมีโมดูล multi-token-prediction ขนาด 4B — แต่เปิดใช้งานเพียง 6B ต่อโทเคน มันเป็นโมเดล mixture-of-experts ที่มี 512 ผู้เชี่ยวชาญ พร้อมการจัดเส้นทางแบบ top-10 และ 48 เลเยอร์ รองรับบริบท 262,144 โทเคนโดยธรรมชาติ และขยายได้ถึง 1M ผ่าน YaRN มันรับอินพุตเป็นข้อความ รูปภาพ และวิดีโอ แล้วส่งออกเป็นข้อความ น้ำหนัก (weights) อยู่บน Hugging Face และ ModelScope ภายใต้สัญญาอนุญาต qwen-community-1.0 และบล็อกของ Alibaba เองเรียกมันว่า "ตัวอย่างเชิงทดลองของสถาปัตยกรรมที่จะรองรับ Qwen4" — บทบาทเดียวกันกับที่ Qwen3-Next เคยเล่นให้กับตระกูล Qwen3.5 คือเป็นนกคานารีที่บินนำหน้าก่อนเรือธง
ในวันเดียวกัน Alibaba ได้เปิดตัวเวอร์ชันเชิงพาณิชย์: build ที่ให้บริการชื่อ Qwen3.8-Flash บน QwenCloud API ในราคา $0.16 ต่อล้านโทเคนสำหรับ input และ $0.47 ต่อล้านโทเคนสำหรับ output ทั้งสองอย่างนี้สับสนได้ง่าย และควรทำความเข้าใจให้ชัดเจน Qwen3.8-Flash-Next คือพรีวิวแบบ open-weights ที่รายงานทางเทคนิควิเคราะห์ ส่วน Qwen3.8-Flash คือ build API สำหรับโปรดักชัน มีการกำหนดราคา มีบริบทเริ่มต้นที่ 1M โทเคน และรูปแบบคำขอที่เข้ากันได้กับ OpenAI และ Anthropic ราคา เกณฑ์มาตรฐาน และข้อโต้แย้งด้านสถาปัตยกรรมล้วนมาจากวิศวกรรมชุดเดียวกัน

การเดิมพันทางสถาปัตยกรรมสี่รายการในรายงานทางเทคนิค
แกนหลักของเอกสารคือข้อสมมติสี่ประการเกี่ยวกับว่าโมเดลระดับแนวหน้าที่รองรับบริบทยาวและมีต้นทุนต่ำควรมีลักษณะอย่างไร โดยแต่ละข้อมีหลักฐานจากการทดลองสนับสนุน
• ความสนใจ — ไฮบริด GDN + QSA สามในสี่เลเยอร์ใช้ Gated DeltaNet ซึ่งเป็นเลเยอร์แอตเทนชันเชิงเส้นที่บีบอัดประวัติศาสตร์ลงในสถานะรีเคอร์เรนต์ขนาดคงที่แทนที่จะเป็น KV cache ที่ขยายตามความยาวลำดับ เลเยอร์ที่เหลือใช้ Qwen Sparse Attention ซึ่งรวมลำดับเป็นไมโครบล็อก ให้คะแนนอย่างประหยัด และรันแอตเทนชันเต็มเฉพาะในส่วนที่สำคัญ Alibaba รายงานความเร็ว prefill สูงถึง 7.6× และ decode 4.9× ที่บริบท 1M; การวัดผลวันแรกของ SGLang เองสูงกว่า ที่ 10.2× และ 6.6× ที่อัตรา hit ของ prefix cache 90% throughput ของ prefill สูงถึง 8.6× เท่าของ Qwen3.7-Plus ตัวเลขเหล่านี้เป็นตัวเลขที่รายงานโดยผู้ขายและพันธมิตร ไม่ได้ผ่านการตรวจสอบโดยอิสระ
• Residual stream — Gated Residual: ขยายเส้นทาง residual เส้นเดียวให้กว้างขึ้นเป็นสี่สาขาแบบขนาน พร้อมการ gating แบบไดนามิกในระดับองค์ประกอบ (element-wise dynamic gating) ซึ่งเป็นการออกแบบหลายสาขาแบบ Hyper-Connection ที่มีการควบคุมแบบ GatedNorm เกตจะควบคุมการอ่านและการเขียนในแต่ละสาขา ซึ่งบทความระบุว่าช่วยระงับค่า activation outliers และในทางปฏิบัติ ช่วยให้สถานะ residual ถูกจัดเก็บในรูปแบบ FP8 ได้
• Embedding — ตาราง n-gram ขนาด 51B แทนที่จะมีหนึ่ง embedding ต่อ token โมเดลจะใช้ตารางค้นหาที่อิงกับ token ปัจจุบันรวมกับ token ก่อนหน้า เพื่อเก็บทั้งวลีและรูปแบบเฉพาะท้องถิ่น ต้นทุนต่อ token แทบไม่มี และเนื่องจากทราบที่อยู่สำหรับค้นหาล่วงหน้า จึงสามารถเก็บไว้ในหน่วยความจำของโฮสต์และดึงข้อมูลล่วงหน้าแบบอะซิงโครนัส โดยไม่ใช้หน่วยความจำ GPU เลย นี่คือเคล็ดลับที่ทำให้ checkpoint ที่มีขนาดเก็บ 176B ทำงานบนเครื่องระดับ 75GB ได้ และมีที่มาจาก per-layer embeddings ของ Gemma 3n และ Engram ของ DeepSeek
• การปรับให้เหมาะสม — Muon ที่ถูกปรับแต่ง การฝึกใช้ตัวปรับให้เหมาะสม Muon ซึ่งเป็นวิธีโมเมนตัมที่ใช้การทำ orthogonalization เป็นพื้นฐาน ประยุกต์ใช้กับแผนที่เชิงเส้นสองมิติ (attention, GDN และน้ำหนักผู้เชี่ยวชาญของ MoE) ในขณะที่ AdamW ยังคงใช้สำหรับ embeddings, router และพารามิเตอร์ low-rank บทความยังรายงานผลลัพธ์เชิงลบที่น่าอ่าน: การวอร์มอัพขนาดแบตช์ถูกตัดออก หลังจากพบว่ามันทำให้ต้องใช้ขั้นตอนของ optimizer มากขึ้น 18.8% โดยไม่ได้ปรับปรุงอะไรเลย
ตารางเกณฑ์มาตรฐาน อ่านอย่างละเอียด
ตัวเลขหลักทุกตัวในที่นี่เป็นของ Qwen เองที่เผยแพร่บนโมเดลการ์ดและในรายงาน และยังไม่มีการตรวจสอบซ้ำอย่างอิสระ — โมเดลเพิ่งเปิดตัวได้เพียงวันเดียวและยังไม่มีบุคคลที่สามเข้ามาตรวจสอบ แต่ถึงจะอ่านด้วยความระมัดระวังแบบนั้น มันก็ยังน่าทึ่ง เพราะ Qwen3.8-Flash-Next กำลังแลกหมัดกับ DeepSeek-V4-Flash-0731 ซึ่งเป็นโมเดลที่ใหญ่กว่าและเป็นที่ยอมรับกว่าได้อย่างสูสี ด้วยพารามิเตอร์แอ็กทีฟเพียง 6B
• DeepSWE 1.1 — 58.7 เทียบกับ 54.4 (รายงานโดยผู้ผลิต)
• SWE-bench Pro — 62.5 เทียบกับ 56.0 (รายงานโดยผู้ขาย)
• Toolathlon ยืนยันแล้ว — 73.5 เทียบกับ 70.3 (ตามรายงานของผู้จำหน่าย)
• LiveCodeBench v6 — 91.9 เทียบกับ 90.6 (รายงานโดยผู้จำหน่าย)
• GPQA Diamond — 91.7 เทียบกับ 90.8 (รายงานโดยผู้จำหน่าย)
• IFBench — 81.3 เทียบกับ 79.2 (รายงานโดยผู้จำหน่าย).
แล้วความบกพร่องที่รายงานเปิดเผยออกมา: NL2Repo-Bench ได้ 48.1 เทียบกับ 54.2 ของ DeepSeek-V4-Flash-0731 — ซึ่งเป็นความขาดที่แท้จริงในด้านการสร้างโค้ดระดับรีโพสิทอรี มิติการเขียนโค้ดแบบเอเจนต์เพียงมิติเดียวที่โมเดลขนาดเล็กไม่ได้ตามทัน Agents' Last Exam สูสีกันที่ 24.3 เทียบกับ 25.2 ด้านระบบอัตโนมัติสำนักงาน Qwen รายงาน CoWorkBench 73.9 — แต่เป็นเบนช์มาร์กภายในบริษัท และ Alibaba ไม่นำมันไปแสดงในแผนภูมิหลัก

ในด้านวิสัยทัศน์ ตารางที่รายงานด้วยตนเองแสดง AndroidWorld 84.5 เทียบกับ 62.0 ของ Claude Opus 4.6 Max และ RealWorldQA 88.5 เทียบกับ 73.9 Humanity's Last Exam เป็นหัวข้อเดียวที่ Qwen แพ้ให้กับ Claude Opus 4.6 Max อย่างสิ้นเชิง — และการประเมินคะแนนนั้นเองก็ดำเนินการโดย GPT-4o ดังนั้นแม้การเปรียบเทียบนั้นก็ไม่สะอาด
ราคา: หนึ่งในสิบสองของรุ่นเรือธง
แล้วตัวเลขที่สำคัญต่องบประมาณก็คือ บริการรุ่น Qwen3.8-Flash อยู่ที่ $0.16 ต่อล้านโทเค็นอินพุต และ $0.47 ต่อล้านเอาต์พุตบน QwenCloud ซึ่งก็คือประมาณหนึ่งในสิบสองของราคารุ่นเรือธงของ Alibaba เองอย่าง Qwen3.8-Max ที่ $2.00 ต่อล้านอินพุตและ $6.00 ต่อล้านเอาต์พุต — บนโมเดลที่รายงานระบุว่าใช้พลังคำนวณในการฝึกประมาณหนึ่งในเก้าของ Qwen3.7-Plus ผู้จำหน่ายโมเดลจีนใช้เวลาตลอดฤดูร้อนลดราคาระดับ flash-tier และการเปิดตัวครั้งนี้คือฝ่าย Qwen ของแคมเปญนั้น ที่มาพร้อมกับเหตุผลเชิงสถาปัตยกรรมแนบมาด้วย แทนที่จะเป็นเพียงส่วนลด
สำหรับใครก็ตามที่เปรียบเทียบในหมวดหมู่นี้ การคำนวณจะง่ายขึ้นเมื่อผู้ให้บริการทุกรายแสดงตัวเลขเดียวกัน OrcaRouter จัดเส้นทางที่เหลือของตระกูล Qwen ได้แก่ Qwen3.8-Max, Qwen3.8-27B และ Qwen3.8 ในราคารายการที่ผู้ให้บริการกำหนดโดยไม่มีส่วนเพิ่ม 0% ดังนั้นการลดราคาจากผู้ขายจึงมีผลกับฝ่ายเราทันทีในวันที่ประกาศ Qwen3.8-Flash-Next ยังไม่อยู่ในแคตตาล็อกของเรา เมื่อมันไปถึงรันไทม์ที่เราให้บริการ มันจะเข้าไปอยู่ในการตั้งค่าราคารายการแบบคีย์เดียวเดียวกันนั้นโดยไม่ต้องมีสัญญาที่สอง
สิ่งที่คุณสามารถทำกับมันได้ในวันนี้
การรองรับการให้บริการแบบ day-zero นั้นกว้างขวางผิดปกติ SGLang มีหน้า cookbook และอิมเมจเฉพาะ (lmsysorg/sglang:qwen38flashnext); vLLM มี vllm/vllm-openai:qwen38-flash-next; NVIDIA รับรองทั้งสองรายการรวมถึง TensorRT LLM บนแร็ค GB300 NVL72 ด้วยอัตรามากกว่า 16,000 โทเคนต่อวินาทีต่อ GPU ในรูปแบบ FP8 และ NeMo ครอบคลุมงาน fine-tuning ในระดับที่ต่ำกว่าดาต้าเซ็นเตอร์ลงไป โมเดลรันบนคลัสเตอร์ DGX Spark และเวิร์กสเตชัน 4×RTX PRO 6000 และขบวน quantization จากชุมชนในวันเดียวกัน — GGUFs จาก Unsloth และบิลด์ 1-bit ที่พอดีในแรม 75GB ด้วยความแม่นยำประมาณ 80% ของความแม่นยำเต็ม — ทำให้ checkpoint ที่เก็บขนาด 176B รันได้จริงบนฮาร์ดแวร์ที่ทีมขนาดเล็กเป็นเจ้าของ ทีมที่อยากเรียกใช้ API มากกว่าจะรันเองสามารถเข้าถึง Qwen3.8-Flash API ผ่าน QwenCloud ของ Alibaba เองและแพลตฟอร์มบุคคลที่สามหลายแห่ง แม้ว่าน้ำหนักแบบเปิด (open weights) จะเป็นสิ่งที่ผู้ใช้งานยุคแรกส่วนใหญ่จะหยิบใช้เป็นอันดับแรกก็ตาม

คณิตศาสตร์ VRAM เบื้องหลังรายการนั้นคือตาราง n-gram และนั่นคือจุดที่ serving stacks กำลังมุ่งมาบรรจบกันเป็นอันดับถัดไป per-layer embedding ที่รายงานเทคนิคเก็บไว้นอกหน่วยความจำ GPU เป็นโครงสร้าง lookup ล้วนๆ — ในแต่ละ token ที่สร้างขึ้น โมเดลดึงข้อมูลเพียงประมาณ 16 แถวจากทั้งหมด 320 ล้านแถว — ซึ่งนั่นคือสิ่งที่ทำให้การ offload มันมีต้นทุนต่ำ vLLM ให้บริการ Qwen3.8-Flash-Next จาก dev image เฉพาะ ในขณะที่ pull request สำหรับรองรับสถาปัตยกรรมยังเปิดอยู่ และชิ้นงานใหม่ล่าสุดของงานนั้น คือ draft PR จาก vLLM author คนเดียวกัน (vllm-project/vllm#54371, ยังไม่ถูก merge) ซึ่งเพิ่ม serving path แบบ PLE-Offload ที่เก็บตารางไว้ใน host memory และอ่านผ่าน CUDA unified virtual addressing แทนการจอง VRAM ที่ FP8 ตารางมีขนาดประมาณ 48GB จาก checkpoint ~173GB ดังนั้นการ offload มันจึงเป็นตัวแบ่งระหว่าง data-center GPU กับการ์ด 96GB ใบเดียว — RTX PRO 6000 หรือ unified-memory pool ของ DGX Spark หนึ่งเครื่อง มันยังอยู่ในช่วงแรกๆ ดังนั้นให้มองมันเป็นทิศทาง มากกว่าตัวเลือกที่รองรับในวันนี้ แต่มันคือ runtime ที่กำลังตามทันสิ่งที่รายงานเทคนิคอ้างไว้แล้ว และเป็นสิ่งที่ควรจับตาดู หากตัวเลข VRAM คือสิ่งที่ฉุดรั้งคุณอยู่
พรีวิวที่เพิ่งปล่อยมาได้หนึ่งวัน พร้อมตัวเลขที่ยังไม่มีใครสามารถทำซ้ำได้ ถือเป็นกรณีตัวอย่างในตำราว่าไม่ควรเดิมพันเส้นทางโปรดักชันกับมัน และนั่นคือสิ่งที่ failover มีไว้จริง ๆ หาก runtime ตัวหนึ่งมี Qwen3.8-Flash-Next และคุณชี้ endpoint หนึ่งไปที่มัน พร้อม failover อัตโนมัติไปยังโมเดลที่คุณไว้ใจอยู่แล้ว คุณจะได้ข้อดีของสถาปัตยกรรมใหม่บนทราฟฟิกที่ไม่สำคัญ และมีทางสำรองที่ไร้รอยต่อเมื่อมันทำงานไม่ไหว — ไม่ต้อง rewiring เพราะนั่นคือกฎการจัดเส้นทาง ไม่ใช่การแก้โค้ด
สิ่งที่พรีวิวนี้บอกเกี่ยวกับ Qwen4
Alibaba เคยเล่นเกมนี้มาก่อน Qwen3-Next เคยนำเสนอ Gated DeltaNet เป็นตัวอย่างในช่วงปลายปี 2025 พร้อมเอกสารที่บางเบา และสถาปัตยกรรมก็ได้รับการกำหนดอย่างสมบูรณ์ก็ต่อเมื่อซีรีส์ Qwen3.5 นำมาใช้ในวงกว้าง รูปแบบกำลังเกิดขึ้นซ้ำ: Qwen3.8-Flash-Next คือตัวทดสอบ (canary) และรายงานนี้คือข้อกำหนดที่ได้จากการทดลอง สิ่งที่เป็นรูปธรรมที่ต้องจับตามองคือว่า Qwen4 รุ่นเรือธงจะนำการแบ่งสัดส่วน GDN ต่อ QSA แบบสามต่อหนึ่งมาใช้หรือไม่, ไม่ว่า n-gram embedding จะยังคงอยู่รอดเมื่อต้องเผชิญกับการให้บริการในระดับโปรดักชันของรุ่นเรือธงหรือไม่, และที่สำคัญที่สุดคือการประเมินโดยอิสระจะยืนยันข้อได้เปรียบของโมเดลแบบ 6B-active เหนือโมเดลที่ใหญ่กว่าหรือไม่ หากสมมติฐานด้านประสิทธิภาพเป็นจริง Qwen4 รุ่นเรือธงอาจเปิดตัวพร้อมต้นทุนการให้บริการที่ต่ำลงอย่างมากเมื่อเทียบกับรุ่นก่อนหน้า.
คำถามที่พบบ่อย
Qwen3.8-Flash-Next และ Qwen3.8-Flash — รุ่นเดียวกันหรือ?
ไม่ และความแตกต่างนี้สำคัญ Qwen3.8-Flash-Next คือสถาปัตยกรรมพรีวิวแบบ open-weights ที่รายงานเทคนิคใช้วิเคราะห์ ส่วน Qwen3.8-Flash คือบิลด์ API สำหรับโปรดักชันที่ Alibaba ให้บริการบน QwenCloud ในราคา $0.16/$0.47 ต่อล้านโทเค็น พร้อมบริบทเริ่มต้น 1M มีต้นสายวิศวกรรมเดียวกัน แต่เป็นอาร์ติแฟกต์คนละชิ้น — อันหนึ่งสำหรับโฮสต์เองและตรวจสอบ อีกอันเป็นบริการจัดการที่มีค่าใช้จ่าย
ควรย้ายเวิร์กโหลดการผลิตไปใช้มันในวันนี้หรือไม่
ไม่ใช่โดยไม่มีความเห็นที่สอง ผลทดสอบทุกรายการมาจากผู้จำหน่ายและยังไม่มีใครจำลองผลได้ สถาปัตยกรรมใหม่พอที่ระบบ serving ยังคงปรับตัวไม่ลงตัว — การรองรับ vLLM เองยังทยอยเข้ามาผ่าน pull requests แบบเปิด — และช่องว่างด้าน agentic-coding หนึ่งจุด (NL2Repo) ตรงกับงานประเภทที่นักพัฒนาในสาย production เจอจริง ๆ การเปิดน้ำหนักโมเดลทำให้ประเมินด้วยตัวเองได้ไม่แพง และการรองรับ SGLang และ vLLM ตั้งแต่วันแรกทำให้ทำ pilot ได้ในสัปดาห์นี้ — แต่ pilot ที่มี failover คอยรองรับคือวิธีที่ซื่อตรงในการเริ่มต้น ไม่ใช่การสับเปลี่ยนโดยตรง
Qwen4 ตัวจริงจะจัดส่งเมื่อไหร่?
Alibaba ยังไม่ได้กล่าว สัญญาณด้านเวลาเพียงอย่างเดียวในรีลีสนี้เป็นเรื่องในอดีต: นกคานารีตัวสุดท้าย Qwen3-Next บินไปประมาณหนึ่งฤดูกาลก่อนที่ซีรีส์ Qwen3.5 จะนำสถาปัตยกรรมนั้นมาใช้ ตามจังหวะนั้น เรือธงของ Qwen4 ใกล้กว่าที่เห็น — แต่รายงานนี้พูดถึงสถาปัตยกรรมโดยเฉพาะ ไม่ใช่โรดแมป
สรุป
Qwen3.8-Flash-Next คือการเปิดตัวที่หาได้ยากซึ่งตัว paper คือตัวผลิตภัณฑ์จริง ๆ ในส่วนของตัวโมเดลเอง สกอร์การ์ดที่ตรงไปตรงมาระบุว่า: พารามิเตอร์แอกทีฟ 6B ที่เทียบเท่าโมเดลที่ใหญ่กว่ามากในเบนช์มาร์กร่วมส่วนใหญ่, ช่องว่างที่ระบุชื่อหนึ่งจุดในโค้ดระดับ repository, ราคาให้บริการหนึ่งในสิบสองของรุ่นเรือธง, และสถาปัตยกรรมที่คือคำตอบของ Qwen ต่อคำถามว่าโมเดลระดับแนวหน้าจะถูกลงได้อย่างไร รายงานเทคนิคบอกว่า Qwen3.8-Flash-Next มีไว้เพื่ออะไร — และมันไม่ใช่ตัวโมเดล มันคือหลักฐานของสถาปัตยกรรมที่จะเป็น Qwen4 และเป็นสิ่งที่ควรอ่านก่อน Qwen4 จะถูกส่งออกมา เพราะการตัดสินใจที่มันเปลี่ยนแปลงคือการตัดสินใจที่คุณจะทำเมื่อ Qwen4 มาถึง
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
