
รีวิว Qwen3.8-Max: เรือธง 2.4T ของ Alibaba ในราคา $2/$6 — บิลด์ 0902 ครองอันดับ Code Arena WebDev
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
Alibaba Qwen เปิดตัวตัวอย่าง Qwen3.8-Max ที่งาน World AI Conference ในนครเซี่ยงไฮ้ เมื่อวันที่ 19 กรกฎาคม 2026 และเป็นเวลาสองสัปดาห์ มันเป็นโมเดลที่ถูกพูดถึงมากที่สุดที่ไม่มีใครสามารถตั้งราคาได้จริง ไม่มีตารางราคา ไม่มีตาราง benchmark ไม่มี model card ไม่มีใบอนุญาต และไม่มีจำนวนพารามิเตอร์ที่ใช้งานจริง — มีเพียงพาดหัวข่าวเรื่องพารามิเตอร์ 2.4 ล้านล้าน และข้ออ้างว่าโมเดลนี้ "เป็นรองเพียง Claude Fable 5" เท่านั้น
ในวันที่ 3 สิงหาคม 2026 สิ่งนั้นก็เปลี่ยนไป Qwen3.8-Max พร้อมใช้งานทั่วไปแล้ว: มีการเผยแพร่อัตราค่าบริการที่ $2 ต่อล้านโทเคนอินพุต และ $6 ต่อล้านโทเคนเอาต์พุต เอนด์พอยต์ที่เข้ากันได้กับ OpenAI และ DashScope ตารางเบนช์มาร์กฉบับสมบูรณ์ และโอเพนเวตที่เผยแพร่เมื่อวันที่ 12 สิงหาคม หนึ่งสัปดาห์ต่อมา ในวันที่ 14 สิงหาคม มันเปิดให้บริการบน DigitalOcean Serverless Inference ในฐานะ "Day 0 launch partner" ของ Alibaba — คลาวด์ตะวันตกรายใหญ่รายแรกที่ให้บริการโมเดลนี้ เมื่อวันที่ 2 กันยายน Alibaba ปล่อยเวอร์ชันรีเฟรชที่มีชื่อว่า Qwen3.8-Max-0902 ซึ่งผ่านการเทรนต่อเพิ่มเติมบน Coding และ Cowork ซึ่ง Qwen ระบุว่าช่วยเสริมประสิทธิภาพสำหรับงานระดับองค์กรและงานวิทยาศาสตร์ที่ซับซ้อน รีวิวนี้เขียนขึ้นโดยอ้างอิงข้อเท็จจริงของ GA โดยรวมเอาข้อมูลการเปิดตัววันแรกและบิลด์ 0902 เข้าไปด้วย และตอบคำถามที่ทีมต่างๆ มีจริง ๆ ในตอนนี้เมื่อโมเดลนี้หาซื้อได้แล้ว: Qwen3.8-Max พร้อมรับทราฟฟิกในโพรดักชันแล้ว หรือยังเป็นเพียงโมเดลที่ต้องจับตามอง?
คำตอบสั้นๆ คือมันไปได้ไกลกว่าที่คนส่วนใหญ่คาดไว้ — โดยเฉพาะเรื่องราคาที่ตั้งมาแบบดุดัน จนต้องมีการปรับราคากันใหม่ทั้งวงการโมเดลระดับแนวหน้า และการรีเฟรชเมื่อวันที่ 2 กันยายนก็ยิ่งตอกย้ำสองสิ่งที่โมเดลทำได้ดีอยู่แล้ว นั่นคือการเขียนโค้ดและการทำงานร่วมกัน สกอร์การ์ดอิสระที่ปล่อยออกมาภายหลังก็ให้ผลดีจริง แต่ก็มีข้อควรระวังที่ควรอ่านก่อนจะตัดสินใจส่งทราฟฟิกเข้าไป
TL;DR. ตอนนี้ Qwen3.8-Max พร้อมใช้งานทั่วไป (GA) ในราคา $2 / $6 ต่อ 1 ล้านโทเคน โดยเป็นราคาคงที่ตลอดทั้งช่วงบริบทความยาว 1M โทเคน ไม่มีค่าธรรมเนียมเพิ่มสำหรับพรอมป์ยาว — ซึ่งต่ำกว่าราคาเอาต์พุตของ Kimi K3 ($3/$15) และ Claude Opus 5 ($5/$25) ซึ่งเป็นต้นทุนหลักสำหรับงานที่ต้องใช้การให้เหตุผล Alibaba เผยแพร่ตารางเบนช์มาร์กที่แข็งแกร่ง (Terminal-Bench 2.1 ได้ 86.6, GPQA Diamond ได้ 92.6, OSWorld-Verified ได้ 86.1) และการก้าวกระโดดด้านการเขียนโค้ดเมื่อเทียบกับรุ่นก่อนหน้านั้นโดดเด่นมาก: FrontierSWE 73.5 เทียบกับ 40.7 แต่ตารางคุณภาพนี้เป็นของ Alibaba เอง และผู้ตัดสินอิสระรายแรก — Artificial Analysis Intelligence Index — ได้ออกมาให้ข้อมูลแล้ว: Qwen3.8-Max ได้คะแนน 56 ที่ราคา $1.14 ต่องาน เท่ากับ Claude Opus 4.8 (56) และตามหลังผู้นำโมเดลโอเพนเวต Kimi K3 (57) อยู่ 1 จุด ขณะที่มีต้นทุนต่องานสูงกว่า 25% จำนวนพารามิเตอร์ที่ใช้งานจริงไม่ใช่เครื่องหมายคำถามอีกต่อไป: เปิดใช้งาน 95B จากทั้งหมด 2.4T ได้รับการยืนยันบนโมเดลการ์ดอย่างเป็นทางการ ซึ่งทำให้บุคคลภายนอกประเมินเรื่องต้นทุนการให้บริการได้ในที่สุด นับตั้งแต่งานรีวิวนี้เผยแพร่ครั้งแรก ก็มีบริการแบบจัดการเพิ่มขึ้นอีกเส้นทาง: Qwen3.8-Max เปิดบริการบน DigitalOcean Serverless Inference เมื่อวันที่ 14 สิงหาคม ในฐานะพาร์ทเนอร์ Day 0 ของ Alibaba พร้อมตัวเลขการให้บริการที่ DigitalOcean เผยแพร่ — การประมวลผล prefill ขยายได้ถึง ~16,000 โทเคน/วินาที และเอาต์พุต ~1,937 โทเคน/วินาที ที่ 256 คำขอพร้อมกันโดยไม่มีข้อผิดพลาด — ซึ่งเป็นข้อมูลความหน่วงที่วัดได้จริงครั้งแรกจากผู้ให้บริการรายอื่นที่ไม่ใช่ Alibaba เมื่อวันที่ 2 กันยายน Alibaba ได้อัปเดตโมเดลเรือธงเป็น Qwen3.8-Max-0902 โดยผ่านการ post-train เพิ่มเติมบนข้อมูล Coding และ Cowork; Qwen กล่าวว่าสแนปชอตใหม่นี้แข็งแกร่งขึ้นสำหรับงานองค์กรและงานวิทยาศาสตร์ที่ซับซ้อน — ซึ่งเป็นการอ้างจากผู้ผลิต ยังไม่มีตัวเลขอิสระสำหรับงานองค์กรหรือวิทยาศาสตร์ ด้านการเขียนโค้ดของบิลด์ 0902 ตอนนี้มีผลการแข่งขันในสนามประลองอิสระเป็นของตัวเอง: Qwen3.8-Max-0902 เปิดตัวที่อันดับ 1 บนกระดาน Code Arena: WebDev ด้วยคะแนน 1,691 คะแนน — เพิ่มขึ้น 22 คะแนนจากบิลด์ก่อนหน้า และนำหน้า Claude Opus 5 และ Kimi K3 — ตามที่ Alibaba ระบุ โดยอ้างอิงรายชื่อสนามประลองจากบุคคลที่สามแบบสด เรื่องราวของเอเจนต์เชิงพาณิชย์ (agentic-commerce) ได้กระดานคะแนนในสัปดาห์เดียวกัน: บน CommerceAgentBench ซึ่งเป็นเบนช์มาร์กใหม่จากทีม Accio ของ Alibaba ที่สร้างจากแบบจำลอง stateful ของซอฟต์แวร์พาณิชย์จริง Qwen3.8-Max ทำผลลัพธ์ได้ดีที่สุดในกลุ่มโอเพนเวต — ผ่านรวม 156 ครั้งจากสามแฮร์เนส นำหน้า DeepSeek V4 Pro อยู่ 2 ครั้ง — เป็นตารางที่ผู้ผลิตจัดทำขึ้น ไม่ใช่ผู้ตัดสินอิสระ สรุป: ตอนนี้สามารถซื้อใช้งานได้จริง และราคาถูกพอที่จะคุ้มค่ากับการประเมินจริง — แต่ควรเลือกใช้งานอย่างมีวิจารณญาณ ไม่ใช่ใช้ทั้งหมดแบบเหมารวม
ประเด็นสำคัญ
• GA ตั้งแต่ 3 สิงหาคม 2026 ยุคของการพรีวิวและแคมเปญเครดิตสิ้นสุดลงแล้ว ตอนนี้มีเรตการ์ดจริงและเอนด์พอยต์จริง
• $2 / $6 ต่อ 1M โทเค็น อัตราเดียวตลอดคอนเทกซ์ 1M คู่แข่งส่วนใหญ่คิดค่าธรรมเนียมเพิ่มสำหรับพรอมป์ต์ยาว แต่ Alibaba ไม่คิด ซึ่งสำคัญอย่างยิ่งสำหรับงานเอกสารยาวและงานรีโพขนาดใหญ่
• ตาราง benchmark ของ Alibaba แข็งแกร่งแต่ไม่ได้รับการตรวจสอบ: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.
• การก้าวกระโดดข้ามรุ่นของการเขียนโค้ดคือเรื่องจริง: FrontierSWE 73.5 (จาก 40.7) และ DeepSWE 1.1 56.6 (จาก 21.6) — ทั้งคู่เพิ่มขึ้นเกือบเท่าตัว.
• คะแนนอิสระรายแรกออกมาแล้ว: Qwen3.8-Max ทำคะแนนได้ 56 ใน AA Intelligence Index ที่ $1.14/งาน — เพิ่มขึ้น 10 จุดจาก Qwen3.7-Max (46), เสมอ Claude Opus 4.8 (56), ตามหลัง Kimi K3 (57) อยู่ 1 จุด กระดานจัดอันดับทั่วไปของ LMArena ยังไม่มีคะแนนเปิดเผย
• ยืนยันพารามิเตอร์ที่ใช้งานอยู่ที่ 95B — การ์ดโมเดลอย่างเป็นทางการระบุว่ามีทั้งหมด 2.4T และเปิดใช้งาน 95B ซึ่งปิดคำถามใหญ่ที่สุดในเรื่องการคำนวณต้นทุนการให้บริการ
Open weights เปิดตัวแล้ว — Qwen3.8-2.4T-A95B (BF16) และ Qwen3.8-2.4T-A95B-FP8 วางบน Hugging Face เมื่อวันที่ 12 สิงหาคมภายใต้ไลเซนส์ Qwen3.8-Max แบบกำหนดเอง ไม่ใช่ Apache 2.0 ส่วน Qwen3.8-27B สำหรับใช้งานภายในองค์กร (on-premise) วางจำหน่ายเมื่อวันที่ 14 สิงหาคมภายใต้ Apache 2.0
• เส้นทางที่มีการจัดการที่สองเปิดเมื่อวันที่ 14 สิงหาคม Qwen3.8-Max เปิดให้บริการแล้วบน DigitalOcean Serverless Inference ในฐานะ "พันธมิตรเปิดตัววันแรก" ของ Alibaba — NVFP4 บน NVIDIA HGX B300, ราคา $2/$6 พร้อมค่าใช้จ่าย cached input $0.20, ให้บริการที่บริบทเนทีฟ 262K ของ open checkpoint ตัวเลขที่ DigitalOcean วัดได้ (prefill ~16K tokens/วินาที, ไม่มีข้อผิดพลาดที่ 256 concurrency) เป็นข้อมูลประสิทธิภาพการให้บริการชุดแรกบนแพลตฟอร์มที่มีการจัดการนอกเหนือจาก Alibaba
• อัปเดตวันที่ 2 กันยายน: Qwen3.8-Max-0902. Alibaba ปรับแต่งโมเดลเรือธงเพิ่มเติมในด้าน Coding และ Cowork และให้บริการบน QwenCloud ด้วยราคาเดิม $2/$6 และบริบท 1M Qwen ระบุว่าประสิทธิภาพระดับองค์กรและวิทยาศาสตร์แข็งแกร่งขึ้น — ยังคงเป็นเพียงคำกล่าวอ้างจากผู้ผลิต — ขณะที่ด้านการเขียนโค้ดก็ได้ผลการจัดอันดับจากสนามทดสอบอิสระในวันเดียวกัน: บิลด์นี้เปิดตัวที่อันดับ 1 บน Code Arena: WebDev ด้วยคะแนน 1,691 (ดูรายละเอียด Code Arena ด้านล่าง)
• CommerceAgentBench: ผู้นำโมเดลเปิดน้ำหนัก จัดทำโดยผู้ขายเอง ทีม Accio ของ Alibaba เปิดตัว CommerceAgentBench สัปดาห์นี้ — งานแบบ long-horizon จำนวน 107 งานในระบบจำลองแบบมีสถานะ (stateful replicas) ของซอฟต์แวร์พาณิชย์และธุรกิจจริง ให้คะแนนตามสถานะของระบบผ่านแฮร์เนส Accio, OpenClaw และ Pi โดยผลปรากฏว่า Qwen3.8-Max นำโมเดลเปิดน้ำหนักด้วยยอดผ่านรวม 156 ครั้ง มากกว่า DeepSeek V4 Pro อยู่ 2 ครั้ง ส่วนโมเดลปิดอย่าง Claude Opus 5 เป็นผู้นำโดยรวมที่ 191 ครั้ง และตารางอันดับนี้เป็นของ Alibaba เอง ไม่ใช่ผู้ประเมินอิสระ
• Code Arena: WebDev #1 — ผลลัพธ์จากอารีนาอิสระของบิลด์ 0902 Qwen3.8-Max-0902 เปิดตัวขึ้นอันดับหนึ่งบนลีดเดอร์บอร์ด Code Arena: WebDev ด้วย 1,691 คะแนน — เพิ่มขึ้น 22 จากบิลด์ก่อนหน้า และนำหน้า Claude Opus 5 และ Kimi K3 — และยังครองเส้นแนวหน้า Pareto ด้านความคุ้มค่าของบอร์ดนั้น ที่ต้นทุนรวมเฉลี่ยประมาณ $5/MToken หรือประมาณหนึ่งในสี่ของราคารวมเฉลี่ยของ Claude Opus 5 บัญชี QwenCloud อย่างเป็นทางการของ Qwen ยืนยันตำแหน่งนี้แล้ว ต่างจาก CommerceAgentBench บอร์ดนี้เป็นของบุคคลที่สาม: เป็นอารีนาที่ให้มนุษย์โหวตแบบไม่เห็นข้อมูล ไม่ใช่ตารางของ Alibaba แม้ว่าการ 'เปิดตัวที่ #1' จะเป็นการประกาศของ Alibaba สำหรับรายการ ณ ช่วงเวลานั้นก็ตาม
หมายเหตุด้านความถูกต้อง: ตาราง benchmark ของ Qwen3.8-Max ในรีวิวนี้เป็นข้อมูลที่ Alibaba รายงานเอง และยังไม่มีการวัดซ้ำโดยอิสระ คะแนน Artificial Analysis Intelligence Index (56 ที่ $1.14/งาน) เป็นการวัดโดยอิสระของ AA บน API อย่างเป็นทางการของ Alibaba — นับเป็นผู้ตัดสินอิสระรายแรกของโมเดลนี้ ราคาที่กล่าวถึงอ้างอิงจากเรตการ์ด GA ของ Alibaba Model Studio คลังโมเดลแบบ open-weights (Qwen3.8-2.4T-A95B และ Qwen3.8-2.4T-A95B-FP8) ตัวเลข 95B-active และข้อความสัญญาอนุญาตเป็นข้อมูลจากผู้พัฒนาโดยตรง กล่าวคือมาจากองค์กร Hugging Face ของ Qwen เอง ตรวจสอบเมื่อวันที่ 13 สิงหาคม 2026 ความพร้อมใช้งานบน DigitalOcean เรตการ์ด การวัดประสิทธิภาพการ serve และการสุ่มตรวจ GPQA ที่ได้ 88 บนบิลด์แบบ quantized ล้วนมาจากเอกสารและบทช่วยสอนของชุมชน DigitalOcean เอง ซึ่งเผยแพร่คู่กับประกาศวันที่ 14 สิงหาคม; ส่วนการกล่าวถึง 'Day 0 launch partner' เป็นถ้อยคำในประกาศของ Alibaba ในจุดที่เราอ้างอิงตัวเลขของคู่แข่ง ข้อมูลมาจาก Artificial Analysis หรือผู้ขายที่ระบุชื่อไว้ในเนื้อหา การรีเฟรช Qwen3.8-Max-0902 ที่ประกาศเมื่อวันที่ 2 กันยายน เป็นข้อมูลที่ผู้ขายแถลงทั้งหมด: สเปก คำอธิบายการฝึก post-training แนวทาง Coding-and-Cowork และการอ้างถึงการยกระดับด้านองค์กรและวิทยาศาสตร์ ล้วนมาจากประกาศของ Qwen เองและหน้าโมเดล QwenCloud และไม่มีตัวเลขใดที่ได้รับการวัดซ้ำโดยอิสระ ตำแหน่งใน Code Arena: WebDev ที่กล่าวถึงในส่วน benchmark เป็นข้อยกเว้นเพียงข้อเดียว: บอร์ดดังกล่าวเป็นอารีนาลงคะแนนแบบ blind-vote ของบุคคลที่สาม ไม่ใช่ตารางของ Alibaba — ถึงแม้การ 'เปิดตัวที่ #1 ด้วยคะแนน 1,691' จะเป็นประกาศของ Alibaba ที่ระบุการติดอันดับ ณ จุดเวลานั้น และคะแนนในอารีนาก็ยังเคลื่อนไหวต่อไปเรื่อย ๆ เมื่อคะแนนเสียงเพิ่มขึ้น ผลลัพธ์ CommerceAgentBench ที่กล่าวถึงด้านล่างอยู่ในหมวดเดียวกัน: benchmark นี้สร้างและเผยแพร่โดย Accio ทีมงานของ Alibaba International ดังนั้นตารางของมันจึงเป็นข้อมูลที่ Alibaba รายงาน — เป็น benchmark โอเพนซอร์ส แต่ไม่ใช่ผู้ตัดสินอิสระในแบบที่ Artificial Analysis เป็น ตาราง benchmark ของผู้ขายมักออกมาในแง่ดีเกินจริงเป็นปกติ — ควรถือว่าข้อมูลเหล่านี้เป็นสมมติฐานที่ต้องทดสอบกับเวิร์กโหลดของคุณเอง ไม่ใช่การจัดอันดับที่ยุติแล้ว

Qwen3.8-Max คืออะไร?
Qwen3.8-Max เป็นเรือธงของตระกูล Qwen ของ Alibaba: โมเดล sparse Mixture-of-Experts ที่มีพารามิเตอร์รวม 2.4 ล้านล้าน, หน้าต่างบริบท 1 ล้านโทเค็น, และรองรับอินพุตมัลติมีเดียโดยธรรมชาติ รองรับทั้งข้อความ รูปภาพ และวิดีโอ และส่งกลับเป็นข้อความ รองรับโหมดการคิด, การเรียกใช้ฟังก์ชัน, เครื่องมือในตัว, และเอาต์พุตแบบมีโครงสร้าง และให้บริการผ่านเอนด์พอยต์ /v1/chat/completions ที่เข้ากันได้กับ OpenAI ซึ่งหมายความว่าการผสานรวมที่มีอยู่ส่วนใหญ่จำเป็นต้องเปลี่ยน base-URL เท่านั้น ไม่ต้องเขียนใหม่ทั้งหมด สแนปชอตการผลิตปัจจุบัน ซึ่งเปิดตัวเมื่อวันที่ 2 กันยายน คือ Qwen3.8-Max-0902 ซึ่งผ่านการเทรนหลังเพิ่มเติมบน Coding และ Cowork
ตัวเลขบริบทในทางปฏิบัติค่อนข้างเฉพาะเจาะจงมากกว่าคำโปรยทางการตลาดที่ว่า "1M" เมตาดาต้าคลาวด์ของอาลีบาบาระบุหน้าต่างโทเคน 983,616 ตัวเมื่อเปิดใช้งานโหมด thinking โดยมีอินพุตสูงสุดประมาณ 991K โทเคน และเอาต์พุตสูงสุด 131,072 โทเคนเพดานเอาต์พุตนั้นสูงอย่างผิดปกติและมีความสำคัญต่องานอย่างการสร้างโค้ดทั้งไฟล์หรือการร่างรายงานยาวๆ เพราะเพดานที่ต่ำกว่าจะบังคับให้ต้องแบ่งเป็นส่วนๆ แล้วต่อเข้าด้วยกัน เช็คพอยต์แบบเปิดที่ DigitalOcean ให้บริการอยู่ในปัจจุบันมีการกำหนดค่าที่แตกต่าง: การ์ดโมเดลระบุโทเคนดั้งเดิม 262,144 ตัว ขยายได้ถึงประมาณ 1,010,000 ดังนั้นการให้บริการผ่านบุคคลที่สามที่รันโมเดลฐานแบบเปิดจึงมักได้จำนวนดั้งเดิมที่น้อยกว่านั้น
จำนวนพารามิเตอร์ที่ใช้งานจริงตอนนี้เปิดเผยแล้ว และชื่อใน repository ก็บ่งบอกไว้: A95B หมายถึง 95 พันล้านพารามิเตอร์ที่ถูกเปิดใช้งาน การ์ดโมเดลอย่างเป็นทางการของ Qwen3.8-2.4T-A95B ระบุว่า "ทั้งหมด 2.4T และเปิดใช้งาน 95B" ซึ่งเป็น Mixture-of-Experts แบบละเอียดที่มีผู้เชี่ยวชาญ 512 ตัว โดยในแต่ละโทเค็นจะมี 10 ตัวที่ถูกเลือกใช้บวกกับอีก 1 ตัวที่ใช้ร่วมกัน ตัวเลขนี้สำคัญกว่าตัวเลข 2.4T ที่เป็นหัวเรื่ęอข่าว สำหรับโมเดลแบบ dense จำนวนพารามิเตอร์ทั้งหมดบอกคร่าวๆ ว่า inference มีต้นทุนเท่าไร แต่สำหรับโมเดลแบบ MoE ตัวเลขนั้นแทบไม่บอกอะไรเลย — มีเพียงจำนวนที่ใช้งานจริงเท่านั้นที่บอกได้ เพราะนั่นคือสิ่งที่รันจริงต่อโทเค็น โมเดล 2.4T ที่เปิดใช้งาน 30B จะมีพฤติกรรมแตกต่างโดยสิ้นเชิง ทั้งในเรื่อง latency และค่าใช้จ่ายในการให้บริการ เมื่อเทียบกับโมเดลที่เปิดใช้งาน 200B ที่ 95B active คอมพิวต์ต่อโทเค็นจะอยู่ในระดับเดียวกันกับโมเดล dense ที่ประมาณ 90B — เป็นเพียงเศษเสี้ยวของสิ่งที่โมเดล dense ขนาด 2.4T ต้องใช้ — และนี่คือตัวเลขที่ทำให้คำถามเรื่องการโฮสต์ด้วยตัวเองด้านล่างตอบได้ในที่สุด
การรีเฟรชวันที่ 2 กันยายน: Qwen3.8-Max-0902
เมื่อวันที่ 2 กันยายน 2026 Qwen ได้เปิดตัวโปรดักชันรีเฟรชที่มีชื่อเฉพาะเป็นครั้งแรก Qwen3.8-Max-0902 ยังคงสถาปัตยกรรม sparse-MoE แบบ 2.4T พารามิเตอร์, แอกทีฟพารามิเตอร์ 95B และหน้าต่างบริบท 1M โทเคนเท่าเดิม แต่ถูกโพสต์เทรนเพิ่มเติมในสองความสามารถ ได้แก่ Coding และ Cowork และเปิดให้บริการบน API ของ QwenCloud ในชื่อ qwen3.8-max-0902 (รวมถึงถูกระบุเป็น qwen3.8-max-2026-09-02 ด้วยเช่นกัน) บิลด์นี้เป็นบิลด์ที่แนะนำในปัจจุบัน ไม่ใช่สาขาย่อย: ตอนนี้เอนด์พอยต์ qwen3.8-max ที่ไม่มีวันที่ของ Alibaba ให้บริการสแนปชอต 0902 แล้ว ดังนั้นการเรียกใช้ชื่อโมเดลมาตรฐานจึงได้เวอร์ชันรีเฟรช ในขณะที่ไอดีแบบระบุวันที่มีไว้สำหรับทีมที่ต้องการล็อกบิลด์ที่แน่นอน ตั้งแต่วันที่ 3 กันยายนเป็นต้นมา สแนปชอตนี้ยังถูกระบุเป็นรหัสโมเดลที่กำหนดเส้นทางได้ของตัวเองบน API ที่จัดการโดยบุคคลที่สามอีกด้วย อัตราค่าบริการไม่มีการเปลี่ยนแปลง: $2 ต่ออินพุต 1M, $6 ต่อเอาต์พุต 1M พร้อมอัตราแคชเท่าเดิม
ข้ออ้างด้านประสิทธิภาพเป็นของ Qwen เอง ประกาศและหน้าโมเดล QwenCloud ระบุถึงความสามารถด้านการเขียนโค้ดที่ “บุกเบิกสิ่งใหม่” ในโปรเจกต์ระดับวิศวกรรมจริงและการพัฒนาอัตโนมัติแบบ long-horizon ตลอดจนประสบการณ์เอเจนต์แบบร่วมมือ (collaborative agent) ที่ “ยกระดับขึ้นอย่างมีนัยสำคัญ” ในการประสานงานเครื่องมือหลายชนิดและการส่งมอบงานแบบ end-to-end และ—ตามคำกล่าวของบริษัท—ให้สมรรถนะที่แข็งแกร่งขึ้นในงานองค์กรซับซ้อน งานวิจัยวิทยาศาสตร์ และเวิร์กโฟลว์ที่ใช้เวลายาวนาน การตรวจสอบอิสระครั้งแรกมีผลออกมาในวันเดียวกัน: Qwen3.8-Max-0902 เปิดตัวที่อันดับ 1 บนกระดาน Code Arena: WebDev—สนามโหวตแบบปกปิดโดยบุคคลที่สามสำหรับการพัฒนาเว็บแบบ agentic ซึ่งเป็นโปรเจกต์ที่เดิมรู้จักในชื่อ WebDev Arena—ด้วยคะแนน 1,691 จุด เพิ่มขึ้น 22 จุดจาก build ก่อนหน้า และนำหน้า Claude Opus 5 กับ Kimi K3 ตามที่ Alibaba อ้างถึงกระดานคะแนนสด อันดับดังกล่าวได้รับการยืนยันจากบัญชีทางการของ Qwen ในวันเดียวกันโดยชี้ไปที่ QwenCloud API ว่าการจัดอันดับนี้พิสูจน์อะไรได้และไม่ได้บ้าง จะมีการอธิบายในส่วน Benchmark ด้านล่าง ข้ออ้างที่เหลือของการอัปเดตครั้งนี้—การให้เหตุผลระดับองค์กร งานด้านวิทยาศาสตร์ และความเป็นอัตโนมัติแบบ long-horizon โดยทั่วไป—ยังคงเป็นคำกล่าวจากผู้พัฒนาระบบเอง จึงควรใช้ระเบียบวินัยเดียวกันกับตารางเดือนสิงหาคม: ให้ถือว่าข้ออ้างเหล่านี้เป็นสมมติฐานจนกว่าจะมีการประเมินโดย Artificial Analysis หรือเวิร์กโหลดจริงมาให้การยืนยัน
ในทางปฏิบัติ ความหมายของ "Cowork" คือจุดที่การรีเฟรชครั้งนี้น่าสนใจ Qwen3.8-Max ในยุค GA มีความสามารถในการทำงานอัตโนมัติระยะยาว (long-horizon autonomy) อยู่แล้ว ไม่ว่าจะเป็นการสร้าง oh-my-cli ใน 16 วัน หรือธุรกิจเสมือนจริงที่ดำเนินไปมากกว่า 2,000 รอบ และบิลด์ 0902 คือการที่ Alibaba ทุ่มเทให้กับแกนนี้มากขึ้น: เอเจนต์ที่ประสานงานเครื่องมือหลายตัวและทำงานให้สำเร็จตั้งแต่ต้นจนจบ แทนที่จะเป็นคำตอบแบบครั้งเดียวจบ ในสัปดาห์เดียวกัน ทีม Accio ของ Alibaba ได้เผยแพร่ CommerceAgentBench ซึ่งเป็นชุดเกณฑ์ชี้วัด (benchmark) ที่สร้างขึ้นเพื่อวัดแกนนี้โดยตรง: งานระยะยาว 107 งานภายในแบบจำลองที่มีสถานะ (stateful) ของซอฟต์แวร์การค้าและธุรกิจจริง โดยที่ Qwen3.8-Max เป็นผู้นำในกลุ่มโมเดล open-weight — รายละเอียดอยู่ในส่วน benchmark ด้านล่าง สำหรับทีมที่กำลังประเมินโมเดลเพื่อใช้งานในองค์กร นี่คือข้ออ้างที่ควรทดสอบเป็นอันดับแรก เพราะเป็นข้อที่ยากที่สุดในการตรวจสอบจากตาราง benchmark เช่นกัน
การตั้งราคา: สิ่งที่ดุดันที่สุดเกี่ยวกับการเปิดตัวครั้งนี้
Alibaba Model Studio ระบุ Qwen3.8-Max ที่ราคา $2.00 ต่อ 1M โทเคนอินพุต และ $6.00 ต่อ 1M โทเคนเอาต์พุต. โดยผลลัพธ์รวมโทเคนการคิด ซึ่งสำคัญเพราะการตั้งค่าที่เน้นการใช้เหตุผลหนักจะคิดค่าบริการการคิดภายในในอัตราเอาต์พุต เรื่องแคช: การเข้าถึงอินพุตที่แคชแล้วคิดเป็น $0.25 ต่อ 1M, การสร้างแคชแบบชัดเจน $2.50, และการอ่านแคชแบบชัดเจน $0.17.
ส่วนที่น่าสนใจในเชิงโครงสร้างไม่ใช่ตัวเลขหลัก แต่คือระดับราคาคงที่. อาลีบาบาคิดราคาเท่ากันที่ $2/$6 ไม่ว่าพรอมต์ของคุณจะมี 5,000 โทเคนหรือ 900,000 โทเคนก็ตาม คู่แข่งส่วนใหญ่เรียกเก็บค่าธรรมเนียมเพิ่มเติมสำหรับบริบทยาว เนื่องจากการให้บริการพรอมต์ขนาดเกือบล้านโทเคนนั้นมีต้นทุนสูง การที่อาลีบาบารับภาระค่าใช้จ่ายนี้คือการแย่งตลาดอย่างจงใจ โดยมุ่งเป้าไปที่เวิร์กโหลดที่ต้องใช้บริบทยาวเป็นหลัก เช่น การตรวจสอบโค้ดทั้งคลัง การวิเคราะห์สัญญาและเอกสารยื่น และการสังเคราะห์งานวิจัยจากเอกสารหลายฉบับ.
ตัวอย่างประกอบสมมติว่าคุณรันเอเจนต์วิเคราะห์ repo: โทเคนอินพุต 200,000 โทเคนสำหรับบริบทโค้ด และโทเคนเอาต์พุต 8,000 โทเคนต่อการเรียกหนึ่งครั้ง
• ต่อการเรียก: 0.2M × $2 = $0.40 สำหรับ input บวกกับ 0.008M × $6 = $0.048 สำหรับ output ≈ $0.45 ต่อการเรียก
• ที่ 1,000 สาย/วัน: ≈ $448/วัน หรือประมาณ $13,400/เดือน
• การเรียกใช้เดียวกันกับ Claude Opus 5 ที่ราคา $5/$25: $1.00 + $0.20 = $1.20 — ประมาณ 2.7 เท่า.
• ด้วยการแคชพรอมต์บนบริบทโค้ดที่เสถียร อินพุตที่ถูกแคชที่ $0.25 จะลดฝั่งอินพุตจาก $0.40 เหลือ $0.05 ทำให้การเรียกมีค่าใช้จ่าย ≈ $0.10 — ซึ่งลดลงเกือบ 4.5 เท่าสำหรับการรับส่งข้อมูลซ้ำ
ความแตกต่างของแคชนั้นคือจุดที่งบประมาณที่แท้จริงอยู่ หากเอเจนต์ของคุณอ่านบริบทที่ไม่ค่อยเปลี่ยนแปลงซ้ำในทุกเทิร์น — ซึ่งอธิบายถึงเอเจนต์ด้านการเขียนโค้ดและการสนับสนุนส่วนใหญ่ — ราคาที่แท้จริงจะใกล้เคียงกับ $0.25/$6 มากกว่า $2/$6 ทีมที่ข้ามการกำหนดค่าแคชมักจะจ่ายเกิน 3–4 เท่าในโมเดลนี้
สำหรับการเปรียบเทียบตามราคาป้าย: Qwen3.8-Max $2/$6; Qwen3.7-Max รุ่นก่อนหน้าของมันเอง $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. ในด้านอินพุต Qwen ก็แค่พอแข่งขันได้เท่านั้น ในด้านเอาต์พุต — ด้านที่ครองสัดส่วนการใช้จ่ายส่วนใหญ่ในงานใช้เหตุผลและงานเอเจนต์ — มันเป็นโมเดลที่ถูกที่สุดในบรรดาโมเดลที่อ้างสถานะระดับแนวหน้าในรายการนั้น
การวัดผลอิสระของ Artificial Analysis เผยให้เห็นอีกด้านของโทเคนราคาถูกเหล่านั้น บนดัชนี Intelligence Index, Qwen3.8-Max มีต้นทุน $1.14 ต่องาน — มากกว่าสองเท่าของรุ่นก่อนหน้าที่ $0.53 และ สูงกว่า $0.86 ของ Kimi K3 ถึง 25% แม้ว่า Kimi K3 จะระบุราคาที่ $3/$15 ต่อโทเคน ช่องว่างนี้เป็นพฤติกรรม ไม่ใช่การขึ้นราคา: โมเดลเฉลี่ยแล้ว64 ขั้นตอนต่องาน GDPval-AA เทียบกับ 14 สำหรับ Qwen3.7-Max และเนื่องจากการทดสอบส่งบทสนทนาทั้งหมดซ้ำในแต่ละขั้นตอน โทเคนอินพุตจึงเพิ่มขึ้นประมาณ 15 เท่า และเอาต์พุตเพิ่มขึ้น ~45% โทเคนราคาถูกไม่ได้เท่ากับเอเจนต์ราคาถูก — ความเยิ่นเย้อที่ผู้ทดสอบรอบพรีวิวชี้ให้เห็นตอนนี้มีป้ายราคาที่วัดได้ เนื่องจาก OrcaRouter ส่งต่อราคาลิสต์ด้วยมาร์กอัป 0% ผ่านเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI คำถามระหว่าง $1.14 เทียบกับ $0.86 จึงเป็นสิ่งที่คุณสามารถวัดผลได้ด้วยพรอมป์เดียวกันโดยไม่ต้องมีสัญญาเพิ่มเติม

ตาราง benchmark และสิ่งที่ตัวเลขแต่ละตัววัดจริงๆ
ที่ GA Alibaba เผยแพร่ตารางที่ตนระงับไว้ในช่วงพรีวิว คะแนนที่รายงาน:
• Terminal-Bench 2.1 — 86.6. วัดว่าโมเดลสามารถใช้งานเชลล์จริงจนเสร็จสมบูรณ์ได้หรือไม่: รันคำสั่ง อ่านผลลัพธ์ กู้คืนจากข้อผิดพลาด นี่คือตัวแทนที่ใกล้เคียงที่สุดสำหรับ "มันทำหน้าที่เป็นเอเจนต์เขียนโค้ดได้หรือไม่ มากกว่าเป็นแค่ตัวแนะนำโค้ด"
• GPQA Diamond — 92.6.คำถามระดับบัณฑิตศึกษาในสาขาฟิสิกส์ เคมี และชีววิทยาที่ถูกออกแบบให้ยากต่อการค้นคืนจากแหล่งข้อมูล คะแนนสูงบ่งบอกถึงความสามารถในการใช้เหตุผลทางวิทยาศาสตร์อย่างแท้จริง ไม่ใช่การจดจำ 92.6 คือคะแนนสูงสุดในวงการปัจจุบัน
• PaperBench — 93.0. การทำซ้ำผลลัพธ์จากงานวิจัย — การอ่านระเบียบวิธีวิจัยแล้วนำมาปรับใช้ใหม่ ให้คะแนนสำหรับความเข้าใจแบบหลายขั้นตอนอย่างต่อเนื่อง
• IFBench — 82.8. การทำตามคำสั่งภายใต้ข้อจำกัด: รูปแบบ ความยาว และคำสั่งเชิงลบ น่าสังเกตว่าเป็นคะแนนต่ำสุดในตารางของ Alibaba เอง ซึ่งสอดคล้องกับข้อร้องเรียนในยุคพรีวิวที่ว่าโมเดลมีความละเอียดรอบคอบจนถึงขั้นละเลยขีดจำกัดของขอบเขต
• OSWorld-Verified — 86.1. การใช้คอมพิวเตอร์: การควบคุม GUI บนเดสก์ท็อปจริงเพื่อทำงานให้สำเร็จ ความแข็งแกร่งในจุดนี้สนับสนุนการวางตำแหน่งในฐานะเอเจนต์
• OmniDocBench 1.5 — 92.1.การแยกวิเคราะห์เอกสาร — ตาราง เลย์เอาต์ ข้อความและรูปภาพที่ผสมกัน จับคู่กับบริบทอัตราคงที่ 1M เพื่อพิสูจน์คุณค่าที่แท้จริงของไพพ์ไลน์เอกสาร
• FrontierSWE ได้ 73.5 เพิ่มขึ้นจาก 40.7 ของรุ่นก่อนหน้า DeepSWE 1.1 ได้ 56.6 เพิ่มขึ้นจาก 21.6
สองประเด็นสุดท้ายนั้นควรค่าแก่การเน้นย้ำ การเพิ่มขึ้นเกือบเท่าตัวบนเกณฑ์มาตรฐานวิศวกรรมซอฟต์แวร์ที่ยากภายในรุ่นเดียวไม่ใช่การพัฒนาที่เพิ่มขึ้นแบบปกติ และสอดคล้องกับการตัดสินใจของ Alibaba ที่จะทำตลาดโมเดลนี้กับนักพัฒนาแทนที่จะเป็นผู้ใช้แชท หากตัวเลข FrontierSWE ผ่านการตรวจสอบซ้ำอย่างอิสระ Qwen3.8-Max ก็เป็นโมเดลเขียนโค้ดที่จริงจัง ไม่ใช่เพียงแค่โมเดลใหญ่เท่านั้น
ข้อแม้จากพรีวิวได้ลดลงแต่ก็ไม่ได้หายไปตารางด้านบนสร้างโดย Alibaba บนระบบทดสอบของตนเอง ภายใต้เงื่อนไขที่ไม่มีใครอื่นตรวจสอบได้ตารางของบริษัทผู้พัฒนาถูกเลือกมา ไม่ใช่การสุ่ม — ห้องแล็บตีพิมพ์เฉพาะเกณฑ์ชี้วัดที่ตนทำได้ดี แต่ ณ วันที่ 6 สิงหาคม บัดนี้มีผู้ตรวจสอบอิสระอย่างแท้จริง: Artificial Analysis ให้คะแนน Qwen3.8-Max อยู่ที่ 56 ในดัชนี Intelligence Index ด้วยต้นทุน 1.14 ดอลลาร์ต่องาน ซึ่งวัดจาก API อย่างเป็นทางการของ Alibaba — เพิ่มขึ้น 10 จุดจากรุ่นก่อนที่ได้ 46, เท่ากับ Claude Opus 4.8 (56) และตามหลัง Kimi K3 (57) หนึ่งจุด บนลีดเดอร์บอร์ด GDPval-AA แบบ agentic ของ AA โมเดลทำคะแนนถึง 1,739 Elo แซง Kimi K3 (1,685) และ GPT-5.6 Sol (1,730) โดยมีเพียง Claude Opus 5 (1,852) ที่นำอยู่ ข้อแม้ของ AA เองก็ควรได้รับความสำคัญเท่าเทียมกัน: การรันครั้งก่อนได้ 53 ก่อนที่ปัญหา endpoint จะถูกแก้ไข และการทดสอบซ้ำบน API อย่างเป็นทางการได้ 56; AA-Omniscience ร่วง 10 จุดจากอัตราการหลอนที่เพิ่มขึ้นจาก 23% เป็น 40%; และต้นทุนต่องานสูงก็เพราะโมเดลต้องประมวลผลหลายขั้นตอนมากกว่าเดิมมาก ลีดเดอร์บอร์ดหลักของ LMArena ยังไม่มีคะแนนที่เปิดเผยต่อสาธารณะ
การเปิดตัว DigitalOcean เพิ่มจุดข้อมูลที่สาม ซึ่งคราวนี้เป็นบนบิลด์แบบ quantized แทนที่จะเป็นรุ่นหลัก (flagship) การตรวจสอบภายในของ DigitalOcean เองต่อน้ำหนัก NVFP4 ที่ให้บริการ ได้คะแนน88 บน GPQA Diamond เทียบกับ 92.6 ที่ Alibaba เผยแพร่สำหรับรุ่นหลักแบบไม่ quantized DigitalOcean เองระบุว่าการเปรียบเทียบนี้เป็น "จุดข้อมูลบ่งชี้มากกว่าการเปรียบเทียบแบบควบคุม" — ความแตกต่างมีอยู่สามแกน (โมเดลฐานแบบ open-weights แทนรุ่นหลักแบบโฮสต์, NVFP4 แทน BF16, และชุดการประเมินที่ต่างกัน) — แต่นี่คือการตรวจสอบอิสระครั้งแรกบนการใช้งาน serving จริงของน้ำหนักเหล่านี้ และเป็นเครื่องเตือนใจว่า checkpoint แบบเปิดไม่ใช่ตัวเลขเดียวกันแบบ byte-for-byte กับตารางของ Alibaba
CommerceAgentBench: กระดานคะแนนสำหรับ agentic-commerce
ควบคู่ไปกับการรีเฟรชครั้งนี้ ทีม Accio ของ Alibaba International ได้เปิดตัว CommerceAgentBench ซึ่งเป็นชุดเกณฑ์ชี้วัดที่สร้างขึ้นเพื่อวัดงานระยะยาวที่ Qwen โปรโมตอยู่เสมอโดยเฉพาะ เอเจนต์จะเริ่มต้นแต่ละงานภายในคอนเทนเนอร์ใหม่เอี่ยมในหนึ่งใน 14 แบบจำลองออฟไลน์ของซอฟต์แวร์เชิงพาณิชย์และธุรกิจจริง ตั้งแต่การเผยแพร่สินค้า การจองขนส่งสินค้า การดูแลหน้าร้าน การดำเนินการด้านการชำระเงิน ไปจนถึงการวิเคราะห์ซัพพลายเออร์ และการให้คะแนนเป็นแบบอิงสถานะ: งานจะผ่านก็ต่อเมื่อบริการจำลองพื้นฐานและไฟล์ที่สร้างขึ้นเกิดการเปลี่ยนแปลงจริงเท่านั้น ดังนั้นเอเจนต์ที่บรรยายลำดับขั้นตอนที่ฟังดูเป็นไปได้แต่ไม่เปลี่ยนสถานะใด ๆ จะไม่ได้คะแนนเลย ชุดทดสอบนี้รัน 107 งานผ่านพื้นผิว CLI เบราว์เซอร์ ไฟล์/เอกสาร และ API/MCP โดยดำเนินการผ่าน harness สามตัว ได้แก่ Accio, OpenClaw และ Pi และโค้ดของ harness (Apache 2.0) กับข้อมูลงาน (CC BY 4.0) เปิดให้ตรวจสอบหรือรันซ้ำได้
ในตารางที่เผยแพร่ Qwen3.8-Max ทำผลลัพธ์ดีที่สุดในกลุ่มโอเพนเวต: ผ่าน 56 จาก 107 งานบนแฮร์เนส Accio, 47 บน OpenClaw และ 53 บน Pi — ยอดผ่านรวม 156 นำ DeepSeek V4 Pro ที่ได้ 154 อยู่ 2. ความได้เปรียบในกลุ่มโอเพนเวตทั้งหมดมาจากแฮร์เนส Accio; ทั้งสองโมเดลเสมอกันบน OpenClaw และ Pi. การเป็นผู้นำกลุ่มโอเพนเวตไม่ใช่การเป็นผู้นำโดยรวม: Claude Opus 5 โมเดลปิดครองสนามด้วยยอดผ่านรวม 191 นำอยู่ 35. และตารางนี้เป็นของ Alibaba เอง — Accio เป็นทีมของ Alibaba และตัวรีโพซิทอรีเองก็ระบุข้อจำกัดด้านการตรวจสอบ: แฮร์เนส Accio ใช้เพื่ออ้างอิงเท่านั้น และไม่สามารถสร้างซ้ำได้จากการเช็คเอาต์ (OpenClaw เป็นเส้นทางที่รันซ้ำได้) ผลลัพธ์ระดับงานไม่มีเช็คซัมสาธารณะที่เปลี่ยนแปลงไม่ได้ และแถวของ Qwen อาศัยโพรโทคอลรีเพลย์เนื้อหาการให้เหตุผลเพื่อให้ยังเทียบเคียงกันได้. จงมองมันเป็นจุดข้อมูลที่ผู้ผลิตแถลงไว้บนแกนเชิงเอเจนต์เดียวกันกับที่ OSWorld-Verified และแนวทาง GDPval-AA ของ AA เข้าถึงจากคนละมุม — คุ้มค่าที่จะลองเทียบกับเวิร์กโฟลว์ของคุณเอง ไม่ใช่การจัดอันดับที่สรุปแล้ว
Code Arena WebDev: กรรมการอิสระของ build 0902
Code Arena คือหลักฐานอิสระชิ้นที่การรีเฟรชครั้งนี้ขาดหายไป เป็นลีดเดอร์บอร์ดจากบุคคลที่สามสำหรับการพัฒนาเว็บแบบเอเจนต์ (agentic web development) — โปรเจกต์ที่เคยรู้จักกันในชื่อ WebDev Arena — ซึ่งการโหวตเปรียบเทียบรายคู่ของมนุษย์โดยไม่เห็นชื่อโมเดล (blind pairwise) ว่าผลลัพธ์ของโมเดลใดที่ผู้ใช้อยากจะปล่อยออกมามากกว่ากัน จะถูกแปลงเป็นเรตติงแบบ Elo บนบอร์ด WebDev ของมัน Qwen3.8-Max-0902 เปิดตัวด้วยการครองอันดับหนึ่ง ด้วยคะแนน 1,691 คะแนน เพิ่มขึ้น 22 คะแนนจากรุ่นก่อนหน้า และนำหน้า Claude Opus 5 และ Kimi K3 ตำแหน่งนี้ยังมีข้อได้เปรียบด้านความคุ้มค่าเชิงต้นทุนด้วย: ที่ราคาแบบผสมประมาณ 5 ดอลลาร์ต่อล้านโทเคน — อัตราราคามาตรฐาน 2/6 ดอลลาร์ที่ถ่วงน้ำหนักตามสัดส่วนที่เน้นเอาต์พุตหนัก ๆ ซึ่งการสร้างเว็บแอปจริงก่อให้เกิดขึ้นจริง — รุ่น 0902 จึงเป็นโมเดลที่ได้คะแนนสูงสุดบนเส้นพาเรโตของบอร์ด โดยมีต้นทุนราวหนึ่งในสี่ของราคาแบบผสมประมาณ 20 ดอลลาร์ต่อล้านของ Claude Opus 5 และต่ำกว่าราคาประมาณ 12 ดอลลาร์ต่อล้านของ Kimi K3 อย่างมาก ซึ่งเป็นเหตุผลที่โมเดลทั้งสองหลุดจากเส้นพาเรโตแม้จะได้คะแนนเป็นอันดับ 2 และ 3 ก็ตาม อาลีบาบาประกาศตำแหน่งดังกล่าวเมื่อวันที่ 2 กันยายน และบัญชีทางการของ Qwen ยืนยันพร้อมชี้ให้ผู้ใช้ไปที่ QwenCloud การวัดนี้ไม่ใช่ของอาลีบาบา: ซึ่งต่างจากตารางเกณฑ์มาตรฐานด้านบนหรือการรัน CommerceAgentBench ที่อยู่ด้านบน คะแนนนี้ถูกสร้างขึ้นโดยอารีนาบุคคลที่สามจากการโหวตความพึงพอใจของมนุษย์
ข้อควรระวังสองประการช่วยให้เรื่องนี้ตรงไปตรงมา ประการแรก คะแนนในอารีนาเป็นแบบชี้จุดเวลา: 1,691 คือค่าที่บอร์ดแสดงตอนอาลีบาบาประกาศเปิดตัว และมันจะขยับไปเรื่อย ๆ เมื่อคะแนนเสียงเพิ่มขึ้น ดังนั้นควรอ่านค่าดังกล่าวเป็นสัญญาณที่แข็งแกร่งเกี่ยวกับการเขียนโค้ดเพื่อพัฒนาเว็บ มากกว่าจะเป็นมงกุฎถาวร ประการที่สอง มันครอบคลุมเพียงมิติเดียวเท่านั้น การกล่าวอ้างด้านองค์กร วิทยาศาสตร์ และงานระยะยาวทั่วไปในการรีเฟรชครั้งนี้ยังไม่มีผู้ตัดสินอิสระ นั่นคือเหตุผลที่ตารางผู้จำหน่ายและดัชนี AA Index 56 บนโมเดลฐานยังคงเป็นจุดอ้างอิงสำหรับทุกอย่างนอกเหนือจากงานฟรอนต์เอนด์แบบเอเจนต์ ประการที่สาม ราคาระดับ前沿เป็นตัวเลือกการสร้างโมเดล ไม่ใช่อัตราใหม่: ตัวเลขประมาณ $5/MToken เกิดจากการผสมรายการราคาเดิมที่ $2/$6 ซึ่งไม่เปลี่ยนแปลง ภายใต้สมมติฐานการใช้งานที่เน้นเอาต์พุตหนัก ดังนั้นควรถือว่ามันเป็นการจัดอันดับความคุ้มค่าด้านต้นทุนตามเงื่อนไขของอารีนาเอง มากกว่าจะเป็นการตั้งราคาใหม่โดยอาลีบาบา

โอเพนเวต, Qwen3.8-27B, และคำถามเรื่องออนพรีมิส
คำสัญญาเรื่องการเปิดเผยน้ำหนักโมเดลของ Alibaba เป็นจริงแล้ว เมื่อวันที่ 12 สิงหาคม 2026 Qwen เผยแพร่รีโพซิทอรีสองแห่งบน Hugging Face — Qwen3.8-2.4T-A95B ในรูปแบบ BF16 และ Qwen3.8-2.4T-A95B-FP8 — แต่ละแห่งมีไฟล์น้ำหนัก 213 ไฟล์ ใบอนุญาตเป็นใบอนุญาต Qwen3.8-Max แบบกำหนดเอง ไม่ใช่ Apache 2.0; ช่องใบอนุญาตบน Hugging Face ระบุว่า “other” ข้อกำหนดอนุญาตให้ใช้ แก้ไข แจกจ่าย และปรับแต่งโมเดล รวมถึงการใช้เชิงพาณิชย์ โดยต้องให้เครดิต และมีเงื่อนไขตามขนาดสองข้อ: ผลิตภัณฑ์ที่มีผู้ใช้รายเดือนมากกว่า 100 ล้านคนหรือมีรายได้ต่อเดือนมากกว่า 20 ล้านดอลลาร์ต้องแสดงชื่อโมเดลอย่างเด่นชัด และธุรกิจ Model-as-a-Service หรือ AI-Work-Assistant ที่มีรายได้รวมในรอบสิบสองเดือนย้อนหลังมากกว่า 50 ล้านดอลลาร์ต้องได้รับใบอนุญาตแยกต่างหากจาก Qwen ทีมส่วนใหญ่อยู่ในเกณฑ์ที่กำหนด; หากธุรกิจของคุณเกินเกณฑ์เหล่านี้ โปรดอ่านข้อความในใบอนุญาตก่อนที่จะนำไปต่อยอด ตัวเลขดาวน์โหลดสนับสนุนความใหม่นี้ — 978 บนรีโพซิทอรี BF16 และ 3,851 บนรีโพซิทอรี FP8 ณ เวลาที่เขียนนี้ ซึ่งต่ำสำหรับการเปิดตัวระดับแนวหน้า และสอดคล้องกับรีโพซิทอรีที่สร้างเมื่อวันที่ 8 สิงหาคมและเพิ่งเปิดเป็นสาธารณะเมื่อวันที่ 12 สิงหาคม ไม่ใช่รีโพซิทอรีที่เปิดให้เห็นมาเป็นเวลาหนึ่งสัปดาห์แล้ว หมายเหตุความจริงใจอีกข้อหนึ่ง: เช็คพอยต์ที่เปิดให้นั้นเป็นโมเดลพื้นฐาน รองรับเฉพาะข้อความและเปิดโหมดคิดเสมอ ในขณะที่ API Qwen3.8-Max ที่โฮสต์ไว้นั้นเพิ่มอินพุตรูปภาพ โหมดไม่คิดแบบเลือกได้ และบริบทเต็ม 1M — การดาวน์โหลดน้ำหนักจะได้ตัวโมเดล ไม่ใช่ทุกฟีเจอร์ของ API
การโฮสต์โมเดลเรือธงด้วยตนเองยังคงเกินเอื้อมสำหรับทีมส่วนใหญ่ แต่ตอนนี้เกินเอื้อมด้วยตัวเลขที่รู้แน่ชัดแล้ว ชุดน้ำหนักพารามิเตอร์ 2.4T เต็มรูปแบบมีขนาดประมาณ 4.9TB ในรูปแบบ BF16 และประมาณ 2.4TB ใน FP8 เนื่องจากผู้เชี่ยวชาญทุกคนต้องอยู่ในหน่วยความจำ แม้ว่าจะเปิดใช้งานเพียง 95B ต่อโทเคนก็ตาม เมื่อทำ quantization แบบ 4-bit จะมีขนาดประมาณ 1.2TB เทียบกับประมาณ 141GB ต่อ H200 ดังนั้นคุณต้องใช้ตัวเร่งความเร็วระดับสูงแปดตัวขึ้นไปก่อนที่จะให้บริการโทเคนเดียว สิ่งที่จำนวน active count ที่เปิดเผยแล้วเพิ่มคือด้านปริมาณงาน: ด้วยการเปิดใช้งาน 95B ต่อโทเคน การคำนวณต่อโทเคนจึงเทียบได้กับโมเดล dense ในคลาส ~90B — ซึ่งเป็นเศษส่วนของต้นทุนที่โมเดล dense 2.4T จะบังคับ — ดังนั้นเมื่อน้ำหนักอยู่ในหน่วยความจำแล้ว ต้นทุนต่อโทเคนจึงไม่ใช่ฝันร้ายอย่างที่จำนวนพารามิเตอร์รวมชี้ให้เห็น การรวมกันของพื้นที่หน่วยความจำขนาดใหญ่และการคำนวณต่อโทเคนที่พอประมาณนี้เป็นเหตุผลที่ Alibaba สามารถตั้งราคาผลลัพธ์ที่ $6/1M และมันชี้ให้ทีมที่โฮสต์ด้วยตนเองไปที่โหนดหลาย GPU ที่รัน FP8 checkpoints แทนที่จะเป็นอะไรก็ตามที่ใช้ GPU เดียว
ทางเลือกในการให้บริการของ DigitalOcean เป็นตัวอย่างการทำงานจริงของหลักคณิตศาสตร์ดังกล่าวในระบบโปรดักชัน โดยรันโมเดลที่ควอนไทซ์แบบ NVFP4 บน GPU NVIDIA HGX B300 เพื่อให้เวตส์ขนาด 2.4T พอดีกับโหนดเดียว หลีกเลี่ยงการจัดเส้นทางผู้เชี่ยวชาญข้ามโหนด — ถือเป็นการนำเศรษฐศาสตร์แบบ 4 บิตที่ส่วนนี้เคยคำนวณไว้บนกระดาษไปใช้จริง ข้อแลกเปลี่ยนคือสิ่งที่การตรวจสอบเฉพาะจุด GPQA ข้างต้นวัดออกมาได้ นั่นคือ หน่วยความจำที่เล็กลง แต่แลกมาด้วยต้นทุนด้านคุณภาพที่วัดได้เมื่อเทียบกับรุ่นเรือธงที่ไม่ผ่านการควอนไทซ์
ซึ่งเป็นสิ่งที่ทำให้ Qwen3.8-27B เป็นการเปิดตัวที่มีนัยสำคัญยิ่งกว่าสำหรับผู้อ่านส่วนใหญ่ — และไม่เหมือนรุ่นเรือธงตรงที่น้ำหนักของโมเดลออกมาตรงตามกำหนดเวลา เมื่อวันที่ 14 สิงหาคม 2026 Qwen ได้เผยแพร่ Qwen/Qwen3.8-27B บน Hugging Face และ ModelScope ภายใต้ Apache 2.0: โมเดล dense 27B ที่รองรับมัลติโมดัลโดยธรรมชาติ มี native context ขนาด 262K โทเคน ขยายได้ถึง 1M และโหมด reasoning_effort ที่ปรับแต่งได้ แดเนียล ฮาน (Daniel Han) แห่ง Unsloth เคยประมาณไว้ว่ามันจะทำงานบน VRAM ประมาณ 17GB — การ์ดระดับโปรซูเมอร์เพียงใบเดียว — และตอนนี้ก็สามารถทดสอบได้แล้ว: รีโพซิทอรีอย่างเป็นทางการมาพร้อมไฟล์ BF16 safetensors (ประมาณ 55.6GB กระจายใน 18 ชาร์ด) และตามด้วยเวอร์ชันควอนไทซ์ GGUF ในรีโพซิทอรีของชุมชน ดังนั้นรูปแบบการวางจำหน่ายของเจนเนอเรชันนี้จึงครบถ้วนแล้ว: น้ำหนักของรุ่นเรือธงขนาด 2.4T เผยแพร่ออกมาก่อนในวันที่ 12 สิงหาคม และโมเดลขนาดเล็กสำหรับเส้นทาง on-premise ก็ออกมาในอีกสองวันต่อมา เราติดตามการเผยแพร่ครั้งนี้ในโพสต์วันวางจำหน่าย Qwen3.8-27B ของเรา
Qwen3.8-Max เหมาะกับที่ใด: สี่สถานการณ์
1. การวิเคราะห์เอกสารยาวและสัญญา นี่คือความเหมาะสมที่สุด อัตราคงที่สำหรับ 1M โทเคน บวกกับ OmniDocBench 92.1 หมายความว่าคุณสามารถส่งเอกสาร 400 หน้าผ่านได้ในครั้งเดียว โดยไม่มีค่าธรรมเนียมเพิ่มเติมและไม่ต้องแบ่งส่วน คู่แข่งที่คิดค่าบริการพิเศษสำหรับบริบทระยะยาวทำให้งานเดียวกันมีราคาแพงกว่าอย่างมีนัยสำคัญ ในเส้นทาง DigitalOcean โปรดจำไว้ว่าเส้นทางนั้นให้บริการฐานเปิดที่บริบท 262K ซึ่งยังคงเป็นเอกสารขนาดใหญ่ แต่ไม่ถึงล้านเต็ม.
2. เอเจนต์เขียนโค้ดระดับรีโพสิทอรีผลลัพธ์ Terminal-Bench 86.6 และ FrontierSWE 73.5 สนับสนุนข้อนี้ และการกำหนดราคาแคช (cache pricing) ทำให้งานแบบวนซ้ำบนโค้ดเบสที่เสถียรมีต้นทุนต่ำ สิ่งแรกที่ควรทดสอบคือความหน่วง (latency) ภายใต้ระดับความพร้อมกัน (concurrency) ของคุณเอง เพราะผู้รีวิวในยุคพรีวิวพบว่าโมเดลทำงานละเอียดลออแต่ช้าในการรันแบบ agentic ที่ยาว และการให้บริการแบบ GA ก็เป็นคนละเรื่องกับการให้บริการแบบพรีวิว ผลลัพธ์ GDPval-AA ของ AA — คะแนน Elo 1,739 ที่เป็นผู้นำ ด้วยต้นทุน 64 สเต็ปต่องาน — คือการยืนยันโดยอิสระถึงทั้งสองด้านของข้อแลกเปลี่ยนนั้น ส่วนการวัดผลของ DigitalOcean เมื่อวันที่ 12 สิงหาคม — ปริมาณงานรวม (aggregate throughput) ที่ขยายสเกลใกล้เคียงเชิงเส้นจนถึง ~1,937 โทเคนเอาต์พุตต่อวินาที ที่คำขอพร้อมกัน 256 รายการ โดยไม่มีข้อผิดพลาดและไม่พบสัญญาณการอิ่มตัว — เป็นจุดข้อมูลแรกบนแพลตฟอร์มแบบจัดการ (managed platform) สำหรับประเด็นนี้ ถึงแม้จะเป็นตัวเลขของ DigitalOcean เองบนระบบให้บริการของตน ไม่ใช่การเทียบแบบตัวต่อตัวกับของ Alibaba
3. ไปป์ไลน์เอกสารและภาพหน้าจอ อินพุตวิดีโอและรูปภาพบวกกับคะแนน OSWorld-Verified 86.1 ทำให้มีความน่าเชื่อถือสำหรับเวิร์กโฟลว์ที่ต้องอ่านหน้าจอ — ระบบอัตโนมัติสำหรับ QA การคัดแยกปัญหาของฝ่ายสนับสนุนจากภาพหน้าจอ งานที่ใกล้เคียงกับ RPA อีกครั้ง อินพุตแบบมัลติโหมดเป็นคุณสมบัติของ hosted API; ส่วนเส้นทาง open-base ของ DigitalOcean เป็นแบบข้อความเท่านั้น
4. จุดที่เรายังไม่นำไปใช้ในตอนนี้ ได้แก่ UX แบบอินเทอร์แอกทีฟที่ไวต่อความหน่วง (latency-critical) และเวิร์กโหลดที่อยู่ภายใต้กฎระเบียบซึ่งต้องมีการประเมินผลที่ทำซ้ำได้ สำหรับกรณีแรก คุณต้องการปริมาณงานที่วัดได้ซึ่งคุณควบคุมได้ สำหรับกรณีที่สอง ความสามารถในการทำซ้ำได้นั้นตอนนี้มีโมเดลการ์ดและใบอนุญาตให้อ้างอิงแล้ว แต่ตาราง benchmark ของ Alibaba ยังไม่มีการทำซ้ำผล — และการถดถอยของ Omniscience ของ AA (อัตราการหลอนสูงถึง 40%) เป็นเครื่องเตือนว่าคะแนนจากผู้ประเมินอิสระนั้นเป็นดาบสองคม

วิธีการเข้าถึง Qwen3.8-Max
มีแนวทางที่ใช้ได้จริงหลายวิธี การใช้โดยตรงผ่าน Alibaba Model Studio / DashScope หรือ QwenCloud API ของ Qwen เอง ช่วยให้คุณได้เรตการ์ดด้านบนและเข้าถึงสแนปช็อตเวอร์ชันใหม่ที่มีวันที่กำกับได้เร็วที่สุด โดยบิลด์ Qwen3.8-Max-0902 วันที่ 2 กันยายนปรากฏบนช่องทางนี้เป็นแห่งแรกก่อนจะกระจายไปยังเอนด์พอยต์อื่น ๆ แต่แลกมากับการต้องเริ่มใช้ผู้ให้บริการรายใหม่และบริหารคีย์อีกหนึ่งตัว Qwen Chat และ Qwen App เป็นวิธีที่เร็วที่สุดในการดูพฤติกรรมคร่าว ๆ ก่อนเขียนโค้ด การดาวน์โหลด open weights จาก Hugging Face เป็นเส้นทางที่สี่สำหรับทีมที่อยากรันโครงสร้างพื้นฐานของตนเอง โดยมีข้อควรระวังเรื่องขนาดและไลเซนส์ตามที่กล่าวข้างต้น ส่วนการใช้งานผ่านเราเตอร์คือตัวเลือกที่ทีมโปรดักชันส่วนใหญ่ควรพิจารณา เพราะช่วยแยกการตัดสินใจเรื่องการย้ายระบบออกจากการตัดสินใจเรื่องการประเมินผล
ตั้งแต่ 14 สิงหาคม 2026 เป็นต้นไป มีตัวเลือกใหม่เกิดขึ้นจริง: Qwen3.8-Max เปิดให้บริการบน DigitalOcean Serverless Inference ซึ่ง Alibaba ประกาศว่าเป็น "Day 0 launch partner" — เป็นคำเรียกของ Alibaba เอง แม้รายการนี้จะเป็นของ DigitalOcean และสามารถยืนได้ด้วยตัวเอง DigitalOcean ให้บริการ checkpoint แบบ open-weights (รหัสโมเดลบนแพลตฟอร์ม qwen3.8-max) ซึ่งถูกควอนไทซ์ด้วย NVFP4 บน GPU NVIDIA HGX B300 ภายใต้ความร่วมมือทางเทคนิคกับ Inferact ให้บริการเป็น serverless API แบบ fully managed: เอนด์พอยต์เดียว ราคาตามการใช้งานจริง ไม่ต้องจัดการโครงสร้างพื้นฐานใดๆ อัตราค่าบริการตรงกับรายการราคาของ Alibaba — $2.00 สำหรับ input / $6.00 สำหรับ output ต่อ 1M โดย input ที่ถูกแคชไว้อยู่ที่ $0.20 — และให้บริการคอนเทกซ์เนทีฟของ open base ซึ่งรองรับขนาด คอนเทกซ์ 262K โดยเปิดโหมดคิด (thinking) ตลอดเวลา แทนที่จะเป็นโหมดมัลติโมดัลขนาด ~1M โทเคนของโมเดลเรือธงที่โฮสต์ให้บริการ เพดานคอนเทกซ์นี้มีความสำคัญหากเวิร์กโหลดของคุณเน้นการใช้งานข้อมูลช่วงยาว: โหมดเต็มล้านโทเคนยังคงใช้ได้เฉพาะผ่าน Alibaba API เท่านั้น
สิ่งที่เส้นทาง DigitalOcean เพิ่มเติมนอกเหนือจากเรื่องภูมิศาสตร์ก็คือข้อมูลการให้บริการจริงชุดแรกจากผู้ให้บริการรายอื่นที่ไม่ใช่อาลีบาบา การวัดผลของ DigitalOcean เองต่อ production endpoint ของตน ซึ่งเก็บเมื่อวันที่ 12 สิงหาคม แสดงให้เห็นว่า prefill ขยายตัวเชิงเส้นที่ประมาณ 16,000 tokens/sec — หลักการคร่าวๆ คือ TTFT ≈ (input ÷ 16,000) + 0.7s ดังนั้นประมาณ 1.1s ที่ ~1,080 tokens และ ~15.8s ที่ ~254K — และปริมาณงานรวมสูงถึง ~1,937 output tokens/sec ที่ 256 คำขอพร้อมกัน โดยไม่มีข้อผิดพลาดและไม่พบจุดอิ่มตัว ตัวเลขเหล่านี้เป็นตัวเลขของ DigitalOcean จากการปรับใช้ของตัวเอง ไม่ใช่การทดลองเปรียบเทียบแบบควบคุม แต่เป็นข้อมูล latency และ concurrency ชุดแรกของโมเดลนี้นอกคลาวด์ของอาลีบาบา และตอบโจทย์ความกังวลเรื่อง "ละเอียดแต่ช้า" จากยุคพรีวิวโดยตรง
Qwen3.8-Max เปิดให้บริการบน OrcaRouter ในชื่อ qwen/qwen3.8-max และการรีเฟรชวันที่ 2 กันยายนสามารถกำหนดเส้นทางได้ภายใต้ id ตามวันที่ของตัวเอง — qwen/qwen3.8-max-0902 — ทั้งคู่อยู่ในอัตราค่าบริการปกติเดียวกันที่ $2.00 / $6.00 OrcaRouter ใช้มาร์กอัป 0% และส่งผ่านราคาของผู้ให้บริการตรงๆ ดังนั้นไม่ว่าจะใช้เส้นทางใดก็มีค่าใช้จ่ายเท่ากับการเชื่อมต่อโดยตรง เทเลเมทรีการให้บริการของเราเองปัจจุบันแสดงค่า p50 ของเวลาไปจนถึงโทเค็นแรกที่ 1.64 วินาที ในหน้าต่างเวลา 7 วัน นี่คือการวัดความหน่วงจากฝ่ายแรก ไม่ใช่การอ้างสิทธิ์จากผู้จำหน่าย และควรนำไปชั่งน้ำหนักเทียบกับรายงานในยุคพรีวิวที่ว่า "โมเดลที่ช้าที่สุดเท่าที่เคยใช้มา" ซึ่งรายงานเหล่านั้นมาจากผู้รีวิวเพียงคนเดียวที่รันงานสร้างแบบ agentic เป็นเวลาหนึ่งชั่วโมงบนโครงสร้างพื้นฐานพรีวิว และควรถูกนำไปทดสอบใหม่กับการให้บริการ GA แทนที่จะถูกกล่าวซ้ำเป็นข้อเท็จจริงในปัจจุบัน
คุณค่าเชิงปฏิบัติของเส้นทางเราเตอร์คือ Qwen3.8-Max อยู่เบื้องหลังเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เดียวกับที่โมเดลที่คุณรันอยู่แล้วใช้ ดังนั้นการประเมินจึงเป็นเพียงการเปลี่ยนสตริงโมเดล คุณสามารถส่งทราฟฟิกการผลิต 5% ไปให้มัน เปรียบเทียบกับโมเดลเดิมของคุณบนพรอมป์ที่เหมือนกัน และมีระบบสำรองไว้ ซึ่งเป็นท่าทีที่เหมาะสมพอดีสำหรับโมเดลที่ตารางข้อมูลจากผู้ขายยังไม่มีการยืนยันซ้ำ ท่าทีเดียวกันนี้เป็นวิธีที่ถูกต้องในการทดสอบการปรับใช้ DigitalOcean: รันทราฟฟิกส่วนหนึ่งเทียบกับมันโดยมีระบบสำรอง แทนที่จะเดิมพันเส้นทางการผลิตกับสแตกการให้บริการที่เพิ่งใช้งานได้สองสัปดาห์

ข้อจำกัดและความเสี่ยงที่ตรงไปตรงมา
• ตารางผู้ขายยังไม่ผ่านการตรวจสอบคะแนนอิสระออกมาแล้ว (AA Index 56) แต่ตารางเกณฑ์มาตรฐานของ Alibaba เองยังไม่ถูกทำซ้ำ และการวัดของ AA บ่งชี้ถึงการถดถอยของ Omniscience โดยมีอัตราการหลอนสูงถึง 40% การให้คะแนนอิสระช่วยได้ แต่ไม่ได้ทำให้ตารางผู้ขายสามารถตรวจสอบได้
• เส้นทางของ DigitalOcean คือฐานเปิด ไม่ใช่เรือธง โดยให้บริการ checkpoint ที่บริบท 262K, รองรับเฉพาะข้อความ, เปิดโหมดคิดเสมอ, ควอนไทซ์ด้วย NVFP4 — และคะแนน spot-check ของ DigitalOcean เองที่ทำได้ 88 บน GPQA Diamond เทียบกับ 92.6 ที่ Alibaba เผยแพร่ ซึ่งเป็นช่องว่างที่ DigitalOcean เรียกว่าบ่งชี้มากกว่าควบคุม หากคุณต้องการ API แบบมัลติโมดัลเต็มรูปแบบที่รองรับหนึ่งล้านโทเคน นั่นยังคงโฮสต์โดย Alibaba
• Qwen3.8-27B เปิดตัวแล้ว แต่ตัวเลข 27B นั้นเป็นชื่อที่ผู้ผลิตกำหนดเอง น้ำหนักของโมเดล 27B ถูกเผยแพร่เมื่อวันที่ 14 สิงหาคมภายใต้ Apache 2.0 ซึ่งเติมเต็มช่องว่างสำหรับการใช้งานภายในองค์กร — แต่ผลวัดประสิทธิภาพที่อ้างอิงเป็นเพียงข้อมูลที่ Alibaba รายงานเองและยังไม่มีการทดสอบซ้ำ รวมถึงโมเดล quantized ที่สร้างโดยชุมชนก็ยังคงทยอยเปิดตัว ณ ช่วงอัปเดตนี้
• ไลเซนส์แบบกำหนดเอง ไม่ใช่ Apache 2.0 ไลเซนส์ Qwen3.8-Max อนุญาตให้ใช้เชิงพาณิชย์ได้โดยต้องแสดงที่มา แต่มีเงื่อนไขสองระดับตามขนาด — ต้องแสดงชื่อโมเดลอย่างเด่นชัดเมื่อมีผู้ใช้รายเดือน (MAU) เกิน 100M หรือมีรายได้รายเดือนเกิน 20M ดอลลาร์สหรัฐ และต้องใช้ไลเซนส์แยกต่างหากสำหรับธุรกิจ MaaS/AI-Work-Assistant ที่มีรายได้รวม 12 เดือนย้อนหลังเกิน 50M ดอลลาร์สหรัฐ โปรดอ่านก่อนที่คุณจะเติบโตข้ามเกณฑ์เหล่านี้
• ความเยิ่นเย้อและการคลาดเคลื่อนจากคำสั่ง.IFBench 82.8 เป็นตัวเลขที่อ่อนที่สุดในตารางของ Alibaba เอง และผู้ทดสอบเวอร์ชันพรีวิวเห็นแบบจำลองเกินขอบเขตซ้ำแล้วซ้ำเล่า — โดยเพิ่มฟีเจอร์ที่ไม่มีการร้องขอ ตัวเลขของ AA เองตอนนี้ให้ตัวเลขที่ชัดเจน: 64 สเตปต่องาน GDPval-AA คือสิ่งที่ทำให้ต้นทุนพุ่งเป็น $1.14 ซึ่งสูงกว่า Kimi K3 ถึง 25% ดูดีในการสาธิต แต่แพงเมื่อคิดเงินเอาต์พุตที่ $6/1M และไม่เสถียรเมื่อคุณต้องการรูปแบบที่แม่นยำ
• ขีดจำกัดด้านเนื้อหา เช่นเดียวกับโมเดลระดับแนวหน้าอื่น ๆ ที่ให้บริการจากจีน คำตอบในหัวข้อที่อ่อนไหวทางการเมืองจะถูกจำกัด มีความเกี่ยวข้องหากผลิตภัณฑ์ของคุณรองรับคำถามแบบปลายเปิด
• โทเค็นการคิดคิดค่าบริการเป็นเอาต์พุต เมื่อเปิดใช้การใช้เหตุผล ต้นทุนจริงจะสูงกว่าประมาณการแบบคร่าวๆ วัดโดยกำหนดค่าการใช้เหตุผลตามวิธีที่คุณจะนำไปใช้งานจริง

คำถามที่พบบ่อย
ตอนนี้ Qwen3.8-Max พร้อมใช้งานหรือยัง?
ใช่ มันเปิดให้ใช้งานทั่วไปเมื่อวันที่ 3 สิงหาคม 2026 พร้อมกับเรตการ์ดที่เผยแพร่และ API ที่เข้ากันได้กับ OpenAI และ DashScope สแนปชอตการผลิตปัจจุบัน — Qwen3.8-Max-0902 ซึ่งเปิดตัวเมื่อวันที่ 2 กันยายน — ใช้งานบน API ของ QwenCloud และเป็นสิ่งที่เอนด์พอยต์มาตรฐาน qwen3.8-max ให้บริการอยู่ในขณะนี้ นี่คือการเปลี่ยนแปลงจากสถานะพรีวิวเมื่อวันที่ 19 กรกฎาคม ซึ่งการเข้าถึงถูกจำกัดเฉพาะ Qwen Chat, Qwen App และแคมเปญเครดิตของ Qoder
Qwen3.8-Max-0902 คืออะไร
Qwen3.8-Max-0902 คือเวอร์ชันรีเฟรชสำหรับการใช้งานจริง (production refresh) ของ Qwen3.8-Max เมื่อวันที่ 2 กันยายน 2026 โดยยังคงเป็นโมเดลเรือธงแบบ sparse-MoE ขนาด 2.4T พารามิเตอร์พร้อมบริบท 1M โทเคนเช่นเดิม แต่ผ่านการ post-train เพิ่มเติมในด้าน Coding และ Cowork และเปิดให้บริการบน API ของ QwenCloud ในราคาเดิมที่ $2/$6 ทาง Qwen ระบุว่าสแนปชอตใหม่นี้แข็งแกร่งขึ้นในงานระดับองค์กรและงานวิทยาศาสตร์ที่ซับซ้อน ซึ่งเป็นเพียงคำกล่าวอ้างจากผู้ผลิตที่ยังไม่ผ่านการวัดเทียบเคียงโดยอิสระ ขณะที่ในด้านการเขียนโค้ดกลับมีผลลัพธ์จากการวัดโดยอิสระอยู่แล้ว: อันดับ 1 บนกระดาน WebDev ของ Code Arena ด้วยคะแนน 1,691 และอยู่ในตำแหน่งสูงสุดของเส้น Pareto frontier ด้านความคุ้มค่าต่อต้นทุนที่อัตราเฉลี่ยรวม ~$5/MToken ตามการประกาศของ Alibaba เรื่องการติดอันดับอารีนาแบบสด (live arena) ซึ่งได้รับการยืนยันโดยบัญชี QwenCloud ของ Qwen เอง
Qwen3.8-Max ราคาเท่าไหร่
2.00 ดอลลาร์ต่อ 1M โทเคนอินพุต และ 6.00 ดอลลาร์ต่อ 1M โทเคนเอาต์พุต ในอัตราคงที่ตลอดบริบท 1M โทเคนเต็ม โดยไม่มีค่าธรรมเนียมเพิ่มเติมสำหรับพรอมป์ยาว การเข้าถึงอินพุตที่แคชไว้คิด 0.25 ดอลลาร์ต่อ 1M การสร้างแคชแบบชัดเจน 2.50 ดอลลาร์ และการอ่านแคช 0.17 ดอลลาร์ โทเคนการคิด (Thinking) คิดอัตราเดียวกับเอาต์พุต ในดัชนีความฉลาดของ Artificial Analysis ต้นทุนที่วัดได้ของโมเดลคือ 1.14 ดอลลาร์ต่องาน — ดูส่วน pricing ว่าทำไมจึงสูงกว่าการคำนวณโทเคน เส้นทางแบบ serverless ของ DigitalOcean ระบุราคาเดียวกันคือ 2/6 ดอลลาร์ โดยอินพุตที่แคชไว้ 0.20 ดอลลาร์
Qwen3.8-Max มีกี่พารามิเตอร์?
รวม 2.4 ล้านล้าน ในรูปแบบ Mixture-of-Experts แบบ sparse จำนวนพารามิเตอร์ที่ใช้งานจริง — ซึ่งเป็นตัวเลขที่กำหนดต้นทุนการให้บริการและความหน่วงจริง — ได้รับการยืนยันแล้วว่าอยู่ที่ 95 พันล้านที่เปิดใช้งาน ตามการ์ดโมเดลอย่างเป็นทางการของ Qwen3.8-2.4T-A95B (ผู้เชี่ยวชาญ 512 ตัว; ถูกเลือกเส้นทาง 10 ตัว บวกกับตัวที่ใช้ร่วมกันอีก 1 ตัวที่เปิดใช้งานต่อโทเคน)
น้ำหนักของโมเดล Qwen3.8-Max เปิดเผยหรือไม่?
ใช่ — ตั้งแต่วันที่ 12 สิงหาคม 2026 Qwen เผยแพร่ Qwen3.8-2.4T-A95B (BF16) และ Qwen3.8-2.4T-A95B-FP8 บน Hugging Face โดยแต่ละรุ่นมีไฟล์น้ำหนัก 213 ไฟล์ สัญญาอนุญาตเป็นแบบ Qwen3.8-Max ที่กำหนดขึ้นเอง (Hugging Face ระบุเป็น "other") ไม่ใช่ Apache 2.0: อนุญาตให้ใช้เชิงพาณิชย์โดยต้องระบุแหล่งที่มา และมีข้อกำหนดแบบสองระดับตามขนาด checkpoint แบบเปิดเป็นข้อความเท่านั้นโดยเปิดใช้การคิด (thinking) ตลอดเวลา; API ที่โฮสต์เพิ่มความสามารถด้านภาพ โหมดไม่คิด (non-thinking) แบบเลือกได้ และบริบทเต็ม 1M
Qwen3.8-Max ถูกทดสอบมาตรฐานโดยอิสระแล้วหรือยัง?
ใช่ — ณ วันที่ 6 สิงหาคม 2026 Artificial Analysis ให้คะแนน 56 ในดัชนีความฉลาด (Intelligence Index) ที่ราคา 1.14 ดอลลาร์ต่องาน โดยวัดจาก API อย่างเป็นทางการของอาลีบาบา: สูงกว่า Qwen3.7-Max (46) อยู่ 10 จุด เสมอ Claude Opus 4.8 (56) และตามหลัง Kimi K3 (57) อยู่ 1 จุด อย่างไรก็ตาม ตารางเปรียบเทียบด้านบนยังคงเป็นข้อมูลที่อาลีบาบาเป็นผู้รายงานและยังไม่มีการทำซ้ำการทดสอบ และกระดานผู้นำทั่วไปของ LMArena ก็ยังไม่มีคะแนนสาธารณะ สถานการณ์ในเวทีอิสระเปลี่ยนไปเมื่อวันที่ 2 กันยายน: รุ่นรีเฟรช 0902 เปิดตัวที่อันดับ 1 บนกระดาน Code Arena: WebDev ของแพลตฟอร์มเดียวกันด้วยคะแนน 1,691 จุด ซึ่งเป็นผลจากการโหวตแบบปกปิดโดยบุคคลที่สาม ไม่ใช่ตารางของอาลีบาบา และเส้นขอบด้านคุ้มค่าด้านต้นทุน (cost-performance frontier) ของ Code Arena ระบุว่ารุ่นนี้เป็นตัวเลือกที่ได้คะแนนสูงสุดบนกระดานที่ต้นทุนรวมประมาณ 5 ดอลลาร์ต่อล้านโทเคน การตรวจสอบแบบเฉพาะจุดของ DigitalOcean ต่อบิลด์แบบ quantized (ได้ 88 ใน GPQA Diamond) เป็นการตรวจสอบจากบุคคลที่สามครั้งแรกบนการใช้งานจริงที่ให้บริการ และระบุไว้อย่างชัดเจนว่าเป็นเพียงการชี้บอกแนวโน้ม ไม่ใช่การทดลองแบบมีการควบคุม ข้อควรระวังหนึ่งสำหรับคอลัมน์ "อิสระ": CommerceAgentBench ซึ่ง Qwen3.8-Max เป็นผู้นำในกลุ่มโมเดลโอเพนเวต ไม่ใช่ผู้ตัดสินอิสระคนที่สอง เพราะ Accio ผู้สร้างและเผยแพร่เป็นทีมงานของอาลีบาบาเอง
Qwen3.8-Max ดีกว่า Qwen3.7-Max ไหม?
จากตัวเลขของอาลีบาบาเอง อย่างมีนัยสำคัญ — FrontierSWE 73.5 เทียบกับ 40.7 และ DeepSWE 1.1 56.6 เทียบกับ 21.6 เกือบจะเพิ่มเป็นสองเท่าในงานวิศวกรรมซอฟต์แวร์ที่ยาก อีกทั้งยังถูกกว่ารุ่นก่อนหน้าที่ราคา $2.50/$7.50 โดยอิสระ AA ระบุว่าการกระโดดข้ามรุ่นอยู่ที่ 10 จุดบน Intelligence Index ของมัน (56 เทียบกับ 46) ข้อกล่าวอ้างของทั้งสองผู้ขายยังคงต้องได้รับการตรวจสอบบนเวิร์กโหลดของคุณ
ฉันสามารถโฮสต์ Qwen3.8-Max ด้วยตนเองได้ไหม?
ในทางปฏิบัติแล้วไม่สามารถทำได้ เซ็ตน้ำหนักเต็ม 2.4T มีขนาดประมาณ 4.9TB ในรูปแบบ BF16 และประมาณ 2.4TB ในรูปแบบ FP8 หรือราว 1.2TB ที่ความแม่นยำ 4-bit — เมื่อเทียบกับประมาณ 141GB ต่อ H200 หนึ่งตัว นั่นคือต้องใช้ GPU ระดับท็อปแปดตัวขึ้นไป ด้วยพารามิเตอร์ที่ถูกเรียกใช้งาน 95B ต่อโทเค็น ปริมาณการคำนวณต่อโทเค็นจึงค่อนข้างน้อยเมื่อเทียบกัน แต่พื้นที่หน่วยความจำที่ใช้ต่างหากคือข้อจำกัดหลัก การให้บริการ NVFP4 ของ DigitalOcean บน B300 คือข้อพิสูจน์เชิงปฏิบัติว่าโหมด 4-bit สามารถบรรจุโมเดลนี้ลงในโหนดเดียวได้ Qwen3.8-27B — ซึ่งรายงานว่าใช้ VRAM ประมาณ 17GB — คือตัวเลือก on-premise ที่สมจริง และค่าน้ำหนักของโมเดลเผยแพร่เมื่อวันที่ 14 สิงหาคม 2026 ภายใต้ Apache 2.0 — ตอนนี้ดาวน์โหลดได้จริง ไม่ใช่แค่คำมั่นสัญญา
Qwen3.8-27B คืออะไร
โมเดลขนาดเล็กกว่ามากที่ประกาศพร้อมกับเรือธง โดยวางตำแหน่งเป็นเส้นทางสำหรับการติดตั้งภายในองค์กรที่ใช้งานได้จริง เป็นโมเดลหนาแน่นขนาด 27B รองรับมัลติโมดัลโดยกำเนิด มีบริบทดั้งเดิม 262K โทเค็น ขยายได้ถึง 1M และเผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 น้ำหนักของโมเดลถูกอัปโหลดบน Hugging Face และ ModelScope เมื่อวันที่ 14 สิงหาคม 2026; Daniel Han จาก Unsloth รายงานว่าสามารถรันได้ใน VRAM ประมาณ 17GB — การ์ดระดับผู้บริโภคประสิทธิภาพสูงเพียงใบเดียว ข้อเรียกร้องด้านประสิทธิภาพมาจากการรายงานของ Alibaba และยังไม่มีการทดสอบซ้ำอย่างอิสระ
Qwen3.8-Max รองรับมัลติโมดัลหรือไม่?
ใช่ — มันรองรับอินพุตแบบข้อความ รูปภาพ และวิดีโอ และส่งคืนข้อความ นอกจากนี้ยังรองรับโหมดการคิด การเรียกใช้ฟังก์ชัน เครื่องมือในตัว และเอาต์พุตที่มีโครงสร้าง จุดตรวจสอบน้ำหนักแบบเปิดเป็นข้อความเท่านั้น อินพุตแบบมัลติโมดัลเป็นคุณสมบัติของ API ที่โฮสต์ ซึ่งเส้นทาง DigitalOcean ไม่ได้รองรับ
Qwen3.8-Max มีให้ใช้งานบน DigitalOcean หรือไม่?
ใช่ — ตั้งแต่วันที่ 14 สิงหาคม 2026 DigitalOcean Serverless Inference ให้บริการ checkpoint แบบ open-weights (NVFP4 บน NVIDIA HGX B300) ในราคา $2.00/$6.00 ต่อ 1M โทเค็น โดยมี cached input ราคา $0.20, บริบท 262K โทเค็น, รองรับเฉพาะข้อความ, และเปิดใช้การคิดตลอดเวลา Alibaba เรียก DigitalOcean ว่าเป็น "Day 0 launch partner" ของตน; ตัวลิสติ้งเองเป็นของ DigitalOcean และเป็นอิสระจากถ้อยคำดังกล่าว ตัวเลขที่ DigitalOcean วัดได้: prefill ~16K โทเค็น/วินาที และ ~1,937 โทเค็นเอาต์พุต/วินาที ที่คำขอพร้อมกัน 256 รายการ โดยไม่มีข้อผิดพลาด
ฉันสามารถใช้ Qwen3.8-Max ผ่าน OrcaRouter ได้ไหม?
ใช่แล้ว มันเปิดให้บริการแล้วในชื่อ qwen/qwen3.8-max และสแนปชอตเมื่อวันที่ 2 กันยายนก็มี id ตามวันที่ของตัวเอง — qwen/qwen3.8-max-0902 — ในราคาลิสต์เดียวกันคือ $2.00/$6.00 โดยไม่มีมาร์กอัป (0%) การจัดเส้นทางมีค่าใช้จ่ายเท่ากับการเชื่อมต่อโดยตรง ผ่าน endpoint ที่รองรับ OpenAI ซึ่งคุณใช้อยู่แล้ว เทเลเมทรี 7 วันของเราแสดงค่า p50 ของเวลา time-to-first-token ที่ 1.64 วินาที
วันนี้ฉันควรย้ายทราฟฟิกโปรดักชันไปที่มันไหม?
ไม่ใช่การเปลี่ยนแปลงแบบยกชุด ราคาและคะแนนการประเมินอิสระครั้งแรกทำให้การประเมินอย่างจริงจังมีต้นทุนต่ำและคุ้มค่าที่จะทำในตอนนี้ แต่ด้วยต้นทุนต่องานที่สูงกว่า Kimi K3 ถึง 25% การเคลื่อนไหวที่มีวินัยคือการแบ่งทราฟฟิกเทียบกับระบบปัจจุบันของคุณบนพรอมพ์ที่เหมือนกัน โดยมีตัวสำรองเตรียมไว้ — ไม่ใช่การย้ายระบบ เส้นทาง DigitalOcean เพิ่มดีพลอยเมนต์แบบมีการจัดการชุดที่สองเพื่อทดสอบเปรียบเทียบ ซึ่งทำให้การประเมินยิ่งถูกลงไปอีก
บรรทัดล่าง
Qwen3.8-Max ใช้เวลาสองสัปดาห์ในฐานะโมเดลที่น่าสนใจที่สุดที่ไม่มีใครซื้อได้ เมื่อถึง GA มันกลับเป็นข้อเสนอที่แตกต่างอย่างแท้จริง: ราคาคงที่ $2/$6 ต่อล้านโทเคนคือการตั้งราคาที่รุกแรง อัตราค่าแคชทำให้งานเอเยนต์แบบวนซ้ำมีต้นทุนต่ำ และการก้าวกระโดดข้ามเจเนอเรชันบน FrontierSWE และ DeepSWE — ถ้าผลลัพธ์เกิดซ้ำได้ — ทำให้มันเป็นโมเดลเขียนโค้ดจริง ไม่ใช่แค่การอวดสเกล การปล่อย open weights ภายใต้ไลเซนส์จริงในวันที่ 12 สิงหาคม ทำให้คำว่า "open weights coming" เปลี่ยนจากคำสัญญาเป็นข้อเท็จจริง ส่วนช่องทาง DigitalOcean แบบ day-zero ที่ประกาศเมื่อวันที่ 14 สิงหาคม — พร้อมตัวเลขการให้บริการที่วัดผลจริงและค่าอ่านแคช $0.20 — ทำให้เหตุผลที่จะ "ลองใช้ในราคาถูก" แข็งแกร่งขึ้น และทำให้ทีมต่าง ๆ มีการปรับใช้ผ่านผู้ให้บริการบุคคลที่สามแบบมีการจัดการ เพื่อนำไปเทียบเคียงกับ API ของ Alibaba เอง การรีเฟรช Qwen3.8-Max-0902 ในวันที่ 2 กันยายนทำให้แนวคิดหลักนั้นยังคงเดิม: ราคา $2/$6 และบริบท 1M เท่าเดิม พร้อมเพิ่ม post-training ในด้านการเขียนโค้ดและการทำงานร่วมกัน ซึ่งโมเดลถูกวางตำแหน่งไว้เพื่อสิ่งนี้อยู่แล้ว การรีเฟรชยังเพิ่มกระดานคะแนนอิสระที่วัดความชอบของมนุษย์สำหรับจุดขายด้านการเขียนโค้ดนั้น โดย Qwen3.8-Max-0902 เปิดตัวที่อันดับ 1 บนกระดาน WebDev ของ Code Arena ด้วยคะแนน 1,691 นำหน้า Claude Opus 5 และ Kimi K3 และด้วยต้นทุนรวมเฉลี่ยประมาณ $5 ต่อล้านโทเคน มันจึงเป็นโมเดลที่ได้คะแนนสูงสุดบนเส้นแนวพาเรโตด้านความคุ้มค่าระหว่างราคากับประสิทธิภาพของกระดานนั้น ผลลัพธ์ CommerceAgentBench ที่ทีม Accio ของ Alibaba เผยแพร่ในสัปดาห์เดียวกัน — Qwen3.8-Max เป็นผู้นำในกลุ่ม open weights บนเบนช์มาร์กที่สร้างจากเวิร์กโฟลว์พาณิชย์จริง — ทำให้แนวคิดเรื่องการทำงานร่วมกันนั้นมีกระดานคะแนนที่เป็นรูปธรรมเป็นของตัวเอง แม้จะเป็นการดำเนินการโดยผู้ขายเองก็ตาม
สิ่งที่เปลี่ยนไปคือทั้งผู้ตัดสิน (referee) และน้ำหนักของโมเดล (weights) ต่างก็ลงจอดเรียบร้อยแล้ว — และผลตัดสินโดยรวมออกมาดี แต่มี asterisk จริง ๆ อยู่ AA ให้คะแนน Qwen3.8-Max อยู่ที่ 56 บน Intelligence Index ซึ่งเป็นการก้าวกระโดดข้ามเจนเนอเรชันอย่างแท้จริง อยู่ในระดับเดียวกันกับ Claude Opus 4.8 ทว่าสกอร์การ์ดใบเดียวกันกลับแสดงว่า Kimi K3 นำอยู่ 1 คะแนน ด้วยต้นทุนต่องานที่ต่ำกว่า 25% และยังชี้ให้เห็นคะแนน Omniscience ร่วง 10 จุดจากอัตราการหลอนประสาท (hallucination) ที่เพิ่มขึ้น คำถามเรื่องพารามิเตอร์ที่เปิดใช้งาน (active parameters) ได้ข้อยุติแล้ว — เปิดใช้งาน 95B ยืนยันบนโมเดลการ์ด — และใบอนุญาตก็เผยแพร่ออกมาแล้ว โดยเป็นแบบกำหนดเอง (custom) ไม่ใช่ Apache 2.0 สิ่งที่ยังไม่เปลี่ยน: ตาราง benchmark ของ Alibaba เองยังไม่มีผู้ทำซ้ำ ต้นทุนต่องานยังสูงอยู่เพราะโมเดลต้องไล่ประมวลผลหลายขั้นตอน โมเดลฐานเปิดที่ให้บริการบน DigitalOcean เป็นโมเดลที่ต่างจากตัวเลขหลักของรุ่นธงเล็กน้อย (262K context, NVFP4, GPQA spot-check 88 เทียบกับ 92.6) และข้อกล่าวอ้างด้าน benchmark ของ Qwen3.8-27B เป็นตัวเลขที่ผู้ผลิตรายงานเอง แม้น้ำหนักของโมเดลจะเผยแพร่ออกไปแล้วก็ตาม การรวมปัจจัยแบบนี้ไม่ได้ทำให้ Qwen3.8-Max เป็นตัวเลือกที่แย่ — ในราคาระดับนี้มันแทบจะเป็นการทดลองที่ต้องทำ — แต่มันหมายความว่าท่าทีที่ถูกต้องคือประเมินอย่างจริงจัง จัดเส้นทางอย่างมีวิจารณญาณ และมีแผนสำรองไว้เสมอ ประเด็นที่ต้องจับตาตอนนี้คือ จำนวนขั้นตอนแบบ agentic ที่อยู่เบื้องหลังต้นทุน 1.14 ดอลลาร์ต่องาน จะเป็นสิ่งที่เวิร์กโหลดของคุณรับไหวหรือไม่ คะแนนนำใน Code Arena: WebDev ของบิลด์ 0902 จะคงอยู่หรือไม่เมื่อเสียงโหวตเพิ่มขึ้นเรื่อย ๆ ผลลัพธ์ด้าน Coding และ Cowork จะเกิดขึ้นซ้ำบนเวิร์กโหลดจริงได้หรือไม่ ตำแหน่งผู้นำในกลุ่ม open-weight บน CommerceAgentBench — ซึ่งผ่านการวัดรวมสองครั้งบนแฮร์เนสของ Alibaba เอง — จะอยู่รอดในการรันโดยอิสระหรือไม่ ข้อกล่าวอ้างด้าน benchmark ของโมเดล 27B จะยังยืนหยัดได้ไหม และ throughput ที่วัดได้ของดีพลอยเมนต์บน DigitalOcean จะคงอยู่ภายใต้ทราฟฟิกจริงหรือไม่ — เพราะสิ่งเหล่านี้จะเป็นตัวตัดสินว่า "รองเพียง Fable 5" คือการวางตำแหน่งหรือคำทำนาย

การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
