
Qwen3.8 Max Prime: Alibaba วางบัตรราคาระดับรองไว้ข้าง flagship ของตัวเอง
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 584 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
เมื่อวันที่ 22 กันยายน 2026 ณ การประชุม Yunqi ที่เมืองหางโจว สายธุรกิจ MaaS ของ Alibaba ได้ประกาศระดับการให้บริการที่เรียกว่า Prime mode — 优速模式 — และเพิ่มรหัสรุ่นใหม่ลงในตารางราคาสำหรับบริการนี้: qwen3.8-max-prime รหัสดังกล่าวไม่ใช่โมเดลใหม่ แต่เป็น Qwen3.8-Max ซึ่งเป็นโมเดลเรือธงแบบ sparse mixture-of-experts ที่มีพารามิเตอร์ 2.4 ล้านล้าน พร้อมให้บริการทั่วไปเมื่อ 3 สิงหาคม 2026 โดยส่งมอบผ่านช่องทางที่เร็วกว่า Qwen3.8 Max Prime ใช้น้ำหนักชุดเดียวกัน หน้าต่างบริบทเดียวกัน เครื่องมือเดียวกัน และขีดจำกัดการใช้งานเดียวกันกับโมเดลพื้นฐาน สิ่งที่แตกต่างคืออัตราทรูพุตและราคา โดยราคาสูงขึ้นประมาณสองเท่า
นี่เป็นครั้งที่สองในเจ็ดสัปดาห์ที่ Alibaba เปลี่ยนวิธีจำหน่าย Qwen3.8-Max โดยไม่เปลี่ยนว่ามันคืออะไร เมื่อวันที่ 2 กันยายน บริษัทได้ปล่อยรีเฟรชที่ผ่านการฝึกเพิ่มเติมซึ่งใช้ชื่อรุ่นว่า Qwen3.8-Max-0902 โดยเน้นงานเขียนโค้ดและงานแบบเอเจนต์ ให้ใช้ผ่าน API เท่านั้น วันที่ 22 กันยายนเพิ่มระดับความเร็ว ทั้งสองไม่ใช่การเปิดตัว และการตีความว่าสิ่งใดสิ่งหนึ่งเป็นการเปิดตัวจะทำให้คุณเสียเงิน

Prime mode จริงๆ แล้วคืออะไร
เอกสารของ Alibaba เองอธิบายโหมด Prime ว่าเป็นช่องทางสำหรับ "สถานการณ์ที่ไวต่อความเร็วเอาต์พุต" — ผู้ช่วยเขียนโค้ดด้วย AI, การให้เหตุผลของเอเจนต์แบบหลายขั้นตอน, การสนทนาแบบเรียลไทม์ — และระบุประโยชน์อย่างตรงไปตรงมา: TPS ถูกเพิ่มขึ้นเป็น 1.5 ถึง 2 เท่าของ API มาตรฐาน ไม่มีพารามิเตอร์ใหม่ให้ตั้งค่า คุณเปลี่ยนค่าโมเดลเป็น Prime ID แล้วคุณก็อยู่บนเลนเร็ว
เอกสารก็ระบุอย่างชัดเจนเช่นเดียวกันเกี่ยวกับสิ่งที่ไม่เปลี่ยนแปลง: "ความสามารถที่โมเดลรองรับและข้อจำกัดการใช้งานนั้นเหมือนกับโมเดลต้นฉบับ" ดังนั้นจึงไม่มีบริบทที่ใหญ่กว่า ไม่มีโหมดการให้เหตุผลที่ดีกว่า ไม่มีพื้นผิวเครื่องมือเพิ่มเติม มันเป็นสแตกการให้บริการเดียวกันที่มีความจุสำรองอยู่เบื้องหลังมากขึ้น
The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.
เรทการ์ด อ่านให้ดี
หน้าราคาระหว่างประเทศของ Alibaba แสดง ID ทั้งสองไว้เคียงข้างกัน ซึ่งทำให้การเปรียบเทียบชัดเจนเป็นพิเศษ ต่อหนึ่งล้านโทเคน:
• อินพุต — qwen3.8-max-prime $3.301 เทียบกับ qwen3.8-max $1.65
• เอาต์พุต — qwen3.8-max-prime $9.902 เทียบกับ qwen3.8-max $4.951
• แคชฮิต — qwen3.8-max-prime $0.413 เทียบกับอัตราการอ่านแคชบน ID มาตรฐานที่หน้าเดียวกันแสดงเป็นบรรทัดส่วนลด
• อัตราส่วน — 2.0× ทั้งอินพุตและเอาต์พุต ไม่ใช่ค่าประมาณที่ปัดเศษ แต่เป็นเลขคณิตตามตัวอักษรของตัวเลขที่เผยแพร่
ในตารางราคาสำหรับจีน อัตราส่วน 2× เดียวกันนี้ใช้กับเงินหยวนเช่นกัน: ¥24 สำหรับอินพุต และ ¥72 สำหรับเอาต์พุตต่อล้านสำหรับ Prime ID เทียบกับ ¥12 และ ¥36 สำหรับรุ่นมาตรฐาน โดยแคชฮิตอยู่ที่ ¥3
ตัวเลขเปิดตัวที่ถูกอ้างอิงกันอย่างกว้างขวางสำหรับ Qwen3.8-Max คือ $2 สำหรับอินพุต และ $6 สำหรับเอาต์พุตต่อล้าน นั่นคือพาดหัวที่การรายงานข่าวในเดือนสิงหาคมใช้ และไม่ใช่ตัวเลขบนตารางอัตราค่าบริการระหว่างประเทศในวันนี้ หากคุณกำลังสร้างแบบจำลองค่าใช้จ่าย ให้ใช้ตารางอัตราค่าบริการสำหรับภูมิภาคของคุณแทนพาดหัวตอนเปิดตัว และตรวจสอบอีกครั้งก่อนที่คุณจะตัดสินใจ — Alibaba ได้แก้ไขหน้านี้สองครั้งนับตั้งแต่วันที่ 2 กันยายน

กฎการจำกัดอัตราคือฟีเจอร์ที่แท้จริง
บรรทัดที่คนส่วนใหญ่มองข้ามไป คือบรรทัดที่สำคัญที่สุดสำหรับการใช้งานจริง เอกสาร Prime ของ Alibaba ระบุว่า เมื่อการใช้งานของคุณถึงขีดจำกัดอัตราแล้ว หากแพลตฟอร์มยังมีทรัพยากรเหลืออยู่ คุณจะไม่ถูกจำกัดความเร็ว ดังนั้นปริมาณงานที่คุณใช้ได้จริงจะไม่ต่ำลงไปกว่าขีดจำกัดที่ระบุไว้
นั่นคือเพดานแบบอ่อนที่มีพื้นแบบแข็ง ซึ่งเป็นรูปร่างที่แตกต่างจากขีดจำกัดระดับมาตรฐาน โดยหมายความว่าตัวเลข 1.5–2× นั้นเป็นคำสัญญาเกี่ยวกับพื้น ไม่ใช่การจำกัดเพดาน: ภายใต้การแย่งชิงทรัพยากร คุณจะได้ขีดจำกัด และภายใต้กำลังว่าง คุณจะได้มากกว่า สำหรับลูปของเอเจนต์ที่ยิงคำขอต่อเนื่องกันหลายสิบครั้ง ความไม่สมมาตรนั้นมีค่ามากกว่าตัวคูณ TPS ดิบ เพราะเป็นความหน่วงหางของการเรียกที่ช้าที่สุดที่กำหนดว่าขั้นตอนการทำงานของคุณจะเสร็จสิ้นหรือไม่
ขีดจำกัด TPM แบบไดนามิกของโมเดลมาตรฐานจะแบ่งเป็นระดับตามค่าใช้จ่ายรายเดือนใน Model Studio — เอกสารชุดเดียวกันแสดง ID พื้นฐาน qwen3.8-max ที่ 5,000,000, 10,000,000 และ 20,000,000 TPM ในแต่ละระดับ โดยรีเฟรชทุกเดือน Prime ไม่ได้ขจัดโครงสร้างนั้น แต่เปลี่ยนว่ามันจะส่งผลอย่างไร

สิ่งที่ยังไม่มีใครเคยวัด
นี่คือช่องว่างที่ตรงไปตรงมา ตัวเลข 1.5–2× นั้นเป็นข้อมูลที่ผู้ขายระบุเอง เราไม่พบการวัดอัตราการประมวลผลในโหมด Prime ที่เป็นอิสระเลย และนั่นสำคัญ เพราะตัวเลขที่เป็นอิสระของบิลด์มาตรฐานเองก็ไม่ได้ดูดีนักในเรื่องความเร็ว
Artificial Analysis ซึ่งวัดโมเดลด้วยชุดทดสอบของตนเอง ปัจจุบันให้คะแนน Qwen3.8-Max บนบิลด์ 0902 ที่ดัชนีความฉลาด 45 โดยมี GPQA Diamond อยู่ที่ 92.8%, Terminal-Bench Hard ที่ 38.9% และ Humanity's Last Exam ที่ 43.1% — พร้อมระบุต้นทุนต่องานที่วัดได้ไว้ที่ $5.41 นี่เป็นตัวเลขอิสระบน SKU มาตรฐาน ซึ่งเก็บข้อมูลเมื่อ 2026-09-24 และยังเป็นเครื่องเตือนใจว่าดัชนีนี้ได้รับการปรับปรุงใหม่นับตั้งแต่การรายงานช่วงเปิดตัวในเดือนสิงหาคม ดังนั้นอย่านำค่าดัชนีเก่าไปวางเทียบกับค่าใหม่ในปัจจุบันแล้วเรียกมันว่าเป็นแนวโน้ม
สิ่งที่ AA ไม่มีคือแถว Prime จนกว่าจะมีใครวัดมัน คำกล่าวอ้างเรื่องความเร็วจึงเป็นของ Alibaba แต่เพียงผู้เดียว และท่าทีที่ถูกต้องคือการทดสอบกับเวิร์กโหลดของคุณเอง แทนที่จะสันนิษฐานว่าอยู่ในระดับสูงสุดของช่วง
สิ่งนี้ทำให้การตัดสินใจด้านการกำหนดเส้นทางอยู่ตรงไหน
Prime เป็นระดับ (tier) ที่ Alibaba ขายบน API ของตัวเอง และที่นั่นเป็นที่เดียวที่จะได้มา เราที่นี่ไม่ได้โฮสต์ qwen3.8-max-prime สิ่งที่ OrcaRouter ให้บริการคือรุ่นมาตรฐาน Qwen3.8-Max และพินที่ระบุวันที่ Qwen3.8-Max-0902 โดยทั้งคู่อยู่บนคีย์เดียวกับสมาชิกอื่น ๆ ในตระกูล Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — พร้อมกับโมเดลอื่น ๆ อีกกว่า 200 รายการ โดยส่งผ่านราคาตามรายการของผู้ให้บริการที่มาร์กอัป 0% ส่วนหลังนี้คือเหตุผลที่การรีเฟรชเมื่อวันที่ 2 กันยายน และการเปลี่ยนแปลงอัตราของ Max ในอนาคตไม่ว่าจะเมื่อใด จะมีผลฝั่งเราในวันเดียวกับที่มีผลฝั่ง Alibaba
การแยกการใช้งานจริงมีหน้าตาแบบนี้ รันทราฟฟิกเริ่มต้นของคุณบน ID มาตรฐานผ่านเราเตอร์ โดยที่กลไก failover จะช่วยปกป้องคุณหากเส้นทางของผู้ให้บริการเพียงเส้นทางเดียวเสื่อมคุณภาพ ย้ายการเรียกเฉพาะที่ความหน่วงตามเวลาจริงคือผลิตภัณฑ์ — การตอบกลับแบบโต้ตอบ ขั้นตอนเอเจนต์ที่รัดกุม — ไปยัง Prime และคิดต้นทุนการตัดสินใจนั้นเทียบกับ 2× แทนที่จะเทียบกับ 1.5×
ใครควรเปลี่ยน และใครควรรอ
สลับไปใช้หากผู้ใช้ของคุณกำลังรอโทเค็นอยู่: การเติมข้อความอัตโนมัติ หนึ่งรอบการสนทนาในแชต ลูปแก้ไขโค้ดที่มีมนุษย์คอยเฝ้าดูอยู่ ที่ปลายบนของช่วงความเร็ว Prime มีต้นทุนเป็นกลางต่อทุกวินาทีของความหน่วงที่ลดลง — คุณจ่ายเป็นสองเท่าพอดีเพื่อแลกกับเวลาที่ลดลงครึ่งหนึ่งพอดี ที่ปลายล่างของช่วง คุณกำลังจ่าย 2× เพื่อแลกกับ 1.5× ซึ่งคิดเป็นเบี้ยเพิ่ม 33% ต่อวินาทีที่ประหยัดได้ หากงานของคุณเป็นงานแบบแบตช์ที่รันข้ามคืน เบี้ยเพิ่มนั้นไม่ได้ซื้ออะไรที่คุณต้องการเลย
เดี๋ยวก่อน ถ้าโมเดลต้นทุนของคุณอิงจากพาดหัวเปิดตัว $2/$6 หรือถ้าคำขอของคุณเน้นอินพุตเป็นหลัก ข้ออ้างเรื่องความเร็วของผู้ขายเป็นเรื่องของ TPS — โทเค็นเอาต์พุตต่อวินาที — และ prefill เป็นขั้นตอนไปป์ไลน์ที่แตกต่างกัน คำขอแบบบริบทยาวจ่ายแพงเป็นสองเท่าในโทเค็นอินพุต ไม่ว่าผลลัพธ์จะมาถึงเร็วขึ้นหรือไม่ก็ตาม วัดกรณีนั้นก่อนที่คุณจะย้ายมัน
และตรวจสอบวันที่บนเรตการ์ดของคุณ Qwen3.8-Max วางตลาดมาตั้งแต่ 3 สิงหาคม ถูกรีเฟรชหนึ่งครั้ง และถูกแพ็กเกจใหม่หนึ่งครั้ง แต่ก็ยังมีอายุเพียงเจ็ดสัปดาห์ สิ่งที่เป็นข่าวคือเทียร์ ไม่ใช่ตัวโมเดล
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
