การ์ดชื่อเรื่องหลักสำหรับ 'Qwen3.8-Max vs Qwen3.7-Max' พร้อมคำโปรย 'สองระดับ Max, 16 จุดดัชนี และโปรโมชันที่พลิกราคา' และส่วนท้ายระบุว่าตัวเลขของ Qwen3.8-Max มาจากการเปิดเผยข้อมูลของ Alibaba เมื่อวันที่ 22 ก.ย. 2026 และ Artificial Analysis ส่วนตัวเลขของ Qwen3.7-Max มาจาก Artificial Analysis
Guides & Insights

Qwen3.8-Max vs Qwen3.7-Max: สองระดับ Max, 16 คะแนนดัชนี และโปรโมชันที่พลิกราคา

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สี่วันก่อน ผู้ขายบอกเราว่า Qwen3.8-Max ไม่ใช่โมเดลที่พวกเขาจัดส่งในเดือนสิงหาคม ในข่าวประชาสัมพันธ์ลงวันที่ 22 กันยายน 2026 จากงาน Apsara Conference ในหางโจว บริษัทเปิดเผยว่าเรือธงของบริษัทเสร็จสิ้น 33 รอบการทำซ้ำ ของงานฝึกอบรมและหลังการฝึกอบรมแบบอัตโนมัติเต็มรูปแบบเป็นเวลากว่าหนึ่งเดือน และบิลด์ที่ได้นั้นดันดัชนี Artificial Analysis Intelligence Index ของมัน จาก 40 เป็น 45 ID ของโมเดลไม่เคยเปลี่ยน ตัวเลขที่อยู่เบื้องหลังมันต่างหากที่เปลี่ยน

เรื่องนี้สำคัญที่สุดในจุดหนึ่งโดยเฉพาะ: การเปรียบเทียบระหว่าง Qwen3.8-Max กับ Qwen3.7-Max ซึ่งเป็นระดับ Max ที่มันเข้าไปแทนที่ Qwen3.8-Max เปิดให้ใช้งานทั่วไปเมื่อ 3 สิงหาคม 2026; ส่วน Qwen3.7-Max เปิดตัวใน พฤษภาคม หากดูจากเอกสารแล้ว นี่ดูเหมือนเป็นการตัดสินใจข้ามรุ่นที่ง่ายดาย — เรือธงใหม่กว่า คะแนนสูงกว่า ก็ไปต่อได้เลย แต่ตัวเลขกลับบอกอะไรที่ชวนอึดอัดกว่าเดิม ระดับรุ่นเก่าเร็วกว่า 3 ถึง 4 เท่า ต้นทุนต่อหนึ่งงานที่ทำสำเร็จถูกกว่าราว 5 เท่า และเทียบเท่ากับรุ่นใหม่บนแบบทดสอบวัดความรู้ล้วน ๆ ส่วนรุ่นใหม่รองรับมัลติโมดัล ทำงานเชิงเอเจนต์ได้ดีขึ้นอย่างมาก และถูกกว่าตามอัตราค่าสากล จะเลือกเรียกใช้ตัวไหนจึงขึ้นอยู่กับคำถามที่การเปรียบเทียบส่วนใหญ่มองข้ามไป: คุณกำลังซื้อความรู้ หรือกำลังซื้อการเรียกใช้เครื่องมือ

สิ่งที่การเปิดเผยของ Apsara กล่าวอ้างจริง ๆ

การเปิดเผยนี้เป็นแถลงการณ์ของผู้ขาย ซึ่ง Alibaba เผยแพร่บนเว็บไซต์ข่าวของบริษัทเอง และควรอ่านในฐานะแถลงการณ์ของผู้ขาย สิ่งที่ระบุไว้มีความเฉพาะเจาะจง: ตลอดระยะเวลากว่าหนึ่งเดือนของการทำงานอัตโนมัติเต็มรูปแบบ ซึ่งครอบคลุมการออกแบบไปป์ไลน์ การตรวจสอบความถูกต้องของข้อมูล การทดลองซ้ำ และการวินิจฉัยข้อผิดพลาด Qwen3.8-Max เสร็จสิ้น 33 รอบ และการปรับแต่งการฝึกอบรมแบบอัตโนมัติพร้อมเทคนิคหลังการฝึกอบรมทำให้เกิดการเปลี่ยนแปลงของคะแนน Alibaba ยังได้อธิบายถึงการทดลองที่สองในการออกแบบชิป ซึ่งโมเดลได้ดำเนินการพัฒนาตนเองมากกว่า 60 ชั่วโมงตลอดวงจรชีวิตการออกแบบ เรียกใช้เครื่องมือ EDA มากกว่า 10,000 ครั้ง และผลิตโมดูลบัสชิประดับการผลิต ขณะเดียวกันก็ลดพื้นที่ชิปได้ 42% โดยไม่มีการระบุถึงการลดทอนประสิทธิภาพ ทั้งหมดนี้เป็นคำบอกเล่าของ Alibaba เกี่ยวกับโมเดลของตัวเอง ซึ่งยังไม่ถูกทำซ้ำโดยบุคคลภายนอกบริษัท

การขยับของคะแนนนั้นเองไม่ได้เป็นคำกล่าวอ้างของผู้ขาย ดัชนีนี้เป็นของ Artificial Analysis และคะแนน 45 อยู่บนหน้า Qwen3.8 Max (0902) ของบุคคลที่สามรายนั้น ส่วนคะแนน 40 ที่มันขยับขึ้นมานั้นอยู่ในหน้าขององค์กรเดียวกันสำหรับบิลด์วันที่ 3 สิงหาคม ซึ่งตอนนี้ถูกทำเครื่องหมายว่าเลิกใช้แล้วและชี้ไปยังเวอร์ชันปัจจุบัน ดังนั้นส่วนต่างนี้จึงเป็นสาเหตุที่ผู้ขายรายงาน ซึ่งผูกกับผลลัพธ์ที่ถูกให้คะแนนอย่างอิสระ นับเป็นจุดยืนที่แข็งแรงกว่าการมีเพียงครึ่งใดครึ่งหนึ่ง และ ณ เวลาที่เขียนนี้ มันยังเป็นหลักฐานสาธารณะที่ชัดเจนที่สุดเท่าที่มีว่า ห้องปฏิบัติการแนวหน้าแห่งหนึ่งได้ขยับความสามารถที่วัดได้ของเรือธง โดยไม่ต้องออกเลขเวอร์ชันใหม่

อีกสองเรื่องเกี่ยวกับการเปิดตัวครั้งนี้เป็นสิ่งที่มองข้ามได้ง่าย และทั้งสองอย่างล้วนเป็นแกนสำคัญ อย่างแรก Alibaba ยืนยันว่า Qwen 4กำลังอยู่ระหว่างการฝึก โดยซีรีส์ Qwen 4.5 และ Qwen 5 คาดว่าจะขยายไปถึง 5–10 ล้านล้านพารามิเตอร์ อย่างที่สอง มีสแนปช็อตที่ระบุวันที่ของโมเดลเวอร์ชันปรับปรุงใหม่ Alibaba ปักหมุดบิลด์หลังการฝึกเป็น qwen3.8-max-0902 เมื่อวันที่ 2 กันยายน และสามารถกำหนดเส้นทางแยกต่างหากได้ การปักหมุดนี้คือคำตอบเชิงปฏิบัติสำหรับทุกสิ่งที่การเปิดเผยเกี่ยวกับ RSI บ่งชี้ และเราจะกลับมาพูดถึงเรื่องนี้

กระดานคะแนน

หกมิติ ทั้งสองด้าน โดยคงความเข้มงวดด้านการระบุแหล่งที่มาไว้อย่างชัดเจน เพราะสองคอลัมน์นั้นไม่ได้ผ่านการตรวจสอบยืนยันมาอย่างเท่าเทียมกัน

• หน้าต่างบริบท — Qwen3.8-Max 1,000,000 โทเคน เทียบกับ Qwen3.7-Max 1,000,000 โทเคน (เหมือนกัน)

• เอาต์พุตสูงสุด — 131,072 โทเค็น เทียบกับ 131,072 โทเค็น ตามหน้าข้อมูลโมเดลของ Alibaba เอง (เหมือนกัน; โปรดทราบว่าหน้าแคตตาล็อกของเราสำหรับ Qwen3.7-Max ระบุ 64,000 ซึ่งเป็นความขัดแย้งที่เราแจ้งให้ทราบแทนที่จะกลบเกลื่อน)

• รูปแบบการป้อนข้อมูล — ข้อความ รูปภาพ และวิดีโอ เทียบกับข้อความเท่านั้น

• ราคาตามรายการสากลต่อ 1M โทเคน — $2.00 ขาเข้า / $6.00 ขาออก เทียบกับ $2.50 ขาเข้า / $7.50 ขาออก; บัตรราคาเดียวกันนี้คิดกับทั้งสองโมเดลที่ $1.65 / $4.951 อยู่แล้วในปักกิ่ง แฟรงก์เฟิร์ต และเวอร์จิเนีย

• Artificial Analysis Intelligence Index — 45 เทียบกับ 29

• ความเร็วเอาต์พุตอิสระ — 39.7 โทเคน/วินาที เทียบกับ 211.3 โทเคน/วินาที วัดเทียบกับกลุ่มการเปรียบเทียบโมเดล 211 รุ่นเดียวกัน โดย Artificial Analysis ให้เกรดว่ารุ่นใหม่ช้ากว่าอย่างเห็นได้ชัด และรุ่นเก่าเร็วกว่าอย่างเห็นได้ชัด

สองแถวสุดท้ายคือเนื้อหาทั้งหมดของบทความ ในตระกูลดัชนีเดียวกัน ระดับที่ใหม่กว่านำอยู่ 16 คะแนน แต่ในด้านความเร็ว กลับตามหลังอยู่มากกว่าห้าเท่า

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

16 คะแนนมาจากไหน — และไม่ได้มาจากไหน

แยก Index ออกเป็นส่วน ๆ แล้วรูปแบบของการอัปเกรดจะชัดเจนขึ้น และมันไม่ใช่รูปแบบที่การตลาดบอกเป็นนัยไว้

ในด้านความรู้และการให้เหตุผล โมเดลทั้งสองเสมอกันในทางปฏิบัติ GPQA Diamond: 92.8 เทียบกับ 92.3. Humanity's Last Exam: 43.1 เทียบกับ 40.5. การเรียกคืนบริบทแบบยาว: 80.33 เทียบกับ 79. SciCode: 52.1 เทียบกับ 49.5. หากภาระงานของคุณคือการตอบคำถามจากคลังข้อมูลขนาดใหญ่ การก้าวกระโดดของรุ่นนี้ถือเป็นเพียงความคลาดเคลื่อนจากการปัดเศษ การจ่ายเงินเพิ่มหลายเท่าเพื่อสิ่งนั้นคงเป็นเรื่องยากที่จะให้เหตุผลสนับสนุน

ในงานเชิงเอเจนต์และการเขียนโค้ด ช่องว่างถ่างออกอย่างหนัก Terminal-Bench 2.1: 88.76 เทียบกับ 74.53 ดัชนีการเขียนโค้ดของ Artificial Analysis: 76.2 เทียบกับ 66 และความแตกต่างที่กว้างที่สุดในชุดคืองานใช้เครื่องมือด้านธนาคาร ซึ่ง Qwen3.8-Max ทำได้ 47.84 เมื่อเทียบกับ Qwen3.7-Max ที่ทำได้ 11.75 — ช่องว่างสี่เท่าในความสามารถที่คำอธิบาย RSI กล่าวว่าวงจรอัตโนมัติกำลังปรับให้เหมาะสม: การออกแบบไปป์ไลน์ การตรวจสอบความถูกต้องของข้อมูล การทดลองแบบวนซ้ำ การวินิจฉัยข้อผิดพลาด โมเดลที่ใช้เวลาหนึ่งเดือนในการปรับปรุงลูปการฝึกของตัวเองคือโมเดลที่เก่งขึ้นในเรื่องลูป

ข้อควรระวังอย่างตรงไปตรงมาประการหนึ่งเกี่ยวกับแถวข้อมูลรายตัวเหล่านั้น หน้าโมเดลทั้งสองอยู่ในตระกูลการปรับปรุง Intelligence Index เดียวกัน (v4.3 และ v4.3.2) ซึ่งทำให้การเปรียบเทียบตัวเลขหลัก 45 ต่อ 29 เป็นการเปรียบเทียบที่ยุติธรรม แถวข้อมูลราย benchmark ไม่ได้อยู่ในกลุ่มเดียวกัน: ตัวเลขระดับงานของ Qwen3.7-Max มาจากช่วงการประเมินเดือนพฤษภาคม ขณะที่ตัวเลขของ Qwen3.8-Max มาจากชุดเดือนกันยายน ให้ดูทิศทางแนวโน้ม ไม่ใช่ตัวเลขหลักนัยสำคัญตัวที่สาม

คำถามเรื่องราคาเป็นคำถามสองข้อ

ในตารางอัตราค่าบริการระหว่างประเทศของ Alibaba รุ่น Max ที่ใหม่กว่านั้นมีราคาถูกกว่ารุ่นที่มันเข้าแทนที่: $2.00 / $6.00 สำหรับ Qwen3.8-Max เทียบกับ $2.50 / $7.50 สำหรับ Qwen3.7-Max ต่อหนึ่งล้านโทเคน การลดราคา 20% ทั้งสองอัตราเมื่อรุ่นใหม่กว่า ถือเป็นเรื่องที่พบได้ยากและน่าจดจำในตัวเอง เศรษฐศาสตร์ของแคชก็เอื้อต่อรุ่นใหม่กว่า — แคชแบบโดยนัยอยู่ที่ $0.25 เทียบกับ $0.50 และการอ่านแคชอยู่ที่ $0.17 เทียบกับ $0.25

นั่นคือคำถามข้อแรก และมันมีคำตอบที่ขึ้นอยู่กับภูมิภาค ซึ่งสื่อส่วนใหญ่รายงานแบบแบนราบจนเสียรายละเอียด $1.65 input / $4.951 output ในปักกิ่ง แฟรงก์เฟิร์ต และเวอร์จิเนีย ช่องว่าง 20% นั้นมีอยู่เฉพาะบนการ์ดระหว่างประเทศของสิงคโปร์เท่านั้น หากทราฟฟิกของคุณไปลงในอีกสามภูมิภาค โทเคนอินพุตและเอาต์พุตมีราคาเท่ากันสำหรับทั้งสองระดับ Max ในปัจจุบัน และการตัดสินใจก็เหลือเพียงเรื่องความสามารถล้วน ๆ — ณ จุดนั้นโมเดลที่ใหม่กว่าชนะในทุกด้านยกเว้นปริมาณงานประมวลผล และไม่เหลืออะไรให้ต้องคำนวณอีก

คำถามข้อที่สองคือกับดัก Qwen3.7-Max ไม่ได้มีค่าใช้จ่ายอยู่ที่ $2.50 / $7.50 ในปัจจุบัน มันให้บริการที่$1.25 / $3.75 — ครึ่งหนึ่งของราคาป้าย ซึ่งเป็นราคาโปรโมชัน นั่นทำให้ระดับของรุ่นก่อนหน้าเป็นตัวเลือกที่ถูกกว่าในวันนี้อย่างมาก และยังหมายความว่าราคาที่คุณวัดได้ในสัปดาห์นี้ไม่ใช่ราคาที่คุณกำลังจะผูกมัดด้วย หน้าของแบบจำลองของ Alibaba เองระบุไว้อย่างชัดเจนว่าตารางที่เผยแพร่แสดงราคาเดิม "โดยไม่รวมโปรโมชันระยะเวลาจำกัดใด ๆ" และแนะนำให้คุณไปที่คอนโซลเพื่อดูข้อเสนอปัจจุบัน โปรโมชัน โดยตัวมันเองแล้ว คืออัตราที่สามารถสิ้นสุดได้ หากมันสิ้นสุด Qwen3.7-Max ไม่ได้เพียงกลายเป็นแพงกว่าวันนี้เท่านั้น แต่จะกลายเป็นแพงกว่าโมเดลที่เอาชนะมันอยู่ถึง 25%

เราส่งต่อเรตของผู้ให้บริการโดยบวกเพิ่ม 0% ดังนั้นทั้งราคาตามรายการและโปรโมชันจึงมีผลฝั่งเราในวันเดียวกับที่เปลี่ยนแปลง — ซึ่งสะดวกสำหรับการเปรียบเทียบ แต่ไม่เป็นประโยชน์หากคุณกำลังพยายามจัดงบประมาณ สร้างโมเดลโดยอิงจากการ์ดราคาตามรายการ และมองอัตราโปรโมชันเป็นส่วนเพิ่ม

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

ตัวเลขที่พลิกข้อโต้แย้งเรื่องต้นทุน

ราคาต่อโทเคนไม่ใช่สิ่งที่บอกว่าภารกิจหนึ่งมีค่าใช้จ่ายเท่าไร Artificial Analysis เผยแพร่ตัวเลขค่าใช้จ่ายต่อภารกิจ ซึ่งรวมเศรษฐศาสตร์ของแคช ปริมาณการให้เหตุผล และความยาวของคำตอบเข้าไว้ด้วยกัน และเมื่อวัดด้วยตัวเลขนี้ อันดับก็พลิกกลับทั้งหมด: $5.41 ต่อภารกิจ Intelligence Index สำหรับ Qwen3.8-Max เทียบกับ $1.15 สำหรับ Qwen3.7-Max ส่วนต่างสูงถึง 4.7 เท่า เมื่อเทียบกับอัตราค่าโทเคนที่ถูกกว่า 20% หรือเท่ากันก็ได้ ขึ้นอยู่กับภูมิภาคของคุณ

ความแตกต่างส่วนใหญ่อยู่ที่ความเยิ่นเย้อ ในการประเมินเดียวกัน โมเดลที่ใหม่กว่าสร้างโทเคนเอาต์พุต 190M เทียบกับรุ่นเก่ากว่าที่สร้าง120M และโมเดลใหม่ใช้เหตุผลอย่างยาวเพื่อไปถึงคำตอบ หากคุณจ่ายตามโทเคนเอาต์พุตสำหรับงานปริมาณมากที่ยากปานกลาง Max รุ่นใหม่กว่าไม่ใช่โมเดลที่ถูกกว่า ณ ราคาต่อโทเคนใด ๆ บนเรตการ์ดทั้งสองแบบ มันเป็นรุ่นที่แพงกว่า และราคาต่อโทเคนตามรายการเป็นเครื่องมือที่ผิดในการตัดสินเรื่องนี้

ความเร็ว และสิ่งที่ทราฟฟิกของเราเองแสดงให้เห็น

ช่องว่างด้านปริมาณงานนั้นกว้างพอที่จะทำให้ต้องเปลี่ยนสถาปัตยกรรมกันเลย Artificial Analysis จัดให้ Qwen3.8-Max อยู่ที่ 39.7 โทเคนต่อวินาที — โดยบทสรุปของมันเรียกโมเดลนี้ว่าช้าอย่างเห็นได้ชัด — เทียบกับ 211.3 ของ Qwen3.7-Max ซึ่งมันเรียกว่าเร็ อย่างเห็นได้ชัด นั่นคือความแตกต่างระหว่างโมเดลที่คุณวางไว้หลังอินเทอร์เฟซแบบโต้ตอบ กับโมเดลที่คุณวางไว้หลังคิว — และบน Qwen3.8-Max มันคือสิ่งแรกที่แผงสถิติของเราแสดงให้คุณเห็น

ข้อมูล telemetry จาก playground ของเราเองในช่วงเจ็ดวันจนถึงวันที่ 25 กันยายน บอกเรื่องความหน่วงได้ละเอียดขึ้นเล็กน้อย และมีข้อควรระวังติดมาด้วย: นี่คือการวัดของเราบน routing ของเรา ไม่ใช่การทดสอบ benchmark แบบควบคุม Qwen3.8-Max มีค่ามัธยฐาน 2,611 ms ถึงการตอบสนองครั้งแรก ที่ 54.7 tokens ต่อวินาที พร้อมอัตราข้อผิดพลาด 2.45%; บิลด์ 0902 ที่ปักหมุดไว้มีค่ามัธยฐาน 3,360 ms ที่ 46.2 tokens ต่อวินาที พร้อมอัตราข้อผิดพลาด 0.66% ที่สะอาดกว่าอย่างเห็นได้ชัด Qwen3.7-Max อยู่ที่ค่ามัธยฐาน 4,509 ms แต่ได้ 169.8 tokens ต่อวินาที พร้อมอัตราข้อผิดพลาด 3.80% ดังนั้นระดับที่เก่ากว่าจึงตอบช้ากว่าในช่วงแรก แล้วสตรีมเร็วกว่า 3 เท่า ขณะที่ล้มเหลวบ่อยกว่า หากภาระงานของคุณมาเป็นระลอก ความแตกต่างของอัตราข้อผิดพลาดนั้นควรค่าแก่การใส่ใจมากกว่าค่ามัธยฐาน

ทั้งสองระดับเปิดใช้งานอยู่บนคีย์ OrcaRouter เดียวกัน ควบคู่ไปกับสแนปช็อตที่ปักหมุดไว้ พร้อมการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติ สำหรับการเปรียบเทียบเช่นนี้ นั่นคือประเด็นสำคัญในทางปฏิบัติ: การวัดพรอมป์ของคุณเองกับทั้งสองเจเนอเรชันของ Max เป็นเพียงการเปลี่ยนแปลงการตั้งค่า ไม่ใช่สัญญาฉบับที่สอง

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

ความสามารถในการทำซ้ำได้กลายเป็นปัจจัยชี้ขาดในตอนนี้แล้ว

นี่คือส่วนหนึ่งของการเปิดเผยข้อมูลของ Apsara ที่ไม่มีใครให้ราคาไว้ ID ของโมเดลที่ใช้งานจริงซึ่งความสามารถที่วัดได้ขยับจาก 40 เป็น 45 ภายในหนึ่งเดือน โดยไม่มีการเปลี่ยนเวอร์ชันและไม่มีประกาศในตอนนั้น ถือเป็นความเสี่ยงด้านการทำซ้ำ ถ้าพฤติกรรมของผลิตภัณฑ์คุณเป็นฟังก์ชันของ ID ที่เคลื่อนที่ คุณก็มีโมเดลที่สามารถดีขึ้น — หรือเปลี่ยนไป — ภายใต้ชุดการประเมินที่ถูกตรึงไว้ ไลบรารีพรอมป์ที่แคชไว้ หรือชุดรีเกรสชันที่เซ็นอนุมัติแล้ว

ทั้งสองรุ่นมีสแนปช็อตแบบระบุวันที่ และนั่นคือมาตรการบรรเทาความเสี่ยง Alibaba ระบุว่า Qwen3.7-Max เทียบเท่าทางการทำงานกับ qwen3.7-max-2026-05-20 โดยมีบิลด์ที่ระบุวันที่เพิ่มเติมที่ 2026-05-17 และ 2026-06-08 Qwen3.8-Max มี qwen3.8-max-0902 ซึ่งเป็นบิลด์เดือนกันยายนที่ผ่านการฝึกภายหลัง และนั่นคือสิ่งที่ 45 หมายถึง หากคุณกำลังปล่อยอะไรก็ตามที่ต้องทำซ้ำได้ ให้ปักหมุด ID ที่ระบุวันที่และมองตัวที่ลอยเป็นเป้าหมายสำหรับ staging วงจร RSI เป็นคุณสมบัติของ ID แบบลอย การปักหมุดคือวิธีที่คุณเลือกที่จะไม่ใช้มัน

รายละเอียดการตั้งชื่อหนึ่งอย่างที่ควรทราบ เพื่อไม่ให้คุณอ่านแคตตาล็อกผิด Alibaba ระบุรูปแบบที่ระบุวันที่รายการที่สาม qwen3.8-max-2026-09-02 พร้อมกับ alias 0902; ทั้งสองหมายถึงบิลด์เดียวกัน รีลีสเดิมวันที่ 3 สิงหาคมไม่สามารถกำหนดเส้นทางได้แล้วในฝั่งของเรา — เราให้บริการ Qwen3.8-Max, 0902 pin ของมัน และ Qwen3.7-Max.

ใครควรเลือกอันไหน

การตัดสินใจไม่ได้อยู่ที่ว่ารุ่นไหนดีกว่า แต่อยู่ที่ว่าคุณกำลังซื้ออะไร

อยู่กับ Qwen3.7-Max หากปริมาณงานของคุณเป็นข้อความล้วน เน้นความรู้มากกว่าเน้นการใช้เครื่องมือ และอ่อนไหวต่ออัตราการประมวลผล — การจำแนกประเภทปริมาณมาก การสกัดข้อมูล การค้นคืนบริบทยาว การสรุปแบบเป็นชุด บน GPQA Diamond และการเรียกคืนบริบทยาว มันห่างจากโมเดลใหม่กว่าเพียงหนึ่งคะแนน สตรีมเร็วกว่าสามถึงสี่เท่า และมีค่าใช้จ่าย $1.15 ต่องาน เทียบกับ $5.41 มันยังเป็นคำตอบที่เหมาะสมสำหรับใครก็ตามที่ต้องการความเห็นที่สองราคาถูกในการตั้งค่าการหลอมรวมหรือการกำหนดเส้นทาง เพราะในอัตราโปรโมชันของมัน ถือเป็นระดับราคาที่แตกต่างออกไปโดยสิ้นเชิง มีข้อควรระวังสองประการ: โปรโมชันก็คือโปรโมชัน และ Artificial Analysis ได้ตั้งค่าสถานะโมเดลนี้ว่าเลิกใช้แล้ว ถูกแทนที่ด้วย Qwen3.8-Max อย่าเริ่มข้อผูกมัดระยะหลายปีกับมัน

ย้ายไปยัง Qwen3.8-Max หากข้อใดข้อหนึ่งต่อไปนี้เป็นจริง: คุณต้องป้อนภาพหรือวิดีโอ ซึ่ง Qwen3.7-Max ไม่รองรับเลย; งานของคุณเป็นแบบเอเจนต์ที่มีสายการเรียกใช้เครื่องมือยาว ๆ หรือลูปการเขียนโค้ดหลายขั้นตอน โดยที่ 88.76 เทียบกับ 74.53 บน Terminal-Bench 2.1 และช่องว่างการใช้เครื่องมือที่มากกว่าสี่เท่า คือความแตกต่างระหว่างการส่งงานได้หรือไม่ได้; หรือคุณเขียนตามเรตการ์ดระหว่างประเทศของสิงคโปร์ ซึ่งโมเดลใหม่กว่าถูกกว่า 20% และไม่มีอะไรต้องแลกให้ชั่งน้ำหนัก ปักหมุด qwen3.8-max-0902 หากคุณต้องการให้พฤติกรรมคงที่

หากคุณอยู่ในปักกิ่ง แฟรงก์เฟิร์ต หรือเวอร์จิเนีย ตัวเลือกนี้ชัดเจนกว่าที่การเปรียบเทียบใด ๆ บ่งชี้: ทั้งสองระดับ Max มีค่าใช้จ่าย $1.65 / $4.951 ต่อล้านโทเค็น เท่ากันทุกประการ ด้วยอัตราเท่านี้ การไม่ต้องจ่ายเพิ่มสำหรับอินพุตมัลติโมดัล ดัชนีที่สูงกว่า 16 จุด และคะแนนการใช้เครื่องมือที่ดีกว่า 4 เท่า ไม่ใช่เรื่องที่ต้องตัดสินใจ แต่มันฟรี — และเหตุผลเดียวที่จะยังใช้ Qwen3.7-Max ต่อไปก็เหลือเพียงทรูพุตดิบ

สองคำถามที่คุ้มค่าที่จะตอบให้ตรง ๆ

การฝึก 33 รอบหมายความว่าโมเดลเปลี่ยนไปภายใต้ทราฟฟิก API ที่มีอยู่หรือนั่นคือสิ่งที่การเปิดเผยข้อมูลบ่งชี้ และนั่นคือเหตุผลที่มีการปักหมุดตามวันที่อยู่ อาลีบาบาอธิบายโมเดลที่ปรับปรุงแล้วว่า "the updated Qwen3.8-Max" ซึ่งเป็น ID แบบลอย ไม่ใช่ ID ใหม่ หากคุณมีเวิร์กโหลดบน ID แบบลอยจนถึงเดือนกันยายน เวิร์กโหลดเหล่านั้นให้บริการโดยโมเดลที่ความสามารถที่วัดได้เปลี่ยนแปลงไปในช่วงเวลานั้น อาลีบาบาไม่ได้เผยแพร่ changelog สำหรับบิลด์ที่อยู่ระหว่างกลาง ดังนั้นวิธีเดียวที่เชื่อถือได้ในการรู้ว่าคุณมีพฤติกรรมแบบใดคือการปักหมุด

ข้อกล่าวอ้างเรื่อง RSI ได้รับการยืนยันโดยอิสระหรือไม่ คะแนนที่มันสร้างขึ้นนั้นได้รับการยืนยันแล้ว — Index เป็นของ Artificial Analysis และเลข 45 อยู่บนหน้าของพวกเขา กลไกเบื้องหลังคือคำอธิบายของ Alibaba เองเกี่ยวกับกระบวนการฝึกของตัวเอง โดยไม่มีการทำซ้ำจากภายนอก ไม่มีโปรโตคอลการประเมินที่เผยแพร่ และไม่มีบุคคลที่สามคอยสังเกตวัฏจักร 33 รอบ ให้ถือว่า "33 รอบการทำซ้ำ" เป็นคำกล่าวอ้างของผู้ขาย และ "45 หลังจาก 40" เป็นคู่ที่วัดได้ ทั้งสองไม่ใช่คำกล่าวประเภทเดียวกัน และความแตกต่างนี้คือเหตุผลที่พาดหัวข่าวควรค่าแก่การอ่านอย่างละเอียดมากกว่าการนำไปพูดซ้ำ

สิ่งต่อไปที่ต้องจับตาดูไม่ใช่ Qwen 4 แต่คือว่าโปรโมชันครึ่งราคาของ Qwen3.7-Max จะอยู่รอดหลังการมาถึงของโมเดลที่ตั้งใจจะมาแทนที่มันหรือไม่ หากไม่รอด ทีมจำนวนมากจะค้นพบว่าพวกเขากำลังนำราคาป้ายไปเทียบกับส่วนลด และว่าในบรรดาสองพี่น้องนั้น ตัวที่เก่ากว่าเป็นตัวที่แพงกว่ามาตลอด

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube