
MiMo-V2.6-Pro vs Qwen3.8-Max: ต่างกันหนึ่งจุดดัชนี ราคาสูงกว่าถึงหกเท่า
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max เป็นโมเดลขนาด 2.4 ล้านล้านพารามิเตอร์ที่เปิดใช้งาน 95,000 ล้านพารามิเตอร์ต่อโทเคน และรันบนผู้ให้บริการรายเดียว ส่วน Xiaomi MiMo-V2.6-Pro เป็นโมเดลขนาด 1.02 ล้านล้านพารามิเตอร์ที่เปิดใช้งาน 42,000 ล้านพารามิเตอร์ต่อโทเคน ได้คะแนนสูงกว่าหนึ่งคะแนนบนดัชนีอิสระเดียวกัน และมีค่าใช้จ่ายในการเรียกใช้งานประมาณหนึ่งในหก ข้อเท็จจริงเหล่านี้อยู่ร่วมกันอย่างน่าอึดอัด และวิธีที่คุณจัดการกับมันคือการตัดสินใจทั้งหมดระหว่างสองตัวนี้ เวอร์ชันสั้น: บน Artificial Analysis Intelligence Index v4.3.2 นั้น Xiaomi MiMo-V2.6-Pro ได้ 46 คะแนน และ Qwen3.8-Max ได้ 45 คะแนน — เป็นการเสมอกันที่อยู่ในระดับความคลาดเคลื่อน — ขณะที่ตารางราคาระบุ $0.43 และ $0.87 ต่อล้านโทเคน เทียบกับ $2.00 และ $6.00
แต่ละโมเดลจริงๆ แล้วคืออะไร
Qwen3.8-Max เป็นเรือธงของ Alibaba เปิดให้ใช้งานทั่วไปตั้งแต่ 3 สิงหาคม 2026 และในตอนที่เปิดตัว มันเป็นโมเดลที่ใหญ่ที่สุดที่สาย Qwen เคยเปิดตัว มันเป็น sparse mixture-of-experts ที่สร้างบนสถาปัตยกรรม Qwen 3.5 โดยมีพารามิเตอร์รวม 2.4 ล้านล้านตัว และเปิดใช้งานประมาณ 95 พันล้านตัวต่อโทเคน หน้าต่างบริบทขนาด 1M โทเคน เอาต์พุตสูงสุด 131,000 โทเคน และอินพุตแบบมัลติโมดัลทั้งข้อความ รูปภาพ และวิดีโอ Alibaba ลดราคาระหว่างประเทศเหลือ $2.00 ต่อล้านโทเคนอินพุต และ $6.00 ต่อล้านโทเคนเอาต์พุต โดยอินพุตที่แคชไว้ราคา $0.25 และนำเสนอว่าราคานั้นคิดเป็นประมาณ 40% ของราคาอินพุตของ Claude Opus 5 การอัปเดตจุด Qwen3.8-Max-0902 ตามมาเมื่อวันที่ 2 กันยายน 2026 และเป็นเวอร์ชันที่ Artificial Analysis วัดผลอยู่ในปัจจุบันที่ 45.0
Xiaomi MiMo-V2.6-Pro เปิดให้ใช้งานทั่วไปเมื่อวันที่ 22 กันยายน 2026 ซึ่งเป็นเวลาสามวันก่อนที่การเปรียบเทียบนี้จะถูกเขียนขึ้น โดยที่คลังเก็บเช็คพอยต์การเรียนรู้แบบเสริมกำลังของมันปรากฏขึ้นในวันก่อนหน้านั้น มันเป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์รวม 1.02 ล้านล้านตัว และมีพารามิเตอร์ที่ทำงาน 42 พันล้านตัวต่อโทเคน พร้อมหน้าต่างบริบท 1M โทเคนเท่าเดิม ความสามารถหลายรูปแบบโดยกำเนิดครอบคลุมข้อความ รูปภาพ วิดีโอ และเสียง และเผยแพร่น้ำหนักภายใต้สัญญาอนุญาต MIT Xiaomi คงราคาของรุ่นก่อนหน้าไว้แทนที่จะปรับราคาเช็คพอยต์ใหม่ให้สูงขึ้น ซึ่งเป็นเหตุผลว่าทำไมจึงระบุราคาไว้ที่ $0.43 และ $0.87 โดยมีส่วนลดแคช 99% และราคาเฉลี่ยรวม $0.18
• การประมวลผลเชิงคำนวณที่ใช้งานจริงต่อโทเคน — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B น้อยกว่าครึ่ง
• พารามิเตอร์ทั้งหมด — Qwen3.8-Max 2.4T; Xiaomi MiMo-V2.6-Pro 1.02T
• คะแนนดัชนี — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45 โดยทั้งคู่วัดบน Artificial Analysis v4.3.2
• ความเร็วเอาต์พุต — Xiaomi MiMo-V2.6-Pro 134.3 โทเคน/วินาที; Qwen3.8-Max 39.2 เมื่อเทียบกับค่ามัธยฐานของระดับที่ 72.5
• เวลาถึงโทเคนแรก — Xiaomi MiMo-V2.6-Pro 2.15 วินาที; Qwen3.8-Max 2.93
• ราคาตามประกาศ — Xiaomi MiMo-V2.6-Pro $0.43 / $0.87 ต่อ 1M; Qwen3.8-Max $2.00 / $6.00
อัตราผสม — Xiaomi MiMo-V2.6-Pro $0.18 ต่อ 1M ที่ 7:2:1 แคชฮิต/อินพุต/เอาต์พุต; Qwen3.8-Max $1.18
• น้ำหนักโมเดล — Xiaomi MiMo-V2.6-Pro มีสัญญาอนุญาตแบบ MIT และดาวน์โหลดได้; Qwen3.8-Max ให้บริการเป็นเอนด์พอยต์แบบกรรมสิทธิ์ โดยมีการเปิดตัวแบบเปิดน้ำหนักสำหรับข้อความล้วนที่ตัดบริบท 1M และอินพุตภาพออก
• การเข้าถึง — นับผู้ให้บริการ API หนึ่งรายสำหรับแต่ละรายการบน Artificial Analysis
คะแนนเสมอกัน แต่ความเร็วไม่เสมอ
หนึ่งคะแนนบนคะแนนรวมจากการประเมินสิบรายการไม่ใช่ความแตกต่างที่ใครควรนำไปลงมือทำ และสัญญาณที่มีประโยชน์กว่าคือสิ่งที่เกิดขึ้นภายใต้คะแนนนั้น โมเดลที่มี active parameters ต่อโทเคนน้อยกว่าครึ่งกลับได้คะแนนสูงกว่าเล็กน้อย และสร้างเอาต์พุตได้เร็วกว่า 3.5 เท่า — 134.3 โทเคนต่อวินาที เทียบกับ 39.2 โดยค่ามัธยฐานสำหรับโมเดล reasoning ที่เทียบเคียงกันคือ 72.5 Qwen3.8-Max เป็นโมเดลที่ช้าที่สุดในกลุ่มโมเดลระดับแนวหน้าที่วัดในหน้านั้น และนั่นเป็นผลจากดีไซน์ที่ต้อง activate พารามิเตอร์ 9.5 หมื่นล้านตัวต่อโทเคน ไม่ใช่ความผิดพลาดของระบบให้บริการ
ความหน่วงเล่าเรื่องตรงกันข้ามกับที่จำนวนพารามิเตอร์บ่งชี้ Qwen3.8-Max ไปถึงโทเคนแรกใน 2.93 วินาที เทียบกับ 2.15 ของ Xiaomi และช่องว่างเล็กกว่าช่องว่างด้านอัตราการประมวลผลมาก — Qwen3.8-Max ช้าเมื่อเริ่มเขียน ไม่ใช่ช้าตอนเริ่ม สำหรับอินเทอร์เฟซแชตที่คำตอบสั้น ความแตกต่างนั้นแทบไม่ปรากฏ แต่สำหรับลูปเอเจนต์ที่สร้างโทเคนเอาต์พุตหลายหมื่นโทเคน อัตราการประมวลผลคือเวลาที่ใช้จริงทั้งหมด และช่องว่าง 3.4 เท่าจะสะสมทบต้นในทุกเทิร์นของการรัน

จุดที่ตารางของผู้จำหน่ายไม่ตรงกัน และเหตุใดจึงไม่ถือเป็นความขัดแย้ง
อาลีบาบาเผยแพร่ตารางผลการทดสอบที่ครอบคลุมสำหรับ Qwen3.8-Max และมันแข็งแกร่งจริง ๆ โดย Terminal-Bench 2.1 อยู่ที่ 86.6, SWE-bench Pro ที่ 67.7, PaperBench ที่ 93.0, GPQA Diamond ที่ 92.6, IFBench ที่ 82.8, OSWorld-Verified ที่ 86.1 และ Humanity's Last Exam ที่ 43.6 ตัวเลขเหล่านี้เป็นผลที่ผู้พัฒนาวิ่งทดสอบเองบนฮาร์เนสของอาลีบาบาเอง และบางส่วนก็บนเบนช์มาร์กของอาลีบาบาเองด้วย ดังนั้นจึงเป็นคำกล่าวอ้างมากกว่าการวัดผลจริง — แต่เป็นคำกล่าวอ้างบนเบนช์มาร์กที่มีการใช้งานกันอย่างแพร่หลาย ซึ่งทำให้เทียบข้ามแล็บได้ง่ายกว่าผลจากฮาร์เนสที่สร้างขึ้นเฉพาะ
ตัวเลขหลักของ Xiaomi คือ 72.57 บน DeepSWE v1.1 เพิ่มขึ้นจากค่าพื้นฐาน 58.4 วัดด้วย mini-swe-agent ที่ค่าเฉลี่ยของการรันสามครั้งบน grader ของ Xiaomi เอง ผ่านการรัน reinforcement learning ที่ Xiaomi บันทึกว่าใช้สามสิบขั้นตอนและประมาณ 750,000 trajectories ด้วยค่าใช้จ่ายที่เผยแพร่ประมาณ 2.62 ล้านดอลลาร์ มันยังไม่ได้ถูกส่งไปยัง leaderboard สาธารณะของ DeepSWE และไม่มีบุคคลที่สามใดทำซ้ำได้ การนำ 72.57 ไปเทียบกับ 67.7 SWE-bench Pro ของ Qwen และประกาศว่า Xiaomi ชนะห้าคะแนน จะเป็นการอ่านข้ามสอง benchmark ที่แตกต่างกัน สอง harness ที่แตกต่างกัน และสองรูปแบบการให้คะแนนที่แตกต่างกัน มีไม้บรรทัดเพียงอันเดียวเท่านั้นที่ทั้งสองโมเดลถูกวัดด้วยโดยบุคคลอื่นที่ไม่ใช่ผู้สร้าง และมันบอกว่า 46 ต่อ 45
ตัวเลขสองตัวที่มีนัยสำคัญมากกว่าของ Qwen3.8-Max ไม่ใช่คะแนนแต่อย่างใด Alibaba ประกาศว่าน้ำหนักโมเดลจะถูกเปิดซอร์สควบคู่ไปกับ Qwen3.8-27B และเช็กพอยต์ที่ออกมาจริงเป็นแบบข้อความล้วน ไม่มีบริบทขนาด 1M โทเคนเต็มรูปแบบหรืออินพุตภาพที่ปลายทาง Max ที่ให้บริการมีอยู่ ดังนั้น "Qwen3.8-Max เป็นโมเดลที่เปิดน้ำหนัก" และ "Qwen3.8-Max เป็นปลายทางมัลติโมดัลบริบท 1M" ต่างก็เป็นข้อความจริงเกี่ยวกับอาร์ติแฟกต์ที่แตกต่างกัน และแผนการดีพลอยที่สร้างขึ้นบนข้อแรกแต่คาดหวังข้อที่สองจะไม่รอดเมื่อถึงเวลาลงมือจริง ในขณะเดียวกัน การเปิดตัวเวอร์ชันย่อย 0902 ได้ดันโมเดลขึ้นเป็นอันดับต้น ๆ ของอารีนาพัฒนาเว็บสาธารณะแห่งหนึ่งโดยไม่มีการเปลี่ยนหมายเลขเวอร์ชัน — เป็นเครื่องเตือนใจว่าโมเดลที่คุณวัดประสิทธิภาพในเดือนสิงหาคมไม่จำเป็นต้องเป็นโมเดลที่ให้บริการคำขอของคุณในเดือนกันยายน
การเปิดเผยน้ำหนักโมเดลหมายความว่าคุณสามารถโฮสต์เองตัวใดตัวหนึ่งได้หรือไม่
สำหรับ Xiaomi MiMo-V2.6-Pro โดยหลักการแล้วใช่: สัญญาอนุญาต MIT ไม่จำเป็นต้องมีข้อตกลงทางการค้า ในทางปฏิบัติ เช็กพอยต์ขนาด 1.02T พารามิเตอร์ที่มีพารามิเตอร์ที่ใช้งานจริง 42B ต้องใช้คลัสเตอร์ให้บริการแบบหลายโหนด ซึ่งเป็นระดับความมุ่งมั่นที่ต่างจากการเรียก API คนละเรื่อง การเผยแพร่เวตทำให้การโฮสต์เองถูกกฎหมาย ไม่ได้ทำให้มีต้นทุนต่ำ
สำหรับ Qwen3.8-Max คำตอบนั้นแคบกว่าที่ชื่อเสียงบอกไว้ รุ่นที่เปิดให้ใช้เป็นแบบข้อความเท่านั้นและไม่มีหน้าต่างบริบทเต็มรูปแบบ ดังนั้นการโฮสต์เองจึงให้โมเดลที่เล็กกว่าตัวที่ใช้ในการวัดผล 45 อย่างมีนัยสำคัญ หากสิ่งที่คุณต้องการคือการกำหนดค่าที่ผ่านการวัดประสิทธิภาพ เอนด์พอยต์ที่ให้บริการคือผลิตภัณฑ์ และเอนด์พอยต์นั้นเป็นกรรมสิทธิ์เฉพาะ
การเรียกใช้อย่างใดอย่างหนึ่ง และการคำนวณที่ตัดสินใจเลือก
โมเดลทั้งสองถูกนับที่ผู้ให้บริการ API รายเดียวโดย Artificial Analysis ซึ่งเป็นเรื่องผิดปกติสำหรับโมเดลเรือธงสองตัว และทำให้การสลับไปใช้ระบบสำรอง (failover) กลายเป็นคำถามเชิงปฏิบัติมากกว่าจะเป็นเพียงของแถม Qwen3.8-Max อยู่บน OrcaRouter ในชื่อ qwen/qwen3.8-max — ปลายทาง (endpoint) เดียวที่เข้ากันได้กับ OpenAI ในราคาตามที่ Alibaba ประกาศเอง โดยไม่บวกเพิ่ม 0%ดังนั้นราคา $2.00 และ $6.00 ข้างต้นจึงถูกส่งผ่านไปโดยไม่เปลี่ยนแปลง และหาก Alibaba ปรับราคา ฝั่งเราก็จะอัปเดตทันทีในวันเดียวกัน การวัดของเราเองพบว่า p50 ของปลายทางนี้อยู่ที่ประมาณ 3.3 วินาที ซึ่งเป็นตัวเลขที่ควรใช้ในการวางแผนมากกว่ากรณีที่ดีที่สุดในทางทฤษฎี และการใช้เชนสำรอง (fallback chain) หมายความว่าคำขอที่ค้างอยู่จะลองใหม่ไปยังต้นทางอื่นก่อนที่การตอบกลับจะเริ่มขึ้น Xiaomi MiMo-V2.6-Pro ไม่มีบน OrcaRouter เช่นเดียวกับโมเดล Xiaomi อื่น ๆ ที่ไม่มี และช่องทางเข้าถึงในปัจจุบันคือแพลตฟอร์มของ Xiaomi เองและแค็ตตาล็อกของบุคคลที่สามที่ระบุรายชื่อโมเดลนี้
การคำนวณต้นทุนคือจุดที่การเปรียบเทียบนี้ตัดสินกันจริง ๆ และไม่ใช่การคำนวณที่อัตราตามพาดหัวข่าวบ่งชี้ ที่ส่วนผสมแคชฮิต/อินพุต/เอาต์พุต 7:2:1 อัตราผสมคือ $0.18 และ $1.18 ต่อล้าน — ช่องว่าง 6.6 เท่า กว้างกว่าช่องว่างอินพุต 4.6 เท่าและเอาต์พุต 6.9 เท่า เพราะส่วนลดแคช 99% ของ Xiaomi ลึกกว่าของ Alibaba ที่ 88% Artificial Analysis ยังบันทึกต้นทุน $0.13 ต่องาน Intelligence Index สำหรับ Xiaomi MiMo-V2.6-Pro โดยวัดแบบเดียวกันทุกโมเดลบนบอร์ด รันเวิร์กโหลดเดียวกันผ่านทั้งสอง และโมเดลที่ถูกกว่าคือโมเดลที่ได้คะแนนสูงกว่า ซึ่งเป็นเรื่องผิดปกติที่สามารถเขียนออกมาได้ และเป็นเหตุผลที่การเปรียบเทียบนี้ไม่ใช่แค่พิธีการ

ใครควรเปลี่ยน และใครไม่ควร
หากวันนี้คุณใช้ Qwen3.8-Max และมันทำงานได้ ก็ยังไม่มีเหตุเร่งด่วนให้ต้องย้าย ช่องว่างของดัชนีเป็นประเด็นหนึ่ง การทำงานด้านภาพและบริบทยาวได้รับการพิสูจน์แล้วในเวิร์กโหลดของคุณ และ Alibaba ยังคงพัฒนาสายผลิตภัณฑ์นี้อยู่ — การอัปเดต 0902 แสดงให้เห็นเช่นนั้น เหตุผลที่ควรย้ายคือทรูพุตและต้นทุนรวม และจะเป็นเหตุผลที่หนักแน่นก็ต่อเมื่อทราฟฟิกของคุณเน้นเอาต์พุตหรือเป็นระยะยาวเท่านั้น: เอเจนต์ การสร้างโค้ด สิ่งใดก็ตามที่เขียนมากกว่าอ่านมาก
หากคุณเริ่มต้นใหม่ทั้งหมด การจัดลำดับนั้นยากที่จะโต้แย้งเมื่อพิจารณาจากหลักฐานที่เผยแพร่ โมเดล Xiaomi เร็วกว่า ถูกกว่าทุกด้าน ใช้สัญญาอนุญาต MIT และนำอยู่เล็กน้อยบนคอมโพสิตเดียวที่รันอย่างอิสระซึ่งครอบคลุมทั้งสอง ปัจจัยถ่วงดุลนั้นมีอยู่จริงและเฉพาะเจาะจง: ประวัติการใช้งานในโปรดักชันเพียงสามวัน เส้นทางให้บริการเพียงเส้นทางเดียว และไม่มีรายการเบนช์มาร์กสาธารณะให้ตรวจสอบ การรวมกันนี้สนับสนุนให้ประเมินมันในเลนที่วางเคียงข้างระบบเดิม มากกว่าการเข้าไปแทนที่ระบบหนึ่ง ซึ่งนั่นคือจุดประสงค์ของการกำหนดค่าเส้นทาง และเป็นเหตุผลว่าทำไมการเคลื่อนไหวที่มีประโยชน์คือการวางแคนดิเดตและระบบเดิมไว้หลังคีย์เดียว มากกว่าการเลือกผู้ชนะจากตารางคะแนน

อะไรจะทำให้คำตอบนี้เปลี่ยนไป
สามเรื่อง. การมีผู้ให้บริการรายที่สองและรายที่สามสำหรับ Xiaomi MiMo-V2.6-Pro จะขจัดข้อโต้แย้งเชิงโครงสร้างเพียงข้อเดียวที่มีต่อมัน และเปลี่ยนช่องว่างด้านราคาให้กลายเป็นการตัดสินใจจริงที่ต้องเลือก แทนที่จะเป็นเพียงตัวเลือกที่น่าดึงดูด. การรันการตั้งค่า DeepSWE แบบอิสระจะยืนยันค่า 72.57 หรือทำให้ค่านั้นเลิกใช้ไป และไม่ว่าผลลัพธ์ใดก็มีค่ามากกว่าตัวเลขนั้นเอง. และการแยกย่อยรายการประเมินแต่ละรายการบน v4.3.2 จะแสดงว่าแต่ละโมเดลชนะการประเมินใดจากทั้งสิบรายการ — ค่าคะแนนรวมก็คือค่าคะแนนรวม และโมเดลที่นำในด้านการเขียนโค้ดแบบเอเจนต์กับโมเดลที่นำในด้านการตอบคำถามที่เน้นการค้นคืน อาจทำคะแนนดัชนีได้เท่ากันทั้งที่ต่างก็ไม่เหมาะกับงานของอีกฝ่าย.
