การ์ดชื่อเรื่องสำหรับการเปรียบเทียบ MiMo-V2.6-Pro กับ Qwen3.8-Max แสดงการ์ดสเปกสองใบที่หันหน้าเข้าหากัน: Xiaomi MiMo-V2.6-Pro ที่ Intelligence Index v4.3.2 46, พารามิเตอร์ที่ใช้งาน 42B ต่อโทเคน, 134.3 โทเคน/วินาที และ $0.18 ต่อ 1M แบบผสม เทียบกับ Qwen3.8-Max ที่ Index 45, ใช้งาน 95B ต่อโทเคน, 39.2 โทเคน/วินาที และ $1.18
Guides & Insights

MiMo-V2.6-Pro vs Qwen3.8-Max: ต่างกันหนึ่งจุดดัชนี ราคาสูงกว่าถึงหกเท่า

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Qwen3.8-Max เป็นโมเดลขนาด 2.4 ล้านล้านพารามิเตอร์ที่เปิดใช้งาน 95,000 ล้านพารามิเตอร์ต่อโทเคน และรันบนผู้ให้บริการรายเดียว ส่วน Xiaomi MiMo-V2.6-Pro เป็นโมเดลขนาด 1.02 ล้านล้านพารามิเตอร์ที่เปิดใช้งาน 42,000 ล้านพารามิเตอร์ต่อโทเคน ได้คะแนนสูงกว่าหนึ่งคะแนนบนดัชนีอิสระเดียวกัน และมีค่าใช้จ่ายในการเรียกใช้งานประมาณหนึ่งในหก ข้อเท็จจริงเหล่านี้อยู่ร่วมกันอย่างน่าอึดอัด และวิธีที่คุณจัดการกับมันคือการตัดสินใจทั้งหมดระหว่างสองตัวนี้ เวอร์ชันสั้น: บน Artificial Analysis Intelligence Index v4.3.2 นั้น Xiaomi MiMo-V2.6-Pro ได้ 46 คะแนน และ Qwen3.8-Max ได้ 45 คะแนน — เป็นการเสมอกันที่อยู่ในระดับความคลาดเคลื่อน — ขณะที่ตารางราคาระบุ $0.43 และ $0.87 ต่อล้านโทเคน เทียบกับ $2.00 และ $6.00

แต่ละโมเดลจริงๆ แล้วคืออะไร

Qwen3.8-Max เป็นเรือธงของ Alibaba เปิดให้ใช้งานทั่วไปตั้งแต่ 3 สิงหาคม 2026 และในตอนที่เปิดตัว มันเป็นโมเดลที่ใหญ่ที่สุดที่สาย Qwen เคยเปิดตัว มันเป็น sparse mixture-of-experts ที่สร้างบนสถาปัตยกรรม Qwen 3.5 โดยมีพารามิเตอร์รวม 2.4 ล้านล้านตัว และเปิดใช้งานประมาณ 95 พันล้านตัวต่อโทเคน หน้าต่างบริบทขนาด 1M โทเคน เอาต์พุตสูงสุด 131,000 โทเคน และอินพุตแบบมัลติโมดัลทั้งข้อความ รูปภาพ และวิดีโอ Alibaba ลดราคาระหว่างประเทศเหลือ $2.00 ต่อล้านโทเคนอินพุต และ $6.00 ต่อล้านโทเคนเอาต์พุต โดยอินพุตที่แคชไว้ราคา $0.25 และนำเสนอว่าราคานั้นคิดเป็นประมาณ 40% ของราคาอินพุตของ Claude Opus 5 การอัปเดตจุด Qwen3.8-Max-0902 ตามมาเมื่อวันที่ 2 กันยายน 2026 และเป็นเวอร์ชันที่ Artificial Analysis วัดผลอยู่ในปัจจุบันที่ 45.0

Xiaomi MiMo-V2.6-Pro เปิดให้ใช้งานทั่วไปเมื่อวันที่ 22 กันยายน 2026 ซึ่งเป็นเวลาสามวันก่อนที่การเปรียบเทียบนี้จะถูกเขียนขึ้น โดยที่คลังเก็บเช็คพอยต์การเรียนรู้แบบเสริมกำลังของมันปรากฏขึ้นในวันก่อนหน้านั้น มันเป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์รวม 1.02 ล้านล้านตัว และมีพารามิเตอร์ที่ทำงาน 42 พันล้านตัวต่อโทเคน พร้อมหน้าต่างบริบท 1M โทเคนเท่าเดิม ความสามารถหลายรูปแบบโดยกำเนิดครอบคลุมข้อความ รูปภาพ วิดีโอ และเสียง และเผยแพร่น้ำหนักภายใต้สัญญาอนุญาต MIT Xiaomi คงราคาของรุ่นก่อนหน้าไว้แทนที่จะปรับราคาเช็คพอยต์ใหม่ให้สูงขึ้น ซึ่งเป็นเหตุผลว่าทำไมจึงระบุราคาไว้ที่ $0.43 และ $0.87 โดยมีส่วนลดแคช 99% และราคาเฉลี่ยรวม $0.18

• การประมวลผลเชิงคำนวณที่ใช้งานจริงต่อโทเคน — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B น้อยกว่าครึ่ง

• พารามิเตอร์ทั้งหมด — Qwen3.8-Max 2.4T; Xiaomi MiMo-V2.6-Pro 1.02T

• คะแนนดัชนี — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45 โดยทั้งคู่วัดบน Artificial Analysis v4.3.2

• ความเร็วเอาต์พุต — Xiaomi MiMo-V2.6-Pro 134.3 โทเคน/วินาที; Qwen3.8-Max 39.2 เมื่อเทียบกับค่ามัธยฐานของระดับที่ 72.5

• เวลาถึงโทเคนแรก — Xiaomi MiMo-V2.6-Pro 2.15 วินาที; Qwen3.8-Max 2.93

• ราคาตามประกาศ — Xiaomi MiMo-V2.6-Pro $0.43 / $0.87 ต่อ 1M; Qwen3.8-Max $2.00 / $6.00

อัตราผสม — Xiaomi MiMo-V2.6-Pro $0.18 ต่อ 1M ที่ 7:2:1 แคชฮิต/อินพุต/เอาต์พุต; Qwen3.8-Max $1.18

• น้ำหนักโมเดล — Xiaomi MiMo-V2.6-Pro มีสัญญาอนุญาตแบบ MIT และดาวน์โหลดได้; Qwen3.8-Max ให้บริการเป็นเอนด์พอยต์แบบกรรมสิทธิ์ โดยมีการเปิดตัวแบบเปิดน้ำหนักสำหรับข้อความล้วนที่ตัดบริบท 1M และอินพุตภาพออก

• การเข้าถึง — นับผู้ให้บริการ API หนึ่งรายสำหรับแต่ละรายการบน Artificial Analysis

คะแนนเสมอกัน แต่ความเร็วไม่เสมอ

หนึ่งคะแนนบนคะแนนรวมจากการประเมินสิบรายการไม่ใช่ความแตกต่างที่ใครควรนำไปลงมือทำ และสัญญาณที่มีประโยชน์กว่าคือสิ่งที่เกิดขึ้นภายใต้คะแนนนั้น โมเดลที่มี active parameters ต่อโทเคนน้อยกว่าครึ่งกลับได้คะแนนสูงกว่าเล็กน้อย และสร้างเอาต์พุตได้เร็วกว่า 3.5 เท่า — 134.3 โทเคนต่อวินาที เทียบกับ 39.2 โดยค่ามัธยฐานสำหรับโมเดล reasoning ที่เทียบเคียงกันคือ 72.5 Qwen3.8-Max เป็นโมเดลที่ช้าที่สุดในกลุ่มโมเดลระดับแนวหน้าที่วัดในหน้านั้น และนั่นเป็นผลจากดีไซน์ที่ต้อง activate พารามิเตอร์ 9.5 หมื่นล้านตัวต่อโทเคน ไม่ใช่ความผิดพลาดของระบบให้บริการ

ความหน่วงเล่าเรื่องตรงกันข้ามกับที่จำนวนพารามิเตอร์บ่งชี้ Qwen3.8-Max ไปถึงโทเคนแรกใน 2.93 วินาที เทียบกับ 2.15 ของ Xiaomi และช่องว่างเล็กกว่าช่องว่างด้านอัตราการประมวลผลมาก — Qwen3.8-Max ช้าเมื่อเริ่มเขียน ไม่ใช่ช้าตอนเริ่ม สำหรับอินเทอร์เฟซแชตที่คำตอบสั้น ความแตกต่างนั้นแทบไม่ปรากฏ แต่สำหรับลูปเอเจนต์ที่สร้างโทเคนเอาต์พุตหลายหมื่นโทเคน อัตราการประมวลผลคือเวลาที่ใช้จริงทั้งหมด และช่องว่าง 3.4 เท่าจะสะสมทบต้นในทุกเทิร์นของการรัน

A two-column comparison scoreboard for Xiaomi MiMo-V2.6-Pro and Qwen3.8-Max covering Intelligence Index v4.3.2 (46 vs 45), active parameters (42B vs 95B per token), output speed (134.3 vs 39.2 tokens/second), time to first token (2.15s vs 2.93s), blended rate ($0.18 vs $1.18 per 1M) and weight availability (MIT, full multimodal vs a text-only release without the 1M context).

จุดที่ตารางของผู้จำหน่ายไม่ตรงกัน และเหตุใดจึงไม่ถือเป็นความขัดแย้ง

อาลีบาบาเผยแพร่ตารางผลการทดสอบที่ครอบคลุมสำหรับ Qwen3.8-Max และมันแข็งแกร่งจริง ๆ โดย Terminal-Bench 2.1 อยู่ที่ 86.6, SWE-bench Pro ที่ 67.7, PaperBench ที่ 93.0, GPQA Diamond ที่ 92.6, IFBench ที่ 82.8, OSWorld-Verified ที่ 86.1 และ Humanity's Last Exam ที่ 43.6 ตัวเลขเหล่านี้เป็นผลที่ผู้พัฒนาวิ่งทดสอบเองบนฮาร์เนสของอาลีบาบาเอง และบางส่วนก็บนเบนช์มาร์กของอาลีบาบาเองด้วย ดังนั้นจึงเป็นคำกล่าวอ้างมากกว่าการวัดผลจริง — แต่เป็นคำกล่าวอ้างบนเบนช์มาร์กที่มีการใช้งานกันอย่างแพร่หลาย ซึ่งทำให้เทียบข้ามแล็บได้ง่ายกว่าผลจากฮาร์เนสที่สร้างขึ้นเฉพาะ

ตัวเลขหลักของ Xiaomi คือ 72.57 บน DeepSWE v1.1 เพิ่มขึ้นจากค่าพื้นฐาน 58.4 วัดด้วย mini-swe-agent ที่ค่าเฉลี่ยของการรันสามครั้งบน grader ของ Xiaomi เอง ผ่านการรัน reinforcement learning ที่ Xiaomi บันทึกว่าใช้สามสิบขั้นตอนและประมาณ 750,000 trajectories ด้วยค่าใช้จ่ายที่เผยแพร่ประมาณ 2.62 ล้านดอลลาร์ มันยังไม่ได้ถูกส่งไปยัง leaderboard สาธารณะของ DeepSWE และไม่มีบุคคลที่สามใดทำซ้ำได้ การนำ 72.57 ไปเทียบกับ 67.7 SWE-bench Pro ของ Qwen และประกาศว่า Xiaomi ชนะห้าคะแนน จะเป็นการอ่านข้ามสอง benchmark ที่แตกต่างกัน สอง harness ที่แตกต่างกัน และสองรูปแบบการให้คะแนนที่แตกต่างกัน มีไม้บรรทัดเพียงอันเดียวเท่านั้นที่ทั้งสองโมเดลถูกวัดด้วยโดยบุคคลอื่นที่ไม่ใช่ผู้สร้าง และมันบอกว่า 46 ต่อ 45

ตัวเลขสองตัวที่มีนัยสำคัญมากกว่าของ Qwen3.8-Max ไม่ใช่คะแนนแต่อย่างใด Alibaba ประกาศว่าน้ำหนักโมเดลจะถูกเปิดซอร์สควบคู่ไปกับ Qwen3.8-27B และเช็กพอยต์ที่ออกมาจริงเป็นแบบข้อความล้วน ไม่มีบริบทขนาด 1M โทเคนเต็มรูปแบบหรืออินพุตภาพที่ปลายทาง Max ที่ให้บริการมีอยู่ ดังนั้น "Qwen3.8-Max เป็นโมเดลที่เปิดน้ำหนัก" และ "Qwen3.8-Max เป็นปลายทางมัลติโมดัลบริบท 1M" ต่างก็เป็นข้อความจริงเกี่ยวกับอาร์ติแฟกต์ที่แตกต่างกัน และแผนการดีพลอยที่สร้างขึ้นบนข้อแรกแต่คาดหวังข้อที่สองจะไม่รอดเมื่อถึงเวลาลงมือจริง ในขณะเดียวกัน การเปิดตัวเวอร์ชันย่อย 0902 ได้ดันโมเดลขึ้นเป็นอันดับต้น ๆ ของอารีนาพัฒนาเว็บสาธารณะแห่งหนึ่งโดยไม่มีการเปลี่ยนหมายเลขเวอร์ชัน — เป็นเครื่องเตือนใจว่าโมเดลที่คุณวัดประสิทธิภาพในเดือนสิงหาคมไม่จำเป็นต้องเป็นโมเดลที่ให้บริการคำขอของคุณในเดือนกันยายน

การเปิดเผยน้ำหนักโมเดลหมายความว่าคุณสามารถโฮสต์เองตัวใดตัวหนึ่งได้หรือไม่

สำหรับ Xiaomi MiMo-V2.6-Pro โดยหลักการแล้วใช่: สัญญาอนุญาต MIT ไม่จำเป็นต้องมีข้อตกลงทางการค้า ในทางปฏิบัติ เช็กพอยต์ขนาด 1.02T พารามิเตอร์ที่มีพารามิเตอร์ที่ใช้งานจริง 42B ต้องใช้คลัสเตอร์ให้บริการแบบหลายโหนด ซึ่งเป็นระดับความมุ่งมั่นที่ต่างจากการเรียก API คนละเรื่อง การเผยแพร่เวตทำให้การโฮสต์เองถูกกฎหมาย ไม่ได้ทำให้มีต้นทุนต่ำ

สำหรับ Qwen3.8-Max คำตอบนั้นแคบกว่าที่ชื่อเสียงบอกไว้ รุ่นที่เปิดให้ใช้เป็นแบบข้อความเท่านั้นและไม่มีหน้าต่างบริบทเต็มรูปแบบ ดังนั้นการโฮสต์เองจึงให้โมเดลที่เล็กกว่าตัวที่ใช้ในการวัดผล 45 อย่างมีนัยสำคัญ หากสิ่งที่คุณต้องการคือการกำหนดค่าที่ผ่านการวัดประสิทธิภาพ เอนด์พอยต์ที่ให้บริการคือผลิตภัณฑ์ และเอนด์พอยต์นั้นเป็นกรรมสิทธิ์เฉพาะ

การเรียกใช้อย่างใดอย่างหนึ่ง และการคำนวณที่ตัดสินใจเลือก

โมเดลทั้งสองถูกนับที่ผู้ให้บริการ API รายเดียวโดย Artificial Analysis ซึ่งเป็นเรื่องผิดปกติสำหรับโมเดลเรือธงสองตัว และทำให้การสลับไปใช้ระบบสำรอง (failover) กลายเป็นคำถามเชิงปฏิบัติมากกว่าจะเป็นเพียงของแถม Qwen3.8-Max อยู่บน OrcaRouter ในชื่อ qwen/qwen3.8-maxปลายทาง (endpoint) เดียวที่เข้ากันได้กับ OpenAI ในราคาตามที่ Alibaba ประกาศเอง โดยไม่บวกเพิ่ม 0%ดังนั้นราคา $2.00 และ $6.00 ข้างต้นจึงถูกส่งผ่านไปโดยไม่เปลี่ยนแปลง และหาก Alibaba ปรับราคา ฝั่งเราก็จะอัปเดตทันทีในวันเดียวกัน การวัดของเราเองพบว่า p50 ของปลายทางนี้อยู่ที่ประมาณ 3.3 วินาที ซึ่งเป็นตัวเลขที่ควรใช้ในการวางแผนมากกว่ากรณีที่ดีที่สุดในทางทฤษฎี และการใช้เชนสำรอง (fallback chain) หมายความว่าคำขอที่ค้างอยู่จะลองใหม่ไปยังต้นทางอื่นก่อนที่การตอบกลับจะเริ่มขึ้น Xiaomi MiMo-V2.6-Pro ไม่มีบน OrcaRouter เช่นเดียวกับโมเดล Xiaomi อื่น ๆ ที่ไม่มี และช่องทางเข้าถึงในปัจจุบันคือแพลตฟอร์มของ Xiaomi เองและแค็ตตาล็อกของบุคคลที่สามที่ระบุรายชื่อโมเดลนี้

การคำนวณต้นทุนคือจุดที่การเปรียบเทียบนี้ตัดสินกันจริง ๆ และไม่ใช่การคำนวณที่อัตราตามพาดหัวข่าวบ่งชี้ ที่ส่วนผสมแคชฮิต/อินพุต/เอาต์พุต 7:2:1 อัตราผสมคือ $0.18 และ $1.18 ต่อล้าน — ช่องว่าง 6.6 เท่า กว้างกว่าช่องว่างอินพุต 4.6 เท่าและเอาต์พุต 6.9 เท่า เพราะส่วนลดแคช 99% ของ Xiaomi ลึกกว่าของ Alibaba ที่ 88% Artificial Analysis ยังบันทึกต้นทุน $0.13 ต่องาน Intelligence Index สำหรับ Xiaomi MiMo-V2.6-Pro โดยวัดแบบเดียวกันทุกโมเดลบนบอร์ด รันเวิร์กโหลดเดียวกันผ่านทั้งสอง และโมเดลที่ถูกกว่าคือโมเดลที่ได้คะแนนสูงกว่า ซึ่งเป็นเรื่องผิดปกติที่สามารถเขียนออกมาได้ และเป็นเหตุผลที่การเปรียบเทียบนี้ไม่ใช่แค่พิธีการ

The OrcaRouter model page for qwen/qwen3.8-max, showing the model's vendor, capability tags, context window and the per-million-token input and output rates passed through from Alibaba's list price.

ใครควรเปลี่ยน และใครไม่ควร

หากวันนี้คุณใช้ Qwen3.8-Max และมันทำงานได้ ก็ยังไม่มีเหตุเร่งด่วนให้ต้องย้าย ช่องว่างของดัชนีเป็นประเด็นหนึ่ง การทำงานด้านภาพและบริบทยาวได้รับการพิสูจน์แล้วในเวิร์กโหลดของคุณ และ Alibaba ยังคงพัฒนาสายผลิตภัณฑ์นี้อยู่ — การอัปเดต 0902 แสดงให้เห็นเช่นนั้น เหตุผลที่ควรย้ายคือทรูพุตและต้นทุนรวม และจะเป็นเหตุผลที่หนักแน่นก็ต่อเมื่อทราฟฟิกของคุณเน้นเอาต์พุตหรือเป็นระยะยาวเท่านั้น: เอเจนต์ การสร้างโค้ด สิ่งใดก็ตามที่เขียนมากกว่าอ่านมาก

หากคุณเริ่มต้นใหม่ทั้งหมด การจัดลำดับนั้นยากที่จะโต้แย้งเมื่อพิจารณาจากหลักฐานที่เผยแพร่ โมเดล Xiaomi เร็วกว่า ถูกกว่าทุกด้าน ใช้สัญญาอนุญาต MIT และนำอยู่เล็กน้อยบนคอมโพสิตเดียวที่รันอย่างอิสระซึ่งครอบคลุมทั้งสอง ปัจจัยถ่วงดุลนั้นมีอยู่จริงและเฉพาะเจาะจง: ประวัติการใช้งานในโปรดักชันเพียงสามวัน เส้นทางให้บริการเพียงเส้นทางเดียว และไม่มีรายการเบนช์มาร์กสาธารณะให้ตรวจสอบ การรวมกันนี้สนับสนุนให้ประเมินมันในเลนที่วางเคียงข้างระบบเดิม มากกว่าการเข้าไปแทนที่ระบบหนึ่ง ซึ่งนั่นคือจุดประสงค์ของการกำหนดค่าเส้นทาง และเป็นเหตุผลว่าทำไมการเคลื่อนไหวที่มีประโยชน์คือการวางแคนดิเดตและระบบเดิมไว้หลังคีย์เดียว มากกว่าการเลือกผู้ชนะจากตารางคะแนน

The Artificial Analysis model page showing the Intelligence Index v4.3.2 scores, output speed, latency and per-task cost that both models in this comparison are measured on.

อะไรจะทำให้คำตอบนี้เปลี่ยนไป

สามเรื่อง. การมีผู้ให้บริการรายที่สองและรายที่สามสำหรับ Xiaomi MiMo-V2.6-Pro จะขจัดข้อโต้แย้งเชิงโครงสร้างเพียงข้อเดียวที่มีต่อมัน และเปลี่ยนช่องว่างด้านราคาให้กลายเป็นการตัดสินใจจริงที่ต้องเลือก แทนที่จะเป็นเพียงตัวเลือกที่น่าดึงดูด. การรันการตั้งค่า DeepSWE แบบอิสระจะยืนยันค่า 72.57 หรือทำให้ค่านั้นเลิกใช้ไป และไม่ว่าผลลัพธ์ใดก็มีค่ามากกว่าตัวเลขนั้นเอง. และการแยกย่อยรายการประเมินแต่ละรายการบน v4.3.2 จะแสดงว่าแต่ละโมเดลชนะการประเมินใดจากทั้งสิบรายการ — ค่าคะแนนรวมก็คือค่าคะแนนรวม และโมเดลที่นำในด้านการเขียนโค้ดแบบเอเจนต์กับโมเดลที่นำในด้านการตอบคำถามที่เน้นการค้นคืน อาจทำคะแนนดัชนีได้เท่ากันทั้งที่ต่างก็ไม่เหมาะกับงานของอีกฝ่าย.

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube