
MiMo-V2.6-Pro so với Qwen3.8-Max: Chênh một điểm chỉ số, giá cao gấp sáu lần
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max là một mô hình 2,4 nghìn tỷ tham số, kích hoạt 95 tỷ trong số đó mỗi token và chạy trên một nhà cung cấp duy nhất. Xiaomi MiMo-V2.6-Pro là một mô hình 1,02 nghìn tỷ tham số, kích hoạt 42 tỷ mỗi token, đạt điểm cao hơn một điểm trên cùng chỉ số độc lập và có chi phí gọi chỉ bằng khoảng một phần sáu. Những dữ kiện đó đặt cạnh nhau một cách trái khoáy, và cách bạn dung hòa chúng chính là toàn bộ quyết định giữa hai mô hình. Bản ngắn gọn: trên Artificial Analysis Intelligence Index v4.3.2, Xiaomi MiMo-V2.6-Pro đạt 46 và Qwen3.8-Max đạt 45 — hòa trong khoảng nhiễu — trong khi bảng giá ghi $0.43 và $0.87 mỗi triệu token so với $2.00 và $6.00.
Mỗi mô hình thực sự là gì
Qwen3.8-Max là mô hình chủ lực của Alibaba, được phát hành chính thức từ ngày 3 tháng 8 năm 2026, và đây là mô hình lớn nhất mà dòng Qwen từng ra mắt tính đến thời điểm đó. Đây là một mô hình mixture-of-experts thưa được xây dựng trên kiến trúc Qwen 3.5 với tổng cộng 2,4 nghìn tỷ tham số, khoảng 95 tỷ tham số hoạt động trên mỗi token, cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 131.000 token và đầu vào đa phương thức gồm văn bản, hình ảnh và video. Alibaba đã hạ mức giá quốc tế xuống còn 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra, với đầu vào được lưu đệm ở mức 0,25 USD, và quảng bá rằng mức đó chỉ bằng khoảng 40% giá đầu vào của Claude Opus 5. Một bản cập nhật điểm, Qwen3.8-Max-0902, ra mắt sau đó vào ngày 2 tháng 9 năm 2026 và đây là phiên bản mà Artificial Analysis hiện đang đánh giá đạt 45.
Xiaomi MiMo-V2.6-Pro đã được phát hành rộng rãi vào ngày 22 tháng 9 năm 2026, ba ngày trước khi bài so sánh này được viết, với các kho lưu trữ checkpoint học tăng cường của nó xuất hiện vào ngày hôm trước. Đây là một mixture-of-experts thưa với tổng cộng 1,02 nghìn tỷ tham số và 42 tỷ tham số hoạt động trên mỗi token, cùng cửa sổ ngữ cảnh 1M token, khả năng đa phương thức gốc trên văn bản, hình ảnh, video và âm thanh, và trọng số được công bố theo giấy phép MIT. Xiaomi giữ nguyên mức giá của thế hệ trước thay vì tăng giá cho checkpoint mới, đó là lý do nó được niêm yết ở mức $0.43 và $0.87 với mức giảm giá cache 99% và giá hỗn hợp $0.18.
• Tính toán hoạt động trên mỗi token — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, chưa bằng một nửa
• Tổng số tham số — Qwen3.8-Max 2.4T; Xiaomi MiMo-V2.6-Pro 1.02T
• Điểm chỉ số — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, cả hai đều trên Artificial Analysis v4.3.2
• Tốc độ đầu ra — Xiaomi MiMo-V2.6-Pro 134,3 token/giây; Qwen3.8-Max 39,2, so với trung vị của phân khúc là 72,5
• Thời gian đến token đầu tiên — Xiaomi MiMo-V2.6-Pro 2,15 giây; Qwen3.8-Max 2,93
• Giá niêm yết — Xiaomi MiMo-V2.6-Pro 0,43 USD / 0,87 USD mỗi 1M; Qwen3.8-Max 2,00 USD / 6,00 USD
• Giá hỗn hợp — Xiaomi MiMo-V2.6-Pro 0,18 USD mỗi 1M theo tỷ lệ 7:2:1 trúng bộ nhớ đệm/đầu vào/đầu ra; Qwen3.8-Max 1,18 USD
• Trọng số — Xiaomi MiMo-V2.6-Pro được cấp phép MIT và có thể tải xuống; Qwen3.8-Max được cung cấp dưới dạng endpoint độc quyền, với bản phát hành trọng số mở chỉ dành cho văn bản, loại bỏ ngữ cảnh 1M và đầu vào thị giác
• Khả năng tiếp cận — tính một nhà cung cấp API cho mỗi mục trên Artificial Analysis
Tỉ số thì hòa. Còn tốc độ thì không.
Một điểm trên tổng hợp mười đánh giá không phải là khác biệt mà ai đó nên hành động dựa vào, và tín hiệu hữu ích hơn là những gì diễn ra bên dưới nó. Mô hình có chưa đến một nửa tham số hoạt động trên mỗi token đạt điểm cao hơn một chút và tạo đầu ra nhanh hơn gấp ba lần rưỡi — 134,3 token mỗi giây so với 39,2, trong khi mức trung vị cho các mô hình suy luận tương đương là 72,5. Qwen3.8-Max là mô hình chậm nhất trong số các mô hình cấp tiên phong được đo trên trang đó, và đó là hệ quả thiết kế của việc kích hoạt 95 tỷ tham số mỗi token chứ không phải một sự cố phục vụ.
Độ trễ kể một câu chuyện trái ngược với câu chuyện mà số lượng tham số gợi ý. Qwen3.8-Max đạt token đầu tiên trong 2,93 giây so với 2,15 giây của Xiaomi, và khoảng cách này nhỏ hơn nhiều so với khoảng cách về thông lượng — Qwen3.8-Max chậm khi đã bắt đầu viết, chứ không chậm ở khởi đầu. Với một giao diện trò chuyện nơi câu trả lời ngắn, sự khác biệt đó hầu như không lộ ra. Đối với một vòng lặp agent tạo ra hàng chục nghìn token đầu ra, thông lượng chính là toàn bộ thời gian thực tế, và khoảng cách 3,4× cộng dồn qua từng lượt của lần chạy.

Khi các bảng của nhà cung cấp không thống nhất với nhau, và vì sao đó không phải là mâu thuẫn
Alibaba đã công bố một bảng kết quả toàn diện cho Qwen3.8-Max và nó thực sự mạnh: Terminal-Bench 2.1 đạt 86.6, SWE-bench Pro đạt 67.7, PaperBench đạt 93.0, GPQA Diamond đạt 92.6, IFBench đạt 82.8, OSWorld-Verified đạt 86.1 và Humanity's Last Exam đạt 43.6. Đó là những con số do nhà cung cấp tự chạy trên các harness của chính Alibaba và một số trong đó trên các benchmark của chính Alibaba, nên chúng là tuyên bố chứ không phải kết quả đo lường — nhưng chúng là những tuyên bố trên các benchmark được sử dụng rộng rãi, khiến chúng dễ so sánh giữa các lab hơn so với kết quả từ một harness riêng.
Con số chủ đạo của Xiaomi là 72,57 trên DeepSWE v1.1, tăng từ mức cơ sở 58,4, được đo bằng mini-swe-agent theo trung bình ba lần trên bộ chấm điểm của chính Xiaomi, trong một lần chạy học tăng cường mà Xiaomi ghi nhận là ba mươi bước và khoảng 750.000 quỹ đạo với mức chi tiêu được công bố khoảng 2,62 triệu USD. Nó chưa được gửi lên bảng xếp hạng DeepSWE công khai và chưa có bên thứ ba nào tái tạo được kết quả này. Đem 72,57 so với 67,7 trên SWE-bench Pro của Qwen và tuyên bố Xiaomi thắng năm điểm sẽ là đối chiếu vắt qua hai benchmark khác nhau, hai harness khác nhau và hai quy ước tính điểm khác nhau. Chỉ có đúng một thước đo mà cả hai mô hình đều được một bên không phải nhà sản xuất của chúng chạy đối chiếu, và nó cho kết quả 46 so với 45.
Hai trong số những con số Qwen3.8-Max có sức ảnh hưởng lớn hơn hoàn toàn không phải là điểm số. Alibaba thông báo rằng trọng số sẽ được mở nguồn cùng với Qwen3.8-27B, và checkpoint được phát hành chỉ có văn bản, không mang ngữ cảnh đầy đủ 1M token hay đầu vào thị giác mà endpoint Max được phục vụ có. Vì vậy, “Qwen3.8-Max là trọng số mở” và “Qwen3.8-Max là một endpoint đa phương thức với ngữ cảnh 1M” đều là những phát biểu đúng về các artifact khác nhau, và một kế hoạch triển khai dựa trên điều thứ nhất trong khi kỳ vọng điều thứ hai sẽ không trụ nổi khi tiếp xúc thực tế. Trong khi đó, bản phát hành điểm 0902 đã đưa mô hình lên đứng đầu một đấu trường phát triển web công khai mà không thay đổi số phiên bản — một lời nhắc rằng mô hình bạn benchmark hồi tháng 8 không nhất thiết là mô hình đang phục vụ yêu cầu của bạn vào tháng 9.
Trọng số mở có nghĩa là bạn có thể tự host một trong hai không?
Đối với Xiaomi MiMo-V2.6-Pro, về nguyên tắc thì có: giấy phép MIT, không cần thỏa thuận thương mại. Trên thực tế, một checkpoint 1,02T tham số với 42B tham số hoạt động cần một cụm phục vụ đa nút, một mức độ cam kết khác hẳn so với việc gọi API. Việc công bố trọng số khiến cho tự vận hành trở nên hợp pháp, chứ không hề rẻ.
Với Qwen3.8-Max, câu trả lời hẹp hơn so với danh tiếng gợi ý. Bản phát hành mở chỉ có văn bản và không có cửa sổ ngữ cảnh đầy đủ, nên việc tự lưu trữ nó mang lại cho bạn một mô hình nhỏ hơn đáng kể so với mô hình mà 45 được đo trên đó. Nếu thứ bạn muốn là cấu hình đã được đánh giá benchmark, thì endpoint được phục vụ chính là sản phẩm, và endpoint đó là độc quyền.
Gọi một trong hai, và phép tính quyết định điều đó
Cả hai mô hình đều được Artificial Analysis thống kê tại một nhà cung cấp API duy nhất, điều này không bình thường đối với hai mô hình hàng đầu và khiến khả năng chuyển đổi dự phòng trở thành câu hỏi thực tế chứ không phải chuyện có thì tốt. Qwen3.8-Max có mặt trên OrcaRouter với tên gọi qwen/qwen3.8-max — một endpoint tương thích OpenAI ở đúng giá niêm yết của chính Alibaba với mức phụ phí 0%, nên mức $2.00 và $6.00 ở trên được giữ nguyên không đổi và thay đổi giá từ phía Alibaba sẽ có hiệu lực trên hệ thống của chúng tôi ngay trong cùng ngày. Các đo đạc của chính chúng tôi cho thấy p50 của endpoint vào khoảng 3.3 giây, đây là con số cần dựa vào để lập kế hoạch chứ không phải trường hợp tốt nhất trên lý thuyết, và một chuỗi dự phòng nghĩa là một yêu cầu bị đình trệ sẽ được thử lại sang một upstream khác trước khi phản hồi bắt đầu. Xiaomi MiMo-V2.6-Pro không có trên OrcaRouter; không có mô hình Xiaomi nào có mặt ở đó, và con đường đến với nó hiện nay là nền tảng của chính Xiaomi cùng các danh mục của bên thứ ba có liệt kê nó.
Phép tính chi phí mới là nơi trận đối đầu này thực sự được phân định, và đó không phải phép tính mà các mức giá nêu trên tiêu đề gợi ý. Với tỷ lệ pha trộn 7:2:1 giữa cache-hit/đầu vào/đầu ra, mức giá tổng hợp là 0,18 USD và 1,18 USD mỗi triệu token — khoảng cách 6,6×, rộng hơn cả mức chênh 4,6× ở đầu vào lẫn 6,9× ở đầu ra, bởi mức chiết khấu cache 99% của Xiaomi sâu hơn mức 88% của Alibaba. Artificial Analysis cũng ghi nhận chi phí 0,13 USD cho mỗi tác vụ Chỉ số Thông minh (Intelligence Index) đối với Xiaomi MiMo-V2.6-Pro, được đo theo cùng một cách trên mọi mô hình trong bảng. Chạy cùng một khối lượng công việc qua cả hai, và mô hình rẻ hơn lại chính là mô hình đạt điểm cao hơn — một điều hiếm khi có thể viết ra, và cũng là lý do khiến so sánh này không chỉ là thủ tục hình thức.

Ai nên chuyển đổi, và ai không nên
Nếu hôm nay bạn đang dùng Qwen3.8-Max và nó vẫn hoạt động tốt, thì không có lý do cấp bách nào để chuyển đổi. Khoảng cách về chỉ số chỉ là một điểm, hành vi thị giác và ngữ cảnh dài đã được chứng minh trong khối lượng công việc của bạn, và Alibaba vẫn đang phát triển dòng này — bản cập nhật 0902 cho thấy điều đó. Lý do để chuyển đổi là thông lượng và chi phí tổng hợp, và đó chỉ là một lý do mạnh mẽ nếu lưu lượng của bạn thiên về đầu ra hoặc dài hơi: agent, sinh mã, bất cứ thứ gì ghi nhiều hơn đọc rất nhiều.
Nếu bạn đang bắt đầu từ đầu, thứ tự xếp hạng này rất khó phản bác dựa trên bằng chứng đã công bố. Mô hình Xiaomi nhanh hơn, rẻ hơn trên mọi phương diện, được cấp phép MIT, và nhỉnh hơn một chút ở chỉ số tổng hợp duy nhất được chạy độc lập bao quát cả hai. Những đối trọng là có thật và cụ thể: ba ngày lịch sử vận hành thực tế, một tuyến phục vụ duy nhất, và không có mục benchmark công khai nào để kiểm tra. Sự kết hợp đó lập luận cho việc đánh giá nó trong một làn chạy bên cạnh một giải pháp hiện hữu thay vì thay thế một giải pháp — đó chính là mục đích của một cấu hình định tuyến, và là lý do động thái hữu ích là đặt ứng viên cùng giải pháp hiện hữu ra sau một khóa thay vì chọn người thắng từ một bảng điểm.

Điều gì sẽ làm thay đổi câu trả lời này?
Ba điều. Nhà cung cấp thứ hai và thứ ba cho Xiaomi MiMo-V2.6-Pro sẽ loại bỏ phản đối mang tính cấu trúc duy nhất đối với nó và biến chênh lệch giá thành một quyết định thực sự thay vì chỉ là một lựa chọn hấp dẫn. Một lần chạy độc lập cấu hình DeepSWE sẽ hoặc xác nhận 72.57 hoặc loại bỏ nó, và dù kết quả nào thì cũng có giá trị hơn chính con số đó. Và các phân tích chi tiết theo từng đánh giá trên v4.3.2 sẽ cho thấy mỗi mô hình thắng những đánh giá nào trong số mười đánh giá — chỉ số tổng hợp vốn chỉ là chỉ số tổng hợp, và một mô hình dẫn đầu về lập trình tác tử cùng một mô hình dẫn đầu về trả lời câu hỏi thiên về truy xuất có thể đạt cùng một điểm chỉ số trong khi lại không phù hợp với công việc của nhau.
