Thẻ hero radar mô hình OrcaRouter mang tiêu đề 'MiMo-V2.6-Flash vs Qwen 3.8', phụ đề 'Một bản tải xuống đối đầu với một đồng hồ đo, và chỉ một bên có điểm số của bên thứ ba', với bảng bên trái cho MiMo-V2.6-Flash hiển thị 309B tổng / 15B hoạt động, giấy phép MIT, không giới hạn truy cập và Không có điểm số độc lập, bảng bên phải cho Qwen3.8-Max hiển thị 2.4T tổng / 95B hoạt động, $2.00 vào / $6.00 ra trên 1M và AA Index 45, thang đo hiện tại, và ba huy hiệu bên dưới hiển thị Flash: công bố ngày 21 tháng 9 năm 2026, Qwen: tính phí từ ngày 3 tháng 8 năm 2026 và Có thể định tuyến: chỉ Qwen3.8-Max.
Guides & Insights

MiMo-V2.6-Flash vs Qwen3.8-Max: Một lượt tải xuống đối đầu với một thước đo, và chỉ một trong hai mới có điểm số

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một con số quyết định cách so sánh này thường được viết, và đó không phải là một benchmark. Qwen3.8-Max là một mô hình được lưu trữ mà Artificial Analysis đo lường liên tục, vì vậy nó có Chỉ số Thông minh hiện tại là 45 trên thang điểm v4.3 đã được hiệu chỉnh lại, tốc độ đầu ra 39,2 token mỗi giây, và giá niêm yết $2.00 cho mỗi triệu token đầu vào và $6.00 cho mỗi triệu token đầu ra. MiMo-V2.6-Flash, mà Xiaomi đã công bố dưới dạng trọng số có thể tải xuống vào ngày 21 tháng 9 năm 2026, không có bất kỳ điều nào trong số đó: không có bảng giá nhà cung cấp, không có mã định danh mô hình nào mà Xiaomi đã công bố, và không có trang Artificial Analysis nào cả. Mọi thông tin được công bố về năng lực của MiMo-V2.6-Flash đều đến từ các bảng đánh giá của chính Xiaomi trong thẻ mô hình của nó. Không một số liệu nào đã được chạy lại bởi một người không làm việc cho Xiaomi.

Sự bất đối xứng đó không phải là điểm trừ đối với mô hình. Đó là một sự thật về việc mỗi thứ là kiểu mua hàng gì, và nó thay đổi những gì bạn thực sự có thể kết luận từ một cuộc so sánh trực tiếp. Phần còn lại của bài viết này nói về ba thứ mà bạn thực sự có thể so sánh — hình dạng của tuyên bố, chi phí của một token, và giấy phép — cộng thêm một con số có thật, được đo lường độc lập, và không thuộc về mô hình nào được nhắc trong tiêu đề.

Đầu tiên, Qwen 3.8 nào, và MiMo nào

Cả hai cái tên trong tiêu đề đó đều là những họ đang giả làm trạm kiểm soát, và những sự thay thế đó không hề vô hại.

• Qwen3.8-Max — mô hình chủ lực dạng dịch vụ của Alibaba, được công bố ngày 3 tháng 8 năm 2026. Một mô hình mixture-of-experts thưa với 2,4 nghìn tỷ tham số, khoảng 95 tỷ tham số hoạt động trên mỗi token, ngữ cảnh 1 triệu token và đầu vào văn bản, hình ảnh cùng video. Đây là mô hình mà phần còn lại của bài viết này coi là đối thủ.

• Qwen3.8-Max (0902) — bản chụp ngày 2 tháng 9 của cùng mô hình đó, được cung cấp như một mục riêng với cùng mức giá $2.00 và $6.00 cùng giới hạn đầu ra 131.072 token. Trang Artificial Analysis hiện tại là dành cho bản dựng này, điều này rất quan trọng khi bạn trích dẫn điểm chỉ số.

• Qwen3.8-2.4T-A95B — bản checkpoint trọng số mở của cùng lõi, có thể tải xuống từ ngày 12 tháng 8 năm 2026 theo Giấy phép Qwen3.8-Max. Nó chỉ xử lý văn bản, chế độ suy luận luôn bật và ngữ cảnh gốc là 262K thay vì một triệu. Đây không phải là mô hình trong tiêu đề.

• MiMo-V2.6-Flash — checkpoint mixture-of-experts thưa của Xiaomi với tổng 309B, kích hoạt 15B, không bị hạn chế truy cập trên Hugging Face theo giấy phép MIT, hỗ trợ đa phương thức gốc, kèm tuyên bố ngữ cảnh 1M token. Đây là thành viên hiệu quả của một bản phát hành gồm hai checkpoint, với mẫu chủ lực là MiMo-V2.6-Pro có tổng 1.02T và kích hoạt 42B.

• MiMo-V2-Flash — mô hình tháng 12 năm 2025. Vẫn tổng 309B, vẫn 15B hoạt động, vẫn cửa sổ trượt 128 token. Nhưng là một lần huấn luyện khác, một bảng xếp hạng benchmark khác, và ngữ cảnh 256K. Bất kỳ trang nào xếp hạng "MiMo-V2-Flash" đối đầu với một mô hình Qwen đều đang so sánh sai thế hệ, và chỉ riêng bảng thông số kỹ thuật sẽ không cho bạn biết điều đó.

Va chạm MiMo là cái hiểm hơn trong hai cái bẫy, vì những con số dùng để nhận diện mô hình cũng tình cờ là những con số giống hệt nhau giữa các checkpoint 2025 và 2026. Va chạm Qwen nhẹ hơn nhưng có một cái giá đi kèm: trọng số mở 2.4T và API được host là những artifact khác nhau với các điều khoản khác nhau, và một phép so sánh đánh tráo chúng sẽ hiểu sai cả năng lực lẫn giấy phép.

Chỉ mục đã được dựng lại, và con số mà hầu hết các trang vẫn in đã không còn nữa.

Đây là kiểu lỗi cần chú ý trước khi bất kỳ điểm số nào xuất hiện.

Artificial Analysis đã hiệu chỉnh lại Chỉ số Thông minh của mình lên v4.3 vào ngày 7 tháng 9 năm 2026. Điểm số từ trước ngày đó không thể so sánh với điểm số sau đó, và trang Qwen3.8-Max đang hoạt động mang một Đã cập nhật huy hiệu đánh dấu kết quả được trình bày lại. Con số 58 được lan truyền rộng rãi cho Qwen3.8-Max thuộc về thang đo cũ. Qwen3.8-Max (0902) hiện tại ghi 45, xếp thứ 19 trong số 202 mô hình mà Artificial Analysis xếp vào lớp đó.

Đây không phải là chuyện vụn vặt. Một 58 bên cạnh một 46 được hiểu là khoảng cách mười hai điểm. Cùng hai mô hình đó trên cùng thang điểm hiện hành chỉ cách nhau một điểm — và 46 thậm chí không phải là mô hình mà bài viết này đang nói tới:

• Qwen3.8-Max (0902), được đo lường độc lập — Chỉ số Thông minh 45 trên v4.3. Tốc độ đầu ra 39,2 token mỗi giây, xếp thứ 151 trong số 202, mà chính trang đó ghi nhận là chậm. Chi phí mỗi tác vụ Chỉ số Thông minh là $5,41. Số token đầu ra được tạo để hoàn thành chỉ số: 190M.

• MiMo-V2.6-Pro, được đo lường độc lập — Chỉ số Thông minh 46, xếp thứ nhất trong số 114 mô hình thuộc nhóm trọng số mở. Tốc độ đầu ra 134,3 token mỗi giây. Chi phí cho mỗi tác vụ Chỉ số Thông minh là 0,13 USD. Số token đầu ra để hoàn thành chỉ số: 140M.

• MiMo-V2.6-Flash, đối tượng thực sự — không tồn tại trang Artificial Analysis nào. Không có gì để trích dẫn.

Đọc cả ba điều đó cùng nhau, và bản tóm tắt trung thực thì chẳng dễ chịu chút nào đối với cả hai nhà cung cấp. Phép so sánh mà ai cũng muốn có — Flash đối đầu với Qwen3.8-Max trên một thang đo trung lập — không hề tồn tại và không thể dựng nên từ các bảng số liệu của nhà cung cấp, bởi vì hai nhà cung cấp đã chạy những harness khác nhau trên những checkpoint khác nhau vào những thời điểm khác nhau, rồi sau đó tự so sánh mình với mô hình của những công ty khác mà họ cũng đã chạy. Thứ thực sự tồn tại là khoảng cách một điểm giữa Qwen bản flagship vàlớn hơn checkpoint của Xiaomi, với chi phí chỉ bằng khoảng một phần bốn mươi cho mỗi tác vụ chỉ số. Đó là con số thực sự thú vị nhất trong cuộc đối đầu này, và nó nói về một mô hình mà không bên nào trong dòng tiêu đề nhắc tới tên.

Scoreboard card headed 'MiMo-V2.6-Flash vs Qwen3.8-Max', with paired rows for parameters (309B total / 15B active against 2.4T total / 95B active), licence (MIT, ungated, no revenue trigger, against a hosted API whose open 2.4T sibling uses the Qwen3.8-Max License), price per 1M (no vendor rate card against $2.00 in and $6.00 out with an 88% cache discount), independent score (None published, no Artificial Analysis page, against AA Index 45 on the v4.3 scale, 19th of 202 in class), DeepSWE v1.1 (67.9 on Xiaomi's own harness against Not published) and routability (No - nowhere, including OrcaRouter, against Yes - on OrcaRouter, base tier and the 0902 snapshot).

Điều mà bảng của nhà cung cấp sẽ và sẽ không cho bạn biết

Cả hai nhà cung cấp đều công bố số liệu. Chúng không phải cùng một loại số liệu, và việc xếp chúng lại theo từng cột sẽ tạo ra một biểu đồ chứ không phải một phát hiện — nhưng hình hài của những tuyên bố vẫn đáng để đọc, vì nó cho bạn biết mỗi phòng thí nghiệm đã tối ưu hoá cho điều gì.

• Tác nhân lập trình — Xiaomi báo cáo MiMo-V2.6-Flash đạt DeepSWE v1.1 67,9; Terminal Bench 2.1 87,6; ProgramBench 26,0 và MiMo Code Bench 61,2. Alibaba báo cáo Qwen3.8-Max đạt SWE-bench Pro 67,7 và Terminal-Bench 2.1 86,6. Các con số Terminal-Bench đủ sát nhau đến mức có khả năng chính harness, chứ không phải mô hình, mới là thứ quyết định thứ hạng.

• Tác nhân tổng quát — Xiaomi báo cáo AutomationBench v1.0.6 52.3, Toolathlon-Verified 73.6, OSWorld-Verified 80.8 và Agents' Last Exam 27.6 cho Flash. Alibaba báo cáo OSWorld-Verified 86.1, WideSearch 81.9 và Agent's Last Exam 52.4 cho Qwen3.8-Max. Trên hai benchmark mà cả hai phòng thí nghiệm đều chạy, các số liệu được Qwen báo cáo cao hơn — trên hệ thống đánh giá của chính Alibaba.

• Kiến thức và bảo mật — Xiaomi vận hành CyberGym (Flash 95,1), MiMo Cyber Bench (77,2), ExploitGym (6,0), ExploitBench (25,3) và SEC Bench Pro (47,5). Alibaba vận hành GPQA Diamond (92,6), Humanity's Last Exam (43,6) và PaperBench (93,0). Hầu như không có sự chồng lấn nào, nên gần như không có gì để so sánh.

Điều duy nhất thực sự hữu ích mà một bảng của nhà cung cấp có thể cho thấy là một sự không nhất quán nội bộ, và bảng của Xiaomi có một điểm như vậy. Bảng điều khiển RL công khai của hãng, vốn đã phát trực tiếp quá trình huấn luyện trong suốt tháng Chín, đã công bố MiMo-V2.6-Flash ở mức 65.68 trên DeepSWE v1.1 sử dụng harness mini-swe-agent với trung bình của ba lần. Thẻ mô hình hoàn chỉnh ghi 67.9 cho các trọng số đã phát hành. Chúng lần lượt mô tả một ảnh chụp huấn luyện và một sản phẩm đã phát hành, và mức chênh hai điểm có cùng độ lớn với khoảng cách giữa hai checkpoint của Xiaomi. Nếu bạn đã trích dẫn con số trên bảng điều khiển từ tuần trước, thì nó đã lỗi thời.

Hóa đơn, đó là điểm mà hai mô hình không còn so sánh được với nhau nữa.

Đây là phần quyết định các đợt triển khai, và nó không hề sít sao.

• Qwen3.8-Max được tính phí theo mức sử dụng. $2.00 cho mỗi triệu token đầu vào và $6.00 cho mỗi triệu token đầu ra trên bảng giá quốc tế của Alibaba, với mức chiết khấu cache mà Artificial Analysis đo được là 88% và chi phí $5.41 cho mỗi tác vụ trên Intelligence Index. Tài liệu khu vực Trung Quốc của Alibaba ghi 12 CNY và 36 CNY cho mỗi triệu token ở cùng cặp mức giá đó. Bạn có thể gọi nó ngay chiều nay và nhận hóa đơn.

• MiMo-V2.6-Flash là một bản tải về. Xiaomi không công bố đơn giá theo token cho thế hệ MiMo-V2.6 trên trang riêng của mình và cũng chưa công bố định danh có thể gọi được cho cả hai checkpoint, nên không có gì để đong đếm. Thay vào đó, thứ hiện có là 172,9 GB dữ liệu trọng số FP8 trải trên 65 shard, chưa tính KV cache cho ngữ cảnh 1M token, cùng một mục triển khai khuyến nghị SGLang ở tensor parallel 16 với hệ số data-parallel là 2, hoặc một công thức vLLM ở tensor parallel 8 — một tác vụ phục vụ đa nút.

• Các niêm yết của bên thứ ba không phải là bảng giá. Các trang danh mục có đưa ra con số cho dòng MiMo-V2.6, và Artificial Analysis ghi nhận một nhà cung cấp API duy nhất phục vụ MiMo-V2.6-Pro ở mức $0.435 và $0.87 mỗi triệu. Đó là niêm yết của một nhà cung cấp cho checkpoint lớn hơn, không phải giá của Xiaomi, và nó hoàn toàn không tồn tại đối với Flash.

Vậy nên phép tính là một khoản mục được đo lường theo mức sử dụng đối chiếu với một quyết định về vốn. Ở mức vài trăm triệu token mỗi tháng, Qwen3.8-Max là một hóa đơn bạn có thể dự báo, còn Flash là một nút bạn sẽ mua để phục vụ một mô hình mà chưa ai ngoài Xiaomi đo lường được. Ở mức hàng tỷ token mỗi tháng, con đường mở bắt đầu thắng về chi phí, và đây là thời điểm mà giấy phép không còn là một chú thích pháp lý nữa mà trở thành một yếu tố đầu vào của việc mua sắm.

Các giấy phép không phải là cùng một sự cho phép.

MIT gần như là mức cấp phép thoáng nhất mà open weights có thể có. Giấy phép Qwen3.8-Max không phải là MIT, và sự khác biệt đó có sức nặng thực sự.

MiMo-V2.6-Flash được phát hành theo giấy phép MIT, không có ngưỡng doanh thu, không có điều kiện kích hoạt theo số lượng người dùng, không có thỏa thuận thương mại riêng và không có điều khoản nghiên cứu. Việc triển khai thương mại, chỉnh sửa, phân phối lại và huấn luyện thêm đều được phép, và kho lưu trữ không bị hạn chế truy cập.

Giấy phép Qwen3.8-Max cấp quyền sử dụng, sửa đổi, phân phối, cấp phép lại, bán, triển khai, lưu trữ và tinh chỉnh, với hai điều kiện. Một sản phẩm hoặc dịch vụ vượt quá 100 triệu người dùng hoạt động hàng tháng hoặc 20 triệu USD doanh thu hàng tháng phải hiển thị tên mô hình một cách nổi bật trong giao diện của mình. Và một doanh nghiệp mô hình-dưới-dạng-dịch-vụ hoặc trợ lý công việc AI có tổng doanh thu trên 50 triệu USD trong bất kỳ mười hai tháng liên tiếp nào cần có giấy phép riêng từ Alibaba trước khi sử dụng cho mục đích thương mại. Việc sử dụng nội bộ được miễn trừ, với điều kiện mô hình hoặc các năng lực của nó không bị phơi bày cho bên thứ ba.

Với hầu hết các nhóm, không điều kiện nào ràng buộc. Với một doanh nghiệp nền tảng thành công, một điều kiện sẽ ràng buộc — và nó ràng buộc đúng vào thời điểm mô hình đã trở thành trụ cột. Cũng lưu ý rằng những điều kiện đó gắn với trọng số 2.4T có thể tải xuống, chứ không phải với API được lưu trữ, nơi các điều khoản của nhà cung cấp được áp dụng thay thế. Hai con đường có những nghĩa vụ khác nhau, đó là một lý do nữa để không so sánh checkpoint mở với bản được lưu trữ như thể chúng là cùng một sản phẩm.

OrcaRouter phù hợp ở đâu, và ở đâu thì không

Qwen3.8-Max có thể định tuyến trên OrcaRouter, trên cả mục cơ sở và ảnh chụp nhanh 0902 gắn ngày, thông qua một API key tại giá niêm yết của nhà cung cấp với mức cộng thêm 0% được chuyển thẳng. Điều đó đặc biệt quan trọng ở đây vì hai lý do. Thứ nhất, bản dựng 0902 là một mục riêng thay vì thay thế âm thầm, nên DSL định tuyến có thể ghim lưu lượng nhạy cảm với khả năng tái lập vào ảnh chụp nhanh gắn ngày trong khi mọi thứ khác đi theo tầng cơ sở — không cần tích hợp thứ hai, không cần thay đổi mã. Thứ hai, vì giá niêm yết được chuyển thẳng thay vì bị cộng thêm, thay đổi trong bảng giá của Alibaba sẽ đến phía bạn trong cùng ngày thay vì vào lần gia hạn hợp đồng tiếp theo, điều này giữ cho phép tính đo đếm so với nút ở trên vẫn trung thực khi giá thay đổi. Các khối lượng công việc nặng về bộ nhớ đệm cũng giữ được chiết khấu bộ nhớ đệm của nhà cung cấp thay vì để mất một phần vào biên lợi nhuận của nhà bán lại.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, marked FEATURED, giving the model id qwen/qwen3.8-max, a 1M-token context, text, image and video input with text output, an input price of $2.00 and output price of $6.00 per 1M tokens, a p50 time to first token of 3.33 seconds, and seven-day traffic of 30.8M tokens.

MiMo-V2.6-Flash không thể định tuyến ở bất kỳ đâu, kể cả hệ thống của chúng tôi. Chúng tôi không định tuyến mô hình Xiaomi nào, và dòng về tính khả dụng trong thẻ của chính Xiaomi trỏ đến các kênh của chính Xiaomi: nền tảng API MiMo, AI Studio, MiMo Code và ứng dụng desktop. Nếu bạn muốn checkpoint này, bạn sẽ phải tải xuống 172,9 GB và tìm một node.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), showing an Intelligence Index of 45 on the updated v4.3 scale ranked 19th of 202, output speed of 39.2 tokens per second ranked 151st of 202, a price of $2.00 per million input tokens and $6.00 per million output with an 88% cache discount and a $5.41 cost per Intelligence Index task, 190M output tokens generated on the index, and a 984k-token context window.

Cái nào, và khi nào

Hãy chọn Qwen3.8-Max nếu bạn muốn năng lực mà không cần phần cứng, nếu khối lượng của bạn chưa chắc chắn, hoặc nếu bạn muốn có tùy chọn một con số độc lập trước khi cam kết. Hãy chấp nhận rằng 45 trên chỉ số hiện tại là vị trí giữa trong nhóm tiên phong chứ không phải vị trí hàng đầu, rằng 39,2 token mỗi giây là đủ chậm để gây ảnh hưởng bên trong một vòng lặp agent, và rằng 190M token đầu ra để hoàn thành Intelligence Index gần gấp đôi mức trung vị — sự dài dòng tốn tiền ở phía tính giá theo đầu ra của đồng hồ đo.

Hãy chọn MiMo-V2.6-Flash nếu ràng buộc là giấy phép, đường dữ liệu, hay một hóa đơn dài hạn mà bạn có thể phân bổ — và nếu bạn có node. Các điều khoản MIT không có cổng doanh thu thực sự là một sự cho phép khác với giấy phép có ngưỡng MAU và điều kiện kích hoạt chia sẻ doanh thu, và với một công ty kỳ vọng trở nên lớn, đó chính là lý do để chọn nó. Hãy dự trù ngân sách cho phục vụ đa node, định cỡ từ dữ liệu trọng số đã công bố thay vì trang repository, và coi mọi con số trong card của Xiaomi là do nhà cung cấp báo cáo cho đến khi ai đó bên ngoài phòng thí nghiệm chạy lại nó.

Và nếu bạn đang chọn ngay hôm nay thay vì quý sau, hãy dùng phương án tính phí theo mức sử dụng trước. Một tháng dùng Qwen3.8-Max sẽ cho bạn biết khối lượng công việc của bạn thực sự cần gì. Còn một node chỉ cho bạn biết điều bạn hy vọng nó sẽ đáp ứng.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày