Thẻ hero có tiêu đề 'MiMo-V2.6-Pro vs MiMo-V2.6-Flash' với phụ đề 'Mức chênh lệch giá gấp 3 lần, và điều không giải thích được nó', cùng hai khung: khung bên trái có tiêu đề 'MiMo-V2.6-Pro' hiển thị '$0.435 / $0.87 mỗi 1M' và '42B tham số hoạt động', và khung bên phải có tiêu đề 'MiMo-V2.6-Flash' hiển thị '$0.14 / $0.28 mỗi 1M' và '15B tham số hoạt động', ở trên một chân trang ghi 'Cả hai đều được cấp phép MIT · cả hai đều có ngữ cảnh 1M · chỉ số chỉ được công bố cho Pro'.
Guides & Insights

MiMo-V2.6-Pro vs MiMo-V2.6-Flash: Khoảng cách giá gấp 3 lần mà hai bài benchmark không giải thích được

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trên chính các bảng đánh giá của Xiaomi, MiMo-V2.6-Flash đánh bại MiMo-V2.6-Pro. Dòng đó là CyberGym, và khoảng cách là 95,1 so với 94,0. Đó là một dòng trong số mười lăm dòng, và đó là lý do để đọc phần còn lại của so sánh này một cách cẩn thận thay vì mặc định rằng mẫu flagship luôn là câu trả lời — bởi vì MiMo-V2.6-Flash có giá chỉ khoảng một phần ba so với MiMo-V2.6-Pro, và trên hầu hết các dòng, hai mẫu chỉ cách nhau vài điểm.

Cả hai mô hình đều được công bố dưới dạng kho Hugging Face vào ngày 21 tháng 9 năm 2026, theo giấy phép MIT, cách nhau mười tám giây, như những lần huấn luyện riêng biệt chứ không phải các nấc thang trên cùng một chiếc thang. Xiaomi MiMo-V2.6-Pro là phân khúc nghìn tỷ tham số. MiMo-V2.6-Flash là phân khúc hiệu quả. Câu hỏi mà trang này trả lời là mô hình nào trong số đó phù hợp với lộ trình sản xuất của bạn, và câu trả lời trung thực phụ thuộc vào một con số không tồn tại trong cả hai bản phát hành.

Mỗi loại là gì

• Tham số — Xiaomi MiMo-V2.6-Pro tổng cộng 1,02T với 42B hoạt động trên mỗi token, so với Xiaomi MiMo-V2.6-Flash ở mức khoảng 309B tổng cộng với 15B hoạt động
• Kiến trúc — cả hai đều là sparse mixture-of-experts với đầu vào đa phương thức nguyên bản; Flash được ghi nhận với 48 lớp, 39 lớp sliding-window và 9 lớp attention đầy đủ, kích thước ẩn 4096, 256 chuyên gia định tuyến với 8 chuyên gia hoạt động và không có chuyên gia chia sẻ, cùng với một vision transformer 681M, một audio tokenizer 308M và một audio patch encoder 127M
• Ngữ cảnh — 1 triệu token trên cả hai, với tối đa 128.000 token đầu ra trên cả hai
• Giấy phép — MIT trên cả hai, trọng số không bị hạn chế trên cả hai
• Giá — 0,435 USD đầu vào và 0,87 USD đầu ra mỗi triệu token đối với Pro, so với 0,14 USD và 0,28 USD đối với Flash: mức chênh 3,1 lần ở cả hai phía của bảng giá
• Đầu vào trúng cache — 0,0036 USD mỗi triệu trên Pro, 0,0028 USD trên Flash
• Chi phí huấn luyện — Xiaomi báo cáo khoảng 2,62 triệu USD cho lần chạy RL của Pro và 854 nghìn USD cho Flash, mỗi lần hoàn thành trong chưa đầy sáu ngày qua 30 bước học tăng cường và khoảng 750.000 quỹ đạo
• Điểm chỉ số độc lập — 46 đối với Xiaomi MiMo-V2.6-Pro trên Artificial Analysis Intelligence Index v4.3.2; không có điểm nào được công bố cho MiMo-V2.6-Flash

Dòng cuối cùng là thứ cần nắm giữ. Mọi thứ phía trên nó, ngoại trừ điểm Pro, đều do Xiaomi báo cáo.

Nơi mà giá gấp ba lần chỉ đổi lấy gần như chẳng có gì

Bảng 3 của Xiaomi đặt hai cái cạnh nhau trên các harness mà dòng này được huấn luyện, và trong công việc agentic tầm xa, chênh lệch rất nhỏ:

• DeepSWE v1.1 — Pro 71,9, Flash 67,9
• MiMo Code Bench — Pro 63,2, Flash 61,2
• AutomationBench v1.0.6 — Pro 53,1, Flash 52,3
• Toolathlon-Verified — Pro 76,9, Flash 73,6
• Terminal Bench 2.1 — Pro 89,9, Flash 87,6
• OSWorld-Verified — Pro 82,0, Flash 80,8
• JobBench — Pro 62,0, Flash 61,2
• MiMo Visual Coding — Pro 72,3, Flash 71,5
• CyberGym — Pro 94,0, Flash 95,1
• MiMo Cyber Bench — Pro 80,2, Flash 77,2

Đọc theo cột đó, lợi thế của chiếc flagship chủ yếu nằm trong khoảng từ một đến bốn điểm, với một hàng bị thua hoàn toàn. Trong một quy trình mà khoảng cách giữa 67.9 và 71.9 chính là khoảng cách giữa việc hoàn thành một tác vụ và việc tác vụ đó thất bại, thì mức giá gấp ba lần vẫn là rẻ. Còn trong một quy trình mà đó chỉ là khoảng cách giữa hai câu trả lời đều chấp nhận được, thì không. Những bảng số liệu của nhà cung cấp với các chữ số thập phân như thế này khơi gợi một độ chính xác giả tạo — chưa ai ngoài Xiaomi chạy chúng, và khoảng cách hai điểm trên một bộ kiểm thử được chấm điểm nội bộ nằm gọn trong phạm vi mà một người chấm khác hoặc một chính sách thử lại khác có thể làm dịch chuyển.

Two-column scoreboard headed 'MiMo-V2.6-Pro vs MiMo-V2.6-Flash — the scoreboard'. The left column, MiMo-V2.6-Pro, reads Active params 42B, Price $0.435 / $0.87, DeepSWE v1.1 71.9, CyberGym 94.0, ExploitGym 17.8, Independent index 46. The right column, MiMo-V2.6-Flash, reads Active params 15B, Price $0.14 / $0.28, DeepSWE v1.1 67.9, CyberGym 95.1, ExploitGym 6.0, Independent index none published. A footer reads 'All benchmark figures are Xiaomi's own runs; only the Pro index score is independent.'

Nơi nó mua rất nhiều

Có một cụm dòng mà ở đó khoảng cách không còn là chuyện tranh cãi về làm tròn nữa. Mỗi một trong số chúng đều là công việc bảo mật:

• ExploitGym — Pro 17.8, Flash 6.0
• ExploitBench — Pro 47.9, Flash 25.3
• SEC Bench Pro — Pro 66.3, Flash 47.5
• Agents' Last Exam — Pro 31.6, Flash 27.6
• Terminal Bench 4.0 — Pro 34.9, Flash 28.8

Trên ExploitGym, mô hình hàng đầu đắt gấp ba lần mô hình rẻ hơn, đúng bằng hệ số giá, còn trên SEC Bench Pro thì là 1,4 lần. Kiểu kết quả đó là điều bạn sẽ kỳ vọng ở một mô hình có 42B tham số hoạt động so với một mô hình 15B: một tác vụ đòi hỏi chuỗi lập luận dài mà không có điểm từng phần là kiểu tác vụ mà năng lực bổ sung sẽ thể hiện rõ, và việc CyberGym lại nằm theo hướng ngược lại chính là ngoại lệ chứng minh rằng hai lần chạy đã học những thứ khác nhau chứ không phải cùng một thứ ở các kích cỡ khác nhau.

Vậy nên sự phân chia này phản ánh một ranh giới khối lượng công việc thực sự chứ không phải một ranh giới tiếp thị. Công việc agent khối lượng lớn với tiêu chí thành công dễ dãi — truy xuất, phân loại, chỉnh sửa thường lệ, những lệnh gọi mà một lần thử lại có thể cứu vãn — là lãnh địa của Flash. Công việc mà một câu trả lời sai gây tốn kém còn một câu trả lời chưa đầy đủ thì vô giá trị — phát triển exploit, đánh giá bảo mật, các phiên terminal với trạng thái nhiều bước — là nơi hạng Pro xứng đáng với mức giá gấp bội.

Con số không tồn tại

MiMo-V2.6-Flash không có trang mô hình nào trên Artificial Analysis. Phiên bản anh em của nó thì có. Sự bất đối xứng đó là điều quan trọng nhất trên trang này, vì nó có nghĩa là số liệu duy nhất được đo lường độc lập ở bất cứ đâu trong dòng MiMo-V2.6 chính là số 46 bên cạnh Xiaomi MiMo-V2.6-Pro. Mọi con số của Flash ở trên — kể cả hàng CyberGym mà nó giành chiến thắng — đều đến từ một bộ khung kiểm thử của Xiaomi, một trình chấm điểm của Xiaomi và một lần chạy ngoại tuyến của Xiaomi.

Có một lý lẽ hợp lý rằng điều này là tạm thời: mô hình chỉ mới ra đời một ngày vào thời điểm viết bài và việc đánh giá của bên thứ ba cần có thời gian. Cũng có một lý lẽ hợp lý rằng đó là vấn đề mang tính cấu trúc, vì Flash là phân khúc số lượng lớn và các phân khúc số lượng lớn thu hút ít sự chú ý đánh giá chuẩn hơn. Dù theo cách nào, hậu quả thực tế hiện nay là bạn không thể so sánh Flash với bất cứ thứ gì bên ngoài dòng sản phẩm của nó với cùng độ tin cậy như khi so sánh Pro. Nếu bạn đang lựa chọn giữa Flash và một mô hình không phải của Xiaomi dựa trên cơ sở giá trên chất lượng, thì bạn đang so sánh một con số của nhà cung cấp với con số đo lường của người khác.

Cả hai thẻ mô hình đều có cùng lưu ý thứ hai. Không kho lưu trữ nào trong hai kho được triển khai bởi bất kỳ nhà cung cấp suy luận nào — Hugging Face nói rõ như vậy trên mỗi trang, và Artificial Analysis chỉ đếm được một nhà cung cấp API cho Pro. Chúng tôi không lưu trữ checkpoint nào trong hai checkpoint đó, nên không checkpoint nào có thể định tuyến qua chúng tôi. Con đường dẫn đến cả hai là nền tảng riêng của Xiaomi và các danh mục bên thứ ba có chứa chúng.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence tag and multimodal tags including 8-bit precision and fp8, a Safetensors panel reporting a model size of 159B parameters, an Inference Providers panel stating 'This model isn't deployed by any Inference Provider', a model tree listing one finetune and six quantizations, and a collection block headed MiMo-V2.6 holding three items.

Cái giá bạn phải trả là về phần cứng, chứ không phải token.

Giá theo token chỉ là một nửa chi phí thực sự của một checkpoint đối với bạn, và hai thứ này khác biệt gay gắt hơn nhiều trên đĩa so với trên bảng giá. MiMo-V2.6-Flash công bố 172,9 GB trọng số FP8 trên 65 shard. Xiaomi MiMo-V2.6-Pro mang số tham số gấp khoảng ba lần, khiến bản tải xuống thô của nó rơi vào khoảng nửa terabyte trước bất kỳ lượng tử hóa nào — và kho của riêng nó báo cáo kích thước mô hình Safetensors là 524B tham số, một con số không khớp với cả tổng 1,02T lẫn số tham số hoạt động 42B.

Khoảng cách đó làm thay đổi cục diện của quyết định. Flash ở 172,9 GB là một mô hình mà một nhóm nhỏ có thể tự vận hành trên hạ tầng thuê và coi như một món hàng phổ thông. Pro với khoảng ba lần con số đó là một quyết định ở cấp cụm — các bài đưa tin quanh thời điểm ra mắt cho thấy hai lần huấn luyện này tương ứng cần khoảng 4.000 và 8.000 GPU tương đương H200. Nếu lý do bạn tìm đến trọng số mở là bạn muốn có lựa chọn ngừng trả tiền theo token, thì hai checkpoint này mang lại lựa chọn đó ở những mức độ cam kết rất khác nhau.

Lựa chọn giữa chúng

Quy tắc vẫn đúng sau những lưu ý ở trên là chọn theo loại khối lượng công việc thay vì theo điểm trung bình benchmark. Dùng Flash cho bất cứ việc gì bạn thấy thoải mái khi phải thử lại; dùng Pro cho bất cứ việc gì mà việc thử lại không cứu được bạn. Sau đó hãy đo lường, bởi vì không mô hình nào có điểm số độc lập trên các benchmark mà bạn thực sự quan tâm.

Đo hai checkpoint cạnh nhau là lúc một router làm được điều mà một hợp đồng theo từng mô hình không thể. Đặt một tầng giá rẻ cho phần lớn lưu lượng của bạn và chỉ đẩy những ca khó lên tầng đắt tiền chính là cùng một quyết định như trang này, được diễn đạt dưới dạng cấu hình thay vì viết lại — và sự kết hợp đó đúng là lý do tầng định tuyến tồn tại. Điều đó cũng quan trọng với chính mức giá: chúng tôi chuyển tiếp giá niêm yết của nhà cung cấp với mức markup 0%, nên nếu Xiaomi giảm mức giá cho một trong hai checkpoint, con số phía chúng tôi sẽ thay đổi ngay trong ngày thay vì vào lần gia hạn hợp đồng tiếp theo. Điều đó áp dụng cho các mô hình chúng tôi cung cấp. Riêng với cặp MiMo-V2.6, hiện tại, bạn vẫn đang mua trực tiếp từ Xiaomi.

Điều gì sẽ giải quyết được nó?

Hai điều sẽ biến việc này từ một quyết định mang tính phán đoán thành một phép toán. Một trang Artificial Analysis cho MiMo-V2.6-Flash sẽ đặt cả hai checkpoint lên cùng trục chi phí trên mỗi tác vụ — trục hiện đang xếp Pro ở mức $0.133 mỗi tác vụ Intelligence Index — và so sánh sẽ tự nó được giải quyết. Một bản tái lập từ bên thứ ba đối với cụm bảo mật — ExploitGym, ExploitBench, SEC Bench Pro — sẽ xác nhận liệu khoảng cách gấp 3 lần ở các hàng đó là thuộc tính của mô hình hay thuộc tính của bộ chấm điểm.

Cho đến lúc đó, quan điểm có thể bảo vệ được là Xiaomi MiMo-V2.6-Flash là lựa chọn mua tốt hơn cho hầu hết các nhóm trong phần lớn thời gian, và Xiaomi MiMo-V2.6-Pro là lựa chọn mua tốt hơn cho nhóm công việc hẹp mà ở đó thất bại là kết cục tốn kém. Hàng duy nhất mà Flash thắng không lật ngược điều đó — nhưng đó là lời nhắc hữu ích rằng mức giá cao cấp của mẫu flagship là một khẳng định về khối lượng công việc, chứ không phải về một mô hình.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing the Xiaomi attribution and 'Released September 2026', an Intelligence card reading 46 ranked #1 of 114, a Speed card reading 125.2 output tokens per second, a Cost card reading $0.435 in and $0.87 out per million tokens with a 99% cache discount and $0.13 cost per Intelligence Index task, and a Verbosity card reading 140M output tokens, with a technical specifications panel listing 1M context window, 1.0T total parameters, 42B active, MIT licence and weights on Hugging Face.