
MiMo-V2.6-Flash vs MiMo-V2.6: Một dòng sản phẩm, hai checkpoint, và một cái tên mang hai vai trò
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Hỏi hai người xem MiMo-V2.6 là gì và bạn có thể nhận được hai mô hình khác nhau. Bản phát hành tháng 9 năm 2026 của Xiaomi là một dòng gồm hai checkpoint đã được công bố — MiMo-V2.6-Flash với 309 tỷ tham số và MiMo-V2.6-Pro với 1,02 nghìn tỷ — còn cái tên trần MiMo-V2.6 được dùng để chỉ cả dòng lẫn, trong hầu hết các bài đưa tin, bản cao cấp nhất của thế hệ. Vậy nên một trang có tiêu đề "MiMo-V2.6-Flash vs MiMo-V2.6" thực ra là so sánh checkpoint hiệu quả với cái tên mà người ta viết khi ý họ là bản flagship. Cả hai checkpoint đều xuất hiện trên Hugging Face cách nhau mười tám giây vào ngày 21 tháng 9 năm 2026, cả hai đều mang giấy phép MIT, và cả hai đều là dạng tải về trước hết — không có endpoint Xiaomi nào để gọi. Hầu như không còn điểm nào khác giữa chúng là giống nhau.
Điều đó quan trọng hơn mức một cuộc tranh cãi vặt về cách đặt tên thường có, bởi vì hai mô hình này không phải là một bậc thang kích thước mà bạn có thể leo lên sau này. Chúng là những lần huấn luyện riêng biệt với các bảng điểm chuẩn riêng, mức sử dụng bộ nhớ riêng, và — như các con số được công bố cho thấy — một vài điểm mà mô hình nhỏ hơn thắng hoàn toàn.
Hai điểm kiểm tra, một phút được công bố
Các kho lưu trữ là XiaomiMiMo/MiMo-V2.6-Flash-RL, được tạo lúc 15:39:51 UTC, và XiaomiMiMo/MiMo-V2.6-Pro-RL, được tạo lúc 15:39:33 UTC. Không kho lưu trữ nào trong hai bị hạn chế truy cập. Cả hai đều đính kèm một báo cáo kỹ thuật và một thẻ mô hình, và cả hai đều được Xiaomi mô tả là sản phẩm của một lần chạy học tăng cường hỗn hợp duy nhất đã gộp các tác vụ lập trình, tác nhân tổng quát, thị giác và an ninh mạng vào một lượt huấn luyện thay vì các lần chạy riêng theo từng lĩnh vực.
• Tham số — MiMo-V2.6-Flash: tổng cộng 309B, kích hoạt 15B mỗi token. MiMo-V2.6-Pro: tổng cộng 1.02T, kích hoạt 42B. Cả hai đều là mô hình mixture-of-experts thưa.
• Backbone — Flash có 48 lớp, 39 lớp attention cửa sổ trượt và 9 lớp attention đầy đủ, kích thước ẩn 4096, 256 chuyên gia định tuyến với 8 chuyên gia được kích hoạt, cửa sổ trượt 128 token và không có chuyên gia chia sẻ. Pro chạy cùng ý tưởng attention lai đó ở độ rộng lớn hơn nhiều.
• Phương thức — cả hai đều là omnimodal nguyên bản, đưa văn bản, hình ảnh, video và âm thanh vào một mô hình duy nhất thay vì ba pipeline được ghép nối với nhau. Flash mang một vision transformer 681M tham số, một tokenizer âm thanh 308M và một bộ mã hóa patch âm thanh 127M.
• Bối cảnh — 1M token, được công bố cho cả hai, với cấu hình hỗ trợ embedding vị trí tối đa 1,048,576 token.
• Giấy phép — MIT cho cả hai, không có ngưỡng doanh thu, không có rào cản chấp nhận sử dụng nào ngoài những rào cản thông thường, và không có điều khoản nghiên cứu. Việc triển khai thương mại, sửa đổi và phân phối lại đều được phép.
• Các tệp trọng số — Flash phát hành 172,9 GB dữ liệu trọng số FP8 trải trên 65 phân mảnh. Pro có số lượng tham số gần gấp ba lần, nên dung lượng tải về của nó rơi vào khoảng nửa terabyte trước bất kỳ bước lượng tử hoá nào bạn tự áp dụng.
• Nơi chúng được phục vụ — Hugging Face, nền tảng API riêng của Xiaomi, AI Studio, MiMo Code và ứng dụng MiMo cho máy tính để bàn. Thẻ cho biết rằng hiện không có checkpoint nào được triển khai bởi nhà cung cấp suy luận bên thứ ba trên chính Hub.
Vụ va chạm khiến người ta mất phần cứng
Sự nhầm lẫn trong cặp so sánh này thực ra không nằm giữa Flash và Pro. Mà là giữa MiMo-V2.6-Flash và mô hình ra đời trước nó.
MiMo-V2-Flash ra mắt vào tháng 12 năm 2025, và bài đăng blog của chính Xiaomi công bố nó mô tả một mô hình mixture-of-experts với tổng cộng 309 tỷ tham số, 15 tỷ tham số hoạt động, một cơ chế attention lai xen kẽ sliding-window và full attention, cùng cửa sổ trượt 128 token đầy tham vọng. Hãy đối chiếu điều đó với danh sách gạch đầu dòng ở trên. Checkpoint 2026 và checkpoint 2025 có cùng hình dạng tổng thể, cùng kích thước sliding-window, và cùng ngân sách kích hoạt — cách nhau chín tháng, từ các lần huấn luyện khác nhau, với các năng lực khác nhau và một bảng benchmark khác.
Thế nên, một tìm kiếm cho “MiMo V2.6 Flash” sẽ sẵn sàng trả về cho bạn các trang nói về MiMo-V2-Flash, kèm theo con số ngữ cảnh 256K và mức giá một phần mười đô-la cho mỗi triệu token đầu vào vốn thuộc về mô hình cũ hơn. Nếu bạn đang ước lượng cấu hình cho một node, thì đó không phải là lỗi hình thức. Checkpoint cũ và checkpoint mới là các bản tải xuống khác nhau với các công thức phục vụ khác nhau, và bản mới tuyên bố ngữ cảnh gấp bốn lần.
Có một cái bẫy thứ hai, kín đáo hơn, trong cách đặt tên. Cả hai kho đều kết thúc bằng -RL, nghe như thể là một adapter học tăng cường nằm trên một mô hình nền nào đó khác. Chúng không phải là adapter. Hậu tố đánh dấu dòng dõi hậu huấn luyện: đây là các checkpoint đầy đủ xuất phát từ lượt chạy RL dạng luồng. Chỉ mục trọng số xác nhận điều đó — hàng chục nghìn tensor bao phủ toàn bộ backbone, bộ mã hóa thị giác, ngăn xếp âm thanh và bộ dự thảo suy đoán.
Bảng của chính nhà cung cấp nói gì
Mọi số liệu trong phần này đều đến từ các bảng đánh giá của Xiaomi trong hai thẻ mô hình. Xiaomi đã chạy các khung đánh giá trên chính các checkpoint của mình. Không có phần nào trong đó được tái lập bên ngoài phòng thí nghiệm, không có phần nào xuất hiện trên bảng xếp hạng công khai, và các cột so sánh là do chính nhà cung cấp chạy cùng những khung đánh giá đó trên mô hình của các công ty khác. Hãy xem thứ hạng là mang tính tham khảo và các chữ số thập phân là để trang trí.
• Code agent — DeepSWE v1.1: Flash 67.9, Pro 71.9. Terminal Bench 2.1: Flash 87.6, Pro 89.9. ProgramBench: Flash 26.0. MiMo Code Bench: Flash 61.2.
• Tác nhân tổng quát — AutomationBench v1.0.6: Flash 52.3, Pro 53.1. Toolathlon-Verified: Flash 73.6, Pro 76.9. OSWorld-Verified: Flash 80.8, Pro 82.0. Agents' Last Exam: Flash 27.6. Terminal Bench 4.0: Flash 28.8.
• An ninh mạng — cột duy nhất mà mô hình nhỏ hơn dẫn đầu. CyberGym: Flash 95.1 so với 94.0 của Pro. MiMo Cyber Bench: Flash 77.2. Rồi mức sàn sụp đổ: ExploitGym 6.0, ExploitBench 25.3, SEC Bench Pro 47.5.
• Tác nhân trực quan — MiMo VisualCoding: Flash 71.5, Pro 72.3.
Đọc từ trên xuống những gạch đầu dòng đó, và bản tóm tắt trung thực là Pro dẫn trước gần như ở mọi mặt, với những khoảng cách nhỏ, và những khoảng cách đó nhỏ đến mức nằm trong độ nhiễu của một bộ khung đánh giá tự vận hành. Trên DeepSWE, hai bên cách nhau bốn điểm trên một thang điểm mà ở đó cùng một checkpoint đã lệch hai điểm giữa hai lần đánh giá do chính Xiaomi thực hiện.
Điểm cuối cùng đó xứng đáng có một đoạn riêng, vì nó là thứ hữu ích nhất trong cả hai thẻ. Bảng điều khiển RL công khai của Xiaomi, nơi phát trực tuyến cả hai lần chạy huấn luyện trong suốt tháng Chín, đã công bố Flash ở mức 65.68 trên DeepSWE v1.1 sử dụng khung mini-swe-agent ở mức trung bình của ba lần. Thẻ hoàn thiện in ra 67.9 cho các trọng số đã phát hành. Trong khi đó, con số trên bảng điều khiển của Pro là 72.57 và thẻ của nó in ra 71.9 — nó đã giảm. Hai điểm kiểm tra từ cùng một lần chạy, được đánh giá hai lần, và khoảng cách giữa hai lần đánh giá bằng với khoảng cách giữa hai mô hình. Nếu bạn đã trích dẫn số liệu trên bảng điều khiển từ tuần trước, chúng mô tả ảnh chụp nhanh huấn luyện, không phải các sản phẩm bạn sẽ tải xuống hôm nay.

Cả hai đều không nằm trên router.
Đây là phần quyết định hầu hết các đánh giá thực tế. Xiaomi không bán checkpoint nào trong hai: không có mức giá theo token nào được công bố cho thế hệ MiMo-V2.6 trên trang web của chính hãng, và không có mã định danh mô hình có thể gọi được mà hãng đã công bố cho bất kỳ mô hình nào trong hai. Thay vào đó, thứ tồn tại là một bản tải xuống, cộng thêm — chỉ với Pro — một nhà cung cấp API duy nhất mà Artificial Analysis tính là đang phục vụ nó với giá 0,435 đô la mỗi triệu token đầu vào và 0,87 đô la mỗi triệu token đầu ra. Đó là bảng niêm yết của một nhà cung cấp chứ không phải bảng giá của nhà sản xuất, và hoàn toàn không có gì tương đương cho Flash. Những con số lưu hành trên các trang danh mục của bên thứ ba cũng nên được đọc theo cách tương tự.
Vậy nên lựa chọn giữa Flash và Pro không phải là lựa chọn giữa hai điểm đầu mút với những thang đo khác nhau. Đó là lựa chọn giữa hai hóa đơn GPU, và cái nhỏ hơn chỉ bằng khoảng một phần ba cái lớn hơn. Đó chính là toàn bộ lập luận thương mại dành cho Flash, và nó mạnh hơn mức mà bảng benchmark gợi ý, bởi vì hai mô hình chỉ cách nhau vài điểm ở những tác vụ mà hầu hết mọi người mua để dùng.
Điều còn lại là cách chia ba nhánh quen thuộc. Thuê mô hình frontier, sở hữu một mô hình nhỏ, hoặc sở hữu một mô hình lớn. Cột frontier chính là cột mà Xiaomi lấy làm chuẩn đối chiếu trong các bảng của riêng mình — Claude Opus 5, GPT-5.6 Sol và Claude Fable 5 đều nằm cao hơn Pro vài điểm trên DeepSWE trong so sánh của chính nhà cung cấp, và cả ba đều có thể gọi ngay hôm nay thông qua một API key trên OrcaRouter ở mức giá niêm yết của nhà cung cấp, với 0% markup được chuyển thẳng. Điều đó quan trọng với quyết định cụ thể đang ở trước mắt bạn: một thay đổi giá từ nhà cung cấp sẽ tác động tới phía bạn ngay trong cùng ngày thay vì đợi đến kỳ gia hạn hợp đồng tiếp theo, nên phép tính thuê-so-với-sở-hữu vẫn trung thực khi giá dịch vụ lưu trữ biến động. Tự động chuyển đổi dự phòng cũng có nghĩa là một mô hình bạn vẫn đang đánh giá không bao giờ phải một mình gánh vác một luồng production trong khi bạn quyết định.
Điều bạn không thể làm trên bất kỳ router nào hiện nay — kể cả của chúng tôi — là gọi MiMo-V2.6-Flash hoặc MiMo-V2.6-Pro. Chúng tôi không định tuyến bất kỳ mô hình Xiaomi nào, và dòng về tính khả dụng trong thẻ của chính Xiaomi trỏ đến các kênh riêng của Xiaomi: nền tảng MiMo API, AI Studio, MiMo Code và ứng dụng desktop.
Checkpoint nào, và khi nào?
Hãy chọn MiMo-V2.6-Flash nếu bạn muốn thế hệ MiMo-V2.6 và phần cứng là ràng buộc quyết định. Bạn phải đánh đổi khoảng bốn điểm DeepSWE và một hai điểm trên hầu hết các benchmark agent so với mẫu flagship. Đổi lại, bạn nhận được một checkpoint chỉ chiếm khoảng một phần ba bộ nhớ, dẫn trước Pro trên CyberGym trong bảng của chính Xiaomi, và dùng chung giấy phép, cùng tuyên bố ngữ cảnh 1M token và cùng khả năng đa phương thức. Với một nhóm làm công việc đánh giá an ninh mạng, cột CyberGym đó không phải là một sai số làm tròn.
Hãy chọn MiMo-V2.6-Pro nếu khối lượng công việc là lập trình hoặc công việc agentic tầm xa và node đã được thanh toán. Đây là mô hình tốt hơn ở gần như mọi cột, là mô hình mà Artificial Analysis đã thực sự đo lường — Chỉ số Thông minh 46 trên thang v4.3 đã hiệu chỉnh lại, đứng đầu trong số 114 mô hình thuộc lớp trọng số mở của nó, 134,3 token đầu ra mỗi giây, và được niêm yết ở mức 0,435 USD cho mỗi triệu token đầu vào và 0,87 USD cho mỗi triệu token đầu ra — và đo lường độc lập có giá trị hơn bảng thông số của nhà cung cấp khi bạn đang lập kế hoạch cho production.
Đừng vội tin bên nào cho đến khi bạn đọc chính các tệp cấu hình thay vì các bản tóm tắt. Thẻ mô hình Flash mô tả một bộ dự thảo suy đoán năm lớp dự đoán bảy token mỗi lượt; tệp config.json trong cùng kho lưu trữ lại đặt num_nextn_predict_layers thành 3. Phần tóm tắt trên thẻ không phải là thứ mà runtime đọc. Và khối Safetensors trên trang kho lưu trữ báo cáo 159B tham số cho Flash và 524B cho Pro, không con số nào khớp với tổng số hay số tham số hoạt động trong bất kỳ thẻ mô hình nào. Xiaomi chưa giải thích sự khác biệt này. Thay vào đó, hãy lấy kích thước từ dữ liệu trọng số đã công bố, vì đó mới là con số bạn phải trả bằng VRAM bất kể các tham số được đếm như thế nào.

Điều gì sẽ giải quyết được nó?
Ba điều, theo thứ tự tương đối về mức độ hữu ích. Một đợt chạy của bên thứ ba trên cùng các harness — DeepSWE hoặc Terminal Bench, được nộp thay vì tự báo cáo — sẽ cho bạn biết liệu khoảng cách bốn điểm giữa Flash và Pro là một vị thế thực sự hay chỉ là một cấu hình thuận lợi. Một bảng giá được công bố sẽ biến toàn bộ so sánh từ một dự án phần cứng thành một mục chi phí mà bạn có thể đặt bên cạnh mô hình frontier được host. Và các môi trường RL, thứ mà Xiaomi đã nói sẽ mở mã nguồn, là tạo tác mà hầu hết các nhóm thực sự muốn, vì chúng là thứ bạn cần để tái tạo vòng lặp trên các trace của riêng bạn.
Cho đến lúc đó, cách hiểu thực tế vẫn hẹp. MiMo-V2.6 là hai checkpoint, không phải một, và cái tên trần thường ám chỉ bản đắt tiền. Nếu hôm nay bạn đang chọn trong dòng này, mặc định trung thực là Flash trừ khi một cột benchmark mà bạn đặc biệt quan tâm nói khác — và nếu bạn chưa sẵn sàng mua một node, thì cả hai đều chưa phải câu trả lời đúng.

