
Xiaomi MiMo-V2.6-Flash đã ra mắt: một mô hình mở 309B do bạn tự vận hành
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiMo-V2.6-Flash đã không còn là một công việc huấn luyện vào lúc 15:39 UTC ngày 21 tháng 9 năm 2026, khi nhóm MiMo của Xiaomi công bố checkpoint dưới tên XiaomiMiMo/MiMo-V2.6-Flash-RL trên Hugging Face — không hạn chế truy cập, theo giấy phép MIT, kèm báo cáo kỹ thuật, 65 shard trọng số trong chỉ mục. XiaomiMiMo/MiMo-V2.6-Pro-RL nối tiếp chỉ mười tám giây sau. Một tuần trước đó, cả hai mô hình là hai thẻ được đánh dấu "stopped" trên một bảng điều khiển huấn luyện công khai, và điều được lặp lại rộng rãi về chúng là không hề có trọng số nào tồn tại. Giờ đây chúng là những tệp mà bất kỳ ai cũng có thể tải xuống và phục vụ. Đó là một thay đổi thực sự về những gì bạn có thể làm với mô hình, khác với một thông báo về một mô hình.
Hãy bắt đầu bằng mốc thời gian, bởi bản phát hành này ra mắt mà không có màn dàn dựng quen thuộc từ phía nhà cung cấp. Blog của chính Xiaomi, kiểm tra vào ngày 22 tháng 9, vẫn hiển thị bài đăng mới nhất là màn ra mắt MiMo-V2-Flash hồi tháng 12 năm 2025. Không có bài viết công bố ra mắt V2.6, không có bảng giá được công bố cho thế hệ mới, và không có mã định danh mô hình có thể gọi được nào mà Xiaomi đã công bố cho cả hai checkpoint. Thứ tồn tại là một kho chứa, một báo cáo kỹ thuật, các công thức triển khai và một bộ bảng benchmark do nhà cung cấp tự chạy — cộng thêm một chi tiết nhỏ đầy ác ý trong thẻ mô hình mà chỉ quan trọng với những người định thực sự nạp thứ này.
Hai thẻ bạn có thể giữ
Cả hai checkpoint đều là omnimodal gốc với ngữ cảnh 1 triệu token được công bố, và cả hai đều mang giấy phép MIT — dùng được cho mục đích thương mại, tinh chỉnh được, phân phối lại được, không có rào cản doanh thu và không có điều khoản nghiên cứu. Model card gọi Flash là "checkpoint cân bằng hiệu quả" của dòng này và Pro là flagship; phần thú vị là hai mô hình khác nhau thế nào khi bạn nhìn vào cấu hình thay vì câu quảng cáo.
• Số lượng tham số — MiMo-V2.6-Flash có tổng 309B tham số với 15B được kích hoạt trên mỗi token; MiMo-V2.6-Pro có tổng 1.02T với 42B được kích hoạt. Cả hai đều là mô hình mixture-of-experts thưa.
• Backbone — Flash có 48 lớp (39 cửa sổ trượt, 9 attention toàn cục), kích thước ẩn 4096, 256 chuyên gia định tuyến với 8 được kích hoạt, cửa sổ trượt 128 token, không có chuyên gia chia sẻ. Khối đầu tiên là attention toàn cục với mạng feed-forward dày đặc; mọi thứ sau đó xen kẽ.
• Bộ mã hóa — một MiMo ViT 681M tham số (28 lớp, 24 lớp cửa sổ trượt cộng 4 lớp đầy đủ), một bộ token hóa âm thanh 308M và một bộ mã hóa patch âm thanh 127M, vì vậy văn bản, hình ảnh, video và âm thanh đều đi vào cùng một mô hình thay vì ba pipeline chắp vá riêng rẽ.
• Giải mã suy đoán — một bộ dự thảo dự đoán nhiều token gồm năm lớp, kiểu DFlash, được mô tả trong thẻ là dự đoán trước bảy token mỗi lượt truyền xuôi để xác minh song song.
• Lưu trữ — chỉ mục đã công bố báo cáo 172.9 GB dữ liệu trọng số trên 65 phân mảnh, ở định dạng FP8 (e4m3) với sơ đồ kích hoạt động. Hiểu điều đó như khoảng chín byte cho mỗi tham số: Xiaomi đã xuất xưởng mô hình lớn, chứ không phải một bản lượng tử hóa cỡ laptop của nó.
Ba con số không khớp nhau
Điều này đáng được nói thẳng, vì cả ba đều ảnh hưởng đến một quyết định triển khai chứ không chỉ là chuyện tranh luận về benchmark, và không điểm nào trong đó là mờ ám — chúng trông như sự lệch pha tài liệu giữa bài mô tả, trang kho mã và các tệp đã phát hành.
Cái đầu tiên là bộ giải mã suy đoán. Phần tóm tắt mô hình nói rằng đầu MTP là một mô hình nháp năm lớp dự đoán bảy token mỗi lượt. config.json trong cùng kho lưu trữ đặt num_nextn_predict_layers thành 3. Cả hai con số không thể mô tả cùng một tạo tác, và config chính là thứ mà runtime sẽ đọc. Nếu bạn đang tính toán bộ nhớ cho giải mã suy đoán, hãy tin vào config và xác minh sau khi tải.
Điểm thứ hai tinh vi hơn và hoàn toàn không phải là lỗi, mà đúng hơn là một quy ước đặt tên trông cứ như lỗi. Kho lưu trữ được gọi là MiMo-V2.6-Flash-RL, khiến người ta dễ cho rằng đây là một adapter học tăng cường thay vì một mô hình. Nó chính là mô hình. Hậu tố -RL đánh dấu dòng dõi hậu huấn luyện — checkpoint này là đầu ra của lần chạy RL hỗn hợp mà Xiaomi đã phát trực tuyến, chứ không phải một LoRA nằm trên đỉnh của một base nào khác. Chỉ mục trọng số xác nhận điều đó: hàng chục nghìn tensor bao phủ toàn bộ backbone, bộ mã hóa thị giác, ngăn xếp âm thanh và drafter.
Cái thứ ba là cái bạn gặp đầu tiên nếu bạn tính toán phần cứng từ trang repository thay vì từ card. Khối Safetensors trên trang đó báo cáo 159B tham số. Đó không phải là một trong hai con số của card — không phải tổng 309B, cũng không phải 15B hoạt động — và đây là con số mà người lập kế hoạch dung lượng dễ sao chép nhất, vì nó nằm ngay cạnh nút tải xuống. Xiaomi chưa giải thích sự khác biệt này và chúng ta không thể làm rõ từ bên ngoài; cách hiểu khả dĩ nhất là một quy ước đếm trên các tensor đã lượng tử hóa chứ không phải một mô hình khác. Cách làm an toàn là thay vào đó hãy tính toán dựa trên dữ liệu trọng số đã công bố: 172,9 GB FP8 trải trên 65 shard là con số phải trả bằng VRAM bất kể các tham số được đếm như thế nào.
Các bài kiểm chuẩn nói gì, và ai đã thực hiện chúng
Mọi con số dưới đây đều đến từ chính các bảng đánh giá của Xiaomi trong thẻ mô hình. Không phần nào trong đó đã được tái tạo độc lập, không phần nào xuất hiện trên một bảng xếp hạng công khai, và các cột so sánh là các lần chạy của chính nhà cung cấp với cùng những bộ khung đánh giá đó để đối chiếu với mô hình của các công ty khác. Hãy xem hình dạng của các kết quả là có tính thông tin, còn các chữ số thập phân chỉ là để trang trí.
• Code agent — DeepSWE v1.1: Flash 67.9, Pro 71.9, so với Claude Opus 5 ở mức 74.0, GPT-5.6 Sol ở 73.0 và Claude Fable 5 ở 70.0. Trên Terminal Bench 2.1, Flash đạt 87.6 so với 89.1 của Opus 5 — khoảng cách đủ nhỏ để có thể chính harness, chứ không phải mô hình, mới là thứ quyết định.
• Agent tổng quát — AutomationBench v1.0.6 đưa Flash lên 52.3, cao hơn cả GPT-5.6 Sol (45.8) và Claude Opus 5 (50.3) trong lần chạy của Xiaomi. Toolathlon-Verified: Flash 73.6, Pro 76.9, Opus 5 80.6.
• An ninh mạng — cột chênh lệch nhất trong bảng. CyberGym: Flash 95,1, cao hơn cả mô hình anh em lớn hơn của chính nó ở mức 94,0, với MiMo-V2.5-Pro ở mức 40,0. Rồi mức sàn sụp đổ: ExploitGym 6,0 đối với Flash so với 22,1 của Opus 5, ExploitBench 25,3 so với 70,0, SEC Bench Pro 47,5 so với 79,1 của GPT-5.6 Sol.
• Tác nhân trực quan — MiMo VisualCoding: Flash 71.5, Pro 72.3, Opus 5 70.0.
Có một con số đáng để tách ra riêng vì đó là kiểu điều mà một bài đăng ra mắt thường giấu đi. Bảng điều khiển RL của Xiaomi đã công bố Flash ở 65.68 trên DeepSWE v1.1 — và thẻ mô hình giờ in 67.9 cho cùng một benchmark trên checkpoint hoàn chỉnh. Đó không phải là cùng một phép đo. Con số trên bảng điều khiển được ghi nhãn mini-swe-agent, avg@3, trên một bản chụp huấn luyện; bảng của thẻ mô hình là đánh giá ngoại tuyến của nhà cung cấp đối với các trọng số đã phát hành. Mức chênh hai điểm là phần tăng từ giai đoạn cuối của lần chạy cộng với bất cứ thứ gì đã thay đổi trong thiết lập đánh giá, và hiện không ai bên ngoài Xiaomi có thể tách riêng hai thứ đó. Nếu bạn đã trích dẫn 65.68 từ tuần trước, thì giờ đây đó là một con số cũ cho một artifact khác.

Chi phí thực sự để vận hành nó là bao nhiêu
Trọng số mở là một giấy phép, không phải một hóa đơn, và đây là chỗ mà việc phát hành bớt phần rôm rả. Mục triển khai của chính tấm card khuyến nghị SGLang (song song tensor 16, song song dữ liệu 2, với đường suy luận đa lớp kiểu EAGLE được bật) hoặc một công thức vLLM ở song song tensor 8, và lưu ý rằng vLLM ổn định có thể tụt lại so với kiến trúc. Đó là một tác vụ phục vụ đa nút cho một mô hình 309B với trọng số chiếm khoảng 173 GB trước khi bạn thêm KV cache cho ngữ cảnh 1M token. Cấu hình lấy mẫu được khuyến nghị là temperature 1.0, top_p 0.95.
Vậy cách diễn đạt trung thực về “mã nguồn mở” ở đây là: Xiaomi đã dỡ bỏ rào cản giấy phép và để nguyên rào cản phần cứng đúng như cũ. Giờ đây, việc tinh chỉnh Flash trên dữ liệu vết của riêng bạn là hợp pháp và khả thi; còn làm điều đó trên bất cứ thứ gì nhỏ hơn một cụm GPU nghiêm túc thì không. Đó là một lời chào thực sự và khác biệt so với một endpoint được host, và đó là lý do hai cách sử dụng thế hệ này không cạnh tranh với nhau — chúng phục vụ những ngân sách khác nhau.
Nếu bạn muốn có năng lực đó mà không cần node, thì các mô hình mà Xiaomi đem ra so sánh trong bảng đó chính là lựa chọn thay thế thiết thực: GPT-5.6 Sol, Claude Opus 5 và Claude Fable 5 đều có thể gọi được ngay hôm nay, và chúng chỉ cần một API key ở mức giá niêm yết của nhà cung cấp với 0% markup được chuyển nguyên qua OrcaRouter, nên quyết định mà bạn thực sự đang đưa ra là "mua một node" hay "trả tiền theo lượng gọi". Nếu bạn muốn xem tầng có thể gọi được so sánh thế nào trên cùng các tác vụ lập trình trước khi quyết định theo hướng nào, thì bảng xếp hạng lập trình là nguồn đọc nhanh hơn bảng của nhà cung cấp. Điều bạn không thể làm trên bất kỳ router nào hiện nay là gọi chính MiMo-V2.6-Flash — chúng tôi không định tuyến mô hình Xiaomi nào, và dòng về tính khả dụng trong thẻ của chính Xiaomi chỉ về các kênh riêng của Xiaomi: nền tảng MiMo API, AI Studio, MiMo Code và ứng dụng desktop.

Vấn đề giá cả vẫn còn bỏ ngỏ
Xiaomi chưa công bố mức giá theo token cho MiMo-V2.6-Flash. Các bài báo về màn ra mắt nói rằng dòng này sẽ giữ nguyên mức giá API của MiMo-V2.5, và đó là tuyên bố của báo chí chứ không phải bảng giá của nhà cung cấp — mức giá công bố ở thị trường nước ngoài của thế hệ V2.5 là khoảng 0,1 USD cho mỗi triệu token đầu vào, với đầu vào được lưu đệm rẻ hơn một bậc độ lớn, nhưng không có gì trên trang của Xiaomi xác nhận rằng các checkpoint mới thừa hưởng những mức giá đó. Cho đến khi có một bảng giá xuất hiện, bất kỳ con số nào bạn thấy cho endpoint MiMo-V2.6 đều là suy đoán của ai đó.
Hai điều khác vẫn còn thiếu, và cả hai đều nằm trong danh sách việc cần làm của chính Xiaomi chứ không phải của ai khác. Tuyên bố của Luo Fuli trong buổi livestream về RL là các môi trường huấn luyện và mã RL sẽ được mở nguồn, và tài liệu ra mắt nhắc lại cam kết đó; hiện các kho lưu trữ chỉ cung cấp trọng số, một báo cáo kỹ thuật và hướng dẫn triển khai, chứ không phải toàn bộ stack huấn luyện. Và không có đánh giá độc lập: không có bài nộp lên bảng xếp hạng, không có bên thứ ba chạy lại các cột DeepSWE hay CyberGym. Đó là khoảng trống quan trọng nhất đối với bất kỳ ai đang cân nhắc liệu một mô hình 309B với ngân sách hoạt động 15B có đáng để bỏ ra một node hay không.
Điều gì sẽ thay đổi cục diện
Ba tín hiệu đáng để theo dõi, theo thứ tự tương đối về mức độ chúng có thể tác động đến một quyết định. Một bảng giá được công bố sẽ biến đây từ một dự án tự vận hành thành một mục chi phí bạn có thể so sánh với các dịch vụ hosted tiên tiến. Một đánh giá của bên thứ ba trên cùng các bộ khung đánh giá — DeepSWE hoặc Terminal Bench, được nộp thay vì tự báo cáo — sẽ xác định liệu 67,9 là một vị trí thực hay chỉ là một cấu hình thuận lợi. Và các môi trường RL, nếu chúng được tung ra, sẽ là sản phẩm thú vị hơn đối với hầu hết các đội ngũ, vì chúng chính là thứ bạn cần để tái tạo vòng lặp tự cải thiện trên dữ liệu của riêng mình.
Cho đến lúc đó, cách hiểu thực tế về bản phát hành này rất hẹp và rõ ràng. MiMo-V2.6-Flash là một mô hình agent đa phương thức toàn diện, có trọng số mở, được cấp phép MIT, đúng nghĩa, ở kích cỡ ngầm định cần một cụm máy chủ — và đây là checkpoint đầu tiên trong thế hệ MiMo-V2.6 mà bạn có thể cầm trong tay, điều mà tuần trước chưa thể nói được về nó.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
