
Xiaomi MiMo-V2.6-Pro: Điểm DeepSWE 72,57, một lần chạy đã dừng lại, và vẫn chưa có ngày phát hành
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro đã dừng phiên chạy học tăng cường được phát trực tuyến công khai của mình vào ngày 20 tháng 9 với điểm DeepSWE v1.1 là 72.57 nằm trên bảng điều khiển của chính Xiaomi — thấp hơn 1,4 điểm so với mức 74% mà GPT-6 Astra, Gemini 3.8 Flash và Claude Opus 5 cùng chia sẻ ở vị trí dẫn đầu của bảng xếp hạng đó. Xiaomi MiMo-V2.6-Flash, mô hình nhỏ hơn được huấn luyện song song, đã dừng vào ngày 19 tháng 9 ở mức 65.68. Cả hai phiên chạy đều kết thúc ở bước 30, và tổng hóa đơn mà Xiaomi công bố kèm theo là 3.474.715 USD vào thời điểm chúng tôi ghi lại trang này sáng nay.
Đó là toàn bộ tin tốt, và nó thực sự tốt. Phần còn lại của câu chuyện là khoảng cách giữa một con số và một sản phẩm. Cả Xiaomi MiMo-V2.6-Pro lẫn Xiaomi MiMo-V2.6-Flash đều không có ngày phát hành, thẻ mô hình, mã định danh API, giá công bố, hay bộ trọng số có thể tải xuống. Không có endpoint nào để gọi. Những gì tồn tại là một bảng điều khiển huấn luyện mà bất kỳ ai cũng có thể theo dõi, một con số đánh giá do chính bộ khung của Xiaomi tạo ra, và một cộng đồng đã dành sáu ngày đọc một trang telemetry như cách người ta từng đọc lá trà.
Vậy đây là một bài tổng hợp những gì đã biết, và phiên bản trung thực của nó tách bạch ba thứ mà các tin bài trong tuần qua đã âm thầm trộn lẫn: những gì Xiaomi đã công bố chính thức, những gì một quan sát viên duy nhất báo cáo về điều đó, và bất kỳ điều nào trong số đó có ý nghĩa gì với người đang chọn một mô hình lập trình hôm nay.
Những gì Xiaomi thực sự đưa lên mạng
Ngày 16 tháng 9, nhóm MiMo do Luo Fuli dẫn dắt đã mở một trang trực tiếp trên tên miền của chính Xiaomi, hiển thị quá trình hậu huấn luyện của hai mô hình chưa phát hành trong thời gian thực: số bước, đường cong phần thưởng, thông lượng token, số lượng sandbox, thông báo lỗi GPU và một đồng hồ đếm chi phí nhảy số ngay khi bạn xem. Cách Xiaomi trình bày, theo các bài đưa tin, là họ đã dành khoảng sáu tháng để giải quyết một câu hỏi — học tăng cường có thể mở rộng đến đâu — và quyết định chạy thí nghiệm đó công khai thay vì công bố một kết quả.
Bảng điều khiển này thẳng thắn đến mức bất thường đối với một tài liệu của nhà cung cấp. Nó liệt kê những thất bại của chính mình trong một nguồn tin thông báo: một lần khởi động lại Pro ở bước 17 do lỗi hết bộ nhớ GPU gây ra bởi mất cân bằng tải giữa các chuyên gia, mà nhóm cho biết đã khắc phục bằng cách điều chỉnh chiến lược song song hóa huấn luyện; một lỗi kết nối mạng giữa cụm huấn luyện Pro và triển khai chấm điểm buộc phải khởi động lại và đưa ra quyết định loại bỏ bộ dữ liệu cyber khỏi lần chạy Pro sắp tới sau "các mẫu xấu trong nhật ký rollout"; một lần khởi động lại Flash từ bước 15 sau khi một loại lỗi hạ tầng không bị phát hiện trong khoảng ba giờ; và một lần khởi động lại Pro do lỗi VRAM trên một nút. Nó cũng lưu ý rằng các tác vụ được đánh giá là "tương đối dễ đối với mô hình pro hiện tại" đã bị lọc bỏ — một sự thừa nhận mà hầu hết các báo cáo hậu huấn luyện đều không nói ra.

Hai thẻ chạy là phần quan trọng đối với bất kỳ ai đang theo dõi thời gian. Cả hai mô hình đều được gắn nhãn đã dừng: MiMo-V2.6-Pro sau 5 ngày 7 giờ đồng hồ thực, MiMo-V2.6-Flash sau 3 ngày 11 giờ, mỗi mô hình ở bước 30, lần lượt vào ngày 20 tháng 9 và ngày 19 tháng 9. Pro tiêu thụ 75 tỷ token và 753 nghìn mẫu với chi phí 2,62 triệu USD; Flash tiêu thụ 81,4 tỷ token với chi phí 854 nghìn USD. Mỗi bước rút ra một lô 1.568 prompt với 16 lần rollout cho mỗi prompt — 25.088 quỹ đạo mỗi bước, chạy hoàn toàn bất đồng bộ.
Nói thẳng cho rõ: Xiaomi chưa cho biết liệu "stopped" nghĩa là lượt chạy đã kết thúc, bị tạm dừng, hay đã được đánh dấu checkpoint. Một thẻ bị dừng không phải là thông báo hoàn thành, và không ai ngoài nhóm biết đó là trường hợp nào.
Điều gì đã được xác nhận, và điều gì chưa được xác nhận?
72,57 không phải là tin đồn. Nó được in trên bảng điều khiển của Xiaomi, trong một biểu đồ có nhãn DeepSWE v1.1, mini-swe-agent, avg@3, bên cạnh đường cong màu cam của lần chạy Pro. Con số 65,68 của mô hình Flash nằm trên cùng biểu đồ đó. Con số này cũng xuất hiện — dưới dạng 62,24 và sau đó là 65,97 — trong các ảnh chụp nhanh trước đó của cùng bảng điều khiển, và đó chính là điều tạo nên hình dạng của đường cong: một sự leo dốc đều đặn qua 30 bước thay vì một lần đánh giá may mắn duy nhất.
Điều chỉ mang tính báo cáo là điểm khởi đầu. Tuyên bố lan truyền trên X vào ngày 21 tháng 9, từ tài khoản @nrehiew_, là mô hình Pro đã đi "từ 58.41 lên 72.57" trên DeepSWE và rằng các lần chạy đã hoàn tất. Điểm cuối khớp chính xác với bảng điều khiển của nhà cung cấp. Mốc cơ sở 58.41 là cách tài khoản đó đọc vị trí mà đường cong bắt đầu — điểm Pro ngoài cùng bên trái của biểu đồ đúng là nằm ở khoảng cuối 50 — và Xiaomi chưa công bố con số cho bước 1. Tuyên bố về việc hoàn tất cũng là một cách diễn giải hai thẻ được đánh dấu là đã dừng, đây là cách hiểu hợp lý và không phải là tuyên bố của Xiaomi. Hãy coi mức cải thiện 14 điểm là vững về mặt xu hướng và chỉ xấp xỉ về mặt con số.

Còn một khác biệt nữa mà các bài đưa tin đã bỏ qua, và đó chính là điều quyết định con số này đáng giá đến đâu. Các bảng benchmark trên dashboard là những đánh giá của chính Xiaomi: công ty đã chạy harness trên các checkpoint của riêng mình và công bố kết quả. Harness này cũng chính là harness mà bảng xếp hạng công khai sử dụng — mini-swe-agent, DeepSWE v1.1 — điều này khiến con số trở nên có thể so sánh hơn so với một benchmark tự phát triển của nhà cung cấp. Nhưng một đánh giá tự chạy không phải là một mục trên bảng xếp hạng, và 72.57 không xuất hiện trên bảng của Datacurve, vì chưa có ai nộp nó.
Mức trần 74% thực tế chặt hơn so với điều mà tiêu đề gợi ý.
Điều đó làm cho phép so sánh trở nên rõ ràng. Bảng xếp hạng DeepSWE v1.1 của Datacurve, cập nhật lần cuối vào ngày 3 tháng 9 năm 2026, liệt kê 113 tác vụ trên 91 kho lưu trữ thuộc năm ngôn ngữ, và ba cấu hình dẫn đầu của nó cùng đạt 74% Pass@1: GPT-6 Astra với nỗ lực suy luận xhigh, Gemini 3.8 Flash ở mức high, và Claude Opus 5 ở mức max. Những con số nằm bên cạnh các điểm số đó mới là điều đáng chú ý.
• Độ tin cậy — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. Trên cùng bảng xếp hạng, GPT-5.6 Sol ở mức 73% ±3, còn GLM-5.3 và Kimi K3 ở mức 69%. Các khoảng này chồng lấn vượt xa cả chữ số thập phân thứ hai.
• Chi phí cho mỗi tác vụ — Gemini 3.8 Flash trung bình $2.36, GPT-6 Astra $6.52, Claude Opus 5 $11.84. Biểu đồ của chính bảng xếp hạng đánh dấu Gemini 3.8 Flash là cấu hình hiệu quả nhất trên bảng, và chênh lệch giữa ba cấu hình đó là khoảng năm trên một đối với một tỷ lệ đạt mà bài đo chuẩn không thể phân biệt.
• Số bước — Gemini 3.8 Flash cần trung bình 166 bước agent cho mỗi tác vụ, Claude Opus 5 cần 99, GPT-6 Astra cần 29. Điểm số ngang nhau che giấu ba phong cách làm việc rất khác biệt, và mô hình rẻ lại chính là mô hình làm việc vất vả nhất.

Vậy nên khi con số 72,57 được báo cáo được mô tả là “đang tiến sát đỉnh bảng,” phiên bản chính xác thì hẹp hơn và bớt kịch tính hơn. Nó nằm trong khoảng cách chừng một điểm rưỡi so với một thế ba bên đồng hạng mà các thành viên không thể tách rời nhau bằng chính các thanh sai số của benchmark. Đây là một kết quả mạnh mẽ đối với một mô hình vẫn đang trong quá trình hậu huấn luyện, được chính nhà cung cấp tạo ra chứ không phải những người duy trì benchmark, trên một bảng mà mô hình chưa từng được gửi lên. Lần cập nhật cuối cùng của bảng xếp hạng diễn ra hoàn toàn trước lần chạy của Xiaomi, đó là lý do vì sao chưa có mục nào về MiMo xuất hiện trên đó.
Tại sao Xiaomi đang đào tạo công khai
Sự minh bạch này không phải là chuyện ngẫu nhiên. Bản phát hành trọng số mở gần đây nhất của Xiaomi là Xiaomi MiMo-V2.5 và Xiaomi MiMo-V2.5-Pro vào cuối tháng Tư, cả hai đều theo giấy phép MIT — có thể dùng cho mục đích thương mại, có thể tinh chỉnh, có thể phân phối lại. MiMo-V2.5-Pro là một mô hình hỗn hợp chuyên gia với 1,02 nghìn tỷ tham số, 42B tham số hoạt động, kiến trúc attention lai và cửa sổ ngữ cảnh 1M token, và tài liệu ra mắt của nó đã nêu rõ ràng các tuyên bố về khả năng tác tử: một trình biên dịch được viết từ đầu bằng Rust qua hàng trăm lần gọi công cụ, một ứng dụng máy tính để bàn dài tám nghìn dòng được xây dựng trong mười một giờ làm việc của tác tử.
Phát trực tiếp quá trình hậu huấn luyện của thế hệ tiếp theo là một kiểu tuyên bố khác. Một phòng thí nghiệm công bố các đường cong phần thưởng, số lượng sandbox và lỗi GPU của mình theo thời gian thực là đang yêu cầu được đánh giá dựa trên quy trình chứ không phải dựa trên một bản trình bày ra mắt, và nó đang phát tín hiệu về một mốc thời gian. Luo Fuli đã nói rằng các chi tiết kỹ thuật của công trình RL sẽ được mở mã nguồn từng phần trong những tuần tới. Đó là thứ gần nhất với một lịch trình mà bất kỳ ai đã đưa ra: phương pháp luận trước, mô hình sau.
Điều này cũng khớp với một kiểu mà Xiaomi từng dùng trước đây, khi một mô hình xuất hiện công khai dưới một tên khác trước khi công ty nhận nó là của mình. Thói quen của công ty là huấn luyện âm thầm, thử nghiệm công khai, rồi phát hành kèm trọng số.
Những gì bạn có thể chạy hôm nay
Không có gì thuộc dòng MiMo-V2.6 cả. Nếu bạn muốn có một mô hình Xiaomi MiMo ngay lúc này, thứ đang tồn tại là thế hệ V2.5 — trọng số mở thông qua các kênh của chính Xiaomi và một số nền tảng bên thứ ba, với model card và giá đã được công bố. Không có API MiMo-V2.6, không có mã định danh mô hình và không có bảng giá, và bất kỳ trang nào trích dẫn mã định danh MiMo-V2.6 hay mức giá theo token đều chỉ đang lấp vào khoảng trống mà Xiaomi đã để ngỏ. Các chuỗi `mimo-v2.6-pro` và `mimo-v2.6-flash` trên bảng điều khiển là tên tác vụ huấn luyện, không phải endpoint đã được công bố.
Hệ quả thực tiễn còn lại là phải làm gì trong lúc chờ đợi. Nếu lý do MiMo-V2.6-Pro khiến bạn quan tâm là vì nó có thể là một cách rẻ hơn để đạt hiệu năng lập trình ở mức tiên phong, thì những cấu hình mà nó đang được đo lường so với đều đã có thể gọi được, và bảng xếp hạng cho thấy bản rẻ hơn vẫn có sức cạnh tranh: Gemini 3.8 Flash ngang bằng tỷ lệ đạt cao nhất với $2.36 một tác vụ và được đánh dấu là cấu hình hiệu quả nhất của bảng. Gemini 3.8 Flash, Claude Opus 5 và GPT-6 Astra đều có thể truy cập được qua một khóa API OrcaRouter duy nhất ở mức giá niêm yết của nhà cung cấp với 0% markup được chuyển thẳng — vì vậy thay đổi giá từ nhà cung cấp được cập nhật ngay bên phía chúng tôi trong cùng ngày thay vì vào kỳ thanh toán tiếp theo — với cơ chế chuyển đổi dự phòng được cấu hình theo từng mô hình thay vì theo từng nhà cung cấp. Và khi một phòng thí nghiệm thực sự mở một mô hình như thế này, định tuyến nó phía sau cùng một khóa là cách đánh giá nó với mức cam kết thấp: bạn có thể đặt nó trước lưu lượng thực tế mà không phải đặt cược một đường dẫn sản xuất vào một checkpoint chưa ai mô tả đặc điểm.
Điều gì thực sự sẽ thay đổi câu chuyện này
Bốn tín hiệu, gần như theo thứ tự về mức độ mà chúng sẽ giải quyết:
• Các trọng số trên Hugging Face theo một giấy phép được nêu rõ, đó là cách thế hệ V2.5 ra đời và là bằng chứng mạnh mẽ nhất rằng lần chạy RL đã tạo ra một mô hình có thể phát hành chứ không phải một thử nghiệm đã kết thúc.
• Một model card với số lượng tham số, độ dài ngữ cảnh và kiến trúc — không có số liệu nào của V2.6 được công khai, và bảng điều khiển không hiển thị chúng. Giả định V2.6-Pro kế thừa cấu trúc 1.02T/42B của V2.5-Pro chỉ là phỏng đoán.
• Một mã định danh API và một bảng giá, đó là thời điểm con số DeepSWE trở thành một quyết định mua hàng thay vì một môn thể thao cho khán giả.
• Một bài nộp lên bảng DeepSWE của Datacurve, việc này sẽ đặt MiMo-V2.6-Pro vào cùng một bảng và dưới cùng các thanh sai số như những mô hình mà nó đang được so sánh với. Một bản đánh giá do nhà cung cấp tự chạy và một bài nộp lên bảng xếp hạng không phải là cùng một tuyên bố, và khoảng cách giữa chúng chính xác là một dòng của bảng đó.
Cho đến lúc đó, tóm tắt trung thực là Xiaomi đã thể hiện quá trình hậu huấn luyện minh bạch nhất mà bất kỳ phòng thí nghiệm lớn nào từng công bố, trên hai mô hình mà hãng chưa phát hành, với một chỉ số đánh giá chuẩn do chính họ tự báo cáo, tiệm cận — nhưng không góp mặt trong — nhóm dẫn đầu bảng xếp hạng. Bài viết chi tiết về phương pháp luận được hứa hẹn trong vài tuần tới. Còn ngày phát hành thì hoàn toàn không được hứa hẹn.
