Thẻ tiêu đề hero cho bài viết 'MiMo-V2.6: Bài báo RL cho thấy điều gì', với dòng chữ nhỏ phía trên là 'BÁO CÁO KỸ THUẬT' và phụ đề 'Báo cáo mixed-RL của Xiaomi, được đọc để xem nó kiểm chứng điều gì và không kiểm chứng điều gì'. Bốn chip bo tròn ghi 'Router MoE đóng băng', 'Chi phí grader 12.7%', 'DeepSWE 58.4 đến 72.6' và 'AA Index 46'. Một dòng chân trang ghi 'Số liệu DeepSWE do nhà cung cấp báo cáo; AA Index 46 do Artificial Analysis đo lường.' Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

MiMo-V2.6: Bài báo về RL của Xiaomi thực sự cho thấy điều gì, và điều gì vẫn chưa được kiểm chứng

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hầu hết các bài báo về mô hình được công bố trong tháng này là các bài báo về kiến trúc. Báo cáo kỹ thuật đằng sau Xiaomi MiMo-V2.6-Pro và Xiaomi MiMo-V2.6-Flash thì không phải vậy. Có tiêu đề MiMo-V2.6: Mở rộng quy mô Học tăng cường Hướng tới Tự cải thiện, được nộp vào ngày 21 tháng 9 năm 2026 và được ghi công cho LLM-Core Xiaomi, báo cáo này dành gần như không chút độ dài nào cho kiến trúc xương sống hỗn hợp các chuyên gia thưa thớt và gần như toàn bộ cho một câu hỏi: điều gì xảy ra khi toàn bộ ngân sách hậu huấn luyện được dồn vào một lần chạy học tăng cường hỗn hợp duy nhất. Báo cáo của DeepSeek-V4.1-Flash, ngược lại, là một tài liệu về bộ nhớ — độ dài của nó dành cho cơ chế chú ý thưa thớt nén, tái sử dụng KV xuyên lớp và lưu trữ FP4. Đặt hai báo cáo cạnh nhau, chúng là những lập luận về nguồn gốc của năng lực, và chúng không đồng thuận với nhau.

Báo cáo đáng đọc theo cách riêng của nó, nhưng cần đọc cẩn thận, vì đây là báo cáo tự thuật từ chính phòng thí nghiệm đã thực hiện lần chạy đó. Nó nêu tên các cơ chế, trình bày các phép ablation, công bố những thất bại của mình, và đồng thời báo cáo những con số không thể kiểm chứng từ bên ngoài. Tách biệt hai điều đó là phần lớn công việc. Bài viết này làm điều đó, và nó được viết vào ngày 23 tháng 9 năm 2026 — hai ngày sau khi các checkpoint được đưa lên, khi bài báo là thứ mới nhất và ít được kiểm chứng nhất về chúng.

Tại sao ngày trên tờ giấy lại quan trọng hơn thường lệ

Các checkpoint MiMo-V2.6-Pro và MiMo-V2.6-Flash của Xiaomi đã có mặt trên model hub vào ngày 21 tháng 9 năm 2026, được cấp phép MIT và không bị hạn chế truy cập. Báo cáo được ghi ngày cùng ngày và đã đạt vị trí đứng đầu danh sách thịnh hành trên trang preprint nơi nó được đăng. Chính thời điểm đó là lý do đây là một bài tin tức chứ không phải một bài hồi cứu: bài báo không phải là lời giải thích về sau cho một mô hình mà ai cũng đã benchmark rồi. Nó đến cùng lúc với các trọng số, trước khi bất kỳ ai ngoài Xiaomi công bố một lần chạy độc lập.

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

Thứ tự đó cũng chính là điểm yếu chính của bài báo với tư cách là bằng chứng. Mọi thứ phía sau nó — đường cong DeepSWE, mức tăng tỷ lệ đạt, lập luận phòng vệ chống reward hacking — đều là một khẳng định về một quá trình huấn luyện đã diễn ra một lần, trong một phòng thí nghiệm, trên một cụm máy, và chưa từng có ai khác tái lập được. Luồng thảo luận đã đánh dấu báo cáo này coi đó là phần thú vị: đây là một bài báo về dữ liệu và thí nghiệm, không phải một bài báo về kiến trúc, và thí nghiệm đúng là kiểu kết quả mà hoặc tái lập được hoặc không.

Ba trục của việc mở rộng quy mô, và chỉ một trong số đó là vấn đề về phần cứng

Cách trình bày của báo cáo là compute của học tăng cường đã được mở rộng theo ba trục cùng một lúc, và trục thứ ba chính là trục làm thay đổi cách bạn nghĩ về phương pháp này.

• Batch và thông lượng — 1,568 mẫu mỗi lần cập nhật, mở rộng thành mười sáu rollout mỗi mẫu, do đó khoảng 25,000 quỹ đạo mỗi bước, tiêu thụ 2.7 đến 3.7 tỷ token mỗi bước ở độ dài ngữ cảnh lên tới một triệu token. Kiến trúc rollout hoàn toàn bất đồng bộ, và đó chính là điều khiến kích thước batch đó có thể chịu đựng được.

• Môi trường — một lượt chạy hỗn hợp duy nhất xuyên qua các tác vụ lập trình, tác nhân tổng quát, thị giác và không gian mạng, dưới nhiều khung tác nhân cùng một lúc, thay vì các lượt chạy RL riêng theo từng lĩnh vực. Cách gọi tắt của chính Xiaomi cho việc này là "You Only RL Once." Lập luận cho việc trộn là những lợi ích đạt được ở một năng lực sẽ củng cố các năng lực khác; rủi ro là một loại tác vụ chậm có thể bị bỏ đói, mà báo cáo nói rằng nó xử lý bằng lập lịch thích ứng.

• Tính toán của bộ chấm điểm — trục không nói về GPU theo nghĩa thông thường. Đạt/không đạt nhị phân không thể xếp hạng hai lời giải đều đạt, nên chính tín hiệu phần thưởng trở thành thứ bạn mở rộng quy mô. Một bộ chấm điểm dạng tác tử so sánh mười sáu lần thử cho một tác vụ cùng nhau và tạo ra một tín hiệu có phân mức thay vì một bit.

Trục thứ ba đó là nơi cụm từ “self-improvement” trong tiêu đề xứng đáng có chỗ đứng, và cũng là nơi báo cáo dễ bị tấn công nhất. Một mô hình tự chấm điểm các rollout của chính nó là một bề mặt để hack phần thưởng, và báo cáo coi đó đúng là như vậy.

Hai cơ chế thực sự đáng để hiểu

Tái phân phối lợi thế theo nhóm

Sau mỗi bước, chính sách tạo ra mười sáu lần thử cho mỗi tác vụ và tất cả chúng được đặt trong một không gian làm việc chung để một mô hình đánh giá có thể xem xét chúng cùng nhau thay vì từng cái một. Các bản vá đạt yêu cầu sau đó được chấm điểm theo năm tiêu chí: liệu cách tiếp cận có phù hợp với vấn đề không, liệu phần triển khai có chính xác mà không có các phương án dự phòng không cần thiết không, liệu thay đổi có tối thiểu không, liệu nó có chỉnh sửa bất cứ thứ gì ngoài phạm vi không, và liệu nó có khớp với phong cách mã xung quanh không. Các lượt đạt xếp hạng thấp hơn nhận ít củng cố tích cực hơn. Một bản vá được xác nhận là hack sẽ bị đặt lại về không và bị coi là thất bại.

Hệ quả là một tín hiệu huấn luyện thúc đẩy theo hướng các giải pháp ngắn hơn, rẻ hơn thay vì chỉ đơn thuần đúng — báo cáo mô tả điều này như việc hướng tới ít token hơn cho mỗi tác vụ. Đó là phần cần ghi nhớ, bởi vì các kết quả nổi bật ở phần sau của bài báo lại chỉ ra điều ngược lại.

Tổng hợp Phần thưởng theo Nhóm

Nửa ngoại tuyến của cùng ý tưởng đó. Thay vì suy ra chất lượng hoàn toàn từ một bộ chấm điểm trực tiếp, nhóm tính trước các rubric theo từng tác vụ và nhân phần thưởng kiểm thử nhị phân với điểm chất lượng và điểm hành vi rút ra từ những rubric đó. Báo cáo mô tả việc này là xây dựng các rubric từ những rollout tương phản — tức là từ những trường hợp kết quả khác nhau, nơi thông tin thực sự nằm ở đó.

Chấm điểm không hề miễn phí. Báo cáo ước tính chi phí chấm điểm chiếm khoảng 12,7% tổng chi phí học tăng cường của MiMo-V2.6-Pro. Chỉ riêng con số đó là điều hữu ích nhất trong bài báo đối với bất kỳ ai đang cân nhắc sao chép phương pháp này, vì nó biến “mở rộng quy mô các bộ chấm điểm của bạn” từ một ý tưởng thành một mục chi phí.

Router đóng băng là kết quả mà hầu hết các đội nhóm sẽ sao chép đầu tiên

Phần tính ổn định của báo cáo chứa một phát hiện tự đứng vững, độc lập với MiMo-V2.6 và độc lập với việc mô hình hoạt động tốt đến đâu.

Với các bộ định tuyến mixture-of-experts có thể huấn luyện, tải của các chuyên gia đã trôi dạt nghiêm trọng qua hai mươi bước. Hệ số biến thiên giữa các chuyên gia tăng từ 0,78 lên 2,0. Tải đỉnh trên chuyên gia bận rộn nhất đi từ gấp sáu lần mức trung bình lên gấp mười sáu lần. Tỷ lệ các chuyên gia nguội — những chuyên gia nhận gần như không có lưu lượng — đi từ 0,5% lên 22%. Khôi phục trọng số bộ định tuyến về giá trị ban đầu tại bước 20 đã lập tức khôi phục lại sự cân bằng.

Phản hồi của Xiaomi là đóng băng bộ định tuyến MoE trong suốt lần chạy. Lý do không hề khó hiểu: ở quy mô batch này, sự bất ổn định định tuyến là một vấn đề động lực học huấn luyện mà bạn có thể đơn giản chọn không mắc phải, và bộ định tuyến không phải là nơi học tăng cường đang thực hiện công việc của nó. Liệu việc đóng băng có gây tốn kém gì về chất lượng cuối cùng hay không vẫn chưa được trả lời bằng một phép ablation trong tài liệu đã công bố, và đó là một điều chính đáng để mong muốn.

Điều mà phát hiện này không đề cập đến là bất cứ điều gì liên quan đến serving. Cân bằng tải router trong một lần chạy huấn luyện và mức sử dụng expert dưới lưu lượng production là những câu hỏi khác nhau, và báo cáo chỉ đề cập đến câu hỏi đầu tiên.

Các con số, cùng với nhãn của chúng được gắn kèm

Các kết quả nổi bật của báo cáo thì rõ ràng về hình thức nhưng lộn xộn về chi tiết, và sự lộn xộn đó không phải là một vụ bê bối — đó là ba phép đo khác nhau của ba đối tượng khác nhau cùng chung một cái tên.

• DeepSWE v1.1, được giữ riêng để đánh giá — MiMo-V2.6-Pro tăng từ 58.4 lên 72.6 trong suốt lần chạy; MiMo-V2.6-Flash từ 48.7 lên 65.7. Bộ đánh giá này gồm 113 tác vụ kỹ thuật kho mã nguồn theo tầm nhìn dài hạn, được chấm bởi các bộ kiểm định chức năng trên năm ngôn ngữ lập trình, và chỉ số là average@3 — tỷ lệ vượt qua trung bình của bộ kiểm định qua ba lần thử được lấy mẫu, vốn không đồng nghĩa với việc liệu có bất kỳ lần nào trong ba lần thử đó thành công hay không. Đọc avg@3 như pass@3 sẽ thổi phồng mọi con số trên trang.

• Cùng một benchmark, nhưng được đo ở nơi khác — các model card đã phát hành ghi 71,9 cho Pro và 67,9 cho Flash. Bảng điều khiển huấn luyện công khai của Xiaomi ghi 72,57 và 65,68. Vậy là có ba con số được công bố cho mỗi model, hai trong số đó đến từ Xiaomi, và hướng chênh lệch lại khác nhau ở mỗi model. Không con số nào sai cả; chúng mô tả một ảnh chụp bảng điều khiển, một mục trong model card và một dòng trong báo cáo, ở những thời điểm khác nhau và có thể dưới những harness khác nhau.

• Chưng cất — MiMo-V2.6-Distill-Qwen-9B, được tinh chỉnh từ Qwen3.5-9B trên các bản trình diễn do MiMo tạo ra, đã đưa SWE-bench Verified từ 61,1 lên 66,2. Đây là con số có khả năng chuyển giao cao nhất trong bài báo, vì một mô hình học trò 9B là kích cỡ mà hầu hết các đội thực sự có thể chạy.

• Một bài đánh giá chuẩn nhỏ nội bộ về an ninh mạng — 31,3 đến 47,0. Nội bộ nghĩa là nội bộ: các nhiệm vụ không được công bố, nên mức chênh lệch không thể được tái lập ngay cả về nguyên tắc.

• Artificial Analysis Intelligence Index — 46 cho MiMo-V2.6-Pro. Chỉ số này khác về bản chất. Nó được Artificial Analysis tạo ra bằng cách chạy harness riêng của họ trên checkpoint đã phát hành, chứ không phải do Xiaomi tạo ra, khiến nó trở thành con số tiêu đề duy nhất trong bản phát hành này mà người đọc có thể coi là được đo lường thay vì được báo cáo. Đây cũng là con số để so sánh với GLM-5.3, Kimi K3 và closed frontier, và nó thấp hơn Claude Opus 5 năm điểm.

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

Báo cáo trung thực về những giới hạn trong bảng của chính nó, và đây là câu đáng để trích dẫn lại cho bất cứ ai không như vậy: các so sánh trộn lẫn giữa benchmark công khai và nội bộ, và không tách bạch được đóng góp của học tăng cường khỏi kiến trúc hay tiền huấn luyện. Một mô hình tốt hơn sau RL không phải là bằng chứng rằng RL chính là lý do.

Có một lưu ý thứ hai, và đây là lưu ý đi ngược lại với cách diễn giải đó. Những mức tăng được báo cáo thường đi kèm với việc sử dụng token ngày càng tăng. Báo cáo trình bày điều đó như là sự cải thiện năng lực bền vững chứ không phải là hiệu quả, và như vậy là đúng. Nhưng GAR được thiết kế rõ ràng để hướng tới những đường đi ngắn hơn và ít token hơn mỗi tác vụ, và kết quả tổng hợp lại không cho thấy khối lượng công việc trở nên rẻ hơn. Năng lực tăng lên; chi phí mỗi tác vụ không giảm xuống. Nếu bạn hiểu “tự cải thiện” là “mô hình sẽ cần ít tiền của tôi hơn trong quý tới”, thì bài báo không ủng hộ cách hiểu đó.

Những gì báo cáo để ngỏ chưa được xác minh

Tính đến ngày 23 tháng 9 năm 2026, chưa có bên thứ ba nào công bố một lần chạy lại độc lập các cột DeepSWE, Terminal Bench hay CyberGym. Điều khác biệt quan trọng nằm giữa điểm chỉ số và mọi thứ còn lại: 46 là một phép đo do người khác thực hiện, còn 72.6 là một tuyên bố về một lần chạy huấn luyện mà không ai có thể chạy lại, bởi vì lần chạy đó được báo cáo tốn 2,6 triệu đô la cho Pro và 0,9 triệu đô la cho Flash, và sẽ không diễn ra lần thứ hai.

Điều mà Xiaomi đã công bố còn hầu hết các phòng thí nghiệm không làm là động thái huấn luyện, khung học tăng cường và các môi trường tác vụ — hơn 7.000 môi trường được phân cấp thuộc lĩnh vực kỹ thuật phần mềm, tái hiện lỗ hổng, công việc tri thức và thiết kế web. Đó là tạo tác có tuổi thọ dài nhất. Các trọng số cho bạn biết lần chạy đã tạo ra gì; các môi trường cho bạn biết cách tự mình thực hiện thí nghiệm, vốn là cách duy nhất để mọi tuyên bố về RL có thể được giải quyết.

Biện pháp phòng vệ chống reward hacking xứng đáng có một lưu ý cụ thể. Nó được mô tả là nhiều lớp — thiết kế phần thưởng, đánh giá đối kháng, phát hiện bất thường và kiểm tra chéo giữa các bên xác minh — và nó được mô tả hoàn toàn bởi chính bên sẽ bị bẽ mặt nếu nó thất bại. Một biện pháp phòng vệ chống lại việc mô hình lợi dụng một bộ chấm điểm dựa trên mô hình không phải là thứ mà một báo cáo tự thuật có thể khép lại. Cơ chế đã được nêu tên và kiểu thất bại đã được thừa nhận, điều mà hầu hết các bài báo không làm được, và nó vẫn là một câu hỏi mở.

Những gì bạn thực sự có thể làm với điều này ngay hôm nay

Cả hai checkpoint đều có thể tải xuống, không bị hạn chế, dưới thẻ giấy phép MIT: Xiaomi MiMo-V2.6-Pro-RL và Xiaomi MiMo-V2.6-Flash-RL, đa phương thức toàn diện, ngữ cảnh một triệu token, với chỉ mục Flash báo cáo 172,9 GB dữ liệu trọng số trên 65 shard ở FP8. Xiaomi chưa công bố bảng giá theo token cho thế hệ V2.6, nên lựa chọn hiện nay là tự vận hành so với một mô hình được host mà bạn đã trả phí.

Phép so sánh đó chính là nơi giá trị thực tiễn của bài báo nằm, và nó không tâng bốc bài báo theo một cách hữu ích. Tuyên bố được kiểm nghiệm không phải là “MiMo-V2.6-Pro có tốt không” — 46 câu trả lời đã giải đáp điều đó. Mà là “liệu học tăng cường trên các tác vụ agent hỗn hợp có tạo ra năng lực suy luận chuyển giao được sang khối lượng công việc của tôi hay không”, và cách trung thực duy nhất để trả lời là chạy cả hai rồi so sánh, vốn là một bài toán định tuyến trước khi là một bài toán nghiên cứu. DeepSeek-V4.1-Flash chỉ cách một khóa API, với $0.15 và $0.60 mỗi triệu token, Qwen3.8-Flash và GLM-5.3-Flash dùng chung khóa đó, và nếu bạn muốn đặt một checkpoint MiMo tự triển khai phía sau cùng endpoint đó trong một tuần và xem liệu đường cong DeepSWE có xuất hiện trong các đánh giá của chính bạn hay không, thì đó là một thay đổi cấu hình chứ không phải một cuộc di trú. OrcaRouter không lưu trữ các mô hình của Xiaomi, và không có gì ở đây nên được hiểu là đang tuyên bố điều ngược lại — nhưng những mô hình mà bạn sẽ đánh giá so sánh với chúng đều có thể truy cập được thông qua một khóa API OrcaRouter duy nhất ở mức giá niêm yết của nhà cung cấp với 0% markup được chuyển nguyên, cùng với failover tự động nếu một checkpoint bạn đang thử nghiệm hóa ra không ổn định dưới tải.

Trường hợp mô hình chưa được kiểm chứng chính là trường hợp mà failover được tạo ra để xử lý. Một checkpoint được công bố cách đây hai ngày, với đánh giá do nhà cung cấp thực hiện và không có lần chạy lại độc lập nào, đúng chính là thứ bạn muốn thử mà không đặt một luồng production phía sau nó.

Ai nên đọc bài báo này

Nếu bạn chạy post-training, hãy đọc nó để lấy phát hiện về router và con số chi phí grader. Cả hai đều dễ mang đi áp dụng, cả hai đều rẻ để thử nghiệm, và không cái nào phụ thuộc vào việc bạn phải tin bất cứ điều gì về bảng benchmark của MiMo-V2.6. Riêng kết quả frozen-router đúng là kiểu thứ chỉ tốn một buổi chiều để thử mà tiết kiệm cả một lần chạy.

Nếu bạn đang chọn một mô hình, hãy đọc điểm chỉ số rồi bỏ qua phần còn lại. Artificial Analysis đo được 46 trên artifact đã phát hành; đó là con số duy nhất trong bản phát hành này không đến từ nhà cung cấp, và nó đưa MiMo-V2.6-Pro lên đầu lĩnh vực open-weights, kém Claude Opus 5 năm điểm. Mọi thứ còn lại trong báo cáo mô tả cách Xiaomi đạt được điều đó, và cách Xiaomi đạt được điều đó không phải là thứ bạn có thể mua.

Và nếu bạn đang đọc các bài đưa tin thay vì đọc bài báo, điều cần để ý là từ “tự cải thiện”. Kết quả của chính báo cáo cho thấy năng lực tăng lên song song với việc sử dụng token, một phát hiện thực sự và có thể lặp lại về việc mở rộng quy mô học tăng cường. Đó không phải là khẳng định rằng mô hình trở nên rẻ hơn để vận hành, và những bài báo tiếp theo sau bài này sẽ cho bạn biết liệu cuối cùng điều đó có xảy ra hay không.