Thẻ hero radar mô hình OrcaRouter cho Xiaomi MiMo-V2.6-Pro, có tiêu đề là tên mô hình cùng dòng 'Trọng số mở, 46 trên chỉ số, $0.43 / $0.87', với hai bảng được dán nhãn 'Những gì đã phát hành' và 'Chi phí là bao nhiêu'.
Guides & Insights

Xiaomi MiMo-V2.6-Pro đứng đầu Open-Weights Index với 46 điểm — và công bố hóa đơn huấn luyện

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Xiaomi MiMo-V2.6-Pro hiện là mô hình trọng số mở có thứ hạng cao nhất trên Chỉ số Trí tuệ Artificial Analysis, ở mức 46 trên v4.3.2 — cao hơn GLM-5.3 một điểm và cao hơn Kimi K3 hai điểm, và cao hơn 20 điểm so với mức 26 mà phiên bản tiền nhiệm MiMo-V2.5-Pro đạt được trên thang chỉ số trước đó. Con số đó được tạo ra bởi Artificial Analysis khi chạy bộ công cụ của riêng họ, không phải bởi Xiaomi, và đó là sự thật hữu ích nhất trong bản phát hành này. Sự thật hữu ích thứ hai là mức giá được in bên cạnh nó: $0.43 cho mỗi triệu token đầu vào, $0.87 cho mỗi triệu token đầu ra, so với $5.00 và $25.00 cho Claude Opus 5 — một mô hình cao hơn năm điểm chỉ số. Điều thứ ba là điều mà không ai ngờ Xiaomi lại tiết lộ: một bản kê khai công khai về chi phí thực tế của quá trình chạy học tăng cường đã tạo ra MiMo-V2.6-Pro.

Điểm số là một phép đo, không phải một lời khẳng định.

Gần như mọi thứ được công bố về một đợt ra mắt mô hình Trung Quốc đều đến dưới dạng con số do nhà cung cấp đưa ra, và độc giả đã học được cách trừ hao nó. Lần này thì khác, và sự khác biệt ấy đáng để nói cho chính xác, bởi các tin bài về đợt ra mắt đã làm nó mờ đi.

Artificial Analysis đã đánh giá chính MiMo-V2.6-Pro, trên tổ hợp v4.3.2 — mười bài đánh giá bao quát suy luận, kiến thức, toán học và lập trình, bao gồm AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience và AA-LCR v1.1. Con số 46 là kết quả mà bộ đánh giá đó trả về. Nó cũng ghi lại các đặc tính vận hành quyết định liệu một mô hình có thể dùng được hay chỉ đơn thuần là tốt: 134,3 token đầu ra mỗi giây, 2,15 giây đến token đầu tiên, chiết khấu bộ nhớ đệm 99%, và chi phí đo được là 0,13 đô la cho mỗi tác vụ Intelligence Index.

Hai trong số đó đáng được nhấn mạnh. Tốc độ 134,3 token mỗi giây đưa MiMo-V2.6-Pro lên vị trí thứ mười một trong số 114 mô hình về tốc độ — đối với một mô hình mixture-of-experts nghìn tỷ tham số, đó là kết quả phục vụ, chứ không chỉ là kết quả huấn luyện. Và mức 0,13 đô-la mỗi tác vụ là con số trụ được khi đối chiếu với ngân sách: đó là chi phí thực tế để chạy chỉ số này trên mô hình này, được đo theo cùng một cách trên mọi mô hình trong bảng, khiến nó có thể so sánh được theo cách mà các mức giá mỗi token được quảng bá không thể.

Scoreboard card headed 'Xiaomi MiMo-V2.6-Pro — the scoreboard', listing the index score of 46 on Intelligence Index v4.3.2 as the highest of any open-weights model, the open-weights field behind it at GLM-5.3 45 and Kimi K3 44, the top of the same index at Claude Fable 5.1 53, GPT-6 Astra 53 and Claude Opus 5 51, serving at 134.3 output tokens per second and 2.15 seconds to first token, a price of $0.43 in and $0.87 out per million tokens with a 99% cache discount and $0.13 per index task, MIT-licensed weights at 1.02T total and 42B active parameters with a 1M-token context window and text, image, video and audio input, and a route count of one API provider.

Chỉ số này bao gồm và không bao gồm những gì

Ngôi vương open-weights là có thật nhưng hẹp hơn vẻ ngoài của nó. Ở mức 46, MiMo-V2.6-Pro dẫn đầu hạng mục open-weights. Nó không dẫn đầu bảng xếp hạng. Đứng đầu v4.3 là Claude Fable 5.1 ở mức nỗ lực tối đa với fallback mặc định và GPT-6 Astra ở mức nỗ lực tối đa, cả hai đều đạt 53, cùng Claude Opus 5 ở 51 và Claude Fable 5 ở 50. Vậy nên cách diễn đạt trung thực là khoảng cách năm điểm so với nhóm tiên phong trên một chỉ số tổng hợp đề cao độ bao phủ, và mức cải thiện hai mươi điểm so với thế hệ trước của chính Xiaomi.

• Dẫn đầu về trọng số mở — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44

• Đứng đầu cùng chỉ số — Claude Fable 5.1 (tối đa, dự phòng) 53, GPT-6 Astra (tối đa) 53, Claude Opus 5 (tối đa) 51

• Tốc độ — 134,3 token đầu ra/giây, đứng thứ mười một trong số 114 mô hình được đo; mức trung vị cho hạng kích thước này là 77,9

• Thời gian đến token đầu tiên — 2,15 giây, so với trung vị 2,34 giây

Chi phí cho mỗi tác vụ Intelligence Index — $0.13, với toàn bộ đánh giá tốn $206.66 để chạy

• Mức giá niêm yết — 0,43 USD mỗi triệu token đầu vào, 0,87 USD mỗi triệu token đầu ra, chiết khấu bộ nhớ đệm 99% và mức giá kết hợp 0,18 USD ở tỷ lệ 7:2:1 giữa lượt trúng bộ nhớ đệm/đầu vào/đầu ra

Một con số trên trang Artificial Analysis là một lưu ý thực sự chứ không phải một lời khoe: tại thời điểm viết bài, nó chỉ tính một nhà cung cấp API duy nhất cho MiMo-V2.6-Pro. Đó hiện là nút thắt thực tế của mô hình này, và đó không phải là vấn đề chất lượng — mà là vấn đề tính khả dụng. Một mô hình chỉ có thể truy cập qua một tuyến thì không có cơ chế chuyển đổi dự phòng. Nếu tuyến đó suy giảm, ứng dụng của bạn cũng suy giảm theo, và khả năng chuyển đổi dự phòng chính là điều mà một router tồn tại để cung cấp. Điểm quan sát đáng lưu ý cho bất kỳ ai đang lên kế hoạch xoay quanh bản phát hành này là chúng tôi không tự vận hành MiMo-V2.6-Pro, và chúng tôi sẽ không giả vờ điều ngược lại; cách truy cập nó hiện nay là nền tảng của chính Xiaomi và một vài danh mục bên thứ ba có liệt kê nó.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, showing the Intelligence Index score of 46 on version 4.3.2, the listed price of $0.43 per million input tokens and $0.87 per million output tokens, a 99% cache discount, output speed of 134.3 tokens per second, time to first token of 2.15 seconds, and the open-weights attribution with the MIT licence.

Hai con số không được nhầm lẫn với nhau

Xiaomi cũng công bố các số liệu đánh giá chuẩn của riêng mình, và chúng là một loại đối tượng khác với 46. Bảng điều khiển của công ty báo cáo MiMo-V2.6-Pro tăng từ 58.4 lên 72.57 trên DeepSWE v1.1 trong suốt quá trình chạy học tăng cường của nó, được đánh giá bằng mini-swe-agent theo trung bình của ba lần. Đó là bộ khung đánh giá của Xiaomi, trình chấm điểm của Xiaomi, lần chạy ngoại tuyến của Xiaomi. Nó chưa được gửi lên bảng xếp hạng DeepSWE công khai và chưa được bất kỳ ai tái tạo lại.

Đọc hai con số đặt cạnh nhau, rất dễ nảy sinh ý muốn coi 72,57 như một điểm số ngang hàng với 74% mà bảng DeepSWE công khai liệt kê ở nhóm dẫn đầu. Chúng không cùng một thang đo. Con số trên bảng xếp hạng là một cấu hình đã được nộp, theo Pass@1, kèm một khoảng tin cậy được công bố và chi phí trung bình cho mỗi tác vụ; còn con số của nhà cung cấp là một đánh giá nội bộ, không hề có những thứ đó đi kèm. Bài viết ngày 21 tháng 9 của chúng tôi đã nêu rõ điểm này khi các con số vẫn còn là những chỉ số trên bảng điều khiển, và điều đó vẫn đúng cho tới nay khi các trọng số đã được công bố. Một bộ kiểm thử của nhà cung cấp có thể hoàn toàn trung thực mà vẫn không phải là một mục trên bảng xếp hạng, bởi vì mục trên bảng xếp hạng là một tuyên bố về một cấu hình cụ thể trong những điều kiện cụ thể mà bên thứ ba có thể chạy lại.

Kỷ luật tương tự cũng được áp dụng cho chi phí huấn luyện. Xiaomi báo cáo khoảng 3.474.715 đô la cho cả hai lần chạy Pro và Flash — 2.620.670 đô la cho Pro, 854.044 đô la cho Flash — với hơn ba mươi bước học tăng cường mỗi lần và khoảng 750.000 quỹ đạo mỗi lần, hoàn thành trong vòng chưa đầy sáu ngày. Đó là những con số hạch toán tính toán của chính công ty. Chúng thú vị vì các phòng thí nghiệm hầu như không bao giờ công bố chúng, và chúng không phải là giá API, không phải là chi phí bạn sẽ phải trả, và không phải là con số mà bất kỳ bên thứ ba nào đã kiểm toán.

Điều gì Xiaomi thực sự đã tung ra

Bản phát hành này là một mô hình hỗn hợp chuyên gia thưa với tổng cộng 1,02 nghìn tỷ tham số, 42 tỷ tham số được kích hoạt trên mỗi token, cửa sổ ngữ cảnh 1 triệu token và tính đa phương thức gốc trên văn bản, hình ảnh, video và âm thanh. Mô hình anh em Xiaomi MiMo-V2.6-Flash của nó có cùng kiến trúc ở quy mô nhỏ hơn, tổng 309 tỷ và 15 tỷ tham số hoạt động. Các trọng số được công bố mang nhãn giấy phép MIT, và gói phát hành bao gồm báo cáo kỹ thuật, hướng dẫn triển khai, và — theo Xiaomi — môi trường huấn luyện học tăng cường cùng mã cần thiết để kiểm tra và tái tạo quá trình hậu huấn luyện.

Điểm cuối cùng đó là khác biệt thực chất giữa lần ra mắt này và một thông báo API thông thường, và nó đáng được tách khỏi phần tiếp thị. Việc công bố môi trường RL là một tuyên bố rằng thiết lập huấn luyện có thể được kiểm chứng. Liệu các môi trường được công bố có đủ để tái tạo 72.57 hay không là một câu hỏi riêng sẽ được giải quyết bởi những người thử làm điều đó, chứ không phải bởi ghi chú phát hành. Ghi chú huấn luyện của chính Xiaomi mô tả một lần chạy kết hợp các nhiệm vụ lập trình, tác nhân tổng quát, thị giác và an ninh mạng trong một lượt, với các bộ chấm điểm xếp hạng các quỹ đạo thành công và phân bổ lại phần thưởng về phía những đường đi tốt hơn — và chúng cũng ghi lại các thất bại: một lần khởi động lại GPU do hết bộ nhớ, gây ra bởi sự mất cân bằng tải của các chuyên gia; một lỗi mạng giữa cụm huấn luyện và triển khai bộ chấm điểm; và một lần khởi động lại Flash sau khi một lỗi hạ tầng không bị phát hiện trong khoảng ba giờ. Việc công bố cả những lỗi cùng với những thành quả chính là phần khiến phần còn lại của nội dung tiết lộ trở nên đáng tin cậy.

Chi phí để gọi là bao nhiêu, và vấn đề định tuyến nằm ở đâu

Ở mức $0,43 và $0,87 mỗi triệu token, MiMo-V2.6-Pro có giá như một mô hình tầm trung và được benchmark như một mô hình open-weights tiên tiến. Xiaomi đã giữ nguyên mức giá tiêu chuẩn của thế hệ MiMo-V2.5 trước đó thay vì tăng giá cho checkpoint mới, đó là lý do mức giá này trông thấp so với số lượng tham số. Mức chiết khấu cache 99% nghĩa là một vòng lặp agent dùng nhiều cache đọc ngữ cảnh của nó gần như không tốn gì, và đó chính là nơi hóa đơn của một agent dài hạn thực sự tích lũy.

Có một phiên bản của thương vụ này định tuyến trơn tru và một phiên bản thì không. Phiên bản trơn tru: những mô hình tiên phong mà bạn sẽ đem MiMo-V2.6-Pro ra so sánh — Claude Opus 5 ở mức $5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — đều có thể truy cập được qua một khóa OrcaRouter duy nhất với giá niêm yết của nhà cung cấp, mức chênh giá 0%, nên việc nhà cung cấp cắt giảm giá đối với bất kỳ mô hình nào trong số đó sẽ có hiệu lực ngay bên phía chúng tôi trong cùng ngày, và một quy tắc định tuyến có thể gửi yêu cầu tới mô hình thứ hai khi mô hình thứ nhất chậm hoặc không khả dụng. Điều này ở đây quan trọng hơn mức thông thường, bởi vì mô hình có điểm open-weights tốt nhất cũng chính là mô hình có tuyến truy cập mỏng manh nhất. Kết hợp cả hai — một làn open-weights giá rẻ cho khối lượng công việc lớn và một làn tiên phong cho phần đuôi khó nhằn — là một quyết định định tuyến, và đó là kiểu quyết định không còn là một canh bạc ngay khi cả hai làn cùng nằm trên một khóa.

Thêm một sản phẩm nữa cần phân biệt cho rõ, vì rất dễ bị nhầm lẫn với mô hình: Xiaomi cũng đang cung cấp MiMo-V2.6-Pro-UltraSpeed, một hạng phục vụ được host, được xây dựng từ cùng một checkpoint. Tài liệu của chính Xiaomi tuyên bố tốc độ đầu ra nhanh gấp tối đa hai mươi lần so với dịch vụ Pro tiêu chuẩn với cùng chất lượng; các danh mục niêm yết của bên thứ ba mô tả khoảng gấp mười lần. Đó là hai con số khác nhau mô tả cùng một hạng, chưa ai công bố phân bố độ trễ theo từng yêu cầu để dung hòa chúng, và hạng này có mức giá cao hơn đáng kể. Không có gì ở UltraSpeed thay đổi những gì các trọng số có thể làm — nó thay đổi tốc độ mà máy chủ của người khác sẽ chạy chúng.

Điều gì sẽ thay đổi bức tranh này

Ba điều, theo thứ tự mức độ quan trọng của chúng.

Một tuyến phục vụ thứ hai và thứ ba. Số lượng nhà cung cấp đơn lẻ trên Artificial Analysis là ràng buộc đối với mọi thứ khác. Nhiều tuyến hơn nghĩa là có chuyển đổi dự phòng, nghĩa là có cạnh tranh về giá ở tầng phục vụ, và nghĩa là mô hình có thể được đưa vào lộ trình sản xuất thay vì chỉ là một thử nghiệm.

Việc tái lập độc lập các số liệu của DeepSWE. Con số 46 vốn đã độc lập; còn 72,57 thì không. Nếu các lần chạy từ bên ngoài cho kết quả gần với nó, lập luận ủng hộ mô hình sẽ mạnh lên đáng kể. Nếu chúng thấp hơn một cách đáng kể, con số của Artificial Analysis vẫn là con số đáng tin, còn con số của nhà cung cấp sẽ gia nhập danh sách dài những tuyên bố khi ra mắt đã không trụ nổi khi tiếp xúc với thực tế.

Timeline card headed 'MiMo-V2.6-Pro — what was disclosed, and by whom', with six dated rows: 21 September 2026 weights, technical report, deployment instructions and RL environments published; 22 September 2026 Xiaomi's launch page carrying the DeepSWE v1.1 figures and the training-spend accounting; the independent Artificial Analysis score of 46 on v4.3.2; the vendor harness result moving 58.4 to 72.57 on DeepSWE v1.1; the vendor accounting of $2,620,670 for Pro and $854,044 for Flash across the RL runs; and a route count of one API provider.

Phân tích chi tiết theo từng đánh giá. Điểm tổng hợp thì chỉ là điểm tổng hợp. Việc MiMo-V2.6-Pro thắng những đánh giá nào trong mười đánh giá và thua những đánh giá nào chính là khác biệt giữa một mô hình bạn triển khai cho lập trình agentic và một mô hình bạn triển khai cho hỏi đáp thiên về truy xuất, còn chỉ số đơn thuần thì không cho bạn biết điều đó. Chi tiết đó là thứ cần theo dõi tiếp theo, và là thứ mà một cấu hình định tuyến cần có trước khi nó đáng để ghi lại.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày