Thẻ hero radar mô hình OrcaRouter cho so sánh giữa MiMo-V2.6-Pro và DeepSeek V4 Pro, với phụ đề 'Hai flagship mở, cách nhau mười điểm chỉ số.', với một panel cho mỗi mô hình và chân trang ghi chú rằng cả hai đều được cấp phép theo MIT với cửa sổ ngữ cảnh 1M token và rằng điểm số là v4.3.2 và không thể so sánh với các phiên bản chỉ số trước đó.
Guides & Insights

MiMo-V2.6-Pro vs DeepSeek V4 Pro: Hai flagship mở, cách nhau mười điểm chỉ số

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Xiaomi MiMo-V2.6-Pro và DeepSeek V4 Pro là cùng một loại đối tượng — những mô hình chủ lực mixture-of-experts Trung Quốc với hàng nghìn tỷ tham số, giấy phép MIT, ngữ cảnh 1M token, trọng số mở mà bạn có thể tải về ngay hôm nay — và chúng cách nhau mười điểm trên Artificial Analysis Intelligence Index v4.3.2, 46 so với 36. Chúng cũng bất đồng về việc một mô hình chủ lực dùng để làm gì. DeepSeek V4 Pro, ra mắt ngày 13 tháng 8 năm 2026, là một mô hình suy luận chỉ dùng văn bản: 1,6 nghìn tỷ tham số với 49 tỷ tham số hoạt động, và không có đầu vào thị giác, âm thanh hay video ở bất kỳ đâu trong bề mặt công bố của nó. Xiaomi MiMo-V2.6-Pro, ra mắt ngày 21 tháng 9 năm 2026, có 1,02 nghìn tỷ tham số với 42 tỷ tham số hoạt động và tiếp nhận văn bản, hình ảnh, video và âm thanh. Sự khác biệt đó quyết định nhiều triển khai hơn mức mười điểm kia, và đó là điều đầu tiên cần giải quyết trước khi bạn so sánh bất cứ thứ gì khác.

Cùng một giấy phép, các máy khác nhau

Hãy bắt đầu với những gì thực sự giống hệt nhau, vì điều đó nhiều hơn mức bạn có thể mong đợi ở hai phòng thí nghiệm đối thủ. Cả hai đều được phát hành dưới thẻ giấy phép MIT trên các kho lưu trữ công khai, nghĩa là có thể triển khai thương mại, sửa đổi và huấn luyện thêm mà không cần rào cản doanh thu hay điều khoản giới hạn lĩnh vực sử dụng. Cả hai đều tuyên bố cửa sổ ngữ cảnh 1M token. Cả hai đều là thiết kế mixture-of-experts thưa — kiến trúc này đã trở thành mặc định ở quy mô này, chứ không phải yếu tố khác biệt. Và cả hai đều được huấn luyện bởi các phòng thí nghiệm công bố ít hơn về phương pháp so với các phòng thí nghiệm tiên phong phương Tây.

• Tham số — MiMo-V2.6-Pro tổng 1,02T / kích hoạt 42B; DeepSeek V4 Pro tổng 1,6T / kích hoạt 49B

• Phương thức đầu vào — MiMo-V2.6-Pro: văn bản, hình ảnh, video, âm thanh; DeepSeek V4 Pro: chỉ văn bản

• Ngữ cảnh — cả hai đều 1M token; DeepSeek V4 Pro giới hạn đầu ra ở mức 384K token

• Điểm chỉ số — MiMo-V2.6-Pro đạt 46 trên Intelligence Index v4.3.2; DeepSeek V4 Pro đạt 36 trên cùng phiên bản

• Chi phí cho mỗi tác vụ Index — MiMo-V2.6-Pro $0.13; DeepSeek V4 Pro $0.67

• Mức giá niêm yết — MiMo-V2.6-Pro $0.43 / $0.87 trên mỗi 1 triệu token; DeepSeek V4 Pro $1.32 / $3.96 theo như Artificial Analysis niêm yết, trước lịch cao điểm/ngoài cao điểm của chính DeepSeek

• Tốc độ — MiMo-V2.6-Pro 134,3 token đầu ra/giây; DeepSeek V4 Pro 97,4

• Thời gian đến token đầu tiên — MiMo-V2.6-Pro 2,15 giây; DeepSeek V4 Pro 1,62 giây

Đọc danh sách đó hai lần, vì có hai hàng đi ngược trực giác. Mô hình nhỏ hơn đạt điểm cao hơn mười điểm — 42 tỷ tham số hoạt động đánh bại 49 tỷ không phải là chênh lệch do làm tròn, mà là kết quả sau huấn luyện, và đó là tín hiệu rõ ràng nhất trong so sánh này cho thấy chất lượng học tăng cường đã vượt qua quy mô thô để trở thành đòn bẩy. Và mô hình rẻ hơn cũng là mô hình nhanh hơn, ở cả thông lượng lẫn chi phí mỗi tác vụ, điều này ngược với đánh đổi thông thường. Xiaomi không bán cho bạn một mức giảm giá để đổi lấy sự kiên nhẫn. Lợi thế của DeepSeek là thời gian đến token đầu tiên, 1,62 giây so với 2,15 — có thật, nhưng là hạng mục duy nhất mà V4 Pro dẫn đầu.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

Vì sao cùng một phiên bản chỉ mục lại quan trọng ở đây

Việc so sánh các mô hình open-weights qua các lần sửa đổi chỉ số là cách mà hầu hết các so sánh được công bố trở nên sai lệch, vì vậy số phiên bản không phải là một chú thích nhỏ. Artificial Analysis đã xây dựng lại Intelligence Index thành v4.3 vào tháng 9 năm 2026, và điểm số đã thay đổi đáng kể qua ranh giới đó — Claude Opus 5 mất ba điểm giữa v4.2 và v4.3, và nhóm open-weights đã được sắp xếp lại. Cả hai con số ở trên đều là v4.3.2, nghĩa là 46 và 36 có thể so sánh trực tiếp với nhau. Chúng không thể so sánh với những con số cũ hơn mà bạn sẽ thấy được trích dẫn ở nơi khác cho một trong hai mô hình.

Đó không phải là một giả thuyết. DeepSeek V4 Pro từng được báo cáo rộng rãi ở mức 53 trên một thang chỉ số trước đó vào tháng 8 năm 2026, và bài đưa tin của chính chúng tôi về giai đoạn đó có đề cập đến con số này. Trên v4.3.2, cùng mô hình đó đạt 36. Không có gì về mô hình thay đổi; thước đo đã thay đổi. Nếu bạn có một bảng tính chứa 53 bên cạnh 46 của MiMo-V2.6-Pro, bạn đang có một so sánh sẽ chỉ cho bạn sai mô hình. Cặp ghép đúng là 46 đối chiếu với 36, và kết luận đúng là mô hình được phát hành năm tuần sau đó, với số tham số bằng hai phần ba, thực sự vượt trội đáng kể.

Khoảng cách báo cáo giữa hai phòng thí nghiệm

Có một khác biệt thứ hai, tinh tế hơn, và nó nằm ở việc mỗi phòng thí nghiệm sẵn sàng để điều gì được kiểm tra.

Con số 46 của MiMo-V2.6-Pro là một phép đo của Artificial Analysis. Tổ chức đánh giá này đã chạy bộ đánh giá riêng của mình — mười bài đánh giá về suy luận, kiến thức, toán học và lập trình — trên mô hình đã phát hành và công bố kết quả, cùng với các thông số vận hành: 134,3 token/giây, 2,15 giây để có token đầu tiên, chiết khấu bộ nhớ đệm 99%, $0,13 mỗi tác vụ index, và tổng chi phí đánh giá là $206,66. Đó là con số của bên thứ ba về mô hình của Xiaomi.

Các con số agentic được nhấn mạnh của DeepSeek V4 Pro là của chính DeepSeek, và khoảng cách giữa chúng với các con số độc lập đã được ghi nhận. Tài liệu ra mắt của công ty báo cáo Terminal-Bench 2.1 đạt 87,9, DeepSWE đạt 62,7, CyberGym đạt 83,3 và SWE-bench Verified đạt 80,6. Các lần chạy độc lập cho Terminal-Bench 2.1 ở mức 78,7 — thấp hơn khoảng chín điểm so với con số của nhà cung cấp — và Chỉ số Coding của Artificial Analysis ở mức 68,8. Không con số nào trong số các con số của nhà cung cấp đó được tái tạo, và mức độ chênh lệch của Terminal-Bench là lý do để coi phần còn lại của bộ số liệu là những tuyên bố thay vì các phép đo.

Xiaomi có phiên bản riêng của cùng vấn đề đó. Bảng điều khiển của họ báo cáo MiMo-V2.6-Pro tăng từ 58.4 lên 72.57 trên DeepSWE v1.1 trong suốt lần chạy học tăng cường của nó, được đánh giá trên khung kiểm thử của chính Xiaomi với mini-swe-agent, lấy trung bình ba lần. Đó không phải là một bài nộp lên bảng xếp hạng và chưa có bên ngoài nào chạy lại nó. Vì vậy, cả hai mô hình đều không có được sự xác nhận hoàn toàn đáng tin cậy trên các bài kiểm chuẩn của nhà cung cấp. Khác biệt là MiMo-V2.6-Pro còn đi kèm một điểm tổng hợp độc lập mà bản ra mắt của DeepSeek không có ở thời điểm tương đương — và nếu bạn đang chọn giữa chúng dựa trên bằng chứng thay vì tiếp thị, thì đó chính là sự bất đối xứng đáng được coi trọng.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

Điều này trông như thế nào trong môi trường thực tế

Sự khác biệt về phương thức chính là ngã rẽ thực tế, và nó ít nghiêng về phía DeepSeek hơn mức mà khoảng cách mười điểm gợi ra. Nếu pipeline của bạn tiếp nhận ảnh chụp màn hình, PDF được kết xuất thành hình ảnh, khung hình video hay âm thanh, thì MiMo-V2.6-Pro xử lý tất cả ngay trong một mô hình duy nhất, còn DeepSeek V4 Pro hoàn toàn không làm được — bạn sẽ cần một mô hình thị giác riêng đặt lên trước, nghĩa là thêm một hợp đồng, thêm một dạng lỗi và thêm một hóa đơn. Nếu khối lượng công việc của bạn chỉ là suy luận văn bản, thì phương thức bổ sung kia chỉ là gánh nặng vô ích mà bạn chẳng phải trả gì cho nó.

Chi phí cho mỗi tác vụ lập chỉ mục là con số khác cần nắm. $0.13 so với $0.67 là khoảng cách gấp năm lần trên một tập tác vụ giống hệt nhau, có kiểm soát, được đo theo cùng một cách cho cả hai. DeepSeek áp dụng lịch tính phí cao điểm/ngoài cao điểm, có thể cắt giảm đáng kể mức giá hiệu dụng tùy vào thời điểm bạn gọi, nên tỷ lệ trong thực tế thu hẹp vào giờ ngoài cao điểm và nới rộng vào giờ cao điểm — một chi tiết quan trọng nếu lưu lượng của bạn tăng vọt theo từng đợt và bạn không thể chọn thời điểm nó đến.

Đây là chỗ mà phía DeepSeek có một lợi thế thực sự không liên quan gì đến mô hình: nó nằm trên nền tảng của chúng tôi. DeepSeek V4 Pro có thể truy cập được dưới dạng deepseek/deepseek-v4-pro thông qua khóa OrcaRouter với giá niêm yết của nhà cung cấp, mức chênh 0%, kèm khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp và DSL định tuyến có sẵn ở lớp trên — nên phép tính giờ cao điểm/thấp điểm, chênh lệch giữa các nhà cung cấp và đường dự phòng đều là những thứ bạn cấu hình chứ không phải bạn tự dựng. MiMo-V2.6-Pro không có trên nền tảng của chúng tôi, và chúng tôi sẽ nói thẳng: để truy cập nó hôm nay, bạn phải dùng nền tảng của chính Xiaomi hoặc một trong các danh mục bên thứ ba có liệt kê nó, và Artificial Analysis chỉ đếm được một nhà cung cấp API duy nhất cho nó tại thời điểm ghi nhận. Một tuyến thì không phải là một tuyến sản xuất, và đó là lập luận mạnh nhất để coi MiMo-V2.6-Pro là mô hình cần đánh giá ngay bây giờ và định tuyến tới một cách thận trọng, với một thứ khác làm phương án dự phòng phía sau.

Cái nào, và khi nào

Chọn DeepSeek V4 Pro nếu công việc của bạn chỉ là văn bản, nếu bạn cần giới hạn đầu ra 384K, nếu bạn muốn thời gian đến token đầu tiên nhanh nhất trong hai mô hình, hoặc nếu bạn đã ở trên nền tảng của chúng tôi và muốn một làn mở trọng số nghìn tỷ tham số với chuyển đổi dự phòng và không cần tích hợp mới. Nó là mô hình hiện hành vì một lý do, và việc lớn hơn năm tuần đồng nghĩa với năm tuần công cụ, lượng tử hóa và công thức phục vụ mà một mô hình tháng Chín chưa tích lũy được.

Chọn MiMo-V2.6-Pro nếu tác vụ mang tính đa phương thức, nếu chi phí cho mỗi tác vụ chi phối kinh tế đơn vị của bạn, nếu thông lượng quan trọng hơn nửa giây độ trễ, hoặc nếu bạn muốn mô hình dẫn đầu về trọng số mở hiện tại trên một chỉ số được đo lường độc lập. Giấy phép MIT trên cả hai mô hình nghĩa là câu hỏi về trọng số đã được giải quyết theo cách nào cũng vậy — bạn có thể chạy một trong hai trên phần cứng của riêng mình, tinh chỉnh nó và phát hành nó cho mục đích thương mại.

Cấu hình đáng cân nhắc không hẳn là một lựa chọn. Một router cho phép bạn giữ làn DeepSeek cho suy luận chỉ văn bản ở mức giá ngoài giờ cao điểm và thêm làn MiMo cho các yêu cầu đa phương thức, với một phương án dự phòng phía trước tuyến mỏng hơn. Đó không phải là phòng hộ rủi ro; mà là khớp từng yêu cầu với mô hình thực sự xử lý được nó, một giải pháp rẻ hơn và bền vững hơn so với việc chọn một kẻ thắng cuộc và hy vọng khối lượng công việc không bao giờ thay đổi hình thái.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

Câu hỏi mà sự so sánh này vẫn chưa thể trả lời

Các benchmark được trích dẫn nhiều nhất của cả hai mô hình đều do nhà cung cấp tự chạy và chưa được tái lập. Với DeepSeek V4 Pro, khoảng trống đó đã tồn tại từ tháng 8 và là lý do điểm độc lập của nó thấp hơn các con số công bố khi ra mắt. Với MiMo-V2.6-Pro, chỉ số tổng hợp độc lập thì có nhưng phần phân rã theo năng lực agent thì không — Artificial Analysis công bố điểm 46 chứ không công bố phổ điểm theo từng đánh giá bên dưới, mà đó chính là chi tiết cho biết một mô hình thuộc về vòng lặp agent hay pipeline hỏi đáp.

Cho đến khi bảng so sánh đó được công bố và cho đến khi ai đó chạy lại bộ khung kiểm thử DeepSWE của Xiaomi, lập trường có thể bảo vệ được vẫn hẹp hơn so với chiến lược tiếp thị của cả hai phòng thí nghiệm: MiMo-V2.6-Pro dẫn đầu về chỉ số tổng hợp độc lập và chi phí đo được trên mỗi tác vụ, DeepSeek V4 Pro dẫn đầu về độ trưởng thành, độ dài đầu ra, độ trễ token đầu tiên và khả năng truy cập qua một tuyến có dự phòng phía sau. Năm tuần là một lợi thế dẫn trước ngắn ngủi, và đó là lợi thế duy nhất mà DeepSeek có.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày