
MiMo-V2.6-Pro vs Claude Opus 5: Rẻ hơn 21 lần, kém năm điểm chỉ số
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 632 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Xiaomi MiMo-V2.6-Pro và Claude Opus 5 là hai đầu của một cuộc đánh đổi, và cuộc đánh đổi đó có giá của nó. Trên Artificial Analysis Intelligence Index v4.3.2, Claude Opus 5 (nỗ lực tối đa) đạt 51 điểm và Xiaomi MiMo-V2.6-Pro đạt 46 điểm. Trên bảng giá, Claude Opus 5 tốn 5,00 USD mỗi triệu token đầu vào và 25,00 USD mỗi triệu token đầu ra; MiMo-V2.6-Pro tốn 0,43 USD và 0,87 USD. Thực hiện phép chia và câu trả lời là 11,6 lần ở đầu vào và 28,7 lần ở đầu ra — và 21 lần ở mức giá kết hợp mà Artificial Analysis công bố cho mỗi mô hình. Năm điểm chỉ số tốn số tiền gấp hai mươi mốt lần. Đó là món hời hay sự lãng phí phụ thuộc hoàn toàn vào việc khối lượng công việc của bạn làm gì với điểm thứ năm, và hầu hết các nhóm chưa bao giờ tính ra điều đó trước khi họ cam kết.
Hai mô hình, nói một cách đơn giản
Claude Opus 5 là mô hình chủ lực độc quyền của Anthropic, ra mắt ngày 24 tháng 7 năm 2026, với cửa sổ ngữ cảnh 1M token và số lượng tham số không được tiết lộ. Xiaomi MiMo-V2.6-Pro là mô hình mixture-of-experts thưa với tổng 1,02 nghìn tỷ tham số và 42 tỷ tham số được kích hoạt, có cửa sổ ngữ cảnh 1M token, khả năng đa phương thức gốc đối với văn bản, hình ảnh, video và âm thanh, cùng trọng số đã công bố theo giấy phép MIT.
• Trọng số — MiMo-V2.6-Pro được cấp phép MIT và có thể tải xuống; Claude Opus 5 độc quyền, chỉ qua API
• Tham số — MiMo-V2.6-Pro 1,02T tổng / 42B hoạt động; Claude Opus 5 không được tiết lộ
• Bối cảnh — cả hai đều 1M token; Claude Opus 5 giới hạn đầu ra ở 128K trên Messages API và 300K trên Batch API
• Phương thức — MiMo-V2.6-Pro nhận văn bản, hình ảnh, video và âm thanh; bề mặt đầu vào được công bố của Claude Opus 5 là văn bản và hình ảnh
• Giá niêm yết — MiMo-V2.6-Pro $0.43 / $0.87 mỗi 1 triệu token; Claude Opus 5 $5.00 / $25.00
• Cache — MiMo-V2.6-Pro đưa ra mức chiết khấu cache 99%; Claude Opus 5 đọc cache ở mức $0.50 mỗi 1M với ghi $6.25 tại TTL 5 phút
• Chi phí đo được cho mỗi tác vụ Intelligence Index — MiMo-V2.6-Pro $0.13; Claude Opus 5 $5.86
• Phục vụ — MiMo-V2.6-Pro 134,3 token đầu ra/giây và 2,15 giây để có token đầu tiên; Claude Opus 5 57,9 token/giây
Cặp cuối cùng đó chính là cặp bị bỏ sót. Mô hình rẻ hơn cũng là mô hình nhanh hơn — nhanh hơn gấp 2,3 lần về thông lượng đầu ra — vì nó được phục vụ trên phần cứng do Xiaomi và các đối tác của họ kiểm soát, và có thể gom lô mạnh tay. Claude Opus 5 ở mức nỗ lực tối đa là một mô hình suy luận làm nhiều việc hơn trên mỗi token; khoảng cách tốc độ không phải là khiếm khuyết, mà là một sản phẩm khác. Nhưng điều đó có nghĩa là lựa chọn rẻ không phải trả giá cho ưu đãi của mình bằng độ trễ. Nó đang trả giá cho ưu đãi đó bằng năm điểm chỉ số và ở phần đuôi của các tác vụ, nơi điểm thứ năm đó nằm.

Năm điểm thực sự nằm ở đâu
Khoảng cách năm điểm trên một tổng hợp gồm mười đánh giá không trải đều, và con số tổng hợp đã che giấu đi điều thực sự quan trọng. Cả hai mô hình đều được chạy trên cùng bộ v4.3.2, bao gồm AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience và AA-LCR v1.1. Các trang đã công bố không tách riêng điểm số theo từng đánh giá cho cả hai mô hình, đây là một hạn chế thực sự ở cả hai phía của so sánh này và đáng để nói ra thay vì che đậy.
Những gì được ghi nhận chính thức chỉ mang tính định hướng. Claude Opus 5 ở mức nỗ lực tối đa đạt 49.0% trên Terminal-Bench 4.0 trong bộ v4.3, xếp sau GPT-6 Astra với 59.1% và Claude Fable 5.1 với 52.0%. Trên AutomationBench-AA, Opus 5 hoàn thành mọi mục tiêu mà không vi phạm hàng rào bảo vệ trên 28.3% quy trình, so với 41.6% của GPT-6 Astra và 32.1% của Fable 5.1. Đó là những con số cứng về năng lực tác tử, và chúng đúng là những hạng mục mà khoảng cách tổng hợp năm điểm ít có khả năng được phân bổ đều nhất — mục chỉ mục của chính MiMo-V2.6-Pro không công bố một phần tách riêng về tác tử có thể so sánh được.
Trong khi đó, các con số do hai công ty công bố không thể so sánh với nhau, và thật đáng để nói thẳng lý do vì sao. Tài liệu ra mắt của Anthropic báo cáo SWE-bench Verified đạt 96.0% và SWE-bench Pro đạt 79.2%; một đơn vị theo dõi lưu ý rằng Opus 5 được phát hành mà không có mục SWE-bench riêng, và không có con số SWE-bench Verified nào được kiểm toán độc lập cho nó. Tài liệu của Xiaomi báo cáo MiMo-V2.6-Pro tăng từ 58.4 lên 72.57 trên DeepSWE v1.1 trong suốt lần chạy RL, trên harness riêng của Xiaomi với mini-swe-agent ở mức trung bình của ba lần, không được gửi lên bảng DeepSWE công khai. Hai harness của nhà cung cấp, hai tác vụ khác nhau, không có sự trùng lặp. Đặt 96.0% cạnh 72.57 và rút ra kết luận sẽ là tạo ra một so sánh không hề tồn tại.

So sánh chi phí, đúng cách
Phép tính theo mỗi token đánh giá thấp khoảng cách, vì hai mô hình không tiêu thụ cùng số lượng token để hoàn thành cùng một công việc. Artificial Analysis đã đo chi phí thực tế để chạy toàn bộ Intelligence Index của từng mô hình: $0,13 cho MiMo-V2.6-Pro, $5,86 cho Claude Opus 5. Đó là khoảng cách gấp 45 lần trên một tập tác vụ được kiểm soát, giống hệt nhau, và đây là con số duy nhất công bằng nhất hiện có vì cả hai đều được đo theo cùng một cách.
Giờ hãy đặt một vòng lặp production hợp lý để đối chiếu với nó. Một lần chạy agent 30 bước, đọc 200.000 token ngữ cảnh mỗi bước và ghi 2.000 token mỗi bước, là 6 triệu token đầu vào và 60.000 token đầu ra mỗi lần chạy. Với Claude Opus 5 theo giá niêm yết, đó là 30,00 USD đầu vào và 1,50 USD đầu ra — 31,50 USD mỗi lần chạy trước mọi caching. Với MiMo-V2.6-Pro, đó là 2,58 USD đầu vào và 0,05 USD đầu ra — 2,63 USD. Với ưu đãi cache mà cả hai nhà cung cấp đưa ra, phần đầu vào giảm mạnh ở cả hai mô hình, và tỷ lệ này dịch chuyển chứ không biến mất: mức giảm giá cache 99% trên một mô hình rẻ so với mức đọc cache 0,50 USD trên một mô hình đắt vẫn khiến mô hình đắt dẫn trước một bậc độ lớn trong một vòng lặp nặng ngữ cảnh.
Đó là toàn bộ lập luận ủng hộ một làn giá rẻ và chống lại việc chuyển đổi toàn diện. Nếu khối lượng công việc của bạn là một vòng lặp agent tầm xa, vốn đọc lại cùng một ngữ cảnh hàng trăm lần, thì chênh lệch chi phí mỗi lần chạy không phải là một sai số làm tròn — đó là sự khác biệt giữa một tính năng bạn có thể đủ khả năng chạy cho từng người dùng và một tính năng bạn không thể. Đó là lý do để đặt MiMo-V2.6-Pro lên trước phần lớn lưu lượng của bạn. Đó không phải là lý do để loại bỏ Claude Opus 5, bởi vì những tác vụ mà điểm chỉ số thứ năm tự bù đắp chi phí cho chính nó, theo cấu trúc, chính là những tác vụ mà thất bại của một mô hình rẻ lại rất tốn kém.

Một quyết định định tuyến ở đây trông như thế nào
Claude Opus 5 có thể truy cập thông qua một khóa OrcaRouter duy nhất ở mức giá niêm yết của nhà cung cấp, không phụ thu 0%, dưới dạng anthropic/claude-opus-5, cùng với các mô hình tiên tiến mà bạn muốn đối chiếu nằm ngay bên cạnh nó trên cùng một khóa. Vì chúng tôi chuyển tiếp nguyên mức giá niêm yết của nhà cung cấp mà không thêm phụ thu, nên khi nhà cung cấp thay đổi giá ở bất kỳ bên nào, phía chúng tôi cập nhật ngay trong cùng ngày thay vì phải chờ báo giá lại. DSL định tuyến mới là phần thú vị: bạn có thể ghép hai mô hình vào một lệnh gọi thay vì phải chọn một trong hai, gửi phần lớn khối lượng công việc sang luồng rẻ và định tuyến phần còn lại — những tác vụ không vượt qua bước tự kiểm tra, hoặc khớp với một vị từ về độ phức tạp — sang luồng đắt đỏ. Chuyển đổi dự phòng là nửa còn lại. Claude Opus 5 có độ phủ nhà cung cấp rộng khắp; MiMo-V2.6-Pro chỉ được một nhà cung cấp API duy nhất niêm yết khi Artificial Analysis ghi nhận nó, đây là một tuyến mỏng manh đối với một mô hình mà bạn sẽ đưa vào đường chạy production. Một router có khả năng dự phòng chính là điều khiến luồng rẻ trở nên an toàn để áp dụng.
Cần nói thẳng, vì rất dễ giả định điều ngược lại: chúng tôi không host MiMo-V2.6-Pro. Để truy cập nó hiện nay, bạn phải dùng nền tảng của chính Xiaomi hoặc một trong các danh mục bên thứ ba có liệt kê nó. Lập luận định tuyến ở đây nói về cách bạn dùng một mô hình như thế này song song với những mô hình mà chúng tôi thực sự cung cấp, chứ không phải một tuyên bố rằng nó là một trong những mô hình của chúng tôi.
Chọn cái nào?
Chọn Claude Opus 5 khi chi phí thất bại của tác vụ vượt quá chi phí token đủ nhiều để năm điểm chỉ số trở thành một khoản bảo hiểm rẻ — công việc tác nhân tầm xa có tác động thực tế, việc dùng công cụ khi một lệnh gọi sai còn tệ hơn một lệnh gọi chậm, bất cứ thứ gì mà bạn vốn đã phải trả tiền cho con người để kiểm tra đầu ra. Con số 5,86 đô-la mỗi tác vụ chỉ số không phải là lý do để tránh nó; đó là cái giá của hạng đó, và hạng đó tồn tại vì một lý do.
Hãy chọn MiMo-V2.6-Pro khi khối lượng là ràng buộc, khi khối lượng công việc nặng về ngữ cảnh và mang tính lặp lại, khi bạn muốn đặt trọng số trên hạ tầng của riêng mình — giấy phép MIT cho phép triển khai thương mại, sửa đổi và huấn luyện thêm — hoặc khi bạn đang xây dựng một thứ mà kinh tế đơn vị chỉ khả thi ở mức một phần năm xu cho mỗi nghìn token. Tốc độ 134,3 token/giây của nó khiến nó khả thi cho việc sử dụng tương tác theo cách mà hầu hết các mô hình mở nghìn tỷ tham số không thể làm được.
Chọn cả hai, nếu bạn có router, vì câu trả lời trung thực cho câu hỏi "cái nào tốt hơn" là chúng không cạnh tranh cho cùng một loại yêu cầu. Kiểu thất bại cần tránh là kiểu tốn kém nhất: chuẩn hóa theo mô hình rẻ vì tỷ lệ nổi bật là 21x, rồi đến tháng thứ ba mới phát hiện ra một loại yêu cầu cụ thể cần mô hình đắt tiền, và không có đường để định tuyến nó tới đó. Kiểu thất bại thứ hai là hình ảnh phản chiếu — trả mức giá Opus 5 cho một công việc tóm tắt mà một mô hình 46-index hoàn thành y hệt. Không cái nào là vấn đề của mô hình. Cả hai đều là vấn đề cấu hình, và cấu hình là phần bạn có thể thay đổi vào một buổi chiều thứ Ba.
