
Xiaomi MiMo-V2.6-Pro so với Grok 4.7: Rẻ hơn 30 lần cho mỗi tác vụ, và cả hai đều không nhanh
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 36 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 181 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Xiaomi MiMo-V2.6-Pro và Grok 4.7 đều ra mắt vào ngày 21 tháng 9 năm 2026, đều đạt 46 trên Artificial Analysis Intelligence Index v4.3.2, và đều bị trang đã đo lường chúng gọi là chậm — 43,6 token đầu ra mỗi giây đối với MiMo-V2.6-Pro so với mức trung vị 67,1, còn Grok 4.7 là 40 ở mức nỗ lực xhigh. Điều phân biệt chúng là chi phí cho một câu trả lời. Con số trên mỗi tác vụ của đơn vị đánh giá là 0,13 đô la cho checkpoint mở của Trung Quốc và 3,74 đô la cho mô hình Grok 4.7, tức hệ số khoảng 29. Đó không phải là khác biệt về đơn giá, hoặc không chỉ là khác biệt về đơn giá: đơn giá đầu ra của Grok 4.7 là 6,00 đô la mỗi triệu token so với 0,87 đô la, tức gấp bảy lần, và phần còn lại của bội số đến từ số lượng token mà mỗi mô hình tiêu tốn để đi đến một câu trả lời.
Hai mô hình trong cùng một tháng, trên cùng một chỉ số, ở cùng một mức điểm, được định giá như thể chúng thuộc về những thập niên khác nhau của thị trường. Câu hỏi thú vị không phải là mô hình nào thắng. Mà là phần nào của mức 29× đó bạn thực sự có thể đi vòng qua — bởi vì trong cặp này, đúng một trong hai là tuyến đường bạn có thể mua ngay hôm nay, và nó là tuyến đắt đỏ.
Cùng ngày, cùng điểm số, loài vật khác nhau
Grok 4.7 ra mắt vào ngày 21 tháng 9 năm 2026 với mức 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra, cửa sổ ngữ cảnh 500.000 token, điểm cắt kiến thức tháng 5 năm 2026, chiết khấu cache 75%, cùng khả năng đầu vào văn bản và hình ảnh, đầu ra văn bản. Nó đạt 46 trên chỉ số ở mức nỗ lực xhigh, 56 trên Coding Agent Index trong harness Grok Build, và 1.657 Elo trên AA-Briefcase — đứng thứ tư trên bảng xếp hạng đó, sau ba mục của Anthropic, với chi phí mỗi tác vụ chỉ bằng khoảng một nửa so với Claude Opus 5.
Xiaomi MiMo-V2.6-Pro là một checkpoint mixture-of-experts thưa, tổng cộng 1,02 nghìn tỷ tham số với 42 tỷ tham số hoạt động, được cấp phép MIT, ngữ cảnh 1M token, đầu vào văn bản, hình ảnh, giọng nói và video so với đầu ra văn bản, $0.43 và $0.87 mỗi triệu token với mức chiết khấu cache 99% khiến phí đầu vào hiệu dụng gần như bằng không trên một prompt đã warm. Artificial Analysis xếp nó thứ nhất trong số 114 mô hình trọng số mở trên chỉ số và thứ mười hai trong số 114 về chi phí. Có thể truy cập nó thông qua ba nhà cung cấp API. Nó không nằm trên các tuyến của chúng tôi, và chúng tôi không liệt kê một mô hình trước khi một nhà cung cấp onboard nó.
Dòng duy nhất quyết định điều đó
• Chi phí cho mỗi tác vụ chỉ mục — MiMo-V2.6-Pro $0.13; Grok 4.7 $3.74 — 29× • Đơn giá đầu ra — MiMo-V2.6-Pro $0.87 / 1M; Grok 4.7 $6.00 / 1M — 6.9× • Token đầu ra trong lần chạy chỉ mục — MiMo-V2.6-Pro 140M; Grok 4.7 240M, so với trung vị 88M • Tốc độ đầu ra — MiMo-V2.6-Pro 43.6 t/s; Grok 4.7 40 t/s — cả hai đều dưới trung vị • Cửa sổ ngữ cảnh — MiMo-V2.6-Pro 1M; Grok 4.7 500K • Trọng số — MiMo-V2.6-Pro được cấp phép MIT và có thể tải xuống; Grok 4.7 độc quyền, chỉ có API
Hãy đọc hai gạch đầu dòng đầu tiên cùng nhau và hình dạng của khoảng cách trở nên rõ ràng. Ở giá niêm yết, hai mô hình cách nhau 6,9× về đầu ra. Trong lần chạy chỉ số, chúng cách nhau 29× về chi phí để có một câu trả lời. Hệ số nhân ở giữa là tính dài dòng: Grok 4.7 tạo ra 240 triệu token đầu ra so với mức trung vị 88 triệu cho lớp của nó, và MiMo-V2.6-Pro tạo ra 140 triệu. Đó là mức phạt token 1,71× nằm trên mức phạt đơn giá 6,9×, và 1,71 × 6,9 là 11,8 — phần còn lại của khoảng cách tới 29 đến từ phía đầu vào, nơi chiết khấu bộ đệm 99% và mức giá đầu vào $0,43 của MiMo-V2.6-Pro gánh phần nặng trên một khối lượng công việc có bất kỳ tiền tố lặp lại nào.

Sự dài dòng là con số mà người ta bỏ ra khỏi ước tính
Các mô hình chi phí thường được xây dựng từ một bảng giá và một số lượng token giả định. Cả hai nửa đó đều sai trong trường hợp này. Bảng giá sai vì mức chiết khấu bộ nhớ đệm không phải là một chú thích nhỏ — 99% so với 75% là sự khác biệt giữa việc một lời nhắc hệ thống khiến bạn tốn tiền ở mọi lần gọi và việc nó gần như không tốn gì. Số lượng token sai vì hai mô hình không phát ra cùng số token cho cùng một công việc, và công cụ đánh giá đã đo được khác biệt: 240 triệu so với 140 triệu, tức mức chênh 1,71× trên một bài kiểm chuẩn.
Không cái nào trong hai thứ đó là một chỉ số đại diện mà bạn có thể đọc thẳng ra từ bảng thông số. Thứ hạng độ dài dòng của Grok 4.7 là #94 trong số 210 mô hình cùng lớp; thứ hạng chi phí của MiMo-V2.6-Pro là #12 trong số 114 mô hình trong lớp của nó. Một nhóm trích dẫn bảng giá của Grok 4.7 và giả định một khối lượng công việc trung tính về token sẽ dự báo chỉ khoảng một phần tư mức mà chỉ số thực sự chi cho mỗi tác vụ. Cách điều chỉnh không phải là cũng lấy chi phí của chỉ số làm ước tính của bạn — đó là phép đo hình dạng của một benchmark. Mà là đo số token của chính bạn ở cả hai phía trước khi cam kết, vì khoảng cách giữa hai mô hình là 6,9× trên giấy và 29× trên thực tế, và chỉ một trong hai con số đó là thật đối với lưu lượng của bạn.

Cả hai đều chậm, và đó không phải là một sự hòa nhau.
Artificial Analysis đo Grok 4.7 ở mức 40 token đầu ra mỗi giây và gọi nó là “thuộc nhóm chậm nhất”; MiMo-V2.6-Pro ở mức 43,6 và gọi là “chậm đáng kể”. Hai kết quả đo đó đủ gần nhau đến mức tốc độ không nên là yếu tố phân định giữa chúng. Nhưng các trung vị bên dưới thì không như vậy: 67,1 đối với nhóm trọng số mở mà MiMo-V2.6-Pro nằm trong đó. Cả hai mô hình đều thấp hơn hẳn mức đó, và MiMo-V2.6-Pro còn có thời gian đến token đầu tiên là 3,17 giây so với trung vị 2,31 giây, đây là con số gây khó chịu trong vòng lặp tương tác chứ không phải vòng lặp theo lô.
Vậy nên bản tóm tắt trung thực về khía cạnh độ trễ là: rẻ hơn 29× không mang lại cho bạn một sản phẩm nhanh hơn, mà mang lại một sản phẩm chậm hơn với chi phí thấp hơn — và nếu người dùng của bạn đang nhìn vào con trỏ, thì khoảng chờ 3,17 giây có thể tốn kém hơn số token tiết kiệm được. Với công việc theo lô qua đêm, đánh giá ngoại tuyến, hay bất kỳ pipeline nào mà đồng hồ được đo bằng giờ, sự đánh đổi này rất rõ ràng và mức 29× gần như miễn phí.
Bộ định tuyến có thể và không thể làm gì với cặp ghép này
Đây là cặp so sánh mà danh mục của chính chúng tôi thực sự chỉ nghiêng hẳn về một phía, và đáng để nói thẳng điều đó. Grok 4.7 đang hoạt động trên OrcaRouter với tên grok/grok-4.7 ở mức giá $2.00 / $6.00 của chính nhà cung cấp, đầu ra tối đa 450K và endpoint tương thích OpenAI-SDK tại https://api.orcarouter.ai/v1 — nên nếu việc so sánh khiến bạn muốn dùng mô hình xAI dưới cùng một khóa như mọi thứ khác, thì lộ trình đó đã tồn tại ngay hôm nay. Xiaomi MiMo-V2.6-Pro không nằm trên các tuyến của chúng tôi; về phía đó, câu trả lời là API của chính nhà cung cấp hoặc bất kỳ nhà cung cấp nào trong ba nhà cung cấp được liệt kê mà bạn đã dùng, và chúng tôi sẽ không giả vờ điều ngược lại.
Điều giúp một router có được vị trí trong một so sánh như thế này là ở những phần không phải mô hình. Một khóa trên hơn 200 mô hình ở mức giá niêm yết của từng nhà cung cấp với 0% markup nghĩa là việc nhà cung cấp giảm giá sẽ vào hóa đơn của bạn ngay trong ngày thay vì đến kỳ gia hạn hợp đồng tiếp theo. Chuyển đổi dự phòng tự động nghĩa là tuyến 40 t/s bị suy giảm không kéo theo pipeline của bạn. DSL định tuyến cho phép việc phân chia được thực hiện dựa trên chi phí công bố theo từng tác vụ thay vì dựa trên lòng trung thành thương hiệu — mô hình rẻ cho khối lượng lớn, mô hình khó cho những lệnh gọi khó, được quyết định theo từng yêu cầu. Và với những khối lượng công việc mà cả hai mô hình đều không thật sự phù hợp, hợp nhất mô hình có thể chạy nhiều mô hình phía sau một lệnh gọi.

Những câu hỏi mà sự so sánh này thường đặt ra
Liệu mức 29× có đúng với khối lượng công việc của tôi không? Chỉ khi hỗn hợp token của bạn giống với lượt chạy chỉ mục. Nếu đầu ra của bạn ngắn còn prompt của bạn dài và được lưu trong bộ nhớ đệm, thì bội số này thu hẹp về mức chênh lệch giá là 6,9× ở đầu ra và mở rộng ở đầu vào, nơi mức giảm giá 99% của MiMo-V2.6-Pro là yếu tố quyết định. Nếu đầu ra của bạn là những chuỗi suy luận dài, nó sẽ mở rộng vượt mức 29×, vì hình phạt dài dòng của Grok 4.7 tỷ lệ thuận với độ dài đầu ra.
Số 46 ở mỗi bên có phải là cùng một số 46 không? Đó là cùng một chỉ số, cùng một phiên bản và cùng một thang đo — các điểm phụ bên dưới là 46,32 và 46,45, chênh lệch 0,13 điểm, và chỉ số này làm tròn cả hai thành 46. Artificial Analysis không công bố kết quả chi tiết theo từng đánh giá cho cả hai mô hình, vì vậy điểm tổng hợp là mức chi tiết nhất hiện có, và mức chênh lệch 0,13 điểm không nên được hiểu là một bảng xếp hạng năng lực.
Một dự án mới nên mặc định chọn cái nào? Nếu khối lượng công việc là theo lô, chấp nhận được độ trễ và nhạy cảm về chi phí, thì MiMo-V2.6-Pro ở mức $0.13 mỗi tác vụ là lựa chọn mặc định, và việc trọng số mở nghĩa là bạn không bị phụ thuộc vào mức giá của một nhà cung cấp duy nhất. Nếu bạn cần cụ thể mô hình xAI — kết quả harness Grok Build, vị trí trên AA-Briefcase, ngữ cảnh 500K với điểm cắt tháng 5 năm 2026 — thì Grok 4.7 là một tuyến đang hoạt động trên OrcaRouter ngay hôm nay, và khoản phụ phí theo từng tác vụ chính là cái giá cho khả năng cụ thể đó. Không có mô hình nào ở đây thắng được cả hai.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
