Một thẻ tiêu đề được tạo hiển thị MiMo-V2.6-Pro vs Grok 4.7, với phụ đề 29x rẻ hơn mỗi tác vụ, và chậm hơn ở cả hai phía nằm bên dưới nó cùng ba biểu tượng đường nét phẳng phía trên tiêu đề gợi ý các chồng xu được so sánh, một mặt số tốc độ và một ổ khóa đang mở. Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

Xiaomi MiMo-V2.6-Pro so với Grok 4.7: Rẻ hơn 30 lần cho mỗi tác vụ, và cả hai đều không nhanh

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Xiaomi MiMo-V2.6-Pro và Grok 4.7 đều ra mắt vào ngày 21 tháng 9 năm 2026, đều đạt 46 trên Artificial Analysis Intelligence Index v4.3.2, và đều bị trang đã đo lường chúng gọi là chậm — 43,6 token đầu ra mỗi giây đối với MiMo-V2.6-Pro so với mức trung vị 67,1, còn Grok 4.7 là 40 ở mức nỗ lực xhigh. Điều phân biệt chúng là chi phí cho một câu trả lời. Con số trên mỗi tác vụ của đơn vị đánh giá là 0,13 đô la cho checkpoint mở của Trung Quốc và 3,74 đô la cho mô hình Grok 4.7, tức hệ số khoảng 29. Đó không phải là khác biệt về đơn giá, hoặc không chỉ là khác biệt về đơn giá: đơn giá đầu ra của Grok 4.7 là 6,00 đô la mỗi triệu token so với 0,87 đô la, tức gấp bảy lần, và phần còn lại của bội số đến từ số lượng token mà mỗi mô hình tiêu tốn để đi đến một câu trả lời.

Hai mô hình trong cùng một tháng, trên cùng một chỉ số, ở cùng một mức điểm, được định giá như thể chúng thuộc về những thập niên khác nhau của thị trường. Câu hỏi thú vị không phải là mô hình nào thắng. Mà là phần nào của mức 29× đó bạn thực sự có thể đi vòng qua — bởi vì trong cặp này, đúng một trong hai là tuyến đường bạn có thể mua ngay hôm nay, và nó là tuyến đắt đỏ.

Cùng ngày, cùng điểm số, loài vật khác nhau

Grok 4.7 ra mắt vào ngày 21 tháng 9 năm 2026 với mức 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra, cửa sổ ngữ cảnh 500.000 token, điểm cắt kiến thức tháng 5 năm 2026, chiết khấu cache 75%, cùng khả năng đầu vào văn bản và hình ảnh, đầu ra văn bản. Nó đạt 46 trên chỉ số ở mức nỗ lực xhigh, 56 trên Coding Agent Index trong harness Grok Build, và 1.657 Elo trên AA-Briefcase — đứng thứ tư trên bảng xếp hạng đó, sau ba mục của Anthropic, với chi phí mỗi tác vụ chỉ bằng khoảng một nửa so với Claude Opus 5.

Xiaomi MiMo-V2.6-Pro là một checkpoint mixture-of-experts thưa, tổng cộng 1,02 nghìn tỷ tham số với 42 tỷ tham số hoạt động, được cấp phép MIT, ngữ cảnh 1M token, đầu vào văn bản, hình ảnh, giọng nói và video so với đầu ra văn bản, $0.43 và $0.87 mỗi triệu token với mức chiết khấu cache 99% khiến phí đầu vào hiệu dụng gần như bằng không trên một prompt đã warm. Artificial Analysis xếp nó thứ nhất trong số 114 mô hình trọng số mở trên chỉ số và thứ mười hai trong số 114 về chi phí. Có thể truy cập nó thông qua ba nhà cung cấp API. Nó không nằm trên các tuyến của chúng tôi, và chúng tôi không liệt kê một mô hình trước khi một nhà cung cấp onboard nó.

Dòng duy nhất quyết định điều đó

• Chi phí cho mỗi tác vụ chỉ mục — MiMo-V2.6-Pro $0.13; Grok 4.7 $3.74 — 29× • Đơn giá đầu ra — MiMo-V2.6-Pro $0.87 / 1M; Grok 4.7 $6.00 / 1M — 6.9× • Token đầu ra trong lần chạy chỉ mục — MiMo-V2.6-Pro 140M; Grok 4.7 240M, so với trung vị 88M • Tốc độ đầu ra — MiMo-V2.6-Pro 43.6 t/s; Grok 4.7 40 t/s — cả hai đều dưới trung vị • Cửa sổ ngữ cảnh — MiMo-V2.6-Pro 1M; Grok 4.7 500K • Trọng số — MiMo-V2.6-Pro được cấp phép MIT và có thể tải xuống; Grok 4.7 độc quyền, chỉ có API

Hãy đọc hai gạch đầu dòng đầu tiên cùng nhau và hình dạng của khoảng cách trở nên rõ ràng. Ở giá niêm yết, hai mô hình cách nhau 6,9× về đầu ra. Trong lần chạy chỉ số, chúng cách nhau 29× về chi phí để có một câu trả lời. Hệ số nhân ở giữa là tính dài dòng: Grok 4.7 tạo ra 240 triệu token đầu ra so với mức trung vị 88 triệu cho lớp của nó, và MiMo-V2.6-Pro tạo ra 140 triệu. Đó là mức phạt token 1,71× nằm trên mức phạt đơn giá 6,9×, và 1,71 × 6,9 là 11,8 — phần còn lại của khoảng cách tới 29 đến từ phía đầu vào, nơi chiết khấu bộ đệm 99% và mức giá đầu vào $0,43 của MiMo-V2.6-Pro gánh phần nặng trên một khối lượng công việc có bất kỳ tiền tố lặp lại nào.

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.7 - the scoreboard, subtitled Same index score, same month, 29x apart per task. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; cost per index task $0.13; list price $0.43 / $0.87 per 1M; output speed 43.6 tokens per second; 140M output tokens on the index run; 1M context; weights downloadable, and carries a tag reading Open weights - MIT. The right column, Grok 4.7 (xhigh), reads Intelligence Index v4.3.2 46; cost per index task $3.74; list price $2.00 / $6.00 per 1M; output speed 40 tokens per second; 240M output tokens; 500K context; weights not released, and carries a tag reading Proprietary - API only. A footer line reads that index scores, per-task cost, speed and token counts are per Artificial Analysis Intelligence Index v4.3.2, read 25 September 2026, and that both models shipped 21 September 2026. The OrcaRouter logo is composited in the bottom-right corner.

Sự dài dòng là con số mà người ta bỏ ra khỏi ước tính

Các mô hình chi phí thường được xây dựng từ một bảng giá và một số lượng token giả định. Cả hai nửa đó đều sai trong trường hợp này. Bảng giá sai vì mức chiết khấu bộ nhớ đệm không phải là một chú thích nhỏ — 99% so với 75% là sự khác biệt giữa việc một lời nhắc hệ thống khiến bạn tốn tiền ở mọi lần gọi và việc nó gần như không tốn gì. Số lượng token sai vì hai mô hình không phát ra cùng số token cho cùng một công việc, và công cụ đánh giá đã đo được khác biệt: 240 triệu so với 140 triệu, tức mức chênh 1,71× trên một bài kiểm chuẩn.

Không cái nào trong hai thứ đó là một chỉ số đại diện mà bạn có thể đọc thẳng ra từ bảng thông số. Thứ hạng độ dài dòng của Grok 4.7 là #94 trong số 210 mô hình cùng lớp; thứ hạng chi phí của MiMo-V2.6-Pro là #12 trong số 114 mô hình trong lớp của nó. Một nhóm trích dẫn bảng giá của Grok 4.7 và giả định một khối lượng công việc trung tính về token sẽ dự báo chỉ khoảng một phần tư mức mà chỉ số thực sự chi cho mỗi tác vụ. Cách điều chỉnh không phải là cũng lấy chi phí của chỉ số làm ước tính của bạn — đó là phép đo hình dạng của một benchmark. Mà là đo số token của chính bạn ở cả hai phía trước khi cam kết, vì khoảng cách giữa hai mô hình là 6,9× trên giấy và 29× trên thực tế, và chỉ một trong hai con số đó là thật đối với lưu lượng của bạn.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 25 September 2026. The header shows Intelligence rank 21 of 210, Speed 159 of 210, Cost 210 of 210, Verbosity 94 of 210, 46 on the Artificial Analysis Intelligence Index, $2.00 input and $6.00 output per 1M tokens with a 75% cache discount, $3.74 per task to evaluate on the Intelligence Index, and 500K context; the summary paragraph calls the model notably slow and very verbose, and the verbosity line shows 240M output tokens generated on the index run against a median of 88M.

Cả hai đều chậm, và đó không phải là một sự hòa nhau.

Artificial Analysis đo Grok 4.7 ở mức 40 token đầu ra mỗi giây và gọi nó là “thuộc nhóm chậm nhất”; MiMo-V2.6-Pro ở mức 43,6 và gọi là “chậm đáng kể”. Hai kết quả đo đó đủ gần nhau đến mức tốc độ không nên là yếu tố phân định giữa chúng. Nhưng các trung vị bên dưới thì không như vậy: 67,1 đối với nhóm trọng số mở mà MiMo-V2.6-Pro nằm trong đó. Cả hai mô hình đều thấp hơn hẳn mức đó, và MiMo-V2.6-Pro còn có thời gian đến token đầu tiên là 3,17 giây so với trung vị 2,31 giây, đây là con số gây khó chịu trong vòng lặp tương tác chứ không phải vòng lặp theo lô.

Vậy nên bản tóm tắt trung thực về khía cạnh độ trễ là: rẻ hơn 29× không mang lại cho bạn một sản phẩm nhanh hơn, mà mang lại một sản phẩm chậm hơn với chi phí thấp hơn — và nếu người dùng của bạn đang nhìn vào con trỏ, thì khoảng chờ 3,17 giây có thể tốn kém hơn số token tiết kiệm được. Với công việc theo lô qua đêm, đánh giá ngoại tuyến, hay bất kỳ pipeline nào mà đồng hồ được đo bằng giờ, sự đánh đổi này rất rõ ràng và mức 29× gần như miễn phí.

Bộ định tuyến có thể và không thể làm gì với cặp ghép này

Đây là cặp so sánh mà danh mục của chính chúng tôi thực sự chỉ nghiêng hẳn về một phía, và đáng để nói thẳng điều đó. Grok 4.7 đang hoạt động trên OrcaRouter với tên grok/grok-4.7 ở mức giá $2.00 / $6.00 của chính nhà cung cấp, đầu ra tối đa 450K và endpoint tương thích OpenAI-SDK tại https://api.orcarouter.ai/v1 — nên nếu việc so sánh khiến bạn muốn dùng mô hình xAI dưới cùng một khóa như mọi thứ khác, thì lộ trình đó đã tồn tại ngay hôm nay. Xiaomi MiMo-V2.6-Pro không nằm trên các tuyến của chúng tôi; về phía đó, câu trả lời là API của chính nhà cung cấp hoặc bất kỳ nhà cung cấp nào trong ba nhà cung cấp được liệt kê mà bạn đã dùng, và chúng tôi sẽ không giả vờ điều ngược lại.

Điều giúp một router có được vị trí trong một so sánh như thế này là ở những phần không phải mô hình. Một khóa trên hơn 200 mô hình ở mức giá niêm yết của từng nhà cung cấp với 0% markup nghĩa là việc nhà cung cấp giảm giá sẽ vào hóa đơn của bạn ngay trong ngày thay vì đến kỳ gia hạn hợp đồng tiếp theo. Chuyển đổi dự phòng tự động nghĩa là tuyến 40 t/s bị suy giảm không kéo theo pipeline của bạn. DSL định tuyến cho phép việc phân chia được thực hiện dựa trên chi phí công bố theo từng tác vụ thay vì dựa trên lòng trung thành thương hiệu — mô hình rẻ cho khối lượng lớn, mô hình khó cho những lệnh gọi khó, được quyết định theo từng yêu cầu. Và với những khối lượng công việc mà cả hai mô hình đều không thật sự phù hợp, hợp nhất mô hình có thể chạy nhiều mô hình phía sau một lệnh gọi.

Screenshot of the OrcaRouter model page for Grok 4.7, captured 25 September 2026. The page shows the model id grok/grok-4.7, a maximum output of 450K, output text, public benchmarks by grok dated 2026-09-21, a price of $2.00 per 1M input and $6.00 per 1M output, and an OpenAI-SDK-compatible code sample whose base URL is https://api.orcarouter.ai/v1 and whose model field is grok/grok-4.7.

Những câu hỏi mà sự so sánh này thường đặt ra

Liệu mức 29× có đúng với khối lượng công việc của tôi không? Chỉ khi hỗn hợp token của bạn giống với lượt chạy chỉ mục. Nếu đầu ra của bạn ngắn còn prompt của bạn dài và được lưu trong bộ nhớ đệm, thì bội số này thu hẹp về mức chênh lệch giá là 6,9× ở đầu ra và mở rộng ở đầu vào, nơi mức giảm giá 99% của MiMo-V2.6-Pro là yếu tố quyết định. Nếu đầu ra của bạn là những chuỗi suy luận dài, nó sẽ mở rộng vượt mức 29×, vì hình phạt dài dòng của Grok 4.7 tỷ lệ thuận với độ dài đầu ra.

Số 46 ở mỗi bên có phải là cùng một số 46 không? Đó là cùng một chỉ số, cùng một phiên bản và cùng một thang đo — các điểm phụ bên dưới là 46,32 và 46,45, chênh lệch 0,13 điểm, và chỉ số này làm tròn cả hai thành 46. Artificial Analysis không công bố kết quả chi tiết theo từng đánh giá cho cả hai mô hình, vì vậy điểm tổng hợp là mức chi tiết nhất hiện có, và mức chênh lệch 0,13 điểm không nên được hiểu là một bảng xếp hạng năng lực.

Một dự án mới nên mặc định chọn cái nào? Nếu khối lượng công việc là theo lô, chấp nhận được độ trễ và nhạy cảm về chi phí, thì MiMo-V2.6-Pro ở mức $0.13 mỗi tác vụ là lựa chọn mặc định, và việc trọng số mở nghĩa là bạn không bị phụ thuộc vào mức giá của một nhà cung cấp duy nhất. Nếu bạn cần cụ thể mô hình xAI — kết quả harness Grok Build, vị trí trên AA-Briefcase, ngữ cảnh 500K với điểm cắt tháng 5 năm 2026 — thì Grok 4.7 là một tuyến đang hoạt động trên OrcaRouter ngay hôm nay, và khoản phụ phí theo từng tác vụ chính là cái giá cho khả năng cụ thể đó. Không có mô hình nào ở đây thắng được cả hai.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày