Một thẻ tiêu đề được tạo tự động so sánh Xiaomi MiMo-V2.6-Pro và Grok 4.6 ở mức nỗ lực cao. Thẻ bên trái ghi Intelligence Index v4.3.2: 46, Cửa sổ ngữ cảnh: 1M token, $0.43 vào / $0.87 ra trên 1M, và 134.3 token mỗi giây; thẻ bên phải ghi Intelligence Index v4.3.2: 44, Cửa sổ ngữ cảnh: 500K token, $2.00 vào / $6.00 ra trên 1M, và 63.0 token mỗi giây. Phần chân trang ghi: Cả hai điểm số trên Artificial Analysis Intelligence Index v4.3.2. Các số liệu DeepSWE do nhà cung cấp chạy và không thể so sánh. Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

MiMo-V2.6-Pro so với Grok 4.6: Cả hai nhà cung cấp đều công bố số liệu DeepSWE, và cả hai đều không có trên bảng xếp hạng.

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai nhà cung cấp, một benchmark, hai con số không thể trừ cho nhau. Tài liệu ra mắt của SpaceXAI cho Grok 4.6 báo cáo 65,9% trên DeepSWE v1.1. Tài liệu của Xiaomi cho MiMo-V2.6-Pro báo cáo 72,57 trên DeepSWE v1.1. Đọc cùng nhau, chúng gợi ý rằng mô hình open-weights rẻ hơn đánh bại mô hình độc quyền tiên phong gần bảy điểm. Đọc kỹ thì chúng gần như chẳng nói lên điều gì, bởi một cái là tỷ lệ phần trăm trên slide ra mắt bằng harness của chính nhà cung cấp, còn cái kia là trung bình của ba lần từ một lần chạy học tăng cường trên bộ chấm điểm của chính Xiaomi, và cả hai đều chưa được gửi lên bảng DeepSWE công khai. Phép so sánh giữa MiMo-V2.6-Pro và Grok 4.6 có thể trụ được dưới sự soi xét nằm trên chỉ số độc lập, và ở đó câu trả lời ngược lại với các con số của nhà cung cấp: 46 so với 44, nghiêng về Xiaomi, với cách biệt hai điểm.

Grok 4.6 được phát hành vào ngày 12 tháng 8 năm 2026 bởi SpaceXAI và là cái tên đương nhiệm ở đây — một mô hình tiên tiến đã được phát hành, phục vụ rộng rãi, có bảng giá được ghi nhận và nhiều tháng đo lường độc lập đằng sau. Xiaomi MiMo-V2.6-Pro được cung cấp rộng rãi vào ngày 22 tháng 9 năm 2026, với các kho lưu trữ checkpoint học tăng cường của nó xuất hiện một ngày trước đó, và nó là cái tên mới. Cả hai đều có khả năng suy luận, cả hai đều được xây dựng cho công việc tác tử chạy dài, và khoảng cách giá giữa chúng đủ lớn đến mức việc cái tên mới còn thiếu kinh nghiệm là điều duy nhất khiến phép so sánh bị chững lại.

Mỗi mô hình thực sự là gì

Grok 4.6 là độc quyền, nhận đầu vào văn bản và hình ảnh và trả về văn bản, và có giới hạn kiến thức là ngày 1 tháng 2 năm 2026. Cửa sổ ngữ cảnh của nó là 500.000 token, bằng một nửa kích thước của các đối thủ chính và là thông số quan trọng nhất trên bảng thông số của nó. Giá niêm yết của nó là 2,00 đô la cho mỗi triệu token đầu vào, 0,50 đô la cho mỗi triệu token đầu vào được lưu trong bộ đệm và 6,00 đô la cho mỗi triệu token đầu ra dưới 200.000 token prompt, với một bước nhảy tại ranh giới đó: bằng hoặc trên 200K, giá trở thành 4,00 đô la, 1,00 đô la và 12,00 đô la, và bậc cao hơn tính phí toàn bộ yêu cầu thay vì phần vượt quá giới hạn. Xử lý ưu tiên tăng gấp đôi mức giá tiêu chuẩn. Artificial Analysis đã đo được 63,0 token đầu ra mỗi giây và 42,79 giây để có token đầu tiên ở mức nỗ lực tối đa, và 2.351,83 đô la để chạy toàn bộ chỉ mục.

Xiaomi MiMo-V2.6-Pro là một mô hình hỗn hợp chuyên gia thưa với tổng cộng 1,02 nghìn tỷ tham số và 42 tỷ tham số được kích hoạt mỗi token, có cửa sổ ngữ cảnh 1 triệu token và khả năng đa phương thức gốc trên văn bản, hình ảnh, video và âm thanh. Mô hình được cấp phép theo MIT với trọng số có thể tải xuống, và Xiaomi đã giữ nguyên mức giá của thế hệ trước thay vì tăng giá cho checkpoint mới — 0,43 USD cho mỗi triệu token đầu vào và 0,87 USD cho mỗi triệu token đầu ra, chiết khấu bộ nhớ đệm 99% và mức giá kết hợp 0,18 USD với tỷ lệ trộn 7:2:1 giữa trúng bộ nhớ đệm/đầu vào/đầu ra. Artificial Analysis đo được 134,3 token đầu ra mỗi giây, 2,15 giây đến token đầu tiên và 206,66 USD để chạy chỉ số — 0,13 USD mỗi tác vụ.

• Trọng số — MiMo-V2.6-Pro được cấp phép MIT và có thể tải xuống; Grok 4.6 độc quyền, chỉ qua API

• Tham số — MiMo-V2.6-Pro tổng 1,02T / 42B hoạt động; Grok 4.6 không được tiết lộ

• Ngữ cảnh — MiMo-V2.6-Pro 1M token; Grok 4.6 500K, với mức giá thay đổi đột ngột tại 200K token đầu vào

• Phương thức — MiMo-V2.6-Pro nhận văn bản, hình ảnh, video và âm thanh; bề mặt đầu vào được công bố của Grok 4.6 là văn bản và hình ảnh

• Điểm chỉ số — MiMo-V2.6-Pro 46; Grok 4.6 44, cả hai đều theo Artificial Analysis v4.3.2

• Giá niêm yết — MiMo-V2.6-Pro $0.43 / $0.87 mỗi 1M; Grok 4.6 $2.00 / $6.00, tăng gấp đôi khi đầu vào trên 200K

• Mức giá kết hợp — MiMo-V2.6-Pro $0,18 mỗi 1M; Grok 4.6 $1,35

• Chi phí để chạy chỉ mục — MiMo-V2.6-Pro $206.66; Grok 4.6 $2,351.83

• Tốc độ — MiMo-V2.6-Pro 134,3 token đầu ra/giây; Grok 4.6 63,0

• Thời gian đến token đầu tiên — MiMo-V2.6-Pro 2,15 giây; Grok 4.6 42,79 giây

• Mốc kiến thức — MiMo-V2.6-Pro chưa được công bố; Grok 4.6 ngày 1 tháng 2 năm 2026

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.6, subtitled Two vendor DeepSWE figures, neither submitted to the public board. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; list price $0.43 / $0.87 per 1M; context window 1M tokens; speed 134.3 tokens per second; DeepSWE v1.1 72.57 vendor-run, avg@3; public DeepSWE entry none. The right column, Grok 4.6 (high), reads Intelligence Index v4.3.2 44; list price $2.00 / $6.00 per 1M; context window 500K tokens; speed 63.0 tokens per second; DeepSWE v1.1 65.9% vendor-reported; public DeepSWE entry ~67% submitted. A footer notes the two DeepSWE figures come from different vendor harnesses with different metrics and must not be subtracted, and that Grok 4.6 list rates double at or above 200K input tokens. The OrcaRouter logo is composited in the bottom-right corner.

Bài kiểm chuẩn mà cả hai nhà cung cấp đều đã chạy, và vì sao nó không thể so sánh được

DeepSWE v1.1 là một đánh giá coding-agent của bên thứ ba, công khai và có thật, do Datacurve vận hành, và đây là nhóm tác vụ duy nhất mà cả hai công ty đều chọn để công bố kết quả. Điều đó khiến nó trở nên đầy cám dỗ. Nó không nên được dùng để so sánh đối đầu trực tiếp, và lý do không phải là một trong hai nhà cung cấp đang nói dối — mà là hai con số đó mô tả những phép đo khác nhau của cùng một tên tác vụ.

Con số 72,57 của Xiaomi là mức trung bình của ba lần chạy trên harness riêng của mình với mini-swe-agent, được tạo ra trong một lần chạy học tăng cường thay vì từ một ứng viên phát hành đã đóng băng, và được báo cáo cùng với một con số khởi điểm là 58,4. Lần chạy này được ghi nhận là 30 bước và khoảng 750.000 quỹ đạo cho mỗi mô hình, hoàn thành trong dưới sáu ngày với chi phí công bố khoảng 2,62 triệu USD cho mô hình Pro. Nó chưa được gửi lên bảng của Datacurve. Con số 65,9% của SpaceXAI cho Grok 4.6 là một con số trên slide ra mắt, lấy từ bộ đánh giá của chính nhà cung cấp, được báo cáo bên cạnh mức tăng so với Grok 4.5 là 11,9 điểm trên cùng benchmark — và bảng công khai có một cấu hình Grok 4.6 đã được gửi ở khoảng 67%, đủ gần với con số của nhà cung cấp để cho thấy harness ít nhất cũng tương đối khớp. Điều đó không đúng với con số của Xiaomi, vốn không có bản công khai tương ứng nào cả.

Vậy tuyên bố trung thực là thế này: trên bảng công khai, Grok 4.6 có mặt còn MiMo-V2.6-Pro thì vắng mặt. Trên bảng tổng hợp độc lập, cả hai thực ra đều được cùng một đơn vị đánh giá chạy thử, và mô hình của Xiaomi dẫn trước hai điểm. Hai sự thật đó không hề mâu thuẫn. Chúng chỉ đơn thuần đo lường những thứ khác nhau, và cái thứ hai mới là cái nên được trích dẫn.

Ngữ cảnh 500K là thông số quyết định khối lượng công việc thực tế

Nửa triệu token là một cửa sổ ngữ cảnh lớn theo bất kỳ tiêu chuẩn thông thường nào, và là một cửa sổ nhỏ đối với năm 2026. Các mô hình được xếp cùng nhóm với MiMo-V2.6-Pro đều ở mức 1M, và hệ quả thực tế thể hiện đúng ở những khối lượng công việc mà Grok 4.6 được quảng bá. Một tác nhân lập trình chạy dài hạn đang giữ một kho mã, một bản ghi công cụ và một kế hoạch tích lũy sẽ vượt qua 200.000 token prompt trong một phiên — và tại ngưỡng đó, mức giá của Grok 4.6 tăng gấp đôi và áp dụng hồi tố cho toàn bộ yêu cầu. Cùng phiên đó trên MiMo-V2.6-Pro chạy tới một triệu token mà không có thay đổi bậc giá.

Đó là khác biệt về thông số kỹ thuật và đồng thời là khác biệt về cấu trúc định giá, và cái thứ hai rất dễ bị bỏ qua khi so sánh các mức giá niêm yết. Mức giá trung bình $1.35 cho Grok 4.6 so với $0.18 cho MiMo-V2.6-Pro là khoảng cách 7,5 lần. Với một prompt vượt quá 200K, khoảng cách này nới rộng tới mức gần 15 lần, vì mức giá của Grok tăng gấp đôi còn của Xiaomi thì không đổi.

Lập luận phản bác cũng đã được ghi nhận, và nó xứng đáng được như vậy. Luận điểm ra mắt của Grok 4.6 là hiệu quả theo lượt thay vì ngữ cảnh thô: trong đánh giá dạng tác tử, nơi nó được đo lường đối chiếu với Claude Opus 5 trên các tác vụ giống hệt nhau, nó hoàn thành trong khoảng 53 lượt và khoảng 500 triệu token đầu vào, so với khoảng 103 lượt và hai tỷ token của mô hình kia, với chi phí ước tính $0.84 mỗi tác vụ — con số thấp nhất trong số các mô hình tiên phong trong so sánh đó. Một mô hình đi vòng lặp ít hơn một nửa số lần thì không cần nhiều ngữ cảnh đến thế, và cũng không đốt nhiều token đến thế. Đó là một lợi thế kiến trúc thực sự và là lập luận mạnh nhất cho Grok 4.6 trước bất kỳ phương án thay thế nào rẻ hơn trên mỗi token, kể cả phương án này.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

Đi đến từng nơi trong số đó

Grok 4.6 có trên OrcaRouter dưới dạng grok/grok-4.6, có thể truy cập qua một endpoint tương thích OpenAI theo giá niêm yết của nhà cung cấp với mức markup 0% — vì vậy khi SpaceXAI thay đổi giá, kể cả thay đổi ở ngưỡng 200K đó, thì ở phía chúng tôi sẽ có hiệu lực ngay trong cùng ngày. Xiaomi MiMo-V2.6-Pro không có trên OrcaRouter. Không có mô hình Xiaomi nào có mặt, và cách truy cập nó hiện nay là nền tảng riêng của Xiaomi hoặc một trong các danh mục bên thứ ba có liệt kê nó. Nói rõ điều đó hữu ích hơn là để một trang mô hình ngụ ý điều ngược lại.

Điều mà sự bất đối xứng đó đáng giá trên thực tế là một thử nghiệm rẻ. Grok 4.6 là mô hình mà bạn có thể đã và đang trả tiền để dùng. MiMo-V2.6-Pro là một cải thiện chỉ số hai điểm với mức giá chỉ bằng một phần nhỏ, ra mắt trong tuần này, chỉ có một tuyến phục vụ duy nhất phía sau. Câu hỏi đáng để trả lời không phải là cái nào tốt hơn trên lý thuyết, mà là mô hình Xiaomi có thể đảm nhận bao nhiêu lưu lượng Grok của bạn trên chính các prompt của bạn — và việc trả lời nó bằng cách mở một hợp đồng thứ hai, một khóa thứ hai và một quan hệ thanh toán thứ hai chính là rào cản khiến thử nghiệm không diễn ra. Với một endpoint duy nhất và chuyển đổi dự phòng tự động giữa các nhà cung cấp, việc so sánh chỉ là một thay đổi cấu hình, và phần dự phòng ở đây quan trọng hơn mức thường lệ: một mô hình vừa ra mắt trong tuần này và chỉ được một nhà cung cấp API niêm yết vào thời điểm Artificial Analysis ghi nhận nó thì không phải là thứ để đưa vào luồng production mà không có làn dự phòng để quay về.

Screenshot of the OrcaRouter model page for Grok 4.6, captured 22 September 2026, showing the breadcrumb Home > Models > SpaceXAI > Grok 4.6, the model id grok/grok-4.6 dated 2026-08-12, the Vision, Tools, JSON and Reasoning capability badges, and the on-this-page index for code samples, pricing, performance, public benchmarks, community buzz, comparisons and FAQ. The rate card sits below the visible area of the capture.

Nên chọn cái nào

Chọn Grok 4.6 khi thứ bạn đang tối ưu là hiệu quả theo lượt — những vòng lặp agent dài, nơi khả năng hoàn thành chỉ trong một nửa số bước của mô hình đáng giá hơn mức giá trên mỗi token — hoặc khi bạn muốn một mô hình đã được đo lường độc lập suốt nhiều tháng thay vì chỉ một tuần. Tốc độ 63 token mỗi giây và thời gian đến token đầu tiên là 42,79 giây khiến nó trở thành mô hình cho xử lý theo lô và khối lượng công việc ngoại tuyến nếu xét về tính tương tác, còn ngữ cảnh 500K với ngưỡng giá tăng vọt ở 200K là lý do để giữ prompt ngắn.

Hãy chọn MiMo-V2.6-Pro khi bạn đang chạy các vòng lặp lặp lại, nặng về ngữ cảnh, những vòng lặp sẽ vượt qua ngưỡng 200K của Grok, khi bạn cần độ trễ token đầu tiên đủ thấp để con người có thể chờ, khi bạn muốn trọng số nằm trong hạ tầng của riêng mình, hoặc khi khối lượng khiến khoảng cách tỷ lệ hỗn hợp 7,5x trở thành con số quyết định. Lợi thế hai điểm trên chỉ số của nó đủ nhỏ để tự nó không nên là lý do; chi phí $206.66 so với $2,351.83 để chạy cùng bộ đánh giá là lý do tốt hơn.

Điều sẽ giải quyết câu hỏi còn bỏ ngỏ là một cấu hình DeepSWE đã được nộp cho MiMo-V2.6-Pro. Grok 4.6 đã có một cấu hình như vậy. Ngay khi mô hình của Xiaomi xuất hiện trên bảng công khai với một harness được nêu rõ, một khoảng tin cậy và chi phí trên mỗi tác vụ, thì 72.57 không còn là con số của nhà cung cấp nữa và phép so sánh ở trên trở thành một phép so sánh thực sự — và xét khoảng cách hai điểm trên chỉ số, kết quả có thể nghiêng theo bất kỳ hướng nào.

OrcaRouter đưa hơn 200 mô hình vào sau một điểm cuối tương thích OpenAI duy nhất với giá niêm yết của nhà cung cấp, mức chênh lệch 0%, vì vậy khi nhà cung cấp thay đổi giá thì sẽ được cập nhật ngay trong cùng ngày.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày