
MiMo-V2.6-Pro so với Grok 4.6: Cả hai nhà cung cấp đều công bố số liệu DeepSWE, và cả hai đều không có trên bảng xếp hạng.
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Hai nhà cung cấp, một benchmark, hai con số không thể trừ cho nhau. Tài liệu ra mắt của SpaceXAI cho Grok 4.6 báo cáo 65,9% trên DeepSWE v1.1. Tài liệu của Xiaomi cho MiMo-V2.6-Pro báo cáo 72,57 trên DeepSWE v1.1. Đọc cùng nhau, chúng gợi ý rằng mô hình open-weights rẻ hơn đánh bại mô hình độc quyền tiên phong gần bảy điểm. Đọc kỹ thì chúng gần như chẳng nói lên điều gì, bởi một cái là tỷ lệ phần trăm trên slide ra mắt bằng harness của chính nhà cung cấp, còn cái kia là trung bình của ba lần từ một lần chạy học tăng cường trên bộ chấm điểm của chính Xiaomi, và cả hai đều chưa được gửi lên bảng DeepSWE công khai. Phép so sánh giữa MiMo-V2.6-Pro và Grok 4.6 có thể trụ được dưới sự soi xét nằm trên chỉ số độc lập, và ở đó câu trả lời ngược lại với các con số của nhà cung cấp: 46 so với 44, nghiêng về Xiaomi, với cách biệt hai điểm.
Grok 4.6 được phát hành vào ngày 12 tháng 8 năm 2026 bởi SpaceXAI và là cái tên đương nhiệm ở đây — một mô hình tiên tiến đã được phát hành, phục vụ rộng rãi, có bảng giá được ghi nhận và nhiều tháng đo lường độc lập đằng sau. Xiaomi MiMo-V2.6-Pro được cung cấp rộng rãi vào ngày 22 tháng 9 năm 2026, với các kho lưu trữ checkpoint học tăng cường của nó xuất hiện một ngày trước đó, và nó là cái tên mới. Cả hai đều có khả năng suy luận, cả hai đều được xây dựng cho công việc tác tử chạy dài, và khoảng cách giá giữa chúng đủ lớn đến mức việc cái tên mới còn thiếu kinh nghiệm là điều duy nhất khiến phép so sánh bị chững lại.
Mỗi mô hình thực sự là gì
Grok 4.6 là độc quyền, nhận đầu vào văn bản và hình ảnh và trả về văn bản, và có giới hạn kiến thức là ngày 1 tháng 2 năm 2026. Cửa sổ ngữ cảnh của nó là 500.000 token, bằng một nửa kích thước của các đối thủ chính và là thông số quan trọng nhất trên bảng thông số của nó. Giá niêm yết của nó là 2,00 đô la cho mỗi triệu token đầu vào, 0,50 đô la cho mỗi triệu token đầu vào được lưu trong bộ đệm và 6,00 đô la cho mỗi triệu token đầu ra dưới 200.000 token prompt, với một bước nhảy tại ranh giới đó: bằng hoặc trên 200K, giá trở thành 4,00 đô la, 1,00 đô la và 12,00 đô la, và bậc cao hơn tính phí toàn bộ yêu cầu thay vì phần vượt quá giới hạn. Xử lý ưu tiên tăng gấp đôi mức giá tiêu chuẩn. Artificial Analysis đã đo được 63,0 token đầu ra mỗi giây và 42,79 giây để có token đầu tiên ở mức nỗ lực tối đa, và 2.351,83 đô la để chạy toàn bộ chỉ mục.
Xiaomi MiMo-V2.6-Pro là một mô hình hỗn hợp chuyên gia thưa với tổng cộng 1,02 nghìn tỷ tham số và 42 tỷ tham số được kích hoạt mỗi token, có cửa sổ ngữ cảnh 1 triệu token và khả năng đa phương thức gốc trên văn bản, hình ảnh, video và âm thanh. Mô hình được cấp phép theo MIT với trọng số có thể tải xuống, và Xiaomi đã giữ nguyên mức giá của thế hệ trước thay vì tăng giá cho checkpoint mới — 0,43 USD cho mỗi triệu token đầu vào và 0,87 USD cho mỗi triệu token đầu ra, chiết khấu bộ nhớ đệm 99% và mức giá kết hợp 0,18 USD với tỷ lệ trộn 7:2:1 giữa trúng bộ nhớ đệm/đầu vào/đầu ra. Artificial Analysis đo được 134,3 token đầu ra mỗi giây, 2,15 giây đến token đầu tiên và 206,66 USD để chạy chỉ số — 0,13 USD mỗi tác vụ.
• Trọng số — MiMo-V2.6-Pro được cấp phép MIT và có thể tải xuống; Grok 4.6 độc quyền, chỉ qua API
• Tham số — MiMo-V2.6-Pro tổng 1,02T / 42B hoạt động; Grok 4.6 không được tiết lộ
• Ngữ cảnh — MiMo-V2.6-Pro 1M token; Grok 4.6 500K, với mức giá thay đổi đột ngột tại 200K token đầu vào
• Phương thức — MiMo-V2.6-Pro nhận văn bản, hình ảnh, video và âm thanh; bề mặt đầu vào được công bố của Grok 4.6 là văn bản và hình ảnh
• Điểm chỉ số — MiMo-V2.6-Pro 46; Grok 4.6 44, cả hai đều theo Artificial Analysis v4.3.2
• Giá niêm yết — MiMo-V2.6-Pro $0.43 / $0.87 mỗi 1M; Grok 4.6 $2.00 / $6.00, tăng gấp đôi khi đầu vào trên 200K
• Mức giá kết hợp — MiMo-V2.6-Pro $0,18 mỗi 1M; Grok 4.6 $1,35
• Chi phí để chạy chỉ mục — MiMo-V2.6-Pro $206.66; Grok 4.6 $2,351.83
• Tốc độ — MiMo-V2.6-Pro 134,3 token đầu ra/giây; Grok 4.6 63,0
• Thời gian đến token đầu tiên — MiMo-V2.6-Pro 2,15 giây; Grok 4.6 42,79 giây
• Mốc kiến thức — MiMo-V2.6-Pro chưa được công bố; Grok 4.6 ngày 1 tháng 2 năm 2026

Bài kiểm chuẩn mà cả hai nhà cung cấp đều đã chạy, và vì sao nó không thể so sánh được
DeepSWE v1.1 là một đánh giá coding-agent của bên thứ ba, công khai và có thật, do Datacurve vận hành, và đây là nhóm tác vụ duy nhất mà cả hai công ty đều chọn để công bố kết quả. Điều đó khiến nó trở nên đầy cám dỗ. Nó không nên được dùng để so sánh đối đầu trực tiếp, và lý do không phải là một trong hai nhà cung cấp đang nói dối — mà là hai con số đó mô tả những phép đo khác nhau của cùng một tên tác vụ.
Con số 72,57 của Xiaomi là mức trung bình của ba lần chạy trên harness riêng của mình với mini-swe-agent, được tạo ra trong một lần chạy học tăng cường thay vì từ một ứng viên phát hành đã đóng băng, và được báo cáo cùng với một con số khởi điểm là 58,4. Lần chạy này được ghi nhận là 30 bước và khoảng 750.000 quỹ đạo cho mỗi mô hình, hoàn thành trong dưới sáu ngày với chi phí công bố khoảng 2,62 triệu USD cho mô hình Pro. Nó chưa được gửi lên bảng của Datacurve. Con số 65,9% của SpaceXAI cho Grok 4.6 là một con số trên slide ra mắt, lấy từ bộ đánh giá của chính nhà cung cấp, được báo cáo bên cạnh mức tăng so với Grok 4.5 là 11,9 điểm trên cùng benchmark — và bảng công khai có một cấu hình Grok 4.6 đã được gửi ở khoảng 67%, đủ gần với con số của nhà cung cấp để cho thấy harness ít nhất cũng tương đối khớp. Điều đó không đúng với con số của Xiaomi, vốn không có bản công khai tương ứng nào cả.
Vậy tuyên bố trung thực là thế này: trên bảng công khai, Grok 4.6 có mặt còn MiMo-V2.6-Pro thì vắng mặt. Trên bảng tổng hợp độc lập, cả hai thực ra đều được cùng một đơn vị đánh giá chạy thử, và mô hình của Xiaomi dẫn trước hai điểm. Hai sự thật đó không hề mâu thuẫn. Chúng chỉ đơn thuần đo lường những thứ khác nhau, và cái thứ hai mới là cái nên được trích dẫn.
Ngữ cảnh 500K là thông số quyết định khối lượng công việc thực tế
Nửa triệu token là một cửa sổ ngữ cảnh lớn theo bất kỳ tiêu chuẩn thông thường nào, và là một cửa sổ nhỏ đối với năm 2026. Các mô hình được xếp cùng nhóm với MiMo-V2.6-Pro đều ở mức 1M, và hệ quả thực tế thể hiện đúng ở những khối lượng công việc mà Grok 4.6 được quảng bá. Một tác nhân lập trình chạy dài hạn đang giữ một kho mã, một bản ghi công cụ và một kế hoạch tích lũy sẽ vượt qua 200.000 token prompt trong một phiên — và tại ngưỡng đó, mức giá của Grok 4.6 tăng gấp đôi và áp dụng hồi tố cho toàn bộ yêu cầu. Cùng phiên đó trên MiMo-V2.6-Pro chạy tới một triệu token mà không có thay đổi bậc giá.
Đó là khác biệt về thông số kỹ thuật và đồng thời là khác biệt về cấu trúc định giá, và cái thứ hai rất dễ bị bỏ qua khi so sánh các mức giá niêm yết. Mức giá trung bình $1.35 cho Grok 4.6 so với $0.18 cho MiMo-V2.6-Pro là khoảng cách 7,5 lần. Với một prompt vượt quá 200K, khoảng cách này nới rộng tới mức gần 15 lần, vì mức giá của Grok tăng gấp đôi còn của Xiaomi thì không đổi.
Lập luận phản bác cũng đã được ghi nhận, và nó xứng đáng được như vậy. Luận điểm ra mắt của Grok 4.6 là hiệu quả theo lượt thay vì ngữ cảnh thô: trong đánh giá dạng tác tử, nơi nó được đo lường đối chiếu với Claude Opus 5 trên các tác vụ giống hệt nhau, nó hoàn thành trong khoảng 53 lượt và khoảng 500 triệu token đầu vào, so với khoảng 103 lượt và hai tỷ token của mô hình kia, với chi phí ước tính $0.84 mỗi tác vụ — con số thấp nhất trong số các mô hình tiên phong trong so sánh đó. Một mô hình đi vòng lặp ít hơn một nửa số lần thì không cần nhiều ngữ cảnh đến thế, và cũng không đốt nhiều token đến thế. Đó là một lợi thế kiến trúc thực sự và là lập luận mạnh nhất cho Grok 4.6 trước bất kỳ phương án thay thế nào rẻ hơn trên mỗi token, kể cả phương án này.

Đi đến từng nơi trong số đó
Grok 4.6 có trên OrcaRouter dưới dạng grok/grok-4.6, có thể truy cập qua một endpoint tương thích OpenAI theo giá niêm yết của nhà cung cấp với mức markup 0% — vì vậy khi SpaceXAI thay đổi giá, kể cả thay đổi ở ngưỡng 200K đó, thì ở phía chúng tôi sẽ có hiệu lực ngay trong cùng ngày. Xiaomi MiMo-V2.6-Pro không có trên OrcaRouter. Không có mô hình Xiaomi nào có mặt, và cách truy cập nó hiện nay là nền tảng riêng của Xiaomi hoặc một trong các danh mục bên thứ ba có liệt kê nó. Nói rõ điều đó hữu ích hơn là để một trang mô hình ngụ ý điều ngược lại.
Điều mà sự bất đối xứng đó đáng giá trên thực tế là một thử nghiệm rẻ. Grok 4.6 là mô hình mà bạn có thể đã và đang trả tiền để dùng. MiMo-V2.6-Pro là một cải thiện chỉ số hai điểm với mức giá chỉ bằng một phần nhỏ, ra mắt trong tuần này, chỉ có một tuyến phục vụ duy nhất phía sau. Câu hỏi đáng để trả lời không phải là cái nào tốt hơn trên lý thuyết, mà là mô hình Xiaomi có thể đảm nhận bao nhiêu lưu lượng Grok của bạn trên chính các prompt của bạn — và việc trả lời nó bằng cách mở một hợp đồng thứ hai, một khóa thứ hai và một quan hệ thanh toán thứ hai chính là rào cản khiến thử nghiệm không diễn ra. Với một endpoint duy nhất và chuyển đổi dự phòng tự động giữa các nhà cung cấp, việc so sánh chỉ là một thay đổi cấu hình, và phần dự phòng ở đây quan trọng hơn mức thường lệ: một mô hình vừa ra mắt trong tuần này và chỉ được một nhà cung cấp API niêm yết vào thời điểm Artificial Analysis ghi nhận nó thì không phải là thứ để đưa vào luồng production mà không có làn dự phòng để quay về.

Nên chọn cái nào
Chọn Grok 4.6 khi thứ bạn đang tối ưu là hiệu quả theo lượt — những vòng lặp agent dài, nơi khả năng hoàn thành chỉ trong một nửa số bước của mô hình đáng giá hơn mức giá trên mỗi token — hoặc khi bạn muốn một mô hình đã được đo lường độc lập suốt nhiều tháng thay vì chỉ một tuần. Tốc độ 63 token mỗi giây và thời gian đến token đầu tiên là 42,79 giây khiến nó trở thành mô hình cho xử lý theo lô và khối lượng công việc ngoại tuyến nếu xét về tính tương tác, còn ngữ cảnh 500K với ngưỡng giá tăng vọt ở 200K là lý do để giữ prompt ngắn.
Hãy chọn MiMo-V2.6-Pro khi bạn đang chạy các vòng lặp lặp lại, nặng về ngữ cảnh, những vòng lặp sẽ vượt qua ngưỡng 200K của Grok, khi bạn cần độ trễ token đầu tiên đủ thấp để con người có thể chờ, khi bạn muốn trọng số nằm trong hạ tầng của riêng mình, hoặc khi khối lượng khiến khoảng cách tỷ lệ hỗn hợp 7,5x trở thành con số quyết định. Lợi thế hai điểm trên chỉ số của nó đủ nhỏ để tự nó không nên là lý do; chi phí $206.66 so với $2,351.83 để chạy cùng bộ đánh giá là lý do tốt hơn.
Điều sẽ giải quyết câu hỏi còn bỏ ngỏ là một cấu hình DeepSWE đã được nộp cho MiMo-V2.6-Pro. Grok 4.6 đã có một cấu hình như vậy. Ngay khi mô hình của Xiaomi xuất hiện trên bảng công khai với một harness được nêu rõ, một khoảng tin cậy và chi phí trên mỗi tác vụ, thì 72.57 không còn là con số của nhà cung cấp nữa và phép so sánh ở trên trở thành một phép so sánh thực sự — và xét khoảng cách hai điểm trên chỉ số, kết quả có thể nghiêng theo bất kỳ hướng nào.
OrcaRouter đưa hơn 200 mô hình vào sau một điểm cuối tương thích OpenAI duy nhất với giá niêm yết của nhà cung cấp, mức chênh lệch 0%, vì vậy khi nhà cung cấp thay đổi giá thì sẽ được cập nhật ngay trong cùng ngày.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
