
Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6: Một checkpoint, giá gấp mười lần
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed và Xiaomi MiMo-V2.6-Pro không phải là hai mô hình. Chúng là một mô hình được bán theo hai cách. Cả hai đều được phục vụ từ cùng một checkpoint MiMo-V2.6 nghìn tỷ tham số mà Xiaomi đã công bố vào tháng 9 năm 2026 — hạng Pro của dòng Xiaomi MiMo-V2.6, với người anh em nhỏ hơn là Xiaomi MiMo-V2.6-Flash. Sự khác biệt giữa hai lựa chọn Pro hoàn toàn nằm ở tốc độ token xuất ra và mức giá bạn phải trả. Gói tiêu chuẩn tính 0,435 đô la cho mỗi triệu token đầu vào và 0,87 đô la cho mỗi triệu token đầu ra. Gói UltraSpeed tính 4,35 đô la và 8,70 đô la. Đó là tỷ lệ rõ ràng 10 trên 1 ở cả hai phía của đồng hồ đo, và nó mua một tuyên bố về tốc độ đầu ra nhanh gấp khoảng mười lần — một tuyên bố mà Xiaomi đưa ra về ngăn xếp phục vụ của chính mình, và là điều mà chưa có benchmark độc lập nào công bố con số cho đến nay.
Vậy nên câu hỏi thú vị không phải là mô hình nào tốt hơn. Mà là liệu mức bội số gấp mười lần có phải là cái giá thích đáng cho tốc độ gấp mười lần hay không, và hóa ra điều đó có một tiền lệ đáng đọc trước khi bạn đặt cược lộ trình sản xuất của mình vào nó.
Tầng nhanh là một quyết định về phục vụ, không phải quyết định về mô hình
Cách chính Xiaomi định vị dòng UltraSpeed là nó khớp với mô hình tiêu chuẩn về chất lượng và chỉ khác ở thông lượng. Điều đó quan trọng hơn vẻ ngoài của nó, vì nó loại bỏ lý do thường thấy khiến người ta chần chừ với một bậc mới. Bạn không đặt cược vào tính cách của một checkpoint khác, hành vi từ chối hay những điểm kỳ quặc trong định dạng của nó. Bạn đang đặt cược rằng cùng một bộ trọng số, khi chạy qua một cấu hình phục vụ tích cực hơn, sẽ hành xử giống hệt trên các prompt của bạn. Nếu điều đó vẫn đúng, việc chuyển đổi giữa hai bậc chỉ là thay đổi cấu hình, không phải migration.
Những gì nằm bên trong cấu hình phục vụ đó chưa được tài liệu hóa cho thế hệ này. Bậc UltraSpeed trước đó, được xây dựng trên checkpoint MiMo-V2.5-Pro vào tháng 6 năm 2026, được Xiaomi mô tả là chỉ dùng lượng tử hóa FP4 trên các lớp expert, một sơ đồ giải mã suy đoán song song theo khối gọi là DFlash, và một runtime gọi là TileRT, và nó chạy trên một nút tám GPU duy nhất. Xiaomi chưa công bố chi tiết tương đương cho bậc V2.6. Hãy coi ngăn xếp trước đó là bối cảnh cho cách tốc độ đạt được, chứ không phải là mô tả về những gì đang chạy hiện nay.
Dòng sản phẩm mà nó nằm trong thì ngắn. Bên cạnh hai hạng Pro là MiMo-V2.6-Flash, người anh em nhỏ hơn với tổng cộng 309 tỷ tham số và 15 tỷ tham số hoạt động. Pro là mẫu chủ lực mixture-of-experts thưa: Artificial Analysis xếp nó ở mức 1,0 nghìn tỷ tham số tổng cộng với 42 tỷ tham số hoạt động mỗi token, cửa sổ ngữ cảnh 1 triệu token, và giấy phép MIT với trọng số trên Hugging Face. Đó là những con số cần ghi nhớ, vì toàn bộ sự so sánh đều dựa trên chúng.
Điều gì thực sự được xác minh, và điều gì thì không

Sự bất đối xứng giữa hai cột ở trên là điều quan trọng nhất trong bài viết này. Gần như mọi thứ có thể đo lường được về cặp này đều đã được đo ở phía chậm.
Artificial Analysis đã đánh giá chuẩn MiMo-V2.6-Pro và công bố Chỉ số Intelligence Index là 46 cho nó — điểm cao nhất trong lớp 114 mô hình mà họ xếp mô hình này vào. Nó đo được 134,3 token đầu ra mỗi giây qua API của Xiaomi, so với trung vị của lớp là 77,9, và thời gian đến chunk đầu tiên là 2,15 giây so với trung vị 2,34. Nó liệt kê chi phí cho mỗi tác vụ Intelligence Index là 0,13 đô la, mức chiết khấu cache 99% trên giá đầu vào, và độ dài đầu ra ở mức 140 triệu token. Đây là những con số độc lập trên một cấu hình được nêu tên, và chúng là mốc thông lượng cứng duy nhất mà so sánh này có.
Đối với UltraSpeed, danh sách đã xác minh ngắn hơn nhiều:
• Tốc độ đầu ra — khoảng gấp mười lần gói tiêu chuẩn, theo Xiaomi công bố và được các nền tảng niêm yết nó nhắc lại. Chưa có bên thứ ba nào công bố phép đo token mỗi giây cho riêng gói này.
• Giá — 4,35 USD cho mỗi triệu token đầu vào và 8,70 USD cho mỗi triệu token đầu ra, gấp mười lần so với gói tiêu chuẩn ở cả hai mức. Không có bậc cache nào được liệt kê cùng với hai mức giá đó.
• Chất lượng — "khớp với bản gốc", lại là một tuyên bố của nhà cung cấp. Chưa có đánh giá độc lập nào về điểm cuối UltraSpeed được công bố, vì vậy tuyên bố rằng chất lượng không thay đổi là chưa được kiểm chứng chứ không phải bị bác bỏ.
• Ngữ cảnh và phương thức — 1.048.576 token cùng đầu vào văn bản, hình ảnh, video và âm thanh gốc, được kế thừa từ checkpoint cơ sở.
Cũng có một benchmark của nhà cung cấp đáng được nêu đích danh chính vì cách nó đã lan truyền. Bảng điều khiển học tăng cường công khai của Xiaomi, nơi đã phát trực tuyến các đợt chạy hậu huấn luyện V2.6 vào tháng 9 năm 2026, báo cáo điểm DeepSWE v1.1 là 72.57 cho bản chạy Pro và 65.68 cho Flash. Những điểm đó đến từ đánh giá ngoại tuyến của chính Xiaomi, sử dụng harness mini-swe-agent với kết quả trung bình của ba lần; chúng chưa từng được gửi lên bảng xếp hạng công khai và chưa được tái lập bên ngoài phòng thí nghiệm. Nếu bạn từng thấy 72.57 được trích dẫn như một điểm trên bảng xếp hạng, thì đó là một con số của nhà cung cấp đang khoác lên mình bộ áo của bảng xếp hạng.

Tiền lệ: lần trước Xiaomi chỉ thu gấp ba lần, chứ không phải mười lần
Đây không phải là mức tốc độ đầu tiên của Xiaomi, và mức trước đó là phép so sánh hữu ích nhất trong toàn bộ câu chuyện — bởi vì hệ số nhân đã thay đổi.
MiMo-V2.5-Pro-UltraSpeed ra mắt vào tháng 6 năm 2026, được xây dựng trên checkpoint V2.5-Pro, và được định giá ở mức khoảng gấp ba lần đơn giá đầu ra của mô hình tiêu chuẩn. Lời chào hàng của Xiaomi khi đó cũng chính là lời chào hàng mà hãng đang đưa ra hiện nay: tốc độ đầu ra nhanh gấp khoảng mười lần. Các bài đưa tin thời điểm đó báo cáo thông lượng duy trì khoảng 1.000 token mỗi giây, đạt đỉnh gần 1.200, trên một node tám GPU duy nhất, dù chính trang của mô hình liệt kê dải rộng hơn từ 500 đến 1.000 — và không có số liệu nào trong đó được xác minh độc lập. Quyền truy cập bị giới hạn sau một biểu mẫu đăng ký thay vì đăng ký mở.
Đặt hai thứ cạnh nhau và sự dịch chuyển chính là câu chuyện. Bội số tốc độ vẫn ở mức xấp xỉ mười. Bội số giá đã chuyển từ ba lên mười. Đó là một thỏa thuận rất khác cho cùng một kiểu nâng cấp, và Xiaomi chưa công bố lời giải thích nào cho thay đổi đó. Nó có thể phản ánh việc phục vụ thực sự đắt đỏ hơn — một checkpoint lớn hơn, một cấu hình giải mã tích cực hơn, hoặc dung lượng chặt hơn khi ra mắt. Nó có thể phản ánh mức giá trong cửa sổ ra mắt cho một hạng chỉ mới có sẵn trong một ngày. Điều nó chưa có là một lý giải công khai mà bạn có thể kiểm chứng.
Có một điểm khác biệt thực tế đáng lưu ý cho bất kỳ ai đã từng dùng gói V2.5: gói đó là một bản dùng thử có giới hạn. Gói V2.6 được niêm yết là sẵn có rộng rãi thông qua API riêng của Xiaomi và một số nền tảng bên thứ ba, với mức giá đã công bố, không cần bước đăng ký. Dù còn thay đổi nào khác, rào cản để dùng thử nó đã giảm đi.
Gấp mười lần tốn kém bao nhiêu trên một khối lượng công việc thực tế
Tỷ lệ phần trăm che giấu hình dạng của điều này, vì vậy đây là phép tính trên một lượt chạy tác nhân cụ thể — một lượt đọc 20 triệu token đầu vào và phát ra 2 triệu token đầu ra trong suốt vòng đời của nó. Đó là một khối lượng công việc tác nhân nặng nhưng không hề kỳ lạ, kiểu mà một mô hình lặp qua các lệnh gọi công cụ và đọc lại ngữ cảnh của chính nó.
• Gói tiêu chuẩn, đầu vào — 20 triệu token với $0.435 mỗi triệu: $8.70.
• Gói tiêu chuẩn, đầu ra — 2 triệu token với $0,87 mỗi triệu: $1,74.
• Gói Tiêu chuẩn, tổng cộng — 10,44 đô-la mỗi lần chạy.
• Gói UltraSpeed, đầu vào — 20 triệu token với giá $4,35 mỗi triệu: $87,00.
• Gói UltraSpeed, đầu ra — 2M token với $8.70 mỗi triệu: $17.40.
• Gói UltraSpeed, tổng — $104.40 mỗi lần chạy.
Sự khác biệt là $93.96, và nó đúng bằng mười lần toàn bộ hóa đơn chứ không phải mười lần một dòng trong đó, vì cả hai mức giá đều tăng cùng nhau. Giờ đến mặt bên kia của sổ sách. Ở mức 134,3 token đầu ra mỗi giây mà Artificial Analysis đo được cho gói tiêu chuẩn, việc tạo ra 2 triệu token đầu ra mất hơn bốn giờ thời gian tạo thuần túy một chút. Ở tốc độ gấp mười lần, việc đó mất khoảng hai mươi lăm phút. Vậy khoản $94 thêm vào mua lại khoảng ba tiếng rưỡi đồng hồ thực trong lần chạy này — tạm tính khoảng $27 cho mỗi giờ tiết kiệm được, nếu bạn muốn hiểu theo cách đó.
Liệu sự đánh đổi đó có tốt hay không phụ thuộc hoàn toàn vào việc thời gian thực tế đáng giá bao nhiêu đối với bạn, và có một điểm rắc rối đi ngược lại cách hiểu ngây thơ. Giá đầu vào của gói tiêu chuẩn được hưởng mức giảm giá cache 99% trên trang của Artificial Analysis, nghĩa là nửa hóa đơn dành cho đầu vào có thể giảm xuống gần như bằng không với các khối lượng công việc đọc lại cùng một ngữ cảnh. Danh mục niêm yết của UltraSpeed chỉ hiển thị hai mức giá chính và không có hạng cache. Nếu khối lượng công việc của bạn nặng về cache, bội số hiệu dụng không phải là mười — mà còn tệ hơn nhiều, vì bạn mất khoản giảm giá ở phía mà trước đó bạn gần như chẳng phải trả gì. Nếu khối lượng công việc của bạn nặng về đầu ra và nhẹ về cache, con số gấp mười lần khá sát với con số thực. Hãy đo tỷ trọng của chính bạn trước khi tin vào bất kỳ con số nào trong hai con số đó.
Sự bất đối xứng của open-weights
Giữa hai hạng có một sự khác biệt mang tính cấu trúc không liên quan gì đến giá cả hay tốc độ, và nó có thể còn quan trọng hơn cả hai yếu tố đó.
MiMo-V2.6-Pro được phát hành theo giấy phép MIT với các trọng số được công bố trên Hugging Face. Điều đó cho phép triển khai thương mại, sửa đổi và huấn luyện thêm, đồng nghĩa mô hình tiêu chuẩn có một mức sàn dưới giá của nó mà không nhà cung cấp nào có thể nâng lên: nếu mức giá dịch vụ lưu trữ không còn hợp lý, bạn có thể tự phục vụ checkpoint. Bạn sẽ không thể đạt được thông lượng của Xiaomi trên phần cứng của riêng mình, và bạn sẽ phải trả tiền cho các GPU, nhưng lựa chọn đó tồn tại và nó giới hạn mức mà gói dịch vụ lưu trữ có thể tính phí.
UltraSpeed không có mức sàn như vậy. Không có trọng số UltraSpeed, bởi vì gói này là ngăn xếp phục vụ chứ không phải mô hình — checkpoint chính là cái đã công khai, và thứ bạn đang thuê là khả năng chạy nó nhanh của Xiaomi. Đó là một thứ chính đáng để bán, và nó có cùng dạng thức với mọi gói tốc độ khác trên thị trường. Điều đó có nghĩa là mức giá gấp mười lần không có ràng buộc cạnh tranh nào ngoài các nhà cung cấp khác cũng chạy cùng bộ trọng số mở đó, và không có lối thoát tự host nếu giá lại thay đổi.

Hãy đối chiếu điều đó với bức tranh về tính sẵn có. Checkpoint tiêu chuẩn có thể truy cập qua các kênh riêng của Xiaomi và một số nền tảng bên thứ ba, và nó cũng là một bản tải xuống. Bậc UltraSpeed có thể truy cập qua API riêng của Xiaomi và một số nền tảng bên thứ ba, và đó là cách duy nhất để có được nó. Với bất kỳ ai đang cân nhắc một phụ thuộc lâu dài, sự khác biệt về tính tùy chọn đó đáng để được định giá cùng với mức giá trên mỗi token.
Ai nên lấy cái nào
Quyết định này tách bạch rõ ràng dựa trên việc chi phí của bạn có bao nhiêu phần đến từ token đầu ra và ngân sách độ trễ của bạn có bao nhiêu phần là quá trình sinh nội dung thay vì chờ trong hàng đợi.
• Dùng UltraSpeed khi khối lượng công việc nặng về đầu ra, nhẹ về cache và mang tính tương tác — tạo nội dung dài, các vòng lặp agent nơi mô hình viết rất nhiều suy luận giữa các lần gọi công cụ, hoặc bất cứ tình huống nào mà một người đang chờ ở đầu bên kia của yêu cầu.
• Hãy chọn gói tiêu chuẩn khi khối lượng công việc nặng về bộ nhớ đệm, chấp nhận xử lý theo lô, hoặc nhạy cảm về chi phí ở mức cận biên — phân loại hàng loạt, trả lời tăng cường truy xuất trên một kho ngữ liệu cố định, các lượt chạy đánh giá qua đêm, bất cứ thứ gì mà bốn giờ tạo sinh là ổn vì không có ai đang theo dõi.
• Hãy chọn gói tiêu chuẩn khi bạn muốn có tùy chọn tự host. Nếu lập trường tuân thủ của bạn đòi hỏi những trọng số mà bạn có thể nắm giữ, thì UltraSpeed không khả dụng với bạn ở bất kỳ mức giá nào.
• Đừng chọn bên nào cho đến khi bạn đã đo lường. Tuyên bố gấp mười lần là con số then chốt ở đây và hiện tại nó do nhà cung cấp đưa ra. Một buổi chiều tự chạy các prompt của bạn qua cả hai hạng sẽ cho bạn biết nhiều hơn bất kỳ số liệu công bố nào, bởi vì con số thông lượng duy nhất mà bất kỳ ai đã xác minh độc lập thuộc về phía chậm hơn trong so sánh.
Về điểm cuối cùng đó, cơ chế kiểm thử một bậc phục vụ cũng giống như kiểm thử một mô hình, và đó chính là lúc một lớp định tuyến chứng minh được giá trị của mình. OrcaRouter mang hơn 200 mô hình đằng sau một khóa API duy nhất với mức giá niêm yết của nhà cung cấp và mức chênh lệch 0% được chuyển nguyên, vì vậy một thay đổi giá từ nhà cung cấp sẽ tác động đến phía bạn ngay trong cùng ngày thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo. Chuyển đổi dự phòng tự động nghĩa là một bậc mà bạn vẫn đang đánh giá sẽ không bao giờ tự nó nằm trên đường đi production, và DSL định tuyến cho phép bạn gửi một loại yêu cầu đến endpoint nhanh và mọi thứ còn lại đến endpoint tiêu chuẩn mà không cần duy trì hai tích hợp. Tất cả những điều đó không đòi hỏi riêng các mô hình của Xiaomi — vấn đề là những quyết định ở cấp bậc như thế này rất dễ đảo ngược khi các bậc nằm sau một khóa duy nhất.
Điều gì sẽ giải quyết việc này?
Thực trạng trung thực của câu hỏi MiMo-V2.6-Pro-UltraSpeed so với MiMo-V2.6-Pro là một nửa được đo lường và một nửa được khẳng định. Hạng tiêu chuẩn có một Intelligence Index độc lập, một con số thông lượng độc lập, và trọng số mở được công bố. Hạng nhanh có một mức giá, một cửa sổ ngữ cảnh, và một lời hứa từ nhà cung cấp rằng đó là cùng một mô hình đang chạy nhanh hơn.
Ba điều sẽ thu hẹp khoảng cách. Một phép đo thông lượng độc lập trên endpoint UltraSpeed — Artificial Analysis đã đo gói tiêu chuẩn thông qua API của Xiaomi, nên cách xử lý tương tự là hoàn toàn khả thi và đơn giản là vẫn chưa diễn ra. Một chính sách cache cho gói nhanh, vì việc thiếu nó chính là thứ biến hóa đơn gấp mười lần thành thứ gì đó còn tệ hơn trong các tác vụ nặng về cache. Và bất kỳ chi tiết nào được công bố về stack phục vụ V2.6, theo cách Xiaomi đã tài liệu hóa các expert FP4, DFlash và TileRT cho thế hệ V2.5.
Cho đến lúc đó, mức giá gấp mười lần là thật, còn tốc độ gấp mười lần chỉ là một lời khẳng định. Nếu khối lượng công việc của bạn nặng về đầu ra và có người đang chờ, lời khẳng định đó đáng để kiểm chứng trên chính các prompt của bạn — và đáng để kiểm chứng phía sau một lớp cho phép bạn chuyển đổi trở lại ngay trong cùng buổi chiều nếu nó không đứng vững.
