
GPT-6.1 Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed: Hai làn đường cao tốc, một bên nói rõ giá phải trả
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Hai cách nhanh nhất để mua một mô hình tiên phong đã được mở bán cách nhau mười sáu ngày, và chỉ một trong số đó cho bạn biết tốc độ được tạo ra như thế nào. GPT-6.1 Ultrafast — tầng phục vụ trên GPT-6.1 Sol, mà OpenAI phát hành vào ngày 29 tháng 9 năm 2026 và có thêm tầng này vào ngày 8 tháng 10 năm 2026 — là một mô hình chủ lực đóng mà bạn tiếp cận qua API, được định giá gấp sáu lần Standard và không có tài liệu công bố nào về điều gì xảy ra giữa các trọng số và yêu cầu của bạn. Xiaomi MiMo v2.6 Pro Ultraspeed, được phát hành ngày 22 tháng 9 năm 2026, là một tầng tốc độ trên MiMo-V2.6-Pro, một checkpoint được cấp phép MIT mà môi trường học tăng cường của nó cũng do Xiaomi công bố. Cả hai đều bán độ trễ theo bội số. Chỉ bội số của Xiaomi nằm trên một thứ mà khách hàng có thể kiểm tra, và sự khác biệt đó có giá trị hơn đối với quyết định so với cả hai tuyên bố tốc độ.
Giá của hai làn là phần dễ và nó đã được nói tới. Phần khó nằm ở chỗ một bậc tốc độ là một lời hứa về khả năng phục vụ, và hai nhà cung cấp đã đưa ra lời hứa đó ở những mức độ công bố thông tin rất khác nhau — một bên vay mượn con số từ người anh em cùng nhà, bên kia công bố cả công thức huấn luyện kèm theo bảng giá. Nếu bạn sắp đưa một khối lượng công việc production lên một làn, thì khoảng cách công bố thông tin chính là rủi ro mà bạn thực sự đang gánh lấy.
Các mức giá, với cả hai phía trên cùng một dòng
Cả hai bậc đều được bán theo bội số của một làn tiêu chuẩn, và các bội số này đủ gần nhau đến mức giá cả không phải là yếu tố phân biệt chúng.
• Làn tiêu chuẩn — GPT-6.1 Sol ở mức $2.00 đầu vào / $10.00 đầu ra mỗi triệu token, so với MiMo-V2.6-Pro ở mức $0.44 / $0.87.
• Làn nhanh — GPT-6.1 Ultrafast ở mức $12.00 / $60.00, so với MiMo-V2.6-Pro-UltraSpeed ở mức $4.35 / $8.70.
• Bội số — chính xác 6x trên mọi dòng đối với gói OpenAI, khoảng 9,9x trên đầu vào và chính xác 10x trên đầu ra đối với gói của Xiaomi.
• Đầu vào được lưu trong bộ nhớ đệm — GPT-6.1 Sol tính $0.10 mỗi triệu trên Standard và $0.60 trên Ultrafast; bảng giá MiMo mà chúng ta có thể đọc không công bố một dòng riêng cho đầu vào được lưu trong bộ nhớ đệm cho cả hai luồng.
• Ngữ cảnh dài — GPT-6.1 Sol định giá lại toàn bộ yêu cầu ở mức 2x cho giá đầu vào và bộ nhớ đệm, và 1.5x cho đầu ra khi vượt quá 272.000 token đầu vào, đưa Ultrafast lên mức $24.00 / $1.20 / $30.00 / $90.00. MiMo-V2.6-Pro sở hữu cửa sổ ngữ cảnh 1M token mà không có ngưỡng tăng giá tương đương nào được công bố.
• Chênh lệch tuyệt đối — hai làn nhanh cách nhau 2,8 lần ở đầu vào và 6,9 lần ở đầu ra, tức là khoảng cách giữa một mô hình đóng tiên tiến và một mô hình trọng số mở xuất hiện bên trong bậc tốc độ thay vì ở mức giá tiêu chuẩn.
Tóm tắt một dòng của khối đó: Xiaomi tính bội số lớn hơn cho một mô hình rẻ hơn nhiều, còn OpenAI tính bội số nhỏ hơn cho một mô hình đắt hơn nhiều. Với token đầu ra, bạn trả $60.00 mỗi triệu cho làn OpenAI và $8.70 cho làn của Xiaomi. Không nhà cung cấp nào đang giảm giá cho tốc độ; cả hai đều định giá nó như một sản phẩm riêng, đây là dấu hiệu đầu tiên cho thấy trong cả hai trường hợp, làn tiêu chuẩn vẫn là mặc định và làn nhanh là một ngoại lệ mà bạn biện minh theo từng khối lượng công việc.
Điều mà mỗi nhà cung cấp sẽ nói với bạn về tốc độ
Đây là điểm mà hai đợt triển khai không còn đối xứng với nhau nữa, và đó chính là điều hữu ích nhất trên trang này.
Con số được OpenAI công bố cho Ultrafast là GPT-6 Astra Ultrafast sinh token nhanh hơn tới 8 lần so với GPT-6 Astra ở chế độ Standard trong Codex. Đó là phép đo của một mô hình khác, trong một client khác, được diễn đạt như một mức trần. Tài liệu đề cập đến Ultrafast cho GPT-6.1 Sol nói rằng hạng này làm giảm thời gian giữa các token đầu ra được sinh ra và trỏ đến một bảng giá; tài liệu hoàn toàn không đưa ra con số nào cho hạng Sol. Vì vậy, con số tiêu đề gắn với đợt triển khai này được vay mượn từ mô hình anh em đã dùng Ultrafast từ ngày 29 tháng 9, và chưa có bên độc lập nào công bố phép đo token/giây cho cả hai. Điều đó hoàn toàn có thể vẫn đúng — cùng ngăn xếp phục vụ, cùng cơ chế — nhưng đó là mức trần do nhà cung cấp đưa ra mà chính OpenAI đã không đo cho mô hình này.
Xiaomi công bố theo một cách khác về bản chất, và sự khác biệt đó không nằm ở chỗ nó chính xác hơn. Tài liệu của chính họ khẳng định UltraSpeed đạt tốc độ đầu ra cao gấp tới 20 lần so với dịch vụ Pro tiêu chuẩn ở cùng mức chất lượng. Còn các danh mục niêm yết của bên thứ ba mô tả đúng mô hình đó trong cùng ngày lại nói khoảng 10 lần. Cả hai con số đều đang được lưu truyền, chúng không phải là cùng một con số, và chưa ai công bố một phép đo nào dung hòa được hai con số ấy. Đọc một cách trung thực: "tối đa 20 lần" là mức trần do nhà cung cấp đưa ra trong những điều kiện mà Xiaomi chưa nêu rõ, "khoảng 10 lần" là mức mà một danh mục sẵn sàng khẳng định là điển hình, còn hệ số nhân thực tế nằm đâu đó trong một khoảng rộng, cho đến khi có ai đó công bố phân bố độ trễ theo từng yêu cầu ở một mức đồng thời được nêu rõ.
Vậy Xiaomi đưa cho bạn hai con số không khớp với nhau, còn OpenAI thì đưa cho bạn một con số thuộc về một mô hình khác. Cả hai đều không phải là dữ kiện mà bạn có thể dựa vào để lập ngân sách, và hệ quả thực tế thì giống nhau ở cả hai trường hợp: hãy tự đo lường hạng đó trên chính các prompt của bạn trước khi bạn cam kết đưa nó vào một lộ trình sản xuất.
Sự bất đối xứng thực sự quan trọng: các chữ số thừa mang lại điều gì
Gạt sang một bên những tuyên bố về tốc độ, hai thứ này gắn với những loại sản phẩm rất khác nhau, và đây là lúc sự lựa chọn không còn là một phép so sánh giá nữa.
MiMo-V2.6-Pro là một thiết kế mixture-of-experts thưa mà Xiaomi đã mô tả công khai: 1,02 nghìn tỷ tham số tổng cộng với 42 tỷ tham số được kích hoạt trên mỗi token, cửa sổ ngữ cảnh 1M token, khả năng đa phương thức gốc trên văn bản, hình ảnh, video và âm thanh, và nhãn giấy phép MIT trên các checkpoint được phát hành. Gói phát hành bao gồm một báo cáo kỹ thuật và ghi chú triển khai, và Xiaomi nói rằng họ đang mở mã nguồn môi trường huấn luyện học tăng cường và mã của nó để quá trình hậu huấn luyện có thể được kiểm tra và tái lập. Quá trình chạy RL cũng được ghi lại — 30 bước và khoảng 750.000 quỹ đạo mỗi mô hình, trong vòng sáu ngày, với chi tiêu công bố tổng hợp khoảng 3.474.715 đô la cho cả các lần chạy Pro và Flash. Trên DeepSWE v1.1, harness của chính Xiaomi với mini-swe-agent ở avg@3, công ty báo cáo MiMo-V2.6-Flash tăng từ 48,8 lên 65,68 và MiMo-V2.6-Pro từ 58,4 lên 72,57 trong lần chạy đó. Đó là những con số do nhà cung cấp báo cáo và chưa được tái lập; sự khác biệt giữa "harness của Xiaomi nói 72,57" và "72,57 là điểm số" chính là sự khác biệt giữa một tuyên bố và một sự thật.
GPT-6.1 Sol không công bố bất kỳ điều nào trong số đó. Không có số lượng tham số, không có ghi chú kiến trúc, không có con số chi phí huấn luyện, không có checkpoint, và không có giấy phép để đọc — chỉ có một model card, một cửa sổ ngữ cảnh, một mốc kiến thức là ngày 30 tháng 4 năm 2026, và một API. Đó là cách sắp đặt thông thường của một phòng thí nghiệm tiên phong và đó không phải là một lời chỉ trích. Nhưng nó có một hệ quả đối với quyết định mua hàng mà các bài đưa tin ra mắt thường bỏ qua: với làn trọng số mở, một tầng nhanh gây thất vọng vẫn có thể khắc phục được. Nếu UltraSpeed hóa ra không đáng với gấp 10 lần lưu lượng truy cập của bạn, cùng một checkpoint đó vẫn có thể tải xuống và bạn có thể tự vận hành nó hoặc thông qua một nhà cung cấp khác, điều này giới hạn thiệt hại tối đa của bạn ở mức chi phí di chuyển. Với làn đóng, một tầng nhanh gây thất vọng là một hóa đơn và một ngân sách giới hạn tốc độ mà bạn phải điều chỉnh giảm trở lại; bạn không thể đi vòng qua nó bằng cách chạy các trọng số, bởi vì không có trọng số nào để chạy.
Một lưu ý về thẻ MIT đó, vì nó thường bị đơn giản hóa trong các bài đưa tin ra mắt. Giấy phép áp dụng cho các checkpoint mà Xiaomi đã công bố. UltraSpeed là một dịch vụ được host, và các dịch vụ được host được điều chỉnh bởi điều khoản dịch vụ chứ không phải bởi giấy phép trọng số. Việc có quyền chạy checkpoint trên phần cứng của bạn và việc có quyền vận hành dịch vụ phục vụ tăng tốc mà người khác cung cấp cho nó là hai quyền khác nhau, và chỉ quyền thứ nhất có trong tệp giấy phép.


Hai cái bẫy đặt tên trước khi bạn sao chép một trong hai định danh
Không tên nào trong tiêu đề của trang này là một checkpoint, và tài liệu của cả hai nhà cung cấp đều khiến lỗi này dễ bị lặp lại.
• GPT-6.1 Ultrafast — không phải là một mô hình. Mã định danh trong yêu cầu vẫn giữ nguyên như của mô hình tiêu chuẩn; hạng được đặt bởi một trường trong yêu cầu, và kết quả là cùng một checkpoint được lập lịch theo cách khác.
• MiMo v2.6 Pro Ultraspeed — cũng không phải là một tập trọng số riêng biệt. Đây là checkpoint MiMo-V2.6-Pro được phục vụ trên một đường dẫn nhanh hơn và được định giá như một mục hàng riêng.
• Điều đó có ý nghĩa gì đối với việc đánh giá hiệu năng — nếu bạn so sánh hai luồng của một trong hai mô hình trên cùng những prompt giống hệt nhau, kết quả mong đợi là những câu trả lời giống nhau ở các tốc độ khác nhau. Nội dung khác biệt trên cùng một đầu vào là một lỗi cần báo cáo, chứ không phải một năng lực mà bạn đã mua.
• Điều đó có nghĩa gì đối với việc kiểm tra giấy phép — với Xiaomi, hãy đọc thẻ mô hình. Với OpenAI, không có gì để đọc, vì các trọng số không được phân phối.
Cũng có một sự bất đối xứng mềm mỏng hơn thể hiện ở cách mỗi hạng được bán. GPT-6.1 Sol hỗ trợ lưu trú dữ liệu tại Hoa Kỳ và EU cùng xử lý toàn cầu, kể cả trong Ultrafast, nên một khối lượng công việc được ghim vào xử lý ở châu Âu có một câu trả lời được ghi nhận. Bảng giá MiMo mà chúng ta có thể đọc hoàn toàn không nêu thông tin lưu trú dữ liệu — Xiaomi đang bán một mô hình và một đường phục vụ, chứ không phải một tư thế tuân thủ. Với một người mua trong ngành được quản lý, chỉ dòng đó có thể quyết định việc so sánh trước khi giá được xem xét.
Nơi mỗi làn thực sự có thể gọi được
Cả hai làn nhanh đều có thể truy cập được thông qua API riêng của nhà cung cấp, và cả hai đều xuất hiện trên các nền tảng của bên thứ ba. Không có cái nào trong số đó nằm trên OrcaRouter, và cần nói thẳng điều đó thay vì để một trang so sánh ngụ ý điều ngược lại.
Thứ có trên OrcaRouter là làn tiêu chuẩn của model OpenAI: openai/gpt-6.1-sol với mức giá niêm yết của chính OpenAI là $2.00 mỗi triệu token đầu vào và $10.00 mỗi triệu token đầu ra, với 0% markup và giá của nhà cung cấp được chuyển thẳng qua, nên việc nhà cung cấp đổi giá sẽ đến phía chúng tôi ngay trong cùng ngày. Ultrafast là một cờ service-tier được tính phí trên chính tài khoản OpenAI của bạn, và không có model Xiaomi nào được host ở đây cả. Điều mà một key mua được là làn tiêu chuẩn cùng với hơn 200 model khác phía sau một endpoint tương thích OpenAI, với chuyển đổi dự phòng tự động giữa các nhà cung cấp — đó là thế hữu ích khi workload bạn đang bảo vệ lại chính là thứ sẽ để ý đến trần rate-limit vào ba giờ sáng.

Làn nào cần kiểm tra, theo thứ tự
Nếu khối lượng công việc của bạn mang tính tương tác và thời gian sinh nằm trên đồng hồ của một con người, cả hai tầng đều đáng để thử và yếu tố quyết định sẽ không phải là giá — mà là ngày hết hạn của lòng tin nơi bạn. Làn open-weight cho phép bạn xác minh rồi rời đi; làn đóng đòi hỏi bạn phải xác minh với nhà cung cấp duy nhất có thể phục vụ nó và ở lại. Sự bất đối xứng đó là có thật, nhưng nó cũng không miễn phí: MiMo-V2.6-Pro-UltraSpeed là một dịch vụ được lưu trữ, nên việc rời đi là một cuộc di trú chứ không phải một thay đổi cấu hình, và checkpoint mà bạn sẽ di trú tới có thể không khớp với các tối ưu phục vụ của tầng đó.
Nếu khối lượng công việc của bạn là theo lô hoặc theo lịch, thì cả hai đều là lựa chọn mua sai, ở mức 6x và ở mức 10x, và cách làm trung thực là chạy nó trên làn tiêu chuẩn rồi dùng phần chênh lệch để đánh giá thay vào đó.
Điều gì có thể thay đổi trang này: một phép đo độc lập về tốc độ đầu ra của một trong hai hạng ở mức đồng thời được nêu rõ, một tuyên bố đã công bố từ Xiaomi về vị trí lưu trú dữ liệu, hoặc một con số giới hạn tần suất từ OpenAI cho hạng Sol mà người mua có thể dựa vào để lập kế hoạch thay vì phải yêu cầu. Cho đến khi những điều đó tồn tại, sự so sánh này chỉ là một bảng giá đối chiếu với một bảng giá, trong khi một trong hai nhà cung cấp đã công bố nhiều hơn đáng kể về đối tượng đang được định giá.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
