
MiniMax M3.1 Flash Preview so với MiniMax M3: Khi mô hình mới hơn lại là lựa chọn rủi ro hơn
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 468 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 192 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Tài liệu của chính nhà cung cấp hiện liệt kê MiniMax-M3.1-Flash-Preview lên trên MiniMax-M3, và thứ tự đó đang làm không ít việc thuyết phục. Đây là mô hình văn bản mới nhất trong dòng, nó mang cùng cửa sổ ngữ cảnh một triệu token, và bổ sung một điều khiển độ sâu suy nghĩ mà mô hình cũ không có. Điều mà bảng không cho thấy là mô hình cũ là mô hình duy nhất trong hai mô hình mà bạn có thể tải xuống, định giá theo token, đối chuẩn với bất cứ thứ gì, hoặc gọi mà không cần gói đăng ký — và rằng mô hình mới hơn đã lấy đi một nút bật/tắt mà MiniMax-M3 từng mang lại cho bạn.
Đây không phải là câu chuyện về một mô hình bị thay thế. Đây là câu chuyện về việc một nhà cung cấp tách dòng sản phẩm của chính mình thành một cỗ máy cày được tính phí theo mức dùng và một bản xem trước bị chặn sau gói đăng ký, và hai thứ này không thể thay thế cho nhau theo cả hai chiều. Sau đây là bản chất thực sự của từng thứ.
Hai bảng thông số kỹ thuật, cạnh nhau
Hãy bắt đầu với những gì mà chính các trang của nhà cung cấp nêu về cả hai, vì hình thái của sự khác biệt thể hiện ở đây chứ không phải trong một bảng benchmark.
• Đã công bố — MiniMax-M3 vào ngày 1 tháng 6 năm 2026 với một ghi chú kiến trúc, một bảng điểm chuẩn và một bảng giá; MiniMax-M3.1-Flash-Preview vào ngày 27 tháng 9 năm 2026 với một mục tài liệu và một bài đăng trên tài khoản agent của MiniMax • Cửa sổ ngữ cảnh — 1.000.000 token cho cả hai, theo bảng mô hình của chính MiniMax • Đầu ra tối đa — 512.000 token đối với MiniMax-M3 trên mục danh mục của chúng tôi, một con số mà chính MiniMax không công bố; không được công bố cho MiniMax-M3.1-Flash-Preview ở bất kỳ đâu • Phương thức đầu vào — văn bản, hình ảnh và video vào, văn bản ra, cho cả hai • Kiểm soát suy luận — một tham số thinking mà MiniMax-M3 có thể được yêu cầu bỏ qua, và có thể được tách thành trường reasoning_details thông qua reasoning_split; trên MiniMax-M3.1-Flash-Preview, thinking là bắt buộc và reasoning_split không thể bị tắt • Độ sâu suy luận — không khả dụng trên MiniMax-M3; một thang effort gồm low, medium, high, xhigh và max, mặc định là max, trên MiniMax-M3.1-Flash-Preview • Tốc độ đầu ra được công bố — khoảng hơn 100 token mỗi giây đối với MiniMax-M3, theo bảng mô hình của chính MiniMax; không có gì được công bố cho MiniMax-M3.1-Flash-Preview • Trọng số — MiniMax-M3 là mô hình trọng số mở với một kho lưu trữ công khai; MiniMax-M3.1-Flash-Preview không có • Giá — 0,30 USD mỗi triệu token đầu vào và 1,20 USD mỗi triệu token đầu ra đối với MiniMax-M3 theo mức giá của nhà cung cấp; không tồn tại mức giá theo token cho MiniMax-M3.1-Flash-Preview • Truy cập — MiniMax-M3 theo hình thức trả theo mức sử dụng và theo Token Plan, và có thể định tuyến qua các nền tảng bên thứ ba; MiniMax-M3.1-Flash-Preview chỉ có trên Token Plan và MiniMax Code
Hai hàng ở đó thuộc một hạng mục khác với phần còn lại. Tốc độ đầu ra được công bố chỉ là con số của nhà cung cấp dành cho mẫu cũ hơn, nên mẫu mới hơn đang được bán như bản nhanh mà không kèm theo số liệu nào. Và khả năng kiểm soát suy nghĩ đã đi ngược hướng với tiếp thị: mẫu mới hơn mang lại khả năng kiểm soát chi tiết hơn đối với mức độ nó suy nghĩ, đồng thời loại bỏ khả năng khiến nó ngừng suy nghĩ hoàn toàn của bạn.
Công tắc mà MiniMax đã lấy đi
Đây là chi tiết dễ khiến bạn gặp rắc rối nhất, và nó được ghi rõ trong tài liệu chứ không hề bị ẩn đi. Với MiniMax-M3, khi gửi thinking: {"disabled"} trên endpoint tương thích với OpenAI sẽ bỏ qua bước suy nghĩ và trả về câu trả lời trực tiếp; còn trên endpoint tương thích với Anthropic, tính năng suy nghĩ mặc định bị tắt và có thể bật bằng adaptive. Trên MiniMax-M3.1-Flash-Preview, cùng một yêu cầu như vậy lại trả về HTTP 400 kèm thông báo requires adaptive thinking. Không có cách nào được hỗ trợ để nhận được phản hồi không suy luận.
Trên thực tế, điều đó có nghĩa là một khối lượng công việc từng dùng MiniMax-M3 như một bộ phân loại hoặc bộ định tuyến rẻ, nhanh — đầu vào là prompt ngắn, đầu ra là câu trả lời có cấu trúc ngắn, không có chuỗi suy luận — không có lộ trình nâng cấp thay thế trực tiếp lên mô hình mới hơn. Bạn có thể giảm mức nỗ lực xuống thấp, và hướng dẫn của MiniMax nói rõ rằng việc giảm mức nỗ lực là cách dự định để giảm độ trễ suy nghĩ và token thay vì vô hiệu hóa nó. Nhưng token và độ trễ không giảm về không, và đối với một tác vụ trích xuất khối lượng lớn ghi bốn trường mỗi lần gọi, "luôn suy nghĩ trước" là một hình thái chi phí khác với "suy nghĩ khi được yêu cầu".

Mỗi cái thực sự đo lường điều gì
Một bên của sự so sánh này có các con số và bên kia có một cột trống, và đáng để nói chính xác về việc những con số nào là của ai.
Hồ sơ độc lập của MiniMax-M3 là thật: Artificial Analysis xếp nó ở mức 29.2 trên Chỉ số Trí tuệ — thứ 60 trong số 145 — với 58.6 trên Chỉ số Lập trình, 59.18 trên chỉ số Toán học, 92.9% trên GPQA Diamond trong cùng nhóm chỉ số, 83% khả năng nhớ lại ngữ cảnh dài và 82.9% trên IFBench. Đó là những đánh giá của bên thứ ba về một mô hình mà bất kỳ ai cũng có thể tải xuống và chạy lại. Các con số công bố khi ra mắt của chính MiniMax cho M3 — BrowseComp đạt 83.5%, SWE-Bench Pro đạt 59.0%, Terminal-Bench 2.1 đạt 66.0%, MCP Atlas đạt 74.2%, OSWorld-Verified đạt 70% — là số liệu của nhà cung cấp và chúng tôi chưa thấy chúng được tái lập.
MiniMax-M3.1-Flash-Preview không có cả hai. MiniMax không công bố bảng benchmark nào, và mô hình không có mục nào trên chỉ mục của Artificial Analysis, nên không có điểm số độc lập, không có chỉ số lập trình, không có con số nhớ lại ngữ cảnh dài và không có đo lường ảo giác. Mọi mô tả về nó đang lưu hành — "nhanh", "đáng tin cậy", "được xây dựng cho phát triển hằng ngày" — đều là những tính từ của chính nhà cung cấp trong bài đăng ra mắt. Sự thiếu vắng này đáng được nói rõ, bởi vì nó có thể được lý giải theo cả hai hướng: chưa có gì được chứng minh là tệ hơn, và chưa có gì được chứng minh là tốt hơn.
Sự bất đối xứng đó chính là toàn bộ quyết định. Bạn có thể đánh giá MiniMax-M3 ngay chiều nay bằng cách tải nó xuống hoặc gọi nó, và bạn có thể so sánh đánh giá đó với một bảng điểm công khai. Với MiniMax-M3.1-Flash-Preview, bạn chỉ có thể sử dụng nó và tự hình thành một ý kiến riêng.
Nơi mô hình mới hơn thực sự chiếm ưu thế
Thật dễ để đọc phần trên như một lập luận nhằm phớt lờ mô hình mới, và đó cũng không phải là kết luận đúng. Có ba điều là có thật và mang tính đặc thù riêng của nó.
Thang nỗ lực là một năng lực thực sự, không phải một công tắc bật/tắt. Năm mức — thấp đến tối đa — cho phép một mô hình phục vụ cả một thao tác đổi tên thông thường lẫn một cuộc tái cấu trúc toàn kho ở các chi phí tính toán khác nhau, và nó được ghi nhận là chỉ có hiệu quả với riêng MiniMax-M3.1-Flash-Preview. Trên MiniMax-M3, lựa chọn của bạn chỉ là nhị phân. Nếu vấn đề của bạn là không thể dự đoán độ trễ theo từng tác vụ, thì độ sâu có thể điều chỉnh chính là cơ chế kiểm soát mà bạn hằng mong muốn.
Đây là mô hình đầu bảng hiện tại của nhà cung cấp, nghĩa là nó kế thừa mọi thứ mà dòng M-series đã học được kể từ tháng Sáu, và MiniMax nói rõ rằng đây là mô hình mới nhất cho suy luận dạng tác tử, sử dụng công cụ, lập trình và các tác vụ ngữ cảnh dài. Cơ chế sử dụng công cụ với tư duy xen kẽ mà M3 giới thiệu vẫn được kế thừa, bao gồm yêu cầu nối thêm toàn bộ phản hồi — cả các khối suy nghĩ và mọi thứ — trở lại lịch sử tin nhắn.
Và nó nhận video, ở mức giá Flash, trong một gói đăng ký. MiniMax-M3 cũng vậy, với mức giá theo token. Nếu bạn đã trả tiền cho một suất Token Plan và rào cản duy nhất ngăn bạn dùng đầu vào video chỉ là chi phí biên mỗi lần gọi, thì M3.1-Flash-Preview xóa bỏ rào cản đó.
Nơi mẫu cũ hơn vẫn là lựa chọn hàng đầu
Ba trường hợp, tất cả đều nói về khả năng dự đoán chứ không phải chất lượng.
Khi bạn cần mô hình hóa chi phí. MiniMax-M3 có bảng giá: 0,30 đô-la cho mỗi triệu token đầu vào, 1,20 đô-la cho mỗi triệu token đầu ra, và mức giá đọc từ bộ nhớ đệm là 0,06 đô-la mỗi triệu token theo danh mục của chúng tôi. Bạn có thể ước tính hóa đơn hằng tháng của một khối lượng công việc đến từng xu trước khi chạy nó. MiniMax-M3.1-Flash-Preview không có mức giá theo token ở bất kỳ đâu trên các trang của MiniMax, nên chi phí của nó là khoản đăng ký của bạn chia cho mức độ bạn sử dụng nó — ổn cho một ngân sách cố định, vô dụng cho kinh tế đơn vị.
Khi bạn cần mô hình thực sự là chính nó. MiniMax-M3 là open-weight: bạn có thể tải nó về, chạy nó trên phần cứng của riêng mình, và biết chắc rằng bản mô hình trả lời các lệnh gọi của bạn sau sáu tháng nữa vẫn chính là bản đang trả lời hôm nay. MiniMax-M3.1-Flash-Preview không có checkpoint, và quyền truy cập ở mức preview đồng nghĩa với việc ngăn xếp phục vụ, cấu phần hạn mức và tính khả dụng đều do nhà cung cấp kiểm soát và được nêu rõ là có thể thay đổi.
Khi bạn cần một câu trả lời không suy luận. Như trên — đây là sự thoái bộ năng lực duy nhất trong so sánh, và đó là điều khiến mọi người ngạc nhiên, bởi vì một mô hình mới hơn không thể làm được điều mà mô hình cũ hơn có thể làm không phải là trường hợp mà ai đó lên kế hoạch đối phó.

Gọi cả hai từ cùng một nơi
Điều khó xử ở đây là hai mô hình được mua theo hai cách khác nhau — một bên tính phí theo mức sử dụng, một bên theo thuê bao — và bản năng tự nhiên là chọn một phe. Nước đi hữu ích hơn là định tuyến giữa chúng theo dạng tác vụ, điều này chỉ khả thi nếu bên tính phí theo mức sử dụng có thể được truy cập từ cùng một nơi như mọi thứ khác.
MiniMax-M3 trên OrcaRouter mang giá niêm yết của MiniMax với 0% markup được cộng thêm, vì vậy $0.30 và $1.20 trên bảng giá chính là chi phí cho một lần gọi, không có biên lợi nhuận nền tảng cộng thêm. Nó nằm trên cùng endpoint tương thích OpenAI như MiniMax M2.7 — cùng mức niêm yết $0.30/$1.20 cho cửa sổ 200.000 token, cũng là open-weight — và như hơn 200 mô hình khác, đằng sau một API key, với chuyển đổi dự phòng tự động giữa các nhà cung cấp khi một endpoint gặp trục trặc. Đối chiếu với dữ liệu đo lường từ xa của chính chúng tôi, một loại số liệu khác với số liệu của nhà cung cấp: trong bảy ngày qua, M3 đã trả lời ở mức khoảng 238 token đầu ra mỗi giây với p50 khoảng 4,1 giây đến token đầu tiên, với tỷ lệ lỗi gần 0,15%, được đo trên playground OrcaRouter. Nếu bạn muốn giữ MiniMax-M3 làm nửa đáng tin cậy của một pipeline và coi MiniMax-M3.1-Flash-Preview là nửa thử nghiệm, thì nửa đáng tin cậy chỉ là một dòng cấu hình thay vì một mối quan hệ nhà cung cấp thứ hai. Bản thân MiniMax-M3.1-Flash-Preview không có trong danh mục của chúng tôi; đường đến nó là Token Plan và sản phẩm lập trình của chính nhà cung cấp.
Điều có thể thay đổi bài viết này thì cụ thể và dễ theo dõi. Một bảng giá được công bố cho MiniMax-M3.1-Flash-Preview sẽ phá tan lý do chính để ưu tiên M3 về mặt kinh tế. Một bộ điểm số độc lập sẽ thay thế cột trống bằng một thứ có thể so sánh được. Một checkpoint có thể tải xuống sẽ loại bỏ phản đối về tính tái lập. Cho đến khi ít nhất một trong những điều đó xuất hiện, MiniMax-M3 vẫn là mô hình trong cặp này mà bạn có thể bắt phải chịu trách nhiệm — và mô hình mới hơn vẫn là bản xem trước nhanh hơn, được kiểm soát tốt hơn, chưa được đo lường mà MiniMax đã quyết định tính phí theo tháng thay vì theo token.

