Một thẻ hero được tạo tự động có tiêu đề MiniMax M3.1 Flash Preview, với phụ đề 'Đang hoạt động trên Token Plan, 27 tháng 9 năm 2026'. Ba chip hiển thị 'ngữ cảnh 1M token', 'đầu vào văn bản + hình ảnh + video', và 'chỉ dùng Token Plan — không trả theo mức sử dụng'. Thẻ bên trái hiển thị 'Được nhà cung cấp xác nhận: cùng Subscription Key như M3 và M2.7, mặc định bật thinking, effort từ low đến max'; thẻ bên phải hiển thị 'Chưa công bố: giá theo token, model card, benchmark, weights, đo lường độc lập'. Logo OrcaRouter nằm ở góc dưới bên phải.
Guides & Insights

MiniMax M3.1 Flash Preview đã ra mắt trên Token Plan: Gói đăng ký của bạn thực sự mở khóa những gì

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

MiniMax-M3.1-Flash-Preview đã chính thức ra mắt vào ngày 27 tháng 9 năm 2026, và cách nó ra mắt mới chính là câu chuyện đáng bàn. Đây không phải là một mô hình trả tiền theo mức sử dụng. Nhà cung cấp đã đặt mô hình văn bản mới nhất của mình phía sau chính Token Plan Subscription Key vốn đã bao phủ MiniMax-M3, MiniMax M2.7 và biến thể M2.7-highspeed, nên nếu bạn đang giữ một suất thì không có khóa mới nào phải tạo và cũng không có hợp đồng thứ hai nào phải ký. Điều cũng không có, tính đến thời điểm hiện tại, là mức giá theo token, thẻ mô hình (model card), bất kỳ bảng đánh giá nào được công bố, hay bất kỳ cách nào để tắt chế độ suy nghĩ của mô hình.

Sự kết hợp đó — quyền truy cập không ma sát đi kèm với các yếu tố kinh tế hoàn toàn chưa được công bố — đủ bất thường để đáng mổ xẻ trước khi bất kỳ ai đấu nối một pipeline sản xuất vào nó. Phần còn lại của bài viết này là những gì tài liệu của chính nhà cung cấp thực sự nói, những gì nó cố tình không nói, và một dòng mã sẽ cho bạn biết trong vòng một phút liệu mô hình này có phù hợp với cách bạn làm việc hay không.

Điều gì thực sự đã hạ cánh vào ngày 27 tháng 9?

Tài liệu dành cho nhà phát triển của MiniMax giờ đây có một ghi chú thường trực, được lặp lại trên mọi trang về mô hình văn bản: MiniMax-M3.1-Flash-Preview hiện chỉ khả dụng thông qua Token Plan và MiniMax Code. Mô hình này xuất hiện đầu tiên trong bảng mô hình của chính nhà cung cấp, phía trên MiniMax-M3, được mô tả là một mô hình lập trình đa phương thức tiên tiến với cửa sổ ngữ cảnh 1M và độ sâu suy luận có thể điều chỉnh.

• Cửa sổ ngữ cảnh — 1.000.000 token, cùng mức trần mà MiniMax-M3 mang
• Phương thức đầu vào — văn bản, hình ảnh và video, trả về văn bản
• Độ sâu suy luận — một nỗ lực thiết lập chấp nhận thấp, trung bình, cao, xhigh và tối đa, mặc định là tối đa khi bị bỏ qua
• Hỗ trợ giao thức — cùng một model id hoạt động trên endpoint tương thích Anthropic của MiniMax, endpoint tương thích OpenAI của nó và endpoint OpenAI Responses của nó
• Khả dụng — chỉ Token Plan và MiniMax Code; không có trên hình thức trả theo mức sử dụng
• Giá — không có mức giá trên mỗi token nào được công bố ở bất kỳ đâu
• Trọng số — không có; hai kho lưu trữ công khai gần đây nhất của tổ chức MiniMaxAI vẫn là MiniMax-Music3 và MiniMax-H3
• Đánh giá độc lập — không có; mô hình không có mục nào trên chỉ mục mô hình của Artificial Analysis

Công ty đã công bố nó cùng ngày trên tài khoản MiniMaxAgent của mình, định vị nó cho phát triển hàng ngày thay vì công việc tiên phong: nhanh và đáng tin cậy, từ sửa lỗi nhanh đến phát triển tính năng đầy đủ. Đó là mô tả dành cho một dòng Flash, không phải cho một flagship. Các bài đưa tin của bên thứ ba từ PANews và KuCoin cũng mô tả nó bằng những thuật ngữ tương tự và lưu ý rằng các nhà phát triển đã phát hiện ra mô hình này trong trình chọn MiniMax Code trước khi công ty xác nhận.

A headless Chromium screenshot of MiniMax's own model documentation page, showing the standing note that MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now, above the vendor's language-model table in which MiniMax-M3.1-Flash-Preview is listed first with a 1,000,000-token context window and the description 'Frontier multimodal coding model with 1M context window and tunable thinking depth', ahead of MiniMax-M3 with the same 1,000,000-token window, captured 28 September 2026.

Việc bạn dùng phím nào quan trọng hơn bình thường.

Đây chính là chỗ khiến nhiều người sập bẫy. MiniMax vận hành hai loại thông tin xác thực riêng biệt, và M3.1-Flash-Preview chỉ chấp nhận một trong hai. Token Plan Subscription Key đến từ Billing > Token Plan và bao gồm việc sử dụng theo gói thuê bao cùng các Credit đã mua. API Key trả theo mức dùng (pay-as-you-go) áp dụng cho các mô hình tính phí theo token. Tài liệu của nhà cung cấp nói rõ rằng hai loại này không thể thay thế cho nhau, và một Subscription Key có thể tồn tại trước khi bất kỳ tài nguyên trả phí nào được gắn vào nó — trong trường hợp đó, nó là một key hợp lệ nhưng chẳng có gì đằng sau.

Vậy nên bài kiểm tra thực tế không phải là "tôi có khóa API MiniMax không" mà là "tôi có một suất Token Plan không". Các suất hiện có đã được bao gồm. Tài liệu lưu ý rằng Subscription Key trở nên dùng được khi một suất hoặc quyền truy cập Credits được gán, và phần Credits vượt sẽ tự động được rút khi hạn mức thuê bao đã cạn.

Cũng có một điểm không nhất quán trong tài liệu đáng để biết, vì nó sẽ khiến bất kỳ ai đọc trang định giá trước tiên bị nhầm lẫn. Chú thích cuối trang về phạm vi bao phủ của trang định giá Token Plan vẫn liệt kê danh sách đủ điều kiện là M3, M2.7, hình ảnh và giọng nói, với H3 bị loại trừ — nó chưa được cập nhật để nêu tên M3.1-Flash-Preview. Các trang mô hình lại nói ngược lại: rằng M3.1-Flash-Preview khả dụng trên Token Plan và không có gì khác. Cả hai trang đều là các trang nhà cung cấp đang hoạt động tính đến hôm nay. Chỉ có chìa khóa trong tay bạn mới giải quyết được điều đó.

Chiếc 400 cho bạn biết đây là loại mẫu nào.

Mọi mô hình dòng MiniMax M đều suy nghĩ trước khi trả lời, nhưng M3.1-Flash-Preview là mô hình đầu tiên từ chối dừng lại. Gửi thinking: {"type": "disabled"} hoặc reasoning_effort: "none" và API trả về HTTP 400 với thông báo:

mô hình "MiniMax-M3.1-Flash-Preview" yêu cầu chế độ suy luận thích ứng; thinking.type="disabled" (bao gồm reasoning.effort=none) không được phép (2013)

Hướng dẫn của chính nhà cung cấp là giảm nỗ lực thay vì cố tắt suy nghĩ, và thang bậc chính là đòn bẩy độ trễ: một chỉnh sửa thông thường ở low và một thay đổi trên toàn kho ở xhigh đều là cùng một mô hình đưa ra những đánh đổi khác nhau. Hai chi tiết nữa dành riêng cho mô hình này. Tham số reasoning_effort được ghi nhận là chỉ có hiệu lực với MiniMax-M3.1-Flash-Preview — nó không phải là một điều khiển chung của dòng M. Và công tắc đầu ra reasoning_split, thứ tách suy nghĩ vào một trường reasoning_content, hiện không thể được đặt thành false trên mô hình này.

Nơi văn bản suy nghĩ xuất hiện phụ thuộc vào giao thức: endpoint tương thích Anthropic trả về nó dưới dạng một thinking khối nội dung, endpoint tương thích OpenAI trả về nó trên reasoning_content, và endpoint Responses trả về nó dưới dạng một mục đầu ra reasoning. Nếu bạn đang phân tích <think> thẻ từ đầu ra của MiniMax-M3, công việc đó không còn cần thiết trên mô hình mới hơn — và đối với các cuộc hội thoại sử dụng công cụ đan xen, toàn bộ phản hồi bao gồm cả khối thinking phải được thêm lại vào lịch sử tin nhắn nếu không chuỗi lý luận sẽ bị phá vỡ.

Chương trình khuyến mãi đang diễn ra ngay bây giờ

MiniMax Code đang chạy chương trình khuyến mãi điểm danh từ ngày 28 tháng 9 đến ngày 7 tháng 10 theo UTC+8, tăng gấp đôi tín dụng miễn phí được cấp cho đăng nhập hằng ngày và mở rộng cho cả người dùng mới lẫn người dùng hiện hữu. Số tín dụng được báo cáo áp dụng trên các mô hình được hỗ trợ, với M3.1-Flash-Preview và các mô hình video H3 được nêu làm ví dụ. Riêng biệt, công ty cho biết hạn mức Token Plan được đặt lại cho tất cả người dùng khi ra mắt và sẽ có thêm các lần đặt lại được lên kế hoạch trong suốt sự kiện, với điều kiện đủ điều kiện được hiển thị trong ứng dụng.

Hãy coi hai điều đó là những tuyên bố của nhà cung cấp được truyền đạt qua bài đưa tin về buổi ra mắt — chúng là các điều khoản quảng bá có kèm ngày tháng, không phải hành vi của sản phẩm, và cũng chính bài đưa tin đó lưu ý rằng thông báo không nêu rõ số tín dụng cho mỗi lần check-in hay các quy tắc chính xác cho những ngày bị bỏ lỡ. Phần kinh tế ở trạng thái ổn định thì dễ trình bày hơn: Token Plan có giá niêm yết 22 đô la mỗi tháng cho gói Plus, 55 đô la cho Max và 132 đô la cho Ultra, với các cửa sổ hạn ngạch cuốn chiếu 5 giờ và theo tuần, được nhà cung cấp định cỡ tương ứng vào khoảng ba đến bốn, bốn đến năm và sáu đến bảy tác nhân đồng thời. Purchased Credits có tỷ lệ 1.000 tín dụng đổi một đô la và được khấu trừ theo giá niêm yết trả theo mức sử dụng của từng mô hình.

Bốn thứ mà mô hình này vẫn chưa có

Không điều nào dưới đây là lời chỉ trích mô hình; mỗi điều là một lỗ hổng mà một đội ngũ phải tính đến để xoay xở, và cả bốn đều có thể kiểm chứng được ngay hôm nay.

• Không có giá. Không có mức giá trên mỗi token cho M3.1-Flash-Preview trên bất kỳ trang MiniMax nào, vì vậy không thể so sánh với M3 ở mức $0.30 mỗi triệu token đầu vào và $1.20 mỗi triệu token đầu ra, hoặc với bất kỳ thứ gì khác, về chi phí trên mỗi token.
• Không có benchmark. MiniMax không công bố bảng đánh giá nào với bản phát hành này. Cũng không ai khác: mô hình vắng mặt trong chỉ mục của Artificial Analysis, nên cột của nó thực sự trống chứ không chỉ là mới sớm.
• Không có trọng số. MiniMax-M3 được phát hành open-weight; M3.1-Flash-Preview không có kho lưu trữ và không có checkpoint có thể tải xuống.
• Không có đo lường độc lập. Không có số liệu về tốc độ đầu ra, độ trễ hoặc tỷ lệ lỗi từ bất kỳ bên thứ ba nào, và cũng không có từ dữ liệu telemetry định tuyến của chúng tôi, vì mô hình không có trong danh mục của chúng tôi.

So với màn ra mắt M3 vào tháng 6 năm 2026 — vốn đã đến cùng một ghi chú kiến trúc, một bảng điểm chuẩn và một bảng giá ngay từ ngày đầu tiên — đây là một bản phát hành im hơi lặng tiếng có chủ đích. Cách lý giải hợp lý — và đó là một cách lý giải, không phải một kế hoạch được nêu rõ — là MiniMax muốn có mức sử dụng thực tế bên trong sản phẩm của chính mình trước khi quyết định mô hình này có giá bao nhiêu và liệu nó có mở ra hay không.

A generated two-column infographic titled 'What the vendor confirms, and what it has not published', for MiniMax M3.1 Flash Preview. The left column, headlined 'Confirmed on day one', lists 'Listed first in MiniMax's own model table, above MiniMax-M3', '1,000,000-token context window', 'Text, image and video input returning text', 'An effort ladder from low to max, defaulting to max', 'Reachable over Anthropic-, OpenAI- and Responses-compatible endpoints', and 'Covered by the existing Token Plan Subscription Key'. The right column, headlined 'Still unpublished', lists 'Per-token price, anywhere on MiniMax's pages', 'A model card or evaluation table', 'Public weights or a downloadable checkpoint', 'Any entry on Artificial Analysis's model index', and 'Output-speed and latency figures from any third party'. A footer reads 'Per platform.minimax.io documentation and the launch announcement, 27 September 2026.'

Những điểm đúng của bản ghi chú xem trước bị rò rỉ

Bốn ngày trước khi ra mắt, một tài liệu xem trước được sao chép trong một kho lưu trữ đối tác công khai đã lan truyền, mô tả một MiniMax M3.1 với attention thưa, lượng tử hóa attention Q8KV4, các chuyên gia định tuyến NVFP4, một đầu giải mã suy đoán DSpark và một reasoning_effort mới nhận các giá trị từ max xuống đến low. Vào thời điểm đó, chúng tôi đưa tin về nó như là chưa được xác minh, bởi vì đúng là như vậy: không có trọng số, không có thẻ mô hình, không có trang định giá và không có id mô hình API nào tồn tại.

Một trong năm tuyên bố đó giờ đã được chính tài liệu của nhà cung cấp xác nhận, và đó là trường reasoning_effort — bao gồm cả thang bậc từ mức tối đa xuống mức thấp, vốn khớp chính xác với các giá trị được phát hành. Bốn tuyên bố còn lại vẫn chưa được xác nhận. Mô tả công bố của MiniMax về M3.1-Flash-Preview chỉ nói rằng đây là một mô hình lập trình đa phương thức tiên tiến với cửa sổ ngữ cảnh 1M và độ sâu suy luận có thể điều chỉnh; mô tả đó không đề cập đến cơ chế attention, việc lượng tử hóa hay đầu giải mã. Bất kỳ ai lặp lại các tuyên bố về sparse-attention và NVFP4 như thể đó là thông số kỹ thuật đã được chốt thì đang lặp lại bản ghi chép của một bên thứ ba, mà đó chính xác là điều mà bản phát hành không xác nhận.

Nếu bạn muốn dùng thử nó mà không phải đặt cược cả một pipeline vào nó

Điều khó xử của một bản xem trước chỉ có Token-Plan là cách tự nhiên để đánh giá một mô hình mới — gọi nó từ stack hiện có của bạn và đo lường — lại chính là điều duy nhất bạn không thể làm một cách gọn gàng. Không có mức giá theo token để làm cơ sở mô hình hóa, không có hồ sơ độ trễ nào được công bố, và không có phương án dự phòng nào trong chính sản phẩm của nhà cung cấp nếu bản xem trước chập chờn.

Đó chính là tình huống mà một lớp định tuyến được sinh ra để xử lý. Mọi thứ bạn có thể gọi ngày hôm nay đều nằm sau một endpoint tương thích OpenAI và một API key, và những mô hình liền kề với mô hình này đã có sẵn ở đó: MiniMax-M3 với mức giá của nhà cung cấp là 0,30 USD mỗi triệu token đầu vào và 1,20 USD mỗi triệu token đầu ra, MiniMax M2.7 với cùng mức giá niêm yết cùng cửa sổ 200.000 token và trọng số mở, cùng các bậc DeepSeek và Qwen Flash trong cùng dải giá. Giá phía chúng tôi là giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, nên khi một nhà cung cấp cắt giảm giá, mức giá mới sẽ có mặt ở đây ngay trong cùng ngày thay vì phải chờ một chu kỳ đàm phán lại. Chuyển đổi dự phòng tự động nghĩa là một phụ thuộc ở mức bản xem trước có thể nằm bên cạnh một luồng production thay vì nằm dưới nó, và khi MiniMax thực sự công bố bảng giá cùng endpoint cho MiniMax-M3.1-Flash-Preview, câu hỏi sẽ trở thành một mục trong bảng định tuyến thay vì một dự án di trú. Bản thân MiniMax-M3.1-Flash-Preview không có trong danh mục của chúng tôi, và cách để truy cập nó ngày hôm nay là Token Plan của chính nhà cung cấp cùng sản phẩm lập trình của họ.

Bản tóm tắt trung thực cho một nhóm đọc nội dung này trong ngày ra mắt: mô hình đã hoạt động, miễn phí ở phần cận biên nếu bạn đã trả tiền cho một suất Token Plan, và hoàn toàn chưa được định giá cũng như chưa được đo lường theo tiêu chuẩn riêng của nó. Hãy dùng thử nó trong MiniMax Code, giữ pipeline mà bạn phụ thuộc vào trên một mô hình có bảng giá và hồ sơ thành tích, và để ý hai điều sẽ biến nó từ một thứ gây tò mò thành một quyết định — một mức giá được công bố và những điểm số độc lập đầu tiên.

A generated scorecard infographic titled 'The models you can call today, and what they cost'. Six rows read: 'MiniMax M3 — $0.30 in / $1.20 out per 1M tokens, 1,048,576-token context, open weights', 'MiniMax M2.7 — $0.30 in / $1.20 out per 1M tokens, 204,800-token context, open weights', 'DeepSeek V4 Flash — $0.22 in / $0.66 out per 1M tokens, 1,048,576-token context', 'DeepSeek V4.1 Flash — routed on the same key in the same price band', 'MiniMax M3.1 Flash Preview — no per-token rate published; Token Plan and MiniMax Code only', and 'One OrcaRouter API key reaches 200+ models with 0% markup on the provider's list price and automatic failover across providers'. A footer reads 'Catalogue figures per OrcaRouter's public model API, 28 September 2026; MiniMax M3.1 Flash Preview is not on the OrcaRouter catalogue.'