Một thẻ hero được tạo có tiêu đề MiniMax M3.1, với huy hiệu ghi 'CHƯA XÁC MINH - CHƯA PHÁT HÀNH' và phụ đề 'Một checkpoint riêng tư 250 GB, một ghi chú kiến trúc bị rò rỉ, và một nhà cung cấp chưa nói gì'. Ba chip ghi 'Checkpoint: MiniMax-M3.1-preview-private', '62 tệp / 48 safetensors / 250 GB' và 'Cửa sổ theo dõi: tuần từ 28 tháng 9 năm 2026'. Thẻ bên trái ghi 'Tuyên bố: sparse attention, Q8KV4 attention, NVFP4 experts, DSpark spec-decode và một trường reasoning_effort mới'; thẻ bên phải ghi 'Chưa xác nhận ra mắt: không có trọng số, không có model card, không có trang định giá, không có API model id'. Logo OrcaRouter nằm ở góc dưới bên phải.
Guides & Insights

MiniMax M3.1: Những tài liệu xem trước bị rò rỉ nói gì — và điều chưa ai xác nhận

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Có một checkpoint 250 GB trên Hugging Face tên là MiniMax-M3.1-preview-private mà không ai ngoài một số ít đối tác inference có thể mở được. Có một tài liệu ghi ngày 22 tháng 9 đọc y hệt ghi chú kiến trúc của nhà cung cấp, lại đang lưu hành trong một kho kỹ thuật đối tác công khai thay vì trên chính trang web của nhà cung cấp. Và vào ngày 26 tháng 9, một người theo dõi mô hình được nhiều người biết đến đã đăng rằng MiniMax M3.1 là "mô hình sắp ra mắt tiếp theo trong tuần tới" và rằng họ đang thử nghiệm bản xem trước của nó. Ghép ba điều đó lại, bạn có toàn bộ hồ sơ công khai về MiniMax M3.1 — một mô hình mà tên, các thay đổi kiến trúc, số lượng trọng số và tuần ra mắt đều đang được bàn tán, mà nhà cung cấp chưa hề nói một lời nào về chúng trước công chúng. Phiên bản tiền nhiệm mà nó kế thừa, MiniMax M3, lại là câu chuyện khác: bản đó đã phát hành, và đó là lý do bất kỳ ai quan tâm đến bản này.

Đây là hình hài của một mô hình chưa phát hành khi nhìn từ bên ngoài, và cần phải chính xác về hình dạng của bằng chứng, bởi vì ba nhánh không mạnh như nhau. Sự tồn tại của checkpoint đã được chứng thực: nhiều nguồn độc lập cùng chỉ về một tên kho riêng tư và cùng một số lượng tệp. Tài liệu kiến trúc thì không được chứng thực theo cách đó — nó là bản chép lại của một bên thứ ba, và nó có thể là thật, đã cũ, hoặc được bịa ra một phần. Tuyên bố "tuần tới" là kỳ vọng của một người, không phải một lịch trình. Mọi thứ trong bài viết này đều được dán nhãn theo đúng độ mạnh mà nó thực có, và không có gì ở đây nên được đọc như một thông báo phát hành.

Điều khiến MiniMax M3.1 đáng được viết một bài trước khi nó tồn tại chính là phiên bản tiền nhiệm. Theo hầu hết các đánh giá, MiniMax M3 là mô hình open-weight mạnh nhất mà MiniMax từng phát hành — một mô hình 1M token, văn bản-hình ảnh-video, đạt 29,2 trên Artificial Analysis Intelligence Index và vẫn là một trong số ít mô hình mở có thể giữ được một ngữ cảnh dài thực sự liền mạch. Nếu M3.1 ra mắt vào tuần cuối tháng 9, những con số quan trọng với nhà phát triển không phải là tính khả tín của bản rò rỉ mà là những gì đã thay đổi trong các lớp và chi phí để phục vụ nó — và về cả hai điểm đó, tài liệu bị rò rỉ đặc biệt cụ thể.

Điều gì đã được xác nhận, và điều gì chỉ đang được lan truyền

Sự phân chia trung thực, tính đến ngày 27 tháng 9 năm 2026:

• Đã xác nhận: không tồn tại phiên bản công khai nào của MiniMax M3.1. Tổ chức MiniMaxAI trên Hugging Face trả về 401 — phản hồi "không tìm thấy hoặc không hiển thị với bạn" của nền tảng — đối với MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview và MiniMaxAI/MiniMax-M3.1-preview-private như nhau. Các tải lên công khai mới nhất của tổ chức này vẫn là MiniMax-Music3 (7 tháng 8 năm 2026) và MiniMax-H3 (28 tháng 7 năm 2026).

• Đã xác nhận: MiniMax M3.1 không thể định tuyến ở bất kỳ nơi nào chúng tôi có thể kiểm tra. Nó không có trong danh mục mô hình OrcaRouter và trong các danh sách công khai mà chúng tôi theo dõi; mô hình MiniMax mà bạn thực sự có thể gọi ngày hôm nay là MiniMax M3, tại minimax/minimax-m3.

• Đã xác nhận: MiniMax chưa công bố bất cứ thứ gì. Không có thẻ mô hình, không có bài đăng blog, không có trang định giá, không có trọng số, không có ID mô hình API. Không có tin tức báo chí về một buổi ra mắt vì chưa hề có buổi ra mắt nào.

• Đang lưu hành: tài liệu kiến trúc. Tài liệu này được sao chép nguyên văn trong một kho lưu trữ công khai — longsco/innoferra-eval, một bộ công cụ onboarding đối tác dành cho các endpoint mô hình được host, được tạo ngày 23 tháng 9 năm 2026 — dưới tên tệp PREVIEW-20260922.md, với phần tiêu đề mô tả nó là tài liệu của nhà cung cấp được chia sẻ vào ngày 25 tháng 9 và kèm lưu ý rằng "tên mô hình, ngày phát hành của nhà cung cấp và thời điểm ra mắt công khai vẫn phụ thuộc vào bản phát hành thực tế." Đó là lời rào đón của chính tài liệu, không phải của chúng tôi, và đó là lời rào đón đúng: bản sao của một bên thứ ba về một ghi chú nhà cung cấp không phải là tuyên bố của MiniMax.

• Đang lưu hành: checkpoint 250 GB và bản phát hành thứ hai của nó. Đặc tả onboarding của repository ghi lại một checkpoint đa phương thức riêng tư tại MiniMaxAI/MiniMax-M3.1-preview-private — 62 tệp, 48 tệp safetensors, khoảng 250 GB, chuỗi kiến trúc MiniMaxM3SparseForConditionalGeneration — và sau đó là bản phát hành thứ hai lớn hơn, MiniMax-M3.1-preview2-dspark-private, với 101 tệp và khoảng 236 GB, bổ sung một bản nháp speculative fp8 2,3 GB. Cả hai đều là riêng tư. Chúng tôi không thể mở cái nào, và bạn cũng không thể.

• Đang lan truyền: dòng thời gian. Bài đăng ngày 26 tháng 9 là mốc thời gian công khai duy nhất mà bất kỳ ai đưa ra, còn "tuần tới" chỉ là một kỳ vọng. Hãy coi tuần của ngày 28 tháng 9 là khoảng thời gian cần theo dõi, chứ không phải một ngày cụ thể.

Tài liệu duy nhất chứa đựng chi tiết kỹ thuật

A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'

Mọi thông tin cụ thể được biết về thiết kế của MiniMax M3.1 đều bắt nguồn từ một tệp markdown đó, cùng với hai tệp đồng hành trong cùng kho lưu trữ: một tài liệu demo SGLang mô tả cách checkpoint được dự kiến phục vụ, và một spec.yaml mà một endpoint đối tác được cho là phải đáp ứng. Đọc toàn bộ kho lưu trữ, nó trông giống như một nhà cung cấp suy luận đang làm đúng những gì một nhà cung cấp suy luận làm — nhận một bản phát hành sớm từ MiniMax, ghi lại những gì đã thay đổi, và xây dựng một bộ kiểm thử xác thực cho nó. Kho lưu trữ không phải là một bộ tài liệu báo chí và nó không được viết để thuyết phục bất kỳ ai.

Đó là một điểm có lợi cho nó, và cũng là giới hạn của những gì nó chứng minh. Không có gì trong đó được MiniMax ký tên. Ba tài liệu nhất quán với nhau theo cách các tài liệu thật nhất quán — cùng các hằng số lượng tử hóa, cùng tên biến môi trường, cùng cờ khởi chạy — và bất đồng theo cách các đợt phát hành thật bất đồng: bản xem trước ngày 22 tháng 9 nói rằng phương pháp giải mã suy đoán mới không có head độ tin cậy, còn đợt phát hành checkpoint thứ hai đã phát hành một cấu hình nháp với enable_confidence_head được đặt thành true. Một thứ ngụy tạo thường sẽ không bao gồm một mạch đính chính. Nhưng "mạch lạc bất thường" không phải là "đã được xác nhận", và kiểu thất bại ở người đọc là tiếp nhận các hằng số bên dưới như là thiết kế đã công bố của MiniMax, trong khi chúng cùng lắm chỉ là thiết kế riêng của MiniMax như được một người khác đọc hiểu.

Năm thay đổi kỹ thuật, theo tài liệu đó

Dưới đây là phần chênh lệch giữa MiniMax M3 và MiniMax M3.1 như tài liệu mô tả. Mọi dòng đều do nhà cung cấp đưa ra và chưa được kiểm toán — chưa có bên độc lập nào đo lường bất kỳ đầu ra nào của MiniMax M3.1.

• Phạm vi attention. Attention đầy đủ trong ba lớp đầu tiên được thay thế bằng attention thưa, do đó tất cả các lớp đều thưa. Trên MiniMax M3, ba lớp đầu tiên là điểm neo attention đầy đủ của chồng thưa.

• Độ chính xác attention — "Q8KV4". Các truy vấn, bao gồm cả truy vấn của indexer, đi ra từ projection ở dạng BF16 và được ép sang FP8 E4M3. Khóa và giá trị — một lần nữa bao gồm cả của indexer — được lượng tử hóa thành E2M1, bốn bit, theo từng khối 16, với scale E4M3 cho mỗi khối là amax/6 được kẹp vào [1/512, 448]. Tài liệu nhấn mạnh rằng thang là round-half-to-even với các ngưỡng bất đối xứng, rằng scale tensor ngoài cùng chính xác là 1, và rằng độ lớn bằng không phải mã hóa thành zero dương. M3 đã dùng một đường KV tám bit cùng họ, nên điều này lại giảm một nửa số byte KV.

• Độ chính xác của expert. Các expert được định tuyến của MoE chuyển từ MXFP8 sang W4A4 NVFP4, với expert chia sẻ được cố ý loại trừ. Hai phép chiếu expert nhận các cơ chế kích hoạt khác nhau: FC1 sử dụng thang đo động theo từng hàng bằng 2688 chia cho giá trị tuyệt đối lớn nhất của hàng, với thang đo hàng được áp dụng sau GEMM nhưng trước hàm kích hoạt; FC2 sử dụng thang đo ngoài cố định là 16. Hệ quả thực tế, được nêu rõ trong README của đối tác, rất thẳng thừng: "một nhà cung cấp chạy checkpoint qua một đường NVFP4 chung mà không có những thứ này sẽ tạo ra các kết quả số khác biệt một cách âm thầm."

• Giải mã suy đoán. Đầu dự đoán đa token kiểu EAGLE không còn nữa, được thay bằng một phương pháp mà MiniMax gọi là DSpark — một đầu Markov thuần, và trong tài liệu ngày 22 tháng 9, không có đầu độ tin cậy. Đây là thay đổi có tác động lớn nhất đến cảm nhận về một endpoint được phục vụ, vì nó là đòn bẩy tốc độ theo từng luồng duy nhất trong thiết kế. Engine demo mà MiniMax phát hành kèm checkpoint không bao gồm DSpark, và nhà cung cấp đã đo mức chênh lệch: trên cùng khung 80.000 token không có suy đoán, thông lượng theo luồng là 63,9 token mỗi giây ở mức đồng thời 1 và giảm xuống dưới 60 khi lên mức đồng thời 4, do đó kết luận của chính tài liệu là nếu không có DSpark, ngăn xếp không thể duy trì mục tiêu độ trễ của mình dưới tải.

• Một trường yêu cầu mới. MiniMax M3.1 bổ sung trường reasoning_effort ở cấp cao nhất, nhận các giá trị max, xhigh, high, medium hoặc low, được chat template chèn vào system prompt như một thẻ effort. M3 chỉ có một công tắc thinking với hai chế độ adaptive và disabled. Tài liệu ghi nhận một cách kỳ lạ và cụ thể rằng trường này được truyền đi mà không có kiểm tra hợp lệ và không có giá trị mặc định bắt buộc — điều mà nhà cung cấp hiểu là cho phép hoặc chấp nhận hoặc từ chối một giá trị không nằm trong danh sách, và điều đó có nghĩa là hai endpoint đều tuân thủ có thể hành xử khác nhau với cùng một yêu cầu.

A generated single-column infographic titled 'MiniMax M3.1 — the scoreboard', listing six vendor-document deltas: 'Attention: all layers sparse', 'KV precision: Q8KV4, E2M1 blocks of 16', 'Routed experts: W4A4 NVFP4', 'Spec-decode: DSpark, no confidence head', 'Reasoning control: reasoning_effort max to low', and 'Benchmarks: none published'. A footer reads 'MiniMax M3.1 terms per a 2026-09-22 vendor preview document cited in partner engineering notes; unaudited, no independent scores exist.' The OrcaRouter logo sits bottom-right.

Hai chi tiết trong checkpoint đáng được nêu riêng vì chúng thuộc kiểu điều mà một bài đăng ra mắt thường bỏ qua. Thứ nhất, checkpoint đi kèm cả cấu hình bộ tiền xử lý ảnh lẫn cấu hình bộ tiền xử lý video — MiniMax M3.1 là một mô hình đa phương thức ngay từ thiết kế, không phải một mô hình văn bản được gắn thêm thị giác về sau, và hướng dẫn của chính nhà cung cấp là không từ chối đầu vào hình ảnh trên ngăn xếp mới. Thứ hai, lần phát hành checkpoint thứ hai đã loại bỏ hoàn toàn các khóa MTP và NEXTN và không thêm bất cứ thứ gì thay thế chúng, đó là lý do bản nháp DSpark phải đến dưới dạng một tạo tác 2.3 GB riêng. Không có draft head nào trong trọng số chính để bật.

Vì sao không có các con số benchmark M3.1, và vì sao đó không phải là một sự sơ suất

Mọi bài viết rò rỉ rồi cũng đến đoạn mà nó hoặc là bịa ra một bảng benchmark, hoặc thừa nhận mình chẳng có bảng nào. MiniMax M3.1 thì không có. Đặc tả dành cho đối tác nói rõ điều đó, trong một trường chỉ tồn tại để ngăn ai đó mắc sai lầm này:

• "Chưa có mốc cơ sở nào cho 3.1 được công bố; không tái sử dụng các số liệu M3 làm ngưỡng chấp nhận."

Chỉ dẫn đó là câu hữu ích nhất trong toàn bộ kho ngữ liệu, bởi vì phiên bản lười biếng của bài viết này ghi điểm Artificial Analysis của MiniMax M3 dưới một tiêu đề MiniMax M3.1. Không nên làm thế. Cùng kho lưu trữ đó chạy các phép thử AIME-25 và GPQA-Diamond đối với endpoint M3.1 của chính MiniMax và ghi lại chúng dưới dạng so sánh đồng đội với nhà cung cấp, với điểm số chưa ngã ngũ: trên GPQA-Diamond, 0,904 cho lượt chạy của nhóm so với 0,813 của nhà cung cấp, và trên một tập con MMLU-Pro gồm 600 câu hỏi, 0,898 so với 0,821. Đó là hai lượt chạy của cùng một phép đánh giá đang mâu thuẫn với nhau, chứ không phải một kết quả mô hình, và chúng được dán nhãn là bản xem trước với các lần lặp lại được tính. Bất kỳ ai hôm nay trích dẫn một con số benchmark duy nhất của MiniMax M3.1 đều đang trích dẫn một thứ chưa tồn tại.

MiniMax M3 là gì, để có thể ước lượng quy mô của phần tiếp theo

MiniMax M3 ra mắt vào cuối tháng 5 năm 2026 và được đưa lên Hugging Face vào ngày 2 tháng 6 — tổng cộng 428 tỷ tham số với 23 tỷ tham số hoạt động, 60 lớp, 128 chuyên gia định tuyến với định tuyến top-4, 4 đầu KV so với 64 đầu attention, và cửa sổ ngữ cảnh 1.048.576 token với đầu ra tối đa 512.000. Về phía độc lập, Artificial Analysis cho nó 29,2 điểm trên Intelligence Index, xếp thứ 60 trong số 145 mô hình được lấy mẫu, với 58,6 trên chỉ số lập trình và p50 là 3.348 mili giây để có token đầu tiên trong dữ liệu đo từ xa định tuyến của chính chúng tôi. Con số tiêu đề của chính MiniMax dành cho nó là 83,5 trên BrowseComp, đây là số liệu của nhà cung cấp và chưa được kiểm toán như vậy.

Giá cả là phần giữ được độ mới lâu nhất trong một chu kỳ rò rỉ. MiniMax M3 có giá 0,30 USD cho mỗi triệu token đầu vào và 1,20 USD cho mỗi triệu token đầu ra, với lượt đọc từ bộ nhớ đệm ở mức 0,06 USD — và nó đã có mặt trên OrcaRouter với tên minimax/minimax-m3, ở mức giá niêm yết của nhà cung cấp với mức tăng giá 0%, vì vậy nếu MiniMax định giá M3.1 theo cùng cách, mức giá mới sẽ có hiệu lực ngay bên phía chúng tôi vào đúng ngày nó tồn tại, thay vì muộn hơn một chu kỳ thanh toán.

Việc nhắc lại tất cả những điều đó không phải vì hoài niệm. Mà là vì lý do duy nhất khiến người ta cứ tải lại trang tổ chức Hugging Face trong tuần này là MiniMax M3 đã đủ tốt đến mức phiên bản kế nhiệm của nó trở thành một câu hỏi sản xuất thực tế chứ không còn là trò để ngồi xem — và rằng một mô hình 428 tỷ tham số với ngữ cảnh 1M ở mức $0.30/$1.20 đặt ra một chuẩn mực về giá-hiệu năng mà M3.1 phải vượt qua, chứ không chỉ là một chuẩn mực về năng lực.

Góc độ niêm yết ẩn danh, và lý do tại sao nó có thể đã được trả lời

Một mạch nội dung từ hồi đầu tháng 9 đáng được khép lại ở đây. Một mục niêm yết ẩn danh kiểu tàng hình đã xuất hiện trên một nền tảng lập trình của bên thứ ba với ngữ cảnh 1.000.000 token, mức giá $0 và các cấp độ suy luận bắt buộc, và chúng tôi đã đưa tin về nó dưới tên Space Bunny Alpha, đồng thời lưu ý tỷ lệ cơ sở rằng mọi mục niêm yết ẩn danh kiểu này rốt cuộc đều được một nhà cung cấp nhận là của mình — Pony Alpha trở thành một mô hình Zhipu, Hunter Alpha trở thành của Xiaomi, Ox Alpha trở thành một bản phát hành MiniMax với tên khác. Bộ tokenizer và các dấu vân tay dị thường trong mục niêm yết đó đều chỉ về một checkpoint xem trước của MiniMax. Nếu MiniMax M3.1 thực sự ra mắt trong tuần này, cách lý giải khả dĩ nhất là mục niêm yết ẩn danh đó chính là cuộc thử nghiệm thực địa của nó, và bí ẩn sẽ được giải quyết bằng một thông báo thay vì bằng thêm công việc điều tra kỹ thuật. Đó là suy luận, không phải bằng chứng, và đây là suy luận cuối cùng trong bài này.

A headless Chromium screenshot of OrcaRouter's own model page for minimax/minimax-m3, showing the breadcrumb 'Models - MiniMax: MiniMax M3', a summary describing a 428B-parameter MoE with 23B active parameters and a 1M-token context window powered by MiniMax Sparse Attention, a PERFORMANCE panel reading Avg Latency 3.2 s, Throughput 210.9 tok/s, Uptime 100.00%, Total Tokens 89.8M and Error Rate 0.13%, a MiniMax provider card reading 92.07M tokens routed in 7 days, P50 TTFT 4.26s and P95 TTFT 10.00s, and the listing rows 1,048,576 Context window, $0.30/M input and $1.20/M output.

Những điều cần chú ý và những việc cần làm trong tuần này

Những tín hiệu có thể biến điều này từ một vụ rò rỉ thành một đợt ra mắt chính thức thì cụ thể và có thể kiểm chứng, và chúng không phải là những tín hiệu mà hầu hết các bài bình luận theo dõi. Một kho Hugging Face công khai thuộc tổ chức MiniMaxAI — không phải kho riêng tư — có thẻ mô hình là chỉ báo đơn lẻ mạnh nhất; lịch sử tải lên của tổ chức này là công khai và ghi ngày mọi bản phát hành đến từng ngày. Một trang mô hình MiniMax hoặc ID mô hình API là tín hiệu thứ hai. Giá được công bố là tín hiệu thứ ba, và là tín hiệu quan trọng đối với ngân sách. Một bảng benchmark trên Artificial Analysis được ghi ngày sau khi phát hành là tín hiệu thứ tư, và là tín hiệu duy nhất độc lập.

Cho đến lúc đó, lập trường thực tế dành cho bất kỳ ai đang xây dựng vẫn không khác gì so với bất kỳ tuần trước phát hành nào khác: mô hình bạn có thể định tuyến ngay hôm nay là MiniMax M3, một API key là đủ để truy cập nó cùng với hơn 200 mô hình khác, tự động chuyển đổi dự phòng nghĩa là một trục trặc nhỏ ở endpoint sẽ không trở thành sự cố ngừng dịch vụ của bạn, và một tuyến được ghim cố định hoặc pha trộn thông qua routing DSL, hay một nhóm mô hình cùng trả lời thông qua model fusion, chính là cách bạn giảm thiểu rủi ro cho một mô hình mà bạn chưa đưa vào vận hành thực tế. Nếu M3.1 xuất hiện, đó chỉ là việc thay một model ID, chứ không phải một cuộc di trú — và đó chính là toàn bộ lý lẽ cho việc không xây dựng một tích hợp riêng cho một bản rò rỉ.

Một điều mà bài viết này sẽ không làm là giả vờ biết được thời điểm. Điểm kiểm soát là có thật, các tài liệu thì cụ thể, và tuyên bố công khai mới nhất là việc một người nói "tuần sau". Trong ba điều đó, chỉ hai điều đầu là những thứ bạn có thể tự mình kiểm chứng.