Thẻ hero cho bài giải thích về MiniMax M3, hiển thị một thẻ ghi 428B tổng tham số với 23B được kích hoạt, một dải ngữ cảnh rộng ghi ngữ cảnh 1M token, cùng các huy hiệu ghi đa phương thức gốc và trọng số mở, với phần chân trang ghi MiniMax M3 - công bố ngày 1 tháng 6 năm 2026 - MiniMax.
Guides & Insights

MiniMax M3 là gì? Mẫu flagship đa phương thức với ngữ cảnh 1M của MiniMax

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

MiniMax M3 là một mô hình ngôn ngữ trọng số mở, đa phương thức gốc từ phòng thí nghiệm Trung Quốc đứng sau các mô hình văn bản dòng M, các mô hình video Hailuo và dòng Music. Phòng thí nghiệm đã công bố nó vào ngày 1 tháng 6 năm 2026 và nó đã soán ngôi MiniMax M2.7 để chiếm vị trí đầu trong danh sách mô hình của chính công ty, mang đến cửa sổ ngữ cảnh một triệu token, đầu vào văn bản-hình ảnh-video gốc và kiến trúc attention thưa mà phòng thí nghiệm gọi là MSA.

Mười bốn bài viết trong kho lưu trữ của blog này có nhắc đến MiniMax M3. Cho đến nay, chưa một bài nào trong số đó thực sự nói về nó. Mô hình này xuất hiện với vai trò đối thủ trong hết so sánh này đến so sánh khác — điểm tham chiếu trọng số mở mà một Gemini, Qwen, Grok hay GPT mới hơn được đem ra đo lường — và chưa từng có trang nào ở đây để độc giả có thể ghé vào và tìm hiểu MiniMax M3 thực chất là gì. Đây chính là trang đó.

Bảng thông số kỹ thuật

MiniMax M3 là một mô hình hỗn hợp chuyên gia với khoảng 428 tỷ tham số tổng cộng và khoảng 23 tỷ tham số được kích hoạt cho mỗi token, theo thẻ mô hình mà MiniMax công bố cùng với các trọng số. Đây là mô hình đa phương thức gốc thay vì chỉ xử lý văn bản rồi gắn thêm khả năng thị giác: thẻ mô hình mô tả việc huấn luyện trên các phương thức xen kẽ ngay từ bước đầu tiên, và mô hình nhận đầu vào là văn bản, hình ảnh và video rồi trả về văn bản.

• Cửa sổ ngữ cảnh: 1.048.576 token, với mục danh mục của chính chúng tôi ghi rõ mức tối thiểu được đảm bảo là 512.000 token ngữ cảnh khả dụng
• Đầu ra tối đa: 512.000 token trên trang danh mục của chúng tôi; MiniMax không công bố con số đầu ra tối đa trong tài liệu của chính họ, nên hãy coi 512K là con số của chúng tôi, không phải của nhà cung cấp
• Phương thức: đầu vào văn bản, hình ảnh và video; đầu ra văn bản
• Tham số: tổng ~428B, ~23B hoạt động trên mỗi token
• Điều khiển suy luận: một tham số thinking với các chế độ bật, thích ứng và tắt
• Lấy mẫu được đề xuất: temperature 1.0, top_p 0.95
• Kiến trúc: MiniMax Sparse Attention (MSA), chủ đề của bài báo arXiv 2606.13392
• Dạng endpoint: chat completions tương thích OpenAI

Tuyên bố kiến trúc đáng chú ý nhất là về chi phí attention ở ngữ cảnh dài. MiniMax nói MSA mang lại tốc độ prefilling nhanh gấp hơn 9 lần và giải mã nhanh gấp hơn 15 lần so với M2 ở cửa sổ một triệu token, cắt giảm tính toán trên mỗi token xuống còn khoảng một phần hai mươi so với thế hệ trước. Đó là những con số do nhà cung cấp đưa ra và chúng tôi chưa thấy chúng được tái lập độc lập.

MiniMax M3 nằm ở đâu trong dòng sản phẩm của chính MiniMax

Đây là mẫu đứng đầu dòng ngôn ngữ, nhưng cần phải chính xác về những gì dòng đó bao gồm, vì MiniMax duy trì danh sách dài hơn các mô hình vẫn được niêm yết so với hầu hết các phòng thí nghiệm. Tài liệu mô hình của chính nhà cung cấp chia chúng thành hai.

• Các mô hình hiện tại: MiniMax M3, MiniMax M2.7, MiniMax M2.7-highspeed
• Các mô hình cũ, vẫn được liệt kê: MiniMax M2.5, MiniMax M2.5-highspeed, MiniMax M2.1, MiniMax M2.1-highspeed, MiniMax M2
• MiniMax M2, mô hình cũ nhất trong số đó, có ngữ cảnh 200.000 token và đầu ra tối đa 128.000 token bao gồm cả chuỗi suy luận
• MiniMax không công bố giới hạn ngữ cảnh hoặc đầu ra cho M2.7 hay M2.1 trong cùng một tài liệu

Khoảng cách thế hệ là có thật nhưng không quá lớn trên chỉ số duy nhất mà cả hai mô hình cùng xuất hiện. Artificial Analysis cho điểm MiniMax M3 là 29 trên bản sửa đổi v4.3.2 của Intelligence Index, và MiniMax M2.7 là 23 trên cùng bản sửa đổi đó — 29 đặt M3 ở hạng 16 trong số 114 mô hình trong bảng của bản sửa đổi đó, và 23 đặt M2.7 ở hạng 36. M2.7 được phát hành vào tháng 3 năm 2026. Bước nhảy này là một bước tiến, không phải một thế hệ, và thật đáng để đọc hai con số đó từ cùng một bản sửa đổi: chỉ số này đã được hiệu chỉnh lại vào ngày 7 tháng 9 năm 2026, và điểm số trước ngày đó không thể so sánh với điểm số sau ngày đó.

Chi phí là bao nhiêu

MiniMax định giá M3 theo kích thước yêu cầu trên bảng giá trả theo mức sử dụng của mình, và mức giá được công bố đi kèm ưu đãi giảm giá vĩnh viễn 50% so với giá niêm yết cao hơn.

• Tối đa 512K token đầu vào: $0.30 mỗi triệu token đầu vào, $1.20 mỗi triệu token đầu ra, $0.06 mỗi triệu lượt đọc bộ nhớ đệm — so với mức niêm yết là $0.60 / $2.40 / $0.12
• Trên 512K token đầu vào: $0.60 mỗi triệu token đầu vào, $2.40 mỗi triệu token đầu ra, $0.12 mỗi triệu lượt đọc bộ nhớ đệm — so với mức niêm yết là $1.20 / $4.80 / $0.24
• Cấp dịch vụ ưu tiên: gấp 1,5 lần mức tiêu chuẩn, tức là $0.45 / $1.80 / $0.09 ở cấp yêu cầu nhỏ, được chọn bằng cách đặt service_tier thành "priority"
• Không được công bố: MiniMax không liệt kê giá ghi bộ nhớ đệm cho M3, chỉ có giá đọc bộ nhớ đệm

OrcaRouter cung cấp MiniMax M3 với mức giá tương tự — 0,30 USD đầu vào, 1,20 USD đầu ra — không có phụ phí cộng thêm trên mức giá của nhà cung cấp. Đây là một mô hình nổi bật trong danh mục của chúng tôi, và lưu lượng không hề nhỏ: 153,7 triệu token được định tuyến trong bảy ngày qua tại thời điểm viết bài, với thời gian đến token đầu tiên p50 là 4,26 giây và p95 là 10,00 giây.

Screenshot of MiniMax's own M3 announcement page, showing the article title MiniMax M3, a dateline reading 2026-06-01 and the vendor's three headline claims: native multimodality, context scaling via sparse attention, and frontier coding and cowork capability.

MiniMax M3 giỏi ở những điểm nào có thể đo lường được

Bắt đầu với những con số mà MiniMax tự báo cáo, tất cả đều do nhà cung cấp tự công bố và chưa có con số nào mà chúng tôi thấy được bên thứ ba tái lập lại.

• SWE-Bench Pro: 59.0%
• Terminal-Bench 2.1: 66.0%
• SWE-fficiency: 34.8%
• MCP Atlas: 74.2%
• BrowseComp: 83.5, con số mà nhà cung cấp dùng để dẫn đầu về tìm kiếm agentic
• Video-MME: 84.6 ở 512 khung hình, trong khi API bên ngoài giới hạn tối đa 640 khung hình
• KernelBench Hard: 28.8%
• OSWorld-Verified: 68.70% ở tối đa 100 bước, tăng lên 70.06% ở 200 bước

Bức tranh độc lập cũng đồng tình về hướng đi. Artificial Analysis xếp MiniMax M3 ở Chỉ số Trí tuệ 29 trên bản sửa đổi v4.3.2, đứng thứ 16 trong số 114 mô hình, với chi phí 0,51 USD để chạy chỉ số cho mỗi mô hình — xếp thứ 21 trong số 114 theo thước đo chi phí đó. Tốc độ đầu ra là 106,4 token mỗi giây so với mức trung vị 67,1, và thời gian đến token đầu tiên là 1,25 giây so với mức trung vị 2,33 giây. Cả hai chỉ số này đều tốt hơn mức thông thường của phân khúc, và mức giá thì thấp hơn hẳn.

Việc bên thứ ba tái xuất bản cùng một nhóm chỉ số sẽ bổ sung các điểm thành phần: SWE-bench Verified ở mức 80,5%, tau-squared-bench ở mức 88,9%, AA-GPQA Diamond ở mức 92,9%, AA-LCR ở mức 83,0%, AA-IFBench ở mức 82,9%, OmniDocBench 1.5 ở mức 91,6%, và USAMO 2026 ở mức 85,7%. Hiểu tài liệu và tuân theo chỉ dẫn có vẻ là những điểm mạnh thực sự, và điểm suy luận ngữ cảnh dài khớp với câu chuyện kiến trúc.

Scoreboard graphic comparing independently measured MiniMax M3 figures, showing an Intelligence Index of 29 at rank 16 of 114, output speed of 106.4 tokens per second, a time to first token of 1.25 seconds, and a blended price of 0.22 US dollars per million tokens.

Nó kém cỏi một cách có thể đo lường được ở những điểm nào

Những điểm yếu thật sự tập trung ở hai chỗ, và cả hai đều lộ rõ trong những con số đã được công bố.

• Khoảng cách agentic là vấn đề lớn nhất: trên cùng một bên thứ ba đăng lại, MiniMax M3 đạt 58.6 trên AA Coding Index nhưng chỉ đạt 30.8 trên AA Agentic Index. Nó viết mã tốt hơn nhiều so với việc tự chủ thực hiện một tác vụ dài gồm nhiều bước.
• Kiến thức và ảo giác: Chỉ số AA-Omniscience là 1.4, độ chính xác 16.7%, và tỷ lệ ảo giác 18.4%. Đây là một mô hình sẽ trả lời đầy tự tin về những điều nó không biết.
• OSWorld 2.0: 4.6%
• CritPt: 3.7%, điểm số được công bố yếu nhất mà chúng tôi tìm thấy cho M3 ở bất kỳ đâu
• ResearchClawBench: 19.8%
• Độ dài dòng: 120 triệu token đầu ra để hoàn thành Intelligence Index, xếp hạng 11 trong số 114 — đây là một mô hình nói nhiều, và với những prompt nặng về suy luận, điều đó thể hiện rõ trên hóa đơn
• Mức sàn tổng hợp: một bên tổng hợp thứ ba xếp nó ở mức 55.28 trên 100, hạng 60 trong số 505, dù chỉ dựa trên phạm vi bao phủ một phần là 50 trên 481 benchmark, nên chỉ số tổng hợp đó là mức sàn chứ không phải là phán quyết cuối cùng

Một số thứ đơn giản là không được đo lường, và chúng tôi thà nói rõ điều đó còn hơn là lấp vào khoảng trống. Không ai ngoài MiniMax tái tạo bảng benchmark của nhà cung cấp ở trên. Artificial Analysis không công bố một con số Coding Index hay Agentic Index cho M3 theo cách riêng của mình — cặp 58.6 và 30.8 đến từ một bên thứ ba đăng lại cùng họ chỉ số. Artificial Analysis nêu AA-Omniscience như một thành phần trong chỉ số của mình nhưng không công bố điểm Omniscience dạng số nào cho M3. MiniMax không công bố con số đầu ra tối đa, nên 512K trên trang model của chính chúng tôi là của chúng tôi. Và hoàn toàn không có giá ghi cache trên bảng giá của nhà cung cấp.

Ai nên chọn MiniMax M3, và ai nên chọn thứ khác

Hãy chọn MiniMax M3 khi công việc đồng thời đòi hỏi ngữ cảnh dài và đa phương thức. Một triệu token với đầu vào video, trọng số mở mà bạn có thể tự tải về và chạy, cùng mức giá đầu vào $0.30 mỗi triệu token là một tổ hợp mà không có gì khác trong lĩnh vực trọng số mở sánh được một cách trọn vẹn. Phân tích tài liệu dài, hiểu video, đọc mã ở quy mô kho lưu trữ và các pipeline trích xuất tài liệu là những nơi tập trung các điểm mạnh đã được đo lường — 91.6% trên OmniDocBench và 83.0% trên AA-LCR là những con số ủng hộ lựa chọn này.

Hãy chọn thứ khác trong ba trường hợp. Nếu bạn không cần cửa sổ ngữ cảnh hoặc đầu vào thị giác, MiniMax M2.7 có cùng mức giá $0.30/$1.20, đạt 23 điểm so với 29 của M3 trên bản sửa đổi chỉ số hiện tại, và là một thứ nhỏ hơn để vận hành — lợi thế của M3 không miễn phí, nó chỉ được định giá ở cùng mức niêm yết. Nếu khối lượng công việc của bạn là các tác nhân tự chủ thay vì lập trình, khoảng cách về năng lực tác nhân chính là lý do để tìm nơi khác, và bảng so sánh của chính MiniMax cũng chỉ về cùng một chỗ: trên PostTrainBench, nhà cung cấp báo cáo 0.37 cho M3 so với 0.42 cho Opus 4.7 và 0.39 cho GPT-5.5, benchmark công bố duy nhất của họ mà M3 thua cả hai. Và nếu bạn cần một giấy phép không kèm điều kiện ràng buộc, hãy đọc đoạn tiếp theo trước khi cam kết.

Giấy phép chính là điểm mấu chốt mà nhiều bài viết bỏ qua. MiniMax M3 được phát hành theo MiniMax Community License, không phải Apache hay MIT. Sử dụng phi thương mại thì miễn phí. Sử dụng thương mại được cho phép, nhưng bạn phải hiển thị nổi bật dòng "Built with MiniMax M3". Dưới 20 triệu USD doanh thu hằng năm, bạn chỉ cần gửi một thông báo một lần; trên mức đó, bạn cần sự cho phép trước bằng văn bản từ MiniMax, được yêu cầu qua email với tiêu đề "M3 licensing - authorization request". Giấy phép còn có một phụ lục liệt kê các mục đích sử dụng bị cấm. Nếu bạn đang phát hành một sản phẩm, đó là việc rà soát pháp lý, chứ không phải một thủ tục hình thức.

Tóm tắt thực tiễn

MiniMax M3 hiện là mẫu chủ lực trong dòng ngôn ngữ của MiniMax: một mô hình hỗn hợp chuyên gia (MoE) khoảng 428B tham số, với khoảng 23B tham số hoạt động trên mỗi token, ngữ cảnh một triệu token, hỗ trợ đầu vào video và hình ảnh gốc, cùng cơ chế attention thưa mà nhà cung cấp cho là giúp giảm 20 lần tính toán trên mỗi token ở ngữ cảnh đầy đủ. Nó được công bố vào ngày 1 tháng 6 năm 2026, nên đây là một mô hình đã định hình, không phải mô hình mới — câu hỏi đáng quan tâm vào tháng 9 năm 2026 không phải là liệu nó có tốt hay không, mà là nó tốt cho nửa nào trong khối lượng công việc của bạn.

Câu trả lời được đo lường là nó mạnh về mã nguồn và tài liệu, bình thường về kiến thức, và yếu về công việc tác nhân tự trị. Nó rẻ so với những gì nó làm được, và đây là mô hình trọng số mở hiếm hoi mà tuyên bố về ngữ cảnh dài vẫn đứng vững trước một đánh giá độc lập. Giấy phép là phần mà hầu hết các nhóm sẽ cần tự thương lượng với chính mình.

MiniMax M3 chạy trên OrcaRouter với mức giá của nhà cung cấp, không thêm phí, thông qua cùng endpoint tương thích OpenAI như mọi thứ khác ở đây: một khóa API truy cập được hơn 200 mô hình, với tính năng chuyển đổi dự phòng tự động nếu một endpoint gặp sự cố và một DSL định tuyến khi bạn muốn ghim hoặc kết hợp. Nếu bạn muốn so sánh nó với phần còn lại của danh mục trước khi quyết định, trang mô hình có bảng giá trực tiếp, phân vị thời gian đến token đầu tiên và lưu lượng truy cập.

Screenshot of the OrcaRouter model page for MiniMax M3, showing a featured badge, the model ID minimax/minimax-m3, a context length of 1,048,576 tokens, input and output prices of 0.30 and 1.20 US dollars per million tokens with 50 percent off badges, the MiniMax provider card showing 153.7 million tokens routed in seven days with a p50 time to first token of 4.26 seconds and a p95 of 10.00 seconds, and the model parameters listed as approximately 428 billion total with 23 billion active.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày