
Dots vs MiniMax M3: Thuê nhân công hay tải trình đọc
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 349 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 210 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Mô hình rẻ nhất trong lô này cũng chính là mô hình bạn được phép giữ lại, và chính sự kết hợp đó tạo nên toàn bộ phép so sánh. MiniMax M3, công bố ngày 31 tháng 5 năm 2026, được mô tả là mô hình nền tảng trọng số mở hàng đầu của MiniMax: đầu vào văn bản, hình ảnh và video, đầu ra văn bản, cửa sổ ngữ cảnh 1.048.576 token, đầu ra tối đa 512.000 token trong một phản hồi, và giá niêm yết là 0,30 USD cho mỗi triệu token đầu vào và 1,20 USD cho mỗi triệu token đầu ra, với lượt đọc từ bộ đệm ở mức 0,06 USD — chỉ bằng khoảng một phần mười ba mức mà các mô hình tiên phong thu cho cùng số token đó. Dots là agent luôn bật của công ty, được công bố tại DevDay ngày 29 tháng 9 năm 2026: nó có máy tính đám mây và trình duyệt riêng, hoạt động trên hơn 4.000 ứng dụng được kết nối, chạy trên GPT-6 Astra, và được bao gồm trong gói Pro và Business Premium mà không có con số hạn mức nào được công bố ở bất kỳ đâu. Một cái là thành phần bạn có thể nắm giữ. Cái còn lại là dịch vụ bạn chỉ có thể đăng ký.
Giá không phải là con số thú vị.
Ba mươi xu một triệu token đầu vào là điểm nhấn chính, nhưng những con số thú vị là hai con số định hình thứ bạn có thể yêu cầu. Con số đầu tiên là 512.000 token đầu ra tối đa — gấp sáu lần lượng mà GPT-5.6 Sol sẽ tạo ra trong một phản hồi, và là mức trần đầu ra lớn nhất so với mọi mô hình trong nhóm so sánh này. Con số thứ hai là 83 về khả năng truy hồi ngữ cảnh dài, đủ cao để cửa sổ ngữ cảnh trở thành một bề mặt làm việc dùng được, chứ không chỉ là một con số trên bảng thông số kỹ thuật.
Kết hợp những điều đó lại, một loại tác vụ cụ thể trở nên rẻ: tạo ra thứ dài từ nguồn dài. Một tài liệu hướng dẫn kỹ thuật dài 400 trang được viết lại cho một đối tượng độc giả khác. Một hướng dẫn chuyển đổi được tạo ra từ toàn bộ một kho mã. Một bản tóm tắt nghiên cứu mà bản thân nó dài bằng một báo cáo. Ở mức $0.30 và $1.20 mỗi triệu token, một công việc mà trên một mô hình tiên phong sẽ là một mục chi phí bốn chữ số thì ở đây chỉ là một sai số làm tròn — và việc trần đầu ra được đo bằng hàng trăm nghìn token thay vì hàng chục nghìn chính là điều biến nó thành một yêu cầu thay vì hai mươi yêu cầu.
Có một điều cần lưu ý đáng nói về việc đo lường. Bảng độ trễ trong danh mục của chúng tôi báo cáo thời gian trung vị để có token đầu tiên là 10,00 giây đối với M3 trong cùng cửa sổ bảy ngày cho thấy 18,35 triệu token lưu lượng, và con số đó nằm chính xác ở đỉnh của phạm vi hiển thị của bảng. Hãy đọc nó như một hiện tượng gây ra bởi cửa sổ thời gian chứ không phải là sự mô tả đặc điểm của mô hình. Con số lưu lượng mới là thứ cho bạn biết người ta đang thực sự sử dụng nó.

Video là nguồn đầu vào mà không ai lường trước
Thị giác giờ đã là điều kiện tối thiểu, nên dạng thức vẫn còn tạo ra khác biệt chính là video. M3 tiếp nhận nó một cách native, song song với văn bản và hình ảnh, và điều đó thay đổi cấu trúc của một pipeline chứ không chỉ đơn thuần thêm một khả năng vào danh sách. Một kho lưu trữ hỗ trợ gồm các bản ghi màn hình, một tập clip camera hành trình, một học kỳ các bản ghi bài giảng — trước đây đây là một bài toán tiền xử lý, nơi bạn lấy mẫu khung hình bằng công cụ này và mô tả chúng bằng công cụ khác. Một mô hình đọc video trực tiếp sẽ gộp hai giai đoạn thành một lần gọi.
Nó cũng khiến việc tính toán chi phí trở nên khó đoán hơn, bởi video vốn tốn kém để xem/xử lý theo cách mà văn bản không hề như vậy, và con số lớn nhất trên hóa đơn thường là phần đầu vào mà không ai đã dự trù. Mức giá rẻ trên mỗi token chính là thứ khiến việc thử nghiệm trở nên an toàn: với $0.30 cho mỗi triệu token đầu vào, một lần nạp năm giờ thỉnh thoảng vẫn đủ rẻ để được đưa vào thử nghiệm thay vì phải tranh cãi trong một cuộc họp lập kế hoạch.
Điều mà các trọng số mở thực sự thay đổi
MiniMax mô tả M3 là một mô hình trọng số mở, nghĩa là các trọng số được công bố thay vì chỉ được cung cấp qua dịch vụ, và đó là một kiểu bảo đảm khác với một gói đăng ký. Nếu MiniMax ngừng cung cấp dịch vụ vào ngày mai, hoặc thay đổi giá, hoặc ngừng hỗ trợ định danh đó, mô hình sẽ không biến mất — nó vẫn sẽ chạy trên phần cứng bạn đã mua, ở bất kỳ mức lượng tử hóa nào phù hợp. Điều đó không làm cho việc tự lưu trữ trở nên rẻ hơn trong trường hợp tổng quát; tự phục vụ một mixture-of-experts thưa lớn là một dự án kỹ thuật thực sự. Nó làm cho sự phụ thuộc trở nên có thể tồn tại được, đó là một khẳng định khác và là khẳng định thực sự quan trọng khi bạn đang quyết định xây dựng dựa trên điều gì.
Một dấu chấm đưa ra sự bảo đảm ngược lại. OpenAI nắm giữ máy tính, trình duyệt, các trình kết nối và hạn mức, và biện pháp khắc phục của bạn nếu bất kỳ phần nào trong đó thay đổi là ngừng sử dụng nó. Đó là một thỏa thuận công bằng — thuê là cách mà hầu hết các đội nên bắt đầu — nhưng nó không phải là cùng một thỏa thuận, và sự khác biệt chỉ trở nên rõ ràng vào ngày nó thực sự quan trọng.

Sáu điểm khác biệt có thể thay đổi một quyết định
• Bảo đảm — một dịch vụ có thể thay đổi điều khoản, đối lại là trọng số mà bạn có thể giữ lại (MiniMax M3 được mô tả là open-weight; một dấu chấm thì không thể tải xuống theo bất kỳ nghĩa nào)
• Chi phí trên mỗi đơn vị công việc — chưa được công bố đối với một dấu chấm, so với $0,30 và $1,20 mỗi triệu token với các lượt đọc từ bộ nhớ đệm ở mức $0,06, mức thấp nhất trong nhóm so sánh này
• Mức trần cho một yêu cầu đơn — không có tài liệu cho một dấu chấm, so với 1.048.576 token đầu vào và 512.000 token đầu ra
• Các phương thức đầu vào — tin nhắn và dữ liệu từ ứng dụng được kết nối dành cho dot, so với văn bản, hình ảnh và video dành cho mô hình
• Các phương thức không áp dụng — các thay đổi bên trong phần mềm khác, đối chiếu với văn bản và chỉ văn bản
• Vị thế độc lập — không có benchmark nào dành cho một dấu chấm; M3 có Chỉ số Trí tuệ Artificial Analysis là 29.2, xếp thứ 60 trong số 145 mô hình được đo, tức ở tầm trung và đáng để biết trước khi bạn cho rằng mức giá rẻ mua được năng lực suy luận tiên phong. Không phải vậy.
Nơi mỗi mục xứng đáng có một dòng trên hóa đơn
Đánh giá thẳng thắn về hồ sơ đã công bố của M3 là nó là một mô hình khối lượng lớn, không phải mô hình tiên phong: 92,9 trên GPQA Diamond là mức cạnh tranh, 59 trên SWE Bench Pro là khá ổn, và Chỉ số Thông minh ở tầm trung mới là dấu hiệu đáng chú ý. Thứ nó thắng là chi phí trên mỗi đơn vị công việc, trần đầu ra, video và khả năng triển khai, theo đúng thứ tự đó. Đó là một mô hình tốt để đặt bên dưới lớp đắt đỏ của một pipeline — các bước tóm tắt, trích xuất, chuyển ngữ, tạo văn bản dài và phân nhánh nhiều lần thử — và là một mô hình tồi để đặt lên trên cùng của pipeline đó.
OrcaRouter cung cấp nó dưới dạng minimax/minimax-m3 ở mức giá niêm yết của nhà cung cấp MiniMax với 0% phụ trội, trong cùng danh mục với hơn 200 mô hình đằng sau một khóa duy nhất, với tính năng chuyển đổi dự phòng tự động giữa các nhà cung cấp thượng nguồn và một DSL định tuyến để gửi một yêu cầu riêng lẻ đến mô hình nên xử lý nó. Cách sắp đặt đó chính là điều khiến việc tách hai lớp trở nên thực tiễn thay vì chỉ mang tính lý thuyết: cùng một khóa với tới được một mô hình rẻ để xử lý khối lượng lớn cũng với tới được một mô hình tiên tiến cho những cuộc gọi cần phải chính xác, và không có gì đến bên trong một dot vì các dot hoàn toàn không nằm trong danh mục — không endpoint, không định danh, không trí tuệ thay thế.
Làm gì vào thứ Hai
Nếu bạn có một tập hợp âm thanh hoặc video và không có cách nào rẻ để xem xét nó, hãy bắt đầu từ đó: M3 là mô hình duy nhất trong bộ này đọc video nguyên bản ở mức giá này, và thí nghiệm tốn gần như không đáng kể. Nếu bạn có một loại công việc liên tục bị bỏ dở vì không ai theo đuổi nó, dot là sản phẩm được tạo hình cho việc đó, và mô hình tính phí theo mức sử dụng sẽ không giả vờ là nó.
Hai thứ đó chỉ xung đột nếu bạn cho rằng một phải thắng. Dịch vụ thuê bao thì đuổi theo; trình đọc đã tải về thì đọc. Hãy sở hữu cái thứ hai, thuê cái thứ nhất, và giữ ranh giới giữa chúng đủ rõ ràng để bạn có thể thay thế một trong hai mà không phải viết lại cái kia.

