
MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash: Hai tấm vé rẻ với ngữ cảnh 1M, một dấu hoa thị khổng lồ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 468 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 192 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Nếu bạn đang tìm mua một cửa sổ ngữ cảnh một triệu token với giá thấp trên mỗi token, MiniMax-M3.1-Flash-Preview và DeepSeek V4 Flash là hai cái tên liên tục được nhắc đến — và chúng thực sự không phải là cùng một loại sản phẩm. DeepSeek V4 Flash là một mô hình đã ngừng hoạt động nhưng định danh của nó vẫn phản hồi, nằm trong bảng giá của nhà cung cấp mà bạn có thể đọc chính xác đến từng xu. MiniMax-M3.1-Flash-Preview là một bản xem trước đang hoạt động nhưng không có mức giá nào được công bố. Do đó, so sánh dưới đây phần nào là so sánh thông số kỹ thuật và phần nào là minh chứng cho thấy hai nhà cung cấp này đang chọn cách bán cùng một phân khúc khác nhau đến mức nào.
Cả hai mặt của vấn đề đều đáng được nêu chính xác, bởi vì những con số quyết định điều đó nằm rải rác trên một trang định giá của nhà cung cấp, một cây tài liệu của nhà cung cấp và danh mục của chính chúng tôi, và một trong những khẳng định được lặp lại thường xuyên nhất về DeepSeek V4 Flash — giá của nó — là khẳng định mà DeepSeek đã thay thế kể từ đó.
Điểm mà hai bảng thông số kỹ thuật thực sự khớp với nhau
Các thông số chính đủ tương đương nhau đến mức chúng không phải là yếu tố quyết định, ngoại trừ một điểm mà không ai quảng cáo.
• Cửa sổ ngữ cảnh — 1.000.000 token cho MiniMax-M3.1-Flash-Preview so với 1.048.576 cho DeepSeek V4 Flash: về danh nghĩa là giống hệt nhau, chênh lệch 48.576 token
• Đầu ra tối đa — không được công bố cho MiniMax-M3.1-Flash-Preview; 384.000 token cho DeepSeek V4 Flash, điều này là bất thường ở mức giá này và là con số nên quyết định phần lớn việc mua sắm
• Phương thức đầu vào — văn bản, hình ảnh và video cho MiniMax-M3.1-Flash-Preview; chỉ văn bản cho DeepSeek V4 Flash
• Kiểm soát suy nghĩ — một mức nỗ lực theo thang từ thấp đến tối đa, suy nghĩ luôn bật, dành cho MiniMax-M3.1-Flash-Preview; suy nghĩ hoặc không suy nghĩ trên DeepSeek V4 Flash, với chế độ không suy nghĩ là một lựa chọn thực sự
• Hỗ trợ giao thức — các endpoint tương thích Anthropic, tương thích OpenAI và OpenAI Responses cho MiniMax-M3.1-Flash-Preview; ba mục tương tự cùng với hoàn thành tiền tố chat trên DeepSeek V4 Flash
• Trọng số — không có cho MiniMax-M3.1-Flash-Preview; trọng số của DeepSeek V4 Flash đã được công bố, dù bản thân mô hình đã bị thay thế
• Giá — chưa được công bố cho MiniMax-M3.1-Flash-Preview; đã được công bố và thấp cho DeepSeek V4 Flash
Hãy đọc danh sách đó hai lần, vì mức trần đầu ra mới là điều âm thầm đáng lưu tâm. Một triệu token ngữ cảnh với 384.000 token đầu ra là một cửa sổ sinh một lượt thực sự dài. Một triệu token ngữ cảnh với mức trần đầu ra không được tiết lộ là một lời hứa về việc đọc, không phải về việc viết. Nếu khối lượng công việc của bạn là "đọc một kho mã, đưa ra một kế hoạch di chuyển", thì con số thứ hai chính là con số quyết định liệu tác vụ có vừa trong một lần gọi hay không.
Mỗi thứ được đo ở đâu
Đây là phần kém thoải mái nhất trong bài so sánh, và nó ngắn thôi.
DeepSeek V4 Flash có kết quả benchmark, và kết quả đó độc lập. Artificial Analysis cho nó 34,3 điểm trên Intelligence Index — đứng thứ 42 trong số 145 mô hình trên chỉ số đó — với 69,1 trên Coding Index và 90,8% trên GPQA Diamond. Con số 95,0 trên τ²-Bench mà mục danh mục của chính chúng tôi đưa lên đầu chính là con số mà tài liệu ra mắt của DeepSeek cũng đưa ra, nên nó là một con số của nhà cung cấp nằm cạnh các số liệu độc lập chứ không phải một con số đã được kiểm toán. Khả năng truy hồi ngữ cảnh dài của nó đạt 79,7% và con số terminal-bench của nó là 78,7% trên harness v2.1. Đó là những phép đo thực, có thể so sánh được của một mô hình đã được biết đến.
MiniMax-M3.1-Flash-Preview thì không có. MiniMax không công bố bảng đánh giá nào cùng với bản phát hành, và cũng không có bên thứ ba nào có bảng như vậy — mô hình này hoàn toàn không xuất hiện trên chỉ mục của Artificial Analysis. Đó không phải là lỗ hổng trong nghiên cứu của chúng tôi; đó là tình trạng hiện tại của hồ sơ công khai, và điều đó có nghĩa là mọi tuyên bố về chất lượng đối với mô hình mới hơn, ở thời điểm này, chỉ là những tính từ do nhà cung cấp tự đưa ra. Bất kỳ ai hôm nay đưa cho bạn kết quả benchmark của MiniMax-M3.1-Flash-Preview thì hoặc là đang trích dẫn MiniMax-M3 cũ hơn, hoặc là đang bịa ra.

DeepSeek V4 Flash không được bán ở mức giá mà bạn nhớ.
Đây là cái bẫy. Con số được trích dẫn rộng rãi cho DeepSeek V4 Flash — 0,14 USD cho mỗi triệu token đầu vào và 0,28 USD cho mỗi triệu token đầu ra — là bảng giá mà mô hình mang theo trước ngày 10 tháng 9 năm 2026. Vào ngày đó, DeepSeek phát hành DeepSeek-V4.1-Flash, khai tử cả V4 Flash và thử nghiệm V4-Flash-Vision-Exp, đồng thời giảm giá. Định danh deepseek-v4-flash vẫn hoạt động, nhưng tài liệu của DeepSeek nêu rằng nó tạm thời được định tuyến đến V4.1 Flash và được tính phí theo giá Flash. Nói cách khác, bạn vẫn có thể nhập tên mô hình cũ; bạn không gọi mô hình cũ.
Vậy bảng giá thực sự để so sánh chính là bảng hiện tại, tính trên mỗi 1M token — và ngoài giờ cao điểm chính là nửa rẻ hơn của nó:
• Đầu vào cache-miss — $0.15 giờ thấp điểm, $0.30 giờ cao điểm
• Đầu vào cache-hit — $0.003 giờ thấp điểm, $0.006 giờ cao điểm
• Đầu ra — $0.60 giờ thấp điểm, $1.20 giờ cao điểm
• Khung giờ cao điểm — 01:00–04:00 và 06:00–10:00 UTC, từ thứ Hai đến thứ Sáu, không bao gồm các ngày lễ công cộng của Trung Quốc; mọi thời điểm khác, kể cả toàn bộ cuối tuần, đều là giờ thấp điểm
Ngược lại, MiniMax-M3.1-Flash-Preview không có bất kỳ mức giá trên mỗi token nào. Chi phí của nó là bất cứ thứ gì ghế Token Plan của bạn tốn — 22 đô la, 55 đô la hoặc 132 đô la mỗi tháng cho Plus, Max và Ultra — bị tiêu hao dần qua một bể hạn ngạch dùng chung theo giá niêm yết trả theo mức sử dụng của từng mô hình, trong khi nhà cung cấp bảo lưu quyền thay đổi thành phần của bể đó. Đối với một ngân sách hàng tháng cố định với khối lượng có thể dự đoán được, đó có thể là giá trị tuyệt vời. Đối với một dự án cần quy chi phí theo từng lần gọi, nó là sự mờ đục được khoác áo thuê bao.
Lý do điều này quan trọng hơn mức thông thường ở phía DeepSeek là hệ số nhân giờ cao điểm. Một nhóm ở châu Âu hoặc châu Á đang trong ngày làm việc của mình sẽ nằm trong khung giờ cao điểm trong một phần đáng kể ngày làm việc và phải trả gấp đôi cho đặc quyền đó, điều này biến mức giá đầu vào được quảng cáo là $0.15 thành $0.30 đúng vào những giờ mà hầu hết sản phẩm đang bận rộn. Hãy lập ngân sách dựa trên cột cao điểm trừ khi lưu lượng truy cập của bạn thực sự chạy vào ban đêm.
Khi nào thì việc chọn MiniMax M3.1 Flash Preview là sai lầm
Ba trường hợp, và hai trường hợp đầu rất dễ bị bỏ sót vì chúng được ghi nhận thay vì bị trừ đi.
Giới hạn đầu ra là không xác định. Nếu tác vụ của bạn kết thúc bằng một lần tạo dài — một đặc tả đầy đủ, một bản viết lại bản ghi, một báo cáo có chú thích — thì bạn đang chọn một ngân sách đầu ra mà mình không thể thấy. DeepSeek V4 Flash công bố 384.000. Sự bất đối xứng đó có lợi cho mô hình cũ hơn đối với bất cứ thứ gì viết nhiều.
Không thể tắt tính năng suy nghĩ. Gửi thinking: {"type": "disabled"} đến MiniMax-M3.1-Flash-Preview và bạn sẽ nhận được HTTP 400: mô hình yêu cầu suy nghĩ thích ứng. Trên DeepSeek V4 Flash, chế độ không suy nghĩ tồn tại và là một công tắc được hỗ trợ. Đối với phân loại thông lượng cao, định tuyến hoặc trích xuất có cấu trúc ngắn, một mô hình luôn lý luận trước đang phải trả bằng độ trễ và token mà bạn không yêu cầu — và đòn bẩy duy nhất bạn có là giảm nỗ lực xuống thấp, chứ không phải loại bỏ việc suy luận.
Nó không thể gọi được theo hình thức trả theo mức sử dụng. Tài liệu của nhà cung cấp nêu rõ ràng không thể nhầm lẫn rằng MiniMax-M3.1-Flash-Preview hiện chỉ khả dụng thông qua Token Plan và MiniMax Code, và Subscription Key không thể dùng thay thế cho API key trả theo mức sử dụng. Nếu bạn đã có sẵn một suất, thì chỉ cần thay đổi một dòng. Nếu chưa có, việc đánh giá mô hình này đồng nghĩa với việc mua một gói đăng ký.
Khi con số DeepSeek là lựa chọn sai lầm
Hình ảnh phản chiếu là việc DeepSeek V4 Flash chỉ xử lý văn bản và đã bị thay thế. Nó chưa bao giờ chấp nhận hình ảnh — công việc đó cần đến bản dựng thử nghiệm riêng, hiện đã bị ngừng song song với nó — và định danh mô hình giờ đây phục vụ các trọng số khác với những gì cái tên gợi ý. Một pipeline được ghim vào deepseek-v4-flash để đảm bảo khả năng tái lập đang dựa vào một chuyển hướng mà DeepSeek mô tả là tạm thời.
MiniMax-M3.1-Flash-Preview xử lý văn bản, hình ảnh và video một cách native, và đây là mô hình văn bản đang đứng đầu bảng của nhà cung cấp. Đầu vào video ở mức giá Flash không phổ biến trong phân khúc này.
Cả hai lưu ý này đều chỉ về cùng một hướng đối với bất kỳ ai đang vận hành lưu lượng production: định danh trên hóa đơn và mô hình đã trả lời không được đảm bảo sẽ mãi là cùng một thứ, và lớp định tuyến chính là nơi điều đó được xử lý thay vì bị phát hiện.

Làm thế nào để quyết định điều này trong một buổi chiều
Hãy bắt đầu từ phần kết của nhiệm vụ thay vì từ phần đầu.
Nếu công việc là tạo văn bản dài — bất cứ thứ gì kết thúc bằng việc viết hàng chục nghìn token — thì DeepSeek V4 Flash là cái duy nhất trong hai cái công bố mức trần đủ lớn để hứa hẹn điều đó, và bảng giá của nó đủ nhỏ để hệ số nhân giờ cao điểm có thể chịu đựng được. Hãy mô hình hóa chi phí vào giờ cao điểm, không phải giờ thấp điểm, và coi định danh đã bị khai tử như một cuộc di trú bạn chưa thực hiện, chứ không phải một hợp đồng ổn định.
Nếu công việc là đọc và suy luận trên đầu vào đa phương thức trong một ngân sách hàng tháng cố định — bản ghi màn hình, tài liệu quét, đánh giá video — thì MiniMax-M3.1-Flash-Preview là dạng có năng lực hơn, và trong một suất Token Plan, đây là cách rẻ nhất để có đầu vào video ở độ dài ngữ cảnh này. Hãy chấp nhận rằng bạn đang mua một mô hình chưa được đo lường, và giới hạn phạm vi ảnh hưởng: giữ khối lượng công việc quan trọng trên thứ gì đó có bảng giá công bố, và để bản xem trước xử lý nửa mang tính thăm dò.
Nếu cả hai mô tả đều khớp với pipeline của bạn, thì đó là vấn đề định tuyến chứ không phải vấn đề chọn mô hình, và đây chính là trường hợp mà chúng tôi tồn tại vì nó. DeepSeek V4 Flash trên OrcaRouter có mức giá đúng bằng giá của nhà cung cấp với mức markup 0% — mục trong danh mục của nó hiển thị $0.22 cho mỗi triệu token đầu vào và $0.66 cho mỗi triệu token đầu ra, tức cột giá cao nhất của bảng giá Flash hiện tại, được truyền thẳng qua — cùng với MiniMax-M3 và MiniMax M2.7 trong cùng dải giá trên cùng một key. Một endpoint duy nhất truy cập được hơn 200 mô hình với cơ chế chuyển đổi dự phòng tự động phía sau, nhờ đó một khối lượng công việc có thể chuyển giữa các mức giá mà không cần tích hợp thêm lần nữa. MiniMax-M3.1-Flash-Preview không có trong danh mục của chúng tôi; muốn dùng được nó thì phải qua Token Plan của nhà cung cấp và sản phẩm lập trình của họ.
Bản một dòng: DeepSeek V4 Flash là lựa chọn đã biết rõ với mức trần đầu ra được công bố, bảng giá dễ đọc và một phiên bản kế nhiệm lặng lẽ mang chính cái tên đó; MiniMax-M3.1-Flash-Preview là bản mới hơn, đa phương thức, chưa được đo lường, tốn một khoản đăng ký để dùng thử. Không điều nào trong số đó là lý do để chọn cái còn lại — chúng chỉ là những sự thật mà bạn sẽ không nhận được từ một so sánh giá trên mỗi token vốn dẫn một bảng giá mà DeepSeek đã ngừng áp dụng từ tháng 9.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
