
GPT-6.1 Sol vs MiniMax M3: Bảng giá rẻ hơn lại thua trên hóa đơn
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
MiniMax M3 chỉ đòi hỏi một phần nhỏ so với những gì GPT-6.1 Sol yêu cầu — 0,30 đô-la mỗi triệu token đầu vào so với 2,00 đô-la, 1,20 đô-la mỗi triệu token đầu ra so với 10,00 đô-la — và theo thước đo thực sự được dùng để tính, nó rẻ hơn: 0,508 đô-la mỗi tác vụ so với 0,724 đô-la theo đánh giá v4.3.2 của Artificial Analysis. Đó là một thắng lợi thực sự, và nó cũng là toàn bộ lập luận, bởi vì chính phép đo trao cho M3 hóa đơn thấp hơn lại trao cho GPT-6.1 Sol lợi thế 22,6 điểm chỉ số, và bộ chuẩn đánh giá đo lường liệu một mô hình có thể hoàn thành công việc mang tính tác tử thay vì chỉ mô tả nó đã biến khoảng cách thành một bức tường. Nhà cung cấp đã phát hành GPT-6.1 Sol vào ngày 29 tháng 9 năm 2026. Công ty đã phát hành M3, mô hình trọng số mở 428 tỷ tham số của mình, vào ngày 31 tháng 5 năm 2026.
Cả hai đều đang hoạt động, cả hai đều đã có giá, và cả hai chỉ cách một lệnh gọi API. Phần tiếp theo là phép tính để chọn giữa chúng, cùng hai chỗ mà phép tính không phải là toàn bộ câu chuyện.
Mỗi mô hình thực sự là gì
GPT-6.1 Sol là mô hình chủ lực hiện tại của OpenAI cho suy luận và kỹ thuật phần mềm — một mô hình đóng, ra mắt chỉ một tuần sau GPT-6 Sol mà nó thay thế, và được bán với cùng mức giá niêm yết $2.00 / $10.00 như phiên bản tiền nhiệm. Nó có mức giá đầu vào được lưu đệm là $0.10, bằng một nửa mức GPT-6 Sol tính cho các lượt truy cập bộ nhớ đệm, và đây là mô hình OpenAI nhắc đến khi nói về lập trình dạng tác tử thay vì trò chuyện.
MiniMax M3 là một mô hình hỗn hợp các chuyên gia với tổng cộng 428 tỷ tham số và 23 tỷ tham số hoạt động trên mỗi token, được phát hành theo MiniMax Community License — một bản phát hành trọng số mở với giấy phép tùy chỉnh mang hơi hướng phi thương mại, không phải giấy phép được OSI phê duyệt. Mô hình này được cung cấp bởi một loạt các nhà cung cấp suy luận: Artificial Analysis ghi nhận mười lăm máy chủ cho M3 so với tám máy chủ cho GPT-6.1 Sol. Sự đa dạng đó chính là lợi thế thực tiễn của trọng số mở, và đó cũng là lý do vì sao cạnh tranh về giá trên M3 diễn ra nhanh hơn so với mô hình đóng.
Bảng giá cước, và chiếc đồng hồ đo có quyền áp đảo nó

Đặt hai bảng giá đã công bố cạnh nhau và rõ ràng là không hề gần nhau.
• Đầu vào — GPT-6.1 Sol $2.00 mỗi 1M so với MiniMax M3 $0.30 mỗi 1M; M3 rẻ hơn 85%
• Đầu ra — $10.00 mỗi 1M so với $1.20 mỗi 1M; M3 rẻ hơn 88%
• Đầu vào cache — $0.10 mỗi 1M so với $0.06 mỗi 1M
• Chi phí mỗi AA task — $0.724 so với $0.508; M3 rẻ hơn 30%, không phải 85%
• Token đầu ra mỗi tác vụ — 38,128 so với 48,192; M3 viết nhiều hơn 26%
• Thời gian mỗi tác vụ — 640 giây so với 486 giây
• Cửa sổ ngữ cảnh — 1,050,000 so với 1,048,576 token; hiệu quả tương đương
• Đầu ra tối đa — 128,000 token so với 512,000; M3 sẽ viết một câu trả lời rất dài
• Đầu vào được chấp nhận — văn bản, hình ảnh và tệp so với văn bản, hình ảnh và video
• Xếp hạng Index — GPT-6.1 Sol thứ 10 trong số 147 mô hình so với MiniMax M3 thứ 62
Hai dòng rẻ ở phía trên là những dòng mà một bảng thu mua nhìn thấy. Dòng thứ ba mới là dòng thanh toán hóa đơn, và nó nói rằng lợi thế 85–88% trên bảng giá trở thành lợi thế 30% trong thực tế, bởi vì M3 tạo ra nhiều token hơn trên mỗi tác vụ và bởi vì một tác vụ không phải là một khối lượng công việc cố định. Bảng giá định giá token; công việc được định giá theo tác vụ. Mọi so sánh dừng lại ở hai dòng đầu đều đang so sánh sai con số, sai đơn vị.
Nơi mà ba mươi phần trăm không còn quan trọng nữa
Chi phí tác vụ đủ gần nhau đến mức khoảng cách chỉ số quyết định mọi thứ ngoài văn bản khối lượng lớn. Artificial Analysis xếp GPT-6.1 Sol ở mức 51,83 và MiniMax M3 ở mức 29,22 — chênh lệch 22,6 điểm, và mức chênh lệch này không được phân bổ đều trên toàn bộ bộ đánh giá. Ở các bài đánh giá yêu cầu một mô hình vận hành terminal, chỉnh sửa kho mã và tự xác minh công việc của mình, hai mô hình không cùng một hạng:
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 so với MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 so với 0.0048
• AA-Omniscience — 41.53 so với 1.35
• MMLU-Pro — 0.8595 so với 0.7856
• AutomationBench — 0.6487 so với 0.2125
• τ²-bench — không được công bố cho GPT-6.1 Sol trong lần chạy này so với 0.8889 cho M3
• GPQA Diamond — không được công bố cho GPT-6.1 Sol trong lần chạy này so với 0.9293 cho M3
• CritPT — 0.3171 so với 0.0371
Hãy đọc kỹ điều đó, bởi vì đây không phải là một thắng lợi toàn diện và những ngoại lệ mới là phần thú vị. MiniMax M3 đạt 0.8889 trên τ²-bench, bài đánh giá hội thoại về sử dụng công cụ và dịch vụ khách hàng, và 0.9293 trên GPQA Diamond — một điểm số khoa học ở mức sau đại học, vượt qua mọi con số của OpenAI được công bố trong lần chạy cụ thể này. M3 là một mô hình suy luận có năng lực và sử dụng công cụ hội thoại tốt. Trên Terminal-Bench 4.0, nó đạt 0.0202. Đó không phải là “tệ hơn”; đó là một mô hình hoàn toàn không thể duy trì mạch một tác vụ kho mã đa bước, và không mức giảm giá token nào có thể khiến một tác vụ mà mô hình thất bại trở nên rẻ hơn tác vụ mà mô hình hoàn thành.
Có một chi phí thứ cấp mà con số trên mỗi tác vụ che giấu. M3 ghi nhận 48.192 token đầu ra mỗi tác vụ và thời gian đến câu trả lời đầu tiên là 23,0 giây, so với 332,0 giây của GPT-6.1 Sol — mô hình nhỏ bắt đầu nói gần như ngay lập tức rồi sau đó suy luận dài dòng. Nếu khối lượng công việc của bạn nhạy cảm với độ trễ nhưng không sâu, đó là một điểm cộng cho M3. Nếu nó mang tính agentic, số lượng token là thứ bạn phải trả, và điểm cuối cùng là thứ bạn nhận được.
Thẻ mô hình của riêng chúng tôi cho GPT-6.1 Sol mang cùng những con số ở đúng dạng mà bạn thực sự sẽ dùng để định tuyến: mức $2,00 / $10,00, cửa sổ ngữ cảnh 1.050.000 token, p50 4,54 giây đến token đầu tiên, và khối chỉ số cùng benchmark của Artificial Analysis nằm ngay trên cùng một trang.

Trọng số mở có giá trị gì ở đây
Việc M3 có thể tải xuống được là lập luận mạnh nhất dành cho nó, và cần nói thật chính xác điều đó mang lại gì. Nó mang lại các điều khoản giấy phép cho phép bạn chạy mô hình bên trong ranh giới của riêng mình — hữu ích nếu dữ liệu không thể rời đi — và nó mang lại sự cạnh tranh về giá đến từ mười lăm bên lưu trữ độc lập. Nó không mang lại cho bạn một cách triển khai rẻ: 428 tỷ tham số với 23 tỷ tham số hoạt động vẫn cần phần cứng suy luận nghiêm túc, và MiniMax Community License là một giấy phép tùy chỉnh có kèm điều kiện, chứ không phải loại không hạn chế. Với hầu hết các nhóm, "trọng số mở" nghĩa là giá tốt hơn cho suy luận được lưu trữ, chứ không phải một chiếc hộp trong tủ rack.
Card OrcaRouter dành cho MiniMax M3 là nơi chứa các con số được phục vụ: mức giá $0.30 / $1.20, cửa sổ ngữ cảnh 1.048.576 token, đầu ra tối đa 512.000 token, đầu vào văn bản/hình ảnh/video, và khối lượng 56,4 triệu token trong bảy ngày trên các nhà cung cấp định tuyến nó.

Cả hai đều nằm sau một phím
Lý do thực tế khiến so sánh này là một thay đổi cấu hình chứ không phải một cuộc di chuyển là cả hai mô hình đều có thể truy cập từ một endpoint OrcaRouter duy nhất — một API cho hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển tiếp nguyên giá với 0% phụ phí, nghĩa là thay đổi giá MiniMax sẽ xuất hiện trên hóa đơn của bạn ngay ngày nhà cung cấp công bố, thay vì chờ đến khi một nhà bán lại đàm phán lại. Điều đó quan trọng hơn với M3 so với đối thủ của nó: lý do chính để định tuyến đến một mô hình trọng số mở là giá cả và danh sách máy chủ của nó đang thay đổi, và một đồng hồ đo chuyển tiếp nguyên giá là kiểu duy nhất bám theo một mục tiêu đang dịch chuyển.
Chuyển đổi dự phòng tự động là nửa còn lại. M3 được cung cấp bởi nhiều nhà cung cấp với độ tin cậy khác nhau, và lớp định tuyến có thể chuyển một yêu cầu sang máy chủ khác khi một máy chủ suy giảm, mà bên gọi không biết nó đã được xử lý ở máy chủ nào. Đó là cách trung thực để áp dụng một mô hình mà điểm Terminal-Bench của nó nói rằng “không dành cho đường tới hạn” — hãy đặt nó ở nơi việc thử lại là rẻ.
Nếu hôm nay bạn phải chọn thì chọn cái nào?
Nếu công việc là văn bản số lượng lớn — trích xuất, tóm tắt, phân loại, đối thoại, bất cứ thứ gì mà đầu ra là văn xuôi và kiểu lỗi là một câu sai chứ không phải một bản dựng hỏng — thì MiniMax M3 là lựa chọn mặc định đúng đắn và ba mươi phần trăm đó là tiền thật. Hãy dùng các con số từ GPQA và τ²-bench làm bằng chứng của bạn: đây là một mô hình có năng lực mà lại rẻ.
Nếu công việc mang tính agentic — kho lưu trữ, terminal, chuỗi công cụ, bất cứ thứ gì có bước xác minh — thì 0.0202 trên Terminal-Bench 4.0 đủ để bị loại, và GPT-6.1 Sol với 0.5606 cho $0.724 mỗi tác vụ là thương vụ tốt hơn kể cả khi đắt hơn 85% mỗi token. Bảng giá chưa bao giờ là thứ bạn đang mua.
Câu trả lời hữu ích là bạn không nhất thiết phải chọn một lần. Định tuyến tầng nông cho M3, định tuyến tầng agentic cho GPT-6.1 Sol, và giữ cả hai sau một thông tin xác thực — DSL định tuyến kết hợp cả hai thành một lời gọi duy nhất khi một tác vụ khởi đầu là trích xuất và chuyển thành một công việc sửa chữa.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
