
GPT-6 Sol so với MiniMax M3: Điều mà mức giá đầu ra gấp tám lần vẫn không mua được
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Điều đầu tiên cần nói về GPT-6 Sol so với MiniMax M3 là đường giá không sát nhau và đường điểm số cũng không sát nhau, và chúng chỉ theo hai hướng ngược nhau. MiniMax M3 là một mô hình trọng số mở mà bạn có thể tự tải về và chạy, và nó được niêm yết ở mức 0,30 đô la cho mỗi triệu token đầu vào và 1,20 đô la cho mỗi triệu token đầu ra; GPT-6 Sol, bậc giữa của thế hệ GPT-6 ra mắt ngày 22 tháng 9 năm 2026, là 2,00 đô la và 10,00 đô la trên cùng đơn vị. Đó là mức cao hơn tám lần một chút so với giá đầu ra. MiniMax M3 cũng chấp nhận video làm phương thức đầu vào, điều mà GPT-6 Sol không hỗ trợ — mô hình Sol nhận văn bản, hình ảnh và tệp. Điều M3 không có là một điểm số nào đó gần bằng Sol: 29,2 so với 47,6 trên Chỉ số Trí tuệ của Artificial Analysis, trên cùng bảng phiên bản v4.3.2.
Sự bất đối xứng đó chính là toàn bộ câu chuyện, và nó thú vị hơn một sự đánh đổi đơn thuần giữa giá và chất lượng, bởi vì cột open-weight được giữ lại thứ mà cột đóng không thể bán bằng bất kỳ giá nào: các checkpoint của M3 nằm trên Hugging Face và mô hình có thể được chạy bên trong một ranh giới mạng. Nếu bạn đang chọn giữa hai cái này, câu hỏi hữu ích không phải là cái nào tốt hơn. Mà là trong bốn thứ riêng biệt bạn đang mua — giá, thông lượng, khả năng kiểm soát, hay năng lực — bạn có thể chấp nhận mất thứ nào.
Bốn chiều kích, và chúng không xếp hạng theo cùng một cách.
• Giá đầu ra — GPT-6 Sol 10,00 USD mỗi triệu so với MiniMax M3 1,20 USD mỗi triệu
• Giá đầu vào — GPT-6 Sol 2,00 USD mỗi triệu so với MiniMax M3 0,30 USD mỗi triệu
• Đầu vào đã lưu trong bộ nhớ đệm — GPT-6 Sol 0,20 USD mỗi triệu so với MiniMax M3 0,06 USD mỗi triệu
• Trọng số — GPT-6 Sol đóng, chỉ API so với MiniMax M3 mở trọng số và có thể tự lưu trữ
• Phương thức đầu vào — GPT-6 Sol văn bản, hình ảnh và tệp so với MiniMax M3 văn bản, hình ảnh và video
• Cửa sổ ngữ cảnh — GPT-6 Sol 1.050.000 token so với MiniMax M3 1.048.576 token
• Đầu ra tối đa — GPT-6 Sol 128.000 token so với MiniMax M3 512.000 token
• Chỉ số thông minh — GPT-6 Sol 47,6 so với MiniMax M3 29,2
• Chỉ số lập trình — GPT-6 Sol không được công bố ở bản sửa đổi này so với MiniMax M3 58,6
• Bước xử lý yêu cầu dài — GPT-6 Sol tính lại giá cho toàn bộ yêu cầu khi vượt quá 272.000 token đầu vào so với MiniMax M3 không có bước nào trên thẻ của nó
Hai trong số những dòng đó đáng được bàn tới nhiều hơn một dòng. Giới hạn đầu ra tối đa lại đi ngược với mọi thứ khác: M3 sẽ tạo ra tối đa 512.000 token trong một phản hồi, gấp bốn lần con số 128.000 của GPT-6 Sol. Với một khối lượng công việc tạo ra toàn bộ một tệp hoặc một báo cáo dài chỉ trong một lần gọi, đó là một lợi thế mang tính cấu trúc, không phải một sai số làm tròn. Và bậc giá cho yêu cầu dài là một chi phí thực của GPT-6 Sol mà M3 hoàn toàn không có — trên 272.000 token đầu vào, Sol định giá lại toàn bộ yêu cầu thành $4.00 / $15.00, trong khi bảng giá của M3 không có điều khoản tương đương. Với một prompt 300.000 token, so sánh đơn giá đầu ra không phải là tám lần, mà là mười hai lần rưỡi.
Vậy nên thứ hạng trung thực phụ thuộc hoàn toàn vào khối lượng công việc. Đối với phân loại hoặc trích xuất khối lượng lớn, nơi một câu trả lời sai thì rẻ còn một câu trả lời chậm thì không, M3 ở mức $0.30 / $1.20 mà không bị phạt vì ngữ cảnh dài là mặc định hợp lý, còn Sol là đốt tiền. Với một tác vụ mà câu trả lời đầu tiên phải đúng — một kế hoạch migration, một đánh giá bảo mật, một đoạn lập luận sẽ được đọc bởi một người sẽ hành động dựa trên đó — khoảng cách chỉ số 18,4 điểm với mức giá đầu ra gấp tám lần là sự đánh đổi mà hầu hết các đội chấp nhận, vì lựa chọn thay thế là trả tiền cho một người để sửa nó.

Nơi các con số được công bố của M3 tốt một cách bất thường, và nơi chúng còn mỏng
Những con số độc lập mạnh nhất của MiniMax M3 không nằm ở nơi bạn sẽ kỳ vọng ở một mô hình trong tầm giá này. Khả năng nhớ ngữ cảnh dài đạt 83,0, thấp hơn 0,7 so với 83,7 của GPT-6 Sol và thực chất là hòa — trên cửa sổ một triệu token, với chi phí bằng một phần sáu giá đầu vào. GPQA Diamond đạt 92,9, đủ gần dải tiên phong đến mức khác biệt nằm trong phạm vi bạn sẽ kỳ vọng đến từ cài đặt nỗ lực suy luận chứ không phải từ năng lực. Hai dòng đó là lý do M3 đáng được coi trọng thay vì bị xếp vào mục “rẻ”.
Những điểm yếu cũng rõ ràng không kém và nên được nói thẳng ra thay vì bị lấp liếm. Khả năng dùng công cụ kiểu bán lẻ rất kém: trên tau-banking, M3 đạt 15,3, và trên bản sửa đổi Terminal-Bench 4.0 mới hơn, nó đạt 2,0. Cả hai đều là các phép đo của bên thứ ba, và cả hai đều cho thấy một mô hình mà điểm trung bình trên benchmark đang che giấu một điểm yếu lớn, cụ thể trong việc gọi công cụ dạng tác tử đối với một dịch vụ mô phỏng. Các con số do chính nhà cung cấp báo cáo lại vẽ nên một bức tranh tốt hơn nhiều — SWE-Bench Pro 59, BrowseComp 83,5, MCP Atlas 74,2, Terminal-Bench 2.1 ở mức 66 — và đó là các số liệu của nhà cung cấp trên chính harness của họ, tức là một tuyên bố chứ không phải một phép đo. Bất kỳ triển khai nào phụ thuộc vào việc dùng công cụ đều nên đọc cặp số liệu này cùng nhau và kiểm thử trực tiếp.
Có một điểm bậc hai về chính việc so sánh điểm chuẩn. GPT-6 Sol được đo trên một bộ điểm chuẩn nhỏ hơn trong danh mục của chúng tôi so với M3 — năm điểm so với hai mươi ba điểm của M3 — bởi vì nhà cung cấp công bố ít hơn và các bên thứ ba đã chạy ít bài kiểm tra hơn đối với nó. Một mô hình có hai mươi ba con số được công bố sẽ luôn trông có vẻ được đánh giá kỹ lưỡng hơn một mô hình chỉ có năm con số, và sự khác biệt nằm ở tài liệu, không phải ở năng lực.
Trọng số mở thực sự mang lại cho bạn điều gì, ngoài một hóa đơn thấp hơn
Tự host M3 là lựa chọn mà GPT-6 Sol không thể sánh bằng, và giá trị của nó không chủ yếu nằm ở khía cạnh tài chính. Ở mức $0.30 / $1, API rẻ hơn chi phí vận hành phần cứng của hầu hết các nhóm, nên lý do để tải nó về là một ràng buộc chứ không phải một bảng tính: dữ liệu không thể rời khỏi ranh giới, một khối lượng công việc không thể chấp nhận phụ thuộc bên ngoài, một bản tinh chỉnh, hoặc một ngân sách độ trễ mà một điểm cuối dùng chung không thể đáp ứng. Trọng số mở là thứ duy nhất trong bốn điều đó mà mô hình đóng có thể trả lời, và nó trả lời bằng cách không sẵn có. Câu trả lời của GPT-6 Sol là bạn không cần chạy nó — đó là một lập luận khác, và đúng với một nhóm các đội khác.
Thông lượng xứng đáng có một dòng riêng vì đây là con số mà một bản demo không bao giờ hiển thị. MiniMax M3 được đo ở khoảng 495 token đầu ra mỗi giây trong cửa sổ trượt bảy ngày của chúng tôi, còn GPT-6 Sol ở khoảng 244. M3 không chỉ là mô hình rẻ hơn trong so sánh này, mà còn là mô hình nhanh hơn trên các tuyến của chúng tôi khoảng gấp đôi, điều này thay đổi chi phí của một tác vụ theo lô cả về thời gian thực tế lẫn đô la. Điều cần lưu ý là đây là các cửa sổ trượt trên một môi trường thử nghiệm dùng chung, không phải một bài kiểm chuẩn có kiểm soát, và chúng biến động.

Vận hành cặp đó như một hệ thống duy nhất
Cả hai mô hình đều nằm sau một khóa OrcaRouter duy nhất cùng với hơn 200 mô hình khác, khiến cho cấu hình thú vị ở đây trở thành một cascade ưu tiên rẻ trước thay vì một sự lựa chọn. Điều hướng lưu lượng đến MiniMax M3, giữ GPT-6 Sol phía sau cho những yêu cầu không vượt qua kiểm tra hoặc kích hoạt tín hiệu độ khó, và chi phí hỗn hợp sẽ tiệm cận mức giá của mô hình trọng số mở hơn là của Sol, trong khi những cuộc gọi khó vẫn nhận được mô hình đạt 47.6 điểm. DSL định tuyến của OrcaRouter chính là nơi thể hiện sự kết hợp đó — một cuộc gọi có thể chỉ định nhiều mô hình và các điều kiện giữa chúng thay vì mã hóa cứng một endpoint cho mỗi tác vụ.
Với những nhóm thực sự không thể quyết định, kết hợp mô hình là phiên bản thô ráp của cùng ý tưởng đó: một hội đồng các mô hình cùng trả lời và các phản hồi được kết hợp lại. Nó không phù hợp với công việc khối lượng lớn và khá phù hợp với một prompt hiếm khi chạy nhưng có tính hệ trọng cao, nơi sự khác biệt giữa câu trả lời 29,2 và 47,6 là thứ duy nhất trên trang.
Failover quan trọng hơn với một mô hình trọng số mở so với một mô hình đóng, và vì một lý do cụ thể: M3 được phục vụ bởi nhiều hơn một nhà cung cấp hạ tầng, và các endpoint khác nhau. Một tuyến thứ hai được cấu hình trước đồng nghĩa một máy chủ chậm hoặc suy giảm chỉ là một lần thử lại thay vì một sự cố ngừng dịch vụ. Và bởi vì danh mục của chúng tôi chuyển tiếp nguyên giá niêm yết của nhà cung cấp mà không cộng thêm markup, một thay đổi mức giá của nhà cung cấp sẽ có hiệu lực phía chúng tôi ngay trong cùng ngày — điều này quan trọng ở một dòng đầu ra $1.20, nơi việc nhà cung cấp thay đổi chỉ một mức giá đầu vào được cache cũng làm thay đổi hóa đơn một cách rõ rệt.

Cái nào bạn thực sự nên gọi
Chọn MiniMax M3 cho khối lượng lớn, cho bất cứ thứ gì muốn có đầu vào video, cho bất cứ thứ gì cần phát ra hơn 128.000 token trong một phản hồi, và cho bất cứ thứ gì phải chạy bên trong vành đai của riêng bạn. Chọn GPT-6 Sol cho những yêu cầu mà câu trả lời chính là sản phẩm, cho các vòng lặp agentic nặng về công cụ, nơi điểm tau-banking và Terminal-Bench 4.0 của M3 là một lời cảnh báo chứ không phải một chú thích nhỏ, và cho bất cứ thứ gì mà mức chênh lệch chỉ số 18 điểm đáng giá gấp tám lần tốc độ đầu ra đối với bạn. Chọn cả hai, và để một bộ định tuyến quyết định, nếu không cái nào trong hai lựa chọn đó mô tả toàn bộ lưu lượng của bạn.
Một điều cần kiểm tra trước khi xét đến cả hai, và đây cũng chính là điểm kiểm tra mà blog này liên tục gặp phải: M3 đã là sản phẩm chủ lực của dòng M-series kể từ tháng 5 năm 2026 và vẫn là mẫu M-series mới nhất trong danh mục của chúng tôi, nên nó thực sự là bản hiện hành — nhưng GPT-6 Sol đã bị GPT-6.1 Sol thay thế ở cùng mức giá cho ngữ cảnh ngắn với đầu vào được cache rẻ hơn, và trang GPT-6 Sol của chính nó có kèm một liên kết trỏ tới bản kế nhiệm. Nếu lý do bạn xem xét Sol ở đây là năng lực chứ không phải bản tích hợp mới tám ngày, hãy xem bản kế nhiệm trước.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
