
Claude Sonnet 5.5 so với MiniMax M3: Nơi mô hình rẻ hơn gấp 15 lần thực sự ngang bằng
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 931 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 192 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Có một dòng trên bảng độc lập mà ở đó MiniMax M3 và Claude Sonnet 5.5 giống hệt nhau, và đó không phải là dòng mà ai cũng đoán ra. Ở bài kiểm tra khả năng ghi nhớ ngữ cảnh dài, MiniMax M3 đạt 83,0% và Claude Sonnet 5.5 đạt 82,7%. MiniMax M3 có giá 0,30 USD cho mỗi triệu token đầu vào và 1,20 USD cho mỗi triệu token đầu ra. Claude Sonnet 5.5 có giá 2,00 USD và 10,00 USD. Trên toàn bộ Chỉ số Trí tuệ, chi phí đo được của M3 là 0,51 USD mỗi tác vụ, so với 7,60 USD của Claude Sonnet 5.5 — rẻ hơn mười lăm lần, và ở bài đánh giá duy nhất đo xem liệu một mô hình có còn tìm được thứ gì đó trong một tài liệu rất dài hay không, nó hoàn toàn không hề thua kém.
Rồi bạn mở các bài đánh giá agentic ra, và bức tranh đảo ngược mạnh đến mức nó không còn là một phép so sánh nữa. Trên Terminal-Bench 4.0, bài kiểm tra yêu cầu một mô hình điều khiển shell và thực sự hoàn thành một tác vụ phần mềm, MiniMax M3 đạt 2.0% còn Claude Sonnet 5.5 đạt 63.6%. Khoảng cách gấp ba mươi lần trên một benchmark giống công việc production nhất không phải là câu hỏi về giá, và không khoản tiết kiệm nào trên mỗi token có thể bù đắp được điều đó. Câu hỏi hữu ích mà cuộc đối đầu này đặt ra không phải "cái nào tốt hơn" mà là bạn có thể hấp thụ kiểu thất bại nào trong hai kiểu thất bại này đối với khối lượng công việc của mình: MiniMax M3 là mô hình trọng số mở, triệu token, native-video, ngang bằng một mô hình tiên tiến về truy xuất và sụp đổ khi thực thi, còn Claude Sonnet 5.5 là mô hình đóng ra mắt ngày 28 tháng 9 năm 2026 để làm điều ngược lại.
Mỗi thứ là gì, được nói rõ ràng.
MiniMax M3 là mô hình nền tảng trọng số mở hàng đầu của phòng thí nghiệm Trung Quốc, được công bố ngày 1 tháng 6 năm 2026 và có thể tải xuống theo giấy phép cộng đồng của chính MiniMax. Đây là mô hình hỗn hợp chuyên gia với tổng cộng khoảng 428 tỷ tham số và khoảng 23 tỷ tham số hoạt động mỗi token, đồng thời có khả năng đa phương thức gốc theo đúng nghĩa mạnh: văn bản, hình ảnh và video là đầu vào còn đầu ra là văn bản, với pipeline đa phương thức được xây dựng lại ngay từ bước tiền huấn luyện đầu tiên thay vì được gắn thêm. Cửa sổ là 1.048.576 token — với mức tối thiểu sử dụng được đảm bảo là 512.000 trong mục danh mục của chính chúng tôi — và đầu ra tối đa là 512.000 token, đây là con số của chúng tôi chứ không phải của nhà cung cấp, vì MiniMax không công bố con số nào. Kiến trúc là MiniMax Sparse Attention, chủ đề của arXiv 2606.13392, và tuyên bố của nhà cung cấp về nó là prefill nhanh hơn trên 9 lần và giải mã nhanh hơn trên 15 lần so với thế hệ trước ở cửa sổ một triệu token. Đó là các con số của nhà cung cấp và chúng tôi chưa thấy chúng được tái lập một cách độc lập.

Claude Sonnet 5.5 là mô hình thế hệ 5.5 thứ hai của Anthropic, mới ra đời được một ngày tại thời điểm viết bài, và nó là mô hình đóng. Anthropic mô tả nó là sự kết hợp tốt nhất giữa tốc độ và trí tuệ trong dòng sản phẩm, với các thông số kỹ thuật gồm 1.000.000 token ngữ cảnh, 128.000 token đầu ra đồng bộ với 300.000 trên Message Batches API, đầu vào văn bản, hình ảnh và tệp, suy luận thích ứng với mức độ nỗ lực có thể lựa chọn, ngày cắt kiến thức tháng 6 năm 2026, và khả năng không lưu trữ dữ liệu có sẵn ngay từ khi ra mắt. Giá của nó không thay đổi so với Claude Sonnet 5: 2,00 USD đầu vào, 10,00 USD đầu ra, 0,20 USD cho đọc bộ nhớ đệm, 2,50 USD cho ghi bộ nhớ đệm. Anthropic nói rằng nó chạy nhanh hơn 30% và tốn ít hơn tới 30% mỗi tác vụ so với Claude Sonnet 5 — số liệu của nhà cung cấp, chưa được tái lập, và cần được hiểu là những tuyên bố về số lượng token chứ không phải về đơn giá, vì đơn giá là giống hệt nhau.
Hình dạng của benchmark chính là toàn bộ câu chuyện.
Cả hai mô hình đều được đo trên cùng một chỉ mục, bản sửa đổi v4.3.2, và kết quả theo từng đánh giá chính là điều khiến việc ghép cặp này trở nên thú vị thay vì lệch hẳn về một phía.
• Khả năng ghi nhớ ngữ cảnh dài — MiniMax M3 83.0% so với Claude Sonnet 5.5 82.7%, mức chênh lệch chỉ là sai số làm tròn trên một kết quả ngang bằng thực sự
• SciCode — MiniMax M3 47.1% so với Claude Sonnet 5.5 61.0%, một khoảng cách thực sự nhưng có thể vượt qua
• Humanity's Last Exam — MiniMax M3 39,0% so với Claude Sonnet 5.5 55,0%
• Terminal-Bench 4.0 — MiniMax M3 2.0% so với Claude Sonnet 5.5 63.6%, chỗ mà việc so sánh không còn hữu ích nữa
• Chỉ số Trí tuệ — MiniMax M3 29 so với Claude Sonnet 5.5 56
• Chi phí cho mỗi tác vụ Index — MiniMax M3 0,51 $ so với Claude Sonnet 5.5 7,60 $
• Token đầu ra được tạo trên toàn bộ Chỉ mục — MiniMax M3 120M so với Claude Sonnet 5.5 410M
• Tốc độ đầu ra — MiniMax M3 115,3 tokens/giây so với Claude Sonnet 5.5 138,7 tokens/giây
Đọc các hàng đó theo thứ tự và một mô hình mạch lạc sẽ hiện ra. MiniMax M3 có năng lực ở lý luận tĩnh và truy xuất, nhưng yếu ở khả năng thực thi bền bỉ. Kết quả Terminal-Bench của nó không phải là một sự thiếu hụt khiêm tốn; điểm 2.0% nghĩa là mô hình về cơ bản không hoàn thành các nhiệm vụ, và mô thức tương tự cũng thể hiện ở điểm chuẩn tự động hóa 0.21 so với 0.21, và ở điểm toàn tri 1.35 so với 32.3. Nơi MiniMax M3 thực sự giữ được vị thế lại đúng là nơi kiến trúc của nó tuyên bố có lợi thế: một đầu vào rất dài, được đọc và trả lời. Đó là MSA đang làm đúng điều mà MiniMax đã quảng bá nó để làm.

Dòng chi phí nêu thêm một điểm thứ hai, ít hiển nhiên hơn. MiniMax M3 không chỉ rẻ hơn trên mỗi token — 1/6,7 ở đầu vào và 1/8,3 ở đầu ra — mà còn tiêu tốn ít token hơn để đi đến câu trả lời, khoảng 120 triệu so với 410 triệu trên cùng một bộ đánh giá. Hai hiệu ứng nhân lên thành khoảng cách gấp mười lăm lần trên mỗi tác vụ. Một phần khoảng cách đó là hiệu quả thực sự, và một phần đơn giản chỉ là MiniMax M3 bỏ cuộc sớm hơn ở những tác vụ mà nó đang thất bại; một tác vụ rẻ tiền nhưng trả về câu trả lời sai thì không phải là một khoản tiết kiệm, và đây là bài học rẻ nhất trong bài viết.
Chiều kích mà bảng giá không thể hiển thị
MiniMax M3 có một đặc tính mà Claude Sonnet 5.5 không có và không thể có được: bạn có thể lấy trọng số. Điều đó quan trọng đối với đúng một nhóm người mua, và đối với người mua đó, nó quan trọng hơn tất cả những điều trên. Nếu một yêu cầu không thể rời khỏi một khu vực tài phán, không thể vượt qua ranh giới mạng, hoặc phải chạy ở nơi hoàn toàn không thể truy cập API, thì một mô hình không có trọng số có thể tải xuống không phải là một lựa chọn ở bất kỳ mức giá nào, và một mô hình trọng số mở 428 tỷ tham số thì có. Cùng đặc tính đó lại là một trở ngại theo hướng ngược lại: tự vận hành 428 tỷ tham số với 23 tỷ tham số hoạt động là một quyết định về vốn, chứ không phải một khóa API, và những tuyên bố về cơ chế chú ý thưa của chính MiniMax tồn tại vì giải pháp thay thế ở một triệu token là cơ sở hạ tầng không thể chi trả.
Đối với tất cả những người khác, cách diễn đạt trung thực là đây là một lằn ranh xây dựng-so-với-mua đi kèm với một mức giá. Claude Sonnet 5.5 là mô hình tốt hơn cho bất cứ thứ gì mang tính tác tử. MiniMax M3 là mô hình tốt hơn để đọc một thứ khổng lồ và trả lời một câu hỏi về nó, và nó là mô hình tốt hơn hẳn để xử lý video, thứ mà Claude Sonnet 5.5 hoàn toàn không chấp nhận — bề mặt đầu vào của nó là văn bản, hình ảnh và tệp.
• Trọng số — MiniMax M3 mở theo giấy phép cộng đồng của MiniMax so với Claude Sonnet 5.5 đóng
• Phương thức đầu vào — MiniMax M3 văn bản, hình ảnh và video so với Claude Sonnet 5.5 văn bản, hình ảnh và tệp
• Đầu ra tối đa — MiniMax M3 512.000 token theo danh mục của chúng tôi so với Claude Sonnet 5.5 128.000 đồng bộ, 300.000 trên Batches
• Giá bộ nhớ đệm — MiniMax M3 0,06 USD mỗi triệu lượt đọc so với Claude Sonnet 5.5 0,20 USD mỗi lượt đọc và 2,50 USD mỗi lượt ghi
• Kiểm soát nỗ lực — tư duy MiniMax M3 được bật, thích ứng hoặc tắt so với tư duy thích ứng của Claude Sonnet 5.5, trong đó việc tắt giờ đây yêu cầu between_toolsdạng
• Lưu trữ dữ liệu — MiniMax M3 do chính bạn quản lý nếu tự triển khai (self-hosted), so với Claude Sonnet 5.5 với tính năng không lưu trữ dữ liệu (zero data retention) có sẵn từ Anthropic ngay khi ra mắt
Chạy cả hai mà không cần chạy hai hợp đồng
Khi bạn kết hợp một mô hình Trung Quốc trọng số mở với một mô hình Anthropic đóng trong cùng một pipeline, chi phí vận hành thường không nằm ở token; mà nằm ở hợp đồng thứ hai, khóa thứ hai, bộ giới hạn tốc độ thứ hai, và điểm thứ hai có thể xảy ra lỗi. OrcaRouter gộp tất cả lại thành một endpoint tương thích OpenAI bao phủ hơn 200 mô hình, với giá niêm yết của nhà cung cấp được giữ nguyên — không cộng thêm markup cho bên nào — tự động chuyển đổi dự phòng giữa các nhà cung cấp thượng nguồn, và một DSL định tuyến để kết hợp nhiều mô hình vào một lệnh gọi duy nhất. MiniMax M3 có thể được định tuyến ở đây dưới dạng minimax/minimax-m3 với mức $0,30 và $1,20 của MiniMax cùng $0,06 cho lượt đọc cache, và đây là một trong những mô hình đông khách nhất trong danh mục theo lưu lượng, bản thân đó đã là một tín hiệu hữu ích: lớp định tuyến có thể cho bạn biết một mô hình đang gánh bao nhiêu tải thực tế, chứ không chỉ là điểm số của nó.
Claude Sonnet 5.5 vẫn chưa có trong danh mục của chúng tôi, và bài viết này sẽ không giả vờ rằng nó đã có. Con đường để tiếp cận nó hiện nay là API của chính Anthropic. Claude Sonnet 5.5 có thể được định tuyến tại đây với đúng mức 2,00 USD và 10,00 USD và đã như vậy kể từ ngày 30 tháng 6, đồng thời nó là mục tiêu chuyển tiếp tự nhiên và là đối tác dự phòng trong khi phiên bản kế nhiệm của nó mới chỉ một ngày tuổi.
Sự kết hợp đó — việc hoán đổi ngữ cảnh dài và đường đi tác tử phía sau một thông tin xác thực — chính là mục đích của một router. MiniMax M3 vận chuyển 63,2 triệu token lưu lượng mỗi tuần qua danh mục này, so với 7,9 triệu của Claude Sonnet 5, vì vậy mô hình rẻ ở đây không phải là một sự thay thế trên lý thuyết; nó đã và đang gánh khối lượng đó. Định tuyến cả hai từ một khóa nghĩa là việc phân chia là một quyết định cấu hình mà bạn có thể chuyển lưu lượng qua lại, thay vì một hợp đồng thứ hai mà bạn phải ký trước khi có thể thử nghiệm phía rẻ hơn.

Làm gì với chiếc cà vạt
Nếu khối lượng công việc của bạn là hỏi đáp ở quy mô tài liệu — đầu vào rất dài, câu trả lời thực tế ngắn gọn, độ trễ ở mức chấp nhận được — thì thế cân bằng ở long-context là có thật, và lợi thế chi phí gấp mười lăm lần của MiniMax M3 cũng có thật. Đó là một sự hoán đổi đơn giản và đáng để thử ngay trong tuần này.
Nếu khối lượng công việc của bạn mang tính agentic, dòng Terminal-Bench sẽ giải quyết điều đó trước khi giá cả được đưa vào cuộc thảo luận. Claude Sonnet 5.5 ở mức 7,60 USD mỗi tác vụ Index so với MiniMax M3 ở mức 0,51 USD là mức phụ trội gấp 15 lần cho một mô hình đạt điểm cao hơn sáu mươi điểm trong bài đánh giá giống lưu lượng sản xuất của bạn nhất, và phương án rẻ hơn mười lăm lần nhưng thất bại ở tác vụ đó mới chính là phương án đắt đỏ. Phép đo cần chạy trên dữ liệu của chính bạn là số token cho mỗi tác vụ hoàn thành, không phải số token cho mỗi yêu cầu, bởi vì đó là con số duy nhất trong bài viết này mà lợi thế về giá của MiniMax M3 không thể đứng vững theo mặc định.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
