Thẻ hero được tạo có tiêu đề Claude Sonnet 5.5 vs MiniMax M3, phụ đề là nơi mô hình rẻ hơn 15 lần đạt kết quả ngang bằng, với ba thẻ thống kê: khả năng nhớ lại ngữ cảnh dài 82.7% so với 83.0%, Terminal-Bench 4.0 63.6% so với 2.0%, và chi phí mỗi tác vụ $7.60 so với $0.51, cùng phần chân trang ghi Tất cả số liệu theo Artificial Analysis v4.3.2; thông số kỹ thuật MiniMax M3 theo MiniMax.
Guides & Insights

Claude Sonnet 5.5 so với MiniMax M3: Nơi mô hình rẻ hơn gấp 15 lần thực sự ngang bằng

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Có một dòng trên bảng độc lập mà ở đó MiniMax M3 và Claude Sonnet 5.5 giống hệt nhau, và đó không phải là dòng mà ai cũng đoán ra. Ở bài kiểm tra khả năng ghi nhớ ngữ cảnh dài, MiniMax M3 đạt 83,0% và Claude Sonnet 5.5 đạt 82,7%. MiniMax M3 có giá 0,30 USD cho mỗi triệu token đầu vào và 1,20 USD cho mỗi triệu token đầu ra. Claude Sonnet 5.5 có giá 2,00 USD và 10,00 USD. Trên toàn bộ Chỉ số Trí tuệ, chi phí đo được của M3 là 0,51 USD mỗi tác vụ, so với 7,60 USD của Claude Sonnet 5.5 — rẻ hơn mười lăm lần, và ở bài đánh giá duy nhất đo xem liệu một mô hình có còn tìm được thứ gì đó trong một tài liệu rất dài hay không, nó hoàn toàn không hề thua kém.

Rồi bạn mở các bài đánh giá agentic ra, và bức tranh đảo ngược mạnh đến mức nó không còn là một phép so sánh nữa. Trên Terminal-Bench 4.0, bài kiểm tra yêu cầu một mô hình điều khiển shell và thực sự hoàn thành một tác vụ phần mềm, MiniMax M3 đạt 2.0% còn Claude Sonnet 5.5 đạt 63.6%. Khoảng cách gấp ba mươi lần trên một benchmark giống công việc production nhất không phải là câu hỏi về giá, và không khoản tiết kiệm nào trên mỗi token có thể bù đắp được điều đó. Câu hỏi hữu ích mà cuộc đối đầu này đặt ra không phải "cái nào tốt hơn" mà là bạn có thể hấp thụ kiểu thất bại nào trong hai kiểu thất bại này đối với khối lượng công việc của mình: MiniMax M3 là mô hình trọng số mở, triệu token, native-video, ngang bằng một mô hình tiên tiến về truy xuất và sụp đổ khi thực thi, còn Claude Sonnet 5.5 là mô hình đóng ra mắt ngày 28 tháng 9 năm 2026 để làm điều ngược lại.

Mỗi thứ là gì, được nói rõ ràng.

MiniMax M3 là mô hình nền tảng trọng số mở hàng đầu của phòng thí nghiệm Trung Quốc, được công bố ngày 1 tháng 6 năm 2026 và có thể tải xuống theo giấy phép cộng đồng của chính MiniMax. Đây là mô hình hỗn hợp chuyên gia với tổng cộng khoảng 428 tỷ tham số và khoảng 23 tỷ tham số hoạt động mỗi token, đồng thời có khả năng đa phương thức gốc theo đúng nghĩa mạnh: văn bản, hình ảnh và video là đầu vào còn đầu ra là văn bản, với pipeline đa phương thức được xây dựng lại ngay từ bước tiền huấn luyện đầu tiên thay vì được gắn thêm. Cửa sổ là 1.048.576 token — với mức tối thiểu sử dụng được đảm bảo là 512.000 trong mục danh mục của chính chúng tôi — và đầu ra tối đa là 512.000 token, đây là con số của chúng tôi chứ không phải của nhà cung cấp, vì MiniMax không công bố con số nào. Kiến trúc là MiniMax Sparse Attention, chủ đề của arXiv 2606.13392, và tuyên bố của nhà cung cấp về nó là prefill nhanh hơn trên 9 lần và giải mã nhanh hơn trên 15 lần so với thế hệ trước ở cửa sổ một triệu token. Đó là các con số của nhà cung cấp và chúng tôi chưa thấy chúng được tái lập một cách độc lập.

Artificial Analysis model page for MiniMax-M3, an open-weights model released June 2026, showing an Intelligence Index of 29, an output speed of 115.3 tokens per second, $0.30 per million input tokens and $1.20 per million output tokens, $0.51 per Intelligence Index task, a 1M-token context window, and text, image and video input.

Claude Sonnet 5.5 là mô hình thế hệ 5.5 thứ hai của Anthropic, mới ra đời được một ngày tại thời điểm viết bài, và nó là mô hình đóng. Anthropic mô tả nó là sự kết hợp tốt nhất giữa tốc độ và trí tuệ trong dòng sản phẩm, với các thông số kỹ thuật gồm 1.000.000 token ngữ cảnh, 128.000 token đầu ra đồng bộ với 300.000 trên Message Batches API, đầu vào văn bản, hình ảnh và tệp, suy luận thích ứng với mức độ nỗ lực có thể lựa chọn, ngày cắt kiến thức tháng 6 năm 2026, và khả năng không lưu trữ dữ liệu có sẵn ngay từ khi ra mắt. Giá của nó không thay đổi so với Claude Sonnet 5: 2,00 USD đầu vào, 10,00 USD đầu ra, 0,20 USD cho đọc bộ nhớ đệm, 2,50 USD cho ghi bộ nhớ đệm. Anthropic nói rằng nó chạy nhanh hơn 30% và tốn ít hơn tới 30% mỗi tác vụ so với Claude Sonnet 5 — số liệu của nhà cung cấp, chưa được tái lập, và cần được hiểu là những tuyên bố về số lượng token chứ không phải về đơn giá, vì đơn giá là giống hệt nhau.

Hình dạng của benchmark chính là toàn bộ câu chuyện.

Cả hai mô hình đều được đo trên cùng một chỉ mục, bản sửa đổi v4.3.2, và kết quả theo từng đánh giá chính là điều khiến việc ghép cặp này trở nên thú vị thay vì lệch hẳn về một phía.

• Khả năng ghi nhớ ngữ cảnh dài — MiniMax M3 83.0% so với Claude Sonnet 5.5 82.7%, mức chênh lệch chỉ là sai số làm tròn trên một kết quả ngang bằng thực sự

• SciCode — MiniMax M3 47.1% so với Claude Sonnet 5.5 61.0%, một khoảng cách thực sự nhưng có thể vượt qua

• Humanity's Last Exam — MiniMax M3 39,0% so với Claude Sonnet 5.5 55,0%

• Terminal-Bench 4.0 — MiniMax M3 2.0% so với Claude Sonnet 5.5 63.6%, chỗ mà việc so sánh không còn hữu ích nữa

• Chỉ số Trí tuệ — MiniMax M3 29 so với Claude Sonnet 5.5 56

• Chi phí cho mỗi tác vụ Index — MiniMax M3 0,51 $ so với Claude Sonnet 5.5 7,60 $

• Token đầu ra được tạo trên toàn bộ Chỉ mục — MiniMax M3 120M so với Claude Sonnet 5.5 410M

• Tốc độ đầu ra — MiniMax M3 115,3 tokens/giây so với Claude Sonnet 5.5 138,7 tokens/giây

Đọc các hàng đó theo thứ tự và một mô hình mạch lạc sẽ hiện ra. MiniMax M3 có năng lực ở lý luận tĩnh và truy xuất, nhưng yếu ở khả năng thực thi bền bỉ. Kết quả Terminal-Bench của nó không phải là một sự thiếu hụt khiêm tốn; điểm 2.0% nghĩa là mô hình về cơ bản không hoàn thành các nhiệm vụ, và mô thức tương tự cũng thể hiện ở điểm chuẩn tự động hóa 0.21 so với 0.21, và ở điểm toàn tri 1.35 so với 32.3. Nơi MiniMax M3 thực sự giữ được vị thế lại đúng là nơi kiến trúc của nó tuyên bố có lợi thế: một đầu vào rất dài, được đọc và trả lời. Đó là MSA đang làm đúng điều mà MiniMax đã quảng bá nó để làm.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs MiniMax M3, the scoreboard, with six matched rows: input price $2.00 vs $0.30, output price $10.00 vs $1.20, Intelligence Index 56 vs 29, cost per task $7.60 vs $0.51, long-context recall 82.7% vs 83.0%, and Terminal-Bench 4.0 63.6% vs 2.0%, with a footer reading All figures per Artificial Analysis v4.3.2; MiniMax M3 is open-weight under MiniMax's community licence.

Dòng chi phí nêu thêm một điểm thứ hai, ít hiển nhiên hơn. MiniMax M3 không chỉ rẻ hơn trên mỗi token — 1/6,7 ở đầu vào và 1/8,3 ở đầu ra — mà còn tiêu tốn ít token hơn để đi đến câu trả lời, khoảng 120 triệu so với 410 triệu trên cùng một bộ đánh giá. Hai hiệu ứng nhân lên thành khoảng cách gấp mười lăm lần trên mỗi tác vụ. Một phần khoảng cách đó là hiệu quả thực sự, và một phần đơn giản chỉ là MiniMax M3 bỏ cuộc sớm hơn ở những tác vụ mà nó đang thất bại; một tác vụ rẻ tiền nhưng trả về câu trả lời sai thì không phải là một khoản tiết kiệm, và đây là bài học rẻ nhất trong bài viết.

Chiều kích mà bảng giá không thể hiển thị

MiniMax M3 có một đặc tính mà Claude Sonnet 5.5 không có và không thể có được: bạn có thể lấy trọng số. Điều đó quan trọng đối với đúng một nhóm người mua, và đối với người mua đó, nó quan trọng hơn tất cả những điều trên. Nếu một yêu cầu không thể rời khỏi một khu vực tài phán, không thể vượt qua ranh giới mạng, hoặc phải chạy ở nơi hoàn toàn không thể truy cập API, thì một mô hình không có trọng số có thể tải xuống không phải là một lựa chọn ở bất kỳ mức giá nào, và một mô hình trọng số mở 428 tỷ tham số thì có. Cùng đặc tính đó lại là một trở ngại theo hướng ngược lại: tự vận hành 428 tỷ tham số với 23 tỷ tham số hoạt động là một quyết định về vốn, chứ không phải một khóa API, và những tuyên bố về cơ chế chú ý thưa của chính MiniMax tồn tại vì giải pháp thay thế ở một triệu token là cơ sở hạ tầng không thể chi trả.

Đối với tất cả những người khác, cách diễn đạt trung thực là đây là một lằn ranh xây dựng-so-với-mua đi kèm với một mức giá. Claude Sonnet 5.5 là mô hình tốt hơn cho bất cứ thứ gì mang tính tác tử. MiniMax M3 là mô hình tốt hơn để đọc một thứ khổng lồ và trả lời một câu hỏi về nó, và nó là mô hình tốt hơn hẳn để xử lý video, thứ mà Claude Sonnet 5.5 hoàn toàn không chấp nhận — bề mặt đầu vào của nó là văn bản, hình ảnh và tệp.

• Trọng số — MiniMax M3 mở theo giấy phép cộng đồng của MiniMax so với Claude Sonnet 5.5 đóng

• Phương thức đầu vào — MiniMax M3 văn bản, hình ảnh và video so với Claude Sonnet 5.5 văn bản, hình ảnh và tệp

• Đầu ra tối đa — MiniMax M3 512.000 token theo danh mục của chúng tôi so với Claude Sonnet 5.5 128.000 đồng bộ, 300.000 trên Batches

• Giá bộ nhớ đệm — MiniMax M3 0,06 USD mỗi triệu lượt đọc so với Claude Sonnet 5.5 0,20 USD mỗi lượt đọc và 2,50 USD mỗi lượt ghi

• Kiểm soát nỗ lực — tư duy MiniMax M3 được bật, thích ứng hoặc tắt so với tư duy thích ứng của Claude Sonnet 5.5, trong đó việc tắt giờ đây yêu cầu between_toolsdạng

• Lưu trữ dữ liệu — MiniMax M3 do chính bạn quản lý nếu tự triển khai (self-hosted), so với Claude Sonnet 5.5 với tính năng không lưu trữ dữ liệu (zero data retention) có sẵn từ Anthropic ngay khi ra mắt

Chạy cả hai mà không cần chạy hai hợp đồng

Khi bạn kết hợp một mô hình Trung Quốc trọng số mở với một mô hình A​nthropic đóng trong cùng một pipeline, chi phí vận hành thường không nằm ở token; mà nằm ở hợp đồng thứ hai, khóa thứ hai, bộ giới hạn tốc độ thứ hai, và điểm thứ hai có thể xảy ra lỗi. OrcaRouter gộp tất cả lại thành một endpoint tương thích Open​AI bao phủ hơn 200 mô hình, với giá niêm yết của nhà cung cấp được giữ nguyên — không cộng thêm markup cho bên nào — tự động chuyển đổi dự phòng giữa các nhà cung cấp thượng nguồn, và một DSL định tuyến để kết hợp nhiều mô hình vào một lệnh gọi duy nhất. MiniMax M3 có thể được định tuyến ở đây dưới dạng minimax/minimax-m3 với mức $0,30 và $1,20 của M​iniMax cùng $0,06 cho lượt đọc cache, và đây là một trong những mô hình đông khách nhất trong danh mục theo lưu lượng, bản thân đó đã là một tín hiệu hữu ích: lớp định tuyến có thể cho bạn biết một mô hình đang gánh bao nhiêu tải thực tế, chứ không chỉ là điểm số của nó.

Claude Sonnet 5.5 vẫn chưa có trong danh mục của chúng tôi, và bài viết này sẽ không giả vờ rằng nó đã có. Con đường để tiếp cận nó hiện nay là API của chính Anthropic. Claude Sonnet 5.5 có thể được định tuyến tại đây với đúng mức 2,00 USD và 10,00 USD và đã như vậy kể từ ngày 30 tháng 6, đồng thời nó là mục tiêu chuyển tiếp tự nhiên và là đối tác dự phòng trong khi phiên bản kế nhiệm của nó mới chỉ một ngày tuổi.

Sự kết hợp đó — việc hoán đổi ngữ cảnh dài và đường đi tác tử phía sau một thông tin xác thực — chính là mục đích của một router. MiniMax M3 vận chuyển 63,2 triệu token lưu lượng mỗi tuần qua danh mục này, so với 7,9 triệu của Claude Sonnet 5, vì vậy mô hình rẻ ở đây không phải là một sự thay thế trên lý thuyết; nó đã và đang gánh khối lượng đó. Định tuyến cả hai từ một khóa nghĩa là việc phân chia là một quyết định cấu hình mà bạn có thể chuyển lưu lượng qua lại, thay vì một hợp đồng thứ hai mà bạn phải ký trước khi có thể thử nghiệm phía rẻ hơn.

OrcaRouter model page for minimax/minimax-m3, dated 2026-05-31, showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 512K maximum output, text, image and video input, $0.30 input and $1.20 output per million tokens, a p50 time to first token of 10.00 s, and 63.2M tokens of recent traffic.

Làm gì với chiếc cà vạt

Nếu khối lượng công việc của bạn là hỏi đáp ở quy mô tài liệu — đầu vào rất dài, câu trả lời thực tế ngắn gọn, độ trễ ở mức chấp nhận được — thì thế cân bằng ở long-context là có thật, và lợi thế chi phí gấp mười lăm lần của MiniMax M3 cũng có thật. Đó là một sự hoán đổi đơn giản và đáng để thử ngay trong tuần này.

Nếu khối lượng công việc của bạn mang tính agentic, dòng Terminal-Bench sẽ giải quyết điều đó trước khi giá cả được đưa vào cuộc thảo luận. Claude Sonnet 5.5 ở mức 7,60 USD mỗi tác vụ Index so với MiniMax M3 ở mức 0,51 USD là mức phụ trội gấp 15 lần cho một mô hình đạt điểm cao hơn sáu mươi điểm trong bài đánh giá giống lưu lượng sản xuất của bạn nhất, và phương án rẻ hơn mười lăm lần nhưng thất bại ở tác vụ đó mới chính là phương án đắt đỏ. Phép đo cần chạy trên dữ liệu của chính bạn là số token cho mỗi tác vụ hoàn thành, không phải số token cho mỗi yêu cầu, bởi vì đó là con số duy nhất trong bài viết này mà lợi thế về giá của MiniMax M3 không thể đứng vững theo mặc định.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày