
Claude Sonnet 5.5 so với Claude Opus 5.5: Các điểm chuẩn hội tụ, còn hóa đơn thì không
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 984 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Claude Sonnet 5.5 đạt trạng thái sẵn sàng chung (general availability) vào ngày 28 tháng 9 năm 2026 với mức 2,00 USD mỗi triệu token đầu vào và 10,00 USD mỗi triệu token đầu ra. Claude Opus 5.5, dòng chủ lực của Anthropic, được phát hành sớm hơn sáu ngày vào ngày 22 tháng 9 với mức giá 4,00 USD và 20,00 USD — đúng gấp đôi ở cả hai mức. Cách hiểu hiển nhiên là Opus 5.5 là mức trần còn Sonnet 5.5 là sự thỏa hiệp bạn phải chấp nhận khi ngân sách là có thật. Bảng ra mắt của chính Anthropic không ủng hộ cách hiểu đó. Theo các con số công ty công bố, Claude Sonnet 5.5 đạt 1844 so với 1846 của Opus 5.5 trên GDPval-AA v2.1, 1811 so với 1822 trên AA-Briefcase v1.1, và 70,6% so với 66,4% trên Terminal-Bench 4.0 — nó thắng ở bài đánh giá chuẩn duy nhất đo lường công việc thực sự được thực hiện bên trong terminal. Hai dòng bên dưới những con số đó, chú thích của chính Anthropic nêu rằng Opus 5.5 "vẫn rõ ràng mạnh hơn ở các công việc phức tạp, kết thúc mở." Cả hai phát biểu đều đúng, và việc tìm ra cách dung hòa cả hai cùng lúc chính là phần lớn mục đích của so sánh này.
Bảng thông tin vụ phóng nói gì, và những gì nó không chịu nói
Xu hướng trong khối benchmark của Anthropic là một mô hình đã thu hẹp phần lớn khoảng cách chứ không phải một mô hình đã vươn lên dẫn đầu. GDPval-AA v2.1, một bộ tác vụ có trọng số kinh tế, là một kết quả hòa với cách biệt hai điểm. AA-Briefcase v1.1, một đánh giá về tài liệu và sản phẩm bàn giao, là một kết quả hòa với cách biệt mười một điểm. CursorBench 4.0 lại đi theo hướng ngược lại: 55,5% cho Sonnet 5.5 so với 57,8% cho Opus 5.5. OSWorld 2.1 đạt 80,1% so với 81,8%, và Humanity's Last Exam đạt 64,5% khi dùng công cụ so với 67,7%. Chỉ có Terminal-Bench 4.0 phá vỡ xu hướng này, và phá vỡ mạnh mẽ — 70,6% so với 66,4%, lợi thế bốn điểm của Sonnet trong công việc trên dòng lệnh mang tính tác tử.
Hãy đọc nhãn của các hàng thay vì đọc các con số, và một điều gì đó khác sẽ hiện ra. Một số mục Opus 5.5 trong đó mang một chú thích về mức nỗ lực — 66,4% ở Xhigh — và một chú thích chân trang nêu rằng cấu hình Max đạt điểm thấp hơn so với Xhigh trên FrontierCode, chứ không phải cao hơn. Nỗ lực cao hơn không mang tính đơn điệu. Một đội ngũ quan tâm đến ngân sách mà cho rằng "nỗ lực tối đa" là một bản nâng cấp miễn phí thì đang mua token để đổi lấy một câu trả lời tệ hơn trên ít nhất một trong các bài kiểm tra của chính Anthropic. Và trên FrontierCode 1.1, cùng chú thích chân trang đó đặt Sonnet 5.5 ở mức 46,2% trong cấu hình Max, so với 54,4% của Opus 5.5 — đây là con số đơn lẻ rõ ràng nhất cho thấy mẫu flagship vẫn vượt lên ở đâu: công việc viết mã trong tầm dài hạn với một định nghĩa nhiệm vụ thưởng cho sự kiên trì.
Còn một lưu ý nữa đáng nói thẳng ra thay vì chôn vùi. Anthropic lưu ý rằng các lần chạy GDPval-AA và AA-Briefcase mà họ công bố được thực thi trên một bản triển khai trước phát hành mang lỗi structured-outputs. Điều đó ảnh hưởng đến cả hai mô hình trong cùng một bảng, nên việc so sánh không bị vô hiệu, nhưng nó có nghĩa là các số liệu tuyệt đối nên được coi như một ảnh chụp nhanh thay vì một kết quả đã ngã ngũ. Các bảng benchmark của nhà cung cấp là sản phẩm tiếp thị kèm một phụ lục phương pháp luận, và bảng này đi kèm với phụ lục của nó.
Nơi phép đo độc lập dừng lại
Artificial Analysis chấm điểm cả hai mô hình dưới cùng một harness, trong cùng cấu hình mà họ gắn nhãn “Adaptive Reasoning, Max Effort, Default Fallback”, trên Intelligence Index v4.3. Claude Opus 5.5 đạt 58. Claude Sonnet 5.5 đạt 56. Đó là khoảng cách hai điểm trên một thang điểm mà cùng đơn vị đánh giá đó xếp Opus 5 ở 51, Sonnet 5 ở 38, DeepSeek V4 Pro ở 36 và Gemini 3.1 Pro Preview ở 30. Một Sonnet mới ra mắt với mức chỉ kém flagship hai điểm và cao hơn thế hệ Opus trước năm điểm chính là tuyên bố thực chất của bản phát hành này, và đây là tuyên bố của bên thứ ba chứ không phải của nhà cung cấp.
Rồi cũng chính trang đó đảo ngược bài toán kinh tế của nó. Artificial Analysis báo cáo rằng một lượt đánh giá Sonnet 5.5 tốn 7,60 USD mỗi tác vụ, so với 5,98 USD của Opus 5.5, dù Sonnet 5.5 chỉ có giá bằng một nửa trên mỗi token. Nguyên nhân nằm ngay trên trang đó: Sonnet 5.5 tạo ra 410 triệu token trong toàn bộ bộ chỉ số, so với mức trung vị 88 triệu của các mô hình mà họ theo dõi — "rất dài dòng", theo lời của đơn vị đánh giá. Opus 5.5 tạo ra 260 triệu trong cùng bộ đó. Với mức 10 USD mỗi triệu token đầu ra so với 20 USD, hệ số dài dòng khoảng 1,6 vẫn khiến Sonnet 5.5 phải trả nhiều hơn khoảng 27% cho mỗi tác vụ hoàn thành.
Đây là phần của so sánh mà một bảng giá theo token không thể cho bạn thấy, và đó là lý do hai con số cùng tồn tại mà không hề mâu thuẫn. Tính theo token, Sonnet 5.5 rẻ hơn một nửa. Tính theo tác vụ đã hoàn thành, trên một bộ đánh giá với các prompt mở và không có kỷ luật về độ dài đầu ra, nó có thể đắt hơn. Việc yếu tố nào trong số đó mô tả khối lượng công việc của bạn mới chính là quyết định thực sự.
Các mức độ nỗ lực, mức trần đầu ra và hình thái của tích hợp
Đối với người mua, các đặc tính cơ học gần như giống hệt nhau giữa hai mẫu này.
• Ngữ cảnh — 1.000.000 token trên cả hai, từ cùng một nhà cung cấp, nên các giả định về thiết kế prompt được giữ nguyên.
• Đầu ra tối đa — 128.000 token trên cả hai; tạo hàng loạt không phải là điểm khác biệt ở đây
• Dạng thức — đầu vào văn bản, hình ảnh và tệp trên cả hai; cả hai đều không chấp nhận âm thanh hoặc video
• Kiểm soát suy luận — tư duy thích ứng trên cả hai, với độ sâu được đặt bằng tham số effort thay vì ngân sách token suy nghĩ. Trên Claude Platform, mặc định là cao; trong các ứng dụng Claude, mặc định là trung bình
• Ghi cache — 5,00 USD mỗi triệu token cho Claude Opus 5.5 so với 2,50 USD cho Claude Sonnet 5.5, dòng duy nhất mà ở đó mô hình rẻ hơn cũng chính là mô hình rẻ hơn khi nạp bằng một tiền tố được dựng lại
• Đọc cache — $0,20 mỗi triệu ở cả hai, ngang bằng chính xác ở dòng chi phối các lượt chạy agent dài
Vì các bề mặt khớp nhau, việc di chuyển giữa chúng chỉ là thay đổi chuỗi model và đo lại nỗ lực, chứ không phải một dự án tích hợp. Điều đó là bất thường giữa các nhà cung cấp và chính là lý do cặp kết hợp cụ thể này đáng được so sánh: hai ứng viên khác nhau về giá và độ sâu, chứ không khác về API mà bạn phải viết.
Một khác biệt vận hành xứng đáng có một dòng riêng. Anthropic cho biết Claude Sonnet 5.5 là Sonnet đầu tiên ra mắt với các biện pháp bảo vệ an ninh mạng và phương án dự phòng ngang hàng với các mô hình hàng đầu của mình, nghĩa là các yêu cầu an ninh mạng có rủi ro cao hơn được định tuyến rõ ràng đến Sonnet trước đó thay vì được mô hình bạn chỉ định trả lời. Nếu khối lượng công việc của bạn liên quan đến lĩnh vực đó, chuỗi mô hình không phải là bảo đảm về việc mô hình nào đã phản hồi — dù ở hạng nào. Anthropic cũng lưu ý rằng nếu bạn chạy Sonnet với tính năng suy nghĩ bị tắt, bạn phải chuyển sang hành vi giữa các công cụ, đây là một thay đổi mã chứ không phải một cờ cấu hình. Cả hai điều đó đều không phải là lý do để tránh mô hình; cả hai đều là lý do để biết trước khi bạn phát hành.
Trên OrcaRouter, Claude Opus 5.5 hiện có thể được định tuyến ngay hôm nay bằng cùng một thông tin xác thực như mọi mô hình khác trong danh mục, theo giá niêm yết của nhà cung cấp với mức chênh lệch 0%, với tính năng chuyển đổi dự phòng tự động sẵn có ở bên dưới. Claude Sonnet 5.5 vẫn chưa phải là một tuyến trên nền tảng của chúng tôi — mô hình này mới chỉ ra đời được một ngày, và cho đến khi nó được niêm yết, tuyên bố trung thực nhất là bạn sẽ truy cập nó thông qua API của chính Anthropic. Bất kỳ ai hiện đang chạy Opus 5.5 qua chúng tôi đều có thể định giá việc chuyển đổi ngay khi nó xuất hiện mà không cần thay đổi bất kỳ điều gì khác trong tích hợp của họ.
Cái nào đặt ở đâu
Sự phân chia rút ra từ các con số: Claude Sonnet 5.5 cho công việc agent gắn với terminal, nơi nó là mô hình mạnh hơn trong hai mô hình theo chỉ số Terminal-Bench 4.0 của chính Anthropic và có giá bằng một nửa; Claude Sonnet 5.5 cho mọi tác vụ mang tính thông lượng, vì khoảng cách chi phí chỉ thu hẹp khi tác vụ buộc phải tạo ra đầu ra dài; Claude Opus 5.5 cho công việc thuộc nhóm FrontierCode, các đợt refactor dài hạn trên những codebase lớn, và bất kỳ khối lượng công việc nào mà mức chênh 54,4% đến 46,2% phản ánh hình dạng vấn đề thực tế của bạn chứ không phải một dòng trên bảng xếp hạng.
Nếu các tác vụ của bạn là kết thúc mở và bạn không thể dự đoán độ dài đầu ra, hãy coi giá trên mỗi token hoàn toàn là con số sai. Hãy đo số token trên mỗi tác vụ đã hoàn thành trên lưu lượng của chính bạn trong một tuần trước khi bạn quyết định theo cách nào; con số artificial-analysis là $7,60 so với $5,98 là một cảnh báo rằng mô hình rẻ có thể thua trên chỉ số mà bạn thực sự trả tiền.
Phán quyết thẳng thắn: đây không còn là sự đánh đổi giữa năng lực và chi phí nữa. Mà là câu hỏi liệu công việc của bạn có bị giới hạn hay không. Đối với các tác vụ bị giới hạn, khối lượng lớn, do công cụ dẫn dắt, mô hình rẻ hơn cũng là mô hình tốt hơn dựa trên bằng chứng hiện có, và mô hình đầu bảng không đáng giá gấp đôi. Với công việc mở, tầm xa, chính câu nói của Anthropic — rằng Opus 5.5 vẫn rõ ràng mạnh hơn — là điều đáng tin, và chưa có mức độ hội tụ benchmark nào có thể thay đổi điều đó.



