
Claude Sonnet 5.5 so với Claude Opus 5: Rẻ hơn ở mọi hạng mục, và dẫn đầu trên Chỉ số
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 984 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Claude Opus 5 ra mắt ngày 24 tháng 7 năm 2026 với giá 5,00 USD cho mỗi triệu token đầu vào và 25,00 USD cho mỗi triệu token đầu ra. Claude Sonnet 5.5 đạt trạng thái sẵn sàng chung vào ngày 28 tháng 9 năm 2026 với mức 2,00 USD và 10,00 USD. Đó là mức giảm 60% ở đầu vào và 60% ở đầu ra cho một mô hình mới hơn hai thế hệ — và, trên bộ kiểm thử mà Artificial Analysis chạy cho cả hai, một mô hình đạt 56 trên Intelligence Index v4.3 so với 51 của Claude Opus 5. Đây là một so sánh hiếm hoi khi mô hình mới hơn, rẻ hơn cũng là mô hình đạt điểm cao hơn trên một chỉ số của bên thứ ba, và khi lý do còn lại để chọn mô hình đương nhiệm không phải là thứ hạng trên benchmark mà là một loại công việc cụ thể. Cả hai mô hình đều nhận 1M token ngữ cảnh, đều tạo ra tối đa 128K token, đều đọc văn bản, hình ảnh và tệp, và đều cấu hình suy luận thông qua một tham số effort thay vì ngân sách token suy nghĩ. Vì các bề mặt đều giống nhau, việc chọn giữa chúng hoàn toàn là câu hỏi về chi phí của một tác vụ đã hoàn thành và những tác vụ nào sẽ thất bại.
Hai bản phát hành, một giao diện
Hãy bắt đầu với việc thay đổi rất ít, bởi vì như vậy đã là nhiều hơn so với hầu hết các bước nhảy thế hệ.
• Cửa sổ ngữ cảnh — 1.000.000 token trên cả hai
• Đầu ra tối đa — 128.000 token trên cả hai
• Phương thức nhập — văn bản, hình ảnh và tệp trên cả hai; không có âm thanh, không có video trên cả hai
• Suy luận — tư duy thích ứng với mức nỗ lực có thể cấu hình trên cả hai, vì vậy độ sâu là một tham số yêu cầu thay vì một chuỗi mô hình riêng biệt
• Năng lực — thị giác, công cụ, JSON và khả năng suy luận trên cả hai, theo các mục trong danh mục OrcaRouter cho anthropic/claude-opus-5 và dòng Sonnet
Hệ quả thực tế là một prompt viết cho Claude Opus 5 không cần phải viết lại để chạy trên Claude Sonnet 5.5, và một vòng lặp agent được tinh chỉnh quanh mức trần đầu ra 128K không cần một tier mới. Việc di chuyển chỉ là hoán đổi chuỗi model, cộng thêm việc kiểm tra lại xem bạn đã ghim thiết lập effort nào — không có gì hơn. Với những đội đã trải qua các chuyển đổi đa phương thức, đa tham số trong hai năm qua, đó mới là điểm đáng chú ý, chứ không phải benchmark.
Điều duy nhất thực sự thay đổi là giá, và giá thay đổi ở từng dòng chứ không chỉ hai dòng trên slide tiếp thị.
• Đầu vào — $2.00 mỗi triệu so với $5.00, giảm 60%
• Đầu ra — 10,00 USD mỗi triệu so với 25,00 USD, giảm 60%
• Đọc cache — 0,20 USD mỗi triệu so với 0,50 USD, mức giảm 60%
• Ghi bộ nhớ đệm — 2,50 đô la mỗi triệu so với 10,00 đô la cho cửa sổ năm phút, giảm 75%
Nếu bạn chạy một agent đọc lại một tiền tố dài ở mỗi lượt, dòng đọc bộ nhớ đệm chính là thứ trả tiền cho việc chuyển đổi. Ở mức $0.20 so với $0.50, mỗi token được lưu trong bộ nhớ đệm trong một phiên dài chỉ còn 40% chi phí cũ, và các lượt đọc bộ nhớ đệm chiếm phần lớn số lượng token trong hầu hết các vòng lặp agent. Khoản tiết kiệm cộng dồn theo cách mà con số tiêu đề trên mỗi token không phản ánh được.
Năm điểm đến từ đâu
Artificial Analysis cho Claude Sonnet 5.5 56 điểm và Claude Opus 5 51 điểm trên Intelligence Index v4.3, cả hai đều được đo theo cấu hình “Adaptive Reasoning, Max Effort”. Năm điểm không phải là sai số làm tròn trên thang đo đó — để có ngữ cảnh, cùng đơn vị đánh giá này xếp Sonnet 5 ở mức 38 và Gemini 3.1 Pro Preview ở mức 30, vì vậy khoảng cách giữa Claude Opus 5 và Claude Sonnet 5.5 bằng một phần ba khoảng cách giữa Claude Opus 5 và thế hệ Sonnet trước đó.
Số liệu công bố của chính Anthropic cho Claude Sonnet 5.5 cũng chỉ về cùng một hướng bằng một công cụ đo khác. Công ty báo cáo 70,6% trên Terminal-Bench 4.0 — cũng chính bài kiểm thử mà Claude Opus 5 được ghi nhận đạt 89,1% trong một bảng Anthropic trước đó, một con số sử dụng bản sửa đổi harness khác và không nên lấy để trừ khỏi con số mới hơn. Đó là lưu ý quan trọng nhất về nguồn trong bài viết này: Terminal-Bench chuyển sang 4.0 vào khoảng giữa năm 2026, chỉ mục chứa nó được sửa đổi thành v4.3 để phù hợp, và các so sánh khác phiên bản của benchmark đó không phải là phép tính số học. Khi một con số có kèm phiên bản, hãy nêu rõ phiên bản đó.
Điều có thể so sánh một cách rõ ràng là tiến trình phía Sonnet của chính nhà cung cấp — từ 10,3% trên Terminal-Bench 4.0 đối với Sonnet 5 lên 70,6% đối với Sonnet 5.5 — và kết quả đọc chỉ số của bên thứ ba, nơi cả hai con số đều đến từ cùng một harness trong cùng một ngày. Dựa trên bằng chứng đó, phiên bản kế nhiệm đã thực sự vượt qua mẫu flagship tháng Bảy về suy luận tổng quát, một tuyên bố mạnh hơn bất kỳ slide nào của nhà cung cấp đưa ra.
Cạm bẫy độ dài đầu ra
Đây là lúc phép tính không còn ưu ái mô hình mới hơn nữa.
Artificial Analysis báo cáo rằng việc đánh giá Claude Sonnet 5.5 trên bộ chỉ số index của nó tốn 7,60 USD mỗi tác vụ. Claude Opus 5 tốn 5,86 USD mỗi tác vụ trên cùng bộ chỉ số. Mô hình mới hơn, dù được giảm 60% trên mọi dòng của bảng giá, lại tốn thêm khoảng 30% chi phí để hoàn thành một tác vụ. Lý do nằm trong cùng báo cáo: Sonnet 5.5 đã phát ra 410 triệu token trên toàn bộ bộ chỉ số, so với mức trung vị 88 triệu token ở các mô hình được theo dõi, điều mà đơn vị đánh giá gọi là “rất dài dòng”. Claude Opus 5 đã phát ra 140 triệu token trên cùng bộ chỉ số.
Chia ra thì cơ chế rất đơn giản. Sonnet 5.5 tạo ra lượng token đầu ra gần gấp ba lần Claude Opus 5 trong cùng một công việc, với mức giá đầu ra bằng 40%. Ba lần 0,4 là 1,2 — tức mức phạt 20% trước khi tính đến hiệu ứng cache, nằm trong khoảng của kết quả 7,60 đô la so với 5,86 đô la. Giá trên mỗi token không sai; chỉ là nó không phải con số quyết định hóa đơn.
Điều này không khiến mô hình mới hơn trở thành lựa chọn mua tệ hơn. Nó khiến quyết định phụ thuộc vào một điều mà hầu hết các so sánh bỏ qua: liệu khối lượng công việc của bạn có cho phép bạn giới hạn đầu ra hay không. Một tác vụ tóm tắt với chỉ dẫn về độ dài, một pipeline trích xuất có cấu trúc tạo ra JSON, một bộ phân loại trả về nhãn — trong tất cả những trường hợp đó, sự dài dòng không hề phát huy tác dụng, và mức cắt giảm 60% trên bảng giá là tiền thật. Một agent mở, được yêu cầu "sửa repo" mà không có kỷ luật về đầu ra, trao cho Sonnet 5.5 số dây dư gấp ba lần.
Cài đặt mức độ nỗ lực và cuộc di trú mà không ai dự trù ngân sách
Cả hai mô hình đều thể hiện độ sâu suy luận thông qua một tham số effort với nhiều mức khác nhau, và cả hai đều có giá trị mặc định thay vì một giá trị cố định — high trên Claude Platform, medium bên trong các ứng dụng Claude. Khi thực hiện migration, người ta rất dễ bị cám dỗ giữ nguyên thiết lập như trên mô hình cũ rồi coi như đã xong việc.
Đó là một sai lầm vì một lý do có thể đo lường được. Chú thích của chính Anthropic cho Claude Sonnet 5.5 nêu rõ rằng cấu hình effort Max đạt điểm thấp hơn Xhigh trên FrontierCode, nghĩa là effort không phải là một núm điều chỉnh đơn điệu và thiết lập cao nhất không phải là một bản nâng cấp miễn phí. Hãy đặt effort bằng cách đo lường tác vụ của bạn, chứ không phải bằng cách chọn tùy chọn đắt đỏ nhất hiện có.
Trên phương diện Sonnet, cũng có một khác biệt hành vi cứng nhắc đáng biết trước khi triển khai. Anthropic tuyên bố rằng Claude Sonnet 5.5 là Sonnet đầu tiên được phát hành kèm các biện pháp bảo vệ an ninh mạng và cơ chế dự phòng tương đương với các mô hình hàng đầu của mình, nên các yêu cầu bảo mật có rủi ro cao hơn sẽ chuyển rõ ràng sang Sonnet trước đó thay vì được phục vụ bởi mô hình mà bạn đã nêu tên. Nếu khối lượng công việc của bạn nằm trong lĩnh vực đó, nhật ký của bạn sẽ hiển thị một mô hình mà bạn không yêu cầu. Claude Opus 5 ra đời trước sự sắp đặt đó trên dòng Sonnet, mặc dù cùng loại định tuyến ấy tồn tại trên sản phẩm của Anthropic cho công việc sinh học và an ninh mạng ở các tầng hàng đầu.
Trên OrcaRouter, cả hai endpoint đều đang hoạt động ngay hôm nay — anthropic/claude-opus-5 và anthropic/claude-sonnet-5nằm trong cùng danh mục như mọi thứ khác, được định giá theo bảng giá niêm yết của nhà cung cấp với mức chênh lệch 0% — và Claude Sonnet 5.5 sẽ có thể truy cập được bằng chính thông tin xác thực đó ngay khi nó được niêm yết. Trong lúc chờ đợi, khả năng liên quan chính là chuyển đổi dự phòng tự động: nếu một tầng của Anthropic bị giới hạn tần suất hoặc trả về lỗi, yêu cầu có thể được chuyển hướng sang tầng còn lại mà không cần thay đổi mã, đây là cách phòng ngừa rẻ nhất có thể trước việc đánh giá sai trong so sánh này.
Quyết định, được phát biểu như một quy tắc
Nếu công việc của bạn có phạm vi giới hạn — bạn kiểm soát được hình dạng đầu ra, các prompt đã được cấu trúc hóa, và số token mỗi tác vụ có thể dự đoán được — hãy chuyển sang Claude Sonnet 5.5 và nhận mức cắt giảm 60%. Bảng chỉ số đồng tình, bảng giá cũng đồng tình, và không còn lập luận nào về năng lực ở phía bên kia nữa.
Nếu công việc của bạn mang tính mở và tự chủ, hãy chạy thử nghiệm trước khi tin vào bất kỳ bảng giá nào. Hãy đo token trên mỗi tác vụ hoàn thành trên lưu lượng của riêng bạn trong một tuần với từng mô hình; kết quả bên thứ ba $7.60 so với $5.86 là một cảnh báo cụ thể rằng bảng giá rẻ hơn có thể tạo ra hóa đơn lớn hơn. Claude Opus 5 vẫn là lựa chọn mặc định an toàn hơn cho công việc tự động dài hạn cho đến khi bạn có được con số đó.
Đánh giá thẳng thắn: đây là thế hệ Sonnet đầu tiên mà việc chọn flagship phụ thuộc vào dạng tác vụ chứ không phải năng lực thô, và bất kỳ ai vẫn ra quyết định chỉ dựa vào tên mô hình giờ đây đều đang để mất 60% lợi ích hoặc phải trả thêm 30% cho mỗi tác vụ hoàn thành, chỉ tùy thuộc vào việc họ đoán theo hướng nào.



So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
