Thẻ tiêu đề được tạo cho Claude Opus 5.5 vs Claude Sonnet 5, với phụ đề 'Một nửa giá, hai mươi điểm chỉ số, năm tháng điểm mù', cùng ba biểu tượng đường nét phẳng (một ký hiệu cơ sở dữ liệu xếp chồng, một biểu đồ cột tăng dần và một lịch có đồng hồ) và dòng chân trang ghi 'Chỉ số theo Artificial Analysis ở mức nỗ lực tối đa; giá theo Anthropic.' Logo OrcaRouter thật được ghép ở góc dưới bên phải.
Guides & Insights

Claude Opus 5.5 vs Claude Sonnet 5: Một nửa giá, hai mươi điểm chỉ số, và một điểm mù kéo dài năm tháng

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Nếu bạn chỉ muốn quy tắc: hãy chạy Claude Sonnet 5 theo mặc định và nâng cấp lên Claude Opus 5.5 khi một tác vụ thất bại, vì mô hình rẻ hơn thực sự chỉ bằng một nửa giá và thực sự thuộc một đẳng cấp năng lực khác. Hai con số đằng sau điều đó là 38 và 58 — điểm của Sonnet 5 và Opus 5.5 trên Chỉ số Thông minh của Artificial Analysis, trên cùng một trình đánh giá, trong cùng một nhóm cấu hình. Khoảng cách hai mươi điểm trên chỉ số đó không phải là một tiêu chí phá thế cân bằng, và đó là khoảng cách lớn nhất trong bất kỳ cuộc đối đầu Claude-với-Claude nào mà bạn có thể tạo ra hiện nay: Claude Opus 5.5 được xếp hạng #1 trong số 210 mô hình và Claude Sonnet 5 được xếp hạng #54, và chênh lệch giá giữa chúng là 2 đô la cho mỗi triệu token đầu vào.

Đó là nửa dễ. Nửa khó là việc leo thang có chọn lọc đòi hỏi phải biết những tác vụ nào thất bại, và hai mô hình bất đồng về thế giới sau tháng 1 năm 2026 theo cách mà không bài đánh giá nào sẽ làm lộ ra như một lỗi.

Khoảng cách hai mươi điểm, trong bối cảnh

A two-column scoreboard comparing Claude Opus 5.5 and Claude Sonnet 5 across six shared rows: Intelligence Index (58, ranked #1 of 210, against 38, ranked #54), price in and out ($4.00 / $20.00 per million against $2.00 / $10.00), default effort (medium against high), knowledge cutoff (Jun 2026 against Jan 2026), output speed (not yet published against 79.3 tokens per second) and cache read ($0.20 per million on both). The footer reads 'Index and speed figures per Artificial Analysis at max effort; prices, effort defaults and cutoffs per Anthropic.'

Artificial Analysis chạy mỗi mô hình trong một cấu hình đã được công bố, và hai mô hình này dùng chung một nhãn họ — "Adaptive Reasoning, Max Effort" — khiến cho việc so sánh trở nên rõ ràng một cách bất thường:

• Chỉ số Trí tuệ — Claude Opus 5.5 58, xếp hạng #1 trong số 210 so với Claude Sonnet 5 38, xếp hạng #54

• Giá — Claude Opus 5.5 $4,00 vào / $20,00 ra mỗi triệu token so với Claude Sonnet 5 $2,00 / $10,00

• Tốc độ đầu ra — Claude Sonnet 5 79,3 token/giây so với Claude Opus 5.5 chưa được công bố trên bảng xếp hạng

• Thời gian đến token đầu tiên — Claude Sonnet 5 150,02 giây so với trung vị của bảng là 3,83 giây

• Mức nỗ lực mặc định — Claude Opus 5.5 trung bình so với Claude Sonnet 5 cao

• Thời điểm cắt kiến thức — tháng 6 năm 2026 đối với Claude Opus 5.5 so với tháng 1 năm 2026 đối với Claude Sonnet 5

• Ngữ cảnh và đầu ra — ngữ cảnh 1M và đầu ra tối đa 128K trên cả hai

Cột thứ hạng là phần đáng để ngồi ngẫm cho kỹ. Hai mươi điểm chỉ số không phải là bốn bậc trên một bảng xếp hạng; mà là bốn mươi chín bậc. Trên một bảng gồm 210 mô hình, Opus 5.5 và Sonnet 5 không phải là những "hàng xóm" chỉ chênh nhau chút về giá — chúng nằm ở những dải hoàn toàn khác nhau, và khoảng cách 2 đô-la mỗi triệu token đang mua lấy một bước tiến thực sự về năng lực chứ không phải một tấm huy hiệu. Bất cứ ai đọc các bài đưa tin tuần này theo kiểu "Anthropic vừa tung ra một Opus rẻ hơn" và cho rằng tầng Sonnet đã bị hút vào đó thì nên nhìn vào cặp thứ hạng ấy: trang định giá của chính Anthropic vẫn liệt kê Claude Sonnet 5 như một sản phẩm hiện hành, và vị trí của nó trên bảng xếp hạng độc lập vẫn không hề nhúc nhích.

Hai lưu ý giữ cho điều này vẫn trung thực. Cả hai điểm số đều được chạy ở mức nỗ lực tối đa, và mặc định phát hành của cả hai mô hình đều không phải mức tối đa — Sonnet 5 mặc định ở mức cao, còn Opus 5.5 là trung bình. Và các hàng về tốc độ khiến câu chuyện trở nên phức tạp hơn theo hướng có lợi cho Sonnet 5: 79,3 token mỗi giây cùng 150 giây cho token đầu tiên là một hồ sơ độ trễ thực tế, đã được đo lường, và đây là mô hình duy nhất trong hai mô hình có mặt trên bảng. Tốc độ và độ trễ của Opus 5.5 chưa được Artificial Analysis công bố, nghĩa là tuyên bố "nhanh hơn" trong cuộc so tài này hiện chỉ dựa trên tài liệu của nhà cung cấp chứ không phải một phép đo.

Cước chú làm thay đổi giá của Sonnet 5

Điều cụ thể nhất xuất hiện trong tháng vừa qua liên quan đến Claude Sonnet 5 là một câu mà hầu hết các bài đưa tin đã bỏ qua. Khi mô hình này ra mắt vào ngày 30 tháng 6 năm 2026, mức giá $2 / $10 của nó được công bố là giá giới thiệu đến hết ngày 31 tháng 8, với kế hoạch tăng lên $3 / $15 vào ngày 1 tháng 9. Trên trang giá hiện tại của Anthropic, chú thích ghi rằng mức giá $2/$10 "hiện là mức giá tiêu chuẩn" và rằng việc tăng giá "sẽ không diễn ra".

Điều đó quan trọng vì hai lý do. Lý do rõ ràng là mức tăng 50% từng được công bố rồi sau đó bị hủy là một khoản chi phí mà giờ đây bạn có thể lên kế hoạch dựa trên đó — Sonnet 5 không phải là mức giá khuyến mãi mà bạn phải mô phỏng thời điểm hết hạn. Lý do ít rõ ràng hơn là nó chốt lại phép tính leo thang. Với Sonnet 5 cố định ở mức $2/$10 và Opus 5.5 ở mức $4/$20, tỷ lệ giữa hai hạng đúng bằng 2x ở cả hai chiều, và nó ổn định. Một quy tắc leo thang chẳng hạn đẩy một phần năm lưu lượng của bạn sang Opus 5.5 sẽ có mức chi phí mà bạn chỉ cần tính một lần rồi thôi không phải tính lại nữa.

Giá batch và giá cache biến động cùng nhau, và đó chính là điều khiến việc so sánh toàn bộ bảng trở nên hữu ích: Sonnet 5 có giá batch là $1.00 / $5.00, so với $2.00 / $10.00 của Opus 5.5, và cả hai đều tính phí đọc cache ở mức $0.20 mỗi triệu token. Con số cuối cùng đó là một sự ngang bằng thực sự — Opus 5.5 đã giảm giá đọc cache từ $0.50 xuống $0.20, còn Sonnet 5 vốn đã ở mức đó. Nếu khối lượng công việc của bạn chủ yếu là đọc lại một ngữ cảnh cache lớn thay vì tạo đầu ra mới, thì lợi thế về giá của mô hình rẻ hơn sẽ nhỏ hơn nhiều so với tỷ lệ được quảng cáo, bởi vì dòng duy nhất mà chúng giống nhau lại chính là dòng bạn chi nhiều nhất.

Bộ ngắt chính là bộ phận hỏng một cách âm thầm

A generated two-card graphic titled 'Knowledge cutoffs, five months apart', showing Claude Sonnet 5 with a knowledge cutoff of January 2026 against Claude Opus 5.5 with a cutoff of June 2026, separated by a marker reading '5 months of coverage'. The footer reads 'Cutoff dates per Anthropic's Claude model documentation, current as of September 2026.'

Claude Opus 5.5 có thời điểm ngừng cập nhật kiến thức là tháng 6 năm 2026. Của Claude Sonnet 5 là tháng 1 năm 2026. Đó là khoảng cách năm tháng, và đây là chiều kích duy nhất trong so sánh này không tự lộ diện. Một mô hình không biết về một sự kiện không hề chậm hơn hay kém chính xác hơn với sự kiện đó theo cách mà cơ chế xử lý lỗi của bạn bắt được — nó trả lời một cách tự tin từ một thế giới đã đi tiếp, và lỗi đó trông giống một câu trả lời sai nhưng nghe hợp lý hơn là một sự từ chối.

Với một số khối lượng công việc, điều này không liên quan: tái cấu trúc một cơ sở mã có các quy ước đã ổn định, tóm tắt các tài liệu bạn cung cấp, biến đổi dữ liệu có cấu trúc. Với những khối lượng khác, chỉ riêng điều đó đã đủ để loại bỏ, bất kể hai mươi điểm chỉ số hay mức giá. Bất cứ thứ gì liên quan đến phần mềm được phát hành trong nửa cuối năm 2026, bất cứ thứ gì trả lời các câu hỏi về những sự kiện gần đây, bất cứ thứ gì phụ thuộc vào một API hoặc một phiên bản thư viện đã thay đổi sau tháng Một — những tác vụ đó không thể được nâng cấp lên Opus 5.5, chúng phải bắt đầu từ đó. Năm tháng đó không phải là một khác biệt về chất lượng; chúng là một giới hạn về phạm vi, và điều đó thuộc về quy tắc định tuyến hơn là trong phần đánh giá.

Cả hai mô hình chia sẻ phần còn lại của đường bao, điều này giới hạn mức độ có thể lách qua cutoff. Cả hai đều nhận 1M token ngữ cảnh và trả về tối đa 128K, cả hai đều chạy chế độ tư duy thích ứng không thể tắt, và cả hai chỉ bộc lộ độ sâu thông qua tham số effort. Không có cấu hình nào mà Sonnet 5 được giao một tài liệu dài hơn để bù đắp.

Đang chạy split

Phiên bản thực tế của cuộc so tài này là một mặc định và một ngoại lệ, và ngoại lệ phải được định nghĩa bằng thứ gì đó khác với "nhiệm vụ khó". Mô thức đứng vững là theo nhóm nhiệm vụ chứ không phải theo độ khó: Sonnet 5 cho khối lượng công việc lớn, nơi cutoff của nó không liên quan và đặc tính độ trễ của nó chấp nhận được; Opus 5.5 cho bất cứ thứ gì mang tính thời sự, bất cứ thứ gì dài hạn, hoặc bất cứ thứ gì mà một lần thử thất bại tốn kém hơn phần chênh lệch token.

Đó là một cấu hình định tuyến chứ không phải một bản viết lại, và đó chính là lúc một endpoint duy nhất chứng tỏ được vị trí của mình. Claude Sonnet 5 có mặt trên OrcaRouter với mức giá $2.00 / $10.00 của chính Anthropic, và Claude Opus 5.5 cũng có ở đó với mức $4.00 / $20.00 — giá niêm yết của nhà cung cấp được giữ nguyên với 0% markup, nên tỷ lệ chi phí trong quy tắc leo thang của bạn chính là tỷ lệ chi phí mà Anthropic công bố, không có lớp markup nào làm lệch nó. Cả hai đều nằm sau một khóa duy nhất, nghĩa là đường leo thang chỉ là một chỉnh sửa quy tắc thay vì một tích hợp thứ hai, cơ chế chuyển đổi dự phòng tự động giữ cho endpoint chính đang gặp sự cố không kéo cả yêu cầu xuống theo, và phép so sánh quyết định các ngưỡng của bạn là thứ bạn có thể chạy ngay bên trong lưu lượng của chính mình thay vì phải dựng lại từ hai bảng giá của nhà cung cấp.

A screenshot of OrcaRouter's own model page for anthropic/claude-sonnet-5, headed 'Claude Sonnet 5' and credited to Anthropic, showing $2.00 input and $10.00 output per 1M tokens, a 1M-token context and a PERFORMANCE panel with 79.3 output tokens per second, a 150.02s time to first token and 55M output tokens over 7 days.

Ai nên di chuyển, và ai nên chờ đợi

Nếu bạn đã đang dùng Claude Sonnet 5 và nó vẫn chạy tốt, thì lý lẽ để thay thế nó là yếu: mô hình này chỉ bằng một nửa giá, mức giá đó giờ đã là vĩnh viễn, và khoảng cách chỉ số chỉ đáng kể ở những tác vụ mà nó đang làm sai. Còn lý lẽ để thêm Claude Opus 5.5 lên trên thì mạnh, miễn là bạn gọi tên được tác nhân kích hoạt — và tác nhân kích hoạt thường là một lỗi ở ngưỡng cắt hoặc một tác vụ mà các lần chạy nỗ lực tối đa của Sonnet 5 vẫn làm sai.

Nếu bạn đang chọn mô hình Claude đầu tiên của mình, câu trả lời kém cân bằng hơn vẻ ngoài mà tỷ lệ giá gợi ra. Một khoảng cách chỉ số hai mươi điểm và thêm năm tháng kiến thức để đổi lấy gấp đôi token là một đánh đổi mà hầu hết các workload production sẽ chấp nhận ở một số ít lần gọi và gần như không workload nào chấp nhận ở tất cả các lần gọi. Sai lầm cần tránh dù nghiêng về hướng nào là coi hai mô hình là có thể thay thế cho nhau và chỉ chuyển đổi dựa trên chi phí, bởi vì thất bại kéo theo không phải là một câu trả lời tệ hơn — mà là một câu trả lời đầy tự tin về một thế giới đã kết thúc vào tháng Một.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày