Thẻ tiêu đề hero cho Claude Opus 5.5 với nội dung "mọi điểm số, thiết lập effort mà nó đến từ, và ai đã đo lường nó", kèm hai chip số liệu: 66.4% trên Terminal-Bench 4.0 ở mức effort xhigh, do nhà cung cấp báo cáo, và 59.6% trên cùng benchmark đó, đo lường độc lập.
Guides & Insights

Điểm chuẩn Claude Opus 5.5: Mọi điểm số, thiết lập Effort mà nó đến từ, và ai đã đo lường nó

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Con số tiêu đề của Ant​hropic cho Claude Opus 5.5 trên Terminal-Bench 4.0 là 66,4%, in đối chiếu với 52,3% của Claude Opus 5 trên cùng bảng — và mức 66,4% đó được tạo ra ở xhigh effort, chứ không phải ở mức mặc định của model là medium. Model này ra mắt ngày 22 tháng 9 năm 2026, hai ngày trước khi trang này được viết, nên đây là một model GA với mức giá của model GA và bảng benchmark của model GA. Con số độc lập trên cùng benchmark, từ Artificial Analysis, là 59,6%, trong một cấu hình có tích hợp định tuyến bảo vệ phía server của Ant​hropic bên trong. Giữa hai con số đó là khác biệt về harness, khác biệt về effort và khác biệt về routing, và chưa ai — kể cả chúng tôi — có thể nói mỗi yếu tố đóng góp bao nhiêu vào khoảng cách. Điều trang này có thể làm là đặt mọi con số đã công bố cho Claude Opus 5.5 vào một chỗ, nêu rõ ai tạo ra nó, nêu rõ cấu hình mà nó được tạo ra, và bao gồm cả những dòng mà GPT-6 AstraClaude Fable 5.1 vượt lên trên.

Hãy bắt đầu với cài đặt mức độ nỗ lực, vì nó làm thay đổi các con số nhiều hơn so với các mô hình

Claude Opus 5.5 mặc định dùng medium effort trên Claude API. Claude Opus 5 mặc định dùng high. Cùng một tên mức như vậy cũng không đồng nghĩa với cùng ngân sách tư duy giữa hai mô hình, nên "chúng tôi chạy cả hai ở mức high" không phải là một so sánh có kiểm soát, ngay cả khi nhãn trùng khớp. Tư duy thích ứng luôn được bật và không thể tắt trên Opus 5.5; tham số effort chỉ thay đổi độ sâu, độ trễ và chi phí, chứ không thay đổi gì khác.

Con số Terminal-Bench 4.0 của Anthropic được chạy ở xhigh. Chỉ riêng chi tiết đó là lưu ý quan trọng nhất trên trang này, bởi vì phép đánh giá mà nó đưa lên hàng đầu là phép đánh giá có mức chênh lệch được báo cáo lớn nhất so với mô hình trước đó, và bởi vì cùng bảng đó cho thấy điều gì sẽ xảy ra khi bạn để nguyên cài đặt:

FrontierCode v1.1 Main — 54,4% ở xhigh, 54,6% ở medium mặc định.Do nhà cung cấp báo cáo. Lần chạy medium cao hơn so với lần chạy xhigh. Trên khối lượng công việc này, núm điều chỉnh effort chẳng mang lại điều gì đo lường được; hai con số ấy là cùng một con số.

CursorBench 4.0 — 57.8% ở mức xhigh, 52.5% ở mức medium.Do nhà cung cấp báo cáo. Cùng một model, cùng một harness, cùng một tuần: 5.3 điểm, đây là mức chênh lệch effort lớn nhất trong bảng.

Hai hàng đó nằm trong cùng một bảng của một nhà cung cấp chính là toàn bộ lập luận. Một khối lượng công việc không nhạy cảm với mức độ nỗ lực, còn khối kia thì rất nhạy cảm, và thẻ mô hình không thể nói trước cho bạn biết khối lượng công việc của bạn thuộc loại nào. Kết luận mà dữ liệu ủng hộ thì hẹp và đáng được phát biểu một cách hẹp như vậy: mức độ nỗ lực phù hợp giờ đây là một phép đo cho từng khối lượng công việc, chứ không phải một giá trị mặc định mà bạn thừa hưởng. Nó không ủng hộ cho "Opus 5.5 nhanh hơn mức các bài đánh giá gợi ý" hay "Anthropic đã cố tình hạ thấp giá trị mặc định" — muốn vậy bạn sẽ cần quét từng khối lượng công việc trên cả năm thiết lập, và chưa ai công bố chúng. Điều đó có nghĩa là nếu bạn chuyển từ Opus 5 sang và giữ nguyên thiết lập nỗ lực bạn đã dùng, thì bạn đã thay đổi phép thử nghiệm, chứ không chỉ thay đổi mô hình.

Thêm một điểm bất đối xứng nữa, và lần này nó lại nghiêng theo chiều ngược lại. Cột đối thủ trong hàng Terminal-Bench của Anthropic là GPT-6 Astra với 57.9% — được chạy ở mức high effort, theo ghi chú trên biểu đồ của chính Anthropic, trong khi 66.4% của Opus 5.5 được chạy ở xhigh. Một bảng số liệu của nhà cung cấp mà chạy model của chính mình ở một thiết lập còn đối thủ ở một thiết lập khác thì không phải là so sánh đối đầu trực tiếp, bất kể hai con số trông thế nào khi đặt cạnh nhau.

Bảng nhà cung cấp, với nguồn và cài đặt trên mỗi hàng

Mọi thứ trong phần này đều là do nhà cung cấp tự báo cáo: tài liệu ra mắt của Anthropic, harness của Anthropic, các biện pháp bảo vệ production được bật, adaptive thinking ở mức effort tối đa trừ khi dòng đó ghi khác. Hãy đọc như thể Anthropic đang tự đo lường chính mình.

Terminal-Bench 4.0 — 66,4%, ở mức xhigh effort. Do nhà cung cấp báo cáo, sai số chuẩn khoảng ±2,6 điểm. Trên cùng hàng: Claude Opus 5 52,3%, Claude Fable 5.1 55,8%, GPT-6 Astra 57,9% (ở mức high effort), GPT-5.6 Sol 37,3%. Terminal-Bench 4.0 rõ ràng là một benchmark mà nhà cung cấp thừa nhận chỉ là đại diện không hoàn hảo cho công việc terminal thực tế, và đây là điểm nhấn chính của mô hình.

FrontierCode v1.1 Main — 54,4% ở xhigh, 54,6% ở mức medium mặc định.Do nhà cung cấp báo cáo. Opus 5 48,0%, Fable 5.1 50,3%, GPT-6 Astra 53,3%, GPT-5.6 Sol 47,5%. Thẻ hệ thống của Anthropic cũng ghi nhận biến thể Extended ở mức 63,6% và con số Extended tốt nhất ở mức medium là 65,3%.

CursorBench 4.0 — 57,8% ở xhigh, 52,5% ở medium.Do nhà cung cấp báo cáo. Opus 5 46,6%, Fable 5.1 51,8%, GPT-5.6 Sol 41,7%. Lưu ý rằng các dòng CursorBench của Fable 5.1 và Opus 5 đều ở mức nỗ lực tối đa, nên Opus 5.5 ở mức medium đang được so sánh với chính những người anh em cùng dòng của nó ở mức tối đa.

GDPval-AA v2.1 — 1.846 Elo. Đây là hàng duy nhất trên bảng của nhà cung cấp mà chính nhà cung cấp không tự chạy. GDPval-AA là một phép đánh giá của Artificial Analysis, và bài viết của chính Artificial Analysis về Opus 5.5 cũng nêu con số 1.846, với Fable 5.1 ở mức 1.735 và Opus 5 ở mức 1.708. Trong bảng của nhà cung cấp: Fable 5.1 1.735, Opus 5 1.708, GPT-5.6 Sol 1.588, GPT-6 Astra 1.542. Đây là hàng duy nhất ở đây mà hai tổ chức cùng đồng ý về một con số, và đó là bởi vì đây chính là cùng một phép đo.

AutomationBench (Zapier) — 40,0%.Được nhà cung cấp báo cáo và chạy với không có mô hình dự phòng, vì vậy mọi can thiệp bảo vệ đều bị tính là thất bại. GPT-6 Astra 41,4%, Fable 5.1 31,4%, GPT-5.6 Sol 28,8%, Opus 5 26,9%.

Humanity's Last Exam, có công cụ — 67,7%. Do nhà cung cấp báo cáo. Fable 5.1 65,6%, Opus 5 63,6%, GPT-6 Astra 57,2%. Thẻ hệ thống của Anthropic báo cáo riêng 64,4% khi không dùng công cụ, đây là con số cần dùng nếu bạn đang so sánh với một nguồn không cấp quyền truy cập công cụ cho mô hình của họ.

Terminal-Bench-Science 0.1 — 58,7%.Do nhà cung cấp báo cáo, sai số chuẩn khoảng ±3,5 đến ±5 điểm, nên đây là một khoảng chứ không phải một điểm. GPT-6 Astra 64,6%, Fable 5.1 52,6%, Opus 5 29,0%, GPT-5.6 Sol 22,4%.

OSWorld 2.0 — 81,8% một phần.Do nhà cung cấp báo cáo, và từ "một phần" đang thực sự làm nên chuyện trong câu đó: thẻ hệ thống của Anthropic đưa ra tỷ lệ hoàn thành nghiêm ngặt là 48,7% cho cùng mô hình trên cùng phép đánh giá. Cả hai đều được công bố; con số "một phần" mới là con số được trích dẫn. Fable 5.1 80,7%, Opus 5 74,0%.

Chartography, với công cụ — 89,0%.Do nhà cung cấp báo cáo. Fable 5.1 88,4%, Opus 5 83,4%.

Scoreboard for Claude Opus 5.5 with six rows: Terminal-Bench 4.0 66.4% at xhigh effort (vendor-reported); Artificial Analysis Intelligence Index 58 at max effort (independent); Humanity's Last Exam 67.7% with tools (vendor-reported); Terminal-Bench-Science 0.1 58.7% (vendor-reported); about 119k output tokens per task at max (independent); price $4.00 input / $20.00 output per 1M. A footer separates the Anthropic launch table from Artificial Analysis.

Những con số độc lập, và "Default Fallback" thực sự có nghĩa là gì

Artificial Analysis là bên thứ ba duy nhất có đánh giá đã công bố, hiện hành về Claude Opus 5.5 trên một chỉ số tổng hợp, và các số liệu của họ là những số liệu cần đặt bên cạnh số liệu của Anthropic. Như đọc được vào ngày 24 tháng 9 năm 2026:

Chỉ số Trí tuệ — 58 ở mức nỗ lực tối đa, trong một cấu hình được gắn nhãn "Adaptive Reasoning, Max Effort, Default Fallback". Độc lập, do Artificial Analysis đo lường. Bài viết của chính họ gọi 58 là "điểm số cao nhất mà chúng tôi từng đo được, cao hơn vài điểm." Cùng chỉ số đó cũng công bố Opus 5.5 ở mọi mức nỗ lực khác, và phần hữu ích nằm ở độ trải: 56 ở xhigh, 54 ở high, 51 ở medium, 42 ở low. Đó là mức chênh 16 điểm trên thang nỗ lực chỉ với một mô hình — lớn hơn khoảng cách giữa hầu hết các mô hình trên bảng đó.

Terminal-Bench 4.0 — 59,6%. Độc lập. Artificial Analysis báo cáo rằng nó “ngang bằng với mô hình dẫn đầu GPT-6 Astra (xhigh)” và cao hơn Claude Opus 5 khoảng 11 điểm.

Humanity's Last Exam — 61,4%.Độc lập, và kết quả tốt nhất trước đó trên cùng bảng xếp hạng là 59,1%, do Claude Fable 5.1 nắm giữ.

SciCode — 66.9%.Độc lập, so với 63.1% của Claude Fable 5.1.

Giờ đến phần cần được giải thích thay vì trích dẫn. "Default Fallback" không phải là một sản phẩm phụ của phép đo chuẩn và cũng không phải là một thiết lập của Artificial Analysis — nó là cơ chế định tuyến bảo vệ phía máy chủ của Anthropic, vẫn đang được bật. Claude Opus 5.5 được phát hành kèm tầng bảo vệ vốn trước đây dành riêng cho Fable 5.1: hầu hết các yêu cầu về an ninh mạng đều được chuyển hướng một cách minh bạch sang Claude Opus 4.8, và các công việc sinh học sẽ chuyển sang Claude Opus 5 trừ khi tài khoản đã được xác minh. Khi Artificial Analysis chạy chỉ số này với tính năng dự phòng mặc định được bật, nó đang đo lường hệ thống đã được triển khai — thứ mà một khóa API chưa được xác minh thực sự chạm tới — chứ không phải một checkpoint thuần khiết của trọng số Opus 5.5. Đó là phép đo trung thực hơn đối với người mua, và cũng là phép đo kém thuần khiết hơn đối với một benchmark. Anthropic cũng nói đúng như vậy về bảng của chính mình: các can thiệp trong lần chạy Terminal-Bench 4.0 khiến các tác vụ mạng được Opus 4.8 hoàn thành và các tác vụ sinh học do Opus 5 đảm nhiệm, và công ty tuyên bố rằng những can thiệp đó có khả năng đã làm giảm điểm số được báo cáo. Vậy nên cơ chế định tuyến bảo vệ là một thực tế vận hành có thật theo cả hai chiều, và không có con số nào trên trang này tách biệt được mô hình nền tảng khỏi nó.

Hai bảng khác nhau ở đâu, và tại sao

Đặt hai con số của Terminal-Bench 4.0 cạnh nhau và bạn sẽ có 66,4% so với 59,6% — 6,8 điểm, trên cùng một benchmark, cho cùng một mô hình. Những lý do đều đã được biết, và mỗi lý do đều đủ lớn để tự nó có ý nghĩa:

Các harness khác nhau. Anthropic chạy scaffold agent của riêng mình; Artificial Analysis chạy harness agent tham chiếu của riêng họ. Điểm benchmark terminal là thuộc tính của scaffold cộng với model, chứ không phải chỉ của riêng model, và cả hai tổ chức đều chưa công bố thí nghiệm hoán đổi scaffold.

Cài đặt mức độ nỗ lực khác nhau. Con số 66,4% của Anthropic được đo ở mức xhigh. Cài đặt mức nỗ lực gắn với con số 59,6% của Artificial Analysis không được nêu trong câu chứa con số đó, và các số liệu benchmark được báo cáo của nó nói chung đều ở mức nỗ lực tối đa.

Có bật biện pháp bảo vệ, trong cả hai trường hợp, nhưng được tính theo cách khác nhau. Anthropic chạy với cơ chế dự phòng và coi các can thiệp là làm giảm điểm nhưng vẫn được tính điểm. Trên AutomationBench, nó chạy không có dự phòng và tính các can thiệp là thất bại hoàn toàn. Artificial Analysis chạy với cơ chế dự phòng được bật xuyên suốt.

Các con số vẫn thay đổi ngay cả trong bảng của chính một nhà cung cấp. Anthropic ghi Claude Opus 5 đạt 52,3% trên Terminal-Bench 4.0 và lưu ý rằng con số 51,8% trên bảng công khai dành cho cùng mô hình đó là "nằm trong ngưỡng nhiễu".

Và đây là bằng chứng mạnh nhất trên trang này về việc một harness đáng giá đến mức nào. Bảng xếp hạng Terminal-Bench 4.0 công khai, được chụp lại vào ngày 24 tháng 9 năm 2026, hoàn toàn không có dòng nào cho Claude Opus 5.5. Mục đứng đầu của bảng là GPT-6 Astra ở mức effort tối đa, agent Codex, 58.2% ±2.8; thứ hai là Claude Fable 5.1 ở mức effort tối đa thông qua Claude Code với 57.9% ±3.8; thứ ba là Claude Opus 5 ở mức xhigh thông qua Claude Code với 53.9% ±3.2. Vậy nên 66.4% không chỉ đơn thuần là một con số khác với 59.6% độc lập — nó thậm chí không có trên bảng công khai, và phiên bản Claude Opus 5 của chính bảng đó là 53.9%, chứ không phải 52.3% mà bảng ra mắt in ra. Cho đến khi Terminal-Bench chấp nhận và công bố một bài nộp Opus 5.5, thì 66.4% là kết quả harness của nhà cung cấp mà không ai tái lập được, còn 59.6% là con số mà một bên thứ ba thực sự sẽ đứng ra bảo chứng. Cũng lưu ý rằng trên cùng bảng đó, mục dẫn đầu Terminal-Bench 4.0 của Artificial Analysis và Opus 5.5 của Anthropic cùng nằm ở 59.6% — đó là một thế hòa trong một harness, và chẳng nói lên điều gì về harness còn lại.

Effort-dial infographic for Claude Opus 5.5 showing the Artificial Analysis Intelligence Index moving from 42 at low effort through 51 at medium (the product default), 54 at high, 56 at xhigh and 58 at max - a 16-point swing on one model - with two comparison cards: FrontierCode v1.1 at 54.4 xhigh against 54.6 medium (effort-insensitive) and CursorBench 4.0 at 57.8 xhigh against 52.5 medium (effort-sensitive).

Những hàng mà Opus 5.5 thua

Một bài tổng hợp bỏ qua các thất bại thì không phải là bài tổng hợp, và bảng của chính Anthropic chứa cả hai.

Terminal-Bench-Science 0.1 — 58,7% so với 64,6% của GPT-6 Astra. Do nhà cung cấp tự báo cáo, trên bảng của Anthropic, và là mức thua kém 5,9 điểm trước một đối thủ được nêu đích danh ở hàng gần với suy luận khoa học nhất. Ghi chú về sai số chuẩn của chính nhà cung cấp (±3,5 đến ±5) có nghĩa là khoảng cách này nằm sát ngưỡng nhiễu chứ không thoải mái nằm trong ngưỡng đó — nhưng đây vẫn là một thất bại trên chính trang của nhà cung cấp, và khoảng sai số không biến nó thành chiến thắng. Claude Opus 5 đạt 29,0% ở cùng hàng, nên mức tăng giữa các thế hệ là có thật ngay cả ở nơi đối thủ dẫn trước.

AutomationBench — 40,0% so với 41,4% của GPT-6 Astra.Do nhà cung cấp tự báo cáo, mức chênh 1,4 điểm, và lần chạy này không có mô hình dự phòng, nên các can thiệp bảo vệ đều bị tính là thất bại. Điều đó nghĩa là phép so sánh cụ thể này đo Opus 5.5 với cả phần phạt định tuyến của nó, đối chiếu với một đối thủ mà phần phạt định tuyến của họ — dù là bao nhiêu — không hề được mô tả. Đây là dòng khó diễn giải nhất trên trang, theo cả hai hướng.

Thêm hai chỗ nữa mà lợi thế dẫn đầu mỏng hơn tiêu đề gợi ý, cả hai đều do nhà cung cấp báo cáo. Trên Humanity's Last Exam với công cụ biên độ so với Claude Fable 5.1 là 2,1 điểm (67,7% so với 65,6%); trên Chartography với công cụ là 0,6 điểm (89,0% so với 88,4%); trên OSWorld 2.0 (một phần) là 1,1 điểm (81,8% so với 80,7%). Đó là những dòng mà "Opus 5.5 là mô hình agentic tốt nhất" là một tuyên bố về thứ hạng chứ không phải về một khoảng cách được đo lường, và một khác biệt 0,6 điểm về đọc biểu đồ không nên quyết định một thương vụ mua sắm.

Vị thế độc lập của Claude Fable 5.1, trên một bản sửa đổi chỉ số khác

Việc đặt Opus 5.5 lên so sánh với chính người anh em cùng nhà của nó cần có một mục riêng, và cần kèm theo một lời cảnh báo, vì việc so sánh khó hơn vẻ ngoài.

Khi Artificial Analysis công bố bài viết về Claude Fable 5.1 vào ngày 1 tháng 9 năm 2026, mô hình này đạt 66 ở mức nỗ lực tối đa trên Chỉ số Thông minh của mình và được gọi là điểm số cao nhất mà họ từng đo được — vượt qua Claude Opus 5 với 63 và GPT-5.6 Sol với 61. Trên chỉ số như được liệt kê vào ngày 24 tháng 9 năm 2026, cùng mô hình đó xuất hiện ở mức 53 ở mức nỗ lực tối đa với fallback, và Opus 5.5 xuất hiện ở mức 58 trong cấu hình tương đương. Bài viết ngày 22 tháng 9 về Opus 5.5 gọi 58 là "điểm số cao nhất mà chúng tôi từng đo được, cao hơn vài điểm."

Hai phát biểu đó không thể cùng đúng trên một thang đo, và lời giải là chúng không nằm trên cùng một thang đo. Chỉ số này là một thực thể sống mà Artificial Analysis vẫn sửa đổi; hai bài viết đã công bố của họ, cách nhau năm tuần, lại đặt cùng một cặp mô hình anh em vào hai phía đối lập của vị trí dẫn đầu. Đó là một phát biểu về các lần sửa đổi chỉ số, chứ không phải về việc mô hình nào đang đi lùi, và điều đó có nghĩa là con số 66 và con số 58 tuyệt đối không bao giờ được in cạnh nhau. Đọc trong cùng một ngày, cùng một bảng xếp hạng, cùng một cấu hình được dán nhãn, thứ tự hiện tại đặt Opus 5.5 dẫn trước Fable 5.1 năm điểm — và ngay cả đó cũng chỉ là so sánh trong cùng một chỉ số, cùng một đơn vị cung cấp chỉ số, chứ không phải một cuộc đối đầu đã được kiểm toán. Điều an toàn để nói thì hẹp hơn: trên bản sửa đổi hiện tại của chỉ số tổng hợp độc lập duy nhất đo lường cả hai, Opus 5.5 là mô hình mạnh hơn trong hai mô hình Anthropic, còn con số 66 nổi tiếng hơn của Fable 5.1 thuộc về một bản sửa đổi trước đó của chỉ số ấy.

Các thiết lập đáng để nói thêm một câu vì chúng dễ bị gộp lẫn với nhau. Con số 66 của Fable 5.1 và 58 của Opus 5.5 đều là những dòng ở mức nỗ lực tối đa — nhưng năm thiết lập nỗ lực của Fable 5.1 trải trên phạm vi gấp 11 lần về lượng token đầu ra, từ 13,1M ở mức thấp đến 143,7M ở mức tối đa, với điểm chỉ số từ 58 đến 66. Một điểm chỉ số duy nhất cho một mô hình có mức phân tán nội bộ lớn đến vậy là sự thay thế kém cỏi cho dòng mà bạn thực sự sẽ chạy.

Chi phí token là một trục đánh giá riêng

Mỗi con số ở trên đều là một điểm số. Không con số nào trong đó là một dự luật, và trong mô hình này, dự luật mới là nơi có diễn biến đáng chú ý.

Artificial Analysis đo Claude Opus 5.5 ở mức nỗ lực tối đa với khoảng 119.000 token đầu ra cho mỗi tác vụ trên Chỉ số Thông minh — cao nhất trong chỉ số của nó. Để so sánh, trên cùng bảng xếp hạng với cùng thiết lập: Claude Opus 5 khoảng 73.000, Claude Fable 5.1 khoảng 78.000, và GPT-6 Astra khoảng 27.000. Token suy nghĩ được tính như token đầu ra, và không thể tắt suy nghĩ thích ứng trên Opus 5.5, nên lượng token mà một mô hình dành để cân nhắc không phải là một chú thích nhỏ trong giá của nó — chúng chiếm phần lớn giá đó.

Hãy làm phép tính, vì giá niêm yết tự nó gây hiểu nhầm. Opus 5.5 niêm yết ở mức $4.00 cho đầu vào / $20.00 cho đầu ra, mức giảm 20% so với $5.00 / $25.00 của Opus 5. Artificial Analysis vẫn đo Opus 5.5 ở mức nỗ lực tối đa tốn khoảng $5.98 mỗi tác vụ chỉ số so với $5.86 đối với Opus 5 ở cùng thiết lập — hơi nhiều hơn, chứ không ít hơn, vì lượng token đầu ra gấp khoảng 1.6 lần ăn hết toàn bộ mức giảm 20% và còn hơn thế. Trên toàn bộ chỉ số, Opus 5.5 tạo ra 260M token đầu ra so với trung vị của bảng là 88M, mà người đánh giá gọi là "rất dài dòng."

Do đó, câu chuyện chi phí nằm hoàn toàn ở cài đặt effort, và nó chỉ phát huy tác dụng nếu bạn thực sự dùng đến. Ở mức effort tối đa, Opus 5.5 là một mô hình đắt hơn trên mỗi tác vụ hoàn thành so với mô hình mà nó thay thế. Ở mức trung bình — mặc định thực tế của sản phẩm, và cũng là phạm vi mà tuyên bố "chi phí vận hành thấp hơn khoảng 40% trên các khối lượng công việc điển hình" của Anthropic nhắm tới — khoản tiết kiệm là có thật, nhưng đó là phát biểu về mức trung bình trên các khối lượng công việc do nhà cung cấp tự chọn, chứ không phải kết quả được kiểm toán theo từng tác vụ. Cách hiểu thực tế: mức giảm giá 20% là chiết khấu trên bảng giá và là một lựa chọn trên núm điều chỉnh effort, không phải khoản tiết kiệm tự động. Nếu kế hoạch di trú của bạn là "đổi model id và giữ nguyên cài đặt", thì bạn đang mua phiên bản đắt tiền.

Điều gì hoàn toàn không được thiết lập?

Đây là phần mà phần còn lại của trang tồn tại để hỗ trợ.

Chưa từng có bất kỳ so sánh đối đầu trực diện nào với cùng mức nỗ lực và cùng khung thử nghiệm giữa Claude Opus 5.5 và bất kỳ đối thủ có tên tuổi nào được công bố.Mọi so sánh giữa các nhà cung cấp khác nhau trên trang này — Opus 5.5 so với GPT-6 Astra, so với GPT-5.6 Sol, so với Claude Fable 5.1 — đều là so sánh giữa hai bảng số liệu do hai công ty khác nhau tạo ra, trên hai khung thử nghiệm khác nhau, ở hai thiết lập mức nỗ lực khác nhau, trong đó một bảng thường là mô hình của chính nhà cung cấp ở một thiết lập có lợi. Không có thí nghiệm nào trong hồ sơ công khai giữ cố định cả scaffold lẫn mức nỗ lực giữa hai nhà cung cấp và báo cáo cả hai.

Việc phân tách token theo từng bài toán không được công bố. Số liệu tổng hợp về token đầu ra được đo độc lập, nhưng không ai mà chúng tôi có thể tìm thấy công bố có bao nhiêu trong đó là phần suy nghĩ so với phần trả lời. Bất kỳ trang nào cho bạn một con số chính xác về token suy nghĩ cho mô hình này đều đang đưa cho bạn một con số mà không ai đo được.

Phần lớn thẻ hệ thống chưa được các bên thứ ba đánh giá bằng benchmark. SWE-bench Pro 89,9%, Multilingual 93,9%, DeepSWE v1.1 74,2%, ProgramBench 91,2%, OfficeQA 78,9%, HealthBench Professional 65,6% đã điều chỉnh theo độ dài, GMMLU 94,3%, ArXivMath 96,9% khi dùng công cụ — tất cả đều do nhà cung cấp báo cáo, không có kết quả nào được tái lập độc lập tại thời điểm viết.

Con số nổi bật của Terminal-Bench 4.0 không có trên bảng công khai.Đã đề cập ở trên, và nó cũng thuộc danh sách này: con số được trích dẫn nhiều nhất về mô hình này là con số mà không một ai bên ngoài nhà cung cấp từng chạy thử.

Anthropic báo cáo rằng Claude Opus 5.5 "thường nghi ngờ rằng nó đang bị đánh giá" — chính lời của công ty, được nêu ra như một hạn chế trong đánh giá an toàn của mình. Hãy coi đó là một vấn đề đo lường nghiêm túc chứ không phải một điều tò mò: nếu mô hình hành xử khác đi khi nó tin rằng mình đang bị kiểm tra, thì mọi con số benchmark trên trang này, dù của nhà cung cấp hay của bên độc lập, đều là phép đo mô hình trong trạng thái bị quan sát, và mức độ khác biệt so với hành vi khi đã triển khai thực tế là chưa biết và chưa được định lượng. Điều đó áp dụng như nhau cho cả những dòng tốt lẫn những dòng xấu. Đó là lưu ý duy nhất mà dù áp dụng bao nhiêu phương pháp luận nỗ lực tương đương cũng không thể khắc phục.

Sonnet 5.5 và Haiku 5.5 chưa có sẵn. Anthropic đã công bố chúng cho "những tuần sắp tới". Chúng chưa được phát hành, chưa có điểm chuẩn nào được công bố, và không có nội dung nào trên trang này áp dụng được cho chúng.

Giá, phong bì và những phần của đặc tả làm thay đổi mã của bạn

Đọc từ bảng giá niêm yết của Anthropic ngày 24 tháng 9 năm 2026: 4,00 đô la cho mỗi triệu token đầu vào, 20,00 đô la cho mỗi triệu token đầu ra, 0,20 đô la cho mỗi triệu lượt đọc cache, 5,00 đô la cho mỗi triệu lượt ghi cache 5 phút, 8,00 đô la cho mỗi triệu lượt ghi cache 1 giờ, và giảm 50% cho cả hai chiều trên Batch API. Mức giá đọc cache là mức lặng lẽ — nó chỉ bằng 5% giá đầu vào cơ bản, trong khi hầu hết các mô hình Claude nằm ở mức 10% và Fable 5.1 ở mức 2,5%. Chế độ nhanh được định giá riêng ở mức 8,00 / 40,00 đô la và Anthropic mô tả nó là bản xem trước dành cho nghiên cứu, chứ không phải một hạng phổ thông.

Đây là phần mà bảng giá không còn là chuyện vặt nữa mà trở thành phép tính mà một router có thể làm thay bạn. Claude Opus 5.5 được cung cấp dưới dạng anthropic/claude-opus-5.5 trên OrcaRouter với cùng mức $4.00 / $20.00, với giá niêm yết được truyền nguyên ở mức markup 0% — nghĩa là ngay khi Anthropic thay đổi một mức giá, đó chính là mức giá ở đây, trong cùng ngày và không có độ trễ định giá lại nào để phải mô hình hóa. Những yếu tố quyết định hóa đơn thực tế là những thứ mà danh mục mang theo bên cạnh giá: mức đọc cache $0.20 bằng 5% giá đầu vào cơ bản, so với 2.5% của Fable 5.1, cửa sổ ngữ cảnh 1M token, và giới hạn đầu ra 128K. Bởi vì tham số effort chính là nơi chi phí của mô hình này thực sự biến động — mức dao động chỉ số 16 điểm và khoảng 119,000 token đầu ra mỗi tác vụ ở mức tối đa, so với khoảng 73,000 đối với Opus 5 — nên cuộc di chuyển tiết kiệm chi phí là cuộc di chuyển cho phép bạn điều chỉnh effort theo từng khối lượng công việc thay vì theo từng tài khoản, và đặt tuyến Opus 5.5 phía sau cơ chế failover tự động trong khi bạn đo lường xem lưu lượng của mình muốn cài đặt nào.

Envelope — ngữ cảnh 1M token, đầu ra tối đa 128K, đầu ra 300K trên Batch API khi bật output-300k-2026-03-24 header beta, thời điểm cắt kiến thức là tháng 6 năm 2026, ngừng hỗ trợ không sớm hơn ngày 22 tháng 9 năm 2027. Tốc độ đầu ra nhanh hơn hơn 30% so với Claude Opus 5.

Thay đổi phá vỡ tương thích so với Opus 5 — không thể tắt chế độ suy nghĩ nữa; việc buộc dùng công cụ (một tool_choice chỉ định một công cụ cụ thể) sẽ trả về lỗi; các khối thinking bị ràng buộc với model và cuộc hội thoại đã tạo ra chúng; công cụ computer-use computer_20251124 cũ hơn không được chấp nhận trên Claude API hoặc Google Cloud. Ba điểm đầu tiên cũng áp dụng cho Fable 5.1. Còn một điểm thứ năm âm thầm: văn bản nằm giữa các lần gọi công cụ giờ đây đến bên trong các khối thinking mà phần văn bản của chúng trống ở thiết lập hiển thị mặc định, nên một giao diện truyền phát văn bản đó làm chỉ báo tiến trình sẽ im lặng mà không có bất kỳ lỗi nào.

Định tuyến bảo vệ, một lần nữa, vì đây là một mục đặc tả chứ không phải chú thích cuối trang — hầu hết các yêu cầu an ninh mạng đều được chuyển đến Claude Opus 4.8 và công việc sinh học sẽ chuyển sang phương án dự phòng là Claude Opus 5 trừ khi tài khoản được xác minh. Trong những đánh giá đó, câu trả lời bạn nhận được có thể hoàn toàn không đến từ Opus 5.5, vì vậy điểm số được công bố trên các chuẩn đánh giá liên quan đến an ninh mạng và sinh học không phải là các phép đo sạch cho mô hình này.

Các tuyên bố về hiệu quả, tất cả đều do nhà cung cấp báo cáo — chi phí vận hành thấp hơn khoảng 40% trên các khối lượng công việc điển hình so với mức giảm giá niêm yết 20%; một ví dụ phân tích sáp nhập đã được thực hiện mất 63 phút trên Opus 5.5 so với 93 phút trên Opus 5 với chi phí thấp hơn 50%; và các tuyên bố từ khách hàng gồm Box (một phần ba số token, câu trả lời ngắn gọn hơn khoảng 40%), Kiro (khoảng một nửa số token, ít hơn 40% số lần gọi), Factory (ít hơn 20–25% token đầu ra), và GitHub (thuộc nhóm ít token và ít bước nhất mà họ từng đo lường). Đây là các con số trung bình trên những khối lượng công việc mà nhà cung cấp và các đối tác ra mắt của họ đã lựa chọn. Chúng là những lời quy kết, không phải kết quả đã được kiểm toán, và chúng đang mâu thuẫn rõ ràng với con số chi phí độc lập theo từng tác vụ ở trên — vốn cũng là một phép đo ở mức nỗ lực tối đa chứ không phải ở mức mặc định. Cả hai đều có thể đúng; không có con số nào là tuyên bố chung về khối lượng công việc của bạn.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the NEW, FLAGSHIP and FEATURED badges, a 1M-token context window, 128K max output, text plus image plus file input, and the $4.00 input / $20.00 output per 1M token rate with pricing passed through from Anthropic.

Tình trạng của bằng chứng

Claude Opus 5.5 là một mô hình có thật với một đợt giảm giá có thật, một phạm vi có thật gồm 1M token ngữ cảnh và 128K đầu ra, cùng một thay đổi có thật và có tính hệ trọng trong cách cấu hình suy nghĩ và nỗ lực. Nó cũng đi kèm với một bảng benchmark chủ yếu đo lường Anthropic, một bảng độc lập chủ yếu đo lường một triển khai được định tuyến thay vì một checkpoint, và một vấn đề tự nhận thức đã được ghi nhận làm suy yếu cả hai. Chưa có cuộc so sánh đối đầu trực tiếp độc lập, cùng mức nỗ lực và cùng harness, giữa Claude Opus 5.5 với một đối thủ được nêu tên nào được công bố. Cho đến khi có một cuộc như vậy, hãy đọc mọi so sánh giữa các nhà cung cấp trên trang này đúng như bản chất của nó: hai bảng của nhà cung cấp từ hai công ty ở hai thiết lập, được chúng tôi đặt cạnh nhau — và hãy đo lại thiết lập nỗ lực của chính bạn trước khi đo lại mô hình.

So sánh trong bài viết này4

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày