
Claude Opus 5.5 đứng đầu Coding Agent Index với 66 điểm — và hóa đơn tác vụ tăng 21%
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 180 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Nhà cung cấp đã cắt Claude Opus 5.5 giá token 20% vào ngày 22 tháng 9 năm 2026. Hai ngày sau, Artificial Analysis đã công bố phép đo coding-agent cho thấy việc cắt giảm đó đã tác động thế nào đến hóa đơn của một agent: chi phí mỗi tác vụ đã tăng 21%, lên $13.04, từ mức $10.79 mà cùng chỉ số đó tính cho Claude Opus 5. Điểm số cũng tăng — 66 trên Coding Agent Index, chỉ số mà Artificial Analysis mô tả là mức cao nhất họ từng đo được, cao hơn Claude Opus 5 sáu điểm và cao hơn bốn điểm so với Claude Fable 5.1 trong cùng cấu hình. Cả hai điều đó đều đúng cùng một lúc, và lý do chúng đúng cùng một lúc chính là toàn bộ câu chuyện của bảng xếp hạng này. Một token rẻ hơn mà mô hình tiêu thụ nhiều hơn không phải là một tác vụ rẻ hơn, và ở mức nỗ lực suy luận tối đa trong các lượt chạy agent dài, Claude Opus 5.5 tiêu thụ chúng nhiều hơn hẳn.
Coding Agent Index thực sự chấm điểm những gì
Đây không phải là một bảng xếp hạng mô hình. Mỗi hàng trên đó là một cặp harness-và-mô hình — một checkpoint chạy bên trong một coding agent cụ thể, ở một thiết lập nỗ lực cụ thể. Hàng mà ai cũng đang trích dẫn là Claude Opus 5.5 ở thiết lập nỗ lực max bên trong Claude Code, đây chính là harness mà Anthropic xây dựng và tinh chỉnh nhắm theo. Con số 60 của Claude Opus 5 và 62 của Claude Fable 5.1 đến từ cùng một harness và cùng một thiết lập nỗ lực, và đó là điều khiến chúng trở thành những so sánh trung thực; một hàng dành cho một trong hai mô hình trong một coding agent khác là một phép đo khác và không được in ra ở đây như thể nó là cùng một phép đo.
Chỉ số này có phiên bản, và phiên bản quan trọng hơn tên thương hiệu ghi trên đó. Bảng xếp hạng hiện được công bố với v1.5 lấy trung bình của ba đánh giá, mỗi đánh giá có trọng số ngang nhau, mỗi đánh giá được báo cáo dưới dạng pass@1 lấy trung bình trên ba lần thử cho mỗi tác vụ:
• Terminal-Bench 4.0 — công việc shell và dòng lệnh mang tính tác tử: điều hướng hệ thống tệp, sử dụng công cụ đúng cách, phục hồi sau lỗi trung gian và hoàn thành một quy trình nhiều bước.
• DeepSWE v1.1 — các tác vụ kỹ thuật phần mềm, công việc chỉnh sửa kho lưu trữ.
• SWE-Atlas-QnA — các câu hỏi về thấu hiểu kho lưu trữ, trong đó câu trả lời được tìm thấy bằng cách đọc cơ sở mã thay vì thay đổi nó.
Ba đánh giá, một con số, và một cột chi phí trên mỗi tác vụ được in ngay bên cạnh nó. Cột chi phí đó là lý do chỉ số này hữu ích hơn một điểm số đơn thuần, và cũng là lý do con số tiêu đề khó đọc hơn vẻ ngoài của nó.

Ba thành phần, và sáu điểm đến từ đâu
Artificial Analysis đã công bố các hàng thành phần cùng với chỉ số tổng hợp, và chúng không thay đổi đồng đều:
• Terminal-Bench 4.0 — 63,1% cho Claude Opus 5.5 so với 54,5% cho Claude Opus 5, mức tăng 8,6 điểm. Đây là mức cải thiện đơn lẻ lớn nhất trong bộ này.
• DeepSWE v1.1 — 68.4% so với 62.5%, tăng 5.9 điểm.
• SWE-Atlas-QnA — 66,4% so với 62,1%, tăng 4,3 điểm.
Lấy trung bình ba chỉ số đó, bạn được 66.0, chính là điểm tổng hợp. Hình dạng của mức tăng mới là phần thú vị: mô hình cải thiện ít nhất ở việc đọc một codebase và nhiều nhất ở việc điều khiển shell. Terminal-Bench là bài đánh giá gần nhất với ý mà người ta thực sự muốn nói khi nhắc đến "coding agent" — một vòng lặp chạy dài, trong đó mô hình chọn lệnh, đọc đầu ra và quyết định làm gì tiếp theo, không có con người can thiệp giữa các bước. Mức tăng 8.6 điểm ở đó là một minh chứng cho việc sử dụng công cụ liên tục, chứ không phải cho việc tạo mã.
Hãy lưu ý điều đó ngụ ý gì về việc nên kỳ vọng sự cải thiện ở đâu. Nếu khối lượng công việc của bạn là “giải thích kho lưu trữ này”, thì Claude Opus 5.5 là một nâng cấp khiêm tốn so với Claude Opus 5 — bốn điểm. Nếu khối lượng công việc của bạn là “chạy cho đến khi bộ kiểm thử vượt qua, sửa những gì bị hỏng”, thì đó là bước nhảy lớn nhất trong bảng.

Con số được in bên cạnh thứ hạng: $13.04 cho mỗi tác vụ
Đây là phép tính khiến việc giảm giá trông khác với cách nó được công bố. Giá niêm yết của Anthropic cho Claude Opus 5.5 là $4.00 cho mỗi triệu token đầu vào và $20.00 cho mỗi triệu token đầu ra, giảm từ $5.00 và $25.00 đối với Claude Opus 5, với lượt đọc cache giảm 60% xuống còn $0.20 cho mỗi triệu. Mỗi dòng trong số đó đều rẻ hơn. Ước tính của Artificial Analysis về chi phí của một tác vụ ở mức nỗ lực tối đa thì vẫn cao hơn:
• Chi phí mỗi tác vụ — $13,04 cho Claude Opus 5.5 so với $10,79 cho Claude Opus 5, tăng 21% trên cùng một chỉ số, cùng harness, cùng thiết lập effort.
• Tổng số token cho mỗi tác vụ — khoảng 15.6M so với 11.4M, tăng khoảng 37%.
• Số token đầu ra cho mỗi tác vụ — khoảng 333.000 so với 137.000, hơn gấp đôi. Đầu ra là hướng tốn kém, và đây là dòng thay đổi nhiều nhất.
• Đầu vào đã cache trên mỗi tác vụ — khoảng 14,6M so với 10,9M, tăng khoảng 34%. Việc cắt giảm 60% lượt đọc cache thực sự phát huy tác dụng ở đây; chỉ là nó không đủ để bù đắp cho một tác vụ đọc nhiều hơn một phần ba lượng ngữ cảnh.
Cộng lại theo các mức giá đã công bố và bức tranh tổng thể sẽ tự hiện ra. Chỉ tính riêng token đầu ra: 333.000 token với $20,00 mỗi triệu thì rơi vào khoảng $6,66 — gần một nửa trong toàn bộ ước tính $13,04, chỉ đến từ một mục đơn lẻ đã tăng gấp đôi. Dòng đọc cache có khối lượng khổng lồ nhưng giá gần như miễn phí: 14,6 triệu token với $0,20 mỗi triệu là chưa tới $3. Mức cắt 20% là thật và mức cắt cho cache cũng là thật; nhưng khi chạy ở mức nỗ lực tối đa trong một vòng lặp agent, chúng đơn giản là bị lấn át bởi một mô hình suy nghĩ lâu hơn và viết nhiều hơn.
Điều đó có hệ quả trực tiếp đối với cách bạn lập ngân sách. Nếu nhóm của bạn chạy 500 tác vụ coding-agent mỗi ngày ở mức nỗ lực tối đa, thì chênh lệch giữa $10,79 và $13,04 là khoảng $1.125 một ngày — khoảng $34.000 một tháng — cho cùng số lượng tác vụ. Đó là con số cần đặt trước mặt người phê duyệt thay đổi mô hình, và đó không phải là con số mà việc giảm giá ngụ ý.
Tại sao $5.98 và $13.04 đều đúng
Artificial Analysis đã công bố một con số khác về chi phí trên mỗi tác vụ cho cùng mô hình vài ngày trước đó, và khi đọc hai thứ cùng nhau mà không có nhãn, chúng trông như một mâu thuẫn. Chúng không phải vậy — chúng là hai đánh giá khác nhau, và sự khác biệt này rất đáng suy ngẫm.
Trên Intelligence Index, bài viết ngày 22 tháng 9 đưa ra chi phí mỗi tác vụ của Claude Opus 5.5 ở mức $5.98, gần ngang bằng với $5.86 của Claude Opus 5, bất chấp khoảng 119.000 token đầu ra mỗi tác vụ so với 73.000 của Opus 5. Ở đó, việc giảm giá và lượng token tăng thêm gần như triệt tiêu nhau hoàn toàn. Trên Coding Agent Index, ở mức nỗ lực tối đa, trong Claude Code, cùng mô hình đó tốn $13.04 so với $10.79.
Cả hai đều là những phép đo trung thực cho các khối lượng công việc khác nhau. Một bài đánh giá hỏi đáp chỉ là một lượt trao đổi ngắn; một tác vụ agent là một vòng lặp dài gồm các lệnh gọi công cụ với ngữ cảnh ngày càng lớn, và sự tăng trưởng đó tích lũy theo hướng đầu ra, nơi giá cao nhất. Bài học thực tiễn là câu hỏi "việc giảm giá có bù đắp được lượng token tăng thêm không?" không có một câu trả lời duy nhất — nó phụ thuộc vào độ dài tác vụ, và tác vụ càng dài, càng mang tính agent thì mức bù đắp càng kém. Nếu bạn lập ngân sách dựa trên một benchmark trả lời ngắn, bạn sẽ đánh giá thấp hóa đơn của một agent.
Ba lưu ý thuộc về hàng đó
Con số 66 là con số của Claude Code, không phải con số của một mô hình thuần. Chỉ số này cố ý ghép từng mô hình với từng khung đánh giá, với lập luận rằng việc định tuyến công cụ, logic thử lại và quản lý ngữ cảnh không thể tách rời khỏi hiệu năng đo lường được của một tác nhân. Điều đó có lợi cho Anthropic trong trường hợp này, bởi khung đánh giá mà nó được chấm điểm chính là khung của hãng. Artificial Analysis đánh dấu một chế độ xem so sánh khung đánh giá là sắp ra mắt; chừng nào nó còn chưa tồn tại, không ai có thể nói bao nhiêu trong mức dẫn trước sáu điểm là nhờ checkpoint và bao nhiêu là nhờ lớp giàn giáo bao quanh nó.
Con số Terminal-Bench 4.0 của chính Anthropic cao hơn thành phần này, và do Anthropic thực hiện. Tài liệu ra mắt báo cáo 66,4% ở xhigh mức effort; thành phần Coding Agent Index là 63,1% ở mức max, và lần chạy độc lập riêng của Artificial Analysis đo được 59,6% trong harness của riêng họ trên cùng phiên bản benchmark. Ba con số, ba cấu hình, ba đơn vị thực hiện. Con số 63,1% ở hàng trên là thành phần của chính chỉ số này và chỉ nên được so sánh với các con số khác trên chỉ số đó; con số 66,4% của nhà cung cấp là do nhà cung cấp báo cáo, chưa được bên thứ ba tái lập, và thuộc về một mức effort khác.
Bản sửa đổi chỉ số đã thay đổi. Blog này đã đưa tin về những hàng Coding Agent Index khác nhau vào đầu tháng 9, trên một phiên bản trước đó của cùng bảng xếp hạng, và những con số cũ hơn đó không thể so sánh với v1.5 — bộ đánh giá đã thay đổi khi Terminal-Bench 4.0 thay thế phiên bản trước đó. Các bản sao của bên thứ ba vẫn mang những ảnh chụp nhanh cũ với nhãn phiên bản cũ hơn. Nếu một con số cho Claude Opus 5.5 trên chỉ số này không đến từ hàng v1.5 hiện tại, đừng đặt nó cạnh một con số v1.5, và đừng tính mức chênh lệch giữa hai con số đó.

Thực sự cần triển khai những gì
Xếp hạng này là một con số ở mức nỗ lực tối đa, và nỗ lực tối đa là thiết lập mà gần như không ai nên đặt làm mặc định khi phát hành. Claude Opus 5.5 có năm mức thiết lập nỗ lực — thấp, trung bình, cao, xhigh và tối đa — và mô hình mặc định ở mức trung bình. Artificial Analysis chưa công bố các hàng trong Coding Agent Index ở những thiết lập thấp hơn, nên khoản tiết kiệm chi phí ở đó chưa được định lượng trên chỉ số này; trên Intelligence Index, cùng mô hình đó ở mức trung bình đạt 51 — ngang bằng mức tối đa của Claude Opus 5 — với chi phí $1.34 mỗi tác vụ. Đó chính là hướng mà khoản tiết kiệm nằm ở đó, và nó là một thiết lập, chứ không phải một mô hình khác.
Mô hình thực tế là một sự chia đôi: giữ mức effort tối đa cho những vòng lặp tự trị dài, nơi mức tăng 8,6 điểm trên Terminal-Bench chính là thứ bạn đang mua, và chạy công việc thường nhật ở mức effort thấp hơn, nơi mô hình vẫn còn vượt xa vị trí mà Claude Opus 5 dừng lại. Vì effort là một tham số của request chứ không phải một deployment, sự chia đôi đó chỉ là một quy tắc định tuyến, và cả hai mô hình nằm trên cùng một danh mục — của Anthropicgiá niêm yết được truyền qua với mức markup 0%, nên khi nhà cung cấp giảm giá thì mức giá mới có hiệu lực trên anthropic/claude-opus-5.5 ngay trong ngày công bố, và không cần thêm hợp đồng thứ hai hay thay đổi mã nguồn nào để A/B hai mô hình này trên chính các tác vụ của bạn. Riêng với nhánh max-effort, nơi một tác vụ đơn lẻ có thể là một lần chạy dài không người giám sát, failover tự động chính là thứ giúp một nhà cung cấp bị treo không làm bạn mất toàn bộ vòng lặp.
Điều gì vẫn chưa được đo lường
Ba điều sẽ thay đổi bức tranh này và chưa có điều nào trong số đó tồn tại. Không có so sánh Claude Opus 5.5 với một checkpoint đối thủ theo kiểu khớp mức nỗ lực, khớp harness — mọi so sánh giữa các nhà cung cấp hiện có đều chỉ là hai bảng của nhà cung cấp được đặt cạnh nhau. Không có lần chạy Coding Agent Index nào được công bố ở mức nỗ lực trung bình hoặc cao, vốn là nơi phần lớn lưu lượng production sẽ nằm. Và câu hỏi quy kết đóng góp cho harness — bao nhiêu phần trong điểm 66 là do mô hình và bao nhiêu là do Claude Code — đã được chỉ số này thừa nhận và tạm hoãn.
Điều bạn có thể hành động ngay hôm nay hẹp hơn và hữu ích hơn một bảng xếp hạng. Claude Opus 5.5 thực sự giỏi hơn Claude Opus 5 ở công việc agent chạy bằng shell liên tục — đó là thành phần duy nhất có mức cải thiện lớn, nhất quán và được tạo ra một cách độc lập. Nó cũng tốn nhiều hơn mỗi tác vụ ở cấu hình nơi mức cải thiện đó được đo, khoảng 2,25 đô la một tác vụ, và mức giảm giá trên mỗi token không bù đắp được con số đó. Hãy triển khai nó ở mức nỗ lực tối đa khi vòng lặp dài và chi phí thất bại cao; giữ cấu hình rẻ hơn ở mọi nơi khác; và kiểm tra lại chỉ số khi các dòng mức nỗ lực thấp hơn xuất hiện, vì đó là cấu hình mà hầu hết các nhóm sẽ thực sự phải trả tiền. Nếu bạn chuyển đổi chỉ vì việc giảm giá, bạn đang mua sai thứ — mô hình rẻ hơn trên mỗi token và đắt hơn trên mỗi tác vụ, và chỉ một trong hai con số đó xuất hiện trên hóa đơn của bạn.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
