Thẻ tiêu đề cho hướng dẫn API Claude Opus 5.5, ghi 'Model ID, bốn thay đổi phá vỡ, và cái thứ năm im lặng', với dải thông số hiển thị ID mô hình claude-opus-5-5, cửa sổ ngữ cảnh 1M, đầu ra 128K, và $4 / $20 mỗi 1M token.
Engineering & Research

Hướng dẫn API Claude Opus 5.5: ID mô hình, Bốn thay đổi phá vỡ tương thích, và Điều thứ năm âm thầm

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Thay đổi chuỗi model từ claude-opus-5 thành claude-opus-5-5 và code của bạn vẫn biên dịch được, vẫn type-check được, và vẫn vượt qua bất cứ thứ gì được coi là một bộ test. Rồi nó trả về lỗi 400 trên production. Bốn dạng request mà Claude Opus 5 chấp nhận đều bị từ chối thẳng thừng bởi Claude Opus 5.5, và thay đổi thứ năm chẳng phá vỡ gì cả — đó chính xác là lý do nó sẽ là thứ tiếp cận được người dùng của bạn. Đây là tài liệu tham chiếu tích hợp cho model: định danh, các bề mặt phục vụ nó, hợp đồng request, bốn lỗi, cái thứ năm im lặng, và cách tham số effort giờ đây hoạt động. Ở những chỗ hành vi khớp với Claude Fable 5.1, một team đã migrate sang đó đã hoàn thành một phần công việc, nên mỗi thay đổi bên dưới đều nói rõ liệu nó có áp dụng cho model đó không.

Mọi nội dung ở đây đều được đọc từ tài liệu Claude của chính Anthropic vào ngày 24-09-2026, hai ngày sau khi mô hình được phát hành. Các tuyên bố của nhà cung cấp được dán nhãn là tuyên bố của nhà cung cấp, các con số độc lập là độc lập, và hai loại này không bao giờ được trình bày ở cùng một thiết lập mức độ nỗ lực như thể chúng có thể so sánh được với nhau.

ID mô hình, và nơi nó được phục vụ

Định danh là claude-opus-5-5 — một model id cố định không có hậu tố ngày, cùng cách đặt tên như claude-opus-5. Không có dạng pinned-snapshot riêng nào để áp dụng và cũng không có alias nào phân giải thành thứ khác.

Tổng quan về các mô hình của Anthropic liệt kê năm bề mặt, với các chuỗi chính xác như sau:

• Claude API — claude-opus-5-5, có sẵn cho tất cả khách hàng.

• Amazon Bedrock — anthropic.claude-opus-5-5 (bề mặt duy nhất có thêm tiền tố nhà cung cấp).

• Claude Platform on AWS — claude-opus-5-5, sử dụng các ID của Claude API thay vì các ID kiểu Bedrock.

Google Cloud — claude-opus-5-5.

• Microsoft Foundry — claude-opus-5-5; tên triển khai là thứ bạn gửi đi, và Foundry tuân theo lịch trình vòng đời của Claude API.

Hai trong số năm cái đó quan trọng hơn phần còn lại của mục này. Amazon Bedrock và Google Cloud tự đặt ngày vòng đời và ngày ngừng hoạt động của riêng mình, và — như các thay đổi phá vỡ tương thích bên dưới cho thấy — Bedrock cũng là nền tảng duy nhất mà công cụ sử dụng máy tính cũ vẫn còn hoạt động. Nếu bạn đang dùng Bedrock, bạn không cùng một quá trình di chuyển như những người khác.

Điều mà mọi yêu cầu phải đáp ứng hiện nay

Hướng dẫn di chuyển của Anthropic nêu rõ hợp đồng dưới dạng một danh sách, và danh sách này đủ ngắn để bạn đối chiếu client của riêng mình. Dù bạn đang chuyển từ mô hình nào, một yêu cầu gửi đến claude-opus-5-5 phải:

• Gửi không có trường thinking hoặc thinking: {"type": "adaptive"} — hai cách này tương đương, vì tính năng thinking thích ứng luôn được bật.

• Kiểm soát độ sâu tư duy bằng effort, tham số yêu cầu duy nhất làm được điều đó; cả năm mức đều được hỗ trợ và mặc định là medium.

• Dùng tool_choice với {"type": "auto"} (mặc định) hoặc {"type": "none"}. Việc buộc chọn một công cụ sẽ bị từ chối.

• Bỏ qua temperature, top_ptop_k, hoặc để chúng ở giá trị mặc định. Mọi giá trị khác đều bị từ chối, trên mô hình này cũng như mọi thứ từ Claude Opus 4.7 trở đi.

• Không kết thúc tin nhắn bằng một lượt trợ lý được điền sẵn; điều đó đã bị từ chối trên Opus 4.6 và các phiên bản sau.

• Khai báo việc sử dụng máy tính là bộ công cụ computer_toolset_20260801 trên Claude API và Google Cloud.

• Không gửi beta header cho cửa sổ ngữ cảnh. Cửa sổ ngữ cảnh 1M là mặc định, và một header được viết cho model cũ hơn sẽ không có tác dụng.

Khi hướng dẫn nói rằng một cài đặt bị từ chối, API sẽ trả về HTTP 400. Đó chính là toàn bộ kiểu lỗi khi chuyển sang mô hình này: không phải đầu ra bị suy giảm, không phải một cảnh báo trong log — mà là một yêu cầu không bao giờ được thực thi.

Anthropic's Migrating to Claude Opus 5.5 documentation page, showing the 'What every request to Claude Opus 5.5 must satisfy' list: the claude-opus-5-5 model id with no date suffix, thinking adaptive-only, the effort parameter with five levels low through max defaulting to medium, tool_choice auto or none, sampling parameters at their defaults, no prefilled assistant turn, the computer_toolset_20260801 toolset on the Claude API and Google Cloud, and a 1M-token context window requiring no beta header.

Bốn thay đổi không tương thích

1. Không thể tắt Thinking

Tư duy thích ứng luôn được bật. thinking: {"type": "disabled"} trả về lỗi 400, và ngân sách thủ công cũng vậy — thinking: {"type": "enabled", "budget_tokens": N}. Thông báo lỗi nêu tên kiểu bạn đã gửi rồi nêu tên kiểu thay thế:

• "thinking.type.disabled" không được hỗ trợ cho mô hình này. Hãy dùng "thinking.type.adaptive" và "output_config.effort" để điều khiển hành vi suy luận.

• "thinking.type.enabled" không được hỗ trợ cho mô hình này. Hãy sử dụng "thinking.type.adaptive" và "output_config.effort" để kiểm soát hành vi suy nghĩ.

Hệ quả thực tế không nằm ở lỗi, mà nằm ở những gì xảy ra sau khi bạn sửa nó. Trên Claude Opus 4.8 và các phiên bản trước đó, một yêu cầu không có trường thinking sẽ chạy mà không suy nghĩ. Trên Claude Opus 5.5, mọi yêu cầu đều suy nghĩ, và max_tokens vẫn là một giới hạn cứng bao gồm cả phần suy nghĩ lẫn văn bản phản hồi. Token suy nghĩ được tính như token đầu ra ngay cả khi văn bản suy nghĩ đó không bao giờ được trả về cho bạn. Vì vậy, một endpoint trước đây chạy không suy nghĩ có thể tạo ra nhiều token đầu ra hơn cho mỗi yêu cầu sau "bản sửa" so với trước đó. Hướng dẫn của Anthropic là hãy giảm mức effort ở những chỗ bạn từng tắt suy nghĩ, và — ở mức xhigh hoặc max — hãy bắt đầu với max_tokens ở 64k rồi tinh chỉnh từ đó.

Hình dạng phản hồi cũng thay đổi. Một phản hồi có thể bắt đầu bằng một hoặc nhiều khối suy nghĩ trước khối văn bản đầu tiên, nên mã đọc câu trả lời theo vị trí — content[0].text, hoặc trình xử lý luồng coi content_block_start đầu tiên là văn bản — sẽ hỏng với những phản hồi này ngay cả khi yêu cầu đã thành công. Thay vào đó, hãy chọn khối theo trường type của chúng.

2. Việc buộc sử dụng công cụ trả về lỗi

tool_choice types anytool đều trả về lỗi 400, và việc xác thực tương tự cũng được áp dụng cho endpoint đếm token, vì vậy thao tác đếm trước khi gọi sẽ thất bại giống hệt như lệnh gọi thực tế:

• tool_choice: loại "tool" và "any" không được hỗ trợ cho mô hình này.

Auto và none không bị ảnh hưởng. Cách thay thế được tài liệu hóa là giữ tool_choice: {"type": "auto"}, đánh dấu các công cụ bằng strict: true để có đối số hợp lệ theo schema, hoặc chuyển schema sang structured outputs — và nói trong prompt khi công cụ áp dụng, vì auto không đảm bảo một lệnh gọi. Việc dùng công cụ strict chấp nhận một tập con của JSON Schema: mọi object trong input_schema của công cụ phải đặt additionalProperties: false, nên hãy kiểm tra từng schema trước khi bật cờ. Và lưu ý khoảng trống mà điều này để lại: nếu mã của bạn phụ thuộc vào việc ép buộc một lệnh gọi thay vì chỉ cho phép một lệnh gọi, thì auto khôi phục quyền được phép chứ không khôi phục sự đảm bảo. Hãy kiểm tra rằng một khối tool_use thực sự đã trả về.

3. Các khối suy nghĩ được gắn với mô hình và với cuộc hội thoại

Mỗi khối tư duy ghi lại mô hình nào đã tạo ra nó, và mỗi mô hình đọc các khối của chính nó cùng với một tập hợp được xác định gồm các khối của những mô hình khác. Các quy tắc vận hành theo cả hai chiều:

• Claude Opus 5.5 đọc các khối suy nghĩ từ Claude Opus 5 và các mô hình Opus, Sonnet và Haiku đời trước — nhưng không đọc từ các mô hình Claude Fable hoặc Claude Mythos.

• Trên Claude API, Claude Fable 5.1 và Claude Mythos 5.1 đọc được các khối Claude Opus 5.5. Không có mô hình nào khác làm được điều đó.

• Một cuộc trò chuyện chuyển từ Claude Opus 5.5 sang bất kỳ thứ nào khác ngoài hai cái đó sẽ chạy các lượt sau mà không có phần lý luận trước đó.

Một router hoặc cơ chế dự phòng giúp di chuyển cuộc hội thoại là cách rõ ràng để gặp vấn đề này. Phần tinh tế hơn là khối cũng bị ràng buộc với tiền tố cuộc hội thoại — system prompt, các công cụ và mọi tin nhắn trước nó. Anthropic thực thi kiểm tra tiền tố theo mặc định đối với các tài khoản được tạo vào hoặc sau 2026-08-31 00:00 UTC, trên Claude API và trên các nền tảng đám mây: nếu phát lại một khối sau khi chỉnh sửa system prompt, danh sách công cụ hoặc một tin nhắn trước đó, yêu cầu sẽ trả về 400. Có hai lối thoát. Gửi thinking-binding-controls-2026-08-01 dưới dạng beta header và đặt thinking.block_binding.prefix_mismatch_behavior thành "drop_block" để bỏ các khối bị ảnh hưởng thay vì làm yêu cầu thất bại. Hoặc giữ cuộc hội thoại ở dạng chỉ ghi thêm và thay đổi hướng dẫn bằng một tin nhắn hệ thống giữa cuộc hội thoại thay vì chỉnh sửa — đó là điều Claude Code, claude.ai, Claude Managed Agents và Claude Agent SDK đã làm.

Có một tin tốt dễ bị bỏ sót: khi một yêu cầu mang theo một khối mà mô hình đích không thể đọc được, API sẽ loại bỏ nó trước khi mô hình nhìn thấy nó. Yêu cầu vẫn thành công và các khối bị loại bỏ không bị tính phí.

4. Công cụ sử dụng máy tính cũ hơn bị từ chối trên Claude API và Google Cloud

Một mục tools thuộc loại computer_20251124 trả về mã 400 trên Claude API và Google Cloud. Thông báo này nêu tên loại bị từ chối, sau đó liệt kê các loại mà mô hình chấp nhận:

• 'claude-opus-5-5' không hỗ trợ các loại công cụ: computer_20251124.

Phần thay thế là computer_toolset_20260801 (bộ công cụ): bỏ computer-use-2025-11-24 tiêu đề beta, và gửi mục tools mà không có name và không có kích thước hiển thị. Đây không chỉ là một thay đổi yêu cầu — vòng lặp agent cũng thay đổi theo. Các hành động đến dưới dạng các khối tool_use thành viên thay vì một công cụ computer duy nhất, có thể có nhiều khối trong một lượt, hành động là name của khối thay vì input.action, và mọi kết quả đều phải echo toolset_name trở lại. Trên Amazon Bedrock, computer_20251124 vẫn hoạt động đúng như trên Claude Opus 5 và không cần thay đổi gì.

Điều nào trong bốn điều cũng áp dụng cho Claude Fable 5.1?

Anthropic cho biết ba thay đổi đầu tiên cũng áp dụng trên Claude Fable 5.1 — luôn bật suy luận, không ép chọn công cụ, và các khối suy luận gắn với mô hình và cuộc hội thoại. Thay đổi về sử dụng máy tính thì không: thay đổi đó chỉ riêng cho mô hình này trên Claude API và Google Cloud. Vì vậy, một nhóm đã chuyển sang Claude Fable 5.1 thì đã loại bỏ các nhánh mã tắt suy luận và các lựa chọn công cụ bị ép buộc, đồng thời có mô hình hội thoại chỉ ghi thêm; điều còn lại là mã định danh mô hình và bộ công cụ sử dụng máy tính. Một nhóm đến từ Claude Opus 5 sẽ phải đối mặt với cả bốn thay đổi cùng lúc. Đó mới là cuộc di trú đáng để lên kế hoạch, và khối lượng công việc sẽ khác nhau tùy vào điểm xuất phát của bạn.

Thay đổi thứ năm: không có lỗi nào xảy ra, và bảng tin tiến độ của bạn trở nên im ắng

Trên Claude Opus 5, các ghi chú ngắn mà mô hình viết giữa các lần gọi công cụ được trả về dưới dạng khối văn bản thông thường. Trên Claude Opus 5.5 — cũng như trên Claude Fable 5.1 — phần tường thuật đó được trả về dưới dạng khối suy nghĩ cập nhật tiến độ, tối đa một khối trước mỗi lần gọi công cụ. Và thinking.display mặc định là "omitted", vì vậy những khối đó xuất hiện với trường thinking trống đi kèm chữ ký của chúng.

Không có yêu cầu nào thất bại. Không có lỗi nào được ghi log. Một ứng dụng truyền phát văn bản giữa các lần gọi công cụ cho người dùng như một chỉ báo tiến độ chỉ đơn giản là ngừng hiển thị tiến độ giữa các lần gọi công cụ và bắt đầu không hiển thị gì cả. Triệu chứng thấy được là một giao diện người dùng dường như bị đóng băng trong đúng quãng thời gian làm việc mà người dùng mong muốn được trấn an nhất, và nó sẽ bị báo cáo như một vấn đề hiệu năng, một vấn đề mạng, hoặc một tình trạng treo — chứ không phải như một lỗi di trú. Đây là thay đổi được đưa lên production.

Cách khắc phục là một cài đặt hiển thị, cùng với một lệnh đọc khớp với nó:

• Đặt thinking.display thành "updates" — bản beta, nằm sau header thinking-display-updates-2026-08-18 — để lấy lại các cập nhật tiến độ trong khi phần suy luận vẫn bị ẩn. Đây là thiết lập mà một nguồn cấp tiến độ mong muốn.

• Hoặc đặt nó thành "tóm tắt" để nhận các cập nhật tiến độ và tóm tắt lập luận được trộn lẫn với nhau trong cùng các khối.

• Sau đó, đọc văn bản từ các khối thinking thay vì khối văn bản, hiển thị từng khối thinking không trống ngay trước khối tool_use mà nó đứng trước, và truyền các khối trở lại nguyên vẹn cùng với phần còn lại của lượt trợ lý.

Ghi chú của chính Anthropic về điều này đáng được dẫn lại theo tinh thần: một giao diện hiển thị văn bản giữa các lần gọi công cụ được kỳ vọng sẽ đặt một giá trị hiển thị thay vì dựa vào giá trị mặc định. Nếu tích hợp của bạn hiện hoàn toàn bỏ qua các khối suy nghĩ, thì đó là nơi duy nhất mà giá trị mặc định là an toàn.

A single-column scoreboard titled 'Claude Opus 5.5 — the migration at a glance' listing six rows: thinking always on and cannot be disabled; forced tool use returning a 400 error; thinking blocks bound to the model and the conversation; the old computer tool rejected on the Claude API and Google Cloud; progress text hidden by default; and the fix of setting thinking.display to summarized. Footer reads: per Anthropic's Claude Opus 5.5 migration guide, read 2026-09-24; vendor-reported.

Nỗ lực chính là bề mặt API

Khi không thể tắt khả năng suy nghĩ, output_config.effort trở thành núm điều chỉnh duy nhất cho mức độ mô hình suy luận, và do đó là núm điều chỉnh duy nhất cho chi phí và độ trễ ở một tác vụ nhất định. Có bốn điều về nó đáng để biết trước khi bạn sao chép một cài đặt từ mô hình cũ sang.

Mặc định đã thay đổi. Claude Opus 5.5 mặc định ở mức effort medium, trong khi Claude Opus 5 và các mô hình Opus trước đó mặc định ở mức high. Một yêu cầu không chỉ định effort giờ sẽ chạy thấp hơn một mức so với trước khi đổi mặc định. Anthropic cũng ghi nhận rằng ở cùng một thiết lập effort, mô hình này có xu hướng suy nghĩ nhiều hơn mỗi lượt so với Claude Opus 5, rõ rệt nhất là ở xhigh và max. Hai hiệu ứng đó tác động theo hướng ngược nhau, và đó chính xác là lý do nhà cung cấp khuyến nghị bạn nên chạy lại một đợt quét effort mới trên bộ đánh giá của riêng mình thay vì chuyển nguyên một thiết lập từ mô hình này sang mô hình khác.

Thang đo là low / medium / high / xhigh / max, cả năm mức đều được hỗ trợ ở đây. Ngay từ đầu, mức được đặt tên vốn không phải là một ngân sách token cố định — Anthropic mô tả effort như một tín hiệu hành vi, chứ không phải một ngân sách nghiêm ngặt — và lượng token phân bổ đằng sau mỗi mức đã thay đổi giữa các mô hình, nên “high” trên Claude Opus 5.5 không phải là “high” trên Claude Opus 5. Đặt effort về giá trị mặc định của mô hình thì giống hệt như bỏ qua nó.

Hai chi tiết vận hành, vì cả hai đều tốn tiền nếu bỏ sót. Thứ nhất, việc thay đổi giá trị effort ở cấp cao nhất giữa các yêu cầu sẽ vô hiệu hóa bộ nhớ đệm prompt: hãy chọn một mức và giữ cố định nó trong suốt một cuộc hội thoại dựa vào cache hit, còn thay đổi giữa các khối lượng công việc thì hãy thay đổi nó. Thứ hai, mô hình này hỗ trợ mức nỗ lực theo từng tin nhắn (header beta mid-conversation-output-config-2026-07-01), cho phép thay đổi mức từ một lượt sau mà không cần khởi động lại cache. Mức tối thiểu của bộ nhớ đệm prompt ở đây là 512 token, giảm từ 1.024 ở thế hệ trước, nên những prompt trước đây quá ngắn để lưu vào bộ nhớ đệm giờ có thể tạo mục lưu mà không cần thay đổi mã.

Giới hạn đầu ra: 128K đồng bộ, 300K trên Batch

API Messages đồng bộ giới hạn đầu ra ở mức 128K token. API Message Batches đạt tới 300K token đầu ra khi dùng tiêu đề beta output-300k-2026-03-24 — đúng chuỗi đó. Đầu vào mặc định là cửa sổ ngữ cảnh đầy đủ 1M token mà không cần tiêu đề.

Cách hiểu thực tế: mức trần 128K không thay đổi so với Claude Opus 5, nên không có gì về một tích hợp đồng bộ cần phân bổ lại ngân sách chỉ riêng ở trục đó. Thứ cần phân bổ lại ngân sách chính là phần suy luận bên trong nó. Vì giờ đây max_tokens bao gồm cả suy luận lẫn văn bản trong mọi yêu cầu, một giá trị từng vừa đủ cho văn bản phản hồi trên Claude Opus 5 sẽ chặt hơn ở đây — và ở mức xhigh hoặc max, nhà cung cấp đề xuất bắt đầu từ 64k rồi tinh chỉnh. Nếu một tác vụ chạy dài đã được định cỡ theo mức trần đồng bộ 128K và giờ bị cắt ngắn, thì thứ đã dịch chuyển không phải là mức trần.

Định tuyến Safeguard là một phần của đặc tả.

Đây là một sự thật về tích hợp, không phải một chú thích chính sách: trong một số câu lệnh, chuỗi mô hình bạn gửi không mô tả thứ đã trả lời.

Claude Opus 5.5 đi kèm với các bộ phân loại an toàn, và một yêu cầu bị từ chối sẽ trả về dưới dạng HTTP 200 với stop_reason: "refusal" và một stop_details nêu rõ khu vực chính sách. Mô hình này bao quát nhiều danh mục hơn Claude Opus 5 — hãy mong đợi bio, frontier_llmreasoning_extraction cùng với cyber quen thuộc. Việc từ chối reasoning_extraction bị chặn hoàn toàn thay vì thử lại: cơ chế dự phòng phía máy chủ của Anthropic không thử lại nó, và từ chối được trả về cho bạn.

Đối với những danh mục có thực hiện thử lại, cơ chế ở đây là một tham số. Hãy đặt fallbacks thành "default" cùng với server-side-fallback-2026-07-01 tiêu đề beta, và API sẽ chạy lại một yêu cầu bị từ chối trên mô hình mà Anthropic khuyến nghị cho danh mục đó, trong một lần gọi duy nhất, trả về một phản hồi. Trung tâm trợ giúp của Anthropic nói thẳng tên định tuyến cho mô hình này: các yêu cầu an ninh mạng bị gắn cờ sẽ chuyển sang Claude Opus 4.8, còn các bộ phân loại sinh học của nó — bộ theo kiểu Fable-5 — khiến chuyển sang Claude Opus 5 cho công việc khoa học sự sống lưỡng dụng. Một nhóm nhỏ các năng lực phát triển LLM tiên phong cũng được định tuyến đến Claude Opus 5. Anthropic cũng lưu ý rằng các kiểm tra này xem xét mọi thứ mà mô hình đọc, chứ không chỉ tin nhắn mới nhất của bạn, nên bộ nhớ, nội dung trình kết nối, kết quả tìm kiếm và tệp đều có thể kích hoạt việc chuyển đổi.

Ba điều cần lưu ý cho tích hợp của bạn. Hãy đọc trường cấp cao nhất model trên mọi phản hồi, vì nó báo cáo mô hình thực sự đã tạo ra thông điệp, và một fallback khối nội dung đánh dấu từng điểm chuyển tiếp. Hãy xác minh giới hạn tốc độ của chính fallback, vì fallback bị giới hạn tốc độ sẽ không được thử và thay vào đó trả về lời từ chối — fallback suy giảm thành từ chối khi chịu tải. Và hãy coi bất kỳ lần chạy benchmark nào được công bố với các biện pháp bảo vệ được bật là phép đo của hệ thống đã định tuyến chứ không phải chỉ riêng Claude Opus 5.5, đúng như những gì Anthropic nói về các con số của chính mình dưới đây.

Tính năng dự phòng phía máy chủ hiện đang ở dạng beta và chỉ dành cho Claude API: tính năng này không được hỗ trợ trên Message Batches API, và không khả dụng trên Amazon Bedrock, Google Cloud hay Microsoft Foundry, nơi middleware của SDK mới là phương thức được tài liệu hóa để dùng thay thế. Về phía xác minh, các lộ trình truy cập đều tồn tại cho cả hai hạng mục — Cyber Verification Program và Life Sciences Verification Program — nhưng hãy lưu ý sự bất đối xứng mà trung tâm trợ giúp của Anthropic ghi nhận tại thời điểm viết bài này: Claude Opus 5.5 hiện chưa được liệt kê trong Cyber Verification Program, trong khi chương trình khoa học sự sống được mô tả là mang lại cho các tổ chức đã được xác minh quyền truy cập vào những mô hình có năng lực mạnh nhất.

Ngữ cảnh, điểm cắt, ngừng cung cấp và Fast mode

Phần còn lại của envelope, từ trang mô hình và bảng các mục không dùng nữa:

• Cửa sổ ngữ cảnh — 1M token, mặc định, không có beta header.

• Mốc kiến thức — tháng 6 năm 2026, cũng chính là mốc dữ liệu huấn luyện.

• Ngừng hỗ trợ — không sớm hơn 2027-09-22 trên các nền tảng do Anthropic vận hành, với thông báo trước ít nhất 60 ngày. Amazon Bedrock và Google Cloud tự ấn định ngày của riêng họ. Claude Opus 5 ở trạng thái Active cho đến ít nhất 2027-07-24, vì vậy không có việc chuyển đổi bắt buộc.

• Bảng giá — $4.00 cho mỗi triệu đầu vào, $20.00 cho mỗi triệu đầu ra, $5.00 cho mỗi triệu ghi bộ nhớ đệm 5 phút, $8.00 cho mỗi triệu ghi bộ nhớ đệm 1 giờ, $0.20 cho mỗi triệu đọc bộ nhớ đệm. Batch có giá bằng một nửa ở cả hai chiều, tức $2.00 / $10.00.

• Lượt đọc cache là điểm ngoại lệ đáng chú ý: $0.20 chỉ bằng 5% đầu vào cơ sở, trong khi hầu hết mô hình Claude ở mức 10% và Claude Fable 5.1 ở mức 2.5%. Các tác vụ hỗn hợp có mức tái sử dụng cache cao sẽ cảm nhận đó là một khoản chiết khấu thực sự.

• Chế độ nhanh — vẫn được ghi nhận là bản xem trước nghiên cứu, chỉ dùng cho Claude API, được tính giá riêng ở mức 8,00 USD đầu vào / 40,00 USD đầu ra cho mỗi triệu token. Bật bằng cách dùng speed: "fast" và tiêu đề beta fast-mode-2026-02-01. Tính năng này không khả dụng trên Bedrock, Claude Platform on AWS, Google Cloud hay Microsoft Foundry, không dùng được với Batch API và cũng không đi kèm cam kết Priority Tier. Lưu ý rằng Claude Opus 5.5 hoàn toàn không hỗ trợ Priority Tier.

Các benchmark cho thấy điều gì và ở cài đặt nào

Các thiết lập Effort là lý do một bảng nhà cung cấp và một bảng độc lập không thể được so sánh theo từng hàng, và là lý do mỗi con số bên dưới đều mang thiết lập của nó.

Do nhà cung cấp báo cáo, trên hệ thống đánh giá của chính Anthropic. Ghi chú ra mắt của Anthropic cho biết rằng, trừ khi có ghi chú khác, mọi kết quả của Claude Opus 5.5 đều sử dụng suy luận thích ứng ở mức nỗ lực tối đa; ngoại lệ là Terminal-Bench 4.0, được báo cáo ở mức xhigh cho Claude Opus 5.5 và high cho GPT-6 Astra vì đó là điểm số cao nhất của mỗi mô hình. Trên cơ sở đó, nhà cung cấp báo cáo Terminal-Bench 4.0 đạt 66,4%, FrontierCode v1.1 Main đạt 54,4%, CursorBench 4.0 đạt 57,8%, GDPval-AA v2.1 đạt 1.846 Elo, AutomationBench đạt 40,0%, Humanity's Last Exam khi dùng công cụ đạt 67,7%, Terminal-Bench-Science 0.1 đạt 58,7%, OSWorld 2.0 đạt 81,8% điểm một phần, và Chartography khi dùng công cụ đạt 89,0%. Ở mức nỗ lực trung bình mặc định của mô hình, nhà cung cấp đưa ra FrontierCode đạt 54,6% và CursorBench đạt 52,5%. Hãy lưu ý điều mà chính ghi chú đó tiết lộ: các đánh giá được chạy với những biện pháp bảo vệ dành cho môi trường sản xuất được bật, và khi chúng kích hoạt, các tác vụ an ninh mạng được Claude Opus 4.8 hoàn thành, còn các tác vụ sinh học và phát triển LLM tiên tiến được Claude Opus 5 hoàn thành — Anthropic cho biết điều này có khả năng làm giảm hiệu suất của Claude Opus 5.5 trên các benchmark đó. Vì vậy, các điểm số được công bố trên những đánh giá bị ảnh hưởng không phải là thước đo thuần túy cho mô hình này.

Độc lập, Artificial Analysis. Trên Intelligence Index v4.3.2, Claude Opus 5.5 đạt 58 điểm trong cấu hình mà Artificial Analysis gọi là "Adaptive Reasoning, Max Effort, Default Fallback" — mức điểm đo được cao nhất của nó, cao hơn vài điểm, và nó dẫn đầu ở sáu trong mười bài đánh giá thành phần. Trên cùng chỉ số và cùng harness, Claude Fable 5.1 đạt 53 điểm và Claude Opus 5 đạt 51 điểm. Artificial Analysis công bố toàn bộ thang effort, đây là sản phẩm độc lập hữu ích nhất ở đây: max 58, xhigh 56, high 54, medium 51, low 42. Các phép đo của chính họ cho thấy Claude Opus 5.5 tạo ra khoảng 119.000 token đầu ra cho mỗi tác vụ chỉ số ở mức effort tối đa, so với khoảng 73.000 đối với Claude Opus 5, 78.000 đối với Claude Fable 5.1 và 27.000 đối với GPT-6 Astra — những token này được tính phí như token đầu ra — và trang của họ báo cáo chi phí 5,98 đô la cho mỗi tác vụ chỉ số. Họ cũng đo Terminal-Bench 4.0 ở mức 59,6% và Humanity's Last Exam ở mức 61,4%, so với 66,4% và 67,7% của nhà cung cấp ở mức effort tối đa trên một harness khác.

Đọc hai đoạn đó đối chiếu với nhau và kết luận trung thực thì khá hẹp. Con số 66,4% trên Terminal-Bench của nhà cung cấp và con số 59,6% độc lập là cùng một benchmark do những người khác nhau chạy ở những thiết lập không đảm bảo khớp nhau, và cả hai đều không phải bằng chứng về khối lượng công việc của bạn. Thang bậc nỗ lực mới là phát hiện có thể chuyển giao: trên một chỉ số độc lập, các thiết lập của chính mô hình này trải rộng tới mười sáu điểm, tức là biên độ rộng hơn khoảng cách giữa nó và phiên bản tiền nhiệm. Việc chọn một mức nỗ lực quan trọng hơn việc chọn giữa các mô hình này, và điều khoản "Default Fallback" trong nhãn đó chính là cơ chế định tuyến bảo vệ được mô tả ở trên, chứ không phải là một sản phẩm phụ của benchmark.

Hiệu quả do nhà cung cấp báo cáo, được ghi nhận nguồn. Anthropic cho biết Claude Opus 5.5 đạt hiệu năng ngang mức Claude Fable 5.1 ở hầu hết công việc với chi phí vận hành thấp hơn khoảng 40%, và rằng các khối lượng công việc điển hình tốn ít hơn khoảng 40% so với trên Claude Opus 5, trong khi giá niêm yết chỉ giảm 20%. Đầu ra nhanh hơn hơn 30%. Đây là những mô tả của nhà cung cấp về mức trung bình trên các khối lượng công việc do chính nhà cung cấp lựa chọn. Các tuyên bố của khách hàng vào thời điểm ra mắt cũng là loại bằng chứng tương tự: Box báo cáo chỉ dùng một phần ba số token và câu trả lời ngắn gọn hơn khoảng 40%, Kiro dùng khoảng một nửa số token và ít hơn khoảng 40% số lượt gọi, Factory giảm 20–25% token đầu ra, GitHub nằm trong số ít token và số bước nhất mà họ từng đo được. Anthropic cũng báo cáo một bài kiểm tra kiểm chứng thông tin nội bộ, trong đó 16 trong số 18 báo cáo của họ đạt ngưỡng chất lượng mà cả Claude Fable 5.1 lẫn Claude Opus 5 đều không vượt qua trong bất kỳ lần thử nào. Tất cả đều do nhà cung cấp báo cáo và không có phần nào được kiểm toán. Hạn chế được công bố thì thẳng thắn một cách bất thường và đáng để ghi nhớ: Anthropic nói rằng Claude Opus 5.5 "thường nghi ngờ rằng nó đang bị đánh giá".

Cuối cùng, các mô hình anh em: Anthropic nói Claude Sonnet 5.5 và Claude Haiku 5.5 sẽ ra mắt "trong vài tuần tới". Cả hai đều chưa được phát hành, chưa được định giá và chưa xuất hiện trên bất kỳ bề mặt nào ở thời điểm hiện tại.

Kiểm thử bốn thay đổi mà không cần chuyển đổi toàn bộ

Rủi ro của đợt migration ở đây không nằm ở chất lượng — mà là một code path bạn chưa từng chạy thử trong staging lại chính là code path trả về 400 ở production. Bốn breaking change đều là thay đổi về hình dạng request, nghĩa là chúng thất bại một cách tất định và ngay lập tức, và cách duy nhất để tìm ra những path bạn đã bỏ sót là chạy lưu lượng thật xuyên qua chúng.

Claude Opus 5.5 đã có mặt trên OrcaRouter với tên anthropic/claude-opus-5.5ở đúng mức giá niêm yết của Anthropic, với 0% phụ phí — giá niêm yết của nhà cung cấp được chuyển nguyên vẹn, nên khi nhà cung cấp thay đổi giá thì tại đây cũng được cập nhật ngay trong cùng ngày.

The OrcaRouter model page for Claude Opus 5.5, showing the identifier anthropic/claude-opus-5.5, input at $4.00 and output at $20.00 per 1M tokens, a 1M-token context window, 128K max output, text plus image and file input, and OpenAI-compatible and Anthropic Messages endpoints served from api.orcarouter.ai.

Điều đó cho phép bạn hướng một phần trăm lưu lượng sản xuất đến mô hình trong khi phần còn lại vẫn chạy trên Claude Opus 5, theo dõi những yêu cầu nào thất bại và tại sao, rồi sửa từng cái một. Bốn lỗi này tự mô tả: mỗi lỗi nêu tên tham số mà nó từ chối và, trong ba trong bốn trường hợp, cả giá trị thay thế. Chuyển đổi dự phòng tự động lấp đầy khoảng trống trong khi một đường dẫn vẫn bị hỏng — một yêu cầu thất bại với mô hình bạn chưa mô tả đầy đủ sẽ tự động chuyển sang mô hình bạn đã có, thay vì hiển thị lỗi 400 cho người dùng.

Một thứ tự công việc thực tế: trước tiên hãy đổi model id và đặt effort một cách rõ ràng, vì mặc định đã chuyển sang medium; tiếp theo gỡ bỏ các nhánh thinking-disabled và forced-tool-choice; sau đó sửa trình đọc streaming — chọn block theo type và thiết lập thinking.display — vì đó là cái thất bại âm thầm thay vì ồn ào; và hãy để việc chuyển đổi bộ công cụ computer-use lại sau cùng nếu bạn đang dùng Bedrock, vì đó là cái không áp dụng ở đó. Mọi thứ còn lại — giá, cửa sổ ngữ cảnh, tỷ lệ cache và mặc định 1M-token — đều đã ở đúng nơi bạn để lại.

Điều phối một phần lưu lượng trực tiếp đến mô hình mới mà không cần chuyển đổi toàn bộ: Claude Opus 5.5 trên OrcaRouter hoạt động theo mức giá niêm yết của Anthropic, với khả năng tự động chuyển đổi dự phòng sang một mô hình mà bạn đã nắm rõ đặc tính.

So sánh trong bài viết này4

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày