Một thẻ tiêu đề cho hướng dẫn API Claude Opus 5, hiển thị một thẻ cổng kết nối bo tròn với các chip mã ghi POST /v1/messages và model: claude-opus-5, một thẻ giá ghi $5 / $25 cho mỗi 1 triệu token, và bốn chip mô hình được gắn nhãn Claude, GPT, Gemini và Qwen được kết nối bằng các đường mảnh vào một cổng kết nối duy nhất.
Guides & Insights

Claude Opus 5 API: Cách gọi, chi phí là bao nhiêu và khi nào thì dùng nó là quá mức cần thiết

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

The Claude Opus 5 API is live on the Messages endpoint and on every OpenAI-compatible gateway that carries it. To call it directly you POST to https://api.anthropic.com/v1/messages with the model id claude-opus-5 and the anthropic-version: 2023-06-01 header. To call it with an OpenAI-style client — the route that needs no new SDK — you point your base URL at https://api.orcarouter.ai/v1 and pass the model id anthropic/claude-opus-5, which is how OrcaRouter exposes it. The price is identical on both: $5 per million input tokens and $25 per million output, exactly the list rate with zero markup. It launched on July 24, 2026, and it is the current Opus tier — Claude Opus 4.8 costs the same $5 / $25 and scores lower on the independent benchmarks. The interesting decision is not which dialect to use; it is whether Opus-tier is what your workload actually needs.

Hai điểm cuối, một mô hình

Hầu hết các bài hướng dẫn về API Claude Opus 5 chỉ trình bày lời gọi Anthropic gốc và dừng lại ở đó. Thực sự có hai phương ngữ, và cả hai đều truy cập đến cùng một trọng số.

Anthropic native — /v1/messages. POST to https://api.anthropic.com/v1/messages with two required headers: x-api-key with your key and anthropic-version: 2023-06-01. The body carries model: "claude-opus-5", a max_tokens, and a messages array. This is what the Anthropic Python and TypeScript SDKs send under the hood.

OpenAI-compatible — /v1/chat/completions. POST to https://api.orcarouter.ai/v1/chat/completions (or /v1/messages if you want the Anthropic dialect through the same host) with the model id anthropic/claude-opus-5. If you already run an OpenAI client, the switch is two lines: change base_url to https://api.orcarouter.ai/v1 and swap the API key. Nothing else in your request shape changes.

Mô hình đám mây. Trên Amazon Bedrock, id là anthropic.claude-opus-5; trên Google Vertex AI và Microsoft Foundry, nó giữ nguyên id của hãng là claude-opus-5. Những đường dẫn này dành cho các nhóm đã cam kết với một nhà cung cấp đám mây; lộ trình tương thích OpenAI là lộ trình giúp mã nguồn của bạn dễ dàng di chuyển.

Mô hình không quan tâm bạn dùng phương ngữ nào. Điều khác biệt là mọi thứ xung quanh lời gọi — thanh toán, khóa, giới hạn tốc độ, chuyển đổi dự phòng, và số lượng mô hình khác bạn có thể truy cập mà không cần thay đổi mã.

Những gì bạn nhận được — và hai điều phá vỡ mã cũ

Claude Opus 5 là sản phẩm chủ lực thiên về suy luận của Anthropic: cửa sổ ngữ cảnh 1M token (mức tối đa cũng là mặc định), giới hạn đầu ra 128K, thời điểm cắt kiến thức tháng 5/2026, và đầu vào văn bản, hình ảnh, tệp cùng đầu ra văn bản. Trên bảng xếp hạng độc lập Artificial Analysis, nó đạt AA Coding 78.0, xếp hạng #1 trong số 132, và AA Intelligence 63.1, xếp hạng #2 trong số 134, với GPQA Diamond 93.2 và điểm Humanity's Last Exam 54.9, tính đến ngày 24 tháng 7 năm 2026. Các tuyên bố ra mắt của chính Anthropic — khoảng gấp đôi Opus 4.8 trên Frontier-Bench — do nhà cung cấp tự chạy và không được tái lập độc lập.

A spec and benchmark scoreboard for Claude Opus 5: 1M token context window, 128K max output, $5 / $25 list price, $0.50 per 1M cache read, AA Coding 78.0 ranked #1 of 132, and AA Intelligence 63.1 ranked #2 of 134.

Tư duy được bật theo mặc định. Tư duy thích ứng quyết định mức độ suy luận cho mỗi lần gọi, được kiểm soát bởi tham số output_config.effort, tham số này nhận giá trị từ low đến max và mặc định là high. Đối với các vòng lặp lập trình và agentic, xhigh là điểm khởi đầu được khuyến nghị; lowmedium thực sự mạnh hơn trên Opus 5 so với các mô hình trước đây, điều này khiến chúng khả thi cho khối lượng công việc thực tế thay vì các lệnh gọi thử nghiệm. Token suy luận được tính vào hóa đơn đầu ra của bạn.

Hai thay đổi phá vỡ tương thích từ Claude Opus 4.8 sẽ ảnh hưởng đến bất kỳ ai sao chép một body yêu cầu cũ:

Việc đặt max_tokens quá thấp giờ sẽ khiến phản hồi bị cắt ngắn. Vì suy luận chạy theo mặc định, một max_tokens có kích thước tương đương độ dài câu trả lời dự kiến sẽ bị suy luận tiêu thụ trước. Nếu bạn chuyển một workload 4.8 sang mà không thay đổi, hãy mong đợi các phản hồi bị cắt ngắn cho đến khi bạn tăng giới hạn hoặc giảm mức nỗ lực.

Các tham số sampling bị từ chối. temperature, top_p, và top_k ở bất kỳ giá trị không mặc định nào đều trả về lỗi 400, cũng như prefill trợ lý. Điều khiển đầu ra bằng effort, không phải temperature.

Việc tắt thinking bị giới hạn. thinking: {"type": "disabled"} chỉ được chấp nhận ở mức effort high hoặc xhigh hoặc max trả về lỗi 400. Cách hợp lý để giảm chi phí là hạ effort, không phải tắt thinking.

Chi phí thực tế là bao nhiêu

Claude Opus 5 được niêm yết ở mức $5 mỗi triệu token đầu vào và $25 mỗi triệu token đầu ra — cùng mức giá với Claude Opus 4.8, đó là tin tốt thầm lặng của bản phát hành. Đọc bộ nhớ cache được tính phí $0.50 mỗi triệu (bộ nhớ cache theo lời nhắc yêu cầu tiền tố tối thiểu 512 token và hỗ trợ TTL 5 phút và 1 giờ). Bản xem trước nghiên cứu chế độ nhanh chạy cùng mô hình với tốc độ token đầu ra lên tới 2.5x mỗi giây với giá $10 / $50, và Batch API trả kết quả không đồng bộ với giá chỉ bằng một nửa.

A price comparison card for the Claude Opus 5 API: Opus 5 at $5/$25 with a $0.50 cache read, $10/$50 fast mode and roughly half-price Batch API, Claude Opus 4.8 at the same $5/$25, Claude Sonnet 5 at $3/$15 with $2/$10 intro pricing, Claude Haiku 4.5 at $1/$5, and a worked example of 100K tokens in plus 20K out billing $1.00 uncached or about $0.55 cached.

Một hóa đơn cụ thể: một yêu cầu 100K token tạo ra 20K token đầu ra tính phí $0.50 cho đầu vào và $0.50 cho đầu ra — $1.00 khi không được lưu cache. Nếu prompt 100K đó được phục vụ từ cache trong lần gọi tiếp theo, phần đầu vào giảm xuống còn khoảng $0.05, với tổng chi phí $0.55 cho một chuyến đi trọn gói. Phép tính cache đó chính là sự khác biệt giữa việc Opus có giá phải chăng với ngữ cảnh dài lặp lại và việc nó hoàn toàn không phải chăng.

Các cấp trên và dưới, để so sánh: Claude Fable 5 là mô hình mạnh nhất của Anthropic với mức giá $10 / $50; Claude Sonnet 5 có giá $3 / $15 (với $2 / $10 giá khuyến mãi giới thiệu đến hết ngày 31 tháng 8 năm 2026); Claude Haiku 4.5 có giá $1 / $5. Trên OrcaRouter, tất cả các mô hình này đều được chuyển tiếp ở giá niêm yết của nhà cung cấp mà không có bất kỳ khoản phụ phí nào trên mỗi token, vì vậy so sánh ở trên cũng chính là số tiền bạn thực sự phải trả.

Trường hợp một điểm cuối

Nếu bạn đang đọc một hướng dẫn API Claude Opus 5, có lẽ bạn đã có sẵn một tích hợp và một khóa, và câu hỏi thực sự là liệu bạn có muốn một tích hợp thứ hai và một khóa thứ hai cho mô hình tiếp theo mà bạn thử hay không. OrcaRouter trả lời điều đó bằng một endpoint tương thích OpenAI đặt trước 200+ mô hình: cùng một client, cùng một base URL, và một model id khác nhau cho mỗi mô hình — anthropic/claude-opus-5 hôm nay, một mô hình rẻ hơn khi khối lượng công việc không còn xứng với mức Opus, một mô hình tiên phong mới ngay trong tuần ra mắt, tất cả mà không cần thay đổi mã.

The OrcaRouter model page for anthropic/claude-opus-5, showing the $5.00 per million input and $25.00 per million output pricing, a 1,000,000-token context window, the released July 24, 2026 label, and both OpenAI-compatible and Anthropic-native endpoints.

Phần chi phí là phần trung thực. OrcaRouter thêm $0 mỗi token — bạn trả theo mức giá công bố của từng nhà cung cấp, vì vậy Claude Opus 5 vẫn giữ mức $5 / $25 của Anthropic, và mức giảm giá của nhà cung cấp sẽ có hiệu lực ở phía chúng tôi ngay trong ngày công bố. Mang khóa riêng của bạn là một tùy chọn hạng nhất: hãy cung cấp khóa API Anthropic hiện có của bạn, giữ nguyên hạn mức truy cập và số dư tín dụng của riêng bạn, và nhà cung cấp sẽ tính phí trực tiếp cho bạn. Các cơ chế bảo vệ — một lá chắn PII và một chính sách nội dung — được thực thi trước khi yêu cầu được tính phí, không phải sau đó. Trang mô hình cho anthropic/claude-opus-5 hiển thị mức giá thời gian thực, ngữ cảnh 1M và các số liệu thông lượng hiện tại, đồng thời DSL định tuyến thiết lập một cơ chế chuyển đổi dự phòng để một mô hình rẻ hơn có thể trả lời khi Opus 5 gặp lỗi hoặc khi cấu trúc lưu lượng của bạn cho phép điều đó.

Nơi Opus 5 là câu trả lời sai

Là tốt nhất không đồng nghĩa với việc phù hợp với khối lượng công việc của bạn, và có ba điểm mà flagship $5 / $25 thua kém.

Cuộc gọi có khối lượng lớn, rủi ro thấp. Một pipeline tóm tắt hoặc phân loại xử lý 10 triệu token đầu vào mỗi tháng có chi phí $50 trên Claude Opus 5 so với $10 trên Claude Haiku 4.5 — cùng endpoint, cùng key, chỉ cần đổi một id. Haiku không phải Opus, nhưng với định tuyến, trích xuất và định dạng, nó đủ gần đến mức khó có thể biện minh cho mức giá gấp 5 lần.

Vòng lặp tác nhân dài. Opus 5 tự xác minh công việc của mình mà không cần nhắc, vì vậy một chỉ dẫn "kiểm tra lại câu trả lời" vốn được tinh chỉnh cho mô hình cũ hơn giờ đây kích hoạt việc xác minh quá mức và tiêu tốn token suy luận. Ở mức xhigh và max effort, ngân sách tư duy tăng lên có chủ đích. Nếu tác nhân của bạn không cần suy luận tiên phong, Claude Sonnet 5 với giá $3/$15 là lựa chọn mặc định mà hầu hết các đội ngũ sản xuất nên bắt đầu, và bạn dùng núm chỉnh effort để giảm mức độ xuống.

Nơi mô hình không phải của chúng tôi. OrcaRouter định tuyến và lập hóa đơn; Anthropic chạy các trọng số. Điểm cuối, mức phụ phí bằng không, khả năng chuyển đổi dự phòng và các cơ chế bảo vệ là của chúng tôi, nhưng chất lượng suy luận và hành vi an toàn là của Anthropic, và với BYOK, tiền sẽ đi thẳng đến họ. Đó là thỏa thuận được nêu rõ ràng: dù thế nào bạn cũng trả theo mức giá của nhà cung cấp, và câu hỏi là liệu một điểm cuối cho hơn 200 mô hình có đáng giá hay không.

Kết luận

Gọi API Claude Opus 5 bằng endpoint Messages gốc nếu bạn không có tích hợp nào khác, và dùng endpoint tương thích OpenAI nếu bạn muốn một client duy nhất cho mọi thứ. Đây là mô hình phù hợp khi nhiệm vụ khó, ngữ cảnh dài và đầu ra có giá trị 25 USD cho mỗi triệu token — và là mô hình không phù hợp khi nhiệm vụ chỉ mang tính thường nhật. Cấu hình gọn gàng nhất là cấu hình cho phép bạn đổi ý: một endpoint, key của riêng bạn, $0 markup, và một mã mô hình mà bạn có thể thay đổi vào ngày khối lượng công việc thay đổi.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube