
Claude Opus 5 API: Cách gọi, chi phí là bao nhiêu và khi nào thì dùng nó là quá mức cần thiết
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
The Claude Opus 5 API is live on the Messages endpoint and on every OpenAI-compatible gateway that carries it. To call it directly you POST to https://api.anthropic.com/v1/messages with the model id claude-opus-5 and the anthropic-version: 2023-06-01 header. To call it with an OpenAI-style client — the route that needs no new SDK — you point your base URL at https://api.orcarouter.ai/v1 and pass the model id anthropic/claude-opus-5, which is how OrcaRouter exposes it. The price is identical on both: $5 per million input tokens and $25 per million output, exactly the list rate with zero markup. It launched on July 24, 2026, and it is the current Opus tier — Claude Opus 4.8 costs the same $5 / $25 and scores lower on the independent benchmarks. The interesting decision is not which dialect to use; it is whether Opus-tier is what your workload actually needs.
Hai điểm cuối, một mô hình
Hầu hết các bài hướng dẫn về API Claude Opus 5 chỉ trình bày lời gọi Anthropic gốc và dừng lại ở đó. Thực sự có hai phương ngữ, và cả hai đều truy cập đến cùng một trọng số.
• Anthropic native — /v1/messages. POST to https://api.anthropic.com/v1/messages with two required headers: x-api-key with your key and anthropic-version: 2023-06-01. The body carries model: "claude-opus-5", a max_tokens, and a messages array. This is what the Anthropic Python and TypeScript SDKs send under the hood.
• OpenAI-compatible — /v1/chat/completions. POST to https://api.orcarouter.ai/v1/chat/completions (or /v1/messages if you want the Anthropic dialect through the same host) with the model id anthropic/claude-opus-5. If you already run an OpenAI client, the switch is two lines: change base_url to https://api.orcarouter.ai/v1 and swap the API key. Nothing else in your request shape changes.
• Mô hình đám mây. Trên Amazon Bedrock, id là anthropic.claude-opus-5; trên Google Vertex AI và Microsoft Foundry, nó giữ nguyên id của hãng là claude-opus-5. Những đường dẫn này dành cho các nhóm đã cam kết với một nhà cung cấp đám mây; lộ trình tương thích OpenAI là lộ trình giúp mã nguồn của bạn dễ dàng di chuyển.
Mô hình không quan tâm bạn dùng phương ngữ nào. Điều khác biệt là mọi thứ xung quanh lời gọi — thanh toán, khóa, giới hạn tốc độ, chuyển đổi dự phòng, và số lượng mô hình khác bạn có thể truy cập mà không cần thay đổi mã.
Những gì bạn nhận được — và hai điều phá vỡ mã cũ
Claude Opus 5 là sản phẩm chủ lực thiên về suy luận của Anthropic: cửa sổ ngữ cảnh 1M token (mức tối đa cũng là mặc định), giới hạn đầu ra 128K, thời điểm cắt kiến thức tháng 5/2026, và đầu vào văn bản, hình ảnh, tệp cùng đầu ra văn bản. Trên bảng xếp hạng độc lập Artificial Analysis, nó đạt AA Coding 78.0, xếp hạng #1 trong số 132, và AA Intelligence 63.1, xếp hạng #2 trong số 134, với GPQA Diamond 93.2 và điểm Humanity's Last Exam 54.9, tính đến ngày 24 tháng 7 năm 2026. Các tuyên bố ra mắt của chính Anthropic — khoảng gấp đôi Opus 4.8 trên Frontier-Bench — do nhà cung cấp tự chạy và không được tái lập độc lập.

Tư duy được bật theo mặc định. Tư duy thích ứng quyết định mức độ suy luận cho mỗi lần gọi, được kiểm soát bởi tham số output_config.effort, tham số này nhận giá trị từ low đến max và mặc định là high. Đối với các vòng lặp lập trình và agentic, xhigh là điểm khởi đầu được khuyến nghị; low và medium thực sự mạnh hơn trên Opus 5 so với các mô hình trước đây, điều này khiến chúng khả thi cho khối lượng công việc thực tế thay vì các lệnh gọi thử nghiệm. Token suy luận được tính vào hóa đơn đầu ra của bạn.
Hai thay đổi phá vỡ tương thích từ Claude Opus 4.8 sẽ ảnh hưởng đến bất kỳ ai sao chép một body yêu cầu cũ:
• Việc đặt max_tokens quá thấp giờ sẽ khiến phản hồi bị cắt ngắn. Vì suy luận chạy theo mặc định, một max_tokens có kích thước tương đương độ dài câu trả lời dự kiến sẽ bị suy luận tiêu thụ trước. Nếu bạn chuyển một workload 4.8 sang mà không thay đổi, hãy mong đợi các phản hồi bị cắt ngắn cho đến khi bạn tăng giới hạn hoặc giảm mức nỗ lực.
• Các tham số sampling bị từ chối. temperature, top_p, và top_k ở bất kỳ giá trị không mặc định nào đều trả về lỗi 400, cũng như prefill trợ lý. Điều khiển đầu ra bằng effort, không phải temperature.
• Việc tắt thinking bị giới hạn. thinking: {"type": "disabled"} chỉ được chấp nhận ở mức effort high hoặc xhigh hoặc max trả về lỗi 400. Cách hợp lý để giảm chi phí là hạ effort, không phải tắt thinking.
Chi phí thực tế là bao nhiêu
Claude Opus 5 được niêm yết ở mức $5 mỗi triệu token đầu vào và $25 mỗi triệu token đầu ra — cùng mức giá với Claude Opus 4.8, đó là tin tốt thầm lặng của bản phát hành. Đọc bộ nhớ cache được tính phí $0.50 mỗi triệu (bộ nhớ cache theo lời nhắc yêu cầu tiền tố tối thiểu 512 token và hỗ trợ TTL 5 phút và 1 giờ). Bản xem trước nghiên cứu chế độ nhanh chạy cùng mô hình với tốc độ token đầu ra lên tới 2.5x mỗi giây với giá $10 / $50, và Batch API trả kết quả không đồng bộ với giá chỉ bằng một nửa.

Một hóa đơn cụ thể: một yêu cầu 100K token tạo ra 20K token đầu ra tính phí $0.50 cho đầu vào và $0.50 cho đầu ra — $1.00 khi không được lưu cache. Nếu prompt 100K đó được phục vụ từ cache trong lần gọi tiếp theo, phần đầu vào giảm xuống còn khoảng $0.05, với tổng chi phí $0.55 cho một chuyến đi trọn gói. Phép tính cache đó chính là sự khác biệt giữa việc Opus có giá phải chăng với ngữ cảnh dài lặp lại và việc nó hoàn toàn không phải chăng.
Các cấp trên và dưới, để so sánh: Claude Fable 5 là mô hình mạnh nhất của Anthropic với mức giá $10 / $50; Claude Sonnet 5 có giá $3 / $15 (với $2 / $10 giá khuyến mãi giới thiệu đến hết ngày 31 tháng 8 năm 2026); Claude Haiku 4.5 có giá $1 / $5. Trên OrcaRouter, tất cả các mô hình này đều được chuyển tiếp ở giá niêm yết của nhà cung cấp mà không có bất kỳ khoản phụ phí nào trên mỗi token, vì vậy so sánh ở trên cũng chính là số tiền bạn thực sự phải trả.
Trường hợp một điểm cuối
Nếu bạn đang đọc một hướng dẫn API Claude Opus 5, có lẽ bạn đã có sẵn một tích hợp và một khóa, và câu hỏi thực sự là liệu bạn có muốn một tích hợp thứ hai và một khóa thứ hai cho mô hình tiếp theo mà bạn thử hay không. OrcaRouter trả lời điều đó bằng một endpoint tương thích OpenAI đặt trước 200+ mô hình: cùng một client, cùng một base URL, và một model id khác nhau cho mỗi mô hình — anthropic/claude-opus-5 hôm nay, một mô hình rẻ hơn khi khối lượng công việc không còn xứng với mức Opus, một mô hình tiên phong mới ngay trong tuần ra mắt, tất cả mà không cần thay đổi mã.

Phần chi phí là phần trung thực. OrcaRouter thêm $0 mỗi token — bạn trả theo mức giá công bố của từng nhà cung cấp, vì vậy Claude Opus 5 vẫn giữ mức $5 / $25 của Anthropic, và mức giảm giá của nhà cung cấp sẽ có hiệu lực ở phía chúng tôi ngay trong ngày công bố. Mang khóa riêng của bạn là một tùy chọn hạng nhất: hãy cung cấp khóa API Anthropic hiện có của bạn, giữ nguyên hạn mức truy cập và số dư tín dụng của riêng bạn, và nhà cung cấp sẽ tính phí trực tiếp cho bạn. Các cơ chế bảo vệ — một lá chắn PII và một chính sách nội dung — được thực thi trước khi yêu cầu được tính phí, không phải sau đó. Trang mô hình cho anthropic/claude-opus-5 hiển thị mức giá thời gian thực, ngữ cảnh 1M và các số liệu thông lượng hiện tại, đồng thời DSL định tuyến thiết lập một cơ chế chuyển đổi dự phòng để một mô hình rẻ hơn có thể trả lời khi Opus 5 gặp lỗi hoặc khi cấu trúc lưu lượng của bạn cho phép điều đó.
Nơi Opus 5 là câu trả lời sai
Là tốt nhất không đồng nghĩa với việc phù hợp với khối lượng công việc của bạn, và có ba điểm mà flagship $5 / $25 thua kém.
• Cuộc gọi có khối lượng lớn, rủi ro thấp. Một pipeline tóm tắt hoặc phân loại xử lý 10 triệu token đầu vào mỗi tháng có chi phí $50 trên Claude Opus 5 so với $10 trên Claude Haiku 4.5 — cùng endpoint, cùng key, chỉ cần đổi một id. Haiku không phải Opus, nhưng với định tuyến, trích xuất và định dạng, nó đủ gần đến mức khó có thể biện minh cho mức giá gấp 5 lần.
• Vòng lặp tác nhân dài. Opus 5 tự xác minh công việc của mình mà không cần nhắc, vì vậy một chỉ dẫn "kiểm tra lại câu trả lời" vốn được tinh chỉnh cho mô hình cũ hơn giờ đây kích hoạt việc xác minh quá mức và tiêu tốn token suy luận. Ở mức xhigh và max effort, ngân sách tư duy tăng lên có chủ đích. Nếu tác nhân của bạn không cần suy luận tiên phong, Claude Sonnet 5 với giá $3/$15 là lựa chọn mặc định mà hầu hết các đội ngũ sản xuất nên bắt đầu, và bạn dùng núm chỉnh effort để giảm mức độ xuống.
• Nơi mô hình không phải của chúng tôi. OrcaRouter định tuyến và lập hóa đơn; Anthropic chạy các trọng số. Điểm cuối, mức phụ phí bằng không, khả năng chuyển đổi dự phòng và các cơ chế bảo vệ là của chúng tôi, nhưng chất lượng suy luận và hành vi an toàn là của Anthropic, và với BYOK, tiền sẽ đi thẳng đến họ. Đó là thỏa thuận được nêu rõ ràng: dù thế nào bạn cũng trả theo mức giá của nhà cung cấp, và câu hỏi là liệu một điểm cuối cho hơn 200 mô hình có đáng giá hay không.
Kết luận
Gọi API Claude Opus 5 bằng endpoint Messages gốc nếu bạn không có tích hợp nào khác, và dùng endpoint tương thích OpenAI nếu bạn muốn một client duy nhất cho mọi thứ. Đây là mô hình phù hợp khi nhiệm vụ khó, ngữ cảnh dài và đầu ra có giá trị 25 USD cho mỗi triệu token — và là mô hình không phù hợp khi nhiệm vụ chỉ mang tính thường nhật. Cấu hình gọn gàng nhất là cấu hình cho phép bạn đổi ý: một endpoint, key của riêng bạn, $0 markup, và một mã mô hình mà bạn có thể thay đổi vào ngày khối lượng công việc thay đổi.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
