Claude Sonnet 4.5 là mô hình Sonnet tiên tiến nhất của Anthropic tính đến thời điểm hiện tại, được tối ưu hóa cho các tác nhân thực tế và quy trình công việc lập trình. Nó mang lại hiệu suất hàng đầu trên các chuẩn đánh giá lập trình như SWE-bench Verified, với...
Claude Sonnet 4.5 là một mô hình ngôn ngữ lớn từ Anthropic, có sẵn thông qua API tương thích với OpenAI của OrcaRouter. Nó nằm giữa các tầng mô hình Haiku và Opus của Anthropic, cung cấp sự cân bằng…
Claude Sonnet 4.5 hoạt động tốt trong các tác vụ yêu cầu suy luận sâu trên văn bản dài, chẳng hạn như phân tích tài liệu, tóm tắt và trích xuất thông tin. Điểm MMLU-Pro đạt 86,0 cho thấy khả năng kiến thức thực tế và suy luận mạnh mẽ trên nhiều lĩnh vực. Mô hình này cũng hiệu quả trong việc tạo mã nguồn, gỡ lỗi và tái cấu trúc, đặc biệt đối với các dự án lớn nằm trong cửa sổ ngữ cảnh của nó. Đối với các tác vụ đa phương thức, nó có thể diễn giải hình ảnh, cung cấp mô tả, trả lời câu hỏi về nội dung trực quan hoặc trích xuất thông tin từ sơ đồ. Khả năng xuất ra 64.000 token cho phép nó tạo ra các phản hồi toàn diện, hữu ích cho việc viết nội dung dài hoặc tạo dữ liệu có cấu trúc.
Claude Sonnet 4.5 chấp nhận hình ảnh và tệp tin như một phần của đầu vào cùng với văn bản. Khi một hình ảnh được cung cấp, mô hình sẽ diễn giải nội dung trực quan của nó—chẳng hạn như các đối tượng, văn bản trong hình ảnh hoặc mối quan hệ không gian—và có thể trả lời câu hỏi hoặc thực hiện hướng dẫn dựa trên sự diễn giải đó. Các tệp tin có thể được tải lên ở nhiều định dạng khác nhau; mô hình sẽ trích xuất nội dung văn bản và xử lý nó trong cùng một ngữ cảnh. Điều này cho phép thực hiện các tác vụ như phân tích hóa đơn đã quét (hình ảnh) và bảng tính liên quan (tệp tin) cùng một lúc. Mô hình không tạo ra hình ảnh; đầu ra của nó luôn là văn bản. Quá trình xử lý đa phương thức sử dụng token: hình ảnh tiêu thụ token tỷ lệ thuận với độ phân giải của chúng, và nội dung tệp tin được token hóa dưới dạng văn bản.
Nếu các tác vụ của bạn đơn giản, ngữ cảnh ngắn, hoặc chỉ có một phương thức (chỉ văn bản), một mô hình chi phí thấp hơn như Claude Haiku của Anthropic có thể phù hợp hơn. Ví dụ, phân loại đơn giản, hỏi đáp ngắn, hoặc tạo văn bản quy mô nhỏ thường có thể được xử lý bởi các mô hình nhỏ hơn với chi phí thấp hơn nhiều. Tương tự, nếu bạn không cần ngữ cảnh mở rộng hoặc khả năng đa phương thức, việc trả tiền cho Claude Sonnet 4.5 có thể không xứng đáng. Hãy đánh giá độ phức tạp và độ dài của các truy vấn điển hình của bạn. Đối với xử lý hàng loạt hàng nghìn yêu cầu ngắn, một mô hình rẻ hơn sẽ giảm tổng chi phí. OrcaRouter cung cấp nhiều cấp độ mô hình để bạn có thể ghép mô hình phù hợp với nhu cầu thực tế của mình.
Claude Sonnet 4.5 lý tưởng cho các tác vụ tận dụng ngữ cảnh lớn và đầu vào đa phương thức. Các trường hợp sử dụng tốt nhất bao gồm: tóm tắt toàn bộ hợp đồng pháp lý hoặc bài nghiên cứu, thực hiện đánh giá mã nguồn trên toàn bộ cơ sở mã, tạo tài liệu từ mã, trích xuất dữ liệu có cấu trúc từ tài liệu quét (hình ảnh), và xây dựng chatbot cần nhớ lại lịch sử trò chuyện dài. Nó cũng phù hợp cho các ứng dụng giáo dục nơi mô hình phải đọc và suy luận về các chương sách giáo khoa hoặc slide bài giảng. Đối với viết sáng tạo, giới hạn token đầu ra cao cho phép tạo nội dung dài như câu chuyện hoặc báo cáo trong một lần. Trong mỗi trường hợp, điểm MMLU-Pro 86.0 của mô hình cho thấy khả năng suy luận đáng tin cậy.
MMLU-Pro là một chuẩn đánh giá đo lường khả năng hiểu ngôn ngữ đa nhiệm của mô hình trên nhiều lĩnh vực khác nhau, bao gồm STEM, nhân văn và khoa học xã hội. Nó bao gồm các câu hỏi trắc nghiệm được thiết kế để kiểm tra cả kiến thức và suy luận. Claude Sonnet 4.5 đạt điểm số 86.0 trên chuẩn đánh giá này. Điểm số này cho thấy mô hình trả lời đúng 86.0% số câu hỏi, đưa nó vào nhóm những mô hình hoạt động mạnh về kiến thức tổng quát và các nhiệm vụ suy luận. Để có bối cảnh, MMLU-Pro là phiên bản mở rộng của MMLU gốc với các câu hỏi thử thách hơn. Điểm số trên 80 được coi là rất cạnh tranh, mặc dù hiệu suất trên các nhiệm vụ cụ thể có thể khác nhau.
Điểm mạnh của Claude Sonnet 4.5 bao gồm cửa sổ ngữ cảnh rất lớn (1M token), giới hạn đầu ra cao (64k token), hỗ trợ đầu vào đa phương thức và điểm MMLU-Pro mạnh mẽ ở mức 86,0. Các tính năng này giúp nó trở nên mạnh mẽ cho các tác vụ ngữ cảnh dài và đa phương thức. Các hạn chế không được chỉ rõ trong dữ liệu được cung cấp, nhưng giống như tất cả các LLM, nó đôi khi có thể tạo ra thông tin sai lệch hoặc ảo giác. Nó không có kiến thức thời gian thực ngoài thời điểm cắt đào tạo. Nó cũng không thể tạo hình ảnh hoặc thực hiện các hành động ngoài đầu ra văn bản. Chi phí mỗi token cao hơn so với các mô hình nhỏ hơn, vì vậy nó có thể không kinh tế cho các tác vụ ngắn, đơn giản. OrcaRouter không tuyên bố bất kỳ dữ liệu độ trễ cụ thể nào, vì vậy tốc độ phụ thuộc vào cơ sở hạ tầng của nhà cung cấp.
Không có dữ liệu về độ trễ cụ thể cho Claude Sonnet 4.5. Nhìn chung, tốc độ phụ thuộc vào các yếu tố như số lượng token đầu vào và đầu ra, tải backend của nhà cung cấp, và kiến trúc mô hình. Là một mô hình tầm trung, nó được kỳ vọng sẽ có suy luận chậm hơn các mô hình nhỏ (ví dụ: Claude Haiku) nhưng nhanh hơn các mô hình lớn hơn (ví dụ: Claude Opus). OrcaRouter định tuyến các yêu cầu đến API của Anthropic, do đó thời gian phản hồi phụ thuộc vào hạ tầng của Anthropic. Đối với các ứng dụng nhạy cảm với độ trễ, nên thử nghiệm với các tải trọng điển hình của bạn. Cửa sổ ngữ cảnh lớn có thể làm tăng thời gian đến token đầu tiên nếu xử lý đầu vào lớn, vì mô hình cần tiếp nhận tất cả token trước khi tạo ra đầu ra.
Trong khi Claude Sonnet 4.5 hoạt động tốt trên MMLU-Pro (86.0) và hỗ trợ ngữ cảnh lớn, nó vẫn có những hạn chế chung của LLMs. Mô hình có thể tạo ra thông tin có vẻ hợp lý nhưng không chính xác (ảo giác). Kiến thức của nó có ngày cắt đào tạo không được chỉ định trong dữ liệu được cung cấp; nó có thể không biết về các sự kiện rất gần đây. Mô hình không có khả năng duyệt web hoặc bộ nhớ ngoài ngoài ngữ cảnh hiện tại. Xử lý đa phương thức các hình ảnh có độ phân giải cao có thể tiêu tốn đáng kể ngân sách token, làm giảm dung lượng văn bản hiệu quả. Mô hình định giá có nghĩa là các đầu ra dài hoặc đầu vào rất lớn có thể trở nên đắt đỏ. Không có đảm bảo về tính nhất quán giữa các lời nhắc giống hệt nhau; nhiệt độ và các tham số khác ảnh hưởng đến đầu ra. API của OrcaRouter có thể có các giới hạn tốc độ không được nêu chi tiết ở đây.
OrcaRouter tính phí Claude Sonnet 4.5 theo giá của nhà cung cấp, không cộng thêm phụ phí. Giá là $3,00 cho mỗi 1 triệu token đầu vào và $15,00 cho mỗi 1 triệu token đầu ra. Token đầu vào bao gồm toàn bộ văn bản, token tương đương hình ảnh và token nội dung tệp được gửi trong một yêu cầu. Token đầu ra là các token phản hồi được sinh ra. Không có khoản phí nào khác ngoài mức tiêu thụ token. Mô hình trả theo token này có nghĩa là chi phí tăng tuyến tính theo mức sử dụng. Đối với một yêu cầu có 100.000 token đầu vào và 10.000 token đầu ra, chi phí sẽ là $0,30 cho đầu vào và $0,15 cho đầu ra, tổng cộng là $0,45.
Chi phí cho mỗi token đầu ra ($15 mỗi 1M) cao gấp năm lần so với chi phí token đầu vào ($3 mỗi 1M). Sự chênh lệch này khuyến khích người dùng thiết kế prompt sao cho giảm thiểu độ dài của các phản hồi được tạo ra. Ví dụ, yêu cầu câu trả lời ngắn gọn hoặc đầu ra có cấu trúc (JSON) có thể giảm token đầu ra. Ngược lại, chi phí đầu vào có thể tích lũy nếu bao gồm các tài liệu lớn. Cửa sổ ngữ cảnh 1M cho phép đầu vào rất lớn, nhưng mỗi token đầu vào đều phát sinh chi phí. Người dùng nên đánh giá xem toàn bộ ngữ cảnh có cần thiết hay không. Nếu bạn đang tạo đầu ra dài, chi phí đầu ra sẽ chiếm ưu thế. Sử dụng giới hạn token đầu ra thấp hơn (qua tham số max_tokens) giúp kiểm soát chi phí.
OrcaRouter không cung cấp thông tin cụ thể về giảm giá bộ nhớ đệm hoặc giới hạn tốc độ cho Claude Sonnet 4.5 trong dữ liệu được cung cấp. Nhìn chung, một số nhà cung cấp API cung cấp tính năng lưu trữ đệm (tức là không xử lý lại các tiền tố đầu vào giống hệt nhau) để giảm chi phí và độ trễ. Bạn nên kiểm tra tài liệu của OrcaRouter để biết các tính năng như vậy. Giới hạn tốc độ (ví dụ: số lượng yêu cầu mỗi phút hoặc token mỗi phút) có thể áp dụng và thay đổi tùy theo hạng tài khoản. Người dùng có nhu cầu thông lượng cao nên liên hệ với OrcaRouter để biết chi tiết. Theo thông lệ tốt nhất, hãy triển khai logic thử lại với backoff theo cấp số nhân trong ứng dụng của bạn để xử lý các phản hồi giới hạn tốc độ tiềm ẩn.
Mức giá của Claude Sonnet 4.5 (3$/15$ cho mỗi 1M token) nằm ở giữa các mô hình nhỏ hơn rẻ hơn (ví dụ: Claude Haiku) và các mô hình cao cấp đắt đỏ hơn (ví dụ: Claude Opus). Giá chính xác của các mô hình khác không được cung cấp, nhưng nhìn chung, một mô hình có ngữ cảnh 1M và số điểm MMLU-Pro là 86.0 mang lại một đề xuất giá trị cụ thể. Đối với các tác vụ không yêu cầu ngữ cảnh lớn hoặc đầu vào đa phương thức, một mô hình ít tốn kém hơn có thể mang lại hiệu quả chi phí tốt hơn. Ngược lại, Opus (nếu có) có khả năng sẽ có chi phí trên mỗi token cao hơn và điểm chuẩn có khả năng cao hơn. Chính sách không tính phí chênh lệch của OrcaRouter có nghĩa là bạn trả đúng giá của nhà cung cấp, giúp việc so sánh chi phí giữa các mô hình trở nên minh bạch.
OrcaRouter cung cấp một endpoint API tương thích với OpenAI. Để sử dụng Claude Sonnet 4.5, hãy đặt base URL thành https://api.orcarouter.ai/v1 và chỉ định model ID là "anthropic/claude-sonnet-4.5". Bạn sẽ cần một khóa API từ OrcaRouter. Định dạng yêu cầu tuân theo cấu trúc chat completions của OpenAI: gửi một mảng các message với các vai trò như 'system', 'user', 'assistant'. Đối với đầu vào hình ảnh, hãy bao gồm một message có nội dung chứa cả phần text và image_url. Đối với đầu vào tệp, bạn có thể cần tải lên hoặc mã hóa tệp dưới dạng văn bản trước. Phản hồi sẽ chứa văn bản do model tạo ra theo định dạng OpenAI tiêu chuẩn. Ví dụ: curl https://api.orcarouter.ai/v1/chat/completions -H "Authorization: Bearer $ORCA_API_KEY" -d '{"model":"anthropic/claude-sonnet-4.5","messages":[{"role":"user","content":"Hello"}]}'
Khi gọi Claude Sonnet 4.5 thông qua API của OrcaRouter, bạn có thể sử dụng các tham số chat OpenAI tiêu chuẩn như 'model', 'messages', 'max_tokens', 'temperature', 'top_p', 'frequency_penalty', 'presence_penalty', 'stop' và 'stream'. Tham số 'max_tokens' kiểm soát giới hạn đầu ra token, lên đến mức tối đa 64.000 token của mô hình. Đối với các yêu cầu đa phương thức, hãy bao gồm 'image_url' trong mảng nội dung của một tin nhắn. Tham số 'stream' hỗ trợ các sự kiện từ máy chủ để tạo token theo thời gian thực. Các tham số bổ sung như 'seed' cho đầu ra xác định cũng có thể khả dụng. Tham khảo tài liệu của OrcaRouter để biết danh sách đầy đủ. Lưu ý rằng không phải tất cả các tham số OpenAI đều được hỗ trợ; nên kiểm tra. API phản hồi bằng một đối tượng JSON chứa 'choices', mỗi đối tượng có một đối tượng 'message'.
Nếu bạn đang chuyển từ API của OpenAI sang OrcaRouter cho Claude Sonnet 4.5, quy trình này khá đơn giản nhờ khả năng tương thích API. Thay đổi base URL từ https://api.openai.com/v1 thành https://api.orcarouter.ai/v1. Thay khóa API của bạn bằng khóa API OrcaRouter. Cập nhật tên model thành "anthropic/claude-sonnet-4.5". Hầu hết mã nguồn hiện có sử dụng Python client, JavaScript client hoặc các yêu cầu HTTP trực tiếp của OpenAI sẽ hoạt động với những thay đổi tối thiểu. Đối với các tính năng đa phương thức (hình ảnh, tệp), hãy đảm bảo cấu trúc tin nhắn của bạn khớp với định dạng OpenAI với các phần nội dung. Nếu bạn đang sử dụng API gốc của Anthropic, bạn có thể cần cấu trúc lại tin nhắn theo định dạng chat completions (vai trò user/assistant). Tài liệu của OrcaRouter có thể cung cấp hướng dẫn di chuyển.
Claude Opus là mô hình mạnh nhất và đắt nhất của Anthropic, trong khi Sonnet 4.5 là một sản phẩm tầm trung. Opus thường đạt điểm benchmark cao hơn (không có số liệu chính xác), nhưng cũng đắt hơn mỗi token. Sonnet 4.5 cung cấp cửa sổ ngữ cảnh 1M, tương tự như Opus thông thường, và giới hạn đầu ra 64k. Sự đánh đổi là giữa khả năng suy luận hàng đầu (Opus) và sự cân bằng hiệu quả về chi phí hơn (Sonnet). Đối với các tác vụ mà điểm MMLU-Pro 86.0 của Sonnet là đủ, đó có thể là một lựa chọn tốt hơn về giá trị. Nếu ứng dụng của bạn yêu cầu độ chính xác tối đa cho các tác vụ khó, hãy cân nhắc Opus. OrcaRouter có thể cung cấp cả hai, cho phép chuyển đổi dễ dàng bằng cách thay đổi ID mô hình.
Claude Sonnet 4.5 (MMLU-Pro 86.0) cạnh tranh với các mô hình tầm trung đến cao cấp khác như GPT-4o. GPT-4o cũng hỗ trợ đầu vào đa phương thức và có ngữ cảnh lớn (mặc dù kích thước chính xác có thể khác nhau). Thông tin về giá và điểm chuẩn của GPT-4o không được cung cấp ở đây, do đó không thể so sánh số liệu trực tiếp. Sự khác biệt chung bao gồm các lựa chọn kiến trúc và phương pháp huấn luyện. Một số người dùng thích Claude vì tính an toàn và khả năng xử lý ngữ cảnh dài, trong khi những người khác ưa chuộng GPT-4o vì hệ sinh thái rộng hơn. Thông qua OrcaRouter, bạn có thể kiểm tra cả hai mô hình với cùng định dạng API và so sánh kết quả trên dữ liệu cụ thể của mình. Sự lựa chọn phụ thuộc vào hiệu suất thực nghiệm trên trường hợp sử dụng của bạn và chi phí chấp nhận được.
Chọn Claude Sonnet 4.5 khi bạn cần sự cân bằng giữa khả năng, độ dài ngữ cảnh và chi phí. Nếu tác vụ của bạn ngắn và đơn giản (ví dụ: phân loại một lượt), Haiku rẻ hơn và nhanh hơn. Nếu bạn cần khả năng suy luận tốt nhất và sẵn sàng trả nhiều tiền hơn, Opus là lựa chọn tốt hơn. Sonnet lý tưởng cho vùng trung gian: nó cung cấp cửa sổ ngữ cảnh lớn (1M) và điểm MMLU-Pro mạnh mẽ (86.0) với mức giá vừa phải. Đối với các ứng dụng xử lý tài liệu dài với độ phức tạp trung bình, Sonnet có thể cung cấp chất lượng đủ dùng mà không phải chi quá nhiều. Nếu bạn không chắc chắn, API của OrcaRouter cho phép bạn kiểm tra A/B các mô hình khác nhau chỉ bằng cách thay đổi ID mô hình.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="anthropic/claude-sonnet-4.5",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningresponse_formatstopstreamstructured_outputstemperaturethinkingtool_choicetoolstop_ktop_p| Đầu vào / 1M tokens | $3.00 |
| Đầu ra / 1M tokens | $15.00 |
| Đọc cache / 1M | $0.300 |
| Ghi cache / 1M | $3.75 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/anthropic/claude-sonnet-4.5Mở @misc{orcarouter_claude_sonnet_4_5,
title = {Claude Sonnet 4.5 API},
author = {Anthropic},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/anthropic/claude-sonnet-4.5}
}Anthropic. (2025). Claude Sonnet 4.5 API. OrcaRouter. https://www.orcarouter.ai/models/anthropic/claude-sonnet-4.5