Biệt danh DeepSeek cho chế độ suy nghĩ Flash V4 — ngữ cảnh 1M, suy luận chuỗi suy nghĩ mở (biệt danh cũ, sắp bị loại bỏ).
DeepSeek Reasoner là một mô hình suy luận chỉ dựa trên văn bản từ DeepSeek, được tối ưu hóa cho các tác vụ yêu cầu suy luận logic sâu và hiểu ngữ cảnh mở rộng. Mô hình này có thể truy cập thông qua…
DeepSeek Reasoner mạnh nhất trong các tác vụ được hưởng lợi từ suy luận mở rộng và cửa sổ ngữ cảnh lớn. Chúng bao gồm chứng minh các định lý toán học, giải các bài toán phức tạp bằng lời, tạo và gỡ lỗi mã trên nhiều tệp, và trả lời các câu hỏi yêu cầu tổng hợp thông tin từ nhiều phần của tài liệu. Nó cũng có thể xử lý các cuộc trò chuyện nhiều lượt trong đó mỗi lượt tham chiếu đến một ngữ cảnh chung lớn mà không bị mất dấu vết. Nhờ giới hạn đầu ra cao, nó hữu ích cho việc tạo báo cáo có cấu trúc hoặc giải thích dài. Bản chất chỉ có văn bản của mô hình giới hạn nó khỏi các tác vụ liên quan đến hiểu hình ảnh, nhưng trong các lĩnh vực văn bản, nó thực hiện công việc phân tích sâu một cách đáng tin cậy.
Giá của DeepSeek Reasoner là $0.44 đầu vào / $0.87 đầu ra cho mỗi 1M token, cao hơn nhiều mô hình nhỏ hơn hoặc nhanh hơn. Bạn nên chọn mô hình này khi tác vụ yêu cầu cửa sổ ngữ cảnh 1M token đầy đủ hoặc khả năng suy luận sâu. Đối với các prompt ngắn (vài nghìn token) không yêu cầu logic từng bước, một mô hình rẻ hơn như một LLM instruction‑tuned nhỏ hơn sẽ tiết kiệm chi phí hơn. Tương tự, nếu ứng dụng của bạn cần độ trễ thấp cho phản hồi thời gian thực, một mô hình nhẹ hơn có thể phù hợp hơn. Tuy nhiên, nếu bạn đang phân tích một tài liệu lớn hoặc giải quyết một vấn đề phức tạp đòi hỏi chuỗi logic, khoản đầu tư vào DeepSeek Reasoner có thể mang lại độ chính xác cao hơn và giảm thời gian xác minh thủ công.
Các điểm mạnh chính của DeepSeek Reasoner là cửa sổ ngữ cảnh cực lớn, giới hạn token đầu ra cao và tập trung vào suy luận logic. Nó có thể duy trì tính mạch lạc qua hàng trăm trang và tạo ra các đầu ra dài, có cấu trúc tốt. Mô hình này chỉ hỗ trợ đầu vào văn bản nhưng có khả năng hiểu nhiều ngôn ngữ, mặc dù điều này chưa được xác nhận rõ ràng. Khả năng suy luận của nó cho phép giải thích quá trình tư duy, hỗ trợ việc gỡ lỗi và xác minh. Ngoài ra, vì OrcaRouter chuyển tiếp giá từ nhà cung cấp với markup bằng không, nên không có chi phí ẩn. Đối với người dùng cần mở rộng các tác vụ phân tích sâu, mô hình này mang lại sự kết hợp mạnh mẽ giữa năng lực và độ trung thực trong suy luận.
Các điểm chuẩn cụ thể cho DeepSeek Reasoner không được cung cấp trong các sự kiện có sẵn. Tuy nhiên, mô hình này là một phần trong dòng mô hình tập trung vào suy luận của DeepSeek, trước đây đã thể hiện hiệu suất mạnh mẽ trên các điểm chuẩn toán học (ví dụ: GSM8K, MATH) và lập trình (ví dụ: HumanEval) trong các đánh giá công khai. Người dùng được khuyến khích kiểm tra mô hình trên các bộ dữ liệu riêng của họ để xác thực hiệu suất cho trường hợp sử dụng cụ thể. Với cửa sổ ngữ cảnh lớn, mô hình này đặc biệt phù hợp cho các tác vụ đánh giá khả năng hiểu phụ thuộc tầm xa. Nếu không có số liệu chính thức, so sánh khách quan nên được thực hiện thông qua thử nghiệm trực tiếp trên API OrcaRouter.
Mặc dù có nhiều điểm mạnh, DeepSeek Reasoner vẫn có những hạn chế. Thứ nhất, nó chỉ chấp nhận đầu vào dạng văn bản—không có hình ảnh, âm thanh hay video. Thứ hai, kích thước ngữ cảnh lớn có thể dẫn đến độ trễ cao hơn, đặc biệt khi đầu vào gần 1 triệu token; thời gian phản hồi token đầu tiên có thể lâu hơn đáng kể so với các mô hình nhỏ hơn. Thứ ba, mặc dù mô hình mạnh về suy luận, nhưng nó có thể không sánh được với khả năng sáng tạo linh hoạt của một số mô hình đa năng cho các tác vụ như thơ ca hoặc kể chuyện mở. Thứ tư, vì là mô hình suy luận chuyên biệt, nó có thể phân tích quá mức các yêu cầu đơn giản, sử dụng nhiều token hơn cần thiết. Cuối cùng, mặc dù giá cả cạnh tranh trong phân khúc của nó, nhưng vẫn cao hơn so với các giải pháp nhẹ hơn, khiến nó không kinh tế cho các truy vấn tầm thường.
DeepSeek Reasoner cung cấp cửa sổ ngữ cảnh 1.048.576 token và đầu ra tối đa 384.000 token. Điều này khiến nó trở thành một trong số ít mô hình có khả năng xử lý các tài liệu dài hơn nhiều tiểu thuyết dài tập chỉ trong một lần nhắc duy nhất. Cửa sổ ngữ cảnh bao gồm cả đầu vào và lịch sử hội thoại hiện có; mô hình sử dụng toàn bộ cửa sổ để tạo phản hồi. Giới hạn đầu ra 384.000 token cho phép tạo ra nội dung rất dài, chẳng hạn như toàn bộ cơ sở mã hoặc báo cáo toàn diện. Người dùng cần lưu ý rằng việc sử dụng toàn bộ ngữ cảnh có thể làm tăng độ trễ và chi phí tương ứng. Các thông số kỹ thuật này được xác nhận trong thông tin thực tế của mô hình và được hỗ trợ trực tiếp khi gọi mô hình qua API tương thích với OpenAI của OrcaRouter.
Trên OrcaRouter, giá cho DeepSeek Reasoner chỉ dựa trên số lượng token đã tiêu thụ, được tính theo giá của nhà cung cấp mà không có phí chênh lệch. Token đầu vào được tính với giá $0,44 cho mỗi 1 triệu token, và token đầu ra với giá $0,87 cho mỗi 1 triệu token. Không có phí nền tảng bổ sung, phí đăng ký hay chi phí ẩn. Chi phí được tính cho mỗi lần gọi API dựa trên tổng số token đã xử lý. OrcaRouter lập hóa đơn trực tiếp cho người dùng, và chi phí phản ánh đúng giá gốc của nhà cung cấp. Mô hình định giá minh bạch này cho phép các nhà phát triển mở rộng quy mô sử dụng một cách dễ dự đoán mà không phải lo lắng về biên lợi nhuận do cổng thêm vào.
Chi phí cho mỗi token có thể được suy ra từ tỷ lệ trên triệu: token đầu vào có giá $0.00000044 mỗi token, và token đầu ra có giá $0.00000087 mỗi token. Trong thực tế, một yêu cầu điển hình gồm 10,000 token đầu vào và 1,000 token đầu ra sẽ có chi phí khoảng $0.0044 + $0.00087 = $0.00527. Bởi vì cửa sổ ngữ cảnh có thể lớn tới 1,048,576 token đầu vào, một yêu cầu sử dụng đầy đủ ngữ cảnh sẽ tốn khoảng $0.46 cho riêng phần đầu vào. Giới hạn đầu ra là 384,000 token sẽ có chi phí lên tới $0.334 nếu sử dụng hết. Các chi phí này tăng tuyến tính, do đó người dùng nên theo dõi việc sử dụng token, đặc biệt khi tận dụng tối đa dung lượng ngữ cảnh và đầu ra.
OrcaRouter tuyên bố rõ ràng rằng DeepSeek Reasoner được định giá theo mức giá của nhà cung cấp, không có bất kỳ khoản chênh lệch nào. Điều này có nghĩa là không có thêm phí nào ngoài chi phí mỗi token được liệt kê. Không có yêu cầu tối thiểu hàng tháng, phí thiết lập hay phí truy cập API. Chi phí duy nhất phát sinh là cho các token đã sử dụng. Người dùng có thể xác minh khoản phí bằng cách so sánh số tiền đã thanh toán với nhật ký sử dụng token. Sự minh bạch về giá của OrcaRouter đảm bảo bạn thấy gì trả nấy, không có khoản phụ phí bất ngờ cho việc sử dụng khối lượng lớn hay các tính năng đặc biệt.
Các dữ kiện hiện có không đề cập đến bất kỳ cơ chế lưu đệm hay giảm giá theo khối lượng nào cho DeepSeek Reasoner trên OrcaRouter. Có thể OrcaRouter cung cấp lưu đệm tiêu chuẩn cho các prompt thường xuyên, nhưng điều này chưa được xác nhận. Tương tự, không có bậc giảm giá nào được mô tả. Giá được tính chặt chẽ theo từng token với tỷ lệ của nhà cung cấp. Người dùng nên giả định rằng không có lưu đệm hoặc giảm giá tích hợp sẵn trừ khi được OrcaRouter thông báo rõ ràng. Đối với việc sử dụng khối lượng lớn, bạn có thể liên hệ bộ phận hỗ trợ của OrcaRouter để hỏi về các thỏa thuận tùy chỉnh, nhưng theo dữ liệu được cung cấp, mô hình giá là trả theo mức sử dụng đơn giản.
Để gọi DeepSeek Reasoner thông qua OrcaRouter, sử dụng endpoint tương thích với OpenAI tại base_url https://api.orcarouter.ai/v1. Đặt tên model là "deepseek/deepseek-reasoner". Tất cả các tham số chat completion tiêu chuẩn của OpenAI đều được hỗ trợ, bao gồm messages, max_tokens, temperature, top_p, và stop sequences. Ví dụ, một yêu cầu sẽ trông như sau: curl https://api.orcarouter.ai/v1/chat/completions -H "Authorization: Bearer YOUR_API_KEY" -d '{"model":"deepseek/deepseek-reasoner","messages":[{"role":"user","content":"Giải bài toán này..."}],"max_tokens":10000}'. API trả về các completion theo cùng định dạng như endpoint chat của OpenAI, giúp việc tích hợp trở nên dễ dàng cho các ứng dụng hiện có.
Ngoài các tham số trò chuyện tiêu chuẩn, DeepSeek Reasoner hỗ trợ các tùy chọn cấu hình tương thích OpenAI thông thường: temperature (mặc định 1, phạm vi 0-2), top_p (mặc định 1), frequency_penalty, presence_penalty, stop và max_tokens (lên đến 384.000). Vì là mô hình suy luận, cài đặt temperature ảnh hưởng đến tính ngẫu nhiên của chuỗi suy luận; temperature thấp hơn tạo ra đầu ra xác định hơn. Không có tham số đặc thù cho suy luận nào được công bố trong API—hành vi suy luận là nội tại của mô hình. Người dùng cũng có thể sử dụng luồng qua tham số stream để nhận token theo từng bước. Tất cả tham số phải được truyền trong phần thân JSON của yêu cầu POST tới endpoint chat completions.
Việc chuyển sang OrcaRouter rất đơn giản vì API hoàn toàn tương thích với định dạng chat completion của OpenAI. Thay thế base URL hiện tại của bạn bằng https://api.orcarouter.ai/v1 và cập nhật tên model thành "deepseek/deepseek-reasoner". Tạo một API key từ dashboard của OrcaRouter và đưa nó vào header Authorization. Điều chỉnh code của bạn để sử dụng base URL và định danh model mới. Phần còn lại của logic, bao gồm định dạng tin nhắn, tên tham số và phân tích phản hồi, không thay đổi. Tính tương thích này cho phép bạn chuyển đổi nhà cung cấp với những thay đổi code tối thiểu, thường chỉ vài dòng trong cấu hình client. Hãy kiểm tra với một payload nhỏ để xác nhận kết nối và giá trước khi mở rộng.
So với dòng GPT-4 của OpenAI, DeepSeek Reasoner cung cấp cửa sổ ngữ cảnh lớn hơn đáng kể (1 triệu token so với 8K-128K của GPT-4 Turbo) và giới hạn đầu ra cao hơn (384K so với 4K-32K). Giá mỗi token thấp hơn ($0,44/$0,87 so với khoảng $10/$30 của GPT-4 Turbo trên 1 triệu token), giúp tiết kiệm chi phí hơn cho các tác vụ có ngữ cảnh dài. Tuy nhiên, GPT-4 Turbo hỗ trợ đầu vào đa phương thức (hình ảnh, âm thanh) và có thể có kiến thức thế giới rộng hơn. DeepSeek Reasoner tập trung đặc biệt vào suy luận và có thể đưa ra các phản hồi theo chuỗi suy nghĩ chi tiết hơn. Đối với các tác vụ không yêu cầu ngữ cảnh cực dài hoặc suy luận sâu, khả năng rộng hơn của GPT-4 Turbo có thể là lựa chọn ưu tiên.
Anthropic's Claude 2 và Claude 3 Opus có cửa sổ ngữ cảnh từ 100K-200K token, nhỏ hơn so với 1 triệu token của DeepSeek Reasoner. Các mô hình Claude cũng hỗ trợ một số đầu vào đa phương thức trong các phiên bản mới hơn. Giá của DeepSeek Reasoner thấp hơn đáng kể (khoảng một phần mười chi phí của Claude 3 Opus cho token đầu vào). Các mô hình Claude nhấn mạnh tính an toàn và hữu ích, trong khi DeepSeek Reasoner được tối ưu hóa cho độ sâu suy luận. Nếu ứng dụng của bạn yêu cầu xử lý các tài liệu rất dài với chi phí thấp hơn, DeepSeek Reasoner có lợi thế. Đối với các tác vụ cần rào cản an toàn và hỗ trợ đa phương thức, Claude có thể phù hợp hơn. Cả hai đều có thể truy cập qua API của OrcaRouter.
Chọn DeepSeek Reasoner khi khối lượng công việc của bạn yêu cầu cửa sổ ngữ cảnh lớn hơn 200K token, hoặc khi bạn cần tạo đầu ra vượt quá 32K token. Nó lý tưởng cho các tác vụ suy luận có hệ thống, nơi việc hiển thị các bước logic trung gian là có giá trị. Lợi thế về chi phí rõ rệt nhất đối với các ứng dụng có khối lượng lớn, ngữ cảnh dài, vì giá mỗi token thấp hơn đáng kể so với các mô hình cao cấp từ OpenAI hoặc Anthropic. Tuy nhiên, nếu tác vụ của bạn ngắn, yêu cầu đầu vào đa phương thức, hoặc được hưởng lợi từ các tập dữ liệu huấn luyện lớn hơn, các lựa chọn thay thế có thể phù hợp hơn. Hãy đánh giá các mẫu sử dụng token và yêu cầu suy luận của bạn để xác định xem điểm mạnh của DeepSeek Reasoner có phù hợp với các ưu tiên của bạn hay không.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="deepseek/deepseek-reasoner",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstream| Đầu vào / 1M tokens | $0.147 |
| Đầu ra / 1M tokens | $0.295 |
| Đọc cache / 1M | $0.028 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/deepseek/deepseek-reasonerMở @misc{orcarouter_deepseek_reasoner,
title = {deepseek/deepseek-reasoner API},
author = {deepseek},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-reasoner}
}deepseek. (n.d.). deepseek/deepseek-reasoner API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-reasoner