DeepSeek V4 Flash 0731 là bản phát hành chính thức được tái hậu đào tạo (re-post-trained) của mô hình mixture-of-experts V4 Flash hiệu quả của DeepSeek — 284B tổng tham số / 13B tham số hoạt động, giống hệt về kiến trúc và kích thước so với bản phát hành V4 Flash tháng 4, với phần hậu đào tạo (post-training) được thực hiện lại từ đầu. Mô hình phục vụ cửa sổ ngữ cảnh 1M token với tối đa 384K token đầu ra, hỗ trợ cả chế độ suy luận (thinking) và không suy luận (non-thinking) (mặc định bật suy luận), cùng với đầu ra JSON và gọi công cụ (tool calls), đồng thời tích hợp sẵn Responses API với khả năng thích ứng nhắm đến các tác nhân lập trình kiểu Codex. Bản sửa đổi 0731 là bước tiến lớn về khả năng tác nhân (agent), vượt qua cả DeepSeek V4 Pro Preview trên các điểm chuẩn tác nhân đã công bố của DeepSeek — 82.7 trên Terminal Bench 2.1, 76.7 trên Cybergym, 70.3 trên Toolathlon Verified, 54.4 trên DeepSWE và 54.2 trên NL2Repo. Trên API độc quyền của DeepSeek, bản sửa đổi này chính là những gì model id deepseek-v4-flash hiện đang phục vụ; định danh theo ngày cũng liệt kê cùng bản sửa đổi cho những người gọi tham chiếu theo ngày. Đây là lựa chọn mạnh mẽ cho các tác nhân lập trình, khối lượng công việc sử dụng terminal và công cụ, cũng như các pipeline tác nhân khối lượng lớn với chi phí phân khúc flash.
DeepSeek V4 Flash 0731 là mô hình ngôn ngữ thuần văn bản từ nhà cung cấp deepseek, có sẵn qua OrcaRouter tại mã mô hình deepseek/deepseek-v4-flash-0731. Các thông số kỹ thuật nổi bật là cửa sổ ngữ…
Đầu vào chỉ giới hạn ở dạng văn bản. Cửa sổ ngữ cảnh là 1.048.576 token và đầu ra tối đa là 384.000 token cho mỗi phản hồi. Đây là một không gian làm việc lớn: bạn có thể đọc khoảng một triệu token nội dung trước khi tạo, và bạn có thể yêu cầu tối đa 384.000 token đầu ra trong một lần gọi. Thẻ mô hình liệt kê hai giới hạn này như các mức trần riêng biệt; nó không nêu giới hạn kết hợp cho một yêu cầu sử dụng cả hai mức gần tối đa. Trong thực tế, để nằm trong giới hạn, hãy đếm token trước khi gửi và đặt max_tokens dưới mức trần đầu ra. Ràng buộc chỉ dùng văn bản cũng có nghĩa là bạn phải chuyển đổi PDF, bảng tính và các tài liệu khác sang văn bản thuần túy trước. Việc phân tách token không được nêu rõ trong các thông tin hiện có, vì vậy hãy kiểm tra nội dung tiêu biểu để xem lời nhắc của bạn sẽ lớn đến mức nào. Nếu yêu cầu của bạn vượt quá 1.048.576 token đầu vào, lệnh gọi API sẽ thất bại; điều tương tự cũng áp dụng cho đầu ra vượt quá 384.000 token.
Dựa trên các thông số kỹ thuật được liệt kê, mô hình này phù hợp nhất cho các tác vụ kết hợp đầu vào văn bản dài, đầu ra văn bản dài và suy luận tác nhân hướng đến terminal. Điểm 82.7 trên Terminal Bench 2.1 là bằng chứng cho thấy sức mạnh trong việc hoàn thành tác vụ dòng lệnh, nơi mô hình đọc đầu ra shell và quyết định lệnh tiếp theo. Ngữ cảnh 1.048.576 token hỗ trợ phân tích toàn bộ kho mã nguồn, đánh giá mã nhiều tệp, tài liệu pháp lý hoặc kỹ thuật dài và lịch sử trò chuyện phong phú. Đầu ra 384.000 token hỗ trợ tạo tài liệu có cấu trúc dài, bộ dữ liệu tổng hợp hoặc phân tích từng bước trong một lần xử lý. Mức giá trên mỗi token là $0.15 cho đầu vào và $0.29 cho đầu ra trên mỗi triệu token giúp chi phí xử lý văn bản khối lượng lớn có thể dự đoán được về mặt tài chính. Mô hình này kém phù hợp hơn khi bạn cần hiểu hình ảnh, phiên âm âm thanh hoặc độ trễ rất thấp — không có điều nào trong số đó được đề cập trong các thông tin được cung cấp. Nếu tác vụ của bạn phù hợp với đặc điểm chỉ dùng văn bản, ngữ cảnh lớn, đầu ra lớn, thì đây là ứng viên hợp lý để đánh giá thông qua OrcaRouter.
Mô hình không thể chấp nhận đầu vào không phải văn bản; không có phương thức thị giác, âm thanh hoặc video trong mục danh mục của nó. Mô hình cũng không có cam kết công bố nào về độ trễ hoặc phát trực tuyến trong các dữ kiện có sẵn. Bạn nên chọn một mô hình rẻ hơn khi khối lượng công việc của bạn không cần ngữ cảnh lớn hoặc giới hạn đầu ra. Ví dụ, một cuộc trao đổi chatbot ngắn sử dụng vài nghìn token vẫn sẽ bị tính phí theo cùng mức giá trên mỗi token nhưng có thể được phục vụ tốt hơn bởi một mô hình có ngữ cảnh nhỏ hơn và giá mỗi triệu token thấp hơn. Các dữ kiện có sẵn không liệt kê giá cho các lựa chọn thay thế, vì vậy hãy so sánh mức giá trên 1M token trong danh mục OrcaRouter. Nếu nhiệm vụ của bạn là phân loại hoặc tóm tắt đơn giản các đoạn văn ngắn, một mô hình rẻ hơn có thể là đủ. Nếu nhiệm vụ của bạn cần ngữ cảnh 1M đầy đủ hoặc đầu ra 384K, hoặc hưởng lợi từ sức mạnh Terminal Bench 2.1 trong công việc dòng lệnh, thì giá của mô hình này là cơ sở đánh giá phù hợp.
Mọi đầu vào phải là văn bản. Các tệp PDF, hình ảnh, bảng tính và tệp âm thanh cần được chuyển đổi thành văn bản thuần túy hoặc phiên âm trước khi có thể gửi đi. Đây là bước tiền xử lý cần thiết, nhưng cũng giúp đơn giản hóa định dạng yêu cầu: các trường nội dung chuẩn kiểu OpenAI chứa chuỗi là tất cả những gì bạn cần. Ngữ cảnh 1.048.576 token cho phép bạn truyền các khối văn bản đã chuyển đổi dài trong một yêu cầu; đầu ra 384.000 token cho phép bạn nhận lại văn bản rất dài. Số lượng token là mối quan tâm vận hành chính vì tổng chi phí phụ thuộc vào token đầu vào và đầu ra. OrcaRouter báo cáo mức sử dụng trong phản hồi tương thích OpenAI, giúp bạn theo dõi cả hai con số. Nếu bạn đang làm việc với ngôn ngữ hoặc mã token hóa không hiệu quả, ngữ cảnh hiệu dụng của bạn sẽ bị thu hẹp vì số lượng token, không phải ký tự, là giới hạn ràng buộc. Không có chi tiết nào về bộ token hóa được cung cấp, vì vậy hãy chạy thử nghiệm nhanh với nội dung của riêng bạn để biết độ dài token điển hình.
Terminal Bench 2.1 đánh giá khả năng làm việc của một mô hình trong môi trường terminal: hiểu đầu ra của lệnh, điều hướng thư mục, thực thi lệnh và hoàn thành các tác vụ quản trị hệ thống hoặc kỹ thuật phần mềm thực tế thông qua shell. Điểm số nổi bật của DeepSeek V4 Flash 0731 là 82.7, trên thang điểm mà giá trị cao hơn sẽ tốt hơn. Đây là kết quả benchmark duy nhất được cung cấp trong các dữ kiện hiện có. Điểm số này là một tín hiệu hữu ích nếu bạn định xây dựng các vòng lặp agent phát ra lệnh shell, vì benchmark được thiết kế để kiểm tra chính xác loại khả năng đó. Nó không phải là thước đo cho kiến thức tổng quát, viết sáng tạo, toán học hoặc năng lực đa ngôn ngữ. Không có đường cơ sở so sánh hoặc số liệu benchmark nào khác được cung cấp, vì vậy 82.7 nên được diễn giải trong bối cảnh: bằng chứng mạnh mẽ cho các tác vụ liên quan đến terminal, và không có bằng chứng nào theo hướng nào cho các lĩnh vực khác. Điểm benchmark phụ thuộc vào phân bố tác vụ chính xác, vì vậy các tác vụ terminal của riêng bạn có thể có điểm khác; hãy xác thực bằng đánh giá của riêng bạn trước khi sử dụng trong sản xuất.
Các thông tin hiện có về DeepSeek V4 Flash 0731 không bao gồm token mỗi giây, thời gian đến token đầu tiên, độ trễ p95, hoặc thông lượng. Cái tên Flash gợi ý về một biến thể nhẹ hơn, nhưng các thông tin được cung cấp không định lượng tốc độ. Những gì các thông tin bao gồm là một cửa sổ ngữ cảnh lớn 1,048,576 token và giới hạn đầu ra lớn 384,000 token. Đầu vào và đầu ra dài hơn vốn tiêu tốn nhiều tài nguyên tính toán hơn, vì vậy độ trễ trên các yêu cầu sử dụng toàn bộ ngữ cảnh có khả năng sẽ cao hơn so với các lời nhắc ngắn, ngay cả đối với một mô hình nhanh. Mức giá $0.15/$0.29 cho mỗi triệu token mô tả chi phí, không phải tốc độ. Để đưa ra quyết định sáng suốt, hãy tự chạy thử nghiệm tải trên API của OrcaRouter với các lời nhắc đại diện có kích thước mà bạn định sử dụng, và so sánh thời gian đến token đầu tiên và tổng thời lượng với các mô hình khác trong danh mục. Đừng ngoại suy độ trễ từ điểm chuẩn, vì điểm chuẩn không đo lường thời gian phản hồi.
Các hạn chế chính có thể thấy từ các dữ kiện được liệt kê. Mô hình chỉ hỗ trợ văn bản, do đó mọi đầu vào đa phương thức đều nằm ngoài phạm vi. Bằng chứng điểm chuẩn chỉ giới hạn ở một điểm số, 82.7 trên Terminal Bench 2.1, bao gồm hoàn thành tác vụ dựa trên terminal, không phải suy luận hoặc kiến thức tổng quát. Không có số liệu về độ trễ, khả dụng hoặc tỷ lệ lỗi nào được công bố, do đó hiệu suất dưới tải là không xác định. Giới hạn ngữ cảnh và đầu ra lớn nhưng hữu hạn: 1.048.576 token đầu vào và 384.000 token đầu ra cho mỗi yêu cầu. Các yêu cầu vượt quá giới hạn này sẽ không thành công. Không có chiết khấu bộ đệm lời nhắc (prompt caching) nào được ghi nhận trong các dữ kiện được cung cấp, do đó các tiền tố lặp lại được tính phí như token đầu vào thông thường. Giá thấp trên cơ sở mỗi token, nhưng chi phí tuyệt đối tăng tuyến tính với kích thước ngữ cảnh. Nếu ứng dụng của bạn cần thị giác, độ trễ thấp hoặc thông lượng rất cao, mô hình này có thể không phù hợp; hãy xác minh các yêu cầu đó một cách riêng biệt trước khi cam kết.
Chi phí được tính theo token, với một mức giá cho đầu vào và một mức giá cho đầu ra. Token đầu vào có giá $0.15 cho mỗi 1,000,000 token; token đầu ra có giá $0.29 cho mỗi 1,000,000 token. OrcaRouter tính phí các khoản này theo mức giá của nhà cung cấp với biên lợi nhuận bằng 0, nghĩa là không có tỷ lệ phần trăm nền tảng nào được cộng thêm vào mức giá của deepseek. Chi phí của một yêu cầu đơn lẻ xấp xỉ bằng số token đầu vào nhân với $0.15 chia cho 1,000,000, cộng với số token đầu ra nhân với $0.29 chia cho 1,000,000. Ví dụ: nếu cả hai giới hạn được sử dụng trong các giao dịch riêng biệt, một đầu vào đầy đủ 1,048,576 token có giá khoảng $0.1573 và một đầu ra có độ dài tối đa 384,000 token có giá khoảng $0.1114. Các dữ kiện hiện có không đề cập đến mức giá chiết khấu cho đầu vào được lưu trong bộ nhớ đệm, vì vậy hãy giả định rằng mỗi token đầu vào được tính phí theo mức giá tiêu chuẩn. Vì mức giá mang tính tuyến tính, việc ước tính chi phí theo lô trở nên đơn giản khi bạn biết kích thước prompt trung bình và độ dài đầu ra của mình.
Sự đánh đổi chính nằm giữa kích thước ngữ cảnh và giá cả. Với mức giá $0.15 cho mỗi 1M token đầu vào, một prompt sử dụng toàn bộ ngữ cảnh 1,048,576 token sẽ tốn khoảng $0.157 chỉ riêng phí đầu vào. Nếu tác vụ của bạn chỉ cần vài nghìn token ngữ cảnh, bạn đang phải trả tiền cho dung lượng không được sử dụng, theo nghĩa là một mô hình có ngữ cảnh nhỏ hơn với mức giá trên mỗi token thấp hơn có thể sẽ rẻ hơn, tùy thuộc vào mức giá của nó. Mức giá $0.29 cho mỗi 1M token đầu ra có nghĩa là các đầu ra dài không đặc biệt đắt khi tính riêng lẻ, nhưng một khối lượng công việc tạo ra hàng gigabyte văn bản sẽ tích lũy chi phí. Không có chiết khấu theo lô, đặt trước hoặc chiết khấu bộ nhớ đệm nào được liệt kê trong các dữ kiện được cung cấp. Cơ chế thanh toán không tính thêm phí từ OrcaRouter có nghĩa là mức giá bạn thấy chính là giá của nhà cung cấp; hóa đơn cuối cùng của bạn chỉ đơn giản là một hàm của số token đã gửi và nhận. Đối với các công việc hàng loạt quy mô lớn, hãy ước tính tổng số token đầu vào và đầu ra, nhân với hai mức giá, rồi so sánh với các lựa chọn thay thế trong danh mục.
OrcaRouter lập hóa đơn cho DeepSeek V4 Flash 0731 theo đúng biểu giá của nhà cung cấp, không cộng thêm phụ phí. Mức $0.15 cho mỗi 1 triệu token đầu vào và $0.29 cho mỗi 1 triệu token đầu ra là biểu giá của nhà cung cấp, không phải bản đã bị cộng thêm phụ phí. Các dữ kiện được cung cấp không mô tả tính năng bộ nhớ đệm lời nhắc (prompt caching) cho mô hình này. Không có mức giá nào cho đầu vào từ bộ nhớ đệm được liệt kê, cũng như không có tuyên bố nào rằng OrcaRouter tự động lưu bộ nhớ đệm lời nhắc thay cho bạn. Nếu nhà cung cấp nền tảng cung cấp tính năng bộ nhớ đệm, các điều khoản đó không nằm trong những gì được cung cấp cho mục danh mục này, vì vậy bạn nên kiểm tra tài liệu hiện tại của OrcaRouter trước khi giả định có khoản chiết khấu. Phản hồi API, vì tuân theo định dạng chat completions của OpenAI, bao gồm thông tin sử dụng cho phép bạn xác minh số token đầu vào và đầu ra được lập hóa đơn. Với mục đích kiểm toán, hãy ghi lại đối tượng usage từ mỗi phản hồi và so sánh với số lượng token bạn dự kiến. Mọi kiểm soát chi phí phải xuất phát từ lựa chọn lời nhắc và tham số của chính bạn.
Gửi các yêu cầu hoàn tất hội thoại chuẩn tới API tương thích OpenAI của OrcaRouter. URL gốc là https://api.orcarouter.ai/v1 và ID mô hình là deepseek/deepseek-v4-flash-0731. Đặt trường model thành chính xác chuỗi đó, và đặt khóa API OrcaRouter của bạn trong header Authorization dưới dạng bearer token. Xây dựng một mảng messages với nội dung văn bản; mô hình sẽ không chấp nhận nội dung hình ảnh hoặc âm thanh. Phản hồi được định dạng giống như một chat completion của OpenAI và bao gồm tin nhắn được tạo cùng một đối tượng usage. Vì ID mô hình bao gồm tiền tố nhà cung cấp, hãy giữ nguyên chính xác như được hiển thị. Các dữ kiện hiện có không yêu cầu bất kỳ header không chuẩn hoặc cài đặt truyền tải đặc biệt nào. Bạn có thể sử dụng SDK của OpenAI, curl hoặc bất kỳ HTTP client nào nói JSON. Bắt đầu với một yêu cầu nhỏ, xác minh usage trả về khớp với số token đầu vào và đầu ra dự kiến, sau đó tăng quy mô lên.
Vì endpoint tương thích với OpenAI, các tham số chat completion điển hình đều có sẵn: model, messages, temperature, top_p, max_tokens hoặc max_completion_tokens, stop, stream và các tùy chọn tương tự được SDK bạn sử dụng hỗ trợ. Các dữ kiện hiện có không liệt kê OrcaRouter tôn trọng những tham số nào cho mô hình cụ thể này, vì vậy bạn nên tự kiểm tra mọi thứ ngoài model và messages. Các giới hạn quan trọng là của chính mô hình: 1.048.576 token đầu vào và 384.000 token đầu ra. Giữ max_tokens dưới giới hạn đầu ra để tránh các yêu cầu bị lỗi. Đối với tool calling hoặc function calling, các dữ kiện không nêu rõ hỗ trợ; hãy kiểm tra một định nghĩa tool tối thiểu trước khi xây dựng agent. Đối với kiểm soát định dạng đầu ra, không có đề cập đến JSON mode hoặc đảm bảo đầu ra có cấu trúc; hãy tự xác thực văn bản được tạo nếu bạn cần cấu trúc đáng tin cậy. Streaming thường được hỗ trợ trên các endpoint tương thích OpenAI, nhưng các dữ kiện không xác nhận điều này cho mô hình này, vì vậy hãy tham khảo tài liệu tham khảo API của OrcaRouter.
Việc chuyển đổi chủ yếu là cấu hình: thay đổi URL gốc thành https://api.orcarouter.ai/v1, đổi khóa API sang khóa OrcaRouter của bạn và thay tên mô hình bằng deepseek/deepseek-v4-flash-0731. Mã hiện đang xây dựng tin nhắn, xử lý phản hồi chat completion và đọc dữ liệu sử dụng sẽ tiếp tục hoạt động miễn là nó tuân theo quy ước OpenAI. Có hai điểm khác biệt cần lưu ý. Thứ nhất, mô hình này chỉ hỗ trợ văn bản, vì vậy hãy xóa mọi trường image_url hoặc audio khỏi các yêu cầu của bạn. Thứ hai, giới hạn bối cảnh và đầu ra rất lớn; hãy điều chỉnh cài đặt max_tokens của bạn để tuân thủ trần đầu ra 384.000 token và chuẩn bị sẵn sàng cho các phản hồi thỉnh thoảng dài. Nếu mã của bạn có logic thử lại khi gặp lỗi 429 hoặc 5xx, hãy giữ nguyên chúng; thực tế không làm thay đổi kỳ vọng về việc xử lý lỗi. Chạy kiểm thử khói với một lời nhắc nhỏ, xác nhận thanh toán hiển thị ở mức $0,15/$0,29 cho mỗi triệu token, sau đó chuyển lưu lượng dần dần.
URL gốc cho API của OrcaRouter là https://api.orcarouter.ai/v1. Tất cả các yêu cầu tới endpoint này phải sử dụng HTTPS. Xác thực bằng khóa API, được gửi dưới dạng mã bearer token chuẩn trong header Authorization. Các thông tin khả dụng không liệt kê phương thức xác thực thay thế nào. ID mô hình là deepseek/deepseek-v4-flash-0731, bao gồm tên nhà cung cấp và hậu tố snapshot 0731; hãy truyền chính xác như được viết. Trong hầu hết các SDK tương thích OpenAI, bạn cấu hình client với base_url và api_key, sau đó đặt tên mô hình trong mỗi lần gọi. Phản hồi sẽ bao gồm số lượng token liên quan đến tính phí trong đối tượng usage. Các thông tin này không nêu giới hạn tốc độ, hành vi thử lại hoặc hướng dẫn về thời gian chờ, vì vậy hãy kiểm tra tài liệu của OrcaRouter để biết các chi tiết vận hành đó. Lưu trữ khóa API của bạn một cách an toàn; khóa quyết định quyền truy cập vào mọi tài khoản mô hình trong dự án OrcaRouter của bạn. Nếu bạn sử dụng proxy hoặc gateway, hãy trỏ nó tới URL gốc của OrcaRouter và giữ nguyên ID mô hình đầy đủ.
Các dữ kiện được cung cấp chỉ bao phủ đúng ảnh chụp nhanh cụ thể này, vì vậy không thể so sánh số liệu từng dòng với các mục DeepSeek khác từ những gì đã cho. Điều chúng ta biết về DeepSeek V4 Flash 0731 là ngữ cảnh 1.048.576 token, giới hạn đầu ra 384.000 token, đầu vào chỉ văn bản, giá $0,15/$0,29 mỗi 1 triệu token và điểm Terminal Bench 2.1 là 82,7. Các mô hình DeepSeek khác trong danh mục của OrcaRouter có thể khác nhau ở bất kỳ tiêu chí nào trong số này. Khi quyết định, hãy so sánh các thông số quan trọng: prompt của bạn thực sự dùng bao nhiêu token, đầu ra của bạn cần bao nhiêu token, bạn có cần đầu vào đa phương thức hay không, và giá mỗi 1 triệu token của ứng viên. Nhãn Flash ngụ ý một biến thể gọn nhẹ hơn so với các bản phát hành DeepSeek khác, nhưng chỉ số hiệu suất khách quan duy nhất trong các dữ kiện là điểm Terminal Bench. Hãy sử dụng các trang danh sách danh mục của OrcaRouter để xem thông số kỹ thuật song song và giá hiện tại trước khi lựa chọn.
Ở mức ngữ cảnh 1.048.576 token, mô hình này thuộc nhóm ngữ cảnh dài. Một mô hình có ngữ cảnh nhỏ hơn có thể bị giới hạn ở vài trăm nghìn token hoặc ít hơn, buộc bạn phải chia nhỏ tài liệu, nhúng các chunk hoặc sử dụng truy xuất. Lợi thế của mô hình này là bạn có thể đặt một kho ngữ liệu rất lớn vào một prompt duy nhất và để mô hình xử lý toàn bộ trong một lượt. Nhược điểm là chi phí trên mỗi yêu cầu: mỗi token đầu vào đều bị tính phí, vì vậy ngữ cảnh khổng lồ sẽ nhân chi phí đầu vào lên nhiều lần. Các dữ kiện không liệt kê bất kỳ mô hình nào có cửa sổ ngữ cảnh lớn hơn, vì vậy những phát biểu an toàn duy nhất là về giới hạn của chính mô hình này. Khi lựa chọn, hãy ước tính kích thước prompt thực tế của bạn. Nếu tác vụ của bạn thường sử dụng dưới 100K token, ngữ cảnh đầy đủ có thể không liên quan và một mô hình nhỏ hơn, rẻ hơn có thể được ưu tiên hơn. Nếu bạn thường xuyên vượt quá giới hạn ngữ cảnh thông thường, cửa sổ 1 triệu token của mô hình này là tính năng quyết định.
Chọn DeepSeek V4 Flash 0731 khi tác vụ chỉ thuần văn bản và bạn có thể khai thác các thông số kỹ thuật của nó. Ngữ cảnh 1.048.576 token xứng đáng được chọn khi bạn cần đọc toàn bộ kho lưu trữ, bộ tài liệu hoặc bản ghi dài trong một lượt. Giới hạn đầu ra 384.000 token xứng đáng được chọn khi bạn cần tạo ra các câu trả lời rất dài mà không phải thực hiện nhiều lượt gọi. Điểm 82,7 trên Terminal Bench 2.1 xứng đáng được chọn cho tự động hóa terminal và các quy trình CLI tác tử. Mức giá $0,15/$0,29 mỗi 1 triệu token xứng đáng được chọn cho xử lý văn bản hàng loạt khối lượng lớn khi chi phí trên mỗi token là yếu tố chi phối. Không chọn nó khi bạn cần hình ảnh hoặc âm thanh, khi nhu cầu ngữ cảnh rất nhỏ và có mô hình rẻ hơn, hoặc khi bạn không thể chấp nhận các đặc tính độ trễ không xác định. Các dữ kiện hiện có không đưa ra bảo đảm nào về độ trễ, vì vậy các nhóm nhạy cảm với hiệu suất nên chạy benchmark bằng các prompt thực tế trước tiên. Trong mọi trường hợp, hãy xác nhận ID mô hình và thông tin thanh toán trên OrcaRouter trước khi mở rộng quy mô.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| Đầu vào / 1M tokens | $0.147 |
| Đầu ra / 1M tokens | $0.295 |
| Đọc cache / 1M | $0.020 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/deepseek/deepseek-v4-flash-0731Mở @misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731