DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
MớiNổi bật
Thị giácCông cụJSONSuy luận
bởi DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash là mô hình nhỏ nhất trong họ kiến trúc mới của DeepSeek, được phát hành vào ngày 10 tháng 9 năm 2026, với khả năng hiểu thị giác đa phương thức tích hợp sẵn — phiên bản kế thừa chính thức của cả V4 Flash và thử nghiệm V4 Flash Vision. Kiến trúc mới nhắm tới trần năng lực cao hơn, suy luận nhanh hơn và thông lượng cao hơn, và DeepSeek báo cáo rằng V4.1 Flash vượt trội toàn diện so với V4 Pro về hiệu suất, chi phí, tốc độ và tổng thời gian thực hiện tác vụ. Mô hình nhận văn bản và hình ảnh với đầu ra là văn bản, phục vụ cửa sổ ngữ cảnh 1M-token với tối đa 384K token đầu ra, và hỗ trợ chế độ suy luận (thinking, mặc định, với mức nỗ lực thấp / cao / tối đa có thể chọn) và chế độ không suy luận trên các API Chat Completions, Responses và các API tương thích Anthropic, cùng với đầu ra JSON, gọi công cụ và hoàn thành tiền tố trò chuyện; FIM chỉ hoạt động ở chế độ không suy luận. Trọng số mô hình được mở công khai trên Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). Các benchmark chính thức tại thời điểm phát hành: 90.6 trên Terminal-Bench 2.1, 74.2 trên DeepSWE v1.1, 65.4 trên NL2Repo-Bench, 90.9 trên GPQA Diamond, 63.9 trên HLE với công cụ, và các kết quả agent thị giác gốc mạnh mẽ (89.6 BabyVision, 78.9 Chartography với công cụ). Giá cũng được cắt giảm cùng phiên bản phát hành: $0.15/M token đầu vào (trượt cache), $0.60/M token đầu ra và $0.003/M khi trúng cache ở mức giá thấp điểm, tăng gấp đôi trong giờ cao điểm ngày thường (01:00-04:00 và 06:00-10:00 UTC); tất cả các giờ khác bao gồm cuối tuần đều là giờ thấp điểm.

ngữ cảnh1M token
Đầu ra tối đa384K
Đầu vàotext + image
Đầu ratext
TTFT p50410 ms
ĐẦU VÀO$0.15/ 1M token
ĐẦU RA$0.60/ 1M token
TTFT p50410 ms7 ngày
p95 TTFT1.56 s7 ngày
LƯU LƯỢNG271.0Mtokens / 7 ngày

DeepSeek V4.1 Flash là một mô hình DeepSeek có sẵn qua OrcaRouter, cổng API tương thích OpenAI. Nó chấp nhận đầu vào văn bản và hình ảnh, sở hữu cửa sổ ngữ cảnh 1.048.576 token và có thể tạo tối đa…

DeepSeek V4.1 Flash là gì?

DeepSeek V4.1 Flash được xây dựng cho ai?

Tại sao cửa sổ ngữ cảnh 1,048,576 token lại quan trọng?

Mã ví dụ

Gọi từ bất kỳ SDK nào

Tương thích OpenAI — giữ nguyên SDK bạn đang dùng

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Tham số được hỗ trợ

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

Giá

Giá
Đầu vào / 1M tokens · Ngoài giờ cao điểm$0.150
Đầu ra / 1M tokens · Ngoài giờ cao điểm$0.600
Đọc cache / 1M · Ngoài giờ cao điểm$0.0030
Giờ cao điểm01:00–04:00, 06:00–10:00 ×2 (UTC)
Đầu vào / 1M tokens · ×2$0.300
Đầu ra / 1M tokens · ×2$1.20
Đọc cache / 1M · ×2$0.0060
Tiền tệUSD

Máy tính chi phí

Token / tháng10MM
Tỷ lệ đầu vào70%%
Ước tính / tháng $2.85 · Có cache prompt $2.34

Ước tính theo giá niêm yết

Công cụ ước tính token & chi phí

Token đầu vào: 17Chi phí mỗi yêu cầu: $0.000303

Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.

Hiệu suất

TTFT p50
410 ms
Tốc độ đầu ra
215 tok/s
p95 TTFT
1.56 s
Tỷ lệ lỗi
0.07%

Benchmark công khai

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
Nguồn: api-docs.deepseek.com

Thảo luận cộng đồng

Điều các nhà phát triển đang nói tuần này

Hacker News13 lượt nhắc · 7 ngàytăng 13 so với tuần trước

So sánh

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
Đầu vào $/M$0.15$0.73$0.24$0.24
Đầu ra $/M$0.60$2.18$0.73$0.73
Ngữ cảnh1.0M1.0M1.0M1.0M
Chất lượng8/108/107/107/10
So sánh song songSo sánh song songSo sánh song songSo sánh song song

Câu hỏi thường gặp

DeepSeek V4.1 Flash có giá bao nhiêu trên OrcaRouter?
OrcaRouter tính phí DeepSeek V4.1 Flash ở mức $0.15 cho mỗi 1M token đầu vào và $0.60 cho mỗi 1M token đầu ra, được chuyển tiếp theo đúng mức giá của nhà cung cấp, không đánh thêm phí. Không có khoản phí riêng nào được mô tả cho chính cửa sổ ngữ cảnh: 1,048,576 token là một giới hạn, không phải một khoản phí. Token đầu vào bao gồm văn bản, hình ảnh và lịch sử hội thoại bạn gửi; token đầu ra bao gồm mọi thứ được tạo ra, tối đa 384,000 token.
Cửa sổ ngữ cảnh và đầu ra tối đa có kích thước bao nhiêu?
DeepSeek V4.1 Flash có cửa sổ ngữ cảnh 1,048,576 token và đầu ra tối đa 384,000 token. Cửa sổ đầu vào cho phép bạn gửi toàn bộ tài liệu, bản ghi hoặc ảnh chụp nhanh kho lưu trữ trong một lần gọi, trong khi giới hạn đầu ra hỗ trợ các tạo tác dài trong một lượt như đặc tả, kế hoạch di chuyển hoặc diff mở rộng.
DeepSeek V4.1 Flash giỏi nhất ở điểm gì?
Nó được xây dựng cho công việc đầu vào dài, đầu ra dài: phân tích toàn bộ tài liệu, hiểu mã nguồn trong kho lưu trữ lớn, đánh giá đa phương thức đối với văn bản và hình ảnh, và các quy trình làm việc cần câu trả lời được tạo ra đáng kể thay vì trả lời ngắn. Điểm 90.9 của nó trên GPQA Diamond cũng cho thấy năng lực lập luận khoa học và kỹ thuật ở trình độ sau đại học vững chắc. Đầu vào hỗ trợ cả văn bản và hình ảnh; đầu ra chỉ là văn bản.
Nó so sánh như thế nào với các mô hình tiên phong lớn hơn?
Các mô hình tiên tiến nhất có thể dẫn đầu trên các benchmark suy luận khó nhất và thường tính phí cao hơn trên mỗi token, trong khi DeepSeek V4.1 Flash cung cấp cửa sổ ngữ cảnh 1.048.576 token và giới hạn đầu ra 384.000 token với mức $0,15 mỗi 1 triệu token đầu vào và $0,60 mỗi 1 triệu token đầu ra. Đối với công việc ngữ cảnh dài và khối lượng lớn, đây thường là lựa chọn thực tế; với những bước suy luận riêng lẻ khó nhất, việc định tuyến các lệnh gọi đó đến một mô hình đắt hơn trên OrcaRouter là một cách làm hợp lý.
Dữ liệu được xử lý như thế nào khi tôi gọi mô hình này?
OrcaRouter định tuyến các yêu cầu đến API của DeepSeek và tính phí theo mức giá của nhà cung cấp mà không cộng thêm phí. Việc lưu trữ, sử dụng để huấn luyện và các điều khoản liên quan được điều chỉnh bởi chính sách của nhà cung cấp, chứ không phải một thỏa thuận riêng được mô tả ở đây, vì vậy hãy xác nhận các điều khoản hiện hành của nhà cung cấp trước khi gửi tài liệu nhạy cảm. Hãy che/xóa các thông tin nhận dạng mà bạn không cần và chỉ giữ lời nhắc ở mức tối thiểu mà tác vụ yêu cầu; ngữ cảnh nhỏ hơn cũng làm giảm chi phí đầu vào ở mức $0.15 cho mỗi 1M token.
Làm thế nào để tôi gọi nó thông qua API tương thích với OpenAI?
Đặt base URL của client thành https://api.orcarouter.ai/v1 và sử dụng ID model deepseek/deepseek-v4.1-flash với khóa API OrcaRouter của bạn. Các yêu cầu và phản hồi tuân theo schema chat completions của OpenAI, nên các SDK, trình xử lý streaming và phân tích cú pháp tool-call hiện có vẫn hoạt động không thay đổi. Việc chuyển đổi thường chỉ là thay đổi base URL và chuỗi model cùng với việc chạy lại bộ đánh giá của bạn.
DeepSeek V4.1 Flash có thể nhận hình ảnh không?
Có. Đầu vào hình ảnh được hỗ trợ thông qua mảng nội dung đa phương thức tiêu chuẩn, với các phần văn bản và hình ảnh trong cùng một tin nhắn của người dùng. Token hình ảnh được tính là đầu vào và được tính phí ở mức $0.15 mỗi 1M token đầu vào trên OrcaRouter. Đầu ra vẫn chỉ là văn bản, vì vậy mô hình mô tả hoặc trích xuất từ hình ảnh thay vì tạo ra chúng.
Liệu 90.9 trên GPQA Diamond có đủ để tôi tin tưởng nó cho tác vụ của mình không?
Đó là một tín hiệu hữu ích, không phải một sự bảo đảm. GPQA Diamond đo lường khả năng suy luận khoa học ở cấp sau đại học trong một định dạng prompt cố định, điều này có liên quan đến việc trả lời câu hỏi kỹ thuật nhưng nói rất ít về khả năng ghi nhớ ngữ cảnh dài, giọng điệu, hoặc độ chính xác trích xuất trên dữ liệu của bạn. Hãy xây dựng một bộ đánh giá nhỏ từ các đầu vào thực tế, chạy nó với DeepSeek V4.1 Flash và bất kỳ model id thay thế nào trên OrcaRouter, rồi so sánh chi phí và chất lượng trước khi định tuyến lưu lượng production.

Nhúng huy hiệu này

DeepSeek: DeepSeek V4.1 Flash$0.15/M in410ms p50qua OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="DeepSeek: DeepSeek V4.1 Flash trên OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

Thẻ mô hình dạng dữ liệu

GET /api/public/models/deepseek/deepseek-v4.1-flashMở
Máy đọc được:/llms.txt/llms-full.txt