DeepSeek V4 Flash chính thức phát hành: Giải thích về mô hình ngữ cảnh 1 triệu token rẻ, nhanh và agentic
Guides & Insights

DeepSeek V4 Flash chính thức phát hành: Giải thích về mô hình ngữ cảnh 1 triệu token rẻ, nhanh và agentic

Tác giả

jinhao song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mô hình tối ưu hiệu suất của DeepSeek, V4 Flash, đã chuyển từ bản preview sang bản phát hành public-beta chính thức — bản build code>-0731/code> được phát hành vào ngày 31 tháng 7 năm 2026. Kiến trúc không thay đổi (vẫn là mô hình mixture-of-experts với 284 tỷ tham số và ngữ cảnh 1 triệu token), nhưng một đợt post-training bổ sung đã cải thiện đáng kể khả năng agentic, lập trình và gọi công cụ, và giờ đây mô hình hỗ trợ nguyên bản Responses API với các tùy biến cụ thể cho các agent kiểu Codex. Hướng dẫn này giải thích V4 Flash là gì, bản phát hành chính thức thực sự nâng cấp những gì, cách đọc các benchmark (do DeepSeek công bố), chi phí và cách sử dụng — mọi con số đều được ghi rõ nguồn.

Lưu ý về độ chính xác: chi tiết phát hành và điểm benchmark dưới đây lấy từ nhật ký thay đổi API chính thức của DeepSeek (ngày 2026-07-31); kiến trúc, ngữ cảnh và giá cả được đối chiếu chéo với trang mô hình của OrcaRouter; các chỉ số tổng hợp từ Artificial Analysis là độc lập. Các benchmark do DeepSeek công bố sử dụng cấu hình harness của riêng họ — hãy xem chúng là số liệu của nhà cung cấp và tự chạy bài đánh giá của bạn. Thông số kỹ thuật và giá cả có thể thay đổi; hãy kiểm tra trước khi xây dựng.

TL;DR. V4 Flash là phiên bản anh em tiết kiệm chi phí của gã khổng lồ DeepSeek V4 Pro: mô hình MoE 284B / 13B active với ngữ cảnh 1M token và đầu ra lên tới 384K, được tối ưu cho các tác vụ tác tử khối lượng lớn, độ trễ thấp. Bản phát hành chính thức ngày 31/7 là bản nâng cấp hậu huấn luyện — cùng kích thước, tác tử và khả năng lập trình tốt hơn đáng kể — đồng thời bổ sung hỗ trợ gốc cho Responses-API và Codex. DeepSeek công bố điểm số tác tử/lập trình cao (ví dụ: Terminal-Bench 2.1 đạt 82,7, Toolathlon đạt 70,3) và chi phí khoảng $0,15 / $0,29 mỗi triệu token đầu vào/đầu ra, tức khoảng một phần ba giá của V4 Pro. Chỉ có API Flash được nâng cấp; V4 Pro và ứng dụng/web DeepSeek không thay đổi. Trên OrcaRouter, bạn nhận được nó với mức phụ phí 0% thông qua một điểm cuối tương thích OpenAI.

Những điểm chính rút ra

• Bản phát hành chính thức (build -0731, ngày 31 tháng 7 năm 2026): bản nâng cấp sau huấn luyện của bản xem trước — cùng kiến trúc, nhưng mạnh hơn nhiều về agent, khả năng lập trình và sử dụng công cụ.

• Kiến trúc không thay đổi: tổng 284B / 13B hoạt động (MoE), ngữ cảnh 1M token (1.048.576), đầu ra lên đến 384K, đầu vào chỉ văn bản, hỗ trợ suy luận, công cụ và JSON.

• Mới: hỗ trợ nguyên bản API Responses kèm khả năng thích ứng riêng cho Codex; vẫn tiếp tục hỗ trợ giao diện kiểu OpenAI ChatCompletions và Anthropic. ID mô hình code>deepseek-v4-flash/code>.

• DeepSeek báo cáo các cải thiện về tác nhân/lập trình: Terminal-Bench 2.1 82.7, Toolathlon (đã xác minh) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.

• Rất rẻ: khoảng $0,15 / $0,29 cho mỗi 1M token đầu vào/đầu ra cùng ~$0,02 cho đọc cache (OrcaRouter, 0% phụ phí) — khoảng một phần ba so với mức $0,44 / $0,88 của V4 Pro. Chỉ có Flash API thay đổi; Pro và app/web vẫn như cũ.

Những gì bản phát hành chính thức thực sự nâng cấp

V4 Flash lần đầu xuất hiện dưới dạng bản xem trước vào ngày 24 tháng 4 năm 2026. Bản phát hành chính thức ngày 31 tháng 7 năm 2026 (bản code>-0731/code>, theo nhật ký thay đổi API của DeepSeek) rõ ràng không phải là một kiến trúc mới: tổng tham số và tham số hoạt động (284B / 13B) cùng ngữ cảnh 1M không thay đổi. Điều thay đổi nằm ở khâu hậu huấn luyện — tinh chỉnh bổ sung mà DeepSeek cho biết đã cải thiện đáng kể các khả năng cốt lõi về tác tử, lập trình và gọi công cụ. Hai điểm bổ sung thực tế đáng chú ý: V4 Flash hiện hỗ trợ nguyên bản Responses API và được tối ưu riêng cho các tác tử lập trình kiểu Codex, trong khi vẫn hỗ trợ các giao diện OpenAI ChatCompletions và kiểu Anthropic. Điều quan trọng là chỉ có API Flash được nâng cấp trong bản phát hành này; V4 Pro và các trải nghiệm ứng dụng/web của DeepSeek không thay đổi. Đối với các nhóm phát triển, điều đó có nghĩa là cải thiện trực tiếp cho các khối lượng công việc tác tử ở cùng mức giá mà không cần migration.

Kiến trúc: MoE kích hoạt nhỏ được tối ưu cho thông lượng

V4 Flash là mô hình hỗn hợp chuyên gia (mixture-of-experts) với tổng cộng khoảng 284 tỷ tham số nhưng chỉ có khoảng 13 tỷ tham số hoạt động cho mỗi token. Số lượng tham số hoạt động thấp đó chính là điểm mấu chốt: nó giúp suy luận nhanh và rẻ trong khi một nhóm chuyên gia lớn vẫn duy trì chất lượng. Cửa sổ ngữ cảnh lên tới 1.048.576 token (khoảng 1M), với đầu ra tối đa rất lớn 384K, và mô hình hỗ trợ suy luận (tư duy mở rộng), gọi công cụ, và JSON có cấu trúc. Đầu vào chỉ là văn bản. Mục tiêu thiết kế — khối lượng lớn, độ trễ thấp, tác vụ agent — được thể hiện qua các số liệu phục vụ: thời gian đến token đầu tiên ở phân vị p50 khoảng 394 mili giây và đầu ra khoảng 184 token mỗi giây theo đo lường của OrcaRouter.

Điểm chuẩn: những con số chính thức nói lên điều gì

Bản phát hành chính thức nhấn mạnh nhiều vào các bài đánh giá tác nhân và lập trình, được chạy bằng khung đánh giá riêng của DeepSeek (cài đặt minimal-mode / max-effort). Dưới đây là cách đọc các kết quả nổi bật, tất cả đều do DeepSeek công bố:

• Terminal-Bench 2.1: 82.7 — các tác vụ dòng lệnh/phần mềm mang tính tác nhân trong một terminal thực. Điểm số cao ở đây cho thấy mô hình có thể thực sự điều khiển các công cụ và shell, chứ không chỉ trả lời câu hỏi.

• Toolathlon (đã xác minh): 70.3 và Automation Bench (Công khai): 25.1 — độ bao phủ và độ tin cậy của việc sử dụng công cụ cũng như tự động hóa đầu cuối. Độ tin cậy khi gọi công cụ chính là đặc điểm quyết định thành bại của các tác nhân.

• Cybergym: 76.7 — giải quyết vấn đề kiểu tác tử bảo mật/CTF.

• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — kỹ thuật phần mềm và lập trình full-stack, từ tạo mã ở cấp kho lưu trữ đến các tác vụ khoa học dữ liệu khó. Điểm DSBench-FullStack (68.7) cao cho thấy năng lực lập trình đa tệp thực tế.

• Agent Last Exam: 25.2 — một bài kiểm tra suy luận tác nhân khó một cách cố ý, nơi ngay cả các mô hình hàng đầu cũng đạt điểm thấp; hữu ích như một tín hiệu tương đối, không phải tuyệt đối.

Để có bối cảnh độc lập, Artificial Analysis (đánh giá vào 2026-06-25, bản preview) xếp V4 Flash ở mức khoảng 56.2 AA Coding, 40.3 AA Intelligence và 50.0 AA Math — một mô hình đa năng thiên về lập trình, trên mức trung bình của nhóm mô hình mở. Đợt tinh chỉnh sau huấn luyện chính thức nhắm thẳng vào trục agentic/lập trình, vì vậy hãy kỳ vọng bản mới hơn sẽ mạnh hơn rõ rệt ở chính những tác vụ đó. Như mọi khi, số liệu từ bộ khung đánh giá của nhà cung cấp thường lạc quan; hãy tự xác thực trên khối lượng công việc của bạn.

Định giá: con số làm thay đổi ngân sách

Trên OrcaRouter, nền tảng chuyển tiếp giá nhà cung cấp mà không cộng thêm phần trăm lợi nhuận, V4 Flash có giá khoảng 0,15 USD cho mỗi triệu token đầu vào và 0,29 USD cho mỗi triệu token đầu ra, với lượt đọc cache khoảng 0,02 USD — và DeepSeek giữ mức giá thấp trong bản phát hành này (không tăng giá cho bản nâng cấp). Đó là khoảng một phần ba so với mức 0,44 USD / 0,88 USD của DeepSeek V4 Pro. Nói theo con số thực tế: 10 triệu token mỗi tháng với tỷ lệ 70% đầu vào / 30% đầu ra chỉ tốn vài đô la trên V4 Flash; nếu mở rộng lên một tỷ token, khoảng cách so với một mẫu flagship sẽ trở thành một khoản mục mà bộ phận tài chính phải để ý. Bộ nhớ đệm prompt còn cắt giảm thêm chi phí cho các agent và hội thoại có system prompt ổn định, vì đầu vào được lưu trong cache được tính phí chỉ bằng khoảng một phần mười so với đầu vào mới. Khả năng agentic rẻ hơn ở cùng mức giá thấp chính là toàn bộ điểm nhấn của bản phát hành này.

Vị trí của V4 Flash: bậc thang DeepSeek V4

Dòng V4 của DeepSeek là một chiếc thang. V4 Pro là mẫu đầu bảng — một mô hình lớn hơn nhiều, thuộc phân khúc cao cấp nhất, chuyên về suy luận và viết mã. V4 Flash là phân khúc hiệu quả: cần ít tính toán chủ động hơn nhiều, giá chỉ bằng một phần nhỏ, và sau đợt nâng cấp hậu huấn luyện này, sở hữu khả năng tác tử và viết mã thực sự mạnh mẽ. Việc DeepSeek đầu tư để biến Flash thành một tác tử tốt hơn (Responses API, khả năng thích ứng với Codex, các benchmark sử dụng công cụ) cho bạn biết họ kỳ vọng lưu lượng sẽ chạy ở đâu: lưu lượng tác tử và viết mã hàng ngày trên Flash, còn những bài toán suy luận khó nhất dành riêng cho Pro. Điều đó phản ánh mô hình chung của toàn ngành — mặc định dùng bản giá rẻ cộng với bản cao cấp đầu bảng — và đó là lý do vì sao định tuyến theo độ khó tốt hơn việc mặc định dùng mô hình lớn nhất.

Ba tình huống thực tế

1. Tác nhân lập trình và quy trình làm việc kiểu Codex

Bản dựng -0731 hỗ trợ native Responses-API và Codex, cùng với điểm số Terminal-Bench (82.7) và DSBench-FullStack (68.7), khiến V4 Flash trở thành engine mạnh mẽ, giá rẻ cho các tác tử lập trình tự động — sửa lỗi, refactor, sinh test, sử dụng công cụ đa bước.

2. Tác nhân sử dụng công cụ quy mô lớn

Tốc độ token đầu tiên nhanh (~394 ms), thông lượng cao (~184 tok/s), ngữ cảnh 1M và độ tin cậy Toolathlon (70.3) mạnh mẽ phù hợp với các agent sản xuất gọi công cụ ở quy mô lớn — truy xuất, tự động hóa, điều phối.

3. Xử lý tài liệu dài với ngân sách hạn chế

Ngữ cảnh đầy đủ 1M token và đầu ra 384K xử lý việc tóm tắt, phân tích hoặc chuyển đổi các đầu vào rất lớn — nhật ký, mã nguồn, báo cáo dài — trong một lần duy nhất, với chi phí thấp.

Cách truy cập V4 Flash

Bạn có thể gọi V4 Flash trực tiếp trên API của DeepSeek (mã model: code>deepseek-v4-flash/code>; nó hỗ trợ Responses API, OpenAI ChatCompletions và giao diện kiểu Anthropic), hoặc thông qua một endpoint trung lập với nhà cung cấp. a href="https://www.orcarouter.ai/">OrcaRouter/a> cung cấp V4 Flash với mức phụ phí 0% thông qua một endpoint tương thích OpenAI duy nhất (code>deepseek/deepseek-v4-flash/code>) cùng với hơn 185 mô hình khác — vì vậy bạn có thể so sánh hiệu năng của nó với GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 và Kimi K3 tại một nơi, và định tuyến từng yêu cầu đến bất kỳ mô hình nào rẻ nhất cho công việc đó. Vì nó tương thích với OpenAI, việc áp dụng V4 Flash — hoặc chuyển khỏi nó — là một thay đổi cấu hình, không phải tích hợp lại.

Những hạn chế và những lưu ý trung thực

V4 Flash là mô hình tối ưu hiệu suất, không phải mô hình chủ lực: ở những bài suy luận khó nhất, nó xếp sau V4 Pro và các mô hình hàng đầu phương Tây. Đầu vào chỉ hỗ trợ văn bản (không có đầu vào hình ảnh gốc). Điểm benchmark tại đây do DeepSeek tự công bố bằng bộ công cụ riêng của họ, vì vậy hãy coi các con số cụ thể chỉ mang tính tham khảo và kỳ vọng rằng các đánh giá độc lập sẽ thấp hơn phần nào. Và "rẻ trên mỗi token" không đồng nghĩa với "rẻ trên mỗi tác vụ" nếu bạn để các vòng suy luận hoặc agent chạy quá lâu — hãy giới hạn mức suy luận và số lần lặp công cụ đối với các lời gọi đơn giản. Hãy xác thực trên khối lượng công việc của chính bạn trước khi đưa vào lưu lượng sản xuất.

Câu hỏi thường gặp

DeepSeek V4 Flash là gì?

Mô hình hiệu suất của DeepSeek trong dòng V4: mô hình hỗn hợp chuyên gia 284B / 13B kích hoạt, ngữ cảnh 1M token, đầu ra lên đến 384K, được tối ưu cho công việc lập trình và tác nhân tốc độ cao, khối lượng lớn. Bản phát hành chính thức (build -0731) ra mắt vào ngày 31 tháng 7 năm 2026.

Điều gì đã thay đổi trong bản phát hành chính thức?

Kiến trúc không thay đổi; đây là bản nâng cấp hậu huấn luyện giúp cải thiện đáng kể khả năng agentic, coding và gọi công cụ, đồng thời bổ sung hỗ trợ Responses-API gốc với khả năng thích ứng Codex. Chỉ có Flash API được nâng cấp — V4 Pro và app/web vẫn giữ nguyên.

V4 Flash giá bao nhiêu?

Khoảng $0,15 cho mỗi triệu token đầu vào và $0,29 cho mỗi triệu token đầu ra trên OrcaRouter (0% phụ phí), với ~$0,02 cho lượt đọc cache — tức khoảng một phần ba so với mức $0,44 / $0,88 của V4 Pro. Mức giá vẫn duy trì ở mức thấp trong bản phát hành này.

V4 Flash tốt đến mức nào trong các tác vụ agentic và lập trình?

DeepSeek báo cáo điểm số ấn tượng: Terminal-Bench 2.1 82.7, Toolathlon (đã xác minh) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — tất cả đều là số liệu từ bộ khung của nhà cung cấp, vì vậy hãy tự kiểm chứng trên các tác vụ của bạn.

V4 Flash so với V4 Pro thì như thế nào?

Pro là flagship lớn hơn nhiều dành cho các tác vụ suy luận và viết mã khó nhất; Flash là phân khúc hiệu quả với giá chỉ bằng ~1/3, có khả năng agentic/viết mã mạnh mẽ. Hãy định tuyến các tác vụ khó đến Pro, mọi thứ còn lại đến Flash.

Cửa sổ ngữ cảnh là gì?

Đầy đủ 1.048.576 token (khoảng 1 triệu), với tối đa 384K token đầu ra.

V4 Flash có đa phương thức không?

Không — đầu vào chỉ là văn bản. Nó hỗ trợ suy luận, gọi công cụ và đầu ra JSON.

V4 Flash có hoạt động với Responses API và Codex không?

Vâng — bản phát hành -0731 bổ sung hỗ trợ Responses-API gốc và khả năng thích ứng Codex cụ thể, bên cạnh các giao diện kiểu OpenAI ChatCompletions và Anthropic.

Làm cách nào để sử dụng V4 Flash?

Trực tiếp qua API của DeepSeek, hoặc qua endpoint tương thích OpenAI của OrcaRouter với mức phụ phí 0% (code>deepseek/deepseek-v4-flash/code>), nơi bạn cũng có thể so sánh và định tuyến qua các mô hình đối thủ.

Kết luận

Bản phát hành chính thức của DeepSeek V4 Flash vẫn giữ công thức rẻ, nhanh và biến nó thành một agent tốt hơn nhiều: vẫn là MoE 284B / 13B-active với ngữ cảnh 1M, nhưng được hậu huấn luyện để lập trình và sử dụng công cụ mạnh hơn, có hỗ trợ gốc Responses-API và Codex — với mức giá ~$0,15 / $0,29 tương tự. Nó không phải flagship và không đa phương thức, nhưng với đại đa số các tác vụ agentic, lập trình và xử lý tài liệu dài, đây là một trong những lựa chọn có giá trị trên mỗi token tốt nhất trong năm 2026. Hãy thử nó qua một endpoint tương thích OpenAI, không phụ phí như OrcaRouter, và định tuyến phần thiểu số yêu cầu khó nhất lên một flagship — sự kết hợp đó khó có thể bị đánh bại về chi phí.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube