
DeepSeek V4 Flash chính thức phát hành: Giải thích về mô hình ngữ cảnh 1 triệu token rẻ, nhanh và agentic
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 224 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicMỚIAnthropic: Claude Opus 52026-07-2461Trí tuệ78Lập trình
- googleMỚIGoogle: Gemini 3.6 Flash2026-07-2150Trí tuệ69Lập trình
- googleMỚIGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1651Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1557Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0854Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0641Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3053Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1651Trí tuệ69Lập trình60Toán
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Trí tuệ61Lập trình61Toán
- anthropicAnthropic: Claude Fable 52026-06-0960Trí tuệ77Lập trình
- qwenQwen: Qwen3.7 Plus2026-06-0139Trí tuệ56Lập trình59Toán
Mô hình tối ưu hiệu suất của DeepSeek, V4 Flash, đã chuyển từ bản preview sang bản phát hành public-beta chính thức — bản build code>-0731/code> được phát hành vào ngày 31 tháng 7 năm 2026. Kiến trúc không thay đổi (vẫn là mô hình mixture-of-experts với 284 tỷ tham số và ngữ cảnh 1 triệu token), nhưng một đợt post-training bổ sung đã cải thiện đáng kể khả năng agentic, lập trình và gọi công cụ, và giờ đây mô hình hỗ trợ nguyên bản Responses API với các tùy biến cụ thể cho các agent kiểu Codex. Hướng dẫn này giải thích V4 Flash là gì, bản phát hành chính thức thực sự nâng cấp những gì, cách đọc các benchmark (do DeepSeek công bố), chi phí và cách sử dụng — mọi con số đều được ghi rõ nguồn.
Lưu ý về độ chính xác: chi tiết phát hành và điểm benchmark dưới đây lấy từ nhật ký thay đổi API chính thức của DeepSeek (ngày 2026-07-31); kiến trúc, ngữ cảnh và giá cả được đối chiếu chéo với trang mô hình của OrcaRouter; các chỉ số tổng hợp từ Artificial Analysis là độc lập. Các benchmark do DeepSeek công bố sử dụng cấu hình harness của riêng họ — hãy xem chúng là số liệu của nhà cung cấp và tự chạy bài đánh giá của bạn. Thông số kỹ thuật và giá cả có thể thay đổi; hãy kiểm tra trước khi xây dựng.
TL;DR. V4 Flash là phiên bản anh em tiết kiệm chi phí của gã khổng lồ DeepSeek V4 Pro: mô hình MoE 284B / 13B active với ngữ cảnh 1M token và đầu ra lên tới 384K, được tối ưu cho các tác vụ tác tử khối lượng lớn, độ trễ thấp. Bản phát hành chính thức ngày 31/7 là bản nâng cấp hậu huấn luyện — cùng kích thước, tác tử và khả năng lập trình tốt hơn đáng kể — đồng thời bổ sung hỗ trợ gốc cho Responses-API và Codex. DeepSeek công bố điểm số tác tử/lập trình cao (ví dụ: Terminal-Bench 2.1 đạt 82,7, Toolathlon đạt 70,3) và chi phí khoảng $0,15 / $0,29 mỗi triệu token đầu vào/đầu ra, tức khoảng một phần ba giá của V4 Pro. Chỉ có API Flash được nâng cấp; V4 Pro và ứng dụng/web DeepSeek không thay đổi. Trên OrcaRouter, bạn nhận được nó với mức phụ phí 0% thông qua một điểm cuối tương thích OpenAI.
Những điểm chính rút ra
• Bản phát hành chính thức (build -0731, ngày 31 tháng 7 năm 2026): bản nâng cấp sau huấn luyện của bản xem trước — cùng kiến trúc, nhưng mạnh hơn nhiều về agent, khả năng lập trình và sử dụng công cụ.
• Kiến trúc không thay đổi: tổng 284B / 13B hoạt động (MoE), ngữ cảnh 1M token (1.048.576), đầu ra lên đến 384K, đầu vào chỉ văn bản, hỗ trợ suy luận, công cụ và JSON.
• Mới: hỗ trợ nguyên bản API Responses kèm khả năng thích ứng riêng cho Codex; vẫn tiếp tục hỗ trợ giao diện kiểu OpenAI ChatCompletions và Anthropic. ID mô hình code>deepseek-v4-flash/code>.
• DeepSeek báo cáo các cải thiện về tác nhân/lập trình: Terminal-Bench 2.1 82.7, Toolathlon (đã xác minh) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.
• Rất rẻ: khoảng $0,15 / $0,29 cho mỗi 1M token đầu vào/đầu ra cùng ~$0,02 cho đọc cache (OrcaRouter, 0% phụ phí) — khoảng một phần ba so với mức $0,44 / $0,88 của V4 Pro. Chỉ có Flash API thay đổi; Pro và app/web vẫn như cũ.
Những gì bản phát hành chính thức thực sự nâng cấp
V4 Flash lần đầu xuất hiện dưới dạng bản xem trước vào ngày 24 tháng 4 năm 2026. Bản phát hành chính thức ngày 31 tháng 7 năm 2026 (bản code>-0731/code>, theo nhật ký thay đổi API của DeepSeek) rõ ràng không phải là một kiến trúc mới: tổng tham số và tham số hoạt động (284B / 13B) cùng ngữ cảnh 1M không thay đổi. Điều thay đổi nằm ở khâu hậu huấn luyện — tinh chỉnh bổ sung mà DeepSeek cho biết đã cải thiện đáng kể các khả năng cốt lõi về tác tử, lập trình và gọi công cụ. Hai điểm bổ sung thực tế đáng chú ý: V4 Flash hiện hỗ trợ nguyên bản Responses API và được tối ưu riêng cho các tác tử lập trình kiểu Codex, trong khi vẫn hỗ trợ các giao diện OpenAI ChatCompletions và kiểu Anthropic. Điều quan trọng là chỉ có API Flash được nâng cấp trong bản phát hành này; V4 Pro và các trải nghiệm ứng dụng/web của DeepSeek không thay đổi. Đối với các nhóm phát triển, điều đó có nghĩa là cải thiện trực tiếp cho các khối lượng công việc tác tử ở cùng mức giá mà không cần migration.

Kiến trúc: MoE kích hoạt nhỏ được tối ưu cho thông lượng
V4 Flash là mô hình hỗn hợp chuyên gia (mixture-of-experts) với tổng cộng khoảng 284 tỷ tham số nhưng chỉ có khoảng 13 tỷ tham số hoạt động cho mỗi token. Số lượng tham số hoạt động thấp đó chính là điểm mấu chốt: nó giúp suy luận nhanh và rẻ trong khi một nhóm chuyên gia lớn vẫn duy trì chất lượng. Cửa sổ ngữ cảnh lên tới 1.048.576 token (khoảng 1M), với đầu ra tối đa rất lớn 384K, và mô hình hỗ trợ suy luận (tư duy mở rộng), gọi công cụ, và JSON có cấu trúc. Đầu vào chỉ là văn bản. Mục tiêu thiết kế — khối lượng lớn, độ trễ thấp, tác vụ agent — được thể hiện qua các số liệu phục vụ: thời gian đến token đầu tiên ở phân vị p50 khoảng 394 mili giây và đầu ra khoảng 184 token mỗi giây theo đo lường của OrcaRouter.
Điểm chuẩn: những con số chính thức nói lên điều gì
Bản phát hành chính thức nhấn mạnh nhiều vào các bài đánh giá tác nhân và lập trình, được chạy bằng khung đánh giá riêng của DeepSeek (cài đặt minimal-mode / max-effort). Dưới đây là cách đọc các kết quả nổi bật, tất cả đều do DeepSeek công bố:
• Terminal-Bench 2.1: 82.7 — các tác vụ dòng lệnh/phần mềm mang tính tác nhân trong một terminal thực. Điểm số cao ở đây cho thấy mô hình có thể thực sự điều khiển các công cụ và shell, chứ không chỉ trả lời câu hỏi.
• Toolathlon (đã xác minh): 70.3 và Automation Bench (Công khai): 25.1 — độ bao phủ và độ tin cậy của việc sử dụng công cụ cũng như tự động hóa đầu cuối. Độ tin cậy khi gọi công cụ chính là đặc điểm quyết định thành bại của các tác nhân.
• Cybergym: 76.7 — giải quyết vấn đề kiểu tác tử bảo mật/CTF.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — kỹ thuật phần mềm và lập trình full-stack, từ tạo mã ở cấp kho lưu trữ đến các tác vụ khoa học dữ liệu khó. Điểm DSBench-FullStack (68.7) cao cho thấy năng lực lập trình đa tệp thực tế.
• Agent Last Exam: 25.2 — một bài kiểm tra suy luận tác nhân khó một cách cố ý, nơi ngay cả các mô hình hàng đầu cũng đạt điểm thấp; hữu ích như một tín hiệu tương đối, không phải tuyệt đối.
Để có bối cảnh độc lập, Artificial Analysis (đánh giá vào 2026-06-25, bản preview) xếp V4 Flash ở mức khoảng 56.2 AA Coding, 40.3 AA Intelligence và 50.0 AA Math — một mô hình đa năng thiên về lập trình, trên mức trung bình của nhóm mô hình mở. Đợt tinh chỉnh sau huấn luyện chính thức nhắm thẳng vào trục agentic/lập trình, vì vậy hãy kỳ vọng bản mới hơn sẽ mạnh hơn rõ rệt ở chính những tác vụ đó. Như mọi khi, số liệu từ bộ khung đánh giá của nhà cung cấp thường lạc quan; hãy tự xác thực trên khối lượng công việc của bạn.
Định giá: con số làm thay đổi ngân sách
Trên OrcaRouter, nền tảng chuyển tiếp giá nhà cung cấp mà không cộng thêm phần trăm lợi nhuận, V4 Flash có giá khoảng 0,15 USD cho mỗi triệu token đầu vào và 0,29 USD cho mỗi triệu token đầu ra, với lượt đọc cache khoảng 0,02 USD — và DeepSeek giữ mức giá thấp trong bản phát hành này (không tăng giá cho bản nâng cấp). Đó là khoảng một phần ba so với mức 0,44 USD / 0,88 USD của DeepSeek V4 Pro. Nói theo con số thực tế: 10 triệu token mỗi tháng với tỷ lệ 70% đầu vào / 30% đầu ra chỉ tốn vài đô la trên V4 Flash; nếu mở rộng lên một tỷ token, khoảng cách so với một mẫu flagship sẽ trở thành một khoản mục mà bộ phận tài chính phải để ý. Bộ nhớ đệm prompt còn cắt giảm thêm chi phí cho các agent và hội thoại có system prompt ổn định, vì đầu vào được lưu trong cache được tính phí chỉ bằng khoảng một phần mười so với đầu vào mới. Khả năng agentic rẻ hơn ở cùng mức giá thấp chính là toàn bộ điểm nhấn của bản phát hành này.
Vị trí của V4 Flash: bậc thang DeepSeek V4
Dòng V4 của DeepSeek là một chiếc thang. V4 Pro là mẫu đầu bảng — một mô hình lớn hơn nhiều, thuộc phân khúc cao cấp nhất, chuyên về suy luận và viết mã. V4 Flash là phân khúc hiệu quả: cần ít tính toán chủ động hơn nhiều, giá chỉ bằng một phần nhỏ, và sau đợt nâng cấp hậu huấn luyện này, sở hữu khả năng tác tử và viết mã thực sự mạnh mẽ. Việc DeepSeek đầu tư để biến Flash thành một tác tử tốt hơn (Responses API, khả năng thích ứng với Codex, các benchmark sử dụng công cụ) cho bạn biết họ kỳ vọng lưu lượng sẽ chạy ở đâu: lưu lượng tác tử và viết mã hàng ngày trên Flash, còn những bài toán suy luận khó nhất dành riêng cho Pro. Điều đó phản ánh mô hình chung của toàn ngành — mặc định dùng bản giá rẻ cộng với bản cao cấp đầu bảng — và đó là lý do vì sao định tuyến theo độ khó tốt hơn việc mặc định dùng mô hình lớn nhất.

Ba tình huống thực tế
1. Tác nhân lập trình và quy trình làm việc kiểu Codex
Bản dựng -0731 hỗ trợ native Responses-API và Codex, cùng với điểm số Terminal-Bench (82.7) và DSBench-FullStack (68.7), khiến V4 Flash trở thành engine mạnh mẽ, giá rẻ cho các tác tử lập trình tự động — sửa lỗi, refactor, sinh test, sử dụng công cụ đa bước.
2. Tác nhân sử dụng công cụ quy mô lớn
Tốc độ token đầu tiên nhanh (~394 ms), thông lượng cao (~184 tok/s), ngữ cảnh 1M và độ tin cậy Toolathlon (70.3) mạnh mẽ phù hợp với các agent sản xuất gọi công cụ ở quy mô lớn — truy xuất, tự động hóa, điều phối.
3. Xử lý tài liệu dài với ngân sách hạn chế
Ngữ cảnh đầy đủ 1M token và đầu ra 384K xử lý việc tóm tắt, phân tích hoặc chuyển đổi các đầu vào rất lớn — nhật ký, mã nguồn, báo cáo dài — trong một lần duy nhất, với chi phí thấp.
Cách truy cập V4 Flash
Bạn có thể gọi V4 Flash trực tiếp trên API của DeepSeek (mã model: code>deepseek-v4-flash/code>; nó hỗ trợ Responses API, OpenAI ChatCompletions và giao diện kiểu Anthropic), hoặc thông qua một endpoint trung lập với nhà cung cấp. a href="https://www.orcarouter.ai/">OrcaRouter/a> cung cấp V4 Flash với mức phụ phí 0% thông qua một endpoint tương thích OpenAI duy nhất (code>deepseek/deepseek-v4-flash/code>) cùng với hơn 185 mô hình khác — vì vậy bạn có thể so sánh hiệu năng của nó với GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 và Kimi K3 tại một nơi, và định tuyến từng yêu cầu đến bất kỳ mô hình nào rẻ nhất cho công việc đó. Vì nó tương thích với OpenAI, việc áp dụng V4 Flash — hoặc chuyển khỏi nó — là một thay đổi cấu hình, không phải tích hợp lại.

Những hạn chế và những lưu ý trung thực
V4 Flash là mô hình tối ưu hiệu suất, không phải mô hình chủ lực: ở những bài suy luận khó nhất, nó xếp sau V4 Pro và các mô hình hàng đầu phương Tây. Đầu vào chỉ hỗ trợ văn bản (không có đầu vào hình ảnh gốc). Điểm benchmark tại đây do DeepSeek tự công bố bằng bộ công cụ riêng của họ, vì vậy hãy coi các con số cụ thể chỉ mang tính tham khảo và kỳ vọng rằng các đánh giá độc lập sẽ thấp hơn phần nào. Và "rẻ trên mỗi token" không đồng nghĩa với "rẻ trên mỗi tác vụ" nếu bạn để các vòng suy luận hoặc agent chạy quá lâu — hãy giới hạn mức suy luận và số lần lặp công cụ đối với các lời gọi đơn giản. Hãy xác thực trên khối lượng công việc của chính bạn trước khi đưa vào lưu lượng sản xuất.
Câu hỏi thường gặp
DeepSeek V4 Flash là gì?
Mô hình hiệu suất của DeepSeek trong dòng V4: mô hình hỗn hợp chuyên gia 284B / 13B kích hoạt, ngữ cảnh 1M token, đầu ra lên đến 384K, được tối ưu cho công việc lập trình và tác nhân tốc độ cao, khối lượng lớn. Bản phát hành chính thức (build -0731) ra mắt vào ngày 31 tháng 7 năm 2026.
Điều gì đã thay đổi trong bản phát hành chính thức?
Kiến trúc không thay đổi; đây là bản nâng cấp hậu huấn luyện giúp cải thiện đáng kể khả năng agentic, coding và gọi công cụ, đồng thời bổ sung hỗ trợ Responses-API gốc với khả năng thích ứng Codex. Chỉ có Flash API được nâng cấp — V4 Pro và app/web vẫn giữ nguyên.
V4 Flash giá bao nhiêu?
Khoảng $0,15 cho mỗi triệu token đầu vào và $0,29 cho mỗi triệu token đầu ra trên OrcaRouter (0% phụ phí), với ~$0,02 cho lượt đọc cache — tức khoảng một phần ba so với mức $0,44 / $0,88 của V4 Pro. Mức giá vẫn duy trì ở mức thấp trong bản phát hành này.
V4 Flash tốt đến mức nào trong các tác vụ agentic và lập trình?
DeepSeek báo cáo điểm số ấn tượng: Terminal-Bench 2.1 82.7, Toolathlon (đã xác minh) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — tất cả đều là số liệu từ bộ khung của nhà cung cấp, vì vậy hãy tự kiểm chứng trên các tác vụ của bạn.
V4 Flash so với V4 Pro thì như thế nào?
Pro là flagship lớn hơn nhiều dành cho các tác vụ suy luận và viết mã khó nhất; Flash là phân khúc hiệu quả với giá chỉ bằng ~1/3, có khả năng agentic/viết mã mạnh mẽ. Hãy định tuyến các tác vụ khó đến Pro, mọi thứ còn lại đến Flash.
Cửa sổ ngữ cảnh là gì?
Đầy đủ 1.048.576 token (khoảng 1 triệu), với tối đa 384K token đầu ra.
V4 Flash có đa phương thức không?
Không — đầu vào chỉ là văn bản. Nó hỗ trợ suy luận, gọi công cụ và đầu ra JSON.
V4 Flash có hoạt động với Responses API và Codex không?
Vâng — bản phát hành -0731 bổ sung hỗ trợ Responses-API gốc và khả năng thích ứng Codex cụ thể, bên cạnh các giao diện kiểu OpenAI ChatCompletions và Anthropic.
Làm cách nào để sử dụng V4 Flash?
Trực tiếp qua API của DeepSeek, hoặc qua endpoint tương thích OpenAI của OrcaRouter với mức phụ phí 0% (code>deepseek/deepseek-v4-flash/code>), nơi bạn cũng có thể so sánh và định tuyến qua các mô hình đối thủ.
Kết luận
Bản phát hành chính thức của DeepSeek V4 Flash vẫn giữ công thức rẻ, nhanh và biến nó thành một agent tốt hơn nhiều: vẫn là MoE 284B / 13B-active với ngữ cảnh 1M, nhưng được hậu huấn luyện để lập trình và sử dụng công cụ mạnh hơn, có hỗ trợ gốc Responses-API và Codex — với mức giá ~$0,15 / $0,29 tương tự. Nó không phải flagship và không đa phương thức, nhưng với đại đa số các tác vụ agentic, lập trình và xử lý tài liệu dài, đây là một trong những lựa chọn có giá trị trên mỗi token tốt nhất trong năm 2026. Hãy thử nó qua một endpoint tương thích OpenAI, không phụ phí như OrcaRouter, và định tuyến phần thiểu số yêu cầu khó nhất lên một flagship — sự kết hợp đó khó có thể bị đánh bại về chi phí.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
