
DeepSeek V4 Flash chính thức phát hành: Giải thích về mô hình ngữ cảnh 1 triệu token rẻ, nhanh và agentic
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
DeepSeek V4 Flash là bản giá rẻ trong thang sản phẩm V4 của DeepSeek, và các số liệu đo lường độc lập cuối cùng cũng đã bắt kịp với nó: trên bộ đề AIME 2026 của MathArena, mô hình đạt 95,83%, không khác biệt về mặt thống kê so với mức 96,67% của DeepSeek V4 Pro, trong khi chi phí mỗi bài toán chỉ bằng khoảng một phần chín. Bản dựng public-beta chính thức, -0731, được phát hành ngày 31 tháng 7 năm 2026 với kiến trúc giống hệt bản xem trước tháng 4 — mô hình hỗn hợp chuyên gia 284 tỷ tham số, 13B tham số hoạt động, ngữ cảnh 1 triệu token — nhưng có thêm một vòng hậu huấn luyện bổ sung giúp cải thiện rõ rệt khả năng tác tử, lập trình và gọi công cụ, cùng với hỗ trợ API Responses gốc và các điều chỉnh dành riêng cho tác tử kiểu Codex. Hướng dẫn này bao gồm những gì bản phát hành thực sự thay đổi, đánh giá của nhà cung cấp và của bên độc lập mỗi bên nói gì, chi phí thực tế khi tính đến mức độ suy luận của mô hình, và cách gọi mô hình.
{{1}}Lưu ý về độ chính xác:{{/1}} các {{2}}chi tiết phát hành và điểm số agentic nổi bật{{/2}} dưới đây lấy từ nhật ký thay đổi API chính thức của {{3}}DeepSeek{{/3}} (ngày 31/07/2026) và do nhà cung cấp tự báo cáo, chạy trên harness (bộ đánh giá) của chính DeepSeek — hãy coi chúng chỉ mang tính định hướng và tự chạy đánh giá của riêng bạn. Các số liệu độc lập được ghi rõ nguồn tại nơi chúng xuất hiện: {{4}}Artificial Analysis{{/4}} cho {{5}}Intelligence Index{{/5}} và các thành phần của nó, {{6}}MathArena{{/6}} cho AIME 2026, bảng giá của chính {{7}}DeepSeek{{/7}} cho phần giá cả. Khi một thông tin dựa trên báo cáo của một chuyên gia thực hành đơn lẻ thay vì một đánh giá đã công bố, câu đó sẽ nêu rõ điều đó. {{8}}Thông số kỹ thuật và giá cả có thể thay đổi; hãy kiểm chứng trước khi xây dựng.{{/8}}
TL;DR. V4 Flash là {{1}}phiên bản anh em tiết kiệm chi phí{{/1}} của gã khổng lồ DeepSeek V4 Pro: một MoE 284B / 13B-kích hoạt với ngữ cảnh 1M token và đầu ra lên tới 384K, được tối ưu hóa cho các công việc tác tử khối lượng lớn, độ trễ thấp. Bản phát hành chính thức ngày 31 tháng 7 là một {{2}}bản nâng cấp sau huấn luyện{{/2}} — cùng kích thước, nhưng cải thiện đáng kể về tác tử và lập trình — đồng thời bổ sung hỗ trợ gốc cho Responses-API và Codex. DeepSeek báo cáo điểm số tác tử/lập trình ấn tượng (ví dụ: Terminal-Bench 2.1 đạt 82,7; Toolathlon đạt 70,3), và Artificial Analysis sau đó đã chấm bản dựng -0731 đạt 50 điểm trên Intelligence Index của họ: {{3}}cao hơn bản xem trước tháng 4 mười điểm{{/3}}, cao hơn sáu điểm so với V4 Pro vốn lớn hơn nhiều, và ngang bằng với Gemini 3.6 Flash. Chi phí khoảng $0,15 / $0,29 cho mỗi triệu token đầu vào/đầu ra, tức khoảng một phần ba giá của V4 Pro. Chỉ Flash API được nâng cấp; V4 Pro và ứng dụng/web DeepSeek không thay đổi. Trên OrcaRouter, bạn nhận được nó với mức phụ phí 0% thông qua một endpoint tương thích OpenAI.
Những điểm chính rút ra
• Bản phát hành chính thức (build -0731, ngày 31 tháng 7 năm 2026): bản nâng cấp sau huấn luyện của bản xem trước — cùng kiến trúc, nhưng mạnh hơn nhiều về agent, khả năng lập trình và sử dụng công cụ.
• Kiến trúc không thay đổi: tổng 284B / 13B hoạt động (MoE), ngữ cảnh 1M token (1.048.576), đầu ra lên đến 384K, đầu vào chỉ văn bản, hỗ trợ suy luận, công cụ và JSON.
• Mới: hỗ trợ trực tiếp Responses API cùng với khả năng thích ứng riêng cho Codex; tiếp tục hỗ trợ các giao diện kiểu OpenAI ChatCompletions và Anthropic. ID mô hình deepseek-v4-flash.
• DeepSeek báo cáo các cải thiện về tác nhân/lập trình: Terminal-Bench 2.1 82.7, Toolathlon (đã xác minh) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.
• Rất rẻ: khoảng $0.15 / $0.29 cho mỗi 1M token đầu vào/đầu ra — gần bằng một phần ba mức $0.44 / $0.88 của V4 Pro — và DeepSeek định giá cache hits ở mức $0.0028 cho mỗi 1M, thấp hơn khoảng 98% so với input mới. Chỉ có Flash API thay đổi; Pro và app/web vẫn như cũ.
Những gì bản phát hành chính thức thực sự nâng cấp
V4 Flash lần đầu xuất hiện dưới dạng bản xem trước vào ngày 24 tháng 4 năm 2026. Bản phát hành chính thức ngày 31 tháng 7 năm 2026 (bản -0731 build, theo nhật ký thay đổi API của DeepSeek) rõ ràng không phải một kiến trúc mới: tổng và tham số hoạt động (284B / 13B) cùng ngữ cảnh 1M không thay đổi. Điều thay đổi là giai đoạn hậu huấn luyện — tinh chỉnh bổ sung mà DeepSeek cho biết đã cải thiện đáng kể các khả năng agentic, lập trình và gọi công cụ cốt lõi. Hai bổ sung thực tế đáng chú ý: V4 Flash hiện hỗ trợ nguyên bản Responses API và được điều chỉnh riêng cho các tác nhân lập trình kiểu Codex, đồng thời vẫn tương thích với giao diện OpenAI ChatCompletions và kiểu Anthropic. Quan trọng là chỉ có Flash API được nâng cấp trong bản phát hành này; V4 Pro và trải nghiệm ứng dụng/web của DeepSeek không thay đổi. Đối với các nhóm, điều đó có nghĩa là cải thiện thay thế trực tiếp cho khối lượng công việc agentic ở cùng mức giá, không cần di chuyển.

Kiến trúc: MoE kích hoạt nhỏ được tối ưu cho thông lượng
V4 Flash là mô hình hỗn hợp chuyên gia (mixture-of-experts) với tổng cộng khoảng 284 tỷ tham số nhưng chỉ có khoảng 13 tỷ tham số hoạt động cho mỗi token. Số lượng tham số hoạt động thấp đó chính là điểm mấu chốt: nó giúp suy luận nhanh và rẻ trong khi một nhóm chuyên gia lớn vẫn duy trì chất lượng. Cửa sổ ngữ cảnh lên tới 1.048.576 token (khoảng 1M), với đầu ra tối đa rất lớn 384K, và mô hình hỗ trợ suy luận (tư duy mở rộng), gọi công cụ, và JSON có cấu trúc. Đầu vào chỉ là văn bản. Mục tiêu thiết kế — khối lượng lớn, độ trễ thấp, tác vụ agent — được thể hiện qua các số liệu phục vụ: thời gian đến token đầu tiên ở phân vị p50 khoảng 394 mili giây và đầu ra khoảng 184 token mỗi giây theo đo lường của OrcaRouter.
Điểm chuẩn: những con số chính thức nói lên điều gì
Bản phát hành chính thức nhấn mạnh nhiều vào các bài đánh giá tác nhân và lập trình, được chạy bằng khung đánh giá riêng của DeepSeek (cài đặt minimal-mode / max-effort). Dưới đây là cách đọc các kết quả nổi bật, tất cả đều do DeepSeek công bố:
• Terminal-Bench 2.1: 82.7 — các tác vụ dòng lệnh/phần mềm mang tính tác nhân trong một terminal thực. Điểm số cao ở đây cho thấy mô hình có thể thực sự điều khiển các công cụ và shell, chứ không chỉ trả lời câu hỏi.
• Toolathlon (đã xác minh): 70.3 và Automation Bench (Công khai): 25.1 — độ bao phủ và độ tin cậy của việc sử dụng công cụ cũng như tự động hóa đầu cuối. Độ tin cậy khi gọi công cụ chính là đặc điểm quyết định thành bại của các tác nhân.
• Cybergym: 76.7 — giải quyết vấn đề kiểu tác tử bảo mật/CTF.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — kỹ thuật phần mềm và lập trình full-stack, từ tạo mã ở cấp kho lưu trữ đến các tác vụ khoa học dữ liệu khó. Điểm DSBench-FullStack (68.7) cao cho thấy năng lực lập trình đa tệp thực tế.
• Agent Last Exam: 25.2 — một bài kiểm tra suy luận tác nhân khó một cách cố ý, nơi ngay cả các mô hình hàng đầu cũng đạt điểm thấp; hữu ích như một tín hiệu tương đối, không phải tuyệt đối.
Để có bối cảnh độc lập, Artificial Analysis đã tự đánh giá bản build -0731 và chấm cho nó 50 điểm trên Chỉ số Trí tuệ Artificial Analysis — cao hơn 10 điểm so với bản xem trước tháng 4 mà nó thay thế, cao hơn 6 điểm so với V4 Pro vốn lớn hơn nhiều, và ngang hàng với Gemini 3.6 Flash. Kết quả từng thành phần: GPQA Diamond 91%, AA-LCR 66%, Humanity's Last Exam 37%, SciCode 50%, τ³-Bench Banking 31%, CritPt 17%, và Elo 1559 trên GDPval-AA v2. Hai trong số đó đáng được xem xét lại. Artificial Analysis đo Terminal-Bench 2.1 ở mức 79% so với con số 82,7 mà DeepSeek công bố — gần, nhưng thấp hơn, và đó là hướng mà các số liệu đo bằng bộ khung của nhà cung cấp thường bỏ sót. Còn trên AA-Omniscience, mô hình dừng ở -16 với tỷ lệ hallucination đo được cao, nên câu chuyện "rẻ và agentic" không mở rộng được tới khả năng tra cứu sự kiện không giám sát. Đó là cách đọc sắc bén hơn về mô hình này: suy luận mạnh trên mỗi đô la, kiến thức yếu trên mỗi truy vấn.
Toán thi đấu: nơi duy nhất Flash sánh ngang với Pro.
Bài đánh giá độc lập hữu ích nhất về khả năng suy luận của V4 Flash đến từ MathArena, nơi chạy mỗi mô hình bốn lần trên từng bài toán của một kỳ thi mới được phát hành và đăng tải bảng kết quả chi tiết theo từng bài. Tại AIME 2026 — cả hai đề thi, 30 bài toán, mỗi bài chạy bốn lần — V4 Flash ở chế độ suy luận tối đa đạt 95.83% ±3.58%, so với mức 96.67% ±3.21% của DeepSeek V4 Pro. Các khoảng này gần như trùng khớp hoàn toàn: trên benchmark này, mô hình nhỏ không kém hơn mô hình chủ lực một cách đáng kể. Cột chi phí mới là nơi chúng khác biệt. MathArena định giá một lần chạy V4 Flash ở mức $0.009 mỗi bài toán, so với $0.082 cho V4 Pro — rẻ hơn khoảng chín lần với cùng độ chính xác, một lập luận mạnh mẽ hơn cho phân khúc hiệu quả so với bất cứ điều gì trong thông báo của chính DeepSeek.
Hai lưu ý cần được nhắc đến trong cùng một hơi thở. MathArena gắn cờ cả hai mục DeepSeek với cảnh báo nhiễm dữ liệu — nhãn của họ dành cho mô hình được phát hành sau khi cuộc thi xuất hiện — nên một phần độ chính xác đó có thể là ghi nhớ chứ không phải suy luận. Và phiên bản MathArena đã kiểm thử có ngày 2026-04-24 — bản xem trước tháng 4, chứ không phải bản dựng -0731. Tính đến thời điểm viết bài này, chưa có điểm AIME 2026 độc lập nào cho bản phát hành chính thức, và thẻ mô hình của chính DeepSeek cũng không công bố bất kỳ điểm chuẩn toán học nào cho mô hình đó, chỉ có các điểm chuẩn tác nhân.
Bảng lưới cũng cho thấy vị trí của mức trần. Gần như mọi mô hình trên bảng xếp hạng đều vượt qua hầu hết các bài trong AIME 2026; bài toán quyết định thứ hạng chính là bài 15. Chỉ có hai bài dự thi giải được cả bốn lần — GPT-5.5 ở mức nỗ lực cực cao và Claude Opus 4.8 ở mức tối đa. V4 Flash đạt 0/4 ở bài này, và V4 Pro cũng vậy, cùng với GLM-5.2, Gemini 3.6 Flash, Kimi K2.6 và Claude Opus 4.7.
Chi tiết cuối cùng đó chính là điều khiến một báo cáo từ ngày 5 tháng 8 năm 2026 đáng được nêu ra. Nhà bình luận AI @teortaxesTex đã đăng rằng bản dựng -0731 thực sự giải được bài 15 của AIME 2026, mất khoảng 1.006 giây và khoảng 100.000 token đầu ra, đồng thời mô tả mô hình bắt đầu lách luật một cách thấy rõ trước khi từ bỏ lối tắt đó và giải bài một cách trung thực. Đây là một lần chạy đơn lẻ của một người thực hành, không phải kết quả benchmark: nó chưa được tái lập, không có bảng xếp hạng công khai nào chấm điểm bản dựng -0731, và một bản ghi chép đơn độc không phải là một bài đánh giá. Điều có thể kiểm tra là tính nhất quán nội tại, và nó đứng vững — Artificial Analysis đo tốc độ đầu ra của mô hình này ở khoảng 116 token mỗi giây, và 1.006 giây ở tốc độ đó là khoảng 117.000 token, cùng cỡ với con số được báo cáo. Một câu trả lời 100.000 token cũng nằm gọn trong mức mà DeepSeek dự kiến, vì hãng này khuyến nghị cho phép tối đa 384K token đầu ra ở mức suy luận cao hoặc tối đa. Cả hai con số này đều cao gấp khoảng ba lần mức trung bình MathArena đo được cho mô hình này (33.588 token đầu ra và 6 phút 50 giây cho mỗi câu trả lời), điều mà bạn sẽ mong đợi ở bài toán khó nhất trong bộ đề. Vì vậy: hợp lý về hình thức, chưa được xác minh về kết quả, và nếu nó tái lập được thì đây là một bước nhảy thực sự so với bản dựng xem trước, vốn trượt bài đó cả bốn lần trong bốn lần.
Định giá: con số làm thay đổi ngân sách
Trên OrcaRouter, nền tảng chuyển tiếp giá của nhà cung cấp với mức chênh lệch 0%, V4 Flash có giá khoảng 0,15 USD cho mỗi triệu token đầu vào và 0,29 USD cho mỗi triệu token đầu ra, đồng thời DeepSeek giữ nguyên mức giá cho bản nâng cấp này. Mức giá này xấp xỉ một phần ba so với mức 0,44 USD / 0,88 USD của DeepSeek V4 Pro. Chi phí cho cache hit rẻ hơn nhiều so với nhiều người vẫn nghĩ: DeepSeek niêm yết đầu vào được cache ở mức 0,0028 USD mỗi triệu token, thấp hơn khoảng 98% so với đầu vào mới, điều này khiến cho các tác nhân (agent) và trò chuyện với một system prompt ổn định có chi phí vận hành rất rẻ. Nói một cách thực tế, 10 triệu token mỗi tháng với tỷ lệ 70% đầu vào / 30% đầu ra chỉ rơi vào khoảng vài đô la; nếu mở rộng lên một tỷ token, chênh lệch so với một mô hình flagship sẽ trở thành một khoản mục mà bộ phận tài chính phải để ý.
Trên một mô hình suy luận, bảng giá lại là nửa ít thú vị hơn trong hóa đơn — thứ thực sự làm thay đổi ngân sách là số token mà mô hình chọn để tiêu. Artificial Analysis cần khoảng 206 triệu token đầu ra để chạy toàn bộ Intelligence Index trên V4 Flash, gần gấp đôi mức trung vị ~100 triệu của các mô hình họ kiểm thử, và mô tả nó nhanh nhưng rất dài dòng. Tính theo giá, một câu trả lời 100.000 token tốn khoảng ba xu và trần đầu ra 384K giới hạn một câu trả lời ở mức gần mười một xu. Rẻ về giá trị tuyệt đối, nhưng đắt gấp vài trăm lần so với một phản hồi ngắn — đó là lý do vì sao mức độ suy luận là một đòn bẩy ngân sách, chứ không phải một núm chất lượng bạn để kẹp ở mức tối đa. Bài viết trải nghiệm thực tế của Simon Willison cũng nêu cùng một điểm từ hướng ngược lại: ở cài đặt mặc định, kết quả sinh của ông khá thất vọng, và nâng mức độ suy luận lên cao đã cải thiện đáng kể. Hãy đo đếm các yêu cầu nặng của chính bạn trước khi cho rằng mức giá niêm yết là chi phí thực tế của bạn.
Vị trí của V4 Flash: bậc thang DeepSeek V4
Dòng V4 của DeepSeek là một cái thang. V4 Pro là soái hạm — một mô hình suy luận và viết mã lớn hơn nhiều, thuộc phân khúc cao cấp. V4 Flash là phân khúc hiệu quả: lượng tính toán thấp hơn nhiều, giá chỉ bằng một phần nhỏ, và, sau đợt nâng cấp hậu huấn luyện này, thực sự có khả năng tác nhân và viết mã mạnh mẽ. Việc DeepSeek đầu tư để biến Flash trở nên tốt hơn như một tác nhân (Responses API, chuyển thể Codex, điểm chuẩn sử dụng công cụ) cho bạn biết nơi họ kỳ vọng khối lượng sẽ đổ về. Nhưng số liệu AIME 2026 làm phức tạp câu chuyện gọn gàng theo hướng có lợi cho Flash: ở toán thi đấu, hai mô hình nằm trong sai số của nhau, vì vậy việc "chuyển các bài toán khó cho Pro" không tự động đúng. Sự phân định thực sự là Pro mang lại bề rộng kiến thức và những tác vụ tác nhân khó nhất, chứ không phải cơ hội tốt hơn cho một bài toán khó — đó là lý do vì sao định tuyến theo độ khó đo được trên các tác vụ của bạn thắng việc mặc định dùng mô hình lớn nhất.

Ba tình huống thực tế
1. Tác nhân lập trình và quy trình làm việc kiểu Codex
Bản dựng -0731 hỗ trợ native Responses-API và Codex, cùng với điểm số Terminal-Bench (82.7) và DSBench-FullStack (68.7), khiến V4 Flash trở thành engine mạnh mẽ, giá rẻ cho các tác tử lập trình tự động — sửa lỗi, refactor, sinh test, sử dụng công cụ đa bước.
2. Tác nhân sử dụng công cụ quy mô lớn
Tốc độ token đầu tiên nhanh (~394 ms), thông lượng cao (~184 tok/s), ngữ cảnh 1M và độ tin cậy Toolathlon (70.3) mạnh mẽ phù hợp với các agent sản xuất gọi công cụ ở quy mô lớn — truy xuất, tự động hóa, điều phối.
3. Xử lý tài liệu dài với ngân sách hạn chế
Ngữ cảnh đầy đủ 1M token và đầu ra 384K xử lý việc tóm tắt, phân tích hoặc chuyển đổi các đầu vào rất lớn — nhật ký, mã nguồn, báo cáo dài — trong một lần duy nhất, với chi phí thấp.
Cách truy cập V4 Flash
Bạn có thể gọi V4 Flash trực tiếp trên API của DeepSeek (model id deepseek-v4-flash; nó hỗ trợ Responses API, OpenAI ChatCompletions và giao diện kiểu Anthropic), hoặc thông qua một endpoint trung lập với nhà cung cấp. OrcaRouter cung cấp V4 Flash với mức phụ giá 0% thông qua một endpoint tương thích OpenAI duy nhất (deepseek/deepseek-v4-flash) cùng với hơn 200 mô hình khác — nhờ đó bạn có thể so sánh nó với GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen3.8-Max và Kimi K3 tại một nơi, đồng thời định tuyến từng yêu cầu đến phương án rẻ nhất cho công việc. Vì giá được truyền thẳng thay vì bị cộng phụ giá, một thay đổi giá của DeepSeek sẽ về hóa đơn của bạn đúng ngày nó được áp dụng. Và vì giao diện tương thích OpenAI, việc áp dụng V4 Flash — hoặc chuyển khỏi nó sau một tuần đo lường — chỉ là một thay đổi cấu hình, không phải một lần tích hợp lại.

Những hạn chế và những lưu ý trung thực
V4 Flash là một mô hình tối ưu hiệu suất, không phải mô hình hàng đầu, nhưng dữ liệu độc lập đã làm rõ ranh giới đó cụ thể hơn là "kém hơn ở những việc khó." Trên AIME 2026, nó ngang bằng V4 Pro trong khoảng tin cậy; điểm yếu rõ rệt là bề rộng kiến thức — AA-Omniscience -16 và tỷ lệ ảo giác đo được cao — cùng những tác vụ agentic đòi hỏi khắt khe nhất. Đầu vào chỉ hỗ trợ văn bản, không có khả năng nhận diện hình ảnh gốc. Các chỉ số agentic nổi bật là do DeepSeek tự công bố trên bộ đánh giá riêng của họ, và con số duy nhất mà một phòng thí nghiệm độc lập chạy lại cho kết quả thấp hơn (Artificial Analysis đo Terminal-Bench 2.1 ở mức 79% so với mức 82,7% được công bố), vì vậy hãy coi số liệu của nhà cung cấp chỉ mang tính định hướng. Và "rẻ trên mỗi token" không đồng nghĩa với "rẻ trên mỗi tác vụ": mô hình này dài dòng một cách đo lường được, nên hãy giới hạn mức suy luận và số vòng lặp công cụ cho các lệnh gọi đơn giản thay vì để mức tối đa hoạt động mặc định. Hãy kiểm chứng trên khối lượng công việc của riêng bạn trước khi đưa lưu lượng sản xuất vào.
Câu hỏi thường gặp
DeepSeek V4 Flash là gì?
Mô hình hiệu suất của DeepSeek trong dòng V4: mô hình hỗn hợp chuyên gia 284B / 13B kích hoạt, ngữ cảnh 1M token, đầu ra lên đến 384K, được tối ưu cho công việc lập trình và tác nhân tốc độ cao, khối lượng lớn. Bản phát hành chính thức (build -0731) ra mắt vào ngày 31 tháng 7 năm 2026.
Điều gì đã thay đổi trong bản phát hành chính thức?
Kiến trúc không thay đổi; đây là bản nâng cấp hậu huấn luyện giúp cải thiện đáng kể khả năng agentic, coding và gọi công cụ, đồng thời bổ sung hỗ trợ Responses-API gốc với khả năng thích ứng Codex. Chỉ có Flash API được nâng cấp — V4 Pro và app/web vẫn giữ nguyên.
V4 Flash giá bao nhiêu?
Khoảng $0.15 cho mỗi triệu token đầu vào và $0.29 cho mỗi triệu token đầu ra trên OrcaRouter (phụ phí 0%) — xấp xỉ một phần ba mức $0.44 / $0.88 của V4 Pro — với cache hits được liệt kê ở mức $0.0028 mỗi triệu, thấp hơn khoảng 98% so với đầu vào không cache. Giá vẫn giữ nguyên trong bản phát hành này. Hãy dự trù ngân sách cho cả khối lượng token lẫn mức giá: đây là một mô hình suy luận dài dòng, và một câu trả lời 100.000 token sẽ tốn khoảng ba xu.
V4 Flash tốt đến mức nào trong các tác vụ agentic và lập trình?
DeepSeek báo cáo điểm số ấn tượng: Terminal-Bench 2.1 82.7, Toolathlon (đã xác minh) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — tất cả đều là số liệu từ bộ khung của nhà cung cấp, vì vậy hãy tự kiểm chứng trên các tác vụ của bạn.
V4 Flash có giỏi về toán thi đấu không?
Tốt hơn so với mức giá của nó. Trên bảng điểm AIME 2026 của MathArena, bản dựng xem trước tháng 4 đạt 95,83% qua bốn lượt chạy với 30 bài toán — nằm trong khoảng tin cậy của mức 96,67% của V4 Pro, với chi phí mỗi bài toán chỉ bằng khoảng một phần chín — mặc dù MathArena đánh dấu cả hai mô hình vì nguy cơ nhiễm dữ liệu, và họ vẫn chưa chấm điểm bản dựng -0731. Bài toán duy nhất mà nó không bao giờ giải được là bài 15, vốn chỉ có GPT-5.5 ở mức nỗ lực cực cao và Claude Opus 4.8 ở mức tối đa mới giải được một cách đáng tin cậy.
V4 Flash so với V4 Pro thì như thế nào?
Pro là flagship lớn hơn nhiều dành cho các tác vụ suy luận và viết mã khó nhất; Flash là phân khúc hiệu quả với giá chỉ bằng ~1/3, có khả năng agentic/viết mã mạnh mẽ. Hãy định tuyến các tác vụ khó đến Pro, mọi thứ còn lại đến Flash.
Cửa sổ ngữ cảnh là gì?
Đầy đủ 1.048.576 token (khoảng 1 triệu), với tối đa 384K token đầu ra.
V4 Flash có đa phương thức không?
Không — đầu vào chỉ là văn bản. Nó hỗ trợ suy luận, gọi công cụ và đầu ra JSON.
V4 Flash có hoạt động với Responses API và Codex không?
Vâng — bản phát hành -0731 bổ sung hỗ trợ Responses-API gốc và khả năng thích ứng Codex cụ thể, bên cạnh các giao diện kiểu OpenAI ChatCompletions và Anthropic.
Làm cách nào để sử dụng V4 Flash?
Trực tiếp qua API của DeepSeek, hoặc thông qua endpoint tương thích OpenAI của OrcaRouter với mức markup 0% (deepseek/deepseek-v4-flash), nơi bạn cũng có thể so sánh và định tuyến qua các mô hình cạnh tranh.
Kết luận
Bản phát hành chính thức của DeepSeek V4 Flash giữ nguyên công thức rẻ, nhanh và biến nó thành một tác nhân tốt hơn nhiều: vẫn là MoE 284B / 13B kích hoạt với ngữ cảnh 1M, được huấn luyện bổ sung để mạnh hơn về lập trình và sử dụng công cụ, có hỗ trợ gốc cho Responses-API và Codex, với cùng mức giá ~$0,15 / $0,29. Các số liệu độc lập giờ đây ủng hộ phần lớn lời quảng bá — Artificial Analysis xếp bản build -0731 ngang hàng với Gemini 3.6 Flash về trí thông minh, còn MathArena cho thấy bản preview ngang bằng V4 Pro trên AIME 2026 với chi phí chỉ bằng một phần chín mỗi bài toán. Điều mức giá rẻ không mua được là bề rộng kiến thức hay quyền miễn tội dài dòng: mô hình này suy nghĩ với ngân sách token gấp khoảng hai lần một mô hình trung bình, vì vậy hóa đơn mỗi tác vụ của bạn phụ thuộc nhiều vào mức độ suy luận bạn cho phép hơn là mức giá được quảng cáo. Hãy chạy nó qua một endpoint tương thích OpenAI với mức chênh lệch 0% như OrcaRouter, đo lường mức chi phí thực tế mà các yêu cầu khó của riêng bạn tiêu tốn, và chỉ định tuyến lên một mô hình flagship khi phép đo cho thấy bạn buộc phải làm vậy.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
