
DeepSeek V4 Flash so với V4 Pro: Phân khúc hiệu quả so với mẫu chủ lực, được so sánh
- obsidianMỚIQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 trên 1 triệu token · 24 tok/s
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-1328 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 2657 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
Dòng V4 của DeepSeek là một chiếc thang hai bậc: V4 Flash, mô hình hiệu quả, giá rẻ và nhanh — hiện đã có bản phát hành chính thức -0731 với các agent mạnh hơn nhiều — và V4 Pro, mô hình chủ lực cỡ lớn cho những tác vụ suy luận và lập trình khó nhất, đã chuyển sang bản dựng GA chính thức (0813) vào ngày 12 tháng 8 năm 2026. Điều thú vị là chúng khác nhau rất ít trong công việc thực tế, nhưng lại khác nhau rất nhiều về giá bán. Hướng dẫn này so sánh hai mô hình về năng lực, chi phí, tốc độ và mức độ phù hợp, với mọi số liệu đều được ghi rõ nguồn.
Ghi chú về độ chính xác: Điểm số agentic/coding của V4 Flash do DeepSeek công bố (nhật ký thay đổi chính thức, 2026-07-31, bộ kiểm thử của DeepSeek); điểm số GA (0813) của V4 Pro cũng do DeepSeek công bố trên cùng bộ kiểm thử, và chưa có đánh giá độc lập nào cho bản dựng 0813 được công bố. Giá hiện tại tính đến ngày 12 tháng 8 năm 2026; mức giảm giá GA được áp dụng trên OrcaRouter với biên độ 0%. Số liệu từ bộ kiểm thử của nhà cung cấp thường lạc quan — hãy tự kiểm chứng trên tác vụ của bạn.
TL;DR. V4 Flash là mô hình MoE 284B / 13B kích hoạt, giá $0.08 / $0.18 mỗi triệu token; V4 Pro là flagship lớn hơn hẳn, hiện ở bản GA chính thức (0813) với giá $0.435 / $0.87 — gấp khoảng năm lần giá Flash, giảm từ mức khoảng mười bốn lần trước đợt giảm giá tháng 8. Về lập trình thực tế, Flash chỉ kém Pro vài điểm (ví dụ: SWE-bench Verified ~79% so với ~80.6%, theo các nguồn tổng hợp), và bản nâng cấp hậu huấn luyện -0731 giúp Flash tự thân trở thành một agent mạnh. Hãy dùng Pro cho các bài toán suy luận khó nhất và các tác vụ lập trình đa tệp đòi hỏi khắt khe nhất; dùng Flash cho phần lớn tác vụ khối lượng lớn — và định tuyến theo độ khó để nhận được phần lớn chất lượng của Pro với chi phí chỉ khoảng một phần năm.
Những điểm chính rút ra
• Kích thước và giá: Flash có 284B / 13B hoạt động với giá $0,08 / $0,18; Pro là bản flagship lớn hơn nhiều với giá $0,435 / $0,87 — giá của Flash chỉ bằng khoảng 1/5, và việc cắt giảm giá GA của Pro đã thu hẹp khoảng cách ~14 lần trước đây xuống còn khoảng 5 lần.
• Chênh lệch về mã hóa là nhỏ: trên tổng hợp SWE-bench Verified ~79% (Flash) so với ~80.6% (Pro, thời kỳ xem trước; bản GA chưa có điểm độc lập); trên bộ đánh giá của DeepSeek, GA Pro đạt Terminal-Bench 2.1 87.9 so với 82.7 của Flash.
• Cả hai đều dùng chung ngữ cảnh 1M token và đầu ra 384K; cả hai chỉ hỗ trợ văn bản, với suy luận, công cụ và JSON.
• Flash phục vụ nhanh hơn và rẻ hơn (p50 TTFT ~394 ms, ~184 tok/s); Pro đánh đổi tốc độ lấy khả năng đỉnh cao.
• Thực hành tốt nhất: định tuyến theo độ khó — Flash cho đa số, Pro cho thiểu số khó.
Mỗi mô hình là gì
V4 Flash là bậc hiệu suất: mô hình mixture-of-experts với tổng 284B tham số nhưng chỉ ~13B tham số hoạt động, ngữ cảnh 1M token, đầu ra lên tới 384K token, được tinh chỉnh cho các tác vụ tác tử khối lượng lớn, độ trễ thấp. Bản phát hành chính thức -0731 (ngày 31 tháng 7 năm 2026) là bản nâng cấp sau huấn luyện giúp cải thiện khả năng tác tử, lập trình và sử dụng công cụ, đồng thời bổ sung hỗ trợ nguyên bản cho Responses-API và Codex. V4 Pro là mô hình chủ lực của DeepSeek — mô hình lớn hơn nhiều, được xây dựng cho các bài toán suy luận và lập trình khó nhất, nơi khả năng tối đa quan trọng hơn chi phí. Mô hình này chạy dưới dạng bản xem trước từ tháng 4, sau đó chuyển sang bản GA chính thức vào ngày 12 tháng 8 năm 2026, với mức giá thấp hơn nhiều. Cả hai đều thuộc cùng dòng V4, chia sẻ ngữ cảnh 1M, đầu vào chỉ văn bản và hỗ trợ suy luận/công cụ/JSON.

Khả năng: Flash gần với Pro đến mức nào?
Gần hơn so với mức chênh lệch giá gợi ý, ít nhất là về mặt lập trình thực tế. Các đánh giá tổng hợp đặt V4 Flash (Max) ở khoảng 79.0% trên SWE-bench Verified — giải quyết các vấn đề GitHub thực tế — so với khoảng 80.6% của V4 Pro khi được thử nghiệm trong thời kỳ xem trước. Bản GA (0813) quá mới để có điểm số độc lập — chưa có điểm nào được công bố — nên so sánh Pro tốt nhất hiện có là từ bộ thử nghiệm của chính DeepSeek, nơi bản GA đạt Terminal-Bench 2.1 87.9 và DeepSWE 62.7, so với các con số -0731 của Flash là 82.7 và 54.4 (tất cả do DeepSeek báo cáo). Điểm Pro vượt trội là ở phân khúc khó nhất: suy luận đa bước phức tạp nhất, lập trình đa tệp khó nhằn nhất, và các tác vụ mà ngân sách tham số hoạt động lớn hơn thực sự hữu ích. Nếu phần lớn công việc của bạn là "khó nhưng không thuộc dạng tiên phong", Flash đáp ứng được; hãy dành Pro cho thiểu số thực sự tiên phong.
Giá cả và tốc độ: lợi thế quyết định của Flash
Đây là nơi hai mô hình khác biệt nhất — và cũng là nơi các con số vừa thay đổi. Flash có giá $0.08 / $0.18 cho mỗi triệu token đầu vào/đầu ra; bản GA chính thức (0813) của V4 Pro có giá $0.435 / $0.87 — gấp khoảng năm lần giá của Flash. Đó vẫn là một mức phí cao đáng kể, nhưng chỉ bằng một phần nhỏ so với khoảng chênh lệch ~14x trước khi giảm giá: bản niêm yết deepseek-v4-pro trước đây đứng ở mức $1.168 / $2.336, nên bản GA rẻ hơn khoảng 63%. Trong một tháng sử dụng 10 triệu token với 70% token đầu vào, Flash tốn khoảng $1.10 và Pro khoảng $5.66 — tỷ lệ này vẫn giữ nguyên khi bạn mở rộng quy mô lên hàng tỷ token. Flash cũng được thiết kế cho thông lượng cao (p50 TTFT ~394 ms, ~184 tok/s), nên phù hợp hơn cho các tác nhân nhạy cảm với độ trễ và có khối lượng xử lý lớn. Mức phí cao của Pro dùng để mua khả năng đỉnh cao, không phải tốc độ hay tiết kiệm chi phí — nhưng khi khoảng chênh lệch chỉ còn ~5x thay vì ~14x, cái giá cho khoảng dư địa hiệu năng hàng đầu đó đã giảm xuống rất nhiều.
Cách phân luồng đúng: định tuyến theo độ khó
Bạn không cần phải chọn một. Cấu hình chất lượng cao rẻ nhất sẽ gửi phần lớn các yêu cầu ở mức dễ đến trung bình tới Flash và chỉ chuyển những yêu cầu khó nhất lên Pro. Vì cả hai thuộc cùng một dòng sản phẩm với cùng ngữ cảnh và giao diện, việc định tuyến đó diễn ra liền mạch — và bản nâng cấp -0731 có nghĩa là Flash giờ xử lý được nhiều hơn ở tầng trung trước khi bạn cần chuyển lên. Nếu triển khai tốt, định tuyến theo độ khó mang lại phần lớn chất lượng của Pro với chi phí gần bằng Flash, và mức giá GA được cắt giảm khiến việc thỉnh thoảng chuyển lên Pro rẻ hơn đáng kể so với thời kỳ xem trước.

Bạn nên chọn cái nào?
Chọn V4 Flash nếu…
Bạn vận hành các khối lượng công việc dạng tác nhân, viết mã, hoặc xử lý tài liệu dài với quy mô lớn, nơi chi phí và tốc độ được ưu tiên, và chất lượng "gần ngang flagship" là đủ — điều mà, sau bản nâng cấp -0731, bao phủ rất nhiều tình huống.
Chọn V4 Pro nếu…
Bạn cần khả năng tối đa cho những bài suy luận khó nhất và công việc mã hóa đa tệp đòi hỏi khắt khe nhất, và bạn sẵn sàng trả khoảng gấp 5 lần giá của Flash cho khoảng không gian dự phòng cao cấp đó — một yêu cầu dễ chịu hơn nhiều so với mức phí cao gấp ~14 lần mà mức giá thời kỳ xem trước từng áp dụng.
Sử dụng cả hai thông qua một endpoint
Cả hai đều có sẵn trên OrcaRouter với mức phụ phí 0% thông qua một endpoint tương thích OpenAI — Flash dưới dạng deepseek/deepseek-v4-flash-0731 và Pro là phiên bản chính thức deepseek/deepseek-v4-pro-0813 GA build — vì vậy bạn có thể triển khai định tuyến theo độ khó như một tùy chọn cấu hình, chạy benchmark cả hai trên các tác vụ của riêng bạn, và chuyển lưu lượng mà không cần tích hợp lại. Đó là cách đơn giản nhất để tận dụng khoản tiết kiệm từ Flash trong khi vẫn giữ Pro sẵn sàng cho thiểu số các tác vụ khó.

Câu hỏi thường gặp
V4 Flash có tốt như V4 Pro không?
Về lập trình thực tế, gần như ngang nhau — điểm tổng hợp SWE-bench Verified ~79% so với ~80,6% (thời kỳ preview của Pro; bản GA chưa có điểm số độc lập). Về suy luận khó nhất và lập trình phức tạp nhất, Pro dẫn đầu. Đối với hầu hết khối lượng công việc, Flash là đủ sau bản nâng cấp -0731.
V4 Flash rẻ hơn bao nhiêu?
Flash có giá khoảng một phần năm giá của Pro: $0.08 / $0.18 mỗi triệu token so với $0.435 / $0.87 của GA Pro. Trước khi Pro giảm giá vào tháng 8, chênh lệch là khoảng 14 lần; hiện nay là khoảng 5 lần.
Chúng có dùng chung cửa sổ ngữ cảnh không?
Vâng — cả hai đều cung cấp ngữ cảnh 1M token (1,048,576) và lên đến 384K đầu ra.
Cái nào nhanh hơn?
Flash, theo thiết kế — p50 thời gian đến token đầu tiên khoảng 394 ms và ~184 token/giây, được tối ưu cho các ứng dụng khối lượng lớn, độ trễ thấp.
Tôi có thể sử dụng cả hai cùng nhau không?
Vâng — định tuyến theo độ khó qua endpoint duy nhất của OrcaRouter: Flash cho khối lượng lớn, Pro cho những tác vụ khó nhất.
Kết luận
V4 Flash so với V4 Pro là sự so sánh giữa hiệu quả và khả năng đỉnh cao. Flash mang lại cho bạn hầu hết khả năng lập trình thực tế của Pro, cùng với một agent thực sự mạnh mẽ sau bản nâng cấp -0731, với giá chỉ bằng khoảng một phần năm và tốc độ cao hơn; bản dựng GA chính thức của Pro là phiên bản hàng đầu cho những tác vụ khó nhất, và việc cắt giảm giá — xuống còn $0.435 / $0.87, khoảng gấp năm lần Flash thay vì gấp mười bốn như trước — khiến mức cao cấp đó trở nên phải chăng hơn bao giờ hết. Cách thông minh không phải là chọn một trong hai — mà là định tuyến theo độ khó qua một điểm cuối duy nhất như OrcaRouter, để phần lớn khối lượng công việc chạy rẻ trên Flash và chỉ phần nhỏ khó khăn trả tiền cho Pro.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
