
DeepSeek V4.1 Flash vs DeepSeek V4 Pro: Sự chuyển giao mà DeepSeek đã lên lịch, rồi hủy bỏ
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
DeepSeek V4.1 Flash đã ra mắt ngày 2026-09-10, và lẽ ra đến giờ này DeepSeek V4 Pro đã không còn nữa. Kế hoạch, được công bố hai ngày trước khi Flash ra mắt và được chốt vào ngày phát hành, là vào 12:00 giờ Bắc Kinh ngày 2026-09-14, mọi yêu cầu gửi tới deepseek-v4-pro sẽ âm thầm được chuyển hướng sang mô hình mới hơn, rẻ hơn là deepseek-flash và được tính phí theo mức giá của Flash. DeepSeek đã hủy kế hoạch đó vào ngày 2026-09-11 sau khi các nhà phát triển phản đối, và đến ngày 2026-09-14, thời hạn đã trôi qua mà V4 Pro vẫn hoạt động và mức phí của nó không thay đổi. Vậy nên đây không phải là một so sánh khi ra mắt — mô hình bên trái mới tám ngày tuổi còn mô hình bên phải là một mẫu chủ lực đã một năm tuổi, đang ở tháng thứ tư kể từ khi được phát hành rộng rãi. Đây là so sánh giữa hai mô hình mà nhà sản xuất đã công bố các chỉ số đánh giá cho thấy mô hình rẻ hơn thắng, rồi phát hiện ra người dùng của mình không đồng tình, và đã rút lui. Trình tự đó là điều hữu ích nhất mà bất kỳ ai đã công bố về một trong hai mô hình trong tháng này, bởi vì đó chính xác là quyết định mà chính bạn sắp phải đưa ra.
Chuyện gì thực sự đã xảy ra, theo thứ tự
Ở đây, mốc thời gian quan trọng hơn bất kỳ một phép đo chuẩn mực đơn lẻ nào, bởi vì sự đảo ngược chính là câu chuyện, và thông báo đã được đưa ra một cách hết sức lặng lẽ.
• 2026-09-09 — DeepSeek thông báo cho người dùng rằng trước khi V4.1 Pro ra mắt, các yêu cầu V4 Pro sẽ được định tuyến đến V4.1 Flash và tính phí theo mức giá của Flash. Thông điệp là Flash đã vượt trội toàn diện so với Pro về hiệu năng, chi phí, tốc độ và thời gian hoàn thành tác vụ.
• 2026-09-10 — DeepSeek V4.1 Flash chính thức ra mắt (GA) trên ứng dụng, web và API. Trọng số được công bố trên Hugging Face theo giấy phép MIT. Tên mô hình API trở thành deepseek-flash. Thế hệ trước deepseek-v4-flash và deepseek-v4-flash-vision-exp bị ngừng hoàn toàn, với các ID cũ tạm thời được định tuyến sang V4.1 Flash. Việc dừng Pro được lùi đến 2026-09-14, 12:00 giờ Bắc Kinh (04:00 UTC).
• 2026-09-11 — DeepSeek đảo ngược quyết định. Trước yêu cầu từ phía người dùng, hãng cho biết dịch vụ V4 Pro API sẽ tiếp tục sau ngày 2026-09-14 với mức tính phí không đổi, đồng thời việc tự động chuyển sang V4.1 Flash bị hủy bỏ.
• 2026-09-14 — hạn chót đã trôi qua. V4 Pro vẫn đang phục vụ ở mức $0,66 / $1,98 mỗi triệu token vào giờ thấp điểm.
Sự bất đối xứng trong chuỗi sự kiện đó chính là toàn bộ bài viết. Người dùng Flash đã bị chuyển đổi dù muốn hay không — ID V4 Flash cũ giờ đây phản hồi bằng một mô hình khác. Người dùng Pro thì được tạm hoãn, và lý do không phải là V4 Pro đạt kết quả benchmark tốt hơn. Đó là vì các hệ thống production đã được tinh chỉnh dựa trên nó: prompt, scaffold cho agent, harness đánh giá và các giả định về khả năng tái lập mà việc hoán đổi backend vô hiệu hóa dù không có bất kỳ thay đổi mã nào ở phía người gọi. Trang so sánh của DeepSeek vẫn liệt kê cả hai mô hình ngày nay, cạnh nhau, điều đó cho thấy công ty có ý định phục vụ cả hai.
Cạnh nhau: hai SKU
Mọi nội dung dưới đây là thông số kỹ thuật do chính DeepSeek công bố, trừ khi có nêu nguồn. Giá được tính trên mỗi triệu token, vào giờ thấp điểm, với mức giá cao điểm trong ngoặc đơn — DeepSeek cao điểm từ 01:00 đến 04:00 và một lần nữa từ 06:00 đến 10:00 UTC, từ thứ Hai đến thứ Sáu, còn tất cả các giờ khác là giờ thấp điểm với mức bằng một nửa giá cao điểm.
• Tên mô hình API — deepseek-flash (DeepSeek-V4.1-Flash) so với deepseek-v4-pro (DeepSeek-V4-Pro-0813).
• Đầu vào, cache miss — $0.15 ($0.30) so với $0.66 ($1.32).
• Đầu vào, cache hit — 0,003 $ (0,006 $) so với 0,022 $ (0,044 $).
• Đầu ra — $0.60 ($1.20) so với $1.98 ($3.96).
• Ngữ cảnh / đầu ra tối đa — 1M token / 384K trên cả hai. Giống hệt nhau.
• Đầu vào hình ảnh — được hỗ trợ nguyên bản trên Flash; được liệt kê là không được hỗ trợ trên V4 Pro.
• Giới hạn đồng thời — 2.500 trên Flash so với 500 trên V4 Pro.
• Thông số được công bố — Flash: tổng 552B, con số do nhà cung cấp đưa ra, với một phản biện đáng tin cậy từ cộng đồng (sẽ bàn thêm ở dưới). V4 Pro: tổng 1.6T, ~49B hoạt động, con số mà Artificial Analysis cũng liệt kê và trang công thức vLLM xác nhận.
• Ngân sách tham số hoạt động trên mỗi token — Flash kích hoạt khoảng 8B ở giai đoạn prefill và 16B ở giai đoạn decode theo đúng thiết kế, đó chính là mục đích kiến trúc của nó; Pro kích hoạt ~49B mỗi token.
• Giấy phép — trọng số mở theo giấy phép MIT cho cả hai.
• Ngày GA — Flash 2026-09-10; V4 Pro 0813 2026-08-13, sau bản xem trước tháng 4.

Chênh lệch giá chính là toàn bộ lập luận.
Đầu vào đắt hơn 4,4 lần trên Pro. Đầu ra là 3,3 lần. Lượt truy cập bộ đệm — hạng chiếm ưu thế trong một lượt chạy agent dài với system prompt ổn định — là 7,3 lần. Vì mức đỉnh tăng gấp đôi ở mọi hạng ở cả hai phía, tỷ lệ là như nhau ở mức đỉnh; khoảng cách không phải là hệ quả của chiết khấu.
Đặt một khối lượng công việc lên đó. Lấy một coding agent chạy 10M token đầu vào mỗi tháng với tỷ lệ cache hit 70% và 2M token đầu ra. Trên V4.1 Flash vào giờ thấp điểm, đó là $0.45 chi phí đầu vào mới, $0.021 đầu vào được cache và $1.20 đầu ra: $1.67. Trên V4 Pro vào giờ thấp điểm, đó là $1.98, $0.154 và $3.96: $6.09. Khoảng 3.6×, trên một khối lượng công việc cố tình tầm thường.
Đó là danh sách của chính DeepSeek, và nó chính là mức giá bạn thực sự phải trả ở đây: OrcaRouter chuyển tiếp nguyên mức giá niêm yết của nhà cung cấp với mức chênh lệch 0%, nên khi DeepSeek thay đổi giá, giá mới đến phía chúng tôi ngay trong cùng ngày thay vì bị đóng gói lại. Cả hai mô hình đều nằm trên cùng một khóa, điều này quan trọng cho phần phía dưới — phần nói về việc thử nghiệm một cuộc di chuyển mà bạn không còn phải thực hiện nữa.

Nơi DeepSeek V4.1 Flash thực sự chiếm ưu thế
Bằng chứng thuyết phục nhất cho Flash không phải là bảng điểm chuẩn của DeepSeek. Mà là Artificial Analysis — một nguồn độc lập, với số liệu được đọc trực tiếp từ các trang mô hình của họ.
• Chỉ số Trí tuệ — Flash (Reasoning, Max Effort) đạt 40 điểm, xếp hạng #6 trong 113 mô hình. V4 Pro 0813 (Reasoning, Max Effort) đạt 36 điểm, xếp hạng #7. Cùng một chỉ số, cùng mức effort, cách nhau bốn điểm, mà mô hình rẻ hơn lại dẫn trước.
• Tốc độ đầu ra — 214,4 token/giây so với 94,4 token/giây. Đó là gấp 2,3 lần, và đây là kết quả đo được, không phải lời tuyên bố.
• Thời gian đến token đầu tiên — 1,21 giây so với 1,74 giây.
• DeepSWE v1.1 — 74,2 cho Flash trên bảng xếp hạng được theo dõi, vị trí thứ nhất, xếp trên GPT-6 Astra ở 74,10, Claude Opus 5 ở 74,00 và Gemini 3.8 Flash ở 73,70. Con số 62,7 của V4 Pro 0813 trên cùng chuẩn đánh giá là số liệu của chính DeepSeek. Khoảng cách ở vị trí dẫn đầu là 0,2 điểm, tức là hòa, không phải thắng — nhưng khoảng cách 11,5 điểm so với Pro thì không phải là hòa.
• Hiệu suất phục vụ — Bộ giải mã của Flash suy ra KV toàn cục từ trạng thái ẩn cuối cùng của encoder thay vì tính toán lại nó cho từng lớp, và đây chính là điều tạo ra hoạt hóa bất đối xứng 8B-prefill / 16B-decode. Hồ sơ InferenceX của SemiAnalysis đặt KV cache ở khoảng 890 byte mỗi token — khoảng một phần tư của V4 Flash — với lưu trữ KV thường trú xuống còn khoảng một phần tám. Đó là lý do mức giá lại như vậy, và cũng là lý do mô hình khả dụng ở mức 2.500 đồng thời trong khi Pro bị giới hạn ở 500.
• Khả năng thị giác trên API được phục vụ — không chỉ nằm trong trọng số. Trang định giá của chính DeepSeek liệt kê đầu vào hình ảnh được hỗ trợ cho Flash và không được hỗ trợ cho V4 Pro, và DeepSeek mô tả đây là mẫu flagship đầu tiên của mình có khả năng hiểu đa phương thức gốc. Đây là flagship DeepSeek đầu tiên mà việc đọc ảnh chụp màn hình không cần một endpoint riêng.
Tất cả các con số tiêu đề khác mà bạn sẽ thấy được trích dẫn — Terminal-Bench 2.1 ở mức 90.6, GPQA Diamond ở mức 90.9, Codeforces 3471 — đều là của riêng DeepSeek, không do chúng tôi tái lập, và nên được đọc với lưu ý đó.
Khi nào {{1}}DeepSeek V4 Pro{{/1}} vẫn là lựa chọn đúng đắn
Sẽ rất dễ để gạt bỏ V4 Pro sau một tuần như thế. Việc đảo ngược trạng thái ngừng hỗ trợ lại nói điều ngược lại, và bảng thông số kỹ thuật cũng nói điều ngược lại.
Pro sở hữu tổng cộng 1.6T tham số và kích hoạt ~49B mỗi token, so với 16B của Flash khi giải mã. Dù chỉ số có nói gì đi nữa, năng lực tính trên mỗi token là một nguồn lực thực sự, và những khối lượng công việc mà nó bộc lộ rõ là các tác vụ tầm xa: những phiên chạy agent kéo dài nhiều giờ, các đợt refactor lớn, những tác vụ mà một bước rẽ sai từ sớm sẽ khiến toàn bộ quỹ đạo phải trả giá. Khoảng cách bốn điểm trên chỉ số đo mức trung bình của mười bài đánh giá, chứ không phải phần đuôi trong phân phối của bạn.
Pro cũng là phương án đã được biết rõ. Nó đã chính thức khả dụng từ ngày 2026-08-13 sau bản xem trước hồi tháng Tư, và bản dựng 0813 có được hiệu năng nhờ hậu huấn luyện chứ không phải nhờ kiến trúc — cùng số lượng tham số, cùng hình dạng như bản xem trước, nhưng hành vi khác. Đó là bốn tháng với công cụ cộng đồng, các harness agent đã công bố, các mẫu prompt và các dạng lỗi. Flash mới GA được tám ngày, và hệ sinh thái xung quanh nó vì thế cũng còn mỏng. Nếu độ tin cậy của nhóm bạn đến từ việc biết chính xác một mô hình thất bại như thế nào, thì Pro chính là nơi kiến thức đó tồn tại.
Và dịch vụ đã không dừng lại. Cam kết của DeepSeek là rõ ràng và việc tính phí của họ không thay đổi, các trọng số là MIT, và V4 Pro vẫn còn trong danh mục của chúng tôi ở cùng mức giá niêm yết. Việc ngừng hỗ trợ bị hủy bỏ không phải là một sự hoãn thi hành — đó là một tuyên bố rằng DeepSeek có ý định tiếp tục phục vụ hạng này.

Ba điều để đối chiếu với cả hai mô hình
Rào chắn, vì quyết định này rất đắt giá nếu làm sai.
• Số lượng tham số đang gây tranh cãi. 552B là con số của DeepSeek. Một phân tích cộng đồng đáng tin cậy lập luận rằng checkpoint được phát hành là 748B — phần xương sống transformer 552B cộng với bảng bộ nhớ có điều kiện Engram ~196B, vốn là một cấu trúc tra cứu được truy vấn tại hai điểm trong mạng chứ không phải một lớp mà tín hiệu chảy qua. Bản tải xuống được công bố là 510.3 GB trải trên 48 shard safetensors gồm các trọng số dense FP8 cùng các chuyên gia định tuyến FP4. Cả hai con số đều có thể đúng cùng lúc, tùy thuộc vào việc bạn có tính phần truy xuất tách biệt với tính toán hay không. Hãy coi 552B là con số do nhà cung cấp báo cáo và kiểm tra dung lượng đĩa thực tế trước khi bạn lên kế hoạch triển khai.
• Điểm trên bảng xếp hạng chỉ là một bước sàng lọc, không phải một bản hợp đồng. 74,2 của DeepSWE v1.1 là một benchmark dạng harness. Một bản kiểm toán do EyesTech Systems Lab tự công bố tuyên bố rằng điểm của các mô hình lớp Flash này sụp đổ khi được chuyển sang các kho nhiều tệp, biệt lập, ngoài đời thực — khiến DeepSeek V4.1 Flash chỉ đạt 31,4% trên SWE-bench Pro so với con số tiêu đề 74,2%, mức giảm còn lớn hơn cả các mô hình tiên phong trong chính so sánh của nó. Bản kiểm toán đó không độc lập — tác giả bán một công cụ để phát hiện chính xác kiểu khai thác harness mà ông mô tả — và chúng tôi chưa thấy sự tái lập nào của nó. Dù vậy, đây vẫn là cách tiếp cận đúng: hãy xác minh trên chính các repo của bạn trước khi chuyển đổi.
• Độ dài dòng là một mục chi phí.Artificial Analysis đo được V4.1 Flash tạo ra 250 triệu token đầu ra trong toàn bộ lượt chạy Intelligence Index của mình, so với mức trung vị 140 triệu của các mô hình open-weights tương đương, và gọi nó là rất dài dòng. Đầu ra là hướng tốn kém trong bảng giá này, nên một mô hình suy nghĩ thành tiếng sẽ ăn vào khoản tiết kiệm của chính nó. Với khối lượng công việc nặng về suy luận, hãy dự trù theo số lượng token, không chỉ giá token.
Một điều nữa, nói thẳng ra để không ai lên kế hoạch dựa trên một tin đồn: DeepSeek V4.1 Pro chưa được phát hành. Việc di chuyển đã bị hủy được mô tả như một giải pháp tạm thời "trước khi V4.1 Pro ra mắt", và không có gì về điều đó thay đổi cả.
Chọn DeepSeek V4.1 Flash nếu
• Khối lượng công việc của bạn có lưu lượng lớn, nhạy cảm với độ trễ hoặc bị giới hạn bởi chi phí — phân loại, trích xuất, định tuyến, tóm tắt, trò chuyện, hầu hết các tác vụ sinh mã.
• Bạn cần đầu vào hình ảnh trên cùng một endpoint như văn bản. Đây là mô hình chủ lực đầu tiên của DeepSeek mà việc đó chỉ là một lệnh gọi duy nhất thay vì dùng mô hình thứ hai.
• Prompt của bạn có thể được lưu vào cache. Với mức 7,3× ở các lần cache trúng, khoảng cách rộng nhất đúng ngay nơi lưu lượng agent diễn ra, và một system prompt ổn định chiếm phần lớn đầu vào của một lần chạy dài.
• Bạn đang bắt đầu lại từ đầu trong tuần này và chưa có harness nào được tinh chỉnh cho những nét riêng của một mô hình cụ thể. Không có gì cần bảo vệ cả.
• Bạn muốn mức trần đồng thời cao hơn. 2.500 so với 500 là mức chênh lệch gấp năm lần về lượng bạn có thể đẩy qua trước khi phải xếp hàng.
Chọn DeepSeek V4 Pro nếu
• Bạn đã có hệ thống production được tinh chỉnh dựa trên nó. Sự đảo ngược nghĩa là bạn có thời gian — hãy dùng nó để kiểm thử thay vì né tránh câu hỏi.
• Nhiệm vụ của bạn mang tính dài hơi và tốn kém nếu thất bại, và bạn đã đo được rằng ~49B tham số hoạt động mỗi token mang lại cho bạn điều gì đó mà 16B của Flash không có, trên dữ liệu của chính bạn chứ không phải trên một bảng xếp hạng.
• Bạn cần hành vi chỉ dựa trên văn bản, có thể dự đoán được, không có luồng thị giác nào để suy luận, hoặc bạn có các đường cơ sở eval mà việc thay mô hình sẽ làm chúng mất hiệu lực ngay giữa nghiên cứu.
• Mô hình truy cập của bạn có khối lượng thấp nhưng rủi ro cao, trong đó mức 3,6× trên một hóa đơn nhỏ không phải là yếu tố quyết định.
Nếu bạn đã xây dựng trên DeepSeek V4 Pro
Điều hữu ích đã thay đổi vào ngày 2026-09-11 là việc di chuyển của bạn không còn là một hạn chót nữa mà đã trở thành một quyết định. Điều đó tốt hơn hẳn cho bạn và tệ hơn hẳn cho hộp thư đến của bạn, bởi vì quyết định đó vẫn phải được đưa ra và hiện giờ không ai đưa ra quyết định đó thay bạn.
Bắt đầu bằng việc định giá nó. Mức chênh 3.3–4.4× là con số bạn đang để tuột mất, và ví dụ đã tính ở trên biến nó thành con số hàng tháng trong khoảng một phút. Sau đó hãy kiểm chứng theo cách duy nhất thực sự quan trọng: sao chép một phần lưu lượng production sang Flash, giữ Pro trên luồng chính, và so sánh đầu ra trên chính các tác vụ của bạn. Vì cả hai mô hình đều trả lời trên cùng một key ở giá niêm yết của nhà cung cấp với cơ chế chuyển đổi dự phòng tự động, lần chạy shadow đó là một thay đổi định tuyến chứ không phải một tích hợp thứ hai, và router có thể chuyển một yêu cầu trả về Pro mà bạn không cần viết phần dự phòng. Các nhóm đốt token vào một cuộc di chuyển mà họ không hề yêu cầu chính là lý do lớp định tuyến tồn tại ngay từ đầu.
Đừng giả định Flash là bản thay thế trực tiếp. Đây là một kiến trúc khác — một bộ mã hóa–giải mã nhân quả 40 lớp với kích hoạt bất đối xứng — và nó dài dòng hơn khi suy luận. Hành vi ở cấp độ prompt sẽ không chuyển đổi trọn vẹn theo cả hai chiều, vì vậy hãy đo lường việc di chuyển dựa trên đầu ra, chứ không dựa trên chỉ số.
Xem gì
Ba điều quyết định sự kết hợp này sẽ ra sao trong một tháng nữa. Thứ nhất, liệu V4.1 Pro có được phát hành và khôi phục một gói Pro thực sự hay không — toàn bộ cuộc chuyển đổi đã bị hủy vốn được nói rõ chỉ là giải pháp tạm thời cho nó, nên lộ trình của DeepSeek vẫn còn một lỗ hổng ở vị trí flagship. Thứ hai, liệu sự hoãn này có sống sót qua đợt điều chỉnh giá tiếp theo của DeepSeek hay không; một công ty sẵn sàng lên lịch âm thầm định tuyến lại một lần đã học được rằng mình không thể, chứ không phải rằng mình không nên. Thứ ba, liệu có ai ngoài DeepSeek tái lập được các con số benchmark của Flash trên những kho mã chưa chỉnh sửa hay không, và đây là kết quả duy nhất có thể giải quyết cuộc tranh luận hiệu quả so với năng lực mà toàn bộ so sánh này xoay quanh. Cho đến lúc đó, lập trường trung thực chính là lập trường mà sự đảo ngược tự nó ngụ ý: Flash là mặc định tốt hơn cho mọi thứ mới, Pro là lựa chọn đáng đặt cược hơn cho mọi thứ đã được xây dựng, và DeepSeek vừa cho bạn biết rằng họ sẽ phục vụ cả hai trong lúc bạn xác định mình là loại nào.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
