Thẻ tiêu đề hero: DeepSeek V4.1 Flash vs DeepSeek V4 Pro — cùng nhà cung cấp, khác thế hệ
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Pro: Cùng nhà cung cấp, khác thế hệ

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điều thú vị khi đặt DeepSeek V4.1 Flash đối đầu với DeepSeek V4 Pro là mô hình mới hơn không phải là mô hình lớn hơn. DeepSeek V4 Pro là một mô hình mixture-of-experts 1,6 nghìn tỷ tham số với 49 tỷ tham số hoạt động, và nó vẫn đang được phục vụ. DeepSeek V4.1 Flash là một MoE 552 tỷ tham số với 8 tỷ hoạt động ở đầu vào và 16 tỷ hoạt động ở đầu ra, và đây là mô hình mà DeepSeek tạo ra để thay thế nó. Cả hai đều nằm trong bảng giá của cùng nhà cung cấp, cả hai đều nhận một triệu token ngữ cảnh, và cả hai đều phát hành theo giấy phép MIT. Việc chọn giữa chúng không phải là câu hỏi về kích thước. Đó là câu hỏi về việc bạn muốn trả tiền cho kiến trúc nào, và câu trả lời đã thay đổi vào ngày 10 tháng 9 năm 2026.

Điều gì thực sự khác biệt, khi đặt cạnh nhau

• Tham số — V4.1 Flash tổng 552B / 8B hoạt động ở đầu vào và 16B ở đầu ra so với V4 Pro tổng 1.6T / 49B hoạt động. V4 Pro có tổng tham số gấp khoảng ba lần và số lượng hoạt động gấp sáu lần ở phía đầu vào.

• Kiến trúc — V4.1 Flash là một Causal Encoder-Decoder, một kiến trúc nền tảng mới so với thiết kế trước đó của V4 Pro. Đây là khác biệt thực chất giữa hai phiên bản và là lý do ".1" không phải là một bản phát hành điểm.

• Giá mỗi 1 triệu token — V4.1 Flash 0,15 USD vào / 0,60 USD ra ngoài giờ cao điểm so với V4 Pro 0,66 USD vào / 1,98 USD ra, theo bảng niêm yết của OrcaRouter.

• Đầu vào đã lưu trong bộ nhớ đệm — V4.1 Flash $0.003 mỗi 1M so với V4 Pro $0.024 mỗi 1M.

• Bộ nhớ đệm KV trên mỗi token — V4.1 Flash 890 byte so với mức chiếm dụng bộ nhớ lớn hơn của V4 Pro. Ở ngữ cảnh một triệu token, đây là khoản mục quyết định liệu một bản ghi agent dài có được giữ thường trú hay không.

• Ngữ cảnh và đầu ra — ngữ cảnh 1M và đầu ra tối đa 384K trên cả hai. Mức.

• Độ trễ quan sát được tới token đầu tiên — V4.1 Flash 2,63 giây p50 so với V4 Pro 3,58 giây p50, trên dữ liệu đo từ xa 7 ngày của OrcaRouter, với p95 ở mức 10,00 giây đối với V4 Pro.

• Các phương thức đầu vào — V4.1 Flash nhận văn bản và hình ảnh, so với V4 Pro, vốn chỉ nhận văn bản và xuất văn bản, trên cùng các danh mục. Mô hình mới hơn là mô hình rộng hơn trong hai mô hình về đầu vào cũng như rẻ hơn về chi phí.

Đọc danh sách mà không có cách đóng khung của nhà cung cấp và quy luật thật bất thường. Bản kế nhiệm rẻ hơn ở mọi dòng, nhanh hơn tới token đầu tiên, rộng hơn về đầu vào và nhỏ hơn ở mọi dòng. Đó là dáng vẻ của một thay đổi kiến trúc đích thực khi nó thành hình, và đó là lý do câu hỏi “cái nào tốt hơn” ở đây có một câu trả lời ngắn và một câu trả lời dài hơn nằm bên dưới nó.

Two-column scoreboard: DeepSeek V4.1 Flash vs DeepSeek V4 Pro — total parameters 552B vs 1.6T, active parameters 8B input and 16B output vs 49B, architecture Causal Encoder-Decoder vs an earlier design, price per 1M tokens $0.15 input and $0.60 output vs $0.66 and $1.98, max output 384K tokens vs 384K tokens, and release date 2026-09-10 vs still served and not retired

Lộ trình của V4 Pro, vì nó quan trọng với bất kỳ ai vẫn đang vận hành nó

DeepSeek V4 Pro đã được lên kế hoạch ngừng hoạt động. API dự kiến sẽ bị tắt vào 12:00 giờ Bắc Kinh ngày 14 tháng 9 năm 2026, với lưu lượng được định tuyến đến V4.1 Flash. Điều đó đã không xảy ra. Vào ngày 11 tháng 9, nhà cung cấp đã đảo ngược quyết định, tuyên bố rằng: "Để đáp ứng nhu cầu người dùng, chúng tôi đã quyết định tiếp tục cung cấp dịch vụ API cho DeepSeek V4 Pro sau ngày 14 tháng 9 năm 2026, với phương thức tính phí giữ nguyên không đổi."

Từ đó rút ra hai điều, và cả hai đều đáng để nói cho thật chính xác, bởi tình huống này rất dễ khiến người ta suy diễn quá mức.

Điều đầu tiên là V4 Pro không bị ngừng hỗ trợ. Đây là một mô hình được hỗ trợ với mức giá không đổi, và chính thông báo của DeepSeek định tuyến lưu lượng V4 Pro hiện có đến nó. Nếu bạn có một đường dẫn production được gắn cố định vào nó, thì không có gì bị lấy đi.

Điều thứ hai là DeepSeek V4.1 Pro không tồn tại. Thông báo ngừng hoạt động đề cập đến lưu lượng V4 Pro được phục vụ bởi V4.1 Flash "cho đến khi V4.1-Pro ra mắt", điều này đã dẫn đến một số suy đoán về một mẫu anh em lớn hơn. Tính đến ngày 22 tháng 9 năm 2026, không có API V4.1 Pro, không có thẻ mô hình, không có trọng số và không có thông báo nào. Một báo cáo ngày 21 tháng 9 năm 2026 gợi ý về một mô hình 2 nghìn tỷ tham số dự kiến vào giữa đến cuối tháng 10, đây là tuyên bố từ một nguồn duy nhất về một sản phẩm chưa được công bố và nên được đối xử như vậy. Bất kỳ ai đang lập kế hoạch năng lực xoay quanh việc ra mắt V4.1 Pro đều đang lập kế hoạch dựa trên một tin đồn.

Thực sự nên gọi cái nào

Trường hợp chuyển đổi rất đơn giản, và đó chính là việc DeepSeek tự thực hiện bằng cách định tuyến lưu lượng V4 Pro sang mô hình mới. Dựa trên các con số ở trên, V4.1 Flash rẻ hơn, nhanh hơn đến token đầu tiên và nhanh hơn ở trạng thái ổn định, với KV cache nhỏ hơn trên mỗi token. Nếu khối lượng công việc của bạn là khối lượng công việc V4 Pro mà không làm điều gì đó chỉ 49B tham số hoạt động mới có thể làm được, thì mô hình mới hơn là công cụ tốt hơn về chi phí và độ trễ và không có sự đánh đổi nào để cân nhắc.

Lý lẽ để tiếp tục dùng V4 Pro xoay quanh việc số lượng tham số hoạt động lớn hơn nhiều mua lại được gì cho bạn trong suy luận khó và công việc agentic dài hạn, và đó là lý lẽ bạn phải đưa ra bằng đánh giá của chính mình thay vì bằng bảng thông số kỹ thuật. Lý do là hai mô hình không được so sánh trên một bảng công khai chung theo cách cô lập được chúng: DeepSeek V4.1 Flash xuất hiện trên đợt đánh giá Agents on Rails từ ngày 21 tháng 9 năm 2026 với 17% ở mức nỗ lực tối đa, trong khi V4 Pro không có trên bảng đó. Không có con số đối đầu trực tiếp nào để chỉ vào. Thứ hiện có là một lập luận hợp lý từ kiến trúc — gấp sáu lần tham số hoạt động là một lượng năng lực lớn để từ bỏ — và đó là một lập luận, không phải một phép đo.

Hai lưu ý thực tế cho bất kỳ ai đang di chuyển lưu lượng giữa hai mô hình. Thứ nhất, lịch giờ cao điểm áp dụng cho cả hai mô hình, nên nếu so sánh chi phí vào sai thời điểm trong ngày thì kết quả sẽ sai gấp đôi; giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC vào các ngày trong tuần, còn cuối tuần hoàn toàn nằm ngoài giờ cao điểm. Thứ hai, hai mô hình dùng chung một cửa sổ ngữ cảnh và giới hạn đầu ra, nên việc di chuyển không làm thay đổi ngân sách prompt của bạn — điều này khiến việc chuyển đổi có rủi ro thấp một cách bất thường ở phía ứng dụng.

Chạy cả hai qua một endpoint

Tình huống mà bạn thực sự muốn cả hai chính là giai đoạn chuyển tiếp, và nó phổ biến hơn mức nghe có vẻ: một nhóm muốn chuyển sang V4.1 Flash nhưng có một pipeline mà hành vi của nó trên kiến trúc mới vẫn chưa được xác minh. Chạy cả hai song song qua các nhà cung cấp riêng biệt đồng nghĩa với hai hợp đồng và hai bộ khóa cho thứ mà, ở cấp độ mô hình, chỉ là một nhà cung cấp.

Cả hai đều nằm trên OrcaRouter dưới một khóa duy nhất, điều này thu gọn lại thành một quyết định định tuyến. OrcaRouter chuyển giá niêm yết của nhà cung cấp qua với mức chênh lệch 0%, vì vậy các con số ở trên là mức giá của chính DeepSeek chứ không phải của chúng tôi, và lịch cao điểm – thấp điểm của DeepSeek áp dụng đúng như cách DeepSeek định nghĩa — kể cả thay đổi giá giữa giai đoạn chuyển tiếp, vốn được cập nhật trực tiếp phía chúng tôi ngay trong ngày. Bạn có thể gửi một phần nhỏ lưu lượng đến mô hình mới và so sánh kết quả đầu ra, hoặc định tuyến theo loại tác vụ, và đặt cơ chế chuyển đổi dự phòng tự động phía sau đường dẫn mới để nếu V4.1 Flash làm điều gì đó bất ngờ với dữ liệu của bạn thì yêu cầu sẽ rơi vào V4 Pro thay vì rơi vào một trang lỗi.

Vì nhà cung cấp đã đổi ý một lần về việc mẫu nào trong số này sẽ bị ngừng cung cấp, nên việc giữ cả hai vẫn có thể truy cập được thông qua một tích hợp duy nhất là phương án không đòi hỏi bạn phải dự đoán lần đảo ngược tiếp theo.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, showing the model id with a flagship badge, 1M-token context, 384K max output, text input and text output, $0.66 input and $1.98 output per 1M tokens, a cache rate of $0.024, and observed time to first token of 3.58 s at p50 and 10.00 s at p95

Xem gì

• Liệu giá hoặc trạng thái ngừng cung cấp của V4 Pro có thay đổi lần nữa hay không. Cú đảo ngược hồi tháng 9 đã nói rõ rằng việc tính phí sẽ giữ nguyên, và đó là cam kết để buộc nhà cung cấp phải tuân theo.

• Liệu V4.1 Pro có trở thành hiện thực. Cho đến khi có model card hoặc bản phát hành trọng số, câu chuyện tham số 2T chỉ là tin đồn từ một nguồn duy nhất.

• Một đánh giá độc lập chạy cả hai mô hình trên cùng một bảng đánh giá. Cho đến khi có một đánh giá như vậy, so sánh trung thực giữa hai mô hình này là chi phí, độ trễ và kiến trúc, những thứ có thể đo lường được, cộng với một phỏng đoán có căn cứ về năng lực, thứ không thể đo lường được.

Cho đến khi điều thứ ba trong số đó xuất hiện, tóm tắt chính xác là: DeepSeek V4.1 Flash là phiên bản kế nhiệm rẻ hơn, nhanh hơn của DeepSeek V4 Pro, V4 Pro vẫn được hỗ trợ với mức giá không đổi, và câu hỏi liệu kiến trúc mới hơn có đánh mất năng lực hay không là điều mà hiện chưa có benchmark công khai nào trả lời.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày