Thẻ tiêu đề hero cho 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash' với phụ đề 'Cùng một biểu giá Flash. Mô hình được tái huấn luyện.', các huy hiệu dạng viên thuốc ghi 'PHÁT HÀNH NGÀY 10 THÁNG 9, 2026' và 'NÂNG CẤP PHÂN KHÚC FLASH', cùng logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Flash: Cùng biểu giá Flash, nhưng là mô hình được đào tạo lại

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tuần mà DeepSeek V4.1 Flash chuyển từ một sản phẩm kế nhiệm được đồn đoán thành mô hình Flash đang phát hành đã ngắn ngủi và ồn ào. Vào ngày 8 tháng 9, mô hình này xuất hiện dưới dạng bài kiểm tra API kéo dài hai ngày với mã mô hình deepseek-v4.1-flash-expires-on-0910 — một bản dựng mà chính DeepSeek gọi là "phiên bản trung gian". Vào ngày 9 tháng 9, nền tảng mở của họ cho biết bản phát hành chính thức, DeepSeek V4.1 Flash, sẽ ra mắt vào khoảng ngày 10 tháng 9 và rằng nó "vượt trội toàn diện" DeepSeek V4 Pro về năng lực, chi phí, tốc độ và thời gian xử lý đầu cuối. Vào ngày 10 tháng 9, thông báo phát hành đi kèm với một bảng giá mới cho dòng Flash, có hiệu lực lúc 12:00 giờ Bắc Kinh, điều mà DeepSeek V4 Flash chưa từng thấy kể từ đợt tăng giá hồi tháng 8. Dù sự thật có ra sao, con ngựa thồ văn bản DeepSeek V4 Flash không còn là cách mới nhất để chạy khối lượng công việc Flash, và bài viết này nói về việc điều đó thực sự thay đổi gì đối với ứng dụng bạn đang chạy hôm nay.

Các so sánh ở thời điểm sớm thế này là chênh lệch, và đáng để nói rõ điều đó trước khi các con số bắt đầu. DeepSeek V4 Flash có thông số kỹ thuật được công bố, một tháng lưu lượng sản xuất sau bản cập nhật DeepSeek-V4-Flash-0731, trọng số mở và các phép đo độc lập từ Artificial Analysis. DeepSeek V4.1 Flash có thông báo chính thức, hai ngày kiểm tra tốc độ từ cộng đồng, và chưa có bảng thông số công bố, chưa có báo cáo kỹ thuật và chưa có điểm số từ bên thứ ba. Các tuyên bố của nhà cung cấp được ghi nhãn là tuyên bố của nhà cung cấp bên dưới; các số liệu cộng đồng được ghi nhãn là đo lường cộng đồng.

Hạng Flash vừa được đặt lại — ba thay đổi, một tuần.

DeepSeek V4 Flash, mô hình hỗn hợp chuyên gia với 284B tham số và 13B tham số kích hoạt, đã là lựa chọn mặc định hợp lý với chi phí thấp, thông lượng cao cho một phần lớn lưu lượng văn bản sản xuất kể từ bản cập nhật ngày 31 tháng 7. Ba thông báo trong ba ngày đã làm rung chuyển nền tảng của nó:

• Ngày 8 tháng 9 — DeepSeek đã mở bản beta có giới hạn thời gian của V4.1 Flash cho mọi tài khoản API, giới hạn ở 20 yêu cầu đồng thời và dự kiến hết hạn vào ngày 10 tháng 9, dưới một tên mô hình mang ngày hết hạn của chính nó.

• Ngày 9 tháng 9 — nền tảng mở đã công bố việc phát hành chính thức DeepSeek V4.1 Flash vào khoảng ngày 10 tháng 9, mô tả một cấu trúc mô hình mới với hỗ trợ đa phương thức gốc, và tuyên bố rằng nó vượt trội DeepSeek V4 Pro về hiệu suất, chi phí, tốc độ và tổng thời gian hoàn thành.

Ngày 10 tháng 9 — bản phát hành chính thức mang đến bảng giá Flash-series mới, có hiệu lực từ 12:00 giờ Bắc Kinh, cắt giảm mức giá mà DeepSeek V4 Flash đã áp dụng kể từ đợt tăng giá ngày 17 tháng 8 vốn vấp phải sự chỉ trích nặng nề từ các nhà phát triển.

Điểm cuối cùng trong số đó xứng đáng được nhắc riêng vì đây là đợt giảm giá hiếm hoi thực sự là giảm giá. Trong bảng giá mới, đầu vào ngoài giờ cao điểm có cache hit giảm từ ¥0,05 xuống ¥0,02 mỗi triệu token — mức giảm 60% — trong khi đầu vào cache-miss giảm từ ¥1,5 xuống ¥1 và đầu ra từ ¥4,5 xuống ¥4. Giá giờ cao điểm gấp đôi mức ngoài giờ cao điểm. Quy đổi tròn theo đô la Mỹ, tức là khoảng $0,003 mỗi triệu token đầu vào cache-hit, $0,14 đầu vào cache-miss và $0,56 đầu ra ở giờ thấp điểm, còn giờ cao điểm gấp đôi. Khoảng cách 24 ngày giữa đợt tăng giá hồi tháng 8 và đợt giảm giá này không phải là sự trùng hợp ngẫu nhiên về lịch trình; việc định giá lại là một phần của đợt ra mắt V4.1 Flash.

Cùng phân khúc, khác mẫu mã

Cách hiểu đơn giản là V4.1 Flash chính là V4 Flash với núm tốc độ được vặn lên. Thực tế không phải vậy. Bản cập nhật 0731 là một bản cập nhật hậu huấn luyện trên nền DeepSeek V4 Flash hiện có — cùng kiến trúc, cùng bố cục hỗn hợp chuyên gia 284B tổng / 13B hoạt động. Mô tả của DeepSeek về V4.1 Flash chỉ ra một điều lớn hơn: một cấu trúc mô hình mới, mà một số trang tin hiểu là một đợt tiền huấn luyện mới thay vì một bản tinh chỉnh. Sự khác biệt này quan trọng vì một mô hình được huấn luyện lại không kế thừa hành vi của mô hình cũ theo cách mà bản cập nhật làm được — cách xử lý prompt, cách gọi công cụ và phong cách đầu ra đều có thể thay đổi ngay cả khi năng lực không đổi.

Kiến trúc — DeepSeek V4.1 Flash: cấu trúc mô hình mới, được DeepSeek mô tả là bản xây dựng mới với đầu vào đa phương thức gốc. DeepSeek V4 Flash: bản làm mới sau huấn luyện V4-Flash-0731 của mô hình MoE có tổng 284B / 13B tham số hoạt động.

• Đầu vào — V4.1 Flash xử lý trực tiếp đầu vào văn bản và hình ảnh ngay trong mô hình cơ sở; DeepSeek V4 Flash chỉ hỗ trợ văn bản, còn hình ảnh cần đến bản dựng ghép thêm riêng DeepSeek-V4-Flash-Vision-Exp.

• Ngữ cảnh và đầu ra — DeepSeek V4 Flash công bố ngữ cảnh 1M và đầu ra tối đa 384K; tài liệu ra mắt của DeepSeek cho biết V4.1 Flash vẫn giữ cửa sổ ngữ cảnh ở quy mô triệu token, nhưng chưa có thẻ thông số chính thức nào được công bố.

• Đồng thời — DeepSeek V4 Flash liệt kê mức trần 2.500 kết nối đồng thời; bản beta V4.1 Flash bị giới hạn ở 20 và tuyên bố "độ đồng thời cao" của DeepSeek cho bản phát hành chưa được hỗ trợ bởi một con số công bố tại thời điểm viết bài.

• {{1}}Trọng số{{/1}} — {{2}}DeepSeek V4 Flash có trọng số mở theo giấy phép MIT; chưa có gì được công bố cho V4.1 Flash.{{/2}}

• Xếp hạng độc lập — DeepSeek V4 Flash đã được Artificial Analysis đo lường; DeepSeek V4.1 Flash chưa có điểm số từ bên thứ ba.

Điểm so sánh văn bản với đa phương thức xứng đáng có thêm một câu ngay cả trong một bài so sánh văn bản, vì nó quyết định V4.1 Flash dành cho ai. Nếu pipeline của bạn đang chạy DeepSeek V4 Flash cho văn bản và DeepSeek-V4-Flash-Vision-Exp cho hình ảnh, thì V4.1 Flash là bản build DeepSeek đầu tiên bao phủ cả hai đường dẫn trong một mô hình — một endpoint duy nhất để bảo trì, không có encoder nào gắn thêm ở bên cạnh.

A two-column comparison scoreboard titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — the scoreboard': left column DeepSeek V4.1 Flash — Architecture New pre-trained structure, Context window 1M expected (not published), Speed (output) ~280-500 tok/s (community), Multimodal input Native text + image, Price (off-peak, per 1M) Flash list from Sep 10, Open weights Not announced; right column DeepSeek V4 Flash — Architecture V4-Flash-0731, 284B/13B MoE, Context window 1M in / 384K out, Speed (output) ~120-140 tok/s (AA-measured), Multimodal input Text only; Vision-Exp bolt-on, Price (off-peak, per 1M) Flash list from Sep 10, Open weights MIT-licensed; footer 'V4.1 Flash figures vendor- and community-reported; DeepSeek V4 Flash per Artificial Analysis and DeepSeek API docs.'

Nơi chúng thực sự khác biệt: thông lượng và chi phí cho một tác vụ hoàn thành.

Với mức giá tương đương, hai mẫu khác nhau ở tốc độ, và tốc độ chính là nơi các con số gây ấn tượng mạnh nhất. Artificial Analysis đo tốc độ của DeepSeek V4 Flash 0731 vào khoảng 120–140 token đầu ra mỗi giây trên API của DeepSeek, tùy thuộc vào cấu hình và cửa sổ đo lường. Những người thử nghiệm đầu tiên của V4.1 Flash báo cáo tốc độ sinh văn bản ổn định trong khoảng 280 đến 500 token mỗi giây tùy theo tác vụ, với đỉnh trên 500 trong các lần chạy có độ cạnh tranh thấp; các con số cao hơn được cộng đồng đo lường, không phải do nhà cung cấp công bố, và token mỗi giây chưa bao giờ là thuộc tính nội tại của một mô hình. Tuy vậy, xu hướng nhất quán qua mọi báo cáo ngày đầu, và tuyên bố của DeepSeek về tốc độ sinh văn bản nhanh hơn và tổng thời gian hoàn thành thấp hơn cũng chỉ cùng một hướng.

Khoảng cách tốc độ đó làm thay đổi bài toán kinh tế ngay cả khi hai mô hình dùng chung một bảng giá, vì bạn trả tiền theo token và token đến nhanh hơn. Một tác vụ truy xuất ngữ cảnh dài hoặc sinh mã mà trên V4 Flash mất một phút thì trên V4.1 Flash có thể hoàn thành chỉ trong một phần nhỏ thời gian đó với cùng mức giá mỗi token — một số người thử nghiệm ngay ngày đầu đã báo cáo tốc độ tổng thể nhanh hơn từ năm đến sáu lần đúng trên các nhóm tác vụ đó. Những phàn nàn "tiêu tiền nhanh hơn" thời kỳ beta là mặt trái của cùng một đồng xu: với mức giá mỗi token không đổi, một mô hình phát token nhanh gấp hai đến ba lần sẽ làm cạn số dư nhanh hơn theo từng phút. Liệu hóa đơn cho mỗi tác vụ có thực sự giảm hay không phụ thuộc vào việc mô hình mới có hoàn thành với ít token hơn và ít lần thử lại hơn hay không, và đó chính là điều chưa ai có thể chứng minh được.

Trên chính thẻ giá, hai mẫu model được đặt cạnh nhau. Theo danh sách ngày 10 tháng 9, mỗi triệu token trong giờ thấp điểm: ¥0,02 cho input trúng cache, ¥1 cho input trượt cache và ¥4 cho output, giờ cao điểm gấp đôi — mức giá áp dụng cho nhóm Flash trước khi cắt giảm vốn là ¥0,05, ¥1,5 và ¥4,5. Đối với khối lượng công việc sử dụng cache nhiều, việc cắt giảm là điểm nhấn: ¥0,02 so với ¥0,05 là mức giảm 60% trên các token chiếm phần lớn luồng input của một tác vụ autocomplete hoặc vòng lặp agent. Đối với tác vụ tiếp nhận dữ liệu mới làm trượt cache, mức tiết kiệm chỉ khoảng một phần ba. Điều đó không làm cho V4.1 Flash rẻ hơn V4 Flash trên mỗi token — chúng dùng chung thẻ giá — nhưng kiến trúc có thông lượng cao hơn là điểm khác biệt và không tốn thêm chi phí.

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the three public models — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak) and published concurrency limits.

Biên nhận dành cho V4 Flash; khiếu nại dành cho V4.1 Flash

Sự thật quan trọng bậc nhất về benchmark trong cuộc so sánh này hiện nay là chưa có benchmark nào cho mô hình mới. Tuyên bố đình đám của DeepSeek V4.1 Flash — rằng nó vượt trội toàn diện DeepSeek V4 Pro về năng lực, chi phí và tốc độ — chỉ đến từ phía nhà sản xuất và chưa được kiểm chứng. Không có số lượng tham số, bảng đánh giá hay báo cáo kỹ thuật nào được công bố, và Artificial Analysis cũng chưa đo lường nó tại thời điểm viết bài. Giữa một dòng mô hình mà lần ra mắt chủ lực gần nhất đã thu hút sự soi xét độc lập, câu "cứ tin chúng tôi, nó thắng bản Pro" là một lời khẳng định mà độc giả nên giữ khoảng cách cho đến khi có bên thứ ba chạy thử.

Ngược lại, DeepSeek V4 Flash có một hồ sơ thực tế rõ ràng. Artificial Analysis xếp phiên bản lý luận 0731 vào nhóm các mô hình dẫn đầu trong phân khúc của nó, đánh giá nó cao hơn hẳn mức trung bình của các mô hình trọng số mở tương đương, và đo thông lượng đầu ra trên chính API của DeepSeek trong khoảng ~120–140 token/giây như đã trích dẫn ở trên. Đó là những con số mà V4.1 Flash sẽ bị đem ra so sánh khi điểm số của chính nó được công bố, và chúng đặt ra một mức chuẩn cao hơn những gì nhãn "Flash nhanh và rẻ" ngụ ý. Mô hình mà phiên bản mới thay thế không hề yếu; nó thực sự là một con ngựa thồ mạnh mẽ với trọng số mở. Đó chính là điều khiến quyết định nâng cấp trở nên thực chất thay vì chỉ mang tính hình thức.

Định tuyến đang đảm nhiệm phần việc nặng nhọc — bên trong DeepSeek và cho bạn.

Phần ít được nhắc đến nhất trong đợt ra mắt này là việc DeepSeek đang định tuyến lưu lượng giữa chính các mô hình của mình. Thông báo của họ rất minh bạch: một khi V4.1 Flash chính thức hoạt động và cho đến khi V4.1 Pro được phát hành, mọi yêu cầu API nhắm đến deepseek-v4-pro sẽ được phục vụ bởi DeepSeek V4.1 Flash và tính phí theo mức giá của dòng Flash. Người dùng V4 Pro nhận được kiến trúc mới và chỉ phải trả một phần nhỏ chi phí cho mỗi token mà không cần thay đổi một dòng mã nào. Hãy lưu ý điều không được định tuyến: các lệnh gọi deepseek-v4-flash. Mô hình Flash cũ vẫn tiếp tục phục vụ những ai còn trỏ đến nó — đây chính là lý do sự so sánh này tồn tại: nếu bạn đang dùng V4 Pro, việc chuyển đổi sẽ được thực hiện cho bạn; còn nếu bạn đang dùng V4 Flash, đó là quyết định bạn phải tự mình đưa ra.

Một nhà cung cấp âm thầm quyết định rằng một mô hình rẻ hơn nên tiếp nhận các cuộc gọi vốn dành cho mô hình cao cấp của họ chính là sự công nhận đầy ấn tượng dành cho V4.1 Flash — và đó cũng chính là logic mà một lớp định tuyến áp dụng xuyên suốt các nhà cung cấp. Đó là khoảng trống mà một nền tảng như OrcaRouter lấp đầy: một API cho hơn 200 mô hình, với giá niêm yết của nhà cung cấp được truyền thẳng với mức phụ giá 0%, nhờ đó đợt giảm giá Flash ngày 10 tháng 9 của DeepSeek có hiệu lực ở phía chúng tôi ngay trong cùng ngày. DeepSeek V4 Flash trên OrcaRoutervẫn có thể gọi được bằng cùng một khóa như mọi mô hình khác bạn đang chạy, điều này khiến cách áp dụng an toàn một mô hình ngày đầu ra mắt thực sự rẻ: chuyển một phần lưu lượng đến DeepSeek V4.1 Flash trên API của chính DeepSeek, giữ DeepSeek V4 Flash làm phương án dự phòng tự động trên cùng một quy tắc định tuyến, và để cơ chế chuyển đổi dự phòng bắt các trường hợp ngoại lệ trong khi kiến trúc mới chứng minh giá trị của nó.

DeepSeek V4.1 Flash so với DeepSeek V4 Flash: bạn nên gọi loại nào?

Nếu câu trả lời trung thực là một trong hai mô hình phù hợp với tất cả mọi người, thì sẽ không có bài viết này. Hai mô hình hiện nay phù hợp với các hồ sơ rủi ro khác nhau, và sự phân chia rõ ràng đến bất thường.

A two-panel decision infographic titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — which should you call?': left panel 'Move to DeepSeek V4.1 Flash' with bullets Starting a new Flash workload today / Latency- or throughput-bound tasks / Needs native image input in one model / Comfortable with day-one risk; right panel 'Stay on DeepSeek V4 Flash' with bullets Serving production at high concurrency / Relies on open weights / self-hosting / Prompts and evals tuned to V4-Flash-0731 / Wants published limits and track record; footer 'No independent benchmark for V4.1 Flash yet — keep V4 Flash as the fallback.'

Chuyển sang DeepSeek V4.1 Flash nếu hôm nay bạn đang bắt đầu một khối lượng công việc Flash mới, nếu độ trễ và thông lượng là ràng buộc quyết định, nếu bạn muốn nhận đầu vào hình ảnh mà không cần duy trì một mô hình thứ hai, hoặc nếu bạn sẵn lòng để bộ định tuyến của chính DeepSeek giảm thiểu rủi ro cho tuyên bố cấp Pro. Mô hình này nằm trên API của chính DeepSeek với tên deepseek-v4.1-flash, được định giá trên cùng gói Flash như mô hình mà nó thay thế, và mọi tín hiệu ngày đầu tiên đều cho thấy nó nhanh hơn đáng kể.

Hãy tiếp tục dùng DeepSeek V4 Flash nếu bạn đang phục vụ lưu lượng sản xuất ở mức trần 2.500 kết nối đồng thời đã được công bố, nếu bạn dựa vào trọng số mở của nó để tự lưu trữ hoặc tuân thủ quy định, hoặc nếu prompt, bộ đánh giá và logic gọi công cụ của bạn được tinh chỉnh theo hành vi của bản 0731 và không thể hấp thụ những điểm bất thường của một mô hình được huấn luyện lại ngay từ ngày đầu. Một đợt tiền huấn luyện mới là một thay đổi hành vi, không chỉ là thay đổi tốc độ, và bản dựng 0731 là phiên bản có tháng dữ liệu thực chứng.

Đối với hầu hết các đội ngũ, lựa chọn mặc định hợp lý nhất là con đường trung dung: coi DeepSeek V4.1 Flash là mặc định cho các khối lượng công việc mới, giữ DeepSeek V4 Flash làm phương án dự phòng cho khối lượng công việc mang lại doanh thu, và để bảng đánh giá độc lập đầu tiên — cùng với một thẻ thông số kỹ thuật được công bố và một chỉ số đồng thời — giải quyết cuộc tranh luận mà bản beta hai ngày không thể giải quyết. Tầng Flash vừa có một engine mới; engine cũ không lỗi thời, nó là chuẩn mực.

Bạn có tò mò lưu lượng cấp Pro trông như thế nào khi DeepSeek định tuyến nó đến V4.1 Flash với mức giá Flash? DeepSeek V4 Pro trên OrcaRouter — cả hai trên một key, được tính phí theo giá niêm yết của DeepSeek.

So sánh trong bài viết này4

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày