Một thẻ tiêu đề chính có dòng chữ 'DeepSeek V4.1 Flash' với phụ đề 'một mô hình cơ sở hoàn toàn mới mang số phiên bản .1', hai huy hiệu dạng viên nang ghi 'GA - 10 SEP 2026' và 'OPEN WEIGHTS - MIT', dòng chân trang ghi 'Kiến trúc do nhà cung cấp công bố; chưa có đánh giá độc lập', họa tiết thanh nén ở bên trái, và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

DeepSeek V4.1 Flash: Mô hình nền hoàn toàn mới đội lốt số hiệu bản phát hành điểm

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

DeepSeek V4.1 Flash ra mắt vào ngày 10 tháng 9 năm 2026: trọng số mở theo giấy phép MIT, ngữ cảnh một triệu token, kiến trúc Causal Encoder-Decoder hoàn toàn mới, cùng xương sống mixture-of-experts với 552 tỷ tham số mà model card của chính Deep​Seek xếp vào cái mà công ty gọi là "họ kiến trúc mới". Nếu như tracker — người đã chỉ ra cách đặt tên này — nói đúng, thì đây cũng là lần đầu tiên Deep​Seek gắn số phiên bản .1 lên một mô hình nền hoàn toàn mới — một nhãn thường báo hiệu sự tinh chỉnh chứ không phải xây dựng lại. DeepSeek V4.1 Pro, phiên bản hàng đầu mà con số đó ngụ ý, vẫn chưa tồn tại.

Sự không khớp đó đáng giá hơn một lời bắt bẻ về tên gọi. Bất kỳ ai so sánh các thế hệ Deep​Seek theo số phiên bản sẽ đọc "V4 Flash lên V4.1 Flash" như một bước vá và phân bổ sự chú ý tương ứng. Kiến trúc bên dưới cho thấy điều ngược lại, và quyết định của chính công ty khi khai tử mô hình chủ lực 1,6 nghìn tỷ tham số để nhường chỗ cho mô hình Flash càng cho thấy điều ngược lại rõ ràng hơn.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Released 10 Sep 2026 (web, app, API), Backbone 552B-parameter MoE, Architecture Causal Encoder-Decoder, Active per token 8B prefill / 16B decode, KV cache 890 bytes per token (FP4), and Price $0.15 in / $0.60 out per 1M, with a footer reading 'Figures per DeepSeek's model card and API docs; no independent evaluation has been published.'

Những gì thực sự đã được phát hành vào ngày 10 tháng 9

Đây không phải bản rò rỉ và cũng không phải bản beta. Bài thử nghiệm API kéo dài hai ngày bắt đầu vào ngày 8 tháng 9 với mã mô hình deepseek-v4.1-flash-expires-on-0910 đã kết thúc đúng như hậu tố của tên gọi cho biết, và bản phát hành chính thức đã ra mắt hôm nay trên ứng dụng web, ứng dụng di động và API nội bộ của Deep​Seek, với trọng số mô hình và báo cáo kỹ thuật được công bố trên Hugging Face tại deepseek-ai/DeepSeek-V4.1-Flash.

Những chi tiết thực tế quan trọng hơn nghi thức:

• Tên mô hình — gọi là deepseek-flash. Các tên cũ deepseek-v4-flashdeepseek-v4-flash-vision-exp vẫn được chấp nhận, nhưng chúng không còn trỏ đến các mô hình như trước nữa: cả hai đều đã ngừng sử dụng, và các yêu cầu gọi tên chúng sẽ được phục vụ bởi DeepSeek V4.1 Flash và tính phí theo mức giá Flash.

• Có gì trong hộp — tham số backbone 552B, cửa sổ ngữ cảnh 1M token, đầu ra tối đa 384K, đầu ra JSON, gọi hàm và chế độ suy luận được bật theo mặc định với các cài đặt nỗ lực thấp, cao và tối đa.

• Giấy phép — MIT, bao gồm cả trọng số, với một thư mục inference và một mô-đun mã hóa riêng biệt trong kho lưu trữ. Deep​Seek đang công khai mời cộng đồng mã nguồn mở xây dựng hỗ trợ inference, đây là tín hiệu chuẩn cho thấy việc phục vụ ngay từ ngày đầu trên các runtime chính chỉ là vấn đề vài ngày chứ không phải vài tuần.

Bản .1 không phải là bản phát hành điểm

Tuyên bố khởi đầu bài viết này đến từ teortaxesTex, một người theo dõi Deep​Seek ẩn danh nhưng rất sát sao, trong một bài đăng ngày 10 tháng 9: rằng đây là "lần đầu tiên Deep​Seek gắn nhãn một mô hình nền tảng hoàn toàn mới với phiên bản phát hành .1", rằng V4.1 "khác biệt với V4 nhiều hơn so với, chẳng hạn, LLaMA 3 so với LLaMA 1", và rằng Deep​Seek "không cảm thấy điều này đáng để gọi là V5" — mà người đăng không thể nói rõ lý do vì sao.

Coi phần nhân quả là suy luận và phần cấu trúc là thứ có thể kiểm chứng. Kết luận suy luận — vì sao DeepSeek chọn .1 thay vì V5 — chỉ là cách đọc của một người quan sát, không hơn không kém; không ai bên ngoài công ty giải thích quyết định này, và chính tài liệu của DeepSeek cũng không bao giờ đề cập đến. Phần có thể kiểm chứng là kiến trúc, và nó không giống một bản phát hành nhỏ. Nhật ký thay đổi của DeepSeek mô tả V4.1 Flash là "mô hình nhỏ nhất trong họ kiến trúc mới của chúng tôi", một câu rất lạ để viết về một bản nâng cấp phiên bản: nâng cấp phiên bản mở rộng một họ, chứ không sáng lập ra một họ mới.

Có một cái giá thực sự cho sự mơ hồ này, và nó đổ lên người mua chứ không phải lên DeepSeek. Số phiên bản là tín hiệu rẻ nhất mà nhà phát triển có để xác định 'đây là thế hệ mới hay chỉ là bản tinh chỉnh lại, và nó xứng đáng bao nhiêu ngân sách đánh giá của tôi?' DeepSeek giờ đây đã khiến tín hiệu đó trở nên không đáng tin cậy theo một hướng — một mô hình sáng lập cả một dòng kiến trúc lại nằm cách một mô hình chỉ thay đổi công thức hậu huấn luyện đúng một chữ số thập phân. Công ty được giữ mốc V5 của mình để dành. Tất cả những ai đang đánh giá việc chuyển đổi đều phải trả giá cho sự nhầm lẫn.

Ý nghĩa của "kiến trúc mới" trong các trọng số

Thẻ mô hình có mức độ cụ thể khác thường, nhờ đó tuyên bố về thế hệ trở nên dễ kiểm chứng mà không cần một benchmark nào. Bốn điểm nổi bật.

A screenshot of the DeepSeek-V4.1-Flash model card on Hugging Face (captured September 10, 2026) showing the MIT licence tag, Image-Text-to-Text and safetensors tags, 485B parameters in the sidebar, and model-card text describing a multimodal Mixture-of-Experts with 552B backbone parameters, a Causal Encoder-Decoder architecture of a 20-layer causal encoder followed by a 20-layer decoder, activation of 8B parameters per token during prefill and 16B during decode, SWA Bounded Replay, Compressed Sparse Attention 2, and a KV cache footprint of 890 bytes per token.

• Kích hoạt bất đối xứng — Sự phân chia Bộ mã hóa-Giải mã Nhân quả là một transformer 40 lớp được tổ chức thành một bộ mã hóa nhân quả 20 lớp tiếp theo là một bộ giải mã 20 lớp, trong đó bộ nhớ cache KV toàn cục của bộ giải mã được chiếu từ các trạng thái ẩn cuối cùng của bộ mã hóa thay vì được suy ra từ chính mỗi lớp giải mã. Ý tưởng của thiết kế này là mô hình chỉ kích hoạt 8B tham số cho mỗi token trong giai đoạn prefill và 16B trong giai đoạn giải mã. Các tác vụ agent nặng về đầu vào — tài liệu dài, dấu vết công cụ dài — nhận được nửa rẻ của mô hình; quá trình sinh nhận được nửa đắt.

• Nén bộ đệm KV, đo theo token — DeepSeek-V4.1-Flash chạy bộ đệm KV chính FP4 ở 890 byte mỗi token, mức mà thẻ đưa ra vào khoảng một phần tư so với DeepSeek V4 Flash. Truyền thông Trung Quốc còn đi xa hơn và so sánh mức nén với thế hệ V4 đầu tiên như một mức giảm 437×; con số lớn hơn đó là số liệu do nhà cung cấp tính toán trên một cơ sở khác, vì vậy hãy coi nó là một tuyên bố thay vì một phép đo.

SWA Bounded Replay — cơ chế chú ý cửa sổ trượt thông thường buộc bạn phải lưu trạng thái KV vào SSD để tái dựng ngữ cảnh. Phương pháp này thay vào đó xây dựng lại các trạng thái KV SWA bị thiếu bằng cách chỉ phát lại cửa sổ token gần nhất, cắt giảm mức chiếm dụng KV bền vững xuống còn khoảng một phần tám so với DeepSeek V4 Flash.

• Compressed Sparse Attention 2 — mỗi lớp attention chạy ở một trong ba chế độ tĩnh (Full, Reindex hoặc Reuse), chia sẻ trạng thái KV và indexer giữa các lớp, với một indexer thưa có phân cấp giới hạn chi phí của các lớp sâu hơn một cách độc lập với độ dài ngữ cảnh.

Đọc bốn điều đó cùng nhau, bức tranh chiến lược trở nên rõ ràng: đây trước hết là một kiến trúc tối ưu cho sự thưa thớt và hiệu quả bộ nhớ đệm, được thiết kế để cùng một cấu trúc có thể mở rộng sau này. Việc đề cập đến “một họ kiến trúc mới” đang thực sự có ý nghĩa — đó là tuyên bố rằng còn nhiều điều sắp đến.

Các điểm chuẩn: do nhà sản xuất công bố và chưa bị bác bỏ

DeepSeek đã công bố một bộ benchmark khi phát hành. Theo số liệu của chính công ty, V4.1 Flash đạt GPQA Diamond 90.9, rating Codeforces 3471, MathArena Apex 65.6, Terminal-Bench 2.1 ở mức 90.6, DeepSWE v1.1 ở mức 74.2, và 63.9 trên HLE với công cụ — con số cuối cùng có chú thích giới hạn chỉ số cơ sở 36.8 ở tập con văn bản thuần túy của benchmark đó.

Hãy gọi đúng tên những con số này. Chúng do nhà cung cấp báo cáo, được công bố mà không kèm theo đánh giá độc lập, và chúng là những con số mà DeepSeek dùng để biện minh cho việc khai tử sản phẩm chủ lực của chính mình — điều khiến chúng trở thành những con số đáng kiểm chứng nhất. Tính đến thời điểm ra mắt ngày 10 tháng 9, Artificial Analysis vẫn chưa công bố kết quả đo lường nào cho DeepSeek V4.1 Flash, và trang mô hình của chính Hugging Face vẫn còn ghi chú rằng mô hình "không được triển khai bởi bất kỳ Inference Provider nào." Tuyên bố trọng yếu của bản phát hành này — rằng một mô hình cấp Flash vượt trội toàn diện so với mô hình chủ lực 1.6T tham số về hiệu năng, chi phí, tốc độ và tổng thời gian xử lý — hiện chỉ là tuyên bố phía nhà cung cấp mà chưa có kiểm định độc lập.

Có một lời cảnh báo trung thực ở phía bên kia nữa. Cùng một báo cáo của nhà cung cấp cho thấy V4.1 Flash thắng 13 trong 16 so sánh với Kimi K3 và 11 trong 13 với GLM-5.3, trong khi vẫn xếp sau GPT-5.6 Sol và Claude Opus 5 trên các tác vụ Terminal-Bench 3.0 và 4.0 mới hơn và trên ProgramBench. Đó là một hình dạng mạch lạc — mạnh nhất ở công việc lập trình, terminal và tự động hóa tác nhân mà kiến trúc này được tối ưu hóa, yếu hơn ở các tác vụ suy luận tiên phong — và đó là hình dạng mà một bước tiến thế hệ thực sự sẽ có.

Giá cả và bộ chuyển mạch định tuyến đáng để ghi vào lịch.

Giá mới có hiệu lực khi ra mắt, và đây vẫn là biểu giá Flash như trước chứ không phải giảm giá: trên deepseek-flash, đầu vào trúng bộ nhớ đệm có giá $0,003 mỗi triệu token ngoài giờ cao điểm và $0,006 vào giờ cao điểm, đầu vào lệch bộ nhớ đệm là $0,15 và $0,30, còn đầu ra là $0,60 và $1,20. Giờ cao điểm chính xác gấp đôi ngoài giờ cao điểm và áp dụng từ 01:00–04:00 và 06:00–10:00 UTC vào các ngày trong tuần.

Phần cắt giảm thay vào đó rơi vào lưu lượng Pro. DeepSeek V4 Pro có giá $0.022 và $0.044 cho đầu vào cache-hit, $0.66 và $1.32 cho đầu vào cache-miss, và $1.98 và $3.96 cho đầu ra — vì vậy việc định tuyến các yêu cầu có tên Pro sang V4.1 Flash giảm chi phí đầu ra của chúng khoảng 70% trong khi, theo lời Deep​Seek, nâng cao khả năng trả lời chúng.

A screenshot of DeepSeek's official API Models & Pricing page (captured September 10, 2026) showing columns for deepseek-flash and deepseek-v4-pro, with model versions DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, both at 1M context length and 384K maximum output. Vision is marked supported for deepseek-flash and 'not supported' for deepseek-v4-pro. Pricing shows 1M cache-hit input tokens at $0.003 off-peak and $0.006 at peak for deepseek-flash versus $0.022 and $0.044 for deepseek-v4-pro, and 1M cache-miss input tokens at $0.15 off-peak and $0.3 at peak for deepseek-flash versus $0.66 and $1.32 for deepseek-v4-pro.

Việc định tuyến lại đó đã được lên lịch, không phải là giả định. Sau 12:00 giờ Bắc Kinh ngày 14 tháng 9 năm 2026, các yêu cầu ghi tên deepseek-v4-pro sẽ chuyển sang V4.1 Flash và được tính phí theo giá Flash, duy trì như vậy cho đến khi DeepSeek V4.1 Pro được phát hành. Nếu hệ thống tích hợp của bạn mã hóa cứng tên mô hình Pro, sẽ không có gì bị hỏng — bạn nhận được một mô hình khác với giá đầu ra chỉ bằng khoảng một phần ba, không cần thay đổi mã và không cần thông báo gì ngoài một mục trong nhật ký thay đổi. Nếu bạn định tuyến theo nấc năng lực thay vì theo tên mô hình, thì ngày 14 tháng 9 là mốc cần kiểm tra lại.

Điều này có nghĩa gì nếu bạn gọi Deep​Seek hôm nay

OrcaRouter chưa cung cấp DeepSeek V4.1 Flash — tính đến hôm nay, trang model cho deepseek-v4.1-flash trả về "model not found", và chúng tôi muốn nói thẳng điều đó hơn là ngụ ý điều ngược lại. Có hai hệ quả. Thứ nhất, việc định tuyến lại mà Deep​Seek công bố là hành vi API của chính hãng, vì vậy việc chuyển đổi vào ngày 14 tháng 9 diễn ra trên endpoint của chính Deep​Seek bất kể bạn truy cập bằng cách nào. Thứ hai, nếu bạn muốn kiến trúc mới ngay hôm nay, bạn đang gọi trực tiếp đến nhà cung cấp.

Điều chúng tôi định tuyến là phần còn lại của dòng Deep​Seek chỉ với một khóa: DeepSeek V4 FlashDeepSeek V4 Pro, cùng với 200+ mô hình khác. Giá ở đó là giá niêm yết từ nhà cung cấp Deep​Seek được chuyển thẳng với mức cộng thêm 0%, đây là điều quan trọng đối với một bản phát hành như thế này — khi nhà cung cấp hạ giá, mức giảm sẽ có hiệu lực ở phía chúng tôi ngay trong ngày thay vì sau một chu kỳ định giá lại. Và khi V4.1 Flash thực sự xuất hiện trong danh mục, mức nửa giá trong giờ thấp điểm nêu trên chính là mức giá, chứ không phải khoản chiết khấu mà chúng tôi thương lượng.

Lập luận về định tuyến cho một mô hình mới như thế này không thực sự xoay quanh giá cả. Nó xoay quanh việc bạn đặt bao nhiêu phần của luồng sản xuất vào một kiến trúc chỉ mới ra mắt được một tuần, chưa có benchmark độc lập và chưa có bên thứ ba phục vụ. Giữ mô hình mới trong một tầng (tier) mà bạn có thể chuyển đổi — hoặc thử nghiệm nó trên một key không phải key sản xuất — chính là sự khác biệt giữa một cuộc đánh giá và một sự cố.

Điều gì sẽ giải quyết được câu hỏi về cách đặt tên

Ba điều, theo thứ tự tăng dần về mức độ chúng sẽ tiết lộ cho bạn.

Một đánh giá độc lập về DeepSeek V4.1 Flash sẽ kiểm chứng tuyên bố về kiến trúc trên một bộ thử nghiệm của bên thứ ba. Đó là phép đo duy nhất biến một bảng thông số của nhà cung cấp thành một sự thật, và đó cũng chính là tin tức tiếp theo có khả năng xảy ra cao nhất.

DeepSeek V4.1 Pro sẽ kiểm chứng tuyên bố của gia đình. Thông báo định tuyến xác định nó là điểm cuối của cửa sổ Pro-to-Flash, điều này khiến nó trở thành mô hình mà toàn bộ bản phát hành này được cấu trúc xoay quanh — và nó vẫn là mô hình mà Deep​Seek xác nhận ít nhất: không có thẻ mô hình, không có số lượng tham số, không có ngày, không có trọng số, không có giá.

Và một điều hữu ích dù không hào nhoáng: liệu Deep​Seek có làm lại điều này hay không. Nhãn .1 thứ hai trên một mô hình nền tảng mới khác sẽ biến một bất thường thành quy ước, và quy ước là thứ mà nhà phát triển có thể lên kế hoạch dựa trên đó. Một mô hình chỉ là điều gây tò mò. Cách đặt tên chỉ trở nên gây hiểu lầm một cách hữu ích khi có một mô hình lặp lại.

Hiện tại, cách đọc thực tế phân định rõ ràng theo từng đối tượng của bạn. Nếu bạn đang dùng DeepSeek V4 Pro, hãy ghi ngày 14 tháng 9 vào lịch và chạy lại các bài đánh giá của bạn trước thời điểm đó, vì mô hình đằng sau cái tên đó đang thay đổi dù bạn có yêu cầu hay không. Nếu bạn đang dùng DeepSeek V4 Flash, bạn đã được chuyển, với cùng mức giá, sang một kiến trúc mà DeepSeek xây dựng để mở rộng quy mô. Và nếu bạn đang chờ V5, câu trả lời thật lòng là DeepSeek dường như đã phát hành thế hệ này nhưng từ chối đặt tên cho nó — kiểu chuyện mà bạn chỉ có thể làm một lần trước khi người ta ngừng tin vào con số đó.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày