Thẻ tiêu đề hero cho DeepSeek V4.1 Flash với phụ đề 'Bản beta API hai ngày: những gì chúng ta biết cho đến nay', các huy hiệu dạng viên thuốc ghi 'BẢN DỰNG TRUNG GIAN' và 'THỬ NGHIỆM API - HẾT HẠN 09-10', dòng chân trang 'Bài đăng phát hành chính thức dự kiến sẽ có rất sớm' và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

DeepSeek V4.1 Flash Ra Mắt Bản Beta API Hai Ngày: Kiến Trúc Mới, Đa Phương Thức Gốc và Tham Vọng Đẳng Cấp Chuyên Nghiệp

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

DeepSeek V4.1 Flash xuất hiện đúng ngay nơi Deep​Seek thử nghiệm mọi thứ trước khi công bố: bên trong API trực tiếp, dưới một mã mô hình mang theo ngày hết hạn của chính nó. Mã — deepseek-v4.1-flash-expires-on-0910 — bắt đầu phục vụ từ ngày 8 tháng 9 năm 2026, sau khi nhóm Deep​Seek đăng một bài kiểm thử nội bộ "phiên bản trung gian" trong các nhóm cộng đồng chính thức của họ, và phần đuôi 0910 đó chính là câu chuyện được kể dưới dạng thu nhỏ. Đây là một bản dựng được đưa vào môi trường API thực để thử nghiệm có giới hạn, dự kiến sẽ ngừng hoạt động vào khoảng ngày 10 tháng 9, trước bài đăng công bố chính thức mà những người tiết lộ đang theo dõi mô hình này dự đoán sẽ diễn ra "rất sớm". Đây không phải là một sự ra mắt chính thức. Không có thẻ mô hình, không có báo cáo kỹ thuật, không có mục nhật ký thay đổi, và tính đến tối nay, trang Models & Pricing công khai của Deep​Seek vẫn chỉ liệt kê DeepSeek V4 Flash, DeepSeek V4 ProDeepSeek-V4-Flash-Vision-Exp.

Tất cả nội dung bên dưới nên được đọc với dấu hoa thị (*) đó trong tâm trí. Kênh chính thức ở đây là một thông báo của nhóm cộng đồng kèm theo biểu mẫu phản hồi, không phải là ghi chú phát hành. Phần tiếp theo là sự tổng hợp giữa thông báo đó, các bài đưa tin từ truyền thông Trung Quốc trong vòng vài giờ sau khi công bố, và số liệu đo lường trong ngày đầu tiên từ các nhà phát triển đã tự trỏ key của họ tới endpoint — với các tuyên bố của nhà cung cấp và các con số từ cộng đồng được ghi chú rõ ràng đúng như bản chất của chúng.

Chuyện gì thực sự đã xảy ra hôm nay

Khoảng 15:00 giờ Bắc Kinh ngày 8 tháng 9, đội ngũ Deep​Seek đã thông báo với các nhóm cộng đồng chính thức của họ rằng một phiên bản trung gian — được mô tả bằng tiếng Trung là 中间版本, một điểm kiểm tra giữa chừng — đang được mở thử nghiệm giới hạn trong môi trường API thực trước khi phiên bản cuối cùng được phát hành. Bất kỳ ai có khóa API Deep​Seek đều có thể gọi nó: giữ nguyên base URL và khóa hiện tại của bạn, rồi đặt tên mô hình là deepseek-v4.1-flash-expires-on-0910. Đó là toàn bộ câu chuyện truy cập — không có endpoint riêng, không có danh sách chờ, và không có bảng điều khiển mới.

Phạm vi thực tế khá hẹp. Phần hậu tố mã hóa kế hoạch: phiên bản thử nghiệm "sẽ tự động hết hạn và ngoại tuyến vào ngày 10 tháng 9", chỉ còn khoảng hai ngày hoạt động. Mỗi tài khoản bị giới hạn ở 20 yêu cầu đồng thời — so với giới hạn 2.500 kết nối đồng thời mà Deep​Seek công bố cho deepseek-v4-flash — đây là một gợi ý mạnh mẽ về ý định: điều này dành cho kiểm thử chức năng và đánh giá, không phải để trỏ lưu lượng sản xuất vào.

• Bản chất — một điểm kiểm tra "phiên bản trung gian" được đặt trong API trực tiếp để thử nghiệm trong thời gian ngắn trước khi có bản chính thức.

• Nơi chạy — API của chính Deep​Seek; URL gốc và khóa không đổi, tên mô hình được thay thành deepseek-v4.1-flash-expires-on-0910.

Bao lâu — tên cho biết expires-on-0910; bài kiểm tra dự kiến sẽ ngoại tuyến vào khoảng ngày 10 tháng 9.

Ai có thể gọi — bất kỳ tài khoản nào có khóa DeepSeek, với 20 yêu cầu đồng thời cho mỗi tài khoản.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Model ID deepseek-v4.1-flash-expires-on-0910, Status 2-day API beta - expires 09-10, Concurrency 20 req/account (V4 Flash: 2,500), Billing same rate card as DeepSeek V4 Flash, Speed (community) ~420 tok/s peaks 500+, Native multimodal text + image (official claim), with a footer reading 'Speed is community-measured; no official benchmarks or specs published yet.'

Bản beta tính phí gì: bảng giá DeepSeek V4 Flash

Deep​Seek cho biết bài kiểm tra được tính phí theo cùng mức giá với deepseek-v4-flash và bảng giá hiện tại của mô hình đó là bảng giá được áp dụng. Kể từ đợt định giá lại ngày 16 tháng 8 năm 2026, Deep​Seek áp dụng biểu giá theo giờ cao điểm/ngoài giờ cao điểm; con số chính xác là con số chính thức cho dòng Flash:

Đầu vào, trúng cache — 0,007 USD mỗi 1 triệu token ngoài giờ cao điểm, 0,014 USD giờ cao điểm

• Đầu vào, cache miss — $0,22 mỗi 1 triệu token ngoài giờ cao điểm, $0,44 giờ cao điểm

• Đầu ra — $0,66 mỗi 1M token ngoài giờ cao điểm, $1,32 giờ cao điểm

• Giờ cao điểm — 01:00–04:00 và 06:00–10:00 UTC, Thứ Hai–Thứ Sáu; tất cả các giờ khác là giờ thấp điểm với mức giá bằng một nửa giá giờ cao điểm

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the current public lineup — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, the off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak), and published concurrency limits of 2,500 / 500 / 2,500.

Lưu ý điều không thay đổi: giá mỗi token. Do đó, tuyên bố của DeepSeek rằng V4.1 Flash "chi phí thấp hơn" là một tuyên bố về hiệu quả, không phải cắt giảm giá — điều mà một số người thử nghiệm ngày đầu đã phải trả giá đắt, khi chứng kiến một phiên năm phút tiêu tốn nhiều hơn đáng kể từ số dư của họ so với cùng thời gian thực trên DeepSeek V4 Flash, vì mô hình sử dụng token nhanh hơn nhiều. Liệu chi phí mỗi tác vụ có thực sự giảm hay không phụ thuộc vào việc mô hình có hoàn thành công việc với ít token hơn và ít lần thử lại hơn, điều mà không ai có thể đánh giá chỉ từ hai ngày chạy thử nghiệm tốc độ.

"Kiến trúc mới, đa phương thức thuần gốc" nghĩa là gì — cho đến nay, vẫn chưa được kiểm chứng.

Mô tả chính thức của DeepSeek về V4.1 Flash đưa ra bốn tuyên bố: cấu trúc mô hình mới, hỗ trợ đa phương thức gốc, năng lực mạnh hơn và tốc độ sinh nhanh hơn. Tuyên bố về kiến trúc là điểm nổi bật vì nó phá vỡ một khuôn mẫu. Bản làm mới trước đó, DeepSeek V4 Flash 0731, là một bản cập nhật sau huấn luyện giữ nguyên kiến trúc và quy mô so với bản xem trước; cách diễn đạt của DeepSeek ở đây chỉ ra một sự thay đổi cấu trúc, và một số trang tin hiểu đó là dấu hiệu cho thấy mô hình được huấn luyện lại thay vì chỉ tinh chỉnh. Ngoài ra, mọi thứ chỉ là suy đoán. Suy đoán của cộng đồng về các cơ chế chú ý thay đổi, mạng chuyên gia, hay mô-đun thị giác tích hợp cũng chỉ là suy đoán. Chưa có công bố nào về số tham số, con số cửa sổ ngữ cảnh, bảng benchmark hay báo cáo kỹ thuật.

Việc dùng cụm từ "native multimodal" có ý nghĩa quan trọng vì một lý do cụ thể. DeepSeek-V4-Flash-Vision-Exp, ra mắt ngày 21 tháng 8 và công khai trọng số từ ngày 31 tháng 8, được tạo ra bằng cách gắn thêm một bộ mã hóa thị giác vào mô hình văn bản DeepSeek V4 Flash — tài liệu của chính DeepSeek mô tả sự kết hợp này là một mô hình văn bản cộng với một đường xử lý thị giác bên ngoài. V4.1 Flash được mô tả là đa phương thức ngay từ nền tảng, với đầu vào hình ảnh và văn bản do chính mô hình cơ sở xử lý. Về nguyên tắc, đây là một khác biệt kiến trúc thực sự, nhưng thông số kỹ thuật về phương thức (modality) vẫn chưa được công bố: những gì người thử nghiệm đã kiểm tra chỉ là văn bản cộng hình ảnh, và người đọc chỉ nên coi "đa phương thức" là được xác nhận theo đúng nghĩa văn bản-hình ảnh đó, cho đến khi model card được công bố. Liệu một tập hợp đầu vào rộng hơn có nằm trong kế hoạch hay không — tính đến thời điểm viết bài này — vẫn là điều chưa rõ, chứ chưa phải là điều đã được xác nhận.

Tốc độ là điểm nhấn — và đó là thước đo của cộng đồng.

Con số được lan truyền trong ngày đầu tiên là khoảng 420 token đầu ra mỗi giây trong các thế hệ sinh văn bản dài, với mức đỉnh được báo cáo trên 500 token/giây ở các lần chạy riêng lẻ. Một bài kiểm tra được chia sẻ rộng rãi đã tạo ra hơn 71.000 token trong chưa đầy ba phút. Không có gì trong số này là chính thức: đây là các phép đo của nhà phát triển đối với endpoint beta, trong điều kiện không được kiểm soát, và Deep​Seek chưa công bố benchmark tốc độ nào của riêng họ. Để so sánh, Artificial Analysis đo endpoint công khai DeepSeek V4 Flash 0731 ở mức khoảng 128 token/giây, vì vậy các báo cáo ban đầu cho thấy bước nhảy về thông lượng thô ở mức gấp ba lần hoặc hơn — kèm theo lưu ý thông thường rằng thông lượng phụ thuộc vào độ dài đầu vào, mức độ đồng thời và điều kiện máy chủ.

Các so sánh từ đầu đến cuối với DeepSeek-V4-Flash-Vision-Exp là nơi khoảng cách trông rõ rệt nhất, vì chúng đo cùng một tác vụ một cách liên tiếp. Người kiểm thử báo cáo tốc độ từ đầu đến cuối nhanh hơn khoảng 6 lần trên tác vụ tạo mã SVG, khoảng 5,2 lần trên truy xuất ngữ cảnh dài 49k token, khoảng 5 lần trên tác vụ tạo và tối ưu hóa SQL lớn, 4,6 lần trên một bài toán thuật toán, và 3,9 lần trên tác vụ tái cấu trúc bất đồng bộ. Hãy coi những con số này mang tính tham khảo, không phải chính xác tuyệt đối: các số đo từ đầu đến cuối trên cùng một tác vụ bao gồm thời gian suy luận, độ trễ token đầu tiên, và tốc độ sinh, đồng thời chúng đến từ từng người kiểm thử riêng lẻ chứ không phải một bộ thử nghiệm có kiểm soát. Hướng nhất quán trên tất cả các kết quả mới là tín hiệu đáng chú ý, không phải bất kỳ hệ số nhân đơn lẻ nào.

Câu hỏi cốt lõi của bản beta

Chi tiết chiến lược nhất đang ẩn trong biểu mẫu phản hồi mà Deep​Seek đính kèm với bài thử nghiệm. Bên cạnh các câu hỏi về agent framework và các tình huống thực tế, biểu mẫu này hỏi trực tiếp người thử nghiệm rằng liệu phiên bản trung gian DeepSeek V4.1 Flash "có thể thay thế hoàn toàn DeepSeek V4 Pro trực tuyến" hay không. Việc một công ty đặt ra câu hỏi như vậy trước người dùng là điều đáng chú ý, vì DeepSeek V4 Pro cao hơn Flash ba bậc giá: theo biểu giá chính thức hiện tại, mô hình Pro thu $0.66 cho mỗi 1M token đầu vào (cache miss) và $1.98 cho mỗi 1M token đầu ra vào giờ thấp điểm, còn DeepSeek V4 Flash là $0.22 và $0.66 — gấp đúng 3 lần ở cả hai mức giá. Nếu một mô hình phân khúc Flash thực sự tiếp cận năng lực phân khúc Pro với giá phân khúc Flash, thì câu hỏi sẽ tự có lời giải với một bộ phận lớn người dùng, và Deep​Seek biết rõ điều đó.

Đọc cùng với cụm từ "cấu trúc mới", bảng câu hỏi gợi ý rằng V4.1 Flash là bước hiện hữu đầu tiên của một điều gì đó lớn hơn một bản làm mới nhỏ — một dòng Flash được định vị lại để thu hẹp khoảng cách với sản phẩm chủ lực, giống như cách Deep​Seek đã nhiều lần dùng một mô hình rẻ hơn, nhanh hơn để thiết lập lại kỳ vọng của thị trường về những gì một phân khúc giá mang lại. Không điều nào trong số đó được xác nhận bởi một điểm chuẩn; đó là cách đọc chiến lược từ một câu hỏi dài hai câu. Nhưng đó là điều thú vị nhất Deep​Seek đã nói về V4.1 Flash suốt cả ngày hôm nay.

Thử nó ở đâu, và trong lúc đó nên chạy gì trong môi trường sản xuất?

Trong thời gian thử nghiệm, nơi duy nhất để truy cập V4.1 Flash là API của chính DeepSeek — không có bên thứ ba nào lưu trữ một bản dựng hết hạn sau hai ngày, và không ai nên kết nối đường dẫn sản xuất với một mã mô hình được lên lịch ngừng phản hồi. Việc sử dụng hợp lý trong hai ngày tới là đánh giá: chạy các khối lượng công việc đại diện của bạn, đo chất lượng và chi phí token thực tế, và coi mọi con số tốc độ bạn thấy chỉ là mang tính giai thoại cho đến khi có bản phát hành chính thức kèm bảng thông số mô hình.

Đối với lưu lượng bắt buộc phải hoạt động liên tục, danh mục Deep​Seek công khai vẫn giữ nguyên, và đó chính là lúc một tầng định tuyến phát huy giá trị của mình. Trên OrcaRouter, DeepSeek V4 Flash, DeepSeek V4 Pro và DeepSeek-V4-Flash-Vision-Exp đều có thể gọi tới qua một API duy nhất với đúng giá niêm yết của Deep​Seek — truyền thẳng, không thêm bất kỳ khoản markup nào — nên đợt giảm giá tháng 8 đã được phía chúng tôi áp dụng ngay từ ngày nó ra mắt, chứ không phải chờ đến khi một bảng tính biên lợi nhuận nào đó rảnh tay cập nhật. Khi phiên bản V4.1 Flash chính thức được phát hành cho các nhà cung cấp, cách thiết lập tương tự chính là phương án có chi phí chuyển đổi thấp để áp dụng nó: gửi một phần lưu lượng sang mô hình mới, giữ DeepSeek V4 Flash hoặc V4 Pro làm failover tự động, rồi để DSL của router quyết định lời gọi nào xứng đáng dùng mô hình chưa được kiểm chứng và lời gọi nào nên tiếp tục ở lại với con ngựa thồ. Bạn không cần phải đánh cược cả một tuyến production vào một bản beta hai ngày chỉ để biết nó có tốt hay không.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash (captured September 5, 2026) showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, text input, a p50 time-to-first-token of 434 ms, and the description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context, optimized for fast everyday workloads.'

Câu hỏi mở

• Khi nào bản phát hành chính thức ra mắt? Tín hiệu gắn cờ cho mô hình này cho biết bài đăng phát hành dự kiến sẽ có "rất sớm"; tuổi thọ hai ngày của bản beta cho thấy Deep​Seek không có ý định để thế giới phải chờ đợi lâu.

• Bản dựng cuối cùng có khớp với bản này không? Các nhà kiểm thử độc lập theo dõi chu kỳ thử nghiệm của Deep​Seek cho biết công ty dường như đang chạy song song nhiều bản dựng ứng viên, và ứng viên nhanh nhất trong một bài kiểm tra sớm không phải lúc nào cũng là bản được phát hành — vì vậy các con số tốc độ hiện tại có thể không mô tả đúng mô hình GA.

• Thông số kỹ thuật là gì? Số lượng tham số, chi tiết kiến trúc, độ dài ngữ cảnh và danh sách đầy đủ các dạng đầu vào đều chưa được công bố — và tất cả đều là những điều đầu tiên mà một bài đánh giá thực sự cần.

• Giá có được giữ nguyên không, và liệu "chi phí thấp hơn" có trụ vững trước khối lượng công việc thực tế không? Bản beta hiện tính phí theo biểu giá DeepSeek V4 Flash; khi ra mắt chính thức có thể sẽ có bảng giá mới, và chi phí cho từng tác vụ hiện vẫn chưa được đo lường.

Liệu nó có thực sự đảm đương được nhiệm vụ của bản Pro không? Bảng câu hỏi đặt ra câu hỏi đó, nhưng chỉ có những bài đánh giá độc lập trên các bộ bài đánh giá về tác nhân AI và lập luận suy luận — những tiêu chuẩn đang phân tách tầng Flash khỏi tầng Pro hiện nay — mới có thể trả lời được.

Nếu bạn có khóa Deep{{1}}​{{/1}}Seek, thì câu chuyện chính là chiếc đồng hồ đếm ngược hai ngày: hãy gọi deepseek-v4.1-flash-expires-on-0910 trước khi nó biến mất, chạy các tác vụ của riêng bạn, rồi ghi nhận kết quả kèm chú thích “cộng đồng đo đạc, điều kiện có thể khác nhau”. Còn với những ai không có khóa, thứ cần theo dõi là bài đăng công bố, và câu hỏi đằng sau nó — liệu mô hình rẻ nhất của Deep{{2}}​{{/2}}Seek có vừa bắt đầu nhắm vào mô hình đắt nhất của hãng hay không.

Trong khi bản beta kéo dài hai ngày đang tự hoàn thiện, mô hình Flash ổn định mà bạn có thể chạy ngay hôm nay chỉ cách một lệnh gọi API: DeepSeek V4 Flash trên OrcaRouter — với giá niêm yết của Deep​Seek, được chuyển thẳng với mức định giá cộng thêm 0%.

Và sản phẩm chủ lực mà bảng câu hỏi beta vẫn yêu cầu người thử nghiệm so sánh V4.1 Flash với: DeepSeek V4 Pro trên OrcaRouter.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày