Thẻ tiêu đề chính ghi 'DeepSeek V4.1 Flash Pricing' với dòng '$0.15 đầu vào, $0.60 đầu ra, $0.003 cache hit', chú thích 'Mỗi 1M token, ngoài giờ cao điểm. Giờ cao điểm nhân đôi mọi mức giá.', cùng ba thẻ ghi 'Cache hit: rẻ hơn 50 lần so với cache miss', 'Ngữ cảnh 1M token' và 'Mở trọng số, giấy phép MIT'
Guides & Insights

Giá DeepSeek V4.1 Flash: Bảng giá đầy đủ, và con số cache-hit quyết định hóa đơn của bạn

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

DeepSeek V4.1 Flash đã được cung cấp rộng rãi kể từ ngày 2026-09-10, và tính đến hôm nay, bảng giá được công bố của nó là thứ rẻ nhất trong phân khúc cao cấp nhất của thị trường mô hình: 0,15 USD cho mỗi triệu token đầu vào, 0,60 USD cho mỗi triệu token đầu ra, và 0,003 USD cho mỗi triệu cache hit. Ba con số đó là cột ngoài giờ cao điểm. Trong các khung giờ cao điểm ngày thường của DeepSeek, mỗi con số đều tăng gấp đôi, kể cả cache hit. Phép so sánh đáng quan tâm không phải là với mẫu flagship đã cũ của chính DeepSeek — DeepSeek-V4-Pro-0813 niêm yết ở mức 0,66 USD / 1,98 USD mỗi triệu token ngoài giờ cao điểm, nên Flash bán rẻ hơn người anh em cùng nhà khoảng 4 lần ở đầu vào — mà là với phân khúc tiên phong đóng mà người mua thực sự dùng để so giá: GPT-5.6 Sol, Claude Opus 5 và Gemini 3.8 Flash, mỗi mô hình đều tính cao hơn một bậc độ lớn trên mỗi token.

Một chỉnh sửa trước khi đi vào các con số, vì thông tin rò rỉ trước lần ra mắt này vẫn đang lan truyền. Những con số lan truyền trước GA mô tả một đợt giảm giá sẽ diễn ra "vào ngày mai". Các mức giá là thật; cách diễn đạt thì không. V4.1 Flash đã ra mắt vào 2026-09-10 với các mức giá này đã có hiệu lực, và nhật ký thay đổi của chính DeepSeek ghi nhận việc giảm giá là một phần của bản phát hành chứ không phải một đợt cắt giảm sau đó. Mọi thứ dưới đây được đọc trực tiếp từ trang giá trực tuyến của DeepSeek hôm nay, 2026-09-16.

Bảng giá đầy đủ, tính đến ngày 2026-09-16

DeepSeek công bố một bảng tính bao gồm các SKU hiện hành, trong đó mỗi mục hàng được tách thành một cột giờ cao điểm và một cột giờ thấp điểm. Đối với model id deepseek-flash, vốn phục vụ DeepSeek-V4.1-Flash, mức giá được công bố là:

Đầu vào, trượt bộ nhớ đệm — $0.15 cho mỗi 1 triệu token ngoài giờ cao điểm; $0.30 cho mỗi 1 triệu token vào giờ cao điểm

Đầu vào, cache hit — $0.003 trên mỗi 1 triệu token ngoài giờ cao điểm; $0.006 trên mỗi 1 triệu token vào giờ cao điểm

Đầu ra — 0,60 USD cho mỗi 1 triệu token ngoài giờ cao điểm; 1,20 USD cho mỗi 1 triệu token vào giờ cao điểm

Cửa sổ ngữ cảnh — 1M token, với đầu ra tối đa 384K

Giới hạn đồng thời — 2.500 yêu cầu đồng thời trên Flash SKU

Các model id cũdeepseek-v4-flashdeepseek-v4-flash-vision-exp đã ngừng là các sản phẩm riêng nhưng vẫn định tuyến đến V4.1 Flash, tính phí theo mức giá của Flash

Khoảng cách giữa hai dòng đầu tiên chính là toàn bộ câu chuyện của bảng này. Một lần cache hit tốn ít hơn 50 lần so với một lần cache miss ngoài giờ cao điểm — mức chiết khấu 98%, và đó cũng là cách Artificial Analysis thể hiện nó trong mô hình chi phí của mình. Không có gì khác trên thẻ có thể khiến hóa đơn thay đổi đến mức đó.

Single-column scoreboard card titled 'DeepSeek V4.1 Flash — the rate card, 2026-09-16', with rows reading 'Off-peak input: $0.15 / 1M tokens', 'Off-peak output: $0.60 / 1M tokens', 'Cache hit: $0.003 / 1M tokens', 'Peak hours: 2x every rate', 'Context window: 1M tokens' and 'Weights: MIT, open', over the footer 'All figures from DeepSeek's published API pricing page, 2026-09-16.'Screenshot of DeepSeek's own Models & Pricing page, showing the deepseek-flash and deepseek-v4-pro columns side by side under MODEL VERSION DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, with 1M context and 384K max output for both, Vision supported on Flash but not on V4 Pro, and the pricing block reading cache-hit input $0.003 off-peak / $0.006 peak against $0.022 / $0.044, cache-miss input $0.15 / $0.3 against $0.66 / $1.32, and output $0.6 / $1.2 against $1.98 / $3.96, above a concurrency limit row of 2500 and 500

Peak không phải là một sai số làm tròn, và nó được hẹn giờ cho Bắc Kinh

Khung giờ cao điểm của DeepSeek là từ Thứ Hai đến Thứ Sáu, 01:00–04:00 UTC và 06:00–10:00 UTC. Mọi thời điểm ngoài các khung giờ đó — bao gồm toàn bộ giờ cuối tuần — được tính phí bằng một nửa. Việc tăng gấp đôi áp dụng cho cả ba dòng, vì vậy một lần cache miss vào giờ cao điểm tốn $0.30 và output vào giờ cao điểm tốn $1.20.

Khung giờ đó rơi vào lúc nào phụ thuộc hoàn toàn vào việc bạn đang ở đâu. Ở Bắc Kinh, chúng là 09:00–12:00 và 14:00–18:00 — hai khối giờ làm việc, và đó chính là điểm mấu chốt. Ở Berlin, vào tháng Chín, khung thứ hai là 08:00–12:00 CEST: toàn bộ buổi sáng của một đội ngũ châu Âu đều là giờ cao điểm. Ở New York, cùng khung giờ đó là 02:00–06:00 EDT. Một đội ngũ ở Mỹ làm việc theo giờ thông thường hầu như không bao giờ bị tính giá cao điểm, còn một đội ở EU phải trả gấp đôi mỗi buổi sáng trước giờ ăn trưa. Nếu bạn đang cân nhắc thời điểm chạy một tác vụ batch, đó là quyết định đáng giá 0,15 USD cho mỗi triệu token và bạn chẳng tốn gì để đưa ra quyết định đó.

Giá theo cache hit thực sự ảnh hưởng thế nào đến hóa đơn của agent

Cache hit diễn ra tự động trên DeepSeek — tài liệu nói rằng bộ đệm đĩa được bật mặc định cho tất cả người dùng mà không cần thay đổi mã — vì vậy khoản giảm giá này không phải là thứ bạn cần thiết kế kiến trúc để có được. Nó cũng chỉ ở mức nỗ lực tốt nhất, không được đảm bảo: DeepSeek nêu rõ không có TTL cố định, bộ đệm không dùng sẽ bị xóa "thường trong vòng vài giờ đến vài ngày," và hệ thống không hứa hẹn tỷ lệ hit 100%. Đáng để đọc các trường prompt_cache_hit_tokensprompt_cache_miss_tokens trong phản hồi trước khi bạn mô hình hóa bất cứ điều gì dựa trên điều này.

Phép tính quan trọng hơn tính từ. Hãy lấy một coding agent có tiền tố ổn định 40.000 token — system prompt, lược đồ công cụ, ngữ cảnh repo — chạy trong một phiên 60 lượt, trong đó mỗi lượt nối thêm khoảng 2.000 token đầu ra của công cụ và mô hình phát ra khoảng 1.200 token. Tổng đầu vào trong cả phiên là 5,94M token và tổng đầu ra là 72.000 token.

Tính phí hoàn toàn không dùng bộ nhớ đệm, ngoài giờ cao điểm: 5,94M đầu vào với $0,15 là $0,891, cộng 72.000 đầu ra với $0,60 là $0,043 — khoảng $0,93 cho phiên này.

Khi tính phí với tiền tố đã được cache, đây mới là điều thực sự diễn ra theo mặc định: 5,782 triệu trong số token đầu vào đó đến dưới dạng cache hit với mức $0.003 ($0.017), 158.000 đến dưới dạng cache miss với mức $0.15 ($0.024), và cùng 72.000 token đầu ra đó tốn $0.043. Khoảng $0.084 — rẻ hơn khoảng 11 lần. Phần đầu vào giảm từ 95% hóa đơn xuống còn 49%, riêng phần được cache đã chiếm 21%, và token đầu ra trở thành mục lớn nhất. Cùng model, cùng phiên, cùng đầu ra — thứ duy nhất thay đổi là tiền tố có được tái sử dụng hay không.

Hãy chú ý điềukhông có trên bảng của DeepSeek: một mục hàng ghi cache. Anthropic tính 1,25 lần giá đầu vào cơ sở để nạp một cache 5 phút và gấp 2 lần cho một giờ; thẻ của DeepSeek chỉ liệt kê hit và miss, còn hướng dẫn caching của hãng không mô tả phí ghi hay phí lưu trữ. Nếu bạn đang so sánh kinh tế caching giữa các nhà cung cấp thay vì mức giá token được quảng cáo, thì việc thiếu khoản đó đáng giá hơn mức mà chiết khấu hit gấp 50 lần gợi ý.

Đây cũng là lý do vì sao chi tiết chuyển tiếp nguyên giá trên DeepSeek V4.1 Flash trên OrcaRouter lại quan trọng ở đây. Chúng tôi tính phí theo đúng mức giá niêm yết của nhà cung cấp với mức chênh lệch bằng không, nên khi nhà cung cấp thay đổi giá thì bên chúng tôi cập nhật ngay trong cùng ngày thay vì phải chờ một đợt định giá lại — và các cột cache-hit cùng cao điểm/ngoài cao điểm mà bạn thấy ở trên chính là những mức giá bạn thực sự bị tính phí, chứ không phải một con số ước lượng tổng hợp nào đó.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id, Vision / Tools / JSON / Reasoning tags, a 2026-09-10 release date, 1M-token context, 384K max output, text + image input, text output, $0.15 input and $0.60 output per 1M tokens, a p50 time to first token of 784 ms, a p95 of 2.95 s, 59,150.9M tokens of traffic over seven days, and body text stating OrcaRouter bills at the provider rate with zero markup added

So với DeepSeek-V4-Pro-0813: khoảng cách gấp 4 lần, và một cuộc khai tử đã không diễn ra

Phép so sánh nội bộ rõ ràng nhất là SKU flagship, và nó kém ấn tượng hơn so với mức giá được nêu trên tiêu đề. DeepSeek-V4-Pro-0813, với mã model là deepseek-v4-pro, niêm yết ở mức 0,66 USD cho mỗi 1M token đầu vào khi cache miss và 1,98 USD cho mỗi 1M token đầu ra vào giờ thấp điểm, tăng gấp đôi vào giờ cao điểm lên 1,32 USD và 3,96 USD. Cache hit của nó tốn 0,022 USD vào giờ thấp điểm — gấp hơn 7 lần so với Flash.

Đầu vào cache-miss — $0.15 so với $0.66 ngoài giờ cao điểm, vậy Flash rẻ hơn 4,4 lần

Đầu ra — $0,60 so với $1,98 ngoài giờ cao điểm, vậy Flash rẻ hơn 3,3 lần

Đầu vào trúng bộ nhớ đệm — $0.003 so với $0.022 ngoài giờ cao điểm, vì vậy Flash rẻ hơn 7,3 lần

Ngữ cảnh và giới hạn đầu ra — giống hệt nhau ở 1M và 384K trên cả hai SKU

Xử lý đồng thời — 2.500 trên Flash so với 500 trên V4 Pro, mức chênh lệch gấp 5 lần hoàn toàn biến mất khỏi bảng giá

Có ba điều trong so sánh này dễ bị hiểu sai. Thứ nhất, xét theo giá trị tuyệt đối, lập luận về tái sử dụng mạnh hơn ở mô hình chủ lực dù Flash có hệ số nhân lớn hơn: lưu đệm một triệu token tiết kiệm $0.638 trên V4 Pro và $0.147 trên Flash, bởi vì tỷ lệ trượt (miss rate) của mô hình chủ lực vốn đã cao hơn nhiều ngay từ đầu. Thứ hai, mô hình mà ai cũng tưởng đã biến mất thì vẫn chưa: DeepSeek thông báo sẽ ngừng phục vụ V4 Pro vào ngày 2026-09-14 và chuyển các yêu cầu đó sang Flash, vấp phải làn sóng phản đối từ giới phát triển vì việc hoán đổi mô hình backend dưới các quy trình sản xuất, rồi đảo ngược quyết định vào ngày 2026-09-11. V4 Pro vẫn đang được phục vụ, với mức tính phí không đổi. Thứ ba, và đây chính là cái bẫy mà các bài đưa tin về rò rỉ đã sập vào — không hề có V4.1 Pro nào được phát hành. DeepSeek-V4-Pro-0813 vẫn là SKU chủ lực, và nhà cung cấp chưa tung ra phiên bản kế nhiệm nào dưới tên đó. Bất kỳ ai đang định giá việc chuyển đổi sang "V4.1 Pro" là đang định giá một mô hình không tồn tại.

So với tầng tiên phong đóng

So với các mô hình đóng mà người mua thực sự đưa vào danh sách rút gọn, hệ số nhân chính là điểm đáng chú ý nhất. Tất cả số liệu dưới đây đều lấy từ trang giá niêm yết của chính từng nhà cung cấp tại thời điểm hiện tại.

GPT-5.6 Sol — niêm yết ở mức 5,00 USD cho mỗi 1 triệu đầu vào và 30,00 USD cho mỗi 1 triệu đầu ra trên hạng ngữ cảnh ngắn của OpenAI, hiện đang áp dụng mức khuyến mại 4,00 USD / 20,00 USD mà OpenAI cho biết sẽ có ít nhất đến hết ngày 21-11-2026, với đầu vào được lưu trong bộ nhớ đệm ở mức 0,40 USD. So với mức khuyến mại, DeepSeek V4.1 Flash rẻ hơn 26,7 lần ở đầu vào và 33,3 lần ở đầu ra; so với giá niêm yết, là 33 lần và 50 lần. Lần truy cập bộ nhớ đệm thành công của Sol tốn gấp 133 lần so với Flash.

Claude Opus 5 — 5,00 USD cho mỗi 1 triệu token đầu vào và 25,00 USD cho mỗi 1 triệu token đầu ra, với giá cache trúng chỉ 0,50 USD mỗi 1 triệu theo bảng công bố của Anthropic. Con số đó cao gấp 33 lần mức giá đầu vào của Flash, gấp 42 lần mức giá đầu ra và gấp 167 lần mức giá cache trúng. Việc ghi cache 5 phút của Anthropic cộng thêm hệ số 1,25 lần; bảng giá của DeepSeek không có dòng tương đương.

Gemini 3.8 Flash — $0.75 cho mỗi 1M đầu vào và $3.75 cho mỗi 1M đầu ra đến hết ngày 2026-12-31, với cả hai mức giá dự kiến sẽ tăng gấp đôi vào ngày 2027-01-01, đầu vào được lưu vào bộ nhớ đệm ở mức $0.075, và — đây là dòng xuất hiện lặp lại trên hóa đơn thực tế — cache lưu trữ ở mức $0.50 cho mỗi 1M token mỗi giờ. Flash rẻ hơn 5 lần về đầu vào, 6,25 lần về đầu ra và 25 lần về các lần trúng bộ nhớ đệm so với nó, và DeepSeek không tính phí để giữ bộ nhớ đệm.

Bối cảnh năng lực là thứ giữ cho điều này trung thực. Trên Chỉ số Thông minh v4.3 của Artificial Analysis, DeepSeek V4.1 Flash (suy luận, nỗ lực tối đa) đạt 40 điểm và xếp thứ 6 trong số 113 mô hình, với 0,27 USD cho mỗi tác vụ chỉ số và 214,4 token đầu ra mỗi giây. Đó là một vị trí thực sự cận biên giới với mức giá thấp hơn 26 lần so với hạng mà nó đang được so sánh — nhưng cùng phép đo đó cho thấy nó là một trong những mô hình dài dòng nhất mà AA từng kiểm nghiệm, tạo ra 250 triệu token đầu ra trong toàn bộ lần chạy chỉ số, so với mức trung vị 140 triệu. Việc dài dòng không làm thay đổi giá trên mỗi token, nhưng nó có làm thay đổi hóa đơn. Một mô hình viết nhiều token hơn 62% so với trung vị vẫn tốn ít hơn nhiều ở đây, nhưng “rẻ trên mỗi token” và “rẻ trên mỗi tác vụ” là hai khẳng định khác nhau, và chỉ khẳng định thứ hai mới là thứ bạn phải trả.

Có gói miễn phí không?

Không. Trang giá của chính DeepSeek không ghi nhận bất kỳ gói API miễn phí nào, không có hạn mức miễn phí hàng tháng và không có model miễn phí — việc thanh toán là trả theo mức sử dụng dựa trên số dư đã nạp hoặc được cấp, và số dư được cấp sẽ bị trừ trước. Ứng dụng chat dành cho người tiêu dùng thì miễn phí; còn API đứng sau deepseek-flash thì không, và không có endpoint miễn phí nào cho nó trên nền tảng của DeepSeek. Một số gateway của bên thứ ba quảng cáo quyền truy cập miễn phí hoặc dùng thử đối với model này, và chúng tôi coi tất cả đều chỉ là bề mặt để tạo nguyên mẫu chứ không phải backend cho môi trường production, bởi vì những điều khoản đó thay đổi mà không báo trước và không bên nào trong số đó có bảng giá chính thức của nhà cung cấp.

Những tuyên bố về hiệu quả đằng sau mức giá

Giá đó không phải là trợ giá, ít nhất là theo cách chính DeepSeek lý giải. Thẻ mô hình và báo cáo kỹ thuật của nhà cung cấp mô tả V4.1 Flash là một mixture-of-experts 552B tham số trên bố cục Causal Encoder-Decoder, kích hoạt khoảng 8B tham số mỗi token trong giai đoạn prefill và 16B trong giai đoạn decode — bất đối xứng có chủ đích, rẻ khi đọc và đắt hơn khi ghi. Về phía bộ nhớ, DeepSeek báo cáo bộ nhớ đệm KV toàn cục khoảng 890 byte mỗi token, tức khoảng một phần tư so với DeepSeek-V4-Flash, và dấu chân bộ nhớ đệm thường trú khoảng một phần tám của nó trong cùng khối lượng công việc, đạt được bằng cách loại bỏ trạng thái cửa sổ trượt và phát lại 128 token cuối khi trúng đệm. Đây là các số đo do nhà cung cấp báo cáo trên phần cứng của chính nhà cung cấp, và báo cáo kỹ thuật không tuyên bố sự tương đương toán học với tính toán đầy đủ đối với đường phát lại.

Số lượng tham số là con số duy nhất trong bản phát hành này thực sự còn chưa ngã ngũ, và đáng để nói rõ vì sao. Phần văn xuôi của DeepSeek báo cáo 552B, và đó là xương sống — phần đảm nhiệm việc tính toán. Bên cạnh đó là Engram, một bảng tra cứu bộ nhớ có điều kiện mà model card ghi kích cỡ 196B tham số, được truy cập bằng tra cứu token chứ không tính toán xuyên qua. Cộng lại thì bạn rơi vào khoảng 748B, con số mà một bài phân tích cộng đồng được đọc rộng rãi trên r/LocalLLaMA đã lập luận ủng hộ chỉ trong vòng vài giờ sau khi trọng số được đưa lên, và bảng tệp của chính kho Hugging Face còn đẩy con số này cao hơn nữa, tới khoảng 763B. Các bài viết triển khai của cộng đồng đã đếm checkpoint vào khoảng 510 GB trải trên 48 shard, được phát hành với lượng tử hóa gốc dưới dạng trọng số dense FP8 cùng các expert FP4. Hãy coi tổng số là còn tranh chấp và con số xương sống là do nhà cung cấp báo cáo. Số tham số hoạt động mới là thứ quyết định tốc độ; còn trọng số thường trú mới là thứ quyết định liệu mô hình có khởi chạy được hay không.

Tự host là một giải pháp thay thế thực sự cho mức giá này, theo giấy phép MIT

Các trọng số nằm tại deepseek-ai/DeepSeek-V4.1-Flash theo giấy phép MIT, giấy phép này cho phép sử dụng thương mại, sửa đổi và phân phối lại. Điều đó khiến bảng giá API trở thành một lựa chọn chứ không phải một khoản phí bắt buộc: với MIT, không có điều khoản nào trong giấy phép ngăn bạn tự vận hành mô hình này và trả tiền cho compute thay vì token.

Điều nó không làm được là khiến việc này trở nên rẻ. Checkpoint có khoảng 510 GB trọng số thường trú trước cache và activation, DeepSeek không nêu yêu cầu GPU ở bất kỳ đâu trong repository, và các bài viết triển khai của cộng đồng đặt mức tối thiểu thực tế ở một node nhiều GPU chứ không phải một máy trạm. Ba ngăn xếp phục vụ đã phát hành hỗ trợ ngay ngày đầu vào 2026-09-10 — vLLM, SGLang với Miles, và bản chuyển thể NeuWare dựa trên vLLM của Cambricon cho các bộ tăng tốc của riêng hãng — nhưng vào ngày phát hành, vLLM và SGLang phát hành image xem trước chuyên dụng thay vì gói chính thức, còn llama.cpp thì chưa hợp nhất hỗ trợ kiến trúc V4.1. Tự host trên phần cứng tiêu dùng không phải là phương án thay thế cho giá API hiện nay; một node 8 GPU đi thuê mới là. Nếu khối lượng của bạn đủ lớn để khấu hao khoản đó, giấy phép cho phép bạn làm vậy; nếu không, 0,15 USD mỗi triệu token là câu trả lời rẻ hơn, và khoảng cách không hề nhỏ.

Bảng giá thực sự yêu cầu bạn quyết định điều gì

Ba việc, xếp theo mức độ tác động đến tiền bạc. Hãy giữ một prompt prefix cố định và để cache làm việc của nó — nó tự động, nó là mức giảm giá 50 lần, và trong một vòng lặp agent 60 lượt, nó biến một phiên $0.93 thành phiên $0.084. Hãy chạy lưu lượng theo lô của bạn ngoài khung 01:00–04:00 và 06:00–10:00 UTC vào các ngày trong tuần, điều mà với một nhóm ở Mỹ thì chẳng thay đổi gì, còn với một nhóm ở châu Âu thì nghĩa là chuyển công việc buổi sáng sang buổi chiều. Và nếu bạn đang định giá điều này so với flagship của chính DeepSeek, hãy nhớ rằng flagship vẫn đang được giảm giá — đợt ngừng vận hành theo lịch đã bị hủy vào 2026-09-11, cả hai SKU nằm sau một key duy nhất, và việc chuyển đổi giữa chúng chỉ là thay đổi model-id chứ không phải là một cuộc di trú.

Điều mà bảng giá không cho bạn biết là liệu mô hình có đủ tốt cho khối lượng công việc của bạn hay không, và những con số cho điều đó mới hơn và mỏng hơn so với bảng giá. Vị trí trên chỉ số Artificial Analysis là một phép đo duy nhất ở mức nỗ lực suy luận tối đa, các dòng điểm chuẩn của nhà cung cấp là do nhà cung cấp tự báo cáo, và số lượng tham số đang gây tranh cãi. Giá là phần đã ngã ngũ trong bản phát hành này. Hãy tính chi phí di chuyển của bạn dựa trên đó, và kiểm tra năng lực trước khi bạn cam kết.

So sánh trong bài viết này4

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày