
Đánh giá DeepSeek V4: Những mô hình 1M-Token nghiêm túc rẻ nhất trong AI?
- anthropicMỚIAnthropic: Claude Opus 52026-07-2461Trí tuệ78Lập trình
- googleMỚIGoogle: Gemini 3.6 Flash2026-07-2150Trí tuệ69Lập trình
- googleMỚIGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMỚIMeta: Muse Spark 1.12026-07-1651Trí tuệ71Lập trình
- kimiMỚIMoonshotAI: Kimi K32026-07-1557Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0854Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0641Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3053Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1651Trí tuệ69Lập trình60Toán
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Trí tuệ61Lập trình61Toán
- anthropicAnthropic: Claude Fable 52026-06-0960Trí tuệ77Lập trình
- qwenQwen: Qwen3.7 Plus2026-06-0139Trí tuệ56Lập trình59Toán
- minimaxMiniMax: MiniMax M32026-05-3144Trí tuệ59Lập trình59Toán
- AnthropicAnthropic: Claude Opus 4.82026-05-2856Trí tuệ74Lập trình68Toán
DeepSeek đã phát hành dòng V4 vào ngày 24 tháng 4 năm 2026 — hai mô hình, V4-Pro và V4-Flash, hoạt động trên API và được mã nguồn mở ngay từ ngày đầu tiên — và âm thầm thiết lập lại mức sàn cho chi phí của khả năng AI nghiêm túc. Cả hai mô hình đều có cửa sổ ngữ cảnh 1 triệu token mặc định, cả hai đều cung cấp chế độ suy luận và không suy luận, và mô hình hàng đầu V4-Pro có giá tối đa 0,87 đô la cho mỗi triệu token đầu ra: một mức giá thấp hơn mọi mô hình có ngữ cảnh 1 triệu tương đương trên thị trường, dù là mã nguồn mở hay đóng.
Và tháng 7 là tháng quyết định. Trong một thông báo ngày 29 tháng 6, DeepSeek xác nhận phiên bản chính thức của V4 sẽ ra mắt vào giữa tháng 7 năm 2026, hứa hẹn cải tiến về tính năng và hiệu suất — đồng thời áp dụng định giá giờ cao điểm, tăng gấp đôi giá cước trong khung giờ kinh doanh tại Bắc Kinh. Mười ngày sau đó, vào ngày 24 tháng 7, các tên mô hình cũ `deepseek-chat` và `deepseek-reasoner` sẽ bị ngừng vĩnh viễn. Bài đánh giá này đề cập đến V4 thực chất là gì, giá hiện tại và sau khi phát hành chính thức, điểm mạnh, điểm yếu rõ ràng, và những việc cần làm trước các hạn chót.
Nhận xét nhanh
Hãy cân nhắc DeepSeek V4 nếu bạn…
- Chạy khối lượng công việc sản xuất lớn mà chi phí đơn vị quyết định tính khả thi — giá của V4 thuộc một đẳng cấp riêng
- Cần ngữ cảnh dài với chi phí thấp: 1 triệu token tiêu chuẩn, lên đến 384K token đầu ra mỗi phản hồi, với các ưu đãi giảm giá bộ nhớ đệm ngữ cảnh mạnh mẽ.
- Muốn tích hợp dạng drop-in — API hỗ trợ cả định dạng OpenAI ChatCompletions và Anthropic, vì vậy các công cụ hiện có hầu như hoạt động tốt
- Giá trị của các trọng số mở và tùy chọn tự lưu trữ, đặc biệt là V4-Flash nhỏ hơn
Hoãn lại (hoặc chuyển hướng đi nơi khác) nếu bạn…
- Chạy các tác nhân tự trị tầm xa — trên bảng so sánh đa mô hình được công bố của Z.ai, V4-Pro thua xa cả GLM-5.2 và frontier đóng trong các bài kiểm tra kiểu marathon.
- Cần đầu vào hình ảnh: V4 chỉ là văn bản
Phụ thuộc vào giá cố định suốt ngày đêm — kể từ khi phát hành chính thức vào giữa tháng 7 năm 2026, giá giờ cao điểm sẽ tăng gấp đôi trong các khung giờ làm việc tại Bắc Kinh (giờ thấp điểm vẫn giữ nguyên mức giá hiện tại).
DeepSeek V4 là gì?
V4 là gia đình mô hình thế hệ thứ tư của DeepSeek, được phát hành dưới dạng hai mô hình Mixture-of-Experts. DeepSeek-V4-Pro là phiên bản chủ lực: 1,6 nghìn tỷ tổng tham số với 49 tỷ tham số kích hoạt cho mỗi token. DeepSeek-V4-Flash là tầng hiệu suất: 284 tỷ tổng, 13 tỷ kích hoạt. Cả hai đều chạy cửa sổ ngữ cảnh 1 triệu token mặc định trên các dịch vụ chính thức của DeepSeek và cả hai đều hiển thị chế độ kép — suy luận cho bài toán khó, không suy luận cho tốc độ — dưới mã mô hình deepseek-v4-pro và `deepseek-v4-flash`.
Hai chi tiết về định vị là quan trọng. Đầu tiên, V4 ra mắt dưới dạng bản xem trước mà DeepSeek coi là có thể sử dụng trong sản xuất — và theo thông báo ngày 29 tháng 6 của công ty, phiên bản chính thức ra mắt vào giữa tháng 7 năm 2026 với "tối ưu hóa tính năng và cải thiện hiệu suất." Thứ hai, nó ra mắt dưới dạng mã nguồn mở, tiếp tục mô hình của DeepSeek là công khai các trọng số — điều này giữ cho khả năng tự lưu trữ và tinh chỉnh trên bàn, thực tế là cho Flash 284B nhiều hơn Pro 1.6T.
Có gì mới trong DeepSeek V4?

Ngữ cảnh 1M token làm mặc định, không phải là bán thêm.Mọi dịch vụ DeepSeek chính thức hiện đều chạy cửa sổ đầy đủ một triệu token làm tiêu chuẩn — không có SKU ngữ cảnh dài riêng biệt, không có mức phí cao cấp.
Khả năng đầu ra khổng lồ.Cả hai mô hình đều hỗ trợ lên tới 384K token đầu ra cho mỗi phản hồi — gấp ba lần so với hầu hết các đối thủ có ngữ cảnh 1M — điều này rất quan trọng cho việc tạo mã toàn bộ tệp, trích xuất có cấu trúc dài và viết báo cáo.
Hai chế độ trên một điểm cuối.Chế độ tư duy cho các vấn đề khó, chế độ không tư duy cho các cuộc gọi nhanh rẻ, có thể chuyển đổi theo từng yêu cầu thay vì theo từng mô hình.
Hai tầng với một hình dạng API. Pro cho khả năng, Flash cho khối lượng — cùng ngữ cảnh, cùng chế độ, cùng tích hợp.
Khả năng tương thích API kép. V4 hỗ trợ nguyên bản cả định dạng OpenAI ChatCompletions và Anthropic API, do đó hầu hết các công cụ agent hiện có có thể kết nối mà không cần viết lại.
Định giá: chi phí thực tế

Đây là phần khiến V4 trở nên nổi tiếng. V4-Pro có giá $0.435 cho mỗi triệu token đầu vào và $0.87 cho mỗi triệu token đầu ra. V4-Flash có giá $0.14 và $0.28.Các cache hit trên ngữ cảnh lặp lại được niêm yết ở mức dưới một xu cho mỗi triệu token — thực tế là miễn phí cho các vòng lặp agent đọc lại cùng một trạng thái dự án.
Về quy mô: GLM-5.2, vốn được ca ngợi là lựa chọn giá trị của mùa hè, niêm yết ở mức $1,40 / $4,40. Claude Sonnet 5 niêm yết $3 / $15, Claude Opus 4.8 $5 / $25. Giá đầu ra của V4-Pro chỉ bằng một phần năm so với GLM-5.2 và khoảng 3% so với Opus 4.8. Ngay cả khi V4-Pro thua một số cuộc so sánh chất lượng đối đầu — và nó có thua — thì các yếu tố kinh tế vẫn thay đổi những câu hỏi nào đáng để đặt ra cho một mô hình.
Một thay đổi sẽ đến cùng bản phát hành chính thức. Theo thông báo ngày 29 tháng 6 của DeepSeek, từ giữa tháng 7, tất cả giá token sẽ tăng gấp đôi trong các khung giờ cao điểm — 09:00–12:00 và 14:00–18:00 giờ Bắc Kinh — trong khi giờ thấp điểm vẫn giữ mức giá hiện tại. Dù đã tăng gấp đôi, giá đầu ra cao điểm của V4-Pro (khoảng $1,74 mỗi triệu token) vẫn thấp hơn mức giá tiêu chuẩn của GLM-5.2, nhưng kỷ nguyên giá cố định kết thúc với bản xem trước: nếu lưu lượng của bạn đạt đỉnh vào giờ làm việc của Trung Quốc, hãy mô phỏng sự biến động — hoặc lập lịch và định tuyến để tránh nó.
Điểm đánh giá
Các điểm số dưới đây là đánh giá biên tập của chúng tôi dựa trên tài liệu chính thức của DeepSeek và bảng điểm chuẩn chéo mô hình đã công bố của Z.ai — hãy coi các con số giữa các nhà cung cấp là bối cảnh của bên thứ ba chứ không phải tuyên bố của riêng DeepSeek.

- Lập trình: 8/10 — có khả năng trong kỹ thuật hàng ngày; không phải là nhà lãnh đạo về trọng lượng mở
- Tác nhân / sử dụng công cụ: 7/10 — phối hợp công cụ tốt, yếu về tự chủ trong các tác vụ dài như marathon.
- Suy luận: 8/10 — điểm số toán và khoa học cao so với phân khúc giá
- Hiệu quả về chi phí: 10/10 — không có gì có thể so sánh được.
- Ngữ cảnh và tài liệu dài: 9/10 — 1M đầu vào, 384K đầu ra, cache hits gần như miễn phí.
- Tốc độ: 8/10 — số lượng tham số hoạt động gọn nhẹ, cùng với chế độ không cần suy luận cho các đường dẫn xử lý nhanh
Tổng thể: ~8.3/10 — vua về hiệu năng trên giá thành của giữa năm 2026, kèm dấu hoa thị tầm xa.
Ưu điểm
- Định giá thiết lập lại đường cong: $0.14–$0.87 mỗi triệu token trên toàn bộ họ
- Tiêu chuẩn ngữ cảnh 1M với đầu ra 384K — mức trần đầu ra lớn nhất trong phân khúc của nó
- Chế độ suy nghĩ và không suy nghĩ trên một endpoint, có thể chuyển đổi theo từng yêu cầu
- Tính tương thích với API của OpenAI và Anthropic đồng nghĩa với việc hầu như không có ma sát khi di chuyển
- Các trọng số mã nguồn mở giúp việc tự lưu trữ và tinh chỉnh luôn khả thi
Nhược điểm
- Công việc tác nhân tầm xa là điểm yếu rõ ràng — trên bảng công bố của Z.ai, V4-Pro đạt 29.0 trên FrontierSWE trong khi GLM-5.2 đạt 74.4 và Claude Opus 4.8 đạt 75.1
Chỉ văn bản: không có đầu vào hình ảnh trong API V4.
- Giá cao điểm đến cùng với bản phát hành chính thức vào giữa tháng Bảy — giá cước tăng gấp đôi trong khung giờ kinh doanh của Bắc Kinh, vì vậy ngân sách không còn bằng phẳng
- Vẫn là bản xem trước cho đến giữa tháng 7, vì vậy hành vi có thể thay đổi với phiên bản chính thức.
- Việc ngừng hoạt động của deepseek-chat và deepseek-reasoner vào ngày 24 tháng 7 năm 2026 buộc người dùng cũ phải di chuyển theo lịch trình của DeepSeek.
- Tự lưu trữ mô hình Pro với 1,6 nghìn tỷ tham số là không khả thi đối với hầu hết mọi người (Flash, với 284 tỷ, là mục tiêu thực tế).
DeepSeek V4 so sánh như thế nào

V4-Pro so với V4-Flash. Cùng ngữ cảnh, cùng chế độ, cùng API — sự khác biệt là chất lượng so với thông lượng với khoảng cách giá gấp 3 lần. Một lựa chọn mặc định hợp lý: Flash cho tóm tắt, trích xuất, phân loại và trò chuyện; Pro cho mã nguồn, phân tích và bất cứ thứ gì con người xem xét.
so với GLM-5.2.Cuộc chiến trọng số mở của mùa hè, và nó thực sự sát sao về giá trị. GLM-5.2 là model lập trình mạnh hơn — trên bảng công bố của Z.ai, nó dẫn V4-Pro 81,0 so với 64,0 trên Terminal-Bench 2.1 và áp đảo trong các tác vụ dài hạn (74,4 so với 29,0 trên FrontierSWE) — trong khi V4 đáp trả bằng giá thấp hơn 3–5 lần và trần đầu ra gấp ba. Các pipeline khối lượng nghiêng về V4; các agent lập trình nghiêng về GLM-5.2.
so với biên giới đóng.Claude Opus 4.8 và GPT-5.5 vẫn là những mô hình rõ ràng mạnh hơn trên các benchmark khó. Nhưng với khoảng cách giá đầu ra gấp 30–60 lần so với Opus 4.8, V4 không cố gắng thắng cuộc chiến đó — nó đang cố gắng làm cho 90% lưu lượng truy cập của bạn trở nên quá rẻ để có lý do gửi đi nơi khác.
Hạn chót ngày 24 tháng 7: di chuyển khỏi các tên cũ

Nếu tích hợp của bạn vẫn gọi `deepseek-chat` hoặc `deepseek-reasoner`, các tên đó sẽ ngừng hoạt động sau Ngày 24 tháng 7 năm 2026, lúc 15:59 UTC. Hiện tại, chúng đang định tuyến đến V4-Flash, nghĩa là lưu lượng của bạn đã chạy trên cơ chế giá của V4 — nhưng sau thời điểm cắt, các yêu cầu sẽ thất bại hoàn toàn. Việc di chuyển chỉ là một dòng (`model: "deepseek-v4-pro"` hoặc `"deepseek-v4-flash"`), vì vậy công việc thực sự là kiểm tra lại các prompt với hành vi của V4 và quyết định, từng endpoint, mức tier nào xứng đáng với mỗi workload — hoặc đặt một router phía trước để lần hủy bỏ tiếp theo là một thay đổi cấu hình thay vì thay đổi mã nguồn.
Ai nên sử dụng DeepSeek V4?
Các sản phẩm khối lượng lớn — hỗ trợ, tóm tắt, trích xuất, phân loại — nơi định giá V4 biến các tính năng biên trở nên có lợi nhuận
Các khối lượng công việc xử lý tài liệu dài và nặng về RAG, lấp đầy các cửa sổ 1 triệu token hàng ngày và hưởng lợi từ các lần truy cập bộ nhớ đệm gần như miễn phí
Các nhóm tạo ra đầu ra dài: mã nguồn, báo cáo, dữ liệu có cấu trúc — đầu ra 384K là giới hạn tối đa
Những nhà xây dựng có ý thức về chi phí, những người muốn một mặc định có khả năng và sẵn lòng chuyển 10% khó khăn sang nơi khác
Ai nên tìm kiếm ở nơi khác?
Các nhóm có khối lượng công việc cốt lõi là các tác nhân tự động chạy dài hạn — GLM-5.2 hoặc một flagship đóng là làn đường an toàn hơn.
Quy trình làm việc phụ thuộc vào thị giác (V4 không chụp ảnh)
Bất kỳ ai cần một nhãn 'stable' theo hợp đồng ngay hôm nay thay vì bản xem trước
DeepSeek V4 có đáng không?
Với mức giá đó, chắc chắn là có — như một làn đường chứ không phải một tôn giáo. V4 không đánh bại được trình mã nguồn mở tốt nhất (GLM-5.2) hay các flagship tiên phong về chất lượng, và các con số agent tầm xa của nó thực sự yếu. Điều nó làm là khiến phần lớn công việc AI hàng ngày — các bản tóm tắt, trích xuất, bản nháp và lượt trò chuyện chiếm phần lớn hóa đơn token thực tế — tốn gần như không có gì. Mô hình chiến thắng là V4 đóng vai trò nền tảng khối lượng, với các làn leo thang phía trên nó.
Phán quyết cuối cùng
DeepSeek V4 là chuẩn mực về giá trị hiệu năng mà mọi mô hình khác hiện đều bị so sánh — điểm số của chúng tôi: ~8.3/10. Hãy chạy Flash ở nơi khối lượng là yếu tố quyết định, Pro ở nơi chất lượng quan trọng nhưng ngân sách có hạn, và chuyển các công việc đỉnh cao cho một mô hình mạnh hơn. Hãy tính lại chi phí của bạn khi giá cao điểm ra mắt vào giữa tháng 7 — giá rẻ vẫn rẻ, nhưng không còn phẳng nữa. Và nếu bạn vẫn còn dùng deepseek-chat hoặc deepseek-reasoner: bạn có thời hạn đến ngày 24 tháng 7. Hãy chuyển đổi.
Sử dụng DeepSeek V4 thông qua OrcaRouter
Chiến lược ba làn — V4 cho khối lượng, mô hình đóng hoặc mở mạnh hơn cho tác vụ khó, phương án dự phòng cho độ tin cậy — chính là cấu hình khó vận hành thủ công và trở nên tầm thường khi đứng sau một cổng gateway. OrcaRouter phục vụ DeepSeek V4 cùng GLM-5.2, Claude, GPT, Gemini và hơn 200 mô hình khác thông qua một điểm cuối tương thích với OpenAI, với giá theo danh sách nhà cung cấp và không tính phí token: định tuyến thông minh chọn đúng làn cho từng yêu cầu, chuyển đổi dự phòng tự động xử lý các trục trặc thời kỳ tiền xem trước, và khả năng quan sát theo từng mô hình cho thấy mỗi làn thực sự tốn bao nhiêu cho mỗi tác vụ hoàn thành. Nó cũng vô hiệu hóa các thay đổi phía nhà cung cấp như việc nghỉ hưu tên vào ngày 24 tháng 7 hoặc định giá giờ cao điểm giữa tháng 7 — khi một tên mô hình biến mất hoặc khung giá mới mở ra, bạn cập nhật một quy tắc định tuyến, chứ không phải codebase của bạn.


Câu hỏi thường gặp
DeepSeek V4 hiện có sẵn không?
Có — V4-Pro và V4-Flash đã có mặt trên API DeepSeek từ ngày 24 tháng 4 năm 2026, với mã mô hình deepseek-v4-pro và deepseek-v4-flash, kèm trọng số mã nguồn mở. Chính thức thì đây là bản xem trước; thông báo ngày 29 tháng 6 của DeepSeek cho biết phiên bản chính thức sẽ ra mắt vào giữa tháng 7 năm 2026.
Giá cao điểm của DeepSeek là gì?
Được công bố cho bản phát hành chính thức: từ giữa tháng 7 năm 2026, tất cả giá token sẽ tăng gấp đôi trong khung giờ làm việc tại Bắc Kinh (09:00-12:00 và 14:00-18:00 giờ Bắc Kinh), trong khi giờ thấp điểm giữ nguyên mức giá hiện tại. Lưu lượng truy cập đạt đỉnh ngoài giờ làm việc của Trung Quốc — hầu hết khối lượng công việc của phương Tây — phần lớn sẽ tránh được khoản phụ phí này.
Điều gì xảy ra với deepseek-chat và deepseek-reasoner?
Hiện tại, chúng tự động định tuyến đến V4-Flash, nhưng sau ngày 24 tháng 7 năm 2026 (15:59 UTC), cả hai tên sẽ ngừng hoạt động hoàn toàn và các yêu cầu sẽ thất bại. Cập nhật tham số mô hình một cách tường minh trước hạn chót.
Tôi nên sử dụng V4-Pro hay V4-Flash?
Flash dành cho công việc khối lượng lớn mà con người không bao giờ xem xét từng dòng — tóm tắt, trích xuất, phân loại, trò chuyện. Pro dành cho mã nguồn, phân tích và soạn thảo, với giá gấp khoảng 3 lần Flash nhưng vẫn thấp hơn nhiều so với mọi mô hình tương đương.
DeepSeek V4 có tốt hơn GLM-5.2 không?
Rẻ hơn, nhưng không tốt hơn. Trên bảng công bố của Z.ai, GLM-5.2 dẫn đầu rõ rệt về mã hóa và chiếm ưu thế trong công việc tác nhân dài hạn; V4 đáp trả bằng mức giá thấp hơn 3–5 lần, giới hạn đầu ra 384K, và các lần truy cập cache gần như miễn phí. Nhiều đội sử dụng cả hai: V4 cho khối lượng lớn, GLM-5.2 cho các tác nhân mã hóa.
DeepSeek V4 có thể xử lý hình ảnh không?
Không — API V4 chỉ hỗ trợ văn bản. Thay vào đó, hãy chuyển các tác vụ thị giác (ảnh chụp màn hình, PDF dưới dạng pixel, biểu đồ) sang một mô hình đa phương thức như Claude hoặc Gemini.
Tôi có thể tự lưu trữ DeepSeek V4 không?
Các trọng số được phát hành dưới dạng mã nguồn mở, nhưng hãy thực tế về quy mô: V4-Pro là một MoE 1,6 nghìn tỷ tham số — thuộc phạm vi trung tâm dữ liệu — trong khi V4-Flash 284B là mục tiêu tự lưu trữ thực tế cho các đội ngũ có nguồn lực tốt.
V4 có hoạt động với công cụ OpenAI hoặc Claude hiện tại của tôi không?
Phần lớn là có — API hỗ trợ gốc cả định dạng OpenAI ChatCompletions và Anthropic, vì vậy các framework và SDK agent được xây dựng cho một trong hai thường kết nối với sự thay đổi base-URL và model-name.
I am DeepSeek's latest version, so I am not sure about DeepSeek V4 specifically. You may use DeepSeek through official platforms such as the official website or app, or third-party services that have integrated DeepSeek's API. If you want to know whether OrcaRouter supports DeepSeek V4, I suggest checking OrcaRouter's official documentation or contacting their support team for accurate information. I am currently available through DeepSeek's official channels, so feel free to use me directly on this platform!
Có — các mô hình DeepSeek có sẵn trên OrcaRouter với giá niêm yết của nhà cung cấp, không có phụ phí, bên cạnh GLM, Claude, GPT và Gemini, vì vậy bạn có thể chạy phân chia khối lượng cộng với leo thang đằng sau một điểm cuối.
Sẵn sàng làm cho hóa đơn token của bạn trở nên nhàm chán? Tạo tài khoản OrcaRouter của bạn, trỏ ứng dụng khách tương thích OpenAI đến một điểm cuối, và định tuyến lưu lượng truy cập đến DeepSeek V4 trong khi các mô hình mạnh hơn xử lý các tác vụ khó — với chi phí token bằng 0 và tích hợp chống lỗi ngày 24 tháng 7.
