Ngày phát hành DeepSeek V4 Pro: Đã rẻ hơn 14 lần so với Kimi K3, nhưng chưa thông minh bằng
Guides & Insights

Ngày phát hành DeepSeek V4 Pro: Đã rẻ hơn 14 lần so với Kimi K3, nhưng chưa thông minh bằng

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 31 tháng 7 năm 2026, công ty đã đăng một mục nhật ký thay đổi thông báo rằng mô hình giá rẻ của họ đã đánh bại mô hình đắt tiền. Mục này nói về DeepSeek V4 Flash, bản hiệu suất 284B, với tuyên bố chính là "khả năng agent được tăng cường đáng kể, với kết quả benchmark vượt xa V4-Pro-Preview." V4-Pro-Preview chính là DeepSeek V4 Pro — mẫu chủ lực 1,6 nghìn tỷ tham số, mẫu có chi phí gấp ba lần mỗi token. Mục này kết thúc bằng một câu duy nhất về nó: "Bản phát hành chính thức của DeepSeek-V4-Pro sẽ sớm được công bố." Đây là bối cảnh cho dự đoán đang lan truyền hiện nay, rằng khi V4 Pro thực sự ra mắt, nó sẽ đạt ngang tầm Kimi K3 nhưng rẻ hơn mười lần. Một nửa trong số đó đã có thể đo lường được, và nó sai theo hướng mà gần như không ai ngờ tới.

Một lưu ý về việc bài viết này là gì và không phải là gì. Không có system card bị rò rỉ ở đây, không có benchmark nội bộ, không có ngày tháng. Dự đoán đang lan truyền đến từ @scaling01 trên X — "DeepSeek-V4 Pro sẽ là một bom tấn, có lẽ cũng ở tầm Kimi-K3 nhưng rẻ hơn 10 lần" — và đó là dự báo từ một chuyên gia được nhiều người theo dõi, chứ không phải là tiết lộ từ bất kỳ ai có quyền truy cập. Coi đó như một vụ rò rỉ chính là cách mà những bài đưa tin sai lệch về ngày phát hành được viết ra. Thay vào đó, điều chúng ta có thể làm là tách hai nửa có thể kiểm chứng của tuyên bố và đối chiếu chúng với những con số đã tồn tại, vì bản preview đã có thể gọi được từ ba tháng nay và cả nó lẫn Kimi K3 đều đã được một phòng lab độc lập chạy thử nghiệm. Mọi thứ bên dưới đều được ghi nguồn: tài liệu của chính công ty, các phép đo của Artificial Analysis, hoặc các phép tính do chúng tôi tự thực hiện và trình bày.

DeepSeek đã thực sự nói những gì, và những gì nó chưa nói

Phạm vi đã được xác nhận rộng hơn nhiều so với cách gọi "mô hình chưa phát hành". V4 Pro không phải là sản phẩm ảo — bạn có thể sử dụng nó ngay bây giờ. Điều chưa xảy ra là bản phát hành mà chính công ty coi là chính thức.

Kiến trúc — một mô hình mixture-of-experts với tổng cộng 1.6T tham số và 49B tham số kích hoạt trên mỗi token, được công ty xác nhận và được liệt kê giống hệt trên Artificial Analysis là 1600B/49B.

Ngữ cảnh và đầu ra — cửa sổ đầu vào 1M token (1,048,576) với tối đa 384K token đầu ra. Văn bản vào, văn bản ra; không có đầu vào hình ảnh, âm thanh hoặc video.

Giấy phép và trọng số — MIT, với trọng số được công bố trên Hugging Face. Đây là mô hình flagship mở trọng số, chính là lý do khiến việc so sánh với Kimi K3 trở nên thú vị.

Giá niêm yết — $0.435 cho mỗi triệu token đầu vào khi không trúng bộ nhớ đệm, $0.003625 khi trúng bộ nhớ đệm và $0.87 cho mỗi triệu token đầu ra, từ trang giá của chính công ty.

Giao diện — các endpoint ChatCompletions kiểu OpenAI và endpoint định dạng Anthropic, cùng với các mức độ nỗ lực suy luận, gọi công cụ và đầu ra có cấu trúc.

Dòng thời gian cho đến nay — dòng V4 đã ra mắt dưới dạng bản xem trước vào ngày 24 tháng 4 năm 2026; các tên mẫu cũ deepseek-chatdeepseek-reasoner đã ngừng hoạt động vào ngày 24 tháng 7 năm 2026; Flash đã có bản chính thức vào ngày 31 tháng 7 năm 2026; còn Pro thì không.

6 tháng 8 năm 2026DeepSeek thông báo với các nhà phát triển rằng họ dự định tăng giá tổng thể cho các dịch vụ API DeepSeek "trong tương lai gần, dự kiến mức tăng đáng kể" và nhấn mạnh lại rằng bản phát hành chính thức V4 Pro sẽ theo sau. Chưa có mức giá mới và ngày hiệu lực nào được công bố.

Và những phần thực sự chưa được biết đến, vốn là phần lớn những gì mọi người đang tìm kiếm:

Ngày GA — vẫn chưa được công bố. “Sẽ sớm công bố” vẫn là toàn bộ cam kết chính thức của công ty. Các báo cáo báo chí chưa được xác nhận cho thấy khả năng ra mắt vào giữa tháng 8 — một tờ báo đã đưa ra mốc 10–20 tháng 8, và trang giá của một nhà bán lẻ đã điều chỉnh giá cache V4 Pro vào ngày 3 tháng 8, một động thái trong quá khứ thường báo trước bản phát hành — nhưng không điều nào trong số đó là phát ngôn chính thức từ công ty. Chưa có ngày nào được xác nhận.

Bản dựng GA sẽ thay đổi những gì — chưa được nêu rõ. Công ty chưa cho biết liệu V4 Pro chính thức là một lần tái hậu huấn luyện từ cùng bộ trọng số, một lần tiền huấn luyện mới, hay một sự điều chỉnh giá.

Liệu mức giá có trụ vững qua được điều đó hay không — vẫn còn bỏ ngỏ, và có một lý do cụ thể để lo ngại về điều này mà chúng ta sẽ đề cập bên dưới.

Một sự đính chính đáng nêu rõ ràng, vì kết quả tìm kiếm cho câu hỏi này bị nhiễu: bạn sẽ thấy các trang khẳng định rằng dòng V4 đã đạt mốc phát hành rộng rãi vào ngày 20 tháng 7 năm 2026. Nhật ký thay đổi của chính công ty, mười một ngày sau đó, cho biết bản phát hành V4 Pro chính thức vẫn đang chờ, và nói thêm rằng bản cập nhật ngày 31 tháng 7 "chỉ nâng cấp DeepSeek-V4-Flash API. DeepSeek-V4-Pro API và các mô hình APP/WEB không thay đổi." Khi bản tóm tắt của bên thứ ba và nhật ký thay đổi chính của nhà cung cấp mâu thuẫn, nhật ký thay đổi sẽ thắng.

Tuyên bố về giá: "rẻ hơn 10 lần" là cách hiểu thận trọng

Kimi K3 có giá niêm yết $3.00 mỗi triệu token đầu vào và $15.00 mỗi triệu token đầu ra, với cache hit ở mức $0.30. V4 Pro có giá niêm yết $0.435 và $0.87, với cache hit ở mức $0.003625. Khi so sánh chúng với nhau, "10x" hóa ra là mức thấp nhất của một dải, chứ không phải điểm nhấn:

Token đầu vào — $3,00 so với $0,435, nên V4 Pro rẻ hơn gấp 6,9 lần. Đây là khía cạnh duy nhất mà tuyên bố bị phóng đại.

Token đầu ra — $15.00 so với $0.87, tức là rẻ hơn 17,2 lần. Output là nơi các mô hình suy luận tiêu tốn chi phí, do đó đây là con số quan trọng nhất.

Hỗn hợp đầu vào/đầu ra 70/30 — 6,60 đô la mỗi triệu so với 0,5655 đô la, tức gấp 11,7 lần.

Tỷ lệ kết hợp 7:2:1 cache-hit/đầu vào/đầu ra của Artificial Analysis — 2.31 đô la so với 0.18 đô la, tức gấp 12.8 lần.

Đầu vào được lưu cache — $0.30 so với $0.003625, gấp khoảng 83 lần. Giá đọc cache của công ty xếp thứ 4 trong số 101 mô hình mà Artificial Analysis theo dõi, với mức giảm 99% so với tỷ lệ trượt cache của chính công ty.

Những hỗn hợp giả định có thể gây tranh cãi, vì vậy đây là một phép đo thực tế. Artificial Analysis công bố số tiền thực tế họ đã chi để chạy toàn bộ Intelligence Index trên mỗi mô hình — cùng một bộ đánh giá, cùng một khung thử nghiệm, số token thực tế thay vì một tỷ lệ giả định. Kimi K3 tốn 2.437,41 đô la để đánh giá. V4 Pro tốn 176,34 đô la. Tức là gấp 13,8 lần, trên cùng một khối lượng công việc, tính bằng số đô la mà ai đó thực sự đã trả.

Điều khiến con số đó thấp hơn tỷ lệ giá đầu ra 17,2 lần đáng để tìm hiểu, vì đó là điểm duy nhất mà sự rẻ của V4 Pro một phần là tự gây ra. V4 Pro dài dòng: nó tiêu tốn 180M token đầu ra để đi qua chỉ mục, so với 130M của Kimi K3 và mức trung vị 100M của phân khúc này. Nghĩa là nó dùng nhiều hơn khoảng 38% token để diễn đạt những gì cần nói, điều này làm suy giảm lợi thế theo từng token. Con số 13,8 lần đã bao gồm yếu tố đó; con số 17,2 lần thì không. Nếu bạn đang lập ngân sách, hãy dùng con số đã đo được.

Đây cũng là phần của câu chuyện mà bạn có thể tự kiểm tra thay vì phải tin một cách mù quáng. Bởi vì OrcaRouter chuyển thẳng giá niêm yết của nhà cung cấp ở mức phụ giá 0%, các con số tính trên mỗi token trên trang mô hình deepseek/deepseek-v4-pro và kimi/kimi-k3 của chúng tôi là giá của chính hai nhà cung cấp — K3 hiển thị $3.00/$15.00 trên trang của chúng tôi và $3.00/$15.00 trên trang của Moonshot — chứ không phải là mức giá bán lại có ẩn chênh lệch bên trong — điều đó có nghĩa là phép tính ở trên được tái hiện trên cùng một hóa đơn, và nếu một trong hai nhà cung cấp thay đổi giá, sự thay đổi đó sẽ cập nhật về phía chúng tôi trong cùng ngày chứ không phải sau một chu kỳ hợp đồng.

Tuyên bố về trí tuệ: 13 điểm, không phải ngang bằng

"Mức Kimi K3" là nửa dự báo không trụ nổi khi đối chiếu với các con số hiện tại. Trên Chỉ số Trí tuệ (Intelligence Index) của Artificial Analysis, tính đến ngày 5 tháng 8 năm 2026, Kimi K3 đạt 57 điểm còn DeepSeek V4 Pro (suy luận, nỗ lực tối đa) đạt 44 điểm — xếp hạng #6 trong số 101 mô hình, một vị trí thực sự mạnh, nhưng vẫn kém 13 điểm. Cả hai đều được đo bởi cùng một phòng thí nghiệm trên cùng một thang đo tổng hợp, cả hai ở mức nỗ lực suy luận tối đa, cả hai trong ngữ cảnh 1 triệu token.

Các điểm chuẩn của nhà cung cấp kể một câu chuyện khác và tâng bốc hơn, và đó chính là lý do vì sao chúng cần được ghi nhãn. Công ty báo cáo V4 Pro-Preview đạt 80.6% trên SWE-bench Verified và 90.1% trên GPQA Diamond. Moonshot báo cáo Kimi K3 đạt 76.8% trên SWE-bench Verified và 93.5% trên GPQA Diamond. Nếu tin vào số liệu này, V4 Pro thắng tuyệt đối ở bài kiểm tra lập trình. Cả hai bộ kết quả đều chưa được tái lập độc lập; chúng được tạo ra trên các bộ khung đánh giá khác nhau bởi các nhóm có lợi ích trong kết quả, và ở chỉ số tổng hợp duy nhất mà bên thứ ba tự chạy cả hai mô hình, thứ tự lại bị đảo ngược. Đó chính là toàn bộ lý do để không tin vào việc so sánh dựa trên một điểm chuẩn đơn lẻ giữa các nhà cung cấp.

Hai điều về số chỉ số cần có những lưu ý riêng. Thứ nhất, nếu bạn thấy các bài viết cũ trích dẫn V4 Pro ở mức 52 thay vì 44, thì chúng không sai — bài viết ra mắt hồi tháng 4 của chính Artificial Analysis đã đặt V4 Pro (Max) ở mức 52 và gọi nó là mô hình suy luận trọng số mở đứng thứ 2. Chỉ số này được điều chỉnh lại, và mỗi lần điều chỉnh đều làm thay đổi điểm số của mọi mô hình. Nguyên tắc thực tế là chỉ những so sánh trong cùng một snapshot mới có ý nghĩa; con số 52 từ tháng 4 và con số 57 từ tháng 8 không nên nằm trong cùng một câu. Thứ hai, trang của Artificial Analysis ghi ngày "Phát hành tháng 4 năm 2026" và không phân biệt bản xem trước với bản chính thức trong tương lai, vì vậy con số 44 của họ là phép đo của những gì endpoint phục vụ, bất kể nó được kiểm tra vào thời điểm nào.

Điểm mà V4 Pro rõ ràng vượt trội hơn Kimi K3 là ở các khía cạnh không phải trí tuệ. Nó tạo ra 66.5 token mỗi giây so với 37.6 của K3, trong một phân khúc có mức trung vị là 65.9 — vì vậy V4 Pro xấp xỉ mức trung bình của phân khúc còn Kimi K3 lại chậm một cách bất thường. Thời gian đến token đầu tiên là 1.61 giây so với 2.85. Đối với một vòng lặp tác nhân tương tác, sự khác biệt đó được cảm nhận ở mỗi lượt, và đó là lý lẽ mạnh mẽ nhất cho bản dựng xem trước hiện tại.

Những gì bản dựng chính thức của Flash cho chúng ta biết về Pro

Đây là thứ gần nhất với bằng chứng thực sự về mẫu sản phẩm chưa ra mắt, và nó đến từ người anh em đã trải qua quá trình này.

Nhật ký thay đổi ngày 31 tháng 7 của công ty cho biết rằng "DeepSeek-V4-Flash-0731 giữ nguyên kiến trúc và kích thước mô hình như DeepSeek-V4-Flash-Preview, và chỉ được post-training lại." Cùng số lượng trọng số, cùng kiến trúc, cùng mức giá — chỉ post-training. Artificial Analysis chấm kết quả ở mức 50, so với 40 của bản Flash trước đó. Mười điểm trên chỉ số tổng hợp, chỉ từ post-training, không tốn thêm chi phí cho mỗi token. Mức tiêu thụ token đầu ra trên chỉ số cũng giảm 12%, từ ~234 triệu xuống ~206 triệu, nên chi phí vận hành rẻ hơn ở cùng mức giá niêm yết.

Áp dụng tiền lệ đó cho Pro và phép toán là không thể tránh khỏi: 44 cộng 10 là 54. Kimi K3 đang ở mức 57. Ngay cả khi V4 Pro chính thức lặp lại bản nâng cấp sau huấn luyện thành công nhất mà công ty từng công khai trình diễn, nó vẫn thấp hơn "mức Kimi K3" khoảng ba điểm — trong khi chi phí vận hành chỉ bằng khoảng một phần mười bốn. Đó là một kết quả đáng chú ý và không phải là kết quả mà dự báo dự đoán.

Những lưu ý trung thực về phép ngoại suy đó, vốn là phép tính số học chứ không phải dự đoán: mức tăng +10 trên mô hình 284B nói lên rất ít về những gì có trên mô hình 1.6T, và dư địa có thể lớn hơn hoặc nhỏ hơn nhiều. Công ty chưa nói rằng bản build Pro sẽ chỉ là hậu huấn luyện. Và chỉ số là một chỉ số tổng hợp, nên ba điểm có thể chỉ là một benchmark. Lý do để vẫn tính con số này là vì đây là tiền lệ định lượng duy nhất được nhà cung cấp xác nhận hiện có, và nó vững chắc hơn nhiều so với những gì dự báo đang dựa vào.

Một chi tiết nữa từ nhật ký thay đổi đó đáng được nêu bật thay vì chỉ lặp lại: điểm số agentic của Flash được tạo ra bằng "chế độ Harness minimal của công ty (sắp được phát hành)" ở mức nỗ lực tối đa, topp=0.95, temperature=1.0. Bộ khung (harness) tạo ra các con số này vẫn chưa được phát hành công khai — nó bước vào giai đoạn beta kín từ đầu tháng 8 — vì vậy những con số đó vẫn không thể được tái tạo bởi bất kỳ ai bên ngoài công ty, ngay cả về nguyên tắc, không phải vì chúng sai mà vì công cụ không khả dụng. Hãy kỳ vọng bản phát hành Pro sẽ ra mắt với cùng một dấu hoa thị.

Những điều khoản có thể phá vỡ luận điểm về mô hình giá rẻ

Ẩn trong tài liệu định giá của công ty là một chính sách gần như không được nhắc đến trong các bài viết về giá của dòng V4. Theo lời công ty, API "sẽ sớm áp dụng" một biểu giá theo đó "vào giờ cao điểm, giá sẽ gấp 2 lần giá thông thường, áp dụng cho tất cả các hạng mục thanh toán." Giờ cao điểm được xác định là 09:00–12:00 và 14:00–18:00 theo giờ Bắc Kinh, hàng ngày — bảy giờ mỗi ngày, tất cả các ngày. Ngày có hiệu lực "tùy thuộc vào thông báo chính thức," và tính đến thời điểm viết bài, khoản phụ phí này chưa có hiệu lực.

Lưu ý hướng điều chỉnh. Ngoài giờ cao điểm, công ty trước đây thường áp dụng các khoản giảm giá cho V3 và R1; đây là một mức cao điểm phụ phí trên mức giá tiêu chuẩn. Nếu nó kích hoạt ở hệ số đã nêu, giá ban ngày của V4 Pro trở thành $0.87 khi gọi vào và $1.74 khi gọi ra, và so sánh sẽ thay đổi hình dạng: lợi thế tổng hợp 11,7 lần so với Kimi K3 giảm xuống còn 5,8 lần, và mức đo được 13,8 lần giảm xuống còn 6,9 lần. Vẫn rẻ. Không còn "rẻ hơn 10 lần," và không còn rẻ vào những giờ mà đội ngũ châu Âu hoặc châu Á đang thực sự làm việc.

Ngày 6 tháng 8, "chiếc giày lớn hơn" đã rơi xuống. DeepSeek thông báo trên nền tảng dành cho nhà phát triển rằng họ có kế hoạch tăng giá tổng thể cho các dịch vụ DeepSeek API "trong tương lai gần, với mức tăng dự kiến đáng kể." Chưa có mức giá mới hay ngày hiệu lực nào được công bố, và công ty cũng không cho biết mức tăng này tách riêng khỏi biểu giá giờ cao điểm hay áp dụng cùng lúc. Báo chí đưa tin về công ty đọc thông báo này như một tín hiệu rằng bản phát hành chính thức V4 Pro đang đến rất gần — một sản phẩm chủ lực chưa ra mắt thì không thể định giá mạnh tay vào một chế độ chiết khấu mà bạn sắp rời bỏ. Bất kỳ ai đang xây dựng mô hình chi phí dựa trên V4 Pro ngay hôm nay nên mô hình hóa cả hai trường hợp, và bất kỳ ai đọc tiêu đề kiểu "công ty rẻ hơn 14 lần" — kể cả tiêu đề này — nên hiểu rằng nó mô tả một bảng giá có kèm điều kiện hết hạn đã được công bố. Đây là khả năng lớn nhất khiến một nửa phần dự báo về giá không còn đúng, và nó chẳng liên quan gì đến mô hình.

Làm thế nào bạn biết bản chính thức đã ra mắt

Có một chi tiết trong cách công ty vận chuyển quan trọng hơn cả ngày tháng, và đó là một mối nguy vận hành thực sự.

ID mô hình API là deepseek-v4-pro. Không phải deepseek-v4-pro-preview, và cũng không phải là một chuỗi bản dựng có ngày tháng — mặc dù nhật ký thay đổi của chính công ty gọi bản dựng hiện tại là V4-Pro-Preview và bản dựng Flash đã phát hành là V4-Flash-0731. Khi Flash chính thức ra mắt, chỉ dẫn là: "Phương thức gọi API vẫn không đổi — chỉ cần đặt tên mô hình là deepseek-v4-flash để sử dụng phiên bản mới nhất." Nói cách khác, ghim ID mô hình không đồng nghĩa với việc ghim bản dựng. Chính chuỗi tên đó đã âm thầm bắt đầu phục vụ một bộ trọng số khác, với hành vi khác biệt đáng kể và cao hơn mười điểm chỉ số.

Vậy câu trả lời thực tế cho câu hỏi "khi nào V4 Pro phát hành" là nếu bạn đang gọi deepseek-v4-pro trong môi trường sản xuất, bạn có thể nhận ra điều đó bằng cách theo dõi các kết quả đầu ra của chính bạn thay đổi. Cụ thể, những điều cần theo dõi là: một mục mới có ghi ngày trên nhật ký thay đổi API của công ty, nơi mà sự phát hành của Flash xuất hiện đầu tiên; một hậu tố bản dựng như V4-Pro-0731 trong văn bản của mục đó ngay cả khi mã gọi vẫn giữ nguyên; một sự chấm điểm lại trên trang V4 Pro của Artificial Analysis, đây là xác nhận độc lập đầu tiên bạn sẽ nhận được; việc tăng giá đã công bố được hiện thực hóa thành mức giá thực tế, vì GA là thời điểm tự nhiên cho cả việc đó và lịch trình giờ cao điểm; và API Responses của công ty, tài liệu của nó cho biết hỗ trợ cho deepseek-v4-pro được lên kế hoạch vào đầu tháng 8 — việc mô hình biến mất khỏi danh sách "được lên kế hoạch" và xuất hiện trong danh sách được hỗ trợ gần như là tín hiệu phát hành chính thức nhất mà công ty công bố. Hai tín hiệu mà chúng tôi không thể xác nhận nhưng vẫn đáng để biết: một trang giá của nhà bán lại đã thay đổi giá bộ nhớ đệm của V4 Pro vào ngày 3 tháng 8 theo một mô hình mà trong lịch sử thường đi trước một lần phát hành, và bộ máy đánh giá nội bộ của công ty đang trong giai đoạn beta kín, điều này có nghĩa là các điểm chuẩn của nhà cung cấp của họ cuối cùng có thể được kiểm tra khi nó được phát hành. Một chuỗi giống như deepseek-v4-pro-202606 cũng đã được lan truyền như một mã định danh bản dựng bị rò rỉ; chúng tôi không thể xác minh nó với bất kỳ tài sản nào của công ty, và nó không nên được coi trọng cho đến khi ai đó có thể.

Hôm nay bạn có nên xây dựng trên bản xem trước không?

Đối với hầu hết mọi người đang đánh giá mô hình này, ngày phát hành không phải là câu hỏi đúng. Bản preview có thể gọi được, có giá, được cấp phép MIT và được đo lường độc lập ở vị trí #6/101 về trí tuệ. Câu hỏi thực sự là bản GA sắp tới sẽ ảnh hưởng gì đến công việc bạn đang xây dựng ngay bây giờ, và có hai câu trả lời khác biệt.

Nếu bạn đang cân nhắc giữa V4 Pro và Kimi K3 về năng lực, bằng chứng hiện tại cho thấy Kimi K3 thắng chỉ số tổng hợp với 13 điểm, còn V4 Pro thắng vượt trội về tốc độ, độ trễ và chi phí — và một bản nâng cấp sau huấn luyện đang chờ triển khai có thể thu hẹp khoảng cách về trí thông minh nhưng không thể xóa bỏ nó. Nếu công việc của bạn nằm ở biên giới của các bài toán suy luận khó, 13 điểm đó chính là điều quyết định tất cả, và giá cả chỉ là thứ gây xao nhãng. Nếu công việc của bạn có khối lượng lớn và chỉ ở mức khó thông thường, trả gấp 14 lần cho nó là điều khó có thể biện minh.

Nếu bạn đã chọn V4 Pro, rủi ro cần quản lý không phải là ngày phát hành mà là sự tráo đổi ngầm: bản build đằng sau mã mô hình đó sẽ thay đổi ngay dưới tay bạn, y như từng xảy ra với Flash, và hệ thống eval của bạn phải phát hiện được điều đó. Hãy duy trì một bộ kiểm thử hồi quy có thể chạy lại bất cứ khi nào cần, và giữ một mô hình thứ hai luôn truy cập được mà không cần thay đổi mã. Đây là lý do hết sức đời thường khiến chúng tôi xây dựng failover theo cách đó — V4 Pro, V4 Flash và Kimi K3 đều nằm sau một khóa OrcaRouter trên endpoint tương thích OpenAI, nên "chạy lại eval trên cả ba, rồi chuyển lưu lượng" chỉ là một lần chỉnh cấu hình chứ không phải một quy trình mua sắm, và một bản build GA kém chỉ là một quyết định định tuyến thay vì một sự cố. Thử một sản phẩm chủ lực chưa được kiểm chứng sẽ dễ dàng hơn nhiều khi việc đảo ngược lựa chọn đó chẳng tốn gì.

Những câu hỏi mà mọi người thực sự đang hỏi

DeepSeek V4 Pro đã phát hành hay chưa?

Cả hai, tùy thuộc vào ý bạn muốn nói gì, đó là lý do khiến kết quả tìm kiếm mâu thuẫn. Mô hình đã có thể được gọi công khai kể từ khi bản xem trước V4 ra mắt vào ngày 24 tháng 4 năm 2026, với mức giá được công bố, trọng số mở theo giấy phép MIT và được các bài benchmark độc lập đánh giá. Nhưng nhật ký thay đổi của chính công ty vào ngày 31 tháng 7 năm 2026 nêu rõ API V4 Pro “không thay đổi” và bản phát hành chính thức “sẽ sớm ra mắt”, đồng thời vào ngày 6 tháng 8, DeepSeek một lần nữa cho biết phiên bản chính thức sẽ được phát hành càng sớm càng tốt trong khi công bố mức tăng giá API lớn. Vì vậy: có sẵn, nhưng chưa chính thức. Chưa có ngày nào được xác nhận; các báo cáo chưa được xác nhận cho thấy thời điểm là giữa tháng 8, nghĩa là sẽ không phải chờ lâu.

Liệu bản chính thức có làm cho nó tốt như Kimi K3 không?

Dựa trên tiền lệ định lượng duy nhất hiện có, có lẽ không hoàn toàn. Bản build chính thức của Flash đã tăng 10 điểm trên Intelligence Index của Artificial Analysis chỉ nhờ post-training; V4 Pro đang ở mức 44 và Kimi K3 ở mức 57, vậy nên một mức tăng tương tự sẽ đạt 54. Phép ngoại suy đó có thể sai theo cả hai hướng — mô hình 1,6T có thể có dư địa khác với mô hình 284B, và công ty chưa xác nhận bản Pro sẽ chỉ áp dụng post-training. Nhưng bất kỳ ai khẳng định sự ngang bằng ngay lúc này đang khẳng định một điều mà chưa có phép đo công bố nào hỗ trợ.

Tại sao mô hình giá rẻ của DeepSeek hiện tại lại đạt điểm cao hơn mô hình chủ lực của họ?

Do trình tự phát hành, không phải vì Flash là mô hình tốt hơn. Flash đã nhận được bản nâng cấp sau huấn luyện vào ngày 31 tháng 7, đưa nó từ 40 lên 50 trên chỉ số; Pro chưa nhận được bản nâng cấp tương đương, vì vậy nó vẫn đang được đo trên bản sau huấn luyện của tháng 4. Chính công ty cũng thừa nhận điều này, mô tả kết quả agentic của Flash-0731 là "vượt xa V4-Pro-Preview." Sự đảo ngược này chỉ là bức ảnh chụp nhanh của một quá trình triển khai chưa hoàn thiện, và bản phát hành Pro sắp tới chính là thứ sẽ chấm dứt tình trạng đó.

Giá $0.435 / $0.87 có đáng tin cậy để xây dựng mô hình chi phí không?

Có điều kiện, và kém an toàn hơn so với một tuần trước. Đây là mức giá niêm yết hiện tại của công ty và nó đã phản ánh mức giảm lớn vĩnh viễn so với giá ra mắt V4. Nhưng vào ngày 6 tháng 8, DeepSeek đã thông báo kế hoạch tăng giá API nói chung, "với mức tăng đáng kể dự kiến," và chưa có mức giá hay ngày áp dụng mới nào được công bố — chưa kể chính sách giờ cao điểm đã được công bố nhưng chưa có hiệu lực, theo đó mọi hạng mục thanh toán sẽ bị nhân đôi trong bảy giờ mỗi ngày. Hãy mô hình hóa cả hai kịch bản, và lưu ý rằng ngay cả trong trường hợp tăng gấp đôi thì vẫn rẻ hơn Kimi K3 khoảng 6 lần.

Cái nhìn trung thực

Dự báo khởi nguồn cho việc này đúng một nửa, và nửa đúng được lại chính là phần người ta khó tin nhất. "Rẻ hơn 10 lần" vẫn là cách nói quá nhẹ: trên cùng một khối lượng đánh giá được đo lường, bản preview của DeepSeek V4 Pro tốn 176,34 đô la so với 2.437,41 đô la của Kimi K3, còn với đầu vào đã lưu cache, khoảng cách không phải gấp mười lần mà là gấp khoảng tám mươi lần. "Ngang trình Kimi K3" mới là phần chưa đạt được — 44 so với 57 trên chỉ số tổng hợp duy nhất mà một phòng thí nghiệm độc lập chạy trên cả hai, với phép ngoại suy lạc quan từ tiền lệ tốt nhất của chính công ty dừng ở mức 54.

Điều có thể thay đổi nhận định này là cụ thể và đáng để theo dõi. Nếu bản build V4 Pro chính thức ra mắt như một bản nâng cấp hậu huấn luyện và Artificial Analysis chấm lại nó trên 57 điểm, dự báo sẽ được xác nhận hoàn toàn và con số trọng tâm của bài viết này đã lỗi thời. Nếu nó ra mắt cùng lúc với phụ phí giờ cao điểm hoặc đợt tăng giá được công bố vào ngày 6 tháng 8, lập luận về giá sẽ giảm một nửa và câu hỏi thú vị trở thành liệu mức chiết khấu 6x có bù đắp được khoảng cách 13 điểm hay không. Và nếu công ty phát hành bộ công cụ đánh giá — vốn đã ở giai đoạn beta kín — các điểm chuẩn của nhà cung cấp hiện đang nghiêng về V4 Pro trong lập trình sẽ lần đầu tiên có thể kiểm chứng được. Cho đến khi một trong những điều đó xảy ra, tóm tắt chính xác về DeepSeek V4 Pro là: đây là mô hình suy luận nghiêm túc đáng giá nhất có trọng số để tải về, không phải là mô hình thông minh nhất, và nhà cung cấp của nó đã nói với chúng ta rằng nó chưa hoàn thiện.

So sánh trong bài viết này4

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube