
Điểm chuẩn DeepSeek V4 Pro: Bảng điểm 0813 đầy đủ, Mọi kiểm tra độc lập, và Điều chưa ai xác minh
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B Uncensored (Aggressive)2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
Câu trả lời ngắn gọn: DeepSeek V4 Pro đạt bảng điểm tác nhân thực sự ấn tượng theo chính số liệu DeepSeek tự công bố — Terminal-Bench 2.1 ở mức 87,9, DeepSWE ở mức 62,7, CyberGym ở mức 83,3 — nhưng gần như mọi con số nổi bật đều do nhà cung cấp tự báo cáo, và bức tranh từ phía độc lập thì kém ấn tượng hơn. Artificial Analysis xếp bản build chính thức 0813 ở mức 53 trên Chỉ số Thông minh (Intelligence Index), ngang bằng với GLM-5.2, kém GPT-5.6 Terra bốn điểm và kém Kimi K3 bảy điểm; Vals AI xếp nó ở vị trí thứ 12, dưới cả GPT-5.5 thế hệ trước. Bài viết này là bản tổng hợp đầy đủ mà chưa ai từng viết: toàn bộ bảng điểm 0813, bộ bài kiểm tra lập trình mở rộng từ báo cáo kỹ thuật, mọi bài kiểm tra độc lập hiện có, và một sổ cái trung thực về những con số nào đã được tái lập và những con số nào vẫn chỉ là lời nói của riêng DeepSeek.
Bảng điểm chính thức 0813 — toàn bộ đều là số liệu của chính DeepSeek
Thông báo chính thức của DeepSeek (tài liệu API, news260813, ngày 13 tháng 8 năm 2026) báo cáo bản dựng sản xuất so với bản xem trước tháng Tư. Mọi con số trong phần này đều do nhà cung cấp báo cáo — chưa có con số nào được tái lập độc lập tính đến ngày 16 tháng 8 năm 2026:
• Terminal-Bench 2.1 — 87.9 (bản xem trước: 72.1).
• DeepSWE — 62.7 (bản xem trước: 12.8) — mức tăng gần 5 lần, tuyên bố nổi bật nhất trên thẻ.
• CyberGym — 83.3 (bản xem trước: 52.7).
• Humanity's Last Exam — 42.7 khi không có công cụ, 60.0 khi có công cụ (bản xem trước: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (bản xem trước: 55.9).
• AutomationBench (công khai) — 31.8 (bản xem trước: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (xem trước: 41.8 / 31.1).
• NL2Repo — 61.5 (bản xem trước: 38.5).
• Agents' Last Exam — 25.7 (xem trước: 16.5).
Điều cần chú ý là nơi tập trung các mức tăng: các chuẩn đánh giá về tác nhân AI và an ninh mạng. Đó chính là loại bảng điểm mà một phòng thí nghiệm tạo ra khi muốn quảng bá mô hình tác nhân — và cũng chính là loại cần được chạy lại một cách trung lập trước khi bạn chi tiền sản xuất cho nó.

Bộ mã hóa mở rộng từ báo cáo kỹ thuật của DeepSeek
Ngoài thẻ tác nhân, báo cáo kỹ thuật DeepSeek (được BenchLM tổng hợp vào ngày 16 tháng 8 năm 2026) bổ sung thêm một bộ dữ liệu mã hóa và ngữ cảnh dài rộng hơn. Cũng do nhà cung cấp báo cáo, và được BenchLM gắn nhãn "Provider exact" — không có bài kiểm tra độc lập:
• SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.
• LiveCodeBench Pass@1-CoT — 93.5% — tốt nhất đã được xác minh trong danh mục của BenchLM.
• Rating Codeforces — 3206 — cũng là mức tốt nhất đã được xác minh trong danh mục.
• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — cả hai đều là tốt nhất trong danh mục về truy xuất 1M-token, điều này quan trọng đối với một mô hình quảng cáo cửa sổ ngữ cảnh 1M-token.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (được liệt kê trên trang mô hình của OrcaRouter).
Những gì các nhà đánh giá độc lập thực sự đo lường
Ba nguồn độc lập đã chạy DeepSeek V4 Pro, và các kết luận của họ tập trung bên dưới thẻ nhà cung cấp:
• Chỉ số Trí tuệ Phân tích Nhân tạo — 53 (báo cáo của SCMP, tháng 8 năm 2026; trang mô hình của OrcaRouter hiển thị 53,2, xếp hạng 20/132). Ngang bằng với GLM-5.2, kém GPT-5.6 Terra bốn điểm, kém Kimi K3 bảy điểm.
• Artificial Analysis Coding — 68.8, xếp hạng 24/130 (theo trang mô hình của OrcaRouter).
• Vals AI Index — hạng 12, xếp sau GPT-5.5 thế hệ trước và cách xa Kimi K3 cùng Claude Opus 5 (SCMP). Bài kiểm tra của chính Vals AI đã chỉ ra hai điểm yếu cụ thể: hoàn thành tác vụ trong môi trường terminal hộp cát và xây dựng các mô hình tài chính phức tạp trong bảng tính Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, lần chạy độc lập duy nhất "Benchmark exact" trong tập hợp).
Sổ cái trung thực — những gì đã được tái hiện so với những gì vẫn chỉ là lời nói của DeepSeek.
Đây là phần mà một bài viết đánh giá hiệu năng tồn tại để cung cấp, và là lý do để đánh dấu trang này thay vì theo dõi tin ra mắt. Chia mỗi điểm số vào một trong hai nhóm:
• Nguồn độc lập: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI xếp hạng thứ 12, Vibe Code Bench 49.93 — và một lần chạy Terminal-Bench 2.1 từ nguồn riêng biệt đạt 78.7 nằm cạnh mức 87.9 của DeepSeek trên trang mô hình của OrcaRouter. Khoảng cách chín điểm giữa con số của nhà cung cấp và một lần chạy độc lập là dữ liệu quan trọng nhất trên trang này: đó chính là khoảng cách tái lập, được định lượng.
• Chỉ do nhà cung cấp báo cáo, chưa được tái lập độc lập: mọi con số trong bảng thông số 0813 chính thức ở trên (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) và toàn bộ bộ dữ liệu lập trình mở rộng (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Tài liệu của chính DeepSeek gắn nhãn con số Terminal-Bench 2.1 là "provider run."
Đọc theo cách đó, câu chuyện mạch lạc: DeepSeek V4 Pro là một mô hình tiên phong thực sự ở phân khúc giữa — AA 53, xếp hạng từ hạng mười đến hạng hai mươi — với bảng điểm của nhà cung cấp tuyên bố hiệu suất tác nhân và lập trình gần như hàng đầu. Cả hai tuyên bố đều đúng và không xung đột; một cái được đo lường, cái kia được khẳng định.

Bảng điểm có chi phí bao nhiêu?
DeepSeek V4 Pro là mô hình MoE hàng đầu với tổng 1,6T / 49B tham số hoạt động, có cửa sổ ngữ cảnh 1 triệu token và đầu ra tối đa 384K. Trên OrcaRouter, mô hình này được định giá theo giá niêm yết của DeepSeek, không cộng thêm bất kỳ khoản phụ phí nào: $0.435 mỗi triệu token đầu vào và $0.87 mỗi triệu token đầu ra (đọc cache $0.060 mỗi triệu), theo danh bạ được kiểm tra ngày 15 tháng 8 năm 2026 và xác nhận trên trang mô hình trực tiếp. Với mức giá đó, phép toán giá trên mỗi điểm là lý lẽ mạnh nhất cho mô hình này: nó có giá đầu ra chỉ bằng khoảng một phần mười so với các mô hình có điểm số gần nó trên chỉ số độc lập, vì vậy bạn đang trả mức giá tầm trung cho một bảng điểm mà, nếu tuyên bố của nhà cung cấp là đúng, sẽ nằm gần top. Một điểm cần lưu ý: DeepSeek đã công bố lịch giá cao điểm/ngoài giờ cao điểm (ngoài giờ cao điểm bằng 50% giá cao điểm) có hiệu lực từ ngày 17 tháng 8, giờ Bắc Kinh, do đó mức giá có thể thay đổi — các con số ở đây là giá niêm yết trực tiếp tính đến thời điểm bài viết này.

Khi khuyến nghị này sai
Những trường hợp thật sự mà DeepSeek V4 Pro không nên là lựa chọn của bạn:
• Bạn cần khả năng suy luận tiên phong được xác nhận độc lập.Chỉ số AA 53 ở hạng giữa — Kimi K3 (60) và GPT-5.6 Terra (57) đứng trước và đã được xác minh. Nếu quyết định của bạn phụ thuộc vào trần đo được, thẻ nhà cung cấp không thay đổi điều đó.
• Bạn đang đánh cược việc sản xuất vào DeepSWE 62.7 trước khi ai đó chạy lại nó. Một bước nhảy từ 12.8 lên 62.7 trong một bản phát hành chỉ là một tuyên bố, không phải một sự thật. Hãy chờ một bản tái lập trung lập — khoảng cách 87.9-vs-78.7 trên Terminal-Bench cho thấy điều người ta có thể tìm thấy.
• Khối lượng công việc của bạn là tự động hóa terminal trong môi trường sandbox hoặc mô hình hóa tài chính Excel. Vals AI cho biết đây chính là những điểm mà mô hình gặp khó khăn, không phụ thuộc vào điểm số của bất kỳ nhà cung cấp nào.
• Bạn đang đưa ra một quyết định an ninh mạng dựa trên CyberGym 83.3. Đó là DeepSeek thử nghiệm mô hình của chính họ trên tiêu chuẩn đánh giá của chính họ — một nhà cung cấp bảo mật mua theo con số này đang mua dữ liệu chưa được kiểm toán.
Kết luận
DeepSeek V4 Pro 0813 là một mô hình tiên phong thực sự với bảng điểm từ nhà cung cấp vượt trội so với kết quả đánh giá độc lập của nó. Bản phát hành 0813 đã biến một bản xem trước văn bản thành một ứng viên agentic nghiêm túc — chúng tôi đã đưa tin về bản phát hành này một cách riêng biệt — và nếu bạn muốn đánh giá nó ngay hôm nay, đó là một khóa tương thích OpenAI trên OrcaRouter với giá niêm yết của DeepSeek, có tự động chuyển đổi dự phòng nếu nhà cung cấp bị trục trặc. Chỉ cần đọc bảng điểm theo cách bài viết này phân tách: các bài kiểm tra độc lập (AA 53, Vals đứng thứ 12, kết quả chạy Terminal-Bench 78.7) là những gì bạn có thể tin tưởng hôm nay; các con số 87.9 và 62.7 là những gì bạn nên xác minh trước khi xây dựng dựa trên chúng. Hãy mua nó vì hiệu năng trên giá thành và ngữ cảnh 1M token, không phải vì những con số tiêu đề chưa được tái lập.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
