
Điểm chuẩn DeepSeek V4 Pro: Bảng điểm 0813 đầy đủ, Mọi kiểm tra độc lập, và Điều chưa ai xác minh
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 143 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Câu trả lời trong một dòng: DeepSeek V4 Pro đạt bảng điểm năng lực tác tử thực sự mạnh theo số liệu tự công bố của DeepSeek — Terminal-Bench 2.1 đạt 87,9, DeepSWE đạt 62,7, CyberGym đạt 83,3 — nhưng gần như mọi con số nổi bật đều do nhà cung cấp tự báo cáo, và bức tranh độc lập thì kém ấn tượng hơn.Artificial Analysis xếp bản build 0813 chính thức ở mức 53 trên Chỉ số Trí tuệ của họ, ngang với GLM 5.2, kém GPT-5.6 Terra bốn điểm và kém Kimi K3 bảy điểm; Vals AI xếp nó ở vị trí thứ 12, dưới cả GPT-5.5 thế hệ trước. Bài viết này là bản tổng hợp đầy đủ mà chưa ai từng viết: bảng điểm 0813 hoàn chỉnh, bộ bài kiểm tra lập trình mở rộng từ báo cáo kỹ thuật, mọi bài kiểm tra độc lập hiện có, cùng một bản kê trung thực về những con số đã được tái lập và những con số vẫn chỉ là lời khai của riêng DeepSeek. Một tuần sau bảng điểm, bức tranh về khả năng phục vụ cũng bắt đầu được lấp đầy — vào ngày 19 tháng 8 năm 2026, LMSYS và Ant Group đã công bố một bộ xếp chồng phục vụ H20 đạt tốc độ 271 token đầu ra/giây ở batch size 1, được trình bày trong phần riêng bên dưới và được ghi nhận, giống như mọi thứ ở phía nhà cung cấp trên trang này, là tự báo cáo cho đến khi có người tái lập.
Bảng điểm chính thức 0813 — những con số của chính DeepSeek, tất cả chúng
Thông báo chính thức của DeepSeek (tài liệu API, news260813, ngày 13 tháng 8 năm 2026) báo cáo bản dựng sản xuất so với bản xem trước tháng 4. Mọi số liệu trong phần này đều do nhà cung cấp báo cáo — chưa có số liệu nào được tái lập độc lập tính đến ngày 16 tháng 8 năm 2026:
• Terminal-Bench 2.1 — 87.9 (bản xem trước: 72.1).
• DeepSWE — 62.7 (bản xem trước: 12.8) — mức tăng gần 5 lần, tuyên bố nổi bật nhất trên thẻ.
• CyberGym — 83.3 (bản xem trước: 52.7).
• Humanity's Last Exam — 42.7 khi không có công cụ, 60.0 khi có công cụ (bản xem trước: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (bản xem trước: 55.9).
• AutomationBench (công khai) — 31.8 (bản xem trước: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (xem trước: 41.8 / 31.1).
• NL2Repo — 61.5 (bản xem trước: 38.5).
• Agents' Last Exam — 25.7 (xem trước: 16.5).
Điều cần chú ý là nơi tập trung các mức tăng: các chuẩn đánh giá về tác nhân AI và an ninh mạng. Đó chính là loại bảng điểm mà một phòng thí nghiệm tạo ra khi muốn quảng bá mô hình tác nhân — và cũng chính là loại cần được chạy lại một cách trung lập trước khi bạn chi tiền sản xuất cho nó.

Bộ mã hóa mở rộng từ báo cáo kỹ thuật của DeepSeek.
Ngoài thẻ agentic, báo cáo kỹ thuật của DeepSeek (theo tổng hợp của BenchLM vào ngày 16 tháng 8 năm 2026) bổ sung một bộ đánh giá rộng hơn về mã hóa và ngữ cảnh dài. Cũng do nhà cung cấp báo cáo, và được BenchLM gắn nhãn "Provider exact" — không có bài kiểm tra độc lập:
• SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.
• LiveCodeBench Pass@1-CoT — 93.5% — tốt nhất đã được xác minh trong danh mục của BenchLM.
• Rating Codeforces — 3206 — cũng là mức tốt nhất đã được xác minh trong danh mục.
• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — cả hai đều là tốt nhất trong danh mục về truy xuất 1M-token, điều này quan trọng đối với một mô hình quảng cáo cửa sổ ngữ cảnh 1M-token.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (được liệt kê trên trang mô hình của OrcaRouter).
Những gì các nhà đánh giá độc lập thực sự đo lường
Ba nguồn độc lập đã chạy DeepSeek V4 Pro, và các kết luận của họ tập trung bên dưới thẻ nhà cung cấp:
• Artificial Analysis Intelligence Index — 53 (Theo báo cáo của SCMP, tháng 8 năm 2026; trang mô hình của OrcaRouter hiển thị 53,2, xếp hạng 20/132). Ngang bằng với GLM 5.2, kém GPT-5.6 Terra 4 điểm, kém Kimi K3 7 điểm.
• Artificial Analysis Coding — 68.8, xếp hạng 24/130 (theo trang mô hình của OrcaRouter).
• Vals AI Index — hạng 12, xếp sau GPT-5.5 thế hệ trước và cách xa Kimi K3 cùng Claude Opus 5 (SCMP). Bài kiểm tra của chính Vals AI đã chỉ ra hai điểm yếu cụ thể: hoàn thành tác vụ trong môi trường terminal hộp cát và xây dựng các mô hình tài chính phức tạp trong bảng tính Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, lần chạy độc lập duy nhất "Benchmark exact" trong tập hợp).
Sổ sách trung thực — những gì đã được tái hiện so với những gì vẫn chỉ là lời của DeepSeek
Đây là phần mà một bài viết đánh giá hiệu năng tồn tại để cung cấp, và là lý do để đánh dấu trang này thay vì theo dõi tin ra mắt. Chia mỗi điểm số vào một trong hai nhóm:
• Nguồn độc lập: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI xếp hạng 12, Vibe Code Bench 49.93 — và một lần chạy Terminal-Bench 2.1 từ nguồn riêng biệt đạt 78.7, con số này nằm cạnh mức 87.9 của DeepSeek trên trang mô hình của OrcaRouter. Khoảng cách chín điểm đó giữa con số của nhà cung cấp và kết quả của lần chạy độc lập là dữ liệu quan trọng nhất trên trang này: đó chính là khoảng cách tái lập, được định lượng.
• Chỉ do nhà cung cấp báo cáo, chưa được tái lập độc lập:mọi con số trong thẻ 0813 chính thức ở trên (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) và toàn bộ bộ đánh giá mã hóa mở rộng (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Tài liệu của DeepSeek tự ghi chú con số Terminal-Bench 2.1 là "provider run".
Đọc theo cách đó, câu chuyện mạch lạc: DeepSeek V4 Pro là một mô hình tiên phong thực sự ở phân khúc giữa — AA 53, xếp hạng từ hạng mười đến hạng hai mươi — với bảng điểm của nhà cung cấp tuyên bố hiệu suất tác nhân và lập trình gần như hàng đầu. Cả hai tuyên bố đều đúng và không xung đột; một cái được đo lường, cái kia được khẳng định.

Bảng điểm có chi phí bao nhiêu?
DeepSeek V4 Pro là mô hình MoE chủ lực với tổng 1,6 nghìn tỷ tham số / 49 tỷ tham số hoạt động, có cửa sổ ngữ cảnh 1 triệu token và đầu ra tối đa 384K. Trên OrcaRouter, mô hình được bán với giá niêm yết của DeepSeek, không cộng thêm bất kỳ khoản phụ phí nào: $0.435 cho mỗi triệu token đầu vào và $0.87 cho mỗi triệu token đầu ra (đọc cache $0.060 cho mỗi triệu token), theo danh mục được kiểm tra ngày 15 tháng 8 năm 2026 và được xác nhận trên trang mô hình trực tiếp. Với mức giá đó, phép tính giá trên mỗi điểm chính là luận cứ mạnh nhất cho mô hình: giá đầu ra của nó chỉ bằng khoảng một phần mười so với các mô hình đạt điểm gần nó trên chỉ số độc lập, nên bạn đang trả mức giá tầm trung cho một bảng điểm mà, nếu những tuyên bố của nhà cung cấp là đúng, sẽ gần đứng đầu. Một lưu ý: DeepSeek đã công bố biểu giá giờ cao điểm/ngoài giờ cao điểm (giá ngoài giờ cao điểm bằng 50% giá giờ cao điểm), có hiệu lực từ ngày 17 tháng 8, theo giờ Bắc Kinh, vì vậy mức giá có thể thay đổi — các con số ở đây là giá niêm yết hiện hành tính đến thời điểm bài viết này.

Phục vụ DeepSeek V4 Pro: 271 token đầu ra/giây trên H20
Các bài benchmark đánh giá những gì mô hình biết; các con số serving đánh giá mức độ rẻ để khiến nó suy nghĩ. Vào ngày 19 tháng 8 năm 2026, LMSYS — tổ chức đứng sau Chatbot Arena — và nhóm mã nguồn mở của Ant Group đã công bố công trình serving nghiêm túc đầu tiên trên bản dựng 0813: một "ngăn xếp serving theo kịch bản cụ thể" được xây dựng trên SGLang, engine mã nguồn mở do LMSYS duy trì. Con số nổi bật là 271 token đầu ra/giây với batch size 1 trên NVIDIA H20, mà nhóm đánh giá là kém 1,42× so với B300 — đạt được trên một con chip không có Tensor Core FP4 gốc. Đây là các phép đo do chính LMSYS và Ant Group thực hiện, được công bố trên blog và trên X của họ; chưa có phép đo nào được tái lập một cách độc lập.
Phần còn lại của các số liệu trong stack, tất cả đều do LMSYS và Ant Group tự báo cáo trên stack của chính họ:
• Độ trễ giải mã — thành phần "DSpark được tối ưu hóa" cắt giảm thời gian trên mỗi token đầu ra (TPOT) đi 74.8–78.0% ở batch size 1.
• Prefill — quá trình prefill với 1 triệu token hoàn tất trong 43.7 giây, cải thiện 36.5% thông lượng prefill theo trung bình hình học.
• KV cache — một giải pháp mà nhóm gọi là "Humming MXFP4AFP8 + Online C128" mở rộng dung lượng KV cache toàn token lên 10.14×, đòn bẩy giúp các tác vụ agent 1M token trở nên khả thi trên loại silicon này.
• Giải mã trên mỗi GPU — ở ngữ cảnh 4K, thông lượng giải mã trên mỗi GPU tăng từ 319.9 lên 703.2 token/s/GPU, mức cải thiện gấp 2.20 lần.
Hãy đọc kỹ các lưu ý trước khi bạn xác định quy mô dàn thiết bị dựa trên nó. Batch size 1 là chế độ đơn luồng — thứ mà một tác nhân tương tác hoặc một phiên chat gặp phải, không phải API có độ đồng thời cao — và so sánh chênh lệch 1,42× so với B300 là một tỷ lệ mà LMSYS đưa ra mà không công bố token/giây tuyệt đối của B300, nên khoảng cách này chỉ được khẳng định chứ không thể kiểm chứng. Kết quả cũng đo stack phần mềm, không phải chip: những cải thiện này đến từ tối ưu hóa ở cấp độ SGLang trên phần cứng mà nếu không có thì trông sẽ thiếu sức mạnh đối với một MoE tổng tham số 1,6T. Để bối cảnh hóa, trang mô hình trực tiếp của OrcaRouter đo DeepSeek V4 Pro ở mức 80,8 token đầu ra/giây qua một endpoint API dùng chung — con số H20 là một benchmark đơn luồng trên một stack chuyên dụng, một con số khác với một ý nghĩa khác.
Nếu khối lượng công việc của bạn được phục vụ qua API, điều này không thay đổi cách bạn gọi mô hình: DeepSeek V4 Pro là một khóa tương thích OpenAI trên OrcaRouter với giá niêm yết của DeepSeek, có chuyển đổi dự phòng tự động nếu nhà cung cấp bị ngừng trệ. Các con số H20 có ý nghĩa nhất nếu bạn là đội ngũ đang cân nhắc giữa việc tự vận hành một cụm H20 và trả phí cho API — khoảng cách mà công trình của LMSYS và Ant Group thu hẹp là quyết định mua phần cứng, không phải quyết định chọn mô hình.
Khi khuyến nghị này sai
Những trường hợp thật sự mà DeepSeek V4 Pro không nên là lựa chọn của bạn:
• Bạn cần khả năng suy luận tiên phong được xác nhận độc lập.Chỉ số AA 53 ở hạng giữa — Kimi K3 (60) và GPT-5.6 Terra (57) đứng trước và đã được xác minh. Nếu quyết định của bạn phụ thuộc vào trần đo được, thẻ nhà cung cấp không thay đổi điều đó.
• Bạn đang đánh cược việc sản xuất vào DeepSWE 62.7 trước khi ai đó chạy lại nó. Một bước nhảy từ 12.8 lên 62.7 trong một bản phát hành chỉ là một tuyên bố, không phải một sự thật. Hãy chờ một bản tái lập trung lập — khoảng cách 87.9-vs-78.7 trên Terminal-Bench cho thấy điều người ta có thể tìm thấy.
• Khối lượng công việc của bạn là tự động hóa terminal trong môi trường sandbox hoặc mô hình hóa tài chính Excel. Vals AI cho biết đây chính là những điểm mà mô hình gặp khó khăn, không phụ thuộc vào điểm số của bất kỳ nhà cung cấp nào.
• Bạn đang đưa ra quyết định an ninh mạng dựa trên CyberGym 83.3. Đó là DeepSeek tự kiểm tra mô hình của chính mình trên chuẩn đánh giá của chính mình — một nhà cung cấp bảo mật mua theo con số này là đang mua dữ liệu chưa được kiểm định.
• Bạn đang mua H20s chỉ dựa trên con số 271 tokens/s. Con số đó là một benchmark tự báo cáo trên một stack duy nhất ở batch size 1 — đầy hứa hẹn, chưa được tái lập, và chỉ là một điểm trên đường cong chi phí bao gồm cả utilization, điện năng, và bất kỳ serving stack nào bạn thực sự sẽ chạy.
Điểm mấu chốt
DeepSeek V4 Pro 0813 là một mô hình tiên phong thực thụ với bảng điểm nhà cung cấp vượt xa thành tích độc lập của nó. Bản phát hành 0813 đã biến bản xem trước văn bản thành một ứng viên tác nhân nghiêm túc — chúng tôi đã đưa tin riêng về bản phát hành — và nếu bạn muốn đánh giá nó hôm nay, nó là một khóa tương thích OpenAI trên OrcaRouter với giá niêm yết của DeepSeek, có tự động chuyển đổi dự phòng nếu nhà cung cấp gặp sự cố. Chỉ cần đọc bảng điểm theo cách bài viết này phân tách: các kiểm tra độc lập (AA 53, Vals đứng thứ 12, lần chạy Terminal-Bench 78.7) là những gì bạn có thể tin tưởng hôm nay; các con số 87.9 và 62.7 là những gì bạn nên xác minh trước khi xây dựng dựa trên chúng. Kỷ luật tương tự hiện nay mở rộng sang khâu phục vụ: con số 271 token đầu ra/giây trên H20 của LMSYS và Ant Group là bức tranh thông lượng tốt nhất chúng tôi có, và vẫn chỉ là lời của họ cho đến khi một lần chạy trung lập xác nhận nó. Hãy mua nó vì tỷ lệ giá-hiệu năng và ngữ cảnh 1M token, chứ không phải vì những con số tiêu đề chưa được tái lập.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
