
Điểm chuẩn DeepSeek V4.1 Flash: 74,2 chứng minh được gì và không chứng minh được gì
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 984 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
DeepSeek V4.1 Flash đạt 74,2 điểm trên DeepSWE v1.1, cao hơn GPT-6 Astra một phần mười điểm, cao hơn Gemini 3.8 Flash và Claude Opus 5 nửa điểm, và con số này đã được trích dẫn suốt tuần như một cuộc đổi ngôi. Cần nói chính xác đây thực sự là gì. Bản thân mô hình không mới — DeepSeek V4.1 Flash được phát hành rộng rãi vào ngày 2026-09-10, sáu ngày trước — nên không có gì ở đây là một buổi ra mắt. Điều xuất hiện trong khoảng thời gian đó là lớp đo lường: những mục chỉ số độc lập đầu tiên, kết quả đấu trường độc lập đầu tiên, hỗ trợ phục vụ ngay từ ngày đầu trên ba stack, và quyết định của nhà cung cấp loại bỏ mô hình chủ lực của chính mình để ưu tiên mô hình này. Trang này là bản tổng hợp những gì đã thực sự được đo lường, với nguồn được nêu rõ cho từng số liệu, và một tuyên bố thẳng thắn về những gì chưa ai xác lập được.
Con số DeepSWE, và bốn mô hình chỉ cách nó chưa đầy nửa điểm
DeepSWE v1.1 là một benchmark kỹ thuật phần mềm tầm xa từ Datacurve — 113 tác vụ nguyên bản trải khắp 91 kho mã nguồn mở và năm ngôn ngữ lập trình, được xây dựng xoay quanh các thay đổi nhiều tệp và tính đúng đắn về hành vi. Trên model card của chính DeepSeek, bảng do nhà cung cấp báo cáo ghi rằng: DeepSeek V4.1 Flash 74.2, Claude Opus 5 74.0, GPT-5.6 Sol 73.0, Kimi K3 67.5, GLM-5.3 66.9, DeepSeek V4-Pro-0813 62.7, DeepSeek V4-Flash 54.4.
Bảng xếp hạng độc lập cho cùng một benchmark không tái tạo lại thứ tự đó, và những khác biệt quan trọng hơn tiêu đề. Bảng xếp hạng DeepSWE v1.1 Pass@1 của Datacurve đặt Muse Spark 1.3 (FAIR) ở vị trí đầu tiên với 75.40, trên DeepSeek V4.1 Flash ở 74.20. Phía sau: GPT-6 Astra ở 74.12 (extra high) và 74.10 (max), Gemini 3.8 Flash ở 73.83 (high), Claude Opus 5 ở 73.65 (max).
Vậy nên 74,2 là một mục có thật trên một bảng xếp hạng có thật của bên thứ ba, và nó đứng thứ hai, không phải thứ nhất. Tuyên bố đã lan truyền vào ngày ra mắt — rằng đây là mức tiên tiến nhất trên DeepSWE — không thể đứng vững khi đối chiếu với bảng xếp hạng mang điểm số đó. Muse Spark 1.3 hơn 1,2 điểm.
Giờ là phần bị bỏ qua. Bốn mô hình tiên phong chỉ cách nhau trong phạm vi 0,55 điểm trên bài đánh giá này: 74,20, 74,12, 73,83, 73,65. Đó là một khoảng hẹp hơn cả nhiễu đo lường. Dao động giữa các lần chạy được công bố trên DeepSWE vào khoảng 1,4 đến 3,2 điểm — gấp ba đến sáu lần toàn bộ chênh lệch của nhóm bốn mô hình dẫn đầu. Mức dẫn trước 0,2 điểm so với GPT-6 Astra không phải là một phát hiện; đó chỉ là vẻ ngoài của một kết quả hòa khi được in với hai chữ số thập phân.
Độ nhạy với scaffold là lý do thứ hai để không bám chặt vào con số, và ở đây tài liệu của chính nhà cung cấp đưa ra bằng chứng. DeepSeek báo cáo DeepSWE trên tám scaffold trong cùng một bộ tài liệu phát hành. Mức 74,2 đạt được trên mini-SWE. Cùng mô hình đó đạt 72,6 trên DSH Minimal, 70,5 trên DSH Standard, 69,8 trên Claude Code, 67,6 trên DSH PTC, 66,2 trên Pi, 65,6 trên Codex và 65,5 trên OpenCode. Đó là mức chênh lệch 8,7 điểm trên cùng một mô hình và cùng một benchmark, hoàn toàn do harness bao quanh nó tạo ra. Bất kỳ ai so sánh một con số DeepSeek được tạo ra trên mini-SWE với con số của đối thủ được tạo ra trên một vòng lặp agent khác đều đang so sánh scaffold, chứ không phải mô hình.
Nơi chỉ mục độc lập thực sự đặt nó
Artificial Analysis chạy một bộ kiểm thử cố định ở các mức effort được công bố, khiến Chỉ số Intelligence của nó trở thành phép kiểm tra bên ngoài sạch sẽ nhất hiện có. Trên trang model của DeepSeek V4.1 Flash, ở mức reasoning max effort, chỉ số ghi nhận 40 — xếp hạng #6 trong số 113 model cùng lớp, so với trung vị của lớp là 18. Các đối thủ đóng nằm phía trên nó: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. Cựu flagship của chính DeepSeek, V4-Pro-0813, nằm phía dưới với 36.
Đọc hai bảng điểm cạnh nhau và sự bất đồng là mang tính cấu trúc, không phải sai sót. Trên benchmark do DeepSeek chọn, với scaffold phù hợp, mô hình này ngang bằng với nhóm dẫn đầu. Trên một bộ kiểm thử bên ngoài cố định, lấy trung bình qua suy luận, lập trình, toán và công việc dạng tác nhân, nó kém Claude Opus 5 mười một điểm và kém Gemini 3.8 Flash một điểm. Cả hai đều có thể đúng. Bảng của nhà cung cấp là một lập luận; chỉ số là một mức trung bình.
Trang chỉ số cũng có hai con số quan trọng cho một quyết định định tuyến và hiếm khi xuất hiện trên các tiêu đề. DeepSeek V4.1 Flash chạy ở tốc độ 214,4 token đầu ra mỗi giây ở mức nỗ lực tối đa — nhanh. Nó cũng tạo ra 250 triệu token đầu ra khi hoàn thành Intelligence Index, so với mức trung vị 140 triệu, điều mà Artificial Analysis gắn cờ là dài dòng rõ rệt. Sự dài dòng không phải là vấn đề chất lượng; nó là một hóa đơn. Một mô hình suy nghĩ bằng số token nhiều hơn 79% so với các mô hình ngang hàng sẽ trả lại một phần lợi thế về giá của mình trong mỗi lượt gọi suy luận dài.

ProgramBench: điểm số của một mô hình đơn và điểm số của hệ đa tác nhân không phải là cùng một phép đo
Đây là con số dễ bị đọc nhầm nhất, nên cần được tách riêng một cách cẩn thận.
• Một mô hình duy nhất, cấu hình tiêu chuẩn — DeepSeek V4.1 Flash đạt 20,3 trên ProgramBench (Almost@1), theo chính thẻ mô hình của DeepSeek. Con số đó thấp hơn GPT-5.6 Sol ở mức 23,0 và thấp hơn nhiều so với Claude Opus 5 ở mức 37,0, chỉ cao hơn một chút so với GLM-5.3 ở 19,0 và Kimi K3 ở 17,5. Do nhà cung cấp báo cáo, và nó không hề tô hồng mô hình.
• Cấu hình nhóm đa tác nhân — báo cáo kỹ thuật của DeepSeek, DeepSeek-V4.1-Flash: Vươn tới giới hạn của nén KV Cache, mô tả một công thức Agent Swarm RL sơ bộ, trong đó một tác nhân dẫn dắt điều phối các đồng đội thông qua một bảng nhiệm vụ chung. Trên một tập con ProgramBench gồm 172 nhiệm vụ có độ tin cậy cao — những nhiệm vụ mà lời giải tham chiếu đạt tỷ lệ vượt qua từ 95% trở lên — cấu hình đa tác nhân tăng từ 13,59% ở hạn chót một giờ lên đỉnh 30,04% ở tám giờ, trong khi đường cơ sở đơn tác nhân chuyển từ 12,79% lên 20,39%.
30,04% là nguồn của tuyên bố “30%”, và nó không phải là điểm của một mô hình đơn lẻ. Đó là một nhóm tác nhân được cho tám giờ, được đo trên một tập con đã lọc, trong đánh giá sơ bộ của chính nhà cung cấp. Phép so sánh mà nó gợi ra — “cao hơn hẳn Sol đơn lẻ, gần gấp đôi Kimi K3” — là công bằng về mặt số học so với 23,0 của Sol và 17,5 của K3, đồng thời cũng là so sánh giữa một cấu hình đa tác nhân và các đường cơ sở mô hình đơn lẻ trên một tập nhiệm vụ khác. Cùng báo cáo đó cho thấy hiệu ứng trên FrontierSWE v2: đa tác nhân đạt 32,90% ở hai mươi giờ so với 28,20% của tác nhân đơn. Khoảng cách là có thật, nó thu hẹp khi thời hạn kéo dài, và chi phí token để đạt được điều đó không hề nhỏ — một bài viết thực hành báo cáo hơn 10 lần token và thời gian chạy tiến gần bốn giờ.
Số lượng tham số vẫn chưa được chốt, nên hãy coi mọi so sánh về kích thước là tạm thời.
Ghi chú phát hành của DeepSeek mô tả một "MoE 552 tỷ tham số". Đó là con số của nhà cung cấp, và là thông tin mà hầu hết các bài đưa tin lặp lại. Nó cũng không phải là toàn bộ tạo tác.
Thẻ mô hình của chính DeepSeek ghi nhận một thành phần thứ hai song song với xương sống transformer: "bộ nhớ có điều kiện Engram (196 tỷ tham số, được truy cập thưa thớt thông qua tra cứu dựa trên token)." Cộng hai thứ lại, bạn có 748 tỷ. Đó là phép tính đằng sau cách diễn giải của cộng đồng đã lan truyền trên r/LocalLLaMA trong vòng vài giờ sau khi phát hành, và chỉ mục safetensors của chính thẻ mô hình liệt kê 763 tỷ tham số trên các loại tensor của nó. Con số khoảng 510 GB FP8 đến từ cùng một mạch phân tích: những gì bạn thực sự tải xuống và giữ trong bộ nhớ.
Điểm dung hòa nằm ở chỗ những con số này đếm những thứ khác nhau. 552B là xương sống tính toán — các tham số mà một token đi qua. 196B là một bảng tra cứu được truy vấn tại các lớp cụ thể, trả về thông tin đã lưu thay vì tính toán trên đó. 8B và 16B, những con số kích hoạt mà DeepSeek đưa ra, lần lượt là các lát cắt theo từng token hoạt động trong prefill và decode. Cả bốn con số đều mô tả cùng một mô hình.
Không điều nào trong số đó khiến việc so sánh trở nên an toàn. Mọi tuyên bố có dạng “mô hình này sánh ngang với một mô hình tiên tiến chỉ với một phần nhỏ kích thước” đều dựa trên một tiêu đề từ nhà cung cấp vốn loại trừ một phần năm tạo tác. Cho đến khi ai đó công bố một bản kê tham số có thể tái lập, các lập luận dựa trên kích thước nên mang theo lời cảnh báo ngay trong dòng.
ARC-AGI: không có kết quả cho mô hình này
Không có điểm ARC-AGI-2 hay ARC-AGI-1 nào cho DeepSeek V4.1 Flash. Trang kết quả đã xác minh của ARC Prize không có mục nào cho checkpoint này, và bảng benchmark của chính DeepSeek cũng không có dòng ARC. Kết quả DeepSeek duy nhất được ARC Prize xác minh là dành cho checkpoint V4 Flash 0731 cũ hơn — 61,4% trên ARC-AGI-2 semi-private ở mức nỗ lực suy luận tối đa và 89,0% trên ARC-AGI-1, với chi phí lần lượt là 0,04 USD và 0,02 USD cho mỗi tác vụ. Đó là số liệu của phiên bản tiền nhiệm trên một mô hình khác, và việc trích dẫn chúng như kết quả của V4.1 Flash sẽ là sai. Nếu ARC-AGI quan trọng đối với đánh giá của bạn, thì mô hình này hiện chưa được chấm điểm.
Còn gì khác đã rơi vào bên trong cửa sổ?
Ba điều đã thay đổi đối với một độc giả đang cân nhắc xem có nên thử mô hình này hay không, và không điều nào trong số đó là bản phát hành của chính mô hình.
• Kết quả đấu trường độc lập. OpenDesign Arena đã cho mười ba mô hình chạy qua các nhiệm vụ thiết kế giống hệt nhau — ứng dụng web, bảng điều khiển, màn hình di động, trang đích. DeepSeek V4.1 Flash đạt 81,2 trên 100 so với 82,7 của GPT-6 Astra, với chi phí 0,023 USD cho mỗi thiết kế hoàn thiện so với 1,61 USD, và hoàn thành trong 5,3 phút so với 11,1 phút. Tỷ lệ bàn giao — đầu ra dùng được mà không cần chỉnh sửa — là 57,7% so với 60% của Astra. Đây là một trong những phép đo thực sự độc lập đầu tiên về mô hình này, và nó đo cụ thể đầu ra thiết kế, không phải suy luận tổng quát hay lập trình.
• Hỗ trợ serving Day-0 trên ba stack. vLLM đã phát hành image Day-0 (2026-09-09) được kiểm chứng trên phần cứng NVIDIA và AMD. SGLang và Miles đã phát hành hỗ trợ inference và RL Day-0 vào ngày 2026-09-10, bao gồm một đường host-offload của Engram giúp tăng dung lượng KV cache thêm 36% trên 4x GB300 và một tối ưu bounded-replay giúp nâng thông lượng prefill lên 1,56 lần trên 8x H200. Cambricon cũng công bố thích ứng Day-0 trên stack vLLM cùng ngày hôm đó. Với một mô hình mà điểm bán chính là khả năng nén KV cache cực mạnh — chỉ bằng một phần tư dấu chân HBM của thế hệ trước, một phần tám dung lượng SSD — thì việc có thể chạy trên các stack tiêu chuẩn ngay từ ngày đầu chính là khác biệt giữa một kết quả trong phòng thí nghiệm và một thứ bạn có thể triển khai.
• Nhà cung cấp đã ngừng mô hình chủ lực của chính mình. DeepSeek đang dần loại bỏ V4-Pro. Từ 04:00 UTC ngày 2026-09-14, mọi yêu cầu ghi tên “deepseek-v4-pro” sẽ được chuyển sang V4.1 Flash và tính phí theo mức giá của Flash, duy trì cho đến khi V4.1 Pro ra mắt. DeepSeek V4.1 Pro chưa được phát hành — đây là một mô hình trong tương lai, và việc chuyển hướng chỉ là giải pháp tạm thời giúp các tích hợp đã ghim không bị hỏng. Cũng đã ngừng: “deepseek-v4-flash” và “deepseek-v4-flash-vision-exp”, cả hai tạm thời được chuyển sang V4.1 Flash để đảm bảo tương thích. Nếu bạn có một ID mô hình được ghim trong môi trường sản xuất, thì việc chuyển hướng đó chính là sự thật vận hành duy nhất trên trang này mà bạn không thể bỏ qua.
Giá cả tác động thế nào đến quyết định
Giá cả chính là điểm mà mô hình này không còn chỉ là một câu chuyện về điểm chuẩn nữa. Theo mức giá do chính DeepSeek công bố, có hiệu lực từ 04:00 UTC ngày 2026-09-10, trong đó giờ cao điểm được định nghĩa là 01:00–04:00 và 06:00–10:00 UTC vào các ngày trong tuần, còn mọi khung giờ khác đều là giờ thấp điểm.
• Ngoài giờ cao điểm, trên mỗi triệu token — $0.003 cho cache hit, $0.15 cho cache miss, $0.60 cho đầu ra.
• Cao điểm, trên mỗi triệu token — $0.006 khi cache hit, $0.30 khi cache miss, $1.20 cho output.
• Đầu vào đã lưu đệm, so với một mô hình đóng tiên tiến — ba phần mười xu một triệu so với khoảng năm mươi xu. Với một agent lặp đi lặp lại trên cùng một repository, mức giá đó chiếm phần lớn số token.
• Đo trên danh mục của chính chúng tôi — $0.15 cho đầu vào và $0.60 cho đầu ra mỗi triệu token, 784 ms thời gian trung vị đến token đầu tiên, 211 token mỗi giây trong bảy ngày qua.
Artificial Analysis liệt kê cùng một mô hình ở mức $0,30 cho đầu vào và $1,20 cho đầu ra, với mức chiết khấu bộ nhớ đệm 98% và giá kết hợp $0,18 mỗi triệu — đó là bậc cao điểm, và hai con số này thực chất là cùng một mức giá vào các thời điểm khác nhau trong ngày. Sự khác biệt này đáng để ghi nhớ trước khi bạn so sánh các nhà cung cấp: một mô hình có đồng hồ hai bậc không thể được so sánh chỉ bằng một mức giá niêm yết duy nhất.
Đó cũng là lý do vì sao định giá chuyển tiếp (pass-through) lại quan trọng hơn mức thông thường ở đây. OrcaRouter định tuyến DeepSeek V4.1 Flash cùng với phần còn lại trong danh mục của mình ở mức 0% markup — giá niêm yết của nhà cung cấp, giữ nguyên, nên các bậc giá cao điểm và thấp điểm của DeepSeek đến phía chúng tôi đúng y như DeepSeek công bố, và khi nhà cung cấp thay đổi giá thì có hiệu lực ngay trong cùng ngày. Với một mô hình có mức giá tăng gấp đôi trong bốn giờ vào mỗi buổi sáng các ngày trong tuần, một nền tảng làm phẳng các bậc giá tức là đang che giấu con số duy nhất mà bạn cần.


Điều mà chưa ai xác lập
Khoảng trống trong câu chuyện này không phải là một benchmark còn thiếu. Vấn đề nằm ở chỗ không tồn tại một so sánh đối đầu trực tiếp đáng tin cậy nào giữa DeepSeek V4.1 Flash và các đối thủ được nêu tên của nó trên cùng một harness, do một người không có lợi ích liên quan đến kết quả thực hiện. Mọi con số trên trang này đều thuộc một trong ba loại: do nhà cung cấp báo cáo, do một bên thứ ba tạo ra trên một cấu hình khác, hoặc là giá trị trung bình qua một bộ kiểm thử cố định vốn không được thiết kế để tách riêng cặp đối đầu này. Không có lần chạy nào mà DeepSeek V4.1 Flash và GPT-6 Astra được đánh giá trên cùng các tác vụ, cùng scaffold, cùng thiết lập nỗ lực, rồi được công bố kèm phương sai.
Ba điều cụ thể sẽ thay đổi cục diện, và không điều nào trong số đó tồn tại ở thời điểm hiện tại.
• Một so sánh DeepSWE có kiểm soát scaffold.Khoảng chênh 8,7 điểm giữa các scaffold của chính DeepSeek còn lớn hơn mọi khoảng cách giữa bốn mô hình dẫn đầu trên bảng xếp hạng. Cho đến khi năng lực tiên phong được đo trên cùng một harness, thứ tự ở phần đầu bảng đó vẫn không có ý nghĩa.
• Một bản tái tạo độc lập kết quả của nhóm agent ProgramBench. Con số 30,04% đến từ báo cáo kỹ thuật của nhà cung cấp trên một tập con 172 tác vụ đã được lọc, trong một cấu hình sơ bộ, với chi phí token chưa được mô tả đặc trưng cho các ngân sách production.
• ARC-AGI. Không hề tồn tại điểm số nào cho checkpoint này.
Hệ quả thực tiễn là một tuyên bố hẹp hơn mức mà các tiêu đề có thể biện hộ. DeepSeek V4.1 Flash có thể đo được là nằm trong ngưỡng nhiễu so với các mô hình tiên phong trên một bài đánh giá lập trình tầm xa, thực sự có sức cạnh tranh trên các nhiệm vụ thiết kế độc lập với chi phí chỉ khoảng 1,4%, và kém khoảng mười điểm trên một chỉ số tổng hợp. Điều đó đủ để biện minh cho việc chạy nó đối chiếu với khối lượng công việc của chính bạn và để đánh giá của bạn phân xử câu hỏi. Điều đó không đủ để biện minh cho việc viết lại một bảng định tuyến production chỉ dựa trên 0,2 điểm — và việc cả hai nhận định đó đều đúng chính là toàn bộ phát hiện.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
