
DeepSeek V4 Flash Vision (Exp) so với DeepSeek V4 Flash: Cùng mức giá, Một bên nhìn thấy được
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
DeepSeek V4 Flash Vision (Exp) và DeepSeek V4 Flash là cùng một mô hình với chỉ một điểm khác biệt duy nhất, và điểm khác biệt đó chính là toàn bộ câu chuyện: mô hình thị giác nhìn thấy hình ảnh còn mô hình văn bản thì không. Được ra mắt hôm nay, ngày 21 tháng 8 năm 2026, dưới dạng bản phát hành thử nghiệm, DeepSeek V4 Flash Vision (Exp) mang nguyên bộ não văn bản của DeepSeek V4 Flash — cùng ngữ cảnh 1M token, cùng đầu ra tối đa 384K, cùng mức giá token — và bổ sung đầu vào hình ảnh, giúp xáo trộn điểm số của nó trên các điểm chuẩn tác tử nơi mô hình văn bản âm thầm thất bại. Câu hỏi thực sự duy nhất là liệu "thử nghiệm" khiến bạn tốn nhiều hơn là tiết kiệm hay không.
Hai mô hình
DeepSeek V4 Flash là mô hình chủ lực giá rẻ chính thức của công ty: một mô hình Mixture-of-Experts với khoảng 284B tổng tham số và 13B tham số hoạt động, chỉ xử lý văn bản, được tối ưu hóa cho các khối lượng công việc hàng ngày có độ đồng thời cao, với ngân sách đồng thời 2.500 token/giây trên API của nhà cung cấp. DeepSeek V4 Flash Vision (Exp) là cùng một họ trọng số với bộ mã hóa thị giác đặt phía trước, được tính phí giống hệt và được gắn nhãn thử nghiệm. Mọi thứ bên dưới đôi mắt đều được dùng chung.
• Tham số — Vision-Exp: 284B tổng / 13B MoE hoạt động so với V4-Flash: 284B tổng / 13B MoE hoạt động (cùng họ)
• Đầu vào — Vision-Exp: văn bản + hình ảnh (JPEG, PNG, GIF, WebP) so với V4-Flash: chỉ văn bản
• Ngữ cảnh — Vision-Exp: 1M token so với V4-Flash: 1M token
• Đầu ra tối đa — Vision-Exp: 384K token so với V4-Flash: 384K token
• Chế độ suy nghĩ — cả hai đều hỗ trợ suy nghĩ và không suy nghĩ
• Định dạng API — cả hai: Chat Completions, Messages, Responses
• Giá — giống nhau (cả hai đều tính phí theo mức giá token cao điểm/ngoài giờ cao điểm của V4-Flash)
• Trạng thái — Vision-Exp: thử nghiệm, chưa có ngày GA so với V4-Flash: bản phát hành chính thức (V4-Flash-0731)

Nơi tầm nhìn thay đổi bảng tỷ số
Về văn bản thuần túy, DeepSeek cho rằng hai mô hình ngang nhau, và không có lý do gì để nghi ngờ điều đó — mô hình thị giác được xây dựng từ cùng năng lực văn bản. Sự khác biệt thể hiện ở các benchmark agent có chứa ảnh chụp màn hình, biểu đồ và hình ảnh giao diện, nơi mô hình chỉ xử lý văn bản thực sự bỏ qua nội dung đa phương thức. Tất cả các con số dưới đây được nhà cung cấp báo cáo từ thông báo ra mắt hôm nay, không được tái tạo độc lập:
• ApexBench Pass@1 — Vision-Exp 36.5 so với V4-Flash 26.2
• Kỳ thi cuối cùng của Agents — Vision-Exp 27.3 so với V4-Flash 25.2
• Terminal-Bench 2.1 — Vision-Exp 83.9 so với V4-Flash 82.7
• NL2Repo — Vision-Exp 57.7 so với V4-Flash 54.2
DeepSWE — Vision-Exp 59.3 so với V4-Flash 54.4
• Chartography — Vision-Exp 64.3 (V4-Flash không thể thử được)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash không thể thực hiện)

Bước nhảy lớn nhất là ApexBench, nơi việc bổ sung khả năng thị giác đã nâng điểm từ 26,2 lên 36,5 — một cú chuyển biến mười điểm không phải vì mô hình tư duy chăm chỉ hơn, mà vì cuối cùng nó đã đọc được nhiệm vụ. Đối với một tác nhân hoạt động qua màn hình — trình duyệt, máy tính để bàn, thiết bị đầu cuối có đầu ra được kết xuất — mô hình văn bản đã mò mẫm trong bóng tối đúng vào những phần của nhiệm vụ mang thông tin.
Câu hỏi về giá chỉ có một câu trả lời.
Không có sự khác biệt về giá cả, và đây chính là điểm khiến việc so sánh trở nên vô cùng rõ ràng theo một hướng. DeepSeek V4 Flash Vision (Exp) được tính phí với mức giá hoàn toàn giống như DeepSeek V4 Flash, vốn kể từ ngày 16 tháng 8 năm 2026 đã có mức giá cao điểm/ngoài giờ cao điểm như sau:
• Đầu vào, cache miss — $0.22 cho mỗi 1M token ngoài giờ cao điểm, $0.44 giờ cao điểm (cả hai mô hình)
• Đầu vào, cache hit — 0,007 USD cho mỗi 1 triệu token ngoài giờ cao điểm, 0,014 USD vào giờ cao điểm (cả hai mô hình)
Đầu ra — $0.66 mỗi 1M token giờ thấp điểm, $1.32 giờ cao điểm (cả hai mô hình)
• Giờ cao điểm — 01:00–04:00 và 06:00–10:00 UTC, cả hai mô hình
Chi phí bổ sung duy nhất mà thị giác mang lại chính là bản thân hình ảnh: mỗi hình ảnh được token hóa tối đa 384 token, vì vậy một ảnh chụp màn hình tiêu tốn khoảng 0,0085 cent vào giờ thấp điểm. Ngay cả một tác nhân thiên về thị giác đọc 50 hình ảnh mỗi lần chạy cũng chỉ thêm chưa đến một cent chi phí đầu vào. Chọn mô hình văn bản để tiết kiệm tiền là chọn đồng xu thay vì thị lực — khoản tiết kiệm đó không có thật.
Khi nào nên chọn cái nào
Chọn DeepSeek V4 Flash Vision (Exp) nếu pipeline của bạn có thể tiếp nhận hình ảnh trong bất kỳ tình huống nào. Các tác nhân kiểm thử giao diện người dùng và QA dựa trên ảnh chụp màn hình, các tác nhân duyệt web cần đọc trang mình đang truy cập, trích xuất biểu đồ và sơ đồ, ảnh chụp tài liệu, ghi lại thông báo lỗi từ màn hình người dùng — trong mọi trường hợp kể trên, mô hình thị giác là lựa chọn vượt trội hơn hẳn ở cùng mức giá. Theo nhà cung cấp, không có sự hy sinh nào về chất lượng văn bản, nên lý do duy nhất để không dùng nó là tính ổn định.
Chọn DeepSeek V4 Flash nếu lưu lượng của bạn hoàn toàn là văn bản và sẽ không có gì thay đổi. Đối với hoàn thành mã, truy xuất và các vòng lặp agent chỉ dùng văn bản, hai mô hình có điểm số tương đương về văn bản, và bản phát hành chính thức chắc chắn là lựa chọn an toàn hơn. Nếu bạn đã dùng V4-Flash và không bao giờ gửi hình ảnh, không có lý do gì để chuyển đổi — và cũng không có lý do gì để không có tùy chọn đó trong cấu hình định tuyến của bạn.
Sự khác biệt thực sự duy nhất: trạng thái thử nghiệm
Mọi thứ phía trên đôi mắt đều giống hệt nhau; chi phí cho thị giác là không đáng kể; các bài benchmark đều nghiêng về mô hình thị giác. Yếu tố duy nhất có thể hợp lý giữ chân bạn với DeepSeek V4 Flash trong production là mô hình thị giác đang ở giai đoạn thử nghiệm. DeepSeek gắn nhãn nó như vậy, không đưa ra ngày GA, và nói rằng nó không được khuyến nghị sử dụng trong production. Bộ não xử lý văn bản đằng sau nó đã được kiểm chứng, nhưng đường dẫn thị giác còn mới, và một bề mặt API thử nghiệm chính là nơi bạn không muốn có một lỗi thầm lặng lúc 2 giờ sáng.
Đây là nơi duy nhất mà cuộc so sánh không được giải quyết bởi thông số kỹ thuật, và cũng là nơi duy nhất mà một bộ định tuyến thay đổi câu trả lời. Trên OrcaRouter, cả hai mô hình đều hoạt động — deepseek/deepseek-v4-flash-vision-exp và deepseek/deepseek-v4-flash — chỉ với một API key duy nhất theo giá niêm yết của nhà cung cấp, được chuyển qua mà không có bất kỳ khoản phụ phí nào. Vì cùng một nền tảng định tuyến cả hai, bạn có thể áp dụng mô hình thị giác ở những nơi nó phát huy tác dụng và giữ phần còn lại với bản phát hành chính thức, với khả năng chuyển đổi dự phòng tự động để một trục trặc thử nghiệm không bao giờ làm sập toàn bộ pipeline. Bạn nhận được mức tăng mười điểm ApexBench trên các lệnh gọi cần nó và sự ổn định của bản phát hành chính thức trên các lệnh gọi không cần, mà không cần hợp đồng thứ hai hay đường mã thứ hai.

Kết luận
Nếu khối lượng công việc của bạn có thể nhận hình ảnh, DeepSeek V4 Flash Vision (Exp) vượt trội DeepSeek V4 Flash ở mọi khía cạnh quan trọng và chỉ thua ở đúng một khía cạnh mà bạn có thể xoay xở được: trạng thái thử nghiệm. Nếu khối lượng công việc của bạn chỉ thuần văn bản, hai mô hình cho đầu ra tương đương nhau và bản phát hành chính thức thắng về độ ổn định. Hai mô hình này thực chất không phải đối thủ của nhau — mô hình thị giác chính là mô hình văn bản được mở khóa thêm một kỹ năng, mà không tính thêm phí. Quyết định duy nhất đáng cân nhắc là bạn sẵn sàng trỏ bao nhiêu lưu lượng của mình vào một API thử nghiệm, và đó là quyết định về định tuyến, không phải quyết định về mô hình.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
