
DeepSeek V4 Flash Vision (Exp) ra mắt trên API: Cùng mức giá với V4-Flash, giờ đã có đôi mắt
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
DeepSeek V4 Flash Vision (Exp) đã chính thức ra mắt trên nền tảng API của DeepSeek hôm nay, ngày 21 tháng 8 năm 2026, và con số quan trọng nhất trong thông báo không phải là một benchmark — mà chính là mức giá: mô hình thị giác thử nghiệm này được tính phí với đúng cùng mức token như DeepSeek V4 Flash, mô hình chỉ xử lý văn bản mà nó tương đương hoàn toàn về năng lực văn bản thuần túy. Điều này đánh dấu lần đầu tiên API của chính DeepSeek chấp nhận hình ảnh, và có nghĩa là cách rẻ nhất để vận hành một agent có ngữ cảnh 1M giờ đã trở thành đa phương thức mà không phải trả thêm phí.
Những gì thực sự đã được phát hành
DeepSeek V4 Flash Vision (Exp) là một mô hình đa phương thức thử nghiệm, được truy cập bằng ID mô hình deepseek-v4-flash-vision-exp. Nó nhận đầu vào là văn bản và hình ảnh, xuất ra văn bản, trong cửa sổ ngữ cảnh 1M token với đầu ra tối đa 384K, ở cả chế độ suy luận và không suy luận. Nó hỗ trợ định dạng Chat Completions, Messages kiểu Anthropic và định dạng Responses, bộ ba mà một khung tác nhân cần để kết nối nó mà không cần bộ chuyển đổi tùy chỉnh.
Về đầu vào hình ảnh, DeepSeek chấp nhận JPEG, PNG, GIF và WebP, được truyền theo ba cách: base64 nội tuyến, một URL bên ngoài, hoặc một tệp được tải lên qua Files API mới. Hiện chưa có đầu vào video hoặc âm thanh — "tầm nhìn" ở đây chỉ dành cho ảnh tĩnh.

Định vị của chính DeepSeek, trong ghi chú phát hành của họ: khả năng văn bản thuần túy — tác nhân, suy luận, kiến thức thế giới — ngang bằng với bản phát hành chính thức DeepSeek V4 Flash, trong khi khả năng tác nhân đa phương thức có bước nhảy vọt lớn và tiến gần đến Opus-4.8. Đó là tuyên bố của nhà cung cấp, chưa được tái lập, và đáng đọc kỹ, vì chi tiết điểm chuẩn đằng sau nó thú vị hơn tiêu đề.
Vì sao cú nhảy điểm chuẩn lớn hơn so với vẻ bề ngoài
Tất cả các số liệu dưới đây đều do DeepSeek tự công bố trong ghi chú ra mắt hôm nay, chưa được xác minh độc lập. Trên các benchmark agent có nhúng ảnh chụp màn hình và hình ảnh, phiên bản chỉ văn bản DeepSeek V4 Flash không đọc chúng — nó chỉ đơn giản bỏ qua các phần đa phương thức của nhiệm vụ. DeepSeek V4 Flash Vision (Exp) thực sự nhìn vào, đó là lý do vì sao các chênh lệch lớn đến vậy:
• ApexBench Pass@1 — Vision-Exp 36.5 so với V4-Flash 26.2 (Opus-4.8 39.4)
• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)
Terminal-Bench 2.1 — Vision-Exp 83.9 so với V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 so với V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 so với V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3 (phiên bản V4-Flash chỉ văn bản không thể thử được)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash bản chỉ văn bản không thể thử được)

Hai con số trong số đó đáng được nhìn lại. Trên Agents' Last Exam, Vision-Exp (27.3) nhỉnh hơn Opus-4.8 (25.7), và trên DeepSWE nó cũng vượt qua Opus-4.8 (59.3 so với 58.0). Đó chính là điều mà "gần bằng Opus-4.8" thực sự dựa vào — không phải một kết quả nổi bật duy nhất, mà là một nhóm các benchmark tác nhân, nơi việc nhìn thấy màn hình thu hẹp phần lớn khoảng cách với mô hình đa phương thức hàng đầu, trong khi có mức giá thấp hơn khoảng một bậc độ lớn.
Giá của một hình ảnh, chính xác đến từng số thập phân
Hình ảnh được token hóa để tính phí — tối đa 384 token cho mỗi ảnh — và sau đó được tính theo mức giá mỗi token giống như DeepSeek V4 Flash. Vì DeepSeek đã chuyển tất cả các mô hình của mình sang mức giá cao điểm/ngoài cao điểm vào ngày 16 tháng 8 năm 2026, con số chính xác phụ thuộc vào thời điểm bạn gọi:
• Đầu vào, cache miss — $0,22 mỗi 1 triệu token ngoài giờ cao điểm, $0,44 giờ cao điểm
Đầu vào, trúng cache — 0,007 USD mỗi 1 triệu token ngoài giờ cao điểm, 0,014 USD giờ cao điểm
• Đầu ra — $0,66 mỗi 1M token ngoài giờ cao điểm, $1,32 giờ cao điểm
• Giờ cao điểm — 01:00–04:00 và 06:00–10:00 UTC (tất cả các giờ khác là giờ thấp điểm)
Làm phép tính, và chi phí cho thị giác gần như biến mất. Một hình ảnh ở mức tối đa 384 token có giá khoảng 0.0085 cent vào giờ thấp điểm và 0.017 cent vào giờ cao điểm, khi dùng làm đầu vào. Một tác nhân đọc 50 ảnh chụp màn hình trong một lần chạy sẽ thêm khoảng nửa cent token đầu vào — trước khi mô hình viết token đầu ra đầu tiên. DeepSeek cũng giới hạn độ phân giải trước khi suy luận: mức chi tiết thấp được thay đổi kích thước thành 512×512, còn mức cao/nguyên bản thì được chia tỷ lệ trước (ảnh nhỏ lên đến khoảng 384×384, ảnh lớn xuống còn khoảng 800×800), vì vậy ảnh gốc độ phân giải cao không bao giờ được đưa vào mô hình với số pixel gốc của nó.
Dàn diễn viên phụ: một Files API miễn phí và Harness 0.1.1
Hai thành phần hạ tầng được phát hành cùng với mô hình. Files API đã hoạt động và miễn phí: tải lên một hình ảnh một lần, tham chiếu bằng file_id và tái sử dụng qua nhiều yêu cầu mà không cần gửi lại các byte — điều này có ý nghĩa đối với một tác tử duyệt web giữ trang trong ngữ cảnh qua nhiều lượt. Và DeepSeek Harness 0.1.1, phát hành cùng ngày, hỗ trợ sẵn mô hình mới, nên harness dùng để benchmark và vận hành các tác vụ tác tử DeepSeek có thể nhắm tới nó ngay lập tức.
Lưu ý về sản xuất, nói một cách rõ ràng
Đây là một mô hình thử nghiệm. DeepSeek ghi nhãn rõ ràng nó là như vậy, chưa công bố ngày phát hành chính thức (GA), và khuyến nghị không nên chạy trực tiếp trong sản xuất; kế hoạch đã nêu là sẽ tiếp tục cải thiện dựa trên phản hồi và phát hành phiên bản ổn định sau này. Hệ quả thực tế là bộ não văn bản đã được chứng minh — nó là cùng một họ trọng số hỗ trợ V4-Flash — nhưng phần thị giác là mã mới, và không ai ngoài DeepSeek đã thử sức chịu tải của nó ở quy mô lớn.
Đó chính xác là tình huống mà một lớp định tuyến phát huy giá trị của nó. Trên OrcaRouter, cả {{1}}deepseek/deepseek-v4-flash-vision-exp{{/1}} và {{2}}deepseek/deepseek-v4-flash{{/2}} đều đang hoạt động sau một API duy nhất, với giá niêm yết của {{3}}DeepSeek{{/3}} được chuyển tiếp nguyên vẹn, không cộng thêm phí. Bạn có thể hướng lưu lượng chứa hình ảnh đến mô hình thử nghiệm và, trong cùng một cấu hình, thiết lập chuyển đổi dự phòng tự động sang một phương án dự phòng ngay khi mô hình gặp lỗi hoặc hết thời gian chờ — điều này giúp giảm rủi ro cho toàn bộ vấn đề "mã mới". DSL định tuyến cũng cho phép bạn chỉ gửi các cuộc gọi thực sự chứa hình ảnh đến mô hình thị giác và giữ lưu lượng văn bản thuần túy trên {{4}}DeepSeek V4 Flash{{/4}}, qua đó gặt hái những lợi ích về điểm chuẩn ở những nơi chúng tồn tại và không phải trả thêm chi phí nào ở những nơi chúng không tồn tại.

Xem gì tiếp theo
Các câu hỏi mở là những câu hỏi quen thuộc cho một đợt ra mắt thử nghiệm. Khi nào DeepSeek V4 Flash Vision (Exp) đạt GA, và giá có được giữ nguyên không? Liệu đầu vào video hoặc âm thanh có theo sau không — hiện tại mô hình chỉ xử lý ảnh tĩnh, điều này khiến các mô hình biên đa phương thức lớn không gặp đối thủ trên nội dung chuyển động. Và các đánh giá độc lập (lần chạy bên thứ ba đầu tiên trên ApexBench hoặc Terminal-Bench) có tái tạo được các con số đã công bố không? Điều thú vị là ngay cả khi mọi điểm chuẩn đều đi xuống, tuyên bố vốn đã hiệu quả về chi phí — thị giác với giá văn bản — là một thực tế về giá chứ không phải tuyên bố điểm chuẩn, và điều đó không cần phải tái tạo.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
