
DeepSeek V4 Flash Vision (Exp) 於 API 上線:價格與 V4-Flash 相同,現在有眼睛了
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
DeepSeek V4 Flash Vision (Exp) 於今日(2026年8月21日)在 DeepSeek API 平台上正式上線,而這項公告中最重要的數字並非基準測試分數——而是價格:這款實驗性視覺模型以與 DeepSeek V4 Flash 完全相同的 token 費率計費,後者是純文字的主力模型,而該視覺模型在純文字能力上與其完全匹敵。這使得 DeepSeek 自家 API 首次接受圖片輸入,也意味著運行 1M 上下文 agent 的最便宜方式,如今免費升級為多模態。
實際發佈的內容
DeepSeek V4 Flash Vision (Exp) 是一個實驗性的多模態模型,使用模型 ID deepseek-v4-flash-vision-exp 進行存取。它接受文字和圖像輸入並產生文字輸出,可在 1M token 的上下文視窗中運作,最大輸出為 384K,並支援思考與非思考兩種模式。它支援 Chat Completions 格式、Anthropic 風格的 Messages,以及 Responses 格式,這三種格式正是代理框架將其接入、無需自訂適配器所需的組合。
在影像輸入方面,DeepSeek 接受 JPEG、PNG、GIF 和 WebP,可透過三種方式傳遞:內嵌 base64、外部 URL,或透過新的 Files API 上傳檔案。目前尚不支援影片或音訊輸入——這裡的「視覺」僅限於靜態圖片。

DeepSeek 在發布說明中對自身的定位:純文字能力——代理、推理、世界知識——與官方 DeepSeek V4 Flash 發布版相當,而多模態代理能力則有重大躍進,接近 Opus-4.8。這是廠商的說法,未經複現,值得仔細閱讀,因為其背後的基準測試細節比標題更有趣。
為何基準跳升的幅度比表面看起來更大
以下所有數據均為 DeepSeek 自行發布,刊載於今日的發布說明中,未經獨立驗證。在嵌入截圖與圖像的智能體基準測試中,純文字的 DeepSeek V4 Flash 不會讀取它們——它只是忽略任務中的多模態部分。DeepSeek V4 Flash Vision (Exp) 確實會查看,這就是為什麼差異如此之大:
• ApexBench Pass@1 — Vision-Exp 36.5 對比 V4-Flash 26.2(Opus-4.8 39.4)
• 代理最終考試 — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7(Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 對比 V4-Flash 54.2(Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 對比 V4-Flash 54.4(Opus-4.8 58.0)
• 圖表繪製 — Vision-Exp 64.3(純文字版 V4-Flash 無法嘗試)
• ZeroBench Pass@5 — Vision-Exp 35.0(僅文字版的 V4-Flash 無法嘗試)

這些數字中有兩個值得再看一眼。在 Agents' Last Exam 中,Vision-Exp(27.3)以些微差距勝過 Opus-4.8(25.7);在 DeepSWE 上它也擊敗了 Opus-4.8(59.3 對 58.0)。這正是「接近 Opus-4.8」這個說法的實際依據——不是單一一個亮眼成績,而是一系列 agentic 基準測試:在這些測試中,能看見螢幕讓它縮短了與前沿多模態模型之間的大部分差距,同時在價格上卻低了約一個數量級。
一張圖像的成本,精確到小數點
圖片會以 token 方式計費——每張最多 384 個 token——然後以與 DeepSeek V4 Flash 相同的每 token 費率收費。由於 DeepSeek 已於 2026 年 8 月 16 日將其所有模型改為尖峰/離峰定價,因此確切數字取決於您呼叫的時間:
• 輸入,快取未命中 — 離峰時段每 1M tokens 0.22 美元,尖峰時段 0.44 美元
輸入,快取命中 — 離峰時段每 100 萬個 token 為 $0.007,尖峰時段為 $0.014
• 輸出 — 離峰時段每 1M tokens 為 $0.66,尖峰時段為 $1.32
• 尖峰時段 — 01:00–04:00 和 06:00–10:00 UTC(其他所有時段皆為離峰)
算一下這筆帳,視覺的成本幾乎就消失了。一張影像在 384 token 的上限下,作為輸入,離峰時約為 0.0085 美分,尖峰時約為 0.017 美分。一個在單次執行中讀取 50 張截圖的 agent,會增加大約半美分的輸入 token——甚至在模型寫出第一個輸出 token 之前。DeepSeek 也會在推理前限制解析度:低細節等級會調整為 512×512,而高/原始則會預先縮放影像(小圖放大至約 384×384,大圖縮小至約 800×800),因此高解析度原始影像永遠不會以原生像素數量輸入模型。
配角阵容:免费的 Files API 和 Harness 0.1.1
{{1}}與模型一同發布的兩項基礎設施。{{/1}}{{2}}Files API 已上線且免費:{{/2}}{{3}}只需上傳圖片一次,即可透過 file_id 引用,並在多次請求間重複使用,無需重複傳送位元組資料{{/3}}{{4}}——對於跨多輪對話將頁面保持在上下文中的瀏覽代理而言,這極具意義。{{/4}}{{5}}同日發布的 DeepSeek Harness 0.1.1 對新模型提供開箱即用的支援,{{/5}}{{6}}因此,這套用於評測並驅動 DeepSeek 代理型工作負載的 Harness 可立即鎖定該模型。{{/6}}
生產警告,直言不諱
這是一個實驗性模型。DeepSeek 明確地將其標示為實驗性模型,尚未公布 GA 日期,並建議不要直接在生產環境中執行;其公布的計畫是根據回饋持續迭代,之後再推出穩定版本。實際的結果是,文字大腦已經過驗證——它與驅動 V4-Flash 的是同一權重系列——但視覺路徑則是全新程式碼,除了 DeepSeek 內部之外,尚未有人對其進行大規模壓力測試。
這正是路由層發揮其價值的場景。在 OrcaRouter 上,deepseek/deepseek-v4-flash-vision-exp 與 deepseek/deepseek-v4-flash 皆同時透過單一 API 上線,以 DeepSeek 的目錄價格原價轉傳、零加成。你可以將帶圖片的流量指向實驗模型,並在同一份設定中,讓它在出錯或逾時的瞬間自動容錯移轉至備援模型——這就化解了整個「新程式碼」的風險。路由 DSL 也讓你能只把真正包含圖片的呼叫送往視覺模型,並讓純文字流量繼續留在 DeepSeek V4 Flash,在基準測試確有增益之處取得成果,在沒有增益之處則不多付任何費用。

接下來要看什麼
開放性問題是實驗性發佈常見的那些。DeepSeek V4 Flash Vision (Exp) 何時達到 GA,價格是否維持?影片或音訊輸入是否跟進——該模型目前僅支援靜態圖片,這讓大型多模態前沿模型在動態媒體上毫無對手。獨立評測(首次第三方在 ApexBench 或 Terminal-Bench 上執行)能否重現已公佈的數據?有趣的是,即使所有基準測試結果都下滑,「以文字價格提供視覺能力」這項主張本身已經是成本效益上的事實,而非基準測試的宣稱,因此無需重現驗證。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
