「DeepSeek-V4-Flash-Vision-Exp 對比 DeepSeek-V4-Flash」的主視覺標題卡片,副標題為「價格相同,一個看得見」,左側為眼睛線條圖示,右側為文字文件線條圖示,以細中性分隔線隔開,右下角為 OrcaRouter 標誌。
Guides & Insights

DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash:價格相同,一個看得見

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4 Flash Vision (Exp) 與 DeepSeek V4 Flash 是同一款模型,兩者只有一個差異,而這個差異就是全部重點:視覺模型能看圖,文字模型不能。今日(2026 年 8 月 21 日)以實驗性版本推出的 DeepSeek V4 Flash Vision (Exp),完整保留 DeepSeek V4 Flash 的文字大腦——同樣的 100 萬 token 上下文、同樣的 384K 最大輸出、相同的 token 定價——額外再加上影像輸入,重新改寫了它在文字模型表現不佳的代理(agent)評測基準上的成績。唯一真正的問題是:「實驗性」三個字,究竟是讓你省更多,還是花更多。

這兩個模型

DeepSeek V4 Flash 是該公司官方的平價主力模型:這是一個混合專家(Mixture-of-Experts)模型,總參數約 284B,活躍參數約 13B,僅支援文字,針對高並發的日常工作量最佳化,在廠商的 API 上提供每秒 2,500 個 token 的並發額度。DeepSeek V4 Flash Vision (Exp) 是相同權重家族,但在前方加上視覺編碼器,計費方式相同,並標記為實驗性。眼睛以下的部分都是共用的。

• 參數 — Vision-Exp:284B 總計 / 13B 啟用 MoE,對比 V4-Flash:284B 總計 / 13B 啟用 MoE(相同系列)

• 輸入 — Vision-Exp:文字 + 圖片(JPEG、PNG、GIF、WebP)對比 V4-Flash:僅限文字

• 上下文 — Vision-Exp: 1M tokens 對比 V4-Flash: 1M tokens

• 最大輸出 — Vision-Exp:384K tokens,對比 V4-Flash:384K tokens

• 思考模式 — 兩者皆支援思考與非思考

• API 格式 — 兩者:Chat Completions、Messages、Responses

• 價格 — 相同(兩者均按 V4-Flash 的尖峰/離峰 token 費率計費)

• 狀態 — Vision-Exp:實驗性,尚無 GA 日期;V4-Flash:正式發布 (V4-Flash-0731)

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

遠見改寫記分板

在純文字方面,Deep​Seek 表示兩者實力相當,這沒有理由懷疑——視覺模型是基於相同的文字能力建構的。差異體現在包含螢幕截圖、圖表與 UI 圖像的 agent 基準測試上,純文字模型在這些測試中確實忽略了多模態內容。以下所有數據均來自今日發布說明的廠商報告,並非獨立重現:

• ApexBench Pass@1 — Vision-Exp 36.5 對比 V4-Flash 26.2

• Agents' Last Exam — Vision-Exp 27.3 對比 V4-Flash 25.2

• Terminal-Bench 2.1 — Vision-Exp 83.9 對比 V4-Flash 82.7

• NL2Repo — Vision-Exp 57.7 對比 V4-Flash 54.2

• DeepSWE — Vision-Exp 59.3 對比 V4-Flash 54.4

• Chartography — Vision-Exp 64.3(V4-Flash 無法嘗試)

• ZeroBench Pass@5 — Vision-Exp 35.0(V4-Flash 無法嘗試)

A two-column comparison scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash — the scoreboard': left column DeepSeek-V4-Flash-Vision-Exp — Input text + image, Context 1M tokens, Max output 384K, ApexBench Pass@1 36.5, Price $0.22/M off-peak, Status experimental; right column DeepSeek-V4-Flash — Input text only, Context 1M tokens, Max output 384K, ApexBench Pass@1 26.2, Price $0.22/M off-peak, Status official release; footer 'Benchmark figures vendor-reported; pricing per DeepSeek API docs.'

最大的一次躍升是 ApexBench,加入視覺後,分數從 26.2 提高到 36.5——這十點的漲幅不是因為模型思考得更費力,而是因為它終於能讀懂任務。對於一個透過螢幕運作的代理——瀏覽器、桌面、帶有渲染輸出的終端——文字模型在任務中承載資訊的那些部分,完全是兩眼一抹黑。

價格問題只有一個答案。

價格沒有差異,而在這方面,比較結果可說是一面倒的顯而易見。DeepSeek V4 Flash Vision (Exp) 的計費費率與 DeepSeek V4 Flash 完全相同,自 2026 年 8 月 16 日起,這些費率分為尖峰/離峰:

• 輸入,快取未命中 — 離峰時段每 1M tokens $0.22,尖峰時段 $0.44(兩種型號皆同)

輸入,快取命中 — 離峰時段每百萬 tokens 0.007 美元,尖峰時段 0.014 美元(兩種模型皆適用)

輸出 — 離峰時段每 1M tokens 為 $0.66,尖峰時段為 $1.32(兩種模型皆適用)

• 尖峰時段 — 01:00–04:00 與 06:00–10:00 UTC,兩種模型皆適用

視覺功能帶來的唯一額外成本就是影像本身:每張影像最多被標記為384個token,因此一張截圖在離峰時段大約花費0.0085美分。即使是一個重度使用視覺的agent,每次執行讀取50張影像,輸入成本增加也不到1美分。為了省錢而選擇文字模型,等於為了省幾美分而放棄視覺能力——這筆節省並不真實。

何時該選哪一個

如果您的 pipeline 有可能接收到圖片,請選擇 DeepSeek V4 Flash Vision (Exp)。UI 測試與基於截圖的 QA 代理、需要讀取目前所在頁面的網頁瀏覽代理、圖表與圖示提取、文件截圖、從使用者螢幕擷取錯誤訊息——在上述每一種情況中,視覺模型在相同價格下絕對是更出色的選擇。根據供應商表示,文字品質並無折損,因此唯一不採用它的理由只有穩定性。

如果您的流量純為文字,且不會有任何變動,請選擇 DeepSeek V4 Flash。就程式碼補全、檢索與純文字代理迴圈而言,兩個模型在文字方面的得分相同,而官方發布版理所當然是更穩妥的選擇。如果您已經在使用 V4-Flash,而且從不傳送圖片,就沒有理由切換——同樣也沒有理由不在路由設定中加上這個選項。

唯一真正的差異:實驗性狀態

眼睛以上的部分完全一樣;視覺功能的成本可忽略不計;基準測試的結果也偏向視覺模型。唯一能合理讓你在生產環境中繼續使用 DeepSeek V4 Flash 的因素,是視覺模型目前仍屬實驗性質。Deep​Seek 官方將其標記為實驗性,沒有給出正式發佈日期,並聲明不建議用於生產環境。它背後的文字模型核心已獲得驗證,但視覺路徑是全新的,而實驗性的 API 介面恰恰是你不希望在凌晨兩點遇到靜默失敗的地方。

這是唯一一個無法單靠規格表定論的比較點,也是唯一一個路由器會改變答案的地方。在 OrcaRouter 上,兩個模型都是即時可用的——deepseek/deepseek-v4-flash-vision-exp 和 deepseek/deepseek-v4-flash——共用同一組 API 金鑰,以供應商列表價格提供,零加價轉傳。由於同一個平台路由這兩個模型,你可以在視覺模型值得被採用的呼叫上採用它,其餘則鎖定在正式版本上,並具備自動故障轉移,讓實驗性的小問題永遠不會拖垮整個管線。你可以在需要時獲得 ApexBench 十分增益,在不需要時獲得正式版的穩定性,無需第二份合約,也無需第二條程式碼路徑。

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text', a price block of $0.15 input / $0.29 output per 1M tokens with p50 TTFT 602 ms, and the model description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context'.

底線

如果你的工作負載可以接收影像,DeepSeek V4 Flash Vision (Exp) 在每個重要的面向上都勝過 DeepSeek V4 Flash,只在一項你可以透過工程手段繞過的面向落敗:實驗狀態。如果你的工作負載是純文字,這兩個模型在輸出上表現相當,而正式版在穩定性上勝出。這兩者其實並非真正的競爭對手——視覺模型就是文字模型解鎖了一項技能,而且無需額外費用。唯一值得做的決定是,你願意將多少流量指向一個實驗性 API,而那是路由決策,不是模型決策。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube