
DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash:同じ価格、片方は見える
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 150 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1214 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
DeepSeek V4 Flash Vision (Exp) と DeepSeek V4 Flash は、ただ一つだけ違いがある同じモデルであり、その違いこそがすべての要点です。ビジョンモデルは画像を見ることができ、テキストモデルにはそれができません。本日2026年8月21日に実験的リリースとして発表された DeepSeek V4 Flash Vision (Exp) は、DeepSeek V4 Flash のテキスト処理の中核を変更なしで引き継いでいます——同じ100万トークンのコンテキスト、同じ384Kの最大出力、同じトークン価格——その上で、テキストモデルが静かに失敗するエージェントベンチマークのスコアを塗り替える画像入力を追加しています。唯一の本当の疑問は、「実験的」という表示が、節約できる以上にコストをもたらすかどうかです。
2つのモデル
DeepSeek V4 Flashは、同社公式の低コスト主力モデルである。総パラメータ数約284B、アクティブパラメータ13BのMixture-of-Expertsモデルで、テキスト専用、高同時実行の日常的ワークロード向けに最適化されており、ベンダーAPIでは毎秒2,500トークンの同時実行予算を持つ。DeepSeek V4 Flash Vision (Exp)は、同じ重みファミリーの先頭に視覚エンコーダを追加したもので、課金は同一、実験的扱いとされている。視覚エンコーダより下のすべての部分は共通である。
パラメータ — Vision-Exp: 合計284B / アクティブMoE 13B vs V4-Flash: 合計284B / アクティブMoE 13B(同じファミリー)
• 入力 — Vision-Exp: テキスト + 画像 (JPEG、PNG、GIF、WebP) vs V4-Flash: テキストのみ
• コンテキスト — Vision-Exp: 1Mトークン vs V4-Flash: 1Mトークン
• 最大出力 — Vision-Exp: 384Kトークン vs V4-Flash: 384Kトークン
• 思考モード — 両方とも思考と非思考に対応
• API形式 — 両方: Chat Completions、Messages、Responses
• 価格 — 同一(両方ともV4-Flashのピーク/オフピークのトークンレートで課金される)
• ステータス — Vision-Exp: 実験版、GA日未定 vs V4-Flash: 正式リリース (V4-Flash-0731)

ビジョンがスコアボードを変える場所
純粋なテキストに関しては、DeepSeekは両者が同等だと述べており、それを疑う理由はない。ビジョンモデルは同じテキスト能力から構築されているからだ。違いが現れるのは、スクリーンショット、グラフ、UI画像を含むエージェントベンチマークにおいてであり、そこではテキストのみのモデルがマルチモーダルなコンテンツを文字どおり無視する。以下の数値はすべて、本日の発表ノートにおけるベンダー報告によるものであり、独自に再現したものではない。
• ApexBench Pass@1 — Vision-Exp 36.5 対 V4-Flash 26.2
• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7
• NL2Repo — Vision-Exp 57.7 対 V4-Flash 54.2
• DeepSWE — Vision-Exp 59.3 対 V4-Flash 54.4
• Chartography — Vision-Exp 64.3(V4-Flashは試行不可)
• ZeroBench Pass@5 — Vision-Exp 35.0(V4-Flashは試行不可)

最大の飛躍はApexBenchである。視覚を追加することでスコアが26.2から36.5に上昇する——これは10ポイントの変動であり、モデルがより深く考えた結果ではなく、ようやくタスクを読み取れるようになったことを示している。画面(ブラウザ、デスクトップ、レンダリングされた出力を備えたターミナル)を通じて操作するエージェントにとって、テキストモデルは、情報を担うタスクのまさにその部分において手探り状態だったのだ。
価格の問題には一つの答えがある。
料金に差はなく、この点で比較は一方向に明確な優劣がつく。DeepSeek V4 Flash Vision (Exp) は DeepSeek V4 Flash とまったく同じ料金で請求され、その料金は2026年8月16日以降、ピーク時/オフピーク時となっている。
• 入力、キャッシュミス — オフピーク時は1Mトークンあたり$0.22、ピーク時は$0.44(両モデル)
• 入力、キャッシュヒット — オフピーク時は100万トークンあたり$0.007、ピーク時は$0.014(両モデルとも)
出力 — オフピーク時は100万トークンあたり$0.66、ピーク時は$1.32(両モデルとも)
• ピーク時間 — UTC 01:00–04:00 および 06:00–10:00、両モデル
視覚機能がもたらす追加コストは、画像そのものだけです。各画像は最大384トークンにトークン化されるため、スクリーンショット1枚のコストはオフピーク時で約0.0085セントです。1回の実行で50枚の画像を読み取る視覚重視のエージェントでも、入力コストは1セント未満しか増えません。コスト節約のためにテキストモデルを選ぶのは、視覚を犠牲にして小銭を選ぶようなもの——実際の節約にはなりません。
いつ、どちらを選ぶか
パイプラインが画像を受け取る可能性がある場合は、DeepSeek V4 Flash Vision (Exp) を選択してください。UIテストやスクリーンショットベースのQAエージェント、現在表示中のページを読み取る必要があるWebブラウジングエージェント、チャートや図の抽出、ドキュメントのスクリーンショット、ユーザーの画面からのエラーメッセージのキャプチャ — これらすべてにおいて、ビジョンモデルの方が同じ価格で厳密に優れたモデルです。ベンダーによるとテキスト品質の低下はないため、使用しない唯一の理由は安定性です。
トラフィックが純粋なテキストのみで、その内容が今後一切変わらないのであれば、DeepSeek V4 Flash を選択してください。コーディング補完、検索、テキストのみのエージェントループにおいて、両モデルはテキストで同じスコアを記録しており、公式リリースの方が定義上より安全な選択です。すでに V4-Flash を使用していて画像を送信しないのであれば、切り替える理由はありません。また、ルーティング設定にそのオプションを用意しておかない理由もありません。
唯一の本当の違い:実験的な状態
目より上の部分はすべて同一で、ビジョンのコストは無視できるほど小さく、ベンチマークでもビジョンモデルが有利です。本番環境でDeepSeek V4 Flashを使い続けることを正当化できる唯一の要因は、ビジョンモデルが実験的であるということです。DeepSeekはそのように明示し、GAの日程も示さず、本番環境での使用は推奨しないと述べています。その背後にあるテキストの頭脳は実績がありますが、ビジョンの経路は新しく、実験的なAPIサーフェスは、午前2時にサイレント障害が発生してほしくないまさにその場所です。
ここは、比較がスペックだけで決着しない唯一の場所であり、ルーターが答えを変える唯一の場所でもあります。OrcaRouterでは、deepseek/deepseek-v4-flash-vision-expとdeepseek/deepseek-v4-flashの両モデルが、単一のAPIキーの背後でプロバイダの定価のまま提供され、マークアップなしで透過的に利用できます。同じプラットフォームが両方をルーティングするため、ビジョンモデルが力を発揮する場面ではそれを採用し、それ以外は公式リリースに固定できます。さらに自動フェイルオーバーにより、実験的な不具合がパイプライン全体を停止させることはありません。必要な呼び出しでは10ポイントのApexBench向上が得られ、不要な呼び出しでは公式リリースの安定性が得られます。追加の契約も、追加のコードパスも不要です。

結論
ワークロードが画像を受け取れる場合、DeepSeek V4 Flash Vision (Exp) は、重要となるすべての軸で DeepSeek V4 Flash を上回り、唯一敗れるのはエンジニアリングで回避できる軸、すなわち実験的ステータスのみです。ワークロードが純粋なテキストである場合、両モデルの出力は同等であり、公式リリースは安定性の面で勝ります。この2つは実際には競合関係にありません。ビジョンモデルは、テキストモデルにスキルが1つ追加されたものであり、追加コストはかかりません。下す価値のある唯一の判断は、トラフィックのどれだけを実験的APIに向けるかということであり、それはモデルの決定ではなく、ルーティングの決定です。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
