DeepSeek-V4-Flash-Vision-Exp 用のヒーロータイトルカード。サブタイトルは「V4-Flash と同じ価格、今度は目つき付き」。目と値札のラインアイコン、「EXPERIMENTAL • API • 2026-08-21」と書かれた小さな角丸バッジ、右下隅には OrcaRouter のロゴ。
Guides & Insights

DeepSeek V4 Flash Vision (Exp) がAPIでリリース: V4-Flashと同じ価格で、しかも視覚機能付き

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

DeepSeek V4 Flash Vision (Exp) は、本日2026年8月21日にDeep​Seek APIプラットフォームで公開されました。この発表で最も重要な数字はベンチマークではなく、価格です。この実験用ビジョンモデルは、テキスト専用の主力モデルであるDeepSeek V4 Flashとまったく同じトークンレートで課金され、その純テキスト性能にも完全に匹敵します。これにより、Deep​Seek自身のAPIが画像を初めて受け入れることになり、1Mコンテキストのエージェントを実行する最も安価な方法が、無料でマルチモーダルになったことを意味します。

実際に出荷されたもの

DeepSeek V4 Flash Vision (Exp) は実験的なマルチモーダルモデルであり、モデルID deepseek-v4-flash-vision-exp でアクセスされます。テキストと画像を入力として受け取り、テキストを出力します。1Mトークンのコンテキストウィンドウと最大384Kの出力を備え、思考モードと非思考モードの両方に対応します。Chat Completions形式、AnthropicスタイルのMessages、Responses形式をサポートしており、これらはエージェントフレームワークがカスタムアダプターなしで接続するために必要な3つの形式です。

画像入力に関して、Deep​Seek は JPEG、PNG、GIF、WebP を受け付けます。渡し方は3通りあります: base64インライン、外部URL、または新しい Files API を通じてアップロードされたファイルです。まだビデオやオーディオの入力はありません — ここでの「ビジョン」は静止画のみです。

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

DeepSeek自身のポジショニングは、そのリリースノートによれば、純テキスト能力(エージェント、推論、世界知識)は公式のDeepSeek V4 Flashリリースと同等であり、マルチモーダルエージェント能力は大幅に飛躍してOpus-4.8に肉薄するというものだ。これはベンダーの主張であり、未検証のものなので、注意深く読む価値がある。その背後にあるベンチマークの詳細は、見出しそのものよりも興味深いからだ。

ベンチマークの飛躍が、見た目よりも大きい理由

以下の図はすべてDeepSeek自身によるもので、本日ローンチノートで公開されたものであり、独立して検証されたものではありません。スクリーンショットや画像が埋め込まれたエージェントベンチマークでは、テキストのみのDeepSeek V4 Flashはそれらを読み取らず、タスクのマルチモーダル部分を単に無視します。DeepSeek V4 Flash Vision (Exp) は実際に画像を見るため、その差がこれほど大きいのです:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)

• エージェント最終試験 — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 対 V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 対 V4-Flash 54.2(Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 対 V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3(テキスト専用V4-Flashでは試行不可)

• ZeroBench Pass@5 — Vision-Exp 35.0(テキストのみのV4-Flashでは試行できません)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

その数字のうち2つは、もう一度見直す価値がある。Agents' Last Examでは、Vision-Exp(27.3)がOpus-4.8(25.7)をわずかに上回り、DeepSWEでもOpus-4.8(59.3対58.0)を上回っている。「Opus-4.8に近い」という評価の根拠は、まさにこうした点にある。つまり、単一の目玉となる結果ではなく、一連のエージェント型ベンチマークにおいて、画面を見ることがフロンティアのマルチモーダルモデルとの差の大部分を埋めつつ、価格はおよそ一桁安いのである。

画像のコスト、小数点まで。

画像は課金のためにトークン化され(各画像最大384トークン)、その後はDeepSeek V4 Flashと同じトークン単価で課金されます。DeepSeekは2026年8月16日に全モデルをピーク/オフピーク価格に移行したため、正確な金額は呼び出しのタイミングによって異なります。

• 入力、キャッシュミス — オフピーク時は100万トークンあたり$0.22、ピーク時は$0.44

入力、キャッシュヒット — $0.007 / 1Mトークン(オフピーク時)、$0.014(ピーク時)

• 出力 — オフピーク時は100万トークンあたり$0.66、ピーク時は$1.32

• ピーク時間帯 — UTC 01:00~04:00 および 06:00~10:00(その他の時間帯はオフピーク)

計算してみれば、ビジョンのコストはほぼ消え去る。384トークンの上限における1枚の画像は、入力としてオフピーク時で約0.0085セント、ピーク時で0.017セントだ。1回の実行で50枚のスクリーンショットを読むエージェントは、モデルが最初の出力トークンを書くより前に、入力トークンをおよそ0.5セント分追加していることになる。Deep​Seekはまた、推論前に解像度をクランプする:低詳細レベルは512×512にリサイズし、高詳細/オリジナルは画像を事前にスケールする(小さい画像は約384×384まで引き伸ばし、大きい画像は約800×800まで縮小する)。そのため、高解像度のオリジナルがネイティブのピクセル数のままモデルに与えられることは決してない。

脇役:無料のFiles APIとHarness 0.1.1

モデルに同梱される形で、2つのインフラストラクチャがリリースされました。Files APIは現在公開中で、無料で利用できます。画像を一度アップロードすれば、file_idで参照し、バイト列を再送信することなく、複数のリクエスト間で再利用できます。これは、複数ターンにわたってページをコンテキストに保持するブラウジングエージェントにとって大きな意味を持ちます。また、同じ日にリリースされたDeep​Seek Harness 0.1.1は、新しいモデルを標準でサポートしており、Deep​Seekのエージェント型ワークロードをベンチマークおよび駆動するハーネスは、即座にこの新モデルを対象とすることができます。

本番環境に関する注意事項を平易に述べる

これは実験的なモデルです。DeepSeekはそれを明示的にそのように位置づけており、GAの日付は発表しておらず、本番環境での直接実行を推奨していません。表明されている計画は、フィードバックに基づいて反復改良し、後日安定版をリリースすることです。実際的な意味合いとしては、テキストの中核部分は実証済みです。これはV4-Flashを動かしているのと同じ重みファミリーですが、視覚パスは新しいコードであり、DeepSeek外部の誰も大規模なストレステストを行っていません。

これはまさに、ルーティングレイヤーがその価値を発揮する場面です。OrcaRouterでは、deepseek/deepseek-v4-flash-vision-expとdeepseek/deepseek-v4-flashの両方が1つのAPIの背後で稼働しており、Deep​Seekのリスト価格をマークアップなしでそのまま適用しています。画像を含むトラフィックを実験モデルに向け、同じ設定で、エラーやタイムアウトが発生した瞬間にフォールバックへ自動フェイルオーバーするよう構成できます。これにより、「新しいコード」という問題全体のリスクを軽減できます。また、ルーティングDSLを使用すれば、実際に画像を含む呼び出しだけをビジョンモデルに送り、テキストのみのトラフィックはDeepSeek V4 Flashに維持できます。これにより、ベンチマーク上の利得があるところではそれを獲得し、ないところでは余分なコストを支払いません。

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

次に見るもの

未解決の問いは、実験的ローンチにありがちなものばかりだ。DeepSeek V4 Flash Vision (Exp) はいつGAに到達し、価格は維持されるのか。動画や音声の入力は今後続くのか——現状このモデルは静止画のみ対応であり、大規模マルチモーダル基盤モデルは動的メディアにおいて競合のない状態が続いている。そして、第三者による独立評価(ApexBenchやTerminal-Benchでの初の外部実行)は、公表された数値を再現するのか。興味深いのは、仮にすべてのベンチマークが下方に乖離したとしても、すでに費用対効果が示されている主張——テキスト価格でのビジョン対応——は、ベンチマークの主張ではなく価格設定上の事実であり、再現を必要としないという点だ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube