Karta tytułowa hero dla 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash' z podtytułem 'Ta sama cena, jedno widzi', ikona linii oka po lewej stronie i ikona linii dokumentu tekstowego po prawej stronie oddzielone cienkim neutralnym separatorem, oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) kontra DeepSeek V4 Flash: Ta sama cena, jedno widzi

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

DeepSeek V4 Flash Vision (Exp) i DeepSeek V4 Flash to ten sam model, który różni się dokładnie jedną rzeczą — a ta różnica jest całym sednem sprawy: model wizyjny widzi obrazy, a model tekstowy nie. Udostępniony dziś, 21 sierpnia 2026 roku, jako wydanie eksperymentalne, DeepSeek V4 Flash Vision (Exp) zachowuje tekstowy mózg DeepSeek V4 Flash bez zmian — ten sam kontekst 1M tokenów, to samo maksymalne wyjście 384K, te same ceny tokenów — i dodaje wejście obrazowe, które przetasowuje jego wyniki w benchmarkach agentowych, gdzie model tekstowy po cichu zawodzi. Jedyne prawdziwe pytanie brzmi, czy „eksperymentalność" kosztuje więcej, niż oszczędza.

Te dwa modele

DeepSeek V4 Flash to oficjalny budżetowy koń roboczy firmy: model Mixture-of-Experts z około 284B parametrów łącznie i 13B aktywnymi, tylko tekstowy, zoptymalizowany pod kątem codziennych obciążeń o wysokiej współbieżności, z budżetem współbieżności 2500 tokenów na sekundę w API dostawcy. DeepSeek V4 Flash Vision (Exp) to ta sama rodzina wag z enkoderem wizyjnym z przodu, wyceniony identycznie i oznaczony jako eksperymentalny. Wszystko poniżej oczu jest wspólne.

• Parametry — Vision-Exp: 284B łącznie / 13B aktywnych MoE vs V4-Flash: 284B łącznie / 13B aktywnych MoE (ta sama rodzina)

• Dane wejściowe — Vision-Exp: tekst + obrazy (JPEG, PNG, GIF, WebP) vs V4-Flash: tylko tekst

• Kontekst — Vision-Exp: 1M tokenów vs V4-Flash: 1M tokenów

• Maksymalne wyjście — Vision-Exp: 384K tokenów vs V4-Flash: 384K tokenów

• Tryby myślenia — oba obsługują myślenie i brak myślenia

• Formaty API — oba: Chat Completions, Messages, Responses

• Cena — identyczna (oba rozliczane według stawek tokenów V4-Flash w szczycie i poza szczytem)

• Status — Vision-Exp: eksperymentalna, brak daty GA vs V4-Flash: oficjalne wydanie (V4-Flash-0731)

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Gdzie wizja zmienia wynik

W czystym tekście Deep​Seek twierdzi, że oba są na równym poziomie i nie ma powodu, by w to wątpić — model wizyjny jest zbudowany na tej samej zdolności tekstowej. Rozbieżność pojawia się w benchmarkach agentowych, które zawierają zrzuty ekranu, wykresy i obrazy interfejsów, gdzie model działający wyłącznie na tekście dosłownie ignoruje treści multimodalne. Wszystkie poniższe liczby pochodzą z dzisiejszej noty wydawniczej producenta i nie zostały niezależnie odtworzone:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2

Agents' Last Exam — Vision-Exp 27.3 kontra V4-Flash 25.2

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7

• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4

• Chartography — Vision-Exp 64.3 (V4-Flash nie może podjąć próby)

• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash nie może podjąć próby)

A two-column comparison scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash — the scoreboard': left column DeepSeek-V4-Flash-Vision-Exp — Input text + image, Context 1M tokens, Max output 384K, ApexBench Pass@1 36.5, Price $0.22/M off-peak, Status experimental; right column DeepSeek-V4-Flash — Input text only, Context 1M tokens, Max output 384K, ApexBench Pass@1 26.2, Price $0.22/M off-peak, Status official release; footer 'Benchmark figures vendor-reported; pricing per DeepSeek API docs.'

Największy pojedynczy skok to ApexBench, gdzie dodanie widzenia podnosi wynik z 26.2 do 36.5 — zmiana o dziesięć punktów, która nie wynika z głębszego myślenia modelu, ale z tego, że w końcu czyta zadanie. Dla agenta, który działa przez ekran — przeglądarkę, pulpit, terminal z wyrenderowanym wyjściem — model tekstowy był ślepy dokładnie na te części zadania, które niosą informację.

Pytanie o cenę ma jedną odpowiedź.

Nie ma różnicy w cenie i to jest miejsce, gdzie porównanie staje się oczywistym wyborem w jedną stronę. DeepSeek V4 Flash Vision (Exp) pobiera dokładnie takie same stawki jak DeepSeek V4 Flash, które od 16 sierpnia 2026 r. obowiązują w systemie szczyt/poza szczytem:

• Wejście, brak trafienia w pamięci podręcznej — 0,22 USD za 1M tokenów poza szczytem, 0,44 USD w szczycie (oba modele)

• Wejście, trafienie w cache — 0,007 USD za 1 mln tokenów poza szczytem, 0,014 USD w szczycie (oba modele)

Output — 0,66 USD za 1 mln tokenów poza szczytem, 1,32 USD w szczycie (oba modele)

• Godziny szczytu — 01:00–04:00 i 06:00–10:00 UTC, oba modele

Jedynym dodatkowym kosztem, jaki wnosi wizja, jest sam obraz: każdy obraz jest tokenizowany do maksymalnie 384 tokenów, więc zrzut ekranu kosztuje około 0,0085 centa poza godzinami szczytu. Nawet agent mocno oparty na wizji, czytający 50 obrazów na jedno uruchomienie, dodaje mniej niż cent do kosztu wejścia. Wybór modelu tekstowego, by oszczędzić pieniądze, to wybieranie groszy zamiast wzroku — ta oszczędność nie jest realna.

Kiedy co wybrać

Wybierz DeepSeek V4 Flash Vision (Exp), jeśli Twój pipeline może kiedykolwiek otrzymać obraz. Agenci testowania UI i kontroli jakości opartej na zrzutach ekranu, agenci przeglądający sieć, którzy muszą odczytać stronę, na której się znajdują, ekstrakcja wykresów i diagramów, zrzuty ekranu dokumentów, przechwytywanie komunikatów o błędach z ekranu użytkownika — w każdym z tych przypadków model wizyjny jest zdecydowanie lepszym modelem w tej samej cenie. Według dostawcy nie ma utraty jakości tekstu, więc jedynym powodem, aby go nie używać, jest stabilność.

Wybierz DeepSeek V4 Flash, jeśli Twój ruch to czysty tekst i nic się w nim nie zmieni. W przypadku uzupełniania kodu, wyszukiwania i pętli agentów tylko tekstowych oba modele osiągają te same wyniki w tekście, a oficjalna wersja jest z definicji bezpieczniejszym wyborem. Jeśli już używasz V4-Flash i nigdy nie wysyłasz obrazów, nie ma powodu, aby przechodzić na inny — ani powodu, aby nie mieć tej opcji w konfiguracji routingu.

Jedyna prawdziwa różnica: status eksperymentalny

Wszystko powyżej oczu jest identyczne; koszt widzenia jest znikomy; benchmarki przemawiają na korzyść modelu wizyjnego. Jedynym czynnikiem, który może w uzasadniony sposób zatrzymać cię przy DeepSeek V4 Flash w produkcji, jest to, że model wizyjny jest eksperymentalny. Deep​Seek tak go oznacza, nie podaje daty GA i mówi, że nie jest zalecany do użytku produkcyjnego. Stojący za nim mózg tekstowy jest sprawdzony, ale ścieżka wizyjna jest nowa, a eksperymentalna powierzchnia API jest dokładnie tym miejscem, w którym nie chcesz cichej awarii o 2 w nocy.

To jedyne miejsce, w którym o porównaniu nie przesądzają specyfikacje, i zarazem jedyne, w którym router zmienia odpowiedź. Na OrcaRouter oba modele są aktywne — deepseek/deepseek-v4-flash-vision-exp i deepseek/deepseek-v4-flash — za jednym kluczem API, w cenie katalogowej dostawcy, przekazywanej dalej bez żadnej marży. Ponieważ oba modele są kierowane przez tę samą platformę, możesz wdrożyć model wizyjny tam, gdzie się opłaca, a resztę przypiąć do oficjalnej wersji, z automatycznym failover, dzięki któremu eksperymentalna usterka nigdy nie powali całego potoku. Zyskujesz dziesięciopunktową poprawę w ApexBench na wywołaniach, które tego potrzebują, i stabilność oficjalnej wersji na tych, które nie potrzebują — bez drugiej umowy ani drugiej ścieżki kodu.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text', a price block of $0.15 input / $0.29 output per 1M tokens with p50 TTFT 602 ms, and the model description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context'.

Sedno sprawy

Jeśli Twoje obciążenie może przyjmować obrazy, {{1}}DeepSeek V4 Flash Vision (Exp) pokonuje DeepSeek V4 Flash{{/1}} na każdej osi, która ma znaczenie, i przegrywa tylko na tej jednej, którą można obejść inżynieryjnie: {{2}}status eksperymentalny{{/2}}. Jeśli Twoje obciążenie jest czysto tekstowe, modele są równe pod względem wyników, a oficjalna wersja wygrywa stabilnością. Te dwa modele właściwie ze sobą nie konkurują — {{3}}model wizyjny to model tekstowy z odblokowaną umiejętnością, bez dodatkowych kosztów{{/3}}. Jedyna decyzja, którą warto podjąć, to ile ruchu chcesz skierować na eksperymentalne API, a to jest {{4}}decyzja o routingu, a nie decyzja o modelu{{/4}}.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube