
DeepSeek V4 Flash Vision (Exp) kontra DeepSeek V4 Flash: Ta sama cena, jedno widzi
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
DeepSeek V4 Flash Vision (Exp) i DeepSeek V4 Flash to ten sam model, który różni się dokładnie jedną rzeczą — a ta różnica jest całym sednem sprawy: model wizyjny widzi obrazy, a model tekstowy nie. Udostępniony dziś, 21 sierpnia 2026 roku, jako wydanie eksperymentalne, DeepSeek V4 Flash Vision (Exp) zachowuje tekstowy mózg DeepSeek V4 Flash bez zmian — ten sam kontekst 1M tokenów, to samo maksymalne wyjście 384K, te same ceny tokenów — i dodaje wejście obrazowe, które przetasowuje jego wyniki w benchmarkach agentowych, gdzie model tekstowy po cichu zawodzi. Jedyne prawdziwe pytanie brzmi, czy „eksperymentalność" kosztuje więcej, niż oszczędza.
Te dwa modele
DeepSeek V4 Flash to oficjalny budżetowy koń roboczy firmy: model Mixture-of-Experts z około 284B parametrów łącznie i 13B aktywnymi, tylko tekstowy, zoptymalizowany pod kątem codziennych obciążeń o wysokiej współbieżności, z budżetem współbieżności 2500 tokenów na sekundę w API dostawcy. DeepSeek V4 Flash Vision (Exp) to ta sama rodzina wag z enkoderem wizyjnym z przodu, wyceniony identycznie i oznaczony jako eksperymentalny. Wszystko poniżej oczu jest wspólne.
• Parametry — Vision-Exp: 284B łącznie / 13B aktywnych MoE vs V4-Flash: 284B łącznie / 13B aktywnych MoE (ta sama rodzina)
• Dane wejściowe — Vision-Exp: tekst + obrazy (JPEG, PNG, GIF, WebP) vs V4-Flash: tylko tekst
• Kontekst — Vision-Exp: 1M tokenów vs V4-Flash: 1M tokenów
• Maksymalne wyjście — Vision-Exp: 384K tokenów vs V4-Flash: 384K tokenów
• Tryby myślenia — oba obsługują myślenie i brak myślenia
• Formaty API — oba: Chat Completions, Messages, Responses
• Cena — identyczna (oba rozliczane według stawek tokenów V4-Flash w szczycie i poza szczytem)
• Status — Vision-Exp: eksperymentalna, brak daty GA vs V4-Flash: oficjalne wydanie (V4-Flash-0731)

Gdzie wizja zmienia wynik
W czystym tekście DeepSeek twierdzi, że oba są na równym poziomie i nie ma powodu, by w to wątpić — model wizyjny jest zbudowany na tej samej zdolności tekstowej. Rozbieżność pojawia się w benchmarkach agentowych, które zawierają zrzuty ekranu, wykresy i obrazy interfejsów, gdzie model działający wyłącznie na tekście dosłownie ignoruje treści multimodalne. Wszystkie poniższe liczby pochodzą z dzisiejszej noty wydawniczej producenta i nie zostały niezależnie odtworzone:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2
Agents' Last Exam — Vision-Exp 27.3 kontra V4-Flash 25.2
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7
• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4
• Chartography — Vision-Exp 64.3 (V4-Flash nie może podjąć próby)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash nie może podjąć próby)

Największy pojedynczy skok to ApexBench, gdzie dodanie widzenia podnosi wynik z 26.2 do 36.5 — zmiana o dziesięć punktów, która nie wynika z głębszego myślenia modelu, ale z tego, że w końcu czyta zadanie. Dla agenta, który działa przez ekran — przeglądarkę, pulpit, terminal z wyrenderowanym wyjściem — model tekstowy był ślepy dokładnie na te części zadania, które niosą informację.
Pytanie o cenę ma jedną odpowiedź.
Nie ma różnicy w cenie i to jest miejsce, gdzie porównanie staje się oczywistym wyborem w jedną stronę. DeepSeek V4 Flash Vision (Exp) pobiera dokładnie takie same stawki jak DeepSeek V4 Flash, które od 16 sierpnia 2026 r. obowiązują w systemie szczyt/poza szczytem:
• Wejście, brak trafienia w pamięci podręcznej — 0,22 USD za 1M tokenów poza szczytem, 0,44 USD w szczycie (oba modele)
• Wejście, trafienie w cache — 0,007 USD za 1 mln tokenów poza szczytem, 0,014 USD w szczycie (oba modele)
Output — 0,66 USD za 1 mln tokenów poza szczytem, 1,32 USD w szczycie (oba modele)
• Godziny szczytu — 01:00–04:00 i 06:00–10:00 UTC, oba modele
Jedynym dodatkowym kosztem, jaki wnosi wizja, jest sam obraz: każdy obraz jest tokenizowany do maksymalnie 384 tokenów, więc zrzut ekranu kosztuje około 0,0085 centa poza godzinami szczytu. Nawet agent mocno oparty na wizji, czytający 50 obrazów na jedno uruchomienie, dodaje mniej niż cent do kosztu wejścia. Wybór modelu tekstowego, by oszczędzić pieniądze, to wybieranie groszy zamiast wzroku — ta oszczędność nie jest realna.
Kiedy co wybrać
Wybierz DeepSeek V4 Flash Vision (Exp), jeśli Twój pipeline może kiedykolwiek otrzymać obraz. Agenci testowania UI i kontroli jakości opartej na zrzutach ekranu, agenci przeglądający sieć, którzy muszą odczytać stronę, na której się znajdują, ekstrakcja wykresów i diagramów, zrzuty ekranu dokumentów, przechwytywanie komunikatów o błędach z ekranu użytkownika — w każdym z tych przypadków model wizyjny jest zdecydowanie lepszym modelem w tej samej cenie. Według dostawcy nie ma utraty jakości tekstu, więc jedynym powodem, aby go nie używać, jest stabilność.
Wybierz DeepSeek V4 Flash, jeśli Twój ruch to czysty tekst i nic się w nim nie zmieni. W przypadku uzupełniania kodu, wyszukiwania i pętli agentów tylko tekstowych oba modele osiągają te same wyniki w tekście, a oficjalna wersja jest z definicji bezpieczniejszym wyborem. Jeśli już używasz V4-Flash i nigdy nie wysyłasz obrazów, nie ma powodu, aby przechodzić na inny — ani powodu, aby nie mieć tej opcji w konfiguracji routingu.
Jedyna prawdziwa różnica: status eksperymentalny
Wszystko powyżej oczu jest identyczne; koszt widzenia jest znikomy; benchmarki przemawiają na korzyść modelu wizyjnego. Jedynym czynnikiem, który może w uzasadniony sposób zatrzymać cię przy DeepSeek V4 Flash w produkcji, jest to, że model wizyjny jest eksperymentalny. DeepSeek tak go oznacza, nie podaje daty GA i mówi, że nie jest zalecany do użytku produkcyjnego. Stojący za nim mózg tekstowy jest sprawdzony, ale ścieżka wizyjna jest nowa, a eksperymentalna powierzchnia API jest dokładnie tym miejscem, w którym nie chcesz cichej awarii o 2 w nocy.
To jedyne miejsce, w którym o porównaniu nie przesądzają specyfikacje, i zarazem jedyne, w którym router zmienia odpowiedź. Na OrcaRouter oba modele są aktywne — deepseek/deepseek-v4-flash-vision-exp i deepseek/deepseek-v4-flash — za jednym kluczem API, w cenie katalogowej dostawcy, przekazywanej dalej bez żadnej marży. Ponieważ oba modele są kierowane przez tę samą platformę, możesz wdrożyć model wizyjny tam, gdzie się opłaca, a resztę przypiąć do oficjalnej wersji, z automatycznym failover, dzięki któremu eksperymentalna usterka nigdy nie powali całego potoku. Zyskujesz dziesięciopunktową poprawę w ApexBench na wywołaniach, które tego potrzebują, i stabilność oficjalnej wersji na tych, które nie potrzebują — bez drugiej umowy ani drugiej ścieżki kodu.

Sedno sprawy
Jeśli Twoje obciążenie może przyjmować obrazy, {{1}}DeepSeek V4 Flash Vision (Exp) pokonuje DeepSeek V4 Flash{{/1}} na każdej osi, która ma znaczenie, i przegrywa tylko na tej jednej, którą można obejść inżynieryjnie: {{2}}status eksperymentalny{{/2}}. Jeśli Twoje obciążenie jest czysto tekstowe, modele są równe pod względem wyników, a oficjalna wersja wygrywa stabilnością. Te dwa modele właściwie ze sobą nie konkurują — {{3}}model wizyjny to model tekstowy z odblokowaną umiejętnością, bez dodatkowych kosztów{{/3}}. Jedyna decyzja, którą warto podjąć, to ile ruchu chcesz skierować na eksperymentalne API, a to jest {{4}}decyzja o routingu, a nie decyzja o modelu{{/4}}.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
