
DeepSeek V4 Flash Vision (Exp) pojawia się w API: ta sama cena co V4-Flash, teraz z oczami.
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
DeepSeek V4 Flash Vision (Exp) wystartował dziś na platformie API DeepSeek, 21 sierpnia 2026 roku, a najważniejsza liczba w ogłoszeniu to nie benchmark — to cena: ten eksperymentalny model wizyjny rozliczany jest po dokładnie tych samych stawkach tokenów co DeepSeek V4 Flash, tekstowy koń roboczy, któremu w pełni dorównuje pod względem czysto tekstowych możliwości. To sprawia, że po raz pierwszy własne API DeepSeek w ogóle przyjmuje obrazy, a to oznacza, że najtańszy sposób uruchomienia agenta z kontekstem 1M właśnie stał się multimodalny za darmo.
Co faktycznie zostało wydane
DeepSeek V4 Flash Vision (Exp) to eksperymentalny model multimodalny, dostępny pod identyfikatorem modelu deepseek-v4-flash-vision-exp. Przyjmuje tekst i obrazy na wejściu i generuje tekst na wyjściu, w oknie kontekstowym o długości 1M tokenów i maksymalnym wyjściu 384K, w trybie myślenia i bez myślenia. Obsługuje format Chat Completions, wiadomości w stylu Anthropic oraz format Responses, czyli trio, którego potrzebuje framework agentów, aby podłączyć go bez niestandardowego adaptera.
Podczas wprowadzania obrazu DeepSeek obsługuje formaty JPEG, PNG, GIF i WebP, przekazywane na trzy sposoby: inline w base64, przez zewnętrzny URL lub jako plik wgrany przez nowe API Files. Na razie nie ma obsługi wideo ani audio — „widzenie” tutaj dotyczy wyłącznie nieruchomych obrazów.

Pozycjonowanie samego DeepSeeka, w jego notatce wydawniczej: zdolności czysto tekstowe — agenci, rozumowanie, wiedza o świecie — są na poziomie oficjalnej wersji DeepSeek V4 Flash, podczas gdy zdolności agenta multimodalnego robią ogromny skok i zbliżają się do Opus-4.8. To deklaracja producenta, niezweryfikowana, którą warto przeczytać uważnie, ponieważ szczegóły benchmarków za nią stojące są bardziej interesujące niż sam nagłówek.
Dlaczego skok w benchmarku jest większy, niż się wydaje.
Wszystkie poniższe liczby pochodzą od DeepSeek, opublikowane dziś w notatce dotyczącej premiery, nie zostały niezależnie zweryfikowane. W benchmarkach agentowych, które zawierają zrzuty ekranu i obrazy, DeepSeek V4 Flash obsługujący tylko tekst nie czyta ich — po prostu ignoruje multimodalne części zadania. DeepSeek V4 Flash Vision (Exp) faktycznie patrzy, dlatego różnice są tak duże:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)
• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3 (tekstowa wersja V4-Flash nie może go podjąć)
• ZeroBench Pass@5 — Vision-Exp 35.0 (tekstowy V4-Flash nie może go wykonać)

Dwie z tych liczb zasługują na drugie spojrzenie. W teście Agents' Last Exam model Vision-Exp (27,3) nieznacznie wyprzedza Opus-4.8 (25,7), a w DeepSWE również pokonuje Opus-4.8 (59,3 wobec 58,0). Na tym właśnie opiera się stwierdzenie „blisko Opus-4.8" — nie na pojedynczym spektakularnym wyniku, ale na całej grupie benchmarków agentowych, w których widzenie ekranu niweluje większość dystansu do czołowego modelu multimodalnego, oferując przy tym cenę niższą o niemal rząd wielkości.
Ile kosztuje obraz, co do grosza
Obrazy są tokenizowane do celów rozliczeniowych — do 384 tokenów każdy — a następnie naliczane według tych samych stawek za token co DeepSeek V4 Flash. Ponieważ DeepSeek przeniósł wszystkie swoje modele na ceny szczytowe/pozaszczytowe 16 sierpnia 2026 r., dokładne kwoty zależą od momentu wywołania:
• Wejście, brak trafienia w cache — 0,22 USD za 1 mln tokenów poza szczytem, 0,44 USD w szczycie
• Wejście, trafienie w cache — 0,007 USD za 1 mln tokenów poza szczytem, 0,014 USD w szczycie
• Wyjście — 0,66 USD za 1 mln tokenów poza szczytem, 1,32 USD w szczycie
• Godziny szczytu — 01:00–04:00 i 06:00–10:00 UTC (wszystkie pozostałe godziny poza szczytem)
Zróbmy arytmetykę, a koszt widzenia niemal znika. Jeden obraz przy limicie 384 tokenów to około 0,0085 centa poza szczytem i 0,017 centa w szczycie, jako wejście. Agent, który czyta 50 zrzutów ekranu w jednym przebiegu, dodaje z grubsza pół centa tokenów wejściowych — zanim model w ogóle wygeneruje swój pierwszy token wyjściowy. DeepSeek również ogranicza rozdzielczość przed inferencją: niski poziom szczegółów skaluje do 512×512, a wysoki/originalny wstępnie skaluje obraz (małe do około 384×384, duże zmniejszane do około 800×800), więc oryginał w wysokiej rozdzielczości nigdy nie jest podawany do modelu w natywnej liczbie pikseli.
Obsada drugoplanowa: darmowe API Files i Harness 0.1.1
Wraz z modelem dostarczono dwa elementy infrastruktury. Interfejs Files API jest dostępny i bezpłatny: prześlij obraz raz, odwołuj się do niego przez file_id i wykorzystuj go w kolejnych żądaniach bez ponownego wysyłania bajtów — to istotne dla agenta przeglądającego sieć, który utrzymuje stronę w kontekście przez kilka tur. A DeepSeek Harness 0.1.1, wydany tego samego dnia, oferuje gotowe wsparcie dla nowego modelu, dzięki czemu harness, który benchmarkuje i napędza agentyczne obciążenia DeepSeek, może od razu z niego korzystać.
Zastrzeżenie produkcyjne, ujęte wprost.
To jest eksperymentalny model. DeepSeek wyraźnie oznacza go jako taki, nie ogłosił żadnej daty GA i odradza uruchamianie go bezpośrednio w produkcji; zadeklarowany plan zakłada iterowanie w oparciu o opinie i późniejsze wydanie stabilnej wersji. Praktyczną konsekwencją jest to, że mózg tekstowy jest sprawdzony — to ta sama rodzina wag, która napędza V4-Flash — ale ścieżka wizyjna to nowy kod i nikt poza DeepSeek nie przetestował go na dużą skalę.
To jest dokładnie sytuacja, w której warstwa routingu pokazuje swoją wartość. Na OrcaRouter zarówno deepseek/deepseek-v4-flash-vision-exp, jak i deepseek/deepseek-v4-flash są dostępne za jednym API, po cenie listowej DeepSeek, przekazywanej dalej z zerową marżą. Możesz skierować ruch zawierający obrazy do modelu eksperymentalnego i w tej samej konfiguracji ustawić automatyczne przełączenie awaryjne na model zapasowy w momencie, gdy model zwróci błąd lub przekroczy limit czasu — co zmniejsza ryzyko związane z całym problemem „nowego kodu”. DSL routingu pozwala również wysyłać do modelu wizyjnego tylko te wywołania, które faktycznie zawierają obrazy, a ruch czysto tekstowy kierować na DeepSeek V4 Flash, uzyskując korzyści w benchmarkach tam, gdzie one występują, i nie płacąc nic ekstra tam, gdzie ich nie ma.

Co obejrzeć dalej
Otwarte pytania są typowe dla eksperymentalnej premiery. Kiedy DeepSeek V4 Flash Vision (Exp) osiągnie wersję GA i czy cena się utrzyma? Czy pojawi się wejście wideo lub audio — model obsługuje obecnie wyłącznie statyczne obrazy, co pozostawia duże multimodalne modele frontier bez konkurencji w zakresie ruchomych mediów. Czy niezależne ewaluacje (pierwsze testy zewnętrzne na ApexBench lub Terminal-Bench) odtworzą opublikowane wyniki? Interesujące jest to, że nawet jeśli każdy benchmark odchyli się w dół, jedyne twierdzenie, które już jest opłacalne — wizja w cenach tekstu — jest faktem cenowym, a nie twierdzeniem benchmarkowym, i nie wymaga odtwarzania.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
