Karta tytułowa hero dla DeepSeek-V4-Flash-Vision-Exp z podtytułem „Ta sama cena co V4-Flash, teraz z oczami”, liniową ikoną oka i metki cenowej, małą zaokrągloną plakietką z napisem „EKSPERYMENTALNY • API • 2026-08-21” oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) pojawia się w API: ta sama cena co V4-Flash, teraz z oczami.

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

DeepSeek V4 Flash Vision (Exp) wystartował dziś na platformie API DeepSeek, 21 sierpnia 2026 roku, a najważniejsza liczba w ogłoszeniu to nie benchmark — to cena: ten eksperymentalny model wizyjny rozliczany jest po dokładnie tych samych stawkach tokenów co DeepSeek V4 Flash, tekstowy koń roboczy, któremu w pełni dorównuje pod względem czysto tekstowych możliwości. To sprawia, że po raz pierwszy własne API DeepSeek w ogóle przyjmuje obrazy, a to oznacza, że najtańszy sposób uruchomienia agenta z kontekstem 1M właśnie stał się multimodalny za darmo.

Co faktycznie zostało wydane

DeepSeek V4 Flash Vision (Exp) to eksperymentalny model multimodalny, dostępny pod identyfikatorem modelu deepseek-v4-flash-vision-exp. Przyjmuje tekst i obrazy na wejściu i generuje tekst na wyjściu, w oknie kontekstowym o długości 1M tokenów i maksymalnym wyjściu 384K, w trybie myślenia i bez myślenia. Obsługuje format Chat Completions, wiadomości w stylu Anthropic oraz format Responses, czyli trio, którego potrzebuje framework agentów, aby podłączyć go bez niestandardowego adaptera.

Podczas wprowadzania obrazu Deep​Seek obsługuje formaty JPEG, PNG, GIF i WebP, przekazywane na trzy sposoby: inline w base64, przez zewnętrzny URL lub jako plik wgrany przez nowe API Files. Na razie nie ma obsługi wideo ani audio — „widzenie” tutaj dotyczy wyłącznie nieruchomych obrazów.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Pozycjonowanie samego Deep​Seeka, w jego notatce wydawniczej: zdolności czysto tekstowe — agenci, rozumowanie, wiedza o świecie — są na poziomie oficjalnej wersji DeepSeek V4 Flash, podczas gdy zdolności agenta multimodalnego robią ogromny skok i zbliżają się do Opus-4.8. To deklaracja producenta, niezweryfikowana, którą warto przeczytać uważnie, ponieważ szczegóły benchmarków za nią stojące są bardziej interesujące niż sam nagłówek.

Dlaczego skok w benchmarku jest większy, niż się wydaje.

Wszystkie poniższe liczby pochodzą od Deep​Seek, opublikowane dziś w notatce dotyczącej premiery, nie zostały niezależnie zweryfikowane. W benchmarkach agentowych, które zawierają zrzuty ekranu i obrazy, DeepSeek V4 Flash obsługujący tylko tekst nie czyta ich — po prostu ignoruje multimodalne części zadania. DeepSeek V4 Flash Vision (Exp) faktycznie patrzy, dlatego różnice są tak duże:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)

• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3 (tekstowa wersja V4-Flash nie może go podjąć)

• ZeroBench Pass@5 — Vision-Exp 35.0 (tekstowy V4-Flash nie może go wykonać)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

Dwie z tych liczb zasługują na drugie spojrzenie. W teście Agents' Last Exam model Vision-Exp (27,3) nieznacznie wyprzedza Opus-4.8 (25,7), a w DeepSWE również pokonuje Opus-4.8 (59,3 wobec 58,0). Na tym właśnie opiera się stwierdzenie „blisko Opus-4.8" — nie na pojedynczym spektakularnym wyniku, ale na całej grupie benchmarków agentowych, w których widzenie ekranu niweluje większość dystansu do czołowego modelu multimodalnego, oferując przy tym cenę niższą o niemal rząd wielkości.

Ile kosztuje obraz, co do grosza

Obrazy są tokenizowane do celów rozliczeniowych — do 384 tokenów każdy — a następnie naliczane według tych samych stawek za token co DeepSeek V4 Flash. Ponieważ DeepSeek przeniósł wszystkie swoje modele na ceny szczytowe/pozaszczytowe 16 sierpnia 2026 r., dokładne kwoty zależą od momentu wywołania:

• Wejście, brak trafienia w cache — 0,22 USD za 1 mln tokenów poza szczytem, 0,44 USD w szczycie

• Wejście, trafienie w cache — 0,007 USD za 1 mln tokenów poza szczytem, 0,014 USD w szczycie

• Wyjście — 0,66 USD za 1 mln tokenów poza szczytem, 1,32 USD w szczycie

• Godziny szczytu — 01:00–04:00 i 06:00–10:00 UTC (wszystkie pozostałe godziny poza szczytem)

Zróbmy arytmetykę, a koszt widzenia niemal znika. Jeden obraz przy limicie 384 tokenów to około 0,0085 centa poza szczytem i 0,017 centa w szczycie, jako wejście. Agent, który czyta 50 zrzutów ekranu w jednym przebiegu, dodaje z grubsza pół centa tokenów wejściowych — zanim model w ogóle wygeneruje swój pierwszy token wyjściowy. Deep​Seek również ogranicza rozdzielczość przed inferencją: niski poziom szczegółów skaluje do 512×512, a wysoki/originalny wstępnie skaluje obraz (małe do około 384×384, duże zmniejszane do około 800×800), więc oryginał w wysokiej rozdzielczości nigdy nie jest podawany do modelu w natywnej liczbie pikseli.

Obsada drugoplanowa: darmowe API Files i Harness 0.1.1

Wraz z modelem dostarczono dwa elementy infrastruktury. Interfejs Files API jest dostępny i bezpłatny: prześlij obraz raz, odwołuj się do niego przez file_id i wykorzystuj go w kolejnych żądaniach bez ponownego wysyłania bajtów — to istotne dla agenta przeglądającego sieć, który utrzymuje stronę w kontekście przez kilka tur. A Deep​Seek Harness 0.1.1, wydany tego samego dnia, oferuje gotowe wsparcie dla nowego modelu, dzięki czemu harness, który benchmarkuje i napędza agentyczne obciążenia Deep​Seek, może od razu z niego korzystać.

Zastrzeżenie produkcyjne, ujęte wprost.

To jest eksperymentalny model. Deep​Seek wyraźnie oznacza go jako taki, nie ogłosił żadnej daty GA i odradza uruchamianie go bezpośrednio w produkcji; zadeklarowany plan zakłada iterowanie w oparciu o opinie i późniejsze wydanie stabilnej wersji. Praktyczną konsekwencją jest to, że mózg tekstowy jest sprawdzony — to ta sama rodzina wag, która napędza V4-Flash — ale ścieżka wizyjna to nowy kod i nikt poza Deep​Seek nie przetestował go na dużą skalę.

To jest dokładnie sytuacja, w której warstwa routingu pokazuje swoją wartość. Na OrcaRouter zarówno deepseek/deepseek-v4-flash-vision-exp, jak i deepseek/deepseek-v4-flash są dostępne za jednym API, po cenie listowej DeepSeek, przekazywanej dalej z zerową marżą. Możesz skierować ruch zawierający obrazy do modelu eksperymentalnego i w tej samej konfiguracji ustawić automatyczne przełączenie awaryjne na model zapasowy w momencie, gdy model zwróci błąd lub przekroczy limit czasu — co zmniejsza ryzyko związane z całym problemem „nowego kodu”. DSL routingu pozwala również wysyłać do modelu wizyjnego tylko te wywołania, które faktycznie zawierają obrazy, a ruch czysto tekstowy kierować na DeepSeek V4 Flash, uzyskując korzyści w benchmarkach tam, gdzie one występują, i nie płacąc nic ekstra tam, gdzie ich nie ma.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

Co obejrzeć dalej

Otwarte pytania są typowe dla eksperymentalnej premiery. Kiedy DeepSeek V4 Flash Vision (Exp) osiągnie wersję GA i czy cena się utrzyma? Czy pojawi się wejście wideo lub audio — model obsługuje obecnie wyłącznie statyczne obrazy, co pozostawia duże multimodalne modele frontier bez konkurencji w zakresie ruchomych mediów. Czy niezależne ewaluacje (pierwsze testy zewnętrzne na ApexBench lub Terminal-Bench) odtworzą opublikowane wyniki? Interesujące jest to, że nawet jeśli każdy benchmark odchyli się w dół, jedyne twierdzenie, które już jest opłacalne — wizja w cenach tekstu — jest faktem cenowym, a nie twierdzeniem benchmarkowym, i nie wymaga odtwarzania.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube