Plansza tytułowa porównująca Ling-3.0-flash-VL i DeepSeek V4 Flash Vision Exp, pokazująca Ling z łączną liczbą 124B parametrów i 5,5B aktywnych parametrów oraz oknem kontekstowym 262K w zestawieniu z DeepSeek V4 Flash Vision Exp z około 305B parametrów, oknem kontekstowym 1 mln tokenów i maksymalnym wyjściem 384K, a w stopce zaznaczono, że indeks Ling pochodzi z Artificial Analysis, a dane DeepSeek są podane przez producenta.
Guides & Insights

Ling-3.0-flash-VL kontra DeepSeek V4 Flash Vision Exp: Dwa zakłady na otwartą wizję

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ling-3.0-flash-VL i DeepSeek V4 Flash Vision Exp to dwa modele wizyjne o otwartych wagach w tej klasie wag, które zespół może dziś realnie pobrać i uruchomić, a zbudowali je ludzie, którzy nie zgadzają się co do tego, do czego służy wizja. Ling-3.0-flash-VL z laboratorium inclusionAI grupy Ant przy każdym tokenie aktywuje około 5,5 mld ze swoich 124 mld parametrów i traktuje wizję jako coś, co należy stosować w pętli sprzężenia zwrotnego — generuj, renderuj, patrz, poprawiaj — przy jak najniższym możliwym koszcie wnioskowania. DeepSeek V4 Flash Vision Exp, pierwsza multimodalna konstrukcja DeepSeek, łączy okno kontekstowe o rozmiarze 1 mln tokenów z maksymalnym wyjściem wynoszącym 384 tys. tokenów i traktuje wizję jako jeszcze jedno wejście, które agent odczytuje, zmierzając do ukończenia długiego zadania. Jeden jest zoptymalizowany pod kątem tego, jak mało kosztuje myślenie. Drugi jest zoptymalizowany pod kątem tego, ile może pomieścić, gdy to robi.

Ta różnica, a nie różnica w benchmarku, powinna decydować o wyborze. Te dwa modele nie mają wspólnego protokołu oceny, względem którego można by je porównywać, a tylko jeden z nich ma jakikolwiek niezależny wynik. Poniżej przedstawiamy uczciwy obraz tego porównania: zakłady architektoniczne, parametry, które faktycznie się różnią, sytuację z benchmarkami — w tym dlaczego jest ona uboga — ile kosztuje każdy z nich i który wygrywa w jakim zadaniu, a także część, w której mówimy wprost, który z tych dwóch znajduje się w naszym katalogu.

Dwa zakłady, precyzyjnie sformułowane

Strona Ling w tym rozwiązaniu to zakład na rzadkość aktywacji jako główną dźwignię kosztową. Ling-3.0-flash-VL to rzadka mieszanina ekspertów o łącznej liczbie 124B parametrów — karta modelu pokazuje około 124,8B, a cookbook SGLang opisuje 5,1B aktywnych, podczas gdy karta mówi o około 5,5B — uruchamiająca 42-warstwowy hybrydowy trzon, który naprzemiennie stosuje Kimi Delta Attention z bramkowanymi blokami MLA w stosunku 5:1. Enkoder wizyjny o dowolnej rozdzielczości i dwuwarstwowy projektor MLP zasilają ten trzon, przy czym VideoRoPE obsługuje pozycję przestrzenną i czasową, dzięki czemu klatki wideo trafiają w spójnej kolejności. Konsekwencją architektoniczną jest model, którego koszt uruchomienia na token stanowi niewielki ułamek kosztu gęstego modelu o 124B parametrów, co jest całym powodem, dla którego pojawia się na granicy inteligencji w stosunku do aktywnych parametrów.

Strona Deep​Seek to zakład na kontekst i wytrzymałość agentową. DeepSeek V4 Flash Vision Exp bierze architekturę tekstową DeepSeek-V4-Flash i dodaje enkoder wizyjny oraz aligner, a następnie kontynuuje trening — jedno źródło podaje, że wynik ma około 305B parametrów, czego Deep​Seek nie potwierdził szczegółowo. Ma okno kontekstowe o rozmiarze 1 048 576 tokenów i maksymalnie 384 000 tokenów wyjścia, obsługuje wyjście JSON, wywołania narzędzi, Responses API, Anth​ropic API oraz kontynuację prefiksu rozmowy, a Deep​Seek jednoznacznie zaznaczył, że nie jest to model odpowiedzi na pytania wizualne. To percepcja dla agentów: odczytywanie zrzutów ekranu stron internetowych, interfejsów oprogramowania i wykresów, a następnie przechodzenie do wywołań narzędzi. Obrazy są konwertowane na tokeny i rozliczane jako tokeny, z ograniczeniem do 384 tokenów na obraz.

Przeczytaj te dwa akapity razem, a kształt decyzji się wyłoni. Jeśli charakter Twojej pracy to „spójrz na to, podejmij decyzję, działaj, spójrz ponownie”, liczba aktywnych parametrów Ling jest tym, co czyni tę pętlę opłacalną, a jej konstrukcja sprzężenia zwrotnego wizyjnego jest ukierunkowana dokładnie na to. Jeśli charakter Twojej pracy to „przeczytaj ten 400-stronicowy dokument z rycinami i idź dalej”, okno kontekstu Deep​Seek jest tą cechą i nic po stronie Ling nie może z nim konkurować.

Dlaczego porównanie z benchmarkiem jest słabsze, niż wygląda

To jest sekcja, którą większość porównań pomija, a jej pominięcie daje tabelę liczb, która nic nie znaczy. Oto rzeczywisty stan dowodów.

Ling-3.0-flash-VL ma jeden niezależny pomiar: 25 w Artificial Analysis Intelligence Index v4.3, miejsce #2 z 64 w swojej klasie rozmiarowej przy medianie klasowej wynoszącej 8. Karta dostawcy niezależnie deklaruje 42 w protokole Intelligence Index v4.1.1, który jest wycofaną skalą i nie jest porównywalny — wartość 42 należy traktować jako nieodtworzoną.

DeepSeek V4 Flash Vision Exp nie ma w ogóle żadnej strony Artificial Analysis. Każda opublikowana dla niego liczba pochodzi od samego DeepSeeka, z ogłoszenia o wydaniu, a kilka z nich wyraźnie odnosi się do Opus-4.8, a nie do ustalonego protokołu. To nie jest krytyka tych liczb; to stwierdzenie o tym, co można z nimi zrobić. Nie można umieścić niezależnie ocenionego modelu i modelu ocenionego wyłącznie przez dostawcę w tej samej kolumnie i ogłosić zwycięzcę, a każda strona, która to robi, kreuje wynik.

Uzasadnione jest porównywanie każdego modelu z jego własnym raportowanym rekordem, wraz z załączoną proweniencją:

• Ling-3.0-flash-VL, niezależnie — Intelligence Index 25 na v4.3, #2 z 64 w klasie, mediana klasy 8, według Artificial Analysisbr /> • Ling-3.0-flash-VL, od dostawcy — 42 w wycofanym protokole v4.1.1 oraz 1 441 wobec 1 440 GPT-5.4 w Image-to-WebDev Arena jako „linthium”; obie wartości zgłoszone przez dostawcę, a przewaga na arenie mieści się w granicach szumu Elobr /> • DeepSeek V4 Flash Vision Exp, od dostawcy — Terminal Bench 2.1 83,9; DeepSWE 59,3 wobec 58,0 Opus-4.8; Agents' Last Exam 27,3 wobec 25,7 Opus-4.8; Toolathlon-Verified 75,9; Cybergym 75,3; Chartography 64,3; NL2Repo 57,7; DSBench-Hard 63,6; ZeroBench Pass@5 35,0; ApexBench Pass@1 36,5; AutomationBench 25,7br /> • DeepSeek V4 Flash Vision Exp, niezależnie — nie opublikowano żadnych

Zauważ, z czego głównie składa się lista DeepSeek: z ocen agentowych i dotyczących inżynierii oprogramowania, a nie z ocen wizyjnych. Sposób przedstawiania tego przez DeepSeek jest taki, że w zadaniach czysto tekstowych model wizyjny dorównuje oficjalnemu DeepSeek-V4-Flash bez regresji, a poprawa dotyczy multimodalnych benchmarków agentowych — gdzie DeepSeek opisuje wynik jako zbliżający się do Opus-4.8, a nie jako lepszy od niego, i przyznaje około dziesięciopunktową lukę w zadaniach strukturalnej analizy danych i kodu NL2Repo oraz DSBench-Hard. To niezwykle ostrożny zestaw twierdzeń i mówi on, że model jest sprzedawany jako ulepszenie percepcji istniejącego stosu agentowego, a nie jako nowy pułap.

A two-column comparison scoreboard for Ling-3.0-flash-VL and DeepSeek V4 Flash Vision Exp across six shared dimensions: Intelligence Index 25 on v4.3 versus none published, active parameters 5.5B versus undisclosed, context window 262K versus 1M tokens, max output tens of thousands versus 384K, license MIT versus MIT, and independent score yes versus none, with a footer noting the Ling figure is per Artificial Analysis and all DeepSeek figures are vendor-reported.

Specyfikacje, które faktycznie się różnią

Większość informacji w obu kartach specyfikacji się zgadza: oba są open-weight na licencji MIT, oba przyjmują tekst i obrazy, a zwracają tekst, oba udostępniają wagi BF16 wraz ze skwantyzowanymi wersjami, oba mają opublikowane receptury wdrożeniowe i oba w jakiejś formie obsługują wideo. Rozbieżności koncentrują się w czterech miejscach.

• Parametry — Ling-3.0-flash-VL ma łącznie 124 mld parametrów, z czego około 5,5 mld aktywnych na token; w przypadku DeepSeek V4 Flash Vision Exp podaje się około 305 mld, bez opublikowanej liczby parametrów aktywnychbr /> • Okno kontekstowe — Ling-3.0-flash-VL osiąga 262 tys. tokenów według Artificial Analysis, podczas gdy w jego własnej karcie modelu podano 256 tys.; DeepSeek V4 Flash Vision Exp obsługuje natywnie 1 048 576 tokenówbr /> • Maksymalna długość odpowiedzi — Ling-3.0-flash-VL jest znacznie krótszy, rzędu dziesiątek tysięcy tokenów; DeepSeek V4 Flash Vision Exp osiąga 384 000br /> • Obsługa obrazów — Ling-3.0-flash-VL przyjmuje do 40 obrazów na żądanie, każdy o rozdzielczości do 16 384 × 784 pikseli, wyłącznie w formacie base64; DeepSeek V4 Flash Vision Exp przyjmuje base64, zewnętrzne adresy URL lub odwołanie do Files API, a koszt obrazu ogranicza do 384 tokenów na obrazbr /> • Parametry aktywne — Ling-3.0-flash-VL aktywuje około 5,5 mld na token; DeepSeek V4 Flash Vision Exp nie opublikował liczby parametrów aktywnych

Wiersz dotyczący obsługi obrazów bywa niedoceniany. Twardy limit 384 tokenów na obraz oznacza, że gęsty wykres lub zrzut ekranu całej strony jest kompresowany do mniej więcej tego samego budżetu co miniatura — tanio i stratnie w sposób, który ma znaczenie w zadaniach precyzyjnego odczytu. Podejście Ling idzie w przeciwnym kierunku: bardzo duży budżet pikseli na obraz, transport wyłącznie w base64, a więc znacznie cięższy ładunek żądania. To, która opcja jest lepsza, zależy wyłącznie od tego, czy Twoje obrazy to fotografie dokumentów, które trzeba odczytać precyzyjnie, czy zrzuty ekranu UI, które trzeba zrozumieć z grubsza.

Drugim niedocenianym wierszem jest maksymalny rozmiar wyjścia. Limit dziesiątek tysięcy tokenów Ling-3.0-flash-VL jest w porządku w pętli opisz-potem-popraw, ale ograniczający dla wszystkiego, co chce wygenerować duży artefakt — długi wygenerowany plik, pełne przepisanie dokumentu, diff obejmujący tysiące linii. Wyjście 384K w Deep​Seek istnieje dokładnie dlatego, że przewidziane dla niego obciążenie kończy się dużym wynikiem wywołania narzędzia albo wygenerowanym artefaktem. Jeśli twój potok oczekuje, że model zwróci coś długiego, ten pojedynczy wiersz rozstrzyga starcie, zanim zrobi to jakikolwiek benchmark.

Cena oraz różnica między darmowym a bez ceny

DeepSeek V4 Flash Vision Exp ma konkretną liczbę w naszym katalogu: $0,24 za 1 mln tokenów wejściowych i $0,73 za 1 mln tokenów wyjściowych, z oknem kontekstu wynoszącym 1 048 576 tokenów i maksymalnym wyjściem 384 000 tokenów, osiągalny jako deepseek/deepseek-v4-flash-vision-exp. To opublikowana stawka, rozliczana w taki sam sposób jak tekstowy V4-Flash, a obrazy są przeliczane na tokeny w liczbie do 384 na obraz. To stawka, którą możesz wpisać do arkusza kalkulacyjnego.

Ling-3.0-flash-VL go nie ma. Strona Artificial Analysis podaje 0,00 USD za 1 mln tokenów wejściowych i 0,00 USD za 1 mln tokenów wyjściowych wobec mediany u konkurentów wynoszącej 0,14 USD i 0,40 USD — ale odzwierciedla to bezpłatny okres próbny działający w Ling Studio firmy Ant, a nie taryfę. Dokumentacja multimodalna Ant nie publikuje ceny za token dla modelu wizyjnego, więc nie ma do czego porównać zera. Bratni model tekstowy Ling-3.0-flash był wyceniany na około 0,075 USD za 1 mln tokenów wejściowych i 0,22 USD za 1 mln tokenów wyjściowych, a specjalistyczne wersje Ling firmy Ant uruchomiono jako darmowe API, co sugeruje podobny docelowy kształt — ale sugestia to nie cena.

Zestaw je uczciwie obok siebie, a porównanie kosztów wygląda tak: jeden model ma stawkę, drugi ma okno promocyjne i wiarygodne przypuszczenie. Każdy, kto twierdzi, że Ling-3.0-flash-VL jest tańszy niż DeepSeek V4 Flash Vision Exp, porównuje darmowy okres próbny z ceną katalogową. Można obronić twierdzenie, że Ling-3.0-flash-VL z bardzo dużym prawdopodobieństwem będzie tańszy za token, gdy zostanie wyceniony, ponieważ 5,5 mld aktywnych parametrów to przewaga strukturalna, której nie zniweluje żadna zmiana stawek — z zastrzeżeniem, że gadatliwość Ling-3.0-flash-VL częściowo ją uszczupla. Artificial Analysis odnotowuje, że spala 160 mln tokenów wyjściowych w Intelligence Index, co plasuje go na 8. miejscu na 64 przy medianie 84 mln, i określa go jako „bardzo gadatliwy”. Płacisz za każdy wyemitowany token, więc model, który mówi prawie dwa razy więcej, żeby dojść do tej samej odpowiedzi, oddaje część tego, co zyskuje dzięki rzadkiej aktywacji.

Który, po co

Uczciwe drzewo decyzyjne dzieli najpierw według kontekstu i długości wyjścia, a dopiero potem według czegokolwiek innego, ponieważ właśnie w tych wymiarach te dwa modele nie są substytutami.

Wybierz DeepSeek V4 Flash Vision Exp, gdy Twoje zadanie jest długie i kończy się artefaktem: dokumenty liczące setki stron z rycinami, bazy kodu czytane od początku do końca, pętle agenta, które muszą wygenerować duży wynik, obciążenia, w których chcesz przekazać obraz przez URL lub odwołanie do Files API, a nie w base64, oraz potoki, w których potrzebujesz Responses API, kontynuacji prefiksu albo publikowanej stawki za token, względem której możesz zaplanować budżet. To także jedyny z tych dwóch, którego dostawca twierdzi, że dorównuje własnemu modelowi tekstowemu w zadaniach tekstowych, co ma znaczenie, jeśli jeden model zastępuje dwa w Twoim stosie.

Wybierz Ling-3.0-flash-VL, gdy twoim wiążącym ograniczeniem jest koszt na wywołanie, a twoja pętla jest krótka: automatyzacja GUI, powtarzana inspekcja zrzutów ekranu, generowanie front-endu z cyklem renderuj-i-poprawiaj, wyrywkowe kontrole dokumentów medycznych lub finansowych, gdzie potrzebujesz wysokiej rozdzielczości na obraz i możesz zaakceptować niewielkie dane wyjściowe. Liczba 5,5 mld aktywnych parametrów jest powodem, by go wybrać, licencja MIT jest powodem, dla którego bezpieczne jest samodzielne hostowanie, a projekt pętli sprzężenia zwrotnego wizji jest ukierunkowany dokładnie na wzorzec obserwuj-działaj-weryfikuj-poprawiaj. Pamiętaj, że wybierasz model bez ustalonej ceny z darmową ścieżką wejścia i bez zobowiązania co do tego, co nastąpi później.

A jeśli tak naprawdę potrzebujesz jednego modelu, który kompetentnie odczytuje obrazy bez popadania w żadną ze skrajności — bez sztuczki z rzadkością 5,5B, bez okna o długości miliona tokenów — to żaden z nich nie jest tą interesującą odpowiedzią, a zwykłe modele wizyjne średniej klasy posłużą ci lepiej i taniej niż którykolwiek z modeli specjalistycznych.

Prowadzenie ich i gdzie szczerze pasujemy

DeepSeek V4 Flash Vision Exp jest w naszym katalogu. Możesz wywołać go przez zgodny z OpenAI endpoint OrcaRoutera, podając ciąg modelu deepseek/deepseek-v4-flash-vision-exp, na tym samym kluczu, którego używasz do wszystkiego innego, w publikowanej stawce 0,24/0,73 USD i bez żadnych dodatków na wierzchu — cena katalogowa dostawcy jest przekazywana bezpośrednio, więc jeśli Deep​Seek obniży stawkę, dotrze ona do Ciebie tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. Jeśli po raz pierwszy wprowadzasz model wizyjny na ścieżkę produkcyjną, ten jest bezpieczniejszym z dwóch na start na warstwie routingu, ponieważ możesz skonfigurować łańcuch zapasowy, tak aby błąd dostawcy został ponowiony przez inną trasę, zanim zacznie się Twoja odpowiedź. Nikt nie chce, żeby jego pierwsze produkcyjne wywołanie modelu wizyjnego było tym, które nauczy go o awarii pojedynczego dostawcy.

The OrcaRouter model page for DeepSeek V4 Flash Vision (Exp) showing a $0.24 per 1M input and $0.73 per 1M output token price, a 1,048,576-token context window, a 384,000-token maximum output, p50 time to first token of 1.31 seconds, the deepseek/deepseek-v4-flash-vision-exp model identifier, and Python and cURL code samples against https://api.orcarouter.ai/v1.

Ling-3.0-flash-VL nie znajduje się w naszym katalogu, i nie zamierzamy sugerować inaczej. Jest dostępny przez własną platformę Ant, która udostępnia endpoint zgodny z OpenAI oraz endpoint zgodny z Anthropic, przez bezpłatny dostęp próbny w Ling Studio, a także przez otwarte wagi na Hugging Face, które możesz hostować samodzielnie za pomocą opublikowanej receptury SGLang lub własnego forka vLLM firmy Ant. Jedną rzecz warto zweryfikować, zanim zainwestujesz w tę ścieżkę: przykłady API Ant używają identyfikatora Ling-3.0-flash-VL-rc1, znacznika release candidate, a to, czy udostępniany checkpoint odpowiada otwartym wagom, nie zostało publicznie rozstrzygnięte. Jeśli przeprowadzasz testy porównawcze względem hostowanego API, oczekując, że liczby przełożą się na samodzielnie hostowane wdrożenie BF16, najpierw zweryfikuj to założenie.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3, a class rank of #2 of 64, 124B total and 5.5B active parameters, 142.9 output tokens per second, and a listed price of $0.00 per 1M tokens in and out reflecting free trial access.

Podsumowanie, które wytrzymuje wnikliwą analizę: to nie są konkurencyjne odpowiedzi na jedno pytanie. DeepSeek V4 Flash Vision Exp to warstwa percepcji o długim kontekście dla agentów z opublikowaną ceną i arkuszem wyników raportowanym przez dostawcę, który opiera się na ewaluacjach agentowych. Ling-3.0-flash-VL to tani w obsłudze model wizyjny z jednym prawdziwym niezależnym wynikiem, bezpłatnym planem bez podanej ceny i projektem ukierunkowanym na krótkie pętle korekcyjne. Dopasuj kształt swojego obciążenia do kształtu modelu, a fakt, że tylko jeden z nich ma niezależny wynik na tablicy, powinien wpływać na to, jak dużą wagę przykładasz do marketingu drugiego.

Ten sam klucz daje dostęp do reszty katalogu, a Ty możesz przeglądać pełny katalog modeli, aby zobaczyć, co jeszcze kryje się za jednym punktem końcowym kompatybilnym z OpenAI.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie