
Ling-3.0-flash-VL vs Ling 3.0 Flash: jeden mózg 124B, teraz z oczami
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
Ling-3.0-flash-VL i Ling 3.0 Flash nie są rywalami, a czytanie tego zestawienia jako pojedynku modeli zaprowadzi cię do błędnych wniosków. Ling-3.0-flash-VL to wizyjno-językowy checkpoint, który laboratorium inclusionAI należące do Ant Group opublikowało w tym tygodniu — wagi są dostępne na Hugging Face na licencji MIT od 4 września 2026 roku — i który powstał bezpośrednio na bazie Ling 3.0 Flash, otwartego modelu tekstowego laboratorium o 124 miliardach parametrów, stanowiącego od końca lipca trzon jego szybkiej linii modeli. Oba modele mają tę samą hybrydowo-liniową architekturę MoE, tę samą ekonomikę rzadkich aktywacji, ten sam przepis na serwowanie kontekstu 256K i tę samą licencję MIT. To, co dodaje checkpoint VL, to jedyna rzecz, której model tekstowy nigdy nie miał: natywne wejście obrazu i wideo, realizowane przez enkoder ViT, dwuwarstwowy projektor MLP i czasowe kodowanie VideoRoPE. Porównanie sprowadza się więc do jednego praktycznego pytania — jeśli żadne z twoich zadań nie dotyczy obrazów, to czy model z oczami zasługuje na to, by na niego przejść?
Powód, dla którego to pytanie w ogóle warto zadać, jest taki, że inclusionAI nie przedstawia Ling-3.0-flash-VL jako osobnej linii produktów. Jej karta modelu nazywa go „naszym nowym natywnym modelem multimodalnym”, zbudowanym na Ling-3.0-flash, dziedziczącym zdolności językowe, rozumowania i obsługi długiego kontekstu tego modelu oraz rozszerzającym je o widzenie, które uczestniczy w pełnej pętli rozumienia, rozumowania, działania i weryfikacji — a nie o widzenie jako dołączone na siłę wejście. Dla rodziny modeli, której wcześniejsze flagowe wydanie było wyraźnie tekstowe, to prawdziwa zmiana, i wpływa to na to, na którym checkpointcie powinien stanąć zespół pracujący z tekstem i narzędziami.
Dwa checkpointy, jeden backbone
Ling 3.0 Flash, przeciwnik w tym porównaniu, jest bardziej dojrzałym z tej pary. Zapowiedziany pod koniec lipca 2026 roku i udostępniony na licencji MIT 7 sierpnia, jest hybrydowo-liniowym modelem mixture-of-experts z 124B parametrów łącznie i około 5,1B aktywnymi na token — 35 warstw KDA i 7 warstw Gated MLA ułożonych w stosunku 5:1, 512 routowanych ekspertów z 8 aktywowanymi, natywnym kontekstem 256K obsługiwanym na 262 144 tokenach. Model jest wyłącznie tekstowy, z obsługą wywoływania narzędzi, myśleniem domyślnie włączonym przez szablon czatu, a także niezwykle niskim profilem kosztów jak na swój rozmiar. Jest też udokumentowaną połową tej pary: Artificial Analysis umieszcza go na swoim aktywnym leaderboardzie, gdzie zajmuje pierwsze miejsce wśród 63 modeli w swojej klasie, i zmierzyła wydajność na poziomie około 313 tokenów na sekundę w API dostawcy.
Ling-3.0-flash-VL zachowuje tę architekturę i dodaje do niej warstwę wizualną. Karta opisuje enkoder wizualny ViT, którego cechy są wyrównywane do przestrzeni tekstowej za pomocą dwuwarstwowego projektora MLP, a VideoRoPE koduje zarówno pozycję przestrzenną, jak i porządek czasowy, dzięki czemu model potrafi lokalizować zdarzenia i rozumować nad długimi filmami. Rdzeń to ta sama hybryda KDA-MLA w proporcji 5:1, tym razem 124B parametrów łącznie / 5.5B aktywnych na token, z 42-warstwowym trzonem. Dane wejściowe to tekst, obraz i wideo; wyjściem jest tekst. Kontekst deklarowany jest do 1M tokenów, a zalecana konfiguracja SGLang obsługuje 256K dzięki skalowaniu YaRN. Podobnie jak jego tekstowy odpowiednik, domyślnie ma włączone myślenie (można je wyłączyć dla pojedynczego żądania przez `chat_template_kwargs`) i działa pod SGLang lub niestandardowym forkiem vLLM od inclusionAI. Wydanie BF16 zajmuje około 250 GB na dysku w 64 shardach safetensor – ta sama klasa ćwierć terabajta co wagi wersji tekstowej.
Jak świeże to jest? W chwili pisania tego tekstu repozytorium VL ma kilkadziesiąt pobrań, jego karta modelu wciąż jest aktualizowana, a Artificial Analysis nie ma go na swojej liście. Wszystko poniżej, co nie jest wyraźnie przypisane Artificial Analysis, to własne raportowanie inclusionAI.

Tablica wyników
Asymetria tutaj nie dotyczy jakości — dotyczy modalności. Sześć wymiarów oddaje decyzję:
• Inteligencja (karta producenta, AA Index v4.1.1) — Ling-3.0-flash-VL: 42, według danych producenta. Ling 3.0 Flash: 38, wcześniejsza wartość indeksu, na którą powołuje się karta.
• Dzisiejsza tablica na żywo AA (v4.3) — Ling-3.0-flash-VL: jeszcze nie na liście. Ling 3.0 Flash: szacunkowo 25, zajmuje 1. miejsce spośród 63 w swojej klasie.
• Wejścia — Ling-3.0-flash-VL: tekst, obraz i wideo. Ling 3.0 Flash: tylko tekst.
• Kontekst — oba deklarują do 1 mln tokenów; obecnie oba są praktycznie udostępniane z 256K (262 144).
• Cena — Ling-3.0-flash-VL: brak ceny katalogowej; tylko otwarte wagi na licencji MIT. Ling 3.0 Flash: ok. 0,07 USD za 1 mln tokenów wejściowych i 0,22 USD za 1 mln tokenów wyjściowych w API producenta.
• Wybierz go do tych zadań — Ling-3.0-flash-VL: dokumenty, zrzuty ekranu, wykresy, wideo oraz agenci obsługujący GUI. Ling 3.0 Flash: wywoływanie narzędzi w środowiskach tekstowych i potoki agentowe o długim horyzoncie.

Tablica wyników, do której model tekstowy nie może wejść
To jest punkt, w którym oba modele faktycznie się rozchodzą, a różnica ma charakter strukturalny, a nie konkurencyjny: w benchmarkach obrazu i wideo czysto tekstowy Ling 3.0 Flash nie ma żadnego wyniku, bo nie może przyjąć takiego wejścia. Własna tabela Ling-3.0-flash-VL — ewaluacja firmy inclusionAI, niezreplikowana, przeprowadzona częściowo wewnętrznie, a częściowo wobec API konkurentów w oficjalnych ustawieniach testów — podaje liczby w trzech kategoriach, które karta modelu eksponuje. W rozumieniu złożonych obrazów osiąga 79,0 w MMMU-Pro i 84,87 w MathVision, a znacznie niższe 19,88 w Humanity's Last Exam-Multimodal pokazuje, jak trudny jest ten zestaw dla wszystkich. W zadaniach na dokumentach i wykresach radzi sobie bardzo dobrze: OmniDocBench1.5 na poziomie 91,35 i CharXiv_RQ na poziomie 81,30. A w zestawach agentowo-multimodalnych, które czynią tę premierę interesującą — ClawEval-MM: 59,9, WebVoyager: 90,83, Vision2Web: 57,69 — model ma odczytać interfejs i podjąć na jego podstawie działanie, czyli dokładnie to zadanie agenta GUI, którego model tekstowy nie może wykonać.
Odczytane w kontekście układają się w spójny obraz: to nie jest model dostrajany do wygrywania quizów na obrazach, tylko model dostrajany do zamiany pikseli w działanie — odczytywania układu, śledzenia wykresu, obsługiwania strony. Na własnym wykresie dostawcy prowadzi w trójstronnym porównaniu (Qwen3.8-27B przy wysokim nakładzie rozumowania, Gemini 3.5 Flash-Lite i Kimi-K2.6) w benchmarkach OmniDocBench, WebVoyager i ClawEval-MM, a wypada gorzej w trudnych zbiorach wiedzy i rozumowania, takich jak MathVision i HLE-MM. Każdą z tych liczb traktuj jako deklarację inclusionAI, dopóki nie potwierdzi ich neutralne laboratorium — ale kierunek dostrajania jest jasny i spójny.
Jedyna liczba, o którą warto się spierać: 42 vs 38
Twierdzeniem, które najprawdopodobniej skłoni zespół pracujący wyłącznie na tekście do zmiany, jest to najważniejsze: inclusionAI podaje, że Ling-3.0-flash-VL uzyskał 42 punkty w Artificial Analysis Intelligence Index (v4.1.1), czyli o cztery punkty więcej niż 38, które przypisuje modelowi Ling 3.0 Flash w tej samej wersji indeksu. Zwróć uwagę, co mierzy ten indeks: jego kompozyt v4.1.1 opiera się na zestawach tekstowych i agentowych — GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam i podobnych, z których żaden nie obejmuje zadań obrazowych. Dostawca twierdzi więc, że dodanie treningu wizualnego do współdzielonego rdzenia poprawiło tekstową inteligencję modelu o cztery punkty, a nie tylko, że model potrafi teraz opisywać obrazy. To uderzające i całkowicie wiarygodne twierdzenie — multimodalne strojenie instrukcji zwykle podnosi zdolności tekstowe.
Dwa zastrzeżenia dotyczące źródeł danych pozwalają zachować właściwą perspektywę dla tej liczby. Po pierwsze, 38 to wynik z wcześniejszej generacji indeksu: Artificial Analysis przeniosło już swoją tablicę wyników na żywo na nowszą wersję indeksu (v4.3), w której obecnie szacuje Ling 3.0 Flash na 25 punktów, plasując go nadal na pierwszej pozycji spośród 63 modeli w tej klasie. Para 42–38 podana przez producenta opiera się na starszej skali, więc nie należy jej odczytywać jako „cztery punkty powyżej obecnego wyniku AA dla modelu tekstowego”. Po drugie, 42 to własna liczba inclusionAI dla modelu, którego Artificial Analysis jeszcze nie uwzględniło w rankingu, a inclusionAI nie opublikowało wyników punktu kontrolnego VL na poszczególnych zestawach testów tekstowych (SWE-Bench, Terminal-Bench), które na wykresie inclusionAI dla modelu tekstowego są rozpisane osobno. Cztery punkty to dokładnie taki przyrost, który warto odtworzyć, zanim na jego podstawie zmigruje się potok działający wyłącznie na tekście.

Cena: jeden ma cenę katalogową, drugi nie
Porównanie kosztów jest obecnie porównaniem tylko z jedną ceną. Ling 3.0 Flash jest dostępny dziś w autorskim API dostawcy za około 0,07 USD za 1M tokenów wejściowych i 0,22 USD za 1M tokenów wyjściowych — ceny ustalone przez dostawcę, potwierdzone na liście Artificial Analysis — przy czym dane wejściowe z pamięci podręcznej są tańsze, a zniżki z okresu premiery już wygasły. Ling-3.0-flash-VL nie ma opublikowanej ceny API nigdzie; nie można jeszcze płacić za niego za token. Jeśli chcesz go mieć w tym tygodniu, musisz go hostować samodzielnie: wagi MIT o wadze około 250 GB w BF16, na tej samej klasie sprzętu, której już wymaga model tekstowy — 4× GPU 141 GB (H20-3e lub H200) albo 4-GPU węzeł Blackwell z tensor-parallel 4, lub 8× GPU 80 GB H100/H800 z TP8.
To zmienia rachunek ekonomiczny dla zespołu pracującego wyłącznie na tekście. Jeśli kupujesz tokeny, model tekstowy przy stawce 0,07/0,22 USD jest tani i sprawdzony. Jeśli już hostujesz u siebie model tekstowy 124B, punkt kontrolny VL nie jest drugim zakupem infrastruktury — to kolejne ~250 GB wag na sprzęcie tej samej klasy, uzasadnione wyłącznie obciążeniami, które faktycznie przetwarzają piksele. Model z oczami zarabia na swoje utrzymanie tylko wtedy, gdy oczy są w pętli.
Kto powinien wybrać, które
• Tylko tekst i duży wolumen — zostań przy Ling 3.0 Flash. Otrzymujesz sprawdzony model notowany na liście AA, realną cenę za token i dojrzałe wywoływanie narzędzi. Czteropunktowy przyrost indeksu modelu VL nie został odtworzony, a jego przepustowość tekstowa nie została zmierzona; nie ma jeszcze dowodów na to, że jest lepszym modelem tekstowym, tylko twierdzenie, że tak jest.
• Wizja wkracza do pętli — dokumenty, zrzuty ekranu, wykresy, zdjęcia, klatki wideo lub interfejs użytkownika, który Twój agent musi odczytać i kliknąć — Ling-3.0-flash-VL jest oczywistym wyborem, ponieważ to ten sam rdzeń rozumowania, który już znasz, z dodanym stosem wizyjnym, a nie osobny model multimodalny, który musisz oceniać od zera.
• Ruch mieszany, bez rozstrzygnięcia — najmniej ryzykownym posunięciem jest pozostawienie obu osiągalnymi i kierowanie ruchem na podstawie żądania, zamiast przebudowywać architekturę wokół jednego z nich. To właśnie właściwość, którą ma dawać brama modeli: jedno API dla ponad 200 modeli, ceny katalogowe dostawców przepuszczane z zerową marżą oraz automatyczny failover, gdy dostawca zaczyna zawodzić. Żaden z checkpointów Ling nie jest jeszcze za endpointem OrcaRouter — cena modelu tekstowego to cena dostawcy, a model VL nie ma żadnej ceny za hostowanie — ale gdy model VL taką cenę otrzyma, przeniesienie części ruchu na niego i zmierzenie efektów to zmiana konfiguracji, a nie projekt integracyjny.
Czego jeszcze brakuje?
• Niezależny test Ling-3.0-flash-VL na aktualnym Artificial Analysis Intelligence Index — 42 to twierdzenie inclusionAI dotyczące wcześniejszej wersji tego indeksu.
Jakakolwiek cena za hostowane API modelu VL, która jest największą pojedynczą przeszkodą w przyjęciu przez okazjonalnych użytkowników.
• Opublikowano podzbiory tylko-tekstowe (SWE-Bench Pro, Terminal-Bench 2.1) dla punktu kontrolnego VL, aby zespół pracujący głównie na tekście mógł zweryfikować, że warstwa wizyjna nic go nie kosztowała.
• Wartość opóźnienia end-to-end lub przepustowości dla VL przy obciążeniu obrazem — mierzona jest szybkość modelu tekstowego, a nie wizyjnego.
Neutralne potwierdzenie wykresu benchmarku wizyjnego, którego części uruchomiono na własnym środowisku testowym inclusionAI, a co najmniej jeden wewnętrzny benchmark ma zostać wydany w późniejszym terminie.
Werdykt
To nie jest konkurs jakości modeli; to decyzja co do modalności, do której dołączono czteropunktową tezę. Jeśli Twoje dane wejściowe to tekst, zostań przy Ling 3.0 Flash — jest tańszy, figuruje na liście AA i został sprawdzony, a przewaga modelu VL nad nim to obecnie liczba podana przez dostawcę na starszej skali indeksowej. Jeśli Twój workflow zaczyna się od ekranu — strony dokumentu, zrzutu ekranu, wykresu, klatki wideo, GUI, którym ma sterować Twój agent — Ling-3.0-flash-VL to ten sam mózg 124B, który już znasz, tyle że teraz potrafi widzieć; to naprawdę nowa opcja, której jeszcze tydzień temu nie było w szybkiej warstwie Ling. Postaw na niego tam, gdzie wizja jest realna, zweryfikuj wynik 42, zanim na jego podstawie zmigrujesz cokolwiek, i utrzymaj ten wybór na warstwie routingu jako odwracalny, dopóki nie pojawią się niezależna ocena i cena katalogowa.
