Plansza tytułowa dla Ling-3.0-flash-VL podsumowująca ten model jako natywny multimodalny mixture-of-experts o 124B parametrów, z 5,5B aktywnych, z laboratorium inclusionAI firmy Ant Group, wydany we wrześniu 2026 r. na licencji MIT, uzyskujący 25 punktów w Artificial Analysis Intelligence Index v4.3 i generujący 142,9 tokena wyjściowego na sekundę.
Guides & Insights

Ling-3.0-flash-VL: model wizyjny firmy Ant z 5,5 mld aktywnych parametrów zajmuje 25. miejsce w Intelligence Index

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ling-3.0-flash-VL ma teraz wynik benchmarku, którego nikt w Ant Group nie wpisał, i to jest właśnie wiadomość. Pierwszy natywnie multimodalny model z laboratorium inclusionAI Ant Group uzyskuje wynik 25 w Artificial Analysis Intelligence Index — niezależny przebieg, na obecnej skali v4.3, opublikowany wraz ze stroną modelu podającą jego szybkość, opóźnienie i cenę. Pojawia się trzy tygodnie po tym, jak karta modelu samego dostawcy twierdziła, że wynosi 42 w tym samym indeksie, a najbardziej użyteczną rzeczą, jaką czytelnik może zrobić z tymi dwiema liczbami, jest zrozumienie, dlaczego nie są one sprzecznością: Ant mierzył według protokołu Intelligence Index v4.1.1, Artificial Analysis mierzył według v4.3, a to są różne miary zbudowane z różnych zbiorów ewaluacyjnych. Liczba dostawcy nie tyle przetrwała kontakt ze stroną trzecią, ile została ponownie zmierzona na skali, która nie istniała, gdy ją zapisano.

Model kryjący się pod tym wynikiem to rzadka mieszanka ekspertów z łączną liczbą 124 mld parametrów i około 5,5 mld aktywnych na token, udostępniony na licencji MIT z wagami BF16 i FP8, przyjmujący tekst, obrazy i wideo oraz zwracający tekst. Ta liczba aktywnych parametrów to cały argument za tym modelem. Przy 5,5 mld aktywnych parametrów Ling-3.0-flash-VL lokuje się na tym, co stało się najciekawszą krzywą w otwartych modelach — granicą inteligencji wykreślanej względem aktywowanych parametrów, a nie całkowitego rozmiaru — i jest tam, ponieważ wykonuje przyzwoitą ilość pracy na jednostkę obliczeń wnioskowania, a nie dlatego, że jest ogromny.

Ten materiał omawia, co faktycznie trafiło do wydania i kiedy, co mówi niezależny przebieg, dlaczego twierdzenie o Pareto broni się lepiej niż większość, ile kosztuje model i gdzie można go faktycznie wywołać. Wersja skrócona, dla każdego, kto chce tylko tego: Ling-3.0-flash-VL jest prawdziwy, ma otwarte wagi, jest wyjątkowo tani w obsłudze, mierzalnie powyżej średniej w swojej klasie rozmiarowej i zauważalnie bardziej rozwlekły oraz wolniejszy w wydaniu, niż sugeruje surowy wynik. Jego deklarowany przez dostawcę wynik 42 nigdy nie został niezależnie odtworzony i nie jest porównywalny z 25, które są teraz na tablicy wyników.

Co faktycznie zostało wydane, oraz harmonogram, który wciąż jest spłaszczany

Relacje z tego wydania zwykle sprowadzają kilka odrębnych zdarzeń do jednej daty premiery, a daty mają znaczenie, ponieważ wyjaśniają, dlaczego wczesne teksty opisywały model, którego nikt spoza Ant nie mógł ocenić. Repozytorium Hugging Face inclusionAI/Ling-3.0-flash-VL powstało 4 września 2026 r. — 64 shardy wag BF16, licencja MIT, stos kodu niestandardowego dla architektury bailing_moe_v3_vl oraz przez kilka dni prawie nikt go nie pobierał. Następnie pojawiła się kwantyzacja FP8 8 września — około 126 GB w 64 shardach, przy czym wieża wizyjna pozostała w wyższej precyzji niż wagi ekspertów. Artificial Analysis podaje datę premiery jako 10 września 2026 r., i do tej właśnie daty odnosi się jej własna strona, a strona modelu z wynikiem pojawiła się mniej więcej wtedy.

A więc „wydany we wrześniu 2026 r.” jest poprawne, ale bezużyteczne. Praktyczna kolejność była następująca: wagi 4 września, drugi format precyzji 8 września, a niezależny pomiar 10 września. Znaczenie tego jest takie, że model, który ma wagi na dysku, ale nie ma hostowanego punktu końcowego ani oceny strony trzeciej, dla większości zespołów nie jest jeszcze czymś, co można ocenić — to plik do pobrania, pod który trzeba przygotować infrastrukturę. Ling-3.0-flash-VL przekroczył tę granicę, gdy istniały już zarówno API, jak i niezależna ocena.

Wsparcie dla serwowania pojawiło się razem z wagami, a nie dopiero po nich. Ant opublikował poradnik wdrożeniowy SGLang i utrzymuje dostrojoną do Ling gałąź vLLM dla tej architektury — czyli część otwartego wydania, która zwykle opóźnia się o tygodnie. Tutaj nie opóźniła się.

Numer na tablicy i ten na karcie

Oto niezależny obraz od Artificial Analysis, który jest jedynym istniejącym obecnie pomiarem tego modelu dokonanym przez stronę trzecią:

• Indeks inteligencji — 25 w wersji v4.3, zajął 2. miejsce wśród 64 w swojej klasie rozmiarowej, w porównaniu z medianą w klasie wynoszącą 8br /> • Parametry całkowite — 124Bbr /> • Parametry aktywne — 5,5B na tokenbr /> • Prędkość generowania — 142,9 tokenów na sekundę, 10. miejsce wśród 64, w porównaniu z medianą wśród podobnych modeli wynoszącą 105,1br /> • Czas do pierwszego tokenu — 2,21 sekundy, w porównaniu z medianą wśród podobnych modeli wynoszącą 2,29br /> • Okno kontekstu — 262K tokenów według pomiaru Artificial Analysis, w porównaniu z 256K podanymi w samej karcie modelubr /> • Licencja — MIT, otwarte wagi

A oto wartość podana przez dostawcę, obok której tak często się ją drukuje: 42 w protokole Artificial Analysis Intelligence Index v4.1.1, o cztery punkty więcej, niż uzyskał tekstowy Ling-3.0-flash w tym samym protokole. To twierdzenie znajduje się w karcie modelu, nie ma opublikowanego śladu ewaluacji i nie jest to liczba, którą podaje Artificial Analysis. Dwie rzeczy są prawdziwe jednocześnie: 42 jest nieodtworzone, a nie jest to dowodem na nic nieuczciwego, ponieważ v4.1.1 i v4.3 nie mierzą tego samego. Artificial Analysis przedstawiło swój indeks w nowej wersji we wrześniu 2026 r. i ponownie oceniło całą swoją tablicę wyników; v4.3 uwzględnia dziesięć ewaluacji, w tym AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 i Humanity's Last Exam. Każdy artykuł, który wciąż cytuje 42 obok 25, nie podając wersji, porównuje dwa różne testy i nazywa to spadkiem.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class ranking of #2 of 64, 124B total and 5.5B active parameters, a 262K-token context window, 142.9 output tokens per second, a 2.21 second time to first token, 160M output tokens from the Intelligence Index ranked #8 of 64, and a listed price of $0.00 per 1M tokens in and out.

Szczegółem wartym odnotowania poza głównym wynikiem jest rozwlekłość. Artificial Analysis odnotowuje, że Ling-3.0-flash-VL wydaje 160 mln tokenów wyjściowych na ukończenie Intelligence Index, plasując go na #8 miejscu na 64 przy medianie 84 mln, i określa go jako „bardzo rozwlekły”. W przypadku modelu, którego argumentem sprzedażowym jest tania inferencja dzięki małej liczbie aktywnych parametrów, stoi to w bezpośredniej sprzeczności z tym argumentem. Płacisz za token, nie za parametr. Model, który aktywuje 5,5 mld parametrów, ale emituje prawie dwa razy więcej tokenów niż mediana, aby odpowiedzieć na te same pytania, oddaje część tej strukturalnej przewagi przy kasie — a to dokładnie taki rodzaj zależności, który ukrywa tabela cen za token, a ujawnia pomiar kosztu na zadanie.

Teza Pareto, poddana niewielkiej presji

Twierdzenie, że Ling-3.0-flash-VL znajduje się na granicy Pareto inteligencji względem liczby aktywnych parametrów, jest — co nietypowe — tym, które niezależne dane potwierdzają, a nie tylko na to pozwalają. Mediana w tej klasie dla tego wskaźnika wynosi 8; Ling-3.0-flash-VL uzyskuje 25; i robi to, aktywując 5,5 mld parametrów na token. Dla zespołów, których wiążącym ograniczeniem jest przepustowość możliwa do obsłużenia — pojedynczy akcelerator, stały budżet żądań, wdrożenie brzegowe — ten stosunek rozstrzyga o całej decyzji i jest to naprawdę mocny wynik.

Dwa zastrzeżenia sprawiają, że nie jest to czyste zwycięstwo. Pierwsze z nich to rozbieżność w liczbie parametrów: karta modelu podaje około 5,5B aktywnych parametrów, podczas gdy cookbook SGLang opisuje model z 5,1B aktywnych parametrów. Oba są dokumentami Ant, różnica jest niewielka i zmienia nieco kształt krzywej, a nie jej kierunek. Drugie to fakt, że „frontier” to względne twierdzenie o dziedzinie, która zmienia się co tydzień. Bycie najlepszym pod względem inteligencji na aktywny parametr przy danej wielkości to pozycja, którą utrzymuje się tylko do czasu, gdy zostanie wydany następny model w tym przedziale — a ten przedział jest zatłoczony.

Sztandarowa demonstracja samego dostawcy — to, że Ling-3.0-flash-VL, rywalizujący w Image-to-WebDev Arena pod pseudonimem „linthium”, zdobył 1,441 przeciwko GPT-5.4, który zdobył 1,440 — powinna być odczytywana jako chwyt na uwagę, a nie jako wynik. Jednopunktowa przewaga mieści się w szumie Elo areny, jest raportowana przez dostawcę i nie jest tym rodzajem różnicy, który o czymkolwiek przesądza. Twierdzenie o możliwościach, które za tym stoi, jest ciekawsze niż sama liczba: model został zbudowany do pętli sprzężenia zwrotnego opartego na wizji, w której generuje kod front-endu z układu, renderuje własny wynik, patrzy na render i koryguje — obserwuj, działaj, weryfikuj, koryguj, zamiast raz opisać i przestać.

A single-column scoreboard card for Ling-3.0-flash-VL listing six rows: Intelligence Index 25 on v4.3, active parameters 5.5B, total parameters 124B, context window 262K tokens, output speed 142.9 tokens per second, and license MIT open weights, with a footer noting the index figure is per Artificial Analysis and the vendor card claims 42 on the retired v4.1.1 protocol.

Ile to kosztuje, co jest mniej jasne, niż się wydaje

Strona Artificial Analysis podaje Ling-3.0-flash-VL w cenie 0,00 USD za 1 mln tokenów wejściowych i 0,00 USD za 1 mln tokenów wyjściowych, wobec median u konkurencji wynoszących 0,14 USD i 0,40 USD. To nie jest cena. To tylko pozór ceny. Artificial Analysis wycenia endpoint, który widzi, a endpoint, który widzi, jest darmowy — model działa na Ling Studio firmy Ant w ramach bezpłatnego okresu próbnego, a ten wpis odzwierciedla darmowy dostęp promocyjny. Własna dokumentacja multimodalna firmy Ant w ogóle nie publikuje cen za token dla modelu wizyjnego, więc nie ma cennika dostawcy, z którym można by zweryfikować to zero. Dla uzmysłowienia skali tekstowy odpowiednik Ling-3.0-flash był podawany w cenie około 0,075 USD za 1 mln tokenów wejściowych i 0,22 USD za 1 mln tokenów wyjściowych, a przeznaczone dla konkretnych domen warianty Ling firmy Ant również zadebiutowały jako darmowe API.

Traktuj zero jako okno testowe, a nie taryfę. Darmowe pakiety w świeżo wydanych modelach to instrument pozyskiwania klientów, a uczciwym założeniem planistycznym jest to, że Ling-3.0-flash-VL prędzej czy później będzie kosztować mniej więcej tyle, co jego tekstowy odpowiednik. Jest też żywa niejasność, której pojawienie się płatnego endpointu nie rozwiąże: własne przykłady API Anta używają identyfikatora modelu Ling-3.0-flash-VL-rc1, czyli znacznika wersji kandydującej, i nadal nie jest jasne, czy udostępniany checkpoint jest bajtowo identyczny z otwartymi wagami z 4 września. Jeśli benchmarkujesz własne prompty na hostowanym API i oczekujesz, że wyniki przełożą się na samodzielnie hostowaną kompilację BF16, to założenie, które powinieneś przetestować, zanim na nim zbudujesz.

Obraz kosztów odwraca się w zależności od tego, po której stronie jesteś. Dla zespołu, który już ma akceleratory, kompilacja FP8 o rozmiarze około 126 GB mieści się w ośmiokierunkowym węźle klasy 80 GB, a liczba aktywnych parametrów 5,5 mld oznacza, że płacisz amortyzowany koszt tego węzła w stosunku do bardzo małego śladu obliczeniowego na token — najtańsza możliwa wersja tego modelu to ta, którą sam serwujesz. Dla zespołu bez akceleratorów pytanie brzmi, czy płatny endpoint pojawi się, zanim zamknie się darmowy plan.

Gdzie możesz to faktycznie nazwać, łącznie z częścią, w której mówimy nie

Ling-3.0-flash-VL jest dostępny przez własną platformę Ant — endpoint zgodny z OpenAI pod api.ant-ling.com/v1/chat/completions oraz towarzyszący mu endpoint zgodny z Anthropic — a także bezpłatny dostęp próbny w Ling Studio i otwarte wagi, które możesz hostować samodzielnie. Niezależne bramy również zaczęły go umieszczać w swoich ofertach, a to naprawdę najszybszy sposób, aby go wypróbować bez konieczności aprowizowania czegokolwiek.

Trzeba powiedzieć wprost, że OrcaRouter nie obsługuje dziś Ling-3.0-flash-VL. Nie ma go w naszym katalogu modeli, więc wszystko, co tu przeczytacie o wywoływaniu go przez nas, byłoby fikcją, a wolimy, żebyście wiedzieli o tym od razu. To, co obsługujemy, to najbardziej zbliżony do niego model wizyjny: DeepSeek V4 Flash Vision Exp, eksperymentalna kompilacja multimodalna Deep​Seek, dostępna w naszym katalogu z oknem kontekstu 1 mln tokenów i opublikowaną stawką. Jeśli Waszą rzeczywistą potrzebą jest wydajny model wizyjny za jednym punktem końcowym zgodnym z OpenAI — z skonfigurowanym łańcuchem awaryjnym, tak aby chwilowa awaria dostawcy została ponowiona, zanim zacznie się Wasza odpowiedź, oraz z przekazywanymi cennikami katalogowymi dostawców bez żadnych dodatków, dzięki czemu zmiana ceny u dostawcy dociera do Was tego samego dnia, w którym następuje — to właśnie ten model warto wypróbować najpierw, dopóki Ling-3.0-flash-VL pozostaje poza katalogiem.

A release-timeline card for Ling-3.0-flash-VL covering four dated events: the Hugging Face repository created September 4 2026 with MIT-licensed BF16 weights, FP8 weights published September 8 at roughly 126 GB, the release anchored to September 10 by Artificial Analysis, and an independent Intelligence Index score of 25 published the same week, with a footer noting the model is not carried on the OrcaRouter catalogue.

Co obserwować dalej

Trzy rzeczy zdecydują, czy to wydanie będzie za sześć miesięcy wyglądać na istotne. Pierwsza to drugi niezależny przebieg: jeden wynik od jednego ewaluatora to pojedynczy punkt danych, a ciekawe pytanie brzmi, czy umiejscowienie Ling-3.0-flash-VL na krzywej inteligencji w zależności od liczby aktywnych parametrów przetrwa inne środowisko testowe. Druga to rzeczywista cena. Dopóki Ant nie opublikuje cennika dla modelu wizyjnego, każde porównanie kosztów z nim związane jest szacunkiem przebranym za liczbę, a darmowy poziom wykonuje pracę, którą w innym razie wykonywałaby cena. Trzecia to różnica jakości FP8 — wieża wizyjna została w tym buildzie celowo utrzymana w wyższej precyzji niż wagi ekspertów, a to, czy wersja skwantyzowana dorównuje BF16 w drobnoziarnistych zadaniach wizualnych, jest dokładnie tym rodzajem pytania, który pojawia się dopiero wtedy, gdy ludzie uruchamiają ją w produkcji, a nie testują ją w benchmarkach.

Werdykt dostępny dziś jest węższy, niż sugerowały doniesienia z premiery, i bardziej użyteczny niż sam wynik. Ling-3.0-flash-VL to prawdziwy, objęty licencją MIT, możliwy do samodzielnego hostowania model wizyjny, który aktywuje niewielki ułamek swoich 124B parametrów, uzyskuje 25 w aktualnym niezależnym indeksie przy medianie klasowej wynoszącej 8, a część tej przewagi oddaje przez rozwlekłość. To dobry model o uczciwym kształcie. 42 na karcie to liczba z linijki, która już nie istnieje.