
Ling-3.0-flash-VL: Ant otwiera multimodalny model na szybkiej linii Ling
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Dnia 4 września 2026 roku laboratorium inclusionAI należące do Ant Group opublikowało na Hugging Face wagi Ling-3.0-flash-VL na licencji MIT i tego samego dnia zaktualizowało dokumentację deweloperską platformy Ant Ling, aby ją dostosować. Ling-3.0-flash-VL to pierwszy punkt kontrolny w rodzinie Ling-3.0-flash obsługujący wizję: ten sam rdzeń sparse mixture-of-experts o około 124 miliardach parametrów, który uczynił tekstowy Ling-3.0-flash jednym z najczęściej omawianych tanich modeli rozumujących późnym latem, teraz czyta także obrazy i krótkie klipy wideo, a nie tylko tekst. Kwantyzacja FP8 pojawiła się 8 września, rankiem, gdy powstaje ten tekst. Tak więc w ciągu czterech dni wydanie zyskało trzy płaszczyzny, na których czytelnik może działać — otwarte wagi, oficjalne API na platformie Ling firmy Ant oraz zgłoszony przez dostawcę wynik 42 w protokole Artificial Analysis Intelligence Index w wersji 4.1.1, o cztery punkty wyżej niż niezależnie zmierzone 38 dla tekstowego odpowiednika. Czego wciąż mu brakuje, to oficjalnego ogłoszenia: karta na Hugging Face i samouczek dla deweloperów to cała premiera, dlatego ten artykuł oddziela to, co deklaruje dostawca, od tego, co osoba z zewnątrz może zweryfikować.
To wydanie ma znaczenie ze względu na to, co robi z mapą produktową Anta. Do połowy 2026 roku prace multimodalne w portfolio modeli Anta znajdowały się w osobnej linii Ming, podczas gdy Ling-3.0-flash był pozycjonowany — również we własnym objaśnieniu tego bloga dotyczącym modelu tekstowego — jako szybka warstwa tekstowo-narzędziowa dla agentów, programowania i pogłębionych badań. Ling-3.0-flash-VL zaciera tę granicę: wprowadza informacje wizualne do modelu rozumowania zbudowanego wokół niezwykle małego śladu aktywowanych parametrów i długich przebiegów agentowych, a wynik przekazuje programistom na trzy sposoby jednocześnie. To czyni z niego decyzję zupełnie inną niż wcześniejsze warianty dostosowane do domen (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), które zostały udostępnione jako darmowe API bez wag. Ten jest otwarty, działa na płatnej platformie Anta i jest na tyle młody, że nikt spoza dostawcy nie opublikował jeszcze niezależnego przebiegu. Ten ostatni fakt jest najważniejszy w tym artykule.
Co wysłano i kiedy
Każdą datę poniżej można zweryfikować w repozytoriach i dokumentacji; żadna z nich nie opiera się na nieistniejącym komunikacie prasowym.
• 4 września — repozytorium Hugging Face o nazwie inclusionAI/Ling-3.0-flash-VL zostało utworzone o 15:24 UTC z 64 shardami wag w formacie bf16, pełnym autorskim stackiem kodu dla architektury bailing_moe_v3_vl, szablonem czatu z domyślnie włączonym trybem myślenia oraz licencją MIT. Liczba pobrań w chwili pisania wynosi kilkadziesiąt: to wrzutka, którą pierwszego dnia wyłapałby tylko obserwator repozytoriów.
• 4 września — portal deweloperski Ling-platform firmy Ant dodał samouczek dotyczący rozumienia multimodalnego, dokumentujący model w oficjalnym API (strona we własnej stopce „ostatnia aktualizacja” wskazuje 4 września 2026). Chińskie media deweloperskie poinformowały o tej funkcji następnego dnia, określając ją jako rozumienie obrazów i krótkich filmów do wizualnego odpowiadania na pytania i analizy treści.
• Od 5 września — szybko pojawiło się wsparcie w zakresie serwowania i wdrażania: podręcznik wdrożeniowy SGLang dla tego modelu, niestandardowy fork vLLM utrzymywany przez organizację inclusionAI oraz lista bibliotek wdrożeniowych typu bring-your-own-weights z gotowym endpointem chat-completions. To środowiska uruchomieniowe i infrastruktura, a nie ogłoszenia, ale pokazują, że model został zbudowany do serwowania, a nie tylko opublikowania.
• 8 września — dołączono kwantyzację FP8 dla inclusionAI/Ling-3.0-flash-VL-fp8 (64 shardy, ~126 GB), przy czym wieża wizyjna celowo pozostała w wyższej precyzji, a wagi MoE są skompresowane do FP8 E4M3. Dla samodzielnego hostowania na mniejszej liczbie lub mniejszych GPU, to właśnie ten checkpoint pobierze większość osób.

Karta powyżej to coś, co w tym wydaniu najbardziej przypomina post premierowy — opis modelu, architektura, linki do przepisów SGLang i vLLM, a nigdzie indziej nie znajdujemy żadnego ogłoszenia. Warto od razu zwrócić uwagę na rozbieżność: karta modelu mówi o „tylko 5.5B parametrów aktywowanych na token”, podczas gdy książka kucharska SGLang napisana mniej więcej w tym samym czasie opisuje model z „5.1B aktywnych” parametrów. W przypadku nowego checkpointu różnica wynika prawdopodobnie ze sposobu liczenia parametrów wieży wizyjnej, a nie z istnienia dwóch różnych modeli, ale to właśnie taki szczegół powinien być oznaczony jako niepewny, a nie wygładzony.
Model 124B, który aktywuje 5,5B — teraz z oczami
Ling-3.0-flash-VL zachowuje hybrydową recepturę rzadkiego MoE, która zdefiniowała tekstowego bliźniaka. Karta opisuje 42-warstwowy szkielet, w którym warstwy Kimi-Delta-Attention i Gated-MLA pojawiają się naprzemiennie w stosunku 5:1 — taki sam rytm strukturalny jak w Ling-3.0-flash — z łączną liczbą parametrów około 124,8 miliarda, z których tylko niewielka część jest aktywowana na każdy token. Nowością jest moduł percepcji: wizualny enkoder ViT przekazujący dane przez dwuwarstwowy projektor MLP do językowego szkieletu, a także VideoRoPE, które koduje pozycję zarówno przestrzenną, jak i czasową, dzięki czemu klatki wideo docierają w kolejności, którą model może przetworzyć. Wejście to tekst, obraz i wideo; wyjście to tekst.
• Parametry — 124B łącznie, ~5,5B aktywowanych na token według karty dostawcy (patrz powyższa uwaga dotycząca liczenia).
Kontekst — reklamowany jako „do 1M tokenów"; istniejące dziś przepisy wdrożeniowe wykorzystują 256K poprzez skalowanie RoPE YaRN, co jest uczciwą praktyczną wartością, na której należy oprzeć planowanie, dopóki ktoś nie opublikuje zweryfikowanego dłuższego przebiegu.
• Myślenie — rozumowanie jest domyślnie włączone poprzez szablon czatu; zarówno oficjalne przykłady API, jak i przepisy serwowania pokazują enable_thinking: false jako przełącznik per żądanie dla wywołań wrażliwych na opóźnienia.
• Licencja — MIT, w obu formatach precyzji, bez dodatkowych zastrzeżeń. To ta sama czysta licencja, która uczyniła sierpniowe udostępnienie kodu modelu tekstowego godnym uwagi, i to ona jest głównym powodem, dla którego samodzielne hostowanie jest realną opcją, a nie szarą strefą.
Intencja projektowa jest równie ważna jak specyfikacja techniczna. Ant pozycjonuje Ling-3.0-flash-VL jako model, który „wprowadza informacje wizualne do pełnego procesu rozumienia, rozumowania, działania i weryfikacji" — a to język zadań agentowych, nie podpisywania obrazów. Model, który potrafi obejrzeć 30-sekundowe nagranie ekranu, utrzymać w kontekście długą sesję wywoływania narzędzi i utrzymać koszt aktywowanych parametrów na poziomie bliskim 5 mld, jest wymierzony wprost w agentów obsługi komputera i agentów opartych na krótkich wideo. To inny produkt niż modele wizyjno-językowe zoptymalizowane pod kątem odpowiadania na pytania o pojedyncze obrazy, i w tej perspektywie należy czytać każdy benchmark poniżej.
Co tak naprawdę akceptuje oficjalne API
Samouczek platformy Ant Ling dokumentuje Ling-3.0-flash-VL w dwóch postaciach API: endpoint kompatybilny z OpenAI pod adresem api.ant-ling.com/v1/chat/completions oraz endpoint kompatybilny z Anthropic pod adresem api.ant-ling.com/anthropic/v1/messages. Warto znać ograniczenia, zanim zaczniesz na niej budować:
• Obrazy — JPEG i PNG, tylko base64, do 40 obrazów na żądanie, każdy obraz do 16 384 × 784 pikseli i każdy ciąg base64 do 32 MB. Zgodny z OpenAI image_url.detail parametr jest ignorowany; silnik decyduje o rozdzielczości wewnętrznie.
• Wideo — MP4, MOV lub WMV, jeden klip na żądanie, ograniczony do 30 sekund, próbkowany ze stałą częstotliwością 2 klatek na sekundę, maksymalnie 32 klatki, base64 do 32 MB. Wideo działa wyłącznie na punkcie końcowym zgodnym z OpenAI; punkt końcowy zgodny z Anthropic przyjmuje tekst i obrazy, ale nie wideo.
• Identyfikator modelu — przykłady curl z samouczka wywołują model Ling-3.0-flash-VL-rc1 zamiast Ling-3.0-flash-VL. Ten przyrostek -rc1 to oznaczenie wersji release-candidate i realne otwarte pytanie: w dokumentacji nie ma informacji, jakie wagi udostępnia platforma ani czy punkt kontrolny API odpowiada buildowi otwartych wag z 4 września. Jeśli oceniasz API względem otwartych wag, to jest to pierwsza rzecz do przetestowania, a nie założenie.

Powyższa strona to miejsce, w którym znajdują się ograniczenia wejściowe — formaty obrazów i wideo, limity na żądanie oraz dwa kształty punktów końcowych. To także miejsce, w którym potwierdza się, że model jest działającą komercyjną ofertą API, a nie tylko atrapą istniejącą w dokumentacji.
Liczby — i kto je podał

Jedyną liczbą w nagłówku na karcie modelu jest 42 w protokole Artificial Analysis Intelligence Index w wersji 4.1.1, które — według Anta — daje cztery punkty przewagi nad wynikiem 38 dla tekstowego Ling-3.0-flash. To rozróżnienie w tym zdaniu jest kluczowe. 38 to pomiar Artificial Analysis — przeprowadzony niezależnie, opublikowany w ich rankingu i cytowany z uznaniem w branżowych doniesieniach o modelu tekstowym. 42 to natomiast deklaracja na własnej karcie modelu Anta, sporządzona według protokołu indeksu AA, ale jeszcze nieuwzględniona przez Artificial Analysis, które w chwili pisania tego tekstu nie miało strony dla Ling-3.0-flash-VL. Nikt poza Antem nie uruchomił jeszcze tego checkpointu. Traktuj 42 jako liczbę od dostawcy, z tej samej rodziny, która wyprodukowała autentyczne 38 dla modelu tekstowego — jako powód, by się przyjrzeć, a nie jako liczbę, którą można przytaczać jako potwierdzoną.
Wszystko inne w tej publikacji ma charakter jakościowy lub metodologiczny. Karta modelu przedstawia model na wykresie możliwości „rozumiej, rozumuj, działaj” i wspomina o ewaluacji agentowej Terminal-Bench przeprowadzonej według protokołu w stylu AA, ale nie publikuje żadnych numerycznych wyników, które moglibyśmy tutaj przytoczyć; poradnik wdrożeniowy wymienia wyniki dokładności (MMMU-Pro, GSM8K) powiązane z konkretnymi konfiguracjami serwowania, które warto przeczytać, ale są to pomiary związane z infrastrukturą, a nie niezależne ewaluacje. Uczciwe podsumowanie jest krótkie: to wiarygodny, tani w serwowaniu model rozumujący z obsługą wizji, który nie ma jeszcze publicznej, niezależnej tablicy wyników.
Ile to kosztuje i co sugeruje historia rodziny.
Wielomodalny tutorial Anta nie podaje ceny za token dla Ling-3.0-flash-VL, więc wszystko tutaj to wnioskowanie, wyraźnie tak oznaczone. Użyteczną kotwicą jest tekstowy odpowiednik na tej samej platformie: oficjalna cena katalogowa Ling-3.0-flash wynosi około 0,075 USD za 1 mln tokenów wejściowych i 0,22 USD za 1 mln tokenów wyjściowych, przy czym odczyty z cache są o około 80% tańsze, a chińska konsola wycenia go w renminbi (0,40 CNY za wejście / 1,20 CNY za wyjście za 1 mln tokenów) po wcześniejszej promocji z 70% zniżką, która zakończyła się 31 sierpnia. Model wielomodalny 124B-A5.5B jest droższy w utrzymaniu niż model tekstowy 124B-A5.1B — wieża wizyjna jest gęsta i działa dla każdego tokena obrazu — więc cena na poziomie tego przedziału lub nieco powyżej jest rozsądnym założeniem wyjściowym. Historia rodziny modeli działa jednak też w drugą stronę: warianty domenowe Fin i Sante zadebiutowały jako darmowe API, więc Ant pokazał, że potrafi stosować zerową cenę, aby zaszczepić adopcję wariantu Linga, który chce wprowadzić na rynek. To, czy VL pójdzie w ślady płatnego modelu tekstowego, czy wzorca darmowego wariantu, po prostu nie jest jeszcze publiczną informacją.
W przypadku ścieżki self-hostingu liczby są konkretne, bo pliki są publiczne. Wydanie bf16 to około 250 GB do pobrania podzielone na 64 shardy — na każdym węźle poza największymi pojedynczymi węzłami wymaga to wielu GPU — natomiast wydanie FP8 (~126 GB, wieża wizyjna w bf16) mieści się wygodnie na węźle z 8 akceleratorami klasy 80 GB i to właśnie tę wersję uruchomi większość zespołów. W książce kucharskiej o serwowaniu są deklaracje przepustowości, ale pochodzą one od dostawców; spodziewaj się zwykłego zastrzeżenia, że realna liczba tokenów na sekundę zależy od twojego sprzętu i rozmiaru batcha.
Gdzie pasuje warstwa routingu — szczerze mówiąc
W momencie premiery żadna z większych zewnętrznych bram modeli, które sprawdziliśmy, nie wymienia Ling-3.0-flash-VL, a OrcaRouter — platforma routingu, do której należy ten blog — również go nie obsługuje. Nic w tym wpisie nie powinno sugerować, że jest inaczej. To uczciwy stan czterodniowego modelu i warto powiedzieć to wprost, ponieważ opcje, które czytelnik faktycznie ma dziś, są dokładnie dwie: skorzystać z oficjalnego API Ant lub samodzielnie hostować wagi na licencji MIT. Kwestia routingu to jednak to, co wydarzy się dalej. Gdy taki model trafi do obsługi przez zewnętrznych dostawców, ekonomia routera typu pass-through jest powodem, dla którego warto go wybrać do ewaluacji: cena katalogowa dostawcy przekazywana dalej z zerową marżą, więc obniżka ceny przez dostawcę (lub eksperyment z darmowym poziomem, jak premiery Fin i Sante) jest aktywna tego samego dnia, w którym została ogłoszona, a automatyczne przełączanie awaryjne pozwala skierować realne obciążenie na kilkudniowy otwarty model bez stawiania całego stosu technologicznego na dostępności jednego dostawcy czy zachowaniu jednego checkpointu. Dla rodziny modeli, która raz zmieniła cennik i w ciągu sześciu tygodni rozpadła się na cztery warianty, to nie jest hipoteza — to różnica między ręcznym testowaniem od nowa za każdym razem, gdy Ant coś zmienia, a testowaniem od nowa raz, przez jedno API.
Co obejrzeć
To wydanie jest na tyle świeże, że przydatne sygnały to głównie kontrole, które każdy może przeprowadzić. Po pierwsze, czy Artificial Analysis (lub inne niezależne laboratorium) umieszcza Ling-3.0-flash-VL na liście i potwierdza lub koryguje 42 — ten pojedynczy punkt danych oddziela „najlepszy model rodziny” od „kolejnego numeru innego producenta”. Po drugie, czy -rc1, identyfikator na oficjalnym API, wskazuje na otwarte wagi z 4 września; jeśli nie, to API i samodzielne hostowanie to różne modele, więc każde porównanie, które czytasz, musi informować, którego użyto. Po trzecie, ceny: opublikowana stawka VL na platformie Ling i to, czy podąża za płatnym progiem modelu tekstowego, czy za scenariuszem darmowego API Fin/Sante. Po czwarte, czy punkt kontrolny FP8 utrzymuje dokładność karty w prawdziwym serwisie — wieża wizyjna w bf16 to dobry znak, ale twierdzenia o skwantowanej wizji wymagają uruchomienia, a nie konfiguracji. I po piąte, kwestia mapy produktów: skoro wizja jest teraz w szybkiej linii Ling, trzeba obserwować, czy Ant pozostawi Ming jako osobną markę multimodalną, czy pozwoli im się zbiec.
Dla programisty odpowiedź na najbliższy czas jest krótka. Jeśli chcesz na tym budować już dziś, oficjalne API to ścieżka zerowej infrastruktury, a wagi FP8 to ścieżka samodzielnego hostowania — i obie są realne od tego tygodnia. Jeśli chcesz budować na liczbie 42, poczekaj, aż ktoś spoza Ant ją odtworzy. Wszystko, co jest naprawdę przydatne w Ling-3.0-flash-VL — wagi MIT, wiarygodna architektura, agresywny projekt relacji ceny do aktywacji i wynik dostawcy, który warto traktować poważnie — już jest na miejscu; wszystko, co uczyniłoby z niego bezpieczną opcję domyślną, wciąż pozostaje do zrobienia.
