Ling-3.0-flash: Co faktycznie wiemy o nowym Fast-Tier MoE Ant Group (a czego nie wiemy)
Guides & Insights

Ling-3.0-flash: Co faktycznie wiemy o nowym Fast-Tier MoE Ant Group (a czego nie wiemy)

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Laboratorium InclusionAI firmy Ant Group wypuściło Ling-3.0-flash około 23 lipca 2026 roku — co oznacza, że ma zaledwie kilka dni w momencie pisania tego briefu. Jest to model językowy typu mixture-of-experts (MoE) z łącznie 124B parametrami i około 5,1B aktywnymi na token (współczynnik rzadkości około 24:1), zaprojektowany do generowania tekstu i wywoływania narzędzi. Jest pozycjonowany jako szybka, tania warstwa rodziny Ling; flagowe miejsce nadal należy do znacznie większego Ling-2.6-1T (1T łącznie / 63B aktywnych). Obecnie dostęp jest tylko przez API — za pośrednictwem własnego portalu deweloperskiego Ant, przez OpenRouter jako inclusionai/ling-3.0-flash oraz przez ZenMux.

To jest w pełni potwierdzony obraz i warto być szczerym, dlaczego ten opis jest bardziej ostrożny niż typowy opis modelu. Nie ma wag Hugging Face, repozytorium GitHub dla Ling-V3 ani jasnego oświadczenia licencyjnego – to realna zmiana w porównaniu z Ling 2.0 i Ling 2.6, które były wydane jako otwarte wagi na licencji MIT. Nie ma również żadnych niezależnych danych benchmarkowych: Artificial Analysis, najczęściej cytowany zewnętrzny ewaluator dla tej klasy modeli, nie ma jeszcze dla niego strony. Każda liczba wydajności i szybkości, która obecnie krąży, pochodzi bezpośrednio od Ant Group.

Krótko mówiąc. Ling-3.0-flash to model MoE 124B/5.1B aktywny od Ant Group's InclusionAI, wydany w ciągu ostatnich kilku dni, tylko przez API, bez wag Hugging Face i niepotwierdzonej licencji. Twierdzenia dostawcy — szczytowa przepustowość 1000 tokenów/s, czas do pierwszego tokena poniżej 100 ms — nie mają jeszcze niezależnej weryfikacji, a dla tego konkretnego modelu nie ma wyniku Artificial Analysis. Poprzednia generacja Ling-2.6-flash uzyskała wskaźnik Artificial Analysis Intelligence Index na poziomie 14 (Ling-2.6-1T uzyskał 26), co jest użytecznym kontekstem, ale nie zastępuje rzeczywistych możliwości modelu Ling-3.0-flash. Ceny (¥0,40 za wejście / ¥1,20 za wyjście na 1 mln tokenów, obecnie bezpłatnie w tygodniu premiery z 500 tys. darmowych tokenów dziennie) są wyraźnie promocyjne i prawdopodobnie ulegną zmianie. Traktuj wszystko tutaj jako podgląd, a nie werdykt.

Najważniejsze wnioski

To jest szybka/tania warstwa, a nie flagowiec.Ling-2.6-1T pozostaje największym modelem InclusionAI; Ling-3.0-flash jest mniejszym, tańszym, szybszym modelem siostrzanym skierowanym do zastosowań o dużym wolumenie.

Nie istnieje jeszcze żaden niezależny benchmark.Artificial Analysis nie ma strony dla Ling-3.0-flash. Jedynymi publicznymi danymi są własne dane Ant Group, a dokumentacja Ant obecnie nie pokazuje żadnej tabeli benchmarków dla tego modelu w ogóle.

Twierdzenia o prędkości pochodzą wyłącznie od dostawcy. Szczytowe 1000 tokenów/s i czas do pierwszego tokena poniżej 100 ms pochodzą od Ant Group, bez testu przepustowości przez stronę trzecią potwierdzającego którąkolwiek z tych wartości.

Brak otwartych wag, licencja niepotwierdzona. Nie ma repozytorium Hugging Face ani projektu Ling-V3 na GitHub. Poprzednie generacje Ling były na licencji MIT; nie wiadomo, czy 3.0-flash pójdzie w ich ślady.

Cennik to promocja z okazji tygodnia premiery.Opłata ¥0.40/¥1.20 za 1M tokenów na Ant's platform jest obecnie zniesiona, z 500k darmowych tokenów dziennie i darmową listą OpenRouter — żadne z tych warunków nie powinno być brane za pewnik po zakończeniu promocji.

To jeden element z rodziny trzech modeli. InclusionAI dzieli swoją ofertę na Ling (uniwersalny MoE, ten model), Ring (skoncentrowany na rozumowaniu) oraz Ming (multimodalny).

Uwaga dotycząca sposobu czytania tego zestawienia: każda specyfikacja, benchmark i cena poniżej są oznaczone źródłem. Tam, gdzie jedynym źródłem jest Ant Group, mówimy to wprost i odpowiednio zastrzegamy. Tam, gdzie poprzednie generacje modeli Ling mają niezależne wyniki, przytaczamy je dla kontekstu – nie jako substytut danych o samym Ling-3.0-flash, które jeszcze nie istnieją. Prawdopodobnie będzie to wymagało aktualizacji po tym, jak niezależne testy nadrobią zaległości.

Co tak naprawdę wiemy

Architektonicznie Ling-3.0-flash jest rzadkim modelem MoE: łącznie 124B parametrów, z czego około 5,1B jest aktywnych dla każdego tokena, co sprawia, że jest tani i szybki w działaniu w stosunku do swojego całkowitego rozmiaru. Okno kontekstu wynosi 256K tokenów według własnej dokumentacji Ant, a dostawca twierdzi, że można je rozszerzyć do 1M; lista OpenRouter pokazuje 262 144 tokenów, co odpowiada wartości 256K. Maksymalna długość odpowiedzi nie została ujawniona w żadnym dostępnym źródle. Model obsługuje standardowe generowanie tekstu i wywoływanie narzędzi, ale nie wspomniano o żadnym multimodalnym wejściu lub wyjściu – ta funkcjonalność należy do oddzielnej linii Ming.

Dostępność: obraz jest dostępny tylko przez API i jest spójny na trzech trasach, które znaleźliśmy: własna platforma deweloperska Ant Group, OpenRouter (wymieniony jako inclusionai/ling-3.0-flash) i ZenMux. Żadna z nich nie udostępnia wag do pobrania. Nie ma strony organizacji GitHub dla projektu „Ling-V3”, a dokumentacja Ant nie podaje licencji dla tego konkretnego modelu – znacząca luka, ponieważ Ling 2.0 i Ling 2.6 zostały wydane jako otwarte wagi na licencji MIT. Dopóki InclusionAI tego nie wyjaśni, nie zakładaj, że Ling-3.0-flash stanie się otwarty, i nie zakładaj, że nie.

Luki: co jest niezweryfikowane

Największą luką są benchmarki. W chwili pisania tego tekstu Artificial Analysis — niezależny ewaluator najczęściej cytowany właśnie dla tej klasy modeli — nie ma strony dla Ling-3.0-flash; wzorzec URL, który normalnie by go hostował, zwraca błąd 404. Oznacza to, że obecnie nie ma wyników rozumowania, kodowania ani matematyki dla tego modelu od zewnętrznych ewaluatorów, ani od Artificial Analysis, ani od żadnego innego niezależnego ewaluatora, którego moglibyśmy znaleźć. Własna dokumentacja Anta pogłębia ten problem: w ogóle nie publikuje tabeli benchmarków dla 3.0-flash, ani od dostawcy, ani inaczej, co jest nietypowe dla wydania modelu i samo w sobie warte odnotowania.

Dla zgrubnego kontekstu, modele Ling poprzedniej generacji mają niezależne wyniki. Ling-2.6-flash uzyskał wynik Artificial Analysis Intelligence Index wynoszący 14, a większy model Ling-2.6-1T zdobył 26 — oba znacznie odstają od wiodących modeli open-weight śledzonych przez Artificial Analysis w tamtym czasie. Własne dane dostawcy Ant dla Ling-2.6-flash podawały 61.2% w SWE-bench Verified i 73.85% w AIME2026. Żadnej z tych liczb nie należy bezpośrednio przypisywać modelowi Ling-3.0-flash; nowa generacja z nową architekturą może przesunąć się w każdym kierunku, a dopóki niezależny ewaluator faktycznie go nie uruchomi, każde stwierdzenie o możliwościach 3.0-flash jest zgadywaniem ubranym w fakt.

Deklaracje dostawcy dotyczące prędkości: szybkie na papierze, niezweryfikowane w praktyce.

Głównym punktem sprzedaży Ant Group w zakresie wydajności Ling-3.0-flash nie jest jakość rozumowania — to surowa prędkość. Producent twierdzi, że osiąga szczytową przepustowość 1000 tokenów na sekundę i czas do pierwszego tokena poniżej 100 milisekund, co byłoby naprawdę szybkie, gdyby się potwierdziło. Jednak „gdyby się potwierdziło” odgrywa tu kluczową rolę: liczby te pochodzą wyłącznie z materiałów Ant Group, zmierzone w warunkach kontrolowanych przez Ant i nie w pełni ujawnionych (sprzęt, rozmiar partii, długość promptu i obciążenie znacząco wpływają na wartości przepustowości). Żadne niezależne laboratorium nie opublikowało ponownego pomiaru. Dopóki ktoś spoza Ant nie przeprowadzi porównywalnego testu, traktuj 1000 tok/s i TTFT poniżej 100 ms jako dane marketingowe, które warto zweryfikować na swoim własnym obciążeniu, a nie potwierdzone fakty.

Ceny i dlaczego są ruchomym celem

Na własnej platformie Ant Group cennik Ling-3.0-flash wynosi ¥0.40 za 1M tokenów wejściowych i ¥1.20 za 1M tokenów wyjściowych — celowo tanie, zgodnie z pozycjonowaniem jako szybka/tania warstwa. Ale ten cennik nie jest tym, co ktokolwiek obecnie płaci: Ant prowadzi promocję bezpłatnego tygodnia startowego, a także osobno oferuje 500k darmowych tokenów dziennie na swojej platformie. Na liście OpenRouter widnieje wariant ling-3.0-flash:free po $0/$0. Nic z tego nie należy mylić ze stabilną ceną. Promocje startowe wygasają, darmowe warstwy są ograniczane, a same kwoty ¥0.40/¥1.20 mogą się zmienić, gdy pojawią się rzeczywiste dane o użyciu. Jeśli planujesz wydatki produkcyjne w oparciu o ten model, budżetuj wg cennika, a nie promocyjnego, i sprawdź ponownie przed podjęciem zobowiązania.

Rodzina Ling / Ring / Ming

Ling-3.0-flash nie istnieje w izolacji — InclusionAI organizuje swoje wydania w trzy nazwane rodziny, każda przeznaczona do innego zadania. Ling to ogólnego przeznaczenia linia MoE, obejmująca codzienne generowanie tekstu i wywoływanie narzędzi; Ling-3.0-flash znajduje się na szybkim/tanim końcu tej linii, a Ling-2.6-1T wciąż pozostaje większym flagowcem. Ring to linia InclusionAI skoncentrowana na rozumowaniu, stworzona do zadań, które opierają się na wieloetapowym chain-of-thought, a nie na surowej przepustowości. Ming to linia multimodalna, obsługująca obrazy i inne modalności nietekstowe, których Ling sam nie dotyka. Jeśli twoje zadanie wymaga intensywniejszego rozumowania lub multimodalnego wejścia, odpowiednim modelem InclusionAI prawdopodobnie nie jest Ling-3.0-flash — został zbudowany dla wydajności i szybkości w obszarze tekstu i narzędzi, a nie dla wkraczania na terytorium pozostałych dwóch rodzin.

Dla kogo to jest: trzy scenariusze

1. Potoki przetwarzania tekstu lub wywoływania narzędzi o dużej objętości i wrażliwe na opóźnienia — jako pilotaż, a nie zobowiązanie

Jeśli Twój obciążenie jest zdominowane przez wrażliwą na przepustowość generację tekstu lub wywoływanie narzędzi — czat, lekkie agenty, wysokoczęstotliwościowe wywołania API — pozycjonowanie Ling-3.0-flash (mała liczba aktywnych parametrów, deklarowany czas TTFT poniżej 100 ms, prawie darmowa cena uruchomienia) sprawia, że warto zrobić pilotaż. Haczyk polega na tym, że "warto zrobić pilotaż" różni się od "warto przełączyć ruch produkcyjny". Przy zerowych niezależnych danych porównawczych, to Ty jesteś teraz benchmarkiem: przeprowadź własny zestaw ewaluacyjny przez to zanim zaufasz temu w czymś skierowanym do klientów, i nie buduj modeli kosztowych w oparciu o obecne promocyjne ceny.

2. Zespoły potrzebujące długiego kontekstu przy ograniczonym budżecie

Okno kontekstu o wielkości 256K (z deklaracją producenta o możliwości rozszerzenia do 1M) przy rzeczywiście niskiej cenie katalogowej to atrakcyjne połączenie dla przypadków użycia wymagających intensywnego wyszukiwania lub przetwarzania dokumentów – pod warunkiem, że rzeczywista jakość rozumowania modelu utrzymuje się na tej długości kontekstu, co, ponownie, nie zostało przetestowane przez żadne niezależne źródło. Jest to rozsądny kandydat do umieszczenia na krótkiej liście obok utrwalonych tanich opcji z długim kontekstem, ale należy go oceniać obok nich, a nie przyjmować wyłącznie na podstawie specyfikacji Ant.

3. Obserwatorzy śledzący krajobraz MoE w Chinach oraz mapę drogową InclusionAI

Dla zespołów śledzących krajobraz konkurencyjny chińskich otwartych i półotwartych laboratoriów modelowych, a nie wdrażających pojedynczy model w produkcji, Ling-3.0-flash jest użytecznym punktem danych: sygnalizuje, że InclusionAI szybko iteruje na swoim szybkim poziomie, potencjalnie wycofując się z otwartych wag (przynajmniej na razie) i nadal stawia na strukturę trzech rodzin (Ling/Ring/Ming) zamiast jednego ogólnego modelu. Warto dodać do zakładek i wrócić do niego, gdy pojawi się jasność co do benchmarków i licencji.

Kiedy nie używać

Pomiń Ling-3.0-flash w przypadku wszystkiego, gdzie potrzebujesz powołać się na zweryfikowane twierdzenie o możliwościach — nie ma niezależnego benchmarku, do którego można by się odnieść, więc każde stwierdzenie na temat jego zdolności do rozumowania, kodowania lub matematyki jest obecnie niemożliwe do zweryfikowania. Pomiń go, jeśli potrzebujesz otwartych wag do samodzielnego hostowania, dostrajania lub ze względów zgodności; żadne nie są dostępne, a licencja dla tego konkretnego modelu nie została nawet określona, a co dopiero potwierdzona jako permisywna. Pomiń go w przypadku zadań multimodalnych — to zadanie linii Ming, a nie Ling. I zachowaj ostrożność przy budowaniu modelu kosztów w oparciu o obecne ceny: darmowy tydzień uruchomienia, 500k darmowych tokenów dziennie oraz darmowy poziom OpenRouter są promocyjne, a cena katalogowa ¥0,40/¥1,20, do której prawdopodobnie powróci, nie została jeszcze przetestowana w rzeczywistych wzorcach użycia.

Często zadawane pytania

Czy Ling-3.0-flash ma otwarte wagi?

Obecnie nie. Nie ma repozytorium Hugging Face ani projektu Ling-V3 na GitHubie w chwili pisania tego tekstu. Poprzednie generacje Ling (2.0 i 2.6) zostały wydane na licencji MIT jako otwarte wagi, ale nic nie potwierdza, że Ling-3.0-flash pójdzie w ich ślady — ani że tego nie zrobi.

Jak Ling-3.0-flash radzi sobie w benchmarkach?

Nie ma jeszcze niezależnego benchmarku dla tego modelu – Artificial Analysis nie ma dla niego strony. Dokumentacja Ant Group również nie publikuje tabeli benchmarków. Dla przybliżonego kontekstu historycznego, poprzednia generacja Ling-2.6-flash uzyskała wynik 14 w Indeksie Inteligencji Artificial Analysis, a Ling-2.6-1T – 26, jednak żadnej z tych wartości nie należy przenosić na nową generację.

Jak szybkie to naprawdę jest?

Ant Group twierdzi, że szczytowa przepustowość wynosi 1000 tokenów/s, a czas do pierwszego tokena poniżej 100 ms. Obie te wartości pochodzą wyłącznie od dostawcy i jak dotąd nie opublikowano niezależnego pomiaru. Traktuj je jako deklaracje do zweryfikowania na własnym obciążeniu, a nie potwierdzoną wydajność.

Ile kosztuje Ling-3.0-flash?

Cennik na platformie Ant wynosi ¥0,40 za 1 mln tokenów wejściowych i ¥1,20 za 1 mln tokenów wyjściowych, ale obecnie jest darmowy w ramach promocji z okazji tygodnia premiery, dostępne jest także 500 tys. darmowych tokenów dziennie. OpenRouter również udostępnia darmowy wariant. Należy spodziewać się zmian tych warunków promocyjnych.

Jak duże jest okno kontekstowe?

256K tokenów zgodnie z dokumentacją Anta, z zapewnieniem sprzedawcy, że można go rozszerzyć do 1M. Lista OpenRoutera pokazuje 262 144 tokeny, co jest zgodne z liczbą 256K. Maksymalna długość wyjścia nie jest ujawniona.

Jaka jest różnica między Ling, Ring i Ming?

Ling to ogólnego przeznaczenia linia MoE do tekstu i wywoływania narzędzi od InclusionAI, a Ling-3.0-flash znajduje się na jej szybkim/tanim końcu. Ring to linia skoncentrowana na rozumowaniu. Ming zajmuje się zadaniami multimodalnymi. Są to osobne rodziny modeli zbudowane do różnych zadań, a nie poziomy tego samego modelu.

Czy Ling-3.0-flash jest tym samym co Ling-2.6-1T?

Nie. Ling-2.6-1T to większy flagowy model InclusionAI (1T całkowitych / 63B aktywnych parametrów) i pozostaje osobnym, większym modelem. Ling-3.0-flash (124B całkowitych / ~5.1B aktywnych) to nowsze, mniejsze, szybsze wydanie.

Czy powinienem użyć Ling-3.0-flash w produkcji dzisiaj?

Dopiero po przeprowadzeniu własnej oceny. Bez niezależnego benchmarku, niepotwierdzonej licencji i cen, które są obecnie promocyjne, rozsądne jest przeprowadzenie pilotażu, ale przedwczesne byłoby powierzenie mu obciążeń krytycznych dla produkcji lub wrażliwych pod względem zgodności bez własnych testów i planu na to, co się stanie po zakończeniu warunków promocyjnych.

Sedno sprawy

Ling-3.0-flash to naprawdę nowe wydanie warte śledzenia – model MoE o 124B/5.1B aktywnych parametrach, celujący w szybkie, tanie i wysokonakładowe przetwarzanie tekstu oraz wywoływanie narzędzi, pochodzący z laboratorium, które wcześniej wypuściło wiarygodne modele. Ale na razie to tylko arkusz specyfikacji i zestaw twierdzeń dostawcy, a nie zweryfikowany produkt: brak niezależnych benchmarków, brak otwartych wag, brak potwierdzonej licencji, a cena jest wyraźnie promocyjna. To nie powód, by go odrzucić – to powód, by przetestować go ostrożnie, zweryfikować twierdzenia, które są dla ciebie bezpośrednio istotne, i wrócić do tej notki, gdy Artificial Analysis lub inny niezależny ewaluator opublikuje rzeczywiste dane.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube