
Ling-3.0-flash: Co obecnie wiemy o modelu MoE open-weight szybkiej klasy od Ant Group
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Laboratorium InclusionAI firmy Ant Group oficjalnie wydało model Ling-3.0-flash — ogłoszony 24 lipca 2026 r. i udostępniony jako open source na licencji MIT 7 sierpnia — a sytuacja zmieniła się znacząco od czasu zapowiedzi, którą opublikowaliśmy tutaj w lipcu. To natywny model hybrydowego rozumowania typu mixture-of-experts z łącznie 124B parametrów i zaledwie 5,1B aktywnymi na token, zaprojektowany jako szybka i tania warstwa rodziny Ling. Dwie liczby, które zmieniły wszystko: Artificial Analysis wycenia go obecnie na 38 w Indeksie Inteligencji (o 24 punkty więcej niż poprzednia generacja szybkiej warstwy, Ling-2.6-flash) i umieszcza go na otwartej granicy Pareto pod względem inteligencji w stosunku do całkowitej liczby parametrów. Wagi są dostępne na Hugging Face i ModelScope.
Gdy po raz pierwszy omawialiśmy ten model 24 lipca, uczciwe podsumowanie brzmiało: tylko API, brak wag, brak oświadczenia licencyjnego, brak niezależnych benchmarków. Wszystkie te cztery stwierdzenia są już nieaktualne. Ant udostępnił wagi na licencji MIT 7 sierpnia, a Artificial Analysis opublikowało od tego czasu pełną niezależną ocenę. Ta aktualizacja rewiduje oryginalny opis — etykiety „niezweryfikowane”, które dominowały w lipcowym poście, dotyczą teraz znacznie węższego zbioru twierdzeń, przede wszystkim deklarowanych przez Anta szczytowych prędkości, a nie całego modelu.
TL;DR.Ling-3.0-flash to szybki model MoE o otwartych wagach od Ant Group: 124B całkowitych / 5.1B aktywnych parametrów, licencja MIT, 256K natywnego kontekstu (262K w wersji serwowanej). Według Artificial Analysis jego wynik w Intelligence Index to 38 — o 24 punkty więcej niż w poprzedniej generacji Ling-2.6-flash, co plasuje go na granicy Pareto dla modeli o otwartych wagach pod względem inteligencji w stosunku do całkowitej liczby parametrów — a zmierzona prędkość generowania to około 368 tokenów na sekundę. Wagi są dostępne na Hugging Face i ModelScope na licencji MIT. Nadal tylko od dostawcy: deklarowana szczytowa przepustowość ponad 1100 tokenów na sekundę, czas do pierwszego tokena poniżej 100 ms oraz tabela benchmarków w karcie modelu. Ceny w oficjalnym API: 0,075 USD za 1 mln tokenów wejściowych / 0,22 USD za 1 mln tokenów wyjściowych (80% zniżki przy trafieniach w cache); darmowy poziom startowy zakończył się 3 sierpnia.
Najważniejsze wnioski
• To szybki/tani wariant, a nie model flagowy. Flagowy model poprzedniej generacji z 1T parametrów pozostaje największym modelem InclusionAI; Ling-3.0-flash to mniejszy, szybszy brat przeznaczony do przetwarzania dużych ilości tekstu i wywoływania narzędzi.
• Wagi są teraz otwarte na licencji MIT. Wagi trafiły na Hugging Face (inclusionAI/Ling-3.0-flash) i ModelScope 7 sierpnia na licencji MIT — co stanowi odwrócenie lipcowego obrazu „tylko API”.
• Wreszcie ma niezależny wynik. Artificial Analysis mierzy wskaźnik inteligencji na poziomie 38, wzrost o 24 w porównaniu z Ling-2.6-flash, i umieszcza model na granicy Pareto dla modeli o otwartych wagach pod względem inteligencji w stosunku do całkowitej liczby parametrów.
• Prędkość jest teraz częściowo mierzona.AA osiąga ok. 368 tokenów/sek na wyjściu i ~1,98 s do pierwszego tokenu; szczytowy wynik 1 100+ tokenów/sek deklarowany przez Anta to wciąż wyłącznie dane od dostawcy.
• Ceny są ustalone, a darmowy start dobiegł końca. Oficjalne API podaje 0,075 USD za wejście / 0,22 USD za wyjście na 1 mln tokenów z 80% zniżką przy trafieniu w cache; darmowa warstwa startowa zakończyła się 3 sierpnia.
• To jeden element rodziny składającej się z trzech modeli. InclusionAI dzieli swoją ofertę na Ling (ogólnego przeznaczenia MoE do tekstu i narzędzi, ten model), Ring (rozumowanie) i Ming (multimodalny).
Uwaga o tym, jak czytać tę aktualizację: to jest rewizja wersji zapoznawczej z 24 lipca, napisana po opublikowaniu wag i pojawieniu się pierwszych niezależnych wyników. Każda specyfikacja, benchmark i cena poniżej są oznaczone źródłem. Gdy jedynym źródłem jest Ant Group — czyli deklaracje o szczytowej szybkości i tabela wyników benchmarków z karty modelu — mówimy to wprost. Tam, gdzie Artificial Analysis zmierzyła coś niezależnie, cytujemy to.
Co tak naprawdę wiemy
Architektura jest teraz w pełni udokumentowana na karcie modelu. Ling-3.0-flash wykorzystuje natywny hybrydowy liniowy stos uwagi — Kimi Delta Attention (KDA) oraz warstwy Gated MLA naprzemiennie w stosunku 5:1 (35 KDA + 7 MLA), z drobnoziarnistym bramkowaniem diagonalnym KDA — na bazie rzadkiego MoE 1/64 (512 ekspertów kierowanych, 8 aktywowanych na token). W ten sposób osiąga 124B parametrów łącznie, przy zaledwie 5,1B aktywnych. Natywne okno kontekstowe wynosi 256K, w przepisach wnioskowania obsługiwane jest na 262 144 tokenów, a Ant twierdzi, że architektura skaluje się do 1M. Maksymalna długość odpowiedzi nie została ujawniona. Model jest wyłącznie tekstowy, ze wsparciem wywoływania narzędzi; wejście multimodalne znajduje się w osobnej linii Ming.
Laboratorium publikuje dwa formaty wag — BF16 (około 255 GB) i FP8 (około 128 GB) — a z karty modelu są już linkowane skwantowane warianty społeczności. Własne zalecenia wdrożeniowe laboratorium dotyczą SGLang i vLLM.
Dostępność: otwarte wagi na licencji MIT
7 sierpnia zespół InclusionAI z Ant Group udostępnił wagi na licencji MIT na Hugging Face (inclusionAI/Ling-3.0-flash) i ModelScope. To permisywna licencja, którą można wykorzystywać komercyjnie — ta sama, na której wydano Ling 2.0 i Ling 2.6 — co oznacza, że możesz samodzielnie hostować, dostrajać i wdrażać Ling-3.0-flash, zamiast wynajmować go przez API. Model można również wywoływać przez własne API deweloperskie Ant oraz kilka platform trzecich. W przypadku szybkiego modelu w tej cenie bardziej interesujące pytanie brzmi: czy hostować go samodzielnie (FP8 działa na około 128 GB), czy pozostać przy API.

Niezależne wyniki: wskaźnik inteligencji AA wynoszący 38
Największą zmianą w porównaniu z lipcowym wpisem jest to, że obecnie istnieją niezależne wyniki. Artificial Analysis ma stronę dla Ling-3.0-flash i ocenia go na 38 punktów w Indeksie Inteligencji — 24 punkty powyżej poprzedniej generacji szybkiej klasy, Ling-2.6-flash (14), oraz na równi z MiMo-V2.5 i Qwen 3.6 27B, aktywując zaledwie ułamek ich parametrów. Artificial Analysis umieszcza również ten model na granicy Pareto dla otwartych wag w zestawieniu inteligencji do całkowitej liczby parametrów: żaden model o otwartych wagach z mniejszą całkowitą liczbą parametrów nie osiąga wyższego wyniku. Lider klasy flash wśród modeli o otwartych wagach w AA, DeepSeek V4 Flash, wciąż osiąga wyższy wynik (Indeks 52 przy maksymalnym wysiłku rozumowania).
Również wyniki agentowe i dla długiego kontekstu są kierunkowo mocne. W pakiecie τ3-Bench Banking od AA model Ling-3.0-flash uzyskuje 27%, co daje mu drugie miejsce wśród modeli klasy flash z otwartymi wagami, za DeepSeek V4 Flash (39%). W GDPval-AA v2 osiąga Elo 1108, w porównaniu z 545 dla Ling-2.6-flash. Ant trenował model w ponad 10 000 interaktywnych środowisk (dane podane przez dostawcę) i pozycjonuje go jako węzeł wykonawczy dla przepływów agentowych — szybki, tani i wymienny, z ciężkim rozumowaniem pozostawionym większemu flagowcowi.
Jedno zastrzeżenie co do źródeł: tabela wyników na karcie modelu Ant — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — pochodzi od dostawcy i nie została jeszcze niezależnie odtworzona. Traktuj ją jako deklaracje samego laboratorium, w tej samej kategorii co poniższe wartości szczytowej prędkości.
Prędkość: zmierzona, potem deklarowana
Historia szybkości to teraz dwie różne historie. Niezależnie od tego Artificial Analysis mierzy ok. 368 tokenów/sek. na wyjściu i około 1,98 s czasu do pierwszego tokena w autorskim API — to naprawdę szybko jak na MoE z 5,1 mld aktywnych parametrów i wystarczająco, by uplasować model w czołówce tej klasy pod względem szybkości. Osobno Ant Group twierdzi, że średnia szybkość generowania przekracza 1100 tokenów/sek. na określonych konfiguracjach GPU, a czas do pierwszego tokena wynosi poniżej 100 ms dzięki klastrowej, hierarchicznej warstwie pamięci podręcznej zbudowanej na SGLang HiCache i Mooncake. Ten drugi zestaw liczb pochodzi wyłącznie od producenta — zmierzono go na sprzęcie i w konfiguracjach wsadowych, które Ant kontroluje, a niezależne powtórzenie testu nie zostało opublikowane. Do planowania przyjmij wynik AA; wartość 1100+ tok/s traktuj jako marketingowy sufit, który trzeba zweryfikować na własnym obciążeniu.

Ceny: niskie, a promocja dobiegła końca.
Artificial Analysis podaje ceny dla API własnego (first-party) na poziomie 0,075 USD za 1 mln tokenów wejściowych i 0,22 USD za 1 mln tokenów wyjściowych, z trafieniami w pamięci podręcznej (cache hits) po 0,015 USD (−80%) — wszystkie ceny ustalone przez dostawcę. Darmowy poziom startowy (500 tys. darmowych tokenów dziennie, darmowy dostęp do API) zakończył się 3 sierpnia, a Ant prowadził tymczasową promocję z 75% zniżką na Ling Studio do 31 sierpnia 2026 r., po czym obowiązują ceny z cennika. Nawet przy pełnym cenniku 0,075/0,22 USD plasuje Ling-3.0-flash zdecydowanie w taniej kategorii jak na model z Indexem 38.
Przy tak niskich cenach koszt przełączenia liczy się bardziej niż cena za token. OrcaRouter istnieje po to, aby to przełączenie było tanie: jedno API dla ponad 200 modeli, cenniki dostawców przekazywane bez narzutu (0% marży) oraz automatyczne przełączanie awaryjne między dostawcami — więc gdy nowo udostępniony model, taki jak ten, dobrze wygląda na papierze, możesz przetestować go na swoim rzeczywistym obciążeniu bez drugiej umowy i wrócić do innego modelu za tym samym kluczem, jeśli nie spełni oczekiwań w konkretnym zadaniu.
Rodzina Ling / Ring / Ming
Ling-3.0-flash nie istnieje w izolacji — InclusionAI organizuje swoje wydania w trzy nazwane rodziny, z których każda jest przeznaczona do innego zadania. Ling to linia ogólnego przeznaczenia MoE do codziennego generowania tekstu i wywoływania narzędzi, a Ling-3.0-flash znajduje się na jej szybkim/tanim końcu, krok poniżej flagowego modelu poprzedniej generacji z 1 bilionem parametrów. Ring to linia skoncentrowana na rozumowaniu, stworzona do wieloetapowego łańcucha myśli. Ming to linia multimodalna. Jeśli twoje zadanie wymaga cięższego rozumowania lub wejścia obrazowego, właściwy model InclusionAI to prawdopodobnie nie Ling-3.0-flash — został zbudowany z myślą o wolumenie i szybkości w obszarze tekstu i narzędzi.
Dla kogo to jest: trzy scenariusze
1. Potoki przetwarzania tekstu lub wywoływania narzędzi o dużej przepustowości i wrażliwe na opóźnienia
To naturalne środowisko tego modelu. Przy niezależnym indeksie 38, licencji MIT i zmierzonych mniej więcej 368 tok/s, hipoteza szybkiej warstwy jest teraz sprawdzalna, a nie tylko teoretyczna — możesz uruchomić na nim własny zestaw ewaluacyjny albo pobrać wagi i hostować go samodzielnie. Tylko nie projektuj rozwiązania wokół deklarowanego pułapu 1100+ tok/s od dostawcy, dopóki nie zmierzysz tego na swoim obciążeniu.
2. Zespoły, które chcą długiego kontekstu w przystępnej cenie
Natywny kontekst 256K (262K serwowanych) z deklarowaną ścieżką do 1M, w cenie $0.075/$0.22, to atrakcyjne połączenie do pracy wymagającej intensywnego wyszukiwania lub przetwarzania dokumentów. Liczby dotyczące długiego kontekstu w karcie modelu pochodzą od dostawcy, więc umieść go na krótkiej liście obok uznanych opcji długiego kontekstu i zweryfikuj na własnym korpusie przed podjęciem decyzji.
3. Obserwatorzy śledzący krajobraz MoE w Chinach i mapę drogową InclusionAI
Lipcowe pytanie — czy InclusionAI pozostanie otwarte? — ma teraz odpowiedź: tak, MIT, i szybko. Ling-3.0-flash lądujący na granicy Pareto AA przy 5,1B aktywnych parametrów jest punktem danych dla każdego, kto śledzi, jak chińskie laboratoria konkurują wydajnością, a nie surową liczbą parametrów.
Co wciąż jest niezweryfikowane
Krótka lista, teraz gdy duże luki zostały zamknięte. Twierdzenia dostawcy o szczytowej przepustowości (1,100+ tok/s, TTFT poniżej 100 ms) nie mają niezależnych ponownych pomiarów. Tabela benchmarków w karcie modelu pochodzi od dostawcy. Warianty FP4/INT4 oraz ścieżka wdrożenia na pojedynczym DGX-Spark to deklaracje dostawcy. A jeśli chodzi o wiedzę, Indeks Omniscience AA pokazuje, że poprawa w porównaniu z poprzednią generacją wynikała głównie ze wstrzymywania się od odpowiedzi — halucynacje spadły (97% → 44%), podczas gdy dokładność wzrosła tylko nieznacznie (16% → 18%) — więc nie myl skoku w nagłówku indeksu z ogólnym skokiem wiedzy.
Kiedy nie używać
{{1}}Pomiń Ling-3.0-flash do zadań multimodalnych — to linia Minga.{{/1}} {{2}}Pomiń go, jeśli potrzebujesz flagowca do ciężkiego rozumowania, a nie szybkiego wykonawcy — to domena Ringa.{{/2}} {{3}}Jeśli planujesz samodzielny hosting, przygotuj budżet na prawdziwy sprzęt: BF16 to mniej więcej 255 GB, a FP8 mniej więcej 128 GB.{{/3}} {{4}}A jeśli jakieś twierdzenie jest dla ciebie istotne, zweryfikuj je — liczby dotyczące szczytowej szybkości i długiego kontekstu to dane Anta, dopóki niezależne laboratorium ich nie powtórzy.{{/4}}
Często zadawane pytania
Czy Ling-3.0-flash ma otwarte wagi?
Tak. Wagi zostały udostępnione jako open source 7 sierpnia na licencji MIT, na Hugging Face (inclusionAI/Ling-3.0-flash) i ModelScope. Jest to licencja permisywna, dopuszczająca użycie komercyjne — ta sama, na której wydano Ling 2.0 i Ling 2.6.
Jak Ling-3.0-flash radzi sobie w benchmarkach?
Artificial Analysis mierzy wskaźnik inteligencji na poziomie 38, o 24 punkty wyżej niż Ling-2.6-flash, i umieszcza model na granicy Pareto dla otwartych wag pod względem inteligencji w porównaniu z całkowitą liczbą parametrów. Tabela wyników na karcie modelu Anta (na przykład SWE-Bench Pro 56.6) jest raportowana przez producenta i nie została niezależnie potwierdzona.
Jak szybkie to naprawdę jest?
Artificial Analysis mierzy około 368 tokenów/sek. na wyjściu, z czasem do pierwszego tokenu wynoszącym ~1,98 s w oficjalnym API. Ant twierdzi, że osiąga szczytową przepustowość 1100+ tokenów/sek. i TTFT poniżej 100 ms w określonych konfiguracjach GPU — to dane producenta bez niezależnej ponownej weryfikacji.
Ile kosztuje Ling-3.0-flash?
AA podaje cenę własnego API na 0,075 USD za 1 mln tokenów wejściowych i 0,22 USD za 1 mln tokenów wyjściowych, z 80% zniżką przy trafieniu w pamięć podręczną. Bezpłatny poziom startowy zakończył się 3 sierpnia, a tymczasowy okres 75% zniżki na Ling Studio obowiązuje do 31 sierpnia 2026 r.
Jak duże jest okno kontekstowe?
256K natywnie, serwowane jako 262 144 tokeny; Ant twierdzi, że architektura skaluje się do 1M. Maksymalna długość odpowiedzi nie jest ujawniona.
Jaka jest różnica między Ling, Ring i Ming?
Ling to linia MoE ogólnego przeznaczenia do tekstu i wywoływania narzędzi firmy InclusionAI, a Ling-3.0-flash znajduje się na jej szybkim/tanim końcu. Ring to linia skoncentrowana na rozumowaniu. Ming zajmuje się zadaniami multimodalnymi. To osobne rodziny do różnych zadań, a nie poziomy jednego modelu.
Czy Ling-3.0-flash jest taki sam jak poprzedni flagowy model 1T?
Nie. Ling-3.0-flash to nowsze, mniejsze wydanie z szybkiej warstwy (124B łącznie / 5.1B aktywnych). Flagowy model poprzedniej generacji z 1T parametrów pozostaje większym modelem.
Czy powinienem użyć Ling-3.0-flash w produkcji dzisiaj?
Bardziej obronne niż w lipcu, teraz gdy dostępna jest niezależna ocena i licencja MIT. Najpierw uruchom własny zestaw testów ewaluacyjnych, zweryfikuj deklarowane przez producenta prędkości względem swojego obciążenia i zdecyduj między API a samodzielnym hostowaniem (FP8 działa na około 128 GB). Pozostałe liczby dostępne wyłącznie u producenta są na tyle wąskie, że można je uwzględnić w planowaniu.
Sedno sprawy
Ling-3.0-flash awansował w dwa tygodnie od „arkusza specyfikacji i deklaracji producenta” do „otwartych wag i niezależnie ocenianych wyników”. Wynik AA Intelligence Index na poziomie 38 przy 5,1 mld aktywnych parametrów — na granicy Pareto dla otwartych wag, na licencji MIT, w cenie 0,075/0,22 USD — czyni go jednym z najbardziej wydajnych modeli o otwartych wagach, na które możesz teraz wskazać, i takim, który możesz faktycznie uruchomić samodzielnie. Zakres zastrzeżeń jest węższy niż wcześniej: wartości szczytowej prędkości i model card nadal pochodzą od Ant, dopóki niezależne laboratorium ich nie odtworzy. Przy dużej skali przetwarzania tekstu i wywoływania narzędzi w tej cenie zasłużył na rzetelną ewaluację.

