
LLaDA2.2-mini: Wagi agenta dyfuzyjnego Ant inclusionAI pojawiły się po cichu 5 września.
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0455Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0247Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0157Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2646Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1541Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0547Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencja49Kod
5 września 2026 roku o 05:16 UTC w serwisie Hugging Face powstało repozytorium inclusionAI/LLaDA2.2-mini i w chwili pisania tego tekstu to niemal cała historia tej publikacji: wagi są już dostępne, karta modelu jest wypełniona, a producent — inclusionAI, laboratorium Ant Group stojące za linią modeli dyfuzyjnych LLaDA — nie powiedział o niej ani słowa. Brak posta premierowego, brak kampanii w mediach społecznościowych, brak wpisu w tabeli modeli w README repozytorium inclusionAI/LLaDA2.X na GitHubie, gdzie większy model LLaDA2.2-flash widnieje w pojedynkę. Dwadzieścia cztery godziny po pojawieniu się repozytorium licznik pobrań wskazywał zero. To tekst o tym, co jak dotąd wiemy o LLaDA2.2-mini — i rygor tej formy ma tu znaczenie, bo niemal każda interesująca liczba przypisana temu modelowi to liczba, którą inclusionAI wpisało na własnej karcie. Artykuł oddziela to, co w tej publikacji da się zweryfikować niezależnie, od tego, co pochodzi od producenta, i wprost nazywa otwarte pytania, zamiast je tuszować.
Krótka wersja dla kogoś, kto chce tylko znać ogólny zarys: LLaDA2.2-mini to mniejszy brat dyfuzyjnego modelu językowego LLaDA2.2-flash, który inclusionAI ogłosiło w lipcu 2026 r. Model jest teraz dostępny jako punkt kontrolny mieszanki ekspertów o 16 miliardach parametrów, aktywujący tylko 1,4 miliarda parametrów na token, obsługujący kontekst 128K i wytrenowany do pracy agentowej — wywoływanie narzędzi, wieloturowe poprawki — przy użyciu dekodera dyfuzyjnego, który potrafi wstawiać i usuwać tokeny w trakcie generowania. Jest na licencji Apache-2.0. A ponieważ wagi mają jeden dzień i nie stoi za nimi żadne ogłoszenie, nie istnieje jeszcze żadna typowa infrastruktura: żadnych niezależnych ewaluacji, żadnego hostowanego API, które moglibyśmy znaleźć, żadnych poradników wdrożeniowych poza tym, co zaleca sama karta modelu. To, co można dziś zweryfikować, to architektura, licencja i liczby, które inclusionAI zdecydowało się opublikować.
Release to repozytorium, a nie wydarzenie.
Zacznij od tego, co można sprawdzić, nie ufając nikomu. API Hugging Face podaje, że inclusionAI/LLaDA2.2-mini został utworzony 5 września 2026 r. i tego samego dnia ostatnio zmodyfikowany. Jest na licencji Apache-2.0, używa formatu safetensors z tensorami bf16, zawiera szablon czatu i wymaga trust_remote_code, ponieważ architektura dyfuzyjna jest dostarczana jako niestandardowy kod modelu. Bliźniacze repozytorium, inclusionAI/LLaDA2.2-flash, zostało utworzone 16 lipca 2026 r., w ciągu kolejnych tygodni zdobyło tysiące pobrań i dziesiątki polubień oraz doczekało się publicznego ogłoszenia. Mini nie ma ani ogłoszenia, ani popularności — w pierwszym dniu odnotowano jednocyfrową liczbę polubień i ani jednego pobrania.

Jedyną uwagą ze strony trzeciej, jaką do tej pory przyciągnął model mini, jest strona agregująca, która opublikowała kartę modelu w ciągu kilku godzin od pojawienia się repozytorium; jest to lustro karty, a nie niezależne źródło, i nie zawiera żadnych informacji, których nie zawierałoby samo repozytorium. To cały publiczny ślad na dzień 6 września. Ramy, które mają znaczenie dla czytelnika decydującego, czy zwrócić uwagę: inclusionAI już dwukrotnie w tym samym tygodniu opublikował po cichu wagi dyfuzyjne — ten model 5 września oraz checkpointy generowania LLaDA-Image dzień wcześniej — więc ciche opublikowanie repozytorium wydaje się ustalonym schematem wydawniczym tego laboratorium, a nie przypadkiem. Ten schemat nie mówi nam nic o tym, czy zapowiedź jest w drodze.
Czym właściwie jest LLaDA2.2-mini
Architektura jest tutaj najbardziej interesującym elementem modelu i została w pełni opisana na karcie. LLaDA2.2-mini to dyfuzyjny model językowy typu mixture-of-experts zbudowany na bazie LLaDA2.0-mini. Dyfuzyjne modele językowe odwracają typową pętlę generowania: zamiast modelu autoregresyjnego przewidującego kolejny token pojedynczo, dyfuzyjny LLM zaczyna od bloku zamaskowanych lub zaszumionych tokenów i równolegle udoskonala cały blok, denoisingując go w kierunku spójnej sekwencji. Generowanie w LLaDA2.2 dodaje to, co inclusionAI nazywa edycją Levenshteina: dwa tokeny sterujące, DELETE i INSERT, które pozwalają dekoderowi zmieniać długość i strukturę tworzonej sekwencji, a nie tylko jej zawartość — usuwając zbędny fragment, który już wygenerował, lub otwierając punkt wstawienia, w którym musi pojawić się nowy kontekst (na przykład wynik działania narzędzia). To właśnie ten mechanizm pozwala rodzinie modeli sprawić, że dekodowanie dyfuzyjne działa w pętlach wieloturnusowych i z użyciem narzędzi, gdzie model autoregresyjny może po prostu czekać na następną turę użytkownika, a model z blokową dyfuzją musi poprawić to, co już wygenerował.
Istotne specyfikacje, wszystkie wprost z karty modelu: 16 miliardów parametrów łącznie, z wyłączeniem embeddingów; 1,4 miliarda aktywnych na token dzięki architekturze MoE z 256 ekspertami, z których na token kierowanych jest 8 ekspertów; 20 warstw, 16 głowic uwagi, 4 głowice KV; słownik liczący 157 184 tokeny; rotacyjne embeddingi pozycyjne; oraz okno kontekstu o długości 128 tys. Technika o nazwie Block Routing ogranicza, które eksperci uaktywniają się na poziomie bloku dyfuzyjnego – to dzięki niej model utrzymuje kontekst 128 tys. w zasięgu możliwości pojedynczego konsumenckiego GPU. Specyfikacja pozycjonuje go pod karty z pamięcią od 24 GB wzwyż i zaleca SGLang jako backend serwujący do długokontekstowych obciążeń agentowych.

Powyżej pokazano, gdzie na osi czasu rodziny plasuje się ta premiera — rodowód, który czyni „LLaDA2.2-mini” czytelnym. LLaDA2.0 w listopadzie 2025 roku był pierwszym dyfuzyjnym modelem językowym przeskalowanym do 100 miliardów parametrów; LLaDA2.1 w lutym 2026 roku wprowadził edycję tokenów w celu szybszej dyfuzji tekstu; a generacja LLaDA2.2 z lipca 2026 roku, ogłoszona wraz z LLaDA2.2-flash i jego raportem technicznym, skierowała rodzinę w stronę agentów. Mini to element tej generacji, który aż do teraz pozostawał obietnicą: relacje z lipcowej premiery wspominały już o lżejszym wariancie flash o 16B parametrów, przeznaczonym do tańszego wdrażania, ale samodzielne wagi pojawiły się dopiero 5 września.
Liczby na karcie, oznaczone jako to, czym są
Tabela benchmarków na karcie modelu jest własnością inclusionAI, wydrukowana w dniu opublikowania wag, a żadne niezależne laboratorium nie odtworzyło żadnego z tych wyników — Artificial Analysis nie ma wpisu dla LLaDA2.2-mini i nie możemy znaleźć żadnego uruchomienia przez stronę trzecią. Odczytuj te liczby jako deklaracje producenta wskazujące kierunek, a nie jako zmierzone fakty. W tych ramach historia opowiedziana przez kartę jest spójna: LLaDA2.2-mini to specjalista od zadań agentowych i długiego kontekstu i poświęca część punktów w ogólnych benchmarkach, aby to osiągnąć.
• Średnia agentowa — 59,00, z τ²-Bench 57,50, Claw-Eval 57,16 i PinchBench 62,33 (dane dostawcy).
Function calling — 47,68 w BFCL v4, w porównaniu z odpowiednio 25,05 i 28,44 dla LLaDA2.0-mini i LLaDA2.1-mini; 69,02 w starszym BFCL v3.
• Długi kontekst — 34.99 w LongBench v2, ponad dwukrotnie więcej niż 15.51 i 12.13 osiągnięte przez poprzednie minis, co jest konkretnym zyskiem z okna 128K.
• Ogólny — średnia ogólna 46.47; AIME 2026: 35.05; OlympiadBench: 61.11; LiveCodeBench v6: 28.14; GPQA-Diamond: 44.41; IFBench: 24.93 — kilka z tych wyników nieco poniżej wcześniejszych mini, widoczny koszt przeznaczenia budżetu szkoleniowego na zachowania agentowe zamiast tego.

Ten ostatni punkt warto przemyśleć, ponieważ to uczciwy powód, dla którego zespół wybrałby ten model zamiast lepszego na papierze modelu ogólnego przeznaczenia. LLaDA2.2-mini nie twierdzi, że jest najlepszym małym modelem w matematyce czy podążaniu za instrukcjami; twierdzi, że jest dobry w tym, w czym modele dyfuzyjne historycznie były słabe — w ciągłej, wieloetapowej pracy z narzędziami — przy jednoczesnym utrzymaniu liczby aktywnych parametrów na tyle niskiej, aby miało to znaczenie na jednym GPU. Skok w BFCL v4 i skok w LongBench v2 to liczby, które przetrwałyby niezależne uruchomienie, gdyby karta modelu była w dużej mierze poprawna.
Uruchomienie tego i brakujący szkielet
Na papierze droga do uruchomienia LLaDA2.2-mini jest prosta, ponieważ wydanie jest natywne dla biblioteki Transformers: karta pokazuje, że można go załadować przy użyciu AutoModelForCausalLM oraz trust_remote_code=True na transformers ≥ 5.2.0, a następnie wywołać generate z parametrami specyficznymi dla dyfuzji — zalecanymi wartościami domyślnymi są długość bloku 32 i temperatura 0.0, a karta dla większości zapytań sugeruje długość wyjścia 32 768 tokenów. Do serwowania długich kontekstów w trybie agentowym wskazuje na SGLang, a użytkownicy z Chin kontynentalnych mają do dyspozycji mirror ModelScope. Nie istnieje jeszcze natomiast ekosystem wokół modelu: u żadnego dostawcy, którego możemy zweryfikować, nie ma hostowanego API, nie możemy też znaleźć żadnych wersji GGUF, a wsparcie frameworków wciąż się stabilizuje — społecznościowe prace nad architekturą LLaDA2 w llama.cpp są niedawne, więc z kwantyzacją jest cienko.
To połączenie — zupełnie nowy paradygmat dekodowania, jednodniowy i wyłącznie self-hostowy — to dokładnie sytuacja, w której warstwa routingu pokazuje swoją wartość, nie udając, że nowy model jest gotowy do produkcji. Sposobem na odpowiedzialne wypróbowanie LLaDA2.2-mini jest uruchomienie go samodzielnie na ścieżce testowej, podczas gdy produkcja pozostaje na dojrzałym modelu — i właśnie do tego służy konfiguracja OrcaRouter: jedno API dla ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, automatyczny failover, dzięki któremu zacięcie jednodniowego checkpointu nie zatrzyma przepływu pracy, oraz DSL routingu do zestawienia samodzielnie hostowanego wywołania dyfuzyjnego z hostowanymi modelami autoregresyjnymi za jednym kluczem. Gdy — jeśli — dostawca doda LLaDA2.2-mini do swojej oferty, obowiązuje ta sama zasada przekazywania dalej, a cena, którą widzisz, jest ceną samego dostawcy. Do tego czasu uczciwa informacja o dostępności brzmi: pobierz wagi na licencji Apache-2.0 z Hugging Face lub ModelScope i uruchom je samodzielnie.
Co obejrzeć dalej
Three things would turn this what-we-know-so-far into a real story, and all three are absent today. First, an announcement: if the LLaDA2.2-flash pattern holds, a launch post and technical-report coverage could follow the quiet repo drop, and it would likely add training details the card omits. Second, an independent run: the agentic average of 59.00 and the BFCL v4 score of 47.68 are the claims most worth reproducing, because agentic benchmarks are the ones where harness choice moves scores the most. Third, serving maturity: SGLang serving guides, a vLLM path, and community quantizations would tell you whether the 1.4B-active footprint is as cheap to operate in practice as the spec sheet suggests. None of those exist on September 6. The weights are real, the license is permissive, and the architecture genuinely is a different way of running an agent — but the evidence that it is a good agent is, for now, one vendor's card.
