Własnoręcznie wykonana karta tytułowa artykułu informacyjnego „LLaDA2.2-mini — News", z podtytułem „Agent modelu językowego typu dyfuzyjnego, opublikowany po cichu 5 września 2026 r.", plakietkami „16B MoE / 1.4B active", „128K context", „Apache-2.0" oraz stopką „Co można wyczytać z repozytorium, a czego jeszcze nie potwierdzono", z logo OrcaRouter umieszczonym w prawym dolnym rogu.
Guides & Insights

LLaDA2.2-mini: Wagi agenta dyfuzyjnego Ant inclusionAI pojawiły się po cichu 5 września.

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

5 września 2026 roku o 05:16 UTC w serwisie Hugging Face powstało repozytorium inclusionAI/LLaDA2.2-mini i w chwili pisania tego tekstu to niemal cała historia tej publikacji: wagi są już dostępne, karta modelu jest wypełniona, a producent — inclusionAI, laboratorium Ant Group stojące za linią modeli dyfuzyjnych LLaDA — nie powiedział o niej ani słowa. Brak posta premierowego, brak kampanii w mediach społecznościowych, brak wpisu w tabeli modeli w README repozytorium inclusionAI/LLaDA2.X na GitHubie, gdzie większy model LLaDA2.2-flash widnieje w pojedynkę. Dwadzieścia cztery godziny po pojawieniu się repozytorium licznik pobrań wskazywał zero. To tekst o tym, co jak dotąd wiemy o LLaDA2.2-mini — i rygor tej formy ma tu znaczenie, bo niemal każda interesująca liczba przypisana temu modelowi to liczba, którą inclusionAI wpisało na własnej karcie. Artykuł oddziela to, co w tej publikacji da się zweryfikować niezależnie, od tego, co pochodzi od producenta, i wprost nazywa otwarte pytania, zamiast je tuszować.

Krótka wersja dla kogoś, kto chce tylko znać ogólny zarys: LLaDA2.2-mini to mniejszy brat dyfuzyjnego modelu językowego LLaDA2.2-flash, który inclusionAI ogłosiło w lipcu 2026 r. Model jest teraz dostępny jako punkt kontrolny mieszanki ekspertów o 16 miliardach parametrów, aktywujący tylko 1,4 miliarda parametrów na token, obsługujący kontekst 128K i wytrenowany do pracy agentowej — wywoływanie narzędzi, wieloturowe poprawki — przy użyciu dekodera dyfuzyjnego, który potrafi wstawiać i usuwać tokeny w trakcie generowania. Jest na licencji Apache-2.0. A ponieważ wagi mają jeden dzień i nie stoi za nimi żadne ogłoszenie, nie istnieje jeszcze żadna typowa infrastruktura: żadnych niezależnych ewaluacji, żadnego hostowanego API, które moglibyśmy znaleźć, żadnych poradników wdrożeniowych poza tym, co zaleca sama karta modelu. To, co można dziś zweryfikować, to architektura, licencja i liczby, które inclusionAI zdecydowało się opublikować.

Release to repozytorium, a nie wydarzenie.

Zacznij od tego, co można sprawdzić, nie ufając nikomu. API Hugging Face podaje, że inclusionAI/LLaDA2.2-mini został utworzony 5 września 2026 r. i tego samego dnia ostatnio zmodyfikowany. Jest na licencji Apache-2.0, używa formatu safetensors z tensorami bf16, zawiera szablon czatu i wymaga trust_remote_code, ponieważ architektura dyfuzyjna jest dostarczana jako niestandardowy kod modelu. Bliźniacze repozytorium, inclusionAI/LLaDA2.2-flash, zostało utworzone 16 lipca 2026 r., w ciągu kolejnych tygodni zdobyło tysiące pobrań i dziesiątki polubień oraz doczekało się publicznego ogłoszenia. Mini nie ma ani ogłoszenia, ani popularności — w pierwszym dniu odnotowano jednocyfrową liczbę polubień i ani jednego pobrania.

A screenshot of the Hugging Face model page for inclusionAI/LLaDA2.2-mini (captured September 6, 2026), showing the tags TextGeneration, Transformers, Safetensors, llada2_moe, dllm, diffusion_lm and custom_code, the Apache-2.0 license, the model-card summary 'LLaDA2.2-mini is the lightweight variant of the agentic diffusion language model in the LLaDA2 series', Model size 16B params, Tensor type BF16, a chat template, the line 'This model isn't deployed by any Inference Provider', and the start of the benchmarks table.

Jedyną uwagą ze strony trzeciej, jaką do tej pory przyciągnął model mini, jest strona agregująca, która opublikowała kartę modelu w ciągu kilku godzin od pojawienia się repozytorium; jest to lustro karty, a nie niezależne źródło, i nie zawiera żadnych informacji, których nie zawierałoby samo repozytorium. To cały publiczny ślad na dzień 6 września. Ramy, które mają znaczenie dla czytelnika decydującego, czy zwrócić uwagę: inclusionAI już dwukrotnie w tym samym tygodniu opublikował po cichu wagi dyfuzyjne — ten model 5 września oraz checkpointy generowania LLaDA-Image dzień wcześniej — więc ciche opublikowanie repozytorium wydaje się ustalonym schematem wydawniczym tego laboratorium, a nie przypadkiem. Ten schemat nie mówi nam nic o tym, czy zapowiedź jest w drodze.

Czym właściwie jest LLaDA2.2-mini

Architektura jest tutaj najbardziej interesującym elementem modelu i została w pełni opisana na karcie. LLaDA2.2-mini to dyfuzyjny model językowy typu mixture-of-experts zbudowany na bazie LLaDA2.0-mini. Dyfuzyjne modele językowe odwracają typową pętlę generowania: zamiast modelu autoregresyjnego przewidującego kolejny token pojedynczo, dyfuzyjny LLM zaczyna od bloku zamaskowanych lub zaszumionych tokenów i równolegle udoskonala cały blok, denoisingując go w kierunku spójnej sekwencji. Generowanie w LLaDA2.2 dodaje to, co inclusionAI nazywa edycją Levenshteina: dwa tokeny sterujące, DELETE i INSERT, które pozwalają dekoderowi zmieniać długość i strukturę tworzonej sekwencji, a nie tylko jej zawartość — usuwając zbędny fragment, który już wygenerował, lub otwierając punkt wstawienia, w którym musi pojawić się nowy kontekst (na przykład wynik działania narzędzia). To właśnie ten mechanizm pozwala rodzinie modeli sprawić, że dekodowanie dyfuzyjne działa w pętlach wieloturnusowych i z użyciem narzędzi, gdzie model autoregresyjny może po prostu czekać na następną turę użytkownika, a model z blokową dyfuzją musi poprawić to, co już wygenerował.

Istotne specyfikacje, wszystkie wprost z karty modelu: 16 miliardów parametrów łącznie, z wyłączeniem embeddingów; 1,4 miliarda aktywnych na token dzięki architekturze MoE z 256 ekspertami, z których na token kierowanych jest 8 ekspertów; 20 warstw, 16 głowic uwagi, 4 głowice KV; słownik liczący 157 184 tokeny; rotacyjne embeddingi pozycyjne; oraz okno kontekstu o długości 128 tys. Technika o nazwie Block Routing ogranicza, które eksperci uaktywniają się na poziomie bloku dyfuzyjnego – to dzięki niej model utrzymuje kontekst 128 tys. w zasięgu możliwości pojedynczego konsumenckiego GPU. Specyfikacja pozycjonuje go pod karty z pamięcią od 24 GB wzwyż i zaleca SGLang jako backend serwujący do długokontekstowych obciążeń agentowych.

A self-built timeline graphic titled 'The LLaDA family, to September 5, 2026' with four node cards: 'LLaDA2.0 — Nov 2025 — First diffusion LM scaled to 100B', 'LLaDA2.1 — Feb 2026 — Token editing for faster diffusion', 'LLaDA2.2-flash — Jul 2026 — Agentic diffusion · ~100B, announced', and 'LLaDA2.2-mini — Sep 5, 2026 — 1.4B-active agent · weights, quiet', with a footer 'Per the inclusionAI/LLaDA2.X GitHub README and Hugging Face repository timestamps' and the OrcaRouter logo composited in the bottom-right corner.

Powyżej pokazano, gdzie na osi czasu rodziny plasuje się ta premiera — rodowód, który czyni „LLaDA2.2-mini” czytelnym. LLaDA2.0 w listopadzie 2025 roku był pierwszym dyfuzyjnym modelem językowym przeskalowanym do 100 miliardów parametrów; LLaDA2.1 w lutym 2026 roku wprowadził edycję tokenów w celu szybszej dyfuzji tekstu; a generacja LLaDA2.2 z lipca 2026 roku, ogłoszona wraz z LLaDA2.2-flash i jego raportem technicznym, skierowała rodzinę w stronę agentów. Mini to element tej generacji, który aż do teraz pozostawał obietnicą: relacje z lipcowej premiery wspominały już o lżejszym wariancie flash o 16B parametrów, przeznaczonym do tańszego wdrażania, ale samodzielne wagi pojawiły się dopiero 5 września.

Liczby na karcie, oznaczone jako to, czym są

Tabela benchmarków na karcie modelu jest własnością inclusionAI, wydrukowana w dniu opublikowania wag, a żadne niezależne laboratorium nie odtworzyło żadnego z tych wyników — Artificial Analysis nie ma wpisu dla LLaDA2.2-mini i nie możemy znaleźć żadnego uruchomienia przez stronę trzecią. Odczytuj te liczby jako deklaracje producenta wskazujące kierunek, a nie jako zmierzone fakty. W tych ramach historia opowiedziana przez kartę jest spójna: LLaDA2.2-mini to specjalista od zadań agentowych i długiego kontekstu i poświęca część punktów w ogólnych benchmarkach, aby to osiągnąć.

• Średnia agentowa — 59,00, z τ²-Bench 57,50, Claw-Eval 57,16 i PinchBench 62,33 (dane dostawcy).

Function calling — 47,68 w BFCL v4, w porównaniu z odpowiednio 25,05 i 28,44 dla LLaDA2.0-mini i LLaDA2.1-mini; 69,02 w starszym BFCL v3.

• Długi kontekst — 34.99 w LongBench v2, ponad dwukrotnie więcej niż 15.51 i 12.13 osiągnięte przez poprzednie minis, co jest konkretnym zyskiem z okna 128K.

• Ogólny — średnia ogólna 46.47; AIME 2026: 35.05; OlympiadBench: 61.11; LiveCodeBench v6: 28.14; GPQA-Diamond: 44.41; IFBench: 24.93 — kilka z tych wyników nieco poniżej wcześniejszych mini, widoczny koszt przeznaczenia budżetu szkoleniowego na zachowania agentowe zamiast tego.

A self-built single-column scoreboard titled 'LLaDA2.2-mini — the scoreboard' listing Type 'MoE diffusion LM with Levenshtein editing (DELETE / INSERT)', Total params '16B (excl. embeddings)', Active params '1.4B — top-8 of 256 experts', Context '128K tokens', Agentic avg '59.00 — τ²-Bench 57.50 · Claw-Eval 57.16 · PinchBench 62.33', Function calling 'BFCL v4 47.68 (up from ~25-28 for prior minis)', with a footer 'All figures from the inclusionAI model card — vendor-reported, not independently reproduced' and the OrcaRouter logo composited in the bottom-right corner.

Ten ostatni punkt warto przemyśleć, ponieważ to uczciwy powód, dla którego zespół wybrałby ten model zamiast lepszego na papierze modelu ogólnego przeznaczenia. LLaDA2.2-mini nie twierdzi, że jest najlepszym małym modelem w matematyce czy podążaniu za instrukcjami; twierdzi, że jest dobry w tym, w czym modele dyfuzyjne historycznie były słabe — w ciągłej, wieloetapowej pracy z narzędziami — przy jednoczesnym utrzymaniu liczby aktywnych parametrów na tyle niskiej, aby miało to znaczenie na jednym GPU. Skok w BFCL v4 i skok w LongBench v2 to liczby, które przetrwałyby niezależne uruchomienie, gdyby karta modelu była w dużej mierze poprawna.

Uruchomienie tego i brakujący szkielet

Na papierze droga do uruchomienia LLaDA2.2-mini jest prosta, ponieważ wydanie jest natywne dla biblioteki Transformers: karta pokazuje, że można go załadować przy użyciu AutoModelForCausalLM oraz trust_remote_code=True na transformers ≥ 5.2.0, a następnie wywołać generate z parametrami specyficznymi dla dyfuzji — zalecanymi wartościami domyślnymi są długość bloku 32 i temperatura 0.0, a karta dla większości zapytań sugeruje długość wyjścia 32 768 tokenów. Do serwowania długich kontekstów w trybie agentowym wskazuje na SGLang, a użytkownicy z Chin kontynentalnych mają do dyspozycji mirror ModelScope. Nie istnieje jeszcze natomiast ekosystem wokół modelu: u żadnego dostawcy, którego możemy zweryfikować, nie ma hostowanego API, nie możemy też znaleźć żadnych wersji GGUF, a wsparcie frameworków wciąż się stabilizuje — społecznościowe prace nad architekturą LLaDA2 w llama.cpp są niedawne, więc z kwantyzacją jest cienko.

To połączenie — zupełnie nowy paradygmat dekodowania, jednodniowy i wyłącznie self-hostowy — to dokładnie sytuacja, w której warstwa routingu pokazuje swoją wartość, nie udając, że nowy model jest gotowy do produkcji. Sposobem na odpowiedzialne wypróbowanie LLaDA2.2-mini jest uruchomienie go samodzielnie na ścieżce testowej, podczas gdy produkcja pozostaje na dojrzałym modelu — i właśnie do tego służy konfiguracja OrcaRouter: jedno API dla ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, automatyczny failover, dzięki któremu zacięcie jednodniowego checkpointu nie zatrzyma przepływu pracy, oraz DSL routingu do zestawienia samodzielnie hostowanego wywołania dyfuzyjnego z hostowanymi modelami autoregresyjnymi za jednym kluczem. Gdy — jeśli — dostawca doda LLaDA2.2-mini do swojej oferty, obowiązuje ta sama zasada przekazywania dalej, a cena, którą widzisz, jest ceną samego dostawcy. Do tego czasu uczciwa informacja o dostępności brzmi: pobierz wagi na licencji Apache-2.0 z Hugging Face lub ModelScope i uruchom je samodzielnie.

Co obejrzeć dalej

Three things would turn this what-we-know-so-far into a real story, and all three are absent today. First, an announcement: if the LLaDA2.2-flash pattern holds, a launch post and technical-report coverage could follow the quiet repo drop, and it would likely add training details the card omits. Second, an independent run: the agentic average of 59.00 and the BFCL v4 score of 47.68 are the claims most worth reproducing, because agentic benchmarks are the ones where harness choice moves scores the most. Third, serving maturity: SGLang serving guides, a vLLM path, and community quantizations would tell you whether the 1.4B-active footprint is as cheap to operate in practice as the spec sheet suggests. None of those exist on September 6. The weights are real, the license is permissive, and the architecture genuinely is a different way of running an agent — but the evidence that it is a good agent is, for now, one vendor's card.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube