Титульная карточка, сделанная вручную, для новостной статьи «LLaDA2.2-mini — Новости»: подзаголовок «Агент на диффузионной языковой модели, тихо выпущенный 5 сентября 2026 года»; плашки «16B MoE / 1.4B активных параметров», «128K контекста», «Apache-2.0»; нижний колонтитул «Что можно узнать из репозитория и что пока не подтверждено». В правый нижний угол вкомпонован логотип OrcaRouter.
Guides & Insights

LLaDA2.2-mini: веса диффузионного агента Ant inclusionAI тихо появились 5 сентября

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

5 сентября 2026 года в 05:16 UTC появился репозиторий на Hugging Face под названием inclusionAI/LLaDA2.2-mini — и на момент написания этого текста это практически вся история релиза: веса опубликованы, карточка модели заполнена, а вендор — inclusionAI, лаборатория Ant Group, стоящая за линейкой диффузионных моделей LLaDA, — ничего об этом не сообщил. Ни анонса, ни публикаций в соцсетях, ни строки в таблице моделей в README репозитория inclusionAI/LLaDA2.X на GitHub, где в одиночестве значится более крупная LLaDA2.2-flash. Через двадцать четыре часа после появления репозитория счётчик загрузок показывал ноль. Это текст в формате «что нам известно на данный момент» о LLaDA2.2-mini, и строгость такого формата здесь важна, потому что почти каждое примечательное число, связанное с моделью, — это число, которое inclusionAI вписала в собственную карточку. Эта статья отделяет то, что о релизе можно проверить независимо, от того, что сообщил вендор, и называет открытые вопросы, а не сглаживает их.

Короткая версия для тех, кому нужно лишь общее представление: LLaDA2.2-mini — младший собрат диффузионной языковой модели LLaDA2.2-flash, анонсированной inclusionAI в июле 2026 года. Модель выпущена как чекпоинт со смесью экспертов на 16 миллиардов параметров, из которых на каждый токен активируется лишь 1,4 миллиарда; она поддерживает контекст в 128K токенов и обучена для агентных сценариев — вызова инструментов, многоходовой коррекции — за счёт диффузионного декодера, способного вставлять и удалять токены прямо в ходе генерации. Лицензия — Apache-2.0. А поскольку веса появились лишь день назад и не подкреплены анонсом, привычного окружения вокруг них пока нет: ни независимых оценок, ни размещённого API, который нам удалось бы найти, ни руководств по развёртыванию, кроме тех, что рекомендует сама карточка модели. Что можно проверить уже сегодня, так это архитектуру, лицензию и цифры, которые inclusionAI решила опубликовать.

Релиз — это репозиторий, а не событие

Начнём с того, что можно проверить, никому не доверяя. Hugging Face API показывает, что модель inclusionAI/LLaDA2.2-mini была создана 5 сентября 2026 года и в тот же день последний раз изменена. Она распространяется по лицензии Apache-2.0, использует формат safetensors с bf16-тензорами, содержит чат-шаблон и требует trust_remote_code, поскольку диффузионная архитектура поставляется в виде пользовательского кода модели. Родственная модель, inclusionAI/LLaDA2.2-flash, была создана 16 июля 2026 года, за прошедшие недели набрала тысячи загрузок и десятки лайков и была публично анонсирована. У мини-модели нет ни анонса, ни признания — в первый день она получила лишь однозначное число лайков и вообще ни одной загрузки.

A screenshot of the Hugging Face model page for inclusionAI/LLaDA2.2-mini (captured September 6, 2026), showing the tags TextGeneration, Transformers, Safetensors, llada2_moe, dllm, diffusion_lm and custom_code, the Apache-2.0 license, the model-card summary 'LLaDA2.2-mini is the lightweight variant of the agentic diffusion language model in the LLaDA2 series', Model size 16B params, Tensor type BF16, a chat template, the line 'This model isn't deployed by any Inference Provider', and the start of the benchmarks table.

Единственное внимание со стороны третьих лиц, которое пока привлекла мини-модель, — это страница-агрегатор, переопубликовавшая карточку модели в течение нескольких часов после появления репозитория; это зеркало карточки, а не независимый источник, и она не содержит информации, которой нет в самом репозитории. Это весь публичный след по состоянию на 6 сентября. Рамка, которая важна для читателя, решающего, стоит ли обращать внимание: inclusionAI уже дважды за одну неделю тихо выложила веса диффузионных моделей — эту модель 5 сентября, а чекпоинты генерации LLaDA-Image днём ранее, — так что тихий релиз в репозиторий, судя по всему, является устоявшейся практикой выпуска для лаборатории, а не случайностью. Ничто в этой практике не говорит нам о том, последует ли анонс.

Что такое LLaDA2.2-mini на самом деле

Архитектура — самое интересное в этой модели, и она полностью описана на карточке. LLaDA2.2-mini — это диффузионная языковая модель на основе смеси экспертов, построенная на базе LLaDA2.0-mini. Диффузионные языковые модели переворачивают обычный цикл генерации: вместо того чтобы авторегрессионная модель предсказывала по одному следующему токену за раз, диффузионная LLM начинает с блока замаскированных или зашумлённых токенов и параллельно уточняет весь блок, убирая шум и приближаясь к связной последовательности. Генерация LLaDA2.2 добавляет то, что inclusionAI называет редактированием Левенштейна: два управляющих токена — DELETE и INSERT, — которые позволяют декодеру изменять длину и структуру создаваемой последовательности, а не только её содержимое: удалять уже написанный избыточный фрагмент или открывать точку вставки там, куда нужно поместить новый контекст (например, результат работы инструмента). Именно этот механизм позволяет семейству моделей применять диффузионный декодинг в многошаговых циклах с инструментами, где авторегрессионная модель может просто дождаться следующего хода пользователя, а блочной диффузионной модели приходится пересматривать уже сгенерированное.

Все релевантные характеристики — прямо из карточки модели: суммарно 16 миллиардов параметров без учёта эмбеддингов; 1,4 миллиарда активных на токен через MoE с 256 экспертами, из которых на каждый токен маршрутизируется по 8; 20 слоёв, 16 голов внимания, 4 KV-головы; словарь на 157 184 токена; ротационные позиционные эмбеддинги; контекстное окно на 128K токенов. Техника Block Routing ограничивает, какие эксперты активируются на уровне диффузионных блоков, — именно так модель делает контекст в 128K токенов выполнимым на одной потребительской видеокарте. Карточка позиционирует модель под видеокарты с объёмом памяти от 24 ГБ и рекомендует SGLang в качестве serving-бэкенда для агентных сценариев с длинным контекстом.

A self-built timeline graphic titled 'The LLaDA family, to September 5, 2026' with four node cards: 'LLaDA2.0 — Nov 2025 — First diffusion LM scaled to 100B', 'LLaDA2.1 — Feb 2026 — Token editing for faster diffusion', 'LLaDA2.2-flash — Jul 2026 — Agentic diffusion · ~100B, announced', and 'LLaDA2.2-mini — Sep 5, 2026 — 1.4B-active agent · weights, quiet', with a footer 'Per the inclusionAI/LLaDA2.X GitHub README and Hugging Face repository timestamps' and the OrcaRouter logo composited in the bottom-right corner.

Выше показано, где этот релиз находится на временной шкале семейства — той линии развития, которая делает «LLaDA2.2-mini» осмысленным. LLaDA2.0 в ноябре 2025 года стала первой диффузионной языковой моделью, масштабированной до 100 миллиардов параметров; LLaDA2.1 в феврале 2026 года добавила редактирование токенов для ускорения текстовой диффузии; поколение LLaDA2.2 в июле 2026 года, анонсированное вместе с LLaDA2.2-flash и её техническим отчётом, нацелило семейство на агентов. Mini — та часть этого поколения, которая до сих пор оставалась лишь обещанием: в сообщениях об июльском релизе уже упоминался более лёгкий вариант flash на 16 млрд параметров для более дешёвого развёртывания, но отдельные веса появились только 5 сентября.

Числа на карточке, подписанные в соответствии с тем, чем они являются.

Таблица бенчмарков на карточке модели принадлежит самой inclusionAI и была напечатана в день выхода весов; ни одна независимая лаборатория не воспроизвела ни одного из этих результатов — у Artificial Analysis нет записи для LLaDA2.2-mini, и мы не находим ни одного стороннего прогона. Воспринимайте эти цифры как заявления вендора с определённым уклоном, а не как измеренные факты. В такой трактовке история, которую рассказывает карточка, последовательна: LLaDA2.2-mini — это специалист по агентным задачам и длинному контексту, и ради этого она жертвует частью баллов в общих бенчмарках.

• Агентное среднее — 59.00, по результатам τ²-Bench — 57.50, Claw-Eval — 57.16 и PinchBench — 62.33 (указано поставщиком).

• Вызов функций — 47.68 на BFCL v4, что выше 25.05 и 28.44 для LLaDA2.0-mini и LLaDA2.1-mini соответственно; 69.02 на более старой версии BFCL v3.

• Длинный контекст — 34.99 на LongBench v2, что более чем вдвое превышает 15.51 и 12.13, показанные предыдущими мини-моделями; это конкретный результат окна в 128K.

• Общее — средний общий балл 46,47, при этом AIME 2026 — 35,05, OlympiadBench — 61,11, LiveCodeBench v6 — 28,14, GPQA-Diamond — 44,41 и IFBench — 24,93; несколько из этих значений немного ниже прежних мини-версий, что является видимой ценой расходования бюджета на обучение на агентное поведение вместо повышения этих показателей.

A self-built single-column scoreboard titled 'LLaDA2.2-mini — the scoreboard' listing Type 'MoE diffusion LM with Levenshtein editing (DELETE / INSERT)', Total params '16B (excl. embeddings)', Active params '1.4B — top-8 of 256 experts', Context '128K tokens', Agentic avg '59.00 — τ²-Bench 57.50 · Claw-Eval 57.16 · PinchBench 62.33', Function calling 'BFCL v4 47.68 (up from ~25-28 for prior minis)', with a footer 'All figures from the inclusionAI model card — vendor-reported, not independently reproduced' and the OrcaRouter logo composited in the bottom-right corner.

Над этим последним пунктом стоит задуматься, потому что это честная причина, по которой команда выберет эту модель вместо универсальной, которая на бумаге выглядит сильнее. LLaDA2.2-mini не претендует на звание лучшей маленькой модели в математике или следовании инструкциям; она претендует на то, чтобы хорошо справляться с тем, в чём диффузионные модели исторически были плохи, — с продолжительной многоходовой работой с инструментами, — сохраняя при этом количество активных параметров достаточно низким, чтобы это имело значение при работе на одном GPU. Скачок в BFCL v4 и скачок в LongBench v2 — это те показатели, которые устояли бы при независимом прогоне, если карточка модели в целом правдива.

Его запуск и отсутствующие леса.

На бумаге путь к запуску LLaDA2.2-mini выглядит просто, поскольку релиз является нативным для Transformers: в карточке указана загрузка с помощью AutoModelForCausalLM и trust_remote_code=True на transformers ≥ 5.2.0, а затем вызов generate с диффузионными параметрами — рекомендуемые значения по умолчанию: длина блока 32 и температура 0.0; карточка также предлагает длину выходной последовательности в 32 768 токенов для большинства запросов. Для агентного обслуживания длинного контекста она указывает на SGLang, а пользователи материкового Китая получают зеркало ModelScope. Чего пока нет — так это окружающей экосистемы: ни одного размещённого API у провайдеров, которые мы можем проверить, ни одной найденной сборки GGUF, а поддержка фреймворков всё ещё устаканивается — работа сообщества над архитектурой LLaDA2 в llama.cpp недавняя, так что с квантизацией пока всё скудно.

Такое сочетание — по-настоящему новая парадигма декодирования, которой всего один день и которая доступна только в self-host варианте, — это как раз тот случай, когда слой маршрутизации оправдывает своё существование, не делая вид, что новая модель готова к продакшену. Ответственный способ попробовать LLaDA2.2-mini — запустить её самостоятельно на тестовом контуре, пока продакшен работает на зрелой модели. Именно для этого и нужен OrcaRouter: один API для более чем 200 моделей по ценам провайдеров с нулевой наценкой, автоматический failover, чтобы зависший однодневный чекпоинт не обрушивал рабочий процесс, и DSL для маршрутизации, позволяющий за одним ключом объединять вызов self-hosted диффузионной модели с размещёнными у провайдера авторегрессионными моделями. Когда — если вообще — провайдер добавит LLaDA2.2-mini в каталог, будет действовать тот же pass-through, и вы увидите цену самого провайдера. А до тех пор честный ответ о доступности такой: скачайте веса под лицензией Apache-2.0 с Hugging Face или ModelScope и запустите их самостоятельно.

Что посмотреть дальше

Три вещи превратили бы то, что мы знаем на данный момент, в полноценную историю, и все три сегодня отсутствуют. Во-первых, анонс: если паттерн LLaDA2.2-flash сохранится, за тихим появлением репозитория могут последовать пост о запуске и освещение в техническом отчёте, и это, вероятно, добавило бы детали обучения, которые карточка модели опускает. Во-вторых, независимый прогон: среднее по агентным бенчмаркам 59.00 и балл BFCL v4 47.68 — это утверждения, которые стоит воспроизводить в первую очередь, потому что именно на агентных бенчмарках выбор харнесса сильнее всего влияет на баллы. В-третьих, зрелость серверного обслуживания: руководства по развёртыванию SGLang, путь через vLLM и квантизации сообщества показали бы, действительно ли эксплуатация при 1.4B активных параметров настолько же дёшева на практике, как следует из спецификации. Ничего из этого на 6 сентября не существует. Веса реальны, лицензия разрешительная, и архитектура действительно представляет собой иной способ запуска агента — но доказательства того, что это хороший агент, — это пока что карточка одного вендора.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube