
LLaDA2.2-mini: веса диффузионного агента Ant inclusionAI тихо появились 5 сентября
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0455Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0247Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0247Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0157Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2646Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1849Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1541Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1251Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0547Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0347Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2140Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Интеллект49Кодинг
5 сентября 2026 года в 05:16 UTC появился репозиторий на Hugging Face под названием inclusionAI/LLaDA2.2-mini — и на момент написания этого текста это практически вся история релиза: веса опубликованы, карточка модели заполнена, а вендор — inclusionAI, лаборатория Ant Group, стоящая за линейкой диффузионных моделей LLaDA, — ничего об этом не сообщил. Ни анонса, ни публикаций в соцсетях, ни строки в таблице моделей в README репозитория inclusionAI/LLaDA2.X на GitHub, где в одиночестве значится более крупная LLaDA2.2-flash. Через двадцать четыре часа после появления репозитория счётчик загрузок показывал ноль. Это текст в формате «что нам известно на данный момент» о LLaDA2.2-mini, и строгость такого формата здесь важна, потому что почти каждое примечательное число, связанное с моделью, — это число, которое inclusionAI вписала в собственную карточку. Эта статья отделяет то, что о релизе можно проверить независимо, от того, что сообщил вендор, и называет открытые вопросы, а не сглаживает их.
Короткая версия для тех, кому нужно лишь общее представление: LLaDA2.2-mini — младший собрат диффузионной языковой модели LLaDA2.2-flash, анонсированной inclusionAI в июле 2026 года. Модель выпущена как чекпоинт со смесью экспертов на 16 миллиардов параметров, из которых на каждый токен активируется лишь 1,4 миллиарда; она поддерживает контекст в 128K токенов и обучена для агентных сценариев — вызова инструментов, многоходовой коррекции — за счёт диффузионного декодера, способного вставлять и удалять токены прямо в ходе генерации. Лицензия — Apache-2.0. А поскольку веса появились лишь день назад и не подкреплены анонсом, привычного окружения вокруг них пока нет: ни независимых оценок, ни размещённого API, который нам удалось бы найти, ни руководств по развёртыванию, кроме тех, что рекомендует сама карточка модели. Что можно проверить уже сегодня, так это архитектуру, лицензию и цифры, которые inclusionAI решила опубликовать.
Релиз — это репозиторий, а не событие
Начнём с того, что можно проверить, никому не доверяя. Hugging Face API показывает, что модель inclusionAI/LLaDA2.2-mini была создана 5 сентября 2026 года и в тот же день последний раз изменена. Она распространяется по лицензии Apache-2.0, использует формат safetensors с bf16-тензорами, содержит чат-шаблон и требует trust_remote_code, поскольку диффузионная архитектура поставляется в виде пользовательского кода модели. Родственная модель, inclusionAI/LLaDA2.2-flash, была создана 16 июля 2026 года, за прошедшие недели набрала тысячи загрузок и десятки лайков и была публично анонсирована. У мини-модели нет ни анонса, ни признания — в первый день она получила лишь однозначное число лайков и вообще ни одной загрузки.

Единственное внимание со стороны третьих лиц, которое пока привлекла мини-модель, — это страница-агрегатор, переопубликовавшая карточку модели в течение нескольких часов после появления репозитория; это зеркало карточки, а не независимый источник, и она не содержит информации, которой нет в самом репозитории. Это весь публичный след по состоянию на 6 сентября. Рамка, которая важна для читателя, решающего, стоит ли обращать внимание: inclusionAI уже дважды за одну неделю тихо выложила веса диффузионных моделей — эту модель 5 сентября, а чекпоинты генерации LLaDA-Image днём ранее, — так что тихий релиз в репозиторий, судя по всему, является устоявшейся практикой выпуска для лаборатории, а не случайностью. Ничто в этой практике не говорит нам о том, последует ли анонс.
Что такое LLaDA2.2-mini на самом деле
Архитектура — самое интересное в этой модели, и она полностью описана на карточке. LLaDA2.2-mini — это диффузионная языковая модель на основе смеси экспертов, построенная на базе LLaDA2.0-mini. Диффузионные языковые модели переворачивают обычный цикл генерации: вместо того чтобы авторегрессионная модель предсказывала по одному следующему токену за раз, диффузионная LLM начинает с блока замаскированных или зашумлённых токенов и параллельно уточняет весь блок, убирая шум и приближаясь к связной последовательности. Генерация LLaDA2.2 добавляет то, что inclusionAI называет редактированием Левенштейна: два управляющих токена — DELETE и INSERT, — которые позволяют декодеру изменять длину и структуру создаваемой последовательности, а не только её содержимое: удалять уже написанный избыточный фрагмент или открывать точку вставки там, куда нужно поместить новый контекст (например, результат работы инструмента). Именно этот механизм позволяет семейству моделей применять диффузионный декодинг в многошаговых циклах с инструментами, где авторегрессионная модель может просто дождаться следующего хода пользователя, а блочной диффузионной модели приходится пересматривать уже сгенерированное.
Все релевантные характеристики — прямо из карточки модели: суммарно 16 миллиардов параметров без учёта эмбеддингов; 1,4 миллиарда активных на токен через MoE с 256 экспертами, из которых на каждый токен маршрутизируется по 8; 20 слоёв, 16 голов внимания, 4 KV-головы; словарь на 157 184 токена; ротационные позиционные эмбеддинги; контекстное окно на 128K токенов. Техника Block Routing ограничивает, какие эксперты активируются на уровне диффузионных блоков, — именно так модель делает контекст в 128K токенов выполнимым на одной потребительской видеокарте. Карточка позиционирует модель под видеокарты с объёмом памяти от 24 ГБ и рекомендует SGLang в качестве serving-бэкенда для агентных сценариев с длинным контекстом.

Выше показано, где этот релиз находится на временной шкале семейства — той линии развития, которая делает «LLaDA2.2-mini» осмысленным. LLaDA2.0 в ноябре 2025 года стала первой диффузионной языковой моделью, масштабированной до 100 миллиардов параметров; LLaDA2.1 в феврале 2026 года добавила редактирование токенов для ускорения текстовой диффузии; поколение LLaDA2.2 в июле 2026 года, анонсированное вместе с LLaDA2.2-flash и её техническим отчётом, нацелило семейство на агентов. Mini — та часть этого поколения, которая до сих пор оставалась лишь обещанием: в сообщениях об июльском релизе уже упоминался более лёгкий вариант flash на 16 млрд параметров для более дешёвого развёртывания, но отдельные веса появились только 5 сентября.
Числа на карточке, подписанные в соответствии с тем, чем они являются.
Таблица бенчмарков на карточке модели принадлежит самой inclusionAI и была напечатана в день выхода весов; ни одна независимая лаборатория не воспроизвела ни одного из этих результатов — у Artificial Analysis нет записи для LLaDA2.2-mini, и мы не находим ни одного стороннего прогона. Воспринимайте эти цифры как заявления вендора с определённым уклоном, а не как измеренные факты. В такой трактовке история, которую рассказывает карточка, последовательна: LLaDA2.2-mini — это специалист по агентным задачам и длинному контексту, и ради этого она жертвует частью баллов в общих бенчмарках.
• Агентное среднее — 59.00, по результатам τ²-Bench — 57.50, Claw-Eval — 57.16 и PinchBench — 62.33 (указано поставщиком).
• Вызов функций — 47.68 на BFCL v4, что выше 25.05 и 28.44 для LLaDA2.0-mini и LLaDA2.1-mini соответственно; 69.02 на более старой версии BFCL v3.
• Длинный контекст — 34.99 на LongBench v2, что более чем вдвое превышает 15.51 и 12.13, показанные предыдущими мини-моделями; это конкретный результат окна в 128K.
• Общее — средний общий балл 46,47, при этом AIME 2026 — 35,05, OlympiadBench — 61,11, LiveCodeBench v6 — 28,14, GPQA-Diamond — 44,41 и IFBench — 24,93; несколько из этих значений немного ниже прежних мини-версий, что является видимой ценой расходования бюджета на обучение на агентное поведение вместо повышения этих показателей.

Над этим последним пунктом стоит задуматься, потому что это честная причина, по которой команда выберет эту модель вместо универсальной, которая на бумаге выглядит сильнее. LLaDA2.2-mini не претендует на звание лучшей маленькой модели в математике или следовании инструкциям; она претендует на то, чтобы хорошо справляться с тем, в чём диффузионные модели исторически были плохи, — с продолжительной многоходовой работой с инструментами, — сохраняя при этом количество активных параметров достаточно низким, чтобы это имело значение при работе на одном GPU. Скачок в BFCL v4 и скачок в LongBench v2 — это те показатели, которые устояли бы при независимом прогоне, если карточка модели в целом правдива.
Его запуск и отсутствующие леса.
На бумаге путь к запуску LLaDA2.2-mini выглядит просто, поскольку релиз является нативным для Transformers: в карточке указана загрузка с помощью AutoModelForCausalLM и trust_remote_code=True на transformers ≥ 5.2.0, а затем вызов generate с диффузионными параметрами — рекомендуемые значения по умолчанию: длина блока 32 и температура 0.0; карточка также предлагает длину выходной последовательности в 32 768 токенов для большинства запросов. Для агентного обслуживания длинного контекста она указывает на SGLang, а пользователи материкового Китая получают зеркало ModelScope. Чего пока нет — так это окружающей экосистемы: ни одного размещённого API у провайдеров, которые мы можем проверить, ни одной найденной сборки GGUF, а поддержка фреймворков всё ещё устаканивается — работа сообщества над архитектурой LLaDA2 в llama.cpp недавняя, так что с квантизацией пока всё скудно.
Такое сочетание — по-настоящему новая парадигма декодирования, которой всего один день и которая доступна только в self-host варианте, — это как раз тот случай, когда слой маршрутизации оправдывает своё существование, не делая вид, что новая модель готова к продакшену. Ответственный способ попробовать LLaDA2.2-mini — запустить её самостоятельно на тестовом контуре, пока продакшен работает на зрелой модели. Именно для этого и нужен OrcaRouter: один API для более чем 200 моделей по ценам провайдеров с нулевой наценкой, автоматический failover, чтобы зависший однодневный чекпоинт не обрушивал рабочий процесс, и DSL для маршрутизации, позволяющий за одним ключом объединять вызов self-hosted диффузионной модели с размещёнными у провайдера авторегрессионными моделями. Когда — если вообще — провайдер добавит LLaDA2.2-mini в каталог, будет действовать тот же pass-through, и вы увидите цену самого провайдера. А до тех пор честный ответ о доступности такой: скачайте веса под лицензией Apache-2.0 с Hugging Face или ModelScope и запустите их самостоятельно.
Что посмотреть дальше
Три вещи превратили бы то, что мы знаем на данный момент, в полноценную историю, и все три сегодня отсутствуют. Во-первых, анонс: если паттерн LLaDA2.2-flash сохранится, за тихим появлением репозитория могут последовать пост о запуске и освещение в техническом отчёте, и это, вероятно, добавило бы детали обучения, которые карточка модели опускает. Во-вторых, независимый прогон: среднее по агентным бенчмаркам 59.00 и балл BFCL v4 47.68 — это утверждения, которые стоит воспроизводить в первую очередь, потому что именно на агентных бенчмарках выбор харнесса сильнее всего влияет на баллы. В-третьих, зрелость серверного обслуживания: руководства по развёртыванию SGLang, путь через vLLM и квантизации сообщества показали бы, действительно ли эксплуатация при 1.4B активных параметров настолько же дёшева на практике, как следует из спецификации. Ничего из этого на 6 сентября не существует. Веса реальны, лицензия разрешительная, и архитектура действительно представляет собой иной способ запуска агента — но доказательства того, что это хороший агент, — это пока что карточка одного вендора.
