Титульная карточка-обложка для «AesCode-32B» с подзаголовком «Microsoft загрузила 33B весов, которые создают презентации в виде редактируемого HTML, — и ничего не объявила», три чипа с надписями «33B параметров, BF16», «База: Qwen3-VL-32B-Instruct» и «Нет хостингового API», плоская линейная иконка окна браузера с макетом слайда, панелью диаграммы и двумя строками таблицы, а также строка нижнего колонтитула: «По данным microsoft/AesCode-32B на Hugging Face и github.com/microsoft/AesCode, прочитано 11 октября 2026 г.»; логотип OrcaRouter расположен в правом нижнем углу расширенного холста.
Guides & Insights

AesCode-32B: тихая 33B-модель Microsoft, которая создаёт презентации в виде редактируемого HTML

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Отметки времени у AesCode-32B противоречат друг другу, и это расхождение — почти всё, о чём стоит сообщить. Репозиторий на Hugging Face microsoft/AesCode-32B был создан 29 сентября 2026 года, но всё в нём появилось одним коммитом от 7 октября 2026 года, сообщение которого — просто «Release AesCode-32B», а обучающий стек, благодаря которому результат воспроизводим, был выложен в github.com/microsoft/AesCode 8 октября. Microsoft ничего не анонсировала: ни поста в блоге, ни препринта на arXiv, ни заявки в лидерборд, ни страницы модели на собственном сайте. Есть только визуально-языковая модель на 33 миллиарда параметров, которая принимает промпт и выдаёт полный самодостаточный HTML-документ — слайд, постер, дашборд, — а также меньшая модель-компаньон microsoft/AesCode-8B. Обе дообучены на основе визуальных моделей Qwen3-VL — Qwen3-VL-32B-Instruct и Qwen3-VL-8B-Instruct соответственно, — обе под лицензией Apache 2.0, и обе можно скачать уже сегодня.

Идентификатор репозитория — microsoft/AesCode-32B, а карточка начинается с приёма: AesCode соединяет ваш запрос с изображением, сгенерированным по тому же самому запросу, использует это изображение как эстетический ориентир и следует за текстом в том, что касается фактического содержания. Генераторы изображений собирают красивую страницу и неверно отрисовывают на ней числа; модели для кода передают числа правильно и не видят, как выглядит страница. AesCode — попытка получить и то и другое, и честная его оценка по состоянию на 11 октября 2026 года такова: веса реальны и проверяемы, числа бенчмарков — собственные числа лаборатории, полученные на написанном ею тестовом стенде, и никто за пределами Microsoft до сих пор не опубликовал для него ни одной цифры. Этот материал на всём протяжении разделяет эти три категории.

Что на самом деле находится в репозитории, побайтово

A headless-browser capture of the Hugging Face model page for microsoft/AesCode-32B, showing the repo heading, a Like count of 1, 'License: apache-2.0', the card intro text, the sentence describing training with GDPO, and the bulleted Paper, Code and Companion links; the surrounding Hugging Face navigation and search chrome is included.

Начните с того, что можно проверить, не доверяя ни одному слову карточки модели. Репозиторий 32B состоит из четырнадцати шардов safetensors общим объёмом 66 714 912 704 байта, что при BF16 составляет примерно 33,4 млрд параметров — это согласуется с указанными в карточке «33B params» и её предупреждением о том, что только веса требуют около 65 ГБ памяти ускорителя. В конфигурации указана Qwen3VLForConditionalGeneration в качестве архитектуры и qwen3_vl в качестве типа модели, поэтому это не новая архитектура и не нуждается в ней: она загружается с помощью transformers>=4.57, а карточка содержит команду vLLM, которая обслуживает её на четырёх тензорно-параллельных рангах, разрешая два изображения на промпт, с ограничением в 24 576 токенов.

Счётчики вовлечённости — самая тихая часть релиза. Две загрузки и один лайк на репозитории 32B на момент написания. В списке inference-провайдеров Hugging Face нет записи, а значит, за страницей репозитория не подключён ни один хостируемый эндпоинт, и нигде не заявлена сборка GGUF, MLX или llama.cpp. Для модели, носящей имя Microsoft и показывающей результаты, которые превосходят GPT-5.5 в собственной таблице вендора, это поразительно малый след — и это самое сильное из имеющихся свидетельств того, что публикация обошлась без запуска.

Сопутствующий репозиторий с кодом дополняет вторую половину временной шкалы, и именно здесь вопрос о дате выпуска становится по-настоящему неоднозначным. microsoft/AesCode был создан 23 июля 2026 года — за десять недель до появления весов — и содержит четырнадцать коммитов, каждый из которых создан одним и тем же контрибьютором, а временные метки всех их находятся в пределах двадцати секунд друг от друга, 8 октября 2026 года, между 23:14:04 и 23:14:24 UTC. Они включают спецификацию для генерации промптов и проверяемых требований, конвейер данных, который строит графы проектирования и вопросы для рубрик, этап холодного старта SFT, цикл обучения с подкреплением GDPO, верификатор рендеринга на основе Playwright, тесты и README, документирующий всё это. Нет ни релизов, ни тегов, описание репозитория пусто, и у него одна звезда.

A headless-browser capture of the github.com/microsoft/AesCode repository page, showing the org and repo name 'microsoft / AesCode', the line 'No description, website, or topics provided', the README summary listing overview, results and the reproduction guide, a commit count of 14, an MIT licence label, and the top-level directory tree including assets, data_prep, eval and examples/hospital_dashboard.

Так какая же дата — дата релиза? Запись в репозитории указывает на 29 сентября. Коммит, в котором содержится модель, — на 7 октября. Код, объясняющий, как была создана модель, — на 8 октября. Три временные метки в пределах одного двухнедельного окна, и ни одну из них не сопровождает фраза Microsoft о том, что «мы это выпускаем». Считайте 7–8 октября рабочей датой для артефактов, которые большинство людей действительно скачает, а 29 сентября — датой, когда репозиторий был зарезервирован. Любой, кто говорит вам, что AesCode-32B «запустили» в конкретный день, выбирает одну из этих временных меток за вас.

Механизм: изображение как эстетический ориентир, граф как награда.

Техническое утверждение карты узкое и конкретное, что говорит в его пользу. Модель обучена с использованием контролируемого дообучения с холодного старта на 3000 демонстрациях при скорости обучения 1e-5, затем с GDPO — вариантом групповой относительной оптимизации политики — на 7408 промптах в течение 520 шагов. Модель 8B использовала тот же рецепт и остановилась на 400 шагах. Запуск RL использовал гибридный движок FSDP-vLLM от verl без критика и без отдельно обученной модели вознаграждения, AdamW с постоянной скоростью обучения 5e-6 без разогрева, 128 промптов на шаг с восемью роллаутами каждый, а промпт и ответ ограничены 8192 токенами каждый.

Необычность этой награды в том, что она не является единым скаляром. Каждая цель обучения описывается как граф дизайна, охватывающий весь холст, поэтому отдельные свойства можно атрибутировать по отдельности. Из этого графа вытекают семь каналов — исполнение, текст, границы, табличная диаграмма, макет, пустое пространство и дизайн — каждый из которых нормализуется в пределах своей группы роллаутов перед агрегацией, чтобы один доминирующий сигнал не заглушал остальные. Детерминированные верификаторы оценивают то, что можно распарсить из кода и его рендеринга; визуально-языковой судья оценивает то, что нельзя, используя рубрику, привязанную к собственным элементам и связям графа. HTML-кандидат оценивается путём рендеринга в браузере Playwright, запущенном в песочнице, с блокировкой внешних запросов; при этом экспортируются DOM, вычисленные стили, ограничивающие рамки, состояние консоли и скриншот.

Об инженерном следствии стоит упомянуть, потому что оно проявляется в выводе, который вы получаете: модель обучена выдавать таблицы как настоящие HTML-структуры таблиц, а графики — как спецификации ECharts, поэтому и то, и другое можно напрямую инспектировать, а не вшивать в пиксели. В этом разница между презентацией, которую можно отдать дизайнеру, и презентацией, которую можно отдать линтеру. Требования к воспроизведению соответственно тяжёлые — README требует Python 3.10, CUDA 12.6 и узел из восьми B200 GPU, закрепляет конкретный коммит verl и прямо указывает, что к нему требуется патч, поскольку стандартный verl не поддерживает Qwen3-VL, а также предупреждает, что без системных библиотек Playwright браузер падает при запуске, а страницы получают нулевую оценку, и что без закреплённого OCR-стека соответствующий канал вознаграждения возвращает ноль вместо воздержания и незаметно искажает сигнал.

Таблица бенчмарков, и четыре причины не держаться за неё слишком крепко

Основные показатели AesCode-32B получены на 300 образцах инфографики: по три генерации на запрос при температуре 0,8 и top-p 0,95, до 12 000 выходных токенов каждая, без отбора среди генераций. Оценки указаны в процентах. При использовании референса 32B-модель показывает Text 95,34, Boundary 97,27, Table/Chart 90,37 и среднее по Rule 94,33; по визуальной части — Content 85,76, Layout 90,58, Style 55,99, что даёт среднее по Visual 77,44 и Overall 85,89. В той же таблице GPT-5.5 с референсом набирает Overall 81,28, а Claude Opus 4.8 с референсом — 80,39, тогда как базовая модель Qwen3-VL-32B-Instruct, на которой обучалась эта модель, набирает 61,10.

A single-column scoreboard headed 'AesCode-32B - the scoreboard' with six rows reading 'Parameters: 33B BF16 (66.7 GB of weights)', 'Base model: Qwen3-VL-32B-Instruct', 'Overall (vendor): 85.89 vs GPT-5.5 at 81.28', 'Boundary: 97.27 - severe overflow on 4.3% of samples', 'Style: 55.99 - no model in the table clears 60' and 'Hosted API: none - self-host only', with a footer line reading 'All figures vendor-reported by Microsoft on its own rubric; no independent run has been published.'; the OrcaRouter logo sits in the bottom-right corner of the extended canvas.

Четыре оговорки должны прозвучать в одном ряду с этими цифрами, и ни одна из них не бросает тень на саму работу. Во-первых, каждая строка, включая строки GPT-5.5 и Claude Opus 4.8, была прогнана Microsoft на стенде Microsoft с оценочной рубрикой Microsoft — это не показатели других лабораторий, а измерения Microsoft для моделей конкурентов; к тому же сама карточка называет рубрику «специфичной для выборки» применительно к каждому дизайн-графу. Во-вторых, рубрика создаётся тем же конвейером, который генерировал обучающие данные, а это ровно та схема, в которой бенчмарк может смещаться в сторону сильных сторон модели; карточка откровенно говорит об ограничениях этой рубрики — Style, требующий, чтобы дизайн не нуждался в дальнейшей визуальной доработке перед сдачей, назван «общим потолком для каждой системы», и ни одна модель в таблице не преодолевает планку в 60. В-третьих, нигде нет независимых измерений этой модели: ни записи в стороннем лидерборде, ни воспроизведения, а учитывая две загрузки, почти наверняка её за пределами лаборатории пока никто не запускает. В-четвёртых, сравнение обладает неочевидной асимметрией, которую стоит заметить: все строки AesCode-32B получены с обусловливанием на референс, то есть модель измеряется в той конфигурации, для которой обучалась, и карточка признаёт это, показывая, что качество всё ещё наивысшее, когда референс предоставлен.

Единственный результат в таблице, который выдерживает проверку лучше заголовочного, — это утверждение о робастности, а не о качестве. Отказ от подачи референсного изображения на этапе инференса стоит AesCode-8B всего 1,00 балла Visual против 19,55 у его базовой модели Qwen3-VL-8B-Instruct и 10,04 у GPT-5.5. Аргумент карточки состоит в том, что обучение с обусловливанием на референсное изображение интернализует визуальное планирование в политику, а не учит модель копировать то, что она видит. Это заявлено производителем и не воспроизведено, и это также тот тип утверждения, который разрешил бы один независимый прогон, — и тот тип, который важнее всего в продакшене, где у вас не всегда под рукой есть референсное изображение.

Сколько стоит эксплуатация и что это значит для сравнения

Ничего в этой модели не обходится дёшево при самостоятельном хостинге. От десяти до двенадцати тысяч выходных токенов — это рабочий объём одного артефакта, а полный HTML-документ со спецификацией ECharts ближе к верхней границе этого диапазона, чем к нижней, поэтому каждая генерация — это долгое декодирование. Собственный рецепт обслуживания из карточки модели требует четырёх GPU с тензорным параллелизмом, чтобы уместить примерно 65 ГБ параметров BF16, а рецепт обучения требует восьми B200. Это настоящая машина, а не хобби-развёртывание, и она задаёт условия сравнения: модели, с которыми сравнивают AesCode-32B, арендуются по токенам, а сама модель арендуется по GPU-часам, владеете вы оборудованием или нет.

Практическая суть этого сравнения — как раз то, ради чего существует слой маршрутизации, и стоит быть точными в том, что мы хостим, а что нет. AesCode-32B нет в каталоге OrcaRouter, и мы его не обслуживаем — хостингового эндпоинта для него нет нигде, где я могу это проверить, включая Microsoft. А в каталоге есть другая сторона стола: хостинговые модели, с которыми вы стали бы сравнивать самостоятельно размещённый генератор артефактов, включая GPT-5.5 и более компактные визуальные модели Qwen3-VL, доступные через один ключ API по прайсовой цене провайдера с наценкой 0%, а это значит, что изменение цены у вендора действует у нас в тот же день. Сравнивать арендованный эндпоинт с моделью, которую вы запускаете сами, не требует второго контракта или второго SDK, а DSL маршрутизации позволяет самостоятельному вызову стоять рядом с хостинговыми за единым эндпоинтом. Если AesCode-32B окажется хорош в том единственном, что заявлено в его карточке, цена проверки — счёт за GPU, а цена альтернатив, с которыми вы его сравниваете, — один ключ, который у вас, скорее всего, уже есть.

Что вы можете сделать с этим сегодня, а чего не существует

• Скачайте и запустите — веса под лицензией Apache 2.0, на основе Qwen3-VL, с четырнадцатью BF16-шардами и работающим transformersпутём для версии выше 4.57 и рецептом vLLM в карточке.

• Воспроизведите обучение — код распространяется по лицензии MIT и достаточно полон, чтобы быть содержательным: верификатор вознаграждения, конструктор рубрик, этапы SFT и GDPO, зафиксированный коммит verl плюс патч, добавляющий поддержку Qwen3-VL, и README, в котором перечислены режимы отказа, а не скрыты.

• Оцените это без эталона — модель принимает промпты с референсным изображением или без него, и самое проверяемое утверждение карточки заключается именно в этой конфигурации.

• Получить для него API — нельзя. Нет размещённого эндпоинта, в репозитории нет сопоставления с провайдером инференса, и нет сборки GGUF или MLX; запуск этого означает запуск на собственном оборудовании.

• Прочитать статью — пока не получится. В карточке есть ссылка на статью под названием AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards, а её собственная запись BibTeX указывает в качестве места публикации «Under review», а в качестве года — 2027. Поиск по arXiv не находит статьи с таким названием. Есть другая, более ранняя статья Microsoft с почти идентичным названием — Code Aesthetics with Agentic Reward Feedback от октября 2025 года, в которой были выпущены модель AesCoder-4B и датасет AesCode-358K, — и ничто в карточке AesCode-32B не ссылается на неё и не указывает на связь с ней. Если вы отправитесь искать материалы для ознакомления и наткнётесь именно на неё, вы будете читать о другой модели, созданной частично теми же авторами.

• Сравнить его на публичном лидерборде — пока нет. Похоже, ни один сторонний индекс не оценивал его, что неудивительно для репозитория с двумя загрузками.

Кому стоит беспокоиться, а кому — подождать

Аудитория этого уже, чем предполагает таблица из заголовка, и конкретнее, чем «все, кто строит что-либо с помощью моделей». Если ваш продукт превращает промпты в презентации, постеры, отчёты или дашборды, которые кому-то приходится редактировать после этого, вы уже обнаружили выбор, на который нацелена эта модель: генерация изображений даёт вам красивый прямоугольник, который нельзя изменить, а генерация кода даёт что-то редактируемое, но выглядящее так, будто его собрал компилятор. 33B-модель с открытыми весами, которая выдаёт полный HTML-документ с настоящими таблицами и спецификациями ECharts, остаётся в пределах примерно одного пункта от своего качества при обусловливании референсом, когда вам нечего дать ей в качестве референса, и которую можно дообучить на собственном фирменном стиле в рамках Apache 2.0, — это по-настоящему полезная вещь, существование которой имеет смысл. Ни одна другая модель не выполняет именно эту задачу при таком размере и на таких условиях.

В противовес этому: всё, что вы знаете о качестве, взято из таблицы, которую построил поставщик, а рубрика, лежащая в её основе, была создана тем же конвейером, который подготовил обучающие данные; и единственное ограничение, которое признаёт карточка, — Style ниже 60 для каждой протестированной системы — это именно та характеристика, которая важнее всего для продукта, чувствительного к дизайну. У команды, у которой есть причина, связанная с соответствием требованиям, держать генерацию внутри компании, и запасной узел на восемь GPU, достаточно ресурсов, чтобы начать уже сегодня. Команда, выбирающая модель для продакшена на следующей неделе, не имеет независимой цифры, на которую можно опереться при выборе, и не должна расценивать 85,89 против 81,28 как окончательный результат.

Что превратило бы это в историю?

Четыре вещи, ни одна из которых пока не существует. Анонс — Microsoft ничего не сказала, а статья, на которую ссылается карточка, явно находится на рецензировании, поэтому технический отчёт с деталями обучения, выходящими за рамки резюме карточки, может появиться в любой момент. Независимый запуск — утверждение о робастности без эталона и показатель Boundary, который, как сказано в карточке, падает до серьёзного сбоя на 4,3% образцов против 34,7% у GPT-5.5, — и то и другое дёшево проверить, и оба заслуживают проверки. Поддержка сервинга вне рецепта вендора — сборка GGUF или появление в мейнстримном рантайме изменили бы историю с оборудованием сильнее, чем любой бенчмарк. И вторая точка данных в вопросе о размере: модель 8B, набирающая 82,94 Overall против 85,89 у 32B в той же таблице, — это разрыв в два пункта при четверти параметров, и это как раз то, что либо воспроизводится, либо тихо перестаёт упоминаться.

Пока что-то из этого не появится, точное описание AesCode-32B таково: реальные веса под разрешительной лицензией, стек обучения, описанный достаточно подробно, чтобы его могла воспроизвести хорошо оснащённая лаборатория, таблица бенчмарков, представляющая собой измерения одной компании для своей собственной модели и моделей двух конкурентов, и история репозитория, которая не позволит назвать какой-либо отдельный день датой запуска. Это более интересный артефакт, чем можно предположить по счётчику, показывающему две загрузки, и менее проверенный, чем подразумевают его 85,89. Обе части этого предложения — честная оценка по состоянию на 11 октября 2026 года.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно