
AesCode-8B против Qwen3-8B: они выглядят как родитель и ребёнок, но это не так
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов · 87 tok/s
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Названия подталкивают к ошибке. AesCode-8B — это модель на 8B с базовой архитектурой Qwen3-VL-8B-Instruct, Qwen3-8B — собственная 8B-модель вендора, и напрашивается вывод, что первая является файнтюном второй. Это не так. Опубликованный конфиг AesCode-8B указывает в качестве базы Qwen3-VL-8B-Instruct — визуально-языкового собрата, другой чекпоинт с другой задачей, — а метаданные на Hugging Face описывают её как файнтюн именно этой модели, а не текстовой Qwen3-8B. Две модели AesCode в этом классе весов — двоюродные братья, а не родитель и ребёнок, и именно это различие делает данную страницу полезной: она говорит, что Microsoft купила, начав с визуально-языкового чекпоинта, чего это стоило на текстовой стороне и почему сравнение с обычным 8B-универсалом из этого семейства в итоге измеряет форк, а не апгрейд.
Оба распространяются под Apache 2.0 и оба доступны для скачивания, но их истории публикации разительно отличаются. Qwen3-8B вышел в апреле 2025 года в составе линейки Qwen3-generation от вендора — за ним стоят документация, интеграция в экосистему и восемнадцать месяцев развёртываний силами других людей. В файлах AesCode-8B нигде нет даты выпуска. Microsoft создала репозиторий на Hugging Face 29 сентября 2026 года, закоммитила веса с сообщением «Release AesCode-8B» в 03:35 UTC 7 октября 2026 года, а на следующий день выложила код обучения на GitHub. Нет ни публикации Microsoft Research, ни примечания к выпуску, ни страницы продукта, ни статьи — в цитировании карточки модели указано «На рассмотрении» с годом-заполнителем 2027, и на момент написания этого текста у репозитория было два скачивания. Все количественные данные об AesCode-8B ниже принадлежат самой Microsoft и никем не воспроизведены.
Семейное древо, которое скрывают имена
Линейка поколения Qwen3 содержит несколько чекпоинтов класса 8B, которые роднит происхождение — и почти ничего больше. Qwen3-8B — это текстовый универсал: примерно 8,2 млрд общих параметров, из которых около 7 млрд — неэмбеддинговые, внимание с группированными запросами, встроенный контекст на 32K токенов, расширяемый до 131K с помощью YaRN, и обучение на 119 языках и диалектах. Он рассуждает, ведёт беседы, пишет код и вызывает инструменты, и именно поэтому это одна из самых распространённых самостоятельно размещаемых 8B-моделей в открытой экосистеме. Qwen3-VL-8B-Instruct — мультимодальный представитель: то же поколение семейства, сверху выделенная башня зрения, изображение и текст на входе, текст на выходе.
Microsoft начала со второго. В конфигурации AesCode-8B указано Qwen3VLForConditionalGeneration, с 36 скрытыми слоями, размером скрытого состояния 4096, 32 головами внимания и 8 головами ключ-значение, словарём на 151 936 токенов и чередующимися позициями mrope, и требуется transformers 4.57 или новее. Шарды в сумме составляют 17 543 339 408 байт, около 8,8 млрд bf16-параметров, поэтому округлённое поле размера в Hugging Face показывает 9B, тогда как поставщик указывает 8B. Это округление, а не расхождение, и количество параметров — не то ответвление, которое имеет значение — важны входная модальность и контекст обслуживания на 24 576 токенов.
Итак, честная формулировка — не «универсальная модель против её дообученной версии». Она такая: текстовая универсальная модель с длинным контекстом и восемнадцатью месяцами истории эксплуатации — против мультимодального исследовательского чекпоинта, который выдаёт документ и никогда не проходил независимую оценку.

На что Microsoft потратила бюджет на обучение
Дизайн-бриф процитирован на карточке модели, и он объясняет развилку: модели для кода «не видят, как компоновка, иерархия и цвет соединяются на холсте», тогда как генераторы изображений «создают визуально привлекательные страницы, но часто неправильно отображают текст, числа и логические связи». AesCode — это попытка взять чувство композиции у одного, а проверяемость — у другого, и рецепт необычен в одном конкретном отношении.
Каждый обучающий промпт сопоставляется с эталонным изображением, сгенерированным из того же самого промпта — в собственных прогонах Microsoft для изображения использовалась GPT-Image-2, а GPT-5.5 разворачивала короткое задание в подробный промпт с описанием содержания. Эталон несёт только компоновку и стиль; текстовый промпт остаётся определяющим по содержанию. Затем, при инференсе, модель почти не нуждается в нём: если не подать эталон AesCode-8B, его оценка Visual падает на 1,00 балла из ста, тогда как у базовой модели — 19,55, а у GPT-5.5 — 10,04. Связанный с этим результат таков: вознаграждения на основе эталона подняли Visual только по промпту с 25,17 до 69,71, так что визуальный априор перешёл в веса, а не остался во входных данных.
Остальное — история про дизайн вознаграждений. Супервизия — это «граф дизайна» из узлов и рёбер — текст, диаграммы, таблицы, карточки, регионы, слоты изображений, где рёбрами служат вложенность, выравнивание, порядок и связи — выбранный так, чтобы каждое свойство на холсте принадлежало именованному элементу и, следовательно, могло оцениваться отдельно. Семь каналов оценивают результат: шесть детерминированных верификаторов для исполнения, текста, границ, данных таблиц и диаграмм, семантической вёрстки и пустого пространства, плюс одна зависящая от образца Visual Graph Rubric, оцениваемая визуально-языковой моделью. Кандидаты отображаются в песочнице браузера Playwright с заблокированными внешними запросами, а тестовый стенд считывает DOM, вычисленные стили, ограничивающие рамки и скриншот, поэтому таблицы должны быть HTML-таблицами, а диаграммы — спецификациями ECharts. Обучение представляло собой холодный старт с дообучением под учителем на 3 000 демонстраций, затем GDPO на 7 408 промптах в течение 400 шагов на одном узле из восьми NVIDIA B200, при этом каждый канал вознаграждения нормализовывался внутри своей группы роллаутов, чтобы плотный сигнал на основе правил не заглушил разреженный визуальный. Microsoft оценивает эту нормализацию в 5,12 визуальных балла по сравнению с обычным скалярным GRPO.
Вся эта механика существует не для того, чтобы сделать AesCode-8B лучшим универсальным ассистентом. Она существует для того, чтобы вывод можно было проверить, и именно поэтому контекст модели таков, каков он есть.
Рядом, с подписанными числами
• Базовая — AesCode-8B: Qwen3-VL-8B-Instruct, визуально-языковой чекпойнт. Qwen3-8B: текстовый универсал того же поколения.
• Параметры — AesCode-8B: около 8,8 млрд bf16, распределённых по четырём шардам. Qwen3-8B: всего около 8,2 млрд, примерно 7 млрд без учёта эмбеддингов.
• Входные данные — AesCode-8B: текст плюс опциональное референсное изображение. Qwen3-8B: текст.
• Вывод — AesCode-8B: полный документ HTML и CSS. Qwen3-8B: текст, вызовы инструментов, код.
• Контекст — AesCode-8B: 24 576 токенов в заявленной конфигурации. Qwen3-8B: 32K нативно, 131K расширенно с помощью YaRN.
• Языки — AesCode-8B: в карточке указан только тег "en". Qwen3-8B: 119 языков и диалектов.
• Доказательства — AesCode-8B: собственная рубрика Microsoft по инфографике на 300 образцах, три генерации на один промпт, без внешнего воспроизведения. Qwen3-8B: восемнадцать месяцев независимых бенчмарков, работы по квантованию и промышленного развёртывания.
• Лицензия — у обоих Apache 2.0, без ограничений. Ничья, и это не тот фактор различия, каким его принято считать.
Разрыв в доказательствах — вот настоящее сравнение
Microsoft сообщает, что AesCode-8B набирает 82,94 балла Overall по своей рубрике, опережая референсно-обусловленный GPT-5.5 с 81,28 и Claude Opus 4.8 с 80,39, а также на 31,1 балла Visual опережает свой собственный референсно-обусловленный бэкбон. Три числа в этой таблице стоят больше, чем заголовок. Первое — Style: AesCode-8B находится на отметке 53,21, и ни одна модель в сравнении не превышает 60; а Microsoft определяет Style как дизайн, не требующий дальнейшей визуальной доработки перед сдачей, так что по единственному измерению, которое отвечает на вопрос, отправил бы человек страницу без правок, модель не лидирует. Второе — пограничный сбой: серьёзное переполнение canvas повторяется в 4,3% из 300 образцов против 34,7% у GPT-5.5. Третье — визуальная половина оценки исходит от неназванного vision-language-судьи, а значит, детерминированную половину может воспроизвести сторонний исследователь, а другую — нет.
Показатели Qwen3-8B берутся совсем из другого источника, и это важнее того, чей набор показателей выше. Восемнадцать месяцев независимой оценки, квантований от сообщества, бенчмарков обслуживания и продакшн-развёртываний — это другой тип доказательств: это не заявление, а история подтверждённых результатов. Вы можете узнать, как Qwen3-8B ведёт себя при четырёхбитном квантовании на конкретной карте, потому что кто-то это опубликовал. Вы не можете сделать этого для AesCode-8B, потому что по состоянию на эту неделю никто за пределами Microsoft не запускал его ни на чём.
И между этими двумя таблицами нет ни одной общей метрики. У Qwen3-8B нет оценки компоновки инфографики; у AesCode-8B вообще нет опубликованного бенчмарка для общих рассуждений. Сравнение не то чтобы близкое или неблизкое — оно недоступно.
Что на самом деле требуется для запуска каждого из них

Qwen3-8B — это простой вариант. Текстовая модель на 8,2 млрд параметров квантуется на одну потребительскую видеокарту, за ней восемнадцать месяцев инструментария во всех фреймворках для обслуживания и локальных средах выполнения, и она ведёт себя предсказуемо. Расширение контекста до 131K задокументировано, а не является фольклором, и поддержка 119 языков — причина, по которой она появляется во множестве многоязычных пайплайнов.
AesCode-8B — это проект по сервингу инференса. Собственная команда из карточки модели — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, а transformers 4.57 или новее нужен для пути без vLLM. 17,5 ГБ весов в bf16 должны уместиться рядом с KV-кэшем на 24 576 токенов и до двух изображений, поэтому одной карты на 24 ГБ технически достаточно, хотя и некомфортно тесно, а реалистичный минимум — 40–48 ГБ или две карты по 24 ГБ. Заложите в бюджет и рендерер, ведь все утверждения о качестве этой модели были сделаны путём рендеринга её HTML-вывода в браузере с песочницей — если вы хотите узнать, хороши ли ваши собственные результаты, именно этот стенд вам и придётся поднять. И учтите: контекст на 24 576 токенов проверялся на одиночных страницах с инфографикой, а не на многослайдовых презентациях, на которые эта модель рассчитана, так что нагрузка на контекст в реальной презентации — территория непроверенная.
Доступность — это вторая половина того же вопроса. AesCode-8B — не то, что маршрутизирует OrcaRouter, и мы также не нашли его в качестве доступного сервиса где-либо ещё; оценка сегодня означает веса на вашем собственном оборудовании. С его предком история иная — Qwen3-VL-8B-Instruct уже сейчас доступен для вызова через OrcaRouter по цене $0.18 за миллион входных токенов и $0.70 за миллион выходных при контексте в 131 072 токена, что делает его самым дешёвым способом увидеть, как необученная версия этой самой архитектуры справляется с вашими собственными промптами для инфографики. Дальше по той же линейке Qwen3.8-27B маршрутизируется по цене $0.33 и $2.40. Прейскурантная цена провайдера передаётся без наценки, а переключение при сбое между провайдерами происходит автоматически, так что прототипирование промпта на размещённом бэкбоне стоит один ключ, а не неделю на GPU, и только те промпты, которые действительно хорошо отрисовываются, заслуживают работы по воспроизведению.

То, какой из них вам нужен, зависит от артефакта.
Выбирайте AesCode-8B, когда результат — это страница, и она должна быть редактируемой. Структурированный HTML-вывод, который диффится в Git, таблицы как настоящие таблицы и диаграммы как спецификации ECharts, — это действительно иной артефакт, нежели абзац текста, и никакой объём общих возможностей его не заменит. Сознательно идите на этот компромисс: необъявленный исследовательский чекпойнт с двузначным числом загрузок, контекст 24K, только английский, без независимой оценки, потолок Style, который публикует сам его вендор, и счёт за обслуживание, измеряемый десятками гигабайт.
Выберите Qwen3-8B для всего остального — а для большинства команд это и есть всё. Это проверенный универсал в этом весовом классе: у него более длинный контекст, он говорит на ста девятнадцати языках, работает на оборудовании, которое у вас уже есть, и за решениями, которые вы собираетесь принять, стоит восемнадцать месяцев чужого производственного опыта. Если у вас нет конкретной необходимости генерировать отрендеренные страницы, у этого сравнения один ответ.
Довод в пользу того, чтобы иметь и то и другое, реален, и это не просто разрешение ничьей. Конвейер, который читает документы и создаёт презентации, использует две модели с двумя действительно разными типами вывода, и полезная позиция — оставить рендерер страниц на оборудовании, способном его вместить, а работу по чтению и рассуждению направить в нечто, размещённое за тем же эндпоинтом, что и всё остальное.
Что сделало бы эту страницу более продающей?
Три вещи, и только одна из них касается бенчмарков. Независимое воспроизведение снижения на 82.94 и 1.00 пункта относительно эталона перевело бы AesCode-8B из разряда заявлений вендора в результат и позволило бы ответить на вопрос о размере 8B против 8B по существу. Провайдер, подхвативший этот чекпоинт, схлопнул бы колонку развёртывания и превратил «GPU-неделю» в «вызов API». А статья, которую карточка цитирует как находящуюся на рассмотрении, — «AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards» — ответила бы на вопрос, на который карточка модели ответить не может: что делает визуальная рубрика, когда граф дизайна, по которому она выставляет оценку, сам по себе неверен.
Пока что-то из этого не выйдет, наиболее обоснованное прочтение — узкое. AesCode-8B — более интересная из этих двух моделей и менее пригодная для использования. Она очень хороша в тех аспектах визуального дизайна, которые может проверить машина, посредственна в том, что нельзя автоматизировать, и принадлежит к тому же семейству поколения Qwen3, что и модель, с которой её сравнивают, но не является её потомком. Qwen3-8B — это та, которую можно поставить в пайплайн уже сегодня днём.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
