
AesCode-8B vs Gemma 4 12B: две небольшие модели компьютерного зрения, два совершенно разных результата
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов · 87 tok/s
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
AesCode-8B и Gemma 4 12B оба принимают изображение и предложение, и оба — это чекпоинты Apache-2.0, которые вы скачиваете, а не арендуете, поэтому поисковые системы с удовольствием ставят их рядом. Сходство реально, но поверхностно. Gemma 4 12B возвращает ответ — описание, транскрипцию, фрагмент кода, трассировку рассуждений. AesCode-8B возвращает отрендеренную страницу: слайд, постер или дашборд в виде полного документа HTML и CSS, который можно открыть в браузере и отредактировать вручную. Одинаковая форма входа, примерно один и тот же класс размера весов, а результат почти ничего общего не имеет с другим. Это единственное различие определяет почти каждый практический вопрос ниже, включая то, какой из них вы сможете показать пользователю уже завтра.
Стоит сразу оговорить, потому что это определяет, какой вес могут иметь эти числа: Gemma 4 12B была выпущена DeepMind 3 июня 2026 года вместе с карточкой модели, документацией и экосистемой, и с тех пор она независимо тестировалась. AesCode-8B так и не выпустили. Репозиторий Microsoft для этой модели был создан 29 сентября 2026 года, а веса появились в коммите под названием «Release AesCode-8B» в 03:35 UTC 7 октября 2026 года; код для обучения и оценки появился на GitHub на следующий день. Нет ни поста Microsoft Research, ни страницы продукта, ни заметки о выпуске, ни препринта — в карточке модели в разделе цитирования указано «Under review» с годом-заполнителем 2027. На момент написания этого текста репозиторий модели 8B показывает две загрузки и один лайк. Таким образом, все количественные данные об AesCode-8B исходят от самой Microsoft, и никто другой их не воспроизводил.
Две модели, на своих собственных условиях
Gemma 4 12B — это открытая модель среднего размера, плотный чекпоинт на 11,95 млрд параметров, определяющая особенность которого — отсутствие отдельного кодировщика для зрения или аудио: фрагменты изображений и звуковые волны поступают напрямую в трансформер. Она поддерживает контекст в 256 тыс. токенов и требует около 16 ГБ видеопамяти, при этом веса BF16 занимают около 27 ГБ, а квантованные сборки — менее 7 ГБ. Собственная карточка вендора — данные, заявленные вендором, и здесь это помечено как таковое — перечисляет DocVQA 94,9, InfoVQA 88,4, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 и LiveCodeBench v6 72,0 в режиме размышления. Независимая оценка — это то, что важнее: Artificial Analysis присваивает конфигурации рассуждений значение Intelligence Index 14, измеряет примерно 114 токенов в секунду и оценивает стоимость типичного обслуживаемого вызова примерно в $0,10 за миллион входных токенов и $0,30 за миллион выходных. За ней стоят три с половиной месяца развёртывания.
AesCode-8B — это дообученная версия Qwen3-VL-8B-Instruct, опубликованная с четырьмя шардами safetensors общим объёмом 17 543 339 408 байт — около 8,8 млрд параметров bf16, поэтому округлённое поле размера на Hugging Face показывает 9B, тогда как издатель говорит 8B. Опубликованная конфигурация — это чистый рецепт Qwen3-VL: 36 скрытых слоёв, размер скрытого слоя 4 096, 32 головы внимания с 8 головками ключей и значений, словарь на 151 936 токенов, требование к transformers 4.0 или новее. В запусках, о которых сообщила Microsoft, использовался контекст на 24 576 токенов с выводом до 12 000 токенов, температура 0,8, top-p 0,95 и три генерации на промпт без отбора. Лицензия — Apache 2.0, без ограничений доступа, без дополнения о допустимом использовании. Чего нет в комплекте — это данные для обучения и оценки, а также какой-либо размещённый эндпоинт — мы не смогли найти AesCode-8B доступным где-либо, и его нет в нашем собственном каталоге.
Что модели на самом деле были обучены делать
Дизайн-бриф процитирован в карточке модели, и его стоит прочитать как весь тезис: модели кода «не видят, как макет, иерархия и цвет объединяются на холсте», тогда как генераторы изображений «создают визуально убедительные страницы, но часто неверно передают текст, числа и логические связи». AesCode — это попытка сохранить одновременно чувство композиции и проверяемость.
Механизм необычен в одном конкретном отношении. Каждый обучающий промпт сопровождается эталонным изображением, сгенерированным из того же самого промпта; это изображение задаёт компоновку и стиль, тогда как текстовый промпт остаётся главным источником истины о содержании. Затем, на этапе инференса, модель почти не нуждается в картинке: если не предоставить эталон AesCode-8B, его оценка Visual падает на 1,00 пункта из ста. Если не предоставить его Qwen3-VL-8B-Instruct, падение составит 19,55. Если не предоставить его GPT-5.5, оценённой на том же стенде, падение составит 10,04. Визуальный приор оказался в весах, а не во входных данных, и это подлинный исследовательский результат, скрывающийся за заголовком.
Цель обучения Gemma 4 12B — обычная мультимодальная, и говорить об этом не значит критиковать: прочитать изображение, ответить на вопрос, выполнить инструкцию, вызвать инструмент. Ничто в её карточке не говорит о том, что её когда-либо нацеливали на создание отрендеренного артефакта, и ни одна опубликованная оценка Gemma 4 12B не измеряет качество макета документа, выход за пределы холста или согласованность дизайна, потому что это не метрики модели.
Табло, и чья это рубрика

• Параметры — AesCode-8B: 8.8B bf16, dense. Gemma 4 12B: 11.95B dense.
• Входные данные — AesCode-8B: текст плюс необязательное эталонное изображение. Gemma 4 12B: текст, изображение, аудио и видео.
• Вывод — AesCode-8B: полный HTML- и CSS-документ. Gemma 4 12B: текст, включая вызовы инструментов.
• Контекст — AesCode-8B: 24 576 токенов в заявленной конфигурации. Gemma 4 12B: 256K токенов.
• Лицензия — обе Apache 2.0, без ограничений, веса включены.
• Доказательства — AesCode-8B: собственная рубрика Microsoft для оценки инфографики на 300 образцах, три генерации на промпт, без независимого воспроизведения. Gemma 4 12B: карточка производителя плюс независимый Intelligence Index, равный 14, и измеренная пропускная способность в Artificial Analysis.
Теперь о том, что табло не способно передать. Microsoft сообщает, что AesCode-8B показывает 82.94 Overall на том наборе из 300 примеров, опережая reference-conditioned GPT-5.5 с 81.28 и Claude Opus 4.8 с 80.39, и на 31.1 балла Visual опережает собственный бэкбон Qwen3-VL-8B. Читайте всё это как заявленное вендором и невоспроизведённое: по рубрике, которую построил вендор, на образцах, которые вендор выбрал, с оценкой харнессом, против которого вендор обучал модель. Карточка достаточно честна, чтобы опубликовать измерение, по которому ни одна модель в сравнении не преодолевает 60, — Style, где AesCode-8B находится на 53.21, а GPT-5.5 лидирует с 57.91, — и собственное определение Microsoft для этого измерения — это дизайн, не требующий дальнейшей визуальной доработки перед сдачей. По той единственной оси, которая отвечает на вопрос, выпустил бы человек страницу без правок, 8B-модель не является лидером. Именно эту цифру стоит держать в голове, когда кто-то приводит 82.94.
Там, где они действительно пересекаются
Есть ровно одна общая полка, и она уже, чем кажется. Если вы оцениваете небольшие открытые модели компьютерного зрения для конвейера с большим объёмом документов, обе являются кандидатами — одна для чтения документа, другая для создания документа. Команда, которая генерирует внутренние дашборды в виде HTML и которой также нужно извлекать числовые данные из загруженных PDF-файлов, в течение одной и той же недели имеет дело с обоими продуктами.
Разделение внутри этого пересечения — чистое. Gemma 4 12B — это модель, на которую вы направляете входящий документ. AesCode-8B — это модель, на которую вы направляете бриф, когда результат — это страница. Ни одна не заменяет другую, и пайплайн, которому нужны обе, — это двухмодельный пайплайн, а не выбор.

Развёртывание — вот где асимметрия действительно даёт о себе знать
История с обслуживанием Gemma 4 12B завершена. Вы скачиваете её, при желании квантуете, запускаете на 16 ГБ видеопамяти — и уже существует обширная база инструментов, которые это делают. Если вы предпочли бы вообще её не запускать, вызов через сервис дёшев и тарифицируется независимо.
История обслуживания AesCode-8B — это одна командная строка и немного арифметики. Карточка модели даёт маршрут напрямую — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, а также transformers версии 4.57 или новее для пути без vLLM. 17,5 ГБ весов bf16 должны разместиться рядом с KV-кэшем на 24 576 токенов и до двух изображений, так что одной карты на 24 ГБ технически достаточно, но это некомфортно впритык; 40–48 ГБ или две карты по 24 ГБ — реалистичный минимум. Заложите в бюджет ещё и рендерер, потому что все утверждения о качестве этой модели делаются путём рендеринга её HTML-вывода в браузере-песочнице, так что для оценки собственных результатов придётся поднять что-то вроде Playwright с заблокированными внешними запросами.
Далее — честная ситуация с доступностью. Мы не маршрутизируем AesCode-8B, и, насколько нам удалось выяснить, этого не делает больше никто; оценка сегодня означает веса на вашем собственном оборудовании. Ближайшее, что можно вызвать, — это архитектура, на основе которой модель была дообучена. Qwen3-VL-8B-Instruct доступна для маршрутизации через OrcaRouter теперь по цене $0.18 за миллион входных и $0.70 за миллион выходных токенов при контексте 131 072 токена, а два чекпоинта, которые мы действительно предоставляем, оцениваются так же — Gemma 4 26B-A4B по $0.06 и $0.33, Gemma 4 31B по $0.13 и $0.38. Цена провайдера по прайс-листу передаётся без наценки, а переключение при сбое между провайдерами происходит автоматически, так что дешёвый способ выяснить, хорошо ли вообще отрабатываются ваши промпты, — сначала протестировать бэкбон без дообучения и потратить GPU-неделю только на те промпты, которые выживут.

Какой именно тебе нужен
Выбирайте AesCode-8B, если конечный результат — это страница. Модель выдаёт структурированный редактируемый HTML — таблицы как HTML-таблицы, графики как спецификации ECharts, — а значит, результат даёт понятные diff'ы в Git и может быть переоформлен дизайнером без повторной генерации. Примите компромисс: неанонсированный исследовательский чекпойнт с двузначным числом скачиваний, без независимой оценки, без размещённого эндпоинта, с контекстом 24K, который проверяли только на одиночных страницах с инфографикой, и с языковым тегом только для английского в карточке модели.
Выбирайте Gemma 4 12B для всего остального. Она читает документы лучше, чем большинство моделей вдвое большего размера, она обрабатывает аудио, она следует инструкциям по инструментам, у неё четверть миллиона токенов контекста, и за ней три с половиной месяца опыта других людей. Если вы выбираете одну из этих двух в качестве вашей небольшой модели зрения, и вас специально не просили создавать слайды в виде кода, это ответ.
И если честное требование — и то и другое, не считайте это тай-брейком. Направьте работу по чтению на размещённую модель, а работу по рендерингу оставьте на любой машине, которая способна вместить веса.
Что изменило бы эту страницу
Три сигнала. Независимое воспроизведение эталонного снижения на 82,94 и 1,00 пункта перевело бы AesCode-8B из разряда заявлений вендора в результат и сделало бы вопрос о размере 8B против 12B по-настоящему интересным, а не просто номинальным. Если бы провайдер инференса подхватил этот чекпойнт, колонка развёртывания схлопнулась бы — а сейчас именно она составляет всю практическую разницу. А статья, которую Microsoft цитирует как находящуюся на рассмотрении, — «AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards», — ответила бы на вопросы, на которые не может ответить карточка модели, начиная с того, как ведёт себя визуальная рубрика, когда сам граф дизайна неверен. Пока не появится что-то из этого, обоснованное прочтение остаётся узким и реальным: AesCode-8B очень хорош в тех частях визуального дизайна, которые машина может проверить, посредственен в той, которую не может, а Gemma 4 12B — готовый продукт, выполняющий другую работу.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
