Сгенерированная титульная карточка с надписью «AREX-2 против Gemma 4 12B — один из них модель», с двумя панелями. Левая панель, озаглавленная Gemma 4 12B, содержит список: выпущена 3 июня 2026 г.; 11,95 млрд параметров, dense; контекст 256K, Apache 2.0; скачайте сегодня. Правая панель, озаглавленная AREX-2, содержит список: репозиторий создан 29 сентября 2026 г.; веса не загружены; нет карточки, нет тега лицензии; скачать нельзя. В нижнем колонтитуле написано: «Один столбец — модель. Другой — метка времени». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

AREX-2 против Gemma 4 12B: одна из них — модель

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Сравнение между Gemma 4 12B и AREX-2 обладает свойством, которого нет ни у одного другого сопоставления в этом блоге: один из двух столбцов пуст, потому что модели с этой стороны ещё не существует. Gemma 4 12B — это выпущенный артефакт: Google DeepMind опубликовала её 3 июня 2026 года как плотную модель с открытыми весами на 11,95 млрд параметров под лицензией Apache 2.0, с полной карточкой модели, контекстным окном на 256 тыс. токенов, встроенным вводом аудио и изображений и тремя с половиной месяцами независимого тестирования за плечами. AREX-2 — это репозиторий на Hugging Face, который BAAI создала 29 сентября 2026 года в 17:56 UTC и до сих пор ничего в него не поместила: ни весов, ни карточки, ни тега лицензии, ни оценки, ни анонса.

Эта асимметрия — не причина пропускать сравнение. Она и есть сравнение. Вопрос, на который стоит отвечать, не в том, какое из них лучше — на это невозможно ответить, пока в AREX-2 не появятся файлы — а в том, будет ли исследовательский агент BAAI второго поколения вообще конкурировать с 12B edge-моделью или же эти двое занимают позиции в стеке, которые никогда не соприкасаются. Ошибиться в этом — дорогостоящая ошибка, потому что именно эта ошибка заставляет команду закладывать бюджет не на то.

Отгруженная сторона, на своих собственных условиях

Gemma 4 12B — младший представитель открытого семейства Goog​le четвёртого поколения, и его определяющий проектный выбор носит архитектурный характер: он полностью отказывается от отдельного визуального энкодера и подаёт необработанные патчи изображений и звуковые волны напрямую в трансформер. Это не трюк для бенчмарков. Именно это делает модель по-настоящему портативной — примерно 27 ГБ весов BF16, которые при квантовании занимают менее 7 ГБ, и карта, для которой целевой объём развёртывания указан как 16 ГБ видеопамяти. На ноутбуке или одной карте среднего сегмента это модель, которую действительно можно держать в руках.

Профиль возможностей следует из этого. У самой Google — по данным вендора, и это стоит отмечать как таковое — указаны DocVQA 94,9 и InfoVQA 88,4 для понимания документов, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 и LiveCodeBench v6 72,0 в режиме размышления. Artificial Analysis, которая независима, оценивает конфигурацию интеллекта в 14 баллов по Intelligence Index, замеряет её на 114 токенов в секунду и оценивает типичный обслуживаемый вызов в $0,10 за миллион входных токенов и $0,30 за миллион выходных. В нашей собственной записи каталога для более крупной Gemma 4 31B указано 85,7 по GPQA Diamond. Из этого вырисовывается портрет небольшого универсала, который необычайно силён в работе с документами и изображениями, показывает разумные результаты и далеко не дотягивает до фронтирной модели в сложных многошаговых задачах.

Таким образом, его задача вполне конкретна: локальный или однотенантный инференс, понимание документов и скриншотов, скромные агентные циклы и всё то, где данные не могут покинуть здание. Это не движок для глубоких исследований, и Google не продаёт его как таковой.

A screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a speed rank of 19 of 142, $0.10 per million input tokens and $0.30 per million output, a 256K-token context window, text, image, speech and video input with text output, and the note that it is among the leading models in intelligence but somewhat expensive for its size. The page header reads 'Released June 2026' and 'Open weights model'.

Другая сторона, которая представляет собой имя и временную метку.

Всё, что можно подтвердить об AREX-2 на этой неделе, умещается в одном предложении. Это репозиторий в организации BAAI на Hugging Face, созданный 29 сентября 2026 года, содержащий файл .gitattributes и ничего больше — ноль байт сохранённых данных модели, ноль загрузок, ни карточки модели, ни декларации лицензии, ни развёртывания у провайдера. Сама BAAI ничего не объявила.

Что делает её достойной упоминания, так это семейство, в честь которого она названа. Линейка AREX от BAAI вышла 23 июля 2026 года с двумя моделями: AREX-Base — смесь экспертов с 122 миллиардами параметров и 10 миллиардами активных параметров на основе Qwen3.5-122B-A10B, и AREX-Turbo — плотная 4B-модель, построенная на Qwen3.5-4B. Обе распространяются под лицензией Apache 2.0. Обе являются агентами для глубоких исследований, а не чат-моделями — внутренний цикл, который собирает доказательства и выдаёт возможный ответ с оценкой уверенности, и внешний цикл, который проверяет этот ответ на соответствие исходным ограничениям и может уточнить или перезапустить всю траекторию. Согласно опубликованным BAAI данным, AREX-Base достигает 82,5 в BrowseComp, 85,4 в GAIA и 89,9 в DeepSearch QA; AREX-Turbo достигает 70,7, 81,6 и 78,5 на тех же трёх.

Все эти показатели получены самим вендором, и ни один из них не был независимо воспроизведён. К тому же они относятся к другой модели. У AREX-2 показателей нет, а «2» ничего не говорит вам о размере, бэкбоне или архитектуре — второе поколение в этой линейке может быть более крупным агентом, меньшей дистилляцией или переобученным фреймворком с заменённым бэкбоном.

Эти двое вообще встречаются?

Вот здесь сравнение оказывается полезнее, чем кажется. Рассмотрим два правдоподобных прочтения того, чем становится AREX-2.

Если это исследовательский агент второго поколения хотя бы отдалённо масштаба Base, то он и Gemma 4 12B вообще не конкурируют. Смесь экспертов на 122B, управляющая поиском по множеству источников, — это размещённый в облаке сервис с оплатой за токены и зависимостью от сети; Gemma 4 12B — это чекпоинт, который вы скачиваете и запускаете сами. Выбор между ними — это не сравнение качества, а решение о том, является ли ваша рабочая нагрузка исследовательским циклом или конечной точкой инференса.

Если AREX-2 окажется младшим уровнем — преемником 4B Turbo, а не 122B Base, — тогда эти две модели действительно делят одну полку, и сравнение становится настоящим. Эта версия AREX-2 имела бы примерно треть от числа параметров Gemma 4 12B, была бы специализирована на поиске с помощью инструментов, а не на мультимодальной широте, и оценивалась бы по BrowseComp и GAIA, а не по DocVQA. Две небольшие модели: одна оптимизирована для удержания длинной исследовательской траектории, другая — для зрения и чтения на скромном оборудовании. Команде, которая строит конвейер документации, не следует обращать внимания на первую; команде, которая строит исследовательского агента, не следует обращать внимания на вторую.

• Что существует — Gemma 4 12B доступна для скачивания уже сегодня, с полной карточкой модели. AREX-2 — это репозиторий, в котором нет ни одного файла.

• Параметры — 11,95 млрд плотных параметров для Gemma 4 12B. Не указано и может быть выведено только из названия продукта — для AREX-2.

• Контекст — 256K токенов (262 144 позиции) для Gemma 4 12B. Неизвестно для AREX-2.

• Модальность — текст, изображение и аудио в Gemma 4 12B. Для AREX-2 неизвестно; первое поколение AREX работало с текстом и инструментами.

• Лицензия — Apache 2.0 для Gemma 4 12B, указано на карточке. Для AREX-2 не указано; AREX-Base и AREX-Turbo были под Apache 2.0.

•Для чего это — развёртываемый мультимодальный вывод на собственном оборудовании против, судя по свидетельствам семейства, долгосрочного поиска и агрегации доказательств через размещённую конечную точку.

A generated two-column card headed 'Two deployment shapes, and only one of them exists'. It contrasts where Gemma 4 12B runs (local or single-tenant; about 27 GB BF16, under 7 GB quantised, 16 GB VRAM target; no rate card or per-token meter) against where AREX-Base runs (a 122B mixture-of-experts, a cluster or a hosted endpoint billed per token), names tokens per search step times steps per trajectory as the cost driver for the AREX shape, and notes that AREX-2 is neither shape because there are no files in the repository. A footer reads 'Is this a quality comparison? Not until one side has a model in it.' The OrcaRouter logo is composited in the bottom-right corner.

Та часть, которую действительно можно сравнить: где выполняется каждый из них.

Поскольку сравнение возможностей недоступно, честно сравнивать именно развёртывание, и здесь разрыв отнюдь не мал.

Gemma 4 12B работает там, где вы её разместите. Нет тарифной сетки, нет счётчика по токенам и нет провайдера между вами и моделью — затраты — это оборудование и электроэнергия, а режим отказа — это ваше собственное планирование мощностей. Когда в июле вышла AREX-Base, напротив, это была 122B-модель mixture-of-experts: модель, которую вы обслуживаете на кластере или арендуете по токенам, а собственный 4B Turbo в семействе существует именно потому, что у этого выбора есть цена. Если второе поколение будет устроено так же, экономика AREX-2 будет функцией от количества токенов, потребляемых за запрос, умноженного на число шагов поиска, которые совершает траектория, — величины, которая гораздо больше для агента глубокого исследования, чем для модели, читающей документы, потому что агент на каждой итерации перечитывает растущий контекст.

Именно здесь слой маршрутизации перестаёт быть абстракцией и становится статьёй расходов. Если вы в итоге запускаете исследовательского агента на хостируемой модели, а для работы с документами оставляете локальную Gemma 4 12B, то в обычном случае это две интеграции. Через один API перед более чем 200 моделями — при этом прайс-листовая цена провайдера передаётся без изменений и никакая наценка не добавляется сверху, так что изменение цены вендором вступает в силу в тот же день — это один ключ, один счёт и один клиент, а правило аварийного переключения может перенаправить запрос с провайдера, переживающего не лучший час, так что ваш цикл агента об этом не узнает. Сегодня мы маршрутизируем Gemma 4 26B-A4B и Gemma 4 31B; мы не маршрутизируем 12B, и ничего из линейки AREX в нашем каталоге тоже нет, так что если вам нужна одна из этих моделей, она поставляется из собственного дистрибутива её вендора.

Что делать на этой неделе

Если вам нужна компактная мультимодальная модель, которую вы можете запустить сами, решение никогда не зависело от AREX-2. Gemma 4 12B выпущена, задокументирована, независимо оценена и готова к развёртыванию, а колонка для сравнения с другой стороны пуста. Не покупайте ничего на основании зарезервированного названия.

Если вы создаёте агента для глубоких исследований и на самом деле вам нужна линейка AREX, следить стоит не за названием, а за деревом: есть ли в этом репозитории safetensors, что в карточке сказано о количестве параметров и какой тег лицензии на ней указан. Первое поколение вышло под Apache 2.0, и если второе тоже, вопрос становится вопросом хостинга, а не лицензирования. До тех пор AREX-Base — это модель AREX, которую вы действительно можете запустить, и она доступна с июля.

Единственное, что стоит прямо сказать о сравнении, которому эта статья номинально посвящена: страница VS, где с одной стороны — коммит в репозитории, а с другой — выпущенная модель, — это не матч, а расписание. Расписание говорит, что Gemma 4 12B уже доступна, а AREX-2 вообще недоступна.