Сгенерированная титульная карточка hero для «MiniCPM-V 4.7 vs UI-Venus 2.9B» с подзаголовком «Универсальная модель зрения против специализированного GUI-агента», левая карточка с текстом «UI-Venus 2.9B: граундинг, CAPTCHA, мобильные, веб, использование компьютера», правая карточка с текстом «MiniCPM-V 4.7: 35,2B разреженная, без карточки, без бенчмарков» и плашка с надписью «Специалист против непроверенного универсала», с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

MiniCPM 4.7 против UI-Venus 2.9B: универсальная модель против специализированного GUI-агента

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

MiniCPM-V 4.7 и UI-Venus 2.9B — обе представляют собой vision-language-модели, которые смотрят на скриншот и выдают текст, и на этом сходство заканчивается, потому что одна из них была создана именно для этой задачи. UI-Venus 2.9B — это GUI-агент общего назначения от inclusionAI, выпущенный 26 августа 2026 года, вся архитектура которого строится вокруг наблюдения за интерфейсом, осмысления состояния задачи, выдачи действия и учёта полученной обратной связи; к нему прилагаются технический отчёт, таблицы бенчмарков по GUI grounding, мобильным, веб-, computer-use- и CAPTCHA-задачам, а также явная оценка того, как часто его можно уговорить на опасное действие. MiniCPM-V 4.7 — это чекпойнт с разреженной смесью экспертов на 35,2 млрд параметров, загруженный OpenBMB 6 октября 2026 года без карточки модели, без лицензии и без бенчмарков. Сравнивать специалиста с неизмеренным универсалом — довольно необычное упражнение, и на этой странице прямо указано, где сравнение уместно, а где нет.

Два совершенно разных вида релиза

UI-Venus 2.9B — это inclusionAI/UI-Venus-2-9B, модель с 9 млрд параметров, инициализированная на основе Qwen3.5-9B и специально дообученная в качестве GUI-агента. В карточке описывается замкнутый цикл — наблюдать за интерфейсом, анализировать состояние задачи, выполнять действие, учитывать обратную связь при следующем решении — обучение в котором проходит в три этапа: мультимодальное промежуточное обучение на крупномасштабных симулированных траекториях мобильных, веб- и десктопных сред; офлайн-обучение с подкреплением, разделённое на пять семейств задач; и дистилляция on-policy с несколькими учителями, которая объединяет специализированных по доменам учителей в единую политику. Её оценивают на бенчмарках для GUI grounding, мобильных устройств, веба, computer-use и CAPTCHA, а также отдельно на безопасности действий с последствиями: в карточке сообщается о доле успешных атак 11,3% на OSHarm и 48,8% на OSBlind против 25,3% и 79,4% у её базовой модели Qwen3.5-9B. Кстати, родственный проект самой OpenBMB тоже исследовал похожую область: у организации MiniCPM с января 2026 года есть проект AgentCPM-GUI, так что это направление, в которое вошли обе лаборатории.

MiniCPM-V 4.7 — это openbmb/MiniCPM-V-4.7-35B-A3B, 35 212 875 824 параметров BF16 в 70,4 ГБ и шестнадцати шардах, загружен 6 октября 2026 года.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs UI-Venus 2.9B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Purpose general vision, Grounding not documented, Safety ASR not evaluated, Context 256K, Evidence config file only. Right column 'UI-Venus 2.9B' lists Parameters 9.4B dense, Purpose GUI agent, Grounding core training task, Safety ASR 11.3% OSHarm, Context 256K served, Evidence technical report. The footer reads 'UI-Venus figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Текстовый бэкбон Sparse MoE с тегом qwen3_5_moe_text — 256 экспертов, 8 на токен — более 40 слоёв с паттерном внимания «три линейных на один полный», 27-слойная собственная визуальная башня с 16-кратным даунсэмплингом и до девяти срезами изображения, а также окно контекста на 256K. Нет README, а значит, нет лицензии и нет бенчмарков. Три лайка, ноль загрузок, пустые обсуждения.

Сравнение, в котором пробелы оставлены открытыми

• Назначение — UI-Venus 2.9B: GUI-агент, обученный end-to-end для взаимодействия с интерфейсом. MiniCPM-V 4.7: универсальная визуально-языковая модель; для чего она оптимизирована, не указано.

• Параметры — UI-Venus 2.9B: 9,41B, плотная. MiniCPM-V 4.7: всего 35,2B, разреженная, 8 из 256 экспертов на токен.

• Базовая модель — UI-Venus 2.9B: инициализирована на основе Qwen3.5-9B, плотного текстового стека Qwen. MiniCPM-V 4.7: производный от Qwen3.5 текстовый стек MoE, класс qwen3_5_moe_text. Разные ветви одного и того же семейного дерева.

• Привязка к интерфейсу — UI-Venus 2.9B: ключевая компетенция, с выделенными семействами задач привязки и CAPTCHA в обучении и системой проверки на основе ключевых точек, использующей голосование нескольких моделей. MiniCPM-V 4.7: нет утверждений, специфичных для привязки, и не документирован формат вывода координат.

• Оценка безопасности — UI-Venus 2.9B: сообщает о ASR 11,3% на OSHarm и 48,8% на OSBlind. MiniCPM-V 4.7: нет.

• Доказательства — UI-Venus 2.9B: технический отчёт на arXiv, страница проекта, репозиторий GitHub и таблицы бенчмарков. MiniCPM-V 4.7: конфигурационный файл.

• Инструментарий — UI-Venus 2.9B: быстрый старт с vLLM с флагом reasoning-parser, а также GGUF-конвертации от сообщества. MiniCPM-V 4.7: пока ничего.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Почему GUI-агент — это не просто «VLM, который смотрит на экраны»

Разрыв между этими двумя моделями не сводится главным образом к количеству параметров, и это стоит разъяснить, потому что именно это делает их противостояние интересным, а не просто неравным.

Задача со скриншотом обладает свойством, которого нет у большинства бенчмарков компьютерного зрения: выходные данные должны быть исполняемыми. Когда UI-Venus 2.9B просят нажать кнопку, он должен выдать координату или структурированное действие, которое среда действительно может применить, и небольшая ошибка в привязке — это не неправильный ответ в таблице лидеров, а проваленная задача и испорченное состояние. Именно поэтому карточка UI-Venus 2 тратит так много места на верификацию: выполнение задачи оценивается по релевантным задаче визуальным ключевым точкам, а не по общему взгляду на финальный экран, а гетерогенные судьи голосуют, чтобы уменьшить предвзятость отдельного судьи. Смысл этого механизма — сделать сигнал вознаграждения в обучении с подкреплением устойчивым к reward hacking — модели, которая учится удовлетворять ленивого верификатора, а не выполнять задачу.

Он также объясняет раздел о безопасности.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured 7 October 2026) showing the model header, the qwen3_5, multimodal, gui and agent tags, and the opening of the UI-Venus-2 card describing a general-purpose foundation GUI agent that operates across mobile applications, web platforms and desktop operating systems.

Агент, способный управлять телефоном или настольным компьютером, имеет поверхность атаки, которой нет у модели подписей к изображениям, и сообщение о доле успешных атак — это минимум, который лаборатория должна сделать при выпуске такого агента. UI-Venus 2.9B сообщает 11,3% на OSHarm и 48,8% на OSBlind — второй показатель высок в абсолютном выражении, а формулировка в карточке представляет собой сравнение с её базовой моделью, а не абсолютное заявление об устойчивости. Воспринимайте это как «существенно лучше, чем отправная точка», а не как «безопасно».

Архитектура MiniCPM-V 4.7 ничего не говорит обо всём этом. Линейное внимание на длинном контексте помогло бы агенту, которому приходится помнить длительную историю взаимодействия, а разреженная MoE помогла бы пропускной способности, если вы запускаете множество эпизодов. Но архитектура, полезная для агента, — это не агент, и ни одна часть выпущенного артефакта не документирует вывод действий, точность привязки к реальности или поведение в плане безопасности.

Честная оценка стороны MiniCPM

Так и тянет заполнить этот раздел показателями 4.6. Сопротивляйтесь этому. MiniCPM-V 4.6 — это плотная модель с 1,3 млрд параметров на базе Qwen3.5-0.8B с переключаемой схемой визуального сжатия 4x/16x, и её заявленные результаты — оценка 13 в Artificial Analysis Intelligence Index, заявленная производителем, при затратах токенов, составляющих лишь малую долю от затрат сопоставимых малых моделей, — описывают именно ту модель. MiniCPM-V 4.7 меняет базовую модель, меняет паттерн внимания и меняет визуальное сжатие по умолчанию. Ни один из показателей 4.6 не переносится, и ни один из них вообще не описывает GUI-агента.

О том, что можно честно сказать про MiniCPM-V 4.7, — это узко и фактично: веса существуют, конфигурация необычна для этого семейства, контекстное окно длинное, а релиз неполон. Отсутствие лицензии — практическое препятствие; отсутствие бенчмарков — оценочное. И есть одна скромная причина для интереса, а не безразличия — OpenBMB создаёт GUI-инструменты, среди них AgentCPM-GUI, так что длинноконтекстная разреженная MoE-модель зрения из этой лаборатории не выглядит неправдоподобной в роли будущей основы для агентов. Это гипотеза о намерении, и репозиторий её не подтверждает.

Что бы вы выбрали и когда

Для всего, что связано со скриншотом и действием — нажатием, вводом текста, прокруткой, навигацией по приложению или веб-сайту, извлечением данных из интерфейса — UI-Venus 2.9B — единственная из двух, которая решает эту задачу. У неё есть обучение, механизмы проверки, заявленные показатели безопасности и достаточно инструментов, чтобы развернуть её на vLLM уже сегодня. Ничто в MiniCPM-V 4.7 не позволяет предположить, что он конкурирует там, а без карточки вы даже не можете проверить, выдаёт ли он координаты.

Для общей мультимодальной работы — описания изображений, чтения документов, анализа длинного контекста по материалам с большим количеством изображений — сравнение пока не может быть решено однозначно, потому что у одной из сторон нет опубликованных данных о качестве. Если это нужно уже сегодня, UI-Venus 2.9B, по крайней мере, поддаётся измерению, хотя её настраивали для интерфейсов, а не для рассуждений по документам, и она тоже не является очевидным первым выбором для этой задачи.

В обоих случаях схема одна и та же: самостоятельно развёрнутая модель, которая выполняет рутинную работу, и хостируемая фронтирная модель для сложных случаев, которые первая ей передаёт. Именно на такой передаче роутер и оправдывает своё существование — один ключ для более чем 200 хостируемых моделей, каждая из которых проходит по прейскурантной цене провайдера без нашей наценки, с автоматическим переключением при деградации провайдера. Ни UI-Venus 2.9B, ни MiniCPM-V 4.7 не хостятся на OrcaRouter; обе — это веса, которые вы запускаете сами. Роутер — это то, с чем общается ваш агент, когда решает, что локальной модели недостаточно.

Что это значит для вас

Это не вопрос тонкого предпочтения, и причина структурная, а не оценка качества. UI-Venus 2.9B — это специализированное решение с отчётом, лицензией, таблицами бенчмарков, оценкой безопасности и рецептом развёртывания. MiniCPM-V 4.7 — это универсальное решение с конфигурационным файлом. Одно из них — продукт, а другое — обещание, и единственный ответственный способ их сравнивать — сказать об этом прямо. Следите за репозиторием: если OpenBMB опубликует карточку, где показаны привязка к интерфейсу и вывод действий, тогда 256K-контекстная разреженная MoE против дистиллированного 9B-агента станет по-настоящему интересным вопросом. До тех пор ответ на вопрос «что мне использовать» — это то, что существует.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube