
MiniCPM 4.7 против UI-Venus 2.9B: универсальная модель против специализированного GUI-агента
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
MiniCPM-V 4.7 и UI-Venus 2.9B — обе представляют собой vision-language-модели, которые смотрят на скриншот и выдают текст, и на этом сходство заканчивается, потому что одна из них была создана именно для этой задачи. UI-Venus 2.9B — это GUI-агент общего назначения от inclusionAI, выпущенный 26 августа 2026 года, вся архитектура которого строится вокруг наблюдения за интерфейсом, осмысления состояния задачи, выдачи действия и учёта полученной обратной связи; к нему прилагаются технический отчёт, таблицы бенчмарков по GUI grounding, мобильным, веб-, computer-use- и CAPTCHA-задачам, а также явная оценка того, как часто его можно уговорить на опасное действие. MiniCPM-V 4.7 — это чекпойнт с разреженной смесью экспертов на 35,2 млрд параметров, загруженный OpenBMB 6 октября 2026 года без карточки модели, без лицензии и без бенчмарков. Сравнивать специалиста с неизмеренным универсалом — довольно необычное упражнение, и на этой странице прямо указано, где сравнение уместно, а где нет.
Два совершенно разных вида релиза
UI-Venus 2.9B — это inclusionAI/UI-Venus-2-9B, модель с 9 млрд параметров, инициализированная на основе Qwen3.5-9B и специально дообученная в качестве GUI-агента. В карточке описывается замкнутый цикл — наблюдать за интерфейсом, анализировать состояние задачи, выполнять действие, учитывать обратную связь при следующем решении — обучение в котором проходит в три этапа: мультимодальное промежуточное обучение на крупномасштабных симулированных траекториях мобильных, веб- и десктопных сред; офлайн-обучение с подкреплением, разделённое на пять семейств задач; и дистилляция on-policy с несколькими учителями, которая объединяет специализированных по доменам учителей в единую политику. Её оценивают на бенчмарках для GUI grounding, мобильных устройств, веба, computer-use и CAPTCHA, а также отдельно на безопасности действий с последствиями: в карточке сообщается о доле успешных атак 11,3% на OSHarm и 48,8% на OSBlind против 25,3% и 79,4% у её базовой модели Qwen3.5-9B. Кстати, родственный проект самой OpenBMB тоже исследовал похожую область: у организации MiniCPM с января 2026 года есть проект AgentCPM-GUI, так что это направление, в которое вошли обе лаборатории.
MiniCPM-V 4.7 — это openbmb/MiniCPM-V-4.7-35B-A3B, 35 212 875 824 параметров BF16 в 70,4 ГБ и шестнадцати шардах, загружен 6 октября 2026 года.

Текстовый бэкбон Sparse MoE с тегом qwen3_5_moe_text — 256 экспертов, 8 на токен — более 40 слоёв с паттерном внимания «три линейных на один полный», 27-слойная собственная визуальная башня с 16-кратным даунсэмплингом и до девяти срезами изображения, а также окно контекста на 256K. Нет README, а значит, нет лицензии и нет бенчмарков. Три лайка, ноль загрузок, пустые обсуждения.
Сравнение, в котором пробелы оставлены открытыми
• Назначение — UI-Venus 2.9B: GUI-агент, обученный end-to-end для взаимодействия с интерфейсом. MiniCPM-V 4.7: универсальная визуально-языковая модель; для чего она оптимизирована, не указано.
• Параметры — UI-Venus 2.9B: 9,41B, плотная. MiniCPM-V 4.7: всего 35,2B, разреженная, 8 из 256 экспертов на токен.
• Базовая модель — UI-Venus 2.9B: инициализирована на основе Qwen3.5-9B, плотного текстового стека Qwen. MiniCPM-V 4.7: производный от Qwen3.5 текстовый стек MoE, класс qwen3_5_moe_text. Разные ветви одного и того же семейного дерева.
• Привязка к интерфейсу — UI-Venus 2.9B: ключевая компетенция, с выделенными семействами задач привязки и CAPTCHA в обучении и системой проверки на основе ключевых точек, использующей голосование нескольких моделей. MiniCPM-V 4.7: нет утверждений, специфичных для привязки, и не документирован формат вывода координат.
• Оценка безопасности — UI-Venus 2.9B: сообщает о ASR 11,3% на OSHarm и 48,8% на OSBlind. MiniCPM-V 4.7: нет.
• Доказательства — UI-Venus 2.9B: технический отчёт на arXiv, страница проекта, репозиторий GitHub и таблицы бенчмарков. MiniCPM-V 4.7: конфигурационный файл.
• Инструментарий — UI-Venus 2.9B: быстрый старт с vLLM с флагом reasoning-parser, а также GGUF-конвертации от сообщества. MiniCPM-V 4.7: пока ничего.

Почему GUI-агент — это не просто «VLM, который смотрит на экраны»
Разрыв между этими двумя моделями не сводится главным образом к количеству параметров, и это стоит разъяснить, потому что именно это делает их противостояние интересным, а не просто неравным.
Задача со скриншотом обладает свойством, которого нет у большинства бенчмарков компьютерного зрения: выходные данные должны быть исполняемыми. Когда UI-Venus 2.9B просят нажать кнопку, он должен выдать координату или структурированное действие, которое среда действительно может применить, и небольшая ошибка в привязке — это не неправильный ответ в таблице лидеров, а проваленная задача и испорченное состояние. Именно поэтому карточка UI-Venus 2 тратит так много места на верификацию: выполнение задачи оценивается по релевантным задаче визуальным ключевым точкам, а не по общему взгляду на финальный экран, а гетерогенные судьи голосуют, чтобы уменьшить предвзятость отдельного судьи. Смысл этого механизма — сделать сигнал вознаграждения в обучении с подкреплением устойчивым к reward hacking — модели, которая учится удовлетворять ленивого верификатора, а не выполнять задачу.
Он также объясняет раздел о безопасности.

Агент, способный управлять телефоном или настольным компьютером, имеет поверхность атаки, которой нет у модели подписей к изображениям, и сообщение о доле успешных атак — это минимум, который лаборатория должна сделать при выпуске такого агента. UI-Venus 2.9B сообщает 11,3% на OSHarm и 48,8% на OSBlind — второй показатель высок в абсолютном выражении, а формулировка в карточке представляет собой сравнение с её базовой моделью, а не абсолютное заявление об устойчивости. Воспринимайте это как «существенно лучше, чем отправная точка», а не как «безопасно».
Архитектура MiniCPM-V 4.7 ничего не говорит обо всём этом. Линейное внимание на длинном контексте помогло бы агенту, которому приходится помнить длительную историю взаимодействия, а разреженная MoE помогла бы пропускной способности, если вы запускаете множество эпизодов. Но архитектура, полезная для агента, — это не агент, и ни одна часть выпущенного артефакта не документирует вывод действий, точность привязки к реальности или поведение в плане безопасности.
Честная оценка стороны MiniCPM
Так и тянет заполнить этот раздел показателями 4.6. Сопротивляйтесь этому. MiniCPM-V 4.6 — это плотная модель с 1,3 млрд параметров на базе Qwen3.5-0.8B с переключаемой схемой визуального сжатия 4x/16x, и её заявленные результаты — оценка 13 в Artificial Analysis Intelligence Index, заявленная производителем, при затратах токенов, составляющих лишь малую долю от затрат сопоставимых малых моделей, — описывают именно ту модель. MiniCPM-V 4.7 меняет базовую модель, меняет паттерн внимания и меняет визуальное сжатие по умолчанию. Ни один из показателей 4.6 не переносится, и ни один из них вообще не описывает GUI-агента.
О том, что можно честно сказать про MiniCPM-V 4.7, — это узко и фактично: веса существуют, конфигурация необычна для этого семейства, контекстное окно длинное, а релиз неполон. Отсутствие лицензии — практическое препятствие; отсутствие бенчмарков — оценочное. И есть одна скромная причина для интереса, а не безразличия — OpenBMB создаёт GUI-инструменты, среди них AgentCPM-GUI, так что длинноконтекстная разреженная MoE-модель зрения из этой лаборатории не выглядит неправдоподобной в роли будущей основы для агентов. Это гипотеза о намерении, и репозиторий её не подтверждает.
Что бы вы выбрали и когда
Для всего, что связано со скриншотом и действием — нажатием, вводом текста, прокруткой, навигацией по приложению или веб-сайту, извлечением данных из интерфейса — UI-Venus 2.9B — единственная из двух, которая решает эту задачу. У неё есть обучение, механизмы проверки, заявленные показатели безопасности и достаточно инструментов, чтобы развернуть её на vLLM уже сегодня. Ничто в MiniCPM-V 4.7 не позволяет предположить, что он конкурирует там, а без карточки вы даже не можете проверить, выдаёт ли он координаты.
Для общей мультимодальной работы — описания изображений, чтения документов, анализа длинного контекста по материалам с большим количеством изображений — сравнение пока не может быть решено однозначно, потому что у одной из сторон нет опубликованных данных о качестве. Если это нужно уже сегодня, UI-Venus 2.9B, по крайней мере, поддаётся измерению, хотя её настраивали для интерфейсов, а не для рассуждений по документам, и она тоже не является очевидным первым выбором для этой задачи.
В обоих случаях схема одна и та же: самостоятельно развёрнутая модель, которая выполняет рутинную работу, и хостируемая фронтирная модель для сложных случаев, которые первая ей передаёт. Именно на такой передаче роутер и оправдывает своё существование — один ключ для более чем 200 хостируемых моделей, каждая из которых проходит по прейскурантной цене провайдера без нашей наценки, с автоматическим переключением при деградации провайдера. Ни UI-Venus 2.9B, ни MiniCPM-V 4.7 не хостятся на OrcaRouter; обе — это веса, которые вы запускаете сами. Роутер — это то, с чем общается ваш агент, когда решает, что локальной модели недостаточно.
Что это значит для вас
Это не вопрос тонкого предпочтения, и причина структурная, а не оценка качества. UI-Venus 2.9B — это специализированное решение с отчётом, лицензией, таблицами бенчмарков, оценкой безопасности и рецептом развёртывания. MiniCPM-V 4.7 — это универсальное решение с конфигурационным файлом. Одно из них — продукт, а другое — обещание, и единственный ответственный способ их сравнивать — сказать об этом прямо. Следите за репозиторием: если OpenBMB опубликует карточку, где показаны привязка к интерфейсу и вывод действий, тогда 256K-контекстная разреженная MoE против дистиллированного 9B-агента станет по-настоящему интересным вопросом. До тех пор ответ на вопрос «что мне использовать» — это то, что существует.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
