Сгенерированная титульная hero-карточка для «MiniCPM-V 4.7 против Microsoft Mage-VL» с подзаголовком «Два способа сократить затраты на просмотр видео», левая карточка с текстом «Mage-VL: кодек-нативная разрежённость токенов, на 75% меньше визуальных токенов», правая карточка с текстом «MiniCPM-V 4.7: линейное внимание, постоянный KV-кэш на протяжении 256K» и пилюля с надписью «Сжимайте входные данные или сжимайте состояние», с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

MiniCPM-V 4.7 против Microsoft Mage-VL: две совершенно разные ставки на то, сколько должна стоить обработка одного кадра моделью компьютерного зрения

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

MiniCPM-V 4.7 и Microsoft Mage-VL — обе являются визуально-языковыми моделями, которые утверждают, что экономят ваши токены, и они достигают этого противоположными путями. Mage-VL, выпущенная Microsoft 25 июля 2026 года, берётся за видеосторону: она заимствует структуру видеокодека, сохраняет каждый патч опорного кадра и только те патчи предсказанных кадров, которые несут реальное движение, и заявляет о сокращении количества визуальных токенов более чем на 75% при ускорении фактического времени до 3,5× по сравнению с равномерной выборкой кадров. MiniCPM-V 4.7, загруженная OpenBMB 6 октября 2026 года, берётся за сторону последовательностей: разреженная MoE с 35,2 млрд параметров, у которой 30 из 40 слоёв используют путь линейного внимания, что заставляет KV-кэш медленно расти на контексте в 256K. Одна модель сжимает то, на что смотрит. Другая сжимает то, что помнит. И только у одной из них есть хоть что-то, что можно оценить.

Что представляет собой каждый

Microsoft Mage-VL — это кодек-нативная мультимодальная фундаментальная модель масштаба 4B с проактивным потоковым режимом, выпущенная под лицензией Apache-2.0 вместе с техническим отчётом и обширным разделом оценки. Она была целенаправленно создана в противовес тому, что её авторы называют парадоксом Моравека для VLM: сильна в офлайн-рассуждениях, но медленна в восприятии в реальном времени. Визуальный энкодер Mage-ViT обучен полностью с нуля на примерно 100 миллионах неразмеченных изображений и видео, а не инициализирован из ViT, предобученного на веб-данных, и единственным предобученным компонентом в стеке является языковой бэкбон Qwen3-4B-Instruct-2507. Полный чекпоинт — это единая унифицированная модель, которая выполняет понимание изображений, офлайн-рассуждения по видео и потоковые комментарии с событийным гейтингом без отдельных вариантов, а сопутствующий microsoft/Mage-ViT релиз предоставляет энкодер отдельно. С момента выпуска он набрал около 10 600 загрузок и 420 лайков.

MiniCPM-V 4.7 — это openbmb/MiniCPM-V-4.7-35B-A3B, BF16-чекпоинт с 35 212 875 824 параметрами, состоящий из шестнадцати шардов общим объёмом 70,4 ГБ, записанный с помощью Transformers 5.2.0 и загруженный 6 октября 2026 года без карточки модели.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs Microsoft Mage-VL — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Token savings linear attention, Context 256K, Vision 16x downsample, Evidence no card no benchmarks. Right column 'Mage-VL' lists Parameters 4.74B dense, Licence Apache-2.0, Token savings 75% fewer visual tokens, Context up to 768 frame windows, Vision from-scratch Codec-ViT, Evidence full card with tables. The footer reads 'Mage-VL figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Его текстовая конфигурация помечена как qwen3_5_moe_text с 256 экспертами и 8 активными на токен; его layer_types — это массив, в котором на каждый слой полного внимания приходится три слоя линейного внимания, всего 40 слоёв; его визуальная башня — собственная minicpmv4_7_vision с 27 слоями, 16-кратным даунсэмплингом и до девяти срезов изображения. Контекст — 256K. У репозитория ноль загрузок, три лайка, нет бенчмарков и нет лицензии.

Шесть строк, которые читатель может проверить

Те же шесть измерений, с обеих сторон. Там, где число отсутствует, пробел остаётся видимым.

• Параметры — Mage-VL: 4.74B, плотная, все активны на токен. MiniCPM-V 4.7: 35.2B всего, разреженная, 8 из 256 экспертов на токен. Число MiniCPM несоизмеримо с числом плотной модели.

• Лицензия — Mage-VL: Apache-2.0, указано в карточке и тегах репозитория. MiniCPM-V 4.7: ничего не заявлено.

• Откуда берётся экономия токенов — Mage-VL: разреженность визуальных токенов на энкодере, согласованная с кодеком, заявлено сокращение более чем на 75%. MiniCPM-V 4.7: линейное внимание на декодере, которое уменьшает рост KV-кэша на длинных последовательностях, но не сокращает количество токенов, которые вы ему подаёте.

• Контекст — Mage-VL: обучена на этапе длинного контекста на 350 тыс. видео в виде скользящих окон кодека размером до 384 или 768 кадров. MiniCPM-V 4.7: max_position_embeddings: 262144.

• Происхождение vision-энкодера — Mage-VL: с нуля, обучен на ~100 млн неразмеченных кадров; в карточке указано 85,69% ImageNet при 256 токенах и монотонное улучшение при увеличении бюджета токенов. MiniCPM-V 4.7: башня из той же линейки, повторно использующая дизайн MiniCPM-V 4.6 с той же конфигурацией 1152 скрытых размерностей и 27 слоёв, с 16-кратным даунсэмплингом по умолчанию.

• Доказательства — Mage-VL: полная карточка с DocVQA 95.14, InfoVQA 80.33, OCRBench 81.80, ChartQAPro 32.57, MMStar 67.32, CV-Bench-3D 94.75 и преимуществом CrossPoint +53.1 над Qwen3-VL-4B, все заявлено производителем на сопоставимой базовой модели. MiniCPM-V 4.7: нет.

• Потоковое поведение — Mage-VL: когнитивный гейт, который оценивает каждое скользящее окно и молчит, пока событие не завершится, обучен на ~3,3 млн потоковых примеров. MiniCPM-V 4.7: нигде не описан.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Та часть про цифры Mage-VL, которую все понимают неправильно

Таблицы бенчмарков в карточке Mage-VL выглядят убедительно, и самые сильные из них легче всего понять неправильно. В строках сравнения Mage-VL-4B противопоставляется Qwen3-VL-4B, Phi-4-Multimodal-Instruct и Phi-4-Reasoning-Vision, а главные приросты — +22.5 на QVHighlight, +24.5 на VideoEval-Pro, +53.1 на CrossPoint — реальны в том смысле, что присутствуют в таблицах поставщика. Это также собственные измерения поставщика, выполненные командой, обучившей модель, на том же стенде. Ни одна независимая сторона их не воспроизвела. Для четырёхмесячной модели это нормально, и это не минус ей, но это означает, что правильный глагол — «сообщает», а не «набирает».

Помимо таблиц, заслуживают признания две вещи. Во-первых, дизайн с согласованным бэкбоном — фиксация декодера Qwen3-4B и замена только ViT — это более чистое доказательство, чем позиция в таблице лидеров, потому что он изолирует визуальный стек, а не всю систему. Во-вторых, обучающий корпус для Mage-ViT — это примерно 100 млн неразмеченных кадров против миллиардов пар «изображение — текст», которые используют веб-предобученные энкодеры, поэтому соответствие поведению класса SigLIP2-at-10B при различении кластеров — это конкретное, проверяемое утверждение об эффективности данных, а не общее хвастовство.

У MiniCPM-V 4.7 ничего из этого нет. Не более слабая версия — ничего.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured 7 October 2026) showing the model header, the mage_vl and video-understanding tags, the Apache-2.0 licence badge, the project page and GitHub links, and the opening of the Mage-VL card describing it as a codec-native, proactive-streaming multimodal foundation model at a 4B scale.

Нет никакой таблицы — ни вендорской, ни какой-либо другой, — а конфигурационный файл, описывающий архитектуру, явно исключает себя из каких-либо утверждений о точности.

Архитектура: два ответа на один и тот же вопрос

Обе модели пытаются ответить на вопрос «как сделать мультимодальный инференс дешёвым», и этот контраст поучителен, потому что два ответа дополняют, а не конкурируют друг с другом.

Mage-VL сокращает входные данные. Его 16×16 сетка патчей является общей для опорного и предсказанных кадров, а предсказанные кадры вносят патчи только там, где кодек расходует биты, — то есть там, где есть движение и новые детали. В результате получаются потоки токенов переменной длины на каждый кадр, поэтому всему стеку нужен проектор, способный передать последовательность переменной длины причинному декодеру, и поэтому один и тот же интерфейс может принимать векторы движения H.264/HEVC или выученную карту скорости нейронного кодека без переобучения. Затем трёхмерное ротационное кодирование сохраняет согласованность пространственно-временных позиций при такой разрежённости. Бюджет токенов — это управляемая величина.

MiniCPM-V 4.7 сокращает состояние. Его слои линейного внимания поддерживают рекуррентное состояние фиксированного размера вместо растущего кэша ключ-значение, поэтому затраты памяти на длинный диалог перестают линейно масштабироваться с числом токенов. Его бюджет последовательности — это управляемая величина, а контекст 256K — это выигрыш. Примечательно, что конфигурация MiniCPM-V 4.7 заявляет 16-кратный визуальный даунсэмплинг — она также сжимает вход — но умалчивает о том, сохраняет ли она переключаемый режим 4x, который предоставляла MiniCPM-V 4.6.

Проще говоря: приём Mage-VL оправдывает себя на видео, где большинство кадров почти идентичны соседним. Приём MiniCPM-V 4.7 оправдывает себя на длинных документах и длинных многоходовых сессиях, где накапливаются токены. Конвейер, который принимает прямой поток, а затем ведёт о нём долгий разговор, выиграл бы от обоих, и ни одна из моделей пока не выполняет работу другой.

Интеграция их в реальный рабочий процесс

Mage-VL вполне можно попробовать уже сегодня: единый чекпойнт, документированная архитектура, лицензия Apache-2.0 и карточка, которая рассказывает, что именно включает в себя репозиторий. Он доступен с июля, и инструментарий вокруг него успел устояться.

MiniCPM-V 4.7 сегодня непрактично пробовать по скучным причинам. 70 ГБ в BF16 без квантования означают память ускорителя, которая у вас, вероятно, не простаивает, а отсутствие лицензии означает, что вопрос о том, можно ли вообще её использовать, остаётся открытым. Пользовательские пути кода требуют trust_remote_code, и не проверено, есть ли в вашем стеке обслуживания ядра для комбинации MoE и линейного внимания.

Что верно для обоих, так это то, что самостоятельно размещённая vision-модель — лишь один компонент системы, которой также приходится обращаться к frontier-моделям. Именно поэтому hosted-половину стоит поместить за единый роутер, а не заводить второй контракт и второй SDK: OrcaRouter охватывает более 200 моделей по одному ключу, пропускает прайс-лист каждого провайдера без каких-либо наценок с нашей стороны и автоматически выполняет переключение при деградации провайдера. Ни Mage-VL, ни MiniCPM-V 4.7 не являются hosted-моделями в этом сервисе — и та и другая представляют собой веса, которые вы размещаете сами, — так что воспринимайте это как инфраструктурную обвязку по другую сторону передачи управления, а не как канал доступности для любой из этих моделей.

Вердикт

Mage-VL — законченная, лицензированная, прошедшая бенчмарки модель с конкретной и хорошо аргументированной философией дизайна, и её доводы опираются на потоковое видео и пространственное рассуждение, где её кодек-нативный энкодер делает нечто структурно иное, чем у всех остальных. MiniCPM-V 4.7 — более крупный, нелицензированный, неизмеренный чекпойнт, чья философия дизайна читаема, но чьё поведение — чистый лист. Во всём, на что читатель может опереться сегодня, Mage-VL выигрывает по умолчанию — не потому, что он лучше, а потому, что он единственный из двух, кого вообще можно оценить. Вернитесь к этому сравнению, когда появится README MiniCPM-V 4.7; если тот день принесёт бенчмарки и лицензию, интересный вопрос будет в том, победит ли MoE с линейным вниманием и контекстом 256K кодек-нативный энкодер разрежённости на длинном видео, и это по-настоящему открытая схватка.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube