
MiniCPM-V 4.7 против Microsoft Mage-VL: две совершенно разные ставки на то, сколько должна стоить обработка одного кадра моделью компьютерного зрения
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
MiniCPM-V 4.7 и Microsoft Mage-VL — обе являются визуально-языковыми моделями, которые утверждают, что экономят ваши токены, и они достигают этого противоположными путями. Mage-VL, выпущенная Microsoft 25 июля 2026 года, берётся за видеосторону: она заимствует структуру видеокодека, сохраняет каждый патч опорного кадра и только те патчи предсказанных кадров, которые несут реальное движение, и заявляет о сокращении количества визуальных токенов более чем на 75% при ускорении фактического времени до 3,5× по сравнению с равномерной выборкой кадров. MiniCPM-V 4.7, загруженная OpenBMB 6 октября 2026 года, берётся за сторону последовательностей: разреженная MoE с 35,2 млрд параметров, у которой 30 из 40 слоёв используют путь линейного внимания, что заставляет KV-кэш медленно расти на контексте в 256K. Одна модель сжимает то, на что смотрит. Другая сжимает то, что помнит. И только у одной из них есть хоть что-то, что можно оценить.
Что представляет собой каждый
Microsoft Mage-VL — это кодек-нативная мультимодальная фундаментальная модель масштаба 4B с проактивным потоковым режимом, выпущенная под лицензией Apache-2.0 вместе с техническим отчётом и обширным разделом оценки. Она была целенаправленно создана в противовес тому, что её авторы называют парадоксом Моравека для VLM: сильна в офлайн-рассуждениях, но медленна в восприятии в реальном времени. Визуальный энкодер Mage-ViT обучен полностью с нуля на примерно 100 миллионах неразмеченных изображений и видео, а не инициализирован из ViT, предобученного на веб-данных, и единственным предобученным компонентом в стеке является языковой бэкбон Qwen3-4B-Instruct-2507. Полный чекпоинт — это единая унифицированная модель, которая выполняет понимание изображений, офлайн-рассуждения по видео и потоковые комментарии с событийным гейтингом без отдельных вариантов, а сопутствующий microsoft/Mage-ViT релиз предоставляет энкодер отдельно. С момента выпуска он набрал около 10 600 загрузок и 420 лайков.
MiniCPM-V 4.7 — это openbmb/MiniCPM-V-4.7-35B-A3B, BF16-чекпоинт с 35 212 875 824 параметрами, состоящий из шестнадцати шардов общим объёмом 70,4 ГБ, записанный с помощью Transformers 5.2.0 и загруженный 6 октября 2026 года без карточки модели.

Его текстовая конфигурация помечена как qwen3_5_moe_text с 256 экспертами и 8 активными на токен; его layer_types — это массив, в котором на каждый слой полного внимания приходится три слоя линейного внимания, всего 40 слоёв; его визуальная башня — собственная minicpmv4_7_vision с 27 слоями, 16-кратным даунсэмплингом и до девяти срезов изображения. Контекст — 256K. У репозитория ноль загрузок, три лайка, нет бенчмарков и нет лицензии.
Шесть строк, которые читатель может проверить
Те же шесть измерений, с обеих сторон. Там, где число отсутствует, пробел остаётся видимым.
• Параметры — Mage-VL: 4.74B, плотная, все активны на токен. MiniCPM-V 4.7: 35.2B всего, разреженная, 8 из 256 экспертов на токен. Число MiniCPM несоизмеримо с числом плотной модели.
• Лицензия — Mage-VL: Apache-2.0, указано в карточке и тегах репозитория. MiniCPM-V 4.7: ничего не заявлено.
• Откуда берётся экономия токенов — Mage-VL: разреженность визуальных токенов на энкодере, согласованная с кодеком, заявлено сокращение более чем на 75%. MiniCPM-V 4.7: линейное внимание на декодере, которое уменьшает рост KV-кэша на длинных последовательностях, но не сокращает количество токенов, которые вы ему подаёте.
• Контекст — Mage-VL: обучена на этапе длинного контекста на 350 тыс. видео в виде скользящих окон кодека размером до 384 или 768 кадров. MiniCPM-V 4.7: max_position_embeddings: 262144.
• Происхождение vision-энкодера — Mage-VL: с нуля, обучен на ~100 млн неразмеченных кадров; в карточке указано 85,69% ImageNet при 256 токенах и монотонное улучшение при увеличении бюджета токенов. MiniCPM-V 4.7: башня из той же линейки, повторно использующая дизайн MiniCPM-V 4.6 с той же конфигурацией 1152 скрытых размерностей и 27 слоёв, с 16-кратным даунсэмплингом по умолчанию.
• Доказательства — Mage-VL: полная карточка с DocVQA 95.14, InfoVQA 80.33, OCRBench 81.80, ChartQAPro 32.57, MMStar 67.32, CV-Bench-3D 94.75 и преимуществом CrossPoint +53.1 над Qwen3-VL-4B, все заявлено производителем на сопоставимой базовой модели. MiniCPM-V 4.7: нет.
• Потоковое поведение — Mage-VL: когнитивный гейт, который оценивает каждое скользящее окно и молчит, пока событие не завершится, обучен на ~3,3 млн потоковых примеров. MiniCPM-V 4.7: нигде не описан.

Та часть про цифры Mage-VL, которую все понимают неправильно
Таблицы бенчмарков в карточке Mage-VL выглядят убедительно, и самые сильные из них легче всего понять неправильно. В строках сравнения Mage-VL-4B противопоставляется Qwen3-VL-4B, Phi-4-Multimodal-Instruct и Phi-4-Reasoning-Vision, а главные приросты — +22.5 на QVHighlight, +24.5 на VideoEval-Pro, +53.1 на CrossPoint — реальны в том смысле, что присутствуют в таблицах поставщика. Это также собственные измерения поставщика, выполненные командой, обучившей модель, на том же стенде. Ни одна независимая сторона их не воспроизвела. Для четырёхмесячной модели это нормально, и это не минус ей, но это означает, что правильный глагол — «сообщает», а не «набирает».
Помимо таблиц, заслуживают признания две вещи. Во-первых, дизайн с согласованным бэкбоном — фиксация декодера Qwen3-4B и замена только ViT — это более чистое доказательство, чем позиция в таблице лидеров, потому что он изолирует визуальный стек, а не всю систему. Во-вторых, обучающий корпус для Mage-ViT — это примерно 100 млн неразмеченных кадров против миллиардов пар «изображение — текст», которые используют веб-предобученные энкодеры, поэтому соответствие поведению класса SigLIP2-at-10B при различении кластеров — это конкретное, проверяемое утверждение об эффективности данных, а не общее хвастовство.
У MiniCPM-V 4.7 ничего из этого нет. Не более слабая версия — ничего.

Нет никакой таблицы — ни вендорской, ни какой-либо другой, — а конфигурационный файл, описывающий архитектуру, явно исключает себя из каких-либо утверждений о точности.
Архитектура: два ответа на один и тот же вопрос
Обе модели пытаются ответить на вопрос «как сделать мультимодальный инференс дешёвым», и этот контраст поучителен, потому что два ответа дополняют, а не конкурируют друг с другом.
Mage-VL сокращает входные данные. Его 16×16 сетка патчей является общей для опорного и предсказанных кадров, а предсказанные кадры вносят патчи только там, где кодек расходует биты, — то есть там, где есть движение и новые детали. В результате получаются потоки токенов переменной длины на каждый кадр, поэтому всему стеку нужен проектор, способный передать последовательность переменной длины причинному декодеру, и поэтому один и тот же интерфейс может принимать векторы движения H.264/HEVC или выученную карту скорости нейронного кодека без переобучения. Затем трёхмерное ротационное кодирование сохраняет согласованность пространственно-временных позиций при такой разрежённости. Бюджет токенов — это управляемая величина.
MiniCPM-V 4.7 сокращает состояние. Его слои линейного внимания поддерживают рекуррентное состояние фиксированного размера вместо растущего кэша ключ-значение, поэтому затраты памяти на длинный диалог перестают линейно масштабироваться с числом токенов. Его бюджет последовательности — это управляемая величина, а контекст 256K — это выигрыш. Примечательно, что конфигурация MiniCPM-V 4.7 заявляет 16-кратный визуальный даунсэмплинг — она также сжимает вход — но умалчивает о том, сохраняет ли она переключаемый режим 4x, который предоставляла MiniCPM-V 4.6.
Проще говоря: приём Mage-VL оправдывает себя на видео, где большинство кадров почти идентичны соседним. Приём MiniCPM-V 4.7 оправдывает себя на длинных документах и длинных многоходовых сессиях, где накапливаются токены. Конвейер, который принимает прямой поток, а затем ведёт о нём долгий разговор, выиграл бы от обоих, и ни одна из моделей пока не выполняет работу другой.
Интеграция их в реальный рабочий процесс
Mage-VL вполне можно попробовать уже сегодня: единый чекпойнт, документированная архитектура, лицензия Apache-2.0 и карточка, которая рассказывает, что именно включает в себя репозиторий. Он доступен с июля, и инструментарий вокруг него успел устояться.
MiniCPM-V 4.7 сегодня непрактично пробовать по скучным причинам. 70 ГБ в BF16 без квантования означают память ускорителя, которая у вас, вероятно, не простаивает, а отсутствие лицензии означает, что вопрос о том, можно ли вообще её использовать, остаётся открытым. Пользовательские пути кода требуют trust_remote_code, и не проверено, есть ли в вашем стеке обслуживания ядра для комбинации MoE и линейного внимания.
Что верно для обоих, так это то, что самостоятельно размещённая vision-модель — лишь один компонент системы, которой также приходится обращаться к frontier-моделям. Именно поэтому hosted-половину стоит поместить за единый роутер, а не заводить второй контракт и второй SDK: OrcaRouter охватывает более 200 моделей по одному ключу, пропускает прайс-лист каждого провайдера без каких-либо наценок с нашей стороны и автоматически выполняет переключение при деградации провайдера. Ни Mage-VL, ни MiniCPM-V 4.7 не являются hosted-моделями в этом сервисе — и та и другая представляют собой веса, которые вы размещаете сами, — так что воспринимайте это как инфраструктурную обвязку по другую сторону передачи управления, а не как канал доступности для любой из этих моделей.
Вердикт
Mage-VL — законченная, лицензированная, прошедшая бенчмарки модель с конкретной и хорошо аргументированной философией дизайна, и её доводы опираются на потоковое видео и пространственное рассуждение, где её кодек-нативный энкодер делает нечто структурно иное, чем у всех остальных. MiniCPM-V 4.7 — более крупный, нелицензированный, неизмеренный чекпойнт, чья философия дизайна читаема, но чьё поведение — чистый лист. Во всём, на что читатель может опереться сегодня, Mage-VL выигрывает по умолчанию — не потому, что он лучше, а потому, что он единственный из двух, кого вообще можно оценить. Вернитесь к этому сравнению, когда появится README MiniCPM-V 4.7; если тот день принесёт бенчмарки и лицензию, интересный вопрос будет в том, победит ли MoE с линейным вниманием и контекстом 256K кодек-нативный энкодер разрежённости на длинном видео, и это по-настоящему открытая схватка.
