
MiniCPM-V 4.7: OpenBMB опубликовала визуально-языковую модель 35B-A3B без карточки модели, без лицензии и без бенчмарков
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
MiniCPM-V 4.7 появился на Hugging Face вечером 6 октября 2026 года в виде репозитория openbmb/MiniCPM-V-4.7-35B-A3B — и это одна из самых странных вещей, которые когда-либо выпускала серия MiniCPM, потому что вместе с ним почти ничего не выпустили. Нет карточки модели. Нет README. Нет заявленной лицензии. Нет таблиц с результатами бенчмарков, нет поста о запуске, нет технического отчёта и нет упоминания в собственной документации OpenBMB на GitHub, которая по состоянию на эту неделю всё ещё называет MiniCPM-V 4.6 «самой новой и самой эффективной моделью в серии MiniCPM-V». А есть — 16 шардов весов в формате bfloat16, все 70,4 ГБ, описывающих визуально-языковую модель со смесью экспертов на 35,2 миллиарда параметров, с окном контекста 256K и необычайно агрессивной гибридной архитектурой внимания. Этого достаточно, чтобы сказать, чем модель является. Но этого пока недостаточно, чтобы сказать, в чём она хороша, и в этом тексте эти две вещи строго разделены.
Что на самом деле попало, байт в байт
Репозиторий был создан 6 октября 2026 года в 18:36 UTC, а его последний коммит был сделан двенадцать минут спустя, в 18:48 UTC. За это время загрузивший отправил файлы весов и конфигурацию, необходимую загрузчику Transformers, и на этом остановился. Полный список файлов насчитывает восемнадцать позиций:
• Веса — шестнадцать safetensors шардов с именами model-00001-of-00016 по model-00016-of-00016, с индексным файлом model.safetensors.index.json, указывающим общий размер тензоров 70,425,751,648 байт.
• Количество параметров — API Hugging Face считывает 35 212 875 824 параметра, все в BF16. Обратите внимание, что это общее количество, которое для разреженной MoE не является числом параметров, активных на любом данном токене.
• Конфигурация — config.json (2 984 байта), generation_config.json (186 байт), preprocessor_config.json, processor_config.json.
• Токенизатор — tokenizer.json (20 МБ), tokenizer_config.json, и chat_template.jinja (7 250 байт).
• — README.md. Прямое обращение к исходному файлу возвращает 404. На Hugging Face отсутствие README означает отсутствие карточки модели, что означает отсутствие поля лицензии, а значит, в репозитории нет license: тега вообще.
У репозитория три лайка, ноль загрузок и пустая вкладка обсуждений. Публикация сообществом чекпоинта на 70 ГБ обычно привлекает комментарии в течение нескольких часов — вопросы о квантах, о развёртывании, о том, какая лицензия. У этого — нет, что согласуется с тем, что его заметили несколько человек, следящих за openbmb организацией, а не было анонсировано кому-либо.

Архитектура, прочитанная прямо из config.json
Поскольку карточки, которую можно было бы перефразировать, нет, основным источником является файл конфигурации, и он на удивление информативен. Класс — MiniCPMV4_7ForConditionalGeneration, тип модели — minicpmv4_7, и он был сохранён с помощью Transformers 5.2.0 — всё это указывает на то, что перед нами официальный чекпоинт OpenBMB из основной линии MiniCPM-V, а не любительский файнтюн сообщества, носящий это имя.
• Языковой бэкбон — model_type: qwen3_5_moe_text. Разреженный MoE на основе Qwen3.5 — впервые в линейке MiniCPM-V использован текстовый стек Qwen-MoE, а не плотные малые варианты Qwen, которые лежали в основе MiniCPM-V 4.5 и 4.6.
• Разреженность — 256 экспертов, 8 выбираются на токен, при промежуточном размере эксперта 512 и общем эксперте того же размера. Общий чекпоинт на 35B при схеме маршрутизации 8 из 256 активирует небольшую часть этого за один прямой проход, в чём и заключается весь смысл названия A3B: веса большие, а вычисления — нет.
• Глубина и ширина — 40 скрытых слоёв, размер скрытого слоя 2048, 16 голов внимания с 2 головами ключей/значений и размерностью головы 256.
• Гибридное внимание — layer_types — это массив из 40 элементов, в котором на каждые три linear_attention слоя приходится один full_attention слой с фиксированным интервалом 4. Десять из сорока слоёв используют обычное внимание; остальные тридцать используют линейный путь в стиле Mamba со свёрточным ядром размера 4. Это самое значимое проектное решение в файле, и это то же направление, в котором двигалась вся отрасль на протяжении 2026 года.
• Позиционное кодирование — RoPE с theta 10 000 000 и partial_rotary_factor: 0.25, что означает, что поворачивается только четверть измерений каждой головы. Мультимодальный RoPE включён с mrope_interleaved: true, разбиением на секции [11, 11, 10] и mrope_mode: canvas.
• Контекст — max_position_embeddings: 262144, и значение model_max_length токенизатора совпадает. 256K токенов.
• Предсказание нескольких токенов — mtp_num_hidden_layers: 1, одна голова спекулятивного декодирования, тот же приём, что использовался в MiniCPM-V 4.6.
• Визуальная башня — minicpmv4_7_vision, размер скрытого слоя 1152, 27 слоёв, активации GELU-tanh, размер патча 14 с image_size, равным 980, и insert_layer_id, равным 6, где визуальные эмбеддинги встраиваются в языковой стек. Форма башни близка к той, что в MiniCPM-V 4.6, поэтому визуальная часть — это эволюция, а не перестройка.
• Сжатие визуальных данных — downsample_mode: "16x" и max_slice_nums: 9 в процессоре изображений. MiniCPM-V 4.6 представила переключаемую схему сжатия токенов 4x/16x; в конфигурации 4.7 настройка 16x указана как значение по умолчанию, при этом слайсер допускает до девяти вспомогательных изображений для входных данных высокого разрешения.
• Словарь — 248 144 токена, при этом <|image_pad|> имеет id 248 056, а <|video_pad|> — 248 057. Видео — полноправный входной формат, точно так же, как и с версии MiniCPM-V 4.5.
• Любопытный пережиток — конфигурация токенизатора по-прежнему объявляет <|audio_start|>, <|audio_end|> и <|audio_pad|>. Это почти наверняка означает, что словарь является общим с веткой omni MiniCPM-o, а не то, что MiniCPM-V 4.7 умеет работать с аудио. Трактовать это как аудиофункцию было бы ошибкой, которую одна лишь конфигурация не может исключить.

Что нам говорит семья, но не говорит этот репозиторий
Поколение 4.6 — это точка отсчёта, и вся суть в контрасте. MiniCPM-V 4.6 был выпущен 11 мая 2026 года как модель с 1,3 миллиарда параметров, построенная на визуальном энкодере SigLIP2-400M и языковой модели Qwen3.5-0.8B, под лицензией Apache-2.0, с чётко заявленной позицией: она набирает 13 баллов в Artificial Analysis Intelligence Index — показатель, заявленный производителем — используя при этом кардинально меньше токенов, чем сопоставимые малые модели, и работает на iOS, Android и HarmonyOS с открытым исходным кодом адаптации для периферийных устройств. Вся её идентичность сводилась к «малая, эффективная, на устройстве».
MiniCPM-V 4.7 — это 1,3B, умноженные примерно на 27. Название 35B-A3B относит его к классу, который занимают разреженные флагманы, а не телефоны. Планирует ли OpenCPM использовать его как серверный компаньон для edge-линейки, как учителя для будущей небольшой модели или как тест потолка возможностей — нигде не сказано, и в репозитории нет ни намёка ни на один из вариантов.
Что действительно ново и заслуживает упоминания для любого, кто следит за этой серией, — это основа Qwen-MoE плюс соотношение линейного внимания к полному 3:1. И то и другое — отход от прежнего. Всё, что OpenBMB публикует об этом семействе, всё ещё написано вокруг 4.6, так что этот чекпойнт опережает собственную документацию.

Что пока невозможно узнать — и почему этот список важен
Стоит без обиняков сказать о размере этой дыры, ведь при работе с чекпоинтом на 70 ГБ так и тянет заполнить её правдоподобными умозаключениями.
• Нет лицензии. Это не формальность. MiniCPM-V 4.6 распространяется под лицензией Apache-2.0, и сообщество привыкло ожидать этого от данной линейки. Репозиторий, в котором отсутствует license:-тег, по умолчанию защищён всеми правами в большинстве юрисдикций — нельзя безопасно строить на его основе, пока этот тег не появится. Этот единственный отсутствующий файл — наиболее значимое отсутствие в репозитории.
• Никаких бенчмарков — ни заявленных производителем, ни каких-либо иных. Нет ни единой цифры, о которой можно спорить. Любой, кто сегодня цитирует результат MMMU или OCRBench для MiniCPM-V 4.7, цитирует то, чего нет в источнике.
• Отсутствие независимой оценки. Artificial Analysis и аналогичные трекеры индексируют модели по названию; чекпоинт без карточки и без анонса обычно какое-то время остаётся без замеров.
• Нет готового рецепта для сервинга. Никем за пределами OpenBMB не проверялось, работают ли выпущенные веса «из коробки» в vLLM, SGLang или llama.cpp. Пользовательские пути кода (MiniCPMV4_7ForConditionalGeneration, MiniCPMV4_7Processor, MiniCPMV4_7ImageProcessor, MiniCPMV4_7VideoProcessor) все требуют trust_remote_code, а комбинация MoE и линейного внимания — не та форма, для которой в каждом движке инференса есть ядро.
Пока не выпущено {1}квантованных вариантов{{/1}} для {2}Codex{{/2}} 4.7. {3}Codex 4.6{{/3}} вышел в вариантах {4}GGUF{{/4}}, {5}AWQ{{/5}}, {6}GPTQ{{/6}}, {7}BNB{{/7}} и в июне попал в {8}библиотеку{{/8}}. Для модели на {9}35B{{/9}} это разница между {10}работоспособностью{{/10}} и {11}быстрым исчерпанием памяти в длинных чатах{{/11}}.
• О связи с 4.6 ничего не сказано. OpenBMB может заменять линейку edge, расширять её или тестировать что-то ортогональное. В репозитории об этом не говорится, и в GitHub README тоже, где по состоянию на коммит от 8 сентября 2026 года 4.6 всё ещё указана как текущий релиз.
Существует также правдоподобное, но неподтверждённое прочтение хронологии: двенадцатиминутный разрыв между созданием репозитория и последним коммитом, отсутствие карточки и отсутствие какого-либо поста — это то, как выглядит контрольная точка, когда её готовят к запуску, а не после него. Это гипотеза о намерении, а не факт об артефакте, и относиться к ней следует именно так.
Как бы вы на самом деле это запустили, когда есть что запускать
Пока здесь ничего нельзя процитировать как поддерживаемый путь, но конфигурация всё же ограничивает варианты. Чекпоинт BF16 с 35 млрд параметров требует примерно 70 ГБ памяти ускорителя ещё до учёта KV-кэша, поэтому развёртывание на одной GPU энтузиастами исключено, пока не появятся квантованные версии. Контекст 256K и соотношение линейного внимания 3:1 означают, что KV-кэш растёт гораздо медленнее, чем у обычного трансформера той же глубины; именно поэтому эта архитектура стоит своей сложности — работа с длинным контекстом и мультимодальностью — это то, где дизайн окупает себя. Когда появится карточка модели, первым делом нужно проверить лицензию, опубликован ли официальный рецепт для vLLM или SGLang, и можно ли заменить стандартный даунсэмплинг 16x на режим 4x, который появился в 4.6.
Для команд, которые хотят оценить такую модель сразу, как только она станет пригодной для использования, практическая проблема не в весах, а в инфраструктуре вокруг них. Модель, которая живёт на вашем собственном GPU, всё равно нуждается во всём, что её окружает, — роутер, который объединяет более 200 размещённых моделей под одним ключом, по каталожной цене каждого провайдера без нашей наценки сверху, и который автоматически переключается при сбое провайдера. Именно для этого нужен OrcaRouter, и стоит прямо сказать, что сам MiniCPM-V 4.7 не является размещённой моделью: это чекпоинт с открытыми весами, который вы обслуживаете сами. Роутер здесь важен как вторая половина архитектуры — передовая модель, которой ваш блок с 4.7 передаёт сложные случаи, доступная через того же клиента, который вы уже написали.
Текущее положение дел и один файл, который нужно обновить
MiniCPM-V 4.7 существует. Его веса можно скачать уже сегодня, количество параметров известно точно, а архитектурные решения эпохи обучения — разреженный MoE, линейное внимание 3:1, контекст 256K, 16-кратное сжатие визуальных данных — полностью читаются из файла конфигурации. Чего не существует, так это каких-либо заявлений от OpenBMB о том, что модель умеет, сколько стоит её эксплуатация на практике и что с ней разрешено делать. Для лаборатории, чья предыдущая vision-модель была релизом на 1,3B под Apache-2.0 для периферийных устройств с полной таблицей сравнения, это разительный пробел, и разумная позиция — следить за репозиторием, а не за разговорами. Единственный файл, который стоит обновлять, — это README.md: как только он появится, в нём будут лицензия, бенчмарки и, вероятно, объяснение того, что делает 35B MiniCPM-V в серии, построенной на маленьких моделях.
До тех пор честный вывод — самый скучный. Это реальная контрольная точка из реальной лаборатории, тихо выложенная, и на интересный вопрос — хороша ли она — опубликованного ответа нет.
OrcaRouter открывает доступ к более чем 200 размещённым моделям через один ключ: цена по прайс-листу каждого провайдера передаётся напрямую с наценкой 0%, а также действует автоматическое переключение при сбое между провайдерами. цена по прайс-листу провайдера, передаваемая с наценкой 0% MiniCPM-V 4.7 — не одна из них: это чекпоинт с открытыми весами, который вы обслуживаете сами, а роутер — это то, что находится по ту сторону передачи управления.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
