
Perceptron Mk1.5 против Gemma 4 12B: один отвечает предложениями, другой — координатами
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 610 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 189 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Вот число, которое должно остановить вас в первую очередь: Perceptron Mk1.5 — это модель, созданная для видео и воплощённых агентов, и её контекстное окно составляет 36 864 токена. Gemma 4 12B — это 12B-универсал с открытыми весами и окном в 256K. По той оси, которую большинство людей использует для сравнения визуальных моделей — сколько видеоматериала я могу ей передать, — меньшая, закрытая, специализированная модель проигрывает скачиваемой в семь раз. Эта инверсия не является недостатком ни одного из продуктов. Она говорит о том, для чего каждый из них на самом деле создавался, и эти две задачи находятся дальше друг от друга, чем предполагает общая строка «мультимодальный ввод» в их спецификациях.
Perceptron Mk1.5 — это модель воплощённого рассуждения, выпущенная Perceptron 25 сентября 2026 года, преемница Perceptron Mk1, вышедшей в мае. Она принимает на вход текст, изображения, видео и аудио, а на выходе выдаёт текст и геометрию, пригодную для машинного разбора. Gemma 4 12B — это мультимодальная модель с открытыми весами от Google DeepMind на 11,96 млрд параметров без энкодера, выпущенная 3 июня 2026 года под лицензией Apache 2.0; она принимает текст, изображения, аудио и видео, а возвращает текст. Обе они недороги, обе читают видеопоток с камеры, и только одна из них передаст вашему контроллеру ограничивающий прямоугольник без второго этапа разбора. Выбор между ними — это выбор того, что должно вернуться.
Что каждый из них предназначен возвращать
Поставьте их рядом — и разница окажется не в точности. Она в типе выходных данных. Спросите Gemma 4 12B, где находится погрузчик, — и вы получите предложение, и в большинстве приложений это предложение и есть продукт: описание, краткое изложение, ответ на вопрос о фотографии. Спросите Perceptron Mk1.5 — и наряду с его прозой у него можно запросить точку, ограничивающий прямоугольник, полигон, клип или <track> элемент, несущий пространственное наблюдениеи временную метку, к которой оно относится.
В этом и заключается весь аргумент в пользу существования Mk1.5, и стоит точно объяснить, почему это важно. Описание сцены — это готовый артефакт. Координата — это входные данные для чего-то другого: планировщика захвата, проверки дефектов, журнала аудита с отметками времени. Если вашему коду на следующем этапе приходится читать текст и выводить из него положение, вы построили парсер между двумя моделями, и теперь этот парсер — ваша поверхность отказов. Суть предложения Mk1.5 в том, что геометрия поступает уже типизированной.
Контраргумент Gemma 4 12B не в том, что она делает это тоже. Он в том, что веса могут быть у вас. Apache 2.0, 11,96 млрд параметров, выпущена в предобученном и дообученном на инструкциях вариантах, работает на подконтрольном вам оборудовании, с опубликованной карточкой оценки и сторонним индексом за ней. Это разные типы активов, и ни один из них не заменяет другой.
Где эти два на самом деле совпадают
Меньше мест, чем подразумевает ярлык «multimodal 2026», но общая основа реальна, и о ней стоит сказать именно потому, что с неё обычно начинается чек-лист покупателя.
• Входные модальности — обе модели по-настоящему четырёхмодальные. Perceptron Mk1.5 принимает текст, изображения, видео и аудио (WAV, MP3, FLAC). Gemma 4 12B принимает текст, изображения, аудио и видео через единый унифицированный путь без энкодера.
• Модальность вывода — ни одна из них не генерирует аудио или изображения. Обе выдают текст. Разница в том, что текст Mk1.5 может нести структурированные пространственные аннотации, а Gemma 4 12B — нет.
• Вызов функций — обе модели его поддерживают. Mk1.5 предоставляет вызов функций в чат-дополнениях и принимает ограниченные ответы через JSON Schema и регулярные выражения. Gemma 4 12B поставляется с вызовом функций в своей версии, настроенной на инструкции, и настраиваемым режимом размышления.
• Контроль рассуждений — Mk1.5 заменяет старый vision_config.enable_thinkingбулев флаг reasoning_effort — поле, принимающее значения high, medium, low, minimal или none, по умолчанию — high. Gemma 4 12B предоставляет варианты с рассуждениями и без них, которые показывают разные результаты на одном и том же тестовом стенде, поскольку выполняют разный объём работы.
• Контекст — 36 864 токена для Mk1.5 против 256K у Gemma 4 12B. Это самый большой разрыв в списке, и следующая секция посвящена ему.
• Веса и лицензия — Mk1.5 — это закрытая хостируемая модель с SDK, а не загрузка. Gemma 4 12B распространяется под Apache 2.0, поэтому цена хостинга — лишь один из нескольких вариантов, а не единственный способ её запустить.

Окно 36K — это проектное решение, а не недостаток.
Воплощённая модель с окном в 36 864 токена звучит как ошибка, пока не посмотришь, что Perceptron создала вместе с ней. Mk1.5 принимает asset_idx в качестве поля, так что один запрос может ссылаться на несколько изображений или видео и обращаться к каждому отдельно. Аудио ограничено 16 384 токенами на элемент — в документации Perceptron это примерно 21,8 минуты речи при скорости около 750 токенов в минуту. И причина, по которой окно может оставаться небольшим, в том, что задача узкая: находить и отслеживать конкретные объекты в кадрах, отвечать на вопросы о них, останавливаться.
Это работа иного характера, чем у Gemma 4 12B. Окно в 256K нужно, чтобы удерживать документ, репозиторий или длинный разговор и рассуждать по всему этому. Окно Mk1.5 — это бюджет на одну задачу восприятия со структурированным ответом, и Perceptron подобрал его размер под эту задачу, а не под таблицу лидеров. Разница становится критичной в тот момент, когда ваша задача — «посмотреть всё это 40-минутное видео осмотра и рассказать мне обо всём»: окно в 36K не вместит одновременно транскрипт, кадры и ответ, а окно Gemma 4 12B вместе с его оценкой recall в длинном контексте — это честный инструмент для этого.
Вторая половина этого обмена — скорость. Perceptron сообщает об ускорении до 4,7× от начала до конца по медиане трёх запусков на одном H100, с оговоркой, что 4,7× — это лучший из трёх замеров, а не типичный случай: ответы в чате сократились с 5,2 секунды до 1,1, вопросы по изображениям — с 1,7 секунды до 0,51 (примерно 3,3×), а 60-секундное видео при восьмикратной параллельности — с 19 секунд до 9,1 (примерно 2,1×). На видеонагрузке, которую реально выполняет воплощённый агент, честная кратность ускорения составляет примерно два.
Одно из них было измерено кем-то другим

Это самая чистая асимметрия в этом противостоянии, и это даже не близко.
У Gemma 4 12B есть карточка оценки от вендора и индекс от третьей стороны. В карточке приведены заявленные вендором показатели — MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 без инструментов 77,5, Tau2 усреднённо по трём запускам 69,0 — и одно честно указанное слабое место в MRCR v2 8-needle на 128k, где результат составляет 43,4; это та строка, которую стоит прочитать, прежде чем считать, что окно 256K одинаково работает на дальнем конце. Поверх этого есть независимое измерение: Artificial Analysis присваивает Gemma 4 12B Intelligence Index, равный 14, ставя её на 22-е место из 142 моделей в её классе, при 113,7 выходных токенов в секунду — 20-е из 142 по скорости — с каталожной ценой $0,10 за входные и $0,30 за выходные за миллион токенов.
У Perceptron Mk1.5 ничего подобного нет. Для Mk1.5 или Mk1 нет ни записи в индексе Artificial Analysis, ни оценки на арене, поэтому все показатели возможностей, существующие для этой модели, были получены продающей её компанией. Этот набор конкретен, а не расплывчат, и его стоит прочитать: 0,9433 на эгоцентрическом hand_box против 0,4467 у Gemini 3.1 Pro и 0,6179 у лучшей Gemini в собственном прогоне Perceptron; EgoSchema 80,40 против 81,20 у того же конкурента — потеря 0,80 балла на широком бенчмарке понимания при заявленном преимуществе в 12% на подмножестве EgoSchema-hard с 63,75; 0,647 centre-F1 и 0,628 point-HOTA на Molmo2-Track; DailyOmni 74,67 и AVHBench 80,56 на аудиочасти. Закономерность в этих числах — решающий перевес в мелкозернистой геометрии, примерно на одном уровне или немного позади в общем понимании видео — последовательна и соответствует истории продукта. Но бенчмарк вендора для собственной модели — это заявление, и две модели в этой статье описываются не с доказательствами одного и того же типа.
Одна строка в той таблице заслуживает отдельного предупреждения. В сравнительной таблице трекинга от Perceptron модель Qwen3-VL-8B указана со значением 0,180 centre-F1, взятым из статьи самой этой модели, рядом с измеренными показателями для собственной модели Perceptron, и поставлена в пару с Qwen3.5-27B на уровне 0,530 и 0,476 для разных чекпойнтов и схем оценки. Цифра из статьи в столбце измеренных значений — это не сопоставимая строка, и именно такие строки часто цитируют без указания их происхождения. Та же осторожность применима и в обратную сторону к публикациям с показателем 56,0 для Mk1.5 на LiveVQA-W с включёнными инструментами: эта цифра получена мажоритарным голосованием по четырём образцам, тогда как 53,2, с которым её сравнивают для Gemini 3.8 Flash с опорой на поиск, — нет; а мажоритарное голосование по четырём образцам — это законная методика, которая завышает оценку по сравнению с одним жадным проходом.
Расчёт стоимости фактической рабочей нагрузки
Тарифные сетки ближе друг к другу, чем сами продукты. Perceptron Mk1.5 — $0,15 за миллион входных токенов и $1,50 за миллион выходных, при этом кэшированный вход — $0,0375, ровно четверть стандартной ставки за вход и дешевле за кэшированный токен, чем стандартный вход Gemma 4 12B за $0,10. Gemma 4 12B в стороннем харнессе, который её измеряет, указана по цене $0,10 и $0,30, и она распространяется под лицензией Apache 2.0, так что самостоятельный хостинг полностью устраняет предельные издержки, если у вас есть оборудование.
Две вещи усложняют прямое сравнение, и они указывают в противоположных направлениях. Во-первых, в Mk1.5 reasoning_effort по умолчанию имеет значение high, а значит, каждый вызов, который вы не настроили, покупает самый дорогой путь рассуждений, который предлагает модель; переход на medium или low — это изменение в одну строку с прямым влиянием на счёт, и это самый дешёвый эксперимент в релизе. Во-вторых, Gemma 4 12B позволяет полностью отключить этап мышления, что меняет и счёт, и задержку, а на фиксированной задаче вроде классификации на уровне кадров проход без рассуждений часто является правильным.
Проведите арифметику на чём-то реальном: конвейер компьютерного зрения, обрабатывающий 40 000 кадров в день при примерно тысяче токенов входных данных изображения на каждый. Это 40 млн входных токенов в день. При ставке Mk1.5 за ввод $0,15 и кэшировании кадров там, где повторяется одна и та же сцена, вы укладываетесь в несколько долларов в день за ввод — дёшево по любым меркам. Gemma 4 12B при $0,10 за ввод ещё дешевле, а на пределе — бесплатно, если вы размещаете модель у себя. Ни одна из моделей не дорогая. Решение здесь — не вопрос бюджета; это вопрос о том, нужны ли вам координаты, окно на 256K или и то, и другое.
Вызов обоих без второй интеграции

Практическое препятствие для проведения этого сравнения — не цена, а то, что Perceptron Mk1.5 и Gemma 4 12B отсутствуют в одном каталоге. Ни один из них сегодня не маршрутизируется в OrcaRouter: из Gemma 4 мы предоставляем варианты 31B Instruct и 26B-A4B, а для Mk1.5 маршрута нет вообще, поэтому честная рекомендация — обращаться к Mk1.5 через собственный API вендора по адресу api.perceptron.inc — pip install "perceptron>=0.4.0", ключ в PERCEPTRON_API_KEY — а к Gemma 4 12B либо через сторонний хостинг, либо развернув веса под Apache-2.0 самостоятельно.
То, для чего в этой ситуации на самом деле нужен слой маршрутизации, — это решение, которое вы ещё не приняли. Если структурированный вывод Mk1.5 — это то, что нужно вашему приложению, а окно Gemma 4 12B — то, что нужно вашей другой рабочей нагрузке, это две интеграции и два домена отказов; поместить их за один OpenAI-совместимый эндпоинт с автоматическим переключением при сбое означает, что сбой у любого из провайдеров превращается в переход на резервный вариант, а не в невыполненную задачу, и правило маршрутизации может направлять работу с геометрией и работу с длинным контекстом к разным моделям, при этом ваше приложение не знает, какая из них какая. Когда вендор меняет свою тарифную сетку, сквозной маршрутизатор выставляет счёт по прейскурантной цене провайдера без каких-либо наценок за токен, поэтому изменение вступает в силу в тот же день, а не в ваш следующий расчётный цикл. DSL маршрутизации — это также способ провести сравнение: направить долю реального трафика к каждой модели, измеренную на ваших собственных кадрах, вместо спора о бенчмарках.
Какой именно тебе нужен
Берите Perceptron Mk1.5, если ответ должен быть машиночитаемым. Если вы чем-то управляете или логируете что-то, где важны позиция и время, никакое дополнительное контекстное окно не заменит типизированную координату, и Mk1.5 — единственная модель в этой паре, которая её выдаёт. Учитывайте три вещи: бюджет в 36 864 токена, высокий уровень рассуждений по умолчанию и тот факт, что все показатели возможностей, привязанные к ней, — собственные показатели производителя.
Самый дешёвый способ решить этот вопрос — направить часть реального трафика к каждому и измерять на собственных фреймах; оба работают через одну конечную точку, совместимую с OpenAI на OrcaRouter, и именно это превращает сравнительный тест в строку конфигурации, а не во вторую интеграцию.
Возьмите Gemma 4 12B, если вам нужно удерживать много материала, если вам нужны веса или если вам нужно обосновать выбор перед тем, кто не принимает вендорские бенчмарки на веру. У неё есть независимый индекс, опубликованная карточка оценки, лицензия Apache 2.0 и окно в семь раз больше — и она опишет сцену, а не измерит её. Эта последняя фраза и есть всё решение. Одна из этих моделей — универсал, которым можно владеть и который можно аудировать; другая — специалист, которого вы арендуете, потому что он возвращает геометрию, и то, что у специалиста окно меньше и нет сторонней оценки, — не противоречие. Именно так узкоспециализированный инструмент выглядит снаружи.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
