Сгенерированная титульная карточка для сравнения Perceptron Mk1.5 и Gemma 4 12B с заголовком «Perceptron Mk1.5 vs Gemma 4 12B» и подзаголовком «Один отвечает предложениями. Другой — координатами», а также три карточки с текстом «Контекст Mk1.5: 36 864 токена», «Контекст Gemma 4 12B: 256K» и «Вывод Mk1.5: боксы и треки», со сноской «Показатели Mk1.5 — по данным производителя».
Guides & Insights

Perceptron Mk1.5 против Gemma 4 12B: один отвечает предложениями, другой — координатами

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Вот число, которое должно остановить вас в первую очередь: Perceptron Mk1.5 — это модель, созданная для видео и воплощённых агентов, и её контекстное окно составляет 36 864 токена. Gemma 4 12B — это 12B-универсал с открытыми весами и окном в 256K. По той оси, которую большинство людей использует для сравнения визуальных моделей — сколько видеоматериала я могу ей передать, — меньшая, закрытая, специализированная модель проигрывает скачиваемой в семь раз. Эта инверсия не является недостатком ни одного из продуктов. Она говорит о том, для чего каждый из них на самом деле создавался, и эти две задачи находятся дальше друг от друга, чем предполагает общая строка «мультимодальный ввод» в их спецификациях.

Perceptron Mk1.5 — это модель воплощённого рассуждения, выпущенная Perceptron 25 сентября 2026 года, преемница Perceptron Mk1, вышедшей в мае. Она принимает на вход текст, изображения, видео и аудио, а на выходе выдаёт текст и геометрию, пригодную для машинного разбора. Gemma 4 12B — это мультимодальная модель с открытыми весами от Google DeepMind на 11,96 млрд параметров без энкодера, выпущенная 3 июня 2026 года под лицензией Apache 2.0; она принимает текст, изображения, аудио и видео, а возвращает текст. Обе они недороги, обе читают видеопоток с камеры, и только одна из них передаст вашему контроллеру ограничивающий прямоугольник без второго этапа разбора. Выбор между ними — это выбор того, что должно вернуться.

Что каждый из них предназначен возвращать

Поставьте их рядом — и разница окажется не в точности. Она в типе выходных данных. Спросите Gemma 4 12B, где находится погрузчик, — и вы получите предложение, и в большинстве приложений это предложение и есть продукт: описание, краткое изложение, ответ на вопрос о фотографии. Спросите Perceptron Mk1.5 — и наряду с его прозой у него можно запросить точку, ограничивающий прямоугольник, полигон, клип или <track> элемент, несущий пространственное наблюдениеи временную метку, к которой оно относится.

В этом и заключается весь аргумент в пользу существования Mk1.5, и стоит точно объяснить, почему это важно. Описание сцены — это готовый артефакт. Координата — это входные данные для чего-то другого: планировщика захвата, проверки дефектов, журнала аудита с отметками времени. Если вашему коду на следующем этапе приходится читать текст и выводить из него положение, вы построили парсер между двумя моделями, и теперь этот парсер — ваша поверхность отказов. Суть предложения Mk1.5 в том, что геометрия поступает уже типизированной.

Контраргумент Gemma 4 12B не в том, что она делает это тоже. Он в том, что веса могут быть у вас. Apache 2.0, 11,96 млрд параметров, выпущена в предобученном и дообученном на инструкциях вариантах, работает на подконтрольном вам оборудовании, с опубликованной карточкой оценки и сторонним индексом за ней. Это разные типы активов, и ни один из них не заменяет другой.

Где эти два на самом деле совпадают

Меньше мест, чем подразумевает ярлык «multimodal 2026», но общая основа реальна, и о ней стоит сказать именно потому, что с неё обычно начинается чек-лист покупателя.

• Входные модальности — обе модели по-настоящему четырёхмодальные. Perceptron Mk1.5 принимает текст, изображения, видео и аудио (WAV, MP3, FLAC). Gemma 4 12B принимает текст, изображения, аудио и видео через единый унифицированный путь без энкодера.

• Модальность вывода — ни одна из них не генерирует аудио или изображения. Обе выдают текст. Разница в том, что текст Mk1.5 может нести структурированные пространственные аннотации, а Gemma 4 12B — нет.

• Вызов функций — обе модели его поддерживают. Mk1.5 предоставляет вызов функций в чат-дополнениях и принимает ограниченные ответы через JSON Schema и регулярные выражения. Gemma 4 12B поставляется с вызовом функций в своей версии, настроенной на инструкции, и настраиваемым режимом размышления.

• Контроль рассуждений — Mk1.5 заменяет старый vision_config.enable_thinkingбулев флаг reasoning_effort — поле, принимающее значения high, medium, low, minimal или none, по умолчанию — high. Gemma 4 12B предоставляет варианты с рассуждениями и без них, которые показывают разные результаты на одном и том же тестовом стенде, поскольку выполняют разный объём работы.

• Контекст — 36 864 токена для Mk1.5 против 256K у Gemma 4 12B. Это самый большой разрыв в списке, и следующая секция посвящена ему.

• Веса и лицензия — Mk1.5 — это закрытая хостируемая модель с SDK, а не загрузка. Gemma 4 12B распространяется под Apache 2.0, поэтому цена хостинга — лишь один из нескольких вариантов, а не единственный способ её запустить.

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Gemma 4 12B - the scoreboard', comparing six dimensions: context window 36,864 tokens vs 256K tokens; input text, image, video, audio vs text, image, audio, video; output text plus boxes, tracks and timestamps vs text only; reasoning control 'reasoning_effort, high default' vs thinking on and off; price $0.15 in / $1.50 out per 1M tokens vs $0.10 in / $0.30 out; and independent score 'none yet' vs AA Index 14 of 142. Footnoted that Mk1.5 figures are vendor-reported with no independent index and that the Gemma index is per Artificial Analysis.

Окно 36K — это проектное решение, а не недостаток.

Воплощённая модель с окном в 36 864 токена звучит как ошибка, пока не посмотришь, что Perceptron создала вместе с ней. Mk1.5 принимает asset_idx в качестве поля, так что один запрос может ссылаться на несколько изображений или видео и обращаться к каждому отдельно. Аудио ограничено 16 384 токенами на элемент — в документации Perceptron это примерно 21,8 минуты речи при скорости около 750 токенов в минуту. И причина, по которой окно может оставаться небольшим, в том, что задача узкая: находить и отслеживать конкретные объекты в кадрах, отвечать на вопросы о них, останавливаться.

Это работа иного характера, чем у Gemma 4 12B. Окно в 256K нужно, чтобы удерживать документ, репозиторий или длинный разговор и рассуждать по всему этому. Окно Mk1.5 — это бюджет на одну задачу восприятия со структурированным ответом, и Perceptron подобрал его размер под эту задачу, а не под таблицу лидеров. Разница становится критичной в тот момент, когда ваша задача — «посмотреть всё это 40-минутное видео осмотра и рассказать мне обо всём»: окно в 36K не вместит одновременно транскрипт, кадры и ответ, а окно Gemma 4 12B вместе с его оценкой recall в длинном контексте — это честный инструмент для этого.

Вторая половина этого обмена — скорость. Perceptron сообщает об ускорении до 4,7× от начала до конца по медиане трёх запусков на одном H100, с оговоркой, что 4,7× — это лучший из трёх замеров, а не типичный случай: ответы в чате сократились с 5,2 секунды до 1,1, вопросы по изображениям — с 1,7 секунды до 0,51 (примерно 3,3×), а 60-секундное видео при восьмикратной параллельности — с 19 секунд до 9,1 (примерно 2,1×). На видеонагрузке, которую реально выполняет воплощённый агент, честная кратность ускорения составляет примерно два.

Одно из них было измерено кем-то другим

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing the Apache 2.0 licence, Google DeepMind authorship, the gemma4_unified image-text-to-text pipeline tag, and the card text that Gemma 4 models handle text, image and audio input (audio supported on E2B, E4B and 12B) and generate text output, with a context window of up to 256K tokens and multilingual support in over 140 languages.

Это самая чистая асимметрия в этом противостоянии, и это даже не близко.

У Gemma 4 12B есть карточка оценки от вендора и индекс от третьей стороны. В карточке приведены заявленные вендором показатели — MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 без инструментов 77,5, Tau2 усреднённо по трём запускам 69,0 — и одно честно указанное слабое место в MRCR v2 8-needle на 128k, где результат составляет 43,4; это та строка, которую стоит прочитать, прежде чем считать, что окно 256K одинаково работает на дальнем конце. Поверх этого есть независимое измерение: Artificial Analysis присваивает Gemma 4 12B Intelligence Index, равный 14, ставя её на 22-е место из 142 моделей в её классе, при 113,7 выходных токенов в секунду — 20-е из 142 по скорости — с каталожной ценой $0,10 за входные и $0,30 за выходные за миллион токенов.

У Perceptron Mk1.5 ничего подобного нет. Для Mk1.5 или Mk1 нет ни записи в индексе Artificial Analysis, ни оценки на арене, поэтому все показатели возможностей, существующие для этой модели, были получены продающей её компанией. Этот набор конкретен, а не расплывчат, и его стоит прочитать: 0,9433 на эгоцентрическом hand_box против 0,4467 у Gemini 3.1 Pro и 0,6179 у лучшей Gemini в собственном прогоне Perceptron; EgoSchema 80,40 против 81,20 у того же конкурента — потеря 0,80 балла на широком бенчмарке понимания при заявленном преимуществе в 12% на подмножестве EgoSchema-hard с 63,75; 0,647 centre-F1 и 0,628 point-HOTA на Molmo2-Track; DailyOmni 74,67 и AVHBench 80,56 на аудиочасти. Закономерность в этих числах — решающий перевес в мелкозернистой геометрии, примерно на одном уровне или немного позади в общем понимании видео — последовательна и соответствует истории продукта. Но бенчмарк вендора для собственной модели — это заявление, и две модели в этой статье описываются не с доказательствами одного и того же типа.

Одна строка в той таблице заслуживает отдельного предупреждения. В сравнительной таблице трекинга от Perceptron модель Qwen3-VL-8B указана со значением 0,180 centre-F1, взятым из статьи самой этой модели, рядом с измеренными показателями для собственной модели Perceptron, и поставлена в пару с Qwen3.5-27B на уровне 0,530 и 0,476 для разных чекпойнтов и схем оценки. Цифра из статьи в столбце измеренных значений — это не сопоставимая строка, и именно такие строки часто цитируют без указания их происхождения. Та же осторожность применима и в обратную сторону к публикациям с показателем 56,0 для Mk1.5 на LiveVQA-W с включёнными инструментами: эта цифра получена мажоритарным голосованием по четырём образцам, тогда как 53,2, с которым её сравнивают для Gemini 3.8 Flash с опорой на поиск, — нет; а мажоритарное голосование по четырём образцам — это законная методика, которая завышает оценку по сравнению с одним жадным проходом.

Расчёт стоимости фактической рабочей нагрузки

Тарифные сетки ближе друг к другу, чем сами продукты. Perceptron Mk1.5 — $0,15 за миллион входных токенов и $1,50 за миллион выходных, при этом кэшированный вход — $0,0375, ровно четверть стандартной ставки за вход и дешевле за кэшированный токен, чем стандартный вход Gemma 4 12B за $0,10. Gemma 4 12B в стороннем харнессе, который её измеряет, указана по цене $0,10 и $0,30, и она распространяется под лицензией Apache 2.0, так что самостоятельный хостинг полностью устраняет предельные издержки, если у вас есть оборудование.

Две вещи усложняют прямое сравнение, и они указывают в противоположных направлениях. Во-первых, в Mk1.5 reasoning_effort по умолчанию имеет значение high, а значит, каждый вызов, который вы не настроили, покупает самый дорогой путь рассуждений, который предлагает модель; переход на medium или low — это изменение в одну строку с прямым влиянием на счёт, и это самый дешёвый эксперимент в релизе. Во-вторых, Gemma 4 12B позволяет полностью отключить этап мышления, что меняет и счёт, и задержку, а на фиксированной задаче вроде классификации на уровне кадров проход без рассуждений часто является правильным.

Проведите арифметику на чём-то реальном: конвейер компьютерного зрения, обрабатывающий 40 000 кадров в день при примерно тысяче токенов входных данных изображения на каждый. Это 40 млн входных токенов в день. При ставке Mk1.5 за ввод $0,15 и кэшировании кадров там, где повторяется одна и та же сцена, вы укладываетесь в несколько долларов в день за ввод — дёшево по любым меркам. Gemma 4 12B при $0,10 за ввод ещё дешевле, а на пределе — бесплатно, если вы размещаете модель у себя. Ни одна из моделей не дорогая. Решение здесь — не вопрос бюджета; это вопрос о том, нужны ли вам координаты, окно на 256K или и то, и другое.

Вызов обоих без второй интеграции

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, and JSON Schema and regex constrained responses) and the Pricing table beneath it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Практическое препятствие для проведения этого сравнения — не цена, а то, что Perceptron Mk1.5 и Gemma 4 12B отсутствуют в одном каталоге. Ни один из них сегодня не маршрутизируется в OrcaRouter: из Gemma 4 мы предоставляем варианты 31B Instruct и 26B-A4B, а для Mk1.5 маршрута нет вообще, поэтому честная рекомендация — обращаться к Mk1.5 через собственный API вендора по адресу api.perceptron.inc — pip install "perceptron>=0.4.0", ключ в PERCEPTRON_API_KEY — а к Gemma 4 12B либо через сторонний хостинг, либо развернув веса под Apache-2.0 самостоятельно.

То, для чего в этой ситуации на самом деле нужен слой маршрутизации, — это решение, которое вы ещё не приняли. Если структурированный вывод Mk1.5 — это то, что нужно вашему приложению, а окно Gemma 4 12B — то, что нужно вашей другой рабочей нагрузке, это две интеграции и два домена отказов; поместить их за один OpenAI-совместимый эндпоинт с автоматическим переключением при сбое означает, что сбой у любого из провайдеров превращается в переход на резервный вариант, а не в невыполненную задачу, и правило маршрутизации может направлять работу с геометрией и работу с длинным контекстом к разным моделям, при этом ваше приложение не знает, какая из них какая. Когда вендор меняет свою тарифную сетку, сквозной маршрутизатор выставляет счёт по прейскурантной цене провайдера без каких-либо наценок за токен, поэтому изменение вступает в силу в тот же день, а не в ваш следующий расчётный цикл. DSL маршрутизации — это также способ провести сравнение: направить долю реального трафика к каждой модели, измеренную на ваших собственных кадрах, вместо спора о бенчмарках.

Какой именно тебе нужен

Берите Perceptron Mk1.5, если ответ должен быть машиночитаемым. Если вы чем-то управляете или логируете что-то, где важны позиция и время, никакое дополнительное контекстное окно не заменит типизированную координату, и Mk1.5 — единственная модель в этой паре, которая её выдаёт. Учитывайте три вещи: бюджет в 36 864 токена, высокий уровень рассуждений по умолчанию и тот факт, что все показатели возможностей, привязанные к ней, — собственные показатели производителя.

Самый дешёвый способ решить этот вопрос — направить часть реального трафика к каждому и измерять на собственных фреймах; оба работают через одну конечную точку, совместимую с OpenAI на OrcaRouter, и именно это превращает сравнительный тест в строку конфигурации, а не во вторую интеграцию.

Возьмите Gemma 4 12B, если вам нужно удерживать много материала, если вам нужны веса или если вам нужно обосновать выбор перед тем, кто не принимает вендорские бенчмарки на веру. У неё есть независимый индекс, опубликованная карточка оценки, лицензия Apache 2.0 и окно в семь раз больше — и она опишет сцену, а не измерит её. Эта последняя фраза и есть всё решение. Одна из этих моделей — универсал, которым можно владеть и который можно аудировать; другая — специалист, которого вы арендуете, потому что он возвращает геометрию, и то, что у специалиста окно меньше и нет сторонней оценки, — не противоречие. Именно так узкоспециализированный инструмент выглядит снаружи.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно