
Perceptron Mk1.5 даёт воплощённым агентам структурированный пространственный вывод — и в тот же день отправляет Isaac на пенсию
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 578 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 182 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Perceptron Mk1.5 теперь общедоступен, и интересно в нём не таблица бенчмарков — а то, что возвращается в теле ответа. Спросите обычную визуально-языковую модель, где находится погрузчик, и получите предложение. Спросите Perceptron Mk1.5 по видеокадру, и наряду с его текстом вы можете получить машиночитаемую геометрию: точку, ограничивающий прямоугольник, полигон, клип или <track>-элемент, несущий пространственные наблюдения с временными метками по всему файлу. В этом разница между моделью, которая описывает сцену, и моделью, которую контроллер робота может использовать без второго этапа разбора. Это прямой преемник Perceptron Mk1, первого релиза компании в мае 2026 года, и он вышел 25 сентября одновременно с прекращением поддержки чекпоинтов Isaac 0.1 и 0.2, которые ему предшествовали.
Что на самом деле возвращает Mk1.5
Модель — это система воплощённого рассуждения для физических агентов. На входе она принимает текст, изображения, видео и аудио. На выходе она выдаёт текст плюс опциональные структурированные аннотации: точки, рамки, полигоны, клипы и треки. Выходные данные трекинга — это то, на чём стоит остановиться. Документация Perceptron описывает <track> блок, записи которого содержат как пространственное наблюдение, так и временную метку, к которой оно относится, поэтому 60-секундный клип возвращается как последовательность положений объекта во времени, а не как одно усреднённое предположение о сцене.
Вторая деталь, важная для всех, кто встраивает это в конвейер с более чем одним активом: Mk1.5 поддерживает asset_idx — поле, поэтому один запрос может ссылаться на несколько изображений или видео и обращаться к ним по отдельности. Если ваша задача — сравнивать эталонное фото с кадром с камеры в реальном времени — цикл проверки дефектов, этап верификации сборки — это должно быть в одном вызове, а не в двух.
Модель также поддерживает ответы с ограничениями, как JSON Schema, так и regex; именно так вы превращаете «примерно так» в схему, которую сможет проверить ваш нижестоящий код. Вызов функций поддерживается в chat completions, а размещённый MCP-сервер Perceptron теперь по умолчанию использует perceptron-mk1.5; передать model: "perceptron-mk1" явно — это способ закрепить предыдущее значение по умолчанию.
Спецификация и сколько это стоит

Приведённые здесь числа стоит назвать прямо, потому что они скромны там, где читатель может этого не ожидать. Контекстное окно — 36 864 токена — не миллион и не 256K. Максимальный объём вывода — 8 192 токена. Это не та модель, которой можно вручить двухчасовое видео и 300-страничное руководство. Она рассчитана на компактную задачу восприятия со структурированным ответом.
Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.
• Контекст — 36 864 токена по сравнению с 32K-окном, с которым поставлялась Perceptron Mk1
• Максимальный вывод — 8 192 токена
• Ввод — текст, изображения, видео, аудио (WAV, MP3, FLAC)
• Ввод из кэша — $0,0375/млн, четверть стандартной ставки за ввод $0,15/млн
• Вывод — $1,50/млн
• Управление рассуждениями — reasoning_effort со значениями high, medium, low, minimal или none, по умолчанию high
Эта последняя строка — замаскированное критическое изменение. Mk1.5 заменяет старый vision_config.enable_thinking (булев параметр) на reasoning_effort, поэтому любой запрос, который вы написали под предыдущую модель, придётся редактировать, а не просто перенаправлять. Значение по умолчанию high заслуживает внимания по другой причине: если вы не задаёте это поле, вы платите за самый дорогой путь рассуждений при каждом вызове.
Аудио и видео, которое имеет собственную звуковую дорожку
Аудиовход здесь действительно новый. Perceptron принимает его тремя способами — встроенный input_audio, audio_url или audio_file_id — с ограничением в 16 384 аудиотокена на элемент. В документации это оценивается примерно в 21,8 минуты речи при примерно 750 токенах в минуту, что является разумным бюджетом для записи передачи смены или журнала технического обслуживания.
Более необычен путь работы с видео. По умолчанию Mk1.5 читает видео как последовательность кадров и игнорирует звуковую дорожку. Установка vision_config.enable_audio_in_video: true снова включает звуковую дорожку — это именно та настройка, которая нужна для всего, где шум и есть сигнал: машина, которая звучит неправильно раньше, чем выглядит неправильно, произнесённая за кадром инструкция, сигнализация на фоне при обходе объекта. По умолчанию она отключена, поэтому видео со слышимой неисправностью будет молча проанализировано как немое кино, если не указать иное.
Картина бенчмарка с явно указанными источниками

Все приведённые ниже цифры взяты из собственного анонса Perceptron и были измерены самой Perceptron. В индексе Artificial Analysis нет записи, и нет оценки арены ни для Mk1.5, ни для его предшественника, поэтому в этом сравнении нигде нет сторонних цифр, с которыми их можно было бы сопоставить. Рассматривайте эти цифры как заявление производителя о собственном продукте, а не как нейтральный результат.
В области эгоцентрического трекинга рук разрыв широк и специфичен: Mk1.5 набирает 0.9433 по hand_box против 0.4467 у Gemini 3.1 Pro и 0.6179 у лучшей модели Gemini в прогоне Perceptron, которую в анонсе определяют как Gemini 3.8 Flash. Это те самые +111% и +53%, с которых начинается пост о запуске, и это самое сильное отдельное число в релизе.
В общем понимании эгоцентричного видео картина гораздо ближе. Perceptron сообщает о 80,40 по EgoSchema для Mk1.5 против 81,20 у Gemini 3.8 Flash — отставание в 0,80 балла — и при этом заявляет о преимуществе в 12% на подмножестве EgoSchema-hard с результатом 63,75. Модель, которая уверенно побеждает в тонкой геометрии рук и немного проигрывает в широком бенчмарке на понимание, — это инструмент особого рода, и её продают именно как таковой.
Сегментация видеообъектов достигает 0.647 center-F1 и 0.628 point-HOTA на Molmo2-Track. Perceptron сообщает, что этот результат лидирует на Molmo2-Track, Ref-DAVIS17 и ReasonVOS, но уступает MolmoPoint-8B на MeViS valid_u. На фоне линейки визуальных моделей Qwen сравнение по трекингу стоит читать внимательно: в анонсе Qwen3-VL-8B указан с 0.180 center-F1 из своей статьи, а Qwen3.5-27B — с 0.530 и 0.476 — разные чекпойнты, разные схемы оценки, и число из статьи находится в том же столбце, что и измеренные. Это не строка для сравнения на равных.
Аудиорезультаты приводятся как DailyOmni 74,67, WorldSense 50,32, OmniBench 51,05 и AVHBench 80,56, при этом строка сравнения не приложена. В мультимодальном поиске с включёнными инструментами Mk1.5 показывает 56,0 на LiveVQA-W по результатам голосования большинством из четырёх образцов — против 53,2 у Gemini 3.8 Flash с опорой на Google Search, 51,0 у GPT-6 sol с веб-поиском OpenAI и 33,2 у GPT-5.2 онлайн. Perceptron также заявляет о приросте на 36,1 пункта на MMSearch после включения инструментов. Голосование большинством по четырём образцам — правомерная методика, и она завышает показатель относительно одиночного жадного прохода, поэтому 56,0 и 53,2 измерены не одинаковым образом.
Задержка и то, как был измерен показатель 4,7×
Утверждение о скорости — то, которое чаще всего будут цитировать без контекста, поэтому вот контекст. Perceptron сообщает об ускорении сквозного процесса до 4,7× по медиане из трёх запусков на одном H100, используя промпты LMArena с ограничением ответов в 256 токенов, а также MIA-Bench и Video-MME с Perception Test. 4,7× — это случай чата: с 5,2 секунды до 1,1. Ответы на вопросы по изображениям: с 1,7 секунды до 0,51, то есть примерно 3,3×. 60-секундное видео, обрабатываемое по восемь за раз, — с 19 секунд до 9,1, примерно 2,1×.
Итак, фигурирующий в заголовке множитель — лучший из трёх, а не типичный случай. На одном H100, на коротких ответах чат-путь действительно работает в 4,7 раза быстрее. На видеонагрузке, которую реально запускал бы воплощённый агент, это ближе к 2×. Оба числа хороши; но только одно из них — то, что в заголовке.
Isaac 0.1 и 0.2 были сняты с поддержки в тот же день

В списке изменений Mk1.5 есть вторая запись от 25 сентября, и именно она больнее всего ударит по тем, кто уже в продакшене. isaac-0.1, isaac-0.2-1b и isaac-0.2-2b-preview — идентификаторы моделей — были выведены из Perceptron API. Они больше не появляются в GET /v1/models, они исчезли с размещённого MCP-сервера, а запросы, в которых они указаны, теперь завершаются ошибкой HTTP 404 model_not_found.
В той же записи есть второе изменение поведения, которое ударит по коду, вообще не упоминавшему модели Isaac: неизвестные идентификаторы моделей теперь возвращают 404 вместо прежнего 400. Любая логика повторных попыток, ветка обработки ошибок или правило оповещения, которые срабатывали при 400 для неверного имени модели, теперь не срабатывают ни на что. Путь миграции, который предлагает Perceptron, — это perceptron-mk1.5.
Вывод семейства моделей из эксплуатации в тот же день, когда вы выпускаете его замену, — это чистая история миграции и одновременно суровая. Если вы закрепили Isaac, потому что он работал, у вас есть дедлайн, который уже прошёл.
Где это запустить и как попробовать, не делая на это ставку
Доступ осуществляется через собственный API поставщика и несколько сторонних платформ. OrcaRouter сейчас не маршрутизирует Perceptron Mk1.5 — этой модели нет в нашем каталоге — поэтому честная рекомендация — обратиться напрямую к api.perceptron.inc за ней, для чего как раз и предназначены SDK и PERCEPTRON_API_KEY (переменная среды).
Что всё же стоит сказать, потому что это относится к решению, а не к модели: чекпойнт двухдневной давности с окном в 36 864 токена и значением reasoning по умолчанию, установленным на high, — это ровно тот профиль, который не следует без предварительной проверки выводить в продакшен. Сначала прогоните его на своих собственных фреймах и измерьте две вещи, а именно: выдерживают ли структурированные выходы ваши реальные краевые случаи, и сколько reasoning_effort: "high" стоит вам за вызов по сравнению со снижением до medium или low. Второе — это изменение в одну строку, напрямую влияющее на ваш счёт, и это самый дешёвый эксперимент в этом релизе.
Более широкая закономерность, в которую это вписывается — модели восприятия, возвращающие геометрию, а не прилагательные — именно та, которую OrcaRouter создан поглощать. Один API охватывает более 200 моделей, а цены провайдеров из прайс-листов передаются с наценкой 0%, поэтому изменение цены поставщиком на любую из них вступает в силу у нас в тот же день, и автоматическое переключение при сбое означает, что запрос к модели восприятия может перейти на вторую модель вместо того, чтобы завершиться ошибкой. Если Mk1.5 — единственное, что преодолевает вашу планку точности, сегодня ничто из этого вам не поможет. Если это лишь один из нескольких кандидатов, провести сравнение через единый эндпоинт дешевле, чем подключить второй SDK, чтобы это выяснить.
Что представляет собой этот релиз и чем он не является
Perceptron Mk1.5 — это специализированный инструмент с необычно честным набором присущих ему ограничений. Он возвращает координаты, а не только описание. Он распознаёт аудио, включая звуковую дорожку видео, если включить эту функцию. Он быстр на коротких ответах в чате. Кроме того, это модель на 36 864 токена с потолком вывода в 8 192 токена, ценой $0.15 и $1.50, полностью протестированная собственным поставщиком и продаваемая компанией, которая вывела из эксплуатации предыдущее поколение в той же записи журнала изменений.
Если ваша задача — «найти руку, отследить её по всему клипу, сказать, куда и когда она переместилась», то проверять стоит именно показатель hand-box. Если ваша задача — широкое понимание видео в сравнении с передовой универсальной моделью, то строка EgoSchema — 80,40 против 81,20 — говорит о том, что вы покупаете специалиста примерно при паритете, и аргумент в пользу перехода должен исходить из структурированного вывода и задержки, а не из точности.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
