
Perceptron Mk1.5 lleva salida espacial estructurada a los agentes encarnados — y retira a Isaac el mismo día
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 578 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Perceptron Mk1.5 ya está disponible de forma general, y lo interesante no es la tabla de benchmarks — es lo que vuelve en el cuerpo de la respuesta. Si le preguntas a un modelo de visión-lenguaje normal dónde está el montacargas, obtienes una oración. Si le preguntas a Perceptron Mk1.5 sobre un fotograma de video y, junto con su prosa, puedes obtener geometría interpretable por máquina: un punto, un cuadro delimitador, un polígono, un clip, o un <track> elemento que transporta observaciones espaciales con marcas de tiempo a lo largo de todo el archivo. Esa es la diferencia entre un modelo que describe una escena y un modelo que un controlador de robot puede consumir sin una segunda etapa de análisis. Es el sucesor directo de Perceptron Mk1, el primer lanzamiento de la compañía en mayo de 2026, y se lanzó el 25 de septiembre junto con la retirada de los checkpoints Isaac 0.1 y 0.2 que lo precedieron.
Lo que Mk1.5 devuelve realmente
El modelo es un sistema de razonamiento encarnado para agentes físicos. En el lado de la entrada acepta texto, imágenes, vídeo y audio. En el lado de la salida produce texto más anotaciones estructuradas opcionales: puntos, cajas, polígonos, clips y tracks. La salida de seguimiento es la pieza en la que merece la pena detenerse. La documentación de Perceptron describe un <track> bloque cuyas entradas llevan tanto una observación espacial como la marca de tiempo a la que pertenece, de modo que un clip de 60 segundos se devuelve como una secuencia de posiciones de objetos a lo largo del tiempo en lugar de una única estimación promediada de la escena.
Un segundo detalle que importa para cualquiera que integre esto en un pipeline con más de un recurso: Mk1.5 admite un campo asset_idx, por lo que una sola solicitud puede hacer referencia a varias imágenes o videos y tratarlos por separado. Si tu tarea consiste en comparar una foto de referencia con un fotograma de cámara en vivo —un bucle de verificación de defectos, un paso de verificación de ensamblaje—, eso debería ir en una sola llamada, no en dos.
El modelo también admite respuestas restringidas, tanto JSON Schema como regex, que es como se convierte "más o menos" en un esquema que tu código posterior puede validar. La llamada a funciones es compatible con finalizaciones de chat, y el servidor MCP alojado de Perceptron ahora usa por defecto perceptron-mk1.5; pasar model: "perceptron-mk1" explícitamente es la forma de fijar el valor predeterminado anterior.
La ficha técnica, y cuánto cuesta

Vale la pena decir claramente los números que aparecen aquí, porque son modestos en aspectos que un lector quizá no esperaría. La ventana de contexto es de 36,864 tokens —no un millón, ni 256K. La salida máxima es de 8,192 tokens. Este no es un modelo al que le entregues un video de dos horas y un manual de 300 páginas. Está pensado para una tarea de percepción concreta con una respuesta estructurada.
Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.
• Contexto — 36.864 tokens, frente a la ventana de 32K con la que se lanzó Perceptron Mk1
• Salida máxima — 8.192 tokens
• Entrada — texto, imágenes, vídeo, audio (WAV, MP3, FLAC)
• Entrada en caché — $0,0375/M, una cuarta parte de la tarifa estándar de entrada de $0,15/M
• Salida — $1,50/M
• Control de razonamiento — reasoning_effort en alto, medio, bajo, mínimo o ninguno, con valor predeterminado en alto
Esa última fila es un cambio de ruptura disfrazado. Mk1.5 reemplaza el antiguo vision_config.enable_thinking booleano con reasoning_effort, así que cualquier solicitud que hayas creado para el modelo anterior necesita edición en lugar de simplemente reasignarla. El valor predeterminado de high merece atención por una razón distinta: si no configuras el campo, estás comprando la ruta de razonamiento más costosa en cada llamada.
Audio, y video que lleva su propia banda sonora
La entrada de audio es genuinamente nueva aquí. Perceptron la acepta de tres formas: en línea input_audio, un audio_url, o un audio_file_id — con un límite de 16.384 tokens de audio por elemento. La documentación lo sitúa en aproximadamente 21,8 minutos de habla a unos 750 tokens por minuto, lo que supone un presupuesto razonable para una grabación de traspaso de turno o un registro de mantenimiento.
Más inusual es la ruta de vídeo. De forma predeterminada, Mk1.5 lee el vídeo como fotogramas e ignora la pista de audio. Establecer vision_config.enable_audio_in_video: true vuelve a activar la banda sonora, que es la configuración que se desea para cualquier cosa en la que el ruido sea la señal: una máquina que suena mal antes de verse mal, una instrucción hablada emitida fuera de cámara, una alarma en segundo plano durante un recorrido por una instalación. Está desactivada de forma predeterminada, por lo que un vídeo con un fallo audible se analizará en silencio como una película muda a menos que se indique lo contrario.
El panorama de referencia, con las fuentes explicitadas

Todas las cifras que aparecen a continuación provienen del propio anuncio de Perceptron y fueron medidas por Perceptron. No hay ninguna entrada en el índice de Artificial Analysis ni ninguna puntuación de arena para Mk1.5 ni para su predecesor, por lo que no hay ningún dato de terceros en esta comparación con el que contrastarlas. Considera las cifras como una afirmación de un proveedor sobre su propio producto, no como un resultado neutral.
En el seguimiento egocéntrico de manos, la brecha es amplia y específica: Mk1.5 obtiene 0.9433 en hand_box frente a 0.4467 de Gemini 3.1 Pro y 0.6179 del mejor Gemini en la ejecución de Perceptron, que el anuncio identifica como Gemini 3.8 Flash. Ese es el +111% y +53% con el que abre la publicación de lanzamiento, y es el número individual más fuerte del lanzamiento.
En la comprensión general de video egocéntrico, el panorama está mucho más reñido. Perceptron reporta EgoSchema en 80,40 para Mk1.5 frente a 81,20 para Gemini 3.8 Flash —una pérdida de 0,80 puntos—, mientras afirma tener una ventaja del 12 % en el subconjunto EgoSchema-hard, con 63,75. Un modelo que gana de forma decisiva en geometría fina de la mano y pierde por poco en el benchmark de comprensión amplia es un tipo específico de herramienta, y se está vendiendo como tal.
La segmentación de objetos de video alcanza 0.647 center-F1 y 0.628 point-HOTA en Molmo2-Track. Perceptron dice que eso lidera Molmo2-Track, Ref-DAVIS17 y ReasonVOS, mientras queda por detrás de MolmoPoint-8B en MeViS valid_u. Frente a la línea de visión de Qwen, la comparación de seguimiento vale la pena leerla con atención: el anuncio enumera Qwen3-VL-8B con 0.180 center-F1 según su paper, y Qwen3.5-27B con 0.530 y 0.476 — diferentes checkpoints, diferentes configuraciones de evaluación, y un número de paper situado en la misma columna que los medidos. Esa no es una fila comparable de forma directa.
Los resultados de audio se reportan como DailyOmni 74.67, WorldSense 50.32, OmniBench 51.05 y AVHBench 80.56, sin fila de comparación adjunta. En búsqueda multimodal con herramientas habilitadas, Mk1.5 registra 56.0 en LiveVQA-W a partir de una votación por mayoría de cuatro muestras, frente a 53.2 de Gemini 3.8 Flash con fundamentación de Google Search, 51.0 de GPT-6 sol con búsqueda web de OpenAI y 33.2 de GPT-5.2 en línea. Perceptron también afirma una ganancia de 36.1 puntos en MMSearch una vez que se activan las herramientas. La votación por mayoría sobre cuatro muestras es una técnica legítima y favorece la puntuación en relación con una única pasada voraz, por lo que el 56.0 y el 53.2 no se miden de la misma manera.
Latencia, y cómo se midió el 4,7×
La afirmación sobre la velocidad es la que más probabilidades tiene de citarse sin su contexto, así que aquí está el contexto. Perceptron reporta hasta 4,7× más rápido de extremo a extremo a partir de una mediana de tres ejecuciones en una sola H100, usando prompts de LMArena limitados a respuestas de 256 tokens, además de MIA-Bench y Video-MME con Perception Test. El 4,7× corresponde al caso de chat: de 5,2 segundos a 1,1. Las respuestas a preguntas sobre imágenes pasan de 1,7 segundos a 0,51, lo que supone aproximadamente 3,3×. Un video de 60 segundos procesado de ocho en ocho pasa de 19 segundos a 9,1, aproximadamente 2,1×.
Así que el múltiplo del titular es el mejor de los tres, no el caso típico. En una sola H100, con respuestas cortas, la ruta de chat es realmente 4,7× más rápida. En la carga de trabajo de video que realmente ejecutaría un agente corpóreo, está más cerca de 2×. Ambos son buenos números; solo uno de ellos es el titular.
Isaac 0.1 y 0.2 se retiraron el mismo día

El registro de cambios de Mk1.5 contiene una segunda entrada fechada el 25 de septiembre, y es la que tiene verdadero impacto para cualquiera que ya esté en producción. isaac-0.1, isaac-0.2-1b y isaac-0.2-2b-previewestos ID de modelo fueron retirados de la API de Perceptron. Ya no aparecen en GET /v1/models, ya no están en el servidor MCP alojado, y las solicitudes que los mencionan ahora fallan con HTTP 404 model_not_found.
Hay un segundo cambio de comportamiento oculto en la misma entrada que afectará a código que ni siquiera mencionaba los modelos Isaac: los ID de modelo desconocidos ahora devuelven 404 en lugar del 400 anterior. Cualquier lógica de reintento, rama de error o regla de alerta que coincidía con un 400 para un nombre de modelo incorrecto ahora no coincide con nada. La ruta de migración que ofrece Perceptron es perceptron-mk1.5.
Retirar una familia de modelos el mismo día en que lanzas su reemplazo es una historia de migración limpia y, a la vez, dura. Si fijaste Isaac porque funcionaba, tienes una fecha límite que ya pasó.
Dónde ejecutarlo y cómo probarlo sin apostar por ello
La disponibilidad es a través de la propia API del proveedor y varias plataformas de terceros. OrcaRouter no enruta actualmente Perceptron Mk1.5 —el modelo no está en nuestro catálogo—, así que la guía honesta es ir directamente a api.perceptron.inc para ello, que es exactamente para lo que sirven el SDK y la variable de entorno PERCEPTRON_API_KEY.
Lo que de todos modos vale la pena decir, porque se aplica a la decisión y no al modelo: un checkpoint de hace dos días sobre una ventana de 36.864 tokens con un valor predeterminado de razonamiento configurado en high es precisamente el perfil de algo que no deberías poner en una ruta de producción sin haberlo visto antes. Pruébalo primero con tus propios frames y mide dos cosas en concreto: si las salidas estructuradas sobreviven a tus casos límite reales, y cuánto te cuesta reasoning_effort: "high" por llamada frente a bajar a medium o low. Lo segundo es un cambio de una sola línea con un efecto directo en tu factura, y es el experimento más barato de esta versión.
El patrón más amplio en el que esto encaja —los modelos de percepción que devuelven geometría en lugar de adjetivos— es uno que OrcaRouter está diseñado para absorber. Una sola API cubre más de 200 modelos con los precios de lista de los proveedores transferidos con un 0 % de recargo, de modo que un cambio de precio de un proveedor en cualquiera de ellos se refleja en nuestro lado el mismo día, y la conmutación automática por error significa que una llamada de percepción puede recurrir a un segundo modelo en lugar de fallar la solicitud. Si Mk1.5 es lo único que supera tu umbral de precisión, nada de eso te ayuda hoy. Si es un candidato entre varios, realizar la comparación a través de un único endpoint es más barato que configurar un segundo SDK para averiguarlo.
Qué es y qué no es esta versión
Perceptron Mk1.5 es una herramienta especializada con un conjunto de límites inusualmente honesto. Devuelve coordenadas, no solo descripción. Lee audio, incluida la banda sonora de un vídeo si lo activas. Es rápida en respuestas breves de chat. También es un modelo de 36.864 tokens con un límite de salida de 8.192 tokens, con precios de $0,15 y $1,50, cuyos benchmarks fueron realizados en su totalidad por su propio proveedor, y que es vendido por una empresa que retiró la generación anterior en la misma entrada del registro de cambios.
Si tu problema es «encontrar la mano, seguirla a lo largo del clip y decirme dónde fue y cuándo», el número de la caja de la mano es el que hay que probar. Si tu problema es la comprensión amplia de vídeo frente a un generalista de frontera, la línea de EgoSchema —80,40 frente a 81,20— sugiere que estás comprando un especialista en paridad aproximada, y el argumento para cambiar tiene que venir de la salida estructurada y la latencia, no de la precisión.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
