
Perceptron Mk1.5 vs Gemma 4 12B: Uno responde con frases, el otro responde con coordenadas
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Este es el número que debería detenerte primero: Perceptron Mk1.5 es un modelo creado para video y agentes encarnados, y su ventana de contexto es de 36.864 tokens. Gemma 4 12B es un generalista de 12B con pesos abiertos y una ventana de 256K. En el eje que la mayoría de la gente usa para comparar modelos de visión —cuánto metraje puedo darle—, el modelo más pequeño, cerrado y de propósito específico pierde por un factor de siete frente al descargable. Esa inversión no es un defecto de ninguno de los dos productos. Te dice para qué se creó realmente cada uno, y las dos tareas están más separadas de lo que sugiere la línea compartida de "entrada multimodal" en sus fichas técnicas.
Perceptron Mk1.5 es el modelo de razonamiento encarnado que Perceptron lanzó el 25 de septiembre de 2026, el sucesor de Perceptron Mk1 de mayo, que recibe texto, imágenes, video y audio y devuelve texto más geometría analizable por máquina. Gemma 4 12B es el modelo multimodal de pesos abiertos y sin codificador de 11,96B de Google DeepMind, publicado el 3 de junio de 2026 bajo Apache 2.0, que recibe texto, imagen, audio y video y devuelve texto. Ambos son baratos, ambos leen una señal de cámara, y solo uno de ellos le entregará a tu controlador una caja delimitadora sin una segunda etapa de análisis. La elección entre ellos es una elección sobre qué tiene que volver.
Qué está diseñado para devolver cada uno
Pon los dos uno al lado del otro y la diferencia no es la precisión. Es el tipo de salida. Pregúntale a Gemma 4 12B dónde está la carretilla elevadora y obtienes una frase, y en la mayoría de las aplicaciones esa frase es el producto: una descripción, un resumen, una respuesta a una pregunta sobre una foto. Pregúntale a Perceptron Mk1.5 y, junto con su prosa, puedes pedir un punto, un cuadro delimitador, un polígono, un clip o un <track> elemento que lleva una observación espacial y la marca de tiempo a la que pertenece. Un clip de 60 segundos se devuelve como una secuencia de posiciones a lo largo del tiempo en lugar de una única conjetura promediada sobre la escena.
Ese es todo el argumento a favor de que Mk1.5 exista, y merece la pena ser precisos sobre por qué importa. Una descripción de una escena es un artefacto terminado. Una coordenada es una entrada para otra cosa: un planificador de agarre, una comprobación de defectos, un registro de auditoría con marcas de tiempo. Si tu código posterior tiene que leer prosa e inferir la posición a partir de ella, has construido un analizador entre dos modelos, y ese analizador pasa a ser tu superficie de fallo. Lo que propone Mk1.5 es que la geometría llegue tipada.
El contraargumento de Gemma 4 12B no es que también haga esto. Es que puedes tener los pesos. Apache 2.0, 11,96 B de parámetros, publicados en variantes preentrenadas y ajustadas a instrucciones, ejecutándose en hardware que controlas, con una tarjeta de evaluación publicada y un índice de terceros que lo respalda. Son tipos de activos distintos, y ninguno sustituye al otro.
Donde los dos realmente coinciden
Menos lugares de los que implica la etiqueta "multimodal 2026", pero el terreno común es real y vale la pena enunciarlo con precisión porque es donde suele empezar la lista de verificación de un comprador.
• Modalidad de entrada: ambos son genuinamente de cuatro modalidades. Perceptron Mk1.5 acepta texto, imágenes, video y audio (WAV, MP3, FLAC). Gemma 4 12B acepta texto, imagen, audio y video mediante una única ruta unificada sin codificador.
• Modalidad de salida — ninguna genera audio ni imágenes. Ambas producen solo texto. La diferencia es que el texto de Mk1.5 puede llevar anotaciones espaciales estructuradas, mientras que el de Gemma 4 12B no.
• Llamada a funciones: ambos la admiten. Mk1.5 expone la llamada a funciones en las finalizaciones de chat y acepta respuestas restringidas mediante JSON Schema y expresiones regulares. Gemma 4 12B incluye la llamada a funciones en su forma ajustada por instrucciones y modo de pensamiento configurable.
• Control de razonamiento — Mk1.5 reemplaza el antiguo vision_config.enable_thinking booleano con un reasoning_effort campo que acepta high, medium, low, minimal o none, y su valor predeterminado es high. Gemma 4 12B expone variantes con razonamiento y sin razonamiento que obtienen puntuaciones distintas en el mismo harness porque realizan diferentes cantidades de trabajo.
• Contexto — 36.864 tokens para Mk1.5 frente a 256K para Gemma 4 12B. Esta es la brecha más amplia de la lista y la próxima sección trata de ello.
• Pesos y licencia — Mk1.5 es un modelo alojado cerrado con un SDK, no una descarga. Gemma 4 12B es Apache 2.0, por lo que el precio del alojamiento es una opción entre varias en lugar de la única forma de ejecutarlo.

La ventana de 36K es una decisión de diseño, no una deficiencia
Un modelo encarnado con una ventana de 36.864 tokens suena a un error hasta que se observa lo que Perceptron construyó junto a él. Mk1.5 acepta un asset_idx como campo, por lo que una sola solicitud puede hacer referencia a varias imágenes o videos y dirigirse a cada una por separado. Limita el audio a 16.384 tokens por elemento —la documentación de Perceptron lo sitúa en aproximadamente 21,8 minutos de habla a unos 750 tokens por minuto—. Y la razón por la que la ventana puede mantenerse pequeña es que la tarea es acotada: encontrar y rastrear cosas específicas en los fotogramas, responder sobre ellas, detenerse.
Eso es una forma de trabajo distinta de la de Gemma 4 12B. Una ventana de 256K sirve para contener un documento, un repositorio o una conversación larga y razonar a lo largo de todo ello. La ventana de Mk1.5 es un presupuesto para una única tarea de percepción con una respuesta estructurada, y Perceptron la ha dimensionado para esa tarea en lugar de para una tabla de clasificación. Donde la diferencia muerde de verdad es en el momento en que tu tarea es «mira todo este vídeo de inspección de 40 minutos y cuéntamelo todo»: una ventana de 36K no podrá contener la transcripción, los fotogramas y la respuesta a la vez, y la ventana de Gemma 4 12B junto con su puntuación de recuperación de contexto largo es el instrumento honesto para eso.
La segunda mitad de esa disyuntiva es la velocidad. Perceptron reporta hasta 4,7× más rápido de extremo a extremo a partir de una mediana de tres ejecuciones en una única H100, con la salvedad de que 4,7× es la mejor de tres mediciones y no el caso típico: las respuestas de chat pasaron de 5,2 segundos a 1,1, la QA de imágenes pasó de 1,7 segundos a 0,51 (aproximadamente 3,3×), y un video de 60 segundos con concurrencia de ocho pasó de 19 segundos a 9,1 (aproximadamente 2,1×). En la carga de trabajo de video que un agente encarnado realmente ejecuta, el multiplicador honesto es de aproximadamente dos.
Uno de estos ha sido medido por alguien más.

Esta es la asimetría más clara en el enfrentamiento y no está ni cerca.
Gemma 4 12B tiene una ficha de evaluación del proveedor y un índice de terceros. La ficha contiene cifras reportadas por el proveedor —MMLU Pro 77,2; GPQA Diamond 78,8; MMMU Pro 69,1; LiveCodeBench v6 72,0; AIME 2026 sin herramientas 77,5; Tau2 promediado en tres ejecuciones 69,0— y un punto débil honesto en MRCR v2 8-needle a 128k, que da 43,4 y es la fila que hay que leer antes de asumir que una ventana de 256K se comporta como una en el extremo lejano. A esto se suma una medición independiente: Artificial Analysis sitúa a Gemma 4 12B en un Intelligence Index de 14, en el puesto 22.º de 142 modelos de su clase, a 113,7 tokens de salida por segundo —20.º de 142 en velocidad—, con un precio de lista de $0,10 por millón de tokens de entrada y $0,30 por millón de tokens de salida.
Perceptron Mk1.5 no tiene nada de eso. No hay entrada en el índice de Artificial Analysis ni puntuación de arena para Mk1.5 o para Mk1, así que cada cifra de capacidad que existe para este modelo fue producida por la empresa que lo vende. Ese conjunto es específico en lugar de vago, y vale la pena leerlo: 0.9433 en egocéntrico hand_box frente a 0.4467 para Gemini 3.1 Pro y 0.6179 para el mejor Gemini en la propia ejecución de Perceptron; EgoSchema 80.40 frente a 81.20 para el mismo competidor, una pérdida de 0.80 puntos en el benchmark de comprensión amplia con una ventaja declarada del 12% en el subconjunto EgoSchema-hard con 63.75; 0.647 centre-F1 y 0.628 point-HOTA en Molmo2-Track; DailyOmni 74.67 y AVHBench 80.56 en el lado de audio. El patrón en esos números — decisivo en geometría de grano fino, más o menos a la par o ligeramente por detrás en comprensión general de vídeo — es coherente y coincide con la historia del producto. Pero el benchmark de un proveedor sobre su propio modelo es una afirmación, y los dos modelos de este artículo no se describen con el mismo tipo de evidencia.
Una fila de esa tabla merece una advertencia específica. La comparación de seguimiento de Perceptron lista Qwen3-VL-8B con un centre-F1 de 0.180, tomado del artículo de ese modelo, junto a cifras medidas para su propio modelo, y lo empareja con Qwen3.5-27B en 0.530 y 0.476 entre distintos checkpoints y configuraciones de evaluación. Una cifra de artículo en una columna de cifras medidas no es una fila comparable en igualdad de condiciones, y es el tipo de línea que se cita sin su procedencia. La misma cautela se aplica a la inversa a las publicaciones de 56.0 para Mk1.5 en LiveVQA-W con herramientas habilitadas: esa cifra proviene de un voto mayoritario de cuatro muestras, mientras que la 53.2 con la que se compara para Gemini 3.8 Flash con búsqueda fundamentada no, y el voto mayoritario sobre cuatro muestras es una técnica legítima que favorece una puntuación en relación con una única pasada codiciosa.
Costeo de una carga de trabajo real
Las tarifas están más cerca entre sí que los productos. Perceptron Mk1.5 cuesta $0.15 por millón de tokens de entrada y $1.50 por millón de salida, con la entrada en caché a $0.0375 — exactamente un cuarto de la tarifa estándar de entrada, y más barato por token en caché que los $0.10 de entrada estándar de Gemma 4 12B. Gemma 4 12B figura a $0.10 y $0.30 en el harness de terceros que lo mide, y es Apache 2.0, así que el autoalojamiento elimina por completo el costo marginal si tienes el hardware.
Dos cosas complican una comparación directa y apuntan en direcciones opuestas. Primero, el reasoning_effort de Mk1.5 tiene por defecto high, lo que significa que cada llamada que no configures está comprando la ruta de razonamiento más costosa que ofrece el modelo; bajar a medium o low es un cambio de una línea con un efecto directo en la factura, y es el experimento más barato del lanzamiento. Segundo, Gemma 4 12B te permite desactivar por completo el paso de pensamiento, lo que cambia tanto la factura como la latencia, y en una tarea fija como la clasificación a nivel de fotograma, una pasada sin razonamiento suele ser la correcta.
Hagamos las cuentas con algo real: un pipeline de visión que procesa 40.000 fotogramas al día con aproximadamente mil tokens de entrada de imagen cada uno. Eso son 40 millones de tokens de entrada al día. Con la tarifa de entrada de 0,15 $ de Mk1.5, y con fotogramas en caché cuando se repite la misma escena, estás hablando de unos pocos dólares al día para la entrada, barato según cualquier estándar. Gemma 4 12B, con 0,10 $ de entrada, es todavía más barato, y gratuito en el margen si lo autoalojas. Ninguno de los dos modelos es caro. La decisión aquí no es una decisión de presupuesto; es la cuestión de si necesitas coordenadas, una ventana de 256K, o ambas cosas.
Llamar a ambos sin una segunda integración

El obstáculo práctico para ejecutar esta comparación no es el precio — es que Perceptron Mk1.5 y Gemma 4 12B no están en el mismo catálogo. Ninguno de los dos está enrutado en OrcaRouter hoy: las entradas de Gemma 4 que servimos son las variantes 31B Instruct y 26B-A4B, y Mk1.5 no tiene ninguna ruta, así que la recomendación honesta es acceder a Mk1.5 a través de la propia API del proveedor en api.perceptron.inc — pip install "perceptron>=0.4.0", la clave en PERCEPTRON_API_KEY — y a Gemma 4 12B, ya sea a través de un host de terceros o sirviendo tú mismo los pesos Apache-2.0.
Aquello para lo que sirve de verdad una capa de enrutamiento en esta situación es la decisión que todavía no has tomado. Si la salida estructurada de Mk1.5 es lo que necesita tu aplicación y la ventana de Gemma 4 12B es lo que necesita tu otra carga de trabajo, esas son dos integraciones y dos dominios de fallo; ponerlas detrás de un único endpoint compatible con OpenAI con conmutación por error automática hace que un contratiempo del proveedor en cualquiera de los dos lados se degrade a un fallback en vez de a un trabajo fallido, y una regla de enrutamiento puede enviar el trabajo de geometría y el trabajo de contexto largo a modelos distintos sin que tu aplicación sepa cuál es cuál. Cuando un proveedor cambia su tarifa, un enrutador de paso factura el precio de lista del proveedor sin nada añadido por token, de modo que el cambio se aplica el mismo día en lugar de a tu próximo ciclo de facturación. El DSL de enrutamiento también es la forma en que plantearías una comparación — una parte del tráfico real a cada modelo, medida con tus propios frames, en lugar de un argumento de benchmark.
¿Cuál quieres realmente?
Elige Perceptron Mk1.5 si la respuesta tiene que ser legible por máquina. Si estás conduciendo algo, o registrando algo donde la posición y el tiempo son lo importante, ninguna cantidad de ventana de contexto adicional sustituye a una coordenada con tipo, y Mk1.5 es el único modelo de este par que produce una. Entra con los ojos abiertos en tres cosas: el presupuesto de 36.864 tokens, el alto valor predeterminado de razonamiento, y el hecho de que cada cifra de capacidad asociada a él es la del propio proveedor.
La forma más barata de resolverlo es enrutar una parte del tráfico real a cada uno y medir sobre tus propias tramas; ambos están detrás de un endpoint compatible con OpenAI en OrcaRouter, que es lo que hace que una prueba comparativa sea una línea de configuración en lugar de una segunda integración.
Toma Gemma 4 12B si necesitas retener mucho material, si necesitas los pesos, o si necesitas justificar la elección ante alguien que no acepta a ciegas los benchmarks de los proveedores. Tiene un índice independiente, una tarjeta de evaluación publicada, licencia Apache 2.0 y una ventana siete veces más grande — y describirá una escena en lugar de medirla. Esa última cláusula es toda la decisión. Uno de estos modelos es un generalista que puedes poseer y auditar; el otro es un especialista que alquilas porque devuelve geometría, y el hecho de que el especialista tenga la ventana más pequeña y ninguna puntuación de terceros no es una contradicción. Es lo que parece una herramienta construida de forma estrecha desde fuera.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
