
Perceptron Mk1.5 vs Qwen 3.8: el robot necesita a ambos y ninguno de los dos es un sustituto
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Un robot que tiene que recoger algo necesita dos cosas de un modelo, y ningún modelo por sí solo de este emparejamiento te da ambas. Perceptron Mk1.5 devuelve geometría: dados fotogramas de vídeo, puede devolver un punto, una caja, un polígono o un elemento <track> con marca de tiempo, y su ventana de contexto es de 36.864 tokens. Qwen 3.8 —el nombre que corresponde al núcleo Qwen3.8-2.4T-A95B de pesos abiertos del proveedor— es un razonador de mezcla de expertos de 2,4 billones de parámetros con una ventana nativa de 262K que se extiende hacia un millón, y es solo texto, así que no puede mirar los fotogramas en absoluto. Uno es una capa de percepción que cuesta $0,15 y $1,50 por millón de tokens; el otro es un núcleo de razonamiento que cuesta aproximadamente trece veces más a la entrada y cuatro veces más a la salida, y tiene una puntuación independiente de 40 en el Artificial Analysis Intelligence Index, mientras que el modelo de percepción no tiene ninguna puntuación independiente en ninguna parte.
Puestos uno al lado del otro como productos competidores, cada uno pierde frente al otro en direcciones opuestas y la comparación no produce nada utilizable. Puestos uno al lado del otro como las dos mitades de un mismo pipeline, explican casi todas las decisiones de costo y confiabilidad en una pila encarnada: dónde se interpretan los fotogramas, dónde se elabora el plan y qué ocurre con tu factura cuando la mitad de razonamiento escribe más tokens de los que la tarea necesita.
La separación que hace que este emparejamiento tenga sentido
Perceptron Mk1.5 se lanzó el 25 de septiembre de 2026 como sucesor de Perceptron Mk1, y su función está definida de forma estricta. Acepta texto, imágenes, video y audio, y devuelve texto más anotación estructurada opcional: puntos, cajas delimitadoras, polígonos, clips y pistas. La salida <track> incluye tanto una observación espacial como la marca temporal a la que pertenece, por lo que un clip de 60 segundos se devuelve como posiciones a lo largo del tiempo en lugar de una única estimación promediada. Un campo asset_idx permite que una sola solicitud aborde varias imágenes o videos por separado, que es lo que necesita una comparación de fotograma de referencia frente a fotograma en vivo. Las respuestas restringidas vienen en dos variantes, JSON Schema y regex, y el objetivo de ambas es que la salida sea tipada.
Qwen 3.8 es el tipo opuesto de instrumento. El núcleo de 2,4T es un MoE de grano fino —92 capas, 512 expertos por capa con 10 enrutados más uno compartido, y 69 de esas 92 capas en atención lineal—, que es como una arquitectura tan grande alcanza su contexto largo. Donde es fuerte es en el razonamiento a través de mucho texto: análisis complejos de varios pasos, derivaciones largas y planificación agéntica. Donde es incapaz es en el lado de la entrada. El núcleo abierto es solo texto, y su razonamiento no se puede desactivar: cada respuesta comienza con un bloque de pensamiento, lo quieras o no.
Eso no es una deficiencia en un modelo de razonamiento; es una deficiencia en un modelo de percepción, y Qwen 3.8 no lo es. Pon los dos en secuencia y la forma es obvia: Mk1.5 responde «dónde está el montacargas y cuándo se movió», Qwen 3.8 responde «dado eso, qué debería hacer el brazo». Ninguna de las dos preguntas puede ser respondida por el otro modelo.

Lo que cuesta cada mitad, a las tarifas que realmente se cobran
• Entrada — {{1}}Perceptron Mk1.5{{/1}} {{2}}$0.15 por millón de tokens{{/2}}. {{3}}Qwen 3.8{{/3}} {{4}}$2.00 por millón en la versión alojada que mide el arnés independiente{{/4}}, {{5}}con un descuento de caché del 88% aplicado{{/5}}, {{6}}lo que lleva un acierto de caché a aproximadamente $0.24{{/6}}{{7}}.{{/7}}
• Salida — Mk1.5 1,50 $ por millón. Qwen 3.8 6,00 $ por millón.
• Caché — la entrada en caché de Mk1.5 cuesta $0.0375 por millón, exactamente una cuarta parte de su tarifa estándar de entrada. El descuento de Qwen 3.8 se basa en porcentaje, pero es más profundo, del 88%, por lo que su tarifa en caché es la más barata de las dos en términos absolutos, y su tarifa sin caché es más de diez veces la de Mk1.5.
• Costo por tarea finalizada — aquí es donde se invierte la clasificación. Artificial Analysis sitúa el costo por tarea del Intelligence Index de Qwen 3.8 en $2.16, en el puesto 32 de 115 de su clase y con una calificación de cuatro de cuatro unidades en costo — barato por tarea completada pese a que sus tokens son caros, porque el modelo generó 170M tokens de salida en las ejecuciones del índice frente a un campo que divaga aún más. Mk1.5 no tiene una cifra equivalente publicada por nadie.
• Contexto — 36,864 tokens para Mk1.5 frente a 262K nativos del núcleo Qwen, ampliables hacia un millón con la configuración de servicio adecuada.
• Control de razonamiento — Mk1.5 expone reasoning_effort en high, medium, low, minimal o none, y su valor predeterminado es high. Qwen 3.8 mantiene el pensamiento activado, así que pagas por los tokens de pensamiento en cada llamada.
Lee esa lista dos veces, porque los dos modelos se invierten en coste. Por token, Mk1.5 es drásticamente más barato. Por tarea finalizada en un benchmark independiente, Qwen 3.8 se mide como barato y Mk1.5 no está medido. Esas dos afirmaciones solo son contradictorias si asumes que están ejecutando el mismo trabajo, y no lo están.

Aquí la evidencia apunta en sentido contrario
En la mayoría de las comparaciones de este lote, el lado de pesos abiertos es el que tiene una pila de cifras reportadas por el proveedor, y la API cerrada es la que tiene una página de terceros. Aquí ocurre lo contrario, y vale la pena señalar la inversión con precisión porque cambia lo que se puede y no se puede verificar.
Qwen 3.8 cuenta con una medición independiente. El Artificial Analysis Intelligence Index sitúa el núcleo de 2,4T en 40, clasificado en 5.º lugar de 115 modelos de su clase en el momento de escribir esto, con una velocidad de salida de 39,6 tokens por segundo — 56.º de 115, lo que está en la media y vale la pena saberlo antes de que alguien planifique un bucle interactivo en torno a él. Las revisiones del índice cambian entre instantáneas y la forma honesta de leer cualquiera de estas cifras es tomarlas como orientativas, pero el punto sigue siendo válido: alguien fuera de Alibaba ha ejecutado este modelo y ha publicado una cifra.
El Perceptron Mk1.5 no tiene nada de eso. No existe ninguna entrada en Artificial Analysis ni ninguna puntuación de arena para el Mk1.5 ni para su predecesor, así que todas las cifras de capacidades que existen las produjo Perceptron sobre el propio modelo de Perceptron. Ese conjunto es inusualmente específico, lo cual es un punto a su favor — 0,9433 en egocentric hand_box frente a 0,4467 de Gemini 3.1 Pro en la propia ejecución del proveedor; EgoSchema 80,40 frente a 81,20 del mismo competidor, una derrota ajustada en el benchmark de comprensión general junto con una ventaja declarada del 12 % en el subconjunto más difícil de EgoSchema, con 63,75; 0,647 de centre-F1 y 0,628 de point-HOTA en Molmo2-Track —, pero específico y verificado de forma independiente son propiedades distintas, y solo la segunda te dice qué ocurrirá con tu propio metraje.
Dos advertencias al leer la tabla de Perceptron, ambas aplicables a cualquier cita de ella. La cifra de 56.0 de LiveVQA-W con las herramientas habilitadas proviene de un voto mayoritario de cuatro muestras, mientras que el 53.2 con el que se la compara para Gemini 3.8 Flash con grounding de Google Search no es un voto mayoritario; la técnica es legítima y favorece una puntuación en relación con una única pasada greedy. Y la fila de tracking incluye Qwen3-VL-8B con 0.180 centre-F1 tomado del artículo de ese modelo, situado en la misma columna que números medidos de una familia de checkpoints diferente. Una cifra de un artículo en una columna de mediciones no es una fila equiparable, y es exactamente el tipo de línea que se cita sin su procedencia.
El núcleo 2.4T no es algo que puedas llamar desde nosotros — pero su arquitectura sí.

Esta es la parte de la comparación en la que la respuesta honesta difiere de lo que sugiere la fama del modelo. Qwen 3.8, como nombre, se usa ampliamente para referirse al núcleo abierto, y el núcleo abierto es una descarga, no un endpoint: 2,4 TB de pesos BF16 bajo la licencia personalizada Qwen3.8-Max de Alibaba, publicada en agosto de 2026. Nosotros no lo servimos, y hoy no hay ningún proveedor que lo sirva en nuestro lado de la valla: la entrada del catálogo existe como una página de seguimiento anunciada y todavía no disponible, en lugar de una ruta activa.
Lo que sí servimos es la API insignia, construida sobre la misma arquitectura de 2.4T. Está disponible como qwen/qwen3.8-max a $2.00 y $6.00 por millón de tokens, la tarifa del propio Alibaba transferida directamente, con nada añadido por token, y con la ventana multimodal de 1M de tokens —entrada de texto, imagen y video— y el mismo diseño de atención híbrida que el núcleo abierto. Si tu mitad de razonamiento necesita ver algo, esa es la ruta, y también es la ruta en la que un cambio de tarifa del proveedor recae sobre nuestro lado el mismo día en lugar de en tu próximo ciclo de facturación. Junto a ella servimos al hermano denso de Alibaba qwen/qwen3.8-27b en nuestra propia infraestructura a $0.33 y $2.40 por millón, con una ventana de 262,144 tokens y entrada de texto, imagen y video, para los casos en los que un razonador de 27B es suficiente y el índice 40 del 2.4T es más de lo que la tarea necesita.
Conectar las dos mitades sin un segundo contrato
La razón práctica por la que este emparejamiento importa más que el argumento del benchmark es que un stack encarnado ya son dos modelos, y el costo de integración de un tercero es lo que mata silenciosamente el diseño. Mk1.5 no está en nuestro catálogo, así que llegar a él implica la propia API del proveedor — pip install "perceptron>=0.4.0", clave en PERCEPTRON_API_KEY, endpoint api.perceptron.inc. La mitad de Qwen está a una clave de distancia.
Es en la costura donde una puerta de enlace se gana su lugar. Una regla de enrutamiento que envía cada fotograma con una pregunta al modelo de percepción y cada plan solo de texto al modelo de razonamiento es una línea de configuración cuando ambos están detrás de un endpoint compatible con OpenAI, y la conmutación por error automática significa que un incidente de un proveedor en cualquiera de los lados se degrada a una alternativa de reserva en lugar de un robot bloqueado. Una API que cubre más de 200 modelos con precios de lista repercutidos con un margen del 0 % también es la forma más barata de responder a la pregunta que este artículo no puede: si tu tarea de seguimiento de objetos necesita las coordenadas de Mk1.5 en absoluto, o si un modelo de visión general con una ventana mucho mayor y una puntuación independiente habría sido suficiente. Enrutar una parte del tráfico real entre candidatos y medir en tus propios fotogramas cuesta menos que cualquier estudio de referencia que pudieras encargar.
Qué hacer con esto, concretamente
Si estás incorporando percepción en un sistema físico, Perceptron Mk1.5 es el único modelo de este par que responde en coordenadas, y eso es una capacidad, no una puntuación: pon a prueba la afirmación sobre el recuadro de la mano con tu propio vídeo, configura reasoning_effort de forma deliberada en lugar de aceptar el valor alto predeterminado, y presupuesta la ventana de 36.864 tokens como una restricción estricta y no como una flexible. Si estás construyendo la capa de razonamiento por encima de él, Qwen 3.8 se mide donde Mk1.5 no, y su coste por tarea completada es la cifra con la que hay que planificar, en lugar del titular de $2.00, con la advertencia de que su razonamiento no se puede desactivar, así que una tarea que no necesita una cadena de razonamiento está pagando por una de todos modos.
Los equipos que se equivocan con esto son los que intentan que un único modelo haga las dos cosas. Un especialista en percepción de 36.864 tokens no retendrá el historial operativo, y un razonador de 2,4T solo de texto nunca verá el fotograma. El emparejamiento no es una solución intermedia entre dos productos. Es la verdadera división del trabajo, y la pregunta útil es solo a qué lado de ella pertenece cada una de tus decisiones.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
