
Bonsai en gafas inteligentes: un VLM de 2B y 1 bit que se ejecuta en Snapdragon AR1 Gen 1
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
El número que decide para qué sirve realmente este anuncio no es 4x y no es 2x. Es 1.024 —la longitud de contexto del modelo que PrismML puso en un par de gafas inteligentes en Snapdragon Summit el 23 de septiembre de 2026. El modelo de visión-lenguaje Bonsai 2B de 1 bit, un sistema de 2 mil millones de parámetros construido sobre Bonsai 1.7B, se ejecuta localmente en gafas inteligentes con IA impulsadas por la plataforma Snapdragon AR1 Gen 1, y las cifras con las que PrismML abre son memoria y velocidad: 0,43 GB de pesos de LLM frente a 1,66 GB para el correspondiente modelo 1.7B de 4 bits, una reducción de 3,83x, y 15,36 tokens por segundo frente a 7,44, una mejora de 2,06x. Ambas cifras son del propio proveedor, ambas se midieron en una plataforma de prueba de 4 GB y ambas se miden frente a un modelo Qwen 3 1.7B de 4 bits. No se miden frente a ningún Bonsai 27B, y no se miden frente a nada alojado. Leerlas como una afirmación sobre la calidad de Bonsai sería un error; leerlas como una afirmación sobre lo que cabe en un presupuesto de memoria de la clase de unas gafas es lo correcto.
Lo que se anunció, en un solo lugar
El anuncio de PrismML —con fecha de Pasadena y vinculado al Snapdragon Summit de Qualcomm— coloca un modelo de visión-lenguaje de 2 mil millones de parámetros en la plataforma de gafas AR1 Gen 1. La división es un modelo de lenguaje de 1,7B y 1 bit más un codificador visual de 0,3B y 4 bits, con una longitud de contexto de 1.024 tokens. Está construido sobre Bonsai 1.7B de PrismML, por lo que es el extremo pequeño de la familia Bonsai en lugar de una nueva arquitectura, y fue compilado para la NPU Hexagon de Qualcomm usando un SDK QNN interno con soporte de kernels de 1 bit.
El titular afirma, según lo declarado por el proveedor:
• Permite alojar un modelo con 4 veces más parámetros dentro de las mismas restricciones de memoria en algunos factores de forma de gafas.
• Ofrece aproximadamente la inteligencia equivalente del mismo modelo con precisión de 4 bits, utilizando alrededor de 4 veces menos memoria.
• Genera tokens a más del doble de velocidad.
Esas tres frases son el comunicado. Las mediciones específicas detrás de las afirmaciones sobre memoria y velocidad son 0.43 GB frente a 1.66 GB y 15.36 frente a 7.44 tokens por segundo, ambas en una plataforma configurada con 4 GB de memoria. El AR1 Gen 1 en sí se cita con un pico de 6 TOPS y 2,304 MACs por ciclo — una cifra para la plataforma, no para la inferencia de modelos de lenguaje, una distinción que los propios números del anuncio dejan clara al citar los tokens por segundo por separado.

El 4x es una afirmación de memoria, y la línea base es un modelo diferente
Esta es la parte que merece la pena tratar con calma, porque «4x» es el tipo de cifra que viaja más lejos que la frase de la que salió. Todas las comparaciones que PrismML publicó para el modelo de las gafas son contra una cuantización de 4 bits de Qwen 3 1.7B —la misma clase de parámetros, el mismo trabajo, una cuantización distinta—. Es una comparación legítima y útil: es la comparación a la que se enfrenta de verdad un fabricante OEM de gafas, donde la cuestión es si una ruta de 1 bit recupera suficiente memoria como para que valga la pena el trabajo de kernel. No es una comparación contra una versión de 4 bits de Bonsai, y no es una comparación contra un Bonsai más grande ejecutándose en otro sitio.
La nota al pie sobre los benchmarks adjunta al anuncio es igual de cuidadosa. PrismML evaluó el LLM de 1 bit Bonsai 1.7B frente al modelo de 4 bits Qwen 3 1.7B en septiembre de 2026 en BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K y GPQA Diamond, y el resultado reportado es que las dos configuraciones «obtuvieron resultados comparables en los benchmarks». Comparativos, no superiores. En el anuncio no hay puntuaciones por benchmark ni reproducción independiente de nada de ello, lo cual es normal para una versión edge de la semana del lanzamiento y es exactamente la razón por la que las cifras deberían presentarse como reportadas por el proveedor hasta que alguien ajeno a PrismML las ejecute.
1,024 tokens es la especificación que da forma al producto
Un modelo de visión-lenguaje en gafas es una carga de trabajo distinta de la de un modelo de visión-lenguaje en una ventana de chat, y la longitud del contexto es donde eso se nota. Con 1.024 tokens, el modelo puede albergar una instrucción breve más lo que una cámara está viendo en ese momento. No puede albergar un historial de conversación, un documento ni una larga cadena de turnos anteriores. Eso no es un defecto del lanzamiento —es la restricción que hizo posible el lanzamiento, porque la caché KV y las activaciones tienen que convivir en los mismos 4 GB que los pesos, y un modelo de clase 27B con un contexto de 262K tokens necesita órdenes de magnitud más de espacio para ese estado.
Así que la descripción honesta de lo que se lanzó es la de un asistente capaz de contexto corto que funciona por completo en el dispositivo. Las tareas con forma de gafas —reconocer esto, leer aquello, traducir el cartel que tengo delante, responder una pregunta sobre lo que estoy viendo— caben en 1.024 tokens. Cualquier cosa que necesite recordar los últimos diez minutos no cabe, y ninguna cantidad de compresión de 1 bit cambia eso, porque el límite es el estado, no los pesos.
Qué debería aprender de esto el ecosistema edge
La ingeniería genuinamente nueva en este anuncio no es el modelo. Es la ruta del kernel: un LLM de 1 bit compilado para la NPU Hexagon mediante un QNN SDK con soporte para kernels de 1 bit. Los pesos de baja precisión llevan un tiempo siendo ejecutables en CPU y GPU, y los propios lanzamientos de Bonsai 27B de PrismML lo demostraron en hardware de Apple silicon y NVIDIA. Conseguir que los kernels de pesos binarios se ejecuten en una NPU móvil es un problema distinto, porque la ruta de datos del acelerador, su formato de empaquetado y su planificación tienen que adaptarse a una representación que no es un tipo float en absoluto.
Si ese camino se generaliza más allá de este único modelo —y el lenguaje del SDK sugiere que PrismML tiene la intención de que así sea—, entonces la consecuencia interesante es que la familia de 1 bit deja de ser una historia de portátiles y teléfonos y se convierte en una historia de dispositivos siempre activos. La plataforma de 4 GB del anuncio es el techo actual. Cualquier cosa que reduzca la huella de los pesos con una calidad fija eleva el tamaño del modelo que cabe por debajo de ese techo.

La afirmación de que se ejecuta en el dispositivo merece una salvedad.
La inferencia multimodal totalmente local en un par de gafas es una afirmación contundente, y vale la pena separar lo que se demuestra de lo que se implica. El AR1 Gen 1 es una plataforma de gafas diseñada para detección y audio siempre activos; el propio planteamiento de Qualcomm para los modelos de lenguaje en el dispositivo ha sido generalmente híbrido, con el dispositivo encargándose de lo que puede y pasando el resto a un teléfono vinculado o a la nube. La primera demostración pública de Qualcomm de un modelo de lenguaje pequeño en el dispositivo estuvo vinculada a la plataforma AR1+ Gen 1, no a AR1 Gen 1. Ninguno de los dos puntos contradice el anuncio de PrismML —el anuncio dice que el modelo se ejecuta localmente en el AR1 Gen 1, y las propias cifras de rendimiento y memoria del fabricante son coherentes con un modelo pequeño haciendo exactamente eso—, pero sí significan que el producto práctico construido sobre esto será casi con certeza un nivel local con una vía de escalado, no un dispositivo que nunca se comunica con nada más.
Esa es la arquitectura correcta de todos modos. Un modelo local de 1.024 tokens es muy bueno con las solicitudes que caben en 1.024 tokens y no puede responder las que no caben.
Dónde corresponde la ruta de escalado
Para cualquiera que construya sobre un lanzamiento como este, la cuestión de diseño no es si el modelo de gafas es bueno — es qué ocurre con la solicitud que no puede atender. Si se responde en el código de la aplicación, se convierte en un montón de casos especiales que hay que reescribir cada vez que el modelo en el dispositivo cambia de tamaño o de contexto. Si se responde como una política de enrutamiento, se convierte en una sola regla: las solicitudes que superan el presupuesto de contexto del nivel local, o que requieren herramientas o razonamiento que el nivel local no tiene, escalan a un modelo alojado. Esa política es el tipo de cosa para la que existe OrcaRouter — un endpoint frente a más de 200 modelos alojados, con failover y la política expresada en la configuración en lugar de en el cliente. Bonsai en sí no se enruta aquí; es una descarga que ejecutas en tu propio hardware. Lo que cubre la capa de enrutamiento es el límite que hay por encima de ella, y ese límite es donde un despliegue de gafas gastará la mayor parte de su tiempo de ingeniería.

Qué ver a continuación
Tres cosas harían que esto pasara de ser un anuncio a una plataforma. Un desglose por benchmark detrás de la línea de «resultados comparativos», para que la contrapartida frente a 4 bits sea visible en lugar de quedar resumida. Una ventana de contexto mayor en la misma ruta de NPU, que es un problema de memoria de estado en lugar de un problema de pesos y, por tanto, el más difícil de los dos. Y una evaluación independiente del LLM de 1 bit y 1,7B frente a su contraparte de 4 bits, porque actualmente todas las cifras de este lanzamiento provienen de quien lo construyó.
Hasta entonces, el resumen preciso es acotado y útil: un modelo multimodal de 2.000 millones de parámetros ahora se ejecuta en un dispositivo de tipo gafas con 0,43 GB de pesos de lenguaje, a aproximadamente el doble de velocidad y aproximadamente un cuarto de la memoria del equivalente de 4 bits, con un presupuesto de contexto de 1.024 tokens. Eso es un paso real para la inferencia en el dispositivo y un paso pequeño para la capacidad del modelo, y las dos no son la misma afirmación.
