
Bonsai vs Ternary Bonsai 2 27B: Dos apuestas de bajo bit, dos reglas distintas
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Coloca el modelo de visión-lenguaje Bonsai 2B de 1 bit junto a Ternary Bonsai 2 27B, y la comparación obvia —2 mil millones de parámetros frente a 27 mil millones, 0,43 GB de pesos de lenguaje frente a 5,93 GB— es lo menos interesante del par. Lo interesante es que los dos modelos, del mismo proveedor y del mismo programa de compresión, no reportan su calidad de la misma manera. Ternary Bonsai 2 27B reporta retención: conserva más del 98 % del rendimiento agregado en pruebas de referencia de su contraparte de precisión completa, medido frente a sí mismo. El Bonsai 2B de 1 bit reporta una comparación: logró "resultados comparativos en pruebas de referencia" frente a un modelo Qwen 3 1.7B con cuantización de 4 bits, medidos frente al modelo de otro con una precisión diferente. Una es una afirmación sobre cuánto se perdió. La otra es una afirmación sobre cómo se compara. Ninguna es una afirmación sobre lo bueno que es cada uno de los dos modelos en términos absolutos, y las dos no pueden leerse en la misma escala.
Esa distinción importa más que el recuento de parámetros, porque determina lo que realmente puedes concluir de las cifras del proveedor, y, a juzgar por la evidencia publicada hasta ahora, la respuesta honesta es menos de lo que sugieren las cifras principales.
Dos afirmaciones de calidad, dos varas de medir
Ternary Bonsai 2 27B, lanzado el 17 de septiembre de 2026, es una reconstrucción ternaria {−1, 0, +1} de Qwen3.8-27B a 1,76 bits efectivos por peso, y la cifra que PrismML destaca es que conserva más del 98 % del rendimiento agregado en benchmarks del modelo de precisión completa. Esa es una afirmación de retención, y las afirmaciones de retención son autorreferenciales por construcción: te dicen cuánto del original sobrevivió a la compresión, no dónde se situaba el original. Un modelo que conserva el 98 % de una línea base mediocre sigue siendo un modelo mediocre, y Qwen3.8-27B no es mediocre — pero el número por sí solo no lo dice, y no se puede comparar entre modelos base.
El modelo de visión-lenguaje Bonsai 2B de 1 bit, anunciado el 23 de septiembre de 2026 para la plataforma de gafas Snapdragon AR1 Gen 1, es un modelo de lenguaje de 1.7B de 1 bit más un codificador de visión de 0.3B de 4 bits. Su declaración de calidad publicada es de naturaleza distinta: PrismML lo evaluó frente a un modelo Qwen 3 1.7B con cuantización de 4 bits en BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K y GPQA Diamond, e informó que las dos configuraciones lograron resultados comparables. Eso es una afirmación de paridad frente a una referencia externa. Dice que la compresión no supuso un coste evidente frente a la ruta de 4 bits que habrías utilizado de otro modo —lo cual es exactamente la pregunta correcta para un lanzamiento de clase dispositivo, y una afirmación mucho más débil que "este modelo es bueno".
Así que no hay ninguna interpretación según la cual el 98,2 % supere a «comparativo» ni a la inversa. Son respuestas a dos preguntas distintas, formuladas frente a dos referencias distintas, en dos suites diferentes, por el mismo proveedor. Cualquiera que clasifique estos dos modelos con base en esas dos frases está clasificando las frases.
Los modelos base provienen de diferentes lugares
Hay una segunda diferencia estructural, y es la que importará durante el próximo año. Ternary Bonsai 2 27B es una recompresión de un modelo externo — Qwen3.8-27B de Alibaba. Su techo de calidad lo establece el calendario de lanzamientos de otra persona, y su cadencia generacional sigue la de Qwen en lugar de la de PrismML. Cuando Qwen lance un nuevo 27B, la línea Bonsai 27B obtendrá una nueva entrada, y la cifra de retención se recalculará con respecto a una nueva línea de base.
El Bonsai 2B de 1 bit se basa en el propio Bonsai 1.7B de PrismML. Su techo se fija internamente, su cadencia de actualización la elige PrismML, y sus mejoras provienen de la receta de compresión y de la ruta del kernel en lugar de un cambio de modelo upstream. Eso es un tipo de activo distinto: más lento a la hora de mejorar en capacidad bruta, totalmente bajo el control del proveedor y —como muestra el lanzamiento de las gafas— capaz de ajustarse para un acelerador específico de una manera que una recompresión general no puede.
Ambas son estrategias legítimas. No son intercambiables, y la que necesitas depende de si tu hoja de ruta está anclada a la de Qwen o a la del dispositivo.

El contraste de especificación, una línea a la vez
• Parámetros — un LLM de 1,7B y 1 bit más un codificador de visión de 0,3B y 4 bits en el modelo de gafas, frente a un modelo de clase 27B derivado de Qwen3.8-27B en Ternary Bonsai 2 27B.
• Representación — binaria {−1, +1} con escalado por grupos FP16 en el modelo de gafas, frente a ternaria {−1, 0, +1} con el mismo escalado a 1,76 bits efectivos por peso en el 27B.
• Pesos del modelo de lenguaje — 0,43 GB para el de 1 bit y 1,7B, frente a 5,93 GB para el empaquetado PTQ1_0 de Ternary Bonsai 2 27B, con un empaquetado PQ2_0 de 7,25 GB también disponible.
• Contexto — 1.024 tokens en el modelo de gafas, frente a un contexto completo de 262.000 tokens en Ternary Bonsai 2 27B.
• Acelerador — la NPU Qualcomm Hexagon mediante un SDK QNN con soporte de kernels de 1 bit, frente a Apple silicon vía MLX y NVIDIA vía CUDA.
• Afirmación de calidad — «resultados comparativos de benchmark» frente a un Qwen 3 1.7B de 4 bits, frente a una retención de «más del 98 %» de la línea base Qwen3.8-27B de precisión completa. Ambos reportados por el proveedor, ninguno reproducido de forma independiente, medidos en conjuntos de pruebas diferentes.
• Entorno de ejecución — una cadena de herramientas de NPU de Qualcomm para el modelo de las gafas, frente al propio fork de llama.cpp de PrismML y un contenedor MLX para el 27B, ninguno de los cuales es compatible con llama.cpp estándar.

Qué compra la apuesta de bits bajos en cada caso
La filosofía de compresión es la misma en ambos modelos y merece la pena nombrarla, porque es la tesis real de la familia: la representación de bajos bits se ejecuta de extremo a extremo —embeddings, atención, MLPs y la cabeza LM— con escalado por grupos en FP16 y sin vías de escape de mayor precisión. Ninguno de los dos modelos mantiene una red de seguridad en coma flotante para las partes que son difíciles de cuantizar. Esa es una posición más agresiva que la que adopta la mayoría de los trabajos de cuantización, y es lo que hace posible que haya 1,76 bits por peso y pesos de 0,43 GB.
Dónde da sus frutos la apuesta varía. En Ternary Bonsai 2 27B, la recompensa es capacidad por byte en hardware que ya tienes: un modelo de clase 27B en 5.93 GB, ejecutándose en un portátil o un teléfono, al 98 % de su rendimiento base. En el 1-bit Bonsai 2B, la recompensa es la existencia en una clase de dispositivo que no tenía opción: un modelo multimodal en 0.43 GB de pesos de lenguaje, en una NPU, a 15.36 tokens por segundo. El primero es una versión mejor de algo que ya funcionaba. El segundo es algo que antes no funcionaba.
Dónde se sitúa el límite del nivel
Estos dos no son alternativas, y tratarlos como un enfrentamiento directo pasa por alto la forma de despliegue hacia la que apuntan ambos lanzamientos. Un producto de gafas o wearable ejecuta el 2B localmente porque nada más encaja. Un producto de portátil o teléfono ejecuta el 27B porque puede. En el momento en que un producto abarca ambos —una app de teléfono emparejada con gafas, una app de portátil con un asistente en el dispositivo—, la pregunta deja de ser qué modelo y pasa a ser qué solicitudes tiene permitido responder cada nivel.
Ese límite vale la pena ponerlo en la configuración en lugar de en el código de la aplicación, porque ambos niveles se moverán. La línea de 27B se mueve cuando Qwen lanza una versión, la línea de 2B se mueve cuando PrismML cambia la receta, y una regla codificada de forma rígida sobre la longitud de contexto o la capacidad se rompe con ambos eventos. Una política de enrutamiento que escala solicitudes más allá del presupuesto del nivel local a un modelo alojado sobrevive a ambos cambios; el nivel local sigue siendo un nivel entre varios en lugar de una suposición que atraviesa todo el cliente. OrcaRouter es la capa que realiza esa escalación — un endpoint para más de 200 modelos alojados, con conmutación por error incluida, con la política expresada como configuración. Ninguno de los Bonsai se enruta aquí; ambos son descargas locales. Lo que está aquí es el nivel superior a ellos, y con un modelo local de 1,024 tokens, ese nivel hace la mayor parte del trabajo.

¿Qué lo resolvería?
Tres mediciones convertirían este par de dos afirmaciones de marketing en una comparación. Un desglose por benchmark detrás de la línea de "resultados comparativos", para que el compromiso frente a 4 bits sea visible en lugar de quedar resumido. Una cifra de retención para el Bonsai 2B de 1 bit frente a su propia línea base de precisión completa —la medición que PrismML usa para la línea de 27B y que no publicó aquí—. Y una evaluación independiente de cualquiera de los dos modelos, ya que actualmente todas las cifras de ambos lanzamientos provienen del proveedor.
Hasta que exista uno de esos, la posición defendible es la que los números realmente respaldan: Ternary Bonsai 2 27B es el mejor modelo por un amplio margen, y el Bonsai 2B de 1 bit es el único de los dos que se ejecuta en el dispositivo para el que fue creado. Esas dos afirmaciones no están en tensión, y el hecho de que el mismo proveedor las midiera con reglas distintas es lo que vale la pena recordar la próxima vez que se cite una de estas cifras sin su línea base.
