
Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF: Menos bits, mejores puntuaciones
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B es más pequeño que la versión GGUF IQ2_XXS de Qwen3.8-27B y, según las cifras publicadas junto con él, también es mejor — lo cual no debería ser posible si todo lo que los separara fuera un presupuesto de bits. La versión de Bonsai contiene 1,76 bits por peso en un archivo de 5,93 GB. La cuantización convencional de 2 bits del mismo modelo base contiene aproximadamente 2,2 bits por peso en un archivo de unos 7,3 GB. Prism ML, que anunció la versión ternaria el 17 de septiembre de 2026, reporta un promedio de 83,9 en 20 benchmarks para su modelo, frente a 75,2 del punto de comparación IQ2_XXS — una diferencia de 8,7 puntos a favor del modelo que usa menos bits.
Esa inversión lo es todo, y no es un truco. Los dos archivos se generan mediante procesos distintos en etapas distintas del ciclo de vida del modelo, y la diferencia entre esos procesos importa más que la diferencia en el ancho de bits. Es también la comparación en la que el consejo popular —«solo toma un quant de 2 bits, ya están bien»— se topa con su contraejemplo más claro, y en la que el contraejemplo cuenta con una medición independiente que lo respalda, y no con la palabra de un proveedor.
La paradoja es el mecanismo
IQ2_XXS es un formato de cuantización posterior al entrenamiento. El modelo se entrena hasta la convergencia en precisión completa y, después, sus pesos se redondean a una representación de pocos bits elegida por un procedimiento de ajuste. El modelo nunca tiene la oportunidad de adaptarse; se mide a posteriori y se aproxima. La familia i-quant mejora los k-quants más antiguos mediante el uso de una matriz de importancia —una pasada de calibración que decide qué pesos merecen más de la precisión disponible—, pero el orden fundamental de las operaciones no cambia. Entrenar y luego comprimir.
Bonsai invierte ese orden. La descripción que Prism ML hace de su propio método es que abandonó por completo la cuantización posterior al entrenamiento e impuso la restricción ternaria durante el entrenamiento: la pasada hacia adelante calcula con pesos restringidos a {−1, 0, +1}, mientras que la pasada hacia atrás sigue arrastrando gradientes de precisión completa. El modelo dedica su entrenamiento a aprender representaciones que sobreviven a la restricción, en lugar de que la restricción se imponga sobre representaciones que nunca la esperaron. El algoritmo se describe como propiedad intelectual patentada, pero su forma les resultará familiar a quienes hayan leído la línea de trabajo de BitNet.
Dos refinamientos se añaden por encima, y ambos son visibles en la aritmética. El primero es la precisión selectiva: 26,2 millones de parámetros —alrededor del 0,098% del modelo, aproximadamente 52 MB en bf16, en su mayoría la ruta del estado recurrente de las capas de atención lineal más los pesos de normalización— se mantienen en precisión completa en lugar de ternarizarse. El segundo es una rotación por bloques. Cada matriz de pesos se transforma mediante una rotación de Walsh–Hadamard con un tamaño de bloque de 1.024 antes de elegir los valores ternarios, lo que distribuye los valores atípicos entre las coordenadas y hace que una aproximación de tres niveles sea menos destructiva. La rotación se incorpora a los pesos almacenados, por lo que no cuesta bytes adicionales; en su lugar, la transformación correspondiente se aplica a las activaciones en tiempo de ejecución.
Ese último detalle tiene una consecuencia con la que te topas al primer intento de ejecutar la cosa, y es el costo real del enfoque.
¿A qué IQ2_XXS te refieres y qué puntuación obtiene realmente?
Antes de comparar la calidad, una corrección que la mayoría de la cobertura omite: «IQ2_XXS» no es un único artefacto. Es un tipo de cuantización de llama.cpp, y el mismo tipo aplicado por distintas cadenas de herramientas al mismo modelo base produce archivos que difieren de forma significativa en tamaño y sustancialmente en calidad.
La evidencia pública más clara es una comparación independiente publicada el 15 de agosto de 2026 por un usuario que investigaba si un Qwen3.8-27B de menos de 2 bits valía la pena construirlo siquiera. La prueba es una medición de divergencia KL de wikitext-2, 100 fragmentos con 512 de contexto, frente a una referencia Q8_0 construida localmente con una perplejidad de 6.7500, y cada candidato usó la misma matriz de importancia, corpus, línea base y compilación de llama.cpp en una sola sesión. Los resultados:
• unsloth UD-IQ2_XXS — 8.39 GiB, perplejidad 7.6528, KLD media 0.146, KLD mediana 0.076, acuerdo top-1 82.98%
• bartowski IQ2_XXS — 8.75 GiB, perplejidad 8.5352, KLD media 0.301, KLD mediana 0.162, concordancia top-1 76.53%
La variante dinámica es 0,36 GiB más pequeña que la estática y aproximadamente 2,1 veces mejor en KLD promedio — con una perplejidad 1,13 veces la de referencia. Dos archivos que llevan la misma etiqueta, separados por un factor de dos en la métrica que mide cuánto se ha desviado la distribución de salida. La misma prueba encontró que todos los candidatos sub-2-bit eran peores que ambas opciones IQ2 publicadas, por lo que el mínimo práctico para este modelo base se sitúa en IQ2 y no por debajo de él.

Esto es importante para la comparación porque cambia a qué se refiere «la versión IQ2_XXS de 7,3 GB». La cifra de Prism ML procede de su propia cuantización del modelo base a 2,2 bits por peso. Una versión dinámica de unsloth de la misma familia mide 8,39 GiB. Una versión de bartowski mide 8,75 GiB. Por lo tanto, la diferencia de tamaño entre Bonsai e «IQ2_XXS» está en algún punto entre 1,4x y 1,5x, según a qué versión te refieras —mayor que el 1,23x que implica el titular, y todo ello antes de que empiece la comparación de calidad.
Dónde falla la compilación posterior al entrenamiento y por qué es fácil que pase desapercibido.
La brecha agregada de 8,7 puntos es la forma menos informativa de expresar la diferencia, porque la degradación en la compilación IQ2_XXS no es uniforme. Es selectiva, y el patrón es lo contrario de lo que la mayoría de la gente predeciría.
• MMLU-Redux — la build posterior al entrenamiento se defiende de forma respetable, en la zona media-alta de los 80
• GPQA Diamond — alrededor de 65,5, frente a 85,76 de la compilación ternaria
• AIME26 — en el rango de 57,5 a 78,6 dependiendo de la compilación, frente a 95,83 para la compilación ternaria
• LiveCodeBench — en el rango de 56,4 a 70,05, frente a 90,07 de la compilación ternaria
Las cifras exactas de IQ2 varían entre las suites de Prism ML y las mediciones de la comunidad, y los rangos anteriores abarcan ambas, pero la forma es consistente en todas las fuentes: el conocimiento superficial sobrevive, y cualquier cosa que requiera una cadena sostenida de razonamiento se degrada drásticamente. Ese es precisamente el modo de fallo que una prueba casual no detectará. Pídele a una compilación de 2 bits que resuma un documento o responda a una pregunta factual y rinde como un modelo mucho más grande. Pídele que sostenga una derivación de varios pasos o que produzca código no trivial y el colapso es repentino en lugar de gradual. Por eso, «me pareció bien cuando lo probé» no es evidencia sobre un modelo cuantizado: es evidencia sobre los prompts que probaste por casualidad.
La versión ternaria no muestra ese colapso en los mismos benchmarks. Prism ML informa AIME26 en 95.83 frente a 94.58 de su base de precisión completa, y LiveCodeBench en 90.07 frente a 90.05 — efectivamente a la par, y la afirmación más útil del lanzamiento, porque dice que la restricción durante el entrenamiento consiguió lo que la de postentrenamiento pierde.
El contraargumento, que es real y que la tabla de calidad no captura
Todo lo anterior favorece a la compilación ternaria en cuanto a calidad por byte. Hay una dimensión en la que el GGUF convencional gana de forma rotunda, y no es pequeña: se ejecuta en el software que ya tienes.
La compilación IQ2_XXS de Qwen3.8-27B es un artefacto estándar de llama.cpp. Se carga en llama.cpp, Ollama, LM Studio, Jan y cualquier otra cosa que enlace con ggml, en todas las plataformas que admite ggml, sin necesidad de un fork ni de kernels especiales. Su matriz de importancia se puede reconstruir o reemplazar. Se comporta como cualquier otro modelo cuantizado que tengas en disco.
Ternary Bonsai 2 27B no lo hace. Los kernels ternarios para la atención híbrida de esta arquitectura residen en el propio fork de llama.cpp de Prism ML. El llama.cpp estándar rechaza PTQ1_0 y PQ2_0 por considerarlos tipos no reconocidos, y no tiene idea de qué hacer con la base rotada que asumen esos paquetes. La compilación de MLX para Apple Silicon tiene kernels de Metal y CPU, pero ninguna ruta CUDA, así que en una máquina NVIDIA recurre a una pasada hacia adelante por CPU que puede tardar minutos. Prism ML sí enumera integración con varios entornos de ejecución, pero el punto de fondo sigue en pie: la usabilidad de este modelo está limitada por si a tu entorno de ejecución preferido se le ha enseñado sobre él.
Ese es el intercambio honesto. Estás eligiendo entre una build que es 1,4 veces más grande, mediblemente peor justo en las tareas para las que es más probable que quieras un modelo de 27B, y que se puede ejecutar en todas partes — y una build que es más pequeña y mejor, en un ecosistema que actualmente se reduce al fork de un solo laboratorio más aquellos runtimes que lo hayan adoptado.

Lo que se necesita para ejecutar cualquiera de los dos
La aritmética de la memoria está más ajustada de lo que sugieren los tamaños de los archivos, porque los archivos no son lo único que hay en la VRAM.
• Compilación IQ2_XXS — de 8,39 a 8,75 GiB de pesos, lo que deja aproximadamente 7,5 GB libres en una tarjeta de 16 GB para contexto y modelos borrador. La prueba independiente anterior señala específicamente que una compilación de 8,39 GiB ya da cabida a un modelo borrador de 2,1 GB junto a ella.
• Ternary Bonsai 2 27B — 5.93 GB para el modelo de lenguaje PTQ1_0, más la torre de visión de 0.63 GB si usas imágenes, más el contexto. El empaquetado PQ2_0 de Prism ML cuesta 7.25 GB y es la opción más rápida en hardware limitado por el rendimiento de instrucciones en lugar del ancho de banda.
En cuanto a la velocidad, las cifras ternarias reportadas son 142,5 tok/s en decodificación con una RTX 5090 y 46,8 tok/s con una Apple M5 Max; los informes de terceros sobre la compilación IQ2 son más escasos, con una medición de Vulkan en tarjetas Radeon duales de alrededor de 3,8 tok/s en generación, aunque esa cifra dice más sobre ese backend en particular que sobre la cuantización. Considera las cifras de rendimiento de ambos lados como altamente dependientes del hardware.
Dónde encaja OrcaRouter y dónde no
Ninguno de estos archivos es algo que un enrutador sirva. Son artefactos locales, y el planteamiento honesto es que OrcaRouter no aloja ninguno de los dos; esta es una comparación sobre lo que se ejecuta en tu propio hardware. Lo que sí está de nuestro lado es el modelo del que ambos se derivaron. Qwen3.8-27B en precisión completa está disponible a través de la propia infraestructura de OrcaRouter a $0.33 por millón de tokens de entrada y $2.40 por millón de tokens de salida, con el contexto nativo de 262K del modelo y su control de esfuerzo de razonamiento bajo/medio/alto intactos.
Eso da lugar a una configuración híbrida sobre la que merece la pena ser concreto. Ejecuta la compilación comprimida localmente para las tareas en las que destaca y enruta la petición ocasional que necesita precisión total al modelo base alojado a través de la misma clave: sin un segundo contrato con un proveedor, sin cambios en el código, porque ambos lados hablan la misma API. Si resulta que la compilación local no es la adecuada para una carga de trabajo, la petición que falla puede conmutarse automáticamente en lugar de devolverse como error, lo que es una forma más barata de descubrir que una cuantización no es adecuada que descubrirlo en producción.
La versión corta
• En la calidad publicada por byte, la versión ternaria gana con claridad, y la victoria se concentra en razonamiento y código — las categorías en las que la versión post-entrenamiento se degrada más.
• En cuanto a la portabilidad, la compilación IQ2_XXS gana igual de claramente. Runtimes estándar en todas partes, sin fork, sin kernels especiales, sin un modo de fallo que produzca basura de forma silenciosa.
• La comparación no es «1,76 bits frente a 2,2 bits». Es «una representación elegida durante el entrenamiento frente a otra ajustada después», y la diferencia de 0,44 bits es un error de redondeo al lado de eso.
• Todas las cifras de calidad de la compilación ternaria de este artículo son mediciones propias de Prism ML en un conjunto de pruebas que Prism ML eligió. Los resultados de KLD de las compilaciones de IQ2 son independientes, de una sola ejecución y específicos de un modelo base y un conjunto de pruebas; son la evidencia de terceros más sólida de esta comparación y no dicen nada sobre Bonsai.
La brecha se cerrará también desde la otra dirección, y probablemente pronto. Si los kernels ternarios llegan a upstream en llama.cpp, la única objeción seria a Bonsai se desvanece y la elección se vuelve sencilla. Hasta entonces, la compilación de IQ2_XXS conserva una ventaja real que no tiene nada que ver con lo buena que sea.

Si vas a decidir esta semana, la prueba que lo resuelve lleva una tarde: toma veinte prompts de tu propia carga de trabajo que requieran más de un paso de razonamiento, ejecuta ambas compilaciones y puntúa las respuestas a ciegas. Las tablas publicadas te dicen dónde mirar. No pueden decirte si tu trabajo está ahí.
