
Ternary Bonsai 2 27B vs Qwen3.8-27B: Lo que realmente se consigue con 47,9 gigabytes de precisión
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B y Qwen3.8-27B son el mismo modelo en dos mundos numéricos. Comparten una arquitectura, un tokenizador, un linaje de entrenamiento y una ventana de contexto de 262.144 tokens. Lo que los separa es cómo se escriben los pesos: Qwen3.8-27B almacena cada uno como un float de 16 bits y ocupa 53,81 GB en su forma de referencia FP16, mientras que Ternary Bonsai 2 27B almacena cada uno como uno de tres símbolos y ocupa 5,93 GB. Prism ML anunció la versión comprimida el 17 de septiembre de 2026 y la publicó en Hugging Face bajo Apache 2.0; los pesos originales de Qwen3.8-27B se publicaron el 13 de agosto de 2026, también bajo Apache 2.0.
La comparación que importa no es cuál es mejor. Es lo que te cuestan los 47,9 GB que faltan, y la respuesta honesta es más acotada y específica de lo que te dirá cualquiera de los dos bandos. Prism ML informa que su versión conserva 98,2% del promedio del modelo de precisión completa en un conjunto de 20 pruebas de referencia — 83,9 frente a 85,4. Ese número es del propio proveedor, medido con su propio sistema de evaluación, y un día después del lanzamiento nadie fuera de Prism ML lo ha reproducido. El agregado también oculta la parte que en realidad debería importarte, porque los 1,8 puntos no están distribuidos de manera uniforme. En las dos pruebas de referencia que ponen a prueba la ingeniería de software sostenida, la brecha no es del 1,8% — está más cerca del 25%.
La misma red, escrita de forma distinta
Empecemos por aquello que la compresión no toca, porque es la razón por la que la comparación resulta interesante en primer lugar. El número de capas, el tamaño oculto, el vocabulario, el patrón de atención y la torre de visión son los del modelo base. Qwen3.8-27B es un diseño de atención híbrida: 48 capas de atención lineal Gated DeltaNet intercaladas con 16 capas de atención completa, una proporción de aproximadamente 3:1, sobre 64 capas con un tamaño oculto de 5,120 y un vocabulario de 248,320 tokens. Esa columna vertebral mayormente lineal es lo que hace que un contexto de 262K sea asequible en primer lugar, y es la propiedad que Bonsai hereda sin cambios.
Lo que Prism ML cambió es la representación de las matrices del modelo de lenguaje, además de los kernels necesarios para operar con ellas. Su informe técnico divide los 27,36 mil millones de parámetros en 24,35 mil millones en el backbone de lenguaje repartidos en 64 bloques, 2,54 mil millones en el embedding y la cabeza LM, y 0,47 mil millones en una torre de visión de 27 bloques. La torre de visión se distribuye como un archivo mmproj de 4 bits separado de unos 0,63 GB y se carga solo cuando llega realmente una imagen, así que un despliegue solo de texto nunca paga por él.
Una consecuencia práctica de ese diseño mayormente lineal merece señalarse antes de cualquier discusión sobre benchmarks. Como la arquitectura no es un transformer convencional, los kernels de bajos bits tuvieron que escribirse específicamente para ella. El llama.cpp estándar rechaza ambos empaquetados de Prism ML como tipos desconocidos —y, lo que es más peligroso, carga sin quejarse un formato ternario más antiguo y produce sinsentidos fluidos, porque no tiene aplicada una rotación correspondiente a las activaciones. Si ejecutas este modelo en un binario que no lo conoce, no obtendrás un error. Obtendrás una salida incorrecta pero segura de sí misma.
La comparación, categoría por categoría
Aquí está el desglose de 20 benchmarks del proveedor, con la base de precisión completa como referencia. Todas las cifras de esta lista son de Prism ML; ninguna ha sido verificada de forma independiente.
• Matemáticas — 96,57 para Ternary Bonsai 2 27B vs 97,06 para Qwen3.8-27B. Efectivamente al mismo nivel.
• Codificación — 81.58 vs 82.17. También están cerca, y es la categoría sobre la que se está debatiendo toda la técnica.
• Seguimiento de instrucciones — 82.66 vs 81.25. El modelo comprimido va por delante aquí, que es la única línea de la tabla que resulta verdaderamente sorprendente.
• Conocimiento y razonamiento — 83,95 frente a 86,66. Una caída de 2,7 puntos, y la mayor contribución individual a los 1,8 puntos faltantes.
• Agéntico y llamada a herramientas — 77,57 vs 79,74, abarcando τ2-Bench con 80,22 y BFCL v3 con 74,92.
• Visión — 78.59 vs 81.64, la mayor pérdida por categoría. Ten en cuenta que la torre de visión en sí no es la parte comprimida; lo es el modelo de lenguaje que lee sus salidas.

Lee la forma en lugar del promedio y aparece una historia más clara. La compresión es casi gratuita en matemáticas, programación y seguimiento de instrucciones, y es costosa en conocimiento y visión. Es lo contrario de la sabiduría popular sobre los modelos de baja precisión, que sostiene que el conocimiento superficial sobrevive y el razonamiento se derrumba. Aquí es el conocimiento el que se erosiona y el razonamiento el que se mantiene.
Dónde residen realmente los 1.8 puntos
El agregado es una media sobre veinte benchmarks, y las medias son el lugar donde se esconden las brechas. Desglosa los resultados individuales y dos de ellos son mucho peores de lo que sugiere el promedio.
• Terminal-Bench 2.1 — 52.8 para la compilación ternaria frente a 69.7 para precisión completa
• SWE-bench Verified — 60,8 frente a 80,6
Ambos quedan cerca de las tres cuartas partes de la puntuación de precisión completa. Frente a eso, AIME26 llega a 95,83, LiveCodeBench a 90,07 y AA-LCR a 77,0 —a menos de un punto del modelo sin comprimir. Esta es la primera vez que se evalúa a la familia Bonsai en Terminal-Bench, y Prism ML deja constancia explícita en sus propios materiales de que la capacidad de ingeniería de software de horizonte largo que prometió en la primera generación se entrega de forma parcial, no completa.
Entonces, la pregunta práctica no es «¿retiene el 98,2 %?» sino «¿cuál es mi carga de trabajo?». Si ejecutas un agente de programación que mantiene un plan a lo largo de docenas de llamadas a herramientas y edita archivos durante minutos, estás en la categoría con la brecha del 25 %, y la cifra agregada es activamente engañosa. Si haces matemáticas, generación de código de un solo turno, extracción, clasificación o chat, estás en las categorías donde la brecha se redondea hasta desaparecer. Lo más útil de la tabla del propio proveedor es que te permite hacer esa distinción en lugar de adivinar.
Qué necesita realmente cada uno para funcionar
El panorama de hardware es menos simétrico de lo que sugiere la proporción de tamaños. Un modelo FP16 de 53,81 GB no cabe en un portátil de 16 GB en absoluto, lo que hace que la comparación sea menos «más rápido frente a más lento» y más «posible frente a no posible». Medidas estandarizadas de Prism ML con tamaño de lote 1, torre de visión excluida:
• NVIDIA RTX 5090 — 142,5 tok/s de decodificación en el empaquetado PQ2_0, a 0,582 mWh por token
• Apple M5 Max — 46,8 tok/s de decodificación, con procesamiento de prompt en torno a 765 tok/s
• Apple M5 Pro — 27,7 tok/s de decodificación
• Apple M4 Pro — 18,0 tok/s de decodificación, con el procesamiento de prompts cerca de 125 tok/s convirtiéndose en la restricción limitante en contextos muy largos
La salvedad importante es que nada de esto es un único binario. El empaquetado PTQ1_0 te da 5,93 GB a 1,76 bits por peso; PQ2_0 cuesta 7,25 GB a 2,16 bits por peso y compra velocidad de decodificación en hardware donde el límite es el rendimiento de instrucciones, no el ancho de banda de memoria. La compilación de MLX para Apple Silicon es un tercer artefacto con su propia contabilidad: un contenedor afín de 2 bits que almacena un sesgo que los pesos ternarios no necesitan, y que se sitúa en 2,25 bits por peso y 8,005 GiB en disco, con kernels de Metal y CPU pero sin ruta CUDA. «Se ejecuta en 5,9 GB» es cierto para exactamente uno de esos archivos en exactamente el entorno de ejecución correcto.
La comparación de costos, planteada con honestidad
Hay dos formas de pagar por Qwen3.8-27B y solo una de pagar por su hermano comprimido. Ternary Bonsai 2 27B es una descarga: Apache 2.0, tu hardware, sin contador. Qwen3.8-27B es tanto una descarga como un servicio alojado, y si optas por la vía alojada, la cifra relevante es la que figura en la página del modelo: 0,33 $ por millón de tokens de entrada y 2,40 $ por millón de tokens de salida, servido desde la propia infraestructura de OrcaRouter en lugar de revendido desde la de otro.
Ahí es donde OrcaRouter se gana un lugar en esta comparación, y no una mera nota al pie. La versión enrutada de Qwen3.8-27B mantiene el mismo contexto de 262K, acepta texto, imágenes y video, y expone el control de esfuerzo de razonamiento que el modelo incluye de serie. Está detrás de la misma clave que más de 200 modelos adicionales, sin margen añadido sobre el precio de lista del proveedor, lo cual importa más de lo que parece: porque el precio de lista se traslada tal cual en lugar de revenderse, un cambio de precio del proveedor se refleja aquí el mismo día en lugar de en la próxima renovación del contrato. Para un equipo que quiera la base de precisión completa como el nivel de escalado por encima de un Bonsai local, eso es un único endpoint y una única clave en lugar de dos relaciones con proveedores.

¿Cuál elegir?
La decisión se trata principalmente de dónde se realiza el trabajo, no de qué modelo es mejor, porque en la mayoría de las tareas son el mismo modelo.
• Elige Qwen3.8-27B en precisión completa cuando la tarea sea de horizonte largo y agéntica, cuando estés evaluando o haciendo fine-tuning, cuando necesites el contexto YaRN de 1M tokens, o cuando la precisión de visión sea determinante. Los números de Terminal-Bench y SWE-bench son la razón.
• Elige Ternary Bonsai 2 27B cuando el trabajo tenga que realizarse en hardware que sea tuyo, cuando la alternativa sea no ejecutar ningún modelo de 27B, o cuando la carga de trabajo sea matemáticas, programación, extracción o razonamiento sin herramientas, donde las categorías están igualadas.
• No elija basándose en el agregado. 83.9 y 85.4 están lo suficientemente cerca como para que un solo intercambio de benchmark pueda reordenarlos, y solo uno de los dos números está verificado de manera independiente.
Lo que hay aquí de genuinamente nuevo no es que un modelo de 27B quepa en seis gigabytes —la primera generación de Bonsai ya lo hizo en julio—. Es que el seguimiento de instrucciones haya quedado por delante del modelo padre y que las matemáticas y la programación hayan quedado a la par, lo cual es una afirmación distinta de «pequeño para su tamaño». Si se mantiene en tu carga de trabajo es exactamente lo que un día de antigüedad no puede decirte, y la primera evaluación independiente de este modelo es el resultado que merece la pena esperar.

Si quieres ejecutar la comparación con tus propios prompts en lugar de con una suite de benchmarks, la vía más rápida es llamar al Qwen3.8-27B alojado a través de un único endpoint y ejecutar localmente la build ternaria, y luego comparar las salidas en las tareas que realmente tengas. Eso es trabajo de una mañana y te dirá más sobre los 1,8 puntos que cualquier tabla publicada.
