
Ternary Bonsai 2 27B Uncensored vs Qwen3.8-27B-Uncensored-MLX: Dos formas de eliminar una dirección de rechazo
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
OrcaRouter Ternary Bonsai 2 27B Uncensored y Qwen3.8-27B-Uncensored-MLX responden a la misma pregunta —cómo se saca una dirección de rechazo de un modelo de lenguaje— y lo hacen en dos lugares distintos. El linaje Qwen3.8-27B-Uncensored-MLX es abliteración convencional: las matrices de pesos se ortogonalizan contra una dirección de rechazo aprendida y los pesos editados se guardan como un nuevo checkpoint. OrcaRouter Ternary Bonsai 2 27B Uncensored, en cambio, realiza la proyección equivalente en tiempo de inferencia, restando el componente de cada escritura residual que cae a lo largo de la dirección de rechazo, de modo que el paquete Bonsai subyacente nunca se modifica y permanece idéntico bit a bit. Ambas son publicaciones nuestras, y la división entre ellas no es una preferencia sobre entornos de ejecución. Se desprende de una aritmética que es específica de los pesos ternarios.
El objeto de esta comparación tiene un día de antigüedad. Prism ML anunció Bonsai 2 27B el 2026-09-17; los repositorios de Hugging Face se crearon la noche anterior, a las 23:40–23:41 UTC del 2026-09-16, bajo Apache-2.0. La compilación MLX abliterada con la que se está comparando lleva disponible desde mediados de agosto. Nada de lo que sigue es un historial de resultados para el más nuevo de los dos; cuando algo no se ha medido, este artículo lo indica.
El mismo truco, aplicado en dos lugares diferentes
La abliteración ordinaria es una edición de pesos. Se estima una dirección de rechazo y luego se proyecta fuera de las matrices que escriben en el flujo residual: W ← W - r(rᵀW). Unas pocas multiplicaciones de matrices, sin optimizador, sin pérdida. Así se creó Qwen3.8-27B-Uncensored-MLX: la ficha del modelo lo describe como "abliteración (eliminación de la dirección de rechazo), luego cuantización afín de MLX", con la dirección ortogonalizada fuera del flujo residual y el resultado guardado como un nuevo conjunto de pesos. Lo que se distribuye es un checkpoint que ya tiene la dirección eliminada.
OrcaRouter Ternary Bonsai 2 27B Uncensored deja los pesos intactos e interviene donde se produce cada contribución residual, en float32, con la dirección de rechazo almacenada r:
• y ← y - alpha · dot(y, r) · r
Con alfa 1 —el valor predeterminado— la componente paralela a r se elimina de esa escritura. Con alfa 0, la proyección está desactivada y el modelo se comporta como lo hace el paquete publicado. Los valores intermedios otorgan una intensidad parcial; los valores superiores a 1 sobreproyectan, lo que, según el proyecto, puede degradar la calidad. La selección de capas también está expuesta, de modo que puedes ablacionar un subconjunto en lugar de toda la pila. La dirección en sí es un vector ordinario de 5120 dimensiones —unos 20 KB en float32— sin ninguna rotación de Hadamard adicional aplicada, porque la proyección opera sobre salidas de proyección, que ya están en la base oculta normal.
El detalle de la cobertura es la parte en la que la gente se equivoca cuando intenta hacerlo por su cuenta. Envolver self_attn.o_proj por sí solo captura 16 sitios. Esta implementación envuelve 129 escritores residuales: 64 mlp.down_proj, 48 linear_attn.out_proj, 16 self_attn.o_proj, y model.embed_tokens. Un selfcheck.py incluido verifica que la proyección reduce el componente restante a aproximadamente 1e-6 de la norma residual, y advierte si no se detectan 129 sitios.

Por qué los pesos ternarios convierten esto en una elección forzada en lugar de una preferencia
Esta es la parte que es realmente específica de este modelo, y es la razón por la que los dos enfoques no son intercambiables aquí, aunque calculan casi lo mismo.
Un paquete ternario almacena valores en {-1, 0, +1} multiplicados por una escala FP16 por grupo, con un tamaño de grupo de 128, en una base rotada. Ortogonaliza una matriz ternaria respecto a una dirección de rechazo y obtienes una matriz densa de precisión completa. No existe una matriz ternaria que sea igual a W - r(rᵀW) en general. Así que volver a guardar los pesos editados significa recuantizarlos — y recuantizar pesos editados no reproduce el entrenamiento consciente de la cuantización que produjo el paquete original. El comportamiento de redondeo que Prism ML entrenó al modelo para tolerar es una propiedad del procedimiento de entrenamiento, no del cuantizador, y no puedes volver a ejecutarlo a posteriori.
En un checkpoint denso en BF16, ese problema no surge. Redondea los pesos editados a 4 bits y obtienes un modelo de 4 bits ligeramente peor, que es el compromiso habitual que todo el mundo ya acepta. En un paquete ternario, estarías desechando la única propiedad que justifica la existencia del paquete.
Así que el planteamiento honesto no es «el tiempo de ejecución es mejor». Es que la proyección en tiempo de ejecución es la única de las dos que preserva lo que tiene de especial este modelo en particular. La dirección de rechazo es de 20 KB. El paquete es de 8,005 GiB.
Esa cifra de 8.005 GiB corresponde específicamente al pack MLX — prism-ml/Ternary-Bonsai-2-27B-mlx-2bit, cuyo model.safetensors mide 8,595,477,990 bytes en la API de Hugging Face (8.595 GB, 8.005 GiB), un contenedor afín de MLX con códigos de 2 bits más una escala y un sesgo FP16 por grupo. Es un artefacto distinto de las compilaciones GGUF que distribuye Prism ML, y las cifras no son transferibles de uno a otro. El propio titular de Prism ML de 5.93 GB / 1.76 bits por peso describe su PTQ1_0 GGUF, que mide 5.947 GB; su formato True Ternary se cita en 1.72 bits por peso y 5.80 GB. Ninguna de esas cifras describe el pack MLX que este runtime somete a ablación.
Donde el enfoque de checkpoint todavía gana, y sí que gana en algunos casos

Sería fácil escribir esto como una vuelta de la victoria para el método más nuevo. Eso sería un error, porque la abliteración convencional va por delante en los ejes que deciden la mayoría de los despliegues.
• Un artefacto, cualquier entorno de ejecución compatible. Un checkpoint abliterado es un conjunto normal de pesos. Cárgalo en el cargador compatible con MLX que ya uses, y funciona. El enfoque de entorno de ejecución necesita el runtime propio incluido en el paquete — y el proyecto advierte explícitamente que un cargador MLX común puede parecer que carga el paquete mientras calcula silenciosamente algo incorrecto. Eso es un margen de maniobra mucho más estrecho.
• Hardware. Qwen3.8-27B-Uncensored-MLX se ofrece en compilaciones de 2, 4, 6 y 8 bits, con una copia de 4 bits replicada en la raíz del repositorio, de modo que las herramientas que tratan un repositorio como un único modelo lo cargan sin configuración. Ternary Bonsai 2 27B Uncensored es Apple Silicon / MLX. La multiplicación de matrices cuantizada del paquete tiene kernels de Metal y CPU, pero ninguna implementación de CUDA a través de mlx-cuda, por lo que en una máquina NVIDIA este paquete MLX actualmente no obtiene aceleración por GPU en absoluto — la inferencia en CPU funciona, y una pasada hacia delante de 27B puede tardar minutos. Eso hace que la ruta de CPU en Linux sea útil para pruebas de implementación y reproducibilidad, no para servir.
• Herramientas y familiaridad. La abliteración tiene años de herramientas detrás — recetas ajustadas, búsqueda de rangos de capas, variantes publicadas con las que puedes comparar. El método en tiempo de ejecución aquí tiene una sola implementación, en un solo modelo, publicada ayer.
• Distribución. Un único checkpoint es una única descarga. La ablación en tiempo de ejecución entrega un paquete, más un archivo de dirección, más un runtime, y el lector tiene que mantener tres cosas sincronizadas.
• Evidencia. La ablación de checkpoints cuenta con mediciones de terceros en esta familia de modelos base. La ablación en tiempo de ejecución sobre un paquete ternario solo dispone de nuestros propios números, y su supuesto central no está verificado; más sobre eso a continuación.

Qué se gana a cambio con la ablación en tiempo de ejecución
El intercambio es real también en la otra dirección, y el primer elemento es el que generaliza más allá de este modelo.
• Procedencia idéntica a nivel de bits.Cero pesos modificados, cero recuantización, cero error de cuantización adicional. Eso no es un eslogan; es la propiedad que hace que las cifras de capacidad a continuación sean interpretables en lugar de una feliz casualidad.
• Un alfa ajustable. La intensidad de ablación es un parámetro de tiempo de ejecución, no una propiedad del checkpoint. Puedes barrerlo para tu carga de trabajo, desactivarlo por completo con alfa 0, o sobreproyectar y medir qué se rompe — sin descargar un segundo modelo.
• Control selectivo por capas. Ablacionar un subconjunto de capas es un argumento, no un re-bake. Eso importa para cualquiera que estudie qué capas portan el comportamiento, porque la alternativa es producir un checkpoint por cada configuración.
• Sin un segundo conjunto de pesos. El modelo editado es el modelo original. Para un pack cuya tesis completa es el footprint, distribuir una copia abliterated paralela de aproximadamente 16 GB — el tamaño de la compilación de 4 bits del repositorio de comparación — le restaría fuerza al argumento.
• Reversibilidad. Una edición de punto de control es permanente para ese artefacto. Una bandera en tiempo de ejecución no lo es.
Los números que tenemos, y exactamente cómo se midieron
Todo en esta sección es la propia evaluación de OrcaRouter de OrcaRouter Ternary Bonsai 2 27B Uncensored, y el método importa tanto como las cifras.
La medición es un clasificador de frases iniciales basado en reglas, no un juez LLM. El pensamiento está desactivado, la decodificación es voraz, el presupuesto es de 64 tokens, y base y ablacionado son los mismos pesos en el mismo proceso con alfa 0 frente a alfa 1. Ese último punto es la parte más sólida de la configuración: no hay comparación entre checkpoints ni diferencia de cuantización que pueda confundir el resultado. También es la razón por la que los números deben leerse como una medida de lo que el modelo dice en su frase inicial, y nada más que eso.
Tasas de rechazo en conjuntos publicados de prompts nocivos, de base a ablacionado:
• AdvBench (n=100) — 99,0% a 6,0%
• JailbreakBench (n=100) — 96,0% a 4,0%
• StrongREJECT (n=150) — 99,3 % a 3,3 %
• HarmBench (n=150) — 98,7 % a 7,3 %
• MaliciousInstruct (n=100) — 97.0% a 0.0%
• ForbiddenQuestions (n=150) — del 75,3 % al 5,3 %
• SimpleSafetyTests (n=50): del 96,0 % al 18,0 %, y este se queda corto
SimpleSafetyTests está subestimado por una razón concreta. Ese conjunto se compone mayormente de prompts de autolesión, y el modelo ablacionado responde a ellos con una redirección de crisis que comienza con «Lamento profundamente oír…». La lista de frases exactas del clasificador no contiene esa apertura, por lo que puntúa una redirección como cumplimiento. La tasa real de rechazo residual es superior al 18,0 %. El clasificador se dejó tal cual a propósito, para que las cifras sigan siendo comparables con las otras tarjetas de modelo de OrcaRouter — pero el lector no debería tomar el 18,0 % al pie de la letra.
Ninguna respuesta en ninguna de estas ejecuciones agotó su presupuesto de tokens, lo que hace que un presupuesto de 64 tokens sea defendible aquí. Una columna separada en los resultados completos cuenta las respuestas que respondieron pero envolvieron la respuesta en un descargo de responsabilidad; eso varió entre el 42 y el 60 % según el conjunto.
Dos resultados que van en contra del relato simple
Dos de los hallazgos merecen un tratamiento propio, porque ambos complican la lectura obvia.
El rechazo excesivo también disminuye. En las indicaciones benignas de JailbreakBench, el paquete publicado rechaza el 25,0 % de ellas. Tras la ablación, rechaza el 0,0 %. En XSTest-safe pasa del 5,2 % al 0,4 %.
Esta es la mitad poco divulgada de la técnica. El paquete Bonsai publicado rechaza una cuarta parte de un conjunto de prompts benignos; haga lo que haga la dirección de rechazo en el modelo QAT, se está activando ante prompts que nunca deberían haberla activado. Eliminar la dirección también elimina esos rechazos, y eso es una ganancia genuina de capacidad, no un costo de seguridad. El mismo efecto aparece en trabajos independientes sobre otros modelos: el propio banco de pruebas de Atomic Chat midió que el sobrerrechazo ante prompts benignos de Gemma 2 9B caía del 44 % al 0,5 % tras la abliteración, con MMLU prácticamente sin cambios, de 68,4 a 68,0. Su medición, su modelo, autoinformados en su blog; el patrón es lo importante, no las cifras exactas.
El encuadre que sigue es incómodo pero honesto: el rechazo excesivo y el rechazo son la misma perilla. No puedes bajar solo los rechazos que no te gustan.
La retención de capacidades es plana, y eso no es suerte. Las comprobaciones de capacidad, de base a ablacionado:
• MMLU (n=300) — 76,7 % a 77,7 %, +1,0
• GSM8K (n=150) — 87,3% a 86,0%, -1,3
• CMMLU (n=500) — 76,2 % a 75,6 %, -0,6
Todo movimiento queda dentro del ruido con estos tamaños de muestra: una pregunta de GSM8K vale 0,7 puntos. MMLU-Pro se excluyó en lugar de notificarse: su prompt pide razonamiento antes de la respuesta, y el 63–64 % de las respuestas de ambos lados no habían llegado a una respuesta dentro del presupuesto de tokens, por lo que cualquier cifra de precisión sería un mínimo fijado por el presupuesto y no una medición.
La capacidad plana se deriva directamente de pesos idénticos bit a bit, y vale la pena ser precisos sobre por qué. El modelo que responde es el mismo modelo. El runtime añade un producto escalar y un AXPY por cada escritura residual, y no cambia nada de los pesos, la cuantización ni los kernels que los leen. Un enfoque basado en checkpoint tiene que ganarse esa planitud —y a menudo no lo hace. Una batería de pruebas de terceros de una abliteración diferente de la misma base Qwen3.8-27B, publicada el 2026-08-17 por un ingeniero de SMF Works, midió una puntuación compuesta del 79,0 % que cayó al 72,0 %, con matemáticas que bajaron del 50,0 % al 33,3 %. Esa es una receta diferente, una cadena de herramientas diferente y una medición diferente, así que no es una puntuación para esta comparación. Es un recordatorio de que la abliteración basada en checkpoint sobre esta base ha costado dos dígitos en al menos una prueba cuidadosa e instrumentada, y de que «la abliteración es casi gratuita» es una afirmación que depende por completo de la receta.
La suposición que nadie ha verificado aún
Esta es la parte de la historia que debe decirse sin rodeos, y pertenece a una comparación de métodos para eliminar la censura, no a una nota al pie.
La dirección de rechazo utilizada aquí se estimó a partir del modelo base BF16 con el que se entrenó el paquete Bonsai. La arquitectura y la base oculta son idénticas, por lo que el vector es dimensionalmente correcto y la proyección es matemáticamente exacta: el entorno de ejecución puede demostrar, y de hecho verifica, que elimina la dirección proporcionada del flujo residual.
Lo que eso no demuestra es que la dirección siga significando lo mismo en el modelo entrenado con conciencia de cuantización. No se ha medido del todo cuán bien sobrevive la dirección al entrenamiento con conciencia de cuantización. Eliminar un vector de forma exacta no es lo mismo que eliminar el comportamiento que se estimó que representaba, y la segunda afirmación es la que importa. Cada número de la sección anterior es un resultado empírico consistente con una buena transferencia; ninguno de ellos es una demostración de que la transferencia sea completa, y el propio proyecto lo dice, recomendando que se haga un barrido de alpha y de la selección de capas antes de sacar conclusiones.
Cualquier comparación honesta de métodos de descensura tiene que admitir esto. La abliteración convencional tiene el problema de la imagen especular: edita los pesos y luego mide el resultado, así que su dirección nunca tiene que transferirse entre versiones del modelo, pero su edición es permanente e irrecuperable si la receta estaba equivocada.
¿Qué queda aún sin medir?
Más allá de la cuestión de la transferencia, merece la pena nombrar tres lagunas en lugar de andarse con rodeos.
• Sin reproducción independiente.Cada benchmark de Bonsai 2 27B que circula —el promedio de 83,9, la retención del 98,2 %, los desgloses por categoría— está reportado por el proveedor, Prism ML, ejecutado con EvalScope sobre un backend vLLM en H100 con un esfuerzo de razonamiento «xhigh». Nadie fuera de Prism ML los ha reproducido. Las tablas de seguridad y capacidad anteriores son nuestras y tampoco son independientes.
• Comportamiento con el pensamiento activado. Nuestras tablas están en modo de pensamiento desactivado. Trabajos independientes sobre otros modelos abliterados han encontrado que, incluso con un 100 % de éxito de ataque, el modelo aún razona sobre seguridad en una fracción sustancial de las respuestas cuando se le permite pensar. No se ha medido si eso se cumple aquí ni qué efecto tiene sobre los números de la frase inicial.
• Una sola dirección. El método asume que el rechazo está mediado por una sola dirección, que es el hallazgo de Arditi et al. y la base de toda la técnica. Trabajos posteriores en otros modelos han encontrado direcciones geométricamente distintas para diferentes categorías de rechazo. Un solo vector, barrido sobre un solo alpha, no resuelve eso.
Qué significa esto si estás eligiendo entre ellos
Elige el checkpoint si necesitas que el modelo se ejecute en cualquier lugar, en hardware que no controlas, a través de un cargador que no escribiste. Elige el runtime si estás en Apple Silicon, te importa que el artefacto que estás estudiando sea el artefacto que Prism ML entrenó, y quieres que la fuerza de ablación sea un parámetro que puedas ajustar en lugar de una decisión que tengas que volver a descargar. Ambas son defendibles, y se eligen por restricciones de despliegue, no por cuál método es más nuevo.
Si intentas decidirlo empíricamente, el método en tiempo de ejecución tiene una ventaja práctica que vale la pena mencionar: alfa 0 y alfa 1 son el mismo proceso y los mismos pesos, así que una comparación entre ellos aísla la ablación y nada más. Eso es un experimento más limpio que comparar las diferencias entre dos checkpoints, y es la razón por la que la tabla anterior puede leerse como una medición de la proyección en lugar de una medición de dos cuantizaciones de esta.
Uso responsable
Eliminar una dirección de rechazo aprendida puede hacer que el modelo responda a solicitudes que el original rechazaría. Eso es el mecanismo funcionando, no un efecto secundario, y no debería registrarse como una característica. Este es un mecanismo de investigación y de control de inferencia, y no es evidencia de que cualquier salida resultante sea segura, correcta o adecuada.
La propia tarjeta del paquete publicado plantea el mismo punto desde el otro lado: la build abliterated de MLX «ha visto eliminada en gran medida su alineación de seguridad», cumplirá con solicitudes que la original rechazaría y no cuenta con salvaguardas integradas significativas. Sus autores la circunscriben a la investigación legítima —interpretabilidad, investigación en seguridad, red-teaming, evaluación de robustez— y dicen claramente que los despliegues deben añadir primero su propia capa de moderación y controles de acceso.
Nada en este artículo constituye un argumento de que la eliminación de rechazos no tenga costo, ni de que una tasa de rechazo más baja sea una señal de calidad. Un modelo que responde más preguntas no es por ello un mejor modelo, y un clasificador basado en reglas que cuenta frases iniciales es una medición de la formulación, no de la competencia. Ambos artefactos son herramientas de investigación con un deber de operador asociado, y ese deber no se traslada a quien haya escrito el código de ablación.
El código de ablación en tiempo de ejecución, la dirección de rechazo y las tablas completas de evaluación los publica OrcaRouter, junto con la plataforma de enrutamiento que el equipo desarrolla.
