Um cartão de título gerado com o texto 'Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF' e o subtítulo 'Menos bits, melhores pontuações', acima de três cartões com os dizeres 'Bits por peso: 1,76 vs 2,2', 'Tamanho: 5,93 GB vs 7,3 GB' e 'Média do conjunto do fornecedor: 83,9 vs 75,2', com um rodapé com o texto 'Números do Bonsai reportados pelo fornecedor; números do IQ2_XXS segundo o fornecedor e testes da comunidade.' O logotipo da OrcaRouter fica no canto inferior direito.
Engineering & Research

Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF: Menos Bits, Melhores Pontuações

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Ternary Bonsai 2 27B é menor do que a versão GGUF IQ2_XXS do Qwen3.8-27B e, pelos números publicados com ele, também melhor — o que não deveria ser possível se tudo o que os separasse fosse um orçamento de bits. A versão Bonsai contém 1,76 bits por peso num ficheiro de 5,93 GB. A quantização convencional de 2 bits do mesmo modelo base contém aproximadamente 2,2 bits por peso num ficheiro de cerca de 7,3 GB. A Prism ML, que anunciou a versão ternária em 17 de setembro de 2026, relata uma média de 20 benchmarks de 83,9 para o seu modelo, contra 75,2 para o ponto de comparação IQ2_XXS — uma diferença de 8,7 pontos a favor do modelo que usa menos bits.

Essa inversão é a história completa, e não é um truque. Os dois arquivos são produzidos por processos diferentes em estágios diferentes da vida do modelo, e a diferença entre esses processos vale mais do que a diferença na largura de bits. É também a comparação em que o conselho popular — "é só pegar um quant de 2 bits, eles já estão bons agora" — encontra seu contraexemplo mais claro, e em que o contraexemplo tem uma medição independente por trás, em vez da palavra de um fornecedor.

O paradoxo é o mecanismo

IQ2_XXS é um formato de quantização pós-treinamento. O modelo é treinado até a convergência em precisão total e, depois, seus pesos são arredondados para uma representação de baixos bits escolhida por um procedimento de ajuste. O modelo nunca tem a chance de se adaptar; ele é medido a posteriori e aproximado. A família i-quant melhora os k-quants mais antigos ao usar uma matriz de importância — uma passagem de calibração que decide quais pesos merecem mais da precisão disponível —, mas a ordem fundamental das operações permanece inalterada. Treinar, depois comprimir.

Bonsai inverte essa ordem. A descrição que a Prism ML faz de seu próprio método é que ela abandonou completamente a quantização pós-treinamento e impôs a restrição ternária durante o treinamento: a passagem direta calcula com pesos restritos a {−1, 0, +1}, enquanto a passagem reversa ainda carrega gradientes de precisão total. O modelo passa seu treinamento aprendendo representações que sobrevivem à restrição, em vez de ter a restrição imposta a representações que nunca a esperavam. O algoritmo é descrito como propriedade intelectual proprietária, mas sua forma será familiar para qualquer pessoa que tenha lido a linha de trabalho BitNet.

Dois refinamentos vêm por cima, e ambos são visíveis na aritmética. O primeiro é a precisão seletiva: 26,2 milhões de parâmetros — cerca de 0,098% do modelo, aproximadamente 52 MB em bf16, em sua maioria o caminho de estado recorrente das camadas de atenção linear mais os pesos de normalização — são mantidos em precisão total em vez de ternarizados. O segundo é uma rotação em blocos. Cada matriz de pesos é transformada por uma rotação de Walsh–Hadamard com tamanho de bloco 1.024 antes de os valores ternários serem escolhidos, o que distribui os outliers entre as coordenadas e torna uma aproximação de três níveis menos destrutiva. A rotação é incorporada aos pesos armazenados, portanto não custa bytes extras; a transformação correspondente é aplicada às ativações em tempo de execução.

Esse último detalhe tem uma consequência com a qual você se depara logo na primeira tentativa de executar a coisa, e esse é o verdadeiro custo da abordagem.

Qual IQ2_XXS você quer dizer, e qual pontuação ele realmente obtém

Antes de comparar qualidade, uma correção que a maioria da cobertura ignora: "IQ2_XXS" não é um artefato. É um tipo de quantização do llama.cpp, e o mesmo tipo aplicado por diferentes cadeias de ferramentas ao mesmo modelo base produz arquivos que diferem significativamente em tamanho e substancialmente em qualidade.

A evidência pública mais clara é uma comparação independente publicada em 15 de agosto de 2026 por um usuário que investigava se sequer valia a pena construir um Qwen3.8-27B sub-2-bit. O teste é uma medição de divergência KL em wikitext-2, 100 chunks com contexto de 512, contra uma referência Q8_0 criada localmente com perplexidade de 6,7500, com cada candidato usando a mesma matriz de importância, corpus, linha de base e build do llama.cpp em uma única sessão. Os resultados:

• unsloth UD-IQ2_XXS — 8,39 GiB, perplexidade 7,6528, KLD médio 0,146, KLD mediano 0,076, concordância top-1 82,98%

• bartowski IQ2_XXS — 8,75 GiB, perplexidade 8,5352, KLD médio 0,301, KLD mediano 0,162, concordância top-1 76,53%

A variante dinâmica é 0,36 GiB menor que a estática e cerca de 2,1x melhor em KLD médio — com 1,13x a perplexidade de linha de base. Dois arquivos com o mesmo rótulo, separados por um fator de dois na métrica que mede o quanto a distribuição de saída se desviou. O mesmo teste constatou que todos os candidatos abaixo de 2 bits eram piores do que ambas as opções IQ2 publicadas, e é por isso que o limite prático para este modelo base fica em IQ2, e não abaixo dele.

A screenshot of a Hugging Face community discussion titled 'Independent KLD benchmark: UD-IQ2_XXS beats bartowski IQ2_XXS on both size and quality', opened 15 August 2026, describing a wikitext-2 test of 100 chunks at 512 context against a locally built Q8_0 reference with perplexity 6.7500. Its table lists unsloth UD-IQ2_XXS at 8.39 GiB with perplexity 7.6528, mean KLD 0.146, median KLD 0.076 and 82.98% top-1 agreement; bartowski IQ2_XXS at 8.75 GiB with perplexity 8.5352, mean KLD 0.301, median 0.162 and 76.53%; stock IQ1_M at 7.33 GiB with mean KLD 0.659; and stock IQ1_S at 6.88 GiB with mean KLD 0.896.

Isso importa para a comparação porque muda a que se refere "a build de 7,3 GB IQ2_XXS". O número da Prism ML vem da sua própria quantização do modelo base a 2,2 bits por peso. Uma build dinâmica do unsloth da mesma família mede 8,39 GiB. Uma build do bartowski mede 8,75 GiB. A diferença de tamanho entre Bonsai e "IQ2_XXS" está, portanto, em algum lugar entre 1,4x e 1,5x, dependendo de qual build você quer dizer — maior que o 1,23x que a manchete sugere, e tudo isso antes de a comparação de qualidade começar.

Onde o build pós-treinamento quebra, e por que é fácil não perceber

A diferença agregada de 8,7 pontos é a forma menos informativa de declarar a diferença, porque a degradação na build IQ2_XXS não é uniforme. Ela é seletiva, e o padrão é o oposto do que a maioria das pessoas preveria.

• MMLU-Redux — a versão pós-treinamento tem um desempenho respeitável, na faixa dos 80 médios a altos

• GPQA Diamond — cerca de 65,5, contra 85,76 da versão ternária

• AIME26 — na faixa de 57,5 a 78,6, dependendo da build, contra 95,83 da build ternária

• LiveCodeBench — na faixa de 56,4 a 70,05, contra 90,07 para a build ternária

Os números exatos do IQ2 variam entre os conjuntos de testes da Prism ML e as medições da comunidade, e os intervalos acima abrangem ambos, mas o formato é consistente em todas as fontes: o conhecimento superficial sobrevive, e qualquer coisa que exija uma cadeia de raciocínio sustentada se degrada acentuadamente. Esse é precisamente o modo de falha que um teste casual não vai encontrar. Peça a um build de 2 bits para resumir um documento ou responder a uma pergunta factual e ele se comporta como um modelo muito maior. Peça a ele para sustentar uma derivação de várias etapas ou produzir código não trivial, e o colapso é súbito em vez de gradual. É por isso que "me pareceu bom quando testei" não é evidência sobre um modelo quantizado — é evidência sobre os prompts que você por acaso testou.

A versão ternária não mostra esse colapso nos mesmos benchmarks. A Prism ML reporta AIME26 em 95,83 contra 94,58 de sua base de precisão total, e o LiveCodeBench em 90,07 contra 90,05 — efetivamente empatados, e a afirmação mais útil do lançamento, porque diz que a restrição durante o treinamento garantiu aquilo que a de pós-treinamento perde.

O contra-argumento, que é real e que a tabela de qualidade não captura

Tudo o que foi dito acima favorece a build ternária no quesito qualidade por byte. Há uma dimensão em que o GGUF convencional vence de forma absoluta, e ela não é pequena: ele roda no software que você já tem.

A build IQ2_XXS do Qwen3.8-27B é um artefato padrão do llama.cpp. Ele carrega no llama.cpp, Ollama, LM Studio, Jan e em qualquer outra coisa que faça link com o ggml, em todas as plataformas suportadas pelo ggml, sem necessidade de fork e sem kernels especiais. Sua matriz de importância pode ser reconstruída ou substituída. Ele se comporta como qualquer outro modelo quantizado que você tenha no disco.

O Ternary Bonsai 2 27B não. Os kernels ternários para a atenção híbrida desta arquitetura ficam no fork do llama.cpp da própria Prism ML. O llama.cpp padrão rejeita PTQ1_0 e PQ2_0 como tipos não reconhecidos — e não faz ideia do que fazer com a base rotacionada que esses pacotes pressupõem. A build do MLX para Apple Silicon tem kernels para Metal e CPU, mas não tem caminho CUDA; então, numa máquina NVIDIA, ela recorre a uma passagem forward na CPU que pode levar minutos. A Prism ML de fato lista integração com vários runtimes, mas o ponto fundamental permanece: a usabilidade deste modelo é limitada por se o runtime da sua escolha foi ensinado sobre ele.

Essa é a troca honesta. Você está escolhendo entre uma build 1,4x maior, mensuravelmente pior exatamente nas tarefas para as quais você provavelmente mais quer um modelo de 27B, e universalmente executável — e uma build menor e melhor, em um ecossistema que atualmente se resume ao fork de um único laboratório mais quaisquer runtimes que o tenham adotado.

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, showing the headline 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet' and the paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance while the new model retains over 98%.

O que é preciso para executar qualquer um dos dois

A aritmética da memória fica mais apertada do que os tamanhos dos arquivos sugerem, porque os arquivos não são a única coisa na VRAM.

• Versão IQ2_XXS — 8,39 a 8,75 GiB de pesos, deixando aproximadamente 7,5 GB livres em uma placa de 16 GB para contexto e modelos de rascunho. O teste independente acima observa especificamente que uma versão de 8,39 GiB já acomoda um modelo de rascunho de 2,1 GB ao lado dela.

• Ternary Bonsai 2 27B — 5,93 GB para o modelo de linguagem PTQ1_0, mais a torre de visão de 0,63 GB se você usar imagens, mais contexto. O empacotamento PQ2_0 da Prism ML custa 7,25 GB e é a opção mais rápida em hardware limitado por throughput de instruções em vez de largura de banda.

Em termos de velocidade, os números ternários relatados são 142,5 tok/s de decodificação em uma RTX 5090 e 46,8 tok/s em um Apple M5 Max; os relatos de terceiros sobre a build IQ2 são mais escassos, com uma medição Vulkan em placas Radeon duplas em torno de 3,8 tok/s de geração, embora esse número diga mais sobre esse backend específico do que sobre a quantização. Trate as cifras de throughput de ambos os lados como fortemente dependentes do hardware.

Onde o OrcaRouter se encaixa, e onde não

Nenhum desses arquivos é algo que um roteador serve. Eles são artefatos locais, e a forma honesta de dizer é que o OrcaRouter não hospeda nenhum dos dois — esta é uma comparação sobre o que roda no seu próprio hardware. O que fica do nosso lado é o modelo do qual ambos foram derivados. O Qwen3.8-27B em precisão total está disponível por meio da infraestrutura própria do OrcaRouter a $0,33 por milhão de tokens de entrada e $2,40 por milhão de tokens de saída, com o contexto nativo de 262K do modelo e seu controle de esforço de raciocínio baixo/médio/alto intacto.

Isso resulta em uma configuração híbrida sobre a qual vale a pena ser concreto. Execute a versão comprimida localmente para as tarefas em que ela é boa, e encaminhe a solicitação ocasional que precisa de precisão total para o modelo base hospedado usando a mesma chave — sem um segundo contrato com fornecedor, sem alteração de código, porque ambos os lados falam a mesma API. Se a versão comprimida local se revelar inadequada para uma carga de trabalho, a solicitação que falhar pode passar por failover automaticamente em vez de ser retornada como erro, o que é uma forma mais barata de descobrir que uma quantização é inadequada do que descobrir isso em produção.

A versão curta

• Em qualidade publicada por byte, a build ternária vence claramente, e essa vitória concentra-se em raciocínio e código — as categorias em que a build pós-treinamento mais se degrada.

• Em portabilidade, a build do IQ2_XXS vence com a mesma clareza. Runtimes padrão em todos os lugares, sem fork, sem kernels especiais, sem modo de falha de lixo silencioso.

A comparação não é "1,76 bits versus 2,2 bits". É "uma representação escolhida durante o treinamento versus uma ajustada posteriormente", e a diferença de 0,44 bits é um erro de arredondamento perto disso.

• Todas as métricas de qualidade do build ternário neste artigo são medições da própria Prism ML numa suíte escolhida pela Prism ML. Os resultados de KLD para os builds IQ2 são independentes, de execução única e específicos de um modelo base e de um conjunto de testes; são as evidências de terceiros mais fortes nesta comparação e não dizem nada sobre o Bonsai.

A lacuna também se fechará pelo outro lado, e provavelmente em breve. Se os kernels ternários forem integrados no upstream do llama.cpp, a única objeção séria ao Bonsai evapora e a escolha se torna direta. Até lá, a build do IQ2_XXS mantém uma vantagem real que não tem nada a ver com o quão boa ela é.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and a description stating the model is self-hosted on OrcaRouter's own infrastructure.

Se você está decidindo esta semana, o teste que resolve a questão leva uma tarde: pegue vinte prompts da sua própria carga de trabalho que exijam mais de uma etapa de raciocínio, execute ambas as builds e avalie as respostas às cegas. As tabelas publicadas dizem onde procurar. Elas não conseguem dizer se o seu trabalho está lá.