
Bonsai vs Ternary Bonsai 2 27B: Duas apostas de baixos bits, duas réguas diferentes
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Coloque o modelo de visão e linguagem Bonsai 2B de 1 bit ao lado do Ternary Bonsai 2 27B e a comparação óbvia — 2 bilhões de parâmetros contra 27 bilhões, 0,43 GB de pesos de linguagem contra 5,93 GB — é a coisa menos interessante do par. O interessante é que os dois modelos, do mesmo fornecedor e do mesmo programa de compressão, não relatam sua qualidade da mesma forma. O Ternary Bonsai 2 27B relata retenção: ele mantém mais de 98% do desempenho agregado em benchmarks de sua contraparte de precisão total, medido em relação a si mesmo. O Bonsai 2B de 1 bit relata uma comparação: ele alcançou "resultados comparativos em benchmarks" contra um modelo Qwen 3 1.7B com quantização de 4 bits, medido em relação ao modelo de outra empresa em uma precisão diferente. Uma é uma afirmação sobre quanto se perdeu. A outra é uma afirmação sobre como ele se sai na comparação. Nenhuma delas é uma afirmação sobre quão bom qualquer um dos modelos é em termos absolutos, e as duas não podem ser lidas na mesma escala.
Essa distinção importa mais do que a contagem de parâmetros, porque decide o que você pode realmente concluir a partir dos números do fornecedor — e, com base nas evidências publicadas até agora, a resposta honesta é menos do que os números de destaque sugerem.
Duas alegações de qualidade, duas réguas diferentes
O Ternary Bonsai 2 27B, lançado em 17 de setembro de 2026, é uma reconstrução ternária {−1, 0, +1} do Qwen3.8-27B a 1,76 bits efetivos por peso, e o número que a PrismML destaca é que ele retém mais de 98% do desempenho agregado em benchmarks do modelo de precisão total. Essa é uma alegação de retenção, e alegações de retenção são autorreferenciais por construção: elas dizem quanto do original sobreviveu à compressão, não onde o original estava. Um modelo que retém 98% de uma linha de base medíocre ainda é um modelo medíocre, e o Qwen3.8-27B não é medíocre — mas o número por si só não diz isso, e não pode ser comparado entre modelos de base.
O modelo de linguagem e visão Bonsai 2B de 1 bit, anunciado em 23 de setembro de 2026 para a plataforma de óculos Snapdragon AR1 Gen 1, é um modelo de linguagem de 1 bit e 1,7B mais um codificador visual de 4 bits e 0,3B. Sua declaração de qualidade publicada é de natureza diferente: a PrismML avaliou-o em relação a um modelo Qwen 3 1.7B com quantização de 4 bits em BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K e GPQA Diamond, e relatou que as duas configurações alcançaram resultados comparáveis. Essa é uma alegação de paridade em relação a uma linha de base externa. Ela diz que a compressão não custou de forma evidente em relação ao caminho de 4 bits que você teria usado de outra forma — o que é exatamente a pergunta certa para um lançamento voltado a dispositivos, e uma alegação muito mais fraca do que "este modelo é bom".
Portanto, não há interpretação segundo a qual 98,2% supere “comparative” ou vice-versa. São respostas a duas perguntas diferentes, feitas em relação a duas referências diferentes, em duas suítes diferentes, pelo mesmo fornecedor. Quem ranqueia esses dois modelos com base na força dessas duas frases está ranqueando as frases.
Os modelos base vêm de lugares diferentes
Há uma segunda diferença estrutural, e é aquela que será importante no próximo ano. O Ternary Bonsai 2 27B é uma recompressão de um modelo externo — o Qwen3.8-27B da Alibaba. O seu teto de qualidade é definido pelo calendário de lançamentos de outra empresa, e a sua cadência geracional segue a da Qwen, em vez da da PrismML. Quando a Qwen lança um novo 27B, a linha Bonsai 27B recebe uma nova entrada, e a taxa de retenção é recalculada em relação a uma nova linha de base.
O 1-bit Bonsai 2B é construído sobre o próprio Bonsai 1.7B da PrismML. Seu teto é definido internamente, cabe à PrismML escolher sua cadência de atualização, e suas melhorias vêm da receita de compressão e do caminho de kernel, em vez de uma troca de modelo upstream. Esse é um tipo diferente de ativo: mais lento para melhorar em capacidade bruta, totalmente sob o controle do fornecedor e — como o lançamento dos óculos mostra — capaz de ser ajustado para um acelerador específico de uma forma que uma recompressão geral não consegue.
As duas são estratégias legítimas. Não são intercambiáveis, e a que você quer depende de seu roadmap estar ancorado no da Qwen ou no do dispositivo.

O contraste da especificação, uma linha de cada vez
• Parâmetros — um LLM de 1,7B com 1 bit mais um codificador de visão de 0,3B com 4 bits no modelo dos óculos, contra um modelo da classe 27B derivado do Qwen3.8-27B no Ternary Bonsai 2 27B.
• Representação — binária {−1, +1} com escalonamento por grupos em FP16 no modelo glasses, contra ternária {−1, 0, +1} com o mesmo escalonamento a 1,76 bits efetivos por peso no 27B.
• Pesos de modelos de linguagem — 0,43 GB para o 1,7B de 1 bit, contra 5,93 GB para o empacotamento PTQ1_0 do Ternary Bonsai 2 27B, com um empacotamento PQ2_0 de 7,25 GB também disponível.
• Contexto — 1.024 tokens no modelo dos óculos, em comparação com um contexto completo de 262.000 tokens no Ternary Bonsai 2 27B.
• Acelerador — a NPU Qualcomm Hexagon por meio de um QNN SDK com suporte a kernel de 1 bit, contra o Apple silicon via MLX e a NVIDIA via CUDA.
• Alegação de qualidade — "resultados comparativos de benchmark" frente a um Qwen 3 1.7B de 4 bits, contra retenção de "mais de 98%" do baseline Qwen3.8-27B de precisão total. Ambos relatados pelo fornecedor, nenhum reproduzido de forma independente, medidos em suítes diferentes.
• Runtime — um conjunto de ferramentas de NPU da Qualcomm para o modelo dos óculos, em comparação com o fork próprio do llama.cpp da PrismML e um contêiner MLX para o 27B, nenhum dos quais o llama.cpp padrão suporta.

O que a aposta em baixa precisão rende em cada caso
A filosofia de compressão é a mesma em ambos os modelos e vale a pena nomeá-la, porque é a tese real da família: a representação de baixos bits funciona de ponta a ponta — embeddings, atenção, MLPs e a cabeça LM — com escalonamento por grupo em FP16 e sem mecanismos de escape de maior precisão. Nenhum dos modelos mantém uma rede de segurança de ponto flutuante para as partes difíceis de quantizar. Essa é uma posição mais agressiva do que a maioria dos trabalhos de quantização adota, e é o que torna possível, afinal, 1,76 bits por peso e pesos de 0,43 GB.
Onde a aposta dá retorno é diferente. No Ternary Bonsai 2 27B, o retorno é capacidade por byte em hardware que você já tem: um modelo da classe 27B em 5,93 GB, rodando em um laptop ou celular, a 98% de seu baseline. No 1-bit Bonsai 2B, o retorno é a existência em uma classe de dispositivo que não tinha opção: um modelo multimodal em 0,43 GB de pesos de linguagem, em uma NPU, a 15,36 tokens por segundo. O primeiro é uma versão melhor de algo que já funcionava. O segundo é algo que não funcionava antes.
Onde fica o limite do nível
Esses dois não são alternativas, e tratá-los como um confronto direto ignora o formato de implantação para o qual os dois lançamentos apontam. Um produto de óculos ou vestível executa o 2B localmente porque nada mais se encaixa. Um produto de laptop ou telefone executa o 27B porque consegue. No momento em que um produto abrange os dois — um aplicativo de telefone emparelhado com óculos, um aplicativo de laptop com um assistente no dispositivo —, a questão deixa de ser qual modelo e passa a ser quais solicitações cada camada tem permissão de responder.
Vale a pena colocar essa fronteira na configuração, em vez de no código da aplicação, porque ambas as camadas vão mudar. A linha de 27B muda quando a Qwen lançar, a linha de 2B muda quando a PrismML alterar a receita, e uma regra codificada rigidamente sobre comprimento de contexto ou capacidade quebra nos dois eventos. Uma política de roteamento que escala solicitações além do orçamento da camada local para um modelo hospedado sobrevive a ambas as mudanças; a camada local continua sendo uma camada entre várias, em vez de uma suposição embutida no cliente. O OrcaRouter é a camada que faz essa escalada — um endpoint para mais de 200 modelos hospedados, com failover incluído, com a política expressa como configuração. Nenhum Bonsai é roteado aqui; ambos são downloads locais. O que fica aqui é a camada acima deles e, com um modelo local de 1.024 tokens, essa camada está fazendo a maior parte do trabalho.

O que resolveria isso
Três medições transformariam este par de duas alegações de marketing numa comparação. Um detalhamento por benchmark por trás da linha de "resultados comparativos", para que o compromisso em relação ao 4-bit fique visível em vez de resumido. Um número de retenção para o Bonsai 2B de 1-bit em relação à sua própria linha de base de precisão total — a medição que a PrismML usa para a linha de 27B e não publicou aqui. E uma avaliação independente de qualquer um dos dois modelos, já que todos os números em ambos os lançamentos vêm atualmente do fornecedor.
Até que um desses exista, a posição defensável é a que os números de fato sustentam: o Ternary Bonsai 2 27B é o melhor modelo por uma ampla margem, e o 1-bit Bonsai 2B é o único dos dois que roda no dispositivo para o qual foi criado. Essas duas afirmações não estão em conflito, e o fato de que o mesmo fornecedor os mediu com réguas diferentes é o que vale lembrar na próxima vez que uma dessas cifras for citada sem sua linha de base.
