
Bonsai vs Bonsai 27B: Um Nome de Família, Dezesseis Vezes os Parâmetros
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Quem procurar esta família pelo nome vai ficar com o modelo errado, e a razão é que o nome isolado "Bonsai" não é um modelo. É a família e, a partir desta semana, a família contém um modelo de visão-linguagem de 2 bilhões de parâmetros que roda em um par de óculos inteligentes e um modelo de 27 bilhões de parâmetros que roda em um celular, um notebook ou um desktop. O primeiro é o modelo de visão-linguagem Bonsai 2B de 1 bit anunciado em 23 de setembro de 2026 — um modelo de linguagem de 1 bit com 1,7B mais um codificador de visão de 4 bits com 0,3B, contexto de 1.024 tokens, construído sobre o Bonsai 1.7B. O segundo é o Bonsai 27B, lançado em 14 de julho de 2026 sob a licença Apache 2.0, construído sobre o Qwen3.6-27B com um contexto de 262.000 tokens e a opção de uma versão ternária de 5,9 GB ou uma versão binária de 3,9 GB. Eles compartilham um nome, um fornecedor, uma filosofia de compressão e quase nada mais. Dezesseis vezes os parâmetros, duzentas e cinquenta e seis vezes o contexto e dois dispositivos completamente diferentes.
Esta página é para a pessoa que pesquisou por um deles e foi parar no outro.
O problema de nomenclatura, dito de forma clara
O menu de modelos da PrismML atualmente lista Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B e Bonsai Image. O anúncio dos óculos acrescenta um modelo de visão-linguagem de 2 bilhões de parâmetros à linha Bonsai 1.7B. Assim, "Bonsai" sozinho pode significar qualquer uma de pelo menos quatro classes de parâmetros e duas gerações, e o sufixo de tamanho é a única coisa que desambigua. Isso não é uma crítica à nomenclatura — é o formato normal de uma família de modelos —, mas significa que o nome da família não traz nenhuma informação sobre o que você está baixando.
A divisão útil não é a geração, e sim a classe de dispositivo. Tudo na linha de 27B pressupõe que você tenha entre 4 GB e 8 GB de memória para dar a um modelo de linguagem e esteja disposto a gastá-la. Tudo na linha de 1,7B pressupõe que você tenha algumas centenas de megabytes e nada mais. Esse único fato determina qual metade da família é relevante para você antes que qualquer benchmark o faça.
O que cada um realmente é
• Parâmetros — LLM de 1,7B com 1 bit mais um codificador de visão de 0,3B com 4 bits no modelo dos óculos, contra um modelo da classe 27B derivado do Qwen3.6-27B no Bonsai 27B.
• Contexto — 1.024 tokens no modelo de óculos, em comparação com um contexto completo de 262.000 tokens no Bonsai 27B.
• Pesos do modelo de linguagem — 0,43 GB para o 1-bit de 1,7B, contra 5,9 GB para o Bonsai 27B ternário e 3,9 GB para a sua versão 1-bit.
• Representação — pesos binários {−1, +1} com escalonamento por grupo FP16 em ambos, que é a receita de 1 bit em torno da qual a família foi construída; o Bonsai 27B também oferece uma versão ternária {−1, 0, +1} a 1,71 bits efetivos por peso.
• Silício alvo — a NPU Qualcomm Hexagon na plataforma de óculos Snapdragon AR1 Gen 1, compilada por meio de um SDK QNN com suporte a kernels de 1 bit, em comparação com o silício da Apple via MLX e a NVIDIA via CUDA para o Bonsai 27B.
• Vazão de decodificação — 15,36 tokens por segundo em uma plataforma de teste AR1 Gen 1 de 4 GB para o modelo dos óculos, em comparação com cerca de 11 tokens por segundo em um iPhone 17 Pro, 87 em um Apple M5 Max e 163 em uma RTX 5090 para o 1-bit Bonsai 27B.
Todos esses números são do fornecedor, e os dois conjuntos foram medidos em hardware diferente e comparados com linhas de base diferentes, portanto descrevem dois produtos, e não dois pontos de uma mesma curva.

Onde o Bonsai 27B vence, e não é nem de perto
O contexto vem em primeiro lugar, e a margem não é uma sutileza. Uma janela de 262.000 tokens comporta uma base de código, um documento longo, uma transcrição ou uma sessão ativa de agente com folga. Uma janela de 1.024 tokens comporta uma instrução curta e uma imagem. Se sua carga de trabalho envolve ler qualquer coisa mais longa que uma página, o Bonsai 27B é o único dos dois que consegue fazer o trabalho, e por mais engenhoso que seja o prompting no modelo dos óculos, isso não fecha essa lacuna, porque o limite é a memória reservada para o estado de chave-valor, e não o tamanho dos pesos.
A capacidade vem em segundo lugar. Relata-se que a construção ternária do Bonsai 27B mantém cerca de 95% de sua linha de base de precisão total em uma suíte de 15 benchmarks em modo de pensamento, e sua construção de 1 bit cerca de 90%, com as maiores perdas em visão e uso de ferramentas. Esses são números do fornecedor na própria suíte do fornecedor, e ainda assim são de uma ordem diferente de um modelo de 2 bilhões de parâmetros cuja única declaração de qualidade publicada é que ele alcançou "resultados comparativos de benchmark" contra um Qwen 3 1.7B de 4 bits. O modelo dos óculos não está sendo comparado a um modelo de 27B por seu próprio fabricante, porque a comparação não seria útil.
O ecossistema é o terceiro. O Bonsai 27B é distribuído em pacotes GGUF, MLX e AWQ com runtimes documentados, então há um caminho para executá-lo em hardware que você já possui. O modelo dos óculos existe dentro de uma cadeia de ferramentas de NPU da Qualcomm.

Onde o 2B vence, e é exatamente esse o ponto
Um modelo de linguagem de 0,43 GB cabe em lugares onde um de 5,9 GB não consegue ir, e a plataforma de óculos é um deles. Esse é o argumento inteiro, e é um argumento mais forte do que o contraste de especificações faz parecer, porque os dispositivos em questão não têm alternativa: um par de óculos com 4 GB de memória compartilhada da plataforma não consegue hospedar o Bonsai 27B em nenhuma build, e um telefone não consegue hospedar a build ternária sem abrir mão da maior parte daquilo para que o telefone serve.
Há uma segunda vantagem que recebe menos atenção: a representação de 1 bit não é uma concessão nessa classe de dispositivo; é o truque que a viabiliza. A própria formulação da PrismML é que o caminho de 1 bit entrega uma inteligência aproximadamente equivalente à do mesmo modelo em precisão de 4 bits, enquanto usa cerca de um quarto da memória e gera tokens a uma velocidade mais de duas vezes maior. Para um dispositivo sempre ativo, em que cada miliwatt e cada megabyte são disputados, essa troca é o produto.
Então os dois modelos não competem entre si. O 2B é o que roda quando não há mais nenhum outro lugar para rodar. O 27B é o que roda quando há.
A fronteira entre níveis é a verdadeira decisão.
Quase ninguém está escolhendo entre esses dois. A implantação realista tem os dois: um pequeno modelo sempre ativo no dispositivo para as requisições que cabem em 1.024 tokens, e algo maior por trás dele para todo o resto. Quando você aceita esse formato, a questão de engenharia deixa de ser "qual Bonsai" e passa a ser "onde está a linha, e quem a aplica".
Imposta no código da aplicação, essa linha torna-se uma ramificação que tem de ser reescrita sempre que o modelo no dispositivo muda o comprimento de contexto ou a capacidade — o que, a julgar pelas evidências dos últimos três meses, acontece aproximadamente todos os meses. Imposta como política de encaminhamento, torna-se uma única regra sobre o orçamento de contexto e a capacidade exigida, e o nível local continua a ser um nível em vez de se tornar um pressuposto embutido em todo o cliente. É nessa camada que o OrcaRouter opera: um endpoint à frente de mais de 200 modelos alojados, com failover e a política de escalonamento expressa na configuração. Nenhum dos Bonsai é encaminhado aqui — ambos são downloads que executa no seu próprio hardware —, pelo que a formulação honesta é que a camada de encaminhamento cobre o nível acima do local e, com um modelo local de 1.024 tokens, é nesse nível que irá aterrar a maior parte do tráfego.

Se você tiver que escolher um
• Você está desenvolvendo para óculos, dispositivos vestíveis ou qualquer dispositivo sempre ativo — o modelo de visão e linguagem Bonsai 2B de 1 bit é a única opção aqui, e o contexto de 1.024 tokens é a restrição de projeto em torno da qual você constrói, em vez de lutar contra ela.
• Você está desenvolvendo para um telefone — o 1-bit Bonsai 27B com 3,9 GB é o maior modelo desta família que cabe em um orçamento de memória de classe iPhone, e ele oferece a você um contexto de 262K que o modelo dos óculos não consegue alcançar.
• Você está fazendo um build para laptop ou desktop — o build ternário do Bonsai 27B é a escolha voltada para a qualidade na família, e o build de 1 bit compra velocidade em vez de capacidade.
• Você está construindo um híbrido — decida primeiro a regra de escalonamento e o modelo depois. O modelo você pode trocar; a fronteira, não — uma vez que ela esteja no cliente.
O que vale a pena observar é se o caminho da NPU que tornou possível o lançamento dos óculos se estende para cima. Se kernels de 1 bit em aceleradores móveis se generalizarem, a linha de 1,7B cresce e o argumento a favor de um modelo de 27B num telefone fica mais forte. Até então, as duas metades da família permanecem claramente separadas por classe de dispositivo, o que torna a escolha mais fácil do que o nome compartilhado sugere.
