Um cartão de título gerado com o texto 'Bonsai on Smart Glasses' e o subtítulo 'Um modelo de visão e linguagem de 1 bit com 2 bilhões de parâmetros rodando localmente', acima de três cartões com os textos 'LLM de 1 bit com 1,7B + codificador de visão de 4 bits com 0,3B', 'Contexto: 1.024 tokens' e 'Pesos do LLM: 0,43 GB vs 1,66 GB em 4 bits', com um rodapé com o texto 'Números informados pelo fornecedor, setembro de 2026.' O logotipo da OrcaRouter fica no canto inferior direito.
Engineering & Research

Bonsai em Óculos Inteligentes: Um VLM de 2B e 1 Bit Rodando no Snapdragon AR1 Gen 1

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O número que determina para que este anúncio realmente serve não é 4x e não é 2x. É 1.024 — o comprimento de contexto do modelo que a PrismML colocou em um par de óculos inteligentes no Snapdragon Summit, em 23 de setembro de 2026. O modelo de visão e linguagem 1-bit Bonsai 2B, um sistema de 2 bilhões de parâmetros construído sobre o Bonsai 1.7B, roda localmente em óculos inteligentes de IA com a plataforma Snapdragon AR1 Gen 1, e os números que a PrismML destaca são memória e velocidade: 0,43 GB de pesos do LLM contra 1,66 GB para o modelo 1.7B de 4 bits correspondente, uma redução de 3,83x, e 15,36 tokens por segundo contra 7,44, uma melhoria de 2,06x. Ambos os números são do próprio fornecedor, ambos foram medidos em uma plataforma de teste de 4 GB, e ambos são medidos em comparação com um modelo Qwen 3 1.7B de 4 bits. Eles não são medidos contra nenhum Bonsai 27B, e não são medidos contra nada hospedado. Lê-los como uma afirmação sobre a qualidade do Bonsai seria um erro; lê-los como uma afirmação sobre o que cabe em um orçamento de memória da classe de óculos é o correto.

O que foi anunciado, em um só lugar

O anúncio da PrismML — datado de Pasadena, ligado à Snapdragon Summit da Qualcomm — coloca um modelo de visão-linguagem de 2 bilhões de parâmetros na plataforma de óculos AR1 Gen 1. A divisão é um modelo de linguagem de 1,7B com 1 bit mais um codificador de visão de 0,3B com 4 bits, com um comprimento de contexto de 1.024 tokens. Ele é construído sobre o Bonsai 1.7B da PrismML, portanto está na extremidade menor da família Bonsai, em vez de ser uma nova arquitetura, e foi compilado para a Qualcomm Hexagon NPU usando um QNN SDK interno com suporte a kernel de 1 bit.

A manchete afirma, conforme declarado pelo fornecedor:

• Acomoda um modelo com 4x mais parâmetros dentro das mesmas restrições de memória em alguns fatores de forma de óculos.

• Entrega aproximadamente a inteligência equivalente do mesmo modelo em precisão de 4 bits, usando cerca de 4x menos memória.

• Gera tokens a mais de 2x a velocidade.

Essas três frases são o comunicado. As medições específicas por trás das alegações de memória e velocidade são os 0,43 GB contra 1,66 GB e os 15,36 contra 7,44 tokens por segundo, ambos em uma plataforma configurada com 4 GB de memória. O próprio AR1 Gen 1 é citado com um pico de 6 TOPS e 2.304 MACs por ciclo — um número para a plataforma, não para inferência de modelos de linguagem, uma distinção que os próprios números do anúncio deixam clara ao citar tokens por segundo separadamente.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model running locally on AI smart glasses powered by the Snapdragon AR1 Gen 1 Platform, fitted with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder and a 1,024-token context.

O 4x é uma alegação de memória, e o baseline é um modelo diferente.

Esta é a parte que merece uma pausa, porque "4x" é o tipo de número que viaja mais longe do que a frase de onde saiu. Todas as comparações que a PrismML publicou para o modelo dos óculos são contra uma quantização de 4 bits do Qwen 3 1.7B — a mesma classe de parâmetros, o mesmo trabalho, uma quantização diferente. Essa é uma comparação legítima e útil: é a comparação que um OEM de óculos realmente enfrenta, em que a questão é se um caminho de 1 bit recupera memória suficiente para valer o trabalho com kernel. Não é uma comparação com uma versão de 4 bits do Bonsai, nem é uma comparação com um Bonsai maior rodando em outro lugar.

A nota de rodapé sobre benchmarks anexada ao anúncio é cautelosa da mesma forma. A PrismML avaliou o LLM de 1 bit Bonsai 1.7B em comparação com o modelo de 4 bits Qwen 3 1.7B em setembro de 2026 nos benchmarks BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K e GPQA Diamond, e o resultado relatado é que as duas configurações "obtiveram resultados comparativos de benchmark". Comparativos, não superiores. Não há pontuações por benchmark no anúncio nem reprodução independente de qualquer parte disso, o que é normal para uma versão edge lançada na semana de lançamento e é exatamente por isso que os números devem ser tratados como informados pelo fornecedor até que alguém fora da PrismML os execute.

1.024 tokens é a especificação que molda o produto

Um modelo de linguagem visual em óculos é uma carga de trabalho diferente de um modelo de linguagem visual numa janela de chat, e é no comprimento do contexto que isso se evidencia. Com 1.024 tokens, o modelo consegue manter uma instrução curta mais aquilo que uma câmara está neste momento a ver. Não consegue manter um histórico de conversa, um documento ou uma longa cadeia de turnos anteriores. Isso não é um defeito do lançamento — é a restrição que tornou o lançamento possível, porque a cache KV e as ativações têm de viver nos mesmos 4 GB que os pesos, e um modelo da classe 27B com um contexto de 262K tokens precisa de ordens de magnitude mais de espaço para esse estado.

Então, a descrição honesta do que foi lançado é a de um assistente competente para contextos curtos que é executado inteiramente no dispositivo. Tarefas no formato de óculos — reconhecer isto, ler aquilo, traduzir a placa à minha frente, responder a uma pergunta sobre o que estou olhando — cabem em 1.024 tokens. Qualquer coisa que precise se lembrar dos últimos dez minutos não cabe, e nenhuma quantidade de compressão de 1 bit muda isso, porque o limite é o estado, não os pesos.

O que o ecossistema de edge deve tirar disso

A engenharia genuinamente nova neste anúncio não é o modelo. É o caminho do kernel: um LLM de 1 bit compilado para a NPU Hexagon por meio de um SDK QNN com suporte a kernels de 1 bit. Pesos de baixa precisão já são executáveis em CPUs e GPUs há algum tempo, e os próprios lançamentos do Bonsai 27B da PrismML demonstraram isso em Apple silicon e em hardware NVIDIA. Levar kernels de pesos binários para uma NPU móvel é um problema diferente, porque o caminho de dados do acelerador, o seu formato de empacotamento e o seu agendamento têm todos de acomodar uma representação que não é de todo um tipo float.

Se esse caminho se generalizar para além deste único modelo — e a linguagem do SDK sugere que a PrismML pretende que isso aconteça —, então a consequência interessante é que a família de 1 bit deixa de ser uma história de laptops e celulares e passa a ser uma história de dispositivos sempre ativos. A plataforma de 4 GB no anúncio é o teto atual. Qualquer coisa que reduza a pegada de pesos com qualidade fixa aumenta o tamanho do modelo que cabe sob esse teto.

A screenshot of the Hugging Face model page for prism-ml/Bonsai-1.7B-mlx-1bit, PrismML's 1-bit Bonsai 1.7B language model — the parameter class and 1-bit representation that the glasses release is built on.

A alegação de processamento no dispositivo merece uma ressalva.

A inferência multimodal totalmente local em um par de óculos é uma afirmação forte, e vale a pena separar o que está demonstrado do que está implícito. O AR1 Gen 1 é uma plataforma de óculos criada para sensoriamento e áudio sempre ativos; o próprio enquadramento da Qualcomm para modelos de linguagem no dispositivo tem sido geralmente híbrido, com o dispositivo cuidando do que consegue e entregando o restante a um telefone pareado ou à nuvem. A primeira demonstração pública da Qualcomm de um modelo de linguagem pequeno no dispositivo estava vinculada à plataforma AR1+ Gen 1, e não ao AR1 Gen 1. Nenhum desses pontos contradiz o anúncio da PrismML — o anúncio diz que o modelo roda localmente no AR1 Gen 1, e os próprios números de vazão e memória do fornecedor são consistentes com um modelo pequeno fazendo exatamente isso —, mas eles significam que o produto prático construído sobre isso será quase certamente um nível local com um caminho de escalonamento, e não um dispositivo que nunca se comunica com qualquer outra coisa.

De qualquer forma, essa é a arquitetura certa. Um modelo local de 1.024 tokens é muito bom para as requisições que cabem em 1.024 tokens e não consegue responder às que não cabem.

Onde o caminho de escalonamento pertence

Para quem está construindo com base em um lançamento como este, a questão de design não é se o modelo dos óculos é bom — é o que acontece com a requisição que ele não consegue atender. Respondida no código da aplicação, ela se torna um monte de casos especiais que precisam ser reescritos toda vez que o modelo no dispositivo muda de tamanho ou de contexto. Respondida como uma política de roteamento, ela se torna uma única regra: requisições que ultrapassam o orçamento de contexto da camada local, ou que exigem ferramentas ou raciocínio que a camada local não possui, escalam para um modelo hospedado. Essa política é o tipo de coisa para a qual o OrcaRouter existe — um endpoint na frente de mais de 200 modelos hospedados, com failover e a política expressa em configuração, e não no cliente. O próprio Bonsai não é roteado aqui; é um download que você executa no seu próprio hardware. O que a camada de roteamento cobre é a fronteira acima dele, e é nessa fronteira que uma implantação de óculos vai gastar a maior parte do seu tempo de engenharia.

A generated scoreboard titled 'Bonsai 2B VLM on Snapdragon AR1 Gen 1 — the scoreboard', listing: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; context 1,024 tokens; LLM weights 0.43 GB versus 1.66 GB for a 4-bit 1.7B; decode speed 15.36 versus 7.44 tokens per second; accelerator Qualcomm Hexagon NPU via a QNN SDK with 1-bit kernel support; test platform 4 GB of memory. Footer reads 'All figures vendor-reported, September 2026; comparison baseline is a 4-bit Qwen 3 1.7B, not another Bonsai.' The OrcaRouter logo sits in the bottom-right.

O que assistir em seguida

Três coisas fariam isto passar de um anúncio para uma plataforma. Um detalhamento por benchmark por trás da linha de "resultados comparativos", para que o trade-off em relação ao 4-bit fique visível em vez de resumido. Uma janela de contexto maior no mesmo caminho da NPU, que é um problema de memória de estado, e não de pesos, e que, portanto, é a mais difícil das duas. E uma avaliação independente do LLM de 1-bit e 1,7B em comparação com sua contraparte de 4-bit, porque todos os números neste lançamento vêm atualmente da parte que o construiu.

Até então, o resumo preciso é restrito e útil: um modelo multimodal de 2 bilhões de parâmetros agora roda em um dispositivo da classe de óculos com 0,43 GB de pesos de linguagem, a aproximadamente o dobro da velocidade e cerca de um quarto da memória do equivalente de 4 bits, em um orçamento de contexto de 1.024 tokens. Isso é um passo real para a inferência no dispositivo e um passo pequeno para a capacidade do modelo, e as duas não são a mesma afirmação.