
Bonsai em Óculos Inteligentes: Um VLM de 2B e 1 Bit Rodando no Snapdragon AR1 Gen 1
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
O número que determina para que este anúncio realmente serve não é 4x e não é 2x. É 1.024 — o comprimento de contexto do modelo que a PrismML colocou em um par de óculos inteligentes no Snapdragon Summit, em 23 de setembro de 2026. O modelo de visão e linguagem 1-bit Bonsai 2B, um sistema de 2 bilhões de parâmetros construído sobre o Bonsai 1.7B, roda localmente em óculos inteligentes de IA com a plataforma Snapdragon AR1 Gen 1, e os números que a PrismML destaca são memória e velocidade: 0,43 GB de pesos do LLM contra 1,66 GB para o modelo 1.7B de 4 bits correspondente, uma redução de 3,83x, e 15,36 tokens por segundo contra 7,44, uma melhoria de 2,06x. Ambos os números são do próprio fornecedor, ambos foram medidos em uma plataforma de teste de 4 GB, e ambos são medidos em comparação com um modelo Qwen 3 1.7B de 4 bits. Eles não são medidos contra nenhum Bonsai 27B, e não são medidos contra nada hospedado. Lê-los como uma afirmação sobre a qualidade do Bonsai seria um erro; lê-los como uma afirmação sobre o que cabe em um orçamento de memória da classe de óculos é o correto.
O que foi anunciado, em um só lugar
O anúncio da PrismML — datado de Pasadena, ligado à Snapdragon Summit da Qualcomm — coloca um modelo de visão-linguagem de 2 bilhões de parâmetros na plataforma de óculos AR1 Gen 1. A divisão é um modelo de linguagem de 1,7B com 1 bit mais um codificador de visão de 0,3B com 4 bits, com um comprimento de contexto de 1.024 tokens. Ele é construído sobre o Bonsai 1.7B da PrismML, portanto está na extremidade menor da família Bonsai, em vez de ser uma nova arquitetura, e foi compilado para a Qualcomm Hexagon NPU usando um QNN SDK interno com suporte a kernel de 1 bit.
A manchete afirma, conforme declarado pelo fornecedor:
• Acomoda um modelo com 4x mais parâmetros dentro das mesmas restrições de memória em alguns fatores de forma de óculos.
• Entrega aproximadamente a inteligência equivalente do mesmo modelo em precisão de 4 bits, usando cerca de 4x menos memória.
• Gera tokens a mais de 2x a velocidade.
Essas três frases são o comunicado. As medições específicas por trás das alegações de memória e velocidade são os 0,43 GB contra 1,66 GB e os 15,36 contra 7,44 tokens por segundo, ambos em uma plataforma configurada com 4 GB de memória. O próprio AR1 Gen 1 é citado com um pico de 6 TOPS e 2.304 MACs por ciclo — um número para a plataforma, não para inferência de modelos de linguagem, uma distinção que os próprios números do anúncio deixam clara ao citar tokens por segundo separadamente.

O 4x é uma alegação de memória, e o baseline é um modelo diferente.
Esta é a parte que merece uma pausa, porque "4x" é o tipo de número que viaja mais longe do que a frase de onde saiu. Todas as comparações que a PrismML publicou para o modelo dos óculos são contra uma quantização de 4 bits do Qwen 3 1.7B — a mesma classe de parâmetros, o mesmo trabalho, uma quantização diferente. Essa é uma comparação legítima e útil: é a comparação que um OEM de óculos realmente enfrenta, em que a questão é se um caminho de 1 bit recupera memória suficiente para valer o trabalho com kernel. Não é uma comparação com uma versão de 4 bits do Bonsai, nem é uma comparação com um Bonsai maior rodando em outro lugar.
A nota de rodapé sobre benchmarks anexada ao anúncio é cautelosa da mesma forma. A PrismML avaliou o LLM de 1 bit Bonsai 1.7B em comparação com o modelo de 4 bits Qwen 3 1.7B em setembro de 2026 nos benchmarks BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K e GPQA Diamond, e o resultado relatado é que as duas configurações "obtiveram resultados comparativos de benchmark". Comparativos, não superiores. Não há pontuações por benchmark no anúncio nem reprodução independente de qualquer parte disso, o que é normal para uma versão edge lançada na semana de lançamento e é exatamente por isso que os números devem ser tratados como informados pelo fornecedor até que alguém fora da PrismML os execute.
1.024 tokens é a especificação que molda o produto
Um modelo de linguagem visual em óculos é uma carga de trabalho diferente de um modelo de linguagem visual numa janela de chat, e é no comprimento do contexto que isso se evidencia. Com 1.024 tokens, o modelo consegue manter uma instrução curta mais aquilo que uma câmara está neste momento a ver. Não consegue manter um histórico de conversa, um documento ou uma longa cadeia de turnos anteriores. Isso não é um defeito do lançamento — é a restrição que tornou o lançamento possível, porque a cache KV e as ativações têm de viver nos mesmos 4 GB que os pesos, e um modelo da classe 27B com um contexto de 262K tokens precisa de ordens de magnitude mais de espaço para esse estado.
Então, a descrição honesta do que foi lançado é a de um assistente competente para contextos curtos que é executado inteiramente no dispositivo. Tarefas no formato de óculos — reconhecer isto, ler aquilo, traduzir a placa à minha frente, responder a uma pergunta sobre o que estou olhando — cabem em 1.024 tokens. Qualquer coisa que precise se lembrar dos últimos dez minutos não cabe, e nenhuma quantidade de compressão de 1 bit muda isso, porque o limite é o estado, não os pesos.
O que o ecossistema de edge deve tirar disso
A engenharia genuinamente nova neste anúncio não é o modelo. É o caminho do kernel: um LLM de 1 bit compilado para a NPU Hexagon por meio de um SDK QNN com suporte a kernels de 1 bit. Pesos de baixa precisão já são executáveis em CPUs e GPUs há algum tempo, e os próprios lançamentos do Bonsai 27B da PrismML demonstraram isso em Apple silicon e em hardware NVIDIA. Levar kernels de pesos binários para uma NPU móvel é um problema diferente, porque o caminho de dados do acelerador, o seu formato de empacotamento e o seu agendamento têm todos de acomodar uma representação que não é de todo um tipo float.
Se esse caminho se generalizar para além deste único modelo — e a linguagem do SDK sugere que a PrismML pretende que isso aconteça —, então a consequência interessante é que a família de 1 bit deixa de ser uma história de laptops e celulares e passa a ser uma história de dispositivos sempre ativos. A plataforma de 4 GB no anúncio é o teto atual. Qualquer coisa que reduza a pegada de pesos com qualidade fixa aumenta o tamanho do modelo que cabe sob esse teto.

A alegação de processamento no dispositivo merece uma ressalva.
A inferência multimodal totalmente local em um par de óculos é uma afirmação forte, e vale a pena separar o que está demonstrado do que está implícito. O AR1 Gen 1 é uma plataforma de óculos criada para sensoriamento e áudio sempre ativos; o próprio enquadramento da Qualcomm para modelos de linguagem no dispositivo tem sido geralmente híbrido, com o dispositivo cuidando do que consegue e entregando o restante a um telefone pareado ou à nuvem. A primeira demonstração pública da Qualcomm de um modelo de linguagem pequeno no dispositivo estava vinculada à plataforma AR1+ Gen 1, e não ao AR1 Gen 1. Nenhum desses pontos contradiz o anúncio da PrismML — o anúncio diz que o modelo roda localmente no AR1 Gen 1, e os próprios números de vazão e memória do fornecedor são consistentes com um modelo pequeno fazendo exatamente isso —, mas eles significam que o produto prático construído sobre isso será quase certamente um nível local com um caminho de escalonamento, e não um dispositivo que nunca se comunica com qualquer outra coisa.
De qualquer forma, essa é a arquitetura certa. Um modelo local de 1.024 tokens é muito bom para as requisições que cabem em 1.024 tokens e não consegue responder às que não cabem.
Onde o caminho de escalonamento pertence
Para quem está construindo com base em um lançamento como este, a questão de design não é se o modelo dos óculos é bom — é o que acontece com a requisição que ele não consegue atender. Respondida no código da aplicação, ela se torna um monte de casos especiais que precisam ser reescritos toda vez que o modelo no dispositivo muda de tamanho ou de contexto. Respondida como uma política de roteamento, ela se torna uma única regra: requisições que ultrapassam o orçamento de contexto da camada local, ou que exigem ferramentas ou raciocínio que a camada local não possui, escalam para um modelo hospedado. Essa política é o tipo de coisa para a qual o OrcaRouter existe — um endpoint na frente de mais de 200 modelos hospedados, com failover e a política expressa em configuração, e não no cliente. O próprio Bonsai não é roteado aqui; é um download que você executa no seu próprio hardware. O que a camada de roteamento cobre é a fronteira acima dele, e é nessa fronteira que uma implantação de óculos vai gastar a maior parte do seu tempo de engenharia.

O que assistir em seguida
Três coisas fariam isto passar de um anúncio para uma plataforma. Um detalhamento por benchmark por trás da linha de "resultados comparativos", para que o trade-off em relação ao 4-bit fique visível em vez de resumido. Uma janela de contexto maior no mesmo caminho da NPU, que é um problema de memória de estado, e não de pesos, e que, portanto, é a mais difícil das duas. E uma avaliação independente do LLM de 1-bit e 1,7B em comparação com sua contraparte de 4-bit, porque todos os números neste lançamento vêm atualmente da parte que o construiu.
Até então, o resumo preciso é restrito e útil: um modelo multimodal de 2 bilhões de parâmetros agora roda em um dispositivo da classe de óculos com 0,43 GB de pesos de linguagem, a aproximadamente o dobro da velocidade e cerca de um quarto da memória do equivalente de 4 bits, em um orçamento de contexto de 1.024 tokens. Isso é um passo real para a inferência no dispositivo e um passo pequeno para a capacidade do modelo, e as duas não são a mesma afirmação.
