
스마트 안경에서의 Bonsai: Snapdragon AR1 Gen 1에서 실행되는 2B 1비트 VLM
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
이 발표가 실제로 무엇에 유용한지를 결정하는 숫자는 4배가 아니고 2배도 아니다. 그것은 1,024다 — 2026년 9월 23일 Snapdragon Summit에서 PrismML이 한 쌍의 스마트 안경에 올린 모델의 컨텍스트 길이이다. Bonsai 1.7B를 기반으로 구축된 20억 매개변수 시스템인 1비트 Bonsai 2B 비전-언어 모델은 Snapdragon AR1 Gen 1 플랫폼으로 구동되는 AI 스마트 안경에서 로컬로 실행되며, PrismML이 앞세우는 수치는 메모리와 속도다: LLM 가중치 0.43GB는 해당 4비트 1.7B 모델의 1.66GB에 대비해 3.83배 감소했고, 초당 15.36 토큰은 7.44에 대비해 2.06배 향상되었다. 두 수치 모두 벤더 자체 측정치이며, 둘 다 4GB 테스트 플랫폼에서 측정되었고, 둘 다 Qwen 3 1.7B 4비트 모델과 비교해 측정되었다. Bonsai 27B와 비교해 측정된 것이 아니며, 호스팅된 어떤 것과도 비교해 측정된 것이 아니다. 이것을 Bonsai의 품질에 대한 주장으로 읽는 것은 실수일 것이다; 안경급 메모리 예산에 무엇이 들어가는지에 대한 주장으로 읽는 것이 올바르다.
무엇이 발표되었는지, 한곳에서
PrismML의 발표 — 패서디나에서 발신되었으며 Qualcomm의 Snapdragon Summit과 연결된 — 는 20억 개 파라미터의 비전-언어 모델을 AR1 Gen 1 안경 플랫폼에 올린다. 구성은 1.7B 1비트 언어 모델에 0.3B 4비트 비전 인코더를 더한 것이며, 컨텍스트 길이는 1,024 토큰이다. 이는 PrismML의 Bonsai 1.7B를 기반으로 하므로 새로운 아키텍처라기보다는 Bonsai 제품군의 가장 작은 쪽에 해당하며, 1비트 커널 지원이 포함된 내부 QNN SDK를 사용해 Qualcomm Hexagon NPU용으로 컴파일되었다.
헤드라인은 공급업체가 밝힌 대로 다음과 같이 주장합니다:
• 일부 안경 폼 팩터에서 동일한 메모리 제약 조건 내에서 4배 더 많은 매개변수를 갖춘 모델을 수용합니다.
• 동일한 모델을 4비트 정밀도로 사용할 때와 거의 동등한 지능을 제공하면서 약 4배 적은 메모리를 사용합니다.
• 2배 이상의 속도로 토큰을 생성합니다.
그 세 문장이 이번 발표문이다. 메모리와 속도에 관한 주장의 근거가 되는 구체적 측정치는 0.43GB 대 1.66GB, 그리고 초당 토큰 15.36 대 7.44이며, 둘 다 4GB 메모리로 구성된 플랫폼에서 측정된 것이다. AR1 Gen 1 자체는 최대 6 TOPS와 사이클당 2,304 MACs로 제시되는데, 이는 언어 모델 추론이 아니라 플랫폼에 관한 수치다. 이는 발표문 자체의 수치가 초당 토큰을 별도로 제시함으로써 분명히 하는 구분이다.

4x는 메모리 관련 주장이고, 베이스라인은 다른 모델입니다.
여기서 잠시 속도를 늦춰 짚어볼 만한 부분이 있습니다. 왜냐하면 "4x"는 원래 문장보다 더 멀리 퍼져 나가는 종류의 수치이기 때문입니다. PrismML이 안경용 모델을 위해 공개한 모든 비교는 Qwen 3 1.7B의 4비트 양자화와의 비교입니다 — 동일한 파라미터 등급, 동일한 작업, 다른 양자화입니다. 이는 타당하고 유용한 비교입니다: 안경 OEM이 실제로 직면하는 비교이며, 여기서의 질문은 1비트 경로가 커널 작업을 감수할 만큼 충분한 메모리를 되찾아 주는가입니다. 그것은 Bonsai의 4비트 버전과의 비교가 아니며, 다른 어딘가에서 실행되는 더 큰 Bonsai와의 비교도 아닙니다.
발표문에 첨부된 벤치마크 각주도 같은 방식으로 신중하다. PrismML은 2026년 9월에 Bonsai 1.7B 1비트 LLM을 Qwen 3 1.7B 4비트 모델과 비교해 BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K, GPQA Diamond 전반에서 평가했으며, 보고된 결과는 두 구성이 "비교 가능한 벤치마크 결과를 달성했다"는 것이다. 비교 가능한 것이지, 우월한 것은 아니다. 발표문에는 벤치마크별 점수가 없고, 이 중 어느 것도 독립적으로 재현되지 않았는데, 이는 출시 주간 엣지 릴리스에서는 정상이며, 바로 그래서 PrismML 외부의 누군가가 이들을 실행하기 전까지는 이 수치를 공급업체 보고로 취급해야 하는 이유다.
1,024 토큰은 제품을 형성하는 사양이다
안경 위의 비전-언어 모델은 채팅 창 속 비전-언어 모델과는 다른 워크로드이며, 컨텍스트 길이에서 그 차이가 드러난다. 1,024 토큰에서 모델은 짧은 지시와 카메라가 현재 보고 있는 것을 담을 수 있다. 대화 기록이나 문서, 또는 이전 턴들의 긴 연쇄는 담을 수 없다. 이는 이 릴리스의 결함이 아니라, 릴리스를 가능하게 만든 제약이다. KV 캐시와 활성화가 가중치와 같은 4GB 안에 상주해야 하고, 262K 토큰 컨텍스트를 가진 27B급 모델은 그 상태를 위해 몇 자릿수 더 많은 공간을 필요로 하기 때문이다.
그래서 실제로 출시된 것에 대한 솔직한 설명은 전적으로 기기에서 실행되는 유능한 단기 문맥 어시스턴트입니다. 안경형 작업 — 이것을 인식하고, 저것을 읽고, 내 앞의 표지판을 번역하고, 내가 보고 있는 것에 대한 질문에 답하는 일 — 은 1,024 토큰 안에 들어갑니다. 지난 10분을 기억해야 하는 것은 그렇지 않으며, 1비트 압축을 아무리 해도 그것은 바뀌지 않습니다. 한계는 가중치가 아니라 상태이기 때문입니다.
엣지 생태계가 여기서 무엇을 배워야 하는가
이번 발표에서 진정으로 새로운 엔지니어링은 모델이 아니다. 그것은 커널 경로다. 즉, 1비트 커널 지원을 갖춘 QNN SDK를 통해 Hexagon NPU용으로 컴파일된 1비트 LLM이다. 저비트 가중치는 한동안 CPU와 GPU에서 실행 가능했으며, PrismML 자체의 Bonsai 27B 릴리스가 Apple 실리콘과 NVIDIA 하드웨어에서 이를 입증했다. 이진 가중치 커널을 모바일 NPU에 올리는 것은 다른 문제다. 가속기의 데이터 경로, 패킹 형식, 스케줄링 모두가 부동소수점 타입이 전혀 아닌 표현을 수용해야 하기 때문이다.
그 경로가 이 하나의 모델을 넘어 일반화된다면 — 그리고 SDK 문구는 PrismML이 그렇게 되기를 의도한다는 것을 시사한다 — 흥미로운 결과는 1비트 제품군이 더 이상 노트북과 휴대폰 이야기가 아니라 상시 작동 기기 이야기가 된다는 점이다. 발표에 나온 4 GB 플랫폼이 현재의 상한이다. 고정된 품질에서 가중치 풋프린트를 낮추는 모든 것은 그 아래에 들어가는 모델 크기를 키운다.

온디바이스 주장에는 한 가지 주의가 필요하다
안경 한 켤레에서 완전한 로컬 멀티모달 추론을 수행한다는 것은 강한 주장이며, 무엇이 입증되었는지와 무엇이 암시되는지를 구분할 가치가 있습니다. AR1 Gen 1은 상시 센싱과 오디오를 위해 만들어진 안경 플랫폼이며, Qualcomm이 온디바이스 언어 모델에 대해 제시해 온 틀은 일반적으로 하이브리드 방식으로, 기기가 처리할 수 있는 부분은 기기에서 처리하고 나머지는 페어링된 휴대폰이나 클라우드로 넘기는 형태였습니다. Qualcomm의 첫 공개 온디바이스 소형 언어 모델 시연은 AR1 Gen 1이 아니라 AR1+ Gen 1 플랫폼과 연결되어 있었습니다. 어느 점도 PrismML의 발표와 모순되지 않습니다. 그 발표는 모델이 AR1 Gen 1에서 로컬로 실행된다고 말하며, 벤더 자체의 처리량 및 메모리 수치는 소형 모델이 정확히 그렇게 하고 있음과 일치합니다. 그러나 이는 이 위에 구축되는 실제 제품이 거의 확실히 로컬 계층과 에스컬레이션 경로를 갖춘 제품이 될 것이며, 다른 무엇과도 결코 통신하지 않는 기기가 되지는 않을 것임을 의미합니다.
어쨌든 그게 올바른 아키텍처입니다. 1,024 토큰 로컬 모델은 1,024 토큰에 들어맞는 요청은 아주 잘 처리하지만, 그렇지 않은 요청에는 답할 수 없습니다.
에스컬레이션 경로가 있어야 할 곳
이런 릴리스 위에 무언가를 구축하려는 사람에게 설계상의 질문은 안경 모델이 좋은지가 아니라, 그것이 처리할 수 없는 요청에 무슨 일이 일어나는가입니다. 애플리케이션 코드에서 답을 내리면, 온디바이스 모델의 크기나 컨텍스트가 바뀔 때마다 다시 작성해야 하는 특수 사례 더미가 됩니다. 라우팅 정책으로 답을 내리면 하나의 규칙이 됩니다. 로컬 티어의 컨텍스트 예산을 넘어서거나 로컬 티어에 없는 도구나 추론을 필요로 하는 요청은 호스팅 모델로 에스컬레이션됩니다. 그런 정책이 바로 OrcaRouter가 존재하는 이유입니다 — 200개 이상의 호스팅 모델 앞에 놓인 하나의 엔드포인트, 페일오버와 함께 정책이 클라이언트가 아니라 구성에 표현되는. Bonsai 자체는 여기서 라우팅되지 않습니다. 그것은 여러분의 하드웨어에서 직접 실행하는 다운로드입니다. 라우팅 계층이 담당하는 것은 그 위의 경계이며, 그 경계야말로 안경 배포가 엔지니어링 시간의 대부분을 쏟게 될 지점입니다.

다음에 볼 콘텐츠
이것을 발표에서 플랫폼으로 끌어올릴 세 가지가 있습니다. 첫째는 "비교 결과" 줄 뒤에 벤치마크별 분석을 제공하여 4-bit와의 트레이드오프가 요약되는 대신 눈에 보이도록 하는 것입니다. 둘째는 동일한 NPU 경로에서 더 큰 컨텍스트 윈도우를 제공하는 것인데, 이는 가중치 문제라기보다 상태 메모리 문제이므로 둘 중 더 어려운 일입니다. 셋째는 1-bit 1.7B LLM을 4-bit 대응 모델과 비교하는 독립적인 평가입니다. 왜냐하면 이번 릴리스의 모든 수치는 현재 그것을 만든 당사자로부터 나온 것이기 때문입니다.
그때까지 정확한 요약은 좁고 유용하다: 20억 매개변수 멀티모달 모델이 이제 안경급 기기에서 0.43GB의 언어 가중치로, 4비트 동등 모델보다 약 두 배 빠르고 약 4분의 1의 메모리로, 1,024토큰의 컨텍스트 예산에서 실행된다. 이는 온디바이스 추론에는 실제 진전이고 모델 능력에는 작은 진전이며, 이 둘은 같은 주장이 아니다.
