
Bonsai pada Kacamata Pintar: VLM 2B 1-Bit yang Berjalan di Snapdragon AR1 Gen 1
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 36 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 182 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Angka yang menentukan untuk apa pengumuman ini sebenarnya berguna bukanlah 4x dan bukan 2x. Angka itu 1.024 — panjang konteks model yang dipasang PrismML pada sepasang kacamata pintar di Snapdragon Summit pada 23 September 2026. Model visi-bahasa Bonsai 2B 1-bit, sistem 2 miliar parameter yang dibangun di atas Bonsai 1.7B, berjalan secara lokal pada kacamata pintar AI yang ditenagai Snapdragon AR1 Gen 1 Platform, dan angka yang diunggulkan PrismML adalah memori dan kecepatan: 0,43 GB bobot LLM dibandingkan 1,66 GB untuk model 1.7B 4-bit yang setara, pengurangan 3,83x, dan 15,36 token per detik dibandingkan 7,44, peningkatan 2,06x. Kedua angka itu milik vendor sendiri, keduanya diukur pada platform pengujian 4 GB, dan keduanya diukur terhadap model Qwen 3 1.7B 4-bit. Keduanya tidak diukur terhadap Bonsai 27B mana pun, dan tidak diukur terhadap apa pun yang dihosting. Membacanya sebagai klaim tentang kualitas Bonsai adalah kesalahan; membacanya sebagai klaim tentang apa yang muat dalam anggaran memori kelas kacamata adalah hal yang tepat.
Apa yang diumumkan, di satu tempat
Pengumuman PrismML — bertanggal Pasadena, terkait dengan Qualcomm Snapdragon Summit — menempatkan model visi-bahasa 2 miliar parameter pada platform kacamata AR1 Gen 1. Pembagiannya adalah model bahasa 1-bit 1,7B ditambah encoder visi 4-bit 0,3B, dengan panjang konteks 1.024 token. Model ini dibangun di atas Bonsai 1.7B milik PrismML, jadi ini adalah ujung kecil dari keluarga Bonsai, bukan arsitektur baru, dan dikompilasi untuk Qualcomm Hexagon NPU menggunakan QNN SDK internal dengan dukungan kernel 1-bit.
Judul berita mengklaim, sebagaimana dinyatakan oleh vendor:
• Dapat memuat model dengan 4x lebih banyak parameter dalam batasan memori yang sama pada beberapa faktor bentuk kacamata.
• Memberikan kecerdasan yang kira-kira setara dengan model yang sama pada presisi 4-bit sambil menggunakan sekitar 4x lebih sedikit memori.
• Menghasilkan token lebih dari 2 kali lebih cepat.
Tiga kalimat itu adalah rilisnya. Pengukuran spesifik di balik klaim memori dan kecepatan adalah 0,43 GB versus 1,66 GB dan 15,36 versus 7,44 token per detik, keduanya pada platform yang dikonfigurasi dengan memori 4 GB. AR1 Gen 1 sendiri disebut memiliki puncak 6 TOPS dan 2.304 MAC per siklus — angka untuk platform, bukan untuk inferensi model bahasa, yang merupakan perbedaan yang diperjelas oleh angka-angka dalam pengumuman itu sendiri dengan menyebutkan token per detik secara terpisah.

4x adalah klaim memori, dan baseline-nya adalah model yang berbeda.
Inilah bagian yang layak untuk diperlambat, karena "4x" adalah jenis angka yang menyebar lebih jauh daripada kalimat asalnya. Setiap perbandingan yang diterbitkan PrismML untuk model kacamata itu adalah terhadap kuantisasi 4-bit dari Qwen 3 1.7B — kelas parameter yang sama, pekerjaan yang sama, kuantisasi yang berbeda. Itu adalah perbandingan yang sah dan berguna: itulah perbandingan yang sebenarnya dihadapi OEM kacamata, di mana pertanyaannya adalah apakah jalur 1-bit mengembalikan cukup memori agar sepadan dengan kerja kernel. Itu bukan perbandingan terhadap versi 4-bit dari Bonsai, dan bukan perbandingan terhadap Bonsai yang lebih besar yang dijalankan di tempat lain.
Catatan kaki benchmark yang dilampirkan pada pengumuman itu sama berhati-hatinya. PrismML mengevaluasi LLM 1-bit Bonsai 1.7B terhadap model 4-bit Qwen 3 1.7B pada September 2026 di seluruh BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K, dan GPQA Diamond, dan hasil yang dilaporkan adalah bahwa kedua konfigurasi tersebut "mencapai hasil benchmark yang komparatif". Komparatif, bukan lebih unggul. Tidak ada skor per benchmark dalam pengumuman itu dan tidak ada reproduksi independen atas semua itu, yang merupakan hal normal untuk rilis edge minggu peluncuran dan justru itulah sebabnya angka-angka tersebut harus dianggap sebagai dilaporkan vendor sampai seseorang di luar PrismML menjalankannya.
1.024 token adalah spesifikasi yang membentuk produk
Model visi-bahasa di kacamata adalah beban kerja yang berbeda dari model visi-bahasa di jendela obrolan, dan panjang konteks adalah tempat hal itu terlihat. Pada 1.024 token, model dapat menampung instruksi singkat ditambah apa yang sedang dilihat kamera. Model tidak dapat menampung riwayat percakapan, dokumen, atau rangkaian panjang giliran sebelumnya. Itu bukan cacat pada rilis ini — melainkan batasan yang membuat rilis ini mungkin, karena cache KV dan aktivasi harus berada di 4 GB yang sama dengan bobot, dan model kelas 27B dengan konteks 262K token membutuhkan ruang beberapa orde besaran lebih besar untuk keadaan itu.
Jadi deskripsi jujur dari apa yang dirilis adalah asisten konteks pendek yang mumpuni yang berjalan sepenuhnya di perangkat. Tugas-tugas berbentuk kacamata — mengenali ini, membaca itu, menerjemahkan papan tanda di depan saya, menjawab pertanyaan tentang apa yang sedang saya lihat — muat dalam 1,024 token. Apa pun yang perlu mengingat sepuluh menit terakhir tidak muat, dan tidak ada banyaknya kompresi 1-bit yang mengubah itu, karena batasnya adalah state, bukan bobot.
Apa yang harus diambil ekosistem edge darinya
Rekayasa yang benar-benar baru dalam pengumuman ini bukanlah modelnya. Melainkan jalur kernel: LLM 1-bit yang dikompilasi untuk Hexagon NPU melalui QNN SDK dengan dukungan kernel 1-bit. Bobot bit rendah sudah dapat dijalankan di CPU dan GPU selama beberapa waktu, dan rilis Bonsai 27B milik PrismML sendiri menunjukkan hal itu pada Apple silicon dan perangkat keras NVIDIA. Menempatkan kernel berbobot biner ke NPU seluler adalah masalah yang berbeda, karena jalur data akselerator, format pengemasannya, dan penjadwalannya semuanya harus mengakomodasi representasi yang sama sekali bukan tipe float.
Jika jalur itu dapat digeneralisasi melampaui model yang satu ini — dan bahasa SDK menunjukkan bahwa PrismML memang menghendakinya — maka konsekuensi menariknya adalah keluarga 1-bit tidak lagi sekadar cerita laptop dan ponsel, melainkan menjadi cerita perangkat yang selalu aktif. Platform 4 GB dalam pengumuman itu adalah batas atas saat ini. Apa pun yang menurunkan jejak bobot pada kualitas tetap akan memperbesar ukuran model yang dapat ditampung di bawahnya.

Klaim on-device itu patut diberi satu catatan.
Inferensi multimodal sepenuhnya lokal pada sepasang kacamata adalah klaim yang kuat, dan penting untuk memisahkan apa yang didemonstrasikan dari apa yang tersirat. AR1 Gen 1 adalah platform kacamata yang dibuat untuk penginderaan dan audio yang selalu aktif; kerangka Qualcomm sendiri untuk model bahasa di perangkat umumnya bersifat hibrida, dengan perangkat menangani apa yang bisa ditanganinya dan menyerahkan sisanya ke ponsel yang dipasangkan atau ke cloud. Demonstrasi publik pertama Qualcomm untuk model bahasa kecil di perangkat dikaitkan dengan platform AR1+ Gen 1, bukan AR1 Gen 1. Kedua poin itu tidak bertentangan dengan pengumuman PrismML — pengumuman tersebut menyatakan model berjalan secara lokal di AR1 Gen 1, dan angka throughput serta memori dari vendor itu sendiri konsisten dengan model kecil yang melakukan tepat hal itu — tetapi keduanya memang berarti produk praktis yang dibangun di atas ini hampir pasti akan berupa tier lokal dengan jalur eskalasi, bukan perangkat yang sama sekali tidak pernah berkomunikasi dengan hal lain.
Bagaimanapun juga, itu arsitektur yang tepat. Model lokal 1.024 token sangat baik dalam menangani permintaan yang muat dalam 1.024 token dan tidak dapat menjawab permintaan yang tidak muat.
Di mana jalur eskalasi seharusnya berada
Bagi siapa pun yang membangun di atas rilis seperti ini, pertanyaan desainnya bukanlah apakah model kacamata itu bagus — melainkan apa yang terjadi pada permintaan yang tidak dapat dilayaninya. Jika dijawab dalam kode aplikasi, itu menjadi tumpukan kasus khusus yang harus ditulis ulang setiap kali model di perangkat berubah ukuran atau konteksnya. Jika dijawab sebagai kebijakan perutean, itu menjadi satu aturan: permintaan yang melampaui anggaran konteks tier lokal, atau yang memerlukan alat atau penalaran yang tidak dimiliki tier lokal, dieskalasi ke model yang dihosting. Kebijakan semacam itulah yang menjadi alasan OrcaRouter ada — satu endpoint di depan lebih dari 200 model yang dihosting, dengan failover dan kebijakan yang dinyatakan dalam konfigurasi alih-alih di klien. Bonsai sendiri tidak dirutekan di sini; ia adalah unduhan yang Anda jalankan di perangkat keras Anda sendiri. Yang dicakup oleh lapisan perutean adalah batas di atasnya, dan batas itulah tempat penerapan kacamata akan menghabiskan sebagian besar waktu rekayasanya.

Tontonan Berikutnya
Tiga hal akan membawa ini dari sebuah pengumuman menjadi sebuah platform. Rincian per tolok ukur di balik baris "hasil komparatif", sehingga trade-off terhadap 4-bit terlihat alih-alih diringkas. Jendela konteks yang lebih besar pada jalur NPU yang sama, yang merupakan masalah memori keadaan dan bukan masalah bobot, dan karena itu merupakan yang lebih sulit di antara keduanya. Dan evaluasi independen atas LLM 1-bit 1.7B terhadap padanan 4-bit-nya, karena setiap angka dalam rilis ini saat ini berasal dari pihak yang membangunnya.
Hingga saat itu, ringkasan yang akurat bersifat sempit dan berguna: model multimodal 2 miliar parameter kini berjalan di perangkat kelas kacamata dengan bobot bahasa 0,43 GB, pada kecepatan kira-kira dua kali lipat dan memori kira-kira seperempat dari padanan 4-bit, dengan anggaran konteks 1.024 token. Itu adalah langkah nyata untuk inferensi di perangkat dan langkah kecil untuk kemampuan model, dan keduanya bukan klaim yang sama.
