
Bonsai trên Kính thông minh: Một VLM 2B 1-bit chạy trên Snapdragon AR1 Gen 1
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 36 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 182 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Con số quyết định thông báo này thực sự có ích cho việc gì không phải là 4x và cũng không phải là 2x. Mà là 1.024 — độ dài ngữ cảnh của mô hình mà PrismML đưa lên một cặp kính thông minh tại Snapdragon Summit vào ngày 23 tháng 9 năm 2026. Mô hình thị giác - ngôn ngữ Bonsai 2B 1-bit, một hệ thống 2 tỷ tham số được xây dựng trên Bonsai 1.7B, chạy cục bộ trên kính thông minh AI dùng nền tảng Snapdragon AR1 Gen 1, và những con số PrismML dẫn đầu là bộ nhớ và tốc độ: 0,43 GB trọng số LLM so với 1,66 GB cho mô hình 1.7B 4-bit tương ứng, mức giảm 3,83 lần, và 15,36 token mỗi giây so với 7,44, mức cải thiện 2,06 lần. Cả hai con số đều là của chính nhà cung cấp, cả hai đều được đo trên một nền tảng thử nghiệm 4 GB, và cả hai đều được đo so với mô hình Qwen 3 1.7B 4-bit. Chúng không được đo so với bất kỳ Bonsai 27B nào, và chúng không được đo so với bất cứ thứ gì được host. Đọc chúng như một tuyên bố về chất lượng của Bonsai sẽ là một sai lầm; đọc chúng như một tuyên bố về việc cái gì vừa vặn trong ngân sách bộ nhớ cấp kính mới là cách đọc đúng.
Điều gì đã được công bố, ở cùng một nơi
Thông báo của PrismML — đề ngày tại Pasadena, gắn với Snapdragon Summit của Qualcomm — đưa một mô hình thị giác-ngôn ngữ 2 tỷ tham số lên nền tảng kính AR1 Gen 1. Cấu trúc tách thành một mô hình ngôn ngữ 1-bit 1,7B cộng với một bộ mã hóa thị giác 4-bit 0,3B, với độ dài ngữ cảnh 1.024 token. Nó được xây dựng trên Bonsai 1.7B của PrismML, nên đây là đầu nhỏ của dòng Bonsai chứ không phải một kiến trúc mới, và nó được biên dịch cho Qualcomm Hexagon NPU bằng một QNN SDK nội bộ có hỗ trợ kernel 1-bit.
Tiêu đề khẳng định, như nhà cung cấp đã nêu:
• Phù hợp với một mô hình có số lượng tham số gấp 4 lần trong cùng giới hạn bộ nhớ trên một số kiểu dáng kính.
• Cung cấp trí tuệ gần tương đương với cùng mô hình ở độ chính xác 4-bit trong khi sử dụng ít hơn khoảng 4 lần bộ nhớ.
• Tạo token với tốc độ nhanh gấp hơn 2 lần.
Ba câu đó chính là bản công bố. Những phép đo cụ thể đằng sau các tuyên bố về bộ nhớ và tốc độ là 0,43 GB so với 1,66 GB và 15,36 so với 7,44 token mỗi giây, cả hai đều trên một nền tảng được cấu hình với 4 GB bộ nhớ. Bản thân AR1 Gen 1 được công bố đạt đỉnh 6 TOPS và 2.304 MACs mỗi chu kỳ — một con số dành cho nền tảng, không phải cho suy luận mô hình ngôn ngữ, một sự phân biệt mà chính các con số trong thông báo làm rõ bằng cách công bố token mỗi giây riêng.

4x là một tuyên bố về bộ nhớ, còn baseline là một mô hình khác.
Đây là phần đáng để chậm lại, bởi vì “4x” là kiểu con số lan xa hơn cả câu mà nó xuất phát. Mọi so sánh mà PrismML công bố cho mô hình trên kính đều là so với một lượng tử hóa 4-bit của Qwen 3 1.7B — cùng lớp tham số, cùng công việc, khác lượng tử hóa. Đó là một so sánh chính đáng và hữu ích: đó là so sánh mà một nhà sản xuất kính OEM thực sự phải đối mặt, khi câu hỏi đặt ra là liệu một hướng tiếp cận 1-bit có tiết kiệm đủ bộ nhớ để đáng với công sức tối ưu kernel hay không. Đây không phải là so sánh với một phiên bản 4-bit của Bonsai, và cũng không phải là so sánh với một Bonsai lớn hơn đang chạy ở một nơi nào đó.
Chú thích benchmark gắn với thông báo cũng thận trọng theo cùng một cách. PrismML đã đánh giá Bonsai 1.7B 1-bit LLM so với mô hình Qwen 3 1.7B 4-bit vào tháng 9 năm 2026 trên BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K và GPQA Diamond, và kết quả được báo cáo là hai cấu hình "đạt kết quả benchmark tương đương". Tương đương, chứ không phải vượt trội. Không có điểm số theo từng benchmark trong thông báo và không có bản tái lập độc lập nào cho bất kỳ phần nào trong đó, điều này là bình thường đối với một bản phát hành edge trong tuần ra mắt và chính vì vậy các con số nên được ghi nhận là do nhà cung cấp báo cáo cho đến khi ai đó bên ngoài PrismML chạy chúng.
1.024 token là thông số định hình nên sản phẩm
Một mô hình ngôn ngữ-thị giác trên kính là một khối lượng công việc khác với một mô hình ngôn ngữ-thị giác trong cửa sổ trò chuyện, và độ dài ngữ cảnh chính là chỗ thể hiện điều đó. Ở 1.024 token, mô hình có thể chứa một chỉ dẫn ngắn cùng với những gì camera đang nhìn vào lúc này. Nó không thể chứa lịch sử hội thoại, một tài liệu, hay một chuỗi dài các lượt trước đó. Đó không phải là một khiếm khuyết trong bản phát hành — mà là ràng buộc đã khiến bản phát hành trở nên khả thi, bởi vì bộ nhớ đệm KV và các hoạt hóa phải nằm trong cùng 4 GB với các trọng số, và một mô hình tầm cỡ 27B với ngữ cảnh 262K token cần không gian lớn hơn nhiều bậc độ lớn cho trạng thái đó.
Vậy nên mô tả trung thực về thứ đã được phát hành là một trợ lý ngữ cảnh ngắn đủ năng lực, chạy hoàn toàn trên thiết bị. Các tác vụ kiểu kính — nhận ra cái này, đọc cái kia, dịch tấm biển trước mặt tôi, trả lời một câu hỏi về thứ tôi đang nhìn — đều nằm gọn trong 1.024 token. Bất cứ thứ gì cần nhớ mười phút vừa qua thì không nằm gọn trong đó, và không mức nén 1-bit nào thay đổi được điều đó, vì giới hạn nằm ở trạng thái, không phải ở trọng số.
Hệ sinh thái edge nên rút ra điều gì từ đó
Phần kỹ thuật thực sự mới trong thông báo này không phải là mô hình. Đó là đường đi của kernel: một LLM 1-bit được biên dịch cho Hexagon NPU thông qua QNN SDK có hỗ trợ kernel 1-bit. Trọng số bit thấp đã có thể chạy trên CPU và GPU từ lâu, và các bản phát hành Bonsai 27B của chính PrismML đã chứng minh điều đó trên Apple silicon và phần cứng NVIDIA. Đưa các kernel trọng số nhị phân lên NPU di động là một bài toán khác, bởi vì đường dữ liệu của bộ tăng tốc, định dạng đóng gói và lập lịch của nó đều phải đáp ứng một biểu diễn hoàn toàn không phải kiểu float.
Nếu con đường đó khái quát hóa vượt ra ngoài một mô hình này — và cách diễn đạt trong SDK cho thấy PrismML có ý định như vậy — thì hệ quả thú vị là dòng 1-bit không còn chỉ là câu chuyện về laptop và điện thoại nữa, mà trở thành câu chuyện về thiết bị luôn bật. Nền tảng 4 GB trong thông báo là mức trần hiện tại. Bất cứ điều gì làm giảm dung lượng trọng số ở chất lượng không đổi đều nâng kích thước mô hình có thể vừa dưới mức đó.

Tuyên bố về xử lý trên thiết bị cần một lưu ý.
Suy luận đa phương thức hoàn toàn cục bộ trên một chiếc kính là một tuyên bố mạnh mẽ, và đáng để tách bạch những gì được chứng minh khỏi những gì được ngụ ý. AR1 Gen 1 là một nền tảng kính được xây dựng cho cảm biến và âm thanh luôn bật; cách định hình của chính Qualcomm đối với các mô hình ngôn ngữ trên thiết bị nhìn chung mang tính lai, với thiết bị xử lý những gì nó có thể và chuyển phần còn lại cho điện thoại được ghép nối hoặc đám mây. Màn trình diễn mô hình ngôn ngữ nhỏ trên thiết bị lần đầu tiên được Qualcomm công bố gắn với nền tảng AR1+ Gen 1 chứ không phải AR1 Gen 1. Không điểm nào trong hai điểm này mâu thuẫn với thông báo của PrismML — thông báo nói rằng mô hình chạy cục bộ trên AR1 Gen 1, và các con số về thông lượng và bộ nhớ của chính nhà cung cấp phù hợp với một mô hình nhỏ làm đúng điều đó — nhưng chúng có nghĩa rằng sản phẩm thực tế được xây dựng trên nền tảng này gần như chắc chắn sẽ là một tầng cục bộ với một cơ chế leo thang, chứ không phải một thiết bị không bao giờ giao tiếp với bất cứ thứ gì khác.
Dù sao thì đó vẫn là kiến trúc đúng. Một mô hình cục bộ 1.024 token rất giỏi với những yêu cầu nằm trong 1.024 token và không thể trả lời những yêu cầu không nằm trong giới hạn đó.
Nơi đường dẫn leo thang thuộc về
Với bất kỳ ai đang xây dựng trên một bản phát hành như thế này, câu hỏi thiết kế không phải là mô hình trên kính có tốt hay không — mà là điều gì xảy ra với yêu cầu mà nó không thể phục vụ. Nếu được trả lời trong mã ứng dụng, điều đó trở thành một đống trường hợp đặc biệt phải được viết lại mỗi khi mô hình trên thiết bị thay đổi kích thước hoặc ngữ cảnh. Nếu được trả lời như một chính sách định tuyến, nó trở thành một quy tắc: các yêu cầu vượt quá hạn mức ngữ cảnh của tầng cục bộ, hoặc cần các công cụ hay khả năng suy luận mà tầng cục bộ không có, sẽ được chuyển lên một mô hình được host. Chính sách đó là kiểu thứ mà OrcaRouter tồn tại để giải quyết — một endpoint phía trước hơn 200 mô hình được host, với khả năng chuyển đổi dự phòng và chính sách được thể hiện trong cấu hình thay vì trong client. Bản thân Bonsai không được định tuyến ở đây; nó là một bản tải về mà bạn chạy trên phần cứng của riêng mình. Điều mà lớp định tuyến bao phủ là ranh giới phía trên nó, và ranh giới đó là nơi một triển khai kính sẽ dành phần lớn thời gian kỹ thuật của mình.

Xem gì tiếp theo
Ba điều sẽ đưa thứ này từ một thông báo thành một nền tảng. Một bản phân tích chi tiết theo từng benchmark đằng sau dòng "kết quả so sánh", để thấy rõ sự đánh đổi so với 4-bit thay vì chỉ được tóm tắt. Một cửa sổ ngữ cảnh lớn hơn trên cùng đường NPU, vốn là một bài toán bộ nhớ trạng thái chứ không phải bài toán trọng số, và do đó là bài toán khó hơn trong hai. Và một đánh giá độc lập về LLM 1-bit 1,7B so với bản 4-bit tương ứng, bởi vì mọi con số trong bản phát hành này hiện đều đến từ chính bên đã tạo ra nó.
Cho đến lúc đó, bản tóm tắt chính xác vẫn hẹp và hữu ích: một mô hình đa phương thức 2 tỷ tham số giờ đây chạy trên thiết bị cấp kính với 0,43 GB trọng số ngôn ngữ, ở tốc độ nhanh gấp đôi và bộ nhớ chỉ bằng khoảng một phần tư so với bản tương đương 4-bit, trên ngân sách ngữ cảnh 1.024 token. Đó là một bước tiến thực sự cho suy luận trên thiết bị và một bước nhỏ cho năng lực mô hình, và hai điều đó không phải là cùng một khẳng định.
