Một thẻ tiêu đề được tạo tự động ghi 'Bonsai vs Bonsai 27B', với phụ đề 'Cùng một dòng họ, gấp mười sáu lần số tham số', phía trên ba thẻ ghi 'Ngữ cảnh: 1.024 token so với 262K', 'Trọng số LLM: 0,43 GB so với 5,9 GB', và 'Thiết bị mục tiêu: kính thông minh so với điện thoại, máy tính xách tay, máy tính để bàn', cùng dòng chân trang ghi 'Số liệu do nhà cung cấp báo cáo; hai mô hình không được đánh giá trên cùng một bộ kiểm chuẩn.' Logo OrcaRouter nằm ở góc dưới cùng bên phải.
Guides & Insights

Bonsai vs Bonsai 27B: Một tên họ, gấp mười sáu lần tham số

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Bất cứ ai tìm mua dòng sản phẩm này bằng tên sẽ nhận được mô hình sai, và lý do là cái tên trần trụi "Bonsai" không phải là một mô hình. Nó là cả dòng sản phẩm, và tính đến tuần này, dòng sản phẩm này bao gồm một mô hình ngôn ngữ-thị giác 2 tỷ tham số chạy trên một cặp kính thông minh và một mô hình 27 tỷ tham số chạy trên điện thoại, máy tính xách tay hoặc máy tính để bàn. Mô hình đầu tiên là mô hình ngôn ngữ-thị giác Bonsai 2B 1-bit được công bố vào ngày 23 tháng 9 năm 2026 — một mô hình ngôn ngữ 1-bit 1,7B cộng với bộ mã hóa thị giác 4-bit 0,3B, ngữ cảnh 1.024 token, được xây dựng trên Bonsai 1.7B. Mô hình thứ hai là Bonsai 27B, phát hành ngày 14 tháng 7 năm 2026 theo giấy phép Apache 2.0, được xây dựng trên Qwen3.6-27B với ngữ cảnh 262.000 token và tùy chọn bản dựng ternary 5,9 GB hoặc bản dựng nhị phân 3,9 GB. Chúng chia sẻ một cái tên, một nhà cung cấp, một triết lý nén và gần như không gì khác. Gấp mười sáu lần tham số, gấp hai trăm năm mươi sáu lần ngữ cảnh, và hai thiết bị hoàn toàn khác nhau.

Trang này dành cho người đã tìm kiếm một trong hai thứ đó và lại truy cập vào thứ còn lại.

Vấn đề đặt tên, nói một cách đơn giản

Menu mô hình của PrismML hiện đang liệt kê Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B và Bonsai Image. Thông báo về kính bổ sung một mô hình thị giác - ngôn ngữ 2 tỷ tham số lên trên dòng Bonsai 1.7B. Vì vậy, chỉ riêng “Bonsai” có thể mang nghĩa là bất kỳ mô hình nào trong ít nhất bốn lớp tham số và hai thế hệ, và hậu tố kích thước là thứ duy nhất giúp phân biệt. Đó không phải là lời chỉ trích cách đặt tên — đó là hình dạng bình thường của một họ mô hình — nhưng nó thực sự có nghĩa là tên họ không mang thông tin gì về thứ bạn đang tải xuống.

Ranh giới hữu ích không nằm ở thế hệ, mà nằm ở lớp thiết bị. Mọi thứ trong dòng 27B đều giả định rằng bạn có khoảng từ 4 GB đến 8 GB bộ nhớ để cấp cho một mô hình ngôn ngữ và sẵn sàng bỏ ra chừng đó. Mọi thứ trong dòng 1.7B đều giả định rằng bạn chỉ có vài trăm megabyte và không hơn. Chỉ riêng sự thật đó đã quyết định nửa nào của họ mô hình là phù hợp với bạn, trước cả khi bất kỳ bài đo chuẩn nào làm điều đó.

Thực tế mỗi thứ là gì

• Thông số — LLM 1-bit 1,7B cùng bộ mã hóa thị giác 4-bit 0,3B trong mô hình kính, so với mô hình cấp 27B bắt nguồn từ Qwen3.6-27B trong Bonsai 27B.

• Ngữ cảnh — 1.024 token trên mô hình kính, so với ngữ cảnh đầy đủ 262.000 token trên Bonsai 27B.

• Trọng số mô hình ngôn ngữ — 0,43 GB cho bản 1-bit 1,7B, so với 5,9 GB cho Bonsai 27B tam phân và 3,9 GB cho bản dựng 1-bit của nó.

• Biểu diễn — trọng số nhị phân {−1, +1} với chia tỷ lệ theo nhóm bằng FP16 ở cả hai, đây là công thức 1-bit mà họ mô hình này được xây dựng xoay quanh; Bonsai 27B còn cung cấp bản dựng tam phân {−1, 0, +1} ở mức 1,71 bit hiệu dụng trên mỗi trọng số.

• Silicon mục tiêu — Qualcomm Hexagon NPU trên nền tảng kính Snapdragon AR1 Gen 1, được biên dịch qua QNN SDK với hỗ trợ kernel 1-bit, so với Apple silicon thông qua MLX và NVIDIA thông qua CUDA cho Bonsai 27B.

• Thông lượng giải mã — 15,36 token mỗi giây trên nền tảng thử nghiệm AR1 Gen 1 4 GB cho mô hình kính, so với khoảng 11 token mỗi giây trên iPhone 17 Pro, 87 trên Apple M5 Max và 163 trên RTX 5090 đối với Bonsai 27B 1-bit.

Mỗi con số trong đó đều là của nhà cung cấp, và hai bộ số liệu được đo trên phần cứng khác nhau cùng những đường cơ sở khác nhau, nên chúng mô tả hai sản phẩm chứ không phải hai điểm trên một đường cong.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, stating a 2-billion-parameter vision-language model runs locally on AI smart glasses powered by the Snapdragon AR1 Gen 1 Platform with a 1,024-token context.

Ở những điểm mà Bonsai 27B chiến thắng, và khoảng cách không hề nhỏ

Ngữ cảnh là điều đầu tiên cần xét, và khoảng cách không phải là chuyện nhỏ nhặt. Cửa sổ 262.000 token chứa được một codebase, một tài liệu dài, một bản ghi, hoặc một phiên làm việc của agent mà vẫn còn thừa chỗ. Cửa sổ 1.024 token chỉ chứa được một chỉ dẫn ngắn và một hình ảnh. Nếu khối lượng công việc của bạn liên quan đến việc đọc bất cứ thứ gì dài hơn một trang, Bonsai 27B là mô hình duy nhất trong hai mô hình có thể làm được việc đó, và không lượng prompt khéo léo nào trên mô hình kính có thể thu hẹp khoảng cách đó, vì giới hạn nằm ở bộ nhớ dành cho trạng thái key-value chứ không phải ở kích thước của trọng số.

Năng lực đứng ở vị trí thứ hai. Bản dựng ternary của Bonsai 27B được báo cáo là giữ lại khoảng 95% baseline độ chính xác đầy đủ của nó trên một bộ 15 benchmark ở chế độ suy nghĩ, và bản 1-bit của nó giữ lại khoảng 90%, với tổn thất lớn nhất ở thị giác và sử dụng công cụ. Đó là các số liệu của nhà cung cấp trên bộ của chính nhà cung cấp, và chúng vẫn là một thứ ở đẳng cấp khác so với một mô hình 2 tỷ tham số mà tuyên bố chất lượng duy nhất được công bố là nó đạt "kết quả benchmark so sánh được" so với Qwen 3 1.7B 4-bit. Mô hình kính không được nhà sản xuất của chính nó đem so sánh với một mô hình 27B, bởi vì việc so sánh sẽ không hữu ích.

Hệ sinh thái là yếu tố thứ ba. Bonsai 27B được phát hành dưới dạng các gói GGUF, MLX và AWQ với runtime được ghi tài liệu, nên có một con đường để chạy nó trên phần cứng bạn đã sở hữu. Mô hình kính tồn tại bên trong chuỗi công cụ NPU của Qualcomm.

A screenshot of PrismML's July 2026 launch post for Bonsai 27B, titled 'Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone', listing a ternary build at 1.71 effective bits per weight and 5.9 GB and a 1-bit build at 1.125 bits per weight and 3.9 GB, with a 262K-token context.

Nơi 2B giành chiến thắng, và đó chính là toàn bộ ý nghĩa.

Một mô hình ngôn ngữ 0,43 GB vừa vặn ở những nơi mà một mô hình 5,9 GB không thể đi tới, và nền tảng kính là một trong số đó. Đó là toàn bộ lập luận, và đó là một lập luận mạnh hơn mức mà sự tương phản thông số kỹ thuật khiến nó nghe có vẻ, bởi vì những thiết bị đang bàn không có lựa chọn thay thế: một cặp kính với 4 GB bộ nhớ nền tảng chia sẻ không thể chạy Bonsai 27B ở bất kỳ bản dựng nào, và một chiếc điện thoại không thể chạy bản dựng ternary mà không từ bỏ phần lớn mục đích vốn có của chiếc điện thoại.

Có một lợi thế thứ hai ít được chú ý hơn: cách biểu diễn 1-bit không phải là một sự thỏa hiệp trên lớp thiết bị này, mà chính là thủ thuật tạo nên khả năng. Cách PrismML tự diễn giải là đường đi 1-bit mang lại trí tuệ tương đương với cùng mô hình ở độ chính xác 4-bit, trong khi chỉ dùng khoảng một phần tư bộ nhớ và sinh token với tốc độ nhanh hơn gấp đôi. Với một thiết bị luôn bật, nơi từng miliwatt và từng megabyte đều phải tranh giành, sự đánh đổi đó chính là sản phẩm.

Vậy nên hai mô hình không cạnh tranh với nhau. 2B là thứ chạy khi không còn nơi nào khác để chạy. 27B là thứ chạy khi có.

Ranh giới giữa các hạng mới là quyết định thực sự

Hầu như không ai đang lựa chọn giữa hai cái này. Cách triển khai thực tế sẽ có cả hai: một mô hình nhỏ luôn bật trên thiết bị cho những yêu cầu nằm gọn trong 1.024 token, và một thứ lớn hơn đứng phía sau cho mọi trường hợp còn lại. Khi bạn đã chấp nhận hình dạng đó, câu hỏi kỹ thuật không còn là "Bonsai nào" nữa mà trở thành "ranh giới nằm ở đâu, và ai thực thi nó".

Được thực thi trong mã ứng dụng, dòng đó trở thành một nhánh phải được viết lại mỗi khi mô hình trên thiết bị thay đổi độ dài ngữ cảnh hoặc khả năng — mà theo bằng chứng của ba tháng qua, thì gần như là hàng tháng. Được thực thi như một chính sách định tuyến, nó trở thành một quy tắc về ngân sách ngữ cảnh và khả năng yêu cầu, và tầng cục bộ vẫn là một tầng thay vì trở thành một giả định được gắn cứng xuyên suốt ứng dụng khách. Đó là tầng mà OrcaRouter hoạt động: một điểm cuối phía trước hơn 200 mô hình được lưu trữ, với failover và chính sách leo thang được thể hiện trong cấu hình. Không có Bonsai nào được định tuyến ở đây — cả hai đều là bản tải xuống mà bạn chạy trên phần cứng của riêng mình — nên cách diễn đạt trung thực là tầng định tuyến bao phủ tầng phía trên tầng cục bộ, và với một mô hình cục bộ 1.024 token thì tầng đó chính là nơi phần lớn lưu lượng sẽ đổ về.

A generated two-column scoreboard titled 'Bonsai vs Bonsai 27B — the scoreboard'. The Bonsai 2B VLM column reads: parameters 1.7B 1-bit plus 0.3B vision; context 1,024 tokens; weights 0.43 GB; base Bonsai 1.7B; device smart glasses; runtime Qualcomm NPU toolchain. The Bonsai 27B column reads: parameters 27B on Qwen3.6-27B; context 262K tokens; weights 5.9 GB ternary, 3.9 GB 1-bit; base Qwen3.6-27B; device phone and laptop; runtime MLX, CUDA, GGUF. Footer reads 'Vendor-reported; different hardware and baselines.' The OrcaRouter logo sits in the bottom-right.

Nếu bạn phải chọn một

• Bạn đang xây dựng cho kính, thiết bị đeo hoặc bất kỳ thiết bị luôn bật nào — mô hình ngôn ngữ-thị giác 1-bit Bonsai 2B là lựa chọn duy nhất ở đây, và ngữ cảnh 1,024-token chính là ràng buộc thiết kế mà bạn xây dựng xoay quanh thay vì chống lại.

• Bạn đang xây dựng cho một chiếc điện thoại — 1-bit Bonsai 27B ở mức 3.9 GB là mô hình lớn nhất trong dòng này vừa với ngân sách bộ nhớ cỡ iPhone, và nó mang lại cho bạn ngữ cảnh 262K mà mô hình dành cho kính không thể tiệm cận được.

• Bạn đang xây dựng cho máy tính xách tay hoặc máy tính để bàn — bản dựng Bonsai 27B ternary là lựa chọn thiên về chất lượng trong dòng, còn bản dựng 1-bit đánh đổi lấy tốc độ thay vì năng lực.

• Bạn đang xây dựng một hệ thống lai — hãy quyết định quy tắc leo thang trước, rồi mới đến mô hình. Mô hình thì bạn có thể hoán đổi; còn ranh giới thì không, một khi nó đã nằm trong client.

Điều đáng theo dõi là liệu con đường NPU đã giúp việc ra mắt kính trở nên khả thi có vươn lên trên hay không. Nếu các kernel 1-bit trên bộ tăng tốc di động được tổng quát hóa, dòng 1.7B sẽ trở nên lớn hơn và lý lẽ cho một mô hình 27B trên điện thoại trở nên mạnh hơn. Cho đến lúc đó, hai nửa của dòng sản phẩm này vẫn tách biệt rõ ràng theo phân khúc thiết bị, khiến việc lựa chọn dễ hơn so với những gì cái tên chung gợi ý.