Một thẻ tiêu đề được tạo ghi 'Bonsai vs Ternary Bonsai 2 27B', với phụ đề 'Hai canh bạc bit thấp, hai thước đo khác nhau', phía trên ba thẻ ghi 'Trọng số: 0,43 GB vs 5,93 GB', 'Tuyên bố chất lượng: so sánh vs độ giữ lại 98,2%', và 'Chip: Hexagon NPU vs Apple silicon và CUDA', cùng phần chân trang ghi 'Mọi số liệu chất lượng do nhà cung cấp báo cáo và chưa được tái lập.' Logo OrcaRouter nằm ở góc dưới bên phải.
Guides & Insights

Bonsai vs Ternary Bonsai 2 27B: Hai canh bạc bit thấp, hai thước đo khác nhau

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt mô hình ngôn ngữ-thị giác 1-bit Bonsai 2B bên cạnh Ternary Bonsai 2 27B và phép so sánh hiển nhiên — 2 tỷ tham số so với 27 tỷ, 0,43 GB trọng số ngôn ngữ so với 5,93 GB — lại là điều kém thú vị nhất ở cặp đôi này. Điều thú vị là hai mô hình, đến từ cùng một nhà cung cấp và cùng một chương trình nén, lại không báo cáo chất lượng của chúng theo cùng một cách. Ternary Bonsai 2 27B báo cáo mức duy trì: nó giữ được hơn 98% hiệu năng benchmark tổng hợp của phiên bản độ chính xác đầy đủ, đo so với chính nó. Còn 1-bit Bonsai 2B báo cáo một phép so sánh: nó đạt "kết quả benchmark tương đương" so với mô hình Qwen 3 1.7B ở mức lượng tử hóa 4-bit, đo so với mô hình của người khác ở một độ chính xác khác. Một cái là phát biểu về việc đã mất đi bao nhiêu. Cái kia là phát biểu về việc nó so sánh đứng ở đâu. Cả hai đều không phải là phát biểu về việc mỗi mô hình tốt đến mức nào theo nghĩa tuyệt đối, và không thể đọc hai điều đó trên cùng một thang đo.

Sự phân biệt đó quan trọng hơn số lượng tham số, vì nó quyết định điều bạn thực sự có thể kết luận từ những con số của nhà cung cấp — và dựa trên bằng chứng đã công bố cho đến nay, câu trả lời trung thực còn ít hơn so với những gì các con số hào nhoáng gợi ý.

Hai tuyên bố về chất lượng, hai thước đo khác nhau

Ternary Bonsai 2 27B, phát hành ngày 17 tháng 9 năm 2026, là bản tái dựng ternary {−1, 0, +1} của Qwen3.8-27B với 1,76 bit hiệu dụng trên mỗi trọng số, và con số mà PrismML dẫn ra là nó giữ lại hơn 98% hiệu năng benchmark tổng hợp của mô hình độ chính xác đầy đủ. Đó là một tuyên bố về mức giữ lại, và các tuyên bố về mức giữ lại vốn mang tính tự quy chiếu theo cấu trúc: chúng cho bạn biết bao nhiêu phần của bản gốc đã sống sót qua nén, chứ không phải bản gốc đứng ở đâu. Một mô hình giữ lại 98% của một baseline tầm thường vẫn là một mô hình tầm thường, và Qwen3.8-27B không tầm thường — nhưng chỉ riêng con số thì không nói lên điều đó, và nó không thể được so sánh giữa các mô hình cơ sở.

Mô hình ngôn ngữ-thị giác Bonsai 2B 1-bit, được công bố vào ngày 23 tháng 9 năm 2026 cho nền tảng kính Snapdragon AR1 Gen 1, là một mô hình ngôn ngữ 1-bit 1,7B cộng với một bộ mã hóa thị giác 4-bit 0,3B. Tuyên bố chất lượng được công bố của nó thì khác về bản chất: PrismML đã đánh giá nó so với một mô hình Qwen 3 1.7B ở mức lượng tử hóa 4-bit trên khắp BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K và GPQA Diamond, và báo cáo rằng hai cấu hình đạt được kết quả tương đương. Đó là một tuyên bố về tính tương đương so với một đường cơ sở bên ngoài. Nó nói rằng việc nén không gây tổn thất rõ ràng cho bạn so với con đường 4-bit mà lẽ ra bạn sẽ dùng — đó chính xác là câu hỏi đúng cho một bản phát hành thuộc lớp thiết bị, và là một tuyên bố yếu hơn nhiều so với "mô hình này tốt".

Vậy nên không có cách diễn giải nào mà theo đó 98,2% đánh bại "comparative" hay ngược lại. Chúng là câu trả lời cho hai câu hỏi khác nhau, được đặt ra dựa trên hai tham chiếu khác nhau, trên hai bộ kiểm thử khác nhau, bởi cùng một nhà cung cấp. Bất kỳ ai xếp hạng hai mô hình này dựa trên sức mạnh của hai câu đó chẳng qua là đang xếp hạng chính những câu đó.

Các mô hình cơ sở đến từ những nơi khác nhau.

Có một khác biệt cấu trúc thứ hai, và đây chính là khác biệt sẽ có ý nghĩa trong năm tới. Ternary Bonsai 2 27B là một bản nén lại của một mô hình bên ngoài — Qwen3.8-27B của Alibaba. Trần chất lượng của nó do lịch phát hành của người khác định đoạt, và nhịp thế hệ của nó bám theo Qwen chứ không phải PrismML. Khi Qwen tung ra một mô hình 27B mới, dòng Bonsai 27B lại có một đầu vào mới, và chỉ số duy trì được tính lại dựa trên một đường cơ sở mới.

Bonsai 2B 1-bit được xây dựng trên Bonsai 1.7B của chính PrismML. Trần của nó do nội bộ đặt ra, nhịp cập nhật do PrismML tự chọn, và những cải tiến của nó đến từ công thức nén và đường kernel chứ không phải từ việc thay mô hình thượng nguồn. Đó là một kiểu tài sản khác: cải thiện năng lực thô chậm hơn, nằm hoàn toàn trong tầm kiểm soát của nhà cung cấp, và — như bản phát hành kính cho thấy — có thể được tinh chỉnh cho một bộ tăng tốc cụ thể theo cách mà việc nén lại tổng quát không thể làm được.

Cả hai đều là những chiến lược hợp lý. Chúng không thể thay thế cho nhau, và cái bạn muốn phụ thuộc vào việc lộ trình của bạn được neo vào Qwen hay vào thiết bị.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder running on the Snapdragon AR1 Gen 1 Platform.

Sự đối chiếu thông số kỹ thuật, từng dòng một

• Tham số — một LLM 1-bit 1,7B cùng bộ mã hóa thị giác 4-bit 0,3B trong mô hình kính, so với mô hình cấp 27B có nguồn gốc từ Qwen3.8-27B trong Ternary Bonsai 2 27B.

• Biểu diễn — nhị phân {−1, +1} với chia tỷ lệ theo nhóm FP16 trong mô hình kính, so với tam phân {−1, 0, +1} với cùng cách chia tỷ lệ ở 1,76 bit hiệu dụng mỗi trọng số trong 27B.

• Trọng số mô hình ngôn ngữ — 0,43 GB cho bản 1-bit 1,7B, so với 5,93 GB cho gói PTQ1_0 của Ternary Bonsai 2 27B, với gói PQ2_0 7,25 GB cũng có sẵn.

• Ngữ cảnh — 1.024 token trên mô hình kính, so với ngữ cảnh đầy đủ 262.000 token trên Ternary Bonsai 2 27B.

• Bộ tăng tốc — Qualcomm Hexagon NPU thông qua QNN SDK với hỗ trợ kernel 1-bit, so với Apple silicon qua MLX và NVIDIA qua CUDA.

• Tuyên bố về chất lượng — “kết quả đánh giá chuẩn so sánh” đối với Qwen 3 1.7B 4-bit, với mức duy trì “trên 98%” của baseline Qwen3.8-27B độ chính xác đầy đủ. Cả hai đều do nhà cung cấp báo cáo, không cái nào được tái lập độc lập, được đo trên các bộ đánh giá khác nhau.

• Runtime — một bộ công cụ Qualcomm NPU cho mô hình kính, đối chiếu với bản fork llama.cpp riêng của PrismML và một container MLX cho 27B, những thứ mà llama.cpp nguyên bản không hỗ trợ.

A screenshot of PrismML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces the memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

Canh bạc bit thấp mang lại gì trong mỗi trường hợp

Triết lý nén là như nhau ở cả hai mô hình và đáng được gọi tên, bởi vì đó chính là luận điểm thực sự của dòng họ này: biểu diễn bit thấp chạy từ đầu đến cuối — embeddings, attention, MLPs và LM head — với chia tỷ lệ theo nhóm FP16 và không có lối thoát độ chính xác cao hơn. Cả hai mô hình đều không giữ một lưới an toàn dạng float cho những phần khó lượng tử hóa. Đó là một quan điểm quyết liệt hơn so với hầu hết các công trình lượng tử hóa, và chính nó là điều khiến cho 1.76 bit mỗi trọng số và trọng số 0.43 GB trở nên khả thi.

Điểm mà khoản đặt cược đền đáp thì khác nhau. Ở Ternary Bonsai 2 27B, phần đền đáp là năng lực trên mỗi byte trên phần cứng bạn đã sở hữu: một mô hình tầm cỡ 27B trong 5.93 GB, chạy trên máy tính xách tay hoặc điện thoại, đạt 98% mức cơ sở của nó. Ở 1-bit Bonsai 2B, phần đền đáp là sự tồn tại trên một lớp thiết bị vốn không có lựa chọn nào: một mô hình đa phương thức trong 0.43 GB trọng số ngôn ngữ, trên một NPU, với tốc độ 15.36 token mỗi giây. Cái thứ nhất là một phiên bản tốt hơn của thứ đã hoạt động được. Cái thứ hai là thứ chưa từng hoạt động được trước đây.

Ranh giới của tầng nằm ở đâu

Hai thứ này không phải là những lựa chọn thay thế cho nhau, và việc coi chúng như một cuộc đối đầu trực diện sẽ bỏ lỡ hình thái triển khai mà cả hai bản phát hành đang hướng tới. Một sản phẩm kính hoặc thiết bị đeo chạy mô hình 2B cục bộ vì không có gì khác phù hợp. Một sản phẩm laptop hoặc điện thoại chạy mô hình 27B vì nó có thể. Ngay khi một sản phẩm bao trùm cả hai — một ứng dụng điện thoại ghép nối với kính, một ứng dụng laptop với trợ lý trên thiết bị — câu hỏi không còn là mô hình nào nữa mà trở thành những yêu cầu nào mà mỗi tầng được phép trả lời.

Ranh giới đó nên được đặt trong cấu hình thay vì trong mã ứng dụng, bởi vì cả hai tầng đều sẽ dịch chuyển. Ranh giới 27B dịch chuyển khi Qwen phát hành, ranh giới 2B dịch chuyển khi PrismML thay đổi công thức, và một quy tắc được mã hóa cứng về độ dài ngữ cảnh hay năng lực sẽ hỏng ở cả hai sự kiện. Một chính sách định tuyến chuyển các yêu cầu vượt quá ngân sách của tầng cục bộ sang một mô hình lưu trữ sẽ đứng vững qua cả hai thay đổi; tầng cục bộ vẫn chỉ là một tầng trong số nhiều tầng, thay vì một giả định xuyên suốt trong ứng dụng khách. OrcaRouter là lớp thực hiện việc chuyển cấp đó — một điểm cuối cho hơn 200 mô hình lưu trữ, bao gồm cả chuyển đổi dự phòng, với chính sách được biểu diễn dưới dạng cấu hình. Không có Bonsai nào được định tuyến ở đây; cả hai đều là bản tải về cục bộ. Thứ nằm ở đây là tầng phía trên chúng, và với một mô hình cục bộ 1.024 token thì tầng đó đang đảm nhiệm phần lớn công việc.

A generated scoreboard titled 'Bonsai vs Ternary Bonsai 2 27B — the scoreboard'. The Bonsai column reads: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; weights 0.43 GB; context 1,024 tokens; representation binary; quality claim comparative against 4-bit Qwen 3 1.7B; accelerator Qualcomm Hexagon NPU. The Ternary Bonsai 2 27B column reads: parameters 27B on Qwen3.8-27B; weights 5.93 GB PTQ1_0; context 262K tokens; representation ternary at 1.76 bits per weight; quality claim over 98% retention of full precision; accelerator Apple MLX and NVIDIA CUDA. Footer reads 'All quality figures vendor-reported; the two claims use different baselines and suites.' The OrcaRouter logo sits in the bottom-right.

Điều gì sẽ giải quyết được nó?

Ba phép đo sẽ biến cặp này từ hai tuyên bố tiếp thị thành một so sánh. Một bảng phân tích theo từng benchmark đằng sau dòng "kết quả so sánh", để thấy rõ sự đánh đổi so với 4-bit thay vì chỉ được tóm tắt. Một con số về độ giữ lại cho Bonsai 2B 1-bit so với baseline full-precision của chính nó — phép đo mà PrismML dùng cho dòng 27B và đã không công bố ở đây. Và một đánh giá độc lập cho một trong hai mô hình, vì mọi con số trong cả hai bản phát hành hiện đều đến từ nhà cung cấp.

Cho đến khi một trong những thứ đó tồn tại, lập trường có thể bảo vệ được là lập trường mà các con số thực sự ủng hộ: Ternary Bonsai 2 27B là mô hình tốt hơn với khoảng cách lớn, và 1-bit Bonsai 2B là mô hình duy nhất trong hai mô hình chạy được trên thiết bị mà nó được tạo ra để chạy. Hai phát biểu đó không hề mâu thuẫn, và việc cùng một nhà cung cấp đo chúng bằng những thước đo khác nhau chính là điều đáng ghi nhớ vào lần tới khi một trong những con số này được trích dẫn mà không có mốc cơ sở của nó.