一张生成的标题卡,内容为"Bonsai vs Ternary Bonsai 2 27B",副标题为"两个低位宽押注,两把不同的标尺",其下方有三张卡片,分别写着"权重:0.43 GB vs 5.93 GB"、"质量宣称:对比式 vs 98.2% 保留率"和"芯片:Hexagon NPU vs Apple silicon 与 CUDA",页脚写着"所有质量数据均由厂商报告,未经复现。"OrcaRouter 标志位于右下角。
Guides & Insights

Bonsai 与 Ternary Bonsai 2 27B:两种低比特押注,两把不同的标尺

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

把 1-bit Bonsai 2B 视觉语言模型与 Ternary Bonsai 2 27B 放在一起,显而易见的对比——20 亿参数对 270 亿参数、0.43 GB 语言权重对 5.93 GB——是这对组合中最没意思的地方。有意思的是,这两个模型来自同一家厂商、同一个压缩项目,却不用同一种方式报告自己的质量。Ternary Bonsai 2 27B 报告的是保留率:它保留了其全精度对应模型超过 98% 的基准测试综合性能,而且是相对于自身来衡量的。1-bit Bonsai 2B 报告的是对比:它在 4-bit 量化下,相对于一个 Qwen 3 1.7B 模型取得了“可比的基准测试结果”,而这个衡量对象是别人的模型,精度也不同。一个是在说明损失了多少。另一个是在说明它处在什么位置。两者都没有说明任一模型在绝对意义上有多好,而且这两者不能放在同一尺度上解读。

这一区别比参数量更重要,因为它决定了你究竟能从厂商的数字中得出什么结论——而就目前公布的证据而言,诚实的答案比那些抢眼数字所暗示的要少。

两个质量主张,两把不同的标尺

Ternary Bonsai 2 27B 于 2026 年 9 月 17 日发布,是 Qwen3.8-27B 的三值 {−1, 0, +1} 重建版本,每权重有效位数为 1.76 位,而 PrismML 主打的数据是:它保留了全精度模型综合基准性能的 98% 以上。这是一个保留率声明,而保留率声明从构造上就是自指的:它们告诉你原始模型有多少在压缩后幸存下来,而不是原始模型本身处于什么水平。一个保留了平庸基线 98% 的模型仍然是平庸的模型,而 Qwen3.8-27B 并不平庸——但仅凭这个数字并不能说明这一点,而且它也无法跨基座模型进行比较。

1-bit Bonsai 2B 视觉语言模型于 2026 年 9 月 23 日发布,面向 Snapdragon AR1 Gen 1 眼镜平台,由 1.7B 的 1-bit 语言模型和 0.3B 的 4-bit 视觉编码器组成。其发布的质量声明在性质上有所不同:PrismML 将其与一个 4-bit 量化的 Qwen 3 1.7B 模型在 BFCL v3、HumanEval+、MMLU Redux、IFEval、IFBench、MuSR、GSM8K 和 GPQA Diamond 上进行了评估,并报告两种配置取得了相当的结果。这是一个相对于外部基线的持平声明。它表明,相比于你原本会使用的 4-bit 路径,这种压缩并没有明显带来损失——对于设备级发布而言,这恰恰是正确的问题,也比“这个模型很好”弱得多。

因此,不存在任何解读能让 98.2% 胜过“comparative”,反过来也一样。它们是针对两个不同问题的答案,这些问题由同一家供应商依据两个不同的参照、在两个不同的套件上提出。任何仅凭那两句话就给这两个模型排名的人,实际上是在给那两句话排名。

基础模型来自不同的地方

还有第二个结构性差异,而它将在接下来的一年里变得重要。Ternary Bonsai 2 27B 是对一个外部模型的重新压缩——阿里巴巴的 Qwen3.8-27B。它的质量上限由别人的发布节奏决定,其代际更迭节奏跟随的是 Qwen,而非 PrismML。当 Qwen 发布新的 27B 时,Bonsai 27B 系列就会获得新的输入,而保留率数字也会针对新的基线重新计算。

1-bit Bonsai 2B 基于 PrismML 自家的 Bonsai 1.7B 构建。它的上限由内部设定,更新节奏由 PrismML 自行选择,其改进来自压缩方案和内核路径,而非上游模型的替换。这是一种不同类型的资产:在原始能力上的提升更慢,完全处于供应商控制之下,并且——正如眼镜发布所表明的那样——能够针对特定加速器进行调优,而这是通用再压缩无法做到的。

两者都是合理的策略。它们不能互换使用,而你需要的究竟是哪一种,取决于你的路线图是锚定在 Qwen 上,还是锚定在设备上。

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder running on the Snapdragon AR1 Gen 1 Platform.

规格对比,一次一行

• 参数量——眼镜模型中的 1.7B 1 比特 LLM 加 0.3B 4 比特视觉编码器,对比 Ternary Bonsai 2 27B 中源自 Qwen3.8-27B 的 27B 级模型。

• 表示方式——眼镜模型中为带 FP16 逐组缩放的二元 {−1, +1},而在 27B 中则为带相同缩放、每权重有效比特数为 1.76 的三元 {−1, 0, +1}。

• 语言模型权重——1-bit 1.7B 为 0.43 GB,而 Ternary Bonsai 2 27B 的 PTQ1_0 打包则为 5.93 GB,另有 7.25 GB 的 PQ2_0 打包可供使用。

• 上下文 — 眼镜模型上为 1,024 个 token,而 Ternary Bonsai 2 27B 上则是完整的 262,000-token 上下文。

• 加速器 — 通过支持 1 位内核的 QNN SDK 使用 Qualcomm Hexagon NPU,对标经由 MLX 的 Apple silicon 和经由 CUDA 的 NVIDIA。

• 质量声明——“对比基准测试结果”是针对 4-bit Qwen 3 1.7B 的,以及相对于全精度 Qwen3.8-27B 基线“超过 98%”的保留率。两者均为厂商报告,均未经独立复现,且在不同测试套件上测得。

• 运行时 — 用于眼镜模型的 Qualcomm NPU 工具链,对标 PrismML 自家的 llama.cpp 分支以及用于 27B 的 MLX 容器,而原版 llama.cpp 对这两者都不支持。

A screenshot of PrismML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces the memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

在每种情况下,低比特投注能换来什么

两个模型的压缩哲学相同,这一点值得点明,因为它是该系列真正的核心主张:低比特表示端到端运行——嵌入、注意力、MLP 和 LM 头——采用 FP16 逐组缩放,且没有更高精度的退路。两个模型都没有为难以量化的部分保留浮点安全网。这比大多数量化工作所采取的立场更为激进,也正是它使每权重 1.76 比特和 0.43 GB 权重成为可能。

回报落在哪里并不相同。在 Ternary Bonsai 2 27B 中,回报是在你已拥有的硬件上衡量每字节的能力:一个 27B 级模型装进 5.93 GB,能在笔记本或手机上运行,达到其基线的 98%。在 1-bit Bonsai 2B 中,回报是在一类此前别无选择的设备上实现存在:一个多模态模型,语言权重仅 0.43 GB,跑在 NPU 上,达到每秒 15.36 个 token。前者是让原本已经可行的东西变得更好。后者是让原本行不通的事情成为可能。

层级边界的位置

这两者并不是互斥选项,把它们当作正面对决,会错过这两个版本共同指向的部署形态。眼镜或可穿戴产品在本地运行 2B,因为没有别的方案能适配。笔记本电脑或手机产品运行 27B,因为它有这个能力。一旦一个产品同时横跨两者——手机应用与眼镜配对,笔记本电脑应用搭配端侧助手——问题就不再是选哪个模型,而是每一层分别被允许回答哪些请求。

那条边界值得写进配置,而不是留在应用代码里,因为两个层级都会变动。27B 这条线会随 Qwen 发版而移动,2B 这条线会随 PrismML 调整配方而移动,而一条关于上下文长度或能力的硬编码规则在这两种情况下都会失效。把超出本地层级预算的请求升级到托管模型的路由策略,能同时扛过这两种变化;本地层级始终只是若干层级中的一个,而不是贯穿客户端的一条预设。OrcaRouter 就是承担这种升级的那一层——一个端点覆盖 200 多个托管模型,包含故障转移,并且策略以配置形式表达。两个 Bonsai 都不在这里路由;它们都是本地下载。这里承载的是它们之上的那一层,而对于一个 1,024 token 的本地模型来说,这一层承担了大部分工作。

A generated scoreboard titled 'Bonsai vs Ternary Bonsai 2 27B — the scoreboard'. The Bonsai column reads: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; weights 0.43 GB; context 1,024 tokens; representation binary; quality claim comparative against 4-bit Qwen 3 1.7B; accelerator Qualcomm Hexagon NPU. The Ternary Bonsai 2 27B column reads: parameters 27B on Qwen3.8-27B; weights 5.93 GB PTQ1_0; context 262K tokens; representation ternary at 1.76 bits per weight; quality claim over 98% retention of full precision; accelerator Apple MLX and NVIDIA CUDA. Footer reads 'All quality figures vendor-reported; the two claims use different baselines and suites.' The OrcaRouter logo sits in the bottom-right.

怎样才能了结

三项测量就能把这对产品从两份营销说辞变成一次真正的对比。在"对比结果"那一行背后给出按基准细分的明细,让与 4 比特版本的取舍变得可见,而不是被一笔带过。给出 1 比特 Bonsai 2B 相对其自身全精度基线的保持率数字——也就是 PrismML 用于 27B 系列、却未在此处公布的那项测量。还有对其中任一模型的独立评测,因为这两份发布中的每一个数字目前都来自厂商自己。

在其中一个出现之前,站得住脚的立场是数字实际支持的那一个:Ternary Bonsai 2 27B 是明显更优的模型,而 1-bit Bonsai 2B 是两者中唯一能在它专为其打造的设备上运行的。这两种说法并不冲突,而同一家厂商用不同标尺来衡量它们这一事实,正是下次这些数字中的某一个被引用却没有给出其基准时值得记住的事。