一张生成的标题卡写着“Ternary Bonsai 2 27B vs Qwen3.8-27B”,副标题为“同一网络,两种精度”,其上方有三张卡片,分别写着“文件大小:5.93 GB vs 53.81 GB”、“缩减:9.05 倍”和“上下文:262K tokens,两者相同”,页脚写着“98.2% 的保留率由厂商提供,未经复现”。OrcaRouter 标志位于右下角。
Guides & Insights

Ternary Bonsai 2 27B 与 Qwen3.8-27B:47.9 GB 的精度究竟换来了什么

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ternary Bonsai 2 27B 和 Qwen3.8-27B 是同一个模型在两个数值世界中的存在形式。它们共享相同的架构、分词器、训练谱系以及 262,144 个 token 的上下文窗口。二者的区别在于权重是如何被记录下来的:Qwen3.8-27B 将每一个权重存储为 16 位浮点数,其 FP16 参考形式占用 53.81 GB;而 Ternary Bonsai 2 27B 将每一个权重存储为三种符号之一,占用 5.93 GB。Prism ML 于 2026 年 9 月 17 日发布了这一压缩版本,并以 Apache 2.0 许可将其发布在 Hugging Face 上;原始的 Qwen3.8-27B 权重于 2026 年 8 月 13 日发布,同样采用 Apache 2.0 许可。

真正重要的比较并不是哪一个更好,而是缺失的 47.9 GB 让你付出了什么代价;而诚实的答案比任何一方阵营会告诉你的都更狭窄、更具体。Prism ML 报告称,其构建在包含 20 项基准的套件中保留了98.2%全精度模型的平均性能——83.9 对 85.4。这个数字来自厂商自己,是在厂商自己的测试框架上测得的,而且发布一天后,Prism ML 之外无人复现。这个综合结果还掩盖了你真正应该关心的部分,因为 1.8 个百分点并非均匀分布。在两项考验持续软件工程能力的基准上,差距不是 1.8%,而是接近 25%。

同一个网络,以不同的方式写下来

先从不被压缩触及的部分说起,因为这正是这场对比之所以有意义的原因。层数、隐藏维度、词表、注意力模式以及视觉塔,都来自基础模型。Qwen3.8-27B 采用混合注意力设计:48 层 Gated DeltaNet 线性注意力层与 16 层全注意力层交错排布,比例约为 3:1,总共 64 层,隐藏维度为 5,120,词表规模为 248,320 个 token。正是这个以线性为主的骨干网络,才让 262K 上下文在一开始就具备了成本上的可行性,而这也是 Bonsai 原样继承下来的特性。

Prism ML 改变的是语言模型矩阵的表示方式,以及在这些矩阵上进行计算所需的内核。其白皮书将 27.36B 参数拆分为:语言主干中跨 64 个块的 24.35B,嵌入和 LM head 中的 2.54B,以及一个 27 块视觉塔中的 0.47B。视觉塔以单独的 4 位 mmproj 文件形式提供,大小约为 0.63 GB,仅在图像实际到达时才加载,因此纯文本部署永远不会为其付出开销。

这种大体上呈线性的设计有一个实际后果,在任何基准测试讨论之前都值得指出。由于该架构不是传统的 transformer,低比特内核必须专门为它编写。原版 llama.cpp 会将 Prism ML 的两种打包都视为未知类型而拒绝——而更危险的是,它会毫无怨言地加载一种较旧的三元格式,并生成流畅的胡言乱语,因为它没有对激活应用相匹配的旋转。如果你在不了解该模型的二进制程序上运行它,你不会得到错误。你会得到看似自信却错误的输出。

逐类别进行比较

以下是供应商的 20 项基准测试明细,以全精度基线为参照。本列表中的每一个数字都来自 Prism ML;没有一项经过独立验证。

• 数学 — Ternary Bonsai 2 27B 为 96.57,而 Qwen3.8-27B 为 97.06。实际上持平。

• 编码 — 81.58 对 82.17。同样很接近,而且这正是整个技术所争论的那个类别。

• 指令遵循 —— 82.66 对 81.25。在这项上,压缩后的模型领先,这是表格中唯一真正令人意外的一行。

• 知识与推理——83.95 对 86.66。下降 2.7 分,是造成 1.8 分差距的最大单一因素。

• 智能体与工具调用 — 77.57 对比 79.74,涵盖 τ2-Bench 的 80.22 以及 BFCL v3 的 74.92。

• 视觉——78.59 对比 81.64,是最大的类别损失。注意,视觉塔本身并不是被压缩的部分;读取其输出的语言模型才是。

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Qwen3.8-27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: bits per weight 1.76 packed, file size 5.93 GB, 20-benchmark average 83.9, math 96.57, instruction following 82.66, Terminal-Bench 2.1 52.8. The Qwen3.8-27B FP16 column reads: bits per weight 16.0, file size 53.81 GB, 20-benchmark average 85.4, math 97.06, instruction following 81.25, Terminal-Bench 2.1 69.7. Footer reads 'Both columns are one vendor suite; the compressed figures are unaudited.' The OrcaRouter logo sits in the bottom-right.

看形态而非平均值,一个更清晰的故事就会浮现。压缩在数学、编程和指令遵循上几乎不费代价,而在知识和视觉上则代价高昂。这与关于低比特模型的民间智慧正好相反:后者认为表层知识会留存,而推理会崩溃。在这里,被侵蚀的是知识,站得住的则是推理。

1.8 分实际上在哪里

总体指标是二十个基准的平均值,而平均值正是差距最容易藏身的地方。把各项单独结果拆出来看,其中两项远比平均值所暗示的更糟。

• Terminal-Bench 2.1 — 三值构建为 52.8,而全精度为 69.7

• SWE-bench Verified — 60.8 对比 80.6

两者都接近全精度得分的四分之三。相比之下,AIME26 达到 95.83,LiveCodeBench 为 90.07,AA-LCR 为 77.0——与未压缩模型的差距在一分以内。这是 Bonsai 系列首次在 Terminal-Bench 上接受评估,而 Prism ML 在其自身材料中明确表示,其在第一代中承诺的长时程软件工程能力只是部分兑现,而非完全兑现。

所以,实际的问题不是“它是否保留了 98.2%”,而是“我的工作负载是什么”。如果你运行的是一个编码智能体,它要在数十次工具调用中保持一个计划,并在数分钟内编辑文件,那么你就属于存在 25% 差距的那一类,而聚合数字其实会产生误导。如果你是在做数学、单轮代码生成、抽取、分类或聊天,那么你属于差距会被舍入掉的那几类。供应商自己的表格最有用的一点是,它能让你做出这种区分,而不是靠猜。

每一个究竟需要什么才能运行

硬件层面的情况并不像尺寸比例所暗示的那样对称。一个 53.81 GB 的 FP16 模型根本无法装进一台 16 GB 的笔记本电脑,这使得比较与其说是“更快与更慢”,不如说是“可行与不可行”。Prism ML 在批次大小为 1、排除视觉塔后的标准化测量结果:

• NVIDIA RTX 5090 — 在 PQ2_0 打包下,解码速度达 142.5 tok/s,每 token 能耗为 0.582 mWh

• Apple M5 Max — 解码 46.8 tok/s,提示处理约 765 tok/s

• Apple M5 Pro — 27.7 tok/s 解码

• Apple M4 Pro — 解码速度为 18.0 tok/s,提示处理接近 125 tok/s,在超长上下文中成为限制性瓶颈

重要的注意事项是,这一切都不是单一的二进制文件。PTQ1_0 打包方案能在每权重 1.76 比特下得到 5.93 GB;PQ2_0 则以每权重 2.16 比特为代价占用 7.25 GB,并在瓶颈是指令吞吐量而非内存带宽的硬件上换来解码速度。面向 Apple Silicon 的 MLX 构建是第三件产物,有自己的一套账——一个仿射 2 位容器,会存储三值权重不需要的偏置,最终为每权重 2.25 比特、磁盘占用 8.005 GiB,具备 Metal 和 CPU 内核,但没有 CUDA 路径。“它能在 5.9 GB 下运行”这句话,只对其中一个文件、且恰好在正确的运行时上才成立。

成本对比,如实呈现

为 Qwen3.8-27B 付费有两种方式,而为其压缩版付费只有一种方式。Ternary Bonsai 2 27B 是一次下载:Apache 2.0,运行在你自己的硬件上,不计量。Qwen3.8-27B 既是可下载模型,也是托管服务;如果走托管路线,相关数字就是模型页面上的那个——每百万输入 token 0.33 美元,每百万输出 token 2.40 美元,由 OrcaRouter 自有基础设施提供,而非从他人处转售。

正因如此,OrcaRouter 才在这场对比中占有一席之地,而不只是一个脚注。Qwen3.8-27B 的路由版本承载相同的 262K 上下文,可接受文本、图像和视频,并开放该模型自带的推理强度控制。它与另外 200 多个模型共用同一把密钥,且在提供商标价之上不附加任何加价——这一点比听起来更重要:因为标价是直接透传,而非转售,供应商的价格变动当天就会在这里体现,而不必等到下一次合同续签。对于想把全精度基础版本用作本地 Bonsai 之上升级层的团队而言,这只是一个端点和一把密钥,而不是两家供应商关系。

A screenshot of Prism ML's launch post for Bonsai 2 27B, dated September 17 2026 and titled 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', showing the opening paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance the new model retains over 98%.

该选哪一个

这个决定主要关乎工作在哪里执行,而不是哪个模型更好,因为在大多数任务上,它们本就是同一个模型。

• 当任务属于长周期且需要智能体能力时,当你在进行评估或微调时,当你需要 1M token 的 YaRN 上下文时,或者当视觉准确率至关重要时,请选择 Qwen3.8-27B 全精度版本。Terminal-Bench 和 SWE-bench 的分数就是理由。

• 当工作必须在你自己拥有的硬件上进行时,当替代方案是根本不运行 27B 模型时,或者当工作负载是数学、编程、提取或无需工具的推理,且这些类别水平相当时,选择 Ternary Bonsai 2 27B。

• 不要根据综合结果做选择。83.9 和 85.4 相差很小,只要更换一个基准测试,就可能颠倒它们的排名,而且这两个数字中只有一个经过了独立验证。

这里真正的新意并不在于一个 27B 模型能塞进 6GB —— 第一代 Bonsai 在 7 月就做到了。而在于它的指令遵循能力超过了父代模型,数学和编程能力则与之持平,这与“相对于其规模来说算小”是两种不同的说法。它是否能在你的工作负载上站得住脚,恰恰是仅凭发布一天还无法说明的事,而这个模型的首次独立评估才是值得等待的结果。

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and the description that the model is self-hosted on OrcaRouter's own infrastructure.

如果你想在自己的提示词上、而不是在基准测试套件上运行这项比较,最快的做法是通过一个端点调用托管版的 Qwen3.8-27B,并在本地运行三值构建版,然后对你实际手头的任务比较输出差异。这不过是一个上午的工作量,而它对那 1.8 个百分点的说明,会比任何已发表的表格都更多。