
Ternary Bonsai 2 27B 与 Qwen3.8-27B:47.9 GB 的精度究竟换来了什么
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B 和 Qwen3.8-27B 是同一个模型在两个数值世界中的存在形式。它们共享相同的架构、分词器、训练谱系以及 262,144 个 token 的上下文窗口。二者的区别在于权重是如何被记录下来的:Qwen3.8-27B 将每一个权重存储为 16 位浮点数,其 FP16 参考形式占用 53.81 GB;而 Ternary Bonsai 2 27B 将每一个权重存储为三种符号之一,占用 5.93 GB。Prism ML 于 2026 年 9 月 17 日发布了这一压缩版本,并以 Apache 2.0 许可将其发布在 Hugging Face 上;原始的 Qwen3.8-27B 权重于 2026 年 8 月 13 日发布,同样采用 Apache 2.0 许可。
真正重要的比较并不是哪一个更好,而是缺失的 47.9 GB 让你付出了什么代价;而诚实的答案比任何一方阵营会告诉你的都更狭窄、更具体。Prism ML 报告称,其构建在包含 20 项基准的套件中保留了98.2%全精度模型的平均性能——83.9 对 85.4。这个数字来自厂商自己,是在厂商自己的测试框架上测得的,而且发布一天后,Prism ML 之外无人复现。这个综合结果还掩盖了你真正应该关心的部分,因为 1.8 个百分点并非均匀分布。在两项考验持续软件工程能力的基准上,差距不是 1.8%,而是接近 25%。
同一个网络,以不同的方式写下来
先从不被压缩触及的部分说起,因为这正是这场对比之所以有意义的原因。层数、隐藏维度、词表、注意力模式以及视觉塔,都来自基础模型。Qwen3.8-27B 采用混合注意力设计:48 层 Gated DeltaNet 线性注意力层与 16 层全注意力层交错排布,比例约为 3:1,总共 64 层,隐藏维度为 5,120,词表规模为 248,320 个 token。正是这个以线性为主的骨干网络,才让 262K 上下文在一开始就具备了成本上的可行性,而这也是 Bonsai 原样继承下来的特性。
Prism ML 改变的是语言模型矩阵的表示方式,以及在这些矩阵上进行计算所需的内核。其白皮书将 27.36B 参数拆分为:语言主干中跨 64 个块的 24.35B,嵌入和 LM head 中的 2.54B,以及一个 27 块视觉塔中的 0.47B。视觉塔以单独的 4 位 mmproj 文件形式提供,大小约为 0.63 GB,仅在图像实际到达时才加载,因此纯文本部署永远不会为其付出开销。
这种大体上呈线性的设计有一个实际后果,在任何基准测试讨论之前都值得指出。由于该架构不是传统的 transformer,低比特内核必须专门为它编写。原版 llama.cpp 会将 Prism ML 的两种打包都视为未知类型而拒绝——而更危险的是,它会毫无怨言地加载一种较旧的三元格式,并生成流畅的胡言乱语,因为它没有对激活应用相匹配的旋转。如果你在不了解该模型的二进制程序上运行它,你不会得到错误。你会得到看似自信却错误的输出。
逐类别进行比较
以下是供应商的 20 项基准测试明细,以全精度基线为参照。本列表中的每一个数字都来自 Prism ML;没有一项经过独立验证。
• 数学 — Ternary Bonsai 2 27B 为 96.57,而 Qwen3.8-27B 为 97.06。实际上持平。
• 编码 — 81.58 对 82.17。同样很接近,而且这正是整个技术所争论的那个类别。
• 指令遵循 —— 82.66 对 81.25。在这项上,压缩后的模型领先,这是表格中唯一真正令人意外的一行。
• 知识与推理——83.95 对 86.66。下降 2.7 分,是造成 1.8 分差距的最大单一因素。
• 智能体与工具调用 — 77.57 对比 79.74,涵盖 τ2-Bench 的 80.22 以及 BFCL v3 的 74.92。
• 视觉——78.59 对比 81.64,是最大的类别损失。注意,视觉塔本身并不是被压缩的部分;读取其输出的语言模型才是。

看形态而非平均值,一个更清晰的故事就会浮现。压缩在数学、编程和指令遵循上几乎不费代价,而在知识和视觉上则代价高昂。这与关于低比特模型的民间智慧正好相反:后者认为表层知识会留存,而推理会崩溃。在这里,被侵蚀的是知识,站得住的则是推理。
1.8 分实际上在哪里
总体指标是二十个基准的平均值,而平均值正是差距最容易藏身的地方。把各项单独结果拆出来看,其中两项远比平均值所暗示的更糟。
• Terminal-Bench 2.1 — 三值构建为 52.8,而全精度为 69.7
• SWE-bench Verified — 60.8 对比 80.6
两者都接近全精度得分的四分之三。相比之下,AIME26 达到 95.83,LiveCodeBench 为 90.07,AA-LCR 为 77.0——与未压缩模型的差距在一分以内。这是 Bonsai 系列首次在 Terminal-Bench 上接受评估,而 Prism ML 在其自身材料中明确表示,其在第一代中承诺的长时程软件工程能力只是部分兑现,而非完全兑现。
所以,实际的问题不是“它是否保留了 98.2%”,而是“我的工作负载是什么”。如果你运行的是一个编码智能体,它要在数十次工具调用中保持一个计划,并在数分钟内编辑文件,那么你就属于存在 25% 差距的那一类,而聚合数字其实会产生误导。如果你是在做数学、单轮代码生成、抽取、分类或聊天,那么你属于差距会被舍入掉的那几类。供应商自己的表格最有用的一点是,它能让你做出这种区分,而不是靠猜。
每一个究竟需要什么才能运行
硬件层面的情况并不像尺寸比例所暗示的那样对称。一个 53.81 GB 的 FP16 模型根本无法装进一台 16 GB 的笔记本电脑,这使得比较与其说是“更快与更慢”,不如说是“可行与不可行”。Prism ML 在批次大小为 1、排除视觉塔后的标准化测量结果:
• NVIDIA RTX 5090 — 在 PQ2_0 打包下,解码速度达 142.5 tok/s,每 token 能耗为 0.582 mWh
• Apple M5 Max — 解码 46.8 tok/s,提示处理约 765 tok/s
• Apple M5 Pro — 27.7 tok/s 解码
• Apple M4 Pro — 解码速度为 18.0 tok/s,提示处理接近 125 tok/s,在超长上下文中成为限制性瓶颈
重要的注意事项是,这一切都不是单一的二进制文件。PTQ1_0 打包方案能在每权重 1.76 比特下得到 5.93 GB;PQ2_0 则以每权重 2.16 比特为代价占用 7.25 GB,并在瓶颈是指令吞吐量而非内存带宽的硬件上换来解码速度。面向 Apple Silicon 的 MLX 构建是第三件产物,有自己的一套账——一个仿射 2 位容器,会存储三值权重不需要的偏置,最终为每权重 2.25 比特、磁盘占用 8.005 GiB,具备 Metal 和 CPU 内核,但没有 CUDA 路径。“它能在 5.9 GB 下运行”这句话,只对其中一个文件、且恰好在正确的运行时上才成立。
成本对比,如实呈现
为 Qwen3.8-27B 付费有两种方式,而为其压缩版付费只有一种方式。Ternary Bonsai 2 27B 是一次下载:Apache 2.0,运行在你自己的硬件上,不计量。Qwen3.8-27B 既是可下载模型,也是托管服务;如果走托管路线,相关数字就是模型页面上的那个——每百万输入 token 0.33 美元,每百万输出 token 2.40 美元,由 OrcaRouter 自有基础设施提供,而非从他人处转售。
正因如此,OrcaRouter 才在这场对比中占有一席之地,而不只是一个脚注。Qwen3.8-27B 的路由版本承载相同的 262K 上下文,可接受文本、图像和视频,并开放该模型自带的推理强度控制。它与另外 200 多个模型共用同一把密钥,且在提供商标价之上不附加任何加价——这一点比听起来更重要:因为标价是直接透传,而非转售,供应商的价格变动当天就会在这里体现,而不必等到下一次合同续签。对于想把全精度基础版本用作本地 Bonsai 之上升级层的团队而言,这只是一个端点和一把密钥,而不是两家供应商关系。

该选哪一个
这个决定主要关乎工作在哪里执行,而不是哪个模型更好,因为在大多数任务上,它们本就是同一个模型。
• 当任务属于长周期且需要智能体能力时,当你在进行评估或微调时,当你需要 1M token 的 YaRN 上下文时,或者当视觉准确率至关重要时,请选择 Qwen3.8-27B 全精度版本。Terminal-Bench 和 SWE-bench 的分数就是理由。
• 当工作必须在你自己拥有的硬件上进行时,当替代方案是根本不运行 27B 模型时,或者当工作负载是数学、编程、提取或无需工具的推理,且这些类别水平相当时,选择 Ternary Bonsai 2 27B。
• 不要根据综合结果做选择。83.9 和 85.4 相差很小,只要更换一个基准测试,就可能颠倒它们的排名,而且这两个数字中只有一个经过了独立验证。
这里真正的新意并不在于一个 27B 模型能塞进 6GB —— 第一代 Bonsai 在 7 月就做到了。而在于它的指令遵循能力超过了父代模型,数学和编程能力则与之持平,这与“相对于其规模来说算小”是两种不同的说法。它是否能在你的工作负载上站得住脚,恰恰是仅凭发布一天还无法说明的事,而这个模型的首次独立评估才是值得等待的结果。

如果你想在自己的提示词上、而不是在基准测试套件上运行这项比较,最快的做法是通过一个端点调用托管版的 Qwen3.8-27B,并在本地运行三值构建版,然后对你实际手头的任务比较输出差异。这不过是一个上午的工作量,而它对那 1.8 个百分点的说明,会比任何已发表的表格都更多。
