一張生成的標題卡,上面寫著「Ternary Bonsai 2 27B vs Qwen3.8-27B」,副標題為「同一個網路,兩種精度」,下方有三張卡片分別寫著「檔案大小:5.93 GB vs 53.81 GB」、「縮減幅度:9.05x」與「上下文:262K tokens,兩者皆同」,頁腳寫著「98.2% 的保留率為廠商自行回報,未經重現。」OrcaRouter 標誌位於右下角。
Guides & Insights

Ternary Bonsai 2 27B 對比 Qwen3.8-27B:47.9 GB 的精確度究竟能換來什麼

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ternary Bonsai 2 27B 與 Qwen3.8-27B 是身處兩個數值世界的同一個模型。它們共享架構、分詞器、訓練淵源,以及 262,144 個權杖的上下文視窗。使它們不同的是權重如何被記錄下來:Qwen3.8-27B 將每一個權重儲存為 16 位元浮點數,在其 FP16 參考形式下佔用 53.81 GB;而 Ternary Bonsai 2 27B 將每一個權重儲存為三個符號之一,佔用 5.93 GB。Prism ML 於 2026 年 9 月 17 日宣布這個壓縮版本,並以 Apache 2.0 授權將其放上 Hugging Face;原始的 Qwen3.8-27B 權重於 2026 年 8 月 13 日發布,同樣採用 Apache 2.0 授權。

真正重要的比較,不是哪一個更好,而是少了那 47.9 GB 會讓你付出什麼代價;而誠實的答案,比任何一個陣營會告訴你的都更狹隘、也更具體。Prism ML 報告指出,其建置版本保留了98.2%的全精度模型在 20 項基準測試套件中的平均表現——83.9 對 85.4。這個數字是廠商自家的,是在廠商自家的測試框架上測得的,而且發布一天後,Prism ML 之外沒有人重現過。這個總體數字也隱藏了你真正該在意的部分,因為這 1.8 分並非平均分布。在兩項考驗長期軟體工程能力的基準測試上,差距不是 1.8%——而是接近 25%。

同一個網路,以不同的方式寫下

先從壓縮不會觸及的部分說起,因為那正是這個比較之所以有趣的原因。層數、隱藏層大小、詞彙表、注意力模式和視覺塔都屬於基礎模型。Qwen3.8-27B 是一種混合注意力設計:48 層 Gated DeltaNet 線性注意力層與 16 層完整注意力層交錯排列,比例約為 3:1,總共 64 層,隱藏層大小為 5,120,詞彙表為 248,320 個詞元。這個以線性為主的骨幹,正是讓 262K 上下文一開始就負擔得起的原因,而這也是 Bonsai 原封不動繼承的特性。

Prism ML 所改變的,是語言模型矩陣的表示方式,以及在其上進行運算所需的核心。其白皮書將 27.36B 參數拆分為:語言主幹中橫跨 64 個區塊的 24.35B、嵌入與 LM head 中的 2.54B,以及 27 層視覺塔中的 0.47B。視覺塔以獨立的 4 位元 mmproj 檔案形式提供,大小約 0.63 GB,只有在實際有影像送達時才會載入,因此純文字部署永遠不必為它付出代價。

那種大致上呈線性的設計有個實際後果,值得在任何基準測試討論之前先提出來。由於這個架構並非傳統的 transformer,低位元核心必須專門為它撰寫。原版的 llama.cpp 會把 Prism ML 的兩種封裝都當成未知類型而拒絕——而且更危險的是,它會毫無怨言地載入較舊的三元格式,並產出流暢的胡言亂語,因為它沒有對激活值套用相符的旋轉。如果你在不認識這個模型的執行檔上執行它,你不會得到錯誤。你會得到自信滿滿的錯誤輸出。

比較,逐類別

以下是廠商的 20 項基準測試細目,並以全精度基礎模型作為參考。這份清單中的每一項數據都是 Prism ML 的;其中沒有任何一項經過獨立驗證。

• 數學 — Ternary Bonsai 2 27B 為 96.57,Qwen3.8-27B 為 97.06。實際上不相上下。

• 程式設計 — 81.58 對 82.17。也很接近,而且這正是整項技術爭論所針對的類別。

• 指令遵循 — 82.66 對 81.25。壓縮後的模型在這裡領先,這是表格中唯一真正令人意外的一行。

• 知識與推理 — 83.95 對 86.66。下滑了 2.7 分,也是短少 1.8 分中單一最大的因素。

• 代理與工具呼叫 — 77.57 對比 79.74,涵蓋 τ2-Bench 的 80.22 與 BFCL v3 的 74.92。

• 視覺 — 78.59 對 81.64,是最大的類別損失。請注意,視覺塔本身並不是被壓縮的部分;讀取其輸出的語言模型才是。

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Qwen3.8-27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: bits per weight 1.76 packed, file size 5.93 GB, 20-benchmark average 83.9, math 96.57, instruction following 82.66, Terminal-Bench 2.1 52.8. The Qwen3.8-27B FP16 column reads: bits per weight 16.0, file size 53.81 GB, 20-benchmark average 85.4, math 97.06, instruction following 81.25, Terminal-Bench 2.1 69.7. Footer reads 'Both columns are one vendor suite; the compressed figures are unaudited.' The OrcaRouter logo sits in the bottom-right.

看整體形狀,而非平均值,就會浮現更清晰的故事。壓縮在數學、程式設計與指令遵循上幾乎不費成本,在知識與視覺上卻代價高昂。這與關於低位元模型的通俗智慧相反;後者認為表層知識能倖存,推理則會崩潰。在這裡,受到侵蝕的是知識,站得住的是推理。

1.8 點實際上落在哪裡

總體結果是二十項基準測試的平均值,而平均值正是差距藏身之處。把個別結果單獨拉出來看,其中兩項遠比平均值所暗示的還要差。

• Terminal-Bench 2.1 — 三值建構版本為 52.8,相較於全精度的 69.7

• SWE-bench Verified — 60.8 對比 80.6

兩者都落在全精度分數的四分之三左右。相較之下,AIME26 達到 95.83,LiveCodeBench 為 90.07,AA-LCR 則是 77.0——與未壓縮模型的差距都在一分以內。這是 Bonsai 系列首次在 Terminal-Bench 上接受評估,而 Prism ML 在自己的資料中也明白指出,它在第一代所承諾的長時程軟體工程能力只是部分落實,而非完全兌現。

所以,實際的問題不是「它是否保留 98.2%」,而是「我的工作負載是什麼」。如果你執行的是程式編寫代理,它會在數十次工具呼叫之間持有一份計畫,並在數分鐘內編輯檔案,那麼你就屬於有 25% 落差的那一類,而總體數字會嚴重誤導人。如果你做的是數學、單輪程式碼生成、擷取、分類或聊天,你就屬於落差會因四捨五入而消失的那些類別。廠商自家表格最有用的一點,在於它讓你做出這種區分,而不是靠猜測。

每一個實際上需要什麼才能運行

硬體方面的情況比尺寸比例所暗示的還要不對稱。一個 53.81 GB 的 FP16 模型根本無法放進 16 GB 的筆電,這使得這項比較與其說是「較快與較慢」,不如說是「可行與不可行」。Prism ML 在批次大小為 1、排除視覺塔後的標準化測量:

• NVIDIA RTX 5090 — 在 PQ2_0 封裝上解碼為 142.5 tok/s,每 token 為 0.582 mWh

• Apple M5 Max — 解碼 46.8 tok/s,提示處理約 765 tok/s

• Apple M5 Pro — 27.7 tok/s 解碼

• Apple M4 Pro — 解碼速度達 18.0 tok/s,提示處理接近 125 tok/s,成為超長上下文的主要限制因素

重要的但書是,這一切都不是單一的二進位檔。PTQ1_0 封裝以每權重 1.76 位元換得 5.93 GB;PQ2_0 則以每權重 2.16 位元付出 7.25 GB,並在限制來自指令吞吐量、而非記憶體頻寬的硬體上換取解碼速度。針對 Apple Silicon 的 MLX 建置是第三種產物,有其獨自的計算方式——一個仿射 2 位元容器,會儲存三值權重所不需要的偏置,最終落在每權重 2.25 位元、磁碟上 8.005 GiB,具備 Metal 與 CPU 核心,但沒有 CUDA 途徑。「它能在 5.9 GB 內執行」這句話,只對那些檔案中的其中一個、且只在恰好正確的執行環境下成立。

成本比較,坦誠呈現

Qwen3.8-27B 有兩種付費方式,而它的壓縮版兄弟只有一種。Ternary Bonsai 2 27B 是下載取得:Apache 2.0、你自己的硬體、沒有計量。Qwen3.8-27B 既是下載項目,也是託管服務,若你選擇託管這條路,相關數字就是模型頁面上的那個——每百萬輸入 token 0.33 美元、每百萬輸出 token 2.40 美元,由 OrcaRouter 自家的基礎設施提供,而非從他人那裡轉售而來。

這正是 OrcaRouter 在這項比較中贏得一席之地,而非只是註腳的地方。Qwen3.8-27B 的路由版本具備相同的 262K 上下文,接受文字、圖像與影片,並提供該模型原生的推理強度控制。它與其他 200 多個模型共用同一把金鑰,且不會在供應商定價之上加價,這點比聽起來更重要:因為定價是 直接傳遞而非轉售,供應商價格變動會當天反映在這裡,而不是等到下一次合約續約。對於想以完整精度基礎模型作為本地 Bonsai 之上升級層級的團隊來說,那就是一個端點和一把金鑰,而不是兩段供應商關係。

A screenshot of Prism ML's launch post for Bonsai 2 27B, dated September 17 2026 and titled 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', showing the opening paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance the new model retains over 98%.

該選哪一個

這個決定主要取決於工作在哪裡進行,而不是哪個模型比較好,因為在大多數任務上,它們是同一個模型。

當任務屬於長時程且具代理性時、當你正在進行評估或微調時、當你需要 1M token 的 YaRN 上下文時,或當視覺準確度舉足輕重時,請選擇 Qwen3.8-27B 全精度。Terminal-Bench 與 SWE-bench 的數字就是原因。

• 當工作必須在你擁有的硬體上進行、當替代方案是根本不執行 27B 模型,或當工作負載是數學、程式設計、擷取或無工具推理,且這些類別表現相當時,請選擇 Ternary Bonsai 2 27B。

• 不要依據總分做選擇。83.9 和 85.4 的差距小到只要換掉一項基準測試,就可能讓兩者的排名對調,而且這兩個數字中只有一個經過獨立驗證。

這裡真正新的地方,不在於一個 27B 模型能塞進 6 GB——第一代 Bonsai 在七月就做到了。而是在於指令遵循的表現超越了母模型,數學和程式設計的表現則持平,這和「以它的規模來說很小」是不同的主張。它能否在你的工作負載上成立,正是僅憑問世一天無法告訴你的事,而這個模型的第一份獨立評估,才是值得等待的結果。

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and the description that the model is self-hosted on OrcaRouter's own infrastructure.

如果你想在自己的提示詞上執行比較,而不是在基準測試套件上,最快的途徑是透過單一端點呼叫託管的 Qwen3.8-27B,並在本機執行三元版本,然後針對你實際手邊的任務比對輸出。那是一個上午就能完成的工作,而它對那 1.8 個百分點所能告訴你的,會比任何已發表的表格都來得多。