
Ternary Bonsai 2 27B 對比 Qwen3.8-27B:47.9 GB 的精確度究竟能換來什麼
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B 與 Qwen3.8-27B 是身處兩個數值世界的同一個模型。它們共享架構、分詞器、訓練淵源,以及 262,144 個權杖的上下文視窗。使它們不同的是權重如何被記錄下來:Qwen3.8-27B 將每一個權重儲存為 16 位元浮點數,在其 FP16 參考形式下佔用 53.81 GB;而 Ternary Bonsai 2 27B 將每一個權重儲存為三個符號之一,佔用 5.93 GB。Prism ML 於 2026 年 9 月 17 日宣布這個壓縮版本,並以 Apache 2.0 授權將其放上 Hugging Face;原始的 Qwen3.8-27B 權重於 2026 年 8 月 13 日發布,同樣採用 Apache 2.0 授權。
真正重要的比較,不是哪一個更好,而是少了那 47.9 GB 會讓你付出什麼代價;而誠實的答案,比任何一個陣營會告訴你的都更狹隘、也更具體。Prism ML 報告指出,其建置版本保留了98.2%的全精度模型在 20 項基準測試套件中的平均表現——83.9 對 85.4。這個數字是廠商自家的,是在廠商自家的測試框架上測得的,而且發布一天後,Prism ML 之外沒有人重現過。這個總體數字也隱藏了你真正該在意的部分,因為這 1.8 分並非平均分布。在兩項考驗長期軟體工程能力的基準測試上,差距不是 1.8%——而是接近 25%。
同一個網路,以不同的方式寫下
先從壓縮不會觸及的部分說起,因為那正是這個比較之所以有趣的原因。層數、隱藏層大小、詞彙表、注意力模式和視覺塔都屬於基礎模型。Qwen3.8-27B 是一種混合注意力設計:48 層 Gated DeltaNet 線性注意力層與 16 層完整注意力層交錯排列,比例約為 3:1,總共 64 層,隱藏層大小為 5,120,詞彙表為 248,320 個詞元。這個以線性為主的骨幹,正是讓 262K 上下文一開始就負擔得起的原因,而這也是 Bonsai 原封不動繼承的特性。
Prism ML 所改變的,是語言模型矩陣的表示方式,以及在其上進行運算所需的核心。其白皮書將 27.36B 參數拆分為:語言主幹中橫跨 64 個區塊的 24.35B、嵌入與 LM head 中的 2.54B,以及 27 層視覺塔中的 0.47B。視覺塔以獨立的 4 位元 mmproj 檔案形式提供,大小約 0.63 GB,只有在實際有影像送達時才會載入,因此純文字部署永遠不必為它付出代價。
那種大致上呈線性的設計有個實際後果,值得在任何基準測試討論之前先提出來。由於這個架構並非傳統的 transformer,低位元核心必須專門為它撰寫。原版的 llama.cpp 會把 Prism ML 的兩種封裝都當成未知類型而拒絕——而且更危險的是,它會毫無怨言地載入較舊的三元格式,並產出流暢的胡言亂語,因為它沒有對激活值套用相符的旋轉。如果你在不認識這個模型的執行檔上執行它,你不會得到錯誤。你會得到自信滿滿的錯誤輸出。
比較,逐類別
以下是廠商的 20 項基準測試細目,並以全精度基礎模型作為參考。這份清單中的每一項數據都是 Prism ML 的;其中沒有任何一項經過獨立驗證。
• 數學 — Ternary Bonsai 2 27B 為 96.57,Qwen3.8-27B 為 97.06。實際上不相上下。
• 程式設計 — 81.58 對 82.17。也很接近,而且這正是整項技術爭論所針對的類別。
• 指令遵循 — 82.66 對 81.25。壓縮後的模型在這裡領先,這是表格中唯一真正令人意外的一行。
• 知識與推理 — 83.95 對 86.66。下滑了 2.7 分,也是短少 1.8 分中單一最大的因素。
• 代理與工具呼叫 — 77.57 對比 79.74,涵蓋 τ2-Bench 的 80.22 與 BFCL v3 的 74.92。
• 視覺 — 78.59 對 81.64,是最大的類別損失。請注意,視覺塔本身並不是被壓縮的部分;讀取其輸出的語言模型才是。

看整體形狀,而非平均值,就會浮現更清晰的故事。壓縮在數學、程式設計與指令遵循上幾乎不費成本,在知識與視覺上卻代價高昂。這與關於低位元模型的通俗智慧相反;後者認為表層知識能倖存,推理則會崩潰。在這裡,受到侵蝕的是知識,站得住的是推理。
1.8 點實際上落在哪裡
總體結果是二十項基準測試的平均值,而平均值正是差距藏身之處。把個別結果單獨拉出來看,其中兩項遠比平均值所暗示的還要差。
• Terminal-Bench 2.1 — 三值建構版本為 52.8,相較於全精度的 69.7
• SWE-bench Verified — 60.8 對比 80.6
兩者都落在全精度分數的四分之三左右。相較之下,AIME26 達到 95.83,LiveCodeBench 為 90.07,AA-LCR 則是 77.0——與未壓縮模型的差距都在一分以內。這是 Bonsai 系列首次在 Terminal-Bench 上接受評估,而 Prism ML 在自己的資料中也明白指出,它在第一代所承諾的長時程軟體工程能力只是部分落實,而非完全兌現。
所以,實際的問題不是「它是否保留 98.2%」,而是「我的工作負載是什麼」。如果你執行的是程式編寫代理,它會在數十次工具呼叫之間持有一份計畫,並在數分鐘內編輯檔案,那麼你就屬於有 25% 落差的那一類,而總體數字會嚴重誤導人。如果你做的是數學、單輪程式碼生成、擷取、分類或聊天,你就屬於落差會因四捨五入而消失的那些類別。廠商自家表格最有用的一點,在於它讓你做出這種區分,而不是靠猜測。
每一個實際上需要什麼才能運行
硬體方面的情況比尺寸比例所暗示的還要不對稱。一個 53.81 GB 的 FP16 模型根本無法放進 16 GB 的筆電,這使得這項比較與其說是「較快與較慢」,不如說是「可行與不可行」。Prism ML 在批次大小為 1、排除視覺塔後的標準化測量:
• NVIDIA RTX 5090 — 在 PQ2_0 封裝上解碼為 142.5 tok/s,每 token 為 0.582 mWh
• Apple M5 Max — 解碼 46.8 tok/s,提示處理約 765 tok/s
• Apple M5 Pro — 27.7 tok/s 解碼
• Apple M4 Pro — 解碼速度達 18.0 tok/s,提示處理接近 125 tok/s,成為超長上下文的主要限制因素
重要的但書是,這一切都不是單一的二進位檔。PTQ1_0 封裝以每權重 1.76 位元換得 5.93 GB;PQ2_0 則以每權重 2.16 位元付出 7.25 GB,並在限制來自指令吞吐量、而非記憶體頻寬的硬體上換取解碼速度。針對 Apple Silicon 的 MLX 建置是第三種產物,有其獨自的計算方式——一個仿射 2 位元容器,會儲存三值權重所不需要的偏置,最終落在每權重 2.25 位元、磁碟上 8.005 GiB,具備 Metal 與 CPU 核心,但沒有 CUDA 途徑。「它能在 5.9 GB 內執行」這句話,只對那些檔案中的其中一個、且只在恰好正確的執行環境下成立。
成本比較,坦誠呈現
Qwen3.8-27B 有兩種付費方式,而它的壓縮版兄弟只有一種。Ternary Bonsai 2 27B 是下載取得:Apache 2.0、你自己的硬體、沒有計量。Qwen3.8-27B 既是下載項目,也是託管服務,若你選擇託管這條路,相關數字就是模型頁面上的那個——每百萬輸入 token 0.33 美元、每百萬輸出 token 2.40 美元,由 OrcaRouter 自家的基礎設施提供,而非從他人那裡轉售而來。
這正是 OrcaRouter 在這項比較中贏得一席之地,而非只是註腳的地方。Qwen3.8-27B 的路由版本具備相同的 262K 上下文,接受文字、圖像與影片,並提供該模型原生的推理強度控制。它與其他 200 多個模型共用同一把金鑰,且不會在供應商定價之上加價,這點比聽起來更重要:因為定價是 直接傳遞而非轉售,供應商價格變動會當天反映在這裡,而不是等到下一次合約續約。對於想以完整精度基礎模型作為本地 Bonsai 之上升級層級的團隊來說,那就是一個端點和一把金鑰,而不是兩段供應商關係。

該選哪一個
這個決定主要取決於工作在哪裡進行,而不是哪個模型比較好,因為在大多數任務上,它們是同一個模型。
當任務屬於長時程且具代理性時、當你正在進行評估或微調時、當你需要 1M token 的 YaRN 上下文時,或當視覺準確度舉足輕重時,請選擇 Qwen3.8-27B 全精度。Terminal-Bench 與 SWE-bench 的數字就是原因。
• 當工作必須在你擁有的硬體上進行、當替代方案是根本不執行 27B 模型,或當工作負載是數學、程式設計、擷取或無工具推理,且這些類別表現相當時,請選擇 Ternary Bonsai 2 27B。
• 不要依據總分做選擇。83.9 和 85.4 的差距小到只要換掉一項基準測試,就可能讓兩者的排名對調,而且這兩個數字中只有一個經過獨立驗證。
這裡真正新的地方,不在於一個 27B 模型能塞進 6 GB——第一代 Bonsai 在七月就做到了。而是在於指令遵循的表現超越了母模型,數學和程式設計的表現則持平,這和「以它的規模來說很小」是不同的主張。它能否在你的工作負載上成立,正是僅憑問世一天無法告訴你的事,而這個模型的第一份獨立評估,才是值得等待的結果。

如果你想在自己的提示詞上執行比較,而不是在基準測試套件上,最快的途徑是透過單一端點呼叫託管的 Qwen3.8-27B,並在本機執行三元版本,然後針對你實際手邊的任務比對輸出。那是一個上午就能完成的工作,而它對那 1.8 個百分點所能告訴你的,會比任何已發表的表格都來得多。
