
Ternary Bonsai 2 27B 對比 Qwen3.8-27B IQ2_XXS GGUF:位元更少,分數更高
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B 比 Qwen3.8-27B 的 IQ2_XXS GGUF 版本更小,而且根據隨它公布的數據,表現也更好——如果兩者之間的差異僅在於位元預算,這本不應該可能。Bonsai 版本在 5.93 GB 的檔案中,每個權重佔 1.76 位元。同一基礎模型的傳統 2 位元量化,在約 7.3 GB 的檔案中,每個權重約佔 2.2 位元。Prism ML 於 2026 年 9 月 17 日宣布這款三值版本,其報告指出,自家模型在 20 項基準測試中平均為 83.9,而 IQ2_XXS 對照點為 75.2——差距 8.7 分,有利於使用較少位元的模型。
那個反轉就是全貌,而且它不是什麼把戲。這兩個檔案是在模型生命週期的不同階段、由不同流程產生的,而那些流程之間的差異,比位元寬度的差異更有價值。這也是那個比較:熱門建議——「直接拿個 2-bit 量化版就好,它們現在已經沒問題了」——遇上最清楚反例的地方,也是這個反例背後有獨立量測撐腰、而不是只憑廠商說法的地方。
悖論就是機制
IQ2_XXS 是一種訓練後量化格式。模型會以全精度訓練至收斂,然後其權重會被捨入成由擬合程序所選定的低位元表示。模型從未有機會適應;它是在事後才被量測並近似。i-quant 系列透過使用重要性矩陣——一個校準階段,用來決定哪些權重值得取得更多可用精度——改進了較舊的 k-quants,但基本的操作順序並未改變。先訓練,再壓縮。
Bonsai 把這個順序反了過來。Prism ML 對自身方法的說法是,它徹底放棄了訓練後量化,並在訓練期間強制套用三元約束:前向傳播以限制在 {−1, 0, +1} 的權重進行計算,而反向傳播仍帶著全精度梯度。模型在訓練中學到的是能承受該約束的表徵,而不是把約束硬加在從未預期它的表徵上。這套演算法被描述為專有智慧財產,但任何讀過 BitNet 系列研究的人,都會覺得它的樣貌似曾相識。
兩項改進疊加於其上,且兩者在算術中都清晰可見。第一項是選擇性精度:2620萬個參數——約占模型的0.098%,在bf16下約52 MB,主要是線性注意力層的遞迴狀態路徑加上歸一化權重——保持全精度而非三值化。第二項是分塊旋轉。每個權重矩陣在選擇三值之前,會以塊大小1,024進行Walsh–Hadamard旋轉,這會將離群值分散到各座標,並使三級近似破壞性更小。該旋轉被折疊進存儲的權重中,因此不花費額外位元組;相應的變換則在運行時應用於激活值。
最後那個細節有一個後果,是你第一次嘗試運行這東西時就會遇到的,而這就是這個做法真正的代價。
你指的是哪一個 IQ2_XXS,而它實際上得分是多少
在比較品質之前,先提出一項大多數報導都會略過的更正:「IQ2_XXS」並非單一成品。它是一種 llama.cpp 量化類型,而同一種類型由不同工具鏈套用到同一個基礎模型時,所產生的檔案在大小上有明顯差異,在品質上則有大幅差異。
最明確的公開證據,是一位使用者在 2026 年 8 月 15 日發表的獨立比較,他當時在探究打造一個低於 2-bit 的 Qwen3.8-27B 究竟是否值得。該測試是 wikitext-2 的 KL 散度測量,在 512 上下文下取 100 個區塊,對照本地建置、困惑度為 6.7500 的 Q8_0 參考模型,而每個候選模型都在同一時間一次使用相同的重要性矩陣、語料庫、基準與 llama.cpp 建置版本。結果如下:
• unsloth UD-IQ2_XXS — 8.39 GiB,困惑度 7.6528,平均 KLD 0.146,中位數 KLD 0.076,top-1 一致率 82.98%
• bartowski IQ2_XXS — 8.75 GiB,困惑度 8.5352,平均 KLD 0.301,中位數 KLD 0.162,top-1 一致率 76.53%
動態變體為 0.36 GiB更小,也就是比靜態版本小,且在平均 KLD 上約好 2.1 倍——基準困惑度為 1.13 倍。兩個檔案掛著相同的標籤,卻在衡量輸出分佈漂移程度的指標上相差一倍。同一項測試發現,所有低於 2 位元的候選項都比兩個已發佈的 IQ2 選項更差,這也是為什麼這個基礎模型的實用下限落在 IQ2,而非更低於它。

這對比較來說很重要,因為它改變了「7.3 GB 的 IQ2_XXS 建置」所指的內容。Prism ML 的數字來自它自己對基礎模型所做的量化,每個權重為 2.2 位元。同一家族的 unsloth 動態建置測得 8.39 GiB。bartowski 建置測得 8.75 GiB。因此,Bonsai 與「IQ2_XXS」之間的尺寸差距,取決於你指的是哪個建置,大約落在 1.4 倍到 1.5 倍之間——比標題所暗示的 1.23 倍更大,而且這一切都還發生在品質比較開始之前。
後訓練建置在哪裡會出錯,以及為什麼很容易被忽略
8.7 分的總體差距,是陳述這項差異時最不具資訊量的方式,因為 IQ2_XXS 建置中的劣化並非全面性的。它是選擇性的,而且模式與大多數人會預測的相反。
• MMLU-Redux — 後訓練建置版本的表現相當穩健,落在八十幾分的中高區間
• GPQA Diamond — 約 65.5,而三元建置則為 85.76
• AIME26 — 視建置而定,介於 57.5 至 78.6 之間,而三元建置則為 95.83
• LiveCodeBench — 範圍為 56.4 到 70.05,而三元建置則為 90.07
IQ2 的具體數字會在 Prism ML 的測試套件與社群測量之間變動,而上述範圍涵蓋兩者,但其形態在每個來源都一致:表層知識得以保留,而任何需要持續推理鏈的事物都會急劇衰退。這正是隨意測試不會發現的失效模式。要求 2-bit 版本摘要一份文件或回答事實性問題,它的表現會像大得多的模型。要求它維持多步推導或產出非平凡的程式碼,崩潰會是突然的,而非漸進的。這就是為什麼「我試的時候感覺沒問題」不是關於量化模型的證據——它是關於你剛好試過的那些提示的證據。
三元版本並未在同一組基準測試上展現出那種崩塌。Prism ML 回報 AIME26 為 95.83,相較其全精度基礎模型的 94.58;LiveCodeBench 則為 90.07,對比 90.05——實際上持平,而這是該發布中最有用的一項說法,因為它表明訓練時期的限制換來了後訓練時期的限制所失去的東西。
這項反駁論點確實存在,而品質表並未捕捉到它
以上一切論述都支持三值版本在每字節品質上的優勢。然而有一個層面,傳統 GGUF 是徹底勝出的,而且這並非微不足道的一點:它能在你手邊已有的軟體上執行。
Qwen3.8-27B 的 IQ2_XXS 建置版本是 llama.cpp 的標準產物。它可以在 llama.cpp、Ollama、LM Studio、Jan,以及任何連結 ggml 的軟體中載入,並支援 ggml 所支援的每個平台,無需分支版本,也不需要特殊核心。其重要性矩陣可以重建或替換。它的行為就跟您磁碟上任何其他量化模型一樣。
Ternary Bonsai 2 27B 則不然。此架構混合注意力所用的三元核心位於 Prism ML 自家的 llama.cpp 分支中。原版 llama.cpp 會將 PTQ1_0 與 PQ2_0 視為無法辨識的類型而拒絕,且完全不知道該如何處理那些封裝所假設的旋轉基底。適用於 Apple Silicon 的 MLX 建置版本具備 Metal 與 CPU 核心,但沒有 CUDA 路徑,因此在 NVIDIA 機器上會退回 CPU 前向傳遞,可能得花上好幾分鐘。Prism ML 確實列出與數個執行環境的整合,但根本要點仍然成立:這個模型的可用性取決於你選用的執行環境是否已被教導認識它。
那就是誠實的取捨。你要選的,是一個體積大上 1.4 倍、在你最可能想要 27B 模型來處理的那些任務上明顯更差,但到哪都能跑的版本;還是選一個更小、更好,但生態系目前只有某一家實驗室的分支,加上已經採用它的那些執行環境。

要運行其中任何一個需要什麼條件
記憶體運算比檔案大小所暗示的還要接近,因為檔案並非 VRAM 中唯一的東西。
• IQ2_XXS 建置 — 權重為 8.39 至 8.75 GiB,在 16 GB 的顯示卡上留下約 7.5 GB 可用空間,供上下文與草稿模型使用。上述獨立測試特別指出,8.39 GiB 的建置已可同時容納一個 2.1 GB 的草稿模型。
• Ternary Bonsai 2 27B — PTQ1_0 語言模型為 5.93 GB,若你會用到圖像,再加上 0.63 GB 的視覺塔,另加上下文。Prism ML 的 PQ2_0 封裝佔用 7.25 GB,且在受指令吞吐量而非頻寬限制的硬體上是更快的選項。
在速度方面,所報告的三值數據為:在 RTX 5090 上解碼達 142.5 tok/s,在 Apple M5 Max 上為 46.8 tok/s;關於 IQ2 版本的第三方報導較少,其中在雙 Radeon 顯示卡上的 Vulkan 測量約為 3.8 tok/s 生成,不過這個數字與其說反映該量化方法,不如說更能反映那個特定後端。請將雙方的吞吐量數據視為高度取決於硬體。
OrcaRouter 適合的地方,以及不適合的地方
這兩個檔案都不是路由器會提供的內容。它們是本地產物,而誠實的說法是:OrcaRouter 兩者都不代管——這是一場關於你自己硬體上執行什麼的比較。真正在我們這邊的,是它們兩者共同衍生自的那個模型。Qwen3.8-27B 完整精度可透過 OrcaRouter 自家基礎設施取得,價格為每百萬輸入 token 0.33 美元、每百萬輸出 token 2.40 美元,並完整保留該模型原生的 262K 上下文與低/中/高推理強度控制。
這提供了一種值得具體說明的混合式架構。在本機執行壓縮版本來處理它擅長的工作,並將偶爾需要完整精度的請求,透過同一把金鑰路由到託管的基礎模型——不需要與第二家供應商簽約,也不需要修改程式碼,因為兩邊使用相同的 API。如果本機版本被證明不適合某種工作負載,失敗的請求可以自動容錯移轉,而不是以錯誤的形式回傳,這比在正式環境中才發現某種量化方式不適用,是更省成本的發現方式。
簡短版本
• 就公佈的每字節品質而言,三元建置明顯勝出,而這項優勢集中在推理與程式碼——也就是後訓練建置退化最嚴重的類別。
• 在可攜性方面,IQ2_XXS 建置同樣明顯勝出。各處皆採用原廠執行環境,不需分支、不需特殊核心,也沒有默默產出垃圾結果的失效模式。
• 這個比較並不是「1.76 位元對 2.2 位元」。而是「在訓練期間所選定的表徵對上事後才擬合的表徵」,而 0.44 位元的差異與此相比只不過是捨入誤差。
• 本文中三元組建的所有品質數據,都是 Prism ML 在其自行選擇的測試套件上所做的自家量測。IQ2 組建的 KLD 結果則是獨立、單次執行,且僅針對一個基礎模型與一組測試集;它們是這項比較中最有力的第三方證據,但對 Bonsai 未提供任何資訊。
差距也會從另一個方向縮小,而且很可能很快就會發生。如果三元核心進入 llama.cpp 上游,那麼對 Bonsai 唯一一個嚴肅的反對理由就會煙消雲散,選擇也會變得簡單明瞭。在那之前,IQ2_XXS 版本仍保有一個真正的優勢,而這優勢與它本身有多好毫無關係。

如果你這週正在做決定,能讓事情定案的那個測試只需花一個下午:從你自己的工作負載中挑出二十個需要不只一個推理步驟的提示詞,執行這兩個建置版本,並以盲測方式為答案評分。已發布的表格會告訴你該往哪裡看,但它們無法告訴你,你的工作是否就在那裡。
