一張生成的標題卡寫著「Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF」,副標題為「更少位元,更好分數」,上方三張卡片分別寫著「每權重位元數:1.76 對 2.2」、「大小:5.93 GB 對 7.3 GB」以及「廠商測試套件平均:83.9 對 75.2」,頁腳寫著「Bonsai 數據為廠商提供;IQ2_XXS 數據依廠商與社群測試。」OrcaRouter 標誌位於右下角。
Engineering & Research

Ternary Bonsai 2 27B 對比 Qwen3.8-27B IQ2_XXS GGUF:位元更少,分數更高

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ternary Bonsai 2 27B 比 Qwen3.8-27B 的 IQ2_XXS GGUF 版本更小,而且根據隨它公布的數據,表現也更好——如果兩者之間的差異僅在於位元預算,這本不應該可能。Bonsai 版本在 5.93 GB 的檔案中,每個權重佔 1.76 位元。同一基礎模型的傳統 2 位元量化,在約 7.3 GB 的檔案中,每個權重約佔 2.2 位元。Prism ML 於 2026 年 9 月 17 日宣布這款三值版本,其報告指出,自家模型在 20 項基準測試中平均為 83.9,而 IQ2_XXS 對照點為 75.2——差距 8.7 分,有利於使用較少位元的模型。

那個反轉就是全貌,而且它不是什麼把戲。這兩個檔案是在模型生命週期的不同階段、由不同流程產生的,而那些流程之間的差異,比位元寬度的差異更有價值。這也是那個比較:熱門建議——「直接拿個 2-bit 量化版就好,它們現在已經沒問題了」——遇上最清楚反例的地方,也是這個反例背後有獨立量測撐腰、而不是只憑廠商說法的地方。

悖論就是機制

IQ2_XXS 是一種訓練後量化格式。模型會以全精度訓練至收斂,然後其權重會被捨入成由擬合程序所選定的低位元表示。模型從未有機會適應;它是在事後才被量測並近似。i-quant 系列透過使用重要性矩陣——一個校準階段,用來決定哪些權重值得取得更多可用精度——改進了較舊的 k-quants,但基本的操作順序並未改變。先訓練,再壓縮。

Bonsai 把這個順序反了過來。Prism ML 對自身方法的說法是,它徹底放棄了訓練後量化,並在訓練期間強制套用三元約束:前向傳播以限制在 {−1, 0, +1} 的權重進行計算,而反向傳播仍帶著全精度梯度。模型在訓練中學到的是能承受該約束的表徵,而不是把約束硬加在從未預期它的表徵上。這套演算法被描述為專有智慧財產,但任何讀過 BitNet 系列研究的人,都會覺得它的樣貌似曾相識。

兩項改進疊加於其上,且兩者在算術中都清晰可見。第一項是選擇性精度:2620萬個參數——約占模型的0.098%,在bf16下約52 MB,主要是線性注意力層的遞迴狀態路徑加上歸一化權重——保持全精度而非三值化。第二項是分塊旋轉。每個權重矩陣在選擇三值之前,會以塊大小1,024進行Walsh–Hadamard旋轉,這會將離群值分散到各座標,並使三級近似破壞性更小。該旋轉被折疊進存儲的權重中,因此不花費額外位元組;相應的變換則在運行時應用於激活值。

最後那個細節有一個後果,是你第一次嘗試運行這東西時就會遇到的,而這就是這個做法真正的代價。

你指的是哪一個 IQ2_XXS,而它實際上得分是多少

在比較品質之前,先提出一項大多數報導都會略過的更正:「IQ2_XXS」並非單一成品。它是一種 llama.cpp 量化類型,而同一種類型由不同工具鏈套用到同一個基礎模型時,所產生的檔案在大小上有明顯差異,在品質上則有大幅差異。

最明確的公開證據,是一位使用者在 2026 年 8 月 15 日發表的獨立比較,他當時在探究打造一個低於 2-bit 的 Qwen3.8-27B 究竟是否值得。該測試是 wikitext-2 的 KL 散度測量,在 512 上下文下取 100 個區塊,對照本地建置、困惑度為 6.7500 的 Q8_0 參考模型,而每個候選模型都在同一時間一次使用相同的重要性矩陣、語料庫、基準與 llama.cpp 建置版本。結果如下:

• unsloth UD-IQ2_XXS — 8.39 GiB,困惑度 7.6528,平均 KLD 0.146,中位數 KLD 0.076,top-1 一致率 82.98%

• bartowski IQ2_XXS — 8.75 GiB,困惑度 8.5352,平均 KLD 0.301,中位數 KLD 0.162,top-1 一致率 76.53%

動態變體為 0.36 GiB更小,也就是比靜態版本小,且在平均 KLD 上約好 2.1 倍——基準困惑度為 1.13 倍。兩個檔案掛著相同的標籤,卻在衡量輸出分佈漂移程度的指標上相差一倍。同一項測試發現,所有低於 2 位元的候選項都比兩個已發佈的 IQ2 選項更差,這也是為什麼這個基礎模型的實用下限落在 IQ2,而非更低於它。

A screenshot of a Hugging Face community discussion titled 'Independent KLD benchmark: UD-IQ2_XXS beats bartowski IQ2_XXS on both size and quality', opened 15 August 2026, describing a wikitext-2 test of 100 chunks at 512 context against a locally built Q8_0 reference with perplexity 6.7500. Its table lists unsloth UD-IQ2_XXS at 8.39 GiB with perplexity 7.6528, mean KLD 0.146, median KLD 0.076 and 82.98% top-1 agreement; bartowski IQ2_XXS at 8.75 GiB with perplexity 8.5352, mean KLD 0.301, median 0.162 and 76.53%; stock IQ1_M at 7.33 GiB with mean KLD 0.659; and stock IQ1_S at 6.88 GiB with mean KLD 0.896.

這對比較來說很重要,因為它改變了「7.3 GB 的 IQ2_XXS 建置」所指的內容。Prism ML 的數字來自它自己對基礎模型所做的量化,每個權重為 2.2 位元。同一家族的 unsloth 動態建置測得 8.39 GiB。bartowski 建置測得 8.75 GiB。因此,Bonsai 與「IQ2_XXS」之間的尺寸差距,取決於你指的是哪個建置,大約落在 1.4 倍到 1.5 倍之間——比標題所暗示的 1.23 倍更大,而且這一切都還發生在品質比較開始之前。

後訓練建置在哪裡會出錯,以及為什麼很容易被忽略

8.7 分的總體差距,是陳述這項差異時最不具資訊量的方式,因為 IQ2_XXS 建置中的劣化並非全面性的。它是選擇性的,而且模式與大多數人會預測的相反。

• MMLU-Redux — 後訓練建置版本的表現相當穩健,落在八十幾分的中高區間

• GPQA Diamond — 約 65.5,而三元建置則為 85.76

• AIME26 — 視建置而定,介於 57.5 至 78.6 之間,而三元建置則為 95.83

• LiveCodeBench — 範圍為 56.4 到 70.05,而三元建置則為 90.07

IQ2 的具體數字會在 Prism ML 的測試套件與社群測量之間變動,而上述範圍涵蓋兩者,但其形態在每個來源都一致:表層知識得以保留,而任何需要持續推理鏈的事物都會急劇衰退。這正是隨意測試不會發現的失效模式。要求 2-bit 版本摘要一份文件或回答事實性問題,它的表現會像大得多的模型。要求它維持多步推導或產出非平凡的程式碼,崩潰會是突然的,而非漸進的。這就是為什麼「我試的時候感覺沒問題」不是關於量化模型的證據——它是關於你剛好試過的那些提示的證據。

三元版本並未在同一組基準測試上展現出那種崩塌。Prism ML 回報 AIME26 為 95.83,相較其全精度基礎模型的 94.58;LiveCodeBench 則為 90.07,對比 90.05——實際上持平,而這是該發布中最有用的一項說法,因為它表明訓練時期的限制換來了後訓練時期的限制所失去的東西。

這項反駁論點確實存在,而品質表並未捕捉到它

以上一切論述都支持三值版本在每字節品質上的優勢。然而有一個層面,傳統 GGUF 是徹底勝出的,而且這並非微不足道的一點:它能在你手邊已有的軟體上執行。

Qwen3.8-27B 的 IQ2_XXS 建置版本是 llama.cpp 的標準產物。它可以在 llama.cpp、Ollama、LM Studio、Jan,以及任何連結 ggml 的軟體中載入,並支援 ggml 所支援的每個平台,無需分支版本,也不需要特殊核心。其重要性矩陣可以重建或替換。它的行為就跟您磁碟上任何其他量化模型一樣。

Ternary Bonsai 2 27B 則不然。此架構混合注意力所用的三元核心位於 Prism ML 自家的 llama.cpp 分支中。原版 llama.cpp 會將 PTQ1_0 與 PQ2_0 視為無法辨識的類型而拒絕,且完全不知道該如何處理那些封裝所假設的旋轉基底。適用於 Apple Silicon 的 MLX 建置版本具備 Metal 與 CPU 核心,但沒有 CUDA 路徑,因此在 NVIDIA 機器上會退回 CPU 前向傳遞,可能得花上好幾分鐘。Prism ML 確實列出與數個執行環境的整合,但根本要點仍然成立:這個模型的可用性取決於你選用的執行環境是否已被教導認識它。

那就是誠實的取捨。你要選的,是一個體積大上 1.4 倍、在你最可能想要 27B 模型來處理的那些任務上明顯更差,但到哪都能跑的版本;還是選一個更小、更好,但生態系目前只有某一家實驗室的分支,加上已經採用它的那些執行環境。

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, showing the headline 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet' and the paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance while the new model retains over 98%.

要運行其中任何一個需要什麼條件

記憶體運算比檔案大小所暗示的還要接近,因為檔案並非 VRAM 中唯一的東西。

• IQ2_XXS 建置 — 權重為 8.39 至 8.75 GiB,在 16 GB 的顯示卡上留下約 7.5 GB 可用空間,供上下文與草稿模型使用。上述獨立測試特別指出,8.39 GiB 的建置已可同時容納一個 2.1 GB 的草稿模型。

• Ternary Bonsai 2 27B — PTQ1_0 語言模型為 5.93 GB,若你會用到圖像,再加上 0.63 GB 的視覺塔,另加上下文。Prism ML 的 PQ2_0 封裝佔用 7.25 GB,且在受指令吞吐量而非頻寬限制的硬體上是更快的選項。

在速度方面,所報告的三值數據為:在 RTX 5090 上解碼達 142.5 tok/s,在 Apple M5 Max 上為 46.8 tok/s;關於 IQ2 版本的第三方報導較少,其中在雙 Radeon 顯示卡上的 Vulkan 測量約為 3.8 tok/s 生成,不過這個數字與其說反映該量化方法,不如說更能反映那個特定後端。請將雙方的吞吐量數據視為高度取決於硬體。

OrcaRouter 適合的地方,以及不適合的地方

這兩個檔案都不是路由器會提供的內容。它們是本地產物,而誠實的說法是:OrcaRouter 兩者都不代管——這是一場關於你自己硬體上執行什麼的比較。真正在我們這邊的,是它們兩者共同衍生自的那個模型。Qwen3.8-27B 完整精度可透過 OrcaRouter 自家基礎設施取得,價格為每百萬輸入 token 0.33 美元、每百萬輸出 token 2.40 美元,並完整保留該模型原生的 262K 上下文與低/中/高推理強度控制。

這提供了一種值得具體說明的混合式架構。在本機執行壓縮版本來處理它擅長的工作,並將偶爾需要完整精度的請求,透過同一把金鑰路由到託管的基礎模型——不需要與第二家供應商簽約,也不需要修改程式碼,因為兩邊使用相同的 API。如果本機版本被證明不適合某種工作負載,失敗的請求可以自動容錯移轉,而不是以錯誤的形式回傳,這比在正式環境中才發現某種量化方式不適用,是更省成本的發現方式。

簡短版本

• 就公佈的每字節品質而言,三元建置明顯勝出,而這項優勢集中在推理與程式碼——也就是後訓練建置退化最嚴重的類別。

• 在可攜性方面,IQ2_XXS 建置同樣明顯勝出。各處皆採用原廠執行環境,不需分支、不需特殊核心,也沒有默默產出垃圾結果的失效模式。

• 這個比較並不是「1.76 位元對 2.2 位元」。而是「在訓練期間所選定的表徵對上事後才擬合的表徵」,而 0.44 位元的差異與此相比只不過是捨入誤差。

• 本文中三元組建的所有品質數據,都是 Prism ML 在其自行選擇的測試套件上所做的自家量測。IQ2 組建的 KLD 結果則是獨立、單次執行,且僅針對一個基礎模型與一組測試集;它們是這項比較中最有力的第三方證據,但對 Bonsai 未提供任何資訊。

差距也會從另一個方向縮小,而且很可能很快就會發生。如果三元核心進入 llama.cpp 上游,那麼對 Bonsai 唯一一個嚴肅的反對理由就會煙消雲散,選擇也會變得簡單明瞭。在那之前,IQ2_XXS 版本仍保有一個真正的優勢,而這優勢與它本身有多好毫無關係。

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and a description stating the model is self-hosted on OrcaRouter's own infrastructure.

如果你這週正在做決定,能讓事情定案的那個測試只需花一個下午:從你自己的工作負載中挑出二十個需要不只一個推理步驟的提示詞,執行這兩個建置版本,並以盲測方式為答案評分。已發布的表格會告訴你該往哪裡看,但它們無法告訴你,你的工作是否就在那裡。