文章《敏感度感知量化解析》的主標題卡,副標題為「OrcaSAQ 如何決定哪些 MoE 權重獲得更多位元——無需校準集」,圖中顯示一個扁平線條圖示的平衡秤,較重的一側放著幾個大顆的圓角藍色方塊,較輕的一側則放著許多小顆的灰色方塊。
Guides & Insights

敏感度感知量化解析:OrcaSAQ 如何決定哪些權重獲得更多位元

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

敏感度感知量化是將位元預算花在關鍵處的做法:量化傷害最大的張量獲得更多位元,其餘張量則維持較低的基礎位寬。本文說明 OrcaSAQ —— 我們隨 GLM-5.3-Flash 量化系列 orcarouter/GLM-5.3-Flash-MLX 一同發布的免校準、架構感知混合精度方法 —— 如何決定 3200億參數的混合專家(MoE)模型中 37,338 個張量哪些值得額外位元,而且完全不需要校準資料集。對於任何正在量化不同 MoE 的人,可通用的經驗是:共享專家和下投影值得獲得額外位元,而你只需要上游發布版本自身的量化元資料就能找到它們。

簡短的回答

敏感性感知量化是一種帶有策略的混合精度方法:每個張量的位寬取決於其對量化誤差的敏感度,而不是整個模型統一使用一種位寬。研究文獻以 Hessian、Fisher 資訊或原始層輸出與量化層輸出之間的發散度來衡量敏感性,然後將位元分配給損害最大的層。OrcaSAQ 屬於一個完全跳過此衡量的較小家族。它將敏感性排序編碼在架構本身中:它使用架構與張量角色的先驗知識來決定哪些權重較為脆弱,然後將其餘的一切以目標基礎精度進行量化。

這換來的是快速、確定性、零校準的流程。不需要組建校準語料庫,不需要逐層敏感度搜尋,也不需要針對每個模型重新調參,所以同一套方法可以在新架構的權重發布當天就套用上去。它所放棄的是適應性:像 GPTQ 或 AWQ 這類由校準驅動的方法,會審視你的模型和資料的實際激活分佈,通常能在相同的平均位元寬度下榨出更高的品質。OrcaSAQ 的賭注是:對混合專家(Mixture-of-Experts)模型而言,張量的角色所能告訴你的,已涵蓋校準運行能提供的絕大部分資訊,而成本僅需一小部分。

找出敏感權重的兩種方法

在制定策略之前,問題是:你如何知道量化會損害哪些張量?這兩個答案就是整個設計空間。

校準驅動。將小型語料庫輸入模型,衡量每個張量或區塊造成的誤差,並分配位元以最小化整體重建誤差。GPTQ 使用基於 Hessian 矩陣的近似來評估每層量化誤差;AWQ 使用激活值統計來識別需要保護的顯著權重。其優點是能適應你的實際數據;代價是需要精心挑選的語料庫、對每一層進行前向傳播與逆 Hessian 求解,以及當校準集改變時結果會隨之偏移。

免校準。 在未看到任何資料之前,從架構中決定敏感度排序。在 MoE 中,你已經知道承重角色:每個 token 都會觸發的專家,以及寫入殘差流的投影。將該排序編碼為固定策略,並機械式地套用。

OrcaSAQ 堅定地站在第二陣營這邊,本文即為該陣營在 MoE 量化上的辯護——並以清醒的眼光說明為此你得放棄什麼。

政策:哪些張量獲得更多位元

OrcaSAQ 的位元分配策略載明於 orcarouter/GLM-5.3-Flash-MLX 的模型卡中,可歸結為三條規則加上一項例外。基礎精度即是你正在建置的版本——6、4、3 或 2 位元——而該策略會將特定張量角色提升至此一精度之上:

共享專家:基礎加上 2 位元。共享專家會對每個 token 執行,因此它的量化誤差會被重放到模型產生的每一個輸出中。它是模型中槓桿效應最高的張量,所以分配到最多的位元。

down_proj: base +1 bit. 在 SwiGLU MLP 區塊中,down projection 是殘差瓶頸——其輸出會直接加入殘差串流,而每個更深的層都會讀取該串流。此處的誤差會直接污染下游所有層所看到的內容。

gate_proj 與 up_proj:基礎精度。這些是擴展與門控路徑;它們的輸出在激活函數內部逐元素相乘。那裡的適度誤差會部分被門控消除,因此它們可以容忍基礎寬度。

從未量化,以 BF16 形式承載:34 個線性注意力層、學習到的稀疏索引器、超連接陣列、正規化層、embed_tokenslm_head,以及整個視覺塔。這些在上游版本中並非 FP8,而且保持全精度。

位元數會向上取整至 MLX 支援的最接近寬度,即 {2,3,4,5,6,8}。具體而言,在 GLM-5.3-Flash 上——320B 總計 / 18B 活躍,288 個路由專家加上 1 個共享專家,採用 top-8 路由,45 層——4 位元版本賦予共享專家 6 位元,每個下投影 5 位元,閘門和上投影 4 位元。6 位元版本將下投影向上取整至 8 位元。群組大小在 4 位元與 6 位元版本中為 64,2 位元與 3 位元版本中為 32,而共享專家一律使用 64。

OrcaSAQ bit-allocation policy card titled 'OrcaSAQ — the bit-allocation policy' on GLM-5.3-Flash, listing the rules 'shared expert base +2 bits', 'down_proj base +1 bit', 'gate_proj / up_proj base', 'never FP8 upstream BF16', with a concrete 'At a 4-bit base' column showing shared expert 6 bits, down_proj 5 bits, gate/up projections 4 bits, and BF16 for the linear-attention path, indexer and vision tower, plus a footer citing the orcarouter/GLM-5.3-Flash-MLX model card

共享專家規則值得嗎?在 2-bit 基礎下,共享專家設定為 4 bits;在 6-bit 基礎下則為 8 bits——兩種情況下,額外的兩個 bits 所耗費的記憶體,本可用於路由專家,而模型卡自身的數據(下文會討論)顯示這項取捨是划算的。這正是 2bit-lite 版本值得推出的原因:始終啟用的專家,正是多一點精度能發揮最大效益的地方。

選擇規則: _scale_inv 作為自由敏感度信號

位元分配策略假設你已經知道哪些張量是候選對象。選擇那組張量正是 OrcaSAQ 最聰明的地方,因為這個規則是機械式的,且不需要任何資料:若且唯若 FP8 發行版隨附了 _scale_inv 伴隨項,該張量才會被重新量化。

為何這有效:上游的 GLM-5.3-Flash 基礎模型是 FP8 — 區塊式e4m3,128×128 區塊,並搭配動態激活方案。區塊式 FP8 量化會將每個區塊的縮放因子及其倒數與權重一同儲存;_scale_inv在檢查點中的出現,是一個持久的標記,表示該張量已在上游經歷過量化流程。上游版本已經告訴你哪些張量可以安全量化 — 不需要 Hessian、不需要校準語料庫、不需要前向傳播。

對 GLM-5.3-Flash 而言,該集合是 MoE 與 dense-MLP 線性層,再加上每個deepseek_sparse_attention區塊的四個投影——q_a_projq_b_projkv_a_proj_with_mqao_proj——涵蓋深度 3、7、11…43 的 11 個稀疏層,再加上 MTP 區塊,共 12 × 4 = 48 個張量。其餘一切從未帶有該標記且保持 BF16:34 個linear_attention層、稀疏索引器和視覺塔。MTP 層(第 45 層)包含在量化權重中,而不是作為單獨模組匯出。

值得偷學的重點就是這個技巧本身。一個在較上游階段就對其權重進行量化的模型發布,已經為「哪些部分可以被量化」的決定完成了大量工作;這個_scale_inv標記正是那項決定,被序列化到檔案格式中。OrcaSAQ 會將其讀回。這正是讓這條管線具備確定性與可移植性的原因——任何以 FP8 權重搭配 scale 中繼資料發布的模型,都能用同一套規則處理,完全不需要資料管線。

OrcaSAQ selection-rule card titled 'OrcaSAQ — the mechanical selection rule' showing the rule 'Re-quantize a tensor iff the FP8 release shipped it with a _scale_inv companion', with a 'Quantized (had _scale_inv)' column listing the MoE and dense-MLP linears, 11 sparse layers x 4 projections at depth 3, 7, 11 … 43, the MTP block, 12 x 4 = 48 sparse-attention projection tensors and 37,338 tensors total, and a 'Never FP8 upstream (BF16)' column listing 34 linear-attention layers, the sparse indexer, hyper-connections, norms, embed_tokens, lm_head and the vision tower

陷阱:配置是按模組的,而非頂層配置項。

如果你自己編寫 MLX 量化器——而這正是本節的目標讀者——模型卡中最有用的一項內容就是一個警告:頂層的bitsgroup_sizeconfig.json中是不夠的。

總計有 37,338 個張量被量化。此指派記錄於 config.jsonquantization 中,作為按模組的 {group_size, bits} 覆寫,以 MLX 模組路徑為鍵——例如 model.layers.3.mlp.switch_mlp.down_proj。因為 MLX 會將一層的路由專家融合成單一的 switch_mlp,所以 173 個條目涵蓋了全部 37,338 個張量。

載入器會在載入時讀取這些條目。如果你以基礎寬度量化整個檔案,每個提升精度的張量——基礎寬度+2的共享專家、基礎寬度+1的每個下投影——都會以錯誤的寬度輸出,導致模型載入時形狀錯誤。依模組的對應表不是你可以跳過的優化;它就是載入路徑。當你撰寫自己的量化器時,為策略提升的每個張量產生覆寫,並在出貨前對照頂層預設值驗證。

這份保單是否自付其費?

這些證據是我們自己測得的,在單一模型 GLM-5.3-Flash 上量測:每個建置版本皆經過去量化,並透過相同的 glm5_next 前向傳遞來運行,因此唯一的變數就是量化方式。以下數字來自模型卡,既非廠商基準,也非第三方數據——請視其為單一數據點,而非定律。

• 困惑度,相對於 FP8 參考值 2.7797:6 位元 2.7864(+0.24%)、4 位元 2.8620(+2.96%)、3 位元 3.0566(+9.96%)、2 位元 4.3622(+56.9%)。

• 與參考結果在相同順序下的 Top-1 token 一致率:97.76%、96.13%、92.06%、86.56%。

這個結果完全符合該策略的預期。一直到3-bit為止,一切都在平穩地退化——這正是位元預算花在正確張量上的典型特徵——而2-bit則是一道懸崖,因為低於某個臨界點後,基於角色的提升便無法再掩蓋損害。在4-bit下,對於一個比FP8參考建置小約38%的建置來說,困惑度僅增加+2.96%,這確實是一筆划算的交易;而同樣的策略,只是應用得更激進,才讓102 GB的2bit-lite建置得以載入。獨立從業者量化相同基底模型時,也回報了相同的排序——頂端梯級接近雜訊底線,4-bit真實但影響溫和——只是因評測語料不同,絕對數值有所差異。

OrcaSAQ quality card titled 'OrcaSAQ — quality versus the FP8 reference' listing perplexity versus the FP8 reference at 2.7797: 6-bit 2.7864 (+0.24%), 4-bit 2.8620 (+2.96%), 3-bit 3.0566 (+9.96%), 2-bit 4.3622 (+56.9%), with top-1 agreement 97.76%, 96.13%, 92.06%, 86.56%, and a footer noting these are OrcaRouter's own measurements on GLM-5.3-Flash, not vendor benchmarks

什麼會轉移到你自己的 MoE?

可重複使用的推理,用於非我們自己的模型:

找出始終啟用的專家。 每個 token 都會觸發的專家——通常是共享或固定路由的專家——應配給最充裕的位元數。其誤差會在所有地方重現。

找出殘差瓶頸。寫入殘差流的投影(通常是每個 MLP 區塊的下投影)會獲得基礎 +1。那裡的誤差會被每一個更深的層看到。

將擴充路徑與門控路徑保持在基準狀態。若輸出在啟動函數內部進行逐元素相乘,其中的量化誤差會被部分吸收。

上游從未量化表示您也從未量化。如果基礎版本以全精度保存這些張量,請以全精度保存它們。

使用上游版本的縮放元數據作為您的選擇規則。如果基礎模型對其權重進行量化,它留下的縮放/逆縮放標記就是一份可量化內容的現成地圖 — 無需進行敏感性搜尋。

記錄每個模組的覆寫設定。全域位元寬度會在載入時使每個提升的張量形狀錯誤。請撰寫模組路徑對應表。

如果你能保有一組校準集,就用它來稽核策略——而不是取代它。以相同的平均位元數執行由校準驅動的量化,並檢查角色先驗的排序是否符合資料所示。在密集模型或全新架構上,這種稽核就是「可辯護的預設值」與「猜測」之間的區別。

在哪些情況下選擇 OrcaSAQ 是錯誤的

這是應該讓方法保持誠實的章節,因為免校正的取捨是真實存在的。

當品質上限比管線速度更重要,且你擁有校準集時。GPTQ 或 AWQ 風格的方法會適應你的模型和資料的實際活化統計資料,在相同的平均位元數下,它們通常會勝過固定的角色型策略。如果你只量化模型一次且不再重新量化,校準所花的額外時數就是一次性成本,能換取可衡量的品質。

非MoE密集模型。角色先驗——共享專家、gate/up/down——並不存在,因此該策略失去了使其值得信賴的結構。你只剩下「所有上游已量化者維持量化」這種較弱的宣稱。

沒有上游 FP8 發布版本的模型。_scale_inv 選擇規則沒有任何可參照的基準。你必須以其他方式決定可量化集合,而機械可遷移性的論點便會瓦解。

全新的架構。先驗正是那些可能不成立的假設。基於校準的方法會偵測到基於角色的策略所遺漏的脆弱張量;OrcaSAQ 不會,因為它從不檢視。

低於3位元的目標。該策略救不了你。在2位元下,無論額外的位元去了哪裡,模型的困惑度都會達到+56.9%;2bit-lite版本的存在是為了適配,而非品質。

當您需要保證時。逐張量保證、量化感知訓練(QAT)預算,或不考慮管線成本而追求固定大小的最佳品質,都屬於校準範疇。

底線

敏感性感知量化是這項實踐;OrcaSAQ 是其中一種確定性、免校準的配方。最持久的經驗教訓是:共享專家和下投影的精度提升、機械式的_scale_inv選擇規則,以及載入器實際讀取的每個模組配置。對於像 GLM-5.3-Flash 這樣擁有 3200 億參數的 MoE,該配方產生的 4-bit MLX 建置版本,困惑度(perplexity)增加了 +2.96%——而orcarouter/GLM-5.3-Flash-MLX儲存庫以 2、3、4 和 6 bits 提供相同的策略,並針對 128 GB 機器提供單獨的 2bit-lite 建置版本。我們的GLM-5.3-Flash-MLX逐步解說一步步說明了哪台機器該運行哪個建置版本。

如果您的優先考量是在固定尺寸下追求最後一點品質,而且您能組建校準語料庫,請使用校準驅動的工具並讓它們自行調整。如果您的優先考量是可重現、快速、無需資料的量化,且能遷移到下一代架構——或者您根本不想建立資料管線——那麼基於角色的策略是合理的預設選擇。而如果您寧可一開始就不量化,全精度的GLM-5.3-Flash可透過 OrcaRouter 提供,名稱為z-ai/glm-5.3-flash。選擇的重點在於您願意運行多少管線,而不是敏感度感知量化是否值得做。

寧願完全不進行量化?z-ai/glm-5.3-flash是以供應商價格在 OrcaRouter 上提供的全精度模型,0% 加價。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube