
민감도 인지 양자화 설명: OrcaSAQ가 어떤 가중치에 더 많은 비트를 할당할지 결정하는 방법
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
민감도 인식 양자화는 비트 예산을 중요한 곳에 사용하는 방식입니다: 양자화로 인해 가장 큰 피해를 입는 텐서에는 더 많은 비트를 할당하고, 나머지는 더 낮은 기본 폭으로 유지하는 것입니다. 이 글에서는 OrcaSAQ가 — 저희의 보정 데이터셋이 필요 없는(calibration-free), 아키텍처를 고려한 혼합 정밀도(mixed-precision) 방식으로, GLM-5.3-Flash 양자화 제품군 orcarouter/GLM-5.3-Flash-MLX와 함께 출시된 — 3200억 개 파라미터를 가진 Mixture-of-Experts 모델의 37,338개 텐서 중 어떤 것이 추가 비트를 받을 자격이 있는지를 보정 데이터셋 전혀 없이 결정하는 방법을 설명합니다. 다른 MoE를 양자화하는 모든 사람에게 적용되는 교훈은 다음과 같습니다: 공유 전문가(shared experts)와 하향 투영(down-projections)이 추가 비트를 받을 자격이 있으며, 이를 찾는 데에는 업스트림 릴리스 자체의 양자화 메타데이터만 있으면 됩니다.
짧은 대답
민감도 인지 양자화는 정책 기반의 혼합 정밀도이다: 각 텐서의 비트 폭은 전체 모델에 하나의 폭을 사용하는 대신, 양자화 오차에 대한 민감도에 따라 결정된다. 연구 문헌에서는 헤시안(Hessian), 피셔 정보(Fisher information), 또는 원본 계층 출력과 양자화된 계층 출력 간의 발산으로 민감도를 측정한 다음, 가장 피해가 큰 계층에 비트를 할당한다. OrcaSAQ는 측정을 완전히 생략하는 더 작은 계열에 속한다. 민감도 순위를 아키텍처 자체에 인코딩합니다: 즉, 사용하는 것은아키텍처 및 텐서 역할 사전 정보이며, 이것으로 어떤 가중치가 취약한지 결정한 다음, 나머지 모두를 목표 기본 정밀도로 양자화합니다.
그것이 가져다주는 것은 빠르고 결정적이며 보정이 필요 없는 파이프라인이다. 구축할 보정 말뭉치도, 레이어별 민감도 탐색도, 모델별 재조정도 없으므로, 동일한 레시피는 새 아키텍처의 가중치가 공개되는 날 바로 그 아키텍처로 이식된다. 그것이 포기하는 것은 적응성이다. GPTQ나 AWQ 같은 보정 기반 방법은 모델과 데이터의 실제 활성화 분포를 살펴보고, 일반적으로 동일한 평균 비트 폭에서 더 많은 품질을 뽑아낸다. OrcaSAQ의 판단은 Mixture-of-Experts 모델의 경우 텐서의 역할이 보정 실행이 제공하는 대부분의 정보를 훨씬 적은 비용으로 알려준다는 것이다.
민감한 가중치를 찾는 두 가지 방법
정책 이전의 질문: 양자화가 어떤 텐서에 손상을 주는지 어떻게 알 수 있을까? 두 가지 답이 곧 전체 설계 공간이다.
• 보정 기반. 모델에 소규모 말뭉치를 통과시키고 각 텐서 또는 블록이 유발하는 오류를 측정한 후, 전체 재구성 오류를 최소화하도록 비트를 할당합니다. GPTQ는 계층별 양자화 오류에 헤시안 기반 근사를 사용하고, AWQ는 활성화 통계를 사용하여 보호해야 할 중요한 가중치를 식별합니다. 장점은 실제 데이터에 적응한다는 점이며, 비용은 선별된 말뭉치, 모든 계층에 대한 순방향 패스 및 역헤시안 계산, 그리고 보정 세트가 변경되면 결과가 달라진다는 점입니다.
• 캘리브레이션 불필요. 데이터를 전혀 보지 않은 채 아키텍처만으로 민감도 순위를 결정하라. MoE에서는 이미 하중을 지탱하는 역할을 알고 있다: 모든 토큰에서 발화하는 전문가와 잔차 스트림에 쓰는 프로젝션이 그것이다. 그 순위를 고정된 정책으로 인코딩하고 기계적으로 적용하라.
OrcaSAQ는 분명히 두 번째 진영에 속하며, 이 글은 MoE 양자화에 대한 그러한 입장의 변호를 담고 있다 — 그 대가로 무엇을 포기하게 되는지에 대한 냉철한 서술과 함께.
정책: 어떤 텐서가 더 많은 비트를 얻는가
OrcaSAQ의 비트 할당 정책은 다음 모델 카드에 명시되어 있습니다: orcarouter/GLM-5.3-Flash-MLX, 그리고 이는 세 가지 규칙과 하나의 예외 조항으로 요약됩니다. 기본 정밀도는 여러분이 만들고 있는 빌드(6, 4, 3 또는 2비트)이며, 정책은 특정 텐서 역할을 그보다 높게 상향 조정합니다:
• 공유 전문가: base +2 bits.공유 전문가는 모든 토큰에서 작동하므로, 그 양자화 오류가 모델이 생성하는 모든 출력에 반영됩니다. 이는 모델에서 가장 영향력이 큰 텐서이며, 가장 많은 비트를 할당받습니다.
• down_proj: base +1 bit. SwiGLU MLP 블록에서 down projection은 잔차 병목 지점입니다. 그 출력은 더 깊은 모든 레이어가 읽는 잔차 스트림에 곧바로 더해집니다. 여기서 발생한 오류는 다운스트림이 보는 모든 것을 직접 오염시킵니다.
• gate_proj 및 up_proj: 기본 정밀도. 이들은 확장 및 게이팅 경로이며, 그 출력은 활성화 내부에서 요소별로 곱해집니다. 그 부분의 약간의 오류는 게이팅에 의해 부분적으로 상쇄되므로 기본 폭을 견딜 수 있습니다.
• 양자화되지 않았으며 BF16으로 유지됨: 34개의 선형 어텐션 레이어, 학습된 희소 인덱서, 하이퍼커넥션 배열, 정규화(norm), embed_tokens, lm_head, 그리고 전체 비전 타워. 이들은 업스트림 릴리스에서 FP8이 아니었으며, 완전한 정밀도로 유지됩니다.
비트는 가장 가까운 MLX 지원 너비인 {2,3,4,5,6,8}로 올림됩니다. 구체적으로 GLM-5.3-Flash(전체 320B / 활성 18B, top-8 라우팅을 사용하는 288개 라우팅 전문가와 1개 공유 전문가, 45개 레이어)에서 4비트 빌드는 공유 전문가에 6비트, 모든 다운 프로젝션에 5비트, 게이트 및 업 프로젝션에 4비트를 할당합니다. 6비트 빌드는 다운 프로젝션을 8비트로 올림합니다. 그룹 크기는 4비트 및 6비트 빌드에서는 64, 2비트 및 3비트 빌드에서는 32이며, 공유 전문가는 항상 64를 사용합니다.

공유 전문가 규칙은 그만한 가치가 있을까? 2비트 베이스에서 공유 전문가는 4비트로 동작하고, 6비트 베이스에서는 8비트로 동작한다. 두 경우 모두 추가된 2비트는 라우팅된 전문가들이 다른 용도로 사용할 수 있었을 메모리를 소비하며, 아래에서 논의할 모델 카드 자체의 수치는 그 트레이드오프가 효과가 있음을 시사한다. 이는 2bit-lite 빌드를 아예 배포할 가치가 있게 만드는 것과 같은 논리다. 항상 활성화되는 전문가는 약간의 추가 정밀도가 가장 큰 효과를 내는 유일한 부분이기 때문이다.
선택 규칙: _scale_inv를 자유 감도 신호로
비트 할당 정책은 이미 어떤 텐서가 후보인지 알고 있다고 가정합니다. 그 집합을 선택하는 것이 OrcaSAQ가 가장 영리한 부분인데, 규칙이 기계적이고 데이터가 필요 없기 때문입니다: 텐서는 오직 FP8 릴리스가 _scale_inv 동반자와 함께 제공한 경우에만 재양자화됩니다.
그것이 작동하는 이유: 업스트림 GLM-5.3-Flash 베이스는 FP8이며, 블록 단위 e4m3, 128×128 블록과 동적 활성화 방식을 사용합니다. 블록 단위 FP8 양자화는 가중치와 함께 블록별 스케일과 그 역수를 저장하며, _scale_inv가 체크포인트에 존재한다는 것은 해당 텐서가 업스트림에서 양자화 경로를 거쳤다는 지속적인 표시입니다. 업스트림 릴리스는 이미 어떤 텐서가 양자화에 안전한지 알려주었습니다 — 헤시안도, 보정 코퍼스도, 순전파도 필요 없습니다.
GLM-5.3-Flash의 경우, 그 세트는 MoE 및 dense-MLP 선형 계층들과, 게다가 모든 deepseek_sparse_attention 블록 — q_a_proj, q_b_proj, kv_a_proj_with_mqa, 그리고 o_proj — 깊이 3, 7, 11 … 43에 있는 11개의 희소 레이어와 MTP 블록에 걸쳐 있으며, 12 × 4 = 48개의 텐서입니다. 그 외의 모든 것은 마커를 보유하지 않았으며 BF16으로 유지됩니다: 34개의 linear_attention 레이어, 희소 인덱서, 그리고 비전 타워입니다. MTP 레이어(레이어 45)는 별도의 모듈로 내보내지지 않고 양자화된 가중치 안에 포함됩니다.
훔칠 가치가 있는 핵심은 바로 그 트릭 자체입니다. 업스트림에서 가중치를 양자화하는 모델 릴리스는 이미 무엇을 양자화할 수 있는지 결정하는 많은 작업을 수행했습니다. 그 _scale_inv 마커는 그 결정을 파일 형식으로 직렬화한 것입니다. OrcaSAQ는 그것을 다시 읽어냅니다. 이것이 파이프라인을 결정적이고 이식 가능하게 만드는 것입니다. 스케일 메타데이터가 포함된 FP8 가중치를 제공하는 모든 모델은 데이터 파이프라인 없이도 동일한 규칙으로 처리할 수 있습니다.

함정: 최상위 비트가 아니라 모듈별 구성입니다.
자신만의 MLX 양자화기를 작성하는 경우 — 이 섹션은 바로 그런 사람을 위한 것입니다 — 모델 카드에서 가장 유용한 단 하나의 것은 경고입니다: 최상위 bits 및 group_size가에서config.json 충분하지 않습니다.
총 37,338개의 텐서가 양자화됩니다. 할당은 config.json → quantization의 모듈별 {group_size, bits} 재정의로 기록되며, 키는 MLX 모듈 경로에 따라 지정됩니다 — 예: model.layers.3.mlp.switch_mlp.down_proj. MLX가 레이어의 라우팅 전문가를 단일 switch_mlp로 융합하기 때문에, 173개의 항목이 37,338개의 텐서를 모두 포함합니다.
그리고 로더는 로드 시에 해당 항목들을 읽습니다. 만약 전체 파일을 기본 너비로 양자화하면, 정밀도가 높아진 모든 텐서 — 기본 +2인 공유 전문가, 기본 +1인 모든 다운 프로젝션 — 가 잘못된 너비로 나오고, 모델은 잘못된 형태로 로드됩니다. 모듈별 맵은 건너뛸 수 있는 최적화가 아닙니다. 그것이 로드 경로입니다. 자신만의 양자화기를 작성할 때, 정책이 올리는 모든 텐서에 대한 오버라이드를 내보내고, 배포 전에 최상위 기본값과 대조하여 검증하십시오.
정책이 비용을 스스로 충당하나요?
이 증거는 우리가 직접 측정한 것으로, 단일 모델인 GLM-5.3-Flash에서 측정했으며, 각 빌드를 양자화 해제한 뒤 동일한 glm5_next 포워드로 실행했으므로 유일한 변수는 양자화뿐입니다. 아래 숫자는 모델 카드에서 가져온 것이며, 벤더 벤치마크나 제3자의 수치가 아닙니다. 법칙이 아닌 하나의 데이터 포인트로 받아들이십시오.
• Perplexity, FP8 기준 2.7797 대비: 6비트 2.7864 (+0.24%), 4비트 2.8620 (+2.96%), 3비트 3.0566 (+9.96%), 2비트 4.3622 (+56.9%).
• 참조와 동일한 순서에서의 Top-1 토큰 일치율: 97.76%, 96.13%, 92.06%, 86.56%.
측정 결과는 정책이 예측한 것과 정확히 일치한다. 3비트까지는 모든 것이 완만하게 저하되는데, 이는 비트 예산이 올바른 텐서에 사용되었다는 신호다. 반면 2비트는 절벽이다. 특정 지점 아래에서는 역할 기반 상향 조정이 더 이상 손상을 메우지 못하기 때문이다. 4비트에서 FP8 기준 모델보다 약 38% 작은 빌드가 +2.96% 퍼플렉시티 증가를 보이는 것은 정말 좋은 절충이며, 동일한 정책을 더 공격적으로 적용한 덕분에 102GB 2비트 라이트 빌드가 아예 로드될 수 있다. 동일한 베이스를 양자화하는 독립 실무자들도 동일한 순서를 보고한다. 최상위 단계는 노이즈 플로어에 근접하고 4비트는 실질적이지만 온건한 수준인데, 다만 평가 코퍼스가 다르면 절대적 수치도 달라진다.

무엇이 당신의 MoE로 전송되나요?
재사용 가능한 추론, 우리 것이 아닌 모델을 위한:
• 항상 활성화된 전문가를 찾으세요. 모든 토큰에서 활성화되는 것 — 일반적으로 공유 또는 상시 라우팅되는 전문가 — 은 가장 넉넉한 비트를 받습니다. 그 오류는 모든 곳에서 재생됩니다.
• 잔차 병목 지점을 찾으십시오. 잔차 스트림에 쓰는 프로젝션(일반적으로 각 MLP 블록의 다운 프로젝션)은 base +1을 받습니다. 그곳의 오류는 더 깊은 모든 레이어에 보입니다.
• 확장 및 게이팅 경로는 기본값으로 둡니다. 출력이 활성화 내부에서 요소별로 곱해지면, 그 안의 양자화 오류는 부분적으로 흡수됩니다.
• 업스트림에서 양자화된 적이 없는 것은 사용자가 양자화하지 않았음을 의미합니다.기본 릴리스가 해당 텐서를 전체 정밀도로 유지했다면, 전체 정밀도로 유지하십시오.
• 업스트림 릴리스의 스케일 메타데이터를 선택 규칙으로 사용하세요.기본 모델이 가중치를 양자화하면, 남겨진 스케일/역스케일 마커는 양자화 가능한 항목의 무료 지도가 됩니다 — 민감도 검색이 필요 없습니다.
• 모듈별 재정의를 기록하십시오. 로드 시 전역 비트 폭은 모든 올려진 텐서의 형태를 왜곡할 것입니다. 모듈 경로 맵을 작성하십시오.
그리고 캘리브레이션 세트를 조금이라도 유지할 수 있다면, 이를 정책을 대체하는 데가 아니라 감사하는 데 사용하세요. 동일한 평균 비트로 캘리브레이션 기반 양자화를 실행하고 역할 사전(role prior)의 순서가 데이터가 제시하는 내용과 일치하는지 확인하세요. 밀집 모델이나 완전히 새로운 아키텍처에서 그러한 감사는 방어 가능한 기본값과 추측을 구분 짓는 핵심입니다.
OrcaSAQ가 잘못된 선택인 경우
이 섹션은 방법의 정직성을 유지해야 하는 부분입니다. 캘리브레이션 없는 트레이드오프가 실제로 존재하기 때문입니다.
• 품질 상한선이 파이프라인 속도보다 우선하고, 캘리브레이션 세트가 있을 때. GPTQ 또는 AWQ 방식은 모델과 데이터의 실제 활성화 통계에 적응하며, 평균 비트 수가 같다면 일반적으로 고정된 역할 기반 정책보다 더 나은 결과를 냅니다. 모델을 한 번만 양자화하고 다시 양자화하지 않는 경우, 추가적인 캘리브레이션 시간은 측정 가능한 품질을 얻기 위한 일회성 비용입니다.
• 비-MoE 밀집 모델. 공유 전문가, 게이트/업/다운으로 구성된 역할 사전(role prior)이 존재하지 않으므로, 정책은 신뢰성을 부여하는 구조를 잃게 됩니다. 결국 "업스트림에서 양자화된 것은 모두 양자화된 채로 유지된다"는 더 약한 주장만 남게 됩니다.
• FP8 업스트림 릴리스가 없는 모델. 해당 _scale_inv 선택 규칙은 기준으로 삼을 것이 없다. 양자화 가능한 집합을 다른 방식으로 결정해야 하며, 기계적 전이 가능성 주장은 무너진다.
• 전혀 새로운 아키텍처.사전 가정은 성립하지 않을 수 있는 바로 그 가정입니다. 교정 기반 방법은 역할 기반 정책이 놓친 취약한 텐서를 감지할 것입니다; OrcaSAQ는 그렇게 하지 않을 것입니다, 왜냐하면 그것은 결코 살펴보지 않기 때문입니다.
• 3비트 미만 타깃. 정책은 당신을 구해주지 않습니다. 2비트에서는 추가 비트가 어디로 갔는지와 무관하게 모델의 perplexity는 +56.9%입니다. 2bit-lite 빌드는 품질이 아니라 적합성을 위해 존재합니다.
• 보장이 필요할 때. 텐서별 보장, 양자화 인식 훈련(QAT) 예산, 또는 파이프라인 비용을 고려하지 않고 고정된 크기에 대해 최상의 품질을 얻는 것은 모두 캘리브레이션 영역에 해당합니다.
요점
민감도 인식 양자화는 일반적인 방식이며, OrcaSAQ는 이를 위한 결정적이고 보정이 필요 없는 하나의 레시피입니다. 지속적인 교훈은 공유 전문가(shared-expert)와 다운 프로젝션(down-projection)의 상향 조정, 기계적인 _scale_inv 선택 규칙, 그리고 로더가 실제로 읽는 모듈별 설정(config)입니다. GLM-5.3-Flash와 같은 3,200억 매개변수 MoE의 경우, 이 레시피는 perplexity가 +2.96%인 4비트 MLX 빌드를 생성하며 — 그리고 orcarouter/GLM-5.3-Flash-MLX 저장소는 동일한 정책을 2, 3, 4, 6비트로 제공하며, 128GB 머신용 별도의 2bit-lite 빌드도 포함합니다. 우리의 GLM-5.3-Flash-MLX 워크스루는 어떤 머신에서 어떤 빌드를 실행할지 단계별로 다룹니다.
고정된 크기에서 마지막 품질까지 중요시하고 보정(calibration) 코퍼스를 구성할 수 있다면, 보정 기반 도구를 사용해 적응시키세요. 재현 가능하고 빠르며 데이터가 필요 없는 양자화를 우선시한다면 — 또는 데이터 파이프라인을 전혀 구축하고 싶지 않다면 — 역할 기반 정책이 타당한 기본값입니다. 그리고 애초에 양자화를 하지 않으려면, 완전 정밀도(full-precision) GLM-5.3-Flash는 OrcaRouter를 통해 다음과 같이 제공됩니다: z-ai/glm-5.3-flash. 선택의 문제는 민감도 인식 양자화를 수행할 가치가 있는지가 아니라, 얼마나 많은 파이프라인을 실행할 의향이 있는지에 관한 것입니다.
아예 양자화를 하고 싶지 않으신가요?z-ai/glm-5.3-flash는 공급업체 가격에 0% 마크업으로 OrcaRouter에서 제공되는 완전 정밀도 모델입니다.
