
Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF: 더 적은 비트, 더 높은 점수
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B는 Qwen3.8-27B의 IQ2_XXS GGUF 빌드보다 더 작고, 함께 공개된 수치로 보면 더 우수하기도 하다 — 두 모델을 가른 것이 비트 예산뿐이라면 있을 수 없는 일이다. Bonsai 빌드는 5.93GB 파일에 가중치당 1.76비트를 담고 있다. 같은 기본 모델의 기존 2비트 양자화는 약 7.3GB 파일에 가중치당 대략 2.2비트를 담고 있다. 2026년 9월 17일 삼진 빌드를 발표한 Prism ML은 자사 모델이 20개 벤치마크 평균 83.9를 기록한 반면 IQ2_XXS 비교 대상은 75.2였다고 보고한다 — 더 적은 비트를 사용하는 모델에 유리한 8.7포인트 격차다.
그 역전이 이야기의 전부이며, 그것은 속임수가 아니다. 두 파일은 모델 생애의 서로 다른 단계에서 서로 다른 프로세스에 의해 생성되며, 그 프로세스들 사이의 차이는 비트 폭의 차이보다 더 큰 가치가 있다. 이 비교는 또한 "그냥 2비트 양자화를 쓰면 돼, 요즘은 괜찮아"라는 대중적인 조언이 가장 명확한 반례와 맞닥뜨리는 지점이며, 그 반례 뒤에는 벤더의 말이 아니라 독립적인 측정이 있다.
역설이 메커니즘이다
IQ2_XXS는 학습 후 양자화 형식입니다. 모델은 완전 정밀도로 수렴할 때까지 학습된 뒤, 이후에 가중치가 피팅 절차에 의해 선택된 저비트 표현으로 반올림됩니다. 모델은 적응할 기회를 전혀 얻지 못합니다. 사후에 측정되어 근사될 뿐입니다. i-quant 계열은 중요도 행렬, 즉 사용 가능한 정밀도 중 어떤 가중치에 더 많은 몫을 배분할지 결정하는 캘리브레이션 패스를 사용함으로써 기존 k-quants를 개선하지만, 근본적인 연산 순서는 바뀌지 않습니다. 학습한 다음 압축합니다.
Bonsai는 그 순서를 뒤집습니다. Prism ML이 자사 방법에 관해 설명하기를, 학습 후 양자화를 완전히 포기하고 삼진 제약을 훈련 중에 강제했다고 합니다: 순전파는 가중치를 {−1, 0, +1}로 제한하여 계산하는 반면, 역전파는 여전히 전체 정밀도 그래디언트를 전달합니다. 모델은 제약을 전혀 예상하지 못한 표현에 제약을 가하는 대신, 그 제약을 견뎌내는 표현을 학습하는 데 훈련을 사용합니다. 이 알고리즘은 독점 IP로 설명되지만, 그 형태는 BitNet 계열 연구를 읽어본 사람이라면 누구나 익숙할 것입니다.
두 가지 개선이 그 위에 얹혀 있으며, 둘 다 산술 연산에서 드러납니다. 첫째는 선택적 정밀도입니다. 2,620만 개 파라미터 — 모델의 약 0.098%, bf16 기준 약 52MB, 대부분 선형 어텐션 계층의 순환 상태 경로와 정규화 가중치 — 는 삼진화되지 않고 완전 정밀도로 유지됩니다. 둘째는 블록 단위 회전입니다. 각 가중치 행렬은 삼진 값이 선택되기 전에 블록 크기 1,024의 월시–아다마르 회전으로 변환되며, 이는 이상치를 좌표 전반에 분산시켜 3단계 근사를 덜 파괴적으로 만듭니다. 회전은 저장된 가중치에 접혀 들어가므로 추가 바이트 비용이 들지 않으며, 대신 런타임에는 활성화에 대응하는 변환이 적용됩니다.
그 마지막 세부 사항에는 그것을 처음 실행해 보려는 순간 맞닥뜨리게 되는 결과가 따르며, 그것이 바로 이 접근 방식의 진정한 비용입니다.
어떤 IQ2_XXS를 말하는 건지, 그리고 그것이 실제로 어떤 점수를 받는지
품질을 비교하기 전에, 대부분의 보도가 빠뜨리는 정정 사항이 하나 있습니다: "IQ2_XXS"는 하나의 아티팩트가 아닙니다. 이는 llama.cpp 양자화 유형이며, 서로 다른 툴체인이 동일한 기본 모델에 동일한 유형을 적용하면 크기에서는 의미 있게, 품질에서는 상당히 차이 나는 파일이 생성됩니다.
가장 명확한 공개 증거는 2026년 8월 15일에 한 사용자가 2비트 미만의 Qwen3.8-27B를 과연 만들 가치가 있는지 조사하며 올린 독립적 비교입니다. 이 테스트는 wikitext-2 KL 발산 측정으로, 512 컨텍스트에서 100개 청크를 대상으로 하며, 퍼플렉서티 6.7500의 로컬 빌드 Q8_0 기준과 비교하고, 모든 후보가 동일한 중요도 행렬, 말뭉치, 기준선 및 llama.cpp 빌드를 한 번에 사용했습니다. 결과는 다음과 같습니다:
• unsloth UD-IQ2_XXS — 8.39 GiB, 퍼플렉서티 7.6528, 평균 KLD 0.146, 중앙값 KLD 0.076, top-1 일치율 82.98%
• bartowski IQ2_XXS — 8.75 GiB, 퍼플렉서티 8.5352, 평균 KLD 0.301, 중앙값 KLD 0.162, top-1 일치율 76.53%
동적 변형은 정적 변형보다 0.36 GiB 더 작고 평균 KLD에서 약 2.1배 더 우수합니다 — 기준선 퍼플렉서티의 1.13배에서요. 같은 레이블을 달고 있는 두 파일이, 출력 분포가 얼마나 멀어졌는지 측정하는 지표에서 두 배 차이로 갈라졌습니다. 동일한 테스트에서 모든 2비트 미만 후보가 공개된 두 IQ2 옵션 모두보다 더 나쁜 것으로 나타났으며, 그래서 이 기본 모델의 실질적 하한선은 IQ2 아래가 아니라 IQ2에 있습니다.

이 점은 비교에 중요합니다. 왜냐하면 "7.3 GB IQ2_XXS 빌드"가 가리키는 대상이 달라지기 때문입니다. Prism ML의 수치는 기본 모델을 가중치당 2.2비트로 자체 양자화한 데서 비롯됩니다. 같은 계열의 unsloth 동적 빌드는 8.39 GiB로 측정됩니다. bartowski 빌드는 8.75 GiB로 측정됩니다. 따라서 Bonsai와 "IQ2_XXS" 사이의 크기 격차는 어떤 빌드를 의미하느냐에 따라 1.4배에서 1.5배 사이 어딘가입니다 — 이는 헤드라인이 암시하는 1.23배보다 크며, 그 격차 전부가 품질 비교가 시작되기도 전에 발생합니다.
학습 후 빌드가 어디에서 깨지는지, 그리고 왜 놓치기 쉬운지
8.7점의 총합 격차는 그 차이를 말하는 가장 정보가 적은 방식이다. IQ2_XXS 빌드의 저하가 균일하지 않기 때문이다. 그것은 선택적이며, 그 패턴은 대부분의 사람들이 예측하는 것과 정반대다.
• MMLU-Redux — 포스트 트레이닝 빌드는 80%대 중후반으로 상당히 괜찮게 버틴다
• GPQA Diamond — 약 65.5, 삼항 빌드의 85.76과 대비
• AIME26 — 빌드에 따라 57.5~78.6 범위이며, 삼진(ternary) 빌드의 95.83과 대비됩니다.
• LiveCodeBench — 56.4~70.05 범위로, 삼항 빌드의 90.07과 대조적입니다
IQ2의 정확한 수치는 Prism ML의 여러 제품군과 커뮤니티 측정치 사이를 오가며, 위의 범위는 양쪽 모두에 걸쳐 있지만, 그 형태는 모든 출처에서 일관됩니다. 표면적 지식은 살아남고, 지속적인 추론 연쇄를 요구하는 것은 무엇이든 급격히 무너집니다. 바로 이것이 캐주얼한 테스트로는 발견되지 않는 실패 유형입니다. 2비트 빌드에 문서 요약이나 사실 확인 질문을 시키면 훨씬 더 큰 모델처럼 작동합니다. 여러 단계의 유도 과정을 유지하거나 사소하지 않은 코드를 생성하라고 하면, 붕괴는 점진적이 아니라 갑작스럽게 일어납니다. 이것이 "직접 해봤을 때는 괜찮았다"가 양자화된 모델에 대한 증거가 되지 못하는 이유입니다. 그것은 당신이 우연히 시도해 본 프롬프트에 대한 증거일 뿐입니다.
삼진 빌드는 동일한 벤치마크에서 그런 붕괴를 보이지 않는다. Prism ML은 AIME26을 95.83으로 보고하는데, 이는 전체 정밀도 베이스의 94.58과 대비되며, LiveCodeBench는 90.07로 90.05와 대비된다 — 사실상 동등한 수준이며, 이는 이번 릴리스에서 가장 유용한 단일 주장인데, 훈련 시점 제약이 포스트트레이닝 시점 제약이 잃는 것을 얻어냈다는 뜻이기 때문이다.
실질적이지만 품질 표가 포착하지 못하는 반론
위의 모든 내용은 바이트당 품질 측면에서 ternary 빌드에 더 유리합니다. 기존 GGUF가 완전히 우위를 점하는 한 가지 차원이 있는데, 이는 결코 사소한 것이 아닙니다. 바로 이미 가지고 있는 소프트웨어에서 실행된다는 점입니다.
Qwen3.8-27B의 IQ2_XXS 빌드는 기본 llama.cpp 아티팩트입니다. 이는 llama.cpp, Ollama, LM Studio, Jan, 그리고 ggml을 링크하는 그 밖의 모든 것에서 로드되며, ggml이 지원하는 모든 플랫폼에서 포크가 필요 없고 특수 커널도 필요 없습니다. 중요도 행렬은 다시 만들거나 교체할 수 있습니다. 디스크에 있는 다른 모든 양자화 모델과 똑같이 동작합니다.
Ternary Bonsai 2 27B는 그렇지 않습니다. 이 아키텍처의 하이브리드 어텐션을 위한 ternary 커널은 Prism ML 자체의 llama.cpp 포크에 있습니다. 기본 llama.cpp는 PTQ1_0과 PQ2_0을 인식되지 않는 유형으로 거부하며, 해당 팩이 전제로 하는 회전된 기저를 어떻게 처리해야 할지 전혀 모릅니다. Apple Silicon용 MLX 빌드에는 Metal 및 CPU 커널이 있지만 CUDA 경로가 없으므로, NVIDIA 머신에서는 수 분이 걸릴 수 있는 CPU 순전파로 폴백합니다. Prism ML이 여러 런타임과의 통합을 나열하긴 하지만, 근본적인 요점은 그대로입니다: 이 모델의 사용성은 선택한 런타임이 이 모델에 대해 알고 있도록 만들어졌는지에 따라 제한됩니다.
그것이 정직한 맞교환입니다. 당신은 1.4배 더 크고, 당신이 27B 모델을 가장 원할 만한 바로 그 작업들에서 측정 가능할 정도로 더 나쁘지만 어디서나 실행 가능한 빌드와, 더 작고 더 나은 — 현재로선 한 연구소의 포크에 그것을 채택한 런타임들을 더한 정도에 불과한 생태계 위에 있는 빌드 — 사이에서 선택하고 있습니다.

둘 중 하나를 실행하는 데 필요한 것
메모리 계산은 파일 크기가 말해 주는 것보다 더 빠듯하다. VRAM에는 파일만 있는 게 아니기 때문이다.
• IQ2_XXS 빌드 — 가중치 8.39~8.75GiB로, 16GB 카드에서 컨텍스트와 드래프트 모델을 위해 약 7.5GB의 여유 공간을 남깁니다. 위의 독립 테스트는 8.39GiB 빌드가 이미 2.1GB 드래프트 모델을 함께 수용한다는 점을 특히 지적합니다.
• Ternary Bonsai 2 27B — PTQ1_0 언어 모델용으로 5.93GB, 이미지를 조금이라도 사용한다면 0.63GB 비전 타워, 그리고 컨텍스트가 추가됩니다. Prism ML의 PQ2_0 패킹은 7.25GB를 차지하며, 대역폭이 아니라 명령 처리량에 제한을 받는 하드웨어에서는 더 빠른 옵션입니다.
속도 면에서, 보고된 삼진(ternary) 수치는 RTX 5090에서 디코드 142.5 tok/s, Apple M5 Max에서 46.8 tok/s입니다. IQ2 빌드에 대한 제3자 보고는 더 희박하며, 듀얼 Radeon 카드에서의 Vulkan 측정치는 생성 약 3.8 tok/s입니다. 다만 그 숫자는 양자화 자체보다는 그 특정 백엔드에 대해 더 많은 것을 말해줍니다. 양쪽의 처리량 수치는 하드웨어에 크게 좌우되는 것으로 간주하십시오.
OrcaRouter가 적합한 경우와 그렇지 않은 경우
이 두 파일 중 어느 것도 라우터가 제공하는 대상이 아닙니다. 이들은 로컬 산출물이며, 솔직히 말하자면 OrcaRouter는 어느 쪽도 호스팅하지 않습니다. 이것은 여러분의 자체 하드웨어에서 무엇이 실행되는지에 관한 비교입니다. 우리 쪽에 있는 것은 이 둘 모두의 원본이 된 모델입니다. Qwen3.8-27B 풀 정밀도는 OrcaRouter 자체 인프라를 통해 입력 토큰 백만 개당 $0.33, 출력 토큰 백만 개당 $2.40에 이용할 수 있으며, 모델 고유의 262K 컨텍스트와 낮음/중간/높음 추론 노력 제어 기능이 그대로 유지됩니다.
그러면 하이브리드 구성이 되는데, 이에 대해서는 구체적으로 짚어볼 가치가 있습니다. 잘하는 작업에는 압축 빌드를 로컬에서 실행하고, 전체 정밀도가 필요한 이따금의 요청은 동일한 키를 통해 호스팅된 기본 모델로 라우팅하세요. 별도의 벤더 계약도, 코드 변경도 필요 없습니다. 양쪽 모두 같은 API를 사용하기 때문입니다. 로컬 빌드가 특정 워크로드에 맞지 않는 것으로 드러나면, 실패한 요청은 자동으로 페일오버될 수 있습니다. 오류로 반환되는 대신 말입니다. 이는 양자화가 부적합하다는 사실을 프로덕션에서 발견하는 것보다 더 저렴하게 발견하는 방법입니다.
간략 버전
• 공개된 바이트당 품질 기준으로 보면, ternary 빌드가 확실히 우세하며, 그 우세는 추론과 코드에 집중됩니다 — post-training 빌드가 가장 크게 성능이 저하되는 범주입니다.
• 이식성 측면에서도 IQ2_XXS 빌드가 마찬가지로 확실하게 우위를 점합니다. 어디서나 기본 런타임, 포크 없음, 특수 커널 없음, 조용히 쓰레기 값을 내놓는 실패 모드도 없습니다.
• 비교는 "1.76비트 대 2.2비트"가 아니다. 그것은 "학습 중에 선택된 표현 대 사후에 적합된 표현"이며, 0.44비트 차이는 그에 비하면 반올림 오차에 불과하다.
• 이 글에서 ternary 빌드에 대한 모든 품질 수치는 Prism ML이 선택한 스위트에서 Prism ML이 직접 측정한 값입니다. IQ2 빌드의 KLD 결과는 독립적이고 단일 실행이며, 하나의 베이스 모델과 하나의 테스트 세트에만 국한됩니다. 이는 이 비교에서 가장 강력한 제3자 증거이지만, Bonsai에 대해서는 아무것도 말해 주지 않습니다.
이 격차는 반대 방향에서도, 그리고 아마 곧 좁혀질 것이다. ternary 커널이 llama.cpp 업스트림에 들어가면, Bonsai에 대한 단 하나의 진지한 반론은 사라지고 선택은 명확해진다. 그때까지 IQ2_XXS 빌드는 그것이 얼마나 좋은지와는 아무 상관 없는 실질적 이점을 계속 유지한다.

이번 주에 결정을 내리는 중이라면, 판가름하는 테스트는 오후 한나절이면 된다. 자신의 업무에서 여러 단계의 추론이 필요한 프롬프트 20개를 뽑아, 두 빌드를 모두 실행하고, 답변을 블라인드로 채점하라. 공개된 표들은 어디를 봐야 하는지 알려준다. 하지만 당신의 업무가 거기에 속하는지는 알려주지 못한다.
