생성된 타이틀 카드는 'Bonsai vs Ternary Bonsai 2 27B'라고 적혀 있고, 부제는 '두 가지 저비트 베팅, 두 가지 다른 잣대'이며, 그 아래에는 '가중치: 0.43 GB vs 5.93 GB', '품질 주장: 비교형 vs 98.2% 유지율', '실리콘: Hexagon NPU vs Apple silicon 및 CUDA'라고 적힌 세 장의 카드가 있습니다. 바닥글에는 '모든 품질 수치는 공급업체 보고이며 재현되지 않았습니다.'라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래에 있습니다.
Guides & Insights

Bonsai vs Ternary Bonsai 2 27B: 두 가지 저비트 베팅, 두 가지 서로 다른 잣대

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

1-bit Bonsai 2B 비전-언어 모델을 Ternary Bonsai 2 27B 옆에 놓으면, 뻔한 비교—20억 개 매개변수 대 270억 개, 0.43GB의 언어 가중치 대 5.93GB—는 이 둘에 관한 가장 흥미로운 점이 아니다. 흥미로운 점은 같은 벤더, 같은 압축 프로그램에서 나온 두 모델이 품질을 같은 방식으로 보고하지 않는다는 것이다. Ternary Bonsai 2 27B는 보존율을 보고한다. 즉, 자사의 풀정밀도 대응 모델이 거둔 집계 벤치마크 성능 중 98% 이상을 유지하며, 자기 자신을 기준으로 측정한다. 1-bit Bonsai 2B는 비교를 보고한다. 즉, 4비트 양자화된 Qwen 3 1.7B 모델에 대해 "비교할 만한 벤치마크 결과"를 달성했으며, 다른 정밀도의 다른 누군가의 모델을 기준으로 측정했다. 하나는 얼마나 잃었는지에 대한 진술이다. 다른 하나는 얼마나 잘 맞서는지에 대한 진술이다. 어느 것도 두 모델 중 어느 하나가 절대적 기준에서 얼마나 좋은지에 대한 진술이 아니며, 둘은 같은 척도로 읽을 수 없다.

그 구분은 매개변수 수보다 더 중요하다. 왜냐하면 그것이 벤더의 수치로부터 실제로 무엇을 결론 내릴 수 있는지를 결정하기 때문이다 — 그리고 지금까지 공개된 증거로 볼 때, 솔직한 답은 헤드라인 수치가 시사하는 것보다 적다.

품질 주장 두 가지, 서로 다른 자 두 개

2026년 9월 17일에 공개된 Ternary Bonsai 2 27B는 Qwen3.8-27B를 가중치당 유효 1.76비트로 삼진 {−1, 0, +1} 재구성한 모델이며, PrismML이 앞세우는 수치는 전체 정밀도 모델의 종합 벤치마크 성능을 98% 이상 유지한다는 것입니다. 이는 유지율 주장이고, 유지율 주장은 구조상 자기참조적입니다. 즉 원본이 어느 위치에 있었는지가 아니라 압축 후 원본의 얼마나 살아남았는지를 알려줄 뿐입니다. 평범한 기준 모델의 98%를 유지하는 모델은 여전히 평범한 모델이며, Qwen3.8-27B는 평범하지 않습니다. 하지만 그 숫자만으로는 이를 알 수 없고, 기본 모델 간에 비교할 수도 없습니다.

2026년 9월 23일 Snapdragon AR1 Gen 1 안경 플랫폼용으로 발표된 1-bit Bonsai 2B 비전-언어 모델은 1.7B 1비트 언어 모델과 0.3B 4비트 비전 인코더로 구성됩니다. 이 모델의 공개된 품질 설명은 성격이 다릅니다: PrismML은 BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K, GPQA Diamond 전반에서 4비트 양자화된 Qwen 3 1.7B 모델과 비교 평가했고, 두 구성이 비교 가능한 결과를 달성했다고 보고했습니다. 이는 외부 기준선에 대한 동등성 주장입니다. 이는 압축이, 그렇지 않았다면 사용했을 4비트 경로에 비해, 눈에 띄게 손해를 끼치지 않았다는 뜻입니다 — 이는 디바이스급 출시에 정확히 맞는 질문이며, “이 모델은 좋다”보다 훨씬 약한 주장입니다.

그러므로 98.2%가 “comparative”를 앞선다고 해석할 여지도, 그 반대라고 해석할 여지도 없다. 그 둘은 같은 벤더가 서로 다른 두 기준에 비추어, 서로 다른 두 스위트에서 제기한 서로 다른 두 질문에 대한 답이다. 누구든 이 두 문장을 근거로 이 두 모델의 순위를 매긴다면, 그건 문장의 순위를 매기는 것이다.

베이스 모델들은 각기 다른 곳에서 왔습니다.

두 번째 구조적 차이가 있으며, 그것은 앞으로 1년 동안 중요해질 차이입니다. Ternary Bonsai 2 27B는 외부 모델 — 알리바바의 Qwen3.8-27B — 을 재압축한 것입니다. 그 품질 상한은 다른 누군가의 출시 일정에 의해 정해지며, 세대 교체 주기는 PrismML보다 Qwen을 따라갑니다. Qwen이 새로운 27B를 출시하면 Bonsai 27B 라인은 새로운 입력을 받게 되고, 유지율 수치는 새로운 기준선에 맞춰 다시 계산됩니다.

1-bit Bonsai 2B는 PrismML 자체의 Bonsai 1.7B를 기반으로 구축되었다. 이 모델의 성능 상한은 사내에서 정해지고, 업데이트 주기는 PrismML이 선택하며, 개선은 업스트림 모델 교체가 아니라 압축 레시피와 커널 경로에서 비롯된다. 이는 성격이 다른 자산이다. 원시 성능을 개선하는 속도는 더 느리지만, 전적으로 벤더의 통제 아래에 있으며 — 안경 출시 사례가 보여주듯 — 일반적인 재압축으로는 할 수 없는 방식으로 특정 가속기에 맞춰 튜닝할 수 있다.

둘 다 합당한 전략입니다. 두 전략은 서로 바꿔 쓸 수 있는 것이 아니며, 어떤 전략이 필요한지는 로드맵이 Qwen에 맞춰져 있는지 아니면 디바이스에 맞춰져 있는지에 따라 달라집니다.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder running on the Snapdragon AR1 Gen 1 Platform.

사양 비교, 한 줄씩

• 매개변수 — 안경 모델의 1.7B 1비트 LLM + 0.3B 4비트 비전 인코더로, Ternary Bonsai 2 27B의 Qwen3.8-27B에서 파생된 27B급 모델과 대비됩니다.

• 표현 — 글래스 모델에서는 FP16 그룹별 스케일링을 사용하는 이진 {−1, +1}이며, 27B에서는 동일한 스케일링으로 가중치당 유효 1.76비트인 삼진 {−1, 0, +1}과 대비됩니다.

• 언어 모델 가중치 — 1비트 1.7B는 0.43GB인 반면, Ternary Bonsai 2 27B의 PTQ1_0 패킹은 5.93GB이며, 7.25GB PQ2_0 패킹도 제공됩니다.

• 컨텍스트 — 안경 모델에서는 1,024토큰인 데 반해, Ternary Bonsai 2 27B에서는 262,000토큰의 전체 컨텍스트.

• 가속기 — 1비트 커널을 지원하는 QNN SDK를 통한 Qualcomm Hexagon NPU, MLX를 통한 Apple silicon 및 CUDA를 통한 NVIDIA와의 대결.

• 품질 주장 — 4비트 Qwen 3 1.7B에 대비한 "비교 벤치마크 결과", 그리고 전체 정밀도 Qwen3.8-27B 기준선의 "98% 이상" 유지율에 대비한 결과. 둘 다 공급업체가 보고한 것이며, 어느 것도 독립적으로 재현되지 않았고, 서로 다른 스위트에서 측정되었습니다.

• 런타임 — 안경 모델을 위한 Qualcomm NPU 툴체인으로, PrismML 자체의 llama.cpp 포크 및 27B용 MLX 컨테이너와 대조되며, 이들 중 어느 것도 기본 llama.cpp에서는 지원하지 않습니다.

A screenshot of PrismML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces the memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

각 경우에 로우비트 베팅이 무엇을 얻어내는가

압축 철학은 두 모델에서 동일하며, 이는 이 패밀리의 실제 테제이기 때문에 이름을 붙일 가치가 있습니다: 저비트 표현은 임베딩, 어텐션, MLP, LM 헤드까지 엔드투엔드로 실행되며, FP16 그룹별 스케일링을 사용하고 더 높은 정밀도의 탈출구는 없습니다. 어느 모델도 양자화하기 어려운 부분을 위한 부동 소수점 안전망을 유지하지 않습니다. 이는 대부분의 양자화 작업이 취하는 것보다 더 공격적인 입장이며, 이것이 가중치당 1.76비트와 0.43GB 가중치를 비로소 가능하게 만듭니다.

이 베팅이 결실을 맺는 지점은 다릅니다. Ternary Bonsai 2 27B에서 결실은 이미 가지고 있는 하드웨어에서의 바이트당 역량입니다: 5.93GB에 담긴 27B급 모델이 노트북이나 휴대폰에서 자체 기준 성능의 98%로 실행됩니다. 1-bit Bonsai 2B에서 결실은 선택지가 없던 기기 등급에서의 존재 자체입니다: 0.43GB의 언어 가중치에 담긴 멀티모달 모델이 NPU에서 초당 15.36토큰으로 실행됩니다. 첫 번째는 이미 작동하던 것의 더 나은 버전입니다. 두 번째는 이전에는 작동하지 않던 것입니다.

티어 경계가 위치하는 곳

이 둘은 대안이 아니며, 이들을 맞대결 구도로 다루는 것은 두 릴리스가 가리키는 배포 형태를 놓치는 일입니다. 안경이나 웨어러블 제품은 다른 무엇도 맞지 않기 때문에 2B를 로컬에서 실행합니다. 노트북이나 폰 제품은 가능하기 때문에 27B를 실행합니다. 제품이 둘 모두를 아우르는 순간 — 안경과 페어링된 폰 앱, 온디바이스 어시스턴트가 있는 노트북 앱 — 질문은 어떤 모델이냐가 아니라 각 계층이 어떤 요청에 답하도록 허용되는지가 됩니다.

그 경계는 애플리케이션 코드가 아니라 구성에 두는 것이 좋습니다. 두 계층 모두 움직일 것이기 때문입니다. 27B 라인은 Qwen이 출시할 때 움직이고, 2B 라인은 PrismML이 레시피를 바꿀 때 움직이며, 컨텍스트 길이나 성능에 관한 하드코딩된 규칙은 두 사건 모두에서 깨집니다. 로컬 계층의 예산을 넘어서는 요청을 호스팅 모델로 에스컬레이션하는 라우팅 정책은 두 변화 모두에서 살아남습니다. 로컬 계층은 클라이언트 전반에 퍼진 가정이 아니라 여러 계층 중 하나로 남습니다. OrcaRouter는 그 에스컬레이션을 수행하는 계층입니다 — 200개 이상의 호스팅 모델을 아우르는 단일 엔드포인트, 페일오버 포함, 정책은 구성으로 표현됩니다. 여기서 라우팅되는 Bonsai는 없습니다. 둘 다 로컬 다운로드입니다. 여기 있는 것은 그들 위의 계층이며, 1,024토큰 로컬 모델에서는 그 계층이 대부분의 작업을 처리합니다.

A generated scoreboard titled 'Bonsai vs Ternary Bonsai 2 27B — the scoreboard'. The Bonsai column reads: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; weights 0.43 GB; context 1,024 tokens; representation binary; quality claim comparative against 4-bit Qwen 3 1.7B; accelerator Qualcomm Hexagon NPU. The Ternary Bonsai 2 27B column reads: parameters 27B on Qwen3.8-27B; weights 5.93 GB PTQ1_0; context 262K tokens; representation ternary at 1.76 bits per weight; quality claim over 98% retention of full precision; accelerator Apple MLX and NVIDIA CUDA. Footer reads 'All quality figures vendor-reported; the two claims use different baselines and suites.' The OrcaRouter logo sits in the bottom-right.

무엇이 그것을 해결할까요?

세 가지 측정이 있어야 이 두 제품이 두 개의 마케팅 주장에서 비교 대상으로 바뀔 것입니다. "비교 결과" 문구 뒤에 있는 벤치마크별 세부 분석, 그래야 4비트 대비 트레이드오프가 요약된 형태가 아니라 눈에 보이게 됩니다. 1비트 Bonsai 2B의 자체 풀정밀도 베이스라인 대비 보존율 수치 — PrismML이 27B 라인에 사용하고 여기서는 공개하지 않은 측정치입니다. 그리고 두 모델 중 어느 하나에 대한 독립적인 평가인데, 현재 두 발표의 모든 수치가 벤더에서 나온 것이기 때문입니다.

그중 하나가 존재하기 전까지는, 숫자가 실제로 뒷받침하는 입장이 가장 방어 가능하다: Ternary Bonsai 2 27B는 훨씬 큰 차이로 더 나은 모델이고, 1-bit Bonsai 2B는 둘 중에서 자신이 만들어진 기기에서 실행되는 유일한 모델이다. 이 두 진술은 서로 충돌하지 않으며, 같은 벤더가 서로 다른 잣대로 그것들을 측정했다는 사실이 다음번에 이 수치 중 하나가 기준선 없이 인용될 때 기억할 만한 점이다.