
Ternary Bonsai 2 27B vs Bonsai 27B: 두 달, 두 개의 베이스 모델, 하나의 빠진 변형
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B는 2026년 9월 17일에 등장했는데, 이는 Bonsai 27B가 2026년 7월 14일에 출시된 지 두 달 후의 일이다. 두 모델을 비교할 때 가장 눈에 띄는 것은 단 한 쌍의 숫자다. 첫 세대는 자사의 풀정밀도 기본 모델 벤치마크 평균의 약 95%를 유지했고, 두 번째 세대는 98.2%를 유지한다. 이는 단순한 세대 개선처럼 읽히며, 대체로 그렇기도 하다 — 하지만 두 수치는 같은 것을 측정하는 게 아니다. 그 밑에서 기본 모델이 바뀌었기 때문이다. 7월 릴리스는 Qwen3.6-27B를 압축했다. 9월 릴리스는 Qwen3.8-27B를 압축한다. 품질 향상의 일부는 압축 레시피 덕분이고, 일부는 더 새로운 Qwen3.8-27B 덕분이며, 이 둘을 분리해 보여주는 공개 수치는 없다.
세대 간에는 훨씬 덜 주목받아 왔지만 특정 사용자 그룹에게는 더 중요한 두 번째 차이가 있습니다: 첫 번째 Bonsai는 두 가지 변형으로 출시되었고, 두 번째 Bonsai는 한 가지로 출시됩니다. 27B급 모델을 iPhone 17 Pro에 구동할 수 있게 한 3.9GB 빌드는 이번 릴리스에 후속이 없습니다. 그 설치 용량이 애초에 Bonsai에 관심을 가진 이유였다면, 최신 세대는 업그레이드가 아닙니다 — 여러분의 사용 사례를 커버하지 않는 다른 제품입니다.
1세대가 실제로 출시한 것
Bonsai 27B는 2026년 7월 14일 Apache 2.0 라이선스로, 동일한 기본 모델을 기반으로 만들어진 두 개의 아티팩트로 출시되었으며, 그 둘 사이의 분리가 바로 이번 출시의 핵심이었다.
• Ternary Bonsai 27B — 삼진 {−1, 0, +1} 가중치에 FP16 그룹별 스케일링을 적용, 가중치당 실효 1.71비트, 5.9GB 풋프린트. 완전한 추론, 도구 호출, 에이전트 기능을 갖춘 일상용 노트북을 겨냥한 품질 지향 빌드.
• 1비트 Bonsai 27B — 동일한 그룹별 스케일링을 사용하는 이진 {−1, +1} 가중치, 가중치당 유효 1.125비트, 3.9GB 풋프린트. iPhone 17 Pro의 메모리 예산에 맞도록 크기를 조정한 풋프린트 지향 빌드.
둘 다 262K 토큰 컨텍스트를 갖췄고, 둘 다 모델이 멀티모달을 유지하도록 컴팩트한 4비트 비전 타워를 유지했으며, 둘 다 DSpark 드래프터를 사용한 추측 디코딩을 지원했습니다. 당시 Prism ML의 설명은 저비트 표현이 임베딩, 어텐션, MLP, LM 헤드까지 엔드투엔드로 실행되며 더 높은 정밀도로 빠져나갈 수 있는 우회로가 없다는 것이었고, 1비트 빌드는 휴대폰에서 실행된 최초의 27B급 모델이었다는 것이었습니다. 보고된 처리량은 1비트 변형의 경우 iPhone 17 Pro에서 약 초당 11토큰, Apple M5 Max에서 87 tok/s, RTX 5090에서 163 tok/s였으며, 삼진 변형은 M5 Max에서 58 tok/s, 5090에서 134 tok/s로 제시되었습니다.
품질 비용은 묻히기보다는 그 수치들과 함께 보고되었습니다. 15개 벤치마크로 구성된 사고 모드 스위트에서 전체 정밀도 기본 모델은 85.0점, 삼진 빌드는 80.5점 — 약 95% —, 1비트 빌드는 76.1점, 약 90%를 기록했습니다. 성능 저하는 1비트 빌드에서 80.0점에서 66.0점으로 떨어진 에이전트형 도구 호출과 72.6점에서 59.6점으로 떨어진 비전에 집중되었습니다. 수학과 코딩은 두 변형 모두에서 상당히 더 잘 유지되었습니다.

2세대가 바꾼 것
Ternary Bonsai 2 27B는 레시피를 유지한 채 입력을 바꿉니다. 삼진 표현은 여전히 {−1, 0, +1}이고, 128개 가중치 그룹당 하나의 FP16 스케일을 사용하며, 이제는 가중치당 1.76비트로 5.93 GB 파일에 패킹되고, 262K 컨텍스트와 동일한 별도 비전 타워를 갖춥니다 — 이번 릴리스에서는 4비트로 0.63 GB이며, 이미지가 들어올 때만 로드됩니다.
두 가지가 진정으로 새로운데, 둘 모두 유지율 수치가 움직인 이유로 설명된다.
첫 번째는 선택적 정밀도입니다. 사실상 모든 것을 삼진화한 7월 빌드와 달리, Bonsai 2는 26,238,464개의 매개변수를 전체 정밀도로 유지합니다 — 언어 모델의 0.0976%, bf16 기준 약 52MB이며, 선형 어텐션 레이어의 순환 상태 경로와 정규화 가중치에 집중되어 있습니다. 이는 바이트 측면에서는 작은 양보지만, 동작 측면에서는 분명히 큰 양보인 듯합니다.
두 번째는 회전된 가중치 기저입니다. 가중치 행렬은 블록 크기 1,024에서 블록 단위 월시-하다마드 회전 후 저장되며, 런타임에 활성화에 대응하는 변환이 적용됩니다. 이는 이상치를 좌표 전체에 분산시키면 3단계 근사가 덜 손실된다는 이론에 기반합니다. 회전이 가중치에 접혀 들어가기 때문에 추가 저장 공간이 들지 않지만, 계산 경로에는 위치합니다.
그다음에는 전혀 기법이라고 할 수 없는 변화가 있습니다: 바로 기본 모델입니다. Qwen3.8-27B는 하이브리드 어텐션 설계로, 대략 75%는 선형 어텐션, 25%는 전체 어텐션이며, 이전 모델은 그렇지 않았습니다. Prism ML이 보고한 카테고리 점수는 그 변화가 무엇을 얻어냈는지 보여줍니다. Bonsai 2의 지시 수행 점수는 82.66이며, 1세대가 압축한 기본 모델인 Qwen3.6-27B의 74.53과 비교됩니다. 추론과 지식은 83.95로, 더 오래된 기본 모델의 84.71과 비교되고, 코딩은 81.58로 82.57과 비교됩니다. 새 기본 모델은 지시 수행에서 큰 차이로 더 뛰어나고 다른 두 카테고리에서는 약간 뒤처지는데, 이는 세대 간 보존율 퍼센트만으로는 도움이 되지 않게 만드는 바로 그런 종류의 프로필입니다.
두 리텐션 수치가 서로 비교할 수 없는 이유
95%와 98.2%는 한 척도 위의 두 측정값처럼 보인다. 하지만 레시피가 3.2포인트 개선되었다고 결론 내리기 전에 분명히 해 둘 만한 세 가지 이유 때문에 그렇지 않다.
• 분모가 다릅니다. 1세대의 95%는 Qwen3.6-27B를 대상으로 한 15개 벤치마크 스위트에서 측정되었습니다. 2세대의 98.2%는 Qwen3.8-27B를 대상으로 한 20개 벤치마크 스위트에서 나온 값입니다. 서로 다른 스위트, 서로 다른 기준선, 서로 다른 난이도 구성입니다.
• 기준선들은 독립적으로 움직였다. 보존 성능 향상 중 일부는 압축된 모델이 압축을 더 잘하게 된 데서 비롯되고, 일부는 기본 모델이 우연히 삼진 가중치에 더 우호적인 방식으로 변한 데서 비롯된다. 발표된 어떤 연구도 이 기여들을 분리하지 않는다.
• 리텐션은 상대적인 지표이므로, 특정 카테고리에서 절대적 성능이 떨어지는데도 리텐션은 상승할 수 있습니다. 더 약한 부모 모델의 99%를 유지하는 모델이 더 강한 모델의 96%를 유지하는 모델보다 여전히 뒤처질 수 있습니다.
절대 비교가 상대 비교보다 더 많은 정보를 주며, 그 기준에서는 이야기가 더 깔끔하다. Bonsai 2의 집계 점수 83.9는 구형 스위트에서 풀정밀도 Qwen3.6-27B가 기록한 83.6보다 높다 — 즉 압축된 후속 모델이 이제 한 세대 전에 대체했던 비압축 모델보다 앞서 있다는 뜻이다. 1세대 삼진 빌드는 자체 스위트에서 80.5점을 기록했다. 그 두 수치는 모두 Prism ML의 것이고 스위트도 서로 다르므로, 소수점 이하가 아니라 대소 순서를 읽어야 한다.

돌아오지 않은 변이
이것은 벤치마크 차트가 아니라 구매 결정을 바꾸는, 비교의 바로 그 부분입니다.
1비트 Bonsai 2는 없습니다. 9월 릴리스에는 삼진 빌드가 두 가지 패킹으로 제공됩니다. 가중치당 1.76비트, 5.93GB인 PTQ1_0과 가중치당 2.16비트, 7.25GB인 PQ2_0이며, Apple Silicon용 MLX 컨테이너도 포함됩니다. 3.9GB 바이너리 변형은 없고, 그런 발표도 없습니다. 현재 보도에 나오는 3.9GB 휴대폰급 수치는 여전히 7월 모델을 가리킵니다.
실질적인 결과는 직접적입니다. 대상이 iPhone이나 iPad, 또는 5.9GB 언어 모델에 0.63GB 비전 타워와 컨텍스트 예산까지 더해도 들어가지 않는 기기라면, 이 제품군에서 1세대 1비트 빌드가 유일한 선택지로 남으며, 1비트 Bonsai 2가 존재하기 전까지는 계속 그럴 것입니다. ternary 경로를 업그레이드한다고 해서 그 경로가 업그레이드되는 것은 아닙니다. "Bonsai 2가 더 좋다"는 말을 읽고 휴대폰에 다시 다운로드하는 사람은 파일이 들어가지 않는다는 것을 알게 될 것입니다.
노트북이나 데스크톱을 사용 중이라면 계산은 정반대입니다. 9월 빌드가 품질 단위당 더 작고, 중요한 벤치마크에서 더 우수하며, 동일한 262K 컨텍스트를 갖추고 있는데 7월 ternary 빌드를 실행할 이유는 없습니다.
Speed, 세대 간 우열을 가리기가 정말 어려운
처리량은 이 비교에서, 솔직한 답은 공개된 수치가 깔끔한 순위를 뒷받침하지 않는다는 것이며, 보기 좋은 조합을 고르기보다 그렇게 말할 가치가 있는 부분이다.
2세대의 표준화된 측정값은 배치 크기 1, 비전 타워 제외 기준으로 PQ2_0 패킹에서 RTX 5090의 경우 디코드 142.5 tok/s, Apple M5 Max에서 46.8 tok/s, M5 Pro에서 27.7, M4 Pro에서 18.0입니다. 1세대는 자사의 삼진 빌드에 대해 RTX 5090에서 134 tok/s, M5 Max에서 58 tok/s를 제시했습니다. 5090 수치는 예상된 방향으로 소폭 움직입니다. M5 Max 수치는 반대 방향으로 움직입니다 — 58에서 46.8로 — 이는 두 달 만의 세대 진전이 보여야 할 모습이 아닙니다.
두 가지 주의점 때문에 이것은 하나의 발견으로 확정되지 않는다. 릴리스마다 측정 기준이 다르고, 더 새로운 모델에 대해 공개된 M5 Max 수치 중 최소 하나는 로테이션 최적화 이전 빌드에 기인한 것으로 여겨져 왔다. 하지만 이를 미해결 질문으로 짚어 둘 가치는 있다. 그것을 설명할 메커니즘이 릴리스 노트에 있기 때문이다. 회전된 기저는 배치 크기 1에서 모든 프로젝션의 임계 경로에 변환을 올려놓으며, Apple Silicon 디코드는 그 타격이 가장 큰 영역이다. 품질을 얻는 그 기법은 디코드 처리량을 희생할 수 있고, 통합 메모리 하드웨어에서 그 트레이드오프는 가장 첨예하다.
MLX 컨테이너는 Apple 사용자에게 또 다른 문제를 더한다. 이것은 아핀(affine) 2비트 형식으로, 블록이 128개 가중치마다 스케일과 바이어스를 모두 저장하지만, 삼진(ternary) 가중치는 스케일만 필요하므로 바이어스는 쓸모없는 부담이다 — 블록은 128개 가중치당 34바이트 대신 36바이트를 차지하고, 패킹된 비율은 가중치당 2.25비트가 되며 측정된 파일 크기는 8.005GiB이다. 이것은 같은 값을 담는 다른 컨테이너이며, 데모 환경이 기본적으로 내려받는 팩이다.
어느 세대든 실행하기
두 세대 모두 이 모델의 어떤 버전도 벗어나지 못한 하나의 운영상 제약을 공유합니다: 어느 쪽도 순정 llama.cpp에서는 실행되지 않습니다. 이 아키텍처용 삼진(ternary) 커널은 Prism ML 자체 포크에 존재하며, 순정 llama.cpp는 현재 패킹을 알 수 없는 것으로 거부합니다. 더 심각한 점은, 이전 삼진 형식을 아무 문제 없이 로드한 뒤 유창하지만 엉터리인 출력을 생성한다는 것입니다. 가중치가 전제하는 회전을 적용하지 않기 때문입니다. MLX 빌드는 Metal과 CPU 커널을 포함하지만 CUDA 경로는 없습니다. 어떤 세대를 선택하든, 런타임 문제에 대한 답은 Prism ML 자체 배포판이나 그 커널을 채택한 런타임에서 나오는 것이지, ggml 생태계 전반에서 나오는 것이 아닙니다.
이런 결정에서 OrcaRouter가 차지하는 자리는 한 단계 위입니다. 어느 Bonsai 세대도 여기에서 호스팅되지 않습니다 — 그것들은 사용자의 하드웨어에서 직접 실행하는 다운로드입니다. 라우팅 계층이 유용한 지점은 경계입니다: 로컬 모델이 답변해서는 안 되는 요청들 말입니다. 에스컬레이션 정책을 라우팅 구성에서 한 번 정의하십시오, 애플리케이션 코드가 아니라, 그러면 로컬로 서비스되는 티어가 긴 컨텍스트, 비전 중심 또는 그 밖의 범위 밖 요청을 실패시키는 대신 호스팅 모델로 올려보내고, 어떤 Bonsai 세대를 설치했든 폴백이 유지됩니다. 그러면 로컬 티어와 호스팅 티어 모두하나의 키 뒤에 자리하고, 다음 Bonsai 세대가 도착하고 티어 경계가 다시 움직일 때 정책은 한 곳에 있게 됩니다.
이걸 어떻게 해야 할까요?

• 노트북이나 데스크톱에서 7월 ternary 빌드를 실행하고 있다면 — Ternary Bonsai 2 27B로 옮기세요. 거의 동일한 풋프린트에서 더 나은 모델이며, 이 모델이 우세한 카테고리 점수는 바로 에이전트 작업과 지시 수행 작업에서 중요한 항목들입니다.
• 7월 1비트 빌드를 휴대폰에서 실행 중이라면 — 그대로 사용하세요. 후속 버전은 없으며, 5.93 GB 터너리 빌드는 3.9 GB짜리를 그대로 대체할 수 있는 대체품이 아닙니다.
• 이 패밀리를 처음 평가하는 경우라면 — 먼저 풋프린트를 결정하고, 그다음 세대를 결정하십시오. 필요한 변형이 어느 릴리스에서 구매해야 하는지를 결정하며, 그 순서는 이 업그레이드가 일반적으로 설명되는 방식과 반대입니다.
• 벤치마크를 기준으로 선택하고 있다면, 95%와 98.2%를 하나의 선 위에 있는 두 점이 아니라 서로 다른 두 측정값으로 취급하고, 9월 모델에 대한 독립적인 평가가 나올 때까지는 양쪽의 모든 수치를 벤더가 자체적으로 낸 것으로 취급하세요. 그 평가가 주목해야 할 대상입니다. 왜냐하면 그것이 두 세대를 공통 기준으로 비교할 수 있게 될 첫 번째 평가이기 때문입니다.
