생성된 타이틀 카드에는 'Ternary Bonsai 2 27B vs Qwen3.8-27B'가 적혀 있고, 부제는 '동일한 네트워크, 두 가지 정밀도'이며, 그 아래에는 '파일 크기: 5.93 GB vs 53.81 GB', '감소: 9.05x', '컨텍스트: 262K 토큰, 둘 모두'라고 적힌 세 개의 카드가 있고, 하단에는 '98.2%의 유지율은 벤더가 보고한 수치이며 재현되지 않았습니다.'라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래에 있습니다.
Guides & Insights

Ternary Bonsai 2 27B vs Qwen3.8-27B: 47.9기가바이트의 정밀도가 실제로 무엇을 가져다주는가

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Ternary Bonsai 2 27B와 Qwen3.8-27B는 두 개의 수치 세계에 존재하는 동일한 모델이다. 이들은 아키텍처, 토크나이저, 학습 계보, 그리고 262,144토큰 컨텍스트 윈도우를 공유한다. 이들을 구분하는 것은 가중치가 기록되는 방식이다: Qwen3.8-27B는 각 가중치를 16비트 부동소수점으로 저장하며 FP16 참조 형식에서 53.81GB를 차지하는 반면, Ternary Bonsai 2 27B는 각 가중치를 세 개의 기호 중 하나로 저장하며 5.93GB를 차지한다. Prism ML은 2026년 9월 17일 압축 빌드를 발표하고 Apache 2.0 라이선스로 Hugging Face에 공개했으며, 원본 Qwen3.8-27B 가중치도 2026년 8월 13일에 Apache 2.0 라이선스로 공개되었다.

중요한 비교는 어느 쪽이 더 나은지가 아니다. 그것은 사라진 47.9 GB가 당신에게 치르게 하는 비용이며, 솔직한 답은 어느 진영이든 말해 주는 것보다 더 좁고 더 구체적이다. Prism ML은 자사 빌드가 98.2%를 20개 벤치마크 제품군 전반에 걸친 전체 정밀도 모델 평균에서 유지한다고 보고한다 — 85.4 대비 83.9. 그 수치는 벤더 자체의 것이며, 벤더 자체의 하네스에서 측정된 것이고, 출시 하루 뒤에도 Prism ML 외부에서는 아무도 그것을 재현하지 못했다. 집계는 또한 당신이 실제로 신경 써야 할 부분을 숨긴다. 왜냐하면 1.8점은 고르게 분포되어 있지 않기 때문이다. 지속적인 소프트웨어 엔지니어링을 압박하는 두 벤치마크에서 격차는 1.8%가 아니라 25%에 더 가깝다.

같은 네트워크, 다르게 기록한 것

압축이 건드리지 않는 것부터 시작하자. 그것이야말로 이 비교가 흥미로운 이유이기 때문이다. 레이어 수, 히든 크기, 어휘, 어텐션 패턴, 비전 타워는 베이스 모델의 것이다. Qwen3.8-27B는 하이브리드 어텐션 설계로, 48개의 Gated DeltaNet 선형 어텐션 레이어가 16개의 전체 어텐션 레이어와 교차 배치되어 대략 3:1 비율을 이루며, 64개 레이어에 걸쳐 히든 크기 5,120과 248,320개 토큰 어휘를 갖는다. 그 대부분 선형인 백본이 애초에 262K 컨텍스트를 감당 가능하게 만드는 요소이며, Bonsai가 변경 없이 물려받는 속성이 바로 그것이다.

Prism ML이 바꾼 것은 언어 모델 행렬의 표현 방식과, 이를 연산하는 데 필요한 커널입니다. 이 백서는 27.36B 파라미터를 64개 블록에 걸친 언어 백본의 24.35B, 임베딩 및 LM 헤드의 2.54B, 27개 블록 비전 타워의 0.47B로 나눕니다. 비전 타워는 약 0.63GB의 별도 4비트 mmproj 파일로 제공되며 실제로 이미지가 들어올 때만 로드되므로, 텍스트 전용 배포에서는 이에 대한 비용을 전혀 부담하지 않습니다.

그 대부분 선형적인 설계의 실질적인 결과는 어떤 벤치마크 논의보다 앞서 짚어둘 가치가 있습니다. 이 아키텍처는 전통적인 트랜스포머가 아니기 때문에, 저비트 커널은 이를 위해 특별히 작성되어야 했습니다. 기본 llama.cpp는 Prism ML의 두 패킹을 모두 알 수 없는 유형으로 거부하며 — 더 위험하게도 — 이전 3진 형식을 아무 문제 없이 로드하고 유창한 헛소리를 만들어냅니다. 활성화에 적용되는 일치하는 회전이 없기 때문입니다. 이 모델을 그것에 대해 모르는 바이너리에서 실행하면 오류가 나지 않습니다. 자신감 있게 틀린 출력이 나옵니다.

비교, 카테고리별로

다음은 전체 정밀도 베이스를 기준으로 삼은 공급업체의 20개 벤치마크 분석입니다. 이 목록의 모든 수치는 Prism ML의 것이며, 그중 어느 것도 독립적으로 검증되지 않았습니다.

• 수학 — Ternary Bonsai 2 27B는 96.57, Qwen3.8-27B는 97.06. 사실상 같은 수준.

• 코딩 — 81.58 대 82.17. 이 또한 근소한 차이이며, 이 기법 전체가 논쟁의 근거로 삼고 있는 범주이기도 하다.

• 지시 따르기 — 82.66 vs 81.25. 여기서는 압축된 모델이 앞서는데, 이것이 표에서 정말로 놀라운 유일한 항목이다.

• 지식 및 추론 — 83.95 대 86.66. 2.7점 하락이며, 부족한 1.8점에 대한 단일 최대 기여 요인입니다.

• 에이전트 및 도구 호출 — 77.57 대 79.74, τ2-Bench 80.22 및 BFCL v3 74.92 기록.

• 비전 — 78.59 대 81.64, 가장 큰 카테고리 손실. 참고로 비전 타워 자체는 압축되는 부분이 아닙니다; 그 출력을 읽는 언어 모델이 압축되는 부분입니다.

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Qwen3.8-27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: bits per weight 1.76 packed, file size 5.93 GB, 20-benchmark average 83.9, math 96.57, instruction following 82.66, Terminal-Bench 2.1 52.8. The Qwen3.8-27B FP16 column reads: bits per weight 16.0, file size 53.81 GB, 20-benchmark average 85.4, math 97.06, instruction following 81.25, Terminal-Bench 2.1 69.7. Footer reads 'Both columns are one vendor suite; the compressed figures are unaudited.' The OrcaRouter logo sits in the bottom-right.

평균이 아니라 분포의 형태를 읽으면 더 명확한 이야기가 드러난다. 압축은 수학, 코딩, 지시 따르기에서는 거의 공짜에 가깝고, 지식과 시각에서는 비용이 많이 든다. 이는 표면적 지식은 살아남고 추론은 무너진다는, 저비트 모델에 관한 통념과 정반대다. 여기서는 지식이 침식되고 추론이 버틴다.

1.8 포인트가 실제로 존재하는 곳

집계는 스무 개 벤치마크에 대한 평균이고, 평균은 격차가 숨기 좋은 곳이다. 개별 결과를 꺼내 보면 그중 두 개는 평균이 시사하는 것보다 훨씬 더 나쁘다.

• Terminal-Bench 2.1 — 삼진 빌드는 52.8, 전체 정밀도는 69.7

• SWE-bench Verified — 80.6 대비 60.8

둘 다 전체 정밀도 점수의 약 4분의 3에 근접한다. 그와 대조적으로 AIME26은 95.83, LiveCodeBench는 90.07, AA-LCR은 77.0을 기록해 비압축 모델과 1점 이내 차이를 보인다. Bonsai 패밀리가 Terminal-Bench에서 평가된 것은 이번이 처음이며, Prism ML은 자사 자료에서 1세대에서 약속했던 장기 지평 소프트웨어 엔지니어링 역량이 완전히가 아니라 부분적으로만 제공되었다고 분명히 밝힌다.

그러므로 실질적인 질문은 "98.2%를 유지하는가"가 아니라 "내 워크로드는 무엇인가"입니다. 수십 번의 도구 호출에 걸쳐 계획을 유지하고 몇 분 동안 파일을 편집하는 코딩 에이전트를 실행하고 있다면, 당신은 25% 격차가 있는 범주에 속하며, 집계 수치는 오히려 적극적으로 오해를 불러일으킵니다. 수학, 단일 턴 코드 생성, 추출, 분류 또는 채팅을 하고 있다면, 격차가 반올림되어 사라지는 범주에 속합니다. 벤더 자체 표에서 가장 유용한 점은 추측하는 대신 그런 구분을 할 수 있게 해준다는 것입니다.

각각 실제로 실행되려면 무엇이 필요한지

하드웨어 이야기는 크기 비율이 시사하는 것보다 덜 대칭적이다. 53.81GB FP16 모델은 16GB 노트북에는 전혀 들어가지 않으므로, 이 비교는 "더 빠름 대 더 느림"이라기보다 "가능 대 불가능"에 가깝다. 배치 크기 1, 비전 타워 제외 조건에서 Prism ML의 표준화된 측정값:

• NVIDIA RTX 5090 — PQ2_0 패킹에서 142.5 tok/s 디코딩, 토큰당 0.582 mWh

• Apple M5 Max — 46.8 tok/s 디코딩, 프롬프트 처리 약 765 tok/s

• Apple M5 Pro — 초당 27.7토큰 디코딩

• Apple M4 Pro — 18.0 tok/s 디코드, 프롬프트 처리는 약 125 tok/s로 매우 긴 컨텍스트에서 병목 제약이 됨

중요한 단서는 이 중 어느 것도 단일 바이너리가 아니라는 점이다. PTQ1_0 패킹은 가중치당 1.76비트로 5.93GB를 확보해 준다. PQ2_0은 가중치당 2.16비트로 7.25GB를 차지하며, 메모리 대역폭이 아니라 명령어 처리량이 한계인 하드웨어에서 디코드 속도를 사준다. Apple Silicon용 MLX 빌드는 자체적인 계산법을 가진 세 번째 아티팩트다. 삼진 가중치에는 필요 없는 바이어스를 저장하는 아핀 2비트 컨테이너로, 가중치당 2.25비트와 디스크상 8.005GiB에 이르며, Metal 및 CPU 커널은 있지만 CUDA 경로는 없다. "5.9GB에서 실행된다"는 말은 그 파일들 중 정확히 하나가, 정확히 올바른 런타임에서일 때만 사실이다.

솔직하게 짚어본 비용 비교

Qwen3.8-27B의 비용을 지불하는 방법에는 두 가지가 있고, 압축된 형제 모델의 비용을 지불하는 방법은 단 한 가지뿐입니다. Ternary Bonsai 2 27B는 다운로드입니다: Apache 2.0, 여러분의 하드웨어, 사용량 측정 없음. Qwen3.8-27B는 다운로드이자 호스팅 서비스이며, 호스팅 방식을 택할 경우 관련 수치는 모델 페이지에 있는 값입니다 — 입력 토큰 100만 개당 $0.33, 출력 토큰 100만 개당 $2.40, OrcaRouter 자체 인프라에서 제공되며 다른 곳에서 재판매되는 것이 아닙니다.

바로 이 지점에서 OrcaRouter는 이 비교에서 각주가 아니라 한 자리를 차지합니다. Qwen3.8-27B의 라우팅된 빌드는 동일한 262K 컨텍스트를 갖추고 텍스트, 이미지, 동영상을 받아들이며, 모델이 기본 제공하는 추론 강도 제어 기능을 노출합니다. 그것은 200개가 넘는 다른 모델과 동일한 키 뒤에 있으며, 공급자 정가 위에 추가 마크업이 없습니다. 이는 들리는 것보다 더 중요합니다. 왜냐하면 정가가 재판매되지 않고 그대로 전달되기 때문에, 공급업체 가격 변경이 다음 계약 갱신 때가 아니라 같은 날 여기에 나타납니다. 로컬 Bonsai 위의 에스컬레이션 계층으로 전체 정밀도 베이스를 원하는 팀에게, 이는 두 개의 공급업체 관계가 아니라 하나의 엔드포인트와 하나의 키입니다.

A screenshot of Prism ML's launch post for Bonsai 2 27B, dated September 17 2026 and titled 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', showing the opening paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance the new model retains over 98%.

어느 것을 선택할까

그 결정은 대부분 작업이 어디에서 이루어지는지에 관한 것이지, 어느 모델이 더 나은지에 관한 것이 아닙니다. 대부분의 작업에서 두 모델은 같은 모델이기 때문입니다.

• 작업이 장기적이고 에이전트적일 때, 평가하거나 미세 조정할 때, 1M 토큰 YaRN 컨텍스트가 필요할 때, 또는 비전 정확도가 중요한 역할을 할 때 Qwen3.8-27B 풀 정밀도를 선택하세요. Terminal-Bench와 SWE-bench 수치가 그 이유입니다.

• 직접 보유한 하드웨어에서 작업을 처리해야 할 때, 27B 모델을 아예 실행하지 않는 것이 대안일 때, 또는 범주가 대등한 수학, 코딩, 추출, 도구 없는 추론 워크로드일 때는 Ternary Bonsai 2 27B를 선택하십시오.

• 총합만 보고 선택하지 마세요. 83.9와 85.4는 벤치마크 하나만 교체해도 순위가 뒤바뀔 수 있을 만큼 차이가 작으며, 두 수치 중 독립적으로 검증된 것은 하나뿐입니다.

여기서 진짜 새로운 점은 27B 모델이 6기가바이트에 들어간다는 게 아니다 — 첫 Bonsai 세대가 7월에 그걸 해냈다. 새로운 점은 지시 수행이 부모 모델을 앞섰고 수학과 코딩이 동등한 수준으로 나왔다는 것이며, 이는 "크기 대비 작다"와는 다른 주장이다. 여러분의 워크로드에서도 그것이 유지되는지는 하루된 모델이라는 사실이 알려줄 수 없는 바로 그 부분이며, 이 모델에 대한 첫 독립 평가가 기다릴 가치가 있는 결과다.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and the description that the model is self-hosted on OrcaRouter's own infrastructure.

벤치마크 스위트가 아니라 자신의 프롬프트에서 비교를 실행하고 싶다면, 가장 빠른 방법은 호스팅된 Qwen3.8-27B를 하나의 엔드포인트를 통해 호출하고 ternary 빌드를 로컬에서 실행한 다음, 실제로 가지고 있는 작업들에 대해 출력을 diff하는 것입니다. 그건 아침 한나절이면 되는 작업이며, 어떤 공개된 표보다도 그 1.8점에 대해 더 많은 것을 알려줄 것입니다.