
Bonsai vs Bonsai 27B: 하나의 패밀리 이름, 16배의 매개변수
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
이 패밀리를 이름만 보고 고르는 사람은 잘못된 모델을 사게 되는데, 그 이유는 "Bonsai"라는 맨이름 자체는 모델이 아니기 때문이다. 그것은 패밀리이며, 이번 주 기준으로 이 패밀리에는 스마트 안경 한 쌍에서 실행되는 20억 매개변수 비전-언어 모델과 휴대폰, 노트북 또는 데스크톱에서 실행되는 270억 매개변수 모델이 포함되어 있다. 첫 번째는 2026년 9월 23일에 발표된 1비트 Bonsai 2B 비전-언어 모델로, 1.7B 1비트 언어 모델에 0.3B 4비트 비전 인코더를 더한 것이며 1,024토큰 컨텍스트를 갖추고 Bonsai 1.7B를 기반으로 만들어졌다. 두 번째는 2026년 7월 14일에 Apache 2.0으로 공개된 Bonsai 27B로, Qwen3.6-27B를 기반으로 하며 262,000토큰 컨텍스트와 5.9GB 삼진 빌드 또는 3.9GB 이진 빌드 중 선택할 수 있다. 이 둘은 이름, 벤더, 압축 철학을 공유할 뿐 그 외에는 거의 아무것도 공유하지 않는다. 매개변수는 16배, 컨텍스트는 256배, 그리고 완전히 다른 두 장치다.
이 페이지는 그중 하나를 검색해 다른 하나에 도착한 사람을 위한 것입니다.
네이밍 문제, 쉽게 말하자면
PrismML의 모델 메뉴에는 현재 Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B 및 Bonsai Image가 나열되어 있습니다. 안경 발표는 Bonsai 1.7B 라인에 20억 매개변수 비전-언어 모델을 추가합니다. 따라서 "Bonsai"만으로는 최소 네 가지 매개변수 클래스와 두 세대 중 어느 것이든 의미할 수 있으며, 크기 접미사만이 이를 구분해 줍니다. 이는 명명 방식에 대한 비판이 아닙니다 — 그것은 모델 패밀리의 정상적인 형태입니다 — 하지만 패밀리 이름이 다운로드하는 대상에 대한 정보를 전혀 담고 있지 않다는 뜻입니다.
유용한 구분은 세대가 아니라 기기 등급입니다. 27B 계열의 모든 것은 언어 모델에 내줄 메모리가 4GB에서 8GB 사이에 있고, 그걸 기꺼이 쓰려 한다고 가정합니다. 1.7B 계열의 모든 것은 수백 메가바이트만 있고 그 이상은 없다고 가정합니다. 그 단 하나의 사실이 어떤 벤치마크보다도 먼저 이 제품군의 어느 절반이 당신에게 관련이 있는지를 결정합니다.
각각이 실제로 무엇인지
• 매개변수 — 안경 모델의 1.7B 1비트 LLM과 0.3B 4비트 비전 인코더 대 Bonsai 27B의 Qwen3.6-27B에서 파생된 27B급 모델.
• 컨텍스트 — 안경 모델에서는 1,024토큰인 반면, Bonsai 27B에서는 전체 262,000토큰 컨텍스트입니다.
• 언어 모델 가중치 — 1비트 1.7B의 경우 0.43GB인 반면, 삼진 Bonsai 27B는 5.9GB, 그 1비트 빌드는 3.9GB입니다.
• 표현 방식 — 둘 모두에서 FP16 그룹별 스케일링을 사용하는 이진 {−1, +1} 가중치이며, 이는 이 제품군이 기반으로 삼는 1비트 레시피입니다. Bonsai 27B는 추가로 가중치당 유효 1.71비트의 삼진 {−1, 0, +1} 빌드를 제공합니다.
• 타겟 실리콘 — Snapdragon AR1 Gen 1 안경 플랫폼의 Qualcomm Hexagon NPU, 1비트 커널 지원이 있는 QNN SDK를 통해 컴파일됨, Bonsai 27B를 위한 MLX를 통한 Apple silicon 및 CUDA를 통한 NVIDIA와 대비.
• 디코딩 처리량 — 안경 모델의 경우 4 GB AR1 Gen 1 테스트 플랫폼에서 초당 15.36토큰이며, 1비트 Bonsai 27B의 경우 iPhone 17 Pro에서 약 초당 11토큰, Apple M5 Max에서 87토큰, RTX 5090에서 163토큰과 대비됩니다.
그 수치들은 모두 공급업체가 제공한 것이고, 두 세트는 서로 다른 하드웨어에서 서로 다른 기준선을 기준으로 측정되었기 때문에, 이는 하나의 곡선 위의 두 점이 아니라 두 개의 제품을 설명합니다.

Bonsai 27B가 이기는 부분, 그리고 그 격차는 크다
컨텍스트는 가장 먼저 고려할 요소이며, 그 격차는 사소한 뉘앙스가 아닙니다. 262,000토큰 창은 코드베이스, 긴 문서, 녹취록, 또는 작동 중인 에이전트 세션을 넣고도 여유가 남습니다. 1,024토큰 창은 짧은 지시 하나와 이미지 하나를 담습니다. 워크로드에 한 페이지보다 긴 내용을 읽는 작업이 포함된다면, Bonsai 27B는 둘 중 유일하게 그 작업을 아예 해낼 수 있는 모델이며, 글래스 모델에 아무리 영리한 프롬프트를 사용해도 그 격차는 좁혀지지 않습니다. 한계는 가중치 크기가 아니라 키-값 상태를 위해 예약된 메모리이기 때문입니다.
성능은 두 번째입니다. Bonsai 27B의 삼진 빌드는 15개 벤치마크로 구성된 사고 모드 스위트 전반에서 전체 정밀도 기준선의 약 95%를 유지하는 것으로 보고되었고, 1비트 빌드는 약 90%를 유지하며, 비전과 도구 사용에서 손실이 가장 큽니다. 이는 벤더 자체 스위트에서 나온 벤더 수치이며, 유일하게 공개된 품질 관련 설명이 4비트 Qwen 3 1.7B와 비교해 "비교 가능한 벤치마크 결과"를 달성했다는 것뿐인 20억 매개변수 모델과는 여전히 차원이 다른 이야기입니다. 안경 모델은 자체 제작사에 의해서도 27B 모델과 비교되지 않습니다. 그 비교가 유용하지 않을 것이기 때문입니다.
세 번째는 생태계입니다. Bonsai 27B는 문서화된 런타임과 함께 GGUF, MLX, AWQ 패킹으로 제공되므로, 이미 보유한 하드웨어에서 실행할 수 있는 경로가 있습니다. 안경 모델은 Qualcomm NPU 툴체인 내부에 존재합니다.

2B가 이기는 지점, 그리고 그것이 바로 핵심이다
0.43GB 언어 모델은 5.9GB 모델이 갈 수 없는 곳에 들어가며, 안경 플랫폼도 그중 하나다. 그게 논거의 전부이고, 이는 스펙 대비가 들리게 하는 것보다 더 강력한 논거다. 왜냐하면 문제의 기기들에는 대안이 없기 때문이다. 4GB의 공유 플랫폼 메모리를 갖춘 안경은 어떤 빌드로도 Bonsai 27B를 호스팅할 수 없고, 휴대폰은 휴대폰의 존재 목적 대부분을 포기하지 않고서는 ternary 빌드를 호스팅할 수 없다.
덜 주목받는 두 번째 승리가 있습니다. 1비트 표현은 이 기기 등급에서 타협이 아니라, 이를 가능하게 하는 핵심 기법입니다. PrismML의 설명에 따르면 1비트 경로는 동일 모델을 4비트 정밀도로 사용할 때와 거의 맞먹는 지능을 제공하면서 메모리는 약 4분의 1만 쓰고 토큰은 두 배 이상의 속도로 생성합니다. 모든 밀리와트와 모든 메가바이트를 두고 경쟁해야 하는 상시 작동 기기에서는 그 절충이 곧 제품입니다.
그래서 두 모델은 경쟁하는 것이 아니다. 2B는 달리 실행할 곳이 없을 때 실행되는 것이고, 27B는 그럴 곳이 있을 때 실행되는 것이다.
티어 경계가 진짜 결정이다
이 둘 중 하나를 고르는 사람은 거의 없습니다. 현실적인 배포에는 두 가지가 모두 있습니다: 1,024 토큰 안에 들어오는 요청을 위해 기기에서 항상 켜져 있는 작은 모델과, 나머지 모든 것을 처리하기 위해 그 뒤에 있는 더 큰 무언가입니다. 그 형태를 받아들이고 나면, 엔지니어링 질문은 "어떤 Bonsai인가"가 아니라 "경계는 어디이며, 누가 그것을 집행하는가"가 됩니다.
애플리케이션 코드에서 강제하면, 그 줄은 온디바이스 모델이 컨텍스트 길이나 기능을 바꿀 때마다 다시 작성해야 하는 분기가 된다 — 지난 3개월의 증거로 볼 때 대략 매달 그렇다. 라우팅 정책으로 강제하면, 컨텍스트 예산과 요구되는 기능에 관한 하나의 규칙이 되고, 로컬 계층은 클라이언트 전반에 박힌 가정이 되는 대신 하나의 계층으로 남는다. 그것이 OrcaRouter가 작동하는 계층이다: 200개가 넘는 호스팅 모델 앞에 놓인 단일 엔드포인트, 페일오버와 구성으로 표현되는 에스컬레이션 정책. Bonsai는 여기서 라우팅되지 않는다 — 둘 다 자체 하드웨어에서 실행하는 다운로드이기 때문이다 — 따라서 솔직히 말하면 라우팅 계층은 로컬 계층 위의 계층을 담당하며, 1,024토큰 로컬 모델에서는 대부분의 트래픽이 바로 그 계층에 도달하게 된다.

하나를 꼭 골라야 한다면
• 안경, 웨어러블, 또는 항상 켜져 있는 모든 기기를 위한 제품을 만들고 있다면 — 1-bit Bonsai 2B 비전-언어 모델이 여기서 유일한 선택지이며, 1,024토큰 컨텍스트는 거스르기보다 그것을 중심으로 설계해야 하는 설계 제약입니다.
• 당신은 휴대폰을 겨냥해 개발하고 있습니다 — 3.9GB의 1-bit Bonsai 27B는 이 계열에서 iPhone급 메모리 예산에 들어가는 가장 큰 모델이며, 안경 모델은 근처에도 못 가는 262K 컨텍스트를 제공합니다.
• 노트북이나 데스크톱을 대상으로 빌드하고 있다면 — ternary Bonsai 27B 빌드는 제품군에서 품질 지향적인 선택이며, 1-bit 빌드는 역량보다 속도를 얻는 선택입니다.
• 당신은 하이브리드를 만들고 있습니다 — 에스컬레이션 규칙을 먼저 정하고, 모델은 그다음에 정하세요. 모델은 교체할 수 있지만, 경계는 일단 클라이언트에 들어가면 교체할 수 없습니다.
주목할 만한 점은 안경 출시를 가능하게 만든 NPU 경로가 위쪽으로 확장되는지 여부다. 모바일 가속기에서 1비트 커널이 일반화된다면, 1.7B 라인은 더 커지고 휴대폰에서 27B 모델을 쓸 수 있다는 명분은 더 강해진다. 그전까지 이 제품군의 두 절반은 기기 등급에 따라 깔끔하게 분리되어 있어, 공유된 이름이 시사하는 것보다 선택이 더 쉽다.
