Wygenerowana karta tytułowa z napisem „Bonsai vs Ternary Bonsai 2 27B”, z podtytułem „Dwa niskobitowe zakłady, dwie różne miary”, nad trzema kartami o treści „Wagi: 0,43 GB vs 5,93 GB”, „Deklaracja jakości: porównawcza vs 98,2% retencji” i „Krzem: Hexagon NPU vs Apple silicon i CUDA”, ze stopką o treści „Wszystkie dane dotyczące jakości podane przez dostawcę i niepowtórzone”. Logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

Bonsai kontra Ternary Bonsai 2 27B: dwa niskobitowe zakłady, dwie różne miary

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw model wizyjno-językowy 1-bit Bonsai 2B obok Ternary Bonsai 2 27B, a oczywiste porównanie — 2 miliardy parametrów wobec 27 miliardów, 0,43 GB wag językowych wobec 5,93 GB — jest najmniej interesującą rzeczą w tej parze. Interesujące jest to, że dwa modele od tego samego dostawcy i z tego samego programu kompresji nie raportują swojej jakości w ten sam sposób. Ternary Bonsai 2 27B podaje wskaźnik retencji: zachowuje ponad 98% zagregowanej wydajności benchmarkowej swojego odpowiednika w pełnej precyzji, mierzonej względem samego siebie. 1-bit Bonsai 2B podaje porównanie: osiągnął „porównywalne wyniki benchmarków” względem modelu Qwen 3 1.7B w kwantyzacji 4-bitowej, mierzone względem modelu kogoś innego o innej precyzji. Jedno to stwierdzenie o tym, ile zostało utracone. Drugie to stwierdzenie o tym, jak wypada na tle innych. Żadne z nich nie jest stwierdzeniem o tym, jak dobry jest którykolwiek z modeli w kategoriach absolutnych, i tych dwóch nie można odczytywać w tej samej skali.

To rozróżnienie ma większe znaczenie niż liczba parametrów, ponieważ decyduje o tym, co faktycznie można wywnioskować z liczb podanych przez dostawcę — a na podstawie dotychczas opublikowanych dowodów uczciwa odpowiedź jest mniejsza, niż sugerują liczby z nagłówków.

Dwie deklaracje jakości, dwie różne miary

Ternary Bonsai 2 27B, wydany 17 września 2026 r., to trójwartościowa rekonstrukcja {−1, 0, +1} modelu Qwen3.8-27B przy 1,76 efektywnego bita na wagę, a liczbą, którą PrismML wysuwa na czoło, jest to, że zachowuje ponad 98% zagregowanej wydajności benchmarkowej modelu pełnej precyzji. To twierdzenie o zachowaniu, a twierdzenia o zachowaniu są z natury autoreferencyjne: mówią, ile z oryginału przetrwało kompresję, a nie jak wypadał oryginał. Model, który zachowuje 98% przeciętnego punktu odniesienia, wciąż jest przeciętnym modelem, a Qwen3.8-27B nie jest przeciętny — ale sama liczba tego nie mówi i nie można jej porównywać między modelami bazowymi.

1-bitowy model językowo-wizyjny Bonsai 2B, ogłoszony 23 września 2026 r. dla platformy okularów Snapdragon AR1 Gen 1, to 1,7B 1-bitowy model językowy oraz 0,3B 4-bitowy enkoder wizyjny. Jego opublikowana deklaracja jakości jest innego rodzaju: PrismML ocenił go w porównaniu z modelem Qwen 3 1.7B w kwantyzacji 4-bitowej w testach BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K i GPQA Diamond i poinformował, że obie konfiguracje osiągnęły porównywalne wyniki. To twierdzenie o parytecie względem zewnętrznego punktu odniesienia. Mówi ono, że kompresja nie przyniosła ci oczywistych strat względem 4-bitowej ścieżki, której w przeciwnym razie byś użył — co jest dokładnie właściwym pytaniem w przypadku wydania klasy urządzeniowej i znacznie słabszym twierdzeniem niż „ten model jest dobry”.

Nie ma więc interpretacji, w której 98,2% wygrywa z „comparative” albo odwrotnie. To odpowiedzi na dwa różne pytania, zadane względem dwóch różnych punktów odniesienia, na dwóch różnych zestawach testów, przez tego samego dostawcę. Kto na podstawie tych dwóch zdań ustala ranking tych dwóch modeli, ten ustala ranking zdań.

Modele bazowe pochodzą z różnych miejsc.

Istnieje druga różnica strukturalna i to właśnie ona będzie miała znaczenie w ciągu najbliższego roku. Ternary Bonsai 2 27B to rekompresja zewnętrznego modelu — Qwen3.8-27B firmy Alibaba. Jego pułap jakości jest wyznaczany przez harmonogram wydań kogoś innego, a jego kadencja generacyjna podąża za Qwen, a nie za PrismML. Gdy Qwen wypuszcza nowy model 27B, linia Bonsai 27B otrzymuje nowe dane wejściowe, a wskaźnik retencji jest przeliczany względem nowej wartości bazowej.

1-bitowy Bonsai 2B bazuje na własnym modelu Bonsai 1.7B firmy PrismML. Jego pułap jest ustalany wewnętrznie, tempo aktualizacji wybiera PrismML, a jego ulepszenia wynikają z receptury kompresji i ścieżki jąder, a nie z wymiany modelu upstream. To zupełnie inny rodzaj zasobu: wolniej poprawia się pod względem surowych możliwości, jest w pełni pod kontrolą dostawcy i — jak pokazuje premiera okularów — można go dostroić do konkretnego akceleratora w sposób, w jaki ogólna rekompresja nie może.

Obie strategie są zasadne. Nie są wymienne, a to, którą wybierzesz, zależy od tego, czy Twoja roadmapa jest zakotwiczona w Qwen, czy w urządzeniu.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder running on the Snapdragon AR1 Gen 1 Platform.

Kontrast specyfikacji, linia po linii

• Parametry — 1,7B 1-bitowy LLM oraz 0,3B 4-bitowy enkoder wizyjny w modelu okularów, w porównaniu z modelem klasy 27B opartym na Qwen3.8-27B w Ternary Bonsai 2 27B.

• Reprezentacja — binarna {−1, +1} z grupowym skalowaniem FP16 w modelu okularów, w porównaniu z ternarną {−1, 0, +1} z tym samym skalowaniem przy 1,76 efektywnego bitu na wagę w modelu 27B.

• Wagi modelu językowego — 0,43 GB dla 1-bitowego modelu 1,7B, w porównaniu z 5,93 GB dla upakowania PTQ1_0 modelu Ternary Bonsai 2 27B, przy czym dostępne jest również upakowanie PQ2_0 o rozmiarze 7,25 GB.

• Kontekst — 1 024 tokeny w modelu okularów, w porównaniu z pełnym kontekstem 262 000 tokenów w Ternary Bonsai 2 27B.

• Akcelerator — Qualcomm Hexagon NPU poprzez QNN SDK ze wsparciem dla jąder 1-bitowych, w zestawieniu z Apple silicon przez MLX i NVIDIA przez CUDA.

• Twierdzenie o jakości — „porównawcze wyniki benchmarku” względem 4-bitowego Qwen 3 1.7B, wobec „ponad 98%” utrzymania baseline’u Qwen3.8-27B w pełnej precyzji. Oba zgłoszone przez producenta, żadnego nie odtworzono niezależnie, mierzone na różnych zestawach testowych.

• Środowisko uruchomieniowe — łańcuch narzędzi Qualcomm NPU dla modelu okularów, w porównaniu z własnym forkiem llama.cpp firmy PrismML oraz kontenerem MLX dla modelu 27B, z których żadnego standardowy llama.cpp nie obsługuje.

A screenshot of PrismML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces the memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

Co daje zakład na niską liczbę bitów w każdym przypadku

Filozofia kompresji jest taka sama w obu modelach i warto ją nazwać, ponieważ jest to właściwie teza tej rodziny: reprezentacja niskobitowa działa od początku do końca — embeddingi, attention, MLP-y i głowica LM — z grupowym skalowaniem FP16 i bez furtek do wyższej precyzji. Żaden z modeli nie utrzymuje zmiennoprzecinkowej siatki bezpieczeństwa dla części, które trudno skwantyzować. To bardziej agresywne stanowisko niż w większości prac nad kwantyzacją i właśnie ono w ogóle umożliwia 1,76 bita na wagę oraz 0,43 GB wag.

To, gdzie zakład się opłaca, różni się. W Ternary Bonsai 2 27B korzyścią są możliwości na bajt na sprzęcie, który już posiadasz: model klasy 27B w 5,93 GB, działający na laptopie lub telefonie, przy 98% swojego poziomu bazowego. W 1-bitowym Bonsai 2B korzyścią jest istnienie na klasie urządzeń, która nie miała opcji: model multimodalny w 0,43 GB wag językowych, na NPU, przy 15,36 tokenów na sekundę. Ten pierwszy to lepsza wersja czegoś, co już działało. Ten drugi to coś, co wcześniej nie działało.

Gdzie znajduje się granica poziomu

Te dwa nie są alternatywami, a traktowanie ich jako bezpośredniego starcia pomija kształt wdrożenia, na który wskazują oba wydania. Produkt na okulary lub do noszenia uruchamia 2B lokalnie, bo nic innego się nie mieści. Produkt na laptopa lub telefon uruchamia 27B, bo może. W momencie, gdy produkt obejmuje oba — aplikacja na telefon sparowana z okularami, aplikacja na laptopa z asystentem działającym na urządzeniu — pytanie przestaje dotyczyć tego, który model, a zaczyna dotyczyć tego, które żądania każda warstwa może obsłużyć.

Tę granicę warto umieścić w konfiguracji, a nie w kodzie aplikacji, ponieważ obie warstwy będą się zmieniać. Granica 27B przesuwa się, gdy Qwen wypuszcza nową wersję, granica 2B przesuwa się, gdy PrismML zmienia recepturę, a reguła zakodowana na sztywno dotycząca długości kontekstu lub możliwości przestaje działać przy obu tych zdarzeniach. Polityka routingu, która eskaluje żądania przekraczające budżet warstwy lokalnej do modelu hostowanego, przetrwa obie zmiany; warstwa lokalna pozostaje jedną z kilku warstw, a nie założeniem przewijającym się przez klienta. OrcaRouter to warstwa, która wykonuje tę eskalację — jeden punkt końcowy dla ponad 200 hostowanych modeli, z uwzględnieniem failover, z polityką wyrażoną jako konfiguracja. Żaden z modeli Bonsai nie jest tu routowany; oba są lokalnymi pobraniami. To, co tu się znajduje, to warstwa ponad nimi, a przy lokalnym modelu o 1024 tokenach ta warstwa wykonuje większość pracy.

A generated scoreboard titled 'Bonsai vs Ternary Bonsai 2 27B — the scoreboard'. The Bonsai column reads: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; weights 0.43 GB; context 1,024 tokens; representation binary; quality claim comparative against 4-bit Qwen 3 1.7B; accelerator Qualcomm Hexagon NPU. The Ternary Bonsai 2 27B column reads: parameters 27B on Qwen3.8-27B; weights 5.93 GB PTQ1_0; context 262K tokens; representation ternary at 1.76 bits per weight; quality claim over 98% retention of full precision; accelerator Apple MLX and NVIDIA CUDA. Footer reads 'All quality figures vendor-reported; the two claims use different baselines and suites.' The OrcaRouter logo sits in the bottom-right.

Co by to rozstrzygnęło

Trzy pomiary zmieniłyby tę parę z dwóch twierdzeń marketingowych w porównanie. Rozbicie na poszczególne benchmarki stojące za wierszem „comparative results”, dzięki któremu kompromis względem 4-bit byłby widoczny, a nie tylko podsumowany. Wartość retencji dla 1-bitowego Bonsai 2B względem jego własnej pełnoprecyzyjnej linii bazowej — pomiar, który PrismML stosuje dla linii 27B, a którego tutaj nie opublikował. Oraz niezależna ewaluacja któregokolwiek z modeli, ponieważ każda liczba w obu wydaniach pochodzi obecnie od dostawcy.

Dopóki jedno z nich nie istnieje, stanowiskiem, którego można bronić, jest to, które faktycznie wspierają liczby: Ternary Bonsai 2 27B jest lepszym modelem z dużą przewagą, a 1-bit Bonsai 2B jest jedynym z tych dwóch, który działa na urządzeniu, dla którego został zbudowany. Te dwa stwierdzenia nie są ze sobą sprzeczne, a fakt, że ten sam dostawca zmierzył je różnymi miarami, jest tym, o czym warto pamiętać następnym razem, gdy jedna z tych liczb zostanie przytoczona bez swojego punktu odniesienia.