
Bonsai kontra Ternary Bonsai 2 27B: dwa niskobitowe zakłady, dwie różne miary
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Postaw model wizyjno-językowy 1-bit Bonsai 2B obok Ternary Bonsai 2 27B, a oczywiste porównanie — 2 miliardy parametrów wobec 27 miliardów, 0,43 GB wag językowych wobec 5,93 GB — jest najmniej interesującą rzeczą w tej parze. Interesujące jest to, że dwa modele od tego samego dostawcy i z tego samego programu kompresji nie raportują swojej jakości w ten sam sposób. Ternary Bonsai 2 27B podaje wskaźnik retencji: zachowuje ponad 98% zagregowanej wydajności benchmarkowej swojego odpowiednika w pełnej precyzji, mierzonej względem samego siebie. 1-bit Bonsai 2B podaje porównanie: osiągnął „porównywalne wyniki benchmarków” względem modelu Qwen 3 1.7B w kwantyzacji 4-bitowej, mierzone względem modelu kogoś innego o innej precyzji. Jedno to stwierdzenie o tym, ile zostało utracone. Drugie to stwierdzenie o tym, jak wypada na tle innych. Żadne z nich nie jest stwierdzeniem o tym, jak dobry jest którykolwiek z modeli w kategoriach absolutnych, i tych dwóch nie można odczytywać w tej samej skali.
To rozróżnienie ma większe znaczenie niż liczba parametrów, ponieważ decyduje o tym, co faktycznie można wywnioskować z liczb podanych przez dostawcę — a na podstawie dotychczas opublikowanych dowodów uczciwa odpowiedź jest mniejsza, niż sugerują liczby z nagłówków.
Dwie deklaracje jakości, dwie różne miary
Ternary Bonsai 2 27B, wydany 17 września 2026 r., to trójwartościowa rekonstrukcja {−1, 0, +1} modelu Qwen3.8-27B przy 1,76 efektywnego bita na wagę, a liczbą, którą PrismML wysuwa na czoło, jest to, że zachowuje ponad 98% zagregowanej wydajności benchmarkowej modelu pełnej precyzji. To twierdzenie o zachowaniu, a twierdzenia o zachowaniu są z natury autoreferencyjne: mówią, ile z oryginału przetrwało kompresję, a nie jak wypadał oryginał. Model, który zachowuje 98% przeciętnego punktu odniesienia, wciąż jest przeciętnym modelem, a Qwen3.8-27B nie jest przeciętny — ale sama liczba tego nie mówi i nie można jej porównywać między modelami bazowymi.
1-bitowy model językowo-wizyjny Bonsai 2B, ogłoszony 23 września 2026 r. dla platformy okularów Snapdragon AR1 Gen 1, to 1,7B 1-bitowy model językowy oraz 0,3B 4-bitowy enkoder wizyjny. Jego opublikowana deklaracja jakości jest innego rodzaju: PrismML ocenił go w porównaniu z modelem Qwen 3 1.7B w kwantyzacji 4-bitowej w testach BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K i GPQA Diamond i poinformował, że obie konfiguracje osiągnęły porównywalne wyniki. To twierdzenie o parytecie względem zewnętrznego punktu odniesienia. Mówi ono, że kompresja nie przyniosła ci oczywistych strat względem 4-bitowej ścieżki, której w przeciwnym razie byś użył — co jest dokładnie właściwym pytaniem w przypadku wydania klasy urządzeniowej i znacznie słabszym twierdzeniem niż „ten model jest dobry”.
Nie ma więc interpretacji, w której 98,2% wygrywa z „comparative” albo odwrotnie. To odpowiedzi na dwa różne pytania, zadane względem dwóch różnych punktów odniesienia, na dwóch różnych zestawach testów, przez tego samego dostawcę. Kto na podstawie tych dwóch zdań ustala ranking tych dwóch modeli, ten ustala ranking zdań.
Modele bazowe pochodzą z różnych miejsc.
Istnieje druga różnica strukturalna i to właśnie ona będzie miała znaczenie w ciągu najbliższego roku. Ternary Bonsai 2 27B to rekompresja zewnętrznego modelu — Qwen3.8-27B firmy Alibaba. Jego pułap jakości jest wyznaczany przez harmonogram wydań kogoś innego, a jego kadencja generacyjna podąża za Qwen, a nie za PrismML. Gdy Qwen wypuszcza nowy model 27B, linia Bonsai 27B otrzymuje nowe dane wejściowe, a wskaźnik retencji jest przeliczany względem nowej wartości bazowej.
1-bitowy Bonsai 2B bazuje na własnym modelu Bonsai 1.7B firmy PrismML. Jego pułap jest ustalany wewnętrznie, tempo aktualizacji wybiera PrismML, a jego ulepszenia wynikają z receptury kompresji i ścieżki jąder, a nie z wymiany modelu upstream. To zupełnie inny rodzaj zasobu: wolniej poprawia się pod względem surowych możliwości, jest w pełni pod kontrolą dostawcy i — jak pokazuje premiera okularów — można go dostroić do konkretnego akceleratora w sposób, w jaki ogólna rekompresja nie może.
Obie strategie są zasadne. Nie są wymienne, a to, którą wybierzesz, zależy od tego, czy Twoja roadmapa jest zakotwiczona w Qwen, czy w urządzeniu.

Kontrast specyfikacji, linia po linii
• Parametry — 1,7B 1-bitowy LLM oraz 0,3B 4-bitowy enkoder wizyjny w modelu okularów, w porównaniu z modelem klasy 27B opartym na Qwen3.8-27B w Ternary Bonsai 2 27B.
• Reprezentacja — binarna {−1, +1} z grupowym skalowaniem FP16 w modelu okularów, w porównaniu z ternarną {−1, 0, +1} z tym samym skalowaniem przy 1,76 efektywnego bitu na wagę w modelu 27B.
• Wagi modelu językowego — 0,43 GB dla 1-bitowego modelu 1,7B, w porównaniu z 5,93 GB dla upakowania PTQ1_0 modelu Ternary Bonsai 2 27B, przy czym dostępne jest również upakowanie PQ2_0 o rozmiarze 7,25 GB.
• Kontekst — 1 024 tokeny w modelu okularów, w porównaniu z pełnym kontekstem 262 000 tokenów w Ternary Bonsai 2 27B.
• Akcelerator — Qualcomm Hexagon NPU poprzez QNN SDK ze wsparciem dla jąder 1-bitowych, w zestawieniu z Apple silicon przez MLX i NVIDIA przez CUDA.
• Twierdzenie o jakości — „porównawcze wyniki benchmarku” względem 4-bitowego Qwen 3 1.7B, wobec „ponad 98%” utrzymania baseline’u Qwen3.8-27B w pełnej precyzji. Oba zgłoszone przez producenta, żadnego nie odtworzono niezależnie, mierzone na różnych zestawach testowych.
• Środowisko uruchomieniowe — łańcuch narzędzi Qualcomm NPU dla modelu okularów, w porównaniu z własnym forkiem llama.cpp firmy PrismML oraz kontenerem MLX dla modelu 27B, z których żadnego standardowy llama.cpp nie obsługuje.

Co daje zakład na niską liczbę bitów w każdym przypadku
Filozofia kompresji jest taka sama w obu modelach i warto ją nazwać, ponieważ jest to właściwie teza tej rodziny: reprezentacja niskobitowa działa od początku do końca — embeddingi, attention, MLP-y i głowica LM — z grupowym skalowaniem FP16 i bez furtek do wyższej precyzji. Żaden z modeli nie utrzymuje zmiennoprzecinkowej siatki bezpieczeństwa dla części, które trudno skwantyzować. To bardziej agresywne stanowisko niż w większości prac nad kwantyzacją i właśnie ono w ogóle umożliwia 1,76 bita na wagę oraz 0,43 GB wag.
To, gdzie zakład się opłaca, różni się. W Ternary Bonsai 2 27B korzyścią są możliwości na bajt na sprzęcie, który już posiadasz: model klasy 27B w 5,93 GB, działający na laptopie lub telefonie, przy 98% swojego poziomu bazowego. W 1-bitowym Bonsai 2B korzyścią jest istnienie na klasie urządzeń, która nie miała opcji: model multimodalny w 0,43 GB wag językowych, na NPU, przy 15,36 tokenów na sekundę. Ten pierwszy to lepsza wersja czegoś, co już działało. Ten drugi to coś, co wcześniej nie działało.
Gdzie znajduje się granica poziomu
Te dwa nie są alternatywami, a traktowanie ich jako bezpośredniego starcia pomija kształt wdrożenia, na który wskazują oba wydania. Produkt na okulary lub do noszenia uruchamia 2B lokalnie, bo nic innego się nie mieści. Produkt na laptopa lub telefon uruchamia 27B, bo może. W momencie, gdy produkt obejmuje oba — aplikacja na telefon sparowana z okularami, aplikacja na laptopa z asystentem działającym na urządzeniu — pytanie przestaje dotyczyć tego, który model, a zaczyna dotyczyć tego, które żądania każda warstwa może obsłużyć.
Tę granicę warto umieścić w konfiguracji, a nie w kodzie aplikacji, ponieważ obie warstwy będą się zmieniać. Granica 27B przesuwa się, gdy Qwen wypuszcza nową wersję, granica 2B przesuwa się, gdy PrismML zmienia recepturę, a reguła zakodowana na sztywno dotycząca długości kontekstu lub możliwości przestaje działać przy obu tych zdarzeniach. Polityka routingu, która eskaluje żądania przekraczające budżet warstwy lokalnej do modelu hostowanego, przetrwa obie zmiany; warstwa lokalna pozostaje jedną z kilku warstw, a nie założeniem przewijającym się przez klienta. OrcaRouter to warstwa, która wykonuje tę eskalację — jeden punkt końcowy dla ponad 200 hostowanych modeli, z uwzględnieniem failover, z polityką wyrażoną jako konfiguracja. Żaden z modeli Bonsai nie jest tu routowany; oba są lokalnymi pobraniami. To, co tu się znajduje, to warstwa ponad nimi, a przy lokalnym modelu o 1024 tokenach ta warstwa wykonuje większość pracy.

Co by to rozstrzygnęło
Trzy pomiary zmieniłyby tę parę z dwóch twierdzeń marketingowych w porównanie. Rozbicie na poszczególne benchmarki stojące za wierszem „comparative results”, dzięki któremu kompromis względem 4-bit byłby widoczny, a nie tylko podsumowany. Wartość retencji dla 1-bitowego Bonsai 2B względem jego własnej pełnoprecyzyjnej linii bazowej — pomiar, który PrismML stosuje dla linii 27B, a którego tutaj nie opublikował. Oraz niezależna ewaluacja któregokolwiek z modeli, ponieważ każda liczba w obu wydaniach pochodzi obecnie od dostawcy.
Dopóki jedno z nich nie istnieje, stanowiskiem, którego można bronić, jest to, które faktycznie wspierają liczby: Ternary Bonsai 2 27B jest lepszym modelem z dużą przewagą, a 1-bit Bonsai 2B jest jedynym z tych dwóch, który działa na urządzeniu, dla którego został zbudowany. Te dwa stwierdzenia nie są ze sobą sprzeczne, a fakt, że ten sam dostawca zmierzył je różnymi miarami, jest tym, o czym warto pamiętać następnym razem, gdy jedna z tych liczb zostanie przytoczona bez swojego punktu odniesienia.
