Wygenerowana karta tytułowa z napisem „Bonsai vs Bonsai 27B”, z podtytułem „Jedna nazwa rodziny, szesnaście razy więcej parametrów”, nad trzema kartami z napisami „Kontekst: 1 024 tokeny vs 262 tys.”, „Wagi LLM: 0,43 GB vs 5,9 GB” i „Urządzenie docelowe: okulary inteligentne vs telefon, laptop, komputer stacjonarny”, ze stopką „Dane podane przez producenta; oba modele nie są testowane na wspólnym zestawie testów”. Logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

Bonsai vs Bonsai 27B: Jedna nazwa rodziny, szesnaście razy więcej parametrów

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Każdy, kto kupuje tę rodzinę po nazwie, wybierze niewłaściwy model, a powód jest taki, że sama nazwa „Bonsai” nie jest modelem. To rodzina, a od tego tygodnia rodzina obejmuje model wizyjno-językowy o 2 miliardach parametrów, który działa na parze inteligentnych okularów, oraz model o 27 miliardach parametrów, który działa na telefonie, laptopie lub komputerze stacjonarnym. Pierwszy to 1-bitowy model wizyjno-językowy Bonsai 2B ogłoszony 23 września 2026 r. — model językowy 1,7B 1-bitowy oraz 4-bitowy enkoder wizyjny 0,3B, kontekst 1024 tokenów, zbudowany na Bonsai 1.7B. Drugi to Bonsai 27B, wydany 14 lipca 2026 r. na licencji Apache 2.0, zbudowany na Qwen3.6-27B z kontekstem 262 000 tokenów i wyborem między wersją ternarną o rozmiarze 5,9 GB a wersją binarną o rozmiarze 3,9 GB. Dzielą nazwę, dostawcę, filozofię kompresji i prawie nic więcej. Szesnaście razy więcej parametrów, dwieście pięćdziesiąt sześć razy większy kontekst i dwa całkowicie różne urządzenia.

Ta strona jest dla osoby, która szukała jednego z nich, a trafiła na drugie.

Problem nazewnictwa, wyrażony wprost

Menu modeli PrismML obecnie wymienia Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B oraz Bonsai Image. Zapowiedź okularów dodaje do linii Bonsai 1.7B model wizyjno-językowy o 2 miliardach parametrów. Tak więc samo „Bonsai” może oznaczać jedną z co najmniej czterech klas parametrów i jedną z dwóch generacji, a przyrostek rozmiaru to jedyne, co pozwala je rozróżnić. To nie jest krytyka nazewnictwa — taki jest normalny kształt rodziny modeli — ale oznacza, że nazwa rodziny nie niesie żadnej informacji o tym, co pobierasz.

Użyteczny podział nie przebiega według generacji, lecz według klasy urządzenia. Wszystko w linii 27B zakłada, że masz gdzieś między 4 GB a 8 GB pamięci do przeznaczenia dla modelu językowego i jesteś gotów ją na to poświęcić. Wszystko w linii 1,7B zakłada, że masz kilkaset megabajtów i ani trochę więcej. Ten jeden fakt decyduje, która połowa rodziny jest dla ciebie istotna, zanim zrobi to jakikolwiek benchmark.

Czym każdy z nich właściwie jest

• Parametry — LLM 1,7B 1-bitowy plus 0,3B 4-bitowy enkoder wizyjny w modelu okularów, w porównaniu z modelem klasy 27B opartym na Qwen3.6-27B w Bonsai 27B.

• Kontekst — 1024 tokeny w modelu okularów, w porównaniu z pełnym kontekstem 262 000 tokenów w Bonsai 27B.

• Wagi modelu językowego — 0,43 GB dla 1-bitowego 1,7B, w porównaniu z 5,9 GB dla trójskładnikowego Bonsai 27B i 3,9 GB dla jego wersji 1-bitowej.

• Reprezentacja — binarne wagi {−1, +1} z grupowym skalowaniem FP16 w obu przypadkach, co stanowi 1-bitowy przepis, na którym opiera się ta rodzina; Bonsai 27B oferuje dodatkowo wariant ternarny {−1, 0, +1} przy 1,71 efektywnego bitu na wagę.

• Docelowy krzem — Qualcomm Hexagon NPU na platformie okularów Snapdragon AR1 Gen 1, kompilowany przy użyciu QNN SDK z obsługą 1-bitowych jąder, w porównaniu z Apple silicon przy użyciu MLX i NVIDIA przy użyciu CUDA dla Bonsai 27B.

• Przepustowość dekodowania — 15,36 tokena na sekundę na platformie testowej AR1 Gen 1 z 4 GB dla modelu okularów, w porównaniu z około 11 tokenami na sekundę na iPhone 17 Pro, 87 tokenami na Apple M5 Max i 163 tokenami na RTX 5090 dla 1-bit Bonsai 27B.

Każda z tych liczb pochodzi od dostawcy, a oba zestawy zmierzono na innym sprzęcie i względem innych wartości odniesienia, więc opisują one dwa produkty, a nie dwa punkty na krzywej.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, stating a 2-billion-parameter vision-language model runs locally on AI smart glasses powered by the Snapdragon AR1 Gen 1 Platform with a 1,024-token context.

Gdzie Bonsai 27B wygrywa, i to nie jest nawet blisko

Kontekst jest na pierwszym miejscu, a przewaga nie jest drobnym szczegółem. Okno o rozmiarze 262 000 tokenów mieści bazę kodu, długi dokument, transkrypcję albo działającą sesję agenta i jeszcze zostaje zapas. Okno o rozmiarze 1024 tokenów mieści jedną krótką instrukcję i jeden obraz. Jeśli Twoje obciążenie obejmuje czytanie czegokolwiek dłuższego niż strona, Bonsai 27B jest jedynym z tych dwóch, który w ogóle może wykonać to zadanie, a żadna ilość sprytnego promptowania na modelu do okularów nie zniweluje tej luki, ponieważ ograniczeniem jest pamięć zarezerwowana na stan klucz-wartość, a nie rozmiar wag.

Możliwości są na drugim miejscu. Według doniesień trójskładnikowa wersja Bonsai 27B zachowuje około 95% swojego poziomu odniesienia w pełnej precyzji w zestawie 15 testów porównawczych w trybie myślenia, a jej wersja 1-bitowa około 90%, przy czym największe straty występują w widzeniu i korzystaniu z narzędzi. To dane producenta z jego własnego zestawu testów i nadal są czymś zupełnie innym niż model o 2 miliardach parametrów, którego jedynym opublikowanym oświadczeniem o jakości jest to, że osiągnął „porównywalne wyniki testów porównawczych” względem 4-bitowego Qwen 3 1.7B. Producent modelu do okularów nie porównuje go z modelem 27B, ponieważ takie porównanie nie byłoby użyteczne.

Ekosystem jest trzeci. Bonsai 27B jest dostarczany w pakietach GGUF, MLX i AWQ z udokumentowanymi środowiskami uruchomieniowymi, więc istnieje ścieżka do uruchomienia go na sprzęcie, który już posiadasz. Model okularów istnieje w łańcuchu narzędzi Qualcomm NPU.

A screenshot of PrismML's July 2026 launch post for Bonsai 27B, titled 'Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone', listing a ternary build at 1.71 effective bits per weight and 5.9 GB and a 1-bit build at 1.125 bits per weight and 3.9 GB, with a 262K-token context.

Gdzie 2B wygrywa, i w tym tkwi cały sens

Model językowy o rozmiarze 0,43 GB mieści się tam, gdzie model o rozmiarze 5,9 GB nie może trafić, a platforma okularów jest jednym z takich miejsc. To cały argument i jest on mocniejszy, niż sugeruje kontrast specyfikacji, ponieważ omawiane urządzenia nie mają alternatywy: para okularów z 4 GB współdzielonej pamięci platformy nie pomieści Bonsai 27B w żadnej wersji, a telefon nie pomieści wersji ternarnej bez rezygnacji z większości tego, do czego telefon służy.

Jest jeszcze druga korzyść, która przyciąga mniej uwagi: reprezentacja 1-bitowa nie jest w tej klasie urządzeń kompromisem — to trik, który umożliwia całe rozwiązanie. Sam PrismML ujmuje to tak, że ścieżka 1-bitowa zapewnia w przybliżeniu inteligencję równoważną temu samemu modelowi w precyzji 4-bitowej, zużywając przy tym około jednej czwartej pamięci i generując tokeny ponad dwukrotnie szybciej. W przypadku urządzenia zawsze włączonego, w którym o każdy miliwat i każdy megabajt toczy się rywalizacja, właśnie ten kompromis jest produktem.

Więc te dwa modele nie konkurują ze sobą. Model 2B uruchamia się wtedy, gdy nie ma już nic innego do uruchomienia. Model 27B uruchamia się wtedy, gdy jest.

Granica poziomu to prawdziwa decyzja

Prawie nikt nie wybiera między tymi dwoma. Realistyczne wdrożenie obejmuje oba: mały, stale działający model na urządzeniu do żądań mieszczących się w 1,024 tokenach oraz coś większego za nim dla całej reszty. Gdy już zaakceptujesz taki układ, pytanie inżynieryjne przestaje być pytaniem „który Bonsai”, a staje się pytaniem „gdzie przebiega granica i kto ją egzekwuje”.

Wymuszona w kodzie aplikacji ta zasada staje się gałęzią, którą trzeba przepisać za każdym razem, gdy model działający na urządzeniu zmieni długość kontekstu lub swoje możliwości — co, sądząc po ostatnich trzech miesiącach, zdarza się mniej więcej raz w miesiącu. Wymuszona jako polityka routingu staje się jedną regułą dotyczącą budżetu kontekstu i wymaganych możliwości, a warstwa lokalna pozostaje warstwą, a nie założeniem wpisanym na stałe w klienta. To właśnie warstwa, na której działa OrcaRouter: jeden punkt końcowy przed ponad 200 hostowanymi modelami, z przełączaniem awaryjnym i polityką eskalacji wyrażoną w konfiguracji. Żaden z modeli Bonsai nie jest tu kierowany — oba są plikami do pobrania i uruchomienia na własnym sprzęcie — więc uczciwie rzecz ujmując, warstwa routingu obejmuje warstwę powyżej lokalnej, a przy lokalnym modelu o 1 024 tokenach to właśnie tam trafi większość ruchu.

A generated two-column scoreboard titled 'Bonsai vs Bonsai 27B — the scoreboard'. The Bonsai 2B VLM column reads: parameters 1.7B 1-bit plus 0.3B vision; context 1,024 tokens; weights 0.43 GB; base Bonsai 1.7B; device smart glasses; runtime Qualcomm NPU toolchain. The Bonsai 27B column reads: parameters 27B on Qwen3.6-27B; context 262K tokens; weights 5.9 GB ternary, 3.9 GB 1-bit; base Qwen3.6-27B; device phone and laptop; runtime MLX, CUDA, GGUF. Footer reads 'Vendor-reported; different hardware and baselines.' The OrcaRouter logo sits in the bottom-right.

Jeśli musisz wybrać jeden

• Budujesz dla okularów, urządzeń noszonych lub dowolnego urządzenia stale włączonego — jedyną opcją jest tu 1-bitowy model wizyjno-językowy Bonsai 2B, a kontekst 1024 tokenów to ograniczenie projektowe, wokół którego budujesz, a nie takie, przeciwko któremu walczysz.

• Budujesz na telefon — 1-bit Bonsai 27B przy 3,9 GB to największy model w tej rodzinie, który mieści się w budżecie pamięci klasy iPhone'a, i zapewnia ci kontekst 262K, do którego model okularowy nie może się zbliżyć.

• Tworzysz pod laptopa lub komputer stacjonarny — ternarna wersja Bonsai 27B to wybór zorientowany na jakość w tej rodzinie, a wersja 1-bitowa daje szybkość, a nie możliwości.

Budujesz rozwiązanie hybrydowe — najpierw ustal regułę eskalacji, a dopiero potem model. Model możesz wymienić; granicy już nie, gdy raz znajdzie się w kliencie.

Warto obserwować, czy ścieżka NPU, która umożliwiła premierę okularów, pójdzie w górę. Jeśli jądra 1-bitowe na mobilnych akceleratorach się uogólnią, linia 1.7B się rozrośnie, a argument za modelem 27B na telefonie stanie się silniejszy. Do tego czasu dwie połowy rodziny pozostają wyraźnie rozdzielone według klasy urządzeń, co czyni wybór łatwiejszym, niż sugerowałaby wspólna nazwa.