Wygenerowana karta tytułowa z napisem „Ternary Bonsai 2 27B vs Bonsai 27B” i podtytułem „Dwa miesiące, dwa modele bazowe”, nad trzema kartami z napisami „Model bazowy: Qwen3.8-27B vs Qwen3.6-27B”, „Najmniejsza kompilacja: 5,93 GB vs 3,9 GB” i „Brak wariantu 1-bitowego w tej generacji”, ze stopką z napisem „Wskaźniki retencji 98,2% i 95% są podane przez dostawcę i pochodzą z różnych zestawów testowych”. Logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

Ternary Bonsai 2 27B vs Bonsai 27B: Dwa miesiące, dwa modele bazowe, jeden brakujący wariant

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ternary Bonsai 2 27B pojawił się 17 września 2026, dwa miesiące po tym, jak Bonsai 27B zadebiutował 14 lipca 2026, a najważniejszym porównaniem między nimi jest jedna para liczb: pierwsza generacja zachowała około 95% średniej z benchmarków swojego pełnoprecyzyjnego modelu bazowego, a druga zachowuje 98,2%. To wygląda na prosty postęp międzypokoleniowy i w większości nim jest — ale te dwie liczby nie mierzą tego samego, ponieważ model bazowy zmienił się pod nimi. Lipcowe wydanie skompresowało Qwen3.6-27B. Wrześniowe wydanie kompresuje Qwen3.8-27B. Część zysku jakościowego należy przypisać recepturze kompresji, a część nowszemu Qwen3.8-27B, i żadna opublikowana liczba nie rozdziela tych dwóch czynników.

Między generacjami istnieje jeszcze druga różnica, która przyciągnęła znacznie mniej uwagi, a ma większe znaczenie dla konkretnej grupy użytkowników: pierwszy Bonsai był oferowany w dwóch wariantach, a drugi — w jednym. Wersja 3.9 GB, dzięki której model klasy 27B zmieścił się na iPhone 17 Pro, nie ma następcy w tym wydaniu. Jeśli to właśnie ten rozmiar był powodem, dla którego w ogóle zainteresowałeś się Bonsai, nowsza generacja nie jest ulepszeniem — to inny produkt, który nie obejmuje twojego przypadku.

Co pierwsza generacja faktycznie dostarczyła

Bonsai 27B został wydany 14 lipca 2026 roku na licencji Apache 2.0 jako dwa artefakty zbudowane na tym samym modelu bazowym, a podział między nimi był sednem tego wydania.

• Ternary Bonsai 27B — wagi trójstanowe {−1, 0, +1} z grupowym skalowaniem FP16, 1,71 efektywnego bitu na wagę, zajętość 5,9 GB. Wersja nastawiona na jakość, przeznaczona do codziennego laptopa, z pełnym rozumowaniem, wywoływaniem narzędzi i możliwościami agentowymi.

• 1-bit Bonsai 27B — binarne wagi {−1, +1} z tym samym skalowaniem grupowym, 1,125 efektywnego bitu na wagę, ślad 3,9 GB. Wersja zorientowana na ślad, o rozmiarze dopasowanym do budżetu pamięci iPhone'a 17 Pro.

Oba miały kontekst 262K tokenów, oba zachowały kompaktową 4-bitową wieżę wizyjną, dzięki czemu model pozostał multimodalny, i oba obsługiwały dekodowanie spekulacyjne ze szkicownikiem DSpark. Stanowisko Prism ML w tamtym czasie było takie, że niskobitowa reprezentacja działała od początku do końca — embeddingi, uwaga, MLP i głowica LM — bez możliwości ucieczki do wyższej precyzji, a wersja 1-bitowa była pierwszym modelem klasy 27B, jaki w ogóle uruchomiono na telefonie. Raportowana przepustowość w wariancie 1-bitowym wynosiła około 11 tokenów na sekundę na iPhone 17 Pro, 87 tok/s na Apple M5 Max i 163 tok/s na RTX 5090; wariant ternarny podawano jako 58 tok/s na M5 Max i 134 tok/s na 5090.

Koszt jakości podano razem z tymi liczbami, a nie ukryto go. W zestawie testów trybu myślenia obejmującym 15 benchmarków pełnoprecyzyjna wersja bazowa uzyskała 85,0, wersja ternarna 80,5 — około 95% — a wersja 1-bitowa 76,1, około 90%. Degradacja skupiła się na wywoływaniu narzędzi przez agenta, które w wersji 1-bitowej spadło z 80,0 do 66,0, oraz na wizji, która spadła z 72,6 do 59,6. Matematyka i kodowanie utrzymały się znacznie lepiej w obu wariantach.

A screenshot of Prism ML's launch post for the first-generation Bonsai 27B, dated July 14 2026 and titled 'Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone', describing the model as based on Qwen3.6 27B and listing two variants: Ternary Bonsai 27B with ternary weights and FP16 group-wise scaling at 1.71 effective bits per weight and 5.9 GB, and 1-bit Bonsai 27B with binary weights at 1.125 effective bits per weight and 3.9 GB, against roughly 54 GB for a 27B model in 16-bit precision and 18 GB for a good 4-bit build.

Co zmieniła druga generacja

Ternary Bonsai 2 27B zachowuje przepis i zmienia dane wejściowe. Reprezentacja trójskładnikowa to nadal {−1, 0, +1} z jedną skalą FP16 na grupę 128 wag, teraz pakującą do 1,76 bitu na wagę w pliku o rozmiarze 5,93 GB, z kontekstem 262K i tą samą oddzielną wieżą wizyjną — 0,63 GB przy 4 bitach w tym wydaniu, ładowaną tylko wtedy, gdy pojawi się obraz.

Dwie rzeczy są naprawdę nowe i obie są podawane jako powód zmiany wartości wskaźnika retencji.

Pierwsza to precyzja selektywna. W przeciwieństwie do lipcowej kompilacji, w której praktycznie wszystko poddano ternaryzacji, Bonsai 2 przechowuje 26 238 464 parametry w pełnej precyzji — 0,0976% modelu językowego, około 52 MB w bf16, skoncentrowane w ścieżce stanu rekurencyjnego warstw uwagi liniowej oraz w wagach normalizacji. To niewielkie ustępstwo pod względem liczby bajtów, a najwyraźniej duże pod względem zachowania.

Drugim jest obrócona baza wag. Macierze wag są przechowywane po blokowej rotacji Walsha–Hadamarda o rozmiarze bloku 1024, a odpowiadające jej przekształcenie jest stosowane do aktywacji w czasie wykonywania, w oparciu o założenie, że rozproszenie wartości odstających po współrzędnych sprawia, że trójpoziomowa aproksymacja jest mniej stratna. Nie wymaga to dodatkowego miejsca do przechowywania, ponieważ rotacja jest wtopiona w wagi, ale jednak znajduje się na ścieżce obliczeniowej.

Jest jeszcze zmiana, która wcale nie jest techniką: model bazowy. Qwen3.8-27B to konstrukcja z hybrydową uwagą — około 75% uwagi liniowej, 25% pełnej uwagi — podczas gdy jego poprzednik nią nie był. Zgłoszone przez Prism ML wyniki w poszczególnych kategoriach pokazują, co dał ten ruch. Podążanie za instrukcjami wynosi 82,66 dla Bonsai 2 wobec 74,53 dla Qwen3.6-27B, modelu bazowego, który kompresowała pierwsza generacja. Rozumowanie i wiedza osiągają 83,95 wobec 84,71 dla starszego modelu bazowego, a kodowanie 81,58 wobec 82,57. Nowy model bazowy jest znacznie lepszy w podążaniu za instrukcjami, a w dwóch pozostałych kategoriach nieco ustępuje, co jest dokładnie tym rodzajem profilu, który sprawia, że procentowe wskaźniki retencji między generacjami są same w sobie nieprzydatne.

Dlaczego tych dwóch wartości retencji nie można ze sobą porównywać

95% i 98,2% wyglądają jak dwa odczyty na jednej skali. Tak jednak nie jest — z trzech powodów, które warto dobrze rozróżnić, zanim wyciągnie się wniosek, że przepis poprawił się o 3,2 punktu.

• Mianowniki się różnią. 95% pierwszej generacji zmierzono na zestawie 15 benchmarków w porównaniu z Qwen3.6-27B. 98,2% drugiej pochodzi z zestawu 20 benchmarków w porównaniu z Qwen3.8-27B. Różne zestawy, różne punkty odniesienia, różne mieszanki trudności.

• Wartości bazowe zmieniły się niezależnie. Część zysku w retencji wynika z tego, że skompresowany model staje się lepszy w kompresowaniu, a część z tego, że model bazowy zmienia się w sposób, który przypadkiem sprzyja wagom trójkowym. Żadna opublikowana praca nie rozdziela tych wkładów.

• Retencja jest względna, więc może rosnąć, podczas gdy bezwzględna zdolność w danej kategorii spada. Model, który zachowuje 99% słabszego rodzica, może nadal ustępować modelowi, który zachowuje 96% silniejszego.

Porównanie bezwzględne dostarcza więcej informacji niż względne, a na tej podstawie cała historia jest czytelniejsza. Wynik zbiorczy Bonsai 2 na poziomie 83,9 przewyższa 83,6, które pełnoprecyzyjny Qwen3.6-27B uzyskał w starszym zestawie — co oznacza, że skompresowany następca wyprzedza teraz nieskompresowany model, którego zastąpił o generację wcześniej. Kompilacja ternarna pierwszej generacji uzyskała 80,5 we własnym zestawie. Obie te liczby pochodzą od Prism ML, a zestawy się różnią, więc czytaj raczej kolejność niż miejsca po przecinku.

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

Wariant, który nie wrócił

To jest ta część porównania, która zmienia decyzję zakupową, a nie wykres benchmarkowy.

Nie istnieje 1-bitowy Bonsai 2. Wrześniowe wydanie zawiera wersję trójkową w dwóch wariantach — PTQ1_0 przy 1,76 bita na wagę i 5,93 GB oraz PQ2_0 przy 2,16 bita na wagę i 7,25 GB — a także kontener MLX dla Apple Silicon. Nie ma wariantu binarnego o rozmiarze 3,9 GB ani zapowiedzi jego istnienia. Pojawiająca się w bieżących materiałach wartość 3,9 GB dla klasy telefonów wciąż odnosi się do lipcowego modelu.

Praktyczna konsekwencja jest bezpośrednia. Jeśli Twoim urządzeniem docelowym jest iPhone lub iPad albo dowolne urządzenie, na którym model językowy o rozmiarze 5,9 GB plus wieża wizyjna 0,63 GB plus budżet kontekstu się nie mieszczą, to kompilacja 1-bitowa pierwszej generacji pozostaje jedyną opcją w tej rodzinie i tak pozostanie, dopóki nie powstanie 1-bitowy Bonsai 2. Ulepszenie ścieżki trójstanowej nie ulepsza tamtej ścieżki. Każdy, kto przeczyta „Bonsai 2 jest lepszy” i pobierze go ponownie na telefon, przekona się, że plik się nie mieści.

Jeśli korzystasz z laptopa lub komputera stacjonarnego, kalkulacja jest odwrotna: nie ma powodu uruchamiać lipcowej kompilacji ternarnej, skoro wrześniowa jest mniejsza na jednostkę jakości, lepsza w benchmarkach, które mają znaczenie, i ma ten sam kontekst 262K.

Szybkość, w przypadku której naprawdę trudno jest uszeregować pokolenia.

Przepustowość to ta część tego porównania, w której uczciwa odpowiedź brzmi: opublikowane liczby nie dają podstaw do jednoznacznego rankingu — i warto to powiedzieć, zamiast wybierać pochlebiającą parę.

Standaryzowane pomiary drugiej generacji przy rozmiarze partii 1 i z wyłączoną wieżą wizyjną to 142,5 tok/s dekodowania na RTX 5090 przy pakowaniu PQ2_0, 46,8 tok/s na Apple M5 Max, 27,7 na M5 Pro i 18,0 na M4 Pro. Pierwsza generacja podawała 134 tok/s na RTX 5090 i 58 tok/s na M5 Max dla swojej wersji ternarnej. Wynik dla 5090 przesuwa się nieznacznie w oczekiwanym kierunku. Wynik dla M5 Max przesuwa się w przeciwnym kierunku — z 58 do 46,8 — co nie przypomina tego, jak powinien wyglądać dwumiesięczny krok generacyjny.

Dwa zastrzeżenia sprawiają, że nie można tego uznać za odkrycie. Podstawy pomiarowe różnią się między wydaniami, a co najmniej jeden opublikowany wynik M5 Max dla nowszego modelu przypisano kompilacji sprzed optymalizacji rotacji. Ale warto to zaznaczyć jako otwarte pytanie, ponieważ mechanizm, który by to wyjaśniał, znajduje się w informacjach o wydaniu: obrócona baza umieszcza transformację na ścieżce krytycznej każdej projekcji przy rozmiarze partii 1, a dekodowanie na Apple Silicon to reżim, w którym szkodzi to najbardziej. Technika, która daje jakość, może kosztować przepustowość dekodowania, a na sprzęcie ze zunifikowaną pamięcią ten kompromis jest najostrzejszy.

Kontener MLX wprowadza osobny problem dla użytkowników Apple. Jest to afiniczny format 2-bitowy, którego blok przechowuje zarówno skalę, jak i przesunięcie dla każdej grupy 128 wag, ale wagi trójstanowe potrzebują tylko skali, więc przesunięcie stanowi zbędny balast — blok kosztuje 36 bajtów na 128 wag zamiast 34, a współczynnik upakowania wynosi 2,25 bita na wagę przy zmierzonym rozmiarze pliku 8,005 GiB. To inny kontener przenoszący te same wartości i to ten pakiet, który środowisko demonstracyjne pobiera domyślnie.

Uruchamianie którejkolwiek generacji

Obie generacje łączy jedno ograniczenie operacyjne, któremu nie wymknęła się żadna wersja tego modelu: żadna z nich nie działa na standardowym llama.cpp. Ternarne jądra dla tej architektury znajdują się we własnym forku Prism ML, standardowy llama.cpp odrzuca bieżące upakowania jako nieznane i — co gorsza — wczyta starszy format ternarny bez protestu i wygeneruje płynny bełkot, ponieważ nie stosuje rotacji, którą zakładają wagi. Kompilacja MLX zawiera jądra Metal i CPU, ale nie ma ścieżki CUDA. Niezależnie od tego, którą generację wybierzesz, kwestię środowiska uruchomieniowego rozstrzyga własna dystrybucja Prism ML albo środowisko uruchomieniowe, które przyjęło jej jądra, a nie ekosystem ggml jako całość.

Miejsce OrcaRoutera w takiej decyzji jest o jeden poziom wyżej. Żadna generacja Bonsai nie jest tu hostowana — to pliki do pobrania, które uruchamiasz na własnym sprzęcie. Warstwa routingu przydaje się na granicy: przy żądaniach, na które Twój lokalny model nie powinien odpowiadać. Zdefiniuj politykę eskalacji raz, w konfiguracji routingu, a nie w kodzie aplikacji, tak aby lokalnie obsługiwany poziom przekazywał żądania z długim kontekstem, mocno oparte na obrazach lub w inny sposób wykraczające poza zakres do hostowanego modelu, zamiast ich nie realizować, i aby mechanizm awaryjny działał niezależnie od tego, którą generację Bonsai masz akurat zainstalowaną. Zarówno poziom lokalny, jak i hostowanystoją wtedy za jednym kluczem, a polityka znajduje się w jednym miejscu, gdy pojawi się kolejna generacja Bonsai i granice poziomów znów się przesuną.

Co zrobić z tym

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Bonsai 27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: base model Qwen3.8-27B, released 17 September 2026, variants one ternary build, smallest footprint 5.93 GB, vendor-reported retention 98.2%, stock llama.cpp support none. The Bonsai 27B (first generation) column reads: base model Qwen3.6-27B, released 14 July 2026, variants ternary plus 1-bit, smallest footprint 3.9 GB, vendor-reported retention 95%, stock llama.cpp support none. Footer reads 'Retention measured on different suites by the vendor; both unreproduced.' The OrcaRouter logo sits in the bottom-right.

• Jeśli uruchamiasz lipcową kompilację ternary na laptopie lub komputerze stacjonarnym — przejdź na Ternary Bonsai 2 27B. To lepszy model przy mniej więcej takim samym rozmiarze, a wyniki w kategoriach, w których wygrywa, są tymi, które mają znaczenie w pracy agentowej i pracy polegającej na podążaniu za instrukcjami.

• Jeśli uruchamiasz lipcową kompilację 1-bitową na telefonie — zostań. Nie ma następcy, a kompilacja ternarna o rozmiarze 5,93 GB nie jest zamiennikiem plug-and-play dla wersji 3,9 GB.

• Jeśli oceniasz tę rodzinę po raz pierwszy — najpierw ustal footprint, a potem generację. Wariant, którego potrzebujesz, decyduje o tym, w którym wydaniu szukasz, a ta kolejność jest odwrotnością tego, jak zwykle opisuje się ten upgrade.

• Jeśli wybierasz na podstawie benchmarków — traktuj 95% i 98,2% jako dwa różne pomiary, a nie dwa punkty na jednej linii, i każdą liczbę w obu przypadkach traktuj jako dane samego dostawcy, dopóki nie pojawi się niezależna ocena modelu z września. To właśnie ta ocena jest tym, na co warto patrzeć, ponieważ będzie pierwszą, która pozwoli porównać obie generacje na wspólnej podstawie.