Wygenerowana karta tytułowa o treści „Ternary Bonsai 2 27B vs Qwen3.8-27B” z podtytułem „Ta sama sieć w dwóch precyzjach”, nad trzema kartami o treści „Rozmiar pliku: 5,93 GB vs 53,81 GB”, „Redukcja: 9,05x” i „Kontekst: 262K tokenów w obu przypadkach”, ze stopką o treści „Retencja na poziomie 98,2% jest podana przez dostawcę i nie została odtworzona”. Logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

Ternary Bonsai 2 27B kontra Qwen3.8-27B: Co tak naprawdę daje 47,9 gigabajta precyzji

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ternary Bonsai 2 27B i Qwen3.8-27B to ten sam model w dwóch światach numerycznych. Mają wspólną architekturę, tokenizer, rodowód treningowy i okno kontekstu wynoszące 262 144 tokeny. Różni je sposób zapisu wag: Qwen3.8-27B przechowuje każdą z nich jako 16-bitowy float i zajmuje 53,81 GB w referencyjnej postaci FP16, natomiast Ternary Bonsai 2 27B przechowuje każdą z nich jako jeden z trzech symboli i zajmuje 5,93 GB. Prism ML ogłosiło skompresowaną wersję 17 września 2026 r. i udostępniło ją na Hugging Face na licencji Apache 2.0; oryginalne wagi Qwen3.8-27B opublikowano 13 sierpnia 2026 r., również na licencji Apache 2.0.

Porównanie, które ma znaczenie, nie polega na tym, który z nich jest lepszy. Chodzi o to, ile kosztuje cię brakujące 47,9 GB, a szczera odpowiedź jest węższa i bardziej konkretna, niż powie ci którykolwiek z obozów. Prism ML podaje, że jego kompilacja zachowuje 98,2% średniej modelu pełnej precyzji w zestawie 20 benchmarków — 83,9 wobec 85,4. Ta liczba pochodzi od samego dostawcy, została zmierzona na jego własnym stanowisku testowym i dzień po wydaniu nikt spoza Prism ML jej nie odtworzył. Agregat ukrywa też to, na czym naprawdę powinno ci zależeć, ponieważ 1,8 punktu nie rozkłada się równomiernie. W dwóch benchmarkach, które sprawdzają wytrzymałość w długotrwałych zadaniach inżynierii oprogramowania, różnica nie wynosi 1,8% — jest bliżej 25%.

Ta sama sieć, zapisana inaczej

Zacznij od tego, czego kompresja nie dotyka, bo właśnie dlatego to porównanie jest w ogóle interesujące. Liczba warstw, rozmiar ukryty, słownik, wzorzec uwagi i wieża wizyjna należą do modelu bazowego. Qwen3.8-27B to projekt z hybrydową uwagą: 48 warstw liniowej uwagi Gated DeltaNet przeplatanych z 16 warstwami pełnej uwagi, podział w przybliżeniu 3:1, w 64 warstwach, z rozmiarem ukrytym 5 120 i słownikiem 248 320 tokenów. Ten w większości liniowy szkielet sprawia, że kontekst 262K jest w ogóle osiągalny, i to właśnie tę właściwość Bonsai dziedziczy bez zmian.

To, co zmienił Prism ML, to reprezentacja macierzy modelu językowego oraz jądra obliczeniowe potrzebne do wykonywania na nich obliczeń. Jego biała księga dzieli 27,36 mld parametrów na 24,35 mld w szkielecie językowym w 64 blokach, 2,54 mld w embeddingu i głowicy LM oraz 0,47 mld w 27-blokowej wieży wizyjnej. Wieża wizyjna jest dostarczana jako oddzielny 4-bitowy plik mmproj o rozmiarze około 0,63 GB i jest ładowana tylko wtedy, gdy faktycznie pojawi się obraz, więc wdrożenie obsługujące wyłącznie tekst nigdy nie ponosi związanego z nią kosztu.

Praktyczna konsekwencja tego w przeważającej mierze liniowego projektu zasługuje na zasygnalizowanie przed jakąkolwiek dyskusją o benchmarkach. Ponieważ architektura nie jest konwencjonalnym transformerem, jądra niskobitowe musiały zostać napisane specjalnie dla niej. Standardowy llama.cpp odrzuca oba formaty upakowania Prism ML jako nieznane typy — a co groźniejsze, bez sprzeciwu wczytuje starszy format ternarny i produkuje płynny bełkot, ponieważ nie stosuje pasującego obrotu do aktywacji. Jeśli uruchomisz ten model na binarce, która o nim nie wie, nie otrzymasz błędu. Otrzymasz pewny siebie, błędny wynik.

Porównanie, kategoria po kategorii

Oto zestawienie 20 benchmarków dostawcy, z modelem bazowym pełnej precyzji jako punktem odniesienia. Każda liczba na tej liście pochodzi od Prism ML; żadna nie została niezależnie zweryfikowana.

• Matematyka — 96,57 dla Ternary Bonsai 2 27B vs 97,06 dla Qwen3.8-27B. W praktyce ten sam poziom.

• Kodowanie — 81,58 vs 82,17. Też blisko, i to kategoria, wokół której toczy się cały spór o tę technikę.

• Podążanie za instrukcjami — 82,66 vs 81,25. Skompresowany model jest lepszy tutaj, co jest jedynym wierszem w tabeli, który naprawdę zaskakuje.

• Wiedza i rozumowanie — 83,95 vs 86,66. Spadek o 2,7 punktu i największy pojedynczy czynnik odpowiadający za brakujące 1,8 punktu.

• Agentowe i wywoływanie narzędzi — 77,57 vs 79,74, obejmujące 80,22 w τ2-Bench i 74,92 w BFCL v3.

• Wizja — 78,59 vs 81,64, największy spadek w kategorii. Zauważ, że sama wieża wizyjna nie jest częścią poddaną kompresji; jest nią model językowy odczytujący jej wyniki.

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Qwen3.8-27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: bits per weight 1.76 packed, file size 5.93 GB, 20-benchmark average 83.9, math 96.57, instruction following 82.66, Terminal-Bench 2.1 52.8. The Qwen3.8-27B FP16 column reads: bits per weight 16.0, file size 53.81 GB, 20-benchmark average 85.4, math 97.06, instruction following 81.25, Terminal-Bench 2.1 69.7. Footer reads 'Both columns are one vendor suite; the compressed figures are unaudited.' The OrcaRouter logo sits in the bottom-right.

Odczytuj kształt, a nie średnią, a wyłoni się jaśniejsza historia. Kompresja jest niemal bezkosztowa w przypadku matematyki, programowania i podążania za instrukcjami, a kosztowna w przypadku wiedzy i widzenia. To odwrotność potocznej mądrości o modelach niskobitowych, która głosi, że powierzchowna wiedza przetrwa, a rozumowanie się załamie. Tutaj to wiedza ulega erozji, a rozumowanie się utrzymuje.

Gdzie tak naprawdę znajduje się 1,8 punktu

Wynik zbiorczy to średnia z dwudziestu benchmarków, a średnie to miejsce, w którym luki lubią się ukrywać. Wyodrębnij poszczególne wyniki, a dwa z nich są znacznie gorsze, niż sugeruje średnia.

• Terminal-Bench 2.1 — 52,8 dla wersji ternarnej wobec 69,7 dla pełnej precyzji

• SWE-bench Verified — 60,8 w porównaniu z 80,6

Oba osiągają blisko trzech czwartych wyniku pełnej precyzji. Dla kontrastu AIME26 osiąga 95,83, LiveCodeBench — 90,07, a AA-LCR — 77,0, czyli w granicach jednego punktu od modelu nieskompresowanego. To pierwszy raz, gdy rodzina Bonsai została w ogóle oceniona na Terminal-Bench, a Prism ML wyraźnie stwierdza w swoich materiałach, że obiecana w pierwszej generacji zdolność do długoterminowej inżynierii oprogramowania została dostarczona częściowo, a nie w pełni.

Praktyczne pytanie nie brzmi więc „czy utrzymuje 98,2%”, lecz „jakie jest moje obciążenie pracą”. Jeśli uruchamiasz agenta kodującego, który podtrzymuje plan przez dziesiątki wywołań narzędzi i edytuje pliki przez kilka minut, znajdujesz się w kategorii z 25-procentową luką, a liczba zbiorcza aktywnie wprowadza w błąd. Jeśli zajmujesz się matematyką, jednorazowym generowaniem kodu, ekstrakcją, klasyfikacją lub czatem, jesteś w kategoriach, w których luka się zaciera. Najbardziej przydatne w tabeli samego dostawcy jest to, że pozwala ci dokonać tego rozróżnienia zamiast zgadywać.

Czego tak naprawdę potrzebuje każdy z nich, aby działać

Sytuacja sprzętowa jest mniej symetryczna, niż sugeruje stosunek rozmiarów. Model FP16 o rozmiarze 53,81 GB w ogóle nie mieści się na laptopie z 16 GB, przez co porównanie sprowadza się mniej do „szybciej kontra wolniej”, a bardziej do „możliwe kontra niemożliwe”. Standaryzowane pomiary Prism ML przy wielkości partii 1, z wyłączeniem wieży wizyjnej:

• NVIDIA RTX 5090 — dekodowanie z szybkością 142,5 tok/s przy pakowaniu PQ2_0, przy 0,582 mWh na token

• Apple M5 Max — 46,8 tok/s przy dekodowaniu, z przetwarzaniem podpowiedzi na poziomie około 765 tok/s

• Apple M5 Pro — 27,7 tok/s dekodowania

• Apple M4 Pro — 18,0 tok/s dekodowania; przetwarzanie promptu na poziomie blisko 125 tok/s staje się ograniczeniem wiążącym przy bardzo długich kontekstach

Istotne zastrzeżenie jest takie, że nic z tego nie jest pojedynczym plikiem binarnym. Pakowanie PTQ1_0 daje 5,93 GB przy 1,76 bita na wagę; PQ2_0 kosztuje 7,25 GB przy 2,16 bita na wagę i daje szybkość dekodowania na sprzęcie, na którym ograniczeniem jest przepustowość instrukcji, a nie przepustowość pamięci. Kompilacja MLX dla Apple Silicon to trzeci artefakt z własnym rozliczeniem — afiniczny 2-bitowy kontener, który przechowuje bias, jakiego wagi trójkowe nie potrzebują, osiągając 2,25 bita na wagę i 8,005 GiB na dysku, z jądrami Metal i CPU, ale bez ścieżki CUDA. „Działa w 5,9 GB” jest prawdą dokładnie w przypadku jednego z tych plików i dokładnie właściwego środowiska uruchomieniowego.

Porównanie kosztów, uczciwie przedstawione

Są dwa sposoby, by zapłacić za Qwen3.8-27B, i tylko jeden sposób, by zapłacić za jego skompresowanego bliźniaka. Ternary Bonsai 2 27B to plik do pobrania: Apache 2.0, twój sprzęt, żadnego licznika. Qwen3.8-27B to zarówno plik do pobrania, jak i usługa hostowana, a jeśli wybierzesz wariant hostowany, istotna jest kwota podana na stronie modelu — 0,33 USD za milion tokenów wejściowych i 2,40 USD za milion tokenów wyjściowych, obsługiwana z własnej infrastruktury OrcaRouter, a nie odsprzedawana od kogoś innego.

Właśnie tu OrcaRouter zasługuje na miejsce w tym porównaniu, a nie na przypis. Routowana wersja Qwen3.8-27B ma ten sam kontekst 262K, przyjmuje tekst, obrazy i wideo oraz udostępnia mechanizm kontroli wysiłku rozumowania, w który model jest wyposażony. Jest dostępna pod tym samym kluczem co ponad 200 innych modeli, bez narzutu ponad cenę katalogową dostawcy, co ma większe znaczenie, niż się wydaje: ponieważ cena katalogowa jest przekazywana dalej, a nie odsprzedawana, zmiana ceny dostawcy pojawia się tutaj tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. Dla zespołu, który chce bazę pełnej precyzji jako poziom eskalacji powyżej lokalnego Bonsai, to jeden punkt końcowy i jeden klucz, a nie dwie relacje z dostawcami.

A screenshot of Prism ML's launch post for Bonsai 2 27B, dated September 17 2026 and titled 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', showing the opening paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance the new model retains over 98%.

Po który sięgnąć?

Decyzja zależy głównie od tego, gdzie wykonywana jest praca, a nie od tego, który model jest lepszy, ponieważ w większości zadań to ten sam model.

• Wybierz Qwen3.8-27B w pełnej precyzji, gdy zadanie ma długi horyzont i charakter agentowy, gdy prowadzisz ewaluację lub fine-tuning, gdy potrzebujesz kontekstu YaRN o rozmiarze 1 mln tokenów albo gdy dokładność wizyjna ma kluczowe znaczenie. Powodem są liczby z Terminal-Bench i SWE-bench.

• Wybierz Ternary Bonsai 2 27B, gdy praca musi odbywać się na sprzęcie, który posiadasz, gdy alternatywą jest w ogóle nieuruchamianie modelu 27B, lub gdy obciążenie to matematyka, kodowanie, ekstrakcja albo rozumowanie bez użycia narzędzi, gdzie kategorie są na równym poziomie.

• Nie wybieraj na podstawie zagregowanego wyniku. 83,9 i 85,4 są tak blisko siebie, że zamiana jednego benchmarku mogłaby zmienić ich kolejność, a tylko jedna z tych dwóch liczb jest niezależnie zweryfikowana.

To, co jest tu naprawdę nowe, to nie to, że model 27B mieści się w sześciu gigabajtach — pierwsza generacja Bonsai dokonała tego w lipcu. Nowe jest to, że podążanie za instrukcjami wypadło lepiej niż w modelu macierzystym, a matematyka i kodowanie wypadły na równym poziomie, co jest innym twierdzeniem niż „mały jak na swój rozmiar”. To, czy utrzyma poziom przy twoim obciążeniu, jest dokładnie tym, czego nie może ci powiedzieć jeden dzień od wydania, a pierwsza niezależna ocena tego modelu to wynik, na który warto czekać.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and the description that the model is self-hosted on OrcaRouter's own infrastructure.

Jeśli chcesz przeprowadzić porównanie na własnych promptach, a nie na zestawie testów porównawczych, najszybszą drogą jest wywołanie hostowanego Qwen3.8-27B przez jeden endpoint i uruchomienie wersji ternarnej lokalnie, a następnie porównanie wyników na zadaniach, które faktycznie masz. To praca na jedno przedpołudnie i powie ci więcej o tych 1,8 punktu niż jakakolwiek opublikowana tabela.