
Ternary Bonsai 2 27B kontra Qwen3.8-27B: Co tak naprawdę daje 47,9 gigabajta precyzji
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B i Qwen3.8-27B to ten sam model w dwóch światach numerycznych. Mają wspólną architekturę, tokenizer, rodowód treningowy i okno kontekstu wynoszące 262 144 tokeny. Różni je sposób zapisu wag: Qwen3.8-27B przechowuje każdą z nich jako 16-bitowy float i zajmuje 53,81 GB w referencyjnej postaci FP16, natomiast Ternary Bonsai 2 27B przechowuje każdą z nich jako jeden z trzech symboli i zajmuje 5,93 GB. Prism ML ogłosiło skompresowaną wersję 17 września 2026 r. i udostępniło ją na Hugging Face na licencji Apache 2.0; oryginalne wagi Qwen3.8-27B opublikowano 13 sierpnia 2026 r., również na licencji Apache 2.0.
Porównanie, które ma znaczenie, nie polega na tym, który z nich jest lepszy. Chodzi o to, ile kosztuje cię brakujące 47,9 GB, a szczera odpowiedź jest węższa i bardziej konkretna, niż powie ci którykolwiek z obozów. Prism ML podaje, że jego kompilacja zachowuje 98,2% średniej modelu pełnej precyzji w zestawie 20 benchmarków — 83,9 wobec 85,4. Ta liczba pochodzi od samego dostawcy, została zmierzona na jego własnym stanowisku testowym i dzień po wydaniu nikt spoza Prism ML jej nie odtworzył. Agregat ukrywa też to, na czym naprawdę powinno ci zależeć, ponieważ 1,8 punktu nie rozkłada się równomiernie. W dwóch benchmarkach, które sprawdzają wytrzymałość w długotrwałych zadaniach inżynierii oprogramowania, różnica nie wynosi 1,8% — jest bliżej 25%.
Ta sama sieć, zapisana inaczej
Zacznij od tego, czego kompresja nie dotyka, bo właśnie dlatego to porównanie jest w ogóle interesujące. Liczba warstw, rozmiar ukryty, słownik, wzorzec uwagi i wieża wizyjna należą do modelu bazowego. Qwen3.8-27B to projekt z hybrydową uwagą: 48 warstw liniowej uwagi Gated DeltaNet przeplatanych z 16 warstwami pełnej uwagi, podział w przybliżeniu 3:1, w 64 warstwach, z rozmiarem ukrytym 5 120 i słownikiem 248 320 tokenów. Ten w większości liniowy szkielet sprawia, że kontekst 262K jest w ogóle osiągalny, i to właśnie tę właściwość Bonsai dziedziczy bez zmian.
To, co zmienił Prism ML, to reprezentacja macierzy modelu językowego oraz jądra obliczeniowe potrzebne do wykonywania na nich obliczeń. Jego biała księga dzieli 27,36 mld parametrów na 24,35 mld w szkielecie językowym w 64 blokach, 2,54 mld w embeddingu i głowicy LM oraz 0,47 mld w 27-blokowej wieży wizyjnej. Wieża wizyjna jest dostarczana jako oddzielny 4-bitowy plik mmproj o rozmiarze około 0,63 GB i jest ładowana tylko wtedy, gdy faktycznie pojawi się obraz, więc wdrożenie obsługujące wyłącznie tekst nigdy nie ponosi związanego z nią kosztu.
Praktyczna konsekwencja tego w przeważającej mierze liniowego projektu zasługuje na zasygnalizowanie przed jakąkolwiek dyskusją o benchmarkach. Ponieważ architektura nie jest konwencjonalnym transformerem, jądra niskobitowe musiały zostać napisane specjalnie dla niej. Standardowy llama.cpp odrzuca oba formaty upakowania Prism ML jako nieznane typy — a co groźniejsze, bez sprzeciwu wczytuje starszy format ternarny i produkuje płynny bełkot, ponieważ nie stosuje pasującego obrotu do aktywacji. Jeśli uruchomisz ten model na binarce, która o nim nie wie, nie otrzymasz błędu. Otrzymasz pewny siebie, błędny wynik.
Porównanie, kategoria po kategorii
Oto zestawienie 20 benchmarków dostawcy, z modelem bazowym pełnej precyzji jako punktem odniesienia. Każda liczba na tej liście pochodzi od Prism ML; żadna nie została niezależnie zweryfikowana.
• Matematyka — 96,57 dla Ternary Bonsai 2 27B vs 97,06 dla Qwen3.8-27B. W praktyce ten sam poziom.
• Kodowanie — 81,58 vs 82,17. Też blisko, i to kategoria, wokół której toczy się cały spór o tę technikę.
• Podążanie za instrukcjami — 82,66 vs 81,25. Skompresowany model jest lepszy tutaj, co jest jedynym wierszem w tabeli, który naprawdę zaskakuje.
• Wiedza i rozumowanie — 83,95 vs 86,66. Spadek o 2,7 punktu i największy pojedynczy czynnik odpowiadający za brakujące 1,8 punktu.
• Agentowe i wywoływanie narzędzi — 77,57 vs 79,74, obejmujące 80,22 w τ2-Bench i 74,92 w BFCL v3.
• Wizja — 78,59 vs 81,64, największy spadek w kategorii. Zauważ, że sama wieża wizyjna nie jest częścią poddaną kompresji; jest nią model językowy odczytujący jej wyniki.

Odczytuj kształt, a nie średnią, a wyłoni się jaśniejsza historia. Kompresja jest niemal bezkosztowa w przypadku matematyki, programowania i podążania za instrukcjami, a kosztowna w przypadku wiedzy i widzenia. To odwrotność potocznej mądrości o modelach niskobitowych, która głosi, że powierzchowna wiedza przetrwa, a rozumowanie się załamie. Tutaj to wiedza ulega erozji, a rozumowanie się utrzymuje.
Gdzie tak naprawdę znajduje się 1,8 punktu
Wynik zbiorczy to średnia z dwudziestu benchmarków, a średnie to miejsce, w którym luki lubią się ukrywać. Wyodrębnij poszczególne wyniki, a dwa z nich są znacznie gorsze, niż sugeruje średnia.
• Terminal-Bench 2.1 — 52,8 dla wersji ternarnej wobec 69,7 dla pełnej precyzji
• SWE-bench Verified — 60,8 w porównaniu z 80,6
Oba osiągają blisko trzech czwartych wyniku pełnej precyzji. Dla kontrastu AIME26 osiąga 95,83, LiveCodeBench — 90,07, a AA-LCR — 77,0, czyli w granicach jednego punktu od modelu nieskompresowanego. To pierwszy raz, gdy rodzina Bonsai została w ogóle oceniona na Terminal-Bench, a Prism ML wyraźnie stwierdza w swoich materiałach, że obiecana w pierwszej generacji zdolność do długoterminowej inżynierii oprogramowania została dostarczona częściowo, a nie w pełni.
Praktyczne pytanie nie brzmi więc „czy utrzymuje 98,2%”, lecz „jakie jest moje obciążenie pracą”. Jeśli uruchamiasz agenta kodującego, który podtrzymuje plan przez dziesiątki wywołań narzędzi i edytuje pliki przez kilka minut, znajdujesz się w kategorii z 25-procentową luką, a liczba zbiorcza aktywnie wprowadza w błąd. Jeśli zajmujesz się matematyką, jednorazowym generowaniem kodu, ekstrakcją, klasyfikacją lub czatem, jesteś w kategoriach, w których luka się zaciera. Najbardziej przydatne w tabeli samego dostawcy jest to, że pozwala ci dokonać tego rozróżnienia zamiast zgadywać.
Czego tak naprawdę potrzebuje każdy z nich, aby działać
Sytuacja sprzętowa jest mniej symetryczna, niż sugeruje stosunek rozmiarów. Model FP16 o rozmiarze 53,81 GB w ogóle nie mieści się na laptopie z 16 GB, przez co porównanie sprowadza się mniej do „szybciej kontra wolniej”, a bardziej do „możliwe kontra niemożliwe”. Standaryzowane pomiary Prism ML przy wielkości partii 1, z wyłączeniem wieży wizyjnej:
• NVIDIA RTX 5090 — dekodowanie z szybkością 142,5 tok/s przy pakowaniu PQ2_0, przy 0,582 mWh na token
• Apple M5 Max — 46,8 tok/s przy dekodowaniu, z przetwarzaniem podpowiedzi na poziomie około 765 tok/s
• Apple M5 Pro — 27,7 tok/s dekodowania
• Apple M4 Pro — 18,0 tok/s dekodowania; przetwarzanie promptu na poziomie blisko 125 tok/s staje się ograniczeniem wiążącym przy bardzo długich kontekstach
Istotne zastrzeżenie jest takie, że nic z tego nie jest pojedynczym plikiem binarnym. Pakowanie PTQ1_0 daje 5,93 GB przy 1,76 bita na wagę; PQ2_0 kosztuje 7,25 GB przy 2,16 bita na wagę i daje szybkość dekodowania na sprzęcie, na którym ograniczeniem jest przepustowość instrukcji, a nie przepustowość pamięci. Kompilacja MLX dla Apple Silicon to trzeci artefakt z własnym rozliczeniem — afiniczny 2-bitowy kontener, który przechowuje bias, jakiego wagi trójkowe nie potrzebują, osiągając 2,25 bita na wagę i 8,005 GiB na dysku, z jądrami Metal i CPU, ale bez ścieżki CUDA. „Działa w 5,9 GB” jest prawdą dokładnie w przypadku jednego z tych plików i dokładnie właściwego środowiska uruchomieniowego.
Porównanie kosztów, uczciwie przedstawione
Są dwa sposoby, by zapłacić za Qwen3.8-27B, i tylko jeden sposób, by zapłacić za jego skompresowanego bliźniaka. Ternary Bonsai 2 27B to plik do pobrania: Apache 2.0, twój sprzęt, żadnego licznika. Qwen3.8-27B to zarówno plik do pobrania, jak i usługa hostowana, a jeśli wybierzesz wariant hostowany, istotna jest kwota podana na stronie modelu — 0,33 USD za milion tokenów wejściowych i 2,40 USD za milion tokenów wyjściowych, obsługiwana z własnej infrastruktury OrcaRouter, a nie odsprzedawana od kogoś innego.
Właśnie tu OrcaRouter zasługuje na miejsce w tym porównaniu, a nie na przypis. Routowana wersja Qwen3.8-27B ma ten sam kontekst 262K, przyjmuje tekst, obrazy i wideo oraz udostępnia mechanizm kontroli wysiłku rozumowania, w który model jest wyposażony. Jest dostępna pod tym samym kluczem co ponad 200 innych modeli, bez narzutu ponad cenę katalogową dostawcy, co ma większe znaczenie, niż się wydaje: ponieważ cena katalogowa jest przekazywana dalej, a nie odsprzedawana, zmiana ceny dostawcy pojawia się tutaj tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. Dla zespołu, który chce bazę pełnej precyzji jako poziom eskalacji powyżej lokalnego Bonsai, to jeden punkt końcowy i jeden klucz, a nie dwie relacje z dostawcami.

Po który sięgnąć?
Decyzja zależy głównie od tego, gdzie wykonywana jest praca, a nie od tego, który model jest lepszy, ponieważ w większości zadań to ten sam model.
• Wybierz Qwen3.8-27B w pełnej precyzji, gdy zadanie ma długi horyzont i charakter agentowy, gdy prowadzisz ewaluację lub fine-tuning, gdy potrzebujesz kontekstu YaRN o rozmiarze 1 mln tokenów albo gdy dokładność wizyjna ma kluczowe znaczenie. Powodem są liczby z Terminal-Bench i SWE-bench.
• Wybierz Ternary Bonsai 2 27B, gdy praca musi odbywać się na sprzęcie, który posiadasz, gdy alternatywą jest w ogóle nieuruchamianie modelu 27B, lub gdy obciążenie to matematyka, kodowanie, ekstrakcja albo rozumowanie bez użycia narzędzi, gdzie kategorie są na równym poziomie.
• Nie wybieraj na podstawie zagregowanego wyniku. 83,9 i 85,4 są tak blisko siebie, że zamiana jednego benchmarku mogłaby zmienić ich kolejność, a tylko jedna z tych dwóch liczb jest niezależnie zweryfikowana.
To, co jest tu naprawdę nowe, to nie to, że model 27B mieści się w sześciu gigabajtach — pierwsza generacja Bonsai dokonała tego w lipcu. Nowe jest to, że podążanie za instrukcjami wypadło lepiej niż w modelu macierzystym, a matematyka i kodowanie wypadły na równym poziomie, co jest innym twierdzeniem niż „mały jak na swój rozmiar”. To, czy utrzyma poziom przy twoim obciążeniu, jest dokładnie tym, czego nie może ci powiedzieć jeden dzień od wydania, a pierwsza niezależna ocena tego modelu to wynik, na który warto czekać.

Jeśli chcesz przeprowadzić porównanie na własnych promptach, a nie na zestawie testów porównawczych, najszybszą drogą jest wywołanie hostowanego Qwen3.8-27B przez jeden endpoint i uruchomienie wersji ternarnej lokalnie, a następnie porównanie wyników na zadaniach, które faktycznie masz. To praca na jedno przedpołudnie i powie ci więcej o tych 1,8 punktu niż jakakolwiek opublikowana tabela.
