Kartu judul yang dihasilkan bertuliskan 'Bonsai vs Ternary Bonsai 2 27B', dengan subjudul 'Dua taruhan bit rendah, dua penggaris berbeda', di atas tiga kartu bertuliskan 'Bobot: 0,43 GB vs 5,93 GB', 'Klaim kualitas: komparatif vs retensi 98,2%', dan 'Silikon: Hexagon NPU vs Apple silicon dan CUDA', dengan catatan kaki bertuliskan 'Semua angka kualitas dilaporkan vendor dan tidak direproduksi.' Logo OrcaRouter berada di kanan bawah.
Guides & Insights

Bonsai vs Ternary Bonsai 2 27B: Dua Taruhan Bit Rendah, Dua Penggaris Berbeda

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tempatkan model visi-bahasa 1-bit Bonsai 2B di samping Ternary Bonsai 2 27B dan perbandingan yang jelas — 2 miliar parameter versus 27 miliar, 0,43 GB bobot bahasa versus 5,93 GB — adalah hal yang paling tidak menarik dari pasangan itu. Hal yang menarik adalah bahwa kedua model tersebut, dari vendor yang sama dan program kompresi yang sama, tidak melaporkan kualitasnya dengan cara yang sama. Ternary Bonsai 2 27B melaporkan retensi: model ini mempertahankan lebih dari 98% performa benchmark agregat dari versi presisi penuhnya, diukur terhadap dirinya sendiri. 1-bit Bonsai 2B melaporkan sebuah perbandingan: model ini mencapai "hasil benchmark komparatif" terhadap model Qwen 3 1.7B pada kuantisasi 4-bit, diukur terhadap model milik pihak lain pada presisi yang berbeda. Yang satu adalah pernyataan tentang berapa banyak yang hilang. Yang lain adalah pernyataan tentang bagaimana posisinya. Tidak satu pun dari keduanya merupakan pernyataan tentang seberapa baik masing-masing model secara absolut, dan keduanya tidak dapat dibaca pada skala yang sama.

Perbedaan itu lebih penting daripada jumlah parameter, karena hal itu menentukan apa yang sebenarnya dapat Anda simpulkan dari angka-angka vendor — dan berdasarkan bukti yang dipublikasikan sejauh ini, jawaban yang jujur adalah lebih sedikit daripada yang disiratkan oleh angka-angka utama.

Dua klaim kualitas, dua tolok ukur yang berbeda

Ternary Bonsai 2 27B, yang dirilis pada 17 September 2026, adalah rekonstruksi ternary {−1, 0, +1} dari Qwen3.8-27B pada 1,76 bit efektif per bobot, dan angka yang dijadikan unggulan PrismML adalah bahwa model ini mempertahankan lebih dari 98% kinerja benchmark agregat model presisi penuh. Itu adalah klaim retensi, dan klaim retensi secara konstruksi bersifat swareferensial: klaim tersebut memberi tahu Anda berapa banyak dari model asli yang bertahan dari kompresi, bukan di mana posisi model asli. Model yang mempertahankan 98% dari baseline biasa-biasa saja tetap merupakan model biasa-biasa saja, dan Qwen3.8-27B bukanlah model biasa-biasa saja — tetapi angka itu saja tidak mengatakan demikian, dan angka itu tidak dapat dibandingkan lintas model dasar.

Model bahasa-visi Bonsai 2B 1-bit, yang diumumkan pada 23 September 2026 untuk platform kacamata Snapdragon AR1 Gen 1, adalah model bahasa 1-bit berukuran 1,7B ditambah encoder visi 4-bit berukuran 0,3B. Pernyataan kualitas yang dipublikasikan berbeda jenisnya: PrismML mengevaluasinya terhadap model Qwen 3 1.7B pada kuantisasi 4-bit di seluruh BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K, dan GPQA Diamond, dan melaporkan bahwa kedua konfigurasi tersebut mencapai hasil yang sebanding. Itu adalah klaim paritas terhadap baseline eksternal. Ini menyatakan bahwa kompresi tersebut tidak secara jelas merugikan Anda dibandingkan jalur 4-bit yang jika tidak akan Anda gunakan — yang justru merupakan pertanyaan yang tepat untuk rilis kelas perangkat, dan klaim yang jauh lebih lemah daripada "model ini bagus".

Jadi tidak ada penafsiran yang membuat 98,2% mengalahkan “komparatif” atau sebaliknya. Keduanya adalah jawaban atas dua pertanyaan berbeda, yang diajukan terhadap dua referensi berbeda, pada dua suite berbeda, oleh vendor yang sama. Siapa pun yang memeringkat kedua model ini berdasarkan kekuatan kedua kalimat itu sebenarnya sedang memeringkat kalimat-kalimatnya.

Model dasar berasal dari tempat yang berbeda-beda.

Ada perbedaan struktural kedua, dan inilah yang akan penting sepanjang tahun mendatang. Ternary Bonsai 2 27B adalah kompresi ulang dari model eksternal — Qwen3.8-27B milik Alibaba. Batas atas kualitasnya ditentukan oleh jadwal rilis pihak lain, dan irama generasinya mengikuti Qwen, bukan PrismML. Ketika Qwen merilis 27B baru, lini Bonsai 27B mendapat input baru, dan angka retensi dihitung ulang terhadap baseline baru.

Bonsai 2B 1-bit dibangun di atas Bonsai 1.7B milik PrismML sendiri. Batas atasnya ditetapkan secara internal, irama pembaruannya menjadi pilihan PrismML, dan peningkatannya berasal dari resep kompresi serta jalur kernel, bukan dari pertukaran model hulu. Itu adalah jenis aset yang berbeda: lebih lambat meningkat dalam kemampuan mentah, sepenuhnya di bawah kendali vendor, dan — seperti yang ditunjukkan oleh peluncuran kacamata — dapat disetel untuk akselerator tertentu dengan cara yang tidak dapat dilakukan oleh kompresi ulang umum.

Keduanya adalah strategi yang sah. Keduanya tidak dapat dipertukarkan, dan strategi yang Anda inginkan bergantung pada apakah peta jalan Anda berpatokan pada Qwen atau pada perangkat.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder running on the Snapdragon AR1 Gen 1 Platform.

Kontras spesifikasi, satu baris demi satu baris

• Parameter — LLM 1-bit 1,7B plus encoder visi 4-bit 0,3B dalam model kacamata, dibandingkan dengan model kelas 27B yang diturunkan dari Qwen3.8-27B dalam Ternary Bonsai 2 27B.

• Representasi — biner {−1, +1} dengan penskalaan per grup FP16 pada model kacamata, dibandingkan dengan ternary {−1, 0, +1} dengan penskalaan yang sama pada 1,76 bit efektif per bobot di 27B.

• Bobot model bahasa — 0,43 GB untuk 1-bit 1,7B, dibandingkan dengan 5,93 GB untuk packing PTQ1_0 dari Ternary Bonsai 2 27B, dengan packing PQ2_0 7,25 GB yang juga tersedia.

• Konteks — 1,024 token pada model kacamata, dibandingkan dengan konteks penuh 262,000 token pada Ternary Bonsai 2 27B.

• Akselerator — Qualcomm Hexagon NPU melalui QNN SDK dengan dukungan kernel 1-bit, dibandingkan dengan Apple silicon melalui MLX dan NVIDIA melalui CUDA.

• Klaim kualitas — "hasil benchmark komparatif" terhadap Qwen 3 1.7B 4-bit, terhadap retensi "lebih dari 98%" dari baseline Qwen3.8-27B presisi penuh. Keduanya dilaporkan vendor, tidak satu pun direproduksi secara independen, diukur pada suite yang berbeda.

• Runtime — toolchain NPU Qualcomm untuk model kacamata, dibandingkan dengan fork llama.cpp milik PrismML sendiri dan kontainer MLX untuk 27B, yang keduanya tidak didukung oleh llama.cpp standar.

A screenshot of PrismML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces the memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

Apa yang didapat dari taruhan low-bit dalam setiap kasus

Filosofi kompresinya sama pada kedua model dan layak disebutkan, karena itulah tesis sebenarnya dari keluarga ini: representasi bit rendah berjalan dari ujung ke ujung — embedding, attention, MLP, dan LM head — dengan penskalaan group-wise FP16 dan tanpa jalur pelarian berpresisi lebih tinggi. Tidak ada model yang mempertahankan jaring pengaman float untuk bagian-bagian yang sulit dikuantisasi. Itu adalah posisi yang lebih agresif daripada yang diambil oleh sebagian besar pekerjaan kuantisasi, dan itulah yang memungkinkan 1,76 bit per bobot serta bobot 0,43 GB sama sekali.

Titik di mana taruhan itu membuahkan hasil berbeda. Pada Ternary Bonsai 2 27B, hasilnya adalah kemampuan per byte pada perangkat keras yang sudah Anda miliki: model kelas 27B dalam 5,93 GB, berjalan di laptop atau ponsel, pada 98% dari baseline-nya. Pada 1-bit Bonsai 2B, hasilnya adalah keberadaan pada kelas perangkat yang sebelumnya tidak punya opsi: model multimodal dalam 0,43 GB bobot bahasa, di NPU, pada 15,36 token per detik. Yang pertama adalah versi yang lebih baik dari sesuatu yang sudah berfungsi. Yang kedua adalah sesuatu yang sebelumnya tidak berfungsi.

Di mana batas tier berada

Keduanya bukanlah alternatif, dan memperlakukannya sebagai adu langsung berarti melewatkan bentuk deployment yang dituju kedua rilis ini. Produk kacamata atau wearable menjalankan 2B secara lokal karena tidak ada yang lain yang cocok. Produk laptop atau ponsel menjalankan 27B karena mampu. Begitu sebuah produk mencakup keduanya — aplikasi ponsel yang dipasangkan ke kacamata, aplikasi laptop dengan asisten di perangkat — pertanyaannya tidak lagi model yang mana, melainkan permintaan mana yang boleh dijawab oleh masing-masing tier.

Batas itu layak ditempatkan dalam konfigurasi alih-alih dalam kode aplikasi, karena kedua tier akan bergeser. Garis 27B bergeser saat Qwen merilis, garis 2B bergeser saat PrismML mengubah resepnya, dan aturan yang di-hard-code tentang panjang konteks atau kemampuan akan rusak pada kedua peristiwa itu. Kebijakan perutean yang mengeskalasi permintaan di luar anggaran tier lokal ke model terkelola akan bertahan melewati kedua perubahan itu; tier lokal tetap menjadi satu tier di antara beberapa, bukan asumsi yang tertanam di seluruh klien. OrcaRouter adalah lapisan yang melakukan eskalasi itu — satu endpoint di lebih dari 200 model terkelola, termasuk failover, dengan kebijakan yang dinyatakan sebagai konfigurasi. Bonsai tidak dirutekan di sini; keduanya adalah unduhan lokal. Yang ada di sini adalah tier di atas keduanya, dan dengan model lokal berkonteks 1.024 token, tier itulah yang melakukan sebagian besar pekerjaan.

A generated scoreboard titled 'Bonsai vs Ternary Bonsai 2 27B — the scoreboard'. The Bonsai column reads: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; weights 0.43 GB; context 1,024 tokens; representation binary; quality claim comparative against 4-bit Qwen 3 1.7B; accelerator Qualcomm Hexagon NPU. The Ternary Bonsai 2 27B column reads: parameters 27B on Qwen3.8-27B; weights 5.93 GB PTQ1_0; context 262K tokens; representation ternary at 1.76 bits per weight; quality claim over 98% retention of full precision; accelerator Apple MLX and NVIDIA CUDA. Footer reads 'All quality figures vendor-reported; the two claims use different baselines and suites.' The OrcaRouter logo sits in the bottom-right.

Apa yang bisa menyelesaikannya

Tiga pengukuran akan mengubah pasangan ini dari dua klaim pemasaran menjadi sebuah perbandingan. Rincian per tolok ukur di balik baris "hasil komparatif", sehingga kompromi terhadap 4-bit terlihat alih-alih hanya diringkas. Angka retensi untuk Bonsai 2B 1-bit terhadap baseline presisi penuhnya sendiri — pengukuran yang digunakan PrismML untuk lini 27B dan tidak diterbitkan di sini. Dan evaluasi independen terhadap salah satu model, karena setiap angka dalam kedua rilis saat ini berasal dari vendor.

Sampai salah satunya ada, posisi yang dapat dipertahankan adalah posisi yang benar-benar didukung oleh angka-angka itu: Ternary Bonsai 2 27B adalah model yang jauh lebih baik, dan 1-bit Bonsai 2B adalah satu-satunya dari keduanya yang berjalan di perangkat yang memang dirancang untuknya. Kedua pernyataan itu tidak saling bertentangan, dan fakta bahwa vendor yang sama mengukurnya dengan penggaris yang berbeda adalah hal yang perlu diingat pada saat berikutnya salah satu dari angka-angka ini dikutip tanpa baseline-nya.