Kartu judul yang dihasilkan bertuliskan 'Bonsai vs Bonsai 27B', dengan subjudul 'Satu nama keluarga, enam belas kali lipat parameternya', di atas tiga kartu yang bertuliskan 'Konteks: 1.024 token vs 262K', 'Bobot LLM: 0,43 GB vs 5,9 GB', dan 'Perangkat target: kacamata pintar vs ponsel, laptop, desktop', dengan footer bertuliskan 'Angka yang dilaporkan vendor; kedua model tidak diuji pada rangkaian pengujian yang sama.' Logo OrcaRouter terletak di sudut kanan bawah.
Guides & Insights

Bonsai vs Bonsai 27B: Satu Nama Keluarga, Parameter Enam Belas Kali Lipat

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Siapa pun yang berbelanja keluarga ini berdasarkan nama akan mendapatkan model yang salah, dan alasannya adalah nama telanjang "Bonsai" bukanlah sebuah model. Itu adalah keluarga, dan per minggu ini keluarga tersebut mencakup model visi-bahasa 2 miliar parameter yang berjalan di sepasang kacamata pintar dan model 27 miliar parameter yang berjalan di ponsel, laptop, atau desktop. Yang pertama adalah model visi-bahasa 1-bit Bonsai 2B yang diumumkan pada 23 September 2026 — model bahasa 1-bit 1,7B ditambah encoder visi 4-bit 0,3B, konteks 1.024 token, dibangun di atas Bonsai 1.7B. Yang kedua adalah Bonsai 27B, dirilis pada 14 Juli 2026 di bawah Apache 2.0, dibangun di atas Qwen3.6-27B dengan konteks 262.000 token dan pilihan build ternary 5,9 GB atau build biner 3,9 GB. Keduanya berbagi nama, vendor, filosofi kompresi, dan hampir tidak ada hal lain. Enam belas kali parameter, dua ratus lima puluh enam kali konteks, dan dua perangkat yang sepenuhnya berbeda.

Halaman ini untuk orang yang mencari salah satunya dan mendarat di yang lain.

Masalah penamaan, dinyatakan dengan gamblang

Menu model PrismML saat ini mencantumkan Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B dan Bonsai Image. Pengumuman kacamata menambahkan model visi-bahasa 2 miliar parameter di atas lini Bonsai 1.7B. Jadi "Bonsai" saja bisa berarti salah satu dari setidaknya empat kelas parameter dan dua generasi, dan akhiran ukuran adalah satu-satunya hal yang membedakannya. Itu bukan kritik terhadap penamaannya — itu bentuk normal dari sebuah keluarga model — tetapi itu berarti nama keluarga tidak membawa informasi tentang apa yang Anda unduh.

Pembagian yang berguna bukanlah generasi, melainkan kelas perangkat. Semua di lini 27B mengasumsikan Anda memiliki antara 4 GB dan 8 GB memori untuk dialokasikan kepada model bahasa dan bersedia menggunakannya. Semua di lini 1.7B mengasumsikan Anda memiliki beberapa ratus megabita dan tidak lebih. Fakta tunggal itu menentukan separuh keluarga mana yang relevan bagi Anda sebelum tolok ukur apa pun menentukannya.

Apa sebenarnya masing-masing itu

• Parameter — LLM 1-bit 1,7B plus encoder visi 4-bit 0,3B pada model kacamata, dibandingkan dengan model kelas 27B yang diturunkan dari Qwen3.6-27B pada Bonsai 27B.

• Konteks — 1.024 token pada model kacamata, dibandingkan dengan konteks penuh 262.000 token pada Bonsai 27B.

• Bobot model bahasa — 0,43 GB untuk 1-bit 1,7B, dibandingkan dengan 5,9 GB untuk Bonsai 27B terner dan 3,9 GB untuk versi 1-bit-nya.

• Representasi — bobot biner {−1, +1} dengan penskalaan per grup FP16 pada keduanya, yang merupakan resep 1-bit yang menjadi dasar keluarga ini; Bonsai 27B juga menawarkan varian terner {−1, 0, +1} pada 1,71 bit efektif per bobot.

• Silikon target — Qualcomm Hexagon NPU pada platform kacamata Snapdragon AR1 Gen 1, dikompilasi melalui QNN SDK dengan dukungan kernel 1-bit, dibandingkan dengan Apple silicon melalui MLX dan NVIDIA melalui CUDA untuk Bonsai 27B.

• Throughput dekode — 15,36 token per detik pada platform pengujian AR1 Gen 1 4 GB untuk model kacamata, dibandingkan dengan sekitar 11 token per detik pada iPhone 17 Pro, 87 pada Apple M5 Max, dan 163 pada RTX 5090 untuk Bonsai 27B 1-bit.

Semua angka itu berasal dari vendor, dan kedua kumpulan data tersebut diukur pada perangkat keras yang berbeda dengan baseline yang berbeda, jadi keduanya menggambarkan dua produk, bukan dua titik pada sebuah kurva.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, stating a 2-billion-parameter vision-language model runs locally on AI smart glasses powered by the Snapdragon AR1 Gen 1 Platform with a 1,024-token context.

Di mana Bonsai 27B menang, dan itu tidak tipis

Konteks adalah hal pertama, dan margin bukanlah nuansa. Jendela 262.000 token dapat menampung basis kode, dokumen panjang, transkrip, atau sesi agen yang sedang berjalan dengan ruang tersisa. Jendela 1.024 token hanya menampung satu instruksi singkat dan satu gambar. Jika beban kerja Anda melibatkan pembacaan apa pun yang lebih panjang dari satu halaman, Bonsai 27B adalah satu-satunya dari keduanya yang sama sekali mampu mengerjakan tugas itu, dan sebanyak apa pun prompt cerdik pada model kacamata tidak akan menutup kesenjangan itu, karena batasnya adalah memori yang disediakan untuk status key-value, bukan ukuran bobotnya.

Kemampuan berada di posisi kedua. Versi ternary Bonsai 27B dilaporkan mempertahankan sekitar 95% dari baseline presisi penuhnya di seluruh suite mode berpikir dengan 15 benchmark, dan versi 1-bitnya sekitar 90%, dengan kerugian terbesar pada visi dan penggunaan alat. Itu adalah angka vendor pada suite milik vendor sendiri, dan itu tetap merupakan kelas yang berbeda dari model 2 miliar parameter yang satu-satunya pernyataan kualitas yang dipublikasikan adalah bahwa model tersebut mencapai "hasil benchmark komparatif" terhadap Qwen 3 1.7B 4-bit. Model kacamata tidak dibandingkan dengan model 27B oleh pembuatnya sendiri, karena perbandingan itu tidak akan berguna.

Ekosistem adalah yang ketiga. Bonsai 27B hadir dalam paket GGUF, MLX, dan AWQ dengan runtime yang terdokumentasi, jadi ada jalur untuk menjalankannya di perangkat keras yang sudah Anda miliki. Model kacamata itu ada di dalam toolchain NPU Qualcomm.

A screenshot of PrismML's July 2026 launch post for Bonsai 27B, titled 'Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone', listing a ternary build at 1.71 effective bits per weight and 5.9 GB and a 1-bit build at 1.125 bits per weight and 3.9 GB, with a 262K-token context.

Di mana 2B menang, dan itulah seluruh intinya.

Model bahasa 0,43 GB muat di tempat yang model 5,9 GB tidak bisa masuk, dan platform kacamata adalah salah satunya. Itulah keseluruhan argumennya, dan itu adalah argumen yang lebih kuat daripada yang terdengar dari kontras spesifikasinya, karena perangkat yang dimaksud tidak punya alternatif: sepasang kacamata dengan memori platform bersama 4 GB tidak dapat menjalankan Bonsai 27B dalam build apa pun, dan ponsel tidak dapat menjalankan build terner tanpa mengorbankan sebagian besar fungsi utamanya.

Ada keunggulan kedua yang kurang mendapat perhatian: representasi 1-bit bukanlah kompromi pada kelas perangkat ini, melainkan trik yang memungkinkannya. Rumusan PrismML sendiri adalah bahwa jalur 1-bit memberikan kecerdasan yang kira-kira setara dengan model yang sama pada presisi 4-bit sembari menggunakan sekitar seperempat memori dan menghasilkan token dengan kecepatan lebih dari dua kali lipat. Bagi perangkat yang selalu aktif, tempat setiap miliwatt dan setiap megabita diperebutkan, pertukaran itulah produknya.

Jadi kedua model itu tidak bersaing. 2B adalah yang berjalan saat tidak ada tempat lain untuk menjalankannya. 27B adalah yang berjalan saat ada.

Batas tier adalah keputusan sebenarnya.

Hampir tidak ada orang yang memilih di antara keduanya. Deployment yang realistis memiliki keduanya: model kecil yang selalu aktif di perangkat untuk permintaan yang muat dalam 1.024 token, dan sesuatu yang lebih besar di belakangnya untuk segala hal lainnya. Begitu Anda menerima bentuk itu, pertanyaan teknisnya bukan lagi "Bonsai yang mana" melainkan "di mana batasnya, dan siapa yang menegakkannya".

Jika diberlakukan di dalam kode aplikasi, baris itu menjadi percabangan yang harus ditulis ulang setiap kali model di perangkat mengubah panjang konteks atau kemampuannya — yang, berdasarkan bukti tiga bulan terakhir, kira-kira terjadi setiap bulan. Jika diberlakukan sebagai kebijakan perutean, ia menjadi satu aturan tentang anggaran konteks dan kemampuan yang dibutuhkan, dan tier lokal tetap menjadi sebuah tier alih-alih menjadi asumsi yang tertanam di seluruh klien. Itulah lapisan tempat OrcaRouter beroperasi: satu endpoint di depan lebih dari 200 model terkelola, dengan failover dan kebijakan eskalasi yang dinyatakan dalam konfigurasi. Tidak ada Bonsai yang dirutekan di sini — keduanya adalah unduhan yang Anda jalankan di perangkat keras Anda sendiri — jadi perumusan yang jujur adalah bahwa lapisan perutean mencakup tier di atas tier lokal, dan dengan model lokal berkonteks 1.024 token, tier itulah tempat sebagian besar lalu lintas akan bermuara.

A generated two-column scoreboard titled 'Bonsai vs Bonsai 27B — the scoreboard'. The Bonsai 2B VLM column reads: parameters 1.7B 1-bit plus 0.3B vision; context 1,024 tokens; weights 0.43 GB; base Bonsai 1.7B; device smart glasses; runtime Qualcomm NPU toolchain. The Bonsai 27B column reads: parameters 27B on Qwen3.6-27B; context 262K tokens; weights 5.9 GB ternary, 3.9 GB 1-bit; base Qwen3.6-27B; device phone and laptop; runtime MLX, CUDA, GGUF. Footer reads 'Vendor-reported; different hardware and baselines.' The OrcaRouter logo sits in the bottom-right.

Jika Anda harus memilih satu

• Anda sedang membangun untuk kacamata, perangkat yang dapat dikenakan, atau perangkat apa pun yang selalu aktif — model visi-bahasa Bonsai 2B 1-bit adalah satu-satunya pilihan di sini, dan konteks 1.024 token adalah batasan desain yang Anda akomodasi saat membangun, bukan yang Anda lawan.

• Anda sedang membangun untuk ponsel — Bonsai 27B 1-bit pada 3,9 GB adalah model terbesar dalam keluarga ini yang cocok dengan anggaran memori kelas iPhone, dan itu memberi Anda konteks 262K yang tidak dapat didekati oleh model kacamata.

• Anda sedang membangun untuk laptop atau desktop — build ternary Bonsai 27B adalah pilihan yang berorientasi kualitas dalam keluarga ini, dan build 1-bit mengutamakan kecepatan ketimbang kemampuan.

• Anda sedang membangun sistem hibrida — putuskan aturan eskalasi lebih dulu, modelnya belakangan. Model bisa Anda ganti; batasnya tidak, begitu sudah berada di klien.

Yang patut dicermati adalah apakah jalur NPU yang memungkinkan peluncuran kacamata itu meluas ke atas. Jika kernel 1-bit pada akselerator seluler dapat digeneralisasi, lini 1.7B menjadi lebih besar dan alasan untuk model 27B di ponsel semakin kuat. Sampai saat itu, dua belahan keluarga ini tetap terpisah secara jelas berdasarkan kelas perangkat, yang membuat pilihannya lebih mudah daripada yang disiratkan oleh nama bersamanya.