
Ternary Bonsai 2 27B vs Bonsai 27B: Dua Bulan, Dua Model Dasar, Satu Varian yang Hilang
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B hadir pada 17 September 2026, dua bulan setelah Bonsai 27B dirilis pada 14 Juli 2026, dan perbandingan utamanya adalah sepasang angka: generasi pertama mempertahankan sekitar 95% dari rata-rata benchmark model dasar presisi penuhnya, dan generasi kedua mempertahankan 98,2%. Itu terbaca seperti peningkatan antargenerasi yang lugas, dan sebagian besar memang demikian — tetapi kedua angka itu tidak mengukur hal yang sama, karena model dasarnya berubah di balik keduanya. Rilis Juli mengompresi Qwen3.6-27B. Rilis September mengompresi Qwen3.8-27B. Sebagian dari perolehan kualitas berasal dari resep kompresi dan sebagian lagi berasal dari Qwen3.8-27B yang lebih baru, dan tidak ada angka yang dipublikasikan yang memisahkan keduanya.
Ada perbedaan kedua antargenerasi yang jauh kurang mendapat perhatian dan lebih penting bagi sekelompok pengguna tertentu: Bonsai pertama hadir dalam dua varian dan yang kedua hadir dalam satu varian. Build 3,9 GB yang membuat model kelas 27B muat di iPhone 17 Pro tidak memiliki penerus dalam rilis ini. Jika ukuran itu adalah alasan Anda tertarik pada Bonsai sejak awal, generasi yang lebih baru bukanlah peningkatan — ini adalah produk berbeda yang tidak mencakup kebutuhan Anda.
Apa yang sebenarnya dirilis generasi pertama
Bonsai 27B dirilis pada 14 Juli 2026 di bawah Apache 2.0 sebagai dua artefak yang dibangun di atas model dasar yang sama, dan pemisahan di antara keduanya itulah inti dari rilis tersebut.
• Ternary Bonsai 27B — bobot ternary {−1, 0, +1} dengan penskalaan per grup FP16, 1,71 bit efektif per bobot, jejak 5,9 GB. Varian yang mengutamakan kualitas, ditujukan untuk laptop sehari-hari dengan kemampuan penalaran penuh, pemanggilan alat, dan agentik.
• 1-bit Bonsai 27B — bobot biner {−1, +1} dengan penskalaan per grup yang sama, 1,125 bit efektif per bobot, jejak 3,9 GB. Varian yang dioptimalkan untuk ukuran, disesuaikan agar muat dalam anggaran memori iPhone 17 Pro.
Keduanya membawa konteks 262K token, keduanya mempertahankan menara visi 4-bit yang ringkas agar model tetap multimodal, dan keduanya mendukung decoding spekulatif dengan drafter DSpark. Kerangka Prism ML saat itu adalah bahwa representasi bit-rendah berjalan dari ujung ke ujung — embeddings, attention, MLP, dan LM head — tanpa jalur pelarian presisi lebih tinggi, dan build 1-bit adalah model kelas 27B pertama yang berjalan di ponsel sama sekali. Throughput yang dilaporkan pada varian 1-bit sekitar 11 token per detik di iPhone 17 Pro, 87 tok/s di Apple M5 Max, dan 163 tok/s di RTX 5090; varian ternary dikutip 58 tok/s di M5 Max dan 134 tok/s di 5090.
Biaya kualitas dilaporkan bersama angka-angka itu alih-alih disembunyikan. Pada rangkaian mode berpikir dengan 15 tolok ukur, basis presisi penuh mencetak skor 85,0, build ternary 80,5 — sekitar 95% — dan build 1-bit 76,1, sekitar 90%. Degradasi terkonsentrasi pada pemanggilan alat agentik, yang turun dari 80,0 menjadi 66,0 pada build 1-bit, dan pada visi, yang turun dari 72,6 menjadi 59,6. Matematika dan pemrograman bertahan jauh lebih baik pada kedua varian.

Apa yang diubah oleh generasi kedua
Ternary Bonsai 2 27B mempertahankan resepnya dan mengubah inputnya. Representasi ternernya masih {−1, 0, +1} dengan satu skala FP16 per grup yang terdiri dari 128 bobot, kini dikemas menjadi 1,76 bit per bobot dalam berkas 5,93 GB, dengan konteks 262K dan menara visi terpisah yang sama — 0,63 GB pada 4-bit dalam rilis ini, dimuat hanya ketika sebuah gambar tiba.
Ada dua hal yang benar-benar baru, dan keduanya disebut sebagai alasan angka retensi itu berubah.
Yang pertama adalah presisi selektif. Berbeda dengan versi Juli, yang mengubah praktis semuanya menjadi ternary, Bonsai 2 menyimpan 26.238.464 parameter dalam presisi penuh — 0,0976% dari model bahasa, sekitar 52 MB pada bf16, terkonsentrasi pada jalur keadaan rekuren dari lapisan linear-attention serta bobot normalisasi. Itu adalah konsesi kecil dalam hal byte dan tampaknya konsesi besar dalam hal perilaku.
Yang kedua adalah basis bobot yang dirotasi. Matriks bobot disimpan setelah rotasi Walsh–Hadamard per blok dengan ukuran blok 1.024, dengan transformasi yang sesuai diterapkan pada aktivasi saat runtime, berdasarkan teori bahwa menyebarkan outlier ke seluruh koordinat membuat aproksimasi tiga tingkat tidak terlalu lossy. Ini tidak memerlukan penyimpanan tambahan karena rotasi dilipat ke dalam bobot, tetapi memang berada di jalur komputasi.
Lalu ada perubahan yang sama sekali bukan teknik: model dasar. Qwen3.8-27B adalah desain hybrid-attention — sekitar 75% linear attention, 25% full attention — sedangkan pendahulunya bukan. Skor kategori yang dilaporkan Prism ML menunjukkan apa yang diperoleh dari langkah itu. Instruction following berada di 82,66 untuk Bonsai 2, dibandingkan 74,53 untuk Qwen3.6-27B, basis yang dikompresi oleh generasi pertama. Penalaran dan pengetahuan berada di 83,95 berbanding 84,71 untuk basis lama, dan coding di 81,58 berbanding 82,57. Basis baru lebih baik dalam instruction following dengan selisih lebar dan sedikit tertinggal pada dua kategori lainnya, yang justru merupakan jenis profil yang membuat persentase retensi antar-generasi tidak banyak membantu jika berdiri sendiri.
Mengapa kedua angka retensi tersebut tidak dapat dibandingkan
95% dan 98,2% tampak seperti dua pembacaan pada satu skala. Tidak demikian, karena ada tiga alasan yang perlu dipahami dengan tepat sebelum menyimpulkan bahwa resep tersebut membaik sebesar 3,2 poin.
• Penyebutnya berbeda. 95% generasi pertama diukur pada rangkaian 15 benchmark terhadap Qwen3.6-27B. 98,2% generasi kedua berasal dari rangkaian 20 benchmark terhadap Qwen3.8-27B. Rangkaian berbeda, baseline berbeda, campuran tingkat kesulitan berbeda.
• Baseline tersebut bergerak secara independen. Sebagian dari perolehan retensi berasal dari model terkompresi yang menjadi lebih baik dalam mengompresi, dan sebagian lagi berasal dari model dasar yang berubah dengan cara-cara yang kebetulan lebih ramah terhadap bobot ternary. Tidak ada yang dipublikasikan yang memisahkan kontribusi-kontribusi tersebut.
• Retensi bersifat relatif, jadi retensi dapat naik sementara kemampuan absolut menurun dalam suatu kategori. Model yang mempertahankan 99% dari model induk yang lebih lemah masih bisa tertinggal dari model yang mempertahankan 96% dari model induk yang lebih kuat.
Perbandingan absolut lebih informatif daripada perbandingan relatif, dan atas dasar itu ceritanya lebih rapi. Agregat Bonsai 2 sebesar 83,9 berada di atas 83,6 yang dicapai Qwen3.6-27B presisi penuh pada suite yang lebih lama — artinya penerus terkompresi kini lebih unggul daripada model tak terkompresi yang digantikannya satu generasi sebelumnya. Build ternary generasi pertama mencetak 80,5 pada suite-nya sendiri. Kedua angka tersebut milik Prism ML, dan suite-nya berbeda, jadi bacalah urutannya, bukan angka desimalnya.

Varian yang tidak kembali
Inilah bagian dari perbandingan yang mengubah keputusan pembelian, bukan sekadar bagan tolok ukur.
Tidak ada Bonsai 2 1-bit. Rilis September menghadirkan build ternary, dalam dua kemasan — PTQ1_0 pada 1,76 bit per bobot dan 5,93 GB, serta PQ2_0 pada 2,16 bit per bobot dan 7,25 GB — plus kontainer MLX untuk Apple Silicon. Tidak ada varian biner 3,9 GB, dan tidak ada pengumuman mengenai varian tersebut. Angka 3,9 GB kelas ponsel yang muncul dalam liputan saat ini masih merujuk pada model Juli.
Konsekuensi praktisnya langsung. Jika target Anda adalah iPhone atau iPad, atau perangkat apa pun yang tidak dapat memuat model bahasa 5,9 GB ditambah menara visi 0,63 GB ditambah anggaran konteks, maka build 1-bit generasi pertama tetap menjadi satu-satunya opsi dalam keluarga ini, dan akan tetap demikian sampai ada Bonsai 2 1-bit. Memutakhirkan jalur ternary tidak memutakhirkan jalur itu. Siapa pun yang membaca “Bonsai 2 lebih baik” dan mengunduh ulang ke ponsel akan mendapati file itu tidak muat.
Jika Anda menggunakan laptop atau desktop, kalkulasinya justru terbalik: tidak ada alasan untuk menjalankan build ternary Juli ketika versi September lebih kecil per satuan kualitas, lebih baik pada benchmark yang penting, dan membawa konteks 262K yang sama.
Kecepatan, di mana generasi-generasinya benar-benar sulit untuk diberi peringkat
Throughput adalah bagian dari perbandingan ini di mana jawaban yang jujur adalah bahwa angka-angka yang dipublikasikan tidak mendukung peringkat yang jelas, dan ada baiknya mengatakan hal itu daripada memilih pasangan yang menyanjung.
Pengukuran terstandardisasi generasi kedua pada ukuran batch 1 dengan menara visi dikecualikan adalah 142,5 tok/s decode pada RTX 5090 dengan packing PQ2_0, 46,8 tok/s pada Apple M5 Max, 27,7 pada M5 Pro, dan 18,0 pada M4 Pro. Generasi pertama menyebutkan 134 tok/s pada RTX 5090 dan 58 tok/s pada M5 Max untuk build ternary-nya. Angka 5090 bergerak secara moderat ke arah yang diharapkan. Angka M5 Max bergerak ke arah sebaliknya — dari 58 turun menjadi 46,8 — yang bukan seperti wujud langkah antargenerasi selama dua bulan.
Dua catatan penting menghalangi hal itu menjadi sebuah temuan. Basis pengukurannya berbeda antar rilis, dan setidaknya satu angka M5 Max yang dipublikasikan untuk model yang lebih baru telah dikaitkan dengan build yang mendahului optimisasi rotasi. Namun hal itu layak ditandai sebagai pertanyaan terbuka, karena mekanisme yang dapat menjelaskannya sudah ada di catatan rilis: basis yang dirotasi menempatkan sebuah transformasi pada jalur kritis setiap proyeksi pada ukuran batch 1, dan decode Apple Silicon adalah rezim tempat hal itu paling merugikan. Teknik yang mengutamakan kualitas bisa jadi mengorbankan throughput decode, dan pada perangkat keras memori terpadu, pertukaran itu berada pada titik paling tajam.
Kontainer MLX menambahkan kerumitan tersendiri bagi pengguna Apple. Ini adalah format affine 2-bit yang bloknya menyimpan skala sekaligus bias untuk setiap kelompok 128 bobot, tetapi bobot terner hanya membutuhkan skala, sehingga bias itu hanya menjadi beban mati — blok tersebut memakan 36 byte per 128 bobot, bukan 34, dan tingkat pemadatannya berada di 2,25 bit per bobot dengan ukuran berkas terukur 8,005 GiB. Ini adalah kontainer berbeda yang membawa nilai yang sama, dan inilah paket yang diunduh secara default oleh setup demonstrasi.
Menjalankan salah satu generasi
Kedua generasi berbagi satu kendala operasional yang belum pernah bisa dihindari oleh versi mana pun dari model ini: tak satu pun berjalan di llama.cpp standar. Kernel ternary untuk arsitektur ini berada di fork milik Prism ML sendiri, llama.cpp standar menolak packing saat ini sebagai tidak dikenal, dan — lebih buruk lagi — ia akan memuat format ternary lama tanpa mengeluh dan menghasilkan sampah yang fasih, karena ia tidak menerapkan rotasi yang diasumsikan oleh bobot. Build MLX membawa kernel Metal dan CPU tetapi tidak memiliki jalur CUDA. Generasi mana pun yang Anda pilih, pertanyaan runtime dijawab oleh distribusi Prism ML sendiri atau oleh runtime yang telah mengadopsi kernelnya, bukan oleh ekosistem ggml secara luas.
Posisi OrcaRouter dalam keputusan seperti ini adalah satu tingkat di atas. Tidak ada generasi Bonsai yang dihosting di sini — keduanya berupa unduhan yang Anda jalankan di perangkat keras Anda sendiri. Yang membuat lapisan perutean berguna adalah batasnya: permintaan yang seharusnya tidak dijawab oleh model lokal Anda. Definisikan kebijakan eskalasi sekali di konfigurasi perutean alih-alih di kode aplikasi, sehingga tier yang dilayani secara lokal meneruskan permintaan berkonteks panjang, berat visi, atau di luar cakupan ke model yang dihosting, bukan menggagalkannya, dan agar fallback tetap bertahan apa pun generasi Bonsai yang kebetulan Anda pasang. Tier lokal dan tier yang dihosting kemudian berada di balik satu kunci, dan kebijakannya berada di satu tempat ketika generasi Bonsai berikutnya hadir dan batas tier bergeser lagi.
Apa yang harus dilakukan dengan ini

• Jika Anda menjalankan build ternary Juli di laptop atau desktop — beralihlah ke Ternary Bonsai 2 27B. Model ini lebih baik dengan ukuran yang kurang lebih sama, dan skor kategori yang membuatnya unggul adalah skor yang penting untuk pekerjaan agentic dan pengikutan instruksi.
• Jika Anda menjalankan build 1-bit Juli di ponsel — tetaplah. Tidak ada penerusnya, dan build ternary 5,93 GB bukan pengganti langsung untuk yang 3,9 GB.
• Jika Anda mengevaluasi keluarga ini untuk pertama kali — tentukan dulu jejak/ukuran fisiknya, baru generasinya. Varian yang Anda butuhkan menentukan rilis mana yang sedang Anda cari, dan urutan itu adalah kebalikan dari cara peningkatan ini biasanya dijelaskan.
• Jika Anda memilih berdasarkan benchmark — anggap 95% dan 98,2% sebagai dua pengukuran yang berbeda, bukan dua titik pada satu garis, dan anggap setiap angka pada keduanya sebagai milik vendor sendiri sampai muncul evaluasi independen atas model September. Evaluasi itulah yang perlu diperhatikan, karena itu adalah yang pertama yang akan dapat membandingkan kedua generasi tersebut atas dasar yang sama.
