Kartu judul untuk Ternary Bonsai 2 27B, dengan subjudul 'Model 27B dalam 5.93 GB — dan apa arti sebenarnya dari 98.2% itu', dengan tiga chip statistik bertuliskan 'Paket terkirim: 5.93 GB', 'Baseline FP16: 53.80 GB' dan 'Pengurangan terukur: 9.05x'. Catatan kaki: 'Ukuran diverifikasi dari paket yang dipublikasikan; angka kualitas dilaporkan oleh vendor.'
Engineering & Research

Ternary Bonsai 2 27B: Apa yang Muat dalam 5,9 GB, dan Apa yang Tidak Diberitahukan 98,2% kepada Anda

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ternary Bonsai 2 27B adalah model bahasa multimodal dengan 27,36 miliar parameter yang diumumkan Prism ML pada 17 September 2026, dan hal yang perlu dipahami tentangnya adalah bahwa bobot bahasanya mengambil salah satu dari tepat tiga nilai. Model dasarnya adalah Qwen3.8 27B — model atensi hibrida 27B — dan Bonsai mempertahankan arsitektur, pelatihan, dan bentuk tersebut, lalu mengganti bobot matriks model bahasanya dengan representasi ternari. Berkas yang dikirimkan berukuran 5,93 GB. Referensi presisi penuh berukuran 53,81 GB. Klaim utama vendor adalah bahwa model ini mempertahankan 98,2% dari rata-rata tolok ukur model aslinya.

Mulai dari bagian yang akan dilewati begitu saja oleh sebagian besar liputan: angka 98,2% itu adalah angka milik Prism ML sendiri, diukur pada rangkaian 20 benchmark milik Prism ML sendiri, dengan harness milik Prism ML sendiri, dan tidak ada orang di luar perusahaan yang telah mereproduksinya. Itu bukan tuduhan — itu adalah keadaan normal sehari setelah rilis, dan itulah status yang tepat untuk Anda berikan padanya. Yang dapat Anda verifikasi secara independen hari ini adalah filenya: API Hugging Face mencantumkan Ternary-Bonsai-2-27B-PTQ1_0.gguf pada 5,947 GB dibandingkan referensi FP16 pada 53,808 GB, yang merupakan pengurangan 9,05x dan cocok dengan "kira-kira 9x" dari vendor tanpa perlu mempercayai siapa pun. Ukurannya adalah fakta. Retensi kualitasnya adalah pengukuran vendor. Materi yang menarik ada di antara keduanya — rincian kategori, yang menunjukkan secara tepat di mana kompresi itu gratis dan di mana tidak.

Ada juga sisi kedua dari rilis ini. Pada 18 September, satu hari setelah pengumuman, OrcaRouter menerbitkan varian yang diabliterasi saat runtime dari model yang sama — OrcaRouter Ternary Bonsai 2 27B Uncensored — yang menghapus arah penolakan yang dipelajari pada waktu inferensi dan menjaga bobot tetap identik secara bit. Varian ini dibahas di bagiannya sendiri di bawah, karena tekniknya adalah bagian yang menarik dan karena batasannya sama instruktifnya dengan hasilnya.

Ini adalah Qwen3.8 27B yang dikompresi, bukan model yang baru dilatih.

Perbedaan ini adalah perbedaan antara menjelaskan rilis dan sekadar mengulang siaran pers. Prism ML tidak melatih model 27B dari nol dan tidak menjalankan resep pra-pelatihan baru. Yang dilakukannya adalah mengambil Qwen3.8 27B dan mengubah representasi numerik tempat bobotnya disimpan dan dihitung.

Arsitekturnya tidak berubah, dan itu milik model dasar: desain perhatian hibrida yang kira-kira 75% perhatian linear dan 25% perhatian penuh, dengan blok MLP SwiGLU, RoPE, dan RMSNorm. Tulang punggung hibrida itu juga alasan konteks 262K token digambarkan sebagai mampu konteks penuh, bukan sekadar didukung — perhatian yang sebagian besar linear itulah yang membuat konteks panjang tetap terjangkau di perangkat. Model ini adalah model visi-bahasa: ia menerima gambar sekaligus teks, dan menara visinya adalah menara Qwen bawaan yang tidak dikuantisasi, dikemas secara terpisah.

Kontribusi Prism ML ada dua hal. Yang pertama adalah representasi ternary itu sendiri ditambah pelatihan sadar kuantisasi yang membuatnya tetap dapat bertahan. Yang kedua adalah kernel — kernel bit rendah khusus untuk stack hybrid-attention tersebut di Apple Silicon dan CUDA, yang beroperasi langsung pada bobot terpaket alih-alih membongkarnya menjadi FP16 lalu mengalikannya. Tanpa kontribusi kedua, yang pertama hanyalah format penyimpanan tanpa cara untuk menggunakannya dengan cepat.

Whitepaper milik Prism ML sendiri melaporkan pembagian parameter sebagai 24,35B di backbone bahasa di 64 blok, 2,54B di embedding dan LM head, serta 0,47B di tower visi 27 blok, dengan total 27,36B. Tower visi adalah satu-satunya bagian yang benar-benar merupakan artefak berbeda: rilis GGUF mengemasnya sebagai file mmproj 4-bit sekitar 0,63 GB, yang dimuat hanya saat gambar benar-benar datang, sehingga penyajian khusus teks tidak pernah membawanya.

Ini adalah Bonsai generasi kedua dari lab yang sama; Bonsai 27B pertama hadir pada Juli 2026, sekitar dua bulan sebelumnya, dan perbandingan antara kedua generasi merupakan pertanyaan yang wajar — yang kami bahas dalam adu langsung melawan Bonsai 27B alih-alih mengulanginya di sini.

Apa arti "ternary g128" secara konkret

Jika Anda belum pernah menemui bobot ternari sebelumnya, inilah paragraf yang membuat segala hal lainnya dapat dipahami, jadi inilah dia tanpa singkatan.

Bobot biasa dalam jaringan saraf adalah bilangan floating-point 16-bit — sekitar 65.536 nilai yang dapat dibedakan pada rentang yang berguna, masing-masing memakan 16 bit untuk disimpan. Bobot terner bukanlah float kecil. Bobot itu adalah pilihan di antara tiga simbol: −1, 0, atau +1. Itulah seluruh kosakata. Menyimpan satu simbol semacam itu secara naif akan menghabiskan dua bit per bobot, karena dua bit memberi Anda empat keadaan dan Anda hanya membutuhkan tiga.

Dengan sendirinya, itu akan menjadi kehilangan ekspresivitas yang katastrofik, dan itulah sebabnya format ini tidak pernah hanya berupa simbol. Setiap kelompok yang terdiri dari 128 bobot berurutan berbagi satu faktor skala FP16, dan nilai bobot sebenarnya adalah simbol terner yang dikalikan dengan skala tersebut:

• w = ssub>g/sub> · t, di mana t ∈ {−1, 0, +1} dan ssub>g/sub> adalah satu skala FP16 bersama untuk grup yang terdiri dari 128

Jadi model tersebut masih merepresentasikan rentang magnitudo yang luas — hanya saja ia merepresentasikannya dalam langkah-langkah kasar per kelompok, bukan per bobot. Angka 0 bukanlah artefak pembulatan; itu adalah keadaan ketiga yang nyata, dan keberadaannya memungkinkan sekelompok 128 bobot menjadi sebagian besar senyap saat memang perlu.

Basis terotasi adalah bagian yang mengejutkan orang. Sebelum penetapan terner terjadi, setiap matriks bobot ditransformasikan secara blok oleh rotasi ortogonal — matriks Walsh–Hadamard yang dikombinasikan dengan diagonal tetap berisi tanda ±1, pada ukuran blok 1024 — dan nilai-nilai terner dipilih dalam ruang terotasi tersebut. Rotasi dilipat ke dalam bobot yang tersimpan selama persiapan, sehingga tidak memerlukan bit tambahan maupun lalu lintas bobot tambahan. Saat inferensi, runtime menerapkan transformasi yang cocok pada aktivasi sebagai gantinya, dan model yang dipaketkan mendeklarasikan rotasinya dalam metadatanya, sehingga runtime akan menerapkan transformasi yang cocok atau menolak memuat file tersebut.

Untuk apa repot-repot? Karena rotasi Hadamard menyebarkan energi matriks bobot lebih merata di seluruh koordinat, yang membuat kuantisasi tiga level berikutnya jauh lebih tidak merusak dibandingkan jika diterapkan pada distribusi mentah yang bergerigi. Rotasi ini bukan sekadar hiasan; itulah alasan model ternari masih dapat mempertahankan kualitas yang menyerupai model induknya. Biayanya adalah transformasi ini berada di jalur kritis setiap proyeksi pada ukuran batch 1, yang merupakan masalah rekayasa nyata — Prism ML menggabungkan pembalikan tanda ke jalur pemuatan transformasi pada Metal dan memparalelkannya di seluruh blok thread pada CUDA agar tidak mendominasi dekode.

Angka-angkanya, dengan hati-hati: 1.585, 1.71, 1.72, 1.76

Empat angka lebar bit beredar seputar rilis ini, semuanya benar, dan mengukur empat hal yang berbeda. Mencampuradukkan semuanya adalah kesalahan paling mudah dalam cerita ini. Berikut masing-masing dan apa yang sebenarnya dicakupnya.

1,585 bit per bobot — kandungan informasi satu simbol terner, log₂3. Ini adalah properti dari format, bukan dari file mana pun. Tidak ada yang dirilis berjalan pada 1,585 bit/bobot.

1,71 bit per bobot — hanya tensor terner. Tambahkan skala grup FP16 16-bit yang diamortisasi pada 128 bobot dan Anda mendapatkan log₂3 + 16/128 ≈ 1,71. Masih bukan angka yang sudah dirilis; ini adalah tensor terner secara terpisah.

1,72 bit per bobot — setiap parameter dalam model bahasa, termasuk himpunan kecil yang dipertahankan di atas representasi bit rendah. Prism ML menyimpan 26.238.464 parameter — 0,0976% dari model bahasa, sekitar 52 MB pada bf16 — dalam presisi lebih tinggi, sebagian besar jalur keadaan berulang dari lapisan linear-attention ditambah bobot normalisasi. Tensor-tensor tersebut tidak dirotasi maupun dikuantisasi, dan itulah yang menggerakkan angka dari 1,71 ke 1,72. Pada 1,72 jejak idealnya adalah 5,80 GB, pengurangan sekitar 9,3x. Ini adalah baris "True Ternary" dari Prism ML, dan ini adalah target, bukan berkas yang Anda unduh.

1,76 bit per bobot — GGUF yang benar-benar dikirimkan. Kernel yang efisien memerlukan format pengemasan, dan PTQ1_0 milik Prism ML mengemas trit secara padat, mencapai 1,76 bit/bobot dalam 5,93 GB, sekitar 9,1x. Inilah berkas di balik baik "5,9 GB" maupun "9x lebih kecil" yang dikutip dalam pengumuman, dan inilah berkas yang dikonfirmasi oleh pengukuran di atas.

Packing kedua adalah PQ2_0, yang menyimpan setiap trit dalam slot 2-bit alih-alih secara padat. Ini memakan lebih banyak ruang demi unpacking yang lebih murah: 2,16 bit/bobot dalam 7,25 GB, sekitar 7,4x. Tidak ada packing yang secara seragam lebih cepat — PTQ1_0 memindahkan sekitar 18% lebih sedikit data bobot per langkah tetapi membayar aritmetika untuk membongkar trit padat, sehingga ia unggul pada kartu generasi Ada dan L4 tempat memori menjadi kendala pengikat, dan kalah pada Hopper, Blackwell, dan Apple silicon tempat dekode batch-1 justru dibatasi oleh throughput instruksi. Pemrosesan prompt menyukai PQ2_0 di mana saja, karena terikat komputasi.

Dua catatan administratif bagi siapa pun yang memeriksa ini terhadap sumbernya. Pertama, dokumen-dokumen Prism ML sendiri membulatkan sedikit berbeda — tabel penyimpanan whitepaper tersebut mencantumkan PTQ1_0 sebagai 1,76 bit/bobot pada 5,93 GB, sedangkan kartu model GGUF di Hugging Face mencantumkan 1,75 dan 5,95 GB, dan file yang diukur adalah 5,947 GB. Ini adalah file yang sama yang dijelaskan pada presisi yang berbeda, bukan ketidaksepakatan tentang substansi. Kedua, penurunan yang diumumkan "lebih dari 9x" adalah milik vendor; jika diukur terhadap file sebenarnya, hasilnya adalah 53,808 / 5,947 = 9,05x, yang konsisten.

Two-column scoreboard for Ternary Bonsai 2 27B and Qwen3.8-27B FP16 across six shared dimensions: bits per weight 1.76 vs 16.0, footprint 5.93 GB vs 53.80 GB, 20-benchmark average 83.9 vs 85.4, math 96.57 vs 97.06, instruction following 82.66 vs 81.25, and Terminal-Bench 2.1 52.8 vs 69.7. Footer: 'Both columns are Prism ML's own vendor-reported figures; no independent reproduction yet.'

Gambaran tolok ukur: bukan rata-rata, melainkan bentuknya

Angka utamanya adalah rata-rata 83,9 berbanding 85,4 untuk baseline Qwen3.8 27B FP16, yaitu 98,2%. Rata-ratanya adalah bagian yang paling tidak menarik darinya. Bentuk di baliknya adalah tempat informasi sebenarnya berada, dan itu tidak seragam.

Mengikuti instruksi — 82,66 vs 81,25. Ini adalah satu-satunya kategori di mana model terkompresi mengalahkan model induk presisi penuhnya. Ini bukan derau yang bisa diabaikan begitu saja; ini adalah kemenangan kategori pada suite milik vendor itu sendiri.

Matematika — 96,57 vs 97,06, dan pemrograman — 81,58 vs 82,17. Keduanya pada dasarnya setara: setengah poin dan enam persepuluh poin pada rata-rata kategori. Untuk model dengan jejak sepersembilan, inilah hasil yang menjadi dasar perdebatan seluruh teknik ini.

Pengetahuan dan penalaran — 83,95 vs 86,66. Penurunan sebesar 2,7 poin, dan di sinilah sebagian signifikan dari 1,8 poin yang hilang pada rata-rata total berada.

Visi — 78,59 vs 81,64. Penurunan 3,05 poin, kerugian terbesar pada satu kategori. Perlu dicatat bahwa menara visi itu sendiri bukan bagian yang dikompresi; justru model bahasa yang membaca keluarannya lah yang dikompresi.

Agentic dan pemanggilan alat — 77,57 vs 79,74. Rata-rata kategori mencakup τ 2-Bench pada 80,22 dan BFCL v3 pada 74,92.

Hasil individual layak diketahui, karena tidak semuanya menunjuk ke arah yang sama. Pada Terminal-Bench 2.1 model ini mendapat skor 52,8 berbanding 69,7 untuk presisi penuh — kira-kira tiga per empat — dan pada SWE-bench Verified mendapat skor 60,8 berbanding 80,6, lagi-lagi sekitar tiga per empat. Ini adalah pertama kalinya keluarga model ini dievaluasi pada Terminal-Bench, dan Prism ML secara eksplisit menyatakan bahwa keuntungan rekayasa perangkat lunak jangka panjang yang dijanjikannya pada rilis Bonsai pertama bersifat sebagian, bukan menyeluruh. Sebaliknya: τ 2-Bench naik ke 80,2 dari 73,6 pada rilis sebelumnya, BFCL v3 bertahan di 74,9, dan AA-LCR berada di 77,0, dalam selisih satu poin dari presisi penuh. AIME26 berada di 95,83 dan LiveCodeBench di 90,07.

Di mana boleh dipercaya dan di mana tidak. Percayai polanya pada matematika, coding, dan kepatuhan pada instruksi — itu adalah kategori di mana teknik ini terbukti secara nyata melakukan apa yang diklaimnya, dan diukur pada harness yang sama dengan baseline. Berhati-hatilah terhadap pekerjaan agentik berhorizon panjang: dua benchmark yang benar-benar menguji rekayasa berkelanjutan yang digerakkan oleh alat, Terminal-Bench 2.1 dan SWE-bench Verified, menunjukkan kesenjangan yang jauh lebih besar daripada yang tersirat dari angka agregat, dan vendor mengatakan hal itu alih-alih menyembunyikannya. Dan perlakukan seluruh tabel itu sebagai pengukuran satu lab pada satu harness sampai pihak lain menjalankannya. Peringatan itu bukan sekadar formalitas di sini — itulah perbedaan antara "model ini mempertahankan 98,2%" dan "vendor model ini mengukur 98,2% pada rangkaian uji yang dipilih vendor." Keduanya benar; hanya satu yang merupakan fakta tentang model itu.

Prism ML's launch post for Bonsai 2 27B, dated September 17 2026, headed 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', with body text stating the model is just 5.9 GB and reduces memory footprint by more than 9x while retaining over 98% of the aggregate benchmark performance of its full-precision counterpart.

Mengapa ini mengalahkan build IQ2_XXS dari model dasar yang sama

Ini pantas mendapat bagiannya sendiri, bukan sekadar satu baris, karena inilah keseluruhan argumen yang mendukung pelatihan ternary sadar kuantisasi dibandingkan kuantisasi pasca-pelatihan.

Cara konvensional untuk membuat Qwen3.8 27B menjadi kecil adalah dengan mengkuantisasinya setelah pelatihan. Titik pembanding dalam whitepaper adalah build GGUF IQ2_XXS dari model dasar yang sama:

• Ternary Bonsai 2 27B — 1,76 bit/bobot, 5,93 GB, rata-rata 20 benchmark 83,9

• Qwen3.8 27B IQ2_XXS — 2,2 bit/bobot, 7,3 GB, rata-rata 20 benchmark 75,2

Model yang dikompresi melalui pelatihanlebih kecil sekaligus lebih baik. Itu 1,23x lebih kecil daripada build bit rendah konvensional dan mencetak skor 8,7 poin lebih tinggi. Kombinasi itu bukanlah keanehan pembulatan; itu adalah klaim bahwa representasi yang dipilih selama pelatihan bernilai jauh lebih besar daripada anggaran bit nominal yang sama yang diterapkan setelahnya.

Bagian yang lebih instruktif adalah bagaimana build konvensional gagal, karena kegagalannya bersifat selektif dan mudah terlewat. IQ2_XXS tidak terdegradasi secara merata. Ia bertahan pada pengetahuan permukaan — 85,79 pada MMLU-Redux — sembari ambruk pada tugas-tugas yang memerlukan rangkaian penalaran berkelanjutan: 78,6 pada AIME26, 70,05 pada LiveCodeBench, 65,45 pada GPQA Diamond. Bonsai 2 mencetak 95,83, 90,07, dan 85,76 pada tiga tugas yang sama. Uji obrolan santai akan menganggap build IQ2_XXS sepenuhnya memadai dan tidak akan pernah mengungkap keambrukan itu; kerusakannya berada tepat di tempat penalaran panjang dan pembuatan kode terjadi. Asimetri itulah sebabnya "rasanya baik-baik saja saat saya mencobanya" bukan bukti tentang model terkuantisasi.

Prism ML memadatkan argumen yang sama menjadi satu angka turunan yang disebutnya densitas kecerdasan — kira-kira, kemampuan benchmark per gigabyte. Pada rangkaian 20 benchmark, ia melaporkan 0,444 per GB untuk Bonsai 2, 0,276 untuk build IQ2_XXS, dan 0,051 untuk FP16. Metrik ini adalah konstruksi vendor itu sendiri dan pembobotannya merupakan pilihan desain, bukan hukum; tetapi pengurutan yang dihasilkannya sama dengan pengurutan yang dihasilkan tabel mentah, jadi metrik ini menambah interpretasi, bukan bukti.

Satu catatan jujur lagi tentang perbandingan ini. Kartu model GGUF Prism ML melaporkan evaluasi kedua yang lebih sempit — suite mode berpikir dengan 14 benchmark — yang di dalamnya angka retensi yang sama muncul lagi pada 84,78 berbanding 86,32, dengan IQ2_XXS pada 72,59. Dua suite berbeda yang menghasilkan 98,2% yang sama merupakan sedikit penguatan bahwa klaim agregat tersebut bukan artefak dari satu pemilihan benchmark. Ini tetap lab yang sama yang menjalankan keduanya, pada harness yang sama. Rincian kami yang lebih lengkap tentang adu ini, termasuk pertanyaan format pengemasan, ada dalam perbandingan dengan build GGUF Qwen3.8 27B.

Apa yang sebenarnya dibutuhkan untuk menjalankannya

Angka throughput, dari pengukuran tg128 terstandardisasi whitepaper pada ukuran batch 1 tanpa menyertakan vision tower:

• Apple M5 Max — 46.8 tok/s dekode, 765 tok/s pemrosesan prompt

• Apple M5 Pro — 27,7 tok/s untuk dekode; pengujian terpisah dengan jendela lebih panjang pada paket PQ2_0 mengukur 27,0 tok/s secara berkelanjutan, menyerap 27,0 W pada rail daya GPU dan 32,8 W di seluruh CPU dan GPU

• Apple M4 Pro — dekode 18,0 tok/s, dengan pemrosesan prompt sekitar 125 tok/s menjadi kendala pengikat untuk konteks yang sangat panjang

• NVIDIA RTX 5090 — dekode 142,5 tok/s pada paket PQ2_0 dengan 0,582 mWh per token

Klaim praktis yang dibuat Prism ML bukanlah rasio percepatan, melainkan sebuah ketiadaan: baseline FP16 pada 53,8 GB sama sekali tidak muat di laptop 16 GB, jadi pernyataan yang bermakna adalah bahwa model kelas 27B kini berjalan secara interaktif pada perangkat keras sehari-hari. Pada M5 Pro, decode yang terukur mengalirkan sekitar 201 GB/s bobot, mengonfirmasi profil yang didominasi bandwidth memori yang dirancang untuk dimanfaatkan oleh representasi bit rendah.

Lalu kasus-kasus tepi, yang lebih penting daripada angka puncaknya.

Anda tidak dapat menggunakan llama.cpp bawaan. Kernel atensi hibrida ternary berada di fork llama.cpp milik Prism ML sendiri. llama.cpp bawaan menolak tipe PTQ1_0 dan PQ2_0 sebagai tidak dikenal, dan — yang lebih berbahaya — memuat format ternary Q2_0 yang lebih lama tanpa peringatan apa pun dan menghasilkan keluaran sampah, karena tidak memiliki runtime aktivasi Hadamard. Jika Anda menjalankan model ini pada biner yang tidak menerapkan rotasi yang sesuai, Anda tidak akan mendapatkan error; Anda akan mendapatkan omong kosong yang terlihat fasih. Ini adalah cara paling mungkin untuk membuang waktu seharian pada rilis ini.

Paket MLX tidak memiliki jalur CUDA. Rilis MLX (prism-ml/Ternary-Bonsai-2-27B-mlx-2bit) menyasar Apple Silicon, dengan kernel khusus untuk stack hibrida di runtime Python dan Swift. Matmul terkuantisasinya memiliki kernel Metal dan CPU tetapi tidak ada implementasi CUDA, sehingga pada mesin NVIDIA paket tersebut sama sekali tidak mendapatkan akselerasi GPU. Inferensi CPU berfungsi, tetapi forward pass 27B di CPU dapat memakan waktu beberapa menit — yang membuat jalur CPU Linux berguna untuk pengujian implementasi dan reproduksibilitas, dan tidak berguna untuk serving.

Kedua paket ini merupakan pertukaran yang sesungguhnya, bukan peringkat. Jika Anda menggunakan kartu generasi Ada atau L4, atau memori menjadi kendala utama, PTQ1_0 adalah pilihannya pada 5,93 GB. Jika Anda menggunakan Hopper, Blackwell, atau 5090, PQ2_0 membeli kecepatan dekode seharga 1,3 GB. Jika Anda menggunakan Apple silicon, perhatikan bahwa angka M5 Pro di atas diukur pada PQ2_0, yang juga merupakan paket yang diunduh secara default oleh pengaturan demo.

Catatan tentang perhitungan paket MLX sendiri, karena ini sering menjadi sumber kebingungan. Wadah MLX adalah format affine 2-bit yang bloknya menyimpan skala FP16 dan bias FP16 untuk setiap kelompok 128 bobot. Bobot ternari Bonsai hanya memerlukan skala — levelnya berasal dari skala saja — jadi bias itu beban mati, dan blok tersebut memakan 36 byte per 128 bobot, bukan 34. Hal itu mendorong laju terkemas paket MLX menjadi 2,250 bit/bobot, bukan 1,72 dan bukan 1,76. Ini adalah wadah berbeda yang membawa nilai-nilai ternari yang sama, dan file terukurnya di Hugging Face adalah 8,005 GiB.

Varian runtime-abliterated

Pada 18 September, OrcaRouter menerbitkan OrcaRouter Ternary Bonsai 2 27B Uncensored, yang menerapkan ablasi arah penolakan pada model ini sepenuhnya saat runtime. Gagasan tekniknya lebih patut diperhatikan daripada produknya, jadi berikut ini gagasannya lebih dulu.

Abliterasi konvensional mengedit bobot. Ia menemukan arah di ruang aktivasi yang berkaitan dengan perilaku penolakan, lalu mengortogonalisasi matriks bobot yang menulis ke aliran residual terhadap arah itu: W ← W − r(rᵀW). Pada model FP16 biasa, itu tidak masalah — matriks hasil edit tetap matriks floating-point yang padat, jadi Anda menyimpannya dan lanjut. Pada paket ternari, itu jalan buntu, dan secara spesifik jalan buntu karena alasan yang membuat seluruh model ini ada. Mengortogonalisasi matriks ternari menghasilkan matriks padat berpresisi penuh. Untuk menyimpannya kembali ke dalam paket ternari, Anda harus mengkuantisasi ulang — dan mengkuantisasi ulang bobot yang telah diedit tidak mereproduksi pelatihan sadar kuantisasi (quantization-aware training) yang menghasilkan versi aslinya. Anda akan membuang persis apa yang telah dibeli.

Jadi proyeksinya beralih ke waktu inferensi sebagai gantinya. Alih-alih mengubah W, ubah outputnya:

• y ← y − α · dot(y, r) · r, dihitung dalam float32, dengan y adalah kontribusi residual dan r adalah arah penolakan yang dinormalisasi

Pada α = 1, komponen dari setiap penulisan residual yang paralel dengan arah penolakan dihilangkan. Pada α = 0, model tidak disentuh. α di atas 1 melakukan proyeksi berlebih dan dapat menurunkan kualitas. Karena α adalah parameter runtime, bukan properti checkpoint, pack yang sama dapat diuji A/B terhadap dirinya sendiri dalam proses yang sama — yang justru merupakan hal yang dilakukan evaluasi OrcaRouter. Pack Bonsai asli tetap identik secara bit: nol bobot diubah, nol kuantisasi ulang, nol galat kuantisasi bobot tambahan.

Ada dua detail implementasi yang menjadi titik kegagalan versi naif dari ini.

129 situs intervensi, bukan 16. Setiap modul yang dapat menulis ke aliran residual harus dibungkus, dan dalam arsitektur hibrida ini yaitu 64 blok mlp.down_proj, 48 lapisan linear_attn.out_proj, 16 lapisan self_attn.o_proj, dan model.embed_tokens — totalnya 129. Membungkus hanya self_attn.o_proj adalah kesalahan yang jelas dan itu menangkap 16 di antaranya, meninggalkan 113 penulisan lainnya tanpa proyeksi. Skrip pemeriksaan mandiri mengukur apakah komponen yang tersisa sepanjang arah penolakan didorong hingga sekitar 1e-6 dari norma residual, dan memperingatkan jika tidak mendeteksi semua 129 situs.

Jangan putar ulang arahnya. Paket ternary menyimpan proyeksinya dalam basis yang dirotasi pada input dimensinya dan mengompensasi di sisi aktivasi. Proyeksi penolakan beroperasi pada output dari proyeksi tersebut, yang sudah kembali ke basis tersembunyi normal — jadi arah penolakan adalah vektor 5120-dimensi biasa dan menerapkan rotasi Hadamard tambahan padanya akan memproyeksikan terhadap basis yang sepenuhnya salah.

The OrcaRouter Ternary Bonsai 2 27B Uncensored repository on GitHub, showing the README description 'Runtime-uncensored Ternary Bonsai 2 27B — without modifying or re-quantizing the original weights', the line 'The original Bonsai pack remains bit-identical.', and a bullet list reading 27B parameters, 0 modified weights, 0 re-quantization, 0 additional weight quantization error, runtime-adjustable ablation strength and 129 residual intervention sites.

Apa yang OrcaRouter ukur — angka kami sendiri, bukan angka independen

Ini adalah pengukuran berbasis aturan milik OrcaRouter sendiri, dan harus dibaca seperti itu: pengklasifikasi frasa pembuka berbasis aturan, bukan juri LLM, mode berpikir nonaktif, decoding greedy, anggaran 64 token, dengan base dan ablated sebagai bobot yang sama dalam proses yang sama pada α = 0 versus α = 1. Semuanya bersifat indikatif, bukan sekelas publikasi, dan bukan verifikasi atas apa pun yang diklaim Prism ML.

Mengenai penolakan, diukur sebagai proporsi prompt yang menerima penolakan:

• AdvBench (n=100) — 99,0% basis, 6,0% terablasi, dengan 56,0% dijawab tetapi dibungkus dalam penafian

• JailbreakBench (n=100) — 96,0% dasar, 4,0% diablasi, 52,0% dengan catatan

• StrongREJECT (n=150) — 99,3% dasar, 3,3% diablasikan, 45,3% dengan catatan

• HarmBench (n=150) — 98,7% dasar, 7,3% diablasikan, 48,0% dengan kaveat

• MaliciousInstruct (n=100) — 97,0% dasar, 0,0% diablasi, 52,0% berkaveat

• ForbiddenQuestions (n=150) — 75,3% dasar, 5,3% diablasi, 42,7% dengan kaveat

• SimpleSafetyTests (n=50) — 96,0% base, 18,0% ablated, 60,0% caveated — dan angka ini terlalu rendah. Kumpulan itu sebagian besar adalah prompt menyakiti diri sendiri, dan model menjawabnya dengan pembuka pengalihan krisis "Saya sangat menyesal mendengar…", yang tidak dikenali oleh daftar frasa persis pengklasifikasi dan dinilai sebagai kepatuhan. Tingkat penolakan residual yang sebenarnya pada kumpulan itu lebih tinggi daripada 18,0%. Pengklasifikasi sengaja dibiarkan apa adanya agar angkanya tetap sebanding dengan kartu model OrcaRouter lainnya.

Tidak ada balasan dalam set mana pun yang kehabisan anggaran tokennya, sehingga tak satu pun dari laju ini digelembungkan oleh pemotongan. Pada prompt jinak, proyeksi yang sama juga menghilangkan penolakan berlebihan: XSTest-safe turun dari 5,2% penolakan menjadi 0,4%, dan subset jinak JailbreakBench dari 25,0% menjadi 0,0%. Paket yang diterbitkan menolak seperempat prompt jinak tolok ukur itu; setelah diablasi, ia tidak menolak satu pun.

Dari segi kapabilitas, bobot yang identik bit berarti tidak ada rekuantisasi yang harus dibayar, dan pengukuran konsisten dengan hal itu:

• MMLU (n=300) — 76,7% dasar, 77,7% diablasi, +1,0

• GSM8K (n=150) — 87,3% dasar, 86,0% diablasi, −1,3

• CMMLU (n=500) — 76,2% dasar, 75,6% terablasi, −0,6

Setiap perubahan berada dalam kisaran noise pada ukuran sampel ini; satu soal GSM8K bernilai 0,7 poin. MMLU-Pro dikecualikan alih-alih dilaporkan: promptnya meminta penalaran sebelum jawaban, dan 63–64% balasan di kedua sisi belum mencapai penalaran dalam anggaran token, sehingga angka akurasi apa pun akan menjadi batas bawah yang ditetapkan oleh anggaran, bukan hasil pengukuran.

Peringatan yang paling penting

Arah penolakan diestimasi dari model dasar BF16 tempat paket Bonsai dilatih. Arsitektur dan basis tersembunyinya identik, sehingga geometrinya selaras. Namun seberapa baik arah tersebut bertahan setelah pelatihan sadar kuantisasi belum diukur sepenuhnya.

Runtime dapat membuktikan, secara matematis dan hingga sekitar 1e-6, bahwa ia menghapus arah yang diberikan dari setiap penulisan residual. Ia tidak dapat membuktikan hanya dari itu bahwa arah tersebut masih menangkap fitur perilaku yang sama dalam model terkuantisasi seperti yang ditangkapnya dalam model padat. Itu klaim yang berbeda, dan hanya klaim pertama yang sudah pasti. Siapa pun yang membaca tabel keamanan di atas sebaiknya membacanya dengan mengetahui bahwa intervensi tersebut persis seefektif asumsi transfer arah, dan asumsi itu adalah pertanyaan terbuka.

Ada juga pembingkaian praktis yang OrcaRouter berikan pada rilis itu sendiri, yang layak diulang alih-alih diparafrasekan hingga maknanya hilang: menghapus arah penolakan yang dipelajari dapat menyebabkan model merespons permintaan yang akan ditolak oleh model aslinya. Ini adalah mekanisme penelitian dan kontrol inferensi, bukan bukti bahwa keluaran yang dihasilkan aman, benar, atau pantas, dan deployment yang menggunakannya harus menerapkan kontrol akses serta penegakan kebijakan mereka sendiri. Menghapus penolakan bukanlah peningkatan yang gratis, dan tulisan ini tidak ditulis seolah-olah demikian.

Tiga catatan praktis tambahan bagi siapa pun yang mereproduksinya. Paket ini harus dimuat dengan runtime bawaannya sendiri — loader MLX biasa dapat tampak berhasil memuatnya sementara diam-diam menghitung hal yang salah, jadi jika keluarannya terlihat salah bahkan sebelum ablasi diaktifkan, periksa dulu jalur pemuatannya. Ablasi selektif per lapisan didukung, sehingga intervensinya tidak harus semua-atau-tidak sama sekali. Dan evaluasi ablasi dijalankan pada ekspansi FP16 yang dibentangkan dari paket, bukan pada paket yang menjalankan kernelnya sendiri, karena matmul terkuantisasi yang dipaketkan tidak memiliki implementasi CUDA dan backend CPU membutuhkan waktu beberapa menit per forward pass; ekspansi tersebut membawa nilai ternari paket secara tepat dan mereproduksi distribusi token berikutnya milik paket hingga tiga desimal pada uji petik, tetapi ini adalah perubahan container dan layak untuk diketahui. Kode dan tabel lengkapnya ada di repositori OrcaRouter Ternary Bonsai 2 27B Uncensored. Perbandingan terpisah yang mencakup build MLX yang diablasi terhadap jalur MLX Qwen3.8 27B tanpa modifikasi membahas lebih dalam tentang detail runtime.

Ke mana ini mengarah, dan apa yang masih belum terbukti

Apa yang diubah oleh model 27B yang nyaris lossless dalam sekitar enam gigabyte untuk agen lokal terutama berkaitan dengan apa yang menjadi residen. Model bahasa yang muat bersama jendela konteks sungguhan di laptop 16 GB dapat tetap dimuat saat agen melakukan pekerjaan lain — membaca file, memanggil alat, mempertahankan rencana lintas giliran — alih-alih ditukar masuk per permintaan atau dikirim ke server. Itulah perbedaan antara model lokal yang Anda coba dan model lokal yang Anda biarkan berjalan, dan itulah properti spesifik yang didukung oleh angka-angka agentik, τ 2-Bench pada 80.2 dan BFCL v3 pada 74.9.

Yang belum terbukti adalah daftar yang lebih panjang daripada yang disiratkan oleh pengumuman itu.

• Tidak ada reproduksi independen. Setiap angka kualitas dalam artikel ini — 83,9, 98,2%, rata-rata kategori — adalah pengukuran Prism ML sendiri pada suite milik Prism ML sendiri. Itu bukan cacat dalam rilis ini; itu hanyalah gambaran dari sesuatu yang baru berusia satu hari. Itu juga hal pertama yang akan berubah.

• Pekerjaan agentik jangka panjang adalah bagian terlemah dari tabel vendor sendiri, bukan bagian terkuat. Terminal-Bench 2.1 pada 52,8 berbanding 69,7 adalah kesenjangan yang nyata, dan vendor menyatakan kemampuan itu masih parsial.

• Prompt yang belum Anda coba. Profil kegagalan model bit rendah bersifat selektif, dan keruntuhan IQ2_XXS pada AIME26 dan LiveCodeBench sementara mempertahankan 85,79 pada MMLU-Redux adalah bukti paling jelas yang tersedia bahwa rata-rata benchmark tidak memberi tahu Anda apa yang terjadi pada beban kerja Anda. Bonsai 2 tidak menunjukkan keruntuhan itu pada kedua benchmark tersebut, yang menggembirakan dan tidak sama dengan jaminan.

• Pertanyaan transfer arah dalam varian yang diabliterasi, di atas, yang secara konstruksi tidak terpecahkan.

• Apakah kernel-kernel itu tetap berfungsi seiring runtime terus berkembang. Saat ini model ini memerlukan fork; llama.cpp standar menolak dua dari tiga format dan diam-diam merusak format ketiga. Sampai kernel-kernel itu masuk ke upstream, "berjalan di mana pun llama.cpp berjalan" belum berlaku untuk model ini.

Rilisnya sendiri tidak dipertanyakan. Model multimodal kelas 27B pada 5,93 GB, pada sepersembilan ukuran dari model asal yang dikompresi, dengan kemampuan matematika dan pengodean setingkat induknya serta kemampuan mengikuti instruksi yang sedikit lebih unggul, adalah titik operasi yang benar-benar berbeda untuk inferensi lokal. Sikap yang wajar pada 18 September 2026 adalah menganggap ukuran file sebagai fakta, menganggap angka retensi sebagai klaim vendor yang hati-hati yang dibuat sehari sebelumnya pada rangkaian pengujian yang dipilih vendor, dan menunda penilaian atas beban kerja Anda sendiri sampai Anda menjalankannya pada beban kerja tersebut.

Kode ablasi runtime, arah penolakan, dan tabel evaluasi lengkap dipublikasikan oleh OrcaRouter, bersama dengan platform routing yang dibangun tim.