Kartu judul yang dihasilkan bertuliskan 'Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF' dengan subjudul 'Bit lebih sedikit, skor lebih baik', di atas tiga kartu bertuliskan 'Bit per bobot: 1,76 vs 2,2', 'Ukuran: 5,93 GB vs 7,3 GB' dan 'Rata-rata suite vendor: 83,9 vs 75,2', dengan footer bertuliskan 'Angka Bonsai dilaporkan vendor; angka IQ2_XXS menurut vendor dan pengujian komunitas.' Logo OrcaRouter berada di kanan bawah.
Engineering & Research

Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF: Bit Lebih Sedikit, Skor Lebih Baik

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ternary Bonsai 2 27B lebih kecil daripada build IQ2_XXS GGUF dari Qwen3.8-27B dan, berdasarkan angka yang diterbitkan bersamanya, juga lebih baik — yang seharusnya tidak mungkin jika yang memisahkan keduanya hanyalah anggaran bit. Versi Bonsai membawa 1,76 bit per bobot dalam berkas 5,93 GB. Kuantisasi 2-bit konvensional dari model dasar yang sama membawa kira-kira 2,2 bit per bobot dalam berkas sekitar 7,3 GB. Prism ML, yang mengumumkan versi terner pada 17 September 2026, melaporkan rata-rata 20 tolok ukur sebesar 83,9 untuk modelnya versus 75,2 untuk titik pembanding IQ2_XXS — selisih 8,7 poin yang menguntungkan model yang menggunakan lebih sedikit bit.

Pembalikan itulah inti seluruh ceritanya, dan itu bukan trik. Kedua file tersebut dihasilkan oleh proses yang berbeda pada tahap yang berbeda dalam siklus hidup model, dan perbedaan antara proses-proses itu lebih bernilai daripada perbedaan lebar bit. Ini juga perbandingan ketika saran populer — "ambil saja model kuantisasi 2-bit, sekarang sudah bagus" — berbenturan dengan contoh kontranya yang paling jelas, dan ketika contoh kontra itu didukung oleh pengukuran independen, bukan kata vendor.

Paradoksnya adalah mekanismenya.

IQ2_XXS adalah format kuantisasi pasca-pelatihan. Model dilatih hingga konvergen dalam presisi penuh, lalu setelah itu bobotnya dibulatkan ke representasi bit rendah yang dipilih oleh prosedur fitting. Model tidak pernah mendapat kesempatan untuk beradaptasi; ia diukur setelah fakta dan didekati. Keluarga i-quant menyempurnakan k-quants yang lebih lama dengan menggunakan matriks kepentingan — sebuah proses kalibrasi yang menentukan bobot mana yang layak mendapatkan lebih banyak dari presisi yang tersedia — tetapi urutan operasi dasarnya tidak berubah. Latih, lalu kompres.

Bonsai membalik urutan itu. Deskripsi Prism ML tentang metodenya sendiri adalah bahwa metode itu sepenuhnya meninggalkan kuantisasi pasca-pelatihan dan memberlakukan batasan ternary selama pelatihan: operasi maju menghitung dengan bobot yang dibatasi pada {−1, 0, +1}, sedangkan operasi mundur masih membawa gradien presisi penuh. Model ini menghabiskan pelatihannya untuk mempelajari representasi yang bertahan terhadap batasan tersebut, alih-alih batasan itu dikenakan pada representasi yang tidak pernah mengharapkannya. Algoritme ini disebut sebagai kekayaan intelektual proprietary, tetapi bentuknya akan familier bagi siapa pun yang telah membaca rangkaian karya BitNet.

Dua penyempurnaan berada di atasnya, dan keduanya terlihat dalam aritmetikanya. Yang pertama adalah presisi selektif: 26,2 juta parameter — sekitar 0,098% dari model, kira-kira 52 MB pada bf16, sebagian besar merupakan jalur keadaan rekuren dari lapisan atensi linear ditambah bobot normalisasi — dipertahankan dalam presisi penuh alih-alih diternarisasi. Yang kedua adalah rotasi per blok. Setiap matriks bobot ditransformasikan oleh rotasi Walsh–Hadamard pada ukuran blok 1.024 sebelum nilai terner dipilih, yang menyebarkan outlier di seluruh koordinat dan membuat aproksimasi tiga tingkat tidak terlalu merusak. Rotasi dilipat ke dalam bobot yang disimpan, sehingga tidak memerlukan byte tambahan; transformasi yang cocok sebagai gantinya diterapkan pada aktivasi saat runtime.

Detail terakhir itu membawa konsekuensi yang Anda jumpai saat pertama kali mencoba menjalankannya, dan itulah biaya sesungguhnya dari pendekatan ini.

IQ2_XXS yang mana yang Anda maksud, dan berapa skor sebenarnya?

Sebelum membandingkan kualitas, sebuah koreksi yang dilewatkan sebagian besar liputan: "IQ2_XXS" bukan satu artefak. Itu adalah jenis kuantisasi llama.cpp, dan jenis yang sama yang diterapkan oleh toolchain berbeda pada model dasar yang sama menghasilkan file yang berbeda secara berarti dalam ukuran dan secara substansial dalam kualitas.

Bukti publik yang paling jelas adalah perbandingan independen yang diposting pada 15 Agustus 2026 oleh seorang pengguna yang menyelidiki apakah Qwen3.8-27B sub-2-bit layak dibangun sama sekali. Tesnya adalah pengukuran divergensi KL wikitext-2, 100 potongan pada konteks 512, terhadap referensi Q8_0 yang dibangun secara lokal dengan perplexity 6.7500, dengan setiap kandidat menggunakan importance matrix, korpus, baseline, dan build llama.cpp yang sama dalam satu sesi. Hasilnya:

• unsloth UD-IQ2_XXS — 8,39 GiB, perpleksitas 7,6528, KLD rata-rata 0,146, KLD median 0,076, kesepakatan top-1 82,98%

• bartowski IQ2_XXS — 8,75 GiB, perplexity 8,5352, KLD rata-rata 0,301, KLD median 0,162, kesepakatan top-1 76,53%

Varian dinamis 0,36 GiB lebih kecildaripada varian statis dan sekitar 2,1x lebih baik pada KLD rata-rata — pada 1,13x perplexity baseline. Dua file memakai label yang sama, terpisah oleh faktor dua pada metrik yang mengukur seberapa jauh distribusi output telah bergeser. Uji yang sama menemukan setiap kandidat sub-2-bit lebih buruk daripada kedua opsi IQ2 yang dipublikasikan, itulah sebabnya batas praktis untuk model dasar ini berada di IQ2, bukan di bawahnya.

A screenshot of a Hugging Face community discussion titled 'Independent KLD benchmark: UD-IQ2_XXS beats bartowski IQ2_XXS on both size and quality', opened 15 August 2026, describing a wikitext-2 test of 100 chunks at 512 context against a locally built Q8_0 reference with perplexity 6.7500. Its table lists unsloth UD-IQ2_XXS at 8.39 GiB with perplexity 7.6528, mean KLD 0.146, median KLD 0.076 and 82.98% top-1 agreement; bartowski IQ2_XXS at 8.75 GiB with perplexity 8.5352, mean KLD 0.301, median 0.162 and 76.53%; stock IQ1_M at 7.33 GiB with mean KLD 0.659; and stock IQ1_S at 6.88 GiB with mean KLD 0.896.

Ini penting untuk perbandingan karena mengubah apa yang dimaksud dengan "build 7,3 GB IQ2_XXS". Angka Prism ML berasal dari kuantisasinya sendiri terhadap model dasar pada 2,2 bit per bobot. Build dinamis unsloth dari keluarga yang sama berukuran 8,39 GiB. Build bartowski berukuran 8,75 GiB. Jadi, selisih ukuran antara Bonsai dan "IQ2_XXS" berada di antara 1,4x dan 1,5x, bergantung pada build mana yang Anda maksud — lebih besar daripada 1,23x yang tersirat dalam headline, dan semuanya sebelum perbandingan kualitas dimulai.

Di mana build pasca-pelatihan gagal, dan mengapa hal ini mudah terlewat

Kesenjangan agregat 8,7 poin adalah cara paling tidak informatif untuk menyatakan perbedaannya, karena degradasi pada build IQ2_XXS tidak seragam. Degradasi itu bersifat selektif, dan polanya justru berlawanan dengan apa yang diperkirakan kebanyakan orang.

• MMLU-Redux — build pasca-pelatihan tetap bertahan dengan terhormat, di kisaran 80-an menengah hingga tinggi

• GPQA Diamond — sekitar 65,5, dibandingkan 85,76 untuk build ternary

• AIME26 — dalam kisaran 57,5 hingga 78,6 tergantung pada build, dibandingkan dengan 95,83 untuk build ternary

• LiveCodeBench — dalam rentang 56,4 hingga 70,05, dibandingkan dengan 90,07 untuk build ternary

Angka IQ2 yang tepat berpindah-pindah antara suite Prism ML dan pengukuran komunitas, dan rentang di atas mencakup keduanya, tetapi bentuknya konsisten di setiap sumber: pengetahuan permukaan bertahan, dan apa pun yang membutuhkan rantai penalaran yang berkelanjutan menurun tajam. Itulah tepatnya mode kegagalan yang tidak akan ditemukan oleh pengujian kasual. Minta build 2-bit merangkum dokumen atau menjawab pertanyaan faktual dan ia tampil seperti model yang jauh lebih besar. Minta ia mempertahankan derivasi multi-langkah atau menghasilkan kode non-trivial dan keruntuhannya mendadak, bukan bertahap. Inilah sebabnya "rasanya baik-baik saja ketika saya mencobanya" bukanlah bukti tentang model terkuantisasi — melainkan bukti tentang prompt yang kebetulan Anda coba.

Versi ternary tidak menunjukkan keruntuhan itu pada benchmark yang sama. Prism ML melaporkan AIME26 sebesar 95,83 berbanding 94,58 untuk basis presisi penuhnya, dan LiveCodeBench sebesar 90,07 berbanding 90,05 — praktis setara, dan klaim paling berguna dalam rilis tersebut karena menyatakan bahwa kendala saat pelatihan telah memberikan hal yang justru hilang pada kendala pasca-pelatihan.

Argumen tandingannya, yang nyata dan yang tidak ditangkap oleh tabel kualitas

Segala hal di atas lebih mengunggulkan build ternary dalam hal kualitas per byte. Ada satu dimensi yang dimenangkan secara mutlak oleh GGUF konvensional, dan itu bukan hal kecil: ia berjalan pada perangkat lunak yang sudah Anda miliki.

Build IQ2_XXS dari Qwen3.8-27B adalah artefak llama.cpp standar. Model ini dimuat di llama.cpp, Ollama, LM Studio, Jan, dan apa pun lainnya yang menautkan ggml, di setiap platform yang didukung ggml, tanpa perlu fork dan tanpa kernel khusus. Matriks kepentingannya dapat dibangun ulang atau diganti. Perilakunya sama seperti setiap model terkuantisasi lain yang ada di disk Anda.

Ternary Bonsai 2 27B tidak. Kernel ternary untuk perhatian hibrida arsitektur ini berada di fork llama.cpp milik Prism ML sendiri. llama.cpp versi stok menolak PTQ1_0 dan PQ2_0 sebagai tipe yang tidak dikenali — dan tidak tahu harus berbuat apa dengan basis terotasi yang diasumsikan oleh paket-paket tersebut. Build MLX untuk Apple Silicon memiliki kernel Metal dan CPU tetapi tidak memiliki jalur CUDA, jadi pada mesin NVIDIA ia beralih ke forward pass CPU yang bisa memakan waktu beberapa menit. Prism ML memang mencantumkan integrasi dengan beberapa runtime, tetapi poin dasarnya tetap: kegunaan model ini dibatasi oleh apakah runtime pilihan Anda sudah diajari tentangnya.

Itulah trade-off yang jujur. Anda memilih antara build yang 1,4x lebih besar, secara terukur lebih buruk tepat pada tugas-tugas yang paling mungkin menjadi alasan Anda menginginkan model 27B, dan dapat dijalankan secara universal — dan build yang lebih kecil dan lebih baik, pada ekosistem yang saat ini hanya sebatas fork satu lab ditambah runtime mana pun yang telah mengadopsinya.

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, showing the headline 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet' and the paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance while the new model retains over 98%.

Apa yang dibutuhkan untuk menjalankan salah satunya

Hitungan memorinya lebih dekat daripada yang disiratkan oleh ukuran file, karena file bukan satu-satunya hal yang ada di VRAM.

• Build IQ2_XXS — bobot 8,39 hingga 8,75 GiB, menyisakan sekitar 7,5 GB kosong pada kartu 16 GB untuk konteks dan model draf. Uji independen di atas secara khusus mencatat bahwa build 8,39 GiB sudah dapat menampung model draf 2,1 GB di sampingnya.

• Ternary Bonsai 2 27B — 5,93 GB untuk model bahasa PTQ1_0, ditambah menara visi 0,63 GB jika Anda menggunakan gambar sama sekali, ditambah konteks. Pengemasan PQ2_0 dari Prism ML memakan 7,25 GB dan merupakan opsi yang lebih cepat pada perangkat keras yang dibatasi oleh throughput instruksi, bukan bandwidth.

Soal kecepatan, angka ternary yang dilaporkan adalah 142,5 tok/s decode pada RTX 5090 dan 46,8 tok/s pada Apple M5 Max; pelaporan pihak ketiga tentang build IQ2 lebih sedikit, dengan pengukuran Vulkan pada dua kartu Radeon sekitar 3,8 tok/s untuk generasi, meskipun angka itu lebih menggambarkan backend tertentu tersebut daripada kuantisasi. Anggap angka throughput di kedua sisi sebagai sangat bergantung pada perangkat keras.

Di mana OrcaRouter cocok, dan di mana tidak

Tidak satu pun dari file ini merupakan hal yang dilayani oleh router. Keduanya adalah artefak lokal, dan penyampaian yang jujur adalah bahwa OrcaRouter tidak menghosting salah satu pun dari keduanya — ini adalah perbandingan tentang apa yang berjalan di perangkat keras Anda sendiri. Yang ada di sisi kami adalah model yang menjadi asal keduanya. Qwen3.8-27B presisi penuh tersedia melalui infrastruktur milik OrcaRouter sendiri dengan harga $0,33 per juta token input dan $2,40 per juta token output, dengan konteks native 262K milik model tersebut serta kontrol upaya penalaran rendah/sedang/tinggi yang tetap utuh.

Itu menghasilkan penyiapan hibrida yang patut dijelaskan secara konkret. Jalankan build terkompresi secara lokal untuk tugas-tugas yang memang cocok untuknya, dan arahkan permintaan sesekali yang memerlukan presisi penuh ke model dasar yang dihosting melalui kunci yang sama — tanpa kontrak vendor kedua, tanpa perubahan kode, karena kedua sisi menggunakan API yang sama. Jika build lokal ternyata salah untuk suatu beban kerja, permintaan yang gagal dapat dialihkan secara otomatis alih-alih dikembalikan sebagai error, yang merupakan cara yang lebih murah untuk menemukan bahwa kuantisasi tidak cocok daripada menemukannya di lingkungan produksi.

Versi singkatnya

• Pada kualitas per byte yang dipublikasikan, build ternary menang jelas, dan kemenangan itu terkonsentrasi pada penalaran dan kode — kategori tempat build pasca-pelatihan paling menurun.

• Dalam hal portabilitas, build IQ2_XXS menang sama jelasnya. Runtime standar di mana-mana, tanpa fork, tanpa kernel khusus, tanpa mode kegagalan sampah senyap.

• Perbandingannya bukanlah "1,76 bit versus 2,2 bit". Melainkan "representasi yang dipilih selama pelatihan versus representasi yang dicocokkan setelahnya", dan perbedaan 0,44 bit itu adalah kesalahan pembulatan yang tidak berarti dibandingkan dengan hal itu.

• Setiap angka kualitas untuk build ternary dalam artikel ini adalah pengukuran Prism ML sendiri pada rangkaian uji yang dipilih Prism ML. Hasil KLD untuk build IQ2 bersifat independen, satu kali jalan, dan spesifik untuk satu model dasar dan satu set uji; ini adalah bukti pihak ketiga terkuat dalam perbandingan ini dan tidak mengatakan apa pun tentang Bonsai.

Kesenjangan itu juga akan menutup dari arah lain, dan mungkin segera. Jika kernel terner masuk ke hulu di llama.cpp, satu keberatan serius terhadap Bonsai akan hilang dan pilihannya menjadi lugas. Sampai saat itu, build IQ2_XXS tetap memiliki keunggulan nyata yang tidak ada hubungannya dengan seberapa bagus kualitasnya.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and a description stating the model is self-hosted on OrcaRouter's own infrastructure.

Jika Anda sedang memutuskan minggu ini, uji yang menentukan hanya membutuhkan waktu satu sore: ambil dua puluh prompt dari beban kerja Anda sendiri yang memerlukan lebih dari satu langkah penalaran, jalankan kedua build, dan nilai jawabannya secara buta. Tabel-tabel yang dipublikasikan memberi tahu Anda ke mana harus melihat. Tabel-tabel itu tidak dapat memberi tahu Anda apakah pekerjaan Anda ada di sana.