
Ternary Bonsai 2 27B vs Qwen3.8-27B: Apa yang Sebenarnya Didapatkan dari 47,9 Gigabita Presisi
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B dan Qwen3.8-27B adalah model yang sama dalam dua dunia numerik. Keduanya berbagi arsitektur, tokenizer, garis keturunan pelatihan, dan jendela konteks 262.144 token. Yang membedakan keduanya adalah bagaimana bobot dituliskan: Qwen3.8-27B menyimpan masing-masingnya sebagai float 16-bit dan menempati 53,81 GB dalam bentuk referensi FP16-nya, sedangkan Ternary Bonsai 2 27B menyimpan masing-masingnya sebagai salah satu dari tiga simbol dan menempati 5,93 GB. Prism ML mengumumkan build terkompresi tersebut pada 17 September 2026 dan menempatkannya di Hugging Face di bawah Apache 2.0; bobot asli Qwen3.8-27B diterbitkan pada 13 Agustus 2026, juga di bawah Apache 2.0.
Perbandingan yang penting bukanlah mana yang lebih baik. Yang penting adalah berapa biaya yang harus Anda tanggung akibat 47,9 GB yang hilang, dan jawaban jujurnya lebih sempit dan lebih spesifik daripada yang akan dikatakan oleh kubu mana pun. Prism ML melaporkan bahwa build-nya mempertahankan 98,2% dari rata-rata model presisi penuh di seluruh rangkaian 20 benchmark — 83,9 berbanding 85,4. Angka itu milik vendor sendiri, diukur pada harness milik vendor sendiri, dan sehari setelah rilis tidak ada pihak di luar Prism ML yang mereproduksinya. Agregatnya juga menyembunyikan bagian yang sebenarnya harus Anda pedulikan, karena 1,8 poin itu tidak terdistribusi secara merata. Pada dua benchmark yang menguji rekayasa perangkat lunak secara berkelanjutan, selisihnya bukan 1,8% — melainkan lebih dekat ke 25%.
Jaringan yang sama, dituliskan dengan cara berbeda
Mulailah dari apa yang tidak disentuh oleh kompresi, karena itulah alasan perbandingan ini bisa menarik. Jumlah layer, ukuran tersembunyi, kosakata, pola atensi, dan menara visi adalah milik model dasar. Qwen3.8-27B adalah desain atensi hibrida: 48 lapisan atensi linear Gated DeltaNet yang diselang-seling dengan 16 lapisan atensi penuh, pembagian sekitar 3:1, pada 64 lapisan dengan ukuran tersembunyi 5.120 dan kosakata 248.320 token. Tulang punggung yang sebagian besar linear itulah yang membuat konteks 262K terjangkau sejak awal, dan itulah properti yang diwarisi Bonsai tanpa perubahan.
Apa yang diubah Prism ML adalah representasi matriks model bahasa, ditambah kernel yang diperlukan untuk melakukan komputasi padanya. Whitepaper-nya membagi 27,36B parameter menjadi 24,35B di tulang punggung bahasa di 64 blok, 2,54B di embedding dan LM head, serta 0,47B di menara visi 27 blok. Menara visi dikirim sebagai file mmproj 4-bit terpisah berukuran sekitar 0,63 GB dan hanya dimuat saat gambar benar-benar tiba, sehingga penerapan hanya teks tidak pernah membayarnya.
Konsekuensi praktis dari desain yang sebagian besar linier itu layak diangkat sebelum diskusi benchmark apa pun. Karena arsitekturnya bukan transformer konvensional, kernel bit-rendah harus ditulis khusus untuknya. llama.cpp bawaan menolak kedua packing milik Prism ML sebagai tipe yang tidak dikenal — dan, yang lebih berbahaya, memuat format ternari yang lebih lama tanpa mengeluh dan menghasilkan omong kosong yang lancar, karena tidak ada rotasi yang cocok yang diterapkan pada aktivasi. Jika Anda menjalankan model ini pada biner yang tidak mengenalinya, Anda tidak akan mendapatkan error. Anda akan mendapatkan keluaran yang salah namun tampak meyakinkan.
Perbandingannya, kategori demi kategori
Berikut adalah rincian 20 benchmark dari vendor, dengan basis presisi penuh sebagai referensi. Setiap angka dalam daftar ini milik Prism ML; tidak ada satu pun yang diverifikasi secara independen.
• Matematika — 96,57 untuk Ternary Bonsai 2 27B vs 97,06 untuk Qwen3.8-27B. Praktis setara.
• Coding — 81.58 vs 82.17. Juga berdekatan, dan merupakan kategori yang menjadi bahan perdebatan seluruh teknik ini.
• Kepatuhan terhadap instruksi — 82.66 vs 81.25. Model yang dikompresi unggul di sini, yang merupakan satu-satunya baris dalam tabel yang benar-benar mengejutkan.
• Pengetahuan dan penalaran — 83,95 vs 86,66. Penurunan 2,7 poin, dan kontributor tunggal terbesar terhadap 1,8 poin yang hilang.
• Agentic dan pemanggilan alat — 77.57 vs 79.74, mencakup τ2-Bench pada 80.22 dan BFCL v3 pada 74.92.
• Vision — 78.59 vs 81.64, penurunan kategori terbesar. Perhatikan bahwa vision tower itu sendiri bukan bagian yang dikompresi; model bahasa yang membaca outputnya-lah yang dikompresi.

Baca bentuknya, bukan rata-ratanya, dan cerita yang lebih jelas pun muncul. Kompresi hampir gratis untuk matematika, pemrograman, dan mengikuti instruksi, serta mahal untuk pengetahuan dan visi. Itu kebalikan dari anggapan umum tentang model bit-rendah, yang menyatakan bahwa pengetahuan permukaan bertahan dan penalaran runtuh. Di sini, justru pengetahuan yang terkikis dan penalaran yang bertahan.
Di mana 1,8 poin itu sebenarnya berada
Agregatnya adalah rata-rata dari dua puluh benchmark, dan rata-rata adalah tempat celah bersembunyi. Tarik keluar hasil individualnya, dan dua di antaranya jauh lebih buruk daripada yang tersirat oleh rata-rata.
• Terminal-Bench 2.1 — 52,8 untuk build ternary dibandingkan 69,7 untuk presisi penuh
• SWE-bench Verified — 60,8 dibandingkan 80,6
Keduanya berada di sekitar tiga perempat skor presisi penuh. Sebaliknya, AIME26 mencatat 95,83, LiveCodeBench 90,07, dan AA-LCR 77,0 — hanya berselisih satu poin dari model yang tidak dikompresi. Ini adalah pertama kalinya keluarga Bonsai dievaluasi pada Terminal-Bench sama sekali, dan Prism ML secara eksplisit menyatakan dalam materinya sendiri bahwa kemampuan rekayasa perangkat lunak jangka panjang yang dijanjikannya pada generasi pertama baru terpenuhi sebagian, bukan sepenuhnya.
Jadi pertanyaan praktisnya bukanlah "apakah model ini mempertahankan 98,2%" melainkan "berapa beban kerja saya". Jika Anda menjalankan agen coding yang mempertahankan rencana di sepanjang puluhan panggilan alat dan mengedit file selama beberapa menit, Anda berada dalam kategori dengan selisih 25%, dan angka agregatnya justru menyesatkan. Jika Anda mengerjakan matematika, pembuatan kode satu giliran, ekstraksi, klasifikasi, atau obrolan, Anda berada dalam kategori yang selisihnya hilang karena pembulatan. Hal paling berguna dari tabel milik vendor itu sendiri adalah tabel itu memungkinkan Anda membuat pembedaan tersebut alih-alih menebak.
Apa yang sebenarnya dibutuhkan masing-masing untuk berjalan
Kisah perangkat kerasnya kurang simetris daripada yang disiratkan oleh rasio ukuran. Model FP16 53,81 GB sama sekali tidak muat di laptop 16 GB, sehingga perbandingannya bukan lagi "lebih cepat versus lebih lambat", melainkan "mungkin versus tidak". Pengukuran terstandardisasi Prism ML pada ukuran batch 1, dengan vision tower dikecualikan:
• NVIDIA RTX 5090 — 142,5 tok/s dekode pada packing PQ2_0, dengan 0,582 mWh per token
• Apple M5 Max — 46,8 tok/s dekode, dengan pemrosesan prompt sekitar 765 tok/s
• Apple M5 Pro — 27,7 tok/s dekode
• Apple M4 Pro — dekode 18,0 tok/s, dengan pemrosesan prompt mendekati 125 tok/s menjadi kendala yang mengikat pada konteks yang sangat panjang
Peringatan pentingnya adalah tidak ada satu pun dari ini yang merupakan satu biner tunggal. Pengemasan PTQ1_0 memberi Anda 5,93 GB pada 1,76 bit per bobot; PQ2_0 memakan 7,25 GB pada 2,16 bit per bobot dan memberikan kecepatan dekode pada perangkat keras yang batasnya adalah throughput instruksi, bukan bandwidth memori. Build MLX untuk Apple Silicon adalah artefak ketiga dengan perhitungannya sendiri — kontainer affine 2-bit yang menyimpan bias yang tidak dibutuhkan oleh bobot ternary, mencapai 2,25 bit per bobot dan 8,005 GiB di disk, dengan kernel Metal dan CPU tetapi tanpa jalur CUDA. "Ini berjalan dalam 5,9 GB" hanya benar untuk tepat satu dari file-file itu pada runtime yang benar-benar tepat.
Perbandingan biaya, disampaikan secara jujur
Ada dua cara untuk membayar Qwen3.8-27B dan hanya satu cara untuk membayar saudara terkompresinya. Ternary Bonsai 2 27B adalah unduhan: Apache 2.0, perangkat keras Anda sendiri, tanpa meteran. Qwen3.8-27B adalah unduhan sekaligus layanan terkelola, dan jika Anda mengambil jalur terkelola, angka yang relevan adalah angka di halaman model — $0,33 per juta token masukan dan $2,40 per juta token keluaran, dilayani dari infrastruktur milik OrcaRouter sendiri alih-alih dijual kembali dari milik pihak lain.
Di situlah OrcaRouter memperoleh tempat dalam perbandingan ini, bukan sekadar catatan kaki. Build Qwen3.8-27B yang dirutekan membawa konteks 262K yang sama, menerima teks, gambar, dan video, serta mengekspos kontrol upaya penalaran yang disertakan bersama model. Ia berada di balik kunci yang sama dengan 200+ model lain tanpa markup di atas harga daftar penyedia, yang lebih penting daripada kedengarannya: karena harga daftar diteruskan, bukan dijual ulang, perubahan harga vendor muncul di sini pada hari yang sama alih-alih pada pembaruan kontrak berikutnya. Bagi tim yang menginginkan basis presisi penuh sebagai tingkat eskalasi di atas Bonsai lokal, itu satu endpoint dan satu kunci, bukan dua hubungan vendor.

Yang mana yang harus dipilih
Keputusan ini sebagian besar tentang di mana pekerjaan itu dilakukan, bukan tentang model mana yang lebih baik, karena pada sebagian besar tugas keduanya adalah model yang sama.
• Pilih Qwen3.8-27B presisi penuh ketika tugasnya berjangka panjang dan bersifat agentik, ketika Anda sedang mengevaluasi atau melakukan fine-tuning, ketika Anda membutuhkan konteks YaRN 1M token, atau ketika akurasi visi sangat menentukan. Angka Terminal-Bench dan SWE-bench adalah alasannya.
• Pilih Ternary Bonsai 2 27B ketika pekerjaan harus dilakukan pada perangkat keras yang Anda miliki, ketika alternatifnya adalah tidak menjalankan model 27B sama sekali, atau ketika beban kerjanya adalah matematika, pemrograman, ekstraksi, atau penalaran tanpa alat yang kategori-kategorinya setara.
• Jangan memilih berdasarkan agregat. 83.9 dan 85.4 cukup berdekatan sehingga satu penukaran benchmark saja dapat mengubah urutan keduanya, dan hanya satu dari kedua angka tersebut yang diverifikasi secara independen.
Yang benar-benar baru di sini bukanlah bahwa model 27B muat dalam enam gigabita — generasi Bonsai pertama sudah melakukannya pada Juli. Melainkan bahwa kemampuan mengikuti instruksi tampil lebih unggul daripada model induknya dan bahwa matematika serta pengodean tampil setara, yang merupakan klaim berbeda dari "kecil untuk ukurannya". Apakah itu bertahan pada beban kerja Anda justru adalah hal yang tidak bisa diberitahukan oleh usia satu hari, dan evaluasi independen pertama atas model ini adalah hasil yang layak ditunggu.

Jika Anda ingin menjalankan perbandingan pada prompt Anda sendiri alih-alih pada rangkaian benchmark, jalur tercepat adalah memanggil Qwen3.8-27B yang di-hosting melalui satu endpoint dan menjalankan build ternary secara lokal, lalu membandingkan output pada tugas-tugas yang benar-benar Anda miliki. Itu pekerjaan satu pagi dan akan memberi tahu Anda lebih banyak tentang 1,8 poin itu daripada tabel apa pun yang dipublikasikan.
