Kartu judul hero bertuliskan 'Intern-Decision-0.8B vs Gemma 4 12B' dengan subjudul 'Yang satu menulis jawaban, yang lain menilainya', membawa lencana 'head penilaian 0,8B, tanpa token keluaran' dan 'generalis multimodal 11,95B', dengan logo OrcaRouter dikompositkan di sudut.
Guides & Insights

Intern-Decision-0.8B vs Gemma 4 12B: Kepala Pemberi Skor Melawan Generalis Multimodal

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Cara termurah untuk melihat apa itu Intern-Decision-0.8B — dan apa yang bukan — adalah dengan menempatkannya di samping Gemma 4 12B, lalu menyadari bahwa perbandingannya hampir seluruhnya tentang apa yang dilakukan masing-masing model dengan lapisan outputnya. Gemma 4 12B, model multimodal tanpa encoder milik DeepMind dengan 11,95 miliar parameter yang dirilis pada 3 Juni 2026 di bawah Apache 2.0, adalah generalis generatif: Anda memberinya teks, gambar, audio, atau video, dan ia menulis jawaban. Intern-Decision-0.8B, yang diunggah secara diam-diam oleh InternLM ke Hugging Face pada 26 September 2026 tanpa pengumuman, adalah fine-tune dari Qwen3.5-0.8B yang jauh lebih kecil yang tidak menghasilkan teks sama sekali — ia menerima sebuah state, skema pertanyaan bernama, dan hingga delapan gambar, lalu mengembalikan distribusi probabilitas terkalibrasi untuk setiap pertanyaan setelah satu forward pass. Yang satu menulis. Yang lain menilai. Semua yang di bawah ini mengikuti dari itu.

Itu membuat ini menjadi pertandingan yang aneh untuk dibingkai sebagai kontes, dan layak dikatakan terus terang sebelum baris-baris spesifikasi: keduanya bukan pengganti satu sama lain, dan siapa pun yang memilih di antara keduanya sudah salah merumuskan masalahnya. Gemma 4 12B menjawab pertanyaan "bagaimana responsnya seharusnya." Intern-Decision-0.8B menjawab pertanyaan "yang mana dari enam belas opsi ini, dan seberapa yakin Anda" — dan menjawabnya tanpa loop decoder, yang menjadi asal perbedaan latensi dan biayanya. Perbandingan yang berguna karena itu adalah tentang bagaimana Anda akan merangkai masing-masing ke dalam satu alur kerja, bukan tentang mana yang menang.

Perbedaan tunggal terbesar adalah sisi keluaran dari tagihan tersebut.

Gemma 4 12B ditagih seperti model generatif mana pun: token input dan token output, keduanya. Saat Anda memintanya menghasilkan JSON terstruktur, setiap token tersebut dihasilkan, disampel, dan ditagih, dan semakin panjang serta semakin bersarang skema Anda, semakin banyak token yang ada. Itu bukan kritik terhadap model — itulah yang dilakukan decoder — tetapi itulah pos biaya yang ada untuk dihilangkan oleh decision head. Intern-Decision-0.8B tidak memiliki token output. Kartunya menjelaskan secara eksplisit alasannya: jalur inferensi tidak pernah memanggil generate()/, membaca logits pada posisi tepat sebelum setiap <decision>/ placeholder dalam skeleton yang telah dirender sebelumnya dan mengambil softmax hanya atas simbol kandidat yang diizinkan untuk bidang tersebut. Penghitung penggunaan yang disebut output_tokens/ menghitung bidang yang dinilai, bukan teks.

Konsekuensinya berlipat ganda pada skala. Pipeline yang melabeli sepuluh ribu catatan dengan Gemma 4 12B membayar untuk sepuluh ribu dokumen JSON; pipeline yang sama dengan Intern-Decision-0.8B membayar untuk prompt dan tidak untuk yang lain. Apakah angka absolutnya besar sepenuhnya bergantung pada volume dan skema Anda, dan siapa pun yang memiliki anggaran per token dapat menghitungnya di spreadsheet dalam sepuluh menit. Tetapi arahnya tidak diperdebatkan, dan itulah alasan sebuah kategori model keputusan kecil muncul sama sekali.

Latensi, dan mengapa kesenjangan parameter menyesatkan

• Model throughput — Intern-Decision-0.8B: satu forward pass, tanpa loop decoding. Gemma 4 12B: generasi autoregresif, satu token pada satu waktu.

• Latensi terukur — Intern-Decision-0.8B: rata-rata 33,98 ms / p95 37,50 ms pada satu RTX 4090 melalui jalur Hugging Face lokal, menurut pengukuran InternLM sendiri. Gemma 4 12B: tidak ada angka single-pass yang sebanding, karena tidak ada single-pass untuk diukur.

• Jejak — Intern-Decision-0.8B: sekitar 1,73 GB penyimpanan repositori, 852.985.920 parameter yang tersebar di shard bahasa 1,50 GB, shard visi 176 MB, dan proyektor 25 MB. Gemma 4 12B: materi peluncuran Google menempatkannya pada 16 GB VRAM atau memori terpadu.

• Determinisme output — Intern-Decision-0.8B: argmax atas logits kandidat, sehingga input yang sama menghasilkan label yang sama setiap kali. Gemma 4 12B: sampling kecuali Anda menyetel temperature ke nol, dan bahkan dalam kasus itu, label datang sebagai teks yang harus Anda parse.

Kesenjangan parameter 14x antara kedua model ini tidak berujung pada kesenjangan waktu eksekusi 14x pada tugas pengambilan keputusan, karena jenis pekerjaannya berbeda. Intern-Decision-0.8B menghabiskan satu lintasannya untuk membaca prompt — state, skema, deskripsi opsi — lalu berhenti. Gemma 4 12B menghabiskan pembacaan prompt yang sama, lalu menambahkan setiap token jawaban di atasnya. Untuk skema enam belas kolom dengan label opsi yang deskriptif, tahap generasi bukanlah kesalahan pembulatan; itu adalah sebagian besar dari total waktu berjalan. Tabel milik InternLM sendiri justru menegaskan hal ini secara tidak sengaja: varian 2B-nya mencatat rata-rata 33,28 ms, sedikit lebih cepat daripada 33,98 ms milik si 0.8B. Ketika pemrosesan prompt mendominasi, jumlah parameter tidak lagi menjadi faktor penentu.img src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

Di mana Gemma 4 12B hanya berada di kategori yang berbeda

Tidak jujur jika membiarkan lembar spesifikasi tetap berada pada kerangka tugas keputusan, karena di luar kerangka itu Gemma 4 12B bukan sekadar unggul — ia bermain di cabang olahraga yang berbeda.

Intern-Decision-0.8B menerima teks plus hingga delapan gambar, dan itulah keseluruhan permukaan masukannya. Batas atas masukan bawaannya adalah 8.192 token, ditolak alih-alih dipotong, yang jauh di bawah 262.144 penyematan posisi maksimum yang diiklankan konfigurasinya — batas atas, bukan arsitekturnya, yang menjadi jendela praktisnya. Gemma 4 12B menerima teks, gambar, audio, dan video secara native melalui desain tanpa encoder yang memproyeksikan patch dan bentuk gelombang mentah langsung ke ruang penyematan, menampung jendela konteks 256K, dan mengembalikan teks. Kartu terbitan Google memberi skor 77,2% pada MMLU Pro, 77,5% pada AIME 2026 tanpa alat, 72,0% pada LiveCodeBench v6, 78,8% pada GPQA Diamond, 69,1% pada MMMU Pro dan 79,7% pada MATH-Vision. Itu adalah angka vendor dari kartu evaluasi Google sendiri, dan tidak seperti tabel Intern-Decision-0.8B, angka-angka itu telah didukung oleh setahun penggunaan pihak ketiga, karena Gemma 4 dirilis ke dalam ekosistem — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — pada hari pertama.

Rilis-rilis itu juga sama sekali tidak mirip, dan kontrasnya memberi pelajaran. Gemma 4 12B memiliki blog peluncuran, laporan teknis di arXiv, halaman keluarga lima model, kartu evaluasi, dan tautan unduhan pada hari kemunculannya. Intern-Decision-0.8B memiliki kartu model dengan URL GitHub yang mengembalikan 404 dan demo Space yang mengembalikan 401, dan ia muncul dalam empat puluh detik setelah dua model saudara yang lebih besar yang sama-sama tidak terdokumentasi. Salah satunya adalah produk. Yang lainnya adalah checkpoint yang seseorang memutuskan untuk ditaruh di internet.

Keduanya adalah Apache 2.0, dan itu bukan baris bersama yang sepele

Satu-satunya dimensi tempat keduanya benar-benar bertemu adalah lisensi, dan ini layak mendapat satu paragraf karena di sinilah keputusan berubah bagi pengguna komersial. Keduanya Apache 2.0. Gemma 4 12B dirilis di bawah ketentuan lisensi Gemma 4 yang dihosting di Google, yang oleh kartu model diidentifikasi sebagai Apache 2.0; Intern-Decision-0.8B membawa Apache-2.0 bersama LICENSE-QWEN/ berkas kedua, yang merupakan penanganan yang tepat untuk model yang diturunkan dari bobot Qwen dan menjadi tanda bahwa InternLM mengurus dokumennya bahkan untuk rilis yang tidak diumumkannya.

Itu membedakan keduanya dari keluarga LFM2.5 milik Liquid AI, yang lisensi LFM Open License v1.0-nya mensyaratkan hak komersial agar badan hukum Anda tetap berada di bawah ambang pendapatan tahunan $10 juta — sebuah batasan nyata yang harus dibaca oleh pembeli model keputusan yang membandingkan opsi sebelum menganggap "bobot terbuka" berarti hal yang sama di mana-mana. Jika kasus penggunaan Anda bersifat komersial dan pendapatan Anda melewati garis itu, Apache 2.0 dan lisensi LFM tidak dapat dipertukarkan, dan baik Gemma 4 12B maupun Intern-Decision-0.8B tidak membawa pembatasan tersebut.

Catatan jujur tentang angka-angka Intern-Decision-0.8B

Setiap angka performa untuk Intern-Decision-0.8B dilaporkan oleh vendor dan tidak direproduksi. Ini bukan sekadar formalitas — inilah keadaan bukti saat ini, dan hal itu semestinya menentukan seberapa besar bobot yang layak diberikan pada tabel tersebut. InternLM memilih tolok ukurnya, memilih pesaingnya, menjalankan evaluasinya, dan menerbitkan hasilnya, serta tidak ada pengujian independen di papan peringkat publik mana pun. Pencarian Artificial Analysis untuk model ini tidak mengembalikan apa pun sama sekali. img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Dengan label itu melekat, bentuk hasilnya tetap informatif. Model 0.8B mencatat 77.35 pada benchmark Typed Decision milik TypeSafe dibandingkan 73.35 untuk Jev 1.13 — model yang menjadi asal nama benchmark tersebut — dan 94.52 pada ToolACE dibandingkan 91.29. Rata-ratanya 79.38 di seluruh suite, dengan saudara 2B dan 4B-nya sendiri pada 84.68 dan 90.02. Kolom yang seharusnya membuat pembeli ragu adalah WildJailBreak, tempat model ini mencetak 64.48 dibandingkan 96.29 milik Jev: celah ketangguhan penolakan sebesar itu adalah properti dari fine-tune, dan apakah itu berasal dari basis Qwen3.5-0.8B, objektif penyetelan keputusan, atau jumlah parameter tidak didokumentasikan di mana pun. Profil kalibrasinya adalah bacaan yang lebih menarik — Brier 0.530 dan kesalahan kalibrasi yang diharapkan 0.066, dibandingkan 0.358 dan 0.095 milik Jev — yang berarti model ini secara keseluruhan kurang akurat, tetapi keyakinan yang dinyatakannya mengikuti akurasinya lebih dekat. Untuk alur kerja berbasis ambang batas, perbedaan itu lebih penting daripada akurasi mentah, dan itulah jenis hal yang tidak punya insentif untuk diterbitkan oleh InternLM.

Sebaliknya, kartu evaluasi Gemma 4 12B juga dilaporkan vendor — Google juga menjalankan benchmark tersebut — tetapi sudah ada di dunia sejak Juni, telah di-deploy melalui setiap runtime lokal utama, dan ketidaksesuaian apa pun pasti sudah muncul. Kesenjangan bukti antara "belum direproduksi selama seminggu" dan "belum direproduksi selama empat bulan dan tidak ada yang membantahnya" adalah perbedaan sesungguhnya antara kedua kolom ini.

Bagaimana Anda sebenarnya akan menggabungkannya

Pola yang masuk akal bukanlah soal pilihan. Head keputusan menangani pemanggilan terstruktur — perutean, triase, klasifikasi, penskoran berdasarkan rubrik — yang di dalamnya himpunan jawabannya tertutup, latensi penting, dan token keluaran murni overhead. Generalis menangani segala hal yang membutuhkan prosa, kode, sintesis, atau konteks panjang: ringkasan eskalasi, penjelasan mengapa tiket dialihkan ke penagihan, draf yang disunting manusia.

Jika Anda sedang mencari tahu di mana batasnya berada, eksperimen termurah adalah menempatkan kedua bagian di belakang satu endpoint. OrcaRouter merutekan 200+ model melalui satu API yang kompatibel dengan OpenAI dengan failover otomatis dan harga daftar penyedia diteruskan tanpa markup, yang berarti menguji model keputusan terkelola dan model generalis terkelola dalam skrip yang sama hanya membutuhkan satu kunci dan satu sore. Ada baiknya kita tepat soal satu batas di sini: Intern-Decision-0.8B bukan salah satu milik kami — itu adalah checkpoint Apache-2.0 yang Anda unduh dan jalankan sendiri, dan alasan utama memilih model 1,73 GB adalah karena ia berada di tempat data Anda sudah berada. Bagian generatif dari pola ini adalah bagian yang tinggal satu baris lagi. Sedangkan untuk Gemma 4 12B secara khusus, itu juga tidak ada di katalog kami; ukuran Gemma 4 yang kami rutekan adalah 31B dan 26B A4B, dan 12B adalah unduhan lokal. img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Putusannya, dengan demikian, bukanlah pemenang. Intern-Decision-0.8B adalah head penilaian yang murah, cepat, dan deterministik dari sebuah lab yang belum menjelaskannya, dengan tabel benchmark yang belum direproduksi siapa pun dan kolom ketangguhan penolakan yang seharusnya diuji sebelum ia mendekati masukan yang tidak tepercaya. Gemma 4 12B adalah generalis multimodal berbobot terbuka yang matang dengan kartu yang diterbitkan, laporan teknis, dan jumlah parameter empat belas kali lipat, dan ia adalah alat yang salah untuk panggilan klasifikasi enam belas bidang — bukan karena ia lebih buruk, tetapi karena menghasilkan jawaban untuk pertanyaan yang himpunan jawabannya sudah Anda tuliskan adalah cara yang mahal untuk mendapatkan sebuah label.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari