Sebuah kartu judul yang dihasilkan bertuliskan 'Intern-Decision-2B vs MiniCPM5-2B', dengan subjudul 'Dua anggaran 2B, terpaut dua puluh hari', dengan lencana 'penilai keputusan' dan 'generalis padat', dengan logo OrcaRouter dikompositkan di sudut.
Guides & Insights

Intern-Decision-2B vs MiniCPM5-2B: Dua Checkpoint 2B, Berjarak Dua Puluh Hari, Cara yang Bertolak Belakang dalam Mengalokasikan Parameter

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

internlm/Intern-Decision-2B dan openbmb/MiniCPM5-2B berukuran sama, dirilis dengan selisih dua puluh hari, dilisensikan dengan cara yang sama, dan dibangun untuk pekerjaan yang sama sekali tidak serupa. Checkpoint InternLM adalah 2.213.241.664 parameter penilai keputusan: ia menerima state dan pertanyaan bertipe, menjalankan satu forward pass, dan mengembalikan probabilitas terkalibrasi tanpa menghasilkan satu token pun, menolak input apa pun yang melebihi 8.192 token. Checkpoint OpenBMB adalah 2.516.756.480 parameter generalis padat: Llama 42 lapis yang diturunkan dari resep MiniCPM5, menerima konteks 131.072 token, menulis kode, memanggil alat, dan mengerjakan matematika, dengan Indeks Kecerdasan Artificial Analysis sebesar 12,5 dan 726.518 unduhan bulan lalu. Biaya mengunduhnya sama dan keduanya membeli hal yang sepenuhnya berbeda.

Bagian yang menarik dari pasangan ini bukanlah kesenjangan benchmark — hampir tidak ada benchmark yang tumpang tindih untuk dibandingkan. Yang menarik adalah untuk apa anggaran parameter 2,2 miliar dan 2,5 miliar masing-masing dapat dipakai, dan apa yang diberitahukan pilihan itu tentang mana yang sudah selesai. MiniCPM5-2B adalah model kedua dalam serinya, menyusul MiniCPM5-1B dari Mei, dan hadir dengan perangkat rilis lengkap. Intern-Decision-2B adalah ukuran tengah dari tiga ukuran yang diunggah InternLM ke Hugging Face pada 05.36 UTC tanggal 26 September 2026 tanpa pengumuman, dan perangkat rilisnya — basis kode pelatihan, bundel evaluasi terverifikasi hash, benchmark kalibrasi 96 kasus — baru menjadi publik pagi ini pada 08.58 UTC.

Ke mana kedua anggaran itu pergi

Kedua model merupakan fine-tune dari arsitektur milik pihak lain, dan keduanya memiliki sekitar 2,5 miliar parameter. Di situlah kemiripannya berakhir.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the OpenBMB organisation, the tags Text Generation, Transformers, Safetensors, English, Chinese, llama, minicpm5, long-context, tool-calling, on-device and edge-ai, an Apache 2.0 licence, the MiniCPM Tech Report, MiniCPM Wiki, GitHub Repo, UltraData and Online Demo links, and the model title.

MiniCPM5-2B adalah Transformer padat dengan 42 lapisan, ukuran tersembunyi 2.048, 16 kepala atensi, ukuran perantara 6.144, kosakata 130.560 token dan konteks 131.072 token, yang dilatih pada campuran korpus terbuka yang diterbitkan OpenBMB bersamanya: UltraX untuk pra-pelatihan web, UltraData-Code dengan pengelolaan kode berjenjang L0–L3, UltraData-Math, dan 500.000 sampel SFT agen dengan lebih dari 80.000 sampel RL di UltraData-RL-2609. Pasca-pelatihannya menjalankan SFT, lalu guru RL khusus dalam matematika, kode, dan tugas agentik, kemudian distilasi on-policy kembali ke satu model. Ini adalah model serbaguna yang seluruh anggaran parameternya diekspos sebagai kemampuan yang dapat Anda prompt.

Intern-Decision-2B adalah Qwen3_5ForConditionalGeneration dengan 24 lapisan — pola berulang dari tiga lapisan perhatian linear terhadap satu lapisan perhatian penuh — ukuran tersembunyi 2.048, 8 kepala kueri terhadap 2 kepala nilai kunci, dimensi kepala 256, lapisan prediksi multi-token yang dipertahankan dan batas penyematan 262.144 posisi. Ini dikirim dengan menara visi 612,5 MB dan proyektor 50,3 MB. Hampir tidak ada dari anggaran itu yang tersedia bagi Anda sebagai prompt: model menjawab skema pertanyaan yang tetap, dan arsitekturnya adalah mekanisme pengiriman untuk softmax, bukan generator teks.

Satu detail dari repositori InternLM yang baru diterbitkan patut disorot, karena hal itu membingkai ulang tag multimodal pada kartu model. Decision tuning itu "melakukan fine-tune pada backbone bahasa Qwen3.5 sambil membekukan vision tower dan projector." Baik checkpoint decision 2B maupun 4B sama-sama membawa shard visi berukuran tepat 612.517.440 byte — ukuran yang sama pada keduanya — yang konsisten dengan komponen-komponen tersebut diwarisi dari basis Qwen, bukan dilatih. Jalur gambar itu nyata dan dapat digunakan, tetapi bukan itu yang menjadi fokus upaya decision tuning InternLM. Jika beban kerja Anda hanya berupa decision scoring berbasis teks, sekitar 660 MB dari unduhan 4,46 GB itu tidak melakukan apa pun untuk Anda.

Papan Skor

A two-column comparison scoreboard titled 'Intern-Decision-2B vs MiniCPM5-2B'. The left column reads: Parameters 2,213,241,664 plus vision tower; Context 8,192 tokens, refused above; Output calibrated probabilities, no text; Modality text plus up to 8 images; Published evidence vendor table, unreproduced; Adoption one like, zero downloads. The right column reads: Parameters 2,516,756,480 dense; Context 131,072 tokens; Output generated text, token by token; Modality text only; Published evidence OpenBMB card, AA Index 12.5; Adoption 726,518 downloads last month. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the MiniCPM5-2B figures are OpenBMB's own card plus an independent Artificial Analysis index.

• Parameter — Intern-Decision-2B 2.213.241.664 dalam BF16 ditambah sekitar 660 MB untuk menara visi dan proyektor, sekitar 4,46 GB repositori; MiniCPM5-2B 2.516.756.480 dalam BF16, satu berkas safetensors 5,03 GB.

• Konteks — 8.192 token untuk Intern-Decision-2B, ditolak tanpa pemotongan di atas jumlah itu; 131.072 token untuk MiniCPM5-2B.

• Keluaran — distribusi terkalibrasi ditambah argmax per bidang, tanpa teks sama sekali; teks yang dihasilkan, token demi token.

• Pelatihan — penyetelan keputusan pada backbone Qwen3.5-2B dengan tower visi dibekukan, data pelatihan tidak diungkapkan; proses pra-pelatihan penuh, pelatihan menengah, dan SFT pemikiran mendalam 400 miliar token yang diikuti oleh RL dan distilasi on-policy, dengan korpora diterbitkan bersama.

• Bukti yang dipublikasikan — tabel vendor tujuh suite dengan rata-rata 84,68, Brier 0,437, dan ECE 0,100, tidak direproduksi oleh pihak ketiga mana pun, satu suka dan nol unduhan; kartu OpenBMB dengan rata-rata 53,9 dalam kumpulan pembandingnya sendiri dan Artificial Analysis Intelligence Index independen sebesar 12,5, dengan 726.518 unduhan dalam sebulan terakhir.

• Lisensi — Apache-2.0 dengan ketentuan Qwen upstream yang dipertahankan sebagai LICENSE-QWEN, dan tidak ada lisensi yang dinyatakan sama sekali di repositori kode; Apache-2.0 di seluruhnya, termasuk kode.

Dalam hal apa masing-masing sebenarnya lebih baik, dan perbandingannya tidak dekat.

Perbandingan itu asimetris sampai-sampai menjadi kekeliruan kategori, jadi lebih berguna untuk menyebutkan pekerjaan-pekerjaannya.

MiniCPM5-2B memenangkan segala hal yang melibatkan menghasilkan jawaban, bukan memilih satu. Ia menulis kode; Intern-Decision-2B tidak memiliki jalur kode. Ia menangani konteks 131.072 token; Intern-Decision-2B berhenti pada 8.192 dan gagal secara mencolok. Ia memanggil alat, dengan skor BFCL v4 66,6 pada tabel OpenBMB sendiri, dan ia mengerjakan matematika, dengan MATH-500 pada 94,6 dan GPQA-Diamond pada 70,2 — angka dari kartu vendor, dengan baris GPQA memuat catatan kaki yang disediakan oleh kartu itu sendiri. Ia mendukung 70,8 pada MMLU-Pro dan 84,7 pada MMLU-Redux. Ia berjalan di llama.cpp dan MLX, tersedia dalam varian GGUF, GPTQ, dan DSpark, serta memiliki Space demo di Hub yang publik, tidak seperti 401 yang ditunjuk oleh kartu Intern-Decision.

Intern-Decision-2B memenangkan tepat dua hal, dan keduanya adalah alasan keberadaannya. Pertama, keputusan himpunan tertutup dengan skema yang Anda tulis mengembalikan probabilitas yang dapat Anda beri ambang batas, dalam satu forward pass, dalam sekitar 33 milidetik, tanpa parser dan tanpa sampling — suatu bentuk yang tidak dapat dihasilkan MiniCPM5-2B kecuali dengan menghasilkan teks dan berharap angka di dalamnya berperilaku baik. Kedua, ini adalah artefak yang dapat direproduksi: repositori sekarang memuat objektif pelatihan, tujuh suite akurasi dengan hash SHA-256 dan jumlah baris per suite, kode penilaian, skrip fitting temperature dan replay, serta tolok ukur kalibrasi distribusi 96 kasus dengan generator dan penilai offline-nya sendiri. Panduan evaluasi InternLM mencatat bahwa preset yang dirilis terikat pada backend XTuner dan bahwa hasil HF harus dilaporkan sebagai pengaturan eksekusi yang berbeda — yang persis merupakan jenis caveat yang ingin dibuat dapat diperiksa oleh kit reproduksi.

A screenshot of the GitHub repository page for InternLM/Intern-Decision, showing the organisation and repository breadcrumb, the description 'Fast multi-modal decision model', 5 stars and 0 forks, the file tree with assets, benchmarks, configs, docs, runtime, scripts, src and tests directories plus a release-manifest.json, and a commit list headed by 'Add demonstration videos and centered README links' roughly an hour old.

Siapa yang harus mengunduh yang mana

Jika Anda memiliki tugas yang melibatkan membaca sesuatu yang panjang, menulis sesuatu, atau menjawab pertanyaan yang opsi-opsinya tidak Anda sebutkan terlebih dahulu, MiniCPM5-2B adalah modelnya dan tidak ada keputusan yang perlu dibuat. Ini adalah generalis kelas 2B yang sudah matang dengan ekosistem nyata, data terbuka di baliknya, dan daftar evaluasi independen, serta tidak ada biaya untuk mencobanya — build GGUF dan MLX sudah tersedia di Hub.

Jika Anda memiliki tugas yang sebenarnya merupakan pilihan di antara jawaban-jawaban yang diketahui — merutekan tiket, mengklasifikasikan email dukungan, memberi label pada kandidat, menilai intent pada skala ordinal — maka model generatif adalah instrumen yang salah, dan Intern-Decision-2B adalah yang lebih menarik di antara keduanya meskipun hampir tidak ada yang pernah menjalankannya. Probabilitas yang bisa Anda beri ambang batas lebih murah untuk dioperasikan, lebih mudah diaudit, dan mustahil untuk berhalusinasi, dan fakta bahwa checkpoint tersebut datang dengan kit reproduksi alih-alih postingan leaderboard menjadikannya yang lebih terdokumentasi di antara keduanya pada dimensi yang penting ketika Anda harus mempertahankan pilihan tersebut.

Tidak satu pun dari model tersebut ada di OrcaRouter. Halaman model kami untuk Intern-Decision-2B mengembalikan 404 dan tidak ada rute MiniCPM5-2B; tidak ada yang di sini merupakan klaim ketersediaan, dan keduanya berarti Anda menjalankan inferensi sendiri. Alternatif praktisnya terletak pada model keputusan yang dihosting:Jev 1.13 milik TypeSafe, model yang digunakan InternLM sebagai tolok ukur untuk seluruh keluarganya, ada di katalog dengan harga $0,042 per juta token masukan dengan konteks 65K dan P50 waktu-ke-token-pertama 178 ms. Dan jika yang sebenarnya Anda butuhkan adalah generalis di kelas ukuran yang sama dengan MiniCPM5-2B tanpa pekerjaan operasional, rute Qwen yang dihosting terkecil kami beberapa kali lebih besar tetapi merupakan satu kunci di antara 200+ model, dengan harga daftar penyedia yang diteruskan tanpa markup dan failover otomatis di belakangnya.

Satu angka yang memutuskannya

Bukan 84,68 versus 53,9. Kedua rata-rata itu berasal dari suite yang berbeda, diukur oleh lab yang berbeda, dan dalam satu kasus oleh lab yang angka-angkanya belum pernah diperiksa. Angka yang menentukan adalah 8.192. Jika state Anda muat dalam delapan ribu token dan jawaban Anda sudah berupa daftar, Intern-Decision-2B adalah instrumen presisi dengan kit reproduksi dan anomali kalibrasi yang perlu Anda ketahui — expected calibration error-nya sebesar 0,100 adalah yang terburuk dari tiga ukuran yang diterbitkan InternLM, dibandingkan 0,066 untuk model yang setengah ukurannya, jadi sesuaikan temperature Anda sendiri sebelum mempercayai nilai keyakinan. Jika state Anda tidak muat, pertanyaannya sudah selesai sebelum benchmark dimulai, dan MiniCPM5-2B adalah jawabannya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari