Kartu judul yang dihasilkan bertuliskan 'Intern-Decision-4B vs ContextPilot-8B', dengan subjudul 'satu menolak konteks panjang, satu mengelolanya', dengan tiga chip bertuliskan 'tidak ada evaluasi independen untuk keduanya', 'keduanya dirilis tanpa pengumuman' dan 'keduanya tidak dapat dirutekan hari ini'. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Engineering & Research

Intern-Decision-4B vs ContextPilot-8B: Model yang Memangkas Konteks versus Model yang Mengelolanya

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pilih racunmu: internlm/Intern-Decision-4B menolak membaca lebih dari 8.192 token, dan tencent/ContextPilot-8B ada khusus untuk bertahan pada konteks yang tumbuh tanpa batas. Keduanya berada di kelas ukuran yang sama, keduanya merupakan fine-tune dari basis Qwen, dan keduanya muncul di Hub tanpa pengumuman vendor dan tanpa evaluasi independen dalam bentuk apa pun — ContextPilot-8B pada 27 Agustus 2026, Intern-Decision-4B pada 26 September 2026 — dan keduanya memecahkan masalah yang berlawanan. Intern-Decision-4B adalah model keputusan terstruktur berparameter 4,5 miliar yang menjalankan satu forward pass, membaca logit, dan mengembalikan probabilitas terkalibrasi untuk setiap pertanyaan yang Anda ajukan; model ini tidak pernah menulis satu token pun. ContextPilot-8B adalah generator teks berparameter 8,19 miliar yang dilatih untuk merencanakan, mengingat, dan mengalihkan konteks kerjanya sendiri selama menjalankan agen yang panjang. Membandingkan keduanya sebenarnya bukan pertanyaan benchmark. Ini pertanyaan tentang separuh mana dari masalah Anda yang lebih Anda ingin model telan.

Pertama, hal yang benar-benar mereka miliki bersama

Tidak ada dari kedua model tersebut yang memiliki satu angka pun yang telah diverifikasi oleh siapa pun di luar labnya sendiri. Hal itu cukup tidak biasa untuk dikatakan sebelum hal lainnya, karena sebagian besar perbandingan di blog ini setidaknya dapat bersandar pada papan peringkat independen untuk salah satu pihak.

Intern-Decision-4B menerbitkan tabel evaluasi lengkap di kartunya — rata-rata 90,02 di tujuh set, skor Brier 0,347, dan kesalahan kalibrasi yang diharapkan 0,065 — semuanya diukur oleh InternLM pada harness milik InternLM. ContextPilot-8B tidak menerbitkan tabel sama sekali. Kartunya menyatakan bahwa kerangka kerja tersebut "secara konsisten mengungguli baseline yang ada di berbagai model dasar dan benchmark" dan menunjuk ke sebuah makalah serta pipeline evaluasi untuk detailnya. Jadi untuk perbandingan ini, kalimat sumber yang jujur itu singkat: satu sisi dilaporkan vendor dan tidak direproduksi, sisi lain diklaim vendor dan tidak diterbitkan, dan tidak ada apa pun di halaman ini yang independen.

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

Kedua taruhan itu, dinyatakan secara gamblang

Taruhan Intern-Decision-4B adalah bahwa bagian tersulit dari sebuah keputusan bukanlah penalaran, melainkan komitmen. Beri ia sebuah state, skema pertanyaan bernama, dan hingga delapan gambar, maka ia mengembalikan distribusi atas string opsi Anda sendiri. Prosedur inferensinya deterministik dan berbentuk tetap: petakan opsi ke simbol token tunggal, render kerangka JSON asisten dengan satu placeholder per bidang, jalankan satu forward pass kausal, baca logit tepat sebelum setiap placeholder, lakukan softmax hanya atas kandidat bidang tersebut, terapkan temperature yang telah di-fit. Tidak ada loop decoding, sehingga tidak ada parser dan tidak ada permukaan halusinasi teks bebas. Harga dari taruhan itu adalah batas input yang keras — kartu tersebut menyatakan input di atas DecisionEngine(max_length=8192) "ditolak tanpa pemotongan".

Taruhan ContextPilot-8B adalah cerminan sebaliknya: biarkan agen terus menulis token, tetapi ajari ia menyunting apa yang sedang dibawanya. Ia menambahkan perencanaan, memori jangka panjang terstruktur, pengambilan informasi, dan pengalihan konteks lunak ke perangkat alat agen, lalu melatih checkpoint dengan resep RL yang mengambil sampel cabang di sekitar keputusan penyuntingan konteks yang penting dan memberikan kredit pada tingkat tindakan, bukan tingkat trajektori. Kartu tersebut berterus terang tentang konsekuensi pengemasannya: memuat checkpoint tidak memberi Anda manajemen konteks. Definisi alat, runtime agen, dan pipeline evaluasi berada di tempat lain dan harus dibawa serta.

Papan skor, dimensi demi dimensi

• Keluaran — Intern-Decision-4B sama sekali tidak mengeluarkan teks, hanya probabilitas atas nilai opsi Anda; ContextPilot-8B menghasilkan seperti biasa dan jawabannya berupa prosa serta panggilan alat yang harus Anda uraikan.

• Batas input — Intern-Decision-4B menolak apa pun yang melebihi 8.192 token; ContextPilot-8B mewarisi batas posisi 40.960 token milik Qwen3-8B dan dirancang untuk tetap bekerja saat konteks efektif bertambah.

• Parameter — 4,54B BF16 untuk Intern-Decision-4B, yang mencakup menara teks, menara visi, dan proyektor; 8,19B BF16 untuk ContextPilot-8B, model bahasa kausal Qwen3 dense biasa.

• Latensi — Intern-Decision-4B berjalan pada rata-rata 44,16 dan 44,60 ms pada P95 di satu RTX 4090, menurut kartu modelnya sendiri; ContextPilot-8B tidak memublikasikan angka latensi, dan biayanya secara fundamental berbeda karena ia menghasilkan token, bukan memberi skor pada token tersebut.

• Gambar — Intern-Decision-4B menerima hingga delapan, dan token gambar diperhitungkan terhadap batas atas 8.192; kartu ContextPilot-8B menjelaskan checkpoint pembuatan teks tanpa jalur multimodal.

• Lisensi — Intern-Decision-4B adalah Apache-2.0 dengan lisensi Qwen hulu yang dipertahankan di sampingnya; lisensi ContextPilot-8B dimulai dengan Bagian 0, “disediakan semata-mata untuk tujuan penelitian dan pengembangan ilmiah. Anda tidak boleh menggunakannya untuk tujuan lain.”

• Bukti yang dipublikasikan — tabel berisi tujuh set dengan diagnostik kalibrasi di satu sisi; abstrak makalah dan penunjuk ke repositori evaluasi di sisi lain.

• Rekam jejak — keduanya sepi. Intern-Decision-4B menunjukkan satu suka dan nol unduhan sejak 26 September 2026; ContextPilot-8B memiliki 11 suka dan sekitar seribu unduhan sejak 27 Agustus 2026, yang berarti lebih banyak perhatian tetapi tetap belum ada evaluasi pihak ketiga.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

Di mana masing-masing sebenarnya rusak

Mode kegagalan Intern-Decision-4B bersifat struktural, dan ada baiknya kita menjelaskannya secara konkret. Jika bukti untuk suatu keputusan tidak muat dalam 8.192 token, model tidak terdegradasi secara mulus — ia menolak permintaan tersebut. Itu adalah pilihan rekayasa yang dapat dipertahankan dan sangat tidak cocok untuk beban kerja yang justru menjadi alasan ContextPilot-8B dibuat. Konfigurasi kartu itu sendiri membuat ketegangan semakin tajam: menara teks di bawah wrapper mendeklarasikan batas posisi 262.144 token. Tulang punggung dapat menangani seperempat juta token, tetapi wrapper yang dirilis tidak akan menerima lebih dari delapan ribu.

Mode kegagalan ContextPilot-8B adalah bahwa ia bukanlah solusi drop-in apa pun. Ia adalah checkpoint di dalam sebuah framework, dan framework itulah tempat perilakunya berada. Ambil bobotnya tanpa definisi tool dan runtime agen, dan Anda mendapatkan fine-tune Qwen3-8B yang kemampuan pembedanya menjadi inert. Tambahkan Section 0 dari lisensi ke dalamnya, dan jawaban praktisnya untuk penerapan komersial adalah Anda tidak dapat menggunakannya sama sekali sebagaimana dirilis — yang juga berarti ia bukan rute kandidat bagi kami, sekarang maupun dalam waktu dekat.

Men-deploy masing-masing, jika Anda akan melakukannya

Intern-Decision-4B menginginkan GPU kecil dan tanpa serving stack yang layak disebut: pasang PyTorch 2.9.1 dan Transformers 5.14.1 di bawah Python 3.12, muat keempat shard sekali, biarkan engine tetap resident, dan lakukan scoring. Karena forward pass-nya berbentuk tetap, P50 dan P95 berada dalam selisih enam persepuluh milidetik satu sama lain, jadi perencanaan kapasitas lebih tentang konkurensi daripada tail latency. Bagian yang canggung adalah bahwa ia dikirim sebagai kelas Python yang dapat diimpor alih-alih layanan HTTP, jadi untuk menempatkannya di depan pemanggil produksi berarti Anda harus membungkusnya sendiri.

ContextPilot-8B menginginkan perlakuan yang sebaliknya: jalur penyajian yang nyata, eksekutor perkakas, penyimpanan memori, dan lingkungan rollout yang mendukung percabangan jika Anda memang berniat melatih ulang atau mengevaluasinya sesuai rancangan. Ini bukan model yang Anda uji coba dalam satu sore; ini adalah kerangka kerja riset yang Anda adopsi.

Apakah router membantu di sini?

Sebagian, dan versi jujurnya lebih sempit dari biasanya. OrcaRouter tidak mencantumkan Intern-Decision-4B, ContextPilot-8B, atau checkpoint penilaian keputusan serupa apa pun di katalognya — halaman model kami 404 untuk keduanya, dan tidak ada apa pun dalam tulisan ini yang boleh dibaca sebagai klaim ketersediaan. Yang benar-benar Anda dapatkan dari endpoint terpadu adalah kemampuan menempatkan eksperimen yang gagal di balik fallback: satu kunci di lebih dari 200 model, harga daftar penyedia diteruskan dengan markup 0%, dan failover otomatis sehingga penilai yang masih Anda evaluasi tidak pernah menjadi titik kegagalan tunggal Itu manfaat nyata untuk sisi Intern-Decision dalam perbandingan ini, di mana model tersebut sebenarnya berjalan dengan murah dan lokal. Untuk ContextPilot-8B hal itu tidak relevan, karena lisensi khusus riset dan pengembangan menutup jalur komersial terlepas dari apa pun yang didukung router mana pun.

Jadi yang mana?

Jika pertanyaan Anda memiliki himpunan jawaban yang tertutup, datang dengan bukti yang terlampir, dan membutuhkan probabilitas alih-alih penjelasan, Intern-Decision-4B adalah objek yang lebih menarik — murah, berbentuk tetap, terkalibrasi sejak dirancang, dan jujur tentang input yang tidak akan diterimanya. Jika masalah Anda adalah bukti yang tak kunjung berhenti datang, tidak ada penskor keputusan yang akan membantu Anda dan ContextPilot-8B membidik sasaran yang tepat, dengan catatan bahwa Anda mengadopsi kerangka kerja dan lisensi riset alih-alih model.

Yang bisa menyelesaikannya adalah uji yang belum dijalankan oleh kedua vendor: berikan kepada keduanya keputusan terstruktur dan singkat yang sama dengan jawaban yang dapat dihitung dari state, lalu lihat apakah rata-rata 90,02 milik scorer itu tetap bertahan di luar harness miliknya sendiri. Sampai ada yang melakukannya, tafsir yang benar dari pertarungan ini adalah bahwa kedua model sama sekali tidak bersaing untuk slot yang sama.

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.