
FrogNano-4B-2609 vs Intern Decision 4B: Satu Model Dasar, Dua Taruhan yang Sepenuhnya Berbeda
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 219 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Dua laboratorium mengambil checkpoint yang sama, Qwen3.5-4B, dan mendorongnya ke arah yang tidak mirip satu sama lain. microsoft/FrogNano-4B-2609 dilatih lanjut dengan pembelajaran penguatan pada sekitar 1.500 lingkungan rekayasa perangkat lunak sintetis sampai dapat mengeluarkan panggilan alat terstruktur dan tambalan multi-berkas melalui harness lima alat. internlm/Intern-Decision-4B disetel halus untuk tidak mengeluarkan teks sama sekali — ia menerima keadaan plus skema pertanyaan bernama dan mengembalikan probabilitas terkalibrasi untuk setiap opsi dalam satu forward pass. Yang satu menulis kode. Yang lain menolak menulis apa pun dan mengembalikan distribusi. Membandingkan keduanya berdasarkan kualitas tidak ada artinya; membandingkan keduanya berdasarkan biaya yang harus Anda keluarkan untuk menjalankannya dan apa yang dapat dipercayakan kepada mereka adalah latihan yang jujur.
Keduanya dirilis tanpa pengumuman, yang merupakan kesamaan lain mereka. Tak satu pun memiliki entri Artificial Analysis, peringkat arena, atau satu pun evaluasi independen. Setiap angka di bawah ini — tangga SWE-bench di satu sisi, baris kalibrasi Brier dan ECE di sisi lain — dihasilkan oleh laboratorium yang melatih model tersebut, dengan harness milik laboratorium itu sendiri, dan belum pernah menjumpai set pengujian yang bukan berasal dari situ.
Fork itu terjadi sebelum salah satu model tersebut ada.
Checkpoint dasar adalah model hibrida Gated DeltaNet dan gated-attention padat 32 lapis, dan kedua turunannya mewarisi kerangkanya. Setelah itu, kedua pipeline pasca-pelatihan tersebut tidak memiliki kesamaan apa pun.
Pipeline Microsoft adalah loop tertutup. TaskPilot menghasilkan tugas repositori kandidat dari snapshot nyata, menjalankan rollout dari checkpoint saat ini untuk menemukan tugas yang kadang-kadang dipecahkan oleh policy, menyimpannya, lalu melatih. Lima iterasi, masing-masing dikalibrasi terhadap policy iterasi sebelumnya, berakhir pada 61,5% di SWE-bench Verified dan 37,6% di SWE-bench Pro. Tanpa distilasi — kartu tersebut menyatakan bahwa tidak ada lintasan, aksi, atau jejak penalaran dari model yang lebih kuat yang digunakan sebagai target.
Pipeline InternLM adalah objektif terawasi tunggal atas bentuk tugas yang tetap. Model diberi prompt sistem, status, skema keputusan, dan kerangka JSON asisten lengkap dengan satu placeholder per bidang. Model menjalankan satu forward pass kausal, membaca logit di setiap posisi placeholder, dan mengambil softmax hanya atas simbol kandidat yang diizinkan untuk bidang tersebut. Kartu InternLM mengatakannya secara terus terang: jalur ini "tidak memanggil generate() atau mengambil sampel teks bebas."
Perbedaan itu bukan perbedaan skala. Ini adalah perbedaan dalam hal apa sebenarnya artefak itu. FrogNano-4B-2609 adalah agen yang dapat salah dalam seratus cara menarik dan dikoreksi melalui pengujian. Intern-Decision-4B adalah pemberi skor yang mode kegagalannya adalah angka yang percaya diri.
Dua kontrak, dan tidak satu pun adalah "kirim prompt"
Kontrak FrogNano adalah sebuah loop. Model mengeluarkan panggilan ke Read, Write, Edit, Glob dan Bash; harness Leaf mengeksekusinya di dalam sandbox repositori terisolasi dan mengembalikan output; loop terus berlanjut hingga model berhenti memanggil. Evaluasi dijalankan pada 150 langkah dalam sekitar 131K token gabungan, dengan hingga 8.192 token yang dihasilkan per giliran asisten. Penyajian membutuhkan SGLang dengan parser penalaran Qwen3 dan parser pemanggilan tool Qwen3 coder — salah dalam hal ini dan model akan menghasilkan prosa di tempat yang diharapkan harness berupa JSON, yang dari luar terlihat persis seperti model yang rusak.
Kontrak Intern-Decision-4B adalah sekali coba dengan batas keras. Pertanyaan dan opsi mempertahankan urutannya. Opsi dipetakan ke simbol satu token — A hingga Z, lalu a hingga z, lalu 0 hingga 9, yang merupakan alasan aritmetika sebuah pertanyaan maksimal 62 opsi. Batas atas wrapper adalah 8.192 token dan kartu InternLM secara eksplisit menyatakan bahwa input yang lebih panjang ditolak tanpa pemotongan. Tiga tipe pertanyaan didukung: choice dengan peta kriteria berurutan, score dengan daftar atau peta berkunci numerik, dan noul, sebuah biner. Hingga delapan gambar diizinkan dan tokennya dihitung terhadap 8.192 yang sama.
• Bentuk keluaran — FrogNano-4B-2609 menghasilkan panggilan alat, teks penalaran, dan patch. Intern-Decision-4B menghasilkan satu simbol per bidang dan tidak ada yang lain.
• Determinisme — FrogNano melakukan sampling pada temperature 0,6 di tiga seed, jadi secara desain memang probabilistik. Argmax Intern-Decision-4B ditetapkan oleh forward pass; temperature hasil fitting hanya mengubah keyakinannya.
• Permukaan kegagalan — FrogNano dapat berhalusinasi tentang sebuah API, memperlebar cakupan suatu suntingan secara berlebihan, atau meloloskan pengujian sekaligus memasukkan kerentanan, yang semuanya itu dinamai oleh kartunya. Intern-Decision-4B tidak dapat berhalusinasi dalam menjawab, karena ia hanya dapat memilih dari opsi yang Anda berikan — ia hanya bisa salah kalibrasi.
• Batas maksimum input — sekitar 131K token gabungan untuk FrogNano dalam konfigurasi yang dievaluasi, dibandingkan dengan batas keras 8.192 untuk Intern-Decision-4B, yang merupakan faktor enam belas dan tidak ada cara mengatasinya.
• Bentuk biaya — FrogNeb menagih berdasarkan trajektori, dan trajektori itu panjang. Intern-Decision-4B tidak memiliki token keluaran untuk ditagih sama sekali.
• Parameter — kartu FrogNano memberikan rentang "500M-5B" dan menjelaskan sekitar 4,66B, dengan unduhan BF16 9,32 GB; Intern-Decision-4B dinyatakan pada 4,54B dengan menara visi 612 MB dan proyektor 54 MB bersama shard bahasanya.
Angka yang menentukan pasangan ini
Kartu model InternLM mencantumkan Intern-Decision-4B pada latensi rata-rata 44,16 ms dan median 44,03 ms pada satu RTX 4090 melalui jalur Hugging Face lokal, dengan P95 sebesar 44,60 ms. Baca lagi sebaran itu: dari median ke ekor jauh di bawah satu milidetik, karena forward pass dengan bentuk tetap hampir tidak punya apa pun yang bisa bervariasi. Itulah keseluruhan argumen untuk arsitektur ini.
Angka yang bersesuaian dari FrogNano tidak dalam milidetik. Evaluasinya mengizinkan anggaran 150 langkah dengan batas maksimum agen 10.800 detik per tugas. Itu bukan satuan yang sebanding dan tidak boleh pernah ditempatkan dalam kalimat yang sama dengan klaim latensi — tetapi itu memang memberi tahu Anda bentuk pertukarannya. Satu model menjawab suatu keputusan dalam empat puluh empat milidetik dan model lainnya menghabiskan beberapa menit panggilan alat untuk mengejar patch. Jika masalah Anda adalah "rutekan tiket ini ke salah satu dari enam antrean dan beri tahu saya seberapa yakin Anda", yang pertama bukan versi yang lebih murah dari yang kedua, melainkan mesin yang berbeda.
Kedua lab mengukur diri mereka dengan cermat, dan kedua rangkaian pengukuran itu harus dibaca sebagai niat, bukan hasil. InternLM melaporkan rata-rata tujuh set sebesar 90,02 dengan skor Brier 0,347 dan kesalahan kalibrasi yang diharapkan sebesar 0,065, yang dicocokkan pada suhu 1,99241824 pada 1.728 kasus kalibrasi yang ditetapkan. Microsoft melaporkan kenaikan lima iterasi dari 39,4% menjadi 61,5% pada SWE-bench Verified, dan lampiran makalah yang sama melaporkan perkembangan yang sama sebagai 48,2%, 53,4%, 58,3%, 58,6%, dan 61,6% — sebuah pengingat bahwa bahkan di dalam satu lab, fakta yang sama yang diukur dengan dua cara menghasilkan dua tangga.

Petunjuknya terletak pada apa yang masing-masing kartu memilih untuk memperingatkanmu.
Kedua kartu ini luar biasa jujur, dan kejujurannya mengarah ke arah yang berlawanan — yang justru menjadi hal paling berguna dalam perbandingan ini.
Bagian keterbatasan yang diketahui dari Microsoft terdengar seperti peringatan penerapan. Hanya bahasa Inggris dan Python. Performa sensitif terhadap harness dan kualitas pengujian. Patch yang mungkin salah atau tidak aman meskipun lulus pengujiannya. Kalimat kartu itu sendiri adalah bahwa FrogNano "tidak boleh dianggap selaras keamanan secara independen untuk penerapan otonom tanpa batas", dan disebutkan celah spesifiknya: pasca-pelatihan khusus agen tidak menggunakan data preferensi keamanan, penolakan, atau adversarial, karena ia justru mengoptimalkan kebenaran fungsional dan penghindaran regresi. Ia juga menyebutkan tingkat panggilan alat paralel sebesar 1,71%, yang berarti model hampir tidak pernah memicu dua alat dalam satu giliran meskipun harness mengizinkannya — regresi kemampuan nyata dari model dasar yang membuat tim menambahkan tahap konsolidasi untuk mencoba memulihkannya.
Kartu InternLM memperingatkan tentang kelas hal yang berlawanan. Tidak ada permukaan halusinasi yang perlu diperingatkan, jadi kaveatnya berkaitan dengan input: penolakan pada 8.192, batas maksimum 62 opsi, fakta bahwa menara teks yang mendasarinya mendeklarasikan batas posisi 262.144 token, sementara wrapper yang dirilis menolak menggunakannya. Risikonya adalah bahwa angka yang meyakinkan dipercaya lebih jauh daripada yang seharusnya, dan kartu itu jujur bahwa kalibrasi mempersempit kesenjangan dengan baseline Jev tanpa menutupnya pada setiap irisan.
Jika dibaca bersama, keduanya menggambarkan dua postur kepercayaan yang berbeda. FrogNano membutuhkan pengawasan karena ia bertindak. Intern-Decision-4B membutuhkan audit karena ia memberi skor — dan angka yang menggerakkan sebuah keputusan produksi adalah tepat jenis keluaran yang tidak terpikir oleh siapa pun untuk diuji.
Di mana router cocok, dan catatan jujur tentang keduanya
Tidak satu pun dari model tersebut merupakan endpoint yang dihosting. FrogNano dikirim sebagai bobot plus harness evaluasi Kubernetes; Intern-Decision-4B dikirim sebagai kelas Python yang Anda impor setelah mengunduh empat shard. Bagi tim yang ingin mencoba salah satunya di depan sesuatu yang nyata, pola aman untuk keduanya sama dan tidak glamor: letakkan komponen eksperimental di belakang fallback sehingga lintasan yang buruk atau hari yang kalibrasinya meleset hanya membutuhkan percobaan ulang, bukan insiden.
Pola itu adalah tujuan lapisan perutean. OrcaRouter menjalankan lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI dengan markup 0% — harga daftar penyedia diteruskan, sehingga perubahan harga vendor sampai ke sisi kami pada hari yang sama — dan failover-nya berada di depan model umum yang menjadi fallback Anda, bukan di depan kedua model ini. Sederhananya: kami tidak menyediakan FrogNano-4B-2609 atau Intern-Decision-4B, dan tidak ada tanggal untuk keduanya. Yang Anda dapatkan dari satu endpoint di sini adalah perbandingannya sendiri menjadi murah — satu kredensial, satu lini penagihan, dan tidak perlu integrasi kedua setiap kali Anda menukar model umum yang menjadi pembanding spesialis tersebut.

Yang mana, dan kapan
Gunakan Intern-Decision-4B ketika jawabannya sudah ada di prompt Anda dan Anda perlu jawaban itu dipilih, dengan keyakinan yang disertakan, pada laju ribuan per detik. Perutean taksonomi tetap, penilaian rubrik, ekstraksi dengan batasan skema, moderasi terhadap kumpulan label tertutup. Forward pass 44 milidetik dan tagihan token keluaran nol adalah produknya, dan kalibrasinya adalah hal yang perlu diaudit sebelum Anda memercayainya.
Ambil FrogNano-4B-2609 ketika jawabannya belum ada dan harus ditemukan dengan membaca repositori dan menjalankan pengujiannya. Itu adalah proses berdurasi beberapa menit, dijalankan dalam sandbox, dan dapat ditinjau, dan 61,5% pada SWE-bench Verified — dilaporkan vendor, belum direproduksi — adalah bukti terbaik saat ini bahwa checkpoint 4B pun mampu melakukannya.
Yang seharusnya tidak dibiarkan berlaku ke arah mana pun adalah kebiasaan membandingkan skor mereka. Rata-rata 90,02 dari tujuh set dan tingkat SWE-bench Verified 61,5 adalah pengukuran atas dua pertanyaan yang berbeda, yang dihasilkan oleh dua laboratorium, pada dua harness, dan tak satu pun dari angka itu pernah melewati tangan pihak ketiga. Keduanya hanya berbagi satu leluhur, dan tidak lebih dari itu.

Satu-satunya prediksi yang benar-benar berguna dari leluhur bersama: karena kedua model dimulai dari checkpoint 4B yang sama, perbedaan di antara keduanya hampir seluruhnya terletak pada pasca-pelatihan, yang berarti pertanyaan menarik bagi siapa pun yang membangun di atas Qwen3.5-4B adalah struktur reward mana dari kedua ini yang bertransfer ke domain mereka sendiri. Sebuah loop tugas sintetis yang mengkalibrasi terhadap policy-nya sendiri, atau head penilaian berbentuk tetap dengan temperature yang di-fit. Itu adalah dua resep, keduanya dipublikasikan, keduanya dari lab yang belum mengizinkan siapa pun menjalankannya. Itu situasi langka dan layak untuk diamati daripada langsung dipercayai.
