
FrogNano-4B-2609 vs Gemma 4 12B: 61,5% pada SWE-bench dan Belum Ada yang Memeriksanya
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 219 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Microsoft FrogNano-4B-2609 adalah agen coding kelas empat miliar yang diturunkan dari Qwen3.5-4B yang melaporkan 61,5% pada SWE-bench Verified. Gemma 4 12B adalah model multimodal tanpa encoder berparameter 11,95 miliar milik DeepMind, dan kartunya melaporkan 72,0% pada LiveCodeBench v6. Itu adalah dua angka yang akan disandingkan oleh pembeli, dan menyandingkannya adalah kesalahan. Angka-angka itu berasal dari tolok ukur yang berbeda, harness yang berbeda, laboratorium yang berbeda, dan — yang lebih penting — hanya satu di antaranya yang memiliki metodologi evaluasi terbitan yang pernah dibaca orang luar. Segala hal lain tentang perbandingan ini adalah pertanyaan tentang apa sebenarnya masing-masing model, dan jawabannya adalah bahwa keduanya sama sekali bukan jenis hal yang sama.
Angka FrogNano di bawah ini berasal dari kartu model Microsoft dan laporan teknisnya, keduanya sudah tersedia untuk publik sejak September dan tidak satu pun direproduksi oleh siapa pun di luar lab. Angka Gemma 4 12B berasal dari kartu model Google, yang juga merupakan dokumen vendor — bedanya, angka-angka Gemma sudah memiliki dua puluh minggu dan sekitar 2,6 juta unduhan sebagai bahan penelaahan di belakangnya, sedangkan FrogNano baru dua minggu dan penghitung unduhannya belum menembus dua digit.
Untuk apa masing-masing model
Inilah bagian yang disembunyikan oleh lembar spesifikasi. FrogNano-4B-2609 bukan model umum yang kebetulan bagus dalam hal kode. Ini adalah checkpoint yang seluruh pasca-pelatihannya berupa rekayasa perangkat lunak tingkat repositori, dan yang dirancang untuk digerakkan oleh harness, bukan untuk diajak bicara.
Kelima alatnya adalah Read, Write, Edit, Glob dan BashModel ini mengeluarkan panggilan ke alat-alat tersebut, sebuah sandbox mengeksekusinya dan mengembalikan keluaran, dan perulangan berjalan hingga model berhenti meminta. Konfigurasi yang dievaluasi adalah 150 langkah interaksi dalam sekitar 131K token gabungan, dan menghasilkan patch kandidat per tugas. Kartu Microsoft secara eksplisit menyatakan bahwa model ini ditujukan untuk repositori berbahasa Inggris yang banyak menggunakan Python dengan lingkungan yang dapat direproduksi dan rangkaian uji yang dapat dieksekusi, dan bahwa komponen gambar dan video yang diwarisi dari model dasar tidak pernah menjalani pelatihan lanjutan dan tidak didukung.
Gemma 4 12B memiliki bentuk yang berlawanan. Ini adalah model terpadu 48 lapisan dengan konteks 256K dan tanpa encoder visi atau audio terpisah — patch gambar mentah dan bentuk gelombang audio diproyeksikan langsung ke ruang penyematan dekoder tunggal melalui lapisan linear yang ringan. Model ini menerima masukan teks, gambar, dan audio serta menghasilkan teks. Model ini memiliki mode berpikir yang dipicu oleh token di prompt sistem, pemanggilan fungsi native, dan kartu Google secara khusus mencantumkan alur kerja agentic di antara penggunaan yang dimaksudkan.
Jadi pertanyaan sebenarnya bukanlah mana yang lebih pintar. Pertanyaannya adalah apakah Anda menginginkan komponen spesialis yang hanya berfungsi di dalam rig yang harus Anda operasikan, atau model umum yang melakukan pekerjaan dengan cukup baik pada banyak hal dan dapat dipanggil oleh apa pun.

Baris demi baris, di mana mereka benar-benar berbeda
• Parameter — FrogNano-4B-2609 mempublikasikan rentang, "500M-5B", pada kartu yang deskripsinya sendiri terbaca sekitar 4,66 miliar; unduhannya menetapkannya pada 9,32 GB bobot BF16. Gemma 4 12B adalah 11,95B, dinyatakan sekali dan tanpa kualifikasi. Rasionya kira-kira 2,6 banding satu, dan itu langsung terlihat pada apa yang harus Anda sewa.
• Konteks — Konfigurasi FrogNano yang dievaluasi sekitar 131K token gabungan, dengan penalaran dan keluaran alat yang berbagi anggaran tersebut. Gemma 4 12B membawa 256.000 token, dan pada baris konteks panjangnya sendiri memperoleh skor 43,4% pada MRCR v2 dengan delapan jarum pada 128K. Hampir dua kali lipat jendelanya, dan angka kedua adalah pengukuran yang dipublikasikan, bukan klaim kemampuan.
• Modalitas — FrogNano-4B-2609 adalah teks masuk, teks keluar, meskipun menara visi berada di checkpoint-nya. Gemma 4 12B adalah teks, gambar, dan audio masuk.
• Batas keluaran — konfigurasi FrogNano yang telah divalidasi memungkinkan 8.192 token yang dihasilkan per giliran asisten, dan kartunya mencatat bahwa konfigurasi pelatihan RL menggunakan batas yang sama. Gemma 4 12B tidak mempublikasikan batas satu giliran yang setara; kendala di sana adalah jendela 256K.
• Antarmuka agentik — FrogNano mengeluarkan panggilan Leaf terstruktur dan memerlukan harness untuk menjalankannya. Gemma 4 12B menyertakan pemanggilan fungsi native dalam bentuk yang disetel dengan instruksi dan dapat dipanggil secara langsung.
• Lisensi — Gemma 4 12B adalah Apache 2.0 di bawah ketentuan Gemma 4 Google, yang dinyatakan secara jelas. Kartu FrogNano menyebut MIT di bagian depannya dan Apache 2.0 di isinya sendiri, yakni jenis ambiguitas yang berakhir dalam tinjauan hukum alih-alih catatan kaki.
• Angka — FrogNano melaporkan 61,5% SWE-bench Verified, 37,6% SWE-bench Pro, 31,1% Terminal-Bench 2.0 dan 47,3% PatchEval-Verified. Gemma 4 12B melaporkan 77,2% MMLU Pro, 72,0% LiveCodeBench v6, ELO Codeforces sebesar 1659, 78,8% GPQA Diamond dan 69,0% pada Tau2. Kartu Google tidak menerbitkan baris SWE-bench, dan kartu Microsoft tidak menerbitkan LiveCodeBench. Tidak ada tumpang tindih sama sekali antara kedua papan skor tersebut.
Poin terakhir itulah yang seharusnya mengakhiri insting membandingkan berdasarkan angka. Tidak ada satu pun tolok ukur yang muncul di kedua kartu. Pembaca yang menjajarkan 61,5 dengan 72,0 telah membandingkan tingkat penyelesaian repositori dengan tingkat kelulusan pemrograman kompetitif, yang kurang lebih seperti membandingkan waktu maraton dengan waktu lari 100 meter karena keduanya dalam satuan detik.
Mengapa diamnya Google soal SWE-bench bukan tanda bahaya
Kesimpulan yang menggoda dari daftar berpoin itu adalah bahwa FrogNano memiliki angka SWE-bench yang nyata sedangkan Gemma tidak, jadi FrogNano menang untuk pertanyaan coding. Itu tidak dapat disimpulkan demikian, karena ada alasan yang perlu dijelaskan secara tepat.
Gemma 4 12B melaporkan Tau2 sebesar 69,0% — tolok ukur penggunaan alat agentik selama tiga kali eksekusi — bersama dengan dukungan pemanggilan fungsinya dan posisinya yang eksplisit untuk alur kerja agentik. Model yang mencetak 69,0 pada Tau2 bukanlah model yang tidak mampu melakukan pekerjaan agentik; itu adalah model yang vendornya memilih melaporkan kinerja penggunaan alat ketimbang resolusi repositori. Google juga tidak melaporkan baris SWE-bench untuk 26B atau 31B, yang merupakan pilihan editorial di seluruh keluarga model, bukan kelemahan 12B.
Sementara itu, hasil yang berlawanan dengan intuisi dalam makalah Microsoft sendiri adalah hal yang harus dibaca dengan cermat oleh pembeli Gemma. FrogNano dimulai dari Qwen3.5-4B, sebuah model umum, yang mencetak skor 39,4% pada SWE-bench Verified melalui harness Leaf. Lima putaran pembelajaran penguatan pada sekitar 1.500 tugas sintetis membawanya ke 61,5%. Pelajaran yang didapat bukanlah "model kecil tidak bisa coding" — melainkan bahwa checkpoint 4B umum pada 39,4% sudah menyelesaikan lebih dari sepertiga kumpulan masalah yang sulit dan divalidasi manusia ketika seseorang menjalankannya di dalam loop agen yang kompeten. Gemma 4 12B tiga kali ukuran itu dan dua puluh minggu lebih matang. Belum ada yang menjalankannya melalui Leaf, dan sampai ada yang melakukannya, "Gemma bukan agen repo" hanyalah asumsi, bukan temuan.
Pajak harness, yang sepenuhnya disembunyikan oleh papan skor
Inilah aspek praktisnya, dan inilah yang menentukan pembelian.
Gemma 4 12B adalah sebuah model. Unduh 11,95B bobot, arahkan Transformers, vLLM, atau SGLang ke bobot tersebut, kirim teks, terima teks. Google menerbitkan jalur penyajiannya, lisensinya tidak ambigu, dan orang-orang yang setara dengan 2,6 juta unduhan telah menemui bagian yang kasar dan mendokumentasikannya. Jika tugasnya adalah "ringkas stack trace ini", "baca tangkapan layar ini dan beri tahu saya apa yang rusak", atau "panggil fungsi ini dengan argumen ini", ini berfungsi hari ini.
FrogNano-4B-2609 adalah model plus harness, dan README Microsoft sendiri menjadikan harness itu wajib. Repositori di github.com/microsoft/FrogNano adalah rig evaluasi Leaf, bukan kode pelatihan — rig ini memerlukan klaster Kubernetes, namespace yang sudah ada, izin untuk mengelola pod dan kebijakan jaringan, akses pull ke image kontainer benchmark, dan endpoint yang kompatibel dengan OpenAI yang dikonfigurasi dengan parser penalaran dan panggilan alat yang tepat. Kartu Microsoft menyatakan kondisi pencocokan secara blak-blakan: skor yang identik memerlukan kecocokan pada checkpoint, tokenizer, konfigurasi serving, image tugas, dan protokol evaluasi. Separuh dari rilis yang menghasilkan skor adalah separuh yang oleh kartu diarahkan ke tautan GitHub.
Ada nilai nyata dalam hal itu, dan hal itu layak disebutkan alih-alih diabaikan. Kontribusi FrogNano adalah siklus sintesis tugas yang meregenerasi soal pelatihan berdasarkan kemampuan kebijakan saat ini — klaim makalah tersebut adalah bahwa agen kecil dapat dilatih hingga tingkat kompetitif pada tugas sintetis tanpa distilasi sama sekali, dan itu membuka jalan bagi siapa pun yang tidak mampu membiayai guru terdepan. API-nya publik. Metodenya dapat direproduksi secara prinsip. Itu adalah kontribusi yang lebih kuat daripada checkpoint inkremental lain, dan itu juga lebih banyak pekerjaan daripada yang disanggupi sebagian besar tim yang mendaftar.

Jika Anda memilih satu, pilihlah berdasarkan pekerjaannya.
Pilih Gemma 4 12B jika pekerjaan mencampur modalitas, jika ada yang perlu melihat gambar atau mendengar audio, jika konteksnya harus menampung pohon berkas besar dan transkrip panjang sekaligus, atau jika Anda menginginkan model yang dapat dimuat oleh framework apa pun tanpa sistem kedua di belakangnya. Skor Tau2 69,0 dan pemanggilan fungsi native-nya menjadikannya pilihan yang dapat dipertahankan untuk pipeline agentik, dan tidak ada yang perlu mempercayai kata sebuah lab begitu saja — model ini telah dievaluasi oleh ribuan orang dan hasilnya bukan rahasia.
Ambil FrogNano-4B-2609 jika Anda sudah menjalankan agen repositori yang di-sandbox dan Anda ingin checkpoint kelas 4B untuk dimasukkan ke dalamnya, dan jika unduhan 9,32 GB yang muat di perangkat sederhana menjadi kendala dalam keputusan. Bersikaplah jernih tentang urutannya: Anda tidak membeli skor, Anda bertaruh pada sebuah metode, dan hal pertama yang akan Anda temukan adalah apakah polling loop dan parser alat Anda cukup mirip dengan Leaf. Beberapa tim akan mendapatkan perilaku yang mendekati 61,32% pada sore ketiga dan sebagian akan menghabiskan dua minggu untuk menemukan bahwa set evaluasi mereka lebih mudah daripada SWE-bench Verified, dan belum ada orang di luar lab yang bisa memberi tahu Anda yang mana Anda.
Jika keputusannya benar-benar tipis, eksperimen murahnya adalah menjalankan keduanya di dalam harness yang sama pada isu Anda sendiri alih-alih memperdebatkan angka yang dipublikasikan yang tidak berbagi benchmark yang sama. OrcaRouter membawa lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI dengan markup 0%, sehingga harga daftar penyedia diteruskan tanpa diubah — yang memungkinkan untuk menempatkan model umum terkelola dan sisa kumpulan kandidat Anda di balik satu endpoint dan satu jalur penagihan selama Anda memutuskan. FrogNano bukan salah satu rute kami dan tidak ada tanggal untuknya; bobotnya adalah unduhan yang Anda host sendiri. Yang bisa kami hilangkan adalah hambatan di sisi lain perbandingan: menukar model kandidat di harness Anda sendiri tanpa kontrak kedua, SDK kedua, atau set kredensial kedua.

Ringkasan yang jujur adalah bahwa angka 61.5 adalah kerja nyata dari lab yang membuatnya, dan bahwa angka itu saat ini merupakan satu-satunya alasan untuk lebih memilih FrogNano dalam hal pengodean. Ketika seseorang di luar Microsoft mereproduksi 61.5 pada 500 tugas yang sama — atau gagal melakukannya — perbandingan ini akan mendapatkan jawaban yang sesungguhnya. Sampai saat itu, default yang lebih aman untuk sebagian besar tim adalah model 11.95B dengan lisensi yang bersih, pengukuran konteks panjang yang dipublikasikan, dan dua puluh minggu kesalahan orang lain yang sudah diserap ke dalam dokumentasinya.
