Kartu judul yang dihasilkan bertuliskan 'FrogNano-4B-2609' dengan subjudul 'agen coding 4B pada backbone Qwen3.5-4B', tiga chip bertuliskan '59,6B byte bobot', 'kartu menyebut 22-SEP-2026' dan 'tanpa postingan peluncuran', footer bertuliskan 'Angka menurut kartu model dan laporan teknis Microsoft; tidak ada apa pun di sini yang direproduksi secara independen', dan logo OrcaRouter dikompositkan di sudut kanan bawah.
Engineering & Research

FrogNano-4B-2609: Microsoft Merilis Agen Coding 4B ke Hugging Face dan Tidak Pernah Mengumumkannya

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Repositori ini muncul pada 17 September 2026 dengan commit awal dan checkpoint-nya sendiri mendarat empat menit kemudian. Lalu tidak ada apa-apa. Tidak ada tweet dari Microsoft AI, tidak ada entri di blog Microsoft Research, tidak ada halaman peluncuran. Tujuh minggu kemudian microsoft/FrogNano-4B-2609 — agen coding kelas empat miliar yang dibangun di atas Qwen3.5-4B — masih tidak memiliki pengumuman di belakangnya, dan keheningan itu adalah fakta tunggal paling penting tentang publikasi model ini. Yang dimilikinya adalah kartu model yang mengklaim adanya sebuah makalah dan sebuah harness, repositori GitHub yang ternyata adalah harness dan bukan makalahnya, serta createdAt tertanggal 17 September yang berada di bawah kartu yang bertuliskan "Tanggal rilis 22-SEP-2026". Kedua tanggal itu improvisasi; tak satu pun salah; keduanya saling bertentangan.

Apa yang sebenarnya dipublikasikan

Semua yang di bawah ini dapat diperiksa di hub saat ini, dan setiap angka dalam tulisan ini berasal dari kartu Microsoft sendiri atau dari jumlah byte di repositori itu sendiri. Tidak ada yang direproduksi oleh pihak ketiga — tidak ada entri Artificial Analysis, tidak ada peringkat arena, dan tidak ada evaluasi independen atas FrogNano di mana pun.

• Bobot — satu repositori publik di bawah organisasi Microsoft, tanpa pembatasan, bertanda MIT di hub, 15 file, tanpa gerbang unduhan dan tanpa perjanjian untuk ditandatangani.

• Bobot di disk — 9,32 GB di dua shard safetensors, 59,6 miliar byte data repositori termasuk kumpulan file tanpa optimizer, 738 tensor dalam indeks.

• Arsitektur — Qwen3_5ForConditionalGeneration, tumpukan hibrida padat 32 lapis yang diwarisi dari Qwen3.5-4B, dengan menara visi 24 lapis yang menurut kartu tersebut diwarisi dan tidak pernah menjalani pelatihan lanjutan.

• Bidang parameter kartu itu sendiri — "500M-5B". Itu adalah rentang, bukan angka, dan berkas unduhan adalah dokumen yang lebih akurat.

• Lisensi — bagian pendahulu kartu ini menyatakan MIT. Isi kartu itu sendiri menyatakan Apache License 2.0, dan harness GitHub memang benar-benar menyertakan file LICENSE MIT. Kedua pernyataan itu merujuk pada artefak yang berbeda dalam rilis yang sama.

• Pengumuman — tidak ada. Tidak ada di blog Microsoft Research, tidak ada di situs riset tim itu sendiri, tidak ada di feed organisasi Hugging Face sebagai apa pun selain daftar repositori.

Baris terakhir itu adalah baris yang seharusnya menetapkan sikap pembaca terhadap sisa tulisan ini. Checkpoint yang diunggah secara diam-diam bukanlah artefak yang lebih rendah daripada checkpoint yang diumumkan — kartunya sering kali lebih panjang, karena tidak ada yang menyuntingnya demi siaran pers. Tetapi ia belum melewati satu filter yang didapat gratis oleh rilis yang diumumkan: orang lain yang melihatnya.

A screenshot of Microsoft's Hugging Face model card for FrogNano-4B-2609 showing the model summary table with rows for Developer (Microsoft Corporation), Description, Model architecture, Parameters (500M-5B), Inputs, Outputs, Context length (approximately 131K tokens in the evaluated coding-agent configuration), Training Dates (Jun 2026 to Aug 2026), Release date (22-SEP-2026), License (Apache License 2.0), the Qwen/Qwen3.5-4B model dependency, the 'Technical report;' and 'Leaf harness.' asset links, and the section 1 Model overview naming Qwen3.5-4B and the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

Skor-skor itu, dan siapa yang menghasilkan masing-masingnya.

Microsoft melaporkan FrogNano mencapai 61,5% pada SWE-bench Verified, 37,6% pada SWE-bench Pro, 31,1% pada Terminal-Bench 2.0, dan 47,3% pada PatchEval-Verified, semuanya sebagai tingkat resolusi Avg@3 yang diukur melalui Leaf harness. Kartu yang sama memberikan titik awal: Qwen3.5-4B memperoleh 39,4% pada SWE-bench Verified di bawah harness dan anggaran yang identik. Lima iterasi reinforcement learning membawanya melalui 49,1%, 53,1%, 56,7%, 59,1% dan 61,5% — 22,1 poin di atas model dasar, yang dalam kerangka Microsoft sendiri dibulatkan menjadi sekitar 56% peningkatan relatif.

Ada dua hal tentang tangga itu yang patut direnungkan, karena keduanya adalah titik tempat sebuah ringkasan bisa keliru, bukan titik tempat vendor melakukan kesalahan.

Yang pertama adalah ketidaksesuaian Iterasi 5. Tabel utama kartu menyebut 61,5% untuk iterasi terakhir; lampiran efisiensi milik makalah itu sendiri melaporkan perkembangan lima checkpoint yang sama sebagai 48,2%, 53,4%, 58,3%, 58,6%, dan 61,6%. Hanya angka terakhir yang mendekati, dan hanya angka terakhir yang dikutip orang. Perlakukan angka final sebagai hasil yang stabil dan tingkat perantara sebagai pengukuran hal-hal yang berbeda, karena dengan agregasi yang berbeda, hal itu jelas memang demikian.

Kedua, FrogNano tidak secara seragam lebih baik daripada model yang menjadi titik awalnya di semua aspek. Tingkat panggilan alat paralel yang dipublikasikan adalah 1,71%. Kartu model itu jujur bahwa iterasi selanjutnya kehilangan kemampuan untuk memicu beberapa panggilan alat dalam satu giliran, dan bahwa pekerjaan konsolidasi tim sebagian ada untuk memulihkannya. Model yang menyelesaikan lebih banyak masalah namun hampir tidak mengeluarkan panggilan bersamaan adalah trade-off rekayasa yang nyata, bukan sekadar catatan kaki.

A generated two-column scoreboard reading 'Microsoft reports' on the left with rows Qwen3.5-4B base 39.4%, Iter 2 49.1%, Iter 4 59.1% and Iter 5 61.5%, and 'What is not verified' on the right with rows Independent evaluation: none, Parallel tool calls: 1.71%, Repository size: 59.6B bytes, Card release date: 22-SEP-2026 and Hub created: 17-SEP-2026, with a footer reading 'All scores vendor-reported through the Leaf harness; no third party has reproduced any of them.'

Harness adalah produk, dan repositori adalah harness.

FrogNano tidak berjalan sendiri. Ia mengeluarkan panggilan terstruktur ke lima alat — Read, Write, Edit, Glob dan Bash — dan sesuatu harus menjalankannya di lingkungan terisolasi dan mengembalikan outputnya. Sesuatu itu adalah Leaf, dan di sini jejaknya melakukan sesuatu yang agak tidak biasa.

Baris "aset terkait tambahan" pada kartu model menautkan laporan teknis di aka.ms/frognano-tech-report dan sebuah harness di github.com/microsoft/FrogNano. Tautan aka.ms tidak mengarah ke PDF; tautan itu mengalihkan langsung ke halaman abstrak arXiv, tempat laporan yang sebenarnya berada. Sementara itu, repositori GitHub tidak berisi kode pelatihan, tidak ada resep RL, dan tidak ada checkpoint. README-nya sendiri mendeskripsikan harness evaluasi yang menjalankan agen coding di sandbox Kubernetes terhadap endpoint yang kompatibel dengan OpenAI, dan mengarahkan kembali ke makalah arXiv untuk kisah pelatihannya. Jadi, kedua tautan aset pada kartu tersebut adalah penunjuk ke makalah dan penunjuk ke balasan makalah, dan namanya sama.

Ini penting bagi siapa pun yang berencana menggunakan model tersebut, karena alasan praktis. Resep penyajian yang didokumentasikan adalah SGLang dengan --reasoning-parser qwen3 --tool-call-parser qwen3_coder, dan harness menginginkan endpoint yang sudah mendukung pemanggilan alat dan penalaran. Jika konfigurasi parsing sedikit saja salah, model akan menghasilkan teks di tempat harness mengharapkan JSON, yang jika dilihat dari luar tampak persis seperti model buruk, bukan konfigurasi buruk. Kartu tersebut secara eksplisit menyatakan bahwa skor yang cocok memerlukan checkpoint, tokenizer, konfigurasi penyajian, gambar tugas, dan protokol evaluasi yang cocok — itu adalah vendor yang memberi tahu Anda bahwa harness adalah separuh dari hasilnya.

Juga perlu dinyatakan secara gamblang bagi siapa pun yang memperhitungkan kebutuhan perangkat keras: checkpoint 9.32 GB pada konteks yang dievaluasi kartu model tersebut bukanlah masalah inferensi 9.32 GB. Evaluasi dijalankan pada sekitar 131K token gabungan dengan anggaran 150 langkah. Memori berskala dengan konteks, bukan dengan bobot, dan kartu model tersebut menyatakan konfigurasi GPU minimum masih "harus divalidasi sebelum rilis" — frasa yang muncul pada model yang sudah dapat diunduh.

Apa yang sebenarnya dilakukan pelatihan itu, dalam satu paragraf

Kontribusi makalah ini bukan modelnya, melainkan loopnya. TaskPilot menghasilkan kandidat tugas rekayasa perangkat lunak dari snapshot repositori nyata, menjalankan rollout dari checkpoint saat ini terhadap tugas-tugas itu, mempertahankan tugas yang berada di sekitar batas kemampuan yang kadang dapat dipecahkan oleh kebijakan, dan membuang kandidat yang secara permanen trivial atau secara permanen mustahil. Himpunan yang diterima melatih checkpoint berikutnya. Checkpoint berikutnya itu kemudian mengkalibrasi putaran berikutnya dari pembuatan tugas, sehingga distribusi tugas bergeser seiring kebijakan bergeser. Secara total sekitar 1.500 lingkungan tervalidasi. Tanpa distilasi: kartu tersebut menyatakan secara gamblang bahwa pasca-pelatihan khusus agen tidak menggunakan trajektori solusi, aksi, jejak penalaran, atau target patch dari model yang lebih kuat. Model yang lebih kuat menulis tugas; mereka tidak menunjukkan jawabannya.

Microsoft menjalankan loop tersebut selama lima iterasi dan melaporkan kenaikan 8,7 poin sebelum konsolidasi apa pun, dengan penalti panjang log yang ditambahkan di tengah proses karena jejak penalaran bertambah panjang lebih cepat daripada peningkatannya.

Kartu model ini secara tidak biasa terus terang tentang di mana seluruh pendekatan ini rapuh. Data pelatihan didominasi Python dan sebagian besar berbahasa Inggris; kumpulan bahasa alami yang didukung yang dinyatakan dalam kartu adalah bahasa Inggris dan tidak ada yang lain, dengan cakupan multibahasa yang lebih luas dari model dasar secara eksplisit tidak diklaim. Kinerja sensitif terhadap harness dan terhadap kualitas pengujian. Patch yang dihasilkan "mungkin salah atau tidak aman meskipun lulus pengujian yang tersedia." Kartu model untuk 4B menutup paragraf itu dengan kalimat yang harus dipegang setiap pembaca: tidak boleh digunakan tanpa tinjauan manusia yang berkualifikasi dan pengujian regresi serta keamanan yang independen. Itu adalah pernyataan vendor tentang artefak vendor, dan itu adalah kalimat yang lebih berguna daripada baris papan skor mana pun di atasnya.

Apa dampaknya bagi pembeli, dan di mana router berperan

FrogNano bukanlah model yang Anda panggil. Tidak ada API pihak pertama, tidak ada endpoint yang dihosting, dan tidak ada image serverless. Ini adalah checkpoint, dan menggunakannya berarti entah menjalankan deployment SGLang Anda sendiri di balik sandbox yang dihosting Kubernetes, atau mengevaluasinya sebagai komponen di dalam tumpukan agen yang sudah Anda operasikan. Itulah keseluruhan jalur adopsi saat ini, dan tidak ada pengumuman yang akan mengubah bentuknya.

Yang bisa dilakukan lapisan routing di sini secara jujur adalah hal yang lebih sempit daripada kesan awalnya. Jika rencananya adalah membandingkan FrogNano yang di-self-host dengan model coding yang di-hosting di dalam harness Anda sendiri, separuh yang di-hosting adalah separuh yang diuntungkan karena berada di balik satu kunci alih-alih kontrak kedua: OrcaRouter membawa 200+ model di balik satu endpoint yang kompatibel dengan OpenAI dengan markup 0%, artinya harga daftar penyedia diteruskan tanpa diubah dan perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama. Itu penting untuk bake-off yang hasilnya ditentukan oleh biaya per masalah yang diselesaikan alih-alih oleh satu angka benchmark. Kami tidak menghosting FrogNano dan tidak ada tanggal untuknya; bobot dan pekerjaan serving menjadi milik Anda.

A generated timeline card headed 'One model, three dates' with three markers: 17 September 2026 labelled 'Hugging Face creation timestamp', 22 September 2026 labelled 'Release date printed on the model card', and 2 October 2026 labelled 'Most recent file update', with a footer reading 'No announcement accompanied any of the three. Dates read from the Hugging Face repository history on 3 October 2026.'

Tiga hal yang menyelesaikannya

Pertama, reproduksi independen. Setiap angka dalam artikel ini — 61.5, 37.6, 31.1, 47.3 — dihasilkan oleh lab yang melatih model, pada harness yang dipelihara lab yang sama, terhadap angka model dasar yang diukur lab yang sama. Itu adalah gambaran yang lengkap dan konsisten secara internal, dan juga merupakan lingkaran tertutup. Uji yang berguna adalah apakah seseorang tanpa kepentingan dapat mereproduksi lonjakan 39.4 ke 61.5 pada 500 tugas yang sama tanpa pekerjaan kalibrasi Microsoft pada set tugas tersebut.

Kedua, seseorang harus memeriksa klaim harness itu secara menyeluruh dari awal sampai akhir. Repositori itu publik, yang sudah lebih dari yang mampu dilakukan banyak rilis, tetapi itu adalah rig evaluasi. Jika lima alat dan isolasi sandbox benar-benar merupakan mekanisme kinerjanya, pihak ketiga yang menjalankan konfigurasi yang dipublikasikan seharusnya mendapatkan angka yang mendekati angka yang dipublikasikan. Jika tidak, kesenjangan itulah temuan sebenarnya.

Ketiga, dan yang paling murah untuk dijawab: Microsoft harus menyatakan apakah ini produk atau artefak di atas kertas. Bagian distribusi kartu memperlakukan bobot, kartu, dan harness sebagai hasil yang harus diserahkan, yang terbaca seperti publikasi ketimbang peluncuran. “Tanggal rilis 22-SEP-2026” terbaca seperti peluncuran. Model yang diumumkan akan mengatasi ambiguitas itu di kalimat pertama pos blog, dan tidak ada pos blog.

Sampai saat itu, sikap yang tepat adalah sikap yang disiratkan oleh rilis itu sendiri. FrogNano-4B-2609 adalah checkpoint MIT-and-Apache-and-maybe-not yang nyata dan dapat diunduh, dengan kartu yang sangat menyeluruh, harness evaluasi publik, gagasan metodologis yang autentik, dan papan skor yang belum pernah disentuh oleh siapa pun yang tidak memiliki alamat Microsoft. Bagi sebuah laboratorium, itu adalah artefak yang lengkap dan menarik. Bagi tim yang akan menempatkan agen di depan repositori pada pukul tiga pagi, ini adalah petunjuk yang layak ditindaklanjuti dan belum merupakan keputusan yang layak diambil.