Kartu judul yang dihasilkan bertuliskan 'FrogNano-4B-2609 vs LFM2.5 2.6B Base' dengan subjudul 'agen 4B yang sudah selesai melawan checkpoint pra-pelatihan 2,69B', tiga chip bertuliskan 'pasca-pelatihan RL selesai', 'hanya pra-pelatihan, 2,69B dense dalam 30 lapisan' dan 'tanpa penyetelan instruksi', catatan kaki bertuliskan 'Kedua kolom dilaporkan vendor; tidak ada pihak ketiga yang menilai salah satu model pun', dan logo OrcaRouter dikompositkan di sudut kanan bawah.
Engineering & Research

FrogNano-4B-2609 vs LFM2.5 2.6B Base: Spesialis yang Sudah Selesai dan Sekantong Bobot Praterlatih

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ketikkan pertanyaan ke dalam LFM2.5 2.6B Base dan model itu akan melanjutkan kalimat Anda alih-alih menjawabnya. Itu bukan cacat — Liquid AI menerbitkannya sebagai checkpoint pra-latih di bawah keluarga LFM2.5, dengan penyetelan instruksi sengaja diserahkan kepada saudara non-Base-nya, dan kartu modelnya menyatakan dengan gamblang bahwa model ini dimaksudkan untuk penyetelan halus yang berat. FrogNano-4B-2609 milik Microsoft adalah gambaran ujung lain dari alur tersebut: jenis model bahasa kecil yang sama, yang menjalani lima iterasi pembelajaran penguatan pada tugas repositori sintetis sampai menghasilkan panggilan alat terstruktur dan patch kandidat melalui harness lima alat. Tidak satu pun memiliki tolok ukur independen yang dipublikasikan. Perbedaannya adalah salah satunya telah menyelesaikan pasca-pelatihannya, dan mengetahui yang mana merupakan keseluruhan keputusan.

Angka-angka FrogNano di bawah ini berasal dari kartu model dan laporan teknis Microsoft. Angka-angka LFM berasal dari kartu Liquid AI, konfigurasi arsitekturnya, dan file lisensinya. Setiap angka yang dikaitkan dengan salah satu vendor dilabeli sebagai dilaporkan vendor, dan tidak satu pun dari model-model ini yang telah melalui evaluasi pihak ketiga — untuk LFM2.5 2.6B Base, itu sebagian besar memang disengaja, karena checkpoint tanpa penyetelan instruksi bukanlah target yang adil untuk benchmark chat.

Perbandingan hanya berfungsi jika Anda tahu apa yang sedang Anda bandingkan.

Letakkan kedua lembar spesifikasi berdampingan dan hal pertama yang meleset adalah jumlah parameter. LFM2.5 2.6B Base memiliki 2,69 miliar parameter dense dalam 30 lapisan — 22 blok konvolusi pendek dengan gerbang ganda dan 8 lapisan grouped-query-attention, dilatih pada sekitar 34 triliun token dalam 16 bahasa, dengan kosakata 128.000 token dan konteks 131.072 token. Build terkuantisasinya berada di sekitar 1,67 GB dalam Q4_K_M.

Kartu FrogNano-4B-2609 mencantumkan bidang parameternya sebagai rentang "500M-5B", dan ringkasan modelnya menggambarkannya sebagai sekitar 4,66 miliar. Hasil unduhan menyelesaikan perdebatan: dua shard safetensors dengan total 9,32 GB bobot BF16, 738 tensor, pada tumpukan hibrida Gated DeltaNet dan gated-attention dense 32-lapis yang diwarisi. Menara visi 24-lapis berada di checkpoint dan tidak pernah di-post-train.

Jadi rasio ukurannya kira-kira 1,7 banding 1, dan rasio memorinya lebih mendekati 5,6 banding 1 setelah kuantisasi diperhitungkan. Kesenjangan itu lebih penting daripada baris parameternya, karena kedua model ini adalah prospek yang di-host sendiri, bukan endpoint — dan itulah satu-satunya alasan keduanya masuk ke dalam artikel yang sama.

• Tujuan penggunaan — LFM2.5 2.6B Base adalah bahan mentah untuk proses fine-tuning. FrogNano-4B-2609 adalah kebijakan final untuk rekayasa perangkat lunak tingkat repositori di dalam Leaf harness.

• Kepatuhan instruksi — LFM2.5 2.6B Base tidak memilikinya secara bawaan; kartu Liquid AI merekomendasikannya untuk tugas yang memerlukan fine-tuning berat. FrogNano-4B-2609 mengikuti deskripsi tugas dan mengeluarkan panggilan alat terstruktur, karena itulah yang dilatih oleh objektif RL-nya.

• Konteks — 131.072 token untuk LFM2.5 2.6B Base, dibandingkan dengan sekitar 131K token gabungan untuk konfigurasi FrogNano yang dievaluasi. Secara nominal identik, tetapi jendela FrogNano harus menampung hasil tool, keluaran shell, dan log pengujian, bukan hanya prompt.

• Batas keluaran — konfigurasi tervalidasi FrogNano memungkinkan 8.192 token yang dihasilkan per giliran asisten. LFM2.5 2.6B Base tidak menerbitkan padanan, karena tidak dirancang untuk mengakhiri jawaban.

• Modalitas — keduanya hanya teks. Komponen visi FrogNano diwarisi dan secara eksplisit tidak didukung; LFM2.5 2.6B Base secara rancangan adalah teks masuk, teks keluar.

• Lisensi — LFM2.5 2.6B Base berada di bawah LFM Open License v1.0, yang gratis di bawah pendapatan tahunan $10 juta dan memerlukan lisensi terpisah pada atau di atas ambang tersebut, dengan karya turunan mewarisi batas itu. Kartu FrogNano menyebut MIT di bagian depannya dan Apache 2.0 di bagian isinya.

Hal yang dibayar Microsoft, dan hal yang harus Anda bayar sendiri

Inilah bagian yang memikul beban, karena di sinilah perbandingan spesifikasi menyesatkan.

Nilai tambah utama FrogNano-4B-2609 seluruhnya ada pada pasca-pelatihan, dan Microsoft telah mempublikasikan metodenya. Mulai dari Qwen3.5-4B, yang mencetak 39,4% pada SWE-bench Verified melalui harness Leaf sebagai model umum. Hasilkan tugas repositori kandidat dari snapshot nyata, jalankan rollout dari checkpoint saat ini untuk menemukan tugas yang kadang dapat diselesaikannya, simpan tugas-tugas itu, latih, dan ulangi — lima iterasi, totalnya sekitar 1.500 lingkungan sintetis tervalidasi, dan tanpa distilasi dari model yang lebih besar pada titik mana pun. Hasilnya pada kartu Microsoft sendiri adalah 61,5% pada SWE-bench Verified, 37,6% pada SWE-bench Pro, 31,1% pada Terminal-Bench 2.0, dan 47,3% pada PatchEval-Verified. Lampiran efisiensi makalah tersebut melaporkan kenaikan yang sama sebagai 48,2%, 53,4%, 58,3%, 58,6%, dan 61,6% di seluruh iterasi, yang merupakan pengingat berguna bahwa bahkan dua tabel lab itu sendiri dari eksperimen yang sama tidak sepakat soal anak tangganya.

Sekarang bandingkan itu dengan LFM2.5 2.6B Base. Itu adalah checkpoint sebelum pekerjaan tersebut dimulai. Rekomendasi pada kartu modelnya sendiri — lakukan fine-tuning terhadapnya — justru merupakan pekerjaan yang didokumentasikan FrogNano: lingkungan tugas, reward yang dapat dieksekusi, harness yang berjalan lebih lama, dan beberapa iterasi pelatihan terhadap kebijakan yang terus berubah. Makalah tersebut tidak mengklaim bahwa hal itu mudah. Makalah itu melaporkan bahwa checkpoint perantara menjadi semakin mahal untuk dilatih seiring memanjangnya jejak penalaran, bahwa penalti panjang log harus ditambahkan untuk menghentikan drift, dan bahwa iterasi selanjutnya kehilangan kemampuan panggilan alat paralel yang dimiliki model dasar, hingga berakhir pada tingkat panggilan bersamaan 1,71%. Siapa pun yang berencana menjalankan resep FrogNano pada base 2.6B yang berbeda harus menganggarkan secara khusus untuk ketiga masalah tersebut.

Yang diperoleh LFM2.5 2.6B Base adalah jenis keunggulan awal yang berbeda: anggaran pra-pelatihan 34 triliun token, arsitektur hibrida yang terdokumentasi, build terkuantisasi yang sudah ada, dan konteks 131.072 token yang terdokumentasi, semuanya pada ukuran yang dapat berjalan di perangkat keras yang tidak dapat menampung checkpoint BF16 9,32 GB. Jika tugas Anda cukup sempit sehingga fine-tune kecil mengalahkan model umum, itu adalah posisi yang nyata — dan jika bukan, Anda telah menghemat satu proses pelatihan.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

Apa yang harus Anda bangun bagaimanapun juga

Tak satu pun dari keduanya merupakan panggilan jaringan, dan hal itu lebih menentukan perbandingan praktisnya dibandingkan baris spesifikasi mana pun.

LFM2.5 2.6B Base membutuhkan runtime inferensi dan sesi pelatihan. Kartu Liquid AI mencantumkan build format native, GGUF, ONNX, dan MLX, jadi bagian penyajian sudah tercakup dengan baik — llama.cpp di laptop adalah opsi nyata untuk checkpoint terkuantisasi. Bagian pelatihannya menjadi tanggung jawab Anda: data, tujuan, evaluasi, dan cara untuk mengetahui apakah hasilnya menjadi lebih baik atau sekadar berbeda.

FrogNano-4B-2609 menginginkan endpoint yang kompatibel dengan OpenAI dengan parser yang tepat dan klaster Kubernetes dengan izin untuk mengelola pod dan kebijakan jaringan. README Microsoft dengan sangat langsung menyatakan bahwa harness adalah dependensi, bukan sekadar kemudahan, dan kartu tersebut menyatakan bahwa skor yang identik memerlukan checkpoint, tokenizer, konfigurasi penyajian, image tugas, dan protokol evaluasi yang cocok. Konfigurasi bukanlah detail di sini — sajikan tanpa parser penalaran Qwen3 dan parser panggilan alat Qwen3 coder, maka model akan menulis prosa di tempat harness mengharapkan panggilan alat.

Itulah bentuk adu ini: di satu sisi, proyek pelatihan dengan masalah penyajian yang kecil; di sisi lain, proyek penyajian dengan masalah evaluasi yang besar dan tidak ada pelatihan lagi yang perlu dilakukan. Keduanya sama-sama pekerjaan beberapa malam. Hanya salah satunya yang merupakan pekerjaan beberapa malam yang bisa berakhir dengan "modelnya tidak cukup bagus" bukan karena kesalahanmu.

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

Di mana sebuah router membuktikan tempatnya dalam build seperti ini

Kedua model ini akhirnya berada di dalam pipeline yang juga memanggil sesuatu yang dihosting. Rig evaluasi milik FrogNano sendiri adalah buktinya: harness Leaf terhubung ke endpoint yang kompatibel dengan OpenAI, yang berarti model yang diuji dan model apa pun yang Anda bandingkan dengannya diakses melalui antarmuka yang sama. Itu adalah pola yang layak ditiru bahkan ketika alasannya hanya soal kebersihan, dan di situlah satu endpoint melakukan sesuatu yang konkret.

OrcaRouter menyediakan lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI dengan markup 0%, sehingga harga daftar penyedia diteruskan tanpa perubahan dan perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama — itulah angka yang benar-benar berubah saat Anda memutuskan apakah model spesialis yang dihosting sendiri mengalahkan model umum yang dihosting pada biaya per tugas. Failover otomatis mencakup separuh bagian yang dihosting dari perbandingan tersebut, bukan checkpoint yang Anda layani sendiri. Kami tidak menghosting FrogNano-4B-2609 atau LFM2.5 2.6B Base; keduanya adalah unduhan. Yang dihilangkan oleh lapisan perutean adalah integrasi kedua setiap kali sisi yang dihosting dari tolok ukur Anda berubah.

Memilih satu, jujur

Pilih LFM2.5 2.6B Base jika tugas Anda sempit, perangkat keras Anda kecil, dan Anda siap menanggung sendiri proses pelatihannya — lisensinya gratis di bawah pendapatan $10M, build terkuantisasi berukuran 1,67 GB, dan kartu milik Liquid AI sendiri merekomendasikannya untuk tepat hal ini. Tukarannya adalah Anda mendapatkan titik awal, bukan sebuah kemampuan: tidak ada apa pun dalam rilis ini yang memberi tahu Anda berapa skor yang akan dicapai oleh proses RL berbentuk FrogNano di atasnya, dan belum ada yang menerbitkannya.

Pilih FrogNano-4B-2609 jika tugasnya adalah rekayasa perangkat lunak tingkat repositori dan Anda ingin pasca-pelatihan sudah selesai. Angka 61,5%, 37,6%, 31,1%, dan 47,3% adalah hasil terbitan asli dari laboratorium yang menjelaskan metodenya secara rinci — dan saat ini, angka-angka itu juga merupakan lingkaran tertutup: laboratorium yang sama, harness yang sama, baseline model dasar yang sama. Unduhan 9,32 GB, ketergantungan harness, dan lisensi majemuk adalah harga untuk melewati proyek pelatihan yang jika tidak, harus Anda jalankan sendiri.

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

Pembingkaian ulang yang berguna adalah bahwa ini bukan pesaing. LFM2.5 2.6B Base berada di hulu dari proses yang menghasilkan sesuatu seperti FrogNano-4B-2609. Jika Anda mendapati diri Anda memilih di antara keduanya, pertanyaan sebenarnya adalah apakah masalah Anda cukup berharga untuk menjalankan pelatihan sendiri — dan jika jawabannya tidak, checkpoint 4B dengan harness, metode yang dipublikasikan, dan tangga SWE-bench yang dilaporkan vendor adalah yang tiba sudah jadi.