
FrogNano-4B-2609 vs LFM2.5 2.6B Base: Spesialis yang Sudah Selesai dan Sekantong Bobot Praterlatih
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 219 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Ketikkan pertanyaan ke dalam LFM2.5 2.6B Base dan model itu akan melanjutkan kalimat Anda alih-alih menjawabnya. Itu bukan cacat — Liquid AI menerbitkannya sebagai checkpoint pra-latih di bawah keluarga LFM2.5, dengan penyetelan instruksi sengaja diserahkan kepada saudara non-Base-nya, dan kartu modelnya menyatakan dengan gamblang bahwa model ini dimaksudkan untuk penyetelan halus yang berat. FrogNano-4B-2609 milik Microsoft adalah gambaran ujung lain dari alur tersebut: jenis model bahasa kecil yang sama, yang menjalani lima iterasi pembelajaran penguatan pada tugas repositori sintetis sampai menghasilkan panggilan alat terstruktur dan patch kandidat melalui harness lima alat. Tidak satu pun memiliki tolok ukur independen yang dipublikasikan. Perbedaannya adalah salah satunya telah menyelesaikan pasca-pelatihannya, dan mengetahui yang mana merupakan keseluruhan keputusan.
Angka-angka FrogNano di bawah ini berasal dari kartu model dan laporan teknis Microsoft. Angka-angka LFM berasal dari kartu Liquid AI, konfigurasi arsitekturnya, dan file lisensinya. Setiap angka yang dikaitkan dengan salah satu vendor dilabeli sebagai dilaporkan vendor, dan tidak satu pun dari model-model ini yang telah melalui evaluasi pihak ketiga — untuk LFM2.5 2.6B Base, itu sebagian besar memang disengaja, karena checkpoint tanpa penyetelan instruksi bukanlah target yang adil untuk benchmark chat.
Perbandingan hanya berfungsi jika Anda tahu apa yang sedang Anda bandingkan.
Letakkan kedua lembar spesifikasi berdampingan dan hal pertama yang meleset adalah jumlah parameter. LFM2.5 2.6B Base memiliki 2,69 miliar parameter dense dalam 30 lapisan — 22 blok konvolusi pendek dengan gerbang ganda dan 8 lapisan grouped-query-attention, dilatih pada sekitar 34 triliun token dalam 16 bahasa, dengan kosakata 128.000 token dan konteks 131.072 token. Build terkuantisasinya berada di sekitar 1,67 GB dalam Q4_K_M.
Kartu FrogNano-4B-2609 mencantumkan bidang parameternya sebagai rentang "500M-5B", dan ringkasan modelnya menggambarkannya sebagai sekitar 4,66 miliar. Hasil unduhan menyelesaikan perdebatan: dua shard safetensors dengan total 9,32 GB bobot BF16, 738 tensor, pada tumpukan hibrida Gated DeltaNet dan gated-attention dense 32-lapis yang diwarisi. Menara visi 24-lapis berada di checkpoint dan tidak pernah di-post-train.
Jadi rasio ukurannya kira-kira 1,7 banding 1, dan rasio memorinya lebih mendekati 5,6 banding 1 setelah kuantisasi diperhitungkan. Kesenjangan itu lebih penting daripada baris parameternya, karena kedua model ini adalah prospek yang di-host sendiri, bukan endpoint — dan itulah satu-satunya alasan keduanya masuk ke dalam artikel yang sama.
• Tujuan penggunaan — LFM2.5 2.6B Base adalah bahan mentah untuk proses fine-tuning. FrogNano-4B-2609 adalah kebijakan final untuk rekayasa perangkat lunak tingkat repositori di dalam Leaf harness.
• Kepatuhan instruksi — LFM2.5 2.6B Base tidak memilikinya secara bawaan; kartu Liquid AI merekomendasikannya untuk tugas yang memerlukan fine-tuning berat. FrogNano-4B-2609 mengikuti deskripsi tugas dan mengeluarkan panggilan alat terstruktur, karena itulah yang dilatih oleh objektif RL-nya.
• Konteks — 131.072 token untuk LFM2.5 2.6B Base, dibandingkan dengan sekitar 131K token gabungan untuk konfigurasi FrogNano yang dievaluasi. Secara nominal identik, tetapi jendela FrogNano harus menampung hasil tool, keluaran shell, dan log pengujian, bukan hanya prompt.
• Batas keluaran — konfigurasi tervalidasi FrogNano memungkinkan 8.192 token yang dihasilkan per giliran asisten. LFM2.5 2.6B Base tidak menerbitkan padanan, karena tidak dirancang untuk mengakhiri jawaban.
• Modalitas — keduanya hanya teks. Komponen visi FrogNano diwarisi dan secara eksplisit tidak didukung; LFM2.5 2.6B Base secara rancangan adalah teks masuk, teks keluar.
• Lisensi — LFM2.5 2.6B Base berada di bawah LFM Open License v1.0, yang gratis di bawah pendapatan tahunan $10 juta dan memerlukan lisensi terpisah pada atau di atas ambang tersebut, dengan karya turunan mewarisi batas itu. Kartu FrogNano menyebut MIT di bagian depannya dan Apache 2.0 di bagian isinya.
Hal yang dibayar Microsoft, dan hal yang harus Anda bayar sendiri
Inilah bagian yang memikul beban, karena di sinilah perbandingan spesifikasi menyesatkan.
Nilai tambah utama FrogNano-4B-2609 seluruhnya ada pada pasca-pelatihan, dan Microsoft telah mempublikasikan metodenya. Mulai dari Qwen3.5-4B, yang mencetak 39,4% pada SWE-bench Verified melalui harness Leaf sebagai model umum. Hasilkan tugas repositori kandidat dari snapshot nyata, jalankan rollout dari checkpoint saat ini untuk menemukan tugas yang kadang dapat diselesaikannya, simpan tugas-tugas itu, latih, dan ulangi — lima iterasi, totalnya sekitar 1.500 lingkungan sintetis tervalidasi, dan tanpa distilasi dari model yang lebih besar pada titik mana pun. Hasilnya pada kartu Microsoft sendiri adalah 61,5% pada SWE-bench Verified, 37,6% pada SWE-bench Pro, 31,1% pada Terminal-Bench 2.0, dan 47,3% pada PatchEval-Verified. Lampiran efisiensi makalah tersebut melaporkan kenaikan yang sama sebagai 48,2%, 53,4%, 58,3%, 58,6%, dan 61,6% di seluruh iterasi, yang merupakan pengingat berguna bahwa bahkan dua tabel lab itu sendiri dari eksperimen yang sama tidak sepakat soal anak tangganya.
Sekarang bandingkan itu dengan LFM2.5 2.6B Base. Itu adalah checkpoint sebelum pekerjaan tersebut dimulai. Rekomendasi pada kartu modelnya sendiri — lakukan fine-tuning terhadapnya — justru merupakan pekerjaan yang didokumentasikan FrogNano: lingkungan tugas, reward yang dapat dieksekusi, harness yang berjalan lebih lama, dan beberapa iterasi pelatihan terhadap kebijakan yang terus berubah. Makalah tersebut tidak mengklaim bahwa hal itu mudah. Makalah itu melaporkan bahwa checkpoint perantara menjadi semakin mahal untuk dilatih seiring memanjangnya jejak penalaran, bahwa penalti panjang log harus ditambahkan untuk menghentikan drift, dan bahwa iterasi selanjutnya kehilangan kemampuan panggilan alat paralel yang dimiliki model dasar, hingga berakhir pada tingkat panggilan bersamaan 1,71%. Siapa pun yang berencana menjalankan resep FrogNano pada base 2.6B yang berbeda harus menganggarkan secara khusus untuk ketiga masalah tersebut.
Yang diperoleh LFM2.5 2.6B Base adalah jenis keunggulan awal yang berbeda: anggaran pra-pelatihan 34 triliun token, arsitektur hibrida yang terdokumentasi, build terkuantisasi yang sudah ada, dan konteks 131.072 token yang terdokumentasi, semuanya pada ukuran yang dapat berjalan di perangkat keras yang tidak dapat menampung checkpoint BF16 9,32 GB. Jika tugas Anda cukup sempit sehingga fine-tune kecil mengalahkan model umum, itu adalah posisi yang nyata — dan jika bukan, Anda telah menghemat satu proses pelatihan.

Apa yang harus Anda bangun bagaimanapun juga
Tak satu pun dari keduanya merupakan panggilan jaringan, dan hal itu lebih menentukan perbandingan praktisnya dibandingkan baris spesifikasi mana pun.
LFM2.5 2.6B Base membutuhkan runtime inferensi dan sesi pelatihan. Kartu Liquid AI mencantumkan build format native, GGUF, ONNX, dan MLX, jadi bagian penyajian sudah tercakup dengan baik — llama.cpp di laptop adalah opsi nyata untuk checkpoint terkuantisasi. Bagian pelatihannya menjadi tanggung jawab Anda: data, tujuan, evaluasi, dan cara untuk mengetahui apakah hasilnya menjadi lebih baik atau sekadar berbeda.
FrogNano-4B-2609 menginginkan endpoint yang kompatibel dengan OpenAI dengan parser yang tepat dan klaster Kubernetes dengan izin untuk mengelola pod dan kebijakan jaringan. README Microsoft dengan sangat langsung menyatakan bahwa harness adalah dependensi, bukan sekadar kemudahan, dan kartu tersebut menyatakan bahwa skor yang identik memerlukan checkpoint, tokenizer, konfigurasi penyajian, image tugas, dan protokol evaluasi yang cocok. Konfigurasi bukanlah detail di sini — sajikan tanpa parser penalaran Qwen3 dan parser panggilan alat Qwen3 coder, maka model akan menulis prosa di tempat harness mengharapkan panggilan alat.
Itulah bentuk adu ini: di satu sisi, proyek pelatihan dengan masalah penyajian yang kecil; di sisi lain, proyek penyajian dengan masalah evaluasi yang besar dan tidak ada pelatihan lagi yang perlu dilakukan. Keduanya sama-sama pekerjaan beberapa malam. Hanya salah satunya yang merupakan pekerjaan beberapa malam yang bisa berakhir dengan "modelnya tidak cukup bagus" bukan karena kesalahanmu.

Di mana sebuah router membuktikan tempatnya dalam build seperti ini
Kedua model ini akhirnya berada di dalam pipeline yang juga memanggil sesuatu yang dihosting. Rig evaluasi milik FrogNano sendiri adalah buktinya: harness Leaf terhubung ke endpoint yang kompatibel dengan OpenAI, yang berarti model yang diuji dan model apa pun yang Anda bandingkan dengannya diakses melalui antarmuka yang sama. Itu adalah pola yang layak ditiru bahkan ketika alasannya hanya soal kebersihan, dan di situlah satu endpoint melakukan sesuatu yang konkret.
OrcaRouter menyediakan lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI dengan markup 0%, sehingga harga daftar penyedia diteruskan tanpa perubahan dan perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama — itulah angka yang benar-benar berubah saat Anda memutuskan apakah model spesialis yang dihosting sendiri mengalahkan model umum yang dihosting pada biaya per tugas. Failover otomatis mencakup separuh bagian yang dihosting dari perbandingan tersebut, bukan checkpoint yang Anda layani sendiri. Kami tidak menghosting FrogNano-4B-2609 atau LFM2.5 2.6B Base; keduanya adalah unduhan. Yang dihilangkan oleh lapisan perutean adalah integrasi kedua setiap kali sisi yang dihosting dari tolok ukur Anda berubah.
Memilih satu, jujur
Pilih LFM2.5 2.6B Base jika tugas Anda sempit, perangkat keras Anda kecil, dan Anda siap menanggung sendiri proses pelatihannya — lisensinya gratis di bawah pendapatan $10M, build terkuantisasi berukuran 1,67 GB, dan kartu milik Liquid AI sendiri merekomendasikannya untuk tepat hal ini. Tukarannya adalah Anda mendapatkan titik awal, bukan sebuah kemampuan: tidak ada apa pun dalam rilis ini yang memberi tahu Anda berapa skor yang akan dicapai oleh proses RL berbentuk FrogNano di atasnya, dan belum ada yang menerbitkannya.
Pilih FrogNano-4B-2609 jika tugasnya adalah rekayasa perangkat lunak tingkat repositori dan Anda ingin pasca-pelatihan sudah selesai. Angka 61,5%, 37,6%, 31,1%, dan 47,3% adalah hasil terbitan asli dari laboratorium yang menjelaskan metodenya secara rinci — dan saat ini, angka-angka itu juga merupakan lingkaran tertutup: laboratorium yang sama, harness yang sama, baseline model dasar yang sama. Unduhan 9,32 GB, ketergantungan harness, dan lisensi majemuk adalah harga untuk melewati proyek pelatihan yang jika tidak, harus Anda jalankan sendiri.

Pembingkaian ulang yang berguna adalah bahwa ini bukan pesaing. LFM2.5 2.6B Base berada di hulu dari proses yang menghasilkan sesuatu seperti FrogNano-4B-2609. Jika Anda mendapati diri Anda memilih di antara keduanya, pertanyaan sebenarnya adalah apakah masalah Anda cukup berharga untuk menjalankan pelatihan sendiri — dan jika jawabannya tidak, checkpoint 4B dengan harness, metode yang dipublikasikan, dan tangga SWE-bench yang dilaporkan vendor adalah yang tiba sudah jadi.
