
FrogNano-4B-2609 vs Qwen 3.8: Berapa Biaya Agen Coding Ketika Bobotnya Milik Anda
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 219 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
microsoft/FrogNano-4B-2609 adalah agen repositori kelas empat miliar parameter yang diturunkan dari Qwen3.5-4B yang Anda unduh dan layani sendiri. Qwen3.8-Max adalah unggulan yang dihosting — model sparse mixture-of-experts 2,4 triliun parameter dengan sekitar 95 miliar parameter aktif per token, jendela multimodal satu juta token, dan daftar tarif $2,00 per juta token input dan $6,00 per juta token output — dapat diakses dengan kunci API sejak 3 Agustus 2026. Salah satunya memerlukan GPU dan waktu satu sore. Yang lain tidak memerlukan biaya sampai Anda menggunakannya, lalu menagih per token pada lintasan terpanjang yang umum digunakan. Pertukaran itulah, bukan tabel benchmark, yang menjadi pertandingan sebenarnya.
Angka FrogNano di sini berasal dari kartu model dan laporan teknis Microsoft; angka Qwen3.8-Max berasal dari harga yang dipublikasikan Alibaba dan catatan model di katalog kami sendiri, dengan skor independen dilabeli sebagai angka Artificial Analysis di mana pun skor itu muncul. Perhatikan penamaannya dengan saksama: Qwen3.8, rilis bobot terbuka, telah diumumkan tetapi belum dirilis, sedangkan Qwen3.8-Max sudah aktif dan sudah diberi harga hari ini. Semua yang dapat dipanggil dalam artikel ini adalah yang terakhir.
Aritmetika yang menentukan perbandingan
Mulailah dari berapa biaya satu tugas, karena hal itu tidak jelas dan tidak kecil.
Evaluasi FrogNano menjalankan setiap trajektori dengan anggaran 150 langkah dalam sekitar 131K token gabungan, hingga 8.192 token yang dihasilkan per giliran asisten, dan batas 10.800 detik. Kalikan dua batas yang dipublikasikan itu dan Anda mendapatkan batas sekitar 1,23 juta token yang dihasilkan untuk satu trajektori kasus terburuk — yang pada Qwen3.8-Max $6,00 per juta token keluaran adalah sekitar $7,38 untuk satu tugas yang berjalan sampai akhir anggarannya. Itu aritmetika atas dua angka yang dipublikasikan, bukan pengukuran: trajektori nyata berhenti lebih awal, rata-ratanya jauh di bawah batas, dan hasil alat serta keluaran shell ditagih pada tarif input yang lebih murah daripada tarif output. Tapi itu menunjukkan bentuk persoalannya. Agen coding tidak menghabiskan beberapa ratus token untuk sebuah pertanyaan; ia menghabiskan percakapan panjang yang padat penalaran dengan dirinya sendiri, dan setiap token dari percakapan itu dihasilkan.
Sekarang letakkan sisi lain dari buku besar di sebelahnya. FrogNano-4B-2609 adalah 9,32 GB bobot BF16 dalam dua shard, yang dapat diunduh tanpa gate. Untuk melayaninya dibutuhkan SGLang dengan parser penalaran Qwen3 dan parser pemanggilan alat coder Qwen3, plus sandbox terisolasi untuk kelima alat tersebut. Setelah itu, biaya marjinal sebuah trajektori adalah listrik, dan memori yang ditempatinya adalah sebesar apa pun konteks Anda membesar, bukan seberapa berat bobotnya.
• Model biaya — FrogNano-4B-2609 adalah biaya perangkat keras tetap dan biaya marginal mendekati nol. Qwen3.8-Max adalah biaya tetap nol dan penagihan per token, dengan pembagian $2.00 / $6.00 yang tidak membebankan apa pun di awal dan membebankan semuanya di akhir pada tarif output.
• Apa yang uang itu beli — agen kelas 4B di silikon Anda sendiri, dibandingkan model berskala frontier yang tidak pernah perlu Anda rencanakan kapasitasnya.
• Titik impas — tercapai ketika volume trajektori bulanan Anda dikalikan dengan rata-rata tagihan token per trajektori melebihi biaya GPU yang jika tidak akan Anda sewa. Bagi tim yang menjalankan beberapa tugas repositori sehari, garis itu masih jauh dan model yang dihosting unggul hanya dari segi kenyamanan.
Dua model yang tidak melakukan pekerjaan yang sama
Perbandingan biaya hanya adil jika keluarannya sebanding, dan di sini tidak demikian, dan itulah bagian yang paling sering disembunyikan oleh sebagian besar lembar spesifikasi.
FrogNano-4B-2609 dilatih pascapelatihan secara eksklusif pada rekayasa perangkat lunak tingkat repositori. Seluruh antarmukanya adalah loop lima alat — Read, Write, Edit, Glob dan Bash — dijalankan oleh Leaf harness di sandbox terisolasi, mengulang sampai model berhenti memanggil. Kartu Microsoft menyatakan bahasa yang didukungnya adalah bahasa Inggris dan domain pemrograman yang divalidasi adalah Python, serta menyatakan secara terang-terangan bahwa komponen gambar dan video dalam checkpoint tidak pernah dilatih pascapelatihan dan tidak didukung. Ia tidak menalar tentang arsitektur Anda, tidak menjawab pertanyaan tentang bisnis Anda, atau tidak membaca tangkapan layar.
Qwen3.8-Max adalah model umum. Catatan katalog Alibaba memberinya input teks, gambar, dan video dengan output teks serta jendela konteks 1.000.000 token. Ia bernalar, menulis, membaca dokumen, dan melakukan percakapan, dan pemanggilan fungsinya adalah fitur dari model umum, bukan keseluruhan inti dari checkpoint tersebut. Angka Artificial Analysis-nya, yang dibaca dari catatan pada 2 September 2026, adalah Intelligence Index 45,4 dan Coding Index 76,2.
• Masukan — FrogNano-4B-2609 hanya teks. Qwen3.8-Max menerima teks, gambar, dan video.
Konteks — sekitar 131K token gabungan untuk konfigurasi FrogNano yang dievaluasi, dibandingkan dengan 1.000.000 untuk Qwen3.8-Max. Itu berarti faktor tujuh setengah, dan hal ini paling penting justru untuk input seukuran repositori yang diterima agen pengodean.
• Output per giliran — konfigurasi tervalidasi FrogNano membatasi satu giliran asisten hingga 8.192 token. Qwen3.8-Max tidak menerbitkan batas per respons yang setara.
• Format keluaran — FrogNano mengeluarkan panggilan alat Leaf terstruktur dan memerlukan harness untuk mengeksekusinya. Qwen3.8-Max mengembalikan prosa atau panggilan fungsi ke klien apa pun yang sudah Anda miliki.
• Skor independen — tidak ada untuk FrogNano-4B-2609 di luar kartunya sendiri; angka Qwen3.8-Max di atas berasal dari pihak ketiga, dari Artificial Analysis.
• Parameter — sekitar 4,66B untuk FrogNano menurut deskripsi kartunya sendiri, dibandingkan dengan total 2,4 triliun dan sekitar 95B aktif untuk Qwen3.8-Max.

Di mana 4B sebenarnya layak mendapatkan tempatnya
Ada satu dimensi di mana agen 4B benar-benar mengalahkan model frontier, dan itu bukan akurasi.
Makalah FrogNano dimulai dari Qwen3.5-4B, yang mencetak 39,4% pada SWE-bench Verified melalui Leaf harness sebagai model umum biasa. Lima iterasi pembelajaran penguatan pada sekitar 1.500 tugas sintetis membawanya ke 61,5%, dengan lampiran makalah yang sama melaporkan perkembangan per iterasi sebesar 48,2%, 53,4%, 58,3%, 58,6%, dan 61,6%. Metode ini — menghasilkan tugas yang dikalibrasi terhadap batas daya pelajari kebijakan saat ini, tanpa distilasi dari model yang lebih kuat — adalah kontribusinya, dan alasan sebuah kelompok riset tanpa anggaran model terdepan akan peduli.
Bacalah apa implikasinya bagi perbandingan itu. Kartu Microsoft dengan jujur menyatakan bahwa FrogNano tidak secara merata lebih baik daripada model asal yang menghasilkannya: tingkat panggilan alat paralelnya adalah 1,71%, karena iterasi-iterasi berikutnya kehilangan kemampuan untuk memicu panggilan bersamaan, dan tim menambahkan tahap konsolidasi untuk mencoba memulihkannya. Model yang menyelesaikan lebih banyak masalah tetapi menjadi lebih buruk dalam satu perilaku tertentu adalah artefak rekayasa nyata dengan sambungan yang terlihat, dan kartunya menyatakan demikian alih-alih menguburnya.
Dan angka SWE-bench adalah lingkaran tertutup. Baseline model dasar, harness, dan skor akhir semuanya berasal dari lab yang sama, dan dua tabel dalam makalah yang sama memberikan dua tangga berbeda untuk eksperimen yang sama. Sebaliknya, angka coding Qwen3.8-Max dihasilkan oleh Artificial Analysis, bukan oleh Alibaba — jenis bukti yang berbeda, jenis keyakinan yang berbeda, dan keduanya tidak boleh saling dikurangkan.
4B yang belum sepenuhnya bisa Anda perhitungkan
Ada dua hal yang menghalangi FrogNano-4B-2609 menuju slot produksi, dan keduanya ada dalam dokumentasinya sendiri, bukan dalam pendapat peninjau mana pun.
Yang pertama adalah perangkat keras. Kartu tersebut menyebutkan persyaratan bobot BF16 sekitar 9,3 GB lalu menambahkan bahwa memori "meningkat secara signifikan seiring konteks gabungan mendekati sekitar 131K token", sebelum menyatakan bahwa model GPU minimum yang tepat, konfigurasi VRAM, versi runtime, dan profil performa "masih harus divalidasi sebelum rilis" — kalimat yang muncul pada model yang sudah dapat diunduh. Tidak ada yang memublikasikan angka VRAM untuk konfigurasi yang dievaluasi, dan kartu tersebut tidak memuatnya.
Yang kedua adalah postur keselamatan. Catatan penyelarasan Microsoft sendiri menyatakan bahwa pasca-pelatihan khusus agen tidak menggunakan dataset preferensi keselamatan, penolakan, konten berbahaya, maupun adversarial; bahwa pasca-pelatihan itu justru dioptimalkan untuk kebenaran fungsional dan penghindaran regresi; dan bahwa model tersebut "tidak boleh dianggap selaras keselamatan secara independen untuk penerapan otonom tanpa batas". Kartu tersebut diakhiri dengan menyebutkan risiko-risiko konkret: patch mungkin salah atau tidak aman meskipun lulus pengujiannya, kinerja sensitif terhadap kualitas pengujian tersebut, dan setiap patch kandidat memerlukan tinjauan manusia yang berkualifikasi serta pengujian regresi dan keamanan yang independen sebelum digunakan. Model umum yang dihosting tidak membawa satu pun peringatan khusus tersebut, dan ia juga tidak akan menjalankan perintah shell di repositori Anda.
Satu kunci untuk sisi mana pun yang kamu pilih
Hal yang berguna dari menjalankan perbandingan ini dalam praktik adalah bahwa hanya separuhnya yang merupakan unduhan. Qwen3.8-Max, dan model-model umum yang akan Anda bandingkan dengan agen yang dihosting sendiri, semuanya dapat diakses melalui satu endpoint yang kompatibel dengan OpenAI di OrcaRouter dengan markup 0% — harga daftar penyedia diteruskan, jadi perubahan harga vendor sampai ke sisi kami pada hari yang sama, yang merupakan angka yang benar-benar berubah ketika tagihan token output agen coding adalah hal yang ingin Anda kendalikan. Itu juga membuat pertanyaan failover menjadi sederhana: jika separuh pipeline Anda yang dihosting menurun, percobaan ulangnya otomatis dan eksperimennya berlanjut.
FrogNano-4B-2609 bukan salah satu rute kami dan tidak ada tanggal untuknya. Bobotnya menjadi milik Anda untuk disajikan, dan kartu modelnya dengan jujur menyatakan bahwa konfigurasi penyajian belum sepenuhnya divalidasi. Yang bisa kami lakukan adalah membuat sisi lain dari perbandingan ini tidak memerlukan biaya apa pun untuk disiapkan, sehingga pertanyaan yang akhirnya Anda jawab adalah pertanyaan yang sesungguhnya — apakah agen SWE-bench 61,5% yang dilaporkan vendor di GPU Anda sendiri mengalahkan model frontier berbayar per pemakaian pada tugas Anda sendiri, pada volume Anda sendiri.

Yang mana yang harus dipilih
Gunakan Qwen3.8-Max ketika pekerjaannya bersifat umum, ketika tim operasi pihak lain yang seharusnya memikul kapasitasnya, ketika masukannya mungkin berisi gambar atau dokumen panjang, atau ketika Anda membutuhkan jawaban hari ini alih-alih stack penyajian pada hari Jumat. Skor pihak ketiganya berarti Anda dapat memperkirakan secara kasar apa yang Anda beli, dan tagihan per tokennya adalah biaya variabel yang dapat Anda lihat sebelum berkomitmen. Bagi tim yang menjalankan sejumlah kecil tugas repositori per bulan, hitungannya tidaklah tipis.
Pilih FrogNano-4B-2609 ketika volume cukup tinggi sehingga penagihan per token pada lintasan panjang menjadi kendala, ketika data tidak boleh meninggalkan infrastruktur Anda, atau ketika pertanyaan penelitian — dapatkah agen kecil dilatih hingga kompetensi tingkat repositori tanpa guru — adalah hal yang sebenarnya Anda uji. Masuklah dengan mengetahui tiga hal: angka 61,5% adalah pengukuran lab sendiri pada harness yang dikelola lab, belum ada yang menerbitkan angka VRAM untuk konfigurasi yang dievaluasi, dan kartunya sendiri menyatakan bahwa penyiapan serving belum divalidasi.
Yang membuat pasangan ini layak ditulis adalah bahwa mereka berbagi nenek moyang dua generasi ke belakang. FrogNano berasal dari Qwen3.5-4B — model umum dari perusahaan yang sama yang model andalannya berparameter 2,4 triliun berada di sisi lain halaman ini. Microsoft mengambil model kecil itu, menghabiskan lima iterasi RL pada repositori sintetis, dan mendapatkan seorang spesialis. Alibaba menempuh arah sebaliknya dan melakukan penskalaan. Kedua jawaban telah dipublikasikan, dan selisih antara berapa biaya unduhan dan berapa biaya API adalah cara yang jujur untuk memilih di antara keduanya.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
