Kartu judul yang dihasilkan bertuliskan 'FrogNano-4B-2609 vs Qwen 3.8' dengan subjudul 'agen 4B di GPU Anda sendiri melawan flagship 2.4T yang di-host', tiga chip bertuliskan 'unduhan 9,32 GB', '$2 masuk / $6 keluar per juta' dan 'hingga 150 langkah per tugas', footer bertuliskan 'Angka FrogNano menurut Microsoft; harga Qwen3.8-Max menurut Alibaba. Tidak ada yang independen di sini', dan logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

FrogNano-4B-2609 vs Qwen 3.8: Berapa Biaya Agen Coding Ketika Bobotnya Milik Anda

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

microsoft/FrogNano-4B-2609 adalah agen repositori kelas empat miliar parameter yang diturunkan dari Qwen3.5-4B yang Anda unduh dan layani sendiri. Qwen3.8-Max adalah unggulan yang dihosting — model sparse mixture-of-experts 2,4 triliun parameter dengan sekitar 95 miliar parameter aktif per token, jendela multimodal satu juta token, dan daftar tarif $2,00 per juta token input dan $6,00 per juta token output — dapat diakses dengan kunci API sejak 3 Agustus 2026. Salah satunya memerlukan GPU dan waktu satu sore. Yang lain tidak memerlukan biaya sampai Anda menggunakannya, lalu menagih per token pada lintasan terpanjang yang umum digunakan. Pertukaran itulah, bukan tabel benchmark, yang menjadi pertandingan sebenarnya.

Angka FrogNano di sini berasal dari kartu model dan laporan teknis Microsoft; angka Qwen3.8-Max berasal dari harga yang dipublikasikan Alibaba dan catatan model di katalog kami sendiri, dengan skor independen dilabeli sebagai angka Artificial Analysis di mana pun skor itu muncul. Perhatikan penamaannya dengan saksama: Qwen3.8, rilis bobot terbuka, telah diumumkan tetapi belum dirilis, sedangkan Qwen3.8-Max sudah aktif dan sudah diberi harga hari ini. Semua yang dapat dipanggil dalam artikel ini adalah yang terakhir.

Aritmetika yang menentukan perbandingan

Mulailah dari berapa biaya satu tugas, karena hal itu tidak jelas dan tidak kecil.

Evaluasi FrogNano menjalankan setiap trajektori dengan anggaran 150 langkah dalam sekitar 131K token gabungan, hingga 8.192 token yang dihasilkan per giliran asisten, dan batas 10.800 detik. Kalikan dua batas yang dipublikasikan itu dan Anda mendapatkan batas sekitar 1,23 juta token yang dihasilkan untuk satu trajektori kasus terburuk — yang pada Qwen3.8-Max $6,00 per juta token keluaran adalah sekitar $7,38 untuk satu tugas yang berjalan sampai akhir anggarannya. Itu aritmetika atas dua angka yang dipublikasikan, bukan pengukuran: trajektori nyata berhenti lebih awal, rata-ratanya jauh di bawah batas, dan hasil alat serta keluaran shell ditagih pada tarif input yang lebih murah daripada tarif output. Tapi itu menunjukkan bentuk persoalannya. Agen coding tidak menghabiskan beberapa ratus token untuk sebuah pertanyaan; ia menghabiskan percakapan panjang yang padat penalaran dengan dirinya sendiri, dan setiap token dari percakapan itu dihasilkan.

Sekarang letakkan sisi lain dari buku besar di sebelahnya. FrogNano-4B-2609 adalah 9,32 GB bobot BF16 dalam dua shard, yang dapat diunduh tanpa gate. Untuk melayaninya dibutuhkan SGLang dengan parser penalaran Qwen3 dan parser pemanggilan alat coder Qwen3, plus sandbox terisolasi untuk kelima alat tersebut. Setelah itu, biaya marjinal sebuah trajektori adalah listrik, dan memori yang ditempatinya adalah sebesar apa pun konteks Anda membesar, bukan seberapa berat bobotnya.

• Model biaya — FrogNano-4B-2609 adalah biaya perangkat keras tetap dan biaya marginal mendekati nol. Qwen3.8-Max adalah biaya tetap nol dan penagihan per token, dengan pembagian $2.00 / $6.00 yang tidak membebankan apa pun di awal dan membebankan semuanya di akhir pada tarif output.

• Apa yang uang itu beli — agen kelas 4B di silikon Anda sendiri, dibandingkan model berskala frontier yang tidak pernah perlu Anda rencanakan kapasitasnya.

• Titik impas — tercapai ketika volume trajektori bulanan Anda dikalikan dengan rata-rata tagihan token per trajektori melebihi biaya GPU yang jika tidak akan Anda sewa. Bagi tim yang menjalankan beberapa tugas repositori sehari, garis itu masih jauh dan model yang dihosting unggul hanya dari segi kenyamanan.

Dua model yang tidak melakukan pekerjaan yang sama

Perbandingan biaya hanya adil jika keluarannya sebanding, dan di sini tidak demikian, dan itulah bagian yang paling sering disembunyikan oleh sebagian besar lembar spesifikasi.

FrogNano-4B-2609 dilatih pascapelatihan secara eksklusif pada rekayasa perangkat lunak tingkat repositori. Seluruh antarmukanya adalah loop lima alat — Read, Write, Edit, Glob dan Bash — dijalankan oleh Leaf harness di sandbox terisolasi, mengulang sampai model berhenti memanggil. Kartu Microsoft menyatakan bahasa yang didukungnya adalah bahasa Inggris dan domain pemrograman yang divalidasi adalah Python, serta menyatakan secara terang-terangan bahwa komponen gambar dan video dalam checkpoint tidak pernah dilatih pascapelatihan dan tidak didukung. Ia tidak menalar tentang arsitektur Anda, tidak menjawab pertanyaan tentang bisnis Anda, atau tidak membaca tangkapan layar.

Qwen3.8-Max adalah model umum. Catatan katalog Alibaba memberinya input teks, gambar, dan video dengan output teks serta jendela konteks 1.000.000 token. Ia bernalar, menulis, membaca dokumen, dan melakukan percakapan, dan pemanggilan fungsinya adalah fitur dari model umum, bukan keseluruhan inti dari checkpoint tersebut. Angka Artificial Analysis-nya, yang dibaca dari catatan pada 2 September 2026, adalah Intelligence Index 45,4 dan Coding Index 76,2.

• Masukan — FrogNano-4B-2609 hanya teks. Qwen3.8-Max menerima teks, gambar, dan video.

Konteks — sekitar 131K token gabungan untuk konfigurasi FrogNano yang dievaluasi, dibandingkan dengan 1.000.000 untuk Qwen3.8-Max. Itu berarti faktor tujuh setengah, dan hal ini paling penting justru untuk input seukuran repositori yang diterima agen pengodean.

• Output per giliran — konfigurasi tervalidasi FrogNano membatasi satu giliran asisten hingga 8.192 token. Qwen3.8-Max tidak menerbitkan batas per respons yang setara.

• Format keluaran — FrogNano mengeluarkan panggilan alat Leaf terstruktur dan memerlukan harness untuk mengeksekusinya. Qwen3.8-Max mengembalikan prosa atau panggilan fungsi ke klien apa pun yang sudah Anda miliki.

• Skor independen — tidak ada untuk FrogNano-4B-2609 di luar kartunya sendiri; angka Qwen3.8-Max di atas berasal dari pihak ketiga, dari Artificial Analysis.

• Parameter — sekitar 4,66B untuk FrogNano menurut deskripsi kartunya sendiri, dibandingkan dengan total 2,4 triliun dan sekitar 95B aktif untuk Qwen3.8-Max.

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

Di mana 4B sebenarnya layak mendapatkan tempatnya

Ada satu dimensi di mana agen 4B benar-benar mengalahkan model frontier, dan itu bukan akurasi.

Makalah FrogNano dimulai dari Qwen3.5-4B, yang mencetak 39,4% pada SWE-bench Verified melalui Leaf harness sebagai model umum biasa. Lima iterasi pembelajaran penguatan pada sekitar 1.500 tugas sintetis membawanya ke 61,5%, dengan lampiran makalah yang sama melaporkan perkembangan per iterasi sebesar 48,2%, 53,4%, 58,3%, 58,6%, dan 61,6%. Metode ini — menghasilkan tugas yang dikalibrasi terhadap batas daya pelajari kebijakan saat ini, tanpa distilasi dari model yang lebih kuat — adalah kontribusinya, dan alasan sebuah kelompok riset tanpa anggaran model terdepan akan peduli.

Bacalah apa implikasinya bagi perbandingan itu. Kartu Microsoft dengan jujur menyatakan bahwa FrogNano tidak secara merata lebih baik daripada model asal yang menghasilkannya: tingkat panggilan alat paralelnya adalah 1,71%, karena iterasi-iterasi berikutnya kehilangan kemampuan untuk memicu panggilan bersamaan, dan tim menambahkan tahap konsolidasi untuk mencoba memulihkannya. Model yang menyelesaikan lebih banyak masalah tetapi menjadi lebih buruk dalam satu perilaku tertentu adalah artefak rekayasa nyata dengan sambungan yang terlihat, dan kartunya menyatakan demikian alih-alih menguburnya.

Dan angka SWE-bench adalah lingkaran tertutup. Baseline model dasar, harness, dan skor akhir semuanya berasal dari lab yang sama, dan dua tabel dalam makalah yang sama memberikan dua tangga berbeda untuk eksperimen yang sama. Sebaliknya, angka coding Qwen3.8-Max dihasilkan oleh Artificial Analysis, bukan oleh Alibaba — jenis bukti yang berbeda, jenis keyakinan yang berbeda, dan keduanya tidak boleh saling dikurangkan.

4B yang belum sepenuhnya bisa Anda perhitungkan

Ada dua hal yang menghalangi FrogNano-4B-2609 menuju slot produksi, dan keduanya ada dalam dokumentasinya sendiri, bukan dalam pendapat peninjau mana pun.

Yang pertama adalah perangkat keras. Kartu tersebut menyebutkan persyaratan bobot BF16 sekitar 9,3 GB lalu menambahkan bahwa memori "meningkat secara signifikan seiring konteks gabungan mendekati sekitar 131K token", sebelum menyatakan bahwa model GPU minimum yang tepat, konfigurasi VRAM, versi runtime, dan profil performa "masih harus divalidasi sebelum rilis" — kalimat yang muncul pada model yang sudah dapat diunduh. Tidak ada yang memublikasikan angka VRAM untuk konfigurasi yang dievaluasi, dan kartu tersebut tidak memuatnya.

Yang kedua adalah postur keselamatan. Catatan penyelarasan Microsoft sendiri menyatakan bahwa pasca-pelatihan khusus agen tidak menggunakan dataset preferensi keselamatan, penolakan, konten berbahaya, maupun adversarial; bahwa pasca-pelatihan itu justru dioptimalkan untuk kebenaran fungsional dan penghindaran regresi; dan bahwa model tersebut "tidak boleh dianggap selaras keselamatan secara independen untuk penerapan otonom tanpa batas". Kartu tersebut diakhiri dengan menyebutkan risiko-risiko konkret: patch mungkin salah atau tidak aman meskipun lulus pengujiannya, kinerja sensitif terhadap kualitas pengujian tersebut, dan setiap patch kandidat memerlukan tinjauan manusia yang berkualifikasi serta pengujian regresi dan keamanan yang independen sebelum digunakan. Model umum yang dihosting tidak membawa satu pun peringatan khusus tersebut, dan ia juga tidak akan menjalankan perintah shell di repositori Anda.

Satu kunci untuk sisi mana pun yang kamu pilih

Hal yang berguna dari menjalankan perbandingan ini dalam praktik adalah bahwa hanya separuhnya yang merupakan unduhan. Qwen3.8-Max, dan model-model umum yang akan Anda bandingkan dengan agen yang dihosting sendiri, semuanya dapat diakses melalui satu endpoint yang kompatibel dengan OpenAI di OrcaRouter dengan markup 0% — harga daftar penyedia diteruskan, jadi perubahan harga vendor sampai ke sisi kami pada hari yang sama, yang merupakan angka yang benar-benar berubah ketika tagihan token output agen coding adalah hal yang ingin Anda kendalikan. Itu juga membuat pertanyaan failover menjadi sederhana: jika separuh pipeline Anda yang dihosting menurun, percobaan ulangnya otomatis dan eksperimennya berlanjut.

FrogNano-4B-2609 bukan salah satu rute kami dan tidak ada tanggal untuknya. Bobotnya menjadi milik Anda untuk disajikan, dan kartu modelnya dengan jujur menyatakan bahwa konfigurasi penyajian belum sepenuhnya divalidasi. Yang bisa kami lakukan adalah membuat sisi lain dari perbandingan ini tidak memerlukan biaya apa pun untuk disiapkan, sehingga pertanyaan yang akhirnya Anda jawab adalah pertanyaan yang sesungguhnya — apakah agen SWE-bench 61,5% yang dilaporkan vendor di GPU Anda sendiri mengalahkan model frontier berbayar per pemakaian pada tugas Anda sendiri, pada volume Anda sendiri.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

Yang mana yang harus dipilih

Gunakan Qwen3.8-Max ketika pekerjaannya bersifat umum, ketika tim operasi pihak lain yang seharusnya memikul kapasitasnya, ketika masukannya mungkin berisi gambar atau dokumen panjang, atau ketika Anda membutuhkan jawaban hari ini alih-alih stack penyajian pada hari Jumat. Skor pihak ketiganya berarti Anda dapat memperkirakan secara kasar apa yang Anda beli, dan tagihan per tokennya adalah biaya variabel yang dapat Anda lihat sebelum berkomitmen. Bagi tim yang menjalankan sejumlah kecil tugas repositori per bulan, hitungannya tidaklah tipis.

Pilih FrogNano-4B-2609 ketika volume cukup tinggi sehingga penagihan per token pada lintasan panjang menjadi kendala, ketika data tidak boleh meninggalkan infrastruktur Anda, atau ketika pertanyaan penelitian — dapatkah agen kecil dilatih hingga kompetensi tingkat repositori tanpa guru — adalah hal yang sebenarnya Anda uji. Masuklah dengan mengetahui tiga hal: angka 61,5% adalah pengukuran lab sendiri pada harness yang dikelola lab, belum ada yang menerbitkan angka VRAM untuk konfigurasi yang dievaluasi, dan kartunya sendiri menyatakan bahwa penyiapan serving belum divalidasi.

Yang membuat pasangan ini layak ditulis adalah bahwa mereka berbagi nenek moyang dua generasi ke belakang. FrogNano berasal dari Qwen3.5-4B — model umum dari perusahaan yang sama yang model andalannya berparameter 2,4 triliun berada di sisi lain halaman ini. Microsoft mengambil model kecil itu, menghabiskan lima iterasi RL pada repositori sintetis, dan mendapatkan seorang spesialis. Alibaba menempuh arah sebaliknya dan melakukan penskalaan. Kedua jawaban telah dipublikasikan, dan selisih antara berapa biaya unduhan dan berapa biaya API adalah cara yang jujur untuk memilih di antara keduanya.

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari