
Muse Spark 1.2 vs Gemini 3.5 Flash-Lite: Dua Lab, Dua Definisi Subagen
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenBARUQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxBARUMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 2046 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3055Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
Dalam selang dua minggu satu sama lain, dua laboratorium merilis model dan mendeskripsikannya dengan kata yang sama. Menurut kartu modelnya sendiri, Gemini 3.5 Flash-Lite adalah "cocok untuk subagen yang menjalankan tugas terfokus dalam alur kerja multi-agen yang kompleks." Meta mengatakan Muse Spark 1.2 dapat berfungsi "baik sebagai agen utama untuk perencanaan dan delegasi atau sebagai subagen yang berjalan secara paralel." Kosakata yang sama, dan Artificial Analysis menjalankan keduanya melalui Intelligence Index-nya untuk menunjukkan betapa berbedanya makna yang mereka maksud: Flash-Lite menyelesaikan rangkaian tersebut dalam 43 juta token keluaran, sedangkan Muse Spark 1.2 membutuhkan 95 juta. Salah satu model ini berpikir singkat dan sering; yang lain berpikir keras dan lama. Keduanya menyebut hasilnya sebagai subagen.
Rasio token tersebut adalah angka yang paling relevan untuk keputusan dalam perbandingan ini, karena tier subagen adalah sesuatu yang Anda sebarkan — dua puluh sekaligus, seratus sekaligus — dan penyebaran itu melipatgandakan kebiasaan per-panggilan apa pun yang dimiliki model. Bagian berikut menguraikan apa yang sebenarnya dibangun oleh setiap lab, seperti apa aritmetika penyebarannya pada harga nyata, dan di mana yang murah ternyata menjadi pilihan yang mahal.
Apa yang dimaksud setiap lab dengan kata tersebut
Versi Flash-Lite adalah definisi peran berdasarkan ukuran. Gemini 3.5 Flash-Lite adalah tier termurah dalam keluarganya, dan positioning tersebut patut diperhatikan karena mengaitkan tingkat berpikir langsung dengan beban kerja subagen multi-langkah — pertama kalinya sebuah tier dalam keluarga tersebut dideskripsikan berdasarkan peran agen, bukan berdasarkan ukuran atau kecepatan. Penalaran bersifat wajib, tetapi upaya default-nya adalah minimal, dialnya mencapai maksimum pada 'high', dan model ini dirancang untuk dibuat secara massal dan menjawab dengan cepat. Vendor melaporkan 54,2% pada SWE-Bench Pro dibandingkan 49,6% untuk Gemini 3 Flash, dan 74,0% pada OSWorld-Verified dibandingkan 65,1% — keduanya merupakan angka yang dilaporkan vendor, tidak direproduksi secara independen, dan keduanya dibingkai sebagai peningkatan agentik, bukan peningkatan kecerdasan mentah.
Versi Meta adalah definisi peran berdasarkan topologi. Teks produk Muse Spark 1.2 menggambarkan sebuah model yang dapat mengumpulkan konteks, membuat rencana, dan mendelegasikan eksekusi ke subagen paralel — atau menjadi salah satu subagen itu sendiri. Tombol penalarannya berkisar dari minimal hingga xhigh dengan default medium, dan Meta menyebutkan target beban kerja secara eksplisit: refactor multi-file, sesi debugging yang panjang, pembuatan seluruh repositori. Ini adalah model yang dirancang untuk menjadi orkestrator yang juga dapat mengerjakan tugasnya, yang merupakan produk yang berbeda dari model yang dirancang untuk diluncurkan dua puluh sekaligus.
Tidak ada laboratorium yang menerbitkan tolok ukur untuk klaim spesifik tersebut. Meta merilis 1.2 pada 5 Agustus tanpa posting peluncuran sama sekali — halaman pengumuman Muse Spark 1.1-nya masih menjelaskan versi sebelumnya.
Kesenjangan yang sebenarnya diukur oleh indeks tersebut.

Skor independen, dari Artificial Analysis yang menjalankan komposit sembilan evaluasi yang sama pada keduanya:
• Indeks Kecerdasan — Muse Spark 1.2 (xhigh) 54, peringkat #13 dari 185. Gemini 3.5 Flash-Lite 36, peringkat #20 dari 163. Delapan belas poin, dibandingkan median kelas 32.
• Kecepatan output — 165.0 token per detik dibandingkan 343.6. Flash-Lite melakukan streaming lebih dari dua kali lebih cepat.
• Waktu hingga token pertama — 26.12 detik berbanding 10.30, keduanya pada upaya maksimum. Artificial Analysis mencatat bahwa 10.30s Flash-Lite sendiri berada di ujung atas untuk model penalaran di kelas harganya.
• Verbositas — 95M token keluaran berbanding 43M untuk rangkaian yang sama, dengan median 65M di semua model. Muse Spark 1.2 berada 46% di atas median; Flash-Lite berada 34% di bawah.
• Biaya menjalankan indeks — $637.85 berbanding $153.08.
• Per-dimensi — Sub-indeks Artificial Analysis menempatkan Gemini 3.5 Flash-Lite pada 49.3 untuk coding dan 26.8 untuk agentic. Belum ada rincian yang dipublikasikan untuk Muse Spark 1.2; pendahulunya memperoleh skor 71.3 dan 37.5.
Delapan belas poin indeks bukanlah perbedaan pembulatan. Ini bukanlah dua kandidat untuk slot yang sama.
Aritmetika fan-out
Harga per-token adalah lensa yang salah untuk tier subagen, karena inti dari tier tersebut adalah Anda menjalankan banyak subagen sekaligus. Buatlah contoh perhitungan dengan harga daftar — $0,30 masuk dan $2,50 keluar untuk Gemini 3.5 Flash-Lite, $1,25 masuk dan $4,25 keluar untuk Muse Spark 1.2.
Seorang orkestrator mengirim dua puluh subagen. Masing-masing membaca 25.000 token konteks terbatas dan menulis kembali 1.500 token.
• Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = sekitar 22.5 sen per fan-out.
• Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = sekitar 75 sen per fan-out.
Tiga sepertiga kali, yang terdengar masih masuk akal. Sekarang terapkan perbedaan verbositas yang terukur. Jika Muse Spark 1.2 menulis secara proporsional lebih banyak daripada Flash-Lite seperti yang dilakukannya pada indeks — kira-kira 2,2 kali lebih banyak token keluaran untuk pekerjaan yang sama — balasan yang tadinya 1.500 token menjadi sekitar 3.300, dan fan-out naik menjadi sekitar 91 sen. Empat kali, bukan tiga. Pada seratus fan-out per jam dalam sistem agen yang sibuk, itu berarti perbedaan antara $22 dan $91 per jam, atau perbedaan sekitar $600.000 per tahun pada beban berkelanjutan.
Dua detail penetapan harga membuat kesenjangan nyata semakin lebar dalam satu arah dan semakin sempit dalam arah lainnya:
• Flash-Lite membebankan biaya penalaran internal pada tarif output. Harga yang tercantum untuk token penalaran internal adalah $2,50 per juta — sama dengan output yang terlihat. Berpikir tidak gratis, ia hanya tidak terlihat pada respons. Jika subagen mempertimbangkan 2.000 token sebelum menjawab, tambahkan setengah sen per panggilan, atau 10 sen di seluruh fan-out.
• Dalam hal rasio, caching menguntungkan Muse Spark 1.2. Pembacaan input cache sebesar $0,15 per juta dibandingkan daftar $1,25 — diskon 88%. Flash-Lite membaca input cache sebesar $0,03 dibandingkan $0,30, diskon 90%, tetapi juga mengenakan biaya sekitar $0,083 per juta untuk menulis cache, sedangkan Muse Spark 1.2 tidak mencantumkan biaya penulisan cache terpisah. Untuk fan-out di mana setiap subagen berbagi prefiks besar yang sama, kesenjangan tersebut menyempit secara signifikan.

Latensi produksi adalah area di mana Flash-Lite paling unggul, dan angka benchmark menyembunyikannya. Di OrcaRouter, selama seminggu bergulir dengan lalu lintas nyata, Gemini 3.5 Flash-Lite menunjukkan waktu p50 hingga token pertama sebesar 816 milidetik dan p95 sebesar 4,57 detik. Muse Spark 1.1 — proksi terdekat yang tersedia, karena 1.2 belum memiliki telemetri — menunjukkan p50 1,84 detik dan p95 6,00 detik. Ketika dua puluh subagen berjalan secara paralel, yang paling lambat menentukan waktu dinding, jadi p95 adalah angka yang menentukan latensi fan-out Anda, bukan p50.
Ketika yang murah adalah pilihan yang salah.
Empat batasan pada Gemini 3.5 Flash-Lite yang tidak muncul dalam perbandingan harga dan akan muncul dalam tinjauan insiden.
• Batas output 65.536 token. Separuh dari batas yang diizinkan sebagian besar model di kelas ini, dan menjadi tembok keras bagi subagen yang diminta membuat file besar atau mengembalikan dokumen terstruktur yang panjang. Endpoint Muse Spark 1.2 tidak menyatakan batas maksimum panjang penyelesaian sama sekali — hal yang cukup tidak lazim sehingga perlu diuji daripada dipercaya, tetapi ini bukan batas yang terdokumentasi.
• Ini adalah endpoint tanpa moderasi. Daftar Flash-Lite tidak memiliki bendera moderasi; milik Meta untuk Muse Spark 1.2 memilikinya. Itu adalah keunggulan nyata untuk sebagian beban kerja dan masalah kepatuhan untuk yang lain, dan itu harus menjadi pilihan yang disengaja, bukan sekadar penemuan.
• Pencarian bawaan yang mahal. Alat pencarian web Flash-Lite dibanderol sekitar $14 per seribu panggilan dibandingkan $2,50 untuk Muse Spark 1.2. Jika subagen Anda meneliti alih-alih hanya membaca, model yang murah menjadi yang mahal — lima setengah kali lipat — dan volume pencarian dalam arsitektur fan-out mengikuti fan-out-nya.
• Harganya naik, bukan turun. Gemini 3.5 Flash-Lite dibanderol $0.30 dan $2.50, sedangkan Gemini 3.1 Flash-Lite sebelumnya $0.25 dan $1.50. Outputnya 67% lebih mahal daripada tier yang digantikannya. Jika Anda menyusun anggaran subagent berdasarkan model lama, sesuaikan kembali.

Satu asimetri lagi yang perlu dinyatakan secara gamblang: Muse Spark 1.2 dilayani oleh tepat satu penyedia — Meta — tanpa host pihak ketiga dan tanpa fallback. Gemini 3.5 Flash-Lite memiliki jejak penyajian multi-region pihak pertama yang biasa. Untuk orkestrator, itu adalah satu titik kegagalan untuk seluruh pohon agent Anda; untuk tier pekerja, itu adalah satu titik kegagalan untuk fan-out.
Pasangan yang paling mungkin benar-benar dipilih oleh kebanyakan tim.
Jika dibandingkan satu sama lain, kedua model ini bukanlah pesaing melainkan dua bagian dari satu arsitektur, dan teks produk Meta sendiri mengatakan hal yang sama ketika menjelaskan peran agen utama secara terpisah dari peran subagen.
Bentuk yang mengikuti angka-angka tersebut: Muse Spark 1.2 sebagai orkestrator, Gemini 3.5 Flash-Lite sebagai pekerja. Satu panggilan yang mahal dan disengaja yang membaca repositori, menyimpan rencana, dan memutuskan apa yang harus didelegasikan — di mana 26 detik berpikir dan verbositas berskala 95M-token memberi Anda rencana yang layak dieksekusi — diikuti oleh dua puluh panggilan murah, cepat, dan terfokus yang masing-masing melakukan satu hal dengan cakupan jelas dan kembali dalam waktu kurang dari satu detik pada p50. Anda membayar tarif mendekati frontier sekali per tugas dan tarif anggaran per unit kerja, yang persis merupakan kurva biaya yang diinginkan arsitektur fan-out.
Balikkan itu dan ekonominya runtuh. Dua puluh subagen Muse Spark 1.2 dengan 91 sen per fan-out adalah empat kali lipat tagihan untuk pekerjaan yang model 18 poin lebih lemah selesaikan dalam sepertiga waktu, dan orkestrator Flash-Lite pada indeks 36 akan menghasilkan rencana yang tidak dapat diselamatkan oleh para pekerja.
Dulu, membangun sistem yang terbagi di antara dua vendor adalah bagian yang canggung. Gemini 3.5 Flash-Lite ada dalam katalog OrcaRouter dengan harga $0,30 dan $2,50 — harga daftar vendor, diteruskan dengan markup 0%, sehingga perubahan harga sampai ke kami di hari yang sama, bukan setelah siklus kontrak — dan Muse Spark 1.1 ada di sana dengan harga $1,25 dan $4,25 dengan basis yang sama, keduanya di belakang satu endpoint yang kompatibel dengan OpenAI. Itu berarti pola orchestrator-dan-workers adalah dua string model dalam satu codebase, bukan dua SDK, dua kunci, dan dua faktur, serta failover otomatis menangani kasus ketika satu vendor bermasalah di tengah fan-out. Untuk lebih tepatnya tentang apa yang tersedia: Muse Spark 1.2 sendiri belum ada di katalog — Meta menyediakannya secara langsung sebagai satu-satunya penyedianya — jadi saat ini versi terdekat dari stack ini menjalankan 1.1 di slot orchestrator.
Pilih berdasarkan peran, bukan berdasarkan skor.
Jika Anda memilih tingkat pekerja — penguraian dokumen, ekstraksi data, edit file dengan cakupan terbatas, klasifikasi, bagian tengah yang sempit dan repetitif dari pohon agen — Gemini 3.5 Flash-Lite adalah instrumen yang lebih baik, dan defisit indeks 18 poin sebagian besar tidak relevan karena Anda tidak memintanya untuk bernalar. Perhatikan batas atas output dan harga penelusuran.
Jika Anda memilih model yang menentukan apa yang dilakukan para pekerja, Muse Spark 1.2 adalah kandidat yang lebih kuat dari keduanya, dengan catatan bahwa ia tidak memiliki skor agen per dimensi yang independen, tidak memiliki catatan arena dalam bentuk apa pun, tidak memiliki telemetri produksi, dan satu penyedia. Itulah celah-celah yang perlu ditutup sebelum ia memiliki rencana produksi.
Dan jika Anda berharap satu model bisa melakukan kedua pekerjaan itu, jawaban jujur dari pengukuran adalah tidak ada satupun yang bisa. Flash-Lite tidak dapat merencanakan pada indeks 36; Muse Spark 1.2 tidak dapat dimunculkan dua puluh sekaligus dengan biaya 91 sen per fan-out. Kata "subagent" yang muncul di kedua deskripsi produk adalah kebetulan pemasaran, bukan tanda bahwa keduanya berada di slot yang sama.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
