
Pratinjau Step 5 vs Muse Glimmer: API Frontier dan Model Laptop
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Di papan peringkat, Step 5 Preview dan Muse Glimmer tidak berdekatan: 44 berbanding 17 pada Artificial Analysis Intelligence Index — selisih dua puluh tujuh poin pada skala yang pemimpin saat ini berada di akhir lima puluhan — yang tidak akan bisa ditutup oleh penyetelan sebanyak apa pun. Pada pertanyaan yang sebenarnya harus dijawab sebuah tim — di mana token saya dijalankan — keduanya adalah pesaing langsung. Step 5 Preview adalah andalan StepFun, diumumkan pada 20 September 2026, dengan total sekitar 600 miliar parameter dan 27 miliar di antaranya aktif, konteks 1 juta token, dengan harga $1,00 per juta token input dan $2,70 per juta token output, serta hanya dapat diakses melalui jaringan. Muse Glimmer adalah model agentik berbobot terbuka berparameter 30 miliar milik Meta Superintelligence Labs, dirilis pada 10 Agustus 2026 di bawah Apache 2.0, dikirim dalam bentuk terkuantisasi 4-bit sehingga muat di bawah 20 GB memori dan berjalan pada satu GPU konsumen dengan koneksi jaringan dicabut. Cara yang tepat untuk membaca pasangan ini bukanlah "mana yang lebih pintar". Melainkan "dari dua kendala — kemampuan atau perimeter — manakah yang tidak dapat digeser oleh beban kerja Anda."
Perbandingan itu juga menjadi koreksi yang berguna terhadap kebiasaan yang telah diambil pasar ini: menganggap skor indeks komposit sebagai keseluruhan nilai sebuah model. Selisih dua puluh tujuh poin itu nyata dan bukan satu-satunya angka dalam berkas tersebut. Dalam pengambilan konteks panjang, dewan independen yang sama menempatkan Muse Glimmer dalam selisih setengah poin dari model berbobot terbuka dari kelas bobot yang jauh lebih besar, dan tolok ukur agentik milik Meta sendiri terbilang terhormat untuk model yang berjalan di laptop. Sementara itu, kelemahan Step 5 Preview yang paling banyak dikutip bukanlah kemampuan sama sekali, melainkan verbositas, dan model itu masih tertutup sampai bobot yang dijanjikan tiba pada 15 Oktober.
Dua model, dua objek yang sepenuhnya berbeda
Step 5 Preview adalah sistem mixture-of-experts yang dilayani dari infrastruktur StepFun: sekitar 600B parameter total, 27B aktif per token, input teks dan gambar, jendela konteks 1M token, dan skor Intelligence Index independen sebesar 44 dibandingkan median model sebanding sebesar 26. Outputnya berjalan pada 87 token per detik dibandingkan rata-rata 78 pada pengukuran papan yang sama, dan ia menghasilkan sekitar 160 juta token output di seluruh rangkaian tugas indeks, sementara model median menghasilkan sekitar 82 juta — kira-kira dua kali lipat teks per unit kerja, ditagih $2,70 per juta. Bobot BF16 dijanjikan untuk 15 Oktober 2026 dan belum ada di repositori, jadi saat ini model tersebut hanya tersedia bagi Anda sebagai API.
Muse Glimmer adalah objek yang berlawanan. Ini adalah model 30B-parameter yang dilatih melalui distilasi logit dari guru Muse Spark milik Meta yang lebih besar, lalu disetel secara halus pada data agentik konteks panjang dan diperkuat untuk penggunaan alat. Meta mengirimkannya dalam bentuk terkuantisasi ke 4-bit, yang menurunkan memori dari lebih dari 55 GB pada presisi penuh menjadi di bawah 20 GB — di dalam amplop VRAM 24 GB atau 32 GB — dan model ini diuji oleh Meta pada Nvidia RTX 5090 serta silikon Apple M4 Max dan M5 Max. Model ini menerima input teks dan gambar dalam lebih dari seratus bahasa, mendukung konteks 131.072 token yang dapat diperluas hingga 262.144, dan dirancang untuk menerima suatu tujuan, memecahnya menjadi langkah-langkah, memanggil alat, dan mencoba ulang panggilan yang gagal alih-alih berhenti. Model ini berlisensi Apache 2.0 dan berjalan secara offline.
• Skor independen — Step 5 Preview: 44 terhadap median 26 di kelasnya vs Muse Glimmer: 17 pada indeks yang sama dalam konfigurasi tingginya.
• Skala — Step 5 Preview: sekitar 600B total, 27B aktif menurut StepFun vs Muse Glimmer: 30B total, dikuantisasi ke 4-bit di bawah 20 GB.
• Jendela konteks — Step 5 Preview: 1 juta token vs Muse Glimmer: 131.072 dapat diperluas hingga 262.144, menurut Meta.
• Harga — Step 5 Preview: $1,00 masuk / $2,70 keluar per juta token, dipublikasikan vs Muse Glimmer: tanpa biaya per token; Anda menyediakan GPU.
• Di mana ia berjalan — Pratinjau Langkah 5: server vendor, melalui HTTP vs Muse Glimmer: perangkat keras Anda sendiri, offline.
• Lisensi — Step 5 Preview: pratinjau tertutup, bobot dijanjikan untuk 15 Oktober 2026 vs Muse Glimmer: Apache 2.0, dapat diunduh sekarang.
• Pengambilan konteks panjang — Muse Glimmer mencetak skor 80,0 pada evaluasi penalaran konteks panjang papan indeks, hanya berselisih setengah poin dari model-model yang kelas harganya beberapa kali lebih tinggi dan cukup dekat dengan bacaan Step 5 Preview sehingga perbedaannya tidak relevan untuk keputusan dalam pekerjaan mencari fakta.
Kedua puluh tujuh poin itu, dan apa yang tidak mereka ukur
Model 30B yang didistilasi agar berjalan dalam memori 20 GB akan kalah dari model unggulan 600B pada indeks kecerdasan umum, dan materi Meta sendiri tidak mengklaim sebaliknya — salah satu penggambarannya terang-terangan menyatakan bahwa Glimmer tidak dirancang untuk menyamai kekuatan penalaran mentah model cloud skala penuh. Jadi skor 17 bukanlah putusan atas rekayasanya; itu hasil yang diharapkan dari menimbang tujuan yang berbeda. Pertanyaan yang tepat adalah tugas Anda yang mana yang sebenarnya tercakup oleh kesenjangan itu.
Pembacaan konteks panjang adalah di mana keduanya paling mendekati dan di mana intuisi itu runtuh. Muse Glimmer mendapat skor 80,0 pada evaluasi penalaran konteks panjang papan — skor yang tidak mencolok untuk model terdepan dan mencolok untuk model yang berjalan di GPU konsumen. Jika beban kerja Anda adalah pengambilan, peringkasan, atau ekstraksi dari dokumen panjang, model lokal pada level itu tidak jelas merupakan alat yang salah, dan fakta bahwa permintaan tidak pernah meninggalkan mesin Anda adalah fitur yang tidak dapat Anda beli dari API dengan harga berapa pun.
Lalu ada bagian dari perbandingan yang tidak ditunjukkan oleh angka-angka Meta. Sebuah studi peer-reviewed tentang orkestrasi multi-agen menguji Muse-Glimmer-30B dalam pengaturan yang terkendali — tugas yang sama, harness yang sama, konsultan yang sama — dan menemukan bahwa model itu tidak memulihkan satu pun kandidat yang dihasilkan oleh model-model frontier yang lebih besar, gagal dalam ketiga upaya di setiap pengaturan. Itu adalah satu studi atas satu konfigurasi, dan itulah jenis bukti yang tidak pernah ditampilkan oleh halaman model. Untuk pipeline agentic di mana orkestrator yang lebih lemah harus pulih dari kegagalan model yang lebih kuat, ini adalah hasil yang paling relevan untuk pengambilan keputusan dalam artikel ini, dan layak dibaca sebelum benchmark apa pun yang dilaporkan vendor Meta.
Tolok ukur tersebut, untuk kelengkapan, adalah milik Meta sendiri dan belum direproduksi: 76,0% pada SWE-Bench Verified, 51,2% pada SWE-Bench Pro, 51,7% pada TerminalBench 2.1, 65,9% pada OSWorld-Verified, 83,5% pada GPQA Diamond, 22% pada Humanity's Last Exam, dan 75,5 pada MCP-Atlas. Tolok ukur itu diukur terhadap model-model di kelas ukurannya sendiri, dan menggambarkan agen lokal yang mumpuni, bukan penalar garda depan.

Di mana batas itu sebenarnya berada
Keunggulan struktural Step 5 Preview adalah ia melakukan pekerjaan yang tidak dapat Anda lakukan secara lokal. Konteks 1M token, input gambar, skor terukur yang mendekati frontier, dan 87 token output per detik tanpa perangkat keras yang perlu dibeli: untuk menyusun draf, merencanakan, meninjau kode di seluruh repositori besar, atau apa pun yang menjadikan batas atas model sebagai hambatan, API menang dan dua puluh tujuh poin itu adalah seluruh argumennya. Biayanya justru kebalikan dari Muse Glimmer: prompt meninggalkan perimeter Anda, harga berlaku lagi pada setiap token, dan kecenderungan model untuk bertele-tele membuat beban kerja dengan output panjang lebih mahal daripada yang disiratkan oleh tarif $2.70.

Keunggulan Muse Glimmer adalah ia mengerjakan pekerjaan yang tidak bisa keluar. Jika data diatur regulasi, jika anggaran latensi hanya beberapa milidetik, jika mesinnya offline, atau jika biaya marginal permintaan ke-juta harus nol, maka tidak ada API yang menjadi kandidat — bukan yang ini, bukan yang mana pun. Harga dari itu adalah kapabilitas: Anda memilih 17 padahal ada 44, dan dalam orkestrasi agentik Anda mungkin memilih koordinator yang tidak dapat pulih dari kesalahan model yang lebih kuat.
Bagi sebagian besar tim, jawabannya bukanlah pilihan melainkan pemisahan, dan pemisahan itu perlu tempat untuk hidup. OrcaRouter merutekan lebih dari 200 model di balik satu kunci API dan satu tagihan dengan markup 0% dan harga daftar penyedia diteruskan, plus failover otomatis dan DSL perutean untuk mengirim lalu lintas berdasarkan tugas, biaya, atau latensi. Baik Step 5 Preview maupun Muse Glimmer tidak ada dalam katalog itu — produk andalan StepFun tidak dirutekan oleh kami dan Glimmer adalah unduhan lokal — jadi nilai yang ditawarkan bukanlah akses ke salah satu model tersebut. Melainkan kumpulan model yang akan Anda jadikan tolok ukur untuk keduanya, yang dapat dipanggil dengan satu kunci hari ini, sehingga keputusan lokal-versus-remote ditentukan oleh distribusi tugas Anda sendiri, bukan oleh halaman vendor mana pun yang terakhir Anda baca.

Cara memutuskan
Pilih Step 5 Preview ketika batas maksimum menjadi kendala. Jika tugas Anda bersifat terbuka, multimodal, konteks panjang, atau agentik dalam arti membutuhkan perencana yang mumpuni, model API adalah satu-satunya dari keduanya yang dapat melakukannya, dan harganya cukup rendah untuk kelasnya sehingga mengujicobanya menjadi pos anggaran, bukan proyek. Anggarkan untuk verbositas, rencanakan agar tanggal bobot 15 Oktober mundur, dan jauhkan beban kerja yang tidak boleh meninggalkan gedung dari itu.
Pilih Muse Glimmer saat perimeter menjadi kendala. Jika data Anda tidak dapat dikirim, jika Anda perlu menjalankannya di pesawat atau di pabrik, atau jika volume Anda membuat penetapan harga per token menjadi tidak masuk akal, model Apache-2.0 30B yang muat dalam 20 GB adalah pilihan praktis, dan hasil retrieval konteks panjangnya cukup baik sehingga kesenjangan kemampuan tidak akan muncul di setiap beban kerja. Uji dalam orkestrasi sebelum Anda mempercayainya di sana, karena di situlah bukti independennya paling lemah.
Jika kedua kendala itu mengikat pada saat yang sama, jalankan keduanya: lokal untuk data yang tidak bisa berpindah, API untuk tugas yang membutuhkan model lebih besar, dan biarkan keputusan perutean menjadi perubahan konfigurasi, bukan migrasi. Perbandingan yang penting bukanlah 44 versus 17. Melainkan permintaan mana di antara milik Anda yang mampu keluar dari mesin, dan itu adalah pertanyaan yang hanya bisa dijawab oleh lalu lintas Anda sendiri.
