
Step 5 Preview vs Intern-S2 Mobius: Apakah Anda Membutuhkan Model Unggulan 600B, atau Penalar 35B yang Cepat?
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Alasan jujur untuk membandingkan Step 5 Preview dengan Intern-S2 Mobius bukanlah karena keduanya mirip. Melainkan karena keduanya adalah jawaban atas dua pertanyaan berbeda dari pembeli yang sama — tim yang memiliki beban kerja penalaran untuk dijalankan dan tidak berminat membeli klaster. StepFun Step 5 Preview, yang diumumkan pada 20 September 2026, adalah jawaban besarnya: sekitar 600 miliar parameter total dengan 27 miliar aktif, konteks 1 juta token, skor Artificial Analysis Intelligence Index yang diukur secara independen sebesar 44, dan harga yang dipublikasikan $1,00 per juta token input dan $2,70 per juta token output. InternLM Intern-S2 Mobius, yang dirilis pada 29 Juli 2026, adalah jawaban kecilnya: model open-weight 35 miliar parameter yang dibangun di atas arsitektur Mobius-v0, dipralatih secara berkelanjutan dari Qwen3.5-35B, yang klaim utamanya bukanlah kemampuan melainkan kecepatan — sekitar 4x percepatan end-to-end pada tolok ukur penalaran dibandingkan baseline yang menjadi dasar pelatihannya, tanpa skor tolok ukur independen apa pun. Yang satu adalah model unggulan yang Anda sewa; yang lain adalah model kecil yang Anda jalankan. Perbandingan ini sebenarnya tentang apakah beban kerja di hadapan Anda benar-benar membenarkan model unggulan itu.
Satu hal yang perlu dibereskan sebelum angka-angka, karena ini menghabiskan waktu nyata orang: InternLM telah merilis beberapa model di bawah bendera Intern-S2, dan model-model itu tidak sama. Intern-S2-397B adalah unggulan multimodal ilmiah; Intern-S2 Mobius adalah penalar efisien 35B yang dibahas di sini; rilis Intern-S2 yang lebih awal adalah model terpisah lagi. Jika Anda mencari "Intern-S2" dan sampai ke tabel benchmark untuk model 397B, Anda sedang membaca tentang checkpoint yang berbeda.
Apa yang sebenarnya diklaim oleh masing-masing model
Klaim Step 5 Preview adalah klaim-klaim konvensional untuk produk unggulan 2026, dan salah satunya diperiksa secara independen. StepFun mencantumkan sekitar 600B parameter total dengan 27B aktif, masukan teks dan gambar, jendela konteks 1M token, dan harga $1,00/$2,70 per juta token masukan dan keluaran. Artificial Analysis mengukurnya pada 44 di Intelligence Index miliknya, di atas median 26 untuk model sebanding, dengan keluaran 87 token per detik dibandingkan rata-rata 78 dan sekitar 160 juta token keluaran yang dihasilkan di seluruh rangkaian tugas indeks dibandingkan median 82 juta — kira-kira dua kali lipat jejak verbose tipikal, yang penting pada model yang ditagih berdasarkan keluaran.
Klaim Intern-S2 Mobius bersifat arsitektural dan lebih sempit. Desainnya memisahkan pengetahuan dari komputasi: Memori yang dibagikan secara global menyimpan vektor pengetahuan, dan sejumlah Reasoner secara iteratif menanyakan serta menyempurnakan status tersembunyi terhadapnya, alih-alih mengikat penyimpanan dan komputasi lapis demi lapis seperti yang dilakukan transformer konvensional. Hasil yang diklaim InternLM adalah percepatan end-to-end sekitar 4x pada tolok ukur penalaran dibandingkan Qwen3.5-35B yang menjadi asal turunannya, dengan skor penalaran yang sebanding atau lebih kuat, plus rantai pemikiran yang terlihat lebih pendek. Model ini berlisensi Apache 2.0, menerima masukan teks dan gambar, dan tersedia untuk diunduh.
• Skala — Step 5 Preview: sekitar 600B total, 27B aktif per StepFun vs Intern-S2 Mobius: 35B total.
• Skor independen — Step 5 Preview: 44 pada Artificial Analysis Intelligence Index vs Intern-S2 Mobius: tidak ada yang diterbitkan oleh pihak ketiga mana pun.
• Kecepatan — Step 5 Preview: 87 token keluaran per detik dibandingkan rata-rata 78, diukur oleh papan indeks vs Intern-S2 Mobius: "hampir 4x" terhadap baseline Qwen3.5-35B miliknya sendiri, dilaporkan vendor dan belum direproduksi.
• Jendela konteks — Step 5 Preview: 1M token per StepFun vs Intern-S2 Mobius: tidak ada angka konteks independen yang dipublikasikan.
• Harga — Step 5 Preview: $1,00 masuk / $2,70 keluar per juta token vs Intern-S2 Mobius: tidak ada harga API; Anda membayar perangkat kerasnya.
• Lisensi dan akses — Pratinjau Step 5: pratinjau tertutup melalui API vendor, bobot BF16 dijanjikan untuk 15 Oktober 2026 vs Intern-S2 Mobius: bobot Apache 2.0 tersedia sekarang.
• Verbositas — Step 5 Preview: sekitar 160M token keluaran di seluruh suite indeks terhadap median 82M, menurut papan indeks vs Intern-S2 Mobius: jejak penalaran yang terlihat lebih pendek yang diklaim oleh InternLM, tidak diukur oleh pihak lain.
Klaim 4x, dan mengapa itu angka yang menarik
Baca angka kedua vendor secara berdampingan dan ketidakcocokannya jelas: angka utama StepFun adalah skor kemampuan, sedangkan milik InternLM adalah pengali throughput. Itu bukan kebetulan, dan itu hal paling berguna dalam perbandingan ini. Percepatan end-to-end 4x pada tugas penalaran, jika bertahan saat diuji dengan harness milik orang lain, lebih berharga bagi deployment bervolume tinggi daripada beberapa poin pada indeks — itu mengubah perhitungan untuk menjalankan beban kerja itu sama sekali. Intern-S2 Mobius menyasar tim yang hambatannya adalah token per detik per dolar, bukan kemampuan puncak.
Peringatannya adalah bahwa pengganda tersebut diukur terhadap Qwen3.5-35B, model yang menjadi titik awal continual-pretraining Intern-S2 Mobius, yang tidak pernah menjalani pelatihan Mobius. Ini adalah perbandingan terhadap titik awalnya sendiri, bukan terhadap pesaing. Tidak ada reproduksi independen atas klaim throughput tersebut, tidak ada skor indeks pihak ketiga, dan tidak ada jendela konteks yang dipublikasikan oleh pihak selain vendor. Anggap "hampir 4x" sebagai sinyal arsitektural yang menarik dan hipotesis untuk diuji pada harness Anda sendiri, bukan sebagai spesifikasi.
Step 5 Preview memiliki profil bukti yang berlawanan. Angka kemampuannya diukur secara independen; kisah efisiensinya adalah bagian yang lemah. Pembacaan verbositas papan indeks — sekitar 160 juta token keluaran, sementara model median mengeluarkan sekitar 82 juta — adalah penyeimbang yang jujur terhadap harga keluaran $2,70, dan itu berarti beban kerja yang mengandalkan generasi terstruktur panjang akan menghabiskan jauh lebih banyak daripada yang disiratkan label harga. Yang dimilikinya sedangkan Intern-S2 Mobius tidak adalah harga API yang dipublikasikan, dan itulah yang membuatnya sebanding sejak awal.
Repositori Hugging Face untuk build vendor yang dijanjikan mengungkap sisi lain dari ceritanya: seperti inilah bentuk rilis berbobot terbuka ketika sudah diumumkan tetapi belum dirilis.

Di mana pertanyaan soal jejak sebenarnya mulai terasa
Keunggulan sebenarnya Intern-S2 Mobius bukanlah skornya, yang belum pernah diukur oleh siapa pun, melainkan berapa biaya jika salah tentangnya. Tiga puluh lima miliar parameter adalah ukuran yang bisa dijalankan sebuah tim pada perangkat keras yang sudah mereka miliki, dievaluasi tanpa surat pesanan pembelian, dan ditinggalkan tanpa perlu menghapus nilai apa pun. Itu adalah keunggulan struktural yang tidak dapat ditandingi oleh model unggulan, tak peduli berapa pun poin yang diraihnya, dan itulah alasan perbandingan ini layak dilakukan alih-alih diabaikan sebagai perbandingan yang tidak sepadan.

Keunggulan model andalan adalah cerminan sebaliknya. Konteks 1M token, input gambar, dan kemampuan penalaran umum yang terukur dari Step 5 Preview mencakup pekerjaan yang kemungkinan besar tidak dapat ditangani dengan baik oleh model 35B, dan tidak ada biaya untuk mencobanya selama jendela gratis — model ini telah gratis di tiga platform pengembang terpisah selama Oktober. Tidak satu pun dari fakta tersebut tersedia untuk model yang dihosting sendiri: tidak ada minggu gratis untuk menjalankan GPU Anda sendiri, dan tidak ada daftar harga yang mengubah keputusan menjadi item baris.
Jika Anda ingin perbandingan itu tetap bertahan setelah jendela promosi berakhir, yang perlu dibangun adalah harness, bukan preferensi. OrcaRouter merutekan lebih dari 200 model di balik satu kunci API dan satu tagihan dengan markup 0% serta harga daftar penyedia yang diteruskan apa adanya, dengan failover otomatis dan DSL perutean untuk mengarahkan lalu lintas berdasarkan biaya, latensi, atau kemampuan. Baik Step 5 Preview maupun Intern-S2 Mobius tidak ada dalam katalog itu — model unggulan StepFun tidak dirutekan oleh kami dan Intern-S2 Mobius adalah unduhan self-host — jadi nilai di sini bukanlah akses ke salah satunya. Nilainya adalah bahwa model-model yang akan Anda jadikan tolok ukur berada hanya sejauh satu kunci, dan keputusan yang diambil berdasarkan pengukuran bergerak mengikuti bukti, bukan mengikuti postingan blog peluncuran.

Cara memutuskan
Jika beban kerja Anda bersifat agentic, multimodal, berkonteks panjang, atau terbuka — jenis yang tugasnya tidak dapat Anda rinci terlebih dahulu — model unggulan adalah jawabannya, dan Step 5 Preview adalah contoh yang wajar darinya: terukur, memiliki harga, murah untuk diuji coba, dan dapat dibalik per token. Anggarkan saja untuk verbositasnya, bukan untuk tarif yang dipublikasikan.
Jika beban kerja Anda sempit, berulang, penalaran bervolume tinggi pada data yang harus tetap berada di dalam perimeter Anda, model kecil adalah jawabannya, dan Intern-S2 Mobius adalah kandidat yang sungguh-sungguh justru karena ukurannya kecil: model ini berjalan pada perangkat keras yang Anda miliki, lisensinya Apache 2.0, dan klaim kecepatannya, jika terbukti benar, adalah hal yang menentukan pertanyaan ekonomi unit. Masuklah dengan kesadaran bahwa Anda sedang menguji klaim vendor, bukan mewarisi putusan orang lain.
Kesalahannya adalah menganggap pilihan ini permanen. Beli dulu evaluasi model kecil, karena itu eksperimen yang murah; sewa model unggulan untuk tugas-tugas yang gagal dilakukan model kecil, karena itu perbaikan yang murah. Tim yang menjaga kedua opsi tetap hidup pada kunci yang sama dan harness yang sama akhirnya membuat keputusan ini dengan data mereka sendiri, dan itulah satu-satunya versi keputusan tersebut yang tetap bertahan saat salah satu vendor merilis penerusnya.
