Kartu judul yang dihasilkan untuk Step 5 Preview bertuliskan 'Step 5 Preview — kebocoran sejauh ini', mencantumkan enam spesifikasi sebagai baris label-dan-nilai: total parameter sekitar 600B, diaktifkan per inferensi sekitar 27B, input teks dan gambar, jendela konteks 1 juta token, AA Intelligence Index 44, dan harga $1,00 untuk input dan $2,70 untuk output per 1 juta token. Footer berbunyi 'Semua angka berasal dari pihak ketiga dan belum diaudit - StepFun belum mengumumkan model ini.' Logo OrcaRouter berada di sudut kanan bawah.
Guides & Insights

Pratinjau Step 5: Flagship 600B StepFun yang Belum Diumumkan Sudah Ada di Papan Peringkat

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Step 5 Preview memiliki peringkat papan peringkat, harga yang dipublikasikan, kecepatan output terukur, dan skor Intelligence Index 44 — skor yang sama dengan Kimi K3, model yang ukurannya sekitar lima kali lipat. Yang tidak dimilikinya adalah peluncuran. StepFun belum mengumumkannya, dokumentasi platform StepFun sendiri tidak mencantumkannya, dan tidak ada bobot untuk diunduh. Setiap angka di bawah ini berasal dari pihak ketiga yang mendapatkan akses sebelum vendor tersebut mengatakan apa pun secara publik, yang menjadikan ini tulisan "sejauh yang kita ketahui" alih-alih ulasan. Bacalah angka-angka itu sebagai bukti tentang apa yang akan datang, bukan sebagai lembar spesifikasi.

Kebocoran itulah beritanya

Jejak publik pertama dari Step 5 Preview adalah sebuah proses evaluasi. Artificial Analysis memiliki halaman model langsung untuknya, yang dinilai melalui API milik StepFun sendiri dengan tag pengujian step-5-preview-b, dengan platform tersebut menetapkan tanggal model itu ke 18 September 2026. Halaman itulah sumber angka 44, harga, pengukuran kecepatan, dan baris benchmark dalam artikel ini.

Sebaliknya, sisi vendor kosong. Dokumentasi pengembang StepFun mencantumkan model hingga Step 3.7 Flash dan Step 3.5 Flash lalu berhenti — tidak ada step-5, tidak ada entri pratinjau. Organisasi stepfun-ai Hugging Face tidak memiliki repositori Step 5, yang konsisten dengan produk andalan berbobot tertutup, bukan kelalaian. Laporan komunitas di forum pengembang Tiongkok menunjuk pada kemungkinan peluncuran di acara AGI Frontier di Shanghai pada 19 September, yang kira-kira sehari setelah evaluasi tersebut muncul. Hingga saat ini, tidak ada pihak di luar StepFun yang memiliki spesifikasi resmi, harga resmi, atau nama resmi untuk versi yang akan dirilis.

Penamaannya sendiri adalah petunjuk pertama bahwa ini adalah pratinjau dan bukan peluncuran. StepFun melewati lini Step 4.x sepenuhnya dan melompat ke Step 5. Model yang dirilis dengan akhiran Preview, di-benchmark sebelum memiliki halaman produk, adalah model yang masih dikalibrasi oleh vendor — harga, perutean, dan batas semuanya dapat berubah sebelum ketersediaan umum.

Seperti apa spesifikasinya, sejauh yang bisa diketahui siapa pun

Ini adalah angka-angka yang beredar, dan inilah klaim yang paling sering diulang dari kebocoran itu — yang tidak sama dengan klaim yang paling banyak dikonfirmasi:

• Total parameter — sekitar 600B, dibandingkan dengan sekitar 2,8T untuk Kimi K3

• Diaktifkan per inferensi — sekitar 27B, kira-kira 4,5% dari total, rasio mixture-of-experts yang luar biasa jarang

• Modalitas masukan — teks dan gambar; keluaran hanya teks

• Penalaran — ya, dengan pemikiran yang diperluas

• Jendela konteks — 1M token di Artificial Analysis; konfigurasi pihak ketiga terpisah yang beredar di perkakas pengembang mencantumkan 350.000 dengan keluaran maksimum 64.000

• Ketersediaan bobot — tertutup, tidak ada repositori

Kontradiksi jendela konteks itu layak ditandai secara terang-terangan, karena belum diselesaikan oleh siapa pun. Jendela 1M token dan jendela 350k token adalah produk yang berbeda dengan biaya memori yang berbeda, dan angka kedua disertai batas keluaran 64k yang tidak disinggung sama sekali oleh yang pertama. Jika Anda merencanakan pipeline dokumen panjang berdasarkan angka 1M, konfigurasi 350k adalah alasan untuk menunggu halaman vendor. Jumlah parameter memiliki ketidakpastian serupa: pelacak DataLearner masih mencatat arsitektur MoE dan jumlah parameter untuk Step 5 Preview sebagai tidak tersedia, yang berarti pasangan 600B/27B — fakta yang paling banyak dikutip tentang model ini — juga merupakan salah satu yang paling sedikit dikonfirmasi secara resmi.

Angka yang menarik adalah 27 miliar, bukan 600 miliar.

Model sparse mixture-of-experts hanya membelanjakan komputasi pada expert yang benar-benar menjadi tujuan routing sebuah token, jadi angka yang diaktifkan adalah angka yang mengatur bagaimana model berperilaku di produksi. Pada sekitar 27B aktif, Step 5 Preview melakukan beban kerja per token dalam rentang yang sama dengan model yang ukurannya hanya sebagian kecil darinya, sementara total 600B sebagian besar merupakan persoalan jejak memori.

Dua konsekuensi menyusul, dan keduanya muncul dalam pengukuran pihak ketiga. Biaya serving mengikuti parameter yang diaktifkan, yang menjadi sebagian alasan harga berada di level tersebut. Dan kecepatan per token juga mendapat manfaat: Artificial Analysis mengukur 99,8 token keluaran per detik, berperingkat ke-42 dari 200 model, dibandingkan median 64,6. Waktu ke token pertama tercatat 2,96 detik dibandingkan median sekitar 3,57 detik. Jika pembagian 600B/27B akurat, ini adalah model yang dirancang agar murah untuk disajikan, bukan murah untuk dihosting — perbedaan penting jika Anda yang membayar GPU, bukan tokennya.

Di mana posisinya pada Intelligence Index

Artificial Analysis memberi Step 5 Preview skor 44 pada Intelligence Index v4.3, yang mencakup sepuluh evaluasi. Itu menempatkannya di peringkat ke-25 dari 200 model di papan peringkat dan jauh di atas model median yang dinilai indeks tersebut, yang berada di angka 25.

• Indeks Kecerdasan — Step 5 Preview 44 vs Kimi K3 44

• Tepat di atas — GLM-5.3 dan Claude Opus 5, keduanya pada 45

• Tepat di bawah — DeepSeek V4.1 Flash pada 40 dan DeepSeek V4 Pro pada 36

• Terminal-Bench 4.0 — Step 5 Preview 33,3% vs Kimi K3 sekitar 12,6%, dan vs DeepSeek V4.1 Flash pada 26,8%

• SciCode — 59% untuk Step 5 Preview, setara dengan Kimi K3

• Kecepatan output — 99,8 token per detik vs median bidang 64,6

Judul utamanya adalah hasil imbang dengan Kimi K3, dan pembacaan yang jujur lebih sempit daripada yang disiratkan oleh judul-judul berita. Menyamai model berparameter 2,8T pada indeks agregat dengan total 600B adalah hasil efisiensi yang nyata, tetapi angka agregat itu menyembunyikan bentuknya: selisih Terminal-Bench 4.0 yang menguntungkan Step 5 Preview sangat dramatis, sementara hasil SciCode benar-benar imbang. Kesetaraan agregat pada sebuah indeks bukanlah kesetaraan di semua tempat, dan versi preview adalah momen paling tidak dapat diandalkan untuk mengasumsikan bahwa selisih-selisih itu akan bertahan.

Satu lagi ketidaksesuaian yang layak disebut: Artificial Analysis melaporkan 44, sementara pelacak independen DataLearner mencatat run yang sama sebagai 43,6. Ini perbedaan pembulatan, bukan ketidaksepakatan soal kemampuan, tetapi hal semacam ini justru menegaskan inti persoalan tentang angka-angka model ini secara umum — angka-angka itu adalah pembacaan pihak ketiga terhadap model yang belum diumumkan, diambil pada momen yang sedikit berbeda, dan tidak satu pun telah dikonfirmasi oleh StepFun. Tidak ada dari tolok ukur ini yang dilaporkan vendor, yang bisa jadi pedang bermata dua: tidak ada seorang pun di StepFun yang mengklaim angka di sini, dan tidak ada seorang pun di StepFun yang mendukung satu angka pun juga.

Screenshot of the Artificial Analysis model page for Step 5 Preview, headed 'Step 5 Preview Intelligence, Performance & Price Analysis', showing StepFun as the creator, a release date of September 2026, an Intelligence Index of 44 at rank 25 of 200, an output speed of 99.8 tokens per second at rank 42 of 200, input pricing of $1.00 and output pricing of $2.70 per million tokens with a 95% cache discount, $0.71 per Intelligence Index task, verbosity of 160M output tokens, and technical specifications listing reasoning as supported, input modality as text plus image, and a 1M token context window.

Harganya, dan bertele-tele yang menggerogotinya

Harga adalah bagian dari kebocoran ini yang akan paling cepat memengaruhi anggaran. Melalui API StepFun, Artificial Analysis mencatat hal berikut:

• Input — $1,00 per juta token, dibandingkan dengan median $1,88 untuk model serupa

• Output — $2,70 per juta token, dibandingkan dengan median $10,00

• Cache — diskon cache 95%, menempatkan cache hit sekitar $0,05 per juta token

• Gabungan — sekitar $0,51 per juta token dengan rasio 7:2:1 cache-hit:input:output

• Biaya per tugas Intelligence Index — $0.71

• Biaya satu kali proses indeks penuh — totalnya $918.34

Output sebesar $2,70 adalah angka yang paling penting, karena berada di bawah seperlima dari yang dibebankan Kimi K3 untuk satu juta token yang sama, yaitu $15,00. Namun ada satu hal yang luput yang disembunyikan oleh perbandingan per token, dan Artificial Analysis mengukurnya secara langsung: verbositas. Step 5 Preview menghasilkan 160M token keluaran untuk menyelesaikan Intelligence Index, dibandingkan dengan median 90M untuk para peserta dan peringkat ke-65 dari 200 pada ukuran tersebut.

Mari kita uraikan. Dengan $2,70 per juta, 160 juta token keluaran setara dengan sekitar $432 — kira-kira setengah dari total biaya $918,34 untuk seluruh proses indeks, yang dihabiskan untuk kecerewetan model itu sendiri alih-alih untuk tugas-tugasnya. Jika 160 juta token yang sama diproses dengan tarif keluaran Kimi K3 sebesar $15,00, Anda berada di angka $2.400, dan dari situlah keunggulan harganya berasal. Namun peringatan praktisnya ditujukan bagi siapa pun yang memperkirakan biaya dengan mengambil jumlah token dari model lain: Step 5 Preview menulis sekitar 1,8 kali median, jadi beban kerja yang berat keluaran mendapatkan tarif yang lebih murah sekaligus token yang lebih banyak. Diskonnya tetap ada, tetapi lebih kecil daripada yang terlihat dari perbandingan $1,00/$2,70 dengan $3,00/$15,00, dan besarnya sepenuhnya bergantung pada seberapa cerewet prompt Anda membuat model tersebut.

Diskon cache 95% adalah tuas lainnya, dan itu luar biasa agresif. Beban kerja dengan penggunaan ulang prompt yang tinggi — prompt sistem yang panjang, dokumen tetap, basis kode bersama — jauh lebih dekat ke angka campuran $0.51 daripada ke tarif input $1.00. Angka campuran itu mengasumsikan rasio 7:2:1, yang merupakan asumsi pemodelan, bukan jaminan, tetapi itulah bentuk aritmatika yang tepat untuk diuji terhadap trafik Anda sendiri.

A generated two-column comparison scoreboard titled 'Step 5 Preview vs Kimi K3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, total params about 600B, active params about 27B, Terminal-Bench 4.0 33.3%, SciCode 59%, and price $1.00 / $2.70. The right column gives Kimi K3 the rows AA Index 44, total params about 2.8T, active params not disclosed, Terminal-Bench 4.0 about 12.6%, SciCode 59%, and price $3.00 / $15.00. A footer reads 'Step 5 Preview figures third-party via Artificial Analysis and unaudited; Kimi K3 figures per Artificial Analysis. Prices per 1M tokens.' The OrcaRouter logo sits in the bottom-right corner.

Apa yang dihadapi para penguji awal

Ini adalah laporan individual dari forum pengembang dan kiriman media sosial pada hari-hari di sekitar kebocoran, bukan pengukuran, dan harus diberi bobot yang sesuai:

• Pemanggilan alat adalah keluhan yang paling umum — nama alat yang dipilih salah, dan pengeditan dilakukan tanpa membaca file target terlebih dahulu

• Kesalahan yang dilaporkan melewati sekitar 340.000 token konteks, yang merupakan mode kegagalan yang perlu diwaspadai jika jendela 1M ternyata adalah angka sebenarnya

• Pemfilteran konten memotong output pada beberapa prompt

• Kesan kemampuan terbagi: sebagian penguji menempatkannya di atas GLM-5.3 Flash, yang lain menempatkannya di bawah DeepSeek V4.1 Flash

Build pratinjau yang belum dirilis gagal dalam penggunaan alat bukanlah skandal — memang itulah gunanya label pratinjau. Tetapi itu berarti angka 44 tidak boleh dibaca sebagai janji tentang keandalan agentik, karena Intelligence Index tidak menguji hal yang paling dikeluhkan oleh para penguji awal.

Bagaimana Anda sebenarnya menyebutnya — dan apa yang digunakan untuk sementara ini

OrcaRouter tidak merutekan Step 5 Preview. Tidak ada endpoint publik dan tidak ada bobot, jadi tidak ada yang bisa dirutekan, dan belum ada platform pihak ketiga yang dapat dengan jujur mengklaim sebaliknya. Siapa pun yang memberi tahu Anda di mana harus memanggilnya hari ini sedang menggambarkan endpoint evaluasi, bukan produk.

Model-model yang dijadikan pembandingnya adalah soal lain. Kimi K3, GLM-5.3, dan DeepSeek V4.1 Flash semuanya tersedia melalui OrcaRouter, di samping 199 model dari 15 penyedia, di balik satu kunci API dan satu tagihan. Harga diteruskan sebesar harga daftar penyedia dengan markup 0%, yang lebih penting daripada biasanya pada model seperti ini: jika $1.00/$2.70 milik Step 5 Preview bertahan saat peluncuran lalu berubah, rute pass-through ikut berubah pada hari yang sama, bukan menurut jadwal penetapan harga ulang pihak lain.

Ketika model itu akhirnya dapat dipanggil, cara yang masuk akal untuk menjalankan model yang belum resmi dirilis adalah cara Anda menjalankan model apa pun yang belum Anda percayai — di balik rute dengan failover otomatis, sehingga kegagalan pemanggilan tool atau error konteks panjang dialihkan ke model yang berfungsi, alih-alih ikut menjatuhkan aplikasi Anda. Itulah pola yang secara khusus dianjurkan oleh laporan-laporan awal di sini: build pratinjau dengan masalah pemanggilan tool dan error konteks panjang yang dilaporkan justru merupakan model yang sebaiknya Anda beri fallback di belakangnya, bukan model yang Anda inginkan berada di jalur produksi sendirian.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models showing 199 models from 15 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a 'How to call any model' card showing a POST request to the OrcaRouter chat completions endpoint.

Apa yang akan mengubah ini dari kebocoran menjadi rilis?

Tiga hal yang perlu diperhatikan, diurutkan menurut seberapa jauh hal itu akan menyelesaikan persoalan. Pertama, halaman model dan harga di platform pengembang StepFun sendiri — saat step-5 muncul di daftar model, lembar spesifikasi vendor menggantikan setiap pembacaan pihak ketiga dalam artikel ini, termasuk pasangan 600B/27B dan klaim konteks 1M. Kedua, penyelesaian kontradiksi konteks 1M versus 350k; batas output 64k di bawah jendela 1M adalah perbedaan yang berarti bagi siapa pun yang membangun pipeline dokumen panjang atau agentic, dan saat ini belum terselesaikan. Ketiga, apakah penetapan harga ini merupakan sikap peluncuran atau lini permanen — harga pratinjau pada model unggulan Tiongkok punya rekam jejak berubah begitu kapasitas mengetat, dan $2,70 per juta token output cukup agresif untuk mengundang pertanyaan itu.

Setidaknya sampai yang pertama dari semua itu terwujud, ringkasan yang jujur adalah bahwa Step 5 Preview tampak seperti model yang benar-benar efisien — total 600B yang mengerjakan beban agregat kelas 2.8T, dengan harga yang jauh lebih murah daripada para pesaing di pasar — namun dengan spesifikasi yang belum terverifikasi, pajak verbositas yang nyata, dan reputasi pemanggilan tool yang belum benar-benar diraih. Layak dijadikan pertimbangan dalam perencanaan. Belum layak untuk dijadikan taruhan jalur produksi.

Dibandingkan dalam artikel ini4

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari