
Step 5 Preview vs Claude Opus 5: Tujuh Poin Indeks untuk Tagihan Tujuh Kali Lipat
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Materi peluncuran StepFun untuk Step 5 Preview dibuka dengan satu klaim komparatif: satu tugas di atasnya menghabiskan biaya seperdelapan dari tugas yang sama di Claude Opus 5. Kedua model kini berada di papan independen yang sama, sehingga klaim itu dapat diperiksa, bukan diperdebatkan. Artificial Analysis menjalankan masing-masing melalui Intelligence Index v4.3.2 — sepuluh evaluasi — dan menerbitkan biaya tiap penjalanan, dengan Claude Opus 5 dinilai pada pengaturan upaya penalaran maksimumnya sendiri. Step 5 Preview: 44 pada indeks, $922,84 untuk menyelesaikan penjalanan. Claude Opus 5: 51 pada indeks, $7.274,74. Itu berarti 7,9 kali lebih banyak uang demi 7 poin skor, dan rasio yang dikutip StepFun ternyata memang akurat. Yang disembunyikan oleh rasio itu adalah bagian yang menarik, karena kesenjangan ini bukan terutama kesenjangan harga. Ini adalah kesenjangan verbositas yang mengenakan pakaian kesenjangan harga, dan memisahkan keduanya mengubah model mana yang sebaiknya Anda tempatkan di hadapan beban kerja mana.
Dua biaya run, satu papan, dan apa yang sebenarnya ada di dalamnya.
Biaya total eksekusi adalah perbandingan tunggal paling bersih yang tersedia di sini karena kedua model menjawab pertanyaan yang sama di bawah perangkat uji yang sama, dan tidak ada vendor yang menghasilkan angka tersebut. Angka ini juga merupakan angka yang paling mungkin salah dibaca, sehingga layak untuk dikupas.
• Skor indeks — Step 5 Preview 44 vs Claude Opus 5 51, Claude Opus 5 dinilai pada pengaturan upaya penalaran maksimumnya
• Total biaya untuk menyelesaikan indeks — Step 5 Preview $922.84 vs Claude Opus 5 $7,274.74
• Harga campuran pada komposisi 7:2:1 cache-hit / input / output — Step 5 Preview $0.51 per 1 juta token vs Claude Opus 5 $3.85
• Token keluaran yang dihasilkan selama proses indeks — Step 5 Preview 160M vs Claude Opus 5 140M
• Harga daftar — Step 5 Preview $1.00 masuk / $2.70 keluar vs Claude Opus 5 $5.00 masuk / $25.00 keluar
Lihat baris ketiga dan kelima secara bersamaan, dan aritmetikanya tidak lagi menjadi perbandingan harga yang lugas. Tarif campuran Step 5 Preview 7,5 kali lebih murah, dan tarif daftarnya 5 kali lebih murah untuk input serta 9,3 kali lebih murah untuk output — jadi campuran itu melakukan hal yang tidak dilakukan oleh harga input. Itu karena campuran diberi bobot ke arah output, dan output adalah tempat kedua model paling berbeda. Claude Opus 5 mengenakan biaya 9,3 kali tarif output Step 5 Preview, dan kedua model menulis sangat banyak: 140 juta token output untuk Claude Opus 5 dibandingkan median 92 juta di antara model-model yang dinilai indeks, dan 160 juta untuk Step 5 Preview dibandingkan median 92 juta yang sama.
Jadi, pembacaan yang jujur lebih sempit daripada "model murah itu tawaran bagus." Step 5 Preview lebih murah dalam segala hal, dan ini bukan model yang hemat — ia menulis 74% lebih banyak keluaran daripada model median yang dijadikan tolok ukurnya, yang justru merupakan perilaku yang seharusnya dihukum oleh harga tersebut. Claude Opus 5 menulis 52% lebih banyak daripada median dan mengenakan biaya 9,3 kali lebih besar untuk setiap token tersebut. Pemanggil yang membatasi panjang keluaran mendapatkan rasio yang berbeda daripada pemanggil yang tidak.
Pertanyaannya bukan mana yang lebih baik. Pertanyaannya adalah di mana titik peralihannya berada.
Misalkan indeks tersebut adalah proksi yang wajar untuk pekerjaan yang benar-benar Anda kirim — tugas agentik berhorizon panjang, kode, penggunaan alat multi-langkah. Maka titik persilangannya mudah dinyatakan: Claude Opus 5 harus setidaknya 7,9 kali lebih berguna per tugas sebelum sepadan dengan tagihannya, dan pada indeks itu ia lebih baik 7 poin pada skala 100 poin. Kedua fakta itu tidak harus mengarah ke arah yang sama, karena selisih indeks 7 poin bukan berarti 16% lebih baik dalam segala hal. Itu adalah agregat dari sepuluh evaluasi, dan komposisinya lebih penting daripada totalnya.
Itulah argumen untuk memedulikan bentuk kedua skor itu alih-alih angka utamanya. Pembacaan Terminal-Bench 4.0 untuk Step 5 Preview adalah 33,3% — hasil agentik yang nyata, di depan DeepSeek V4.1 Flash pada 26,8% — tetapi belum ada dalam catatan yang dipublikasikan yang menunjukkan bahwa model ini menyamai Claude Opus 5 pada evaluasi horizon panjang, bidang yang paling kuat bagi model Anthropic tersebut. Materi StepFun sendiri mengakui hal ini dalam penyusunan kalimatnya: pada ALE-CLI, FrontierFinance, dan DRACO, perusahaan menempatkan Step 5 Preview di posisi kedua, di belakang GPT-6 Astra atau Claude Opus 5, dan di depan model-model terbuka lain dalam perbandingan tersebut. Peringkat kedua dengan harga seperlima adalah hasil yang benar-benar bagus. Tetapi itu juga bukan peringkat pertama, dan tugas-tugas tempat sebuah model finis di posisi kedua biasanya adalah tugas-tugas yang membutuhkan peringkat pertama.
Asimetri lainnya adalah apa yang terjadi pada pemanggilan yang buruk. Jawaban salah dari model murah yang memakan waktu empat detik dan 2.000 token membuat Anda menanggung percobaan ulang; jawaban salah yang sama dari Claude Opus 5 dengan 25 dolar per juta token keluaran membuat Anda menanggung percobaan ulang ditambah proses pertimbangannya. Jika pipeline Anda mencoba ulang saat gagal — sebagian besar loop agen melakukannya — biaya efektif per keberhasilan tugas adalah angka yang penting, dan rasionya tidak sama dengan harga daftar, karena kedua model tidak akan gagal pada tingkat yang sama. Belum ada yang menerbitkan angka itu untuk Step 5 Preview.

Perbandingan spesifikasi, dimensi demi dimensi
• Skor indeks — Step 5 Preview 44 vs Claude Opus 5 51, keduanya pada Intelligence Index v4.3.2, Claude Opus 5 pada pengaturan upaya penalaran maksimumnya
• Harga per 1 juta token — Step 5 Preview $1,00 masuk / $2,70 keluar vs Claude Opus 5 $5,00 masuk / $25,00 keluar
• Diskon cache — Step 5 Preview 95% vs Claude Opus 5 90%
• Konteks — keduanya 1M token; StepFun belum menerbitkan batas keluaran dan milik Anthropic adalah 128K
• Input — keduanya menerima teks dan gambar; keduanya hanya mengeluarkan teks
• Kecepatan output — Step 5 Preview 99,8 token/detik vs Claude Opus 5 55,3 token/detik
• Permukaan kontrol — Step 5 Preview mengekspos extended thinking; Claude Opus 5 menggantikan temperature dan top_p dengan dial upaya penalaran yang adaptif
• Bobot — Step 5 Preview ditutup hari ini, checkpoint BF16 dijadwalkan pada 15 Oktober; Claude Opus 5 proprietary sepenuhnya
• Bukti independen — keduanya dinilai oleh Artificial Analysis; baris tolok ukur agentik StepFun dijalankan oleh vendor dan tidak direproduksi
Dua baris patut diberi catatan. Kesenjangan kecepatan itu nyata dan dalam praktik lebih besar daripada yang disiratkan tabel: 99,8 token per detik versus 55,3 berarti model yang selesai sekitar dua kali lebih cepat untuk keluaran yang sama, dan waktu ke token pertama Step 5 Preview sebesar 2,96 detik versus 56,84 detik milik Claude Opus 5 pada papan yang sama adalah hal yang berbeda kelas — meskipun angka kedua itu mengukur konfigurasi penalaran dengan upaya maksimum, di mana model menimbang-nimbang sebelum mengeluarkan apa pun. Ini bukan latensi yang dialami panggilan produksi. Dibandingkan endpoint standar, katalog kami sendiri melaporkan waktu ke token pertama p50 sebesar 6,73 detik untuk Claude Opus 5, yang merupakan angka yang harus dijadikan acuan jika Anda tidak sengaja meminta deliberasi maksimum.
Baris diskon cache adalah baris yang secara diam-diam menentukan beban kerja berulang, dan baris itu menguntungkan Step 5 Preview, 95% berbanding 90%. Sebuah loop agen yang mengirim ulang system prompt dan konteks repositori yang sama pada setiap panggilan hampir seluruhnya bergantung pada diskon tersebut, sehingga selisih lima poin menumpuk sepanjang sesi yang panjang.

Ketika Claude Opus 5 masih menjadi satu-satunya jawaban
Tidak ada yang di atas membantah model Anthropic. Biayanya memang sebesar itu karena ia melakukan hal yang coba diukur oleh indeks tersebut, dan ia melakukannya di dekat puncak papan peringkat — 51 pada Intelligence Index v4.3.2, unggul tujuh poin dari Step 5 Preview dan berada dalam jangkauan para pemimpin generasi saat ini. Beban kerja ketika selisih agregat 7 poin meremehkan perbedaannya adalah beban kerja yang tidak mentoleransi jawaban peringkat kedua: refaktor berjam-jam yang mode kegagalannya adalah perubahan perilaku yang halus, model keuangan yang rantai penalarannya harus dapat diaudit, migrasi yang keputusan salahnya baru ditemukan seminggu kemudian. Dalam kasus-kasus itu, percobaan ulang tidak murah dan pertimbangan mendalamnya adalah produknya.
Beban kerja yang membuat kesenjangan itu tidak relevan adalah beban kerja yang tersusun dari banyak keputusan kecil: langkah klasifikasi dan perutean, ekstraksi, peringkasan, perancah pengujian, ribuan panggilan yang dilakukan agen di antara dua panggilan yang benar-benar penting. Pada beban kerja seperti itu, model dengan nilai 44 yang menjawab dalam separuh waktu dengan seperlima harga input bukanlah kompromi. Itu adalah default yang tepat, dengan model mahal disimpan untuk langkah yang harus benar.
Menjalankan pemisahan tanpa menjalankan dua integrasi
Versi praktis dari perbandingan ini adalah pipeline berjenjang, dan alasan tim tidak membangunnya adalah pengadaan, bukan rekayasa — dua vendor, dua kontrak, dua SDK, dua kunci untuk dirotasi. Claude Opus 5 ada di katalog kami dengan harga $5.00 dan $25.00, dan model teks yang lebih murah yang akan Anda tempatkan di depannya ada di katalog yang sama, semuanya di balik satu kunci untuk lebih dari 200 model dengan harga daftar penyedia diteruskan pada markup 0%. Step 5 Preview tidak ada dalam daftar itu — model ini berjalan di API milik StepFun sendiri, dan sampai bobotnya tersedia, itu satu-satunya tempat model ini berjalan. Menyusun tingkatan di seluruh model yang kami rutekan adalah ekspresi routing-DSL, bukan perubahan kode — kirim panggilan rutin ke model kecil, eskalasi ke model mahal berdasarkan kondisi keyakinan atau kompleksitas, dan pertahankan kedua jalur di balik endpoint yang sama.
Failover otomatis penting di sini karena alasan yang spesifik, bukan sebagai fitur generik. Step 5 Preview membuka API-nya pada hari pengumuman tanpa bobot yang dipublikasikan dan tanpa armada penyajian yang diungkapkan; ini adalah endpoint pratinjau yang baru berumur beberapa hari, dan endpoint pratinjau dibatasi kapasitasnya dengan cara yang tidak dialami endpoint yang sudah matang. Claude Opus 5 dilayani oleh banyak penyedia independen, dan itulah redundansi yang tidak dapat ditawarkan oleh sebuah pratinjau. Mempertahankan model yang sudah terbukti sebagai jalur cadangan — di sisi kami itu berarti model produksi dari katalog, bukan pratinjau — adalah cara Anda mendapatkan sinyal kualitas yang nyata pada beban kerja Anda sendiri tanpa membuat jalur produksi Anda bergantung pada armada yang masih dalam tahap penentuan ukuran.

Aturan keputusan
Jika beban kerja Anda adalah sejumlah kecil tugas yang sangat sulit, Claude Opus 5 bukanlah opsi yang mahal — melainkan opsi yang murah, karena jawaban terbaik kedua biayanya lebih besar daripada selisihnya. Jika beban kerja Anda adalah sejumlah besar tugas biasa dengan sejumlah kecil tugas sulit di dalamnya, Step 5 Preview dengan harga $1.00 dan $2.70 dengan diskon cache 95% adalah default yang lebih baik dan selisih 7 poin sebagian besar hanyalah kesalahan pembulatan pada pekerjaan yang tidak membutuhkannya.
Yang akan mengubah perhitungan itu adalah bukti independen tentang tingkat kegagalan dan tentang baris-baris agentik berhorizon panjang. Angka StepFun sendiri menempatkan model tersebut di peringkat kedua pada evaluasi yang menjadi landasan peluncurannya, dan belum ada pihak ketiga yang mereproduksinya. Perhatikan checkpoint 15 Oktober untuk dua hal: apakah lisensinya mengizinkan fine-tuning yang memungkinkan Anda menutup selisih 7 poin pada data Anda sendiri, dan apakah verbositasnya bertahan setelah akhiran preview dilepas. Yang pertama akan mengubah rasio; yang kedua sudah mengubahnya sekali.
