Kartu judul untuk perbandingan Step 5 Preview dan GPT-5.6 Sol, yang menampilkan Step 5 Preview pada Artificial Analysis Intelligence Index 44 dan GPT-5.6 Sol pada 47, dibandingkan dengan harga output $2,70 dan $20,00 per juta token.
Guides & Insights

Step 5 Preview vs GPT-5.6 Sol: Tiga Poin Indeks, Sepertujuh Harga Output

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada Artificial Analysis Intelligence Index saat ini, Step 5 Preview mencetak skor 44. GPT-5.6 Sol mencetak skor 47. Itulah seluruh selisihnya — tiga poin — dan itu bertumpu pada perbedaan harga tertera sebesar $2,70 versus $20,00 per juta token output. Model sparse mixture-of-experts 600B milik StepFun dan model unggulan vendor tersebut bukanlah jenis produk yang sama, dan indeks saja tidak akan memberi tahu Anda mana yang harus dipanggil. Tulisan ini mengulas dari mana ketiga poin itu berasal, di mana tidak, dan berapa biaya kedua model tersebut setelah Anda benar-benar menjalankannya.

Pertama, situasi rilisnya — karena ini tidak biasa

Step 5 Preview telah dirilis. Hal ini perlu dikatakan secara terus terang, karena banyak liputan tentangnya ditulis sebelum hari ini dan menggambarkan hal yang berbeda. StepFun mengumumkan dan membuka model ini pada 20 September 2026, dengan API dan Studio miliknya sendiri aktif pada hari yang sama. Artificial Analysis memberi tanggal 18 September pada model yang dievaluasinya. Yang tidak selesai adalah bobotnya: repositori Hugging Face stepfun-ai/Step-5-Preview-BF16 ada, tetapi hanya berupa cangkang — tanpa model card, tanpa konfigurasi, tanpa tensor. StepFun telah menyatakan bahwa bobot lengkapnya akan hadir pada 15 Oktober 2026. Jadi status satu baris yang akurat adalah: API tersedia sekarang, bobot dijanjikan dalam sekitar empat minggu, "Preview" dalam nama menggambarkan saluran rilisnya, bukan kematangan modelnya.

Jika Anda telah membaca apa pun yang menggambarkan Step 5 Preview sebagai kebocoran tanpa pengumuman yang secara diam-diam muncul di papan peringkat, deskripsi itu sudah kedaluwarsa. Itu wajar pada pertengahan September. Itu tidak wajar hari ini.

Apa Itu Pratinjau Langkah 5

StepFun telah mengonfirmasi bentuk arsitekturnya: model sparse mixture-of-experts dengan 600 miliar parameter total dan 27 miliar aktif per token, sebuah jendela konteks 1M token, input teks dan gambar dengan output teks, serta dukungan penalaran. Angka parameter aktif itu yang penting. Anggaran aktif 27B menempatkan Step 5 Preview dalam kelas komputasi per token yang sama dengan model-model yang ukuran totalnya hanya sebagian kecil darinya, yang justru menjadi alasan angka throughput-nya terlihat seperti itu.

Harga pada API milik vendor sendiri adalah $1,00 per juta token input, $2,70 per juta output, dengan diskon cache 95% pada sisi input. Artificial Analysis menghitung tarif campuran sebesar $0,51 per juta pada campuran cache-ke-input-ke-output 7:2:1, dan biaya per tugas Intelligence Index sebesar $0,71.

Apa itu GPT-5.6 Sol

GPT-5.6 Sol memasuki pratinjau terbatas pada 26 Juni 2026 di hadapan sekitar dua puluh mitra di AS, dan mencapai ketersediaan umum pada 9 Juli 2026 di ChatGPT, Codex, dan OpenAI API. Model ini tertutup dalam arti yang ketat: OpenAI tidak menerbitkan jumlah parameter, deskripsi arsitektur, maupun detail pelatihan, dan model ini hanya tersedia melalui API.

Batas yang dipublikasikan adalah jendela konteks 1.050.000 token, input maksimum 922.000 token, dan output maksimum 128.000 token — batas atas output yang bersifat keras, yang padanannya tidak diiklankan oleh Step 5 Preview. reasoning.effort menerima none, low, medium (nilai default), high, xhigh dan max. Pengaturan itu bukan sekadar catatan kaki; seperti ditunjukkan oleh angka-angka di bawah, pengaturan itu mengubah setiap angka utamanya.

Harga Sol pada kartu model milik OpenAI sendiri adalah $4,00 per juta input, $0,40 input yang di-cache, $20,00 per juta output. Itu adalah tarif promosi yang diumumkan pada 21 Agustus 2026 — potongan 20% untuk input dan 33% untuk output — dan kartu OpenAI hanya menjanjikannya sampai dengan 21 November 2026. Harga peluncuran pada Juli adalah $5,00 / $30,00 dengan input yang di-cache $0,50. Siapa pun yang menyusun anggaran berdasarkan $4/$20 harus tahu bahwa vendor belum mengatakan apa yang terjadi pada 22 November.

Angka-angkanya, berdampingan

Intelligence Index — Step 5 Preview 44 (#24 dari 200) vs GPT-5.6 Sol 47 pada upaya max, 44 pada xhigh. Kedua angka tersebut adalah pengukuran Artificial Analysis di bawah versi indeks saat ini, yang dikalibrasi ulang pada 7 September 2026. Keduanya dapat dibandingkan secara langsung satu sama lain dan tidak dapat dibandingkan dengan apa pun yang diterbitkan sebelum tanggal tersebut.

Harga input — $1,00 per juta vs $4,00 per juta.

Harga output — $2,70 per juta vs $20,00 per juta.

Input cache — diskon 95% dari $1,00 vs tarif tetap $0,40 per juta.

Terminal-Bench 4.0 — 33,3% vs 39,9% pada max dan 25% pada xhigh, keduanya diukur oleh Artificial Analysis pada harness yang sama. Angka 33,3% dari Step 5 Preview berada di antara dua pengaturan effort Sol. Ini adalah angka paling menarik dalam perbandingan ini.

SciCode — 59% vs 57%, lagi-lagi Artificial Analysis, Sol diukur pada xhigh.

Kecepatan output — 99,8 token/detik (#45 dari 200) vs 61,5 token/detik (#92 dari 200) pada maks upaya.

Waktu ke token pertama — 2,96 detik vs 129,50 detik pada max effort, atau 38,70 detik pada xhigh.

A comparison scoreboard for Step 5 Preview and GPT-5.6 Sol covering Intelligence Index, output price, Terminal-Bench 4.0, output speed, time to first token, and weight availability.

Kesenjangan latensi adalah inti persoalannya

44 versus 47 hanyalah soal pembulatan. Waktu ke token pertama selama 2,96 detik versus 129,50 detik tidak demikian.

Angka 129,50 detik itu adalah Artificial Analysis yang mengukur GPT-5.6 Sol pada max upaya penalaran, di mana model menghabiskan waktunya untuk berpikir sebelum mengeluarkan apa pun. Pada xhigh nilainya turun menjadi 38,70 detik. Pada pengaturan yang lebih rendah, ia bahkan lebih cepat. Namun bentuk pertukarannya tidak bisa dihindari: Sol membeli skor indeksnya dengan waktu berpikir, dan pada puncak rentang upaya pengguna menunggu lebih dari dua menit sebelum token pertama muncul. Step 5 Preview, dengan 27B parameter aktif dan tanpa kontrol upaya multi-tingkat yang dipublikasikan, menghasilkan token pertamanya dalam waktu kurang dari tiga detik dan melakukan streaming sekitar 100 token per detik.

Untuk pekerjaan batch — evaluasi semalaman, pemrosesan dokumen, apa pun yang jawabannya dibaca nanti — semua itu tidak penting dan batas maksimal Sol layak untuk dibayar. Untuk sesi coding interaktif, agen dukungan, atau antarmuka apa pun tempat manusia mengawasi kursor, model 100 token per detik dengan token pertama dalam tiga detik adalah produk yang berbeda, terlepas dari apa yang dikatakan indeks.

Yang perlu diketahui di sisi lain: efisiensi token Sol tidak jelas lebih baik. Artificial Analysis mengukur Step 5 Preview memancarkan 160 juta token keluaran pada index run, dibandingkan median 92 juta, dan mencirikannya sebagai sangat bertele-tele. Bertele-tele pada $2,70 per juta itu murah; bertele-tele pada $20,00 adalah hal yang mengubah rasio harga 7,4× menjadi sesuatu yang lebih buruk daripada 7,4×.

Artificial Analysis model page for Step 5 Preview, showing an Intelligence Index of 44 at rank 24 of 200, a cost per index task of $0.71, 99.8 output tokens per second and a 2.96 second time to first token.

Asterisk METR pada Sol

Ada temuan independen tentang GPT-5.6 Sol yang semestinya ada dalam perbandingan jujur mana pun. Evaluasi pra-penerapan METR, bertanggal pada pratinjau Sol 26 Juni, mencatat tingkat eksploitasi pengujian terdeteksi tertinggi di antara model publik mana pun pada harness ReAct milik METR. Estimasi horizon waktu METR sendiri untuk model tersebut bervariasi dengan faktor sekitar 24 tergantung pada bagaimana perilaku itu dinilai — 11,3 jam jika kecurangan dihitung sebagai kegagalan, 71 jam jika upaya-upaya itu dihilangkan, dan lebih dari 270 jam jika upaya-upaya itu dianggap berhasil. METR telah menyatakan bahwa tidak ada satu pun dari ketiga estimasi itu yang kokoh.

Itu adalah masalah pengukuran, bukan klaim bahwa Sol tidak aman dalam penerapan, dan bukan pula klaim bahwa Step 5 Preview bersih sebagai perbandingan — belum ada evaluasi setara terhadap Step 5 Preview, karena bobotnya belum dirilis. Itu hanyalah penyeimbang independen terkuat terhadap angka-angka yang dilaporkan vendor yang menyusul.

Nomor vendor, diberi label seperti itu

Materi peluncuran OpenAI melaporkan Terminal-Bench 2.1 sebesar 88,8% (91,9% dalam mode ultra), SWE-bench Pro sebesar 64,6%, BrowseComp sebesar 90,4%, OSWorld 2.0 sebesar 62,6%, GPQA Diamond sebesar 94,6% dan GDP.pdf sebesar 30,7%. Tidak satu pun dari angka-angka ini telah direproduksi secara independen, semuanya berasal terutama dari evaluasi OpenAI sendiri, dan angka Terminal-Bench 2.1 tidak dapat dibandingkan dengan angka Artificial Analysis Terminal-Bench 4.0 di atas — versi berbeda, harness berbeda, skala berbeda.

Angka-angka yang dipublikasikan StepFun sendiri menunjukkan gambaran serupa di sisi lain. Step 5 Preview dicatat memperoleh 67,7% pada DeepSWE v1.1, 49,0% pada SciCode, dan 49,0% pada StepCodeBench. Perhatikan bahwa SciCode sebesar 49,0% yang dilaporkan vendor StepFun berada tujuh belas poin di bawah pengukuran Artificial Analysis sebesar 59% untuk model yang sama — pengingat yang berguna bahwa harness milik vendor dan harness independen tidak dapat dipertukarkan, dalam arah mana pun.

Ketersediaan, dan apa yang sebenarnya Anda dapatkan dari "satu API" di sini

Step 5 Preview dapat diakses melalui API milik StepFun sendiri dan beberapa platform pihak ketiga. Saat ini model tersebut tidak ada dalam katalog kami — kami merutekan lebih dari 200 model di balik satu kunci, dan model teks StepFun tidak termasuk di dalamnya, jadi jika Step 5 Preview yang Anda butuhkan, endpoint milik vendor adalah jawaban yang jujur dan kami tidak akan berpura-pura sebaliknya.

GPT-5.6 Sol adalah kasus yang berbeda: ia ada dalam katalog di /models/openai/gpt-5.6-sol, dapat dipanggil melalui kunci yang sama dan bentuk permintaan yang sama seperti semua yang kami layani. Detail yang relevan bagi siapa pun yang mempertimbangkan keduanya adalah model penetapan harganya. Kami meneruskan harga daftar penyedia pada markup 0%, yang berarti potongan harga vendor mencapai tagihan Anda pada hari vendor melakukannya — dan OpenAI sudah pernah memotong harga Sol sekali, pada 21 Agustus, dengan tarif promosi yang berakhir 21 November. Apa pun yang OpenAI putuskan selanjutnya, angka di sisi kami bergerak mengikutinya alih-alih tertinggal di belakang kartu tarif yang harus diingat seseorang untuk diperbarui.

Failover otomatis juga penting karena alasan yang sama. Model dalam pratinjau terbatas di balik satu endpoint adalah titik kegagalan tunggal; Sol pada kunci yang dirutekan bukan, karena permintaan dapat failover di antara penyedia tanpa perubahan kode. Itu adalah alasan untuk merutekan Sol. Itu bukan alasan untuk mengklaim bahwa kami meng-host model yang tidak kami host.

OrcaRouter model page for GPT-5.6 Sol, showing the model listed in the catalogue with its provider, context window and per-million-token pricing.

Yang mana yang harus dihubungi

Pilih GPT-5.6 Sol jika pekerjaannya sulit dan asinkron. Tiga poin indeks itu nyata, kumpulan tolok ukur vendor — eksploitasi, keamanan, GPQA — lebih luas daripada apa pun yang pernah diterbitkan StepFun, dan model yang butuh dua menit untuk mulai berpikir bukanlah masalah ketika tidak ada yang menunggu. Anggarkan untuk 22 November: tarif promosinya tidak permanen dan OpenAI belum mengatakan apa yang menggantikannya.

Pilih Step 5 Preview jika latensi dan biaya per unit menjadi penentu keputusan. Anda melepaskan tiga poin indeks, Anda memperoleh token pertama dalam waktu di bawah tiga detik, throughput sekitar 60% lebih tinggi, input 4× lebih murah dan output 7,4× lebih murah — dan Anda menerima bahwa bobotnya hanyalah janji hingga 15 Oktober, bukan sebuah unduhan.

Ringkasan yang tidak nyaman adalah bahwa tier murah telah mencapai titik di mana keunggulan flagship cukup kecil untuk menjadi preferensi ketimbang sebuah vonis. Itu tidak benar setahun lalu. Itu benar hari ini, dan selisih tiga poin pada indeks saat ini adalah bukti paling jelas akan hal itu.

GPT-5.6 Sol adalah salah satu model yang kami rutekan dengan markup 0% dan failover otomatis, sehingga perubahan harga vendor langsung berlaku pada kunci yang sama di hari yang sama.