
Step 5 Preview vs GPT-6 Astra: Sepuluh Kali Harga Input untuk Sembilan Poin Indeks
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Kedua model ini diumumkan terpaut tujuh belas hari dan harganya ditujukan untuk "planet" yang berbeda. Step 5 Preview, model sparse mixture-of-experts 600B parameter milik StepFun yang diumumkan pada 20 September 2026, mematok $1,00 per juta token input dan $2,70 per juta token output. GPT-6 Astra, model unggulan vendor tersebut yang dirilis pada 3 September 2026, mematok $10,00 dan $50,00 untuk unit yang sama di bawah ambang input 272K token — serta $20,00 dan $75,00 di atasnya. Itu berarti sepuluh kali harga input dan sekitar delapan belas kali harga output untuk model yang mencetak sembilan poin lebih tinggi pada Intelligence Index independen, 53 berbanding 44. Apakah Astra lebih baik tidak perlu dipertanyakan. Apakah selisih itu sepadan dengan tambahan tiga puluh dolar per juta token output pada beban kerja Anda, itulah pertanyaannya, dan jawabannya berubah dua kali sepanjang artikel ini.
Untuk apa masing-masing model
Step 5 Preview dibangun dan dijual untuk pekerjaan agentik: pengkodean AI, rekayasa perangkat lunak, pekerjaan pengetahuan profesional, keuangan. Arsitekturnya disetel untuk itu — 600B parameter total dengan sekitar 27B aktif per token, konteks 1M token, input teks dan gambar, serta penalaran dengan pemikiran yang diperluas. StepFun melewati seluruh lini Step 4.x untuk sampai ke sini, bergerak langsung dari Step-3.7-Flash ke Step 5.
GPT-6 Astra adalah model andalan serbaguna OpenAI: konteks 1M token, output hingga 128K token, masukan berupa teks, gambar, dan file, keluaran berupa teks, batas pengetahuan 30 April 2026, serta dukungan untuk alur kerja penalaran, coding, dan agentik. Ini adalah model yang dipilih perusahaan ketika jawabannya harus benar dan biaya token bukanlah kendala pembatas.
• Indeks Kecerdasan — Step 5 Preview 44 vs GPT-6 Astra 53
• Parameter — Step 5 Preview 600B total / 27B aktif vs GPT-6 Astra tidak diungkapkan
• Konteks dan batas keluaran — keduanya memiliki konteks 1M token; Astra mencantumkan jendela 1.050.000 token dan batas keluaran 128K, StepFun belum menerbitkan batas keluaran
• Modalitas masukan — teks dan gambar vs teks, gambar, dan file
• Kecepatan keluaran — Step 5 Preview 99,8 token/detik vs GPT-6 Astra 59,3 token/detik
• Harga per 1 juta token — $1,00 masuk / $2,70 keluar vs $10,00 masuk / $50,00 keluar di bawah 272 ribu input, naik menjadi $20,00 / $75,00 di atasnya
• Cache — Step 5 Preview diskon 95% vs GPT-6 Astra diskon baca 90% dengan tarif penulisan cache $12,50 per juta
• Biaya per tugas Intelligence Index — Step 5 Preview $0,71 vs GPT-6 Astra $3,26

Faktur, baris demi baris
Harga Step 5 Preview datar dan murah: $1,00 masuk, $2,70 keluar, dengan diskon cache 95% yang membuat input tercache mendekati $0,05 per juta token. Pada campuran cache-hit, input, dan output 7:2:1 — konvensi yang digunakan blog ini untuk lalu lintas agen — tarif campuran berada di sekitar $0,51 per juta token, dan biaya per tugas Intelligence Index menjadi $0,71, peringkat ke-27 dari 200. Catatannya adalah verbositas: model menghasilkan 160M token output pada Index tersebut dibandingkan median 92M, sehingga jumlah token mentah lebih tinggi daripada yang disiratkan oleh harga tiket.
Harga GPT-6 Astra bertingkat, dan tingkatannya adalah bagian yang perlu dibaca dengan saksama. Di bawah 272K token masukan per permintaan, harganya $10,00 dan $50,00; di atasnya, $20,00 dan $75,00. Tingkatan dipilih berdasarkan jumlah token masukan dari masing-masing permintaan, yang lebih penting daripada kedengarannya untuk model yang dijual dengan konteks 1M token — satu panggilan dengan konteks besar melewati batas dan menggandakan tarif untuk keseluruhan permintaan. Pembacaan cache $1,00 per juta, diskon 90%, dan penulisan cache $12,50 per juta. Pada komposisi 7:2:1 yang sama, tarif campuran berada di sekitar $7,70 per juta token, dan biaya per tugas Index adalah $3,26, peringkat ke-71 dari 200.
Astra mengambil arah sebaliknya soal verbositas, dan di sini ia adalah model yang ringkas: 60M token keluaran pada Index dibandingkan 160M milik Step 5 Preview, peringkat ke-27 dari 200 pada ukuran tersebut. Token yang lebih sedikit pada tarif yang lebih tinggi mempersempit kesenjangan itu dengan cara yang dilebih-lebihkan oleh kelipatan mentahnya. Namun itu tidak menutupnya — angka biaya per tugas sudah memperhitungkan verbositas, perilaku cache, dan penetapan harga secara bersamaan, dan $3,26 dibandingkan $0,71 masih merupakan perbedaan 4,6 kali.
Apa yang bisa diperoleh dari sembilan poin indeks
Angka-angka utama Astra adalah milik OpenAI sendiri dan belum direproduksi: 96,1 pada GPQA Diamond, 72,6% pada OSWorld 2.0, 97,6% pada FrontierMath Tier 4, 57,2% pada Humanity's Last Exam dengan alat, dan sekitar 57,9% pada Terminal-Bench 4.0. Angka ARC-AGI-3 adalah yang perlu ditangani dengan hati-hati — OpenAI melaporkan 99,9% di bawah harness adapter penyedia miliknya sendiri dan 62,7% pada harness standar, dan selisih 37 poin antar-harness mengatakan setidaknya sama banyak tentang harness seperti tentang model.
Angka yang dipublikasikan Step 5 Preview berada di wilayah yang sama pada tugas-tugas agentik yang untuknya ia dibangun, dan disertai catatan yang sama: 33,3% pada Terminal-Bench 4.0, 80,5 pada ProgramBench, 67,7 pada DeepSWE v1.1, dan 49,0 pada StepCodeBench, semuanya dari StepFun dan tidak ada yang direproduksi secara independen. Vendor berbeda, harness berbeda, tidak ada run yang sama — itulah tepatnya alasan mengapa selisih sembilan poin yang diukur secara independen adalah angka yang lebih berguna daripada semua angka tersebut.
Kesenjangan itu nyata dan tidak kecil. Di papan peringkat yang berisi 200 model, 53 dan 44 berada di posisi ketiga dan kedua puluh empat, dan pemisahan itu muncul sebagai kelas tugas yang berbeda, bukan skor yang berbeda pada tugas yang sama: kemenangan yang dipublikasikan Astra mengelompok pada penalaran jangka panjang dan penggunaan komputer, yakni area tempat puncak papan peringkat makin menjauh. Jika beban kerja Anda berada di sana, sembilan poin itu lebih bernilai daripada tagihannya.
Satu catatan penting tentang skor Astra. Artificial Analysis merevisi Intelligence Index, dan angka untuk model yang sama bergeser di antara snapshot yang diambil berselang beberapa minggu — 52,8, 53, dan 54,7 semuanya muncul dalam materi yang diterbitkan tentang model ini dalam bulan yang sama. Angka 53 di halaman model saat ini adalah angka yang harus digunakan, dan perbandingan apa pun yang menempatkan snapshot Astra yang lebih lama di samping angka Step 5 Preview saat ini berarti mengukur dengan dua penggaris yang berbeda.

Kecepatan dan latensi adalah dua pertanyaan yang berbeda.
Dalam hal kecepatan generasi, papan peringkat independen tidak ambigu: 99,8 token keluaran per detik untuk Step 5 Preview dibandingkan dengan 59,3 untuk GPT-6 Astra, yang juga lebih lambat daripada rata-rata 70 token per detik di antara model yang diukur. Dalam loop pengodean interaktif, itu adalah perbedaan antara saran dan jeda, dan hal itu menumpuk sepanjang sesi seperti halnya diskon cache.
Latensi adalah cerita yang lebih rumit, dan satu angka saja menyesatkan tentangnya. Astra merutekan penalaran sebelum ia mengeluarkan output, sehingga waktu ke token pertama dan waktu ke jawaban yang dapat digunakan bukan pengukuran yang sama, dan angka-angka yang dipublikasikan untuknya tersebar luas tergantung pada apakah penalaran dihitung. Pada trafik kami sendiri selama tujuh hari terakhir, waktu median ke token pertama GPT-6 Astra adalah 6,72 detik dengan persentil ke-95 sebesar 10,00 detik — angka yang benar-benar dialami pemanggil melalui endpoint kami. Artificial Analysis menempatkan waktu ke token pertama Step 5 Preview pada 2,96 detik di harness-nya sendiri, dan kedua angka tersebut tidak diukur dengan cara yang sama, sehingga keduanya tidak boleh saling dikurangkan.
Di mana asimetri cache sebenarnya bermuara
Kedua model memberikan diskon besar untuk prefiks yang berulang dan keduanya mengenakan biaya untuk menulisnya, dan perbedaan di antara keduanya adalah 20 kali lipat pada pembacaan. Diskon cache 95% milik Step 5 Preview membuat input yang di-cache mendekati $0,05 per juta token. GPT-6 Astra membaca cache pada $1,00 per juta — diskon 90% dari tarif dasar yang sepuluh kali lebih tinggi — dan menulisnya pada $12,50 per juta.
Untuk loop agen yang mengirim ulang prompt sistem dan konteks repositori yang sama pada setiap giliran, tarif pembacaan adalah yang berlipat ganda, dan diskon yang lebih besar pada model yang lebih murah lebih bernilai daripada diskon yang lebih kecil pada model yang mahal. Campuran Astra masih berada di sekitar $7,70 per juta token dibandingkan $0,51 milik Step 5 Preview pada campuran 7:2:1 yang sama — selisih lima belas kali lipat yang tidak menyempit dalam sesi panjang, melainkan makin melebar.
Menjalankan keduanya dari satu kunci
GPT-6 Astra sudah aktif di OrcaRouter dengan openai/gpt-6-astra pada tarif daftar OpenAI — $10,00 dan $50,00 per juta di bawah ambang 272K, $20,00 dan $75,00 di atasnya — diteruskan tanpa markup, sehingga perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama, bukan pada siklus penagihan berikutnya. Telemetri tujuh hari kami sendiri pada endpoint tersebut menunjukkan median 6,72 detik dan persentil ke-95 waktu ke token pertama 10,00 detik seperti yang dikutip di atas, di samping 277,9 juta token lalu lintas yang melewatinya dalam sepekan terakhir.
Step 5 Preview tidak ada di katalog kami dan kami tidak merutekannya. Model ini berjalan di API dan Studio milik StepFun sendiri, dan di situlah satu-satunya tempat model ini berjalan sampai checkpoint 15 Oktober tiba. Asimetri itu bukanlah cacat dalam perbandingan ini; itulah perbandingannya. Bagian murah dari pertarungan ini adalah bagian yang harus Anda cari di tempat lain untuk memanggilnya, dan bagian yang bisa Anda masukkan ke produksi hari ini berada di balik satu API untuk lebih dari 200 model: GPT-6 Astra dengan tarif di atas, GLM-5.3 seharga $1,26 dan $3,96, DeepSeek V4 Pro, Claude Opus 5 dan sisanya, dengan failover otomatis antar penyedia yang menjaga jalur tetap stabil ketika kapasitas penyedia berubah dan DSL perutean yang memungkinkan sebuah tugas dimulai dengan murah dan meningkat hanya bila memang perlu. Aturan eskalasi itulah jawaban sebenarnya untuk selisih harga sepuluh kali lipat: sebagian besar beban kerja tidak memerlukan peringkat teratas, dan lapisan perutean adalah cara Anda berhenti membayar untuk bagian yang tidak memerlukannya.

Siapa yang harus memilih yang mana
Jika beban kerja Anda adalah agen berhorizon panjang yang harus menyelesaikan tugas sulit dengan benar — penggunaan komputer, riset multi-langkah, pekerjaan yang mana jawaban salah lebih mahal daripada tokennya — keunggulan sembilan poin GPT-6 Astra adalah bagian termurah dari keputusan ini, dan fakturnya adalah harga yang dibayar untuk kemampuan tersebut. Jalankan sebagai target eskalasi, bukan sebagai default, dan perhatikan ambang 272K: satu permintaan yang kelebihan ukuran akan menggandakan tarif untuk semua yang ada di dalamnya.
Jika beban kerja Anda adalah teks agentik bervolume tinggi — pembuatan kode, refaktor, ekstraksi terstruktur, loop inti asisten coding — Step 5 Preview unggul dalam segala hal yang diperhitungkan oleh tagihan dan waktu, dan sembilan poin indeks kemungkinan tidak akan bertahan saat bersentuhan dengan distribusi tugas yang tidak berada di puncak papan peringkat. Kendalanya bukan performa: model ini proprietary, tanpa lisensi yang dipublikasikan, tanpa izin penggunaan komersial, dan tanpa checkpoint hingga 15 Oktober. Anda bisa memanggilnya; Anda tidak bisa memilikinya, melakukan fine-tune, atau merilis turunannya.
Jika jawabannya tidak jelas, polanya adalah pemisahan tingkat alih-alih pilihan. Arahkan lalu lintas umum ke model tingkat menengah dan sisakan Astra untuk permintaan yang membutuhkan posisi teratas — kedua ujung aturan itu berada di balik satu kunci di sisi kami, jadi pemisahan ini hanya memerlukan aturan perutean, bukan kontrak kedua. Membayar tarif kelas utama untuk pekerjaan yang bisa diselesaikan dengan benar oleh model tingkat menengah adalah kesalahan yang sebenarnya menjadi pokok perbandingan ini.
