
Step 5 Preview vs Gemini 3.1 Pro: Dua Model Bernama Preview, Terpisah Tujuh Bulan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Baik Step 5 Preview maupun Gemini 3.1 Pro sama-sama memuat kata preview, dan kata itu tidak berarti hal yang sama pada keduanya. StepFun mengumumkan Step 5 Preview pada 20 September 2026, dengan API terbuka, bobotnya dijadwalkan pada 15 Oktober, dan repositori BF16 di Hugging Face yang hanya berisi .gitattributes. Pihak lainnya telah dirilis sebagai gemini-3.1-pro-preview di API dan sebagai "Gemini 3.1 Pro Preview" di setiap papan peringkat sejak 19 Februari 2026, menangani lalu lintas produksi selama tujuh bulan tanpa label itu pernah dilepas. Yang satu adalah pratinjau asli dari sesuatu yang belum selesai. Yang lainnya adalah konvensi penamaan yang dilekatkan pada produk yang sudah jadi. Membandingkan keduanya pada sumbu yang sama berarti memutuskan mana dari dua hal itu yang sebenarnya Anda beli, dan jawaban tingkat kedua — bahwa model yang masih disebut preview setelah tujuh bulan adalah yang lebih dapat diprediksi di antara keduanya — adalah bagian yang layak dibawa ke dalam keputusan pengadaan.
Apa yang dikatakan dewan yang sama
Artificial Analysis menilai keduanya pada Intelligence Index v4.3.2, sepuluh evaluasi. Ini satu-satunya tempat kedua ini diukur oleh pihak yang sama, dan hasilnya lebih jauh berbeda daripada yang disiratkan oleh materi vendor di kedua belah pihak.
• Indeks Kecerdasan — Step 5 Preview 44 vs Gemini 3.1 Pro Preview 30
• Peringkat — Step 5 Preview ke-24 dari 200 model vs Gemini 3.1 Pro Preview ke-69 dari 200
• Harga per 1 juta token — Step 5 Preview $1,00 masuk / $2,70 keluar vs Gemini 3.1 Pro $2,00 masuk / $12,00 keluar
• Diskon cache — Step 5 Preview 95% vs Gemini 3.1 Pro 90%
• Kecepatan keluaran — Step 5 Preview 99,8 token/detik vs Gemini 3.1 Pro 118,9 token/detik
• Waktu ke token pertama — Step 5 Preview 2,96 dtk vs Gemini 3.1 Pro 35,72 dtk
• Konteks — keduanya 1M token; katalog kami mencantumkan Gemini 3.1 Pro dengan batas keluaran 65K, StepFun belum menerbitkannya
• Modalitas masukan — Pratinjau Langkah 5: teks dan gambar. Gemini 3.1 Pro: teks, gambar, audio, video, dan file. Keduanya hanya menghasilkan teks
• Bobot — Step 5 Preview ditutup hari ini, checkpoint BF16 dijadwalkan pada 15 Oktober; Gemini 3.1 Pro proprietary sepenuhnya
Selisih 14 poin pada skala yang nilai tertingginya berada di 53 adalah selisih yang besar, dan selisih itu harus dilaporkan berdampingan dengan hal yang membuatnya aneh: angka evaluasi yang diterbitkan Google sendiri untuk model ini sangat baik. Vendor melaporkan 77,1% pada ARC-AGI-2, 82,8% pada suite multimodalnya, 94,1 pada GPQA Diamond, dan 47,0 pada Humanity's Last Exam. Itu bukan angka yang lemah. Angka-angka itu juga milik Google sendiri, dijalankan pada harness milik Google, dan mengukur kemampuan spesifik alih-alih agregat yang dinilai oleh indeks tersebut. Kedua kumpulan angka itu bisa sama-sama akurat pada saat yang bersamaan. Ketika evaluasi utama vendor dan komposit independen berselisih setajam ini, komposit itulah yang harus menjadi acuan untuk merencanakan beban kerja produksi, karena komposit itulah yang memberi penalti kepada model atas hal-hal yang tidak dipilih vendor untuk diukur.
Dua baris kecepatan itu lebih baik dibaca bersama-sama daripada terpisah. Gemini 3.1 Pro menghasilkan token 19% lebih cepat setelah mulai — 118,9 versus 99,8 — dan membutuhkan 35,72 detik untuk mulai, dibandingkan 2,96 milik Step 5 Preview. Itu adalah profil model yang berpikir panjang sebelum menghasilkan output. Untuk pekerjaan batch yang tidak ditunggu manusia, generator yang lebih cepat unggul dalam hal throughput. Untuk loop agen yang melakukan puluhan panggilan yang saling bergantung, perbedaan dua belas kali lipat dalam waktu ke token pertama adalah perbedaan antara alat interaktif dan antrean.

Satu-satunya sumbu di mana Gemini menang telak
Modalitas bukan catatan kaki dalam perbandingan ini. Gemini 3.1 Pro menerima teks, gambar, audio, video, dan file sembarang, sedangkan Step 5 Preview menerima teks dan gambar. Jika pipeline Anda melibatkan rekaman layar, rekaman panggilan, kumpulan PDF, atau feed video, hanya satu dari dua model ini yang dapat menerima input sama sekali, dan selisih indeks 14 poin tidak relevan karena model lainnya tidak dapat menjawab pertanyaan tersebut.
Asimetri itu menentukan lebih banyak beban kerja nyata daripada yang ditentukan tabel tolok ukur. Peninjauan video, analisis rapat, transkripsi audio plus penalaran, dan alur kerja dokumen yang dibangun dari file hasil pindai semuanya adalah kasus ketika keluasan Gemini 3.1 Pro menjadikannya satu-satunya kandidat di halaman ini. Itu juga alasan model ini tetap berada dalam produksi selama tujuh bulan dengan label pratinjau: beban kerja yang ditanganinya adalah beban kerja yang tidak dapat digantikan oleh model teks-dan-gambar yang lebih baru.
Untuk pekerjaan teks dan gambar, kalkulasinya terbalik. Step 5 Preview unggul 14 poin secara agregat, kira-kira dua kali lebih cepat pada harga input dan 4,4 kali lebih murah untuk output, serta menjawab dalam seperdua belas waktu. Pada beban kerja ekstraksi dokumen atau obrolan di atas tangkapan layar, tidak ada alasan untuk membayar premi dan menunggu sebelas detik ekstra untuk pertimbangan.
Di mana penetapan harga menjadi kurang merata daripada yang terlihat
Harga yang ditampilkan meremehkan perbedaannya, dan penyebabnya adalah batas tingkatan, bukan tarif.
Tarif $2.00 dan $12.00 Gemini 3.1 Pro berlaku hingga 200.000 token input. Di atas itu, kedua tarif naik menjadi $4.00 dan $18.00 — kenaikan 50% pada output yang berlaku untuk seluruh permintaan, bukan hanya bagian yang melewati batas. Step 5 Preview dengan $1.00 dan $2.70 tidak memiliki tier yang dipublikasikan; harganya tetap sama berapa pun panjang yang diizinkan oleh jendela konteks.
Kedua model mengiklankan konteks 1M token, jadi keduanya mengundang Anda untuk membangun pipeline konteks panjang. Pada salah satunya, permintaan 300.000 token berbiaya dua kali lipat dari yang tertera di daftar harga; pada yang lain tidak demikian. Itu adalah keunggulan struktural bagi Step 5 Preview tepat pada kategori yang menjadi alasan StepFun membangunnya — pekerjaan agentik berhorizon panjang dengan konteks besar yang direferensikan berulang kali — dan hal itu diperkuat oleh diskon cache, di mana 95% milik Step 5 Preview versus 90% milik Gemini 3.1 Pro semakin memperlebar selisihnya pada pola prefiks berulang yang dihasilkan oleh loop agen.
Dihitung secara kasar, dan ditandai sebagai aritmetika alih-alih angka yang dikutip: sebuah loop agen yang mengirim konteks 250.000 token pada setiap satu dari empat puluh giliran berarti sepuluh juta token masukan. Pada tarif di atas 200K milik Gemini 3.1 Pro, dengan cache menyerap prefiks yang berulang, itu adalah kenaikan yang berarti dibandingkan dengan apa yang tersirat dari tarif daftar $2.00. Pada tarif tetap $1.00 milik Step 5 Preview dengan diskon cache yang lebih dalam, loop yang sama menelan biaya lebih sedikit dan, yang lebih penting, biayanya adalah sesuatu yang dapat Anda prediksi dari daftar harga tanpa membaca tabel tier terlebih dahulu.

Ketersediaan adalah pembeda yang tenang
Gemini 3.1 Pro sudah dapat dipanggil selama tujuh bulan melalui API Google dan, yang lebih berguna untuk perencanaan, melalui beberapa penyedia independen — itulah yang membuat angka latensi p50 bermakna, bukan sekadar anekdot. Step 5 Preview membuka API-nya pada 20 September dan hanya memiliki satu sumber. Endpoint bersumber tunggal yang baru berumur beberapa hari adalah komponen paling tidak dapat diprediksi yang dapat Anda tempatkan di jalur produksi, bukan karena modelnya buruk, tetapi karena belum ada yang mengetahui kurva kapasitasnya.
Itulah argumen untuk melakukan routing alih-alih memilih. Gemini 3.1 Pro Preview ada di katalog kami dengan harga $2,00 dan $12,00 dengan kenaikan tiernya diteruskan tanpa perubahan, dan model-model yang dijadikan pembandingnya berada tepat di sampingnya, di balik satu kunci untuk lebih dari 200 model dengan harga daftar dari penyedia diteruskan pada markup 0%. Step 5 Preview tidak ada dalam daftar itu — model ini berjalan di API milik StepFun sendiri, dan sampai bobotnya dirilis, hanya di sanalah model ini berjalan. Failover otomatis adalah yang membuat preview yang baru berumur beberapa hari aman untuk diuji coba, bukan sekadar taruhan: pertahankan jalur produksi pada model yang sudah punya rekam jejak, kirimkan beban teks-dan-gambar ke Step 5 Preview selama Anda mengevaluasinya dengan trafik Anda sendiri, dan biarkan fallback menahan saat endpoint preview menurun kinerjanya. Tidak ada kontrak kedua dan tidak ada SDK terpisah untuk model yang kami rutekan, jadi perubahan harga dari Google muncul di tagihan Anda sebagai angka terkini, bukan saat perpanjangan.

Yang mana yang sebenarnya sedang Anda beli?
Jika pekerjaan Anda datang dalam bentuk video, audio, atau file, Gemini 3.1 Pro adalah satu-satunya model di halaman ini yang dapat menerimanya, dan kesenjangan indeks tidak masuk ke dalam keputusan. Tujuh bulan dalam produksi dengan label pratinjau yang masih melekat adalah sinyal stabilitas, bukan peringatan: konvensi penamaan tetap ada karena Google tidak pernah perlu mengubahnya, dan model tersebut berperilaku sebagai pekerja keras produksi yang memang seperti itu.
Jika pekerjaan Anda berupa teks dan gambar dalam volume besar dengan konteks berulang yang besar, Step 5 Preview unggul pada setiap metrik yang penting — 14 poin indeks, setengah harga input, tarif output 4,4x lebih murah, tanpa jurang tier, diskon cache yang lebih dalam, dan waktu ke token pertama yang diukur dalam detik, bukan dalam setengah menit. Yang Anda beli di sana adalah endpoint sumber tunggal yang baru berusia beberapa hari tanpa lisensi yang dipublikasikan dan tanpa batas output yang dipublikasikan, yang merupakan risiko nyata sekaligus risiko yang terbatas.
Hal yang perlu dicermati bukanlah indeksnya, melainkan apakah StepFun menerbitkan batas atas keluaran bersama jendela konteks 1M-token, karena pengumuman vendor tersebut tidak menyebutkan hal itu dan konfigurasi pihak ketiga terpisah yang beredar selama kebocoran mencantumkan konteks 350.000 dengan batas keluaran 64.000 — produk yang secara substansial berbeda dari yang ada di daftar harga. Batas 65K Gemini 3.1 Pro, sebagaimana tercantum dalam katalog kami, juga tidak longgar, tetapi batas itu dinyatakan, dan batas yang dinyatakan adalah batas yang bisa Anda perhitungkan dalam desain.
