Kartu judul yang dihasilkan untuk Step 5 Preview vs NVIDIA Nemotron 3 Ultra 550B A55B bertuliskan 'dua puluh satu poin indeks untuk dua puluh sen', dengan tiga chip statistik: Artificial Analysis Intelligence Index 44 versus 23, harga output $2,70 versus $2,50 per juta token, dan biaya per tugas indeks $1,03 versus $0,60. Logo OrcaRouter berada di strip putih di kanan bawah.
Guides & Insights

Step 5 Preview vs Nemotron 3 Ultra: Dua Puluh Satu Poin Indeks untuk Dua Puluh Sen

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Salah satu dari model ini bisa Anda unduh sore ini juga, dan justru model itulah yang kalah dengan selisih dua puluh satu poin. Step 5 Preview, andalan tertutup milik StepFun, membuka API-nya pada 20 September 2026 dan tidak punya berkas lisensi yang bisa Anda pegang; NVIDIA Nemotron 3 Ultra 550B A55Bsudah ada di Hugging Face sejak 4 Juni 2026 di bawah lisensi permisif dengan resep pelatihannya turut disertakan. Pada Artificial Analysis Intelligence Index, keduanya tercatat 44 berbanding 23. Pada harga output, angkanya $2.70 berbanding $2.50 per juta token. Dua puluh satu poin demi dua puluh sen bukanlah perbandingan yang bisa disimpulkan secara gamblang ke salah satu arah, itulah sebabnya hal ini layak dikerjakan dengan benar alih-alih hanya membaca sekilas dua kolom utama lalu memilih satu pihak.

Tidak satu pun dari keduanya merupakan peluncuran minggu ini, dan itu penting bagi cara Anda membaca angka-angka di bawah ini. Keduanya sudah dapat dipanggil selama berbulan-bulan, keduanya telah melewati harness independen yang sama, dan tidak ada perubahan rate card pada keduanya dalam periode ini. Yang berubah justru lebih kecil dan lebih menarik: indeks yang menjadi dasar penilaian mereka telah dibangun ulang pada September, dan keduanya kini dinilai terhadap dua median berbeda yang diambil dari dua populasi berbeda. Di situlah perbandingan ini sebenarnya ditentukan.

Dua jenis produk yang sangat berbeda

Baca lembar spesifikasinya secara berdampingan dan hal pertama yang akan terlihat adalah bahwa keduanya nyaris bukan kategori benda yang sama.

• Parameter — Step 5 Preview sekitar 600 miliar total dengan 27 miliar aktif per token menurut dokumentasi StepFun sendiri; Nemotron 3 Ultra adalah 550 miliar total dengan 55 miliar aktif, menurut angka yang dicatat dewan independen terhadap konfigurasinya.

• Arsitektur — StepFun tidak menerbitkan deskripsi internal untuk Step 5 Preview. Kartu NVIDIA mendokumentasikan arsitektur hibrida: lapisan Mamba-2 yang berselang-seling, lapisan atensi terpilih, susunan LatentMoE, dan head Multi-Token Prediction.

• Jendela konteks — 1 juta token pada tabel spesifikasi Step 5 Preview, dengan output maksimum 64.000 token, juga didokumentasikan oleh StepFun. Nemotron 3 Ultra tercatat pada 262.144 token oleh evaluator yang menjalankannya; kartu vendor mengiklankan hingga 1 juta, dapat dicapai melalui konfigurasi serving, bukan secara bawaan.

• Masukan — teks, gambar, dan video pada Step 5 Preview, hingga 60 gambar per permintaan dan file MP4 di bawah 128MB. Hanya teks pada Nemotron 3 Ultra.

• Kontrol penalaran — pengaturan upaya rendah, sedang, dan tinggi yang terdokumentasi di sisi StepFun; flag templat obrolan di sisi NVIDIA yang mengaktifkan atau menonaktifkan jejak pemikiran.

• Bobot — tidak ada yang dipublikasikan untuk Step 5 Preview, yang bersifat proprietary dan hanya tersedia via API, dengan checkpoint BF16 yang menurut StepFun akan menyusul pada 15 Oktober 2026. Nemotron 3 Ultra menghadirkan build BF16 dan NVFP4 serta model reward GenRM di Hugging Face di bawah OpenMDW-1.1.

• Batas minimum penerapan — tidak berlaku untuk model API; delapan GPU kelas B200 atau kelas GB200, atau enam belas H100, pada model terbuka, sesuai batas minimum dari vendor.

• Daftar tarif — $1,00 input, $0,10 saat cache hit, dan $2,70 output untuk Step 5 Preview, dari halaman harga berbahasa Inggris StepFun. Sekitar $0,60 input, $0,16 saat cache hit, dan $2,50 output untuk Nemotron 3 Ultra, dan perhatikan dengan saksama dari mana pasangan angka itu berasal: NVIDIA tidak menerbitkan daftar tarif, jadi angka tersebut adalah harga penyedia teramati yang dicatat oleh dewan independen, bukan angka dari vendor.

Baris yang dianggap paling menentukan oleh kebanyakan orang adalah baris pertama, dan baris itu justru paling tidak informatif dari delapan baris. Kedua total itu hanya terpaut sembilan persen satu sama lain, sementara parameter aktif berbeda dengan faktor dua, dan parameter aktiflah yang menentukan biaya komputasi setiap token yang dihasilkan. Tidak satu pun dari kedua angka itu memprediksi selisih dua puluh satu poin.

Generated two-column comparison scoreboard for Step 5 Preview and NVIDIA Nemotron 3 Ultra 550B A55B across six shared rows: Artificial Analysis Intelligence Index 44 against 23; output price $2.70 against $2.50 per million tokens; cost per index task $1.03 against $0.60; output speed 87 against 135.6 tokens per second; weights, 'none, BF16 checkpoint promised 15 October' against 'BF16 and NVFP4 on Hugging Face today'; and input, 'text, image and video' against 'text only'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and that the Nemotron rate is the recorded provider listing rather than a vendor rate card. The OrcaRouter logo sits in a white strip at the bottom right.

Median adalah pilihan yang dibuat sebelum Anda membaca skor.

Dewan independen tidak menilai model terhadap satu bidang. Dewan itu mengelompokkannya — dan kelompok tempat suatu model berada mengubah kalimat yang tercetak di bawah skornya, tanpa mengubah skornya.

Step 5 Preview ditempatkan di kelas penalaran umum, yang oleh papan peringkat dihitung sebanyak 227 model, dan median model sebandingnya adalah 26. Nemotron 3 Ultra ditempatkan di kelas open-weights, yang dihitung sebanyak 117 model, dengan median 18. Jadi papan peringkat yang sama menggambarkan 44 sebagai "jauh di atas rata-rata" dan 23 sebagai "di atas rata-rata," dan kedua deskripsi itu benar, karena 44 unggul delapan belas poin dari mediannya dan 23 unggul lima poin dari mediannya sendiri.

Ini bukan tipuan, dan bukan karena papan peringkatnya bersikap tidak adil. Ini adalah cara yang benar untuk menyajikan model terbuka — Anda membandingkan checkpoint yang dapat diunduh dengan checkpoint lain yang dapat diunduh, karena tim yang hanya bisa mengambil unduhan tidak sedang memilih dari 227. Tetapi ini berarti bahwa siapa pun yang mengutip "di atas rata-rata" tentang Nemotron 3 Ultra dan "di atas rata-rata" tentang 44 sedang membandingkan dua kalimat yang berbeda satu sama lain. Jika Anda menginginkan satu angka untuk pasangan itu, gunakan indeks mentah dan terima selisih dua puluh satu poin; jika Anda menginginkan keputusannya, gunakan kelasnya dan akui bahwa Anda sudah memilih bidang Anda.

Screenshot of the Artificial Analysis model page for Nemotron 3 Ultra 550B A55B (Reasoning), showing an Intelligence Index of 23 in a class of 117 open-weights models with a comparable-model median of 18, pricing of $0.60 per million input tokens and $2.50 per million output tokens with a 73 percent cache discount, an average cost of $0.60 per index task, 110 million output tokens generated during the run against a 140 million median, 135.6 output tokens per second, and a 262,144-token context window.

Apa yang diukur oleh satu harness pada keduanya

Tabel vendor tidak dapat saling dikurangkan, karena StepFun dan NVIDIA menjalankan rangkaian uji yang berbeda pada hari yang berbeda dan materi NVIDIA tidak memuat setiap benchmark yang dilaporkan StepFun. Dasar yang jujur adalah irisan: apa yang dijalankan satu evaluator terhadap keduanya.

Pada Artificial Analysis Intelligence Index, titik temu itu adalah 44 berbanding 23. Untuk biaya per tugas indeks yang diselesaikan, nilainya $1,03 berbanding $0,60. Pada kecepatan keluaran, keadaannya terbalik, dan tajam: 87 token per detik untuk Step 5 Preview berbanding 135,6 untuk Nemotron 3 Ultra, jadi model yang skornya hampir dua kali lebih tinggi justru adalah model yang menjawab sekitar setengah detik lebih lambat per token.

Baris tunggal yang paling mencolok adalah Terminal-Bench 4.0. Step 5 Preview mencetak 33,3 persen di sana. Nemotron 3 Ultra mencetak 0,5 persen. Itu bukan artefak pembulatan di kedua sisi dan bukan celah yang halus — pada rangkaian terminal agentik spesifik itu, model andalan open-weight praktis tidak terdaftar. Jebakannya adalah papan yang sama juga mencantumkan model yang sama pada 53,9 persen di Terminal-Bench 2.1. Dua tolok ukur dengan nama yang hampir sama, dua generasi berbeda dari keluarga tugas yang sama, dan satu model berada di 53,9 pada yang lebih lama dan 0,5 pada yang lebih baru. Jika Anda pernah melihat angka Nemotron di kisaran lima puluhan yang dikutip kepada Anda, dari situlah angka itu berasal, dan itu bukan rangkaian tolok ukur yang berlaku saat ini.

Satu kesesuaian patut disebut justru karena jarang terjadi. Kartu milik NVIDIA sendiri mengklaim 87,0 persen pada GPQA tanpa alat; uji independen mengukur 86,7 persen. Angka vendor dan angka dari pihak luar yang hanya terpaut tiga persepuluh poin adalah wujud tabel evaluasi yang dapat dipercaya, dan itu membuat 0,5 persen pada Terminal-Bench 4.0 lebih mudah diterima sebagai nyata, bukan sebagai kesalahan evaluator.

Ke mana uang sebenarnya mengalir dalam sebuah index run

Harga per token sangat sedikit memberi gambaran tentang berapa biaya sebuah beban kerja, dan pasangan ini menunjukkan hal itu lebih baik daripada kebanyakan. Papan tersebut menerbitkan penguraian biaya untuk indeks lengkap setiap model, dan untuk keduanya, pos biaya yang dominan bukanlah generasi.

Biaya Step 5 Preview sebesar $1,03 per tugas terbagi menjadi $0,85 untuk input dan $0,17 untuk output. Dalam angka input tersebut, $0,62 adalah pembacaan cache, $0,22 adalah penulisan cache, dan hanya $0,014 yang merupakan input baru yang tidak di-cache. Dalam angka output tersebut, $0,12 adalah jejak penalaran dan $0,06 adalah jawaban akhir.

Biaya Nemotron 3 Ultra sebesar $0.60 per tugas terbagi menjadi $0.53 untuk input dan $0.07 untuk output, dan komposisi di dalam lini input hampir merupakan kebalikannya — $0.48 untuk penulisan cache dibandingkan hanya $0.04 untuk pembacaan cache.

Dua kesimpulan muncul. Yang pertama adalah bahwa pada evaluasi jangka panjang dengan penggunaan ulang prefiks yang besar, sekitar delapan puluh persen dari biaya yang Anda keluarkan berada di sisi input pembukuan, sehingga tingkat hit cache dan kedisiplinan konteks Anda menjadi angka yang perlu dioptimalkan, bukan panjang output Anda. Yang kedua adalah bahwa kedua model sampai pada tagihannya dengan cara yang berbeda: Step 5 Preview membayar untuk membaca ulang prefiks bersama yang besar, sedangkan Nemotron 3 Ultra membayar untuk menuliskan konten yang berbeda ke dalam cache sejak awal. Biaya utama yang mirip, dua tagihan yang berbeda — dan jika beban kerja Anda lebih menyerupai salah satu pola tersebut daripada yang lain, urutan pada $1,03 dan $0,60 bisa terbalik.

Angka-angka verbositas menjelaskan sisa baris keluaran. Step 5 Preview menghasilkan sekitar 160 juta token keluaran di seluruh rangkaian indeks, dibandingkan median 82 juta, yang oleh papan itu digambarkan secara datar sebagai sangat bertele-tele. Nemotron 3 Ultra menghasilkan 110 juta dibandingkan median 140 juta, yang disebutnya cukup ringkas. Model yang lebih murah adalah yang singkat, dan ia singkat ke arah yang penting untuk sebuah tagihan.

Screenshot of StepFun's English documentation page for Step 5 Preview showing the specification table - model ID step-5-preview, a 1M-token context window, text, image and video input with text output, a 1M maximum input and a 64k maximum output - together with the input and video format notes listing JPG, JPEG, PNG, WebP and static GIF at up to 60 images per request and MP4, QuickTime and Matroska video under 128MB per file.

Apa yang diperoleh dari unduhan, dan berapa biaya untuk mempertahankannya

Harga Nemotron 3 Ultra bukan $2.50 per juta token keluaran jika Anda mengambil checkpoint-nya. Itu adalah harga untuk menyewa deployment milik orang lain atas model tersebut. Ambil unduhannya dan Anda telah membeli rangkaian biaya dan rangkaian hak yang berbeda.

Hak-haknya bersifat konkret dan itulah bagian yang tidak dapat ditandingi oleh model yang hanya berbasis API berapa pun harganya. OpenMDW-1.1 hadir bersama bobotnya, dan NVIDIA menerbitkan kumpulan data pra-pelatihan dan pasca-pelatihan serta resep pelatihannya bersamaan dengan itu. Ada build NVFP4 yang ukurannya kira-kira setengahnya untuk model yang sama, dan bobot Ultra telah dilatih terlebih dahulu dengan resep NVFP4 alih-alih dikuantisasi setelahnya — itulah sebabnya build kecil tersebut merupakan artefak kelas satu di kartu tersebut, bukan eksperimen komunitas. Posisi komersialnya dinyatakan secara gamblang: siap untuk penggunaan komersial dan non-komersial.

Biayanya sama-sama konkret. Deployment minimumnya adalah delapan GPU kelas B200 atau enam belas H100, dan itulah batas bawah yang dinyatakan kartu tersebut, bukan sekadar saran. Jendela konteks yang benar-benar Anda peroleh bergantung pada cara Anda mengonfigurasi serving, dengan 256K sebagai default dan 1M di balik pengaturan eksplisit. Tim yang tidak dapat mengalokasikan satu rak tidak sedang memilih di antara kedua model ini pada input $1,00 dan $0,60; mereka memilih antara satu model dan sebuah pesanan pembelian.

Ada versi perbandingan ini di mana model terbuka menang pada sumbu yang katanya orang pedulikan dan jarang diberi harga — ketergantungan. Step 5 Preview adalah endpoint yang Anda panggil dan vendor yang Anda percaya, dengan checkpoint yang dijanjikan alih-alih dikirim. Jika StepFun merevisi kartu tarifnya, memperketat batasnya, menghentikan ID-nya, atau mengalami minggu buruk, satu-satunya tuas Anda adalah penanganan error Anda sendiri. Bobot Nemotron 3 Ultra sudah ada di disk di klaster seseorang, dan itu bernilai sesuatu yang nyata bahkan ketika model yang sama sedang kalah dua puluh satu poin indeks.

Ada baiknya kita tepat mengenai apa yang dimaksud dengan "dijanjikan" di pihak lain, karena situasinya lebih berantakan daripada yang diakui oleh kedua kubu. Beberapa mirror pihak ketiga dari build BF16 muncul di Hugging Face pada 20 September, hari API dibuka, sebagian di antaranya jauh lebih dari satu terabyte safetensors. Itu adalah unggahan ulang komunitas, bukan rilis vendor, dan StepFun tidak menerbitkan pengumuman open-weights apa pun bersamaan dengan itu. Yang mereka buktikan adalah bahwa bobot-bobot tersebut sudah beredar dan bahwa checkpoint 15 Oktober yang dijanjikan akan menjadi formalisasi, bukan pengungkapan.

Angka yang bergerak saat kami membacanya

Satu angka dalam tulisan ini berubah di antara dua kali pembacaan halaman yang sama, dan itu layak disebut karena justru begitulah sebuah perbandingan diam-diam menjadi basi.

Dewan independen menunjukkan biaya $0.71 per tugas indeks untuk Step 5 Preview dalam cakupan bertanggal 9 Oktober 2026. Saat dibaca lagi pada 10 Oktober, halaman yang sama menyebut $1.03. Tidak ada yang berubah pada model dalam rentang waktu itu, karena tidak ada yang bisa mengubah bobot model yang hanya API dalam semalam. Yang berubah adalah akuntansi evaluasinya: ketika harga cache vendor bergerak, ketika evaluator merevisi asumsi pembacaan cache-nya, atau ketika sebuah eksekusi dihitung ulang terhadap bauran token yang berbeda, angka per tugas berubah dan skor indeks tidak.

Jadi perlakukan biaya per tugas sebagai angka yang terus diperbarui dan ditempeli tanggal, bukan sebagai properti model. Setiap angka per tugas di artikel ini adalah pembacaan 10 Oktober dan diberi label seperti itu. Jika Anda menyusun anggaran dari halaman ini, susunlah dari angka yang Anda tarik sendiri pada hari Anda berkomitmen — dan jika Anda membandingkan dua tulisan dari minggu yang berbeda, periksa tanggal pengambilan datanya sebelum menyimpulkan bahwa sebuah model menjadi lebih murah.

Yang mana yang sebenarnya akan Anda panggil?

Katakan dulu bagian yang tidak nyaman: OrcaRouter tidak merutekan satu pun dari kedua model ini. Step 5 Preview dapat diakses melalui API milik StepFun sendiri dan beberapa platform pihak ketiga, dan Nemotron 3 Ultra disediakan dari endpoint milik NVIDIA sendiri serta oleh beberapa penyedia, dan Anda dapat memeriksa kedua klaim tersebut terhadap katalog kami dalam menit yang sama saat Anda membacanya.

Yang tersisa adalah bentuk ketergantungannya, bukan pilihan modelnya, dan inilah satu tempat di mana lapisan perutean benar-benar berguna di sini. Pratinjau khusus API pada satu jalur vendor justru merupakan pengaturan di mana gangguan sesaat di penyedia menjadi pemadaman layanan Anda, dan asuransi murahnya adalah bidang kendali yang dapat mengalihkan permintaan ke cadangan yang memenuhi syarat begitu jalur penyedia menurun. Itulah gunanya failover otomatis: bukan sebagai pengganti Pratinjau Langkah 5, melainkan sebagai hal yang Anda tempatkan di depan model yang benar-benar dapat Anda panggil, sehingga endpoint khusus vendor tidak pernah menjadi satu-satunya jalan menuju produksi. Katalog yang sama yang melakukan itu membawa lebih dari 200 model di balik satu kunci dan satu tagihan, dengan harga daftar penyedia diteruskan tanpa markup 0 persen — yang merupakan separuh argumen lainnya, karena perubahan kartu tarif di mana pun di hulu langsung berlaku di sisi kami pada hari yang sama, bukan pada pembaruan kontrak berikutnya.

Jika tidak ada satu pun model yang akan Anda panggil, versi singkatnya seperti ini. Ambil Step 5 Preview ketika Anda menginginkan skor, input video dan gambar, serta diskon cache 90 persen, dan terimalah bahwa Anda sedang menyewa pratinjau tanpa lisensi atas bobotnya dan checkpoint Oktober yang belum Anda lihat. Ambil Nemotron 3 Ultra ketika bobot lebih penting daripada skor — untuk kendala on-premise, untuk fine-tuning, untuk lisensi yang dapat Anda baca — dan anggarkan rak sebelum Anda menganggarkan token, karena dengan $0.60 per juta token input, penerapan 550 miliar parameter hanya murah jika orang lain sudah membayar GPU-nya.

Hal yang perlu diperhatikan adalah 15 Oktober. Jika StepFun menerbitkan checkpoint BF16 yang dijanjikannya, asimetri utama artikel ini — bahwa hanya salah satu dari kedua ini yang merupakan unduhan — tidak lagi berlaku, dan dua puluh satu poin indeks menjadi jauh lebih sulit untuk dibantah. Jika tanggalnya meleset, argumen untuk model open-weight menguat secara default, yang merupakan cara aneh bagi kesenjangan kemampuan untuk tertutup dan cara yang sangat umum.