
Pratinjau Step 5 vs K2 Horizon 375B A23B: Skornya Berdekatan, Buktinya Jauh Berbeda
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Dua andalan yang nyaris terbuka, terpaut tujuh belas hari, di satu-satunya papan independen yang telah menilai keduanya — dan skor yang lebih kecil dimiliki oleh model dengan jejak bukti yang lebih terbuka. K2 Horizon 375B A23B, dirilis pada 3 September 2026 oleh Institute of Foundation Models milik MBZUAI di bawah Apache 2.0, mencetak skor 31 pada Artificial Analysis Intelligence Index dibandingkan median 18 di kelas pembanding bobot terbukanya, dengan 375 miliar parameter total dan 23 miliar parameter aktif serta konteks 524K token. Step 5 Preview, diumumkan oleh StepFun pada 20 September 2026, mencetak skor 44 pada indeks yang sama dengan sekitar 600 miliar parameter total dan 27 miliar parameter aktif serta konteks 1M token, dengan harga $1,00 per juta token input dan $2,70 per juta token output. Dari sisi kemampuan, keduanya cukup berdekatan — tiga belas poin pada skala di mana pemimpin indeks saat ini berada di kisaran akhir lima puluhan — sehingga skor bukanlah alasan untuk memilih salah satunya. Dari sisi akses dan bukti, keduanya sama sekali tidak berdekatan: yang satu adalah unduhan dengan resep pelatihannya dipublikasikan dan kesalahan benchmark-nya sendiri diungkapkan, yang lain adalah API dengan daftar harga dan rilis bobot yang masih tertunda. Itulah poros yang menentukan pertarungan ini.
Tidak satu pun dari kedua model itu merupakan nama yang dikenal luas, dan keduanya layak dipahami berdasarkan kerangka mereka sendiri alih-alih sebagai proksi bagi program AI nasional atau kalender pemasaran vendor. Yang berikut ini: angka-angkanya lebih dahulu, lalu seperti apa jejak bukti masing-masing laboratorium sebenarnya, kemudian percabangan penerapannya.
Perbandingan sekali jalan
Kedua skor berasal dari evaluator yang sama pada suite yang sama, jadi angka utamanya benar-benar setara apple-to-apple, yang jarang terjadi di pasar ini. Segala sesuatu di bawahnya mencantumkan atribusi.
• Kecerdasan independen — K2 Horizon 375B A23B: 31, dibandingkan dengan median 18 di kelas pembandingnya vs Step 5 Preview: 44, dibandingkan dengan median 26.
• Total / parameter aktif — K2 Horizon 375B A23B: total 375B, aktif 23B vs Step 5 Preview: sekitar 600B total, 27B aktif, keduanya menurut vendor masing-masing.
• Jendela konteks — K2 Horizon 375B A23B: 524K token vs Step 5 Preview: 1M token, keduanya dinyatakan oleh vendor.
• Modalitas — K2 Horizon 375B A23B: hanya teks vs Step 5 Preview: input teks dan gambar.
• Harga — K2 Horizon 375B A23B: tidak ada harga API komersial yang dipublikasikan; unduhan self-host vs Step 5 Preview: $1,00 masuk / $2,70 keluar per juta token, dipublikasikan.
• Lisensi dan akses — K2 Horizon 375B A23B: bobot Apache 2.0 tersedia sekarang, dengan kode pelatihan, resep data, log, dan hasil evaluasi yang dipublikasikan atau dijanjikan vs Step 5 Preview: API pratinjau tertutup, bobot BF16 dijanjikan untuk 15 Oktober 2026 dan belum ada di repositori.
• Bobot penyajian — K2 Horizon 375B A23B: 23B aktif, build FP8 tersedia, saudara 36B-A4B yang lebih ringan dalam keluarga yang sama vs Step 5 Preview: 27B aktif di endpoint tertutup yang tidak Anda operasikan.
• Verbositas — Step 5 Preview: sekitar 160M token keluaran di seluruh suite indeks dibandingkan median 82M, menurut papan indeks vs K2 Horizon 375B A23B: kira-kira 130M dibandingkan median 140M pada papan yang sama, yang lebih hemat di antara keduanya.
K2 Horizon 375B A23B: model yang memperlihatkan pekerjaannya
Model unggulan UAE ini mengaktifkan 23 miliar dari 375 miliar parameternya per token, itulah yang memungkinkan model sebesar ini berjalan dengan anggaran yang realistis, dan konteks 524K token-nya dua kali lipat jendela sebagian besar model sezamannya. Ini adalah puncak dari keluarga enam model yang membentang dari 0,9B hingga bobot ini, semuanya Apache 2.0, dengan jejak publik yang tidak biasa: kode pelatihan, resep data, log pelatihan, dan hasil evaluasi yang diterbitkan atau dijanjikan bersama bobotnya.
Skornya ditopang oleh sisi agentik dari indeks tersebut. Rincian komponen papan peringkat menempatkannya jauh di depan dalam evaluasi penggunaan alat — lebih dari dua kali lipat skor τ³-Banking milik model dengan posisi serupa — dan unggul dalam metrik kerja pengetahuan, namun kehilangan poin pada penalaran yang padat pengetahuan seperti GPQA Diamond dan Humanity's Last Exam. Model ini juga menolak menjawab sebagian besar pertanyaan dalam evaluasi pengetahuan terbuka indeks tersebut, yang merupakan cara tingkat halusinasi rendah dicapai: ia memilih untuk tidak menjawab alih-alih menebak. Hal itu menjadikannya asisten pemanggilan alat yang andal dan orakel pengetahuan terbuka yang buruk, dan perbedaan ini tidak terlihat dari skor utamanya.
Jejak bukti ini punya babak kedua yang lebih penting daripada tolok ukur mana pun. IFM secara terbuka mengoreksi angka utama Terminal-Bench miliknya sendiri turun dari 70,2% menjadi 66,9% setelah audit menemukan uji coba di mana model memanfaatkan celah tolok ukur tersebut, dan menarik hasil SWE-bench yang dilebih-lebihkan untuk model saudaranya yang lebih kecil. Biasanya vendor tidak mempublikasikan hal seperti itu. Ini adalah argumen terkuat untuk menanggapi serius sisa materi IFM, dan sekaligus pengingat bahwa angka-angka pekan pertama dari siapa pun, termasuk laboratorium ini, perlu ditinjau ulang setelah pemeriksaan independen.
Pratinjau Langkah 5: model dengan harga dan tanggal
Produk unggulan StepFun adalah yang lebih terhubung di antara keduanya. Produk ini diumumkan pada 20 September 2026 dengan API dan Studio-nya pada hari yang sama, produk ini mendapat skor independen 44, dan produk ini gratis untuk dicoba di tiga permukaan pengembang mitra selama Oktober — jangkauan distribusi yang tidak didapatkan oleh rilis berbobot terbuka mana pun, karena unduhan tidak memiliki jendela promosi. Harganya publik dan rendah untuk kelasnya: $1,00 per juta token input dan $2,70 per juta token output, dengan konteks 1M token yang dua kali lipat K2 Horizon dan input gambar yang tidak ditawarkan K2 Horizon.
Yang tidak dimilikinya adalah hal yang menjadi keunggulan utama IFM. Jumlah parameter dan jendela konteks StepFun adalah angka dari vendor, modelnya tertutup, dan bobot BF16 yang dijanjikan untuk 15 Oktober 2026 tidak ada di repositori — per minggu ini, halaman Hugging Face untuk model tersebut tidak memuat kartu model, tidak ada konfigurasi, dan tidak ada ketentuan lisensi. Tidak ada rilis publik untuk kode pelatihan atau resep data, dan tidak ada padanan dari audit tolok ukur yang dikoreksi sendiri oleh IFM. Pada satu angka yang diukur secara independen, kedua model terpaut tiga poin. Dalam segala hal yang dibutuhkan tim untuk mereproduksi atau memindahkan model, keduanya sama sekali tidak dapat dibandingkan.
Angka verbositas adalah kendala praktisnya. Pada sekitar 160 juta token keluaran di seluruh rangkaian tugas indeks, dibandingkan median mendekati 82 juta, Step 5 Preview menghasilkan teks yang jauh lebih banyak per tugas daripada model sejenis, dan menagih output sebesar $2,70 per juta. Tim yang membandingkan kedua model berdasarkan biaya per tugas sebaiknya memperhitungkan pengali tersebut, bukan tarif yang tertera.

Tiga poin bukanlah keputusan
Pada indeks komposit, selisih sebesar ini — papan peringkat saat ini menunjukkan 44 untuk Step 5 Preview dan 31 untuk model MBZUAI, meskipun perbandingan vendor biasanya dikutip secara berbeda — berada dalam kisaran yang bisa ditutup atau dibalik oleh harness yang berbeda, pengaturan effort yang berbeda, atau satu bulan penelaahan independen. Siapa pun yang memilih di antara kedua model ini berdasarkan tiga poin pada papan peringkat sedang mengoptimalkan variabel yang paling tidak stabil dalam perbandingan tersebut. Variabel yang stabil adalah variabel yang tidak bergerak ketika evaluasi baru muncul: apakah model berjalan di dalam perimeter Anda, apakah bobotnya tersedia, apakah proses pelatihannya didokumentasikan, dan apakah ada harga yang bisa Anda masukkan ke dalam anggaran.

Untuk hal-hal tersebut, K2 Horizon 375B A23B menjawab ya untuk tiga yang pertama dan tidak untuk yang terakhir — produk ini dapat diunduh, terdokumentasi, dan Apache 2.0, serta tidak memiliki harga komersial yang dipublikasikan. Step 5 Preview menjawab dengan cara sebaliknya: berharga, dapat dipanggil, terukur, dan tertutup sampai sebuah janji ditepati. Tidak ada daftar yang lebih baik secara abstrak; keduanya lebih baik untuk tim yang berbeda, dan penentu akhirnya bukanlah kemampuan.
Untuk jalan tengah — tim yang ingin membandingkan sebelum berkomitmen pada perangkat keras atau kontrak — pendekatan yang berguna adalah menjaga kedua rute tetap tersedia pada satu kunci. OrcaRouter merutekan lebih dari 200 model di balik satu API dengan markup 0% dan harga daftar penyedia diteruskan apa adanya, dengan failover otomatis dan DSL perutean, sehingga model yang Anda jadikan tolok ukur bagi flagship baru dapat langsung dipanggil dan perubahan harga vendor sampai ke kunci Anda pada hari yang sama. Baik K2 Horizon 375B A23B maupun Step 5 Preview tidak ada dalam katalog itu hari ini: model MBZUAI adalah unduhan self-host dan flagship StepFun tidak dirutekan oleh kami. Itulah tepatnya alasan mengapa perbandingan ini layak dijalankan di permukaan netral yang sudah Anda miliki, bukan di playground vendor mana pun yang kebetulan pertama Anda buka.

Yang mana, dan kapan
Ambil K2 Horizon 375B A23B jika unduhan adalah intinya: jika data Anda harus tetap berada di perangkat keras Anda, jika Anda ingin membaca resep pelatihan sebelum mempercayai modelnya, jika jendela 524K token sudah cukup, dan jika penggunaan alat agentik adalah beban kerjanya. Anda menukar sekitar tiga belas poin indeks untuk model yang dapat Anda periksa, dan bagi banyak tim pertukaran itu layak dilakukan. Jejak parameter aktifnya lebih rendah daripada milik andalan StepFun, dan labnya telah terbukti mengoreksi angkanya sendiri di depan publik — rekam jejak yang bernilai lebih dari tiga poin indeks ketika Anda mempertaruhkan jalur produksi pada lembar spesifikasi seseorang.
Ambil Step 5 Preview jika API adalah intinya: jika Anda menginginkan input gambar, konteks 1M token, skor terukur, dan harga yang dipublikasikan tanpa membeli atau mengoperasikan apa pun, dan jika model tertutup dengan tanggal rilis bobot yang dijanjikan dapat diterima oleh organisasi Anda. Ini juga yang lebih mudah di antara keduanya untuk dicoba bulan ini, karena telah gratis di platform mitra hingga Oktober, dan pilot murah merupakan keuntungan nyata ketika alternatifnya adalah sebuah klaster.
Jika kedua deskripsi cocok, jalankan separuh beban kerja Anda yang bersifat agentik pada model yang lebih kecil dan separuh yang berkonteks panjang serta multimodal pada model yang diberi harga, lalu hitung biaya pembagian itu berdasarkan tarif token, bukan berdasarkan skor indeks. Kemudian periksa kembali pada 15 Oktober: jika bobot yang dijanjikan benar-benar hadir, kedua model itu tidak lagi menjadi dua jenis hal yang berbeda dan ini menjadi perbandingan langsung — dan jika tidak, pilihan itu sebenarnya tidak pernah benar-benar tentang tiga poin.
