
Reflection Beam vs Kimi K3: Nama Benchmark yang Sama, Dua Harness yang Berbeda
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Reflection Beam mencetak skor 80,1 pada Terminal-Bench 2.1. Kimi K3 mencetak skor 88,3. Tempatkan kedua angka itu berdampingan, seperti yang dilakukan sebagian besar liputan minggu ini, dan Anda akan menyimpulkan Beam tertinggal sekitar delapan poin dari model terbuka terbaik di bidang ini. Tetapi kedua angka itu tidak berasal dari ruangan yang sama. Angka 80,1 milik Beam dilaporkan vendor, diambil dari tabel dalam posting peluncuran Reflection sendiri. Angka 88,3 milik Kimi K3 juga dilaporkan vendor, kali ini dari tabel Moonshot sendiri — dan tabel vendor hanya mencetak skor pesaingnya ketika skor itu dijalankan pada harness milik vendor sendiri, dengan set prompt milik vendor sendiri, pada pengaturan effort milik vendor sendiri. Pihak ketiga, Artificial Analysis, sejak itu menjalankan Kimi K3 pada benchmark dengan nama yang sama dan menerbitkan angka 85,0. Itu selisih 4,9 poin, bukan 8,2 — dan arah koreksinya sepenuhnya dapat diprediksi, karena angka yang tergerus selalu angka yang berasal dari lab yang punya sesuatu untuk dibuktikan.
Itulah seluruh masalah dengan perbandingan yang dijanjikan oleh judul artikel ini, dan itulah sebabnya tulisan ini menghabiskan paruh pertamanya untuk asal-usul ketimbang skor. Reflection Beam adalah model sparse mixture-of-experts dengan 501 miliar parameter dan 23 miliar parameter aktif per token, yang diumumkan pada 5 Oktober 2026 oleh Reflection AI dengan endpoint beta yang kompatibel dengan OpenAI dan aktif pada hari yang sama. Kimi K3 adalah model open flagship milik Moonshot AI, yang tercantum di katalog kami sendiri dengan tanggal rilis 15 Juli 2026 dan dinilai secara independen oleh Artificial Analysis. Salah satunya adalah produk yang sudah dirilis dengan rate card dan pengujian harness pihak ketiga; yang lainnya adalah beta dengan daftar tunggu yang bobot, laporan teknis, dan harganya belum ada. Membandingkan keduanya bukanlah latihan yang simetris, dan berpura-pura sebaliknya akan menghasilkan halaman yang tampak presisi tetapi salah.
Versi 30 detik
• Beam lebih cepat per FLOP di atas kertas, tidak dipatok harga dalam praktik, dan belum direproduksi. Kimi K3 dinilai oleh pihak ketiga, dipatok harga $3,00 untuk input dan $15,00 untuk output per juta token, serta tersedia secara umum.
Pada satu-satunya tolok ukur yang keduanya pernah dijalankan — Terminal-Bench 2.1 — selisih yang jujur adalah sekitar lima poin, bukan delapan, begitu angka masing-masing pihak berasal dari harness yang netral.
• Keunggulan nyata Beam bersifat struktural, bukan numerik: profil penyajian dengan 23B parameter aktif dan lisensi Apache 2.0 yang dijanjikan. Tidak satu pun dari keduanya dapat digunakan saat ini.
Jika Anda membutuhkan model minggu ini, ini bukan sekadar lempar koin. Ini satu model yang sudah tersedia dan satu daftar tunggu.
Apa yang sebenarnya diterbitkan Reflection, dan terhadap siapa
Posting peluncuran Reflection menjalankan satu kartu skor terhadap tujuh model lain: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max, dan DeepSeek V4.1 Flash. Setiap angka dalam tabel dilaporkan vendor, tidak ada satu pun yang telah direproduksi secara independen, dan tidak ada halaman Artificial Analysis untuk Reflection Beam — halaman model tersebut menampilkan 404 di situs mereka per 6 Oktober 2026. Beberapa sel di aslinya ditandai NR karena model tersebut tidak dijalankan.
Berikut ini adalah irisan entire-versus-K3 dari tabel itu, satu baris per dimensi:
• Terminal-Bench 2.1 — Beam 80,1 vs Kimi K3 88,3
• SWE-Bench Pro v2-Hard — Beam 77.2 vs Kimi K3 88.2
• DeepSWE v1.1 — Beam 44.4 vs Kimi K3 68.0
• SWE Atlas Tanya Jawab Basis Kode — Beam 34.6 vs Kimi K3 68.0
• HLE, tanpa alat — Beam 36.2 vs Kimi K3 46.9
• GPQA Diamond — Beam 90,5 vs Kimi K3 93,5
• SciCode — Beam 49,7 vs Kimi K3 58,7
• MCP Atlas — Beam 78,7 vs Kimi K3 82,3
• BrowseComp dengan manajemen konteks — Beam 77.4 vs Kimi K3 91.2
• DeepSearchQA dengan manajemen konteks — Beam 80.1 vs Kimi K3 95.0
Baca daftar itu dengan jujur dan bentuk peluncurannya akan terlihat. Reflection tidak mengklaim kemenangan atas K3 di mana pun. Ia mengklaim berada di dekat puncak sebuah tier sambil menghabiskan komputasi inferensi tiga hingga empat kali lebih sedikit daripada GLM 5.2 pada skor penalaran yang sebanding — dan satu baris tempat kedua model berdekatan, Terminal-Bench 2.1, adalah baris yang perbandingannya paling tidak dapat dipercaya.
Mengapa harness lebih penting daripada skor
Nama benchmark adalah label, bukan spesifikasi. Terminal-Bench 2.1 berarti serangkaian tugas tertentu yang dijalankan di bawah scaffold agen tertentu, dengan kebijakan percobaan ulang tertentu, anggaran token tertentu, dan pengaturan upaya penalaran tertentu. Dua laboratorium dapat sama-sama secara jujur melaporkan angka "Terminal-Bench 2.1" dan menghasilkan angka yang tidak dapat dibandingkan, karena scaffold dan pengaturan upaya adalah tempat sebagian besar varians berada. Artificial Analysis hadir sebagai organisasi justru karena hal ini: ia menjalankan satu harness, dalam satu konfigurasi, pada banyak model, sehingga angka-angkanya dapat saling dikurangkan.
Jadi angka 80,1 yang dicetak Reflection untuk Beam adalah angka vendor pada harness vendor, dan angka 88,3 yang dicetaknya untuk K3 juga merupakan angka vendor — vendornya adalah Reflection, yang mengukur pesaingnya sendiri. Angka kedua itu adalah angka paling tidak dapat diandalkan di baris tersebut: laboratorium yang menjalankan bobot milik pesaing pada scaffold-nya sendiri tidak punya insentif untuk menjalankannya pada konfigurasi terbaik pesaing itu, dan tidak punya kewajiban untuk mengungkap konfigurasi yang dipilihnya. Tidak ada ketidakjujuran di dalamnya; itu hanyalah angka yang asal-usulnya tidak mendukung bobot yang telah diberikan liputan kepadanya.
Run milik Artificial Analysis sendiri menempatkan Kimi K3 pada 85,02 di Terminal-Bench 2.1, di samping 12,6 pada Terminal-Bench v4.0 — tes yang berbeda dan lebih sulit — AA Coding Index 76,2 (peringkat 9 dari model-model di papan peringkat), Intelligence Index 43,6, GPQA Diamond 93,5, HLE 46,9, SciCode 59,5, tau-banking 45,98, dan Long-Context Recall 88,7. Angka-angka itu dibaca dari kartu katalog K3 di sistem kami sendiri, bersumber dari artificialanalysis.ai, dengan snapshot evaluasi bertanggal 15 Juli 2026. Beam hanya punya satu angka di semesta daftar itu dan angka itu berasal dari Reflection. Ketidakhadiran itu seharusnya bersifat sementara, bukan permanen: Artificial Analysis telah mengatakan bahwa Reflection memberinya akses dan bahwa pihaknya sedang melakukan benchmark pada model tersebut, dan formulasi awalnya sendiri — bahwa Beam "akan menjadi salah satu model terbuka paling hemat token yang pernah kami lihat untuk tingkat kecerdasannya" — adalah lembaga benchmark yang mengisyaratkan ekspektasi, bukan melaporkan hasil. Sampai skor itu terbit, angka-angka dalam artikel ini tidak dapat dikurangkan, dan kami tidak akan berpura-pura sebaliknya.

Berapa biaya masing-masing, dan apa masing-masing itu
Perbandingan biayanya tidak seimbang, dan sebenarnya bukanlah sebuah perbandingan sama sekali, karena salah satu sisinya kosong.
• Harga — Kimi K3 $3,00 input / $15,00 output per juta token, dengan pembacaan cache sebesar $0,30, vs Reflection Beam: tidak ada harga yang dipublikasikan di mana pun di blog, dokumentasi, atau daftar model Reflection, dengan konsol platform berada di balik gerbang pendaftaran.
• Konteks — 1.048.576 token pada Kimi K3 vs 256.000 pada beta Beam, dengan catatan kaki di dokumentasi Beam sendiri yang berbunyi "jendela konteks dapat berubah selama masa beta."
• Modalitas — Kimi K3 menerima teks dan gambar; Reflection Beam bersifat teks-masuk, teks-keluar tanpa jalur gambar atau audio saat peluncuran.
• Ketersediaan — Kimi K3 tersedia secara umum hari ini; Reflection Beam adalah beta dengan daftar tunggu dengan bobot yang dijanjikan untuk nanti pada bulan Oktober di bawah Apache 2.0.
• Skor independen — K3 memiliki baris Artificial Analysis yang lengkap; Beam tidak punya sama sekali.
• Profil penyajian — Kimi K3 adalah model frontier besar yang cenderung dense dengan 46,8 token output per detik pada pengukuran playground kami sendiri selama seminggu terakhir; 23B parameter aktif milik Beam adalah argumen arsitektural yang sesungguhnya untuk latensi lebih rendah dan biaya per token lebih rendah, tetapi tidak ada endpoint yang terbuka untuk publik untuk mengukurnya.
Klaim efisiensi itu layak mendapat satu kalimat kehati-hatian lagi, karena itulah judul utama peluncuran ini dan ia melakukan lebih banyak pekerjaan daripada yang dapat ditanggungnya. "3 hingga 4× lebih sedikit komputasi inferensi" dari Reflection berasal dari grafik yang memperkirakan FLOPs sebagai dua kali jumlah parameter aktif dikalikan dengan rata-rata jumlah token yang dihasilkan. Rumus itu sengaja mengecualikan prefill prompt, biaya atensi, dan overhead penyajian — bagian-bagian tagihan yang mendominasi pekerjaan agentik konteks panjang. Ini adalah perkiraan kasar atas komputasi rasio, bukan pengukuran, bukan angka dolar, dan dibuat oleh vendor. Anggap saja ini sebagai hipotesis yang memungkinkan orang lain mengujinya lewat bobot.
Di mana posisi OrcaRouter dalam hal ini
Kimi K3 adalah salah satu rute kami. Harganya tercantum $3.00 untuk input dan $15.00 untuk output per juta token dengan cache read sebesar $0.30, yang merupakan tarif penyedia Moonshot yang diteruskan tanpa tambahan apa pun — jadi jika Moonshot mengubah kartu tarifnya, angka di halaman kami berubah pada hari yang sama, bukan menunggu kapan pun reseller memperbaruinya. Model ini dapat dipanggil dari satu kunci yang kompatibel dengan OpenAI bersama 200+ model lainnya, yang di sini penting karena alasan spesifik: jawaban jujur untuk "Beam atau K3?" adalah bahwa tim yang melakukan hedging sebaiknya tidak memilih. Karena failover otomatis adalah bagian dari routing, bukan sesuatu yang harus Anda bangun, model seperti Beam — beta, tanpa harga, tidak dinilai oleh pihak ketiga mana pun — adalah hal yang tepat untuk Anda tempatkan pada sebagian trafik, bukan pada jalur kritis Anda. Anda merutekan pekerjaan ke K3 secara default, mengirimkan sebagian ke Beam saat undangan waitlist Anda tiba, dan membiarkan routing fallback ke K3 saat terjadi error. Itu adalah keputusan yang bisa Anda buat tentang model yang belum terbukti. Bertaruh pada jalur produksi pada satu model bukanlah demikian.

Apa yang akan mengubah putusan ini
Tiga hal, dalam urutan menurun berdasarkan seberapa pentingnya.
Harga. Jika Beam mendarat di bawah tier K3, argumen efisiensi akan menjadi konkret, bukan teoretis. Kedua, bobotnya. Apache 2.0 plus laporan teknis akan memungkinkan siapa pun yang memiliki beberapa node mengukur token per detik per GPU pada patokan kualitas tetap — uji yang benar-benar menyelesaikan klaim komputasi. Ketiga, uji harness pihak ketiga. Reflection telah memberi Artificial Analysis akses, dan skor diharapkan keluar darinya; sampai angka itu terbit, setiap angka Beam-versus-K3 yang beredar dapat dilacak kembali ke dokumen yang ditulis oleh salah satu dari dua vendor.
Dua pertanyaan yang layak dijawab secara langsung
Apakah Reflection Beam lebih baik daripada Kimi K3?
Berdasarkan bukti yang tersedia saat ini, tidak — dan belum ada yang menerbitkan bukti bahwa memang demikian. Tabel Reflection sendiri menempatkan K3 unggul pada kesepuluh baris bersama di atas, beberapa di antaranya dengan selisih (SWE Atlas 34,6 vs 68,0, DeepSearchQA 80,1 vs 95,0) yang tidak dekat. Argumen Beam adalah biaya per unit kapabilitas, dan argumen itu hanyalah grafik buatan vendor sampai bobot dan harga tersedia.
Haruskah saya menunggu bobot Beam sebelum membangun di atas K3?
Hanya jika self-hosting merupakan keharusan, bukan preferensi, karena itulah satu-satunya dimensi di mana keduanya tidak saling menggantikan — K3 hanya tersedia melalui API, sedangkan Beam menjanjikan bobot dengan lisensi Apache 2.0. Jika Anda memanggil API, K3 sudah tersedia, sudah dinilai, dan sudah ada harganya, sedangkan Beam masih daftar tunggu. Tidak ada versi keputusan itu yang layak membuat proyek ditunda.

Reflection telah memberi kita tanggal dan bagan, dan tanggal bukanlah model. Satu hal yang benar-benar dibuktikan oleh peluncuran ini adalah bahwa model 501B yang mengaktifkan 23B parameter dapat dilatih untuk berada dalam beberapa poin dari frontier terbuka — yang, jika bobotnya tiba dan angkanya bertahan, merupakan hasil yang berarti tentang efisiensi. Ini belum menjadi alasan untuk memindahkan pekerjaan dari model yang benar-benar telah diukur oleh pihak ketiga.
