Kartu hero yang dihasilkan berjudul 'Reflection Beam: 501B parameter, 23B aktif', dengan subbaris 'Sparse MoE / 23,8T token pra-pelatihan / konteks API 256K token / bobot dijanjikan bulan ini / setiap angka dilaporkan vendor'. Tiga ikon garis datar berada di bawah teks: diagram lapisan bertumpuk dengan sebagian besar lapisan diredupkan dan satu disorot, rak berisi sembilan unit server, dan kerangka dokumen dengan gembok kecil. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Reflection Beam, Dijelaskan: 501B Parameter, 23B Aktif, dan Bobot yang Belum Dirilis

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 5 Oktober 2026, Reflection mengumumkan Reflection Beam, sebuah model bahasa sparse mixture-of-experts dengan total 501 miliar parameter yang mengaktifkan 23 miliar di antaranya per token, dan pada hari yang sama menyediakan endpoint beta yang kompatibel dengan OpenAI di depannya. Itu berarti 4,6 persen dari model aktif pada saat tertentu — rasio yang agresif bahkan menurut standar bidang open-weight saat ini — dan angka itulah yang menjadi tumpuan seluruh peluncuran. Reflection mengatakan bobot lengkap, laporan teknis, dan kartu model akan datang akhir bulan ini di bawah Apache 2.0. Per hari ini semua itu belum ada, tidak ada harga yang dipublikasikan di mana pun pada properti milik Reflection sendiri, dan Artificial Analysis tidak memiliki baris untuk model tersebut. Jadi ringkasan jujur dari peluncuran ini adalah ini: klaim yang sangat spesifik tentang efisiensi, yang dibuat oleh lab yang melatih model tersebut, dengan setiap angka pendukung disediakan oleh lab itu.

Tabel perbandingan Reflection sendiri menempatkan Reflection Beam dibandingkan dengan Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max dan DeepSeek V4.1 Flash, yang merupakan gambaran yang adil tentang tingkat yang dituju: model terbuka dan semi-terbuka yang kuat tetapi bukan terdepan, beberapa di antaranya hanya sebagian kecil dari ukuran Beam. Beam tidak mengalahkan bidang itu dalam hal kemampuan mentah, dan kami akan menunjukkan kepada Anda dengan tepat di mana ia kalah. Yang diklaimnya adalah mencapai posisi mendekati puncaknya sambil menghabiskan komputasi inferensi sekitar tiga hingga empat kali lebih sedikit daripada GLM 5.2 pada skor penalaran yang sebanding. Klaim itulah isi artikel ini.

Apa yang benar-benar ada saat ini

Semua yang ada di bagian ini berasal dari dokumentasi Reflection sendiri, yang dibaca pada 6 Oktober 2026. API-nya sudah aktif dalam versi beta di balik daftar tunggu; bobotnya belum dirilis.

• ID Model — Beam-501B-A23B, dibuat 5 Oktober 2026.

• Antarmuka — permukaan yang kompatibel dengan OpenAI di api.reflection.ai/openai/v1, yang mengekspos Chat Completions dan daftar Models, dan tidak ada yang lain. Tidak ada Completions, tidak ada embeddings, tidak ada batches.

• Konteks — 256,000 token, dengan catatan kaki yang dilampirkan pada angka itu sendiri: "Jendela konteks dapat berubah selama masa beta." Output maksimum adalah 128,000 token.

• Penalaran — parameter reasoning_effort dengan lima nilai: low, medium, high, xhigh, dan max. Default-nya adalah medium, dan model selalu melakukan penalaran terlepas dari pengaturannya — tidak ada tombol nonaktif.

• Modalitas — teks masuk, teks keluar. Tidak ada input gambar atau audio saat peluncuran, yang merupakan perbedaan nyata dari Inkling, model yang mengutamakan multimodalitas yang diluncurkan oleh Thinking Machines milik Mira Murati pada Juli.

• Batas pengetahuan — 30 Juni 2026.

• Harga — tidak dipublikasikan. Postingan blog Reflection, dokumentasinya, dan daftar modelnya semuanya tidak mencantumkannya, dan konsol platform berada di balik dinding pendaftaran.

Baris terakhir itu lebih penting daripada yang terlihat. Setiap model lain dalam kumpulan perbandingan Beam memiliki harga daftar publik yang dapat Anda masukkan ke dalam spreadsheet hari ini. Beam tidak memilikinya, yang berarti argumen biaya apa pun tentangnya saat ini adalah argumen tentang komputasi, bukan tentang dolar.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

Rasio 501 banding 23 adalah argumennya.

Sparsitas bukanlah hal baru; pertanyaannya adalah seberapa jauh sebuah lab bersedia mendorongnya. GLM 5.2 menjalankan sekitar 40 miliar parameter aktif dari total yang dilaporkan di kisaran 744 miliar — sekitar 5,4 persen. Reflection Beam berada di 4,6 persen dari 501 miliar. Di atas kertas, itu adalah langkah lebih lanjut yang moderat, dan Reflection berhati-hati tentang apa yang diklaimnya untuk itu.

Angka efisiensi dalam pos peluncuran berasal dari bagan yang dibuat berdasarkan data Artificial Analysis dan DataCurve, yang memplot skor penalaran terhadap perkiraan FLOPs inferensi, dengan FLOPs diperkirakan sebagai dua kali jumlah parameter aktif dikalikan rata-rata jumlah token yang dihasilkan. Formula itu sengaja mengecualikan prefill prompt, biaya atensi, dan overhead penyajian. Ini adalah model perkiraan kasar, bukan pengukuran, dan Reflection tidak menyajikannya sebagai pengukuran — tetapi ini juga satu-satunya dukungan kuantitatif untuk klaim "3 hingga 4× lebih murah pada skor yang sama", dan itu ditulis oleh vendor. Anggap saja ini sebagai hipotesis yang, ketika bobotnya dirilis, akan memungkinkan pihak lain mengujinya.

Yang diperoleh dari arsitektur ini dalam praktik adalah profil penyajian. Model dengan dua puluh tiga miliar parameter aktif adalah model yang dapat Anda jalankan pada jumlah GPU yang relatif sedikit dengan latensi interaktif, dan itu adalah produk yang berbeda dari model padat 501 miliar parameter meskipun jumlah parameter di kartu sama. Itulah alasan Reflection dapat membicarakan penalaran yang mendekati frontier tanpa membicarakan penerapan berskala pusat data.

Kurang dari empat minggu untuk pra-pelatihan, dan pengungkapannya luar biasa spesifik

Uraian tentang pelatihan adalah bagian dari rilis yang terasa benar-benar informatif, karena Reflection mempublikasikan angka-angka yang biasanya hanya disimpan sebagai internal oleh sebagian besar lab.

• Pra-pelatihan — 23,8 triliun token pada 6.144 chip GB300 dalam rak NVL72, selesai dalam waktu kurang dari empat minggu dengan goodput yang dilaporkan sebesar 92,3 persen, dengan sembilan rewind dari checkpoint selama proses berlangsung.

• Pembelajaran penguatan — 10.500 chip GB300 selama empat minggu, lebih dari 100 juta rollout, konteks rollout maksimum 256.000 token, sekitar 1,3 miliar sandbox dan sekitar satu juta lingkungan berbeda, dengan rata-rata 110.000 rollout berjalan secara bersamaan.

• Midtraining — memperluas konteks efektif model hingga 1 juta token.

• Stabilitas — gradien kebijakan asinkron yang tetap stabil dengan keusangan berskala hari, plus penalti panjang yang dapat dikontrol sehingga panjang penalaran dapat disesuaikan tanpa pelatihan ulang.

Bacalah baris pra-pelatihan dan RL secara bersamaan dan bentuk klaimnya mulai tampak. Kisah efisiensi bukan hanya soal parameter aktif saat inferensi; ini juga soal seberapa cepat model dilatih dan seberapa besar komputasi yang dialokasikan ke RL yang terikat lingkungan alih-alih ke lebih banyak token. Satu juta lingkungan dan 1,3 miliar sandbox adalah pernyataan tentang infrastruktur pelatihan penggunaan alat dan agentik, dan itu sejalan dengan tolok ukur yang dipilih Reflection untuk ditonjolkan lebih dulu.

Satu angka layak diberi tanda. Blog tersebut menyatakan bahwa midtraining memperluas konteks efektif menjadi 1 juta token; dokumentasi API mencantumkan batas penyajian 256.000 token dengan catatan kaki beta terlampir. Itu adalah kemampuan di sisi pelatihan dan batas di sisi penyajian, bukan kontradiksi — tetapi kesenjangan itu justru jenis hal yang bisa menjadi tajuk "konteks 1 juta" jika tidak ada yang membaca dokumen kedua, dan siapa pun yang menulis tentang Beam pekan depan harus membaca dokumen kedua.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

Benchmark: di mana Reflection Beam unggul, dan di mana tidak

Setiap angka di bawah ini dilaporkan oleh vendor, dari tabel di postingan peluncuran Reflection, dan tidak satu pun darinya telah direproduksi secara independen. Kolom perbandingan berisi angka yang sama yang diterbitkan Reflection untuk model lain; ketika sebuah sel menampilkan "NR" pada aslinya, model tersebut tidak dijalankan. Tidak ada baris Artificial Analysis untuk Beam, jadi tidak ada apa pun di sini yang telah melalui harness pihak ketiga.

Pengodean agentik

• Terminal-Bench v2.1 — Beam 80,1 vs GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.

• SWE-Bench Pro v1 — Beam 65,5 vs Qwen3.8 Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.

• SWE-Bench Pro v2-Hard — Kimi K3 88,2, GLM 5,3 84,3, Inkling 56,9.

• SWE-Bench Verified — Beam 80,9 vs Inkling 77,6, Nemotron 3 Ultra 70,7.

• SWE-Bench Multilingual — Beam 78,0 vs Nemotron 3 Ultra 67,7.

• DeepSWE v1.1 — Beam 44,4 vs DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen3.8 Max 51,0, GLM 5.2 44,0.

• SWE Atlas Codebase QnA — Beam 34.6 vs Kimi K3 68.0, GLM 5.3 61.0.

Baris terakhir itulah yang perlu direnungkan. Penjawaban pertanyaan repositori berhorizon panjang adalah situasi ketika sebuah model harus menyimpan basis kode di kepalanya selama interaksi yang panjang, dan 34,6 versus 68,0 bukanlah perbedaan pembulatan. DeepSWE menunjukkan cerita serupa: 44,4 menempatkan Beam sejajar dengan GLM 5.2 dan jauh di belakang DeepSeek V4.1 Flash.

Penalaran

• AIME 2026 — Beam 97.8 vs GLM 5.2 99.2, Inkling 97.1.

• HLE, tanpa alat — Beam 36.2 vs Kimi K3 46.9, Qwen3.8 Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7.

• GPQA Diamond — Beam 90.5 vs Kimi K3 93.5, Qwen3.8 Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9, Inkling 87.2, Nemotron 3 Ultra 87.

• SciCode — Beam 49,7 vs GLM 5.3 59,0, Kimi K3 58,7, Qwen3.8 Max 52,1, DeepSeek V4.1 Flash 52,0, Inkling 46,1, Nemotron 3 Ultra 44,6.

• CriPT AA — Beam 16.3 vs Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

Profil penalaran Beam berada di pertengahan, dan polanya konsisten: cukup jauh di depan dua model dari generasi sebelumnya dalam daftar Reflection, tetapi tertinggal dari model saat ini. GPQA Diamond pada 90,5 adalah skor solid yang dilampaui empat model lain.

• MCP Atlas — Beam 78,7 vs Qwen3.8 Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8, Inkling 76,0, Nemotron 3 Ultra 63,1.

• AutomationBench, split publik — Beam 37.0 vs DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2.

• tau3 banking — Beam 38,0 vs Qwen3.8 Max 55,2, GLM 5.2 37,1, Kimi K3 37,1, Inkling 25,0, Nemotron 3 Ultra 22,6.

• BrowseComp dengan manajemen konteks — Beam 77,4 vs Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.

• DeepSearchQA dengan manajemen konteks — Beam 80,1 vs Kimi K3 95,0.

Reflection juga menampilkan dua demo kemampuan dalam tulisan itu: tingkat penyelesaian 95,5 persen pada teka-teki "Land or Water", grid 180 kali 90 dengan 16.200 titik yang membutuhkan penyimpanan status papan besar — angka yang berada di antara 92,5 dan 97,8 persen yang Reflection kaitkan dengan Opus 5 dan Fable 5 pada tugas yang sama — dan fine-tune Text2SQL dari Gemma-4 terkecil yang meningkatkan akurasi held-out menjadi 66,5 persen. Demo dikurasi; demo menunjukkan model bisa melakukan sesuatu, bukan seberapa sering.

Apa yang bisa Anda lakukan dengannya hari ini, dan apa yang sebaiknya tidak Anda jadikan dasar perencanaan

Hari ini, secara umum tepat satu hal yang mungkin dilakukan: meminta akses beta dan memanggil Beam-501B-A23B melalui endpoint milik Reflection sendiri dengan klien berbentuk OpenAI. Tidak ada harga yang dipublikasikan, jadi tidak ada cara untuk memodelkan biaya beban kerja di atasnya. Tidak ada bobot, jadi tidak ada self-hosting, tidak ada kuantisasi, tidak ada fine-tune, dan tidak ada reproduktibilitas pihak ketiga. Tidak ada baris benchmark independen, jadi seluruh gambaran performa di atas bergantung pada tabel satu lab.

Reflection Beam bukan salah satu rute kami. Kami tidak akan menyiratkan sebaliknya, dan kami tidak akan mengarahkan Anda ke reseller yang mungkin memilikinya. Yang bisa kami sampaikan adalah berapa biaya kumpulan pembandingnya, karena kami merutekan empat dari model tersebut dan angka di bawah ini dibaca langsung dari katalog kami sendiri pagi ini: GLM 5.2 sebesar $1,40 masuk dan $4,40 keluar per juta token, GLM 5.3 sebesar $1,26 dan $3,96, Qwen3.8 Max sebesar $2,00 dan $6,00, serta DeepSeek V4.1 Flash sebesar $0,15 dan $0,60. Itu rentang yang nyata — DeepSeek V4.1 Flash hampir sepuluh kali lebih murah pada input dibandingkan GLM 5.2 — dan itulah sebabnya model beta tanpa harga sulit dimasukkan ke dalam pengambilan keputusan. OrcaRouter menjalankan satu kunci yang kompatibel dengan OpenAI untuk model-model tersebut dan 200-plus model lainnya dengan harga daftar dari penyedia diteruskan apa adanya dan tanpa tambahan apa pun, yang berarti perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama, bukan menunggu kapan pun reseller memperbaruinya. Dan karena failover otomatis merupakan bagian dari perutean, bukan sesuatu yang harus Anda bangun sendiri, model baru yang belum terbukti adalah jenis hal yang bisa Anda tempatkan pada sebagian trafik, bukan pada jalur kritis Anda — yang merupakan satu-satunya cara bertanggung jawab untuk menggunakan sesuatu yang tolok ukurnya belum direproduksi oleh siapa pun.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

Apa yang perlu dicermati sebelum Anda menganggap serius klaim efisiensi itu

Tiga hal akan menjawab pertanyaan itu, dan dua di antaranya dijanjikan dalam bulan ini.

Yang pertama adalah bobotnya. Apache 2.0 dan laporan teknis akan memungkinkan siapa pun yang memiliki beberapa node untuk mengukur hal yang benar-benar penting — token per detik per GPU pada standar kualitas yang tetap, dan apakah 23 miliar parameter aktif benar-benar memberikan skor per FLOP seperti yang tersirat dalam grafik. Sampai saat itu, argumen efisiensi hanyalah aritmetika di atas serbet.

Yang kedua adalah harga. Model tanpa harga daftar tidak punya tempat dalam perbandingan biaya, dan jika Beam berada di atas tier GLM dan DeepSeek, narasi komputasi tidak lagi penting bagi siapa pun yang punya anggaran. Jika berada di bawah, gambarannya berubah dengan cepat.

Yang ketiga adalah pihak ketiga yang menjalankan rangkaian pengujian tersebut. Setiap angka di atas berasal dari dokumen yang sama, dan tabel yang dilaporkan vendor yang menempatkan modelnya sendiri di posisi belakang pada tujuh dari enam belas baris adalah tanda baik tentang kejujuran laboratorium itu — tetapi itu tetap satu laboratorium, satu harness, satu set prompt.

Jika hari ini Anda membutuhkan pengode agentik yang cakap dan perlu tahu berapa biayanya, jawabannya belum Reflection Beam. Mungkin tiga minggu lagi. Model yang klaim efisiensinya layak dipertaruhkan adalah model yang bobotnya dapat Anda unduh dan FLOPs-nya dapat Anda hitung sendiri — dan pada uji itu, Reflection memberi kami tanggal, bukan model.

Dibandingkan dalam artikel ini4

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari