
Reflection Beam, Dijelaskan: 501B Parameter, 23B Aktif, dan Bobot yang Belum Dirilis
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 145 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 128 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 183 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Pada 5 Oktober 2026, Reflection mengumumkan Reflection Beam, sebuah model bahasa sparse mixture-of-experts dengan total 501 miliar parameter yang mengaktifkan 23 miliar di antaranya per token, dan pada hari yang sama menyediakan endpoint beta yang kompatibel dengan OpenAI di depannya. Itu berarti 4,6 persen dari model aktif pada saat tertentu — rasio yang agresif bahkan menurut standar bidang open-weight saat ini — dan angka itulah yang menjadi tumpuan seluruh peluncuran. Reflection mengatakan bobot lengkap, laporan teknis, dan kartu model akan datang akhir bulan ini di bawah Apache 2.0. Per hari ini semua itu belum ada, tidak ada harga yang dipublikasikan di mana pun pada properti milik Reflection sendiri, dan Artificial Analysis tidak memiliki baris untuk model tersebut. Jadi ringkasan jujur dari peluncuran ini adalah ini: klaim yang sangat spesifik tentang efisiensi, yang dibuat oleh lab yang melatih model tersebut, dengan setiap angka pendukung disediakan oleh lab itu.
Tabel perbandingan Reflection sendiri menempatkan Reflection Beam dibandingkan dengan Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max dan DeepSeek V4.1 Flash, yang merupakan gambaran yang adil tentang tingkat yang dituju: model terbuka dan semi-terbuka yang kuat tetapi bukan terdepan, beberapa di antaranya hanya sebagian kecil dari ukuran Beam. Beam tidak mengalahkan bidang itu dalam hal kemampuan mentah, dan kami akan menunjukkan kepada Anda dengan tepat di mana ia kalah. Yang diklaimnya adalah mencapai posisi mendekati puncaknya sambil menghabiskan komputasi inferensi sekitar tiga hingga empat kali lebih sedikit daripada GLM 5.2 pada skor penalaran yang sebanding. Klaim itulah isi artikel ini.
Apa yang benar-benar ada saat ini
Semua yang ada di bagian ini berasal dari dokumentasi Reflection sendiri, yang dibaca pada 6 Oktober 2026. API-nya sudah aktif dalam versi beta di balik daftar tunggu; bobotnya belum dirilis.
• ID Model — Beam-501B-A23B, dibuat 5 Oktober 2026.
• Antarmuka — permukaan yang kompatibel dengan OpenAI di api.reflection.ai/openai/v1, yang mengekspos Chat Completions dan daftar Models, dan tidak ada yang lain. Tidak ada Completions, tidak ada embeddings, tidak ada batches.
• Konteks — 256,000 token, dengan catatan kaki yang dilampirkan pada angka itu sendiri: "Jendela konteks dapat berubah selama masa beta." Output maksimum adalah 128,000 token.
• Penalaran — parameter reasoning_effort dengan lima nilai: low, medium, high, xhigh, dan max. Default-nya adalah medium, dan model selalu melakukan penalaran terlepas dari pengaturannya — tidak ada tombol nonaktif.
• Modalitas — teks masuk, teks keluar. Tidak ada input gambar atau audio saat peluncuran, yang merupakan perbedaan nyata dari Inkling, model yang mengutamakan multimodalitas yang diluncurkan oleh Thinking Machines milik Mira Murati pada Juli.
• Batas pengetahuan — 30 Juni 2026.
• Harga — tidak dipublikasikan. Postingan blog Reflection, dokumentasinya, dan daftar modelnya semuanya tidak mencantumkannya, dan konsol platform berada di balik dinding pendaftaran.
Baris terakhir itu lebih penting daripada yang terlihat. Setiap model lain dalam kumpulan perbandingan Beam memiliki harga daftar publik yang dapat Anda masukkan ke dalam spreadsheet hari ini. Beam tidak memilikinya, yang berarti argumen biaya apa pun tentangnya saat ini adalah argumen tentang komputasi, bukan tentang dolar.

Rasio 501 banding 23 adalah argumennya.
Sparsitas bukanlah hal baru; pertanyaannya adalah seberapa jauh sebuah lab bersedia mendorongnya. GLM 5.2 menjalankan sekitar 40 miliar parameter aktif dari total yang dilaporkan di kisaran 744 miliar — sekitar 5,4 persen. Reflection Beam berada di 4,6 persen dari 501 miliar. Di atas kertas, itu adalah langkah lebih lanjut yang moderat, dan Reflection berhati-hati tentang apa yang diklaimnya untuk itu.
Angka efisiensi dalam pos peluncuran berasal dari bagan yang dibuat berdasarkan data Artificial Analysis dan DataCurve, yang memplot skor penalaran terhadap perkiraan FLOPs inferensi, dengan FLOPs diperkirakan sebagai dua kali jumlah parameter aktif dikalikan rata-rata jumlah token yang dihasilkan. Formula itu sengaja mengecualikan prefill prompt, biaya atensi, dan overhead penyajian. Ini adalah model perkiraan kasar, bukan pengukuran, dan Reflection tidak menyajikannya sebagai pengukuran — tetapi ini juga satu-satunya dukungan kuantitatif untuk klaim "3 hingga 4× lebih murah pada skor yang sama", dan itu ditulis oleh vendor. Anggap saja ini sebagai hipotesis yang, ketika bobotnya dirilis, akan memungkinkan pihak lain mengujinya.
Yang diperoleh dari arsitektur ini dalam praktik adalah profil penyajian. Model dengan dua puluh tiga miliar parameter aktif adalah model yang dapat Anda jalankan pada jumlah GPU yang relatif sedikit dengan latensi interaktif, dan itu adalah produk yang berbeda dari model padat 501 miliar parameter meskipun jumlah parameter di kartu sama. Itulah alasan Reflection dapat membicarakan penalaran yang mendekati frontier tanpa membicarakan penerapan berskala pusat data.
Kurang dari empat minggu untuk pra-pelatihan, dan pengungkapannya luar biasa spesifik
Uraian tentang pelatihan adalah bagian dari rilis yang terasa benar-benar informatif, karena Reflection mempublikasikan angka-angka yang biasanya hanya disimpan sebagai internal oleh sebagian besar lab.
• Pra-pelatihan — 23,8 triliun token pada 6.144 chip GB300 dalam rak NVL72, selesai dalam waktu kurang dari empat minggu dengan goodput yang dilaporkan sebesar 92,3 persen, dengan sembilan rewind dari checkpoint selama proses berlangsung.
• Pembelajaran penguatan — 10.500 chip GB300 selama empat minggu, lebih dari 100 juta rollout, konteks rollout maksimum 256.000 token, sekitar 1,3 miliar sandbox dan sekitar satu juta lingkungan berbeda, dengan rata-rata 110.000 rollout berjalan secara bersamaan.
• Midtraining — memperluas konteks efektif model hingga 1 juta token.
• Stabilitas — gradien kebijakan asinkron yang tetap stabil dengan keusangan berskala hari, plus penalti panjang yang dapat dikontrol sehingga panjang penalaran dapat disesuaikan tanpa pelatihan ulang.
Bacalah baris pra-pelatihan dan RL secara bersamaan dan bentuk klaimnya mulai tampak. Kisah efisiensi bukan hanya soal parameter aktif saat inferensi; ini juga soal seberapa cepat model dilatih dan seberapa besar komputasi yang dialokasikan ke RL yang terikat lingkungan alih-alih ke lebih banyak token. Satu juta lingkungan dan 1,3 miliar sandbox adalah pernyataan tentang infrastruktur pelatihan penggunaan alat dan agentik, dan itu sejalan dengan tolok ukur yang dipilih Reflection untuk ditonjolkan lebih dulu.
Satu angka layak diberi tanda. Blog tersebut menyatakan bahwa midtraining memperluas konteks efektif menjadi 1 juta token; dokumentasi API mencantumkan batas penyajian 256.000 token dengan catatan kaki beta terlampir. Itu adalah kemampuan di sisi pelatihan dan batas di sisi penyajian, bukan kontradiksi — tetapi kesenjangan itu justru jenis hal yang bisa menjadi tajuk "konteks 1 juta" jika tidak ada yang membaca dokumen kedua, dan siapa pun yang menulis tentang Beam pekan depan harus membaca dokumen kedua.

Benchmark: di mana Reflection Beam unggul, dan di mana tidak
Setiap angka di bawah ini dilaporkan oleh vendor, dari tabel di postingan peluncuran Reflection, dan tidak satu pun darinya telah direproduksi secara independen. Kolom perbandingan berisi angka yang sama yang diterbitkan Reflection untuk model lain; ketika sebuah sel menampilkan "NR" pada aslinya, model tersebut tidak dijalankan. Tidak ada baris Artificial Analysis untuk Beam, jadi tidak ada apa pun di sini yang telah melalui harness pihak ketiga.
Pengodean agentik
• Terminal-Bench v2.1 — Beam 80,1 vs GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.
• SWE-Bench Pro v1 — Beam 65,5 vs Qwen3.8 Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Kimi K3 88,2, GLM 5,3 84,3, Inkling 56,9.
• SWE-Bench Verified — Beam 80,9 vs Inkling 77,6, Nemotron 3 Ultra 70,7.
• SWE-Bench Multilingual — Beam 78,0 vs Nemotron 3 Ultra 67,7.
• DeepSWE v1.1 — Beam 44,4 vs DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen3.8 Max 51,0, GLM 5.2 44,0.
• SWE Atlas Codebase QnA — Beam 34.6 vs Kimi K3 68.0, GLM 5.3 61.0.
Baris terakhir itulah yang perlu direnungkan. Penjawaban pertanyaan repositori berhorizon panjang adalah situasi ketika sebuah model harus menyimpan basis kode di kepalanya selama interaksi yang panjang, dan 34,6 versus 68,0 bukanlah perbedaan pembulatan. DeepSWE menunjukkan cerita serupa: 44,4 menempatkan Beam sejajar dengan GLM 5.2 dan jauh di belakang DeepSeek V4.1 Flash.
Penalaran
• AIME 2026 — Beam 97.8 vs GLM 5.2 99.2, Inkling 97.1.
• HLE, tanpa alat — Beam 36.2 vs Kimi K3 46.9, Qwen3.8 Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7.
• GPQA Diamond — Beam 90.5 vs Kimi K3 93.5, Qwen3.8 Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9, Inkling 87.2, Nemotron 3 Ultra 87.
• SciCode — Beam 49,7 vs GLM 5.3 59,0, Kimi K3 58,7, Qwen3.8 Max 52,1, DeepSeek V4.1 Flash 52,0, Inkling 46,1, Nemotron 3 Ultra 44,6.
• CriPT AA — Beam 16.3 vs Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
Profil penalaran Beam berada di pertengahan, dan polanya konsisten: cukup jauh di depan dua model dari generasi sebelumnya dalam daftar Reflection, tetapi tertinggal dari model saat ini. GPQA Diamond pada 90,5 adalah skor solid yang dilampaui empat model lain.
Penggunaan alat dan pencarian
• MCP Atlas — Beam 78,7 vs Qwen3.8 Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8, Inkling 76,0, Nemotron 3 Ultra 63,1.
• AutomationBench, split publik — Beam 37.0 vs DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2.
• tau3 banking — Beam 38,0 vs Qwen3.8 Max 55,2, GLM 5.2 37,1, Kimi K3 37,1, Inkling 25,0, Nemotron 3 Ultra 22,6.
• BrowseComp dengan manajemen konteks — Beam 77,4 vs Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.
• DeepSearchQA dengan manajemen konteks — Beam 80,1 vs Kimi K3 95,0.
Reflection juga menampilkan dua demo kemampuan dalam tulisan itu: tingkat penyelesaian 95,5 persen pada teka-teki "Land or Water", grid 180 kali 90 dengan 16.200 titik yang membutuhkan penyimpanan status papan besar — angka yang berada di antara 92,5 dan 97,8 persen yang Reflection kaitkan dengan Opus 5 dan Fable 5 pada tugas yang sama — dan fine-tune Text2SQL dari Gemma-4 terkecil yang meningkatkan akurasi held-out menjadi 66,5 persen. Demo dikurasi; demo menunjukkan model bisa melakukan sesuatu, bukan seberapa sering.
Apa yang bisa Anda lakukan dengannya hari ini, dan apa yang sebaiknya tidak Anda jadikan dasar perencanaan
Hari ini, secara umum tepat satu hal yang mungkin dilakukan: meminta akses beta dan memanggil Beam-501B-A23B melalui endpoint milik Reflection sendiri dengan klien berbentuk OpenAI. Tidak ada harga yang dipublikasikan, jadi tidak ada cara untuk memodelkan biaya beban kerja di atasnya. Tidak ada bobot, jadi tidak ada self-hosting, tidak ada kuantisasi, tidak ada fine-tune, dan tidak ada reproduktibilitas pihak ketiga. Tidak ada baris benchmark independen, jadi seluruh gambaran performa di atas bergantung pada tabel satu lab.
Reflection Beam bukan salah satu rute kami. Kami tidak akan menyiratkan sebaliknya, dan kami tidak akan mengarahkan Anda ke reseller yang mungkin memilikinya. Yang bisa kami sampaikan adalah berapa biaya kumpulan pembandingnya, karena kami merutekan empat dari model tersebut dan angka di bawah ini dibaca langsung dari katalog kami sendiri pagi ini: GLM 5.2 sebesar $1,40 masuk dan $4,40 keluar per juta token, GLM 5.3 sebesar $1,26 dan $3,96, Qwen3.8 Max sebesar $2,00 dan $6,00, serta DeepSeek V4.1 Flash sebesar $0,15 dan $0,60. Itu rentang yang nyata — DeepSeek V4.1 Flash hampir sepuluh kali lebih murah pada input dibandingkan GLM 5.2 — dan itulah sebabnya model beta tanpa harga sulit dimasukkan ke dalam pengambilan keputusan. OrcaRouter menjalankan satu kunci yang kompatibel dengan OpenAI untuk model-model tersebut dan 200-plus model lainnya dengan harga daftar dari penyedia diteruskan apa adanya dan tanpa tambahan apa pun, yang berarti perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama, bukan menunggu kapan pun reseller memperbaruinya. Dan karena failover otomatis merupakan bagian dari perutean, bukan sesuatu yang harus Anda bangun sendiri, model baru yang belum terbukti adalah jenis hal yang bisa Anda tempatkan pada sebagian trafik, bukan pada jalur kritis Anda — yang merupakan satu-satunya cara bertanggung jawab untuk menggunakan sesuatu yang tolok ukurnya belum direproduksi oleh siapa pun.

Apa yang perlu dicermati sebelum Anda menganggap serius klaim efisiensi itu
Tiga hal akan menjawab pertanyaan itu, dan dua di antaranya dijanjikan dalam bulan ini.
Yang pertama adalah bobotnya. Apache 2.0 dan laporan teknis akan memungkinkan siapa pun yang memiliki beberapa node untuk mengukur hal yang benar-benar penting — token per detik per GPU pada standar kualitas yang tetap, dan apakah 23 miliar parameter aktif benar-benar memberikan skor per FLOP seperti yang tersirat dalam grafik. Sampai saat itu, argumen efisiensi hanyalah aritmetika di atas serbet.
Yang kedua adalah harga. Model tanpa harga daftar tidak punya tempat dalam perbandingan biaya, dan jika Beam berada di atas tier GLM dan DeepSeek, narasi komputasi tidak lagi penting bagi siapa pun yang punya anggaran. Jika berada di bawah, gambarannya berubah dengan cepat.
Yang ketiga adalah pihak ketiga yang menjalankan rangkaian pengujian tersebut. Setiap angka di atas berasal dari dokumen yang sama, dan tabel yang dilaporkan vendor yang menempatkan modelnya sendiri di posisi belakang pada tujuh dari enam belas baris adalah tanda baik tentang kejujuran laboratorium itu — tetapi itu tetap satu laboratorium, satu harness, satu set prompt.
Jika hari ini Anda membutuhkan pengode agentik yang cakap dan perlu tahu berapa biayanya, jawabannya belum Reflection Beam. Mungkin tiga minggu lagi. Model yang klaim efisiensinya layak dipertaruhkan adalah model yang bobotnya dapat Anda unduh dan FLOPs-nya dapat Anda hitung sendiri — dan pada uji itu, Reflection memberi kami tanggal, bukan model.
Dibandingkan dalam artikel ini4
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
