
Reflection Beam Meluncurkan API dalam Beta, dan Bobotnya Masih Dua Minggu Lagi
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 150 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Model pertama Reflection disebut Reflection Beam, dan yang menarik tentangnya pagi ini bukanlah bahwa model itu ada — melainkan bahwa baru separuhnya yang ada. Perusahaan mengumumkan Beam pada 5 Oktober 2026 sebagai model sparse mixture-of-experts dengan total 501 miliar parameter dan 23 miliar parameter aktif per token, dan pada hari yang sama menyediakan endpoint beta yang kompatibel dengan OpenAI di depannya. Bobotnya dijanjikan akan tersedia akhir bulan ini di bawah Apache 2.0, bersama laporan teknis, kartu model, dan stack penyajian. Sampai semuanya tersedia, satu-satunya orang yang dapat menjalankan Beam-501B-A23B adalah mereka yang diberi kunci daftar tunggu oleh Reflection, dan setiap angka kinerja yang beredar berasal dari tabel lab itu sendiri.
Itu tempat yang aneh untuk sebuah peluncuran berhenti, dan penting untuk bersikap tepat mengenai separuh mana yang kita miliki. Reflection telah merilis pratinjau yang dapat Anda ikuti dengan mendaftar dan serangkaian tabel benchmark yang belum ada yang mereproduksi. Reflection belum merilis hal yang dimaksud dengan "open-weight" dalam judul.
Apa yang sebenarnya sedang live pagi ini?
Semua yang ada di bagian ini berasal dari postingan blog dan dokumentasi Reflection sendiri, yang dibaca pada 6 Oktober 2026.
• ID Model — Beam-501B-A23B, dibuat pada 5 Oktober 2026, disajikan di api.reflection.ai/openai/v1 dengan Chat Completions dan daftar Models dan tidak ada yang lain.
• Bentuk — 501 miliar parameter total, 23 miliar aktif per token, menghasilkan rasio aktivasi sekitar 4,6 persen. Sebagai gambaran skala, GLM 5.2 berada di kisaran 5,4 persen.
• Konteks — 256.000 token di API, dengan catatan kaki yang dilampirkan pada angka itu sendiri yang memperingatkan bahwa jendelanya dapat berubah selama beta. Output maksimum adalah 128.000 token.
• Penalaran — parameter reasoning_effort dengan lima pengaturan: low, medium, high, xhigh, dan max. Medium adalah default, dan model selalu bernalar. Tidak ada tombol nonaktif dan tidak ada mode tanpa penalaran.
• Modalitas — teks masuk, teks keluar. Tidak ada input gambar, audio, atau video saat peluncuran.
• Harga — tidak dipublikasikan. Postingan blog tidak mencantumkannya, dokumentasi tidak mencantumkannya, dan konsol platform berada di balik dinding pendaftaran.
• Akses — daftar tunggu. Tidak ada jalur mandiri dan tidak ada bobot, jadi tidak ada unduhan, tidak ada kuantisasi, dan tidak ada penyetelan halus.
Baris harga adalah baris yang mengubah cara Anda membaca segala hal lainnya. Empat dari tujuh model yang dibandingkan dengan Beam dalam tabel milik Reflection sendiri memiliki harga daftar publik yang dapat Anda masukkan ke dalam spreadsheet hari ini. Beam tidak, jadi klaim biaya apa pun tentangnya saat ini adalah klaim tentang komputasi, bukan tentang dolar.

Angka yang menjadi penentu peluncuran
Pitch Reflection adalah efisiensi inferensi, dan mereka sangat spesifik tentang apa artinya itu: pada benchmark penalaran tingkat lanjut, Beam mencetak skor yang sebanding dengan GLM 5.2 sekaligus menggunakan komputasi inferensi 3 hingga 4× lebih sedikit. Keuntungannya digambarkan bahkan lebih besar lagi terhadap model-model dalam keluarga 2 triliun parameter, tempat Qwen 3.8-Max berada.
Grafik di balik klaim itu layak dibaca dengan cermat, karena itulah bukti penopang dalam seluruh tulisan ini. Grafik itu memplot skor penalaran terhadap estimasi FLOPs inferensi pada DeepSWE, Humanity's Last Exam, dan Terminal-Bench 2.1, serta memperkirakan FLOPs sebagai kira-kira dua kali jumlah parameter aktif dikalikan rata-rata jumlah token yang dihasilkan per percobaan. Formula itu sengaja mengecualikan prefill prompt, operasi attention yang bergantung pada konteks, dan overhead penyajian — Reflection menyatakannya di keterangan gambar. Ini adalah perbandingan yang konsisten antarmodel, bukan pengukuran tagihan siapa pun, dan ini juga satu-satunya dukungan kuantitatif untuk klaim efisiensi, yang ditulis oleh lab yang membangun model tersebut. Perlakukan itu sebagai hipotesis yang dapat diuji orang lain berkat bobotnya.
Yang sebenarnya diperoleh dari arsitektur ini dalam praktik adalah profil serving. Dua puluh tiga miliar parameter aktif adalah model yang secara masuk akal dapat Anda jalankan pada jumlah GPU yang relatif sedikit dengan latensi interaktif, yang merupakan produk berbeda dari model dense 501 miliar parameter meskipun angka pada kartu modelnya sama. Itulah sebabnya Reflection dapat berbicara tentang penalaran yang mendekati frontier tanpa membicarakan deployment berskala pusat data — dan mengapa perilisan bobot pada akhirnya adalah peristiwa yang lebih penting daripada kunci beta.
Di mana Beam berada di tabel milik Reflection sendiri
Semua angka di bawah ini dilaporkan oleh vendor, berasal dari tabel di pos peluncuran Reflection, dan tidak satu pun telah direproduksi secara independen. Jika Reflection tidak memublikasikan angka untuk suatu model, sel tersebut bertuliskan NR pada aslinya. Kolom perbandingan adalah milik Reflection, bukan milik kami dan bukan milik pihak ketiga.
Pekerjaan pengkodean dan terminal
• Terminal-Bench v2.1 — Reflection Beam 80.1 dibandingkan dengan GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen 3.8-Max 86.6 dan DeepSeek V4.1 Flash 90.6. Beam berada di bawah semuanya.
• SWE-Bench Verified — Reflection Beam 80.9 dibandingkan Inkling 77.6 dan Nemotron 3 Ultra 70.7. Di sinilah Beam terlihat paling kuat, tetapi perhatikan bahwa hanya dua model terlemah dalam daftar yang dijalankan pada benchmark ini.
• SWE-Bench Pro v1 — Reflection Beam 65,5 melawan Qwen 3.8-Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Reflection Beam 77.2 dibandingkan dengan Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9. Selisih sepuluh poin dari puncak tabel.
• DeepSWE v1.1 — Reflection Beam 44.4 melawan DeepSeek V4.1 Flash 74.2, Kimi K3 68.0, GLM 5.3 61.0, Qwen 3.8-Max 51.0, GLM 5.2 44.0. Beam berada selevel dengan generasi sebelumnya dan tertinggal tiga puluh poin dari pemimpin.
• SWE Atlas Codebase QnA — Reflection Beam 34.6 dibandingkan dengan Kimi K3 68.0 dan GLM 5.3 61.0. Menyimpan repositori besar dalam pikiran selama interaksi panjang adalah hal tersulit dalam daftar ini, dan 34.6 milik Beam bukanlah perbedaan karena pembulatan.
Penalaran dan sains
• AIME 2026 — Reflection Beam 97.8 melawan GLM 5.2 99.2 dan Inkling 97.1.
• HLE tanpa alat — Reflection Beam 36,2 dibandingkan dengan Kimi K3 46,9, Qwen 3.8-Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7. Berada di posisi menengah, dan hanya lebih unggul daripada dua model generasi sebelumnya.
• GPQA Diamond — Reflection Beam 90,5 vs. Kimi K3 93,5, Qwen 3.8-Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9.
• SciCode — Reflection Beam 49.7 dibandingkan dengan GLM 5.3 59.0, Kimi K3 58.7, Qwen 3.8-Max 52.1, DeepSeek V4.1 Flash 52.0.
• CriPT AA: Reflection Beam 16.3 dibandingkan dengan Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
Alat, pencarian, dan konteks panjang
• MCP Atlas — Reflection Beam 78,7 melawan Qwen 3.8-Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8.
• AutomationBench, split publik — Reflection Beam 37,0 melawan DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen 3.8-Max 39,8, GLM 5.2 26,2.
• tau3 banking — Reflection Beam 38.0 dibandingkan dengan Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1.
• BrowseComp dengan manajemen konteks — Reflection Beam 77,4 versus Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.
• DeepSearchQA dengan manajemen konteks — Reflection Beam 80.1 dibandingkan Kimi K3 95.0.
• AA-LCR — Reflection Beam 79.3 dibandingkan dengan Kimi K3 88.7, DeepSeek V4.1 Flash 84.0, Qwen 3.8-Max 80.3, GLM 5.3 79.7, Nemotron 3 Ultra 79.3, GLM 5.2 78.3, Inkling 77.3. Recall konteks panjang adalah satu-satunya baris kemampuan umum di mana Beam benar-benar kompetitif, bukan sekadar berada di papan tengah.
Bacalah keempat tabel itu bersama-sama dan sebuah pola yang konsisten pun muncul: Beam mengalahkan dua model generasi sebelumnya dalam daftar Reflection dan kalah dari model terkini, pada hampir setiap baris, dengan selisih yang berkisar dari kecil hingga yang membuatnya tersingkir. Vendor yang menerbitkan tabel yang menempatkan modelnya sendiri di posisi belakang pada begitu banyak baris adalah tanda yang baik tentang kejujuran lab tersebut. Itu bukan tanda bahwa model tersebut berada di garis terdepan.

Satu-satunya suara independen sejauh ini, dan apa yang tidak dikatakannya
Satu-satunya penilaian pihak ketiga yang tercatat adalah Artificial Analysis, yang mengatakan pada 5 Oktober bahwa Reflection telah memberinya akses dan bahwa ia secara independen melakukan benchmark terhadap Beam, serta menambahkan bahwa indikator awal menunjukkan Beam akan menjadi salah satu model terbuka paling efisien token yang pernah dilihatnya untuk tingkat kecerdasannya.
Itu adalah pernyataan yang berarti dari organisasi yang indeksnya adalah indeks yang benar-benar dibaca oleh sebagian besar pembeli, dan itu juga merupakan pernyataan tanpa angka di dalamnya. Per pagi ini, tidak ada baris Beam di papan peringkat Artificial Analysis — halaman model mengembalikan 404 dan payload papan peringkat tidak memuat entri Beam — jadi klaim efisiensi token, untuk saat ini, adalah janji dari pihak ketiga bahwa mereka akan menerbitkan sesuatu. Belum ada apa pun dalam indeks yang dihitung ulang dengan Beam.
Pengungkapan pelatihan, yang merupakan bagian terkuat dari rilis tersebut
Bagian rekayasa dalam postingan Reflection memuat angka-angka yang sebagian besar lab simpan secara internal, dan itu layak dicatat karena merupakan bagian dari rilis yang akan tetap menarik dalam sebulan.
• Pra-pelatihan — 23,8 triliun token terkurasi pada 6.144 chip NVIDIA GB300 dalam rak NVL72, diselesaikan dari awal hingga akhir dalam waktu kurang dari empat minggu, dengan goodput 92,3 persen yang dilaporkan, dan sembilan rewind semi-otomatis di sepanjang proses yang dikaitkan dengan lonjakan norma gradien atau dugaan korupsi data senyap.
• Pembelajaran penguatan — 10.500 chip GB300 selama empat minggu, lebih dari 100 juta rollout, konteks rollout maksimum 256.000 token, sekitar 1,3 miliar sandbox dan sekitar satu juta lingkungan berbeda yang disumberkan untuk tugas coding, agentic, dan STEM.
• Penyajian — bobot baru mencapai armada inferensi dalam median sekitar 12 detik, dengan distribusi hierarkis memangkas lalu lintas antar-rak sebesar 75 persen dan membuat adopsi di seluruh armada 2,2× lebih cepat daripada setiap replika menarik bobotnya sendiri.
• Stabilitas — gradien kebijakan yang sepenuhnya asinkron yang tetap stabil secara numerik saat belajar dari interaksi yang sudah basi satu hari, ditambah penalti panjang yang dapat dikendalikan untuk menukar panjang penalaran dengan skor tanpa pelatihan ulang.
• Data — sekitar 95 persen token internet mentah dihilangkan melalui parsing, deduplikasi, dan kurasi, dengan klaim bahwa filter konvensional akan melewatkan sekitar 1,8 triliun dari token yang dipertahankan Reflection, termasuk 87 persen dari token kode web terkurasi miliknya.
Dua baris patut disorot. Tulisan itu menyebutkan bahwa midtraining memperluas konteks efektif Beam hingga 1 juta token, sementara dokumentasi API mencantumkan batas penyajian 256.000 token dengan catatan kaki beta. Itu adalah kemampuan di sisi pelatihan dan batas di sisi penyajian, bukan kontradiksi, tetapi celah itulah yang justru menjadi judul "konteks 1M" jika tidak ada yang membaca dokumen kedua. Dan angka RL lebih dari 100 juta rollout disajikan sebagai salah satu proses terbesar semacam itu oleh lab terbuka mana pun, yang merupakan klaim tentang skala, bukan tentang apa yang diperoleh dari skala itu — kurva skor versus rollout adalah milik vendor sendiri dan berhenti di tempat vendor berhenti memplotnya.

Apa yang bisa Anda lakukan dengan Reflection Beam hari ini
Satu hal: ikutlah daftar tunggu dan, jika kamu mendapat kunci, panggil Beam-501B-A23B melalui endpoint milik Reflection sendiri dengan klien berformat OpenAI. Tidak ada harga yang dipublikasikan, jadi tidak ada cara untuk memodelkan biaya suatu beban kerja padanya. Tidak ada bobot, jadi tidak ada hosting mandiri, tidak ada kuantisasi, dan tidak ada reproduksi pihak ketiga. Tidak ada baris benchmark independen, jadi seluruh gambaran performa di atas bertumpu pada tabel satu laboratorium saja.
Reflection Beam bukan salah satu rute kami, dan kami tidak akan menyiratkan bahwa itu salah satunya. Yang bisa kami berikan adalah harga pasar yang ingin dimasukinya, yang dibaca langsung dari katalog kami sendiri pagi ini: GLM 5.2 pada $1.40 masuk dan $4.40 keluar per juta token, GLM 5.3 pada $1.26 dan $3.96, Qwen 3.8-Max pada $2.00 dan $6.00, serta DeepSeek V4.1 Flash pada $0.15 dan $0.60. Itu adalah selisih lebih dari sembilan kali lipat antara yang termurah dan termahal hanya dari sisi input — dan itulah sebabnya model beta tanpa harga daftar benar-benar sulit dimasukkan ke dalam pengambilan keputusan, tak peduli seberapa bagus grafik efisiensinya terlihat.
OrcaRouter menjalankan satu kunci yang kompatibel dengan OpenAI di keempat model tersebut dan lebih dari 200 model lainnya, meneruskan harga daftar dari penyedia tanpa tambahan apa pun, sehingga perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama, bukan saat reseller memperbarui tabel. Failover otomatis adalah bagian dari perutean, bukan sesuatu yang Anda bangun di sekitar setiap penyedia, yang berarti model yang belum terbukti — tanpa reproduksi, tanpa skor independen, dan tanpa harga — justru jenis hal yang Anda tempatkan pada sebagian trafik, bukan pada jalur kritis Anda.
Ketika klaim menjadi dapat diuji
Tiga hal menentukan ini, dan Reflection telah menempatkan dua di antaranya di dalam bulan itu.
Yang pertama adalah bobotnya. Apache 2.0 plus laporan teknis memungkinkan siapa saja yang punya beberapa node untuk mengukur hal yang penting — token per detik per GPU pada ambang kualitas tetap, dan apakah 23 miliar parameter aktif benar-benar memberikan skor per FLOP seperti yang disiratkan bagan itu. Sampai saat itu, argumen efisiensinya hanyalah aritmetika di atas serbet, dan setiap orang yang mengulanginya hanya mengulang takarir Reflection.
Yang kedua adalah harga. Model tanpa harga daftar tidak punya tempat dalam perbandingan biaya. Jika Beam berada di atas tingkat GLM dan DeepSeek, narasi komputasi tidak lagi penting bagi siapa pun yang punya anggaran; jika berada di bawah, gambarannya berubah dengan cepat.
Yang ketiga adalah indeks. Artificial Analysis telah mengatakan bahwa pihaknya sedang melakukan benchmark terhadap Beam dan belum menerbitkan angka apa pun. Ketika baris itu muncul, itu akan menjadi angka pertama dalam cerita ini yang tidak dihitung oleh Reflection.
Jika Anda membutuhkan pengode agentik yang mumpuni hari ini dan ingin tahu berapa biayanya, jawabannya belum Reflection Beam. Mungkin tiga minggu lagi. Model yang klaim efisiensinya layak dipertaruhkan adalah model yang bobotnya dapat Anda unduh dan FLOPs-nya dapat Anda hitung sendiri — dan dalam ujian itu, Reflection baru memberi kita tanggal dan daftar tunggu, bukan model.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
