
Reflection Beam vs Gemini 3.1 Pro Preview: Satu Membaca Video, Satu Membaca Teks
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 150 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Mulailah dengan asimetri yang tidak disebutkan oleh tabel benchmark mana pun dalam perbandingan ini. Reflection Beam, yang diumumkan pada 5 Oktober 2026, adalah model sparse mixture-of-experts dengan 501 miliar parameter dan 23 miliar parameter aktif per token, serta ia menerima teks sebagai masukan dan mengembalikan teks sebagai keluaran. Tidak ada yang lain. Gemini 3.1 Pro Preview, model multimodal terdepan dari vendor tersebut sejak 19 Februari 2026, menerima teks, gambar, video, audio, dan berkas, dan ini satu-satunya model dalam perbandingan ini yang pertanyaan "bisakah ia melihat hal yang ingin saya tanyakan" memiliki jawaban berbeda untuk masing-masing pihak. Segala hal lainnya — rasio sparsitas, jendela konteks, tingkatan harga — hanyalah argumen. Yang satu itu adalah spesifikasi.
Ini juga berarti ini adalah pasangan yang paling tidak simetris dalam kumpulan ini, dan yang paling berguna, karena ini mengungkap untuk apa perbandingan model sebenarnya. Jika beban kerja Anda berupa teks, Beam dan Gemini 3.1 Pro adalah dua opsi pada spektrum yang membentang dari murah-dan-tidak-terukur hingga mahal-dan-dinilai-secara-menyeluruh. Jika beban kerja Anda memiliki satu frame video di dalamnya, tidak ada perbandingan yang bisa dibuat.
Apa yang dimaksud dengan masing-masing model
Gemini 3.1 Pro Preview adalah produk unggulan tingkat preview milik Google: konteks 1.048.576 token, keluaran maksimum 65.536 token, lima modalitas input, dan jendela 1 juta token yang dicapai melalui tangga harga, bukan tarif tetap. Google memposisikannya untuk rekayasa perangkat lunak yang ditingkatkan, keandalan agentik yang lebih baik, dan penggunaan token yang lebih efisien pada alur kerja kompleks. Model ini bukan open weights. Namanya masih menyandang "Preview", status yang dipertahankan Google untuk model ini sejak Februari.
Reflection Beam adalah model pertama Reflection dan awal dari seri open-weight. Lima ratus satu miliar parameter total, 23 miliar aktif — sekitar 4,6 persen dari model yang aktif per token. Dua puluh tiga koma delapan triliun token pra-pelatihan pada 6.144 chip GB300 dalam waktu kurang dari empat minggu, lalu kampanye pembelajaran penguatan pada 10.500 chip GB300 selama empat minggu dengan lebih dari 100 juta rollout di sekitar satu juta lingkungan. API-nya kompatibel dengan OpenAI di api.reflection.ai/openai/v1 dengan Chat Completions dan daftar Models, konteksnya 256.000 token dengan catatan kaki beta, parameter reasoning_effort-nya memiliki lima tingkat dan tidak ada sakelar mati, dan bobotnya dijanjikan untuk akhir bulan ini dengan lisensi Apache 2.0.
• Modalitas — Gemini 3.1 Pro Preview menerima teks, gambar, video, audio, dan file; Reflection Beam hanya menerima teks.
• Konteks dan keluaran — 1.048.576 token masuk dan 65.536 keluar untuk Gemini, dibandingkan dengan 256.000 masuk dan 128.000 keluar untuk Beam.
• Harga — Gemini 3.1 Pro Preview sebesar $2,00 untuk input dan $12,00 untuk output per juta token hingga 200.000 token, naik menjadi $4,00 dan $18,00 di atas jumlah tersebut, dengan pembacaan cache sebesar $0,20; Reflection Beam tidak memiliki harga yang dipublikasikan.
• Cakupan tooling — pemanggilan alat native, output terstruktur, dan grounding pencarian di sisi Google; pemanggilan alat dan output terstruktur di sisi Beam, dengan endpoint yang terbatas pada Chat Completions.
• Bobot — proprietari untuk Gemini; Apache 2.0 dijanjikan untuk Beam, belum dirilis.
• Skor Independen — Gemini 3.1 Pro Preview memiliki indeks Artificial Analysis; Beam tidak memiliki baris di papan.
Kesenjangan modalitas adalah keseluruhan argumennya.
Ada baiknya bersikap konkret alih-alih hanya menyinggung "multimodal," karena konsekuensi praktisnya spesifik.
Beban kerja yang menyerap rekaman layar, foto produk, kontrak hasil pemindaian, atau berkas audio pusat panggilan tidak dapat dilayani oleh Beam dengan harga berapa pun, dengan prompt apa pun, pada paket apa pun. Tidak ada solusi alternatif di lapisan API: dokumentasi Beam menjelaskan satu modalitas masukan dan satu modalitas keluaran, dan tidak ada jalur gambar atau audio yang tercantum. Gemini 3.1 Pro Preview menangani kelima hal itu, yang berarti ini satu-satunya model di sini yang dapat dimasukkan ke dalam alur kerja ketika masukannya belum berupa teks.
Kasus sebaliknya juga layak dikemukakan, karena inilah yang sering disalahpahami orang. Jika input Anda berupa teks dan akan tetap berupa teks, lima modalitas Gemini tidak memberi Anda manfaat apa pun, dan Anda membayar harga model multimodal untuk menjalankan beban kerja teks. Itu bukan argumen untuk Beam — melainkan argumen bahwa pertanyaan modalitas harus dijawab sebelum pertanyaan benchmark, karena pertanyaan itu menyingkirkan opsi dengan lebih murah dan lebih andal daripada perbandingan skor mana pun.
Dua pratinjau, dua makna yang berbeda
Kedua nama model tersebut memiliki catatan masing-masing dan catatan tersebut tidak serupa, yang merupakan hal paling menarik dari pasangan ini.
Gemini 3.1 Pro "Preview" adalah konvensi penamaan pada model yang telah dapat dipanggil secara umum sejak Februari, dengan skor independen, tarif yang dipublikasikan termasuk tier konteks panjang yang terdokumentasi, dan cakupan alat yang lengkap. Dalam praktiknya, "Preview" berarti Google berhak menggantikannya, bukan berarti model tersebut sulit didapat atau
Beta Beam adalah gerbang yang sesungguhnya. Aksesnya melalui daftar tunggu, ID model dibuat pada 5 Oktober 2026, tidak ada daftar tarif, tidak ada skor pihak ketiga, dan artefak yang memungkinkan siapa pun memverifikasi klaim utamanya — bobot, laporan teknis, kartu model — dijanjikan alih-alih dirilis. Angka konteksnya membawa catatan kaki yang memperingatkan bahwa angka itu dapat berubah selama beta, sebuah bentuk kehati-hatian yang tidak dibutuhkan oleh model yang tersedia secara umum.
Konsekuensinya asimetris dalam hal yang penting bagi pengadaan. Tim yang mengadopsi Gemini 3.1 Pro Preview menerima risiko pergantian model. Tim yang mengadopsi Beam hari ini menerima harga yang tidak diketahui, skor independen yang tidak diketahui, dan tidak adanya kemampuan untuk menjalankan model itu sendiri. Itu adalah kategori risiko yang berbeda, dan harga adalah faktor yang paling sering menentukan.

Tolok ukur, dan masalah pengutipan
Tabel peluncuran Reflection tidak menyertakan Gemini 3.1 Pro Preview atau model Google mana pun. Kumpulan perbandingannya hanya mencakup model terbuka dan semi-terbuka: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max, dan DeepSeek V4.1 Flash. Jadi, kedua model tersebut belum pernah diadu satu sama lain dalam tabel yang dipublikasikan, dan angka-angka di bawah ini berasal dari harness yang berbeda di kedua sisi.
• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview mencatat 29,7, peringkat ke-58 dari 147 dalam run-nya. Beam tidak memiliki baris indeks sama sekali.
• GPQA Diamond — Gemini 3.1 Pro Preview pada 94,1 menurut Artificial Analysis dibandingkan dengan 90,5 yang dilaporkan vendor Beam.
• SciCode — 58,7 untuk Gemini dibandingkan 49,7 yang dilaporkan vendor Beam.
• Humanity's Last Exam — 47,0 untuk Gemini dibandingkan 36,2 yang dilaporkan vendor Beam, yang terakhir secara eksplisit tanpa alat.
• Terminal-Bench v2.1 — 73,8 untuk Gemini menurut Artificial Analysis, dibandingkan 80,1 yang dilaporkan vendor Beam. Ini adalah baris terkuat Beam dalam perbandingan ini, dan ini adalah panen terhadap model yang telah ada di pasar sejak Februari.
• Recall konteks panjang — 82,0 untuk Gemini dibandingkan dengan 79,3 yang dilaporkan vendor Beam pada AA-LCR.
• tau-squared Bench — 95,6 untuk Gemini dibandingkan 78,7 milik Beam pada MCP Atlas dan 38,0 pada tau3 banking. Evaluasi terkait penggunaan alat agentik, bukan evaluasi yang sama, dan perbedaan penamaannya penting.
Ada masalah kejujuran tersendiri pada sisi Gemini dalam tabel ini yang layak mendapat kalimatnya sendiri. Skor indeks independen untuk Gemini 3.1 Pro Preview telah dikutip sebesar 30, 46, 47,7 dan 57 di berbagai sumber, dan Artificial Analysis menyajikan revisi indeks yang berbeda di halaman model yang berbeda pada saat yang sama. Angka 29,7 di atas adalah angka yang ada di halaman yang kami baca pada 6 Oktober 2026, dan itu satu-satunya yang akan kami kutip — tetapi artikel mana pun yang menempatkan satu angka indeks Gemini di samping pesaing tanpa menyebutkan dari snapshot mana angka itu berasal sedang menyajikan angka yang mengambang sebagai angka tetap. Peringatan yang sama berlaku secara terbalik untuk Beam, yang tidak memiliki snapshot sama sekali.
Harga, dan tier yang tidak pernah direncanakan siapa pun
Gemini 3.1 Pro Preview adalah $2,00 untuk masukan dan $12,00 untuk keluaran per juta token hingga 200.000 token, serta $4,00 dan $18,00 di atasnya. Pembacaan cache $0,20 per juta dan penulisan cache $0,375. Batas tingkat adalah bagian yang perlu direncanakan: nilai jual utama model ini adalah jendela 1.048.576 token, dan begitu sebuah beban kerja melewati 200.000 token, tarif masukan menjadi dua kali lipat dan keluaran naik setengah. Beban kerja yang dirancang untuk jendela satu juta token karenanya adalah beban kerja yang dihargai pada tingkat kedua untuk sebagian besar trafiknya, bukan yang pertama.
Beam tidak memiliki rate card, tidak ada tier untuk dimodelkan, dan tidak ada yang bisa dibandingkan. Ketiadaan itu bersifat netral: artinya, pernyataan paling minim yang dapat dipertahankan tentang biaya Beam adalah bahwa biaya itu tidak diketahui, dan satu-satunya dukungan kuantitatif untuk posisi efisiensinya adalah milik Reflection sendiri, yang memperkirakan FLOPs yang dihasilkan sebagai dua kali jumlah parameter aktif dikalikan rata-rata token yang dihasilkan per percobaan di DeepSWE, HLE, dan Terminal-Bench 2.1 — dengan keterangan yang mengakui bahwa prefill prompt, attention, dan overhead penyajian dikecualikan. Pada beban kerja yang membuat konteks sejuta token menjadi penting, prefill bukanlah galat pembulatan, dan justru itulah suku yang dihilangkan oleh rumus tersebut.

Penggunaan alat, pencarian, dan di mana kedua desain berbeda
Kekuatan yang diiklankan Gemini 3.1 Pro Preview adalah rekayasa perangkat lunak, keandalan agentik, dan efisiensi token, dan permukaan alat yang dipublikasikannya mencakup pemanggilan fungsi, keluaran terstruktur, dan grounding pencarian. Poin terakhir itulah yang perlu dicatat bagi siapa pun yang membandingkan tumpukan agentik: pencarian yang di-grounding adalah kemampuan pihak pertama di sisi Google, dan itu mengubah hal yang dapat dilakukan agen yang menggunakan alat tanpa layanan pengambilan eksternal yang terpasang.
Kisah alat Beam lebih menarik daripada yang disiratkan oleh satu baris spesifikasi dan lebih sulit dinilai. Reflection melaporkan MCP Atlas pada 78,7, AutomationBench publik pada 37,0, tau3 banking pada 38,0, BrowseComp dengan manajemen konteks pada 77,4 dan DeepSearchQA dengan manajemen konteks pada 80,1 — dan mencatat bahwa selama pembelajaran penguatan (reinforcement learning) model secara organik belajar untuk melakukan kueri ke model bahasa lain dan memanggil API OCR ketika diberi akses web, meskipun tugas-tugas browsing tidak ada dalam campuran pelatihan. Jika generalisasi itu berlaku, ini adalah sinyal nyata tentang transfer agentik. Pada titik ini, ini juga merupakan observasi vendor dari sebuah proses pelatihan, tanpa pemeriksaan independen.
Pada baris penggunaan alat yang kedua sisinya memiliki angka, gambarannya beragam, bukan sepihak. Tabel vendor Beam menempatkannya di depan GLM 5.2 pada MCP Atlas dan setara dengan GLM 5.2 serta Kimi K3 pada tau3 banking, sementara angka tau-squared Bench milik Gemini sebesar 95.6 adalah angka agentik tertinggi yang pernah diterbitkan oleh pihak mana pun di antara keduanya. Suite berbeda, harness berbeda, dan tidak ada evaluasi bersama — itulah masalah yang berulang dalam perbandingan ini.
Memilih, dan cara melakukan lindung nilai
Aturan keputusan yang muncul dari uraian di atas cukup sederhana untuk dinyatakan dalam satu baris: jika ada input berupa teks, Beam adalah opsi dan perbandingannya selesai. Jika setiap input adalah teks, keputusannya menjadi apakah klaim efisiensi Beam yang tanpa atribusi sepadan dengan harga yang tidak diketahui dan tanpa skor independen, dibandingkan dengan model yang berbiaya $2.00 dan $12.00 dengan jenjang yang terdokumentasi dan cakupan alat yang lengkap.
Gemini 3.1 Pro Preview sudah ada di katalog kami, dengan tarif daftar dari penyedia yang diteruskan apa adanya tanpa tambahan apa pun, di balik satu kunci yang kompatibel dengan OpenAI di api.orcarouter.ai/v1 bersama 200+ model lainnya — dan kunci yang sama melayani model-model yang bersaing dengan Beam dari segi harga, dari GLM 5.3 pada $1.26 dan $3.96 hingga DeepSeek V4.1 Flash pada $0.15 dan $0.60, dibaca langsung pagi ini. Karena batas tier di 200.000 token adalah masalah routing, bukan masalah model, DSL routing memungkinkan Anda menyatakannya secara langsung: pertahankan permintaan pendek di tier murah dan patok permintaan yang benar-benar panjang di tempat jendela konteks menjadi alasan Anda memilih model tersebut, dalam satu panggilan alih-alih di dalam kode aplikasi.
Reflection Beam bukan salah satu rute kami, dan kami tidak akan mengarahkan Anda ke siapa pun yang mengklaim memilikinya. Jika bobot Apache 2.0 tiba bulan ini seperti yang dijanjikan, hosting mandiri menjadi opsi ketiga untuk pekerjaan yang hanya berupa teks dan klaim efisiensinya menjadi dapat diuji pada perangkat keras Anda sendiri.

Apa yang bisa mengubah jawabannya
Argumen Beam melawan Gemini bertumpu pada dua hal yang sama seperti setiap perbandingan Beam, dan adu ini menambahkan hal ketiga.
Sebuah harga. Tanpa itu, argumen efisiensi tidak dapat diubah menjadi keputusan anggaran, dan model tersebut bersaing berdasarkan diagram, bukan kartu tarif.
Skor independen. Artificial Analysis mengatakan pada 5 Oktober bahwa Reflection telah memberinya akses dan bahwa ia sedang melakukan benchmark terhadap Beam, menggambarkan indikator awal yang menunjukkan bahwa Beam akan menjadi salah satu model terbuka paling hemat token yang pernah dilihatnya untuk tingkat kecerdasannya. Itu adalah sumber yang tepat yang mengatakan hal yang tepat, dan masih belum ada baris Beam di papan tersebut — halaman model mengembalikan 404 dan papan peringkat tidak memuat entri Beam per pagi ini.
Dan hal yang tidak berubah: Beam hanya teks. Tidak ada rilis bobot, tidak ada pemotongan harga, dan tidak ada skor indeks yang mengubah itu, yang berarti untuk satu kelas beban kerja secara keseluruhan perbandingan ini tidak akan pernah menjadi perbandingan sama sekali. Jika pipeline Anda memiliki video di dalamnya, jawabannya adalah Gemini 3.1 Pro Preview bahkan sebelum benchmark pertama dimuat.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
