
Mercury 2.5 Preview vs Gemini 3.1 Pro: Dua Pratinjau, Berjarak Enam Bulan
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0259Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0258Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0166Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
Kedua model dalam perbandingan ini sama-sama menyandang kata "preview" dalam nama mereka, dan di situlah kesamaan berakhir. Mercury 2.5 Preview dan Gemini 3.1 Pro sama-sama model penalaran yang bisa dipanggil melalui API saat ini, tetapi keduanya adalah preview di ujung yang berlawanan dari siklus hidup mereka. Gemini 3.1 Pro, model penalaran unggulan, telah dalam status preview sejak 19 Februari 2026 — dengan rekam jejak enam bulan evaluasi independen, posisi di papan peringkat publik, dan trafik produksi, serta skor Artificial Analysis Intelligence Index 57 saat peluncuran, input multimodal untuk teks, gambar, audio, dan video, konteks 1M token, dan harga $2.00 / $12.00 per juta token. Mercury 2.5 Preview, diffusion LLM milik Inception yang dirilis pada 31 Agustus 2026, baru berusia dua hari: model khusus teks dengan konteks 256K, klaim kecepatan 1.107 token per detik, harga daftar $0.20 / $0.75 (sekitar $0.04 / $0.15 setelah diskon hingga 8 September), dan belum ada satu pun tolok ukur independen. Menyebut keduanya "preview" menyembunyikan pertanyaan yang sebenarnya, yaitu seberapa berharga keunggulan awal dalam hal bukti selama enam bulan dibandingkan dengan cara yang secara fundamental lebih cepat untuk menghasilkan teks.
Apa sebenarnya setiap model itu
Gemini 3.1 Pro adalah model unggulan multimodal tertutup untuk penalaran umum. Ia membaca teks, gambar, audio, dan video, menangani jendela konteks 1M token dengan batas keluaran 64K, dan menyesuaikan kedalaman penalarannya secara dinamis — vendor menggambarkan empat tingkat intensitas penalaran yang berskala sesuai kompleksitas tugas. Angka peluncurannya — ARC-AGI-2 77.1%, GPQA Diamond 94.3%, SWE-bench Verified 80.6%, Terminal-Bench 2.0 68.5% — dilaporkan oleh vendor, tetapi angka-angka itu berada di atas enam bulan pengawasan independen, termasuk pengukuran ulang oleh Artificial Analysis pada skala indeks yang lebih ketat dengan hasil sekitar 46.5. Pengukuran ulang itulah yang memang layak diperoleh model yang matang: model tersebut telah diuji cukup keras hingga indeks di sekitarnya ikut menjadi lebih ketat. Mercury 2.5 Preview adalah model difusi — ia menghasilkan dan menyempurnakan token secara paralel, bukan satu per satu — dengan penalaran yang dapat disetel, panggilan alat paralel, dan JSON yang selaras dengan skema, yang dibangun untuk beban kerja dengan efek latensi berlipat yang disebut-sebut Inception: agen pencarian, pipeline suara, subagen pengodean. Semua klaim kualitas yang melekat padanya, termasuk lompatan 10+ poin atas Mercury 2, adalah klaim vendor itu sendiri, dan belum ada pihak ketiga yang mengukurnya.

Kontras spesifikasi
• Harga — Mercury 2.5 Preview: $0.20 / $0.75 per 1M input/output, ~$0.04 / $0.15 harga perkenalan hingga 8 Sep. Gemini 3.1 Pro: $2.00 / $12.00 per 1M, naik menjadi $4.00 / $18.00 di atas 200K input.
• Konteks / keluaran — Mercury 2.5 Preview: konteks 256K. Gemini 3.1 Pro: konteks 1M, output maksimum 64K.
• Input — Mercury 2.5 Preview: teks saja. Gemini 3.1 Pro: teks, gambar, audio, video, file.
• Arsitektur — Mercury 2.5 Preview: LLM difusi, generasi token paralel. Gemini 3.1 Pro: autoregresif, kedalaman penalaran dinamis.
• Kecepatan — Pratinjau Mercury 2.5: diklaim 1.107 token/detik. Gemini 3.1 Pro: tidak ada klaim utama yang sebanding.
• Bukti — Mercury 2.5 Preview: hanya laporan vendor. Gemini 3.1 Pro: Indeks AA 57 saat peluncuran (46.5 pada skala yang lebih baru) ditambah rekam jejak evaluasi independen yang panjang.

Kesenjangan multimodalitas adalah perbedaan yang menentukan.
Untuk sebagian besar aplikasi, perbandingan ini sudah selesai sebelum penetapan harga atau tolok ukur ikut berperan, karena Mercury 2.5 Preview tidak dapat melihat. {{1}}Gemini 3.1 Pro membaca tangkapan layar, diagram, audio, dan video — ini adalah model yang Anda arahkan ke PDF, bagan, rekaman rapat, atau UI ketika Anda menginginkan jawaban tentang sesuatu yang belum berupa teks.{{/1}} {{2}}Mercury 2.5 Preview khusus teks secara desain; model bahasa difusi yang menghasilkan teks secara paralel tidak memiliki jalur input gambar atau audio sama sekali. Untuk aplikasi yang padat dokumen, agen vision, atau produk multimodal apa pun, Gemini 3.1 Pro adalah satu-satunya kandidat di sini, tanpa kecuali.{{/2}} {{3}}Keterbatasan khusus teks pada Mercury 2.5 Preview bukan sekadar catatan kecil; itu adalah batas yang menentukan beban kerja mana yang memenuhi syarat bagi model tersebut.{{/3}}
Enam bulan pengujian dibandingkan dua hari
Berdasarkan bukti, ini bukanlah sebuah kontes, dan penting untuk menyatakan dengan jelas alasannya. Gemini 3.1 Pro telah diuji secara mendalam oleh laboratorium independen selama enam bulan; skornya telah ditetapkan, diukur ulang, dan diperdebatkan, yang merupakan wujud "dapat dipercaya" bagi sebuah model. Mercury 2.5 Preview hanya memiliki satu sumber informasi — pembuatnya — dan sumber tersebut mengklaim lompatan kecerdasan lebih dari 10 poin dibandingkan Mercury 2 serta kesetaraan dengan tier frontier yang dioptimalkan untuk biaya. Kedua pernyataan itu mungkin benar. Belum ada satu pun yang dikonfirmasi oleh pihak di luar Inception, dan model yang terlalu baru membuat hal tersebut memang bisa diduga. Asimetrinya bukan bahwa yang satu lebih baik; melainkan bahwa yang satu sudah dapat diketahui dan yang lainnya belum.
Di mana kecepatan Merkurius sebenarnya menang
Argumen yang jujur untuk Mercury 2.5 Preview memang sempit, khusus teks, dan nyata. Generasi token paralel mengubah perhitungan latensi dengan cara yang tidak bisa diikuti model autoregresif mana pun — termasuk Gemini 3.1 Pro — karena model autoregresif memang serial secara desain. Untuk pipeline suara, ironisnya input dan output berupa audio, tetapi proses berpikir di antara keduanya berupa teks: lapisan penalaran teks yang cepat itulah yang membuat agen suara terasa responsif. Untuk agen pencarian yang berulang kali melakukan panggilan tool, dan untuk subagen pengodean yang menghasilkan banyak penyelesaian kecil per tugas, latensi per panggilan terakumulasi menjadi kecepatan yang dirasakan. Pada harga perkenalan — $0,04 untuk input, $0,15 untuk output — Mercury 2.5 Preview kira-kira 80 kali lebih murah daripada tarif output standar Gemini 3.1 Pro, sehingga bukan sekadar lebih cepat, melainkan masuk kelas biaya yang berbeda untuk penalaran teks bervolume tinggi. Catatan yang harus menyertai setiap kalimat tersebut: kecepatan diklaim, paritas kualitas diklaim, dan belum ada pengukuran independen.
Harga: premium konteks panjang Gemini versus teaser Mercury
Kartu tarif Gemini 3.1 Pro memiliki satu detail yang perlu diketahui sebelum Anda membandingkan angka-angka utamanya: permintaan yang melewati 200 ribu token input melompat dari $2.00 / $12.00 menjadi $4.00 / $18.00 per juta. Pada model berkonteks 1M, premi konteks panjang itu bukan sekadar kasus langka — itulah harga untuk benar-benar memakai jendela yang membuat model tersebut terkenal. Mercury 2.5 Preview tidak memiliki jenjang seperti itu, dan konteks 256K-nya tidak akan sering menyentuh wilayah konteks panjang. Tetapi harga murah Mercury hanyalah umpan yang berakhir pada 8 September, sedangkan harga Gemini adalah tarif resmi yang stabil. Saat membandingkan, bandingkan harga daftar Mercury sebesar $0.20 / $0.75 dengan tier standar Gemini, bukan angka setelah diskon — diskon adalah insentif untuk mencoba, bukan harga untuk dijadikan acuan perencanaan.
Keputusan perutean
Kedua model saat ini sudah dapat dirutekan, dan itu mengubah cara Anda memperlakukan masing-masing. Gemini 3.1 Pro ada di OrcaRouter sebagai google/gemini-3.1-pro-preview, dengan harga resmi penyedia yang diteruskan dengan markup 0%, sehingga tarif standar maupun konteks panjang harganya persis seperti yang dipublikasikan penyedia, berdampingan dengan 200+ model lain dalam satu kunci API. Lencana pratinjau justru hal yang sebaiknya dihindari dalam perutean, bukan dijadikan taruhan — panel tingkat error di halaman model ada karena suatu alasan, dan failover otomatis berarti respons pratinjau yang menurun akan dialihkan ke penyedia kedua tanpa perubahan kode. Mercury 2.5 Preview belum ada di OrcaRouter; Inception menyajikannya melalui API miliknya sendiri dan beberapa platform pihak ketiga. Model berusia dua hari yang belum bisa Anda letakkan di belakang failover adalah kandidat uji, bukan ketergantungan produksi. Saat penyedia mendaftarkannya, penerusan harga yang sama berlaku dan diskon perkenalan masuk pada hari yang sama — saat itulah pertandingan ini menjadi aturan perutean, bukan keputusan.
Kesimpulan jujurnya, kedua pratinjau ini menjawab pertanyaan yang berbeda. Gemini 3.1 Pro menjawab "model mana yang sebaiknya saya gunakan untuk membangun produk saya hari ini" — ia multimodal, berkonteks panjang, telah diuji secara independen, dan stabil, dengan harga yang mencerminkan semua itu. Mercury 2.5 Preview menjawab "seberapa cepat penalaran teks bisa berjalan secara fisik" — dan arsitektur kecepatannya adalah hal yang paling menarik dari model ini, yang masih menunggu laboratorium independen untuk memastikan apakah kualitas yang menyertainya benar-benar nyata. Jika beban kerja Anda multimodal atau berkonteks panjang, pilihannya sudah pasti. Jika hanya teks, rentan terhadap akumulasi latensi, dan sensitif terhadap harga, Mercury 2.5 Preview adalah taruhan yang perlu diperhatikan — dan 8 September adalah tanggal pembandingnya.

