Kartu judul hero untuk 'Mercury 2.5 vs Mercury 2.5 Preview' dengan subjudul 'Satu model difusi, dua tanggal rilis — apa yang sebenarnya berubah dari pembaruan produksi tersebut'. Tiga chip terletak di bawahnya: ikon kolom terpisah berlabel 'MESIN SAMA', ikon petir berlabel 'KLAIM 1.107 tok/s', dan ikon jam berlabel '31 AGU vs 8 SEP'. Logo OrcaRouter berada di pojok kanan bawah.
Guides & Insights

Mercury 2.5 vs Mercury 2.5 Preview: Satu Model Difusi, Dua Tanggal Peluncuran

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Berikut adalah perbandingan head-to-head di mana kedua pesaing berbagi kartu model yang sama. Mercury 2.5 Preview milik Inception, yang dirilis pada 31 Agustus 2026, dan Mercury 2.5, yang dirilis pada 8 September 2026, adalah model bahasa difusi yang sama dengan selisih delapan hari: sebuah saluran pratinjau yang dibuka Inception untuk pengembang, dan versi produksi "siap untuk perusahaan" yang diluncurkan seminggu kemudian. Inception tidak mengungkapkan checkpoint yang berbeda, angka kecepatan yang berbeda, atau harga yang berbeda untuk Mercury 2.5 — dan angka-angka yang berubah di antara kedua pengumuman itu tampak seperti sekadar perapian, bukan model baru. Angka konteks dikoreksi dari 256K di halaman pratinjau menjadi 260K saat peluncuran, dan peningkatan kecerdasan dibandingkan Mercury 2 dikemas ulang dari "lebih dari 10 poin" (materi pratinjau) menjadi "40 persen" (materi peluncuran). Mesinnya, klaim 1.107 token per detik, dan daftar harganya identik. Jadi ini bukan pertarungan lembar spesifikasi biasa, dan menggelembungkan salah satunya akan menjadi tidak jujur. Perbandingan yang penting antara kedua nama ini adalah soal pengemasan dan waktu: apa yang sebenarnya diubah oleh peluncuran produksi, apa yang sebenarnya disampaikan oleh label Preview, dan nama mana yang seharusnya dipakai oleh panggilan API Anda sekarang.

Mengapa sebuah model dibandingkan dengan dirinya sendiri

Vendor biasanya mempratinjau sebuah model lalu diam-diam menggabungkannya ke dalam nama utama; daftar pratinjau menghilang dan tidak ada yang menulis perbandingannya. Inception justru menampilkan kedua nama tersebut berdampingan selama seminggu, dan identitas pratinjau itu baru sekarang dipensiunkan — justru itulah mengapa perbandingan ini punya isi. Preview adalah jalur cepat yang digunakan Inception untuk menghadirkan taruhan difusinya di hadapan para pengembang. Model ini muncul pada 31 Agustus dengan lembar spesifikasi yang kini menjadi lembar spesifikasi Mercury 2.5: sebuah LLM difusi (dLLM) yang menghasilkan dan menyempurnakan blok-blok token secara paralel, bukan mengeluarkan satu token dalam satu waktu; klaim 1.107 token per detik pada GPU standar; klaim waktu ke-token-pertama di bawah 300ms; jendela konteks 260K token dengan keluaran 65.536 token; tingkat penalaran yang dapat disetel; penggunaan alat secara native, panggilan alat paralel, dan keluaran terstruktur. Setiap angka tersebut adalah milik Inception sendiri, dan belum ada laboratorium independen yang mengukur model tersebut ketika Preview dirilis.

Pada tanggal 8 September, Inception meluncurkan Mercury 2.5 sebagai "tingkat kecerdasan berikutnya untuk LLM difusi" dan model penalaran tercepatnya yang dalam produksi — siap untuk enterprise, ditujukan untuk agen suara, subagen pemrograman, pencarian enterprise, dan beban kerja dukungan. Spesifikasinya sama, posisinya sama, daftar harganya sama. Peluncuran tersebut juga memperlihatkan dua produk saudara yang memperjelas arah Inception: Mercury Voice, sebuah dLLM yang disetel ke token pertama di bawah 170ms untuk agen suara, dan Mercury Router, yang merutekan prompt antar model berdasarkan kualitas, kecepatan, dan biaya. Mercury 2.5 adalah andalan dari keluarga yang dibangun untuk beban kerja yang sensitif terhadap latensi dan agentik, bukan untuk tingkatan kualitas frontier.

Apa yang Sebenarnya Diubah oleh Peluncuran 8 September

Bandingkan kedua nama tersebut baris demi baris, dan perbedaannya bukanlah mesinnya — melainkan semua yang membungkus mesin tersebut:

Status — Mercury 2.5 Preview: pratinjau tertutup yang dapat "mengubah perilaku atau ketersediaan." Mercury 2.5: model produksi yang diluncurkan dengan komitmen siap perusahaan, saluran penjualan, dan daftar produksi bertanggal.

Identitas — Halaman model Inception sekarang mencantumkan Mercury 2.5, Mercury Voice, dan Mercury Router, tanpa ada Preview sama sekali, dan catatan kaki dukungannya menyebut Mercury 1, Mercury 2, dan Mercury Edit 2 sebagai model yang "tetap didukung untuk pelanggan yang sudah ada." Preview tidak muncul di daftar mana pun. Menurut vendor, label preview telah diserap ke dalam Mercury 2.5.

Endpoint — Platform developer Inception menyajikan model sebagai mercury-2.5, dan listing produksi yang tayang pada 8 September menjadi tempat lalu lintas baru dilayani. Pada katalog yang pertama kali memuat Preview pada akhir Agustus, nama Preview kini tidak lagi mengarah ke endpoint layanan langsung, sementara listing Mercury 2.5 yang ditambahkan pada 8 September yang menjawab. Siapa pun yang membuat kode dengan mengacu pada nama Preview harus mengarahkan ulang ke Mercury 2.5 dan memastikan apa yang sebenarnya ditagihkan oleh penyedia mereka — id yang Anda integrasikan pada minggu pertama itulah yang dipensiunkan.

Harga — daftar harga yang identik dan diskon yang identik. Keduanya $0.20 per juta input dan $0.75 per juta output, dengan input yang di-cache sebesar $0.02, dan keduanya diluncurkan dengan diskon sekitar 80%: $0.04 / $0.15, input yang di-cache sebesar $0.004. Diskon Preview secara eksplisit dibatasi waktunya hingga 8 September; Mercury 2.5 diluncurkan dengan penawaran diskon 80% yang sama, dan tarif diskon itulah yang masih tampil di daftar produksinya saat tulisan ini dibuat. Itulah jebakannya, yang diuraikan di bawah ini.

Onboarding — peluncuran produksi menambahkan jatah token gratis untuk akun pengembang baru — materi peluncuran menyebutkan 100 juta token — dan membuka jalur kontak enterprise yang tidak dimiliki oleh versi pratinjau.

Bukti — tidak berubah. Tidak satu pun nama yang memiliki tolok ukur independen, dan klaim vendor adalah klaim yang sama dengan susunan kata yang sedikit berbeda: lompatan kecerdasan "lebih dari 10 poin" atas Mercury 2 di materi pratinjau menjadi peningkatan "40 persen" di materi peluncuran, di samping paritas yang dinyatakan sama dengan tier frontier yang dioptimalkan untuk biaya (GPT-5.6 Luna dalam mode upaya rendah, Gemini 3.5 Flash-Lite, Claude Haiku 4.5) dan 79% pada GPQA Diamond serta 77% pada IFBench yang sama-sama dilaporkan vendor. Klaim yang diulang bukanlah klaim yang terverifikasi.

A two-column comparison card titled 'Mercury 2.5 Preview vs Mercury 2.5 — what actually changed'. Left column 'Mercury 2.5 Preview, released Aug 31, 2026': Release Aug 31, 2026; Status closed preview; Engine diffusion dLLM, 260K ctx; Serving preview id retired from the catalog; Price $0.20/$0.75 list, 80% off intro; Evidence none independent. Right column 'Mercury 2.5, released Sep 8, 2026': Release Sep 8, 2026; Status production, enterprise-ready; Engine same, no new checkpoint disclosed; Serving mercury-2.5 id live, serving traffic; Price $0.20/$0.75 list, 80% off launch; Evidence none independent. Footer reads 'Same engine under two labels — the delta is lifecycle, not spec. All figures vendor-reported.' The OrcaRouter logo is in the bottom-right corner.

Jebakan harga di jantung pasangan ini.

Karena kedua nama tersebut memiliki harga daftar yang sama dan teaser 80% yang sama, mudah untuk berasumsi bahwa keduanya selalu membutuhkan biaya yang sama. Padahal tidak harus demikian. Diskon Preview berhenti total pada 8 September; diskon peluncuran Mercury 2.5 berjalan dengan hitungan waktu yang baru. Selama seminggu, sangat mungkin Anda membayar $0,20 / $0,75 untuk satu panggilan ke Preview sementara mesin yang sama merespons dengan harga $0,04 / $0,15 di bawah nama produksinya — atau, lebih mungkin lagi, berada di id preview yang diam-diam berhenti melayani sementara tagihan terus berdatangan. Diskon peluncuran yang kedaluwarsa per endpoint adalah jenis cetakan kecil yang mengubah cerita "model yang sama, harga yang sama" menjadi perbedaan biaya yang nyata.

The durable number is the list price, and the durable advice is to budget around it: $0.20 / $0.75 per million, cached input $0.02 — cheap for a reasoning model with a 260K context, comfortably under the flagship tier, but not the $0.04 / $0.15 that the launch banners advertise. Treat the discounted rate as a test-drive price with a lifespan, verify what your provider bills for the exact model id in your code rather than for the name on the marketing page, and if you onboarded on the Preview, migrate to Mercury 2.5 before an expiry or a retired endpoint decides for you.Angka yang bertahan adalah harga daftar, dan saran yang bertahan adalah menganggarkan di sekitar angka itu: $0,20 / $0,75 per juta, input cache $0,02 — murah untuk model penalaran dengan konteks 260K, nyaman di bawah tier flagship, tetapi bukan $0,04 / $0,15 yang diiklankan spanduk peluncuran. Anggaplah harga diskon itu sebagai harga uji coba dengan masa berlaku, verifikasi apa yang ditagih penyedia Anda untuk id model yang persis dalam kode Anda, bukan untuk nama di halaman pemasaran, dan jika Anda bergabung di Preview, migrasilah ke Mercury 2.5 sebelum masa berlaku habis atau endpoint yang pensiun memutuskannya untuk Anda.

Ini juga kelas masalah yang lapisan routing ada untuk menghilangkan. Sebuah router model yang meneruskan harga daftar para penyedia dengan markup 0% menunjukkan harga yang sebenarnya ditagihkan vendor, yang diperbarui pada hari yang sama saat diskon peluncuran mulai berlaku atau berakhir, dan failover otomatis menjaga panggilan tetap mengalir ketika sebuah endpoint dihentikan tanpa sepengetahuan Anda. Mercury 2.5 belum ada di OrcaRouter pada saat tulisan ini dibuat — Inception menyediakannya melalui API-nya sendiri dan beberapa platform pihak ketiga — jadi untuk saat ini, halaman model vendor adalah sumber kebenaran untuk tarif tersebut. Begitu penyedia mendaftarkannya, mekanisme penerusan itulah yang Anda dapatkan dengan satu kunci, dan pemotongan harga atau berakhirnya diskon muncul di sisi kami pada hari yang sama saat diumumkan.

Masalah bukti yang dimiliki bersama oleh kedua nama tersebut.

Papan skor yang jujur untuk pasangan ini pendek, karena kedua kolom tersebut adalah model yang sama dengan ketiadaan bukti yang sama. Baik Mercury 2.5 maupun Mercury 2.5 Preview tidak memiliki skor indeks independen, hasil uji yang direproduksi, atau penempatan arena per 9 September 2026. Klaim Inception sendiri — lonjakan kecerdasan dibandingkan Mercury 2, kesetaraan dengan tingkat Haiku 4.5, GPQA Diamond 79%, 1.107 token per detik — adalah perkataan perusahaan itu sendiri, dan keduanya identik untuk kedua nama karena modelnya identik.

Satu-satunya bukti independen dalam keluarga model ini menunjukkan cara membaca klaim kecepatan tersebut. Artificial Analysis mengukur Mercury 2, pendahulunya, pada 684 token per detik di endpoint produksi, memberinya skor 22 pada Intelligence Index — memang cepat, dan bukti bahwa pendekatan difusi bukanlah ilusi, tetapi jauh di bawah sekitar 1.000 token per detik yang diiklankan Inception untuk model tersebut pada perangkat keras Blackwell. Harapkan kesenjangan serupa antara angka 1.107 milik Mercury 2.5 dan apa yang sebenarnya diberikan oleh endpoint bersama multi-penyewa di bawah beban nyata. Kehati-hatian yang sama berlaku untuk kualitas: model difusi baru yang hanya diukur oleh pembuatnya tidak boleh dipercaya begitu saja mengenai kemampuan menyamai Claude Haiku 4.5 sampai pihak ketiga mengujinya.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the predecessor Mercury 2.5 builds on, showing its Intelligence Index score of 22, its independently measured output speed of 684 tokens per second, its $0.25 input / $0.75 output pricing, and its 128K context window.

Pelacak yang mulai meliput perilisan ini mencerminkan persis keadaan tersebut. Catatan BenchLM untuk Mercury 2.5, yang diposting pada 8 September, tidak memberikan model itu skor publik maupun peringkat publik; catatan tersebut memuat angka GPQA Diamond 79% dan IFBench 77% milik Inception yang secara eksplisit diberi label sebagai laporan dari penyedia, dan menyebutkan bahwa kecepatan runtime independen belum diukur. Entri indeks Artificial Analysis yang pertama, penempatan di LMArena, atau pengujian GPQA yang direproduksi akan mengubah Mercury 2.5 dari sekadar klaim menjadi objek yang dapat dibandingkan — dan itu akan berlaku untuk kedua nama sekaligus, karena hanya ada satu model yang harus diukur.

A screenshot of the BenchLM model record for Mercury 2.5 (captured September 9, 2026), showing 'No public score yet' and 'No public rank', the model noted as released September 8, 2026 with a 260K context window, and the decision note that Inception reports 79% on GPQA Diamond and 77% on IFBench as provider-reported results with independent runtime speed not yet measured.

Nama apa yang sebaiknya kamu panggil?

Integrasi baru, tanpa sistem lama: gunakan Mercury 2.5 dan abaikan Preview. Versi produksinya membawa mesin yang sama, diskon yang sama untuk saat ini, syarat enterprise, serta jaminan bahwa id itulah yang benar-benar disajikan vendor. Preview hanya menambah risiko ketidakstabilan dan tidak ada yang lain.

Sudah mengintegrasikan Preview: periksa hari ini apa yang disajikan penyedia Anda dengan nama tersebut dan berapa yang ditagihkan untuk itu. Arahkan ulang klien Anda ke id Mercury 2.5 dan konfirmasi tarifnya. Mempertahankan nama Preview dalam kode produksi kini merupakan taruhan bahwa saluran pratinjau yang diberi batas waktu secara eksplisit akan bertahan melampaui masa pensiunnya sendiri.

Lalu lintas enterprise atau yang kritis untuk produksi:Mercury 2.5 melalui jalur enterprise Inception, bukan label pratinjau tanpa komitmen di baliknya. Kebutuhan suara dan perutean masing-masing mengarah ke Mercury Voice dan Mercury Router, yang keduanya masih merupakan pratinjau.

Siapa pun yang mengevaluasi tier difusi: Kedua nama tersebut adalah target evaluasi yang sama, jadi jalankan evaluasi Anda terhadap Mercury 2.5 sekali saja dan anggap hasilnya berlaku untuk lini model tersebut. Buat anggaran sesuai harga daftar, dan perlakukan klaim vendor sebagai hipotesis sampai skor independen muncul.

Apa yang harus ditonton

Tiga hal akan menentukan pasangan model ini dalam beberapa minggu ke depan. Pertama, tolok ukur independen pertama — penempatan indeks atau hasil GPQA atau AIME yang direproduksi — yang akan menguji klaim paritas yang menjadi taruhan komersial utama. Kedua, apakah identitas Preview hilang sepenuhnya dari ekosistem model, seperti yang sudah tersirat di halaman model milik Inception sendiri. Ketiga, apa yang terjadi pada diskon peluncuran 80% setelah tenggat 8 September yang menjadi patokan Preview telah berlalu: perpanjangan membuat Mercury 2.5 murah secara struktural, sementara lonjakan kembali ke $0,20 / $0,75 membuatnya hanya sekadar kompetitif. Sampai saat itu, jawaban yang tepat untuk "Mercury 2.5 atau Mercury 2.5 Preview?" adalah bahwa keduanya satu model, dan Anda seharusnya memanggil yang masih berupa produk.