Kartu judul hero: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — salah satu dari ini masih berupa pratinjau
Guides & Insights

DeepSeek V4.1 Flash vs Gemini 3.1 Pro: Salah Satunya Masih Pratinjau

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hal paling berguna untuk diketahui tentang DeepSeek V4.1 Flash dibandingkan dengan Gemini 3.1 Pro tidak tercantum pada lembar spesifikasi mana pun. DeepSeek V4.1 Flash adalah model yang tersedia secara umum, dirilis pada 10 September 2026 dengan bobot berlisensi MIT yang dapat Anda unduh. Gemini 3.1 Pro telah berada dalam pratinjau sejak 19 Februari 2026 dan masih dilayani dengan nama build pratinjau sekitar tujuh bulan kemudian. Asimetri itu tidak menentukan model mana yang lebih baik, tetapi menentukan jenis komitmen apa yang Anda buat saat membangun di atas salah satunya, dan itulah kerangka untuk semua hal di bawah ini.

Keduanya menampung konteks sejuta token. Keduanya menerima gambar. Perbedaan yang benar-benar membedakan keduanya adalah kurva harga di atas 200.000 token input, modalitas input, batas maksimum output, dan fakta bahwa salah satu dari keduanya adalah file yang dapat Anda miliki dan yang lainnya adalah API.

Di mana posisi keduanya sebenarnya

• Harga per 1 juta token, hingga konteks 200K — DeepSeek V4.1 Flash $0,15 input / $0,60 output vs Gemini 3.1 Pro $2,00 input / $12,00 output. Itu 13 kali lipat harga input dan 20 kali lipat harga output.

• Harga per 1 juta token, untuk konteks di atas 200K — V4.1 Flash tidak berubah pada $0,15 / $0,60 vs Gemini 3.1 Pro $4,00 masuk / $18,00 keluar. Kelipatan input melebar menjadi 27× tepat pada titik di mana pekerjaan konteks panjang berada.

• Input cache — V4.1 Flash $0,003 per 1 juta di luar jam sibuk vs Gemini 3.1 Pro $0,40 per 1 juta. Dua orde besaran, pada pos biaya yang menentukan apakah konteks baca-ulang terjangkau.

• Jendela konteks — 1M token vs 1M token. Tingkat.

• Output maksimum — V4.1 Flash 384K token vs Gemini 3.1 Pro 65K token. Enam kali lipat batas maksimum.

• Modalitas masukan — V4.1 Flash menerima teks dan gambar vs Gemini 3.1 Pro menerima teks, gambar, audio, video, dan unggahan file.

• Bobot — V4.1 Flash MIT, dapat diunduh vs Gemini 3.1 Pro tertutup, hanya API.

• Status rilis — V4.1 Flash tersedia secara umum sejak 10 September 2026 vs Gemini 3.1 Pro dalam pratinjau sejak 19 Februari 2026.

• Latensi teramati hingga token pertama — V4.1 Flash 2,63 s pada p50 dan 9,05 s pada p95 vs Gemini 3.1 Pro 10,00 s pada p50 dan 10,00 s pada p95, berdasarkan telemetri 7 hari milik OrcaRouter sendiri. Waktu tunggu median model mahal tersebut berada di plafon telemetri, dan ekornya tidak bergerak menjauh darinya.

Baca daftarnya tanpa harga dan bentuknya sudah tidak asing lagi dari setiap perbandingan open-weights versus frontier: model yang dapat diunduh menang pada batas atas keluaran, imbang pada konteks, dan unggul pada latensi yang teramati. Model tertutup menang pada modalitas, dan pada hal-hal itu ia menang mutlak. Tidak ada apa pun di sini yang dengan sendirinya menjelaskan kelipatan input 13×.

Two-column scoreboard: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — price per 1M tokens $0.15 input and $0.60 output vs $2.00 and $12.00 up to 200K and $4.00 and $18.00 above, cached input $0.003 vs $0.40, context window 1M tokens on both, max output 384K tokens vs 65K tokens, input modalities text and images vs audio, file, image, text and video, weights MIT vs closed, release state generally available since 2026-09-10 vs in preview since 2026-02-19, and a time to first token of 2.63 s at p50 and 9.05 s at p95 vs 10.00 s at p50 and p95

Tebing 200K adalah cerita penetapan harga.

Tarif utama Gemini 3.1 Pro bukanlah tarif tunggal. Prompt hingga 200.000 token masukan dikenai tarif $2,00 untuk masukan dan $12,00 untuk keluaran per juta; prompt yang melewati ambang tersebut dikenai tarif $4,00 dan $18,00. DeepSeek V4.1 Flash tidak memiliki tingkatan — tarifnya $0,15 dan $0,60 baik permintaannya 2.000 token maupun 900.000, dengan satu catatan bahwa DeepSeek menggandakan tarifnya pada jam sibuk dan sepenuhnya beroperasi di luar jam sibuk pada akhir pekan.

Batas tingkatan itu jatuh di tempat yang paling buruk untuk pekerjaan konteks panjang, karena pekerjaan konteks panjang menurut definisinya adalah pekerjaan yang melintasinya. Perbandingan yang dikerjakan membuatnya menjadi konkret. Ambil contoh pipeline yang melakukan 20.000 panggilan per bulan, masing-masing rata-rata 250.000 token input dan 4.000 token output — pekerjaan analisis dokumen atas file-file besar.

• DeepSeek V4.1 Flash dengan tarif di luar jam sibuk: 20.000 × 250.000 adalah 5.000 juta token masukan dengan $0,15 per juta, atau $750,00. Keluarannya adalah 20.000 × 4.000, yaitu 80 juta token dengan $0,60 per juta, atau $48,00. Total $798,00.

• Gemini 3.1 Pro pada tier di atas 200K: 5.000M token input yang sama dengan $4,00 per juta adalah $20.000,00, dan 80M token output dengan $18,00 per juta adalah $1.440,00. Total $21.440,00.

Itu adalah perbedaan 27× dalam pengeluaran bulanan untuk trafik yang identik, dan itu bukan kelipatan yang Anda duga dari angka-angka utamanya. Kelipatan utamanya adalah 13×. Kelipatan yang sebenarnya Anda bayar untuk pekerjaan konteks panjang adalah 27×, karena batas tier persis berada di tempat prompt Anda berada.

Apa Sebenarnya yang Anda Bayar dari Label Pratinjau

Build pratinjau adalah build pratinjau di seluruh industri: ia tidak membawa jaminan stabilitas yang dipublikasikan. Vendor belum berkomitmen untuk mempertahankan endpoint pada perilaku tersebut, harga tersebut, atau nama tersebut. Itu bukan kritik terhadap Gemini 3.1 Pro — itulah arti label itu, dan itulah sebabnya sufiks pratinjau bertahan selama tujuh bulan alih-alih menjadi formalitas dua minggu.

Untuk prototipe, ini bukan apa-apa. Untuk jalur produksi, ini adalah risiko spesifik dan terukur: Anda bertaruh bahwa build yang Anda jadikan acuan tuning akan tetap tidak berubah. Kontras dengan sisi lain perbandingan ini bersifat struktural, bukan retoris. DeepSeek V4.1 Flash sudah GA, dan bobotnya berlisensi MIT serta dapat diunduh, yang berarti bahkan jika API yang dihosting mengubah ketentuannya besok, model itu sendiri akan tetap berada di tangan Anda. Model pratinjau tertutup tidak memberi Anda komitmen GA maupun jalan keluar. Jika beban kerja Anda dapat berjalan di salah satu dari keduanya, perbedaan itu bernilai lebih dari satu poin benchmark.

Ketika Gemini 3.1 Pro adalah instrumen yang lebih baik

Kesenjangan modalitas bukanlah kesalahan pembulatan, dan ini adalah satu-satunya dimensi dalam daftar ini di mana model murah tidak dapat digantikan dengan harga berapa pun. Gemini 3.1 Pro menerima audio dan video sebagai input kelas utama, plus unggahan file. DeepSeek V4.1 Flash menerima teks dan gambar. Jika pipeline Anda menyerap rekaman panggilan, tangkapan layar, atau tinjauan video, DeepSeek V4.1 Flash bukanlah opsi yang lebih murah — ini bukan opsi. Kelipatan 13× tidak relevan untuk tugas yang dapat dilakukan satu model dan tidak dapat dilakukan model lainnya.

Ada kasus kedua yang lebih tenang. Gemini 3.1 Pro telah tersedia untuk publik, dalam suatu bentuk, sejak Februari, dan ini adalah model dengan riwayat produksi lebih panjang — lebih banyak orang telah menemui batasannya, dan perilakunya pada lalu lintas nyata lebih terdokumentasi dibandingkan rilis berusia dua belas hari. Untuk pekerjaan interaktif yang padat output, di mana waktu tunggu median sepuluh detik dapat diterima karena pekerjaan berjalan di latar belakang, rekam jejak itulah argumennya, dan itu argumen yang nyata. Ini bukan argumen latensi: pada telemetri di atas, model yang lebih murah adalah yang lebih cepat di antara keduanya, baik pada median maupun ekornya.

Dan ada pertanyaan tentang apa arti label pratinjau bagi riwayat itu. Tujuh bulan ketersediaan dengan nama build pratinjau lebih lama daripada yang didapatkan sebagian besar model, dan itu juga berarti tujuh bulan tanpa komitmen GA. DeepSeek V4.1 Flash berusia dua belas hari pada saat penulisan, dan rekam jejak independennya tipis: satu uji menyeluruh pihak ketiga terbaru yang memuatnya, papan pengodean agentik Agents on Rails yang diterbitkan pada 21 September 2026, menempatkannya di 17% pada upaya maksimum, di pertengahan klasemen. Dua belas hari bukan waktu yang cukup bagi reputasi sebuah model untuk berarti apa pun, ke arah mana pun — itulah alasan jujur mengapa pembeli mungkin lebih memilih model yang lebih lama di sini, dan itu sama sekali tidak ada hubungannya dengan kecepatan.

Perutean berdasarkan panjang konteks, karena itulah keputusan yang sesungguhnya

Keputusan yang tersirat dari perbandingan ini bukanlah "pilih salah satu." Ini adalah aturan dengan dua klausa: pekerjaan konteks panjang dengan volume tinggi masuk ke DeepSeek V4.1 Flash, dan apa pun yang berisi audio atau video di dalamnya masuk ke Gemini 3.1 Pro. Bagian yang canggung adalah aturan ini mudah dinyatakan dan menyebalkan untuk diterapkan, karena kedua klausa tersebut biasanya berada di vendor yang berbeda dengan kunci yang berbeda, SDK yang berbeda, dan batas laju yang berbeda.

Kedua model dapat diakses dari satu kunci OrcaRouter, yang mengubah aturan ini menjadi aturan routing alih-alih kode percabangan di aplikasi Anda — Anda bisa mendasarkan keputusan langsung pada panjang konteks permintaan, yakni dimensi yang sebenarnya menentukan perbedaan biaya di sini. OrcaRouter meneruskan harga daftar penyedia tanpa markup, yaitu 0%, sehingga tarif bertingkat di atas adalah milik Google sendiri dan jadwal jam sibuk DeepSeek adalah milik DeepSeek sendiri, dengan perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama. Dan karena salah satu sisi pasangan ini adalah build pratinjau, failover otomatis layak dipasang di belakangnya: jika build tersebut direvisi saat Anda sedang menggunakannya, permintaan akan mendarat di model lainnya, bukan di halaman error.

Poin terakhir itu adalah versi praktis dari semua yang telah diuraikan di atas. Kelipatan 27× pada pekerjaan konteks panjang adalah alasan untuk merutekan alih-alih memilih, dan label pratinjau pada salah satu dari dua model tersebut adalah alasan untuk memiliki tempat tujuan bagi permintaan ketika build berubah.

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the model id, 1M-token context, 65K max output, audio, file, image, text and video input, $2.00 input and $12.00 output per 1M tokens, and observed time to first token of 10.00 s at both p50 and p95

Apa yang harus ditonton

• Apakah Gemini 3.1 Pro keluar dari preview. Rilis GA akan menghilangkan catatan stabilitas dan mengubah bentuk perbandingan ini lebih dari perubahan harga apa pun.

• Apakah tier di atas 200K berubah. Batas tier lebih berperan dalam perhitungan biaya daripada tarif utamanya.

• Apakah DeepSeek V4.1 Flash mengumpulkan rekam jejak independen. Model dengan bobot berlisensi MIT, plafon keluaran 384K, dan konteks 1M dengan harga $0.15 per juta input adalah paket yang tidak biasa; apakah kemampuannya benar-benar ada adalah pertanyaan yang belum dijawab oleh benchmark publik mana pun.

Sampai yang pertama dari itu hadir, ringkasan yang akurat adalah ini: DeepSeek V4.1 Flash kira-kira tiga belas kali lebih murah untuk input dan dua puluh tujuh kali lebih murah untuk input konteks panjang dibandingkan Gemini 3.1 Pro, ini satu-satunya dari keduanya yang dapat Anda unduh, dan ini satu-satunya dari keduanya yang memiliki komitmen GA di belakangnya. Gemini 3.1 Pro adalah model dengan sejarah produksi yang lebih panjang dan satu-satunya dari keduanya yang dapat membaca audio dan video. Rutekan sesuai dengan itu.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart