
OpenAI o3 vs DeepSeek V4 Pro: Era Penalaran Premium Berakhir di Titik Kesenjangan Harga Terbuka
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
Pertarungan antara OpenAI o3 dan DeepSeek V4 Pro sebenarnya adalah dua angka yang saling bertabrakan. OpenAI o3, yang dirilis pada 16 April 2025, adalah titik acuan untuk penalaran premium — model yang Anda bayar lebih ketika biaya jawaban yang salah lebih tinggi daripada biaya token. DeepSeek V4 Pro, yang menjadi GA sebagai build 0813 pada 13 Agustus 2026 setelah rilis malam yang tenang dan peluncuran yang mencakup pengumuman yang ditarik kembali serta bobot yang diunggah ulang, adalah model yang membuat premium itu tampak seperti kesalahan kategori: indeks independen yang berada di atas indeks o3, dengan harga kira-kira seperlima, ditambah bobot terbuka. Dan tabrakan ini berstempel waktu, karena OpenAI o3 meninggalkan ChatGPT pada 26 Agustus 2026, snapshot API-nya menyusul pada 11 Desember, dan setiap minggu perbandingan ini memihak model yang tidak akan pergi ke mana-mana.
Dua model yang dirilis berjarak satu tahun dan berbeda filosofi.
o3 adalah andalan penalaran murni: model tertutup yang dilatih untuk berpikir lama sebelum menjawab, dengan jendela konteks 200K, output hingga 100K, dan input gambar yang digabungkan ke dalam rantai pemikirannya. Menurut angka OpenAI sendiri, model ini menetapkan standar 2025 — 96,7% pada AIME 2024, 87,7% pada GPQA Diamond, 69,1% pada SWE-bench Verified tanpa scaffolding, dan Elo Codeforces 2727 — dan OpenAI kemudian memangkas harganya dari $10/$40 menjadi $2/$8 per juta token, yang masih berlaku hingga kini. DeepSeek V4 Pro adalah ekonomi yang sama sekali berbeda: model campuran-para-ahli dengan 1,6 triliun parameter, sekitar 49 miliar aktif per token, jendela konteks 1 juta token, output maksimal 384K, input hanya teks, dan — baru dengan build GA 0813 — tumpukan pasca-pelatihan yang dibangun ulang plus integrasi API Respons dan Codex asli yang membuat skor agennya melonjak dari 12,8 pada versi pratinjau menjadi 62,7 di DeepSWE. Model ini juga bersifat bobot terbuka: checkpoint DeepSeek-V4-Pro-0813 dapat diunduh di Hugging Face di bawah lisensi MIT, setelah 24 jam pertama yang kacau dengan spanduk rilis yang ditarik dan bobot yang sempat 404 sebelum daftar ulang konfigurasi yang dikoreksi.
Kesenjangan biaya dalam angka nyata
Kartu tarif sudah banyak berbicara sendiri:
• OpenAI o3 — $2,00 per juta input, $8,00 per juta output, $0,50 untuk input yang di-cache. Token penalaran ditagih sebagai output, sehingga pertanyaan sulit menghabiskan token berpikir sebelum jawabannya.
• DeepSeek V4 Pro — $0.435 per juta input (cache miss), $0.003625 cache hit, $0.87 per juta output hari ini. Output kira-kira 4.6× lebih murah daripada o3, input cache-hit secara efektif gratis.
Catatan tambahan dengan tanggal tertentu — kenaikan harga DeepSeek yang dijadwalkan pada 17 Agustus mengubah output V4 Pro dari 6 yuan menjadi 27 yuan per juta pada jam sibuk (13,5 di luar jam sibuk) dan input cache-miss dari 3 menjadi 9 yuan. Bahkan pada tarif puncak baru, outputnya hanya sebagian kecil dari $8 milik o3. Jendela waktu untuk membangun dengan tarif saat ini hanya hitungan hari, yang dengan sendirinya menjadi bagian dari kalkulasi migrasi.
Ekonomi per-jawaban-benar mempertajam poin tersebut. Token penalaran tersembunyi o3 berarti biaya riil per jawaban sulitnya adalah beberapa kali lipat dari tarif output-nya. DeepSeek V4 Pro juga melakukan penalaran, dan pemikirannya juga ditagih sebagai output, tetapi dengan $0.87, biaya absolutnya hanyalah kesalahan pembulatan dibandingkan dengan sesi o3 yang berpikir selama satu setengah menit. Pembingkaian biaya-agen yang digunakan DeepSeek saat peluncuran — sekitar kesenjangan harga 45× per tugas dibandingkan frontier tertutup — melebih-lebihkan terhadap o3 secara khusus, tetapi arahnya tidak diperdebatkan: ini adalah kesenjangan 4–10× dalam biaya efektif tergantung pada beban kerja.
Di mana kesenjangan kualitas sebenarnya berada
Skor yang paling penting adalah yang independen. Pada Intelligence Index milik Artificial Analysis, DeepSeek V4 Pro mencatatkan 53 dan berada di peringkat #2 dari 104 model yang saat ini tercantum dalam indeks tersebut; o3 berada di sekitar 30 — selisih lebih dari 20 poin pada pengujian yang sama. Itulah ringkasan paling jelas mengenai posisi unggulan penalaran premium setelah dua tahun kemajuan: ia tidak lagi sekadar dikalahkan dari segi harga; ia dikalahkan pada agregat independen.
Gambaran per-benchmark lebih rumit dan membutuhkan label yang jujur. Angka unggulan agen DeepSeek V4 Pro — Terminal-Bench 2.1 di 87,9, CyberGym di 83,3, DeepSWE di 62,7, AutomationBench di depan model frontier tertutup — adalah klaim DeepSeek sendiri dari peluncuran 0813, belum direproduksi secara independen hingga tulisan ini dibuat, dan episode konfigurasi yang salah dalam peluncuran tersebut berarti tidak ada yang bisa memastikan bahwa API menyajikan bobot final yang telah dikoreksi ketika angka pihak ketiga awal dikumpulkan. Benchmark peluncuran o3 juga sama-sama dilaporkan vendor, tetapi sebagian tervalidasi oleh pengujian ulang independen pada 2025, ketika o3 benar-benar memimpin papan peringkat penalaran. Pada matematika dan penalaran murni, catatan publik o3 masih terlihat lebih baik daripada DeepSeek V4 Pro — kekuatan DeepSeek ada pada penggunaan alat agen, coding, dan tugas berhorizon panjang, yang merupakan rangkaian pengujian yang berbeda dari olimpiade matematika yang didominasi o3.

Apa yang masih lebih baik dilakukan o3
Dua hal tetap utuh dalam perbandingan ini. Pertama, matematika dan penalaran yang cermat: AIME 96,7% dan GPQA 87,7% milik o3 masih berada di atas apa pun yang telah dipublikasikan DeepSeek V4 Pro, dan jika beban kerja Anda adalah pembuktian yang sulit atau soal kompetisi, o3 — selama masih berjalan — adalah jawaban yang lebih aman. Kedua, penalaran gambar: o3 dapat berpikir tentang tangkapan layar atau diagram di dalam rantai pikirnya, sedangkan DeepSeek V4 Pro hanya berupa teks; build 0813 tidak menambahkan encoder visi, dan jika tugas Anda membutuhkan model untuk membaca gambar, DeepSeek V4 Pro bukan pengganti o3 dalam hal tersebut. Tidak ada satu pun keunggulan itu yang menjadi alasan untuk bertahan pada model yang pensiun, tetapi keduanya adalah alasan untuk jujur bahwa migrasi ini bukan peningkatan murni.
Hal lain yang perlu diperhatikan adalah perbedaan bobot terbuka, yang sama sekali bukan tolok ukur. o3 bersifat tertutup dan kini sedang dikonsolidasikan hingga lenyap; Anda tidak dapat terus menjalankannya di perangkat keras Anda sendiri. Checkpoint 0813 DeepSeek V4 Pro adalah milik Anda secara permanen, berlisensi MIT — bobot yang sama, model 1,6 triliun parameter yang sama, dapat di-host sendiri jika Anda memiliki perangkat keras sekitar 1,5 terabyte untuk itu. Bagi tim yang pernah terbakar karena bergantung pada model tertutup yang dapat dipensiunkan vendor, itu adalah jawaban struktural atas masalah yang justru muncul dari pensiunnya o3.
Memigrasi beban kerja
Bagi tim API yang baru saja beralih dari o3, DeepSeek V4 Pro adalah tempat paling murah untuk mendarat dan, pada pekerjaan agenik dan coding yang sebenarnya merupakan sebagian besar penggunaan API, jarang sekali menjadi penurunan kualitas. Jebakan sebenarnya bersifat operasional, bukan kualitas: V4 Pro dibatasi maksimal 500 permintaan bersamaan di API resmi—batas yang akan Anda tembus dengan armada agen—dan harganya berubah pada 17 Agustus. Kedua hal tersebut justru yang menjadi fungsi lapisan routing.
Di OrcaRouter, DeepSeek V4 Pro dilayani dengan harga daftar penyedia yang diteruskan tanpa markup (0%) — jadi $0.44/$0.87 hari ini sudah aktif di sini pada hari yang sama saat aktif di DeepSeek, dan ketika jadwal puncak/off-peak 17 Agustus tiba, hal itu juga tercermin di sini pada hari yang sama. Satu kunci juga menjangkau sisa kohort pengganti o3 ini, dan failover otomatis adalah solusi yang tepat untuk batas konkurensi 500: arahkan jalur produksi ke V4 Pro plus model kedua pada kunci yang sama, dan biarkan router yang menyerap batas atasnya. OpenAI o3 sendiri tidak ada di kunci itu — ia tetap tersedia melalui API OpenAI sendiri dan beberapa platform pihak ketiga hingga batas waktu snapshot 11 Desember.

Siapa yang diunggulkan matematika
Bagi siapa pun yang beban kerja o3-nya adalah pengkodean, loop agen, atau pemrosesan konteks panjang, perhitungannya tidak berdekatan: DeepSeek V4 Pro mengungguli o3 pada indeks independen, biayanya hanya sebagian kecil, dan bobot terbukanya berarti ketergantungan khusus ini tidak dapat dipensiunkan begitu saja dari bawah kaki Anda. Tim yang memiliki alasan sejati untuk mempertahankan o3 saat ini adalah yang sempit — penalaran matematika murni yang sulit, dan apa pun yang dibangun di atas pemikiran gambar o3 — dan bahkan itu pun harus menguji pengganti terhadap beban kerja nyata sebelum Desember, karena tenggat waktu tidak peduli dengan kasus pojok Anda. Era penalaran premium yang didefinisikan o3 berakhir dengan pengumuman pensiunnya; DeepSeek V4 Pro kebetulan menjadi tempat duduk termurah di era berikutnya.

Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
