
GPT-6.1 Sol vs DeepSeek V4 Pro: Tiga Meter, Tiga Jawaban Berbeda
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Tanyakan seberapa jauh perbedaan GPT-6.1 Sol dan DeepSeek V4 Pro, dan jawaban jujurnya adalah bahwa itu tergantung pada meter mana yang Anda baca, dan ketiga meter itu saling berselisih lebih besar daripada perselisihan sebagian besar perbandingan model tentang apa pun. Dalam hal harga per juta token, dengan campuran rasio input-ke-output 3:1, keduanya $4,00 berbanding $0,99 — faktor empat. Dalam hal biaya aktual untuk menjalankan rangkaian evaluasi yang sama, keduanya $0,72 berbanding $0,67 per tugas — tujuh persen. Pada Artificial Analysis Intelligence Index, keduanya 51,8 berbanding 36 — enam belas poin, yang terdengar menentukan sampai Anda melihat dengan apa setiap angka dibandingkan, karena metodologi evaluator itu sendiri menempatkan kedua model di liga yang berbeda. GPT-6.1 Sol dirilis pada 29 September 2026 dengan harga $2,00 untuk input dan $10,00 untuk output dengan jendela 1.050.000 token. DeepSeek V4 Pro adalah model unggulan mixture-of-experts berlisensi MIT, 1,6 triliun parameter dengan 49 miliar aktif, dirilis pada 13 Agustus 2026 dengan harga $0,66 dan $1,98 dengan jendela 1.048.576 token. Satu di antaranya adalah model teks yang dapat Anda unduh. Yang lain dapat melihat gambar. Menentukan meter mana dari ketiga meter itu yang sebenarnya harus Anda jadikan pedoman adalah inti dari seluruh pekerjaan ini.
Baris indeks bukanlah perbandingan seperti yang terlihat
Mulailah dengan angka yang paling sering dikutip, karena angka itulah yang paling sering dikutip secara keliru.
Artificial Analysis menerbitkan metodologinya bersama papan peringkatnya, dan dua kalimat di dalamnya penting di sini. Model open-weights, katanya, hanya dibandingkan dengan model open-weights lain dari kelas ukuran yang sama — tiny, small, medium, large, dengan batas pada 150 miliar parameter. Model proprietary justru dibandingkan lintas rentang harga, dengan rasio campuran 3:1 input-ke-output. Itu adalah dua kelompok pembanding yang berbeda. DeepSeek V4 Pro 0813 adalah open-weights — FAQ milik penilai sendiri menyatakannya, dan menunjuk pada bobot yang dipublikasikan — dan dengan total 1,6 triliun parameter, ia masuk ke kelas large open-weights. GPT-6.1 Sol bersifat proprietary dan dinilai terhadap model-model di rentang harganya sendiri.
Angka 51,8 dan 36 yang berada di baris-bersebelahan pada tabel yang sama karenanya bukanlah adu langsung. Keduanya adalah skor terhadap satu kelompok pembanding dan skor terhadap kelompok pembanding lain, dan justru itulah sebabnya angka biaya per tugas bisa dibandingkan sedangkan angka indeks mentahnya tidak. Jika Anda ingin tahu apakah DeepSeek V4 Pro bagus untuk model yang dapat diunduh, 36 adalah angka yang menjawabnya. Jika Anda ingin tahu bagaimana performanya terhadap model garis depan yang dihosting, kolom indeks tidak akan memberi tahu Anda, dan ini adalah kasus ketika langkah yang jujur adalah mengatakan hal itu alih-alih mengurangi 36 dari 51,8 dan menyebutnya sebagai selisih.
Apa yang dapat dibandingkan secara bersih: kartu harga, batas konteks dan output, daftar modalitas, dan biaya menjalankan rangkaian evaluasi yang sama — karena angka terakhir itu adalah perhitungan kerja yang identik, bukan skor.
Apa kata meteran mentah

• Harga input — GPT-6.1 Sol $2,00 vs DeepSeek V4 Pro $0,66 per juta token
• Harga output — GPT-6.1 Sol $10.00 vs DeepSeek V4 Pro $1.98, berubah menjadi $1.32 dan $3.96 di dalam dua jendela UTC empat jam pada hari kerja
• Pembacaan cache — GPT-6.1 Sol $0,10 vs DeepSeek V4 Pro $0,022 per juta token; keduanya melakukan cache, dan sisi murahnya 4,5× lebih murah lagi
• Biaya per tugas indeks — GPT-6.1 Sol $0.72 vs DeepSeek V4 Pro $0.67
• Token keluaran yang dikeluarkan pada suite indeks — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M
• Output maksimum — DeepSeek V4 Pro 384.000 token vs GPT-6.1 Sol 128.000 token
• Modalitas — GPT-6.1 Sol menerima teks, gambar, dan file; DeepSeek V4 Pro hanya menerima teks
Baris keempat dan kelima adalah pasangan yang menarik. DeepSeek V4 Pro mengeluarkan 2,4 kali lebih banyak token pada suite yang sama dan tetap 7% lebih murah per tugas, karena laju outputnya seperlima dari GPT-6.1 Sol. Seperti itulah bentuk model yang digerakkan oleh harga ketika Anda mengukur output, bukan laju: verbositasnya nyata, dan itu tidak menghapus keunggulannya. Jendela waktu adalah catatan pentingnya. Dua blok empat jam pada hari kerja — 40 dari 168 jam dalam seminggu — menggandakan tarif yang tertera menjadi $1,32 dan $3,96, dan biaya tambahan itu berlaku untuk token yang sama yang jika tidak, akan menjadi yang termurah di kedua kartu.
Apa yang tidak dilakukan oleh model yang lebih murah
Tiga hal, dan masing-masing merupakan batas mutlak, bukan kompromi.
Ia tidak dapat melihat. DeepSeek V4 Pro adalah teks masuk, teks keluar. Tidak ada tangkapan layar, tidak ada PDF hasil pemindaian, tidak ada pembacaan bagan, tidak ada diagram di dalam tiket. Alur kerja yang banyak menggunakan komputer dan berat dokumen — beban kerja yang persis disasar GPT-6.1 Sol — sama sekali tidak bisa dipertimbangkan, berapa pun harganya. Jika pipeline Anda sudah mengarahkan gambar ke model visi, ini bukan masalah; jika tidak, ini adalah kendala penentu.
Itu tidak memiliki irama rilis yang bisa Anda jadikan dasar perencanaan. Nama "deepseek-v4-pro" telah mengarah ke build 0813 sejak Agustus, dan perjalanan menuju ke sana tidak berlangsung tenang: vendor mengumumkan pensiunnya build tersebut untuk 14 September, menarik kembali pengumuman itu dua hari sebelum tanggal tersebut, dan tetap melayani API dengan penagihan yang tidak berubah. Katalog kami sendiri masih mencantumkannya sebagai unggulan dengan konteks, batas output, dan batas konkurensi yang sama. Vendor yang bisa menarik kembali pengumuman penghentian dalam dua hari juga bisa menolak menariknya kembali; pelajaran operasionalnya bukanlah bahwa modelnya tidak stabil, melainkan bahwa namanya hanyalah penunjuk, dan menyematkan perilaku pada pengenal build alih-alih nama rute adalah asuransi murah.
Ini tidak membawa pengetahuan di sekitarnya. GPT-6.1 Sol baru berusia delapan hari dan sudah memiliki satu konfigurasi independen yang dipublikasikan; DeepSeek V4 Pro memiliki riwayat evaluasi yang lebih panjang dan basis praktisi yang jauh lebih besar, termasuk stack penyajian yang dipublikasikan dan pekerjaan throughput pihak ketiga. Untuk deployment yang dihosting sendiri, kumpulan materi itu lebih berharga daripada baris indeks, karena itulah yang Anda konsultasikan ketika model berperilaku aneh pada perangkat keras Anda alih-alih pada tolok ukur.
Ketika meteran yang empat kali lebih murah adalah meteran yang salah
Jika model murah itu sekadar lebih buruk dalam segala hal, ini akan menjadi artikel yang pendek. Fakta yang menyulitkan adalah bahwa keduanya berbeda 7% per tugas pada pekerjaan yang identik, dan berbeda 2,4× dalam seberapa banyak yang mereka tulis untuk mencapainya. Itu berarti pengukur token campuran — yang menyebut 4× — mengukur perbedaan yang sebagian besar tidak Anda bayar, karena ia memberi harga pada campuran token yang mungkin tidak pernah Anda kirim. Dan pengukur indeks, yang menyebut 16 poin, mengukur pada dua kelompok pembanding dan tidak dapat dikurangkan.
Jadi, pembagian praktisnya bukanlah "model terdepan untuk pekerjaan berat, model murah untuk pekerjaan ringan." Ini adalah pemisahan berdasarkan modalitas dan pemisahan berdasarkan volume. Apa pun yang mengandung gambar ditangani oleh GPT-6.1 Sol, begitu pula apa pun yang jawabannya singkat dan penalarannya adalah bagian yang mahal — lima tingkat upayanya, dari low hingga max dengan medium sebagai default, memungkinkan Anda membeli penalaran tanpa membeli prosa, dan input yang di-cache seharga $0.10 membuat prompt panjang yang berulang menjadi murah. Apa pun yang hanya teks, bervolume tinggi, dan toleran terhadap jawaban yang lebih panjang — klasifikasi, ekstraksi, peringkasan, pembuatan massal dengan anggaran output 384.000 token — ditangani oleh DeepSeek V4 Pro, idealnya di luar dua jendela UTC.
Keduanya pada satu tombol, dan pemisahannya adalah baris konfigurasi
Kedua model tersedia di OrcaRouter dengan tarif resmi yang dipublikasikan masing-masing penyedianya, tanpa tambahan apa pun: GPT-6.1 Sol seharga $2.00 / $10.00, naik menjadi $4.00 / $15.00 di atas 272.000 token prompt, dan DeepSeek V4 Pro seharga $0.66 / $1.98 dengan dua jendela waktu yang tetap berlaku seperti tercantum. Satu kunci, satu tagihan, satu endpoint yang kompatibel dengan OpenAI untuk keduanya.
Itulah alasan pemisahan di atas layak dituliskan alih-alih diperdebatkan. Pemisahan modalitas dapat dinyatakan sebagai aturan perutean, sehingga permintaan yang membawa gambar dialihkan ke model visi dan teks dalam jumlah besar dialihkan ke model murah tanpa perubahan aplikasi; jika suatu rute menurun kualitasnya, failover memindahkan panggilan alih-alih menggagalkannya. Dan karena keduanya berada di endpoint yang sama, perbandingan harga yang benar-benar penting — milik Anda, pada lalu lintas Anda, pada komposisi token Anda — dapat dihasilkan dari faktur Anda sendiri alih-alih dari rata-rata rangkaian tolok ukur.


Putusannya, dalam satu baris, adalah bahwa pembacaan empat kali lebih murah adalah yang harus dicurigai, dan pembacaan tujuh persen adalah yang perlu diperiksa. Empat kali adalah apa yang dikatakan meter campuran tentang campuran token yang mungkin tidak Anda kirim. Tujuh persen adalah biaya evaluasi yang sama pada keduanya, dan itu disertai perbedaan verbositas 2,4× yang sudah melekat di dalamnya. Enam belas poin itu nyata, tetapi juga tersebar di dua kelompok sejawat, dan batasan yang sebenarnya menentukan sebagian besar penerapan pasangan ini sama sekali bukan angka: salah satu dari model ini dapat membaca tangkapan layar dan yang lain tidak.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
