Kartu judul hero bertuliskan "GPT-6 vs DeepSeek V4 Pro", dengan chip bertuliskan "GPT-6 di ChatGPT untuk semua orang 2026-10-07", dua baris harga bertuliskan "GPT-6 Sol $2 / $10" dan "DeepSeek V4 Pro $0.66 / $1.98 puncak", chip bertuliskan "DeepSeek: bobot MIT, output maks 384K", dan footer bertuliskan "Item yang dilaporkan vendor diberi label dalam teks; angka indeks menurut Artificial Analysis." Logo OrcaRouter dikomposisikan di sudut kanan bawah.
Guides & Insights

GPT-6 vs DeepSeek V4 Pro: Yang Satu Bisa Anda Sewa dari Siapa Saja, yang Lain Bisa Anda Bawa Pulang

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

There is exactly one thing you can do with DeepSeek V4 Pro that you cannot do with GPT-6 Sol: take it home. DeepSeek V4 Pro is an MIT-licensed mixture-of-experts flagship — 1.6 trillion total parameters, 49 billion active per token — released on 13 August 2026, and the checkpoint is downloadable. GPT-6 Sol is closed weights, shipped by Ope​nAI on 22 September 2026, and as of 7 October 2026 it is also the model sitting under the paid tiers of ChatGPT's global rollout to more than 1.2 billion weekly users.

Segala hal lain dalam perbandingan ini bergantung pada meter mana yang Anda baca. Pada kartu tarif, keduanya terpaut empat kali. Pada biaya aktual untuk menghasilkan jawaban jadi pada suite independen, keduanya terpaut 1,55×. Pada Intelligence Index, baris-barisnya tampak terpaut enam belas poin dan, menurut metodologi terdokumentasi evaluator itu sendiri, sama sekali tidak dapat dikurangkan. Menentukan angka mana dari ketiga angka itu yang seharusnya memandu keputusan adalah inti persoalannya, dan jawabannya berbeda bergantung pada apakah Anda memilih vendor atau memilih file.

Apa itu tiap model, masing-masing dalam satu paragraf.

GPT-6 Sol is the middle tier of Ope​nAI's GPT-6 line — below the GPT-6 Astra flagship, above the budget GPT-6 Luna — with a 1,050,000-token context window, a 128,000-token output ceiling, text, image and file input, native tool calling, structured outputs, and reasoning effort selectable across five levels from low to max. It is the tier Ope​nAI routes ChatGPT Plus, Pro, Business and Enterprise to, and it is priced at $2.00 per million input tokens and $10.00 per million output, with a long-context tier that reprices the whole request at $4.00 and $15.00 once the prompt passes 272,000 input tokens.

DeepSeek V4 Pro is a text-only flagship with a 1,048,576-token window and a 384,000-token maximum output — three times GPT-6 Sol's ceiling — and no vision at any price. Dee​pSeek's own API documentation lists it at $0.66 per million input tokens and $1.98 per million output during peak hours, halved to $0.33 and $0.99 off-peak, with cache hits at $0.022 off-peak. Peak hours are 01:00–04:00 and 06:00–10:00 UTC on weekdays; everything else, including weekends and Chinese public holidays, is off-peak.

Tiga meter

Mulailah dengan yang paling banyak dikutip, karena itulah yang paling sering dikutip tanpa konteksnya. Artificial Analysis memberi skor DeepSeek V4 Pro 36,0 dan GPT-6 Sol 47,6 pada Intelligence Index v4.3.2. Sebelas setengah poin adalah jenis selisih yang mengakhiri sebuah perbandingan.

Tidak seharusnya begitu, dan evaluatornya sendiri mengatakan demikian. Artificial Analysis hanya membandingkan model berbobot terbuka dengan model berbobot terbuka lain di kelas ukuran yang sama, dengan batas 150 miliar parameter, serta model proprietary di sepanjang rentang harga pada rasio gabungan input-ke-output 3:1. Itu adalah dua kelompok pembanding yang berbeda yang menghasilkan dua skala yang berbeda. Angka 36 dan 47,6 yang berada di baris berdampingan pada tabel yang sama bukanlah perbandingan langsung, dan langkah yang jujur adalah mengatakan itu alih-alih mengurangkan satu dari yang lain lalu menyebutnya kemampuan.

A screenshot of the Artificial Analysis leaderboard showing the rows around DeepSeek V4 Pro, with MiMo-V2.6-Flash at 38 and $0.06 per index task, Claude Haiku 5.5 (high) at 38 and $0.08, and DeepSeek V4 Pro 0813 (max) at 36 and $0.67, each row carrying its creator, index, cost per task, output speed and latency columns.

Dua meteran yang sebanding mengatakan sesuatu yang lebih berguna:

• Harga campuran pada rasio 3:1 — GPT-6 Sol $4.00 per 1M vs DeepSeek V4 Pro $0.99 pada tarif puncak, atau $0.50 di luar jam puncak; selisih 4× hingga 8× tergantung kapan Anda menjalankannya
• Biaya per tugas indeks yang diselesaikan — GPT-6 Sol $1.04 vs DeepSeek V4 Pro $0.67; selisih 1.55×
• Token keluaran yang dihasilkan di seluruh rangkaian uji — GPT-6 Sol 76.8M vs DeepSeek V4 Pro 162.9M, jadi model murah menulis 2.1× lebih banyak untuk menyelesaikan pekerjaan yang sama
• Keluaran maksimum — DeepSeek V4 Pro 384,000 token vs GPT-6 Sol 128,000; batas atas 3×
• Input multimodal — GPT-6 Sol menerima teks, gambar, dan berkas vs DeepSeek V4 Pro hanya teks
• Bobot — DeepSeek V4 Pro berlisensi MIT dan dapat diunduh vs GPT-6 Sol tertutup

A two-column comparison scoreboard for GPT-6 Sol and DeepSeek V4 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against DeepSeek V4 Pro at 36.0, $0.67 and 384,000 tokens, with input and output prices of $2.00/$10.00 against $0.66/$1.98 and an MIT-weights row. A footer reads "Index figures per Artificial Analysis v4.3.2; row scored in different peer groups, not subtractable."

Baris keempat dan kelima menjelaskan yang kedua. Selisih utama 4× yang menyusut menjadi 1,55× pada pekerjaan nyata adalah hal yang terjadi ketika model yang lebih murah juga lebih bertele-tele: DeepSeek V4 Pro mengeluarkan token keluaran 2,1× lebih banyak daripada yang dikeluarkan GPT-6 Sol pada rangkaian evaluasi yang sama. Bertele-tele adalah pengganda biaya yang tidak pernah muncul di halaman harga, dan itulah angka yang paling kurang diperhatikan dalam perbandingan ini.

Di mana model terbuka benar-benar menang

Dua tempat, dan keduanya bersifat struktural, bukan marginal.

Batas keluaran adalah yang pertama. 384.000 token berbanding 128.000 adalah perbedaan tiga kali lipat, dan itu menentukan seluruh kategori pekerjaan: menghasilkan artefak terstruktur besar dalam satu panggilan, menulis dokumen panjang tanpa perantaian, menghasilkan refaktor besar sebagai satu respons. GPT-6 Sol tidak dapat melakukan hal-hal itu berapa pun harganya, karena batasnya bukanlah tingkat penagihan — melainkan maksimum model.

Agentic tool use is the second, on one specific measurement. DeepSeek V4 Pro scores 96.2% on τ²-Bench, the agentic tool-use evaluation, and that is the figure Dee​pSeek leads its own card with. It is also the number the model's OrcaRouter catalogue entry repeats, which is the version of the claim our own readers would meet. GPT-6 Sol's comparable τ²-Bench figure is not published on the same board, so treat the comparison as directional: on the one benchmark Dee​pSeek chose to headline, the open model is at the top of the field, and the closed model has not put a number in the same column.

Dan soal kepemilikan, yang sama sekali bukan tolok ukur. Checkpoint MIT yang dapat diunduh berarti Anda dapat menjalankan model di perangkat keras sendiri, menjaga agar permintaan tidak melewati jaringan pihak mana pun, melakukan fine-tuning atasnya, mengunci versi, dan tahu bahwa versi itu akan tetap ada tiga tahun dari sekarang. Tidak ada vendor yang dapat menghentikan dukungannya, menetapkan ulang harganya, atau menghapusnya dari daftar tarif. Bagi golongan pembeli tertentu — industri teregulasi, siapa pun yang memiliki kendala residensi data, siapa pun yang pernah dirugikan oleh penghentian model — itu bernilai lebih dari sebelas poin indeks.

Di mana GPT-6 Sol menang, dan bukan hanya soal indeks

Terminal-Bench 4.0 adalah baris paling tidak menyanjung pada kartu DeepSeek V4 Pro: 14,1% berbanding 43,9% milik GPT-6 Sol. Itu bukan perbedaan pembulatan dan menunjukkan profil yang nyata — model terbuka ini kuat dalam orkestrasi alat multi-giliran dan lemah dalam pekerjaan terminal jangka panjang yang menjadi bahan dasar agen pengodean modern. Jika beban kerja Anda adalah agen yang harus menjaga sesi shell tetap utuh selama dua puluh menit, evaluasi tunggal ini lebih prediktif terhadap pengalaman Anda daripada komposit indeks.

Multimodalitas adalah yang kedua. DeepSeek V4 Pro adalah teks masuk, teks keluar. GPT-6 Sol menerima gambar dan file, dan itu bukan sekadar kotak centang fitur — pekerjaan profesional yang padat dokumen mencakup tangkapan layar, halaman hasil pemindaian, diagram, dan PDF, dan model yang hanya teks sama sekali tidak dapat masuk ke kategori itu.

The third is the thing that happened this week. GPT-6 landed in ChatGPT's Chat tab for Plus, Pro, Business and Enterprise on 7 October, with Free and Go following from 8 October, carrying a capability Ope​nAI calls Intelligent UI — answers that compose text, graphics, charts, forms and tappable controls per question rather than defaulting to prose. That is a surface, not an API feature, and it does not change a line of your integration code. What it does change is the ambient default: the model your team already has open in a browser tab is now GPT-6, and prototype work drifts toward the model it can reach without a key. Vendor-reported and unreproduced, Ope​nAI also claims GPT-6 at Extra High begins answering as fast as GPT-5.6 at Medium, and that GPT-6 Instant starts answering 44% sooner on search-backed questions.

Menjalankan satu, atau menjalankan keduanya

The reason this particular pairing is easier to hedge than most is that both models sit on the same catalogue. OrcaRouter routes GPT-6 Sol and DeepSeek V4 Pro — along with 200-plus other models — through one Ope​nAI-compatible endpoint on one key, at 0% markup over the provider's list price. That pass-through is what makes the peak/off-peak structure legible rather than mysterious: Dee​pSeek's off-peak halving is the vendor's, we do not touch it, and when a vendor reprices, the change is live here the same day.

Di sinilah juga keputusan jendela puncak menjadi keputusan perutean. Tarif off-peak DeepSeek V4 Pro adalah setengah dari tarif puncaknya, dan jendela puncak adalah jam UTC yang tetap. Pekerjaan batch yang bisa digeser layak dijadwalkan di sekitar jendela tersebut, dan jalur yang sensitif terhadap latensi layak dijauhkan darinya. Dengan kedua model di balik satu kunci, pembagiannya adalah konfigurasi, bukan kontrak vendor kedua: rutekan pekerjaan massal dan keluaran panjang ke DeepSeek V4 Pro pada off-peak, rutekan lalu lintas multimodal dan yang berat penalaran ke GPT-6 Sol, dan biarkan failover otomatis menangani batas laju di salah satu sisi alih-alih menemukannya di produksi.

A screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 release date, a 1.05M-token context window, a 128K-token maximum output, text, image and file input and tool calling, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

Apa yang sebenarnya akan saya lakukan

Jika Anda memerlukan gambar, file, atau skor penalaran mutakhir dan Anda sedang membeli API, GPT-6 Sol adalah jawabannya, dan sebelas poin indeks itu sebagian besar bukan intinya — gerbang multimodal sudah memutuskannya sebelum benchmark ikut memberi suara. Jika Anda memerlukan keluaran 384.000 token, lisensi yang bisa Anda simpan, penerapan on-premise, atau biaya per tugas selesai terendah di papan peringkat, DeepSeek V4 Pro menang dan selisih indeks adalah urusan kelompok pembanding pihak lain.

Yang tidak akan saya lakukan adalah membaca 36 terhadap 47,6 sebagai kesenjangan kemampuan lalu membeli berdasarkan itu. Meter yang sebanding — $0,67 terhadap $1,04 per tugas, dan perbedaan verbositas 2,1× yang tersembunyi di dalam selisih utama 4× — memberi gambaran yang jauh lebih mendekati daripada baris-baris indeks, dan itulah yang muncul di faktur.

The thing to watch next is whether Dee​pSeek closes the Terminal-Bench gap in a V4 Pro refresh, since that is the one measurement where the open model looks genuinely behind rather than differently scored. GPT-6, for its part, just stopped being a choice and became a default, and defaults are hard to argue with even when the benchmark says otherwise.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari