Papan skor perbandingan dua kolom yang dihasilkan dengan judul 'GPT-6.1 Sol vs GPT-6 Luna - papan skor'. Kolom kiri 'GPT-6.1 Sol': baris-baris berbunyi 'Indeks Kecerdasan: 51.8', 'Biaya per tugas indeks: $0.72', 'Harga per 1 juta: $2.00 / $10.00', 'Token keluaran pada proses indeks: 67J', 'Terminal-Bench 4.0: 56.1%', 'Batas bawah upaya: rendah'. Kolom kanan 'GPT-6 Luna': baris-baris berbunyi 'Indeks Kecerdasan: 38.1', 'Biaya per tugas indeks: $0.07', 'Harga per 1 juta: $0.10 / $0.50', 'Token keluaran pada proses indeks: 144J', 'Terminal-Bench 4.0: 12.6%', 'Batas bawah upaya: tidak ada'. Kaki halaman berbunyi 'Angka independen menurut Artificial Analysis v4.3.2 pada upaya maksimal; harga daftar vendor.'
Guides & Insights

GPT-6.1 Sol vs GPT-6 Luna: Tiga Belas Poin Indeks, Sepuluh Kali Biaya, dan Dua Evaluasi yang Tidak Berlaku

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Open​AI merilis GPT-6.1 Sol pada 29 September 2026, satu minggu setelah GPT-6 Lunahadir pada 22 September dalam siklus keynote yang sama. Keduanya adalah dua ujung dari generasi yang sama: Luna adalah tier murah, Sol adalah tier menengah di atasnya, dan GPT-6 Astra berada di atas keduanya. Selisih harga antara keduanya mencapai satu orde besaran — $0,10 dan $0,50 per juta token versus $2,00 dan $10,00, input cache $0,01 versus $0,10 — dan selisih kemampuannya di papan independen adalah 13,7 poin Intelligence Index, 51,8 versus 38,1 pada upaya penalaran maksimum. Sepuluh kali lipat biaya untuk tiga belas poin kira-kira merupakan nilai tukar terburuk dalam jajaran Open​AI saat ini. Yang membuat perbandingan ini layak ditulis adalah pertanyaan empat puluh dolar yang menyusul: tiga belas poin yang mana?

Dua model itu, dan sepekan di antara keduanya

GPT-6 Luna adalah model kecil dari generasi GPT-6 — model yang digambarkan OpenAI sebagai dirancang untuk pekerjaan bervolume tinggi dan sensitif terhadap latensi: klasifikasi, ekstraksi, perutean, peringkasan massal, lingkaran dalam sebuah agen. Model ini membawa jendela konteks 1.050.000 token dan batas keluaran 128.000 token, menerima teks, gambar, dan berkas sebagai masukan, serta mempertahankan tangga upaya enam tingkat secara penuh termasuk none, yang dihapus pada tingkat 6.1. Daftar tarifnya adalah alasan model ini ada: $0,10 untuk masukan dan $0,50 untuk keluaran per juta token, masukan cache $0,01 dan penulisan cache $0,125, dengan kenaikan konteks panjang di atas 272.000 token masukan menjadi $0,20, $0,75, dan $0,02 untuk cache.

GPT-6.1 Sol adalah penyegaran kelas menengah yang dirilis seminggu kemudian. Jendela yang sama, batas output yang sama, modalitas input yang sama, batas pengetahuan 30 April 2026 dibandingkan dengan milik Luna, dan jenjang upaya yang dimulai dari rendah karena tidak ada dan minimal ditolak mentah-mentah. Harganya $2.00 dan $10.00 dengan input yang di-cache sebesar $0.10 — dua puluh kali tarif input Luna dan dua puluh kali tarif outputnya, dengan baris cache yang sepuluh kali lebih mahal per hit.

Keduanya dijual, keduanya ada di ChatGPT Work dan Codex serta API, dan keduanya dapat dipanggil melalui kunci yang sama di sisi kami. Tidak ada apa pun tentang pasangan ini yang mengharuskan untuk memilih.

Apa yang sebenarnya bisa dibeli oleh tiga belas poin indeks

Composite adalah angka yang paling tidak informatif dalam perbandingan ini, karena ia merata-ratakan tugas-tugas yang perilakunya sangat berbeda. Jika dinilai evaluasi demi evaluasi pada upaya penalaran maksimum di Artificial Analysis v4.3.2, bentuknya adalah perpecahan, bukan kemiringan:

• AA-LCR v1.1, penalaran konteks panjang — GPT-6 Luna 0,833 vs GPT-6.1 Sol 0,830. Luna sedikit lebih unggul.

• SciCode — GPT-6 Luna 0.546 vs GPT-6.1 Sol 0.542. Sekali lagi, secara efektif setara, dan sekali lagi model yang lebih murah secara nominal berada di depan.

• Terminal-Bench 4.0 — GPT-6 Luna 0.126 vs GPT-6.1 Sol 0.561. Selisih 43 poin; kedua model berada di liga yang berbeda dalam pekerjaan terminal.

• Humanity's Last Exam — GPT-6 Luna 0.385 vs GPT-6.1 Sol 0.529.

• AutomationBench-AA — GPT-6 Luna 0.532 vs GPT-6.1 Sol 0.649.

• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 vs GPT-6.1 Sol Elo 1575,1, selisih Elo 138 poin pada pekerjaan berbasis pengetahuan profesional.

• GDP.pdf — GPT-6 Luna 0.228 vs GPT-6.1 Sol 0.310.

• CritPt — GPT-6 Luna 0.194 vs GPT-6.1 Sol 0.317.

• AA-Omniscience — GPT-6 Luna 0,65 vs GPT-6.1 Sol 41,5. Pada skala di mana nol berarti jumlah jawaban benar sama banyak dengan jawaban salah, Luna berada tepat di garis air dan Sol berada secara signifikan di atasnya.

• MMMU-Pro — GPT-6 Luna 0,797 vs GPT-6.1 Sol 0,860.

• Biaya per tugas indeks, independen — GPT-6 Luna $0.068 vs GPT-6.1 Sol $0.72; selisih sekitar sepuluh kali lipat yang menguntungkan model murah

• Token keluaran pada uji indeks — GPT-6 Luna 144 juta vs GPT-6.1 Sol 67 juta, dibandingkan median kelas 100 juta untuk Luna dan sekitar 81 juta untuk Sol

Dua dari sepuluh evaluasi berakhir seri yang menguntungkan model murah. Delapan dimenangkan oleh yang mahal, dan pada enam dari delapan itu selisihnya bukanlah marginal. Itulah pembacaan jujur atas tiga belas poin: ini bukan gradien kualitas yang seragam, melainkan dua kemampuan — eksekusi agentik yang berkelanjutan dan keandalan faktual — di mana Luna jelas bukan kelas model yang sama, dan area tengah yang luas di mana perbedaannya nyata tetapi cukup kecil sehingga tak terlihat dalam set evaluasi Anda sendiri.

Hasil AA-LCR layak mendapat satu catatan, karena angka itulah yang paling menyanjung Luna. Penalaran konteks panjang di 0,833 adalah skor yang kuat dan kedua model berada dalam selisih setengah poin satu sama lain, tetapi tolok ukur ini mengukur pengambilan dan penalaran atas masukan panjang, bukan kemampuan untuk bertindak sepanjang sesi yang panjang. Selisih pada Terminal-Bench 4.0 adalah gambaran dari "bertindak sepanjang sesi yang panjang" ketika dinilai, dan besarnya 43 poin.

A generated hero card for a GPT-6.1 Sol versus GPT-6 Luna comparison, headed 'Thirteen index points, ten times the money', with two badges reading 'GPT-6.1 Sol: 51.8 at $2.00 / $10.00 per 1M' and 'GPT-6 Luna: 38.1 at $0.10 / $0.50 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

Aritmetika biaya per tugas, dan di mana hal itu tidak lagi benar

Artificial Analysis menetapkan harga setiap index run berdasarkan konsumsi token yang terukur, sehingga angka biayanya bukan inferensi dari daftar tarif. Run GPT-6 Luna memakan biaya $0,068 per tugas; biaya GPT-6.1 Sol $0,72. Rasionya 10,7×, yang hanya sedikit lebih buruk daripada rasio harga nominal dua puluh kali lipat karena Luna menghasilkan 144 juta token keluaran dalam run tersebut, dibandingkan 67 juta milik Sol — model murah itu lebih dari dua kali lebih cerewet, dan itu menggerus keunggulannya sendiri. Meski begitu, jarak peringkatnya tidak dekat, dan pada beban kerja jawaban singkat selisihnya akan melebar: volume keluaran yang lebih sedikit berarti penalti kecerewetan Luna menyusut sementara keunggulan harganya tetap.

Di mana aritmetika itu berhenti berlaku adalah pada beban kerja apa pun yang tidak mirip dengan indeks tersebut. Jika tugas Anda adalah pengeditan berskala repositori yang menuntut dua puluh pemanggilan alat tetap koheren, model $0,07 yang gagal menyelesaikan tugas akan menghabiskan seluruh putaran percobaan ulang plus waktu nyata, sedangkan model $0,72 yang selesai sekali justru lebih murah. Kerangka peluncuran GPT-6.1 Sol sendiri sepenuhnya dibangun di atas gagasan ini — biaya per selesai tugas — dan itulah kerangka yang benar: perbandingan yang relevan bukanlah tarif token, melainkan biaya yang diharapkan per hasil, dan pada tugas yang tidak dapat diselesaikan Luna, ekspektasi itu tidak terbatas.

Dua detail struktural mempertajam batas tersebut. Pertama, langkah konteks panjang: kedua model menetapkan harga ulang di atas 272.000 token masukan, Luna menjadi $0,20 dan $0,75, serta Sol menjadi $4,00 dan $15,00, sehingga selisih absolutnya melebar di batas tersebut alih-alih menutup, tetapi tarif Luna setelah penetapan harga ulang masih satu orde besaran di bawah tarif standar Sol. Kedua, dan mudah terlewat: tangga effort tidak memiliki bentuk yang sama. Luna menerima none; Sol tidak. Kaskade yang merutekan ke Sol terlebih dahulu dan melakukan fallback ke Luna saat error atau timeout tidak boleh membawa reasoning.effortmilik permintaan itu tanpa perubahan, karena konfigurasi yang legal pada satu model akan menghasilkan error pada model lainnya. Itu adalah urusan lapisan perutean, bukan urusan kualitas model, dan justru hal semacam itulah yang seharusnya diserap oleh satu endpoint dengan aturan perutean.

Menjalankan keduanya adalah intinya, bukan sekadar langkah berjaga-jaga.

Kedua model tersedia di OrcaRouter dengan harga daftar OpenAI sendiri tanpa tambahan apa pun: GPT-6 Luna seharga $0,10 dan $0,50 dengan input cache seharga $0,01, GPT-6.1 Sol seharga $2,00 dan $10,00 dengan input cache seharga $0,10, dan langkah 272.000 token pada masing-masing diteruskan persis seperti yang tercantum di daftar vendor. Karena platform meneruskan harga daftar penyedia alih-alih menaikkannya, rasio dua puluh kali lipat dalam artikel ini adalah rasio yang benar-benar Anda bayar, di kedua sisi.

A screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the listing dated 2026-09-22, the model described as the fast, cost-efficient tier of OpenAI's GPT-6 series for high-volume and latency-sensitive workloads, a 1M-token context with 128K maximum output, text, image and file input, and the list price of $0.10 input and $0.50 output per million tokens with a 1.45 s median time to first token.

Alasan yang penting di sini secara khusus adalah bahwa pasangan ini adalah kaskade yang menunggu untuk ditulis. Sebuah pengklasifikasi, sebuah router, pekerjaan ekstraksi massal, dan agen pengodean berskala repositori tidak cocok berada pada model yang sama, dan selisih harganya cukup lebar sehingga salah memilih ke arah mana pun itu mahal — dua puluh kali terlalu mahal per panggilan di satu arah, tugas yang gagal di arah lainnya. Satu kunci, dua model, dan aturan yang mengirim lalu lintas mudah ke Luna dan mengeskalasi ke Sol ketika kelas tugas berubah atau ketika keluaran Luna gagal dalam pemeriksaan, adalah perubahan konfigurasi di pihak kami alih-alih kontrak vendor kedua. Failover otomatis mencakup kasus ketika salah satu dari keduanya mengalami degradasi, yang untuk model yang baru dirilis delapan hari lalu masih merupakan kemungkinan nyata.

A screenshot of OpenAI's GPT-6 Luna documentation page, showing the model ID gpt-6-luna, the effort ladder supporting none, low, medium, high, xhigh and max, a 1,050,000-token context window with 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and the pricing table listing input at $0.10, cached input at $0.01, cache writes at $0.125 and output at $0.50 per million tokens.

Keputusan, dalam sekali jalan

• Klasifikasi, ekstraksi, perutean, peringkasan massal, loop internal agen — GPT-6 Luna, dan berhenti membaca. Dengan $0.10/$0.50 plus pembacaan cache satu sen, tiga belas poin indeks kemampuan umum tidak sepadan dengan sepuluh kali tagihan untuk pekerjaan yang jawabannya singkat dan bisa diperiksa.

• Pengodean skala repo, agen terminal, eksekusi multi-langkah — GPT-6.1 Sol. Selisih 43 poin di Terminal-Bench 4.0 adalah seluruh argumennya; inilah kemampuan yang dibayar oleh harga tersebut.

• Pertanyaan pekerjaan berbasis pengetahuan yang jawaban salahnya mahal — GPT-6.1 Sol, tentang kesenjangan AA-Omniscience dan GDPval-AA. Skor keandalan faktual Luna berada di garis batas.

• Masukan panjang dengan jawaban singkat yang dihasilkan — GPT-6 Luna. Ia bernalar atas konteks panjang setara dengan model yang biayanya dua puluh kali lipat, dan penalti keberlebihan 144 juta tokennya tidak pernah mendapat kesempatan untuk berlaku.

• Apa pun yang sudah diatur ke none — tetap di Luna, atau anggarkan untuk perubahan. Tingkat itu tidak ada di GPT-6.1 Sol.

• Permukaan yang sensitif terhadap latensi — GPT-6 Luna, berdasarkan pengukuran papan itu sendiri: 129.4 token keluaran per detik dan 100 detik hingga chunk pertama, dibandingkan milik Sol yang 59.7 dan 332.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari