
GPT-6.1 Sol vs GPT-6 Luna: Tiga Belas Poin Indeks, Sepuluh Kali Biaya, dan Dua Evaluasi yang Tidak Berlaku
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
OpenAI merilis GPT-6.1 Sol pada 29 September 2026, satu minggu setelah GPT-6 Lunahadir pada 22 September dalam siklus keynote yang sama. Keduanya adalah dua ujung dari generasi yang sama: Luna adalah tier murah, Sol adalah tier menengah di atasnya, dan GPT-6 Astra berada di atas keduanya. Selisih harga antara keduanya mencapai satu orde besaran — $0,10 dan $0,50 per juta token versus $2,00 dan $10,00, input cache $0,01 versus $0,10 — dan selisih kemampuannya di papan independen adalah 13,7 poin Intelligence Index, 51,8 versus 38,1 pada upaya penalaran maksimum. Sepuluh kali lipat biaya untuk tiga belas poin kira-kira merupakan nilai tukar terburuk dalam jajaran OpenAI saat ini. Yang membuat perbandingan ini layak ditulis adalah pertanyaan empat puluh dolar yang menyusul: tiga belas poin yang mana?
Dua model itu, dan sepekan di antara keduanya
GPT-6 Luna adalah model kecil dari generasi GPT-6 — model yang digambarkan OpenAI sebagai dirancang untuk pekerjaan bervolume tinggi dan sensitif terhadap latensi: klasifikasi, ekstraksi, perutean, peringkasan massal, lingkaran dalam sebuah agen. Model ini membawa jendela konteks 1.050.000 token dan batas keluaran 128.000 token, menerima teks, gambar, dan berkas sebagai masukan, serta mempertahankan tangga upaya enam tingkat secara penuh termasuk none, yang dihapus pada tingkat 6.1. Daftar tarifnya adalah alasan model ini ada: $0,10 untuk masukan dan $0,50 untuk keluaran per juta token, masukan cache $0,01 dan penulisan cache $0,125, dengan kenaikan konteks panjang di atas 272.000 token masukan menjadi $0,20, $0,75, dan $0,02 untuk cache.
GPT-6.1 Sol adalah penyegaran kelas menengah yang dirilis seminggu kemudian. Jendela yang sama, batas output yang sama, modalitas input yang sama, batas pengetahuan 30 April 2026 dibandingkan dengan milik Luna, dan jenjang upaya yang dimulai dari rendah karena tidak ada dan minimal ditolak mentah-mentah. Harganya $2.00 dan $10.00 dengan input yang di-cache sebesar $0.10 — dua puluh kali tarif input Luna dan dua puluh kali tarif outputnya, dengan baris cache yang sepuluh kali lebih mahal per hit.
Keduanya dijual, keduanya ada di ChatGPT Work dan Codex serta API, dan keduanya dapat dipanggil melalui kunci yang sama di sisi kami. Tidak ada apa pun tentang pasangan ini yang mengharuskan untuk memilih.
Apa yang sebenarnya bisa dibeli oleh tiga belas poin indeks
Composite adalah angka yang paling tidak informatif dalam perbandingan ini, karena ia merata-ratakan tugas-tugas yang perilakunya sangat berbeda. Jika dinilai evaluasi demi evaluasi pada upaya penalaran maksimum di Artificial Analysis v4.3.2, bentuknya adalah perpecahan, bukan kemiringan:
• AA-LCR v1.1, penalaran konteks panjang — GPT-6 Luna 0,833 vs GPT-6.1 Sol 0,830. Luna sedikit lebih unggul.
• SciCode — GPT-6 Luna 0.546 vs GPT-6.1 Sol 0.542. Sekali lagi, secara efektif setara, dan sekali lagi model yang lebih murah secara nominal berada di depan.
• Terminal-Bench 4.0 — GPT-6 Luna 0.126 vs GPT-6.1 Sol 0.561. Selisih 43 poin; kedua model berada di liga yang berbeda dalam pekerjaan terminal.
• Humanity's Last Exam — GPT-6 Luna 0.385 vs GPT-6.1 Sol 0.529.
• AutomationBench-AA — GPT-6 Luna 0.532 vs GPT-6.1 Sol 0.649.
• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 vs GPT-6.1 Sol Elo 1575,1, selisih Elo 138 poin pada pekerjaan berbasis pengetahuan profesional.
• GDP.pdf — GPT-6 Luna 0.228 vs GPT-6.1 Sol 0.310.
• CritPt — GPT-6 Luna 0.194 vs GPT-6.1 Sol 0.317.
• AA-Omniscience — GPT-6 Luna 0,65 vs GPT-6.1 Sol 41,5. Pada skala di mana nol berarti jumlah jawaban benar sama banyak dengan jawaban salah, Luna berada tepat di garis air dan Sol berada secara signifikan di atasnya.
• MMMU-Pro — GPT-6 Luna 0,797 vs GPT-6.1 Sol 0,860.
• Biaya per tugas indeks, independen — GPT-6 Luna $0.068 vs GPT-6.1 Sol $0.72; selisih sekitar sepuluh kali lipat yang menguntungkan model murah
• Token keluaran pada uji indeks — GPT-6 Luna 144 juta vs GPT-6.1 Sol 67 juta, dibandingkan median kelas 100 juta untuk Luna dan sekitar 81 juta untuk Sol
Dua dari sepuluh evaluasi berakhir seri yang menguntungkan model murah. Delapan dimenangkan oleh yang mahal, dan pada enam dari delapan itu selisihnya bukanlah marginal. Itulah pembacaan jujur atas tiga belas poin: ini bukan gradien kualitas yang seragam, melainkan dua kemampuan — eksekusi agentik yang berkelanjutan dan keandalan faktual — di mana Luna jelas bukan kelas model yang sama, dan area tengah yang luas di mana perbedaannya nyata tetapi cukup kecil sehingga tak terlihat dalam set evaluasi Anda sendiri.
Hasil AA-LCR layak mendapat satu catatan, karena angka itulah yang paling menyanjung Luna. Penalaran konteks panjang di 0,833 adalah skor yang kuat dan kedua model berada dalam selisih setengah poin satu sama lain, tetapi tolok ukur ini mengukur pengambilan dan penalaran atas masukan panjang, bukan kemampuan untuk bertindak sepanjang sesi yang panjang. Selisih pada Terminal-Bench 4.0 adalah gambaran dari "bertindak sepanjang sesi yang panjang" ketika dinilai, dan besarnya 43 poin.

Aritmetika biaya per tugas, dan di mana hal itu tidak lagi benar
Artificial Analysis menetapkan harga setiap index run berdasarkan konsumsi token yang terukur, sehingga angka biayanya bukan inferensi dari daftar tarif. Run GPT-6 Luna memakan biaya $0,068 per tugas; biaya GPT-6.1 Sol $0,72. Rasionya 10,7×, yang hanya sedikit lebih buruk daripada rasio harga nominal dua puluh kali lipat karena Luna menghasilkan 144 juta token keluaran dalam run tersebut, dibandingkan 67 juta milik Sol — model murah itu lebih dari dua kali lebih cerewet, dan itu menggerus keunggulannya sendiri. Meski begitu, jarak peringkatnya tidak dekat, dan pada beban kerja jawaban singkat selisihnya akan melebar: volume keluaran yang lebih sedikit berarti penalti kecerewetan Luna menyusut sementara keunggulan harganya tetap.
Di mana aritmetika itu berhenti berlaku adalah pada beban kerja apa pun yang tidak mirip dengan indeks tersebut. Jika tugas Anda adalah pengeditan berskala repositori yang menuntut dua puluh pemanggilan alat tetap koheren, model $0,07 yang gagal menyelesaikan tugas akan menghabiskan seluruh putaran percobaan ulang plus waktu nyata, sedangkan model $0,72 yang selesai sekali justru lebih murah. Kerangka peluncuran GPT-6.1 Sol sendiri sepenuhnya dibangun di atas gagasan ini — biaya per selesai tugas — dan itulah kerangka yang benar: perbandingan yang relevan bukanlah tarif token, melainkan biaya yang diharapkan per hasil, dan pada tugas yang tidak dapat diselesaikan Luna, ekspektasi itu tidak terbatas.
Dua detail struktural mempertajam batas tersebut. Pertama, langkah konteks panjang: kedua model menetapkan harga ulang di atas 272.000 token masukan, Luna menjadi $0,20 dan $0,75, serta Sol menjadi $4,00 dan $15,00, sehingga selisih absolutnya melebar di batas tersebut alih-alih menutup, tetapi tarif Luna setelah penetapan harga ulang masih satu orde besaran di bawah tarif standar Sol. Kedua, dan mudah terlewat: tangga effort tidak memiliki bentuk yang sama. Luna menerima none; Sol tidak. Kaskade yang merutekan ke Sol terlebih dahulu dan melakukan fallback ke Luna saat error atau timeout tidak boleh membawa reasoning.effortmilik permintaan itu tanpa perubahan, karena konfigurasi yang legal pada satu model akan menghasilkan error pada model lainnya. Itu adalah urusan lapisan perutean, bukan urusan kualitas model, dan justru hal semacam itulah yang seharusnya diserap oleh satu endpoint dengan aturan perutean.
Menjalankan keduanya adalah intinya, bukan sekadar langkah berjaga-jaga.
Kedua model tersedia di OrcaRouter dengan harga daftar OpenAI sendiri tanpa tambahan apa pun: GPT-6 Luna seharga $0,10 dan $0,50 dengan input cache seharga $0,01, GPT-6.1 Sol seharga $2,00 dan $10,00 dengan input cache seharga $0,10, dan langkah 272.000 token pada masing-masing diteruskan persis seperti yang tercantum di daftar vendor. Karena platform meneruskan harga daftar penyedia alih-alih menaikkannya, rasio dua puluh kali lipat dalam artikel ini adalah rasio yang benar-benar Anda bayar, di kedua sisi.

Alasan yang penting di sini secara khusus adalah bahwa pasangan ini adalah kaskade yang menunggu untuk ditulis. Sebuah pengklasifikasi, sebuah router, pekerjaan ekstraksi massal, dan agen pengodean berskala repositori tidak cocok berada pada model yang sama, dan selisih harganya cukup lebar sehingga salah memilih ke arah mana pun itu mahal — dua puluh kali terlalu mahal per panggilan di satu arah, tugas yang gagal di arah lainnya. Satu kunci, dua model, dan aturan yang mengirim lalu lintas mudah ke Luna dan mengeskalasi ke Sol ketika kelas tugas berubah atau ketika keluaran Luna gagal dalam pemeriksaan, adalah perubahan konfigurasi di pihak kami alih-alih kontrak vendor kedua. Failover otomatis mencakup kasus ketika salah satu dari keduanya mengalami degradasi, yang untuk model yang baru dirilis delapan hari lalu masih merupakan kemungkinan nyata.

Keputusan, dalam sekali jalan
• Klasifikasi, ekstraksi, perutean, peringkasan massal, loop internal agen — GPT-6 Luna, dan berhenti membaca. Dengan $0.10/$0.50 plus pembacaan cache satu sen, tiga belas poin indeks kemampuan umum tidak sepadan dengan sepuluh kali tagihan untuk pekerjaan yang jawabannya singkat dan bisa diperiksa.
• Pengodean skala repo, agen terminal, eksekusi multi-langkah — GPT-6.1 Sol. Selisih 43 poin di Terminal-Bench 4.0 adalah seluruh argumennya; inilah kemampuan yang dibayar oleh harga tersebut.
• Pertanyaan pekerjaan berbasis pengetahuan yang jawaban salahnya mahal — GPT-6.1 Sol, tentang kesenjangan AA-Omniscience dan GDPval-AA. Skor keandalan faktual Luna berada di garis batas.
• Masukan panjang dengan jawaban singkat yang dihasilkan — GPT-6 Luna. Ia bernalar atas konteks panjang setara dengan model yang biayanya dua puluh kali lipat, dan penalti keberlebihan 144 juta tokennya tidak pernah mendapat kesempatan untuk berlaku.
• Apa pun yang sudah diatur ke none — tetap di Luna, atau anggarkan untuk perubahan. Tingkat itu tidak ada di GPT-6.1 Sol.
• Permukaan yang sensitif terhadap latensi — GPT-6 Luna, berdasarkan pengukuran papan itu sendiri: 129.4 token keluaran per detik dan 100 detik hingga chunk pertama, dibandingkan milik Sol yang 59.7 dan 332.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
