Kartu hero yang dihasilkan untuk GPT-6.1 Sol berjudul 'Skor independen telah tiba', dengan lencana bertuliskan 'Dirilis: 29 September 2026', 'Indeks Kecerdasan: 52 pada upaya maksimal' dan 'Biaya per tugas indeks: $0,72', catatan kaki bertuliskan 'Angka independen menurut Artificial Analysis, indeks v4.3.2, dibaca pada 30 September 2026', dan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Skor Independen Pertama GPT-6.1 Sol Sudah Keluar: Tertinggal 0,84 Poin dari Astra, dengan Biaya Tugas Kurang dari Seperempat

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Setiap tulisan tentang GPT-6.1 Sol yang diterbitkan dalam beberapa hari setelah peluncuran DevDay Ope​nAI 29 September 2026 — termasuk blog ini — membawa catatan yang sama: angka kemampuannya berasal dari vendor dan belum ada pihak ketiga yang menilai model tersebut. Catatan itu kini tidak berlaku lagi. Artificial Analysis memiliki baris GPT-6.1 Sol di Intelligence Index-nya, yang dijalankan dengan upaya penalaran maksimum, dan ini adalah angka pertama sepanjang usia singkat model ini yang tidak dihasilkan oleh Ope​nAI. Angkanya 51,8 berbanding 52,7 untuk GPT-6 Astra dan 47,5 untuk GPT-6 Sol — selisih kurang dari satu poin dengan model unggulan $10/$50, dan peningkatan 4,3 poin dari model yang digantikan GPT-6.1 Sol. Angka yang membuat baris itu menarik adalah angka di sebelahnya: papan tersebut mencantumkan biaya proses evaluasi di balik setiap skor, dan proses indeks GPT-6.1 Sol memakan biaya $0,72 per tugas sedangkan milik Astra $3,26. Empat setengah kali lipat biaya untuk 0,84 poin adalah keseluruhan perbandingan dalam satu baris, dan sekarang ini adalah baris yang terukur, bukan pembingkaian vendor atasnya.

Baris itu sendiri, dan pada apa ia dijalankan

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis menerbitkan Intelligence Index-nya sebagai komposit dari sepuluh evaluasi, dan versi yang berjalan pada 30 September 2026 adalah v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience dan AA-LCR v1.1. Ketiga model OpenAI dalam artikel ini berada pada versi yang sama, sehingga perbandingan di bawah ini benar-benar setara dengan cara yang tidak pernah dimiliki tabel peluncuran vendor sendiri. Papan peringkat itu juga mencatat tanggal rilis yang dimilikinya untuk model — 2026-09-29, tanggal DevDay — dan mengevaluasinya dalam konfigurasi upaya maksimum, yaitu pengaturan yang disebutkan halaman tersebut di judulnya sendiri.

• Intelligence Index — 51.8 untuk GPT-6.1 Sol (max), 52.7 untuk GPT-6 Astra (max), 47.5 untuk GPT-6 Sol (max).
• Biaya per tugas indeks — $0.72 untuk GPT-6.1 Sol, $3.26 untuk Astra, $1.05 untuk GPT-6 Sol. Ini adalah angka dari papan itu sendiri untuk biaya menjalankan satu evaluasi indeks penuh, bukan daftar tarif.
• Token keluaran yang dihabiskan selama pengujian — 67.2 juta untuk GPT-6.1 Sol, 60.0 juta untuk Astra, 76.8 juta untuk GPT-6 Sol. Komentar AA sendiri menyebut 67 juta sebagai "cukup ringkas" dibandingkan median papan sebesar 82 juta, yang merupakan kemenangan kedua yang lebih senyap atas model yang digantikannya.
• Kecepatan keluaran — 66.8 token per detik untuk GPT-6.1 Sol, 57.0 untuk Astra, 76.2 untuk GPT-6 Sol.
• Harga sebagaimana dicantumkan papan — $2.00 input dan $10.00 output per juta token untuk GPT-6.1 Sol, dengan input tercache $0.10 dan penulisan cache $2.50. Keempat angka itu sama persis dengan halaman harga vendor, dan itulah hal yang paling tidak dramatis sekaligus paling berguna dari baris ini: daftar independen atas tarif yang sudah kami kutip.

Catatan pembingkaian sebelum angka-angka itu dipakai sebagai amunisi. Indeks AA terdiri dari sepuluh evaluasi, dan evaluasi yang OpenAI kedepankan di awal pengumumannya sendiri — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — tidak termasuk di dalamnya. AA menjalankan varian AutomationBench-nya sendiri, yang bukan harness yang sama dengan versi AutomationBench yang dikutip vendor. Jadi rekam independen tidak mengonfirmasi atau membantah empat klaim utama dari postingan peluncuran; rekam itu mengukur kumpulan tugas yang sebagian besar berbeda, dan layak dibaca sebagai pendapat kedua tentang bentuk model, bukan sebagai putusan atas kalimat-kalimat spesifik tersebut.

Astra tetap menang, dengan selisih kurang dari satu poin, dengan biaya empat setengah kali lipat.

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

Kedua model menyediakan tangga upaya, dan papan peringkat kini telah menerbitkan skor serta biaya menjalankan untuk setiap anak tangga pada keduanya. Jika disejajarkan, tangga-tangga itu mengatakan sesuatu yang tidak dapat dikatakan oleh perbandingan utama tunggal: konfigurasi terbaik GPT-6.1 Sol tidak bersaing dengan yang terbaik dari Astra. Ia bersaing dengan yang terbaik kedua dari Astra.

• GPT-6.1 Sol, max — 51,8, $0,72 per tugas indeks. GPT-6 Astra, max — 52,7, $3,26.
• GPT-6.1 Sol, xhigh — 51,0, $0,39. GPT-6 Astra, xhigh — 52,4, $2,31.
• GPT-6.1 Sol, high — 50,2, $0,32. GPT-6 Astra, high — 50,9, $1,73.
• GPT-6.1 Sol, medium — 47,8, $0,21. GPT-6 Astra, medium — 49,6, $1,54.
• GPT-6.1 Sol, low — 42,1, $0,13. GPT-6 Astra, low — 45,8, $0,82.

Astra memimpin di setiap tingkatan, yang merupakan ringkasan jujur dari perbandingan ini dan juga bagian yang paling tidak menarik darinya. Bagian yang menarik adalah nilai tukarnya. Jika Anda menginginkan konfigurasi Astra termurah yang mengalahkan hasil terbaik GPT-6.1 Sol, itu adalah Astra pada xhigh: 52,4 versus 51,8, dengan biaya $2,31 versus $0,72. Itu berarti 0,56 poin indeks dengan tambahan $1,59 per proses evaluasi — kira-kira 3,2 kali biaya untuk kurang dari satu persen skor. Beralihlah ke arah sebaliknya dan turunkan GPT-6.1 Sol ke xhigh, maka Anda mengorbankan 0,8 poin sementara tagihannya turun menjadi $0,39, yang 5,9 kali lebih murah daripada xhigh Astra dan sepersembilan dari proses upaya maksimum Astra.

Ada pembacaan kedua atas tangga yang sama yang berargumen menentang pembelian Astra pada upaya maksimum. Empat anak tangga Astra yang lebih rendah semuanya lebih murah daripada max-nya, dan xhigh-nya berada 0,29 poin di bawah max-nya — sedikit lebih dari setengah persen skor untuk pemotongan biaya eksekusi sebesar 29%. Percakapan pengadaan apa pun tentang pasangan ini yang dimulai dari "Astra pada max" dan berakhir pada "Astra berbiaya 4,5 kali lebih mahal" telah mengabaikan anak tangga Astra sendiri yang lebih murah dari perbandingan.

Enam evaluasi diberikan kepada Astra, dua kepada GPT-6.1 Sol, dua seri.

Kompositnya menyembunyikan perpecahan. Dinilai evaluasi demi evaluasi pada upaya maksimal, GPT-6.1 Sol bukanlah Astra yang secara seragam sedikit lebih buruk — ia lebih baik dalam dua hal dan lebih buruk dalam enam hal.

• GDPval-AA — Elo 1575,1 untuk GPT-6.1 Sol dibandingkan 1541,9 untuk Astra, keunggulan 33 poin pada tugas pekerjaan profesional. Ini adalah kemenangan independen tunggal terbesar bagi model yang lebih murah.
• AA-LCR v1.1, penalaran konteks panjang — 0,830 dibandingkan 0,807. GPT-6.1 Sol unggul.
• AA-Briefcase v1.1 — Elo 1564,2 dibandingkan 1568,9. Astra unggul 4,7.
• AutomationBench-AA — 0,649 dibandingkan 0,685. Astra unggul 3,6 poin.
• Terminal-Bench 4.0 — 0,561 dibandingkan 0,591. Astra unggul 3,0 poin.
• SciCode — 0,542 dibandingkan 0,565. Astra unggul 2,3 poin.
• Humanity's Last Exam — 0,529 dibandingkan 0,547. Astra unggul 1,8 poin.
• AA-Omniscience — 41,5 dibandingkan 43,4. Astra unggul 1,9 poin.
• GDP.pdf dan CritPt — imbang sempurna pada 0,310 dan 0,317 masing-masing, pada kedua model.

Dua dari baris itu bernilai lebih besar daripada posisinya dalam daftar. Selisih GDPval-AA adalah satu-satunya tempat di mana keunggulan model yang lebih murah cukup besar untuk bertahan terhadap pergantian harness, dan hal itu tepat mengenai beban kerja yang diklaim oleh positioning vendor — pekerjaan profesional yang padat dokumen. Dan dua hasil imbang mutlak berada pada evaluasi dengan sebaran paling sempit, yang menjadi pengingat bahwa selisih komposit 0,84 poin disusun dari baris-baris yang secara individual berkisar dari kemenangan 33 poin hingga kekalahan 3,6 poin.

Dibandingkan dengan model yang digantikannya, peningkatan itu nyata tetapi tidak merata.

Perbandingan yang penting bagi siapa pun yang sudah menjalankan GPT-6 Sol di jalur produksi adalah perbandingan yang dibuat 6.1 Sol terhadap pendahulunya sendiri, dan catatan independen lebih tajam soal itu daripada postingan vendor. Delapan dari sepuluh evaluasi membaik. Dua mengalami kemunduran.

• SciCode — GPT-6.1 Sol mencetak skor 0,542 sementara GPT-6 Sol mencetak 0,576. Model yang lebih baru ini lebih buruk dalam kode ilmiah sebesar 3,5 poin.
• AA-LCR v1.1 — 0,830 untuk 6.1 Sol melawan 0,837 untuk GPT-6 Sol. Selisih sangat tipis, tetapi ke arah yang salah, pada evaluasi konteks panjang.
• AA-Omniscience — 41,5 melawan 27,1. Ini adalah perubahan terbesar di baris ini: lompatan 14,4 poin pada evaluasi pengetahuan, dan akurasi pada set tersebut naik dari 0,545 ke 0,621.
• Tingkat halusinasi pada set yang sama — 0,543 untuk GPT-6.1 Sol, turun dari 0,601 untuk GPT-6 Sol dan masih di atas 0,513 milik GPT-6 Astra. AA-Omniscience membagi skornya menjadi "menjawab benar" dan "salah dengan percaya diri", dan justru pada pembagian itulah penyegaran 6.1 membuktikan nilainya: model ini secara signifikan lebih jujur daripada Sol, dan Sol masih yang paling tidak jujur di antara ketiganya.
• Terminal-Bench 4.0 — 0,561 melawan 0,439, kenaikan 12,2 poin. AA-Briefcase — 1482,8 menjadi 1564,2 Elo. GDP.pdf — 0,248 menjadi 0,310.

Pembacaannya adalah bahwa ini lebih merupakan penyegaran pengetahuan dan tooling ketimbang penyegaran penalaran. Evaluasi yang perubahannya paling besar adalah evaluasi yang menghargai mengetahui berbagai hal dan bukan mengarangnya; evaluasi yang turun adalah evaluasi yang sempit dan teknis. Siapa pun yang beralih ke 6.1 Sol demi penghematan cache mendapatkan peningkatan pengetahuan sebagai bonus dan tidak boleh menganggapnya berlaku untuk setiap harness yang mereka jalankan.

Di mana papan itu, dan apa yang berada di atasnya.

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

Dalam urutan default Intelligence Index di papan peringkat, GPT-6 Astra pada upaya maksimum berada di peringkat ke-7 dan GPT-6.1 Sol pada upaya maksimum berada di peringkat ke-10, dengan GPT-6 Sol pada upaya maksimum di peringkat ke-20. Sembilan baris di atas GPT-6.1 Sol adalah dua konfigurasi Astra, tiga konfigurasi Claude Opus 5.5, satu konfigurasi Claude Sonnet 5.5, dan dua konfigurasi Claude Fable 5.1 — jadi model yang paling dekat dengan GPT-6.1 Sol adalah model unggulan dari keluarganya sendiri, dan model yang sebenarnya telah digeser posisinya olehnya dalam urutan itu adalah pendahulunya sendiri, turun tiga belas peringkat.

Hilangkan pengaturan effort, maka urutannya memadat dengan cara yang penting untuk perencanaan biaya: GPT-6.1 Sol pada xhigh berada di peringkat 13, pada high di peringkat 15, pada medium di peringkat 19, dan pada low di peringkat 35, sementara Astra berada di peringkat 14 pada high, 16 pada medium, dan 26 pada low. Dengan kata lain, GPT-6.1 Sol pada xhigh mengungguli Astra pada high di papan peringkat, dan GPT-6.1 Sol pada medium mengungguli Astra pada low. Effort adalah tuas yang lebih besar di sini daripada pilihan model, setidaknya di antara keduanya.

Apa yang harus dilakukan dengan nomor itu, sejujurnya.

Klaim vendor yang diuji pada baris ini adalah bahwa GPT-6.1 Sol hampir menyamai model unggulan dengan harga sekitar seperlima. Versi independen dari pernyataan itu adalah: selisihnya hanya 0,84 poin indeks dari model unggulan, dan proses evaluasi di balik skornya berbiaya 22% dari biaya model unggulan. Itu cukup dekat dengan klaim tersebut sehingga tak seorang pun perlu merasa disesatkan olehnya, dan itu adalah pernyataan yang lebih kuat daripada "belum diverifikasi" dalam segala hal yang penting bagi pembeli.

Yang tidak dilakukan baris ini adalah menetapkan harga beban kerja Anda. Satu kali eksekusi indeks adalah campuran tugas yang spesifik, dan angka yang menentukan tagihan nyata adalah kartu tarif yang diadu dengan profil token Anda sendiri — itulah sebabnya baris cache tetap menjadi baris yang perlu dimodelkan: input cache GPT-6.1 Sol sebesar $0,10 versus $1,00 milik Astra adalah selisih sepuluh kali lipat yang tidak tersentuh oleh skor indeks mana pun. Di sisi kami, penerusan yang sama juga berlaku: OrcaRouter menyediakan GPT-6 Astra, GPT-6 Sol, dan GPT-6 Luna dengan harga daftar OpenAI sendiri tanpa tambahan markup, jadi ketika tarif vendor berubah, tarif di sisi kami ikut berubah, bukan menunggu kontrak kedua. GPT-6.1 Sol tidak ada di rute kami — katalog publik mengembalikan "model not found" untuk openai/gpt-6.1-sol hari ini, dan tidak ada cara jujur untuk menggambarkan model yang tidak dapat kami layani. Yang benar-benar Anda dapatkan dengan satu kunci API saat ini adalah pasangan yang sebenarnya diperdebatkan dalam benchmark — Astra untuk pekerjaan tersulit, Sol untuk volume — dengan harga daftar penyedia diteruskan tanpa markup dan failover otomatis antar penyedia ketika salah satunya mengalami error.

Dua hal akan semakin mempertajam ini. Perangkat uji independen kedua pada model yang sama akan memberi tahu kita apakah keunggulan GDPval-AA merupakan properti dari model atau dari evaluasi tersebut, dan itu adalah titik data hilang paling berguna di baris ini. Dan pengukuran independen terhadap tier konteks panjang 272.000 token akan lebih penting daripada poin komposit lain, karena di situlah penetapan harga keluarga ini tidak lagi murah.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari