Kartu judul hero yang dihasilkan untuk Solar Mini 4 dengan judul utama 'Solar Mini 4 — uji mandiri', dengan subjudul 'Indeks Kecerdasan 24, dan sekitar lima kali lipat biaya per tugas GPT-6 Luna' serta dua lencana bertuliskan 'Dirilis 22 September 2026' dan 'Evaluasi pihak ketiga pertama, 30 September 2026'.
Guides & Insights

Solar Mini 4 Mendapat Skor 24 pada Artificial Analysis Index — dan Biayanya Lima Kali Lebih Mahal per Tugas Dibandingkan GPT-6 Luna

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Solar Mini 4 mengenakan biaya yang sama per token masukan seperti GPT-6 Luna, dan sekitar lima kali lebih mahal untuk benar-benar menyelesaikan suatu pekerjaan. Itulah inti cerita dari evaluasi independen pertama atas model baru Upstage, dan bukan cerita yang disampaikan materi peluncurannya. Solar Mini 4 mulai tersedia pada 22 September 2026 sebagai sparse mixture-of-experts 35 miliar parameter yang mengaktifkan sekitar 3 miliar parameter per token, dengan harga $0,10 per juta token masukan dan $0,40 per juta token keluaran. GPT-6 Luna, tier efisiensi OpenAI, tercantum dengan harga $0,10 dan $0,50, dengan tier konteks panjang di atas 272.000 token yang kurang lebih menggandakan keduanya. Pada daftar harga, keduanya tampak seperti pembelian yang sama. Pada Intelligence Index milik Artificial Analysis, tempat kedua model dijalankan melalui rangkaian sepuluh evaluasi yang sama, Solar Mini 4 memakan biaya $0,36 per tugas yang diselesaikan dibandingkan $0,07 untuk GPT-6 Luna (max) — faktor 5,4 yang sepenuhnya berasal dari cara kedua model berperilaku selama suatu tugas, bukan dari apa yang mereka kenakan per token.

Pada 30 September 2026, Artificial Analysis menerbitkan ulasannya tentang model tersebut, yang memperoleh skor 24 pada Intelligence Index v4.3.2. Segala hal dalam artikel ini yang dikaitkan dengan Artificial Analysis merupakan pengukuran organisasi itu sendiri; segala hal yang dikaitkan dengan Upstage adalah klaim vendor. Perbedaan ini lebih penting di sini daripada biasanya, karena kedua kumpulan angka tersebut tidak selalu sejalan.

Apa yang sebenarnya dilakukan oleh independent run

A scoreboard titled 'Solar Mini 4 — the scoreboard' with the rows: Intelligence Index 24.05 against a median of 12; Cost per index task $0.36 against GPT-6 Luna (max) at $0.07; Rate card $0.10 in / $0.01 cached / $0.40 out per 1M; Output per index task 88,300 tokens, 71,600 of them reasoning; Output speed 204 tokens per second and 430 seconds per index task; Context Upstage says 512K while Artificial Analysis lists 1.05M; Weakest result Terminal-Bench 4.0 at 1%.

Solar Mini 4 mencatat 24,05 pada Intelligence Index, dibandingkan median 12 di antara model penalaran di kelas harganya. Itu menempatkannya jauh di atas rata-rata untuk kelas bobotnya, dan pernyataan Upstage sendiri — "skor keseluruhan tertinggi di antara model dengan 3B aktif dalam perbandingan Artificial Analysis Intelligence Index" — terbukti bertahan dalam pengujian independen pada poin spesifik itu. Qwen3.6 35B A3B, yang juga mengaktifkan 3B parameter, mencetak 18,2 pada indeks yang sama. K2 Horizon MoVA 36B A4B, dengan 4B aktif, mencetak 25,3 — dan melakukannya pada konteks yang lebih pendek, 524K token dibandingkan 1,05M milik Solar Mini 4. Dibandingkan dengan Inkling, MoE berbobot terbuka dengan 975 miliar parameter yang dirilis pada Juli, Solar Mini 4 mencatat 24,1 berbanding 25,0 — dalam selisih satu poin dari model yang ukurannya hampir tiga puluh kali lipat dan berbiaya $1,00/$4,05 per juta token.

Profil di dalam skor itu tidak rata, dan ketidakrataan itulah bagian yang berguna:

• Penalaran konteks panjang adalah kekuatan relatifnya. Solar Mini 4 mencetak 83% pada AA-LCR v1.1, sejajar dengan MiniMax-M3 dan GPT-6 Luna (max), serta unggul atas Gemini 3.8 Flash (high) dan GPT-6 Astra (max) yang memperoleh 81%.

• Koding ilmiah tetap solid. 48% pada SciCode, unggul satu poin dari MiniMax-M3 dan Inkling (xhigh).

• Pengodean agentik runtuh. 1% pada Terminal-Bench 4.0. Bukan "lemah" — 1%. Pada AutomationBench-AA, yang menjalankan alur kerja multi-langkah di berbagai aplikasi SaaS nyata, 22,3%.

• Akurasi pengetahuan rendah, tetapi model tahu bahwa ia sedang menebak. AA-Omniscience menghasilkan −11 dengan akurasi 18%; model ini abstain pada sekitar separuh pertanyaan yang diajukan kepadanya. Tingkat non-halusinasi model ini adalah 64%, jauh di atas Inkling (xhigh) pada 32% dan GPT-6 Luna (max) pada 23%. Model yang mengatakan "Saya tidak tahu" separuh waktu dan benar dua pertiga dari waktu ketika menjawab adalah instrumen yang berbeda dari model yang berkonfabulasi dengan percaya diri.

Pada pekerjaan pengetahuan agentik, angkanya adalah 1072 Elo pada GDPval-AA dan 872 Elo pada AA-Briefcase, keduanya mendekati Inkling (xhigh).

Angka lima kali, dibedah

Angka biaya per tugas dari Artificial Analysis adalah angka yang akan menentukan sebagian besar percakapan pengadaan, dan angka itu layak dibaca sebagai rincian, bukan dikutip sebagai judul berita. Ada dua hal yang mendorongnya.

Pertama, volume. Solar Mini 4 mengeluarkan sekitar 88.300 token keluaran per tugas Intelligence Index; 71.600 di antaranya adalah token penalaran. Pada $0,40 per juta token keluaran, itu kira-kira $0,035 dari tagihan — murah, karena keluaran memang murah. Yang menjadi biayanya sebagai gantinya adalah waktu: pada kecepatan terukur 204 token per detik, Artificial Analysis mencatat 430 detik kerja untuk tugas indeks rata-rata, atau sekitar 7,2 menit. GPT-6 Luna (max) mengeluarkan 50.000 token keluaran per tugas pada 127 token per detik dan membutuhkan 396 detik. Inkling (xhigh), model berbobot terbuka dengan 975 miliar parameter, mengeluarkan 34.700 token dan selesai dalam 169 detik. Solar Mini 4 lebih lambat daripada keduanya, tetapi dengan selisih yang sama sekali tidak berkaitan dengan kesenjangan biaya lima kali lipat.

Kedua — dan inilah inti persoalannya — input penulisan cache. Rincian biaya Artificial Analysis mengaitkan sekitar $0,30 dari $0,36 per tugas Solar Mini 4 dengan token yang ditulis ke dalam cache prompt, dibandingkan $0,03 untuk pembacaan cache, $0,035 untuk output, dan kesalahan pembulatan untuk input yang benar-benar tidak di-cache. Untuk GPT-6 Luna (max), penulisan cache adalah $0,012 dari $0,068 — sekitar 17% dari tagihan, dibandingkan 82% untuk Solar Mini 4. Input yang di-cache adalah pos termurah pada kartu tarif Upstage, yaitu $0,01 per juta, dan model Artificial Analysis memang menggunakannya; masalahnya adalah seberapa banyak yang harus ditulis sebelum dapat dibaca. Agen yang mengirim ulang percakapan yang terus bertambah pada setiap giliran membayar biaya penulisan jauh lebih sering daripada model yang menjawab dalam giliran singkat dan tertutup.

Itulah temuan yang layak dibawa ke produksi: untuk model seperti ini, harga per token hampir tidak memprediksi apa pun tentang tagihan per tugas. Perilaku cache-lah yang menentukan.

Jika angka milik Upstage sendiri berbeda

A screenshot of Upstage's Console documentation page for Solar Mini 4, showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate, the description of a cost-efficient compact language model at 35B total and 3B active parameters built for agentic use cases, English, Japanese and Korean language support, tool calling, a 128K max output, the platforms Upstage Console and on-premises, and the version string solar-mini4-260922 with a training data cut-off of February 2026.

Postingan peluncuran Upstage, yang diterbitkan pada 1 Oktober 2026 dengan judul "Solar Mini 4: Dibuat untuk Beban Kerja Agen Bervolume Tinggi", melaporkan 24,1 pada Artificial Analysis Intelligence Index — secara efektif angka yang sama — dan membuat beberapa klaim yang berdampingan dengan, bukan berada di atas, data independen.

Vendor tersebut menyebut 22,3% pada AutomationBench-AA, persis sama dengan Artificial Analysis, dan 47,2 pada τ³-Banking, tolok ukur kebijakan dan penggunaan alat yang sejak itu telah dihapus dari rangkaian indeks. Model ini melaporkan 83,3% pada AA-LCR dan 47,6% pada SciCode, keduanya hanya berbeda karena pembulatan dari angka-angka independen. Pada Humanity's Last Exam, model ini melaporkan 19,6%, sementara halaman Artificial Analysis mencantumkan 25,8% untuk model yang sama; keduanya merupakan pembacaan yang masuk akal dari evaluasi yang terkenal volatil, tetapi keduanya bukan angka yang sama dan tidak satu pun boleh disajikan sebagai yang lain.

Dua baris spesifikasi juga saling bertentangan. Upstage mendokumentasikan jendela konteks 512K token dengan hingga 128K token keluaran. Artificial Analysis mencantumkan jendela konteks 1,0M token dan keluaran maksimum 262K. Blog Upstage secara eksplisit menyatakan bahwa angka 512K adalah kontrak untuk versi yang dirilis; perbedaan semacam ini layak diselesaikan dengan merujuk pada respons API sebelum siapa pun membangun pipeline pengambilan berdasarkan angka itu.

Vendor tersebut juga membuat satu perbandingan yang bisa dilakukannya dengan caranya sendiri: uji internal pada tiga tugas agen berbahasa Korea yang dijalankan tiga kali per model, di mana menyelesaikan 1.000 set tiga tugas menelan biaya sekitar $1,25 dengan Solar Mini 4 dan $2,20 dengan MiMo-V2.5. Itu adalah uji yang dijalankan vendor pada tugas yang dipilih vendor dengan latensi dikecualikan, dan hasilnya mengarah ke arah yang berlawanan dari hasil Artificial Analysis. Itu tidak salah — tugas yang berbeda menguji anggaran token yang berbeda — tetapi itu adalah angka pemasaran, dan diskon peluncuran yang dipublikasikan model tersebut menjadi alasan terpisah untuk menghitung ulang angka Anda sendiri alih-alih mengadopsi angka siapa pun.

Harga, berdasarkan dokumentasi konsol Upstage yang aktif: $0,10 per juta token masukan, $0,01 per juta token masukan yang di-cache, $0,40 per juta token keluaran, dengan diskon peluncuran yang saat ini diiklankan sebesar 50% hingga 22 Oktober 2026 UTC, yang membuat tarif efektifnya menjadi $0,05 masukan, $0,005 masukan yang di-cache, dan $0,20 keluaran hingga saat itu.

Apa artinya ini jika Anda yang membayar

Hal menarik tentang Solar Mini 4 bukanlah bahwa model ini buruk. Melainkan bahwa ini adalah model kecil yang benar-benar bagus yang ekonominya didominasi oleh perilaku yang tidak dapat ditunjukkan oleh daftar tarif kepada Anda. Nilai 24 pada indeks dengan tiga parameter aktif adalah hasil rekayasa yang nyata, dan beban kerja berbahasa Korea — keunggulan yang dinyatakan model ini, bersama bahasa Inggris dan Jepang — justru merupakan tempat hasil itu paling mungkin sepadan dengan harganya.

Bagian yang canggung adalah semua yang terjadi setelah panggilan pertama. Giliran asisten yang panjang, penggunaan ulang cache yang rendah, dan tugas yang memerlukan tujuh menit decode per eksekusi indeks jika dijumlahkan menghasilkan angka yang sama sekali tidak seperti $0.10/$0.40. Jika Anda mengevaluasinya, eksperimen yang jujur adalah uji biaya per pekerjaan yang diselesaikan pada beban kerja Anda sendiri, dengan prompt caching diaktifkan seperti cara stack produksi Anda benar-benar menggunakannya — bukan perbandingan harga token.

Ini juga merupakan kelas masalah yang keberadaan router dimaksudkan untuk dipecahkan, dan alasan OrcaRouter meneruskan harga daftar penyedia tanpa markup 0% sehingga perubahan harga vendor sampai ke tagihan Anda pada hari yang sama. Kami tidak merutekan model Upstage, jadi baik Solar Mini 4 maupun Solar Pro 4 tidak tersedia melalui kami — keduanya berasal dari API Upstage sendiri dan platform pihak ketiga. Yang kami rutekan adalah separuh lainnya dari perbandingan ini: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash dan lebih dari 200 model lain di balik satu kunci, yang membuatnya praktis untuk mempertahankan model murah dan model mahal pada tugas yang sama dan membiarkan failover otomatis serta perutean per permintaan memutuskan mana yang menjawab. Ketika perbedaan antara dua model adalah selisih biaya per tugas lima kali lipat yang tidak diungkapkan oleh daftar harga mana pun, kemampuan untuk memindahkan satu permintaan di antara keduanya lebih penting daripada tabel tolok ukur mana pun.

A screenshot of the Artificial Analysis article dated September 30, 2026, headlined 'Korean AI Lab Upstage has released Solar Mini 4 which scores 24 on the Artificial Analysis Intelligence Index, but costs ~5x as much per task as GPT-6 Luna (max) despite similar per-token prices'. The visible key-results text covers the 3B-active Pareto claim, the 6-point lead over Qwen3.6 35B A3B at the same active size, 83% on AA-LCR v1.1 matching MiniMax-M3 and GPT-6 Luna (max), 48% on SciCode, and fast output at 208 tokens per second with slow tasks.

Versi singkatnya: Solar Mini 4 adalah titik Pareto baru yang ditarik Artificial Analysis untuk model dengan parameter aktif di bawah tiga miliar, dan harganya sekitar lima kali lebih mahal per tugas yang diselesaikan dibandingkan model yang tercantum pada harga input yang sama. Kedua pernyataan itu benar, dan pernyataan kedua itulah yang muncul di faktur.