Kartu judul yang dihasilkan bertuliskan GPT-6 Sol vs MiniMax M3, apa yang tidak bisa didapatkan dengan harga keluaran delapan kali lipat, dengan kartu statistik bertuliskan harga keluaran $10,00 vs $1,20 per juta, Indeks Kecerdasan 47,6 vs 29,2, dan bobot tertutup vs terbuka, dengan catatan kaki bertuliskan Indeks menurut Artificial Analysis v4.3.2; tarif MiniMax M3 menurut MiniMax dan tarif GPT-6 Sol menurut kartu tarif OpenAI.
Guides & Insights

GPT-6 Sol vs MiniMax M3: Apa yang Tetap Tidak Dapat Dibeli dengan Harga Output Delapan Kali Lipat

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hal pertama yang perlu dikatakan tentang GPT-6 Sol versus MiniMax M3 adalah bahwa soal harga tidak dekat dan soal skor juga tidak dekat, dan keduanya menunjuk ke arah yang berlawanan. MiniMax M3 adalah model dengan bobot terbuka yang dapat Anda unduh dan jalankan sendiri, dan harganya tercatat $0,30 per juta token masukan dan $1,20 per juta keluaran; GPT-6 Sol, tier menengah dari generasi GP​T-6 yang dirilis 22 September 2026, adalah $2,00 dan $10,00 pada satuan yang sama. Itu sedikit lebih dari delapan kali tarif keluaran. MiniMax M3 juga menerima video sebagai modalitas masukan, yang tidak dimiliki GPT-6 Sol — model Sol menerima teks, gambar, dan file. Yang tidak dimiliki M3 adalah skor yang bahkan tidak mendekati skor Sol: 29,2 versus 47,6 pada Intelligence Index milik Artificial Analysis, pada papan revisi v4.3.2 yang sama.

Asimetri itu adalah inti ceritanya, dan itu adalah cerita yang lebih menarik daripada sekadar pertukaran harga versus kualitas, karena kolom open-weight bisa menyimpan sesuatu yang tidak dapat dijual oleh kolom tertutup pada harga berapa pun: checkpoint M3 ada di Hugging Face dan modelnya dapat dijalankan di dalam batas jaringan. Jika Anda memilih di antara keduanya, pertanyaan yang berguna bukanlah mana yang lebih baik. Melainkan, dari empat hal terpisah yang Anda beli — harga, throughput, kontrol, atau kemampuan — mana yang dapat Anda relakan untuk hilang.

Empat dimensi, dan mereka tidak menempati peringkat dengan cara yang sama

• Harga output — GPT-6 Sol $10.00 per juta vs MiniMax M3 $1.20 per juta
• Harga input — GPT-6 Sol $2.00 per juta vs MiniMax M3 $0.30 per juta
• Input yang di-cache — GPT-6 Sol $0.20 per juta vs MiniMax M3 $0.06 per juta
• Bobot — GPT-6 Sol tertutup, hanya API vs MiniMax M3 bobot terbuka dan dapat dihosting sendiri
• Modalitas input — GPT-6 Sol teks, gambar, dan file vs MiniMax M3 teks, gambar, dan video
• Jendela konteks — GPT-6 Sol 1,050,000 token vs MiniMax M3 1,048,576 token
• Output maksimum — GPT-6 Sol 128,000 token vs MiniMax M3 512,000 token
• Indeks Kecerdasan — GPT-6 Sol 47.6 vs MiniMax M3 29.2
• Indeks coding — GPT-6 Sol tidak dipublikasikan pada revisi ini vs MiniMax M3 58.6
• Tingkatan permintaan panjang — GPT-6 Sol menetapkan harga ulang seluruh permintaan di atas 272,000 token input vs MiniMax M3 tidak ada tingkatan pada kartunya

Dua dari baris-baris itu layak mendapat lebih dari sekadar satu baris. Plafon output maksimum bergerak berlawanan arah dengan semua hal lainnya: M3 akan mengeluarkan hingga 512.000 token dalam satu respons, empat kali lipat dari 128.000 milik GPT-6 Sol. Untuk beban kerja yang menghasilkan seluruh berkas atau laporan panjang dalam satu panggilan, itu adalah keunggulan struktural, bukan kesalahan pembulatan. Dan tahap permintaan panjang adalah biaya GPT-6 Sol yang nyata yang sama sekali tidak dimiliki M3 — di atas 272.000 token masukan, Sol menetapkan ulang harga seluruh permintaan menjadi $4,00 / $15,00, sedangkan kartu M3 tidak memuat klausul yang setara. Pada prompt 300.000 token, perbandingan tarif output bukan delapan kali, melainkan dua belas setengah kali.

Jadi, peringkat yang jujur sepenuhnya bergantung pada beban kerja. Untuk klasifikasi atau ekstraksi bervolume tinggi yang jawaban salahnya murah dan jawaban lambatnya tidak, M3 pada $0.30 / $1.20 tanpa penalti konteks panjang adalah default yang masuk akal dan Sol adalah uang yang dibakar. Untuk tugas yang jawaban pertamanya harus benar — rencana migrasi, tinjauan keamanan, bagian penalaran yang akan dibaca oleh orang yang akan bertindak berdasarkan itu — selisih indeks 18,4 poin dengan harga output delapan kali lipat adalah trade-off yang diambil sebagian besar tim, karena alternatifnya adalah membayar manusia untuk memperbaikinya.

Generated comparison scoreboard titled GPT-6 Sol vs MiniMax M3, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, weights closed, Intelligence Index 47.6, context window 1,050,000 tokens, reprices above 272K input tokens. MiniMax M3: input $0.30 per million, output $1.20 per million, weights open and downloadable, Intelligence Index 29.2, context window 1,048,576 tokens, no long-request step. A footer reads MiniMax M3 figures per Artificial Analysis v4.3.2 and MiniMax; GPT-6 Sol figures per Artificial Analysis v4.3.2 and OpenAI.

Di mana angka-angka yang dipublikasikan M3 luar biasa bagus, dan di mana angka-angka itu minim.

Angka-angka independen terkuat MiniMax M3 tidak berada di tempat yang Anda duga dari model pada harga ini. Recall konteks panjang mencapai 83,0, yaitu 0,7 di bawah 83,7 milik GPT-6 Sol dan praktis imbang — pada jendela satu juta token, dengan seperenam harga input. GPQA Diamond mencatat 92,9, cukup dekat dengan pita terdepan sehingga selisihnya berada dalam rentang yang Anda perkirakan berasal dari pengaturan upaya penalaran, bukan dari kemampuan. Kedua baris itulah alasan M3 layak ditanggapi serius, bukan sekadar dimasukkan ke kategori "murah".

Bagian-bagian yang lemah sama jelasnya dan harus dinyatakan, bukan ditutup-tutupi. Penggunaan tool bergaya ritel buruk: pada tau-banking M3 nilainya 15,3, dan pada revisi Terminal-Bench 4.0 yang lebih baru nilainya 2,0. Keduanya adalah pengukuran pihak ketiga, dan keduanya menunjukkan model yang rata-rata benchmark-nya menyembunyikan kelemahan besar yang spesifik dalam pemanggilan tool agentic terhadap layanan simulasi. Angka yang dilaporkan vendor sendiri memberi gambaran yang jauh lebih baik — SWE-Bench Pro 59, BrowseComp 83,5, MCP Atlas 74,2, Terminal-Bench 2.1 sebesar 66 — dan itu adalah angka vendor pada harness miliknya sendiri, yang merupakan klaim, bukan pengukuran. Deployment apa pun yang bergantung pada penggunaan tool harus membaca kedua angka itu bersama-sama dan mengujinya secara langsung.

Ada poin tingkat kedua tentang perbandingan benchmark itu sendiri. GPT-6 Sol diukur pada kumpulan benchmark yang lebih kecil dalam katalog kami dibandingkan M3 — lima skor versus dua puluh tiga milik M3 — karena vendor menerbitkan lebih sedikit dan pihak ketiga telah menjalankan lebih sedikit pengujian terhadapnya. Model dengan dua puluh tiga angka yang dipublikasikan akan selalu tampak dievaluasi lebih menyeluruh daripada model dengan lima angka, dan perbedaannya adalah dokumentasi, bukan kemampuan.

Apa yang Sebenarnya Anda Dapatkan dari Bobot Terbuka, di Luar Tagihan yang Lebih Rendah

Melakukan self-hosting M3 adalah opsi yang tidak dapat ditandingi GPT-6 Sol, dan nilainya tidak terutama bersifat finansial. Pada $0,30 / $1,20, API-nya lebih murah daripada biaya sebagian besar tim untuk menjalankan perangkat keras, jadi alasan untuk mengunduhnya adalah sebuah kendala, bukan lembar kerja: data yang tidak dapat keluar dari suatu batas, beban kerja yang tidak memiliki dependensi eksternal yang dapat diterima, fine-tune, atau anggaran latensi yang tidak dapat dipenuhi oleh endpoint bersama. Bobot terbuka adalah satu-satunya dari keempat hal itu yang dapat dijawab oleh model tertutup, dan model tertutup menjawabnya dengan tidak tersedia. Jawaban GPT-6 Sol adalah bahwa Anda tidak perlu menjalankannya — yang merupakan argumen berbeda, dan benar untuk kumpulan tim yang berbeda.

Throughput layak mendapat barisnya sendiri karena itulah angka yang tidak pernah ditunjukkan oleh sebuah demo. MiniMax M3 terukur pada sekitar 495 token keluaran per detik dalam jendela bergulir tujuh hari kami, dan GPT-6 Sol pada sekitar 244. M3 bukan hanya model yang lebih murah dalam perbandingan ini, tetapi juga yang lebih cepat di rute kami sekitar dua kali lipat, yang mengubah biaya pekerjaan batch baik dari segi waktu aktual maupun dolar. Catatan pentingnya adalah bahwa ini adalah jendela bergulir di playground bersama, bukan tolok ukur terkendali, dan angka-angka itu bergerak.

OrcaRouter model page for MiniMax M3 (minimax/minimax-m3) by MiniMax, dated 2026-05-31, tagged Vision, Tools, JSON and Reasoning, describing it as MiniMax's flagship open-weight foundation model with a 1M-token context window and text, image and video input, listing $0.30 per million input and $1.20 per million output, with a model-page note that it is available through OrcaRouter under the model id minimax/minimax-m3.

Menjalankan pasangan tersebut sebagai satu sistem

Kedua model berada di balik satu kunci OrcaRouter bersama 200+ lainnya, yang membuat konfigurasi menarik di sini menjadi kaskade yang mengutamakan yang murah alih-alih sebuah pilihan. Arahkan volume ke MiniMax M3, pertahankan GPT-6 Sol di belakangnya untuk permintaan yang gagal pemeriksaan atau memicu sinyal kesulitan, dan biaya campuran akan jauh lebih mendekati tarif open-weight daripada tarif Sol, sementara panggilan sulit tetap mendapatkan model yang mencetak skor 47.6. DSL routing OrcaRouter adalah tempat komposisi itu dinyatakan — sebuah panggilan dapat menyebutkan beberapa model dan kondisi di antaranya alih-alih melakukan hard-code pada satu endpoint per tugas.

Bagi tim yang benar-benar tidak dapat memutuskan, fusi model adalah versi kasar dari gagasan yang sama: panel model menjawab bersama-sama dan responsnya digabungkan. Ini kurang cocok untuk pekerjaan bervolume tinggi dan cukup cocok untuk prompt berisiko tinggi yang jarang dijalankan, di mana perbedaan antara jawaban 29,2 dan 47,6 adalah satu-satunya hal di halaman.

Failover lebih penting pada model open-weight dibandingkan model tertutup, dan karena alasan yang spesifik: M3 dilayani oleh lebih dari satu penyedia infrastruktur, dan endpoint-nya berbeda. Rute kedua yang dikonfigurasi sebelumnya berarti host yang lambat atau kinerjanya menurun hanya perlu dicoba ulang, bukan menjadi pemadaman layanan. Dan karena katalog kami meneruskan harga daftar penyedia tanpa markup, perubahan tarif vendor langsung berlaku di sisi kami pada hari yang sama — yang penting pada baris output $1,20, ketika vendor mengubah satu tarif input yang di-cache saja sudah terlihat mengubah tagihan.

Artificial Analysis model page for MiniMax-M3, described as an open-weights model released June 2026, showing an Intelligence rank of 18 of 117 with an Intelligence Index of 29 on a comparable-model median of 18, an output speed rating above average, a 1M-token context window, and support for text, image and video input with text output.

Yang mana yang sebenarnya harus kamu telepon

Gunakan MiniMax M3 untuk volume, untuk apa pun yang membutuhkan input video, untuk apa pun yang perlu mengeluarkan lebih dari 128.000 token dalam satu respons, dan untuk apa pun yang harus berjalan di dalam perimeter Anda sendiri. Gunakan GPT-6 Sol untuk permintaan yang jawabannya adalah produknya, untuk loop agentic yang berat alat di mana skor tau-banking dan Terminal-Bench 4.0 M3 menjadi peringatan alih-alih catatan kaki, dan untuk apa pun di mana perbedaan indeks 18 poin bernilai delapan kali laju keluaran bagi Anda. Gunakan keduanya, dan biarkan router yang memutuskan, jika tidak satu pun dari itu menggambarkan seluruh lalu lintas Anda.

Satu hal yang perlu diperiksa sebelum keduanya, dan ini adalah titik pemeriksaan yang sama yang terus dihadapi blog ini: M3 telah menjadi unggulan lini M-series sejak Mei 2026 dan tetap menjadi model M-series terbaru di katalog kami, jadi model ini benar-benar terkini — tetapi GPT-6 Sol sudah digantikan oleh GPT-6.1 Sol dengan tarif konteks pendek yang sama serta input cache yang lebih murah, dan halaman GPT-6 Sol miliknya sendiri memuat penunjuk ke sana. Jika alasan Anda melihat Sol di sini adalah kemampuan, bukan integrasi yang berusia delapan hari itu, lihat dulu penerusnya.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari