
GPT-6 Sol vs MiniMax M3: Apa yang Tetap Tidak Dapat Dibeli dengan Harga Output Delapan Kali Lipat
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Hal pertama yang perlu dikatakan tentang GPT-6 Sol versus MiniMax M3 adalah bahwa soal harga tidak dekat dan soal skor juga tidak dekat, dan keduanya menunjuk ke arah yang berlawanan. MiniMax M3 adalah model dengan bobot terbuka yang dapat Anda unduh dan jalankan sendiri, dan harganya tercatat $0,30 per juta token masukan dan $1,20 per juta keluaran; GPT-6 Sol, tier menengah dari generasi GPT-6 yang dirilis 22 September 2026, adalah $2,00 dan $10,00 pada satuan yang sama. Itu sedikit lebih dari delapan kali tarif keluaran. MiniMax M3 juga menerima video sebagai modalitas masukan, yang tidak dimiliki GPT-6 Sol — model Sol menerima teks, gambar, dan file. Yang tidak dimiliki M3 adalah skor yang bahkan tidak mendekati skor Sol: 29,2 versus 47,6 pada Intelligence Index milik Artificial Analysis, pada papan revisi v4.3.2 yang sama.
Asimetri itu adalah inti ceritanya, dan itu adalah cerita yang lebih menarik daripada sekadar pertukaran harga versus kualitas, karena kolom open-weight bisa menyimpan sesuatu yang tidak dapat dijual oleh kolom tertutup pada harga berapa pun: checkpoint M3 ada di Hugging Face dan modelnya dapat dijalankan di dalam batas jaringan. Jika Anda memilih di antara keduanya, pertanyaan yang berguna bukanlah mana yang lebih baik. Melainkan, dari empat hal terpisah yang Anda beli — harga, throughput, kontrol, atau kemampuan — mana yang dapat Anda relakan untuk hilang.
Empat dimensi, dan mereka tidak menempati peringkat dengan cara yang sama
• Harga output — GPT-6 Sol $10.00 per juta vs MiniMax M3 $1.20 per juta
• Harga input — GPT-6 Sol $2.00 per juta vs MiniMax M3 $0.30 per juta
• Input yang di-cache — GPT-6 Sol $0.20 per juta vs MiniMax M3 $0.06 per juta
• Bobot — GPT-6 Sol tertutup, hanya API vs MiniMax M3 bobot terbuka dan dapat dihosting sendiri
• Modalitas input — GPT-6 Sol teks, gambar, dan file vs MiniMax M3 teks, gambar, dan video
• Jendela konteks — GPT-6 Sol 1,050,000 token vs MiniMax M3 1,048,576 token
• Output maksimum — GPT-6 Sol 128,000 token vs MiniMax M3 512,000 token
• Indeks Kecerdasan — GPT-6 Sol 47.6 vs MiniMax M3 29.2
• Indeks coding — GPT-6 Sol tidak dipublikasikan pada revisi ini vs MiniMax M3 58.6
• Tingkatan permintaan panjang — GPT-6 Sol menetapkan harga ulang seluruh permintaan di atas 272,000 token input vs MiniMax M3 tidak ada tingkatan pada kartunya
Dua dari baris-baris itu layak mendapat lebih dari sekadar satu baris. Plafon output maksimum bergerak berlawanan arah dengan semua hal lainnya: M3 akan mengeluarkan hingga 512.000 token dalam satu respons, empat kali lipat dari 128.000 milik GPT-6 Sol. Untuk beban kerja yang menghasilkan seluruh berkas atau laporan panjang dalam satu panggilan, itu adalah keunggulan struktural, bukan kesalahan pembulatan. Dan tahap permintaan panjang adalah biaya GPT-6 Sol yang nyata yang sama sekali tidak dimiliki M3 — di atas 272.000 token masukan, Sol menetapkan ulang harga seluruh permintaan menjadi $4,00 / $15,00, sedangkan kartu M3 tidak memuat klausul yang setara. Pada prompt 300.000 token, perbandingan tarif output bukan delapan kali, melainkan dua belas setengah kali.
Jadi, peringkat yang jujur sepenuhnya bergantung pada beban kerja. Untuk klasifikasi atau ekstraksi bervolume tinggi yang jawaban salahnya murah dan jawaban lambatnya tidak, M3 pada $0.30 / $1.20 tanpa penalti konteks panjang adalah default yang masuk akal dan Sol adalah uang yang dibakar. Untuk tugas yang jawaban pertamanya harus benar — rencana migrasi, tinjauan keamanan, bagian penalaran yang akan dibaca oleh orang yang akan bertindak berdasarkan itu — selisih indeks 18,4 poin dengan harga output delapan kali lipat adalah trade-off yang diambil sebagian besar tim, karena alternatifnya adalah membayar manusia untuk memperbaikinya.

Di mana angka-angka yang dipublikasikan M3 luar biasa bagus, dan di mana angka-angka itu minim.
Angka-angka independen terkuat MiniMax M3 tidak berada di tempat yang Anda duga dari model pada harga ini. Recall konteks panjang mencapai 83,0, yaitu 0,7 di bawah 83,7 milik GPT-6 Sol dan praktis imbang — pada jendela satu juta token, dengan seperenam harga input. GPQA Diamond mencatat 92,9, cukup dekat dengan pita terdepan sehingga selisihnya berada dalam rentang yang Anda perkirakan berasal dari pengaturan upaya penalaran, bukan dari kemampuan. Kedua baris itulah alasan M3 layak ditanggapi serius, bukan sekadar dimasukkan ke kategori "murah".
Bagian-bagian yang lemah sama jelasnya dan harus dinyatakan, bukan ditutup-tutupi. Penggunaan tool bergaya ritel buruk: pada tau-banking M3 nilainya 15,3, dan pada revisi Terminal-Bench 4.0 yang lebih baru nilainya 2,0. Keduanya adalah pengukuran pihak ketiga, dan keduanya menunjukkan model yang rata-rata benchmark-nya menyembunyikan kelemahan besar yang spesifik dalam pemanggilan tool agentic terhadap layanan simulasi. Angka yang dilaporkan vendor sendiri memberi gambaran yang jauh lebih baik — SWE-Bench Pro 59, BrowseComp 83,5, MCP Atlas 74,2, Terminal-Bench 2.1 sebesar 66 — dan itu adalah angka vendor pada harness miliknya sendiri, yang merupakan klaim, bukan pengukuran. Deployment apa pun yang bergantung pada penggunaan tool harus membaca kedua angka itu bersama-sama dan mengujinya secara langsung.
Ada poin tingkat kedua tentang perbandingan benchmark itu sendiri. GPT-6 Sol diukur pada kumpulan benchmark yang lebih kecil dalam katalog kami dibandingkan M3 — lima skor versus dua puluh tiga milik M3 — karena vendor menerbitkan lebih sedikit dan pihak ketiga telah menjalankan lebih sedikit pengujian terhadapnya. Model dengan dua puluh tiga angka yang dipublikasikan akan selalu tampak dievaluasi lebih menyeluruh daripada model dengan lima angka, dan perbedaannya adalah dokumentasi, bukan kemampuan.
Apa yang Sebenarnya Anda Dapatkan dari Bobot Terbuka, di Luar Tagihan yang Lebih Rendah
Melakukan self-hosting M3 adalah opsi yang tidak dapat ditandingi GPT-6 Sol, dan nilainya tidak terutama bersifat finansial. Pada $0,30 / $1,20, API-nya lebih murah daripada biaya sebagian besar tim untuk menjalankan perangkat keras, jadi alasan untuk mengunduhnya adalah sebuah kendala, bukan lembar kerja: data yang tidak dapat keluar dari suatu batas, beban kerja yang tidak memiliki dependensi eksternal yang dapat diterima, fine-tune, atau anggaran latensi yang tidak dapat dipenuhi oleh endpoint bersama. Bobot terbuka adalah satu-satunya dari keempat hal itu yang dapat dijawab oleh model tertutup, dan model tertutup menjawabnya dengan tidak tersedia. Jawaban GPT-6 Sol adalah bahwa Anda tidak perlu menjalankannya — yang merupakan argumen berbeda, dan benar untuk kumpulan tim yang berbeda.
Throughput layak mendapat barisnya sendiri karena itulah angka yang tidak pernah ditunjukkan oleh sebuah demo. MiniMax M3 terukur pada sekitar 495 token keluaran per detik dalam jendela bergulir tujuh hari kami, dan GPT-6 Sol pada sekitar 244. M3 bukan hanya model yang lebih murah dalam perbandingan ini, tetapi juga yang lebih cepat di rute kami sekitar dua kali lipat, yang mengubah biaya pekerjaan batch baik dari segi waktu aktual maupun dolar. Catatan pentingnya adalah bahwa ini adalah jendela bergulir di playground bersama, bukan tolok ukur terkendali, dan angka-angka itu bergerak.

Menjalankan pasangan tersebut sebagai satu sistem
Kedua model berada di balik satu kunci OrcaRouter bersama 200+ lainnya, yang membuat konfigurasi menarik di sini menjadi kaskade yang mengutamakan yang murah alih-alih sebuah pilihan. Arahkan volume ke MiniMax M3, pertahankan GPT-6 Sol di belakangnya untuk permintaan yang gagal pemeriksaan atau memicu sinyal kesulitan, dan biaya campuran akan jauh lebih mendekati tarif open-weight daripada tarif Sol, sementara panggilan sulit tetap mendapatkan model yang mencetak skor 47.6. DSL routing OrcaRouter adalah tempat komposisi itu dinyatakan — sebuah panggilan dapat menyebutkan beberapa model dan kondisi di antaranya alih-alih melakukan hard-code pada satu endpoint per tugas.
Bagi tim yang benar-benar tidak dapat memutuskan, fusi model adalah versi kasar dari gagasan yang sama: panel model menjawab bersama-sama dan responsnya digabungkan. Ini kurang cocok untuk pekerjaan bervolume tinggi dan cukup cocok untuk prompt berisiko tinggi yang jarang dijalankan, di mana perbedaan antara jawaban 29,2 dan 47,6 adalah satu-satunya hal di halaman.
Failover lebih penting pada model open-weight dibandingkan model tertutup, dan karena alasan yang spesifik: M3 dilayani oleh lebih dari satu penyedia infrastruktur, dan endpoint-nya berbeda. Rute kedua yang dikonfigurasi sebelumnya berarti host yang lambat atau kinerjanya menurun hanya perlu dicoba ulang, bukan menjadi pemadaman layanan. Dan karena katalog kami meneruskan harga daftar penyedia tanpa markup, perubahan tarif vendor langsung berlaku di sisi kami pada hari yang sama — yang penting pada baris output $1,20, ketika vendor mengubah satu tarif input yang di-cache saja sudah terlihat mengubah tagihan.

Yang mana yang sebenarnya harus kamu telepon
Gunakan MiniMax M3 untuk volume, untuk apa pun yang membutuhkan input video, untuk apa pun yang perlu mengeluarkan lebih dari 128.000 token dalam satu respons, dan untuk apa pun yang harus berjalan di dalam perimeter Anda sendiri. Gunakan GPT-6 Sol untuk permintaan yang jawabannya adalah produknya, untuk loop agentic yang berat alat di mana skor tau-banking dan Terminal-Bench 4.0 M3 menjadi peringatan alih-alih catatan kaki, dan untuk apa pun di mana perbedaan indeks 18 poin bernilai delapan kali laju keluaran bagi Anda. Gunakan keduanya, dan biarkan router yang memutuskan, jika tidak satu pun dari itu menggambarkan seluruh lalu lintas Anda.
Satu hal yang perlu diperiksa sebelum keduanya, dan ini adalah titik pemeriksaan yang sama yang terus dihadapi blog ini: M3 telah menjadi unggulan lini M-series sejak Mei 2026 dan tetap menjadi model M-series terbaru di katalog kami, jadi model ini benar-benar terkini — tetapi GPT-6 Sol sudah digantikan oleh GPT-6.1 Sol dengan tarif konteks pendek yang sama serta input cache yang lebih murah, dan halaman GPT-6 Sol miliknya sendiri memuat penunjuk ke sana. Jika alasan Anda melihat Sol di sini adalah kemampuan, bukan integrasi yang berusia delapan hari itu, lihat dulu penerusnya.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
