
GPT-6.1 Sol vs MiniMax M3: Tarif yang Lebih Murah Kalah pada Tagihan
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
MiniMax M3 meminta sebagian kecil dari apa yang GPT-6.1 Sol meminta — $0,30 per juta token masukan versus $2,00, $1,20 per juta token keluaran versus $10,00 — dan menurut meter yang benar-benar berjalan, model ini lebih murah: $0,508 per tugas versus $0,724 pada evaluasi v4.3.2 Artificial Analysis. Itu kemenangan nyata, dan itu juga seluruh argumennya, karena pengukuran yang sama yang memberikan tagihan lebih rendah kepada M3 memberikan keunggulan indeks 22,6 poin kepada GPT-6.1 Sol, dan rangkaian tolok ukur yang mengukur apakah suatu model dapat menyelesaikan pekerjaan agentic alih-alih mendeskripsikannya mengubah kesenjangan menjadi dinding. Vendor mengirimkan GPT-6.1 Sol pada 29 September 2026. Perusahaan merilis M3, model open-weight 428 miliar parameternya, pada 31 Mei 2026.
Keduanya aktif, keduanya sudah diberi harga, dan keduanya hanya berjarak satu panggilan API. Yang berikut ini adalah perhitungan yang menentukan pilihan di antara keduanya, dan dua titik di mana perhitungan bukanlah keseluruhan ceritanya.
Apa sebenarnya masing-masing model
GPT-6.1 Sol adalah andalan OpenAI saat ini untuk penalaran dan rekayasa perangkat lunak — model tertutup, dirilis hanya sepekan setelah GPT-6 Sol yang digantikannya, dan dijual dengan harga daftar $2.00 / $10.00 yang sama seperti pendahulunya. Tarif input cache-nya $0.10, setengah dari yang dikenakan GPT-6 Sol untuk cache hit, dan itulah model yang ditunjuk OpenAI saat membahas coding agentik ketimbang chat.
MiniMax M3 adalah model mixture-of-experts dengan 428 miliar parameter total dan 23 miliar parameter aktif per token, diterbitkan di bawah MiniMax Community License — sebuah rilis open-weights dengan lisensi kustom yang bernuansa non-komersial, bukan lisensi yang disetujui OSI. Model ini dilayani oleh banyak penyedia inferensi: Artificial Analysis mencatat lima belas host untuk M3, dibandingkan delapan untuk GPT-6.1 Sol. Keluasan itu adalah keunggulan praktis dari open weights, dan itulah sebabnya persaingan harga pada M3 berlangsung lebih cepat daripada pada model tertutup.
Kartu tarif, dan meteran yang mengesampingkannya

Sejajarkan dua kartu tarif yang telah dipublikasikan itu, dan hasilnya jauh berbeda.
• Masukan — GPT-6.1 Sol $2,00 per 1 juta vs MiniMax M3 $0,30 per 1 juta; M3 85% lebih murah
• Keluaran — $10,00 per 1 juta vs $1,20 per 1 juta; M3 88% lebih murah
• Masukan cache — $0,10 per 1 juta vs $0,06 per 1 juta
• Biaya per tugas AA — $0,724 vs $0,508; M3 30% lebih murah, bukan 85%
• Token keluaran per tugas — 38.128 vs 48.192; M3 menulis 26% lebih banyak
• Waktu per tugas — 640 s vs 486 s
• Jendela konteks — 1.050.000 vs 1.048.576 token; secara efektif setara
• Keluaran maksimum — 128.000 token vs 512.000; M3 akan menulis satu jawaban yang sangat panjang
• Masukan yang diterima — teks, gambar, dan file vs teks, gambar, dan video
• Peringkat indeks — GPT-6.1 Sol ke-10 dari 147 model vs MiniMax M3 ke-62
Dua baris murah di bagian atas adalah yang dilihat oleh lembar pengadaan. Baris ketiga adalah baris yang membayar tagihan, dan di situ tertulis bahwa keunggulan rate card sebesar 85–88% menjadi keunggulan dunia nyata sebesar 30%, karena M3 mengeluarkan lebih banyak token per tugas dan karena tugas bukanlah kuantitas pekerjaan yang tetap. Rate card menetapkan harga token; pekerjaan dihargai dalam tugas. Perbandingan apa pun yang berhenti pada dua baris pertama membandingkan angka yang salah, dalam satuan yang salah.
Ketika tiga puluh persen tidak lagi penting
Biaya tugasnya cukup dekat sehingga selisih indeks yang menentukan untuk apa pun di luar teks massal. Artificial Analysis menempatkan GPT-6.1 Sol di 51,83 dan MiniMax M3 di 29,22 — selisih 22,6 poin, dan selisih itu tidak terdistribusi secara merata di seluruh rangkaian evaluasi. Pada evaluasi yang meminta model mengoperasikan terminal, mengedit repositori, dan memverifikasi pekerjaannya sendiri, kedua model itu tidak berada dalam kategori yang sama:
• Terminal-Bench 4.0 GPT-6.1 Sol 0.5606 vs MiniMax M3 0.0202
• Terminal-Bench Science — 0.581 vs 0.0048
• AA-Omniscience — 41.53 vs 1.35
• MMLU-Pro — 0.8595 vs 0.7856
• AutomationBench — 0.6487 vs 0.2125
• τ²-bench — tidak dipublikasikan untuk GPT-6.1 Sol dalam uji coba ini vs 0.8889 untuk M3
• GPQA Diamond — tidak dipublikasikan untuk GPT-6.1 Sol dalam uji coba ini vs 0.9293 untuk M3
• CritPT — 0.3171 vs 0.0371
Baca itu dengan saksama, karena ini bukan sapu bersih dan pengecualiannya adalah bagian yang menarik. MiniMax M3 mencetak 0,8889 pada τ²-bench, evaluasi dialog penggunaan alat dan layanan pelanggan, dan 0,9293 pada GPQA Diamond — skor sains tingkat pascasarjana yang mengalahkan setiap angka OpenAI yang dipublikasikan dalam pengujian khusus ini. M3 adalah penalar yang kompeten dan pengguna alat yang baik dalam percakapan. Pada Terminal-Bench 4.0, skornya 0,0202. Itu bukan "lebih buruk"; itu adalah model yang sama sekali tidak mampu menjaga tugas repositori multi-langkah tetap konsisten, dan tidak ada diskon token yang membuat tugas yang gagal dikerjakan model lebih murah daripada tugas yang diselesaikan model.
Ada biaya orde kedua yang disembunyikan oleh angka per tugas. M3 mencatat 48.192 token keluaran per tugas dan waktu-ke-jawaban-pertama 23,0 detik, dibandingkan 332,0 detik milik GPT-6.1 Sol — model kecil mulai berbicara hampir seketika lalu bernalar panjang lebar. Jika beban kerja Anda sensitif terhadap latensi tetapi dangkal, itu merupakan satu poin yang menguntungkan M3. Jika bersifat agentik, jumlah token adalah yang Anda bayar dan skor akhir adalah yang Anda peroleh.
Kartu model kami sendiri untuk GPT-6.1 Sol memuat angka-angka yang sama dalam bentuk yang benar-benar akan Anda gunakan sebagai acuan perutean: tarif $2,00 / $10,00, jendela konteks 1.050.000 token, p50 ke token pertama sebesar 4,54 detik, serta indeks Artificial Analysis dan blok benchmark yang berada di halaman yang sama.

Berapa nilai bobot terbuka di sini
Fakta bahwa M3 dapat diunduh adalah argumen terkuat untuknya, dan ada baiknya kita tepat mengenai apa manfaatnya. Ini memberi Anda ketentuan lisensi yang memungkinkan Anda menjalankan model di dalam batas Anda sendiri — berguna jika data tidak boleh keluar — dan ini memberi Anda persaingan harga yang berasal dari lima belas host independen. Ini tidak memberi Anda deployment murah: 428 miliar parameter dengan 23 miliar aktif tetap memerlukan perangkat keras inferensi yang serius, dan MiniMax Community License adalah lisensi khusus dengan syarat yang melekat, bukan lisensi tanpa batasan. Bagi sebagian besar tim, "bobot terbuka" berarti harga yang lebih baik untuk inferensi yang dihosting, bukan sebuah kotak di rak.
Kartu OrcaRouter untuk MiniMax M3 adalah tempat angka-angka yang disajikan berada: tarif $0,30 / $1,20, jendela konteks 1.048.576 token, keluaran maksimum 512.000 token, masukan teks/gambar/video, dan volume tujuh hari sebesar 56,4 juta token di antara penyedia yang merutekannya.

Keduanya di balik satu kunci
Alasan praktis mengapa perbandingan ini merupakan perubahan konfigurasi dan bukan migrasi adalah bahwa kedua model dapat dijangkau dari satu endpoint OrcaRouter — satu API untuk 200+ model, dengan harga daftar penyedia diteruskan pada markup 0%, yang berarti perubahan tarif MiniMax muncul di tagihan Anda pada hari yang sama saat vendor mempublikasikannya, bukan kapan pun reseller menegosiasikan ulang. Hal itu lebih penting bagi M3 daripada bagi rivalnya: alasan utamanya untuk merutekan ke model open-weight adalah harganya dan daftar host-nya bergerak, dan meteran pass-through adalah satu-satunya jenis yang melacak target bergerak.
Failover otomatis adalah separuh lainnya. M3 dilayani oleh banyak penyedia dengan tingkat keandalan yang berbeda-beda, dan lapisan perutean dapat memindahkan permintaan ke host lain saat salah satunya menurun, tanpa pemanggil mengetahui di host mana permintaan itu mendarat. Itulah cara yang jujur untuk mengadopsi model yang skor Terminal-Bench-nya berkata "bukan untuk jalur kritis" — tempatkan model itu di posisi yang percobaan ulangnya murah.
Yang mana, jika kamu harus memilih hari ini
Jika pekerjaannya adalah teks massal — ekstraksi, peringkasan, klasifikasi, dialog, apa pun yang outputnya berupa prosa dan mode kegagalannya adalah kalimat yang salah, bukan build yang rusak — MiniMax M3 adalah default yang tepat dan tiga puluh persen itu uang nyata. Gunakan angka GPQA dan τ²-bench sebagai bukti Anda: ini adalah model yang cakap yang kebetulan murah.
Jika pekerjaannya bersifat agentik — repositori, terminal, rantai alat, apa pun yang memiliki langkah verifikasi — skor 0.0202 pada Terminal-Bench 4.0 berarti tidak memenuhi syarat, dan GPT-6.1 Sol dengan skor 0.5606 seharga $0.724 per tugas adalah tawaran yang lebih baik bahkan dengan biaya 85% lebih tinggi per token. Daftar tarif tidak pernah menjadi hal yang Anda beli.
Jawaban yang berguna adalah Anda tidak harus memilih sekali saja. Arahkan tier dangkal ke M3, arahkan tier agentic ke GPT-6.1 Sol, dan jaga keduanya tetap di balik satu kredensial — DSL routing menggabungkan keduanya menjadi satu panggilan ketika suatu tugas dimulai sebagai ekstraksi dan berubah menjadi pekerjaan perbaikan.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
