OpenAI GPT-4.1 Mini: penalaran efisien biaya dengan konteks 1M, input gambar, dan skor MATH-500 yang kuat
Model ini adalah versi yang diperkecil dari keluarga GPT-4.1 milik OpenAI, yang secara spesifik dirilis pada 14 April 2025. Model ini dirancang untuk memberikan performa penalaran dan pengikutan…
Model ini unggul dalam tugas-tugas yang menggabungkan penalaran dengan konteks dalam jumlah besar, seperti analisis dokumen, peringkasan dokumen panjang, pemahaman kode, dan instruksi multi-langkah yang kompleks. Skor MATH-500 yang kuat (92,5) menunjukkan kemahiran dalam pemecahan masalah matematika. Model ini juga dapat menangani tugas berbasis gambar seperti mendeskripsikan gambar, mengekstrak teks dari foto (OCR), dan menjawab pertanyaan tentang konten visual. Unggahan file memungkinkannya bekerja dengan PDF, spreadsheet, dan data terstruktur lainnya.
Anda sebaiknya menggunakan model ini ketika tugas memerlukan penalaran yang kuat, jendela konteks yang sangat besar, atau kemampuan multimodal. Model yang lebih murah (misalnya, GPT-4.1 mini sendiri sudah menjadi opsi yang murah; tetapi jika dibandingkan dengan model yang lebih kecil seperti GPT-3.5 Turbo) mungkin kurang memiliki akurasi yang dibutuhkan untuk matematika, logika, atau ketergantungan jarak jauh. Jika aplikasi Anda membutuhkan konteks token 1M secara penuh atau perlu menafsirkan gambar, model ini sangat cocok. Untuk klasifikasi teks sederhana atau respons pendek, model yang lebih ringan mungkin lebih hemat biaya.
Pertimbangkan untuk beralih ke GPT-4.1 (full) atau GPT-4o jika tugas Anda memerlukan akurasi yang hampir sempurna pada penalaran yang sangat kompleks, seperti pembuktian teorema tingkat lanjut, interpretasi dokumen hukum dengan nuansa, atau penulisan kreatif yang menuntut konsistensi gaya yang mendalam. Varian mini terkadang dapat menghasilkan keluaran yang kurang presisi pada kasus-kasus tepi atau saat mengikuti instruksi pemformatan yang sangat spesifik. Skor benchmark pada tes yang lebih luas (misalnya, MMLU) tidak disediakan di sini, tetapi sebagai model mini, kemungkinan kinerjanya lebih rendah dibandingkan flagship berukuran penuh pada domain penalaran tertentu.
Gambar ditokenisasi dan diproses mirip dengan cara GPT-4o menanganinya, tetapi dengan model dasar yang lebih kecil. Model ini dapat mendeskripsikan konten gambar, menjawab pertanyaan tentang elemen visual, dan mengekstrak teks dari gambar. Berkas ditangani dengan mengekstrak konten teksnya (untuk dokumen seperti PDF atau DOCX) atau dengan memperlakukannya sebagai gambar jika berisi halaman yang dipindai. Model ini tidak dirancang untuk masukan video atau audio. Untuk alur kerja yang intensif dalam penggunaan file, jendela konteks yang besar memungkinkan banyak halaman atau banyak gambar disertakan dalam satu prompt.
Model ini mencapai skor 92.5 pada tolok ukur MATH-500, yang menguji penalaran matematika di berbagai tingkat kesulitan. Ini adalah hasil yang kuat, terutama untuk model mini, dan menunjukkan bahwa model ini dapat menangani aljabar, geometri, kalkulus, dan topik matematika lainnya dengan akurasi tinggi. MATH-500 adalah subkumpulan dari dataset MATH. Sebagai konteks, banyak model yang lebih besar memperoleh skor di kisaran 90-an rendah hingga menengah, sehingga kinerja ini kompetitif dalam hal biaya dan ukuran.
Tidak ada tolok ukur langsung untuk penalaran umum (misalnya, MMLU, GSM8K) yang disediakan, tetapi berdasarkan hasil MATH-500, kemungkinan model ini berada dalam beberapa poin persentase dari varian GPT-4 yang lebih besar dalam penalaran matematika. Untuk tugas yang memerlukan pemahaman umum yang mendalam atau penalaran kreatif, model yang lebih besar biasanya memiliki keunggulan. Pengguna harus mengevaluasi pada kumpulan data mereka sendiri untuk menentukan apakah varian mini memenuhi persyaratan akurasi. Imbalannya adalah biaya dan latensi yang jauh lebih rendah.
Angka latensi yang tepat tidak disediakan, tetapi sebagai model yang lebih kecil, openai/gpt-4.1-mini-2025-04-14 umumnya menghasilkan respons lebih cepat dibandingkan versi ukuran penuhnya. Model ini dioptimalkan untuk throughput tinggi dan waktu per permintaan yang rendah, terutama untuk keluaran yang lebih pendek. Untuk tugas pembuatan teks yang panjang (mendekati keluaran maksimal 32K), latensi mungkin masih terasa, tetapi seharusnya tetap lebih rendah dibandingkan GPT-4.1 ukuran penuh. Waktu jaringan dan antrean bergantung pada infrastruktur dan beban OrcaRouter saat ini.
Model ini bukanlah yang memiliki performa terbaik di setiap kategori. Ia mungkin kesulitan dengan instruksi yang sangat bernuansa atau ambigu, dan batas pengetahuannya secara implisit terkait dengan tanggal rilis (14 April 2025). Model ini tidak dirancang untuk keputusan yang kritis terhadap keselamatan tanpa pengawasan manusia. Selain itu, karena merupakan model mini, ia memiliki lebih sedikit parameter dibandingkan versi lengkapnya, yang dapat menghasilkan output yang kurang percaya diri pada topik yang jarang atau sangat terspesialisasi. Pengguna yang menjalankan konteks yang sangat panjang mungkin mengalami sedikit penurunan dalam mengingat token awal.
OrcaRouter menggunakan tarif persis dari penyedia tanpa markup: $0,40 per 1 juta token input dan $1,60 per 1 juta token output. Token input mencakup teks prompt lengkap, tokenisasi gambar, dan teks file. Token output hanya menghitung token penyelesaian. Tidak ada biaya tambahan per permintaan atau biaya tersembunyi. Penetapan harga yang transparan ini memudahkan estimasi biaya untuk aplikasi berskala besar.
Karena OrcaRouter tidak menambahkan biaya tambahan, Anda membayar persis sesuai dengan biaya OpenAI. Hal ini menguntungkan bagi pengguna dengan volume tinggi yang mungkin akan dikenakan markup di perantara lain. Harga bersifat publik dan stabil, tanpa biaya tambahan untuk streaming atau pemrosesan batch. Perhatikan bahwa total tagihan Anda juga akan tergantung pada overhead tokenisasi gambar atau file, yang menambah jumlah token input.
Model lengkap GPT-4.1 (jika tersedia) kemungkinan besar dibanderol dengan harga lebih tinggi—seringkali beberapa kali lipat per token. Varian mini menawarkan harga yang lebih rendah sambil tetap memberikan performa yang kuat di banyak tugas. Sebagai contoh, dibandingkan dengan GPT-4o, GPT-4.1 mini biasanya lebih murah, meskipun harga pasti model lain tidak disebutkan di sini. Jika Anda dapat mentolerir akurasi yang sedikit lebih rendah pada sebagian tugas, model mini dapat secara drastis mengurangi biaya bulanan. Tidak ada penyebutan diskon caching, sehingga pengguna harus menganggap sistem penagihan berdasarkan token standar.
Kirim permintaan ke https://api.orcarouter.ai/v1/chat/completions dengan parameter model diatur ke "openai/gpt-4.1-mini-2025-04-14". API ini sepenuhnya kompatibel dengan OpenAI, sehingga Anda dapat menggunakan SDK yang sama (misalnya, pustaka openai Python, Node.js) dengan mengubah base URL. Autentikasi diperlukan melalui API key. Contoh: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; lalu panggil openai.ChatCompletion.create dengan model="openai/gpt-4.1-mini-2025-04-14".
Semua parameter standar OpenAI didukung: temperature, top_p, max_tokens, n, stop, presence_penalty, frequency_penalty, dan logit_bias. Input gambar dapat disediakan melalui array konten dengan tipe "image_url". Untuk unggahan file, Anda dapat menyertakan ID file (jika menggunakan API file OrcaRouter) atau menyematkan teks file secara langsung. Parameter max_tokens tidak boleh melebihi 32,768. Streaming didukung dengan mengatur stream=true. Format respons identik dengan struktur Chat Completion OpenAI.
Jika saat ini Anda menggunakan API OpenAI secara langsung, migrasi ke OrcaRouter hanya perlu memperbarui URL dasar dan kunci API. Jika Anda menggunakan gateway model lain, periksa apakah format permintaan Anda sesuai dengan skema OpenAI. OrcaRouter tidak memerlukan header atau wrapper khusus vendor. Untuk basis kode yang sudah ada yang menggunakan pustaka openai Python, ubah openai.api_base ke titik akhir OrcaRouter. Pastikan Anda memiliki akun OrcaRouter yang valid dan kunci API. Tidak ada perubahan kode lain yang diperlukan.
Model GPT-4.1 yang lengkap diperkirakan memiliki skor benchmark yang lebih tinggi di semua bidang, terutama pada pengetahuan umum dan penalaran yang kompleks. Namun, kemungkinan besar lebih mahal dan lebih lambat. Varian mini menawarkan rasio biaya-kinerja yang menguntungkan untuk sebagian besar tugas praktis, mengorbankan beberapa poin persentase akurasi untuk latensi yang lebih rendah secara signifikan dan biaya per token. Mini juga memiliki jendela konteks 1M yang sama dan kemampuan multimodal, sehingga perbedaannya sebagian besar terletak pada kecerdasan mentah dan kualitas output.
GPT-4o adalah model multimodal unggulan dengan kemampuan yang lebih luas, termasuk audio dan video waktu nyata. GPT-4.1 mini adalah model dari rilis yang lebih baru (April 2025) dan lebih fokus pada efisiensi daripada menjadi penerus penuh. Tanpa perbandingan tolok ukur langsung, masuk akal untuk berasumsi bahwa GPT-4o mengungguli mini dalam berbagai tugas, tetapi mini mungkin lebih murah dan lebih cepat. Pilihan tergantung pada apakah Anda membutuhkan kemampuan tambahan dari GPT-4o atau dapat menerima kompromi dari mini.
Claude Haiku adalah model cepat dan berbiaya rendah milik Anthropic dengan tujuan yang serupa. Keduanya memiliki jendela konteks yang besar (Haiku memiliki 200k token, sedangkan model ini memiliki 1M). Skor MATH-500 sebesar 92.5 menunjukkan penalaran matematika yang kompetitif. Tanpa tolok ukur berdampingan, pengguna harus mengevaluasi keduanya pada tugas spesifik mereka. Model ini mendukung input gambar secara langsung, sedangkan Haiku juga mendukung gambar. Harga mungkin berbeda; model ini memiliki biaya $0.40 per juta input yang relatif rendah. Preferensi mungkin tergantung pada ekosistem dan gaya.
GPT-3.5 Turbo adalah model lama yang lebih murah dengan kemampuan penalaran yang lebih lemah dan tidak mendukung gambar secara native. Model GPT-4.1 mini merupakan peningkatan yang substansial: mendukung gambar, memiliki konteks yang jauh lebih besar (1M vs 16K), dan skor pada tolok ukur matematika jauh lebih tinggi. GPT-3.5 Turbo masih berguna untuk tugas-tugas sederhana bervolume tinggi di mana biaya mini pun masih terlalu tinggi, tetapi untuk tugas apa pun yang memerlukan pemahaman bernuansa, model ini jauh lebih unggul. Jika Anda saat ini menggunakan GPT-3.5 Turbo, pertimbangkan untuk meningkatkan ke model ini untuk akurasi yang lebih baik.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4.1-mini-2025-04-14",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Input / 1M token | $0.400 |
| Output / 1M token | $1.60 |
| Baca cache / 1M | $0.100 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/openai/gpt-4.1-mini-2025-04-14Buka @misc{orcarouter_gpt_4_1_mini_2025_04_14,
title = {openai/gpt-4.1-mini-2025-04-14 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4.1-mini-2025-04-14}
}openai. (n.d.). openai/gpt-4.1-mini-2025-04-14 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4.1-mini-2025-04-14