GPT-4o mini adalah model terbaru OpenAI setelah [GPT-4 Omni](/models/openai/gpt-4o), yang mendukung input teks dan gambar dengan output teks. Sebagai model kecil mereka yang paling canggih, harganya berkali-kali lipat lebih terjangkau...
GPT-4o-mini adalah varian yang lebih kecil dan lebih cepat dari model GPT-4o milik OpenAI, dioptimalkan untuk biaya komputasi yang lebih rendah namun tetap mempertahankan kemampuan multimodal. Model…
GPT-4o-mini unggul dalam berbagai tugas bahasa, termasuk peringkasan, penerjemahan, klasifikasi, dan menjawab pertanyaan. Ia mendukung output JSON terstruktur, pemanggilan fungsi, dan penggunaan alat, memungkinkan integrasi dengan API dan basis data eksternal. Jendela konteks 128K memungkinkannya untuk menyerap dokumen besar atau riwayat percakapan untuk analisis yang koheren. Ia berkinerja baik pada tolok ukur umum (skor MATH-500 sebesar 78.9) dan cocok untuk soal matematika pendidikan, penjelasan kode, dan ekstraksi data. Untuk tugas yang lebih sederhana, GPT-4o-mini seringkali menyamai model yang lebih besar dengan biaya yang jauh lebih rendah. Namun, tugas yang membutuhkan keahlian domain mendalam atau keluaran yang sangat kreatif mungkin mengalami penurunan kualitas dibandingkan dengan GPT-4o.
Gambar dapat disediakan sebagai URL atau data yang dikodekan dalam base64 dalam permintaan API. Model ini menafsirkan gambar, memahami konten visual seperti objek, teks dalam gambar, dan hubungan spasial. Hal ini memungkinkan kasus penggunaan seperti tanya jawab visual, interpretasi diagram, dan pengenalan digit tulisan tangan. Token gambar diperhitungkan dalam batas konteks, sehingga gambar beresolusi tinggi atau berukuran besar mengonsumsi lebih banyak anggaran 128K token. Model ini tidak menghasilkan gambar; hanya memprosesnya. Untuk tugas yang memerlukan detail visual yang sangat halus (misalnya, pencitraan medis), model visi khusus mungkin lebih akurat, tetapi GPT-4o-mini menawarkan solusi serba guna dengan biaya yang wajar.
GPT-4o-mini menerima file yang diunggah selain teks dan gambar. Jenis file umum termasuk PDF, .docx, .txt, .csv, dan .json. Model mengekstrak teks dan elemen visual yang relevan (jika file berisi gambar yang disematkan) dan memprosesnya sebagai bagian dari konteks. Ini berguna untuk menganalisis makalah penelitian, kontrak hukum, atau spreadsheet tanpa perlu menyalin secara manual. Perhatikan bahwa konten file berkontribusi pada penggunaan token; misalnya, PDF setebal 50 halaman dapat menghabiskan beberapa ribu token. OrcaRouter mengenakan biaya berdasarkan total token input, termasuk yang berasal dari file. Tidak ada biaya pemrosesan file tambahan di luar konsumsi token.
Jika beban kerja Anda hanya melibatkan teks tanpa gambar atau file, dan konteks yang diperlukan berada di bawah 16K token, model yang lebih kecil (seperti GPT-3.5-turbo) mungkin menawarkan biaya per token yang lebih rendah. Demikian pula, untuk tugas dengan throughput tinggi seperti klasifikasi sederhana atau T&J sepele, model yang disesuaikan (fine-tuned) secara khusus mungkin lebih ekonomis. GPT-4o-mini hemat biaya untuk kasus penggunaan multimodal atau konteks panjang, tetapi kekuatannya terletak pada menyeimbangkan kinerja dan harga. Jika aplikasi Anda dapat mentolerir respons yang lebih lambat atau biaya yang lebih tinggi untuk akurasi maksimal, GPT-4o adalah alternatif. Lakukan benchmarking pada tugas spesifik Anda untuk memastikan model mana yang memenuhi ambang batas kualitas dan anggaran Anda.
MATH-500 adalah subset dari tolok ukur MATH, yang terdiri dari 500 soal matematika tingkat kompetisi yang mencakup aljabar, geometri, teori bilangan, dan probabilitas. Skor 78.9 menunjukkan bahwa GPT-4o-mini menjawab dengan benar sekitar 78.9% dari soal-soal tersebut. Ini adalah hasil yang kuat untuk model yang lebih kecil, mencerminkan kemampuan penalaran matematisnya. Model ini melampaui banyak model sebelumnya dengan ukuran serupa. Namun, kinerja dapat bervariasi pada domain soal tertentu. Tolok ukur dilakukan dalam kondisi zero-shot, artinya tidak ada contoh sebelumnya yang diberikan. Untuk bimbingan matematika di dunia nyata, model mungkin memerlukan prompting yang hati-hati untuk menangani solusi multi-langkah dengan benar.
Meskipun satu-satunya tolok ukur yang disediakan adalah MATH-500, informasi publik yang dikenal luas menunjukkan bahwa GPT-4o-mini juga memperoleh skor kompetitif pada MMLU (pemahaman bahasa multitugas masif), HellaSwag, dan GSM8K. Biasanya peringkatnya di bawah GPT-4o tetapi di atas GPT-3.5-turbo pada metrik tersebut. Pada tolok ukur penalaran, kinerjanya kuat untuk jumlah parameternya. Pada penulisan kreatif atau generasi terbuka, keluarannya koheren tetapi mungkin kurang bernuansa dibanding model yang lebih besar. Latensi umumnya lebih rendah daripada GPT-4o, sehingga cocok untuk aplikasi waktu nyata. Untuk skor pasti, lihat dokumentasi OpenAI. OrcaRouter menyediakan akses tanpa markup tambahan.
Latensi tergantung pada kompleksitas permintaan, jumlah token, dan beban API. GPT-4o-mini dirancang agar cepat—biasanya mengembalikan token pertama dalam waktu kurang dari satu detik untuk prompt dengan panjang sedang. Untuk dokumen panjang (misalnya, 50 ribu token), latensi akan meningkat karena model memproses seluruh konteks. OrcaRouter tidak mengubah kecepatan; Anda mengalami waktu respons yang sama seperti panggilan API OpenAI secara langsung. Streaming didukung untuk mengurangi latensi yang dirasakan. Untuk aplikasi yang sensitif terhadap latensi, pertimbangkan untuk menjaga panjang prompt tetap pendek dan menggunakan streaming. Waktu tepat hingga token pertama dapat diukur dengan memantau waktu respons; tidak ada SLA khusus yang disediakan.
Meskipun cakap, GPT-4o-mini memiliki keterbatasan karena ukurannya yang lebih kecil. Model ini mungkin menghasilkan jawaban yang kurang akurat pada penalaran multi-langkah yang kompleks dibandingkan dengan GPT-4o. Kadang-kadang dapat salah menafsirkan instruksi yang bernuansa atau gagal menjaga koherensi yang sempurna dalam keluaran yang sangat panjang. Pemahaman multimodalnya baik tetapi tidak sempurna; model ini mungkin melewatkan detail kecil dalam gambar atau salah menghitung elemen. Model ini dapat menunjukkan bias yang ada dalam data pelatihannya. Model ini tidak mendukung pencarian internet atau akses data waktu nyata kecuali secara eksplisit disetel untuk penggunaan alat. Untuk tugas yang memerlukan presisi tinggi (misalnya, nasihat hukum, diagnosis medis), tinjauan manusia sangat penting. Skor tolok ukur mencerminkan kondisi yang terkendali; kinerja di dunia nyata dapat bervariasi.
OrcaRouter meneruskan harga eksak OpenAI tanpa markup: $0,15 per 1 juta token masukan dan $0,60 per 1 juta token keluaran. Token masukan mencakup semua teks, token gambar, dan konten file. Token keluaran menghitung teks yang dihasilkan. Tidak ada biaya bulanan atau biaya tersembunyi. Ini adalah salah satu biaya per token terendah untuk model multimodal dengan jendela konteks 128K. Sebagai perbandingan, GPT-4o berharga $2,50 per 1M masukan dan $10 per 1M keluaran, menjadikan GPT-4o-mini 94% lebih murah pada masukan dan 94% lebih murah pada keluaran. Keunggulan biaya ini signifikan untuk aplikasi bervolume tinggi.
Meskipun GPT-4o-mini murah per token, ukurannya yang lebih kecil mungkin memerlukan lebih banyak percobaan atau prompting yang lebih rinci untuk mencapai akurasi yang diinginkan, yang berpotensi meningkatkan konsumsi token secara keseluruhan. Untuk tugas di mana GPT-4o mendapatkan jawaban yang benar dalam satu percobaan tetapi GPT-4o-mini membutuhkan tiga, biaya keseluruhan mungkin serupa atau bahkan lebih tinggi. Selain itu, jika Anda perlu mengirimkan banyak permintaan kecil, overhead panggilan API mungkin menambah latensi tetapi bukan biaya langsung. Caching tidak diterapkan; setiap permintaan diproses secara baru. Evaluasi kasus penggunaan Anda dengan kedua model untuk menentukan keseimbangan biaya-kinerja terbaik. OrcaRouter menyediakan harga yang konsisten tanpa diskon volume.
OrcaRouter tidak menerapkan caching prompt. Setiap permintaan ke GPT-4o-mini dikirim ke server OpenAI dan ditagih per token. Tidak ada tarif diskon untuk prompt yang berulang. Jika beban kerja Anda sering mengulangi pesan sistem yang sama atau konteks yang panjang, Anda dapat mempertimbangkan untuk menyimpan respons di pihak Anda untuk menghindari pengiriman ulang prompt yang identik. Beberapa penyedia menawarkan diskon caching prompt, tetapi melalui OrcaRouter Anda membayar tarif standar penyedia. Ini transparan dan dapat diprediksi. Kurangnya caching menyederhanakan harga, tetapi berarti Anda harus merancang kueri Anda untuk meminimalkan penggunaan token yang berulang.
(Catatan: Tidak ada varian lain dari GPT-4o-mini yang disediakan. Dengan asumsi pertanyaan tentang perbandingan dengan model mini lain seperti Claude 3 Haiku atau Gemini Flash, tetapi hanya fakta yang diberikan. Sebagai gantinya, kami membandingkan dengan GPT-4o.) Dibandingkan dengan GPT-4o, GPT-4o-mini jauh lebih murah: $0,15 vs $2,50 per 1M token input (94% lebih murah) dan $0,60 vs $10 per 1M token output (94% lebih murah). Banyak pengguna menganggap GPT-4o-mini memadai untuk 80-90% tugas, memberikan penghematan besar. Namun, untuk tugas yang membutuhkan akurasi maksimum (misalnya, pembuatan kode yang kompleks, penalaran hukum yang bernuansa), penghematan biaya mungkin tidak membenarkan penurunan kualitas. OrcaRouter memungkinkan Anda beralih antar model dengan mudah melalui endpoint API yang sama dengan mengubah ID model.
Gunakan pustaka klien OpenAI atau klien HTTP apa pun, dengan mengarahkan URL dasar ke https://api.orcarouter.ai/v1. Atur parameter model menjadi "openai/gpt-4o-mini". Autentikasi memerlukan kunci API OrcaRouter. Contoh minimal Python: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) Semua parameter API OpenAI didukung, termasuk temperature, max_tokens, stream, dan tools. OrcaRouter meneruskan permintaan ke OpenAI dan mengembalikan respons tanpa perubahan.
Parameter Standar OpenAI Chat Completions: model (wajib: "openai/gpt-4o-mini"), messages (array dari objek pesan), temperature (0-2, default 1), top_p (0-1, default 1), n (jumlah respons, default 1), stream (boolean), stop (string/array), max_tokens (hingga 16384), presence_penalty, frequency_penalty, logit_bias, user (opsional), dan tools untuk pemanggilan fungsi. Untuk vision, sertakan konten gambar dalam pesan (tipe "image_url" atau "image_url" dengan detail). Input file dapat dienkode base64. OrcaRouter meneruskan semua parameter ke OpenAI. Catatan: Format respons (mode JSON) didukung; atur response_format={ "type": "json_object" } jika sesuai.
Migrasi itu sederhana: ubah URL dasar di klien Anda dari "https://api.openai.com/v1" menjadi "https://api.orcarouter.ai/v1" dan ganti kunci API Anda dengan kunci OrcaRouter. Perbarui nama model menjadi "openai/gpt-4o-mini" (atau tetap gunakan "gpt-4o-mini"? Faktanya menyebutkan id model "openai/gpt-4o-mini", jadi gunakan itu). Semua kode lainnya tetap tidak berubah karena API sepenuhnya kompatibel dengan OpenAI. Anda juga dapat menyimpan beberapa string model dan merutekan berdasarkan biaya atau kemampuan. OrcaRouter tidak mengubah format respons. Uji dengan beberapa kueri untuk memastikan header dan streaming berfungsi seperti yang diharapkan.
Ya, GPT-4o-mini mendukung streaming melalui server-sent events (SSE). Atur stream=true dalam permintaan. Respons akan berupa serangkaian potongan yang berisi konten delta. Ini mengurangi time-to-first-token bagi pengguna dan memungkinkan tampilan real-time. OrcaRouter meneruskan respons streaming tanpa modifikasi. Perhatikan bahwa jumlah token total yang ditagih tetap sama. Streaming kompatibel dengan semua modalitas input (teks, gambar, file). Anda juga dapat menggabungkan streaming dengan panggilan fungsi; model akan melakukan streaming potongan panggilan alat (tool call chunk) saat sesuai. Parameter max_tokens berlaku untuk seluruh respons.
GPT-4o-mini adalah saudara yang lebih kecil dan lebih murah dari GPT-4o. Harganya sekitar 94% lebih rendah untuk token input dan output. Ia memiliki jendela konteks 128K yang sama dan output maksimal 16K. Ia mendukung input multimodal yang sama, tetapi secara umum sedikit kurang akurat dalam penalaran kompleks dan tugas kreatif. Pada MATH-500, GPT-4o-mini mendapat skor 78,9 sementara GPT-4o mendapat skor 92+ (perkiraan). Untuk banyak tugas sehari-hari seperti dukungan pelanggan, peringkasan, dan visi sederhana, GPT-4o-mini sudah cukup. Pilih GPT-4o saat Anda membutuhkan performa terbaik dan dapat menerima latensi serta biaya yang lebih tinggi.
Perbandingan dengan model seperti Claude 3 Haiku atau Gemini 1.5 Flash: GPT-4o-mini menawarkan jendela konteks 128K, sementara Haiku memungkinkan 200K dan Flash 1M. Harga serupa (Haiku $0,25/$1,25 per 1M token; Flash $0,35/$1,05). Skor MATH-500 GPT-4o-mini sebesar 78,9 cukup kompetitif; Haiku mendapat skor sekitar 73 dan Flash sekitar 78 pada tolok ukur matematika serupa. Untuk input multimodal, ketiganya menerima gambar. GPT-4o-mini mungkin memiliki kualitas penalaran yang lebih baik untuk harganya, tetapi jendela konteks lebih kecil dibanding beberapa pesaing. Pilihan terbaik tergantung pada kebutuhan spesifik Anda akan latensi, biaya, dan kualitas. OrcaRouter juga menyediakan akses ke Haiku dan Flash, memungkinkan perbandingan berdampingan.
GPT-3.5-turbo lebih lama, memiliki jendela konteks 16K, dan biayanya sedikit lebih murah ($0.50 per 1M input vs $0.15 untuk GPT-4o-mini? Sebenarnya GPT-3.5-turbo-0125 berbiaya $0.50/$1.50 tetapi dengan konteks yang lebih kecil. Berdasarkan harga yang diberikan, GPT-4o-mini lebih murah per token dan menawarkan konteks yang lebih besar serta input multimodal. Jadi untuk sebagian besar tugas, GPT-4o-mini lebih unggul. Namun, beberapa aplikasi lama yang sudah menggunakan GPT-3.5-turbo mungkin memerlukan perubahan minimal. GPT-4o-mini juga berkinerja lebih baik pada tolok ukur penalaran. Kecuali jika latensi sangat kritis atau Anda telah melakukan fine-tune pada model GPT-3.5, GPT-4o-mini adalah upgrade pengganti langsung yang direkomendasikan.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Input / 1M token | $0.150 |
| Output / 1M token | $0.600 |
| Baca cache / 1M | $0.075 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/openai/gpt-4o-miniBuka @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini