GPT-4o mini adalah model terbaru OpenAI setelah [GPT-4 Omni](/models/openai/gpt-4o), yang mendukung input teks dan gambar dengan output teks. Sebagai model kecil mereka yang paling canggih, harganya berkali-kali lipat lebih terjangkau...
GPT-4o-mini (2024-07-18) adalah model multimodal ringan yang dikembangkan oleh OpenAI, dirancang untuk pemrosesan teks dan gambar yang hemat biaya. Model ini ditujukan bagi pengembang dan organisasi…
GPT-4o-mini dapat melakukan tugas penalaran gambar seperti mendeskripsikan konten visual, menjawab pertanyaan tentang gambar, dan mengidentifikasi objek atau teks dalam gambar. Model ini mendukung format gambar standar (JPEG, PNG, GIF, WebP) dan dapat menangani banyak gambar dalam satu permintaan. Model tidak melakukan deteksi objek dalam arti kotak pembatas terstruktur, tetapi dapat mendeskripsikan lokasi dan hubungan. Misalnya, model dapat membaca teks dari foto, memahami grafik dan diagram, serta memberikan deskripsi pemandangan yang terperinci. Akurasi tugas berbasis gambar tergantung pada resolusi dan konteks; gambar beresolusi tinggi mungkin memerlukan biaya token yang lebih besar tetapi dapat menghasilkan hasil yang lebih baik untuk detail halus.
GPT-4o-mini menerima masukan file seperti PDF, dokumen Word, dan file gambar melalui struktur konten multi-modal. Ketika sebuah file disediakan, model tersebut mengekstrak teks dan konten gambar dari file tersebut, memungkinkan pengguna untuk mengajukan pertanyaan tentang konten dokumen, meringkas teksnya, atau menganalisis tabel dan gambar yang tertanam. File tidak diunggah atau disimpan; file diproses secara langsung selama panggilan API. Ini berguna untuk alur kerja yang melibatkan peninjauan dokumen, analisis kontrak, atau mengekstrak data dari formulir yang dipindai. Perhatikan bahwa file yang sangat besar mungkin melebihi jendela konteks 128.000 token atau menimbulkan biaya token yang tinggi.
Untuk tugas yang hanya memerlukan pembuatan teks ringan, anggaran token mungkin lebih baik dialokasikan ke model yang lebih murah seperti GPT-3.5-Turbo atau alternatif sumber terbuka (misalnya, Llama 3 8B). Jika beban kerja Anda tidak memerlukan input multimodal atau konteks 128k, model yang lebih kecil dapat mengurangi biaya lebih lanjut. Selain itu, untuk tugas sempit seperti klasifikasi sederhana atau ekstraksi kata kunci, model kecil yang disesuaikan (fine-tuned) dapat menawarkan latensi dan biaya yang lebih rendah. Namun, kombinasi harga rendah, konteks besar, dan kemampuan multimodal dari GPT-4o-mini menjadikannya default yang kuat untuk banyak aplikasi tujuan umum.
GPT-4o-mini unggul dalam lingkungan produksi volume tinggi yang mendapatkan manfaat dari pemahaman multimodal dan jendela konteks yang besar. Kasus penggunaan yang ideal termasuk chatbot dukungan pelanggan yang dapat menangani tangkapan layar dan riwayat percakapan panjang, jalur pemrosesan dokumen untuk mengekstrak data dari PDF atau gambar, alat pendidikan untuk bimbingan belajar matematika (sebagaimana dibuktikan dengan skor MATH-500 78.9), dan debugging kode yang melibatkan teks dan diagram. Ini juga sangat cocok untuk alur kerja moderasi konten yang memerlukan analisis gambar bersama teks. Biaya rendah per token memungkinkan penskalaan hingga jutaan permintaan tanpa biaya yang mahal.
GPT-4o-mini mencapai skor 78,9 pada tolok ukur MATH-500, sebuah subset dari dataset MATH yang terdiri dari 500 soal matematika menantang. Skor ini menunjukkan kemampuan model dalam menyelesaikan soal aritmetika, aljabar, geometri, dan masalah matematika lainnya dengan penalaran langkah demi langkah. Skor 78,9 menempatkannya di atas banyak model yang lebih kecil dan beberapa varian GPT-4 awal, menunjukkan kemampuan penalaran yang kuat untuk model dengan ukuran dan biaya tersebut. Namun, performanya tidak sebaik GPT-4o atau GPT-4 Turbo pada tolok ukur yang sama. Hasil ini harus diinterpretasikan dalam konteks: GPT-4o-mini dirancang untuk efisiensi, bukan akurasi maksimal.
Angka latensi spesifik tidak diungkapkan secara publik oleh OpenAI, tetapi GPT-4o-mini umumnya lebih cepat daripada model GPT-4 yang lebih besar karena jumlah parameternya yang lebih kecil. Dalam praktiknya, pengguna melaporkan waktu-ke-token-pertama dalam kisaran beberapa ratus milidetik untuk prompt pendek, dan throughput generasi puluhan token per detik. Latensi tergantung pada jumlah total token (input + output), jumlah gambar, dan beban server saat ini. Karena OrcaRouter bertindak sebagai proxy, latensi jaringan tambahan minimal—biasanya dalam beberapa milidetik dari latensi API OpenAI langsung. Model ini mendukung streaming untuk aplikasi real-time.
Kelebihan: Efisiensi biaya (harga terendah di antara anggota keluarga GPT-4 dengan dukungan multimodal), jendela konteks 128k yang besar, penalaran matematis yang solid (78.9 MATH-500), dan inferensi cepat dibandingkan model yang lebih besar. Model ini menangani input gambar dan file dengan kompeten untuk tugas-tugas umum. Keterbatasan: Pada penalaran yang kompleks dan bernuansa atau penulisan kreatif, kinerjanya kurang baik dibandingkan GPT-4o dan GPT-4 Turbo. Kepatuhannya terhadap instruksi mungkin kurang andal untuk tugas-tugas yang memerlukan format ketat atau batasan multi-langkah. Selain itu, karena model yang lebih kecil, batas pengetahuannya (Januari 2024) mungkin sudah ketinggalan untuk peristiwa yang sangat baru. Model ini juga tidak mendukung kemampuan visi untuk deteksi objek secara terperinci atau pengenalan wajah.
Harga ditetapkan sebesar $0.15 per 1 juta token input dan $0.60 per 1 juta token output. Ini adalah tarif standar penyedia OpenAI, dan OrcaRouter tidak mengenakan markup apa pun di atasnya. Penagihan didasarkan pada jumlah token yang dilaporkan oleh penyedia model. Tidak ada biaya tambahan per permintaan atau minimum. Kebijakan tanpa markup berlaku untuk semua model yang tersedia melalui OrcaRouter, sehingga harga identik dengan yang akan Anda bayarkan langsung ke OpenAI. Transparansi ini memungkinkan pengguna untuk menganggarkan secara akurat tanpa biaya kejutan.
Token output empat kali lebih mahal per token dibandingkan token input ($0.60 vs $0.15 per juta). Untuk tugas yang menghasilkan respons panjang, seperti ringkasan detail atau pembuatan kode, biaya output dapat mendominasi. Pengguna dapat mengontrol penggunaan token output melalui parameter max_tokens dan dengan menyusun prompt yang menghasilkan respons singkat. Sebaliknya, tugas dengan input besar (misalnya, memproses dokumen panjang dengan banyak gambar) menimbulkan biaya input. Jendela konteks 128k yang besar memudahkan untuk menyertakan konteks yang substansial, tetapi hal itu dikenakan tarif input per token. Mengoptimalkan keseimbangan antara panjang input dan output adalah kunci untuk mengelola biaya keseluruhan.
OrcaRouter saat ini tidak menawarkan caching bawaan untuk permintaan GPT-4o-mini di luar apa yang disediakan OpenAI di tingkat API. Tidak ada diskon volume atau opsi kapasitas cadangan yang tersedia melalui OrcaRouter; harga ketat bersifat bayar sesuai pemakaian dengan tarif penyedia OpenAI. Pengguna bertanggung jawab untuk menerapkan strategi caching mereka sendiri (misalnya, di lapisan aplikasi) untuk mengurangi panggilan API duplikat. Kebijakan markup nol berarti bahwa setiap perubahan harga di masa depan oleh OpenAI tercermin secara otomatis. Untuk kasus penggunaan volume yang sangat tinggi, perjanjian enterprise langsung dengan OpenAI mungkin menawarkan persyaratan yang lebih baik, tetapi melalui OrcaRouter, kesederhanaan satu kunci API dan penagihan terpadu masih bisa menguntungkan.
Gambar yang diproses oleh GPT-4o-mini diubah menjadi token berdasarkan resolusi dan tingkat detailnya. OpenAI menggunakan algoritma perhitungan token yang mempertimbangkan lebar dan tinggi; misalnya, gambar 1024x1024 tipikal dengan detail tinggi dapat menghabiskan sekitar 2.000–3.000 token input. Karena token input ditagih sebesar $0,15 per juta, biaya per gambar sangat rendah (biasanya di bawah satu sen). Namun, memproses banyak gambar dalam satu permintaan dapat bertambah. Pengguna dapat mengontrol biaya dengan menggunakan tingkat detail `low` (biaya sekitar 85 token per gambar) saat fidelitas tinggi tidak diperlukan. Selalu periksa token yang digunakan dalam respons API untuk memahami biaya gambar.
Atur URL dasar API Anda ke https://api.orcarouter.ai/v1 dan gunakan ID model "openai/gpt-4o-mini-2024-07-18". API ini mengikuti format standar chat completions OpenAI. Contohnya, dalam Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). Semua parameter seperti temperature, top_p, max_tokens, stream, dan stop sequences didukung seperti pada API OpenAI asli. Respons mencakup field standar seperti id, choices, usage dengan jumlah token.
Untuk output deterministik, atur temperature=0 dan top_p=1. Untuk tugas kreatif, temperature sekitar 0.8–1.2 mungkin sesuai. Max_tokens mengontrol panjang respons; default adalah 16,384. Untuk mengurangi biaya output, atur max_tokens sesuai kebutuhan. Ketika menggunakan input multimodal, strukturlah pesan dengan array bagian konten: [{"type":"text","text":"Describe this:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. Untuk pemrosesan file, sertakan konten file sebagai teks atau base64. Parameter stop dapat digunakan untuk menghentikan generasi pada urutan kustom. Stream=True memungkinkan pengiriman token secara real-time.
Migrasi memerlukan tiga perubahan sederhana: Atur base_url ke https://api.orcarouter.ai/v1, ganti kunci API Anda dengan kunci API OrcaRouter Anda, dan ubah ID model menjadi "openai/gpt-4o-mini-2024-07-18". Tidak perlu modifikasi kode lain jika Anda menggunakan pustaka OpenAI Python/Node.js atau klien HTTP apa pun yang mengikuti format chat completions standar. Struktur responsnya identik. Perhatikan bahwa OrcaRouter tidak membatasi permintaan Anda secara berbeda dari OpenAI; batas kecepatan yang sama berlaku sesuai dengan tingkat akun OpenAI Anda, tetapi Anda mengelola kunci melalui OrcaRouter. Uji dengan permintaan kecil untuk memverifikasi jumlah token dan latensi.
Sediakan kunci API OrcaRouter Anda di header Authorization: Authorization: Bearer <your-key>. API mengembalikan kode status HTTP standar: 200 untuk sukses, 400 untuk permintaan buruk (misalnya, parameter tidak valid), 401 untuk tidak sah (kunci API salah), 429 untuk pembatasan laju, dan 500 untuk kesalahan server. Respons kesalahan menyertakan body JSON dengan objek error yang berisi pesan dan tipe. Disarankan untuk menerapkan percobaan ulang dengan backoff eksponensial untuk kesalahan 429 dan 5xx. OrcaRouter tidak memodifikasi respons kesalahan dari OpenAI, sehingga pesan kesalahan yang sama yang Anda lihat dengan API langsung akan muncul.
GPT-4o-mini secara signifikan lebih mampu daripada GPT-3.5-Turbo dalam penalaran, matematika, dan mengikuti instruksi, sebagaimana ditunjukkan oleh skor MATH-500 sebesar 78,9 dibandingkan skor tipikal GPT-3.5-Turbo yang berkisar 30-40. GPT-4o-mini juga mendukung input multimodal (gambar dan file), yang tidak dimiliki GPT-3.5-Turbo. Jendela konteksnya lebih besar: 128k vs 16k. Harga: GPT-4o-mini ($0,15/$0,60 per juta token) sedikit lebih mahal daripada GPT-3.5-Turbo ($0,50/$1,50 untuk versi 16k? Sebenarnya GPT-3.5-Turbo 0125 adalah $0,50/$1,50 per juta? Tunggu, GPT-3.5-Turbo standar adalah $1,50/$2,00 per juta? Saya akan berpegang pada fakta yang diberikan: harga GPT-4o-mini sudah diberikan. Bandingkan secara kualitatif: GPT-4o-mini menawarkan performa yang lebih baik dengan biaya yang sedikit lebih tinggi daripada GPT-3.5-Turbo, namun dengan kemampuan multimodal.
GPT-4o-mini adalah versi yang lebih kecil dan lebih hemat biaya dari GPT-4o. Meskipun keduanya memiliki kemampuan multimodal dan ukuran jendela konteks yang sama (128k token), GPT-4o mencapai skor lebih tinggi pada tolok ukur seperti MMLU dan MATH. Skor MATH-500 GPT-4o-mini sebesar 78,9 lebih rendah dibandingkan skor GPT-4o yang dilaporkan sekitar 90–95. Harga jauh lebih murah: GPT-4o-mini ($0,15/$0,60) vs GPT-4o ($2,50/$10,00 per juta token). Untuk aplikasi yang membutuhkan akurasi maksimal pada tugas penalaran kompleks, GPT-4o lebih disukai. Untuk tugas dengan throughput tinggi dan sensitif biaya di mana akurasi sedang dapat diterima, GPT-4o-mini menawarkan penghematan yang signifikan.
Model open-source seperti Llama 3 8B dan 70B menawarkan keuntungan hosting mandiri dengan biaya per-token nol, tetapi memerlukan infrastruktur dan keahlian. GPT-4o-mini melalui OrcaRouter menyediakan akses serverless tanpa biaya awal dan penskalaan otomatis. Pada tolok ukur, skor MATH-500 GPT-4o-mini sebesar 78.9 kompetitif dengan Llama 3 8B (sekitar 30-40) dan lebih mendekati Llama 3 70B (sekitar 60-70). GPT-4o-mini juga mendukung gambar secara native, yang tidak dimiliki oleh sebagian besar model open-source. Konsekuensinya: model open-source menawarkan privasi data (tanpa panggilan API eksternal) dan latensi lebih rendah jika perangkat keras inferensi tersedia. GPT-4o-mini menawarkan kemudahan penggunaan dan kemampuan multimodal dengan harga per-token yang rendah.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Input / 1M token | $0.150 |
| Output / 1M token | $0.600 |
| Baca cache / 1M | $0.075 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Buka @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18