OpenAI's GPT-Image 1.5 untuk input teks dan gambar, diakses melalui API OrcaRouter dengan harga langsung dari penyedia.
openai/gpt-image-1.5 adalah model multimodal yang dikembangkan oleh OpenAI yang menerima input teks dan gambar. Model ini dirancang untuk melakukan tugas penalaran yang memerlukan pemahaman konten…
Model ini mampu memahami dan melakukan penalaran terhadap gambar yang dikombinasikan dengan instruksi teks. Tugas umumnya meliputi pembuatan deskripsi teks (caption) untuk foto, menjawab pertanyaan tentang konten gambar (misalnya, 'Apa warna mobil tersebut?'), serta mengekstrak teks dari gambar (tugas seperti OCR saat diminta dengan tepat). Model ini juga dapat digunakan untuk penalaran yang lebih kompleks, seperti menganalisis bagan, diagram, atau catatan tulisan tangan. Rentang kemampuan yang tepat bergantung pada pelatihan model, yang belum dirinci oleh OpenAI, tetapi model ini mengikuti paradigma transformer multimodal secara umum.
Model ini unggul dalam skenario di mana konteks visual sangat penting untuk menghasilkan keluaran teks yang akurat. Contoh kasus penggunaan termasuk memberikan deskripsi waktu nyata bagi pengguna tunanetra, pemberian label otomatis pada produk dari gambar katalog, dan membantu analisis pencitraan medis dengan menghasilkan laporan awal. Model ini juga sangat cocok untuk aplikasi pendidikan, seperti menjelaskan diagram atau memecahkan teka-teki visual. Karena merupakan model teks-gambar khusus, ia mungkin mengungguli model multimodal tujuan umum pada tugas gambar-ke-teks murni, meskipun perbandingan langsung tidak tersedia dari penyedia.
Jika aplikasi Anda tidak memerlukan input gambar, sebaiknya pertimbangkan model teks saja yang lebih murah yang tersedia di OrcaRouter, seperti openai/gpt-4o-mini, yang memiliki biaya per token lebih rendah. Demikian pula, jika tugas berbasis gambar Anda sederhana (misalnya, klasifikasi biner) dan dapat ditangani oleh model visi yang ringan, alternatif yang lebih kecil mungkin lebih hemat biaya. GPT-Image 1.5 dibanderol pada kisaran harga tertinggi dari penawaran OpenAI, jadi untuk tugas gambar dengan volume tinggi dan kompleksitas rendah, mungkin perlu dievaluasi apakah model yang lebih kecil dapat memenuhi kebutuhan akurasi Anda. OrcaRouter memungkinkan Anda menguji beberapa model pada tugas yang sama untuk membandingkan biaya dan kualitas.
Model ini memerlukan input teks dan gambar untuk menghasilkan output. Dalam praktiknya, Anda dapat memberikan prompt teks minimalis seperti 'Deskripsikan gambar ini' untuk memproses gambar saja secara efektif. Namun, arsitektur model selalu mengharapkan komponen teks dalam pesan; tidak ada mode untuk inferensi hanya gambar. Gambar-gambar diperlakukan sebagai bagian dari konteks percakapan, sehingga Anda juga dapat merantai beberapa pertukaran gambar-teks. Tidak ada informasi publik tentang apakah model ini mendukung input video atau bingkai animasi.
Per tanggal pemutakhiran pengetahuan, OpenAI belum menerbitkan skor benchmark apa pun untuk model GPT-Image 1.5. Hal ini umum terjadi untuk varian model khusus yang mungkin dimaksudkan untuk penggunaan internal atau akses awal. Tanpa benchmark resmi, tidak mungkin membuat perbandingan kuantitatif dengan model multimodal lainnya. Pengguna disarankan untuk mengevaluasi model pada kumpulan data mereka sendiri untuk menentukan efektivitasnya dalam tugas-tugas tertentu. Platform OrcaRouter menyediakan pencatatan dan analitik yang dapat membantu dalam evaluasi tersebut.
Detail latensi untuk openai/gpt-image-1.5 tidak tersedia secara publik. Secara umum, pemrosesan input gambar cenderung lebih lambat daripada permintaan teks saja karena model harus menyandikan informasi visual sebelum menghasilkan teks. Waktu respons aktual akan bergantung pada faktor seperti ukuran gambar, kompleksitas permintaan, dan beban API saat ini. API OrcaRouter menyertakan batas waktu standar yang dapat dikonfigurasi, dan pengguna harus menguji model dengan ukuran gambar mereka sendiri untuk mengukur kinerja dunia nyata. Tidak ada tolok ukur kecepatan yang diketahui secara publik untuk model ini.
Kekuatan utama GPT-Image 1.5 adalah kemampuannya untuk mengintegrasikan informasi visual ke dalam proses penalaran model bahasa, memungkinkan tugas-tugas yang tidak dapat ditangani oleh model teks murni. Keterbatasannya adalah kurangnya data kinerja yang tersedia untuk umum, sehingga sulit untuk memprediksi akurasi tanpa pengujian empiris. Selain itu, model ini kemungkinan kurang cocok untuk tugas-tugas yang memerlukan detail gambar resolusi tinggi (misalnya, OCR yang sangat detail pada teks yang sangat kecil) dibandingkan dengan model visi komputer khusus. Seperti semua model bahasa besar, model ini dapat menghasilkan deskripsi yang masuk akal tetapi tidak tepat, sehingga keluaran harus divalidasi untuk kasus penggunaan kritis.
Harga untuk openai/gpt-image-1.5 adalah per token: $8.00 per juta token input dan $32.00 per juta token output. Tarif ini ditetapkan oleh OpenAI dan diteruskan tanpa markup oleh OrcaRouter. Baik data teks maupun gambar dihitung sebagai token input; gambar ditokenisasi berdasarkan ukuran dan resolusinya sesuai dengan skema tokenisasi OpenAI. Token output adalah teks yang dihasilkan oleh model. Penagihan dihitung per panggilan API, dan tidak ada penggunaan minimum yang diperlukan. OrcaRouter tidak mengenakan biaya tambahan per permintaan.
Biaya per token relatif tinggi dibandingkan dengan model bahasa kecil, tetapi model ini dikhususkan untuk tugas multimodal di mana input visual sangat penting. Untuk aplikasi yang memproses banyak gambar dengan prompt teks pendek, biaya token input akan mendominasi. Untuk aplikasi yang menghasilkan deskripsi panjang dan detail, token output akan menjadi faktor yang lebih besar. Tidak ada informasi apakah model ini mendukung caching prompt atau diskon untuk penggunaan volume tinggi. Pengembang disarankan untuk memperkirakan jumlah token untuk permintaan tipikal mereka sebelum berkomitmen menggunakan model ini.
API OrcaRouter mungkin mendukung mekanisme caching, tetapi ini tidak spesifik untuk GPT-Image 1.5. Jika caching diaktifkan, permintaan identik yang berulang dapat mengurangi jumlah token yang ditagih, tetapi penyedia (OpenAI) menentukan apakah caching berlaku dan pada tingkat apa. Pengguna harus berkonsultasi dengan dokumentasi OrcaRouter untuk detail tentang perilaku cache dan implikasi harga. Saat ini, belum ada pernyataan publik dari OpenAI tentang caching untuk model ini, jadi yang paling aman adalah menganggap tidak ada manfaat caching.
Penagihan untuk penggunaan openai/gpt-image-1.5 di OrcaRouter ditangani melalui sistem pengukuran yang sudah ada di platform. Biaya dikenakan berdasarkan penggunaan token yang dilaporkan oleh API, tanpa biaya tambahan. OrcaRouter menawarkan dasbor penggunaan untuk melihat konsumsi secara hampir real-time. Metode pembayaran dikonfigurasi di tingkat akun. Tidak ada pengembalian dana atau kredit untuk permintaan yang gagal yang mengembalikan kesalahan; panggilan API yang berhasil ditagih secara normal. Pengguna harus memastikan batas kecepatan mereka sesuai untuk menghindari biaya yang tidak terduga.
Untuk memanggil openai/gpt-image-1.5 melalui OrcaRouter, atur base URL menjadi https://api.orcarouter.ai/v1 dan gunakan parameter model 'openai/gpt-image-1.5' dalam permintaan chat completion Anda. API ini sepenuhnya kompatibel dengan pustaka klien Python dari OpenAI; misalnya, dalam Python Anda akan mengatur openai.api_base = 'https://api.orcarouter.ai/v1' dan openai.api_key = 'your-orcarouter-key'. Pesan dapat menyertakan konten teks dan gambar menggunakan array 'content' dengan tipe 'image_url' atau 'image_base64', mengikuti format pesan multimodal OpenAI.
API mendukung parameter standar seperti 'messages' (wajib), 'max_tokens', 'temperature', 'top_p', 'frequency_penalty', dan 'presence_penalty'. Tidak ada parameter khusus model yang didokumentasikan secara publik selain parameter standar. Data gambar dilewatkan dalam bidang 'content' dari pesan sistem atau pengguna. Format tepat untuk gambar mengikuti konvensi OpenAI: gunakan 'type': 'image_url' dengan objek 'image_url' yang berisi bidang 'url' (base64 data URI atau URL publik). OrcaRouter mungkin memberlakukan batasan tambahan; lihat referensi API mereka untuk detail.
Jika Anda saat ini menggunakan API OpenAI secara langsung untuk GPT-Image 1.5, migrasi ke OrcaRouter hanya memerlukan dua perubahan: memperbarui base URL menjadi https://api.orcarouter.ai/v1 dan mengganti kunci API OpenAI Anda dengan kunci API OrcaRouter. Format permintaan dan responsnya identik, sehingga tidak diperlukan perubahan kode pada struktur pesan. OrcaRouter menawarkan model yang sama dengan harga penyedia yang sama, tanpa markup. Selain itu, OrcaRouter mungkin menyediakan pembatasan tingkat, pencatatan, dan fitur lain yang berbeda dari layanan OpenAI sendiri.
Autentikasi ke API OrcaRouter dilakukan melalui kunci API yang dikirim dalam header 'Authorization': 'Authorization: Bearer <your-api-key>'. Kunci API diperoleh dari dasbor OrcaRouter. Tidak diperlukan OAuth tambahan atau sertifikat klien. Kunci harus tetap rahasia dan tidak boleh diekspos dalam kode sisi klien. OrcaRouter mendukung pembatasan kecepatan per kunci dan dapat menghasilkan beberapa kunci untuk aplikasi yang berbeda. Kunci dapat dicabut kapan saja dari dasbor.
GPT-4o adalah model multimodal yang lebih besar dari OpenAI yang juga menerima input teks dan gambar. Perbedaan utamanya adalah GPT-4o memiliki jendela konteks yang lebih besar (128k token) dan dirancang untuk penalaran tujuan umum, sementara GPT-Image 1.5 adalah model khusus dengan ukuran konteks yang tidak diketahui. Harga untuk GPT-4o adalah $5/M input dan $15/M output, membuat GPT-Image 1.5 lebih mahal (terutama output). Tanpa tolok ukur, tidak jelas model mana yang berkinerja lebih baik pada tugas terkait gambar. GPT-4o mungkin lebih hemat biaya untuk beban kerja campuran, sementara GPT-Image 1.5 mungkin disesuaikan secara khusus untuk pemahaman gambar-teks.
Ada model visi komputer khusus seperti CLIP, DALL-E, atau mesin OCR khusus yang mungkin lebih berperforma pada tugas gambar spesifik (misalnya, klasifikasi, generasi, atau ekstraksi teks). GPT-Image 1.5 menggabungkan pemahaman gambar dengan pembuatan bahasa alami, yang memberikan fleksibilitas tetapi mungkin tidak menyamai akurasi model yang dibangun untuk tugas sempit. Sebagai contoh, untuk mengekstrak data terstruktur dari dokumen, model OCR khusus mungkin memiliki akurasi lebih baik dan latensi lebih rendah, tetapi GPT-Image 1.5 dapat mengikuti instruksi bahasa alami yang kompleks. Pilihan tergantung pada kompleksitas tugas dan kebutuhan akan eksplanabilitas.
OrcaRouter menyediakan akses ke openai/gpt-image-1.5 dengan markup nol pada harga penyedia, artinya Anda membayar persis sesuai tarif yang ditetapkan OpenAI. OrcaRouter menawarkan API yang kompatibel dengan OpenAI, sehingga memudahkan migrasi bagi pengguna yang sudah ada. Selain itu, OrcaRouter dapat menyediakan fitur-fitur seperti pelacakan penggunaan, pencatatan, manajemen pembatasan laju, dan perutean multi-model yang tidak tersedia langsung dari OpenAI. Bagi pengguna yang perlu membandingkan beberapa model atau mengelola kunci API secara terpusat, OrcaRouter menawarkan antarmuka terpadu tanpa penguncian vendor.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1backgroundmoderationnoutput_compressionoutput_formatpartial_imagesqualitysize| Input / 1M token | $8.00 |
| Output / 1M token | $32.00 |
| Baca cache / 1M | $1.25 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
Yang dibicarakan developer minggu ini
GET /api/public/models/openai/gpt-image-1.5Buka @misc{orcarouter_gpt_image_1_5,
title = {openai/gpt-image-1.5 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-1.5}
}openai. (n.d.). openai/gpt-image-1.5 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-1.5