Versi GPT-4o tanggal 2024-08-06 menawarkan peningkatan kinerja dalam output terstruktur, dengan kemampuan untuk menyediakan skema JSON di respon_format. Baca selengkapnya [di sini](https://openai.com/index/introducing-structured-outputs-in-the-api/). GPT-4o ("o" untuk "omni") adalah...
GPT-4o (2024-08-06) adalah versi dari model GPT-4o milik OpenAI, yang dirilis pada Agustus 2024. Model ini merupakan model bahasa besar multimodal yang memproses input teks, gambar, dan file. Model…
Kekuatan inti model ini terletak pada penalaran matematis dan pemahaman multimodal. Skor MATH-500 sebesar 79,5 menunjukkan kemampuan yang kuat untuk memecahkan masalah matematika kompleks secara langkah demi langkah. Model ini dapat menginterpretasikan gambar, diagram, dan grafik, serta memberikan deskripsi atau analisis yang akurat. Jendela konteks 128K memungkinkannya memproses informasi dalam jumlah besar, seperti buku setebal penuh atau serangkaian gambar dengan teks terkait. Model ini juga menangani unggahan file, sehingga berguna untuk tugas-tugas seperti mengekstrak data dari spreadsheet atau membaca file kode. Kemampuan-kemampuan ini didukung oleh optimalisasi berkelanjutan dari OpenAI dan model ini banyak digunakan di lingkungan produksi.
GPT-4o (2024-08-06) unggul dalam tugas yang memerlukan penggabungan informasi visual dan tekstual. Contohnya termasuk memecahkan masalah matematika dengan diagram, menganalisis tangkapan layar antarmuka pengguna untuk laporan bug, mengekstrak data dari dokumen yang dipindai, dan memberikan penjelasan rinci tentang figur yang kompleks. Ini juga efektif untuk pembuatan kode dan debugging ketika konteksnya mencakup tangkapan layar kesalahan atau struktur file. Aplikasi pendidikan mendapatkan manfaat dari penalaran langkah demi langkahnya. Untuk tugas yang murni berbasis teks dan sederhana, seperti T&J dasar atau peringkasan teks pendek, model yang lebih murah seperti GPT-4o mini mungkin sudah mencukupi. Model ini sebaiknya disediakan untuk alur kerja bernilai tinggi, multimodal, atau yang membutuhkan penalaran intensif.
Untuk tugas yang tidak memanfaatkan visi, pemrosesan file, atau penalaran tingkat lanjut, model yang lebih kecil dan lebih murah lebih hemat biaya. Misalnya, aplikasi obrolan sederhana, pembuatan konten singkat, atau tugas klasifikasi dapat ditangani oleh model seperti GPT-4o mini atau GPT-3.5 Turbo. Jika aplikasi Anda hanya memproses teks dan tidak memerlukan jendela konteks 128K, model dengan konteks yang lebih kecil dapat mengurangi latensi dan biaya. Selain itu, jika data Anda tidak melibatkan gambar atau file, model khusus teks sudah cukup. Evaluasilah apakah kompleksitas tugas membenarkan harga per-token yang lebih tinggi dari GPT-4o. OrcaRouter menawarkan berbagai model dengan titik harga yang berbeda untuk menyesuaikan berbagai kasus penggunaan.
Ya, model ini menerima input file. Anda dapat mengunggah file seperti PDF, dokumen Word, spreadsheet, gambar, dan file kode. Model ini mengekstrak dan memahami konten dalam file tersebut, memperlakukannya sebagai bagian dari konteks. Misalnya, model dapat membaca teks dari PDF, menginterpretasikan angka dalam CSV, atau menganalisis kode sumber dalam file .py. Ketika dikombinasikan dengan input gambar, model dapat memproses media campuran seperti dokumen dengan grafik yang disematkan. Ini sangat berguna untuk mengotomatiskan ekstraksi data, tinjauan dokumen, dan analisis kode. Perhatikan bahwa pemrosesan file memperhitungkan jendela konteks 128.000 token, sehingga file yang besar dapat menghabiskan ruang yang signifikan.
Pada tolok ukur MATH-500, GPT-4o (2024-08-06) mencapai skor 79,5. MATH-500 adalah subset dari dataset MATH, yang terdiri dari 500 soal matematika tingkat kompetisi yang menantang mencakup topik seperti aljabar, geometri, teori bilangan, dan probabilitas. Skor 79,5 menunjukkan jawaban benar pada sekitar empat dari lima soal. Ini menempatkannya di antara model-model dengan kinerja terbaik untuk penalaran matematis. Meskipun tidak ada skor tolok ukur lain yang disediakan, metrik ini menunjukkan kekuatan model dalam deduksi logis langkah demi langkah dan aritmatika. Pengguna dapat mengharapkan kinerja yang andal pada aplikasi dengan muatan matematika yang berat seperti bimbingan belajar, verifikasi, dan pembuatan soal.
Skor tolok ukur spesifik selain MATH-500 tidak disediakan dalam fakta yang tersedia. Namun, GPT-4o sebagai keluarga model dikenal luas memiliki kinerja kompetitif pada berbagai tolok ukur standar termasuk MMLU (pemahaman bahasa multitugas masif), HumanEval (generasi kode), dan berbagai tugas visi-bahasa. Versi Agustus 2024 mungkin menyertakan pembaruan yang meningkatkan penalaran dan pengikutan instruksi. Tanpa angka pasti, pengguna harus merujuk pada evaluasi yang dipublikasikan OpenAI untuk data terbaru. Untuk tujuan praktis, model ini dianggap sebagai yang terdepan di antara model API terbuka dalam hal kemampuan teks dan visi yang digabungkan.
Tidak ada angka latensi atau throughput spesifik yang diberikan untuk model ini. Secara umum, GPT-4o dirancang lebih cepat daripada varian GPT-4 sebelumnya sambil mempertahankan kualitas. Latensi bergantung pada faktor-faktor seperti panjang input, panjang output, permintaan bersamaan, dan infrastruktur backend. Saat diakses melalui OrcaRouter, permintaan diarahkan ke server OpenAI, dan waktu respons serupa dengan panggilan API langsung. Pengguna dapat mengoptimalkan dengan menggunakan konteks seminimal mungkin yang diperlukan dan menetapkan batas max_tokens yang wajar. Untuk aplikasi real-time, disarankan untuk menguji dengan beban kerja representatif. OrcaRouter tidak menambahkan latensi tambahan di luar perutean jaringan.
Kelebihan: penalaran matematis yang kuat (MATH-500 79.5), input multimodal (teks, gambar, file), jendela konteks besar 128K, dan batas token output yang tinggi (16.384). Ini sangat efektif untuk penalaran kompleks, pemahaman visual, dan tugas yang memerlukan konteks jarak jauh. Keterbatasan: biaya lebih tinggi dibandingkan model yang lebih kecil; mungkin tidak optimal untuk tugas sederhana atau dengan latensi rendah; akurasi dapat bervariasi pada input yang ambigu atau diformat dengan buruk; kemampuan visual mungkin tidak berfungsi baik pada gambar yang terdistorsi atau resolusi rendah. Juga, seperti semua LLM, ia dapat menghasilkan jawaban yang terdengar masuk akal tetapi salah, terutama di domain di luar data pelatihannya. Mitigasi dengan memvalidasi output dan menggunakan rekayasa prompt.
Harga untuk GPT-4o (2024-08-06) berdasarkan penggunaan token. Token input ditagih sebesar $2.50 per 1 juta token. Token output ditagih sebesar $10.00 per 1 juta token. Ini adalah tarif penyedia (OpenAI), dan OrcaRouter menerapkan markup nol—Anda membayar persis sama seperti jika Anda memanggil OpenAI secara langsung. Token dihitung berdasarkan teks yang dikirim dan diterima. Input gambar dan file mengonsumsi token yang proporsional dengan ukuran dan kompleksitas pemrosesan (biaya token gambar sesuai kebijakan OpenAI). Tidak ada biaya tambahan untuk menggunakan endpoint API. Penagihan biasanya diagregasi per periode penggunaan, dan Anda dapat memantau konsumsi token melalui dasbor OrcaRouter.
Tidak ada biaya tersembunyi atau biaya tambahan. OrcaRouter menagih sesuai tarif persis penyedia tanpa markup. Harga yang tercantum ($2.50/1M input, $10/1M output) sudah termasuk semuanya. Tidak ada biaya tambahan untuk autentikasi, koneksi, atau dukungan. Namun, input gambar dan file akan dikenakan biaya token yang ditentukan oleh kebijakan harga OpenAI, yang mungkin melebihi biaya token teks saja. Misalnya, gambar 1080x1080 mungkin memerlukan sejumlah token di luar token teks. Periksa dokumentasi OpenAI untuk harga token gambar yang tepat. OrcaRouter meneruskan biaya ini tanpa markup. Tidak ada diskon berbasis caching berdasarkan informasi saat ini.
Memilih GPT-4o (2024-08-06) dibandingkan model yang lebih murah seperti GPT-4o mini atau GPT-3.5 Turbo melibatkan pertukaran antara performa dan biaya. Harga per token lebih tinggi, sehingga untuk aplikasi bervolume tinggi, biaya dapat bertambah dengan cepat. Namun, jika tugas memerlukan kemampuan multimodal model atau jendela konteks 128K, model yang lebih murah mungkin tidak memadai, yang berpotensi menghasilkan keluaran yang tidak lengkap atau berkualitas lebih rendah. Untuk tugas berbasis teks dengan penalaran sederhana, model yang lebih murah mengurangi biaya tanpa mengorbankan banyak kualitas. OrcaRouter memungkinkan Anda beralih antar model dengan mudah, sehingga Anda dapat bereksperimen untuk menemukan keseimbangan biaya-performa terbaik untuk setiap kasus penggunaan.
Fakta yang tersedia tidak menyebutkan adanya mekanisme caching atau diskon untuk model ini. OrcaRouter menagih sesuai tarif penyedia tanpa markup, sehingga diskon apa pun kemungkinan berasal dari harga OpenAI sendiri (misalnya, diskon berjenjang untuk penggunaan volume tinggi, jika berlaku). OrcaRouter mungkin menawarkan fitur caching sendiri, tetapi hal ini tidak dikonfirmasi untuk model ini. Untuk meminimalkan biaya, pertimbangkan untuk mengurangi penggunaan token input dengan memotong riwayat percakapan, menggunakan prompt yang lebih pendek, dan membatasi panjang output dengan parameter max_tokens. Untuk kueri identik yang berulang, Anda dapat menerapkan caching di tingkat aplikasi.
Untuk memanggil GPT-4o (2024-08-06) melalui OrcaRouter, gunakan base URL https://api.orcarouter.ai/v1 dan atur ID model menjadi "openai/gpt-4o-2024-08-06". API ini sepenuhnya kompatibel dengan pustaka klien OpenAI. Sebagai contoh, dalam Python dengan pustaka openai, Anda akan mengonfigurasi openai.api_base = "https://api.orcarouter.ai/v1" dan openai.api_key = "your-orcarouter-api-key". Kemudian panggil openai.ChatCompletion.create(model="openai/gpt-4o-2024-08-06", messages=[...]). Semua parameter standar (temperature, max_tokens, top_p, dll.) didukung. Lihat dokumentasi OrcaRouter untuk detail tentang autentikasi dan batas kecepatan.
Karena model ini mendukung API yang kompatibel dengan OpenAI, Anda dapat menggunakan seluruh rangkaian parameter yang tersedia di endpoint chat completions OpenAI. Parameter utama mencakup: model (atur ke ID model), messages (daftar objek role-content), temperature (0-2), top_p (0-1), n (jumlah completions), max_tokens (hingga 16384), stop (urutan), frequency_penalty, presence_penalty, logit_bias, dan user (untuk pelacakan penggunaan). Untuk input multimodal, Anda menyertakan gambar atau file_url dalam konten pesan menggunakan format yang sesuai (misalnya, content: [{type: "text", text: "..."}, {type: "image_url", image_url: {...}}]). Lihat dokumentasi OpenAI untuk sintaks input gambar dan file.
Migrasi dari API OpenAI langsung ke OrcaRouter memerlukan dua perubahan: 1) Atur URL dasar menjadi https://api.orcarouter.ai/v1, dan 2) Ganti kunci API OpenAI Anda dengan kunci API OrcaRouter. Tidak diperlukan perubahan kode untuk pemformatan pesan atau parameter. ID model berubah dari "gpt-4o-2024-08-06" menjadi "openai/gpt-4o-2024-08-06". Semua logika yang ada untuk menangani streaming, pemanggilan fungsi, dan penguraian respons tetap sama. API OrcaRouter dirancang sebagai pengganti yang plug-and-play. Setelah beralih, Anda juga dapat mengakses model dari penyedia lain melalui antarmuka yang sama, memungkinkan perbandingan dan penyeimbangan beban yang mudah.
Autentikasi dilakukan melalui kunci API yang disediakan oleh OrcaRouter. Sertakan dalam header sebagai "Authorization: Bearer YOUR_ORCAROUTER_API_KEY". Batas kecepatan dikelola oleh OrcaRouter dan mungkin berbeda dari batas langsung OpenAI. Periksa rencana OrcaRouter Anda untuk detailnya. Jika Anda melampaui batas kecepatan, Anda akan menerima respons HTTP 429. Untuk mengurangi hal ini, terapkan logika percobaan ulang dengan backoff eksponensial. OrcaRouter juga memungkinkan Anda mengatur batas kecepatan per pengguna melalui parameter pengguna. Untuk kebutuhan throughput tinggi, hubungi dukungan OrcaRouter untuk pengaturan khusus. Model itu sendiri tidak memiliki batas kecepatan terpisah; ia tunduk pada batas titik akhir keseluruhan.
GPT-4o (2024-08-06) adalah model flagship berukuran penuh, sedangkan GPT-4o mini adalah varian yang lebih kecil dan lebih murah. Perbedaan utama: GPT-4o memiliki jendela konteks 128K (vs. GPT-4o mini juga 128K, tetapi mini memiliki batas output yang lebih rendah, biasanya 16K juga? Sebenarnya GPT-4o mini juga memiliki konteks 128K dan output 16K, tetapi kurang mampu dalam penalaran dan visi. Model penuh mendapat skor 79,5 pada MATH-500; GPT-4o mini mendapat skor lebih rendah pada tolok ukur matematika. Harga: GPT-4o lebih mahal ($2,50/$10 vs. GPT-4o mini $0,15/$0,60 per 1M token). Untuk tugas yang memerlukan akurasi tinggi atau penalaran kompleks, model penuh lebih tepat. Untuk tugas yang lebih sederhana, mini memberikan alternatif yang hemat biaya.
Dibandingkan dengan GPT-4 (misalnya, GPT-4-0613 atau GPT-4 Turbo), GPT-4o (2024-08-06) menawarkan beberapa peningkatan: input multimodal asli (teks, gambar, berkas) tanpa memerlukan model visi terpisah, jendela konteks yang lebih besar (128K vs. 32K milik GPT-4 untuk versi lama), dan inferensi yang lebih cepat. Harganya lebih rendah dibandingkan varian GPT-4 sebelumnya, yang seringkali lebih mahal. Contohnya, GPT-4 Turbo memiliki konteks serupa tetapi harga lebih tinggi. Dalam hal tolok ukur, skor MATH-500 sebesar 79.5 mengungguli model GPT-4 lama. Namun, beberapa pengguna mungkin menganggap model-model sebelumnya lebih stabil untuk tugas spesifik karena riwayat pelatihan yang lebih panjang. Secara keseluruhan, GPT-4o adalah penerus yang lebih modern dan efisien.
Pilihan tergantung pada kebutuhan spesifik dan preferensi penyedia. GPT-4o (2024-08-06) unggul dalam penalaran matematika (MATH-500 79.5) dan tugas multimodal dengan teks, gambar, dan file. Model Claude dari Anthropic mungkin menawarkan fitur keamanan yang lebih kuat atau jendela konteks yang lebih panjang di beberapa versi, tetapi biasanya memiliki harga yang lebih tinggi. Model Gemini dari Google menyediakan multimodal dan konteks besar, tetapi mungkin memiliki profil kinerja yang berbeda. Menggunakan OrcaRouter, Anda dapat menguji beberapa penyedia dengan satu API. Untuk tugas yang membutuhkan akurasi matematika tinggi, GPT-4o adalah kandidat yang kuat. Untuk peringkasan teks murni atau tugas berbiaya rendah, model lain mungkin lebih ekonomis. Evaluasi skor tolok ukur dan harga untuk kasus penggunaan Anda.
Saat menggunakan GPT-4o melalui OrcaRouter, data Anda dikirim ke server OpenAI untuk inferensi. OrcaRouter tidak menyimpan atau memproses prompt Anda selain meneruskannya. Kebijakan penggunaan data OpenAI berlaku—periksa persyaratan OpenAI jika Anda memiliki kekhawatiran tentang penggunaan data pelatihan atau penyimpanan data. Jika Anda memerlukan data tetap berada di dalam yurisdiksi tertentu atau menghindari penyedia tertentu, OrcaRouter memungkinkan Anda memilih di antara beberapa penyedia per permintaan. Anda juga dapat menggunakan fitur perutean OrcaRouter untuk mengarahkan permintaan ke penyedia yang memenuhi persyaratan kepatuhan Anda. Selalu tinjau dokumentasi penanganan data dari OrcaRouter dan penyedia yang mendasarinya.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-08-06",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Input / 1M token | $2.50 |
| Output / 1M token | $10.00 |
| Baca cache / 1M | $1.25 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/openai/gpt-4o-2024-08-06Buka @misc{orcarouter_gpt_4o_2024_08_06,
title = {GPT-4o (2024-08-06) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06}
}OpenAI. (2024). GPT-4o (2024-08-06) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06