GPT-4o ("o" untuk "omni") adalah model AI terbaru OpenAI, yang mendukung input teks dan gambar dengan output teks. Ia mempertahankan tingkat kecerdasan [GPT-4 Turbo](/models/openai/gpt-4-turbo) sementara dua kali lebih...
GPT-4o (2024-05-13) adalah model bahasa multimodal dari OpenAI, yang dapat diakses melalui API OrcaRouter. Model ini memproses teks, gambar, dan file, sehingga cocok untuk tugas yang menggabungkan…
GPT-4o dapat menganalisis gambar yang disediakan sebagai bagian dari input. Ia dapat mendeskripsikan konten visual, menjawab pertanyaan tentang objek, teks dalam gambar, dan hubungan spasial. Ia juga dapat mengekstrak dan mentranskripsikan teks dari dokumen atau foto yang dipindai. Karena memproses gambar secara langsung, Anda tidak memerlukan model OCR atau visi terpisah. Gambar tersebut ditokenisasi agar sesuai dengan jendela konteks. Misalnya, pengguna dapat mengunggah tangkapan layar grafik dan meminta model untuk menginterpretasikan tren. Pemahaman model tidak terbatas pada keterangan sederhana; model dapat menalar konten, membandingkan beberapa gambar, dan menggunakan isyarat visual bersamaan dengan instruksi tekstual. Kemampuan ini terintegrasi dalam panggilan API yang sama, menggunakan format pesan yang sama dengan permintaan teks saja. Di OrcaRouter, Anda mengirim gambar sebagai data yang dienkode base64 atau URL dalam array konten. ID model tetap "openai/gpt-4o-2024-05-13".
GPT-4o menerima file sebagai masukan. Format yang didukung meliputi PDF, dokumen Microsoft Office (Word, Excel, PowerPoint), file teks, dan format gambar. Untuk PDF dan file Office, model mengekstrak konten teks dan menganalisis tata letak. Ia tidak langsung merender format yang kompleks tetapi membaca konten teks. Ini berguna untuk memproses laporan, kontrak, spreadsheet, atau presentasi tanpa ekstraksi manual. Konten file di-token dan dihitung ke dalam total token masukan. Model dapat menjawab pertanyaan tentang konten file, meringkasnya, atau melakukan perhitungan pada data tabel. Saat menggunakan file, Anda menyertakannya sebagai bagian dari konten pesan menggunakan bidang OpenAI API yang sesuai. OrcaRouter menangani transmisi tanpa modifikasi. Perhatikan bahwa kemampuan model bergantung pada kualitas teks yang diekstrak; gambar hasil pemindaian berat dalam PDF mungkin tidak sepenuhnya terbaca kecuali mengandung lapisan teks tertanam.
GPT-4o adalah model premium dengan biaya lebih tinggi dibandingkan alternatif seperti GPT-4o-mini atau varian GPT-3.5 sebelumnya. Jika tugas Anda tidak memerlukan kemampuan multimodal (misalnya, tugas hanya teks), konteks besar (hingga 128K), atau tingkat penalaran matematis yang diukur oleh MATH-500 (79,1), model yang lebih murah mungkin lebih ekonomis. Misalnya, klasifikasi sederhana, pembuatan konten pendek, atau obrolan dasar dapat ditangani oleh model dengan biaya lebih rendah yang tetap menghasilkan kualitas yang dapat diterima. Selain itu, jika aplikasi Anda sensitif terhadap latensi dan model yang lebih kecil lebih cepat, trade-off mungkin lebih mengutamakan kecepatan daripada akurasi absolut. Terakhir, jika Anda jarang perlu memproses gambar atau file, kemampuan multimodal tambahan tidak diperlukan. OrcaRouter menawarkan berbagai model sehingga Anda dapat memilih rasio harga-kinerja terbaik. Evaluasi kebutuhan kasus penggunaan Anda terhadap skor benchmark dan harga untuk menentukan apakah keunggulan GPT-4o sepadan dengan biaya tambahan.
GPT-4o dapat menghasilkan hingga 16.384 token per permintaan. Ini adalah batas yang murah hati yang memungkinkan jawaban berbentuk panjang, kode detail, atau analisis multi-paragraf. Namun, token keluaran dikenakan biaya $15.00 per juta, sehingga membuat keluaran yang lebih panjang menjadi lebih mahal. Anda dapat mengontrol panjang keluaran menggunakan parameter max_tokens dalam panggilan API. Jika Anda mengantisipasi perlunya generasi yang sangat panjang, pertimbangkan untuk melakukan pengelompokan atau membagi permintaan. Batas 16.384 berlaku untuk seluruh penyelesaian, termasuk langkah penalaran atau rantai pemikiran jika diminta. Untuk tugas yang sangat kompleks yang memerlukan pemikiran panjang, Anda mungkin perlu menggunakan beberapa panggilan. Di OrcaRouter, jumlah token keluaran dilaporkan dalam bidang penggunaan respons API, sehingga Anda dapat melacak biaya secara akurat. Tidak ada batasan tambahan yang diberlakukan oleh OrcaRouter; batas bawaan model yang berlaku.
GPT-4o mencapai skor 79.1 pada tolok ukur MATH-500. MATH-500 terdiri dari 500 soal matematika yang menantang di berbagai topik seperti aljabar, geometri, teori bilangan, dan probabilitas. Skor 79.1 berarti model tersebut menjawab 79.1% soal dengan benar. Ini adalah hasil yang kuat yang menunjukkan kemampuan penalaran matematika yang kokoh, terutama untuk model multimodal. Tolok ukur ini menguji kemampuan pemecahan masalah dan penalaran langkah demi langkah. Skor ini dapat menjadi panduan ekspektasi untuk aplikasi yang melibatkan bimbingan belajar matematika, komputasi ilmiah, atau teka-teki logika. Perlu dicatat bahwa kinerja tolok ukur tidak menjamin hasil yang identik dalam tugas dunia nyata; penyesuaian domain atau rekayasa prompt mungkin diperlukan. Saat mempertimbangkan model ini, bandingkan skor MATH-500-nya dengan model lain yang Anda evaluasi. OrcaRouter tidak menyediakan data tolok ukur tambahan, sehingga ini adalah satu-satunya titik referensi yang diberikan untuk model ini.
Latensi tergantung pada beberapa faktor: panjang input, panjang output yang diharapkan, beban saat ini pada server OpenAI, dan jalur jaringan antara aplikasi Anda dan OrcaRouter. OrcaRouter tidak menambah overhead yang signifikan di luar waktu respons penyedia yang mendasarinya. Untuk permintaan tipikal dengan input moderat (beberapa ribu token) dan output pendek (di bawah 1.000 token), respons sering tiba dalam beberapa detik. Output yang lebih panjang (mendekati 16.384 token) secara alami akan memakan waktu lebih lama karena model menghasilkan token secara berurutan. Input gambar juga meningkatkan latensi karena tokenisasi dan pemrosesan. Anda dapat mengoptimalkan latensi dengan mengurangi panjang output, menggunakan prompt yang lebih pendek, atau melakukan batch permintaan. OrcaRouter menyediakan endpoint API standar yang mengembalikan hasil secara asinkron melalui streaming jika diinginkan. Untuk aplikasi interaktif real-time, pertimbangkan untuk menggunakan mode streaming (stream: true) untuk memulai pemrosesan segera setelah token tiba. Tidak ada angka latensi spesifik yang disediakan dalam fakta model, jadi ini adalah perkiraan kualitatif.
Kelebihan: Input multimodal (teks, gambar, file), jendela konteks besar 128K, penalaran matematika yang kuat (MATH-500: 79,1), dan batas token output yang tinggi (16.384). Model ini menangani dokumen panjang dan percakapan multi-putaran secara efektif. API yang digunakan kompatibel dengan standar OpenAI, memudahkan integrasi. Keterbatasan: Biaya lebih tinggi dibandingkan model yang lebih kecil. Tidak dioptimalkan untuk tugas yang tidak memanfaatkan multimodalitas atau konteks besar. Tidak ada informasi yang diberikan tentang performa bahasa non-Inggris atau tolok ukur keamanan tertentu. Pemahaman gambar mungkin terbatas untuk pemandangan yang sangat kompleks atau gambar resolusi rendah. Selain itu, model ini mungkin menghasilkan jawaban yang salah pada masalah di luar distribusi pelatihannya. Tidak ada jaminan latensi yang diungkapkan. Bagi pengguna yang membutuhkan latensi sangat rendah atau biaya sangat rendah, model lain mungkin lebih cocok. Skor tolok ukur 79,1 pada MATH-500 menunjukkan masih ada ruang untuk perbaikan pada soal matematika tersulit. Evaluasi apakah trade-off ini sesuai dengan persyaratan aplikasi Anda.
GPT-4o ditagih per token, dengan tarif terpisah untuk token input dan output. Token input seharga $5.00 per 1 juta token. Token output seharga $15.00 per 1 juta token. Ini adalah tarif penyedia, yang diteruskan oleh OrcaRouter tanpa markup. Biaya per permintaan = (token input/1e6 * 5) + (token output/1e6 * 15). Sebagai contoh, percakapan dengan 4.000 token input dan 200 token output akan dikenakan biaya (0.004*$5) + (0.0002*$15) = $0.02 + $0.003 = $0.023. Tidak ada biaya tambahan untuk panggilan API itu sendiri; Anda hanya membayar untuk token yang digunakan. Harga diperbarui secara dinamis berdasarkan perubahan penyedia; OrcaRouter akan meneruskan penyesuaian di masa mendatang. Karena tidak ada markup, pengguna mendapatkan keuntungan dari tarif yang sama dengan pelanggan langsung OpenAI, tetapi dengan kemudahan manajemen dan penagihan terpadu OrcaRouter. Perlu diingat bahwa gambar dan file di-tokenisasi dan berkontribusi pada jumlah token input, seringkali meningkatkan biaya dibandingkan input teks saja.
Tidak. OrcaRouter tidak menawarkan diskon, token yang di-cache, atau harga yang lebih murah untuk input berulang. Setiap token ditagih sesuai tarif standar penyedia. Tidak ada biaya caching terpisah atau biaya tambahan untuk volume tinggi. Tarif $5/$15 per juta token adalah tarif tetap. Pengguna yang membutuhkan throughput sangat tinggi dapat menanyakan pengaturan khusus, tetapi layanan standar tidak mencakup diskon volume. Selain itu, tidak ada biaya tersembunyi seperti biaya koneksi atau minimum bulanan. Penetapan harga transparan dan langsung terkait dengan penggunaan token. Untuk optimalisasi biaya, pertimbangkan untuk mengurangi ukuran input (misalnya, memangkas riwayat, menggunakan perintah yang lebih pendek) dan panjang output (misalnya, mengatur max_tokens yang lebih rendah). Juga, menggunakan model hanya saat kemampuannya diperlukan (multimodal, konteks besar) membantu mengendalikan biaya. Jika aplikasi Anda memiliki perintah berulang yang identik setiap kali, caching di lapisan aplikasi dapat mengurangi penggunaan token, tetapi OrcaRouter sendiri tidak menyediakan fitur semacam itu.
GPT-4o memiliki harga premium. Untuk banyak tugas, model yang lebih murah (misalnya, GPT-4o-mini atau GPT-3.5-turbo) mungkin sudah memadai. Lakukan pertukaran dengan mengevaluasi kompleksitas dan akurasi yang dibutuhkan. Jika tugas Anda melibatkan ekstraksi atau klasifikasi sederhana dengan konteks terbatas, model yang lebih murah mungkin memberikan kinerja serupa dengan biaya yang jauh lebih rendah. Sebaliknya, jika tugas memerlukan pemahaman nuansa dari gambar, dokumen panjang, atau presisi matematis yang tinggi (skor MATH-500 sebesar 79.1 versus skor yang lebih rendah pada model yang lebih murah), GPT-4o mungkin sepadan dengan harga premiumnya. Gunakan pengujian A/B pada sampel representatif untuk membandingkan kualitas dan biaya. Juga, pertimbangkan bahwa harga per juta token yang sama berlaku terlepas dari panjang teks; permintaan yang lebih pendek lebih murah. Jika alur kerja Anda sering menggunakan konteks penuh 128K, biaya token input untuk permintaan tersebut mungkin tinggi; pastikan konteks tersebut benar-benar diperlukan. OrcaRouter menyediakan metrik penggunaan sehingga Anda dapat memantau dan mengoptimalkan.
Untuk memanggil GPT-4o di OrcaRouter, gunakan endpoint API yang kompatibel dengan OpenAI: base_url = "https://api.orcarouter.ai/v1". Atur parameter model menjadi "openai/gpt-4o-2024-05-13". Anda memerlukan kunci API dari OrcaRouter. Format permintaan mengikuti API Chat Completions OpenAI standar: array messages dengan peran (system, user, assistant), konten opsional untuk gambar dan file, dan parameter seperti temperature, max_tokens, top_p, frequency_penalty, presence_penalty, dan stop. Contohnya, permintaan teks sederhana dikirim sebagai POST ke /chat/completions. Untuk gambar, sertakan konten sebagai bagian dari pesan user dengan tipe "image_url". Untuk file, sertakan juga sebagai bagian dari konten (format spesifik mengikuti spesifikasi OpenAI). Respons akan menyertakan pesan asisten, statistik penggunaan (prompt_tokens, completion_tokens, total_tokens), dan metadata lainnya. Tidak diperlukan header khusus selain Content-Type dan Authorization standar. Integrasi identik dengan menggunakan OpenAI secara langsung.
Semua parameter standar OpenAI Chat Completions didukung: messages (wajib), model (wajib, diatur ke "openai/gpt-4o-2024-05-13"), temperature (0–2, default 1), top_p (0–1, default 1), n (jumlah penyelesaian, default 1), stop (string atau daftar string), max_tokens (default 16.384, batas maksimal 16.384), presence_penalty (−2 hingga 2, default 0), frequency_penalty (−2 hingga 2, default 0), logit_bias (peta ID token ke nilai bias), user (string untuk pemantauan penyalahgunaan), stream (boolean, default false), dan functions/tools (untuk pemanggilan fungsi). Untuk input multimodal, konten messages dapat berupa array dari bagian konten dengan tipe "text" atau "image_url". Selain itu, Anda dapat menyertakan konten tipe "file" sesuai dengan dokumentasi OpenAI (misalnya, untuk lampiran PDF). OrcaRouter meneruskan parameter-parameter ini langsung ke penyedia tanpa modifikasi. Pastikan Anda tidak melebihi jendela konteks 128K token. API mengembalikan kode error standar untuk permintaan yang tidak valid, pembatasan laju, atau kegagalan autentikasi.
Migrasi sangat mudah karena API OrcaRouter sepenuhnya kompatibel dengan OpenAI. Anda hanya perlu mengubah dua hal: URL dasar dari https://api.openai.com/v1 menjadi https://api.orcarouter.ai/v1, dan ID model dari "gpt-4o-2024-05-13" menjadi "openai/gpt-4o-2024-05-13". Kunci API Anda dari OrcaRouter menggantikan kunci OpenAI Anda. Semua kode yang ada yang menggunakan pustaka Python/Node OpenAI atau permintaan HTTP mentah akan berfungsi tanpa modifikasi lain. Format pesan, nama parameter, dan struktur respons identik. Untuk pustaka yang menerima parameter URL dasar, cukup atur ke titik akhir OrcaRouter. Jika Anda menggunakan klien OpenAI, Anda dapat membuat instance-nya dengan base_url diatur ke titik akhir OrcaRouter. Tidak diperlukan perubahan pada rekayasa prompt atau logika caching. OrcaRouter juga mendukung streaming (stream: true) dan pemanggilan fungsi persis seperti sebelumnya. Pengujian dapat dilakukan dengan serangkaian permintaan kecil untuk memverifikasi bahwa perilaku sesuai.
OrcaRouter tidak mengubah perilaku model. Ia bertindak murni sebagai gerbang, meneruskan permintaan Anda ke server OpenAI dan mengembalikan respons secara verbatim. Tidak ada pra-pemrosesan tambahan, pasca-pemrosesan, atau penyaringan konten yang diterapkan oleh OrcaRouter. Mengenai penanganan data: OrcaRouter tidak menyimpan atau mencatat data prompt atau completion di luar yang diperlukan untuk penagihan dan pemantauan operasional. Kebijakan data OpenAI sendiri berlaku untuk penggunaan model melalui OrcaRouter. Sesuai dengan fakta yang diberikan, tidak ada penyebutan retensi data oleh OrcaRouter di luar pencatatan API standar. Pengguna harus meninjau kebijakan privasi OrcaRouter dan kebijakan OpenAI untuk memahami penanganan data. Jika Anda memiliki persyaratan residensi data yang ketat, konsultasikan dengan OrcaRouter tentang opsi yang tersedia. Tidak ada indikasi bahwa OrcaRouter membagikan data dengan pelanggan lain. ID model adalah satu-satunya modifikasi yang diperlukan; tidak ada instruksi kustom yang disuntikkan.
Perbedaan utama antara GPT-4o dan GPT-4o-mini adalah ukuran jendela konteks, kemampuan multimodal, kinerja benchmark, dan biaya. GPT-4o menawarkan jendela konteks 128K dan mendukung input gambar dan file. GPT-4o-mini (berdasarkan penawaran OpenAI) biasanya memiliki konteks yang lebih kecil (misalnya, 128K atau 16K pada beberapa versi) dan mungkin tidak mendukung semua modalitas. Pada MATH-500, GPT-4o mendapat skor 79,1; GPT-4o-mini akan mendapat skor lebih rendah. Harga: GPT-4o berbiaya $5/$15 per juta token, sedangkan GPT-4o-mini jauh lebih murah (misalnya, $0,15/$0,60 per juta token pada beberapa versi). Dengan demikian, GPT-4o-mini cocok untuk tugas yang lebih sederhana di mana biaya lebih rendah sangat penting, sementara GPT-4o lebih baik untuk penalaran kompleks, konteks panjang, tugas multimodal. Saat memilih di antara keduanya, pertimbangkan persyaratan akurasi dan kebutuhan akan penanganan gambar atau file. OrcaRouter menawarkan kedua model dengan ID yang berbeda. Jika beban kerja Anda jarang menggunakan gambar atau konteks besar, GPT-4o-mini mungkin menjadi pilihan yang lebih ekonomis.
GPT-4o (2024-05-13) adalah model multimodal dengan jendela konteks 128K, sedangkan versi GPT-4 yang lebih lama (seperti gpt-4-0613) biasanya memiliki konteks 8K atau 32K dan hanya teks (beberapa versi yang lebih baru mendukung gambar melalui endpoint visi terpisah). Harga untuk GPT-4o ($5/$15 per juta token) umumnya lebih rendah dibandingkan harga puncak GPT-4 Turbo (misalnya, $10/$30 per juta token). Kinerja benchmark: skor MATH-500 yang disediakan sebesar 79.1 adalah untuk GPT-4o; GPT-4 tidak memiliki skor MATH-500 resmi dalam fakta yang disediakan, tetapi diketahui memiliki skor lebih rendah pada benchmark matematika serupa. GPT-4o juga menawarkan batas output yang lebih tinggi (16K token) dibandingkan GPT-4 yang lebih lama (4K atau 8K tergantung versi). Secara keseluruhan, GPT-4o memberikan nilai yang lebih baik untuk aplikasi multimodal dan konteks panjang. Namun, model GPT-4 yang lebih lama mungkin telah di-fine-tune untuk tugas tertentu; evaluasi pada data Anda sendiri. Melalui OrcaRouter, kedua keluarga model dapat diakses.
Perbandingan langsung memerlukan fakta spesifik model yang tidak disediakan di sini. Secara umum, kedua model kompetitif dalam kemampuan penalaran dan multimodal. GPT-4o memiliki jendela konteks 128K, mirip dengan konteks 200K Claude (untuk Sonnet). Keduanya mendukung gambar. Skor tolok ukur bervariasi: GPT-4o memberikan skor MATH-500 sebesar 79,1; skor Claude 3.5 Sonnet pada tolok ukur tersebut tidak disediakan. Harga: GPT-4o $5/$15 per juta token; harga Claude Sonnet biasanya sekitar $3/$15 per juta token (dapat berubah). Dengan demikian, biaya input untuk GPT-4o lebih tinggi. Perbedaan kinerja tergantung pada tugas: beberapa pengguna menganggap Claude unggul untuk penulisan panjang, sementara GPT-4o unggul dalam matematika dan pengkodean. Tanpa evaluasi terkontrol, disarankan untuk menguji keduanya pada sampel representatif. OrcaRouter menawarkan kedua model, sehingga Anda dapat membandingkan dengan mudah dengan mengubah ID model. Pada akhirnya, model terbaik tergantung pada kebutuhan spesifik Anda akan akurasi, latensi, dan biaya. Fakta yang diberikan tidak mencakup skor Claude, sehingga perbandingan ini tetap bersifat kualitatif.
Llama 3 (misalnya, Llama 3 70B) adalah model open-source yang dapat di-host sendiri, sedangkan GPT-4o bersifat proprietary dan diakses melalui API. GPT-4o mendukung input multimodal (teks, gambar, file) dengan konteks 128K, sedangkan Llama 3 biasanya hanya teks (kecuali jika di-fine-tune untuk visi) dan memiliki konteks yang lebih kecil (misalnya, 8K atau 32K). Skor benchmark: Skor MATH-500 GPT-4o adalah 79,1; Llama 3 70B mendapat skor sekitar 70–75 pada benchmark matematika serupa (tidak disediakan dalam fakta, tetapi pengetahuan umum). Biaya: Biaya API GPT-4o per token tetap; hosting sendiri Llama 3 melibatkan biaya infrastruktur (GPU, listrik) yang bisa lebih rendah pada volume tinggi. Latensi: GPT-4o berbasis API mungkin lebih cepat untuk beban kerja burst; model yang di-host sendiri dapat menawarkan latensi yang konsisten jika kapasitas dicadangkan. Fleksibilitas: Llama 3 dapat di-fine-tune; GPT-4o tidak bisa. Bagi pengguna yang ingin menghindari vendor lock-in atau menangani data sensitif sepenuhnya secara on-premise, model open-source sangat menarik. OrcaRouter menyediakan akses ke kedua jenis: Anda dapat menggunakan GPT-4o melalui API dan juga mengakses model open-source melalui OrcaRouter jika tersedia.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-05-13",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamtemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Input / 1M token | $5.00 |
|---|---|
| Output / 1M token | $15.00 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
Yang dibicarakan developer minggu ini
GET /api/public/models/openai/gpt-4o-2024-05-13Buka @misc{orcarouter_gpt_4o_2024_05_13,
title = {GPT-4o (2024-05-13) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13}
}OpenAI. (2024). GPT-4o (2024-05-13) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13