Model teks hemat biaya dari OpenAI dengan skor MMLU-Pro 46.2, diakses melalui API OrcaRouter.
openai/gpt-3.5-turbo-0125 adalah model generasi teks yang dikembangkan oleh OpenAI dan tersedia melalui API OrcaRouter. Model ini merupakan bagian dari keluarga GPT-3.5-Turbo, yang dioptimalkan untuk…
GPT-3.5-Turbo-0125 unggul dalam berbagai tugas berbasis teks, termasuk obrolan, peringkasan, penerjemahan, menjawab pertanyaan, dan pembuatan konten. Ia menangani instruksi dengan baik dan dapat menghasilkan respons yang koheren serta sesuai konteks untuk dukungan pelanggan, curah pendapat, dan pelabelan data. Data pelatihannya mencakup beragam domain hingga April 2023, memungkinkan kinerja yang wajar pada pengetahuan umum dan gaya penulisan. Untuk keluaran terstruktur, ia dapat memformat JSON atau mengikuti skema khusus saat diminta dengan jelas.
Jika aplikasi Anda melibatkan volume yang sangat tinggi dengan tugas-tugas sederhana dan berulang seperti klasifikasi langsung atau pembuatan kalimat tunggal, Anda mungkin perlu mempertimbangkan penggunaan model yang lebih kecil seperti GPT-3.5-Turbo-Instruct atau bahkan alternatif sumber terbuka yang dihosting di OrcaRouter. Penghematan biaya dapat signifikan ketika jumlah token rendah dan persyaratan akurasi minimal. Namun, GPT-3.5-Turbo-0125 tetap menjadi pilihan yang hemat biaya untuk sebagian besar penggunaan umum, terutama mengingat skor benchmark yang kuat sebesar 46,2 pada MMLU-Pro.
Ya, model telah dilatih pada teks multibahasa, meskipun kinerja terkuatnya adalah pada bahasa Inggris. Model ini dapat memahami dan menghasilkan teks dalam banyak bahasa termasuk Spanyol, Prancis, Mandarin, Arab, dan lainnya. Akurasi mungkin menurun untuk bahasa dengan representasi terbatas dalam data pelatihan atau untuk ekspresi yang sangat idiomatis. Untuk tugas yang memerlukan kefasihan multibahasa yang tepat, pertimbangkan untuk menambahkan penyesuaian khusus bahasa atau menggunakan model asli. Input dan output selalu berupa teks, jadi karakter non-Inggris didukung.
Karena total jendela konteks adalah 16.385 token (spesifikasi publik yang dikenal luas), model dapat memproses dokumen yang cukup panjang dalam satu kali proses. Namun, keluaran dibatasi hingga 4.096 token per permintaan. Untuk keluaran yang lebih panjang, Anda harus menerapkan pendekatan map-reduce atau sliding window. Mekanisme perhatian model dapat menjaga koherensi di seluruh konteks, tetapi kinerja mungkin menurun untuk tugas yang memerlukan referensi ke awal prompt yang panjang. Strategi chunking dan perangkuman direkomendasikan untuk teks yang sangat panjang.
MMLU-Pro adalah versi yang ditingkatkan dari tolok ukur Massive Multitask Language Understanding, yang mengukur kemampuan model untuk menjawab pertanyaan di 57 mata pelajaran termasuk sains, hukum, dan humaniora. Skor 46,2 menunjukkan bahwa GPT-3.5-Turbo-0125 menjawab dengan benar sekitar 46,2% pertanyaan, yang merupakan angka kompetitif di antara model yang lebih kecil. Skor ini mencerminkan pengetahuan umum yang kuat tetapi juga menunjukkan ruang untuk perbaikan dibandingkan dengan model yang lebih besar seperti GPT-4. Untuk tugas yang membutuhkan keahlian mendalam, pertimbangkan untuk mengevaluasi model pada tolok ukur khusus domain.
Latensi yang tepat tergantung pada ukuran permintaan, kondisi jaringan, dan beban saat ini pada infrastruktur OpenAI. Dalam penggunaan tipikal, GPT-3.5-Turbo-0125 merespons dalam beberapa detik untuk perintah singkat, seringkali lebih cepat daripada model yang lebih besar. OrcaRouter tidak menambahkan overhead yang signifikan di luar waktu respons penyedia. Untuk aplikasi real-time, uji dengan beban kerja Anda. Kecepatan dan biaya model menjadikannya pilihan populer untuk chatbot interaktif dan pipeline produksi di mana latensi per-permintaan penting.
GPT-3.5-Turbo-0125 banyak digunakan karena keandalannya, format yang konsisten, dan kemampuan mengikuti instruksi yang kuat. Jarang sekali gagal menghasilkan respons yang koheren dan mampu menangani kesalahan ketik atau frasa ambigu dengan baik. Cakupan data pelatihannya hingga April 2023 memungkinkannya menjawab peristiwa terkini dari periode tersebut secara akurat. Model ini juga mendukung pesan sistem untuk mengatur perilaku, sehingga mudah disesuaikan untuk berbagai aplikasi seperti bermain peran atau pembuatan teks yang dibatasi.
Model ini mungkin kesulitan dengan penalaran kompleks, aritmetika multi-langkah, dan instruksi yang sangat bernuansa. Model terkadang dapat menghasilkan jawaban yang terdengar masuk akal tetapi salah (halusinasi) dan mungkin tidak secara konsisten menerapkan aturan pemformatan yang ketat. Panjang outputnya dibatasi 4096 token, yang mungkin tidak memadai untuk pembuatan konten panjang. Selain itu, model ini tidak memiliki akses internet secara default dan tidak dapat mengambil informasi real-time atau melakukan tindakan di luar antarmuka obrolan. Untuk logika tingkat lanjut atau data terkini, pertimbangkan retrieval-augmented generation (RAG) atau model yang lebih mumpuni.
OrcaRouter meneruskan harga persis OpenAI tanpa markup: $0,50 per 1 juta token masukan dan $1,50 per 1 juta token keluaran. Tidak ada biaya platform tambahan, biaya langganan, atau biaya per permintaan di luar tarif token ini. Token masukan mencakup prompt, pesan sistem, dan riwayat percakapan; token keluaran adalah respons yang dihasilkan. Penagihan didasarkan pada jumlah token yang diproses, diukur oleh tokenizer tiktoken untuk GPT-3.5.
Meskipun GPT-3.5-Turbo-0125 sudah menjadi salah satu model yang paling hemat biaya dari OpenAI, Anda dapat lebih mengoptimalkannya dengan mengirimkan prompt yang lebih pendek, memangkas riwayat percakapan jika memungkinkan, dan menggunakan nilai max_tokens yang lebih kecil jika kasus penggunaan Anda memungkinkan. Hindari pesan sistem yang terlalu panjang jika tidak diperlukan. Untuk volume yang sangat tinggi, pertimbangkan apakah model gratis atau sumber terbuka di OrcaRouter dapat memenuhi persyaratan akurasi Anda. Trade-off-nya adalah bahwa model yang lebih murah mungkin memerlukan rekayasa prompt atau fine-tuning yang lebih ketat.
OrcaRouter saat ini tidak menawarkan mekanisme caching bawaan untuk perintah atau respons. Setiap panggilan API dikenakan biaya berdasarkan token yang dikirim dan diterima dalam permintaan tersebut. Jika Anda menggunakan perintah yang sama di beberapa panggilan (misalnya, pesan sistem yang identik), Anda akan dikenakan biaya untuk token tersebut setiap kali. Untuk mengurangi biaya, pertimbangkan untuk menyimpan cache permintaan identik di tingkat aplikasi atau menggabungkan beberapa kueri menjadi satu perintah dengan beberapa pesan pengguna.
Gunakan endpoint standar OpenAI Chat Completions dengan URL dasar https://api.orcarouter.ai/v1. Atur parameter model ke 'openai/gpt-3.5-turbo-0125'. Sertakan kunci API OrcaRouter Anda di header Authorization. Contoh menggunakan cURL: curl https://api.orcarouter.ai/v1/chat/completions -H 'Authorization: Bearer YOUR_API_KEY' -H 'Content-Type: application/json' -d '{"model":"openai/gpt-3.5-turbo-0125","messages":[{"role":"user","content":"Hello"}]}'. Format respons sesuai dengan spesifikasi OpenAI.
Semua parameter standar OpenAI chat completions tersedia, termasuk: 'messages', 'max_tokens' (hingga 4096), 'temperature', 'top_p', 'frequency_penalty', 'presence_penalty', 'stop', dan 'stream'. 'n' (jumlah penyelesaian) juga didukung. Tidak ada dukungan 'logprobs' atau 'logit_bias' untuk model ini di gateway OrcaRouter. Perhatikan bahwa parameter 'max_tokens' dibatasi hingga 4096 untuk menyesuaikan dengan batas keluaran model. Untuk streaming, atur 'stream': true untuk menerima delta inkremental.
Jika Anda saat ini menggunakan OpenAI secara langsung, migrasi ke OrcaRouter sangat mudah: ubah URL dasar dari https://api.openai.com/v1 menjadi https://api.orcarouter.ai/v1, perbarui ID model menjadi 'openai/gpt-3.5-turbo-0125' jika Anda menggunakan alias generik, dan ganti kunci API Anda dengan yang dari OrcaRouter. Tidak ada perubahan kode pada format pesan atau parameter yang diperlukan. Jika Anda menggunakan penyedia lain, pastikan pustaka klien Anda mendukung skema yang kompatibel dengan OpenAI. OrcaRouter menyediakan pengganti yang langsung dapat digunakan.
GPT-4 umumnya mengungguli GPT-3.5-Turbo-0125 dalam penalaran kompleks, akurasi faktual, dan mengikuti instruksi yang bernuansa, sebagaimana tercermin dalam skor tolok ukur yang lebih tinggi di MMLU dan pengujian lainnya. Namun, GPT-4 jauh lebih mahal (biasanya 10x biaya per token) dan mungkin memiliki latensi yang lebih tinggi. GPT-3.5-Turbo-0125 menawarkan titik harga-kinerja yang menarik untuk tugas-tugas yang tidak memerlukan kedalaman GPT-4. Pilih model yang lebih besar untuk analisis tingkat lanjut atau ketika toleransi kesalahan sangat sempit.
Claude 3 Haiku milik Anthropic adalah model pesaing berbiaya rendah dengan inferensi cepat dan fitur keamanan yang kuat. Kedua model hanya berupa teks dan dirancang untuk aplikasi bervolume tinggi. Meskipun perbandingan tolok ukur spesifik bervariasi, GPT-3.5-Turbo-0125 banyak diadopsi dan mendapat manfaat dari dokumentasi dan ekosistem yang ekstensif. Claude 3 Haiku mungkin memiliki kekuatan berbeda dalam penulisan kreatif dan perilaku penolakan. Pilihannya tergantung pada preferensi pengembang dan persyaratan integrasi. OrcaRouter mendukung kedua model, sehingga Anda dapat membandingkan secara langsung.
Model open-source (misalnya Llama 3, Mistral) dapat dijalankan di perangkat keras Anda sendiri atau melalui OrcaRouter untuk potensi biaya per token yang lebih rendah, terutama dalam skala besar. Namun, model tersebut seringkali memerlukan lebih banyak pengaturan, rekayasa prompt, dan mungkin memiliki kemampuan mengikuti instruksi yang lebih lemah. GPT-3.5-Turbo-0125 menawarkan keandalan siap pakai, kualitas yang konsisten, dan tanpa pengelolaan infrastruktur. Untuk tim tanpa keahlian ML, API yang dikelola seringkali lebih disukai. Jalankan tolok ukur pada beban kerja spesifik Anda untuk memutuskan.
OpenAI dapat merilis versi yang lebih baru dari GPT-3.5-Turbo atau menghentikan snapshot spesifik ini. OrcaRouter akan memperbarui model yang tersedia sesuai. Jika aplikasi Anda bergantung pada perilaku yang konsisten, Anda mungkin ingin mengunci versi model tertentu dengan menggunakan ID model yang tepat. OrcaRouter memberikan pemberitahuan awal tentang penghentian. Untuk sistem produksi berisiko tinggi, pertimbangkan untuk menguji terhadap versi baru di lingkungan staging sebelum beralih.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-0125",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_pparallel_tool_calls| Input / 1M token | $0.500 |
| Output / 1M token | $1.50 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/openai/gpt-3.5-turbo-0125Buka @misc{orcarouter_gpt_3_5_turbo_0125,
title = {openai/gpt-3.5-turbo-0125 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125}
}openai. (n.d.). openai/gpt-3.5-turbo-0125 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125