يقدم هذا النموذج أربعة أضعاف طول السياق لـ gpt-3.5-turbo، مما يسمح له بدعم ما يقرب من 20 صفحة من النص في طلب واحد بتكلفة أعلى. بيانات التدريب: حتى...
GPT-3.5 Turbo 16k هو نسخة موسّعة السياق من نموذج GPT-3.5 Turbo الخاص بـ OpenAI، تم إطلاقه في الأصل لدعم المهام التي تتطلب معالجة كميات أكبر من النص دون تقسيم. تسمح سعة نافذة السياق البالغة 16,385…
يبرع GPT-3.5 Turbo 16k في المهام النصية التي تستفيد من السياقات الطويلة. وتشمل هذه المهام تلخيص المستندات متعددة الصفحات، والحفاظ على تماسك المحادثات متعددة الجولات، والإجابة عن الأسئلة المطروحة عبر فقرات طويلة، وإجراء مراجعة الكود عبر قواعد أكواد أكبر. تسمح نافذة السياق البالغة 16 ألف رمز (16k) له بتناول فصول كاملة أو سلاسل رسائل بريد إلكتروني طويلة دفعة واحدة، مما يقلل الحاجة إلى التقسيم اليدوي للنص. كما يعالج النموذج مهام التوليد القياسية مثل صياغة رسائل البريد الإلكتروني، وكتابة المحتوى الإبداعي، وتقديم الشروحات. وباعتباره نموذجًا من فئة GPT-3.5، فهو بارع في اتباع التعليمات وإنتاج نص بطلاقة، على الرغم من أنه قد لا يضاهي GPT-4 في الاستدلال المعقد أو المعرفة المتخصصة الدقيقة.
إذا كان تطبيقك لا يتطلب نافذة السياق الموسعة، فقد يكون نموذج GPT-3.5 Turbo 4k القياسي (أو المتغيرات الأرخص الأخرى) أكثر فعالية من حيث التكلفة. بالنسبة للمهام التي تتضمن مطالبات قصيرة ومخرجات أقل من 4,000 رمز، فإن الإصدار 16k لا يقدم أي ميزة ويكلف نفس التكلفة لكل رمز. يجب عليك أيضًا التفكير في نموذج أصغر أو أسرع عندما يعمل مسار معالجتك بالفعل مع نص مقسم ولا يستفيد من سياق كبير. في OrcaRouter، يمكنك التبديل بسهولة بين معرفات النماذج — على سبيل المثال، باستخدام "openai/gpt-3.5-turbo" (4k) عندما تكون احتياجات السياق ضئيلة. قم بتقييم متوسط عدد رموز الإدخال لديك واختر النموذج الذي يغطي >95% من الطلبات لتجنب دفع ثمن سعة غير مستخدمة.
الفائدة الرئيسية للسياق الذي يبلغ 16 ألفًا هي القدرة على معالجة مدخلات أطول في طلب واحد، مما يحافظ على التماسك ويزيل المشكلات الناتجة عن تقسيم النص عبر النوافذ. على سبيل المثال، يمكنك إدخال ورقة بحثية كاملة مكونة من 10,000 كلمة إلى النموذج وتطلب منه استخراج النتائج الرئيسية دون الحاجة إلى تجميع الأجزاء يدويًا. في التطبيقات الحوارية، يمكن للنموذج تذكر سجل الحوار الكامل من تفاعل طويل لدعم العملاء، مما يؤدي إلى ردود أكثر وعيًا بالسياق. بالنسبة لمهام البرمجة، يمكنك تضمين ملفات متعددة أو مكتبة دوال كاملة في المطالبة، مما يمكّن النموذج من فهم التبعيات عبر الملفات. تقلل هذه القدرة من العبء الهندسي لبناء منطق التقسيم وإدارة الحالة.
GPT-3.5 Turbo 16k يرث القيود العامة لسلسلة GPT-3.5. يمكنه إنتاج معلومات تبدو معقولة ولكنها غير صحيحة أو غير مدعومة (هلوسة)، خاصة في المجالات المتخصصة أو شديدة التفصيل. النموذج نصي فقط ولا يمكنه معالجة الصور أو الصوت أو غيرها من الوسائط. عمق استدلاله أقل من GPT‑4، لذا قد يواجه صعوبة في المنطق المعقد متعدد الخطوات، أو البراهين الرياضية، أو التفسير القانوني الدقيق. درجة MMLU‑Pro البالغة 46.2، رغم أنها محترمة، إلا أنها أقل بكثير من درجة GPT‑4 النموذجية التي تزيد عن 80، مما يشير إلى ضعف الدقة الواقعية في الموضوعات المتقدمة. بالإضافة إلى ذلك، حد السياق البالغ 16,384 رمزًا، رغم كبره، ليس غير محدود؛ المستندات الطويلة جدًا لا تزال تتطلب هندسة مطالبات دقيقة أو تجزئة.
يحقق نموذج GPT-3.5 Turbo 16k درجة 46.2 على معيار MMLU‑Pro. MMLU‑Pro هو مجموعة فرعية منتقاة من مجموعة Massive Multitask Language Understanding، المصممة لتقييم عمق معرفة النموذج عبر 57 موضوعًا متنوعًا تشمل العلوم والتكنولوجيا والهندسة والرياضيات (STEM) والعلوم الاجتماعية والعلوم الإنسانية والقانون. تمثل الدرجة نسبة الإجابات الصحيحة. للمقارنة، النسخة الأصغر GPT-3.5 Turbo (4k) تسجل عادة حوالي 43 على MMLU (القياسي)، بينما يسجل GPT‑4 أعلى من 80. تشير قيمة 46.2 إلى أن هذا النموذج يتمتع بفهم معتدل للمواد الواقعية المعقدة، لكنه ليس الأحدث في استرجاع المعرفة البحتة. يُستخدم بشكل أفضل في المهام التي تكون فيها أهمية توليد نص سلس بدقة واقعية مقبولة أعلى من التفكير من الدرجة الأولى.
على الرغم من عدم توفير معايير تقييم تفكير محددة، إلا أن GPT-3.5 Turbo 16k يتصرف بشكل مشابه لـ GPT-3.5 Turbo القياسي في الاستنتاج المنطقي والحساب والتفكير المنطقي العام. يمكنه حل الألغاز المنطقية البسيطة والتعليمات متعددة الخطوات، لكنه قد يفشل في المهام التي تتطلب الالتزام الصارم بالقيود أو التفكير المضاد للواقع. نافذة السياق الموسعة لا تحسن قدرة التفكير بحد ذاتها - بل تسمح فقط بمعالجة مدخلات إضافية. من الناحية العملية، يبلغ المستخدمون أن النموذج يؤدي بشكل مرضٍ في تطبيقات التلخيص والترجمة وروبوتات الدردشة، لكن لا ينبغي الاعتماد عليه في القرارات عالية المخاطر دون التحقق البشري. درجة MMLU‑Pro البالغة 46.2 تؤكد أن الخبرة المتخصصة في المجال متوسطة.
مقاييس السرعة والكمون لنموذج GPT-3.5 Turbo 16k غير معطاة بشكل صريح، ولكن باعتباره نموذجًا من فئة GPT-3.5، فهو أسرع بشكل عام من GPT‑4 ومناسب للتطبيقات في الوقت الفعلي. على OrcaRouter، يعتمد وقت الاستجابة على البنية التحتية لـ OpenAI بالإضافة إلى عوامل الشبكة. بالنسبة للمدخلات النموذجية التي تقل عن 4000 رمز (token)، غالبًا ما يُرجع النموذج الرمز الأول في غضون مئات الميلي ثانية إلى بضع ثوانٍ. يجب أن يتوقع المستخدمون كمونًا مشابهًا لنموذج GPT-3.5 Turbo (4k) القياسي، لأن البنية الأساسية متطابقة باستثناء حد السياق. قد يكون نموذج 16k أبطأ قليلاً عند معالجة المطالبات الطويلة جدًا، لأن النموذج يحتاج إلى الانتباه إلى عدد أكبر من الرموز، لكن الفرق عادةً ما يكون طفيفًا. بالنسبة لحالات الاستخدام الحساسة للكمون، نوصي بالاختبار بأطوال المطالبات الخاصة بك.
تسعير GPT-3.5 Turbo 16k على OrcaRouter هو 3.00 دولار لكل مليون رمز إدخال و4.00 دولار لكل مليون رمز إخراج، ويتم الفوترة وفقًا لسعر مزود OpenAI تمامًا دون أي رسوم إضافية. لا توجد رسوم منصة إضافية، أو مستويات اشتراك، أو خصومات على الكميات — السعر ثابت وشفاف. يتم حساب التكاليف بناءً على عدد الرموز في كل طلب: رموز الإدخال هي إجمالي الرموز في مصفوفة الرسائل، ورموز الإخراج هي الرموز المُنشأة في الرد. لا يضيف OrcaRouter أي رموز إضافية. أنت تدفع فقط مقابل ما تستخدمه، ويتم تفصيل استخدامك في لوحة تحكم OrcaRouter الخاصة بك.
المقايضة الرئيسية في التكلفة تكون بين الدفع مقابل نافذة السياق الكبيرة مقابل استخدام نموذج أرخص بنافذة سياق أصغر. إذا كان متوسط الإدخال نادرًا ما يتجاوز 4,000 رمز (token)، فإن النموذج القياسي GPT-3.5 Turbo (4k) — الذي تبلغ تكلفته $1.50 للإدخال / $2.00 للإخراج لكل مليون رمز على OpenAI — سيكون أكثر اقتصادية. ومع ذلك، بمجرد أن تتجاوز الإدخالات بانتظام 4,000 رمز، فإن نموذج 16k يمنع الحاجة إلى التقسيم المكلف ومنطق الاسترجاع. سعر الرمز الواحد لنموذج GPT-3.5 Turbo 16k هو ضعف سعر النموذج 4k. لذلك، تحتاج إلى تقييم توزيع الرموز لديك: إذا كانت أكثر من 50% من الطلبات تتطلب >4k رمز، فقد يكون نموذج 16k أرخص بشكل عام عند حساب وقت الهندسة اللازم لتنفيذ التقسيم.
لا يقوم OrcaRouter بتخزين مخرجات النموذج أو إكمال المطالبات مؤقتًا افتراضيًا. يتم إرسال كل طلب جديدًا إلى OpenAI. هذا يعني أنك تتحمل تكاليف الرموز الكاملة لكل استدعاء، بما في ذلك المدخلات المتكررة. لتقليل التكلفة، فكر في تنفيذ التخزين المؤقت للمطالبات من جانبك — على سبيل المثال، تخزين رسالة النظام مؤقتًا أو استخدام قاعدة بيانات متجهة لاسترداد السياق ذي الصلة بدلاً من إعادة إرسال المستند الكامل في كل مرة. نظرًا لأن تسعير النموذج هو لكل رمز ويعتمد على إجمالي الرموز المرسلة، فإن أي تقليل في طول الإدخال يقلل التكلفة مباشرة. تضمن سياسة هامش الربح الصفري أن أي استراتيجية تخزين مؤقت تستخدمها تحقق وفورات بنفس معدل استخدام OpenAI المباشر.
تطبق OrcaRouter هامش ربح صفري على نموذج GPT-3.5 Turbo 16k. الأسعار المذكورة — 3.00 دولار لكل مليون رمز إدخال و 4.00 دولار لكل مليون رمز إخراج — هي بالضبط الأسعار التي تحددها OpenAI لهذا النموذج. ولا تضيف OrcaRouter أي رسوم إضافية. هذه السياسة تجعل OrcaRouter وسيطًا مباشرًا: تدفع سعر المزوّد دون أي رسوم منصّة إضافية. لا يوجد حد أدنى للإنفاق أو التزام. لكن انتبه إلى أنه إذا غيّرت OpenAI أسعارها مستقبلًا، فستقوم OrcaRouter بتمرير تلك التغييرات. يمكنك مراقبة تكاليفك في الوقت الفعلي عبر لوحة تحكم OrcaRouter، التي تعرض استهلاك الرموز والتكلفة لكل نموذج.
لاستخدام GPT-3.5 Turbo 16k عبر OrcaRouter، قم بتعيين عنوان URL الأساسي لعميل API الخاص بك إلى https://api.orcarouter.ai/v1 واستخدم معرف النموذج "openai/gpt-3.5-turbo-16k". جميع معلمات الإكمال للمحادثة من OpenAI مدعومة، بما في ذلك messages وtemperature وtop_p وfrequency_penalty وpresence_penalty وmax_tokens وstop وstream. يجب المصادقة باستخدام مفتاح API صالح من OrcaRouter يتم توفيره في رأس Authorization (Bearer <key>). مثال باستخدام curl: curl https://api.orcarouter.ai/v1/chat/completions -H "Authorization: Bearer YOUR_KEY" -H "Content-Type: application/json" -d '{"model":"openai/gpt-3.5-turbo-16k","messages":[{"role":"user","content":"Hello"}],"max_tokens":1024}'. يُرجع OrcaRouter نفس بنية JSON مثل OpenAI.
جميع معاملات الإكمال الحواري لـ OpenAI متاحة عند استخدام GPT-3.5 Turbo 16k عبر OrcaRouter. تتضمن المعاملات الرئيسية: messages (مصفوفة من كائنات الدور/المحتوى)، temperature (0‑2، الافتراضي 1)، top_p (0‑1، الافتراضي 1)، n (عدد الإكمالات التي سيتم إنشاؤها، الافتراضي 1)، stream (منطقي، الافتراضي false)، max_tokens (حتى 4096)، stop (سلسلة نصية واحدة أو أكثر)، frequency_penalty (‑2‑2، الافتراضي 0)، presence_penalty (‑2‑2، الافتراضي 0)، و logit_bias (خريطة من معرفات الرموز إلى الانحياز). يجب أن يكون معرّف النموذج بالضبط "openai/gpt-3.5-turbo-16k". لاحظ أن max_tokens لا يمكن أن يتجاوز 4096، ويجب أن يبقى إجمالي رموز المطالبة والإكمال ضمن 16,384. يتحقق OrcaRouter من هذه الحدود ويعيد خطأً إذا تم تجاوزها.
يتطلب الترحيل من تكامل مباشر مع OpenAI إلى OrcaRouter لـ GPT-3.5 Turbo 16k ثلاثة تغييرات فقط: تحديث عنوان URL الأساسي من https://api.openai.com/v1 إلى https://api.orcarouter.ai/v1، واستبدال مفتاح API بمفتاح OrcaRouter الخاص بك، وتغيير معرف النموذج من "gpt-3.5-turbo-16k" إلى "openai/gpt-3.5-turbo-16k". جميع الأكواد الأخرى، بما في ذلك تنسيق الرسائل ومعالجة المعاملات وتحليل الاستجابات، تبقى كما هي تمامًا. إذا كنت تستخدم سابقًا إصدار 4k، فيمكنك التبديل إلى نموذج 16k بتغيير معرف النموذج فقط. لا حاجة لتعديلات في المخطط أو حدود المعدل؛ OrcaRouter يعكس مواصفات API الخاصة بـ OpenAI. يمكن إجراء الاختبار عن طريق إجراء طلب واحد مع موجه قصير لتأكيد المصادقة وبنية الاستجابة.
GPT-3.5 Turbo 16k و GPT-3.5 Turbo 4k (معرف النموذج "openai/gpt-3.5-turbo") يشتركان في نفس البنية الأساسية والقدرات. الاختلافات الوحيدة هي نافذة السياق (16,384 مقابل 4,096 رمزًا) والتسعير. الإصدار 4k أرخص: على OpenAI، تكلفته $1.50/1M رمز إدخال و $2.00/1M رمز إخراج؛ عبر OrcaRouter تنطبق نفس الأسعار. إصدار 16k يكلف الضعف بالضبط. الأداء على معايير مثل MMLU (القياسي) متطابق تقريبًا — GPT-3.5 Turbo 4k يسجل حوالي 43 على MMLU، بينما إصدار 16k يسجل 46.2 على MMLU‑Pro (متغير أصعب). للمهام التي تتناسب مع 4k رمز، النموذج 4k أكثر اقتصادية. للمهام الأطول، يتجنب النموذج 16k أخطاء اقتطاع السياق.
بالمقارنة مع GPT‑4 (مثل "openai/gpt‑4")، فإن GPT‑3.5 Turbo 16k أضعف بشكل ملحوظ في التفكير والدقة الواقعية والمواءمة الآمنة. عادةً ما يحقق GPT‑4 درجة >80 في اختبار MMLU ويتعامل بشكل أفضل بكثير مع المنطق متعدد الخطوات المعقّد والتعليمات الدقيقة. كما يدعم GPT‑4 الصور في بعض النسخ وله نافذة سياق تصل إلى 8,192 أو 32,768 رمزًا. ومع ذلك، فإن GPT‑4 أبطأ بكثير وأكثر تكلفة — غالبًا 10‑20 ضعفًا لكل رمز. تقدم نماذج Claude (مثل "anthropic/claude‑2") أيضًا نوافذ سياق كبيرة (100k رمز) وقدرات تفكير قوية، لكنها مسعّرة بأعلى من GPT‑3.5 Turbo وقد تختلف دلالات واجهة برمجة التطبيقات الخاصة بها. GPT‑3.5 Turbo 16k هو خيار فعال من حيث التكلفة عندما تحتاج فقط إلى سياق موسع دون تفكير من الدرجة الأولى. يتيح لك OrcaRouter تجربة أي نموذج بسهولة.
متوافق مع OpenAI — أبقِ على SDK الحالي
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-16k",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_p| الإدخال / 1M توكن | $3.00 |
| الإخراج / 1M توكن | $4.00 |
| العملة | USD |
تقدير بناءً على السعر المُعلن
تقدير فقط — يعتمد العدد الفعلي للرموز على مُجزّئ الرموز الخاص بالمزوّد.
GET /api/public/models/openai/gpt-3.5-turbo-16kفتح @misc{orcarouter_gpt_3_5_turbo_16k,
title = {GPT-3.5 Turbo 16k API},
author = {OpenAI},
year = {2023},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-16k}
}OpenAI. (2023). GPT-3.5 Turbo 16k API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-16k