يقدم إصدار 2024-08-06 من GPT-4o أداءً محسنًا في المخرجات المنظمة، مع إمكانية توفير مخطط JSON في `respone_format`. اقرأ المزيد [هنا](https://openai.com/index/introducing-structured-outputs-in-the-api/). GPT-4o ("o" تعني "omni") هو...
GPT-4o (2024-08-06) هو إصدار من نموذج GPT-4o الخاص بـ OpenAI، تم إطلاقه في أغسطس 2024. وهو نموذج لغوي كبير متعدد الوسائط يعالج مدخلات النصوص والصور والملفات. يتم الوصول إلى النموذج عبر واجهة API…
تتمثل نقاط القوة الأساسية للنموذج في التفكير الرياضي والفهم متعدد الوسائط. تشير نتيجته في اختبار MATH-500 البالغة 79.5 إلى قدرة قوية على حل المسائل الرياضية المعقدة خطوة بخطوة. يمكنه تفسير الصور والرسوم البيانية والمخططات، وتقديم أوصاف أو تحليلات دقيقة. تسمح نافذة السياق البالغة 128 ألف رمز له بمعالجة كميات كبيرة من المعلومات، مثل كتاب كامل أو سلسلة من الصور المصحوبة بنص. كما يتعامل مع تحميل الملفات، مما يجعله مفيدًا لمهام مثل استخراج البيانات من جداول البيانات أو قراءة ملفات التعليمات البرمجية. هذه القدرات مدعومة بالتحسين المستمر من OpenAI، ويُستخدم النموذج على نطاق واسع في بيئات الإنتاج.
GPT-4o (2024-08-06) يتفوق في المهام التي تتطلب الجمع بين المعلومات البصرية والنصية. تشمل الأمثلة حل المسائل الرياضية باستخدام الرسوم البيانية، وتحليل لقطات الشاشة لواجهات المستخدم بغرض الإبلاغ عن الأخطاء، واستخراج البيانات من المستندات الممسوحة ضوئيًا، وتقديم شروحات مفصلة للأشكال المعقدة. كما أنه فعال في إنشاء الأكواد وتصحيح الأخطاء عندما يتضمن السياق لقطات شاشة للأخطاء أو بنية الملفات. تستفيد التطبيقات التعليمية من أسلوب التفكير الخطوي لديه. بالنسبة للمهام النصية البحتة والبسيطة، مثل الأسئلة والأجوبة الأساسية أو تلخيص النصوص القصيرة، قد يكون النموذج الأرخص مثل GPT-4o mini كافيًا. يُفضّل حجز هذا النموذج لسير العمل عالية القيمة أو متعددة الوسائط أو المكثفة في التفكير.
بالنسبة للمهام التي لا تستخدم الرؤية أو معالجة الملفات أو التفكير المتقدم، فإن النموذج الأصغر والأرخص يكون أكثر فعالية من حيث التكلفة. على سبيل المثال، يمكن معالجة تطبيقات الدردشة البسيطة، وإنشاء المحتوى القصير، أو مهام التصنيف بواسطة نماذج مثل GPT-4o mini أو GPT-3.5 Turbo. إذا كان تطبيقك يعالج النصوص فقط ولا يحتاج إلى نافذة سياق بسعة 128 ألف رمز، فإن نموذجًا بنافذة سياق أصغر قد يقلل من زمن الاستجابة والتكلفة. بالإضافة إلى ذلك، إذا كانت بياناتك لا تتضمن صورًا أو ملفات، فإن نموذجًا نصيًا بحتًا يكون كافيًا. قيّم ما إذا كان تعقيد المهمة يبرر السعر الأعلى لكل رمز في GPT-4o. يقدم OrcaRouter مجموعة من النماذج بنقاط سعر مختلفة لتتناسب مع حالات الاستخدام المتنوعة.
نعم، النموذج يقبل إدخال الملفات. يمكنك تحميل ملفات مثل PDF، مستندات Word، جداول البيانات، الصور، وملفات الأكواد. يقوم النموذج باستخراج وفهم المحتوى داخل هذه الملفات، ويعاملها كجزء من السياق. على سبيل المثال، يمكنه قراءة النص من ملف PDF، تفسير الأرقام في ملف CSV، أو تحليل الكود المصدري في ملف .py. عند دمجه مع إدخالات الصور، يمكنه معالجة الوسائط المختلطة مثل مستند يحتوي على رسوم بيانية مدمجة. هذا مفيد بشكل خاص لأتمتة استخراج البيانات، مراجعة المستندات، وتحليل الأكواد. يُرجى ملاحظة أن معالجة الملفات تُحتسب ضمن نافذة السياق البالغة 128,000 رمزًا، لذا قد تستهلك الملفات الكبيرة مساحة كبيرة.
في اختبار MATH-500، حققت GPT-4o (2024-08-06) درجة 79.5. MATH-500 هي مجموعة فرعية من مجموعة بيانات MATH، تتكون من 500 مسألة رياضية صعبة على مستوى المسابقات تغطي موضوعات مثل الجبر والهندسة ونظرية الأعداد والاحتمالات. تشير درجة 79.5 إلى إجابات صحيحة في حوالي أربعة من كل خمسة مسائل. وهذا يضعها بين النماذج الأعلى أداءً في التفكير الرياضي. على الرغم من عدم تقديم نتائج اختبارات أخرى، يُظهر هذا المقياس قوة النموذج في الاستنتاج المنطقي خطوة بخطوة والحساب. يمكن للمستخدمين توقع أداء موثوق في التطبيقات كثيفة الرياضيات مثل التدريس والتحقق وتوليد المسائل.
لا يتم تقديم نتائج معيارية محددة تتجاوز MATH-500 في الحقائق المتاحة. ومع ذلك، يُعرف نموذج GPT-4o كعائلة نماذج بأدائه التنافسي في مجموعة من المعايير القياسية بما في ذلك MMLU (فهم اللغة متعدد المهام الهائل) وHumanEval (توليد الكود) ومختلف مهام الرؤية واللغة. قد يتضمن إصدار أغسطس 2024 تحديثات تحسن التفكير واتباع التعليمات. بدون أرقام دقيقة، يجب على المستخدمين الرجوع إلى التقييمات المنشورة من OpenAI للحصول على أحدث البيانات. لأغراض عملية، يُعتبر النموذج الأحدث بين نماذج الواجهة البرمجية المفتوحة (open-API) من حيث القدرات المشتركة للنص والرؤية.
لا توجد أرقام محددة حول زمن الاستجابة أو الإنتاجية لهذا النموذج. بشكل عام، تم تصميم GPT-4o ليكون أسرع من الإصدارات السابقة من GPT-4 مع الحفاظ على الجودة. يعتمد زمن الاستجابة على عوامل مثل طول الإدخال وطول الإخراج والطلبات المتزامنة والبنية التحتية الخلفية. عند الوصول عبر OrcaRouter، يتم توجيه الطلبات إلى خوادم OpenAI، وتكون أوقات الاستجابة مماثلة لاستدعاءات API المباشرة. يمكن للمستخدمين تحسين الأداء باستخدام أصغر سياق ضروري وتعيين حدود قصوى معقولة لـ max_tokens. بالنسبة للتطبيقات في الوقت الفعلي، يُنصح بالاختبار باستخدام أعباء عمل تمثيلية. لا يضيف OrcaRouter أي تأخير إضافي يتجاوز توجيه الشبكة.
نقاط القوة: تفكير رياضي قوي (MATH-500 79.5)، إدخال متعدد الوسائط (نص، صور، ملفات)، نافذة سياق كبيرة 128K، وحد أقصى عالي لعدد الرموز المخرجة (16,384). إنه فعال بشكل خاص في التفكير المعقد، وفهم الرؤية، والمهام التي تتطلب سياقًا طويل المدى. القيود: تكلفة أعلى مقارنة بالنماذج الأصغر؛ قد لا يكون مثاليًا للمهام البسيطة أو منخفضة زمن الاستجابة؛ يمكن أن تختلف الدقة في المدخلات الغامضة أو سيئة التنسيق؛ قد لا تعمل قدرات الرؤية بشكل جيد على الصور المشوهة أو منخفضة الدقة. أيضًا، كما هو الحال مع جميع نماذج اللغات الكبيرة، يمكن أن ينتج إجابات تبدو صحيحة ولكنها غير صحيحة، خاصة في المجالات خارج بيانات تدريبه. التخفيف عن طريق التحقق من المخرجات واستخدام هندسة المطالبات.
تسعير GPT-4o (2024-08-06) يعتمد على استخدام الرموز (tokens). يتم محاسبة رموز الإدخال بسعر $2.50 لكل مليون رمز. ورموز الإخراج بسعر $10.00 لكل مليون رمز. هذا هو سعر المزود (OpenAI)، ولا تفرض OrcaRouter أي هامش ربح—فأنت تدفع نفس المبلغ تمامًا كما لو كنت تتصل بـ OpenAI مباشرة. تُحتسب الرموز بناءً على النص المرسل والمستلم. تستهلك صور وملفات الإدخال رموزًا تتناسب مع حجمها وتعقيد المعالجة (تكلفة رموز الصور وفقًا لسياسة OpenAI). لا توجد رسوم إضافية لاستخدام نقطة نهاية API. يتم عادةً تجميع الفوترة حسب فترة الاستخدام، ويمكنك مراقبة استهلاك الرموز من خلال لوحة تحكم OrcaRouter.
لا توجد تكاليف خفية أو رسوم إضافية. تقوم OrcaRouter بالفواتير بسعر المزود المحدد بدون أي هامش ربح. الأسعار المدرجة ($2.50/1M إدخال، $10/1M إخراج) هي شاملة لكل شيء. لا توجد رسوم إضافية للمصادقة أو الاتصال أو الدعم. ومع ذلك، فإن مدخلات الصور والملفات تتحمل تكاليف رمزية (token) تحددها سياسات التسعير الخاصة بـ OpenAI، والتي قد تتجاوز تكلفة الرموز النصية فقط. على سبيل المثال، قد تكلف صورة بدقة 1080×1080 عددًا معينًا من الرموز تتجاوز الرموز النصية. تحقق من وثائق OpenAI لمعرفة تسعير الرموز الدقيق للصور. تقوم OrcaRouter بتمرير هذه التكاليف دون أي هامش ربح. لا يوجد خصم يعتمد على التخزين المؤقت وفقًا للمعلومات الحالية.
اختيار GPT-4o (2024-08-06) بدلاً من النماذج الأرخص مثل GPT-4o mini أو GPT-3.5 Turbo ينطوي على مقايضة بين الأداء والتكلفة. سعر كل رمز (token) أعلى، لذا بالنسبة للتطبيقات ذات الحجم الكبير، يمكن أن تتراكم التكاليف بسرعة. ومع ذلك، إذا كانت المهمة تتطلب القدرات متعددة الوسائط للنموذج أو نافذة السياق البالغة 128 ألف رمز، فقد لا تكون النماذج الأرخص كافية، مما قد يؤدي إلى مخرجات غير مكتملة أو أقل جودة. بالنسبة للمهام النصية فقط ذات التفكير البسيط، فإن النموذج الأرخص يقلل النفقات دون التضحية بالكثير من الجودة. يتيح لك OrcaRouter التبديل بين النماذج بسهولة، لذا يمكنك التجربة للعثور على أفضل توازن بين التكلفة والأداء لكل حالة استخدام.
لا تذكر الحقائق المتاحة أي آليات للتخزين المؤقت أو الخصم لهذا النموذج. تقوم OrcaRouter بالفوترة بسعر المزوّد دون أي هامش ربح، لذا فإن أي خصومات ستأتي على الأرجح من تسعيرة OpenAI الخاصة بها (مثل الخصومات المتدرجة للاستخدام عالي الحجم، إن وُجدت). قد تقدّم OrcaRouter ميزات التخزين المؤقت الخاصة بها، ولكن هذا غير مؤكد لهذا النموذج. لتقليل التكاليف، فكّر في تقليل استخدام الرموز المميزة في المدخلات عبر اقتطاع تاريخ المحادثة، واستخدام استفسارات أقصر، والحد من طول المخرجات باستخدام معامل max_tokens. بالنسبة للاستفسارات المتكررة المتطابقة، يمكنك تنفيذ التخزين المؤقت على مستوى التطبيق.
لاستدعاء GPT-4o (2024-08-06) عبر OrcaRouter، استخدم عنوان URL الأساسي https://api.orcarouter.ai/v1 واضبط معرف النموذج على "openai/gpt-4o-2024-08-06". واجهة البرمجة متوافقة تمامًا مع مكتبات عملاء OpenAI. على سبيل المثال، في بايثون باستخدام مكتبة openai، يمكنك تعيين openai.api_base = "https://api.orcarouter.ai/v1" و openai.api_key = "your-orcarouter-api-key". ثم استدعاء openai.ChatCompletion.create(model="openai/gpt-4o-2024-08-06", messages=[...]). جميع المعاملات القياسية (temperature, max_tokens, top_p, إلخ) مدعومة. راجع وثائق OrcaRouter للحصول على تفاصيل حول المصادقة وحدود المعدل.
نظرًا لأن النموذج يدعم واجهة برمجة التطبيقات المتوافقة مع OpenAI، يمكنك استخدام مجموعة المعلمات الكاملة المتاحة في نقطة نهاية محادثات الإكمال الخاصة بـ OpenAI. تشمل المعلمات الرئيسية: model (يُضبط على معرف النموذج)، messages (قائمة من كائنات الدور-المحتوى)، temperature (0-2)، top_p (0-1)، n (عدد الإكمالات)، max_tokens (حتى 16384)، stop (تسلسلات)، frequency_penalty، presence_penalty، logit_bias، وuser (لتتبع الاستخدام). للمدخلات متعددة الوسائط، يمكنك تضمين صورة أو file_url في محتوى رسالة باستخدام التنسيق المناسب (على سبيل المثال: content: [{type: "text", text: "..."}, {type: "image_url", image_url: {...}}]). راجع وثائق OpenAI للحصول على صيغة إدخال الصور والملفات.
الانتقال من OpenAI API مباشرة إلى OrcaRouter يتطلب تغييرين: 1) تعيين عنوان URL الأساسي إلى https://api.orcarouter.ai/v1، و2) استبدال مفتاح OpenAI API الخاص بك بمفتاح OrcaRouter API. لا حاجة لإجراء تغييرات على الكود الخاص بتنسيق الرسائل أو المعاملات. يتغير معرف النموذج من "gpt-4o-2024-08-06" إلى "openai/gpt-4o-2024-08-06". تبقى جميع المنطقيات الحالية للتعامل مع التدفق (streaming) واستدعاء الدوال (function calling) وتحليل الردود كما هي. تم تصميم OrcaRouter API ليكون بديلاً مباشرًا. بعد التبديل، يمكنك أيضًا الوصول إلى نماذج موفري خدمات آخرين من خلال نفس الواجهة، مما يتيح المقارنة السهلة وتوزيع الأحمال.
يتم المصادقة عبر مفتاح API يُقدمه OrcaRouter. قم بتضمينه في الترويسة (header) كـ "Authorization: Bearer YOUR_ORCAROUTER_API_KEY". حدود معدل الطلبات (rate limits) تُدار بواسطة OrcaRouter وقد تختلف عن حدود OpenAI المباشرة. اطلع على خطة OrcaRouter الخاصة بك للتفاصيل. إذا تجاوزت حدود معدل الطلبات، ستتلقى استجابات HTTP 429. للتخفيف من ذلك، قم بتطبيق منطق إعادة المحاولة مع التراجع الأسي (exponential backoff). قد يسمح لك OrcaRouter أيضًا بتعيين حدود معدل الطلبات لكل مستخدم عبر معلمة المستخدم (user parameter). لاحتياجات الإنتاجية العالية، اتصل بدعم OrcaRouter للحصول على ترتيبات مخصصة. النموذج نفسه لا يحتوي على حدود معدل طلبات منفصلة؛ فهو يخضع للحدود الإجمالية لنقطة النهاية (endpoint).
GPT-4o (2024-08-06) هو النموذج الرائد كامل الحجم، بينما GPT-4o mini هو إصدار أصغر وأقل تكلفة. الاختلافات الرئيسية: GPT-4o لديه نافذة سياق 128K (و GPT-4o mini لديه أيضًا 128K، لكن الإصدار المصغر له حد إخراج أقل، عادة 16K أيضًا؟ في الواقع GPT-4o mini لديه أيضًا سياق 128K وإخراج 16K، لكنه أقل قدرة في التفكير والرؤية. النموذج الكامل يسجل 79.5 على MATH-500؛ GPT-4o mini يسجل درجات أقل في معايير الرياضيات. الأسعار: GPT-4o أغلى ($2.50/$10 مقابل GPT-4o mini بسعر $0.15/$0.60 لكل مليون رمز). بالنسبة للمهام التي تتطلب دقة عالية أو تفكيرًا معقدًا، يُوصى بالنموذج الكامل. أما للمهام الأبسط، فيوفر الإصدار المصغر بديلاً فعالاً من حيث التكلفة.
مقارنةً بـ GPT-4 (مثل GPT-4-0613 أو GPT-4 Turbo)، يقدم GPT-4o (2024-08-06) العديد من التحسينات: إدخال متعدد الوسائط أصلي (نصوص، صور، ملفات) دون الحاجة إلى نماذج رؤية منفصلة، نافذة سياق أكبر (128K مقابل 32K في الإصدارات الأقدم من GPT-4)، واستنتاج أسرع. التسعير أقل من متغيرات GPT-4 السابقة التي كانت غالبًا أكثر تكلفة. على سبيل المثال، كان GPT-4 Turbo يحتوي على سياق مشابه لكن بتسعير أعلى. من حيث المعايير، حصل على درجة 79.5 في اختبار MATH-500 متجاوزًا نماذج GPT-4 الأقدم. ومع ذلك، قد يجد بعض المستخدمين أن النماذج السابقة أكثر استقرارًا لمهام محددة بسبب تاريخ التدريب الأطول. بشكل عام، يُعد GPT-4o خليفة أكثر حداثة وكفاءة.
يعتمد الاختيار على الاحتياجات المحددة وتفضيلات المزود. يتميز GPT-4o (2024-08-06) في التفكير الرياضي (MATH-500 79.5) والمهام متعددة الوسائط التي تشمل النصوص والصور والملفات. قد توفر نماذج Claude من Anthropic ميزات أمان أقوى أو نوافذ سياق أطول في بعض الإصدارات، ولكنها عادةً ما تكون ذات تسعير أعلى. توفر نماذج Gemini من Google إمكانيات متعددة الوسائط وسياق كبير، ولكن قد يكون لها ملفات أداء مختلفة. باستخدام OrcaRouter، يمكنك اختبار مزودين متعددين عبر واجهة برمجة تطبيقات واحدة. للمهام التي تتطلب دقة رياضية عالية، يُعد GPT-4o خيارًا قويًا. أما بالنسبة للتلخيص النصي البحت أو المهام منخفضة التكلفة، فقد تكون النماذج الأخرى أكثر اقتصادية. قم بتقييم درجات المعايير والتسعير حسب حالة الاستخدام الخاصة بك.
عند استخدام GPT-4o عبر OrcaRouter، يتم إرسال بياناتك إلى خوادم OpenAI لتنفيذ الاستدلال. لا يقوم OrcaRouter بتخزين أو معالجة مطالباتك (prompts) بما يتجاوز إعادة توجيهها. تسري سياسات استخدام بيانات OpenAI - ارجع إلى شروط OpenAI إذا كانت لديك مخاوف بشأن استخدام بيانات التدريب أو الاحتفاظ بالبيانات. إذا كنت بحاجة إلى بقاء البيانات ضمن نطاق قضائي معين أو تجنب مزودين معينين، يتيح لك OrcaRouter الاختيار بين عدة مزودين لكل طلب. يمكنك أيضًا استخدام ميزات التوجيه في OrcaRouter لتوجيه الطلبات إلى مزودين يستوفون متطلبات الامتثال لديك. تأكد دائمًا من مراجعة وثائق معالجة البيانات لكل من OrcaRouter والمزود الأساسي.
متوافق مع OpenAI — أبقِ على SDK الحالي
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-08-06",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| الإدخال / 1M توكن | $2.50 |
| الإخراج / 1M توكن | $10.00 |
| قراءة الذاكرة المؤقتة / 1M | $1.25 |
| العملة | USD |
تقدير بناءً على السعر المُعلن
تقدير فقط — يعتمد العدد الفعلي للرموز على مُجزّئ الرموز الخاص بالمزوّد.
GET /api/public/models/openai/gpt-4o-2024-08-06فتح @misc{orcarouter_gpt_4o_2024_08_06,
title = {GPT-4o (2024-08-06) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06}
}OpenAI. (2024). GPT-4o (2024-08-06) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06