Qwen3-VL 235B-A22B Instruct — نموذج رؤية-لغة مفتوح الوزن، 235B إجمالي / 22B معامل نشط، سياق 256k، بدون وضع تفكير.
Qwen3 VL 235B A22B Instruct هو إصدار متخصص في الرؤية واللغة من سلسلة نماذج Qwen3، تم بناؤه من قبل Alibaba Cloud. يستخدم تصميم خليط من الخبراء (MoE) بإجمالي 235 مليار معلمة، منها حوالي 22 مليار معلمة…
يتميز النموذج في المهام التي تتفاعل فيها الصور والنصوص. يمكنه الإجابة عن أسئلة حول محتوى الصورة، ووصف المشاهد بالتفصيل، وقراءة النصوص من المستندات أو اللافتات، واستنتاج العلاقات بين الأشياء في الصورة. كما يتعامل مع عدة صور في محادثة واحدة، مما يتيح التحليل المقارن أو الاستدلال التسلسلي. يُمكن الضبط التعليمي النموذج من اتباع التعليمات المعقدة متعددة الوسائط، مثل "اشرح لماذا يُظهر هذا الرسم البياني اتجاهًا" أو "استخرج جميع القيم الرقمية من هذا الجدول". تنبع هذه القدرات من البنية الأساسية الكبيرة (MoE) والتدريب المتخصص في اللغة والبصر.
كونه نسخة مُدرَّبة على التعليمات (Instruct variant)، فقد تم ضبط النموذج بدقة لاتباع تعليمات المستخدم بدرجة عالية من الدقة عبر كل من المطالبات النصية فقط والمطالبات متعددة الوسائط. يمكنه التعامل مع الحوارات متعددة الجولات حيث يتم تقديم الصور بشكل تدريجي، والحفاظ على السياق عبر عدة تبادلات، واتباع تعليمات التنسيق (على سبيل المثال، الإخراج بصيغة JSON، أو نقاط نقطية، أو خطوة بخطوة). يؤدي أداءً جيدًا في المهام التي تتطلب الالتزام بالقيود، مثل "الإجابة فقط إذا كانت الصورة تحتوي على كلب." وهذا يجعله مناسبًا للتطبيقات التي يكون فيها السلوك المتسق واتباع القواعد مهمًا.
بالنسبة للمهام النصية فقط التي لا تحتوي على عنصر بصري، قد يكون نموذج MoE بسعة 235B مبالغًا فيه؛ فالنماذج الكثيفة الأصغر أو متغيرات Qwen النصية الأخرى ستكون أكثر فعالية من حيث التكلفة. وبالمثل، إذا كانت صورك بسيطة (مثل شعارات أساسية، كائنات مفردة) أو كنت بحاجة إلى إنتاجية عالية للغاية بميزانية محدودة، فقد يكون نموذج الرؤية الأصغر مثل Qwen2-VL 7B كافيًا. يكون هذا النموذج مبررًا أكثر عندما تحتاج إلى التعامل مع صور معقدة عالية الدقة، أو مستندات ذات نصوص كثيفة، أو مهام تتطلب استدلالًا متعدد الوسائط عميقًا. على OrcaRouter، يمكنك مقارنة الأسعار وتبديل معرفات النماذج بسهولة.
لا. Qwen3 VL 235B A22B Instruct هو نموذج لتوليد النصوص يقبل الصور كمدخل فقط. لا يقوم بتوليد الصور أو الصوت أو أي نمط آخر. المخرجات دائمًا سلسلة نصية. إذا كنت بحاجة إلى توليد الصور، فستستخدم نموذجًا منفصلًا. تكمن قوة هذا النموذج في فهم وتحليل المدخلات البصرية. يمكنه، على سبيل المثال، وصف كيف تبدو الصورة أو الإجابة عن أسئلة تتعلق بها، لكنه لا يستطيع إنشاء الصور أو تعديلها أو تحويلها بنفسه.
درجة MMLU-Pro المبلغ عنها لهذا النموذج هي 82.3. MMLU-Pro هي نسخة محسّنة من معيار فهم اللغة متعددة المهام الضخم، وتغطي 57 موضوعًا عبر مجالات STEM والعلوم الإنسانية والعلوم الاجتماعية. درجة 82.3 تشير إلى معرفة عامة قوية واستدلال عبر مواضيع متنوعة. إنها درجة إجمالية واحدة؛ قد يختلف الأداء حسب الموضوع. هذه الدرجة تضع النموذج بين أفضل الأداء في فئة حجمه، خاصة بالنظر إلى بنية MoE التي تنشط فقط جزءًا من إجمالي معاملاتها لكل استعلام.
تشمل نقاط القوة الدقة العالية في اختبارات التفكير متعدد الوسائط، والقدرة القوية على اتباع التعليمات، وفعالية التكلفة مقارنةً بالنماذج الكثيفة ذات عدد المعاملات الإجمالي المماثل. يسمح التصميم المعتمد على خليط الخبراء (MoE) بتوسيع السعة دون تكلفة حسابية متناسبة. أما نقاط الضعف فتشمل التكلفة المطلقة الأعلى مقارنةً بالنماذج الأصغر، وإمكانية زيادة زمن الاستجابة بسبب العدد الكبير من المعاملات الإجمالية (على الرغم من أن 22 مليارًا فقط منها نشطة، إلا أن النموذج الكامل يجب تحميله في الذاكرة). قد يحدث أحيانًا هلوسة في التفاصيل الدقيقة للصور أو يفشل في المدخلات البصرية عالية الغموض. كما أن الأداء في المهام الخاصة بمجال معين (مثل التصوير الطبي) غير مضمون.
سرعة الاستدلال تعتمد على النهاية الخلفية للأجهزة المستخدمة من قبل OrcaRouter والحمل الحالي. كنموذج MoE بإجمالي 235 مليار معامل، يتطلب ذاكرة GPU كبيرة على الرغم من أن 22 مليار معامل فقط يتم تنشيطها لكل رمز. يؤدي هذا عادةً إلى زمن استجابة أعلى لكل طلب مقارنة بالنماذج الكثيفة الأصغر (مثل 7B-70B معامل). يتأثر الإنتاجية أيضًا بحجم الدفعة وطول التسلسل. للتطبيقات الحساسة لزمن الاستجابة، فكر في استخدام نموذج أصغر أو تحسين المطالبات الأقصر. لا يقدم OrcaRouter ضمانات محددة لزمن الاستجابة ولكنه يهدف إلى استجابة من مستوى الإنتاج.
تقوم OrcaRouter بتحصيل السعر المحدد تمامًا من المزود: 0.40 دولار لكل مليون رمز إدخال و1.60 دولار لكل مليون رمز إخراج. لا توجد أي رسوم إضافية. يتم حساب رموز الإدخال والإخراج وفقًا لقواعد تقسيم الرموز الخاصة بـ OpenAI، والتي قد تختلف قليلاً عن أداة التقسيم الداخلية للنموذج. كما يتم فوترة الصور كرموز بناءً على أبعادها ومستوى التفاصيل، وفقًا لسياسة المزود. يمكنك تقدير التكاليف عن طريق ضرب استخدامك المتوقع للرموز في هذه الأسعار.
التكلفة لكل رمز (token) أعلى من النماذج الأصغر أو الكثيفة، لكن بنية MoE توفر سعة أكبر لكل معامل نشط مقارنة بنموذج كثيف بنفس الحجم النشط. بالنسبة للمهام المتعددة الوسائط المعقدة، قد يكمل هذا النموذج المهمة بعدد أقل من الرموز أو بدقة أعلى، مما قد يقلل من الإنفاق الإجمالي. ومع ذلك، بالنسبة للمهام البسيطة، فإن نموذجًا أرخص سيخفض التكاليف. على منصة OrcaRouter، يمكنك التبديل بين النماذج بسرعة، مما يتيح لك استخدام هذا النموذج فقط عند الحاجة. لا توجد التزامات شهرية دنيا أو رسوم مخفية.
لا يفصح OrcaRouter حاليًا عن سياسات التخزين المؤقت المحددة لهذا النموذج. قد يتم تطبيق التخزين المؤقت على مستوى الرموز من قبل المزود الأساسي ولكن ذلك غير مضمون. لا توجد خصومات بالجملة أو أسعار متدرجة مذكورة؛ الأسعار ثابتة لكل رمز. بالنسبة للمستخدمين ذوي الحجم الكبير، قد يكون من الجيد الاتصال بدعم OrcaRouter لترتيبات مخصصة محتملة. بشكل عام، الأسعار شفافة ومبنية على الاستخدام.
يتم تحويل الصور إلى عدد من الرموز بناءً على دقة الصورة وإعداد التفاصيل. تحدد الموفر (Qwen) الصيغة الدقيقة وقد تختلف. عادةً، تستهلك الصور ذات الدقة الأعلى عددًا أكبر من الرموز. يمرر OrcaRouter عملية الترميز الخاصة بالموفر دون أي تغيير. يمكنك التحكم في التكاليف عن طريق تغيير حجم الصور أو استخدام وضع التفاصيل المنخفضة إذا كان النموذج يدعم ذلك. يُرجى دائمًا الرجوع إلى وثائق الموفر للحصول على حساب دقيق للرموز الخاصة بالصور. تُحتسب رموز الإدخال للصور ضمن معدل 0.40 دولار لكل مليون رمز.
ترسل طلب POST إلى https://api.orcarouter.ai/v1/chat/completions مع حمولة JSON متوافقة مع OpenAI. اضبط حقل model على "qwen/qwen3-vl-235b-a22b-instruct". أدرج مصفوفة messages حيث يمكن أن تحتوي كل رسالة على نص و/أو محتوى صورة. بالنسبة للصور، استخدم تنسيق محتوى الصورة القياسي من OpenAI (رابط URL أو base64). يتم المصادقة عبر رمز Bearer (مفتاح API الخاص بك). تعمل المعاملات المثالية مثل temperature و max_tokens و top_p وتسلسلات الإيقاف stop sequences بنفس طريقة واجهة OpenAI. توفر وثائق OrcaRouter التفاصيل الكاملة.
جميع معلمات إكمال الدردشة القياسية مدعومة: درجة الحرارة (0-2، الافتراضي 1)، top_p (0-1، الافتراضي 1)، max_tokens (عدد رموز الإخراج)، stop (قائمة من السلاسل النصية)، presence_penalty، frequency_penalty، و seed للتكرارية. كما يحترم النموذج رسائل النظام لضبط السلوك. بالنسبة للطلبات متعددة الوسائط، تقوم بتضمين جزء صورة في محتوى رسالة المستخدم. لا توجد معلمات خاصة بنموذج معين مكشوفة؛ يتم الاحتفاظ بواجهة البرمجة عامة للتوافق. إذا كنت بحاجة للتحكم في توجيه MoE، فإن ذلك يتم معالجته داخليًا.
نعم. نظرًا لأن OrcaRouter يستخدم تنسيق واجهة برمجة التطبيقات (API) الخاص بـ OpenAI، فإن عملية الترحيل تكون مباشرة. استبدل عنوان URL الأساسي الحالي ومعرّف النموذج الخاص بك بنقطة نهاية OrcaRouter و"qwen/qwen3-vl-235b-a22b-instruct". تأكد من أن مفتاح API الخاص بك صالح وأن لديك رصيدًا كافيًا. تنسيق الرسالة للصور مطابق تمامًا لتنسيق OpenAI (باستخدام نوع المحتوى 'image_url'). قد تحتاج إلى تعديل تقديرات عدد الرموز المميزة (tokens) نظرًا لاختلاف طريقة الترميز (tokenization). لا يلزم إجراء أي تغييرات على منطق تطبيقك بخلاف تغيير نقطة النهاية واسم النموذج.
يدعم كل من Qwen3 VL 235B A22B Instruct وGPT-4V الإدخالات متعددة الوسائط. الاختلافات الرئيسية: يستخدم Qwen3 VL تقنية MoE مع 22 مليار معامل نشط، بينما GPT-4V هو نموذج كثيف مملوك بحجم غير معلن. تسعير Qwen3 VL عبر OrcaRouter هو $0.40/$1.60 لكل مليون رمز، وهو أقل بكثير من أسعار GPT-4V النموذجية. نتائج المعايير ليست قابلة للمقارنة مباشرة لأن MMLU-Pro والاختبارات الأخرى تستخدم مجموعات فرعية مختلفة. يتمتع GPT-4V بدعم أوسع للنظام البيئي، لكن Qwen3 VL يوفر ميزة من حيث التكلفة لأحمال العمل متعددة الوسائط عالية الحجم على OrcaRouter.
Claude 3.5 Sonnet هو نموذج كثيف من Anthropic يتمتع بقدرات قوية في معالجة النصوص والصور. لا يستخدم MoE، لذا فإن سعته الإجمالية أقل من معاملات Qwen3 VL الكلية، لكن سعته النشطة لكل استدلال أعلى من 22B. تسعير Claude 3.5 Sonnet أعلى عمومًا لكل رمز (حوالي $3.00/$15.00 لكل مليون رمز). يوفر Qwen3 VL تكلفة أقل بكثير للمهام متعددة الوسائط. ومع ذلك، تمتلك نماذج Claude نافذة سياق أكبر (200 ألف رمز). يعتمد الاختيار على الميزانية، واحتياجات طول السياق، والمزود المفضل.
من المحتمل أن OrcaRouter تقدم نماذج Qwen أخرى مثل Qwen2.5 7B و Qwen2.5 72B أو متغيرات Qwen2-VL. نموذج Qwen3 VL 235B A22B Instruct هو أكبر نموذج multimodal MoE في مجموعة Qwen. مقارنةً بـ Qwen2-VL 72B، فهو يمتلك عددًا أكبر من المعاملات الكلية وهندسة MoE، مما قد يحقق أداءً أفضل في المهام المعقدة مع الحفاظ على تكلفة استدلال معقولة. إنه أغلى لكل رمز (token) من نماذج Qwen الأصغر ولكنه قد يكون فعالاً من حيث التكلفة إذا قلل الحاجة إلى مكالمات متعددة أو استهلاك كبير للرموز.
متوافق مع OpenAI — أبقِ على SDK الحالي
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| الإدخال / 1M توكن | $0.400 |
| الإخراج / 1M توكن | $1.60 |
| العملة | USD |
تقدير بناءً على السعر المُعلن
تقدير فقط — يعتمد العدد الفعلي للرموز على مُجزّئ الرموز الخاص بالمزوّد.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructفتح @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct