Qwen3-VL 8B Thinking — نموذج تفكير بصري-لغوي صغير مفتوح الأوزان، 8 مليار معلمة، سياق 128 ألف.
Qwen3 VL 8B Thinking هو نموذج لغوي متعدد الوسائط يحتوي على 8 مليارات معلمة، تم تطويره بواسطة فريق Qwen في Alibaba Cloud، ومُستضاف على OrcaRouter تحت مزود qwen. ينتمي إلى عائلة Qwen3 من نماذج الرؤية…
يتفوق Qwen3 VL 8B Thinking في الإجابة على الأسئلة البصرية، خاصة عندما يتضمن السؤال كائنات متعددة، أو علاقات مكانية، أو نصًا مضمنًا في الصور (مثل لافتات الشوارع، الإيصالات). كما يمكنه التعامل مع مهام فهم الفيديو، مثل تلخيص مقطع قصير، تحديد الإجراءات، أو الإجابة على أسئلة حول طوابع زمنية محددة. تحليل المستندات هو حالة استخدام قوية: استخراج المعلومات من ملفات PDF التي تحتوي على كل من النصوص والرسوم البيانية، أو من النماذج الممسوحة ضوئيًا. نافذة السياق الطويلة تجعله مناسبًا لمعالجة المستندات الكبيرة (مثل ملفات PDF التي تزيد عن 100 صفحة) مع إدراج الصور أحيانًا، طالما أن الإدخال المرمّز الإجمالي يبقى أقل من 131K.
إذا كانت حالة الاستخدام الخاصة بك تعتمد كليًا على النصوص ولا تتضمن صورًا أو فيديو، فإن استخدام نموذج نصي بحت (مثل Qwen3-8B أو إصدار Llama بحجم مشابه) سيكون أكثر فعالية من حيث التكلفة. النماذج متعددة الوسائط تتحمل عبئًا إضافيًا لترميز المدخلات البصرية، كما أن تسعير كل رمز (Token) لـ Qwen3 VL 8B Thinking (0.18 دولار للمدخل، 2.10 دولار للمخرج لكل مليون رمز) قد يكون أعلى من العديد من البدائل النصية البحتة. بالإضافة إلى ذلك، إذا كانت مهمتك عبارة عن تصنيف بسيط أو استخراج من صور قصيرة جدًا، فقد يكون نموذج الرؤية واللغة الأصغر حجمًا مع زمن استجابة وتكلفة أقل (مثل Qwen2 VL 2B) كافيًا دون التضحية بالأداء.
نعم، يمكن للنموذج قبول عدة صور متداخلة مع النص في استدعاء API واحد، طالما أن إجمالي عدد الرموز (رموز الصور بالإضافة إلى رموز النص) يظل ضمن نافذة السياق البالغة 131,072 رمزًا. يتم ترميز كل صورة في عدد متغير من الرموز حسب دقتها وتعقيدها. يتيح لك API المتوافق مع OpenAI من OrcaRouter إرسال عدة روابط صور أو صور مشفرة بـ base64 في مصفوفة المحتوى. لا يوجد حد صارم لعدد الصور بخلاف قيد السياق. بالنسبة للفيديو، عادةً ما تستخرج الإطارات الرئيسية وترسلها كصور منفصلة مع مطالبة نصية.
مثل جميع النماذج متعددة الوسائط، قد يهلوس نموذج Qwen3 VL 8B Thinking في التفاصيل داخل الصور أو الفيديو، خاصة مع الدقة المنخفضة أو المحتوى الغامض. إنه ليس مصممًا للبث المباشر للفيديو؛ فهو يعالج إطارات ثابتة. يعني حجم المعلمات 8B أنه قد يكون أقل دقة في المجالات المتخصصة للغاية (مثل التصوير الطبي، صور الأقمار الصناعية) مقارنة بالنماذج الأكبر (مثل نماذج الرؤية-اللغة بقدرة 70B-100B+). لا يدعم الإدخال الصوتي. يمكن لعملية التفكير أن تزيد طول المخرجات، لذا خصص ميزانية لعدد الرموز المخرجة وفقًا لذلك. أخيرًا، تم تحسينه للغة الإنجليزية ولكنه يمكنه التعامل مع اللغات الأخرى بفعالية متفاوتة.
لم يتم توفير نتائج المعايير المرجعية المحددة لـ Qwen3 VL 8B Thinking في التقييمات متعددة الوسائط القياسية (مثل MMMU و MathVista و VideoMME) ضمن المعلومات المتاحة. يُنصح المستخدمون بالرجوع إلى بطاقة النموذج الرسمية لـ Qwen أو الورقة البحثية للحصول على النتائج المنشورة النهائية. بشكل عام، أظهرت سلسلة Qwen3 VL أداءً تنافسيًا في مهام اللغة البصرية مقارنة بالنماذج الأخرى ذات المعلمات 7B-8B. من المتوقع أن يحسن المتغير "Thinking" المعايير التي تعتمد على الاستدلال مثل سلسلة التفكير البصري. في غياب النتائج العامة، يُفضل اختبار النموذج على مجموعة البيانات التمثيلية الخاصة بك لتقييم ملاءمته.
لم يتم الكشف عن بيانات زمن الاستجابة لهذا النموذج المحدد على البنية التحتية لـ OrcaRouter. كقاعدة عامة، سيكون للنموذج متعدد الوسائط ذو 8 مليارات معامل (8B-parameter) زمن استجابة أعلى من نموذج نصي بحت بنفس الحجم بسبب ترميز الرؤية. يزيد إدخال الفيديو من زمن الاستجابة بشكل أكبر بسبب معالجة الإطارات الإضافية. على مجموعات GPU عالية الأداء (مثل A100، H100)، يتراوح الوقت النموذجي لأول token (time-to-first-token) لنموذج 8B من بضع مئات من الملي ثانية إلى بضع ثوانٍ، اعتمادًا على طول الإدخال وحجم الدفعة. عادةً ما تُقاس سرعة توليد الرموز الناتجة (tokens) بعشرات الـ tokens في الثانية. هذه القيم نوعية؛ يعتمد الأداء الفعلي على التزويد الحالي والحمل لـ OrcaRouter.
نقاط القوة: يتعامل النموذج مع السياقات الطويلة متعددة الوسائط (131 ألف رمز)، ويسمح بإخراج كميات كبيرة (تصل إلى 40 ألف رمز)، ويعالج ثلاثة أنواع من المدخلات. تعمل قدرته على التفكير على تحسين الاستدلال في المهام التي تتطلب استنتاجًا تدريجيًا. وهو مسعّر بشكل تنافسي لنموذج 8B متعدد الوسائط. القيود: لم يتم مقارنته مع أحدث النماذج الرائدة في العديد من لوحات التصدر العامة. قد يكون إنتاجيته القصوى للإخراج أقل من النماذج الأصغر. وهو غير محسّن لتوليد الصور الإبداعي (يخرج نصًا فقط). يجب ألا يفترض المستخدمون عدم وجود هلوسة في المهام البصرية. تقتصر معالجة الفيديو على الاستخراج القائم على الإطارات بدلاً من التحليل المستمر.
يتم فوترة Qwen3 VL 8B Thinking لكل رمز بسعر المزوّد دون أي رسوم إضافية. تكلفة رموز الإدخال 0.18 دولار لكل مليون رمز. وتكلفة رموز الإخراج 2.10 دولار لكل مليون رمز. لا توجد رسوم إضافية للبنية التحتية، ولا تكلفة أساسية لكل طلب، ولا اشتراك شهري. تنطبق الأسعار بالتساوي على جميع طرق الإدخال (نص، صورة، فيديو)؛ يتم تحويل كل طريقة إلى رموز وتحصيلها بسعر الإدخال. لا تفرض OrcaRouter أي رسوم إضافية فوق السعر المذكور. على سبيل المثال، معالجة صورة يتم تحويلها إلى 2,000 رمز إدخال ستكلف 2,000 * ($0.18 / 1M) = $0.00036 كتكلفة إدخال. وتحسب تكلفة الإخراج بالمثل.
يتم ترميز كل صورة في عدد متغير من الرموز بناءً على أبعادها ومستوى الضغط. قد تستهلك الصور عالية الدقة آلاف الرموز. تتم معالجة الفيديو عن طريق استخراج الإطارات (عادةً إطار واحد كل بضع ثوانٍ) وترميز كل إطار كصورة؛ وبالتالي، تتزايد تكلفة الرموز خطيًا مع مدة الفيديو ومعدل الإطارات. يمكن للمستخدمين التحكم في التكلفة عن طريق تغيير حجم الصور أو تقليل عدد الإطارات. لا توجد رسوم منفصلة لترميز الوسائط تتجاوز تكلفة الرموز. تعتمد تكلفة الإخراج فقط على عدد رموز النص المُنشأة. بالنسبة لمقاطع الفيديو الطويلة، يمكن أن تقترب رموز الإدخال بسرعة من حد 131K، مما يزيد من تكلفة كل طلب.
بناءً على المعلومات المتوفرة، لا توجد خصومات على الاستخدام المجمع أو الالتزامات المدفوعة مسبقًا. لا يقدم OrcaRouter حاليًا تخزينًا مؤقتًا للرموز (token caching) من شأنه تقليل التكاليف للطلبات المتكررة أو الصور. يتم فوترة جميع الطلبات لكل رمز (token) في الوقت الفعلي بالسعر القياسي. إذا قدم المزوّد (qwen) أسعارًا مخفضة في المستقبل، فسينقل OrcaRouter هذه التوفيرات إليك دون أي هامش ربح. يُشجّع المستخدمون على متابعة صفحة أسعار OrcaRouter لأي تحديثات. بالنسبة لحالات الاستخدام ذات الحجم الكبير، يُنصح بالتواصل مع OrcaRouter مباشرة لمناقشة الأسعار المحتملة حسب الحجم.
بالمقارنة مع النماذج متعددة الوسائط الأكبر (مثل GPT-4V و Gemini 1.5 Pro)، فإن Qwen3 VL 8B Thinking أرخص بشكل كبير لكل رمز: تلك النماذج غالبًا ما تكلف من 2 إلى 10+ دولار لكل مليون رمز إدخال. بين نماذج الرؤية واللغة التي تحتوي على 7B-8B معامل، فإنه يتماشى مع التسعير النموذجي (Qwen2 VL 7B يتراوح تقريبًا من 0.10 إلى 0.20 دولار للإدخال، ومن 1 إلى 2 دولار للإخراج). تكلفة رمز الإخراج (2.10 دولار لكل مليون) أعلى من بعض نماذج النص النقي 8B (مثل 0.20 دولار لكل مليون إخراج)، مما يعكس العبء الإضافي للاستدلال. إذا كان بإمكانك استخدام نموذج أصغر (مثل 2B-4B معامل)، يمكن أن تكون التكاليف أقل بنسبة 50-90%، ولكن مع قدرة منخفضة.
يمكنك استدعاء Qwen3 VL 8B Thinking عن طريق إرسال طلب POST إلى نقطة نهاية OrcaRouter المتوافقة مع OpenAI على https://api.orcarouter.ai/v1/chat/completions. عيّن معلمة النموذج إلى "qwen/qwen3-vl-8b-thinking". قم بتضمين مفتاح API الخاص بك في ترويسة Authorization كـ "Bearer <key>". يتبع جسم الطلب مخطط OpenAI لمحادثات الإكمال. للإدخال متعدد الوسائط، قم ببناء محتوى الرسالة كمصفوفة من الكائنات: واحد بنوع "text" للموجه النصي، وواحد بنوع "image_url" لكل صورة (باستخدام رابط URL أو بيانات base64). يمكن إرسال الفيديو كعدة مدخلات image_url تمثل الإطارات. يستجيب النظام وفقًا لهيكل OpenAI القياسي، حيث يكون كل النص المُنشأ في مصفوفة choices.
جميع معايير إكمال الدردشة القياسية من OpenAI مدعومة: درجة الحرارة (0–2، الافتراضي 1.0)، top_p (0–1، الافتراضي 1.0)، max_tokens (حتى 40960)، تسلسلات الإيقاف، frequency_penalty، presence_penalty، logprobs، و n (عدد الإكمالات). هل النموذج لا يدعم البث المباشر؟ من المحتمل أن OrcaRouter يدعم البث المباشر عند تعيين streaming=true؛ راجع وثائق المزود. معلمة الأدوات (استدعاء الوظائف) قد تكون مدعومة إذا كان المزود الأساسي يُمكّنها؛ حاليًا غير مضمونة. يُسمح بمطالبة النظام. يمكن تمرير معرفات المستخدمين للمراقبة. تأكد من البقاء ضمن نافذة السياق البالغة 131072 رمزًا من خلال مراقبة عدد الرموز قبل الإرسال.
إذا كنت تستخدم حاليًا نفس النموذج من مزود API مختلف (مثل مباشرة من Alibaba Cloud)، فإن الانتقال إلى OrcaRouter يكون بسيطًا: قم بتغيير عنوان URL الأساسي إلى https://api.orcarouter.ai/v1، وحدِّث سلسلة النموذج إلى "qwen/qwen3-vl-8b-thinking"، واستبدل مفتاح API بمفتاح OrcaRouter API. لا حاجة لأي تغييرات أخرى في الكود لأن OrcaRouter يستخدم نفس واجهة OpenAI المتوافقة تمامًا. كن على علم أن استخدام الرموز (tokens) والتسعير سيعتمدان على أسعار OrcaRouter (والتي تُمرر دون أي عمولة). قد تحتاج إلى ضبط أدوات مراقبة التكاليف الخاصة بك لتعكس التسعير الجديد.
البث متاح عبر واجهة برمجة تطبيقات OrcaRouter. اضبط المعامل stream على true في طلبك. سيكون الرد عبارة عن دفق من أحداث الخادم المرسلة (SSE) مع deltas للرموز المولدة. هذا مفيد للعرض في الوقت الفعلي. لاحظ أنه بالنسبة لنمط "Thinking"، قد تؤدي عملية التفكير إلى تأخيرات أطول قبل الرمز الأول، لكن البث سيظل يرسل الرموز التدريجية عند إنتاجها. تتبع تنسيق البث مواصفات البث الخاصة بـ OpenAI، مع أحداث من النوع "chat.completion.chunk". يحتوي كل جزء (chunk) على delta تحتوي على محتوى الرمز أو دوره.
Qwen3 VL 8B Thinking هو الخلف لـ Qwen2 VL 7B، مع نفس عدد المعاملات تقريبًا (8B مقابل 7B) ولكن ببنية محسّنة لسياق أطول (131K مقابل 32K لـ Qwen2 VL 7B). كما يضيف قدرة "التفكير" للاستدلال خطوة بخطوة، والتي لم تكن موجودة في Qwen2 VL. زاد الحد الأقصى لطول المخرجات من 2048 رمزًا (Qwen2 VL 7B) إلى 40960 رمزًا. تسعير Qwen3 VL 8B Thinking أعلى قليلاً لكل رمز مقارنة بـ Qwen2 VL 7B (التي تكلف حوالي $0.15 للإدخال، $1.80 للإخراج لكل مليون رمز)، مما يعكس القدرات المضافة والسياق الأكبر. يجب أن يتوقع المستخدمون الذين يقومون بالترقية أداءً أفضل في مهام الاستدلال المعقدة.
GPT-4o mini هو نموذج متعدد الوسائط رائد من OpenAI مع نافذة سياقية بحجم 128K. يحتوي على معلمات أكثر بشكل ملحوظ (غير معروفة، لكنها تُقدر بأكثر من 70B) ويحقق عمومًا دقة أعلى في المعايير القياسية. ومع ذلك، فإن Qwen3 VL 8B Thinking أرخص بكثير: تبلغ تكلفة GPT-4o mini $0.15 لكل مليون رمز إدخال و$0.60 لكل مليون رمز إخراج، وهو ما يقل فعليًا عن تكلفة Qwen3 البالغة $0.18 للإدخال و$2.10 للإخراج؟ انتظر، تحقق: إدخال GPT-4o mini هو $0.15، والإخراج $0.60 — أرخص من Qwen3 VL 8B Thinking؟ في الواقع الإخراج أرخص بكثير. لذا فإن التكلفة ليست أقل في جميع المجالات. لكن Qwen3 يدعم الفيديو والإخراج الأطول (40960 مقابل 16384 لـ GPT-4o mini). نوافذ السياق متشابهة. يعتمد الاختيار على الدقة المطلوبة والميزانية؛ Qwen3 متخصص للإخراجات الطويلة جدًا والنشر مفتوح المصدر.
يعد Llama 3.2 11B Vision نموذجًا متعدد الوسائط بمعاملات 11B مع نافذة سياق بحجم 128K وحد أقصى للإخراج 8K رمزًا. يتمتع Qwen3 VL 8B Thinking بعدد معاملات أصغر ولكن حد أقصى للإخراج أكبر بكثير (40960 مقابل 8000) ويتضمن قدرات تفكير. كلاهما يدعم إدخال النصوص والصور، لكن Llama 3.2 11B لا يدعم الفيديو بشكل أصلي. تسعير Llama عبر المزودين متشابه، حوالي $0.15–$0.20 للإدخال، $0.60–$1.00 للإخراج لكل مليون رمز، مما يجعل Qwen3 أكثر تكلفة في الإخراج. بالنسبة للمهام التي تتطلب نصوصًا طويلة جدًا (مثل كتابة التقارير من الفيديو)، فإن Qwen3 هو الأنسب. أما بالنسبة للمهام القصيرة والحساسة من حيث التكلفة، فقد يكون Llama 3.2 11B هو الأفضل.
Gemini 1.5 Flash هو نموذج متعدد الوسائط سريع وفعال من حيث التكلفة، مع نافذة سياقية تبلغ 1M (حتى 2M)، ويدعم الصور والفيديو والصوت. إنه أرخص من Qwen3 VL 8B Thinking (حيث تبلغ تكلفة Gemini Flash 0.075 دولارًا للإدخال و0.30 دولارًا للإخراج لكل مليون رمز) وأسرع. ومع ذلك، يوفر Qwen3 VL 8B Thinking عملية تفكير يمكنها تحسين الاستدلال في المهام البصرية الصعبة، كما أن الحد الأقصى للإخراج أكبر بكثير (40K مقابل 8K في Gemini Flash). إذا كان تطبيقك يتطلب استدلالًا خطوة بخطوة ومخرجات طويلة، فإن Qwen3 هو الخيار الأفضل. أما بالنسبة للإنتاجية العالية وزمن الوصول المنخفض، فإن Gemini Flash يكون عادةً متفوقًا. أيضًا، قد يُفضل Qwen3 عندما تتطلب سيادة البيانات نشرًا ذاتي الاستضافة أو مستقلاً عن المزوّد.
متوافق مع OpenAI — أبقِ على SDK الحالي
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| الإدخال / 1M توكن | $0.180 |
| الإخراج / 1M توكن | $2.10 |
| العملة | USD |
تقدير بناءً على السعر المُعلن
تقدير فقط — يعتمد العدد الفعلي للرموز على مُجزّئ الرموز الخاص بالمزوّد.
GET /api/public/models/qwen/qwen3-vl-8b-thinkingفتح @misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking