Qwen3.5 Flash — دردشة متعددة الوسائط (نص/صورة/فيديو) محسّنة من حيث التكلفة، وسياق 1M.
Qwen3.5 Flash هو نموذج لغوي متعدد الوسائط من عائلة Qwen، مصمم للاستدلال السريع والتكلفة المنخفضة. يقبل إدخالات النص والصورة والفيديو ويولد استجابات نصية. تسمح نافذة السياق التي تبلغ 1,048,576 رمزًا…
يقبل Qwen3.5 Flash النصوص والصور (بما في ذلك صور متعددة في الطلب الواحد) ومدخلات الفيديو. بالنسبة للفيديو، يمكن للنموذج استيعاب الإطارات أو ملفات الفيديو كاملة حتى حد السياق. يقوم بمعالجة هذه الوسائط معًا في استدعاء API واحد، مما يتيح مهام مثل وصف مشهد فيديو، أو الإجابة عن أسئلة حول صورة، أو دمج تعليمات نصية مع محتوى مرئي. يعتمد طول الفيديو المدعوم بدقة على استخراج الإطارات وتخصيص الرموز ضمن نافذة السياق البالغة 1M.
يتميز النموذج في المهام التي تتطلب سياقًا كبيرًا وإدخالًا متعدد الوسائط. تشمل الأمثلة تلخيص نصوص الفيديو الطويلة، واستخراج البيانات المنظمة من المستندات الممسوحة ضوئيًا مع الصور، وبناء وكلاء محادثة يستندون إلى السياق البصري. كما أنه فعال في المعالجة الدفعية عالية الإنتاجية، حيث أن التكلفة المنخفضة لكل رمز (خاصةً الإدخال) تجعله اقتصاديًا لملايين الاستعلامات. بالنسبة للمهام النصية البسيطة، قد يكون النموذج النصي الأرخص أكثر كفاءة من حيث التكلفة.
للمهام التي تعتمد فقط على النص ولا تتطلب القدرات متعددة الوسائط، قد يكون نموذج أصغر أو نصي فقط بتسعير أقل أكثر فعالية من حيث التكلفة. تكمن قوة Qwen3.5 Flash في قدراتها متعددة الوسائط والسياق الطويل؛ إذا كان تطبيقك يحتاج فقط إلى مخرجات نصية قصيرة، فإن نماذج مثل text-davinci أو إصدارات أصغر من Qwen قد توفر المال. وبالمثل، إذا كنت لا تحتاج إلى السياق الكامل البالغ 1M، فإن نموذجًا بنافذة أصغر قد يقلل من زمن الاستجابة والتكلفة.
التسمية "Flash" تشير إلى أن هذا النموذج يضحي ببعض دقة المعايير مقابل سرعة استنتاج أعلى وتكلفة حسابية أقل. مقارنةً بالنماذج الأكبر من Qwen (مثل Qwen3.5-72B)، فإنه يستخدم بنية أكثر كفاءة مع عدد أقل من المعاملات. يتم نشر نتائج المعايير من قبل Qwen ولكنها غير مدرجة في هذا الإدخال الدليلي. عمليًا، يؤدي بشكل تنافسي في مهام الفهم متعدد الوسائط مع الحفاظ على زمن استجابة أقل لكل طلب، مما يجعله مناسبًا للتطبيقات في الوقت الفعلي.
يعتمد زمن الاستجابة على حجم الإدخال، وطول الإخراج، وحمولة الخادم. نظرًا لأن Qwen3.5 Flash مصمم للسرعة، فإنه يعيد الاستجابات بشكل أسرع من النماذج الأكبر مثل Qwen3.5-72B لعدد الرموز المكافئ. لا يتم توفير الأرقام الدقيقة للرموز في الثانية في الكتالوج. يمكن للمستخدمين اختبار الأداء من خلال نقطة نهاية OrcaRouter لقياس زمن الاستجابة الفعلي لحالة الاستخدام الخاصة بهم. قد تؤدي نافذة السياق البالغة 1M إلى زيادة الحمل في المعالجة للمدخلات الطويلة جدًا.
تشمل نقاط القوة الإدخال متعدد الوسائط، وسياق كبير جداً، و65 ألف رمز إخراج، وتكلفة منخفضة لكل رمز. يتعامل النموذج بشكل جيد مع المستندات الطويلة ومقاطع الفيديو. القيود: ليس الأكثر دقة في المهام المنطقية المعقدة أو الحسابية مقارنة بالنماذج الحدودية الأكبر. قد يواجه أيضاً صعوبة في التعليمات متعددة الخطوات الدقيقة. للمهام التي تتطلب جودة إخراج متطورة، فكر في نموذج أكبر من Qwen أو فئة GPT-4o. بنية 'Flash' تعطي أولوية للإنتاجية والتكلفة على الدقة القصوى.
السعر هو 0.10 دولار لكل مليون رمز إدخال (رموز النص أو الصورة أو الفيديو) و0.40 دولار لكل مليون رمز إخراج. يتم فرض هذه الأسعار بسعر المزوّد دون أي هامش ربح من OrcaRouter. لا توجد رسوم إضافية على بوابة API. يتم تمرير هذا التسعير مباشرة، مما يعني أن المستخدم النهائي يدفع نفس المبلغ كما لو كان يستدعي واجهة برمجة التطبيقات الخاصة بالمزوّد، دون أي رسوم إضافية من OrcaRouter. يتبع حساب الرموز الترميز القياسي لكل وسيط.
سعر رمز الإدخال (0.10 دولار لكل مليون) تنافسي جداً بين النماذج متعددة الوسائط. على سبيل المثال، تفرض العديد من النماذج متعددة الوسائط الكبيرة 2-10 دولارات لكل مليون رمز إدخال. سعر الإخراج (0.40 دولار لكل مليون) منخفض أيضاً. ومع ذلك، نظراً لأن النموذج يحتوي على نافذة سياقية تبلغ مليون رمز، فإن معالجة المدخلات الطويلة جداً قد تؤدي إلى تكلفة إجمالية عالية رغم انخفاض السعر لكل رمز. يجب على المستخدمين الموازنة بين طول السياق وعدد الطلبات. بالنسبة للمدخلات القصيرة، قد تقدم النماذج الأصغر تكلفة مطلقة أقل.
إدخال الكتالوج لا يوضح ما إذا كان التخزين المؤقت متاحًا لـ Qwen3.5 Flash على OrcaRouter. يجب على المستخدمين مراجعة وثائق OrcaRouter للحصول على تفاصيل حول ميزات التخزين المؤقت للاستعلامات أو التخزين المؤقت للردود. إذا لم يكن التخزين المؤقت مدعومًا، فسيؤدي إدخال نفس البيانات بشكل متكرر إلى تكبد تكاليف الرموز الكاملة في كل مرة. بالنسبة للمعالجة المجمعة، يُنصح بإزالة الإدخالات المكررة أو استخدام ذاكرة تخزين مؤقت محلية لتقليل استدعاءات API. تظل الأسعار وفقًا لأسعار المزود بدون أي رسوم إضافية بغض النظر عن حالة التخزين المؤقت.
استخدم نقطة النهاية المتوافقة مع OpenAI على https://api.orcarouter.ai/v1. عيّن معامل النموذج إلى "qwen/qwen3.5-flash" في طلبك. قدّم مفتاح API من OrcaRouter. يتطابق تنسيق الطلب مع واجهة برمجة تطبيقات الدردشة الكاملة من OpenAI، مع دعم الأدوار (system، user، assistant) والمحتوى متعدد الوسائط باستخدام مصفوفة "content" مع "type": "image_url" أو "type": "text". بالنسبة للفيديو، قد تحتاج إلى استخراج الإطارات وتمريرها كصور. راجع وثائق OrcaRouter للحصول على إرشادات دقيقة حول معالجة الفيديو.
المعايير القياسية المتوافقة مع OpenAI: temperature، top_p، max_tokens (حتى 65536)، تسلسلات الإيقاف، presence_penalty، frequency_penalty، وseed. يتم تحديد معامل max_tokens بـ 65536 ليتناسب مع أقصى مخرجات النموذج. يدعم النموذج البث من خلال stream: true. يمكنك أيضًا تعيين معرفات المستخدم للتتبع. بالنسبة للطلبات متعددة الوسائط، قم بتضمين محتوى الصورة أو الفيديو داخل رسالة المستخدم. يقبل النموذج ما يصل إلى نافذة سياق يبلغ إجماليها 1,048,576 رمزًا عبر جميع الأدوار.
إذا كنت تستخدم بالفعل حزمة Python SDK الخاصة بـ OpenAI، فغيّر base_url إلى https://api.orcarouter.ai/v1 وحدّث اسم النموذج إلى "qwen/qwen3.5-flash". تستخدم المصادقة مفتاح API من OrcaRouter بدلاً من مفتاح OpenAI. هياكل الطلب والاستجابة متطابقة. للهجرة من مزودين آخرين، استخدم تنسيق chat completions. تأكد من تنسيق prompts النظام والمحتوى متعدد الوسائط وفقًا لاتفاقيات OpenAI. لا يلزم إجراء تغييرات على الكود بخلاف نقطة النهاية واسم النموذج.
نعم، تدعم واجهة برمجة تطبيقات OrcaRouter رسائل النظام، ورسائل المستخدم، ورسائل المساعد في محادثة متعددة الجولات. يُحتسب سجل المحادثة الكامل ضمن نافذة السياق البالغة 1,048,576 رمزًا مميزًا. يعالج النموذج المحتوى متعدد الوسائط في رسائل المستخدم. بالنسبة للفيديو، يمكنك إرسال عدة إطارات كصور في رسالة مستخدم واحدة. يحافظ النموذج على السياق عبر الجولات، لذا يمكنك إجراء تفاعلات ممتدة مع تواريخ طويلة، بشرط أن تظل الرموز الإجمالية ضمن الحد المسموح.
Qwen3.5 Flash هو بديل أصغر وأسرع وأقل تكلفة لنماذج Qwen الأكبر مثل Qwen3.5-72B أو Qwen3.5-32B. إنه يضحي ببعض دقة المعايير مقابل زمن استجابة أقل وتكلفة أقل. وهو يدعم نفس إدخال الوسائط المتعددة ونافذة السياق الكبيرة (1M) مثل نظرائه الأكبر حجمًا. بالنسبة للمهام التي تتطلب تفكيرًا متطورًا، تُفضل النماذج الأكبر. أما بالنسبة للتطبيقات عالية الحجم أو الوقت الفعلي حيث تكون السرعة والتكلفة أكثر أهمية، فإن Flash هو الخيار الأفضل.
توفر GPT-4o دقة أعلى في العديد من معايير التفكير والمتعددة الوسائط، لكن بسعر أعلى بكثير (عادةً 2.50 دولار لكل مليون رمز إدخال لـ GPT-4o و 0.15 دولار لـ GPT-4o mini). أما Qwen3.5 Flash فهي أرخص (0.10 دولار للإدخال) ولديها نافذة سياق أكبر (1M مقابل 128K لـ GPT-4o). كما يتجاوز حد رموز الإخراج الخاص بها (65K) حد GPT-4o mini (16K). بالنسبة للتطبيقات الحساسة للتكلفة ذات الإدخالات الطويلة جدًا، قد تكون Qwen3.5 Flash أكثر اقتصادًا مع استمرارها في تقديم فهم جيد متعدد الوسائط.
كلود 3 هايكو وجيميني 1.5 فلاش هما نموذجان 'فلاش' متشابهان. كلود 3 هايكو مخصص للنصوص فقط وسعره 0.25 دولار لكل مليون رمز إدخال. جيميني 1.5 فلاش يدعم الإدخال متعدد الوسائط وله نافذة سياقية بحجم 1 مليون، وسعره 0.075 دولار لكل مليون رمز إدخال. دعم Qwen3.5 فلاش متعدد الوسائط ونافذة السياق 1 مليون يضعانه في فئة مماثلة، مع تسعير الإخراج (0.40 دولار/1 مليون) أعلى من Gemini Flash (0.30 دولار/1 مليون) لكنه أقل من Haiku (1.25 دولار/1 مليون). أداء المعايير يختلف حسب المهمة.
يستضيف OrcaRouter نماذج مفتوحة المصدر مثل Llama 3.1 8B وMistral 7B. أما Qwen3.5 Flash فهو نموذج مملوك، لكنه ينافس من حيث التكلفة والقدرات. غالبًا ما تكون للنماذج مفتوحة المصدر تكلفة أقل أو معدومة لكل رمز (تدفع فقط مقابل الحوسبة)، لكنها قد تتطلب جهدًا هندسيًا أكبر للإعداد. يقدم Qwen3.5 Flash واجهة برمجة تطبيقات مُدارة بدون هامش ربح، ونافذة سياق تبلغ 1M، ودعمًا متعدد الوسائط تفتقر إليه معظم النماذج مفتوحة المصدر. إنه حل وسط جيد بين مرونة المصادر المفتوحة وجودة النماذج المملوكة.
متوافق مع OpenAI — أبقِ على SDK الحالي
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| الإدخال / 1M توكن | $0.100 |
| الإخراج / 1M توكن | $0.400 |
| العملة | USD |
تقدير بناءً على السعر المُعلن
تقدير فقط — يعتمد العدد الفعلي للرموز على مُجزّئ الرموز الخاص بالمزوّد.
ما يتحدث عنه المطورون هذا الأسبوع
GET /api/public/models/qwen/qwen3.5-flashفتح @misc{orcarouter_qwen3_5_flash,
title = {qwen/qwen3.5-flash API},
author = {qwen},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-flash}
}qwen. (n.d.). qwen/qwen3.5-flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-flash