Qwen 3.7 Flash: نموذج الرؤية الرخيص جدًا من Alibaba للوكلاء الذين ينظرون فعليًا إلى الشاشات
Guides & Insights

Qwen 3.7 Flash: نموذج الرؤية الرخيص جدًا من Alibaba للوكلاء الذين ينظرون فعليًا إلى الشاشات

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

قضى فريق Qwen التابع لشركة Alibaba العامين الماضيين في إطلاق تشكيلة كثيفة من النماذج عبر تقريبًا كل مستويات الأسعار والقدرات التي يمكن تخيلها، وفي 27 يوليو 2026، وصل نموذج آخر بهدوء كإدراج API تجاري: qwen/qwen3.7-flash. لم يصاحَب بضجة إطلاق نموذج رئيسي، ولم تنشر Alibaba تقريرًا فنيًا أو مجموعة معايير أو مخططًا معماريًا له. لكن ما وصل به هو وصف يهم المطورين أكثر بكثير من نتيجة أخرى في لوحات المتصدرين: نموذج استدلال رؤية-لغة، ونافذة سياقية من مليون رمز، وتسعير منخفض لدرجة أنه بالكاد يُسجَّل كبند في الفاتورة.

تلك التركيبة — رخيصة، سياق ضخم، و"ترى" الصور بشكل طبيعي — تضع Qwen 3.7 Flash بشكل مباشر في فئة أصبحت واحدة من أكثر الفئات تنافسية وفائدة في سوق النماذج بأكمله: الحصان العامل متعدد الوسائط منخفض التكلفة. هذه ليست النماذج التي تفوز بمخططات المعايير. إنها النماذج التي يتم استدعاؤها عشرة ملايين مرة يوميًا داخل حلقات الوكيل، وخطوط أنابيب أتمتة المتصفح، وأدوات الدعم، لأنه بتكلفة إدخال 0.03 دولار وإخراج 0.13 دولار لكل مليون رمز، تتوقف التكلفة أساسًا عن كونها قيدًا على التصميم.

هذه المقالة هي شرح أولي: ما هو Qwen 3.7 Flash فعليًا، وما الذي كشفته Alibaba (والأهم، ما لم تكشف عنه)، وكيف تعمل الاقتصاديات مع حسابات التوكنات الحقيقية، وأين يتناسب ضمن باقي عائلة Qwen — بما في ذلك Qwen 3.8 الأكبر بكثير وQwen 3.7 Max — وفي مواجهة المنافسين متعددي الوسائط الرخيصين مثل Gemini 3.5 Flash-Lite. وسنستعرض أيضًا كيف تعامل طبقة توجيه مثل OrcaRouter نموذجًا كهذا: ليس كنموذج رئيسي، بل كطبقة افتراضية تمتص بهدوء الجزء الأكبر من حركة المرور متعددة الوسائط.

ملخص

كيوين 3.7 فلاش هو نموذج رؤية-لغة من فريق كيوين التابع لشركة علي بابا، مُدرج تحت معرف النموذج qwen/qwen3.7-flash منذ 27 يوليو 2026. وهو مصمم للوكلاء متعددي الوسائط، والبرمجة البصرية، والبحث، والتفاعل مع الحاسوب/واجهة المستخدم، مع نقاط قوة مزعومة في التعرف على الأشياء والفهم المكاني. وهو يدعم نافذة سياقية من 1,000,000 رمز ويُسعَّر بـ0.03 دولار لكل مليون رمز إدخال و0.13 دولار لكل مليون رمز إخراج — وهو من بين أرخص النماذج القادرة على الرؤية المتاحة في أي مكان. الحد الأقصى لطول المخرجات، والعدد الدقيق للمعلمات، والبنية المعمارية غير معلنة رسميًا؛ تشير التكهنات المجتمعية إلى تصميم صغير من نوع خليط الخبراء واحتمال كونه مقدمة لإصدار كيوين 3.7 مفتوح الأوزان، لكن ذلك غير مؤكد. وهو نموذج متميز وأصغر وأرخص من كل من كيوين 3.8 (النموذج الرائد مفتوح الأوزان الذي أعلنته علي بابا بشكل منفصل بمعلمات تبلغ 2.4 تريليون) وكيوين 3.7 ماكس (النموذج الرائد الأكبر في نفس هذا الجيل). لم تقيّمه أي مجموعة معايير مستقلة — بما في ذلك Artificial Analysis — حتى الآن، لذا تعامل مع ادعاءات الجودة على أنها مبكرة وغير مثبتة حتى تظهر أرقام من جهات خارجية.

النقاط الرئيسية

• كيوين 3.7 فلاش هو نموذج رؤية-لغة، وليس نصًا فقط — فهو مصمم لوكلاء متعدد الوسائط، والبرمجة البصرية، والبحث، ومهام استخدام الكمبيوتر، وليس للدردشة العامة.

• تبلغ التسعيرة 0.03 دولار لكل مليون رمز إدخال و0.13 دولار لكل مليون رمز إخراج، وهي تقريبًا متوافقة مع أرخص فئة من النماذج متعددة الوسائط القريبة من الحدود المتطورة في السوق اليوم.

• نافذة السياق هي 1 مليون رمز، وهو ما يهم أكثر لجلسات الوكيل كثيرة الصور ومتعددة الجولات مما يبدو، لأن الصور ولقطات الشاشة تستهلك الرموز بسرعة.

تشير ملاحظات التسعير في القائمة إلى أنه مع التخزين المؤقت للسياق المتكرر، يمكن أن تكون التكلفة الفعلية أقل بنسبة 60-80% من سعر القائمة — وهي أداة فعالة لحلقات الوكلاء التي تعيد استخدام نفس استعلام النظام أو سجل لقطات الشاشة.

• لم تنشر علي بابا الحد الأقصى لرموز الإخراج، أو عدد المعلمات، أو تفاصيل الهندسة المعمارية؛ أي شيء أكثر تحديدًا تقرأه في مكان آخر هو استنتاج مجتمعي، وليس إفادة من البائع.

• إنه ليس Qwen 3.8 (الرائد مفتوح الأوزان بسعة 2.4T) وليس Qwen 3.7 Max (الرائد المغلق الأكبر في نفس موجة الإصدار) — بغض النظر عن تشابه التسمية، فهذه ثلاثة نماذج مختلفة بثلاث مهام مختلفة.

• لم تنشر أي منظمة معايير مستقلة، بما في ذلك Artificial Analysis، نتائج اختبارات لـ Qwen 3.7 Flash حتى وقت كتابة هذا النص — الجودة غير مثبتة حقًا خارج وصف البائع.

ما هو Qwen 3.7 Flash في الواقع

بغض النظر عن اتفاقية التسمية، فإن Qwen 3.7 Flash هي إجابة علي بابا على سؤال طرحته كل مختبر رئيسي الآن: كيف يبدو النموذج عندما يكون موجز تصميمه بالكامل هو "التعامل مع حركة المرور المرئية والوكيلية وعالية الحجم بأقل تكلفة ممكنة دون أن يكون عديم الفائدة"؟ أجابت جوجل عليه بمستويات Gemini Flash وFlash-Lite. أجابت OpenAI عليه بخطوط mini وnano. إجابة علي بابا، في هذا الجيل، هي Qwen 3.7 Flash.

يركز الوصف الرسمي على أربع حالات استخدام: الوكلاء متعددو الوسائط، البرمجة البصرية، البحث، والتفاعل مع الحاسوب أو واجهة المستخدم. وهذه قائمة مدروسة بعناية. ليست "ممتازة في الكتابة الإبداعية" أو "تفكير قوي في مسائل الأولمبياد الرياضي" — بل هي قائمة بالمهام التي يحتاج فيها النموذج إلى النظر إلى لقطة شاشة، صفحة ويب، جزء من واجهة المستخدم، أو فرق كود معروض بصريًا، ثم التصرف بناءً عليه. كما تبرز أليبابا التعرف على الأشياء والفهم المكاني كنقاط قوة خاصة، وهو ما يتوافق مع إطار استخدام الحاسوب والتفاعل مع واجهة المستخدم: الوكيل الذي سينقر على الأزرار، يقرأ التخطيطات، أو يتنقل عبر الشاشة يحتاج إلى معرفة أين توجد الأشياء، وليس فقط ما تقوله.

من الجدير أن نكون صريحين بشأن معنى "الاستدلال" في هذا السياق. يُوصف Qwen 3.7 Flash بأنه نموذج استدلال بصري-لغوي، مما يعني أنه من المتوقع أن يعمل على مهام بصرية متعددة الخطوات بدلاً من مجرد وصف صورة أو الإجابة على سؤال بحث مفرد. هذا هو الفرق بين "صِف هذه اللقطة الشاشة" و"هذه لقطة شاشة لنموذج يحتوي على ثلاثة أخطاء تحقق — اكتشف ما هو الخطأ وأخبرني أي حقل يجب إصلاحه أولاً."

المواصفات والتركيز متعدد الوسائط والوكالي

إليك القائمة الكاملة لما تم تأكيده فعليًا، مقابل ما لم يتم تأكيده.

مؤكد:الصانع هو فريق Qwen من Alibaba. مدرج تحت معرّف النموذج qwen/qwen3.7-flash، متاح منذ 27 يوليو 2026. يقبل إدخالاً متعدد الوسائط (رؤية ولغة). نافذة السياق هي 1,000,000 رمز. السعر هو 0.03 دولار لكل مليون رمز إدخال و0.13 دولار لكل مليون رمز إخراج. تشير ملاحظات التسعير الخاصة بالقائمة إلى أن التخزين المؤقت للاستدلال على السياق المتكرر يمكن أن يخفض التكلفة الفعلية بنسبة 60-80% مقارنة بالسعر المدرج لأحمال العمل التي تعيد استخدام نفس تعليمات النظام أو الصور المرجعية عبر الاستدعاءات — وهي تفاصيل مهمة جدًا لحلقات الوكلاء التي تعيد إرسال نفس سجل لقطات الشاشة أو مخطط الأدوات في كل دورة.

لم يتم الإفصاح:الحد الأقصى لعدد الرموز المخرجة. عدد المعلمات الدقيق. البنية (كثيفة مقابل خليط من الخبراء). تكوين بيانات التدريب. أي نتائج اختبارات مرجعية من الطرف الأول.

تخمين مجتمعي (ضع عليه هذه التسمية، فهذا كل ما هو عليه): بالنظر إلى تسمية "Flash"، والتسعير العدواني، والنمط الذي اتبعه Alibaba مع الأجيال السابقة من Qwen، يشتبه بعض المراقبين أن Qwen 3.7 Flash يستخدم بنية صغيرة من نوع mixture-of-experts محسنة لتكلفة حسابية منخفضة لكل رمز، وأنه قد يكون خطوة معاينة أو تقطير قبل إصدار Qwen 3.7 مفتوح الوزن في نهاية المطاف، على غرار كيف سبقت المتغيرات السابقة من Qwen "flash" أو "turbo" أحيانًا إصدارات مفتوحة أوسع. لم يتم تأكيد أي من هذا من قبل Alibaba. تعامل معه كتخمين مدروس، وليس كحقيقة، حتى يصدر تقرير تقني رسمي أو بطاقة نموذج تقول خلاف ذلك.

غياب رقم أقصى للإخراج منشور يستحق التنبيه لأي شخص يبني على هذا النموذج: إذا كانت حالة الاستخدام لديك تنتج مخرجات منظمة طويلة (حمولات JSON كبيرة، توليد كود متعدد الملفات، نصوص طويلة)، فاختبر السقف الفعلي للإخراج تجريبيًا قبل الالتزام به في الإنتاج، لأنه لا يمكنك مراجعة الوثائق لرقم غير موجود.

مثال عملي للتسعير: ما هي التكلفة الفعلية؟

من السهل تجاهل الأرقام الصغيرة كهذه، لذا دعنا نقوم بالحسابات بشكل صحيح.

بتكلفة $0.03 لكل 1M رمز إدخال و $0.13 لكل 1M رمز إخراج، تكلفة استدعاء واحد يحتوي على 2,000 رمز إدخال (لقطة شاشة بحجم مناسب مع تعليمات قصيرة) و300 رمز إخراج (إجابة منظمة) هي: 2,000/1,000,000 × $0.03 = $0.00006 للإدخال، بالإضافة إلى 300/1,000,000 × $0.13 = $0.000039 للإخراج. الإجمالي تقريبًا $0.0001 لكل استدعاء — جزء من مائة من السنت.

وسّع هذا إلى مستوى الحجم التشغيلي. شغّل مليونًا من هذه الاستدعاءات — وهو حمل يومي معقول لمنتج وكيل متوسط الحجم يقوم بتحليل لقطات الشاشة أو فحوصات حالة واجهة المستخدم — وستحصل على: 1,000,000 × 2,000 = 2 مليار توكين إدخال × $0.03/1M = $60، بالإضافة إلى 1,000,000 × 300 = 300 مليون توكين إخراج × $0.13/1M = $39. الإجمالي: نحو $99 لكل مليون استدعاء لوكيل الرؤية. حتى قبل إضافة التخزين المؤقت للمطالبات (prompt caching) — الذي تشير ملاحظات القائمة إلى أنه قد يخفض هذا المبلغ بنسبة 60-80% لأحمال العمل ذات السياق المتكرر — فهذا رقم يمكن لمعظم الفرق الموافقة عليه دون اجتماع للميزانية.

الآن قارن سيناريو أثقل: وكيل يستخدم الكمبيوتر يحافظ على سياق جارٍ يتكون من 50,000 رمز (لقطات شاشة، تاريخ الإجراءات، نتائج الأدوات) ويولد 500 رمز من الإجراءات لكل خطوة، ويتم تشغيله 100,000 مرة يوميًا. تكلفة الإدخال: 100,000 × 50,000 = 5 مليار رمز × 0.03 دولار/مليون = 150 دولارًا/يوم. تكلفة الإخراج: 100,000 × 500 = 50 مليون رمز × 0.13 دولار/مليون = 6.50 دولارًا/يوم. وهذا تقريبًا 156 دولارًا/يوم، أو حوالي 4,700 دولار/شهر، لعمل وكيل ذي سياق طويل عدواني إلى حد ما — وذلك قبل أي خصم تخزين مؤقت على الأجزاء المتكررة من ذلك السياق البالغ 50 ألف رمز، والذي في حلقة استخدام الكمبيوتر (نفس المطالبة النظامية، نفس تعريفات الأدوات، حالة الشاشة المتداخلة) هو بالضبط نوع العمل الذي صمم التخزين المؤقت للمطالبات من أجله.

جولات تفصيلية لسيناريوهات واقعية

مهام الرؤية عالية الحجم

تخيل خط أنابيب لفهرسة المنتجات يحتاج إلى تصنيف ووسم واستخراج السمات من بضع مئات الآلاف من صور المنتجات يوميًا — هذا هو بالضبط نوع عبء العمل الذي تتضاعف فيه التكلفة لكل رمز بسرعة كافية لتحطيم الميزانية على نموذج رؤية متوسط المستوى، لكنها تبقى مريحة وبأسعار معقولة في تسعير Qwen 3.7 Flash. التعرف على الأشياء والفهم المكاني، وهما القدرتان اللتان تذكرهما Alibaba صراحة، يترجمان مباشرة إلى "ما في هذه الصورة، وأين هو، وفي أي حالة هو."

الترميز البصري

"التشفير البصري" كحالة استخدام مسماة يقترح سير عمل مثل: إطعام النموذج لقطة شاشة لواجهة مستخدم معروضة مع كود المكون الأساسي، واطلب منه اكتشاف عدم التطابق، أو أخذ تصدير من Figma والحصول على تنفيذ أولي. هذه فئة مهام تعاقب بشكل خاص نماذج الكود النصية فقط — يمكنك وصف خطأ في التخطيط بالكلمات، لكن النموذج الذي يمكنه رؤية الحشو المكسور أو الزر غير المحاذي فعليًا سيشخصه بشكل أسرع وأكثر موثوقية.

وكيلية / استخدام الحاسوب

هذه هي حالة الاستخدام الرئيسية. يجب على وكيل استخدام الكمبيوتر أن ينظر إلى الشاشة، ويفهم ما هو قابل للنقر، ويقرر الإجراء، ويكرر ذلك — غالبًا لعشرات الخطوات في كل مهمة. الاقتصاد هنا قاسٍ بالنسبة للنماذج الباهظة الثمن: مهمة أتمتة للمتصفح أو سطح المكتب تتكون من 30 خطوة، تحمل كل خطوة لقطة شاشة جديدة، يمكن أن تتراكم مئات الآلاف من الرموز قبل اكتمال المهمة. بالتسعير الخاص بالنماذج الحدودية، هذا يمثل أموالًا حقيقية لكل مهمة؛ أما بتسعير Qwen 3.7 Flash، فإن تشغيل آلاف من هذه الجلسات يوميًا يظل في متناول ميزانية فريق صغير.

البحث البصري — مطابقة صورة مع مجموعة من الصور، التحقق من أن النتيجة المسترجعة تطابق بالفعل صورة مرجعية، أو ترسيخ استعلام بحث في لقطة شاشة لما يبحث عنه المستخدم — يستفيد من نفس المزيج من السياق الكبير (لاحتواء عدة صور مرشحة أو مجموعة طويلة من الوثائق المسترجعة) والتكلفة المنخفضة لكل استدعاء (لأن حلقات البحث والتحقق غالبًا ما تعني العديد من استدعاءات النموذج لكل استعلام مستخدم، وليس واحدًا).

كيفية الوصول إلى Qwen 3.7 Flash واستخدامه

يُستدعى Qwen 3.7 Flash بمعرّف النموذج qwen/qwen3.7-flash، ويعمل مع أي أدوات متوافقة مع OpenAI — أي أن التكاملات الحالية من نمط chat-completions أو responses يمكنها الإشارة إليه بمجرد تغيير اسم النموذج دون إعادة كتابة كود العميل. وهنا تصبح طبقة التوجيه مثل OrcaRouter عملية بدلًا من نظرية: فبدلًا من ترميز نموذج واحد في كل خدمة، تتيح نقطة نهاية موحّدة متوافقة مع OpenAI تحديد نموذج متعدد الوسائط رخيص وقادر كطبقة افتراضية لحركة المرور البصرية والوكيلة، مع حجز النماذج الاستدلالية الأغلى للطلبات التي تحتاجها فعلًا. وبالنسبة لنموذج قيمته كلها أنه "رخيص جدًا، وقادر جدًا، وغير مثبت في الحدود القصوى"، فإن هذا التوجيه المتدرّج — الرخيص افتراضيًا، والرفع عند الحاجة — هو الطريقة الصحيحة لنشره في بيئة الإنتاج بدلًا من الرهان على نموذج واحد غير موثّق لقناة كاملة.

ينطبق التنسيق القياسي للطلبات متعددة الوسائط: مدخلات الصور إلى جانب النص في الرسالة نفسها، ونوافذ سياق كبيرة للجلسات متعددة الصور أو متعددة الأدوار، وفوترة لكل توكن تظهر بوضوح في لوحات الاستخدام. اختبر السقف العملي لطول المخرجات لعبء عملك قبل الاعتماد عليه، لأن الحد الأقصى غير منشور.

القيود الصريحة وما هو غير مؤكد

لنكن صريحين بشأن ما هو مجهول حقًا هنا: لا توجد بيانات معيارية مستقلة حول Qwen 3.7 Flash من Artificial Analysis أو أي جهة تقييم مماثلة حتى كتابة هذه السطور. كل ما يتعلق بجودتها — مدى كفاءة أدائها في التفكير البصري، ومدى موثوقيتها في المهام متعددة الخطوات القائمة على الوكالة، وكيفية صمودها أمام المشتتات في سيناريوهات السياق الطويل — يُدعم حاليًا فقط بلغة التموضع الخاصة بشركة Alibaba، وليس بواسطة طرف ثالث يختبرها عبر مجموعة اختبارات موحدة. وصف البائع والتحقق المستقل ليسا نفس الشيء، وينبغي للقراء أن يزنوا قدرات هذا النموذج وفقًا لذلك حتى يتحقق هذا التحقق.

بخلاف المعايير، لم تكشف Alibaba عن البنية أو عدد المعلمات أو الحد الأقصى لطول المخرجات. نظرية "MoE صغير، وربما مقدمة لإصدار Qwen 3.7 مفتوح الأوزان" المتداولة في المجتمع هي تخمين معقول استنادًا إلى أنماط التسمية والتسعير، لكنها مجرد تكهن وليست ما أكدته Alibaba. إذا كانت شفافية النموذج (بنية منشورة، أوزان مفتوحة، تقرير تقني) شرطًا لحالة الاستخدام الخاصة بك، فإن Qwen 3.7 Flash لا يلبي هذا المعيار حاليًا — فهو نموذج مغلق يعمل عبر API فقط، مع توثيق عام ضئيل لا يتجاوز قائمة API الخاصة به.

كيف تقارن: Qwen 3.8، Qwen 3.7 Max، والمنافسون الرخيصون

التسمية هنا تُربك الناس، لذا من الجدير أن نكون دقيقين. Qwen 3.8 هي الرائدة مفتوحة الأوزان التي أعلنت عنها Alibaba بشكل منفصل، ويُقال إنها مبنية على تصميم بـ 2.4 تريليون معلمة — نموذج مختلف جوهريًا وله غرض مختلف: نموذج كبير مفتوح متعدد الأغراض يهدف للمنافسة في الطليعة، ليس طبقة أدوات متعددة الوسائط رخيصة. Qwen 3.7 Max هي الرائدة المغلقة الأكبر والأكثر قدرة على الأرجح ضمن نفس موجة الإصدار "3.7" — النموذج الذي تلجأ إليه عندما تحتاج المهمة إلى أقصى جودة بغض النظر عن التكلفة. Qwen 3.7 Flash، موضوع هذه المقالة، هي النقطة الثالثة والأرخص في تلك المجموعة: أصغر، أسرع، أقل تكلفة بشكل كبير، ومخصصة تحديدًا لأعباء العمل الوكيلة متعددة الوسائط بدلاً من التميز متعدد الأغراض. لا تفترض أن القدرة أو السلوك ينتقل بين هذه الثلاثة لمجرد أن اثنين منهما يتشاركان رقم إصدار — إنها نماذج مختلفة بمهام مختلفة.

مقارنة بالمنافسة الخارجية، أقرب مقارنة هي جوجل Gemini 3.5 Flash-Lite، التي تحتل مكانة مشابهة: طبقة منخفضة التكلفة، متعددة الوسائط، عالية الإنتاجية مصممة خصيصًا لنوع أحمال العمل الكبيرة الموصوفة أعلاه. كلا النموذجين يتنافسان بشكل أساسي على نفس المحاور — السعر لكل رمز، طول السياق، والمعالجة متعددة الوسائط — بدلاً من معايير الاستدلال الخام، حيث أن لا أحد منهما يُصنف كنموذج استدلال رائد. بدون بيانات معيارية مستقلة لـ Qwen 3.7 Flash، لا يمكن لهذه المقالة أن تقدم ادعاءً مباشرًا بالجودة ضد Gemini 3.5 Flash-Lite بشكل مسؤول؛ ما يمكن قوله هو أن تسعير Qwen 3.7 Flash تنافسي مع أو أقل من تلك الطبقة، ونافذة السياق البالغة 1M سخية لنموذج في هذه الشريحة التكلفة، وهو بالضبط النوع من الفجوة الذي يجعل الطبقات متعددة الوسائط الرخيصة تستحق الاختبار التجريبي على عبء العمل الخاص بك بدلاً من الاختيار بناءً على السعر وحده.

الأسئلة الشائعة

ما هو Qwen 3.7 Flash؟

إنه نموذج استدلال بصري-لغوي من فريق Qwen التابع لشركة Alibaba، صُمم للوكلاء متعددي الوسائط، والبرمجة البصرية، والبحث، والتفاعل مع الحاسوب/واجهة المستخدم، وهو مدرج تحت معرف النموذج qwen/qwen3.7-flash منذ 27 يوليو 2026.

كم تكلفة Qwen 3.7 Flash؟

$0.03 لكل مليون رمز إدخال و$0.13 لكل مليون رمز إخراج — من بين أرخص النماذج القادرة على الرؤية المتاحة حالياً، مع الإشارة في القائمة إلى إمكانية الحصول على خصومات إضافية تتراوح بين 60-80% عبر التخزين المؤقت للاستعلامات عند تكرار السياق.

ما هي نافذة السياق؟

1,000,000 توكن

هل Qwen 3.7 Flash هو نفسه Qwen 3.8؟

لا. كيوين 3.8 هو النموذج الرائد مفتوح الأوزان من علي بابا، ويحتوي على 2.4 تريليون معلمة، وقد أُعلن عنه بشكل منفصل. أما كيوين 3.7 فلاش فهو نموذج متعدد الوسائط مغلق أصغر بكثير وأقل تكلفة وله غرض مختلف. لا ينبغي الخلط بينهما رغم أن كليهما من سلسلة كيوين التابعة لعلي بابا.

هل Qwen 3.7 Flash هو نفسه Qwen 3.7 Max؟

لا، Qwen 3.7 Max هو النموذج الرئيسي الأكبر في نفس موجة الإصدار "3.7". أما Qwen 3.7 Flash فهو الطبقة الأصغر والأسرع والأرخص بكثير، والمصممة للمهام متعددة الوسائط والعوامل عالية الحجم بدلاً من الإخراج عالي الجودة.

هل يدعم Qwen 3.7 Flash الصور؟

نعم، إنه نموذج رؤية ولغة — يقبل مدخلات متعددة الوسائط (صورة ونص) ويتم وضعه تحديدًا حول المهام البصرية مثل التعرف على الكائنات، والفهم المكاني، والترميز البصري، والتفاعل مع الكمبيوتر/واجهة المستخدم.

ما هو الحد الأقصى لطول الإخراج؟

لم يتم الإعلان رسميًا من قبل Alibaba. يجب على أي شخص يقوم ببناء عبء عمل إنتاجي اختبار السقف العملي للإخراج مباشرة بدلاً من افتراض رقم.

هل Qwen 3.7 Flash نموذج خليط من الخبراء؟

غير مؤكد. يتكهن البعض في المجتمع أنه يستخدم بنية MoE صغيرة بناءً على أسعاره ونمط تسميته، لكن علي بابا لم تنشر تفاصيل البنية، لذلك يبقى هذا تخمينًا وليس حقيقة.

كيف يقارن ذلك بـ Gemini 3.5 Flash-Lite؟

كلا النموذجين يحتلان طبقة متعددة الوسائط منخفضة التكلفة وعالية الإنتاجية، ويتنافسان بشكل أساسي على السعر وطول السياق بدلاً من معايير التفكير المجردة. لا توجد حتى الآن بيانات قياسية مستقلة لإجراء مقارنة نوعية قاطعة لـ Qwen 3.7 Flash.

أين يمكنني الوصول إلى Qwen 3.7 Flash؟

باستخدام معرف النموذج qwen/qwen3.7-flash عبر أي عميل متوافق مع OpenAI، أو من خلال طبقة توجيه مثل OrcaRouter يمكنها تعيينه كطبقة متعددة الوسائط رخيصة افتراضية إلى جانب نماذج أخرى.

هل Qwen 3.7 Flash جيد؟

لم يتم إثباته بشكل مستقل حتى وقت كتابة هذا التقرير — لا توجد أي منظمة معايير خارجية، بما في ذلك Artificial Analysis، قد نشرت نتائج له. عرض قيمته هو السعر وحجم السياق، وليس تفوقًا في الجودة مثبتًا، لذا من الجدير اختباره تجريبيًا مقابل عبء العمل الخاص بك قبل الالتزام.

الخلاصة

لا يحاول Qwen 3.7 Flash الفوز بلوحة المتصدرين، ولم تقدم Alibaba لأي شخص الوثائق اللازمة للتحقق حتى لو أراد ذلك. ما يحاول فعله هو جعل أعباء العمل الخاصة بالرؤية والعوامل — تحليل لقطات الشاشة، وفحوصات الترميز البصري، وحلقات استخدام الحاسوب، والبحث البصري — رخيصة بما يكفي بحيث لا تكون التكلفة هي السبب وراء عدم بناء الميزة. بسعر 0.03$ / 0.13$ لكل مليون رمز مع سياق مليون رمز، تدعم الاقتصاديات حقًا حركة مرور العوامل متعددة الوسائط عالية الحجم والدائمة التشغيل بطريقة لا يمكن لعدد قليل من النماذج في أي مستوى جودة منافستها. الجانب السلبي هو الصراحة بشأن الفجوات: لا معايير مستقلة، ولا بنية مفصح عنها أو أقصى طول للمخرجات، وغموض حقيقي حول مدى صمودها أمام منافسي الطبقة الرخيصة الراسخين مثل Gemini 3.5 Flash-Lite. تعامل معه كخيار واعد وبأسعار معقولة جدًا افتراضيًا لأعباء العمل متعددة الوسائط والعوامل الجديرة بالاختبار الآن — واحفظه بوضوح منفصلاً في ذهنك عن كل من Qwen 3.8 و Qwen 3.7 Max، فهما نموذجان مختلفان يحلان مشاكل مختلفة تمامًا.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا