بطاقة عنوان مُولَّدة للقرار Decision 3.0 بعنوان فرعي 'ستة نماذج قرار متعددة الوسائط مفتوحة، من 0.6B إلى 27B'، مع شرائح نصية تقرأ 'الأوزان Apache-2.0'، و'الصور والفيديو'، و'لا يوجد منشور إطلاق حتى الآن'، وتذييل يقول 'كل الأرقام في هذا المقال هي أرقام vLLM-SR الخاصة؛ لا شيء هنا مُعاد إنتاجه بشكل مستقل.' وشعار OrcaRouter مُدمَج في الزاوية اليمنى السفلية.
Engineering & Research

Decision 3.0 متاح على Hugging Face: ستة نماذج قرار متعددة الوسائط مفتوحة، أُعلن عنها على X فقط

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Decision 3.0 متاح في صيغة يمكنك تنزيلها الآن، ولم يدوّنه أحد تقريبًا. ست نقاط تفتيش — d3، d3-flash، d3-mini، d3-nano، d3-lite وd3-edge — نُشرت في منظمة vllm-sr على Hugging Face في 10 أكتوبر 2026، من الأحدث أولًا بدءًا من 09:38 UTC وانتهاءً بـ d3-edge عند 23:49 UTC. وهي بترخيص Apache-2.0، ومبنية على بنيتين أساسيتين Qwen3.5 وQwen3.8، وتجيب عن أسئلة الاختيار ونعم/لا والدرجات باحتمال لكل خيار بدلًا من توليد توكن، وخمسة من الستة تقرأ الآن الصور والفيديو. تصف كل بطاقة نموذج نفسها بأنها "نموذج القرار الأساسي متعدد الوسائط بحجم 27B الخاص بـ Decision 3.0، نماذج القرار الخاصة بـ vLLM Semantic Router"، وهي طبقة القرار المفتوحة لمشروع vLLM.

ما ينقص هو الإعلان. حساب مشروع vLLM على X هنّأ فريق vLLM-SR على الإصدار في 11 أكتوبر، بالاقتباس من خيط المقدمة الخاص بالمشرف نفسه — وهذا هو السجل العام بأكمله. لا يزال فهرس مدونة المشروع ينتهي عند 10 أكتوبر بمقال عن نماذج قرارات التوجيه، وليس عن هذه النماذج. صفحة إصدارات GitHub لـ vllm-project/semantic-router لا يزال أعلى إصدار فيها هو v0.4.0 بتاريخ 27 سبتمبر. تم شحن الأوزان؛ أما ملاحظة الإطلاق فلم تصدر بعد.

هذا التمييز مهم لكيفية قراءتك لكل ما يلي. كل رقم أداء في هذه المقالة يأتي من بطاقات النماذج الخاصة بـ vLLM-SR، مقيسًا بأداة الاختبار الخاصة بهم على عتادهم الخاص. لم يُعِد أي طرف خارجي إنتاج أي شيء هنا، ولوحة النتائج التي ينشرون عليها هي لوحة يديرونها بأنفسهم. هذه قراءة مبكرة وصادقة لعمل فني حقيقي وادّعاء لم يُدقّق بعد.

ما الذي يوجد فعليًا على Hugging Face؟

المستودعات الستة بسيطة وكاملة ومتسقة مع بعضها البعض. يحمل كل منها أوزان safetensors، وقالب محادثة، وdecision_config.json يثبّت مراجعة النموذج الأساسي، وشيفرة نمذجة مخصصة (modeling_d3.py، d3_engine.py، d3_server.py)، ورأس قراءة خاص به في readout.safetensors، وMODEL_MANIFEST.json مع SHA-256 لكل ملف. وهناك مستودع سابع، صفحة المجموعة، يسرد الستة جميعها.

العائلة، بالترتيب الذي تظهر به الأحجام:

• d3 — 26.09 مليار معامل بما في ذلك مشفّر رؤية بحجم 0.46 مليار، مبني على Qwen/Qwen3.8-27B. تم رفعه في 10 أكتوبر، 09:38 بالتوقيت العالمي UTC.

• d3-flash — 8.39B بما في ذلك مشفّر رؤية بحجم 0.46B، مبني على Qwen/Qwen3.5-9B.

• d3-mini — 4.54B بما في ذلك مُشفّر بصري بحجم 0.33B، مبني على Qwen/Qwen3.5-4B.

• d3-nano — 2.21 مليار، بما في ذلك مُشفِّر رؤية بحجم 0.33 مليار، مبني على Qwen/Qwen3.5-2B.

• d3-lite — 0.85B بما في ذلك مشفّر رؤية بحجم 0.10B، مبني على Qwen/Qwen3.5-0.8B.

• d3-edge — 0.59 مليار، بما في ذلك مشفّر رؤية بحجم 0.10 مليار، ومبني أيضًا على Qwen/Qwen3.5-0.8B. رُفع أخيرًا، الساعة 23:49 بالتوقيت العالمي المنسق.

جميع الستة تحمل نفس عقد الطلب: حالة (نص أو JSON، مع صور وفيديوهات اختيارياً) بالإضافة إلى قاموس من الأسئلة المسماة، واستجابة من توزيعات احتمالية محددة النوع. توجد ثلاثة أنواع من الأسئلة — Choice، Noul (نعم/لا)، Score — ويجيب النموذج عليها جميعاً في نداء واحد عن طريق تشغيل تمريرة أمامية واحدة لكل سؤال على نفس المدخل، دون أي حلقة فك ترميز في أي مكان.

A screenshot of the vLLM-SR collection page on Hugging Face, headed Decision 3.0 with the subtitle 'Towards Open Multimodal Foundation Decision Models' and marked as updated about 15 hours ago with 25 upvotes. It lists six repositories, each tagged Zero-Shot Classification: vllm-sr/d3 at 26B with 130 downloads and 18 likes, vllm-sr/d3-flash at 8B with 69 downloads, vllm-sr/d3-mini at 5B with 62, vllm-sr/d3-nano at 2B with 82, vllm-sr/d3-lite at 0.9B with 83, and vllm-sr/d3-edge at 0.6B with 33. The left sidebar lists the organisation's other collections: Vela 2.0, Decision 2.0, Decision 1.0, Vela 1.0, MoM 1.0 and MoM Nano.

الأرقام، ولمن هي

تنشر vLLM-SR لوحة صدارة تسميها Jev Decision Index 0.3.1 وتضع d3 على قمتها. الصفوف الرئيسية، وكلها حسب إبلاغ المورّدين:

• d3 — المؤشر 64.7، المجموعة العامة 65.5، اختبارات المهارات نفسها 62.8، مهام النطاق الجديد 56.6.

• Perplexity Decider v1.1 (27B) — 62.8، 62.3، 61.1، 55.6.

• Fastino GLiDE بدون تفكير (28B) — 60.2، 59.1، 59.5، 52.9.

• Jev — 60.1، 58.0، 58.0، 55.0.

• Torchcast Decision 27B — 59.9، 65.1، 58.1، 50.8.

• Decision 2.0 (27B)، الجيل السابق — 55.9، 57.0، 55.7، 47.9.

تشير حاشية على بطاقة d3 بصراحة إلى أن صف d3 نفسه تقييم داخلي، بينما صفوف المقارنة بيانات لوحة مباشرة قُرئت في 10 أكتوبر. هذا هو الإفصاح الصحيح الذي ينبغي تقديمه، ويستحق القراءة مرتين: فقد سُحبت أرقام المنافسين من لوحة، بينما أُنتج رقم موضوع التقييم بواسطة الفريق الذي بنى النموذج. تدّعي البطاقة أيضًا أن جميع الطلبات العامة البالغ عددها 140,178 قد لُبّيت دون أي منها غير مدعوم — وهو ادعاء تغطية، لا ادعاء دقة، ومن غير المعتاد نشره.

A screenshot of the vllm-sr/d3 model card on Hugging Face. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The Highlights section states a Jev Decision Index 0.3 public suite score of 65.45 measured with the official 0.3 kit on the released weights, all 140,178 public requests answered and none unsupported, and +8.5 on the public suite over Decision 2.0. The sidebar shows 130 downloads last month, a model tree pinned to Qwen/Qwen3.8-27B, and two Spaces using the model.

تُبلِغ نقاط التحقق الأصغر عن نفسها بأنها تسير على نفس الإيقاع. تعطي كل بطاقة رقمًا من مجموعة اختبارات عامة وفرقًا مقابل الحجم المكافئ في Decision 2.0: d3-flash ‏57.79، بزيادة 11.0 عن 9B السابق؛ d3-mini ‏54.90، بزيادة 10.7؛ d3-nano ‏42.22، بزيادة 12.2؛ d3-lite ‏36.93، بزيادة 16.4؛ d3-edge ‏28.82، بزيادة 12.1. المكاسب النسبية هي الأكبر في الطرف الأدنى من النطاق، وهو ما قد تتوقعه إذا كانت وصفة التدريب المسبق متعددة الوسائط تؤدي عملًا أكبر من أجل النماذج الصغيرة مقارنة بالكبيرة — وهو أيضًا ما قد تنتجه إذا ضبطت النماذج الصغيرة بأقصى شدة. لا توجد طريقة لمعرفة أيّ من الأمرين من الخارج.

الجزء متعدد الوسائط هو التغيير الحقيقي

تقرأ نماذج Decision 2.0 النصوص. وتقرأ نماذج Decision 3.0 النصوص والصور والفيديو، وهذا هو الفرق الجوهري بين الجيلين — وليس تحرّك الفهرس. تسرد كل بطاقة إدخال الصور بصيغة PNG أو JPEG أو WebP، مقدَّمة كمسارات أو عناوين URL أو صور PIL أو عناوين URL لبيانات base64، مع عدة صور لكل طلب بحد أقصى 1.6 ميغابكسل لكل منها؛ والفيديو بصيغة MP4 أو WebM أو MOV أو MKV، أو كمصفوفات إطارات، يُقرأ بمعدل 2 إطار في الثانية مع 32 إطارًا كحد أقصى موزعة على المقطع بأكمله وبحد أقصى 0.2 ميغابكسل لكل إطار. يرى كل سؤال في الطلب كل صورة وكل فيديو مرفقًا به.

الدليل الداعم للفيديو هو نتيجة Perception Test على جميع أسئلة التحقق البالغ عددها 19,140: d3 عند 77.4، وd3-flash عند 73.3، وd3-mini عند 70.3، وd3-nano عند 63.5، وd3-lite عند 59.3، وd3-edge عند 46.6، مقابل حد الصدفة الأدنى الموثّق البالغ 33.3 في الأسئلة ثلاثية الخيارات. ويصنّف vLLM-SR هذا تقييمًا داخليًا. كما تحمل d3 لوحة رؤية تضعها عند 71.6 إجمالًا، متقدمة على Perplexity Decider v1.1 عند 70.6 وJEV-27B-VL عند 69.6، مع أن صفوف المقارنة مستمدة مرة أخرى من بيانات اللوحة بدلًا من أن يشغّلها المؤلفون.

أرقام الإنتاجية هي لطلب واحد، ووحدة معالجة رسومات واحدة، وتُذكر على هذا النحو: يُجيب d3 على طلب نصي في وسيط 55 مللي ثانية، وطلب يحمل صورة في 273 مللي ثانية، وطلب يحمل فيديو مدته عشر ثوانٍ في 553 مللي ثانية، على وحدة AMD Instinct MI325X واحدة. يفعل d3-edge الشيء نفسه في 6.7 مللي ثانية و41.9 مللي ثانية و308.3 مللي ثانية. هذه وسائط لكل سؤال على نموذج مصمم ليُستدعى مرات عديدة داخل سير عمل واحد، وهو الرقم المهم للبنية التي بُنيت لها هذه النماذج — عشرون قرارًا متسلسلًا بتكلفة إضافية قدرها 100 مللي ثانية لكل منها تكلف ثانيتين، كما أشارت Microsoft إلى النقطة نفسها بشأن نموذج القرار الخاص بها هذا الشهر.

ما لا تقوله المستودعات

ثمّة ثلاث فجوات جديرة بالذكر قبل أن يخطط أي أحد بناءً على هذا.

الأول هو ميزانية الإدخال. decision_config.json بالنسبة لأكبر مجموعات النماذج، يضبط max_length إلى null، ولا تذكر أي بطاقة سقفًا من التوكنات للحالة إضافةً إلى الأسئلة وأوصاف الخيارات. نشرت بطاقات Decision 1.0 ميزانيات صريحة — 1,024 توكن لفرع التشفير، و16,384 لفرع فك التشفير — وتلك الأرقام قيد حقيقي على التخطيط. وغيابها هنا لافت للنظر، وهو الشيء الأكثر فائدة الذي يمكن أن يضيفه إيداع لاحق.

الثاني هو المعايرة. أهم رقم في نموذج القرار ليس الدقة، بل ما إذا كانت قيمة 0.9 المُعادة تعني تسع مرات من أصل عشر. لا تقول مؤشرات الرؤية والنص شيئًا عن ذلك. لا توجد درجة Brier، ولا قيمة لخطأ المعايرة المتوقع، ولا درجة حرارة في أي من البطاقات الست. نشرت InternLM كليهما عن نموذج القرار الخاص بها في سبتمبر؛ أما vLLM-SR فلم تفعل ذلك، لأي عضو من هذه العائلة.

الثالث هو الاستقلال. نماذج Decision 2.0 مضى عليها أسبوعان من الاستخدام الخارجي؛ أما نماذج Decision 3.0 فمضى عليها ساعات. أعداد التنزيلات في 11 أكتوبر — 130 لـ d3، و83 لـ d3-lite، و82 لـ d3-nano — هي بصمة عملية رفع، وليست بصمة تبنٍّ. تعامل مع كل رقم مؤشر أعلاه باعتباره فرضيةً لها مستودع مرتبط بها.

أين يقع هذا في حزمة تقنيات يمكنك استدعاؤها اليوم

السؤال العملي حول نموذج قرار هو ما إذا كان يُدمج في خط أنابيب موجود بالفعل، وهنا النظام البيئي أكثر تقدّمًا مما عليه النماذج. إن صيغة طلب System One التي تستخدمها هذه النماذج ليست حصرية لـ vLLM-SR: إنها العقد نفسه القائم على الحالة والأسئلة المسماة الذي تُستدعى به نماذج Jev المستضافة، ولهذا يظهر "Jev" بوصفه اسم الفهرس في بطاقة نموذج d3 وبوصفه صفًا في لوحة صدارتها.

تتولى OrcaRouter ذلك الجانب من العائلة. typesafe/jev-1.13 موجود في كتالوجنا ويُقدَّم عبر POST /v1/systemone — العقد نفسه، بسعر $0.042 لكل مليون رمز إدخال مع عدم وجود رسوم إكمال لأنه لا يوجد إكمال، حتى نحو 64 ألف رمز إدخال، إدخال نصي ومخرجات JSON منظّمة، غير متدفق. وهو النوع من النماذج التي تستدعيها طبقة قرار اليوم. هناك أمران لا ندّعيهما: d3 وبقية Decision 3.0 ليسا في كتالوجنا، ومسار الاستدلال المحلي في Decision 3.0 هو صنف Python في مستودع Hugging Face، وليس نقطة نهاية كنا نستطيع توجيهها حتى لو أردنا. ما يمنحك إياه الموجّه هنا يقع على الجانب الآخر من الحلقة — النموذج التوليدي الذي يتصرف بناءً على قرار، يُوجَّه عبر مفتاح واحد بين أكثر من 200 نموذج مع تجاوز فشل تلقائي عندما يتعثر مزوّد، بحيث لا يعني إضافة خطوة تقييم أمام سير عمل إضافة علاقة مورّد ثانية أيضًا.

ما الذي قد يغيّر هذه الصورة؟

أربعة أشياء، بترتيب تقريبي حسب مقدار ما ستخبرك به. منشور مدونة من المشروع يذكر ميزانية المدخلات وشكل النشر المقصود، مما سيؤكد أن هذا إصدار وليس دفعة. درجة Brier أو قيمة ECE على أي نقطة تفتيش واحدة. طرف ثالث يشغّل مجموعة الاختبارات العامة على الأوزان المنشورة بدلاً من قراءة الفهرس. وبيئة تشغيل — مستودع semantic-router سجّل التزامين في 11 أكتوبر يربطان d3 وd3-edge ببيئة تشغيل النموذج الخاصة به، بما في ذلك إدخال الفيديو، مما يشير إلى أن قصة خدمة النموذج تُبنى الآن وستكون الشيء الذي يجعل تجربة هذه النماذج رخيصة.

إلى أن يتحقق أول تلك الأمور على الأقل، فإن الخلاصة الصادقة هي هذه: توجد عائلة نماذج قرار كاملة، بترخيص Apache-2.0، متعددة الوسائط حقًا، ماثلة على Hugging Face بأحجام تتراوح من 0.6B إلى 27B، نُشرت مع توثيق منشأ جيد على نحو غير معتاد — تجزئات ملفات، ومراجعات أساسية مثبتة، وهدف عتادي معلن — ومع قدر ضئيل على نحو غير معتاد من التوثيق المحيط الذي يتيح لك أن تقرر ما إذا كنت ستستخدمها. تنزيلها لا يكلف شيئًا. أما الوثوق بالفهرس فيجب أن ينتظر.

A generated six-row scoreboard titled 'Decision 3.0 - the scoreboard', listing the family from largest to smallest with each checkpoint's parameter count and its vLLM-SR-reported Jev Decision Index 0.3 public-suite figure: d3 26.09B and 65.5, d3-flash 8.39B and 57.79, d3-mini 4.54B and 54.90, d3-nano 2.21B and 42.22, d3-lite 0.85B and 36.93, d3-edge 0.59B and 28.82, with a footer reading 'All figures are vLLM-SR's own; nothing here is independently reproduced.'

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا