
Decision 3.0 متاح على Hugging Face: ستة نماذج قرار متعددة الوسائط مفتوحة، أُعلن عنها على X فقط
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز · 71 tok/s
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
Decision 3.0 متاح في صيغة يمكنك تنزيلها الآن، ولم يدوّنه أحد تقريبًا. ست نقاط تفتيش — d3، d3-flash، d3-mini، d3-nano، d3-lite وd3-edge — نُشرت في منظمة vllm-sr على Hugging Face في 10 أكتوبر 2026، من الأحدث أولًا بدءًا من 09:38 UTC وانتهاءً بـ d3-edge عند 23:49 UTC. وهي بترخيص Apache-2.0، ومبنية على بنيتين أساسيتين Qwen3.5 وQwen3.8، وتجيب عن أسئلة الاختيار ونعم/لا والدرجات باحتمال لكل خيار بدلًا من توليد توكن، وخمسة من الستة تقرأ الآن الصور والفيديو. تصف كل بطاقة نموذج نفسها بأنها "نموذج القرار الأساسي متعدد الوسائط بحجم 27B الخاص بـ Decision 3.0، نماذج القرار الخاصة بـ vLLM Semantic Router"، وهي طبقة القرار المفتوحة لمشروع vLLM.
ما ينقص هو الإعلان. حساب مشروع vLLM على X هنّأ فريق vLLM-SR على الإصدار في 11 أكتوبر، بالاقتباس من خيط المقدمة الخاص بالمشرف نفسه — وهذا هو السجل العام بأكمله. لا يزال فهرس مدونة المشروع ينتهي عند 10 أكتوبر بمقال عن نماذج قرارات التوجيه، وليس عن هذه النماذج. صفحة إصدارات GitHub لـ vllm-project/semantic-router لا يزال أعلى إصدار فيها هو v0.4.0 بتاريخ 27 سبتمبر. تم شحن الأوزان؛ أما ملاحظة الإطلاق فلم تصدر بعد.
هذا التمييز مهم لكيفية قراءتك لكل ما يلي. كل رقم أداء في هذه المقالة يأتي من بطاقات النماذج الخاصة بـ vLLM-SR، مقيسًا بأداة الاختبار الخاصة بهم على عتادهم الخاص. لم يُعِد أي طرف خارجي إنتاج أي شيء هنا، ولوحة النتائج التي ينشرون عليها هي لوحة يديرونها بأنفسهم. هذه قراءة مبكرة وصادقة لعمل فني حقيقي وادّعاء لم يُدقّق بعد.
ما الذي يوجد فعليًا على Hugging Face؟
المستودعات الستة بسيطة وكاملة ومتسقة مع بعضها البعض. يحمل كل منها أوزان safetensors، وقالب محادثة، وdecision_config.json يثبّت مراجعة النموذج الأساسي، وشيفرة نمذجة مخصصة (modeling_d3.py، d3_engine.py، d3_server.py)، ورأس قراءة خاص به في readout.safetensors، وMODEL_MANIFEST.json مع SHA-256 لكل ملف. وهناك مستودع سابع، صفحة المجموعة، يسرد الستة جميعها.
العائلة، بالترتيب الذي تظهر به الأحجام:
• d3 — 26.09 مليار معامل بما في ذلك مشفّر رؤية بحجم 0.46 مليار، مبني على Qwen/Qwen3.8-27B. تم رفعه في 10 أكتوبر، 09:38 بالتوقيت العالمي UTC.
• d3-flash — 8.39B بما في ذلك مشفّر رؤية بحجم 0.46B، مبني على Qwen/Qwen3.5-9B.
• d3-mini — 4.54B بما في ذلك مُشفّر بصري بحجم 0.33B، مبني على Qwen/Qwen3.5-4B.
• d3-nano — 2.21 مليار، بما في ذلك مُشفِّر رؤية بحجم 0.33 مليار، مبني على Qwen/Qwen3.5-2B.
• d3-lite — 0.85B بما في ذلك مشفّر رؤية بحجم 0.10B، مبني على Qwen/Qwen3.5-0.8B.
• d3-edge — 0.59 مليار، بما في ذلك مشفّر رؤية بحجم 0.10 مليار، ومبني أيضًا على Qwen/Qwen3.5-0.8B. رُفع أخيرًا، الساعة 23:49 بالتوقيت العالمي المنسق.
جميع الستة تحمل نفس عقد الطلب: حالة (نص أو JSON، مع صور وفيديوهات اختيارياً) بالإضافة إلى قاموس من الأسئلة المسماة، واستجابة من توزيعات احتمالية محددة النوع. توجد ثلاثة أنواع من الأسئلة — Choice، Noul (نعم/لا)، Score — ويجيب النموذج عليها جميعاً في نداء واحد عن طريق تشغيل تمريرة أمامية واحدة لكل سؤال على نفس المدخل، دون أي حلقة فك ترميز في أي مكان.

الأرقام، ولمن هي
تنشر vLLM-SR لوحة صدارة تسميها Jev Decision Index 0.3.1 وتضع d3 على قمتها. الصفوف الرئيسية، وكلها حسب إبلاغ المورّدين:
• d3 — المؤشر 64.7، المجموعة العامة 65.5، اختبارات المهارات نفسها 62.8، مهام النطاق الجديد 56.6.
• Perplexity Decider v1.1 (27B) — 62.8، 62.3، 61.1، 55.6.
• Fastino GLiDE بدون تفكير (28B) — 60.2، 59.1، 59.5، 52.9.
• Jev — 60.1، 58.0، 58.0، 55.0.
• Torchcast Decision 27B — 59.9، 65.1، 58.1، 50.8.
• Decision 2.0 (27B)، الجيل السابق — 55.9، 57.0، 55.7، 47.9.
تشير حاشية على بطاقة d3 بصراحة إلى أن صف d3 نفسه تقييم داخلي، بينما صفوف المقارنة بيانات لوحة مباشرة قُرئت في 10 أكتوبر. هذا هو الإفصاح الصحيح الذي ينبغي تقديمه، ويستحق القراءة مرتين: فقد سُحبت أرقام المنافسين من لوحة، بينما أُنتج رقم موضوع التقييم بواسطة الفريق الذي بنى النموذج. تدّعي البطاقة أيضًا أن جميع الطلبات العامة البالغ عددها 140,178 قد لُبّيت دون أي منها غير مدعوم — وهو ادعاء تغطية، لا ادعاء دقة، ومن غير المعتاد نشره.

تُبلِغ نقاط التحقق الأصغر عن نفسها بأنها تسير على نفس الإيقاع. تعطي كل بطاقة رقمًا من مجموعة اختبارات عامة وفرقًا مقابل الحجم المكافئ في Decision 2.0: d3-flash 57.79، بزيادة 11.0 عن 9B السابق؛ d3-mini 54.90، بزيادة 10.7؛ d3-nano 42.22، بزيادة 12.2؛ d3-lite 36.93، بزيادة 16.4؛ d3-edge 28.82، بزيادة 12.1. المكاسب النسبية هي الأكبر في الطرف الأدنى من النطاق، وهو ما قد تتوقعه إذا كانت وصفة التدريب المسبق متعددة الوسائط تؤدي عملًا أكبر من أجل النماذج الصغيرة مقارنة بالكبيرة — وهو أيضًا ما قد تنتجه إذا ضبطت النماذج الصغيرة بأقصى شدة. لا توجد طريقة لمعرفة أيّ من الأمرين من الخارج.
الجزء متعدد الوسائط هو التغيير الحقيقي
تقرأ نماذج Decision 2.0 النصوص. وتقرأ نماذج Decision 3.0 النصوص والصور والفيديو، وهذا هو الفرق الجوهري بين الجيلين — وليس تحرّك الفهرس. تسرد كل بطاقة إدخال الصور بصيغة PNG أو JPEG أو WebP، مقدَّمة كمسارات أو عناوين URL أو صور PIL أو عناوين URL لبيانات base64، مع عدة صور لكل طلب بحد أقصى 1.6 ميغابكسل لكل منها؛ والفيديو بصيغة MP4 أو WebM أو MOV أو MKV، أو كمصفوفات إطارات، يُقرأ بمعدل 2 إطار في الثانية مع 32 إطارًا كحد أقصى موزعة على المقطع بأكمله وبحد أقصى 0.2 ميغابكسل لكل إطار. يرى كل سؤال في الطلب كل صورة وكل فيديو مرفقًا به.
الدليل الداعم للفيديو هو نتيجة Perception Test على جميع أسئلة التحقق البالغ عددها 19,140: d3 عند 77.4، وd3-flash عند 73.3، وd3-mini عند 70.3، وd3-nano عند 63.5، وd3-lite عند 59.3، وd3-edge عند 46.6، مقابل حد الصدفة الأدنى الموثّق البالغ 33.3 في الأسئلة ثلاثية الخيارات. ويصنّف vLLM-SR هذا تقييمًا داخليًا. كما تحمل d3 لوحة رؤية تضعها عند 71.6 إجمالًا، متقدمة على Perplexity Decider v1.1 عند 70.6 وJEV-27B-VL عند 69.6، مع أن صفوف المقارنة مستمدة مرة أخرى من بيانات اللوحة بدلًا من أن يشغّلها المؤلفون.
أرقام الإنتاجية هي لطلب واحد، ووحدة معالجة رسومات واحدة، وتُذكر على هذا النحو: يُجيب d3 على طلب نصي في وسيط 55 مللي ثانية، وطلب يحمل صورة في 273 مللي ثانية، وطلب يحمل فيديو مدته عشر ثوانٍ في 553 مللي ثانية، على وحدة AMD Instinct MI325X واحدة. يفعل d3-edge الشيء نفسه في 6.7 مللي ثانية و41.9 مللي ثانية و308.3 مللي ثانية. هذه وسائط لكل سؤال على نموذج مصمم ليُستدعى مرات عديدة داخل سير عمل واحد، وهو الرقم المهم للبنية التي بُنيت لها هذه النماذج — عشرون قرارًا متسلسلًا بتكلفة إضافية قدرها 100 مللي ثانية لكل منها تكلف ثانيتين، كما أشارت Microsoft إلى النقطة نفسها بشأن نموذج القرار الخاص بها هذا الشهر.
ما لا تقوله المستودعات
ثمّة ثلاث فجوات جديرة بالذكر قبل أن يخطط أي أحد بناءً على هذا.
الأول هو ميزانية الإدخال. decision_config.json بالنسبة لأكبر مجموعات النماذج، يضبط max_length إلى null، ولا تذكر أي بطاقة سقفًا من التوكنات للحالة إضافةً إلى الأسئلة وأوصاف الخيارات. نشرت بطاقات Decision 1.0 ميزانيات صريحة — 1,024 توكن لفرع التشفير، و16,384 لفرع فك التشفير — وتلك الأرقام قيد حقيقي على التخطيط. وغيابها هنا لافت للنظر، وهو الشيء الأكثر فائدة الذي يمكن أن يضيفه إيداع لاحق.
الثاني هو المعايرة. أهم رقم في نموذج القرار ليس الدقة، بل ما إذا كانت قيمة 0.9 المُعادة تعني تسع مرات من أصل عشر. لا تقول مؤشرات الرؤية والنص شيئًا عن ذلك. لا توجد درجة Brier، ولا قيمة لخطأ المعايرة المتوقع، ولا درجة حرارة في أي من البطاقات الست. نشرت InternLM كليهما عن نموذج القرار الخاص بها في سبتمبر؛ أما vLLM-SR فلم تفعل ذلك، لأي عضو من هذه العائلة.
الثالث هو الاستقلال. نماذج Decision 2.0 مضى عليها أسبوعان من الاستخدام الخارجي؛ أما نماذج Decision 3.0 فمضى عليها ساعات. أعداد التنزيلات في 11 أكتوبر — 130 لـ d3، و83 لـ d3-lite، و82 لـ d3-nano — هي بصمة عملية رفع، وليست بصمة تبنٍّ. تعامل مع كل رقم مؤشر أعلاه باعتباره فرضيةً لها مستودع مرتبط بها.
أين يقع هذا في حزمة تقنيات يمكنك استدعاؤها اليوم
السؤال العملي حول نموذج قرار هو ما إذا كان يُدمج في خط أنابيب موجود بالفعل، وهنا النظام البيئي أكثر تقدّمًا مما عليه النماذج. إن صيغة طلب System One التي تستخدمها هذه النماذج ليست حصرية لـ vLLM-SR: إنها العقد نفسه القائم على الحالة والأسئلة المسماة الذي تُستدعى به نماذج Jev المستضافة، ولهذا يظهر "Jev" بوصفه اسم الفهرس في بطاقة نموذج d3 وبوصفه صفًا في لوحة صدارتها.
تتولى OrcaRouter ذلك الجانب من العائلة. typesafe/jev-1.13 موجود في كتالوجنا ويُقدَّم عبر POST /v1/systemone — العقد نفسه، بسعر $0.042 لكل مليون رمز إدخال مع عدم وجود رسوم إكمال لأنه لا يوجد إكمال، حتى نحو 64 ألف رمز إدخال، إدخال نصي ومخرجات JSON منظّمة، غير متدفق. وهو النوع من النماذج التي تستدعيها طبقة قرار اليوم. هناك أمران لا ندّعيهما: d3 وبقية Decision 3.0 ليسا في كتالوجنا، ومسار الاستدلال المحلي في Decision 3.0 هو صنف Python في مستودع Hugging Face، وليس نقطة نهاية كنا نستطيع توجيهها حتى لو أردنا. ما يمنحك إياه الموجّه هنا يقع على الجانب الآخر من الحلقة — النموذج التوليدي الذي يتصرف بناءً على قرار، يُوجَّه عبر مفتاح واحد بين أكثر من 200 نموذج مع تجاوز فشل تلقائي عندما يتعثر مزوّد، بحيث لا يعني إضافة خطوة تقييم أمام سير عمل إضافة علاقة مورّد ثانية أيضًا.
ما الذي قد يغيّر هذه الصورة؟
أربعة أشياء، بترتيب تقريبي حسب مقدار ما ستخبرك به. منشور مدونة من المشروع يذكر ميزانية المدخلات وشكل النشر المقصود، مما سيؤكد أن هذا إصدار وليس دفعة. درجة Brier أو قيمة ECE على أي نقطة تفتيش واحدة. طرف ثالث يشغّل مجموعة الاختبارات العامة على الأوزان المنشورة بدلاً من قراءة الفهرس. وبيئة تشغيل — مستودع semantic-router سجّل التزامين في 11 أكتوبر يربطان d3 وd3-edge ببيئة تشغيل النموذج الخاصة به، بما في ذلك إدخال الفيديو، مما يشير إلى أن قصة خدمة النموذج تُبنى الآن وستكون الشيء الذي يجعل تجربة هذه النماذج رخيصة.
إلى أن يتحقق أول تلك الأمور على الأقل، فإن الخلاصة الصادقة هي هذه: توجد عائلة نماذج قرار كاملة، بترخيص Apache-2.0، متعددة الوسائط حقًا، ماثلة على Hugging Face بأحجام تتراوح من 0.6B إلى 27B، نُشرت مع توثيق منشأ جيد على نحو غير معتاد — تجزئات ملفات، ومراجعات أساسية مثبتة، وهدف عتادي معلن — ومع قدر ضئيل على نحو غير معتاد من التوثيق المحيط الذي يتيح لك أن تقرر ما إذا كنت ستستخدمها. تنزيلها لا يكلف شيئًا. أما الوثوق بالفهرس فيجب أن ينتظر.

مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
