بطاقة عنوان مُولّدة لـ Microsoft-Decision-1 مقابل Liquid AI d1-3B، بعنوان فرعي 'النموذجان الوحيدان للقرار اللذان يتفقان على نافذة السياق'، مع شرائح تعرض 32,768 رمزًا في كليهما، نص فقط مقابل نص وصور وصوت، 25 لغة مقابل 16، واجهة برمجة تطبيقات مستضافة مقابل أوزان lfm1.0، وتذييل يشير إلى أن أرقام كلا المورّدين مُبلّغ عنها ذاتيًا وغير مُتحقق منها.
Guides & Insights

Microsoft-Decision-1 مقابل Liquid AI d1-3B: نافذة 32K نفسها، لكن معنيان مختلفان

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

لأول مرة تتطابق المواصفات. Microsoft-Decision-1، المتاح عمومًا على Microsoft Foundry منذ 8 أكتوبر 2026، يستوعب 32,768 رمزًا من السياق. وكذلك Liquid AI d1-3B، الذي تم رفعه إلى Hugging Face في 5 أكتوبر 2026 وأعلنت عنه Liquid AI بعد يومين. كلاهما يقبل حالة بالإضافة إلى مجموعة من الأسئلة المصنفة — نعم/لا، اختيار بين خيارات مسماة، موقف على مقياس مرتب — وكلاهما يجيب في تمريرة أمامية واحدة بتوزيع احتمالي بدلاً من نص مُولّد؛ تختلف Laya وIntern-Decision-4B وKev وبقية هذا المجال مع بعضها البعض حول طول السياق، لذا هذا هو الزوج الوحيد الذي يسقط فيه هذا البُعد ويجب أن تُبنى المقارنة على شيء آخر.

اتضح أن الشيء الآخر هو قناة الإدخال. نموذج Microsoft نصّي فقط، صراحةً: فهو «لا يقبل أو يُنتج محتوى صور أو صوت أو فيديو». أما نموذج Liquid AI فيحمل مُرمِّز رؤية SigLIP2 NaFlex بمعاملات تبلغ 400 مليون على عمود فقري لغوي بمعاملات 2.6 مليار، ويصل إجمالاً إلى 3.12 مليار معامل، وقد بُني تحديداً من أجل الأمر الذي استبعدته Microsoft — تقييم لقطة شاشة أو نموذج ممسوح ضوئياً أو إطار كاميرا مقابل سؤال ثابت. وهذا الانقسام، إضافة إلى اختلاف في الترخيص لا علاقة له بالقدرة، هو جوهر المواجهة كاملة.

حيث يتفق الاثنان، وهو أكثر مما تتوقعه

• نافذة السياق — 32,768 توكنًا لـ Microsoft-Decision-1 و32,768 توكنًا لـ Liquid AI d1-3B.

• شكل المخرجات — احتمالات معايرة على الخيارات المقدمة؛ لا يولّد أي منهما نصًا، ويُبلّغ عدّاد الاستخدام من Liquid AI عن ذلك على النحو output_tokens: 0.

• أنواع الأسئلة — سواءً كان اختيار المستند، أو الدرجة المرتبة، أو نعم/لا الثنائي، وكلاهما يتيح لك تحديد مجموعة الخيارات لكل طلب بدلًا من إعادة تدريب رأس المفردات.

• الامتناع — توثّق Microsoft خيارات امتناع صريحة مثل "لا أستطيع الجزم"؛ يدعم مخطط Decision Index من Liquid AI الأمر نفسه عبر مجموعة خياراته.

• الاستدلال بتمريرة واحدة — استدعاء واحد لكل قرار على الجانبين، وهو ما يجعل أياً منهما مجدياً عند حجم خط الأنابيب.

اتفاق نموذجين على أصعب قيدين في هذا المجال المتخصص أمر يستحق التوقف عنده. نافذة 32K هي ما يجعل مقيّم القرارات قابلاً للاستخدام مع عقد كامل، أو سياسة متعددة الصفحات، أو سلسلة دعم طويلة؛ أما نقطة التحقق الإنجليزية Laya بحجم 512 رمزًا وحدود الأسئلة لكل استدعاء في Intern-Decision-4B فلا تفعل ذلك. إذا كان مدخلك قصيرًا، فإن معظم هذا المجال قابل للتبادل ويكون القرار حينها متعلقًا بالاستضافة. وإذا كان مدخلك طويلًا، فإن المجال ينحصر في هذين الاثنين.

الإحساس الذي لا يملكه إلا واحد منهم

إن Liquid AI d1-3B متعدد الوسائط، وتجعل شجرة النماذج النسب واضحًا: LFM2.5-2.6B-Base، ثم LFM2.5-VL-3B، ثم d1-3B المدرَّب لاحقًا لاتخاذ قرارات معايَرة بتمريرة واحدة. تدخل الصور عبر مُرمّز SigLIP2 NaFlex، وتُبلّغ بطاقة النموذج عن متوسط 74.1 عبر أحد عشر معيارًا عامًا للصور مقابل 73.9 لنموذج الرؤية الأساسي — لذا لم يُكلّف ضبط القرار جودة الرؤية لديه. كما تُبلّغ عن التجربة العكسية: عند إزالة الصور، تهبط الأسئلة نفسها إلى 45.1، وهو أنقى دليل يمكن أن تحصل عليه على أن قناة الإدراك أساسية وليست زخرفية.

لا يوجد لـ Microsoft-Decision-1 ما يعادله، والإغفال متعمد وليس غير مكتمل. تُدرج بطاقة Microsoft الاستخدامات الخارجة عن النطاق على أنها توليد النصوص، والإجابة عن أسئلة مفتوحة، والمحادثة، والترجمة والتلخيص، وتذكر بشكل منفصل أن النموذج نصّي فقط. وبالنسبة لخط أنابيب يحتاج إلى تقييم لقطة شاشة لنموذج استمارة مقابل معايير تقييم، أو تحديد ما إذا كان إطار كاميرا يتضمن حدثًا أمنيًا، فهذا يمثل توقفًا صارمًا — لا يمكن لأي هندسة أوامر استعادة وسيط لم يُمنح النموذج إياه قط.

أما أعداد اللغات فتسير في الاتجاه المعاكس، وهذا هو الانقسام الحقيقي الثاني. يُدرج Microsoft-Decision-1 خمسًا وعشرين لغة مدعومة، والشركة صريحة في أن التغطية والجودة والمعايرة "قد تتفاوت حسب اللغة"، وتشير إلى اللغات غير الإنجليزية، وخاصة اللغات ذات الموارد المحدودة، باعتبارها مجالًا لأداء دون المستوى. ويذكر Liquid AI d1-3B ست عشرة لغة. من حيث الاتساع، تتفوق Microsoft على الورق؛ أما من حيث الصراحة بشأن ما يعنيه الاتساع، فيقول كلا الموردين شيئًا مشابهًا، ولم ينشر أي منهما معايرة خاصة بكل لغة.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

تبويب المعيار، مرة أخرى

تحتوي صفحة Foundry الخاصة بـ Microsoft-Decision-1 على علامة تبويب Benchmarks تضم قسمًا للمنهجية وبلا أي أرقام: معايير قرار عامة ومجتمعية إضافة إلى مجموعات داخلية محجوزة، ومقاييس تغطي الدقة وخطأ المعايرة، وترتيب خيارات متنوّع، واختبارات إحصائية مقترنة، وادعاءً بأن النموذج "يؤدي على قدم المساواة مع نماذج القرار الرائدة ويتقدّم على نماذج القرار المفتوحة الأخرى التي جرى تقييمها بالمنهجية نفسها." لا شيء للتحقق منه، ولا شيء لإعادة إنتاجه.

تنشر Liquid AI نموذج d1-3B نتيجة 48.57 على Decision Index 0.2.1 — والتحفّظ أهم من الرقم، لأن Decision Index هو مؤشر Liquid AI الخاص، وd1-3B هو نموذج Liquid AI الخاص. إنها نتيجة مُقيَّمة من المورّد على معيار من تأليف المورّد، وتضعها الشركة كأفضل نموذج قرارات دون 10B ومتقدّمة على نموذج 35B على المقياس نفسه. تعامل مع 48.57 كادّعاء اتجاهي، لا كرقم مُدقَّق. وإلى جانبه، تسرد البطاقة تقييمات داخلية لتنسيق القرارات بمتوسط 77.1، وSQuAD 2.0 عند 85.3، وPAWS-X عند 76.9، وDecisionBench عند 71.8 — وجميعها مُبلَّغ عنها ذاتيًا، وصياغة «أقل من 10B» قيد حقيقي وليست مراوغة، لأن النموذج بحجم 3.12B.

إذن، مسألة المعايرة تُحل بالطريقة نفسها التي تُحل بها في هذا المجال بأكمله: تمنحك Liquid AI رقمًا مُنتَجًا وفق مقياسها الخاص، وتمنحك Microsoft منهجية دون رقم، ولا تمنحك أي منهما قياسًا مستقلًا من طرف ثالث. الرقم الوحيد للمعايرة الذي سيهمّ في عملية النشر الخاصة بك هو الذي تحسبه على بياناتك المُعنونة الخاصة.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

التقديم، والتراخيص، وما الذي تشتريه فعليًا

زمن استجابة d1-3B منشور وهو السبب وراء وجود النموذج. ثماني مللي ثانية لكل قرار على RTX 4090، وتسع على AMD MI325X، مع إنتاجية معبأة تبلغ 475 و1,106 في الثانية عند 64 حالة. على الأجهزة الطرفية: 30 مللي ثانية على Apple M5 Pro، و16 مللي ثانية على Jetson AGX Thor، و26 مللي ثانية على Jetson AGX Orin 64 GB، و50 مللي ثانية على Orin Nano. لا ينشر Microsoft-Decision-1 أي رقم لزمن الاستجابة على الإطلاق، وخياراته المدمجة في التصميم — واجهة Foundry API مستضافة بنظام الدفع حسب الاستخدام أو الإنتاجية المحجوزة المخصصة، مع تعطيل الاستدلال بالدفعات — يعني أنك تقيسه من خلال النشر الخاص بك. وهذه ليست فجوة صغيرة بالنسبة لنموذج غرضه الكامل أن يُستدعى مرة واحدة لكل مستند مسترجع أو إجراء مقترح.

الترخيص هو موضع افتراق الاثنين بطريقة تفاجئ الناس. ويُوسَم Liquid AI d1-3B بـlfm1.0، لا Apache 2.0 — وهو ترخيص من العائلة نفسها التي ينتمي إليها بقية خط LFM من Liquid، ويحمل شروط استخدام لا يحملها ترخيص متساهل. إذا كانت مراجعتك القانونية تفهمه على أنه متوافق مع OpenAI وبلا قيود، فهذا ليس ذلك، ويستحق القراءة قبل إطلاق النموذج لا بعده. لا يملك Microsoft-Decision-1 أوزانًا على الإطلاق: فهو نقطة نهاية مستضافة ضمن محفظة Direct from Azure، مع مصادقة Azure، وفوترة موحّدة، ولا تنزيل، ومسألة الترخيص استُبدلت باتفاقية خدمة. لا يمكن ضبط أي من النموذجين ضبطًا دقيقًا عبر المسارات التي توثقها الشركات المورّدة، وهذا هو أشد القيود حدةً بالنسبة إلى نموذج قرار — فالمُقيِّم الذي لا يمكنك تكييفه مع تسمياتك الخاصة هو مُقيِّم لا تستطيع إصلاح أنماط أخطائه، بل الالتفاف حولها فقط.

التوجيه حولها هو المكان الذي ينتمي إليه OrcaRouter في هذا النمط، وعلى جانب واحد منه فقط. نحن لا نستضيف Microsoft-Decision-1 ولا Liquid AI d1-3B: فلا أيٌّ منهما يُرجع نصًا، ولا أيٌّ منهما في كتالوجنا، ونقطة نهاية تسجيل الاحتمالات ليست هدفًا لإكمال المحادثات. ما نقدّمه هو النصف المُولِّد من الحلقة — النموذج الذي يصوغ الإجابة التي سيقيمها المُقيِّم لديك، أو يستخرج الحقول التي سيحكم عليها المُقيِّم لديك، أو يقترح الإجراء الذي سيوافق عليه المُقيِّم لديك. هذا أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI بسعر قائمة المزوّد مُمرَّرًا مع هامش ربح 0%، لذا فإن تغيُّر سعر المورّد يسري على جانبنا في اليوم نفسه، ويغطي التحويل التلقائي عند الفشل استدعاء التوليد في حلقة ليس لديها زمن استجابة احتياطي لإعادة محاولة أحدها.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

اختياران نظيفان، وواحد ليس قريبًا

اختر Liquid AI d1-3B إذا كان أي شيء في مسار المعالجة لديك عبارة عن صورة. فرز لقطات الشاشة، واستخراج النماذج، وتوجيه ضمان الجودة البصري، ومشرف يقيّم إطارات الكاميرا — لا يمكن جعل Microsoft-Decision-1 يقوم بهذا، وقد بُني d1-3B لهذا الغرض مع معايير الرؤية المنشورة لدعم هذا الادعاء. اختره أيضًا إذا كنت تحتاج إلى استدلال طرفي يُقاس بعشرات المللي ثانية على Jetson أو حاسوب محمول، أو إذا أردت النموذج على عتادك الخاص، أو إذا كانت رخصة يمكنك قراءتها كافية لمستشارك القانوني.

اختر Microsoft-Decision-1 إذا كان مدخلك نصًا، وكانت مستنداتك طويلة، وكانت بوابتك هي المشتريات — مصادقة Azure، وفوترة موحّدة، وتقييم للذكاء الاصطناعي المسؤول، ومورّد يمكن التصعيد إليه — أو كانت حركة المرور لديك تغطي أكثر من اللغات الـ16 التي يسردها d1-3B. تقبّل أن غياب رقم زمن الاستجابة وغياب جدول معايير الأداء يعنيان أن أول أسبوعين لك معه سيكونان للقياس، لا للتكامل.

الحالة الوحيدة التي لا خلاف عليها هي العمل متعدد الوسائط: فهناك، حُسم الاختيار عندما كتبت مايكروسوفت "نصي فقط" في بطاقة النموذج.