بطاقة عنوان مُولَّدة لـ Microsoft-Decision-1 مقابل Liquid AI d1-omni-600M بعنوان فرعي «أوسع سطح استشعار في الفئة مقابل أقصر قائمة مدخلات»، مع شرائح مكتوب عليها: 587 مليون معلمة مع الرؤية والصوت، وواجهة Foundry API للنصوص فقط، و30 ثانية من الكلام مقابل 32,768 رمزًا من النص، ومُشفِّر ثنائي الاتجاه مع مُفكِّك ترميز مُدرَّب لاحقًا، ولا معايرة منشورة على أي من الجانبين.
Engineering & Research

Microsoft-Decision-1 مقابل Liquid AI d1-omni-600M: مُقيِّم يستمع في مواجهة مُقيِّم يقرأ فقط

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أنت تُوجِّه المطالبات في مكتب تأمين، ويصل الملف في ثلاث صور: مستند PDF، وصورة فوتوغرافية لباب منبعج، ومكالمة هاتفية مدتها تسعون ثانية. Liquid AI d1-omni-600Mيستطيع قراءة المستند، والنظر إلى الصورة، والاستماع إلى المكالمة، ثم الإجابة عن مجموعة من الأسئلة كتبتها مسبقًا — هل هذا مشمول؟ وما الفئة؟ وما مدى الخطورة على مقياس من اثنين إلى عشرة؟ — في تمريرة واحدة، دون توليد أي نص ودون أي شيء يحتاج إلى تحليل. Microsoft-Decision-1يستطيع قراءة المستند. وقد أصبح متاحًا عمومًا على Microsoft Foundry في ٨ أكتوبر ٢٠٢٦كأداة تقييم مستضافة نصية فقط، مُدرَّبة لاحقًا على Qwen3.5-9B بنافذة سياق تبلغ 32,768 رمزًا، وينتهي سطح الإدخال لديها عند هذا الحد: لا صور، ولا صوت، ولا فيديو. وكلاهما يُعيد احتمالات معايَرة على الخيارات التي توفرها، وكلاهما لا يُصدر أي رمز إخراج، ولم ينشر أي منهما رقمًا للمعايرة.

تلك الجملة المشتركة الأخيرة هي الجزء غير المريح في هذه المقارنة. هذان النموذجان القائمان على القرار، الأوسع مستشعرًا والأضيق مستشعرًا، اللذان سيُطرحان هذا الشهر، ورغم كل التباعد المعماري بينهما فقد استقرّا في الموضع الإثباتي نفسه تمامًا: أوزان حقيقية أو نقطة نهاية حقيقية، وعقود موثّقة، ولا رقم يستطيع أي شخص من خارج المورّد أن يشير إليه عندما يسأل أحدهم ما إذا كانت الاحتمالات جديرة بالثقة.

سلالتان، لا مقاسين

إن رقم 587 مليون يغريك بقراءة Liquid AI d1-omni-600M باعتباره قريبًا مصغَّرًا من النماذج التي تناولتها هذه المدونة سابقًا. لكنه ليس كذلك. يُدرَّب النموذج انطلاقًا من LFM2.5-Encoder-350M، وهو مُرمِّز ثنائي الاتجاه، بجذع مشترك ورأس قرار بحجم 381 مليون، ومُرمِّز رؤية بحجم 94 مليون مأخوذ من سلسلة LFM2.5-VL-450M، وFastConformer ذو 17 طبقة للصوت. أما Microsoft-Decision-1 فهو من سلالة أخرى بالكامل: مُفكِّك Qwen3.5-9B، دُرِّب لاحقًا لدى Microsoft، ويُستضاف على Foundry، وأوزانه غير موزَّعة ولا يُقدَّم أي مسار للضبط الدقيق.

إن كون النموذج ثنائي الاتجاه مقابل مفكك التشفير هو الحقيقة المعمارية التي تحدّد كيفية تصرّف كل واحد منهما، وهي أيضًا سبب كون أعداد المعاملات مجرد مصدر تشتيت. فالمُشفِّر ثنائي الاتجاه يقرأ الحالة بأكملها دفعة واحدة، وهو الشكل الصحيح لإصدار حكم على مُدخل ثابت؛ أما مفكك التشفير المُدرَّب تدريبًا لاحقًا فيتخلى عن مسار التوليد لكنه يحتفظ بالمُرمِّز، والنافذة، والتغليف المؤسسي الذي يأتي مع النشر عبر Foundry. لا يمثل أيٌّ منهما نسخة موسَّعة من الآخر، ولا يمكن استبدال أحدهما بالآخر مهما كانت طريقة قراءة جدول المعايير.

ما الذي تجنيه فعليًا من قائمة المدخلات

هنا يتباعد d1-omni-600M إلى أقصى حد عن كل ما عداه في هذه الفئة، وهنا يجب قراءة ادّعاء ما بعناية.

• الكلام: يقبل Liquid AI d1-omni-600M نصًا بالإضافة إلى ما يصل إلى 30 ثانية من الكلام ويصدر قرارًا بناءً عليه، وهو ما لا يستطيع أي مُقيِّم نصي خالص فعله عند أي مستوى من الدقة. أما الأنماط غير النصية لدى Microsoft-Decision-1 فهي غير موجودة.

• الاستبعاد المتبادل — يرفع d1-omni-600M ValueError إذا وصلت الصور والصوت في الطلب نفسه. لا يزال أوسع سطح استشعار في الفئة محصوراً في وسيلة واحدة غير نصية في المرة الواحدة، وهو قيد حقيقي على مكتب المطالبات ذاك.

• الاقتطاع — تذكر بطاقته 16,384 موضعًا مشتركًا للنص والصورة والصوت، وتضيف أنه عند وجود الصور يُقتطع نص الحالة والسؤال إلى 896 رمزًا لتتوافق مع التدريب. أي مستند ترفق به صورة يتنافس مع ذلك الاقتطاع. رموز Microsoft-Decision-1 البالغة 32,768 كلها نصية ولا تخضع للاقتطاع.

• الصيغ — لدى d1-omni-600M ثلاثة أنواع من الأسئلة: noul لقرار ثنائي يُعيد P(yes) بين 0 و1، choice لوسم واحد من مجموعة تسمّيها مع درجة ثقة واحتمال لكل خيار، و score لموضع على مقياس مرتّب من مستويين إلى عشرة مستويات مع توزيعه. تتفرع عدة أسئلة عن حالة واحدة وتُقرأ من تمريرة واحدة، ويُبلغ عدّاد الاستخدام عن output_tokens: 0. توثّق Microsoft أشكال نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، ومعايير التقييم، إضافةً إلى خيار امتناع مدعوم صراحةً مثل "لا يمكن الجزم" عندما تكون الأدلة غير كافية — وهو التفصيل التصميمي الوحيد في صفحة Microsoft الذي لا نظير مباشر له هنا.

• وقت التشغيل — d1-omni-600M يأتي مع رمز مخصص، ويحتاج إلى trust_remote_code=True، وتوصي بطاقتها بـ float16 على وحدة معالجة الرسوميات مع التحذير من أن bfloat16 غيّر أعلى إجابة في بعض الصفوف. هذه حساسية وقت الخدمة موثقة من قبل البائع، وليست عيبًا. Microsoft-Decision-1 هي نقطة نهاية مُدارة حيث يكون شكل النشر هو المتغير الوحيد في وقت التشغيل لديك، ومن الجدير بالذكر أن الاستدلال المجمع معطّل: لا توجد قناة غير متصلة لاستيعاب تكلفة تشغيل تقييم مجمّع من خلالها.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

فجوة الأدلة، في كلا الاتجاهين

نشرت Liquid AI عائلة d1 المفتوحة، بما في ذلك d1-omni-600M، في 7 أكتوبر 2026 مع منشور إصدار ومجموعة توثيق. وما لم يُنشر هو الرقم الذي من شأنه أن يجعل ادعاء تعدد الوسائط ملموسًا. لا يوجد معيار دقة خاص بقدرتها الرئيسية المعلنة — جودة قرار الرؤية والصوت التي تبرر مشفّري 94M و112M — كما أن تقسيم الرؤية محجوب من مواد التقييم المنشورة. ولا يُنشر أي رقم لزمن الاستجابة أيضًا، لذا فإن معدل إنتاجية النموذج شيء تكتشفه على عتادك الخاص.

موقف مايكروسوفت متطابق بنيويًا ومتقدّم بخطوة واحدة. تُسمّي علامة التبويب Benchmarks الخاصة به المقاييس — الدقة، وخطأ المعايرة، واستدعاء السلامة، ومعدلات الإيجابيات الكاذبة، واتساق العدالة — وتذكر أن التقييم جرى على معايير قرارات عامة ومجتمعية بالإضافة إلى مجموعات اختبار داخلية محجوزة لم تُستخدم في التدريب، وأن ترتيب الخيارات تم تغييره، وأن اختبارات إحصائية مقترنة طُبقت، وتزعم أن النموذج «يؤدي على قدم المساواة مع نماذج القرار الرائدة ومتقدمًا على غيره من نماذج القرار المفتوحة التي قُيّمت بالمنهجية نفسها». لكنها لا تنشر أيًا من النتائج. تُدرَج خمس وعشرون لغة كمدعومة، منها اليابانية والكورية والعربية والفيتنامية والتايلاندية والتركية والهندية والبنغالية والسواحيلية والعبرية والفارسية والأوكرانية، مع تحذير صريح بأن التغطية والجودة والمعايرة «قد تتفاوت حسب اللغة» وأن غير الإنجليزية، وخاصة اللغات ذات الموارد الأقل، نقطة ضعف. التسعير ليس على صفحة النموذج أيضًا؛ بل يربط إلى واجهة التسعير الخاصة بمايكروسوفت.

إذن، فالمقارنة بين هذين ليست مقارنة بين دليل ودليل. إنها اختيار بين نوعين من الأرقام المفقودة. فقد أطلقت Liquid AI سطح الاستشعار وتركت دقة ذلك السطح دون قياس علني. وأطلقت Microsoft مسار الشراء — مصادقة Azure، والحوكمة، وتقييم Responsible AI، ومنهجية موثّقة — وتركت معايرة منتج احتمالي دون تحديد كمّي.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

سؤال المعايرة الذي لا يجيب عنه أيٌّ منهما.

بالنسبة لنموذج قرار، الاحتمال هو الناتج. كل ما يأتي بعد ذلك هو عتبة: 0.7 تصعّد، 0.95 تقبل تلقائيًا، وتُدفع تكلفة رسم هذا الخط بشكل خاطئ في قرارات آلية سيئة بدلاً من الرموز. في هذه الفئة، هناك على الأقل عائلة واحدة تنشر الأرقام — نقاط تفتيش Intern-Decision من InternLM تطبع أرقام Brier وخطأ المعايرة المتوقع على بطاقات نماذجها — ولا يفعل أي من النموذجين في هذه المقالة ذلك. هذا التفاوت هو السبب العملي لإبقاء المجال واسعًا بدلاً من الالتزام بالمعمارية وحدها.

الخبر السار هو أن الاختبار رخيص ولا يتطلب تعاون المورّد. اجمع بضع مئات من الحالات الموسومة التي تشبه حركة البيانات الحقيقية لديك، واكتب مخطط الأسئلة الذي سيرسله تطبيقك فعلاً، وشغّل كلا النموذجين عليها، واحسب خطأ المعايرة المتوقع على المخرجات. عندئذ ستعرف أمرين لا يعرفهما حالياً أحد خارج المورّدين: مدى انعكاس احتمالات Microsoft-Decision-1 لدقتها على توزيعك، وما إذا كانت مسارات الصوت والصورة في d1-omni-600M تستحق المشفّرات التي تحملها. وتشير إرشادات مايكروسوفت الموثقة نفسها في الاتجاه ذاته — تحقّق على بيانات تمثيلية، وحدّد العتبات استناداً إلى تكلفة أخطائك، وأدرج دائماً خيار الامتناع، وعشوِّ ترتيب الخيارات، وأبقِ إنساناً في الحلقة بالنسبة للقرارات ذات العواقب.

إلى أين ينتمي كل منها، وإلى أين ينتمي OrcaRouter

ينتمي Microsoft-Decision-1 إلى أي سياق تكون فيه المادة الحاسمة نصًا والعائق هو المشتريات: مستند طويل، أو مقطع مسترجَع، أو استدعاء أداة مقترَح، أو إجابة مولَّدة تُقيَّم وفق معيار، مع مصادقة Azure وفوترة موحدة وتقييم للمورّد لا بد منه قبل أن يصل أي شيء إلى مرحلة الإنتاج. وهو الأداة الأضيق نطاقًا والأسهل في الحصول على الموافقة.

ينتمي Liquid AI d1-omni-600M إلى كل موضع تكون فيه المادة الحاسمة غير نصية — صورة مرفقة بنموذج، أو تسجيل قصير لمكالمة، أو لقطة شاشة — وإلى كل موضع تريد فيه أوزان lfm1.0 التي يمكنك تشغيلها وضبطها الدقيق داخل حدود تتحكم بها. إنه الأداة الأوسع والأصعب في التحقق منها، لأن ادعاء تعدد الوسائط هو بالضبط الجزء الذي لا يقف خلفه أي معيار منشور.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

لا هذا ولا ذاك في كتالوجنا، ولا شيء هنا يمثل ادعاءً بتوفّر أيٍّ منهما. النموذج الذي يعيد احتمالات بدلًا من نص ليس شيئًا توجّه إليه إكمالات الدردشة، والبقاء خارج مقعد التقييم هو كامل تصميم الأداة. ما تحمله OrcaRouter هو الجانب التوليدي من الحلقة نفسها: أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI تكتب المعيار الذي يقيّم المقيّم وفقه، وتنسخ المادة أو تلخّصها قبل أن تصبح حالة، وتصدر استدعاء الأداة الذي يوافق عليه المقيّم قبل تشغيله. يُمرَّر سعر قائمة المزوّد بـهامش ربح 0%، لذا فإن تخفيض سعر من المورّد على الجانب التوليدي يصبح ساريًا لدينا في اليوم نفسه. يبقي التحويل التلقائي عند الفشل ذلك الجانب حيًا عندما يتدهور مزوّد واحد — وهو ما يلاحظه فورًا أي مسار معالجة يقيّم كل مستند مسترجع — وإذا أردت أن يُقيَّم عدة كتّاب بدلًا من واحد، فإن DSL التوجيه يجمعهم في استدعاء واحد، ويُبلّغ دمج النماذج عن توافقهم كحقل يستطيع المقيّم قراءته مثل أي حقل آخر.

الخلاصة

وصل Microsoft-Decision-1 إلى الإتاحة العامة على Microsoft Foundry في 8 أكتوبر 2026: نصي فقط، و32,768 رمزًا، ومبني على Qwen3.5-9B خضع لتدريب لاحق، ومستضاف دون أوزان، ولا سعر على صفحة النموذج، ولا رقم لزمن الاستجابة، وقسم اختبارات معيارية يصف منهجيته دون نشر أي نتيجة. رُفع Liquid AI d1-omni-600M في 7 أكتوبر 2026 كنموذج قرار بمشفّر ثنائي الاتجاه بحجم 587M يقرأ النص أو الصور أو 30 ثانية من الكلام — نمط واحد غير نصي في المرة، مع تقليص النص إلى 896 رمزًا عند وجود الصور — بموجب ترخيص lfm1.0، دون معيار دقة لقدرته الرئيسية، ولا تقسيم منفصل للرؤية، ولا زمن استجابة منشور. اختر بناءً على النمط والتحكم لا على الدرجات، لأن الدرجات غير موجودة: إذا كانت مادتك صورة فوتوغرافية أو مكالمة هاتفية، فواحد فقط منهما يستطيع الإجابة، وإذا كان مستندًا من أربعين صفحة يحتوي على نص فقط، فالآخر وحده يستطيع الإجابة.

ما يحمله OrcaRouter هو الجانب التوليدي من الحلقة نفسها: أكثر من 200 نموذجخلف مفتاح واحد متوافق مع OpenAI، تكتب معيار التقييم الذي يقيّم مُقيّمك بناءً عليه، وتنسخ أو تلخّص المادة قبل أن تصبح حالة، وتُصدر استدعاء الأداة الذي يوافق عليه مُقيّمك قبل تشغيله.