بطاقة عنوان مُولَّدة لمقارنة بين Decision 3.0 وIntern-Decision-4B، بعنوان فرعي «القاعدة نفسها Qwen3.5-4B، إجابتان مختلفتان»، مع شرائح نصية تقول «26 سبتمبر مقابل 10 أكتوبر»، و«فيديو مقابل صور فقط»، و«Brier منشور مقابل غير منشور»، وتذييل نصه «أرقام Decision 3.0 هي أرقام vLLM-SR الخاصة به؛ وأرقام Intern-Decision-4B هي أرقام InternLM الخاصة به؛ ولم يُعِد أحد إنتاج أيٍّ منها بشكل مستقل.» وشعار OrcaRouter مُركَّب في الزاوية السفلية اليمنى.
Engineering & Research

Decision 3.0 مقابل Intern-Decision-4B: فريقان ضبطا النموذج نفسه ضبطًا دقيقًا واختلفا في كل شيء آخر

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ضع d3-mini، العضو 4B من Decision 3.0، بجانب Intern-Decision-4B وأول ما تلاحظه ليس اختلافًا. كلاهما نتيجتا ضبط دقيق لنفس نقطة التفتيش الأساسية، Qwen3.5-4B. كلاهما مُدرج عند 4.54 مليار معامل. كلاهما يستقبل حالة، ومخططًا لأسئلة مُسمّاة، ومجموعة من الإجابات المرشّحة، ويعيد احتمالًا مُعايرًا لكل مرشح دون توليد رمز. كلاهما Apache-2.0. أُطلق كلاهما دون إعلان — فقد رفعت InternLM ثلاث نقاط تفتيش خلال أربعين ثانية في 26 سبتمبر 2026، ووصلت عائلة Decision 3.0 التابعة لـ vLLM-SR إلى Hugging Face في 10 أكتوبر 2026، ولم يحمل الخبر سوى حساب X الخاص بمشروع vLLM.

كل ما يأتي بعد ذلك هو خلاف. فهم يختلفون حول كيفية قراءة احتمال من النموذج، وحول ما إذا كان الفيديو يُحتسب كمدخل، وحول المدة التي قد يستغرقها الطلب، والأكثر حدةً، حول ما إذا كان الفريق على استعداد لنشر الرقم الذي يقول إن ثقته بنفسه موثوقة. يتناول هذا المقال تلك الخلافات الأربعة وما يكلّفك كل واحد منها، لا أي النموذجين "أفضل"، لأن الاثنين لا يُقاسان على المقياس نفسه ولا يمكن ترتيبهما أحدهما مقابل الآخر دون القيام بعمل لم يقم به أيٌّ من المورّدين.

الصدفة التي تستحق الفهم أولاً

اختيار مختبرين لنفس العمود الفقري 4B خلال أسبوعين ليس مفاجئًا تمامًا — Qwen3.5-4B هو قاعدة معقولة لنموذج ذي مخرجات منظمة، ومن الواضح أن كلا الفريقين اختاره لأنه صغير بما يكفي للتشغيل بتكلفة زهيدة وقوي بما يكفي لقراءة التعليمات. المفاجئ هو أنهما وصلا إلى نفس عدد المعلمات بدقة أربعة أرقام معنوية. هذا يخبرك أن الضبط الدقيق حافظ على البنية، وأن أياً منهما لم يضف برج رؤية منفصلاً كبيراً بما يكفي لتغيير الإجمالي. كلاهما يدمجان قدرتهما متعددة الوسائط في نفس الأوزان.

الجزء المثير للاهتمام هو القراءة. كلا النموذجين يجيبان عن الأسئلة بالطريقة نفسها من حيث المبدأ — إذ يقيّمان الإجابات المرشحة بدلاً من توليدها — ويختلفان تمامًا في الآلية:

• Intern-Decision-4B — يربط كل خيار برمز توكن واحد (A–Z، ثم a–z، ثم 0–9)، ويُصيّر هيكل JSON في المطالبة مع عنصر نائب لكل حقل، ويشغّل تمريرة أمامية سببية واحدة، ويقرأ اللوغيتات عند الموضع الذي يسبق كل عنصر نائب مباشرةً. الآلية موثّقة خطوة بخطوة على بطاقة النموذج الخاصة به، بما في ذلك خطوة softmax ودرجة الحرارة الدقيقتين.

• d3-mini — يوفّر بنية مخصّصة في modeling_d3.py مع رأس قراءة منفصل في ملفه الخاص readout.safetensors، decision_config.json يعلن noncausal_full_attention وتجميع الرمز الأخير، وتعيين من الرمز إلى الكود محدد في الإعدادات بدلاً من وصفه في النثر.

لا يبدو أي من النهجين أفضل بوضوح. يتميز مسار InternLM بأنه يعمل على فئة نموذج Hugging Face جاهزة مع تسلسل رقمي موثّق — يمكنك التحقق من عمله. ويتميز مسار vLLM-SR بأن المخرَج عبارة عن رأس مدرَّب بدلًا من إسقاط لتضمين رمز موجود، وهو ما يمنح ملاءمةً أكثر حرية، والثمن هو أنه يجب عليك trust_remote_code=True وتشغيل شفرتهم لفعل أي شيء على الإطلاق.

الحدود التي ينشرها كل واحد

هنا يبدأ تفضيل حقيقي في التشكّل، لأن إحدى البطاقتين أكثر تحديدًا بكثير من الأخرى بشأن النقطة التي تتوقف عندها عن العمل.

• سقف الإدخال — Intern-Decision-4B: 8,192 رمزًا افتراضيًا، والطلبات التي تتجاوز ذلك تُرفض رأسًا، ولا تُقتطع أبدًا، مع تحديد السقف عبر وسيطة مُنشئ. d3-mini: max_length هي null في الإعداد المُشحون، ولا يظهر أي حد للرموز في أي مكان على البطاقة.

• الأسئلة لكل طلب — Intern-Decision-4B: من 1 إلى 16، بحد أقصى معلن يبلغ 62 خيارًا في أي سؤال واحد. d3-mini: لا يوجد حد معلن؛ تقول البطاقة فقط إن الأسئلة يُجاب عنها معًا، وكل منها من تمريرته الأمامية الخاصة.

• الصور — Intern-Decision-4B: حتى ثمانٍ لكل طلب، مرتبة حسب قائمة تقدمها، مع قيام معالج نقطة التحقق بتغيير الحجم وتوسيع الرموز. d3-mini: عدة صور لكل طلب كمسارات، أو عناوين URL، أو صور PIL، أو عناوين URL لبيانات base64، تُقرأ كل واحدة بدقة تصل إلى 1.6 ميغابكسل، بحيث يرى كل سؤال كل صورة.

• فيديو — Intern-Decision-4B: لا شيء. d3-mini: فيديوهات متعددة، تُقرأ بمعدل إطارين في الثانية، بحد أقصى 32 إطارًا موزعة على المقطع و0.2 ميجابكسل لكل إطار.

سقف الإدخال هو السطر الذي سيحسم هذا الأمر بالنسبة لمعظم الناس. ميزانية 8,192 رمزًا موزعة بين الحالة وتعليمات السؤال وأوصاف المرشحين قيد حقيقي على أعمال تصنيف المستندات والتوجيه طويل السياق التي تُسوَّق هذه النماذج من أجلها، ويستحق InternLM الثناء لأنه قال ذلك بوضوح بدلًا من تركه ليُكتشف. أما vLLM-SR فتركه غير معلن هو العكس: ليس حدًا خفيًا، بل حدًا مجهولًا، ولا يفضّ أي قدر من قراءة المستودع هذا الأمر.

المعايرة هي الانقسام الحقيقي

كل نموذج قرار يقدّم الوعد نفسه: الرقم الذي يعيده هو احتمال، والعتبات المضبوطة مقابله لها معنى. ولا يكاد أيٌّ منها يثبت ذلك. هنا يتباعد الإصداران أكثر ما يتباعدان، ويسير هذا التباعد في الاتجاه المعاكس للاتجاه الذي قد تستنتجه من تواريخ الإصدار.

ينشر Intern-Decision-4B، على بطاقته الخاصة، درجة Brier مقدارها 0.347 وخطأ معايرة متوقع (ECE) قدره 0.065 في المتوسط عبر معاييره السبعة، ودرجة حرارة مُلائَمة مقدارها 1.99241824 مستخرجة عبر تصغير NLL على 1,728 حالة معايرة مُخصَّصة مع 1,693 حالة تحقق منفصلة، وبيانًا صريحًا بأن تسميات مجموعة الاختبار لم تُستخدم لاختيار تلك الدرجة الحرارية، وتشخيصًا من 96 حالة يُظهر انتقال معايرته من 0.628 Brier / 0.213 ECE قبل تحجيم الحرارة إلى 0.550 / 0.089 بعده. كما يذكر الإعداد الافتراضي ويقول إن المعايرة لكل نقطة تفتيش، لذا لن يتطابق استخدام حجم آخر مع هذه الوحدة.

ينشر Decision 3.0 مؤشر دقة وادعاء تغطية — تمت الإجابة عن كل واحد من 140,178 طلبًا عامًا، ولا يوجد أي منها غير مدعوم — ولا يوجد أي رقم معايرة على الإطلاق. لا يوجد مقياس Brier، ولا ECE، ولا درجة حرارة معلنة، عند أي من نقاط التفتيش الست.درجة الحرارة في d3 المشحون، الملف decision_config.json هي 1.0، وهي دالة الهوية وقد تكون أو لا تكون القيمة المُلاءَمَة؛ ولا يذكر الملف ذلك.

اقرأ عنواني المؤشر جنبًا إلى جنب، فيزداد عدم التماثل سوءًا. تُبلغ بطاقة d3-mini عن درجة 54.90 في Jev Decision Index 0.3 public-suite، موصوفة بأنها قيست باستخدام الطقم الرسمي على الأوزان المنشورة، بينما تُوصف صفوف المقارنة على اللوحة نفسها بأنها بيانات لوحة حية. تُبلغ Intern-Decision-4B عن متوسط 90.02 عبر معاييرها السبعة الخاصة. هذان الرقمان ليسا على المقياس نفسه، ولا يستخدمان المهام نفسها، ووضعهما في جملة واحدة على سبيل المقارنة سيكون غير أمين. ما يمكن مقارنته هو الإفصاح: بطاقة واحدة تخبرك بمدى خطأ درجات ثقتها، والأخرى لا تعرف أو لا تريد أن تقول.

A generated two-column scoreboard headed 'Decision 3.0 d3-mini vs Intern-Decision-4B - the scoreboard'. The left column for d3-mini reads: base model Qwen3.5-4B fine-tuned, 4.54B parameters; input ceiling not stated on the card; video input yes, up to 32 frames at 2 fps; calibration figures none published; reported score Jev Decision Index 0.3 public suite 54.90; latency median 17.5 ms text and 96.2 ms image. The right column for Intern-Decision-4B reads: base model Qwen3.5-4B fine-tuned, 4.54B parameters; input ceiling 8,192 tokens, rejected not truncated; video input none, images only up to eight; calibration Brier 0.347, ECE 0.065 and temperature 1.99241824; reported score 90.02 seven-benchmark average; latency mean 44.16 ms and median 44.03 ms on one RTX 4090. A footer reads 'd3-mini figures are vLLM-SR's own; Intern-Decision-4B figures are InternLM's own; neither is independently reproduced.'

زمن الاستجابة، ولماذا مجموعتا المللي ثانية غير قابلتين للمقارنة أيضًا

تنشر كلتا البطاقتين زمن الاستجابة لكل طلب، وسيكون أخذُهما على ظاهرهما خطأً للسبب نفسه الذي يجعل أرقام الدقة غير قابلة للمقارنة.

• Intern-Decision-4B — المتوسط 44.16 مللي ثانية، والوسيط 44.03 مللي ثانية، والقيمة المئوية 95 تبلغ 44.60 مللي ثانية، مقيسة على بطاقة RTX 4090 واحدة عبر مسار Hugging Face المحلي، ويُوصف بأنه يعتمد على حجم العمل والعتاد.

• d3-mini — وسيط 17.5 مللي ثانية للنص، و96.2 مللي ثانية مع صورة، و371.5 مللي ثانية مع فيديو مدته عشر ثوانٍ، على وحدة AMD Instinct MI325X واحدة، وطلب واحد في كل مرة.

هناك أمران يجعلان هذين غير قابلين للمقارنة. الأول هو العتاد ومسار البرمجيات: بطاقة 4090 مقابل MI325X، وتمريرة أمامية قياسية من Hugging Face مقابل تنفيذ انتباه مخصّص مزوّد بنوى الطبقات المقنّعة متاحة عبر flash-linear-attention. والثاني هو عبء العمل: يُوصَف رقم InternLM بأنه من طرف إلى طرف لكل استعلام على مزيج غير محدد، بينما رقم vLLM-SR مفصَّل حسب وسيط الإدخال، لذا فالمقارنة النصية فقط هي البند الوحيد القابل للمقارنة المباشرة، وحتى ذلك يمتد عبر مورّدَي GPU.

الرقم الذي يجب أخذه من كلتا البطاقتين ليس الترتيب، بل الشكل. يُستدعى نموذج القرار مرارًا وتكرارًا داخل سير عمل واحد — قد يحتاج سجل الدعم إلى وجهة، وفحص استرداد، وقرار تصعيد، ودرجة أولوية، أربعة أسئلة، وتحوّل دفعة من 128 سجلًا ذلك إلى 512 قرارًا. عند هذا الحجم، يختفي كل من 17 ms و44 ms بجانب ما يكلّفه النموذج التوليدي في المراحل اللاحقة أيًا كان. الأرقام المعتمدة على نمط الوسائط هي التي يجب مراقبتها، لأن طلب صورة أو فيديو يبلغ ما بين خمسة أضعاف وعشرين ضعفًا تكلفة طلب نصي وفق أرقام d3-mini نفسها، وإذا كان قرارك يُتخذ بناءً على لقطة شاشة فقد استوردت ملف تكلفة لا تملكه معظم عمليات نشر نماذج القرار.

أيّ واحد تختار فعليًا

إذا كان القرار الذي تحتاج إلى اتخاذه يعتمد على فيديو، فلا مجال للمنافسة ولا حاجة إلى أي تحليل: Decision 3.0 يقرأ الفيديو بينما Intern-Decision-4B لا يفعل. هذا هو الجواب الكامل لأي شيء يتضمن تسجيلات الشاشة أو مقاطع الكاميرا أو تسلسلات الإطارات، وهي فجوة القدرات التي تبرر وجود العائلة الأحدث بحد ذاتها.

إذا كانت مدخلاتك نصًا وصورًا من حين لآخر، فإن الاختيار يتوقف على أمرين، وليس أيٌّ منهما هو لوحة الصدارة.

خذ Intern-Decision-4B عندما تحتاج إلى التفكير في العتبات. إنه الوحيد من بين الاثنين الذي يخبرك ما إذا كانت 0.9 تعني تسع مرات من أصل عشر، ويسمي درجة حرارته، ويذكر الحالات التي تم فيها ملاءمة درجة الحرارة تلك، ويوثق استدلاله كإجراء مرقم قصير يمكنك إعادة تنفيذه مقابل فئة نموذج جاهزة. بالنسبة لمقيّم يقف أمام إجراء آلي، هذه هي الخاصية المهمة، وهي أندر من نقاط الدقة.

اختر Decision 3.0 عندما تحتاج إلى المدى أو الوسائط. ست نقاط تحقق من 0.59B إلى 26.09B تعني أن صيغة الطلب نفسها يمكن أن يخدمها نموذج طرفي بزمن 6.7 ms ونموذج بحجم 27B، كما تشترك العائلة في واجهة واحدة، لذا فإن الانتقال بين الطبقات تغيير في الإعدادات وليس إعادة كتابة. المشكلة أنك تثق بميزانية إدخال غير معلنة وادعاء معايرة غير مُدقّق، وأكبر نموذج في العائلة هو النموذج الذي قاس المورّد رقم مؤشره على أداة الاختبار الخاصة به.

لا يُعد أيٌّ منهما خيارًا افتراضيًا آمنًا اليوم. نقطة التحقق الأكثر تنزيلًا الخاصة بـ d3 موجودة على Hugging Face منذ حوالي يوم؛ أما Intern-Decision-4B فقد مضى على طرحه أسبوعان وجذب نحو 3,200 عملية تنزيل و83 إعجابًا، وهذا انتباه لا حركة إنتاج. كلاهما رخيص بما يكفي لاختباره، ولا يقف خلف أيٍّ منهما تقييم من طرف ثالث. إذا كنت تضع مُقيِّمًا أمام شيء ينفق المال، فالخطوة الصحيحة هي تشغيلهما على حالاتك الموسومة ومقارنة منحنيات المعايرة، لا صفوف المؤشر.

A screenshot of the Intern-Decision-4B model card on Hugging Face. The header shows 83 likes, 1.34k followers and tags for Image-Text-to-Text, Transformers, Safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational under an Apache-2.0 licence, with the model size listed as 5B parameters in F32 or BF16 and the base model pinned to Qwen/Qwen3.5-4B. A section titled 'How inference works' lists five numbered steps: map each question's options to single-token symbols A to Z then a to z then 0 to 9; render the state, decision schema and a JSON skeleton with one decision placeholder per field; run one causal forward pass and read logits immediately before each placeholder; take a softmax over the allowed candidate-symbol logits and apply the checkpoint's probability calibration; and map symbols back to the original option values. It states that the API never calls generate() and samples no free-form text. A benchmark results table below carries Jevbench Easy, Jevbench Original, Jevbench Hard, Typed Decision, ToolACE, AG News and WildJailBreak columns for the Jev, Laya, Semif and Kev rows. The sidebar reports 3,179 downloads last month.

أين يندرج جهاز التوجيه، بصراحة

لا يضم OrcaRouter أيًا من هذين النموذجين. نقاط التحقق الخاصة بـ Decision 3.0 هي مسار استدلال Python محلي في مستودع Hugging Face دون أي نقطة نهاية HTTP منشورة، ويُتاح Intern-Decision-4B كصنف DecisionEngine تقوم بإنشائه بنفسك. لا يمكننا توجيه أي منهما اليوم، ولا ينبغي قراءة أي جزء من هذه المقالة على أنه ادعاء بالتوفر.

ما نوفّره بالفعل هو الطرف المستضاف من العائلة نفسها. typesafe/jev-1.13 موجود في كتالوجنا، ويُقدَّم عبر POST /v1/systemone — العقد نفسه الخاص بالحالة والأسئلة المسمّاة الذي يطبّقه كلا النموذجين المفتوحين المذكورين أعلاه — بتكلفة $0.042 لكل مليون رمز إدخال، دون أي رسوم على الإكمال، لأنه لا يولّد أي إكمال. وهو يجلس إلى جانب أكثر من 200 نموذج آخر، وهذه هي النقطة العملية لأي شخص يقارن بين هذين: أداة التقييم هي الجزء الرخيص من الحلقة، والنموذج الذي يتصرّف بناءً على القرار هو الجزء المكلف. توجيه كليهما عبر مفتاح واحد، مع تجاوز الأعطال تلقائياً عند تعثّر مزوّد، وتمرير سعر القائمة لدى المزوّد بهامش ربح 0%، يعني أن تقييم نموذج قرار لا يتطلب توقيع عقد ثانٍ أو إعادة كتابة موضع الاستدعاء عند تبديل الواجهات الخلفية. إذا كنت في منتصف التقييم — وهو الموضع الذي يوجد فيه كلا هذين النموذجين اليوم — فهذا هو الجزء الذي يستحق الإعداد قبل أن تلتزم بأي منهما.

A screenshot of the OrcaRouter model page for Jev 1.13. The header reads 'Jev 1.13', by TypeSafe, dated 2026-09-24, tagged NEW, with a specification panel reading 65K tokens of context, text input, text output and a p50 time-to-first-token of 176 ms, and the endpoint listed as /v1/systemone. The description says it is TypeSafe's structured decision and evaluation model, given a state and a set of named questions (noul / choice / score), returning a structured answer for each, served via POST /v1/systemone, non-streaming, up to about 64K input tokens, text in and structured JSON out. The metric strip reads input /bin/bash.04 per 1M tokens, no output price, p50 TTFT 176 ms, p95 TTFT 423 ms and 59.3M tokens of traffic over 7 days. Buttons read 'Get the Jev 1.13 API' and 'Try in playground', and a code sample shows a POST to https://api.orcarouter.ai/v1/systemone with the model typesafe/jev-1.13 and a state plus noul, choice and score questions.

السؤال المفتوح

تختلف البطاقتان حول ما يدين به مؤلف النموذج للقارئ، وهذا الخلاف أكثر إثارة للاهتمام من النموذجين أنفسهما. نشرت InternLM درجة حرارة والحالات التي ضُبطت عليها، ثم نشرت التشخيص الذي يوضح مقدار تحسّن المعايرة. ونشرت vLLM-SR تجزئات الملفات، ومراجعات أساس مثبّتة، وهدف عتاد معلن، وادعاء تغطية — عمل حقيقي في توثيق المصدر — ولا رقم معايرة على الإطلاق.

إن الاختبار الذي يحدد أي إصدار ينضج ليس أيّها يفوز على لوحة، بل ما إذا كانت نقطة التحقق Decision التالية تُشحن حاملةً درجة Brier، وما إذا كان التحميل التالي لـ InternLM يصل إلى الفيديو. كلا الأمرين مرئي من الخارج، وكلا الأمرين رخيص الفحص، ولم يحدث أيٌّ منهما بعد.