بطاقة عنوان مُولَّدة تحمل النص 'FrogNano-4B-2609 مقابل Intern-Decision-4B'، مع عنوان فرعي يقول 'السلف Qwen3.5-4B نفسه، ومُخرَجان متعاكسان'، وثلاث شرائح نصّها 'استدعاءات الأدوات والتصحيحات'، و'رمز واحد لكل حقل'، و'لم يُقيَّم أيٌّ منهما بشكل مستقل'، وتذييل يقول 'كلا لوحتي النتائج مُبلَّغ عنهما من المورّد؛ لم يُعِد أي طرف ثالث إنتاج أيٍّ منهما'، وشعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Guides & Insights

FrogNano-4B-2609 مقابل Intern Decision 4B: نموذج أساسي واحد، رهانان مختلفان تمامًا

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أخذ مختبران نقطة التحقق ذاتها، Qwen3.5-4B، ودفعاها في اتجاهين لا يشبه أحدهما الآخر. microsoft/FrogNano-4B-2609دُرِّب لاحقًا بالتعلم المعزز على نحو 1,500 بيئة هندسة برمجيات اصطناعية حتى صار قادرًا على إخراج استدعاءات أدوات مهيكلة وتصحيحات متعددة الملفات عبر منظومة من خمس أدوات. internlm/Intern-Decision-4Bخضع لضبط دقيق كي لا يُصدر أي نص على الإطلاق — فهو يتلقى حالة، إضافة إلى مخطط لأسئلة مسمّاة، ويُعيد احتمالًا معايرًا لكل خيار في تمريرة أمامية واحدة. أحدهما يكتب الشيفرة. والآخر يرفض كتابة أي شيء ويُعيد توزيعًا. مقارنتهما من حيث الجودة بلا معنى؛ أما مقارنتهما من حيث ما يكلفك تشغيلهما وما يمكن الوثوق به فيهما فهي التمرين الصادق.

صدر كلاهما دون إعلان، وهذا هو الشيء الآخر الذي يجمعهما. لا يملك أيٌّ منهما مدخلًا في Artificial Analysis، ولا تقييمًا في الساحة، ولا تقييمًا مستقلًا واحدًا. كل رقم أدناه — سلّم SWE-bench من جهة، وصفوف معايرة Brier وECE من جهة أخرى — أنتجه المختبر الذي درّب النموذج، على منصة الاختبار الخاصة بذلك المختبر، ولم يلتقِ قط بمجموعة اختبار لم يأتِ منها.

حدث التفرع قبل وجود أيّ من النموذجين.

نقطة التحقق الأساسية هي نموذج هجين كثيف مكوّن من 32 طبقة يجمع بين Gated DeltaNet والانتباه البوابي، وكلا النموذجين المشتقين يرثان هيكله. بعد ذلك، لا يوجد أي قاسم مشترك بين خطي أنابيب التدريب اللاحق.

خط أنابيب Microsoft هو حلقة مغلقة. يولّد TaskPilot مهام مستودعات مرشحة من لقطات حقيقية، ويشغّل عمليات rollout من نقطة التحقق الحالية للعثور على المهام التي تحلها السياسة أحيانًا، ويحتفظ بها، ثم يدرّب. خمس تكرارات، كل منها معاير مقابل سياسة التكرار السابق، لتنتهي عند 61.5% على SWE-bench Verified و37.6% على SWE-bench Pro. لا تقطير — تنص البطاقة على أنه لم تُستخدم أي مسارات أو إجراءات أو آثار استدلال من نماذج أقوى كأهداف.

إنّ خط أنابيب InternLM هدفٌ إشرافيّ واحد على شكل مهمة ثابت. يُمنَح النموذج مطالبة نظام، وحالة، ومخطط قرار، وهيكل JSON مساعد كامل مع عنصر نائب واحد لكل حقل. وهو يُجري تمريرة أمامية سببية واحدة، ويقرأ اللوغيتات عند موضع كل عنصر نائب، ويطبّق softmax على رموز المرشحين المسموح بها لذلك الحقل فقط. وتقول بطاقة InternLM ذلك صراحةً: إن هذا المسار "لا يستدعي generate() أو يأخذ عيّنات من نص حر."

هذا الفرق ليس فرقًا في الحجم. إنه فرق في ماهية الأثر نفسه. FrogNano-4B-2609 وكيل يمكن أن يخطئ بمئة طريقة مثيرة للاهتمام، ويمكن تصحيحه عبر الاختبارات. Intern-Decision-4B مُقيِّم نمط فشله رقم واثق.

عقدان، وليس أيٌّ منهما «إرسال مُوجِّه»

عقد FrogNano عبارة عن حلقة. يُصدر النموذج استدعاءات إلى Read، Write، Edit، Glob وBash؛ ينفّذها إطار Leaf داخل بيئة صندوقية لمستودع معزول ويعيد المخرجات؛ وتستمر الحلقة حتى يتوقف النموذج عن الاستدعاء. أُجريت التقييمات عند 150 خطوة ضمن ما يقارب 131 ألف رمز إجمالي، مع ما يصل إلى 8,192 رمزًا مولّدًا لكل دور من أدوار المساعد. تحتاج الخدمة إلى SGLang مع محلل استدلال Qwen3 ومحلل استدعاءات أدوات Qwen3 coder — وإذا أخطأت في ذلك، ينتج النموذج نثرًا حيث يتوقع الإطار JSON، وهو ما يبدو من الخارج تمامًا كنموذج معطوب.

عقد Intern-Decision-4B هو محاولة واحدة بحدّ صارم. تحتفظ الأسئلة والخيارات بترتيبها. تُربط الخيارات برموز من توكن واحد — A حتى Z، ثم a حتى z، ثم 0 حتى 9، وهو السبب الحسابي في أن السؤال يبلغ حده الأقصى 62 خيارًا. سقف الغلاف هو 8,192 توكن، وبطاقة InternLM صريحة في أن المدخلات الأطول تُرفض دون اقتطاع. تُدعم ثلاثة أنواع من الأسئلة: choice مع خريطة معايير مرتبة، score مع قائمة أو خريطة بمفاتيح رقمية، وnoul، وهو ثنائي. يُسمح بما يصل إلى ثماني صور، وتُحتسب توكناتها ضمن نفس 8,192.

• شكل المخرجات — يُصدر FrogNano-4B-2609 نداءات الأدوات ونص استدلال ورقعة. ويُصدر Intern-Decision-4B رمزًا واحدًا لكل حقل ولا شيء آخر.

• الحتمية — يأخذ FrogNano عينات عند درجة حرارة 0.6 عبر ثلاث بذور، لذا فهو احتمالي بحكم التصميم. قيمة argmax لدى Intern-Decision-4B ثابتة بفعل التمرير الأمامي؛ ودرجة الحرارة المُلاءمة لا تحرّك سوى ثقته.

• سطح الفشل — يمكن لـ FrogNano أن يهلوس واجهة برمجة تطبيقات، أو يوسّع نطاق تعديل بشكل مفرط، أو يجتاز الاختبارات بينما يُدخل ثغرة أمنية، وكل ذلك تسمّيه بطاقته. لا يمكن لـ Intern-Decision-4B أن يهلوس إجابة، لأنه يمكنه فقط الاختيار من الخيارات التي زوّدته بها — لا يمكنه إلا أن يكون غير معاير بدقة.

• سقف الإدخال — نحو 131 ألف رمز مجمّع لـ FrogNano في تكوينه المُقيَّم، مقابل حدّ صارم يبلغ 8,192 لـ Intern-Decision-4B، وهو فارق بمعامل ستة عشر ولا يوجد أي حل التفافي.

• شكل التكلفة — تفرض FrogNano رسومًا حسب المسار، والمسارات طويلة. ولا يملك Intern-Decision-4B أي رموز إخراج لفوترتها على الإطلاق.

• المعاملات — تمنح بطاقة FrogNano نطاقًا "500M-5B" وتصف حوالي 4.66B، مع تنزيل BF16 بحجم 9.32 GB؛ ويُذكر أن Intern-Decision-4B يبلغ 4.54B مع برج رؤية بحجم 612 MB وبروجكتر بحجم 54 MB إلى جانب شظايا اللغة الخاصة به.

الرقم الذي يحدد هذا الاقتران

تضع بطاقة InternLM نموذج Intern-Decision-4B عند زمن استجابة متوسط قدره 44.16 ms ووسيط قدره 44.03 ms على بطاقة RTX 4090 واحدة عبر مسار Hugging Face المحلي، مع قيمة P95 عند 44.60 ms. أعد قراءة هذا التفاوت: المسافة من الوسيط إلى الذيل أقل بكثير من ميلي ثانية واحدة، لأن تمريرًا أماميًا ذا شكل ثابت لا يكاد يوجد فيه أي شيء يتغير. وهذه هي الحجة الكاملة لصالح هذه البنية.

الرقم المقابل لـ FrogNano ليس بالمللي ثانية. فقد سمحت تقييماته بميزانية قدرها 150 خطوة مع سقف زمني للوكيل يبلغ 10,800 ثانية لكل مهمة. تلك ليست وحدات قابلة للمقارنة، ولا ينبغي أبدًا وضعها في الجملة نفسها إلى جانب ادعاء بزمن الوصول — لكنها تخبرك بشكل المقايضة. أحد النموذجين يتخذ قرارًا في أربع وأربعين مللي ثانية، بينما يقضي الآخر دقائق في استدعاءات أدوات لمطاردة رقعة. إذا كانت مشكلتك هي «وجّه هذه التذكرة إلى أحد ستة طوابير وأخبرني بمدى ثقتك»، فإن الأول ليس نسخة أرخص من الثاني، بل آلة مختلفة.

قاس كلا المختبرين نفسيهما بعناية، وينبغي قراءة مجموعتي القياسات بوصفهما نوايا لا نتائج. يُبلِغ InternLM عن متوسط من سبع مجموعات قدره 90.02 مع درجة Brier مقدارها 0.347 وخطأ معايرة متوقع قدره 0.065، مُلاءَم عند درجة حرارة 1.99241824 على 1,728 حالة معايرة محددة. وتُبلِغ Microsoft عن صعود بخمس تكرارات من 39.4% إلى 61.5% على SWE-bench Verified، ويُبلِغ ملحق الورقة نفسها عن التقدم نفسه بوصفه 48.2%، و53.4%، و58.3%، و58.6% و61.6% — تذكير بأنه حتى داخل مختبر واحد، فإن قياس الحقيقة نفسها بطريقتين ينتج سلّمين.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

الدليل يكمن في ما تختار كل بطاقة أن تحذّرك منه.

كلتا البطاقتين صادقتان بشكل غير معتاد، ويتجه الصدق فيهما في اتجاهين متعاكسين — وهذا هو أكثر ما يفيد في هذه المقارنة.

يبدو قسم القيود المعروفة لدى Microsoft وكأنه تحذير من النشر. الإنجليزية وPython فقط. الأداء حساس لأداة الاختبار وجودة الاختبار. تصحيحات قد تكون غير صحيحة أو غير آمنة على الرغم من اجتيازها لاختباراتها. الجملة الموجودة في البطاقة نفسها هي أن FrogNano "لا ينبغي اعتباره متوافقًا مع السلامة بشكل مستقل للنشر الذاتي غير المقيد"، وتذكر الفجوة المحددة: التدريب اللاحق الخاص بالوكيل لم يستخدم أي بيانات لتفضيلات السلامة أو الرفض أو الخصومة، لأنه حسّن من أجل الصحة الوظيفية وتجنب الانحدار بدلاً من ذلك. كما تكشف طوعًا عن معدل استدعاء الأدوات المتوازية البالغ 1.71%، مما يعني أن النموذج لا يطلق أداتين في دور واحد أبدًا على الرغم من أن أداة الاختبار تسمح بذلك — وهو انحدار حقيقي في القدرات من النموذج الأساسي الذي أضاف الفريق مرحلة توحيد لمحاولة استعادته.

تحذّر بطاقة InternLM من فئة معاكسة من الأمور. لا توجد ساحة هلوسة يُحذَّر منها، لذا تدور التحذيرات حول المدخلات: رفض 8,192، وسقف الخيارات البالغ 62، وكون برج النص الأساسي يعلن حد موضع قدره 262,144 رمزًا يرفض الغلاف الصادر استخدامه. تكمن مخاطرته في أن يُوثق برقم واثق أكثر مما يستحق، وتصرّح البطاقة بصراحة بأن المعايرة تضيّق فجوة مع خط أساس Jev دون أن تغلقها في كل شريحة.

عند قراءتهما معًا، يصفان موقفين مختلفين تجاه الثقة. يحتاج FrogNano إلى إشراف لأنه يتصرّف. ويحتاج Intern-Decision-4B إلى تدقيق لأنه يمنح درجات — والرقم الذي يحرّك قرارًا إنتاجيًا هو بالضبط نوع المخرجات التي لا يخطر ببال أحد اختبارها.

أين يجد الموجّه مكانه، وملاحظة صادقة بشأن كليهما

لا يُعد أيٌّ من النموذجين نقطة نهاية مستضافة. يُشحن FrogNano كأوزان زائد إطار تقييم Kubernetes؛ ويُشحن Intern-Decision-4B كفئة Python تستوردها بعد تنزيل أربع شرائح. وبالنسبة لفريق يريد تجربة أيٍّ منهما أمام شيء حقيقي، فإن النمط الآمن هو نفسه لكليهما، وهو غير مبهر: ضع المكوّن التجريبي خلف خيار احتياطي بحيث يكلّف مسار سيئ أو يوم سيئ المعايرة إعادةَ محاولة بدلًا من حادثة.

هذا النمط هو ما وُجدت طبقة التوجيه من أجله. يشغّل OrcaRouter أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI بهامش ربح 0% — وسعر قائمة المزوّد يُمرَّر كما هو، لذا فإن أي تغيّر في سعر البائع يصل إلى طرفنا في اليوم نفسه — وتقع آلية التبديل الاحتياطي لديه أمام النموذج العام الذي ترجع إليه، لا أمام هذين النموذجين. وبصراحة: نحن لا نوفّر FrogNano-4B-2609 ولا Intern-Decision-4B، ولا يوجد تاريخ محدّد لأيّ منهما. ما تمنحك إياه نقطة نهاية واحدة هنا هو أن المقارنة نفسها تصبح رخيصة — اعتماد واحد، وسطر فواتير واحد، ولا تكامل ثانٍ في كل مرة تبدّل فيها النموذج العام الذي تقيس عليه النموذج المتخصص.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

أي واحد، ومتى؟

استخدم Intern-Decision-4B عندما تكون الإجابة موجودة بالفعل في النص التوجيهي لديك وتحتاج إلى اختيارها، مع درجة ثقة مرفقة، بمعدل آلاف في الثانية. التوجيه وفق تصنيف ثابت، والتقييم وفق معايير، والاستخراج المقيّد بالمخطط، والإشراف مقابل مجموعة تسميات مغلقة. إن التمريرة الأمامية البالغة 44 مللي ثانية والفاتورة الصفرية لرموز الإخراج هما المنتج، والمعايرة هي ما يجب تدقيقه قبل الوثوق به.

خذ FrogNano-4B-2609 عندما لا تكون الإجابة موجودة بعد ويتعيّن اكتشافها عبر قراءة مستودع وتشغيل اختباراته. تلك عملية تستغرق دقائق، داخل بيئة معزولة، وقابلة للمراجعة، و61.5% على SWE-bench Verified — مُبلَّغ عنها من المورّد، ولم يُعَد إنتاجها — هي أفضل دليل متاح حالياً على أن نقطة حفظ بحجم 4B قادرة على فعل ذلك أصلاً.

ما لا ينبغي أن يمرّ في أيٍّ من الاتجاهين هو عادة مقارنة درجاتهما. فمتوسط 90.02 على سبع مجموعات، ومعدل 61.5 في SWE-bench Verified، هما قياسان لسؤالين مختلفين، أنتجهما مختبران اثنان، على أداتَي تقييم اثنتين، ولم يمرّ أي من الرقمين عبر أيدي طرف ثالث. لا يتقاسمان سوى سلف واحد ولا شيء غيره.

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

التنبؤ الوحيد المفيد حقًا من السلف المشترك: بما أن كلا النموذجين يبدآن من نقطة الحفظ نفسها بحجم 4B، فإن الفرق بينهما يكاد يكون كله في التدريب اللاحق، ما يعني أن السؤال المثير لأي شخص يبني على Qwen3.5-4B هو أي من بنيتي المكافأة هاتين تنتقل إلى مجاله الخاص. حلقة مهام اصطناعية تُعاير مقابل سياستها الخاصة، أو رأس تقييم ثابت الشكل بدرجة حرارة مُلائمة. هاتان وصفتان، كلتاهما منشورتان، وكلتاهما من مختبرات لم تسمح بعد لأي طرف آخر بتشغيلهما. هذا موقف نادر ويستحق المراقبة بدلًا من الانخراط فيه.