
FrogNano-4B-2609: أطلقت مايكروسوفت وكيل برمجة بحجم 4 مليارات معلمة على Hugging Face ولم تعلن عنه أبدًا
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 219 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
ظهر المستودع في 17 سبتمبر 2026 مع الالتزام الأولي، ووصلت نقطة التحقق نفسها بعد أربع دقائق. ثم لا شيء. لا تغريدة من Microsoft AI، ولا مدخل على مدونة Microsoft Research، ولا صفحة إطلاق. وبعد سبعة أسابيعmicrosoft/FrogNano-4B-2609 — وكيل برمجي من فئة الأربعة مليارات مبني على Qwen3.5-4B — ما زال بلا أي إعلان خلفه، وهذا الصمت هو الحقيقة الأهم على الإطلاق بشأن نشر هذا النموذج. ما لديه بالفعل هو بطاقة نموذج تدّعي وجود ورقة بحثية وأداة تقييم، ومستودع GitHub يتبيّن أنه الأداة وليس الورقة، وcreatedAt بتاريخ 17 سبتمبر يقع تحت بطاقة تقول "تاريخ الإصدار 22-SEP-2026". كلا التاريخين مرتجل؛ ولا واحد منهما خاطئ؛ لكنهما يتناقضان.
ما الذي يُنشَر فعليًا؟
كل ما يلي قابل للتحقق على hub الآن، وكل رقم في هذا المقال مصدره بطاقة Microsoft الخاصة أو أعداد البايتات في المستودع نفسه. لم يُعِد أي طرف ثالث إنتاج أي شيء — فلا يوجد مُدخل لـ Artificial Analysis، ولا تصنيف arena، ولا أي تقييم مستقل لـ FrogNano في أي مكان.
• الأوزان — مستودع عام واحد تحت مؤسسة Microsoft، غير مقيّد، موسوم بترخيص MIT على Hub، 15 ملفًا، لا بوابة تنزيل ولا اتفاقية للتوقيع.
• الأوزان على القرص — 9.32 جيجابايت موزعة على شاردتين من safetensors، و59.6 مليار بايت من بيانات المستودع بما في ذلك مجموعة الملفات الخالية من المُحسِّن، و738 موترًا في الفهرس.
• البنية المعمارية — Qwen3_5ForConditionalGeneration، المكدس الهجين الكثيف ذو الـ32 طبقة الموروث من Qwen3.5-4B، مع برج رؤية ذي 24 طبقة تقول البطاقة إنه موروث ولم يُدرَّب تدريبًا لاحقًا.
• حقل المعامل الخاص بالبطاقة نفسه — "500M-5B". هذا نطاق، وليس رقمًا، والتنزيل هو المستند الأكثر دقة.
• الترخيص — تقول البيانات التمهيدية للبطاقة إنه MIT. ويقول متن البطاقة نفسه إنه Apache License 2.0، كما أنّ منظومة GitHub الفعلية تُرفِق فعلاً ملف LICENSE الخاص بترخيص MIT. هذان البيانان يتعلقان بعنصرين مختلفين في الإصدار نفسه.
• إعلان — لا شيء. لا على مدونة Microsoft Research، ولا على موقع الفريق البحثي الخاص، ولا في موجز منظمة Hugging Face على أي نحو يتجاوز كونه قائمة مستودع.
ذلك السطر الأخير هو ما ينبغي أن يضبط موقف القارئ من بقية هذا النص. إن نقطة حفظ رُفعت بهدوء ليست مُخرَجًا أقل شأنًا من نقطة حفظ معلَنة — فبطاقتها غالبًا أطول، لأن لا أحد يختصرها استعدادًا لبيان صحفي. لكنها لم تمرّ بالمصفاة الوحيدة التي تحصل عليها أي إصدارة معلَنة مجانًا: أن ينظر إليها آخرون.

النتائج، ومن أنتج كل واحدة منها
تُفيد مايكروسوفت أن FrogNano حقق 61.5% على SWE-bench Verified، و37.6% على SWE-bench Pro، و31.1% على Terminal-Bench 2.0، و47.3% على PatchEval-Verified، جميعها كمعدلات حل Avg@3 تم قياسها عبر أداة Leaf. تعطي البطاقة نفسها نقطة البداية: سجل Qwen3.5-4B نسبة 39.4% على SWE-bench Verified تحت نفس الأداة والميزانية. خمس تكرارات للتعلم المعزز نقلته عبر 49.1%، و53.1%، و56.7%، و59.1%، و61.5% — بزيادة 22.1 نقطة عن النموذج الأساسي، وهو ما تقربه صياغة مايكروسوفت الخاصة إلى حوالي 56% تحسن نسبي.
هناك أمران في ذلك السلّم يستحقان التوقف عندهما، لأنهما موضعان يمكن أن يخطئ فيهما الملخّص، لا موضعان أخطأ فيهما المورّد.
الأول هو تباين التكرار 5. يقول الجدول الرئيسي في البطاقة إن النسبة 61.5% للتكرار النهائي؛ أما ملحق الكفاءة الخاص بالورقة فيورد التدرج نفسه ذا المحطات الخمس على النحو التالي: 48.2% و53.4% و58.3% و58.6% و61.6%. الرقم الأخير وحده قريب، والرقم الأخير وحده هو الذي يقتبسه أي شخص. تعامل مع الرقم النهائي بوصفه النتيجة المستقرة، ومع المراحل الوسيطة بوصفها قياسًا لأشياء مختلفة، لأنها في ظل تجميع مختلف تكون كذلك بوضوح.
الثانية هي أن FrogNano ليس أفضل بشكل موحّد من النموذج الذي بدأ منه على كل المحاور. معدّل استدعاء الأدوات المتوازية المنشور لديه هو 1.71%. وتذكر بطاقة النموذج بصراحة أن الإصدارات اللاحقة فقدت القدرة على إطلاق عدة استدعاءات أدوات في دور واحد، وأن عمل الدمج الذي يقوم به الفريق موجود جزئيًا لاستعادة هذه القدرة. إن نموذجًا يحل مشكلات أكثر بينما لا يكاد يصدر أي استدعاءات متزامنة يمثل مقايضة هندسية حقيقية، وليس تفصيلًا هامشيًا.

إطار الاختبار هو المنتج، والمستودع هو إطار الاختبار.
FrogNano لا يعمل من تلقاء نفسه. إنه يصدر استدعاءات منظّمة إلى خمس أدوات — Read، Write، Edit، Glob وBash — ويجب على شيء ما أن ينفّذها في بيئة معزولة ويعيد المخرجات. ذلك الشيء هو Leaf، وهنا يفعل المسار شيئًا غير معتاد قليلًا.
يربط صف "الأصول ذات الصلة الإضافية" في بطاقة النموذج تقريرًا فنيًا عند aka.ms/frognano-tech-report وأداة تقييم عند github.com/microsoft/FrogNano. أما aka.ms فلا يشير إلى ملف PDF؛ بل يعيد التوجيه مباشرة إلى صفحة ملخص arXiv، حيث يقع التقرير الفعلي. وفي المقابل، لا يحتوي مستودع GitHub على أي تعليمات برمجية للتدريب، ولا وصفة تعلّم معزز، ولا نقاط حفظ. ويصف ملف README الخاص به أداة تقييم تشغّل وكلاء البرمجة في بيئات Kubernetes معزولة مقابل نقطة نهاية متوافقة مع OpenAI، ويعود إلى ورقة arXiv لقصة التدريب. لذا فإن رابطي الأصول في البطاقة هما مؤشر إلى الورقة ومؤشر إلى رد الورقة، والاسم مشترك.
هذا مهم لأي شخص يخطط لاستخدام النموذج، لسبب عملي. وصفة التشغيل الموثقة هي SGLang مع --reasoning-parser qwen3 و --tool-call-parser qwen3_coder، وتريد أداة الاختبار نقطة نهاية تدعم بالفعل استدعاءات الأدوات والاستدلال. إذا أخطأت قليلًا في تهيئة التحليل، ينتج النموذج نصًا حيث تتوقع أداة الاختبار JSON، وهو ما يبدو من الخارج تمامًا كنموذج سيئ وليس كتهيئة سيئة. توضح البطاقة صراحةً أن أي نتيجة مطابقة تتطلب نقطة تحقق مطابقة، ومُرمِّزًا مطابقًا، وتهيئة تشغيل مطابقة، وصور مهام، وبروتوكول تقييم — وهذا يعني أن المورّد يخبرك أن أداة الاختبار تشكل نصف النتيجة.
من الجدير أيضًا ذكره بوضوح لأي شخص يقدّر حجم العتاد المطلوب: نقطة تحقق بحجم 9.32 GB عند السياق المُقيَّم للبطاقة ليست مشكلة استدلال بحجم 9.32 GB. أُجريت التقييمات عند نحو 131K من الرموز المجتمعة بميزانية 150 خطوة. تتناسب الذاكرة مع السياق، لا مع الأوزان، وتقول البطاقة إن الحد الأدنى لتكوين GPU لا يزال "يجب التحقق منه قبل الإصدار" — وهي عبارة تظهر على نموذج قابل للتنزيل بالفعل.
ما الذي فعله التدريب فعليًا، في فقرة واحدة
مساهمة الورقة ليست النموذج، بل الحلقة. يولّد TaskPilot مهام هندسة برمجيات مرشحة انطلاقًا من لقطات مستودعات حقيقية، ويشغّل عمليات تنفيذ تجريبية من نقطة التحقق الحالية عليها، ويُبقي تلك القريبة من الحد الذي قد تنجح السياسة في حله أحيانًا، ويستبعد المرشحات التي تكون تافهة بشكل دائم أو مستحيلة بشكل دائم. تُدرّب المجموعة المقبولة نقطة التحقق التالية. ثم تعاير نقطة التحقق التالية الجولة التالية من توليد المهام، بحيث يتحرك توزيع المهام مع تحرك السياسة. نحو 1,500 بيئة مُتحقَّق منها إجمالًا. لا تقطير: تنص البطاقة صراحةً على أن التدريب اللاحق الخاص بالوكيل لم يستخدم أي مسارات حلول أو إجراءات أو آثار استدلال أو أهداف ترقيع من نموذج أقوى. النماذج الأقوى تكتب المهام؛ لكنها لا تعرض الأجوبة.
شغّلت Microsoft تلك الحلقة لخمس تكرارات وأفادت بتحقيق مكسب قدره 8.7 نقطة قبل أي دمج، مع إضافة عقوبة طول السجل في منتصف التشغيل لأن آثار الاستدلال كانت تنمو أسرع مما كانت تتحسن.
تتسم بطاقة النموذج بصراحة غير معتادة بشأن مواضع الهشاشة في النهج بأكمله. فبيانات التدريب تغلب عليها لغة Python وهي في المقام الأول بالإنجليزية؛ ومجموعة اللغات الطبيعية المدعومة المعلنة في البطاقة هي الإنجليزية ولا شيء غيرها، مع عدم الادعاء صراحةً بتغطية النموذج الأساسي الأوسع متعددة اللغات. والأداء حساس لإطار التقييم ولجودة الاختبارات. وقد تكون الرقعات المولّدة «غير صحيحة أو غير آمنة رغم اجتيازها الاختبارات المتاحة». وتُغلق بطاقة النموذج الخاصة بـ 4B تلك الفقرة بجملة ينبغي أن يحملها كل قارئ: ألّا يُستخدم من دون مراجعة بشرية مؤهلة واختبار مستقل للانحدار والأمان. وهذا تصريح من مورّد بشأن منتج مورّد، وهو جملة أكثر فائدة من أي من صفوف لوحة النتائج الواردة أعلاه.
ما الذي يعنيه هذا للمشتري، وأين يقع جهاز التوجيه من ذلك
FrogNano ليس نموذجًا تستدعيه. لا توجد واجهة برمجة تطبيقات من الطرف الأول، ولا نقطة نهاية مستضافة، ولا صورة بلا خادم. إنه نقطة تفتيش، واستخدامه يعني إما إقامة نشر SGLang خاص بك خلف بيئة معزولة مستضافة على Kubernetes، أو تقييمه كمكوّن داخل حزمة وكلاء تشغّلها بالفعل. هذا هو مسار التبني بالكامل اليوم، ولم يكن أي إعلان ليغيّر شكله.
ما يمكن لطبقة توجيه أن تفعله بصدق هنا هو شيء أضيق مما يبدو عليه للوهلة الأولى. إذا كانت الخطة هي مقارنة FrogNano المستضاف ذاتيًا مقابل نموذج برمجة مستضاف داخل إطار الاختبار الخاص بك، فإن النصف المستضاف هو النصف الذي يستفيد من وجوده خلف مفتاح واحد بدلًا من عقد ثانٍ: يحمل OrcaRouter أكثر من 200 نموذج خلف نقطة نهاية واحدة متوافقة مع OpenAI بهامش ربح 0%، مما يعني أن أسعار قوائم المزودين تمر كما هي دون تغيير وأن تغيير سعر المورّد يصبح ساريًا من جانبنا في اليوم نفسه. هذا مهم في اختبار تنافسي تُحدد نتيجته بالتكلفة لكل مشكلة محلولة وليس برقم معياري واحد. نحن لا نستضيف FrogNano ولا يوجد موعد لذلك؛ الأوزان وعمل التشغيل مسؤوليتك.

الأمور الثلاثة التي من شأنها أن تحسم الأمر
أولاً، إعادة إنتاج مستقلة. كل رقم في هذا المقال — 61.5، 37.6، 31.1، 47.3 — أنتجه المختبر الذي درّب النموذج، على منصة اختبار يصونها المختبر نفسه، مقابل رقم نموذج أساسي قاسه المختبر نفسه. تلك صورة كاملة ومتسقة داخلياً، وهي أيضاً حلقة مغلقة. الاختبار المفيد هو ما إذا كان شخص لا مصلحة له يعيد إنتاج القفزة من 39.4 إلى 61.5 على المهام الـ500 نفسها دون عمل المعايرة الذي أجرته Microsoft على مجموعة المهام.
ثانيًا، يجب على شخص ما التحقق من ادعاء منظومة الاختبار من البداية إلى النهاية. المستودع عام، وهذا أكثر مما تنجح فيه إصدارات كثيرة، لكنه هو منصة التقييم. إذا كانت الأدوات الخمس وعزل الصندوق الرملي هما بالفعل آلية الأداء، فينبغي لطرف ثالث يشغّل التهيئة المنشورة أن يصل إلى أرقام قريبة من الأرقام المنشورة. وإذا لم يحدث ذلك، فالفجوة هي الاكتشاف الحقيقي.
ثالثًا، وهو الأرخص للإجابة: على Microsoft أن تقول ما إذا كان هذا منتجًا أم أثرًا في ورقة بحثية. يتعامل قسم التوزيع في البطاقة مع الأوزان والبطاقة وإطار الاختبار باعتبارها المُخرَج التسليمي، وهو ما يُقرأ كمنشور علمي لا كإطلاق. عبارة «تاريخ الإصدار 22-SEP-2026» تُقرأ كإطلاق. أي نموذج مُعلَن كان سيزيل هذا الغموض في الجملة الأولى من تدوينة، ولا توجد أي تدوينة.
حتى ذلك الحين، فإن الموقف الصحيح هو الذي يوحي به الإصدار نفسه. FrogNano-4B-2609 هو نقطة تفتيش حقيقية، قابلة للتنزيل، مرخصة بـ MIT وApache وربما لا، مع بطاقة مفصلة على نحو غير معتاد، وأداة تقييم عامة، وفكرة منهجية حقيقية، ولوحة نتائج لم يلمسها قط أحد لا يملك عنوان Microsoft. بالنسبة لمختبر، هذا قطعة أثرية كاملة ومثيرة للاهتمام. أما بالنسبة لفريق على وشك وضع وكيل أمام مستودع في الثالثة صباحًا، فهو خيط يستحق المتابعة، وليس بعد قرارًا يستحق اتخاذه.
