
AesCode-8B مقابل MathForm-8B: كلاهما نموذجان مضبوطان ضبطًا دقيقًا بحجم 8B يمكن للآلة التحقق من مخرجاتهما
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز · 87 tok/s
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
AesCode-8B وMathForm-8B صدرا خلال ثمانية أسابيع من بعضهما البعض، وكلاهما من مستودعات لا من بيانات صحفية، والمصادفة أكثر إثارة للاهتمام مما تبدو للوهلة الأولى. يبدأ كلاهما من نقطة تفتيش من عائلة Qwen3. ويُنفق كلاهما ميزانية التدريب بأكملها على شكل مخرجات ضيق. وقد بُني كلاهما حول مُدقِّق: يُدرَّب MathForm-8B مقابل حكم مُصرِّف Lean 4، ويُقيَّم AesCode-8B عبر عرض كل صفحة مرشحة في متصفح معزول وقراءة DOM والأنماط المحسوبة ولقطة شاشة. لا أحد منهما روبوت محادثة ولا يحاول أي منهما أن يصبح كذلك. ما يفصلهما هو ما يمكن للآلة التحقق منه وما لا يمكنها — وفي حالة الأحدث منهما، ما يحدث عندما يأتي نصف الدرجة من حَكَم لم يسمّه أحد.
سجلات النشر ليست متناظرة. جاء MathForm-8B من OpenBMB، وتؤرّخ بطاقة نموذجه الإصدار بـ 2026-08-14؛ وهو مبني على Qwen3-8B، ومدرَّب على FormalVerse، وهي مجموعة من نحو 367,000 مثال Lean 4 مُتحقَّق منها، مع ضبط دقيق خاضع للإشراف يتبعه تعلّم معزّز يستخدم تصريف Lean وفحوص الاتساق الدلالي كإشارة مكافأة له. لا يحمل AesCode-8B أي تاريخ إصدار في أي مكان من ملفاته. أنشأت Microsoft مستودع Hugging Face في 2026-09-29، وأودعت الأوزان في 03:35 UTC بتاريخ 2026-10-07 برسالة "Release AesCode-8B"، ونشرت كود التدريب على GitHub في 2026-10-08. لم يصاحب أي إعلان أيًّا من الحدثين، ويقول الاستشهاد في بطاقة النموذج "قيد المراجعة، 2027"، وأظهر المستودع تنزيلين حتى وقت كتابة هذا النص. وهو مضبوط بدقة انطلاقًا من Qwen3-VL-8B-Instruct، وهو أمر جدير بالملاحظة تحديدًا لأنه ليس السلف نفسه الخاص بـ MathForm-8B.
يشرح النسب معظم الانقسام
يتشارك Qwen3-8B وQwen3-VL-8B-Instruct الجيل واسم العائلة، لكن لا يتشاركان المهمة. Qwen3-8B هو نموذج عام نصي فقط: نحو 8.2 مليار معامل إجمالي، منها حوالي 7 مليارات غير تضمينية، وانتباه بالاستعلامات المجمّعة، وسياق أصلي بطول 32 ألف رمز قابل للتوسعة إلى 131 ألفًا عبر YaRN، وتدريب عبر 119 لغة ولهجة. أما Qwen3-VL-8B-Instruct فهو الشقيق البصري-اللغوي، وهو نقطة التحقق التي يبدأ منها AesCode-8B — فإعداد AesCode المنشور هو وصفة Qwen3-VL مباشرة مع 36 طبقة مخفية، وحجم مخفي 4,096، و32 رأس انتباه مع 8 رؤوس مفتاح-قيمة، ومفردات من 151,936 رمزًا.
ذلك التفرّع يحدد جانب الإدخال لدى كلا المتخصصين قبل أن يُدرَّب أيٌّ منهما. يأخذ MathForm-8B نصًا ويُخرج نصًا بصياغة رسمية. يأخذ AesCode-8B نصًا مع صورة مرجعية اختيارية ويُخرج مستندًا.
• الأساس — MathForm-8B: Qwen3-8B، نصي فقط. AesCode-8B: Qwen3-VL-8B-Instruct، إدخال الصورة والنص.
• المعاملات — MathForm-8B: حوالي 8.2 مليار. AesCode-8B: حوالي 8.8 مليار بصيغة bf16 موزعة على أربع شظايا، وتقرّبها Hugging Face إلى 9 مليار.
• بيانات التدريب — MathForm-8B: FormalVerse، نحو 367 ألف مثال Lean 4 تم التحقق منه. AesCode-8B: 3,000 عرض توضيحي للبدء البارد، ثم التعلم المعزز GDPO عبر 7,408 مطالبات لمدة 400 خطوة.
• ما الذي يتحقق من المخرجات — MathForm-8B: مترجم Lean 4، إضافةً إلى فحص للاتساق الدلالي مقابل المسألة الأصلية. AesCode-8B: عرض Playwright داخل بيئة معزولة مع ستة مدققات حتمية ومعيار واحد يُقيَّم بواسطة النموذج.
• الترخيص — كلاهما Apache 2.0، وكلاهما غير مقيّد، وكلاهما يرث من البنية الأساسية لعائلة Qwen3.
• استضافة في أي مكان — لا هذا ولا ذاك، بحسب ما يمكننا العثور عليه.
معنيان مختلفان لكلمة "قابل للتحقق"
هذا هو التمييز الذي يستحق التمهل فيه، لأن «قابل للتحقق آليًا» يُستخدم لكليهما، وهو لا يعني الشيء نفسه.
مدقّق MathForm-8B هو مساعد برهان. فإما أن يقبل Lean 4 قضيةً ما وإما ألا يقبلها، والحكم ليس مسألة رأي أو معيار تصحيح أو ذوق حكَم. وحلقة التدريب موجّهة نحو تلك الإشارة: مرحلة SFT على FormalVerse تعلّم الانتقال من مسألة غير رسمية إلى صياغة مبرهنة رسمية ذات ترويسة imports ومبرهنة مُسمّاة، ومرحلة RL تشحذ ذلك باستخدام الترجمة البرمجية إضافة إلى فحص اتساق يسأل عما إذا كانت الصيغة الرسمية لا تزال تقول ما قالته المسألة الأصلية. أما فحص الاتساق فهو النصف الأكثر لينًا، وهو النصف الذي تصبح فيه الأرقام المُبلَّغ عنها ضعيفة — وهو بالضبط ما تُظهره النتائج المنشورة.
مدقّق AesCode-8B هو مُصيِّر. تُصيَّر المرشّحات في متصفح Playwright معزول مع حجب الطلبات الخارجية، وتقرأ منظومة الاختبار DOM والأنماط المحسوبة والمربعات المحيطة وحالة وحدة التحكم ولقطة شاشة. تقيّم ست قنوات حتمية العناصر القابلة للتحليل — التنفيذ، والنص المطابق، وسلوك الحدود، وبيانات الجداول والرسوم البيانية، والتخطيط الدلالي، والمسافات البيضاء — ويقيّم السابع، وهو Visual Graph Rubric، الهندسة والموضع عبر أسئلة نعم/لا مرتبطة بالرسم البياني. يجب أن تكون الجداول جداول HTML حقيقية، وأن تكون الرسوم البيانية مواصفات ECharts، وهو قيد له أثر فعلي: فهو يفرض على المخرجات أن تتخذ شكلًا يستطيع المتحقّق تحليله. النصف الحتمي قابل لإعادة الإنتاج حقًا. أما النصف البصري فيحكم عليه نموذج رؤية-لغة لا يذكر التوثيق هويته، وهو ما يعني أنه لا يستطيع أحد خارج المختبر إعادة إنتاجه.
إذاً المقارنة الصادقة ليست «أن أحدهما موثَّق والآخر غير موثَّق». بل هي أن الإشارة الأساسية لدى MathForm-8B هي مُصرِّف، وإشارته الثانوية هي فحص اتساق، بينما الإشارة الأساسية لدى AesCode-8B هي مجموعة من تأكيدات DOM الحتمية، وإشارته الثانوية هي رأي نموذج، مُغلَّفة داخل الدرجة الإجمالية نفسها.

ما الذي يبلّغ عنه كل واحد منها، وما قيمته
يُبلّغ MathForm-8B عن متوسط Pass@8 قدره 88.06% في فحص البنية الصياغية و72.37% في فحص الاتساق عبر ستة معايير. الجزء المثير للاهتمام هو التوزّع بين المعايير: اتساق 95.06% على FormalIMATH و94.83% على ProverBench، ثم 63% على FATE-H و37% على FATE-X. هذان الأخيران هما العبارتان الصعبتان والواقعيتان، والانخفاض من منتصف التسعينيات إلى منتصف الثلاثينيات هو الشكل الصادق لهذه القدرة. كل هذه الأرقام مُبلَّغ عنها من المورّد وغير معاد إنتاجها، ومزيج المعايير يميل نحو المجموعات الأسهل.
يُبلّغ AesCode-8B عن نتيجة إجمالية قدرها 82.94 على معيار الرسوم المعلوماتية المكوّن من 300 عيّنة الخاص بمايكروسوفت — النص 94.06، الحدود 88.36، المخطط 87.79، القاعدة 90.07، المحتوى 86.41، التخطيط 87.80، النمط 53.21، البصري 75.80 — مع ثلاث توليدات لكل موجّه ودون انتقاء. وتُبلغ مايكروسوفت أيضاً أنه يتفوق على GPT-5.5 المشروط بالمرجع عند 81.28 وClaude Opus 4.8 عند 80.39 وفق المعيار نفسه، وأن فشلاً شديداً يتمثل في تجاوز حدود اللوحة يتكرر في 4.3% من العينات الـ300، وأن 22.4 نقطة بصرية تفصل النموذج المرافق 32B عن عموده الفقري الخاص. كل رقم هو رقم الجهة المورّدة، وفي مهمة الجهة المورّدة، ومُقيَّم مقابل قنوات صمّمتها الجهة المورّدة.
لا يمكن مقارنة مجموعتي الأرقام ببعضهما البعض على الإطلاق. فلا توجد مهمة مشتركة، ولا مقياس مشترك، ولا محكّم مشترك. فوضع 88.06% إلى جانب 82.94 سيكون بمثابة مقارنة معدل النجاح في الصياغة الصورية باستخدام Lean بدرجة إجمالية لإنفوجرافيك، ولم يُقيَّم أي من النموذجين قط على ما يقوم به الآخر.
هناك عدم تماثل جدير بالتسمية لأنه يعمل ضد النموذج الأحدث. المقياس الأبرز لدى MathForm-8B يتضمن حكماً خارجياً مدمجاً: يمكن لأي شخص تثبيت Lean، وتحميل المعايير نفسها، والتحقق مما إذا كانت العبارات تُصرَّف. أما المقياس الأبرز لدى AesCode-8B فليس كذلك — إذ يمكن لشخص خارجي مصمم إعادة تشغيل المدققات الحتمية، لكن النصف البصري من الدرجة يعتمد على حكم لم تحدد الورقة هويته. إن معدل نجاح التصريف غير المُعاد إنتاجه ادعاء أضعف من جدول معايير، لكنه يظل أقوى من درجة معيار تقييم غير مُعاد إنتاجها ويضم بداخلها مُقيّماً مجهولاً.
تشغيلها مسألة مختلفة عن أي من النتيجتين
كلاهما قراران بالاستضافة الذاتية اليوم. MathForm-8B هو الأرخص بفارق كبير: نقطة تحقق نصية فقط بحجم 8.2 مليار تقريبًا، مع ميزانية توليد تبلغ نحو 16 ألف رمز من مخرجات Lean، ويمكن تكميمها لتستقر على بطاقة واحدة متوسطة المدى. AesCode-8B هو نموذج لغوي بصري بحجم 8.8 مليار يحمل مسار خدمته الصور إلى جانب النص؛ وأمر البطاقة نفسه هو vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576، كما أن 17.5 غيغابايت من أوزان bf16 بالإضافة إلى ذاكرة KV مؤقتة تكفي لـ 24,576 رمزًا وصورتين يعني أن بطاقة سعة 24 غيغابايت تكون ضيقة، وأن 40-48 غيغابايت هو الحد الأدنى الواقعي. خصص ميزانية لمنظومة تصيير أيضًا إذا أردت تقييم مخرجاتك بنفسك، لأن هذه هي الطريقة التي صيغت بها كل ادعاءات الجودة حول النموذج.
التكلفة الخفية الأكبر هي أن كلا النموذجين متخصصان ستتبناهما بشكل دائم. الفريق الذي يحتاج إلى إضفاء الطابع الرسمي وتوليد المستندات يشغّل الآن مساري خدمة بحجم 8B، ومجموعتين من صيغ المطالبات، ونمطين للفشل، ولا يستطيع أي من النموذجين استيعاب عمل الآخر. هذه هي الحالة التي توجد طبقة التوجيه من أجلها: أبقِ المتخصصين حيث تبرر الجدوى الاقتصادية والتعامل مع البيانات امتلاك وحدة معالجة رسومات، ووجّه حركة المرور العامة إلى شيء مستضاف خلف نقطة النهاية نفسها. وعلى نحو ملموس، يمكن استدعاء النظائر العامة لهاتين القاعدتين — Qwen3-VL-8B-Instruct بسعر $0.18 لكل مليون رمز إدخال و$0.70 لكل مليون رمز إخراج ضمن سياق من 131,072 رمزًا، إلى جانب عائلة Qwen 3.8 ونقاط تحقق مفتوحة أخرى — كل ذلك عبر واجهة API الواحدة من OrcaRouter التي تغطي أكثر من 200 نموذج، مع تمرير سعر قائمة المزوّد كما هو بهامش ربح 0% والتبديل التلقائي عند فشل أحد المزوّدين. لا يمكن توجيه أيٍّ من النموذجين المتخصصين هنا أو في أي مكان آخر نستطيع العثور عليه؛ والقابل للتوجيه هو النموذج العام الذي ترجع إليه عند انتهاء المهمة الضيقة، وهذا هو الفرق بين تجربة نقطة تحقق بحثية وتحويلها إلى تبعية أساسية يتحمّل النظام عبئها.

الاختيار بينهما، إن كان لا بد لك من ذلك حقًا.
اختر MathForm-8B عندما يجب أن يُترجَم المُخرَج البرمجي. تحويل بنك المسائل، ومدوّنات رسمية لمُثبِت، والتنسيق المسبق للعبارات لأدوات مبنية على Lean — هذا هو الوصف الوظيفي بأكمله، وهو الوحيد من بين الاثنين الذي دُرِّب على ذلك. خُذ أرقام FATE على محمل الجد عند تحديد النطاق: في أصعب العبارات الواقعية، يخرج نحو الثلث منها متسقًا، وسوف تبني خطوة مراجعة بشرية على أية حال.
اختر AesCode-8B عندما يكون لا بد من عرض الناتج. يدخل موجز، ويخرج مستند HTML قابل للتحرير، وتبقى الجداول جداول، وتأتي المخططات على هيئة مواصفات مخططات، ويمكن تتبع الفروقات في الناتج بأكمله عبر Git. تقبّل سقف Style — 53.21، وهو بُعد مُعرَّف بأنه لا يحتاج إلى أي مراجعة بصرية إضافية قبل التسليم — بوصفه المقياس الصادق لمقدار التحرير المتبقي، وتقبّل أن سياق 24,576 توكنًا لم يُتحقق منه إلا على صفحات إنفوجرافيك مفردة، لا على العروض متعددة الشرائح التي يريدها الناس فعلاً.
لكن الخيار الذي ستواجهه معظم الفرق فعليًا ليس أيًّا من هذين. بل هو ما إذا كان أحد هذين المتخصصين الضيقين يستحق النشر من الأساس، أم أن النموذج العام الكامن خلفه، المستدعى عبر واجهة برمجة تطبيقات (API)، قريب بما يكفي لحجم استخدامك. ذلك يستغرق فترة بعد ظهر من اختبار المطالبات بدلًا من شراء وحدة معالجة رسومات (GPU)، وأرقام كلتا البطاقتين نفسها تمنحك سببًا لتشغيله: فدرجة الاتساق على المجموعة الصعبة لدى MathForm-8B تبلغ 37%، ودرجة Style لدى AesCode-8B تبلغ 53%، لذا لا يُعد أيٌّ منهما نموذجًا قد تضعه في خط أنابيب دون إشراف.

ما يخبرك به كلا الإصدارين عن كيفية طرح النماذج الآن
نموذجان مضبوطان بدقة بحجم 8B، يفصلهما ثمانية أسابيع، من مختبرين مختلفين، صدرا بلا إعلان، ولا صفحة منتج، ولا تقييم مستقل، وكلاهما مبني حول حلقة تحقّق، وكلاهما بترخيص Apache 2.0، ولا يقدّمهما أي أحد. هذا النمط هو القصة أكثر من أي من النموذجين. لقد انتقلت منهجية البحث إلى دالة المكافأة — إشارة المترجم لدى OpenBMB، والقنوات العابرة للوسائط المفصولة لدى Microsoft — وأصبحت المخرجات المنشورة هي وصفة التدريب بالإضافة إلى الأوزان، على أن تأتي الورقة البحثية لاحقًا، إن جاءت أصلًا.
ما يعنيه ذلك لأي شخص يقرأ مقارنة كهذه هو أن أرقام المورّد نفسه هي كل ما ستحصل عليه لفترة، والسؤال المفيد ليس مدى ارتفاعها بل مدى قابليتها للتحقق. معدل التجاوز في AesCode-8B وسقف Style الخاص به هما ادّعاءان قابلان للتحقق يتنكران في هيئة إخفاقات. ورقم الاتساق FATE-X الخاص بـ MathForm-8B هو الشيء نفسه. تلك هي الأرقام التي ينبغي قراءتها، والتي ينبغي أن تعود وتعيد تشغيلها بنفسك بمجرد أن تصبح أدوات التحقق قابلة لإعادة الإنتاج من البداية إلى النهاية.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
