بطاقة عنوان مُولَّدة بعنوان "AesCode-8B مقابل Qwen3-8B" مع بطاقتين مستديرتين جنبًا إلى جنب. البطاقة اليسرى AesCode-8B تحمل أيقونة نافذة متصفح تعرض صفحة ملصق والسطرين "الأساس: Qwen3-VL-8B-Instruct" و"يُصدر صفحة معروضة"؛ البطاقة اليمنى Qwen3-8B تحمل أيقونة مستند مع فقاعة كلام والسطرين "النموذج العام الخاص بـ Qwen" و"نص، 119 لغة". فاصل بينهما يقرأ "أبناء عمومة، وليس أبًا وابنًا" وشريط تسمية توضيحية عبر الأعلى يقرأ "AesCode-8B ليس ضبطًا دقيقًا لـ Qwen3-8B". شعار OrcaRouter مركّب في أسفل اليمين.
Guides & Insights

AesCode-8B مقابل Qwen3-8B: يبدوان كأنهما والد وطفل، لكنهما ليسا كذلك

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الأسماء تدعو إلى الخطأ. AesCode-8B هو نموذج 8B ببنية أساسية Qwen3-VL-8B-Instruct، Qwen3-8B هو نموذج 8B الخاص بالمورّد، والقراءة البديهية هي أن الأول ضبط دقيق للثاني. لكنه ليس كذلك. ملف التكوين المنشور لـ AesCode-8B يعلن Qwen3-VL-8B-Instruct كقاعدة — الشقيق البصري-اللغوي، نقطة تفتيش مختلفة بمهمة مختلفة — وتُدرجه بيانات Hugging Face الوصفية كضبط دقيق لذلك النموذج، وليس لنموذج Qwen3-8B النصي. النموذجان AesCode في هذه الفئة الوزنية هما أبناء عمومة وليسا أبًا وابنًا، وهذا التمييز هو السبب الكامل وراء فائدة هذه الصفحة: فهي تخبرك بما اشترته Microsoft عندما بدأت من نقطة تفتيش بصرية-لغوية، وما كلفها ذلك على الجانب النصي، ولماذا ينتهي الأمر بمقارنة مع النموذج العام 8B البسيط للعائلة إلى قياس تفرّع وليس ترقية.

كلاهما بترخيص Apache 2.0 وكلاهما قابل للتنزيل، لكن سجلات نشرهما لا يمكن أن تكون أكثر اختلافًا. طُرح Qwen3-8B في أبريل 2025 ضمن سلسلة الجيل Qwen3 الخاصة بالشركة المطوّرة، مدعومًا بتوثيق وتكامل مع المنظومة وثمانية عشر شهرًا من عمليات نشر الآخرين. لا يحمل AesCode-8B أي تاريخ إصدار في أي مكان من ملفاته. أنشأت Microsoft مستودع Hugging Face في 2026-09-29، وأودعت الأوزان برسالة "Release AesCode-8B" في 03:35 UTC بتاريخ 2026-10-07، ووضعت كود التدريب على GitHub في اليوم التالي. لا يوجد منشور من Microsoft Research، ولا ملاحظة إصدار، ولا صفحة منتج، ولا ورقة بحثية — ويقرأ الاستشهاد في بطاقة النموذج «قيد المراجعة» مع السنة البديلة 2027، وأظهر المستودع عمليتَي تنزيل حتى وقت كتابة هذا النص. وكل ما هو كمّي بشأن AesCode-8B أدناه هو من Microsoft وحدها ولم يكرّره أحد.

شجرة العائلة التي تخفيها الأسماء

تحتوي سلسلة الجيل Qwen3 على عدة نقاط حفظ من فئة 8B تتشارك نسبًا واحدًا ولا الكثير غير ذلك. Qwen3-8B هو النموذج العام للنصوص فقط: نحو 8.2 مليار معامل إجمالي، منها نحو 7 مليارات من المعاملات غير الخاصة بالتضمين، مع انتباه الاستعلامات المجمّعة، وسياق أصلي بطول 32 ألف رمز قابل للتوسعة إلى 131 ألفًا عبر YaRN، وتدريب على 119 لغة ولهجة. إنه يستدل ويحادث ويكتب الأكواد ويستدعي الأدوات، وهو أحد أكثر نماذج 8B انتشارًا في الاستضافة الذاتية ضمن النظام البيئي المفتوح لهذه الأسباب تحديدًا. Qwen3-VL-8B-Instruct هو العضو متعدد الوسائط: من الجيل نفسه للعائلة، مع برج رؤية مخصص فوقه، صورة ونص كمدخل، ونص كمخرج.

بدأت Microsoft من الثاني. تشير تهيئة AesCode-8B إلى Qwen3VLForConditionalGeneration، مع 36 طبقة مخفية، وحجم مخفي 4,096، و32 رأس انتباه و8 رؤوس مفتاح-قيمة، ومفردات من 151,936 رمزًا ومواضع mrope متشابكة، ويحتاج إلى transformers 4.57 أو أحدث. يبلغ مجموع الشظايا 17,543,339,408 بايت، أي نحو 8.8 مليار معامل bf16، ولهذا يقول حقل الحجم المقرّب لدى Hugging Face 9B بينما يقول المورّد 8B. هذا تقريب وليس تباينًا، وعدد المعاملات ليس الفارق المهم — بل نمط الإدخال وسياق الخدمة البالغ 24,576 رمزًا.

إذاً، التأطير الصادق ليس «نموذج عام مقابل نسخته المضبوطة بدقة». بل هو: نموذج عام نصي بسياق طويل وثمانية عشر شهراً من تاريخ الإنتاج، في مقابل نقطة تفتيش بحثية متعددة الوسائط تُصدر مستنداً ولم تُقيَّم بشكل مستقل قط.

A generated two-column scoreboard titled "AesCode-8B vs Qwen3-8B - the scoreboard". Left column AesCode-8B reads Base Qwen3-VL-8B-Instruct, Parameters 8.8B, Output HTML and CSS page, Context 24,576 tokens, Languages English only, Evidence vendor rubric and unreproduced. Right column Qwen3-8B reads Base Qwen3-8B itself, Parameters 8.2B, Output text and tool calls, Context 32K native and 131K extended, Languages 119, Evidence 18 months independent. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Qwen3-8B specifications are Alibaba's." The OrcaRouter logo is composited bottom-right.

ما الذي أنفقت مايكروسوفت ميزانية التدريب عليه

الموجز التصميمي مقتبس على بطاقة النموذج ويشرح الانقسام: نماذج الأكواد "لا تستطيع رؤية كيف يتكامل التخطيط والهرمية واللون على اللوحة"، بينما مولّدات الصور "تكوّن صفحات جذابة بصريًا لكنها غالبًا ما تسيء تصيير النصوص والأرقام والعلاقات المنطقية." إن AesCode هي المحاولة لأخذ حس التكوين من أحدهما والقابلية للتحقق من الآخر، والوصفة غير معتادة بطريقة محددة.

كل موجّه تدريبي يقترن بصورة مرجعية مُولّدة من نفس الموجّه — استخدمت تشغيلات مايكروسوفت الخاصة GPT-Image-2 للصورة وGPT-5.5 لتوسيع موجز قصير إلى موجّه محتوى مفصّل. تحمل الصورة المرجعية التخطيط والأسلوب فقط؛ يظل موجّه النص هو المرجع الموثوق للمحتوى. ثم، عند الاستدلال، يكاد النموذج لا يحتاجها: احجب المرجع عن AesCode-8B فتنخفض درجته البصرية 1.00 نقطة من مئة، مقابل 19.55 للعمود الفقري و10.04 لـ GPT-5.5. نتيجة ذات صلة هي أن المكافآت القائمة على المرجع رفعت الدرجة البصرية المعتمدة على الموجّه فقط من 25.17 إلى 69.71، لذا انتقلت الأولوية البصرية إلى الأوزان بدلاً من البقاء في المدخلات.

الباقي قصة تصميم مكافآت. الإشراف هو "رسم بياني تصميمي" من عُقد وحواف — نصوص، ومخططات، وجداول، وبطاقات، ومناطق، وخانات صور، مع الاحتواء والمحاذاة والترتيب والاتصال كحواف — يُختار بحيث تنتمي كل خاصية على اللوحة إلى عنصر مُسمّى وبالتالي يمكن تقييمها بمفردها. سبعة معايير تُقيّم النتيجة: ستة مُقيّمات حتمية للتنفيذ، والنص، والحدود، وبيانات الجداول والمخططات، والتخطيط الدلالي، والمسافات البيضاء، بالإضافة إلى معيار تقييم بصري خاص بكل عيّنة يحكم عليه نموذج لغوي بصري. تُعرض المرشحات في متصفح Playwright معزول مع حجب الطلبات الخارجية، وتقرأ أداة الاختبار بنية DOM والأنماط المحسوبة ومربّعات الحدود ولقطة شاشة، ولهذا يجب أن تكون الجداول بصيغة HTML والمخططات بمواصفات ECharts. كان التدريب ضبطًا دقيقًا خاضعًا للإشراف ببداية باردة على 3,000 عرض توضيحي، ثم GDPO على 7,408 مطالبات لمدة 400 خطوة على عقدة واحدة من ثماني وحدات NVIDIA B200، مع تطبيع كل قناة مكافأة داخل مجموعة التوليد الخاصة بها كي لا تُغرق الإشارة القاعدية الكثيفة الإشارة البصرية المتناثرة. وتقيس Microsoft هذا التطبيع عند 5.12 نقطة بصرية مقابل مقياس GRU القياسي البسيط.

لا توجد أي من تلك الآليات لجعل AesCode-8B مساعدًا عامًا أفضل. إنها موجودة لجعل المخرجات قابلة للتحقق، وهذا هو سبب كون سياق النموذج كما هو.

جنبًا إلى جنب، مع تسمية الأرقام

• الأساس — AesCode-8B: Qwen3-VL-8B-Instruct، نقطة حفظ للنموذج اللغوي البصري. Qwen3-8B: النموذج العام النصي فقط من الجيل نفسه.

• المعاملات — AesCode-8B: حوالي 8.8B bf16 موزعة على أربع شرائح. Qwen3-8B: حوالي 8.2B إجمالاً، ونحو 7B منها غير تضمينية.

• المُدخلات — AesCode-8B: نص بالإضافة إلى صورة مرجعية اختيارية. Qwen3-8B: نص.

• المخرجات — AesCode-8B: مستند HTML وCSS كامل. Qwen3-8B: نص، واستدعاءات أدوات، وكود.

• السياق — AesCode-8B: 24,576 رمزًا في التكوين المُبلَّغ عنه. Qwen3-8B: 32K أصلي، و131K موسّع عبر YaRN.

• اللغات — AesCode-8B: وسم البطاقة هو "en" وحده. Qwen3-8B: 119 لغة ولهجة.

• الدليل — AesCode-8B: معيار Microsoft الخاص للإنفوجرافيك المكوّن من 300 عينة، وثلاث عمليات توليد لكل موجّه، دون إعادة إنتاج خارجية. Qwen3-8B: ثمانية عشر شهرًا من الاختبارات المعيارية المستقلة، وأعمال التكميم، والنشر الإنتاجي.

• الترخيص — كلاهما Apache 2.0، دون قيود. إنه تعادل، وليس الفارق الذي يفترضه الناس.

فجوة الأدلة هي المقارنة الحقيقية

تقرير مايكروسوفت يضع AesCode-8B عند 82.94 الإجمالية على مقياسها، متقدمًا على GPT-5.5 المشروط بالمرجع عند 81.28 وClaude Opus 4.8 عند 80.39، وبفارق 31.1 نقطة بصرية عن العمود الفقري الخاص به المشروط بالمرجع. ثلاثة أرقام في ذلك الجدول تستحق أكثر من العنوان الرئيسي. الأول هو الأسلوب، حيث يقع AesCode-8B عند 53.21 ولا يتجاوز أي نموذج في المقارنة 60 — وتعريف مايكروسوفت للأسلوب هو تصميم لا يحتاج إلى أي مراجعة بصرية أخرى قبل التسليم، لذا في البُعد الوحيد الذي يسأل عمّا إذا كان الإنسان سيشحن الصفحة دون تحرير، فإن النموذج ليس المتصدر. الثاني هو الفشل الحدّي: يتكرر تجاوز شديد لحدود لوحة الرسم في 4.3% من العينات الـ300، مقابل 34.7% لدى GPT-5.5. الثالث هو أن النصف البصري من الدرجة يأتي من حَكَم رؤية ولغة غير مُسمّى، ما يعني أن النصف الحتمي قابل لإعادة الإنتاج من طرف خارجي، بينما النصف الآخر ليس كذلك.

أرقام Qwen3-8B تأتي من مصدر مختلف تمامًا، وهذا يهم أكثر من مسألة أيّ المجموعتين أعلى. ثمانية عشر شهرًا من التقييم المستقل، وعمليات التكميم المجتمعية، ومعايير تقديم الخدمة، وعمليات النشر الإنتاجية هي نوع مختلف من الأدلة: فهي ليست مجرد ادعاء، بل سجل حافل. يمكنك أن تعرف كيف يتصرف Qwen3-8B عند تكميمه بأربع بتات على بطاقة معينة لأن شخصًا ما قد نشر ذلك. لا يمكنك فعل ذلك مع AesCode-8B، لأنه اعتبارًا من هذا الأسبوع لم يُشغّله أحد خارج Microsoft على أي شيء.

ولا يوجد مقياس مشترك بين الجدولين. لا يملك Qwen3-8B درجة تخطيط إنفوجرافيك؛ ولا يملك AesCode-8B أي معيار منشور للاستدلال العام على الإطلاق. المقارنة ليست قريبة ولا غير قريبة — بل هي غير متاحة.

ما الذي يتطلبه تشغيل كل واحد منها فعليًا

A screenshot of the OrcaRouter model page for qwen/qwen3-vl-8b-instruct showing the Vision, Tools and JSON capability badges, the byline "by Qwen - 2025-10-14", the description "Qwen3-VL 8B Instruct - open-weight small vision-language model, 8B params, 128k context, no thinking mode", the pricing row reading $0.18 input and $0.70 output per million tokens, and the OpenAI-compatible code sample against the https://api.orcarouter.ai/v1 base URL.

Qwen3-8B هو الخيار السهل. نموذج نصي بحجم 8.2 مليار يمكن تكميمه على بطاقة رسومات استهلاكية واحدة، ويقف خلفه ثمانية عشر شهرًا من الأدوات عبر كل إطار تقديم وبيئة تشغيل محلية، ويتصرف بشكل متوقع. امتداد السياق إلى 131K موثّق بدلًا من كونه كلامًا متوارثًا، وتغطيته لـ119 لغة هي السبب في ظهوره في الكثير من مسارات المعالجة متعددة اللغات.

AesCode-8B مشروع تقديم. أمر البطاقة نفسه هو vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576، مع transformers 4.57 أو أحدث لمسار غير vLLM. يجب أن تتّسع 17.5 GB من أوزان bf16 بجانب ذاكرة KV مؤقتة سعة 24,576 رمزًا وما يصل إلى صورتين، لذا فإن بطاقة واحدة بسعة 24 GB كافية تقنيًا لكنها ضيقة بشكل غير مريح، والحد الواقعي الأدنى هو 40-48 GB أو بطاقتان بسعة 24 GB. خصّص ميزانية لعارض أيضًا، لأن كل ادعاء حول جودة هذا النموذج قُدّم عبر عرض مخرجاته بصيغة HTML في متصفح معزول — إذا أردت معرفة ما إذا كانت مخرجاتك أنت جيدة، فهذا هو الإطار الذي عليك إعداده. ولاحظ أن سياق الـ 24,576 رمزًا جُرّب على صفحات إنفوجرافيك مفردة، لا على عروض متعددة الشرائح التي يُروَّج للنموذج من أجلها، لذا فإن ضغط السياق على عرض حقيقي أرض غير مُختبرة.

التوفر هو النصف الآخر من نفس النقطة. AesCode-8B ليس شيئًا يوجهه OrcaRouter، ولم نتمكن من العثور عليه مخدومًا في أي مكان آخر أيضًا؛ التقييم اليوم يعني الأوزان على العتاد الخاص بك. سلفه قصة مختلفة — Qwen3-VL-8B-Instruct قابل للاستدعاء عبر OrcaRouter الآن بسعر 0.18 دولار لكل مليون رمز إدخال و0.70 دولار لكل مليون إخراج عبر سياق 131,072 رمزًا، مما يجعله أرخص طريقة لرؤية ما تفعله النسخة غير المضبوطة من هذه البنية بالضبط على مطالباتك الرسومية الخاصة. أعلى في نفس الخط، Qwen3.8-27B قابل للتوجيه بسعر 0.33 و2.40 دولار. سعر قائمة المزود يُمرر دون إضافة هامش ربح والتحويل بين المزودين تلقائي، لذا فإن نمذجة المطالبة مقابل العمود الفقري المستضاف تكلف مفتاحًا واحدًا بدلاً من أسبوع GPU، وفقط المطالبات التي تُنتج بشكل جيد تستحق عمل إعادة الإنتاج.

A Hugging Face screenshot of the microsoft/AesCode-8B model card showing 0 likes at capture time, the Microsoft organisation follower count, the Image-Text-to-Text, Transformers, Safetensors and English tags with qwen3_vl and code-generation, an Apache-2.0 licence badge, and the opening card text describing AesCode as generating information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS, followed by the line that AesCode-8B starts from Qwen3-VL-8B-Instruct.

أي واحد تريده يعتمد على القطعة الأثرية.

اختر AesCode-8B عندما يكون المُخرَج صفحةً ويجب أن يكون قابلاً للتحرير. إخراج HTML مُهيكل يمكن مقارنته في Git، وجداول كجداول حقيقية ورسوم بيانية كمواصفات ECharts، هو أثر مختلف جوهريًا عن فقرة نصية، ولا تُغني عنه أي قدرة عامة مهما بلغت. اقبل المقايضة عن علم: نقطة تحقق بحثية غير معلنة بعدد تنزيلات من رقمين، وسياق 24K، والإنجليزية فقط، ولا تقييم مستقل، وسقف Style ينشره البائع نفسه، وفاتورة خدمة تُقاس بعشرات الغيغابايت.

اختر Qwen3-8B لكل ما تبقى — وهو، بالنسبة لمعظم الفرق، كل شيء. إنه المتخصص العام المُجرَّب عند هذا الوزن، ولديه سياق أطول، ويتحدث مئة وتسع عشرة لغة، ويعمل على عتاد تملكه بالفعل، وتقف خلفه ثمانية عشر شهرًا من الخبرة الإنتاجية للآخرين في القرارات التي أنت على وشك اتخاذها. إذا لم تكن لديك حاجة محددة إلى إخراج صفحات مُصيَّرة، فهذه المقارنة لها إجابة واحدة.

الحجة لرغبتنا في كليهما حقيقية، وهي ليست حلاً للتعادل. إن خط أنابيب يقرأ المستندات وينتج عروضاً تقديمية يستخدم نموذجين بنوعين مختلفين حقاً من المخرجات، والوضع المفيد هو إبقاء مُصيّر الصفحات على عتاد قادر على تحمّله، وتوجيه عمل القراءة والاستدلال إلى شيء مستضاف خلف نفس نقطة النهاية مثل كل شيء آخر.

ما الذي سيجعل هذه الصفحة أكثر قدرة على الإغلاق؟

ثلاثة أمور، وواحد منها فقط يتعلق بالمقارنات المعيارية. إعادة إنتاج مستقلة لـ82.94 ولانخفاض المرجعي البالغ 1.00 نقطة ستنقل AesCode-8B من ادعاء بائع إلى نتيجة، وستتيح الإجابة عن سؤال الحجم 8B مقابل 8B على أساس الجدارة. كما أن تبنّي مزوّد لنقطة الحفظ سيطوي عمود النشر ويحوّل «أسبوع GPU» إلى «استدعاء API». أما الورقة التي تستشهد بها البطاقة باعتبارها قيد المراجعة — «AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards» — فستجيب عن السؤال الذي لا تستطيع بطاقة النموذج الإجابة عنه: ماذا يفعل المعيار البصري عندما يكون مخطط التصميم الذي يقيّم مقابله خاطئًا في الأساس؟

إلى أن يتحقق أحدها، تظل القراءة القابلة للدفاع عنها هي القراءة الضيقة. AesCode-8B هو الأكثر إثارة للاهتمام بين هذين النموذجين، والأقل قابلية للاستخدام. إنه جيد جدًا في الأجزاء التي تستطيع الآلة التحقق منها من التصميم البصري، ومتوسط المستوى في الجزء الذي لا يمكن أتمتته، وينتمي إلى العائلة نفسها من جيل Qwen3 التي ينتمي إليها النموذج الذي يُقارَن به، دون أن يكون منحدرًا منه. أما Qwen3-8B فهو النموذج الذي يمكنك وضعه في خط معالجة بعد ظهر اليوم.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا