بطاقة عنوان مُولَّدة تحمل العنوان "AesCode-8B مقابل Gemma 4 12B" مع بطاقتين مستديرتي الحواف جنبًا إلى جنب. البطاقة اليسرى AesCode-8B تحمل أيقونة نافذة متصفح والسطرين "نقطة تفتيش بحثية من Microsoft" و"تُصدر صفحة HTML مُصيَّرة"؛ والبطاقة اليمنى Gemma 4 12B تحمل أيقونة عدسة مكبّرة فوق مستند والسطرين "Google DeepMind، أُطلقت في 2026-06-03" و"تُجيب عن الأسئلة المتعلقة بالصور". فاصل بينهما يقول "أحدهما يُصيّر، والآخر يرد"، وشريط تعليق عبر الأعلى يقول "إصدار غير معلن - الأوزان فقط، بلا نقطة نهاية مستضافة". شعار OrcaRouter مُدمج في أسفل اليمين.
Guides & Insights

AesCode-8B مقابل Gemma 4 12B: نموذجان صغيران للرؤية، ومخرَجَان مختلفان تمامًا

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

AesCode-8B وGemma 4 12B كلاهما يأخذ صورة وجملة، وكلاهما نقطة تحقق Apache-2.0 تُنزّلها بدل أن تستأجرها، ولهذا تضعها محركات البحث بكل سرور جنبًا إلى جنب. التشابه حقيقي، وهو أيضًا سطحي. يُرجع Gemma 4 12B إجابة — وصفًا، أو نسخًا نصيًا، أو مقتطف شيفرة، أو أثر استدلال. أما AesCode-8B فيُرجع صفحة مُصيَّرة: شريحة عرض أو ملصقًا أو لوحة معلومات كمستند HTML وCSS كامل يمكنك فتحه في متصفح وتحريره يدويًا. شكل المدخل نفسه، وفئة الوزن التقريبية نفسها، ومخرج لا يشارك الآخر تقريبًا أي شيء. هذا الفرق الواحد يحدد كل سؤال عملي تقريبًا أدناه، بما في ذلك أيّهما يمكنك وضعه أمام مستخدم غدًا.

يجدر القول منذ البداية، لأن ذلك يحدد مقدار الثقل الذي يمكن أن تحمله الأرقام: أُطلقت Gemma 4 12B من طرف DeepMind في 2026-06-03 مرفقة ببطاقة نموذج ووثائق ومنظومة، وقد خضعت لاختبارات مستقلة منذ ذلك الحين. أما AesCode-8B فلم يُطلق إطلاقًا. أُنشئ مستودع Microsoft الخاص به في 2026-09-29، ووصلت الأوزان في إيداع بعنوان "Release AesCode-8B" عند الساعة 03:35 UTC من يوم 2026-10-07، بينما ظهر كود التدريب والتقييم على GitHub في اليوم التالي. لا يوجد منشور من Microsoft Research، ولا صفحة منتج، ولا ملاحظة إصدار، ولا مسودة أولية — إذ يقرأ الاستشهاد في بطاقة النموذج "Under review" مع سنة بديلة 2027. وحتى كتابة هذه السطور، يُظهر مستودع 8B تنزيلين وإعجابًا واحدًا. لذا فكل ما هو كمي بشأن AesCode-8B مصدره Microsoft نفسها، ولم يقم أي طرف آخر بإعادة إنتاجه.

النموذجان، وفق شروطهما الخاصة

Gemma 4 12B نموذج مفتوح متوسط الحجم، نقطة حفظ كثيفة ذات 11.95 مليار معامل، وخياره التصميمي المميز هو أنه لا يملك مُشفّرًا منفصلًا للرؤية أو الصوت: إذ تدخل رقائق الصور والموجات الصوتية مباشرة إلى المحوّل. وهو يحمل سياقًا من 256 ألف توكن ويحتاج قرابة 16 غيغابايت من VRAM، مع أوزان BF16 بنحو 27 غيغابايت وبنيات مُكمّمة دون 7 غيغابايت. أما بطاقة المورّد الخاصة — المبلَّغ عنها من المورّد، والموسومة بذلك هنا — فتسرد DocVQA 94.9، وInfoVQA 88.4، وMMLU-Pro 77.2، وGPQA Diamond 78.8، وAIME 2026 77.5، وLiveCodeBench v6 72.0 في وضع التفكير. التقييم المستقل هو الجزء الأهم: إذ يمنح Artificial Analysis إعداد الاستدلال مؤشر ذكاء قدره 14، ويقيس نحو 114 توكنًا في الثانية، ويسعّر استدعاءً نموذجيًا عبر الخدمة بنحو 0.10 دولار لكل مليون توكن إدخال و0.30 دولار لكل مليون توكن إخراج. وخلفه ثلاثة أشهر ونصف من النشر.

AesCode-8B هو نسخة مضبوطة بدقة من Qwen3-VL-8B-Instruct، نُشرت بأربع شظايا safetensors يبلغ مجموعها 17,543,339,408 بايت — أي نحو 8.8 مليار معامل bf16، ولهذا يقرأ حقل الحجم المقرّب في Hugging Face قيمة 9B بينما يقرأه المورّد 8B. الإعداد المنشور هو وصفة Qwen3-VL مباشرة: 36 طبقة مخفية، وحجم مخفي 4,096، و32 رأس انتباه مع 8 رؤوس مفتاح-قيمة، ومفردات من 151,936 رمزًا، ومتطلبات transformers 4.57 أو أحدث. استخدمت عمليات التشغيل المبلّغ عنها من Microsoft سياقًا من 24,576 رمزًا مع ما يصل إلى 12,000 رمز إخراج، ودرجة حرارة 0.8، وtop-p 0.95، وثلاث توليدات لكل موجه دون اختيار. الترخيص هو Apache 2.0، غير مقيّد ببوابة، ولا ملحق استخدام مقبول. ما ليس في الصندوق هو بيانات التدريب والتقييم، وأي نقطة نهاية مستضافة — لم نتمكن من العثور على AesCode-8B مخدومًا في أي مكان، وهو ليس في فهرسنا الخاص.

ما الذي دُرِّبت النماذج فعليًا على القيام به

يُقتبَس الموجز التصميمي في بطاقة النموذج، ويستحق القراءة بوصفه الأطروحة كاملة: نماذج الأكواد "لا تستطيع رؤية كيف يندمج التخطيط والتسلسل الهرمي واللون معًا على اللوحة"، بينما مولّدات الصور "تُنشئ صفحات جذابة بصريًا لكنها كثيرًا ما تُخطئ في عرض النصوص والأرقام والعلاقات المنطقية". AesCode هي المحاولة للحفاظ على الحس التكويني وقابلية التحقق في آنٍ واحد.

الآلية غير معتادة من ناحية واحدة محددة. كل موجّه تدريبي يقترن بصورة مرجعية مولّدة من الموجّه نفسه، وهي توفّر التخطيط والأسلوب بينما يظل الموجّه النصي هو المرجع في المحتوى. ثم عند الاستدلال، لا يكاد النموذج يحتاج إلى الصورة: احجب المرجع عن AesCode-8B، وستهبط درجته البصرية 1.00 نقطة من أصل مئة. واحجبه عن Qwen3-VL-8B-Instruct، فيصبح الانخفاض 19.55. واحجبه عن GPT-5.5، المقيَّم ضمن الإطار الاختباري نفسه، فيصبح الانخفاض 10.04. انتهى الأمر بالافتراض البصري المسبق إلى أن يستقر في الأوزان بدلاً من المدخلات، وهذه هي نتيجة البحث الحقيقية الكامنة خلف العنوان الرئيسي.

هدف تدريب Gemma 4 12B هو الهدف متعدد الوسائط العادي، وليس نقدًا أن يقال ذلك: اقرأ الصورة، وأجب عن السؤال، واتبع التعليمة، واستدعِ الأداة. لا شيء في بطاقته يشير إلى أنه وُجّه يومًا نحو إنتاج أثر مُصيَّر، ولا يقيس أي تقييم منشور لـ Gemma 4 12B جودة تخطيط المستند أو تجاوز حدود اللوحة أو اتساق التصميم، لأن هذه ليست مقاييس النموذج.

لوحة النتائج، ولمن يعود معيار التقييم

A generated two-column scoreboard titled "AesCode-8B vs Gemma 4 12B - the scoreboard". Left column AesCode-8B reads Parameters 8.8B dense, Inputs text plus one image, Output a rendered HTML page, Context 24,576 tokens, Evidence Microsoft rubric with no outside test, Hosted nowhere we can find. Right column Gemma 4 12B reads Parameters 11.95B dense, Inputs text, image, audio, video, Output text and tool calls, Context 256K tokens, Evidence AA Intelligence Index 14, Hosted cheap served calls. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Gemma 4 12B figures per Artificial Analysis." The OrcaRouter logo is composited bottom-right.

• المعاملات — AesCode-8B: 8.8B bf16، كثيف. Gemma 4 12B: 11.95B كثيف.

• المدخلات — AesCode-8B: نص مع صورة مرجعية اختيارية. Gemma 4 12B: نص، وصورة، وصوت، وفيديو.

• الإخراج — AesCode-8B: مستند HTML وCSS كامل. Gemma 4 12B: نص، بما في ذلك استدعاءات الأدوات.

• السياق — AesCode-8B: 24,576 توكن في التكوين المذكور. Gemma 4 12B: 256 ألف توكن.

• الترخيص — كلاهما Apache 2.0، متاح دون قيود، مع الأوزان.

• الدليل — AesCode-8B: معيار Microsoft الخاص بالرسوم البيانية المعلوماتية المكوّن من 300 عيّنة، وثلاث عمليات توليد لكل طلب، دون إعادة إنتاج مستقلة. Gemma 4 12B: بطاقة مورّد بالإضافة إلى مؤشر Intelligence Index مستقل بقيمة 14 وإنتاجية مقاسة على Artificial Analysis.

الآن الجزء الذي لا تستطيع لوحة النتائج حمله. تفيد Microsoft بأن AesCode-8B حقّق 82.94 في التقييم الإجمالي على مجموعة العينات تلك المكوّنة من 300 عينة، متقدّمًا على GPT-5.5 المهيَّأ بالمرجع عند 81.28 وClaude Opus 4.8 عند 80.39، وبفارق 31.1 نقطة بصرية عن نموذجه الأساسي Qwen3-VL-8B. اقرأ كل ذلك على أنه مُبلَّغ من المورّد ولم يُعَد إنتاجه، وفق مقياس وضعه المورّد، وعلى عينات اختارها المورّد، وقُيِّم بواسطة أداة تقييم درّب المورّد النموذج عليها. البطاقة صادقة بما يكفي لنشر بُعد لا يتجاوز فيه أي نموذج في المقارنة 60 — الأسلوب، حيث يسجّل AesCode-8B 53.21 ويتصدّر GPT-5.5 عند 57.91 — وتعريف Microsoft نفسه لهذا البُعد هو تصميم لا يحتاج إلى أي مراجعة بصرية أخرى قبل التسليم. على المحور الوحيد الذي يسأل عمّا إذا كان الإنسان سيسلّم الصفحة دون تحرير، فإن نموذج 8B ليس المتصدّر. هذا هو الرقم الذي يجب التمسك به عندما يقتبس أحدهم 82.94.

حيث تتقاطع فعليًا

يوجد رفّ مشترك واحد فقط، وهو أضيق مما يبدو. إذا كنت تقيّم نماذج رؤية مفتوحة صغيرة لمسار معالجة يعتمد بكثافة على المستندات، فكلاهما مرشّحان — أحدهما لقراءة مستند، والآخر لإنتاج مستند. الفريق الذي ينشئ لوحات معلومات داخلية بصيغة HTML ويحتاج أيضًا إلى استخراج الأرقام من ملفات PDF المرفوعة يتعامل مع كلا المنتجين خلال الأسبوع نفسه.

الانقسام داخل هذا التداخل واضح. Gemma 4 12B هو النموذج الذي توجّهه إلى مستند وارد. AesCode-8B هو النموذج الذي توجّهه إلى موجز عندما يكون المُخرَج صفحة. لا يحل أيٌّ منهما محل الآخر، وخط الأنابيب الذي يريد كليهما هو خط أنابيب ثنائي النماذج وليس خيارًا.

A Hugging Face screenshot of the microsoft/AesCode-32B model card showing tags for Image-Text-to-Text, Transformers, Safetensors, English and qwen3_vl, an Apache-2.0 licence badge, 1 like from the Microsoft organisation, and the card opening text that AesCode generates information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS with output that stays structured, editable and verifiable.

النشر، وهو حيث يُلقي عدم التماثل بثقله فعليًا.

اكتملت قصة تقديم Gemma 4 12B. تنزّله، وتكمّمه إن أردت، وتشغّله على 16 GB من VRAM، وهناك قاعدة كبيرة من الأدوات التي تفعل ذلك بالفعل. وإذا كنت تفضّل عدم تشغيله إطلاقًا، فإن الاستدعاء المستضاف رخيص وله تسعير مستقل.

قصة تقديم AesCode-8B هي سطر أوامر وبعض الحسابات. تمنح بطاقة الطراز المسار مباشرة — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576، مع transformers 4.57 أو أحدث للمسار غير المعتمد على vLLM. يجب أن تستقر أوزان bf16 البالغة 17.5 GB إلى جانب ذاكرة KV cache مؤقتة لـ 24,576 رمزًا وما يصل إلى صورتين، لذا فإن بطاقة واحدة بسعة 24 GB كافية تقنيًا وضيقة بشكل غير مريح؛ أما 40-48 GB، أو بطاقتا 24 GB، فهي الحد الأدنى الواقعي. خصّص ميزانية لعارض أيضًا، لأن كل ادعاء جودة حول هذا الطراز يُقدَّم عبر عرض مخرجات HTML الخاصة به في متصفح معزول، لذا فإن تقييم نتائجك بنفسك يعني إقامة شيء على غرار Playwright مع حظر الطلبات الخارجية.

ثم هناك الحالة الصادقة للتوافر. نحن لا نوجّه AesCode-8B، ولا يبدو أن أي جهة أخرى تفعل ذلك بحسب ما يمكننا العثور عليه؛ أي تقييم اليوم يعني الحصول على الأوزان على عتادك الخاص. أقرب شيء قابل للاستدعاء هو البنية التي ضُبط النموذج منها. Qwen3-VL-8B-Instruct هو قابل للتوجيه عبر OrcaRouter الآن مقابل $0.18 لكل مليون رمز إدخال و$0.70 لكل مليون رمز إخراج ضمن سياق من 131,072 رمزاً، ونقطتا التفتيش اللتان نوفرهما فعلاً مسعرتان بالطريقة نفسها — Gemma 4 26B-A4B بسعر $0.06 و$0.33، وGemma 4 31B بسعر $0.13 و$0.38. يمر سعر قائمة المزوّد كما هو دون إضافة أي هامش، ويحدث التبديل الاحتياطي بين المزوّدين تلقائياً، لذا فإن الطريقة الرخيصة لمعرفة ما إذا كانت مطالباتك تؤدي جيداً أصلاً هي اختبار العمود الفقري غير المضبوط أولاً، وإنفاق أسبوع GPU فقط على المطالبات التي تصمد.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Featured badge, the byline "by Google - 2026-04-02", a description of Gemma 4 31B Instruct as a 30.7B dense multimodal model with text and image input and a 256K-token context window, and the pricing row reading $0.13 input and $0.38 output per million tokens with measured latency figures.

أيّ واحد تريده فعلاً؟

اختر AesCode-8B إذا كان الناتج المطلوب صفحة. يُصدر النموذج HTML منظَّمًا وقابلًا للتحرير — الجداول كجداول HTML، والرسوم البيانية كمواصفات ECharts — ما يعني أن الناتج يظهر كفروقات في Git ويمكن لمصمم إعادة تنسيقه دون إعادة توليده. اقبل المقايضة: نقطة تحقق بحثية غير معلَنة بعدد تنزيلات مكوّن من رقمين، وبلا تقييم مستقل، وبلا نقطة نهاية مستضافة، وسياق بحجم 24K لم يُتحقق من صحته إلا على صفحات إنفوجرافيك منفردة، ووسم لغة إنجليزية فقط على البطاقة.

اختر Gemma 4 12B لكل شيء آخر. فهو يقرأ المستندات أفضل من معظم النماذج التي يبلغ حجمها ضعف حجمه، ويتعامل مع الصوت، ويتبع تعليمات الأدوات، ولديه ربع مليون توكن من السياق، ووراءه ثلاثة أشهر ونصف من خبرة الآخرين. إذا كنت تختار واحدًا من هذين ليكون نموذج الرؤية الصغير لديك، ولم يُطلب منك تحديدًا إنتاج عروض شرائح كشيفرة، فهذا هو الجواب.

وإذا كان المطلب الحقيقي هو الاثنان معًا، فلا تتعامل معه على أنه فاصل تعادل. وجّه عمل القراءة إلى نموذج مستضاف، وأبقِ عمل التصيير على أي جهاز قادر على استيعاب الأوزان.

ما الذي سيغيّر هذه الصفحة؟

ثلاث إشارات. إن إعادة إنتاج مستقلة لنتيجة 82.94 والانخفاض المرجعي البالغ 1.00 نقطة ستنقل AesCode-8B من ادعاء مورّد إلى نتيجة، وستجعل مسألة الحجم بين 8B و12B مثيرة للاهتمام حقاً لا اسمياً فحسب. وأي مزوّد استدلال يتبنّى نقطة التحقق هذه سيطوي عمود النشر، وهو حالياً الفارق العملي بأكمله. والورقة التي تستشهد بها Microsoft باعتبارها قيد المراجعة — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — ستجيب عن الأسئلة التي لا تستطيع بطاقة النموذج الإجابة عنها، بدءاً من كيفية تصرف المعيار البصري عندما يكون مخطط التصميم نفسه خاطئاً. وإلى أن يتحقق أحد هذه الأمور، فإن القراءة القابلة للدفاع عنها ضيقة وحقيقية: AesCode-8B بارع جداً في الأجزاء من التصميم البصري التي تستطيع الآلة فحصها، ومتوسط في الجزء الذي لا تستطيع، أما Gemma 4 12B فهو منتج مكتمل يؤدي مهمة مختلفة.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا