
AesCode-8B مقابل Gemma 4 12B: نموذجان صغيران للرؤية، ومخرَجَان مختلفان تمامًا
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز · 87 tok/s
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
AesCode-8B وGemma 4 12B كلاهما يأخذ صورة وجملة، وكلاهما نقطة تحقق Apache-2.0 تُنزّلها بدل أن تستأجرها، ولهذا تضعها محركات البحث بكل سرور جنبًا إلى جنب. التشابه حقيقي، وهو أيضًا سطحي. يُرجع Gemma 4 12B إجابة — وصفًا، أو نسخًا نصيًا، أو مقتطف شيفرة، أو أثر استدلال. أما AesCode-8B فيُرجع صفحة مُصيَّرة: شريحة عرض أو ملصقًا أو لوحة معلومات كمستند HTML وCSS كامل يمكنك فتحه في متصفح وتحريره يدويًا. شكل المدخل نفسه، وفئة الوزن التقريبية نفسها، ومخرج لا يشارك الآخر تقريبًا أي شيء. هذا الفرق الواحد يحدد كل سؤال عملي تقريبًا أدناه، بما في ذلك أيّهما يمكنك وضعه أمام مستخدم غدًا.
يجدر القول منذ البداية، لأن ذلك يحدد مقدار الثقل الذي يمكن أن تحمله الأرقام: أُطلقت Gemma 4 12B من طرف DeepMind في 2026-06-03 مرفقة ببطاقة نموذج ووثائق ومنظومة، وقد خضعت لاختبارات مستقلة منذ ذلك الحين. أما AesCode-8B فلم يُطلق إطلاقًا. أُنشئ مستودع Microsoft الخاص به في 2026-09-29، ووصلت الأوزان في إيداع بعنوان "Release AesCode-8B" عند الساعة 03:35 UTC من يوم 2026-10-07، بينما ظهر كود التدريب والتقييم على GitHub في اليوم التالي. لا يوجد منشور من Microsoft Research، ولا صفحة منتج، ولا ملاحظة إصدار، ولا مسودة أولية — إذ يقرأ الاستشهاد في بطاقة النموذج "Under review" مع سنة بديلة 2027. وحتى كتابة هذه السطور، يُظهر مستودع 8B تنزيلين وإعجابًا واحدًا. لذا فكل ما هو كمي بشأن AesCode-8B مصدره Microsoft نفسها، ولم يقم أي طرف آخر بإعادة إنتاجه.
النموذجان، وفق شروطهما الخاصة
Gemma 4 12B نموذج مفتوح متوسط الحجم، نقطة حفظ كثيفة ذات 11.95 مليار معامل، وخياره التصميمي المميز هو أنه لا يملك مُشفّرًا منفصلًا للرؤية أو الصوت: إذ تدخل رقائق الصور والموجات الصوتية مباشرة إلى المحوّل. وهو يحمل سياقًا من 256 ألف توكن ويحتاج قرابة 16 غيغابايت من VRAM، مع أوزان BF16 بنحو 27 غيغابايت وبنيات مُكمّمة دون 7 غيغابايت. أما بطاقة المورّد الخاصة — المبلَّغ عنها من المورّد، والموسومة بذلك هنا — فتسرد DocVQA 94.9، وInfoVQA 88.4، وMMLU-Pro 77.2، وGPQA Diamond 78.8، وAIME 2026 77.5، وLiveCodeBench v6 72.0 في وضع التفكير. التقييم المستقل هو الجزء الأهم: إذ يمنح Artificial Analysis إعداد الاستدلال مؤشر ذكاء قدره 14، ويقيس نحو 114 توكنًا في الثانية، ويسعّر استدعاءً نموذجيًا عبر الخدمة بنحو 0.10 دولار لكل مليون توكن إدخال و0.30 دولار لكل مليون توكن إخراج. وخلفه ثلاثة أشهر ونصف من النشر.
AesCode-8B هو نسخة مضبوطة بدقة من Qwen3-VL-8B-Instruct، نُشرت بأربع شظايا safetensors يبلغ مجموعها 17,543,339,408 بايت — أي نحو 8.8 مليار معامل bf16، ولهذا يقرأ حقل الحجم المقرّب في Hugging Face قيمة 9B بينما يقرأه المورّد 8B. الإعداد المنشور هو وصفة Qwen3-VL مباشرة: 36 طبقة مخفية، وحجم مخفي 4,096، و32 رأس انتباه مع 8 رؤوس مفتاح-قيمة، ومفردات من 151,936 رمزًا، ومتطلبات transformers 4.57 أو أحدث. استخدمت عمليات التشغيل المبلّغ عنها من Microsoft سياقًا من 24,576 رمزًا مع ما يصل إلى 12,000 رمز إخراج، ودرجة حرارة 0.8، وtop-p 0.95، وثلاث توليدات لكل موجه دون اختيار. الترخيص هو Apache 2.0، غير مقيّد ببوابة، ولا ملحق استخدام مقبول. ما ليس في الصندوق هو بيانات التدريب والتقييم، وأي نقطة نهاية مستضافة — لم نتمكن من العثور على AesCode-8B مخدومًا في أي مكان، وهو ليس في فهرسنا الخاص.
ما الذي دُرِّبت النماذج فعليًا على القيام به
يُقتبَس الموجز التصميمي في بطاقة النموذج، ويستحق القراءة بوصفه الأطروحة كاملة: نماذج الأكواد "لا تستطيع رؤية كيف يندمج التخطيط والتسلسل الهرمي واللون معًا على اللوحة"، بينما مولّدات الصور "تُنشئ صفحات جذابة بصريًا لكنها كثيرًا ما تُخطئ في عرض النصوص والأرقام والعلاقات المنطقية". AesCode هي المحاولة للحفاظ على الحس التكويني وقابلية التحقق في آنٍ واحد.
الآلية غير معتادة من ناحية واحدة محددة. كل موجّه تدريبي يقترن بصورة مرجعية مولّدة من الموجّه نفسه، وهي توفّر التخطيط والأسلوب بينما يظل الموجّه النصي هو المرجع في المحتوى. ثم عند الاستدلال، لا يكاد النموذج يحتاج إلى الصورة: احجب المرجع عن AesCode-8B، وستهبط درجته البصرية 1.00 نقطة من أصل مئة. واحجبه عن Qwen3-VL-8B-Instruct، فيصبح الانخفاض 19.55. واحجبه عن GPT-5.5، المقيَّم ضمن الإطار الاختباري نفسه، فيصبح الانخفاض 10.04. انتهى الأمر بالافتراض البصري المسبق إلى أن يستقر في الأوزان بدلاً من المدخلات، وهذه هي نتيجة البحث الحقيقية الكامنة خلف العنوان الرئيسي.
هدف تدريب Gemma 4 12B هو الهدف متعدد الوسائط العادي، وليس نقدًا أن يقال ذلك: اقرأ الصورة، وأجب عن السؤال، واتبع التعليمة، واستدعِ الأداة. لا شيء في بطاقته يشير إلى أنه وُجّه يومًا نحو إنتاج أثر مُصيَّر، ولا يقيس أي تقييم منشور لـ Gemma 4 12B جودة تخطيط المستند أو تجاوز حدود اللوحة أو اتساق التصميم، لأن هذه ليست مقاييس النموذج.
لوحة النتائج، ولمن يعود معيار التقييم

• المعاملات — AesCode-8B: 8.8B bf16، كثيف. Gemma 4 12B: 11.95B كثيف.
• المدخلات — AesCode-8B: نص مع صورة مرجعية اختيارية. Gemma 4 12B: نص، وصورة، وصوت، وفيديو.
• الإخراج — AesCode-8B: مستند HTML وCSS كامل. Gemma 4 12B: نص، بما في ذلك استدعاءات الأدوات.
• السياق — AesCode-8B: 24,576 توكن في التكوين المذكور. Gemma 4 12B: 256 ألف توكن.
• الترخيص — كلاهما Apache 2.0، متاح دون قيود، مع الأوزان.
• الدليل — AesCode-8B: معيار Microsoft الخاص بالرسوم البيانية المعلوماتية المكوّن من 300 عيّنة، وثلاث عمليات توليد لكل طلب، دون إعادة إنتاج مستقلة. Gemma 4 12B: بطاقة مورّد بالإضافة إلى مؤشر Intelligence Index مستقل بقيمة 14 وإنتاجية مقاسة على Artificial Analysis.
الآن الجزء الذي لا تستطيع لوحة النتائج حمله. تفيد Microsoft بأن AesCode-8B حقّق 82.94 في التقييم الإجمالي على مجموعة العينات تلك المكوّنة من 300 عينة، متقدّمًا على GPT-5.5 المهيَّأ بالمرجع عند 81.28 وClaude Opus 4.8 عند 80.39، وبفارق 31.1 نقطة بصرية عن نموذجه الأساسي Qwen3-VL-8B. اقرأ كل ذلك على أنه مُبلَّغ من المورّد ولم يُعَد إنتاجه، وفق مقياس وضعه المورّد، وعلى عينات اختارها المورّد، وقُيِّم بواسطة أداة تقييم درّب المورّد النموذج عليها. البطاقة صادقة بما يكفي لنشر بُعد لا يتجاوز فيه أي نموذج في المقارنة 60 — الأسلوب، حيث يسجّل AesCode-8B 53.21 ويتصدّر GPT-5.5 عند 57.91 — وتعريف Microsoft نفسه لهذا البُعد هو تصميم لا يحتاج إلى أي مراجعة بصرية أخرى قبل التسليم. على المحور الوحيد الذي يسأل عمّا إذا كان الإنسان سيسلّم الصفحة دون تحرير، فإن نموذج 8B ليس المتصدّر. هذا هو الرقم الذي يجب التمسك به عندما يقتبس أحدهم 82.94.
حيث تتقاطع فعليًا
يوجد رفّ مشترك واحد فقط، وهو أضيق مما يبدو. إذا كنت تقيّم نماذج رؤية مفتوحة صغيرة لمسار معالجة يعتمد بكثافة على المستندات، فكلاهما مرشّحان — أحدهما لقراءة مستند، والآخر لإنتاج مستند. الفريق الذي ينشئ لوحات معلومات داخلية بصيغة HTML ويحتاج أيضًا إلى استخراج الأرقام من ملفات PDF المرفوعة يتعامل مع كلا المنتجين خلال الأسبوع نفسه.
الانقسام داخل هذا التداخل واضح. Gemma 4 12B هو النموذج الذي توجّهه إلى مستند وارد. AesCode-8B هو النموذج الذي توجّهه إلى موجز عندما يكون المُخرَج صفحة. لا يحل أيٌّ منهما محل الآخر، وخط الأنابيب الذي يريد كليهما هو خط أنابيب ثنائي النماذج وليس خيارًا.

النشر، وهو حيث يُلقي عدم التماثل بثقله فعليًا.
اكتملت قصة تقديم Gemma 4 12B. تنزّله، وتكمّمه إن أردت، وتشغّله على 16 GB من VRAM، وهناك قاعدة كبيرة من الأدوات التي تفعل ذلك بالفعل. وإذا كنت تفضّل عدم تشغيله إطلاقًا، فإن الاستدعاء المستضاف رخيص وله تسعير مستقل.
قصة تقديم AesCode-8B هي سطر أوامر وبعض الحسابات. تمنح بطاقة الطراز المسار مباشرة — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576، مع transformers 4.57 أو أحدث للمسار غير المعتمد على vLLM. يجب أن تستقر أوزان bf16 البالغة 17.5 GB إلى جانب ذاكرة KV cache مؤقتة لـ 24,576 رمزًا وما يصل إلى صورتين، لذا فإن بطاقة واحدة بسعة 24 GB كافية تقنيًا وضيقة بشكل غير مريح؛ أما 40-48 GB، أو بطاقتا 24 GB، فهي الحد الأدنى الواقعي. خصّص ميزانية لعارض أيضًا، لأن كل ادعاء جودة حول هذا الطراز يُقدَّم عبر عرض مخرجات HTML الخاصة به في متصفح معزول، لذا فإن تقييم نتائجك بنفسك يعني إقامة شيء على غرار Playwright مع حظر الطلبات الخارجية.
ثم هناك الحالة الصادقة للتوافر. نحن لا نوجّه AesCode-8B، ولا يبدو أن أي جهة أخرى تفعل ذلك بحسب ما يمكننا العثور عليه؛ أي تقييم اليوم يعني الحصول على الأوزان على عتادك الخاص. أقرب شيء قابل للاستدعاء هو البنية التي ضُبط النموذج منها. Qwen3-VL-8B-Instruct هو قابل للتوجيه عبر OrcaRouter الآن مقابل $0.18 لكل مليون رمز إدخال و$0.70 لكل مليون رمز إخراج ضمن سياق من 131,072 رمزاً، ونقطتا التفتيش اللتان نوفرهما فعلاً مسعرتان بالطريقة نفسها — Gemma 4 26B-A4B بسعر $0.06 و$0.33، وGemma 4 31B بسعر $0.13 و$0.38. يمر سعر قائمة المزوّد كما هو دون إضافة أي هامش، ويحدث التبديل الاحتياطي بين المزوّدين تلقائياً، لذا فإن الطريقة الرخيصة لمعرفة ما إذا كانت مطالباتك تؤدي جيداً أصلاً هي اختبار العمود الفقري غير المضبوط أولاً، وإنفاق أسبوع GPU فقط على المطالبات التي تصمد.

أيّ واحد تريده فعلاً؟
اختر AesCode-8B إذا كان الناتج المطلوب صفحة. يُصدر النموذج HTML منظَّمًا وقابلًا للتحرير — الجداول كجداول HTML، والرسوم البيانية كمواصفات ECharts — ما يعني أن الناتج يظهر كفروقات في Git ويمكن لمصمم إعادة تنسيقه دون إعادة توليده. اقبل المقايضة: نقطة تحقق بحثية غير معلَنة بعدد تنزيلات مكوّن من رقمين، وبلا تقييم مستقل، وبلا نقطة نهاية مستضافة، وسياق بحجم 24K لم يُتحقق من صحته إلا على صفحات إنفوجرافيك منفردة، ووسم لغة إنجليزية فقط على البطاقة.
اختر Gemma 4 12B لكل شيء آخر. فهو يقرأ المستندات أفضل من معظم النماذج التي يبلغ حجمها ضعف حجمه، ويتعامل مع الصوت، ويتبع تعليمات الأدوات، ولديه ربع مليون توكن من السياق، ووراءه ثلاثة أشهر ونصف من خبرة الآخرين. إذا كنت تختار واحدًا من هذين ليكون نموذج الرؤية الصغير لديك، ولم يُطلب منك تحديدًا إنتاج عروض شرائح كشيفرة، فهذا هو الجواب.
وإذا كان المطلب الحقيقي هو الاثنان معًا، فلا تتعامل معه على أنه فاصل تعادل. وجّه عمل القراءة إلى نموذج مستضاف، وأبقِ عمل التصيير على أي جهاز قادر على استيعاب الأوزان.
ما الذي سيغيّر هذه الصفحة؟
ثلاث إشارات. إن إعادة إنتاج مستقلة لنتيجة 82.94 والانخفاض المرجعي البالغ 1.00 نقطة ستنقل AesCode-8B من ادعاء مورّد إلى نتيجة، وستجعل مسألة الحجم بين 8B و12B مثيرة للاهتمام حقاً لا اسمياً فحسب. وأي مزوّد استدلال يتبنّى نقطة التحقق هذه سيطوي عمود النشر، وهو حالياً الفارق العملي بأكمله. والورقة التي تستشهد بها Microsoft باعتبارها قيد المراجعة — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — ستجيب عن الأسئلة التي لا تستطيع بطاقة النموذج الإجابة عنها، بدءاً من كيفية تصرف المعيار البصري عندما يكون مخطط التصميم نفسه خاطئاً. وإلى أن يتحقق أحد هذه الأمور، فإن القراءة القابلة للدفاع عنها ضيقة وحقيقية: AesCode-8B بارع جداً في الأجزاء من التصميم البصري التي تستطيع الآلة فحصها، ومتوسط في الجزء الذي لا تستطيع، أما Gemma 4 12B فهو منتج مكتمل يؤدي مهمة مختلفة.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
