بطاقة عنوان رئيسية لـ 'AstaBrief 8B مقابل Gemma 4 12B: كاتب متخصص في مواجهة نموذج متعدد المهام يجيد كل شيء'، تُقابل بين كاتب التقارير أحادي المهمة والنموذج المتعدد الوسائط العام الذي يبلغ 11.95B معلمة، مع شعار OrcaRouter في الزاوية.
Guides & Insights

AstaBrief 8B مقابل Gemma 4 12B: كاتب متخصص في مواجهة خبير عام يفعل كل شيء

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ينتمي AstaBrief 8B وGemma 4 12B إلى الفئة نفسها من حيث الحجم وإلى الترخيص نفسه، وبعد ذلك هما إجابتان عن سؤالين مختلفين. AstaBrief 8B هو نموذج Ai2 مفتوح الأوزان بحجم 8B، صدر بتاريخ 2026-10-02 ومضبوط بدقة انطلاقًا من Qwen3-8B، وهو يفعل شيئًا واحدًا: يحوّل سؤالًا بحثيًا ومقتطفات من الأدبيات المسترجَعة إلى تقرير موثّق بالاستشهادات، في تمريرة واحدة، خلال نحو 51 ثانية من البداية إلى النهاية. Gemma 4 12B هو نموذج DeepMind الموحّد متعدد الوسائط بحجم 11.95B، ونموذج عام بترخيص Apache-2.0 يستقبل النص والصور والصوت والفيديو على نحو أصلي ويتعامل مع 256,000 رمز من السياق. أحدهما مِبضع يؤدّي مهمة واحدة أسرع من خط الأنابيب متعدد الأغراض الذي حلّ محلّه؛ والآخر هو صندوق الأدوات بأكمله، على الجهاز.

الإغراء هو أن تُعلن أن النموذج المتخصص أفضل في مهمته وتمضي قدماً. أما السؤال الأكثر فائدة، إذا كنت تنشر على بطاقة رسوميات استهلاكية واحدة، فهو ما إذا كانت ميزة النموذج الضيق كبيرة بما يكفي لتبرير تشغيل حزمتين تقنيتين بدلاً من واحدة — والجواب يتوقف على أرقام لم يحصل أي من المختبرين على تحقق مستقل بها.

الأجزاء التي تتداخل فعلاً

كلاهما نموذجان كثيفان مفتوحا الأوزان يمكن استيعابهما على بطاقة واحدة، وكلاهما بترخيص Apache-2.0، وكلاهما متاح للتنزيل بدلاً من أن يكونا خلف واجهة برمجة تطبيقات. هذا القدر يمثّل تداخلًا حقيقيًا، وهو السبب الذي يجعل المقارنة تستحق العناء من الأساس.

وفيما عدا ذلك، فالتباين كلي، ويقوم صفّان بمعظم العمل.

• المعاملات — AstaBrief 8B: كثيف بنحو 8B، أوزان BF16 في فئة وحدة معالجة رسوميات واحدة. Gemma 4 12B: كثيف 11.95B، بنية موحّدة خالية من المُرمِّز.

• الوسائط في — AstaBrief 8B: نص فقط، وتحديدًا سؤال مع مقتطفات. Gemma 4 12B: نص وصورة وصوت وفيديو، مع إسقاط الصوت والرؤية مباشرةً في فضاء تضمين وحدة فك الترميز عبر طبقات خطية خفيفة بدلًا من مُشفِّرات منفصلة.

• الوسائط الصادرة — كلاهما: نص. يُصدر AstaBrief 8B تقريرًا مزوّدًا بالاستشهادات؛ ويُصدر Gemma 4 12B نصًا عاديًا بالشكل الذي تطلبه.

• السياق — AstaBrief 8B: الحد الأقصى لموضع النموذج الأساسي البالغ 40,960 رمزًا، والمُدرَّب عند 32 ألف. Gemma 4 12B: 256,000 رمزًا، مع نظام انتباه هجين يُشبك الانتباه المحلي بنافذة منزلقة (نافذة 1024 رمزًا) مع الانتباه العالمي، و RoPE متناسب على الطبقات العالمية للحفاظ على ذاكرة السياق الطويل تحت السيطرة.

• التدريب — AstaBrief 8B: ضبط دقيق بإشراف على 47 ألف مثال لتقارير، ثم نحو 6 آلاف زوج من DPO، على ثماني وحدات H100. Gemma 4 12B: التدريب المسبق العام لدى Google DeepMind بالإضافة إلى الضبط بالتعليمات، وموثّق في تقرير تقني.

• المهمة — AstaBrief 8B: مهمة واحدة، إنشاء التقارير مع الاستشهادات. Gemma 4 12B: الاستدلال، والبرمجة، وسير العمل الوكيلي، والدردشة متعددة اللغات عبر أكثر من 140 لغة.

• درجات مستقلة — لا يوجد أي منها لـ AstaBrief 8B خارج جداول Ai2 الخاصة. يظهر Gemma 4 12B على لوحات الصدارة العامة، بما في ذلك Artificial Analysis، حيث تُقيَّم عائلة الإصدار؛ وهذه أرقام طرف ثالث وهي الوحيدة في هذا المقال التي لم يقدمها مورّد.

اقرأ صف السياق باعتباره الفرق البنيوي، لا كنقطة في ورقة مواصفات. سقف 40K لدى AstaBrief 8B ليس قيدًا تتحايل عليه Ai2؛ بل هو نتيجة التصميم. لا يحتفظ النموذج أبدًا بمجموعة نصوص كاملة، بل بمقتطفات فقط اختارها شخص آخر وحدّد حجمها. تعني نافذة 256K لدى Gemma 4 12B أنه يمكن تناول المهمة نفسها دون طبقة استرجاع على الإطلاق — ألصق كمية كبيرة من المواد واسأل — وهو معمار مختلف جوهريًا لتحقيق النتيجة ذاتها، ويُدمج نظامين في نظام واحد.

أين يتفوق المتخصص، وبأي مقدار

حجة Ai2 لصالح AstaBrief هي السرعة، وهي حجة وجيهة. فقد بلغ متوسط خط أنابيب Thinking المدعوم من Claude الخاص به 178.5 ثانية لكل تقرير؛ بينما يبلغ متوسط AstaBrief عند كتابة التقرير كاملًا في مرور واحد 51.1 ثانية، أي أسرع بنحو 3.5 مرة، وتزعم Ai2 أن هذا التبسيط لم يأتِ على الجودة في مقاييسه المتتبعة.

الشركة التي تهم هنا ليست Claude، بل السقالات متعددة الخطوات نفسها — تلخيص المقتطفات، والتجميع الموضوعي، والكتابة قسمًا بقسم — وكل ذلك يحذفه AstaBrief. وهذه السقالات هي العمل نفسه الذي سيتعين عليك بناؤه فوق أي نموذج عام، بما في ذلك Gemma 4 12B، إذا أردت منه تقريرًا منظمًا وموثّقًا بالاستشهادات. النموذج العام إذا طُلب منه "تقرير موثّق بالاستشهادات" فسيُنتج واحدًا؛ لكن جعله ينتج واحدًا وفق مخطط ثابت، مع مفاتيح استشهاد تتطابق مع قائمة المصادر، هو هندسة أوامر تملكها أنت وتصونها.

ادّعاء الجودة هو النقطة التي عليك أن تتباطأ فيها.

• متوسط SQABench-CS2، تقسيم الاختبار (حسب إفادة المورّد) — AstaBrief 8B 87.0، ونقطة التحقق SFT الخاصة به 83.7، والنموذج الأساسي Qwen3-8B 77.3. 100 سؤال في علوم الحاسوب من كتابة المستخدمين.

• DeepScholarBench (المُبلَّغ عنها من المورد) — AstaBrief 8B 53.50، متأخر عن Asta ScholarQA الخاصة بـ Ai2 عند 60.25 و DR-Tulu-8B عند 56.26.

• في مقارنة ثنائية مقابل خط أنابيب Ai2 المدعوم بـ Claude (بحسب ما أوردته الشركة المورّدة) — فوز بنسبة 55% في مجموعة التطوير، و72% في الاختبار.

• دراسة بشرية (بحسب ما أفاد به المورّد) — 14 سؤالًا من ثلاثة باحثين، وفُضِّل DR-Tulu إجمالًا، وأشار اثنان من الثلاثة إلى دقة الاستشهادات في AstaBrief.

لا يوجد نتيجة مكافئة لـ Gemma 4 12B على SQABench-CS2، في أي من الاتجاهين. هذا الغياب هو المركز الصادق لهذه المقارنة: لا يمكنك وضع رقم على جودة تقارير Gemma 4 12B مقابل جودة تقارير AstaBrief 8B، لأن لا أحد شغّل النموذج العام عبر أداة الاختبار الخاصة بـ Ai2 ولا أحد يتظاهر بذلك. أي شخص يخبرك أن النموذج المتخصص "أفضل بـ26 نقطة" إنما يقارن رقم مورّد باللا شيء.

A screenshot of the Hugging Face model card for google/gemma-4-12B-it showing the 'Any-to-Any' pipeline tag, the Apache 2.0 licence line, the gemma4_unified and image-text-to-text tags, the arXiv identifier 2607.02770, the 12B parameter size and a downloads-last-month figure of 1,902,430.

حيث يفوز صاحب المهارات المتعددة فوزًا ساحقًا

مزايا Gemma 4 12B ليست هامشية ويسهل التقليل من شأنها.

الأول هو الاتساع. AstaBrief 8B مكوّن يتوقّع أن تُسلَّم إليه الأدلة. Gemma 4 12B يقرأ لقطات الشاشة، ويستمع إلى الصوت، ويشاهد الفيديو، ويكتب التعليمات البرمجية، ويحتفظ بمحادثة من 256K. إذا كان عملك يتضمن الأشكال في الأوراق البحثية، أو الأحاديث المسجلة، أو مواد مصدرية متعددة الوسائط، فإن المتخصص لا يستطيع المشاركة إطلاقًا ويُغلق السؤال.

الثاني هو أن التعرض العام الواسع هو بحد ذاته شكل من أشكال الأدلة. يظهر Gemma 4 12B على لوحات ترتيب تابعة لجهات خارجية؛ وتمتد العائلة عبر خمسة أحجام من E2B حتى 31B؛ كما تُنشر كل من المتغيرات المضبوطة بالتعليمات والمُدرَّبة مسبقًا إلى جانب تقرير فني. هذا مصدر عادي وممل وقابل للتحقق — وهو بالضبط ما يفتقده كل من AstaBrief 8B والفئة الأوسع من نماذج البحث المتخصصة.

الثالثة هي التكلفة العملية لحزمة ثانية. تشغيل AstaBrief 8B لكتابة التقارير إلى جانب نموذج عام لكل ما عدا ذلك يعني وجود نموذجين مقيمين في الذاكرة، وصيغتي تلقين، وأداتي تقييم، ومساري ترقية. على بطاقة واحدة بسعة 24GB في BF16، هذا ليس مجانيًا — وبطاقة AstaBrief تحذّر من أنه ضُبط بدقة مقابل صيغة تلقين واحدة محددة، نُشرت كملف مجموعة بيانات، وأن استخدام صيغة مختلفة قد يُضعف السلوك. النموذج العام لا يعاني من هذا الارتباط.

• Gemma 4 12B (وفق ما أبلغ عنه المورّد) — مؤشر الذكاء 9 في تهيئة الاستدلال؛ لا توجد قيمة Gemma قابلة للمقارنة في معايير الأداء الواردة في تقرير Ai2.

• عائلة Gemma 4 — خمسة أحجام من E2B حتى 31B، بترخيص Apache-2.0، مع نشر تقرير تقني، وحضور على لوحات الصدارة من جهات خارجية.

• Gemma 4 26B A4B، مُقدَّم في كتالوجنا — ‏$0.06 لكل مليون رمز إدخال، ‏$0.33 لكل مليون رمز إخراج، نافذة سياق بحجم 262,144 رمزًا. كما يتم توجيه Gemma 4 31B أيضًا، بسعر ‏$0.13 / ‏$0.38.

• Gemma 4 12B، محلي — 11.95B كثيف، سياق 256K، انتباه هجين بنافذة منزلقة وانتباه عام، نافذة محلية بحجم 1024 رمزًا.

من حيث التوافر، تُستضاف نماذج Gemma 4 تجاريًا: Gemma 4 26B A4B مسار مباشر في كتالوجنا بسعر $0.06 لكل مليون رمز إدخال و$0.33 لكل مليون رمز إخراج، بنافذة سياق تبلغ 262,144 رمزًا، كما أن Gemma 4 31B موجَّه أيضًا. هذا مهم لأنه يعني أنه يمكنك تقييم الذراع العامة دون امتلاك GPU على الإطلاق. لا يقدّم أي مزوّد في كتالوجنا AstaBrief 8B، بما في ذلك نحن — فهو نموذج يُنزَّل ويُشغَّل، والطريقة الأمينة لاستخدامه هي على عتاد تتحكم به، أو داخل منتج Asta الخاص بـ Ai2.

إجراء المقارنة بنفسك، بتكلفة منخفضة

القرار الذي لا يستطيع هذا المقال أن يتخذه نيابةً عنك هو القرار الذي يمكنك اتخاذه في غضون ظهيرة واحدة، لأن التجربة غير متناظرة في التكلفة. يحتاج AstaBrief 8B إلى أوزان محلية وإلى صيغة التوجيه المنشورة الخاصة به؛ يمكنك تشغيله على بطاقة واحدة باستخدام vLLM وفق التكوين الذي توثّقه Ai2، بدرجة حرارة 0.7 وtop-p 0.95. أما ذراع التعميم فيمكن أن يكون نداءً مستضافًا — فـ Gemma 4 26B A4B بسعر 0.06 دولار للإدخال و0.33 دولار للإخراج لكل مليون رمز قريب بما يكفي في الروح للمعايرة عليه، ويمكنك توجيه أداة الاختبار الخاصة بك إلى كليهما دون امتلاك وحدة معالجة رسومات ثانية.

ثم قِس الأمر الذي لا تقيسه جداول البائعين: على أسئلتك، وبمقتطفاتك، كم عدد التقارير التي تعود مُستشهَدًا بها بشكل صحيح، وكم تستغرق السلسلة كاملة بعد أن تضيف طبقة الربط الخاصة بمخطط الاستشهادات إلى الجانب العام. إن مضاعف 3.5x لدى Ai2 مُقاس مقابل خط أنابيب Ai2 نفسه، وليس مقابل Gemma 4 12B، وستبدو تلك الفجوة مختلفة في منظومتك.

إبقاء الذراع العامة خلف واجهة برمجية واحدة هو ما يجعل تكرار هذا رخيصًا بدلًا من كونه مشروعًا لمرة واحدة: واجهة برمجية واحدة عبر أكثر من 200 نموذج، سعر القائمة لدى المزوّد يُمرَّر كما هو دون أي هامش ربح (0%)، بحيث يصل أي تخفيض من البائع إلى فاتورتك في اليوم نفسه، تجاوز فشل تلقائي عند تدهور أداء مزوّد، ولغة توجيه DSL إذا أردت أن تستجيب عدة نماذج معًا. الفكرة ليست الولاء لأي من النموذجين؛ بل إن إعادة إجراء المقارنة في الربع القادم ينبغي أن تكون تغييرًا في الإعدادات، لأن كلا هذين النموذجين سيُستبدلان.

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration tag, the apache-2.0 licence, the qwen3 and deep-research tags and the role descriptor for Ai2, as the reference point for the specialist arm of the comparison.

أي واحد يجب عليك تنزيله فعليًا

اختر AstaBrief 8B إذا كان المُخرَج تقريراً بحثياً موثّقاً بالمراجع ولديك طبقة استرجاع تغذّيه. إن التصميم أحادي المرور إنجاز هندسي حقيقي، وانخفاض زمن التوليد بمقدار 3.5 مرة هو سبب وجوده، كما أن ترخيص Apache-2.0 مع بيانات التدريب المنشورة يجعله قابلاً للتدقيق، ولن يضاهي أي نموذج عام بنية مخرجاته دون أن تبني أنت السقالات وتصونها بنفسك.

اختر Gemma 4 12B إذا كان عملك أوسع نطاقًا من التقارير، أو إذا كانت مصادرك متعددة الوسائط، أو إذا كانت سعة السياق 256K تتيح لك تخطّي بناء طبقة استرجاع على الإطلاق، أو إذا أردت النموذج الذي ترتبط باسمه تقييمات من أطراف ثالثة ومسار مستضاف يمكنك استدعاؤه اليوم.

ولاحظ اللاتماثل الصادق في الأدلة، لأنه يضر بالمتخصص: أرقام AstaBrief 8B، بما في ذلك أكثرها إقناعًا من بين أرقامها، تأتي من Ai2، وتصف مجموعة مقارنة لعام 2025 يقول المختبر إنه لم يُعِد تشغيلها، وتضم دراسة بشرية من أربعة عشر سؤالًا. أما أرقام Gemma 4 12B فتأتي من أشخاص لا يعملون في Google. وفرق المصدر هذا يستحق أكثر من بضع نقاط على معيار لم يُشغِّله أحد على كليهما.