بطاقة عنوان مُولّدة تحمل النص 'AREX-2 مقابل Gemma 4 12B - أحدهما نموذج'، مع لوحتين. اللوحة اليسرى، التي تحمل عنوان Gemma 4 12B، تسرد: صدر في 3 يونيو 2026؛ 11.95B معامل، كثيف؛ سياق 256K، Apache 2.0؛ حمّله اليوم. اللوحة اليمنى، التي تحمل عنوان AREX-2، تسرد: أُنشئ المستودع في 29 سبتمبر 2026؛ لم تُرفع أي أوزان؛ لا بطاقة، لا وسم ترخيص؛ غير قابل للتنزيل. يقرأ التذييل 'أحد العمودين نموذج. والآخر طابع زمني.' شعار OrcaRouter مركّب في الزاوية اليمنى السفلى.
Guides & Insights

AREX-2 مقابل Gemma 4 12B: أحدهما نموذج

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

مقارنة بين Gemma 4 12B وAREX-2 لها خاصية لا يتمتع بها أي تنافس آخر على هذه المدونة: أحد العمودين فارغ لأن النموذج في ذلك الجانب غير موجود بعد. Gemma 4 12B منتج تم إطلاقه فعليًا — نشرته Google DeepMind في 3 يونيو 2026 كنموذج كثيف مفتوح الأوزان يضم 11.95 مليار معامل بموجب Apache 2.0، مع بطاقة نموذج كاملة، ونافذة سياق تبلغ 256 ألف رمز، وإدخال صوتي وصوري أصلي، وثلاثة أشهر ونصف من الاختبار المستقل وراءه. أما AREX-2 فهو مستودع على Hugging Face أنشأته BAAI في 29 سبتمبر 2026 عند 17:56 بالتوقيت العالمي المنسق ولم تضع فيه أي شيء بعد: لا أوزان، ولا بطاقة، ولا وسم ترخيص، ولا تقييم، ولا إعلان.

هذا التفاوت ليس سببًا لتخطّي المقارنة. بل هو المقارنة نفسها. السؤال الجدير بالإجابة ليس أيّهما أفضل — فلا شيء يستطيع الإجابة عن ذلك حتى تصبح لدى AREX-2 ملفات — بل هل سينافس وكيل أبحاث BAAI من الجيل الثاني أصلًا نموذجًا طرفيًا بحجم 12B، أم أنّ هذين الاثنين يشغلان موضعين في مكدّس لا يتلامسان فيه أبدًا. الخطأ في ذلك هو الخطأ المكلف، لأنه الخطأ الذي يقود فريقًا إلى وضع ميزانية للشيء الخطأ.

الجانب الذي تم شحنه، وفقًا لشروطه الخاصة

Gemma 4 12B هو العضو الصغير في عائلة Google المفتوحة من الجيل الرابع، وخياره التصميمي المميز معماري: فهو يستغني كليًا عن مُرمِّز الرؤية المنفصل ويغذّي رقع الصور الخام والموجات الصوتية مباشرة إلى المحوّل. هذه ليست خدعة في المعايير. إنها ما يجعل النموذج محمولًا حقًا — نحو 27 GB من أوزان BF16 التي تُكمَّم إلى أقل من 7 GB، وبطاقة تحدد 16 GB من VRAM كهدف للنشر. على حاسوب محمول أو بطاقة واحدة متوسطة المدى، هذا نموذج يمكنك امتلاكه فعليًا.

ويترتب على ذلك ملف القدرات. فبطاقة Google الخاصة — وهي مبلّغ عنها من المورّد، ويجدر وسمها بذلك — تُدرج DocVQA 94.9 وInfoVQA 88.4 لفهم المستندات، وMMLU-Pro 77.2، وGPQA Diamond 78.8، وAIME 2026 77.5، وLiveCodeBench v6 72.0 في وضع التفكير. أما Artificial Analysis، وهي مستقلة، فتقيّم إعداد الاستدلال عند Intelligence Index قدره 14، وتقيسه عند 114 رمزًا في الثانية، وتضع سعرًا لاستدعاء نموذجي مخدوم عند 0.10 دولار لكل مليون رمز إدخال و0.30 دولار لكل مليون رمز إخراج. ومدخلنا الخاص في الكتالوج للنموذج الأكبر Gemma 4 31B يحمل 85.7 على GPQA Diamond. وشكل ذلك هو نموذج عام صغير قوي على نحو غير معتاد في المستندات والصور، ومعقول في الاستدلال، وبعيد كل البعد عن نموذج رائد في الأعمال الصعبة متعددة الخطوات.

لذا فإن وصف مهمته محدد بوضوح: استدلال محلي أو في بيئة مستأجر واحد، وفهم المستندات ولقطات الشاشة، وحلقات وكيلية متواضعة، وأي حالة لا يمكن للبيانات أن تغادر فيها المبنى. وهو ليس محرك بحث معمّق، ولا تسوّقه Goog​le على هذا النحو.

A screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a speed rank of 19 of 142, $0.10 per million input tokens and $0.30 per million output, a 256K-token context window, text, image, speech and video input with text output, and the note that it is among the leading models in intelligence but somewhat expensive for its size. The page header reads 'Released June 2026' and 'Open weights model'.

الجانب الآخر، وهو اسم وطابع زمني

كل ما يمكن تأكيده بشأن AREX-2 هذا الأسبوع يتّسع في جملة واحدة. إنه مستودع تحت منظمة BAAI على Hugging Face، أُنشئ في 29 سبتمبر 2026، ويحتوي على .gitattributes ملف ولا شيء آخر — صفر بايت من بيانات النموذج المخزَّنة، صفر تنزيلات، لا بطاقة نموذج، لا إعلان ترخيص، ولا نشر من مزوّد. BAAI نفسها لم تُعلن شيئًا.

ما يجعله جديرًا بالتدوين هو العائلة التي سُمّي باسمها. طُرحت سلسلة AREX التابعة لـ BAAI في 23 يوليو 2026 بنموذجين: AREX-Base، وهو مزيج خبراء بـ122 مليار معلمة مع 10 مليارات معلمة نشطة، مبني على Qwen3.5-122B-A10B، وAREX-Turbo، وهو نموذج كثيف بحجم 4 مليارات مبني على Qwen3.5-4B. كلاهما بترخيص Apache 2.0. كلاهما وكيلا بحث عميق وليسا نموذجَي محادثة — حلقة داخلية تجمع الأدلة وتنتج إجابة مرشحة مع رقم ثقة، وحلقة خارجية تتحقق من تلك الإجابة مقابل القيود الأصلية ويمكنها تحسين المسار بالكامل أو إعادة تشغيله. وفق أرقام BAAI المنشورة، يبلغ AREX-Base 82.5 على BrowseComp، و85.4 على GAIA، و89.9 على DeepSearch QA؛ ويبلغ AREX-Turbo 70.7 و81.6 و78.5 على الاختبارات الثلاثة نفسها.

كل تلك الأرقام مصدرها البائع نفسه، ولم يُعِد أحد إنتاج أي منها بشكل مستقل. كما أنها تخص نموذجًا مختلفًا. لا توجد أرقام لـ AREX-2، والرقم "2" لا يخبرك بشيء عن الحجم أو العمود الفقري أو البنية المعمارية — فقد يكون الجيل الثاني في هذا الخط وكيلًا أكبر، أو عملية تقطير أصغر، أو إطارًا أُعيد تدريبه مع استبدال العمود الفقري.

هل يلتقي هذان الاثنان أصلًا؟

هنا تصبح المقارنة أكثر فائدة مما تبدو عليه. خُذ القراءتين المعقولتين لما سيصير إليه AREX-2.

إذا كان وكيل بحث من الجيل الثاني على أي مقياس يقارب حجم Base، فإنه و Gemma 4 12B لا يتنافسان قط. فـ 122B mixture-of-experts الذي يقود بحثًا متعدد المصادر هو خدمة مستضافة، تُحاسب لكل رمز، ومرتبطة بالشبكة؛ أما Gemma 4 12B فهو نقطة تحقق تنزّلها وتشغّلها بنفسك. والاختيار بينهما ليس مقارنة جودة، بل قرار بشأن ما إذا كان عبء العمل لديك حلقة بحث أم نقطة نهاية استدلال.

إذا اتضح أن AREX-2 ينتمي إلى الفئة الصغيرة — خليفةً لـ 4B Turbo بدلًا من 122B Base — فإن الاثنين يتشاركان الرف نفسه، وتصبح المقارنة حقيقية. ستكون تلك النسخة من AREX-2 نحو ثلث عدد معلمات Gemma 4 12B، متخصصة في البحث المدفوع بالأدوات بدلًا من الاتساع متعدد الوسائط، وستُقاس على BrowseComp وGAIA بدلًا من DocVQA. نموذجان صغيران، أحدهما محسّن للاحتفاظ بمسار بحثي طويل، والآخر للرؤية والقراءة على عتاد متواضع. لا ينبغي لفريق يبني خط توثيق أن يهتم بالأول؛ ولا ينبغي لفريق يبني وكيل بحث أن يهتم بالثاني.

• ما الموجود — يمكن تنزيل Gemma 4 12B اليوم مع بطاقة كاملة. أما AREX-2 فهو مستودع لا يحتوي على أي ملفات.

• المعاملات — 11.95B كثيفة لـ Gemma 4 12B. غير مذكورة، ولا يمكن استنتاجها إلا من اسم منتج، بالنسبة لـ AREX-2.

• السياق — 256 ألف رمز (262,144 موضعًا) لـ Gemma 4 12B. غير معروف لـ AREX-2.

• الوسائط — النص والصورة والصوت مدعومة في Gemma 4 12B. غير معروف بالنسبة إلى AREX-2؛ فقد كان الجيل الأول من AREX نصًا مع استخدام الأدوات.

• الترخيص — Apache 2.0 لـ Gemma 4 12B، مذكور على البطاقة. لم يُذكر لـ AREX-2؛ وكان AREX-Base وAREX-Turbo مرخّصين بموجب Apache 2.0.

• ما الغرض منه — استدلال متعدد الوسائط قابل للنشر على عتادك الخاص، مقابل — استنادًا إلى ما تُظهره العائلة — البحث بعيد المدى وتجميع الأدلة في مواجهة نقطة نهاية مُستضافة.

A generated two-column card headed 'Two deployment shapes, and only one of them exists'. It contrasts where Gemma 4 12B runs (local or single-tenant; about 27 GB BF16, under 7 GB quantised, 16 GB VRAM target; no rate card or per-token meter) against where AREX-Base runs (a 122B mixture-of-experts, a cluster or a hosted endpoint billed per token), names tokens per search step times steps per trajectory as the cost driver for the AREX shape, and notes that AREX-2 is neither shape because there are no files in the repository. A footer reads 'Is this a quality comparison? Not until one side has a model in it.' The OrcaRouter logo is composited in the bottom-right corner.

الجزء الذي يمكن مقارنته فعليًا: أين يعمل كل واحد

بما أن مقارنة القدرات غير متاحة، فإن مقارنة النشر هي المقارنة الصادقة التي يجب إجراؤها، وهي ليست متقاربة.

Gemma 4 12B يعمل حيث تضعه. لا توجد بطاقة أسعار، ولا عداد لكل رمز، ولا مزود بينك وبين النموذج — التكلفة هي العتاد والكهرباء، ونمط الفشل هو تخطيط السعة الخاص بك. عندما طُرح AREX-Base في يوليو، في المقابل، كان مزيج خبراء بحجم 122B: نموذج تستضيفه على عنقود أو تستأجره بالرمز، ووُجد 4B Turbo الخاص بالعائلة نفسها تحديدًا لأن لهذا الاختيار ثمنًا. إذا اتبع الجيل الثاني الشكل نفسه، فستكون اقتصاديات AREX-2 دالة على الرموز المستهلكة لكل استعلام مضروبة في عدد خطوات البحث التي يتخذها المسار — وهو رقم أكبر بكثير بالنسبة لوكيل بحث عميق مما هو لنموذج قراءة مستندات، لأن الوكيل يعيد قراءة سياق متنامٍ في كل تكرار.

هنا حيث تتوقف طبقة التوجيه عن كونها تجريدًا وتبدأ تكون بندًا في الفاتورة. إذا انتهى بك الأمر إلى تشغيل وكيل بحثي مقابل نموذج مستضاف بينما تُبقي Gemma 4 12B محليًا لأعمال المستندات، فهذان تكاملان في الحالة العادية. عبر واجهة API واحدة أمام أكثر من 200 نموذج — مع تمرير سعر قائمة المزود دون إضافة هامش ربح، بحيث يصل تغيير سعر البائع في اليوم نفسه — فهما مفتاح واحد وفاتورة واحدة وعميل واحد، ويمكن لقاعدة تجاوز الفشل نقل الطلب بعيدًا عن مزود يمر بساعة سيئة دون أن تعلم حلقة الوكيل الخاصة بك. نحن نوجّه Gemma 4 26B-A4B و Gemma 4 31B اليوم؛ نحن لا نوجّه 12B، ولا يوجد أي شيء من خط AREX في كتالوجنا أيضًا، لذا إذا كان أي من هذين هو النموذج الذي تحتاجه، فهو يأتي من توزيع البائع نفسه.

ماذا تفعل هذا الأسبوع

إذا كنت بحاجة إلى نموذج متعدد الوسائط مدمج يمكنك تشغيله بنفسك، فإن القرار لم يكن يومًا معلقًا على AREX-2. إن Gemma 4 12B متاح للشحن، وموثّق، ومُقيَّم بشكل مستقل، وقابل للنشر، بينما عمود المقارنة في الجهة الأخرى فارغ. لا تشترِ شيئًا بناءً على اسم محجوز.

إذا كنت تبني وكيل بحث عميق وكان خط AREX هو ما تريده فعلاً، فالشيء الذي يجب مراقبته ليس الاسم بل الشجرة: ما إذا كانت safetensors تظهر في ذلك المستودع، وماذا تقول البطاقة عن عدد المعاملات، وأي وسم ترخيص يُلحق به. صدر الجيل الأول بترخيص Apache 2.0، وإذا فعل الجيل الثاني ذلك أيضًا، يصبح السؤال سؤال استضافة لا سؤال ترخيص. حتى ذلك الحين، AREX-Base هو نموذج AREX الذي يمكنك تشغيله فعلاً، وهو متاح منذ يوليو.

الشيء الوحيد الجدير بالقول بوضوح عن المقارنة التي يُفترض ظاهريًا أن هذا المقال يدور حولها: صفحة VS يكون أحد طرفيها إيداعًا في مستودع والآخر نموذجًا تم شحنه ليست مواجهة، بل جدول زمني. يقول الجدول إن Gemma 4 12B متاح الآن، بينما AREX-2 غير متاح على الإطلاق.