
EVIE-8B مقابل EVIE-Preview-4.5B: زيادة بمقدار 1.39 نقطة لمتجهات أعرض بـ 32 ضعفًا
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
بعد ثلاثة أسابيع من إصدار Tencent لنموذج EVIE-Preview-4.5B ووصفه بأنه مسترجع المستندات البصرية الأكثر دقة على لوحات ViDoRe، أصدرت Tencent نموذج EVIE-8B وحرّكت بهدوء معايير القياس التي كان نموذجها ذو الـ128 بُعدًا يعتمد عليها. فـ EVIE-8B هو المعلم الرئيسي بحجم 8.41 مليار معلمة، وبأبعاد 4096 لكل توكين للتضمين؛ بينما EVIE-Preview-4.5B هو المسترجع المضغوط بحجم 4.54 مليار معلمة، وكانت فكرته الجوهرية أن 128 بُعدًا كافية للتفوق على نماذج أكبر منه بأربعة أضعاف. وعلى لوحة الصدارة المحدّثة داخل بطاقة EVIE-8B، يحتل EVIE-Preview-4.5B الآن المركز الثالث ضمن عائلته الخاصة — خلف EVIE-8B الجديد وخلف EVIE-4.5B، وهو نموذج تلميذ أصدرته Tencent في الصباح نفسه. وإذا كنت تختار أيّ النموذجين المذكورين لتعتمد عليه في فهرسة مجموعة مستندات، فإن الأرقام على بطاقات Tencent تشير إلى أن نموذج 8B أفضل بنحو 1.39 نقطة على ViDoRe V3 وأفضل بنحو 3.36 نقطة على ViDoRe V2 — وأن ذلك يتطلب مساحة فهرسة أكبر بـ32 مرة لكل متجه. تتناول هذه المقالة ما إذا كانت تلك المقايضة تستحق العناء، وتبدأ من تحذير صريح مفاده أن بطاقتي النتائج تعودان إلى Tencent نفسها، ولم تتم إعادة إنتاج أي منهما بشكل مستقل.
النسخة المختصرة
• اختر EVIE-8B إذا كانت دقة الاسترجاع هي العائق وكانت مجموعة مستنداتك صغيرة بما يكفي بحيث لا يهم حجم الفهرس الخام — فأنت تتعامل مع آلاف الصفحات، وليس ملايينها، وتريد أفضل مسترجِع مفتوح نشرته Tencent.
• اختر EVIE-Preview-4.5B إذا كانت تكلفة الفهرسة، أو زمن الاستجابة لكل صفحة، أو ميزانية GPU قيدًا حقيقيًا — فمتجهاتها 128D هي السبب الكامل لوجودها، والفجوة في الدقة مقارنةً بنسخة 8B صغيرة على ViDoRe V1 ومتواضعة على V3.
• أعد التحقق من كليهما مقابل EVIE-4.5B قبل أن تلتزم: أصدرت Tencent نموذجًا تلميذيًا في اليوم نفسه يتمتع بمتجهات قابلة للاقتطاع وقت التشغيل وضغطٍ للرموز، وهو ما يتفوق به على كليهما عند حدود الكفاءة، وأي مقارنة تتجاهله تكون متجاوزة بالفعل.
• اعتبر كل رقم هنا كما أبلغت به الجهة المورّدة. لم يقم أحد خارج Tencent بتشغيل EVIE-8B؛ أما أرقام EVIE-Preview-4.5B فمصدرها سكربتات إعادة الإنتاج الخاصة بـ Tencent.
حيث يختلفان فعليًا
• المعلمات — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.
البنية الأساسية — Qwen3.5-9B مع انتباه ثنائي الاتجاه الكامل مقارنةً بـ Qwen3.5-4B مع انتباه خطي متناوب عبر GatedDeltaNet وانتباه كامل.
• التضمين (Embedding) — متجهات متعددة لكل رمز بأبعاد 4096 مقابل متجهات متعددة أصلية لكل رمز بأبعاد 128، وكلاهما مُقيَّم باستخدام MaxSim للتفاعل المتأخر.
• ViDoRe V1 (10 مهام، nDCG@5) — 92.18 مقابل 91.73.
• ViDoRe V2 (4 مهام، nDCG@5) — 74.23 مقابل 70.87. هذه هي أكبر فجوة نسبية.
• ViDoRe V3 (48 مهمة، nDCG@10) — 66.75 مقابل 65.36.
• ميزانية الرموز المرئية الكامنة خلف تلك الأرقام الرئيسية — 1,024 رمزًا لكل صفحة لتقييم EVIE-8B مقابل 1,792 رمزًا لكل صفحة لمستوى EVIE-Preview-4.5B الرئيسي (وعند مستوى التدريب البالغ 768 رمزًا، تحقق النسخة المعاينة 64.56).
• مؤشر BF16 الخام لكل مليون صفحة — لم يُنشر لـ EVIE-8B مقابل 179.2 GiB عند 768 توكنًا/صفحة و420.5 GiB عند 1,792 للمعاينة.
• الترخيص والإصدار — Apache-2.0، إصدار هادئ 2026-09-04 مقابل Apache-2.0، إصدار هادئ 2026-08-17.

لوحة النتائج أعلاه تعيد صياغة الصورة نفسها. أبقِ تحفّظين في ذهنك أثناء قراءتها: عمود EVIE-8B وعمود EVIE-Preview-4.5B مأخوذان من بطاقتَي نموذج مختلفتين من Tencent، ورقم V3 الرئيسي لإصدار 8B مُقاس بميزانية رموز بصرية لكل صفحة أقل من رقم الإصدار التجريبي الرئيسي.
بطاقتان من تينسنت، تتحدثان إلى بعضهما البعض
الإطار الصادق لهذه المواجهة هو أنها خلاف عائلي، وليست منافسة مستقلة. بطاقة EVIE-Preview-4.5B الخاصة، التي نُشرت في 17 أغسطس، تدّعي "المرتبة رقم 1 على ViDoRe V3" عند 65.36 nDCG@10، متغلبًا على webAI-ColVec1.1-8b بفارق 0.04. بطاقة EVIE-8B، المنشورة في 4 سبتمبر، تعيد إدراج نفس الرقم 65.36 باعتباره ثالث أفضل رقم في الصفحة، أدنى من 66.75 الخاص بـ EVIE-8B و66.02 الخاص بـ EVIE-4.5B، وتُظهر أن نسخة 8B تفوز على النسخة الأولية في جميع مجالات ViDoRe V3 العامة الثمانية. تم إنتاج بطاقتي الأداء باستخدام منصة التقييم الخاصة بشركة Tencent، ولا يوجد حتى الآن أي تشغيل مستقل لأي من النموذجين في أي من الأدبيات. لذا فإن المقارنة التي تقرأها هي سردية Tencent لتغلب Tencent على Tencent — متسقة داخليًا، ومن المحتمل أنها صُممت بهذه الطريقة عمدًا، ولم يتحقق منها أي شخص لا تربطه مصلحة بالنتيجة.

بطاقة tencent/EVIE-8B أعلاه هي السطح العام للمتحدي: معلّم رئيسي بحجم 8.41B مع تضمينات 4096D وجدول ViDoRe المحدَّث للعائلة في الأعلى.

بطاقة tencent/EVIE-Preview-4.5B أعلاه هي بطاقة النموذج الحالي: مسترجع بحجم 4.54 مليار معامل، ولا تزال متجهاته الأصلية ذات الدقة 128D وحسابات تكلفة الفهرس المنشورة هي السمة المميزة له.
السؤال ذو النقطة 1.39
الفجوة الخام في ViDoRe V3 صغيرة — 1.39 نقطة nDCG@10 بين 66.75 لـ EVIE-8B و65.36 لـ EVIE-Preview-4.5B — وهي تأتي مع علامة نجمية تتعلق بميزانية الرموز المميزة ذات أهمية للنشر. بروتوكول التقييم الخاص بـ EVIE-8B يحدّ المستندات بـ 1,024 رمزًا مرئيًا لكل صفحة؛ بينما احتاج النموذج الأولي إلى 1,792 رمزًا لكل صفحة ليحقق نتيجته البارزة 65.36، ولم يسجّل سوى 64.56 ضمن ميزانية التدريب الخاصة به البالغة 768 رمزًا. وبناءً على هذه الأرقام، فإن 8B ليس أكثر دقة فحسب عند ميزانية مماثلة — بل هو أكثر دقة عند ميزانية أصغر، وهو الاتجاه الذي تريده لتأخير الاستجابة لكل صفحة. أما المكسب النسبي الأكبر فهو على ViDoRe V2، حيث يسجّل EVIE-8B 74.23 مقابل 70.87 للنموذج الأولي، أي قفزة بمقدار 3.36 نقطة على اللوحة التي تتضمن مهام المستندات المركّبة الأصعب. أما ViDoRe V1، الأقدم والأكثر تشبعًا بين اللوحات، فلا يتحرك إلا بالكاد: 92.18 مقابل 91.73. هذا النمط — ثبات حيث يكون الجميع قريبين من السقف بالفعل، وحسم حيث تكون المهام أحدث وأصعب — هو سمة زيادة قدرات حقيقية لا مجرد ضجيج على لوحة الصدارة، لكنه مع ذلك مجرد قياس من Tencent نفسها.
المؤشر هو الخصم الحقيقي
الدقة ليست سوى نصف هذا القرار، لأن النموذجين يقدمان وعودًا مختلفة جذريًا حول ما تخزنه. سبب وجود EVIE-Preview-4.5B هو متجه الرموز الأصلي ذو الأبعاد الـ128: إذ تنشر البطاقة حسابات دقيقة للمؤشر (179.2 جيبي بايت من مؤشر BF16 الخام لكل مليون صفحة في ميزانية تدريبها، و420.5 جيبي بايت في المستوى المُستقرأ) وتشير إلى أن المتجه الأضيق يقلل مساحة التخزين وعمل تسجيل MaxSim بشكل تناسبي مباشر. أما متجهات الرموز في EVIE-8B فتبلغ أبعادها 4096، أي أوسع بـ32 مرة لكل متجه، وبطاقة EVIE-8B لا تنشر أي رقم لحجم المؤشر على الإطلاق. هذا الإغفال بذاته معلومة: عند العدد نفسه من الرموز لكل صفحة، يكون مؤشر BF16 الخام لـ EVIE-8B في حدود 32 ضعفًا لمثيله لدى النموذج الأولي، مما يضع مجموعة مليون صفحة ضمن نطاق التيرابايتات قبل التكميم، ويجعل النموذج الرائد موجهًا لبضع مئات الآلاف من الصفحات لا شيئًا تستضيفه على نطاق واسع بشكل اعتيادي. عرض النموذج الرائد يشتري دقة الاسترجاع؛ لكنه لا يشتري قابلية النشر.
الخيار الثالث الذي أصدرته Tencent في نفس اليوم
لا تتوقف أي نسخة صادقة من هذه المقارنة عند النموذجين المذكورين، لأن الإصدار الذي ضمّ EVIE-8B ضمّ أيضًا EVIE-4.5B — نموذجًا طالبًا بحجم 4.61B تم تقطيره من المعلم 8B، مع إسقاط أحادي بُعد 2048 يُقتطع وقت التشغيل إلى 64 أو 128 أو 256 أو 512 أو 1024 أو 2048 بُعدًا، بالإضافة إلى تمرير ضغط الرموز بدون تدريب الذي تسميه Tencent "HAC"، وهو يجمع الرموز البصرية للصفحة إلى 32–64 متجهًا، ووفقًا لبطاقة النموذج، بصمة فهرسة تبلغ 3.81 GiB لكل مليون صفحة. على جدول Tencent الخاص، يسجّل EVIE-4.5B نتيجة 66.02 على ViDoRe V3 — بفارق 0.73 فقط خلف المعلم 8B، و0.66 أمام EVIE-Preview-4.5B — ما يجعله الإجابة على المعضلة الدقيقة التي تطرحها هذه المواجهة. إذا كنت تريد "معظم دقة 8B دون فهرسة 8B"، فإن Tencent قد أصدرت هذا النموذج بالفعل، وهو ليس أيًّا من النموذجين اللذين تحمل الصفحة عنوانهما. أما حالة EVIE-Preview-4.5B المتبقية فضيّقة لكنها حقيقية: فهو نقطة التحقق الموجودة بالفعل في الإنتاج لأي شخص نشره في أغسطس، وملفه الثابت بـ128D أبسط في التعامل المنطقي من ماتريوشكا تطلب منك اختيار بُعدك وقت التشغيل.
أيها يجب أن تفهرس به؟
طابِق النموذج مع القيد الذي يقيّد فعليًا:
• قم بالفهرسة عند EVIE-8B إذا كنت تبني نقطة المرجعية للدقة — معيارًا، أو مدونة نصوص قانونية أو علمية عالية القيمة تمتد لمئات الآلاف من الصفحات، أو نظامًا تكون فيه أخطاء الاسترجاع مكلفة والتخزين رخيصًا. أنت تدفع مقابل قمة منحنى العائلة، والعائلة تقصد أن يكون نموذج الطالب 4.5B هو ما توسّع نطاقه لاحقًا.
• ابقَ على EVIE-Preview-4.5B إذا كنت قد فهرست به بالفعل وكانت الجودة المقيسة مقبولة — فإن إعادة الفهرسة تكلفة حقيقية، والمكسب من V3 الذي تسعى إليه هو 1.39 نقطة على بطاقة مورّد لم يؤكدها أحد بشكل مستقل.
• قيّم EVIE-4.5B قبل أيٍّ منهما إذا كنت تبدأ من جديد على نطاقٍ ذي مغزى. إن اقتطاع Prefix-MRL وضغط HAC موجَّهان مباشرةً إلى حسابات التخزين الواردة أعلاه، وأرقام Tencent الخاصة تضعه على مسافة قريبة من المعلم.
لا يوفّر أيٌّ من الخيارات الثلاثة واجهة برمجة تطبيقات مستضافة على أيّ منصة، بما في ذلك OrcaRouter؛ لذا فإن مرحلة الاسترجاع قرارٌ يعتمد على الاستضافة الذاتية في كل الأحوال. غير أنّ المرحلة التي تليها لا يلزم أن تكون كذلك. الموجّه الذي يديره OrcaRouter عبر أكثر من 200 نموذج يُبقي النموذجَ الذي يقرأ صفحاتك المسترجَعة ويكتب الإجابة خلف واجهة API واحدة، مع تجاوزٍ تلقائيٍّ للفشل (failover) بين المزودين، وتمريرٍ لأسعار المزودين المعلَنة بهامش ربحٍ يساوي 0٪ — وهذا هو الإعداد المطلوب على وجه التحديد عندما يكون المُسترجِع الذي يغذّي هذا النظام نقطةَ فحصٍ لم يتجاوز عمرُها ثلاثة أيام وادّعاءاتُها غير مُتحقَّقة. ابنِ الفهرسَ بالمُسترجِع الذي يناسب تخزينك، وأبقِ بقية خطوط المعالجة (pipeline) قابلةً للتبديل حتى يؤكّد شخصٌ من خارج Tencent أيٌّ من بطاقات الأداء هذه هو الحقيقي.
