
EVIE-8B לעומת EVIE-Preview-4.5B: שיפור של 1.39 נקודות עבור וקטורים רחבים פי 32
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
שלושה שבועות לאחר שטנסנט שחררה את EVIE-Preview-4.5B וכינתה אותו המאחזר המסמכים החזותי המדויק ביותר בלוחות ViDoRe, טנסנט שחררה את EVIE-8B והזיזה בשקט את עמודי השער שעליהם עמד המודל שלה בעל 128 הממדים. EVIE-8B הוא מודל המורה הדגל בעל 8.41B פרמטרים עם אמבדינגס של 4096 ממדים לכל טוקן; EVIE-Preview-4.5B הוא המאחזר הקומפקטי בעל 4.54B פרמטרים שכל הרעיון שלו היה ש-128 ממדים מספיקים כדי לנצח מודלים גדולים ממנו פי ארבעה. בלוח התוצאות המעודכן שבתוך כרטיס ה-EVIE-8B, EVIE-Preview-4.5B נמצא כעת במקום השלישי בתוך המשפחה שלו — מאחורי EVIE-8B החדש ומאחורי EVIE-4.5B, תלמיד שטנסנט שחררה באותו בוקר. אם אתם בוחרים באיזה משני המודלים הנקובים לאנדקס קורפוס מסמכים, המספרים בכרטיסים של טנסנט אומרים שה-8B טוב יותר בכ-1.39 נקודות ב-ViDoRe V3 ובכ-3.36 נקודות ב-ViDoRe V2 — ושהוא דורש פי 32 יותר שטח אינדקס לכל וקטור כדי להגיע לשם. מאמר זה עוסק בשאלה אם העסקה הזו שווה, והוא מתחיל מהסתייגות כנה ששני דפי התוצאות הם של טנסנט עצמה, ואף אחד מהם לא שוחזר באופן בלתי תלוי.
הגרסה הקצרה
• בחר ב-EVIE-8B אם דיוק האחזור הוא צוואר הבקבוק והקורפוס שלך קטן מספיק כך שגודל האינדקס הגולמי לא משנה — אתה מודד באלפי עמודים, לא במיליונים, ואתה רוצה את הרטריבר הפתוח הטוב ביותר שטנסנט פרסמה.
• בחר ב-EVIE-Preview-4.5B אם עלות אינדקס, זמן אחזור לדף או תקציב GPU הם אילוץ אמיתי — הווקטורים ה-128D שלו הם כל הסיבה לקיומו, ופער הדיוק מול ה-8B קטן ב-ViDoRe V1 ומתון ב-V3.
• בדוק שוב את שניהם מול EVIE-4.5B לפני שתתחייב: Tencent שחררה באותו יום מודל סטודנט עם וקטורים הניתנים לקיצור בזמן ריצה ודחיסת טוקנים, שמתעלה על שניהם בגבול היעילות, וכל השוואה שמתעלמת ממנו כבר מיושנת.
יש להתייחס לכל מספר כאן כפי שדווח על ידי היצרן. EVIE-8B לא הופעל על ידי איש מחוץ לטנסנט; הנתונים של EVIE-Preview-4.5B מגיעים מסקריפטי השחזור של טנסנט עצמה.
היכן שהם באמת נבדלים
• פרמטרים — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.
Backbone — Qwen3.5-9B עם קשב דו-כיווני מלא לעומת Qwen3.5-4B עם קשב ליניארי משולב מסוג GatedDeltaNet וקשב מלא.
• אמבדינג — רב-וקטור לכל טוקן בממד 4096 לעומת רב-וקטור מקורי לכל טוקן בממד 128, ושניהם מקבלים ניקוד באמצעות אינטראקציה מאוחרת של MaxSim.
• ViDoRe V1 (10 משימות, nDCG@5) — 92.18 לעומת 91.73.
• ViDoRe V2 (4 משימות, nDCG@5) — 74.23 לעומת 70.87. זהו הפער היחסי הגדול ביותר.
• ViDoRe V3 (48 משימות, nDCG@10) — 66.75 לעומת 65.36.
• תקציב האסימונים החזותיים מאחורי המספרים המרכזיים האלה — 1,024 אסימונים לעמוד עבור ההערכה של EVIE-8B לעומת 1,792 אסימונים לעמוד עבור הדרגה הראשית של EVIE-Preview-4.5B (בדרגת האימון של 768 אסימונים, התצוגה המקדימה משיגה 64.56).
• אינדקס BF16 גולמי למיליון עמודים — לא פורסם עבור EVIE-8B לעומת 179.2 GiB ב-768 טוקנים לעמוד ו-420.5 GiB ב-1,792 עבור התצוגה המקדימה.
• רישיון ושחרור — Apache-2.0, שחרור שקט 2026-09-04 לעומת Apache-2.0, שחרור שקט 2026-08-17.

לוח התוצאות שלמעלה חוזר על אותו דיוקן. יש להחזיק שתי הסתייגויות לנגד העיניים בזמן הקריאה: עמודת EVIE-8B ועמודת EVIE-Preview-4.5B מגיעות משני גיליונות מודל שונים של Tencent, והמספר הראשי V3 של ה-8B נמדד בתקציב אסימונים חזותיים נמוך יותר לדף מאשר המספר הראשי של גרסת ה-Preview-4.5B.
שני כרטיסי טנסנט, מדברים זה עם זה
המסגור הכנה למפגש הזה הוא שזה ויכוח משפחתי, לא תחרות עצמאית. הכרטיס של EVIE-Preview-4.5B, שפורסם ב-17 באוגוסט, טוען ל"Rank #1 על ViDoRe V3" עם 65.36 nDCG@10, כשהוא מנצח את webAI-ColVec1.1-8b ב-0.04. הכרטיס של EVIE-8B, שפורסם ב-4 בספטמבר, מפרט מחדש את אותו 65.36 כמספר השלישי בטיבו בעמוד, מתחת ל-66.75 של EVIE-8B ול-66.02 של EVIE-4.5B, ומראה שה-8B מנצח בכל שמונת התחומים הציבוריים של ViDoRe V3 מול התצוגה המקדימה. שני דוחות הניקוד הופקו עם מערך ההערכה של Tencent עצמו, ולאף אחד מהמודלים אין ריצה עצמאית בשום מקום בספרות עדיין. אז ההשוואה שאתם קוראים היא החשבון של Tencent על Tencent שמביס את Tencent — עקבי פנימית, סביר שזה תוכנן כך במכוון, וללא אימות על ידי מי שאין לו אינטרס בתוצאה.

הכרטיס של tencent/EVIE-8B שלמעלה הוא החזית הציבורית של המתמודד: מורה־דגל בגודל 8.41B עם הטמעות 4096D וטבלת ה־ViDoRe המעודכנת של המשפחה בחלק העליון.

כרטיס ה-tencent/EVIE-Preview-4.5B שלמעלה הוא זה של השחקן הנוכחי: {{1}}מאחזר בגודל 4.54B{{/1}} {{2}}שהווקטורים המקוריים שלו ב-128D ומתמטיקת עלות האינדקס שפורסמה{{/2}} הם עדיין המאפיין המגדיר שלו.
השאלה ששווה 1.39 נקודות
הפער הגולמי ב-ViDoRe V3 קטן — 1.39 נקודות nDCG@10 בין 66.75 של EVIE-8B לבין 65.36 של EVIE-Preview-4.5B — והוא מגיע עם כוכבית על תקציב הטוקנים שחשובה לפריסה. פרוטוקול ההערכה של EVIE-8B מגביל מסמכים ל-1,024 טוקנים חזותיים לעמוד; התצוגה המקדימה (preview) נזקקה ל-1,792 טוקנים לעמוד כדי לרשום את 65.36 שבכותרת, וקיבלה רק 64.56 בתקציב האימון שלה של 768 טוקנים. על פי המספרים האלה, ה-8B אינו רק מדויק יותר בתקציב דומה — הוא מדויק יותר בתקציב קטן יותר, וזה הכיוון הרצוי מבחינת זמן האחזור לעמוד. הניצחון היחסי הגדול יותר הוא ב-ViDoRe V2, שם EVIE-8B מדווח על 74.23 לעומת 70.87 של התצוגה המקדימה, זינוק של 3.36 נקודות בלוח הכולל את משימות המסמכים המסונתזים הקשות יותר. ViDoRe V1, הלוח הוותיק והרווי ביותר, בקושי זז: 92.18 לעומת 91.73. הדפוס הזה — שטוח במקום שבו כולם כבר קרובים לתקרה, מכריע במקום שבו המשימות חדשות וקשות יותר — הוא הפרופיל של עליית יכולות אמיתית ולא רעש בטבלת דירוגים, אבל זו עדיין המדידה של Tencent עצמה.
המדד הוא היריב האמיתי
הדיוק הוא רק מחצית מההחלטה הזאת, משום ששני המודלים מציעים הבטחות שונות בתכלית לגבי מה שאתה מאחסן. הסיבה לקיומו של EVIE-Preview-4.5B היא וקטור הטוקנים המובנה שלו בעל 128 ממדים: כרטיס המודל מפרסם חישוב מדויק של האינדקס (179.2 GiB של אינדקס BF16 גולמי למיליון עמודים בתקציב האימון שלו, ו-420.5 GiB בדרגת האקסטרפולציה) ומצביע על כך שווקטור צר יותר מקצץ את האחסון ואת עבודת ניקוד MaxSim ביחס ישר. וקטורי הטוקנים של EVIE-8B הם בעלי 4096 ממדים — רחבים פי 32 לכל וקטור — וכרטיס המודל של EVIE-8B אינו מפרסם כל נתון על גודל האינדקס. ההשמטה הזו היא כשלעצמה מידע: באותו מספר טוקנים לעמוד, אינדקס BF16 גולמי של EVIE-8B הוא בסדר גודל של פי 32 מזה של ה-Preview, מה שמציב קורפוס של מיליון עמודים בטווח של טרה-בייטים מרובים לפני קוונטיזציה, והופך את מודל הדגל למשהו שמכוונים לכמה מאות אלפי עמודים, לא למשהו שמארחים סתם כך בקנה מידה רחב. רוחבו של מודל הדגל קונה נאמנות אחזור; הוא אינו קונה יכולת פריסה.
האפשרות השלישית שטנסנט שלחה באותו יום
שום ניתוח כן של השוואה זו אינו עוצר בשני הדגמים הנקובים בשמם, כי המהדורה שהכילה את EVIE-8B הכילה גם את EVIE-4.5B — דגם תלמיד בעל 4.61B פרמטרים שזוקק מדגם המורה בעל 8B. הוא מצויד בהשלכה יחידה בת 2048 ממדים, שמצטמצמת בזמן ריצה ל-64, 128, 256, 512, 1024 או 2048 ממדים, ובנוסף במעבר דחיסת טוקנים נטול אימון שטנסנט מכנה HAC, שמקבץ את הטוקנים החזותיים של עמוד לכדי 32–64 וקטורים. לפי כרטיס המודל, טביעת רגל האינדקס שלו מגיעה ל-3.81 GiB למיליון עמודים. בטבלה של טנסנט עצמה, EVIE-4.5B משיג 66.02 ב-ViDoRe V3 — רק 0.73 נקודות מאחורי דגם המורה 8B ו-0.66 נקודות לפני EVIE-Preview-4.5B — מה שהופך אותו לתשובה לדילמה המדויקת שההתמודדות הזו מציבה. אם מה שאתם רוצים הוא "רוב הדיוק של ה-8B בלי האינדקס של ה-8B", טנסנט כבר שחררה את הדגם הזה, והוא אינו אף אחד משני הדגמים שעל שמם נקרא עמוד זה. הטיעון שנותר בעד EVIE-Preview-4.5B הוא צר אך אמיתי: הוא ה-checkpoint שכבר נמצא בייצור עבור כל מי שפרס אותו באוגוסט, ופרופיל ה-128D הקבוע שלו פשוט יותר להבנה מאשר מטריושקה שמבקשת ממך לבחור את מספר הממדים בזמן ריצה.
באיזה מהם כדאי לאנדקס?
התאם את המודל לאילוץ שבאמת מחייב:
• בצע אינדקס ב-EVIE-8B אם אתה בונה את נקודת הייחוס לדיוק — מדד, קורפוס משפטי או מדעי בעל ערך גבוה בן מאות אלפי עמודים, או מערכת שבה החמצות אחזור הן יקרות והאחסון זול. אתה משלם עבור החלק העליון של עקומת המשפחה, והמשפחה מייעדת את התלמיד 4.5B להיות הדבר שתגדיל בקנה מידה מאוחר יותר.
• הישארו עם EVIE-Preview-4.5B אם כבר ביצעתם אינדוקס באמצעותו ואיכות המדידה מקובלת — אינדוקס מחדש הוא עלות ממשית, ורווח ה-V3 שהייתם רודפים אחריו הוא 1.39 נקודות בכרטיס ספק שאיש לא אימת באופן עצמאי.
הערך את EVIE-4.5B לפני כל אחת מהאפשרויות אם אתה מתחיל מאפס בהיקף משמעותי. קיצוץ ה-Prefix-MRL ודחיסת ה-HAC מכוונים ישירות לחשבון האחסון שתואר לעיל, והמספרים של Tencent עצמה מציבים אותו במרחק נגיעה מהמודל המורה.
לאף אחד מהשלושה אין API מתארח בשום פלטפורמה, כולל OrcaRouter, ולכן שלב האחזור הוא החלטת אירוח עצמי בכל מקרה. השלב שאחריו לא חייב להיות כזה. ראוטר כמו זה ש-OrcaRouter מריץ על פני 200+ מודלים משאיר את המודל שקורא את הדפים המאוחזרים וכותב את התשובה מאחורי API יחיד, עם failover אוטומטי בין ספקים ועם מחירי המחירון של הספקים שמועברים הלאה ב-0% תווך — וזה בדיוק התצורה שאתה רוצה כשהמאחזר שמזין אותו הוא צ'קפוינט בן שלושה ימים עם טענות לא מאומתות. בנה את האינדקס עם המאחזר שמתאים לאחסון שלך, ושמור על שאר הפייפליין בר-החלפה עד שמישהו מחוץ לטנסנט יאשר איזה מכרטיסי הניקוד האלה הוא אמיתי.
