כרטיס כותרת גיבור עבור 'AstaBrief 8B מול ContextPilot 8B: שתי תשובות לאותו מודל בסיס 8B', תוך ציון בסיס Qwen3-8B המשותף ושני התפקידים המנוגדים, עם הלוגו של OrcaRouter בפינה.
Guides & Insights

AstaBrief 8B לעומת ContextPilot 8B: שתי תשובות לאותו מודל בסיס 8B

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שימו את AstaBrief 8B ואת ContextPilot 8B על גיליון מפרט אחד, ושש השורות הראשונות זהות. שניהם צ׳קפוינטים צפופים של 8B שעברו כיוונון עדין מ-Qwen/Qwen3-8B. שניהם יורשים את אותה ארכיטקטורה — 36 שכבות, גודל נסתר 4096, 32 ראשי קשב עם 8 ראשי מפתח-ערך, אוצר מילים של 151,936 טוקנים, ותקרת המיקום של 40,960 טוקנים של מודל הבסיס. אף אחד מהם אינו ארכיטקטורה חדשה, ואף אחד מהם לא מנסה להיות כזו. אלו שתי מעבדות שלוקחות את אותם משקלי בסיס קפואים ומלמדות אותם שתי עבודות שונות, והעבודות מצביעות על שני קצוות מנוגדים של סוכן מחקר ארוך-טווח: AstaBrief 8B כותב את הדוח המצוטט המוגמר, ו-ContextPilot 8B מונע מההקשר העבודה של הסוכן לקרוס בזמן שהוא אוסף את החומר.

זו כל ההשוואה בשורה אחת, ולכן זה גם לא ראש בראש שכדאי לקרוא אותו כ"המנצח לוקח את הכל". בכל הנוגע לרישוי, לראיות ולדרישות ריצה, שני המודלים נבדלים לחלוטין זה מזה, והפער הזה מאלף יותר מכל ציון שפרסמה מי מהמעבדות.

אותה גיאומטריית נקודת ביקורת, שתי הורשות שונות

התחל ממה שבאמת משותף, מפני שהוא תוחם את כל השאר. גם AstaBrief 8B של Ai2 וגם ContextPilot 8B של Tencent מצהירים על Qwen3-8B כבסיס שלהם, ושניהם מתעגלים לכ-8 מיליארד פרמטרים. המאגר של ContextPilot 8B מתעד 16.38 GB של משקולות BF16 הפרוסות על פני ארבעה שברי safetensors, וזה המשקל של מודל צפוף 8B. תקרת ההקשר היא של הבסיס, ואינה משתנה בשני המודלים: 40,960 פוזיציות בתצורה, אומן ב-32K וניתן להארכה עם YaRN. אף אחד מהמודלים אינו מודל הקשר ארוך. AstaBrief 8B לא צריך להיות כזה, מפני שמקבל קטעים ולא קורפוס. ContextPilot 8B במכוון אינו כזה, מפני שהתזה שלו היא לגרום לחלון קטן לעבוד קשה יותר.

מה שכל מעבדה שינתה הוא מטרת האימון, ומטרות אלו בקושי יכולות להיות שונות יותר.

• שיטת אימון-המשך — AstaBrief 8B: כיוונון עדין מפוקח ואחר כך אופטימיזציה ישירה של העדפות במצב לא-מקוון, 47 אלף דוגמאות SFT וכ-6 אלף זוגות העדפה, על שמונה H100.

• שיטת פוסט-אימון — ContextPilot 8B: למידת חיזוק על גבי מסגרת פרואקטיבית לניהול הקשר, עם מיזוג וקטור-משימה של שלוש הרצות SFT מתמחות המונחות על גבי הבסיס המקורי.

• המשימה — AstaBrief 8B: לכתוב דוח רב-סעיפים עם ציטוטים מוטמעים מתוך שאלה בתוספת קטעי ספרות שנשלפו, במעבר אחד.

• העבודה — ContextPilot 8B: לתכנן, לשמור זיכרון לטווח ארוך, לשלוף מאינדקס, ולפרוק הקשר שהסוכן לא צריך כרגע, תוך שהוא ממשיך להסיק ולהפעיל כלים.

• זמן ריצה — AstaBrief 8B: הגשה סטנדרטית עם vLLM או Transformers, בתוספת פורמט הפרומפט המומלץ מתוך מאגר הנתונים AstaBrief_prompts.

• סביבת הרצה — ContextPilot 8B: סביבת ההרצה של סוכן Tencent, הגדרות הכלים וצינור ההערכה ממאגר Tencent/ContextPilot. נקודת הביקורת לבדה אינה סוכן מתפקד.

• רישיון — AstaBrief 8B: Apache-2.0. ContextPilot 8B: טקסט Apache-2.0 מותאם אישית עם סעיף 0 נוסף המגביל את השימוש למחקר ופיתוח.

• עדויות — AstaBrief 8B: טבלאות בנצ'מרק כפי שדווחו על ידי הספק בתוספת נתוני שימוש מוקדמים בייצור מפלטפורמת Asta של Ai2. ContextPilot 8B: טענות במאמר arXiv שהתקבל למסלול הראשי של EMNLP 2026; כרטיס המודל אינו כולל מספרים ואף צד שלישי לא שחזר אותם.

שתי שורות ברשימה הזו עושות יותר עבודה מהשאר. שורת הרישיון קובעת אם בכלל תוכלו לשלב את המודל במוצר: התנאים של AstaBrief 8B תחת Apache-2.0 מתירים שימוש מסחרי, ואילו הסעיף הנוסף של ContextPilot 8B אינו מתיר זאת. שורת זמן הריצה קובעת כמה מהמעבדה תצטרכו לאמץ יחד עם המשקלים. AstaBrief 8B הוא צ'קפוינט שאפשר להכניס ישירות למחסנית הגשה קיימת. ContextPilot 8B הוא רכיב במסגרת, והחלקים שמאפשרים למסגרת לפעול — חוזה הכלים, לוגיקת הרולאאוט, הקצאת הקרדיט — נמצאים בקוד של Tencent, לא ברסיסים שאתם מורידים.

A two-column scoreboard headed 'AstaBrief 8B vs ContextPilot 8B — the scoreboard'. The AstaBrief column reads base model Qwen3-8B, job 'write the cited report', post-training 'SFT then DPO', context 40K inherited, licence Apache 2.0, evidence 'vendor tables only'; the ContextPilot column reads base model Qwen3-8B, job 'manage agent context', post-training 'RL plus task-vector merge', context 40K inherited, licence 'research-only clause', evidence 'paper claims only'. A footer reads 'Both vendor-reported, unreproduced; no independent scores yet.'

היכן שכל אחד מהם באמת מצדיק את מקומו

הדרך השימושית להשוות ביניהם היא כסוכני־משנה סמוכים בצינור ששתי המעבדות מתכנסות אליו מכיוונים מנוגדים.

לסוכן סינתזת ספרות יש שכבת אחזור, שכבת הקשר ושכבת יצירה. ContextPilot 8B תוקף את שכבת ההקשר: הוא מעניק לסוכן תכנון, זיכרון ארוך-טווח מובנה עם הערות כתיבה/עדכון/קריאה, אחזור מעל אינדקס, ופריקת הקשר רכה, כך שחלון צנוע נשאר שמיש לאורך מסלול ארוך. הטענה של המאמר היא שמודלים קודמים לעריכת הקשר חלקו שלוש חולשות, והמסגרת מתייחסת אליהן יחד — ערכת כלים רחבה יותר, rollout חלקי מודע-הקשר שממקד את החקירה בעריכות שבאמת משנות את המסלול, והקצאת קרדיט עדינה. יעדי ההערכה הם QA בהקשר ארוך וחיפוש עמוק: InfBench, NovelQA, LongMemEval, BrowseComp+, לפי הקריאה המוקדמת שלנו של המאגר.

AstaBrief 8B תוקף את שכבת היצירה, והוא מניח שבעיית ההקשר כבר נפתרה במעלה הזרם. הוא לא מאחזר, לא מסכם קטעים, לא מקבץ נושאים, ולא מחליט אילו ראיות לשמור. Ai2 הסירה את כל זה מתפקיד המודל ואימנה אותו לכתוב את הדוח במעבר אחד מתוך קטעים שמישהו אחר בחר. ההימור הוא שהפיגומים היקרים לא היו המקום שבו שכנה האיכות: Ai2 מדווחת שהשכתוב במעבר אחד השתווה לפייפליין הרב-שלבי המופעל על ידי Claude במדדים הנמדדים שלה, תוך קיצור זמן היצירה של הפייפליין המלא מ-178.5 שניות ל-51.1 שניות.

ביחד, שני המודלים מתארים חלוקת עבודה שכל אחת מהמעבדות הייתה יכולה לשרטט בעצמה. האחד שומר על קבוצת העבודה קטנה ועל זרימת הראיות. האחר הופך את הראיות ששרדו לפרוזה עם ציטוטים מצורפים. מצבי הכשל משלימים זה את זה ולא חופפים: מנהל הקשר שמשמיט את הקטע הלא נכון מרעיל כותב טוב, וכותב טוב שקיבל לידיו קטעים גרועים מפיק דוח רהוט על הדבר הלא נכון.

ההשלמה ההדדית הזו היא נימוק להתייחס לכל אחד מהם כרכיב בר־החלפה ולא כהתחייבות. אם תבנה את מחצית ההקשר עם ContextPilot 8B, מחצית הפקת הדוחות אמורה לשבת מאחורי ממשק שלא אכפת לו איזה מודל נמצא מאחוריו — AstaBrief 8B באירוח עצמי בצד אחד, ומודל חזית מתארח בצד השני, והיכולת לעבור ביניהם בלי לשכתב את הצינור. הרצת שתי הזרועות דרך נקודת קצה אחת היא מה שהופך את זה לשינוי תצורה ולא להגירה: API אחד על פני יותר מ-200 מודלים עם מחיר המחירון של הספק שמועבר הלאה בתוספת של 0%, מעבר אוטומטי לגיבוי כאשר ספק מתדרדר, וכן DSL לניתוב כשאתה רוצה לשלב כמה מודלים לקריאה אחת. הכותב באירוח עצמי נשאר באירוח עצמי כי זה החלק עם סיפור רגישות הנתונים; כל מה שסביבו נשאר ניתן לניתוב כי שם הגמישות זולה.

A screenshot of the Hugging Face model card for Tencent/ContextPilot-8B showing the TextGeneration tag, the 'other' licence line, the qwen3, context-management, tool-use and agent tags, the arXiv identifier 2608.28476 and the model title 'ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL'.

המצב הכנה של הראיות

לאף אחד מהמודלים אין לוח תוצאות עצמאי, ושתי המעבדות אפילו לא מודדות את אותו הדבר.

• AstaBrief 8B, ממוצע SQABench-CS2 (כפי שדווח על ידי הספק): 87.0 בחלוקת הבדיקה, לעומת 83.7 עבור צ'קפוינט ה-SFT שלה עצמה ו-77.3 עבור Qwen3-8B הבסיסי.

• AstaBrief 8B, DeepScholarBench (לפי דיווח הספק): 53.50, מאחורי Asta ScholarQA של Ai2 עצמה ב-60.25 ו-DR-Tulu-8B ב-56.26.

• AstaBrief 8B, שיעור ניצחונות בהשוואה זוגית מול הפייפליין מבוסס Claude של Ai2 (לפי דיווח הספק): 55% ב-SQABench-CS2 dev, 72% ב-test.

• ContextPilot 8B: הנתונים מופיעים רק במאמר, במבחני QA להקשר ארוך ולחיפוש מעמיק; אין מספרים בכרטיס הדגם ואין רפרודוקציה מצד שלישי.

הסתייגות אחת חלה על כל הטור של AstaBrief, ו-Ai2 מציינת אותה בבלוג עצמו: רוב האימון וההערכה הושלמו ב-2025, כך שמודלי ההשוואה משקפים את החזית של אותה עת, והמעבדה לא הריצה מחדש את ההערכה מול מודלי החזית הנוכחיים. יש לקרוא את האחוזים האלה כראיה לבחירה עיצובית בנקודת זמן, ולא כדירוג נוכחי. המספרים של ContextPilot 8B נושאים את ההסתייגות הרגילה של מאמר — מערך בנצ'מרקים שנבחר באופן עצמי, הרנס שהורץ באופן עצמי, ללא שחזור מחוץ ל-Tencent.

הסתייגות שנייה היא ספציפית ל-AstaBrief 8B וקל למעוד עליה בפועל. הכרטיס שלו מזהיר שהצ'קפוינט עבר כיוונון עדין מול פורמט פרומפט אחד, שפורסם כקובץ דאטהסט, ושפורמטים אחרים עלולים לפגוע בהתנהגות. אם תבחנו אותו עם הארנס שיחה גנרי, אתם מודדים את ההארנס שלכם לא פחות מאשר את המודל.

איזה אחד אתה רוצה

בחרו ב-AstaBrief 8B כאשר התוצר הוא המסמך. הוא ברישיון Apache-2.0, הוא פועל על GPU בודד במחלקת 8B BF16, הוא אינו זקוק למסגרת סוכנים סביבו, והוא מאומן במיוחד עבור פלט אחד בדיוק: דוח עם ציטוטים שנבנה מראיות שמישהו אחר אסף. הרישיון המסחרי הוא הגורם המכריע עבור רוב הצוותים, והגישה של Ai2 עצמה של מאגר פתוח — משקולות, תערובת SFT, תערובת DPO, ופורמט פרומפט, כולם מפורסמים — היא מה שהופך אותו לניתן לביקורת ולא רק לחינמי.

בחרו ב-ContextPilot 8B כאשר התוצר הוא מסלול פעולה עובד והבעיה שלכם היא שהסוכן שוכח או טובע. רישיון המחקר בלבד מוציא אותו מדיון לשם שימוש בייצור עבור רוב החברות, ודרישת זמן הריצה פירושה שאתם מאמצים את המסגרת של Tencent, ולא רק מודל. אם אתם בוחנים ניהול הקשר פרואקטיבי כטכניקה, זהו מקום מתועד היטב להתחיל בו. אם אתם צריכים לשחרר לפרודקשן, זה לא.

ואם אתם זקוקים לשתי היכולות, התשובה אינה אף מודל לבדו — היא הצמד, מחווט כך שכל אחד מהם ניתן להחלפה. הדבר היחיד שהשוואה הזו לא אמורה להניב הוא מנצח יחיד, מפני ששני הצ'קפוינטים לא מתחרים על אותה משבצת במערכת.