כרטיס כותרת הירו עבור המאמר 'AstaBrief 8B: כותב הדוחות הפתוח של Ai2 רץ פי 3.5 מהר יותר מהפייפליין שהוא מחליף', עם תווית של תזמון 51.1 s לעומת 178.5 s, רישיון Apache-2.0 ובסיס Qwen3-8B, עם הלוגו של OrcaRouter בפינה.
Guides & Insights

AstaBrief 8B: כותב הדוחות הפתוח של Ai2 מהיר פי 3.5 מהפייפליין שהוא מחליף

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המספר הכותרתי מהודעת ההשקה של AstaBrief 8B של Ai2 הוא קריאת שעון עצר, לא ציון בנצ'מרק: לאורך כל צינור Asta, המודל החדש מייצר דוח מחקר עם ציטוטים בממוצע של 51.1 שניות, לעומת 178.5 שניות במסלול מבוסס Claude שלצדו הוא ניצב כעת. זה מהיר פי כ-3.5, והוא נובע מהחלטה ארכיטקטונית אחת — לכתוב את כל הדוח במעבר אחד במקום לסכם, לקבץ לאשכולות ואז לכתוב סעיף אחר סעיף. AstaBrief 8B הוא מודל עם משקולות פתוחות של 8B, ברישיון Apache-2.0, שעבר כיוונון עדין מ-Qwen3-8B, שמקבל שאלת מחקר בתוספת קטעי ספרות שנשלפו ומחזיר דוח עם ציטוטים בתוך הטקסט. הוא שוחרר אל פלטפורמת Asta של Ai2 כ-"Fast mode" ב-2026-10-02, והמשקולות, נתוני האימון ותהליך עבודה מקומי לדוגמה פורסמו לציבור באותו יום.

המאגר ישן יותר מההכרזה, ולזה יש משמעות.

פרט אחד בפרסום הזה ראוי לומר אותו בבירור, משום שהוא משנה את האופן שבו עליך לקרוא את כל השאר: המאגר של Hugging Face בכתובת allenai/AstaBrief_8B נושא חתימת זמן יצירה פנימית של 2026-02-09, ומערך הנתונים הנלווה של DPO מתוארך לנובמבר 2025. ההכרזה מ-2 באוקטובר אמיתית — פוסט הבלוג, הציוץ של AI2 וכרטיס המודל כולם הופיעו באותו יום — אבל ההיסטוריה של המאגר ארוכה יותר מכפי שמחזור החדשות מרמז.

מה שקרה ב-2 באוקטובר הוא ש-Ai2 שחררה ותיעדה את הדבר, ועדכנה את המאגר בהתאם: שלושה קומיטים נחתו על כרטיס המודל בין 16:18:06 ל-16:18:20 UTC ביום ההשקה, והוסיפו תבנית תגובה לתבנית הצ'אט והסירו טוקן חסר השפעה. אלה עבודות תחזוקה על כרטיס, לא אימון מחדש. Ai2 גם מפורשת בבלוג ש"רוב האימון וההערכה שתוארו הושלמו ב-2025", ושהמודלים הקנייניים ששימשו ליצירת נתוני אימון וכנקודות השוואה "משקפים את החזית באותו זמן". המעבדה אומרת שהיא לא הריצה מחדש את ההערכה המלאה מול מודלי החזית של היום.

A screenshot of the Ai2 blog post 'Open-sourcing AstaBrief, the fast report-generation model in Asta', dated October 2, 2026, showing the opening paragraphs about grounding scientific answers in evidence.

אז זהו שחרור GA של עבודה שהושלמה ברובה ב-2025 — השקה, עם התיעוד של השקה והאינטגרציה הפלטפורמית של השקה, על גבי צ'קפוינט שקיים בחשבון המעבדה כבר חודשים. שום דבר בזה אינו לא ישר, והמודל חדש לכולם מחוץ ל-Ai2. אבל זה כן אומר שמספרי ההשוואה למטה מתארים חזית של 2025, ו-Ai2 אומרת זאת בעצמה.

מה AstaBrief 8B בעצם עושה

לפלטפורמת Asta של Ai2 יש תכונת יצירת דוחות שבה חוקרים מביאים שאלה משמעותית וגוף ספרות, ומקבלים בחזרה סינתזה מצוטטת שהם מתייחסים אליה כתוצר עבודה. תכונה זו פעלה בעבר כולה על מה ש-Ai2 מכנה Thinking mode: צינור רב-שלבי שמסכם קטעים שנשלפו, מקבץ אותם תמטית, וכותב את התשובה סעיף אחר סעיף, בגיבוי מודלים של Claude. Thinking mode הוא יסודי ואיטי.

AstaBrief 8B הוא מצב Fast. בהינתן אותה שאלה ואותם קטעים שנשלפו, הוא כותב את הדוח הסופי במעבר קדימה אחד. הטענה של Ai2 היא החלק המעניין: עקיפת סיכום הקטעים, האשכול, והלולאה סעיף-אחר-סעיף לא פגעה באיכות הדוח, לפחות לפי המדדים שהמעבדה עקבה אחריהם. המודל אינו מנוע חיפוש והוא אינו שולף — הוא הכותב בסוף צינור אחזור, והוא מצפה שימסרו לו את הראיות.

זה הופך אותו לרכיב ולא למוצר. זו גם הסיבה ש-Ai2 שחררה תהליך עבודה לדוגמה לצד המשקלים: ספרייה קטנה שהופכת קבצי PDF משלך לדוחות, במאגר ai2-scholarqa-lib, נותנת לך נקודת התחלה להפקה מקומית.

מתכון האימון הוא משעמם בכוונה, וזו בדיוק הנקודה

העבודה הקודמת של Ai2 עצמה, DR Tulu, הראתה שלמידת חיזוקים יכולה לשפר יצירת דוחות ארוכים במודלים עם משקלים פתוחים. עבור AstaBrief, הצוות שקל את הנתיב הזה ובחר שלא ללכת בו, בנימוק שלמידת חיזוקים אינה יציבה ויקרה ושהוא רצה משהו שקל יותר לאתר בו באגים. מה שהצוות בנה במקום זאת הוא כיוונון עדין מפוקח, ואחריו אופטימיזציה ישירה של העדפות באופן לא מקוון. שני שלבים, שניהם קונבנציונליים.

שלב ה-SFT החל משאילתות אמיתיות שהוגשו דרך מערכת Asta של Ai2 ולא מפרומפטים סינתטיים. מתוך הלוגים שנאספו סיננה הקבוצה לפי איכות, רלוונטיות ופרטיות — סינון תעבורת בוטים ובודקי בטא, השמטת שאילתות קצרות מדי מכדי להיות משמעותיות, והרצת מעבר LLM כדי לתפוס שאילתות שאינן באנגלית, בקשות שאינן מדעיות ופרומפטים המכילים מידע אישי. כך נותר מאגר של 90,000 שאילתות ממוקדות מחקר. יעדי דוח מלא עבור אותן שאילתות נוצרו באמצעות צינור העבודה הרב-שלבי ScholarQA, תוך שימוש ב-Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini ו-GPT-4.1 כמודלים תומכים. לאחר סינון איכות: 47,000 דוגמאות אימון שמישות.

שלב ה-DPO היה זקוק למשהו אחר — זוגות של דוחות עם העדפה ביניהם. דוח אחד לכל שאילתה הגיע מצינור ה-ScholarQA; הדוח המתחרה הגיע מהזנת הקטעים שנשלפו על ידי ScholarQA למודל אחר, מתוך o3, o4-mini, DeepSeek-V3 או DeepSeek-R1. שני שופטים, GPT-4.1 ו-DeepSeek-R1, בחרו מנצח לכל זוג, ורק זוגות שבהם שני השופטים הסכימו שרדו. Ai2 מדווחת על 95% הסכמה בין שופטי ה-LLM להעדפות אנושיות. מערך ההעדפות הסופי מנה בערך 6,000 דוגמאות. גם תערובת ה-SFT וגם תערובת ה-DPO נמצאות ב-Hugging Face לבדיקה.

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration and PyTorch tags, the apache-2.0 licence line, the qwen3 and deep-research tags, the Ai2 organisation badge and the start of the model card text about supervised fine-tuning and offline DPO.

הממצא שהכי ניתן להעברה הוא גם הפחות זוהר. ריצות SFT מוקדמות כתבו דוחות טובים יותר אך פיגרו בדיוק התשובות ובאיכות הציטוטים, ולכן הצוות בחן ארבעה מסננים מבוססי סטטיסטיקה על נתוני האימון הסינתטיים: יחס טוקנים של פלט לקלט, רלוונטיות אחזור ממוצעת של מאמרים מצוטטים, צפיפות ציטוטים (שיעור הטענות הנושאות לפחות ציטוט אחד), ומגוון ציטוטים. הרווחים הגדולים ביותר הגיעו מסינון החוצה של דוחות סינתטיים בעלי צפיפות ציטוטים נמוכה — וסינון אגרסיבי יותר, שילובי מסננים וסריקות קצב למידה לא הוסיפו רווחים משמעותיים. המסקנה של Ai2 ראויה להילקח מעבר למודל הזה: ההתמחות לא הייתה עניין של לשפוך עוד טקסט מדעי לתוך האימון המקדים, אלא של ההרכב והאיכות של נתוני השלב שאחרי האימון המקדים.

לוח התוצאות ש-Ai2 פרסם, ואיך לקרוא אותו

A screenshot of the Hugging Face dataset page for allenai/AstaBrief_DPO_Mix showing the cc-by-nc-4.0 licence, the json format tag and the dataset viewer with a 6.62k-row train split and prompt, chosen and rejected columns.

כל נתון להלן מדווח על ידי הספק. הוא מגיע מכרטיס המודל והבלוג של Ai2, שהופקו על ידי מערכת ההערכה של המעבדה עצמה, ואף חלק ממנו לא שוחזר באופן עצמאי. היעד העיקרי היה SQABench-CS2, קבוצה של 100 שאלות מחקר במדעי המחשב שנכתבו על ידי משתמשים, שנמדדת לפי ארבעה מדדים: ריקול של מרכיבים (כיסוי של תוכן הכרחי), דיוק תשובה (האם כל פסקה רלוונטית), דיוק ציטוט (האם כל ציטוט תומך בטענתו), וריקול של ציטוטים (האם טענות נתמכות במלואן בציטוטים שניתנו).

• ממוצע כולל — AstaBrief 8B 87.0, צ'קפוינט ה-SFT של עצמו 83.7, Qwen3-8B הבסיסי 77.3

• זכירת מרכיבים — AstaBrief 8B 90.2, SFT 85.2, Qwen3-8B 77.8

• דיוק תשובות — AstaBrief 8B 89.0, SFT 90.4, Qwen3-8B 90.6

• דיוק ציטוטים — AstaBrief 8B 90.5, SFT 87.7, Qwen3-8B 76.2

• אחזור ציטוטים — AstaBrief 8B 78.2, SFT 71.3, Qwen3-8B 64.6

קראו את השורות יחד ושלב ה-DPO נראה ממוקד ולא טוב יותר באופן אחיד. הממוצע הכללי עולה, ריקול המרכיבים ושני מדדי הציטוט עולים בחדות, ודיוק התשובה יורד במעט מתחת גם לצ'קפוינט SFT וגם למודל הבסיס. אם מקרה השימוש שלך הוא רלוונטיות לכל פסקה מעל לכל, הכיוונון העדין אינו בהכרח התשובה שלך.

בהערכות משניות, Ai2 בחנה את המודל הסופי מול פייפליין ה-ScholarQA שלה ומול DR-Tulu-8B. ב-SQABench-CS2 dev,‏ Asta ScholarQA קיבלה 87.6,‏ DR-Tulu-8B קיבלה 86.5, ו-AstaBrief 8B קיבלה 86.3; בפיצול ה-test,‏ ScholarQA קיבלה 86.2,‏ DR-Tulu-8B קיבלה 88.8,‏ AstaBrief קיבלה 87.0. ב-DeepScholarBench, בנצ'מרק לסינתזה ארוכת-טווח של 63 שאילתות, ScholarQA קיבלה 60.25,‏ DR-Tulu-8B קיבלה 56.26, ו-AstaBrief קיבלה 53.50 — השורה היחידה שבה כותב הדוחות הפתוח מפגר אחרי שתי החלופות. בשתי השוואות זוגיות שנשפטו על ידי LLM מול פייפליין מבוסס Claude,‏ AstaBrief גרפה 55% מההשוואות ב-dev ו-72% מההשוואות ב-test. מחקר אנושי נפרד כיסה רק 14 שאלות משלושה חוקרים, ובהעדפה כוללת DR-Tulu ניצח, אף ששניים מבין שלושת החוקרים העדיפו את AstaBrief בדיוק הציטוטים. ארבע עשרה שאלות משלושה אנשים הן אות, לא פסק דין, ו-Ai2 מציגה זאת כך.

המעבדה גם פרסמה נתוני שימוש מוקדמים מאינטגרציית Asta: מבין 374 משתמשים שניסו את Fast mode, ‏29.1% השתמשו בו ביומיים או יותר, המשתמשים יצרו בממוצע 3.67 שרשורי דוחות, ‏23% מעולם לא חזרו ל-Thinking mode, ו-18% נעו בין שני המצבים בהתאם למשימה. משוב חיובי עמד על 84.2% עבור Fast mode לעומת 85.2% עבור Thinking mode — פער קטן דיו עד ש-Ai2 מאפיינת את המשוב כדליל מכדי להסיק ממנו מסקנות נחרצות. זו ההצגה הכנה של הדברים, ולכן יש להשאיר אותה.

להריץ את זה בעצמך

AstaBrief 8B הוא ברישיון Apache-2.0 ומבוסס על Qwen/Qwen3-8B, כך שהוא משתייך למחלקת ה-GPU הבודד ולא למחלקת מרכז הנתונים: מודל dense בגודל 8B בארכיטקטורת Qwen3, 36 שכבות, גודל חבוי 4096, 32 ראשי קשב עם 8 ראשי מפתח-ערך, אוצר מילים של 151,936 טוקנים, ותקרת המיקום של הבסיס של 40,960 טוקנים. ב-BF16 הוא נכנס בנוחות בכרטיס של 24GB, והדוגמה של הכרטיס עצמו משתמשת ב-vLLM עם טמפרטורה 0.7, top-p 0.95, ומגבלת פלט של 4096 טוקנים.

אזהרה תפעולית אחת מודפסת בהדגשה בכרטיס המודל וקל לפספס אותה: נקודת השמירה עברה כיוונון עדין כנגד פורמט פרומפט אחד ספציפי, שפורסם כקובץ sft_prompt.txt במאגר הנתונים AstaBrief_prompts. אם תשתמשו בפרומפט או בפורמט אינטראקציה שונים, Ai2 מצפה להתנהגות ירודה או לא עקבית. אם תעריכו את המודל הזה עם מערכת הערכה משלכם ותקבלו תוצאות גרועות, בדקו את הפרומפט לפני שתסיקו משהו לגבי המשקולות.

הכרטיס גם גלוי לב באשר להיקף. AstaBrief מיועד לשימוש מחקרי וחינוכי, לא כעוזר לשימוש כללי, ואין נקודת קצה מתארחת להסקה מבית Ai2 — אתה מוריד אותו, או שאתה משתמש בו בתוך Asta. אף ספק בקטלוג שלנו לא מספק אותו, כולל אנחנו, כך שאין נתיב להפנות אליו; הדרך ההגונה להשתמש בו היא על החומרה שלך או מאחורי חומת האש שלך, וזה בדיוק הטיעון ש-Ai2 מעלה לטובת משקלים פתוחים מלכתחילה.

היכן משתלב ראוטר בצינור דוחות

AstaBrief תופס מקום אחד בשרשרת ארוכה יותר. משהו מאחזר את הספרות, משהו מחליט אילו קטעים ראויים להעביר הלאה, ומשהו עשוי לשפוט או לאמת את הדוח המוגמר. קריאות אלו הן קריאות רגילות של מודלים מתארחים, והן החלק בסטאק שבו אתה באמת רוצה בחירה של ספקים: API אחד שמכסה יותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה בתוספת 0% כך ש הורדת מחיר של ספק מופיעה בחשבון שלך באותו יום, מעבר אוטומטי לגיבוי אם ספק מתדרדר, ו-DSL לניתוב אם אתה רוצה להרכיב מספר מודלים לקריאה אחת. ארח בעצמך את הכותב כי זה החלק עם השלכות של רגישות לנתונים ועלות קבועה; נתב את התזמור כי זה החלק שבו גמישות שווה יותר מבעלות.

יש כאן גם ניסוי זול. מערך ההשוואה של Ai2 עצמה הוא Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini ו-GPT-4.1 — בכוונה חוד החנית של 2025, והמעבדה אומרת שהוא לא הורץ מחדש. הצבת הפלט של AstaBrief לצד המודלים המתארחים של היום על השאלות שלך היא תרגיל של מקש אחד אם שני הזרועות נגישות דרך אותו endpoint, והיא עונה על השאלה שהפוסט בבלוג מותיר פתוחה.

מה היה משנה את התמונה

שלושה דברים יהפכו את זה מהשקה מתועדת היטב לתוצאה מבוססת. שחזור בלתי תלוי של המספרים של SQABench-CS2, שכן כל נתון לעיל הוא דיווח עצמי. הרצה חוזרת מול מודלי החזית הנוכחיים, מאחר שקבוצת ההשוואה מיושנת בשנה לפי הודאתה של המעבדה עצמה. והערכה אנושית גדולה יותר מאשר ארבע־עשרה שאלות משלושה חוקרים — הבלוג של Ai2 עצמו מסתיים בטענה שהתחום זקוק להערכות החורגות מתמיכת ציטוטים כדי לשאול אם מודל שומר על היקף הראיות של מקורותיו, כולל אם הוא הופך בשקט ממצאים ספציפיים למדגם להכללות גורפות. זו ביקורת הוגנת על כל קטגוריית ההערכה, והיא חלה גם על פרסום זה.

לעת עתה, הקריאה המעשית פשוטה. אם אתה מייצר דוחות עם ציטוטים מהספרות וברצונך שהכותב יהיה על החומרה שלך, ברישיון Apache-2.0, עם נתוני האימון פתוחים, AstaBrief 8B היא האפשרות הפתוחה הייעודית ביותר שמישהו פרסם, והצמצום של פי 3.5 בזמן השעון הוא הסיבה שהיא קיימת. אם עבודתך תלויה בסינתזה החדה ביותר האפשרית, שים לב שהטבלה של Ai2 עצמה מציבה את DR-Tulu לפני באשר להעדפה אנושית כוללת ואת ScholarQA לפני ב-DeepScholarBench — ושמצב Thinking עדיין שם, באותו מוצר, בדיוק מהסיבה הזו.