כרטיס כותרת הירו עבור 'AstaBrief 8B לעומת Qwen3-8B: מה שכיוונון עדין של Ai2 מוסיף למודל הבסיס של עצמו', תוך ציון הארכיטקטורה המשותפת של Qwen3 וממוצעי SQABench-CS2 של 87.0 לעומת 77.3, עם הלוגו של OrcaRouter בפינה.
Guides & Insights

AstaBrief 8B לעומת Qwen3-8B: מה כיוונון עדין של Ai2 מוסיף למודל הבסיס של עצמו

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אין כאן סיפור ארכיטקטוני, וזו בדיוק הנקודה. AstaBrief 8B הוא פיין-טיון של Qwen/Qwen3-8B, ושני המודלים חולקים קונפיגורציה זהה עד לראש הקשב האחרון: Qwen3ForCausalLM, 36 שכבות, גודל מוסתר 4096, 32 ראשי קשב עם 8 ראשי מפתח-ערך, אוצר מילים של 151,936 טוקנים, ותקרת מיקום של 40,960 טוקנים. כל מה שמפריד בין הגרסה של Ai2 מ-2026-10-02 לבסיס מאפריל 2025 הוא פוסט-אימון. השאלה המעניינת היא אפוא לא מה טוב יותר באופן כללי — אלא מה מקנה לך הרצת פוסט-אימון ספציפית וממומנת היטב מעל מודל בסיס שאתה כבר יכול להוריד בחינם, ומה זה עולה לך בתמורה.

התשובה של Ai2 היא כותב דוחות שמייצר סינתזה מרובת סעיפים עם ציטוטים בבערך 51 שניות, לעומת 178.5 שניות עבור הצינור מבוסס Claude שהוא החליף בתוך פלטפורמת Asta — בערך פי 3.5 מהר יותר, כש-Ai2 טוענת שאיכות הדוח נשמרה במדדים שהיא עקבה אחריהם. התשובה של Qwen3-8B היא גנרליסט עם מצבי חשיבה ואי-חשיבה היברידיים, יותר ממאה שפות, ושנה וחצי של שימוש downstream. שניהם Apache-2.0. הפשרה היא יכולת צרה בתוספת מהירות מול יכולת רחבה בתוספת גמישות, והנתונים שלמטה הופכים את הצורה של זה לדי קונקרטית.

שורת הארכיטקטורה היא פעולה ריקה, ולכן הפרומפט אינו כזה.

מכיוון שגיאומטריית הצ'קפוינט זהה, כל אינטואיציית הגשה שיש לך לגבי Qwen3-8B עוברת ללא שינוי ל-AstaBrief 8B. הוא 8B צפוף ב-BF16, הוא נכנס בכרטיס 24GB, הוא מוגש ב-vLLM או ב-Transformers ללא קרנלים מותאמים אישית, והוא יורש את תקרת המיקום 40K של הבסיס — אף אחד מהמודלים אינו מודל הקשר ארוך, וחלון האימון של 32K מתרחב עם YaRN בדיוק כמו הבסיס. תכנון הפריסה של ה-fine-tune הוא תכנון הפריסה של הבסיס. כדאי לומר זאת בפשטות מכיוון שזה לא תמיד נכון לגבי fine-tunes, וזה אומר שהדבר היחיד שאתה מעריך הוא התנהגות.

ההתנהגות היא המקום שבו מתגוררת הנעילה. הכרטיס של AstaBrief נושא אזהרה מודגשת: המודל כוונן מול פורמט פרומפט ספציפי אחד, שפורסם כ-sft_prompt.txt במערך הנתונים AstaBrief_prompts, ו-Ai2 אומרת ששימוש בפרומפט או בפורמט אינטראקציה שונים עלול להוביל להתנהגות ירודה או לא עקבית. הפרומפט הזה אינו תבנית צ'אט רגילה. קראו אותו ותמצאו חוזה נוקשה — משבצת שאילתה בסוגריים, בלוק section_references של ציטוטים הממופתחים לפי מזהה, תחביר ציטוט מפורש הדורש שמפתח ההפניה יבוא אחרי המשפט שהוא תומך בו, סמן ייעודי לידע של המודל שאסור לשלב עם מקור אחר, והוראה לפתוח כל סעיף ב-TLDR בן שני משפטים. Qwen3-8B יקבל כל דבר שתקלידו. AstaBrief 8B מכוונן לצורת קלט אחת ויתפקד פחות טוב אם תמסרו לו צורה אחרת.

מה קנו 47,000 דוגמאות ו-6,000 העדפות

הכיוונון העדין מתרחש כולו לאחר האימון, והמתכון קונבנציונלי במכוון: כיוונון עדין עם פיקוח, שלאחריו אופטימיזציית העדפות ישירה לא־מקוונת, ללא למידת חיזוק. Ai2 החלה משאילתות אמיתיות שהוגשו דרך מערכת Asta שלה, סיננה 90,000 הנחיות ממוקדות מחקר לפי איכות, רלוונטיות ופרטיות, יצרה מטרות דוח עם צינור ScholarQA הרב־שלבי תוך שימוש ב-Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini ו-GPT-4.1, ושמרה 47,000 דוגמאות. שלב ההעדפות בנה אז כ־6,000 זוגות, כאשר GPT-4.1 ו-DeepSeek-R1 שימשו כשופטים ורק זוגות שזכו להסכמה שרדו.

נמדד על SQABench-CS2 — 100 שאלות מחקר במדעי המחשב שנכתבו על ידי משתמשים — לעומת מודל הבסיס, הנה מה שזה השיג, כאשר כל נתון דווח על ידי הספק ואף אחד מהם לא שוחזר באופן עצמאי:

• ממוצע כולל — AstaBrief 8B 87.0 לעומת Qwen3-8B 77.3, שיפור של 9.7 נקודות.

• אזכור מרכיבים — 90.2 לעומת 77.8.

• דיוק ציטוטים — 90.5 לעומת 76.2.

• נזכור ציטוטים — 78.2 לעומת 64.6.

• דיוק התשובות — 89.0 לעומת 90.6, ירידה של 1.6 נקודות לעומת הבסיס.

השורה האחרונה היא זו שאמורה לעצב את הציפיות. כיוונון עדין לאיכות הדוח לא שיפר באופן אחיד את הכול; הוא החליף כמות קטנה של רלוונטיות לכל פסקה תמורת רווחים גדולים בכיסוי ובביסוס ציטוטים. אם המשימה שלך מתגמלת פסקאות רלוונטיות מעל לכל, מודל הבסיס אינו בהכרח הבחירה הגרועה יותר, והכיוונון העדין אינו אוטומטית התשובה שלך.

עוד שני דברים שהכסף לא קנה. ל-AstaBrief 8B אין ציון מדווח ב-DeepScholarBench שהוא גבוה מזה של החלופות של Ai2 עצמה — ה-53.50 שלו נמצא מאחורי Asta ScholarQA עם 60.25 ו-DR-Tulu-8B עם 56.26 — והאימות האנושי שלו הוא ארבע עשרה שאלות משלושה חוקרים, שבהן DR-Tulu זכה בהעדפה הכוללת. מודל מומחה יכול להפסיד למודל מחקר לשימוש כללי במדד הביצועים של המומחה עצמו, ו-Ai2 פרסמה זאת.

A two-column scoreboard headed 'AstaBrief 8B vs Qwen3-8B — the scoreboard'. The AstaBrief column reads 'identity: fine-tune of Qwen3-8B', 'job: cited report writing', 'context: 40K inherited', 'prompt: one fixed format', 'licence: Apache 2.0', 'evidence: vendor-reported SQA-CS2'; the Qwen column reads 'identity: the base model', 'job: generalist, thinking modes', 'context: 40K, YaRN to 131K', 'prompt: open', 'licence: Apache 2.0', 'evidence: 11M downloads, established'. A footer reads 'AstaBrief SQA-CS2 average 87.0 vs base 77.3 per Ai2; unreproduced.'

מה שהבסיס עדיין עושה טוב יותר

ההשוואה אינה חד-כיוונית, וקל להמעיט בערכו של הצד הג'נרליסטי שבה.

Qwen3-8B מגיע עם מצבי חשיבה ואי-חשיבה היברידיים, כך שהוא יכול להשקיע טוקנים בהסקה כאשר בעיה מצדיקה זאת, ולענות ישירות כאשר היא אינה מצדיקה זאת. AstaBrief 8B אומן לכתיבת דוחות ב-one-shot ואינו יורש דבר מהתנהגות ההסקה המכוונת הזו כמאפיין מוצר. Qwen3-8B גם נושא את הכיסוי הרב-לשוני של הבסיס — יותר ממאה שפות — בעוד AstaBrief אומן על קורפוס שסונן במפורש לשאילתות מדעיות באנגלית, ולכן הכשירות שלו מחוץ לתחום הזה אינה ידועה ולא רק שלא נבדקה.

ואז יש את משטח ההוראות. גנרליסט הוא מה שאתה רוצה כשהמשימה תשתנה בשבוע הבא, כשאתה צריך קריאה לכלים, כשסכימת הפלט היא שלך ולא של Ai2, או כשאתה עושה אב-טיפוס ועדיין לא יודע איך ייראה הפרומפט הסופי. ולגבי שאלת המקור הגולמי — זו שחשובה כשמישהו שואל למה אתה סומך על המודל — ל-Qwen3-8B יש יותר מאחד עשר מיליון הורדות ושנה וחצי של שימוש עצמאי. ל-AstaBrief 8B היה שבוע השקה.

מה שיש ל-AstaBrief 8B ושאין למודל הבסיס סיכוי להשתוות לו הוא משמעת הציטוטים. דיוק הציטוטים והריקול הם שני המדדים שבהם היתרון של הכיוונון העדין הוא הגדול והעקבי ביותר עם סיפור האימון — המסנן החזק ביותר בצינור הנתונים של Ai2 היה צפיפות ציטוטים, השיעור של משפטים הנושאים לפחות ציטוט אחד, והמודל שנוצר משקף את סדר העדיפויות הזה. לגרום למודל כללי לצטט בתוך הטקסט בפורמט מפתח קבוע, באופן אמין, בלי לוותר על תמיכה בטענות, זו הנדסת פרומפטים שאתה כותב ומתחזק. הכיוונון העדין של Ai2 הופך את זה להתנהגות ברירת המחדל של המודל.

A screenshot of the Hugging Face model card for Qwen/Qwen3-8B showing the TextGeneration tag, the apache-2.0 licence line, the qwen3 tag, the 8B parameter size in BF16 and a downloads-last-month figure of 11,020,586.

סדרת Qwen התקדמה מאז אפריל 2025

עוד סיבוך אחד, והוא מעשי: Qwen3-8B בן שנה וחצי, והשוואה של כיוונון עדין חדש אליו אינה אותו דבר כמו השוואה שלו למודל קיים שהוא אופציה ראויה.

הקו של Qwen עובר כעת דרך Qwen3.5, Qwen3.6, Qwen3.7 ו-Qwen3.8, והדור הנוכחי נגיש ללא הורדת דבר. Qwen3.8 27B הוא מסלול חי בקטלוג שלנו עם חלון הקשר של 262,144 אסימונים במחיר של $0.33 למיליון אסימוני קלט ו-$2.40 למיליון פלט; Qwen3.8 Flash נושא חלון של מיליון אסימונים במחיר של $0.15 ו-$0.47; Qwen3 VL 8B Instruct מכסה את המקרה המולטימודלי במחיר של $0.18 ו-$0.70 למיליון עם חלון של 131,072 אסימונים ומנותב מאז אוקטובר 2025. Qwen3-8B עצמו אינו מסלול שאנו מספקים, וגם לא AstaBrief 8B — שניהם משקולות להורדה והרצה, והניסוח הכנה הוא שהבסיס שייך לחומרה שלכם, ואילו הדור המודרני של Qwen לא חייב להיות.

זה נותן לך זרוע שלישית להערכה ש-Ai2 לא הצליחה להריץ. הצב את AstaBrief 8B על ה-GPU שלך, העמד את בסיס Qwen3-8B לצידו כדי לאמת את הדלתאות המדווחות, וכוון את אותה ערכת בדיקה אל מודל Qwen3.8 מתארח לצורך קנה מידה. כל שלוש הזרועות נמצאות במרחק של נקודת קצה אחת, וזה מה שהופך את זה לתרגיל קונפיגורציה ולא לפרויקט רכש — API אחד ליותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה בתוספת של 0%, כך שקיצוץ במחיר של ספק נכנס לתוקף אצלך באותו יום, מעבר אוטומטי לגיבוי, וכן DSL לניתוב אם ברצונך שמספר מודלים יענו יחד על שאלה אחת. הזרועות באירוח עצמי נשארות באירוח עצמי משיקולי רגישות נתונים; כל מה שבאירוח נשאר ניתן להחלפה, וזה חשוב כשהדור הבא של Qwen משוחרר בעוד רבעון.

איך להחליט

בחר ב-AstaBrief 8B אם המוצר שלך הוא סינתזת ספרות עם ציטוטים ואתה רוצה שהתנהגות הציטוט תהיה ברירת המחדל של המודל ולא באחריות הפרומפט שלך. הגיאומטריה של מודל הבסיס משמעה אפס הפתעות בשירות, רישיון Apache-2.0 ותערובות ה-SFT וה-DPO שפורסמו הופכים אותו לניתן לביקורת, והיתרון שלו בדיוק ובנזכרות של ציטוטים הוא התוצאה הגדולה והניתנת להסבר ביותר בטבלאות של Ai2.

הישאר על Qwen3-8B, או עבור ל-Qwen3.x עדכני, אם המשימות שלך מגוונות, אם אתה זקוק למצב חשיבה או לכלים או לכיסוי רב־לשוני, אם אתה עדיין חוקר את הפרומפט, או אם היית מעדיף שלא להיות כבול לבלוק הוראות בן שישה־עשר אלף תווים שלא כתבת. המודל הבסיסי הפסיד בכיסוי ובביסוס ציטוטים, לא ברלוונטיות, והוא שמר משהו שהכוונון העדין ויתר עליו.

הדבר שיש להימנע ממנו הוא להתייחס לממוצע 87.0 לעומת 77.3 כאל כל הסיפור. הטבלה של Ai2 עצמה מראה שהכיוונון העדין מוותר על דיוק התשובות כדי להרוויח משמעת ציטוטים; רשימות המעבדה שלה מציינות שרוב האימון וההערכה הושלמו ב-2025 ולא הורצו מחדש מול החזית הנוכחית; ומודל הבסיס שהוא בא לשפר כבר אינו הדור שהייתם בוחרים בו לשום מטרה מלבד ההשוואה הזו. מה שהכיוונון העדין מוסיף באופן מוכח הוא צורה של פלט; אם הצורה הזו שווה את הצמצום תלוי לחלוטין בשאלה אם היא תואמת את הצורה של המוצר שלכם.