
AstaBrief 8B לעומת Qwen3-8B: מה כיוונון עדין של Ai2 מוסיף למודל הבסיס של עצמו
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 220 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
אין כאן סיפור ארכיטקטוני, וזו בדיוק הנקודה. AstaBrief 8B הוא פיין-טיון של Qwen/Qwen3-8B, ושני המודלים חולקים קונפיגורציה זהה עד לראש הקשב האחרון: Qwen3ForCausalLM, 36 שכבות, גודל מוסתר 4096, 32 ראשי קשב עם 8 ראשי מפתח-ערך, אוצר מילים של 151,936 טוקנים, ותקרת מיקום של 40,960 טוקנים. כל מה שמפריד בין הגרסה של Ai2 מ-2026-10-02 לבסיס מאפריל 2025 הוא פוסט-אימון. השאלה המעניינת היא אפוא לא מה טוב יותר באופן כללי — אלא מה מקנה לך הרצת פוסט-אימון ספציפית וממומנת היטב מעל מודל בסיס שאתה כבר יכול להוריד בחינם, ומה זה עולה לך בתמורה.
התשובה של Ai2 היא כותב דוחות שמייצר סינתזה מרובת סעיפים עם ציטוטים בבערך 51 שניות, לעומת 178.5 שניות עבור הצינור מבוסס Claude שהוא החליף בתוך פלטפורמת Asta — בערך פי 3.5 מהר יותר, כש-Ai2 טוענת שאיכות הדוח נשמרה במדדים שהיא עקבה אחריהם. התשובה של Qwen3-8B היא גנרליסט עם מצבי חשיבה ואי-חשיבה היברידיים, יותר ממאה שפות, ושנה וחצי של שימוש downstream. שניהם Apache-2.0. הפשרה היא יכולת צרה בתוספת מהירות מול יכולת רחבה בתוספת גמישות, והנתונים שלמטה הופכים את הצורה של זה לדי קונקרטית.
שורת הארכיטקטורה היא פעולה ריקה, ולכן הפרומפט אינו כזה.
מכיוון שגיאומטריית הצ'קפוינט זהה, כל אינטואיציית הגשה שיש לך לגבי Qwen3-8B עוברת ללא שינוי ל-AstaBrief 8B. הוא 8B צפוף ב-BF16, הוא נכנס בכרטיס 24GB, הוא מוגש ב-vLLM או ב-Transformers ללא קרנלים מותאמים אישית, והוא יורש את תקרת המיקום 40K של הבסיס — אף אחד מהמודלים אינו מודל הקשר ארוך, וחלון האימון של 32K מתרחב עם YaRN בדיוק כמו הבסיס. תכנון הפריסה של ה-fine-tune הוא תכנון הפריסה של הבסיס. כדאי לומר זאת בפשטות מכיוון שזה לא תמיד נכון לגבי fine-tunes, וזה אומר שהדבר היחיד שאתה מעריך הוא התנהגות.
ההתנהגות היא המקום שבו מתגוררת הנעילה. הכרטיס של AstaBrief נושא אזהרה מודגשת: המודל כוונן מול פורמט פרומפט ספציפי אחד, שפורסם כ-sft_prompt.txt במערך הנתונים AstaBrief_prompts, ו-Ai2 אומרת ששימוש בפרומפט או בפורמט אינטראקציה שונים עלול להוביל להתנהגות ירודה או לא עקבית. הפרומפט הזה אינו תבנית צ'אט רגילה. קראו אותו ותמצאו חוזה נוקשה — משבצת שאילתה בסוגריים, בלוק section_references של ציטוטים הממופתחים לפי מזהה, תחביר ציטוט מפורש הדורש שמפתח ההפניה יבוא אחרי המשפט שהוא תומך בו, סמן ייעודי לידע של המודל שאסור לשלב עם מקור אחר, והוראה לפתוח כל סעיף ב-TLDR בן שני משפטים. Qwen3-8B יקבל כל דבר שתקלידו. AstaBrief 8B מכוונן לצורת קלט אחת ויתפקד פחות טוב אם תמסרו לו צורה אחרת.
מה קנו 47,000 דוגמאות ו-6,000 העדפות
הכיוונון העדין מתרחש כולו לאחר האימון, והמתכון קונבנציונלי במכוון: כיוונון עדין עם פיקוח, שלאחריו אופטימיזציית העדפות ישירה לא־מקוונת, ללא למידת חיזוק. Ai2 החלה משאילתות אמיתיות שהוגשו דרך מערכת Asta שלה, סיננה 90,000 הנחיות ממוקדות מחקר לפי איכות, רלוונטיות ופרטיות, יצרה מטרות דוח עם צינור ScholarQA הרב־שלבי תוך שימוש ב-Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini ו-GPT-4.1, ושמרה 47,000 דוגמאות. שלב ההעדפות בנה אז כ־6,000 זוגות, כאשר GPT-4.1 ו-DeepSeek-R1 שימשו כשופטים ורק זוגות שזכו להסכמה שרדו.
נמדד על SQABench-CS2 — 100 שאלות מחקר במדעי המחשב שנכתבו על ידי משתמשים — לעומת מודל הבסיס, הנה מה שזה השיג, כאשר כל נתון דווח על ידי הספק ואף אחד מהם לא שוחזר באופן עצמאי:
• ממוצע כולל — AstaBrief 8B 87.0 לעומת Qwen3-8B 77.3, שיפור של 9.7 נקודות.
• אזכור מרכיבים — 90.2 לעומת 77.8.
• דיוק ציטוטים — 90.5 לעומת 76.2.
• נזכור ציטוטים — 78.2 לעומת 64.6.
• דיוק התשובות — 89.0 לעומת 90.6, ירידה של 1.6 נקודות לעומת הבסיס.
השורה האחרונה היא זו שאמורה לעצב את הציפיות. כיוונון עדין לאיכות הדוח לא שיפר באופן אחיד את הכול; הוא החליף כמות קטנה של רלוונטיות לכל פסקה תמורת רווחים גדולים בכיסוי ובביסוס ציטוטים. אם המשימה שלך מתגמלת פסקאות רלוונטיות מעל לכל, מודל הבסיס אינו בהכרח הבחירה הגרועה יותר, והכיוונון העדין אינו אוטומטית התשובה שלך.
עוד שני דברים שהכסף לא קנה. ל-AstaBrief 8B אין ציון מדווח ב-DeepScholarBench שהוא גבוה מזה של החלופות של Ai2 עצמה — ה-53.50 שלו נמצא מאחורי Asta ScholarQA עם 60.25 ו-DR-Tulu-8B עם 56.26 — והאימות האנושי שלו הוא ארבע עשרה שאלות משלושה חוקרים, שבהן DR-Tulu זכה בהעדפה הכוללת. מודל מומחה יכול להפסיד למודל מחקר לשימוש כללי במדד הביצועים של המומחה עצמו, ו-Ai2 פרסמה זאת.

מה שהבסיס עדיין עושה טוב יותר
ההשוואה אינה חד-כיוונית, וקל להמעיט בערכו של הצד הג'נרליסטי שבה.
Qwen3-8B מגיע עם מצבי חשיבה ואי-חשיבה היברידיים, כך שהוא יכול להשקיע טוקנים בהסקה כאשר בעיה מצדיקה זאת, ולענות ישירות כאשר היא אינה מצדיקה זאת. AstaBrief 8B אומן לכתיבת דוחות ב-one-shot ואינו יורש דבר מהתנהגות ההסקה המכוונת הזו כמאפיין מוצר. Qwen3-8B גם נושא את הכיסוי הרב-לשוני של הבסיס — יותר ממאה שפות — בעוד AstaBrief אומן על קורפוס שסונן במפורש לשאילתות מדעיות באנגלית, ולכן הכשירות שלו מחוץ לתחום הזה אינה ידועה ולא רק שלא נבדקה.
ואז יש את משטח ההוראות. גנרליסט הוא מה שאתה רוצה כשהמשימה תשתנה בשבוע הבא, כשאתה צריך קריאה לכלים, כשסכימת הפלט היא שלך ולא של Ai2, או כשאתה עושה אב-טיפוס ועדיין לא יודע איך ייראה הפרומפט הסופי. ולגבי שאלת המקור הגולמי — זו שחשובה כשמישהו שואל למה אתה סומך על המודל — ל-Qwen3-8B יש יותר מאחד עשר מיליון הורדות ושנה וחצי של שימוש עצמאי. ל-AstaBrief 8B היה שבוע השקה.
מה שיש ל-AstaBrief 8B ושאין למודל הבסיס סיכוי להשתוות לו הוא משמעת הציטוטים. דיוק הציטוטים והריקול הם שני המדדים שבהם היתרון של הכיוונון העדין הוא הגדול והעקבי ביותר עם סיפור האימון — המסנן החזק ביותר בצינור הנתונים של Ai2 היה צפיפות ציטוטים, השיעור של משפטים הנושאים לפחות ציטוט אחד, והמודל שנוצר משקף את סדר העדיפויות הזה. לגרום למודל כללי לצטט בתוך הטקסט בפורמט מפתח קבוע, באופן אמין, בלי לוותר על תמיכה בטענות, זו הנדסת פרומפטים שאתה כותב ומתחזק. הכיוונון העדין של Ai2 הופך את זה להתנהגות ברירת המחדל של המודל.

סדרת Qwen התקדמה מאז אפריל 2025
עוד סיבוך אחד, והוא מעשי: Qwen3-8B בן שנה וחצי, והשוואה של כיוונון עדין חדש אליו אינה אותו דבר כמו השוואה שלו למודל קיים שהוא אופציה ראויה.
הקו של Qwen עובר כעת דרך Qwen3.5, Qwen3.6, Qwen3.7 ו-Qwen3.8, והדור הנוכחי נגיש ללא הורדת דבר. Qwen3.8 27B הוא מסלול חי בקטלוג שלנו עם חלון הקשר של 262,144 אסימונים במחיר של $0.33 למיליון אסימוני קלט ו-$2.40 למיליון פלט; Qwen3.8 Flash נושא חלון של מיליון אסימונים במחיר של $0.15 ו-$0.47; Qwen3 VL 8B Instruct מכסה את המקרה המולטימודלי במחיר של $0.18 ו-$0.70 למיליון עם חלון של 131,072 אסימונים ומנותב מאז אוקטובר 2025. Qwen3-8B עצמו אינו מסלול שאנו מספקים, וגם לא AstaBrief 8B — שניהם משקולות להורדה והרצה, והניסוח הכנה הוא שהבסיס שייך לחומרה שלכם, ואילו הדור המודרני של Qwen לא חייב להיות.
זה נותן לך זרוע שלישית להערכה ש-Ai2 לא הצליחה להריץ. הצב את AstaBrief 8B על ה-GPU שלך, העמד את בסיס Qwen3-8B לצידו כדי לאמת את הדלתאות המדווחות, וכוון את אותה ערכת בדיקה אל מודל Qwen3.8 מתארח לצורך קנה מידה. כל שלוש הזרועות נמצאות במרחק של נקודת קצה אחת, וזה מה שהופך את זה לתרגיל קונפיגורציה ולא לפרויקט רכש — API אחד ליותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה בתוספת של 0%, כך שקיצוץ במחיר של ספק נכנס לתוקף אצלך באותו יום, מעבר אוטומטי לגיבוי, וכן DSL לניתוב אם ברצונך שמספר מודלים יענו יחד על שאלה אחת. הזרועות באירוח עצמי נשארות באירוח עצמי משיקולי רגישות נתונים; כל מה שבאירוח נשאר ניתן להחלפה, וזה חשוב כשהדור הבא של Qwen משוחרר בעוד רבעון.
איך להחליט
בחר ב-AstaBrief 8B אם המוצר שלך הוא סינתזת ספרות עם ציטוטים ואתה רוצה שהתנהגות הציטוט תהיה ברירת המחדל של המודל ולא באחריות הפרומפט שלך. הגיאומטריה של מודל הבסיס משמעה אפס הפתעות בשירות, רישיון Apache-2.0 ותערובות ה-SFT וה-DPO שפורסמו הופכים אותו לניתן לביקורת, והיתרון שלו בדיוק ובנזכרות של ציטוטים הוא התוצאה הגדולה והניתנת להסבר ביותר בטבלאות של Ai2.
הישאר על Qwen3-8B, או עבור ל-Qwen3.x עדכני, אם המשימות שלך מגוונות, אם אתה זקוק למצב חשיבה או לכלים או לכיסוי רב־לשוני, אם אתה עדיין חוקר את הפרומפט, או אם היית מעדיף שלא להיות כבול לבלוק הוראות בן שישה־עשר אלף תווים שלא כתבת. המודל הבסיסי הפסיד בכיסוי ובביסוס ציטוטים, לא ברלוונטיות, והוא שמר משהו שהכוונון העדין ויתר עליו.
הדבר שיש להימנע ממנו הוא להתייחס לממוצע 87.0 לעומת 77.3 כאל כל הסיפור. הטבלה של Ai2 עצמה מראה שהכיוונון העדין מוותר על דיוק התשובות כדי להרוויח משמעת ציטוטים; רשימות המעבדה שלה מציינות שרוב האימון וההערכה הושלמו ב-2025 ולא הורצו מחדש מול החזית הנוכחית; ומודל הבסיס שהוא בא לשפר כבר אינו הדור שהייתם בוחרים בו לשום מטרה מלבד ההשוואה הזו. מה שהכיוונון העדין מוסיף באופן מוכח הוא צורה של פלט; אם הצורה הזו שווה את הצמצום תלוי לחלוטין בשאלה אם היא תואמת את הצורה של המוצר שלכם.
