כרטיס כותרת ראשי שכותרתו 'Kolibri נגד Granite 4.2 3B' עם כתובית משנה 'תערובת דלילה של מומחים בגודל 78B מול מודל הסקה צפוף בגודל 3B', תגי גלולה עם הכיתוב '78.1B סה"כ | 3.46B פעיל', '~3B צפוף', 'Apache 2.0 שניהם', ושורת כותרת תחתונה עם הכיתוב 'נתונים שדווחו על ידי הספק משני הצדדים', עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Kolibri מול Granite 4.2 3B: הימור על דלילות של 78B, והמודל 3B שמסרב לשחק את אותו המשחק

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הצב את Kolibri וGranite 4.2 3B זה לצד זה, וההבחנה הכנה הראשונה היא שזה לא מאבק הוגן — ולא בכיוון שהייתם מניחים. Kolibri הוא מודל mixture-of-experts של Aleph Alpha עם 78.1 מיליארד פרמטרים, ששוחרר ב-3 באוקטובר 2026 ומפעיל 3.46 מיליארד פרמטרים לכל טוקן. Granite 4.2 3B הוא מודל ההסקה הצפוף (dense) של IBM עם כשלושה מיליארד פרמטרים, שמשקולותיו הגיעו ל-Hugging Face ב-7 באוגוסט 2026, כאשר כרטיס המודל והבלוג הטכני באו בעקבותיהם ב-25 באוגוסט. האחד גדול פי עשרים ושישה מהשני בסך הפרמטרים. הסיבה ששניהם שייכים לאותה החלטה היא ששניהם ברישיון Apache 2.0, שניהם טקסט בלבד, שניהם מיועדים לאירוח עצמי מלכתחילה, ושניהם כוונו לאותו קונה: צוות שרוצה בינה מסמכית על חומרה שהוא שולט בה, עם תיעוד מקור שישרוד סקירת רכש. השאלה המעניינת אינה איזה מהם טוב יותר. היא מה בעצם קונה תקציב הפרמטרים הגדול פי עשרים ושישה, ומה המחיר של לשאת אותו.

אי-ההתאמה, במילים פשוטות

Granite 4.2 3B הוא מודל צפוף עצמאי שעבר אימון-המשך (post-training) מ-Granite-4.1-3B-Base, חלק ממשפחת Granite 4.2 ש-IBM הוציאה עד אוגוסט. יש לו 40 שכבות עם grouped-query attention, חלון הקשר מקורי של 128K שאותו IBM מרחיבה ל-512K בשלב הקדם-אימון החמישי, ושלושה מצבי חשיבה לכל שאילתה: חשיבה מלאה כברירת מחדל, מסלול במאמץ נמוך ומסלול ללא חשיבה. כרטיס המודל של IBM גלוי באופן יוצא דופן באשר למה שה-3B אינו. בניגוד לאחיו ה-8B וה-30B, הוא דילג בכוונה על בלוק למידת החיזוק הסוכנית המתמחה שאומן בסביבות SWE-agent, טרמינל וחיפוש, ולכן IBM אינה מפרטת עבורו נתון SWE-bench כלל, ומציגה את המודל כמומחה להסקה ולא כסוכן.

Kolibri הולך בכיוון ההפוך בכל ציר. חמישים שכבות, כל אחת מהן תערובת מומחים, 384 מומחים בכל שכבה עם אחד משותף ושישה מנותבים, ויחס דלילות של בערך 22.6 ל-1. ההקשר שלו הוא באופן מקורי 262,144 טוקנים, מאומת עד 1,048,576, כאשר הכרטיס ממליץ להישאר על 262,144 או מתחת לכך עבור עבודה רגישה להשהיה. ארבע רמות מאמץ הסקה. קריאה לכלים בסגנון Hermes עם מפענח vLLM שמסופק באותו מאגר כמו המשקלים. וטביעת רגל של בערך 78 GB ב-FP8, כשהתצורה המינימלית של הכרטיס היא שני כרטיסי A100 80 GB, שני H100 SXM5, H200 אחד, B200 אחד או B300 אחד.

• פרמטרים — Kolibri: 78,103,074,560 סה"כ, 3,457,573,120 פעילים לכל טוקן. Granite 4.2 3B: בקירוב 3B צפוף, כל הפרמטרים פעילים בכל טוקן.

• הקשר — Kolibri: 16,384 מאומן, 65,536 מאומן בינוני, 262,144 מקורי, 1,048,576 מאומת. Granite 4.2 3B: 128K מקורי, הורחב ל-512K.

• מצבי חשיבה — Kolibri: ללא, נמוך, בינוני, גבוה, נקבעים דרך תבנית הצ'אט. Granite 4.2 3B: מלא, במאמץ נמוך וללא חשיבה, לכל שאילתה.

• קריאה לכלים — Kolibri: בסגנון Hermes, עם מנתח מובנה. Granite 4.2 3B: כן, אבל לא המסלול המאומן ב-RL סוכני שאחיו הגדולים קיבלו.

• שפות — Kolibri: גרמנית ואנגלית, במכוון ותו לא. Granite 4.2 3B: אנגלית תחילה, עם האימון הרב־לשוני הרחב יותר של IBM מאחוריו.

• טביעת רגל — Kolibri: כ-78 GB ב-FP8, מינימום שני כרטיסי GPU. Granite 4.2 3B: כ-6–8 GB ב-bfloat16, פחות מ-2 GB מכומת, ברמת מחשב נייד.

• רישיון — שניהם Apache 2.0, ושניהם ללא נספח שימוש מקובל או סף של משתמשים פעילים חודשיים.

• הגשה — Kolibri: התוסף vLLM של aleph-alpha-inference או תמונת הקונטיינר שפורסמה. Granite 4.2 3B: vLLM, SGLang, Transformers, GGUF ו-Ollama תחת granite4.2:3b.

A two-column comparison scoreboard titled 'Kolibri vs Granite 4.2 3B'. Left column Kolibri: Parameters 78.1B total / 3.46B active, Context 262,144 native / 1,048,576 validated, Thinking none / low / medium / high, Languages German and English, Licence Apache 2.0, Footprint about 78 GB FP8, two GPUs minimum. Right column Granite 4.2 3B: Parameters ~3B dense, Context 128K native / 512K extended, Thinking full / low / none, Languages English-first with IBM multilingual training, Licence Apache 2.0, Footprint 6-8 GB bfloat16 / under 2 GB quantized, laptop-class. Footer: 'Kolibri figures are Aleph Alpha's own; Granite 4.2 3B figures are IBM's own; nothing here is independently reproduced.' with the OrcaRouter logo in the bottom-right corner.

מה שהפרמטרים הנוספים של 75 מיליארד קונים

שלושה דברים, וראוי לדייק לגבי אילו מהם מבוססים ואילו מהם הם בגדר טענה בלבד.

הראשון הוא גרמני. זהו ההבדל האמיתי החד ביותר בין שני המודלים, והוא אינו שורה בטבלת בנצ'מרק. Aleph Alpha בנתה את Kolibri סביב קורפוס דו-לשוני גרמני-אנגלי, תוך כוונה להגיע לכ-20 אחוז גרמנית בהרצת אימון מקדים של 20 טריליון טוקנים, והגיעה בסופו של דבר למאגר גרמני של 2.4 טריליון טוקנים, ש-80 אחוזים ממנו המעבדה ליקטה או יצרה בעצמה. כרטיס המודל מסביר למה זה דרש עבודה: מערכי נתונים גרמניים פתוחים שעברו הסרת כפילויות סיפקו רק 390 מיליארד טוקנים, פער של סדר גודל, ולכן המעבדה כיווננה מחדש מסנן של Common Crawl במיוחד עבור גרמנית, וניסחה מחדש מסמכים גרמניים קיימים לערכי אנציקלופדיה, לדיאלוגים ולקטעים. פרט המסנן הוא זה שכדאי לזכור. צינור עיבוד נתוני שפה סטנדרטי משליך מסמכים עם יותר מדי מילים ארוכות, ופרוזה מנהלית גרמנית עוברת באופן שגרתי את הגבול האנגלי לאורך מילה ממוצע — כך שהגדרות ברירת המחדל מוחקות בשקט את הרגיסטר של כתיבת המינהל הציבורי. IBM לא בנתה את Granite עבור אותו קורפוס. Granite 4.2 3B יתמודד עם גרמנית; הוא לא תוכנן סביב רגיסטר משפטי ומנהלי גרמני, ואף לוח דירוג לא יספר לך את ההבדל.

השני הוא הקשר ארוך ששורד מסמכים אמיתיים. התקרה של 512K של Granite היא גדולה באמת, אבל שני המודלים הגיעו לשם בדרכים שונות, והעיצוב הפוזיציוני של Kolibri הוא הטיעון המקובל יותר בכל הנוגע להקשר ארוך. התייחס לנתוני RULER של IBM — 67.52 ב-64K ו-55.30 ב-128K בחומר שפורסם של משפחת 4.2 — כגילוי כן של מידת ההידרדרות של איכות האחזור עד 128K, וזכור של-Kolibri אין בכלל עקומת הידרדרות מפורסמת מקבילה.

השלישי הוא מרווח חשיבה גולמי, וכאן התשובה הכנה היא "לא כמו שיחס הפרמטרים מרמז". צינור האימון של Kolibri הקנה לו ריצת אימון מקדים של 20 טריליון טוקנים על 768 NVIDIA B200s במשך 21 ימים, וטבלת ההשוואה של Aleph Alpha עצמה, עם Kolibri במאמץ חשיבה גבוה, מציבה אותו ב-75.5 בממוצע האנגלי וב-70.8 בממוצע הגרמני של השוואה של ארבעה-עשר מודלים — שם הוא מפסיד למודל צפוף בן 27 מיליארד פרמטרים של Alibaba ברוב השורות. הטענות המרכזיות של Granite 4.2 3B הן משל עצמו: AIME 2025 ב-78.33, GPQA ב-54.80, LiveCodeBench v6 ב-69.71 ו-MMLU-Pro ב-67.84, כולן מדווחות על ידי IBM ולא שוחזרו. חבילות שונות, רתמות שונות, ספקים שונים. אין מספר באותה רתמה עבור הצימוד הזה בשום מקום, ואנחנו לא מתכוונים להמציא אחד.

איפה כל אחד למעשה מנצח

הריצו את Granite 4.2 3B אם המגבלה שלכם היא המכונה. ב-6–8 GB ב-bfloat16, או פחות מ-2 GB מכומת, הוא נכנס למחשב נייד, ל-GPU בודד בתחנת עבודה, או למארז edge מבודד מרשת שלא יראה לעולם שני H100s. הוא מוגש דרך חמישה סביבות הרצה שונות, ובהן Ollama ו-GGUF — וזה משנה כשמטרת הפריסה היא המחשב הנייד של מישהו אחר ולא הארון שלכם. וכרטיס המודל שלו אמין באופן יוצא דופן בדיוק מפני ש-IBM רשמה מה היא השמיטה. ספק שמסרב לטעון לתוצאות SWE-bench עבור מודל 3B אומר לכם היכן המודל נעצר.

הריצו את Kolibri אם הקורפוס הוא העיקר והחומרה קיימת. צוות עם חוזים בשפה הגרמנית, תיעוד טכני או מסמכים מנהליים, צומת קיים עם שני כרטיסי GPU, ודרישה שהמשקלים לעולם לא יצאו מהבניין — בדיוק עבורו תוכננה מהדורה זו. חלון ההקשר המקורי של 262,144 טוקנים, מטמון ה-KV מסוג FP8, ארבע רמות המאמץ ומסלול קריאת הכלים של Hermes — כולם מצביעים על זרימות עבודה עם מסמכים ולא על צ'אט. הטוקנייזר הדו-לשוני הוא חלק מאותו טיעון: Aleph Alpha מדווחת על 4.90 בייטים בממוצע לטוקן בטקסט גרמני מהאינטרנט, לעומת 4.35 עבור GPT-5 ו-3.28 עבור Kimi K3, הכול נמדד בידי הספק על הקורפוס של הספק, ויותר תווים לטוקן הוא אפקט ישיר של עלות הסקה ולא ציון. אם זה מחזיק מעמד, זה מצטבר על פני כל עמוד שאתם מעבדים.

האסימטריה שאיש לא מפרסם היא הנתונים. IBM פרסמה את המשקלים של Granite 4.2 3B ותיאור טכני מפורט של האופן שבו המודל נבנה, אך לא את נתוני האימון. Aleph Alpha פרסמה את הפייפליין, את מקור הנתונים ואת נתון האנרגיה לצד המשקלים של Kolibri — 20 טריליון טוקנים של אימון מקדים, 9.5×10² MWh כולל תקורת מרכזי נתונים ובלא כיוונון עדין מפוקח ולמידת חיזוקים. עבור צוות שצריך להשיב לשאלה "מאין הגיע הטקסט של המודל הזה", ההבדל הזה אינו קוסמטי.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the card header, the Apache 2.0 licence tag, the twelve tested languages, and the links to the Granite 4.2 Collection, the technical blog and the GitHub repository.

מציאות הניתוב עבור שניהם

אף אחד מהמודלים לא נמצא היום בקטלוג מתארח. ל-Kolibri אין כלל מק"ט API של ספק — השחרור הוא משקלים בתוספת דוח טכני — ו-Granite 4.2 3B מגיע כמשקלים עבור חמש ערימות הרצה ללא נקודת קצה מתארחת מ-IBM. שניהם הצעות באחסון עצמי, והשאלה המעשית עבור רוב הצוותים אינה איזה מהם לאמץ, אלא האם עומס העבודה מצדיק להחזיק באחד מהם.

זה המקום שבו שכבת ניתוב מצדיקה את מקומה גם עבור מודלים שהיא לא נושאת. בדקנו את הקטלוג של OrcaRouter בכל איות של שני שמות המודלים, וגם Kolibri וגם Granite 4.2 3B לא נמצאים שם, ולכן לא נעמיד פנים אחרת. מה ש-OrcaRouter כן נותן לך הוא הדרך הזולה לגלות אם החלטת החומרה מוצדקת לפני שאתה מקבל אותה: כוון נתיב בדיקה אל שכבת תערובת-מומחים קטנה שכבר מנותבת — הווריאנט Gemma 4 26B-A4B במחיר 0.06 דולר למיליון טוקנים בקלט ו-0.33 דולר למיליון בפלט, עם חלון של 262,144 טוקנים — ותראה אם עומס העבודה של המסמכים הגרמניים שלך באמת צריך את מה ש-Kolibri מספק, על מפתח אחד תואם OpenAI, במחיר המחירון של הספק בלי שום תוספת. אם כן, אתה קונה את ה-GPUs עם ראיות ולא לפי תחושת בטן. אם לא, פשוט חסכת הזמנת חומרה.

פסק הדין, ומה ישנה אותו

זו אינה התמודדות עם מנצח. Kolibri ו-Granite 4.2 3B עונים על שאלות שונות בנקודות מחיר שונות, והדירוג הכנה היחיד הוא לפי אילוץ: אם האילוץ הוא חומרה, Granite 4.2 3B הוא היחיד מבין השניים שעומד בו. אם האילוץ הוא עבודה על מסמכים בגרמנית ברמת הרגיסטר הרגולטורי בסביבה מקומית, Granite 4.2 3B מעולם לא היה בתמונה, ו-Kolibri הוא הארטיפקט המעניין יותר — מהדורת 78B לגיטימית עם משקולות פתוחות, Apache 2.0, עם צינור הנתונים והטוקנייזר שפורסמו לצד המשקולות.

שני דברים יכריעו את ההשוואה. הרצה בלתי תלויה של Kolibri על משימת שאלות-תשובות על מסמכים בגרמנית תבחן את הטענה שהשחרור נועד למעשה להוכיח, מכיוון שאף לוח דירוג לא מודד אותה כיום. ושחזור בלתי תלוי של מספרי החשיבה של Granite 4.2 3B יגיד לך אם מכונה בדרגת מחשב נייד יכולה לעמוד בכוחות עצמה על תת-הקבוצה של עומס העבודה שלך שמעולם לא נזקקה ל-78 מיליארד פרמטרים מלכתחילה. עד שאחד מאלה יתממש, קנה לפי אילוצים, לא לפי מספר פרמטרים.

A screenshot of IBM's technical blog announcing the Granite 4.2 family, showing the post header and the discussion of the family's dense and mixture-of-experts tiers and their reasoning and thinking modes.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית