כרטיס כותרת הירו עם הכיתוב 'Kolibri: מודל 78B עם משקולות פתוחות מגרמניה' בסוג גדול ומודגש, ומתחתיו שורה אחת קטנה יותר עם הכיתוב '78B סה"כ / 3.46B פעילים / חלון הקשר של 1M טוקנים / Apache 2.0', ושלושה אייקוני קו שטוחים קטנים בשורה, על רקע לבן עם הדגשות גרדיאנט עדינות בכחול ותכלת ולוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

היום הראשון של Kolibri: Aleph Alpha פתחה 78B של משקולות גרמניות-אנגליות, והתגובה מקדימה את הראיות

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

עשרים וארבע שעות לאחר שחברת Aleph Alpha פרסמה את Kolibri, התגובה התקבעה לשורה אחת, וכדאי לפרק את השורה הזו. המעבדה של היידלברג העלתה מודל תערובת מומחים עם 78.1 מיליארד פרמטרים ל-Hugging Face תחת Apache 2.0 ב-3 באוקטובר 2026, הכריזה עליו באותו בוקר בחדר החדשות שלה ומהחשבון שלה, ולמחרת הסיכום שהסתובב בפידי AI נשמע כך: 78 מיליארד פרמטרים בסך הכול, 3.46 מיליארד פעילים לכל טוקן, משקלים פתוחים תחת Apache 2.0, שנבנה עבור גרמנית ואנגלית. כל סעיף במשפט הזה ניתן לאמת מהמאגר. מה שלא נאמר ברובו הוא אילו חלקים מהפרסום הם עובדות מדודות ואילו הם טענות שהמחברים הציגו על המודל שלהם שאף אחד מחוץ להיידלברג לא הריץ. הפער הזה הוא סיפור היום הראשון, והוא חשוב יותר מהמספר שבכותרת.

נתחיל מהציר הזמן, כי כמות מפתיעה מהתגובות התייחסה לזה כאל השקה שקטה ומסתורית — וזה ממש לא היה המקרה. המאגר ב-Hugging Face Aleph-Alpha/Kolibri-1 נוצר ב-2 באוקטובר 2026 בשעה 05:54:02 UTC, כרטיס המודל מציין תאריך שחרור של 3 באוקטובר, והפוסט בחדר החדשות של הספק פורסם באותו בוקר בשעה 08:43:53 GMT — ביום האיחוד הגרמני, תאריך שהמעבדה בבירור בחרה בו. החשבון של Aleph Alpha עצמה פרסם על כך בתוך דקות. לא היה אמברגו עיתונאי ולא אירוע השקה, וכנראה מכאן באה התפיסה של "השקה שקטה", אבל פוסט בחדר חדשות של ספק, דוח טכני והכרזה רשמית אינם השקה שקטה. זו השקה רגילה שהעיתונות הכללית של ה-AI פשוט לא סיקרה באותו יום.

המספר שהתגובה חוזרת עליו

הסיבה לכך ש-3.46B פעילים הוא הנתון שכולם מצטטים היא שזהו המספר היחיד בהכרזה שמשנה את מה שקונה צריך להחזיק. Kolibri הוא טרנספורמר בעל 50 שכבות שבו כל שכבה היא תערובת מומחים, עם 384 מומחים בכל שכבה, אחד משותף ושישה מנותבים, על סך 78,103,074,560 פרמטרים. בכל טוקן הוא מפעיל 3,457,573,120 מהם — יחס דלילות של בערך 22.6 ל-1. זה מה שמאפשר להגיש מודל בעל 78 מיליארד פרמטרים על זוג H100s במקום על ארון שרתים, וזו הטענה בעלת ההשלכות הרבה ביותר בהכרזה.

סביבו יושבים שאר הנתונים הבולטים, כולם מכרטיס המודל ולא מהרצה עצמאית:

• הקשר — אומן ב-16,384 אסימונים, אומן בשלב ביניים ב-65,536, נייטיבי ב-262,144, ומאומת עד 1,048,576. הכרטיס ממליץ להישאר על 262,144 או מתחת לכך עבור עבודה רגישה להשהיה. שים לב היטב ש"הקשר של 1M" השטוח שתראה בסיכומים הוא התקרה המאומתת, לא החלון הנייטיבי.

• דיוק — משקולות FP8 בבלוקים בגודל 128x128 עם אקטיבציות שעברו כימות דינמי, כאשר ההערכה מתבצעת עם מטמון KV מסוג FP8; ההטמעות, ראש ה-LM, הנורמות ונתב ה-MoE נשארים ב-bfloat16.

• חשיבה — ארבע רמות מאמץ — ללא, נמוכה, בינונית, גבוהה — נקבעות דרך תבנית הצ'אט, עם קריאה לכלים בסגנון Hermes ופרסר vLLM המסופק באותו מאגר כמו המשקלים.

• שפות — גרמנית ואנגלית, ולא שום דבר אחר.

• אימון — 20 טריליון טוקנים של אימון מקדים על פני קורפוס דו-לשוני מסונן שהוא בערך 62.5 אחוז אנגלית, 23.9 אחוז גרמנית ו-13.6 אחוז קוד, ובנוסף 3.44 טריליון טוקנים של אימון ביניים ו-201 מיליארד להרחבת הקשר ארוך.

• מחשוב ואנרגיה — 768 יחידות NVIDIA B200 ב-96 צמתי HGX, 21 ימי אימון מקדים במשך 511 שעות ו-392,000 שעות GPU בהיקף מדווח של 6.4x10^23 FLOPs, וצריכה מוערכת של 9.5x10^2 MWh כולל תקורת מרכז נתונים, לא כולל כיוונון עדין מפוקח ולמידת חיזוק.

• רישיון — Apache 2.0. אין נספח שימוש מקובל, אין סף משתמשים פעילים חודשיים, ואין תנאים מסחריים נפרדים.

שתי הטענות שאיש לא בדק

זהו החלק של היום הראשון שהתגובה דילגה עליו, וזה החלק שמכריע אם Kolibri חשוב או רק מעניין.

הראשונה היא הטענה בדבר כלכלת ההגשה. הניסוח של Aleph Alpha אינו ש-Kolibri הוא המודל החזק ביותר הזמין — לפי טבלת ההשוואה של המעבדה עצמה הוא לא כזה, והמעבדה אומרת זאת. הניסוח שלה הוא שאף מודל מבין אלה שהושוו לו אינו מספק איכות גבוהה יותר באותה עלות הגשה, או אותה איכות בעלות נמוכה יותר, לאורך חזית פארטו של איכות מול אסימונים מפוענחים לשנייה לכל GPU. זו טענה בדבר תפוקה בחומרה מסוימת, והיא בדיוק מהסוג שרק צד שלישי עם שעון עצר ושני כרטיסי H100 יכול להכריע בו. איש לא עשה זאת. אין רשומה של Artificial Analysis עבור Kolibri נכון ל-4 באוקטובר 2026, ואין שכפול על ידי צד שלישי של תשתית ההערכה.

השנייה היא הטענה בדבר הטוקנייזר. אלף אלפא אימנה טוקנייזר דו-לשוני גרמני-אנגלי עם אוצר מילים של 128,000 טוקנים באמצעות שיטה שהיא מכנה UniBPE, ומדווחת על 4.90 בתים בממוצע לטוקן בטקסט אינטרנט בגרמנית, לעומת GPT-5 עם 4.35, Gemini עם 4.13, Qwen 3.5-3.8 עם 4.17, GLM 5.3 עם 3.93, DeepSeek V4 עם 3.72 ו-Kimi K3 עם 3.28. כל אחד מהנתונים הללו הוא של הספק עצמו, כפי שנמדד על קורפוס של הספק עצמו, מול מתחרים שהספק בחר. יותר טקסט לכל טוקן הוא אפקט אמיתי של עלות הסקה ולא טענה לגבי איכות, ואם הוא מתקיים הוא מצטבר על פני כל עומס עיבוד מסמכים — אבל זו מדידה של מעבדה אחת, לא תוצאת בנצ'מרק.

גרמנית היא העיקר, והיא ההנדסה המעניינת ביותר בגרסה.

רוב כרטיסי המודל ה"רב־לשוניים" מתארים תערובת אימון שבמקרה כללה גרמנית. זה בנוי בדיוק להפך, והכרטיס מפורט באופן יוצא דופן לגבי המכניקה.

ניסויים קטנים במודלי פרוקסי הובילו את Aleph Alpha ליעד של כ-20 אחוז נתונים בגרמנית בתערובת, אשר עבור ריצה של 20 טריליון טוקנים משמעותו היה למצוא 4 טריליון טוקנים בגרמנית. מערכי נתונים גרמניים פתוחים שעברו דה-דופליקציה וסינון סיפקו 390 מיליארד — קטן בסדר גודל. המעבדה סגרה את הפער בשלוש דרכים: כיוונון מחדש של מסנן Common Crawl במיוחד עבור גרמנית, אשר הניב 1.3 טריליון טוקנים אורגניים ייחודיים; ניסוח מחדש של מסמכים גרמניים קיימים לערכים אנציקלופדיים, דיאלוגים של שאלות ותשובות וקטעי טקסט, אשר הניבו עוד כטריליון והפכו למקור הגרמני הגדול היחיד; ותרגום, אשר שימש עבור מודל קודמו והושמט במכוון עבור Kolibri. הגרמנית הסתיימה כמאגר ייחודי של 2.4 טריליון טוקנים, 80 אחוז ממנו נאצר או נוצר בבית, ונראתה ב-21.3 אחוז מטוקני קדם-האימון לאחר העלאה בדגימה.

פרט המסנן הוא מהסוג שעולה לפני השטח רק במעבדה שבאמת אומנה על גרמנית. צינור עיבוד נתוני שפה סטנדרטי משליך מסמכים עם יותר מדי מילים ארוכות — אך פרוזה מנהלית גרמנית עוברת באופן שגרתי את הגבול האנגלי לאורך מילה ממוצע, כך שהגדרות ברירת המחדל מוחקות בשקט את הרגיסטר שהמנהל הציבורי כותב בו. למודל שאומן על מסנן אנגלי סטנדרטי אין אוצר מילים משפטי-מנהלי גרמני של ממש, ואף מדד לא יגיד לך זאת.

מה שטבלת ההשוואה למעשה מציגה

Aleph Alpha פרסמה השוואת פוסט-אימון המכסה ארבעה־עשר מודלים, והיא שימושית יותר מרוב טבלאות ההשקה מכיוון שהיא אינה מחמיאה לנושא. על אותה ערכת בדיקה עם Kolibri ברמת מאמץ הסקה גבוהה, Qwen3.8 27B משיג 80.2 בממוצע האנגלי לעומת 75.5 של Kolibri, ו-79.9 בממוצע הגרמני לעומת 70.8, והוא מוביל ב-GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified ובשני מבחני ההקשר הארוך. Nemotron 3 Super 120B-A12B משיג 73.0 באנגלית לעומת 75.5 של Kolibri. Gemma 4 26B-A4B IT משיג 71.9 ו-66.3 בשני הממוצעים.

אז הסיכום האמיתי של השחרור אינו 'המתקדם ביותר'. הוא ש-Kolibri יושב באמצע תחום של מודלים שמפעילים בין שלושה לשנים עשר מיליארד פרמטרים לכל טוקן, שהוא מנצח בבירור את הקטנים בהרבה, ושהוא מפסיד למודל צפוף בן 27 מיליארד פרמטרים מבית Alibaba ברוב השורות בטבלה שלו עצמו, בעודו מפעיל בערך שמינית מהפרמטרים. האם הכלכלה מצילה את הפער הזה היא טענת פארטו, וטענת פארטו לא נבדקה.

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

איך היית קורא לזה בפועל, היום

אין נקודת קצה מתארחת מהספק — המהדורה היא משקלים בתוספת דו"ח טכני, ללא SKU של API של Aleph Alpha עבור Kolibri בחומר שפורסם. כמו כן, אין מסלול עבורו ב-OrcaRouter: בדקנו את הקטלוג בכל איות של קידומת הספק ושם הדגם ו-Kolibri אינו שם, כך שקריאה לו היום משמעה להוריד כ-78 GB של משקלי FP8 ולהריץ נקודת קצה של vLLM בעצמך מתוך חבילת aleph-alpha-inference או תמונת המכולה שפורסמה.

זו החלטת רכש אמיתית, לא הערת שוליים, וזה בדיוק המקום שבו שכבת ניתוב מצדיקה את מקומה גם עבור מודל שהיא אינה נושאת. ההשוואה הכנה לכל מי ששוקל פריסה ריבונית של 78B באירוח עצמי אינה שורות של מבחני ביצועים — אלא 78 GB של VRAM ושיחת רכש מול סעיף תשלום לפי טוקן על חומרה שמישהו אחר מחזיק בה. אם מה שאתם באמת צריכים החודש הוא מודל קטן מסוג mixture-of-experts שתוכלו לפנות אליו בלי לקנות שני GPUs, רמת Gemma 4 26B-A4B היא הדבר הקרוב ביותר שכבר נמצא בנקודת קצה מנותבת, במחיר של $0.06 למיליון טוקנים בקלט ו-$0.33 למיליון בפלט עם חלון של 262,144 טוקנים, ו-OrcaRouter מנתבת את הרמה הזו על מפתח אחד תואם OpenAI במחיר המחירון של הספק בלי שום תוספת. זו הדרך הזולה לגלות אם עומס העבודה מצדיק את הבעלות על החומרה לפני שהחומרה מגיעה.

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

למה לשים לב, ומה ישנה את ההכרעה

שלושה דברים, לפי מידת ההשפעה שלהם על התמונה.

מדידת תפוקה בלתי תלויה בתצורת две? no. Let's be careful: "at the card's recommended two-H100 configuration" — "בתצורת שתי כרטיסי H100 המומלצת של הכרטיס" hmm. The card recommends two-H100 config. So: "בתצורת שתי ה-H100 המומלצת של הכרטיס". Final: מדידת תפוקה בלתי תלויה בתצורת שתי ה-H100 המומלצת של הכרטיס תאשר או תפיל את טענת הפארטו, שהיא הטענה היחידה בהודעה שהיא חדשה באמת ולא חזרה על דף מפרט. שחזור בלתי תלוי של ממוצעי מערכי המשימות בגרמנית ובאנגלית יגיד לך אם הפער ל-Qwen3.8 27B צר כפי שמרמזת הטבלה של הספק עצמו או צר אף יותר. והערכה בגרמנית על טקסט מנהלי אמיתי — לא מבחן כללי מתורגם — תבחן את הדבר שלשמו ההודעה למעשה נועדה, דבר שאף לוח דירוג לא מודד כיום.

עד שאחד מאלה יתממש, המסגור הנכון הוא זה שהמאגר עצמו תומך בו. Kolibri הוא שחרור אמיתי של משקולות פתוחות ממעבדה אירופית, בהיקף שמעבדות אירופיות לא השיקו בעבר, עם תנאי Apache 2.0 שאף מתחרה מבוסס לא השתווה להם, צינור נתונים שפורסם לצד המשקולות, וסיפור איטרציה של שני מודלים שמעניין יותר מהמספר הכותרתי. הוא גם, לעת עתה, מודל שהנתונים המצוטטים ביותר שלו מגיעים מהמחברים שלו עצמו. שני המשפטים האלה נכונים מהיום הראשון, והשני הוא זה שהתגובה השמיטה.

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.