כרטיס גיבור שנוצר עבור ההסבר של Kolibri, שכותרתו 'Kolibri: מודל עם משקולות פתוחות בנפח 78B מגרמניה', עם שורת המשנה '78B סה"כ / 3.46B פעילים / הקשר של 1M טוקנים / Apache 2.0' ושלושה אייקוני קו שטוחים: יונק דבש, ערימת שכבות, ומנעול מעל מסמך. הלוגו של OrcaRouter נמצא ברצועה שמתחת לאיור.
Guides & Insights

Kolibri, מוסבר: Aleph Alpha משיקה מודל 78B גרמני-אנגלי תחת רישיון Apache 2.0

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Aleph Alpha שחררה את Kolibri ב-3 באוקטובר 2026, מודל תערובת מומחים בעל 78.1 מיליארד פרמטרים שמפעיל 3.46 מיליארד פרמטרים לכל טוקן, מצויד בחלון הקשר מאומת של 1,048,576 טוקנים, ומופץ עם משקלות מלאות ב-Hugging Face תחת רישיון Apache 2.0. מעבדת היידלברג פרסמה אותו ביום איחוד גרמניה, לצד דוח טכני, כרטיס מודל בגרמנית ובאנגלית, ותיאור מפורט במיוחד של האופן שבו הוא אומן. המודל שכנגדו הוא נמדד לאורך כל התיעוד של Aleph Alpha עצמה הואKolibri Origin — קודמו בעל 30.6 מיליארד הפרמטרים ו-3.27 מיליארד הפרמטרים הפעילים, שסיים אימון מקדים ב-11 ביוני 2026 ומעולם לא שוחרר לציבור. שני מודלים, בהפרש של שלושה חודשים, והמרחק ביניהם הוא הדבר המעניין ביותר בשחרור.

מה שהופך את Kolibri לשווה קריאה מדוקדקת הוא לא היותו המודל החזק ביותר הזמין. לפי טבלאות ההשוואה של Aleph Alpha עצמה הוא אינו כזה, ונחזור לכך. מה שבולט הוא שמעבדה אירופית השיקה מודל במשקולות פתוחות בקנה מידה כזה בכלל, עם צינור האימון, מקור הנתונים ונתון האנרגיה שפורסמו לצידו, והגדירה את הרישיון כ-Apache 2.0 ולא כרישיון מחקרי ייעודי. עבור צוותים שכללי הרכש שלהם מתחילים בשאלה "לאן הולכים הנתונים", השילוב הזה הוא המוצר.

דף המפרט, ושני המספרים שחשובים

כל מה שלהלן לקוח מכרטיס המודל ש-Aleph Alpha פרסמה יחד עם המשקולות; שום דבר ממנו לא שוחזר באופן עצמאי עדיין, ואין שורה של Artificial Analysis עבור Kolibri בזמן כתיבת שורות אלה.

• סך הפרמטרים — 78,103,074,560, עם 3,457,573,120 פעילים לכל טוקן, יחס של בערך 22.6 ל-1.

• ארכיטקטורה — טרנספורמר בעל 50 שכבות, כל השכבות תערובת-מומחים, 384 מומחים בכל שכבה עם 1 משותף ו-6 מנותבים, ותערובת של 4:1 של קשב חלון-מחליק לקשב מקובץ-שאילתה לאורך המחסנית.

הקשר — אומן ב-16,384 טוקנים, עבר אימון-ביניים ב-65,536, והורחב לנייטיבי של 262,144. מכיוון שהקידוד המיקומי מוחל רק בשכבות חלון ההזזה, Aleph Alpha מציינת שניתן להרחיב את החלון ללא שינוי קנה מידה מיקומי, ואימתה איכות ויעילות הגשה של עד 1,048,576 טוקנים. הכרטיס ממליץ להישאר על 262,144 או מתחת לכך עבור עבודה רגישה להשהיה ולמשימות מורכבות.

• דיוק — משקולות FP8 בבלוקים של 128×128 עם אקטיבציות מכומתות דינמית, הנמדדות עם מטמון KV של FP8; הטמעות, ראש ה-LM, הנורמות ונתב ה-MoE נשארים ב-bfloat16.

• הסקה — ארבע רמות מאמץ: ללא, נמוכה, בינונית וגבוהה, הנקבעות באמצעות תבנית הצ׳אט.

• קריאה לכלים — כן, בסגנון Hermes, עם מפענח vLLM המגיע באותו מאגר כמו המשקלים.

• שפות — גרמנית ואנגלית, ותו לא. זה מוצהר כבחירה עיצובית ולא כהשמטה.

• אימון — 20 טריליון טוקנים של קדם-אימון על קורפוס דו-לשוני מסונן, כ-62.5 אחוזים אנגלית, 23.9 אחוזים גרמנית ו-13.6 אחוזים קוד, בתוספת 3.44 טריליון טוקנים של אימון ביניים ו-201 מיליארד להרחבת הקשר ארוך.

• חישוב — 768 כרטיסי NVIDIA B200 על פני 96 צמתי HGX, 21 ימים של אימון מוקדם במשך 511 שעות ו-392,000 שעות GPU, בקצב מדווח של 6.4×10²³ FLOPs. אימון ביניים הוסיף חמישה ימים ו-90,000 שעות GPU; הרחבת הקשר ארוך הוסיפה 13 שעות ו-10,000 שעות GPU.

• אנרגיה — 9.5×10² MWh בהערכה, כולל תקורת מרכז נתונים, המכסה אימון מקדים, אימון ביניים ואימון בהקשר ארוך, אך לא כולל כיוונון עדין מפוקח ולמידת חיזוק.

• רישיון — Apache 2.0. אין נספח שימוש מקובל, אין סף משתמשים פעילים חודשיים, ואין תנאים מסחריים נפרדים.

שתיים מהשורות האלה הן שורות שקונה צריך לקרוא פעמיים. מספר הפרמטרים הפעילים הוא מה שמשלמים עליו בזמן הסקה, ו-3.46 מיליארד פעילים מתוך 78 מיליארד בסך הכול הוא יחס ספארסיות אגרסיבי — זו כל הסיבה לכך שמודל בגודל כזה יכול להיות מוגש בכלל על שני GPUs. ונתון ההקשר מוצהר כ-262,144 נייטיבי עם 1,048,576 מאומת, וזו הצהרה זהירה יותר מאשר "הקשר של 1M" השטוח שתראו ברוב הסיקור של ההשקה הזו.

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

שני דגמים, שלושה חודשים זה מזה

Kolibri הוא המודל השני מתוך מה ש-Aleph Alpha מכנה ה-Model Factory שלה, ולוח הזמנים שפרסמה הוא החלק בהשקה שרוב הסיקור מדלג עליו.

העבודה על צינור האימון החלה בינואר 2026. Kolibri Origin סיים אימון מקדים בקנה המידה המיועד ב-11 ביוני 2026 — 30.6 מיליארד פרמטרים בסך הכול, 3.27 מיליארד פעילים, חלון הקשר של 65,536 טוקנים, 7.51 טריליון טוקני אימון, 50 שכבות שמתוכן שתיים צפופות ו-48 MoE, ומצב הסקה יחיד. הוא עבר ולידציה פנימית ומעולם לא שוחרר לציבור. Kolibri סיים אימון מקדים ב-11 בספטמבר 2026.

• פרמטרים — 30.6B בסך הכול ו-3.27B פעילים, לעומת 78.1B בסך הכול ו-3.46B פעילים.

• הקשר — 8,192 טוקנים של הקשר קדם-אימון ב-Origin, לעומת 16,384 ב-Kolibri, ומסתיים ב-262,144 נייטיבי.

• נתונים — 7.51 טריליון טוקנים של אימון מקדים ב-Origin, לעומת 20 טריליון, שנשאבו ממאגר גולמי של יותר מ-200 טריליון, שצינור העיבוד סינן, הסיר כפילויות ואצר.

• ארכיטקטורה — שתי שכבות צפופות ועוד 48 שכבות MoE ב-Origin, לעומת 50 שכבות MoE, עם עיצוב קשב שונה, פי שלושה מספר המומחים, דלילות גבוהה יותר ואלגוריתם ניתוב שהוחלף.

• הסקה — מצב אחד ב-Origin, לעומת אין, נמוך, בינוני וגבוה ב-Kolibri.

• הפצה — אין הפצה ציבורית עבור Origin, 3 באוקטובר 2026 עבור Kolibri.

המספרים שזזים הכי הרבה הם אלה של מערכי המשימות, שבהם אותו מערך הערכה העניק ציון לשני המודלים. בממוצע הגרמני של מערך לאחר האימון, Origin קיבל 46.4 ו-Kolibri קיבל 70.8; בממוצע האנגלי, 54.1 מול 75.5. ב-AIME 2025 בגרמנית, 73.5 מול 87.5. בבנצ'מרקים הפנימיים של פרוקסי-לקוח שהספק מפרסם כמערך אנכי, מערך ספקי הרכב עלה מ-0.72 ל-0.99, מוליכים למחצה מ-0.35 ל-0.80, המגזר הציבורי הגרמני מ-0.54 ל-0.75, טכנולוגיית הנעה תעשייתית מ-0.31 ל-0.60 ותעופה וחלל מ-0.14 ל-0.59.

המספרים הוורטיקליים הפנימיים האלה מופעלים על ידי הספק על גבי חבילות הערכה שנבנו על ידי הספק ומיועדות סביב לקוחות הספק, אז התייחסו אליהם כתיאור של כוונה ולא כאל ציון. הנקודה בפרסום שלהם היא שהם מסבירים עבור מה המודל עבר אופטימיזציה: לא לוח דירוג, אלא אוסף של מסמכים מתעשיות מפוקחות.

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

גרמנית היא החלטה עיצובית כאן, לא תג שפה

רוב כרטיסי המודל ה"רב־לשוניים" מתכוונים לתערובת אימון שבמקרה כללה קצת גרמנית. זה בנוי בדיוק ההפך, והכרטיס מפרט את המכניקה.

Aleph Alpha מצאה מניסויים קטנים עם מודלי פרוקסי שכ-20 אחוז נתונים בגרמנית בתערובת הניבו את התוצאות הטובות ביותר, ובהרצה של 20 טריליון טוקנים המשמעות הייתה למצוא 4 טריליון טוקנים בגרמנית. מערכי נתונים גרמניים פתוחים שעברו דה-דופליקציה וסינון סיפקו לה 390 מיליארד — פחות מהיעד בסדר גודל. היא סגרה את הפער בשלוש דרכים: כיוונון מחדש של מסנן Common Crawl במיוחד עבור גרמנית, שהפיק 1.3 טריליון טוקנים אורגניים ייחודיים; ניסוח מחדש של מסמכים גרמניים קיימים לערכים בסגנון אנציקלופדיה, דיאלוגים של שאלות ותשובות וקטעי טקסט, שהפיקו כ-1 טריליון נוספים והפכו למקור הגרמני הגדול ביותר; ותרגום, שנעשה בו שימוש רק ב-Kolibri Origin והוסר עבור Kolibri. הגרמנית הסתיימה כמאגר ייחודי של 2.4 טריליון טוקנים, ש-80 אחוזים ממנו אוצרו או נוצרו באופן פנימי, והיא הופיעה בשיעור של 21.3 אחוזים מטוקני האימון המקדים לאחר אפסמפלינג.

פרט המסנן ראוי לציטוט, משום שזה מסוג הדברים שמתגלים רק במעבדה שהתאמנה בפועל על גרמנית. צינור עיבוד נתוני שפה סטנדרטי משליך מסמכים עם יותר מדי מילים ארוכות — אך פרוזה מנהלית בגרמנית חורגת באופן שגרתי מהגבול האנגלי לאורך מילה ממוצע, כך שהגדרות ברירת המחדל מוחקות בשקט את הרגיסטר שהמינהל הציבורי כותב בו. ההשלכה המסחרית הברורה היא שלמודל שאומן על מסנן אנגלי סטנדרטי אין אוצר מילים משפטי-מנהלי גרמני של ממש, ואף בנצ'מרק לא יגיד לכם זאת.

הטוקנייזר זוכה לאותו יחס. Aleph Alpha אימנה טוקנייזר דו-לשוני גרמני-אנגלי עם אוצר מילים של 128,000 טוקנים, בשיטה חדשה שהיא מכנה UniBPE, ששומרת על המיזוג מלמטה למעלה של קידוד זוגות בתים (byte-pair encoding) אך בוחרת מיזוגים לפי פונקציית מטרה של יוניגרם. על טקסט רשת בגרמנית היא מדווחת על 4.90 בתים בממוצע לכל טוקן, ומקדימה את GPT-5 עם 4.35, Gemini עם 4.13, Qwen3.5–3.8 עם 4.17, GLM 5.3 עם 3.93, DeepSeek V4 עם 3.72 ו-Kimi K3 עם 3.28 — כולם נתונים שדווחו על ידי הספקים בהשוואה של הספק עצמו. יותר טקסט לכל טוקן משמעו פחות טוקנים לכל משימה, וזהו אפקט ישיר של עלות הסקה ולא טענה לגבי איכות, וזה מסוג ניצחונות היעילות שמצטברים לאורך עומס עבודה של עיבוד מסמכים.

מה שטבלת הספק אינה מכריעה

Aleph Alpha פרסמה השוואה של פוסט-אימון המכסה ארבעה עשר מודלים, והיא שימושית יותר מרוב טבלאות ההשקה מפני שהיא אינה מחמיאה לנושא.

על אותו הרנס, כאשר Kolibri מוגדר ברמת מאמץ חשיבה גבוהה, Qwen3.8 27B משיג 80.2 בממוצע האנגלי, לעומת 75.5 של Kolibri, ו-79.9 בממוצע הגרמני, לעומת 70.8. הוא גם מוביל ב-GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified ובשני מבחני ההקשר הארוך. Nemotron 3 Super 120B-A12B משיג 73.0 באנגלית לעומת 75.5 של Kolibri — קרוב יותר, ומוביל ב-AIME 2025. Gemma 4 26B-A4B IT משיג 71.9 ו-66.3 בשני הממוצעים.

אז הסיכום הכנה של ההשקה אינו "המתקדם ביותר". הוא ש-Kolibri נמצא באמצע שדה של מודלים שמפעילים בין שלושה לשנים־עשר מיליארד פרמטרים לכל טוקן, שהוא מנצח בבירור את אלה הקטנים בהרבה, ושהוא מפסיד למודל צפוף בן 27 מיליארד פרמטרים של Alibaba ברוב השורות של הטבלה של עצמו, בעודו מפעיל בערך שמינית מהפרמטרים. המסגור של Aleph Alpha לכך הוא חזית פארטו של איכות מול טוקנים מפוענחים לשנייה לכל GPU — אף אחד מהמודלים המושווים לא מספק איכות גבוהה יותר באותה עלות הגשה, או את אותה איכות בעלות נמוכה יותר. זו הטענה שיש לבחון, והיא טענת כלכלת הגשה, לא טענת יכולת.

אף אחד מהנתונים האלה לא אומת באופן בלתי תלוי. אין רשומה של Artificial Analysis עבור Kolibri, אין שכפול מצד שלישי של מסגרת ההערכה, והבנצ'מרקים הוורטיקליים נבנו על ידי הספק. ההשוואה גם נדיבה מבחינה מבנית כלפי Kolibri בכיוון אחד ובלתי נדיבה בכיוון אחר: כל ארבעה־עשר המודלים הורצו דרך מערכת ההרצה של Aleph Alpha עצמה עם פרומפטים זהים והגדרות few-shot זהות, וזו הדרך הנכונה לעשות זאת, אבל זו עדיין מערכת הרצה של מעבדה אחת. התייחסו לכל מספר בסעיף הזה כמדווח על ידי הספק עד שמישהו אחר יריץ את ההערכה.

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

מה שאתה צריך כדי להריץ את זה

Kolibri אינו מודל שמנסים על מחשב נייד. משקולות ה-FP8 הן נפח זיכרון של מודל של כ-78 GB, והמינימום מבחינת כרטיסים הוא שני כרטיסי A100 80 GB, שני H100 SXM5, H200 אחד, B200 אחד או B300 אחד; התצורה המומלצת היא שני H100 SXM5, שני H200, B200 אחד או B300 אחד.

הגשתו מחייבת התקנה של החבילה aleph-alpha-inference, המספקת את תוסף Kolibri vLLM ומצמידה את גרסת vLLM שהיא תומכת בה, או משיכה של תמונת הקונטיינר ghcr.io/aleph-alpha/aleph-alpha-inference. משם מדובר בהפעלה סטנדרטית של vLLM עם מטמון KV מסוג FP8, מנתח החשיבה של Kolibri ומנתח קריאות הכלים של Kolibri. הקשרים מעבר ל-262,144 אסימונים דורשים דגל מפורש של maximum-model-length ועקיפה של position-embedding. פרמטרי הדגימה המומלצים הם temperature 1.0, top-p 0.97 ו-top-k 128.

משטח ה-API תואם ל-OpenAI, וזה חשוב יותר ממה שזה נשמע: מאמץ החשיבה מועבר דרך תבנית הצ'אט כערך reasoning_effort, וקריאות לכלים נפלטות בשדה tools הסטנדרטי. צוות שכבר מדבר בפורמט chat-completions יכול להפנות קוד קיים לנקודת קצה של Kolibri על מכונה בבניין שלהם בלי שכבת עטיפה.

מה שאין ל-Kolibri עדיין

ארבע היעדרויות ראויות להיאמר בבירור, מפני שסיקור ההשקה נוטה לדלג עליהן.

אין הערכה עצמאית. ל-Artificial Analysis אין עמוד מודל עבור Kolibri, ואף צד שלישי לא פרסם שחזור של טבלת הבנצ'מרק של הספק.

• אין נקודת קצה מתארחת מטעם הספק. השחרור הוא משקלים בתוספת דוח טכני; אין SKU של API של Aleph Alpha עבור Kolibri בחומר שפורסם עם המודל.

• אין נתיב ב-OrcaRouter, וגם לא באף אגרגטור שהיינו נוקבים בשמו. בדקנו את הקטלוג בכל איות של קידומת הספק ושל שם הדגם, ו-Kolibri לא מופיע שם — אז אם ברצונך לפנות אליו, אתה מוריד 78 GB ומריץ נקודת קצה של vLLM בעצמך. מוטב לנו לומר זאת מאשר לרמוז שאנחנו מגישים אותו.

• ללא קלט רב-מודלי. טקסט נכנס, טקסט יוצא, שתי שפות. זהו המחיר שהמעבדה שילמה כדי להעדיף עומק על פני רוחב, ולפריסה לעיבוד מסמכים זה כנראה המחיר הנכון, אבל זהו גבול ממשי.

אם מה שאתם באמת צריכים היום הוא מודל קטן מסוג mixture-of-experts שאפשר לקרוא לו בלי לקנות שני כרטיסי GPU, שכבת ה-Gemma 4 MoE היא הדבר הקרוב ביותר שכבר נמצא בנקודת קצה מנותבת, במחיר של $0.06 למיליון טוקני קלט ו-$0.33 למיליון טוקני פלט בגרסת 26B-A4B, עם חלון של 262,144 טוקנים. עבור מי ששוקל פריסה ריבונית בהתארחות עצמית של 78B מול זה, ההשוואה השימושית אינה שורות של בנצ'מרקים — אלא 78 GB של VRAM ושיחה על רכש מול סעיף חיוב לפי טוקן. OrcaRouter מנתב את השכבה הזו באמצעות מפתח אחד תואם OpenAI, כשמחיר המחירון של הספק מועבר כמו שהוא בלי תוספת, וזו הדרך הזולה לגלות אם עומס העבודה מצדיק את הבעלות על החומרה.

קוליברי עצמו הוא הארטיפקט המעניין יותר. מודל גרמני-אנגלי בן 78 מיליארד פרמטרים תחת Apache 2.0, עם צינור הנתונים, שיטת הטוקנייזר, נתון האנרגיה וסיפור איטרציה בן שלושה חודשים שמפורסמים לצד המשקלים, הוא סוג אחר של שחרור לעומת שחרור המשקלים הרגיל — החשיפה היא חלק מהמוצר, לא פוסט בלוג עליו. האם טענת פארטו מחזיקה מעמד היא כעת שאלה לאנשים עם שני H100s ושעון עצר, והתשובה לא תגיע מאף אחד שכתב את כרטיס המודל.