
Kolibri לעומת MiniCPM5-2B: 78 מיליארד פרמטרים מול 2.5, ומדוע הקטן אינו האפשרות הזולה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 217 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הצב את Kolibriלצד MiniCPM5-2Bוהקריאה האינסטינקטיבית היא שזו השוואת גדלים, ושהמודל בעל 2.5 מיליארד הפרמטרים הוא הבחירה החסכונית. קריאה זו שגויה באופן מאלף. Kolibri הוא מודל תערובת המומחים של Aleph Alpha בעל 78.1 מיליארד פרמטרים, שיצא לאור ב-3 באוקטובר 2026, מפעיל 3.46 מיליארד פרמטרים לכל טוקן, עם נפח FP8 של כ-78 ג'יגה-בייט ותצורת הגשה מינימלית של שני כרטיסי A100 80 GB. MiniCPM5-2B הוא המודל הצפוף בעל 2.52 מיליארד פרמטרים של ModelBest ו-OpenBMB, שנחשף בכנס העולמי לבינה מלאכותית ב-19 ביולי 2026, כשהמשקולות עלו ל-Hugging Face ב-6 בספטמבר. MiniCPM5-2B קטן פי שלושים ואחד במספר הפרמטרים. הוא גם זה שמחייב תקציב הערכה לפני שסומכים עליו, מפני שהמספרים המצוטטים ביותר שלו הופקו על ידי הספק ולא שוחזרו — וזה בדיוק ההפך ממה ש"מודל קטן" מרמז בדרך כלל לגבי סיכון.
שניהם שוחררו בשקט; רק אחד מהם שוחרר לאחרונה
יש להם סיפורי מקור דומים וגילים שונים מאוד, והגילים חשובים. המאגר של Aleph Alpha עבור Kolibri נוצר ב-2 באוקטובר 2026 עם תאריך שחרור מוצהר של 3 באוקטובר, וההודעה של חדר החדשות של הספק עצמו יצאה באותו בוקר, ביום האיחוד הגרמני. עיתונות ה-AI הכללית פספסה זאת ברובה באותו יום, ומשם הגיע המסגור של "השחרור השקט", אבל כרטיס דגם, דוח טכני ופוסט של ספק אינם שחרור שקט. MiniCPM5-2B היה שקט יותר באמת: ההכרזה ב-WAIC ביולי הייתה חשיפה בכנס של פיץ' ומפרטים, והמשקלים בפועל לא הופיעו עד 6 בספטמבר, פורסמו בלי אירוע השקה, לצד צ'קפוינטים מסוג GGUF, MLX, GPTQ, base, SFT ו-draft וקורפוסי האימון שמאחוריהם.
הפער הזה של חמישה שבועות בין ההכרזה למשקלים שווה לזכור, מפני שזו הסיבה לכך ששני סטים שונים של מספרים מסתובבים לגבי המודל הזה. החומר מיולי הציג חלון הקשר של 512K טוקנים. התצורה שנשלחה מגדירה 131,072. הארטיפקט ששוחרר הוא זה שנחשב.
מה כל מודל מיועד לו בפועל
Kolibri נבנה לעבודה עם מסמכים בגרמנית ובאנגלית, ו-Aleph Alpha מפרטת באופן יוצא דופן מדוע זה דרש הנדסה אמיתית. ניסויים קטנים עם מודלי פרוקסי הציבו יעד של כ-20 אחוז גרמנית בתערובת האימון, אשר עבור ריצה של 20 טריליון טוקנים פירושו היה למצוא 4 טריליון טוקנים בגרמנית. מערכי נתונים גרמניים פתוחים שעברו דה-דופליקציה וסינון הניבו 390 מיליארד — קצר בסדר גודל — ולכן המעבדה כיווננה מחדש מסנן של Common Crawl במיוחד עבור גרמנית, והפיקה 1.3 טריליון טוקנים אורגניים ייחודיים, וניסחה מחדש מסמכים גרמניים קיימים לערכים אנציקלופדיים, לדיאלוגים ולקטעים עבור בערך עוד טריליון, שהפך למקור הגרמני הבודד הגדול ביותר. תרגום, ששימש את קודמו Kolibri Origin, הושמט ב-Kolibri. פרט המסנן הוא זה שכדאי לזכור: צינור עיבוד נתוני שפה סטנדרטי פוסל מסמכים עם יותר מדי מילים ארוכות, ופרוזה מנהלית גרמנית עולה באופן שגרתי על הגבול האנגלי לאורך מילה ממוצע, כך שהגדרות ברירת המחדל מוחקות בשקט את הרגיסטר שבו כותב המינהל הציבורי.
MiniCPM5-2B נבנה עבור הקצה ההפוך — סוכן על-מכשיר. הכרטיס מתאר טרנספורמר צפוף של 2.52 מיליארד פרמטרים בסך הכול, 1.98 מיליארד ללא פרמטרי הטמעה, 42 שכבות בגודל חבוי 2048, מנגנון תשומת לב מסוג grouped-query עם 16 ראשי query ו-2 ראשי KV, וארכיטקטורת LlamaForCausalLM סטנדרטית ללא קרנלים מותאמים אישית. צינור האימון נוטה להיות סוכני: אימון-ביניים סוכני בקנה מידה של 200 מיליארד, סט גדול של agent-SFT סוכני, יישור RL סוכני, ושלב סופי של On-Policy Distillation שמקפל שישה-עשר מודלים מומחי RL בחזרה לרשת צפופה קטנה אחת. הוא מגיע עם קריאות כלים בסגנון XML עם מנתח SGLang מובנה, והקונפיגורציה שפורסמה שלו קובעת חלון של 131,072 טוקנים.
• פרמטרים — Kolibri: 78,103,074,560 סה״כ, 3,457,573,120 פעילים, דלילות של 22.6:1. MiniCPM5-2B: 2,516,756,480 סה״כ, 1.98 מיליארד שאינם embedding, צפוף.
• שוחרר — Kolibri: 3 באוקטובר 2026. MiniCPM5-2B: הוכרז ב-19 ביולי 2026, משקלים ב-6 בספטמבר 2026.
• הקשר — Kolibri: 16,384 מאומן, 65,536 באימון ביניים, 262,144 נייטיבי, 1,048,576 מאומת. MiniCPM5-2B: 131,072 בתצורה שסופקה; הטענה על 512K מיולי אינה נכללת בה.
• טביעת רגל — Kolibri: כ־78 GB ב־FP8; שני A100 80 GB, שני H100 SXM5, H200 אחד, B200 אחד או B300 אחד לכל הפחות. MiniCPM5-2B: פלח BF16 בודד, ברמת מחשב נייד.
• שפות — Kolibri: גרמנית ואנגלית, לפי התכנון ולא שום דבר אחר. MiniCPM5-2B: אנגלית וסינית, כאשר כל ערכות ההערכה שפורסמו הן באנגלית.
• קריאה לכלים — Kolibri: בסגנון Hermes עם מפענח vLLM מובנה. MiniCPM5-2B: בסגנון XML עם מפענח SGLang.
• רישיון — שניהם Apache 2.0, שניהם ללא נספח שימוש מקובל.

לוחות התוצאות, והמקורות שמאחוריהם
אין שום נתון של ראש בראש לזיווג הזה בשום מקום, בחומר של אף אחד מהספקים, ואנחנו לא מתכוונים להרכיב אחד משני מתקני בדיקה שונים ולקרוא לזה השוואה. שווה להפריד בזהירות את מה שכל צד מפרסם, מפני ששתי קבוצות הנתונים נושאות כמויות שונות מאוד של ראיות.
המספרים של Kolibri מגיעים מטבלת ההשוואה של ארבעה־עשר מודלים של Aleph Alpha עצמה, שהורצה על הרנס יחיד כאשר Kolibri פועל במאמץ חשיבה גבוה: 75.5 בממוצע האנגלי, 70.8 בממוצע הגרמני. הטבלה הזו אינה מחמיאה למושא שלה — Qwen3.8 27B משיג 80.2 ו-79.9 באותם שני ממוצעים ומוביל ב-GPQA Diamond, ב-LiveCodeBench v6, ב-SWE-Bench Verified ובשני מבחני ההקשר הארוך, תוך שהוא מפעיל בערך שמינית מהפרמטרים של Kolibri. המסגור של הספק לפער הזה הוא חזית פרטו של איכות מול אסימונים מפוענחים לשנייה לכל GPU, שאף אחד מהמודלים המושווים לא גובר עליה. זהו טיעון של כלכלת הגשה, לא טיעון של יכולת, ואף צד שלישי לא מדד אותו: אין רשומה של Artificial Analysis עבור Kolibri ואין שכפול של ההרנס.
המספרים של MiniCPM5-2B מגיעים מהכרטיס של המודל עצמו: ממוצע פנימי של 53.9 על פני סט השוואה שנבחר על ידי ספק, AIME 2025/2026 ב-86.5, MATH-500 ב-94.6, ו-46.4 בהרצת ספק על SWE-bench Verified — נתון שהיה יוצא דופן עבור מודל צפוף עם 2.5 מיליארד פרמטרים אם ישרוד בדיקות עצמאיות. באותו כרטיס, Granite 4.2 3B של IBM עומד על 42.7 מול 53.9 של MiniCPM5-2B — ספק אחד שהריץ את שני המודלים על סט אחד שהוא בחר. סטים שונים, הרנסים שונים, ספקים שונים. שום דבר מזה אינו פסק דין על הזיווג הזה.
מה שבאמת שימושי בצד של MiniCPM5-2B הוא החשיפה. OpenBMB שחררה את קורפוסי האימון UltraData לצד המשקולות — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, ערכות ה-SFT וה-RL של הסוכן — הכול תחת Apache 2.0, מה שהופך קופסה שחורה למתכון שאפשר לבדוק ולהמשיך על הדומיין שלך. המודל מגיע גם עם התאמה מיום האפס על פני תשע משפחות שבבים דרך קהילת FlagOS של ModelBest, מ-Huawei Ascend ועד NVIDIA ו-ARM, וזו הצהרת פריסה ולא הצהרת בנצ'מרק. כנגד זה, IBM פרסמה את המשקולות של Granite 4.2 3B ותיאור טכני מפורט של הבנייה, אך לא את נתוני האימון שלה, ו-Aleph Alpha פרסמה את צינור הנתונים וחשבונאות האנרגיה של Kolibri — 20 טריליון טוקנים של אימון מקדים, 9.5×10² MWh כולל תקורת מרכזי נתונים ולא כולל כיוונון עדין מפוקח ולמידת חיזוק — אך לא את הקורפוס עצמו.
איפה פער הגודל באמת בא לידי ביטוי
הדרך השימושית ביותר להעמיד את השניים זה לצד זה היא על שני הצירים שקובעים פריסה ממשית: מה חייב להיות בחדר, ומה קורה כשהמודל טועה.
מבחינת חומרה, MiniCPM5-2B מנצח וזה בכלל לא צמוד. מודל dense עם 2.52 מיליארד פרמטרים ב-shard יחיד של BF16 רץ על לפטופ, על edge box או על GPU צרכני בודד, והתמיכה של FlagOS בתשע משפחות שבבים פירושה שהוא רץ על חומרה שאינה מאיץ NVIDIA בכלל. הרף התחתון של Kolibri הוא שני כרטיסי A100 80 GB או B200 אחד, בערך 78 GB של משקולות FP8, כשהוא מוגש דרך התוסף vLLM של aleph-alpha-inference או הקונטיינר המפורסם. עבור עומס עבודה של קוקפיט חכם או כזה שצמוד לטלפון, ה-2B הוא היחיד מבין השניים שמתאים, ו-Kolibri מעולם לא תוכנן להתחרות שם.
בכל הנוגע ליכולת אימות, Kolibri זוכה מסיבה עדינה יותר. הטענה המצוטטת ביותר של Kolibri — כלכלת ההגשה — לא נבדקה, אבל נתוני האיכות שלה לפחות פורסמו מול שלושה־עשרה מתחרים בשמם על הרנס אחד, כשההגדרות מפורטות, והטבלה של הספק עצמו מעניקה את הניצחון ברוב השורות ליריב. המספרים המרכזיים של MiniCPM5-2B הם של הספק, על הסוויטה של הספק, כאשר אין הרנס השוואתי גלוי, והמודל נושא אי־ודאות נוספת של צ'קפוינט בן שבועות ולא ימים. אף אחד מהמודלים לא נבחן בבנצ'מרק בלתי תלוי. ההבדל הוא שספק אחד רשם השוואה שגורמת למודל שלו להפסיד, והאחר רשם השוואה שגורמת למודל שלו לנצח בפער גדול.
במכוון, אין כאן תחרות כלל. Kolibri קיים לעיבוד מסמכים בשפה הגרמנית בסביבה מקומית (on-premises), עם טוקנייזר דו-לשוני ש-Aleph Alpha מדווחת על 4.90 בתים בממוצע לטוקן בטקסט אינטרנט גרמני, לעומת 4.35 של GPT-5 ו-3.28 של Kimi K3 — הכול נמדד על ידי הספק, ואפקט עלות לטוקן ולא טענת איכות. MiniCPM5-2B קיים עבור סוכנים הקוראים לכלים (tool-calling) באנגלית ובסינית על חומרה מוגבלת. צוות עם חוזים בגרמנית ודרישת תאימות לא בוחר בין השניים.

מציאות הניתוב, והניסוי ששווה להריץ
אף אחד מהמודלים אינו נמצא בקטלוג מתארח כיום, ובדקנו את שניהם במקום להניח. ל-Kolibri אין מק"ט API של ספק — ההפצה היא משקלים, דוח טכני ותמונת מכולה — והוא אינו ב-OrcaRouter: בדקנו את הקטלוג בכל איות של קידומת הספק ושל שם המודל והוא מחזיר "לא נמצא". גם ל-MiniCPM5-2B אין נקודת קצה מתארחת מ-ModelBest, והוא אינו מנותב אצלנו. שניהם הצעות באירוח עצמי, ומעדיפים לומר זאת מאשר לרמוז שאנו מספקים אחד מהם.
המקום שבו זה נעשה מעניין הוא הניסוי. מודל אג'נטי עם 2.5 מיליארד פרמטרים ומודל מסמכים עם 78 מיליארד פרמטרים פותרים בעיות שונות, והדרך היחידה לדעת איזה מהם עומס העבודה שלכם דורש היא להריץ את שניהם מולו — וזה בדיוק המצב ששכבת ניתוב נבנית עבורו, גם כשהיא עצמה לא נושאת אף אחד מהמודלים. כוונו נתיב בדיקה לבנייה בהתארחות עצמית של MiniCPM5-2B דרך נקודת קצה אחת תואמת OpenAI עם מעבר אוטומטי בין שרתים, כשסביבת הייצור נשארת על מודל מנותב מוכח, והסטאק החדש יכול להיתקע או להפיק שטויות בלי להפיל שום דבר. מחירי המחירון של הספקים על המודלים שאתם משווים אליהם עוברים ללא תוספת מחיר, כך שהשוואת ה-A/B נשארת זולה והפיכה. ואם מה שהניסוי בעצם חושף הוא שעומס העבודה הגרמני שלכם לא צריך אף אחד מהמודלים בהתארחות עצמית, אותו מפתח מגיע לשכבה קטנה של mixture-of-experts שכבר מנותבת — וריאנט Gemma 4 26B-A4B במחיר של $0.06 למיליון טוקנים בקלט ו-$0.33 למיליון בפלט, עם חלון של 262,144 טוקנים וקלט טקסט, תמונה וווידאו — וזו הדרך הזולה ביותר לגלות את זה לפני שאתם קונים שני כרטיסים גרפיים.
איזה מהם, ומה ישנה את התשובה
הפעל את MiniCPM5-2B אם האילוץ הוא המכשיר. עם 2.52 מיליארד פרמטרים הוא היחיד מבין השניים שנכנס למחשב נייד, לתא טייס או לקופסת edge, ואם עומס העבודה שלך הוא סוכן אינטראקטיבי לקריאת כלים באנגלית או בסינית, זה המודל שמיועד לכך. הקצה זמן לשחזר תחילה את המספרים שלו — הממוצע של 53.9 והטענה של 46.4 ב-SWE-bench הם של ModelBest בלבד, והעובדה שתאגידי האימון פתוחים הופכת את השחזור הזה לאפשרי באמת ולא לתיאורטי.
הרץ את Kolibri אם הקורפוס בגרמנית, החומרה קיימת, ואסור שהמשקלים יצאו מהבניין. חלון מקורי של 262,144 טוקנים, מטמון KV מסוג FP8, ארבע רמות של מאמץ חשיבה וקריאה לכלים של Hermes הם הצורה הנכונה לעבודת מסמכים בפיקוח רגולטורי, ותנאי Apache 2.0 יחד עם צינור הנתונים שפורסם הם החלק ששורד בדיקת רכש.
שני דברים יכריעו את זה מהר יותר מכל ויכוח. הרצה בלתי תלויה של SWE-bench Verified על MiniCPM5-2B תאשר או תפיל את הטענה המפתיעה ביותר שאחד מהכרטיסים טוען. ומדידת תפוקה בלתי תלויה של Kolibri בתצורת שתי כרטיסי H100 המומלצת שלו — או רשומה של Artificial Analysis, שלא קיימת היום — תהפוך את "78 מיליארד פרמטרים" ממפרט לעלות, וזה המספר שכל מי ששוקל את ההשוואה הזו מול חומרה באמת מחפש. עד אז, פער הגודל הוא אמיתי, פער הייעוד גדול יותר, והאפשרות שנראית זולה היא זו שנושאת את הטענה שאינה מאומתת.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
