נוצר כרטיס הירו עבור Kolibri נגד Gemma 4 12B, עם הכותרת 'Kolibri נגד Gemma 4 12B' וכותרת המשנה 'מודל MoE של 78B מול מודל צפוף של 11.95B', אייקון של יונק דבש בצד שמאל ויהלום בצד ימין, משני צדיו של קו מפריד דק. הלוגו של OrcaRouter נמצא ברצועה שמתחת לאיור.
Guides & Insights

Kolibri נגד Gemma 4 12B: 78 מיליארד פרמטרים לעומת 12, ורק לאחד מהם יש ציון

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Kolibri וGemma 4 12B הם שני הקצוות של ספקטרום ששחרורים במשקולות פתוחות בדרך כלל לא מאפשרים להשוות בתנאים שווים. Kolibri של Aleph Alpha הושק ב-3 באוקטובר 2026: 78.1 מיליארד פרמטרים בסך הכול, 3.46 מיליארד פעילים לכל טוקן, חלון הקשר מאומת של 1,048,576 טוקנים, גרמנית ואנגלית בלבד, Apache 2.0. Gemma 4 12B הושק ב-3 ביוני 2026: 11.95 מיליארד פרמטרים צפופים, חלון הקשר של 262,144 טוקנים, קלט טקסט, תמונה, אודיו ווידאו, Apache 2.0. לאחד מהם יש ציון עצמאי שניתן לשחזור בפומבי. לשני יש טבלת בנצ'מרק של ספק. האסימטריה הזו אינה הערת שוליים להשוואה הזו; היא ההשוואה, כי כל דבר אחר שאכפת לקונה ממנו — עלות למשימה, איכות לוואט, האם זה יעבוד על המסמכים שלך — עובר דרכה.

עלינו להיות ישירים באותה מידה לגבי צורת ההשוואה, משום שכותרת שמציבה מודל 78B מול מודל 12B מזמינה מסקנה שגויה. אלה אינם מתחרים. האחד הוא פריסה של 78 GB שמיועדת לעבודת מסמכים במגזר הציבורי ובתעשייה בגרמניה, על מתלים שהלקוח מחזיק בבעלותו; האחר הוא מודל מולטימודלי מאוחד בן 12 מיליארד פרמטרים שרץ על מחשב נייד ונושא אינדקס עצמאי של 14. בהמשך ניתן תיאור של למה כל אחד מהם מיועד בפועל, היכן המספרים המפורסמים מאפשרים לכם לדרג אותם והיכן לא, ומה המחיר של היעדר ציון עצמאי.

המספר האחד שאפשר לסמוך עליו כאן, והאחד שאי אפשר

Artificial Analysis ביצעה מדידה של Gemma 4 12B, בתצורת החשיבה שלו. הממצאים, כפי שפורסמו בעמוד המודל שלהם, הם אלה שיש לעבוד לפיהם:

• אינטליגנציה — ציון של 14 במדד Artificial Analysis Intelligence Index, שממקם אותו ברצועת הדירוג העליונה, במיקום #21 מבין 142 המודלים בהשוואה הזו, לעומת חציון של 8 עבור מודלים דומים.

• מהירות — 112.5 אסימוני פלט לשנייה, מקום 21 מתוך 142 בתצוגת המהירות, ומעל החציון של 91 אסימונים עבור מודלים דומים.

• מחיר — $0.10 למיליון טוקני קלט ו-$0.30 למיליון טוקני פלט, שהעמוד שלהם מסמן כיקר במידה מסוימת לעומת חציון של $0.03 ו-$0.15 עבור מודלים בגודל ובסוג דומים.

• מפרט — הקשר של 262,144 טוקנים, 12B פרמטרים בסך הכול, Apache 2.0, קלט טקסט, תמונה, דיבור וווידאו, פלט טקסט.

הכרעת הסיכום של Artificial Analysis עצמה בוטה באופן יוצא דופן עבור עמוד טבלת דירוג, וראויה לחזרה: Gemma 4 12B נמנה עם המודלים המובילים באינטליגנציה אך יקר במידה מסוימת לעומת מודלים אחרים עם משקולות פתוחות בגודל דומה. זוהי הערכה אמיתית, עצמאית וניתנת לשחזור מצד צד שלישי שאין לו אינטרס באף אחד מהספקים.

לכליברי אין שום מקביל. אין עבורו עמוד מודל ב-Artificial Analysis, ובזמן כתיבת שורות אלו שום צד שלישי לא שחזר את חבילת ההערכה. מה שקיים הוא טבלת ההשוואה של Aleph Alpha עצמה, שבה Kolibri מקבל 75.5 בממוצע האנגלי ו-70.8 בממוצע הגרמני על פני חבילת המשימות שלו. אלה ממוצעים באחוזים לא משוקללים על פני שילוב בנצ'מרקים שהספק בחר, על מסגרת בדיקה שהספק כתב, ברמת מאמץ חשיבה גבוהה. הם אינם Intelligence Index, ואת שני המספרים לא ניתן להמיר זה לזה או להציב זה לצד זה. כל מי שמציג את "Kolibri 75.5 לעומת Gemma 14" כדירוג משווה אחוז בסולם אחד לציון בסולם אחר. העמדה הכנה היא שהאיכות של Gemma 4 12B נמדדת וזו של Kolibri נתבעת.

מה שטבלת הספק כן מאפשרת לך לעשות הוא לקרוא לרוחב השורות. Gemma 4 26B-A4B IT, האח מבוסס תערובת המומחים של גוגל עצמה ל-12B, מופיע בטבלה של Aleph Alpha עם 71.9 באנגלית ו-66.3 בגרמנית, מתחת ל-Kolibri בשניהם. זה הדבר הקרוב ביותר לבדיקה צולבת שזמין, והוא מגיע עם אותה הסתייגות: הרנס של הספק, המספרים של הספק. זה אות חלש, לא ראיה.

Screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), marked 'Open weights model, Released June 2026', showing an Intelligence Index of 14 against a median of 8, a #21/142 intelligence rank and a #21/142 speed rank, 112.5 output tokens per second against a 91-token median, input pricing $0.10 per million tokens against a $0.03 median and output pricing $0.30 against a $0.15 median, a 262k-token context window, the summary verdict that the model is amongst the leading models in intelligence but somewhat expensive compared with other open-weight models of similar size, and the 142 models in this class count.

ה-12B הצפוף מול ה-78B הדליל הוא לא אי-ההתאמה שזה נראה

פער הארכיטקטורה גדול מפער הפרמטרים ברגע שמביאים בחשבון מה בעצם מחושב לכל טוקן.

• חישוב לכל טוקן — Gemma 4 12B מפעיל את כל 11.95 מיליארד הפרמטרים בכל טוקן. Kolibri מפעיל 3,457,573,120 מתוך 78,103,074,560 שלו, בערך אחד חלקי עשרים ושניים מהמודל, עם מומחה משותף אחד ושישה מומחים מנותבים בכל שכבה מתוך 384.

• זיכרון — הפשרה עובדת בכיוון ההפוך, והיא אכזרית. Gemma 4 12B ב-bfloat16 הוא בסדר גודל של 24 GB של משקלים. הכרטיס של Kolibri מעמיד את משקלי ה-FP8 על כ-78 GB, עם מינימום של שני כרטיסי A100 80 GB, שני H100 SXM5, H200 אחד, B200 אחד או B300 אחד.

• קשב — Gemma 4 משתמשת בשילוב היברידי של קשב חלון-מחליק מקומי וקשב גלובלי מלא, כאשר השכבה האחרונה היא תמיד גלובלית. Kolibri משתמשת בפיצול של 4:1 בין חלון-מחליק ל-grouped-query על פני 50 שכבות שכולן MoE.

• הקשר — 262,144 טוקנים עבור Gemma 4 12B; 262,144 נייטיבי עבור Kolibri, מאומת עד 1,048,576 ללא סקיילינג מיקום.

אז הניסוח הכנה של "78B מול 12B" הוא ש-Kolibri מנצחת בעלות ההפעלה ומפסידה בנפח המשקלים, ואף אחד מהיתרונות אינו בחינם. מודל דליל שמפעיל 3.46 מיליארד פרמטרים לכל טוקן עדיין צריך להחזיק את כל 78 המיליארד בזיכרון, ולכן רצפת הפריסה היא צמד מאיצים של 80GB ולא כרטיס צרכני אחד. Gemma 4 12B עושה את העסקה ההפוכה: חלק גדול יותר מהמודל מופעל בכל טוקן, אבל הוא נכנס לחומרה שאדם יכול לקנות.

יש עניין ייחודי לגרמנית בצד של Kolibri שמשנה את החשבון ולא את הדירוג. הטוקנייזר שלה עומד בממוצע על 4.90 בייטים לטוקן בטקסט אינטרנטי גרמני, לעומת 4.13 עבור Gemini, 4.17 עבור משפחת Qwen3.5–3.8 ו-4.35 עבור GPT-5, לפי המדידות של Aleph Alpha עצמה. פחות טוקנים לכל מסמך גרמני הוא הפחתה ישירה בעלות ההסקה, ולעומס עבודה שהוא טקסט מנהלי גרמני במיליונים, האפקט הזה יכול להיות שווה יותר מכמה נקודות מדד. הוא גם כולו מדווח על ידי הספק.

Generated two-column scoreboard for Kolibri and Gemma 4 12B. Left column Kolibri: independent score 'none published', context '262,144 native, 1M validated', parameters '78.1B MoE, 3.46B active', modalities 'text only', licence Apache 2.0, price 'self-host, 78 GB'. Right column Gemma 4 12B: independent score 'AA Index 14', context 262,144, parameters '11.95B dense', modalities 'text, image, audio, video', licence Apache 2.0, price '$0.10 in / $0.30 out'. The footer reads 'Kolibri figures vendor-reported; Gemma 4 12B figures per Artificial Analysis.'

מה שכל אחד מהם יכול למעשה לראות

כאן ההשוואה מפסיקה להיות צמודה, וזו עובדת מפרט ולא טענת איכות. Gemma 4 12B הוא מודל מולטימודלי מאוחד: הכרטיס שלו מתאר ארכיטקטורה נטולת אנקודר שמקרינה פיסות תמונה גולמיות וצורות גל אודיו ישירות אל מרחב ההטמעה של מודל השפה, עם טקסט, תמונה, דיבור וווידאו בכניסה וטקסט ביציאה. הוא נבנה כדי לפעול על מכשירי צריכה בלי צורך בהקצאת אנקודרים נפרדים.

קוליברי קורא טקסט, בשתי שפות, ותו לא. Aleph Alpha ממסגרת זאת בכוונה כ״עומק על פני רוחב״: שתי שפות, באוצרות קפדני, ולא תערובת רב-לשונית רחבה. אין מגדל ראייה, אין מסלול שמע, אין וידאו. אם עומס העבודה שלך כולל טפסים סרוקים, שיחות מוקלטות או תצלומים של ציוד, Gemma 4 12B הוא מועמד וקוליברי לא, ולא משנה מה אומרות שורות הבנצ׳מרק. אם עומס העבודה שלך הוא קורפוס של מסמכים בגרמנית ובאנגלית שאסור להם לעולם לצאת מהבניין, ההפך קרוב יותר לאמת — אך שים לב שדרישת ״לעולם לא לצאת מהבניין״ מתמלאת גם על ידי Gemma 4 12B, שכן המשקולות הן Apache 2.0 וניתנות להורדה.

איזה מהם זול יותר תלוי במה שאתה קונה

שני המודלים מתומחרים במטבעות שאינם ניתנים להמרה. ל-Gemma 4 12B יש שער שוק: 0.10$ ו-0.30$ למיליון טוקנים, כפי שנמדד בקרב ספקים על ידי Artificial Analysis, וזול יותר ברמת ה-MoE בנקודות קצה מנותבות. ל-Kolibri אין שער כלל, מפני ש-Aleph Alpha אינה מוכרת הסקה עבורו — השחרור הוא משקולות, דוח טכני וכרטיס מודל.

• Gemma 4 12B במסלול מתארח — $0.10 למיליון טוקנים בקלט ו-$0.30 למיליון בפלט לפי הנתונים של Artificial Analysis. בקטלוג שלנו, האח ה-MoE, ‏Gemma 4 26B-A4B IT, רשום ב-$0.06 בקלט ו-$0.33 בפלט עם חלון של 262,144 טוקנים, וה-Gemma 4 31B IT ה-dense הגדול יותר ב-$0.13 ו-$0.38; אלה מחירי מחירון של הספקים המועברים הלאה, וזה המספר היחיד שאנחנו לא מוסיפים לו דבר.

• Kolibri על החומרה שלך — 78 GB של משקלים, תוסף vLLM מחבילת aleph-alpha-inference של הספק, ודרישת מינימום של H200 או B200 אחד, או זוג H100 SXM5. העלות היא רכישה הונית, חריץ בארון ואדם שיכול להריץ פריסת vLLM, כאשר היא נפרסת על פני מספר הטוקנים שאתה מייצר.

אלה אינן אותה רכישה, וההשוואה אינה "מה זול יותר". השאלה היא אם לעומס העבודה יש צורה שמצדיקה בעלות על החומרה. צוות שמעבד בנפח גבוה מאגר מסמכים קבוע ורגיש יכול לצאת נשכר במידה ניכרת בצד של אירוח עצמי. צוות שבונה תכונת מוצר שקוראת למודל כמה מיליוני טוקנים ביום כמעט שאינו יוצא נשכר.

דרך ביניים מעשית אחת: שכבת Gemma נמצאת על OrcaRouter היום, על אותו endpoint תואם OpenAI כמו כל השאר, עם failover בין ספקים ומחיר המחירון של הספק מועבר כמו שהוא בלי שום תוספת לכל טוקן. זה הופך אותה לדרך זולה למדוד את נפח הטוקנים האמיתי שלך במסלול מתארח לפני שתחליט אם פריסה ריבונית של 78 GB מוצדקת. ראוי לומר בבירור מה זה לא: אנחנו לא מנתבים את Kolibri. בדקנו את הקטלוג בכל איות של שם הספק ושם הדגם, והוא לא נמצא שם. אירוח עצמי הוא כרגע הדרך היחידה לקרוא לו.

Screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the 262K-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'Public benchmarks by Google - 2026-04-05', the description of Gemma 4 26B A4B IT as an instruction-tuned mixture-of-experts model from Google DeepMind with roughly 26B total parameters of which about 4B activate per token, the pricing tiles $0.06 and $0.33, and the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

מי צריך לבחור מה

כלל ההחלטה קצר מספיק כדי לנסח אותו בשלוש שורות.

בחרו ב-Gemma 4 12B אם אתם צריכים משהו מלבד טקסט בגרמנית ובאנגלית, אם אתם צריכים מספר איכות מדיד לפני שאתם מתחייבים, אם המודל צריך לרוץ על חומרה שכבר יש לכם, או אם אתם מעדיפים לשכור טוקנים מאשר להחזיק ראק משלכם. הוא היחיד מבין השניים עם ציון עצמאי, מהירות שפורסמה ומחיר שוק.

בחר ב-Kolibri אם הדרישה שלך היא מודל הסקה בעל 78 מיליארד פרמטרים, שהמשקלים שלו, מקור נתוני האימון, צריכת האנרגיה והרישיון שלו כולם מתועדים, שנפרס בתוך ההיקף שלך, עם טוקנייזר שנבנה עבור פרוזה מנהלית גרמנית והתנהגות הימנעות שתהליך עבודה מוסדר יכול להסתמך עליה. זהו יעד צר, ו-Aleph Alpha כיוונה אליו במכוון.

אל תבחרו באף אחד מהם רק על סמך שורת בנצ'מרק שראיתם בפוסט השקה. ה-14 של Gemma 4 12B הוא מדידה שמישהו אחר ערך, ואתם יכולים לבדוק אותה. ה-75.5 של Kolibri הוא טענה שהמחבר שלה השמיע, והאדם היחיד שיכול כיום להפריך אותה הוא לקוח עם שני H100s ומאגר מסמכים.