
Kolibri לעומת Intern-Decision 4B: האחד כותב מסמכים, האחר מסרב לכתוב דבר בכלל
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 217 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הדבר השימושי ביותר לשים לב אליו בנוגע לKolibri ו-Intern-Decision-4B הוא שהם אינם אותו סוג של אובייקט, והתייחסות לכך כהשוואה בין מודל למודל תהיה שגיאת קטגוריה. Kolibri הוא מודל השפה מסוג תערובת מומחים של Aleph Alpha, בעל 78.1 מיליארד פרמטרים, ששוחרר ב-3 באוקטובר 2026, שמפעיל 3.46 מיליארד פרמטרים לכל טוקן וכותב טקסט בגרמנית ובאנגלית. Intern-Decision-4B הוא מודל החלטה מובנה רב-מודאלי בעל 4.54 מיליארד פרמטרים מצוות InternLM, שהועלה ל-Hugging Face ב-26 בספטמבר 2026, ושהכרטיס שלו מציין במפורש שהוא "אינו קורא ל-generate() ואינו דוגם טקסט חופשי" בכלל. אחד מפיק פרוזה. האחר מפיק התפלגות הסתברות על פני אפשרויות שאתה מספק, במעבר קדמי אחד, ואין לו יכולת לכתוב משפט. הם הופכים למתחרים רק במצב צר אחד, והדבר המועיל ביותר בכל אחד מהשחרורים מתברר להיות לדעת בדיוק מהו אותו מצב.
שתי מהדורות, שתי טענות תמציתיות שונות לחלוטין
הכרטיס של Kolibri הוא מפרט של מודל שפה גדול ודליל: 50 שכבות, כאשר כל אחת היא תערובת מומחים, 384 מומחים בכל שכבה עם אחד משותף ושישה מנותבים, חלון הקשר מקורי של 262,144 טוקנים, מאומת עד 1,048,576, ארבע רמות מאמץ הסקה, קריאה לכלים בסגנון Hermes עם מפענח vLLM מצורף, משקולות FP8 בבלוקים של 128×128, ותנאי Apache 2.0. האימון שלו עיבד 20 טריליון טוקנים על 768 כרטיסי NVIDIA B200 במשך 21 ימים — 392,000 שעות GPU, בדיווח של 6.4×10²³ FLOPs ובהערכה של 9.5×10² MWh, כולל תקורת מרכז נתונים, לא כולל כיוונון עדין מפוקח ולמידת חיזוק. תצורת ההגשה המינימלית של הכרטיס היא שני כרטיסי A100 80 GB, שני כרטיסי H100 SXM5, כרטיס H200 אחד, כרטיס B200 אחד או כרטיס B300 אחד, ונפח ה-FP8 הוא כ-78 GB. מדובר בפריט תשתית רציני, והוא עונה על שאלות על ידי יצירת טקסט.
Intern-Decision-4B הוא סוג הפוך של אובייקט, והכרטיס גלוי לב באופן מרענן לגבי זה. זהו fine-tune של Qwen3.5-4B שבו מגדל הראייה והמקרן קפואים ורק עמוד השדרה הלשוני מאומן. אתה מוסר לו מצב, סכימה של שאלות בעלות שמות, ובאופן אופציונלי עד שמונה תמונות, והוא מחזיר התפלגות על פני התשובות המועמדות עבור כל שאלה בבת אחת. המנגנון יוצא דופן וראוי לציין אותו במדויק: אפשרויות ממופות לסמלים של טוקן בודד המשתרעים מ-A עד Z, מ-a עד z ומ-0 עד 9 — 62 מועמדים, כך שמקסימום 62 אפשרויות לשאלה — הפרומפט מרונדר עם ממלא מקום אחד לכל שדה, והמודל קורא לוגיטים במיקום מיד לפני כל ממלא מקום. Softmax רץ רק על הלוגיטים של הסמלים המותרים של אותו שדה, טמפרטורה ספציפית לצ'קפוינט מכיילת את התוצאה, והסמלים ממופים בחזרה לערכי האפשרויות המקוריות שלך כ-JSON מוקלד. אין לולאת פענוח, אין דגימה ואין פרוזה.
• פלט — Kolibri: טקסט בגרמנית או באנגלית שנוצר באופן חופשי, קריאות לכלים, עקבות חשיבה. Intern-Decision-4B: תשובות JSON עם טיפוסים עם הסתברות לכל אפשרות.
• פרמטרים — Kolibri: 78,103,074,560 סה״כ, 3,457,573,120 פעילים. Intern-Decision-4B: 4.54 מיליארד על פני ארבעה שברי safetensors ב-bfloat16, עם מגדל ראייה קפוא.
• קלט — Kolibri: טקסט בלבד. Intern-Decision-4B: טקסט בתוספת עד שמונה תמונות.
• קיבולת שאלות — Intern-Decision-4B: עד 62 אפשרויות לכל שדה, במעבר קדימה אחד, עם סוגי שאלות 'choice', 'score' ו-'noul' (כן/לא). Kolibri: ללא גבול באופן עקרוני, טוקן אחד בכל פעם בפועל.
• שפה — Kolibri: גרמנית ואנגלית מעצם הבנייה. Intern-Decision-4B: כל מה ש-Qwen3.5-4B נושא, כשכל מערכי ההערכה שפורסמו הם באנגלית.
• השהיה — Intern-Decision-4B: 44.16 ms בממוצע, 44.03 ms בחציון ו-44.60 ms ב-P95 לשאילתה על RTX 4090 בודד, לפי המדידה שלה עצמה. Kolibri: אין בכלל נתון מפורסם לשאילתה.
• רישיון — שניהם Apache 2.0; Intern-Decision-4B מגיע עם קובץ הרישיון של Qwen שנשמר לצידו.

למה בכלל קיים מודד 4B
הטיעון בעד Intern-Decision-4B אינו שהוא קטן. אלא שלבקש ממודל גנרטיבי גדול הסתברות אינו אותו דבר כמו למדוד אותה, וההבדל ניתן למדידה.
טבלת הבנצ'מרק של הכרטיס עצמו מציגה את הטיעון במידה יוצאת דופן של חשיפה עצמית. בשבע ערכות דיוק, Intern-Decision-4B משיג ממוצע של 90.02 — לעומת 88.74 עבור הבסיס החזק ביותר שאיתו הוא משווה את עצמו, מודל בשם Jev. אבל הדיוק הוא החצי הפחות מעניין. הטבלה גם מדווחת ציון Brier ושגיאת כיול צפויה (ECE), ושם התמונה מחמירה יותר. ה-4B רושם Brier של 0.347 ו-ECE של 0.065, לעומת 0.358 ו-0.095 של Jev. האחים הקטנים יותר הם המקום שבו סיפור הכיול הופך לבאמת מלמד. Intern-Decision-2B משיג ממוצע של 84.68, הרחק לפני ה-0.8B עם 79.38 — ובכל זאת ה-ECE שלו, 0.100, גרוע מזה של ה-0.8B, 0.066, וגרוע מזה של ה-4B, 0.065, עם Brier של 0.437 לעומת 0.530 של ה-0.8B. המדויק מבין שני המודלים הקטנים הוא הפחות כן לגבי הביטחון העצמי שלו. אם הנחתם שכיול משתפר עם דיוק, או עם מספר פרמטרים, הטבלה הזו היא דוגמת נגד בשני המובנים.
אבחון שני ונפרד מכסה 96 מקרים שנבנו עם התפלגויות ייחוס מדויקות ולא עם תוויות קשות מדוגמות — הגרלות אקראיות, אירועים מורכבים, היסטוריה מותנית, חידות הסתברות. השגיאה של מודל ה-4B בפיילוט הזה ירדה מ-0.628 ל-0.550 במדד שדווח, בעוד שמודל ההשוואה עמד על 0.595. הכרטיס מבהיר במפורש שפיילוט זה לא שימש להתאמה או לבחירה של הטמפרטורה שפורסמה; הטמפרטורה של ה-4B, 1.992418, הותאמה בנפרד על סט כיול. צוות InternLM גם העביר את הבנצ'מרק עצמו למאגר ה-GitHub — המחולל הדטרמיניסטי, הייחוסים והמעריך הלא-מקוון — מה שאומר שטענת הכיול היא מהסוג הנדיר שצד שלישי יכול למעשה להריץ מחדש במקום לקבל באמונה.
שום דבר בפרסום של Kolibri אינו מציע מקבילה. טבלת ההשוואה שלו מדווחת על דיוק במשימות עבור ארבעה־עשר מודלים על הרנס של ספק אחד, ודיוק הוא המדד שלפיו ניתן למדוד מודל גנרטיבי. אין שום נתון כיול, אין Brier או ECE בשום מקום בחומר, ואין דרך לבקש ממנו "את ההסתברות שסעיף החוזה הזה ניתן לאכיפה" בלי לדגום משפט ולקרוא אותו.
התפר היחיד שבו הם באמת נפגשים
הציבו את השניים זה לצד זה בצינור עיבוד אמיתי, והצורות הופכות לברורות. תהליך עבודה למסמכים בגרמנית זקוק לשני החצאים, ואף אחד מהכלים אינו מכסה את החצי של האחר.
Kolibri הוא החצי שקורא וכותב. צוות עם חוזים בגרמנית או תיעוד טכני מקבל חלון נייטיבי של 262,144 אסימונים, מטמון KV מסוג FP8, טוקנייזר דו-לשוני ש-Aleph Alpha מדווחת על 4.90 בתים בממוצע לאסימון בטקסט אינטרנט גרמני, וקריאה לכלים של Hermes — כלומר, מודל שיכול לסכם כתב הגשה, לנסח תשובה, ולהריץ לולאת כלים. מה שהוא לא יכול לעשות הוא לומר לך את רמת הביטחון של עצמו באופן שאפשר לבצע עליו ביקורת, כי כל מה שהוא פולט הוא מחרוזת שנדגמה.
Intern-Decision-4B הוא החצי שמחליט. בהינתן עמוד טקסט בגרמנית וקבוצה קבועה של אפשרויות, הוא מחזיר התפלגות מכוילת בתוך 44 מילישניות על GPU צרכני אחד, ללא שלב הפקה ולכן ללא שונות דגימה כלל. מה שהוא אינו יכול לעשות הוא להפיק את הטקסט הגרמני מלכתחילה, וחבילות ההערכה שפורסמו שלו הן באנגלית — ההתנהגות שלו בגרמנית ירשה מבסיס Qwen3.5-4B ולא אומנה עבורה, וזו מגבלה ממשית לפריסה בשפה הגרמנית ואחת שאיש לא העריך.
אז התשובה ההנדסית הכנה עבור תהליך עבודה רגולטורי בשפה הגרמנית היא שאלו שני שלבים של צינור עיבוד אחד, ולא שני מועמדים לאותה משבצת. השאלה המעשית היא היכן כל אחד מהם רץ. Kolibri זקוק לשני H100 או ל-B200 וכ-78 GB. Intern-Decision-4B זקוק ל-RTX 4090 אחד ומריץ שאילתה בפחות מ-45 מילישניות. אי-הסימטריה בעלויות היא בערך שני סדרי גודל בחומרה, והיא מצביעה על עיצוב שבו מדרג קטן רץ באופן רציף על כל מקרה, והמחולל הגדול מופעל רק כאשר מקרה באמת זקוק לפרוזה. זהו מבנה זול יותר וידידותי יותר לביקורת מאשר להעביר כל מקרה דרך מודל ה-78B כדי לקבל תשובה שאחר כך צריך לפרש.

מציאות האחסון עבור שניהם, ולמה נועדה השכבה
אף אחד מהמודלים אינו זמין כ‑API מתארח, ובדקנו ולא הנחנו. ל‑Intern-Decision-4B אין נקודת קצה של ספק; המהדורה היא משקולות, מאגר GitHub ו‑Hugging Face Space. מוני ההורדות והלייקים שלו זזו מאז אמצע השבוע, מה שאומר שאנשים מתחילים לאמץ אותו, אבל עדיין אין שום נתיב בתשלום שניתן לקרוא לו, בשום מקום שנציין.
גם ל-Kolibri אין SKU של API של Aleph Alpha — השחרור הוא משקלים, דוח טכני ותמונת קונטיינר בכתובת ghcr.io/aleph-alpha/aleph-alpha-inference. והוא אינו נמצא ב-OrcaRouter: בדקנו את הקטלוג בכל איות של קידומת הספק ושל שם המודל והוא מחזיר 'לא נמצא', מה שאנו מעדיפים לומר מאשר לרמוז אחרת.
מה ששכבת ניתוב משנה כאן אינו הגישה לשני המודלים האלה, אלא הכלכלה של ההחלטה אם לרכוש את החומרה לאחד מהם. המבחן הכנה שלפני הרכישה עבור החצי הגנרטיבי הוא להריץ את עומס העבודה כנגד שכבת תערובת-מומחים קטנה שכבר מנותבת — וריאנט Gemma 4 26B-A4B במחיר של $0.06 למיליון טוקני קלט ו-$0.33 למיליון טוקני פלט עם חלון של 262,144 טוקנים וקלט טקסט, תמונה וווידאו — עלמפתח אחד תואם OpenAI במחיר המחירון של הספק בלי שום תוספת, ולראות אם עומס העבודה של המסמכים בגרמנית באמת זקוק ל-78 מיליארד פרמטרים לפני שמזמינים את כרטיסי ה-GPU. לחצי ההחלטה אין קיצור דרך כזה, משום שההתנהגות של התפלגות מכוילת היא כל תכליתו של המודל ואף שכבת ניתוב לא עושה זאת. אבל זו עצמה המסקנה: היא אומרת לך שמודל הניקוד 4B הוא החלק שתריץ באמת בעצמך, והגנרטור הוא החלק ששווה לבדוק מחדש כנגד משהו שאתה יכול לשכור כבר היום אחר הצהריים.
מה יפתור את זה?
שתי מדידות, ואף אחת מהן עדיין אינה קיימת.
הראשון הוא Intern-Decision-4B על קלט בגרמנית. כל סוויטה שפורסמה היא באנגלית, והמודל הוא כיוונון עדין של בסיס רב-לשוני, ולכן הכיול שלו לגרמנית אינו ידוע — וכיול הוא בדיוק התכונה שאינה עוברת בחינם בין שפות. גרסה גרמנית של פיילוט התפלגות בן 96 מקרים תהיה הארטיפקט האינפורמטיבי ביותר שמישהו יכול לפרסם על המודל הזה.
השנייה היא העלות לכל החלטה של Kolibri. טענת כלכלת ההגשה שלה היא חזית פארטו של איכות מול אסימונים מפוענחים לשנייה לכל GPU, ואין דף Artificial Analysis עבור Kolibri ואין שכפול על ידי צד שלישי של ההרנס. עד שמישהו יריץ אותו, "78 מיליארד פרמטרים" הוא מפרט ולא עלות, וההצדקה להשאיר מודד של 44 מילישניות לפניו נשארת טיעון תכנוני ולא טיעון מדוד.
עד אז, הדרך הנכונה לפרש את הצימוד הזה היא לא כתחרות. Intern-Decision-4B הוא הגרסה המעניינת יותר מבחינה טכנית מבין השתיים, מפני שפלט מובנה מודע לכיול הוא יכולת שכמעט אין מודל גנרטיבי שמציע, וכרטיס המודל שלו מאפשר לבדוק את הטענה. Kolibri הוא הגרסה המשמעותית יותר, מפני שמעבדה אירופית שמשחררת מודל Apache 2.0 עם 78 מיליארד פרמטרים, כשצינור הנתונים מתפרסם לצדו, הוא אירוע בשרשרת האספקה ולא אירוע של מודל. אף אחד מהם לא מחליף את האחר. צוותים שזקוקים לשניהם צריכים לתכנן לשניהם ולהתאים את החומרה בהתאם, וההרנס סביבם הוא המקום שאליו המאמץ ההנדסי באמת מופנה.

