כרטיס כותרת מיוצר עם הכיתוב 'Intern-Decision-4B מול ContextPilot-8B', עם כותרת משנה 'האחד מסרב להקשר ארוך, והאחר מנהל אותו', ושלושה צ׳יפים עם הכיתוב 'אין הערכות בלתי תלויות לאף אחד מהם', 'שניהם שוחררו בלי הכרזה' ו'אף אחד מהם אינו ניתן לניתוב היום'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Engineering & Research

Intern-Decision-4B לעומת ContextPilot-8B: מודל שמכווץ את ההקשר מול מודל שמנהל אותו

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

בחרו את הרעל שלכם: internlm/Intern-Decision-4B מסרב לקרוא יותר מ-8,192 טוקנים, ו־tencent/ContextPilot-8B קיים במיוחד כדי לשרוד הקשרים שגדלים ללא גבול. הם באותה מחלקת גודל, שניהם כיוונונים עדינים של בסיס Qwen, ושניהם עלו ל-Hub ללא הודעה מצד הספק וללא הערכה עצמאית מכל סוג שהוא — ContextPilot-8B ב-27 באוגוסט 2026, Intern-Decision-4B ב-26 בספטמבר 2026 — והם פותרים בעיות מנוגדות. Intern-Decision-4B הוא מודל החלטות מובנה בעל 4.5 מיליארד פרמטרים, שמבצע מעבר קדימה אחד, קורא לוגיטים ומחזיר הסתברות מכוילת לכל שאלה ששאלתם; הוא לעולם לא כותב טוקן. ContextPilot-8B הוא מחולל טקסט בעל 8.19 מיליארד פרמטרים, שאומן לתכנן, לזכור ולהעביר החוצה את הקשר העבודה שלו במהלך ריצת סוכן ארוכה. השוואה ביניהם היא לא באמת שאלה של בנצ'מרק. זו שאלה לגבי איזה חצי מהבעיה שלכם הייתם מעדיפים שהמודל יבלע.

ראשית, הדבר שהם באמת חולקים

לאף אחד מהמודלים אין מספר בודד שאדם מחוץ למעבדה שלו אי פעם אימת. זה יוצא דופן מספיק כדי לציין זאת לפני כל דבר אחר, מכיוון שרוב ההשוואות בבלוג הזה יכולות לכל הפחות להישען על לוח דירוג בלתי תלוי עבור צד אחד.

Intern-Decision-4B מפרסם טבלת הערכה מלאה בכרטיס שלו — ממוצע של 90.02 על פני שבע ערכות, ציון Brier של 0.347 ושגיאת כיול צפויה של 0.065 — כשהכול נמדד על ידי InternLM במערכת ההערכה של InternLM. ContextPilot-8B לא מפרסם טבלה כלל. הכרטיס שלו אומר שהמסגרת "מתעלה באופן עקבי על קווי הבסיס הקיימים בקרב מגוון מודלים בסיסיים ובנצ'מרקים" ומצביע על מאמר ועל צינור הערכה לפרטים. אז עבור ההתמודדות הזו שורת המקור הכנה היא קצרה: צד אחד מדווח על ידי הספק ואינו משוחזר, הצד האחר נטען על ידי הספק ואינו מפורסם, ושום דבר בעמוד הזה אינו עצמאי.

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

שני ההימורים, בניסוח פשוט

ההימור של Intern-Decision-4B הוא שהחלק הקשה של החלטה אינו החשיבה, אלא ההתחייבות. תנו לו מצב, סכימה של שאלות בעלות שם ועד שמונה תמונות, והוא מחזיר התפלגות על מחרוזות האפשרויות שלכם. הליך ההסקה דטרמיניסטי ובעל צורה קבועה: מפו אפשרויות לסמלים של טוקן בודד, רנדרו שלד JSON של עוזר עם מציין מקום אחד לכל שדה, הריצו מעבר קדמי סיבתי אחד, קראו את הלוגיטים מיד לפני כל מציין מקום, בצעו softmax רק על המועמדים של אותו שדה, החילו את הטמפרטורה המותאמת. אין לולאת פענוח, ולכן אין מנתח ואין משטח הזיות בטקסט חופשי. המחיר של ההימור הזה הוא תקרת קלט קשיחה — הכרטיס אומר שקלטים מעל DecisionEngine(max_length=8192) "נדחים ללא חיתוך".

ההימור של ContextPilot-8B הוא תמונת הראי: להשאיר את הסוכן כותב טוקנים, אבל ללמד אותו לערוך את מה שהוא נושא. היא מוסיפה תכנון, זיכרון ארוך-טווח מובנה, אחזור ופריקת הקשר רכה לערכת הכלים של הסוכן, ואז מאמנת את הצ'ק-פוינט עם מתכון RL שדוגם ענפים סביב החלטות עריכת ההקשר החשובות, ומקצה קרדיט ברמת הפעולה ולא ברמת המסלול. הכרטיס גלוי לב בנוגע להשלכת האריזה: טעינת הצ'ק-פוינט לא נותנת לך ניהול הקשר. הגדרות הכלים, סביבת ההרצה של הסוכן וצינור ההערכה נמצאים במקום אחר ויש להביא אותם איתך.

לוח תוצאות, ממד אחר ממד

• פלט — Intern-Decision-4B אינו מפיק טקסט כלל, אלא רק הסתברויות על ערכי האפשרויות שלך; ContextPilot-8B מייצר כרגיל, והתשובות שלו הן פרוזה וקריאות לכלים שעליך לנתח.

• תקרת קלט — Intern-Decision-4B מסרב לכל דבר מעבר ל‑8,192 טוקנים; ContextPilot-8B יורש מ‑Qwen3-8B את מגבלת המיקום של 40,960 טוקנים, ונבנה כך שימשיך לפעול בזמן שההקשר האפקטיבי גדל.

• פרמטרים — 4.54B BF16 עבור Intern-Decision-4B, על פני מגדל טקסט, מגדל חזותי ומקרן; 8.19B BF16 עבור ContextPilot-8B, מודל שפה סיבתי צפוף ופשוט של Qwen3.

• השהיה — Intern-Decision-4B מציג ממוצע של 44.16 ms ו-44.60 ms ב-P95 על RTX 4090 בודד, לפי כרטיס המודל שלו; ContextPilot-8B אינו מפרסם נתון השהיה, והעלות שלו שונה מהותית מכיוון שהוא מייצר טוקנים במקום לדרג אותם.

• תמונות — Intern-Decision-4B מקבל עד שמונה, ואסימוני תמונה נספרים כנגד תקרת 8,192; הכרטיס של ContextPilot-8B מתאר צ'קפוינט ליצירת טקסט ללא מסלול מולטימודלי.

• רישיון — Intern-Decision-4B הוא Apache-2.0, כאשר רישיון Qwen במעלה הזרם נשמר לצידו; הרישיון של ContextPilot-8B נפתח בסעיף 0, "מוצע אך ורק למטרת מחקר ופיתוח מדעיים. אין להשתמש בו לכל מטרה אחרת."

• עדויות שפורסמו — טבלה בת שבעה סטים עם אבחוני כיול מצד אחד; תקציר מאמר והפניה למאגר הערכה מצד שני.

• רקורד — שניהם שקטים. Intern-Decision-4B מציג לייק אחד ואפס הורדות מאז 26 בספטמבר 2026; ל-ContextPilot-8B יש 11 לייקים וכאלף הורדות מאז 27 באוגוסט 2026, שזה יותר תשומת לב אבל עדיין אין הערכה של צד שלישי.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

היכן שכל אחד מהם למעשה נשבר

מצב הכשל של Intern-Decision-4B הוא מבני, וכדאי להיות קונקרטיים בנוגע אליו. אם הראיות להחלטה אינן נכנסות ב-8,192 טוקנים, המודל לא מתדרדר בחן — הוא דוחה את הבקשה. זו בחירה הנדסית מוצדקת והתאמה איומה בדיוק לעומס העבודה שלשמו נבנה ContextPilot-8B. התצורה של הכרטיס עצמו מחדדת את המתח: מגדל הטקסט שמתחת למעטפת מצהיר על מגבלת מיקום של 262,144 טוקנים. עמוד השדרה יכול לפנות לרבע מיליון טוקנים, והמעטפת ששוחררה לא תקבל יותר משמונה אלף.

מצב הכשל של ContextPilot-8B הוא שהוא אינו מהווה תחליף ישיר לשום דבר. הוא צ'ק פוינט בתוך פריימוורק, והפריימוורק הוא היכן שההתנהגות נמצאת. משכו את המשקלים בלי הגדרות הכלים וסביבת ההרצה של הסוכן, ותקבלו כיוונון עדין של Qwen3-8B שהיכולת המייחדת שלו אינרטית. תוסיפו לכך את סעיף 0 של הרישיון, והתשובה המעשית לפריסה מסחרית היא שאינכם יכולים להשתמש בו כלל כפי שהוא משוחרר — מה גם שפירושו שהוא אינו נתיב מועמד עבורנו, לא עכשיו ולא בקרוב.

לפרוס כל אחד, אם היית מתכוון לכך

Intern-Decision-4B רוצה GPU קטן, ולא מחסנית הגשה הראויה לשמה: התקינו PyTorch 2.9.1 ו-Transformers 5.14.1 תחת Python 3.12, טענו את ארבעת השארדים פעם אחת, השאירו את המנוע בזיכרון, והפיקו ציונים. מכיוון שמעבר קדימה הוא בעל צורה קבועה, P50 ו-P95 נמצאים זה מזה במרחק של שש עשיריות מילישנייה, ולכן תכנון קיבולת עוסק במקביליוּת ולא בהשהיית זנב. החלק המסובך הוא שהוא מגיע כמחלקת Python ניתנת לייבוא ולא כשירות HTTP, כך שכדי להעמיד אותו לפני גורם קורא בסביבת ייצור יש לעטוף אותו בעצמך.

ContextPilot-8B דורש טיפול הפוך: נתיב הגשה אמיתי, מבצע כלים, מאגרי זיכרון, וסביבת rollout בעלת יכולת הסתעפות — אם אי פעם בכוונתך לאמן מחדש או להעריך אותו כפי שתוכנן. זה לא מודל שאתה מנסה באחר צהריים אחד; זו מסגרת מחקרית שאתה מאמץ.

האם ראוטר עוזר כאן?

בְּחֵלֶק, והגרסה הכנה צרה מהרגיל. OrcaRouter אינה מפרטת את Intern-Decision-4B, את ContextPilot-8B, או כל נקודת ביקורת לדירוג החלטות דומה בקטלוג שלה — דפי המודל שלנו מחזירים 404 עבור שניהם, ושום דבר בטקסט הזה אינו אמור להיקרא כטענת זמינות. מה שכן נותנת לך נקודת קצה מאוחדת הוא היכולת לשים ניסוי כושל מאחורי גיבוי: מפתח אחד על פני יותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה עם 0% תוספת, ומעבר אוטומטי לגיבוי, כך שמודל דירוג שאתה עדיין בוחן אותו לעולם לא הופך לנקודת כשל יחידה. זהו יתרון אמיתי עבור הצד של Intern-Decision בהשוואה הזו, שבו המודל אכן רץ בזול ובאופן מקומי. עבור ContextPilot-8B זה חסר משמעות, מכיוון שרישיון למחקר ופיתוח בלבד שולל מסלול מסחרי, ללא קשר למה שכל ראוטר תומך בו.

אז איזה מהם?

אם לשאלה שלך יש קבוצה סגורה של תשובות, היא מגיעה כשהראיות מצורפות, והיא זקוקה להסתברות ולא להסבר, Intern-Decision-4B הוא האובייקט המעניין יותר — זול, בעל צורה קבועה, מכויל מעצם בנייתו, וכנה לגבי הקלט שהוא לא יקבל. אם הבעיה שלך היא שהראיות לא מפסיקות להגיע, שום מערכת לניקוד החלטות לא תעזור לך, ו-ContextPilot-8B מכוון אל המטרה הנכונה, עם ההסתייגות שאתה מאמץ מסגרת ורישיון מחקרי ולא מודל.

מה שיכריע את העניין הוא מבחן שאף אחד מהספקים לא הריץ: לתת לשניהם אותה החלטה קצרה ומובנית, שתשובתה ניתנת לחישוב מתוך המצב, ולראות אם הממוצע 90.02 של המעריך מחזיק מעמד מחוץ להרנס של עצמו. עד שמישהו יעשה זאת, הקריאה הנכונה של ההתמודדות הזאת היא ששני המודלים כלל אינם מתחרים על אותה משבצת.

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.