
Intern-Decision-4B לעומת ContextPilot-8B: מודל שמכווץ את ההקשר מול מודל שמנהל אותו
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 592 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
בחרו את הרעל שלכם: internlm/Intern-Decision-4B מסרב לקרוא יותר מ-8,192 טוקנים, ו־tencent/ContextPilot-8B קיים במיוחד כדי לשרוד הקשרים שגדלים ללא גבול. הם באותה מחלקת גודל, שניהם כיוונונים עדינים של בסיס Qwen, ושניהם עלו ל-Hub ללא הודעה מצד הספק וללא הערכה עצמאית מכל סוג שהוא — ContextPilot-8B ב-27 באוגוסט 2026, Intern-Decision-4B ב-26 בספטמבר 2026 — והם פותרים בעיות מנוגדות. Intern-Decision-4B הוא מודל החלטות מובנה בעל 4.5 מיליארד פרמטרים, שמבצע מעבר קדימה אחד, קורא לוגיטים ומחזיר הסתברות מכוילת לכל שאלה ששאלתם; הוא לעולם לא כותב טוקן. ContextPilot-8B הוא מחולל טקסט בעל 8.19 מיליארד פרמטרים, שאומן לתכנן, לזכור ולהעביר החוצה את הקשר העבודה שלו במהלך ריצת סוכן ארוכה. השוואה ביניהם היא לא באמת שאלה של בנצ'מרק. זו שאלה לגבי איזה חצי מהבעיה שלכם הייתם מעדיפים שהמודל יבלע.
ראשית, הדבר שהם באמת חולקים
לאף אחד מהמודלים אין מספר בודד שאדם מחוץ למעבדה שלו אי פעם אימת. זה יוצא דופן מספיק כדי לציין זאת לפני כל דבר אחר, מכיוון שרוב ההשוואות בבלוג הזה יכולות לכל הפחות להישען על לוח דירוג בלתי תלוי עבור צד אחד.
Intern-Decision-4B מפרסם טבלת הערכה מלאה בכרטיס שלו — ממוצע של 90.02 על פני שבע ערכות, ציון Brier של 0.347 ושגיאת כיול צפויה של 0.065 — כשהכול נמדד על ידי InternLM במערכת ההערכה של InternLM. ContextPilot-8B לא מפרסם טבלה כלל. הכרטיס שלו אומר שהמסגרת "מתעלה באופן עקבי על קווי הבסיס הקיימים בקרב מגוון מודלים בסיסיים ובנצ'מרקים" ומצביע על מאמר ועל צינור הערכה לפרטים. אז עבור ההתמודדות הזו שורת המקור הכנה היא קצרה: צד אחד מדווח על ידי הספק ואינו משוחזר, הצד האחר נטען על ידי הספק ואינו מפורסם, ושום דבר בעמוד הזה אינו עצמאי.

שני ההימורים, בניסוח פשוט
ההימור של Intern-Decision-4B הוא שהחלק הקשה של החלטה אינו החשיבה, אלא ההתחייבות. תנו לו מצב, סכימה של שאלות בעלות שם ועד שמונה תמונות, והוא מחזיר התפלגות על מחרוזות האפשרויות שלכם. הליך ההסקה דטרמיניסטי ובעל צורה קבועה: מפו אפשרויות לסמלים של טוקן בודד, רנדרו שלד JSON של עוזר עם מציין מקום אחד לכל שדה, הריצו מעבר קדמי סיבתי אחד, קראו את הלוגיטים מיד לפני כל מציין מקום, בצעו softmax רק על המועמדים של אותו שדה, החילו את הטמפרטורה המותאמת. אין לולאת פענוח, ולכן אין מנתח ואין משטח הזיות בטקסט חופשי. המחיר של ההימור הזה הוא תקרת קלט קשיחה — הכרטיס אומר שקלטים מעל DecisionEngine(max_length=8192) "נדחים ללא חיתוך".
ההימור של ContextPilot-8B הוא תמונת הראי: להשאיר את הסוכן כותב טוקנים, אבל ללמד אותו לערוך את מה שהוא נושא. היא מוסיפה תכנון, זיכרון ארוך-טווח מובנה, אחזור ופריקת הקשר רכה לערכת הכלים של הסוכן, ואז מאמנת את הצ'ק-פוינט עם מתכון RL שדוגם ענפים סביב החלטות עריכת ההקשר החשובות, ומקצה קרדיט ברמת הפעולה ולא ברמת המסלול. הכרטיס גלוי לב בנוגע להשלכת האריזה: טעינת הצ'ק-פוינט לא נותנת לך ניהול הקשר. הגדרות הכלים, סביבת ההרצה של הסוכן וצינור ההערכה נמצאים במקום אחר ויש להביא אותם איתך.
לוח תוצאות, ממד אחר ממד
• פלט — Intern-Decision-4B אינו מפיק טקסט כלל, אלא רק הסתברויות על ערכי האפשרויות שלך; ContextPilot-8B מייצר כרגיל, והתשובות שלו הן פרוזה וקריאות לכלים שעליך לנתח.
• תקרת קלט — Intern-Decision-4B מסרב לכל דבר מעבר ל‑8,192 טוקנים; ContextPilot-8B יורש מ‑Qwen3-8B את מגבלת המיקום של 40,960 טוקנים, ונבנה כך שימשיך לפעול בזמן שההקשר האפקטיבי גדל.
• פרמטרים — 4.54B BF16 עבור Intern-Decision-4B, על פני מגדל טקסט, מגדל חזותי ומקרן; 8.19B BF16 עבור ContextPilot-8B, מודל שפה סיבתי צפוף ופשוט של Qwen3.
• השהיה — Intern-Decision-4B מציג ממוצע של 44.16 ms ו-44.60 ms ב-P95 על RTX 4090 בודד, לפי כרטיס המודל שלו; ContextPilot-8B אינו מפרסם נתון השהיה, והעלות שלו שונה מהותית מכיוון שהוא מייצר טוקנים במקום לדרג אותם.
• תמונות — Intern-Decision-4B מקבל עד שמונה, ואסימוני תמונה נספרים כנגד תקרת 8,192; הכרטיס של ContextPilot-8B מתאר צ'קפוינט ליצירת טקסט ללא מסלול מולטימודלי.
• רישיון — Intern-Decision-4B הוא Apache-2.0, כאשר רישיון Qwen במעלה הזרם נשמר לצידו; הרישיון של ContextPilot-8B נפתח בסעיף 0, "מוצע אך ורק למטרת מחקר ופיתוח מדעיים. אין להשתמש בו לכל מטרה אחרת."
• עדויות שפורסמו — טבלה בת שבעה סטים עם אבחוני כיול מצד אחד; תקציר מאמר והפניה למאגר הערכה מצד שני.
• רקורד — שניהם שקטים. Intern-Decision-4B מציג לייק אחד ואפס הורדות מאז 26 בספטמבר 2026; ל-ContextPilot-8B יש 11 לייקים וכאלף הורדות מאז 27 באוגוסט 2026, שזה יותר תשומת לב אבל עדיין אין הערכה של צד שלישי.

היכן שכל אחד מהם למעשה נשבר
מצב הכשל של Intern-Decision-4B הוא מבני, וכדאי להיות קונקרטיים בנוגע אליו. אם הראיות להחלטה אינן נכנסות ב-8,192 טוקנים, המודל לא מתדרדר בחן — הוא דוחה את הבקשה. זו בחירה הנדסית מוצדקת והתאמה איומה בדיוק לעומס העבודה שלשמו נבנה ContextPilot-8B. התצורה של הכרטיס עצמו מחדדת את המתח: מגדל הטקסט שמתחת למעטפת מצהיר על מגבלת מיקום של 262,144 טוקנים. עמוד השדרה יכול לפנות לרבע מיליון טוקנים, והמעטפת ששוחררה לא תקבל יותר משמונה אלף.
מצב הכשל של ContextPilot-8B הוא שהוא אינו מהווה תחליף ישיר לשום דבר. הוא צ'ק פוינט בתוך פריימוורק, והפריימוורק הוא היכן שההתנהגות נמצאת. משכו את המשקלים בלי הגדרות הכלים וסביבת ההרצה של הסוכן, ותקבלו כיוונון עדין של Qwen3-8B שהיכולת המייחדת שלו אינרטית. תוסיפו לכך את סעיף 0 של הרישיון, והתשובה המעשית לפריסה מסחרית היא שאינכם יכולים להשתמש בו כלל כפי שהוא משוחרר — מה גם שפירושו שהוא אינו נתיב מועמד עבורנו, לא עכשיו ולא בקרוב.
לפרוס כל אחד, אם היית מתכוון לכך
Intern-Decision-4B רוצה GPU קטן, ולא מחסנית הגשה הראויה לשמה: התקינו PyTorch 2.9.1 ו-Transformers 5.14.1 תחת Python 3.12, טענו את ארבעת השארדים פעם אחת, השאירו את המנוע בזיכרון, והפיקו ציונים. מכיוון שמעבר קדימה הוא בעל צורה קבועה, P50 ו-P95 נמצאים זה מזה במרחק של שש עשיריות מילישנייה, ולכן תכנון קיבולת עוסק במקביליוּת ולא בהשהיית זנב. החלק המסובך הוא שהוא מגיע כמחלקת Python ניתנת לייבוא ולא כשירות HTTP, כך שכדי להעמיד אותו לפני גורם קורא בסביבת ייצור יש לעטוף אותו בעצמך.
ContextPilot-8B דורש טיפול הפוך: נתיב הגשה אמיתי, מבצע כלים, מאגרי זיכרון, וסביבת rollout בעלת יכולת הסתעפות — אם אי פעם בכוונתך לאמן מחדש או להעריך אותו כפי שתוכנן. זה לא מודל שאתה מנסה באחר צהריים אחד; זו מסגרת מחקרית שאתה מאמץ.
האם ראוטר עוזר כאן?
בְּחֵלֶק, והגרסה הכנה צרה מהרגיל. OrcaRouter אינה מפרטת את Intern-Decision-4B, את ContextPilot-8B, או כל נקודת ביקורת לדירוג החלטות דומה בקטלוג שלה — דפי המודל שלנו מחזירים 404 עבור שניהם, ושום דבר בטקסט הזה אינו אמור להיקרא כטענת זמינות. מה שכן נותנת לך נקודת קצה מאוחדת הוא היכולת לשים ניסוי כושל מאחורי גיבוי: מפתח אחד על פני יותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה עם 0% תוספת, ומעבר אוטומטי לגיבוי, כך שמודל דירוג שאתה עדיין בוחן אותו לעולם לא הופך לנקודת כשל יחידה. זהו יתרון אמיתי עבור הצד של Intern-Decision בהשוואה הזו, שבו המודל אכן רץ בזול ובאופן מקומי. עבור ContextPilot-8B זה חסר משמעות, מכיוון שרישיון למחקר ופיתוח בלבד שולל מסלול מסחרי, ללא קשר למה שכל ראוטר תומך בו.
אז איזה מהם?
אם לשאלה שלך יש קבוצה סגורה של תשובות, היא מגיעה כשהראיות מצורפות, והיא זקוקה להסתברות ולא להסבר, Intern-Decision-4B הוא האובייקט המעניין יותר — זול, בעל צורה קבועה, מכויל מעצם בנייתו, וכנה לגבי הקלט שהוא לא יקבל. אם הבעיה שלך היא שהראיות לא מפסיקות להגיע, שום מערכת לניקוד החלטות לא תעזור לך, ו-ContextPilot-8B מכוון אל המטרה הנכונה, עם ההסתייגות שאתה מאמץ מסגרת ורישיון מחקרי ולא מודל.
מה שיכריע את העניין הוא מבחן שאף אחד מהספקים לא הריץ: לתת לשניהם אותה החלטה קצרה ומובנית, שתשובתה ניתנת לחישוב מתוך המצב, ולראות אם הממוצע 90.02 של המעריך מחזיק מעמד מחוץ להרנס של עצמו. עד שמישהו יעשה זאת, הקריאה הנכונה של ההתמודדות הזאת היא ששני המודלים כלל אינם מתחרים על אותה משבצת.

