
ContextPilot-14B הוא הסוכן השקט של Tencent עם משקלים פתוחים, שמנהל את הקונטקסט של עצמו
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
tencent/ContextPilot-14B הוא כוונון-עדין עם משקלים פתוחים של Qwen3-14B, בעל 15 מיליארד פרמטרים, שהופיע ב-Hugging Face ב-27 באוגוסט 2026 ללא שום הכרזה. המשקלים הועלו; המאמר, "ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL" (arXiv 2608.28476, התקבל ל-EMNLP 2026), הופיע למחרת; קוד האימון וההערכה הגיע לאחר מכן ל-GitHub. וזו כל ההשקה. הוא מודל הדגל של משפחה בת שלושה צ'קפוינטים — ContextPilot-14B, ContextPilot-8B, ו-ContextPilot-E4B — שנבנה כדי לבצע משהו שרוב המודלים בעלי המשקלים הפתוחים אינם מנסים: להחליט, תור אחר תור, מה המודל צריך לשמור, לזכור, ולדחוף החוצה מההקשר העובדתי שלו בזמן שהוא מנמק ומפעיל כלים.
אזהרה אחת לפני הכול: חיפוש של "ContextPilot" יציג בתוצאות הראשונות פרויקט שונה ובלתי קשור — מערכת אופטימיזציה להסקה עם הקשר ארוך מאוניברסיטת אדינבורו, שגם היא נקראת ContextPilot, שמשתמשת מחדש בהקשר שנשמר במטמון בין קריאות כדי לקצץ בעלות ה-prefill. אותו שם, דבר שונה לחלוטין. מאמר זה עוסק במסגרת אימון הסוכנים של Tencent, ובלבול בין השניים ישלח אתכם ל-repo הלא נכון, למאמר הלא נכון ולמערך הטענות הלא נכון.
מה שוחרר, ומה שאפשר לדעת כרגע
השחרור כולל שלושה מאגרי Hugging Face תחת ארגון tencent, שכולם נוצרו בהפרש של יום אחד זה מזה. הדגם המוביל, {{1}}tencent/ContextPilot-14B{{/1}}, הוא checkpoint בפורמט BF16 עם כ-15B פרמטרים, שנבנה על בסיס {{2}}Qwen/Qwen3-14B{{/2}}; {{3}}tencent/ContextPilot-8B{{/3}} הוא הגרסה של {{4}}Qwen3-8B{{/4}}; {{5}}tencent/ContextPilot-E4B{{/5}} הוא החבר הקומפקטי, שנבנה על בסיס השלד של {{6}}Gemma4-E4B-it{{/6}}. כרטיס המודל של גרסת ה-14B מפורש לגבי חלוקת העבודה: טעינת ה-checkpoint לבדה אינה עושה דבר — {{7}}"הגדרות הכלים, סביבת ההרצה של הסוכן וצינור ההערכה מסופקים במאגר ContextPilot,"{{/7}} לכן המשקולות הופכות לסוכן רק כשמריצים אותן עם הקוד.

דף המאגר שלמעלה הוא כל המשטח הציבורי של המהדורה כרגע: כרטיס מודל, קובץ רישיון, וקישור למאמר ולקוד. אין פוסט השקה בבלוג, אין הודעה לעיתונות, ואין דף תמחור באתר הספק נכון לכתיבת שורות אלה.
מאגר GitHub זה, Tencent/ContextPilot, הוא המקום שבו נמצאת התועלת. הוא מכיל ספריית train עם מימוש למידת חיזוק המבוסס על verl — עם מתכונים עבור שתי נקודות הבידוק Qwen3-8B ו-Qwen3-14B — וספריית infer עם סקריפטים להערכה וטועני נתונים עבור ארבעה benchmarks ארוכי-הקשר: InfBench, NovelQA, LongMemEval, ו-BrowseComp+. יש גם כתובת URL לדמו חי בכרטיס המודל. נכון למועד כתיבת שורות אלה, המאגר בן יומיים עם קומץ כוכבים ואפס forks, כך שיש לקרוא כל היבט שלו כחדש שנטבע זה עתה, ולא כמנוסה ומוכחת בשטח.
מה ש-ContextPilot מלמד סוכן לעשות
הצהרת הבעיה של המאמר היא מצב הכשל המרכזי של סוכן עם אופק ארוך: במשך סבבים רבים של אחזור, קריאות לכלים וחשיבה, הקשר העבודה של הסוכן גדל ללא גבול, עלות ה-prefill עולה, והמודל טובע בהיסטוריה שלו עצמו. ניסיונות קודמים נתנו למודלים כמה כלי עריכה — חיפוש, מחיקה, תמצות — שלטענת המאמר חלשים מדי: אין תוכנית גלובלית, אין זיכרון ששורד את הסבב, אין דרך לדחוס במקום להרוס.
הפתרון של ContextPilot הוא ערכת כלים עם שלוש תוספות: כלי תכנון שמחליט מה לשמר לפני שהסוכן פועל; מאגר זיכרון ארוך-טווח שמתמיד מידע על פני הקשר העבודה; ומנגנון פריקה רכה שמעביר הקשר פחות שימושי מחוץ לחלון הפעיל במקום למחוק אותו, כך שניתן לשלוף אותו חזרה בעת הצורך. בצד ההכשרה, המאמר תורם שתי טכניקות RL ספציפיות לעריכת הקשר: גלגול חלקי מודע-הקשר, שמפצל מסלול רק ברגעים שבהם עריכה אכן שינתה את המצב, והקצאת אשראי עדינה, שמייחסת תגמול לפעולת העריכה הספציפית שהייתה משמעותית במקום למרוח את התגמול הסופי על פני כל עריכה. שתיהן ניסיונות לפתור את אותה בעיה בסיסית — לעריכות הקשר יש השפעה הטרוגנית, והתייחסות אליהן באופן אחיד מבזבזת את אות ה-RL.
הטענה המרכזית היא "ביצועים חזקים יותר עם הקשר עבודה קומפקטי יותר." מספרי ההערכה תומכים לפחות בחלק השני: מודלי ContextPilot פועלים בתוך חלון הקשר של 32K, בעוד שמודל הבסיס Qwen3-14B ללא כוונון מוערך על 128K, ונקודות הביקורת של ContextPilot עדיין משיגות ציונים גבוהים יותר בחבילת ההקשר הארוך של המאמר עצמו.
לוח התוצאות, מסומן בכנות
כל מספר בחלק זה הוא דיווח של הספק מהמאמר (arXiv 2608.28476) ולא שוחזר באופן בלתי תלוי — אף צד שלישי לא הריץ את tencent/ContextPilot-14B במסגרת ציבורית, וקוד ההערכה הוא בן ימים ספורים. המאמר מדווח על ממוצעים של שלוש ריצות בארבעה בנצ'מרקים: NovelQA, ∞Bench (אנגלית רב-ברירתית), LongMemEval-S ו-BrowseComp+.
• tencent/ContextPilot-14B (לאחר SFT): 84.28 / 79.04 / 65.93 / 53.13 — ממוצע 70.60.
• tencent/ContextPilot-14B (+ RL): 84.81 / 81.08 / 67.40 / 55.50 — ממוצע 72.20. מעבר ה-RL שווה בערך 1.6 נקודות בממוצע, והרווחים הגדולים ביותר שלו נוחתים על המדד הקשה ביותר, BrowseComp+ (2.4+).
• ההשוואה שנותנת למספרים האלה משמעות: ה-Qwen3-14B הלא מכוונן, ללא כלי הקשר, שנבדק בהקשר של 128K, משיג ממוצע של 53.26 — כמעט 19 נקודות מתחת למודל המכוונן ב-RL שפועל ברבע מההקשר. StateLM-14B-RL, קו הבסיס החזק ביותר הקודם לניהול הקשר, משיג ממוצע של 70.11, כך ש-ContextPilot-14B-RL מוביל עליו בכ-2.1 נקודות.
• חיפוש עמוק הוא הערכה שנייה ונפרדת. ב-WebExplorer-8B, הסוכן של ContextPilot מגיע לממוצע של 50.10 על פני BrowseComp, BrowseComp-ZH, GAIA ו-xBench-DeepSearch לעומת 49.09 עבור קו הבסיס החזק SUPO; ב-WebSailor-7B הוא משיג 38.32 לעומת 36.31 של SUPO.
• טענת היעילות היא המעניינת ביותר והקשה ביותר לאימות: ב-BrowseComp הקלט של סוכן הבסיס גדל כמעט ליניארית לכ-30K טוקנים, בעוד שסוכן ContextPilot-8B מתייצב על כ-8K–10K טוקנים לכל תור. הקשר עבודה קומפקטי הוא כל התזה של המאמר, והנתון הזה הוא הראיה הישירה לכך.

הכרטיס שלמעלה מציג את הממוצעים המדווחים של שלוש נקודות הביקורת זה לצד זה. יש להתייחס לכל נתון כאל טענה מתוך המאמר, ולא כתוצאה מבוקרת.
הרישיון הוא החלק שמשנה את התוכניות שלך
הנה העובדה שרוב הכתבות יטמינו ואתם לא צריכים. המשקולות "פתוחות", אבל הרישיון אינו Apache-2.0 — הוא "License Terms of ContextPilot-14B" מותאם אישית, אשר משכפל את הטקסט של Apache ומוסיף סעיף 0 הקובע שהמודל "זמין אך ורק למטרות מחקר ופיתוח מדעיים" ו"אסור" להשתמש בו לכל מטרה אחרת. זהו רישיון למחקר בלבד בשפה פשוטה: אפשר לכוונן ולחקור אותו, אבל אי אפשר לפרוס אותו במוצר, להגיש אותו מסחרית, או להשתמש בו כמנוע של שירות בתשלום ללא הסדר נפרד עם Tencent. מודל הבסיס, Qwen3-14B, הוא Apache-2.0; כוונון העדין של ContextPilot מוסיף את המגבלה על גביו. האחים 8B ו-E4B נושאים קבצי רישיון משלהם ויש לקרוא אותם על פי תנאיהם.
הרישיון למחקר בלבד מסביר גם את היעדר המסלול המתארח. אף ספק הסקה (inference) לא מציע את tencent/ContextPilot-14B כ-API כיום, ורישיון למחקר בלבד הוא סיבה חזקה לכך שאף נתב מסחרי — כולל OrcaRouter — לא יוסיף אותו לרשימה עד שטנסנט (Tencent) תשנה את התנאים. עבור מי שרוצה להריץ אותו עכשיו, זה אומר אירוח עצמי למחקר: ה-fine-tune מוגש דרך vLLM או SGLang עם נקודת קצה תואמת OpenAI, וזה בדיוק האופן שבו צינור ה-infer של המאמר עצמו מפעיל אותו.
מה מאומת, ומה לא
אושר ישירות מהמאגרים עצמם: שלוש נקודות הבידוק קיימות וניתנות להורדה; המאמר קיים, מתוארך ל-28 באוגוסט 2026, ונושא אישור קבלה למסלול הראשי של כנס EMNLP 2026; מתכוני האימון אמיתיים ומפורטים (verl, Qwen3-8B ו-Qwen3-14B); צינור ההערכה מכסה את ארבעת מדדי הייחוס שצוינו; וטקסט הרישיון הוא לשימוש מחקרי בלבד.
עדיין לא אושר: כל הודעה או פוסט השקה מטעם Tencent (אינו קיים נכון לכתיבת שורות אלה); כל תמחור או API מתארח; כל הרצת בנצ'מרק עצמאית; כל שכפול של מספרי החיפוש העמוק או ההקשר הארוך על ידי צד שלישי; ומספר הפרמטרים המדויק ותקציב האימון עבור גרסת E4B, שהמאמר מתאר כחבר הקומפקטי הבנוי על Gemma4-E4B-it. גם ערכת הבנצ'מרק ראויה לקריאה סקפטית — BrowseComp+ עם ממוצע של 552K אסימוני קלט הוא מבחן מאמץ שונה מאוד מ-NovelQA עם ממוצע 119K, והממוצע במאמר מקפל פיזור רחב.

הדף הראשי של המאמר שלמעלה {{1}}הוא המקור הקנוני לכל טענה בלוח התוצאות{{/1}} — {{2}}והעדרו של כל ציטוט מצד שלישי הוא בעצמו עמודת "טרם אושר"{{/2}}.
מה לצפות בהמשך
שלוש התפתחויות עשויות לשנות את התמונה, לפי סדר חשיבותן. ראשית, {{1}}רישיון מסחרי או הודעה רשמית — זה ההבדל בין אב-טיפוס מחקרי למודל בר-פריסה, וההחלטה היא כולה של טנסנט{{/1}}. שנית, {{2}}הערכה עצמאית ראשונה: סוויטת ההקשר הארוך ונתוני החיפוש העמוק ניתנים לשחזור מהקוד הציבורי ומהמשקלים, כך שהרצה של צד שלישי אמורה לנחות בתוך שבועות אם התוצאות מחזיקות מעמד{{/2}}. שלישית, {{3}}כל סימן לכך שהגישה מחלחלת למודלי הייצור של טנסנט — קו Hunyuan הוא המועמד הברור — שיגיד לך אם ניהול פרואקטיבי של קונטקסט הוא נישה מחקרית או כיוון שהתעשייה עומדת להעתיק{{/3}}.
למפתחים, העמדה הכנה לטווח הקרוב היא: לצפות בזה, להעריך את זה, ועדיין לא לבנות על זה מוצר. נקודת ביקורת למחקר בלבד שמשוחררת בלי הכרזה ובלי אימות בלתי תלוי היא בדיוק מה שצריך לכוון אליו נתיב בדיקה, לא נתיב ייצור. כשהרישיון והאימות ינחתו, סיפור הניתוב הוא טריוויאלי — אותו מפתח OrcaRouter שמשרת 200+ מודלים מתארחים במחיר המחירון של הספק עם 0% מרווח, היה מוסיף את המודל הזה ביום שספק יפרסם אותו, עם מעבר אוטומטי (failover), כך שנקודת ביקורת של סוכן ששוחררה לפני ימים ספורים ונתקעת לעולם לא מפילה איתה עומס עבודה אמיתי. עד אז, משקלי המודל הם ארטיפקט מחקרי מעניין מאוד עם מתכון אימון חדשני באמת — וחומה משפטית סביבם, שכדאי לקרוא לפני שעושים איתם משהו.
