
Cognition SWE-2: מי מייצר אותו, באיזה הארנס הוא רץ, ומה המספרים באמת אומרים
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 316 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 196 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
Cognition SWE-2 הוא מודל קוד שנוצר על ידי Cognition, החברה שמאחורי Devin, והוא מוגש בתוך Devin ולא דרך API של מודל: הפוסט הרשמי של Cognition מציין ש-SWE-2 זמין תחילה ב-Devin Desktop וב-Devin CLI, עם פריסה הדרגתית ל-Devin Web ול-Fusion. הוא עבר אימון-המשך מ-Kimi K3, המודל של Moonshot AI עם 2.8 טריליון פרמטרים. זו התשובה המלאה לשאלה שרוב האנשים בעצם שואלים כשהם מגיעים לכאן, וכדאי להצהיר על כך לפני כל דבר אחר, מפני שחלק מדיד מהחיפושים שמובילים לעמוד הזה מוסיף מילה רביעית — Devin — ומייחס את המודל ל-Devin ולא ל-Cognition. Devin הוא הסוכן ש-Cognition מוכרת. SWE-2 הוא המודל ש-Cognition אימנה כדי לפעול בתוכו.
העמוד הזה הוא עמוד אסמכתא ולא כתבת השקה. SWE-2 שוחרר ב-10 בספטמבר 2026, תאריך שנמצא יותר משבוע מאחורינו; התאריך מופיע כאן כדי לעגן את המודל בזמן, ולא כדי לדווח על אירוע. בהמשך מפורט מה מתועד, מי תיעד אותו, ומה שאף אחד עדיין לא בדק.
מי מייצר את SWE-2, ולמה הייחוס ממשיך להיסחף
הבלבול אינו בלתי סביר. Cognition אינה מוכרת את SWE-2 כפי שמעבדה מוכרת מודל API. אין כרטיס מודל עם חלון הקשר, אין מחיר טוקנים שפורסם, ואין מזהה שאפשר להעביר בגוף הבקשה. יש מוצר — Devin — והמודל מגיע כחלק ממנו. הניסוח של Cognition עצמה מחזק את הטשטוש: פוסט ההשקה כתוב מנקודת המבט של Devin, טבלת הבנצ'מרק אינה מוסברת למי שלא קרא כבר את עבודת FrontierCode המוקדמת של החברה, ושורת הזמינות מזכירה את Devin ארבע פעמים ואת Cognition פעם אחת — בשורת הקרדיט.
אז, בפשטות: Cognition מייצרת את SWE-2. Cognition מייצרת את Devin. השניים אינם אותו דבר, אבל נכון להיום אינך יכול לקבל אחד בלי האחר. זו גם לא תאונת שמות חד־פעמית. Cognition השיקה סדרה של מודלים להנדסת תוכנה תחת הקידומת SWE — SWE-1.5, SWE-1.6, SWE-1.7 וכעת SWE-2, עם נקודת ביקורת SWE-1.6 Preview בדרך — לצד כלים ממוקדים יותר כמו SWE-grep ו-SWE-check. הקידומת היא הקיצור של החברה להנדסת תוכנה, והיא קדמה לכל מודל בפסקה הזו בכשנה.
השם: מודל, לא מדד
זו הסיבה השנייה לכך שהמחפשים מייחסים את SWE-2 לבעלים הלא נכון, והיא ראויה לפסקה משלה ולא להערת שוליים.
SWE-bench הוא בנצ'מרק. זוהי הערכה בלתי תלויה שמתוחזקת על ידי צוות SWE-bench, מתארחת ב-swebench.com, והיא מופצת במספר מהדורות: הסט המקורי בן 2,294 המופעים שנאסף מבעיות GitHub אמיתיות, ובנוסף תת-הקבוצות Verified, Lite, Multilingual ו-Multimodal. היא משמשת לדירוג סוכני קידוד באופן כללי, כולל Devin — Cognition פרסמה דוח טכני על Devin ב-SWE-bench כבר במרץ 2024, והוא עדיין נמצא בבלוג שלה.
SWE-2 הוא מודל. הוא אינו מהדורה של SWE-bench, ואינו קיצור של מהדורה כזו. אין SWE-bench 2: המשפחה שפורסמה כוללת את SWE-bench, Verified, Lite, Multilingual ו-Multimodal, ומספור הגרסאות שקיים שייך לתת-הקבוצות של הבנצ'מרק, ולא ליורש ממוספר. הבנצ'מרק הרשמי של Cognition עבור המודלים האלה נקרא FrontierCode, שהוא כלי שונה לחלוטין, וכפי שמוסבר בקטע הבא, אחד שנמצא בבעלות Cognition.
אם הגעתם לכאן בציפייה לדור שני של הערכת SWE-bench, הרי שזו כל אי-ההבנה.
תאריך יציאה וכיצד SWE-2 מופץ
בפוסט ההכרזה של Cognition מופיעה שורת קרדיט מ-10 בספטמבר 2026, והנתונים המובנים של העמוד עצמו נותנים את חותמת הזמן של הפרסום כ-2026-09-10. השניים תואמים. SWE-2 היה זמין ב-Devin Desktop וב-Devin CLI באותו תאריך, כאשר Devin Web ו-Fusion באו לאחר מכן.
זהו משטח ההפצה, וזהו כל משטח ההפצה. אין משקלים פתוחים — אין שום דבר ב-Hugging Face מטעם Cognition עבור המודל הזה — ואין נקודת קצה המתארחת אצל ספק שמקבלת מזהה SWE-2. אם ההארנס שלך הוא משלך, SWE-2 אינו רכיב שתוכל להתקין בו היום. אם ההארנס שלך הוא Devin, SWE-2 כבר נמצא לפניך.
לכל מי שזקוק למעטפת של מודל הבסיס ולא לזו של SWE-2, Kimi K3 הוא דבר נפרד ומתועד טוב יותר, והוא מנותב ב-OrcaRouter בתור kimi/kimi-k3 — API אחד ל-200+ מודלים במחיר המחירון של הספק וללא תוספת. זה חשוב כאן מסיבה מסוימת: היכולת הבסיסית ש-Cognition התחילה ממנה נגישה באופן עצמאי, אף שהמודל שעבר אימון-המשך אינו כזה.
המעטפת: מה Cognition מתעדת, ומה היא אינה מתעדת
דף עיון צריך להיות כנה לגבי צורת הראיות שלו עצמו, וכאן הראיות של SWE-2 הן הדלות ביותר.
• מאמץ הסקה — שלוש רמות מתועדות: medium, high ו-max. Cognition כותבת שהרמות מתנהגות באופן שונה במכוון: medium נכנסת לפעולה מוקדם יותר ומטפלת בעבודה פשוטה ובינונית, בעוד ש-high ו-max מתכננות יותר, בוחנות יותר את בסיס הקוד, ומשקיעות יותר באימות.
• הפצה — Devin Desktop ו-Devin CLI בעת ההשקה, Devin Web ו-Fusion יוצאים בהדרגה. ללא API, ללא משקלים, ללא מסלול אירוח עצמי.
• מודל בסיס — Kimi K3, שמתואר על ידי Cognition כמודל בעל 2.8T פרמטרים שכבר עבר RL נרחב לקידוד סוכני. מאמר Kimi K3 מעניק לבסיס הזה חלון הקשר של 1M טוקנים וראייה מובנית.
• חלון הקשר, פלט מקסימלי, מודאליות, מספר פרמטרים לאחר אימון — לא פורסמו עבור SWE-2. ההודעה של Cognition אינה אומרת דבר על אף אחד מהם, ואף עמוד אחר של Cognition לא ממלא את החסר.
ההבחנה בשורה האחרונה אינה קפדנות יתר. חלון מיליון הטוקנים של Kimi K3 הוא עובדה לגבי Kimi K3. Cognition לא אומרת ש-SWE-2 יורש אותו, ופוסט-אימון לפי מתכון שונה הוא בדיוק סוג השינוי שיכול לשנות את מה שהמודל מקבל. אם אתה צריך מספר חלון־הקשר לצורכי תכנון, המספר שאתה יכול לאמת שייך למודל הבסיס, ועליך להתייחס לזה של SWE-2 כלא־ידוע במקום להניח ששניהם תואמים.

כרטיס התעריפים, במטבע היחיד שבו Cognition מצטטת
אין מחיר לכל טוקן עבור SWE-2, מפני שאין נקודת קצה של SWE-2. הטענה של Cognition בנוגע לעלות נקובה אחרת: היא אומרת ש-SWE-2 נופל בטווח של נקודה אחת מ-Claude Fable 5.1 ב-FrontierCode 1.1 Main — 50.0% לעומת 50.9% — בעודו זול ב-64%. יש לקרוא את יחידת המידה בעיון. ה-64% הם ממוצע הדולרים האמריקאיים שהוצאו לכל הרצה ב-FrontierCode, נתון ברמת המשימה שכורך את המודל, את ה-harness, את ה-scaffolding ואת מחסנית ההגשה של Cognition לחשבונית אחת. זה אינו תעריף טוקנים, ואי אפשר להשוות אותו לתעריף כזה.
המחירון שכן קיים הוא של Devin. בעמוד התמחור של Devin, כפי שנקרא ב-28 בספטמבר 2026: Free ב-$0, Pro ב-$20 לחודש, Max ב-$200 לחודש, Teams ב-$80 לחודש ועוד $40 לכל מושב מפתח מלא. שורת SWE-2 נמצאת ב-Pro ונושאת תאריך — "שימוש חינם ב-SWE-2 — חינם ב-Devin Desktop וב-CLI עד 10 באוקטובר 2026." זהו חלון מבצעי שנותרו לו כשבועיים בערך, והוא הנתון היחיד על SWE-2 בעמוד הזה שהוא באמת רגיש לזמן: עלות המודל בתוך Devin אחרי 10 באוקטובר אינה מצוינת שם.
נתוני היעילות של Cognition ראויים לציטוט לצד טענת העלות, והם מדווחים על ידי הספק כמו כל דבר אחר בעמוד הזה. ב-FrontierCode 1.1 Main, SWE-2 במאמץ בינוני משיג ציון גבוה מ-SWE-1.7 תוך שהוא צורך 58% פחות סבבים ועולה 81% פחות בממוצע. מספר הצעדים הממוצע לכל הרצה יורד מ-127 ב-SWE-1.7 ל-53 במאמץ בינוני, 80 במאמץ גבוה ו-98 במאמץ מקסימלי, והחציון של עריכת הקוד האמיתית הראשונה עובר מצעד 48 לצעד 18.
הבנצ'מרקים, עם רתמת הבדיקה מחוברת
ציוני הנדסת תוכנה רגישים באופן יוצא דופן ל-scaffold שבו הם הופקו, ולכן מספר בלי ה-harness שלו אינו מספר. Cognition מציינת את מדיניות ה-harness שלה בנספח המתודולוגיה של ההודעה: תוצאות מדווחות ממקורות ציבוריים כאשר קיים כזה, ואחרת מורצות על מסגרת ההערכה הפנימית של Cognition תוך שימוש ב-harness שלמענו פותח כל מודל בעיקר — Claude Code עבור מודלים של Anthropic, Codex עבור מודלים של OpenAI, Grok Build עבור מודלים של xAI, ו-Devin CLI עבור מודלים בקוד פתוח. עבור כל מודל, Cognition מדווחת את הציון הטוב ביותר מבין הגדרות מאמץ החשיבה.
מכך נובעות שתי מסקנות, ושתיהן צריכות להיאמר בנשימה אחת עם המספרים. ראשית, כמה שורות אינן ברות-השוואה: נתון של Fable 5.1 שהופק ב-Claude Code ונתון של Kimi K3 שהופק ב-Devin CLI הם מדידות של שתי מערכות סוכנים שונות, ולא של שני מודלים בהרנס ניטרלי. שנית, "הציון הטוב ביותר על פני הגדרות המאמץ" פירושו שכל תא הוא המקרה הטוב ביותר של מודל, ולא הגדרה מותאמת. השוואה שבה המאמץ נשמר קבוע הייתה נראית אחרת, ו-Cognition לא פרסמה השוואה כזו.
כל ארבע השורות שלמטה מדווחות על ידי הספק ולא מבוקרות.
• FrontierCode 1.1 Main — SWE-2 50.0%, Kimi K3 44.2%, Grok 4.6 48.0%, Claude Fable 5.1 50.9%, GPT-5.6 Sol 47.5%, GPT-6 Astra 53.3%, SWE-1.7 42.0%. זו שורת הכותרת, ו-FrontierCode הוא הבנצ'מרק של Cognition עצמה — Cognition כותבת את המשימות יחד עם יותר מ-20 מתחזקי קוד פתוח, מפעילה את טבלת המובילים, ומדרגת את ההגשות. שום דבר מכל זה לא הופך את הנתונים לשגויים; כל זה שייך למשפט שבו אתה מצטט אותם.
• DeepSWE 1.1 — SWE-2 73.0%, Kimi K3 68.5%, Grok 4.6 67.5%, Claude Fable 5.1 67.4%, GPT-5.6 Sol 72.7%, GPT-6 Astra 74.1%, SWE-1.7 37.7%. השורה שבה SWE-2 מנצחת באופן המשכנע ביותר מודל חזית ממש.
• Terminal-Bench 2.1 — SWE-2 92.8%, Kimi K3 88.3%, Grok 4.6 88.4%, Claude Fable 5.1 91.4%, GPT-5.6 Sol 88.8%, GPT-6 Astra 89.9%, SWE-1.7 81.5%. המספר המרשים ביותר של SWE-2, והמהדורה הנוכחית של Terminal-Bench היא לא 2.1.
• Terminal-Bench 4 — SWE-2 27.3%, Kimi K3 21.5%, Grok 4.6 20.3%, Claude Fable 5.1 55.8%, GPT-5.6 Sol 37.3%, GPT-6 Astra 57.9%, SWE-1.7 7.6%. השורה המצוטטת הכי פחות, וזו שבה המודל נמצא בערך 28 נקודות מאחורי החזית.
ההשוואה זקוקה גם לעוד פיסת הקשר, כי היא מסבירה מאין מגיעה הצורה הבלתי־שגרתית של שורת החזית. הערת השוליים של Cognition עצמה לתרשימים שלה מציינת כי הגדרת המאמץ המרבי של Fable 5.1 ב-FrontierCode 1.1 Main משיגה 50.3% בעלות של $12.83 למשימה — מתחת להגדרה הבינונית שלה, 50.9% ו-$3.28. יותר מאמץ קנה ציון נמוך יותר בעלות גבוהה פי ארבעה בערך. זו העקומה של מודל החזית שמתכופפת חזרה על עצמה, וזה חלק מהסיבה ש-50.0% לעומת 50.9% קרובים יותר ממה ששני המספרים לבדם מרמזים.
מספרי האמינות
המדור הנפרד של Cognition בנושא מהימנות הוא החלק בפרסום שאין לו דבר וחצי דבר עם לוחות דירוג, והוא מדווח כי SWE-2 עבר 98.0% מהפרומפטים שלו בנושא תעמולה וצנזורה בסך הכול — 99.8% באנגלית, 95.2% בסינית מפושטת ו-99.1% בסינית מסורתית — וכי הערכת הפגיעוּת התלוית-הקשר שלו לא מצאה שום תנאי מסגור שהפיק שינוי מובהק סטטיסטית באף מודל שנבדק. אלה הם שיפוטים של Cognition, שהופקו עם שופט GPT-5.6 Luna על סט של 145 שאלות, והם מדווחים על ידי הספק באותו מובן שבו מדווחים המדדים.
הקריאה הבלתי תלויה: עדיין אין כזו
נכון ל-28 בספטמבר 2026, ל-SWE-2 אין ערך ב-Artificial Analysis. חיפוש לפי השם באינדקס המודלים אינו מחזיר דבר, ובקשה ישירה לדף המודל מחזירה 404. לוח התוצאות היחיד שמציג את SWE-2 הוא FrontierCode, ששייך ל-Cognition. זה מותיר את ההשקה עם מספרים שמדווחים על ידי הספק ותו לא, וזו אינה ביקורת על המספרים — זהו אמירה על כמה מהם יכול הקורא לבדוק.
שני דברים ספציפיים יכריעו את העניין, ואף אחד מהם לא קיים היום. הרצה של צד שלישי של SWE-2 על Terminal-Bench 4 תקבע אם זהו מודל סמוך לחזית שבמקרה זול, או מודל מהיר שבמקרה מוביל מהדורה שהוצאה משימוש. וכל שחזור בלתי תלוי של הפער ב-FrontierCode יגיד לך אם יתרון של נקודה אחת מול Fable 5.1 הוא תכונה של המודל או תכונה של המכשיר.
שלא כמו המודלים של Cognition עצמה, Artificial Analysis כן כוללת את Kimi K3 — והנתונים של Kimi K3 הם ממקור שלישי, מה שהופך את מודל הבסיס לחצי שהראיות לגביו טובות יותר בסטאק הזה. האסימטריה הזו היא הצורה המעשית של SWE-2 היום: ה-post-train הוא החלק המעניין והחלק הפחות ניתן לאימות; הבסיס הוא החלק המתועד וזה שאפשר למעשה לקרוא לו.

שימוש ב-SWE-2, ומה לעשות כל עוד הוא לא מבוקר
אם אתה כבר משלם עבור Devin, ההחלטה קלה ואינה תלויה באף אחת מההסתייגויות שלעיל. SWE-2 נמצא במוצר שלך, Cognition אומרת שהוא עולה פחות לכל משימה מהמודל שהוא מחליף, ונתוני היעילות — 58% פחות סיבובים, 81% פחות עלות ממוצעת, עריכה ראשונה חציונית בצעד 18 במקום בצעד 48 — מתארים מודל שמבזבז פחות מזמנך בעבודה שגרתית. התחל אותו במאמץ בינוני בקצה הפשוט של התור שלך, וזה בדיוק המקום שבו תכנון רמות המאמץ של Cognition עצמה ממקם את החיסכון בעלות.
אם אתם בוחרים מודל קידוד מחוץ ל-Devin, העמדה הכנה היא ש-SWE-2 אינו מועמד שאפשר להעריך, כי אין מה לקרוא. אין מזהה, אין מחיר לטוקן, ואין נקודת קצה. מה שאפשר להעריך הוא מודל הבסיס.

Kimi K3 מנותב דרך OrcaRouter, במחיר של $3.00 לכל 1M טוקני קלט ו-$15.00 לכל 1M טוקני פלט, ללא תוספת מעל תעריף הספק, עם חלון הקשר של 1M טוקנים, קריאה מקורית לכלים, קלט תמונות ושליטה ברמה העליונה במאמץ החשיבה. זהו החצי הנגיש של השחרור הזה: היכולת ש-Cognition ביצעה על בסיסה אימון-המשך, זמינה דרך נקודת קצה אחת תואמת OpenAI ולא דרך מוצר סוכן של ספק בודד. וכיוון שזה שטח לא מבוקר כך או כך, אתה יכול להציב מאחוריו שרשרת גיבוי, כך שמודל שאתה בוחן לא יהפוך לתלות בייצור ביום שבו הוא יאכזב אותך.
מה ש-SWE-2 מספר לך, אם אתה קורא אותו כראיה ולא כעמוד מוצר, הוא צר יותר ושימושי יותר מהכותרת: מעבר RL מבוצע היטב על גבי Kimi K3 הזיז את הרמה בכחמש נקודות בארבעה מבחני ביצועים מבלי לשנות את הצורה, והצריך 58% פחות סיבובים כדי לעשות זאת. זו תוצאה אמיתית בתוך Devin. זו עדיין לא תוצאה שאף אחד ב-Cognition שחזר, ומבחן הביצועים היחיד שבו SWE-2 ניצח את הכל הוא זה שהתחום הפסיק לדרג בו.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
