
Cognition SWE-2: קידוד סמוך-לחזית בהנחה של 64%, ומלכודת הבנצ'מרק שמתחת
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
Cognition SWE-2 יצא לשוק השבוע עם מספר שנבנה לנסוע: 50.0% ב-FrontierCode 1.1 Main, במרחק נקודה אחת מ-Claude Fable 5.1 עם 50.9%, תמורת 64% פחות כסף. המודל הוא אימון-המשך של Kimi K3 של Moonshot AI — הבסיס במשקלים פתוחים עם 2.8 טריליון פרמטרים — ו-Cognition אומרת שלמידת החיזוק שלה הוסיפה 5–6 נקודות בכמה בנצ'מרקים. שני הנתונים הם של הספק עצמו, ואף אחד מהם לא שוחזר באופן עצמאי. השני, לעומת זאת, הוא הטענה שאמורה לשנות את האופן שבו אתה קורא את הראשון, מכיוון ש"ועוד חמש או שש" מתברר כמתאר כמעט כל מה ש-SWE-2 עושה, כולל המקומות שבהם הוא מפסיד קשות.
זו לא ביקורת. זה הדבר השימושי ביותר בגרסה הזו, וזה החלק שכמעט אף אחד מסיקור ההשקה לא אומר בקול רם.
מה Cognition למעשה שחררה
SWE-2 הוא מודל הקידוד של Devin, ולא מודל API לשימוש כללי עם מחירון. הוא הושק זמין החל מהיום ב-Devin Desktop וב-CLI, במילותיה של Cognition עצמה, כשההשקה בעיצומה ב-Devin Web וב-Fusion. סיקור צד שלישי מתארך את ההכרזה ל-10 בספטמבר 2026; חתימת הכותב בפוסט הבלוג של Cognition עצמה מציינת 09.11.26. כך או אחרת, זה בן ימים ספורים בלבד. המשקלים קנייניים ואין כרטיס תעריפים מפורסם לפי טוקן. אם ברצונך להשתמש ב-SWE-2, אתה משתמש בו בתוך Devin.
הבסיס הוא Kimi K3, מודל Mixture-of-Experts בעל 2.8 טריליון פרמטרים, עם כ-104 מיליארד פרמטרים פעילים לכל טוקן — בערך פי שלושה מגודל הבסיס של SWE-1.7. Cognition מציינת ש-K3 כבר עבר אימון RL ממושך לתכנות סוכני לפני שהגיע לשם, ושגם ה-RL שלה עצמה "עדיין מוצאת מרחב פעולה משמעותי". זה משקף את הדפוס של SWE-1.7, שעבר אימון-המשך על בסיס Kimi אף הוא.
הנה הפרט שחשוב יותר מכל ציון בנצ'מרק בודד: FrontierCode הוא הבנצ'מרק של Cognition. החברה כותבת את המשימות — עם יותר מ־20 מתחזקי קוד פתוח, יותר מ־40 שעות לכל משימה, כשכל מתחזק מגדיר מה משמעות "ניתן למיזוג" במאגר שלו — מפעילה את לוח הדירוג, ומדרגת את ההגשות. זו עבודת עיצוב הערכה רצינית, והיא גם כלי פנימי. Cognition מדווחת על הציון הטוב ביותר של כל מודל על פני הגדרות מאמץ החשיבה, ולפי נספח המתודולוגיה שלה מודלי ההשוואה עם משקולות פתוחות, כולל Kimi K3, הורצו בתוך Devin CLI של Cognition. שום דבר מזה לא הופך את המספרים לשגויים. כל זה שייך למשפט שבו אתה חוזר עליהם.

קריאה של טבלת הבנצ'מרק ביושר
ארבעה מדדי ביצוע, כולם לפי דיווח הספק. הנה מה שכל אחד מהם בעצם אומר, שורה אחת בכל שורה.
• FrontierCode 1.1 Main — SWE-2 50.0%, לעומת Kimi K3 44.2%, Grok 4.6 48.0%, GPT-5.6 Sol 47.5%, Claude Fable 5.1 50.9%, GPT-6 Astra 53.3%, SWE-1.7 42.0%. במרחק של נקודה אחת מהחזית, ומקדים את כל השאר בטבלה.
• DeepSWE 1.1 — SWE-2 73.0%, לפני Claude Fable 5.1 עם 67.4% ו-Grok 4.6 עם 67.5%, מאחורי GPT-6 Astra עם 74.1%. זו השורה שבה SWE-2 מביס באופן המהימן ביותר מודל חזית באופן מוחלט.
• Terminal-Bench 2.1 — SWE-2 92.8%, הציון הגבוה ביותר בטבלה של Cognition, לפני Claude Fable 5.1 עם 91.4% ו-GPT-6 Astra עם 89.9%. זהו המספר שמופיע ברוב כותרות ההשקה.
• Terminal-Bench 4 — SWE-2 27.3%, לעומת Claude Fable 5.1 עם 55.8% ו-GPT-6 Astra עם 57.9%. פער של כ-28 נקודות, והשורה שמצוטטת הכי פחות.
ההתנגדות הברורה היא שכולם יורדים ב-Terminal-Bench 4 — זה יורש קשה וארוך-טווח יותר, אז כמובן שהציונים נופלים. החלק המעניין הוא בכמה, והנפילה אינה פרופורציונלית. במעבר מ-Terminal-Bench 2.1 ל-4, Claude Fable 5.1 מאבד כ-35.6 נקודות ו-GPT-6 Astra כ-32.0. SWE-2 מאבד כ-65.5, והבסיס שלו Kimi K3 כ-66.8. כלומר, בעבודה סוכנית ארוכת-טווח, SWE-2 לא רק נמצא מתחת למודלים המובילים — הוא נדרדר בערך פי שניים מהר מהם כשהמשימה מתארכת.
השאלה אם Terminal-Bench 4 הוא הגרסה ה"חיה" ראויה ללומר אותה בבירור: הוא המהדורה הנוכחית, ו-2.1 היא זו שהוחלפה. השורה שבה SWE-2 מוביל היא הבנצ'מרק שיצא משימוש. השורה שבה הוא מפגר היא הנוכחית. שתי העובדות נכונות, וסיקור ההשקה נטה לבחור באחת מהן.
"Kimi K3 plus five" — ההיוריסטיקה שמנבאת את הציונים שאף אחד לא פרסם
הצב את ארבעת הבנצ׳מרקים מול מודל הבסיס של SWE-2 עצמו, ומשהו כמעט מכני יוצא מזה. מול Kimi K3, SWE-2 מרוויח 5.8 נקודות ב-FrontierCode 1.1 Main, 4.5 ב-DeepSWE 1.1, 4.5 ב-Terminal-Bench 2.1, ו-5.8 ב-Terminal-Bench 4.
ארבעה בנצ'מרקים, ארבעה פערים, כולם בין 4.5 ל־5.8. הפוסט-אימון הזיז את הרמה, לא את הצורה. בכל מקום שבו K3 חזק, SWE-2 חזק ועוד בערך חמישה. בכל מקום שבו K3 חלש — כשהמקרה הברור הוא Terminal-Bench 4 — SWE-2 חלש ועוד בערך חמישה.
זה נותן לך תחזית מעשית לכל משימה ש-Cognition לא בחנה, וזה רוב המשימות. בדוק כיצד Kimi K3 מתפקד בעומס העבודה שלך, הוסף חמש נקודות, ויש לך הערכה טובה יותר של SWE-2 מכל מספרי הכותרת שיתנו לך. זה גם מסביר את התזה האמיתית של ההשקה: Cognition לא טוענת שהביסה את החזית. היא טוענת שהזיזה את כל עקומת העלות-ביצועים החוצה, תוך שמירה על מרחק קבוע מאחורי המודל הטוב ביותר בכל ציר שתמדוד.
ה־64% אמיתי, אבל אי אפשר לקנות אותו.
"64% זול יותר מ-Claude Fable 5.1" הוא משפט נכון לגבי מדידה ספציפית — והמדידה היא ממוצע דולרים אמריקאיים שהוצאו לכל rollout ב-FrontierCode, ולא מחיר טוקן. אין תעריף לפי טוקן עבור SWE-2 כי אין API של SWE-2. טענת העלות מתארת כמה עולה משימה בתוך Devin, שמאגד את המודל, את ה-harness, את ה-scaffolding ואת מחסנית ההגשה של Cognition לחשבונית אחת.
להבחנה הזו יש משמעות של ממש. אי אפשר להשוות את העלות של SWE-2 למחיר של טוקן מספק אחר, כי אלה לא אותה יחידה. ואי אפשר לקחת את SWE-2 למקום אחר: משקלים קנייניים, ספק אחד, מוצר סוכן אחד. הנתון "עלות נמוכה יותר של עד 70%" בכמה סיקורים הוא הקצה העליון של הטווח ש-Cognition מצטטת על פני מבחנים; הנתון של FrontierCode 1.1 Main הוא 64%.
נתוני היעילות הם, אם כבר, הסיפור המעשי יותר, וגם הם מדווחים על ידי הספק. SWE-2 במאמץ בינוני מנצח את ציון FrontierCode של SWE-1.7 תוך שימוש ב-58% פחות סבבים ובעלות נמוכה ב-81% בממוצע. ממוצע הצעדים לכל הרצה יורד מ-127 ב-SWE-1.7 ל-53 במאמץ בינוני (80 בגבוה, 98 במקסימלי), והחציון של עריכת הקוד האמיתית הראשונה עובר מצעד 48 לצעד 18. זו תשובה ישירה לתלונה ש-SWE-1.7 חקר יתר על המידה משימות פשוטות, וזה מסוג השיפורים שמופיעים בחשבון שלך הרבה לפני שפער של נקודה אחת בבנצ'מרק עושה זאת.

הטריק באימון הוא הבשורה האמיתית
אם מסירים את המיצוב בטבלת המובילים, נותרת כאן פיסת הנדסה אחת חדשנית באמת, וזו הסיבה שהשחרור שווה קריאה גם אם לעולם לא תפתחו את Devin.
Cognition אימנה את כל שלוש רמות מאמץ החשיבה — בינונית, גבוהה ומקסימלית — בריצת RL אחת. המנגנון הוא קנס עלות ליניארי לכל רמת מאמץ, שכל אחד מהם מכוונן להתאים לשיפוע של עקומת פארטו של עלות-ביצועים של מודל הבסיס עצמו באותה נקודה. הטיעון של Cognition לכך שהקנס חייב להיות ליניארי הוא החלק המעניין: רק קנס ליניארי משאיר את מטרת האימון פונקציה של עלות ממוצעת ושיעור פתרונות בלבד, ולא משהו שתלוי בצורת ההתפלגות.
הגישה הרגילה מאמנת רמות מאמץ בנפרד, או מצרפת אליהן בדיעבד נקודת ביקורת זולה יותר. אימון שלהן יחד בריצה אחת הוא מה שמאפשר לחברה לטעון שקידמה את כל החזית ולא רק נקודה אחת עליה. שינויים תומכים: בסיס תגמול משוקלל לפי אורך, שילוש מספר סביבות ה-RL, שכבות עוקפות של מילוי הוראות, וגלגל תנופה שמשתמש בנקודות ביקורת קודמות של SWE-2 כדי לחזק את המאמתים מפני פריצת תגמול. בצד ההגשה, קרנלים של NVFP4 ו-FP8 עם אימון מודע לכימות, מודל טיוטה ל-DSpark speculative decoding שאומן מחדש לאורכי קבלה ארוכים ב-15%, ומעכב prefill ששווה 10–20% בתפוקה לכל GPU במחיר של זמן גרוע יותר לתו הראשון.
אם אתם מריצים פוסט-אימון, המתכון הזה הוא החלק שניתן להעביר הלאה במהדורה הזו. אם לא, המסקנה פשוטה יותר: הסיבה ש-SWE-2 זול אינה שהוא מודל קטן יותר. היא שהעלות של הרצתו נכתבה לתוך פונקציית התגמול.
אם אתה רוצה את היכולת של Kimi K3 מחוץ ל-Devin
SWE-2 אינו זמין ב-OrcaRouter, וגם לא יהיה — משקלים קנייניים, ללא API, הפצה בלעדית ב-Devin. המצב שונה בכל הנוגע למודל הבסיס שלו. Kimi K3 מנותב ב-OrcaRouter בתור kimi/kimi-k3, במחיר של $3.00 לכל 1M טוקני קלט ו-$15.00 לכל 1M טוקני פלט ללא תוספת מעל תעריף הספק, חלון הקשר של 1M טוקנים, קריאה מקורית לכלים, קלט תמונות, ועומק חשיבה הנשלט דרך reasoning_effort פרמטר ברמה העליונה במקום הגדרות דגימה.
זו הגרסה הכנה של המסקנה המעשית של המהדורה הזו. SWE-2 מראה לך איך נראית הרצת RL מבוצעת היטב על גבי K3 בקצה העליון של הטווח שלו — שיפור אמיתי של 4.5 עד 5.8 נקודות, בתוספת שיפורי יעילות גדולים, במחיר אמיתי. מה שזה לא נותן לך הוא מודל שאתה יכול לקרוא לו. אם אתה רוצה שהיכולת הבסיסית תופנה לקוד שלך, להארנס שלך או לפייפליין שלך, K3 הוא החלק בסטאק הזה שאתה באמת יכול להגיע אליו, והוא נגיש דרך נקודת קצה אחת תואמת OpenAI.
זה גם החצי הבטוח יותר של ההימור כל עוד המספרים לא מאומתים. הבנצ'מרקים של SWE-2 הם של Cognition עצמה ואף אחד מחוץ לחברה לא שחזר אותם. אלה של Kimi K3 הם אלו שההשוואה בעצם נשענת עליהם — ואם תנתבו דרך OrcaRouter תוכלו להציב מאחוריו שרשרת גיבוי, כך שמודל שאתם בוחנים לא יהפוך לתלות בפרודקשן ביום שהוא יאכזב אתכם.

מי צריך לפעול, ומה יפתור את זה
אם אתם כבר משלמים עבור Devin, SWE-2 הוא פשוט חדשות טובות: הוא נפרס למוצר שלכם, הוא זול יותר לכל משימה ממה שהוא מחליף, ומספרי היעילות מרמזים שהוא יבזבז פחות סבבים על עבודה קלה. נסו אותו קודם בקצה הפשוט של התור שלכם — העיצוב של רמות המאמץ אומר שהרווח בעלויות נמצא ברמה הבינונית.
אם אתם בוחרים מודל קידוד מבחוץ, המתינו להערכה עצמאית. עדיין אין כזו: ל-Artificial Analysis אין רשומה עבור SWE-2, ולוח הדירוג FrontierCode הוא כלי של Cognition עצמה. שלושה דברים יכריעו את העניין. הרצה של צד שלישי של SWE-2 על Terminal-Bench 4, שהיא השורה שמכריעה אם זהו מודל הסמוך לחזית או מודל מהיר. כל שחזור עצמאי של פער FrontierCode. ומחיר לכל טוקן, שיחייב את Cognition למכור את המודל מחוץ ל-Devin — השינוי היחיד שיהפוך את 64% לברי-השוואה לכל דבר אחר שמצטטים לך.
עד אז הסיכום ההוגן הוא זה שפער מודל הבסיס כבר נותן לך. SWE-2 הוא Kimi K3 ועוד חמש נקודות, בעלות ש-Cognition תכננה לתוך פונקציית התגמול. זה הישג אמיתי באימון ועסקה ממש טובה בתוך Devin. הוא עדיין לא מודל חזית, והבנצ'מרק האחד שבו נראה שהוא מנצח את הכול הוא זה שהפסיק להיחשב.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
