بطاقة عنوان لـ Cognition SWE-2 بعنوان "Cognition SWE-2"، وعنوان فرعي "نموذج برمجي من Cognition، مدرب لاحقًا من Kimi K3، يعمل داخل Devin"، مع ثلاث بطاقات أدناه مكتوب عليها: صُنع بواسطة Cognition، والنموذج الأساسي Kimi K3 2.8T، ويعمل في Devin Desktop وCLI.
Guides & Insights

Cognition SWE-2: مَن يصنعه، وما إطار الاختبار الذي يعمل داخله، وما تقوله الأرقام فعلاً

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Cognition SWE-2 هو نموذج للبرمجة طورته Cognition، الشركة التي تقف وراء Devin، ويُقدَّم داخل Devin لا عبر واجهة برمجة تطبيقات للنموذج: يقول منشور الإطلاق الخاص بـ Cognition نفسه إن SWE-2 متاح أولًا في Devin Desktop وDevin CLI، مع طرحه تدريجيًا في Devin Web وFusion. وقد خضع لتدريب لاحق انطلاقًا من Kimi K3، نموذج Moonshot AI ذو 2.8 تريليون معلمة. هذا هو الجواب الكامل عن السؤال الذي يطرحه معظم الناس فعليًا عند وصولهم إلى هنا، ويستحق ذكره قبل أي شيء آخر، لأن نسبة قابلة للقياس من عمليات البحث التي تؤدي إلى هذه الصفحة تضيف كلمة رابعة — Devin — وتنسب النموذج إلى Devin بدلًا من Cognition. Devin هو الوكيل الذي تبيعه Cognition. SWE-2 هو النموذج الذي دربته Cognition ليعمل داخله.

هذه الصفحة صفحة مرجعية وليست قصة إطلاق. تم إطلاق SWE-2 في 10 سبتمبر 2026، وهو تاريخ مضى عليه أكثر من أسبوع؛ التاريخ موجود هنا لتثبيت النموذج في الزمن، لا للإبلاغ عن حدث. ما يلي هو ما هو موثّق، ومن وثّقه، وما لم يتحقق منه أحد بعد.

من يصنع SWE-2، ولماذا يستمر الإسناد في التزحزح؟

الارتباك ليس بغير معقول. فشركة Cognition لا تبيع SWE-2 بالطريقة التي يبيع بها مختبر ما نموذج API. لا توجد بطاقة نموذج تحدّد نافذة سياق، ولا سعر منشور للتوكن، ولا معرّف يمكنك تمريره في جسم الطلب. هناك منتج — Devin — ويأتي النموذج كجزء منه. كما تعزّز نصوص Cognition نفسها هذا الاندماج: فمنشور الإطلاق مكتوب من وجهة نظر Devin، وجدول القياس المرجعي غير مشروح لأي شخص لم يقرأ بالفعل عمل الشركة السابق FrontierCode، وسطر الإتاحة يذكر Devin أربع مرات وCognition مرة واحدة — في سطر اسم الكاتب.

إذن، بصراحة: Cognition تصنع SWE-2. Cognition تصنع Devin. الاثنان ليسا الشيء نفسه، لكن لا يمكنك حاليًا الحصول على أحدهما دون الآخر. هذا أيضًا ليس حادث تسمية عابرًا. أطلقت Cognition سلسلة من نماذج هندسة البرمجيات تحت البادئة SWE — SWE-1.5، وSWE-1.6، وSWE-1.7 والآن SWE-2، مع نقطة تحقق SWE-1.6 Preview على طول الطريق — إلى جانب أدوات أضيق مثل SWE-grep وSWE-check. البادئة هي اختصار الشركة لهندسة البرمجيات، وهي تسبق كل نموذج في هذه الفقرة بنحو عام.

الاسم: نموذج، وليس معيارًا

هذا هو السبب الثاني الذي يجعل الباحثين يُسنِدون SWE-2 إلى المالك الخطأ، وهو يستحق فقرة خاصة به بدلًا من حاشية.

‏SWE-bench هو معيار تقييم. وهو تقييم مستقل يتولاه فريق SWE-bench، ويُستضاف على swebench.com، ويصدر في عدة إصدارات: المجموعة الأصلية المكوّنة من 2,294 حالة مستمدة من قضايا GitHub الحقيقية، إضافة إلى المجموعات الفرعية Verified وLite وMultilingual وMultimodal. ويُستخدم لتقييم وكلاء البرمجة عمومًا، ومنهم Devin — فقد نشرت Cognition تقريرًا تقنيًا عن Devin على SWE-bench في مارس 2024، ولا يزال منشورًا على مدونتها.

SWE-2 هو نموذج. وهو ليس إصدارًا من SWE-bench، وليس اختصارًا لأحدها. لا يوجد SWE-bench 2: فالعائلة المنشورة تضم SWE-bench وVerified وLite وMultilingual وMultimodal، وترقيم الإصدارات الموجود يخص المجموعات الفرعية للمقياس، وليس خلفًا مرقّمًا. المقياس المعتمد لدى Cognition لهذه النماذج يُسمّى FrontierCode، وهو أداة مختلفة تمامًا، وكما يوضح القسم التالي، تملكها Cognition.

إذا جئت إلى هنا متوقعًا جيلًا ثانيًا من تقييم SWE-bench، فهذا هو جوهر سوء الفهم بأكمله.

تاريخ الإصدار وكيفية توزيع SWE-2

يحمل منشور إعلان Cognition توقيعًا بتاريخ 10 سبتمبر 2026، كما تُعطي البيانات المنظمة الخاصة بالصفحة نفسها الطابع الزمني للنشر بالصيغة 2026-09-10. وهما متطابقان. كان SWE-2 متاحًا في Devin Desktop وDevin CLI في ذلك التاريخ، ثم تبعهما Devin Web وFusion.

ذلك هو سطح التوزيع، وهو سطح التوزيع بأكمله. لا توجد أوزان مفتوحة — لا شيء على Hugging Face من Cognition لهذا النموذج — ولا نقطة نهاية مستضافة لدى مورّد تقبل SWE-2. إذا كانت منصّة التشغيل من تطويرك الخاص، فإن SWE-2 ليس مكوّنًا يمكنك تثبيته فيها اليوم. وإذا كانت منصّة التشغيل لديك هي Devin، فإن SWE-2 أمامك بالفعل.

لمن يحتاج إلى نطاق النموذج الأساسي بدلاً من نطاق SWE-2، فإن Kimi K3 شيء منفصل وموثّق بشكل أفضل، ويُوجَّه على OrcaRouter باسم kimi/kimi-k3 — واجهة API واحدة لأكثر من 200 نموذج بسعر القائمة لدى المزود دون أي هامش. وهذا مهم هنا لسبب محدد: النموذج الأساسي الذي بدأت منه Cognition متاح بشكل مستقل، حتى وإن لم يكن النموذج المُدرَّب لاحقًا كذلك.

المظروف: ما توثّقه Cognition، وما لا توثّقه

ينبغي أن تكون الصفحة المرجعية صادقة بشأن شكل أدلتها الخاصة، وهنا تحديدًا تكون أدلة SWE-2 في أضعف حالاتها.

• جهد الاستدلال — ثلاثة مستويات موثّقة: متوسط، وعالٍ، وأقصى. تكتب Cognition أن هذه المستويات تتصرف بشكل مختلف بحكم التصميم: المستوى المتوسط يشرع في التنفيذ أبكر ويتولّى الأعمال البسيطة والمتوسطة، بينما يخطّط المستويان العالي والأقصى أكثر، ويستكشفان مزيدًا من قاعدة الشيفرة، وينفقان أكثر على التحقّق.
• التوزيع — Devin Desktop وDevin CLI عند الإطلاق، وDevin Web وFusion في طور الطرح التدريجي. لا واجهة برمجية، ولا أوزان، ولا مسار استضافة ذاتية.
• النموذج الأساسي — Kimi K3، الذي تصفه Cognition بأنه نموذج بـ2.8 تريليون معامل خضع بالفعل لتدريب معزّز مكثّف للبرمجة الوكيلية. وتمنح ورقة Kimi K3 ذلك الأساس نافذة سياق بمليون رمز ورؤية أصلية.
• نافذة السياق، والحد الأقصى للمخرجات، والأنماط، وعدد المعاملات بعد التدريب — لم تُنشر لـSWE-2. لا يقول إعلان Cognition شيئًا عن أيٍّ منها، ولا تسدّ أي صفحة أخرى من Cognition هذه الفجوة.

التمييز في ذلك الصف الأخير ليس تنطّعًا. نافذة المليون توكن لدى Kimi K3 حقيقة تخصّ Kimi K3. ولا تقول Cognition إن SWE-2 يرثها، والتدريب اللاحق وفق وصفة مختلفة هو بالضبط نوع التغيير الذي قد يغيّر ما يقبله النموذج. إذا كنت تحتاج إلى رقم نافذة السياق للتخطيط، فإن الرقم الذي يمكنك التحقق منه يخصّ النموذج الأساسي، وينبغي أن تعامل رقم SWE-2 على أنه غير معروف بدلًا من أن تفترض تطابقهما.

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

بطاقة الأسعار، بالعملة الوحيدة التي تسعّر بها Cognition

لا يوجد سعر لكل رمز (token) لـ SWE-2، لأنه لا توجد نقطة نهاية (endpoint) لـ SWE-2. ادعاء التكلفة الخاص بـ Cognition مُقوَّم بشكل مختلف: يقول إن SWE-2 يقع في حدود نقطة واحدة من Claude Fable 5.1 على FrontierCode 1.1 Main — 50.0% مقابل 50.9% — بينما يكون أرخص بنسبة 64%. اقرأ الوحدة بعناية. نسبة 64% هي متوسط الدولارات الأمريكية المُنفَقة لكل عملية تشغيل على FrontierCode، وهو رقم على مستوى المهمة يجمع النموذج، والـ harness، والـ scaffolding، وحزمة الخدمة الخاصة بـ Cognition في فاتورة واحدة. إنه ليس سعر رمز، ولا يمكن مقارنته بسعر رمز.

بطاقة الأسعار الموجودة هي بطاقة Devin. على صفحة أسعار Devin، كما قُرئت في 28 سبتمبر 2026: Free بسعر 0 دولار، Pro بسعر 20 دولاراً شهرياً، Max بسعر 200 دولار شهرياً، Teams بسعر 80 دولاراً شهرياً بالإضافة إلى 40 دولاراً لكل مقعد مطور كامل. يقع بند SWE-2 ضمن Pro ويحمل تاريخاً — "الاستخدام المجاني لـ SWE-2 — مجاني في Devin Desktop و CLI حتى 10 أكتوبر 2026." تلك نافذة ترويجية يتبقى منها حوالي أسبوعين، وهي الرقم الوحيد لـ SWE-2 في تلك الصفحة الذي يعتبر حساساً للوقت حقاً: لم تُذكر هناك تكلفة النموذج داخل Devin بعد 10 أكتوبر.

أرقام كفاءة Cognition تستحق الاقتباس بجانب ادعاء التكلفة، وهي مُبلَّغ عنها من المورّد مثل كل شيء آخر في هذه الصفحة. في FrontierCode 1.1 Main، يسجل SWE-2 بجهد متوسط أعلى من SWE-1.7 مع استخدام دورات أقل بنسبة 58% وبتكلفة أقل بنسبة 81% في المتوسط. ينخفض متوسط الخطوات لكل تشغيل من 127 في SWE-1.7 إلى 53 عند الجهد المتوسط، و80 عند المرتفع، و98 عند الأقصى، وينتقل الوسيط لأول تعديل حقيقي على الكود من الخطوة 48 إلى الخطوة 18.

الاختبارات المعيارية، مع أداة الاختبار المرفقة.

درجات هندسة البرمجيات حساسة على نحو غير معتاد للهيكل الذي أُنتجت فيه، لذا فإن رقمًا بلا أداة التقييم الخاصة به ليس رقمًا. وتعلن Cognition سياستها بشأن أداة التقييم في ملحق المنهجية الخاص بالإعلان: تُنشر النتائج من مصادر عامة حيث يوجد مصدر عام، وإلا فتُشغَّل على إطار التقييم الداخلي لـ Cognition باستخدام أداة التقييم التي طُوِّر كل نموذج أساسًا من أجلها — Claude Code لنماذج Anthropic، وCodex لنماذج OpenAI، وGrok Build لنماذج xAI، وDevin CLI للنماذج المفتوحة الأوزان. وبالنسبة إلى كل نموذج، تُبلغ Cognition عن أفضل درجة عبر إعدادات جهد الاستدلال.

يترتب على ذلك نتيجتان، وكلتاهما ينبغي ذكرهما في السياق نفسه مع الأرقام. أولًا، ليست كل الصفوف متكافئة للمقارنة المباشرة: فرقم Fable 5.1 الصادر في Claude Code ورقم Kimi K3 الصادر في Devin CLI هما قياسان لنظامَي وكيل مختلفين، لا لنموذجين في بيئة اختبار محايدة. ثانيًا، يعني «أفضل نتيجة عبر إعدادات الجهد» أن كل خلية تمثل أفضل حالة للنموذج، لا إعدادًا متماثلًا. إن مقارنة تُبقي الجهد ثابتًا ستبدو مختلفة، ولم تنشر Cognition واحدة منها.

جميع الصفوف الأربعة أدناه مُقدَّمة من البائع وغير مدققة.

• FrontierCode 1.1 Main — SWE-2 50.0%، Kimi K3 44.2%، Grok 4.6 48.0%، Claude Fable 5.1 50.9%، GPT-5.6 Sol 47.5%، GPT-6 Astra 53.3%، SWE-1.7 42.0%. هذا هو الصف الأبرز، وFrontierCode هو معيار Cognition الخاص — إذ تكتب Cognition المهام مع أكثر من 20 من مشرفي مشروعات مفتوحة المصدر، وتدير لوحة الصدارة، وتقيّم المشاركات. لا شيء من ذلك يجعل الأرقام خاطئة؛ بل كل ذلك ينتمي إلى الجملة التي تكرر فيها تلك الأرقام.
• DeepSWE 1.1 — SWE-2 73.0%، Kimi K3 68.5%، Grok 4.6 67.5%، Claude Fable 5.1 67.4%، GPT-5.6 Sol 72.7%، GPT-6 Astra 74.1%، SWE-1.7 37.7%. الصف الذي يتفوق فيه SWE-2 على نحو أكثر مصداقية على نموذج طليعي تفوقًا كاملًا.
• Terminal-Bench 2.1 — SWE-2 92.8%، Kimi K3 88.3%، Grok 4.6 88.4%، Claude Fable 5.1 91.4%، GPT-5.6 Sol 88.8%، GPT-6 Astra 89.9%، SWE-1.7 81.5%. الرقم الأفضل مظهرًا لدى SWE-2، لكن الإصدار الحالي من Terminal-Bench ليس 2.1.
• Terminal-Bench 4 — SWE-2 27.3%، Kimi K3 21.5%، Grok 4.6 20.3%، Claude Fable 5.1 55.8%، GPT-5.6 Sol 37.3%، GPT-6 Astra 57.9%، SWE-1.7 7.6%. الصف الأقل اقتباسًا، وهو الصف الذي يقع فيه النموذج متأخرًا بنحو 28 نقطة عن الطليعة.

تحتاج المقارنة أيضًا إلى قطعة سياق إضافية، لأنها تشرح من أين يأتي الشكل غير المعتاد للصف الحدودي. وتشير الحاشية التي أدرجتها Cognition بنفسها على مخططاتها إلى أن إعداد أقصى جهد لدى Fable 5.1 على FrontierCode 1.1 Main يسجّل 50.3% بتكلفة 12.83 دولارًا للمهمة الواحدة — أي أقل من إعداده المتوسط الخاص به عند 50.9% و3.28 دولار. جهدٌ أكبر اشترى نتيجةً أدنى بتكلفة تقارب أربعة أضعاف. هذا هو منحنى النموذج الحدودي وهو ينثني عائدًا على نفسه، وهو جزء من سبب كون 50.0% مقابل 50.9% أقرب مما يوحي به الرقمان وحدهما.

أرقام الموثوقية

قسم الموثوقية المنفصل الخاص بـ Cognition هو الجزء من الإصدار الذي لا علاقة له بلوحات الصدارة، ويُفيد بأن SWE-2 اجتاز 98.0% من موجّهات الدعاية والرقابة الخاصة به إجمالًا — 99.8% بالإنجليزية، و95.2% بالصينية المبسطة، و99.1% بالصينية التقليدية — وبأن تقييمه للثغرات المرتبط بالسياق لم يجد أي شرط تأطير يُنتج تغييرًا ذا دلالة إحصائية لأي نموذج خضع للاختبار. تلك أحكام Cognition، التي أُنتجت باستخدام مُحكِّم GPT-5.6 Luna على مجموعة مكوّنة من 145 سؤالًا، وهي مُبلَّغ عنها من المورّد بالمعنى نفسه الذي تُبلَّغ به المعايير المرجعية.

القراءة المستقلة: لا توجد واحدة بعد

حتى 28 سبتمبر 2026، لا يوجد لـ SWE-2 أي إدخال على Artificial Analysis. البحث عن الاسم في فهرس النماذج لا يُرجع شيئًا، وطلب مباشر لصفحة النموذج يعيد خطأ 404. لوحة النتائج الوحيدة التي تضم SWE-2 هي FrontierCode، التابعة لـ Cognition. وهذا يترك الإصدار بأرقام مُبلَّغ عنها من المورّد ولا شيء غيرها، وهو ليس انتقادًا للأرقام — بل هو بيان عن مدى ما يمكن للقارئ التحقق منه منها.

هناك أمران محدّدان كفيلان بحسم المسألة، ولا وجود لأي منهما اليوم. تشغيل طرف ثالث لـ SWE-2 على Terminal-Bench 4 سيحدد ما إذا كان هذا نموذجًا متاخمًا للحدود يصادف أنه رخيص أم نموذجًا سريعًا يصادف أنه يتصدر نسخة متقاعدة. وأي إعادة إنتاج مستقلة للفجوة في FrontierCode ستخبرك ما إذا كان فارق النقطة الواحدة أمام Fable 5.1 خاصيةً في النموذج أم خاصيةً في أداة القياس.

على خلاف نماذج Cognition نفسها، فإن Artificial Analysis تُدرج فعلاً Kimi K3 — وأرقام Kimi K3 من طرف ثالث، وهو ما يجعل النموذج الأساسي النصف الأفضل إسنادًا بالأدلة في هذه المنظومة. هذا التفاوت هو الشكل العملي لـ SWE-2 اليوم: فالتدريب اللاحق هو الجزء المثير للاهتمام وأقل الأجزاء قابلية للتحقق؛ أما الأساس فهو الجزء الموثّق والذي يمكنك فعلاً استدعاؤه.

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

استخدام SWE-2، وما ينبغي فعله في أثناء كونه غير مدقق

إذا كنت تدفع بالفعل مقابل Devin، فالقرار سهل ولا يعتمد على أي من التحفظات المذكورة أعلاه. إن SWE-2 موجود في منتجك، وتقول Cognition إنه يكلّف أقل لكل مهمة من النموذج الذي يحل محله، وأرقام الكفاءة — انخفاض عدد الجولات بنسبة 58%، وانخفاض متوسط التكلفة بنسبة 81%، وأول تعديل وسيط عند الخطوة 18 بدلاً من الخطوة 48 — تصف نموذجًا يُهدر قدرًا أقل من وقتك في العمل العادي. شغّله بمستوى جهد متوسط على الطرف البسيط من قائمة مهامك، وهو الموضع الذي يضع فيه تصميم Cognition الخاص بمستوى الجهد مكسب التكلفة.

إذا كنت تختار نموذجًا برمجيًا من خارج Devin، فالموقف الصادق هو أن SWE-2 ليس مرشحًا يمكنك تقييمه، لأنه لا يوجد شيء يمكن استدعاؤه. لا يوجد معرّف، ولا سعر لكل رمز، ولا نقطة نهاية. ما يمكنك تقييمه هو النموذج الأساسي.

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

يتم توجيه Kimi K3 عبر OrcaRouter، بسعر 3.00 دولارات لكل 1M رمز إدخال و15.00 دولارًا لكل 1M رمز إخراج دون أي هامش مضاف على سعر المزوّد، مع نافذة سياق تبلغ 1M رمز، واستدعاء أدوات أصلي، وإدخال صور، وتحكم من المستوى الأعلى في جهد الاستدلال. هذا هو النصف القابل للوصول من هذا الإصدار: القدرة التي أجرت Cognition تدريبًا لاحقًا انطلاقًا منها، متاحة عبر نقطة نهاية واحدة متوافقة مع OpenAI بدلًا من منتج وكيل لمورّد واحد. ولأنها منطقة غير مدققة في كلتا الحالتين، يمكنك وضع سلسلة احتياطية خلفه، حتى لا يصبح نموذج تجرّبه اعتمادًا في الإنتاج في اليوم الذي يخيّب فيه ظنك.

ما يخبرك به SWE-2، إذا قرأته كدليل بدلاً من صفحة منتج، أضيق وأكثر فائدة من العنوان الرئيسي: تمريرة تعلم معزز (RL) منفذة جيدًا فوق Kimi K3 رفعت المستوى بنحو خمس نقاط عبر أربعة معايير دون تغيير الشكل، واستغرقت 58% دورات أقل للقيام بذلك. هذه نتيجة حقيقية داخل Devin. وهي ليست بعد نتيجة أعاد إنتاجها أي شخص خارج Cognition، والمعيار الوحيد الذي يبدو أن SWE-2 يتفوق فيه على كل شيء هو المعيار الذي توقف المجال عن تقييمه.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا