بطاقة عنوان لـ Cognition SWE-2 تعرض عنواناً فرعياً نصه «Kimi K3 بعد التدريب، 50.0% على FrontierCode 1.1 Main بتكلفة أقل بنسبة 64%»، مع ثلاث بطاقات: FrontierCode 1.1 Main 50.0%، مقابل Claude Fable 5.1 50.9%، وتكلفة كل تشغيل أقل بنسبة 64%.
Guides & Insights

Cognition SWE-2: برمجة قريبة من الطليعة بخصم 64%، وفخ المعيار الكامن تحته

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

طرح Cognition SWE-2 هذا الأسبوع برقم صُمم لينتشر: 50.0% على FrontierCode 1.1 Main، ضمن نقطة واحدة من Claude Fable 5.1 عند 50.9%، وبتكلفة أقل بنسبة 64%. النموذج هو نسخة مُدرَّبة لاحقًا من Kimi K3 التابع لـ Moonshot AI — القاعدة مفتوحة الأوزان البالغة 2.8 تريليون معامل — ويقول Cognition إن التعلم المعزز الخاص به أضاف 5–6 نقاط عبر عدة معايير قياس. كلا الرقمين من عند المورّد نفسه، ولم يُعَد إنتاجهما بشكل مستقل. غير أن الرقم الثاني هو الادعاء الذي ينبغي أن يغيّر طريقة قراءتك للرقم الأول، لأن «زائد خمسة أو ستة» يتبين أنه يصف تقريبًا كل ما يفعله SWE-2، بما في ذلك المواضع التي يخفق فيها إخفاقًا بالغًا.

هذا ليس انتقادًا. إنه أكثر شيء مفيد في هذا الإصدار، وهو الجزء الذي لا يكاد أيّ من تغطية الإطلاق يقوله بصوت عالٍ.

ما الذي شحنته Cognition فعليًا

SWE-2 هو نموذج البرمجة الخاص بـ Devin، وليس نموذج API عام الأغراض مصحوباً بقائمة أسعار. وقد طُرح متاحاً بدءاً من اليوم في Devin Desktop وCLI، على حد تعبير Cognition نفسها، مع بدء طرحه تدريجياً على Devin Web وFusion. وتؤرّخ تغطية من جهات خارجية الإعلان في 10 سبتمبر 2026؛ بينما يحمل التوقيع على منشور مدونة Cognition نفسها تاريخ 09.11.26. في كلتا الحالتين، لم يمضِ على ذلك سوى بضعة أيام. الأوزان مملوكة ولا توجد بطاقة أسعار منشورة لكل توكن. إذا أردت استخدام SWE-2، فاستخدمه داخل Devin.

الأساس هو Kimi K3، نموذج مزيج الخبراء بـ 2.8 تريليون معامل مع حوالي 104 مليار معامل نشط لكل رمز — أي حوالي ثلاثة أضعاف حجم أساس SWE-1.7. تشير Cognition إلى أن K3 كان قد تم تدريبه بشكل مكثف بالتعلم المعزز للبرمجة الوكيلية قبل أن يصل إلى هناك، وأن التعلم المعزز الخاص به "لا يزال يجد هامشًا كبيرًا". وهذا يعكس النمط من SWE-1.7، الذي تم تدريبه لاحقًا على قاعدة Kimi أيضًا.

إليك التفصيل الذي يهم أكثر من أي نتيجة معيارية منفردة: FrontierCode هو المعيار الذي أعدّته Cognition. الشركة تكتب المهام — بمشاركة أكثر من 20 مشرفًا على مشاريع مفتوحة المصدر، وأكثر من 40 ساعة لكل مهمة، حيث يحدد كل مشرف ما يعنيه "قابل للدمج" في مستودعه الخاص — وتدير لوحة المتصدرين، وتقيّم المشاركات. إنه عمل جاد في تصميم التقييم، وهو أيضًا أداة داخلية. تُبلّغ Cognition عن أفضل نتيجة لكل نموذج عبر إعدادات جهد الاستدلال، ووفق ملحق المنهجية الخاص بها، شُغّلت نماذج المقارنة المفتوحة الأوزان، بما فيها Kimi K3، داخل Devin CLI التابع لـ Cognition. لا شيء من ذلك يجعل الأرقام خاطئة. كل ذلك ينتمي إلى الجملة التي تعيد فيها ذكرها.

Two-column scoreboard headed 'Cognition SWE-2 vs Claude Fable 5.1'. Left column Cognition SWE-2: FrontierCode 1.1 Main 50.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%, Cost per rollout 64% lower, Base model Kimi K3 2.8T, Independent eval none yet. Right column Claude Fable 5.1: FrontierCode 1.1 Main 50.9%, Terminal-Bench 2.1 91.4%, Terminal-Bench 4 55.8%, Cost per rollout baseline, Base model proprietary, Independent eval third-party scored.

قراءة جدول المعايير بصدق

أربعة معايير قياس، جميعها مُبلَّغ عنها من الجهات المورّدة. إليك ما يقوله كل واحد منها في الواقع، سطر واحد لكل صف.

• FrontierCode 1.1 Main — SWE-2 50.0%، مقابل Kimi K3 44.2%، وGrok 4.6 48.0%، وGPT-5.6 Sol 47.5%، وClaude Fable 5.1 50.9%، وGPT-6 Astra 53.3%، وSWE-1.7 42.0%. بفارق نقطة واحدة عن الطليعة، ومتقدّم على كل ما عداه في الجدول.

• DeepSWE 1.1 — SWE-2 بنسبة 73.0%، متقدم على Claude Fable 5.1 عند 67.4% وGrok 4.6 عند 67.5%، ومتأخر عن GPT-6 Astra عند 74.1%. هذا هو الصف الذي يتفوق فيه SWE-2 بشكل أكثر موثوقية على نموذج رائد بشكل قاطع.

• Terminal-Bench 2.1 — SWE-2 بنسبة 92.8%، وهي أعلى نتيجة في جدول Cognition، متقدمة على Claude Fable 5.1 عند 91.4% وGPT-6 Astra عند 89.9%. هذا هو الرقم الوارد في معظم عناوين الإطلاق.

• Terminal-Bench 4 — SWE-2 بنسبة 27.3%، مقابل Claude Fable 5.1 بنسبة 55.8% وGPT-6 Astra بنسبة 57.9%. فجوة تبلغ نحو 28 نقطة، وهي الصف الذي يُقتبس أقل من غيره.

الاعتراض الواضح هو أن أداء الجميع ينخفض على Terminal-Bench 4 — فهو خليفة أصعب وأطول أفقًا، لذا فمن الطبيعي أن تنخفض الدرجات. الجزء المثير هو إلى أي مدى، والانخفاض ليس متناسبًا. عند الانتقال من Terminal-Bench 2.1 إلى 4، يخسر Claude Fable 5.1 نحو 35.6 نقطة، ويخسر GPT-6 Astra نحو 32.0. ويخسر SWE-2 نحو 65.5، ويخسر نموذجه الأساسي Kimi K3 نحو 66.8. لذلك، في العمل الوكيلي الطويل الأفق، لا يقع SWE-2 فحسب أدنى من النماذج الرائدة — بل يتدهور بسرعة تعادل ضعف سرعتها تقريبًا عندما تطول المهمة.

ما إذا كانت Terminal-Bench 4 هي النسخة «الحية» أمر يستحق القول بوضوح: فهي النسخة الحالية، و2.1 هي النسخة التي استُبدلت. الصف الذي يتصدر فيه SWE-2 هو المعيار المتقاعد. والصف الذي يتخلف فيه هو المعيار الحالي. الحقيقتان صحيحتان، وكانت تغطية الإطلاق تميل إلى اختيار واحدة منهما.

«Kimi K3 زائد خمسة» — القاعدة الاستدلالية التي تتنبأ بالدرجات التي لم ينشرها أحد

ضع المعايير الأربعة في مقارنة مباشرة مع النموذج الأساسي الخاص بـ SWE-2 نفسه، فيظهر شيء يكاد يكون آليًا. مقابل Kimi K3، يكسب SWE-2 5.8 نقاط على FrontierCode 1.1 Main، و4.5 على DeepSWE 1.1، و4.5 على Terminal-Bench 2.1، و5.8 على Terminal-Bench 4.

أربعة اختبارات معيارية، وأربع فجوات، جميعها بين 4.5 و5.8. غيّر التدريب اللاحق المستوى، لا الشكل. حيثما كان K3 قويًا، كان SWE-2 قويًا مضافًا إليه نحو خمسة. وحيثما كان K3 ضعيفًا — مع كون Terminal-Bench 4 الحالة الواضحة — كان SWE-2 ضعيفًا مضافًا إليه نحو خمسة.

هذا يمنحك توقعًا عمليًا لأي مهمة لم تقم Cognition بقياسها، وهي معظم المهام. ابحث عن كيفية أداء Kimi K3 على عبء العمل الخاص بك، أضف خمس نقاط، وستحصل على تقدير أفضل لـ SWE-2 مما ستمنحك أي من الأرقام الرئيسية. كما يشرح الأطروحة الفعلية للإصدار: Cognition لا تدّعي أنها تغلبت على الحدود. إنها تدّعي أنها حرّكت منحنى التكلفة والأداء بالكامل نحو الخارج مع بقائها على مسافة ثابتة خلف أفضل نموذج على أي محور تقيسه.

الـ64% حقيقية، لكن لا يمكنك التسوق بها

«أرخص بنسبة 64% من Claude Fable 5.1» عبارة صحيحة عن قياس محدّد بعينه — والقياس هو متوسط الدولارات الأمريكية المنفَقة لكل عملية تشغيل على FrontierCode، وليس سعر الرموز (tokens). فلا يوجد سعر لكل رمز في SWE-2 لأنه لا توجد واجهة برمجية (API) لـ SWE-2. ووصف التكلفة يبيّن ما تكلّفه المهمة داخل Devin، الذي يجمع النموذج وأداة التشغيل والبنية المساندة ومنظومة الاستضافة لدى Cognition في فاتورة واحدة.

هذا التمييز له أثر حقيقي. لا يمكنك مقارنة تكلفة SWE-2 بسعر توكن من مورّد آخر، لأنهما ليسا الوحدة نفسها. ولا يمكنك أخذ SWE-2 إلى مكان آخر: أوزان مملوكة، مورّد واحد، منتج وكيل واحد. رقم "خفض التكلفة بنسبة تصل إلى 70%" في بعض التغطيات هو الحد الأعلى للنطاق الذي تذكره Cognition عبر المعايير المرجعية؛ ورقم FrontierCode 1.1 Main هو 64%.

أرقام الكفاءة هي، إن جاز القول، القصة الأكثر عملية، وهي أيضاً مُبلَّغ عنها من المورّد. يتفوق SWE-2 عند الجهد المتوسط على نتيجة FrontierCode لدى SWE-1.7، مع استخدام جولات أقل بنسبة 58% وتكلفة أقل بنسبة 81% في المتوسط. وينخفض متوسط الخطوات لكل تشغيل من 127 في SWE-1.7 إلى 53 عند الجهد المتوسط (80 عند المرتفع، و98 عند الأقصى)، وينتقل الوسيط لأول تعديل حقيقي على الشيفرة من الخطوة 48 إلى الخطوة 18. وهذا رد مباشر على الشكوى من أن SWE-1.7 بالغ في استكشاف المهام البسيطة، وهو نوع التحسين الذي يظهر في فاتورتك قبل وقت طويل من ظهور فجوة نقطة واحدة في أي اختبار معياري.

Screenshot of Cognition's official SWE-2 announcement blog post, headed 'Introducing SWE-2: Pushing the Pareto Frontier', bylined 09.11.26, showing the opening claim of 50.0% on FrontierCode 1.1 Main within one point of Fable 5.1 while being 64% cheaper, and a cost-versus-solve-rate Pareto chart labelling the medium, high and max effort levels.

الحيلة التدريبية هي الخبر الحقيقي

إذا أزلنا جانب التموقع في لوحة الصدارة، فسيتبقى هنا قطعة هندسية واحدة جديدة حقًا، ولهذا يستحق هذا الإصدار القراءة حتى لو لم تفتح Devin أبدًا.

درّبت Cognition جميع مستويات جهد الاستدلال الثلاثة — المتوسط والعالي والأقصى — في جولة تعلم معزز واحدة. الآلية هي عقوبة تكلفة خطية لكل مستوى جهد، كل واحدة منها مضبوطة لتطابق ميل منحنى باريتو الخاص بالنموذج الأساسي نفسه للتكلفة والأداء عند تلك النقطة. وحجة Cognition حول سبب وجوب أن تكون العقوبة خطية هي الجزء المثير للاهتمام: فقط العقوبة الخطية تُبقي هدف التدريب دالةً لمتوسط التكلفة ومعدل الحل وحدهما، بدلًا من شيء يعتمد على شكل التوزيع.

النهج المعتاد يدرّب مستويات الجهد منفصلة، أو يربط لاحقًا نقطة تحقق أرخص. تدريبها معًا داخل تشغيل واحد هو ما يتيح للشركة أن تدّعي أنها دفعت الحدود كاملة إلى الأمام، لا نقطة واحدة عليها. تغييرات داعمة: خط أساس للمكافأة مرجّح بالطول، ومضاعفة عدد بيئات التعلم المعزز ثلاث مرات، وطبقات متابعة التعليمات، ودولاب يستخدم نقاط تحقق SWE-2 الأقدم لتحصين المدققين ضد التلاعب بالمكافأة. وعلى جانب الخدمة، نوى NVFP4 وFP8 مع تدريب واعٍ بالتكميم، ونموذج مسودة DSpark للفك التخميني أُعيد تدريبه لأطوال قبول أطول بنسبة 15%، ومؤخّر تعبئة مسبقة بقيمة 10–20% من الإنتاجية لكل GPU على حساب زمن وصول أسوأ إلى أول رمز.

إذا نفّذت التدريب اللاحق، فإن تلك الوصفة هي الجزء القابل للنقل من هذا الإصدار. وإن لم تفعل، فالخلاصة أبسط: سبب كون SWE-2 رخيصًا ليس أنه نموذج أصغر، بل أن تكلفة تشغيله كُتبت داخل دالة المكافأة.

إذا كنت تريد إمكانات Kimi K3 خارج Devin

إنّ SWE-2 ليس متاحًا على OrcaRouter، ولن يكون كذلك — أوزان احتكارية، ولا واجهة برمجية، وتوزيع حصري عبر Devin. أما نموذجه الأساسي فهو حالة مختلفة. يتم توجيه Kimi K3 على OrcaRouter باسم kimi/kimi-k3، بسعر 3.00 دولارات لكل مليون رمز إدخال و15.00 دولارًا لكل مليون رمز إخراج دون أي هامش مُضاف فوق سعر المزوّد، مع نافذة سياق تبلغ مليون رمز، واستدعاء أدوات أصلي، وإدخال صور، وعمق تفكير يُتحكَّم فيه عبر معامل reasoning_effort على المستوى الأعلى بدلًا من إعدادات أخذ العينات.

هذه هي النسخة الصادقة من الخلاصة العملية لهذا الإصدار. يوضح لك SWE-2 كيف تبدو تمريرة RL مُنفَّذة بإتقان فوق K3 عند الحد الأعلى من نطاقها — ارتفاع حقيقي يتراوح بين 4.5 و5.8 نقاط، إلى جانب مكاسب كبيرة في الكفاءة، مقابل تكلفة حقيقية. لكن ما لا يمنحك إياه هو نموذج يمكنك استدعاؤه. إذا أردت توجيه القدرة الكامنة نحو شيفرتك الخاصة، أو أداة الاختبار الخاصة بك، أو خط الأنابيب الخاص بك، فإن K3 هو الجزء من هذه المنظومة الذي يمكنك الوصول إليه فعلاً، ويمكن الوصول إليه عبر نقطة نهاية واحدة متوافقة مع OpenAI.

وهو أيضًا الجانب الأكثر أمانًا من الرهان ما دامت الأرقام غير مدققة. فمعايير SWE-2 هي معايير Cognition الخاصة، ولم يُعِد إنتاجها أحد من خارج الشركة. أما معايير Kimi K3 فهي التي تستند إليها المقارنة فعليًا — وإذا وجّهت الطلبات عبر OrcaRouter يمكنكوضع سلسلة احتياطية خلفه، حتى لا يصبح نموذج تجرّبه تبعية إنتاجية في اليوم الذي يخيّب فيه ظنّك.

Screenshot of the OrcaRouter model page for Kimi K3, showing model ID kimi/kimi-k3, input $3.00 per 1M tokens, output $15.00 per 1M tokens, cache read $0.300, 1M-token context, text and image input, p50 time-to-first-token of 9.85 seconds, and 2,739.4M tokens of traffic over 7 days.

من ينبغي أن يتصرف، وما الذي سيحسم الأمر

إذا كنت تدفع بالفعل مقابل Devin، فإن SWE-2 خبر جيد بوضوح: فهو يُطرح في منتجك، وهو أرخص لكل مهمة مما يستبدله، وتشير أرقام الكفاءة إلى أنه سيهدر جولات أقل في العمل السهل. جرّبه أولًا على الطرف البسيط من قائمة مهامك — فتصميم مستوى الجهد يعني أن المستوى المتوسط هو حيث يكمن مكسب التكلفة.

إذا كنت تختار نموذج برمجة من الخارج، فانتظر تقييمًا مستقلًا. لا يوجد أي تقييم مستقل بعد: فلا يضم Artificial Analysis أي إدخال لـ SWE-2، ولوحة صدارة FrontierCode هي أداة Cognition الخاصة. ثلاثة أمور كفيلة بحسم الأمر. تشغيل من طرف ثالث لـ SWE-2 على Terminal-Bench 4، وهو الصف الذي يحدد ما إذا كان هذا نموذجًا قريبًا من الطليعة أم نموذجًا سريعًا. وأي إعادة إنتاج مستقلة لفجوة FrontierCode. وسعر لكل توكن، وهو ما سيتطلب أن تبيع Cognition النموذج خارج Devin — التغيير الوحيد الذي سيجعل نسبة 64% قابلة للمقارنة بأي شيء آخر يُعرض عليك.

حتى ذلك الحين، فإن الخلاصة المنصفة هي تلك التي تمنحك إياها فجوة النموذج الأساسي بالفعل. إن SWE-2 هو Kimi K3 مضافًا إليه خمس نقاط، بتكلفة صمّمتها Cognition في دالة المكافأة. وهذا إنجاز حقيقي في التدريب، وصفقة جيدة حقًا داخل Devin. لكنه ليس بعد نموذجًا حدوديًا، والمعيار الوحيد الذي يبدو أنه يتفوق فيه على كل شيء هو ذاك الذي لم يعد يُحتسب.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا