Титульная карточка для Cognition SWE-2 с подзаголовком: «Kimi K3 после пост-тренировки, 50,0% на FrontierCode 1.1 Main при стоимости на 64% ниже», с тремя карточками: FrontierCode 1.1 Main — 50,0%, против Claude Fable 5.1 — 50,9%, и стоимость одного прогона — на 64% ниже.
Guides & Insights

Cognition SWE-2: программирование почти фронтирного уровня со скидкой 64% и ловушка бенчмарков под этим

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Cognition SWE-2 вышла на этой неделе с цифрой, рассчитанной на распространение: 50,0% на FrontierCode 1.1 Main, в пределах одного пункта от Claude Fable 5.1 с 50,9%, при затратах на 64% меньше. Модель — это результат посттренировки Kimi K3 от Moonshot AI, базовой модели с открытыми весами и 2,8 трлн параметров, и Cognition утверждает, что обучение с подкреплением добавило 5–6 пунктов в нескольких бенчмарках. Обе цифры — собственные данные вендора, и ни одна из них не была независимо воспроизведена. Однако вторая из них — это утверждение, которое должно изменить то, как вы читаете первую, потому что «плюс пять или шесть», как выясняется, описывает почти всё, что делает SWE-2, включая те места, где она сильно проигрывает.

Это не упрёк. Это самое полезное в этом релизе, и именно об этом почти никто из материалов о запуске не говорит вслух.

Что Cognition на самом деле выпустила

SWE-2 — это модель программирования от Devin, а не универсальная API-модель с прайс-листом. Она вышла доступной начиная с сегодняшнего дня в Devin Desktop и CLI, по словам самой Cognition, а развёртывание в Devin Web и Fusion уже идёт. Сторонние источники датируют анонс 10 сентября 2026 года; подпись под постом в блоге Cognition гласит 09.11.26. Так или иначе, ей всего несколько дней. Веса проприетарны, и опубликованного тарифа за токены нет. Если вы хотите использовать SWE-2, вы используете её внутри Devin.

База — Kimi K3, модель Mixture-of-Experts с 2,8 трлн параметров, из которых примерно 104 млрд активны на токен — примерно в три раза больше базы SWE-1.7. Cognition отмечает, что K3 уже прошла интенсивное RL-обучение для агентного программирования ещё до того, как попала к ним, и что её собственное RL «всё ещё находит существенный запас для роста». Это отражает схему SWE-1.7, которая также прошла постобучение на базе Kimi.

Вот деталь, которая важнее любого отдельного результата в бенчмарке: FrontierCode — это бенчмарк Cognition. Компания сама пишет задания — с участием более 20 мейнтейнеров открытых проектов, более 40 часов на каждое задание, причём каждый мейнтейнер сам определяет, что значит «можно смержить» в его собственном репозитории, — ведёт таблицу лидеров и оценивает присланные решения. Это серьёзная работа по проектированию оценки, и в то же время это внутренний инструмент. Cognition сообщает каждой модели лучший результат среди всех настроек уровня усилий рассуждения, а согласно её собственному приложению с методологией сравнительные модели с открытыми весами, включая Kimi K3, запускались внутри Devin CLI от Cognition. Ничего из этого не делает цифры неверными. Но всё это должно звучать в том предложении, где вы их повторяете.

Two-column scoreboard headed 'Cognition SWE-2 vs Claude Fable 5.1'. Left column Cognition SWE-2: FrontierCode 1.1 Main 50.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%, Cost per rollout 64% lower, Base model Kimi K3 2.8T, Independent eval none yet. Right column Claude Fable 5.1: FrontierCode 1.1 Main 50.9%, Terminal-Bench 2.1 91.4%, Terminal-Bench 4 55.8%, Cost per rollout baseline, Base model proprietary, Independent eval third-party scored.

Честно читая таблицу бенчмарков

Четыре бенчмарка, все заявлены вендорами. Вот что на самом деле говорит каждый из них — по одной строке на каждый.

• FrontierCode 1.1 Main — SWE-2 50,0%, против Kimi K3 44,2%, Grok 4.6 48,0%, GPT-5.6 Sol 47,5%, Claude Fable 5.1 50,9%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. В пределах одного пункта от фронтира, впереди всего остального в таблице.

• DeepSWE 1.1 — SWE-2 73,0 %, опережая Claude Fable 5.1 с 67,4 % и Grok 4.6 с 67,5 %, но уступая GPT-6 Astra с 74,1 %. Это та строка, где SWE-2 наиболее убедительно напрямую превосходит фронтирную модель.

• Terminal-Bench 2.1 — SWE-2 92,8%, лучший результат в таблице Cognition, опережая Claude Fable 5.1 с 91,4% и GPT-6 Astra с 89,9%. Именно это число фигурирует в большинстве заголовков о запуске.

• Terminal-Bench 4 — SWE-2 27,3%, против Claude Fable 5.1 с 55,8% и GPT-6 Astra с 57,9%. Разрыв примерно в 28 пунктов, и строка, которую цитируют реже всего.

Очевидное возражение состоит в том, что на Terminal-Bench 4 проваливаются все — это более сложный преемник с более длинным горизонтом, так что падение результатов неудивительно. Интересно здесь насколько, и падение непропорционально. При переходе с Terminal-Bench 2.1 на 4 Claude Fable 5.1 теряет около 35,6 балла, а GPT-6 Astra — около 32,0. SWE-2 теряет около 65,5, а её база Kimi K3 — около 66,8. Так что в агентной работе с длинным горизонтом SWE-2 не просто находится ниже фронтирных моделей — она деградирует примерно вдвое быстрее них, когда задача затягивается.

Стоит прямо сказать, является ли Terminal-Bench 4 «живой» версией: это текущая редакция, а 2.1 — заменённая. Строка, где лидирует SWE-2, относится к выведенному из эксплуатации бенчмарку. Строка, где он отстаёт, относится к текущему. Оба факта верны, и публикации о запуске обычно выбирали один из них.

«Kimi K3 плюс пять» — эвристика, предсказывающая оценки, которые никто не публиковал

Поставьте четыре бенчмарка рядом с собственной базовой моделью SWE-2 — и вырисовывается нечто почти механическое. В сравнении с Kimi K3 SWE-2 прибавляет 5,8 балла на FrontierCode 1.1 Main, 4,5 — на DeepSWE 1.1, 4,5 — на Terminal-Bench 2.1 и 5,8 — на Terminal-Bench 4.

Четыре бенчмарка, четыре разрыва — все между 4,5 и 5,8. Дообучение сместило уровень, а не форму. Там, где K3 силён, SWE-2 силён, плюс примерно пять. Там, где K3 слаб — Terminal-Bench 4 тому явный пример, — SWE-2 слаб, плюс примерно пять.

Это даёт вам рабочий прогноз для любой задачи, которую Cognition не проверяла в бенчмарках, а таких большинство. Посмотрите, как Kimi K3 показывает себя на вашей рабочей нагрузке, добавьте пять пунктов — и вы получите более точную оценку SWE-2, чем дадут любые цифры из заголовков. Это также объясняет фактический тезис релиза: Cognition не утверждает, что превзошла фронтир. Она утверждает, что сдвинула всю кривую стоимость-производительность наружу, оставаясь на фиксированном расстоянии позади лучшей модели по той оси, которую вы измеряете.

64% — это реально, но это нельзя купить.

«На 64% дешевле, чем Claude Fable 5.1» — это верное утверждение о конкретном измерении, и это измерение — средние расходы в долларах США на один прогон на FrontierCode, а не цена за токен. Для SWE-2 нет ставки за токен, потому что не существует API SWE-2. Утверждение о стоимости описывает, во сколько обходится задача внутри Devin, где модель, обвязка, скаффолдинг и серверный стек Cognition объединяются в один счёт.

Это различие не пустой звук. Нельзя сравнивать стоимость SWE-2 с ценой за токен от другого поставщика: это не одна и та же единица измерения. И вы не можете перенести SWE-2 куда-то ещё: проприетарные веса, один поставщик, один агентный продукт. Цифра «до 70% ниже по стоимости», встречающаяся в некоторых публикациях, — это верхняя граница диапазона, который Cognition приводит по разным бенчмаркам; показатель FrontierCode 1.1 Main — 64%.

Показатели эффективности, если уж на то пошло, — это более практичная часть истории, и они тоже основаны на данных вендора. SWE-2 при среднем уровне усилия превосходит результат SWE-1.7 в FrontierCode, используя при этом на 58% меньше ходов и сто́я в среднем на 81% меньше. Среднее число шагов на запуск снижается с 127 у SWE-1.7 до 53 при среднем усилии (80 при высоком, 98 при максимальном), а медианный шаг первой реальной правки кода сдвигается с 48-го на 18-й. Это прямой ответ на жалобу, что SWE-1.7 чрезмерно исследовал простые задачи, и это тот вид улучшения, который отражается в вашем счёте задолго до того, как это сделает разрыв в один пункт в бенчмарке.

Screenshot of Cognition's official SWE-2 announcement blog post, headed 'Introducing SWE-2: Pushing the Pareto Frontier', bylined 09.11.26, showing the opening claim of 50.0% on FrontierCode 1.1 Main within one point of Fable 5.1 while being 64% cheaper, and a cost-versus-solve-rate Pareto chart labelling the medium, high and max effort levels.

Трюк с обучением — это и есть настоящая новость.

Если убрать позиционирование в таблице лидеров, здесь есть одна действительно новая инженерная идея — именно поэтому релиз стоит прочитать, даже если вы никогда не откроете Devin.

Cognition обучила все три уровня усилий рассуждения — средний, высокий и максимальный — в ходе единого запуска RL. Механизм — это линейный штраф за стоимость для каждого уровня усилий, причём каждый из них настроен так, чтобы соответствовать наклону собственной кривой Парето «стоимость–производительность» базовой модели в соответствующей точке. Самое интересное — аргумент Cognition о том, почему штраф должен быть линейным: только линейный штраф сохраняет целевую функцию обучения зависящей исключительно от средней стоимости и доли решённых задач, а не от формы распределения.

Обычный подход обучает уровни усилий отдельно или прикручивает более дешёвый чекпоинт после. Обучение их вместе в рамках одного запуска — это то, что позволяет компании заявить, что она продвинула весь фронтир, а не одну точку на нём. Вспомогательные изменения: базовая линия вознаграждения, взвешенная по длине, утроение числа сред RL, надстройки для следования инструкциям и маховик, который использует более ранние чекпоинты SWE-2, чтобы укрепить верификаторы против взлома вознаграждения. На стороне обслуживания: ядра NVFP4 и FP8 с обучением с учётом квантования, черновая модель спекулятивного декодирования DSpark, переобученная на 15% более длинные длины принятия, и задержка предзаполнения, дающая 10–20% к пропускной способности на GPU ценой ухудшения времени до первого токена.

Если вы занимаетесь постобучением, этот рецепт — та переносимая часть этого релиза. Если нет, вывод проще: причина, по которой SWE-2 дешёв, не в том, что это меньшая модель. А в том, что стоимость его работы была заложена в функцию вознаграждения.

Если вам нужны возможности Kimi K3 за пределами Devin

SWE-2 отсутствует на OrcaRouter и не будет — проприетарные веса, нет API, распространение только через Devin. С его базовой моделью ситуация иная. Kimi K3 маршрутизируется через OrcaRouter как kimi/kimi-k3, по цене $3.00 за 1M входных токенов и $15.00 за 1M выходных токенов без наценки сверх тарифа провайдера, контекстное окно на 1M токенов, нативный вызов инструментов, ввод изображений, а глубина рассуждений управляется через параметр верхнего уровня reasoning_effort вместо настроек сэмплирования.

Вот честная версия практического вывода из этого релиза. SWE-2 показывает, как на верхней границе своего диапазона выглядит хорошо выполненный RL-прогон поверх K3 — настоящий прирост в 4,5–5,8 пункта плюс существенный выигрыш в эффективности, но за реальную цену. Чего он не даёт вам — так это модели, которую можно вызвать. Если вы хотите, чтобы эта базовая возможность была направлена на ваш собственный код, ваш собственный тестовый стенд или ваш собственный пайплайн, K3 — это та часть этого стека, до которой вы действительно можете добраться, и добраться до неё можно через один OpenAI-совместимый эндпоинт.

Это также более безопасная половина ставки, пока цифры не проверены независимо. Бенчмарки SWE-2 принадлежат самой Cognition, и никто за пределами компании их не воспроизвёл. Именно на бенчмарках Kimi K3 фактически и строится сравнение — и если вы маршрутизируете через OrcaRouter, вы можете поставить за ним цепочку резервных моделей, чтобы модель, которую вы тестируете, не стала производственной зависимостью в тот день, когда она вас разочарует.

Screenshot of the OrcaRouter model page for Kimi K3, showing model ID kimi/kimi-k3, input $3.00 per 1M tokens, output $15.00 per 1M tokens, cache read $0.300, 1M-token context, text and image input, p50 time-to-first-token of 9.85 seconds, and 2,739.4M tokens of traffic over 7 days.

Кто должен действовать, и что могло бы это урегулировать?

Если вы уже платите за Devin, SWE-2 — это однозначно хорошая новость: он внедряется в ваш продукт, каждая задача обходится дешевле, чем у того, что он заменяет, а показатели эффективности говорят о том, что он будет тратить меньше шагов на простую работу. Сначала попробуйте его на самых простых задачах в вашей очереди — продуманная система уровней усилий устроена так, что именно на среднем уровне достигается выигрыш по стоимости.

Если вы выбираете модель для программирования со стороны, дождитесь независимой оценки. Пока её нет: у Artificial Analysis нет записи о SWE-2, а таблица лидеров FrontierCode — это собственный инструмент Cognition. Три вещи могли бы решить вопрос. Сторонний прогон SWE-2 на Terminal-Bench 4 — это та строка, которая решает, является ли эта модель близкой к фронтиру или просто быстрой. Любое независимое воспроизведение разрыва FrontierCode. И цена за токен, для чего Cognition пришлось бы продавать модель вне Devin — единственное изменение, которое сделало бы 64% сопоставимыми с чем-либо ещё, что вам предлагают.

А до тех пор честная оценка — та, которую уже даёт вам разрыв с базовой моделью. SWE-2 — это Kimi K3 плюс пять баллов, ценой, которую Cognition заложила в функцию вознаграждения. Это реальное достижение в обучении и по-настоящему выгодное предложение в составе Devin. Это пока не фронтирная модель, а единственный бенчмарк, где она, похоже, обходит всё, — это тот, который перестал считаться.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно