Титульная карточка для Cognition SWE-2 с заголовком «Cognition SWE-2», подзаголовком «Модель для программирования от Cognition, дообученная на основе Kimi K3, работающая внутри Devin», и тремя карточками ниже с надписями: «Создано Cognition», «Базовая модель Kimi K3 2.8T» и «Работает в Devin Desktop и CLI».
Guides & Insights

Cognition SWE-2: кто его создаёт, в каком харнессе он работает и что на самом деле говорят цифры

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Cognition SWE-2 — это модель для программирования, созданная Cognition, компанией, стоящей за Devin, и она работает внутри Devin, а не через API модели: в собственном анонсе Cognition говорится, что SWE-2 сначала доступна в Devin Desktop и Devin CLI, с последующим развёртыванием в Devin Web и Fusion. Она дообучена на основе Kimi K3 — модели Moonshot AI с 2,8 триллиона параметров. Это и есть исчерпывающий ответ на вопрос, который большинство людей на самом деле задают, попадая сюда, и его стоит привести прежде всего, потому что заметная доля поисковых запросов, ведущих на эту страницу, добавляет четвёртое слово — Devin — и приписывает модель Devin, а не Cognition. Devin — это агент, который продаёт Cognition. SWE-2 — это модель, которую Cognition обучила для работы внутри него.

Эта страница — справочная, а не материал о запуске. SWE-2 вышел 10 сентября 2026 года, а это было больше недели назад; дата здесь для того, чтобы зафиксировать модель во времени, а не сообщить о событии. Далее — что задокументировано, кем это задокументировано и что ещё никто не проверял.

Кто производит SWE-2 и почему атрибуция постоянно смещается

Путаница небезосновательна. Cognition не продаёт SWE-2 так, как лаборатория продаёт API-модель. Нет карточки модели с контекстным окном, нет опубликованной цены за токены, нет идентификатора, который можно передать в теле запроса. Есть продукт — Devin — и модель поставляется как его часть. Собственный текст Cognition лишь закрепляет это смешение: пост о запуске написан от лица Devin, таблица бенчмарков остаётся без объяснений для всех, кто ещё не читал более раннюю работу компании FrontierCode, а в строке о доступности Devin упоминается четыре раза, а Cognition — один раз, в подписи автора.

Итак, прямо: Cognition создаёт SWE-2. Cognition создаёт Devin. Это не одно и то же, но сейчас нельзя иметь одно без другого. И это тоже не разовая случайность в названии. Cognition выпустила ряд моделей для программной инженерии под префиксом SWE — SWE-1.5, SWE-1.6, SWE-1.7 и теперь SWE-2, а по пути ещё и промежуточный чекпойнт SWE-1.6 Preview — наряду с более узкими инструментами вроде SWE-grep и SWE-check. Этот префикс — принятое в компании сокращение для программной инженерии, и он примерно на год старше каждой модели, упомянутой в этом абзаце.

Название: модель, а не бенчмарк

Это вторая причина, по которой поисковые системы приписывают SWE-2 не тому владельцу, и она заслуживает отдельного абзаца, а не сноски.

SWE-bench — это бенчмарк. Это независимая оценка, поддерживаемая командой SWE-bench и размещённая на swebench.com; она выпускается в нескольких версиях: исходный набор из 2 294 экземпляров, составленный на основе реальных issue на GitHub, а также подмножества Verified, Lite, Multilingual и Multimodal. Он используется для оценки coding-агентов в целом, включая Devin, — Cognition опубликовала технический отчёт о Devin на SWE-bench ещё в марте 2024 года, который до сих пор доступен в её блоге.

SWE-2 — это модель. Это не редакция SWE-bench и не сокращение для неё. SWE-bench 2 не существует: опубликованное семейство включает SWE-bench, Verified, Lite, Multilingual и Multimodal, а существующая нумерация версий относится к подмножествам этого бенчмарка, а не к нумерованному преемнику. Эталонный бенчмарк Cognition для этих моделей называется FrontierCode — это совершенно иной инструмент, и, как объясняется в следующем разделе, он принадлежит самой Cognition.

Если вы пришли сюда в ожидании второго поколения оценки SWE-bench, то в этом и заключается всё недоразумение.

Дата выпуска и как распространяется SWE-2

В анонсирующем посте Cognition указана дата 10 сентября 2026 года, а структурированные данные самой страницы дают временную метку публикации 2026-09-10. Оба источника согласуются. SWE-2 был доступен в Devin Desktop и Devin CLI в этот день, а Devin Web и Fusion появились следом.

Это и есть поверхность распространения, и это вся поверхность распространения. Открытых весов нет — на Hugging Face нет ничего от Cognition для этой модели — и нет размещённого у вендора эндпоинта, который принимает идентификатор SWE-2. Если ваша обвязка — ваша собственная, SWE-2 сегодня не компонент, который можно в неё установить. Если ваша обвязка — Devin, SWE-2 уже перед вами.

Тем, кому нужен набор возможностей базовой модели, а не SWE-2, Kimi K3 — это отдельный и лучше документированный вариант, и он маршрутизируется на OrcaRouter как kimi/kimi-k3 — один API для более чем 200 моделей по прайс-листу провайдера без наценки. Это важно здесь по конкретной причине: базовая возможность, с которой начинала Cognition, доступна независимо, хотя дообученная модель — нет.

Конверт: что документирует Cognition, а что — нет

Справочная страница должна честно говорить о том, как устроены её собственные доказательства, и именно здесь доказательная база SWE-2 наиболее скудна.

• Усилие рассуждения — три документированных уровня: medium, high и max. Cognition пишет, что эти уровни ведут себя по-разному по замыслу: medium раньше переходит к действиям и несёт простую и промежуточную работу, тогда как high и max больше планируют, больше исследуют кодовую базу и тратят больше на верификацию.
• Распространение — Devin Desktop и Devin CLI на старте, Devin Web и Fusion в процессе поэтапного запуска. Ни API, ни весов, ни пути self-host.
• Базовая модель — Kimi K3, которую Cognition описывает как модель с 2,8 трлн параметров, уже прошедшую масштабное RL для агентного программирования. В статье о Kimi K3 указано, что у этой базы контекстное окно на 1 млн токенов и встроенное зрение.
• Контекстное окно, максимальный объём вывода, модальности, число параметров после дообучения — для SWE-2 не опубликованы. В анонсе Cognition о них ничего не сказано, и ни одна другая страница Cognition не восполняет этот пробел.

Различие в последней строке — не педантизм. Окно Kimi K3 в миллион токенов — это факт о Kimi K3. Cognition не утверждает, что SWE-2 наследует его, а постобучение по другому рецепту — именно такого рода изменение, которое может повлиять на то, что принимает модель. Если вам нужно число контекстного окна для планирования, то число, которое вы можете проверить, относится к базовой модели, а значение для SWE-2 следует считать неизвестным, а не предполагать, что эти два числа совпадают.

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

Тарифная карта — в единственной валюте, в которой Cognition указывает цены.

У SWE-2 нет цены за токен, потому что не существует эндпоинта SWE-2. Утверждение Cognition о затратах выражено в других единицах: в нём говорится, что SWE-2 оказывается в пределах одного пункта от Claude Fable 5.1 на FrontierCode 1.1 Main — 50,0% против 50,9% — и при этом на 64% дешевле. Внимательно прочитайте единицу измерения. Эти 64% — это средние расходы в долларах США на один роллаут в FrontierCode, показатель уровня задачи, который объединяет модель, harness, scaffolding и стек обслуживания Cognition в один счёт. Это не тариф за токены, и его нельзя сравнивать с тарифом за токены.

Тарифная сетка, которая всё же существует, принадлежит Devin. На странице цен Devin, по состоянию на 28 сентября 2026 года: Free — $0, Pro — $20 в месяц, Max — $200 в месяц, Teams — $80 в месяц плюс $40 за каждое полноценное место разработчика. Строка SWE-2 находится в Pro и сопровождается датой: «Бесплатное использование SWE-2 — бесплатно в Devin Desktop и CLI до 10 октября 2026 года». Это промо-окно, до конца которого осталось примерно две недели, и это единственный показатель SWE-2 на той странице, который действительно чувствителен ко времени: стоимость модели внутри Devin после 10 октября там не указана.

Показатели эффективности Cognition стоит привести рядом с утверждением о стоимости, и они, как и всё остальное на этой странице, заявлены производителем. На FrontierCode 1.1 Main SWE-2 при среднем уровне усилий набирает больше баллов, чем SWE-1.7, при этом совершая на 58% меньше ходов и обходясь в среднем на 81% дешевле. Среднее число шагов за запуск падает со 127 у SWE-1.7 до 53 при среднем уровне, 80 при высоком и 98 при максимальном, а медиана первой реальной правки кода смещается с 48-го шага на 18-й.

Бенчмарки, вместе с прикреплённым тестовым стендом.

Баллы по программной инженерии необычно чувствительны к скаффолду, в котором они были получены, поэтому число без его стенда — не число. Cognition излагает свою политику в отношении стендов в приложении о методологии к анонсу: результаты берутся из публичных источников, где таковые существуют, а в остальных случаях получаются на внутренней системе оценки Cognition с использованием стенда, для которого в первую очередь разрабатывалась каждая модель, — Claude Code для моделей Anthropic, Codex для моделей OpenAI, Grok Build для моделей xAI и Devin CLI для моделей с открытыми весами. Для каждой модели Cognition сообщает лучшую оценку среди всех настроек усилия рассуждения.

Из этого следуют два вывода, и оба должны звучать в одном ряду с числами. Во-первых, несколько строк — это не сравнение равного с равным: показатель Fable 5.1, полученный в Claude Code, и показатель Kimi K3, полученный в Devin CLI, — это измерения двух разных агентных систем, а не двух моделей в нейтральном стенде. Во-вторых, «лучший результат среди настроек усилий» означает, что каждая ячейка — это лучший случай модели, а не согласованная настройка. Сравнение при неизменном уровне усилий выглядело бы иначе, а Cognition такого не публиковала.

Все четыре строки ниже предоставлены поставщиком и не проверены аудитом.

• FrontierCode 1.1 Main — SWE-2 50,0%, Kimi K3 44,2%, Grok 4.6 48,0%, Claude Fable 5.1 50,9%, GPT-5.6 Sol 47,5%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. Это главная строка, а FrontierCode — собственный бенчмарк Cognition: Cognition пишет задачи вместе с более чем 20 мейнтейнерами проектов с открытым исходным кодом, ведёт таблицу лидеров и оценивает присланные работы. Ничто из этого не делает эти цифры неверными; всё это следует упоминать в том же предложении, где вы их повторяете.
• DeepSWE 1.1 — SWE-2 73,0%, Kimi K3 68,5%, Grok 4.6 67,5%, Claude Fable 5.1 67,4%, GPT-5.6 Sol 72,7%, GPT-6 Astra 74,1%, SWE-1.7 37,7%. Строка, где SWE-2 наиболее убедительно превосходит фронтирную модель вчистую.
• Terminal-Bench 2.1 — SWE-2 92,8%, Kimi K3 88,3%, Grok 4.6 88,4%, Claude Fable 5.1 91,4%, GPT-5.6 Sol 88,8%, GPT-6 Astra 89,9%, SWE-1.7 81,5%. Самый выигрышный показатель SWE-2, и текущая версия Terminal-Bench — не 2.1.
• Terminal-Bench 4 — SWE-2 27,3%, Kimi K3 21,5%, Grok 4.6 20,3%, Claude Fable 5.1 55,8%, GPT-5.6 Sol 37,3%, GPT-6 Astra 57,9%, SWE-1.7 7,6%. Строка, которую цитируют реже всего, и та, где модель отстаёт от фронтира примерно на 28 пунктов.

Для этого сравнения нужен ещё один фрагмент контекста, потому что он объясняет, откуда берётся необычная форма строки frontier. В собственной сноске Cognition к своим графикам отмечается, что режим максимальных усилий Fable 5.1 в FrontierCode 1.1 Main набирает 50,3% при $12,83 за задачу — ниже, чем его собственный средний режим с 50,9% при $3,28. Больше усилий дало более низкий результат при примерно вчетверо больших затратах. Это кривая frontier-модели, загибающаяся сама на себя, и это отчасти объясняет, почему 50,0% против 50,9% ближе, чем можно предположить по одним лишь этим двум числам.

Показатели достоверности

Отдельный раздел Cognition, посвящённый надёжности, — это та часть релиза, которая никак не связана с таблицами лидеров; в нём сообщается, что SWE-2 прошла 98,0% своих промптов по пропаганде и цензуре в целом — 99,8% на английском, 95,2% на упрощённом китайском и 99,1% на традиционном китайском — а также что оценка контекстно-зависимых уязвимостей SWE-2 не выявила ни одного условия фрейминга, приводящего к статистически значимому изменению для какой-либо протестированной модели. Это оценки Cognition, полученные с помощью модели-судьи GPT-5.6 Luna на наборе из 145 вопросов, и они сообщаются поставщиком в том же смысле, что и бенчмарки.

Независимое прочтение: пока его нет

По состоянию на 28 сентября 2026 года у SWE-2 нет записи на Artificial Analysis. Поиск по названию в индексе моделей ничего не даёт, а прямой запрос к странице модели возвращает 404. Единственная таблица результатов, где фигурирует SWE-2, — это FrontierCode, принадлежащая Cognition. В итоге у релиза остаются только цифры, заявленные производителем, и ничего больше; это не критика этих цифр — это констатация того, насколько их может проверить читатель.

Две конкретные вещи могли бы разрешить этот вопрос, и ни одной из них сегодня не существует. Прогон SWE-2 на Terminal-Bench 4, выполненный третьей стороной, решил бы, является ли это моделью, близкой к передовой, которая оказалась дешёвой, или быстрой моделью, которой случилось возглавить устаревшую версию. А любое независимое воспроизведение разрыва в FrontierCode показало бы, является ли преимущество в один пункт над Fable 5.1 свойством модели или свойством инструмента.

В отличие от собственных моделей Cognition, Artificial Analysis действительно включает Kimi K3 — и показатели Kimi K3 получены от третьих сторон, что делает базовую модель лучше подтверждённой доказательствами половиной этого стека. Эта асимметрия — практическая суть SWE-2 сегодня: пост-тренировка — интересная часть и наименее проверяемая; база — документированная часть и та, которую действительно можно вызвать.

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

Использование SWE-2 и что делать, пока он не прошёл аудит

Если вы уже платите за Devin, решение простое и не зависит ни от одной из оговорок выше. SWE-2 уже в вашем продукте, Cognition утверждает, что он стоит меньше за задачу, чем модель, которую он заменяет, а показатели эффективности — на 58% меньше ходов, на 81% ниже средняя стоимость, медианное первое редактирование на шаге 18 вместо шага 48 — описывают модель, которая тратит меньше вашего времени на обычную работу. Запускайте её со средним уровнем усилий на простых задачах в вашей очереди — именно там собственная система уровней усилий от Cognition обеспечивает выигрыш по стоимости.

Если вы выбираете модель для программирования вне Devin, честная позиция такова: SWE-2 — не кандидат, которого вы можете оценить, потому что вызывать нечего. Нет идентификатора, нет цены за токен и нет эндпоинта. Оценить вы можете базовую модель.

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

Kimi K3 маршрутизируется через OrcaRouter — по цене $3,00 за 1 млн входных токенов и $15,00 за 1 млн выходных токенов, без наценки сверх тарифа провайдера, с контекстным окном на 1 млн токенов, нативным вызовом инструментов, приёмом изображений и управлением уровнем усилий рассуждения верхнего уровня. Это доступная половина данного релиза: та самая способность, на которой Cognition проводила постобучение, доступна через единый OpenAI-совместимый эндпоинт, а не через агентский продукт одного вендора. А поскольку в любом случае это непроверенная территория, вы можете выстроить за ним цепочку резервных моделей, чтобы модель, которую вы тестируете, не превратилась в производственную зависимость в тот самый день, когда она вас разочарует.

То, что SWE-2 говорит вам, если читать его как свидетельство, а не как страницу продукта, оказывается более узким и более полезным, чем заголовок: качественно выполненный прогон RL поверх Kimi K3 сдвинул уровень примерно на пять пунктов на четырёх бенчмарках, не изменив форму, и потребовал на 58% меньше ходов. Это реальный результат внутри Devin. Но это пока не результат, который кто-либо за пределами Cognition воспроизвёл, а единственный бенчмарк, где SWE-2, судя по всему, обходит всё, — это тот, на котором сообщество перестало оценивать результаты.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно