
Cognition SWE-2: кто его создаёт, в каком харнессе он работает и что на самом деле говорят цифры
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 316 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 196 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Cognition SWE-2 — это модель для программирования, созданная Cognition, компанией, стоящей за Devin, и она работает внутри Devin, а не через API модели: в собственном анонсе Cognition говорится, что SWE-2 сначала доступна в Devin Desktop и Devin CLI, с последующим развёртыванием в Devin Web и Fusion. Она дообучена на основе Kimi K3 — модели Moonshot AI с 2,8 триллиона параметров. Это и есть исчерпывающий ответ на вопрос, который большинство людей на самом деле задают, попадая сюда, и его стоит привести прежде всего, потому что заметная доля поисковых запросов, ведущих на эту страницу, добавляет четвёртое слово — Devin — и приписывает модель Devin, а не Cognition. Devin — это агент, который продаёт Cognition. SWE-2 — это модель, которую Cognition обучила для работы внутри него.
Эта страница — справочная, а не материал о запуске. SWE-2 вышел 10 сентября 2026 года, а это было больше недели назад; дата здесь для того, чтобы зафиксировать модель во времени, а не сообщить о событии. Далее — что задокументировано, кем это задокументировано и что ещё никто не проверял.
Кто производит SWE-2 и почему атрибуция постоянно смещается
Путаница небезосновательна. Cognition не продаёт SWE-2 так, как лаборатория продаёт API-модель. Нет карточки модели с контекстным окном, нет опубликованной цены за токены, нет идентификатора, который можно передать в теле запроса. Есть продукт — Devin — и модель поставляется как его часть. Собственный текст Cognition лишь закрепляет это смешение: пост о запуске написан от лица Devin, таблица бенчмарков остаётся без объяснений для всех, кто ещё не читал более раннюю работу компании FrontierCode, а в строке о доступности Devin упоминается четыре раза, а Cognition — один раз, в подписи автора.
Итак, прямо: Cognition создаёт SWE-2. Cognition создаёт Devin. Это не одно и то же, но сейчас нельзя иметь одно без другого. И это тоже не разовая случайность в названии. Cognition выпустила ряд моделей для программной инженерии под префиксом SWE — SWE-1.5, SWE-1.6, SWE-1.7 и теперь SWE-2, а по пути ещё и промежуточный чекпойнт SWE-1.6 Preview — наряду с более узкими инструментами вроде SWE-grep и SWE-check. Этот префикс — принятое в компании сокращение для программной инженерии, и он примерно на год старше каждой модели, упомянутой в этом абзаце.
Название: модель, а не бенчмарк
Это вторая причина, по которой поисковые системы приписывают SWE-2 не тому владельцу, и она заслуживает отдельного абзаца, а не сноски.
SWE-bench — это бенчмарк. Это независимая оценка, поддерживаемая командой SWE-bench и размещённая на swebench.com; она выпускается в нескольких версиях: исходный набор из 2 294 экземпляров, составленный на основе реальных issue на GitHub, а также подмножества Verified, Lite, Multilingual и Multimodal. Он используется для оценки coding-агентов в целом, включая Devin, — Cognition опубликовала технический отчёт о Devin на SWE-bench ещё в марте 2024 года, который до сих пор доступен в её блоге.
SWE-2 — это модель. Это не редакция SWE-bench и не сокращение для неё. SWE-bench 2 не существует: опубликованное семейство включает SWE-bench, Verified, Lite, Multilingual и Multimodal, а существующая нумерация версий относится к подмножествам этого бенчмарка, а не к нумерованному преемнику. Эталонный бенчмарк Cognition для этих моделей называется FrontierCode — это совершенно иной инструмент, и, как объясняется в следующем разделе, он принадлежит самой Cognition.
Если вы пришли сюда в ожидании второго поколения оценки SWE-bench, то в этом и заключается всё недоразумение.
Дата выпуска и как распространяется SWE-2
В анонсирующем посте Cognition указана дата 10 сентября 2026 года, а структурированные данные самой страницы дают временную метку публикации 2026-09-10. Оба источника согласуются. SWE-2 был доступен в Devin Desktop и Devin CLI в этот день, а Devin Web и Fusion появились следом.
Это и есть поверхность распространения, и это вся поверхность распространения. Открытых весов нет — на Hugging Face нет ничего от Cognition для этой модели — и нет размещённого у вендора эндпоинта, который принимает идентификатор SWE-2. Если ваша обвязка — ваша собственная, SWE-2 сегодня не компонент, который можно в неё установить. Если ваша обвязка — Devin, SWE-2 уже перед вами.
Тем, кому нужен набор возможностей базовой модели, а не SWE-2, Kimi K3 — это отдельный и лучше документированный вариант, и он маршрутизируется на OrcaRouter как kimi/kimi-k3 — один API для более чем 200 моделей по прайс-листу провайдера без наценки. Это важно здесь по конкретной причине: базовая возможность, с которой начинала Cognition, доступна независимо, хотя дообученная модель — нет.
Конверт: что документирует Cognition, а что — нет
Справочная страница должна честно говорить о том, как устроены её собственные доказательства, и именно здесь доказательная база SWE-2 наиболее скудна.
• Усилие рассуждения — три документированных уровня: medium, high и max. Cognition пишет, что эти уровни ведут себя по-разному по замыслу: medium раньше переходит к действиям и несёт простую и промежуточную работу, тогда как high и max больше планируют, больше исследуют кодовую базу и тратят больше на верификацию.
• Распространение — Devin Desktop и Devin CLI на старте, Devin Web и Fusion в процессе поэтапного запуска. Ни API, ни весов, ни пути self-host.
• Базовая модель — Kimi K3, которую Cognition описывает как модель с 2,8 трлн параметров, уже прошедшую масштабное RL для агентного программирования. В статье о Kimi K3 указано, что у этой базы контекстное окно на 1 млн токенов и встроенное зрение.
• Контекстное окно, максимальный объём вывода, модальности, число параметров после дообучения — для SWE-2 не опубликованы. В анонсе Cognition о них ничего не сказано, и ни одна другая страница Cognition не восполняет этот пробел.
Различие в последней строке — не педантизм. Окно Kimi K3 в миллион токенов — это факт о Kimi K3. Cognition не утверждает, что SWE-2 наследует его, а постобучение по другому рецепту — именно такого рода изменение, которое может повлиять на то, что принимает модель. Если вам нужно число контекстного окна для планирования, то число, которое вы можете проверить, относится к базовой модели, а значение для SWE-2 следует считать неизвестным, а не предполагать, что эти два числа совпадают.

Тарифная карта — в единственной валюте, в которой Cognition указывает цены.
У SWE-2 нет цены за токен, потому что не существует эндпоинта SWE-2. Утверждение Cognition о затратах выражено в других единицах: в нём говорится, что SWE-2 оказывается в пределах одного пункта от Claude Fable 5.1 на FrontierCode 1.1 Main — 50,0% против 50,9% — и при этом на 64% дешевле. Внимательно прочитайте единицу измерения. Эти 64% — это средние расходы в долларах США на один роллаут в FrontierCode, показатель уровня задачи, который объединяет модель, harness, scaffolding и стек обслуживания Cognition в один счёт. Это не тариф за токены, и его нельзя сравнивать с тарифом за токены.
Тарифная сетка, которая всё же существует, принадлежит Devin. На странице цен Devin, по состоянию на 28 сентября 2026 года: Free — $0, Pro — $20 в месяц, Max — $200 в месяц, Teams — $80 в месяц плюс $40 за каждое полноценное место разработчика. Строка SWE-2 находится в Pro и сопровождается датой: «Бесплатное использование SWE-2 — бесплатно в Devin Desktop и CLI до 10 октября 2026 года». Это промо-окно, до конца которого осталось примерно две недели, и это единственный показатель SWE-2 на той странице, который действительно чувствителен ко времени: стоимость модели внутри Devin после 10 октября там не указана.
Показатели эффективности Cognition стоит привести рядом с утверждением о стоимости, и они, как и всё остальное на этой странице, заявлены производителем. На FrontierCode 1.1 Main SWE-2 при среднем уровне усилий набирает больше баллов, чем SWE-1.7, при этом совершая на 58% меньше ходов и обходясь в среднем на 81% дешевле. Среднее число шагов за запуск падает со 127 у SWE-1.7 до 53 при среднем уровне, 80 при высоком и 98 при максимальном, а медиана первой реальной правки кода смещается с 48-го шага на 18-й.
Бенчмарки, вместе с прикреплённым тестовым стендом.
Баллы по программной инженерии необычно чувствительны к скаффолду, в котором они были получены, поэтому число без его стенда — не число. Cognition излагает свою политику в отношении стендов в приложении о методологии к анонсу: результаты берутся из публичных источников, где таковые существуют, а в остальных случаях получаются на внутренней системе оценки Cognition с использованием стенда, для которого в первую очередь разрабатывалась каждая модель, — Claude Code для моделей Anthropic, Codex для моделей OpenAI, Grok Build для моделей xAI и Devin CLI для моделей с открытыми весами. Для каждой модели Cognition сообщает лучшую оценку среди всех настроек усилия рассуждения.
Из этого следуют два вывода, и оба должны звучать в одном ряду с числами. Во-первых, несколько строк — это не сравнение равного с равным: показатель Fable 5.1, полученный в Claude Code, и показатель Kimi K3, полученный в Devin CLI, — это измерения двух разных агентных систем, а не двух моделей в нейтральном стенде. Во-вторых, «лучший результат среди настроек усилий» означает, что каждая ячейка — это лучший случай модели, а не согласованная настройка. Сравнение при неизменном уровне усилий выглядело бы иначе, а Cognition такого не публиковала.
Все четыре строки ниже предоставлены поставщиком и не проверены аудитом.
• FrontierCode 1.1 Main — SWE-2 50,0%, Kimi K3 44,2%, Grok 4.6 48,0%, Claude Fable 5.1 50,9%, GPT-5.6 Sol 47,5%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. Это главная строка, а FrontierCode — собственный бенчмарк Cognition: Cognition пишет задачи вместе с более чем 20 мейнтейнерами проектов с открытым исходным кодом, ведёт таблицу лидеров и оценивает присланные работы. Ничто из этого не делает эти цифры неверными; всё это следует упоминать в том же предложении, где вы их повторяете.
• DeepSWE 1.1 — SWE-2 73,0%, Kimi K3 68,5%, Grok 4.6 67,5%, Claude Fable 5.1 67,4%, GPT-5.6 Sol 72,7%, GPT-6 Astra 74,1%, SWE-1.7 37,7%. Строка, где SWE-2 наиболее убедительно превосходит фронтирную модель вчистую.
• Terminal-Bench 2.1 — SWE-2 92,8%, Kimi K3 88,3%, Grok 4.6 88,4%, Claude Fable 5.1 91,4%, GPT-5.6 Sol 88,8%, GPT-6 Astra 89,9%, SWE-1.7 81,5%. Самый выигрышный показатель SWE-2, и текущая версия Terminal-Bench — не 2.1.
• Terminal-Bench 4 — SWE-2 27,3%, Kimi K3 21,5%, Grok 4.6 20,3%, Claude Fable 5.1 55,8%, GPT-5.6 Sol 37,3%, GPT-6 Astra 57,9%, SWE-1.7 7,6%. Строка, которую цитируют реже всего, и та, где модель отстаёт от фронтира примерно на 28 пунктов.
Для этого сравнения нужен ещё один фрагмент контекста, потому что он объясняет, откуда берётся необычная форма строки frontier. В собственной сноске Cognition к своим графикам отмечается, что режим максимальных усилий Fable 5.1 в FrontierCode 1.1 Main набирает 50,3% при $12,83 за задачу — ниже, чем его собственный средний режим с 50,9% при $3,28. Больше усилий дало более низкий результат при примерно вчетверо больших затратах. Это кривая frontier-модели, загибающаяся сама на себя, и это отчасти объясняет, почему 50,0% против 50,9% ближе, чем можно предположить по одним лишь этим двум числам.
Показатели достоверности
Отдельный раздел Cognition, посвящённый надёжности, — это та часть релиза, которая никак не связана с таблицами лидеров; в нём сообщается, что SWE-2 прошла 98,0% своих промптов по пропаганде и цензуре в целом — 99,8% на английском, 95,2% на упрощённом китайском и 99,1% на традиционном китайском — а также что оценка контекстно-зависимых уязвимостей SWE-2 не выявила ни одного условия фрейминга, приводящего к статистически значимому изменению для какой-либо протестированной модели. Это оценки Cognition, полученные с помощью модели-судьи GPT-5.6 Luna на наборе из 145 вопросов, и они сообщаются поставщиком в том же смысле, что и бенчмарки.
Независимое прочтение: пока его нет
По состоянию на 28 сентября 2026 года у SWE-2 нет записи на Artificial Analysis. Поиск по названию в индексе моделей ничего не даёт, а прямой запрос к странице модели возвращает 404. Единственная таблица результатов, где фигурирует SWE-2, — это FrontierCode, принадлежащая Cognition. В итоге у релиза остаются только цифры, заявленные производителем, и ничего больше; это не критика этих цифр — это констатация того, насколько их может проверить читатель.
Две конкретные вещи могли бы разрешить этот вопрос, и ни одной из них сегодня не существует. Прогон SWE-2 на Terminal-Bench 4, выполненный третьей стороной, решил бы, является ли это моделью, близкой к передовой, которая оказалась дешёвой, или быстрой моделью, которой случилось возглавить устаревшую версию. А любое независимое воспроизведение разрыва в FrontierCode показало бы, является ли преимущество в один пункт над Fable 5.1 свойством модели или свойством инструмента.
В отличие от собственных моделей Cognition, Artificial Analysis действительно включает Kimi K3 — и показатели Kimi K3 получены от третьих сторон, что делает базовую модель лучше подтверждённой доказательствами половиной этого стека. Эта асимметрия — практическая суть SWE-2 сегодня: пост-тренировка — интересная часть и наименее проверяемая; база — документированная часть и та, которую действительно можно вызвать.

Использование SWE-2 и что делать, пока он не прошёл аудит
Если вы уже платите за Devin, решение простое и не зависит ни от одной из оговорок выше. SWE-2 уже в вашем продукте, Cognition утверждает, что он стоит меньше за задачу, чем модель, которую он заменяет, а показатели эффективности — на 58% меньше ходов, на 81% ниже средняя стоимость, медианное первое редактирование на шаге 18 вместо шага 48 — описывают модель, которая тратит меньше вашего времени на обычную работу. Запускайте её со средним уровнем усилий на простых задачах в вашей очереди — именно там собственная система уровней усилий от Cognition обеспечивает выигрыш по стоимости.
Если вы выбираете модель для программирования вне Devin, честная позиция такова: SWE-2 — не кандидат, которого вы можете оценить, потому что вызывать нечего. Нет идентификатора, нет цены за токен и нет эндпоинта. Оценить вы можете базовую модель.

Kimi K3 маршрутизируется через OrcaRouter — по цене $3,00 за 1 млн входных токенов и $15,00 за 1 млн выходных токенов, без наценки сверх тарифа провайдера, с контекстным окном на 1 млн токенов, нативным вызовом инструментов, приёмом изображений и управлением уровнем усилий рассуждения верхнего уровня. Это доступная половина данного релиза: та самая способность, на которой Cognition проводила постобучение, доступна через единый OpenAI-совместимый эндпоинт, а не через агентский продукт одного вендора. А поскольку в любом случае это непроверенная территория, вы можете выстроить за ним цепочку резервных моделей, чтобы модель, которую вы тестируете, не превратилась в производственную зависимость в тот самый день, когда она вас разочарует.
То, что SWE-2 говорит вам, если читать его как свидетельство, а не как страницу продукта, оказывается более узким и более полезным, чем заголовок: качественно выполненный прогон RL поверх Kimi K3 сдвинул уровень примерно на пять пунктов на четырёх бенчмарках, не изменив форму, и потребовал на 58% меньше ходов. Это реальный результат внутри Devin. Но это пока не результат, который кто-либо за пределами Cognition воспроизвёл, а единственный бенчмарк, где SWE-2, судя по всему, обходит всё, — это тот, на котором сообщество перестало оценивать результаты.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
