Cognition SWE-2용 타이틀 카드. 제목은 'Cognition SWE-2', 부제는 'Cognition이 만든 코딩 모델로, Kimi K3에서 후속 학습되었으며, Devin 내부에서 제공됨'. 아래에는 'Cognition 제작', '기본 모델 Kimi K3 2.8T', 'Devin Desktop 및 CLI에서 제공'이라고 적힌 세 장의 카드가 있습니다.
Guides & Insights

Cognition SWE-2: 누가 만드는가, 어떤 하네스에서 실행되는가, 그리고 숫자는 실제로 무엇을 말하는가

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Cognition SWE-2는 Devin을 만든 회사인 Cognition이 만든 코딩 모델로, 모델 API를 통해서가 아니라 Devin 내부에서 제공됩니다. Cognition의 자체 출시 게시물에 따르면 SWE-2는 Devin Desktop과 Devin CLI에서 먼저 사용할 수 있으며, 이후 Devin Web과 Fusion으로 순차 출시됩니다. 이 모델은 Kimi K3, 즉 Moonshot AI의 2조 8,000억 개 파라미터 모델을 기반으로 후속 학습되었습니다. 이것이 이곳에 도착한 대부분의 사람들이 실제로 묻는 질문에 대한 답의 전부이며, 다른 무엇보다 먼저 밝혀둘 가치가 있습니다. 이 페이지로 이어지는 검색 중 상당수는 네 번째 단어인 Devin을 덧붙여 그 모델을 Cognition이 아니라 Devin의 것으로 돌리기 때문입니다. Devin은 Cognition이 판매하는 에이전트입니다. SWE-2는 그 안에서 실행되도록 Cognition이 학습시킨 모델입니다.

이 페이지는 출시 기사라기보다 참조 페이지입니다. SWE-2는 2026년 9월 10일에 출시되었으며, 이는 지금으로부터 일주일 넘게 지난 날짜입니다. 이 날짜는 사건을 보도하려는 것이 아니라 모델의 시간축을 맞추기 위해 여기 있습니다. 다음은 무엇이 문서화되었는지, 누가 문서화했는지, 그리고 아직 아무도 확인하지 않은 것이 무엇인지입니다.

SWE-2는 누가 만들며, 왜 그 귀속은 계속 흔들리는가

혼란은 부당하지 않다. Cognition은 실험실이 API 모델을 파는 방식으로 SWE-2를 판매하지 않는다. 컨텍스트 윈도가 적힌 모델 카드도, 공개된 토큰 가격도, 요청 본문에 넣을 수 있는 식별자도 없다. 제품이 하나 있고 — Devin — 그 모델은 그 제품의 일부로 제공된다. Cognition 자신의 글은 이러한 뒤섞임을 더욱 강화한다: 출시 글은 Devin의 관점에서 쓰였고, 벤치마크 표는 회사의 이전 FrontierCode 작업을 이미 읽지 않은 사람에게는 설명되지 않으며, 가용성 안내 문구에서는 Devin을 네 번, Cognition을 한 번 — 바이라인에서 — 언급한다.

그러니까, 간단히 말해: Cognition이 SWE-2를 만든다. Cognition은 Devin을 만든다. 둘은 같은 것이 아니지만, 현재로서는 하나 없이 다른 하나를 가질 수 없다. 이것 역시 일회성 명명 사고가 아니다. Cognition은 SWE 접두사 아래 일련의 소프트웨어 엔지니어링 모델들을 출시해 왔다 — SWE-1.5, SWE-1.6, SWE-1.7, 그리고 이제 SWE-2까지, 그 과정에서 SWE-1.6 Preview 체크포인트도 포함해 — SWE-grep과 SWE-check 같은 더 좁은 범위의 도구들과 함께. 이 접두사는 회사가 소프트웨어 엔지니어링을 줄여 부르는 말이며, 이 문단의 모든 모델보다 약 1년 앞선다.

이름: 벤치마크가 아닌 모델

이것이 검색자들이 SWE-2를 잘못된 소유자에게 귀속시키는 두 번째 이유이며, 이는 각주가 아닌 독립된 단락으로 다룰 가치가 있다.

SWE-bench는 벤치마크입니다. 이는 SWE-bench 팀이 유지 관리하는 독립적인 평가이며, swebench.com에서 호스팅되고, 여러 에디션으로 제공됩니다: 실제 GitHub 이슈에서 가져온 원래의 2,294개 인스턴스 세트와 Verified, Lite, Multilingual, Multimodal 하위 집합입니다. 이는 일반적으로 코딩 에이전트를 채점하는 데 사용되며 Devin도 포함됩니다 — Cognition은 2024년 3월에 Devin-on-SWE-bench 기술 보고서를 발표했는데, 이는 아직도 그들의 블로그에 있습니다.

SWE-2는 모델입니다. 그것은 SWE-bench의 에디션이 아니며, 그 약자도 아닙니다. SWE-bench 2는 존재하지 않습니다: 공개된 제품군은 SWE-bench, Verified, Lite, Multilingual, Multimodal로 구성되며, 존재하는 버전 번호는 벤치마크의 하위 집합에 속하는 것이지 번호가 붙은 후속 버전에 속하는 것이 아닙니다. 이 모델들에 대해 Cognition이 공식적으로 채택한 벤치마크는 FrontierCode라고 하며, 이는 완전히 다른 도구이고, 다음 섹션에서 설명하듯이 Cognition이 소유한 것입니다.

SWE-bench 평가의 2세대를 기대하며 이곳을 찾으셨다면, 바로 그것이 오해의 전부입니다.

출시일 및 SWE-2 배포 방식

Cognition의 발표 게시물에는 2026년 9월 10일자 작성자 표기가 있으며, 페이지 자체의 구조화 데이터는 게시 타임스탬프를 2026-09-10으로 제공합니다. 두 정보는 일치합니다. SWE-2는 해당 날짜에 Devin Desktop과 Devin CLI에서 사용할 수 있었으며, Devin Web과 Fusion이 뒤를 이었습니다.

그것이 배포 표면이며, 그것이 전체 배포 표면입니다. 공개 가중치는 없습니다 — 이 모델에 대해 Cognition이 Hugging Face에 올린 것은 아무것도 없습니다 — 그리고 SWE-2 식별자를 받는 벤더 호스팅 엔드포인트도 없습니다. 당신의 하네스가 자체 제작한 것이라면, SWE-2는 오늘 그것에 설치할 수 있는 구성 요소가 아닙니다. 당신의 하네스가 Devin이라면, SWE-2는 이미 당신 앞에 있습니다.

SWE-2의 범위가 아니라 기본 모델의 범위가 필요한 사람이라면, Kimi K3는 별개이며 문서화가 더 잘 된 대상이고, OrcaRouter에서는 kimi/kimi-k3로 라우팅됩니다 — 제공업체의 정가로 마크업 없이 200개 이상의 모델을 이용할 수 있는 단일 API입니다. 이 점은 여기서 특정한 이유로 중요합니다: 사후 학습된 모델은 그렇지 않지만, Cognition이 출발한 기반 역량은 독립적으로 접근할 수 있습니다.

엔벨로프: Cognition이 문서화하는 것과 문서화하지 않는 것

참조 페이지는 자기 근거가 어떤 형태인지에 대해 정직해야 하는데, 바로 이 점에서 SWE-2의 근거는 가장 빈약하다.

• 추론 강도 — 문서화된 세 가지 수준: medium, high, max. Cognition은 이 수준들이 설계상 다르게 작동한다고 설명합니다: medium은 더 일찍 행동에 들어가 간단하고 중간 수준의 작업을 처리하는 반면, high와 max는 더 많이 계획하고 코드베이스를 더 많이 탐색하며 검증에 더 많은 비용을 씁니다.
• 배포 — 출시 시점에는 Devin Desktop과 Devin CLI, Devin Web과 Fusion은 순차 출시 중입니다. API도, 가중치도, 자체 호스팅 경로도 없습니다.
• 기반 모델 — Cognition이 에이전트형 코딩을 위한 광범위한 RL을 이미 거친 2.8T 파라미터 모델이라고 설명한 Kimi K3. Kimi K3 논문은 그 기반 모델에 1M 토큰 컨텍스트 창과 네이티브 비전을 부여합니다.
• 컨텍스트 창, 최대 출력, 모달리티, 사후 학습된 파라미터 수 — SWE-2에 대해서는 공개되지 않았습니다. Cognition의 발표는 이들 중 어느 것에 대해서도 언급하지 않으며, 다른 어떤 Cognition 페이지도 이 공백을 메우지 않습니다.

마지막 행의 그 구분은 단순한 현학적 지적이 아니다. Kimi K3의 백만 토큰 창은 Kimi K3에 관한 사실이다. Cognition은 SWE-2가 그것을 물려받는다고 말하지 않으며, 다른 레시피로의 사후 학습은 모델이 받아들이는 것을 바꿀 수 있는 바로 그런 종류의 변화다. 계획을 위해 컨텍스트 창 수치가 필요하다면, 검증할 수 있는 수치는 기본 모델에 속한 것이므로, 둘이 일치한다고 가정하기보다 SWE-2의 것은 알 수 없는 것으로 취급해야 한다.

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

요율표, Cognition이 제시하는 유일한 화폐로

SWE-2에는 토큰당 가격이 없다. SWE-2 엔드포인트가 없기 때문이다. Cognition의 비용 주장은 기준이 다르다. 즉, SWE-2가 FrontierCode 1.1 Main에서 Claude Fable 5.1에 1포인트 이내로 근접한다고 말한다 — 50.0% 대 50.9% — 이면서 64% 더 저렴하다고 한다. 단위를 주의 깊게 읽어라. 64%는 FrontierCode에서 롤아웃당 지출된 평균 미국 달러로, 모델, 하네스, 스캐폴딩, Cognition의 서빙 스택을 하나의 청구서로 묶은 작업 수준 수치다. 이는 토큰 요율이 아니며, 토큰 요율과 비교할 수 없다.

실제로 요금표가 있는 쪽은 Devin이다. Devin의 가격 페이지에서 2026년 9월 28일에 확인한 내용은 다음과 같다: Free는 $0, Pro는 월 $20, Max는 월 $200, 월 $80에 정규 개발자 1석당 $40 추가. SWE-2 항목은 Pro에 있고 날짜가 붙어 있다 — "SWE-2 무료 사용 — 2026년 10월까지 Devin Desktop 및 CLI에서 무료." 그것은 약 2주가 남은, 시간에 민감한 수치이며, 그 페이지에서 진짜로 시간에 민감한 항목이다: 10월 10일 이후 Devin 내부에서 이 모델의 비용은 거기에 명시되어 있지 않다.

Cognition의 효율성 수치는 비용 주장 옆에 인용할 가치가 있으며, 이 페이지의 다른 모든 내용과 마찬가지로 공급업체가 보고한 수치입니다. FrontierCode 1.1 Main에서 medium effort의 SWE-2는 SWE-1.7보다 높은 점수를 기록하면서 평균적으로 58% 더 적은 턴을 사용하고 81% 더 적은 비용이 듭니다. 실행당 평균 단계 수는 SWE-1.7의 127에서 medium 53, high 80, max 98로 줄어들며, 첫 실제 코드 편집의 중앙값은 48단계에서 18단계로 이동합니다.

하네스가 연결된 벤치마크

소프트웨어 엔지니어링 점수는 그것이 산출된 스캐폴드에 유난히 민감하므로, 하네스가 함께 제시되지 않은 숫자는 숫자가 아니다. {{1}}Cognition{{/1}}은 발표문의 방법론 부록에서 자사의 하네스 정책을 밝힌다: 결과는 공개 출처가 존재하는 경우 공개 출처에서 보고되며, 그렇지 않으면 각 모델이 주로 개발된 하네스를 사용하여 {{2}}Cognition{{/2}}의 내부 평가 프레임워크에서 실행된다 — Anthropic 모델에는 Claude Code, OpenAI 모델에는 Codex, xAI 모델에는 Grok Build, 오픈웨이트 모델에는 Devin CLI. 모든 모델에 대해 Cognition은 추론 노력 설정 전반에서 최고 점수를 보고한다.

두 가지 결과가 뒤따르며, 둘 다 그 수치와 같은 호흡으로 다루어야 한다. 첫째, 여러 행은 동일 조건 비교가 아니다. Claude Code에서 산출된 Fable 5.1 수치와 Devin CLI에서 산출된 Kimi K3 수치는 중립적인 하네스에 놓인 두 모델이 아니라, 서로 다른 두 에이전트 시스템을 측정한 것이다. 둘째, "effort 설정 전반에 걸친 최고 점수"는 각 셀이 동일하게 맞춘 설정이 아니라 모델의 최선의 경우를 의미한다. effort를 일정하게 고정한 비교는 다르게 보일 것이며, Cognition은 그런 비교를 공개하지 않았다.

아래 네 행은 모두 공급업체가 보고한 것이며 감사되지 않았습니다.

• FrontierCode 1.1 Main — SWE-2 50.0%, Kimi K3 44.2%, Grok 4.6 48.0%, Claude Fable 5.1 50.9%, GPT-5.6 Sol 47.5%, GPT-6 Astra 53.3%, SWE-1.7 42.0%. 이것이 대표 행이며, FrontierCode는 Cognition 자체의 벤치마크다 — Cognition이 20명이 넘는 오픈소스 메인테이너와 함께 과제를 작성하고, 리더보드를 운영하며, 제출물을 채점한다. 그렇다고 해서 그 수치들이 틀린 것은 아니다; 그 모든 사실은 이 수치들을 다시 언급하는 문장에 들어가야 한다.
• DeepSWE 1.1 — SWE-2 73.0%, Kimi K3 68.5%, Grok 4.6 67.5%, Claude Fable 5.1 67.4%, GPT-5.6 Sol 72.7%, GPT-6 Astra 74.1%, SWE-1.7 37.7%. SWE-2가 프런티어 모델을 완전히 앞선다고 가장 신뢰할 만하게 말할 수 있는 행.
• Terminal-Bench 2.1 — SWE-2 92.8%, Kimi K3 88.3%, Grok 4.6 88.4%, Claude Fable 5.1 91.4%, GPT-5.6 Sol 88.8%, GPT-6 Astra 89.9%, SWE-1.7 81.5%. SWE-2의 가장 좋아 보이는 수치이며, 그리고 현재 판 Terminal-Bench는 2.1이 아니다.
• Terminal-Bench 4 — SWE-2 27.3%, Kimi K3 21.5%, Grok 4.6 20.3%, Claude Fable 5.1 55.8%, GPT-5.6 Sol 37.3%, GPT-6 Astra 57.9%, SWE-1.7 7.6%. 가장 적게 인용되는 행이며, 이 모델이 프런티어보다 약 28점 뒤처지는 행이다.

이 비교에는 문맥이 하나 더 필요하다. 그것은 프런티어 행의 이례적인 모양이 어디서 비롯되는지 설명해 주기 때문이다. Cognition이 자사 차트에 붙인 각주에 따르면, Fable 5.1의 FrontierCode 1.1 Main에서의 최대 노력 설정은 과제당 $12.83에 50.3%를 기록한다. 이는 자사의 중간 설정인 50.9%, $3.28보다 낮다. 더 많은 노력은 약 네 배의 비용으로 더 낮은 점수를 얻었다. 그것은 프런티어 모델의 곡선이 스스로 되접히는 모습이며, 50.0% 대 50.9%가 두 숫자만 보아서 짐작되는 것보다 더 가깝다는 점의 일부 이유다.

신뢰성 수치

Cognition의 별도 신뢰성 섹션은 이번 발표에서 리더보드와 아무 관련이 없는 부분이며, SWE-2가 전체적으로 선전 및 검열 프롬프트의 98.0%를 통과했다고 보고합니다 — 영어 99.8%, 간체 중국어 95.2%, 번체 중국어 99.1% — 그리고 문맥 의존적 취약성 평가에서는 테스트된 어떤 모델에서도 통계적으로 유의미한 변화를 일으키는 프레이밍 조건이 발견되지 않았다고 합니다. 이는 145개 질문 세트에 대해 GPT-5.6 Luna 판정자로 산출된 Cognition의 판단이며, 벤치마크와 같은 의미에서 벤더가 보고한 것입니다.

독립적인 해석: 아직 없습니다.

2026년 9월 28일 기준으로, SWE-2는 Artificial Analysis에 항목이 없다. 모델 색인에서 그 이름을 검색해도 아무것도 나오지 않고, 모델 페이지에 직접 요청하면 404가 뜬다. SWE-2를 싣고 있는 유일한 스코어보드는 Cognition 소유의 FrontierCode다. 그 결과 이 릴리스에는 벤더가 보고한 수치 외에는 아무것도 남지 않는데, 이는 그 수치들에 대한 비판이 아니라 독자가 그중 얼마나 많은 부분을 확인할 수 있는지에 관한 진술이다.

두 가지 구체적인 요소만 있으면 판가름이 날 텐데, 둘 다 현재는 존재하지 않는다. Terminal-Bench 4에서 SWE-2를 제3자가 실행해 본다면, 이것이 우연히 저렴한 프런티어 인접 모델인지, 아니면 우연히 퇴역한 에디션에서 선두를 차지한 빠른 모델인지 결정될 것이다. 그리고 FrontierCode 격차에 대한 독립적인 재현이 있다면, Fable 5.1을 상대로 한 1점 차이가 모델의 속성인지 측정 도구의 속성인지 알려줄 것이다.

Cognition의 자체 모델들과 달리, Artificial Analysis는 Kimi K3를 실제로 포함한다 — 그리고 Kimi K3의 수치는 제3자 출처이므로, 이 스택에서 근거가 더 탄탄한 절반은 베이스 모델이 된다. 그 비대칭성이 오늘날 SWE-2의 실질적 형태다: 포스트 트레인은 흥미로운 부분이자 가장 검증하기 어려운 부분이고, 베이스는 문서화된 부분이자 실제로 호출할 수 있는 쪽이다.

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

SWE-2 사용하기, 그리고 감사를 받지 않은 동안 해야 할 일

이미 Devin에 비용을 지불하고 있다면, 결정은 간단하며 위의 어떤 주의사항에도 좌우되지 않습니다. SWE-2는 귀하의 제품에 있으며, Cognition은 이것이 대체하는 모델보다 작업당 비용이 더 적게 든다고 말합니다. 그리고 효율성 수치 — 턴 수 58% 감소, 평균 비용 81% 절감, 첫 편집 중앙값이 48단계가 아닌 18단계 — 는 일상적인 작업에서 귀하의 시간을 덜 낭비하는 모델을 보여줍니다. 대기열에서 간단한 쪽 작업에 중간 노력 수준으로 시작하세요. Cognition 자체의 노력 수준 설계가 비용 이점을 두는 곳이 바로 그곳입니다.

Devin 외부에서 코딩 모델을 고르는 상황이라면, 솔직한 입장은 SWE-2가 평가할 수 있는 후보가 아니라는 것입니다. 호출할 대상이 없기 때문입니다. 식별자도, 토큰당 가격도, 엔드포인트도 없습니다. 평가할 수 있는 것은 기본 모델뿐입니다.

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

Kimi K3는 OrcaRouter에서 라우팅되며, 100만 입력 토큰당 $3.00, 100만 출력 토큰당 $15.00의 요금으로 제공자 요율 대비 마크업이 없고, 100만 토큰 컨텍스트 윈도우, 네이티브 도구 호출, 이미지 입력, 그리고 최상위 수준의 추론 노력 제어를 갖추고 있습니다. 그것이 이번 릴리스에서 접근 가능한 절반입니다: Cognition이 포스트트레이닝한 그 능력을 특정 벤더의 에이전트 제품이 아닌 하나의 OpenAI 호환 엔드포인트를 통해 쓸 수 있다는 점입니다. 그리고 어느 쪽이든 감사되지 않은 영역이므로, 여러분은 그 뒤에 폴백 체인을 둘 수 있으므로, 시험 중인 모델이 여러분을 실망시키는 날 바로 프로덕션 의존성이 되지는 않습니다.

SWE-2가 말해 주는 것을 제품 페이지가 아니라 증거로 읽는다면, 그 내용은 헤드라인보다 더 좁고 더 유용하다. Kimi K3를 기반으로 잘 수행된 RL 패스는 네 개 벤치마크 전반에서 형태를 바꾸지 않고 성능 수준을 약 5포인트 끌어올렸으며, 그렇게 하는 데 58% 더 적은 턴을 사용했다. 이는 Devin 내부에서 나온 실제 결과다. 아직 Cognition 외부에서 누구도 재현하지 못한 결과이며, SWE-2가 모든 것을 앞서는 것으로 보이는 단 하나의 벤치마크는 업계가 채점을 중단한 바로 그 벤치마크다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트