Cognition SWE-2의 타이틀 카드로, 'Kimi K3 post-train, FrontierCode 1.1 Main에서 50.0%, 64% 더 낮은 비용'이라는 부제를 표시하며, 세 개의 카드: FrontierCode 1.1 Main 50.0%, Claude Fable 5.1 50.9% 대비, 롤아웃당 비용 64% 더 낮음.
Guides & Insights

Cognition SWE-2: 64% 할인된 프론티어 근접 코딩, 그리고 그 밑에 깔린 벤치마크 함정

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Cognition SWE-2는 이번 주 널리 퍼질 만한 숫자를 달고 출시됐다. FrontierCode 1.1 Main에서 50.0%를 기록해, 50.9%를 기록한 Claude Fable 5.1에 1포인트 이내로 근접했으면서도 비용은 64% 더 적게 든다. 이 모델은 Moonshot AI의 Kimi K3 — 2.8조 파라미터 오픈 웨이트 기반 — 을 포스트트레이닝한 것이며, Cognition은 자사의 강화 학습이 여러 벤치마크에서 5~6포인트를 더했다고 말한다. 두 수치 모두 벤더가 자체적으로 낸 것이고, 어느 것도 독립적으로 재현된 바 없다. 하지만 두 번째 수치는 첫 번째 수치를 읽는 방식을 바꿔 놓아야 할 주장이다. 왜냐하면 ‘플러스 5 또는 6’은 SWE-2가 하는 거의 모든 일, 심지어 크게 뒤지는 부분까지 설명하는 것으로 드러나기 때문이다.

그건 흠잡는 게 아니다. 이번 출시에서 가장 유용한 점이며, 거의 어떤 출시 보도도 입 밖에 내지 않는 부분이다.

Cognition이 실제로 출시한 것

SWE-2는 Devin의 코딩 모델이며, 가격표가 있는 범용 API 모델이 아닙니다. 그것은 오늘부터 Devin Desktop과 CLI에서 사용 가능한 상태로 출시되었습니다. Cognition의 표현에 따르면 Devin Web과 Fusion에서도 순차 배포가 진행 중입니다. 제3자 보도는 이 발표를 2026년 9월 10일로 보고 있으며, Cognition 자체 블로그 게시물의 필자 서명은 09.11.26으로 적혀 있습니다. 어느 쪽이든 불과 며칠 된 것입니다. 가중치는 독점이며 공개된 토큰당 요금표가 없습니다. SWE-2를 사용하려면 Devin 내에서 사용해야 합니다.

베이스는 Kimi K3로, 2.8조 개 파라미터의 Mixture-of-Experts 모델이며 토큰당 약 104B 개의 파라미터가 활성화됩니다 — SWE-1.7 베이스 크기의 약 3배입니다. Cognition은 K3가 그 지점에 도달하기 전에 이미 에이전트 코딩을 위해 강도 높은 RL 훈련을 받았으며, 자체 RL이 "여전히 상당한 여지를 찾아낸다"고 언급합니다. 이는 Kimi 베이스에서 사후 훈련된 SWE-1.7의 패턴과도 일치합니다.

어떤 단일 벤치마크 점수보다도 더 중요한 세부 사항이 있습니다: FrontierCode는 Cognition의 벤치마크입니다. 이 회사는 과제를 직접 작성하고 — 20명이 넘는 오픈소스 메인테이너와 함께, 과제당 40시간 이상을 들여, 각 메인테이너가 자신의 저장소에서 "병합 가능"이 무엇을 의미하는지 정의합니다 — 리더보드를 운영하며, 제출물을 채점합니다. 이는 진지한 평가 설계의 산물이자, 동시에 자사 내부 도구이기도 합니다. Cognition은 각 모델의 최고 점수를 추론 노력 설정 전반에 걸쳐 보고하며, 자체 방법론 부록에 따르면 Kimi K3를 포함한 오픈 웨이트 비교 모델들은 Cognition의 Devin CLI 안에서 실행되었습니다. 그렇다고 해서 그 숫자들이 틀린 것은 아닙니다. 이 모든 것은 여러분이 그 숫자들을 다시 말하는 바로 그 문장에 들어가야 합니다.

Two-column scoreboard headed 'Cognition SWE-2 vs Claude Fable 5.1'. Left column Cognition SWE-2: FrontierCode 1.1 Main 50.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%, Cost per rollout 64% lower, Base model Kimi K3 2.8T, Independent eval none yet. Right column Claude Fable 5.1: FrontierCode 1.1 Main 50.9%, Terminal-Bench 2.1 91.4%, Terminal-Bench 4 55.8%, Cost per rollout baseline, Base model proprietary, Independent eval third-party scored.

벤치마크 표를 솔직하게 읽기

네 가지 벤치마크, 모두 공급업체가 보고한 수치입니다. 각 항목이 실제로 말하는 내용은 다음과 같습니다. 각 행마다 한 줄씩.

• FrontierCode 1.1 Main — SWE-2 50.0%, Kimi K3 44.2%, Grok 4.6 48.0%, GPT-5.6 Sol 47.5%, Claude Fable 5.1 50.9%, GPT-6 Astra 53.3%, SWE-1.7 42.0%와 비교해. 최전선에서 1포인트 이내이며, 표의 다른 모든 항목보다 앞선다.

• DeepSWE 1.1 — SWE-2 73.0%, Claude Fable 5.1의 67.4%와 Grok 4.6의 67.5%를 앞서며, GPT-6 Astra의 74.1%에는 뒤진다. 이 행은 SWE-2가 프런티어 모델을 완전히 앞서는 가장 설득력 있는 사례다.

• Terminal-Bench 2.1 — SWE-2 92.8%, Cognition의 표에서 최고 점수로, 91.4%의 Claude Fable 5.1과 89.9%의 GPT-6 Astra를 앞선다. 이 수치는 대부분의 출시 헤드라인에 등장한 숫자다.

• Terminal-Bench 4 — SWE-2 27.3%, Claude Fable 5.1의 55.8%, GPT-6 Astra의 57.9%와 대비된다. 약 28점 차이이며, 가장 적게 인용되는 행이다.

뻔한 반론은 모두가 Terminal-Bench 4에서 점수가 떨어진다는 것이다 — 더 어렵고 더 긴 호라이즌의 후속 벤치마크이니 점수가 떨어지는 건 당연하다. 흥미로운 부분은 얼마나 떨어지는지이며, 그 하락은 비례적이지 않다. Terminal-Bench 2.1에서 4로 가면 Claude Fable 5.1은 약 35.6점, GPT-6 Astra는 약 32.0점을 잃는다. SWE-2는 약 65.5점, 그 기반인 Kimi K3는 약 66.8점을 잃는다. 따라서 장기 호라이즌 에이전트 작업에서 SWE-2는 단지 프런티어 모델들보다 아래에 있는 것이 아니라 — 작업이 길어질 때 그들보다 대략 두 배 빠르게 성능이 저하된다.

Terminal-Bench 4가 "현역" 버전인지는 분명히 짚을 가치가 있습니다. 그것은 현재 에디션이고, 2.1은 대체된 쪽입니다. SWE-2가 앞서는 행은 퇴역한 벤치마크입니다. SWE-2가 뒤처지는 행은 현재 벤치마크입니다. 두 사실 모두 맞으며, 출시 보도는 대체로 한쪽만 골라 다루는 경향이 있었습니다.

"Kimi K3 더하기 5" — 아무도 발표하지 않은 점수를 예측하는 휴리스틱

네 가지 벤치마크를 SWE-2 자체의 베이스 모델과 나란히 놓고 보면, 거의 기계적인 결론이 도출된다. Kimi K3와 비교해 SWE-2는 FrontierCode 1.1 Main에서 5.8점, DeepSWE 1.1에서 4.5점, Terminal-Bench 2.1에서 4.5점, Terminal-Bench 4에서 5.8점을 얻는다.

네 가지 벤치마크, 네 개의 격차, 모두 4.5에서 5.8 사이에 있다. 포스트 트레이닝은 수준을 바꿨을 뿐, 형태는 바꾸지 않았다. K3가 강한 곳마다 SWE-2는 거기에 약 5를 더한 만큼 강하다. K3가 약한 곳 — Terminal-Bench 4가 분명한 사례다 — 에서는 SWE-2가 약한 정도에 약 5를 더한 수준이다.

그러면 Cognition이 벤치마크하지 않은 모든 작업, 즉 대부분의 작업에 대해 쓸 만한 예측치를 얻을 수 있다. Kimi K3가 당신의 워크로드에서 얼마나 잘 수행하는지 찾아보고 5점을 더하면, 어떤 헤드라인 수치보다도 SWE-2에 대한 더 나은 추정치를 얻게 된다. 이는 또한 이번 릴리스의 실제 논지를 설명해 준다. Cognition은 프런티어를 뛰어넘었다고 주장하는 것이 아니다. 당신이 측정하는 어떤 축에서든 최고 모델 뒤에 일정한 거리를 유지하면서 전체 비용-성능 곡선을 바깥으로 밀어냈다고 주장하는 것이다.

64%는 사실이지만, 그걸 살 수는 없습니다.

“Claude Fable 5.1보다 64% 더 저렴하다”는 특정 측정값에 관한 참인 진술이다 — 그리고 그 측정값은 FrontierCode에서 롤아웃당 지출된 평균 미국 달러이지, 토큰 가격이 아니다. SWE-2에는 토큰당 요금이 없다. SWE-2 API가 없기 때문이다. 이 비용 주장은 Devin 내부에서 작업에 드는 비용을 설명하는데, Devin은 모델, 하네스, 스캐폴딩 및 Cognition의 서빙 스택을 하나의 청구서로 묶는다.

그 구분은 실질적인 의미가 있다. SWE-2의 비용을 다른 공급업체의 토큰 가격과 비교할 수는 없다. 둘은 같은 단위가 아니기 때문이다. 그리고 SWE-2를 다른 곳으로 가져갈 수도 없다. 독점 가중치, 단일 공급업체, 단일 에이전트 제품이기 때문이다. 일부 보도에서 나오는 "최대 70% 더 낮은 비용"이라는 수치는 Cognition이 여러 벤치마크에 걸쳐 제시하는 범위의 최댓값이다. FrontierCode 1.1 Main의 수치는 64%다.

효율 수치는 오히려 더 실용적인 이야기이며, 그 수치들 역시 벤더가 보고한 것이다. SWE-2는 중간 노력 설정에서 SWE-1.7의 FrontierCode 점수를 능가하면서 평균적으로 58% 더 적은 턴을 사용하고 81% 더 적은 비용이 든다. 실행당 평균 단계 수는 SWE-1.7의 127에서 중간 노력 설정의 53으로 떨어지며(높은 노력 설정에서는 80, 최대 노력 설정에서는 98), 첫 실제 코드 편집의 중앙값은 48단계에서 18단계로 이동한다. 이는 SWE-1.7이 단순한 작업을 과도하게 탐색했다는 불만에 대한 직접적인 답이며, 1점짜리 벤치마크 격차보다 훨씬 먼저 청구서에 나타나는 종류의 개선이다.

Screenshot of Cognition's official SWE-2 announcement blog post, headed 'Introducing SWE-2: Pushing the Pareto Frontier', bylined 09.11.26, showing the opening claim of 50.0% on FrontierCode 1.1 Main within one point of Fable 5.1 while being 64% cheaper, and a cost-versus-solve-rate Pareto chart labelling the medium, high and max effort levels.

훈련 트릭이 실제 뉴스다

리더보드 포지셔닝을 걷어내고 나면 여기에는 정말로 참신한 엔지니어링이 하나 있는데, 그래서 Devin을 한 번도 열어보지 않더라도 이번 릴리스는 읽어볼 가치가 있다.

Cognition은 세 가지 추론 노력 수준 — 중간, 높음, 최대 — 모두를 단일 RL 실행으로 훈련했다. 메커니즘은 노력 수준별 선형 비용 페널티로, 각 페널티는 해당 지점에서 기본 모델 자체의 비용-성능 파레토 곡선의 기울기와 일치하도록 조정되었다. 페널티가 왜 선형이어야 하는지에 대한 Cognition의 주장이 흥미로운 부분이다. 선형 페널티만이 훈련 목표를 분포의 형태에 따라 달라지는 무언가가 아니라 평균 비용과 해결률만의 함수로 유지한다.

일반적인 접근법은 추론 강도 수준을 따로 학습시키거나, 나중에 더 저렴한 체크포인트를 덧붙이는 것입니다. 이들을 하나의 실행 안에서 함께 학습시키는 것이야말로, 회사가 그 프런티어 위의 한 점이 아니라 프런티어 전체를 진전시켰다고 주장할 수 있게 해줍니다. 이를 뒷받침하는 변경 사항으로는 길이 가중 보상 베이스라인, RL 환경 수를 세 배로 늘리기, 지시 수행 오버레이, 그리고 이전 SWE-2 체크포인트를 사용해 검증기를 보상 해킹에 더 견고하게 만드는 플라이휠이 있습니다. 서빙 측면에서는 양자화 인식 학습을 적용한 NVFP4 및 FP8 커널, 15% 더 긴 수락 길이를 위해 재학습된 DSpark 추측 디코딩 드래프트 모델, 그리고 첫 토큰까지 걸리는 시간이 더 나빠지는 대가로 GPU당 처리량에서 10–20%의 가치를 지닌 프리필 지연기가 있습니다.

포스트트레이닝을 실행한다면, 그 레시피가 이번 릴리스에서 전이 가능한 부분입니다. 실행하지 않는다면, 시사점은 더 단순합니다: SWE-2가 저렴한 이유는 더 작은 모델이기 때문이 아닙니다. 그것을 실행하는 비용이 보상 함수에 쓰여 있었기 때문입니다.

Devin 외부에서 Kimi K3 기능을 원한다면

SWE-2는 OrcaRouter에 없으며, 앞으로도 없을 것입니다 — 독점 가중치, API 없음, Devin 전용 배포입니다. 그 기반 모델은 상황이 다릅니다. Kimi K3의 OrcaRouter 라우팅 경로는 kimi/kimi-k3이며, 100만 입력 토큰당 $3.00, 100만 출력 토큰당 $15.00으로 제공자 요금 대비 마크업이 없고, 100만 토큰 컨텍스트 윈도, 네이티브 도구 호출, 이미지 입력, 그리고 샘플링 설정 대신 최상위 reasoning_effort 파라미터를 통해 제어되는 추론 깊이를 지원합니다.

그것이 이번 릴리스의 실질적인 핵심을 솔직하게 표현한 버전입니다. SWE-2는 K3 위에 잘 수행된 RL 패스를 그 범위의 최상단에서 보여줍니다 — 실제로 4.5~5.8포인트 향상과 큰 효율성 이득을, 그에 따른 실제 비용을 치르면서 얻는 모습입니다. 그것이 주지 않는 것은 호출할 수 있는 모델입니다. 기반이 되는 역량을 자체 코드, 자체 하네스 또는 자체 파이프라인에 겨냥하고 싶다면, K3가 이 스택에서 실제로 접근할 수 있는 부분이며, 하나의 OpenAI 호환 엔드포인트를 통해 접근할 수 있습니다.

또한 숫자가 감사되지 않은 동안에는 이쪽이 베팅에서 더 안전한 쪽입니다. SWE-2의 벤치마크는 Cognition 자체 측정치이며, 회사 밖에서 이를 재현한 사람은 아무도 없습니다. 비교가 실제로 기대는 것은 Kimi K3의 벤치마크입니다 — 그리고 OrcaRouter를 통해 라우팅하면 그 뒤에 폴백 체인을 둘 수 있으므로, 시험 중인 모델이 당신을 실망시키는 날 곧바로 프로덕션 의존성이 되는 일은 없습니다.

Screenshot of the OrcaRouter model page for Kimi K3, showing model ID kimi/kimi-k3, input $3.00 per 1M tokens, output $15.00 per 1M tokens, cache read $0.300, 1M-token context, text and image input, p50 time-to-first-token of 9.85 seconds, and 2,739.4M tokens of traffic over 7 days.

누가 행동해야 하며, 무엇이 그것을 해결할까

이미 Devin에 비용을 지불하고 있다면, SWE-2는 분명히 좋은 소식입니다: 여러분의 제품에 배포되고 있고, 대체하는 것보다 작업당 비용이 더 저렴하며, 효율성 수치는 쉬운 작업에서 턴을 덜 낭비할 것임을 시사합니다. 대기열에서 간단한 작업부터 먼저 시도해 보세요 — effort 수준 설계상 비용 이점은 중간에 있습니다.

외부에서 코딩 모델을 선택하고 있다면, 독립적인 평가를 기다리세요. 아직 없습니다: Artificial Analysis에는 SWE-2 항목이 없고, FrontierCode 리더보드는 Cognition 자체의 도구입니다. 이를 판가름할 세 가지가 있습니다. Terminal-Bench 4에서 SWE-2를 제3자가 실행한 결과—이 행은 이 모델이 프런티어 인접 모델인지, 아니면 빠른 모델인지를 결정합니다. FrontierCode 격차에 대한 독립적인 재현. 그리고 토큰당 가격—이는 Cognition이 Devin 외부에서 이 모델을 판매해야 가능하며, 당신이 견적받는 다른 무엇과도 64%를 비교 가능하게 만들 유일한 변화입니다.

그때까지는 베이스 모델 격차가 이미 말해 주는 것이 공정한 요약이다. SWE-2는 Kimi K3에 5점을 더한 것이고, 그 대가는 Cognition이 보상 함수에 설계해 넣은 것이다. 이는 훈련에서의 진정한 성과이며 Devin 내부에서는 정말 좋은 거래다. 아직 프론티어 모델은 아니고, 그것이 모든 것을 이기는 것처럼 보이는 단 하나의 벤치마크는 집계를 중단한 바로 그 벤치마크다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트