
Cognition SWE-2: 64% 할인된 프론티어 근접 코딩, 그리고 그 밑에 깔린 벤치마크 함정
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 100만 토큰당
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
Cognition SWE-2는 이번 주 널리 퍼질 만한 숫자를 달고 출시됐다. FrontierCode 1.1 Main에서 50.0%를 기록해, 50.9%를 기록한 Claude Fable 5.1에 1포인트 이내로 근접했으면서도 비용은 64% 더 적게 든다. 이 모델은 Moonshot AI의 Kimi K3 — 2.8조 파라미터 오픈 웨이트 기반 — 을 포스트트레이닝한 것이며, Cognition은 자사의 강화 학습이 여러 벤치마크에서 5~6포인트를 더했다고 말한다. 두 수치 모두 벤더가 자체적으로 낸 것이고, 어느 것도 독립적으로 재현된 바 없다. 하지만 두 번째 수치는 첫 번째 수치를 읽는 방식을 바꿔 놓아야 할 주장이다. 왜냐하면 ‘플러스 5 또는 6’은 SWE-2가 하는 거의 모든 일, 심지어 크게 뒤지는 부분까지 설명하는 것으로 드러나기 때문이다.
그건 흠잡는 게 아니다. 이번 출시에서 가장 유용한 점이며, 거의 어떤 출시 보도도 입 밖에 내지 않는 부분이다.
Cognition이 실제로 출시한 것
SWE-2는 Devin의 코딩 모델이며, 가격표가 있는 범용 API 모델이 아닙니다. 그것은 오늘부터 Devin Desktop과 CLI에서 사용 가능한 상태로 출시되었습니다. Cognition의 표현에 따르면 Devin Web과 Fusion에서도 순차 배포가 진행 중입니다. 제3자 보도는 이 발표를 2026년 9월 10일로 보고 있으며, Cognition 자체 블로그 게시물의 필자 서명은 09.11.26으로 적혀 있습니다. 어느 쪽이든 불과 며칠 된 것입니다. 가중치는 독점이며 공개된 토큰당 요금표가 없습니다. SWE-2를 사용하려면 Devin 내에서 사용해야 합니다.
베이스는 Kimi K3로, 2.8조 개 파라미터의 Mixture-of-Experts 모델이며 토큰당 약 104B 개의 파라미터가 활성화됩니다 — SWE-1.7 베이스 크기의 약 3배입니다. Cognition은 K3가 그 지점에 도달하기 전에 이미 에이전트 코딩을 위해 강도 높은 RL 훈련을 받았으며, 자체 RL이 "여전히 상당한 여지를 찾아낸다"고 언급합니다. 이는 Kimi 베이스에서 사후 훈련된 SWE-1.7의 패턴과도 일치합니다.
어떤 단일 벤치마크 점수보다도 더 중요한 세부 사항이 있습니다: FrontierCode는 Cognition의 벤치마크입니다. 이 회사는 과제를 직접 작성하고 — 20명이 넘는 오픈소스 메인테이너와 함께, 과제당 40시간 이상을 들여, 각 메인테이너가 자신의 저장소에서 "병합 가능"이 무엇을 의미하는지 정의합니다 — 리더보드를 운영하며, 제출물을 채점합니다. 이는 진지한 평가 설계의 산물이자, 동시에 자사 내부 도구이기도 합니다. Cognition은 각 모델의 최고 점수를 추론 노력 설정 전반에 걸쳐 보고하며, 자체 방법론 부록에 따르면 Kimi K3를 포함한 오픈 웨이트 비교 모델들은 Cognition의 Devin CLI 안에서 실행되었습니다. 그렇다고 해서 그 숫자들이 틀린 것은 아닙니다. 이 모든 것은 여러분이 그 숫자들을 다시 말하는 바로 그 문장에 들어가야 합니다.

벤치마크 표를 솔직하게 읽기
네 가지 벤치마크, 모두 공급업체가 보고한 수치입니다. 각 항목이 실제로 말하는 내용은 다음과 같습니다. 각 행마다 한 줄씩.
• FrontierCode 1.1 Main — SWE-2 50.0%, Kimi K3 44.2%, Grok 4.6 48.0%, GPT-5.6 Sol 47.5%, Claude Fable 5.1 50.9%, GPT-6 Astra 53.3%, SWE-1.7 42.0%와 비교해. 최전선에서 1포인트 이내이며, 표의 다른 모든 항목보다 앞선다.
• DeepSWE 1.1 — SWE-2 73.0%, Claude Fable 5.1의 67.4%와 Grok 4.6의 67.5%를 앞서며, GPT-6 Astra의 74.1%에는 뒤진다. 이 행은 SWE-2가 프런티어 모델을 완전히 앞서는 가장 설득력 있는 사례다.
• Terminal-Bench 2.1 — SWE-2 92.8%, Cognition의 표에서 최고 점수로, 91.4%의 Claude Fable 5.1과 89.9%의 GPT-6 Astra를 앞선다. 이 수치는 대부분의 출시 헤드라인에 등장한 숫자다.
• Terminal-Bench 4 — SWE-2 27.3%, Claude Fable 5.1의 55.8%, GPT-6 Astra의 57.9%와 대비된다. 약 28점 차이이며, 가장 적게 인용되는 행이다.
뻔한 반론은 모두가 Terminal-Bench 4에서 점수가 떨어진다는 것이다 — 더 어렵고 더 긴 호라이즌의 후속 벤치마크이니 점수가 떨어지는 건 당연하다. 흥미로운 부분은 얼마나 떨어지는지이며, 그 하락은 비례적이지 않다. Terminal-Bench 2.1에서 4로 가면 Claude Fable 5.1은 약 35.6점, GPT-6 Astra는 약 32.0점을 잃는다. SWE-2는 약 65.5점, 그 기반인 Kimi K3는 약 66.8점을 잃는다. 따라서 장기 호라이즌 에이전트 작업에서 SWE-2는 단지 프런티어 모델들보다 아래에 있는 것이 아니라 — 작업이 길어질 때 그들보다 대략 두 배 빠르게 성능이 저하된다.
Terminal-Bench 4가 "현역" 버전인지는 분명히 짚을 가치가 있습니다. 그것은 현재 에디션이고, 2.1은 대체된 쪽입니다. SWE-2가 앞서는 행은 퇴역한 벤치마크입니다. SWE-2가 뒤처지는 행은 현재 벤치마크입니다. 두 사실 모두 맞으며, 출시 보도는 대체로 한쪽만 골라 다루는 경향이 있었습니다.
"Kimi K3 더하기 5" — 아무도 발표하지 않은 점수를 예측하는 휴리스틱
네 가지 벤치마크를 SWE-2 자체의 베이스 모델과 나란히 놓고 보면, 거의 기계적인 결론이 도출된다. Kimi K3와 비교해 SWE-2는 FrontierCode 1.1 Main에서 5.8점, DeepSWE 1.1에서 4.5점, Terminal-Bench 2.1에서 4.5점, Terminal-Bench 4에서 5.8점을 얻는다.
네 가지 벤치마크, 네 개의 격차, 모두 4.5에서 5.8 사이에 있다. 포스트 트레이닝은 수준을 바꿨을 뿐, 형태는 바꾸지 않았다. K3가 강한 곳마다 SWE-2는 거기에 약 5를 더한 만큼 강하다. K3가 약한 곳 — Terminal-Bench 4가 분명한 사례다 — 에서는 SWE-2가 약한 정도에 약 5를 더한 수준이다.
그러면 Cognition이 벤치마크하지 않은 모든 작업, 즉 대부분의 작업에 대해 쓸 만한 예측치를 얻을 수 있다. Kimi K3가 당신의 워크로드에서 얼마나 잘 수행하는지 찾아보고 5점을 더하면, 어떤 헤드라인 수치보다도 SWE-2에 대한 더 나은 추정치를 얻게 된다. 이는 또한 이번 릴리스의 실제 논지를 설명해 준다. Cognition은 프런티어를 뛰어넘었다고 주장하는 것이 아니다. 당신이 측정하는 어떤 축에서든 최고 모델 뒤에 일정한 거리를 유지하면서 전체 비용-성능 곡선을 바깥으로 밀어냈다고 주장하는 것이다.
64%는 사실이지만, 그걸 살 수는 없습니다.
“Claude Fable 5.1보다 64% 더 저렴하다”는 특정 측정값에 관한 참인 진술이다 — 그리고 그 측정값은 FrontierCode에서 롤아웃당 지출된 평균 미국 달러이지, 토큰 가격이 아니다. SWE-2에는 토큰당 요금이 없다. SWE-2 API가 없기 때문이다. 이 비용 주장은 Devin 내부에서 작업에 드는 비용을 설명하는데, Devin은 모델, 하네스, 스캐폴딩 및 Cognition의 서빙 스택을 하나의 청구서로 묶는다.
그 구분은 실질적인 의미가 있다. SWE-2의 비용을 다른 공급업체의 토큰 가격과 비교할 수는 없다. 둘은 같은 단위가 아니기 때문이다. 그리고 SWE-2를 다른 곳으로 가져갈 수도 없다. 독점 가중치, 단일 공급업체, 단일 에이전트 제품이기 때문이다. 일부 보도에서 나오는 "최대 70% 더 낮은 비용"이라는 수치는 Cognition이 여러 벤치마크에 걸쳐 제시하는 범위의 최댓값이다. FrontierCode 1.1 Main의 수치는 64%다.
효율 수치는 오히려 더 실용적인 이야기이며, 그 수치들 역시 벤더가 보고한 것이다. SWE-2는 중간 노력 설정에서 SWE-1.7의 FrontierCode 점수를 능가하면서 평균적으로 58% 더 적은 턴을 사용하고 81% 더 적은 비용이 든다. 실행당 평균 단계 수는 SWE-1.7의 127에서 중간 노력 설정의 53으로 떨어지며(높은 노력 설정에서는 80, 최대 노력 설정에서는 98), 첫 실제 코드 편집의 중앙값은 48단계에서 18단계로 이동한다. 이는 SWE-1.7이 단순한 작업을 과도하게 탐색했다는 불만에 대한 직접적인 답이며, 1점짜리 벤치마크 격차보다 훨씬 먼저 청구서에 나타나는 종류의 개선이다.

훈련 트릭이 실제 뉴스다
리더보드 포지셔닝을 걷어내고 나면 여기에는 정말로 참신한 엔지니어링이 하나 있는데, 그래서 Devin을 한 번도 열어보지 않더라도 이번 릴리스는 읽어볼 가치가 있다.
Cognition은 세 가지 추론 노력 수준 — 중간, 높음, 최대 — 모두를 단일 RL 실행으로 훈련했다. 메커니즘은 노력 수준별 선형 비용 페널티로, 각 페널티는 해당 지점에서 기본 모델 자체의 비용-성능 파레토 곡선의 기울기와 일치하도록 조정되었다. 페널티가 왜 선형이어야 하는지에 대한 Cognition의 주장이 흥미로운 부분이다. 선형 페널티만이 훈련 목표를 분포의 형태에 따라 달라지는 무언가가 아니라 평균 비용과 해결률만의 함수로 유지한다.
일반적인 접근법은 추론 강도 수준을 따로 학습시키거나, 나중에 더 저렴한 체크포인트를 덧붙이는 것입니다. 이들을 하나의 실행 안에서 함께 학습시키는 것이야말로, 회사가 그 프런티어 위의 한 점이 아니라 프런티어 전체를 진전시켰다고 주장할 수 있게 해줍니다. 이를 뒷받침하는 변경 사항으로는 길이 가중 보상 베이스라인, RL 환경 수를 세 배로 늘리기, 지시 수행 오버레이, 그리고 이전 SWE-2 체크포인트를 사용해 검증기를 보상 해킹에 더 견고하게 만드는 플라이휠이 있습니다. 서빙 측면에서는 양자화 인식 학습을 적용한 NVFP4 및 FP8 커널, 15% 더 긴 수락 길이를 위해 재학습된 DSpark 추측 디코딩 드래프트 모델, 그리고 첫 토큰까지 걸리는 시간이 더 나빠지는 대가로 GPU당 처리량에서 10–20%의 가치를 지닌 프리필 지연기가 있습니다.
포스트트레이닝을 실행한다면, 그 레시피가 이번 릴리스에서 전이 가능한 부분입니다. 실행하지 않는다면, 시사점은 더 단순합니다: SWE-2가 저렴한 이유는 더 작은 모델이기 때문이 아닙니다. 그것을 실행하는 비용이 보상 함수에 쓰여 있었기 때문입니다.
Devin 외부에서 Kimi K3 기능을 원한다면
SWE-2는 OrcaRouter에 없으며, 앞으로도 없을 것입니다 — 독점 가중치, API 없음, Devin 전용 배포입니다. 그 기반 모델은 상황이 다릅니다. Kimi K3의 OrcaRouter 라우팅 경로는 kimi/kimi-k3이며, 100만 입력 토큰당 $3.00, 100만 출력 토큰당 $15.00으로 제공자 요금 대비 마크업이 없고, 100만 토큰 컨텍스트 윈도, 네이티브 도구 호출, 이미지 입력, 그리고 샘플링 설정 대신 최상위 reasoning_effort 파라미터를 통해 제어되는 추론 깊이를 지원합니다.
그것이 이번 릴리스의 실질적인 핵심을 솔직하게 표현한 버전입니다. SWE-2는 K3 위에 잘 수행된 RL 패스를 그 범위의 최상단에서 보여줍니다 — 실제로 4.5~5.8포인트 향상과 큰 효율성 이득을, 그에 따른 실제 비용을 치르면서 얻는 모습입니다. 그것이 주지 않는 것은 호출할 수 있는 모델입니다. 기반이 되는 역량을 자체 코드, 자체 하네스 또는 자체 파이프라인에 겨냥하고 싶다면, K3가 이 스택에서 실제로 접근할 수 있는 부분이며, 하나의 OpenAI 호환 엔드포인트를 통해 접근할 수 있습니다.
또한 숫자가 감사되지 않은 동안에는 이쪽이 베팅에서 더 안전한 쪽입니다. SWE-2의 벤치마크는 Cognition 자체 측정치이며, 회사 밖에서 이를 재현한 사람은 아무도 없습니다. 비교가 실제로 기대는 것은 Kimi K3의 벤치마크입니다 — 그리고 OrcaRouter를 통해 라우팅하면 그 뒤에 폴백 체인을 둘 수 있으므로, 시험 중인 모델이 당신을 실망시키는 날 곧바로 프로덕션 의존성이 되는 일은 없습니다.

누가 행동해야 하며, 무엇이 그것을 해결할까
이미 Devin에 비용을 지불하고 있다면, SWE-2는 분명히 좋은 소식입니다: 여러분의 제품에 배포되고 있고, 대체하는 것보다 작업당 비용이 더 저렴하며, 효율성 수치는 쉬운 작업에서 턴을 덜 낭비할 것임을 시사합니다. 대기열에서 간단한 작업부터 먼저 시도해 보세요 — effort 수준 설계상 비용 이점은 중간에 있습니다.
외부에서 코딩 모델을 선택하고 있다면, 독립적인 평가를 기다리세요. 아직 없습니다: Artificial Analysis에는 SWE-2 항목이 없고, FrontierCode 리더보드는 Cognition 자체의 도구입니다. 이를 판가름할 세 가지가 있습니다. Terminal-Bench 4에서 SWE-2를 제3자가 실행한 결과—이 행은 이 모델이 프런티어 인접 모델인지, 아니면 빠른 모델인지를 결정합니다. FrontierCode 격차에 대한 독립적인 재현. 그리고 토큰당 가격—이는 Cognition이 Devin 외부에서 이 모델을 판매해야 가능하며, 당신이 견적받는 다른 무엇과도 64%를 비교 가능하게 만들 유일한 변화입니다.
그때까지는 베이스 모델 격차가 이미 말해 주는 것이 공정한 요약이다. SWE-2는 Kimi K3에 5점을 더한 것이고, 그 대가는 Cognition이 보상 함수에 설계해 넣은 것이다. 이는 훈련에서의 진정한 성과이며 Devin 내부에서는 정말 좋은 거래다. 아직 프론티어 모델은 아니고, 그것이 모든 것을 이기는 것처럼 보이는 단 하나의 벤치마크는 집계를 중단한 바로 그 벤치마크다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
