제목 카드에는 "Claude Opus 5.5, Coding Agent Index에서 66으로 1위"가 적혀 있고, 부제는 "더 저렴해진 토큰, 더 커진 작업 비용"이며, 그 아래에 세 개의 둥근 카드가 있다: Coding Agent Index 66, 작업당 비용 $13.04, 21% 상승, Claude Opus 5: 60, $10.79.
Guides & Insights

Claude Opus 5.5, 코딩 에이전트 지수 66으로 1위 — 그리고 작업 비용은 21% 상승

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

공급업체는Claude Opus 5.5의 토큰 가격을 2026년 9월 22일에 20% 인하했다. 이틀 후, Artificial Analysis는 에이전트 청구서에 그 인하가 어떤 영향을 미쳤는지 보여주는 코딩 에이전트 측정 결과를 발표했다: 작업당 비용은 상승하여 21%, $13.04가 되었는데, 이는 $10.79에서 오른 것인데, 이는 동일 지수가 Claude Opus 5에 대해 부과하는 금액이다. 점수도 올랐다 — 66점으로, Coding Agent Index에서 Artificial Analysis가 측정한 최고 점수라고 설명하며, 동일 구성에서 Claude Opus 5보다 6점, Claude Fable 5.1보다 4점 앞선다. 이 두 가지 사실은 동시에 참이며, 동시에 참인 이유가 바로 이 순위의 전체 이야기이다. 모델이 더 많이 소비하는 더 저렴한 토큰이 더 저렴한 작업은 아니며, 긴 에이전트 실행에서 최대 추론 노력으로 Claude Opus 5.5는 그것을 훨씬 더 많이 소비한다.

Coding Agent Index가 실제로 점수를 매기는 것

이것은 모델 리더보드가 아니다. 그 위의 모든 행은 하네스-모델 쌍 — 특정 코딩 에이전트 안에서 특정 노력 설정으로 실행되는 체크포인트다. 모두가 인용하는 행은 Claude Opus 5.5이며, max 노력으로 Claude Code 안에서 실행되는 것으로, 이는 Anthropic이 만들고 튜닝하는 하네스다. Claude Opus 5의 60과 Claude Fable 5.1의 62는 같은 하네스와 같은 노력 설정에서 나온 것이며, 이것이 이들을 정직한 비교로 만든다. 다른 코딩 에이전트에서 두 모델 중 하나에 대한 행은 다른 측정이며, 같은 측정인 것처럼 여기에 인쇄되지 않는다.

이 지수는 버전이 지정되어 있으며, 버전은 그 위에 붙은 브랜드 이름보다 더 중요합니다. 현재 공개된 보드는 v1.5 버전이며, 세 가지 평가를 평균내며, 각 평가는 동일한 가중치를 가지며, 각각 작업당 세 번의 시도에 걸쳐 평균한 pass@1로 보고됩니다:

Terminal-Bench 4.0 — 에이전트 기반 셸 및 명령줄 작업: 파일 시스템 탐색, 도구를 올바르게 사용하기, 중간 단계의 실패에서 복구하기, 그리고 다단계 워크플로 완료하기.

DeepSWE v1.1 — 소프트웨어 엔지니어링 작업, 즉 저장소 편집 작업입니다.

SWE-Atlas-QnA — 리포지토리 이해형 질문으로, 코드베이스를 수정하는 것이 아니라 읽어서 답을 찾는 유형입니다.

세 가지 평가, 하나의 숫자, 그리고 그 옆에 인쇄된 작업당 비용 열. 그 비용 열은 이 지수가 점수 하나만보다 더 유용한 이유이며, 또한 헤드라인 숫자가 보기보다 읽기 어려운 이유이기도 하다.

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

세 가지 구성 요소, 그리고 여섯 개의 점이 어디에서 왔는지

Artificial Analysis는 구성 요소 행을 종합 지수와 함께 공개했으며, 이들은 균등하게 움직이지 않습니다:

Terminal-Bench 4.063.1%를 기록한 Claude Opus 5.5 대 54.5%를 기록한 Claude Opus 5, 상승폭은 8.6점. 이는 세트에서 가장 큰 단일 개선입니다.

DeepSWE v1.168.4% 대비 62.5%, 5.9포인트 상승.

SWE-Atlas-QnA66.4% 대비 62.1%, 4.3포인트 상승.

그 세 가지를 평균 내면 66.0이 나오고, 그것이 종합 점수입니다. 흥미로운 부분은 상승의 형태입니다. 모델은 코드베이스를 읽는 능력에서 가장 적게 향상되었고, 셸을 다루는 능력에서 가장 많이 향상되었습니다. Terminal-Bench는 사람들이 실제로 "코딩 에이전트"라고 말할 때 의미하는 것에 가장 가까운 평가입니다. 모델이 명령을 선택하고 출력을 읽으며 다음에 무엇을 할지 결정하는 장시간 실행 루프이고, 각 단계 사이에 사람이 개입하지 않습니다. 여기서의 8.6점 상승은 코드 생성이 아니라 지속적인 도구 사용에 관한 진술입니다.

그것이 어디에서 개선을 기대할 수 있는지에 관해 무엇을 함의하는지 주목하세요. 워크로드가 "이 저장소를 설명해 줘"라면, Claude Opus 5.5는 Claude Opus 5보다 소폭 업그레이드입니다 — 4점입니다. 워크로드가 "테스트 스위트가 통과할 때까지 실행하고, 깨지는 부분을 고쳐라"라면, 그것은 표에서 가장 큰 상승폭입니다.

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

순위 옆에 인쇄된 숫자: 작업당 $13.04

가격 인하가 발표된 방식과는 다르게 보이게 만드는 계산은 이렇습니다. Anthropic의 Claude Opus 5.5 정가는 백만 입력 토큰당 $4.00이고 백만 출력 토큰당 $20.00로, Claude Opus 5의 $5.00와 $25.00에서 인하되었으며, 캐시 읽기는 60% 하락해 $0.20 백만당입니다. 그 각 항목은 모두 더 저렴합니다. Artificial Analysis가 최대 노력에서 작업 비용이 얼마인지 추정한 값은 어쨌든 더 높습니다:

작업당 비용 — Claude Opus 5.5의 경우 $13.04로, Claude Opus 5의 $10.79 대비 21% 상승했습니다. 동일한 지수, 동일한 하네스, 동일한 노력 설정 기준입니다.

작업당 총 토큰 — 대략 15.6M, 11.4M 대비 약 37% 증가.

작업당 출력 토큰 — 대략 333,000 대비 137,000으로, 두 배 이상입니다. 출력은 비용이 많이 드는 방향이며, 가장 많이 움직인 항목입니다.

작업당 캐시된 입력 — 대략 14.6M10.9M으로, 약 34% 증가했습니다. 60%의 캐시 읽기 절감이 여기서 실질적인 효과를 내고 있지만, 컨텍스트를 3분의 1 더 읽는 작업을 상쇄하기에는 역부족입니다.

공개된 요율로 계산해 보면 윤곽이 드러난다. 출력 토큰만 따져 보자: 333,000토큰에 백만 개당 $20.00이면 약 $6.66 — 두 배로 늘어난 단일 항목 하나에서 나온, 전체 $13.04 추정치의 약 절반이다. 캐시 읽기 항목은 볼륨이 막대하고 가격은 거의 무료에 가깝다: 14.6M 토큰에 백만 개당 $0.20이면 $3 미만이다. 20% 인하는 실제이고 캐시 인하도 실제이다; 에이전트 루프에서 최대 노력으로 돌리면, 더 오래 생각하고 더 많이 쓰는 모델 앞에서 그저 압도되고 만다.

이는 예산을 책정하는 방식에 직접적인 영향을 미칩니다. 팀이 하루에 최대 에포트로 500개의 코딩 에이전트 작업을 실행한다면, $10.79와 $13.04의 차이는 약 하루 $1,125 — 같은 작업 수에 대해 한 달에 약 $34,000 — 입니다. 이 숫자가 모델 변경을 승인하는 사람에게 제시해야 할 숫자이며, 가격 인하가 암시하는 숫자는 아닙니다.

왜 $5.98과 $13.04가 모두 사실인가

Artificial Analysis는 다른 작업당 비용 수치를 며칠 전에 동일한 모델에 대해 발표했는데, 라벨 없이 두 수치를 함께 읽으면 모순처럼 보인다. 하지만 모순이 아니다. 이 둘은 서로 다른 두 가지 평가이며, 그 차이는 시사하는 바가 있다.

에서 Intelligence Index9월 22일 글은 Claude Opus 5.5의 작업당 비용을 $5.98로 책정했습니다. 이는 Claude Opus 5의 $5.86과 거의 같은 수준인데, 작업당 출력 토큰이 Opus 5의 73,000개에 비해 약 119,000개임에도 그렇습니다. 여기서는 가격 인하와 추가 토큰이 거의 정확히 상쇄됩니다.Coding Agent Index에서는 최대 노력일 때, Claude Code에서, 동일 모델의 비용은 $13.04로 $10.79에 대비됩니다.

둘 다 서로 다른 워크로드를 정직하게 측정한 결과입니다. 질의응답 평가는 짧은 주고받기이고, 에이전트 작업은 컨텍스트가 커져 가는 도구 호출의 긴 루프이며, 그 증가는 가격이 가장 높은 출력 방향에서 복리처럼 불어납니다. 실용적인 교훈은 "가격 인하가 추가 토큰을 상쇄하는가?"에는 단일한 답이 없다는 것입니다 — 그것은 작업 길이에 달려 있고, 작업이 길고 에이전트적일수록 상쇄 효과는 더 나빠집니다. 짧은 답변 벤치마크를 기준으로 예산을 잡으면, 에이전트의 청구서를 과소평가하게 될 것입니다.

해당 행에 있어야 할 세 가지 주의사항

66은 Claude Code의 수치이지, 순수 모델의 수치가 아니다. 이 지수는 도구 라우팅, 재시도 로직, 컨텍스트 관리가 에이전트의 측정된 성능과 분리될 수 없다는 논거에 따라 모델과 하네스를 의도적으로 짝지어 평가한다. 여기서는 그 점이 Anthropic에 유리하게 작용하는데, 점수가 매겨지는 하네스가 자사 것이기 때문이다. Artificial Analysis는 하네스 비교 뷰를 곧 제공할 예정이라고 표시하고 있다. 그것이 존재하기 전까지는 6점 차이 중 얼마가 체크포인트 때문이고 얼마가 이를 둘러싼 스캐폴딩 때문인지 아무도 말할 수 없다.

Anthropic 자체의 Terminal-Bench 4.0 수치는 이 구성 요소보다 높으며, 이는 Anthropic이 직접 실행한 것입니다. 출시 자료에서는 66.4%xhigh effort에서 보고했고, Coding Agent Index 구성 요소는 63.1%로 max에서 측정되었으며, Artificial Analysis의 별도 독립 실행에서는 동일한 벤치마크 버전에 대해 자체 하네스에서 59.6%를 측정했습니다. 세 개의 숫자, 세 가지 구성, 세 주체. 위 행의 63.1%는 해당 인덱스 자체의 구성 요소이므로 그 인덱스의 다른 숫자들과만 비교해야 하며, 벤더가 보고한 66.4%는 제3자가 재현하지 않은 수치로, 다른 effort 설정에 속합니다.

인덱스 개정이 진행됩니다. 이 블로그는 9월 초에 동일한 보드의 이전 버전에서 다른 Coding Agent Index 행을 보고했으며, 그 오래된 수치들은 v1.5와 비교할 수 없습니다 — Terminal-Bench 4.0이 이전 버전을 대체했을 때 평가 세트 자체가 변경되었습니다. 제3자 미러는 여전히 이전 버전 레이블이 있는 오래된 스냅샷을 보유하고 있습니다. 이 인덱스에서 Claude Opus 5.5에 대한 숫자가 현재 v1.5 행에서 나온 것이 아니라면, 이를 v1.5 숫자 옆에 두지 말고, 둘 사이의 델타를 계산하지 마십시오.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

실제로 배포해야 할 것

이 순위는 최대 노력 기준의 수치이며, 최대 노력은 거의 아무도 기본값으로 내놓아서는 안 되는 설정입니다. Claude Opus 5.5에는 다섯 가지 노력 설정 — 낮음, 중간, 높음, xhigh, 최대 — 이 있고, 모델의 기본값은 중간입니다. Artificial Analysis는 더 낮은 설정에서의 Coding Agent Index 행을 공개하지 않았으므로, 그쪽의 비용 절감은 이 지수에서는 정량화되지 않았습니다. Intelligence Index에서는 같은 모델이 중간 설정으로 51을 기록했습니다 — Claude Opus 5의 최대와 동일 — 작업당 $1.34였습니다. 절감이 존재하는 방향은 바로 그쪽이며, 그것은 다른 모델이 아니라 하나의 설정입니다.

현실적인 패턴은 분할입니다: 8.6포인트의 Terminal-Bench 향상을 사려는 장시간 자율 루프에는 최대 노력을 유지하고, 일상적인 작업은 모델이 여전히 Claude Opus 5가 끝낸 지점보다 훨씬 앞서 있는 더 낮은 노력으로 실행하는 것입니다. 노력은 배포가 아니라 요청 파라미터이기 때문에, 그 분할은 라우팅 규칙이며, 두 모델 모두 같은 카탈로그에 올라 있습니다 — Anthropic의 정가를 0% 마크업으로 그대로 전달, 따라서 벤더 가격 인하는 anthropic/claude-opus-5.5에 발표되는 당일 바로 반영되며, 두 모델을 여러분의 작업에 대해 A/B 테스트하는 데 두 번째 계약이나 코드 변경이 필요하지 않습니다. 특히 최대 노력 경로에서는 단일 작업이 장시간 무인 실행이 될 수 있는데, 자동 페일오버가 바로 정체된 제공자 때문에 전체 루프를 잃는 일을 막아줍니다.

아직 측정되지 않은 것은 무엇인가

세 가지가 이 그림을 바꿀 텐데, 아직 그중 어느 것도 존재하지 않습니다. Claude Opus 5.5를 경쟁 체크포인트와 동일 에포트·동일 하네스로 비교한 결과는 없습니다 — 이용 가능한 모든 벤더 간 비교는 두 벤더 표를 나란히 배치한 것에 불과합니다. 중간 또는 높은 에포트로 실행된 Coding Agent Index 결과가 공개된 적도 없는데, 대부분의 프로덕션 트래픽이 위치할 곳이 바로 그 지점입니다. 그리고 하네스 귀속 문제 — 66점 중 얼마가 모델이고 얼마가 Claude Code인지 — 는 인덱스에서 인정되었지만 보류되었습니다.

오늘 당장 실행에 옮길 수 있는 것은 순위표보다 범위가 더 좁고 더 유용하다. Claude Opus 5.5는 지속적인 셸 기반 에이전트 작업에서 Claude Opus 5보다 확실히 더 낫다 — 크고, 일관되며, 독립적으로 산출된 이득을 가진 유일한 구성 요소다. 또한 그 이득이 측정된 설정에서는 작업당 약 $2.25 더 비싸며, 토큰당 가격 인하는 그 수치에 미치지 못한다. 루프가 길고 실패 비용이 높은 곳에서는 최대 노력(max effort)으로 배포하고, 나머지 모든 곳에서는 더 저렴한 설정을 유지하라. 그리고 더 낮은 노력(lower-effort) 행이 나타나면 인덱스를 다시 확인하라, 왜냐하면 그것이 대부분의 팀이 실제로 비용을 지불하게 될 구성이기 때문이다. 가격 인하만을 위해 전환한다면, 당신은 잘못된 것을 사고 있는 것이다 — 모델은 토큰당 더 저렴하고 작업당 더 비싸며, 그 두 수치 중 하나만 청구서에 나타난다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트