Claude Opus 5.5 vs GPT-6 Astra를 위한 생성된 타이틀 카드입니다. 부제는 '6달러 차이, 그리고 272,000 토큰 초과 시 추가 요금'이며, 플랫한 저울 아이콘과 하단에 'Artificial Analysis 기준 최대 노력 시 지수; 가격은 각 공급업체 기준.'이라는 문구가 있습니다. 실제 OrcaRouter 로고는 오른쪽 하단에 합성되어 있습니다.
Guides & Insights

Claude Opus 5.5 vs GPT-6 Astra: 6달러의 격차, 그리고 272K를 넘어설 때 Astra가 부과하는 두 번째 가격

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이번 달 두 업체가 각자의 플래그십 모델에 대한 벤치마크 표를 공개했는데, 두 표 모두 자기 모델이 이기는 것으로 나오며, 두 모델을 서로 맞붙여 실행한 행은 어느 표에도 단 한 줄도 없다. Claude Opus 5.5, 2026년 9월 22일 출시, 백만 입력 토큰당 4달러, 그리고 GPT-6 Astra, 2026년 9월 3일 출시, 백만 입력 토큰당 10달러인 이 둘 사이에 겹치는 벤치마크는 정확히 두 개뿐이며, 그것도 둘이 나눠 가진다 — Anthropic의 표에서는 Opus 5.5가 AutomationBench에 준하는 작업을 가져가고 OpenAI의 표에서는 Astra가 가져가며, 과학적 추론에서는 두 표 모두에서 Astra가 확실히 앞선다. 벤더 자료가 알려줄 수 있는 것은 그 정도다. 독립적인 그림은 훨씬 덜 모호하고 정반대를 가리키며, 가격 구도는 둘 중 어느 쪽보다도 더 기울어져 있다.

각 측이 발표한 내용

Anthropic의 Opus 5.5 표는 자체 하네스와 자체 에포트 설정을 사용하며, Astra를 기재한 부분의 수치는 Anthropic의 것이지 재실행 결과가 아닙니다. 전체 세트를 벤더 보고로 간주하세요:

• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% 대 GPT-6 Astra 57.9% (Anthropic은 Opus 실행이 xhigh 추론 노력을 사용했다고 밝힘)

• FrontierCode v1.1 — Claude Opus 5.5 54.4% vs GPT-6 Astra 53.3%

• GDPval-AA v2.1, 지식 노동 — Claude Opus 5.5 1,846 Elo vs GPT-6 Astra 1,542

• AutomationBench — Claude Opus 5.5 40.0% 대 GPT-6 Astra 41.4% (Astra 우세)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58.7% 대 GPT-6 Astra 64.6% (Astra 우세)

• 도구를 사용한 인류의 마지막 시험 — Claude Opus 5.5 67.7% vs GPT-6 Astra 57.2%

OpenAI 진영 쪽은 비교를 맞추기가 더 어렵다. 왜냐하면 OpenAI는 Astra를 Anthropic의 플래그십과 비교한 것이 아니라 자사 전작과 비교해 공개했고, 선택한 벤치마크인 컴퓨터 사용, 프런트엔드 엔지니어링, 일반 지식은 Anthropic의 표에는 거의 전혀 등장하지 않기 때문이다. 그것은 부정직한 것이 아니라 일반적인 출시 행태이며, 두 공급업체의 표로 만든 비교가 두 모델의 비교가 아니라 두 선별 항목의 비교인 이유가 바로 여기에 있다. 두 표가 일치하는 단 한 가지는 Astra가 에이전틱 과학과 컴퓨터 사용에 강하다는 점, 그리고 코딩에서는 두 모델이 충분히 비슷해서 하네스 선택이 결과를 바꿀 수 있다는 점이다.

어느 벤더도 선택하지 않은 독립적인 읽기

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

Artificial Analysis는 모든 모델을 하나의 공개된 구성에서 실행하므로, 여기에서 동일한 평가자가 동일한 조건에서 산출한 수치는 Artificial Analysis의 수치뿐입니다:

• 인텔리전스 지수 — Claude Opus 5.5 58, 210개 중 1위 vs GPT-6 Astra 53, 6위

• 구성 라벨 — Claude Opus 5.5 "적응형 추론, 최대 노력, 기본 폴백", GPT-6 Astra "최대"

• 출력 속도 — GPT-6 Astra 초당 52.5토큰, 동일 가격대에서 하위권이며, Claude Opus 5.5는 아직 발표되지 않음

• 첫 토큰까지 걸리는 시간 — GPT-6 Astra 352.15초 vs 리더보드 중앙값 3.83초; Claude Opus 5.5는 아직 공개되지 않음

• 가격 — Claude Opus 5.5 백만 토큰당 입력 $4.00 / 출력 $20.00 vs GPT-6 Astra $10.00 / $50.00

• 컨텍스트 및 출력 — GPT-6 Astra 1M 컨텍스트와 128K 최대 출력 vs Claude Opus 5.5 1M과 128K

5점 지수 격차는 그 자체로 결정적이지 않으며, 그렇게 읽어서도 안 됩니다 — 두 모델 모두 같은 역량 구간에 속하는데, 이것이 이번 분기에 "프런티어"가 의미하는 바입니다. Astra 행들이 분명히 보여주는 것은, 프리미엄이 두 모델이 모두 등장하는 단 하나의 보드에서 역량 우위를 사주는 것은 아니라는 점입니다. 지연 시간 행은 솔직한 골칫거리입니다: 첫 토큰까지 352초는 이 그룹에서 큰 차이로 가장 높은데, 다만 이는 최대 노력에서 측정된 것이며 내보내기 전에 생각하는 추론 모델은 이 지표로 보면 항상 느려 보일 수밖에 없습니다. 52.5 tokens/sec라는 수치가 더 범용성 있는 지표이며, $10/$50짜리 모델로서는 낮은 편입니다.

Astra의 두 번째 가격, 272,000 토큰 이상

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

요금표에서 이 둘은 비교 자체가 불가능해지는데, Astra의 가격 책정에 단계가 있기 때문입니다. 표준 요율은 백만 토큰당 입력 $10.00, 캐시 입력 $1.00, 캐시 쓰기 $12.50, 출력 $50.00입니다. 하지만 입력 토큰 272,000개를 넘으면 전체 요청의 가격이 다시 책정됩니다. 초과분이 아니라 전체 호출이 입력 및 캐시 요율은 2배, 출력은 1.5배가 됩니다. 그러면 긴 컨텍스트 작업은 백만 토큰당 대략 입력 $20, 출력 $75가 됩니다.

Claude Opus 5.5는 이렇게 하지 않습니다. Anthropic은 100만 토큰 전체 창을 표준 가격으로 청구하며 $4.00와 $20.00를 책정하고, 90만 토큰 요청도 9천 토큰 요청과 동일한 토큰당 요율로 청구된다고 명시합니다. 따라서 이 둘 사이의 표면상 비율, 즉 Astra가 양방향 모두에서 Opus 5.5보다 2.5배 더 비싸다는 비율은 두 모델이 실제로 판매되는 워크로드에 적용되는 비율이 아닙니다. 대규모 작업 컨텍스트를 유지하는 장기 호라이즌 에이전트에서는 비교가 $20/$75 대 $4/$20이 되며, 이는 입력에서 5배, 출력에서 거의 4배입니다. 배치 가격은 이를 해결하기는커녕 더 악화시킵니다. Opus 5.5는 $2.00/$10.00로 절반이 되지만, Astra의 플렉스 티어는 이미 장기 컨텍스트의 경우 5배 더 높은 기준에서 $5.00/$25.00로 절반이 됩니다.

이것은 이 맞대결에서 결정과 가장 직접적으로 관련된 단 하나의 비대칭성이며, 어느 회사의 모든 출시 표에서도 보이지 않습니다. 두 공급업체 모두 대표 요금만 제시하기 때문입니다. 프롬프트가 272K 토큰 미만이라면 무시하세요. 저장소나 문서 집합을 읽는 에이전트를 만들고 있다면, 무엇이든 비교하기 전에 $20/$75로 가격을 계산하세요.

접근성은 명세의 일부입니다

Astra는 회사의 자체 Preparedness Framework에 따라 Critical 사이버보안 역량 임계값을 넘은 첫 OpenAI 모델이며, 이번 출시는 역량이 아니라 그 분류를 반영한 것입니다. 접근 권한은 처음에 제한된 일부 조직에만 열렸고, 엔터프라이즈 접근은 관리자가 사용자에게 표시되기 전에 이를 켜야 하며, 출시된 모델은 일부 범주의 작업을 아예 거부합니다. Claude Opus 5.5는 같은 문제를 반대 방향에서 겪는 버전으로 등장합니다. 즉, Anthropic이 이전에 Claude Fable 5.1을 위해 남겨두었던 안전장치 등급과 함께 출시되는데, 이는 계정이 검증되지 않는 한 대부분의 사이버보안 요청이 Claude Opus 4.8로 재라우팅되고 생물학 작업은 Claude Opus 5로 폴백된다는 뜻입니다.

두 동작 모두 같은 곳, 즉 여러분의 평가에서 나타납니다. Artificial Analysis가 Opus 5.5의 구성을 "Default Fallback"이라고 표기하는 바로 그 이유는, 요청이 여러분이 지정한 모델과 다른 모델에 도달할 수 있기 때문이며, 보안 또는 생명과학 프롬프트에서는 이것이 일상적으로 발생합니다. 여러분의 워크로드가 그러한 도메인에 속한다면, 요청에 있는 모델 문자열은 응답한 모델에 대한 보장이 아니며, 품질 수치에는 알 수 없는 비율의 호출에서 더 작은 모델이 포함될 것입니다. 어느 벤더도 이것을 숨기지 않고 있으며 — 둘 다 문서화하고 있습니다 — 하지만 어느 쪽의 헤드라인에서도 이것을 언급하지는 않습니다.

그것들 중에서 선택하기

이 맞대결이 실제로 제기하는 결정은 장문맥 워크로드가 Astra의 단계별 가격 책정을 정당화하는지 여부이며, 대부분의 팀에게 답은 '아니오'일 것입니다: Opus 5.5는 272K 미만의 모든 구간에서 더 저렴하고, 그 이상에서는 훨씬 더 저렴하며, 유일한 독립 리더보드에서 더 높은 점수를 받고, 추가 요금 없이 1M 토큰의 컨텍스트에 도달합니다. Astra의 사례는 더 좁지만 실재합니다 — 과학적 추론, 컴퓨터 사용, 그리고 OpenAI 생태계의 도구 — 그리고 여러분의 평가에서 이러한 부분에서 앞선다면, 그 프리미엄은 오류가 아니라 하나의 비용 항목입니다.

그것이 실용적으로 다가오는 지점은 두 모델을 서로 겨루어 어떻게 운영하느냐에 있습니다. 공정한 비교를 위해서는 두 모델이 같은 키와 같은 청구서 위에 놓여야 하기 때문입니다. 두 모델 모두 OrcaRouter를 통해 공급자 정가에 0% 마크업으로 라우팅할 수 있습니다 — Anthropic의 $4.00/$20.00인 Claude Opus 5.5와 $10.00/$50.00인 GPT-6 Astra — 즉 272K 결정을 두 개의 보도자료를 놓고 논쟁하는 대신 자체 트래픽에서 테스트할 수 있다는 뜻입니다. Astra를 그것이 승리하는 작업 클래스에 고정하고 나머지는 자동 장애 조치가 담당하도록 하는 것은 하나의 라우팅 규칙이며, 272K 선을 넘는 요청은 코드 변경 없이 더 저렴한 경로로 보낼 수 있습니다. 규칙이 애플리케이션이 아니라 라우터에 살아 있기 때문입니다.

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

답을 바꾸는 것은 무엇인가?

한 가지 방법이 있을 것이다: 공유 벤치마크에서 동일한 노력으로 맞붙는 통제된 일대일 비교다. 어느 벤더도 그런 비교를 발표하지 않았고 발표할 유인도 없으며, 그 결과 독립 지수만이 이용 가능한 유일한 동일 조건 비교로 남는다 — 그리고 그 지수는 Opus 5.5를 Astra보다 5점, 5계단 위에 두면서 토큰 가격은 절반도 안 된다. 주목할 만한 반론은 두 모델 모두 최대 노력으로 채점된 반면 Opus 5.5는 기본값이 중간으로 출시된다는 점이다. 만약 장기 지평의 과학 작업에서 Astra의 우위가 동일 노력 조건의 실행에서도 유지된다면, 프리미엄에 대한 근거는 약해지기는커녕 더 강해진다. 누군가 그것을 실행하기 전까지 방어 가능한 입장은 Astra가 범용 모델 가격이 매겨진 전문 모델이고, Opus 5.5는 우연히 더 높은 점수를 받은 범용 모델이라는 것이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트