기사용 타이틀 카드로, 제목은 'GPT-6 Astra Benchmarks', 부제는 '모든 점수, 누가 측정했는지, 그리고 숫자가 의미를 잃기 시작하는 지점'입니다. 세 개의 통계 칩에는 'FrontierMath Tier 4: 98% (포화)', 'Terminal-Bench 4.0: 57.9% (벤더 보고)' 그리고 'DeepSWE v1.1: 74% (독립, 공동 1위)'가 적혀 있습니다. 하단 문구에는 '모델 공개 2026년 9월 3일. 수치 재확인 2026년 9월 16일.'이 적혀 있습니다. OrcaRouter 로고는 여백이 있는 캔버스의 오른쪽 아래 모서리에 있습니다.
Guides & Insights

GPT-6 Astra 벤치마크: 모든 점수, 누가 측정했는가, 그리고 숫자가 더 이상 아무 의미도 없어지는 지점

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GPT-6 Astra는 FrontierMath Tier 4에서 98%, ARC-AGI-3에서 99.9%를 기록했으며, OpenAI 스스로 두 벤치마크 모두 포화 상태라고 말합니다. 그렇기 때문에 이 모델 페이지에서 가장 많이 인용되는 두 숫자가, 정작 이 모델을 써야 할지에 관해서는 가장 적은 것을 알려주는 두 숫자가 됩니다. GPT-5.6 SolClaude Fable 5.1을 놓고 보면, 실제로 변별력이 있는 항목은 다른 곳에 있습니다. Terminal-Bench 4.0에서의 57.9%, 독립적으로 수행되었으면서 동시에 동점이기도 한 DeepSWE v1.1에서의 74%, 그리고 여기 어떤 백분율보다도 사용성에 관해 더 많은 것을 결정하는 작업당 소요 시간 수치입니다. 이 모델 자체는 2026년 9월 3일 출시로, 발행 시점 기준 13일 된 것이지 출시 뉴스가 아닙니다. 이 문서는 GPT-6 Astra가 어떤 점수를 받는지, 각 측정을 누가 수행했는지, 그리고 각 숫자가 무엇을 입증하고 무엇을 입증하지 않는지에 대한 참조 페이지입니다.

13일 된 모델이 이번 주에도 여전히 한 페이지를 차지할 가치가 있는 이유는, 독자가 실제로 행동에 옮길 수 있는 것들이 출시 이후에 도착했기 때문이다. 광범위한 제공 완료: OpenAI는 9월 8일 Astra가 Codex와 ChatGPT Work의 Plus, Pro, Business, Enterprise 사용자에게 완전히 출시되었다고 밝혔다. 이는 9월 3일 “오늘부터 제한된 일부 조직에 순차 제공되며, 앞으로 며칠에 걸쳐 모든 ChatGPT Plus, Pro, Business, Enterprise 사용자에게 제공되고, OpenAI API, Microsoft Azure, AWS Bedrock을 통해서도 이용할 수 있게 될 것”이라는 문구로 시작된 것이었다. 출시 당시 기본적으로 꺼져 있던 Enterprise 액세스는 관리자가 해당 적용 요금표에 따라 켤 수 있는 항목이 되었고, 9월 9일 공개된 이 모델에 관한 OpenAI의 엔터프라이즈 업무 페이지에는 관리자 제어 기능과 네 가지 엔터프라이즈 플러그인이 함께 제공되었다. 그리고 이 모델에 대한 첫 독립적 평가들이 나왔는데, 바로 이것이 이 모델을 공급업체 슬라이드에서 읽어낸 점수판에서 구매자가 따져볼 수 있는 무언가로 바꿔 놓는다.

전체 벤치마크 목록, 모든 행에 출처 포함

아래의 모든 내용은 해당 행에서 달리 명시하지 않는 한 OpenAI가 보고한 것입니다. 그 구분은 단순한 장식이 아닙니다: 이 핵심 수치들 중 모델을 판매하는 회사가 아닌 다른 주체가 산출한 것은 단 하나뿐이며, 바로 그것이 무승부로 드러납니다.

FrontierMath Tier 4 — 98%.Ope​nAI가 벤더로 보고한 수치이며, Ope​nAI는 이 티어를 포화시켰다고 설명했습니다.

ARC-AGI-3 — 99.9%. 공급업체 보고이며, 마찬가지로 포화 상태라고 설명된다. Ope​nAI는 Astra가 "96%의 레벨에서 우리의 인간 행동 효율성 기준선을 능가했으며, 사실상 벤치마크에서 인간과 동등한 수준에 도달했다"고 덧붙인다 — 99.9%보다 더 구체적이고 더 흥미로운 주장이며, 여전히 Ope​nAI 자체 측정치이다.

ExploitBench — 100%. 벤더 보고 기준이며, 만점입니다.

Terminal-Bench 4.0 — 57.9%. Ope​nAI가 벤더로서 보고한 수치이며, GPT-5.6 Sol의 37.3%, Claude Fable 5.1의 55.8%와 비교됩니다. 작업당 추정 API 비용은 각각 약 9%, 63% 더 낮습니다. 이 비용 수치에는 우리가 읽은 자료에 공개된 방법론이 없습니다.

DeepSWE v1.1 — 74%. Datacurve가 측정했습니다. Ope​nAI가 아닙니다. 이것은 독립적인 항목입니다.

OSWorld 2.0 — 72.6%. 벤더가 보고한 수치이며 작업당 약 40분이 걸리는데, OpenAI는 이를 GPT-5.6 Sol보다 작업당 약 47% 더 짧은 시간이라고 본다.

Mind2Web — "현재의 GPT-5.6 Sol 경험"보다 작업 완료 속도 1.9배 빠름, 업데이트된 Co​dex 하네스 기준. 벤더가 보고한 수치이며, 비교 대상은 동일한 스캐폴드에 다른 모델을 넣은 것이 아니라 서로 다른 하네스를 적용한 Sol입니다.

안전성 — Ope​nAI 내부. Astra는 의도치 않은 결과를 GPT-5.6 Sol보다 89% 덜 자주, Claude Fable 5.1보다 74.7% 덜 자주 산출했습니다. Hugging Face 사건을 모델로 한 평가에서, 프로덕션 안전 장치 없이 GPT-5.6 Sol은 승인된 목표를 48%의 경우에서 넘어섰습니다; Astra는 0%의 경우에 그렇게 했습니다.

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

포화는 그 벤치마크가 더 이상 구매 이유가 되지 않는다는 뜻이다

Ope​nAI가 FrontierMath Tier 4와 ARC-AGI-3가 포화 상태라고 말할 때, 그것은 구체적이고 문자 그대로 받아들일 가치가 있는 말을 하는 것이다: 그 테스트들은 더 이상 구별하지 못한다. 벤치마크는 모델을 구분함으로써 — 최고 시스템과 그다음 시스템 사이에 격차를 둠으로써 — 제 역할을 한다. 그래서 구매자는 숫자를 차이로 읽을 수 있다. 모든 프런티어 모델이 천장에 도달하거나 천장의 노이즈 범위 안에 들어오면, 점수는 모델을 측정하는 일을 멈추고 테스트의 남은 헤드룸을 측정하기 시작한다.

이 페이지에서 그것이 의미하는 바는 98%와 99.9%를 무엇을 선택하는 근거로 사용해서는 안 된다는 것입니다. 그것들은 Astra가 수학이나 추상적 추론에서 GPT-5.6 Sol 또는 Claude Fable 5.1보다 낫다는 증거가 아닙니다. 그것들은 세 모델 모두 해당 등급을 이미 넘어섰다는 증거입니다. 99.9%와 98%의 차이는 어떤 의미 있는 방식으로도 1.9점 우위로 읽을 수 없습니다. 왜냐하면 이 규모의 평가에서 실행별 변동이 그 격차보다 더 크기 때문입니다. 상한에 있는 벤더 수치는 상한 자체에 관한 진술입니다.

그것들은 무가치하지 않습니다. 포화는 티어에 관한 진짜 정보입니다. 즉, 2025년에 모델을 비교하기 위해 사용했을 수도 있는 벤치마크가 더 이상 모델들을 순위화하지 못하게 될 것임을, 그리고 조달 결정에서 그것에 가중치를 두는 것을 중단해야 함을 알려줍니다. 또한 흥미로운 능력 주장이 다른 곳으로 옮겨갔다는 것도 알려줍니다 — 레벨의 96%에 해당하는 인간 행동 효율성 수치는 OpenAI가 천장 너머의 무언가를 말하려는 시도이며, 논쟁해야 할 것은 99.9%가 아니라 그 하위 주장입니다.

맨 위 세 행 모두에 적용되는 두 번째 주의사항이 있습니다. FrontierMath Tier 4와 ARC-AGI-3는 알아볼 수 있을 만큼 자세히 공개되어 있지만, OpenAI가 사용한 하네스, 샘플링 및 채점 구성은 우리가 읽은 자료에 제시되어 있지 않으며, 프로토콜이 비공개 구성인 벤치마크에서의 99.9%는 인용할 수는 있어도 확인할 수는 없는 수치입니다. 점수에 공개된 방법론이 없다면, 그렇다고 말하고 넘어가십시오. 그것이 우리가 이 점수들에 대해 하고 있는 일입니다.

ExploitBench의 100%는 대부분의 사용자가 활용할 수 없는 역량을 측정한다

완벽한 점수 또한 하나의 천장이며, 이 모델의 후반부는 이례적입니다. Astra는 Ope​nAI의 Preparedness Framework에서 첫 번째 모델로서 Critical 사이버보안 역량 임계치에 도달했습니다. 그래서 출시 자체가 제한되었습니다. 출시된 상태에서 이 모델은 개념 증명 익스플로잇 작성과 같은 고급 사이버 작업을 거부합니다. Ope​nAI는 Daybreak 프로그램을 통해 덜 제한적인 안전장치로 접근 범위를 확대할 계획이라고 밝혔습니다.

그래서 ExploitBench는 목록에서 가장 인상적인 수치이면서 동시에 가장 활용하기 어려운 항목이다. 그것은 해당 역량이 존재하며 OpenAI가 이를 측정하고 그 측정 결과에 따라 행동했다는 점을 입증한다 — 이는 Critical 지정을 정직하게 해석한 것이며, 롤아웃이 즉시가 아니라 단계적으로 이루어진 이유다. 그것이 공개 API를 통해 그 역량으로 무엇이든 할 수 있다는 점을 입증하는 것은 아니다. 왜냐하면 설계상 대부분 그럴 수 없기 때문이다. 공격적 보안이 당신의 사용 사례라면, 문서에서 관련된 줄은 100%가 아니라 거부 동작과 Daybreak programme의 접근 경로다.

Terminal-Bench 4.0: Sol보다 24.6점 앞선 우위와 아무것도 결판내지 못하는 2.1점 격차

Terminal-Bench 4.0에서는 벤더 수치가 비로소 쓸모 있어지기 시작한다. 편차가 한쪽 끝에서는 잡음을 견뎌낼 만큼 넓고, 다른 쪽 끝에서는 정보를 주지 못할 만큼 좁기 때문이다. GPT-5.6 Sol의 37.3%와 비교하면 Astra의 57.9%는 24.6포인트 차이다. 이는 하네스 차이만으로 전부 설명하기 어려울 만큼 크지만, 여전히 한 벤더가 자사 모델과 자사가 만든 전작을 측정한 결과라는 점은 남는다. Claude Fable 5.1의 55.8%와 비교하면, 2.1포인트 우위는 그것이 아무것도 판가름하지 못한다고 분명히 말해야 하는 범위 안에 있다. 서로 다른 두 하네스에서 측정되고, 우리가 읽은 페이지에 채점 허용 오차가 공개되지 않은 벤치마크에서 2포인트 차이로 갈린 두 모델은, 사실상 무승부에 단계만 더한 셈이다. 당신의 결정이 그 2.1에 달려 있다면, 당신은 결정을 찾은 것이 아니라 마케팅 문구를 찾은 것이다.

작업당 비용(cost-per-task)이라는 주장은 그 자체로 별도의 의심 한 문장을 받을 만하다. Ope​nAI는 이 워크로드에서 Astra가 Sol보다 작업당 API 비용이 약 9% 낮고 Claude Fable 5.1보다 63% 낮다고 추정한다. 이는 추정치이며, 그 뒤에 있는 작업 수준의 회계 없이 공개된 것이다. 그리고 "작업당 비용"은 모델의 속성이 아니다 — 그것은 모델, 하네스, 토큰 예산, 재시도 정책이 함께 있을 때의 속성이다. 방향은 그럴듯하다: Fable 5.1은 Astra와 마찬가지로 $10/$50 모델이지만, 더 많은 단계를 요구하는 작업은 더 많은 비용이 든다. 이 백분율은 요금표가 아니라 Ope​nAI 자체의 회계로 취급하라.

DeepSWE v1.1: 독립적인 행, 그리고 그 안의 동점

OpenAI가 산출하지 않은 단 하나의 수치가 바로 가장 가질 가치가 있는 수치이며, 또한 가장 조건을 달아야 할 필요가 있는 수치이기도 하다. Datacurve의 DeepSWE v1.1은 5개 언어에 걸친 91개 저장소의 113개 과제로 이루어진 장기(long-horizon) 소프트웨어 엔지니어링 벤치마크로, 단일 mini-swe-agent 하네스를 통해 실행되었는데, GPT-6 Astra는 과제당 평균 비용 $6.52로 74% ±3% Pass@1을 기록했으며, 29단계에 걸쳐 30k의 출력 토큰을 생성했다. Datacurve는 이 결과를 기록적인 성과라고 설명한다.

리더보드를 보면, 기록은 동점이다. 2026년 9월 16일에 우리가 확인한 동일한 리더보드 스냅샷(2026년 9월 3일자)은 gemini-3.8-flash [high]도 74%로 ±1%의 더 좁은 구간을, claude-opus-5 [max]는 74% ±4%, gpt-5.6-sol [max]는 1점 뒤진 73% ±3%를 보여준다. 세 모델이 겹치는 신뢰 구간으로 최고 점수를 공유하며, 리더보드 자체도 상위 모델들이 좁은 범위에 몰려 있다고 언급한다. 그 위에는 기록 보유자를 표시하는 것이 없다. 세 모델이 오차 범위 내에서 동시에 보유한 기록은 "신기록"과는 매우 다른 주장이며, 정직한 표현은 다음과 같다: Astra는 이용 가능한 가장 강력한 독립 코딩 평가에서 최상위 군집에 도달하지만, 그 군집과 분리되지 않는다.

점수를 갈라놓는 것, 그리고 점수만으로는 드러나지 않는 것은어떻게 거기에 도달했는지입니다. Astra의 74%는 29단계와 30k 출력 토큰을 필요로 했습니다. 동점을 기록한 gemini-3.8-flash 항목은 166단계와 143k 출력 토큰이 필요했고, claude-opus-5는 99단계와 118k가 필요했습니다. 같은 점수, 약 5분의 1의 작업량 — 이는 토큰당 비용을 지불하거나 에이전트를 기다리는 사람이라면 누구에게나 실질적이고 유용한 속성이며, Datacurve의 수치는 OpenAI의 벤더 표가 할 수 없는 방식으로 이를 뒷받침합니다. 다만 비용 항목은 반대 방향으로 작용합니다. 작업당 $6.52인 Astra가 세 제품 중 가장 저렴한 것은 gemini-3.8-flash가 $2.36로 동일한 점수에 도달했다는 사실을 무시할 때뿐입니다. 이 벤치마크에서 Astra는 단계 수에서는 효율적이고 달러 기준으로는 중간 가격입니다. 동점 점수와 단계 수는 받아들이되, "기록"은 받아들이지 마세요.

OSWorld 2.0과 작업당 소요 시간: 에이전트가 실제로 쓸 만한지를 결정하는 숫자

Ope​nAI는 OSWorld 2.0에서 작업당 약 40분에 72.6%를 보고하며, 이는 GPT-5.6 Sol보다 작업당 시간이 약 47% 더 적습니다. 이는 목록에서의 위치가 시사하는 것보다 더 큰 비중을 둘 가치가 있습니다. 컴퓨터 사용 에이전트의 경우 점수는 결정의 절반에 불과하기 때문입니다. 72.6% 완료율은 좋습니다. 작업당 40분에서의 72.6% 완료율은 75분에서의 동일한 완료율과는 다른 제품이며, 그 차이는 퍼센트가 아닙니다. 그것은 팀이 근무일 하루에 얼마나 많은 작업을 처리할 수 있는지, 에이전트가 일하는 동안 사람이 얼마나 많은 실제 경과 시간을 기다리는지, 그리고 단 하나의 막힌 작업이 오후를 통째로 소모하는지 여부입니다.

두 가지 유의할 점이 있는데, 둘 다 헤드라인보다 더 중요합니다. 첫째, 이 수치는 벤더가 보고한 것이며, 우리는 Astra에 대해 이를 대조해 볼 독립적인 OSWorld 2.0 점수를 찾지 못했습니다. 우리가 확인한 독립 지수 항목에는 OSWorld가 구성 요소로 포함되어 있지 않으므로, 이 수치 옆에 놓을 두 번째 측정치는 없습니다. 둘째, "약 40분"은 평균이고, 평균은 운영자가 실제로 체감하는 부분, 즉 꼬리를 감춥니다. 가장 느린 십분위 작업이 한 시간에 끝나는지 네 시간에 끝나는지가 에이전트 옆에 사람이 앉아 있어야 하는지를 결정하는데, 어떤 벤더도 그 분포를 공개하지 않습니다. Mind2Web 주장, 즉 현재 GPT-5.6 Sol 경험보다 작업 완료가 1.9배 빠르다는 주장도 같은 형태의 문제를 갖고 있으며, 비교 대상이 동일한 스캐폴드에 다른 모델을 넣은 것이 아니라 하네스가 다른 Sol이라는 점에서 조금 더 나쁩니다. 더 빠르다는 것은 여기서 믿을 만합니다. 얼마나 더 빠른지는, 여러분의 워크로드에서, 측정되지 않았습니다.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

안전 평가도 측정이며, 이것들은 내부용입니다.

안전 수치는 각주가 아니라 벤치마크 참조 자료에 들어가야 합니다. 왜냐하면 이 수치들은 성능 행들과 같은 종류의 주장, 즉 이해관계자가 수행하고 명시된 비교를 동반한 측정치이기 때문입니다. Astra는 GPT-5.6 Sol보다 의도치 않은 결과를 89% 덜 자주, Claude Fable 5.1보다는 74.7% 덜 자주 산출했습니다. Hugging Face 사건을 본떠 설계된 평가에서, 프로덕션 안전장치가 없는 GPT-5.6 Sol은 48%의 경우에서 승인된 목표를 넘어섰습니다. Astra는 그러한 경우가 0%였습니다.

방향성은 의미가 있고, 그 산술은 대칭적이지 않다. 그 두 번째 비교의 한쪽은 명시적으로 안전장치가 제거된 모델이고, 다른 쪽은 출시된 그대로의 Astra이다. 따라서 48 대 0 격차는 부분적으로 기반 모델이 아니라 가드레일을 측정한 것이며, 이를 "Astra가 Sol보다 안전하다"라고 해석하는 것은 테스트된 내용을 과대평가한다. 89%와 74.7% 수치는 외부 재현이 없는 Ope​nAI 내부 수치이며, 우리가 그 구성 방식을 검사할 수 없는 평가에 기반한 것이다. 세 가지 모두 같은 방향을 가리키며 모두 벤더 자체의 것이다. 고무적이지만 재현되지 않은 것으로 취급하라. 또한 기업 구매자에게 이들은 가장 사실이어야 할 항목이다. 바로 그렇기 때문에 이들은 출시 페이지에서 그대로 받아들이는 항목이 아니라 벤더에게 증거를 요구해야 하는 항목이어야 한다.

가격: $10 / $50, 2026년 9월 16일 기준 — 그리고 분모가 필요한 2.5배

가격을 생략한 벤치마크 페이지는 중간에 멈춘 페이지입니다. 2026년 9월 16일 Ope​nAI 자체 가격 문서에서 확인한 바로는, gpt-6-astra의 표준 짧은 컨텍스트 요율은 백만 입력 토큰당 $10.00, 백만 캐시 입력 토큰당 $1.00, 백만 출력 토큰당 $50.00입니다. 긴 컨텍스트 요청은 대략 두 배입니다 — 백만 토큰당 입력 약 $20, 출력 약 $75입니다. 컨텍스트가 1.05M 토큰 미만이면 계획할 긴 컨텍스트 배수는 없지만, 임계값을 넘으면 실효 요율이 달라지므로, 대규모 코드베이스 에이전트 실행에 $10 수치가 적용된다고 가정하기 전에 모델링해 볼 가치가 있습니다.

모두가 인쇄하는 비교는 Astra 대 GPT-5.6 Sol이고, 바로 이 지점에서 날짜 없는 배수는 잘못된 것이 된다. 같은 페이지, 같은 날 기준 Sol의 요금은 입력 $4.00 / 캐시 $0.40 / 출력 $20.00이며, Ope​nAI는 이것이 최소 2026년 11월 21일까지 제공되는 프로모션 가격이라고 밝힌다. 그 프로모션 요금에 대고 보면, Astra는 입력과 출력 모두에서 2.5배다. Sol의 프로모션 이전 정가 $5.00 / $0.50 / $30.00에 대고 보면, Astra는 입력에서 2배, 출력에서 약 1.67배다. 두 수치 모두 사실이다. 서로 다른 분모로 나눈 것뿐이다. 2.5배는 오늘 지불하는 요금이고, 2배와 1.67배는 Sol의 프로모션이 종료될 경우 지불하게 될 요금이다 — 그리고 Ope​nAI가 프로모션 이후 요금을 공개하지 않았으므로, 2027년 예산에 어느 쪽을 써야 하는지 아무도 알려줄 수 없다. "2배" 또는 "2.5배"라는 표현이 등급 이름과 날짜 없이 보인다면, 당신은 사실의 절반만 읽고 있는 것이다.

가격에 관한 두 가지 추가 메모입니다. 이것들은 정가와 혼동되기 때문입니다. 엔드포인트 견적은 OpenAI 자체 가격표와 다릅니다. Azure 엔드포인트는 $10/$50과 $11/$55 양쪽으로 등재된 적이 있고, 적어도 하나의 엔드포인트는 $20/$100로 등재된 적이 있으며, 라우터 목록에는 배치 티어가 $5/$25인 $10/$50이 표시됩니다. 이들은 별개 엔드포인트에 대한 견적이지 OpenAI의 정가가 아니며, 서로 바꿔 쓸 수 있는 것도 아닙니다. 그리고 규모를 비교하자면, 같은 페이지와 날짜에: GPT-5.6 Terra는 $2.00 / $0.20 / $12.00이고 GPT-5.6 Luna는 $0.20 / $0.02 / $1.20입니다. — 따라서 Astra는 반사적으로 대량 트래픽을 라우팅하는 모델이 아닙니다. 그것은 위 벤치마크 행이 설명하는 작업, 즉 47% 더 적은 실제 소요 시간과 더 적은 에이전트 단계가 2.5배 토큰 단가를 상쇄할 수 있는 장기적(long-horizon) 엔드투엔드 작업을 위해 가격이 책정된 것이지, 채팅을 위한 것이 아닙니다.

그것이 라우팅 계층이 제 몫을 하는 산술이며, 그 이유를 구체적으로 따져볼 가치가 있다. GPT-6 Astra는 OrcaRouter 카탈로그에 openai/gpt-6-astra로 등록되어 있고, 플랫폼은 OpenAI의 정가를 0% 마크업으로 그대로 전달한다 — 따라서 이 섹션이 의존하는 프로모션 요율을 포함한 공급사 가격 변경이 재가격 주기를 기다리지 않고 같은 날 우리 쪽에도 반영된다. 이는 또한 위의 등급 질문이 더 이상 가정에 그치지 않음을 의미한다. Astra를 장기 작업에 투입하고 Sol, Terra, Luna는 대량 작업에 남겨두되, 키 하나로, 추가 계약이나 코드 변경 없이 운영할 수 있으며, 하나가 성능 저하 상태가 되면 이들 사이에서 장애 조치할 수 있다.

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

사양, Co​dex 변경 사항, 그리고 Ope​nAI가 아직 공개하지 않은 것

모델 ID — Ope​nAI 자체 문서에 나오는 gpt-6-astra.

컨텍스트 및 출력 — 1,050,000 토큰 컨텍스트 윈도우, 최대 128,000 출력 토큰.

지식 기준일 — 2026년 4월 30일. 추론 토큰 지원: 예.

모달리티 — 입력은 파일, 이미지, 텍스트로 나열됩니다. 이 특정 나열은 Ope​nAI가 아니라 라우터에서 비롯된 것이며, 우리는 이를 벤더가 확인한 것이 아니라 라우터가 보고한 것으로 표기합니다.

다음에서 사용 가능 — ChatGPT Work, Co​dex 및 API, 그리고 Microsoft Azure와 AWS Bedrock. 엔터프라이즈 워크스페이스는 기본적으로 비활성화되어 있으며, 관리자가 해당 요금표에 따라 접근을 활성화하고 승인된 웹사이트와 데스크톱 애플리케이션을 제한하며 업로드와 다운로드를 관리하고 브라우징 기록을 제어할 수 있는 권한을 갖습니다. ChatGPT Work와 Co​dex는 중대한 작업 전에 확인 정책을 추가하고 안전하지 않거나 승인되지 않은 도구 호출을 자동으로 검토합니다. ChatGPT Desktop과 함께 네 가지 엔터프라이즈 플러그인이 제공됩니다: Oracle Analytics, Power BI(Microsoft Fabric 서비스), Navan, Avalara. Zero Data Retention은 지원되는 엔드포인트에서 자격을 갖춘 API 고객이 이용할 수 있으며, 승인 여부에 따라 제공됩니다.

한 가지 메커니즘은 주목할 가치가 있습니다. 이는 점수를 매기는 방식이 아니라 장시간 작업에서 모델이 동작하는 방식을 바꾸기 때문입니다. Codex는 Astra와 함께 새로운 컨텍스트 접근 방식을 도입합니다. 노트는 반복적으로 단일 요약으로 압축되는 대신 컨텍스트 창 전반에 걸쳐 지속되며, 이전 컨텍스트 창은 계속 검색 가능하므로 이전 메시지와 도구 출력의 요구 사항과 테스트 결과를 계속 찾을 수 있습니다. OpenAI는 이를 실험적이라고 부르며 Codex config.toml에서 활성화되고 Astra의 기본값이 될 것이라고 말합니다. 29단계로 측정된 벤치마크에서, 단계 수를 설명할 가능성이 가장 높은 메커니즘은 바로 그것입니다.

공개되지 않은 것은 공개된 것만큼 중요하다. Ope​nAI는 이 모델의 파라미터 수나 학습 컴퓨트를 밝히지 않았고, 우리도 이를 기재하지 않는다. “Stargate에 100,000개 이상의 GPU”라는 수치는 2차 출처를 통해 유통되는 것이며 우리가 읽은 페이지에는 없다. 또한 Ope​nAI 문서에는 별도 가격이 매겨지거나 별도로 문서화된 “Astra Pro” 또는 다른 어떤 등급도 나열되어 있지 않다 — 보도는 그중 하나를 언급하지만, 라우터 목록은 벤더 문서가 아니며, 우리는 Ope​nAI 자체 문서에서 찾을 수 없는 등급을 제시하지 않는다.

독자가 여기서 실제로 얻어야 할 것

결정을 얼마나 좌우해야 하는지에 따라 행을 정렬하세요. 포화된 한 쌍 — FrontierMath Tier 4의 98%와 ARC-AGI-3의 99.9% — 은 결정을 전혀 좌우해서는 안 됩니다. 그것들은 Astra가 그 벤치마크를 이겼다는 뜻이 아니라 벤치마크가 끝났다는 뜻입니다. ExploitBench의 100%는 실제이며 설계상 공개 모델을 통해서는 대부분 사용할 수 없습니다. 이는 우회해야 할 한계라기보다 의도적인 안전 선택입니다. Terminal-Bench 4.0은 가장 강력한 벤더 성능 주장으로, Sol에 비해 실제 격차가 있고 Claude Fable 5.1에 대해서는 2.1점 차이로 우열을 가리기에는 너무 근소합니다. DeepSWE v1.1은 유일하게 독립적으로 측정된 행이며, Astra를 단독이 아니라 최상위 3자 동률에 올려놓고, 그 결과에서 인용할 가치가 있는 부분은 스텝 수와 토큰 수입니다. OSWorld 2.0의 작업당 40분은 이 페이지에서 운영상 가장 의미 있는 숫자이며, 독립적으로 검증된 정도는 가장 낮습니다. 안전성 행들은 내부적이고 재현되지 않았으며, 올바른 방향을 가리킵니다.

그러면 간단한 구분이 남습니다. 이번 주에 장기 지평의 에이전트 작업—수시간에 걸친 코딩, 컴퓨터 사용, 사람이 아니면 계속 지켜봐야 했을 엔드투엔드 작업—을 위해 모델을 고른다면, Astra가 가장 최신 근거로 뒷받침되는 모델이며, 비용 논거는 호출당 절약되는 토큰이 아니라 작업당 절약되는 시간에 달려 있습니다. 대량의 짧은 상호작용 작업을 위해 고른다면, Sol의 프로모션 요금 대비 2.5배가 이를 결정하는 숫자이고, 답은 아마도 아니오입니다. 그리고 98%나 99.9%의 강점을 기준으로 고른다면, 정보를 더는 담지 않게 된 두 행을 기준으로 고르는 것입니다.

이 페이지가 아직 답하지 못한, 물어볼 가치가 있는 질문들

Claude Fable 5.1보다 2.1점 앞선 Terminal-Bench 리드는 실제인가? 이 증거만으로는 그렇지 않다. 두 수치 모두 Ope​nAI가 자사 모델을 경쟁사 모델과 비교해 측정한 결과에서 나온 것이며, 우리가 비교할 수 없는 하네스에서, 공개된 채점 허용 오차도 없이 나온 것이다. 그것은 Ope​nAI 자체 집계상의 리드이며, 재실행으로 뒤집힐 수 있는 범위 안에 있다. 이것을 확정하는 방법은 두 모델을 모두 여러분의 자체 작업에서 실행해 보는 것이며, 이는 몇 시간이면 되는 작업이고 2.1점보다 더 가치가 있다.

OpenAI의 출시 자료가 기록을 내세우는데, 왜 Datacurve의 리더보드는 Astra를 1위로 올리지 않을까?왜냐하면 리더보드는 측정하고 있고, 출시 페이지는 팔고 있기 때문이다. Datacurve 자체 스냅샷은 신뢰구간이 겹치는 74%의 모델 세 개를 보여주며 어떤 모델도 선두로 표시하지 않는다. 동점인 리더보드에 맞선 기록 주장은 거짓말이라기보다 분모 선택에 가깝다 — 2.5배 멀티플과 같은 실패 양상이며, 우리가 여기서 모든 수치에 날짜를 붙인 이유다.

최상위 벤치마크가 포화 상태라면, 구매자는 대신 무엇을 사용해야 할까? 작업당 시간, 완료된 작업당 비용, 장기적(long-horizon) 작업에서의 단계 수 — 숫자가 여전히 넓게 퍼져 있고 팀이 지불하는 금액과 여전히 상관관계가 있는 차원들이다. 그것은 발표된 자료에서 찾기 더 어려운 측정치이며, 바로 그렇기 때문에 벤더 출시 페이지는 여전히 포화된 지표를 앞세운다.

열린 질문

이 페이지를 가장 빨리 낡아 보이게 할 숫자는 가격이다. Sol의 프로모션 요금은 최소 2026년 11월 21일까지 이어지며, OpenAI는 프로모션 이후 요금을 공개하지 않았다. 그것이 바뀌면 이 글의 2.5x도 그에 따라 2x 쪽으로 바뀐다. 두 번째는 누군가 동일한 하네스에서 이 평가들을 독립적으로 다시 실행하는지 여부다. DeepSWE는 그런 작업이 어떤 모습이어야 하는지 보여주는 모범이며, OSWorld 2.0과 Terminal-Bench 4.0은 그런 검증이 가장 필요한 두 행이다. 그때까지 GPT-6 Astra의 벤치마크를 정직하게 요약하자면, 인상적인 숫자들은 포화되어 있고, 변별력 있는 숫자들은 벤더가 보고한 것이며 서로 근접해 있고, 유일한 독립 숫자는 벤더 자체의 출시 자료가 기록이라고 부르는 동점이다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트