OpenAI Astra-1
Guides & Insights

OpenAI Astra: GPT-6가 아닌 그 모델에 대해 우리가 아는 모든 것

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

오늘 다운로드할 수 있는 것은 모델이 아니다. 그것은 Lean 코드 파일 열 개다. 2026년 8월 1일, OpenAI는 수학에 관한 연구 게시물을 발표했는데, 그 안에 차세대 프런티어 시스템의 이름인 Astra에 대한 첫 확인이 묻혀 있었다. 모델 카드도, 가격 페이지도, API 엔드포인트도, 날짜도 없다. 현재 실제로 호출할 수 있는 플래그십은 여전히 GPT-5.6 Sol이며, 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 30달러로, 7월 9일 이후로 정확히 그대로다.

GPT-6을 검색했다면, 짧게 말하면 이렇습니다. OpenAI는 그런 이름의 모델을 발표한 적이 없으며, 현재까지 Astra가 GPT-6로 출시될지, GPT-5.7 같은 GPT-5 포인트 릴리스로 출시될지, 아니면 Sol, Terra, Luna와 함께하는 4번째 계층으로 출시될지 결정하지 않았습니다. 그 명명 모호성은 언론을 피하려는 것이 아닙니다. 이는 현재 진행 중인 내부 쟁점으로, The Information이 7월 31일에 보도했고 그 이후로 해결되지 않았습니다.

다음 내용은 이 이야기에 대한 대부분의 보도가 한데 뭉뚱그려 다루는 세 가지를 구분한다: OpenAI가 직접 밝힌 것, 신뢰할 만한 보도가 덧붙인 것, 그리고 출처 없이 떠도는 것이다. 증명들은 직접 컴파일할 수 있는 실제 산출물이다. 10조 파라미터라는 수치는 누군가 인터넷에 입력한 숫자에 불과하다. 그 각각은 매우 다른 비중으로 다뤄져야 한다.

OpenAI가 실제로 말한 내용 — 그리고 말하지 않은 내용의 훨씬 더 긴 목록

이 발표는 제품 출시 형식이 아니라 논문 형식으로 나왔다. OpenAI의 게시물은 '우리의 차기 주요 모델인 Astra의 내부 버전'이 만들어낸 결과를 설명했는데, 그가 제시한 관점에서 보면 최소 10년 동안 주요 결과에 진전이 없었던 문제들이었다. Astra는 장기 실행 작업을 위해 만들어진 시스템으로 특징지어졌다: 한 번에 답을 내놓는 대신, 여러 에이전트가 긴 시간에 걸쳐 하나의 큰 문제의 서로 다른 부분들을 조정하는 방식이다.

그것은 공식 기술 설명 전체에 가깝다. 이에 견주어 보면, 누락된 항목들의 목록은 두드러진다:

OpenAI에 의해 확인됨 — 이름은 Astra이며, "차기 주요 모델"이라는 점, 내부 버전이 10개의 결과를 생성했다는 점, 멀티 에이전트·장기 지평 설계 의도, 249페이지 분량의 원고, 공개 저장소의 Lean 4 인증서, GPT-5.6 Sol 요율로 인용된 토큰 비용 추정치.

OpenAI가 명시하지 않음 — 출시일, 가격, 컨텍스트 윈도우, 파라미터 수, 벤치마크 점수, 모델 카드, ChatGPT에 제공되는지 API에만 제공되는지, 에이전트가 몇 개 실행되었는지, 얼마나 오래, 어떤 하드웨어에서, 프롬프트, 성공률, 최종 제품명.

신뢰할 수 있는 보도가 조금 더 내용을 채워준다. The Information은 샘 올트먼이 7월 말 워싱턴에서 정책 입안자들에게 Astra를 시연했다고 보도했다. 그 보도에 따르면, 이 브리핑에는 라파엘 워녹, 버니 모레노, 마크 워너 상원의원이 참석했고, 스콧 베센트 재무장관과 하워드 러트닉 상무장관도 자리했다. 이 모델 제품군은 이미 테스트 중인 것으로 알려졌으며, "Astra"라는 이름 자체는 아직 임시 명칭이다.

OpenAI 외부의 누구도 이 모델을 어떤 것에서도 실행하지 않았습니다. 유통되는 모든 성능 주장은 열 개의 공개된 증명 또는 대중이 보지 못한 데모로 거슬러 올라갑니다.

열 가지 증명: 유난히 검증 가능하면서도 아직 해결되지 않은

OpenAI Astra-2

이것이 바로 이 발표가 일반적인 벤치마크 발표보다 확실히 더 강력한 지점이며, 그 이유에 대해 정확히 짚어볼 가치가 있다. OpenAI는 점수를 공개하고 믿어달라고 요청하지 않았다. Apache 2.0 라이선스 하에 openai/ten-proofs 저장소에 기계 검증 가능한 산출물을 게시했다 — 결과당 하나의 Lean 파일씩, mathlib 의존성을 포함해 Lean 4.32.0에 고정했으며, 독립적 검증을 위한 ComparatorChallenges 디렉토리도 함께 제공했다. 저장소는 8월 1일 단일 커밋으로 게시되었으며, 이후 수백 개의 스타와 수십 개의 포크를 받았다.

저장소가 명명한 열 가지 결과는 특이할 정도로 다양한 분야에 걸쳐 있습니다:

군론 — 비소픽 군의 구성, 1999년부터 열린 문제에 대한 부정적 답변. 소픽성은 수학자들이 다루는 거의 모든 군이 만족하는 성질이다; 모든 가산 이산 군이 이를 만족해야 하는지는 27년간 미해결로 남아 있었다.

연산자 대수 — 1980년 필즈상 수상자 알랭 콘이 제기한 콘 강성도 추측에 관한 반례.

고차원 기하학 — 1978년 이후 처음으로 보고된 구 채움(sphere-packing) 방법의 개선 — 그리고 Ehrhart 부피 부등식의 날카로운 형태.

부호 이론 — 이진 부호와 구면 부호에 대한 새로운 경계.

복잡도 — 퍼머넌트에 대한 산술 회로 하한, 그리고 얽힌 게임에 대한 지수적 병렬 반복 결과.

격자 암호 — 최근접 벡터 문제에 대한 고정 다항식 경도.

극단 조합론 — 다색 삼각형 램지 수의 증가 규모, 그리고 극단 그래프 이론에서의 반례, 여러 목록화된 Erdős 문제에 대한 연구를 포함.

수학자들의 반응은 무시하는 태도라기보다는 관심을 보이는 것이었다. 에르되시 문제 데이터베이스를 관리하는 토마스 블룸은 그 결과를 큰 뉴스라고 불렀으며, 5월의 단위 거리 추측 반례보다 더 높게 평가했다. OpenAI의 노암 브라운은 내부자로서 유용한 냉정한 평가를 내놓았다: "안타깝게도 아직 밀레니엄 문제는 없다."

Lean 증명서가 확정하는 것과 열어 두는 것

타입 체크를 통과하는 Lean 증명은 구성상 유효합니다. OpenAI의 평가 방법론, 기준선 선택, 혹은 자체 결과에 대한 해석을 신뢰할 필요가 없습니다. 파일을 직접 컴파일하면 되기 때문입니다. "94.1%를 달성했다"가 표준 증거 단위인 산업에서, 이는 반증 가능성에 있어 의미 있는 개선입니다.

또한 이는 헤드라인이 시사하는 바보다 더 좁은 범위를 가지며, 구체적으로 네 가지 측면에서 그러하다. Lean은 형식적 진술의 증명이 타당한지 확인한다. 그러나 그 형식적 진술이 본문이 주장하는 정리인지는 확인하지 않는다. 인코딩된 정의가 해당 분야에서 그 용어들이 의미하는 바와 일치하는지도 확인하지 않는다. 형식적 끝점과 헤드라인 결과를 연결하는 비형식적 환원도 검증하지 않는다. 그리고 새로움, 즉 어떤 결과가 새로운 것인지 아니면 다른 이름으로 이미 알려진 것인지에 대해서는 아무것도 말하지 않는다.

그 네 가지는 모두 인간의 판단에 달린 문제이며, 발표 시점 기준으로 어느 것도 동료 심사를 거치지 않았다. 원고는 전문가들과의 자문을 인정하고 있지만, 자문 인정이 모든 주장을 지지하는 것은 아니다. 저장소의 공개된 부분 빌드 하나는 9,007개 작업 중 8,820개를 컴파일했는데, 이는 완성된 감사라기보다 검증 중인 대규모 실제 형식화의 모습이다. 오늘날 정직한 상태는 열 개의 진지하고 공식적으로 부호화된 연구 주장이지, 수학 정전에 확정된 열 개의 항목이 아니다.

두 번째, 더 조용한 한계가 있습니다: 발견 과정은 OpenAI 외부의 누구도 재현할 수 없습니다. 증명은 공개되어 있지만, 검색 시스템, 프롬프트, 체크포인트 및 실행 환경은 공개되어 있지 않습니다. 목적지를 확인할 수는 있습니다. 여정을 다시 실행할 수는 없습니다.

2,000달러라는 수치, 그리고 왜 그 금액이 듣기보다 덜 사는지

OpenAI Astra-3

The number that traveled furthest was the cost. OpenAI put the token spend behind the ten solutions at roughly $2,000 priced at GPT-5.6 Sol rates — about $200 per decade-old open problem, on the most common reading of its phrasing. Some coverage read the same sentence as under $2,000 per problem, a tenfold difference; OpenAI's post is terse enough that both readings survived into print, and we have not seen the company disambiguate it.

전체 수치를 기준으로 계산해 보자. Sol은 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 30달러를 청구하며, 추론 토큰은 출력으로 청구된다. 지출이 전적으로 출력이라고 가정하면, 2,000달러로 최대 약 6,700만 개의 출력 토큰을 구매할 수 있다 — 문제당 약 670만 개꼴이다. 그것은 많은 사고량이지만, 터무니없는 사고량은 아니다. 이는 충분한 자금을 갖춘 연구 그룹이 하나의 어려운 문제에 이미 쓸 수 있는 예산 수준이다.

세 가지 주의사항이 헤드라인보다 더 중요합니다:

이것은 반사실적 가격이지 실제 가격이 아닙니다. Astra는 출시되지 않았고 가격도 정해지지 않았습니다. $2,000는 그 토큰들이 다른 모델의 요율로 들었을 비용을 나타냅니다. 수 시간에 걸친 멀티 에이전트 실행을 위해 구축된 프론티어 시스템이 Sol과 같은 가격으로 책정되어야 할 명백한 이유는 없으며, 오히려 그보다 높게 책정되어야 할 모든 이유가 있습니다.

오직 승리만 집계합니다. 성공률은 공개되지 않았습니다. Astra가 얼마나 많은 문제를 겨냥했고 해독에 실패했는지, 그리고 그 시도에 어떤 비용이 들었는지 우리는 알 수 없습니다. 성공률 없이 공개된 성공당 비용은 결과당 비용이 아니며, 그 차이는 어느 방향으로든 한 차수(10배) 이상일 수 있습니다.

토큰은 저렴한 부분입니다.인간이 문제를 구성하고, 원고를 준비했으며, 형식화를 주도했습니다. 그 노동은 $2,000에 포함되어 있지 않습니다.

오늘 가격을 책정할 수 있는 유일한 부분은 기준선(baseline)입니다. OrcaRouter가 공급업체 목록 가격을 0% 마크업으로 그대로 전달하므로, GPT-5.6 Sol은 OpenAI API와 동일하게 당사 API에서도 $5/$30의 비용이 듭니다. 따라서 자체 워크로드에 맞춰 계산을 검증하고 싶다면, 공지에 명시된 요율이 실제로 지불하게 될 요율입니다. 아직 아무도 가격을 책정할 수 없는 것은 Astra 자체이며, 그렇지 않다고 말하는 공급업체는 추측에 불과합니다.

출시일은 유출이 아닌 30일 시계에 의해 결정됩니다.

OpenAI Astra-4

대부분의 'GPT-6는 언제인가' 보도는 루머 산술에 지나지 않는다. 더 구체적인 제약 조건이 눈에 잘 띄는 곳에 존재하지만, 그것은 이 질문과 거의 연결되지 않았다.

2026년 6월 2일에 서명된 행정명령은 연방 기관들이 자발적 검토 절차를 마련하도록 지시했는데, 이 절차에 따라 프론티어 개발자들은 공개 출시 최대 30일 전에 정부 검토를 위해 모델을 제출하게 된다. 이 프레임워크는 8월 1일, 즉 Astra 게시물이 올라온 바로 그날 공식적으로 발효될 예정이었다. 보도에 따르면 Astra가 이 절차를 통과하는 첫 번째 모델이 될 것으로 예상된다.

"자발적"이라는 단어는 그 문장에서 나름의 역할을 한다. 실제로 행정부는 이전에도 출시 시점에 영향을 준 적이 있으며, OpenAI의 최근 행보는 그 리허설처럼 보인다: GPT-5.6은 6월 26일부터 약 20개의 검증된 기관에만 제공되다가 7월 9일에 일반 공개가 이루어졌다. 즉 약 2주에 걸친 단계적 출시였다.

이 두 가지 사실을 겹쳐 보면 예측이 아니라 대략적인 최저선만 얻을 수 있습니다. Astra가 30일 사전 출시 검토를 거친 후 GPT-5.6 패턴을 반복한다면, 광범위한 제공은 제출 후 약 6주 뒤에 이뤄집니다. 그리고 제출 날짜가 바로 우리가 알 수 없는 부분입니다. 그래서 확신에 찬 8월 날짜는 할인해서 봐야 합니다. 관문 단계는 공개된 기간이 있는 절차인데, 그 시계는 아직 눈에 띄게 시작되지 않았기 때문입니다.

예측 시장은 정확히 그 방향으로 움직였다. 2026년 8월 5일 기준, Polymarket의 "GPT-6 출시 시점" 래더는 8월 7일 1%, 8월 14일 3%, 8월 21일 13%, 8월 31일 25%, 9월 30일 68%, 12월 31일 89%를 기록했으며, 거래량은 거의 100만 달러에 달했다. 이는 군중의 집계된 추측으로 받아들이고, 출처로 삼지 마십시오. 단, 군중의 무게가 4분기로 옮겨졌다는 점에 유의하십시오.

또한 그동안의 전적을 기억하는 것도 도움이 된다. 지난 12개월간 "GPT-6가 다음 주에 출시된다"는 주장은 모두 틀렸다. 확인되지 않은 유출 정보는 2026년 4월 14일을 출시일로 지목했지만, 실제로 9일 뒤 출시된 것은 GPT-5.5였다.

소문, 등급 매김

실제로 각각이 얼마나 많은 비중을 차지하는지에 따라 정렬됨:

명칭 미정 (GPT-6 / GPT-5.7 / 별도 클래스). 출처는 The Information. 이 이야기에서 가장 신뢰할 만한 비(非)오픈AI 주장이자, 기대치를 재설정해야 할 바로 그 내용이다 — 수학 논문을 통해 발표되는 시스템은 세대적 도약으로 브랜딩되지 않을 가능성이 크다.

코드네임 "Zinc"와 "Magnesium"이 Design Arena에서 발견되었다. 커뮤니티 목격담으로, 항목이 비활성화된 것으로 알려졌으며 OpenAI가 확인하지 않았다. 즉, GPT-5.x 포인트 릴리스가 출시될 가능성이 높다. 전에 Astra가 누구의 GPT-6 기대도 충족시키지 못하면서 뉴스 사이클을 흡수하기

규모 면에서 대략 GPT-5.6 Sol의 2배; 가격은 GPT-5.6 수준에 근접. 유포 중인 루머. 그 배후의 유출자는 모델을 테스트하지 않았다고 인정함. 그럴듯해 보이지만 전혀 근거가 없음.

150만 토큰 컨텍스트 창. 출처가 명시되지 않은 채 유출 정리 글에 등장한다. Sol은 이미 1,050,000 토큰을 제공하므로, 이는 큰 도약이 아니라 점진적 증가에 불과하다. 이를 헤드라인 "유출"로 의심하게 만드는 이유다.

약 10조 개의 파라미터입니다.우리가 추적할 수 있는 어떤 출처도 없습니다. 이 전체 이야기에서 가장 많이 반복되면서도 가장 근거가 부족한 숫자입니다.

메모리와 개인화가 핵심 방향으로 자리 잡다. Altman이 2025년 8월 인터뷰에서 직접 밝힌 공개 발언에 근거한 내용으로, 실제 발언이기는 하나 1년 전의 것이고 GPT-5 이후의 전반적인 방향에 관한 것이지 Astra에 국한된 것은 아닙니다.

지금부터 출시될 때까지 실제로 해야 할 일

잘못된 선택은 모델 카드도 없는 모델을 위해 아키텍처를 재설계하는 것입니다. 올바른 선택은 장기적(롱호라이즌) 멀티 에이전트 시스템이 바꿀 문제가 무엇인지 파악하는 것입니다. 그러한 문제들은 OpenAI가 무엇을 출시하든 오늘날 여러분의 스택에서 부족하게 구축된 부분이기 때문입니다.

그중 세 가지는 지금 GPT-5.6 Sol을 상대로 구축할 가치가 있습니다:

비용 상한은 호출 단위가 아니라 작업 단위로 적용됩니다. 단일 작업이 몇 시간씩 실행되며 6~7백만 개의 출력 토큰을 소비할 수 있다면, 요청별 한도는 더 이상 보호 역할을 하지 못합니다. 전체 작업이 상속받는 예산과 하드 스톱이 필요합니다.

체크포인팅 및 재개 가능성. 일회성 호출은 반환되거나 실패할 뿐입니다. 수시간 동안 실행되는 에이전트가 90분째에 영속적으로 저장된 것이 하나도 없는 채로 중단되는 것은 대부분의 코드베이스가 한 번도 처리해 본 적이 없는 비용이 많이 드는 실패 유형입니다.

참조 답안이 없는 문제에 대해 믿을 수 있는 평가. 열 가지 증명이 흥미로운 이유 중 하나는 Lean이 오라클을 제공하기 때문입니다. 실제 운영 환경에서는 그런 것을 제공하는 경우가 거의 없습니다. 6시간짜리 좋은 실행과 그럴듯해 보이는 나쁜 실행을 구분할 수 없다면, 더 많은 컴퓨팅 자원도 도움이 되지 않을 것입니다.

전환 문제에 대해 말하자면, Astra는 OrcaRouter에서 사용할 수 없습니다. 어디에서도 사용할 수 없기 때문입니다. 우리가 말할 수 있는 것은 버전 변동(version-churn) 문제가 우리 쪽에서 상당 부분 해결되었다는 점입니다. 하나의 키로 200개 이상의 모델에 접근할 수 있으므로, 이것이 GPT-6, GPT-5.7, 또는 네 번째 GPT-5.6 등급으로 출시되든 간에 도입은 마이그레이션이 아니라 모델 문자열(model-string) 변경에 불과합니다. 두 번째 계약도, 새로운 SDK도 필요 없습니다. 특히 검증되지 않은 프론티어 모델의 경우, 자동 장애 조치(failover)는 실제 워크로드에서 이를 평가하는 것과, 연구실 밖에서 아무도 스트레스 테스트를 하지 않은 시스템에 프로덕션 경로를 거는 것 사이의 차이를 만들어냅니다. 트래픽의 일부를 그 모델로 라우팅하고, 폴백으로 Sol을 아래에 유지한 채 확인해보면 됩니다.

답할 가치가 있는 질문들

Astra와 GPT-6은 같은 것인가요?

반드시 그런 것은 아니며, 그것이 이 이야기에서 가장 중대한 미지수다. OpenAI는 Astra를 차기 주요 모델로 확정했지만 출시 이름은 아직 정하지 않았다. 보도에 따르면 GPT-6, GPT-5.7, 그리고 별도의 클래스가 Sol, Terra, Luna와 함께 모두 검토 대상에 올라와 있다. GPT-6라는 이름의 모델이 결코 등장하지 않을 가능성도 충분히 있으며, 사람들이 기다려 온 성능 도약이 아무도 주목하지 않던 이름으로 도래할 수도 있다.

오늘 어떤 형태로든 Astra에 접근할 수 있나요?

아니요 — ChatGPT에서도, API를 통해서도, 어떤 라우터나 리셀러를 통해서도 아닙니다. 공개적으로 존재하는 것은 논문, 추론 워크스루, 그리고 Lean 저장소뿐입니다. Astra 접근을 제공한다고 주장하는 서비스가 있다면, 그것은 다른 것을 재판매하거나 거짓말을 하는 것입니다. 현재 릴리스로 진정으로 유용하게 할 수 있는 유일한 일은 직접 증명을 컴파일하는 것입니다.

Astra는 정말 인간 수학자들이 풀지 못한 문제들을 해결했나요?

그것은 적어도 10년 동안 미해결로 남아 있던 명제들에 대해 형식적으로 검증된 증명을 산출했는데, 이는 실제적이고 이례적인 성과다. 그리고 그 검증은 업계 표준보다 한 단계 위다. 하지만 "Lean으로 검증됨"은 "동료 검토를 거침"과 같지 않으며, 각 형식적 명제가 표제 문제를 포착하는지 여부라는 프레이밍 질문은 정확히 Lean이 답할 수 없는 부분이다. 원고를 읽은 전문가들은 긍정적이었지만, 어떤 것도 심사를 거치지 않았다. 평가는 앞으로 몇 달에 걸쳐 어느 방향으로든 확정될 것으로 기대된다.

$2,000라는 수치는 최첨단 연구가 이제 저렴하다는 뜻인가요?

승리한 토큰 실행들은 실패 사례와 인간의 개입을 제외하고, 다른 모델의 가격으로 저렴했다는 뜻이다. 그 세 가지 제외 사항 각각은 상당할 수 있다. 솔직한 해석은 성공적인 자동 증명 탐색의 한계 비용이 흥미로울 만큼 충분히 떨어졌다는 것이지, 열 개의 미해결 문제가 이제 노트북 한 대 값이라는 뜻은 아니다.

이걸 실제로 해결해 줄 것은 무엇일까

세 가지 구체적인 사항이 있는데, 그중 어느 것도 루머가 아니며, 모두 실제로 발생했을 때 확인할 수 있습니다.

모델 카드와 가격 페이지. 그 순간, Astra는 더 이상 연구 산출물이 아니라 계획을 세울 수 있는 대상이 됩니다 — 그리고 이름 문제가 스스로 해결되는 순간이기도 합니다.

Lean 리포지토리를 독립적으로 재구축한 것으로, 전문가들이 유형 검사만이 아니라 정의와 비공식적 환원을 감사한다. ComparatorChallenges 디렉토리는 OpenAI가 이를 기대하고 있음을 시사한다. 공식 진술이 그러한 정밀 검토를 견뎌 낸다면, 결과는 훨씬 반박하기 어려워진다. 만약 불일치가 열 개 중 하나라도 드러나면, 그 집합의 모든 주장이 다시 읽히게 된다.

연방 검토 시계가 시작되었다는 증거다. 30일 사전 공개 기간에서, 그 제출은 출시일을 알리는 가장 이른 신뢰 가능한 신호이며 — 아레나 리더보드에서 비활성화된 항목의 다음 스크린샷보다 훨씬 더 많은 정보를 제공한다.

그때까지, 정확한 진술은 좁고 붙잡아 둘 가치가 있다: OpenAI의 다음 플래그십은 이름, 열 개의 기계 검증 가능한 증명, 워싱턴 데모, 그리고 그 외에는 아무것도 없다. 날짜를 제시하는 사람은 추측하는 것이고, 파라미터 수를 제시하는 사람은 지어내는 것이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube