히어로 타이틀 카드에는 “OpenAI의 722개 수학 원고”가 적혀 있고, 부제는 “그 뒤에 있는 모델에는 이름도, 가격도, API도 없다”, 호박색 배지에는 “미출시 모델 - 결과만”, 그리고 세 장의 카드가 있다: “출시된 것: 722개 원고, 372개 패밀리”, “출시되지 않은 것: 모델 카드 없음, 식별자 없음, 날짜 없음”, “OpenAI의 입장: 모델 출시를 위해 작업 중”.
Guides & Insights

OpenAI의 722개 수학 원고: 그 뒤에 있는 모델은 이름도, 가격도, API도 없다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 10월 6일 21:47 UTC에, 저장소가 있는데, 그 이름은openai/math 설명도 없이 초기 커밋과 함께 GitHub에 나타났습니다. 14분 후, OpenAI는 이를 X에 게시하고 "수학에서의 AI 진전 공유"라는 동반 페이지를 올렸습니다. 이 두 가지는 전례 없는 사건을 설명합니다: OpenAI가 이름도 밝히지 않고, 가격도 책정하지 않았으며, 어떤 API에서도 호출할 수 없는 내부 프런티어 모델이 생성한 722개의 수학 논문이 372개의 패밀리로 그룹화되었습니다. 그 모델 아래에 있는 모델들은 오늘날 실제로 접근할 수 있는 모델들입니다 — GPT-6 Astra는 100만 토큰당 $10 / $50이고, GPT-6.1 Sol는 $2 / $10입니다 — 그리고 그들 중 어느 것도 이 논문들을 작성하지 않았습니다. OpenAI는 그렇게 한 모델이 아직 훈련 중이며, 이를 "책임감 있게 공개"하는 작업을 진행 중이라고 말합니다. 이것이 지금까지 검증된 것, 검증되지 않은 것, 그리고 독자가 여기서 얻어야 할 한 가지 질문입니다.

이번 릴리스가 무엇이 아닌지부터 시작하자. 이것은 모델 출시가 아니다: 모델 카드도, 식별자도, 컨텍스트 윈도도, 벤치마크 표도, 날짜도 없다. 이것은 논문이 아니다: 여기 있는 어떤 것도 동료 평가를 거치지 않았으며, OpenAI는 Lean 형식화 없는 결과는 "문제가 있을 수 있다"고 분명히 말한다. 그리고 이것은 유출이 아니다 — 이 글이 지금까지 우리가 아는 내용이라는 틀을 쓰는 이유는 자료가 비밀이라서가 아니라, 주제 자체인 모델이 아직 공개되지 않았기 때문이다. 아래의 나머지 모든 내용은 저장소, OpenAI 자체 게시물, 그리고 OpenAI가 자문했다고 밝힌 자문 그룹과 대조해 확인할 수 있다.

10월 6일에 실제로 무엇이 나왔을까

이 저장소는 공개되어 있고 Apache-2.0 라이선스가 적용되며 Lean으로 작성되었다. README에는 이 카탈로그가 "722개의 원고를 372개의 패밀리로 구성해 담고 있다"고 명시되어 있는데, 여기서 패밀리는 하나의 주요 결과를 부수적 논증, 귀결 또는 대안적 증명과 함께 묶은 것이다. 원고 지도는 검증할 수 있을 만큼 상세하다: 각각 하나의 주요 결과를 가진 372개의 패밀리가 구성 논문들과, 이용 가능한 경우 Lean 형식화 링크와 함께 나열되어 있다.

OpenAI의 게시물은 자체적이며 독립적으로 감사되지 않은 출처 수치를 덧붙인다:

• 제시된 문제 — 약 4,000개, 이 중에서 공개된 문제군이 선정되었습니다

• 결과당 컴퓨트 — 평균적으로 약 3시간 분량의 ChatGPT Pro 사고에 해당

• 추론 요약 — 10건 공개, π의 무리성 지수, 대칭 및 일반 Mahler 추측, 표수 2에서의 Kaplansky의 직접 유한성 추측, 희석 스핀 유리에 대한 Mézard–Parisi 공식, 3차원 상대론적 Vlasov–Maxwell 계를 포함한 여러 계열을 다룸

• 개정 정책 — 수정을 위해 새 버전이 게시되며, 이전 버전도 계속 접근 가능하게 유지됩니다

주제들은 전체 영역에 걸쳐 있습니다: 정수론, 대수기하학 및 복소기하학, 조합론, 이론 전산학, 작용소 대수, 확률론 및 수리물리학. 일부 계열 제목은 겉보기에 매우 대담한 주장입니다 — Ryser의 덮개 추측에 대한 반례, 다음 값 미만인 정수 곱셈: n log n, 지수가 최대 9/4인 행렬 곱셈, Mahler의 추측들, Baum–Connes와 Kadison–Kaplansky에 대한 반례들. 주어진 주장이 성립하는지 여부는 바로 이번 릴리스가 여러분을 위해 결론을 내려주지 않는 질문입니다.

Screenshot of the GitHub repository page for openai/math, created October 6, 2026, showing the README statement that the repository contains mathematical manuscripts and supporting proof artifacts produced by an internal OpenAI model, the description of 722 manuscripts organized into 372 families, and the list of ten released reasoning summaries.

그 모델은 아직 이름도 없고 공개되지도 않았으며, OpenAI는 곧 출시될 예정이라고 말한다

README는 저자에 대해 명확하다: "내부 OpenAI 모델이 생성한 수학 원고 및 이를 뒷받침하는 증명 산출물"이며, 대다수는 "공개되지 않은 내부 OpenAI 모델을 사용해" 얻은 것이다. 이름도, 코드명도, 크기도 없다. 다른 보도에서 떠도는 이름들은 OpenAI가 확인한 바 없으며, 우리는 그러한 이름을 제공하지 않을 것이다.

날짜를 특정할 수 있는 것은 그 주변의 타임라인이다. 2026년 8월 28일, OpenAI의 수학 자문 그룹 페이지에 따르면, 이 회사는 "새 내부 모델을 훈련하기 시작했다"고 밝혔으며, 그 모델은 이후 나비에–스토크스 밀레니엄 상 문제와 OpenAI 자체 집계로 100개 이상의 오랫동안 미해결로 남아 있던 문제를 해결했다. 나비에–스토크스 결과는 2026년 9월 8일에 별도로 발표되었는데, 이 자리에서 OpenAI는 그 결과를 낸 모델을 "GPT-6 Astra보다 훨씬 더 뛰어나다"고 설명하고 훈련은 아직 진행 중이라고 말했다. 이번 주 컬렉션에 포함된 원고 중 두 편은 표준 절차를 벗어나는데, 이는 이번 공개가 하나의 일관된 파이프라인이 아니라는 뜻이므로 주목할 만하다: 리만 제타 함수의 무영점 영역에 관한 연구와 CM 아벨 다양체에 대한 호지 추측 증명은 다르게 처리되었으며, OpenAI는 제타 관련 글은 가독성을 위해 사람이 편집했다고 말한다.

그다음, 이 문제를 놓고 계획하는 모든 사람에게 중요한 문장이 있습니다: OpenAI는 "이러한 결과를 만들어낸 모델을 책임감 있게 공개하기 위해 노력하고 있다"고 씁니다. 그것은 의도에 대한 진술이지 날짜가 아닙니다. 그것이 출시되기 전까지 개발자가 호출할 수 있는 OpenAI 모델은 이미 가격표에 올라 있는 모델뿐입니다.

여기서 "검증"이란 무엇을 의미하며 — 그것이 어디까지인가

이것은 그 발표에 관한 대부분의 보도가 한 문구로 압축해버리는 부분이며, 어떤 개별 논문에 얼마나 비중을 둘지를 결정하는 부분이다.

OpenAI는 "이 컬렉션에는 다양한 검증 단계에 있는 결과들이 포함되어 있다"라고 분명히 밝힌다. 이 묶음에서 가장 강력한 형태의 증거는 Lean 형식화로, 이는 사람이 아니라 컴퓨터가 증명을 검사할 수 있게 해 준다. 저장소 자체의 형식화 매니페스트 — 주요 결과가 형식화된 논문들의 목록 — 에는 162개 항목이 등록되어 있으므로, 722편의 원고 중 약 5분의 1이 공개 트리에서 기계 검증 가능한 증명의 뒷받침을 받고 있다. OpenAI는 "그것들을 확보하는 대로" 더 추가될 것이라고 말한다.

나머지 대다수는 그런 의미에서 검증되지 않았으며, OpenAI는 전체 컬렉션에 걸쳐 그렇지 않은 척하지 않는다: "형식화되지 않은 결과 중 일부에는 문제가 있을 수 있습니다. 그러한 문제가 있으면 신속히 수정하도록 노력하겠습니다." 두 가지 구조적 세부 사항은 이것이 개방형 릴리스가 아니라 관리형 릴리스임을 뒷받침한다 — 저장소에서는 이슈가 비활성화되어 있고, 풀 리퀘스트는 협력자로 제한되어 있다. 이미 올라와 있는 증명에 이의를 제기할 수 있는 공개적 경로는 없다.

따라서 정직한 해석은 헤드라인 숫자가 암시하는 것보다 더 좁다:

• 기계 검증됨 — 공개 Lean 트리에서 주요 결과가 형식화된 논문 162편

• 기계 검사되지 않음 — OpenAI 자체가 잠재적으로 오류를 포함할 수 있다고 표시하는 나머지 부분

• 인간의 책임 — 누구도 지목되지 않음; OpenAI 스스로의 설명 방식은, 산출된 것의 대부분 배후에 있는 논증을 이해하는 사람은 아무도 없다는 것이다

• 독립적 평가 — 공개된 것은 없음; 어떤 결과가 포함될 만큼 “유의미”한지에 대한 선별은 OpenAI가 수행했다

그렇다고 해서 그 작업이 잘못되었다는 뜻은 아니다. 그것은 지금으로서는 "OpenAI가 722개의 증명을 공개했다"와 "722개의 증명이 검증되었다"가 서로 다른 진술이며, 오늘 참인 것은 첫 번째뿐이라는 뜻이다.

Three-column infographic titled "How much of the 722 is actually checked", contrasting "Machine-checked: 162 manuscripts, formalized main result, in the public Lean tree", "Not machine-checked: the remaining majority, no Lean formalization, OpenAI says could contain issues", and "Human or independent review: none named, none published, selection made by OpenAI", with a footer reading "Figures per OpenAI's repository and post, October 6 2026".

자문단이 조건을 붙였고, 이는 공식 기록에 남아 있다

OpenAI의 게시물에 따르면, OpenAI는 Institute for Advanced Study의 독립적인 수학 및 인공지능 자문 그룹(Advisory Group on Mathematics and Artificial Intelligence)과 협의했고 “그들의 조언과 공개 권고”를 참고했다. 그 권고는 이 그룹이 수학계로부터 600건이 넘는 응답을 받은 뒤 2026년 9월 29일에 발표되었으며, 이 그룹은 단순한 거수기가 아니기 때문에 직접 읽어볼 가치가 있다.

같은 문서는 서두에서 이 그룹이 그 관행을 전혀 지지하지 않는다고 밝히고 있다: "일부 프런티어 AI 연구소들은 더 넓은 과학계가 접근할 수 없는 독점 모델에서 고급 수학 문제를 테스트하고 있다... 우리는 이 관행을 지지하지 않으며, 중단할 것을 요청한다." 그룹은 또한 스스로 독립적으로 운영되며, 구성원들은 무급이고 OpenAI에 대한 의사 결정권이 없다고 설명한다 — OpenAI 자신의 게시물도 이 관계에 대한 설명을 그대로 반영한다.

그룹의 권고안과 이번 릴리스가 일치하는 지점은 프로세스에 있다: 아이디어를 처음 제시한 연구를 인용한 철저한 문헌 검토, 가공되지 않은 모델 출력이 아니라 표준 양식으로 작성된 증명 문서, 그리고 이전 릴리스들을 보존하는 버전 관리. 일치하지 않는 지점은 그룹이 핵심이라고 부르는 부분이다 — 아무도 이해하지 못하는 결과를 공개하는 연구소는 뒤따라야 하는 인간의 이해를 워크숍, 컨퍼런스, 프로그램을 통해 지원해야 하며, 이 작업은 연구소가 주도하는 것이 아니라 커뮤니티가 주도해야 한다는 것. OpenAI는 "AI가 산출한 주요 결과에 대한 이해를 둘러싼 일련의 워크숍, 컨퍼런스, 특별 프로그램"에 자금을 지원하겠다고 약속했으며 세부 사항은 추후 공개하겠다고 밝혔다. 그것이 아직 열려 있는 항목이며, 바로 그것을 두고 그들에게 약속 이행을 요구해야 한다.

오늘 무엇을 걸 수 있는지, 그리고 여기서 라우팅이 실제로 무엇을 위한 것인지

이 원고들을 만들어낸 모델에 요청을 보낼 방법은 없고, 어떤 제3자 플랫폼도 그 요청을 라우팅할 수 없습니다 — 그렇지 않다고 주장하는 어떤 목록이든, 누구의 카탈로그에도 존재하지 않는 모델을 설명하고 있는 것입니다. 프로덕션 환경의 OpenAI 모델은 라이브 GPT-6 라인이며, 그 수치들은 추론된 것이 아니라 가격표에 있습니다:

• GPT-6 Astra — 백만 토큰당 $10 / $50, $1 캐시 읽기, 272K 초과 롱 컨텍스트 티어는 $20 / $50; 1.05M 토큰 컨텍스트, 128K 최대 출력

• GPT-6.1 Sol — 백만 토큰당 $2 / $10, 캐시 읽기 $0.10; 동일한 장문맥 계층화 $4 / $15; 1.05M 토큰 컨텍스트, 128K 최대 출력

둘 다 OrcaRouter 카탈로그에 있습니다, 이는 이 발표를 역량에 관한 신호로 읽는 모든 사람에게 실질적인 핵심입니다: 오늘 여러분이 사용하도록 허용된 모델들은 여러분의 프롬프트가 이미 그에 맞춰 형성된 모델들이기도 하며, 그 모델들과 내부 모델 사이의 격차는 바로 OpenAI가 수학자들의 도움을 받아 좁히려고 하는 격차입니다.

그 격차는 또한 실험 비용을 프로덕션 경로와 분리해 두어야 하는 이유이기도 합니다. OpenAI가 실제로 이 모델에 이름과 가격을 붙이면, 첫 주는 검증되지 않은 벤치마크 주장이 쏟아지고 허둥지둥 재통합하는 작업이 밀려들 것입니다 — 우리 같은 플랫폼의 라우팅 논거는, 검증되지 않은 모델을 시도할 때 드는 비용이 마이그레이션이 아니라 모델 문자열 하나라는 점입니다. GPT-6 Astra는 백만 토큰당 $10 / $50, GPT-6.1 Sol은 $2 / $10이며, 0% 마크업으로 정가 그대로 전달되므로, 벤더 가격 변경은 적용되는 당일 바로 반영됩니다. 자동 페일오버 덕분에 새 모델이 트래픽의 일부를 담당하다가 요청 경로까지 함께 무너뜨리지 않고 빠질 수 있으며, 라우팅 DSL을 사용하면 여러 모델을 하나의 호출로 구성할 수 있으므로 긴 유도 과정에 대해 단일 답변이 아니라 다른 의견을 원할 때 유용합니다. 이 중 어느 것도 아직 출시되지 않은 모델에는 적용되지 않습니다 — 하지만 다음 모델이 나오기 전에 갖춰 두고 싶은 바로 그 인프라입니다.

Screenshot of the OrcaRouter model page for OpenAI GPT-6.1 Sol, showing a 1.05M-token context window, 128K max output, a base pricing tier of $2.00 per million input tokens and $10.00 per million output tokens with a $0.100 cache read and $2.50 cache write, a long-context tier above 272K prompt tokens at $4.00 / $15.00 with $0.200 cache read and $5.00 cache write, plus live performance and benchmark panels.

다음에 볼 콘텐츠

중요해질 가능성이 큰 순서대로 네 가지입니다. 형식화 건수, 이번 릴리스에서 “OpenAI가 말한다”에서 “기계가 검증했다”로 넘어갈 수 있는 유일한 숫자이며 공개되어 있기 때문입니다. 이름이 붙은 결과에 대한 최초의 진정한 독립 평가 — OpenAI 외부의 수학자가 특정 논문을 공개적으로 검토하는 것이지, 모음집 요약이 아닙니다. OpenAI가 여전히 탐색 중이라고 말하는 커뮤니티 호스팅 저장소, 이는 그 산출물을 OpenAI 자체 계정에서 꺼내 해당 분야의 손으로 넘기는 일이 될 것입니다. 그리고 OpenAI가 약속했지만 일정은 잡지 않은 모델 자체입니다.

722개의 원고는 AI가 이 문제들을 해결했다는 뜻인가요?

일부에 대해서는, 수학이 성립한다면: 이 컬렉션은 잘 알려진 미해결 문제들에 걸친 반례와 증명을 주장하며, 그중 162편의 논문은 주요 결과를 뒷받침하는 기계 검증 가능한 형식화를 갖추고 있다. 나머지에 대해서는, 어떤 모델이 그 문제에 관한 원고를 만들어냈다는 주장인데, 이는 검증된 해법보다 약한 진술이며, OpenAI 스스로도 형식화되지 않은 결과에는 오류가 있을 수 있다고 경고한다. "증명을 만들어냈다"와 "증명을 가지고 있다"의 구분이 이번 공개 릴리스의 전부다.

이 중에 오늘 실제 제품에 쓸 수 있는 게 있나요?

아니요. 그 원고들은 PDF, Lean 소스, 추론 요약입니다 — 서비스가 아니라 연구 산출물입니다. 모델 ID도, 엔드포인트도, 가격도, 접근 요청 양식도 없습니다. 개발자에게 이번 공개에서 실질적으로 유용한 부분은 OpenAI가 GPT-6 Astra를 실질적으로 뛰어넘는 모델을 훈련 중이라는 확인이며, 이는 이번 주에 호출할 수 있는 무언가라기보다 향후 12개월을 위한 계획 신호입니다.

OpenAI는 왜 모델 대신 결과를 발표했나요?

두 가지는 위험 특성이 다르기 때문이다. 논문을 출판하는 것은 되돌릴 수 있다 — OpenAI는 이전 버전을 보관하며 문제를 수정하겠다고 말한다 — 반면 모델을 출시하는 것은 되돌릴 수 없다. OpenAI는 이를 책임감 있게 출시하기 위해 노력 중이라고 밝히며, 회사가 참고했다고 말하는 자문 그룹의 권고안은 바로 이 순서를 중심으로 구성되어 있다: 결과를 인용과 버전 관리를 갖춰 해당 분야의 손에 들어가게 하고, 그다음 반드시 뒤따라야 하는 인간의 이해를 위한 자금을 지원하라.

훑어보는 사람을 위한 한 줄 요약: AI가 만들어낸 진정으로 전례 없는 규모의 수학 연구 결과물이 10월 6일 공개됐고, 그중 약 5분의 1은 기계 검증됐으며, 어느 것도 동료 검토를 거치지 않았고, 전부 당신이 사용할 수 없는 모델에 연결되어 있다. 흥미로운 질문은 그 모델이 유능한지가 아니다 — 4,000개 문제에 걸쳐 결과당 3시간의 최전선 사고 연산이 그 답을 내주며, OpenAI는 그 모델이 GPT-6 Astra보다 훨씬 더 유능하다고 말한다 — 그보다는 다음 릴리스가 이것을 구식으로 만들기 전에 검증과 인간의 이해가 따라잡을 수 있을지다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트