
OpenAI의 두 번째 루프 모델: DevDay '금지된 축' 유출이 실제로 주장하는 바
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1323 tok/s
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
이 기사가 다루는 주장의 출처는 정확히 하나뿐이며, 그것은 X의 단일 게시물입니다. 9월 24일, 계정 @scaling01이 벤더가 "수문을 열었고 DevDay에서 GPT-6 Astra 외에 두 번째 루프형 언어 모델을 출시할 것"이라고 썼으며, 순환 깊이(recurrent depth)를 "금단의 축"이라고 표현하고 그것이 이제 "더 이상 금단이 아니다"라고 언급했습니다. 그게 전부입니다: 모델 이름도, 모델 ID도, 가격도, 샌프란시스코에서 열리는 9월 29일 DevDay 기조연설 외의 날짜도, 벤더의 발언도 없습니다. 이 주장이 독자의 시간을 들일 가치가 있는 이유는 트윗이 아니라 그 밑에 깔린 출시된 사실들입니다. GPT-6 Astra는 벤더가 9월 3일에 출시한 모델로, 보도가 루프형 순환 깊이 아키텍처와 연결한, 모든 주요 연구소를 통틀어 최초의 프로덕션 모델입니다. GPT-6 Sol과 GPT-6 Luna는 9월 22일 백만 토큰당 입력 $2 / 출력 $10, 입력 $0.10 / 출력 $0.50에 출시되어 그 플래그십을 가격 사다리로 바꾸어 놓았습니다. 두 번째 루프 모델이 나온다면 이는 벤더가 더 이상 순환 깊이를 일회성 베팅이 아니라 상시 아키텍처로 취급하고 있다는 뜻입니다 — 단일 출시보다 더 큰 주장이며, 확인하기는 훨씬 더 어려운 주장입니다.
이는 현재까지 파악된 내용을 정리한 글입니다. 게시자나 익명 제보에 귀속되는 모든 내용은 그와 같이 표기되어 있으며, 이 글의 어떤 부분도 공식 발표로 해석되어서는 안 됩니다.
왜 '금지된 축'이라는 표현이 그 트윗에서 가장 흥미로운 부분인가
이 표현은 게시자 자신의 문구로, 전문 용어는 아니지만 실재하는 무언가를 가리킨다. 트랜스포머 스케일링에는 세 가지 명확한 축이 있다: 파라미터, 데이터, 학습 컴퓨트다. 반복에 의한 깊이(depth-by-recurrence)는 네 번째 축이며, 이는 상당히 특이한 축이다. N개의 서로 다른 블록을 쌓는 대신, 루프 모델은 동일한 작은 블록 스택을 R번 재사용하므로, 파라미터 수는 그대로 유지되면서 실효 깊이는 대략 레이어 수에 루프 횟수를 곱한 값이 된다. Google DeepMind는 Reasoning with Latent Thoughts: On the Power of Looped Transformers에서 이론을 제시했고, 널리 인용된 Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach는 실용적 사례를 보여주었다.
그것은 공짜 깊이가 아니다. 루프형 언어 모델에 대한 등깊이 스케일링 연구는 재귀 등가 지수를 대략 0.46으로 제시한다 — 즉, 루프를 하나 더 추가하면 진짜 새로운 블록 하나가 벌어다 주었을 몫의 약 46%를 얻는다는 뜻이다. 당신은 깊이를 할인된 값에 사고 있고, 그 대가는 메모리가 아니라 직렬 연산으로 치르고 있다. 이는 메모리에 병목이 있거나 작은 모델이 큰 모델처럼 행동하기를 원하는 경우 유리한 거래이며, 이는 모든 패밀리의 저가 티어가 바라는 바로 그 거래다.
그러면 왜 "금지"인가? 루프 내부에서 일어나는 계산은 출력되는 토큰이 아니라 은닉 상태에서 일어나기 때문이다. 사고의 연쇄 모니터링 — 모델이 생각하는 동안 적어 내려가는 내용을 읽는 것 — 은 추론 모델이 등장한 이후 업계의 주요 보증 도구였고, 7월 Hugging Face 에이전트 사건을 조사자들이 애초에 파악할 수 있게 만든 도구였다. 잠재 공간에서 더 많은 작업을 하는 모델은 그 도구가 읽을 거리를 줄인다. 이는 2년 동안 최전선에서 루프를 쓰는 것에 반대하는 논거였으며, 이 기법이 오픈 웨이트에서 퍼진 이유이기도 하다 — ByteDance Seed의 Ouro, 1.4B와 2.6B, 그리고 Nanbeige4.2-3B, 22개 층 스택을 두 번 통과시키는 모델 — 반면 안전성 약속을 공개한 연구소들은 이 기법을 피했다. Alibaba의 MeSH와 SpiralFormer 논문들은 같은 문제를 효율성 측면에서 공략했다.
OpenAI가 실제로 말한 것과 말하지 않은 것
이 일을 촉발한 보도는 The Information이 9월 1일과 2일에 한 보도입니다: Astra가 recurrent depth, 즉 opaque recurrence라고도 설명되는 기법을 사용한다는 내용입니다. 그 매체는 확실한 실적을 갖춘, 출처가 탄탄한 매체이며, 이는 여전히 문서가 아니라 보도입니다. OpenAI는 루프 설계를 확인하는 아키텍처 논문을 발표한 적이 없으며, Astra에 관한 Sebastian Raschka의 널리 읽힌 분석은 루프 구조가 공개 발언에서 추론된 것이라고 분명히 말합니다 — 그의 재구성에 따르면 Astra는 22개 블록을 두 번 실행해 실질적으로 44번의 블록 적용을 하며, 두 번의 루프가 최적이고 그보다 많으면 훈련을 불안정하게 만듭니다.
OpenAI 내부 사람들이 말한 내용은 언론 보도나 반발이 시사한 것보다 더 좁고 신중했다. 최고 과학자 Jakub Pachocki는 9월 2일, Astra를 포함한 프런티어 모델의 계산 그래프 깊이가 GPT-4의 두 배 이내 범위에 있다고 게시했다. 이는 일부 헤드라인이 암시한 극단적 재귀가 아니라 제한된 양의 루프이며, 그가 혼란스러운 보도라고 부른 것에 반박하는 한편 사고 연쇄(chain-of-thought) 모니터링이 취약하고 부정적인 방향으로 가고 있음을 인정했다. 알려진 바에 따르면 Astra 시스템 카드는 추론 추적의 모니터링 가능성이 GPT-5.6 Sol보다 한 단계 낮아졌다고 지적하는데, 이는 실질적인 인정이며 어떤 아키텍처가 그 원인인지에 좌우되지 않는다.
안전성 반응은 거셌다. Redwood Research의 Buck Shlegeris는 자신이 극도로 우려하고 있다고 말하며, 재귀를 확장하면 "CoT 모니터링 가능성을 완전히 파괴"할 수 있다고 경고했다. Ryan Greenblatt와 Zvi Mowshowitz는 서로 다른 어조로 같은 주장을 펼쳤다. 가장 유용한 반론은 Raschka에게서 나왔다. OpenAI는 o1 세대 이후 아키텍처와 무관하게 원시 추론 추적을 공개하지 않아 왔으며, 더 강력한 모델이 더 짧은 사고 사슬을 내놓는 것 자체만으로 숨겨진 추론 채널의 증거가 되지는 않는다.
그 두 문단을 합치면 그 트윗이 걸고 있는 판세가 나온다. "Astra는 루프형이다"라는 것은 OpenAI가 확인을 거부한 신뢰할 만한 보도다. "두 번째 루프형 모델이 9월 29일에 출시된다"는 게시물 하나다.
9월 OpenAI 유출 5건, 그리고 이번 건의 위치
9월에는 OpenAI 관련 유출 보도가 빽빽하게 몰려 나왔는데, 그것들에 대해 유용한 점은 모두 같은 종류의 증거가 아니라는 것이다.
• 9월 3일 — 문자열 gpt-6-astra와 gpt-6-astra-aeon가 Codex Desktop 내부의 Statsig 기능 플래그에 나타났고, @notjazii가 스크린샷을 찍었으며 @kimmonismus가 이를 확산시켰다. Aeon 에이전트 이야기는 그로부터 생겨났다. 5주가 지난 지금도 Aeon에 대한 제품 페이지도, 가격도, 문서도, 벤치마크도 없으며, 해석되는 모델 ID도 없다.
• 9월 21일 — NVIDIA 병합 기록에서 {{1}}GPT-6 Sol medium{{/1}} 문자열이 나타났습니다.
• 9월 22일 — gpt-6-sol, gpt-6-luna, gpt-6-astra-minor를 위한 세 개의 Azure 레지스트리 경로가 중국 개발자 포럼 locdd.com에 실제 Microsoft URL로 게시되었습니다. 다음 날 우리가 공개 플레이그라운드 구성 엔드포인트를 가져왔을 때, 그 안에는 세 가지 새 이름이 없었습니다. 대신 레지스트리에는 gpt-6-astra와 더 오래된 GPT-5.6 세대 항목들이 들어 있었습니다.
• 9월 22일 — GPT-6 Sol과 GPT-6 Luna가 출시되었습니다. 가격, 모델 ID, SDK 릴리스 노트, Bedrock 등록, GitHub Copilot 선택기 항목, Perplexity 기본값이 모두 하루 만에 뒤따랐습니다.
이 패턴은 미묘하지 않다. 실제로 출시되는 표면 — SDK 릴리스 노트, 클라우드 레지스트리, 데스크톱 기능 플래그 — 안에 아티팩트를 담고 있는 유출 유형은 계속 제품으로 이어졌다. 이름만 있던 유출 유형은 그렇지 않았다. 오늘의 주장, 즉 OpenAI가 DevDay에서 내놓은 두 번째 루프형 언어 모델은 아티팩트를 전혀 갖고 있지 않다: 문자열도, 플래그도, 레지스트리 경로도, 가격 행도, 모델 ID도 없다. 그렇다고 해서 그것이 틀린 것은 아니다. 그것은 외부에서 검증할 수 없게 만들 뿐이며, 이는 다른, 그리고 더 정직한 설명이다.
그것을 둘러싼 DevDay 일정은 실재하며, 이례적으로 잘 문서화되어 있다.
정확히 날짜를 알 수 있는 단 하나는 바로 그 행사입니다. DevDay 2026은 9월 29일 화요일, 샌프란시스코의 Fort Mason에서 열리는 것으로 확정되었으며, Sam Altman이 기조연설을 하고 무료 라이브스트림도 진행됩니다 — OpenAI는 지난 4월에 이 날짜를 발표했습니다.
그 안에서 기대되는 바는 평소보다 더 노골적으로 예고돼 왔다. Altman은 9월 15일 OpenAI에 "이번 주에 큰 출시가 있고, 그다음 DevDay에는 ship x 6"이 있다고 게시했고, 다음 날 저녁 그 첫 부분을 철회했다: "이번 주에 출시하게 되어 기대했던 가장 중요한 것은 대신 다음 주가 될 예정이지만, 내 생각엔 기다릴 가치가 있어!" 그 주를 DevDay급으로 규정했던 프로덕트 리드 Tibo Sottiaux는 9월 19일 출시가 여전히 화요일에 나온다고 말했고, 9월 22일에는 실제로 나왔다 — Sol and Luna, 더불어 유료 계정을 위한 적립된 Codex 사용량 리셋도 있었다. "ship x 6"을 DevDay 즈음 출시되는 여섯 가지의 수로 읽으면 두 번째 루프형 모델도 그 표현의 일반적 의미에 자연스럽게 들어맞는다; 과장으로 읽으면 전혀 들어맞지 않는다. 어느 쪽이든 그것은 창업자의 게시물이지 로드맵이 아니다.
인접한 유출들은 모델 이름을 밝히지 않은 채 같은 방향을 가리킨다. Codex Cloud 빌드가 Tailscale 및 프록시 통합과 함께 데스크톱 ChatGPT 빌드 9922에서 모습을 드러냈고, 온보딩 흐름에서는 개발자 플랜 등급 — Free, Prototype, Accelerate, 마지막은 $50 — 이 기조연설 며칠 전에 나타났다. 둘 다 루프된 모델은 아니다. 둘 다 연구보다 플랫폼에 더 무게를 둔 DevDay와 일치한다.
만약 그것이 진짜라면, 어떤 모델입니까?
아무도 신원을 신고하지 않았으므로, 다음은 추론이며 그렇게 읽어야 합니다.
"OpenAI의 두 번째 루프 모델"로 가는 가장 짧은 길은 Astra 후속 모델이다. 앨트먼은 더 유능한 모델이 "머지않아" 나올 것이라고 말해 왔으며, 순환 깊이 기반 위에서 그런 모델을 만드는 가장 저렴한 방법은 아키텍처는 그대로 두고 루프 예산을 높이는 것이다 — 더 많은 가중치가 아니라 토큰당 더 많은 순환이다. 그 해석은 "수문이 열린다"는 프레이밍을 가장 잘 설명하기도 한다. 왜냐하면 동일한 아키텍처의 두 번째 플래그십은 첫 번째가 통했다는 선언이기 때문이다.
두 번째 해석은 기존 GPT-6 라인 안의 새로운 계층이다. 명명 문법은 이미 gpt-6-astra-minor, gpt-6-sol, gpt-6-luna 문자열을 내놓았고, 다른 깊이 예산의 루프형 형제 모델은 이제 백만 출력 토큰당 $0.10에서 $50까지 아우르는 패밀리와 완전히 들어맞는다. 더 저렴한 루프형 모델은 독자가 지갑에서 가장 크게 체감하게 될 이 패밀리의 버전일 것이다.
세 번째 해석 — 루프형 오픈 웨이트 공개 — 은 가장 뒷받침이 약하다. 그것은 그 문구를 다른 무엇보다 잘 설명해 줄 것이며, 그것이 나란히 놓일 공개 루프형 문헌은 이미 Ouro와 Nanbeige4.2-3B에 존재한다. 하지만 OpenAI는 이 세대에 대해 그런 방향으로 아무것도 발표하지 않았고, 단어 하나에 맞추기 위해 제품을 만들어내는 것은 유출 보도가 잘못되는 방식이다.

이것을 9월 29일 전에 확인 가능하게 하려면 무엇이 필요할까요?
지난 세 번의 누출을 해결한 표면들을 다음 순서대로 주시하세요:
• OpenAI API에서 인식되는 모델 ID 또는 가격 페이지의 새 행.
• openai-go 또는 openai-node SDK의 릴리스 노트에서 새 모델 식별자의 이름을 밝히는 것 — 이것이 바로 Sol과 Luna가 자신들의 등장을 스스로 유출한 방식입니다. SDK v3.65.0이 발표 페이지가 게시되기 몇 시간 전에 모델 식별자를 배포했기 때문입니다.
• Bedrock 또는 Azure 리스팅, 또는 데스크톱 빌드의 새로운 Statsig 플래그 문자열.
• 시스템 카드에 들어갈 아키텍처 관련 문장. 이것은 가장 중요하면서도 가장 마지막에 나올 문장이다. 왜냐하면 OpenAI는 Astra의 루프 설계를 확인한 적이 없기 때문이다.
처음 세 가지에 못 미치는 것은 모두 이름이며, 이름은 이번 주기 전체에서 가장 신뢰할 수 없는 산출물이었다.

트윗이 사실이 아닌 것으로 밝혀지더라도 그것이 중요한 이유
순환 깊이가 예외적인 것이 아니라 표준이 되면 두 가지가 달라진다.
첫 번째는 보증입니다. 차세대 모델이 추론의 더 많은 부분을 은닉 상태에서 수행하게 되면, 모델이 작성한 사고 연쇄를 읽는 데 의존하는 모든 평가는 신호를 잃게 됩니다. 여기에는 OpenAI 자체의 모니터링뿐 아니라 제3자 안전성 평가도 포함됩니다. 이는 보증 요건을 가진 누구에게나 조달 판단의 입력 자료가 되며, 벤치마크 표에서는 드러나지 않을 것입니다.
두 번째는 가격 사다리의 형태입니다. 루핑은 파라미터를 직렬 연산과 맞바꾸므로, 비용을 메모리에서 시간으로 옮깁니다. 호스팅은 잠재적으로 더 저렴하고, 토큰당 속도는 잠재적으로 더 느려질 수 있습니다. GPT-6 라인은 이미 그 트레이드오프를 가격에 명시적으로 반영하고 있습니다 — 백만 토큰당 입력 $10 / 출력 $50인 GPT-6 Astra는 심도 모델이고, $2 / $10인 GPT-6 Sol은 빠른 모델이며, $0.10 / $0.50인 GPT-6 Luna는 대용량 모델입니다. 세 가지 모두 OrcaRouter에서 OpenAI의 정가로 서비스 중이며 마크업이 없습니다. 따라서 만약 네 번째 루핑 모델이 9월 29일에 출시된다면, 우리 쪽 요금표는 출시 당일 벤더의 요금표와 같습니다 — 그리고 벤더의 가격 인하는 그쪽에서 적용되는 바로 그날 여기서도 적용됩니다.
이런 유출의 실용적 용도는 예측이 아니라 준비입니다. 5일 뒤에 출시될 수도 있고 독립적인 벤치마크도 없는 모델은 바로 자동 페일오버가 존재하는 이유에 해당합니다. 경로를 새 모델로 지정하고 그 뒤에 GPT-6 Astra나 GPT-6 Sol을 유지하면, 첫 주가 좋지 않더라도 프로덕션 경로 전체가 아니라 트래픽의 일부만 잃게 됩니다. 그것은 또한 깊이 중심 모델을 테스트하는 현명한 방법이기도 합니다. 라우팅 DSL은 대체하려는 모델들 옆에 그 모델을 하나의 호출로 구성하고, 모델 퓨전은 동일한 프롬프트에 대해 여러 모델로 구성된 패널을 실행하는데, 이는 어떤 출시 발표 글보다 새 아키텍처를 더 빠르게 파악하는 방법입니다.
오늘 밤 실제로 무엇이 진실인가
X의 한 게시물은 OpenAI의 두 번째 루프 언어 모델이 9월 29일에 출시된다고 말한다. 모델 ID도, 가격도, 이름도, 두 번째 출처도, 산출물도 없다. 그 밑에는 9월 3일에 출시된 플래그십이 있는데, 보도에서는 루프 구조라고 하지만 OpenAI는 루프 구조라고 확인한 적이 없으며, GPT-5.6 Sol 대비 추론 트레이스 모니터링 가능성의 저하를 인정했고, 최고과학자는 루프가 GPT-4의 연산 그래프 깊이의 두 배 이내로 제한된다고 말하며, 9월 22일에 출시된 저가 티어는 그 아키텍처 문제를 학술적 문제가 아니라 상업적으로 중요하게 만들었다.
그것은 두터운 이야기 위에 얹힌 빈약한 주장이며, 이는 행사 닷새 전 유출이 흔히 보이는 형태다. 화요일에 Fort Mason에 두 번째 루프형 모델이 등장한다면, 흥미로운 세부 사항은 벤치마크 수치가 아니라 시스템 카드가 모니터링 가능성 유보 문구를 반복하는지 여부일 것이다. 그 한 문장이 "더 이상 금지되지 않음"이 구호인지 정책인지 말해준다.

이 글에서 비교한 모델3
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
