
GPT-6.7과 'Bob' 질문: OpenAI의 미출시 플래그십이 정말 2배 느리게 실행될까?
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
8월 15일, @Yuchenj_UW 계정의 X 게시물은 소문을 한 문장으로 압축했다: "GPU 커널의 왕, Bob이 회사를 떠났다고? GPT-6.7이 2배 느려질 것이다…." 그 물음표에는 두 가지 주장이 실려 있다 — 회사의 가장 비밀스러운 엔지니어가 떠났다는 것과, 그의 퇴사로 인해 회사의 미공개 플래그십 모델 GPT-6.7(지난 10월 GPT-6-7로 개명)의 서빙 속도가 절반으로 줄어든다는 것. 어느 주장도 검증되지 않았다. 하지만 이 게시물은 회사의 차기 모델이 이미 문제가 된 시점에 등장했다 — 문제는 언제가 아니라 여부다: Astra 제품군 이름은 8월 1일에 등장했고, 8월 7일 안전 검토가 이를 보류시켰으며, 현재 플래그십으로 OrcaRouter에서 서비스 중인 GPT-5.6 Sol이 차세대가 넘어서야 할 유일한 구체적 기준점이다. 오늘 현재 실제로 확인 가능한 사실은 다음과 같다.
먼저 한 가지: OpenAI 외부에서는 아무도 GPT-6.7을 실행해 본 적이 없습니다. 토큰 제공 속도에 대한 어떤 주장도 추정일 뿐입니다 — "2x slower" 수치도 포함해서요. 아래 내용은 검증된 사실(이름 변경, 출시 일정, 공식적으로 확인된 이탈)과 전설(Bob, 커널, 숫자)을 구분합니다. 모든 루머 자료는 그렇게 표시되어 있습니다.
"Bob"이 누구인지, 그리고 한 명의 엔지니어가 어떻게 전설이 되었는지
"Bob"은 회사가 공식적으로 이름을 확인해 준 적이 없는 엔지니어를 OpenAI 직원들이 부르는 별명이다. 2025년 9월의 언론 보도(QbitAI, The Paper, itbear — 모두 전·현직 OpenAI 직원을 인용)는 추론에 사용되는 CUDA 커널을 단독으로 작성하는 비밀스러운 연구원을 조명한다. CUDA 커널은 트랜스포머 수학을 토큰으로 변환하는 저수준 GPU 코드다. OpenAI 내부에서 "Bob 커널"이라 불리는 그의 어텐션 커널은 수십만 개의 GPU에서 하루에 수조 번 실행되는 것으로 알려져 있으며, 그에 걸맞은 정밀도가 요구된다. 버그 하나가 발생하면 체크포인트 롤백과 재학습 사이클이 강제되기 때문이다.
전설은 여러 증언에서 일관되게 나타난다. 전 직원들은 밥이 동료들이 일주일 동안 씨름해 온 성능 문제를 몇 분 만에 해결했다고 말한다. OpenAI 내부 Slack에는 "Bob magic" 이모지가 있다. 같은 보도에서 인용된 업계 추정에 따르면 고성능 트레이닝 CUDA 커널을 작성할 수 있는 살아 있는 사람은 100명 미만이다. 그래서 이런 종류의 단일 인물 의존성은 있으면 좋은 정도가 아니라 실제로 위험한 것으로 간주된다.
{{1}}정체에 관해 OpenAI는 밥(Bob)이 누구인지 밝힌 적이 없다.{{/1}} {{2}}동일한 언론 보도에서 반복되는 주요 가설은 스콧 그레이(Scott Gray)다. 그는 물리학과 컴퓨터 과학을 전공한 졸업생으로 2016년 OpenAI에 합류했고, OpenAI의 2017년 블로그 게시물 "Block-sparse GPU kernels"의 제1 저자였으며, 이후 GPT-4 기술 보고서와 스케일링 법칙(scaling laws) 논문의 공동 저자로 참여했다. 그의 논문은 51편이며 인용 횟수는 8만 회가 넘는다.{{/2}} {{3}}그 추정은 정황적이지만 널리 반복되어 왔으며,{{/3}} {{4}}확인이 아닌 추론에 불과하다.{{/4}}
Bob이 정말 떠났나요?
그 트윗은 주장이 아니라 질문이다. 하지만 그 질문이 가리키는 퇴사에는 문서적 근거가 있다. 2026년 8월 15일에 게재된 리더십 교체 정리 기사에 따르면, 2016년에 합류해 스파스 트랜스포머, 스케일링 법칙, GPT-3의 기반 인프라 구축을 도운 '오랜 GPU 시스템 엔지니어'로 묘사되는 스콧 그레이는 2026년에 OpenAI를 떠난 최소 12명의 고위 인사 중 하나로 꼽힌다. 같은 목록에는 최고수익책임자(CRO) 데니스 드레서, 전 COO 브래드 라이트캡, 애플리케이션 CEO 피지 시모, 소라 책임자 빌 피블스, 그리고 안전·윤리·마케팅·하드웨어 책임자들의 이름도 올라 있다. 이는 공식 확인이 아닌 2차 보도이며, 그레이의 퇴사 날짜는 제시되지 않는다.
더 넓은 맥락에서 보면 이 소문은 그리 놀랍지 않다. 같은 주에 나온 보도들은 인력 변동을 IPO 전 지각 변동으로 묘사한다. 공동 창업자 그렉 브록먼이 예정된 상장을 앞두고 운영 권한을 자신에게로 끌어모으고 있으며, CNBC는 8월 13일 CRO의 퇴사를 보도했다. 또한 'Bob'은 1년 동안 알려진 영입 대상이었다. 2025년 9월 보도에 따르면 메타의 마크 저커버그는 채용 회의에서 'Bob이 누구인가'를 상시 안건으로 삼았다고 한다. 이 특정 기술 역량을 둘러싼 인재 전쟁은 실재하며, 그렇기에 이 유출이 그럴듯하게 읽히는 이유 중 하나다.
그럼에도 불구하고, 그 주장의 사슬에는 두 가지 검증되지 않은 연결고리가 있습니다: Scott Gray가 Bob이라는 점과, 그 목록에 오른 항목이 트윗이 의미하는 퇴사와 동일한 사건이라는 점입니다. 트윗이 실제 퇴사보다 앞선 소문을 반복하고 있을 가능성도 충분히 있습니다. 이 섹션은 정직한 요약입니다: 공식적으로는 Scott Gray라는 시니어 GPU 엔지니어가 2026년 퇴사 명단에 올라 있으며, 비공식적으로는 그 사람이 트윗이 의미하는 Bob일 수도 있고 아닐 수도 있습니다.
왜 "2배 느린"이 중요할까 — 그리고 왜 그것이 아마 그렇게 단순하지 않은지
커널은 모델의 경제성을 결정하는 두 가지 숫자, 즉 초당 토큰 수와 토큰당 비용을 결정합니다. 가상의 "Bob-최적화" 버전보다 절반밖에 효율적이지 않은 서빙 커널로 GPT-6.7이 출시된다면, 동일한 하드웨어는 절반의 토큰만 서빙하게 되고 동일한 요청은 두 배로 오래 걸리며 — 한계 비용도 대략 두 배가 됩니다. 프로덕션 트래픽을 라우팅하는 개발자에게 이는 플래그십에서 2배의 지연 시간과 2배의 비용 타격을 의미하며, 이는 모델 선택을 바꾸는 바로 그런 숫자입니다. 그렇기 때문에 그 소문에는 설득력이 있습니다.
이제 그것을 불신해야 하는 이유들:
• "2x"에는 명시된 근거가 없습니다. 그것은 게시물에 적힌 숫자일 뿐입니다 — 사고 실험이지 측정이 아니며, 링크된 이미지에도 측정값이 없습니다.
• 커널은 코드이며, 코드는 작성자보다 오래 남는다. Bob(또는 누구든)이 이전 모델을 위해 작성한 서빙 스택은 사람이 떠나도 사라지지 않으며, 다음 모델이 그 대부분을 물려받는다.
• OpenAI의 인프라 조직은 규모가 크며, "한 사람이 모든 것을 작성한다"는 전설은 거의 확실히 단순화된 이야기다. 핵심 인물 의존 위험(Key-person risk)은 실제하지만, 대개 전부 아니면 전무의 문제는 아니다.
• 진정한 효율성 저하가 발생하더라도 기능은 바뀌지 않습니다. 비용과 지연 시간이 달라질 뿐입니다. 고통스럽기는 하지만, 공급업체가 일부를 흡수하거나 가격으로 조정할 수 있으며, OpenAI는 이미 정확히 이러한 서빙 비용 압박을 겨냥한 속도 기능(Ultrafast, 현재 최상위 모델에서 최대 14배 빠름)을 출시했습니다.
주장의 가장 강력한 버전은 100명 미만이라는 통계입니다. 플래그십의 서빙 커널을 작성한 사람이 사라지면, 그 대체는 단순한 인원 충원이 아니라 수년에 걸친 램프업입니다. 이는 OpenAI의 서빙 경제학에 대한 타당한 위험입니다. 그러나 이는 팀에 대한 위험이지, 아직 출시되지 않은 모델에 대한 측정된 사실이 아닙니다.
GPT-6.7에 대해 우리가 실제로 알고 있는 것
루머의 대상이 된 모델은 트윗이 암시하는 것보다 더 오랜 공개 이력을 가지고 있으며, 그 대부분은 최근의 것이다:
• 2025년 10월 31일 — 샘 알트만은 X에서 "GPT-6"가 "GPT-6-7"로 이름이 바뀔 것이라고 발표했으며, 이는 널리 Gen-Alpha 속어 "6-7"을 가리키는 것으로 읽힌다. "GPT-6.7"과 "GPT-6-7"이 엄밀히 같은 것인지는 공식적으로 확인되지 않았지만, 해당 트윗은 둘을 상호 교환 가능한 것으로 취급하며, 대부분의 보도도 마찬가지다.
• 2026년 4월 — GPT-6 사전 훈련이 완료되었다는 보도가 있었으며, 4월 14일경 출시될 것이라는 소문이 돌았다. 하지만 그 날짜가 지나도록 출시는 이루어지지 않았다.
• 2026년 8월 — 유출에 따르면 출시가 8월 초로 앞당겨졌으며, OpenAI는 GPT-5.7부터 GPT-5.9까지 건너뛸 것이라고 한다. 미확인.
• 2026년 8월 1일 — OpenAI는 연구 보고서를 통해 열 개의 미해결 수학 문제를 해결했다고 주장하며 차기 모델 패밀리의 이름으로 "Astra"를 발표했다. Astra가 GPT-6라는 이름으로 출시될지는 확인되지 않았다.
• 2026년 8월 7일 — OpenAI는 내부 안전 검토에서 "심각한" 사이버보안 위험으로 지적된 후 Astra 개발을 중단하고 출시를 연기했다 — 해당 등급을 촉발한 첫 모델이었다. 앨트먼은 광범위한 출시는 "조금 더 시간이 필요하다"고 말했다.
• 예측 시장 — 8월 중순 기준, 트레이더들은 GPT-6 출시 확률을 9월 30일까지 약 62%, 12월 31일까지 약 90%로 보고 있다.
• 루머 사양 — 약 2M 토큰 컨텍스트, 현재 세대보다 약 40% 더 나은 성능, 개인 맞춤 메모리, 그리고 코드명 "Symphony"의 네이티브 멀티모달 아키텍처. 모두 미확인.
그래서 "2x slower" 뒤에 있는 모델은 아직 배포되지 않았고, 확정된 출시일도 없으며, 현재 안전 검토가 진행 중입니다. 여기에 붙은 서빙 속도 수치는 두 가지 측면에서 추측에 불과합니다. 하나는 출시일, 다른 하나는 속도 자체입니다.

오늘 정직한 유일한 점수판
GPT-6.7은 아직 존재하지 않으므로, 스코어보드는 소문을 실제로 공개된 것과 대조할 수 있을 뿐입니다:
• GPT-6.7 (미출시) — 상태: 출시되지 않음; 출시: 2026년 가을로 예상; 컨텍스트: 약 2M 토큰(예상); 속도: "2배 느림?" 확인되지 않음; 가격: 해당 없음; 라우팅 가능: 아직 아님.
• GPT-5.6 Sol (실시간) — 상태: 출시 중; 컨텍스트: 1.05M 토큰, 최대 출력 128K; 속도: OrcaRouter의 7일 통계에서 관측된 약 290 tok/s; 가격: 표준 입력 등급에서 백만 토큰당 $5.00 입력 / $30.00 출력; 라우팅 가능: 예, 공급업체 목록 가격 기준.
흥미로운 차이는 가격 열입니다. OpenAI의 현재 플래그십 모델은 OrcaRouter를 통해 백만 토큰당 $5/$30이며, 통과 요금은 제로 마크업으로 공급업체 자체 목록 가격입니다. 따라서 OpenAI가 GPT-6.7의 가격을 어떻게 책정하든, 우리 쪽의 숫자는 출시 당일에 변동되며 재협상이 필요 없습니다. 이것이 다음 모델을 계획하는 모든 이에게 유용한 점수판의 핵심 부분입니다.

이런 누수를 처리하는 방법
그 패턴은 익숙한 것이다: 출시되지 않은 모델, 극적인 숫자, 이름이 거론된 인물. 각 부분은 그럴듯하지만 어느 것도 검증되지 않았다. 올바른 대응은 루머를 무시하는 것도, 그것에 베팅하는 것도 아니다. 선택을 강요받지 않도록 결정을 구조화하는 것이다.
그것이 라우팅을 해야 하는 이유입니다. GPT-6.7이 출시되면, 2배 더 느리다는 주장을 프로덕션 경로에 걸지 않고 평가하는 방법은 이미 사용 중인 동일한 엔드포인트 뒤에 두는 것입니다: 하나의 API 키, 새 모델이 성능 저하를 보이는 순간 GPT-5.6 Sol로 자동 장애 조치, 그리고 실제 트래픽이 그 소문이 사실인지 결정하게 하는 것입니다. 그러면 그 주장은 트윗이 아니라 측정값이 됩니다. OpenAI의 가격표가 새 출시와 함께 변경되면, 패스스루 요율도 같은 날 업데이트됩니다. OrcaRouter는 공급업체 목록 가격을 마크업 없이 그대로 전달하므로, 공급업체의 가격 인하(또는 인상)가 재협상 없이 즉시 여기에 반영됩니다.
한편, 현재의 플래그십이 바로 구체적인 실체다. GPT-5.6 Sol은 오늘 OrcaRouter에서 토큰 백만 개당 $5/$30으로 제공되며, 스코어보드에 나타난 1.05M 토큰 컨텍스트와 ~290 tok/s를 갖춘다. 8월 13일에 발표된 Ultrafast 모드(최대 14배 더 빠르며 Cerebras 인프라에서 초당 약 750 토큰 처리)는 해당 모델에 적용되고 GPT-6.7에는 적용되지 않는다. 이는 OpenAI가 커널뿐 아니라 인프라를 통해서도 서빙 비용을 공략할 수 있다는 점을 상기시킨다.

지금 보고 있는 것
• Bob의 퇴사가 확인되는지 여부. OpenAI는 Bob이 누구인지에 대해 언급하지 않는다. 가장 공식적으로 기록된 사건은 2026년 퇴사 명단에 있는 Scott Gray의 이름이다. OpenAI나 Gray가 이를 확인한다면, 이 체인의 첫 번째 고리가 사실이 된다.
• "2x slower"라는 수치가 근거를 얻을 수 있을지 여부. 만약 GPT-6.7이 출시되고 독립적인 속도 측정 결과가 나오면, 그 수치는 더 이상 루머가 아니라 확정되거나 폐기될 것이다. 그때까지는 게시물 속의 숫자에 불과하다.
• Astra의 안전 일시 중지가 날짜를 미루는지 여부. 예측 시장은 이미 GPT-6를 8월에서 제외했습니다; "중요" 지정과 OpenAI가 원한다고 밝힌 정부 테스트는 모두 추가 지연의 자연스러운 원인입니다.
• 커널 벤치가 재정렬되는지 여부. OpenAI의 서빙 팀이 그 손실을 흡수하거나 — 또는 그 전설이 한 사람의 몫을 과장한 것이라면 — 그 루머 전체는 무의미해지며, 첫 번째 신호는 다음 모델의 서빙 성능이 이전 모델과 비교해 어떤지일 것이다.
솔직한 평가: "2배 느리다"는 설득력 있는 이야기일 뿐이고, 지금까지는 그게 전부다. 커널 전문가의 이탈은 실제 문서 기록이 있는 진짜 데이터 포인트지만, 속도 수치는 트윗 속 숫자일 뿐이다. GPT-6.7이 출시될 때까지 방어 가능한 입장은 두 결과를 모두 대비하는 것이다. 루머가 부분적으로 맞을 수 있다고 가정하고, 예상보다 느린 플래그십을 테스트하는 데 아무런 비용이 들지 않도록 라우팅을 구축하는 것이다. 그것이 바로 아직 만나지 못한 모델을 라우팅하는 이유의 전부다.
