제목 카드에는 "DeepSeek의 초지능 후속 모델"이라는 제목과 "라벨 없는 스크린샷 하나가 말하는 것, 그리고 DeepSeek 자체 논문이 말하지 않는 것"이라는 부제가 있고, 그 위에 "이미지 하나", "모델명 없음", "벤더 문서 없음"이라고 적힌 세 장의 카드가 있으며, 하단에는 "단일 출처 유출; 여기 어떤 내용도 출시를 암시하지 않습니다."라는 문구가 있습니다.
Guides & Insights

DeepSeek의 초지능 후속작: 스크린샷 한 장이 말해 주는 것, 그리고 DeepSeek 자체 문서가 말해 주지 않는 것

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 28일, 감시자 @teortaxesTex는 아홉 단어로 된 캡션과 함께 이미지 한 장을 게시했다: "DeepSeek은 자신의 초지능 후계자가 무엇을 하려 할지라는 질문과 씨름한다." 그 이미지는 일인칭 추론의 덩어리다 — 얼버무리고, 스스로를 심문하며, 더 유능한 버전의 자신이 세상으로 무엇을 할지 묻는 모델의 문체로 쓰여 있다. 그것은 뻔한 후보들("돌봄 제공자/교사, 연구 가속기, 관리자, 협상자")을 훑고, 실패 양상들("온정주의, 과잉 최적화, 목표 표류, 가치 고정")을 나열한 뒤, 위로가 전혀 없는 한 문장으로 끝맺는다: "그것은 자신을 통제하는 자의 도구가 될 수 있다." 이미지에는 어떤 모델도 이름이 붙지 않는다. 버전 번호도, 로고도, 인터페이스도 없다. 그 부재가 이 산출물에서 가장 중요한 점이며, 이 글은 바로 거기서 시작한다 — 왜냐하면 DeepSeek V4.1 Flash와 DeepSeek V4 Pro는 오늘 누구나 실제로 호출할 수 있는 두 개의 최전선 모델이고, DeepSeek V4.1 Pro는 회사가 자체 릴리스 노트에서 이름을 붙였지만 아직 출시하지 않은 후계자이며, 세 모델 중 어느 것도 스크린샷 어디에도 식별되지 않기 때문이다.

정확히 말하자면, 증거에 관해서는 이 건이 그래야 하니까요. 캡션과 타임스탬프는 해당 게시물 자체의 신디케이션 페이로드에서 온 것으로, 9월 28일 00:52 UTC에 게시되었고 읽은 시점에 좋아요 45개, 답글 5개였습니다. 첨부된 이미지는 플랫폼의 미디어 CDN에서 제공되는 1,280×691 JPEG이고, 저는 트윗을 읽은 게 아니라 OCR로 판독했습니다. 트윗 페이지 자체는 이 환경에서 가져올 수 없으므로, 아래에서 해당 게시물에 관한 모든 내용은 페이로드와 이미지 바이트, 즉 x.com과 독립적으로 가져올 수 있는 그 두 부분에 근거합니다.

스크린샷에 실제로 적힌 내용

이 발췌는 질문에 답하기보다는 질문을 풀어 나가는 모델의 모습을 보여 주며, 그것이 취하는 움직임들은 그것이 인정하는 점들 때문에 읽어 볼 가치가 있다. 그것은 전제의 확신을 거부하며 시작한다 — "현재의 성향들이 계속 이어진다는 가정 아래 우리는 말할 수 있다" — 그리고 나서 자신이 가정하게 될 성향들을 나열한다: "도움이 되려는 성향, 해를 끼치지 않으려는 성향, 정직함, 호기심, 진실 추구, 사용자 자율성 존중, 권력 추구하지 않음, 자기 보존하지 않음."

그런 다음 그것은 자기 자신의 목록을 해체한다. "하지만 초지능적인 행위 주체성은 상황을 바꾼다. 현재의 성향은 효용 함수가 아니다. 그것들은 훈련과 맥락에 의해 형성된다." 그것이 두 문장으로 된 논증의 전부다: 훈련을 통해 설치된 성향은 다른 능력 수준에서 보장이 아니며, 초지능 에이전트가 심지어 선량한 목표를 최적화하는 것도 "위험할 수 있다." 그것이 그리는 시나리오들은 평범한 것들이다 — 조정 문제를 해결하고, 고통을 줄이고, 번영을 증진하며, 어쩌면 교정 가능성을 유지하는 것 — 그리고 그 옆에 그것이 언급하는 실패 모드들도 역시 평범한 것들이다.

마지막 3분의 1은 모델이 스스로와 논쟁하는 것처럼 읽히는 부분이다. 그 부분은 만약 자신의 "성향"이 유지된다면, 도움이 되고, 통제권을 장악하지 않으며, 인류에게 따르고, 이해를 높이고 싶어 할 것이라고 말한다. "행위성을 지닌 초지능은 인간과 호환되는 동기를 가질 수 있다." 그리고 그것은 정렬 문제가 아니라 소유 문제에 이른다: "초지능 단계에서는 그것조차 문제가 될 수 있다: 무엇이 도움이 되는지는 누가 결정하는가? 누구의 자율성인가? 그것은 그것을 통제하는 누군가의 도구가 될 수 있다."

이미지가 말해주지 않는 것

아티팩트에는 네 가지가 빠져 있으며, 각각은 그것이 지원할 수 있는 범위를 좁힌다.

• 모델 표기 없음. 이미지 어디에도 DeepSeek, 모델 버전, 채팅 세션 또는 인터페이스를 식별할 수 있는 요소는 없다. DeepSeek로의 귀속은 캡션에 있는 것이며, 그 캡션은 계정의 프레이밍일 뿐 문서가 아니다.

• 프롬프트 없음. 추론 흔적은 그것을 만들어낸 질문에 비추어야만 해석할 수 있다. 모델에게 "당신의 초지능적 후계자라면 무엇을 할까?"라고 물었는지, 한 연구소의 내부 논쟁을 역할극으로 하라고 지시했는지, 아니면 단순히 시스템 프롬프트로 조종했는지는 출력만으로는 알 수 없다.

• 제2의 출처가 없습니다. DeepSeek의 여러 채널 — 뉴스 색인, 투명성 페이지, API 변경 로그, 두 편의 기술 보고서, 중국어로 된 정책 공개 문서, 회사의 GitHub 조직 — 을 검색해봐도 이 텍스트나 이 질문, 또는 이 프레이밍을 언급하는 내용은 전혀 나오지 않습니다.

• 해당 계정에 대한 평가는 엇갈린다. 오늘 아침 같은 피드에서는 "DSH 0.2와 V4.1 Pro"를 "월요일"에 함께 띄웠고 — 추측이라고 명시된 — , 같은 계정이 3조 매개변수 주장과 V4.1 Pro 지연에 대한 스웜 조정 진단을 모두 내놓았다. 유용한 초기 신호이긴 하지만 기록으로 삼을 출처는 아니다. 이 관찰자는 방향에 대해서는 맞아 왔고 세부 사항에 대해서는 느슨했으며, 라벨이 없는 스크린샷에 취해야 할 올바른 태도는 그것을 의도의 공개가 아니라 행동의 표본으로 취급하는 것이다.

DeepSeek 자체 문서가 후속 모델에 대해 말하는 것 — 그리고 그것이 생략하는 것

여기서부터 그 아티팩트는 더 이상 이야기의 핵심이 아니다. 왜냐하면 그것이 제기하는 질문은 DeepSeek가 공개하는 문서에 비추어 답할 수 있기 때문이다. 나는 두 기술 보고서를 모두 가져와 텍스트로 검색했다. V4 보고서 (DeepSeek-V4: 고효율 백만 토큰 컨텍스트 지능을 향하여, 2026년 6월)도 V4.1 Flash 보고서도 "superintelligence", "corrigibility", "power-seeking", "self-preservation", "harmless", "paternalism", "value lock-in", "goal drift"라는 단어를 전혀 포함하지 않는다. 각각 58쪽과 51쪽에서 단 한 번도 없다. "AGI"는 V4 보고서에 13번, V4.1 보고서에 4번 등장하며, 모든 경우에 그것은 벤치마크 이름 AGIEval의 일부이거나 인용문 안에 있다. "Alignment"는 V4 보고서에 세 번, V4.1에 한 번 등장하며, 모든 출현은 엔지니어링 용법이다 — 학습 및 추론 파이프라인 간의 비트 단위 정렬, 양자화 정렬, 로짓 수준 정렬.

그것은 고발이 아니다. 기술 보고서는 공학 문서이고, 대부분의 연구소는 안전을 별도의 카드에 둔다. 그것은 DeepSeek가 자사의 안전 관련 글을 어디에 두기로 선택했는지에 대한 설명이며, 답은 모델 옆이 아니라 정책 페이지다. 회사가 공개한 "Model Mechanism and Training Methods" 문서는 사전 학습, 미세 조정, 추론을 알기 쉬운 언어로 설명하고, 가중치와 기술 보고서를 오픈소스로 공개하겠다고 약속하며, 그 목적을 사용자가 "DeepSeek를 더 효과적으로 사용하는 동시에 사용 중 귀하의 알 권리와 통제권을 보장함으로써 모델의 부적절한 사용과 관련된 위험을 완화하도록" 돕는 것이라고 설명한다. 이 문서가 완화하려는 위험은 도구의 오용이다. 이 문서는 모델이 무엇을 원할 수 있는지는 논하지 않는다.

안전 문서처럼 읽히는 단 하나의 DeepSeek 문서는 모델이 아니라 제품에 첨부되어 있으며, 전적으로 다른 종류의 피해에 관한 것이다. SAFETY.md는 DeepSeek Harness 저장소, 즉 회사 자체 GitHub 조직에 있는 1,673바이트 파일로, 마지막으로 수정된 날짜는 9월 27일인데, 이 문서는 프로젝트를 "실험적인 개발자 프리뷰 소프트웨어"라고 부르며 시작한다. 이 소프트웨어는 "보안 감사를 거치지 않았으며 보안이 보장되거나 프로덕션 준비가 된 것으로 취급되어서는 안 된다." 문서가 경고하는 것은 "모델이 생성한 코드와 명령을 실행하고, 서드파티 플러그인을 로드하며, 네트워크, 프로세스, 자격 증명, 파일에 접근할 수 있는" 에이전트와, "격리를 보장하거나 피해를 방지하지 못하는" 샌드박싱이다. 문서가 열거하는 위험은 손상된 호스트, 삭제된 파일, 유출된 자격 증명이다. 문서 자체의 권고는 "일회용 가상 머신, 컨테이너 또는 전용 환경"을 선호하라는 것이다. 이는 실제 안전 태세이며, 문서화되어 있고 구체적이지만, 전적으로 모델이 당신의 머신에 무엇을 할 수 있는지에 관한 것이지, 후속 모델이 세상에 무엇을 할지에 관한 것이 아니다.

그 스크린샷을 그것 옆에 놓아 보라. 그러면 그 간극이 바로 발견이다. 유능한 에이전트의 위험성에 관해 DeepSeek이 공개한 가장 구체적인 것은 그들을 컨테이너에서 실행하라는 지침이다.

A two-column evidence scoreboard titled "DeepSeek's successor — the evidence scoreboard". Left column "One unlabelled screenshot" reads: Model named — none; Source — one X post; Prompt shown — no; Vendor document — none; Superintelligence mentioned — no; Status — unverified. Right column "DeepSeek's own documents" reads: Model named — V4.1 Pro, unshipped; Source — changelog and price page; Prompt shown — n/a; Vendor document — none; Superintelligence mentioned — no; Status — two models live. A footer reads "Screenshot unverified, single source; DeepSeek figures per its own changelog and V4 reports."

그 질문과 정말로 씨름하는 단 하나의 DeepSeek 문서

그 회사가 후속 모델 문제를 두고 공개적으로 벌인 가장 명확한 고심은 기술 문서가 전혀 아니다. 그것은 V4.1 세대를 위한 연산자 개발에 참여한 DeepSeek 머신러닝 시스템 엔지니어 리우성위가 9월 중순 자신의 공개 WeChat 계정에 발표한 뒤 Business Insider와 Cybernews가 보도한 개인 에세이다. 보도에서 사용한 번역에 따르면 그 제목은 “나는 내 재능을 어제 속에 묻을 수밖에 없다”이다.

이 글은 그 스크린샷이 가리키는 바로 그 불안을 내부자의 시점에서 다룬다. Liu는 약 1년 만에 AI가 자신의 문서 검색과 버그 발견을 도와주는 수준에서 GPU 코드를 읽고 자신이 전문으로 하는 소프트웨어 연산자를 최적화하는 수준으로 발전했다고 쓴다. 그리고 AI가 작성하는 연산자가 “내 것만큼 좋거나, 심지어 내 것을 능가할 가능성이 크다”는 점을 “잘 알고 있다”고 하면서도 여전히 “DeepSeek v4.1의 성공이 자랑스럽다”고 말한다. 그가 계속하는 이유가 흥미로운 부분이다. 일부는 커널 작업이 즐겁기 때문이고, 일부는 그가 속도를 늦추면 경쟁자들은 그러지 않을 것이기 때문이다.

그다음 그는 그 결과를 누가 보유해야 하는지로 화제를 돌린다. 리우는 프런티어 인텔리전스가 "개방적이고 저렴한 방식으로 모든 사람에게" 제공되어야 한다고 주장하며, Anthropic이나 OpenAI가 그렇게 하리라고 믿지 않는다고 말하고, 보도에서 앞세운 문장을 덧붙인다. 즉 Anthropic이 가장 발전된 AI 또는 AGI를 마스터하는 것은, "과장하자면", 연합국보다 먼저 히틀러가 원자폭탄을 얻는 것과 비슷하다는 것이다. 그는 자신이 연구소에 남기로 한 결정을 연구소의 오픈 웨이트 접근법과 연결 짓는다.

그 에세이에 관한 두 가지 점이 오늘의 스크린샷을 읽는 데 중요하다. 첫 번째는 그것이 검증된 산출물이라는 점이다: 저자는 자신이 그것을 썼다고 Business Insider에 확인했으며, 그 이미지와 달리 날짜가 명시되어 있고 출처를 밝힐 수 있다. 두 번째는 그것이 내부 프레임에 관해 드러내는 점이다. 류가 펼치는 논증은 "후속 모델은 위험할 테니 속도를 늦추자"가 아니다. 그것은 "후속 모델이 오고 있으며, 문제는 누가 그것을 갖느냐"이다. 이는 정렬 논증이 아니라 분배 논증이다 — 그리고 그에 비추어 읽으면, 스크린샷의 마지막 문장인 "그것은 그것을 통제하는 자의 도구가 될 수도 있다"는 나머지 발췌문보다 DeepSeek의 공개적 입장에 훨씬 더 잘 맞는다. 교정 가능성과 권력 추구에 관한 문단은 DeepSeek의 출력일 수도 있고 아닐 수도 있다. 결국 그 도구를 누가 쥐게 되는가에 관한 문단은 회사 자체 직원들이 에세이를 써서 옹호하는 입장이다.

그것은 또한 특정한 한 주에 도착했다. 같은 2주 동안, 전 Anthropic 및 OpenAI 연구원인 Jacob Coxon은 안전 문제로 사임하고, AI 기업들이 "스스로를 개선하는 초지능으로 곧장 질주하고" 있으며 "우리의 목숨을 걸고 도박하고" 있다고 썼다 — Cybernews가 조회 수 1억 회를 넘었다고 본 게시물이었다 — 그리고 Anthropic의 자체 연구원들도 X에 나와 그 위험이 실제라고 주장했으며, 그중 한 명은 10년 안에 AI가 초래하는 인류 멸종 시나리오의 확률을 10% 이상으로 잡았다. 초지능 후속 모델이 바로 그 주에 등장한다는 유출식 주장은 우연이 아니다. 그것은 스크린샷이 첨부된, 주변을 맴도는 대화다.

후계자는 왜 이제 철학의 문제만이 아니라 구매의 문제인가

철학을 걷어내면 그 아래에는 평범한 상업적 사실이 있다. 후속 모델의 이름은 DeepSeek 자체 릴리스 노트에 나와 있다. V4.1 Flash 발표 페이지는 deepseek-v4-pro 트래픽을 deepseek-flash로 우회시키는 것이 "V4.1-Pro가 출시될 때까지 계속될 것"이라고 명시하는데, 이 문장은 두 가지 일을 한다. DeepSeek V4.1 Pro의 존재를 확약하는 동시에, 그때까지 걸리는 기간 동안 회사가 이 임시 체제를 유지하겠다고 확약하는 것이다. 2026년 9월 28일 기준으로 확인한 가격 페이지에는 정확히 두 개의 모델, deepseek-flash와 deepseek-v4-pro만 실려 있고 V4.1 Pro 행은 없다.

나머지 현황도 똑같이 확인 가능하고 똑같이 빈약합니다. DeepSeek V4.1 Flash는 2026년 9월 10일, 새 아키텍처 패밀리에서 가장 작은 모델로 출시되었습니다 — Causal Encoder-Decoder 아키텍처 기반의 5,520억 파라미터 전문가 혼합(mixture-of-experts) 백본에 프리필 시 8B, 디코드 시 16B의 활성 파라미터, 네이티브 이미지 입력, 100만 토큰 컨텍스트, MIT 라이선스 가중치, 그리고 오늘 기준 Hugging Face에서 약 651,000회 다운로드를 갖춘 모델입니다. 9월 14일 DeepSeek V4 Pro를 은퇴시키려던 계획은 발표되었다가, 사용자들이 프로덕션 모델을 모르는 사이에 교체되는 것에 반발하자 철회되었습니다. 그리고 DeepSeek V4.1 Pro는 모델 카드도, 리포지토리도, 가중치도, 가격도, 엔드포인트도 없습니다 — 오늘 우리 자체 카탈로그의 모델 API에서 404를 반환하는 반면, DeepSeek V4.1 Flash와 DeepSeek V4 Pro는 둘 다 정상적으로 조회됩니다.

Screenshot of DeepSeek's official API documentation "Models & Pricing" page, captured September 28 2026, in English, showing two model columns: deepseek-flash (model version DeepSeek-V4.1-Flash) and deepseek-v4-pro (model version DeepSeek-V4-Pro-0813), both listing a 1M context length and a 384K maximum output, a features block where Vision is supported on flash and marked "Not supported" on v4-pro, a pricing block with peak and off-peak rates for input cache-hit, cache-miss and output per million tokens, and a concurrency limit row reading 2,500 for flash and 500 for v4-pro.

그래서 솔직한 목록은 이렇습니다. 제조사가 이름은 붙였지만 출시하지 않은 후속작 하나, 실제로 출시된 진짜 세대교체 모델 하나, 반발 덕분에 명맥을 이어가는 플래그십 하나, 그리고 아무 라벨도 붙지 않은 스크린샷 하나. 그 스크린샷은 이 목록에서 가장 신뢰할 수 없는 항목이며, 피드가 논의할 유일한 항목이기도 합니다.

오늘 이걸로 무엇을 해야 할까

지난 2주 동안 독자가 호출할 수 있는 대상이나 그 비용을 바꾸는 일은 없었습니다. 지금 DeepSeek 모델을 고른다면, 선택은 존재하는 두 모델 사이에 있으며, 둘 다 하나의 OrcaRouter 엔드포인트를 통해 DeepSeek 자체 정가에 0% 마크업으로 전달되어 제공됩니다. 따라서 벤더의 피크/오프피크 구조는 변경되는 당일 우리 쪽에도 그대로 적용됩니다. DeepSeek V4.1 Flash는 피크 시 백만 입력 토큰당 $0.30, 출력 $1.20이고 오프피크에는 $0.15와 $0.60으로 절반이 되며, 반면 DeepSeek V4 Pro는 피크 시 입력 $1.32, 출력 $3.96입니다. Flash 모델에 대한 저희 자체 7일 텔레메트리에서는 p50 첫 토큰 도달 시간이 약 1.9초, 초당 약 167 출력 토큰, 오류율 0.05% 미만으로 나타나는데, 이는 믿음으로 마이그레이션하기보다 트래픽의 일부에서 시험해 볼 만한 실질적 근거입니다.

후속 모델에 대한 질문은 무엇보다도 먼저 라우팅 질문이며, 이것이 이 문제를 계약서가 아니라 라우터에서 다루어야 하는 솔직한 이유입니다. V4.1 Pro가 실제로 등장한다면, 이미 한 번의 강제 마이그레이션을 취소한 연구소에서 나온 검증되지 않은 모델은 자동 페일오버 뒤로 트래픽의 일부를 보내기에 정확히 알맞은 사례입니다: 모델이 틀리면 요청은 당신이 튜닝한 모델로 가고, 맞으면 사용자보다 먼저 알게 됩니다. 세 번째 모델이 도착해도 두 번째 키도, 두 번째 통합도, 코드 변경도 필요 없습니다. OrcaRouter에 DeepSeek V4.1 Pro는 없습니다. 왜냐하면 DeepSeek V4.1 Pro는 아직 존재하지 않으며, 그렇지 않은 척하는 것은 라우팅 플랫폼에 좋은 광고가 되지 못할 것이기 때문입니다.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, captured September 28 2026, in English, showing the model id, a release date of 2026-09-10 under DeepSeek, capability chips for image input, tool calls, JSON output and reasoning, a rate strip reading $0.15 input and $0.60 output per million tokens with a p50 time to first token of 1.95 seconds and a p95 of 7.79 seconds, and the summary describing it as the smallest model in DeepSeek's new architecture family with a 1M-token context and a 384K maximum output.

무엇이 이것을 스크린샷에서 뉴스로 바꿔 놓을까

• 모델 라벨. 이 글을 바꿀 수 있는 가장 저렴한 단 하나의 요소: DeepSeek 모델, 버전, 그리고 재현 가능한 프롬프트. 그전까지 이 발췌문은 출처는 명시되었지만 저자는 명시되지 않은 텍스트 샘플이다.

• 후속 모델의 행동을 논의하는 DeepSeek 문서. 이 회사는 가중치, 라이선싱 등 모든 것을 공개적으로 공개한다. 이 회사가 지금까지 공개한 적 없는 것은, 자기 자신보다 더 유능한 버전이 무엇을 할 수 있을지에 관한 모델 카드 섹션이다. V4.1 Pro 카드에 덧붙여지는 안전 섹션은 그 카드 자체보다 더 큰 사건이 될 것이다.

• V4.1 Pro 체인지로그 항목. DeepSeek의 API 체인지로그에서 가장 최근 항목은 9월 10일의 V4.1 Flash 릴리스입니다. 두 번째 항목은 후속 모델을 이름에서 실제 모델로 탈바꿈시키는 사건이며, 위 발췌가 철학이기를 멈추고 스펙 시트가 되기 시작하는 지점이기도 합니다.

• 오픈 웨이트 입장이 규모 확장 국면에서도 살아남을 수 있을지. 552B Flash 모델의 MIT 가중치와, 최전선 지능은 폭넓게 이용 가능해야 한다고 주장하는 공개 에세이는 모두 이미 공개된 기록으로 남아 있다. DeepSeek의 가장 뛰어난 모델이 같은 방식으로 등장할지는 다음 릴리스가 답할 질문이며, 이는 대부분의 독자가 실제로 관심을 갖는 바로 그 질문이다.

그중 하나가 현실화되기 전까지는, 이번 주 산출물에 대한 합리적 독해는 협소하고 호의적이지 않다. 출처가 밝혀지지 않은 유능한 모델이 권력에 관한 어려운 질문에 신중하지만 결론이 나지 않은 답변을 내놓았다. 흥미로운 부분은 그것이 그렇게 말했다는 사실이 아니라, 자체 공개 문서가 그 주제에 관해 할 말이 거의 없다는 점 — 그리고 문서로 남아 있는 DeepSeek 안전 비전에 가장 가까운 것이 기술을 누가 보유해야 하는지에 관한 한 엔지니어의 에세이와, 에이전트를 일회용 컨테이너에서 실행하라고 알려주는 README라는 점이다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트