
DeepSeek의 3T 모델: 클러스터를 기다려야 하는 스케일업
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
9월 14일, DeepSeek는 DeepSeek V4 Pro를 은퇴시키고 — 8월 13일 일반 제공을 시작한 1조 6천억 매개변수 플래그십 — 그리고 이제 deepseek-v4-pro로 들어오는 모든 호출에 DeepSeek V4.1 Flash로 응답합니다. 이 모델은 9월 10일 공개한 5,520억 매개변수 모델입니다. 그 전환 발표 나흘 전, 익명의 DeepSeek 관찰자는 반대 방향의 날카로운 지적을 올렸습니다: 연구소가 3조 매개변수 모델을 개발해 왔으며, "아마 또 하나의 1T params Engram"이고, 그것이 출시되지 않은 이유는 역량이 아니라 경제성이라는 것입니다.
그 모델에 대해 확인된 것은 아무것도 없다. 이름도, 저장소도, 설정 파일도, 벤치마크도, 출시 시점도 없다 — X 게시물 하나뿐이고, 출처는 "믿을 만한 소식통"으로 되어 있으며, 가장 흥미로운 단 하나의 세부 사항은 작성자 스스로가 추측이라고 명시적으로 표시했다. 그것을 사실이 아니라 신호로 다뤄라. 그래도 읽을 가치는 있다. 그 주장의 두 반쪽이 서로 반대 방향으로 당기고 있고, 그중 하나만이 DeepSeek 자체의 로드맵과 맞닥뜨린 뒤에도 살아남을 가능성이 크기 때문이다.
유출된 내용이 실제로 말하는 것과 말하지 않는 것
이 게시물은 teortaxesTex라는 계정에서 올라왔는데, 그는 2023년부터 이 연구소의 팬이라고 스스로를 설명해 온, 오랫동안 DeepSeek을 지켜본 관찰자다. 전문은 다음과 같다. “사실 저는 DeepSeek이 3T 모델을 개발 중이었다는 믿을 만한 정보를 갖고 있습니다(백본, 아마 또 다른 1T 파라미터 Engram일 텐데, 그건 제 추측입니다). 다만 그들은 그것을 포스트트레인해서 서빙하는 것이 경제적일지 확신하지 못했을 뿐입니다. 그들의 클러스터가 커지면, 우리는 뭔가를 보게 될 것입니다...”
그 두 문장에서 중요한 비중을 차지하는 것이 네 가지인데, 그중 하나는 사실이 전혀 아니다. "믿을 만한 소식통"은 누구인지 밝혀지지 않았다. 파라미터 수는 총 파라미터와 활성 파라미터 간 구분 없이 단일 숫자로 제시된다. Engram에 대한 부연은 추측하는 당사자에 의해 추측이라고 표시된다. 그리고 "그들의 클러스터가 성장할 때"는 날짜가 전혀 붙지 않은 조건문이다.
• 무엇이 주장되고 있는가 — 3조 파라미터 DeepSeek 모델이 개발의 어느 단계에 존재한다는 것.
• 명시적으로 저자 자신의 추측인 부분 — 그중 대략 1T가 Engram 메모리라는 점.
• 알려지지 않은 것 — 이름, 아키텍처, 활성 파라미터 수, 컨텍스트 윈도우, 학습 상태, 그리고 제품으로 출시되기는 하는지 여부.
• 지금 당장 검증 가능한 것 — 아무것도 없다. 어떤 DeepSeek 리포지토리, 모델 카드, 가격 행, 문서 항목도 이를 언급하지 않는다.
심지어 산술조차 모호하다. "3T 모델(백본, 아마도 또 다른 1T 파라미터 Engram)"은 두 가지로 해석될 수 있다: 약 1T가 Engram인 3T 모델이거나, 3T 백본에 또 다른 1T의 Engram이 함께 있는 경우로 총합 약 4T가 된다. 그 격차는 1조 파라미터만큼 넓으며, 대부분의 연구소가 한 번의 학습 실행에 지출하는 것보다 더 큰 폭으로 서빙 비용을 바꾼다.
또한 이 계정의 기록은 예언자급이라기보다 뒤섞여 있다는 점을 기억할 만하다. 그는 V4 Pro 트래픽 경로 재조정에 관한 DeepSeek의 9월 9일 공지를 연구소가 "V4 제품군의 아키텍처 문제를 해결했다"는 증거로 읽었다. 이는 합리적인 추론이며, 여전히 추론일 뿐이다. 9월 초 그는 제3자 코딩 플랫폼의 익명 스텔스 모델이 Xiaomi의 MiMo-V3-Flash라는 생각도 제기했지만, 아무도 이를 확인하지 못했다. 유용한 초기 신호일 뿐, 기록의 출처는 아니다.
흥미로운 절반은 파라미터 수가 아니라 메모리 테이블이다
Engram은 실재하며, 3T 주장이 처음 들리는 것보다 더 그럴듯한 이유가 바로 그것입니다. DeepSeek은 2026년 1월에 조건부 메모리 아키텍처를 오픈소스 코드와 함께 공개했고, 이 아키텍처는 이례적인 일을 합니다. 바로 정적 지식 검색을 동적 추론과 분리하는 것입니다. 사실을 떠올리는 데 GPU 연산을 쓰는 대신, 모델은 컨텍스트를 DRAM에 보관된 임베딩 테이블로 해싱하고 상수 시간에 검색하며, 조회 경로에는 GPU 작업이 없고, 주변 컨텍스트와 충돌할 때 검색된 메모리를 억제하는 게이팅 메커니즘도 있습니다.
DeepSeek가 자체 테스트 구성에 대해 보고한 수치들이 바로 기억해야 할 값이다: 처리량 손실 3% 미만으로 DRAM에 오프로드된 1,000억 파라미터 임베딩 테이블, 그리고 100만 토큰에서 97%의 니들 인 어 헤이스택 정확도로, 표준 어텐션의 84.2%와 대비된다. 이는 연구소 자체 수치이며, 우리가 재현한 것이 아니다. 보고된 바에 따르면 독립적인 초기 평가들은 동일한 컨텍스트 길이에서 93–96% 범위에 도달했는데, 이는 베이스라인보다 확실히 높지만 주장한 수치에는 못 미친다.
그 아이디어를 10배로 확장하면 유출의 형태가 달라진다. 3T 모델의 추가 파라미터 대부분이 HBM을 두고 경쟁하는 전문가가 아니라 DRAM에 상주하는 해시 테이블 메모리라면, "3T"는 더 이상 "서빙 불가능"의 대리 지표가 아니다. 총 파라미터 수와 서빙 비용은 분리된다. 그것이 이번 유출에서 진정으로 새로운 아이디어이며, 공개된 연구가 실제로 뒷받침하는 부분이다.
한 가지 주의할 점은, 보도에 따르면 Engram 논문이 추론 시점 오버헤드—지연 시간과 처리량—을 다루지 않는다는 것이다. 그리고 바로 그 지점이 DRAM 상주 조회 테이블이 어디에서든 드러난다면 드러날 곳이다. 가서 가져와야 하는 메모리는 공짜로 얻는 메모리가 아니다.

왜 DeepSeek 자체의 9월은 반대 방향을 주장하는가
곧 출시될 3T 제품에 반대하는 논거는 DeepSeek가 방금 1.6T로 그 실험을 돌려 더 작은 것으로 자기 질문에 답했다는 점이다. 현재의 V4 래더는 다음과 같다:
• DeepSeek-V4-Flash-0731 — 총 파라미터 284B, 토큰당 활성 파라미터 13B.
• DeepSeek-V4-Pro-0813 — 총 1.6T, 활성 49B, MIT 라이선스 하의 오픈 웨이트.
• DeepSeek V4.1 Flash — 프리필 동안 토큰당 8B 파라미터를, 디코드 동안 16B 파라미터를 활성화하는 Causal Encoder-Decoder 설계를 기반으로 한 552B 백본.
베이징 시간 9월 14일 정오에 중간 등급 모델이 공개된다. DeepSeek는 V4 Pro를 오프라인으로 전환하고, 다음에 대한 요청을 deepseek-v4-pro V4.1 Pro가 존재할 때까지 V4.1 Flash로 라우팅하며 Flash 요금으로 청구한다. 오늘 공식 가격 페이지에는 두 개의 행이 실려 있으며, 규모상 은퇴한 모델의 후속 모델은 어느 쪽도 아니다: deepseek-flash 피크 시간대 입력 토큰 100만 개당 $0.30, 출력 토큰 100만 개당 $1.20, deepseek-v4-pro $1.32와 $3.96이며, 오프피크 요금은 그 수치의 절반이다. 둘 다 1M 토큰 컨텍스트 창과 384,000토큰 출력 상한을 명시한다.
나아가는 방향은 미묘하지 않다. 가장 큰 모델을 은퇴시키고, 토큰당 활성화되는 파라미터 수가 10분의 1에 불과한 모델을 택한 연구소는 프런티어 역량의 경제적 단위가 학습시킬 수 있는 가장 큰 체크포인트가 아니라는 결론을 이미 내린 것이다. 개발사가 '포스트트레이닝되어 경제적으로 서빙될 수 있을지' 확신하지 못하는 3T 모델은 망설임에 관한 소문이 아니다. 그것은 이제 대안에 관한 측정 데이터를 확보한 연구소를 말해 준다.
포스트트레이닝은 그 문제의 더 날카로운 절반이다. Huawei의 CloudMatrix384 SuperPOD에서 DeepSeek-V4-Pro 라인의 전체 파라미터 포스트트레이닝은 제3자 SLAI T-Rex 프로젝트에 의해 34.22% MFU, 대략 공개 베이스라인 레시피의 2.93배로 보고되었다. 그것은 고무적인 숫자다 — 1.6T 모델에서 나온 제3자 숫자다. 백본을 두 배로 늘리면 토큰 하나가 서빙되기도 전에 비용이 대략 두 배로 늘어난다.

"그들의 클러스터가 성장할 때"가 문장 전체입니다.
유출된 내용에서 핵심을 떠받치는 조항은 마지막 조항이다. 공개적으로 확인 가능한 문서 기록이 있는 유일한 부분이기 때문이다. DeepSeek는 내몽골 우란차부의 새 데이터센터에 화웨이의 Ascend 950DT 가속기를 최소 16만 개 도입하는, 약 25억 6천만 달러 규모의 주문을 계획 중인 것으로 알려졌다 — 이는 지금까지 시도된 중국산 AI 실리콘 클러스터 중 가장 큰 축에 든다.
그 계획에 붙은 단서들은 헤드라인보다 더 중요하다. 그 칩은 훈련이 아니라 추론용으로 계획되어 있다. DeepSeek은 이전에 화웨이 실리콘으로 훈련을 시도한 적이 있지만 여전히 엔비디아 가속기로 훈련하고 있으며, 이는 3T 모델이 실제로 필요로 하는 단계다. 공급은 1년 이상 걸릴 수 있다. 부분적인 생산 능력은 2027년 말에서 2028년 초에 가동될 것으로 예상된다. 그리고 올해 화웨이가 950DT 유닛을 몇 개나 만들 수 있을지를 제한하는 것은 로직이 아니라 고대역폭 메모리 공급이 될 것으로 예상된다.
따라서 "그들의 클러스터가 성장할 때"라는 낙관적 해석은 3T 모델의 시점을 이르면 2027–2028년으로 잡고, 비관적 해석, 즉 그것이 연구 산출물로 남아 결코 제품이 되지 않는다는 해석은 DeepSeek가 2026년에 출시한 모든 것과 일치한다. 연구소를 둘러싼 컴퓨팅 환경 역시 순수한 공급 문제라기보다 논쟁적인 정책 문제다: 9월 8–9일 NSA, FBI, CISA는 DeepSeek를 포함한 중국 연구소 여섯 곳이 미국 프런티어 모델을 "산업적 규모"로 증류했다고 공동 주장했고, 중국 상무부는 이 혐의를 부인했다. 그 혐의를 어떻게 보든, 클러스터 성장에 의존하는 출시는 DeepSeek 내부의 누구도 통제하지 못하는 결정에 달려 있다.
이것을 유출이 아닌 정식 출시로 바꾸려면 무엇이 필요할까
체크리스트는 짧고 구체적이며, 아직 아무것도 발동되지 않았다:
• Hugging Face의 deepseek-ai 조직 산하에 있는 리포지토리로, 제품군 슬러그가 아니라 버전이 지정된 체크포인트 이름을 사용합니다.
• DeepSeek의 Models & Pricing 페이지에 추가된 새 행.
• 랩에서 흔히 쓰는 newsYYMMDD 형식으로 된, API 문서 뉴스 피드의 날짜별 항목.
• 패밀리 이름이 아닌 모델 식별자 — DeepSeek 버전은 체크포인트이고, 지금까지 단순한 패밀리 슬러그는 프리뷰를 의미해 왔습니다.
더 가까운 마일스톤은 V4.1 Pro로, DeepSeek 팀원이 9월 9일에 라우팅 윈도우의 종료 지점이라고 언급한 바 있다. 여기에는 공개된 사양도, 파라미터 수치도, 가격도, 날짜도 없다. 어떤 의미에서 V4.1 Pro는 이 유출의 시험대다: 차기 플래그십이 대략 V4 Pro의 1.6T 또는 그 이하에 머문다면, 3T 주장은 적어도 한 세대는 밀린 셈이다.
이번 주에 모델을 선택한다면 이 모든 것이 의미하는 바
2026년에 3T 모델은 구매 결정의 기준이 아니며, DeepSeek의 9월이 주는 실질적 교훈은 규모에 관한 것이 전혀 아니다. 그것은 엔드포인트 뒤에 있는 모델이 바뀔 수 있다는 점이다, 엔드포인트의 이름은 정확히 그대로인 채로. 누구든 deepseek-v4-pro를 추상화 계층을 통해 호출하면 9월 14일에 코드를 건드리지 않고도 더 다르고, 더 작고, 더 저렴한 모델을 받는다. 그 ID에 대한 단일 공급자의 구현에 직접 연결된 사람은 그 공급자가 하기로 결정한 것을 그대로 받는다.
DeepSeek V4.1 Flash와 DeepSeek V4 Pro는 모두 OrcaRouter에 하나의 키로 0% 마크업으로 제공됩니다 — 제공업체 정가가 그대로 전달되므로, DeepSeek의 9월 10일 가격 변경이 여기서도 같은 날 정가로 적용되며, 마크업이 붙은 어떤 버전으로 적용되는 것이 아닙니다. 모델 페이지에는 오프피크 구간에서 입력 토큰 100만 개당 $0.15, 출력 100만 개당 $0.60으로 표시되어 있으며, 이는 DeepSeek 자체의 오프피크 요금이고 그 위에 아무것도 더해지지 않습니다. 제공업체 전반에 걸친 자동 페일오버는 이번 같은 주에 가장 중요한, 화려하지 않은 기능입니다: 공급업체가 엔드포인트 밑에서 모델을 교체해 버릴 때, 라우팅 계층이 바로 그것을 마이그레이션이 아닌 구성 변경으로 만들어 주는 곳입니다.
3T DeepSeek 모델이 실제로 출시된다면, 그것을 감당할 클러스터를 가진 쪽이 서빙할 것이고, 가격은 컴퓨트가 정하는 대로 책정될 것이다. 당신이 그것을 만나게 될 곳도 같은 라우팅 계층이다 — 별도의 계약 없이, 아무것도 다시 구축하지 않고.

미해결 질문은 DeepSeek이 3조 파라미터 모델을 만들 수 있는지가 아니다. 공개된 세 편의 아키텍처 논문, 작동하는 메모리 설계, 그리고 제조사가 자사의 1.6T 전작보다 성능이 뛰어나다고 말하는 552B 모델은 모두 이 연구소가 방법을 알고 있음을 시사한다. 문제는 누군가 그것을 서빙하는 데 돈을 낼 사람이 있을지 — 그리고 지난 2주간의 정황으로 볼 때, DeepSeek 자신도 확신하지 못한다. 파라미터 수가 아니라 클러스터를 보라. 가격 페이지는 DeepSeek이 실제로 무엇을 출시하는지 어떤 유출보다 더 빠르게 알려줄 것이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
