'dots-note-3.0: 42/42 IMO 모델이 vLLM PR로 방금 유출됨'의 타이틀 카드: 대형 헤드라인 'dots-note-3.0', 부제 '지금까지 알려진 것', 그리고 두 개의 플랫 아이콘 카드 — 트로피 라인 아이콘과 '공식 평가' 배지가 있는 'IMO 2026 · 42/42', 코드 파일 라인 아이콘과 '아키텍처 유출' 배지가 있는 'vLLM PR #51255'. OrcaRouter 로고는 오른쪽 하단에 합성됨.
Guides & Insights

dots-note-3.0: vLLM PR로 유출된 42/42 IMO 모델이 이제 오픈소스로 공개되었습니다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 8월 14일, dots-note-3.0은 더 이상 유출이 아니게 되었습니다. vLLM 풀 리퀘스트가 출시에 앞서 모델 아키텍처를 유출한 지 8일 만에, Xiaohongshu의 Dots Model Lab은 dots3 계열의 첫 공개 모델인 dots3-note preview를 오픈소스로 공개했습니다 — 2,800억 개의 파라미터(활성 160억 개), 512K 컨텍스트 윈도우, Apache-2.0 라이선스 —. 가중치는 Hugging Face에, 코드는 GitHub에 있으며, 2026 국제수학올림피아드에서 공식적으로 42/42를 기록한 체크포인트는 처음으로 누구나 실행할 수 있습니다.

이번 릴리스는 이 블로그의 8월 6일자 유출 게시물이 남겨 둔 모든 미해결 질문(크기, 컨텍스트 길이, 라이선스, Hugging Face 경로, 출시일)에 답하며, "지금까지 알려진 것들"이라는 이야기를 확인 가능한 이야기로 바꿔 놓는다. 아래는 업데이트 내용이다. 무엇이 출시되었는지, 공개된 설정이 PR이 처음 공개한 아키텍처에 대해 무엇을 확인해 주는지, 이제 무엇이 독립적으로 검증 가능한지, 그리고 무엇이 여전히 공급업체의 주장인지.

초안 PR에서 공개 체크포인트까지

유출 내용을 빠르게 정리하면, 2026년 8월 6일 KurodaKanbei라는 닉네임을 쓰는 기여자 — 스스로 ETH 취리히 박사 과정 학생이라고 밝힌 인물로, 샤오홍슈 직원은 아니다 — 가 vllm-project/vllm 풀 리퀘스트 #51255를 열어 "Dots3 NOTE" 언어 모델 지원을 추가했다. 드래프트 플래그는 8월 7일 13:55 UTC에 해제되었고, PR 자체의 검증 노트가 결정적 단서였다. 작성자는 8-GPU DP8/EP8 서비스를 "Dots3 NOTE FP8 체크포인트"로 실행했다고 적었다. 가지고 있지 않은 FP8 체크포인트를 검증할 수는 없다 — 그 PR을 작성한 사람은 실제 모델을 보유하고 있었다는 뜻이다. 이 PR은 새로운 vllm/models/dots3_note 모듈을 포함해 14개 파일을 건드렸고, new-model 및 verified 라벨이 붙어 있었다.

8월 8일에 우리가 나열한 네 가지 신호 중 가장 중요한 하나를 제외한 모든 신호가 이제 발동했습니다. Hugging Face 저장소가 나타났습니다 — dots-studio/dots3-note-prev, Apache-2.0. 공식 발표도 도착했습니다 — 오늘, 오픈소스 릴리스 자체가 발표되었습니다. 추론 스택은 더 이상 초안이 아닙니다. vLLM 지원이 main에서 기본으로 제공되며, transformers와 SGLang 모두 dots3-note 지원을 포함합니다. 네 번째 신호인 42/42 수학 결과에 대한 독립적 검증은 여전히 남아 있는 유일한 신호입니다. 그리고 가중치가 공개되었기 때문에 이제 이 검증은 이전에는 전혀 불가능했던 방식으로 가능해졌습니다.

Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).

실제로 출시된 것

공개된 모델 카드는 PR의 추론을 사양 시트로 바꾸며, 그 숫자들은 제3자 요약이 아닌 체크포인트 자체의 config에서 비롯됩니다. dots3-note preview는 전문가 혼합(mixture-of-experts) 모델입니다:

• 총 280B / 16B 활성 파라미터 — 256개의 라우팅 전문가와 1개의 공유 전문가, top-8 라우팅, 1개의 dense 레이어 + 45개의 MoE 레이어, 히든 크기 5,120.

• 512K-토큰 컨텍스트 윈도우, 152K 어휘, BF16 및 FP8 정밀도.

• 다중 토큰 예측(MTP) 모듈 — 1.13B 파라미터의 공유 레이어 하나로, 최대 3개의 추가 토큰을 병렬로 예측합니다. 이는 별도의 드래프트 모델 없이도 추측 디코딩(speculative decoding)을 가능하게 합니다.

• 멀티모달 입력 — 텍스트, 이미지, 비디오, 오디오 — 텍스트 출력을 생성합니다. 비전 인코더는 MoE ViT(총 7B / 활성 1.2B)이고, 오디오 인코더는 덴스 800M입니다.

PR의 범위 메모에는 vLLM 작업이 "LLM만" 다루며 멀티모달 구성 요소는 범위 밖이라고 명시되어 있었습니다. 이는 추론 패치에 관한 것이지 모델 자체에 관한 것이 아닙니다. 공개된 체크포인트에는 언어 코어와 함께 비전 및 오디오 인코더가 포함되어 있습니다. 멀티모달 버전을 원한다면 같은 저장소를 보게 되며, 먼저 유출된 vLLM의 LLM 전용 경로가 아니라 transformers 및 SGLang 경로를 통해 제공됩니다.

구체적으로, 이용 가능성은 다음과 같습니다: 가중치는 Apache-2.0 라이선스 하에 Hugging Face의 dots-studio/dots3-note-prev에 있으며, 코드와 서빙 레시피는 GitHub의 studio-dots-ai/dots3-note-prev 저장소에 있습니다. 호스팅 액세스는 공급업체 자체 API 포털과 여러 타사 플랫폼을 통해 제공됩니다. 이는 dots3 패밀리의 첫 번째 오픈 가중치 릴리스로, 샤오홍슈가 중국어 성명에서 2주 동안 사용해 온 '곧 오픈소스화'(近期将开源)라는 표현이 실현된 것입니다.

유출이 정확히 맞힌 아키텍처

해당 PR은 dots-note-3.0을 "DeepSeek-V3.2와 구조적으로 관련이 있다"고 설명했지만, 하나의 스택에 두 가지 어텐션 지오메트리가 혼합되어 있다고 했다. 공개된 설정(config)이 이를 확증한다. 모델 카드는 46개의 어텐션 레이어를 top-2048 인덱싱을 사용하는 13개의 DeepSeek 스타일 희소 어텐션(DSA) 레이어와 33개의 슬라이딩 윈도우 어텐션(SWA) 레이어로 나누며, 대략 희소 레이어 하나당 세 개의 dense 레이어가 있는 셈이다. 이것이 브랜치 이름 note-hopper가 암시했던 "희소 전역과 밀집 지역 사이를 오가는" 구조이며, 이제 체크포인트 자체에 명시되어 있다.

기계적으로 보면, 이는 {{1}}DeepSeek{{/1}}가 {{KEEP}}V3.2{{/KEEP}}에서 선보인 것과 동일한 아이디어다. {{2}}DSA 절반은 가벼운 인덱서로, 캐시된 모든 키를 쿼리와 대조해 점수를 매기고 top-k 후보를 유지한 다음, 전체 컨텍스트 대신 그 후보들에 대해서만 어텐션을 계산한다{{/2}} — {{3}}긴 시퀀스의 2차 비용을 거의 선형 수준으로 줄인다{{/3}}. {{4}}슬라이딩 윈도우 절반은 균형추 역할을 한다{{/4}}: {{5}}희소 인덱서가 무엇을 결정하든 가장 최근 토큰이 항상 완전히 어텐션되도록 보장하는, 제한된 범위의 조밀한 로컬 어텐션이다{{/5}}. {{6}}전역 희소 + 조밀한 로컬을 같은 모델에 담은 것은 이번 유출에서 진정으로 이례적인 부분이었다{{/6}} — {{7}}그리고 이제 그것은 확인된 사실이 되었다{{/7}}.

나머지 설계는 PR에서 말했듯이 익숙한 DeepSeek 계열 구조다: 비그룹화 MoE 라우터, 시퀀스 병렬 MoE, 전체 512K 윈도우까지 검증된 장문맥 청크 프리필, 그리고 투기적 디코딩을 위해 기본적으로 슬라이딩 윈도우 어텐션 유형을 사용하는 MTP 레이어가 그것이다.

42/42 기록 — 그리고 이제 확인할 수 있는 것

IMO 결과 자체는 변하지 않으며, 라벨링도 마찬가지다. 2026년 7월 25일, 샤오홍슈는 상하이에서 열린 제67회 국제수학올림피아드 공식 채점에서 모델이 완벽한 42/42를 기록했다고 발표했다. 666명의 인간 참가자 중 단 7명만이 이 결과와 동일했으며, 금메달 커트라인은 29점이었다. 이는 금메달보다 13점 높은 점수이고, 공식 IMO 채점에서 이전 최고 AI 성적이었던 Gemini Deep Think의 35/42보다 7점 높은 것이다. 이 설명은 공식적으로 채점된 대회에 대한 회사의 주장으로 남아 있다. 점수는 실제이며 위원회가 검증했지만, 문제 접근 방식, 샘플링 및 채점 통제 방식에 관한 주변의 주장들은 독립적으로 검증된 적이 없었다. 연구소 외부의 누구도 모델을 실행할 수 없었기 때문이다.

이것이 이번 릴리스가 바꾸는 부분입니다. 가중치가 공개됨에 따라 42/42는 더 이상 맹목적으로 믿거나 pull request의 말만으로 받아들일 숫자가 아닙니다. 이는 제3자가 재현을 시도할 수 있는 결과이며, 이것이 이번 릴리스에서 가장 가치 있는 검증 가능한 부분입니다. 또한 2주 전과 마찬가지로 세부적인 부분에서는 여전히 논쟁의 여지가 있습니다. 중국 매체들은 화웨이(Huawei)의 셀리아(Celia)도 같은 평가에서 42/42를 기록했다고 보도했으므로, dots-note-3.0은 최초라기보다는 최초 중 하나입니다. 그리고 Menlo Ventures 파트너가 X에 게시한 OpenAI, Anthropic, Axiom Math, Moonshot의 Kimi K3도 올해 42/42를 달성했다는 주장은 여전히 그 뒤에 평가 기록이 없는 검증되지 않은 소셜 게시물일 뿐입니다.

이 회사는 또한 출시와 함께 새로운 벤치마크 주장을 내놓았는데, 모두 벤더가 보고한 수치이며 지금까지 재현되지 않았다. ARC-AGI 3 벤치마크에서 Dots는 dots3-note 프리뷰가 보고된 테스트 시점 비용 $500 미만으로 약 0.35의 점수를 기록한다고 밝혔다. WebShop, HotpotQA, ALFWorld를 포함한 추론 및 에이전트 스위트에서 이 모델은 활성 파라미터 수가 몇 배 더 많은 모델들과 동등하거나 더 우수하며, 비전 성능도 해당 크기에서 두드러진다고 주장한다. 이는 Dots가 자체 모델에 대해 내놓은 수치다 — 중립적인 연구소가 다시 검증할 때까지는 그렇게 취급하면 된다.

Dots는 또한 이 유형의 작업을 위해 자체 구축한 두 가지 평가 하네스를 공개했는데, 이를 오픈소스화하는 것은 모델 자체만큼이나 유용하다. VibeLifeBench는 22개의 시뮬레이션 서비스와 288개의 도구 인터페이스에서 200개의 작업을 실행하며, 에이전트가 작업 중간에 환경이 변할 때 일관성을 유지하는지 1,247개의 원자 조건을 확인한다. Dots 자신의 결과에 따르면, 지금까지 테스트된 가장 강력한 모델은 단 32.5 avg@3을 기록했고, 대부분의 최고 수준의 비공개 가중치 모델은 완전히 실패한다. VibeSearchBench는 더 좁은 범위로, 20개 도메인, 200개 작업에서 요청이 모호할 때 에이전트가 명확성을 요청하는지 테스트한다. 둘 다 ARC-AGI 수치와 동일한 공급업체 보고 라벨을 갖고 있지만, 하네스는 공개되어 있어 32.5라는 수치가 수사적이 아닌 반증 가능한 것이 된다.

왜 이것은 수학 모델이 아니라 에이전트 모델인가

누출도 IMO 점수도 이 모델이 무엇을 위해 만들어졌는지에 대해 당신을 오도해서는 안 됩니다. 출시 포지셔닝은 수학이 아니라 장기적이고 개방형 작업입니다: 개인 맞춤형 여행 계획, 결혼 준비 워크플로, 소규모 매장 운영, 주택 리노베이션. 단일 정답이 없는 작업, 작업 중간에 목표가 바뀌는 작업, 그리고 시간 단위가 몇 시간이나 며칠에 걸친 작업입니다. 이것은 수학 및 코딩 리더보드와 의도적으로 다른 벤치마크 세트이며, 바로 여기서 dots3-note 설계 선택 — 512K 컨텍스트, 메모리 파일, 자기 비판 루프 — 가 실제로 효과를 발휘합니다.

공개된 자료에는 세 가지 기법이 눈에 띈다. 첫째, 모델은 지속적으로 갱신되는 환경 요약으로 메모리 파일(memory.md)을 유지하며, 이를 통해 길고 개방형인 세션 전반에 걸쳐 상태를 이어 나간다. 둘째, '자기 비평' 메커니즘을 사용한다는 점이다. 이는 IMO 풀이가 사용하는 것으로 설명된 것과 동일한 재귀적 자기 검토 방식으로, 모델이 자신의 중간 단계를 지적하고 수정한다. 셋째, 훈련 방식의 이름은 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)이다. 모델은 긴 궤적을 매크로 단계로 나누고 행위자(actor)와 비평가(critic) 역할을 번갈아 수행하며 자체 훈련 신호를 생성한다. 이것이 정답(ground-truth)이 없는 작업에서도 최적화할 수 있다고 보고된 이유다.

판매업체의 직접 시연은 그 주장의 실체를 보여준다: 덱빌더 게임인 Slay the Spire II를 33층까지 플레이하고, ARC-AGI 3의 6개 레벨을 모두 320단계로 해결하며, 주택 개조 공간 추리 문제를 단계별로 풀어내고, visionOS 앱을 처음부터 끝까지 빌드하는 것(스위프트 파일 12개, 1,876줄, "BUILD SUCCEEDED")이 그것이다. 이것들은 벤치마크가 아니라 시연으로 취급하라. 그러나 그것들은 특정한 역량, 즉 하나의 목표를 마음에 두고 흐름을 놓치지 않은 채 많은 단계를 수행하는 모델의 시연이다. 그리고 이는 현재 에이전트 시장에서 가장 부족한 능력이다.

비용, 자체 호스팅, 그리고 사용해 보는 방법

오픈 가중치는 무료입니다. {{1}}dots3-note preview{{/1}}의 비용은 서빙하는 데서 발생합니다. FP8 체크포인트용 {{2}}레퍼런스 vLLM 레시피{{/2}}는 8개의 NVIDIA H100에서 {{3}}텐서 병렬화 8, 전문가 병렬화 8{{/3}}로 실행됩니다 — 실제 예산이 필요한 사양이지, 노트북에서 돌릴 수 있는 모델이 아닙니다. 그런 하드웨어를 갖춘 팀은 런타임에 포함된 {{4}}3-토큰 MTP 추측 디코딩{{/4}}과 dots 도구 호출 파서를 포함한 전체 스택을 사용할 수 있습니다. 나머지 사람들은 호스팅 방식으로 이용하게 됩니다. 공급업체의 API 포털이 가동 중이며, 호스팅 프리뷰 엔드포인트는 가중치가 공개된 바로 그날인 {{5}}8월 14일{{/5}}에 타사 플랫폼에서도 오픈했습니다. 프리뷰 티어는 이를 서빙하는 플랫폼에서 {{6}}토큰당 $0{{/6}}으로 리스팅되어 있는데, 이는 공급업체의 가격 페이지가 아닌 해당 플랫폼 자체의 리스팅 기준이므로, 프리뷰 태그가 유지되는 한 오늘 프로덕션에서 {{7}}dots3-note preview{{/7}}를 시도하는 진입 비용은 사실상 0입니다.

빌더에게 있어, 검증되지 않은 모델에 저렴하게 베팅하자는 2주 전의 논쟁은 이제 막 출시된 모델을 평가하는 논쟁으로 읽힌다 — 패턴은 동일하다. 자동 장애 조치(failover) 뒤에 있는 새 모델로 트래픽의 일부를 보내서, 예상치 못한 실패 모드가 프로덕션 경로 대신 테스트 경로를 무너뜨리게 하라. 그것이 바로 라우터의 존재 이유이며, 이것이 제안의 정직한 버전이다: 이 글을 쓰는 시점에 dots3-note preview는 OrcaRouter에서 호스팅되지 않으며, 누구도 그 반대로 가장해서는 안 된다. 그러나 우리가 유출 기사에서 썼던 라우팅 방식은 그것이 호스팅되는 날부터 적용된다 — 제공자가 새 모델을 호스팅하는 순간 그 모델에 도달할 수 있는 하나의 API, 공급자 정가를 0% 마크업으로 그대로 전달하고 요청별로 장애 조치를 구성하는 API. 그 사이에, 이 모델과 구조적으로 연관된 DeepSeek 계열 모델들은 이미 그런 방식으로 호출할 수 있다: DeepSeek V4 Flash와 DeepSeek V4 Pro는 둘 다 하나의 키로 라이브 상태이며, 동일한 정가 전달(pass-through) 가격과 요청별 장애 조치를 갖춘다 — 이는 dots3-note preview와 같은 16B 활성 파라미터 에이전트 모델이 프로덕션에서 실제로 어떻게 동작하는지 판단할 수 있는 합리적인 기준점이다.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash (www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731), the released DeepSeek-generation model whose MLA + sparse-attention family dots-note-3.0 is structurally related to.

다음에 볼 콘텐츠

상황을 바꿀 수 있는 정도에 따라 대략 순서대로 나열한 네 가지:

• 42/42의 독립적 재현. 가중치가 공개되었으며, IMO 결과에 대한 최초의 진지한 제3자 재실행 — 또는 이를 반박하는 중립적 평가 패키지 — 은 이번 릴리스가 생산할 수 있는 가장 가치 있는 데이터 포인트입니다. 그때까지 42/42는 공식적으로 채점되고 회사가 보고한 점수로 유지됩니다.

• 더 큰 형제들, jazz와 aria. dots3-note 프리뷰는 첫 공개 릴리스이며, 회사에 따르면 dots3 제품군에서 가장 가벼운 멤버다. 280B 총 파라미터 / 16B 활성 파라미터가 작은 모델이라면, 두 개의 더 큰 모델이 실제로 프론티어 주장이 시험될 대상이다.

• 호스팅 제한 및 미리보기 조건. 가격은 이제 공개되었습니다 — 미리보기 티어는 이를 제공하는 플랫폼에서 토큰당 무료입니다 — 그러나 속도 제한과 미리보기 태그에 특별 조건이 포함되는지 여부는 여전히 누가 자체 호스팅을 할지, 누가 API를 호출할지를 결정할 것입니다.

• 독립적인 리더보드에서 어디에 위치하는지. 벤더가 보고한 ARC-AGI 및 에이전트 스위트 주장은 사용 가능한 사실이 되기 위해 중립적인 측정이 필요합니다. 이는 올해 모든 공개 릴리스에서 과대광고와 현실을 구분한 것과 같은 과정입니다.

8월에 해당 유출을 다뤘을 때, 솔직한 요약은 짧았습니다: 진짜 아키텍처, 진짜 기록, 가중치 없음, 날짜 없음. 그 네 가지 조건 중 세 가지가 이제 사라졌습니다. 아키텍처는 공개되었고, 기록은 다운로드 가능한 체크포인트에 첨부되어 있으며, 날짜도 도래했습니다. 남은 것은 검증뿐입니다. 이제 dots3-note 프리뷰는 읽기만 하는 것이 아니라 직접 실행할 수 있게 되었으니, 샤오훙슈가 주장하는 에이전트 모델을 실제로 구축했는지에 대한 답은 풀 리퀘스트가 아닌, H100 여덟 대와 벤치마크 하네스를 가진 누구에게서든 나올 것입니다.