
NVIDIA PixelUMM, 발표 없이 출시 — 가중치가 방금 공개됐다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
NVIDIA가 새로운 통합 멀티모달 모델을 만들었다는 사실을 알아내는 가장 쉬운 방법은 아무도 당신에게 알려주지 않았다는 점을 눈치채는 것이다. 그 nvidia/PixelUMM 저장소는 2026년 10월 1일 21:40 UTC에 Hugging Face에 나타났으며, 학습된 전체 스택이 Qwen3-8B 백본 위에 올라간 152억 파라미터 체크포인트를 담고 있었습니다 — 그리고 이를 함께 알릴 블로그 글도, 보도자료도, 기조연설 슬라이드도, 출시 스레드도 없었습니다. 이 이름을 검색해도 NVIDIA 자체 블로그에서는 아무것도 나오지 않습니다. 대신 존재하는 것은 GitHub 저장소, 자체 URL에 여전히 "preview"라고 적혀 있는 프로젝트 페이지, 2609.38597번이 붙은 arXiv 프리프린트, 그리고 로더가 없으면 실행을 거부하는 숨겨진 인덱스와 함께 128개 파일로 나뉜 체크포인트입니다. PixelUMM은 실제로 존재하며 오늘 다운로드할 수 있습니다. NVIDIA가 이것을 출시된 것으로 간주하는지는 회사가 답하지 않은 질문입니다.
존재하는 아티팩트와 아무 말도 하지 않은 벤더 사이의 그 간극 — 이것이 여기서 이야기의 전부이며, 각 사실이 그 간극의 어느 쪽에 놓이는지를 정확히 짚어볼 가치가 있다. 아래의 모든 내용은 저장소, 모델 카드, 그리고 저자들이 직접 발표한 논문에서 나온다. 어떤 것도 발표에서 나온 것이 아니다. 발표가 없었기 때문이다.
무엇이 나타났으며, 언제
그 시리즈는 약 4주에 걸쳐 이어졌고, 각 콘텐츠는 조용히 자리 잡았다.
• 2026년 9월 4일 — nv-tlabs/PixelUMM이 GitHub에 Apache-2.0 저장소 라이선스로 생성되었으며, 간단히 "인코더 없는 통합 이미지 및 비디오 이해와 생성"이라고 설명됩니다. 9월 말까지 단일 초기 커밋만 있는 상태로 남아 있습니다.
• 2026년 9월 28–29일 — 저장소의 최초 커밋이 올라오고, arXiv가 9월 29일자로 프리프린트 arXiv:2609.38597을 배정한다. 저자로는 NVIDIA와 워터루 대학교 소속의 Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang, Jay Zhangjie Wu가 명시되어 있다.
• 2026년 10월 1일 21:32 UTC — 저장소에 "docs: add PixelUMM paper citation"라는 제목의 최종 커밋.
• 2026년 10월 1일 21:40 UTC — Hugging Face 모델 저장소가 생성되고, 8분 후 체크포인트 샤드로 채워집니다.
프로젝트 페이지는 문자 그대로 pixelumm-project-page-preview라고 적힌 경로에 호스팅되어 있고, 논문에는 게재 학회를 밝히는 문구가 없다 — CVPR도, NeurIPS도, "accepted to"도 없다. 종합해 보면, 이 일련의 정황은 한 연구팀이 논문 아티팩트를 라이브로 공개하고 HF 업로드를 발표로 삼는 것처럼 읽힌다. 이는 증거에 관한 관찰이지 의도에 관한 주장이 아니다: NVIDIA가 나중을 위해 출시를 계획해 두었을 가능성도 충분하며, 여기에는 그것을 배제할 만한 것이 없다.

PixelUMM이 실제로 무엇인지
설계 논지는 모델 카드의 첫 줄에 제시되어 있다: VAE도, 비전 인코더도 없다. 기존의 통합 모델이 두 개의 시각 인터페이스 — 이해를 위한 의미 특징을 생성하는 비전 트랜스포머와, 생성을 위한 재구성 잠재 변수를 생성하는 변이형 오토인코더 — 를 갖추는 반면, PixelUMM은 그 어느 것도 갖추지 않는다. 이미지는 16×16 픽셀 패치로 잘리고, 비디오는 4프레임 시공간 튜블릿으로 잘린다. 둘 모두 오직 단일 계층 선형 투영을 통해서만 백본에 도달한다. 원시 픽셀이 들어가고, 원시 픽셀이 나온다.
• 아키텍처 — 원시 픽셀 패치 임베딩과 반복적 픽셀 생성 헤드를 갖춘 디코더 전용 Transformer로, 논문에서는 공유 어텐션과 작업별 파라미터를 결합한 Mixture-of-Transformers로 설명된다.
• 백본 — Qwen3-8B, 리비전 b968826d9c46dd6066d109eabc6255188de91218에 고정. config 파일과 토크나이저 파일만 있으면 되며, 체크포인트 자체에 학습된 언어 가중치가 포함되어 있습니다.
• 파라미터 — 15,199,672,064(대략 15.2B)이며, 논문 자체의 벤치마크 표에서는 "8B MoT"로 표기되는데, 여기서 크기 표기는 백본과 생성 전문가를 별도로 계산한다.
• 목표 — 자기회귀 텍스트 예측과 픽셀 공간 플로우 매칭을 공동으로 학습하는 것으로, 이를 통해 하나의 가중치 집합이 이미지에 관한 질문에 답하는 동시에 새로운 이미지를 그릴 수 있습니다.
• 작업 — 텍스트-투-이미지, 96프레임 / 24fps / 4초 텍스트-투-비디오, 이미지 조건부 텍스트, 비디오 조건부 텍스트.
이 논문의 실증 섹션은 주목할 만큼 이례적이다. 여덟 개 섹션은 리더보드 순위보다는 설계 선택에 대한 연구다 — 이미지 패치 크기, 비디오 패치 크기, 패치 아티팩트, 픽셀 공간 대 VAE 공간 학습 역학, 모델 크기, 컴퓨트 스케일링, 멀티모달 문맥 조건화, 비디오 이해 인터페이스. 이것은 그 접근법이 작동하는지를 답하려는 사람들이 쓴 논문이지, 표에서 이기려는 논문이 아니다.
그 수치는 저자들 자신의 것이다
아래의 모든 수치는 PixelUMM 저자들이 자신들의 프리프린트에서 보고한 것입니다. 독립적인 재현도, 아레나 Elo도, 제3자 평가도 없습니다. 왜냐하면 이 모델은 많아야 6주 된 것으로, 어떤 외부 하네스보다도 먼저 나왔기 때문입니다. 이것들을 검증된 성능이 아니라 다운로드 링크가 딸린 주장으로 취급하십시오.
• 이미지 이해 — MMMU 41.67, MMStar 53.99, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00, BLINK 53.46, MMMU-Pro 27.63, 공식 LMMS-Eval 프로토콜 기준 (21개 태스크에 걸친 64,750회 생성).
• 비디오 이해 — MVBench 70.53, Video-MME 57.33(자막 없이), LongVideoBench 59.61, LVBench 40.41.
• 이미지 생성 — LLM 프롬프트 재작성기 사용 시 GenEval 종합 0.83, 미사용 시 0.77, DPG-Bench 종합 85.74.
• 비디오 생성 — VBench 파트 1 품질 점수 84.10, 의미 점수 79.80; VBench 파트 2 총점 83.24.
솔직히 읽어보면 이것들은 동급 내에서 경쟁력은 있지만 카테고리를 선도하는 수치는 아니며, 논문 자체도 그렇게 말한다: 모델마다 학습 데이터가 다르기 때문에 그 결과가 "어떤 아키텍처가 더 우수한지 입증할 수 없다"고 언급한다. Qwen3-VL-8B와 비교하면 이미지 이해 격차는 MMMU에서 크고(41.67 대 69.60), MMMU-Pro에서는 저자들이 경쟁 수치를 보고하지 않는다. Qwen-Image 20B와 비교하면 GenEval 격차는 0.83 대 0.87이다. PixelUMM이 자체 수치로 보았을 때 아닌 것은 최첨단 모델이다. 자체 수치로 보았을 때 그것은 주변의 특화 시스템과 같은 대역에 위치한, 진정으로 특이한 아키텍처를 지닌 15B 모델이다.
가장 날카로운 무기는 라이선스이지, 벤치마크가 아니다
저장소는 Apache-2.0이며 모델 카드에도 그렇게 분명히 명시되어 있습니다. 체크포인트는 조건이 다른 별개의 아티팩트이며, 바로 이 세부 사항이 팀을 가장 당황하게 만들 가능성이 큽니다. 가중치는 NVIDIA One-Way Noncommercial License에 따라 배포되는데, 이 라이선스의 사용은 비상업적 연구 또는 평가로 제한됩니다. 이는 바로 옆에 있는 코드보다 실질적으로 더 엄격한 허여 조건입니다. 저장소의 한 소스 파일인 modeling/pixelumm/modeling_utils.py에는 DiT에서 파생된 CC BY-NC 4.0 고지가 추가로 남아 있습니다.
연구 그룹, 평가 팀 또는 논문을 발표하는 누구에게나 이것은 완벽하게 사용할 수 있는 라이선스입니다. 내부 기능을 프로토타이핑하는 제품 팀에게 이것은 법무팀에 가장 먼저 보여줘야 할 것이고, 답은 '아니오'일 수도 있습니다. 출시할 수 없는 모델은 출시할 수 있는 모델과는 다른 종류의 자산이며, 벤치마크가 아무리 동등해도 그 사실은 달라지지 않습니다.

그것을 실행하는 데 필요한 것
이것은 주말에 끝낼 수 있는 다운로드가 아닙니다. 환경 문서에서는 Linux x86-64, Python 3.12, CUDA 13.0 개발 툴킷, NVIDIA GPU, 그리고 해당 툴킷에 맞춰 소스에서 빌드한 FlashAttention을 요구합니다 — 런타임 전용 CUDA 이미지로는 해결되지 않습니다. 체크포인트 자체도 model.safetensors 파일이 아닙니다: 총 약 30GB에 달하는 128개의 .distcp 샤드와 숨겨진 .metadata 인덱스로 이루어져 있으며, 로더는 참조된 모든 샤드와 그 인덱스가 존재할 것을 요구합니다.
두 가지 추가 세부 사항이 실제로 이걸로 무엇을 할 수 있는지를 좌우합니다. 첫째, 텍스트-투-비디오는 기본적으로 Cosmos 가드레일을 실행하며, 이를 위해서는 접근이 제한된 nvidia/Cosmos-1.0-Guardrail 리포지토리와 서로 다른 Transformers 메이저 버전을 사용하는 두 번째 Python 환경에 대한 접근이 필요합니다. 로그인만으로는 가중치가 열리지 않습니다. 둘째, 공개된 유일한 학습 레시피인 4단계 토이 학습 예제는 각각 최소 48GiB인 GPU 7개와 출력용 약 61GB의 여유 디스크가 필요하다고 문서화되어 있습니다. 워크스테이션에서의 파인튜닝은 의도된 경로가 아니며, 최신 카드 한 장에서의 추론이 의도된 경로입니다.
리포지토리에는 네 개의 체크포인트가 함께 제공됩니다. S8-F22-R05는 기본값이며 논문 평가에 사용된 것으로, 네 가지 태스크를 모두 처리합니다. S8-F18-R01은 480p와 720p에서 10,000회의 추가 파인튜닝 단계를 거쳤고 일반적으로 약간 더 나은 텍스트-투-비디오 결과를 제공하지만, 비디오 이해는 할 수 없습니다. S8-F19-R03과 S8-F21-R02는 중간 단계입니다. 이 중에서 선택하는 것은 사소한 세부 사항이 아니라 진짜 결정입니다.
확인되지 않은 것은 무엇입니까?
짧은 목록이며, 위의 긴 목록보다 더 중요합니다.
• NVIDIA의 발표가 없습니다. 작성 시점까지 이 모델에 관한 보도자료나 회사 자체 블로그 게시물은 확인되지 않았습니다. 조용한 출시는 의도된 것일 수 있으며 — 연구 산출물은 흔히 이런 방식으로 공개됩니다 — 아니면 아직 출시가 이루어지지 않았을 수도 있습니다.
• 독립적인 평가는 없습니다. 이 글의 모든 수치는 저자들 자체의 것입니다. NVIDIA와 Waterloo 외부에서 재실행된 것은 아무것도 없습니다.
• 어디에도 호스팅된 경로가 없습니다. 현재 API를 통해 PixelUMM을 호출할 수 없으며, 여기에는 OrcaRouter도 포함됩니다 — 저희는 이를 라우팅하지 않습니다, 그리고 그럴 수도 없습니다. 비상업적 라이선스가 적용된 체크포인트는 상업적 서빙 플랫폼이 제공할 수 있는 것이 아니기 때문입니다. 그렇지 않다고 말하는 사람은 누구든 자체 호스팅 구성을 설명하고 있는 것입니다.
• 향후 라이선싱에 대한 명시된 입장 없음. 비상업적 약관은 배포된 그대로의 약관입니다. 완화될지 여부는 알 수 없으며, NVIDIA의 연구 체크포인트 관련 이력을 고려하면 이를 전제로 계획할 만한 사안이 아닙니다.

다음에 주목할 사항
세 가지 사건이 PixelUMM을 연구 산출물에서 더 넓은 대중이 사용할 수 있는 무언가로 바꿔 놓을 것입니다. 첫 번째는 체크포인트의 라이선스 변경입니다. 그 단일 파일이 "흥미로운" 것과 "제품에서 사용할 수 있는" 것 사이의 유일한 장벽입니다. 두 번째는 공식 NVIDIA 출시로, 이는 저장소가 제공할 수 없는 프레이밍을 동반할 것입니다: 모델이 무엇을 위한 것인지, 그리고 그것이 제품 방향인지 논문인지입니다. 세 번째는 최초의 독립적 재현으로, 아마도 여분의 GPU 클러스터를 가진 누군가가 GenEval이나 MVBench를 다시 실행하는 경우일 텐데, 그때가 저자들의 수치가 유일한 수치가 아니게 되는 순간입니다.
그때까지 올바른 태도는 증거가 뒷받침하는 태도다. PixelUMM은 존재하고, 코드와 논문은 공개되어 읽을 수 있으며, 가중치도 다운로드되고, 성능 주장 중 어느 것도 이를 만든 팀 외부의 누구에 의해서도 검증되지 않았다. 그것은 이 작업에 대한 비판이 아니다 — 6주 된 연구 공개물이란 그런 모습이다. 또한 라우팅 계층이 나중에 제값을 하게 되는 바로 그런 상황이기도 하다. 라이선스가 언젠가 완화된다면 말이다: 이미 신뢰하는 모델들 전반에서 하나의 키, 정가가 0% 마크업으로 그대로 전달되는 구조, 그리고 입증되지 않은 무언가로 트래픽 일부를 보내면서도 프로덕션 경로를 거기에 걸지 않게 해주는 페일오버. 하지만 지금으로서는 솔직한 요약이 더 단순하다. NVIDIA는 특이한 무언가를 만들고, 그것을 철저히 공개하고도 아무에게도 알리지 않았다. 저장소가 곧 발표다.
