
PixelUMM vs InternLumina-U2: 인코더 없는 두 베타, 그리고 그것을 결정짓는 유일한 차이
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
두 모델, 둘 다 공개되어 있고, 둘 다 이례적으로 설계되었지만, 그중 하나로만 제품을 만들 수 있다. PixelUMM은 NVIDIA의 인코더 없는 통합 모델이다 — Qwen3-8B 백본 위에 152억 개의 파라미터를 얹고, 16×16 패치와 4프레임 튜블릿을 통해 원시 픽셀을 읽고 쓰며, 스택 어디에도 VAE도 비전 인코더도 없다. InternLumina-U2는 Shanghai AI Laboratory의 16B 전문가 혼합(mixture-of-experts) 확산 모델로, AToken이라는 토크나이저를 통해 모든 시각 입력을 여덟 개의 상보적 이산 코드로 압축한다. 둘 다 시각 인터페이스가 병목이라고 승부를 걸었다. 더 중요한 승부는 라이선스 파일에 있다: InternLumina-U2는 Apache-2.0 가중치를 배포하고, PixelUMM은 비상업적 라이선스가 걸린 체크포인트를 배포한다. 상업적인 용도로 둘 중 하나를 고르는 상황이라면, 그 문장이 비교의 전부이며 이 페이지의 나머지는 그에 대한 맥락일 뿐이다.
아래의 두 수치 세트는 모두 해당 연구소들 자체에서 나온 것입니다. 두 모델 모두 독립적인 평가나 아레나 Elo, 제3자 재현이 없습니다. 어느 쪽도 호스팅 API로 제공되지 않습니다. 다른 점은 아티팩트를 다운로드한 후 그것으로 무엇을 하도록 허용되는지, 그리고 각 릴리스가 실제로 어느 정도까지 진행되었는지입니다.
각각이 지금 현재 어디에 있는지
릴리스 일정은 서로 다른 속도로 움직였고, 둘 다 조용히 그렇게 움직였다.
• PixelUMM — 2026년 9월 4일에 생성된 GitHub 저장소; 2026년 9월 29일자 arXiv 프리프린트 2609.38597; 2026년 10월 1일 21:40 UTC에 생성된 Hugging Face 모델 저장소. 이와 관련해 공개된 NVIDIA 블로그 게시물, 보도자료 또는 출시 스레드는 없었다.
• InternLumina-U2 — GitHub 리포지토리는 2026년 9월 1일에 생성되었습니다; Hugging Face 스텁은 같은 날 등록되었습니다; Ascend로 훈련된 체크포인트 가중치는 2026년 9월 10일에 추가되었습니다; NVIDIA/CUDA 체크포인트 가중치는 2026년 9월 24일에 추가되었습니다. 스택당 7개의 샤드이며, 두 스택 모두 오늘 다운로드할 수 있습니다.
9월 초에 존재했던 InternLumina-U2 — 코드만 있고, 가중치는 “곧 공개”, 모델 저장소는 텅 비어 있던 — 는 지금 존재하는 InternLumina-U2가 아니다. 이달 초에 그것에 대해 읽고 가중치가 빠졌다고 결론 내린 사람이라면 다시 확인해야 한다. Huawei Ascend와 NVIDIA/CUDA 체크포인트가 모두 Apache-2.0 아래에 공개되어 있으며, 토크나이저, config, 채팅 템플릿, 원격 모델링 코드도 함께 제공된다.

같은 질문에 대한 두 가지 답변
두 모델 모두 동일한 불만에서 출발합니다: 이해를 위한 비전 인코더와 생성을 위한 VAE를 함께 사용하는 것은 모든 이미지를 두 번 표현한다는 뜻이며, 시각적 컨텍스트를 대략 두 배로 늘리고 학습 파이프라인이 두 개의 인터페이스를 유지하도록 강제합니다.
PixelUMM의 해답은 둘 다 삭제하는 것이다. 원시 픽셀은 단일 계층 선형 투영을 통해 곧바로 입력된다 — 이미지 위치당 16×16 패치, 비디오 위치당 4프레임 튜블릿 — 그리고 백본은 디코더 전용 Transformer로, Mixture-of-Transformers 설계가 공유 어텐션과 작업별 파라미터를 결합한다. 텍스트는 자기회귀적으로 예측되고, 픽셀은 플로 매칭으로 예측된다. 이 논문은 설계 연구 — 패치 크기, 패치 아티팩트, 픽셀 공간 대 VAE 공간 역학, 컴퓨트 스케일링 — 에 8개 섹션을 할애하는데, 이는 팀의 진짜 질문이 이 패러다임이 과연 성립하는지였음을 보여준다.
InternLumina-U2의 해답은 이산 인터페이스는 유지하되 각 토큰이 훨씬 더 많은 정보를 담게 만드는 것입니다. AToken 토크나이저는 텍스처, 내장 텍스트, 기하 구조를 포괄하는 여덟 개의 상보적 코드북으로 모든 시각적 위치를 설명하며, 여덟 개의 임베딩은 위치마다 연결되어 하나의 백본 토큰으로 투영됩니다. 디코딩은 반대 방향으로 작동하며, 공간적으로 병렬적인 디노이징과 여덟 개의 코드를 순서대로 예측하는 다중 코드북 자기회귀 헤드를 사용합니다. 백본은 LLaDA-2.0 계보의 희소 확산 LLM으로, 총 16B 규모에 1B가 활성입니다.
• 시각 인터페이스 — PixelUMM: 원시 픽셀 패치와 튜블릿(tubelet), 토크나이저가 전혀 없음. InternLumina-U2: AToken의 8개 코드북 완전 이산 토큰, 연속 잠재 표현 없음.
• 백본 — PixelUMM: Qwen3-8B(총 15.2B), 이해 및 생성 전문가를 갖춘 단일 덴스 디코더. InternLumina-U2: 총 16B / 활성 1B 스파스 MoE 확산 언어 모델.
• 생성 방식 — PixelUMM: 픽셀 공간 플로우 매칭과 자기회귀 텍스트. InternLumina-U2: 이산 코드에 대한 마스크드 디퓨전 디노이징.
• 지원하는 작업 — PixelUMM: 텍스트→이미지, 텍스트→비디오, 이미지→텍스트, 비디오→텍스트. InternLumina-U2: 여기에 이미지 편집과 3D 이해가 추가됩니다.
• 가중치 형식 — PixelUMM: 128.distcp 샤드(약 30 GB)가 숨겨진 .metadata 인덱스 뒤에 있습니다. InternLumina-U2: 하드웨어 스택당 7개의 .safetensors 샤드, 표준 Hugging Face 레이아웃.

출처가 함께 첨부된 스코어보드
모든 행을 해당 연구실의 자체 주장으로 읽으십시오. PixelUMM의 주장은 자체 프리프린트에서 나온 것이고, InternLumina-U2의 주장은 해당 연구실이 이를 “예비적, 부분적”이라고 스스로 설명한 것이며, 전체 비교 표는 아직 나오지 않은 기술 보고서로 미뤄 둔 상태입니다.
• MMMU(이미지 추론) — PixelUMM 41.67(저자 자체 측정). InternLumina-U2: 보고되지 않음.
• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.
• DocVQA — PixelUMM 90.42. InternLumina-U2: 보고되지 않음.
• Video-MME (자막 없음) — PixelUMM 57.33. InternLumina-U2 51.26.
• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.
• GenEval 전체 — LLM 프롬프트 재작성기 사용 시 PixelUMM 0.83, 미사용 시 0.77. InternLumina-U2 0.81.
• DPG-Bench 종합 — PixelUMM 85.74, InternLumina-U2 87.10.
• 비디오 생성 — PixelUMM VBench 파트 1 품질 84.10 / 시맨틱 79.80, 파트 2 총점 83.24. InternLumina-U2: 보고되지 않음.
• 3D 이해 — PixelUMM: 해당 과제 없음. InternLumina-U2는 3D MM-Vet 41.8을 보고합니다.
이 비교는 두 연구소가 서로 다른 표를 공개하기 때문에 불균형한 것이지, 한쪽이 이기고 있어서가 아닙니다. PixelUMM에는 전체 비디오 생성 섹션이 있고 편집이나 3D는 없습니다. InternLumina-U2는 여섯 가지 작업군을 주장하며 그 전반에 걸친 부분적인 표를 보고합니다. 같은 벤치마크 이름에 대한 연구소 간 수치는 동일한 측정이 아닙니다 — 분할, 프롬프트, 샘플링이 다르기 때문입니다 — 그러므로 ChartQA와 GenEval 행은 대략 동등한 수준으로 취급하고 거기서 멈추세요.
라이선싱은 여기서 무승부가 끝나는 지점입니다
이 부분은 어떤 벤치마크 표에도 나오지 않는다. PixelUMM 저장소는 Apache-2.0이며, 모델 카드에도 그렇게 눈에 띄게 명시되어 있다. 체크포인트는 NVIDIA One-Way Noncommercial License에 따른 별도 아티팩트로, 비상업적 연구 또는 평가로 제한되며, 한 소스 파일에는 DiT에서 상속된 CC BY-NC 4.0 고지가 추가로 남아 있다. 연구용: 문제없다. 내부 제품 기능: 법무와의 대화가 필요하며, 어쩌면 짧은 대화가 될 수도 있다.
InternLumina-U2는 코드와 두 체크포인트 모두 끝까지 Apache-2.0이며, 별도의 비상업적 예외 조항은 없습니다. 출시해야 하는 팀에게 그것은 작은 우위가 아니라 결정을 좌우하는 전부입니다. 두 모델 모두 성숙도 면에서 연구 등급입니다. 그중 하나만 사용에 제한이 없습니다.
실제로 어떤 걸 해봐야 하고, 어떻게 해야 할까요?
당신의 작업이 비디오 이해이거나 하나의 가중치 세트에서 비디오와 이미지를 생성하는 모델을 원한다면, PixelUMM은 더 완성도 높은 산출물이고 그 논문이 더 유용한 읽을거리입니다. 하지만 이는 비상업적 라이선스의 연구 프로젝트이므로 파이프라인에 넣을 것이 아니라 평가용 벤치에 두는 것이 맞습니다. 당신의 작업이 차트, 문서, 이미지 생성의 폭넓음이거나 편집과 3D가 필요하다면, InternLumina-U2가 더 넓은 범위를 포괄하며 라이선스 상한이 없습니다. 그 대가는 16B-A1B 확산 백본과 AToken 토크나이저 때문에 실제 서빙 엔지니어링이 필요하다는 점이며, 공개된 수치도 명시적으로 부분적입니다.
이 글을 쓰는 시점 기준으로 두 모델 중 어느 것도 어떤 호스팅 API에도 없으며, 여기에는 OrcaRouter도 포함됩니다 — 우리는 두 모델 중 어느 것도 라우팅하지 않습니다. 상황이 바뀌면, 직접 통합하는 대신 라우팅 계층을 통해 이들에 접근하는 근거는 새로 공개된 모든 모델에 적용되는 것과 같습니다: 200개 이상의 모델 전반에 걸친 하나의 키, 공급자 정가가 0% 마크업으로 그대로 전달됨, 그리고 자동 페일오버를 통해 공급업체 표에서 시사한 것보다 더 나쁜 것으로 판명된 모델을 배포를 다시 작성하는 대신 경로를 변경하여 강등할 수 있습니다. 그때까지 정직한 조언은 지루한 것입니다 — 사용 사례에 허용되는 라이선스를 내려받고, 자체 데이터로 자체 평가를 실행하며, 연구소 외부의 누군가가 그 수치를 다시 실행할 때까지는 어느 연구소의 수치도 기준으로 삼아 계획하지 마십시오.
답을 바꾸는 것은 무엇인가?
영향력이 큰 순서대로 세 가지다. PixelUMM의 체크포인트에 상용 라이선스가 적용되면 비교가 진정으로 팽팽해지고, "논문을 읽는" 단계에서 "가중치를 평가하는" 단계로 넘어갈 것이다. 전체 비교 표를 담은 Shanghai AI Laboratory의 기술 보고서가 나오면 InternLumina-U2의 부분적인 수치를 검증 가능한 것으로 만들고, 여섯 과제의 폭 중 얼마나가 동등한 수준에 있고 얼마나가 토큰 깊이에 있는지도 드러낼 것이다. 그리고 두 모델 중 하나에 대한 최초의 독립적 재현 — 결과에 아무 이해관계가 없는 팀이 수행한 GenEval 또는 MVBench 재실행 — 은 이들 중 하나가 더 이상 벤더 표가 아니게 되는 순간이다. 그때까지 하나는 연구만 할 수 있는 특이한 아키텍처이고, 다른 하나는 출시할 수 있는 특이한 아키텍처다.
