OrcaRouter 하우스 스타일로 생성된 타이틀 카드에는 “PixelUMM vs Microsoft Mage-VL”이라고 적혀 있고, 네 개의 통계 타일이 있습니다: “>75%”(Mage-VL이 보고한 시각 토큰 감소율), “3.5×”(균일 프레임 샘플링 대비 보고된 실제 시간 기준 속도 향상), “15.2B vs 4B”(Mage-VL의 Qwen3-4B 백본에 맞선 PixelUMM의 총계), 그리고 “0 / 1”(이미지와 비디오를 아우르는 PixelUMM의 모델 1개에 맞선 Mage-VL의 생성 능력 0). 하단 푸터 줄에는 “두 연구소의 자체 수치이며, 어느 모델도 독립적으로 재실행되지 않았습니다.”라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 하단의 패딩된 스트립에 합성되어 있습니다.
Guides & Insights

PixelUMM vs Microsoft Mage-VL: 하나는 비주얼 토크나이저를 삭제하고, 다른 하나는 이를 재작성한다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

은 모두 PixelUMM과 Microsoft Mage-VL비전이 토큰으로 변환되는 방식이 잘못된 병목이라고 확신한 팀들이 만들었으며, 그들은 이를 정반대 방향으로 해결했다. Microsoft의 코덱 네이티브 스트리밍 모델인 Mage-VL은 토크나이저를 유지하면서 그것을 훨씬 더 공격적으로 만든다: 현대 비디오 코덱의 구조를 따르고, 모든 앵커 프레임과 코덱이 비트를 소비하는 예측 프레임 패치만 유지하며, 균일 프레임 샘플링 대비 시각 토큰을 75% 이상 줄이면서 최대 3.5배의 wall-clock 속도 향상을 얻는다고 보고한다. NVIDIA의 인코더 없는 통합 모델인 PixelUMM은 토크나이저를 완전히 제거한다 — 원시 픽셀의 모든 16×16 패치가 단일 선형 투영을 통해 백본에 도달하며, VAE도 비전 트랜스포머도 어디에도 없다. 하나는 더 강하게 압축한다. 다른 하나는 압축을 아예 거부한다. 그리고 둘 중 하나만이 무엇이든 생성할 수 있다.

그 마지막 차이가 이 조합을 사양 싸움보다 더 흥미롭게 만든다. Mage-VL은 감시자다 — 언제 말할지를 결정하는 선제적 게이트를 갖춘 스트리밍 인식 모델이다. PixelUMM은 그리기도 하는 판독기다. 동일한 가중치가 이미지에 관한 질문에 답하고 텍스트 프롬프트로 새 비디오를 생성한다. 이 둘은 "통합 비전 모델은 무엇이어야 하는가"에 대한 서로 양립할 수 없는 두 답이며, 각 연구소의 수치는 각자의 것이다.

압축이 일어나는 곳

Mage-VL의 전제는 현대판 모라벡의 역설이다: 비전-언어 모델은 어려운 오프라인 추론에는 강하지만 단순한 실시간 인지에는 느리고 연산 자원을 많이 소모한다. 이에 대한 해법은 코덱 정렬이다. 스트림을 균일하게 샘플링된 프레임으로 디코딩한 뒤 고정된 웹 사전학습 ViT에 조밀한 그리드를 밀어 넣는 대신, Mage-VL은 스트림을 앵커(I) 프레임과 예측(P) 프레임으로 분리하고, 모든 앵커 패치를 유지하며, 실제 움직임이나 새로운 세부 정보를 담은 예측 프레임 패치만 유지한다. 인코더인 Mage-ViT는 3D 회전 위치 인코딩을 사용하는 16×16 패치 그리드에서 처음부터 학습되며, 명시적으로 코덱에 구애받지 않는다 — 동일한 인터페이스가 아키텍처 변경이나 재학습 없이 H.264/AVC 또는 HEVC 모션 벡터와 잔차 에너지, 또는 신경망 코덱의 학습된 레이트 맵을 받아들인다.

PixelUMM의 전제는 인코더 자체가 문제라는 것이지, 그 효율성이 문제라는 것이 아니다. 이 논문은 BAGEL 같은 모델이 두 가지 시각 인터페이스 — 의미 특징을 위한 ViT와 재구성 잠재값을 위한 VAE — 를 갖고 있으며, 이로 인해 조건 이미지당 시각적 컨텍스트가 대략 두 배가 되고 비전-언어 사전학습 파이프라인이 두 번째 스트림 중심으로 재구축되어야 한다고 주장한다. PixelUMM은 둘 다 삭제한다. 이미지는 16×16 공간 패치가 되고, 비디오는 4프레임 시공간 튜블릿이 되며, 원시 픽셀은 단일 계층 선형 투영을 통해 디코더 전용 Transformer에 도달한다. 이해는 자기회귀적 텍스트이고, 생성은 픽셀 공간 플로 매칭이다.

• 압축 전략 — Mage-VL: 시간적, 코덱 기반; 앵커는 유지하고 예측 프레임은 희소화합니다. PixelUMM: 없음; 원시 픽셀의 모든 패치를 유지합니다.

• 처음부터 학습되는 것 — Mage-VL: 약 1억 장의 레이블 없는 이미지와 비디오를 사용한 전체 비주얼 스택. PixelUMM: Qwen3-8B 언어 백본 위에 구축된 픽셀 임베더와 디코더.

• 백본 — Mage-VL: Qwen3-4B-Instruct-2507, 유일한 사전학습 구성 요소이며, 2계층 MLP 프로젝터 뒤에 있습니다. PixelUMM: Qwen3-8B, 총 약 15.2B 파라미터.

• 스트리밍 동작 — Mage-VL: 인지 게이트가 각 롤링 윈도우를 평가하고, 응답할 가치가 있는 이벤트가 완료될 때까지 침묵을 유지하다가 그때가 되어서야 전체 모델을 호출합니다. PixelUMM: 스트리밍 모드 없음; 요청은 생성 또는 이해 호출입니다.

A headless-browser capture of the Hugging Face model card for the Microsoft Mage-VL repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

각각이 하는 일과 하지 않는 일

Mage-VL은 이미지 및 비디오 이해와 선제적 스트리밍 게이트를 동시에 제공하는 단일 체크포인트입니다. 동일한 가중치가 오프라인 질문에 답하고 이벤트 기반 해설을 구동합니다. 코덱 프로세서, 뉴럴 코덱 패키지 및 게이트를 함께 제공합니다. 두 번째 릴리스인 microsoft/Mage-ViT는 처음부터 시작하는 사전 학습 단계의 독립형 시각 인코더로, 다른 멀티모달 학습을 위한 드롭인 프런트 엔드로 제공됩니다. Mage-VL이 하지 않는 것은 생성입니다. 읽습니다.

PixelUMM은 텍스트-투-이미지, 96프레임 및 24fps의 텍스트-투-비디오, 그리고 이미지와 비디오를 조건으로 하는 텍스트를 지원합니다. 네 개의 체크포인트를 제공합니다 — S8-F22-R05는 네 가지 작업을 모두 포괄하는 기본값이고, S8-F18-R01은 480p 및 720p에서 더 나은 텍스트-투-비디오를 위해 튜닝되었지만 비디오 이해는 할 수 없으며, 두 개의 중간 단계도 있습니다. 이 모델이 하지 않는 것은 스트리밍, 편집 또는 3D입니다. 실시간 피드를 지켜보다가 무슨 일이 일어나면 말하는 모델이 필요하다면, PixelUMM은 완전히 잘못된 형태이며, 어떤 벤치마크 열도 그 사실을 알려주지 않습니다.

도입 격차는 첫 번째 정직한 신호다

두 릴리스가 똑같이 성숙한 것은 아니며, 다운로드 카운터는 어떤 출시 게시글보다도 이를 더 분명하게 말해준다.

• Mage-VL — 2026년 7월 25일 Apache-2.0 라이선스로 Hugging Face에 공개되었으며, 함께 제공되는 기술 보고서와 arXiv 식별자가 있습니다. 10월 초까지 약 13,800건의 다운로드와 414개의 좋아요를 기록했고, 그 주변으로 소규모 커뮤니티 작업 생태계가 형성되었습니다.

• PixelUMM — 2026년 10월 1일 비상업적 체크포인트 라이선스로 Hugging Face에 공개되었습니다. 이 글을 쓰는 시점에 다운로드 수는 0회, 좋아요 수는 3개였습니다. 공개된 지 며칠 되지 않았습니다.

두 연구소 모두 각자의 출시에 대해 아직 발표가 없다 — Mage-VL은 7월에 그런 발표 없이 출시됐고, PixelUMM은 10월에 그런 발표 없이 출시됐다. 그 대칭성은 실제지만, 그것을 두 모델이 동등한 결과물이라는 뜻으로 읽는다면 실수일 것이다. Mage-VL은 10주 동안 커뮤니티의 관심을 받아왔고, PixelUMM은 며칠밖에 받지 못했다. 연구소 밖에서는 아무도 실행해 보지 않은 모델은 수천 명이 다운로드한 모델과는 다른 문제이며, 이 둘 중 두 번째 범주에 속하는 것은 하나뿐이다.

A generated scoreboard card titled “PixelUMM vs Microsoft Mage-VL — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual tokenizer, backbone, trained from scratch, streaming, generation and licence. Mage-VL's column shows a codec-native sparse token grid, a Qwen3-4B-Instruct-2507 backbone, a Mage-ViT pretrained from scratch on about 100M unlabeled media, proactive streaming with a cognition gate, no generation, and Apache-2.0; PixelUMM's column shows no tokenizer at all, a Qwen3-8B backbone at 15.2B total, pixel embedders and decoders trained on top of it, no streaming mode, text-to-image and text-to-video plus understanding, and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

점수판, 출처와 함께

모든 수치는 각 모델을 개발한 연구소 자체에서 나온 것이다. Mage-VL의 수치는 마이크로소프트의 모델 카드와 기술 보고서에서, PixelUMM의 수치는 자체 프리프린트에서 비롯되었다. 어느 쪽도 독립적으로 재현된 적이 없다.

• 시각 토큰 — Mage-VL: 밀집 프레임 샘플링 대비 75% 이상 감소를 보고. PixelUMM: 감소 없음. 원시 패치가 첫 번째 인코딩을 축소하는 것이 아니라 두 번째 인코딩을 제거한다는 논리이다.

• 실제 소요 시간 기준 속도 — Mage-VL: 동일한 정확도에서 균일 프레임 샘플링보다 최대 3.5배 빠름(마이크로소프트 보고). PixelUMM: 논문에 비교 속도에 관한 주장 없음.

• 인코더 품질 — Mage-VL: Mage-ViT는 약 1억 개의 레이블 없는 미디어를 사용해 256토큰 예산에서 CIFAR-10 99.33%, ImageNet 85.69%를 보고합니다. PixelUMM: 벤치마크할 인코더가 없으므로 이에 상응하는 인코더 벤치마크가 없습니다.

• 비디오 이해 — Mage-VL: 보고된 모든 비디오 및 시간적 그라운딩 벤치마크에서 Qwen3-VL-4B 대비 향상을 보고했으며, QVHighlight에서 +22.5, ActivityNet에서 +17.1을 포함합니다. PixelUMM: MVBench 70.53, 자막 없는 Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.

• 이미지 이해 — Mage-VL: 정적 이미지에서 Qwen3-VL-4B와 동등한 수준, Microsoft 보고 기준. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96.

• 생성 — Mage-VL: 없음. PixelUMM: 프롬프트 재작성기 사용 시 GenEval 종합 0.83, DPG-Bench 85.74, VBench Part 1 품질 84.10.

• 스트리밍 — Mage-VL: SoccerNet 스트리밍에서 보고된 최고 TimVal, F1, ROC-AUC 및 PR-AUC를 바탕으로 한 사전 예방적 이벤트 게이팅. PixelUMM: 미지원.

• 라이선스 — Mage-VL: Apache-2.0, 코드 및 가중치. PixelUMM: Apache-2.0 코드, 체크포인트에는 NVIDIA One-Way Noncommercial License 적용.

두 열은 순위를 매길 만큼 충분히 겹치지 않습니다. Mage-VL은 동일 규모 경쟁 모델을 앞서는 효율적인 인코더를 보고하고, PixelUMM은 15B 모델이 주변의 전문 시스템들과 같은 대역에 속한다고 보고하며, 자체 논문에서 학습 데이터가 다르기 때문에 그 결과로는 “어떤 아키텍처가 더 우수한지 확립할 수 없다”고 분명히 밝힙니다.

실용적 분할

점수가 아니라 작업으로 고르세요. 실시간 비디오 인식 — 스트림을 지켜보다가 무슨 일이 생기면 코멘트를 다는 모니터 — 을 만들고 있고 토큰 비용이 결정적 제약이라면, Mage-VL이 둘 중 이것을 하는 유일한 모델이며, Apache-2.0이고, 4B급 규모라 단일 노드로 서빙할 수 있습니다. 이미지와 비디오를 읽고 또 생성까지 하는 하나의 모델이 필요하다면, PixelUMM이 둘 중 그것을 하는 유일한 모델이지만, 비상업적 라이선스의 연구 산출물이고, 가중치는 숨겨진 인덱스 뒤에 있는 128개의 분산 체크포인트 샤드이며, 텍스트-투-비디오는 기본적으로 Cosmos 가드레일을 적용하고 게이트를 위해 별도의 Python 환경이 필요합니다.

두 기능이 모두 필요한 팀이라면, 오늘날 둘 다 호스팅되지 않더라도 두 개의 직접 통합 대신 하나의 라우팅 계층을 통해 이들에 접근하는 논리는 명확합니다: 단일 키, 0% 마크업으로 전달되는 제공업체 정가, 그리고 새로 공개된 Apache-2.0 모델을 트래픽의 일부 앞에 배치하면서 검증된 모델이 나머지를 담당하게 하는 페일오버 규칙입니다. OrcaRouter는 바로 그런 형태의 문제를 위해 만들어졌습니다 — 그리고 분명히 말하자면, 현재 PixelUMM도 Mage-VL도 라우팅하지 않습니다 따라서 이는 워크플로에 대한 설명이며, 목록이 아닙니다.

무엇이 그것을 해결할까요?

중요한 사건은 두 가지다. 첫째는 Mage-ViT의 인코더 수치나 Mage-VL의 비디오 결과를, 그 결과에 이해관계가 없는 누군가가 독립적으로 다시 실행하는 것이다 — 10주 동안의 다운로드로도 아직 그런 재실행은 하나도 나오지 않았다. 둘째는 PixelUMM의 체크포인트 라이선스에 가해지는 어떤 변경이든이며, 이는 현재 연구용 산출물과 배포 가능한 산출물을 가르는 유일한 사실이다. 둘 중 어느 하나라도 실현되기 전까지, 이 둘에 관해 할 수 있는 유용한 말은 마이크로소프트는 시각 인터페이스를 더 저렴하게 만드는 데 베팅했고 NVIDIA는 그것을 제거하는 데 베팅했다는 것, 그리고 어느 베팅도 그것을 건 연구소 밖의 누구에게도 평가받지 못했다는 것이다.