OrcaRouter 하우스 스타일로 생성된 타이틀 카드에는 “PixelUMM vs North Micro Vision Instruct”라고 적혀 있으며, 네 개의 통계 타일이 있습니다: “2.4B”(North Micro Vision Instruct의 총 파라미터), “~180k”(10월 초까지의 Hugging Face 다운로드 수), “0.921 / 90.42”(PixelUMM의 백분율에 대비한 정확도 분수로 나타낸 DocVQA) 그리고 “Apache-2.0”(PixelUMM의 비상업적 체크포인트에 대비한 코드 및 가중치 라이선스). 하단 라인에는 “공급업체 보고 수치; 어느 모델도 독립적으로 재실행되지 않음.”이라고 쓰여 있습니다. OrcaRouter 로고는 오른쪽 하단의 패딩된 스트립에 합성되어 있습니다.
Guides & Insights

PixelUMM vs North Micro Vision Instruct: 출시할 수 있는 2.4B 리더에 맞서는 비상업적 연구 모델

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

을 놓고 North Micro Vision Instruct과 PixelUMM나란히 보면 크기 차이는 거의 방해가 될 정도입니다: Cohere의 네이티브 해상도 리더는 24억 개 매개변수, NVIDIA의 통합 모델은 152억 개 매개변수입니다. 흥미로운 축은 인코더입니다. North Micro Vision Instruct는 전통적인 방식으로 구축되었습니다 — SigLIP 2 SO400M에서 초기화된 4억 개 규모의 비전 인코더가 20억 개 규모의 언어 모델에 입력을 공급하며, 262,144개 토큰 어휘로 감싸여 Apache-2.0에 따라 배포됩니다. PixelUMM은 바로 이 구성이 병목이라는 주장 위에 세워졌으며, 인코더를 삭제합니다: 원시 16×16 픽셀 패치가 단일 계층 선형 투영을 통해 Qwen3-8B 백본으로 들어가고, 동일한 가중치가 영상을 생성할 뿐만 아니라 그것에 관한 질문에도 답합니다. 하나는 오늘 다운로드해 배포할 수 있는 특화된 읽기 기기입니다. 다른 하나는 다운로드 링크와 제품에 쓰지 못하게 막는 라이선스가 붙은 연구 논문입니다.

아래 두 모델의 수치는 각자의 연구소에서 나온 것입니다. 어느 쪽도 독립적으로 재현된 적이 없고, 두 곳은 서로 다른 벤치마크 세트를 공개하기 때문에 겹치는 부분은 보기보다 좁습니다.

지루한 아키텍처를 옹호하는 이유

North Micro Vision Instruct는 2026년 8월 10일 Hugging Face에 공개되어 사용자를 모을 8주가 있었고, 10월 초에는 다운로드 약 180,000건과 좋아요 150개를 기록하고 있었다 — 며칠밖에 안 된 PixelUMM의 저장소보다 약 10배 더 많은 주목을 받은 것이다. 이 모델이 내세우는 점은 구체적이고 화려함과는 거리가 멀다. 대부분의 비전 모델은 이미지를 고정된 그리드로 축소해 문서가 기대는 미세한 디테일을 잃어버리지만, 이 모델은 이미지를 원래 해상도로 처리해 종횡비와 작은 텍스트를 보존한다.

• 파라미터 — 총 2.4B: 2B 언어 모델에 SigLIP 2 SO400M을 기반으로 커스텀 학습한 400M 비전 인코더.

• 컨텍스트 — 128K 토큰 언어 백본이지만, 검증된 멀티모달 작동 범위는 약 8K 토큰입니다. 카드에는 더 긴 멀티모달 컨텍스트가 외삽에 의존하며 벤치마크되지 않았다고 명시되어 있습니다.

• 입력과 출력 — 텍스트와 이미지가 뒤섞여 들어가고, 텍스트가 나옵니다. 11개 이상의 언어를 아우르는 다국어 지원. 어떠한 종류의 생성도 하지 않습니다.

• 보고된 점수 — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, 모두 Cohere가 보고한 수치이며 재현되지 않음. MMMU 0.329, 카드가 숨기지 않은 사실: 이것은 추론 범용 모델이 아니라 판독 전문 모델이다.

• 배포 — Transformers 5.16.0과 가속기, bfloat16으로 2.4B를 처리하는 최신 단일 GPU, Flash Attention 2는 필수가 아닌 선택 사항.

그 설계에는 참신한 점이 전혀 없다. 그것은 또한 이번 주에 바로 내려받아 미세 조정하고 실제 문서 앞에 투입할 수 있는 이유이기도 하다.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

반대편에서 제시한 반대 논거

PixelUMM의 프리프린트는 그 아키텍처의 비용을 명시하며 시작한다. 동결된 웹 사전학습 비전 트랜스포머는 이해를 위한 의미 특징을 제공하고, 별도의 VAE는 생성을 위한 재구성 지향 잠재 표현을 제공한다. 둘 모두를 함께 사용하면 조건화 이미지당 시각적 컨텍스트가 대략 두 배로 늘어나고, 비전-언어 사전학습 파이프라인을 두 번째 스트림을 중심으로 재구축하도록 강제한다. North Micro Vision Instruct는 두 번째 작업을 완전히 거부함으로써만 그 두 배화를 피한다 — 생성하지 않으므로 두 개가 아니라 하나의 인터페이스가 필요하다.

PixelUMM은 그 논지를 끝까지 밀어붙인다. 인코더도, VAE도, 토크나이저도 없다: 이미지에는 16×16 픽셀 패치, 비디오에는 4프레임 시공간 튜블릿을 사용하며, 둘 다 단일 계층 선형 투영을 통해 디코더 전용 Transformer에 도달하고, 이해는 자기회귀 텍스트로, 생성은 픽셀 공간 흐름 매칭으로 수행한다. 이 논문의 여덟 개 실증 섹션은 리더보드 승리가 아니라 설계 선택에 대한 연구다 — 패치 크기, 패치 아티팩트, 픽셀 공간 대 VAE 공간의 학습 역학, 컴퓨트 스케일링 — 즉 이는 그 패러다임이 유지되는지를 묻는 논문이지, 이미 승리했다고 주장하는 논문이 아니다.

• 비전 경로 — North Micro Vision Instruct: 네이티브 해상도에서 400M 사전 학습된 비전 인코더. PixelUMM: 인코더 없음; 선형 투영을 거치는 원시 패치.

• 할 수 있는 기능 — North Micro Vision Instruct: 이미지와 문서를 읽고, 텍스트로 답변하며, 그라운딩 및 캡션을 수행합니다. PixelUMM: 이미지와 동영상을 읽고, 텍스트로부터 이미지와 4초 길이의 동영상을 생성합니다.

• 규모 — Qwen3-8B 백본 기준 dense 2.4B 대 전체 약 15.2B이며, 논문 자체 표에서는 "8B MoT"로 표기됩니다.

• 라이선스 — 코드와 가중치에 Apache-2.0을 적용하는 경우와, 코드에는 Apache-2.0을 적용하고 체크포인트에는 NVIDIA One-Way Noncommercial License를 적용하는 경우의 비교.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

두 점수판을 솔직하게 읽기

두 모델은 서로 다른 벤치마크를 발표하며, 두 벤치마크가 겹치는 부분에서는 척도가 다릅니다.

• DocVQA — North Micro Vision Instruct는 정확도 분수로 0.921. PixelUMM은 백분율로 90.42. 같은 벤치마크 이름이지만 분할과 프롬프트 설정이 다르고, 둘 중 하나만 네이티브 해상도 처리를 그 이유로 내세운다.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. 원시 문자열을 서로 비교하는 걸 멈추면 다시 한번 대략 같은 구간에 들어옵니다.

• OCRBench — North Micro Vision Instruct 0.792. PixelUMM 78.00.

• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. 둘 다 대형 비전-언어 모델 기준으로는 낮은 수치이며, 두 연구소 모두 이를 꾸밈없이 그대로 보고한다.

• PixelUMM-only — 프롬프트 재작성기를 사용한 MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83, VBench 파트 1 품질 84.10.

• North Micro Vision Instruct-only — 그라운딩, 캡셔닝, 다중 이미지 작업; 도구 호출의 문서화된 부재와 에이전트 동작의 명시적 배제.

이 중첩에서 눈에 띄는 점은 문서 및 차트 읽기에서 2.4B 전문 모델이 15.2B 범용 모델에 얼마나 근접하는가이다. 그것은 인코더 없는 접근법이 실패한다는 증거가 아니다 — 문서 읽기가 컴팩트한 네이티브 해상도 인코더에 매우 잘 맞는 작업이며, PixelUMM의 아키텍처는 다른 논점을 겨냥하고 있다는 증거다. PixelUMM의 논문 자체도 인용할 만한 한 문장에서 이 점을 인정한다: 모델마다 학습 데이터가 다르기 때문에, 그 결과는 "어떤 아키텍처가 더 우수한지 확립할 수 없다".

결정이 실제로 내려지는 곳

문서, 차트, 양식 또는 스크린샷이 있고 이번 달에 답이 필요하다면, North Micro Vision Instruct는 실용적인 선택이며 이견의 여지가 없다: Apache-2.0, 2.4B, 표준 Transformers 로드 경로, 가드레일 환경 없음, 분산 체크포인트 인덱스 없음, 두 번째 Python 스택 없음. 자체 문서 분포에 맞춰 미세 조정하면 전문가 모델을 갖게 된다. 단, 주의할 점은 범위다 — 추론 작업에 겨냥하면 MMMU 수치가 당신을 찾아올 것이다.

PixelUMM이 내세우는 것은 범위의 넓이와 하나의 연구 질문이다. 하나의 가중치 세트로 이미지와 비디오를 읽고 생성하며, 훨씬 더 흥미로운 읽을거리다. 그러나 체크포인트는 비상업적 라이선스 아래에 있고, 가중치는 약 30GB에 달하는 숨겨진 메타데이터 인덱스 뒤에 있는 128개의 분산 체크포인트 샤드로 되어 있으며, 소스에서 컴파일한 FlashAttention이 포함된 CUDA 13 툴킷을 요구하고, 텍스트-투-비디오 경로는 게이트된 저장소와 별도 환경을 필요로 하는 Cosmos 가드레일을 실행한다. 그것은 배포가 아니라 실험실 벤치다.

라우팅이라는 측면은 나중에 나옵니다, 아예 나오지 않는다면 모르겠지만요. 현재로서는 두 모델 모두 어떤 호스팅 API로도 이용할 수 없으며 — OrcaRouter는 둘 다 라우팅하지 않습니다 — 라이선스가 허용하기 전까지는 앞으로도 그럴 것입니다. North Micro Vision Instruct 같은 모델이 공유 엔드포인트 뒤에 등장하게 되면, 직접 통합보다 그것을 선호할 이유는 흔한 것들입니다. 200개 이상의 모델에 걸친 하나의 키, 제공업체 정가를 0% 마크업으로 그대로 전달하는 것, 모델 카드에 명시된 성능에 미치지 못하는 모델을 강등하는 페일오버, 그리고 대체 모델을 A/B 테스트하고 싶을 때 협상할 두 번째 계약이 없다는 점입니다. 이것은 워크플로에 대한 설명이지, 이용 가능성에 대한 주장이 아닙니다.

그들을 구분할 단 하나의 시험

동일한 문서 세트에서 동일한 해상도로 두 모델을 모두 실행하고 작은 텍스트 사례를 채점한 다음, 변수 하나를 바꿔 보세요. PixelUMM에 네이티브 해상도 입력을 공급하여 비교에서 비전 인코더를 제거하는 것입니다. 인코더 없는 모델이 훨씬 적은 파라미터 비용으로 밀집 텍스트에서도 견딘다면, 그것은 이 논지에 대해 가능한 가장 강력한 증거입니다. 그리고 두 체크포인트 모두 다운로드되므로, 여분의 그래픽 카드가 있는 사람이라면 누구나 실행할 수 있는 테스트입니다. 누군가 그렇게 하기 전까지는 실용적인 요약이 유효합니다. 배포할 것은 소형 Apache-2.0 리더이고, 연구할 것은 대형 비상업적 범용 모델입니다.