'InternLumina-U2 vs Microsoft Mage-VL' 비교를 위한 히어로 타이틀 카드로, 부제는 '조용한 두 연구소, 더 똑똑한 비전 토큰을 향한 두 가지 베팅'이다. 세 개의 스탯 칩 — 'InternLumina-U2: 16B-A1B diffusion MoE', 'Microsoft Mage-VL: ~5B codec-native VLM', '둘 다 벤더 보고 기준이며 재현되지 않음' — 이 함께 표시되며, 오른쪽 하단 모서리에는 OrcaRouter 로고가 있다.
Guides & Insights

InternLumina-U2 vs Microsoft Mage-VL: 조용히 비전 토큰의 역할을 키우는 데 베팅하는 두 연구소

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Microsoft Mage-VL과 InternLumina-U2는 모두 연구실이 결과물이 아직 제품인지 확신하지 못할 때 제품을 출시하는 방식으로 공개되었다. 조용히 말이다. Microsoft는 2026년 7월 25일 아무런 발표 없이 Hugging Face에 Mage-VL 가중치와 코드를 게시했고, 상하이 인공지능 연구소의 InternLM 조직도 2026년 9월 1일 아무런 발표 없이 GitHub에 InternLumina-U2 추론 코드를 게시했다. 다섯 주 간격으로, 세계에서 가장 큰 두 연구소가 하나의 조용한 신념을 공유하는 모델을 내놓았다 — 즉, 우리가 시각을 토큰으로 변환하는 방식이 병목이라는 믿음 — 그리고 커뮤니티가 알아차리도록 그대로 남겨두었다. 그중 하나는 오늘 바로 다운로드해서 실행할 수 있다. 다소 불편하게 말이다. 다른 하나는 전혀 실행할 수 없다. 가중치가 아직 존재하지 않기 때문이다. 이것이 두 모델에 대한 정직한 지도이자, "둘 다 공급업체가 보고했고, 둘 다 검증되지 않았다"는 말이 왜 두 모델에게 동일한 문장이 아닌지에 대한 설명이다.

5주, 표현 효율성에 대한 두 가지 베팅

{{1}}그 연결 논리는 수사가 아니라 실제다. {{2}}Mage-VL은 코덱 네이티브 비디오 모델이다. 즉, 스트림을 균일하게 샘플링된 프레임으로 디코딩하고, 조밀한 패치 그리드를 웹에서 사전학습된 고정형 비전 트랜스포머에 통과시키는 대신, 현대 비디오 코덱의 구조를 따라 스트림을 앵커 프레임과 그 사이의 압축된 모션 데이터로 분리하고,{{/2}} 그 간결한 표현을 직접 입력받는다. 마이크로소프트가 보고한 성과는 시각 토큰의 대폭적인 감소와 실질적으로 더 빨라진 스트리밍 인식 경로다. 회사는 이를 비디오 언어 모델에 나타나는 일종의 모라벡 역설, 곧 작은 실시간 인식 작업이 어려운 오프라인 추론만큼의 연산을 요구하는 문제를 해결하는 것으로 규정한다. {{3}}Mage-VL은 관찰자다. 비디오를 효율적으로 소비하고, 자신이 보는 것에 대한 질문에 거의 실시간으로 답한다.{{/3}}{{/1}}

{{1}}InternLumina-U2는 같은 병목 현상을 반대 방향에서 공략하는 승부수다.{{/1}} {{2}}Mage-VL이 코덱을 따라 비디오를 압축한다면,{{/2}} {{3}}InternLumina-U2는 연구팀이 {{4}}AToken{{/4}}이라 부르는 토크나이저를 사용해 각 위치를 하나가 아닌 여덟 개의 상호보완적 이산 코드로 기술함으로써 모든 시각 입력을 압축한다.{{/3}} {{5}}이 승부수의 근거는 단일 코드북이 시각 토큰 하나가 담을 수 있는 정보량을 제한한다는 판단이다.{{/5}} {{6}}따라서 다중 코드북 어휘를 사용하면 160억(16B) 파라미터의 디퓨전 모델 하나가 동일한 인터페이스를 통해 이해와 생성을 모두 해낼 수 있다{{/6}} — {{7}}차트를 읽고, 영상 질문에 답하고, 3D 에셋을 설명하고, 텍스트로 이미지를 생성하며, 지시에 따라 이미지를 편집하는 일{{/7}} — {{8}}별도의 생성 스택 없이도 말이다.{{/8}} {{9}}Mage-VL이 스트림을 저비용으로 인식하고자 한다면,{{/9}} {{10}}InternLumina-U2는 하나의 가중치 집합으로 인식과 그리기를 모두 해내려는 것이다.{{/10}}

점수판

두 모델의 수치는 모두 공급업체가 보고한 것이며 재현되지 않았으므로, 스코어보드는 모든 행에 그 출처를 표시한다.

• 형태 — Mage-VL: Qwen 텍스트 백본을 기반으로 하는 컴팩트한 코덱-네이티브 비전-언어 모델(약 50억 개의 BF16 파라미터)로, 이미지 및 비디오 이해를 위해 학습되었습니다. InternLumina-U2: 활성 파라미터 10억 개를 가진 160억 개 파라미터의 MoE(16B-A1B) 모델로, 이해, 생성 및 편집을 포괄하는 희소 확산 LLM입니다.

• 시각적 표현 — Mage-VL: 비디오 코덱 구조(앵커 및 모션)를 따르는 코덱 네이티브 토큰; 스트리밍 비디오에서 시각적 토큰이 75% 이상 감소했다고 보고됨. InternLumina-U2: AToken 토크나이저에서 나온 완전히 이산적인 8-코드북 토큰.

• 기능 — Mage-VL: 이미지 및 비디오 입력을 보고 텍스트로 답변하며, 스트리밍 인식을 위해 구축되었습니다. InternLumina-U2: 텍스트, 이미지 이해, 텍스트-이미지 생성, 이미지 편집, 비디오 이해 및 3D 이해를 지원한다고 합니다.

• 가중치 — Mage-VL: 2026년 7월 25일부터 Hugging Face에 공개 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: 비공개 — Hugging Face 저장소는 빈 스텁이며, 가중치는 "곧 공개 예정"으로 표시됨.

• 주요 수치 — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, 모두 Microsoft 보고 수치. InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81, 모두 랩 보고 수치로, 예비적이며 부분적인 결과입니다.

• 서빙 현실 — Mage-VL: 다운로드는 가능하지만 표준 vLLM 또는 SGLang 경로가 존재하지 않는다. 코드는 trust_remote_code를 요구하며, 현재 어떤 추론 제공업체도 이를 배포하지 않는다. InternLumina-U2: 누구도 서빙할 수 없다. 가중치가 공개되어 있지 않으며, 공개된 추론 드라이버조차 저장소에 없는 체크포인트 파일을 요구한다.

A comparison scoreboard for InternLumina-U2 and Microsoft Mage-VL: InternLumina-U2 with Shape 16B-A1B sparse MoE, Visual rep. 8-codebook discrete (AToken), Weights not public 'coming soon', Job understand/generate/edit, Headline ChartQA 86.5 GenEval 0.81, Serving none — weights absent; Microsoft Mage-VL with Shape ~5B codec-native VLM, Visual rep. codec-native stream tokens, Weights public since Jul 25 2026, Job watch video answer in text, Headline Video-MME 64.0 (reported), Serving trust_remote_code DIY, with a footer noting both sets of figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

"사용 가능하지만 어색함"은 "사용 불가능"과 같지 않다.

실제로 무언가를 만들어 보려 한다면 가장 중요한 차이는 바로 이것이다. Mage-VL은 무엇보다 중요한 방식에서 실재한다. 가중치는 Hugging Face에 있고, 모델 카드는 7월 말 이후 다운로드 트래픽이 많았으며, 그 주변에는 커뮤니티 양자화(community quantization)의 작은 생태계가 형성되었다. '실재한다'는 것이 '쉽다'는 뜻은 아니다. 모델 카드에는 custom-code 태그가 표시되어 있고, 비주얼 인코더는 기존 서빙 스택이 전제하는 표준 frozen ViT가 아니며, Microsoft 자체 저장소도 그 실질적 결과를 보여 준다. 실행한다는 것은 trust_remote_code를 의미하고 턴키 방식의 프로바이더 배포가 없다는 뜻이다. 그러나 GPU를 갖춘 결단력 있는 팀이라면 이를 로드해서 비디오 스트림에 적용하고, 코덱-네이티브(codec-native) 테제가 자신들의 데이터에서도 유효한지 확인할 수 있다. 이것은 InternLumina-U2와는 엄청난 차이다. InternLumina-U2에서는 같은 문장이 다르게 끝난다. 결단력 있는 팀은 추론 코드를 읽을 수 있지만, 로드할 가중치가 없으므로 거기서 끝난다.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the multi-codebook diffusion description, and the per-task inference scripts that make up the public release.

2026년 8월 27일에 캡처된 microsoft/Mage-VL Hugging Face 카드 — 코덱 네이티브 스트리밍 설명, Apache-2.0 라이선스, arxiv 태그, 그리고 현재 어떤 제공업체도 모델을 배포하지 않음을 보여주는 추론 제공업체 섹션.

벤치마크 비대칭성도 같은 맥락을 따른다. 두 모델의 수치는 모두 독립적인 재실행 없이 제공된 벤더 측 주장일 뿐이다. 그러나 Mage-VL의 주장은 적어도 다운로드 가능한 산출물 위에 기반을 두고 있어, 주장과 검증 사이의 간극은 누군가 그것을 실행하기만 하면 되는 문제다. InternLumina-U2의 주장은 로드맵 항목 위에 놓여 있다 — "전체 비교표는 곧 공개될 기술 보고서에 포함될 예정" — 그리고 이를 검증할 수 있는 산출물은 존재하지 않는다. 해당 연구소가 공개한 부분 표(table)에서조차 이 모델이 능가한다고 주장하는 경쟁사 최소 한 곳(GenEval 0.81 대 LLaDA2.0-Uni의 0.89)에 뒤처지는 모습이 드러나는데, 이는 "예비적이고 부분적인"이라는 라벨을 문자 그대로 읽어야 한다는 유용한 상기점이다.

그들이 경쟁하는 대신 창작할 수 있는 곳

이 둘을 해석하는 가장 유용한 방법은 같은 역할을 두고 다투는 라이벌로 보는 것이 아니라, 사다리의 인접한 가로대로 보는 것이다. Mage-VL과 같은 코덱-네이티브 감시자가 흥미로운 이유는 정확히 그것이 연속 가동하기에 충분히 저렴하기 때문이다. 즉 스트림의 모든 프레임을 살피다가 더 큰 모델의 주의를 끌 만한 무언가가 나타날 때만 에스컬레이션하는 존재다. 그것이 에스컬레이션하는 더 큰 모델은 원칙적으로 InternLumina-U2가 자신이라고 주장하는 종류의 통합 모델일 수 있다. 무엇을 볼지 정하는 항상 켜진 게이트이자, 실제로 차트를 읽고, 3D 장면을 따라가고, 편집된 이미지를 만들어 내는 심층 모델 말이다. 둘 다 입증되지 않았다. Mage-VL은 입증되지는 않았지만 돌릴 수 있고, InternLumina-U2는 입증도 되지 않았고 공개도 되지 않았다. 그러므로 정직한 표현은 양쪽이 각각 독립적으로 검증된 뒤에 구성할 수 있는 조합이지, 오늘 당장 실행할 수 있는 일대일 대결이 아니다.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026), showing the codec-native streaming description, the Apache-2.0 license, the arxiv tag, and an inference-provider section showing no provider currently deploys the model.

2026년 9월 2일에 캡처된 InternLM/InternLumina-U2 GitHub 저장소 — 저장소 랜딩 페이지에는 멀티 코드북 확산 설명, Apache-2.0 라이선스 배지, 그리고 공개 릴리즈를 구성하는 추론 진입점 스크립트가 표시되며, 가중치는 트리에 포함되지 않습니다.

라우팅 계층이 검증되지 않은 체크포인트로 하는 일

이 두 모델 모두 OrcaRouter에서 호스팅되지 않으며, 우리가 그렇지 않다고 암시하지도 않을 것입니다. Mage-VL에는 어디에도 표준 서빙 경로가 없고, InternLumina-U2에는 가중치가 공개되어 있지 않습니다. 이런 상황에서 라우팅 DSL이 진정으로 유용한 점은, 위 구성을 맞춤형 접착 코드 대신 하나의 호출로 표현할 수 있다는 데 있습니다. 즉, 항상 작동하는 저비용 지각 모델이 더 깊은 모델에 입력을 공급하고, 저비용 모델이 무언가 변했다고 판단할 때만 고비용 모델이 실행되도록 사슬처럼 연결하는 것입니다. 그리고 검증되지 않은 체크포인트 문제 — 두 모델의 리스크 프로필 전부이기도 한 문제 — 에서 자동 장애 조치는 팀이 운영 경로를 그 모델에 걸지 않고도 Mage-VL 같은 모델을 실제 경로로 시험해볼 수 있게 해주는 메커니즘입니다. 새 체크포인트가 처음으로 멈추거나, 쓰레기 값을 반환하거나, 예외를 던지면 호출은 검증된 모델로 폴백되고, 스위치를 켜기 위해 엔지니어가 잠에서 깨어나야 할 일도 없습니다. 200개 이상의 모델을 아우르는 단일 API, 0% 마크업으로 전달되는 공급업체 목록 가격, 그리고 프로덕션 앞이 아닌 안전망 뒤에서 오디션을 치르는 새 모델.

요점

오늘 코덱-네이티브 비디오 논제를 시험해 보고 싶다면, 존재하는 것은 Mage-VL뿐이다. 그리고 그 '존재한다'라는 표현에는 커스텀 코드와 DIY 서빙에 관한 단서가 따라붙는다. 멀티-코드북 통합 모델 논제를 시험해 보고 싶다면, 지금은 불가능하다. InternLumina-U2는 아직 가중치가 실리기를 기다리는 사양일 뿐이기 때문이다. 지금 할 수 있는 일은 아키텍처를 읽어 두는 것, 그래서 Hugging Face의 스텁이 채워지는 순간 바로 대비가 되어 있는 것이다. Microsoft의 모델은 어색하지만 실제하는 산출물로 취급하고, Shanghai AI Lab의 모델은 문서화가 잘 된 약속으로 취급하라. 그리고 이 대결 구도에서 '벤더가 보고했지만 재현되지 않음'이 양쪽 모두에 해당한다는 점을 기억하라. 다만 그 말은 직접 다운로드할 수 있는 파일이 존재할 때는 다른 의미를 지닌다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube