
InternLumina-U2 대 North Micro Vision Instruct: 오늘 실행할 수 있는 문서 리더 대 아직 준비되지 않은 16B 모델
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
이번 주에 문서, 스크린샷, 차트를 읽을 수 있는 모델이 필요하다면, 이 비교 글에는 짧고 실용적인 답이 있습니다. North Micro Vision Instruct는 Cohere가 Apache-2.0 라이선스로 공개한 24억 파라미터의 오픈 가중치 모델로, 2026년 8월 10일부터 다운로드할 수 있으며, 문서 작업에서 충분히 좋은 성능을 보여 오늘 바로 자신의 파일에 적용해 볼 만합니다. InternLumina-U2는 상하이 AI 연구소의 160억 파라미터 확산 모델로, 차트·문서 이해를 비롯해 여섯 가지 이상의 작업을 수행한다는 훨씬 야심 찬 설계이지만, 가중치가 공개되지 않았고 Hugging Face 저장소는 빈 껍데기일 뿐이며, 현재 어디에서도 실행할 수 없습니다. 더 긴 답변은 두 개의 Apache-2.0 모델이 문서 판독 기능에 대해 겹치는 주장을 할 때, 그중 하나만 실제로 손에 쥘 수 있는 결과물일 경우 어떤 일이 벌어지는지에 관한 것입니다.
실제로 존재하는 2.4B
North Micro Vision Instruct는 Cohere North 제품군의 비전 전문 모델로, 총 약 24억 개의 파라미터를 지닌 소형 모델이면서 기본 해상도로 이미지를 읽도록 설계되었습니다. 설계의 핵심은 대부분의 비전 모델이 이미지를 고정 그리드로 축소하면서 문서가 담고 있는 미세한 디테일을 잃는 문제에 있습니다. 따라서 North Micro Vision Instruct는 약 200dpi A4 페이지 수준까지 이미지를 기본 해상도 그대로 수용하며, 종횡비와 작은 텍스트를 보존합니다. Cohere가 보고한 수치는 이 크기 등급에서 우수합니다: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 — 모두 Cohere 보고 수치이며 타 기관에 의해 재현되지는 않았습니다. 검증된 멀티모달 컨텍스트는 약 8K 토큰이고, MMMU(0.329)에서의 취약점도 문서화되어 있습니다. 이는 이 모델이 추론 범용 모델이 아니라 읽기 전문 모델임을 상기시켜 줍니다. 자체 호스팅 API나 표준 호스팅 경로가 따로 없으며, 현실적인 활용 방식은 2.4B 모델을 자체 호스팅하는 것입니다. 이 크기는 최신 워크스테이션 GPU 한 대로도 실행할 수 있을 만큼 가볍습니다. 커뮤니티 채택도 꾸준히 이어져, 8월 말 기준 Hugging Face 카드에는 월 수만 건의 다운로드가 표시되고 있었습니다.
약속인 16B
InternLumina-U2는 색다른 종류의 산출물입니다. Shanghai AI Laboratory가 2026년 9월 1일에 공개한 것은 모델이 아니라 추론 코드와 아키텍처입니다. 즉, 완전히 이산적인 8-코드북 시각 표현을 기반으로 구축된 희소 혼합 전문가 확산 LLM으로, 총 16B 파라미터 중 1B만 활성화됩니다. 저장소의 드라이버 스크립트가 다루는 여섯 가지 작업군(텍스트, 이미지 이해, 텍스트-이미지, 이미지 편집, 비디오 이해, 3D 이해) 중 이미지 이해에는 고밀도 차트와 문서가 명시적으로 포함됩니다. 프로젝트 페이지의 예비 표에는 연구소가 해당 전문가가 주장하는 것과 동일한 범위로 보고한 차트 및 문서 수치, 즉 ChartQA 86.52와 CharXiv-DQ 83.65가 나열되어 있으며, HallusionBench 62.15와 MathVision 33.22도 함께 실려 있습니다. 페이지는 이 결과를 "예비적이고 부분적인(preliminary, partial)" 것이라고 부르며, 전체 표가 담길 기술 보고서는 "곧 공개 예정(coming soon)"으로 표시되어 있습니다. 그리고 결정적인 사실은, 누구도 검증할 수 있는 가중치가 없다는 것입니다.
점수판
아래의 모든 수치는 공급업체가 보고한 것입니다. North Micro Vision Instruct의 것은 Cohere 자체 평가이고, InternLumina-U2의 것은 해당 연구소의 예비 부분 표입니다.
• 크기 및 형태 — North Micro Vision Instruct: 약 2.4B 규모의 덴스(dense) 네이티브 해상도 리더. InternLumina-U2: 총 16B/활성 1B 스파스(sparse) MoE 기반의 이산 멀티코드북 확산 모델.
• 기능 — North Micro Vision Instruct: 이미지, 문서, 차트 및 UI 화면을 읽고; 근거를 포함한 텍스트로 답변합니다. InternLumina-U2: 읽기 및 생성 지원 — 이미지/비디오/3D를 이해하고, 이미지를 생성하고 편집합니다.
• 가중치 — North Micro Vision Instruct: 2026년 8월 10일부터 공개됨(CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: 비공개. Hugging Face 스텁이 비어 있고, 가중치는 "곧 공개 예정"으로 표시됨.
• 주요 읽기 점수 — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (Cohere 보고). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (연구실 보고, 예비).
• 문서 컨텍스트 — North Micro Vision Instruct: 네이티브 해상도는 200dpi에서 약 A4 크기까지, 검증된 멀티모달 컨텍스트는 약 8K. InternLumina-U2: 고밀도 차트 및 자연 이미지는 AToken 멀티코드북 인코더를 통해 처리되며, 컨텍스트는 아직 지정되지 않음.
• 알려진 약점 — North Micro Vision Instruct: MMMU 0.329, 도구 호출(tool calling) 없음 — 추론자도 에이전트도 아닌 단순한 읽기 전용 모델. InternLumina-U2: 자체 부분 표(table)에서 GenEval(0.81 vs 0.89) 결과가 이름이 명시된 경쟁사 중 적어도 하나에 뒤처지며, 나머지 모든 것은 검증되지 않음.
• 실행 방법 — North Micro Vision Instruct: 2.4B 모델을 자체 호스팅한다. vLLM 지원은 이 글이 작성되던 당시 아직 도입 중이었다. InternLumina-U2: 아무도 실행할 수 없다 — 가중치가 없고, 공개된 드라이버는 저장소에 없는 체크포인트 디렉터리와 토크나이저 파일을 필요로 한다.

동일한 벤치마크, 매우 다른 두 인식론
ChartQA는 두 주장의 차이를 확인할 수 있는 가장 확실한 방법입니다. 두 모델 모두 ChartQA 수치를 보고하는데, North Micro Vision Instruct는 정확도 분율로 0.808을 보고하고, InternLumina-U2는 백분율로 86.52를 보고합니다. 동일한 벤치마크이며, 서로 다른 스케일에서 80년대 중반에서 후반대 사이의 본질적으로 동일한 결과이지만, 두 모델이 모두 존재하더라도 논문 간 ChartQA 비교를 위험하게 만드는 서로 다른 평가 분할과 프롬프트 설정에 따라 다소 차이가 있을 수 있습니다. 중요한 것은 인식론적 차이입니다. North Micro Vision Instruct의 0.808은 다운로드 가능한 산출물에 연결되어 있으므로, GPU와 차트 세트를 가진 어떤 팀이든 이번 주에 재현하거나 반박할 수 있습니다. InternLumina-U2의 86.52는 로드맵에 연결되어 있습니다. 확인할 수 없는 수치는 기반으로 삼아서는 안 되는 수치입니다. 이는 표에 예비(preliminary)라는 라벨을 붙임으로써 연구소 스스로가 인정하는 입장이기도 합니다.

CohereLabs/North-Micro-Vision-Instruct Hugging Face 카드 — 2026년 8월 27일 캡처 — 2.4B 기본 해상도 비전-언어 설명, Apache-2.0 라이선스, 및 Cohere가 보고한 문서 읽기 벤치마크.
읽기 대 읽기와 그리기
아키텍처 철학의 격차는 벤치마크 격차보다 더 가치가 있다. North Micro Vision Instruct는 좁은 전문가 모델이다. 읽기만 수행하며, GPU 비용을 신경 쓰지 않고도 파이프라인의 모든 페이지, 모든 스크린샷, 모든 인보이스에 실행할 수 있을 만큼 저렴하게 그 한 가지 일을 처리한다. 그 저렴함이 바로 기능이다. 대규모 문서 인텔리전스는 정확성 문제만큼이나 비용 문제이기 때문이다. InternLumina-U2는 정반대의 시도다. 이해와 생성이 서로를 강화한다는 이론 아래, 읽기를 이미지 생성, 이미지 편집, 비디오 이해, 3D 이해와 함께 하나의 공유된 이산 토큰 인터페이스로 통합하려는 거대한 스파스 모델이다. 작동한다면 전혀 다른 급의 도구가 되겠지만, '작동한다면'이라는 전제가 짊어진 짐이 크다. 커스텀 토크나이저와 Blender 렌더링 3D 전처리를 갖춘 16B-A1B 디퓨전 MoE는 2.4B 전문가 모델처럼 저렴한 상시 가동형 리더가 결코 될 수 없다. 이 둘은 사실상 대체재가 아니다. 하나는 오늘 바로 배포할 수 있는 도구이고, 다른 하나는 대비할 수 있는 연구 방향이다.

2026년 9월 2일에 캡처된 InternLM/InternLumina-U2 GitHub 저장소 — "Omni-Visual Understanding, Image Generation and Editing" 설명과 작업별 추론 스크립트가 포함된 저장소 랜딩 페이지; 그중 이미지 이해 경로는 자연 이미지와 복잡한 차트를 대상으로 합니다.
문서 파이프라인을 구축하는 경우 이것이 의미하는 바
두 모델 모두 OrcaRouter에서 호스팅되지 않습니다. North Micro Vision Instruct는 호스팅 API가 없는 자체 호스팅 모델이고, InternLumina-U2는 누구도 호스팅할 수 있는 가중치가 없습니다. 따라서 여기서 라우팅 관점은 "오늘 둘 다 하나의 키로 호출하는 것"이 아닙니다. 그것은 둘 중 하나가 변경되는 날 사용하게 될 패턴입니다. 문서 파이프라인은 거의 항상 저렴한 리더와 더 큰 추론기를 짝지으며, 라우팅 레이어의 가치는 그 짝을 하나의 호출로 표현하고, 실제로 사용하는 호스팅 모델들에 대해 0% 마크업 패스스루를 정직하게 유지하는 데 있습니다. Apache-2.0 체크포인트인 InternLumina-U2가 마침내 등장하면, 현명한 방법은 작동 중인 문서 스택을 뜯어내는 것이 아니라 새 모델을 자동 장애 조치(failover) 뒤의 테스트 경로에 두는 것입니다. 그렇게 하면 새 모델이 프로덕션 트래픽을 견뎌냄으로써 그 트래픽을 얻게 되고, 실제 차트에서 실패하는 순간 호출은 이미 검증된 모델로 폴백됩니다. 200개 이상의 모델을 아우르는 하나의 API가 메커니즘이고, 장애 조치는 안전망이며, 오늘 가동할 수 있는 전문가 모델이 16B 약속이 여전히 지켜지는 동안 비용을 충당해 줍니다.
평결
지금 이 시점의 문서 및 차트 판독에 있어 North Micro Vision Instruct는 둘 중 유일하게 실용적인 의미로 존재하는 모델이다. 작고, Apache-2.0이며, 다운로드 가능하고, 직접 검증할 수 있는 강력한 벤더 보고 점수를 갖추고 있다. InternLumina-U2는 장기적으로 더 흥미로운 산출물인데, 읽기를 하나의 통합 모델 안에서 여섯 가지 기술 중 하나로 만들려고 하기 때문이며, 그것이 성공한다면 '비전 모델'의 의미가 바뀐다. 빈 Hugging Face 리포지토리를 발사 카운트다운을 지켜보듯 주시하라. safetensors 파일이 나타나는 날, 그 약속은 모델이 되고, 비교는 실제 비교가 된다. 그때까지, 차트 벤치마크에서 벤더가 보고한 86.52가 의사결정에서 다운로드 가능한 0.808보다 우위를 차지하지 않도록 하라.
