
North Micro Vision Instruct: Cohere의 조용한 2.4B 문서 VLM, 설명
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 144 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
CohereLabs/North-Micro-Vision-Instruct — 줄여서 'North Micro Vision'이라고 부르는 — 24억 파라미터 규모의 비전-언어 모델로, 소리 소문 없이 출시되었습니다. 가중치는 2026년 8월 10일 Hugging Face에 등장했고, Cohere의 공식 발표는 8월 12일에 이어졌으며, 하루가 지난 지금도 호스팅 API도, 가격표도, 제3자 리더보드 등재도 없습니다. North Micro Vision은 단 한 가지 작업을 위해 만들어졌습니다. 문서를 원본 해상도로 읽는 것 — 캡션 모델이 썸네일을 흘깃 보는 방식이 아니라, 사람이 스캔한 A4 용지를 눈을 가늘게 뜨고 읽는 방식입니다. 그리고 이 모델 카드는 자신이 무엇이 아닌지에 대해 이례적으로 솔직합니다. 도구 호출 없음, 추론 루프 없음, 시스템 프롬프트는 적극 권장되지 않음. 이 글은 지금까지 알려진 사실을 정리한 글이므로, 아래의 모든 수치에는 출처가 표시되어 있습니다. 저장소 자체가 확립한 것, Cohere가 주장했지만 아무도 재현하지 못한 것, 그리고 지금까지 발표된 유일한 제3자 분석이 추가로 밝힌 것까지 말입니다.
Cohere가 실제로 출시한 것
이 섹션의 모든 내용은 저장소에서 직접 읽은 것입니다: config.json, README, 모델 카드. 이들은 Cohere의 주요 출처이며, 모델에 대해 알려진 대부분의 내용에 있어 유일한 출처이기도 합니다.
• 크기 — 총 2.4B 파라미터: 약 400M 비전 인코더와 2B "North Micro LLM" 언어 모델, bfloat16, 약 4.97GB 가중치
• 라이선스 — Apache 2.0, 상업적으로 허용, 가중치 및 토크나이저 공개
• 비전 인코더 — 네이티브 해상도에 맞춰 커스텀 훈련되었으며, SigLIP 2 SO400M에서 초기화됨
• 언어 모델 — Command A+ 아키텍처를 따르는 자체 개발 2B North Micro LLM: 슬라이딩 윈도우 어텐션 레이어 3개와 글로벌 어텐션 레이어 1개의 교차 배치, 그룹 쿼리 어텐션(쿼리 헤드 16개, KV 헤드 8개), 결합 임베딩, 262,144개 토큰 어휘
• 프로젝터 — "DeepStack": 여러 비전 인코더 레이어의 패치 임베딩이 한 번만 앞에 추가되는 대신 초기 언어 레이어에 주입되며, 이를 통해 작은 텍스트와 표 형상이 보존된다.
• 해상도 — 네이티브 해상도 입력, 종횡비 유지, 약 1654 × 2339픽셀까지 (대략 200 DPI의 A4 페이지 한 장)
• 컨텍스트 — 언어 백본의 128K 텍스트 컨텍스트; 8K 검증된 멀티모달 컨텍스트(자세한 내용은 아래)
• 언어 — 11개 지원: 영어, 중국어, 독일어, 프랑스어, 스페인어, 이탈리아어, 포르투갈어, 힌디어, 일본어, 한국어, 아랍어
"Instruct" 접미사가 중요합니다. 이것은 지시 조정된 체크포인트로, 채팅 및 시각 QA 모델이며, 현재 글을 쓰는 시점에서 유일한 체크포인트입니다. 모델 트리에는 이미 11개의 커뮤니티 양자화와 3개의 파인튠이 나열되어 있지만, 다른 이름으로 게시된 별도의 기본 변형은 없습니다.
아키텍처가 한 단락의 가치가 있는 이유
대부분의 2-3B VLM은 이미지를 고정 그리드로 축소해 잔 글씨를 잃는다. North Micro Vision의 선택은 그 반대다. 해상도를 유지하고 토큰을 소비하는 것이다. 비전 인코더는 2D RoPE와 학습된 1D 위치 임베딩을 사용하며, DeepStack 프로젝터는 패치 임베딩을 단일 프리펜드가 아닌 여러 언어 레이어에 주입한다. 이것이 빽빽하게 들어찬 표나 각주가 살아남는 방식이다. 위치 인코딩은 인터리브된 mRoPE 방식이므로 시각 토큰 수가 사전 설정된 상한에 묶이지 않고 이미지 해상도에 비례해 늘어난다.
그 선택이 곧 제품의 전부이며, 거기에는 비용이 따른다. RohitAI의 출시 분석에 따르면 최대 해상도의 기본 A4 페이지는 대략 3,800개의 병합된 시각적 위치에 해당한다. 그 숫자를 아래의 맥락 주의사항과 함께 읽어보라. 3,800개의 시각적 토큰과 프롬프트는 질문을 제기하기도 전에 검증된 멀티모달 창의 상당 부분을 채울 수 있다.
벤치마크 카드, 정직하게 읽기

이 섹션의 모든 수치는 공급업체가 보고한 것입니다. 어떤 것도 독립 연구소에서 재현되지 않았으며, 해당 모델은 아직 공개 리더보드에 등재되지 않았습니다. 문서상으로는 Cohere가 지적하는 부분에서 기록이 확실히 강력합니다:
• DocVQA — 0.921 (문서 시각 질의응답)
• ChartQA — 0.808 (차트 읽기)
• OCRBench — 0.792 (실제 환경의 OCR)
• RefCOCO 그라운딩 — 0.732 평균 P@1 (객체 가리키기)
• MMMU — 0.329 (대학 수준의 멀티모달 지식 — 이 크기에서는 예상대로 취약한 부분)
• IFEval — 0.749 (지시 따르기)
Cohere의 출시 포지셔닝은 North Micro Vision이 "다양한 시각 이해 벤치마크"에서 Gemma 4 E2B와 Ministral 3 3B를 능가한다고 주장하며, 그 강점은 문서 이해와 시각 QA에 집중되어 있습니다. 이는 Cohere가 자사 모델에 대해 내세우는 주장일 뿐이며, 그렇게 받아들여야 합니다. 한 가지 걸림돌은 Cohere가 Liquid 제품군과의 비교에서 3B 체크포인트가 아닌 1.6B 체크포인트를 사용했다는 점입니다. 따라서 두 모델이 동일한 엣지 문서 처리 예산을 두고 경쟁하게 될 것임에도 불구하고, 카드에는 유효한 North와 LFM2.5-VL-3B 간 비교가 존재하지 않습니다.
지금까지 공개된 유일한 제3자 평가 — 실험실 스위트가 아닌 단일 블로거의 실행 — 는 카드가 생략한 그림을 추가한다. 이는 North Micro Vision이 7개 중 5개의 문서, 차트, OCR 항목에서 Ministral 3 3B Instruct를 능가한다고 보고하며, 이는 공급업체의 프레이밍과 일치한다. 하지만 또한 Qwen3.5-2B가 그 7개 중 6개 항목과 공개된 모든 일반 VQA, 추론, 계산, 환각, 텍스트 지식 항목에서 North Micro Vision을 능가한다고 보고한다. 그 세트에서 North Micro Vision이 Qwen3.5-2B를 상대로 유일하게 승리한 것은 AI2D뿐이다. 그리고 English OCRBench v2는 헤드라인 OCRBench 0.792와 대비하여 0.367에 그친다. 이는 OCR 점수가 어떤 분할과 어떤 난이도를 실행하느냐에 크게 좌우된다는 점을 상기시킨다. 한 번의 실행이 판결은 아니지만, 이 규모에서 North Micro Vision의 진짜 경쟁자는 Cohere가 벤치마크 대상으로 선택한 모델들이 아니라 Qwen 3.5 제품군이라는 첫 번째 증거다.
컨텍스트 창 하나, 숫자 둘
카드에는 128K 텍스트 컨텍스트와 8K 검증된 멀티모달 컨텍스트가 명시되어 있으며, 이 둘 사이의 격차는 실제로 중요한 역할을 합니다. 128K 수치는 언어 백본에만 해당합니다. 8K 토큰을 초과하는 이미지-텍스트 프롬프트는 훈련되거나 검증된 적이 없으므로, 그 기준을 넘어서는 모든 것은 외삽(추정)에 불과합니다. 조밀한 A4 페이지 한 장이 약 3,800개의 시각적 위치를 차지하므로, 문서 하나와 짧은 질문만으로도 8K 창에 도달할 수 있습니다. 실질적인 의미는 다음과 같습니다. 전체 페이지를 입력으로 넣고 그에 대한 긴 대화를 기대하기보다는, 파이프라인을 페이지를 영역(테이블, 서명 블록, 단일 인보이스)별로 크롭하는 방식으로 설계하라는 것입니다.
모델 카드가 하지 말라고 알려주는 것
North Micro Vision은 에이전트가 아닌 인식 계층이며, Cohere는 이를 반갑게도 명확히 밝히고 있습니다. 카드에는 이 모델이 추론 모델이 아니며, 수학 및 코드 능력이 제한적이고, 도구 호출이나 에이전트 워크플로우를 지원하지 않으며, 대형 범용 어시스턴트를 대체해서는 안 된다고 명시되어 있습니다. 이는 대부분의 카드보다 한 단계 더 나아가 시스템 프롬프트 사용을 권장하지 않는데, 모델이 시스템 프롬프트로 훈련되지 않았기 때문입니다. 보정된 신뢰도 점수도 없습니다. 여기서 암시하는 설계는 분업입니다: North Micro Vision은 읽고 추출하고, 스키마는 구조를, 규칙은 불변 조건을 담당하며, 더 강력한 모델은 모호한 호출을 처리하고, 인간은 중요한 모든 사항을 승인합니다. 페이지의 텍스트를 정책이 아닌 데이터로 취급하세요 — 문서에 묻혀 있는 스캔된 지시문은 정확히 이 분업이 방어하는 종류의 시각적 프롬프트 인젝션입니다.

오늘 실행하는 방법

퀵스타트는 자체적인 불편함에 대해 솔직합니다. 모델 카드는 Transformers 5.16.0을 요구하는데, 이는 출시 당일 최신 안정 PyPI 릴리스가 아니었으므로 초기 사용자들은 소스에서 설치해야 했습니다. 공개 vLLM 지원은 "곧 제공 예정"으로 표시되어 있으며, Cohere는 내부 vLLM 빌드로 평가했습니다. 그 외 출시 첫날의 생태계 지원은 좋은 편입니다: 엣지 및 GPU 배포를 위한 NVIDIA NeMo AutoModel 레시피, Axolotl QLoRA 및 전체 파인튜닝 레시피, Apple Silicon용 커뮤니티 MLX 양자화가 제공됩니다. 4비트 빌드는 약 2.17GB입니다. 짚어둘 만한 배포 함정이 하나 있습니다: max_pixels를 명시적으로 설정하세요. sequence_len은 이미지 토큰을 제한하지 않으므로, 설정하지 않으면 의도치 않게 검증된 멀티모달 윈도우를 초과할 수 있습니다.
North Micro Vision은 OrcaRouter에 없으며, 자체 카드에 따르면 어떤 추론 제공자에도 없다 — 이것은 셀프 호스팅 이야기이고, 그걸로 끝이다. 이것이 바로 다음 문장에서 라우팅 계층이 중요한 이유다: 어떤 제공자가 이 모델을 위한 엔드포인트를 세우는 순간, 라우터를 통해 나온 지 며칠 안 된 Apache-2.0 모델을 여러분이 프로덕션에서 이미 호출 중인 모델들 옆에 둘 수 있다 — 하나의 API, 새로운 계약 없음, 제공자 공시 가격을 0% 마크업으로 그대로 전달, 그리고 자동 페일오버 덕분에 검증되지 않은 모델이 실제 트래픽을 처리하는 동안 검증된 모델이 그 모델이 놓친 호출을 받아낸다. 그 엔드포인트가 존재할 때까지, 오늘 실제로 실행할 수 있는 비교는 이 체크포인트와 여러분이 이미 비용을 지불하고 있는 호스팅 문서 모델 간의 비교이며, 여러분의 페이지에서 나란히 놓고 보는 것이다.
누가 움직여야 하고, 누가 기다려야 할까요?
한정된 문서 추출 작업(송장, 은행 거래 내역서, 계약서, 정형 양식)이 있고, 호스팅 API가 매력적으로 느껴지지 않게 만드는 데이터 거주성 또는 감사 요구 사항이 있다면 이 모델을 선택하세요. Apache 2.0, 저비용 QLoRA 도메인 적응, 그리고 기본 해상도 인코더는 그러한 작업 부하에 있어 정말 이례적인 조합이며, 모델 카드의 한계가 충분히 명확해서 예상치 못한 일은 없을 것입니다. 호스팅 엔드포인트, 토큰별 과금, 또는 에이전트 동작이 필요하다면 기다리세요. 그런 것들 중 어느 것도 아직 존재하지 않습니다. 그리고 위의 어떤 벤치마크도 확정된 것으로 받아들이기 전에 기다리세요. 모든 주요 수치는 Cohere의 것이며, 유일한 외부 실행은 소형 모델 클래스 최상위에서 더 논쟁적인 그림을 보여줍니다. 게다가 이 모델은 출시된 지 1주일도 안 되었습니다. 주목할 점은 서빙 스토리입니다. 기본 Transformers와 공개 vLLM 릴리스가 모두 이 모델을 지원하는 날, North Micro Vision은 씨름해야 하는 저장소가 아니라 문서를 가리키기만 하면 되는 모델이 됩니다.
