
North Micro Vision Instruct: Cichy dokumentowy VLM 2.4B od Cohere — wyjaśnienie
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 144 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
CohereLabs/North-Micro-Vision-Instruct — „North Micro Vision” w skrócie — to model wizyjno-językowy o 2,4 miliarda parametrów, który został wydany po cichu: wagi pojawiły się na Hugging Face 10 sierpnia 2026 roku, ogłoszenie Cohere nastąpiło 12 sierpnia, a dzień później wciąż nie ma hostowanego API, cennika ani wpisu w zewnętrznych rankingach. North Micro Vision jest zbudowany do jednego zadania — czytania dokumentów w natywnej rozdzielczości, tak jak człowiek mruży oczy na skan strony A4, a nie jak model podpisujący obrazki spogląda na miniaturkę — a jego karta modelu jest niezwykle bezpośrednia co do tego, czym nie jest: brak wywoływania narzędzi, brak pętli rozumowania, aktywne odradzanie promptów systemowych. To materiał typu „co wiemy do tej pory”, więc każda liczba poniżej jest opisana: co ustala samo repozytorium, co twierdzi Cohere, ale nikt tego nie powtórzył, oraz co wnosi jedyna dotychczas opublikowana zewnętrzna analiza.
Co tak naprawdę wydał Cohere
Wszystko w tej sekcji pochodzi bezpośrednio z repozytorium: config.json, README i karty modelu. To główne źródła Cohere, a dla większości tego, co wiadomo o modelu, są to jedyne źródła.
• Rozmiar — łącznie 2,4 mld parametrów: ~400 mln enkoder wizyjny plus 2 mld model językowy „North Micro LLM”, w formacie bfloat16, około 4,97 GB wag
• Licencja — Apache 2.0, permisywna komercyjnie, otwarte wagi i tokenizer
• Enkoder wizyjny — specjalnie trenowany dla natywnej rozdzielczości, inicjalizowany z SigLIP 2 SO400M
• Model językowy — wewnętrzny model LLM North Micro 2B oparty na architekturze Command A+: trzy warstwy uwagi z przesuwanym oknem przeplatane z jedną globalną warstwą uwagi, uwaga z grupowanymi zapytaniami (16 głowic zapytań na 8 głowic KV), wspólne embeddingi, słownik o rozmiarze 262 144 tokenów
• Projektor — „DeepStack": embeddingi fragmentów z kilku warstw kodera wizyjnego są wstrzykiwane do wczesnych warstw językowych, zamiast być dołączane jednorazowo na początku, dzięki czemu mały tekst i geometria tabel zostają zachowane.
• Rozdzielczość — wejście w natywnej rozdzielczości z zachowaniem proporcji, do około 1654 × 2339 pikseli, co odpowiada jednej stronie A4 przy około 200 DPI.
• Kontekst — 128K kontekstu tekstowego w rdzeniu językowym; 8K zweryfikowanego kontekstu multimodalnego (szczegóły poniżej)
• Języki — 11 obsługiwanych: angielski, chiński, niemiecki, francuski, hiszpański, włoski, portugalski, hindi, japoński, koreański, arabski
Sufiks „Instruct" ma znaczenie. To punkt kontrolny dostrojony do instrukcji — model czatu i wizualnego QA — i w chwili pisania tego tekstu jest to jedyny taki punkt kontrolny. Drzewo modeli już wymienia jedenaście kwantyzacji społecznościowych i trzy dostrojenia, ale nie opublikowano żadnego osobnego wariantu bazowego pod inną nazwą.
Dlaczego architektura zasługuje na akapit
Większość modeli wizyjno-językowych (VLM) o rozmiarze 2-3B zmniejsza rozdzielczość obrazu do stałej siatki i traci drobny druk. Zakład North Micro Vision jest odwrotny: zachować rozdzielczość, wydać tokeny. Enkoder wizyjny wykorzystuje 2D RoPE plus wyuczone 1D osadzenia pozycyjne, a projektor DeepStack wprowadza osadzenia fragmentów do wielu warstw językowych, zamiast pojedynczego dołączenia na początku — dzięki temu gęsto upakowana tabela lub przypis przetrwają. Kodowanie pozycyjne jest przeplatane za pomocą mRoPE, więc liczba tokenów wizualnych skaluje się wraz z rozdzielczością obrazu, zamiast być ograniczona z góry ustawionym limitem.
Ten wybór stanowi cały produkt — i ma swoją cenę. Analiza premiery RohitAI szacuje, że natywna strona A4 przy maksymalnej rozdzielczości to około 3800 scalonych pozycji wizualnych. Przeczytaj tę liczbę obok poniższego zastrzeżenia dotyczącego kontekstu: 3800 tokenów wizualnych plus prompt może wypełnić znaczną część zweryfikowanego okna multimodalnego, zanim zadasz pytanie.
Karta benchmarkowa, odczytana uczciwie.

Każdy wynik w tej sekcji pochodzi od producenta. Żaden nie został powtórzony przez niezależne laboratorium, a model nie pojawił się jeszcze na żadnej publicznej liście rankingowej. Na papierze osiągnięcia są naprawdę solidne tam, gdzie wskazuje Cohere:
• DocVQA — 0.921 (wizualne odpowiadanie na pytania dotyczące dokumentów)
• ChartQA — 0.808 (czytanie wykresów)
• OCRBench — 0.792 (OCR w rzeczywistych warunkach)
• RefCOCO grounding — 0,732 średnia P@1 (wskazywanie obiektów)
• MMMU — 0.329 (multimodalna wiedza na poziomie college'u — słaby punkt, jak można było oczekiwać przy tej wielkości)
• IFEval — 0.749 (podążanie za instrukcjami)
Ramy prezentacji Cohere twierdzą, że North Micro Vision przewyższa Gemmę 4 E2B i Ministral 3 3B „w zakresie szeregu benchmarków rozumienia wizualnego”, przy czym główne atuty dotyczą rozumienia dokumentów i wizualnego QA. To twierdzenie Cohere o modelu Cohere — należy je tak traktować. Jedna uwaga: porównanie Cohere z rodziną Liquid wykorzystywało punkt kontrolny 1.6B, a nie 3B, więc w karcie nie ma prawidłowego porównania North vs LFM2.5-VL-3B, mimo że oba modele będą konkurować o ten sam budżet na przetwarzanie dokumentów na krawędzi.
Jedyna opublikowana dotąd zewnętrzna ocena — pojedynczy test przeprowadzony przez jednego blogera, a nie laboratoryjna seria testów — uzupełnia obraz, którego karta modelu nie zawiera. Wynika z niej, że North Micro Vision pokonuje Ministral 3 3B Instruct w pięciu z siedmiu pozycji dotyczących dokumentów, wykresów i OCR, co jest zgodne z narracją producenta. Pokazuje jednak również, że Qwen3.5-2B pokonuje North Micro Vision w sześciu z tych siedmiu pozycji oraz we wszystkich ujawnionych pozycjach dotyczących ogólnego VQA, rozumowania, liczenia, halucynacji i wiedzy tekstowej; jedyne zwycięstwo North Micro Vision nad Qwen3.5-2B w tym zestawie to AI2D. Angielski OCRBench v2 osiąga wynik 0.367 wobec reklamowanego OCRBench 0.792 — co przypomina, że wyniki OCR w dużej mierze zależą od tego, którą wersję testu i poziom trudności wybierzesz. Jeden test to nie werdykt, ale to pierwszy dowód na to, że prawdziwym konkurentem North Micro Vision w tej skali jest rodzina Qwen 3.5, a nie modele, które Cohere wybrało do porównania.
Jedno okno kontekstu, dwie liczby
Karta specyfikacji podaje 128K kontekstu tekstowego i 8K zwalidowanego kontekstu multimodalnego, a luka między nimi wykonuje prawdziwą pracę. Liczba 128K dotyczy wyłącznie rdzenia językowego; prompty łączące obraz i tekst powyżej 8K tokenów nigdy nie były trenowane ani walidowane, więc wszystko za tą linią to ekstrapolacja. Gęsta strona A4 pochłania około 3800 pozycji wizualnych, więc do okna 8K można trafić z jednym dokumentem i krótkim pytaniem. Praktyczny wniosek: zaprojektuj swój potok przetwarzania wokół przycinania stron do regionów — tabeli, bloku podpisu, pojedynczej faktury — zamiast podawać całe strony i oczekiwać długiej wymiany zdań na ich temat.
Czego karta modelu mówi, żeby nie robić
{{1}}North Micro Vision{{/1}} to warstwa percepcji, a nie agent, a {{2}}Cohere{{/2}} mówi o tym z odświeżającą bezpośredniością. Karta mówi, że nie jest to model rozumujący, ma ograniczone umiejętności matematyczne i programistyczne, nie obsługuje wywoływania narzędzi ani przepływów agentowych i nie powinien zastępować większego asystenta ogólnego. {{3}}Idzie o krok dalej niż większość kart: odradza stosowanie promptów systemowych, ponieważ model nie był na nich trenowany.{{/3}} Nie ma też skalibrowanych wyników pewności. {{4}}Wynikający z tego projekt to podział:{{/4}} North Micro Vision czyta i wyodrębnia, schemat odpowiada za strukturę, reguły za niezmienniki, silniejszy model zajmuje się niejednoznacznymi przypadkami, a człowiek zatwierdza wszystko, co ma istotne konsekwencje. {{5}}Traktuj tekst na stronie jako dane, nigdy jako zasady{{/5}} — zeskanowana instrukcja ukryta w dokumencie jest dokładnie tym rodzajem wizualnego prompt injection, przed którym chroni ten podział.

Jak to uruchomić dzisiaj

Przewodnik szybkiego startu jest uczciwy co do własnych niedogodności: karta modelu wymaga Transformers 5.16.0, które nie było najnowszą stabilną wersją na PyPI w dniu premiery, więc pierwsi użytkownicy muszą instalować ze źródeł. Publiczne wsparcie vLLM jest oznaczone jako „wkrótce”; Cohere przeprowadziło ewaluację przy użyciu wewnętrznej kompilacji vLLM. Poza tym wsparcie ekosystemu od pierwszego dnia jest dobre: przepisy NVIDIA NeMo AutoModel na wdrożenia brzegowe i GPU, przepisy Axolotl QLoRA i pełnego fine-tuningu oraz społecznościowe kwantyzacje MLX dla Apple Silicon — wersja 4-bitowa waży około 2,17 GB. Warto wymienić jedną pułapkę wdrożeniową: ustaw max_pixels jawnie, ponieważ sequence_len nie ogranicza tokenów obrazu, a bez tego można niechcący przekroczyć walidowane okno multimodalne.
North Micro Vision nie jest na OrcaRouter i zgodnie z własną kartą nie jest u żadnego dostawcy inferencji — to historia self-hostingu, koniec kropka. I właśnie dlatego warstwa routingu ma znaczenie w następnym zdaniu: w momencie, gdy jakikolwiek dostawca uruchomi dla niego endpoint, router pozwala umieścić model Apache-2.0 sprzed kilku dni obok tych, do których już wywołujesz w produkcji — jedno API, bez nowej umowy, cena listowa dostawcy przekazana dalej z 0% marżą i automatyczny failover, dzięki któremu nieprzetestowany model może przyjmować prawdziwy ruch, podczas gdy sprawdzony przechwytuje wywołania, które tamten pogubi. Dopóki ten endpoint nie istnieje, porównanie, które faktycznie możesz uruchomić dziś, to porównanie między tym checkpointem a hostowanymi modelami dokumentów, za które już płacisz, obok siebie na własnych stronach.
Kto powinien się ruszyć, a kto powinien czekać
Wybierz, jeśli masz ograniczone zadanie ekstrakcji dokumentów — faktury, wyciągi bankowe, umowy, ustrukturyzowane formularze — a wymogi dotyczące rezydencji danych lub audytu sprawiają, że hostowane API jest nieatrakcyjne. Apache 2.0, tania adaptacja dziedzinowa QLoRA i enkoder pracujący w natywnej rozdzielczości to naprawdę nietypowe połączenie dla takiego obciążenia, a ograniczenia karty modelu są na tyle jasne, że nic Cię nie zaskoczy. Poczekaj, jeśli potrzebujesz hostowanego punktu końcowego, cen za token lub zachowania agentowego — nic z tego jeszcze nie istnieje. I poczekaj, zanim potraktujesz którykolwiek z powyższych benchmarków jako rozstrzygnięty: wszystkie liczby w nagłówkach pochodzą od Cohere, jedyne zewnętrzne uruchomienie pokazuje bardziej sporny obraz w czołówce klasy małych modeli, a model ukazał się niespełna tydzień temu. Warto obserwować kwestię serwowania — w dniu, w którym zarówno standardowe Transformers, jak i publiczne wydanie vLLM będą go obsługiwać, North Micro Vision przestaje być repozytorium, z którym trzeba się zmagać, a staje się modelem, który można po prostu skierować na swoje dokumenty.
