כרטיס כותרת עבור North Micro Vision Instruct, שעליו כתוב 'North Micro Vision Instruct', עם כותרת משנה 'Cohere's 2.4B Apache-2.0 document VLM' ותגית שמציינת שהוא שוחרר ב-12 באוגוסט 2026, מעל שלוש אייקוני קו לסריקת מסמכים, קריאת תרשימים ועיגון תיבות תיחום.
Guides & Insights

North Micro Vision Instruct: מודל ה-VLM השקט של Cohere למסמכים (2.4B), מוסבר

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

CohereLabs/North-Micro-Vision-Instruct — "North Micro Vision" בקיצור — הוא מודל ראייה-שפה עם 2.4 מיליארד פרמטרים שהושק בשקט: המשקולות הופיעו ב-Hugging Face ב-10 באוגוסט 2026, ההכרזה של Cohere הגיעה ב-12 באוגוסט, ויום אחר כך עדיין אין API מתארח, אין רשימת מחירים, ואין רשומה בלוח תוצאות של צד שלישי. North Micro Vision בנוי למשימה אחת — קריאת מסמכים ברזולוציה מקורית, כמו שאדם פוזל לעבר עמוד A4 מסורק, ולא כמו שמודל כיתוב מביט בתמונה ממוזערת — וכרטיס המודל שלו ישיר באופן יוצא דופן לגבי מה שהוא לא: אין קריאות לכלים, אין לולאת חשיבה, והנחיות מערכת לא מומלצות במפורש. זהו מאמר "מה שאנחנו יודעים עד כה", ולכן כל נתון להלן מסומן: מה שהמאגר עצמו קובע, מה ש-Cohere טוענת אבל איש לא שחזר, ומה שהוסיפה הבדיקה היחידה של צד שלישי שפורסמה עד כה.

מה Cohere למעשה השיקה

הכל בחלק זה נקרא ישירות מהמאגר: config.json, ה-README וכרטיס המודל. אלו הם המקורות הראשיים של Cohere, ועבור רוב מה שידוע על המודל הם המקורות היחידים.

• גודל — 2.4B פרמטרים בסך הכול: מקודד ראייה של ~400M בתוספת מודל שפה "North Micro LLM" עם 2B פרמטרים, בפורמט bfloat16, כ-4.97 GB של משקלים

• רישיון — Apache 2.0, מתיר שימוש מסחרי, משקולות וטוקנייזר פתוחים

• מקודד ראייה — אומן בהתאמה אישית לרזולוציה מקורית, אותחל מ־SigLIP 2 SO400M

• מודל שפה — מודל ה-LLM הביתי North Micro בגודל 2B, העוקב אחר ארכיטקטורת Command A+: שלוש שכבות קשב עם חלון נע המשולבות עם שכבת קשב גלובלית אחת, קשב מקובץ-שאילתות (16 ראשי שאילתה על פני 8 ראשי KV), הטמעות קשורות, ואוצר מילים של 262,144 טוקנים.

• פרויקטור — "DeepStack": הטמעות פאצ'ים ממספר שכבות של מקודד הראייה מוזרקות לשכבות שפה מוקדמות במקום להיות מוצמדות פעם אחת בתחילה, וכך שורדים טקסט קטן וגאומטריית טבלאות.

• רזולוציה — קלט ברזולוציה מקורית עם שמירה על יחס גובה-רוחב, עד לכ־1654 × 2339 פיקסלים, שזהו עמוד A4 אחד בכ־200 DPI.

• קונטקסט — 128K קונטקסט טקסט על שדרת השפה; 8K קונטקסט מולטי-מודאלי מאומת (פרטים בהמשך)

• שפות — 11 נתמכות: אנגלית, סינית, גרמנית, צרפתית, ספרדית, איטלקית, פורטוגזית, הינדית, יפנית, קוריאנית, ערבית

הסיומת "Instruct" חשובה. זהו checkpoint מכוונן-הוראות — מודל צ'אט ו-QA ויזואלי — ונכון לכתיבת שורות אלה, הוא ה-checkpoint היחיד. עץ המודל כבר מפרט אחת-עשרה קוונטיזציות קהילתיות ושלושה fine-tunes, אך לא פורסם וריאנט בסיס נפרד בשם אחר.

למה הארכיטקטורה ראויה לפסקה

רוב מודלי ה-VLM בגודל 2-3B מקטינים את התמונה שלך לרשת קבועה ומאבדים את האותיות הקטנות. ההימור של North Micro Vision הוא ההפך: לשמור על הרזולוציה, לבזבז את הטוקנים. מקודד הראייה משתמש ב-2D RoPE ובהטבעות מיקום חד-ממדיות שנלמדות, ומקרן ה-DeepStack מזין את ההטבעות של פאצ'ים למספר שכבות שפה במקום הוספה אחת בתחילת הרצף, כך שטבלה צפופה או הערת שוליים שורדים. קידוד המיקום הוא mRoPE משולב, כך שמספר הטוקנים החזותיים גדל עם רזולוציית התמונה במקום להיות מוגבל על ידי ערך קבוע מראש.

הבחירה הזו היא כל המוצר — ויש לה מחיר. ניתוח ההשקה של RohitAI מעריך שעמוד A4 מקורי ברזולוציה מקסימלית מסתכם בכ-3,800 מיקומים חזותיים מאוחדים. קראו את המספר הזה לצד אזהרת ההקשר שלהלן: 3,800 אסימונים חזותיים בתוספת הנחיה יכולים למלא חלק ניכר מהחלון הרב-מודאלי המאומת לפני ששאלתם את שאלתכם.

כרטיס הביצועים, בקריאה כן.

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

כל נתון בחלק זה מדווח על ידי הספק. אף אחד מהם לא שוכפל במעבדה בלתי תלויה, והמודל אינו מופיע עדיין באף לוח תוצאות ציבורי. על הנייר, הביצועים אכן חזקים באמת היכן שקוהר מצביעה עליהם:

• DocVQA — 0.921 (מענה חזותי לשאלות על מסמכים)

• ChartQA — 0.808 (קריאת תרשים)

• OCRBench — 0.792 (OCR בשטח)

• עיגון RefCOCO — 0.732 ממוצע P@1 (הצבעה על אובייקטים)

• MMMU — 0.329 (ידע מולטי-מודלי ברמת מכללה — הנקודה החלשה, כצפוי בגודל הזה)

• IFEval — 0.749 (עקיבות אחר הוראות)

המסגור של Cohere בהשקה טוען ש-North Micro Vision מתעלה על Gemma 4 E2B ו-Ministral 3 3B "במגוון מדדי הבנה חזותית", כשהחוזק מרוכז בהבנת מסמכים וב-QA ויזואלי. זו הטענה של Cohere לגבי המודל של Cohere — יש להתייחס אליה ככזו. נקודה אחת: ההשוואה של Cohere מול המשפחה של Liquid השתמשה ב-checkpoint של 1.6B, לא ב-3B, כך שאין בגיליון הנתונים השוואה תקפה של North מול LFM2.5-VL-3B, אף ששני המודלים יתחרו על אותו תקציב edge-document.

המבחן החיצוני היחיד שפורסם עד כה — ריצה של בלוגר יחיד, לא סוויטת מעבדה — מוסיף את התמונה שהכרטיס משמיט. הוא מדווח ש‑North Micro Vision מביסה את Ministral 3 3B Instruct בחמש מתוך שבע קטגוריות של מסמכים, תרשימים ו‑OCR, מה שתואם למסגור של הספק. אבל הוא גם מדווח ש‑Qwen3.5-2B מביסה את North Micro Vision בשש מתוך שבע הקטגוריות האלה ובכל הקטגוריות המוצהרות של VQA כללית, חשיבה, ספירה, הזיות וידע טקסטואלי; הניצחון היחיד של North Micro Vision על Qwen3.5-2B בקבוצה זו הוא AI2D. ו‑English OCRBench v2 מגיע ל‑0.367 לעומת ה‑OCRBench הראשי של 0.792 — תזכורת לכך שציוני OCR תלויים מאוד באיזה פיצול ובאיזו רמת קושי מריצים. ריצה אחת אינה פסק דין, אבל היא הראיה הראשונה לכך שהמתחרה האמיתי של North Micro Vision בגודל זה הוא משפחת Qwen 3.5, לא המודלים שמולם בחרה Cohere לבצע benchmarking.

חלון הקשר אחד, שני מספרים

הכרטיס מציין 128K של הקשר טקסט ו-8K של הקשר מולטי-מודאלי מאומת, והפער בין השניים נושא משמעות מעשית של ממש. המספר 128K שייך אך ורק לשדרת השפה; הנחיות של תמונה-פלוס-טקסט בהיקף העולה על 8K טוקנים מעולם לא אומנו או אומתו, ולכן כל מה שמעבר לקו הזה הוא אקסטרפולציה. עמוד A4 צפוף צורך בערך 3,800 עמדות חזותיות, כך שניתן להגיע לחלון ה-8K עם מסמך אחד ושאלה קצרה. ההשלכה המעשית: תכננו את הפייפליין סביב חיתוך עמודים לאזורים — הטבלה, גוש החתימה, חשבונית בודדת — במקום להזין עמודים שלמים ולצפות לדיאלוג ארוך עליהם.

מה כרטיס המודל אומר לך לא לעשות

North Micro Vision היא שכבת תפיסה, לא סוכן, ו-Cohere מצהירה על כך בבהירות מרעננת. הכרטיס אומר שהמודל אינו מודל חשיבה, יש לו יכולת מוגבלת במתמטיקה וקוד, הוא אינו תומך בקריאת כלים או בזרימות עבודה סוכנותיות, ואין להחליף בו עוזר כללי גדול יותר. הוא הולך צעד אחד רחוק יותר מרוב הכרטיסים: הוא ממליץ נגד הנחיות מערכת, משום שהמודל לא אומן עליהן. אין גם ציוני ביטחון מכוילים. העיצוב שמשתמע מכך הוא חלוקה: North Micro Vision קורא ומחלץ, סכמה מחזיקה במבנה, חוקים מחזיקים באינווריאנטים, מודל חזק יותר מטפל בקריאות העמומות, ובן אדם מאשר כל דבר בעל השלכות. התייחסו לטקסט שעל הדף כאל נתונים, לעולם לא כאל מדיניות — הוראה סרוקה הקבורה בתוך מסמך היא בדיוק סוג הזרקת ההנחיה החזותית שהחלוקה הזו מגנה מפניו.

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

איך להריץ את זה היום

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

הקוויקסטארט כנה לגבי החיכוך שלו: כרטיס המודל דורש Transformers 5.16.0, שלא הייתה הגרסה היציבה העדכנית ביותר ב-PyPI ביום ההשקה, ולכן משתמשים מוקדמים מתקינים מקוד המקור. תמיכה ציבורית ב-vLLM רשומה כ"בקרוב"; Cohere העריכה באמצעות build פנימי של vLLM. מלבד זאת, התמיכה האקולוגית ביום ההשקה טובה: מתכוני NVIDIA NeMo AutoModel לפריסת edge ו-GPU, מתכוני QLoRA וכוונון עדין מלא של Axolotl, וכימותי MLX קהילתיים ל-Apple Silicon — ה-build של 4-bit הוא כ-2.17 GB. מלכודת פריסה אחת שכדאי להזכיר: הגדר את max_pixels במפורש, כי sequence_len אינו מגביל את טוקני התמונה, ובלעדיו אפשר לפוצץ את החלון המולטימודלי המאומת בלי כוונה.

North Micro Vision אינו זמין ב-OrcaRouter, ולפי כרטיס המודל שלו אינו זמין אצל אף ספק inference — זה סיפור של אירוח עצמי, נקודה. וזו בדיוק הסיבה ששכבת הניתוב חשובה במשפט הבא: ברגע שספק כלשהו יקים endpoint עבורו, נתב הוא מה שמאפשר לך להציב מודל Apache-2.0 בן ימים ספורים לצד אלה שכבר קוראים להם בייצור — API אחד, בלי חוזה חדש, מחיר המחירון של הספק מועבר ב-0% תוספת, ו-failover אוטומטי כך שמודל לא מוכח יכול לקבל תעבורה אמיתית בעוד מודל מוכח קולט את הקריאות שהוא מפיל. עד שה-endpoint הזה יתקיים, ההשוואה שאתה יכול להריץ בפועל היום היא בין ה-checkpoint הזה לבין מודלי המסמכים המתארחים שאתה כבר משלם עליהם, זה לצד זה על הדפים שלך.

מי צריך לזוז, ומי צריך לחכות

עבור אם יש לך משימת חילוץ מסמכים מוגבלת — חשבוניות, דפי בנק, חוזים, טפסים מובנים — ודרישות של שהות נתונים או ביקורת שהופכות API מתארח ללא אטרקטיבי. Apache 2.0, התאמה לתחום זולה ב-QLoRA, ומקודד ברזולוציה מקורית הם שילוב נדיר באמת עבור עומס עבודה שכזה, והמגבלות של כרטיס המודל עצמו ברורות מספיק כדי שלא תופתעו. חכה אם אתה צריך נקודת קצה מתארחת, תמחור לפי טוקן, או התנהגות סוכנית — אף אחד מאלה לא קיים עדיין. וחכה לפני שמתייחסים לכל מדד לעיל כמוסכם: כל נתון ראשי הוא של Cohere, הריצה החיצונית היחידה מציירת תמונה שנויה יותר במחלוקת בראש מחלקת המודלים הקטנים, והמודל בחוץ פחות משבוע. הדבר שכדאי לעקוב אחריו הוא סיפור ההגשה — ביום שבו Transformers הסטנדרטיים ושחרור ציבורי של vLLM שניהם תומכים בו, North Micro Vision מפסיק להיות מאגר שצריך להיאבק בו והופך למודל שאפשר פשוט להפנות למסמכים שלך.