การ์ดไตเติลสำหรับ North Micro Vision Instruct ที่อ่านว่า 'North Micro Vision Instruct' พร้อมคำบรรยายใต้ชื่อว่า 'Cohere's 2.4B Apache-2.0 document VLM' และชิปที่ระบุว่าเปิดตัวเมื่อวันที่ 12 สิงหาคม 2026 เหนือไอคอนเส้นสามไอคอนสำหรับการสแกนเอกสาร การอ่านแผนภูมิ และการยึดตำแหน่ง bounding-box
Guides & Insights

North Micro Vision Instruct: อธิบาย Cohere Document VLM 2.4B ที่เงียบๆ

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

CohereLabs/North-Micro-Vision-Instruct — หรือเรียกสั้นๆ ว่า "North Micro Vision" — เป็นโมเดลวิทัศน์-ภาษาที่มีพารามิเตอร์ 2.4 พันล้านตัว ซึ่งเปิดตัวแบบเงียบๆ น้ำหนักโมเดลปรากฏบน Hugging Face ในวันที่ 10 สิงหาคม 2026 ตามด้วยประกาศจาก Cohere ในวันที่ 12 สิงหาคม และอีกหนึ่งวันต่อมา ก็ยังไม่มี API ให้บริการ ไม่มีรายการราคา และไม่มีรายการในลีดเดอร์บอร์ดของบุคคลที่สาม North Micro Vision ถูกสร้างขึ้นเพื่องานเดียว นั่นคือการอ่านเอกสารที่ความละเอียดดั้งเดิม อย่างที่คนเราหรี่ตามองหน้ากระดาษ A4 ที่สแกนมา มากกว่าที่โมเดลบรรยายภาพจะมองภาพขนาดเล็ก และการ์ดโมเดลของมันก็ตรงไปตรงมาผิดปกติเกี่ยวกับสิ่งที่มันไม่ใช่: ไม่มีการเรียกใช้เครื่องมือ ไม่มีวงวนการให้เหตุผล และไม่สนับสนุน system prompt อย่างแข็งขัน นี่คือบทความแบบ "สิ่งที่เรารู้ในตอนนี้" ดังนั้นตัวเลขทุกตัวด้านล่างจึงมีป้ายกำกับว่า สิ่งใดที่ตัว repository ระบุไว้เอง สิ่งใดที่ Cohere อ้างแต่ไม่มีใครทำซ้ำได้ และสิ่งใดที่การตรวจสอบจากบุคคลที่สามเพียงรายเดียวที่เผยแพร่จนถึงตอนนี้เพิ่มเติมเข้ามา

สิ่งที่ Cohere ปล่อยออกมาจริงๆ

ทุกอย่างในส่วนนี้อ่านโดยตรงจาก repository: config.json, README และ model card สิ่งเหล่านี้คือแหล่งข้อมูลหลักของ Cohere และสำหรับสิ่งที่ทราบเกี่ยวกับโมเดลนี้เป็นส่วนใหญ่ แหล่งข้อมูลเหล่านี้คือแหล่งเดียวที่มี

• ขนาด — พารามิเตอร์ทั้งหมด 2.4B: ตัวเข้ารหัสภาพขนาด ~400M รวมกับโมเดลภาษา "North Micro LLM" ขนาด 2B ในรูปแบบ bfloat16 น้ำหนักประมาณ 4.97 GB

• สัญญาอนุญาต — Apache 2.0, อนุญาตให้ใช้เชิงพาณิชย์, น้ำหนักและโทเคนไนเซอร์เปิด

• ตัวเข้ารหัสภาพ — ฝึกสอนโดยเฉพาะสำหรับความละเอียดดั้งเดิม เริ่มต้นจาก SigLIP 2 SO400M

• โมเดลภาษา — LLM North Micro ขนาด 2B ที่พัฒนาภายในองค์กร ตามสถาปัตยกรรม Command A+: ชั้น sliding-window attention สามชั้นสลับกับชั้น global attention หนึ่งชั้น, grouped-query attention (16 query heads บน 8 KV heads), tied embeddings, คำศัพท์ 262,144 โทเคน

• Projector — "DeepStack": แพตช์เอมเบดดิงจากเลเยอร์วิทัศน์เอนโค้ดเดอร์หลายชั้นถูกฉีดเข้าไปในเลเยอร์ภาษาช่วงต้น แทนที่จะเติมไว้ด้านหน้าครั้งเดียว ซึ่งเป็นวิธีที่ทำให้ข้อความขนาดเล็กและโครงสร้างตารางยังคงอยู่ได้

• ความละเอียด — รองรับอินพุตความละเอียดดั้งเดิมโดยคงอัตราส่วนภาพไว้ สูงสุดประมาณ 1654 × 2339 พิกเซล ซึ่งเท่ากับกระดาษ A4 หนึ่งหน้าที่ความละเอียดประมาณ 200 DPI

• บริบท — บริบทข้อความ 128K บนแกนหลักภาษา; บริบทมัลติโหมดที่ผ่านการตรวจสอบแล้ว 8K (รายละเอียดด้านล่าง)

• ภาษา — รองรับ 11 ภาษา: อังกฤษ, จีน, เยอรมัน, ฝรั่งเศส, สเปน, อิตาลี, โปรตุเกส, ฮินดี, ญี่ปุ่น, เกาหลี, อาหรับ

คำต่อท้าย "Instruct" มีความสำคัญ นี่คือ checkpoint ที่ถูกปรับแต่งด้วย instruction — โมเดลสำหรับแชทและ visual-QA — และในขณะที่เขียนนี้มันเป็น checkpoint เพียงตัวเดียว ต้นไม้โมเดลแสดงรายการ community quantizations สิบเอ็ดรายการและ fine-tunes สามรายการแล้ว แต่ยังไม่มีการเผยแพร่ base variant แยกต่างหากภายใต้ชื่ออื่น

เหตุใดสถาปัตยกรรมนี้จึงควรค่าแก่การกล่าวถึงหนึ่งย่อหน้า

โมเดล VLM ขนาด 2-3B ส่วนใหญ่จะลดขนาดภาพของคุณให้เป็นกริดคงที่และทำให้รายละเอียดเล็กๆ หายไป กลยุทธ์ของ North Micro Vision นั้นตรงกันข้าม: คงความละเอียดไว้ แลกกับการใช้โทเค็นมากขึ้น ตัวเข้ารหัสภาพใช้ 2D RoPE ร่วมกับ positional embeddings 1D ที่เรียนรู้ได้ และโปรเจกเตอร์ DeepStack จะป้อน patch embeddings เข้าไปในเลเยอร์ภาษาหลายชั้นแทนที่จะป้อนเพียงชั้นเดียวตอนต้น ซึ่งเป็นวิธีที่ทำให้ตารางที่แน่นหนาหรือเชิงอรรถยังคงอยู่ การเข้ารหัสตำแหน่งเป็นแบบ mRoPE แบบสลับ (interleaved) ดังนั้นจำนวนโทเค็นภาพจึงปรับตามความละเอียดของภาพแทนที่จะถูกจำกัดด้วยค่าที่ตั้งไว้ล่วงหน้า

ทางเลือกนั้นคือตัวผลิตภัณฑ์ทั้งหมด — และมันมีต้นทุน การวิเคราะห์การเปิดตัวของ RohitAI ประเมินว่าหน้ากระดาษ A4 ต้นฉบับที่ความละเอียดสูงสุดจะคิดเป็นตำแหน่งภาพรวมประมาณ 3,800 ตำแหน่ง ลองอ่านตัวเลขนั้นคู่กับข้อควรระวังด้านบริบทด้านล่าง: โทเคนภาพ 3,800 โทเคนบวกกับพรอมต์สามารถใช้พื้นที่ส่วนใหญ่ของหน้าต่างมัลติโมดัลที่ผ่านการตรวจสอบแล้ว ก่อนที่คุณจะได้ถามคำถามด้วยซ้ำ

การ์ด benchmark เมื่ออ่านอย่างตรงไปตรงมา

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

ตัวเลขทุกตัวในส่วนนี้เป็นข้อมูลที่ผู้จำหน่ายรายงานไว้ ยังไม่มีห้องปฏิบัติการอิสระใดทำการทดสอบซ้ำ และโมเดลนี้ยังไม่ปรากฏบนลีดเดอร์บอร์ดสาธารณะใด ๆ บนกระดาษ สถิติถือว่าแข็งแกร่งจริงในจุดที่ Cohere ชี้ให้เห็น:

• DocVQA — 0.921 (การตอบคำถามเชิงภาพจากเอกสาร)

• ChartQA — 0.808 (การอ่านกราฟ)

• OCRBench — 0.792 (OCR ในโลกจริง)

• การตรึง RefCOCO — ค่าเฉลี่ย P@1 0.732 (การชี้ไปที่วัตถุ)

• MMMU — 0.329 (ความรู้มัลติโมดัลระดับมหาวิทยาลัย — จุดอ่อน ตามที่คาดไว้สำหรับขนาดโมเดลนี้)

• IFEval — 0.749 (การทำตามคำสั่ง)

กรอบการเปิดตัวของ Cohere อ้างว่า North Micro Vision มีประสิทธิภาพเหนือกว่า Gemma 4 E2B และ Ministral 3 3B "ในเกณฑ์ชี้วัดความเข้าใจภาพที่หลากหลาย" โดยจุดแข็งกระจุกตัวอยู่ในความเข้าใจเอกสารและ Visual QA นั่นคือคำกล่าวอ้างของ Cohere เกี่ยวกับโมเดลของ Cohere เอง — ควรถือเป็นเช่นนั้น ข้อสังเกตหนึ่ง: การเปรียบเทียบของ Cohere กับตระกูลโมเดลของ Liquid ใช้ checkpoint ขนาด 1.6B ไม่ใช่รุ่น 3B ดังนั้นจึงไม่มีการเปรียบเทียบระหว่าง North กับ LFM2.5-VL-3B ที่สมเหตุสมผลในบัตรข้อมูลโมเดล แม้ว่าทั้งสองโมเดลจะแข่งขันกันในงบประมาณเอกสารระดับเอดจ์เดียวกันก็ตาม

ผลการประเมินจากบุคคลที่สามเพียงรายเดียวที่เผยแพร่จนถึงตอนนี้ — ซึ่งเป็นการรันโดยบล็อกเกอร์คนเดียว ไม่ใช่ชุดทดสอบในห้องแล็บ — เพิ่มภาพที่การ์ดไม่ได้แสดง รายงานระบุว่า North Micro Vision ชนะ Ministral 3 3B Instruct ในห้าในเจ็ดแถวสำหรับงานเอกสาร แผนภูมิ และ OCR ซึ่งสอดคล้องกับการนำเสนอของผู้ผลิต แต่ก็ยังรายงานว่า Qwen3.5-2B ชนะ North Micro Vision ในหกในเจ็ดแถวนั้น และในทุกแถวที่เปิดเผยสำหรับงาน general-VQA, การให้เหตุผล, การนับ, การหลอน และความรู้ทางข้อความ; ชัยชนะเดียวของ North Micro Vision เหนือ Qwen3.5-2B ในชุดนั้นคือ AI2D และ English OCRBench v2 ได้คะแนน 0.367 เทียบกับ OCRBench 0.792 ที่เป็นจุดเด่น — ซึ่งเป็นเครื่องเตือนใจว่าคะแนน OCR ขึ้นอยู่กับ split และระดับความยากที่ใช้รันเป็นอย่างมาก การรันครั้งเดียวไม่ใช่คำตัดสิน แต่เป็นหลักฐานแรกที่แสดงว่าคู่แข่งที่แท้จริงของ North Micro Vision ในขนาดนี้คือตระกูล Qwen 3.5 ไม่ใช่โมเดลที่ Cohere เลือกมาเทียบเคียง

หน้าต่างบริบทหนึ่ง ตัวเลขสองตัว

การ์ดระบุหน้าต่างบริบทข้อความ 128K และบริบทมัลติโมดัลที่ผ่านการตรวจสอบแล้ว 8K และช่องว่างระหว่างสองค่านี้กำลังทำงานจริงๆ ตัวเลข 128K เป็นของโครงข่ายหลักภาษาศาสตร์เพียงอย่างเดียว พรอมต์แบบภาพรวมข้อความที่เกิน 8K โทเคนไม่เคยถูกนำมาฝึกหรือตรวจสอบความถูกต้อง ดังนั้นอะไรก็ตามที่เกินเส้นนั้นเป็นการคาดการณ์ล่วงหน้า ด้วยหน้า A4 ที่หนาแน่นกินพื้นที่ตำแหน่งภาพประมาณ 3,800 ตำแหน่ง คุณสามารถเข้าถึงหน้าต่าง 8K นั้นได้ด้วยเอกสารหนึ่งฉบับและคำถามสั้นๆ ผลในทางปฏิบัติคือ วางแผนไปป์ไลน์ของคุณรอบการครอบตัดหน้าเป็นส่วนๆ — ตาราง บล็อกลายเซ็น ใบแจ้งหนี้หนึ่งใบ — แทนที่จะป้อนทั้งหน้าและคาดหวังการโต้ตอบไปมายาวนานกับหน้านั้น

สิ่งที่การ์ดโมเดลบอกว่าไม่ให้ทำ

North Micro Vision คือเลเยอร์การรับรู้ (perception layer) ไม่ใช่เอเจนต์ และ Cohere ระบุเรื่องนี้อย่างชัดเจนน่าชื่นชม การ์ดระบุว่าโมเดลไม่ใช่โมเดลสำหรับการให้เหตุผล มีความสามารถด้านคณิตศาสตร์และการเขียนโค้ดจำกัด ไม่รองรับการเรียกใช้เครื่องมือ (tool calling) หรือเวิร์กโฟลว์แบบเอเจนต์ และไม่ควรใช้แทนผู้ช่วยทั่วไปที่ใหญ่กว่า มันไปไกลกว่าการ์ดส่วนใหญ่ขั้นหนึ่ง: มันแนะนำไม่ให้ใช้พรอมต์ระบบ เพราะโมเดลไม่ได้ถูกฝึกมาด้วยสิ่งเหล่านั้น นอกจากนี้ยังไม่มีคะแนนความเชื่อมั่นที่ปรับเทียบ (calibrated confidence scores) การออกแบบที่ได้นัยจากสิ่งนี้คือการแบ่งแยก: North Micro Vision ทำหน้าที่อ่านและแยกข้อมูล โครงสร้างเป็นของสคีมา กฎเป็นผู้ดูแลอินวาเรียนต์ โมเดลที่แข็งแกร่งกว่าจัดการกับคำขอที่คลุมเครือ และมนุษย์ต้องอนุมัติสิ่งที่มีผลกระทบใดๆ จงปฏิบัติกับข้อความบนหน้าเหมือนเป็นข้อมูล ไม่ใช่เป็นนโยบาย — คำสั่งที่ถูกสแกนซ่อนอยู่ในเอกสารคือตัวอย่างที่แท้จริงของ visual prompt injection ที่การแบ่งแยกนี้ปกป้องอยู่

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

วิธีรันในวันนี้

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

คู่มือเริ่มต้นใช้งานตรงไปตรงมาเกี่ยวกับอุปสรรคของตัวมันเอง: การ์ดโมเดลกำหนดให้ใช้ Transformers 5.16.0 ซึ่งไม่ใช่เวอร์ชันเสถียรล่าสุดบน PyPI ในวันเปิดตัว ดังนั้นผู้ใช้ยุคแรกจึงต้องติดตั้งจากซอร์สโค้ด การรองรับ vLLM สาธารณะระบุไว้ว่า "เร็วๆ นี้"; Cohere ประเมินผลด้วยบิลด์ vLLM ภายในองค์กร การรองรับระบบนิเวศตั้งแต่วันแรกในด้านอื่นถือว่าดี: สูตร NVIDIA NeMo AutoModel สำหรับการปรับใช้บนอุปกรณ์ edge และ GPU, สูตร Axolotl สำหรับ QLoRA และการฟายจูนแบบเต็ม และการควอนไทซ์ MLX จากชุมชนสำหรับ Apple Silicon — บิลด์ 4 บิตมีขนาดประมาณ 2.17 GB กับดักการปรับใช้ที่ควรกล่าวถึงหนึ่งข้อ: ต้องตั้งค่า max_pixels อย่างชัดเจน เพราะ sequence_len ไม่ได้จำกัดโทเคนของรูปภาพ และหากไม่ตั้งค่า คุณอาจทำให้หน้าต่าง multimodal ที่ผ่านการตรวจสอบแล้วเกินขอบเขตโดยไม่ตั้งใจ

นอร์ธ ไมโคร วิชัน (North Micro Vision) ไม่ได้อยู่บน OrcaRouter และจากข้อมูลของตัวมันเอง มันไม่ได้อยู่บนผู้ให้บริการอินference รายใดเลย — นี่คือเรื่องของการโฮสต์ด้วยตนเอง (self-host) เท่านั้นเอง และนี่คือเหตุผลที่เลเยอร์การจัดเส้นทาง (routing layer) มีความสำคัญในประโยคถัดไป: ทันทีที่ผู้ให้บริการรายใดตั้งค่า endpoint สำหรับมัน เราเตอร์จะช่วยให้คุณวางโมเดล Apache-2.0 ที่เพิ่งเปิดตัวได้ไม่กี่วันไว้ข้างๆ โมเดลที่คุณเรียกใช้ในโปรดักชันอยู่แล้ว — API เดียว ไม่ต้องมีสัญญาใหม่ ราคารายการของผู้ให้บริการส่งผ่านที่มาร์กอัป 0% และการเฟลโอเวอร์อัตโนมัติ เพื่อให้โมเดลที่ยังไม่ผ่านการพิสูจน์สามารถรับทราฟฟิกจริงได้ ขณะที่โมเดลที่พิสูจน์แล้วจะคอยรับช่วงการเรียกที่มันพลาดไป จนกว่า endpoint นั้นจะมีขึ้น การเปรียบเทียบที่คุณสามารถทำได้จริงในวันนี้ คือการเปรียบเทียบระหว่าง checkpoint นี้กับโมเดลเอกสารแบบโฮสต์ที่คุณจ่ายเงินอยู่แล้ว เคียงข้างกันบนหน้าเพจของคุณเอง

ใครควรย้าย และใครควรรอ

เลือกใช้ หากคุณมีงานสกัดเอกสารที่มีขอบเขตจำกัด — ใบแจ้งหนี้, รายการเดินบัญชีธนาคาร, สัญญา, แบบฟอร์มที่มีโครงสร้าง — และข้อกำหนดด้านการเก็บข้อมูลในประเทศหรือการตรวจสอบบัญชีที่ทำให้ API แบบโฮสต์ไม่น่าสนใจ Apache 2.0, การปรับโดเมน QLoRA ที่ราคาถูก, และ encoder ความละเอียดดั้งเดิม เป็นการผสมผสานที่ผิดปกติจริงๆ สำหรับงานแบบนั้น และข้อจำกัดของการ์ดเองก็ชัดเจนพอที่คุณจะไม่แปลกใจ รอไว้ก่อน หากคุณต้องการ hosted endpoint, การคิดราคาต่อโทเค็น, หรือพฤติกรรมแบบ agentic — ยังไม่มีสิ่งเหล่านี้เลย และรอก่อนที่จะถือว่า benchmark ใดๆ ข้างต้นเป็นที่สรุปแล้ว: ตัวเลขพาดหัวทุกตัวเป็นของ Cohere, การรันภายนอกเพียงครั้งเดียวให้ภาพที่มีการแข่งขันมากขึ้นที่ระดับบนสุดของคลาสโมเดลเล็ก, และโมเดลเพิ่งเปิดตัวไม่ถึงสัปดาห์ สิ่งที่น่าจับตาคือเรื่องของการ serve — ในวันที่ Transformers มาตรฐานและการเปิดตัว vLLM สาธารณะรองรับมันทั้งคู่ North Micro Vision จะหยุดเป็น repo ที่คุณต้องต่อสู้ดิ้นรน และกลายเป็นโมเดลที่คุณแค่ชี้ไปที่เอกสารของคุณได้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube