ไทเทิลการ์ดที่สร้างขึ้นในสไตล์ประจำของ OrcaRouter ที่ระบุว่า “PixelUMM vs North Micro Vision Instruct” พร้อมไทล์สถิติสี่ไทล์: “2.4B” (จำนวนพารามิเตอร์ทั้งหมดของ North Micro Vision Instruct), “~180k” (ยอดดาวน์โหลดบน Hugging Face ของมันภายในต้นเดือนตุลาคม), “0.921 / 90.42” (DocVQA ของมันในรูปเศษส่วนความแม่นยำเทียบกับเปอร์เซ็นต์ของ PixelUMM) และ “Apache-2.0” (ใบอนุญาตโค้ดและน้ำหนักของมัน เทียบกับเช็คพอยต์ที่ไม่ใช่เชิงพาณิชย์ของ PixelUMM) บรรทัดท้ายอ่านว่า “ตัวเลขที่ผู้ขายรายงาน; ไม่มีการรันซ้ำโดยอิสระของทั้งสองโมเดล” โลโก้ OrcaRouter ถูกคอมโพสิตลงในแถบที่มีการเว้นระยะที่มุมขวาล่าง
Guides & Insights

PixelUMM vs North Micro Vision Instruct: โมเดลวิจัยแบบไม่ใช่เชิงพาณิชย์ เทียบกับตัวอ่านขนาด 2.4B ที่คุณนำไปใช้งานได้

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วางNorth Micro Vision Instruct และ PixelUMM ไว้เคียงข้างกัน แล้วความต่างของขนาดก็แทบจะเป็นเรื่องที่เบี่ยงเบนความสนใจ: 2.4 พันล้านพารามิเตอร์สำหรับตัวอ่านความละเอียดเนทีฟของ Cohere เทียบกับ 15.2 พันล้านพารามิเตอร์สำหรับโมเดลแบบรวมของ NVIDIA แกนที่น่าสนใจคือเอนโคเดอร์ North Micro Vision Instruct ถูกสร้างตามแนวทางทั่วไป — เอนโคเดอร์ภาพขนาด 400M ที่เริ่มต้นจาก SigLIP 2 SO400M ป้อนเข้าสู่โมเดลภาษาขนาด 2B ห่อหุ้มด้วยคลังคำศัพท์ 262,144 โทเคน และเผยแพร่ภายใต้ Apache-2.0 ส่วน PixelUMM สร้างขึ้นบนข้อโต้แย้งว่าการจัดวางแบบนี้เองคือคอขวด และตัดเอนโคเดอร์ออก: แพตช์พิกเซลดิบขนาด 16×16 เข้าสู่แกนหลัก Qwen3-8B ผ่านการฉายเชิงเส้นแบบชั้นเดียว และน้ำหนักชุดเดียวกันทั้งสร้างวิดีโอและตอบคำถามเกี่ยวกับวิดีโอนั้นได้ ตัวหนึ่งเป็นเครื่องอ่านเฉพาะทางที่คุณดาวน์โหลดและนำไปใช้ได้วันนี้ อีกตัวเป็นงานวิจัยเชิงทฤษฎีที่มีลิงก์ดาวน์โหลดและไลเซนส์ที่กีดกันไม่ให้มันถูกนำไปใช้ในผลิตภัณฑ์

ตัวเลขของทั้งสองโมเดลด้านล่างนี้เป็นของแล็บของตัวเองทั้งคู่ ไม่มีตัวใดที่ได้รับการทำซ้ำอย่างอิสระ และทั้งสองเผยแพร่ชุดทดสอบ benchmark ที่แตกต่างกัน ดังนั้นส่วนที่ทับซ้อนกันจึงแคบกว่าที่เห็น

ข้อสนับสนุนสถาปัตยกรรมที่น่าเบื่อ

North Micro Vision Instruct ถูกเผยแพร่บน Hugging Face เมื่อวันที่ 10 สิงหาคม 2026 มีเวลาแปดสัปดาห์ในการสะสมผู้ใช้ และภายในต้นเดือนตุลาคมก็มียอดดาวน์โหลดประมาณ 180,000 ครั้งและไลก์ 150 ครั้ง — เป็นความสนใจที่มากกว่าถึงสิบเท่าเมื่อเทียบกับที่เก็บข้อมูลของ PixelUMM ที่เพิ่งมีอายุไม่กี่วัน จุดขายของมันเจาะจงและไม่หวือหวา: โมเดลวิชันส่วนใหญ่ลดขนาดภาพลงเป็นกริดคงที่และสูญเสียรายละเอียดเล็กๆ ที่เอกสารต้องพึ่งพา ดังนั้นโมเดลนี้จึงประมวลผลภาพที่ความละเอียดดั้งเดิม โดยรักษาอัตราส่วนภาพและข้อความขนาดเล็ก

• พารามิเตอร์ — รวมทั้งหมด 2.4B: โมเดลภาษา 2B บวกกับวิชันเอนโคดเดอร์ 400M ที่ฝึกแบบกำหนดเองจาก SigLIP 2 SO400M

• บริบท — แกนหลักด้านภาษาขนาด 128K โทเคน แต่ช่วงการทำงานแบบหลายรูปแบบที่ผ่านการตรวจสอบแล้วอยู่ที่ประมาณ 8K โทเคน การ์ดระบุชัดเจนว่าบริบทแบบหลายรูปแบบที่ยาวกว่านั้นอาศัยการคาดการณ์นอกช่วง และยังไม่มีการทดสอบ基準

• อินพุตและเอาต์พุต — ข้อความและรูปภาพที่สลับแทรกกันเข้ามา, ส่งออกเป็นข้อความ รองรับหลายภาษามากกว่าสิบเอ็ดภาษา ไม่มีการสร้างใด ๆ

• คะแนนที่รายงาน — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 ทั้งหมดเป็นข้อมูลที่ Cohere รายงานและยังไม่มีการตรวจสอบซ้ำ MMMU 0.329 ซึ่งการ์ดไม่ได้ปิดบังไว้ว่า นี่คือผู้เชี่ยวชาญด้านการอ่าน ไม่ใช่ผู้เชี่ยวชาญทั่วไปด้านการให้เหตุผล

• การปรับใช้ — Transformers 5.16.0 และตัวเร่งความเร็ว GPU สมัยใหม่เพียงตัวเดียวที่ขนาด 2.4B ในรูปแบบ bfloat16 โดย Flash Attention 2 เป็นเพียงตัวเลือกเสริมมากกว่าจะเป็นสิ่งจำเป็น

ไม่มีอะไรเกี่ยวกับการออกแบบนั้นที่แปลกใหม่เลย และนั่นก็เป็นเหตุผลที่ทำให้มันสามารถดาวน์โหลด ปรับแต่งละเอียด และนำไปใช้กับเอกสารจริงได้ในสัปดาห์นี้

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

ข้อโต้แย้งต่อเรื่องนี้ที่อีกฝ่ายนำเสนอ

พรีพรินต์ของ PixelUMM เปิดต้นด้วยการระบุต้นทุนของสถาปัตยกรรมนั้น ทรานส์ฟอร์เมอร์เชิงภาพที่ผ่านการพรีเทรนบนเว็บและถูกแช่แข็งจะป้อนคุณลักษณะเชิงความหมายสำหรับการทำความเข้าใจ ส่วน VAE แยกต่างหากจะป้อนเลเทนต์ที่มุ่งเน้นการสร้างใหม่สำหรับการเจนเนอเรต การถือทั้งสองอย่างไว้ทำให้บริบทเชิงภาพต่อภาพเงื่อนไขหนึ่งภาพเพิ่มขึ้นราวสองเท่า และบังคับให้ไปป์ไลน์การพรีเทรนแบบ vision-language ต้องถูกสร้างใหม่รอบสตรีมที่สอง North Micro Vision Instruct หลีกเลี่ยงการเพิ่มเป็นสองเท่านี้ได้เพียงด้วยการปฏิเสธงานที่สองไปเลย — มันไม่เจนเนอเรต จึงต้องการอินเทอร์เฟซเดียว ไม่ใช่สอง

PixelUMM นำข้อโต้แย้งไปสู่ข้อสรุป ไม่มีตัวเข้ารหัส ไม่มี VAE ไม่มีโทเคไนเซอร์: แพตช์พิกเซลขนาด 16×16 สำหรับภาพ, ทูบเล็ตเชิงเวลา-อวกาศ 4 เฟรมสำหรับวิดีโอ, ทั้งคู่ไปถึง Transformer ที่มีเฉพาะตัวถอดรหัสผ่านการฉายเชิงเส้นชั้นเดียว, โดยมีความเข้าใจผ่านข้อความแบบออโตรีเกรสซีฟและการสร้างผ่านการจับคู่การไหลในปริภูมิพิกเซล ส่วนเชิงประจักษ์ทั้งแปดของมันเป็นการศึกษาทางเลือกการออกแบบมากกว่าการชนะบนกระดานผู้นำ — ขนาดแพตช์, อาร์ติแฟกต์ของแพตช์, พลวัตการฝึกในปริภูมิพิกเซลเทียบกับปริภูมิ VAE, การขยายขนาดการคำนวณ — ซึ่งเป็นบทความที่ถามว่ากระบวนทัศน์นี้ยังคงใช้ได้หรือไม่ ไม่ใช่บทความที่อ้างว่ามันชนะแล้ว

• เส้นทางภาพ — North Micro Vision Instruct: ตัวเข้ารหัสภาพที่ผ่านการฝึกมาก่อนขนาด 400M ที่ความละเอียดดั้งเดิม PixelUMM: ไม่มีตัวเข้ารหัส; เพตช์ดิบผ่านการฉายเชิงเส้น

• สิ่งที่ทำได้ — North Micro Vision Instruct: อ่านภาพและเอกสาร ตอบเป็นข้อความ ระบุตำแหน่งและใส่คำบรรยาย PixelUMM: อ่านภาพและวิดีโอ และสร้างภาพกับวิดีโอความยาว 4 วินาทีจากข้อความ

• ขนาด — 2.4B แบบ dense เทียบกับประมาณ 15.2B ทั้งหมดบนโครงหลัก Qwen3-8B ซึ่งแสดงเป็น "8B MoT" ในตารางของงานวิจัยเอง

• สัญญาอนุญาต — Apache-2.0 สำหรับโค้ดและเวต เทียบกับ Apache-2.0 สำหรับโค้ด พร้อม NVIDIA One-Way Noncommercial License สำหรับเช็กพอยต์

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

อ่านสกอร์บอร์ดทั้งสองอย่างตรงไปตรงมา

โมเดลทั้งสองเผยแพร่เกณฑ์มาตรฐานที่ต่างกัน และในส่วนที่ทับซ้อนกันนั้น สเกลก็ต่างกัน

• DocVQA — North Micro Vision Instruct 0.921 ในรูปเศษส่วนความแม่นยำ PixelUMM 90.42 ในรูปเปอร์เซ็นต์ ชื่อ benchmark เดียวกัน แต่การแบ่งสปลิตและการตั้งค่า prompt ต่างกัน และมีเพียงหนึ่งในสองเท่านั้นที่อ้างว่าการจัดการความละเอียดเนทีฟเป็นเหตุผล

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. อีกครั้ง โดยประมาณแล้วก็อยู่ในช่วงเดียวกันเมื่อคุณเลิกเปรียบเทียบสตริงดิบ

• OCRBench — North Micro Vision Instruct 0.792 PixelUMM 78.00

• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67 ทั้งคู่ต่ำเมื่อเทียบกับมาตรฐานของโมเดลภาษาภาพขนาดใหญ่ และทั้งสองแล็บรายงานค่าเหล่านี้โดยไม่ปรุงแต่ง

• เฉพาะ PixelUMM — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 ด้วยตัวเขียนพรอมป์ต์ใหม่, VBench Part 1 คุณภาพ 84.10

• North Micro Vision แบบ Instruct-only — งาน grounding, captioning และงานภาพหลายภาพ; มีเอกสารระบุชัดว่าไม่มีการเรียกใช้เครื่องมือ และไม่มีพฤติกรรมแบบเอเจนต์อย่างชัดเจน

สิ่งที่น่าทึ่งเกี่ยวกับความทับซ้อนนี้คือ โมเดลเฉพาะทางขนาด 2.4B เข้าใกล้โมเดลเอนกประสงค์ขนาด 15.2B ได้มากเพียงใดในการอ่านเอกสารและแผนภูมิ นั่นไม่ใช่หลักฐานว่าแนวทางที่ไม่ใช้เอนโคเดอร์ล้มเหลว แต่เป็นหลักฐานว่าการอ่านเอกสารเป็นงานที่เอนโคเดอร์ความละเอียดเนทีฟแบบกะทัดรัดเหมาะสมอย่างยิ่ง และสถาปัตยกรรมของ PixelUMM มุ่งเป้าไปที่ข้อโต้แย้งที่แตกต่างออกไป งานวิจัยของ PixelUMM เองยอมรับประเด็นนี้ในประโยคที่ควรค่าแก่การยกมาอ้าง: เนื่องจากข้อมูลการฝึกแตกต่างกันไปในแต่ละโมเดล ผลลัพธ์ของมัน "ไม่อาจยืนยันได้ว่าสถาปัตยกรรมใดเหนือกว่า"

การตัดสินใจนั้นจริง ๆ แล้วลงเอยที่ตรงไหน

หากคุณมีเอกสาร แผนภูมิ แบบฟอร์ม หรือภาพหน้าจอ และต้องการคำตอบภายในเดือนนี้ North Micro Vision Instruct คือตัวเลือกที่ใช้งานได้จริงและไม่ใกล้เคียงเลย: Apache-2.0, 2.4B, เส้นทางการโหลด Transformers มาตรฐาน, ไม่มีสภาพแวดล้อมแบบ guardrail, ไม่มีดัชนี distributed-checkpoint, ไม่มีสแต็ก Python ตัวที่สอง ไฟน์จูนมันกับชุดเอกสารของคุณเอง แล้วคุณจะได้ผู้เชี่ยวชาญ ข้อควรระวังคือขอบเขต — ลองใช้มันกับงานที่ต้องใช้เหตุผล แล้วตัวเลข MMMU จะตามมาหาคุณ

ข้อเสนอของ PixelUMM คือความครอบคลุมกว้างและคำถามงานวิจัย มันอ่านและสร้างได้ทั้งภาพและวิดีโอจากชุดเวตชุดเดียว และเป็นสิ่งที่อ่านแล้วน่าสนใจกว่าอย่างมาก แต่เช็กพอยต์ของมันอยู่ภายใต้สัญญาอนุญาตแบบไม่ใช้เชิงพาณิชย์ เวตของมันคือ 128 ชาร์ดเช็กพอยต์แบบกระจายที่อยู่หลังดัชนีเมทาดาทาซ่อนเร้นซึ่งรวมขนาดราว 30 GB มันต้องการชุดเครื่องมือ CUDA 13 พร้อม FlashAttention ที่คอมไพล์จากซอร์ส และเส้นทางข้อความเป็นวิดีโอของมันใช้การ์ดเรลของ Cosmos ซึ่งต้องมีรีโพซิทอรีแบบเกตและสภาพแวดล้อมแยกต่างหาก นั่นคือโต๊ะทดลองในแล็บ ไม่ใช่การดีพลอย

มุมเรื่องการจัดเส้นทางจะมาทีหลัง หากมันจะมาถึงจริง ทั้งสองโมเดลยังไม่พร้อมใช้งานผ่าน API แบบโฮสต์ใด ๆ ในวันนี้ — OrcaRouter ไม่จัดเส้นทางให้ทั้งคู่ — และทั้งคู่ก็จะยังไม่พร้อมจนกว่าสัญญาอนุญาตของพวกมันจะเอื้ออำนวย เมื่อโมเดลอย่าง North Micro Vision Instruct ปรากฏอยู่เบื้องหลังปลายทางที่ใช้ร่วมกันจริง ๆ เหตุผลที่ควรเลือกวิธีนั้นแทนการผสานรวมโดยตรงก็เป็นเหตุผลธรรมดา ๆ: คีย์เดียวใช้ได้กับโมเดลกว่า 200 รุ่น, ราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกเพิ่ม 0%, ระบบสลับสำรองอัตโนมัติที่ลดอันดับโมเดลซึ่งทำได้ต่ำกว่าที่การ์ดของมันระบุ และไม่ต้องเจรจาสัญญาฉบับที่สองเมื่อคุณต้องการทำ A/B หาตัวแทน นั่นคือคำอธิบายของเวิร์กโฟลว์ ไม่ใช่ข้ออ้างเรื่องความพร้อมใช้งาน

การทดสอบเพียงหนึ่งเดียวที่จะแยกแยะพวกเขาออกจากกัน

รันทั้งสองบนชุดเอกสารเดียวกันที่ความละเอียดเดียวกัน และให้คะแนนกรณีข้อความขนาดเล็ก จากนั้นสลับตัวแปรหนึ่งตัว: ตัดตัวเข้ารหัสภาพออกจากการเปรียบเทียบ โดยป้อนอินพุตความละเอียดดั้งเดิมให้ PixelUMM หากโมเดลที่ไม่มีตัวเข้ารหัสยังทำได้ดีกับข้อความหนาแน่นด้วยต้นทุนพารามิเตอร์เพียงเสี้ยวเดียว นั่นคือหลักฐานที่แข็งแกร่งที่สุดเท่าที่จะเป็นไปได้สำหรับข้อเสนอหลักนี้ — และมันเป็นการทดสอบที่ใครก็ตามที่มีการ์ดสำรองสามารถรันได้ เพราะเช็กพอยต์ทั้งสองดาวน์โหลดได้ จนกว่าจะมีใครทำได้ ข้อสรุปเชิงปฏิบัติยังคงใช้ได้: ตัวอ่าน Apache-2.0 ขนาดเล็กคือสิ่งที่คุณนำไปใช้งาน และโมเดลทั่วไปขนาดใหญ่ที่ไม่ใช่เชิงพาณิชย์คือสิ่งที่คุณศึกษา

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube