
PixelUMM vs North Micro Vision Instruct: โมเดลวิจัยแบบไม่ใช่เชิงพาณิชย์ เทียบกับตัวอ่านขนาด 2.4B ที่คุณนำไปใช้งานได้
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 223 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
วางNorth Micro Vision Instruct และ PixelUMM ไว้เคียงข้างกัน แล้วความต่างของขนาดก็แทบจะเป็นเรื่องที่เบี่ยงเบนความสนใจ: 2.4 พันล้านพารามิเตอร์สำหรับตัวอ่านความละเอียดเนทีฟของ Cohere เทียบกับ 15.2 พันล้านพารามิเตอร์สำหรับโมเดลแบบรวมของ NVIDIA แกนที่น่าสนใจคือเอนโคเดอร์ North Micro Vision Instruct ถูกสร้างตามแนวทางทั่วไป — เอนโคเดอร์ภาพขนาด 400M ที่เริ่มต้นจาก SigLIP 2 SO400M ป้อนเข้าสู่โมเดลภาษาขนาด 2B ห่อหุ้มด้วยคลังคำศัพท์ 262,144 โทเคน และเผยแพร่ภายใต้ Apache-2.0 ส่วน PixelUMM สร้างขึ้นบนข้อโต้แย้งว่าการจัดวางแบบนี้เองคือคอขวด และตัดเอนโคเดอร์ออก: แพตช์พิกเซลดิบขนาด 16×16 เข้าสู่แกนหลัก Qwen3-8B ผ่านการฉายเชิงเส้นแบบชั้นเดียว และน้ำหนักชุดเดียวกันทั้งสร้างวิดีโอและตอบคำถามเกี่ยวกับวิดีโอนั้นได้ ตัวหนึ่งเป็นเครื่องอ่านเฉพาะทางที่คุณดาวน์โหลดและนำไปใช้ได้วันนี้ อีกตัวเป็นงานวิจัยเชิงทฤษฎีที่มีลิงก์ดาวน์โหลดและไลเซนส์ที่กีดกันไม่ให้มันถูกนำไปใช้ในผลิตภัณฑ์
ตัวเลขของทั้งสองโมเดลด้านล่างนี้เป็นของแล็บของตัวเองทั้งคู่ ไม่มีตัวใดที่ได้รับการทำซ้ำอย่างอิสระ และทั้งสองเผยแพร่ชุดทดสอบ benchmark ที่แตกต่างกัน ดังนั้นส่วนที่ทับซ้อนกันจึงแคบกว่าที่เห็น
ข้อสนับสนุนสถาปัตยกรรมที่น่าเบื่อ
North Micro Vision Instruct ถูกเผยแพร่บน Hugging Face เมื่อวันที่ 10 สิงหาคม 2026 มีเวลาแปดสัปดาห์ในการสะสมผู้ใช้ และภายในต้นเดือนตุลาคมก็มียอดดาวน์โหลดประมาณ 180,000 ครั้งและไลก์ 150 ครั้ง — เป็นความสนใจที่มากกว่าถึงสิบเท่าเมื่อเทียบกับที่เก็บข้อมูลของ PixelUMM ที่เพิ่งมีอายุไม่กี่วัน จุดขายของมันเจาะจงและไม่หวือหวา: โมเดลวิชันส่วนใหญ่ลดขนาดภาพลงเป็นกริดคงที่และสูญเสียรายละเอียดเล็กๆ ที่เอกสารต้องพึ่งพา ดังนั้นโมเดลนี้จึงประมวลผลภาพที่ความละเอียดดั้งเดิม โดยรักษาอัตราส่วนภาพและข้อความขนาดเล็ก
• พารามิเตอร์ — รวมทั้งหมด 2.4B: โมเดลภาษา 2B บวกกับวิชันเอนโคดเดอร์ 400M ที่ฝึกแบบกำหนดเองจาก SigLIP 2 SO400M
• บริบท — แกนหลักด้านภาษาขนาด 128K โทเคน แต่ช่วงการทำงานแบบหลายรูปแบบที่ผ่านการตรวจสอบแล้วอยู่ที่ประมาณ 8K โทเคน การ์ดระบุชัดเจนว่าบริบทแบบหลายรูปแบบที่ยาวกว่านั้นอาศัยการคาดการณ์นอกช่วง และยังไม่มีการทดสอบ基準
• อินพุตและเอาต์พุต — ข้อความและรูปภาพที่สลับแทรกกันเข้ามา, ส่งออกเป็นข้อความ รองรับหลายภาษามากกว่าสิบเอ็ดภาษา ไม่มีการสร้างใด ๆ
• คะแนนที่รายงาน — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 ทั้งหมดเป็นข้อมูลที่ Cohere รายงานและยังไม่มีการตรวจสอบซ้ำ MMMU 0.329 ซึ่งการ์ดไม่ได้ปิดบังไว้ว่า นี่คือผู้เชี่ยวชาญด้านการอ่าน ไม่ใช่ผู้เชี่ยวชาญทั่วไปด้านการให้เหตุผล
• การปรับใช้ — Transformers 5.16.0 และตัวเร่งความเร็ว GPU สมัยใหม่เพียงตัวเดียวที่ขนาด 2.4B ในรูปแบบ bfloat16 โดย Flash Attention 2 เป็นเพียงตัวเลือกเสริมมากกว่าจะเป็นสิ่งจำเป็น
ไม่มีอะไรเกี่ยวกับการออกแบบนั้นที่แปลกใหม่เลย และนั่นก็เป็นเหตุผลที่ทำให้มันสามารถดาวน์โหลด ปรับแต่งละเอียด และนำไปใช้กับเอกสารจริงได้ในสัปดาห์นี้

ข้อโต้แย้งต่อเรื่องนี้ที่อีกฝ่ายนำเสนอ
พรีพรินต์ของ PixelUMM เปิดต้นด้วยการระบุต้นทุนของสถาปัตยกรรมนั้น ทรานส์ฟอร์เมอร์เชิงภาพที่ผ่านการพรีเทรนบนเว็บและถูกแช่แข็งจะป้อนคุณลักษณะเชิงความหมายสำหรับการทำความเข้าใจ ส่วน VAE แยกต่างหากจะป้อนเลเทนต์ที่มุ่งเน้นการสร้างใหม่สำหรับการเจนเนอเรต การถือทั้งสองอย่างไว้ทำให้บริบทเชิงภาพต่อภาพเงื่อนไขหนึ่งภาพเพิ่มขึ้นราวสองเท่า และบังคับให้ไปป์ไลน์การพรีเทรนแบบ vision-language ต้องถูกสร้างใหม่รอบสตรีมที่สอง North Micro Vision Instruct หลีกเลี่ยงการเพิ่มเป็นสองเท่านี้ได้เพียงด้วยการปฏิเสธงานที่สองไปเลย — มันไม่เจนเนอเรต จึงต้องการอินเทอร์เฟซเดียว ไม่ใช่สอง
PixelUMM นำข้อโต้แย้งไปสู่ข้อสรุป ไม่มีตัวเข้ารหัส ไม่มี VAE ไม่มีโทเคไนเซอร์: แพตช์พิกเซลขนาด 16×16 สำหรับภาพ, ทูบเล็ตเชิงเวลา-อวกาศ 4 เฟรมสำหรับวิดีโอ, ทั้งคู่ไปถึง Transformer ที่มีเฉพาะตัวถอดรหัสผ่านการฉายเชิงเส้นชั้นเดียว, โดยมีความเข้าใจผ่านข้อความแบบออโตรีเกรสซีฟและการสร้างผ่านการจับคู่การไหลในปริภูมิพิกเซล ส่วนเชิงประจักษ์ทั้งแปดของมันเป็นการศึกษาทางเลือกการออกแบบมากกว่าการชนะบนกระดานผู้นำ — ขนาดแพตช์, อาร์ติแฟกต์ของแพตช์, พลวัตการฝึกในปริภูมิพิกเซลเทียบกับปริภูมิ VAE, การขยายขนาดการคำนวณ — ซึ่งเป็นบทความที่ถามว่ากระบวนทัศน์นี้ยังคงใช้ได้หรือไม่ ไม่ใช่บทความที่อ้างว่ามันชนะแล้ว
• เส้นทางภาพ — North Micro Vision Instruct: ตัวเข้ารหัสภาพที่ผ่านการฝึกมาก่อนขนาด 400M ที่ความละเอียดดั้งเดิม PixelUMM: ไม่มีตัวเข้ารหัส; เพตช์ดิบผ่านการฉายเชิงเส้น
• สิ่งที่ทำได้ — North Micro Vision Instruct: อ่านภาพและเอกสาร ตอบเป็นข้อความ ระบุตำแหน่งและใส่คำบรรยาย PixelUMM: อ่านภาพและวิดีโอ และสร้างภาพกับวิดีโอความยาว 4 วินาทีจากข้อความ
• ขนาด — 2.4B แบบ dense เทียบกับประมาณ 15.2B ทั้งหมดบนโครงหลัก Qwen3-8B ซึ่งแสดงเป็น "8B MoT" ในตารางของงานวิจัยเอง
• สัญญาอนุญาต — Apache-2.0 สำหรับโค้ดและเวต เทียบกับ Apache-2.0 สำหรับโค้ด พร้อม NVIDIA One-Way Noncommercial License สำหรับเช็กพอยต์

อ่านสกอร์บอร์ดทั้งสองอย่างตรงไปตรงมา
โมเดลทั้งสองเผยแพร่เกณฑ์มาตรฐานที่ต่างกัน และในส่วนที่ทับซ้อนกันนั้น สเกลก็ต่างกัน
• DocVQA — North Micro Vision Instruct 0.921 ในรูปเศษส่วนความแม่นยำ PixelUMM 90.42 ในรูปเปอร์เซ็นต์ ชื่อ benchmark เดียวกัน แต่การแบ่งสปลิตและการตั้งค่า prompt ต่างกัน และมีเพียงหนึ่งในสองเท่านั้นที่อ้างว่าการจัดการความละเอียดเนทีฟเป็นเหตุผล
• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. อีกครั้ง โดยประมาณแล้วก็อยู่ในช่วงเดียวกันเมื่อคุณเลิกเปรียบเทียบสตริงดิบ
• OCRBench — North Micro Vision Instruct 0.792 PixelUMM 78.00
• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67 ทั้งคู่ต่ำเมื่อเทียบกับมาตรฐานของโมเดลภาษาภาพขนาดใหญ่ และทั้งสองแล็บรายงานค่าเหล่านี้โดยไม่ปรุงแต่ง
• เฉพาะ PixelUMM — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 ด้วยตัวเขียนพรอมป์ต์ใหม่, VBench Part 1 คุณภาพ 84.10
• North Micro Vision แบบ Instruct-only — งาน grounding, captioning และงานภาพหลายภาพ; มีเอกสารระบุชัดว่าไม่มีการเรียกใช้เครื่องมือ และไม่มีพฤติกรรมแบบเอเจนต์อย่างชัดเจน
สิ่งที่น่าทึ่งเกี่ยวกับความทับซ้อนนี้คือ โมเดลเฉพาะทางขนาด 2.4B เข้าใกล้โมเดลเอนกประสงค์ขนาด 15.2B ได้มากเพียงใดในการอ่านเอกสารและแผนภูมิ นั่นไม่ใช่หลักฐานว่าแนวทางที่ไม่ใช้เอนโคเดอร์ล้มเหลว แต่เป็นหลักฐานว่าการอ่านเอกสารเป็นงานที่เอนโคเดอร์ความละเอียดเนทีฟแบบกะทัดรัดเหมาะสมอย่างยิ่ง และสถาปัตยกรรมของ PixelUMM มุ่งเป้าไปที่ข้อโต้แย้งที่แตกต่างออกไป งานวิจัยของ PixelUMM เองยอมรับประเด็นนี้ในประโยคที่ควรค่าแก่การยกมาอ้าง: เนื่องจากข้อมูลการฝึกแตกต่างกันไปในแต่ละโมเดล ผลลัพธ์ของมัน "ไม่อาจยืนยันได้ว่าสถาปัตยกรรมใดเหนือกว่า"
การตัดสินใจนั้นจริง ๆ แล้วลงเอยที่ตรงไหน
หากคุณมีเอกสาร แผนภูมิ แบบฟอร์ม หรือภาพหน้าจอ และต้องการคำตอบภายในเดือนนี้ North Micro Vision Instruct คือตัวเลือกที่ใช้งานได้จริงและไม่ใกล้เคียงเลย: Apache-2.0, 2.4B, เส้นทางการโหลด Transformers มาตรฐาน, ไม่มีสภาพแวดล้อมแบบ guardrail, ไม่มีดัชนี distributed-checkpoint, ไม่มีสแต็ก Python ตัวที่สอง ไฟน์จูนมันกับชุดเอกสารของคุณเอง แล้วคุณจะได้ผู้เชี่ยวชาญ ข้อควรระวังคือขอบเขต — ลองใช้มันกับงานที่ต้องใช้เหตุผล แล้วตัวเลข MMMU จะตามมาหาคุณ
ข้อเสนอของ PixelUMM คือความครอบคลุมกว้างและคำถามงานวิจัย มันอ่านและสร้างได้ทั้งภาพและวิดีโอจากชุดเวตชุดเดียว และเป็นสิ่งที่อ่านแล้วน่าสนใจกว่าอย่างมาก แต่เช็กพอยต์ของมันอยู่ภายใต้สัญญาอนุญาตแบบไม่ใช้เชิงพาณิชย์ เวตของมันคือ 128 ชาร์ดเช็กพอยต์แบบกระจายที่อยู่หลังดัชนีเมทาดาทาซ่อนเร้นซึ่งรวมขนาดราว 30 GB มันต้องการชุดเครื่องมือ CUDA 13 พร้อม FlashAttention ที่คอมไพล์จากซอร์ส และเส้นทางข้อความเป็นวิดีโอของมันใช้การ์ดเรลของ Cosmos ซึ่งต้องมีรีโพซิทอรีแบบเกตและสภาพแวดล้อมแยกต่างหาก นั่นคือโต๊ะทดลองในแล็บ ไม่ใช่การดีพลอย
มุมเรื่องการจัดเส้นทางจะมาทีหลัง หากมันจะมาถึงจริง ทั้งสองโมเดลยังไม่พร้อมใช้งานผ่าน API แบบโฮสต์ใด ๆ ในวันนี้ — OrcaRouter ไม่จัดเส้นทางให้ทั้งคู่ — และทั้งคู่ก็จะยังไม่พร้อมจนกว่าสัญญาอนุญาตของพวกมันจะเอื้ออำนวย เมื่อโมเดลอย่าง North Micro Vision Instruct ปรากฏอยู่เบื้องหลังปลายทางที่ใช้ร่วมกันจริง ๆ เหตุผลที่ควรเลือกวิธีนั้นแทนการผสานรวมโดยตรงก็เป็นเหตุผลธรรมดา ๆ: คีย์เดียวใช้ได้กับโมเดลกว่า 200 รุ่น, ราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกเพิ่ม 0%, ระบบสลับสำรองอัตโนมัติที่ลดอันดับโมเดลซึ่งทำได้ต่ำกว่าที่การ์ดของมันระบุ และไม่ต้องเจรจาสัญญาฉบับที่สองเมื่อคุณต้องการทำ A/B หาตัวแทน นั่นคือคำอธิบายของเวิร์กโฟลว์ ไม่ใช่ข้ออ้างเรื่องความพร้อมใช้งาน
การทดสอบเพียงหนึ่งเดียวที่จะแยกแยะพวกเขาออกจากกัน
รันทั้งสองบนชุดเอกสารเดียวกันที่ความละเอียดเดียวกัน และให้คะแนนกรณีข้อความขนาดเล็ก จากนั้นสลับตัวแปรหนึ่งตัว: ตัดตัวเข้ารหัสภาพออกจากการเปรียบเทียบ โดยป้อนอินพุตความละเอียดดั้งเดิมให้ PixelUMM หากโมเดลที่ไม่มีตัวเข้ารหัสยังทำได้ดีกับข้อความหนาแน่นด้วยต้นทุนพารามิเตอร์เพียงเสี้ยวเดียว นั่นคือหลักฐานที่แข็งแกร่งที่สุดเท่าที่จะเป็นไปได้สำหรับข้อเสนอหลักนี้ — และมันเป็นการทดสอบที่ใครก็ตามที่มีการ์ดสำรองสามารถรันได้ เพราะเช็กพอยต์ทั้งสองดาวน์โหลดได้ จนกว่าจะมีใครทำได้ ข้อสรุปเชิงปฏิบัติยังคงใช้ได้: ตัวอ่าน Apache-2.0 ขนาดเล็กคือสิ่งที่คุณนำไปใช้งาน และโมเดลทั่วไปขนาดใหญ่ที่ไม่ใช่เชิงพาณิชย์คือสิ่งที่คุณศึกษา
