การ์ดไตเติลแบบฮีโร่สำหรับการเปรียบเทียบ 'InternLumina-U2 vs North Micro Vision Instruct' พร้อมคำบรรยาย 'ตัวอ่านเอกสารที่รันได้จริงในวันนี้ เทียบกับ 16B ที่ยังมาไม่ถึง' และชิปสถิติสามชิป — 'North Micro: 2.4B ใช้งานได้วันนี้', 'InternLumina-U2: 16B ยังไม่มีน้ำหนัก', 'ChartQA 0.808 เทียบกับ 86.52 (ทั้งคู่รายงานมา)' — พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

InternLumina-U2 เทียบกับ North Micro Vision Instruct: ตัวอ่านเอกสารที่รันได้เลยวันนี้ เทียบกับโมเดล 16B ที่ยังไปไม่ถึง

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

หากคุณต้องการโมเดลที่อ่านเอกสาร ภาพหน้าจอ และแผนภูมิในสัปดาห์นี้ การเปรียบเทียบครั้งนี้มีคำตอบเชิงปฏิบัติแบบสั้น ๆ คือ North Micro Vision Instruct คือโมเดลเปิดน้ำหนัก 2.4 พันล้านพารามิเตอร์จาก Cohere เผยแพร่ภายใต้สัญญาอนุญาต Apache-2.0 ดาวน์โหลดได้ตั้งแต่วันที่ 10 สิงหาคม ค.ศ. 2026 และมีความสามารถด้านงานเอกสารดีพอที่จะคุ้มค่าที่จะนำไปใช้กับไฟล์ของคุณเองได้ในวันนี้ ส่วน InternLumina-U2 คือโมเดลดิฟฟิวชันขนาด 16 พันล้านพารามิเตอร์ของ Shanghai AI Laboratory ซึ่งเป็นดีไซน์ที่ทะเยอทะยานกว่า much มาก โดยอ้างว่าสามารถเข้าใจแผนภูมิและเอกสารได้ รวมถึงงานอื่น ๆ อีกครึ่งโหล — แต่เวชั่นน้ำหนักของมันไม่ได้เปิดเผยต่อสาธารณะ คลังบน Hugging Face เป็นเพียงหน้าเปล่า ๆ และยังไม่มีใครที่ไหนสามารถรันมันได้เลย คำตอบแบบยาวคือเรื่องที่เกิดขึ้นเมื่อโมเดล Apache-2.0 สองตัวอ้างความสามารถด้านการอ่านที่ทับซ้อนกัน แต่มีเพียงตัวเดียวเท่านั้นที่เป็นสิ่งที่คุณจับต้องได้จริงในมือ

2.4B ที่มีอยู่จริง

North Micro Vision Instruct คือผู้เชี่ยวชาญด้านวิทัศน์ในตระกูล North ของ Cohere: มีพารามิเตอร์รวมประมาณ 2.4 พันล้านตัว เป็นโมเดลขนาดกะทัดรัดที่ออกแบบมาเพื่ออ่านภาพที่ความละเอียดดั้งเดิม จุดออกแบบคือโมเดลวิทัศน์ส่วนใหญ่ย่อภาพลงเป็นกริดขนาดคงที่และสูญเสียรายละเอียดเล็กๆ ที่เอกสารพึ่งพา — ดังนั้น North Micro Vision Instruct จึงรับภาพที่ความละเอียดดั้งเดิมได้จนถึงประมาณหน้ากระดาษ A4 ที่ 200 dpi คงอัตราส่วนภาพและข้อความขนาดเล็กไว้ ตัวเลขที่ Cohere รายงานนั้นแข็งแกร่งสำหรับขนาดโมเดลระดับนี้: DocVQA ที่ 0.921, ChartQA ที่ 0.808, OCRBench ที่ 0.792 ทั้งหมดเป็นตัวเลขที่ Cohere รายงานเองและยังไม่มีการทำซ้ำผล โดยมีบริบท multimodaal ที่ได้รับการตรวจสอบแล้วประมาณ 8K โทเคน และจุดอ่อนที่บันทึกไว้ชัดเจนใน MMMU (0.329) — เป็นเครื่องเตือนว่ามันเป็นผู้เชี่ยวชาญด้านการอ่าน ไม่ใช่ผู้เชี่ยวชาญด้านการใช้เหตุผลทั่วไป มันไม่มี API โฮสต์ของตัวเอง และไม่มีเส้นทางโฮสต์มาตรฐาน เรื่องในทางปฏิบัติคือการโฮสต์โมเดล 2.4B ด้วยตนเอง ซึ่งเล็กพอที่จะรันบน GPU เวิร์กสเตชันสมัยใหม่เพียงตัวเดียว การนำไปใช้โดยชุมชนเติบโตสม่ำเสมอ — การ์ด Hugging Face แสดงยอดดาวน์โหลดหลายหมื่นครั้งต่อเดือนภายในปลายเดือนสิงหาคม

16B ที่เป็นคำสัญญา

InternLumina-U2 เป็นผลงานประเภทที่แตกต่างออกไป สิ่งที่ Shanghai AI Laboratory เผยแพร่เมื่อวันที่ 1 กันยายน ค.ศ. 2026 คือโค้ดสำหรับการอนุมาน (inference) และสถาปัตยกรรม ไม่ใช่ตัวโมเดล: เป็น LLM แบบ diffusion ที่ใช้สถาปัตยกรรม sparse mixture-of-experts มีพารามิเตอร์รวม 16B โดยมีพารามิเตอร์ที่ทำงานจริง 1B สร้างขึ้นบนการแทนค่าภาพแบบไม่ต่อเนื่องโดยสมบูรณ์ (fully-discrete) จาก codebook แปดชุด ในบรรดากลุ่มงานหกกลุ่มที่สคริปต์ขับเคลื่อนของคลังเก็บโค้ด (repo) ครอบคลุม — ข้อความ ความเข้าใจภาพ การสร้างภาพจากข้อความ การแก้ไขภาพ ความเข้าใจวิดีโอ ความเข้าใจ 3 มิติ — ความเข้าใจภาพได้รวมถึงแผนภูมิและเอกสารที่มีความหนาแน่นสูงอย่างชัดเจน ตารางเบื้องต้นในหน้าโครงการแสดงตัวเลขผลลัพธ์ด้านแผนภูมิและเอกสารที่ห้องปฏิบัติการรายงานไว้ในระดับเดียวกันกับที่ผู้เชี่ยวชาญอ้าง: ChartQA 86.52, CharXiv-DQ 83.65 พร้อมกับ HallusionBench 62.15 และ MathVision 33.22 หน้านั้นระบุว่าผลลัพธ์เป็น "ข้อมูลเบื้องต้น ไม่สมบูรณ์" ขณะที่รายงานทางเทคนิคซึ่งจะนำเสนอตารางฉบับเต็มถูกระบุสถานะว่า "เร็วๆ นี้" และ — ข้อเท็จจริงที่ชี้ขาด — ไม่มีค่าน้ำหนัก (weights) ใด ๆ ให้ใครก็ตามตรวจสอบได้

กระดานคะแนน

ตัวเลขทุกตัวด้านล่างนี้เป็นข้อมูลที่ผู้จำหน่ายรายงาน ค่าของ North Micro Vision Instruct เป็นการประเมินของ Cohere เอง ส่วนของ InternLumina-U2 เป็นตารางเบื้องต้นบางส่วนของห้องปฏิบัติการ

• ขนาดและรูปแบบ — North Micro Vision Instruct: โมเดลแบบ dense ขนาด ~2.4 พันล้านพารามิเตอร์ อ่านภาพที่ความละเอียดดั้งเดิม (native resolution) ส่วน InternLumina-U2: sparse MoE มีพารามิเตอร์รวม 16 พันล้าน / ใช้งานจริง 1 พันล้าน เป็นโมเดล diffusion แบบ discrete multi-codebook

• สิ่งที่มันทำ — North Micro Vision Instruct: อ่านภาพ เอกสาร แผนภูมิ และหน้าจอ UI; ตอบเป็นข้อความ พร้อมการอ้างอิง (grounding). InternLumina-U2: อ้างว่าอ่านและสร้างได้ — เข้าใจภาพ/วิดีโอ/3D สร้างและแก้ไขภาพ

— น้ำหนัก — North Micro Vision Instruct: เผยแพร่ต่อสาธารณะตั้งแต่วันที่ 10 สิงหาคม 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0) InternLumina-U2: ยังไม่เผยแพร่ต่อสาธารณะ; Hugging Face stub ว่างเปล่า, น้ำหนักระบุว่า "เร็วๆ นี้"

• คะแนนการอ่านหลัก — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (รายงานโดย Cohere). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (รายงานจากห้องปฏิบัติการ ยังเป็นผลเบื้องต้น).

• บริบทเอกสาร — North Micro Vision Instruct: ความละเอียดดั้งเดิมสูงสุด ~A4 ที่ 200 dpi, มีบริบทมัลติโมดัลที่ผ่านการตรวจสอบแล้ว ~8K InternLumina-U2: แผนภูมิที่มีข้อมูลหนาแน่นและภาพธรรมชาติถูกจัดการผ่านตัวเข้ารหัสแบบหลายโค้ดบุ๊ก AToken ยังไม่ได้ระบุบริบท

• จุดอ่อนที่ทราบ — North Micro Vision Instruct: MMMU 0.329, ไม่มีการเรียกใช้เครื่องมือ — เป็นเพียงตัวอ่าน ไม่ใช่ตัวให้เหตุผลหรือเอเจนต์ InternLumina-U2: ตามหลังคู่แข่งที่ถูกระบุชื่ออย่างน้อยหนึ่งรายบน GenEval (0.81 vs 0.89) ในตารางบางส่วนของตัวเอง; ทุกอย่างยังไม่ผ่านการยืนยัน

• วิธีรัน — North Micro Vision Instruct: โฮสต์โมเดล 2.4B ด้วยตนเอง; การรองรับ vLLM ยังอยู่ในระหว่างการเพิ่มเข้ามาเมื่อเขียนข้อความนี้ InternLumina-U2: ไม่มีใครสามารถรันได้ — ไม่มี weights และไดรเวอร์ที่เผยแพร่ออกมาจำเป็นต้องมีไดเรกทอรี checkpoint และไฟล์ tokenizer ที่ไม่มีอยู่ใน repo

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

เกณฑ์ชี้วัดเดียวกัน สองญาณวิทยาที่แตกต่างกันอย่างสิ้นเชิง

ChartQA เป็นวิธีที่เห็นความแตกต่างระหว่างข้อกล่าวอ้างทั้งสองได้ชัดเจนที่สุด ทั้งสองโมเดลรายงานตัวเลข ChartQA; North Micro Vision Instruct รายงาน 0.808 เป็นเศษส่วนความแม่นยำ ส่วน InternLumina-U2 รายงาน 86.52 เป็นเปอร์เซ็นต์ — เป็นเกณฑ์มาตรฐานเดียวกัน โดยพื้นฐานเป็นผลลัพธ์เดียวกันในช่วง 80 ปลายถึง 80 กลางบนสเกลคนละแบบ โดยคร่าว ๆ ตามการแบ่งชุดประเมินและการตั้งค่าพรอมต์ที่ต่างกัน ซึ่งทำให้การเปรียบเทียบ ChartQA ข้ามเอกสารชวนให้เข้าใจผิดได้แม้ทั้งสองโมเดลจะมีอยู่จริง ความแตกต่างเชิงญาณวิทยาคือสิ่งที่สำคัญ: ตัวเลข 0.808 ของ North Micro Vision Instruct ผูกอยู่กับอาร์ติแฟกต์ที่ดาวน์โหลดได้ ทีมใดก็ตามที่มี GPU และชุดแผนภูมิก็สามารถทำซ้ำหรือหักล้างตัวเลขนั้นได้ในสัปดาห์นี้ ตัวเลข 86.52 ของ InternLumina-U2 ผูกอยู่กับโรดแมป ตัวเลขที่ไม่สามารถตรวจสอบได้คือตัวเลขที่ไม่ควรนำมาสร้างต่อ — ซึ่งก็คือจุดยืนที่แล็บเองยอมรับโดยติดป้ายว่าตารางของตนเป็นผลลัพธ์เบื้องต้น

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

การ์ด Hugging Face ของ CohereLabs/North-Micro-Vision-Instruct ซึ่งบันทึกเมื่อวันที่ 27 สิงหาคม 2026 — คำอธิบายโมเดลวิทัศน์-ภาษาความละเอียดดั้งเดิมขนาด 2.4B พารามิเตอร์ สัญญาอนุญาต Apache-2.0 และผลการวัดประสิทธิภาพการอ่านเอกสารที่ Cohere รายงาน

การอ่าน เทียบกับการอ่านและการวาดภาพ

ช่องว่างทางปรัชญาสถาปัตยกรรมมีค่ายิ่งกว่าช่องว่างด้านเกณฑ์วัดผล North Micro Vision Instruct คือผู้เชี่ยวชาญเฉพาะทางแคบ ๆ: มันอ่านได้ และมันทำงานเดียวนี้ได้ในราคาที่คุ้มพอที่คุณจะรันมันบนทุกหน้า ทุกสกรีนช็อต ทุกใบแจ้งหนี้ในไปป์ไลน์โดยไม่ต้องคอยดูบิลค่า GPU ความถูกนี่แหละคือจุดเด่น — ปัญญาเอกสารในระดับใหญ่เป็นปัญหาด้านต้นทุนพอ ๆ กับปัญหาด้านความแม่นยำ InternLumina-U2 คือการเดิมพันที่ตรงกันข้าม: โมเดล sparse ขนาดยักษ์ที่พยายามรวมการอ่านเข้ากับการสร้างภาพ การแก้ไขภาพ ความเข้าใจวิดีโอ และความเข้าใจ 3D ไว้ในอินเทอร์เฟซ discrete-token ร่วมกันเดียว บนทฤษฎีที่ว่าความเข้าใจและการสร้างเสริมซึ่งกันและกัน ถ้ามันได้ผล มันจะเป็นเครื่องมือคนละระดับ — แต่คำว่า "ถ้ามันได้ผล" กำลังรับน้ำหนักเยอะมาก และ MoE แบบ diffusion ขนาด 16B-A1B พร้อม tokenizer แบบกำหนดเองและการประมวลผลล่วงหน้า 3D ที่เรนเดอร์ด้วย Blender จะไม่มีทางเป็นเครื่องอ่านราคาถูกที่เปิดตลอดเวลาแบบที่โมเดลเฉพาะทางขนาด 2.4B เป็น สิ่งเหล่านี้ไม่ใช่ตัวทดแทนกันจริง ๆ พวกมันคือเครื่องมือที่คุณนำไปใช้ได้วันนี้ กับทิศทางงานวิจัยที่คุณเตรียมตัวได้

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

ที่เก็บ GitHub ของ InternLM/InternLumina-U2 ซึ่งจับภาพเมื่อวันที่ 2 กันยายน 2026 — หน้าแรกของที่เก็บพร้อมคำอธิบาย "Omni-Visual Understanding, Image Generation and Editing" และสคริปต์การอนุมานสำหรับแต่ละงาน; ในจำนวนนี้ เส้นทางสำหรับการทำความเข้าใจภาพคือสิ่งที่กำหนดเป้าหมายไปที่ภาพธรรมชาติและแผนภูมิที่มีข้อมูลหนาแน่น

สิ่งนี้หมายความว่าอย่างไร หากคุณกำลังสร้างไปป์ไลน์เอกสาร

โมเดลทั้งสองไม่ได้โฮสต์บน OrcaRouter — North Micro Vision Instruct เป็นโมเดลที่โฮสต์เองโดยไม่มี hosted API และ InternLumina-U2 ไม่มี weights ให้ใครโฮสต์ — ดังนั้นมุมมองเรื่อง routing ตรงนี้ไม่ใช่ “เรียกทั้งคู่ผ่านคีย์เดียวในวันนี้” แต่เป็นรูปแบบที่คุณจะใช้ในวันที่หนึ่งในสองตัวนี้เปลี่ยนไป: document pipeline เกือบจะจับคู่ตัวอ่านราคาถูกเข้ากับตัวให้เหตุผลที่ใหญ่กว่าเสมอ และคุณค่าของ routing layer คือการแสดงการจับคู่นั้นออกมาเป็นการเรียกครั้งเดียว พร้อมรักษาความซื่อตรงของ pass-through แบบ 0% markup บน hosted models ที่คุณใช้จริง เมื่อ checkpoint แบบ Apache-2.0 อย่าง InternLumina-U2 เปิดตัวในที่สุด การเคลื่อนไหวที่ฉลาดไม่ใช่การถอด document stack ที่ทำงานได้ดีออก — แต่คือการวางตัวใหม่บนเส้นทางทดสอบที่อยู่เบื้องหลัง automatic failover เพื่อให้มันได้รับปริมาณงาน production จากการอยู่รอดผ่านมันไปได้ และในวินาทีที่มันพลาดบน chart จริง การเรียกนั้นก็จะตกกลับไปยังโมเดลที่พิสูจน์ตัวเองมาแล้ว API เดียวครอบคลุม 200+ โมเดลคือกลไก; failover คือตาข่ายนิรภัย; ผู้เชี่ยวชาญที่คุณรันได้ในวันนี้คือสิ่งที่จ่ายค่าใช้จ่าย ในขณะที่คำสัญญา 16B ยังคงถูกรักษาไว้

คำตัดสิน

สำหรับการอ่านเอกสารและแผนภูมิในขณะนี้ North Micro Vision Instruct เป็นเพียงหนึ่งในสองรุ่นเดียวที่ใช้งานได้จริงในความหมายที่ใช้การได้ — เล็ก ใช้สัญญา Apache-2.0 ดาวน์โหลดได้ และมีคะแนนจากผู้ผลิตที่แข็งแกร่งซึ่งคุณสามารถไปตรวจสอบได้จริง ส่วน InternLumina-U2 คือสิ่งที่ชวนสนใจมากกว่าสำหรับระยะยาว เพราะมันพยายามทำให้การอ่านเป็นหนึ่งทักษะในหกทักษะภายในโมเดลแบบรวมศูนย์เดียว และถ้าสิ่งนั้นสำเร็จ มันจะเปลี่ยนความหมายของคำว่า "vision model" ไปเลย จงจับตาดูคลังข้อมูล Hugging Face ที่ว่างเปล่าของมันเช่นเดียวกับที่คุณเฝ้าดูการนับถอยหลังการปล่อยจรวด: ในวันที่ไฟล์ safetensors ปรากฏขึ้น คำมั่นสัญญาจะกลายเป็นโมเดล และการเปรียบเทียบจะกลายเป็นการเปรียบเทียบที่แท้จริง จนกว่าจะถึงเวลานั้น อย่าปล่อยให้คะแนน 86.52 ที่ผู้ผลิตรายงานไว้บนเกณฑ์ชี้วัดด้านแผนภูมิ มีน้ำหนักเหนือกว่า 0.808 ที่ดาวน์โหลดได้จริงในการตัดสินใจของคุณ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube