
InternLumina-U2 เทียบกับ North Micro Vision Instruct: ตัวอ่านเอกสารที่รันได้เลยวันนี้ เทียบกับโมเดล 16B ที่ยังไปไม่ถึง
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
หากคุณต้องการโมเดลที่อ่านเอกสาร ภาพหน้าจอ และแผนภูมิในสัปดาห์นี้ การเปรียบเทียบครั้งนี้มีคำตอบเชิงปฏิบัติแบบสั้น ๆ คือ North Micro Vision Instruct คือโมเดลเปิดน้ำหนัก 2.4 พันล้านพารามิเตอร์จาก Cohere เผยแพร่ภายใต้สัญญาอนุญาต Apache-2.0 ดาวน์โหลดได้ตั้งแต่วันที่ 10 สิงหาคม ค.ศ. 2026 และมีความสามารถด้านงานเอกสารดีพอที่จะคุ้มค่าที่จะนำไปใช้กับไฟล์ของคุณเองได้ในวันนี้ ส่วน InternLumina-U2 คือโมเดลดิฟฟิวชันขนาด 16 พันล้านพารามิเตอร์ของ Shanghai AI Laboratory ซึ่งเป็นดีไซน์ที่ทะเยอทะยานกว่า much มาก โดยอ้างว่าสามารถเข้าใจแผนภูมิและเอกสารได้ รวมถึงงานอื่น ๆ อีกครึ่งโหล — แต่เวชั่นน้ำหนักของมันไม่ได้เปิดเผยต่อสาธารณะ คลังบน Hugging Face เป็นเพียงหน้าเปล่า ๆ และยังไม่มีใครที่ไหนสามารถรันมันได้เลย คำตอบแบบยาวคือเรื่องที่เกิดขึ้นเมื่อโมเดล Apache-2.0 สองตัวอ้างความสามารถด้านการอ่านที่ทับซ้อนกัน แต่มีเพียงตัวเดียวเท่านั้นที่เป็นสิ่งที่คุณจับต้องได้จริงในมือ
2.4B ที่มีอยู่จริง
North Micro Vision Instruct คือผู้เชี่ยวชาญด้านวิทัศน์ในตระกูล North ของ Cohere: มีพารามิเตอร์รวมประมาณ 2.4 พันล้านตัว เป็นโมเดลขนาดกะทัดรัดที่ออกแบบมาเพื่ออ่านภาพที่ความละเอียดดั้งเดิม จุดออกแบบคือโมเดลวิทัศน์ส่วนใหญ่ย่อภาพลงเป็นกริดขนาดคงที่และสูญเสียรายละเอียดเล็กๆ ที่เอกสารพึ่งพา — ดังนั้น North Micro Vision Instruct จึงรับภาพที่ความละเอียดดั้งเดิมได้จนถึงประมาณหน้ากระดาษ A4 ที่ 200 dpi คงอัตราส่วนภาพและข้อความขนาดเล็กไว้ ตัวเลขที่ Cohere รายงานนั้นแข็งแกร่งสำหรับขนาดโมเดลระดับนี้: DocVQA ที่ 0.921, ChartQA ที่ 0.808, OCRBench ที่ 0.792 ทั้งหมดเป็นตัวเลขที่ Cohere รายงานเองและยังไม่มีการทำซ้ำผล โดยมีบริบท multimodaal ที่ได้รับการตรวจสอบแล้วประมาณ 8K โทเคน และจุดอ่อนที่บันทึกไว้ชัดเจนใน MMMU (0.329) — เป็นเครื่องเตือนว่ามันเป็นผู้เชี่ยวชาญด้านการอ่าน ไม่ใช่ผู้เชี่ยวชาญด้านการใช้เหตุผลทั่วไป มันไม่มี API โฮสต์ของตัวเอง และไม่มีเส้นทางโฮสต์มาตรฐาน เรื่องในทางปฏิบัติคือการโฮสต์โมเดล 2.4B ด้วยตนเอง ซึ่งเล็กพอที่จะรันบน GPU เวิร์กสเตชันสมัยใหม่เพียงตัวเดียว การนำไปใช้โดยชุมชนเติบโตสม่ำเสมอ — การ์ด Hugging Face แสดงยอดดาวน์โหลดหลายหมื่นครั้งต่อเดือนภายในปลายเดือนสิงหาคม
16B ที่เป็นคำสัญญา
InternLumina-U2 เป็นผลงานประเภทที่แตกต่างออกไป สิ่งที่ Shanghai AI Laboratory เผยแพร่เมื่อวันที่ 1 กันยายน ค.ศ. 2026 คือโค้ดสำหรับการอนุมาน (inference) และสถาปัตยกรรม ไม่ใช่ตัวโมเดล: เป็น LLM แบบ diffusion ที่ใช้สถาปัตยกรรม sparse mixture-of-experts มีพารามิเตอร์รวม 16B โดยมีพารามิเตอร์ที่ทำงานจริง 1B สร้างขึ้นบนการแทนค่าภาพแบบไม่ต่อเนื่องโดยสมบูรณ์ (fully-discrete) จาก codebook แปดชุด ในบรรดากลุ่มงานหกกลุ่มที่สคริปต์ขับเคลื่อนของคลังเก็บโค้ด (repo) ครอบคลุม — ข้อความ ความเข้าใจภาพ การสร้างภาพจากข้อความ การแก้ไขภาพ ความเข้าใจวิดีโอ ความเข้าใจ 3 มิติ — ความเข้าใจภาพได้รวมถึงแผนภูมิและเอกสารที่มีความหนาแน่นสูงอย่างชัดเจน ตารางเบื้องต้นในหน้าโครงการแสดงตัวเลขผลลัพธ์ด้านแผนภูมิและเอกสารที่ห้องปฏิบัติการรายงานไว้ในระดับเดียวกันกับที่ผู้เชี่ยวชาญอ้าง: ChartQA 86.52, CharXiv-DQ 83.65 พร้อมกับ HallusionBench 62.15 และ MathVision 33.22 หน้านั้นระบุว่าผลลัพธ์เป็น "ข้อมูลเบื้องต้น ไม่สมบูรณ์" ขณะที่รายงานทางเทคนิคซึ่งจะนำเสนอตารางฉบับเต็มถูกระบุสถานะว่า "เร็วๆ นี้" และ — ข้อเท็จจริงที่ชี้ขาด — ไม่มีค่าน้ำหนัก (weights) ใด ๆ ให้ใครก็ตามตรวจสอบได้
กระดานคะแนน
ตัวเลขทุกตัวด้านล่างนี้เป็นข้อมูลที่ผู้จำหน่ายรายงาน ค่าของ North Micro Vision Instruct เป็นการประเมินของ Cohere เอง ส่วนของ InternLumina-U2 เป็นตารางเบื้องต้นบางส่วนของห้องปฏิบัติการ
• ขนาดและรูปแบบ — North Micro Vision Instruct: โมเดลแบบ dense ขนาด ~2.4 พันล้านพารามิเตอร์ อ่านภาพที่ความละเอียดดั้งเดิม (native resolution) ส่วน InternLumina-U2: sparse MoE มีพารามิเตอร์รวม 16 พันล้าน / ใช้งานจริง 1 พันล้าน เป็นโมเดล diffusion แบบ discrete multi-codebook
• สิ่งที่มันทำ — North Micro Vision Instruct: อ่านภาพ เอกสาร แผนภูมิ และหน้าจอ UI; ตอบเป็นข้อความ พร้อมการอ้างอิง (grounding). InternLumina-U2: อ้างว่าอ่านและสร้างได้ — เข้าใจภาพ/วิดีโอ/3D สร้างและแก้ไขภาพ
— น้ำหนัก — North Micro Vision Instruct: เผยแพร่ต่อสาธารณะตั้งแต่วันที่ 10 สิงหาคม 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0) InternLumina-U2: ยังไม่เผยแพร่ต่อสาธารณะ; Hugging Face stub ว่างเปล่า, น้ำหนักระบุว่า "เร็วๆ นี้"
• คะแนนการอ่านหลัก — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (รายงานโดย Cohere). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (รายงานจากห้องปฏิบัติการ ยังเป็นผลเบื้องต้น).
• บริบทเอกสาร — North Micro Vision Instruct: ความละเอียดดั้งเดิมสูงสุด ~A4 ที่ 200 dpi, มีบริบทมัลติโมดัลที่ผ่านการตรวจสอบแล้ว ~8K InternLumina-U2: แผนภูมิที่มีข้อมูลหนาแน่นและภาพธรรมชาติถูกจัดการผ่านตัวเข้ารหัสแบบหลายโค้ดบุ๊ก AToken ยังไม่ได้ระบุบริบท
• จุดอ่อนที่ทราบ — North Micro Vision Instruct: MMMU 0.329, ไม่มีการเรียกใช้เครื่องมือ — เป็นเพียงตัวอ่าน ไม่ใช่ตัวให้เหตุผลหรือเอเจนต์ InternLumina-U2: ตามหลังคู่แข่งที่ถูกระบุชื่ออย่างน้อยหนึ่งรายบน GenEval (0.81 vs 0.89) ในตารางบางส่วนของตัวเอง; ทุกอย่างยังไม่ผ่านการยืนยัน
• วิธีรัน — North Micro Vision Instruct: โฮสต์โมเดล 2.4B ด้วยตนเอง; การรองรับ vLLM ยังอยู่ในระหว่างการเพิ่มเข้ามาเมื่อเขียนข้อความนี้ InternLumina-U2: ไม่มีใครสามารถรันได้ — ไม่มี weights และไดรเวอร์ที่เผยแพร่ออกมาจำเป็นต้องมีไดเรกทอรี checkpoint และไฟล์ tokenizer ที่ไม่มีอยู่ใน repo

เกณฑ์ชี้วัดเดียวกัน สองญาณวิทยาที่แตกต่างกันอย่างสิ้นเชิง
ChartQA เป็นวิธีที่เห็นความแตกต่างระหว่างข้อกล่าวอ้างทั้งสองได้ชัดเจนที่สุด ทั้งสองโมเดลรายงานตัวเลข ChartQA; North Micro Vision Instruct รายงาน 0.808 เป็นเศษส่วนความแม่นยำ ส่วน InternLumina-U2 รายงาน 86.52 เป็นเปอร์เซ็นต์ — เป็นเกณฑ์มาตรฐานเดียวกัน โดยพื้นฐานเป็นผลลัพธ์เดียวกันในช่วง 80 ปลายถึง 80 กลางบนสเกลคนละแบบ โดยคร่าว ๆ ตามการแบ่งชุดประเมินและการตั้งค่าพรอมต์ที่ต่างกัน ซึ่งทำให้การเปรียบเทียบ ChartQA ข้ามเอกสารชวนให้เข้าใจผิดได้แม้ทั้งสองโมเดลจะมีอยู่จริง ความแตกต่างเชิงญาณวิทยาคือสิ่งที่สำคัญ: ตัวเลข 0.808 ของ North Micro Vision Instruct ผูกอยู่กับอาร์ติแฟกต์ที่ดาวน์โหลดได้ ทีมใดก็ตามที่มี GPU และชุดแผนภูมิก็สามารถทำซ้ำหรือหักล้างตัวเลขนั้นได้ในสัปดาห์นี้ ตัวเลข 86.52 ของ InternLumina-U2 ผูกอยู่กับโรดแมป ตัวเลขที่ไม่สามารถตรวจสอบได้คือตัวเลขที่ไม่ควรนำมาสร้างต่อ — ซึ่งก็คือจุดยืนที่แล็บเองยอมรับโดยติดป้ายว่าตารางของตนเป็นผลลัพธ์เบื้องต้น

การ์ด Hugging Face ของ CohereLabs/North-Micro-Vision-Instruct ซึ่งบันทึกเมื่อวันที่ 27 สิงหาคม 2026 — คำอธิบายโมเดลวิทัศน์-ภาษาความละเอียดดั้งเดิมขนาด 2.4B พารามิเตอร์ สัญญาอนุญาต Apache-2.0 และผลการวัดประสิทธิภาพการอ่านเอกสารที่ Cohere รายงาน
การอ่าน เทียบกับการอ่านและการวาดภาพ
ช่องว่างทางปรัชญาสถาปัตยกรรมมีค่ายิ่งกว่าช่องว่างด้านเกณฑ์วัดผล North Micro Vision Instruct คือผู้เชี่ยวชาญเฉพาะทางแคบ ๆ: มันอ่านได้ และมันทำงานเดียวนี้ได้ในราคาที่คุ้มพอที่คุณจะรันมันบนทุกหน้า ทุกสกรีนช็อต ทุกใบแจ้งหนี้ในไปป์ไลน์โดยไม่ต้องคอยดูบิลค่า GPU ความถูกนี่แหละคือจุดเด่น — ปัญญาเอกสารในระดับใหญ่เป็นปัญหาด้านต้นทุนพอ ๆ กับปัญหาด้านความแม่นยำ InternLumina-U2 คือการเดิมพันที่ตรงกันข้าม: โมเดล sparse ขนาดยักษ์ที่พยายามรวมการอ่านเข้ากับการสร้างภาพ การแก้ไขภาพ ความเข้าใจวิดีโอ และความเข้าใจ 3D ไว้ในอินเทอร์เฟซ discrete-token ร่วมกันเดียว บนทฤษฎีที่ว่าความเข้าใจและการสร้างเสริมซึ่งกันและกัน ถ้ามันได้ผล มันจะเป็นเครื่องมือคนละระดับ — แต่คำว่า "ถ้ามันได้ผล" กำลังรับน้ำหนักเยอะมาก และ MoE แบบ diffusion ขนาด 16B-A1B พร้อม tokenizer แบบกำหนดเองและการประมวลผลล่วงหน้า 3D ที่เรนเดอร์ด้วย Blender จะไม่มีทางเป็นเครื่องอ่านราคาถูกที่เปิดตลอดเวลาแบบที่โมเดลเฉพาะทางขนาด 2.4B เป็น สิ่งเหล่านี้ไม่ใช่ตัวทดแทนกันจริง ๆ พวกมันคือเครื่องมือที่คุณนำไปใช้ได้วันนี้ กับทิศทางงานวิจัยที่คุณเตรียมตัวได้

ที่เก็บ GitHub ของ InternLM/InternLumina-U2 ซึ่งจับภาพเมื่อวันที่ 2 กันยายน 2026 — หน้าแรกของที่เก็บพร้อมคำอธิบาย "Omni-Visual Understanding, Image Generation and Editing" และสคริปต์การอนุมานสำหรับแต่ละงาน; ในจำนวนนี้ เส้นทางสำหรับการทำความเข้าใจภาพคือสิ่งที่กำหนดเป้าหมายไปที่ภาพธรรมชาติและแผนภูมิที่มีข้อมูลหนาแน่น
สิ่งนี้หมายความว่าอย่างไร หากคุณกำลังสร้างไปป์ไลน์เอกสาร
โมเดลทั้งสองไม่ได้โฮสต์บน OrcaRouter — North Micro Vision Instruct เป็นโมเดลที่โฮสต์เองโดยไม่มี hosted API และ InternLumina-U2 ไม่มี weights ให้ใครโฮสต์ — ดังนั้นมุมมองเรื่อง routing ตรงนี้ไม่ใช่ “เรียกทั้งคู่ผ่านคีย์เดียวในวันนี้” แต่เป็นรูปแบบที่คุณจะใช้ในวันที่หนึ่งในสองตัวนี้เปลี่ยนไป: document pipeline เกือบจะจับคู่ตัวอ่านราคาถูกเข้ากับตัวให้เหตุผลที่ใหญ่กว่าเสมอ และคุณค่าของ routing layer คือการแสดงการจับคู่นั้นออกมาเป็นการเรียกครั้งเดียว พร้อมรักษาความซื่อตรงของ pass-through แบบ 0% markup บน hosted models ที่คุณใช้จริง เมื่อ checkpoint แบบ Apache-2.0 อย่าง InternLumina-U2 เปิดตัวในที่สุด การเคลื่อนไหวที่ฉลาดไม่ใช่การถอด document stack ที่ทำงานได้ดีออก — แต่คือการวางตัวใหม่บนเส้นทางทดสอบที่อยู่เบื้องหลัง automatic failover เพื่อให้มันได้รับปริมาณงาน production จากการอยู่รอดผ่านมันไปได้ และในวินาทีที่มันพลาดบน chart จริง การเรียกนั้นก็จะตกกลับไปยังโมเดลที่พิสูจน์ตัวเองมาแล้ว API เดียวครอบคลุม 200+ โมเดลคือกลไก; failover คือตาข่ายนิรภัย; ผู้เชี่ยวชาญที่คุณรันได้ในวันนี้คือสิ่งที่จ่ายค่าใช้จ่าย ในขณะที่คำสัญญา 16B ยังคงถูกรักษาไว้
คำตัดสิน
สำหรับการอ่านเอกสารและแผนภูมิในขณะนี้ North Micro Vision Instruct เป็นเพียงหนึ่งในสองรุ่นเดียวที่ใช้งานได้จริงในความหมายที่ใช้การได้ — เล็ก ใช้สัญญา Apache-2.0 ดาวน์โหลดได้ และมีคะแนนจากผู้ผลิตที่แข็งแกร่งซึ่งคุณสามารถไปตรวจสอบได้จริง ส่วน InternLumina-U2 คือสิ่งที่ชวนสนใจมากกว่าสำหรับระยะยาว เพราะมันพยายามทำให้การอ่านเป็นหนึ่งทักษะในหกทักษะภายในโมเดลแบบรวมศูนย์เดียว และถ้าสิ่งนั้นสำเร็จ มันจะเปลี่ยนความหมายของคำว่า "vision model" ไปเลย จงจับตาดูคลังข้อมูล Hugging Face ที่ว่างเปล่าของมันเช่นเดียวกับที่คุณเฝ้าดูการนับถอยหลังการปล่อยจรวด: ในวันที่ไฟล์ safetensors ปรากฏขึ้น คำมั่นสัญญาจะกลายเป็นโมเดล และการเปรียบเทียบจะกลายเป็นการเปรียบเทียบที่แท้จริง จนกว่าจะถึงเวลานั้น อย่าปล่อยให้คะแนน 86.52 ที่ผู้ผลิตรายงานไว้บนเกณฑ์ชี้วัดด้านแผนภูมิ มีน้ำหนักเหนือกว่า 0.808 ที่ดาวน์โหลดได้จริงในการตัดสินใจของคุณ
