การ์ดชื่อเรื่องที่สร้างขึ้นในสไตล์ของ OrcaRouter มีข้อความว่า “PixelUMM vs InternLumina-U2” พร้อมไทล์สถิติสี่ไทล์: “41.67 / 57.33” (MMMU และ Video-MME ของ PixelUMM), “0.81 / 51.26” (GenEval และ Video-MME ของ InternLumina-U2), “Apache-2.0” (โค้ดและเช็กพอยต์ทั้งสองของ InternLumina-U2) และ “1-way NC” (ใบอนุญาตของเช็กพอยต์ PixelUMM) บรรทัดท้ายระบุว่า “ตัวเลขที่ผู้ขายรายงาน; ไม่มีการรันซ้ำอย่างอิสระของโมเดลใดเลย”. โลโก้ OrcaRouter ถูกคอมโพสิตเข้ากับแถบที่เว้นระยะขอบด้านล่างขวา
Guides & Insights

PixelUMM vs InternLumina-U2: สองเบต้าไร้ Encoder และความแตกต่างเพียงอย่างเดียวที่ชี้ขาด

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สองโมเดล ทั้งคู่เป็นสาธารณะ ทั้งคู่ถูกออกแบบมาอย่างไม่ธรรมดา และมีเพียงตัวเดียวในนั้นที่คุณสามารถสร้างผลิตภัณฑ์บนมันได้ PixelUMMคือโมเดลแบบรวมที่ไม่มีเอนโคเดอร์ของ NVIDIA — มีพารามิเตอร์ 1.52 หมื่นล้านบนแบ็กโบน Qwen3-8B อ่านและเขียนพิกเซลดิบผ่านแพตช์ขนาด 16×16 และทิวบ์เล็ต 4 เฟรม โดยไม่มี VAE และไม่มีวิชันเอนโคเดอร์อยู่ที่ใดในสแต็กเลย InternLumina-U2คือโมเดลดิฟฟิวชันแบบ mixture-of-experts ขนาด 16B ของ Shanghai AI Laboratory ที่บีบอัดอินพุตภาพทุกอย่างให้กลายเป็นโค้ดแบบไม่ต่อเนื่อง 8 ชุดที่เสริมกัน ผ่านโทเคไนเซอร์ที่ชื่อ AToken ทั้งคู่เดิมพันว่าส่วนต่อประสานทางภาพคือคอขวด แต่การเดิมพันที่สำคัญกว่าคือการเดิมพันในไฟล์ไลเซนส์: InternLumina-U2 เผยแพร่น้ำหนักภายใต้ Apache-2.0 ส่วน PixelUMM เผยแพร่เช็กพอยต์ภายใต้ไลเซนส์ที่ห้ามใช้เชิงพาณิชย์ หากคุณกำลังเลือกระหว่างสองตัวนี้เพื่อการใช้งานเชิงพาณิชย์ใด ๆ ประโยคนั้นก็คือการเปรียบเทียบทั้งหมด และส่วนที่เหลือของหน้านี้เป็นเพียงบริบทประกอบเท่านั้น

ตัวเลขทั้งสองชุดด้านล่างนี้มาจากตัวห้องแล็บเอง ไม่มีโมเดลใดมีการประเมินอิสระ คะแนน Elo จากอารีนา หรือการทำซ้ำโดยบุคคลที่สาม และไม่มีโมเดลใดให้บริการผ่าน API ที่โฮสต์ไว้ สิ่งที่แตกต่างคือสิ่งที่คุณได้รับอนุญาตให้ทำกับอาร์ติแฟกต์หลังจากดาวน์โหลดแล้ว และแต่ละรีลีสอยู่ในขั้นไหนจริง ๆ

ตอนนี้แต่ละอันอยู่ตรงจุดไหน

ไทม์ไลน์การเปิดตัวเคลื่อนไปด้วยความเร็วที่แตกต่างกัน และทั้งสองก็เคลื่อนไปอย่างเงียบ ๆ

• PixelUMM — รีโพซิทอรี GitHub ถูกสร้างขึ้นเมื่อวันที่ 4 กันยายน 2026; arXiv preprint 2609.38597 ลงวันที่ 29 กันยายน 2026; รีโพซิทอรีโมเดล Hugging Face ถูกสร้างขึ้นเมื่อวันที่ 1 ตุลาคม 2026 เวลา 21:40 UTC ไม่มีโพสต์บล็อก ข่าวประชาสัมพันธ์ หรือเธรดการเปิดตัวใด ๆ ของ NVIDIA ปรากฏสำหรับโปรเจกต์นี้

• InternLumina-U2 — รีโพซิทอรี GitHub ถูกสร้างเมื่อวันที่ 1 กันยายน 2026; สตับบน Hugging Face ถูกขึ้นทะเบียนในวันเดียวกัน; น้ำหนักเช็กพอยต์ที่ฝึกด้วย Ascend ถูกเพิ่มเมื่อวันที่ 10 กันยายน 2026; น้ำหนักเช็กพอยต์ที่ฝึกด้วย NVIDIA/CUDA ถูกเพิ่มเมื่อวันที่ 24 กันยายน 2026. แต่ละสแตกมีเจ็ดชาร์ด และทั้งสองสแตกสามารถดาวน์โหลดได้ในวันนี้

InternLumina-U2 ที่มีอยู่ในช่วงต้นเดือนกันยายน — มีเพียงโค้ด เวต "เร็ว ๆ นี้" และรีโพซิทอรีโมเดลที่ว่างเปล่า — ไม่ใช่ InternLumina-U2 ที่มีอยู่ในตอนนี้ ใครก็ตามที่อ่านเกี่ยวกับมันเมื่อต้นเดือนแล้วสรุปว่าเวตหายไป ควรกลับไปตรวจสอบใหม่ เช็กพอยต์ทั้งของ Huawei Ascend และ NVIDIA/CUDA เปิดให้ใช้งานแล้ว ภายใต้ Apache-2.0 พร้อมด้วยโทเคไนเซอร์ คอนฟิก เทมเพลตแชต และโค้ดสำหรับโมเดลระยะไกลอยู่ด้วยกัน

A headless-browser capture of the Hugging Face model card for the InternLumina-U2 repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters alongside the file listing for the checkpoint shards.

สองคำตอบสำหรับคำถามเดียวกัน

ทั้งสองโมเดลเริ่มต้นจากข้อร้องเรียนเดียวกัน: การพกพา vision encoder สำหรับการเข้าใจ และ VAE สำหรับการสร้าง means การแทนทุกภาพสองครั้ง ซึ่งเพิ่มบริบททางภาพเป็นประมาณสองเท่าและบังคับให้ไปป์ไลน์การฝึกต้องดูแลอินเทอร์เฟซสองตัว

คำตอบของ PixelUMM คือการลบทั้งสองอย่างทิ้ง พิกเซลดิบถูกป้อนเข้าไปตรง ๆ ผ่านการฉายเชิงเส้นแบบชั้นเดียว — แพตช์ขนาด 16×16 ต่อหนึ่งตำแหน่งภาพ และทูบเล็ต 4 เฟรมต่อหนึ่งตำแหน่งวิดีโอ — โดยแกนหลักคือ Transformer แบบ decoder-only ซึ่งการออกแบบ Mixture-of-Transformers จับคู่ความสนใจที่ใช้ร่วมกันเข้ากับพารามิเตอร์เฉพาะงาน ข้อความถูกทำนายแบบ autoregressive ส่วนพิกเซลถูกทำนายด้วย flow matching งานวิจัยนี้ใช้ถึงแปดหัวข้อสำหรับการศึกษาเชิงออกแบบ — ขนาดแพตช์ อาร์ติแฟกต์ของแพตช์ พลวัตในปริภูมิพิกเซลเทียบกับปริภูมิ VAE การสเกลการประมวลผล — ซึ่งบอกให้รู้ว่าคำถามจริง ๆ ของทีมคือกระบวนทัศน์นี้ยังใช้ได้อยู่หรือไม่เลยตั้งแต่แรก

คำตอบของ InternLumina-U2 คือการคงอินเทอร์เฟซแบบไม่ต่อเนื่อง แต่ทำให้แต่ละโทเค็นบรรจุข้อมูลได้มากขึ้นมาก ตัวสร้างโทเค็น AToken อธิบายทุกตำแหน่งภาพด้วยสมุดรหัสเสริมแปดชุดที่ครอบคลุมพื้นผิว ข้อความฝัง และเรขาคณิต; การฝังทั้งแปดจะถูกนำมาต่อกันในแต่ละตำแหน่งและฉายเข้าสู่โทเค็นแกนหลักหนึ่งตัว การถอดรหัสทำงานในทางกลับกัน โดยมีการลดสัญญาณรบกวนแบบขนานเชิงพื้นที่ และหัวออโตเรเกรสซีฟแบบหลายสมุดรหัสที่ทำนายรหัสทั้งแปดตามลำดับ แกนหลักคือ LLM แบบดิฟฟิวชันแบบเบาบางในตระกูล LLaDA-2.0 ขนาดรวม 16B โดยมี 1B ที่ทำงานอยู่

• อินเทอร์เฟซเชิงภาพ — PixelUMM: แพตช์พิกเซลดิบและทูบเบิลต์ ไม่มีโทเคไนเซอร์เลย InternLumina-U2: โทเคนแบบไม่ต่อเนื่องเต็มรูปแบบจากโค้ดบุ๊กแปดชุดของ AToken ไม่มีเลเทนต์แบบต่อเนื่อง

• แกนหลัก — PixelUMM: Qwen3-8B (รวม 15.2B) เดคโคเดอร์แบบเดนส์ตัวเดียวที่มีผู้เชี่ยวชาญด้านความเข้าใจและการสร้าง InternLumina-U2: โมเดลภาษาดิฟฟิวชันแบบ MoE สแปร์ส ขนาดรวม 16B / ใช้งาน 1B

• วิธีการสร้าง — PixelUMM: การจับคู่โฟลว์ในปริภูมิพิกเซลร่วมกับข้อความแบบออโตรีเกรสซีฟ InternLumina-U2: การลดสัญญาณรบกวนแบบดิฟฟิวชันที่ถูกมาสก์บนรหัสแบบไม่ต่อเนื่อง

• งานที่อ้างว่าทำได้ — PixelUMM: ข้อความเป็นภาพ, ข้อความเป็นวิดีโอ, ภาพเป็นข้อความ, วิดีโอเป็นข้อความ InternLumina-U2: ทั้งหมดนั้นบวกกับการแก้ไขภาพและความเข้าใจแบบ 3 มิติ

• รูปแบบน้ำหนัก — PixelUMM: 128 .distcp ชาร์ด (~30 GB) ที่อยู่เบื้องหลัง.metadata ซึ่งเป็นดัชนีที่ซ่อนอยู่ InternLumina-U2: เจ็ด.safetensors ชาร์ดต่อชุดฮาร์ดแวร์ ตามเลย์เอาต์มาตรฐานของ Hugging Face

A generated scoreboard card titled “PixelUMM vs InternLumina-U2 — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual interface, backbone, generation method, video understanding, weight format and licence. PixelUMM's column shows raw pixel patches and tubelets, a Qwen3-8B backbone at 15.2B, pixel-space flow matching, Video-MME 57.33 with MVBench 70.53, 128 distributed-checkpoint shards, and a noncommercial checkpoint licence; InternLumina-U2's column shows eight-codebook discrete AToken tokens, a 16B-A1B sparse MoE diffusion backbone, masked diffusion denoising, Video-MME 51.26 with MVBench 59.74, seven safetensors shards per hardware stack, and Apache-2.0. A footer notes that the figures are vendor-reported with no independent rerun.

กระดานคะแนน โดยมีที่มาแนบมาด้วย

อ่านทุกแถวเสมือนเป็นข้ออ้างของห้องแล็บเอง ของ PixelUMM มาจาก preprint ของตัวเอง ส่วนของ InternLumina-U2 เป็นคำอธิบายของห้องแล็บเองว่าสิ่งเหล่านั้นเป็น "preliminary, partial" โดยตารางเปรียบเทียบฉบับเต็มถูกเลื่อนไปไว้ในรายงานทางเทคนิคที่ยังไม่ปรากฏ

• MMMU (การให้เหตุผลด้านภาพ) — PixelUMM 41.67 (ของผู้เขียนเอง) InternLumina-U2: ไม่ได้รายงาน

• ChartQA — PixelUMM 82.96 InternLumina-U2 86.52

• DocVQA — PixelUMM 90.42 InternLumina-U2: ไม่ได้รายงาน

• Video-MME (ไม่มีคำบรรยาย) — PixelUMM 57.33. InternLumina-U2 51.26.

• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.

• ภาพรวม GenEval — PixelUMM 0.83 เมื่อใช้ตัวเขียนพรอมป์ด้วย LLM, 0.77 เมื่อไม่ใช้ InternLumina-U2 0.81

• ภาพรวม DPG-Bench — PixelUMM 85.74, InternLumina-U2 87.10

• การสร้างวิดีโอ — PixelUMM VBench พาร์ต 1 คุณภาพ 84.10 / เชิงความหมาย 79.80, พาร์ต 2 รวม 83.24. InternLumina-U2: ไม่มีการรายงาน

• ความเข้าใจ 3 มิติ — PixelUMM: ไม่มีงานดังกล่าว InternLumina-U2 รายงาน 3D MM-Vet 41.8

การเปรียบเทียบนี้ไม่เสมอภาคกัน เพราะสองแล็บเผยแพร่ตารางที่แตกต่างกัน ไม่ใช่เพราะฝ่ายใดฝ่ายหนึ่งกำลังชนะ PixelUMM มีส่วนงานด้านการสร้างวิดีโอเต็มรูปแบบ แต่ไม่มีส่วนงานด้านการตัดต่อหรือ 3D ส่วน InternLumina-U2 อ้างว่าครอบคลุมหกกลุ่มงานและรายงานตารางเพียงบางส่วนในกลุ่มงานเหล่านั้น ตัวเลขข้ามแล็บบนชื่อเบนช์มาร์กเดียวกันไม่ใช่การวัดเดียวกัน — การแบ่งชุดข้อมูล พรอมต์ และการสุ่มตัวอย่างแตกต่างกัน — ดังนั้นให้ถือว่าแถวของ ChartQA และ GenEval อยู่ในระดับใกล้เคียงกันและพอเพียงแค่นั้น

การให้สิทธิ์คือจุดที่เรื่องนี้เลิกเป็นความเสมอ

นี่คือส่วนที่ไม่มีตาราง benchmark ไหนแสดงให้เห็น รีโพซิทอรี PixelUMM อยู่ภายใต้ Apache-2.0 และการ์ดก็ระบุไว้อย่างชัดเจน เช็กพอยต์เป็นอาร์ติแฟกต์แยกต่างหากภายใต้ NVIDIA One-Way Noncommercial License ซึ่งจำกัดไว้เฉพาะการวิจัยหรือการประเมินที่ไม่ใช่เชิงพาณิชย์ และไฟล์ซอร์สหนึ่งไฟล์ยังคงมีประกาศ CC BY-NC 4.0 ที่สืบทอดมาจาก DiT การใช้เพื่อการวิจัย: ได้ การนำไปใช้เป็นฟีเจอร์ผลิตภัณฑ์ภายใน: ต้องคุยกับฝ่ายกฎหมาย และอาจเป็นบทสนทนาสั้น ๆ

InternLumina-U2 เป็น Apache-2.0 แบบครบวงจร ทั้งโค้ดและเช็กพอยต์ทั้งสอง โดยไม่มีข้อยกเว้นแบบไม่ใช่เชิงพาณิชย์แยกต่างหาก สำหรับทีมที่ต้องส่งมอบงาน นั่นไม่ใช่ข้อได้เปรียบเล็ก ๆ — มันคือปัจจัยชี้ขาดทั้งหมด ทั้งสองโมเดลมีความสมบูรณ์ในระดับงานวิจัย มีเพียงหนึ่งเดียวเท่านั้นที่ใช้งานได้อย่างไม่มีข้อจำกัด

อันไหนที่ควรลองจริง ๆ และอย่างไร

ถ้างานของคุณคือการทำความเข้าใจวิดีโอ หรือคุณต้องการโมเดลที่สร้างวิดีโอและภาพจากชุดน้ำหนักชุดเดียว PixelUMM คือชิ้นงานที่สมบูรณ์กว่า และงานวิจัยของมันอ่านแล้วมีประโยชน์กว่า — แต่เป็นโครงการวิจัยภายใต้สัญญาอนุญาตแบบไม่ใช่เชิงพาณิชย์ ดังนั้นมันจึงเหมาะสำหรับการประเมินผล ไม่ใช่สำหรับใช้ในไปป์ไลน์ ถ้างานของคุณคือความกว้างของการสร้างแผนภูมิ เอกสาร และภาพ หรือคุณต้องการการแก้ไขและ 3D, InternLumina-U2 ครอบคลุมขอบเขตมากกว่า และไม่มีเพดานเรื่องสัญญาอนุญาต; ต้นทุนของมันคือว่าโครงข่ายหลักแบบ diffusion ขนาด 16B-A1B และตัวตัดคำ AToken หมายถึงต้องมีวิศวกรรมการให้บริการจริง และตัวเลขที่เผยแพร่ของมันระบุไว้อย่างชัดเจนว่ายังไม่สมบูรณ์

ณ เวลาที่เขียนนี้ ทั้งสองรุ่นยังไม่มีให้บริการบน hosted API ใด ๆ และนั่นรวมถึง OrcaRouter ด้วย — เราไม่ให้บริการ routing สำหรับทั้งสองรุ่นนี้. เมื่อสถานการณ์นั้นเปลี่ยนไป เหตุผลที่ควรเข้าถึงรุ่นเหล่านี้ผ่านเลเยอร์ routing แทนการเชื่อมต่อโดยตรง ก็เป็นเหตุผลเดียวกับที่ใช้ได้กับโมเดลที่เพิ่งเปิดตัวใหม่ทุกรุ่น: คีย์เดียวใช้ได้กับโมเดลกว่า 200 รุ่น ราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยบวกมาร์กอัป 0% และมี failover อัตโนมัติ เพื่อให้โมเดลที่ปรากฏว่าแย่กว่าที่ตารางของผู้ขายระบุไว้ถูกลดระดับได้ด้วยการเปลี่ยน route แทนการเขียน deployment ใหม่ จนกว่าจะถึงตอนนั้น คำแนะนำที่ตรงไปตรงมาก็คือคำแนะนำที่น่าเบื่อ — ดาวน์โหลดไลเซนส์แบบใดก็ตามที่อนุญาตให้ใช้กับกรณีการใช้งานของคุณ รันการประเมินของคุณเองบนข้อมูลของคุณเอง และอย่าวางแผนโดยอิงกับตัวเลขของห้องแล็บใด ๆ จนกว่าจะมีคนนอกห้องแล็บรันทดสอบซ้ำ

อะไรจะเปลี่ยนคำตอบ

สามเรื่อง เรียงตามระดับผลกระทบ การมีสัญญาอนุญาตเชิงพาณิชย์ครอบคลุมเช็กพอยต์ของ PixelUMM จะทำให้การเปรียบเทียบใกล้เคียงกันอย่างแท้จริง และจะยกระดับมันจาก "อ่านเปเปอร์" ไปเป็น "ประเมินเวต" รายงานทางเทคนิคจาก Shanghai AI Laboratory ที่แนบตารางเปรียบเทียบฉบับเต็มมาด้วย จะเปลี่ยนตัวเลขบางส่วนของ InternLumina-U2 ให้กลายเป็นสิ่งที่ตรวจสอบได้ และยังจะเผยให้เห็นว่าความกว้างระดับหกงานนั้นมีสัดส่วนเท่าใดที่ทัดเทียมกัน เทียบกับที่ลงลึกในระดับโทเคน และการทำซ้ำอย่างอิสระครั้งแรกของโมเดลใดโมเดลหนึ่ง — การรัน GenEval หรือ MVBench ซ้ำโดยทีมที่ไม่มีส่วนได้ส่วนเสียกับผลลัพธ์ — คือช่วงเวลาที่ทั้งสองสิ่งนี้เลิกเป็นตารางของผู้ขาย จนกว่าจะถึงตอนนั้น ตัวหนึ่งเป็นสถาปัตยกรรมแปลกใหม่ที่คุณทำได้เพียงศึกษา ส่วนอีกตัวหนึ่งเป็นสถาปัตยกรรมแปลกใหม่ที่คุณนำไปปล่อยใช้งานได้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube