การ์ดไตเติลที่สร้างขึ้นในสไตล์เฉพาะของ OrcaRouter มีข้อความว่า “NVIDIA PixelUMM” พร้อมไทล์สถิติสี่ไทล์: “1 ต.ค. 2026” (สร้างที่เก็บ Hugging Face แล้ว ยอดดาวน์โหลดเป็นศูนย์), “15.2B” (แสดงเป็น “8B MoT” ในตารางของบทความ), “0” (ประกาศจากผู้ขาย) และ “ไม่ใช้เชิงพาณิชย์” (สัญญาอนุญาตของเช็กพอยต์; โค้ดเป็น Apache-2.0) บรรทัดท้ายระบุว่า “แหล่งที่มา: การ์ดโมเดล Hugging Face · arXiv:2609.38597” โลโก้ OrcaRouter ถูกคอมโพสิตลงในแถบที่มีการเพิ่มระยะขอบด้านล่างขวา
Engineering & Research

NVIDIA PixelUMM วางจำหน่ายโดยไม่มีการประกาศ — น้ำหนักโมเดลเพิ่งมาถึงแล้ว

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วิธีที่ง่ายที่สุดในการรู้ว่า NVIDIA ได้สร้างโมเดลมัลติโมดัลแบบรวมเป็นหนึ่งใหม่ คือการสังเกตว่าไม่มีใครบอกคุณเลย nvidia/PixelUMM รีโพซิทอรีปรากฏขึ้นบน Hugging Face เมื่อเวลา 21:40 UTC ของวันที่ 1 ตุลาคม 2026 พร้อมเช็กพอยต์ขนาด 15.2 พันล้านพารามิเตอร์ซึ่งสแต็กที่เรียนรู้มาทั้งหมดวางอยู่บน Qwen3-8B แกนหลัก — และไม่มีโพสต์บล็อก ไม่มีการแถลงข่าว ไม่มีสไลด์คีย์โน้ต และไม่มีเธรดเปิดตัวมาด้วย การค้นหาชื่อนี้ไม่พบอะไรบนบล็อกของ NVIDIA เอง สิ่งที่มีอยู่แทนคือรีโพซิทอรี GitHub หน้าโปรเจกต์ที่ URL ของมันเองยังคงเขียนว่า "preview" พรีพรินต์ arXiv หมายเลข 2609.38597 และเช็กพอยต์ที่แยกออกเป็น 128 ไฟล์พร้อมดัชนีที่ซ่อนอยู่ซึ่งตัวโหลดจะไม่ยอมทำงานหากไม่มี PixelUMM เป็นของจริงและดาวน์โหลดได้วันนี้ ส่วนว่า NVIDIA ถือว่ามันเปิดตัวแล้วหรือไม่นั้นเป็นคำถามที่บริษัทไม่ได้ตอบ

ช่องว่างนั้น — ระหว่างอาร์ติแฟกต์ที่มีอยู่จริง กับผู้ขายที่ไม่ได้พูดอะไรเลย — คือเรื่องราวทั้งหมดตรงนี้ และมันคุ้มค่าที่จะแม่นยำว่าแต่ละข้อเท็จจริงอยู่ฝั่งไหนของช่องว่างนี้ ทุกอย่างด้านล่างมาจากรีโพซิทอรี การ์ดโมเดล และเปเปอร์ที่ผู้เขียนเองเผยแพร่ ไม่มีอะไรมาจากประกาศ เพราะไม่มีประกาศอยู่เลย

อะไรปรากฏขึ้น และเมื่อไหร่

ชุดนี้ดำเนินไปประมาณสี่สัปดาห์ และแต่ละชิ้นก็ออกมาอย่างเงียบ ๆ

• 4 กันยายน 2026 — nv-tlabs/PixelUMM ถูกสร้างขึ้นบน GitHub ภายใต้สัญญาอนุญาตที่เก็บแบบ Apache-2.0 โดยมีคำอธิบายสั้น ๆ ว่า "การเข้าใจและการสร้างภาพและวิดีโอแบบรวมเป็นหนึ่งโดยไม่ต้องใช้ตัวเข้ารหัส" ที่เก็บนี้มีคอมมิตเริ่มต้นเพียงครั้งเดียวจนถึงสิ้นเดือนกันยายน

• 28–29 กันยายน 2026 — การคอมมิตเริ่มต้นของรีโพซิทอรีเกิดขึ้น และ arXiv กำหนดให้ preprint arXiv:2609.38597 ลงวันที่ 29 กันยายน โดยระบุรายชื่อผู้เขียนจาก NVIDIA และ University of Waterloo: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang และ Jay Zhangjie Wu.

• 1 ตุลาคม 2026, 21:32 UTC — คอมมิตสุดท้ายไปยังรีโพซิทอรีที่มีชื่อว่า "docs: add PixelUMM paper citation"

• 1 ตุลาคม 2026, 21:40 UTC — ที่เก็บโมเดล Hugging Face ถูกสร้างขึ้น แปดนาทีต่อมา และถูกเติมด้วยเช็กพอยต์ชาร์ด

หน้าโปรเจกต์ถูกโฮสต์อยู่ที่พาธที่อ่านตามตัวอักษรว่า pixelumm-project-page-preview และเปเปอร์ไม่มีบรรทัดระบุสถานที่ตีพิมพ์ — ไม่มี CVPR ไม่มี NeurIPS ไม่มีคำว่า “accepted to” เมื่อนำมารวมกัน ลำดับนี้ดูเหมือนทีมวิจัยกำลังผลักดันอาร์ติแฟกต์ของเปเปอร์ให้เผยแพร่สด และปล่อยให้การอัปโหลดบน HF เป็นการประกาศ นั่นเป็นข้อสังเกตเกี่ยวกับหลักฐาน ไม่ใช่ข้อกล่าวอ้างเกี่ยวกับเจตนา: NVIDIA อาจมีแผนเปิดตัวในภายหลังก็ได้ และไม่มีอะไรตรงนี้ที่ตัดความเป็นไปได้นั้นออก

A headless-browser capture of the PixelUMM project page, hosted at a URL path that still reads pixelumm-project-page-preview, showing the model's title, its summary line about encoder-free unified image and video understanding and generation, and the project's task links.

PixelUMM จริง ๆ แล้วคืออะไร

แก่นแนวคิดการออกแบบถูกระบุไว้ในบรรทัดแรกของการ์ดโมเดล: ไม่มี VAE ไม่มีตัวเข้ารหัสเชิงภาพ ในขณะที่โมเดลแบบรวมเป็นหนึ่งทั่วไปมีอินเทอร์เฟซทางภาพสองส่วน — ทรานส์ฟอร์เมอร์เชิงภาพที่สร้างคุณลักษณะเชิงความหมายสำหรับการทำความเข้าใจ และออโตเอนโคเดอร์แบบแปรผันที่สร้างเลเทนต์สำหรับการสร้างใหม่เพื่อการสร้าง — PixelUMM ไม่มีสิ่งเหล่านี้เลย ภาพถูกตัดเป็นแพตช์พิกเซลขนาด 16×16; วิดีโอถูกตัดเป็นทิวบ์เล็ตเชิงปริภูมิ-เวลาขนาด 4 เฟรม; ทั้งสองเข้าสู่แกนหลักผ่านเพียงการฉายเชิงเส้นแบบชั้นเดียวเท่านั้น พิกเซลดิบเข้าไป; พิกเซลดิบออกมา

• สถาปัตยกรรม — Transformer แบบ decoder-only ที่มีการฝังแพตช์จากพิกเซลดิบและส่วนหัวสำหรับสร้างพิกเซลแบบวนซ้ำ ซึ่งในบทความอธิบายว่าเป็น Mixture-of-Transformers ที่จับคู่ความสนใจที่ใช้ร่วมกันกับพารามิเตอร์เฉพาะงาน

• Backbone — Qwen3-8B ปักหมุดไว้ที่ revision b968826d9c46dd6066d109eabc6255188de91218 จำเป็นต้องใช้เพียงไฟล์ config และ tokenizer ของมันเท่านั้น ส่วน checkpoint มีน้ำหนักภาษาที่เรียนรู้มาในตัวเองอยู่แล้ว

• พารามิเตอร์ — 15,199,672,064 (ประมาณ 15.2B) แสดงเป็น "8B MoT" ในตาราง benchmark ของบทความเอง โดยสัญกรณ์ขนาดจะนับ backbone และ generation expert แยกจากกัน

• วัตถุประสงค์ — การทำนายข้อความแบบ autoregressive และ flow matching ในปริภูมิพิกเซลที่ฝึกฝนร่วมกัน ซึ่งเป็นสิ่งที่ทำให้ชุดน้ำหนักชุดเดียวสามารถทั้งตอบคำถามเกี่ยวกับภาพและวาดภาพใหม่ขึ้นมาได้

• งาน — การแปลงข้อความเป็นภาพ, การแปลงข้อความเป็นวิดีโอที่ 96 เฟรม / 24 fps / 4 วินาที, ข้อความที่กำหนดเงื่อนไขด้วยภาพ และข้อความที่กำหนดเงื่อนไขด้วยวิดีโอ

ส่วนเชิงประจักษ์ของเปเปอร์นี้แปลกในแบบที่ควรตั้งข้อสังเกต แปดส่วนของเปเปอร์นี้เป็นการศึกษาทางเลือกในการออกแบบมากกว่าตำแหน่งบนลีดเดอร์บอร์ด — ขนาดแพตช์ภาพ ขนาดแพตช์วิดีโอ อาร์ติแฟกต์ของแพตช์ พลวัตการฝึกในปริภูมิพิกเซลเทียบกับปริภูมิ VAE ขนาดโมเดล การสเกลคอมพิวต์ การปรับเงื่อนไขบริบทแบบมัลติโมดัล และอินเทอร์เฟซสำหรับการทำความเข้าใจวิดีโอ นั่นคือเปเปอร์ที่เขียนโดยคนที่พยายามตอบว่าแนวทางนี้ได้ผลหรือไม่ ไม่ใช่เปเปอร์ที่พยายามขึ้นนำบนตาราง

ตัวเลขเหล่านี้เป็นของผู้เขียนเอง

ตัวเลขทุกตัวด้านล่างนี้ถูกรายงานโดยผู้เขียน PixelUMM ใน preprint ของพวกเขาเอง ไม่มีการทำซ้ำอย่างอิสระ ไม่มี Elo ของ arena และไม่มีการประเมินจากบุคคลที่สาม เนื่องจากโมเดลนี้มีอายุอย่างมากที่สุดเพียงหกสัปดาห์ และเกิดขึ้นก่อนชุดทดสอบภายนอกใด ๆ ให้ถือว่าสิ่งเหล่านี้เป็นคำกล่าวอ้างที่มาพร้อมลิงก์ดาวน์โหลด ไม่ใช่ประสิทธิภาพที่ได้รับการยืนยันแล้ว

• ความเข้าใจภาพ — MMMU 41.67, MMStar 53.99, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00, BLINK 53.46, MMMU-Pro 27.63 ภายใต้โปรโตคอล LMMS-Eval อย่างเป็นทางการ (การสร้าง 64,750 ครั้งครอบคลุม 21 งาน)

• ความเข้าใจวิดีโอ — MVBench 70.53, Video-MME 57.33 โดยไม่มีคำบรรยาย, LongVideoBench 59.61, LVBench 40.41.

• การสร้างภาพ — GenEval โดยรวม 0.83 เมื่อใช้ตัวเขียนพรอมต์ใหม่ด้วย LLM, 0.77 เมื่อไม่ใช้; DPG-Bench โดยรวม 85.74.

• การสร้างวิดีโอ — คะแนนคุณภาพ VBench พาร์ตที่ 1 อยู่ที่ 84.10 คะแนนเชิงความหมาย 79.80; VBench พาร์ตที่ 2 รวม 83.24

การอ่านอย่างตรงไปตรงมาคือ ตัวเลขเหล่านี้เป็นตัวเลขที่แข่งขันได้ภายในระดับเดียวกัน ไม่ใช่ตัวเลขที่นำหน้าหมวดหมู่ และเปเปอร์ก็ระบุเช่นนั้นเอง โดยชี้ว่าเนื่องจากข้อมูลฝึกแตกต่างกันไปในแต่ละโมเดล ผลลัพธ์จึง “ไม่สามารถชี้ชัดได้ว่าสถาปัตยกรรมใดเหนือกว่า” เมื่อเทียบกับ Qwen3-VL-8B ช่องว่างด้านการเข้าใจภาพมีขนาดใหญ่บน MMMU (41.67 เทียบกับ 69.60) และบน MMMU-Pro ซึ่งผู้เขียนไม่ได้รายงานตัวเลขของคู่แข่งไว้ เมื่อเทียบกับ Qwen-Image 20B ช่องว่าง GenEval อยู่ที่ 0.83 ถึง 0.87 สิ่งที่ PixelUMM ไม่ใช่ เมื่อดูจากตัวเลขของตัวเอง คือโมเดลระดับล้ำสมัยที่สุด สิ่งที่มันเป็น เมื่อดูจากตัวเลขของตัวเอง คือโมเดลขนาด 15B ที่มีสถาปัตยกรรมแปลกใหม่ไม่เหมือนใครอย่างแท้จริง ซึ่งจัดอยู่ในกลุ่มเดียวกับระบบเฉพาะทางรอบข้าง

คมที่สุดคือสัญญาอนุญาต ไม่ใช่เกณฑ์มาตรฐาน

ที่เก็บโค้ดนี้อยู่ภายใต้ Apache-2.0 และการ์ดโมเดลก็ระบุไว้อย่างชัดเจนว่าเป็นเช่นนั้น เช็กพอยต์เป็นอาร์ติแฟกต์ที่แตกต่างออกไปพร้อมข้อกำหนดที่แตกต่าง และนี่คือรายละเอียดที่อาจทำให้ทีมพลาดได้มากที่สุด เวทโมเดลเผยแพร่ภายใต้ NVIDIA One-Way Noncommercial License ซึ่งการใช้งานจำกัดเฉพาะการวิจัยหรือการประเมินผลที่ไม่ใช่เชิงพาณิชย์ — เป็นการให้สิทธิ์ที่เข้มงวดกว่าตัวโค้ดที่อยู่ข้าง ๆ อย่างมีนัยสำคัญ ไฟล์ซอร์สโค้ดหนึ่งไฟล์ในที่เก็บโค้ด คือ modeling/pixelumm/modeling_utils.py ยังคงมีประกาศ CC BY-NC 4.0 ซึ่งได้มาจาก DiT อยู่ด้วย

สำหรับกลุ่มวิจัย ทีมประเมินผล หรือใครก็ตามที่กำลังตีพิมพ์บทความ สิทธิ์การใช้งานนี้ถือว่าใช้งานได้อย่างสมบูรณ์ สำหรับทีมผลิตภัณฑ์ที่กำลังสร้างต้นแบบฟีเจอร์ภายใน นี่คือสิ่งแรกที่ต้องยื่นให้ฝ่ายกฎหมายพิจารณา และคำตอบอาจเป็น “ไม่” โมเดลที่คุณนำออกใช้ไม่ได้เป็นสินทรัพย์คนละประเภทกับโมเดลที่คุณนำออกใช้ได้ และความเท่าเทียมกันของ benchmark ไม่ว่าจะมากแค่ไหนก็ไม่เปลี่ยนข้อเท็จจริงนั้น

A headless-browser capture of the Hugging Face model card for nvidia/PixelUMM, showing the model title, the licence tag, and the repository's download and like counters.

สิ่งที่ต้องใช้ในการรันมัน

นี่ไม่ใช่การดาวน์โหลดสบาย ๆ ในช่วงสุดสัปดาห์ เอกสารสภาพแวดล้อมระบุว่าต้องใช้ Linux x86-64, Python 3.12, CUDA 13.0 development toolkit, NVIDIA GPU และ FlashAttention ที่คอมไพล์จากซอร์สโดยอิงกับ toolkit นั้น — อิมเมจ CUDA แบบ runtime-only ใช้ไม่ได้ ตัว checkpoint เองก็ไม่ใช่ไฟล์ model.safetensors: มันคือ .distcp จำนวน 128 ชาร์ด รวมขนาดราว 30 GB บวกกับ .metadata index ที่ซ่อนอยู่ และ loader ต้องการให้มีทุก shard ที่ถูกอ้างอิงพร้อม index นั้นอยู่ครบ

รายละเอียดเพิ่มเติมอีกสองข้อเป็นตัวกำหนดสิ่งที่คุณทำได้จริงกับมัน ประการแรก text-to-video จะรัน Cosmos guardrails โดยค่าเริ่มต้น และสิ่งเหล่านั้นต้องเข้าถึงที่เก็บ nvidia/Cosmos-1.0-Guardrail แบบ gated พร้อมกับสภาพแวดล้อม Python แห่งที่สองที่มีเวอร์ชันหลักของ Transformers ต่างกัน — การล็อกอินเพียงอย่างเดียวไม่ได้ปลดล็อก weights ประการที่สอง ตัวอย่างการฝึกแบบ toy สี่ขั้นตอน ซึ่งเป็นสูตรการฝึกเดียวที่เผยแพร่ มีเอกสารระบุว่าต้องใช้ GPUs เจ็ดตัว โดยแต่ละตัวมีอย่างน้อย 48 GiB และพื้นที่ดิสก์ว่างประมาณ 61 GB สำหรับเอาต์พุต การ fine-tuning บนเวิร์กสเตชันไม่ใช่เส้นทางที่ตั้งใจไว้ ส่วนการทำ inference บนการ์ดสมัยใหม่เพียงใบเดียวต่างหากที่เป็นเส้นทางนั้น

รีโพซิทอรีนี้มาพร้อมเช็กพอยต์สี่ตัว S8-F22-R05 เป็นค่าเริ่มต้นและเป็นตัวที่ใช้สำหรับการประเมินในบทความ โดยครอบคลุมงานทั้งสี่ S8-F18-R01 ผ่านขั้นตอน fine-tuning เพิ่มเติม 10,000 ขั้นที่ 480p และ 720p และโดยทั่วไปให้ผลลัพธ์ text-to-video ที่ดีขึ้นเล็กน้อย แต่ไม่สามารถทำ video understanding ได้ S8-F19-R03 และ S8-F21-R02 เป็นขั้นกลาง การเลือกระหว่างเช็กพอยต์เหล่านี้เป็นการตัดสินใจจริง ไม่ใช่เรื่องรายละเอียดเล็กน้อย

สิ่งที่ไม่ได้รับการยืนยัน

รายการสั้น ๆ และมันสำคัญยิ่งกว่ารายการยาวข้างบนนั้น

• ไม่มีการประกาศจาก NVIDIA ไม่มีข่าวประชาสัมพันธ์และไม่มีโพสต์บนบล็อกของบริษัทเองปรากฏสำหรับโมเดลนี้ ณ เวลาที่เขียน การเปิดตัวแบบเงียบ ๆ นี้อาจเป็นความตั้งใจก็ได้ — งานวิจัยมักเผยแพร่กันลักษณะนี้ — หรือการเปิดตัวอาจยังไม่เกิดขึ้นจริง

• ไม่มีการประเมินโดยอิสระ ตัวเลขทุกตัวในบทความนี้เป็นของผู้เขียนเอง ไม่มีอะไรถูกรันซ้ำนอก NVIDIA และ Waterloo

• ไม่มีเส้นทางโฮสต์ที่ไหนเลย คุณไม่สามารถเรียก PixelUMM ผ่าน API ได้ในวันนี้ และนั่นรวมถึง OrcaRouter — เราไม่ได้จัดเส้นทางให้มัน และไม่สามารถทำได้ เพราะเช็กพอยต์ที่ได้รับใบอนุญาตแบบไม่ใช้เชิงพาณิชย์ไม่ใช่สิ่งที่แพลตฟอร์มให้บริการเชิงพาณิชย์จะเสนอได้ ใครก็ตามที่บอกคุณเป็นอย่างอื่นกำลังอธิบายการตั้งค่าแบบโฮสต์เอง

• ไม่มีจุดยืนที่ระบุไว้เกี่ยวกับการออกใบอนุญาตในอนาคต ข้อกำหนดที่ไม่ใช่เชิงพาณิชย์คือข้อกำหนดตามที่เผยแพร่มา ไม่ทราบว่าจะผ่อนปรนหรือไม่ และเมื่อพิจารณาจากเช็กพอยต์งานวิจัยของ NVIDIA แล้ว ก็ไม่ใช่สิ่งที่ควรใช้เป็นแนวทางในการวางแผน

A headless-browser capture of the GitHub repository page for nv-tlabs/PixelUMM, showing the repository description “Encoder-Free Unified Image and Video Understanding and Generation” and the Apache-2.0 repository licence.

สิ่งที่ต้องจับตาต่อไป

สามเหตุการณ์จะเปลี่ยน PixelUMM จากงานวิจัยชิ้นหนึ่งให้กลายเป็นสิ่งที่ผู้คนในวงกว้างสามารถนำไปใช้ได้ เหตุการณ์แรกคือการเปลี่ยนแปลงเรื่องสัญญาอนุญาตของ checkpoint — ไฟล์เดียวนั้นคือกำแพงทั้งหมดที่กั้นระหว่าง "น่าสนใจ" กับ "ใช้งานได้จริงในผลิตภัณฑ์" เหตุการณ์ที่สองคือการเปิดตัวอย่างเป็นทางการของ NVIDIA ซึ่งจะมาพร้อมกรอบการนำเสนอที่ตัว repository เองให้ไม่ได้: โมเดลนี้มีไว้เพื่ออะไร และมันเป็นทิศทางของผลิตภัณฑ์หรือเป็นเพียงเปเปอร์ เหตุการณ์ที่สามคือการทำซ้ำโดยอิสระครั้งแรก ซึ่งน่าจะเป็นการรัน GenEval หรือ MVBench ซ้ำโดยใครสักคนที่มีคลัสเตอร์ GPU ว่าง และนั่นคือช่วงเวลาที่ตัวเลขของผู้เขียนจะไม่ใช่ตัวเลขชุดเดียวอีกต่อไป

จนกว่าจะถึงตอนนั้น ท่าทีที่ถูกต้องคือท่าทีที่หลักฐานสนับสนุน PixelUMM มีอยู่จริง โค้ดและบทความเปิดเผยต่อสาธารณะและอ่านได้ น้ำหนักโมเดลดาวน์โหลดได้ และยังไม่มีใครนอกทีมที่สร้างข้ออ้างด้านประสิทธิภาพเหล่านั้นตรวจสอบข้ออ้างใด ๆ เลย นั่นไม่ใช่การวิจารณ์ผลงาน — มันคือสิ่งที่งานวิจัยที่เพิ่งเปิดตัวได้หกสัปดาห์ดูเป็นเช่นนั้น และ它也เป็นสถานการณ์แบบนั้นเป๊ะ ๆ ที่ชั้นจัดเส้นทางจะคุ้มค่าในภายหลัง หากสัญญาอนุญาตผ่อนปรนลง someday: คีย์เดียวใช้ครอบคลุมโมเดลที่คุณไว้วางใจอยู่แล้ว ราคาตามที่ประกาศส่งต่อโดยบวกเพิ่ม 0% และการสลับเมื่อล้มเหลวที่ช่วยให้คุณชี้ทราฟฟิกส่วนหนึ่งไปยังสิ่งที่ยังไม่ผ่านการพิสูจน์ โดยไม่ต้องเดิมพันเส้นทางโปรดักชันไว้กับมัน แต่สำหรับตอนนี้ สรุปที่ตรงไปตรงมาจะง่ายกว่า NVIDIA สร้างสิ่งที่แปลกใหม่ เผยแพร่มันอย่างละเอียด และไม่ได้บอกใคร รีโพซิทอรีคือประกาศ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube