
PixelUMM vs InternLumina-U2: สองเบต้าไร้ Encoder และความแตกต่างเพียงอย่างเดียวที่ชี้ขาด
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 223 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
สองโมเดล ทั้งคู่เป็นสาธารณะ ทั้งคู่ถูกออกแบบมาอย่างไม่ธรรมดา และมีเพียงตัวเดียวในนั้นที่คุณสามารถสร้างผลิตภัณฑ์บนมันได้ PixelUMMคือโมเดลแบบรวมที่ไม่มีเอนโคเดอร์ของ NVIDIA — มีพารามิเตอร์ 1.52 หมื่นล้านบนแบ็กโบน Qwen3-8B อ่านและเขียนพิกเซลดิบผ่านแพตช์ขนาด 16×16 และทิวบ์เล็ต 4 เฟรม โดยไม่มี VAE และไม่มีวิชันเอนโคเดอร์อยู่ที่ใดในสแต็กเลย InternLumina-U2คือโมเดลดิฟฟิวชันแบบ mixture-of-experts ขนาด 16B ของ Shanghai AI Laboratory ที่บีบอัดอินพุตภาพทุกอย่างให้กลายเป็นโค้ดแบบไม่ต่อเนื่อง 8 ชุดที่เสริมกัน ผ่านโทเคไนเซอร์ที่ชื่อ AToken ทั้งคู่เดิมพันว่าส่วนต่อประสานทางภาพคือคอขวด แต่การเดิมพันที่สำคัญกว่าคือการเดิมพันในไฟล์ไลเซนส์: InternLumina-U2 เผยแพร่น้ำหนักภายใต้ Apache-2.0 ส่วน PixelUMM เผยแพร่เช็กพอยต์ภายใต้ไลเซนส์ที่ห้ามใช้เชิงพาณิชย์ หากคุณกำลังเลือกระหว่างสองตัวนี้เพื่อการใช้งานเชิงพาณิชย์ใด ๆ ประโยคนั้นก็คือการเปรียบเทียบทั้งหมด และส่วนที่เหลือของหน้านี้เป็นเพียงบริบทประกอบเท่านั้น
ตัวเลขทั้งสองชุดด้านล่างนี้มาจากตัวห้องแล็บเอง ไม่มีโมเดลใดมีการประเมินอิสระ คะแนน Elo จากอารีนา หรือการทำซ้ำโดยบุคคลที่สาม และไม่มีโมเดลใดให้บริการผ่าน API ที่โฮสต์ไว้ สิ่งที่แตกต่างคือสิ่งที่คุณได้รับอนุญาตให้ทำกับอาร์ติแฟกต์หลังจากดาวน์โหลดแล้ว และแต่ละรีลีสอยู่ในขั้นไหนจริง ๆ
ตอนนี้แต่ละอันอยู่ตรงจุดไหน
ไทม์ไลน์การเปิดตัวเคลื่อนไปด้วยความเร็วที่แตกต่างกัน และทั้งสองก็เคลื่อนไปอย่างเงียบ ๆ
• PixelUMM — รีโพซิทอรี GitHub ถูกสร้างขึ้นเมื่อวันที่ 4 กันยายน 2026; arXiv preprint 2609.38597 ลงวันที่ 29 กันยายน 2026; รีโพซิทอรีโมเดล Hugging Face ถูกสร้างขึ้นเมื่อวันที่ 1 ตุลาคม 2026 เวลา 21:40 UTC ไม่มีโพสต์บล็อก ข่าวประชาสัมพันธ์ หรือเธรดการเปิดตัวใด ๆ ของ NVIDIA ปรากฏสำหรับโปรเจกต์นี้
• InternLumina-U2 — รีโพซิทอรี GitHub ถูกสร้างเมื่อวันที่ 1 กันยายน 2026; สตับบน Hugging Face ถูกขึ้นทะเบียนในวันเดียวกัน; น้ำหนักเช็กพอยต์ที่ฝึกด้วย Ascend ถูกเพิ่มเมื่อวันที่ 10 กันยายน 2026; น้ำหนักเช็กพอยต์ที่ฝึกด้วย NVIDIA/CUDA ถูกเพิ่มเมื่อวันที่ 24 กันยายน 2026. แต่ละสแตกมีเจ็ดชาร์ด และทั้งสองสแตกสามารถดาวน์โหลดได้ในวันนี้
InternLumina-U2 ที่มีอยู่ในช่วงต้นเดือนกันยายน — มีเพียงโค้ด เวต "เร็ว ๆ นี้" และรีโพซิทอรีโมเดลที่ว่างเปล่า — ไม่ใช่ InternLumina-U2 ที่มีอยู่ในตอนนี้ ใครก็ตามที่อ่านเกี่ยวกับมันเมื่อต้นเดือนแล้วสรุปว่าเวตหายไป ควรกลับไปตรวจสอบใหม่ เช็กพอยต์ทั้งของ Huawei Ascend และ NVIDIA/CUDA เปิดให้ใช้งานแล้ว ภายใต้ Apache-2.0 พร้อมด้วยโทเคไนเซอร์ คอนฟิก เทมเพลตแชต และโค้ดสำหรับโมเดลระยะไกลอยู่ด้วยกัน

สองคำตอบสำหรับคำถามเดียวกัน
ทั้งสองโมเดลเริ่มต้นจากข้อร้องเรียนเดียวกัน: การพกพา vision encoder สำหรับการเข้าใจ และ VAE สำหรับการสร้าง means การแทนทุกภาพสองครั้ง ซึ่งเพิ่มบริบททางภาพเป็นประมาณสองเท่าและบังคับให้ไปป์ไลน์การฝึกต้องดูแลอินเทอร์เฟซสองตัว
คำตอบของ PixelUMM คือการลบทั้งสองอย่างทิ้ง พิกเซลดิบถูกป้อนเข้าไปตรง ๆ ผ่านการฉายเชิงเส้นแบบชั้นเดียว — แพตช์ขนาด 16×16 ต่อหนึ่งตำแหน่งภาพ และทูบเล็ต 4 เฟรมต่อหนึ่งตำแหน่งวิดีโอ — โดยแกนหลักคือ Transformer แบบ decoder-only ซึ่งการออกแบบ Mixture-of-Transformers จับคู่ความสนใจที่ใช้ร่วมกันเข้ากับพารามิเตอร์เฉพาะงาน ข้อความถูกทำนายแบบ autoregressive ส่วนพิกเซลถูกทำนายด้วย flow matching งานวิจัยนี้ใช้ถึงแปดหัวข้อสำหรับการศึกษาเชิงออกแบบ — ขนาดแพตช์ อาร์ติแฟกต์ของแพตช์ พลวัตในปริภูมิพิกเซลเทียบกับปริภูมิ VAE การสเกลการประมวลผล — ซึ่งบอกให้รู้ว่าคำถามจริง ๆ ของทีมคือกระบวนทัศน์นี้ยังใช้ได้อยู่หรือไม่เลยตั้งแต่แรก
คำตอบของ InternLumina-U2 คือการคงอินเทอร์เฟซแบบไม่ต่อเนื่อง แต่ทำให้แต่ละโทเค็นบรรจุข้อมูลได้มากขึ้นมาก ตัวสร้างโทเค็น AToken อธิบายทุกตำแหน่งภาพด้วยสมุดรหัสเสริมแปดชุดที่ครอบคลุมพื้นผิว ข้อความฝัง และเรขาคณิต; การฝังทั้งแปดจะถูกนำมาต่อกันในแต่ละตำแหน่งและฉายเข้าสู่โทเค็นแกนหลักหนึ่งตัว การถอดรหัสทำงานในทางกลับกัน โดยมีการลดสัญญาณรบกวนแบบขนานเชิงพื้นที่ และหัวออโตเรเกรสซีฟแบบหลายสมุดรหัสที่ทำนายรหัสทั้งแปดตามลำดับ แกนหลักคือ LLM แบบดิฟฟิวชันแบบเบาบางในตระกูล LLaDA-2.0 ขนาดรวม 16B โดยมี 1B ที่ทำงานอยู่
• อินเทอร์เฟซเชิงภาพ — PixelUMM: แพตช์พิกเซลดิบและทูบเบิลต์ ไม่มีโทเคไนเซอร์เลย InternLumina-U2: โทเคนแบบไม่ต่อเนื่องเต็มรูปแบบจากโค้ดบุ๊กแปดชุดของ AToken ไม่มีเลเทนต์แบบต่อเนื่อง
• แกนหลัก — PixelUMM: Qwen3-8B (รวม 15.2B) เดคโคเดอร์แบบเดนส์ตัวเดียวที่มีผู้เชี่ยวชาญด้านความเข้าใจและการสร้าง InternLumina-U2: โมเดลภาษาดิฟฟิวชันแบบ MoE สแปร์ส ขนาดรวม 16B / ใช้งาน 1B
• วิธีการสร้าง — PixelUMM: การจับคู่โฟลว์ในปริภูมิพิกเซลร่วมกับข้อความแบบออโตรีเกรสซีฟ InternLumina-U2: การลดสัญญาณรบกวนแบบดิฟฟิวชันที่ถูกมาสก์บนรหัสแบบไม่ต่อเนื่อง
• งานที่อ้างว่าทำได้ — PixelUMM: ข้อความเป็นภาพ, ข้อความเป็นวิดีโอ, ภาพเป็นข้อความ, วิดีโอเป็นข้อความ InternLumina-U2: ทั้งหมดนั้นบวกกับการแก้ไขภาพและความเข้าใจแบบ 3 มิติ
• รูปแบบน้ำหนัก — PixelUMM: 128 .distcp ชาร์ด (~30 GB) ที่อยู่เบื้องหลัง.metadata ซึ่งเป็นดัชนีที่ซ่อนอยู่ InternLumina-U2: เจ็ด.safetensors ชาร์ดต่อชุดฮาร์ดแวร์ ตามเลย์เอาต์มาตรฐานของ Hugging Face

กระดานคะแนน โดยมีที่มาแนบมาด้วย
อ่านทุกแถวเสมือนเป็นข้ออ้างของห้องแล็บเอง ของ PixelUMM มาจาก preprint ของตัวเอง ส่วนของ InternLumina-U2 เป็นคำอธิบายของห้องแล็บเองว่าสิ่งเหล่านั้นเป็น "preliminary, partial" โดยตารางเปรียบเทียบฉบับเต็มถูกเลื่อนไปไว้ในรายงานทางเทคนิคที่ยังไม่ปรากฏ
• MMMU (การให้เหตุผลด้านภาพ) — PixelUMM 41.67 (ของผู้เขียนเอง) InternLumina-U2: ไม่ได้รายงาน
• ChartQA — PixelUMM 82.96 InternLumina-U2 86.52
• DocVQA — PixelUMM 90.42 InternLumina-U2: ไม่ได้รายงาน
• Video-MME (ไม่มีคำบรรยาย) — PixelUMM 57.33. InternLumina-U2 51.26.
• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.
• ภาพรวม GenEval — PixelUMM 0.83 เมื่อใช้ตัวเขียนพรอมป์ด้วย LLM, 0.77 เมื่อไม่ใช้ InternLumina-U2 0.81
• ภาพรวม DPG-Bench — PixelUMM 85.74, InternLumina-U2 87.10
• การสร้างวิดีโอ — PixelUMM VBench พาร์ต 1 คุณภาพ 84.10 / เชิงความหมาย 79.80, พาร์ต 2 รวม 83.24. InternLumina-U2: ไม่มีการรายงาน
• ความเข้าใจ 3 มิติ — PixelUMM: ไม่มีงานดังกล่าว InternLumina-U2 รายงาน 3D MM-Vet 41.8
การเปรียบเทียบนี้ไม่เสมอภาคกัน เพราะสองแล็บเผยแพร่ตารางที่แตกต่างกัน ไม่ใช่เพราะฝ่ายใดฝ่ายหนึ่งกำลังชนะ PixelUMM มีส่วนงานด้านการสร้างวิดีโอเต็มรูปแบบ แต่ไม่มีส่วนงานด้านการตัดต่อหรือ 3D ส่วน InternLumina-U2 อ้างว่าครอบคลุมหกกลุ่มงานและรายงานตารางเพียงบางส่วนในกลุ่มงานเหล่านั้น ตัวเลขข้ามแล็บบนชื่อเบนช์มาร์กเดียวกันไม่ใช่การวัดเดียวกัน — การแบ่งชุดข้อมูล พรอมต์ และการสุ่มตัวอย่างแตกต่างกัน — ดังนั้นให้ถือว่าแถวของ ChartQA และ GenEval อยู่ในระดับใกล้เคียงกันและพอเพียงแค่นั้น
การให้สิทธิ์คือจุดที่เรื่องนี้เลิกเป็นความเสมอ
นี่คือส่วนที่ไม่มีตาราง benchmark ไหนแสดงให้เห็น รีโพซิทอรี PixelUMM อยู่ภายใต้ Apache-2.0 และการ์ดก็ระบุไว้อย่างชัดเจน เช็กพอยต์เป็นอาร์ติแฟกต์แยกต่างหากภายใต้ NVIDIA One-Way Noncommercial License ซึ่งจำกัดไว้เฉพาะการวิจัยหรือการประเมินที่ไม่ใช่เชิงพาณิชย์ และไฟล์ซอร์สหนึ่งไฟล์ยังคงมีประกาศ CC BY-NC 4.0 ที่สืบทอดมาจาก DiT การใช้เพื่อการวิจัย: ได้ การนำไปใช้เป็นฟีเจอร์ผลิตภัณฑ์ภายใน: ต้องคุยกับฝ่ายกฎหมาย และอาจเป็นบทสนทนาสั้น ๆ
InternLumina-U2 เป็น Apache-2.0 แบบครบวงจร ทั้งโค้ดและเช็กพอยต์ทั้งสอง โดยไม่มีข้อยกเว้นแบบไม่ใช่เชิงพาณิชย์แยกต่างหาก สำหรับทีมที่ต้องส่งมอบงาน นั่นไม่ใช่ข้อได้เปรียบเล็ก ๆ — มันคือปัจจัยชี้ขาดทั้งหมด ทั้งสองโมเดลมีความสมบูรณ์ในระดับงานวิจัย มีเพียงหนึ่งเดียวเท่านั้นที่ใช้งานได้อย่างไม่มีข้อจำกัด
อันไหนที่ควรลองจริง ๆ และอย่างไร
ถ้างานของคุณคือการทำความเข้าใจวิดีโอ หรือคุณต้องการโมเดลที่สร้างวิดีโอและภาพจากชุดน้ำหนักชุดเดียว PixelUMM คือชิ้นงานที่สมบูรณ์กว่า และงานวิจัยของมันอ่านแล้วมีประโยชน์กว่า — แต่เป็นโครงการวิจัยภายใต้สัญญาอนุญาตแบบไม่ใช่เชิงพาณิชย์ ดังนั้นมันจึงเหมาะสำหรับการประเมินผล ไม่ใช่สำหรับใช้ในไปป์ไลน์ ถ้างานของคุณคือความกว้างของการสร้างแผนภูมิ เอกสาร และภาพ หรือคุณต้องการการแก้ไขและ 3D, InternLumina-U2 ครอบคลุมขอบเขตมากกว่า และไม่มีเพดานเรื่องสัญญาอนุญาต; ต้นทุนของมันคือว่าโครงข่ายหลักแบบ diffusion ขนาด 16B-A1B และตัวตัดคำ AToken หมายถึงต้องมีวิศวกรรมการให้บริการจริง และตัวเลขที่เผยแพร่ของมันระบุไว้อย่างชัดเจนว่ายังไม่สมบูรณ์
ณ เวลาที่เขียนนี้ ทั้งสองรุ่นยังไม่มีให้บริการบน hosted API ใด ๆ และนั่นรวมถึง OrcaRouter ด้วย — เราไม่ให้บริการ routing สำหรับทั้งสองรุ่นนี้. เมื่อสถานการณ์นั้นเปลี่ยนไป เหตุผลที่ควรเข้าถึงรุ่นเหล่านี้ผ่านเลเยอร์ routing แทนการเชื่อมต่อโดยตรง ก็เป็นเหตุผลเดียวกับที่ใช้ได้กับโมเดลที่เพิ่งเปิดตัวใหม่ทุกรุ่น: คีย์เดียวใช้ได้กับโมเดลกว่า 200 รุ่น ราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยบวกมาร์กอัป 0% และมี failover อัตโนมัติ เพื่อให้โมเดลที่ปรากฏว่าแย่กว่าที่ตารางของผู้ขายระบุไว้ถูกลดระดับได้ด้วยการเปลี่ยน route แทนการเขียน deployment ใหม่ จนกว่าจะถึงตอนนั้น คำแนะนำที่ตรงไปตรงมาก็คือคำแนะนำที่น่าเบื่อ — ดาวน์โหลดไลเซนส์แบบใดก็ตามที่อนุญาตให้ใช้กับกรณีการใช้งานของคุณ รันการประเมินของคุณเองบนข้อมูลของคุณเอง และอย่าวางแผนโดยอิงกับตัวเลขของห้องแล็บใด ๆ จนกว่าจะมีคนนอกห้องแล็บรันทดสอบซ้ำ
อะไรจะเปลี่ยนคำตอบ
สามเรื่อง เรียงตามระดับผลกระทบ การมีสัญญาอนุญาตเชิงพาณิชย์ครอบคลุมเช็กพอยต์ของ PixelUMM จะทำให้การเปรียบเทียบใกล้เคียงกันอย่างแท้จริง และจะยกระดับมันจาก "อ่านเปเปอร์" ไปเป็น "ประเมินเวต" รายงานทางเทคนิคจาก Shanghai AI Laboratory ที่แนบตารางเปรียบเทียบฉบับเต็มมาด้วย จะเปลี่ยนตัวเลขบางส่วนของ InternLumina-U2 ให้กลายเป็นสิ่งที่ตรวจสอบได้ และยังจะเผยให้เห็นว่าความกว้างระดับหกงานนั้นมีสัดส่วนเท่าใดที่ทัดเทียมกัน เทียบกับที่ลงลึกในระดับโทเคน และการทำซ้ำอย่างอิสระครั้งแรกของโมเดลใดโมเดลหนึ่ง — การรัน GenEval หรือ MVBench ซ้ำโดยทีมที่ไม่มีส่วนได้ส่วนเสียกับผลลัพธ์ — คือช่วงเวลาที่ทั้งสองสิ่งนี้เลิกเป็นตารางของผู้ขาย จนกว่าจะถึงตอนนั้น ตัวหนึ่งเป็นสถาปัตยกรรมแปลกใหม่ที่คุณทำได้เพียงศึกษา ส่วนอีกตัวหนึ่งเป็นสถาปัตยกรรมแปลกใหม่ที่คุณนำไปปล่อยใช้งานได้
