
InternLumina-U2 เทียบกับ Qwen2.5 Omni: โมเดล Omni ที่ Alibaba ปล่อยออกมา เทียบกับรุ่นที่ Shanghai AI Lab ยังคงน่าจับตามอง
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
InternLumina-U2 และ Qwen2.5 Omni ต่างก็เป็นคำตอบของความทะเยอทะยานเดียวกัน — โมเดลหนึ่งเดียวที่จัดการทุกโมดาลิตี้แทนที่จะเป็นกลุ่มผู้เชี่ยวชาญเฉพาะทาง — แต่มาจากสองรุ่นที่ห่างกัน Qwen2.5 Omni คือคำตอบที่เปิดตัวจริง: โมเดลน้ำหนักเปิดขนาด 7 พันล้านพารามิเตอร์ ปล่อยเมื่อเดือนมีนาคม 2025 อายุสิบเจ็ดเดือน ณ เวลาที่เขียน รับข้อความ รูปภาพ เสียง และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความหรือเสียงพูดสตรีมมิงธรรมชาติ InternLumina-U2 คือคำตอบของ Shanghai AI Laboratory เผยแพร่เป็นโค้ดอินเฟอเรนซ์เมื่อวันที่ 1 กันยายน 2026: โมเดล sparse diffusion ขนาด 16B พารามิเตอร์ที่อ้างว่ารับรู้ภาพ วิดีโอ และ 3D และสร้างและแก้ไขภาพผ่านอินเทอร์เฟซโทเคนไม่ต่อเนื่องร่วมกันชุดเดียว โมเดลหนึ่งของแนวคิด omni อยู่ในโปรดักชันมานานปีครึ่ง ส่วนอีกโมเดลเพิ่งเกิดวันเดียวและไม่มีใครสามารถรันได้ เพราะน้ำหนักของมันยังไม่มีอยู่จริง ช่องว่างระหว่างทั้งสองคือความแตกต่างระหว่างคำสัญญาที่รักษาไว้กับคำสัญญาที่ให้ไว้
omni ที่เปิดตัว: Qwen2.5 Omni
Qwen2.5 Omni สมควรถูกมองอย่างจริงจังในฐานะโมเดลพื้นฐาน (baseline) เพราะเป็นโมเดลโอเพนที่หาได้ยากซึ่งทำตามแนวคิด “รับรู้ทุกอย่าง ตอบได้ในทุกรูปแบบ” ได้จริง สถาปัตยกรรม Thinker-Talker จับคู่ Thinker ที่ประมวลผลข้อความเข้ากับ Talker ที่ทำหน้าที่สร้างเสียงพูด โดยใช้การเข้ารหัสตำแหน่งแบบมัลติโมดัลที่สอดคล้องตามเวลาเพื่อให้เสียงและวิดีโอซิงโครไนซ์กัน อินพุตรับได้ทั้งข้อความ รูปภาพ เสียง และวิดีโอ ส่วนเอาต์พุตสามารถเป็นข้อความพร้อมกับเสียงพูดในเทิร์นเดียวกันได้ โดยมีเสียงในตัวสี่เสียง ข้อจำกัดก็ถูกกล่าวถึงไว้พร้อมกับความสามารถ: บริบทมีขนาด 32K โทเค็น ไม่มีการเรียกใช้ฟังก์ชัน และไม่มีเอาต์พุตแบบมีโครงสร้าง อีกทั้งมันเป็นนักสนทนาแบบ omni มากกว่าเอเจนต์ สิ่งที่มันทำไม่ได้นั้นสำคัญที่ต้องเน้นสำหรับการเปรียบเทียบนี้—มันรับรู้ภาพ เสียง และวิดีโอได้ แต่ไม่สร้างสิ่งเหล่านั้นขึ้นมา “omni” ใน Qwen2.5 Omni คือการรับรู้รอบด้าน (omni-perception) พร้อมการสังเคราะห์เสียงพูดในฝั่งเอาต์พุต พิกเซลไหลเข้าไป แล้วถ้อยคำไหลออกมา
ประวัติผลงานเป็นเรื่องจริง โมเดลดังกล่าวถูกดาวน์โหลดหลายแสนครั้ง มี API ให้บริการผ่านแพลตฟอร์มของผู้พัฒนาเองและแพลตฟอร์มของบุคคลที่สามหลายแห่ง และใช้เวลาสิบเจ็ดเดือนในการสั่งสมควอนไทเซชัน เครื่องมือจากชุมชน และราคาที่เป็นที่รู้จัก — รายการบนเว็บรวมข้อมูลระบุว่าสำหรับข้อความคิดประมาณ $0.09 ต่ออินพุตโทเค็นล้านตัว และ $0.34 ต่อเอาต์พุตโทเค็นล้านตัว ส่วนเสียงถูกคิดแยกต่างหาก สิบเจ็ดเดือนนานพอที่จะทำแผนที่ทั้งจุดแข็งและข้อจำกัดของมันได้ดี นั่นคือสิ่งที่ความเป็นผู้ใหญ่มอบให้: ไม่ใช่ความสมบูรณ์แบบ แต่คือความคาดเดาได้
ผู้รอบด้านที่สัญญาไว้: InternLumina-U2
InternLumina-U2 กำลังพยายามไปให้ไกลกว่า Qwen2.5 Omni อีกหนึ่งก้าว และก้าวนั้นก็อยู่ในจุดที่ความยากซ่อนอยู่พอดี หลักการออกแบบของมันคือ การรับรู้และการสร้างควรแชร์อินเทอร์เฟซโทเคนแบบไม่ต่อเนื่องเดียวกัน กล่าวคือ แทนที่จะเป็นโมเดลภาษาที่รับรู้วิดีโอกับโมเดลดิฟฟิวชันอีกตัวที่ใช้สร้างภาพ กลับเป็นโครงข่ายหลักดิฟฟิวชันแบบ sparse MoE เพียงตัวเดียว — 16B รวม, 1B แอ็กทีฟ — ที่จะอ่านภาพ แผนภูมิ วิดีโอ หรือแอสเซ็ต 3 มิติ และสร้างภาพใหม่หรือการแก้ไขออกมา โดยใช้คำศัพท์ทางภาพแบบโค้ดบุ๊กแปดชุดที่ไม่ต่อเนื่องโดยสมบูรณ์ เพื่อให้แต่ละตำแหน่งภาพมีข้อมูลมากพอรองรับทั้งสองทิศทาง นี่เป็นข้อกล่าวอ้างที่ใหญ่กว่า Qwen2.5 Omni อย่างเป็นรูปธรรมมาก การจัดการให้อินพุตทุกโมดัลิตี้ไหลไปเป็นข้อความและคำพูดเป็นเรื่องหนึ่ง แต่การทำให้ค่าน้ำหนักชุดเดียวสร้างพิกเซลได้คล่องแคล่วพอๆ กับที่มันใช้เหตุผลเกี่ยวกับพิกเซลเหล่านั้นเป็นอีกเรื่องหนึ่ง
ขณะนี้ ข้อกล่าวอ้างนี้ก็ยังไม่สามารถพิสูจน์ได้เช่นกัน ห้องแล็บได้เผยแพร่โค้ดสำหรับการอนุมาน (inference code) หน้าโปรเจกต์พร้อมตาราง benchmark "เบื้องต้น ไม่สมบูรณ์" (preliminary, partial) และ Hugging Face stub ที่ว่างเปล่า ขณะที่ weights โค้ดฝึกโมเดล รายงานทางเทคนิค และซอฟต์แวร์สแตก Ascend-NPU ต่างก็ระบุไว้เพียงว่า "เร็วๆ นี้" (coming soon) ทั้งสิ้น ไม่มีการประเมินผลอย่างอิสระใดๆ เกิดขึ้น เพราะไม่มีอะไรให้ประเมิน สถาปัตยกรรมของ Qwen2.5 Omni ตรวจสอบได้ในสัปดาห์ที่เปิดตัว เนื่องจาก weights ถูกเผยแพร่มาพร้อมกับโมเดล ส่วนสถาปัตยกรรมของ InternLumina-U2 อ่านได้ในตอนนี้ แต่คุณภาพของมันยังเป็นเพียงคำสัญญาจากผู้พัฒนาอยู่ดี
กระดานคะแนน
เนื่องจากโมเดลหนึ่งในสองนี้มีประวัติยาวนานสิบเจ็ดเดือน ในขณะที่อีกโมเดลหนึ่งมีโค้ดเพียงวันเดียว แถวจึงแสดงที่มาของข้อมูลแทนที่จะแสร้งว่าคอลัมน์ต่างๆ สมมาตรกัน
• อายุ — Qwen2.5 Omni: เปิดตัวเมื่อเดือนมีนาคม 2025 ใช้งานจริงมา 17 เดือน มียอดดาวน์โหลดหลายแสนครั้ง ส่วน InternLumina-U2: เผยแพร่โค้ดอินเฟอเรนซ์เมื่อวันที่ 1 กันยายน 2026 ไม่มีการดาวน์โหลดเลย และไม่มีการรันโดยอิสระแม้แต่ครั้งเดียว
• รูปแบบ — Qwen2.5 Omni: ~7B แบบ end-to-end, Thinker-Talker พร้อมการเข้ารหัสตำแหน่งแบบ multimodal ที่สอดคล้องตามเวลา InternLumina-U2: 16B รวม / 1B แอ็กทีฟ sparse MoE diffusion LLM พร้อมตัวแปลงโทเคนภาพแบบไม่ต่อเนื่องแปดโค้ดบุ๊ก
• อินพุต — ทั้งคู่รองรับข้อความและรูปภาพ; Qwen2.5 Omni รองรับเสียงและวิดีโอเพิ่มเติมสำหรับการแชทแบบ omni; InternLumina-U2 อ้างว่ารองรับความเข้าใจวิดีโอจากเฟรมที่สุ่มตัวอย่าง 64 เฟรม และความเข้าใจ 3D จากมุมมอง GLB/GLTF ที่เรนเดอร์ด้วย Blender เพิ่มเติม
• เอาต์พุต — Qwen2.5 Omni: ข้อความและเสียงพูดแบบสตรีมมิ่ง สี่เสียง InternLumina-U2: อ้างว่ารองรับข้อความ การสร้างภาพจากข้อความสูงสุด 1024×1024 และการแก้ไขภาพตามคำสั่ง
• แนวหน้าด้านการสร้าง — Qwen2.5 Omni: สร้างคำพูดและเสียง ไม่ใช่พิกเซล ส่วน InternLumina-U2: พยายามสร้างและแก้ไขพิกเซลภายในโมเดล discrete-token ตัวเดียวกันกับที่ใช้สำหรับอ่าน
• น้ำหนักและใบอนุญาต — ทั้งคู่เป็นโอเพนเวต Apache-2.0 ในหลักการ; ของ Qwen2.5 Omni ดาวน์โหลดได้แล้ววันนี้ ส่วนของ InternLumina-U2 ยังไม่เปิดเผยต่อสาธารณะ
• การให้บริการ — Qwen2.5 Omni: มี hosted API และ self-host (การปรับใช้แบบ full-precision ที่หนัก); รู้จัก context 32K และไม่รองรับ function calling ส่วน InternLumina-U2: ไม่สามารถให้บริการได้ — ไดรเวอร์ที่เผยแพร่คาดหวัง checkpoint ที่ไม่มีอยู่จริง
• {{1}}ตัวเลขสำคัญ{{/1}} — {{2}}Qwen2.5 Omni: อยู่ในลีดเดอร์บอร์ด OmniBench มาอย่างยาวนาน (คะแนนประมาณ 0.561 บนลีดเดอร์บอร์ดปัจจุบัน); InternLumina-U2: ChartQA 86.52, MathVision 33.22, GenEval 0.81{{/2}} — {{3}}ทั้งหมดเป็นตัวเลขที่ผู้พัฒนารายงาน โดยเป็นเพียงข้อมูลเบื้องต้นและบางส่วน.{{/3}}

ทำไมช่องว่างระหว่างวัยจึงเป็นเรื่องราวที่แท้จริง
วางเรื่องอายุของโมเดลไว้ก่อน ความแตกต่างที่แท้จริงก็คือเส้นขอบเขตที่แต่ละโมเดลหยุดอยู่ Qwen2.5 Omni เลือกออมนิในเวอร์ชันที่จัดการได้จริง: รับรู้ในวงกว้าง ตอบกลับด้วยภาษาหรือเสียง และปล่อยการสังเคราะห์ภาพและวิดีโอให้เป็นหน้าที่ของโมเดลสร้างเนื้อหาเฉพาะทางที่อยู่จุดอื่นในสแต็ก การแบ่งงานแบบนี้คือวิธีที่ระบบมัลติโมดัลระดับโปรดักชันแทบทุกระบบในปี 2026 ถูกสร้างขึ้น และเป็นเหตุผลที่ Qwen2.5 Omni เปิดตัวได้ในปี 2025 แล้วยังคงมีประโยชน์ต่อในปี 2026 — มันทำหน้าที่ในส่วนของตัวเองได้ดีและประกอบเข้ากับส่วนที่เหลือได้ InternLumina-U2 คือการเดิมพันว่าการแบ่งงานนี่แหละคือตัวปัญหา: โมเดลที่ถูกบีบให้แทนทุกอย่าง — ทั้งการรับรู้และการสร้าง — ด้วยคำศัพท์แบบไม่ต่อเนื่องชุดเดียวกันที่ใช้ร่วมกัน จะเรียนรู้ความเข้าใจภาพที่ลึกซึ้งกว่าโมเดลที่ต้องแค่บรรยายภาพเท่านั้น การเดิมพันนั้น ถ้ามันได้ผล มันคือผลลัพธ์ที่สำคัญกว่า ถ้าไม่ได้ผล InternLumina-U2 ก็จะจบลงด้วยการเป็น Qwen2.5 Omni ที่ช้ากว่า ใช้ทรัพยากรมากกว่า และมีตัวสร้างภาพติดผนวกเข้ามาในน้ำหนักชุดเดียวกันอย่างงุ่มง่าม การแข่งขันทั้งหมดนี้ — และมันคือการแข่งขันระหว่างดีไซน์ที่ส่งมอบออกสู่ตลาดแล้วกับสมมติฐาน ไม่ใช่ระหว่างโมเดลที่รันได้จริงสองตัว — อยู่ที่ว่าสถาปัตยกรรมที่ยากกว่านั้นจะพิสูจน์ความคุ้มค่าของตัวเองได้หรือไม่

การ์ด Hugging Face ของ Qwen/Qwen2.5-Omni-7B ซึ่งบันทึกเมื่อวันที่ 27 สิงหาคม 2026 — ภาพรวม Thinker-Talker, สัญญาอนุญาต Apache-2.0 และแท็กโมดาลิตีด้านข้อความ รูปภาพ เสียง และวิดีโอของโมเดล
หนึ่งปีครึ่งของการดาวน์โหลด ซื้ออะไรได้จริง
ความเป็นผู้ใหญ่ไม่ใช่ "ไวบ์" แต่คือรายการสิ่งที่คุณรู้ กับ Qwen2.5 Omni คุณรู้ว่าบริบท 32K เป็นข้อจำกัดตายตัว และคุณสามารถออกแบบงานให้เดินเลี่ยงมันได้ คุณรู้ว่าไม่มีเส้นทางสำหรับการเรียกใช้ฟังก์ชัน และคุณจะไม่แสร้งว่ามีเส้นทางนั้น คุณรู้คร่าวๆ ว่าการดีพลอยโมเดลสักตัวมีค่าใช้จ่ายเท่าไร ทั้งผ่าน hosted API และบน GPU ของคุณเอง เพราะโมเดลนี้ถูกตั้งราคาและถูกนำไปรันโดยผู้คนมากพอจนตัวเลขต่างๆ ตกลงเป็นที่เรียบร้อยแล้ว คุณรู้ว่าอันดับบน OmniBench มีอยู่จริง เพราะลีดเดอร์บอร์ดอิสระได้ติดตามมันมานานกว่าหนึ่งปี ส่วน InternLumina-U2 ไม่มีคำกริยาเหล่านั้นใช้ได้แม้แต่คำเดียว — คุณไม่รู้ และไม่มีทางรู้ได้ เพราะไม่มี artifact ตัวจริงให้ตรวจสอบ เมื่อโมเดลอายุแค่วันเดียวและไร้น้ำหนัก ทุกข้อกล่าวอ้างเกี่ยวกับมันจึงเป็นเพียงการประกาศเจตนา ความไม่สมมาตรเช่นนั้นไม่ใช่การตำหนิตัววิทยาศาสตร์ หากคือท่าทีเชิงญาณวิทยาที่ถูกต้องสำหรับใครก็ตามที่กำลังเลือกว่าจะต่อยอดสร้างบนอะไร

ที่เก็บ GitHub ของ InternLM/InternLumina-U2 ซึ่งบันทึกเมื่อวันที่ 2 กันยายน 2026 — หน้าแลนดิ้งของที่เก็บที่เปิดเผยสถาปัตยกรรมต่อสาธารณะ — คำอธิบาย สัญญาอนุญาต และสคริปต์สำหรับการอนุมาน — ขณะที่ตัวน้ำหนักเองไม่ได้อยู่ในทรีของที่เก็บ
การตัดสินใจกำหนดเส้นทางที่ถูกนำเสนออย่างตรงไปตรงมา
เราจะบอกสถานะความพร้อมใช้งานอย่างตรงไปตรงมา: OrcaRouter ไม่ได้โฮสต์ InternLumina-U2 เพราะไม่มีน้ำหนัก (weights) ให้ใครโฮสต์ และตอนนี้เราก็ไม่ได้ให้บริการ Qwen2.5 Omni เช่นกัน — มันทำงานผ่าน API ของนักพัฒนาเองและแพลตฟอร์มของบุคคลที่สาม ดังนั้นบทเรียนเรื่องการจัดเส้นทาง (routing) ตรงนี้จึงเกี่ยวกับท่าที (posture) ไม่ใช่การเรียกใช้ทั้งสองรุ่นนี้ผ่านคีย์เดียวในวันนี้ รูปแบบที่ยั่งยืนคือรูปแบบที่การตัดสินใจระหว่างโมเดลที่เติบโตเต็มที่แล้วกับตัวใหม่ทุกรายในที่สุดก็ต้องมาถึง: เก็บโมเดลที่พิสูจน์แล้วไว้บนเส้นทางหลัก โดยที่ API เดียวครอบคลุม 200+ โมเดล และส่วนเพิ่ม 0% แบบส่งผ่าน หมายความว่าคุณจ่ายเท่าราคาที่ผู้ให้บริการกำหนดและไม่ต้องจ่ายเพิ่ม; ชี้ตัวใหม่ที่ยังไม่ผ่านการพิสูจน์ไปยังเส้นทางทดสอบพร้อมการสลับระบบอัตโนมัติ (automatic failover) เพื่อว่าเมื่อมันชะงัก เบี่ยงเบน หรือส่งคืนสิ่งที่ไม่สมเหตุสมผลเป็นครั้งแรก การเรียกใช้ก็จะหลุดไปยังโมเดลที่มีประวัติการทำงาน 17 เดือน นั่นคือวิธีที่คุณจะประเมินสถาปัตยกรรมใหม่ที่มีความทะเยอทะยานอย่าง InternLumina-U2 ในวันที่น้ำหนักของมันถูกปล่อยออกมา — โดยไม่ต้องทำให้เส้นทางผลิตที่คุณพึ่งพาอยู่แล้วต้องเสี่ยง
คำตัดสิน
Qwen2.5 Omni คือโมเดล omni ที่คุณสามารถนำมาสร้างต่อได้ตั้งแต่วันนี้: ส่งมอบแล้ว ดาวน์โหลดได้ มีเอกสารครบถ้วน รู้ขีดจำกัด และราคาคงที่ InternLumina-U2 คือโมเดล omni ที่ต้องจับตามอง: ก้าวข้ามโครงสร้างทางสถาปัตยกรรมอย่างแท้จริง ไปไกลกว่าการรับรู้สู่การสร้างสรรค์ อยู่ภายใต้สัญญาอนุญาต Apache-2.0 โค้ดเปิดเผยต่อสาธารณะ และน้ำหนักโมเดลกำลังรอการเผยแพร่ หากแนวคิด multi-codebook ของห้องแล็บผ่านการทดสอบอย่างอิสระ InternLumina-U2 จะไม่ใช่แค่คู่แข่งของ Qwen2.5 Omni หากแต่เป็นรุ่นถัดไปของแนวคิดเดียวกัน หากไม่ผ่าน โมเดลเอนกประสงค์อายุสิบเจ็ดเดือนที่เปิดตัวจริงก็ยังคงอยู่ที่นั่น ทำงานที่มันทำมาตลอด จับตาดูหน้า stub ของ Hugging Face ไว้ คำตัดสินรออยู่ที่ไฟล์ safetensors ไม่ใช่บทความนี้
