
InternLumina-U2 vs Gemini Omni 1.1 Flash: โมเดลที่คุณยังรันไม่ได้ vs โมเดลที่จ่ายเป็นวินาที
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
หากเส้นตายของคุณคือสัปดาห์นี้ การเปรียบเทียบนี้มีคำตอบเพียงหนึ่งประโยค Gemini Omni 1.1 Flash คือโมเดลสร้างวิดีโอที่ Google เปิดให้ใช้งานทั่วไป — คุณเรียกใช้มันผ่าน API มันจะส่งคลิปที่มีเสียงซิงค์กลับมา และคุณจ่ายเงินต่อวินาทีของผลลัพธ์ InternLumina-U2 คือโมเดลวิจัยแบบ Apache-2.0 ที่ Shanghai AI Laboratory เผยแพร่อย่างเงียบ ๆ — คุณดาวน์โหลดโค้ดอินเฟอเรนซ์ได้ แต่ไม่สามารถดาวน์โหลดน้ำหนักของโมเดลได้ ซึ่งทางแล็บยังคงระบุว่า “เร็ว ๆ นี้” หนึ่งคือผลิตภัณฑ์ที่คุณซื้อได้ทันที อีกหนึ่งคือการเดิมพันบนกระดาษที่คุณไม่สามารถรันมันได้เลย คำถามที่น่าสนใจคือ ทำไมใครถึงเอามันมาเปรียบเทียบในประโยคเดียวกันตั้งแต่แรก และแต่ละอย่างบอกอะไรคุณเกี่ยวกับทิศทางของงานมัลติโมดัลแบบเปิดในช่วงปลายปี 2026
ทุกสิ่งที่อยู่ด้านล่างนี้มีการระบุแหล่งที่มาไว้แล้ว รายละเอียดของ InternLumina-U2 มาจากคลังที่เก็บ GitHub และหน้าโครงการที่ห้องปฏิบัติการเผยแพร่เมื่อวันที่ 1 กันยายน 2026 — วันเดียวกับที่ Hugging Face stub ที่ว่างเปล่าปรากฏขึ้น — และตัวเลขเกณฑ์มาตรฐานทุกตัวของมันเป็นข้อมูลที่ผู้ขายรายงาน เป็นข้อมูลเบื้องต้น และยังไม่มีการทำซ้ำเพื่อยืนยันผล รายละเอียดของ Gemini Omni 1.1 Flash มาจากเอกสารเผยแพร่ของ Google เองและหน้าปริมาณราคาสำหรับโมเดลที่เปิดให้ใช้งานทั่วไปเมื่อวันที่ 27 สิงหาคม 2026
สองคำตอบสำหรับคำถาม "multimodal" เดียวกัน
ทั้งสองโมเดลอยู่ภายใต้คำนิยามกว้างๆ ร่วมกันว่า “หนึ่งโมเดล หลายโมดาลิตี้” และป้ายชื่อร่วมกันนี้คือเหตุผลเดียวที่ทำให้ทั้งคู่ถูกนำมาเปรียบเทียบกัน แต่ภายใต้คำนิยามนั้น พวกมันแทบไม่มีอะไรที่เหมือนกันเลย Gemini Omni 1.1 Flash เป็นบริการสร้างสรรค์ผลงานที่เน้นวิดีโอเป็นหลัก แบบปิดและโฮสต์อยู่บนคลาวด์ คุณสามารถป้อนข้อความ รูปภาพ คลิปอ้างอิงสั้นๆ หรือเสียง แล้วมันจะผลิตวิดีโอความละเอียด 720p ความยาวสูงสุดสิบวินาที พร้อมคำพูด ดนตรี และเอฟเฟกต์เสียงที่ผสานลงไปในตัว ขยายต่อได้ครั้งละสิบวินาที จนได้ฉากยาวสี่สิบวินาที มันทำความเข้าใจคลิปที่คุณมีอยู่แล้ว — รอบการต่อวิดีโอตอนนี้จะพิจารณาบริบทย้อนหลังสูงสุดสิบวินาที แทนที่จะเป็นหนึ่งวินาทีแบบเวอร์ชันก่อนหน้า — และรองรับการควบคุมเฟรมแรก/เฟรมสุดท้าย เพื่อให้คุณกำหนดจุดเริ่มต้นและจุดสิ้นสุดของช็อต แล้วปล่อยให้โมเดลสร้างส่วนกลางขึ้นมาเอง มันคือเครื่องมือสำหรับสร้างภาพเคลื่อนไหว ที่ขายเป็นรายวินาที
InternLumina-U2 เป็นการเดิมพันในทิศทางตรงกันข้าม: โมเดล mixture-of-experts แบบ sparse เพียงตัวเดียว มีพารามิเตอร์ทั้งหมด 16B แต่ใช้จริง 1B ซึ่งอ้างว่าสามารถเข้าใจภาพ วิดีโอ และสินทรัพย์ 3D และสามารถสร้างและแก้ไขภาพผ่านอินเทอร์เฟซโทเคนแบบไม่ต่อเนื่องร่วมกันเพียงหนึ่งเดียว ด้านภาพของมันเป็นแบบไม่ต่อเนื่องโดยสมบูรณ์ — โค้ดบุ๊กเสริมแปดชุดจากโทเคนไนเซอร์ที่ห้องแล็บเรียกว่า AToken ดังนั้นแต่ละตำแหน่งภาพจึงถูกอธิบายด้วยรหัสแปดตัวแทนที่จะเป็นหนึ่งตัว — และด้านภาษาเป็นแกนหลักแบบ diffusion ซึ่งห้องแล็บขยายมาจาก LLaDA-2.0 แนวคิดคือความเข้าใจและการสร้างควรเสริมซึ่งกันและกันในชุดน้ำหนักเดียว แทนที่จะถูกประกอบเข้าด้วยกันจากโมเดลเฉพาะทาง ว่ามันจะได้ผลหรือไม่นั้น ณ ตอนนี้ยังตอบไม่ได้: โมเดลนี้ไม่สามารถรันได้ที่ไหนเลย เพราะน้ำหนักไม่มีอยู่ในที่สาธารณะ
กระดานคะแนน อย่างที่มันเป็นอยู่น่ะ
กระดานคะแนนที่ซื่อสัตย์สำหรับคู่นี้ต้องระบุที่มาของข้อมูลในทุกแถว เนื่องจากคอลัมน์หนึ่งเป็นผลิตภัณฑ์ที่วางจำหน่ายแล้วซึ่งมีราคาเปิดเผย ส่วนอีกคอลัมน์หนึ่งเป็นข้อกล่าวอ้างจากงานวิจัยที่ยังไม่เผยแพร่ซึ่งไม่มีราคาเลย
• มันคืออะไร — Gemini Omni 1.1 Flash: โมเดลสร้างและแก้ไขวิดีโอแบบโฮสต์ (รหัสโมเดล gemini-omni-1.1-flash) GA 27 สิงหาคม 2026. InternLumina-U2: โมเดล LLM แบบ diffusion แบบโอเพนไซเอนซ์สำหรับความเข้าใจภาพแบบ omni-visual การสร้างและการแก้ไขภาพ เผยแพร่โค้ดเมื่อ 1 กันยายน 2026.
• น้ำหนัก — Gemini Omni 1.1 Flash: ไม่มี ปิดและให้บริการแบบโฮสต์เท่านั้น InternLumina-U2: ยังไม่มีเหมือนกัน แต่ใช้ใบอนุญาต Apache-2.0 และระบุไว้ชัดเจนว่า “เร็วๆ นี้”
• ผลลัพธ์ที่คุณได้รับ — Gemini Omni 1.1 Flash: คลิป 720p ยาว 10 วินาทีพร้อมเสียง ขยายได้ถึง 40 วินาที; อัปสเกลเป็น 1080p และ 4K; พร้อมข้อความประกอบ. InternLumina-U2: ยังไม่มีอะไร — แค่โค้ดอินเฟอเรนซ์และโรดแมป.
• สิ่งที่รับเข้า — Gemini Omni 1.1 Flash: ข้อความ รูปภาพ วิดีโอ (สูงสุด ~131K โทเคนอินพุต; คลิป 10 วินาที 3 คลิปต่อพรอมป์ต์) เสียง InternLumina-U2: รองรับข้อความ ภาพธรรมชาติ แผนภูมิที่มีจุดข้อมูลหนาแน่น วิดีโอที่สุ่มตัวอย่างจาก 64 เฟรม และแอสเซ็ต 3D แบบ GLB/GLTF ที่เรนเดอร์เป็นมุมมองสีและความลึก 64 มุม
• วิธีเรียกใช้ — Gemini Omni 1.1 Flash: ใช้ Gemini API ของ Google ผ่าน stateful Interactions API; ผู้ใช้ทั่วไปเข้าถึงได้ผ่าน Google Flow สำหรับสมาชิก AI Plus, Pro และ Ultra ส่วน InternLumina-U2: โฮสต์เองเท่านั้น และเฉพาะหลังจากที่ปล่อย weights แล้ว; โค้ดต้องการไดเรกทอรี checkpoint แบบแยกส่วน, น้ำหนักตัวแปลงโทเคน AToken, FlashAttention และ Blender 4.5 สำหรับเส้นทาง 3D
• ราคาเท่าไร — Gemini Omni 1.1 Flash: $0.03/วินาที ที่ 360p แบบร่าง, $0.10/วินาที ที่ 720p, $0.15/วินาที ที่ 1080p, $0.30/วินาที ที่ 4K โดยมีอัตราค่าโทเคนอยู่ที่ $1.50 ต่อล้านโทเคนนำเข้า และ $9.00 ต่อล้านโทเคนสำหรับข้อความส่งออก InternLumina-U2: ค่าใช้จ่ายเท่ากับต้นทุน GPU ของคุณเอง เมื่อมันถูกสร้างขึ้นมาแล้ว

คอลัมน์ทั้งสองไม่ได้วัดบนแกนเดียวกัน ฝั่ง Gemini มีการตั้งราคา ให้บริการ และพร้อมใช้งานได้ทันที ขณะที่ฝั่ง InternLumina เป็นเพียงข้อกำหนดของคุณสมบัติของโมเดลที่ยังไม่เป็นโมเดลจริง
ส่วนที่ยังเป็นปัจจุบันจริงๆ: GA ของ Gemini Omni 1.1 Flash
Gemini Omni 1.1 Flash สร้างความสำคัญได้ด้วยตัวมันเองในสัปดาห์นี้ เพราะนี่คือจังหวะที่ไลน์วิดีโอ omni ของ Google ไม่ได้เป็นเพียงตัวอย่างอีกต่อไป โดยเอ็นด์พอยต์ตัวอย่าง Gemini Omni Flash รุ่นก่อนหน้ามีกำหนดปิดทำการในวันที่ 30 กันยายน 2026 และโมเดล GA ตัวนี้คือตัวแทนที่นักพัฒนาจะถูกย้ายไปใช้งาน รายการอัปเกรดนั้นเป็นรูปธรรม: การต่อฉากความยาวสี่สิบวินาทีที่สร้างจากช่วงเพิ่มทีละสิบวินาที, การควบคุมคีย์เฟรมที่ให้คุณกำหนดเฟรมแรกและเฟรมสุดท้าย แล้วให้โมเดลสร้างฟุตเทจที่เชื่อมระหว่างกัน, คลิปอ้างอิงความยาวไม่เกินสามวินาทีเพื่อรักษาความคงเส้นคงวาของตัวละครหรือฉาก, รวมถึงชั้นความละเอียดดราฟต์ 360p ที่คิดราคาหนึ่งในสามของ 720p แต่ประมวลผลเร็วขึ้นถึง 60% สำหรับทำซ้ำปรับพรอมป์ตก่อนเรนเดอร์รอบสุดท้ายที่มีต้นทุนสูง หากคุณสร้างไปป์ไลน์วิดีโอ ตารางราคา — $0.10 ต่อหนึ่งวินาทีที่ 720p, $1.01 ต่อคลิปสิบวินาที, ประมาณ $4 สำหรับฉาก 720p สี่สิบวินาทีที่เกิดจากการเรียกขยายสี่ครั้ง — คือตัวเลขที่จะเปลี่ยนโมเดลต้นทุนของคุณ
สิ่งเหล่านั้นไม่ได้ทำให้มันเป็นคู่แข่งของ InternLumina-U2 ในเชิงปฏิบัติการแต่อย่างใด Gemini Omni 1.1 Flash สร้างภาพเคลื่อนไหว ส่วน InternLumina-U2 หากคำกล่าวอ้างของมันยังยืนหยัดเมื่อต้องสัมผัสกับน้ำหนักจริง ก็จะเข้าใจการเคลื่อนไหวและสร้างภาพนิ่ง ทีมที่ต้องการวิดีโอผลิตภัณฑ์ในไตรมาสนี้ไม่ได้เลือกจากสองตัวนี้ — โมเดล Gemini เป็นรุ่นเดียวในสองรุ่นนี้ที่เรียกใช้งานได้จริง และมันสามารถเข้าถึงได้ผ่าน API ของ Google เองและแพลตฟอร์มของบุคคลที่สามหลายแห่ง

เอกสาร "Models" ของ Gemini API บนเว็บไซต์นักพัฒนา AI ของ Google บันทึกเมื่อวันที่ 2 กันยายน 2026 — หน้าที่แสดงรายชื่อตระกูล Gemini รุ่นปัจจุบัน โดยมีไลน์ Gemini Omni อยู่ในเมนูนำทางแถบด้านข้าง
ส่วนที่ไม่ทันสมัยเลย: InternLumina-U2
การเปิดตัว InternLumina-U2 เมื่อวันที่ 1 กันยายนเป็นแบบเงียบที่สุดเท่าที่จะเงียบได้: คอมมิตสามรายการไปยังคลังที่เก็บ GitHub, หน้าโปรเจกต์, stub ขนาด 28 ไบต์บน Hugging Face ซึ่งเนื้อหาทั้งหมดเป็นเพียงส่วนหัวของลิขสิทธิ์ Apache-2.0 และไม่มีการประกาศใดๆ สิ่งที่เปิดเผยต่อสาธารณะอย่างแท้จริงคือชุดเครื่องมือสำหรับรันอินเฟอเรนซ์และสถาปัตยกรรม และทั้งสองสิ่งนี้คุ้มค่าแก่การอ่านอย่างละเอียด precisely เพราะยังไม่มีใครสามารถทดสอบตัวโมเดลได้ คลังที่เก็บแสดงไดรเวอร์ที่มีจุดเข้าใช้งานหนึ่งจุดต่อหนึ่งงาน — ข้อความ, การสังเคราะห์ภาพจากข้อความสูงสุด 1024×1024, ความเข้าใจภาพบนภาพธรรมชาติและแผนภูมิข้อมูลหนาแน่น, การแก้ไขภาพตามคำสั่งพร้อมโหมด dual-CFG ที่เลือกได้, ความเข้าใจวิดีโอบนเฟรมสุ่มตัวอย่าง 64 เฟรม และความเข้าใจ 3D บนมุมมอง GLB/GLTF ที่เรนเดอร์ด้วย Blender ข้อเดิมพันเชิงออกแบบคือ คลังคำศัพท์ภาพแบบไม่ต่อเนื่องหลายโค้ดบุ๊ก (multi-codebook discrete visual vocabulary) จะช่วยให้แกนหลักเดียวสามารถจัดการทั้งหมดนี้ได้โดยไม่ทำให้ลำดับความยาวพองโต — นี่คือแนวคิดเดียวกันกับ "โทเคนภาพควรบรรจุข้อมูลได้มากขึ้น" ที่ขับเคลื่อนโมเดลวิดีโอแบบ codec-native แต่ถูกนำมาประยุกต์ใช้กับอินเทอร์เฟซแบบผสานระหว่างการเข้าใจและการสร้าง

ที่เก็บ GitHub InternLM/InternLumina-U2 ซึ่งบันทึกเมื่อวันที่ 2 กันยายน 2026 — หน้าแลนดิ้งของที่เก็บภายใต้ใบอนุญาต Apache-2.0 พร้อมคำอธิบาย "Multi-Codebook Diffusion Large Language Model" คอมมิตสามรายการ และสคริปต์อินเฟอเรนซ์เฉพาะงาน ซึ่งเป็นทั้งหมดที่เผยแพร่สู่สาธารณะในตอนนี้
ตาราง benchmark บนหน้าโปรเจกต์ถูกติดป้ายว่า "preliminary, partial results" โดยห้องแล็บเอง และตัวเลขที่มีอยู่นั้นให้ผลทั้งสองทาง: ตัวเลขที่แข็งแกร่งสำหรับชาร์ตและเอกสาร (ChartQA 86.52, CharXiv-DQ 83.65, รายงานจากผู้พัฒนาระบบ) อยู่เคียงข้าง GenEval ที่ได้ 0.81 ซึ่งตามหลัง 0.89 ของอย่างน้อยหนึ่งโมเดลที่ห้องแล็บอ้างว่าตนเหนือกว่า ไม่มีการประเมินจากภายนอกอย่างเป็นอิสระ เพราะไม่มีโมเดลให้ประเมิน ทุกอย่างที่เกี่ยวกับคุณภาพจริงยังคงเป็นเพียงข้อกล่าวอ้าง จนกว่าไฟล์ safetensors จะปรากฏใน Hugging Face stub ที่ว่างเปล่านั้น
สิ่งที่เลเยอร์การกำหนดเส้นทางทำเมื่อมีเพียงฝั่งเดียว
นี่คือการเปรียบเทียบแบบที่มุมมองเรื่อง routing จริง ๆ แล้วเกี่ยวกับเวลา ไม่ใช่ทางเลือก เราจะไม่แสร้งทำเป็นว่า OrcaRouter ให้บริการ InternLumina-U2 — ไม่มีใครทำได้ เพราะยังไม่มีการปล่อยค่าน้ำหนัก (weights) — และ Gemini Omni 1.1 Flash ก็ไม่ได้อยู่ในแคตตาล็อกของเราเช่นกัน คุณเข้าถึงมันได้ผ่าน API ของ Google เอง จุดประสงค์ที่แท้จริงของ routing layer ในช่องว่างนี้คือการรักษาทางเลือกของคุณให้เปิดกว้าง โดยไม่ต้องสร้างไปป์ไลน์ขึ้นมาใหม่ถึงสองครั้ง กลไกคือโมเดลแบบส่งผ่าน (pass-through): เมื่อโมเดลของผู้ให้บริการที่โฮสต์ไว้ถูกเพิ่มเข้าในแคตตาล็อก ราคารายการที่ผู้ให้บริการกำหนดไว้จะถูกส่งผ่านที่มาร์กอัป 0% อัตราต่อวินาทีที่ผู้ให้บริการประกาศไว้จึงเป็นอัตราต่อวินาทีที่คุณจ่าย ผ่านคีย์เดียวแทนการทำสัญญาแยกรายผู้ให้บริการ และเมื่อค่าน้ำหนักภายใต้ Apache-2.0 อย่าง InternLumina-U2 ถูกปล่อยออกมาในที่สุด การตัดสินใจที่สมเหตุสมผลไม่ใช่การรื้อสแตกวิดีโอที่ทำงานได้ดีอยู่แล้วทิ้ง — แต่คือการนำโมเดลใหม่ขึ้นตั้งบนเส้นทางทดสอบที่อยู่เบื้องหลังระบบ failover อัตโนมัติ เพื่อที่ว่าเมื่อโมเดล diffusion ที่ยังไม่ผ่านการพิสูจน์แสดงพฤติกรรมผิดปกติเป็นครั้งแรก การเรียกใช้จะถอยกลับไปยังโมเดลที่คุณไว้ใจอยู่แล้วโดยไม่ต้องแก้ไขโค้ด ลองสิ่งใหม่ในจุดที่มันทำร้ายคุณไม่ได้ แล้วจัดเส้นทางให้กับสิ่งที่ทำเงินให้คุณ
คำตัดสิน
{{1}}หากคุณต้องการวิดีโอในเดือนนี้ การตัดสินใจถูกกำหนดไว้แล้วให้คุณ: {{2}}Gemini Omni 1.1 Flash มีจริง ตั้งราคาแล้ว และเปิดให้ใช้งานทั่วไปแล้ว ขณะที่ InternLumina-U2 ยังไม่มีใครเรียกใช้งานได้{{/2}} {{3}}หากคุณกำลังจับตาดูว่าวงการวิจัยมัลติโมดัลแบบเปิดกำลังไปทางไหน InternLumina-U2 คือสิ่งที่น่าสนใจกว่า — เป็นการเดิมพันแบบ fully-discrete และ multi-codebook ที่หายากจากแล็บใหญ่ อยู่ภายใต้สัญญา Apache-2.0 โดยสถาปัตยกรรมถูกเปิดเผยต่อสาธารณะแล้ว และน้ำหนักของโมเดลก็น่าจะตามมาในไม่ช้า{{/3}} {{4}}มองที่รีโพสิทอรีเสมือนตัวอย่างทิศทางงานวิจัย มองโมเดลวิดีโอแบบ GA เป็นเครื่องมือที่คุณต่อยอดได้ตั้งแต่วันนี้ และอย่าให้ป้ายชื่อ "มัลติโมดัล" ที่ใช้ร่วมกันทำให้คุณเข้าใจผิดว่าพวกมันแข่งขันเพื่อจุดประสงค์เดียวกัน{{/4}}
