
Qwen3.8-Omni-Flash vs InternLumina U2: ประสาทสัมผัสแบบเช่า vs ค่าน้ำหนักแบบเป็นเจ้าของ
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
วิธีที่มีประโยชน์ในการเปรียบเทียบ Qwen3.8-Omni-Flash กับ InternLumina U2 ไม่ใช่การเทียบทีละแถวของ benchmark เพราะทั้งสองไม่ได้ปรากฏอยู่ในชุดเดียวกัน สิ่งที่ควรถามคือ ใครบ้างที่ได้รับอนุญาตให้รันมัน Qwen3.8-Omni-Flash ของผู้จำหน่าย ซึ่งเปิดให้ลูกค้า API ตั้งแต่ 18 กันยายน 2026 เป็นโมเดลปิดบนแพลตฟอร์มของผู้จำหน่ายเอง: คอนเท็กซ์หนึ่งล้านโทเคน, เสียงและวิดีโอต่อเนื่องได้ถึงหนึ่งชั่วโมงต่อการเรียกหนึ่งครั้ง, เอาต์พุตเป็นข้อความเท่านั้น และไม่มีเวต InternLumina U2 ของ Shanghai AI Laboratory เป็นโมเดล diffusion แบบ mixture-of-experts ขนาด 16B-A1B ภายใต้สัญญาอนุญาต Apache 2.0 ซึ่งเช็กพอยต์สำหรับ Ascend ดาวน์โหลดได้จาก Hugging Face ตอนนี้เลย ส่วนเช็กพอยต์สำหรับ NVIDIA และรายงานทางเทคนิคยังระบุว่าเร็ว ๆ นี้ อันหนึ่งคือบริการที่คุณเช่าตามจำนวนโทเคน อีกอันคือไฟล์ที่คุณถือไว้ได้ พร้อมข้อแม้เรื่องฮาร์ดแวร์ที่มันรันอยู่ตอนนี้ ความแตกต่างนี้ตัดสินการใช้งานจริงได้มากกว่าคะแนนใด ๆ ในตารางของผู้จำหน่ายทั้งสองราย
InternLumina U2 จริง ๆ แล้วคืออะไร
สถาปัตยกรรมเป็นส่วนที่น่าสนใจ และมันแปลกใหม่จริง ๆ InternLumina U2เป็น MoE แบบสแปร์สที่มีพารามิเตอร์รวม 1.6 หมื่นล้านตัว และมีพารามิเตอร์ที่ทำงานจริง 1 พันล้านตัว และมันเป็นโมเดลภาษาดิฟฟิวชัน ไม่ใช่แบบออโตเรเกรสซีฟ — มันขัดเกลาทั้งลำดับพร้อมกันแบบขนาน แทนที่จะปล่อยโทเคนจากซ้ายไปขวา การแทนค่าภาพของมันเป็นแบบไม่ต่อเนื่องทั้งหมด: โค้ดบุ๊กแปดชุดของโทเคนภาพที่สร้างบน AToken ของ Apple ซึ่งเป็นสิ่งที่ทำให้โมเดลเดียวทั้งอ่านภาพและสร้างภาพได้โดยไม่ต้องมีตัวถอดรหัสแยกมาต่อท้าย การตอบคำถามจากข้อความ การสร้างภาพจากข้อความ การเข้าใจภาพ การแก้ไขภาพ การเข้าใจวิดีโอ และการเข้าใจ 3D ล้วนเป็นโมเดลเดียวกันที่ทำงานแบบเดียวกันบนคำศัพท์ชุดเดียวกัน
• ขนาดและรูปร่าง — InternLumina U2 มีพารามิเตอร์รวม 16B, ใช้งาน 1B, เป็น MoE แบบเบาบาง; จำนวนพารามิเตอร์ของ Qwen3.8-Omni-Flash ไม่เปิดเผย
• การสร้าง — InternLumina U2 สร้างและแก้ไขรูปภาพ รวมถึงรองรับความเข้าใจแบบ 3D; Qwen3.8-Omni-Flash ไม่สร้างสื่อใด ๆ เลย และตอบกลับเป็นข้อความ
• การถอดรหัส — InternLumina U2 เป็น LLM แบบ diffusion ที่ถอดรหัสแบบขนาน; Qwen3.8-Omni-Flash เป็นแบบ autoregressive
• บริบทและระยะเวลา — Qwen3.8-Omni-Flash มีหน้าต่าง 1M โทเคน และรองรับเสียง-วิดีโอต่อเนื่องได้นานถึงหนึ่งชั่วโมงในการเรียกใช้ครั้งเดียว ส่วนเอกสารเผยแพร่ของ InternLumina U2 ไม่ได้ระบุสิ่งเหล่านี้เลย และเสียงรูปแบบยาวก็ไม่อยู่ในความสามารถที่ระบุไว้
• เวต — InternLumina U2 อยู่ภายใต้ Apache 2.0 โดยมีเช็กพอยต์ Ascend เผยแพร่แล้ว และเช็กพอยต์ NVIDIA ยังรอดำเนินการ; Qwen3.8-Omni-Flash ไม่มีเวตและไม่มีแผนที่ประกาศไว้สำหรับเวตใด ๆ
• วิธีที่คุณได้รับมัน — InternLumina U2 เป็นการดาวน์โหลดจาก Hugging Face พร้อมโค้ดสำหรับการอนุมานบน GitHub; Qwen3.8-Omni-Flash เป็นการเรียก API ไปยัง Alibaba Cloud Model Studio หรือแพลตฟอร์ม Qianwen
• คะแนนจากแหล่งอิสระ — ไม่มีสำหรับทั้งคู่ การ์ดของ InternLumina U2 เองติดป้ายตาราง benchmark ของตนว่า "ผลลัพธ์เบื้องต้น เฉพาะบางส่วน"; ส่วนของ Qwen ล้วนเปรียบเทียบกับรุ่นก่อนหน้าของตัวเองและยังไม่มีการทำซ้ำ

ประเด็นเรื่องน้ำหนักได้เปลี่ยนไปแล้วนับตั้งแต่การรายงานช่วงพรีวิว
หากคุณได้อ่านบทความก่อนหน้าของเราเกี่ยวกับ InternLumina U2ตอนที่โค้ดเปิดตัวครั้งแรก สถานการณ์ได้เปลี่ยนไปในด้านหนึ่งและยังคงเดิมในอีกด้านหนึ่ง และทั้งสองด้านล้วนสำคัญ รีโพซิทอรี Hugging Face ไม่ใช่แค่โครงร่างเปล่า ๆ อีกต่อไป: โฟลเดอร์ ascend/ตอนนี้มีไฟล์ safetensors เจ็ดชาร์ด พร้อมกับคอนฟิกูเรชัน โทเคไนเซอร์ และโค้ดโมเดล ซึ่งหมายความว่าโมเดลนี้ดาวน์โหลดได้จริงและรันได้โดยใครก็ตามที่มีฮาร์ดแวร์ที่เหมาะสม โฟลเดอร์ nvidia/ยังคงถูกระบุว่าเร็ว ๆ นี้ รายงานทางเทคนิคยังคงรอการเผยแพร่ และส่วน benchmark ของรีโพซิทอรีเองก็ยังบอกว่า "ผลลัพธ์เบื้องต้นและยังไม่ครบถ้วน" ดังนั้นข้อความที่ถูกต้องในวันนี้ไม่ใช่ "น้ำหนักโมเดลออกแล้ว" หรือ "น้ำหนักโมเดลยังไม่มา" — แต่คือเช็กพอยต์ของฮาร์ดแวร์สแตกหนึ่งได้รับการเผยแพร่แล้ว และอีกสแตกหนึ่งยังไม่ได้รับการเผยแพร่ ซึ่งเป็นข้อจำกัดจริงสำหรับใครก็ตามที่คลัสเตอร์เป็น NVIDIA
ยังมีอีกสองเรื่องที่เคลื่อนไหวไปอย่างเงียบ ๆ ที่เก็บ GitHub ยังคงได้รับการคอมมิตอย่างต่อเนื่อง แม้จะผ่านการปล่อยครั้งแรกเมื่อวันที่ 1 กันยายนมานานแล้ว ดังนั้นโค้ดที่ปล่อยออกมาจึงได้รับการดูแลรักษา แทนที่จะถูกจอดทิ้งไว้ และตัวนับยอดดาวน์โหลดบนที่เก็บ Hugging Face ก็ยังคงแสดงเป็นศูนย์ ซึ่งบอกเรื่องตัวโมเดลได้น้อยกว่าบอกเรื่องกลุ่มเป้าหมาย: โมเดล diffusion ขนาด 16B-A1B ที่มีเช็กพอยต์ซึ่งให้ความสำคัญกับ Ascend เป็นอันดับแรก มุ่งเป้าไปที่ห้องแล็บ ไม่ใช่ทีมผลิตภัณฑ์ที่กำลังมองหาเอนด์พอยต์แบบโฮสต์ในไตรมาสนี้
จุดที่ทั้งสองทับซ้อนกันจริง ๆ และจุดที่ไม่ได้ทับซ้อนกัน
การทำความเข้าใจภาพคือจุดตัด และมันแคบกว่าที่เห็น ทั้งสองโมเดลสามารถดูภาพและตอบคำถามเกี่ยวกับภาพนั้นได้ ซึ่งเป็นงานทั้งหมดของ Qwen3.8-Omni-Flash และเป็นหนึ่งในหกงานของ InternLumina U2 ส่วนทุกอย่างหลังจากนั้นแตกต่างกันอย่างมาก InternLumina U2 สามารถแก้ไขภาพนั้นหรือสร้างภาพใหม่จากพรอมต์ได้ในโมเดลเดียวกัน โดยใช้คำศัพท์ทางภาพชุดเดียวกับที่ใช้ในการอ่านภาพ Qwen3.8-Omni-Flash ไม่สามารถสร้างพิกเซลได้แม้แต่พิกเซลเดียว แต่จะรับเสียงและวิดีโอหนึ่งชั่วโมงได้ในการเรียกครั้งเดียว และบอกคุณว่าใครพูด เมื่อไร และมีการตัดสินใจอะไร — ซึ่งเอกสารที่เผยแพร่ของ InternLumina U2 ไม่ได้อ้างว่าทำได้เลย
จุดทับซ้อนที่จริงแล้วสำคัญน้อยกว่าที่คนมักคิดก็คือวิดีโอ ทั้งสองถูกอธิบายว่าจัดการวิดีโอ แต่ทั้งสองทำคนละสิ่งกับมัน: ตัวหนึ่งทำความเข้าใจการบันทึกยาว ๆ ในฐานะเอกสาร อีกตัวหนึ่งจัดการวิดีโอเป็นโมดัลลิตีทางภาพควบคู่กับ 3D ทีมที่ต้องการให้สรุปฟุตเทจหนึ่งชั่วโมงจะไม่ได้รับการตอบสนองความต้องการจากตัวที่สอง และทีมที่ต้องการให้สร้างเฟรมจะไม่ได้รับการตอบสนองความต้องการจากตัวแรก

ค่าใช้จ่าย การควบคุม และสิ่งที่คุณกำลังซื้อจริง ๆ
การเปรียบเทียบราคานี้ไม่ได้เป็นการเปรียบเทียบในแบบเดียวกันเลย Qwen3.8-Omni-Flashคิดค่าบริการเป็นรายโทเคน — 0.15 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน 0.016 ดอลลาร์สำหรับแคช และ 0.47 ดอลลาร์สำหรับเอาต์พุตในรายการราคาสากล โดยมีรายการราคาแผ่นดินใหญ่แยกต่างหากที่นำมาเทียบกันไม่ได้ — และพาดหัวข่าวเปิดตัวของมันคือการลดต้นทุนที่ผู้ขายรายงานเองว่าเกิน 98% สำหรับค่าอินพุตเสียงหนึ่งชั่วโมง ซึ่งคำนวณโดยตั้งราคาจากตัวอย่างความยาวสองนาทีแล้วคูณด้วยสามสิบ โดยสุ่มตัวอย่างวิดีโอที่ 720p และหนึ่งเฟรมต่อวินาที InternLumina U2ไม่คิดค่าบริการใด ๆ เพราะไม่มีอะไรให้คิดค่าบริการ: ต้นทุนคือฮาร์ดแวร์และเวลาของคุณ และการ์ดข้อมูลของโมเดลเองก็ไม่ได้เผยแพร่ตัวเลขอัตราการประมวลผลที่จะทำให้คุณแปลงมันเป็นตัวเลขต่อโทเคนได้
นั่นคือข้อแลกเปลี่ยนในบรรทัดเดียว API ให้ความสามารถที่คุณไม่สามารถโฮสต์เองได้ และค่าใช้จ่ายรายชั่วโมงที่ปรับตามการใช้งาน ส่วน open weights ให้ค่าใช้จ่ายคงที่และการควบคุมเส้นทางข้อมูลอย่างเต็มรูปแบบ ในแลกมาด้วยสแตกการอนุมานที่คุณต้องสร้างเองและชุดเช็กพอยต์ที่ปัจจุบันหมายถึงฮาร์ดแวร์ Ascend สำหรับเวิร์กโหลดที่มีการกำกับดูแลซึ่งสื่อไม่สามารถออกจากอาคารได้ ตัวเลือกที่สองไม่ใช่แค่ความชอบ — แต่เป็นตัวเลือกเดียวในหน้านี้ สำหรับทีมที่ต้องการวิเคราะห์เสียงแบบยาวในเดือนนี้ ตัวเลือกแรกคือตัวเลือกเดียวในหน้านี้
OrcaRouter ยังไม่ให้บริการโฮสต์โมเดลทั้งสองนี้ในตอนนี้ และเราขอพูดอย่างตรงไปตรงมาเช่นนี้ ดีกว่าที่จะบอกเป็นนัยถึงเส้นทาง routing ที่ไม่มีอยู่จริง: Qwen3.8-Omni-Flashทำงานเฉพาะบนแพลตฟอร์มของ Alibaba เองเท่านั้น และInternLumina U2เป็นสิ่งที่ต้องดาวน์โหลด ไม่ใช่เอนด์พอยต์ สิ่งที่เราให้บริการคือส่วนที่เหลือของตระกูล Qwen3.8 — Qwen3.8-Flash และ Qwen3.8-Max — ผ่านone APIในราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ซึ่งเป็นวิธีที่ปฏิบัติได้จริงในการรักษาระดับพื้นฐานที่ใช้งานได้สำหรับฝั่งโมเดลปิดของการเปรียบเทียบนี้ ในขณะที่ฝั่งโอเพนเวตยังคงจัดเรียงเช็กพอยต์ของ NVIDIA ให้เรียบร้อย

อันไหนที่คุณควรเลือกจริง ๆ
เลือก InternLumina U2 หากคุณต้องการโมเดลเดียวที่อ่าน สร้าง และแก้ไขภาพได้ และคุณยินดีเป็นเจ้าของสแต็กการอนุมานเอง — และหากตัวเร่งความเร็วของคุณเป็น Ascend หรือคุณรอเช็กพอยต์ของ NVIDIA ได้ มันเป็นโมเดลเดียวในสองตัวนี้ที่สร้างภาพได้ และเป็นตัวเดียวที่คุณรันได้โดยไม่ต้องส่งข้อมูลไปยังผู้ให้บริการรายใด ให้ถือว่าตัวเลข benchmark ของมันยังไม่ได้รับการพิสูจน์จนกว่ารายงานทางเทคนิคจะเผยแพร่ออกมา เพราะการ์ดโมเดลระบุไว้อย่างนั้นเลย
เลือก Qwen3.8-Omni-Flash หากปัญหาของคุณคือไฟล์เสียงและวิดีโอความยาวหลายชั่วโมง มากกว่าการส่งออกเป็นพิกเซล — อย่างงานประชุมอัจฉริยะ การวิเคราะห์บันทึกเสียงยาวนาน งานเอเจนต์ที่เน้นเสียงเป็นหลักในภาษาจีนและอังกฤษ — และหากคุณยอมรับได้กับการพึ่งพาแหล่งเดียวและการส่งออกเป็นข้อความเท่านั้น เรื่องต้นทุนของมันแข็งแกร่งเมื่อคิดตามชั่วโมงเสียงขาเข้า แต่อ่อนกว่ามากเมื่อคิดจากยอดบิลรวม ผลทดสอบของมันมาจากผู้ขายและยังไม่มีการทำซ้ำ และการทดสอบโดยบุคคลที่สามครั้งแรก ๆ ที่ปรากฏออกมาวางมันไว้ที่เปอร์เซ็นไทล์ที่ 28 ด้านการให้เหตุผล บนตัวอย่างที่เล็กพอจนควรกระตุ้นให้ทดสอบมากกว่าตัดสินใจ
หากคุณต้องการทั้งสองอย่าง สิ่งเหล่านี้เป็นส่วนเสริมกัน ไม่ใช่ทางเลือกแทนกัน นั่นคือโมเดลภาพแบบเปิดน้ำหนักที่คุณโฮสต์เอง กับโมเดลสื่อระยะยาวแบบปิดที่คุณเรียกใช้งาน ณ วันนี้ยังไม่มีตัวใดที่เราเตอร์ผ่านเราได้ สิ่งที่ต้องจับตาดูในฝั่งหนึ่งคือเช็กพอยต์ของ NVIDIA และรายงานทางเทคนิค ส่วนอีกฝั่งหนึ่งคือการประเมินอิสระครั้งแรก ซึ่งยังไม่มีอยู่ในขณะนี้ และเป็นช่องว่างที่ใหญ่ที่สุดเพียงหนึ่งเดียวในทุกสิ่งที่เขียนเกี่ยวกับQwen3.8-Omni-Flashจนถึงตอนนี้
