
Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash: ตัวหนึ่งดูวิดีโอ อีกตัวสร้างมันขึ้นมา
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
คำตอบสั้น ๆ: สองตัวนี้ไม่ใช่สิ่งทดแทนกัน และการเปรียบเทียบจะสมเหตุสมผลก็ต่อเมื่อคุณเลิกมอง "omni" เป็นหมวดหมู่ Qwen3.8-Omni-Flash ซึ่งผู้ขายเปิดให้ลูกค้า API ใช้งานเมื่อวันที่ 18 กันยายน 2026 รับข้อความ รูปภาพ เสียง และวิดีโอเข้า แล้วส่งคืนข้อความ — เป็นโมเดลสำหรับอ่านการประชุมหรือฟุตเทจยาวหนึ่งชั่วโมงแล้วบอกคุณว่าเกิดอะไรขึ้น Gemini Omni 1.1 Flash ซึ่งผู้ขายเปิดตัวเมื่อวันที่ 27 สิงหาคม 2026 รับพรอมป์ต์ข้อความหรือรูปภาพแล้วส่งคืนวิดีโอพร้อมเสียงที่ซิงค์กัน — เป็นโมเดลสำหรับสร้างฟุตเทจ ตัวหนึ่งบริโภคสื่อ ส่วนอีกตัวผลิตสื่อ หากไปป์ไลน์ของคุณต้องการทั้งสอง คุณก็ต้องมีทั้งสอง และคำถามที่ตรงไปตรงมาไม่ใช่ว่าตัวไหนชนะ แต่คือคุณขาดตัวไหนจริง ๆ ต่างหาก
ทั้งสองโมเดลไม่ได้เป็นแบบ open-weight ทั้งคู่ไม่สามารถกำหนดเส้นทางผ่าน OrcaRouter ได้ และทั้งคู่ถูกตั้งราคาบนแกนที่ไม่สามารถแปลงเป็นกันและกันได้ — โทเค็นในด้านหนึ่ง วินาทีของวิดีโอที่สร้างขึ้นในอีกด้านหนึ่ง จุดที่ทั้งสองทับซ้อนกันจริง ๆ นั้นแคบกว่าที่กรอบ "omni vs omni" บ่งชี้ และการทับซ้อนนั้นคุ้มค่าที่จะระบุให้ชัดก่อนการคำนวณราคา เพราะการคำนวณราคาเป็นจุดที่ทั้งสองถูกนำมาเปรียบเทียบกันอย่างผิด ๆ บ่อยที่สุด
ความเข้าใจผิดเชิงหมวดหมู่ที่ควรทำให้กระจ่างเป็นอันดับแรก
สื่อเปิดตัวของ Alibaba ใช้Qwen3.8-Omni-Flashเป็นเกณฑ์เปรียบเทียบกับGemini 3.8 Flash และสื่อที่ตามมาอีกจำนวนมากก็ย่อความนั้นเหลือเพียง "เอาชนะ Gemini" นั่นเป็นโมเดล Google คนละตัวกับGemini Omni 1.1 Flash และทั้งสองไม่ใช่จุดอ้างอิงที่ใช้แทนกันได้: Gemini 3.8 Flash เป็นโมเดลมัลติโมดัลอเนกประสงค์ ส่วน Gemini Omni 1.1 Flash เป็นโมเดลสร้างวิดีโอที่มีรายการราคาแยกต่างหากและพื้นผิว API แยกต่างหาก ตัวเลข Qwen เทียบ Gemini ทุกตัวที่แพร่กระจายออกมาจากการเปิดตัวครั้งนี้ — WildClawBench-MM 71.0 ต่อ 58.9, SpotSoundBench 67.2 ต่อ 39.7, AgenticVBench 36.8 ต่อ 45.0 — ล้วนเทียบกับ Gemini 3.8 Flash ไม่ได้เทียบกับโมเดลวิดีโอ Omni และไม่ว่ากรณีใดก็ไม่มีตัวเลขใดที่เป็นอิสระเลย ถ้าคุณมาที่นี่โดยถือตารางคะแนนที่วางสองโมเดลในบทความนี้ไว้บนแกนเดียวกัน ก็แทบจะแน่นอนว่าคุณกำลังใส่โมเดล Google ผิดตัวในคอลัมน์ขวามือ
สิ่งที่แต่ละอันทำจริง ๆ
• สิ่งที่รองรับเป็นอินพุต — Qwen3.8-Omni-Flash รับข้อความ รูปภาพ เสียง และวิดีโอ รวมถึงเสียงสเตอริโอและเสียงเชิงพื้นที่แบบสี่แชนเนล ส่วน Gemini Omni 1.1 Flash รับพรอมต์ที่เป็นข้อความและรูปภาพ พร้อมวิดีโออ้างอิงความยาวไม่เกินสามวินาที
• สิ่งที่ได้กลับมา — Qwen3.8-Omni-Flash ส่งคืนเฉพาะข้อความเท่านั้น ส่วน Gemini Omni 1.1 Flash ส่งคืนวิดีโอพร้อมเสียงที่ซิงโครไนซ์กันโดยธรรมชาติ ในฉากที่สามารถขยายความยาวได้ถึง 40 วินาที โดยเพิ่มทีละสิบวินาที
• พื้นผิวการควบคุม — Qwen3.8-Omni-Flash เปิดให้เข้าถึงบริบท การสุ่ม และโหมดแบบเอเจนต์ที่ตัดสินใจได้เองว่าจะดูอะไร ส่วน Gemini Omni 1.1 Flash เปิดให้ควบคุมเฟรมแรกและเฟรมสุดท้าย มีการย้อนดูสิบวินาทีเพื่อความต่อเนื่อง และมีระดับการร่างแบบ 360p ที่ Google อธิบายว่ามีต้นทุนประมาณหนึ่งในสามและเร็วกว่าราว 60%
• ความละเอียดและความสมบูรณ์ — Qwen3.8-Omni-Flash ไม่มีความละเอียดของเอาต์พุตเนื่องจากไม่สร้างสื่อใด ๆ; Gemini Omni 1.1 Flash ส่งออกที่ 720p, 1080p และ 4K
• บริบทและระยะเวลา — Qwen3.8-Omni-Flash รองรับหนึ่งล้านโทเค็นและออดิโอวิดีโอต่อเนื่องนานสูงสุดหนึ่งชั่วโมงในการเรียกครั้งเดียว; ส่วน Gemini Omni 1.1 Flash ถูกจำกัดด้วยคลิปที่กำลังสร้าง ไม่ใช่ด้วยหน้าต่างอินพุต
• วิธีการจ่ายเงินของคุณ — Qwen3.8-Omni-Flash คิดค่าบริการตามจำนวนโทเคน: $0.15 ต่อล้านโทเคนอินพุต, $0.016 สำหรับแคช, $0.47 เอาต์พุตในรายการราคานานาชาติ; Gemini Omni 1.1 Flash คิดค่าบริการตามวินาทีของวิดีโอที่สร้างขึ้น โดยอัตราที่ Google ประกาศไว้คือ $0.10 ต่อวินาทีสำหรับ 720p
• ความเปิดกว้าง — ปิดทั้งสองด้าน ไม่มีเวทสำหรับโมเดลทั้งสอง และทั้งคู่ยังไม่พร้อมให้เรียกผ่าน API ของเราในวันนี้

ส่วนที่ทับซ้อนกันคือความเข้าใจวิดีโอ และมันไม่สมมาตร
ที่เดียวที่ผู้ซื้อจะนำสองสิ่งนี้มาเปรียบเทียบกันได้อย่างสมเหตุสมผลก็คือไปป์ไลน์ที่ต้องทั้งเข้าใจฟุตเทจและผลิตมันออกมา — เช่น ผู้ช่วยตัดต่อที่อ่านไฟล์บันทึกยาว ๆ ค้นหาช่วงเวลาที่คุ้มค่าแก่การเก็บไว้ และสร้างงานตัดออกมา ในด้านการเข้าใจ Qwen3.8-Omni-Flash ถูกสร้างมาเพื่อสิ่งนี้โดยเฉพาะ: เสียงและวิดีโอต่อเนื่องหนึ่งชั่วโมงต่อการเรียกหนึ่งครั้ง การแยกผู้พูด และโหมดเอเจนติกที่เพิ่มความแม่นยำบน OmniVideoBench ของผู้ให้บริการจาก 63.4 เป็น 67.8 พร้อมกับลดโทเคนต่อคำถามจาก 145,736 เหลือ 79,117 ในด้านการผลิต Gemini Omni 1.1 Flash เป็นตัวที่สามารถสร้างคลิปผลลัพธ์พร้อมเสียงที่ซิงค์กันได้ และโมเดลของ Qwen ไม่สามารถสร้างวิดีโอได้แม้แต่เฟรมเดียว
ความไม่สมมาตรยังเกิดขึ้นในทางกลับกันได้เช่นกัน และมองข้ามได้ง่ายกว่า ความเข้าใจของโมเดลสร้างวิดีโอเป็นเพียงเครื่องมือเท่านั้น มันต้องการความเข้าใจฉากมากพอที่จะทำให้ช็อตมีความสอดคล้องกันเมื่อต่อความยาวออกไปสิบวินาที ซึ่งเป็นข้อกำหนดที่ต่างจากการตอบคำถามว่าเกิดอะไรขึ้นในชั่วโมงที่สามของการประชุม โมเดลของ Google มีประวัติผลงานที่ยาวนานกว่าในด้านคุณภาพการสร้าง และมีประวัติที่สั้นกว่าในด้านการวิเคราะห์เนื้อหายาว ส่วนของ Alibaba กลับกัน ถ้างานของคุณคือ "หาสามนาทีที่สำคัญในบันทึกนี้" โมเดลสร้างวิดีโอไม่ใช่เครื่องมือที่เหมาะสม ถ้างานของคุณคือ "สร้างคลิปความยาวสามสิบวินาทีที่ตรงกับบรีฟนี้" โมเดลความเข้าใจก็ไม่ใช่เครื่องมือที่เหมาะสมเช่นกัน
ทำไมการเปรียบเทียบราคาจึงยังคงผิดพลาดอยู่เสมอ
อัตราต่อวินาทีและอัตราต่อโทเคนไม่สามารถแปลงเป็นกันและกันได้ และความพยายามที่จะแปลงนั้นก่อให้เกิดข้อผิดพลาดสองประการที่ครอบงำการเปรียบเทียบนี้ ข้อแรกคือการนำคลิปที่สร้างขึ้นมาทั้งคลิปไปเทียบกับอัตราอินพุตต่อโทเคน แล้วสรุปว่าโมเดลวิดีโอมีราคาแพงกว่าหลายร้อยเท่า — ซึ่งเป็นจริงแต่ไม่มีความหมาย เพราะทั้งสองไม่ได้ขายสิ่งเดียวกัน ข้อที่สองคือการเปรียบเทียบเฉพาะราคาอินพุตและมองข้ามว่าส่วนลดเสียง 98% ของ Alibaba ใช้กับชั่วโมงเสียงอินพุต ในขณะที่อัตราของ Google ใช้กับวินาทีวิดีโอเอาต์พุต ดังนั้น "ส่วนลด" ทั้งสองจึงไม่ได้อยู่ฝั่งเดียวกันของมิเตอร์ด้วยซ้ำ
สิ่งที่พูดได้อย่างตรงไปตรงมาคือแบบนี้ ภายใต้ระเบียบวิธีของ Alibaba เอง — การสุ่มตัวอย่างสองนาทีคูณด้วยสามสิบ วิดีโอที่ 720p และหนึ่งเฟรมต่อวินาที — หนึ่งชั่วโมงของอินพุตเสียงและวิดีโอรวมกันที่ป้อนเข้าสู่ Qwen3.8-Omni-Flash ถูกระบุราคาไว้ที่ประมาณ $0.20 ลดลงจาก $3.27 เมื่อเทียบกับรุ่นก่อนหน้า การสร้างวิดีโอ 720p ความยาวสี่สิบวินาทีด้วย Gemini Omni 1.1 Flash ในราคาที่ Google ประกาศไว้ $0.10 ต่อวินาที มีค่าใช้จ่าย $4.00 และการร่างสี่สิบวินาทีเดียวกันที่ 360p อยู่ที่ประมาณ $1.20 ตามกรอบคิดต้นทุนหนึ่งในสามของ Google ตัวเลขทั้งสองชุดเป็นข้อมูลที่ผู้ขายรายงานเอง และยังไม่มีชุดใดถูกทำซ้ำเพื่อตรวจสอบอย่างอิสระ ข้อสรุปที่มีประโยชน์ไม่ใช่ว่าตัวเลขใดเล็กกว่า แต่คือการวิเคราะห์ฟุตเทจหนึ่งชั่วโมงกับการสร้างฟุตเทจนั้นสี่สิบวินาทีอยู่ในอันดับของขนาดเดียวกัน — ซึ่งนั่นคือเหตุผลที่แท้จริงว่าทำไมไปป์ไลน์การผลิตที่ทำทั้งสองอย่างจึงต้องมีโมเดลต้นทุน ไม่ใช่ผู้ชนะ
นั่นก็เป็นเหตุผลเดียวกันกับการเก็บทั้งสองไว้บนคีย์เดียวแทนที่จะแยกเป็นสองสัญญา ปัจจุบันไม่มีโมเดล omni ตัวใดที่ route ผ่าน OrcaRouter ได้: Qwen3.8-Omni-Flash ทำงานได้เฉพาะบนแพลตฟอร์มของ Alibaba เองเท่านั้น และ Google ยังไม่ได้เปิด Omni video API ให้กับการ route โดยบุคคลที่สาม เราจึงไม่ได้โฮสต์ทั้งสองตัวและจะไม่เสแสร้งว่าโฮสต์ได้ สิ่งที่มีอยู่จริงในแค็ตตาล็อกของเราคือรุ่นพี่น้องในแต่ละตระกูล — Qwen3.8-Flash และ Gemini 3.8 Flash — ซึ่งเรียกใช้ได้แล้ววันนี้ผ่าน ปลายทางเดียว ในราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ซึ่งทำให้การทดสอบ A/B เทียบกับตัวเลขของผู้ขายรายนั้น ๆ เป็นเพียงการเปลี่ยน config ไม่ใช่การอินทิเกรตครั้งที่สอง

จุดที่แต่ละอันชนะ บอกกันตรงๆ
Qwen3.8-Omni-Flash ชนะในทุกด้านที่วัดกันเป็นชั่วโมงของอินพุต ไม่ว่าจะเป็นการถอดเสียงและแยกผู้พูดในการประชุม การสรุปบันทึกเสียงความยาวมาก การใช้งานเครื่องมือแบบเอเจนต์ที่เน้นเสียงเป็นหลัก และต้นทุนต่อชั่วโมงของสื่อที่ประมวลผล ผลลัพธ์ด้านเสียงที่ผู้ขายรายงานนั้นแข็งแกร่ง และจุดอ่อนของมันอยู่ตรงจุดที่โมเดลนี้ไม่ได้ถูกออกแบบมาให้เล่นตั้งแต่แรก — บอร์ดที่เน้นการให้เหตุผลหนัก ๆ ซึ่งการทดสอบโดยบุคคลที่สามครั้งแรก ๆ จัดให้มันอยู่ที่เปอร์เซ็นไทล์ที่ 28 ด้านการให้เหตุผล พร้อมตัวเลขความเร็วที่เปอร์เซ็นไทล์ที่ 21 จากตัวอย่างที่เล็กพอจนควรถือว่าตัวเลขเหล่านี้เป็นข้อชวนให้ไปทดสอบด้วยตัวเอง มากกว่าจะเป็นคำตัดสิน
Gemini Omni 1.1 Flashชนะในด้านผลลัพธ์: การสร้างช็อตพร้อมเสียงที่ประสานกัน ความต่อเนื่องข้ามฉากที่ยาวนาน การควบคุมในระดับเฟรม และการทำขั้นสุดท้ายที่ความละเอียด 4K ซึ่งกระบวนการส่งมอบอาจจำเป็นต้องมี ข้อได้เปรียบของมันไม่ใช่คะแนนจากแบบทดสอบมาตรฐาน — แต่คือการที่โมเดลอีกตัวไม่สามารถทำงานนั้นได้เลย จุดที่อ่อนแอกว่าคือสิ่งใดก็ตามที่ต้องถือบริบทนานถึงหนึ่งชั่วโมง เพราะมันไม่ได้ถูกสร้างมาเพื่อสิ่งนั้น
การตัดสินใจ และสิ่งที่ต้องจับตามอง
หากคุณกำลังเลือกระหว่างสองตัวนี้ คำถามคือครึ่งไหนของไปป์ไลน์ที่ยังไม่มีใครรองรับ ทีมที่สร้างวิดีโออยู่แล้วและต้องการเข้าใจไฟล์บันทึกยาว ๆ ควรทดสอบ Qwen3.8-Omni-Flash กับเสียงของตัวเองในสัปดาห์นี้; ทีมที่วิเคราะห์สื่อและต้องการผลิตสื่อนั้นควรทดสอบ Gemini Omni 1.1 Flash ทีมที่ต้องการทั้งสองอย่างกำลังพิจารณาผู้ให้บริการสองราย โมเดลการคิดค่าบริการสองแบบ และการผสานรวมสองแบบ ซึ่งเป็นสถานการณ์ที่เลเยอร์การจัดเส้นทางเพียงชั้นเดียวเลิกเป็นเพียงความสะดวก และเริ่มเป็นสิ่งที่ทำให้โมเดลต้นทุนยังอ่านเข้าใจได้
สองสิ่งจะเปลี่ยนการวิเคราะห์นี้ การประเมินที่เป็นอิสระของ Qwen3.8-Omni-Flashจะแทนที่ตัวเลขจากผู้ขายทุกรายข้างต้นด้วยตัวเลขที่เทียบเคียงกันได้ — ยังไม่มีตัวเลขดังกล่าว และการไม่มีอยู่นี้คือช่องว่างที่ใหญ่ที่สุดเพียงหนึ่งเดียวในการเปรียบเทียบนี้ และอัตราค่าบริการที่ประกาศเผยแพร่สำหรับเอาต์พุต 1080p และ 4K จาก Google จะทำให้การคำนวณในระดับไฮเอนด์ตรวจสอบได้ ทุกวันนี้ตัวเลขเหล่านั้นแพร่กระจายกันเพียงในฐานะประมาณการจากมาร์เก็ตเพลสเท่านั้น มิใช่ในฐานะรายการราคาของ Google เอง

หมายเหตุปิดท้ายหนึ่งเรื่องเกี่ยวกับการวางกรอบ "Omni" ได้เลิกมีความหมายที่เจาะจงใด ๆ แล้ว — ตอนนี้มันครอบคลุมตั้งแต่โมเดลที่อ่านเสียงประชุมหนึ่งชั่วโมงไปจนถึงโมเดลที่เรนเดอร์คลิปสี่สิบวินาทีพร้อมเสียง และการมองคำนี้เป็นหมวดหมู่ก็คือสาเหตุที่ผู้ซื้อลงเอยด้วยการเปรียบเทียบอัตราต่อโทเคนกับอัตราต่อวินาที แล้วดึงข้อสรุปจากสิ่งนั้น โมเดลเหล่านี้เป็นส่วนเสริมกันโดยมีส่วนทับซ้อนกันเพียงเล็กน้อย และท่าทีที่ถูกต้องต่อทั้งสองตัว ณ ห้าวันและสี่สัปดาห์หลังการเปิดตัวของแต่ละตัวตามลำดับ ก็เป็นเช่นเดียวกัน: จงวัดผลพวกมันกับเนื้อหาของคุณเอง และเปิดทางเลือกที่สองไว้
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
