การ์ดชื่อเรื่องฮีโร่สำหรับการเปรียบเทียบ 'Qwen3.8-Omni-Flash vs Qwen 3.8' พร้อมข้อความคิ้ว 'เทียบกันแบบตัวต่อตัว - ครอบครัวเดียวกัน แต่โจทย์ตรงกันข้าม' คำโปรยรอง 'โมเดลเฉพาะทางที่สร้างมาสำหรับสื่อหลายชั่วโมง เมื่อเทียบกับคอร์เปิดขนาด 2.4 ล้านล้านพารามิเตอร์ที่สร้างมาเพื่อความลึกต่อโทเคน' และชิปสถิติสามชิ้นที่อ่านว่า 'ราคาต่อ 1 ล้านโทเคน: ต่างกัน 13 เท่า', 'บริบท: 1M ทั้งคู่' และ 'น้ำหนักเปิด: มีเพียงฝั่งเดียว'
Guides & Insights

Qwen3.8-Omni-Flash กับ Qwen 3.8: บิลด์เฉพาะทาง ปะทะ บิลด์เรือธง

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ถ้าอยากได้เวอร์ชันสั้น ๆ: Qwen3.8-Omni-Flashมีราคาถูกกว่าราวสิบสามเท่าต่อโทเคนเมื่อเทียบกับQwen 3.8และเป็นรุ่นเดียวในสองรุ่นนี้ที่ออกแบบมาให้รองรับออดิโอวิดีโอได้นานถึงหนึ่งชั่วโมงโดยไม่สะดุด — ในขณะที่ Qwen 3.8 ซึ่งเป็นแกนเปิดขนาด 2.4 ล้านล้านพารามิเตอร์ที่อยู่บนสุดของสาย Qwen3.8 คือรุ่นที่คุณใช้เมื่อคำตอบต้องถูกต้องมากกว่าจะถูก และเป็นรุ่นเดียวในสองรุ่นนี้ที่คุณดาวน์โหลดน้ำหนักโมเดลได้ ทั้งสองรุ่นมีความยาวคอนเท็กซ์เท่ากัน อยู่ตระกูลเดียวกัน และมีช่วงเปิดตัวระหว่างเดือนสิงหาคมถึงกันยายน พวกมันไม่ใช่ของที่ใช้แทนกันได้ และคุณค่าทั้งหมดของการเปรียบเทียบนี้อยู่ที่การรู้ว่าจริง ๆ แล้วคุณกำลังถามคำถามอะไรอยู่

เพื่อให้แม่นยำเรื่องชื่อ เพราะตระกูลนี้มีสมาชิก crowded กันเยอะ Qwen 3.8ในที่นี้หมายถึงแกนกลางแบบเปิดตระกูล mixture-of-experts ขนาด 2.4T-A95B — โมเดลที่อยู่เบื้องหลังเอนด์พอยต์ Qwen3.8-Max ซึ่ง Alibaba เปิดตัวเมื่อวันที่ 3 สิงหาคม 2026 และเผยแพร่เวตเมื่อวันที่ 12 สิงหาคม และซึ่ง Artificial Analysis จัดอันดับไว้ที่ 40 ในดัชนี Intelligence Index ของตน Qwen3.8-Omni-Flashคือโมเดล omni-modal แบบเนทีฟที่ Alibaba นำออกให้บริการผ่าน API เมื่อวันที่ 18 กันยายน 2026 สร้างขึ้นบนสายสถาปัตยกรรม Qwen3.8-Flash รับข้อความ ภาพ เสียง และวิดีโอเข้า แล้วส่งคืนข้อความ ทุกอย่างเกี่ยวกับโมเดลเรือธงเป็นข้อมูลที่ผู้ขายรายงานเองหรือจัดอันดับโดยอิสระ ตามที่ระบุไว้ ส่วนทุกอย่างเกี่ยวกับโมเดล omni เป็นข้อมูลที่ผู้ขายรายงานเองเพียงอย่างเดียว เพราะเพิ่งเปิดตัวได้ไม่กี่ชั่วโมงและยังไม่มีใครนอก Alibaba วัดผลมัน

สองโมเดล หนึ่งตระกูล กับบรีฟการออกแบบที่ตรงกันข้าม

สิ่งล่อใจคือการอ่านสิ่งนี้เป็นโมเดลขนาดใหญ่และโมเดลขนาดเล็กจากรุ่นเดียวกัน เหมือนกับที่คุณอ่าน Qwen3.8-Max เทียบกับ Qwen3.8-Flash การอ่านเช่นนั้นผิดในแบบที่ต้องเสียค่าใช้จ่าย แกนหลักของ Qwen 3.8 คือเครื่องยนต์การให้เหตุผลที่บังเอิญรับภาพและวิดีโอได้ ปริมาณงานของมันวัดเป็นโทเค็นต่อวินาทีสำหรับปัญหายาก ราคาของมันถูกตั้งค่าให้สะท้อนต้นทุนการคำนวณของการส่งผ่านไปข้างหน้าของพารามิเตอร์ที่ใช้งาน 95 พันล้านพารามิเตอร์ และแผ่นประเมินของมันคือรายการของบอร์ดการให้เหตุผลและการเขียนโค้ด Qwen3.8-Omni-Flash เป็นเครื่องยนต์การรับรู้และการกระทำที่บังเอิญให้เหตุผลได้ ราคาของมันถูกตั้งค่าเทียบกับต้นทุนการนำเข้าสื่อหลายชั่วโมง และแผ่นประเมินของมันคือรายการของบอร์ดเสียง วิดีโอ และการเรียกใช้เครื่องมือ ตัวหนึ่งถูกปรับให้เหมาะสมสำหรับความลึกต่อโทเค็น อีกตัวถูกปรับให้เหมาะสมสำหรับโทเค็นต่อชั่วโมงของเนื้อหา

ความแตกต่างนั้นปรากฏชัดที่สุดในจุดที่การตลาดไม่ได้พูดถึง ทั้งสองโมเดลรับได้ประมาณหนึ่งล้านโทเค็น และทั้งคู่รับวิดีโอ แต่ Qwen3.8-Omni-Flash ถูกออกแบบมาโดยเฉพาะเพื่อจัดการกับปัญหาด้านระยะเวลา — รองรับเสียงและวิดีโอต่อเนื่องได้นานถึงหนึ่งชั่วโมงในการเรียกใช้ครั้งเดียว พร้อมโหมด Agentic Understanding ซึ่งโมเดลเลือกว่าจะสุ่มตัวอย่างส่วนใดแทนที่จะประมวลผลทุกเฟรม ลดจำนวนโทเค็นต่อคิวรีจาก 145,736 เหลือ 79,117 พร้อมทั้งเพิ่มความแม่นยำบน OmniVideoBench จาก 63.4 เป็น 67.8. Qwen 3.8ไม่มีกลไกที่เผยแพร่เทียบเท่า การป้อนวิดีโอสองชั่วโมงให้กับมันเป็นไปได้ในทางทฤษฎี แต่การทำเช่นนั้นในราคาที่ผ่านการตรวจสอบของทีมการเงินเป็นอีกคำถามหนึ่ง และนั่นคือคำถามที่โมเดล omni ถูกสร้างขึ้นมาเพื่อตอบ

มิติที่เป็นตัวชี้ขาดจริง ๆ

• ราคา — Qwen3.8-Omni-Flash $0.15 ต่ออินพุตหนึ่งล้าน และ $0.47 ต่อเอาต์พุตหนึ่งล้าน เทียบกับ Qwen 3.8 ที่ $2.00 และ $6.00 การอ่านแคช: $0.016 เทียบกับ $0.25

• น้ำหนักโมเดลแบบเปิด — Qwen 3.8 เผยแพร่น้ำหนักโมเดลเมื่อวันที่ 12 สิงหาคม 2026 ภายใต้ใบอนุญาตแบบกำหนดเอง; Qwen3.8-Omni-Flash ให้บริการผ่าน API เท่านั้น และ Alibaba ยังไม่ประกาศว่าจะเปิดให้เผยแพร่

• บริบท — หนึ่งล้านโทเค็นทั้งสองฝั่ง; อินพุตสูงสุด 991K บนโมเดล omni พร้อมเอาต์พุตสูงสุด 131K และงบประมาณการให้เหตุผล 262K

• ระยะเวลาสื่อ — สูงสุดหนึ่งชั่วโมงของเสียงและวิดีโอต่อเนื่องในการเรียกแบบ omni ครั้งเดียว; รุ่นเรือธงมีเอกสารระบุสำหรับอินพุตวิดีโอ โดยไม่มีข้อมูลค่าใช้จ่ายต่อชั่วโมงประกอบ

• รูปแบบเอาต์พุต — ข้อความทั้งสองฝั่ง ทั้งคู่ไม่สร้างเสียงพูด แม้ว่าจะมีที่มาจากโมเดล omni

• คะแนนอิสระ — Qwen 3.8 อยู่ที่ 40 บน Artificial Analysis Intelligence Index ส่วน Qwen3.8-Omni-Flash ยังไม่มีคะแนนอิสระใด ๆ ทั้งสิ้น

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen 3.8 - the scoreboard'. Left column Qwen3.8-Omni-Flash: Price per M $0.15 in / $0.47 out, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Open weights not released, Independent score none yet. Right column Qwen 3.8: Price per M $2.00 in / $6.00 out, Context 1M tokens, Media per call video input with no per-hour price, Output text only, Open weights published 12 Aug 2026, Independent score AA Index 40. The footer reads 'Qwen 3.8 pricing and Index score per Artificial Analysis and Alibaba; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

ทำไมตาราง benchmark จึงไม่สามารถชี้ขาดเรื่องนี้ได้

ยังไม่มีตารางเปรียบเทียบแบบวัดกันตรง ๆ และอีกไม่นานก็คงจะยังไม่มี เอกสารเปิดตัวของ Alibaba สำหรับ Qwen3.8-Omni-Flashนั้นใช้เป็นเกณฑ์เปรียบเทียบกับ Qwen3.5-Omni-Plus ซึ่งเป็นรุ่นก่อนหน้าโดยตรงเท่านั้น และกับ Gemini 3.8 Flash ส่วนตัวเลขของเรือธงนั้นมาจากชุดการประเมินด้านการให้เหตุผลและการเขียนโค้ดอีกชุดหนึ่งทั้งหมด สองตารางนี้ไม่มีแถวใดร่วมกันเลย ใครก็ตามที่เผยแพร่ตารางซึ่งนำทั้งสองมาไว้ข้างกันบนแกนเดียวกัน แกนนั้นก็คือสิ่งที่พวกเขาประกอบขึ้นมาเอง

สิ่งที่พูดได้อย่างตรงไปตรงมาคือมันเป็นไปในเชิงทิศทาง จากตัวเลขของผู้ขายเอง โมเดล omni ถือเป็นก้าวที่ใหญ่เมื่อเทียบกับสาย omni ที่มันเข้ามาแทนที่ — โดยมีค่าเฉลี่ยเพิ่มขึ้นเกิน 26% จากการประเมินประมาณสามสิบรายการ โดย WildClawBench-MM อยู่ที่ 71.0, UniClawBench อยู่ที่ 69.6, LongAudioSpan อยู่ที่ 82.7 — และเป็นความก้าวหน้าที่จริงแต่เพียงบางส่วนเมื่อเทียบกับ Gemini 3.8 Flash โดยนำบนบอร์ดที่เน้นเสียงอย่าง SpotSoundBench (67.2 ต่อ 39.7) และ MMAU (81.8 ต่อ 76.9) และตามหลังใน AgenticVBench ที่เน้นการให้เหตุผลจากวิดีโอโดยแท้ (36.8 ต่อ 45.0) ในฝั่งเรือธง คะแนน Index ของ Qwen 3.8 ที่ 40 นั้นเป็นการวัดที่เป็นอิสระ และมีค่ามากกว่าสิ่งใด ๆ ข้างต้น สิ่งเหล่านั้นเป็นหลักฐานคนละประเภท และไม่ควรนำมาเฉลี่ยรวมกัน

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

การเปรียบเทียบต้นทุนแบบแสดงวิธีคำนวณ โดยระบุสมมติฐานไว้อย่างชัดเจน

ลองพิจารณางานวิเคราะห์เอกสารยาวและวิดีโอ: อินพุต 300,000 โทเคน และเอาต์พุต 20,000 โทเคน ซึ่งเป็นปริมาณที่น่าจะเป็นไปได้สำหรับการประชุมที่บันทึกไว้ 90 นาทีพร้อมสไลด์ เมื่อใช้ Qwen3.8-Omni-Flash จะคิดเป็น 300,000 × $0.15 ต่อล้าน = $0.045 สำหรับอินพุต และ 20,000 × $0.47 ต่อล้าน = $0.0094 สำหรับเอาต์พุต ดังนั้นประมาณ 5.4 เซนต์ เมื่อใช้ Qwen 3.8 การเรียกเดียวกันจะคิดเป็น 300,000 × $2.00 ต่อล้าน = $0.60 และ 20,000 × $6.00 ต่อล้าน = $0.12 หรือประมาณ 72 เซนต์ ต้นทุนสูงกว่าสิบสามเท่าเล็กน้อยสำหรับจำนวนโทเคนเดียวกัน

ตัวเลขที่เปลี่ยนการตัดสินใจไม่ใช่อัตราส่วน แต่คือปริมาณ ที่งานแบบนี้หนึ่งร้อยงานต่อวัน นั่นคือประมาณ 5 ดอลลาร์ต่อวัน เทียบกับประมาณ 72 ดอลลาร์ต่อวัน — ความแตกต่างระหว่างฟีเจอร์ที่คุณส่งมอบ กับฟีเจอร์ที่คุณลดขอบเขตลง แต่ถ้างานคือการสกัดข้อมูลยาก ๆ หนึ่งครั้งจากสัญญาขนาด 300K โทเค็น ซึ่งคำตอบที่ผิดมีค่าใช้จ่ายเป็นเวลาตรวจทานโดยมนุษย์หนึ่งชั่วโมง ค่าใช้จ่ายที่แพงกว่า 13 เท่าก็ไม่มีความสำคัญ และโมเดลที่ให้เหตุผลแข็งแกร่งกว่าจะชนะตรงความผิดพลาดครั้งแรกที่มันไม่ทำ ตั้งสมมติฐานก่อนที่คุณจะดูราคา ไม่ใช่หลังจากนั้น

จุดที่แต่ละตัวชนะจริง ๆ

Qwen3.8-Omni-Flash ชนะในทุกงานที่นับเวลากันเป็นชั่วโมง ไม่ว่าจะเป็นการถอดเสียงบันทึกการประชุมพร้อมการแยกแยะผู้พูด (diarisation) และการสกัดงานที่ต้องติดตามผล การสรุปวิดีโอยาว รายงานวิจัยเชิงเสียงและภาพ ไปป์ไลน์การใส่คำบรรยาย และเอเจนต์ใด ๆ ที่ต้องตัดสินใจเองว่าวินาทีไหนของไฟล์บันทึกมีความสำคัญ การปรับปรุงด้านการแยกแยะผู้พูดตามที่ผู้ขายรายงานไว้ — อัตราความผิดพลาดในการระบุผู้พูดของ AliMeeting ลดลงจาก 88.11 เหลือ 3.35 — เป็นส่วนต่างแบบที่เปลี่ยนไปป์ไลน์ซึ่งต้องมีคนตรวจสอบให้กลายเป็นไปป์ไลน์อัตโนมัติ แม้ว่าการวิเคราะห์เชิงเทคนิคฉบับภาษาจีนเกี่ยวกับการเปิดตัวครั้งนี้จะโต้แย้งว่าผลที่ได้ส่วนใหญ่มาจากงานวิศวกรรมส่วนหน้าและงานวิศวกรรมการแยกแยะผู้พูดที่ห่อหุ้มโมเดลไว้ มากกว่าจะมาจากตัวโมเดลเอง ดังนั้นควรทดสอบวัดผลกับเสียงของคุณเองก่อนจะยุติขั้นตอนการตรวจสอบโดยมนุษย์ โมเดล omni ยังชนะอย่างชัดเจนในด้านราคาสำหรับงานข้อความปริมาณมากใด ๆ ที่คุณภาพข้อความของมันเพียงพอ ซึ่งอาลีบาบาอ้างว่าเทียบได้กับโมเดลข้อความล้วนขนาดเดียวกัน — เป็นข้ออ้างที่ยังไม่มีการทำซ้ำ และควรทดสอบมากกว่าที่จะสันนิษฐานเอา

Qwen 3.8 ชนะในทุกที่ที่ผลลัพธ์ถูกตัดสินมากกว่านับเป็นตัวเลข: การให้เหตุผลที่ยาก งานเอเจนต์ระยะยาว งานเขียนโค้ดขนาดใหญ่ การวิเคราะห์เอกสารระดับล้านโทเคนที่การสังเคราะห์คือผลิตภัณฑ์ มันยังชนะในมิติที่ไม่เกี่ยวข้องกับเบนช์มาร์กเลย — มันเป็น โอเพนเวท หากข้อจำกัดของคุณคือการเก็บข้อมูลให้อยู่ในประเทศ การปรับใช้บนเครื่องภายในองค์กร การไฟน์ทูน หรือเพียงแค่ไม่อยากให้มีผู้ขายรายใดอยู่ในเส้นทางการอนุมาน โมเดลออมนิก็ไม่ใช่ตัวเลือกเลยตั้งแต่แรก และไม่มีข้อได้เปรียบด้านราคาใด ๆ ที่ปิดช่องว่างนั้นได้ ข้อจำกัดเพียงข้อเดียวนั้นตัดสินการนำไปใช้งานจริงได้มากกว่าตัวเลขทั้งหมดข้างต้น

Running them without two contracts

ความยุ่งยากในทางปฏิบัติของการเปรียบเทียบแบบนี้แทบไม่เคยอยู่ที่การเลือกโมเดล แต่อยู่ที่คุณต้องผสานรวมผู้ให้บริการสองราย ความสัมพันธ์ด้านการเรียกเก็บเงินสองชุด และโค้ดไคลเอนต์สองชุด เพื่อค้นหาว่าจริง ๆ แล้วคุณต้องการตัวไหนQwen3.8-Max — เอนด์พอยต์ที่บรรจุแกนเปิดขนาด 2.4 ล้านล้านพารามิเตอร์ — เปิดให้ใช้งานแล้วบน OrcaRouterภายใต้รหัสโมเดลqwen/qwen3.8-max ในราคา $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $6.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน พร้อมบริบทหนึ่งล้านโทเคน และรองรับอินพุตข้อความ รูปภาพ และวิดีโอ ควบคู่ไปกับโมเดลอื่นอีกกว่า 200 โมเดลบนคีย์เดียวในราคาตามรายการของผู้ให้บริการ โดยไม่บวกเพิ่ม 0% และมีระบบสลับไปยังผู้ให้บริการรายอื่นอัตโนมัติหากเอนด์พอยต์เสื่อมประสิทธิภาพQwen3.8-Omni-Flashไม่ได้อยู่ในแค็ตตาล็อกนั้น — มันทำงานบนแพลตฟอร์มของ Alibaba เอง — ดังนั้นการตั้งค่าที่ตรงไปตรงมาในวันนี้คือใช้เรือธงบนเส้นทางของเรา และเรียกโมเดล omni โดยตรง โดยเลเยอร์การจัดเส้นทางให้ที่สำหรับวางโมเดลที่แพ้ในการทดสอบ เมื่อคุณทดสอบเสร็จแล้ว

A screenshot of the OrcaRouter model page for Qwen3.8 Max at www.orcarouter.ai/models/qwen/qwen3.8-max (captured 18 September 2026, English UI), showing the model id qwen/qwen3.8-max with a FEATURED badge and a byline date of 2026-08-03, a spec panel reading ctx 1M tokens, Input text + image + video, Output text, p50 TTFT 10.00s, and a metrics row reading INPUT $2.00 / 1M tokens, OUTPUT $6.00 / 1M tokens, TRAFFIC 84.0M tokens / 7d, above OpenAI- and Anthropic-compatible SDK code samples.

คำตัดสิน

เลือก Qwen3.8-Omni-Flash เมื่ออินพุตยาว เอาต์พุตสั้น และปริมาณทำให้ราคาต่อหน่วยเป็นข้อจำกัดที่ชี้ขาด เลือก Qwen 3.8 เมื่ออินพุตหนาแน่น เอาต์พุตคือตัวผลิตภัณฑ์ และไม่ว่าจะเป็นความถูกต้องหรือการควบคุมการนำไปใช้งาน ล้วนเป็นสิ่งที่ไม่สามารถต่อรองได้ พื้นที่ที่ทับซ้อนกัน — การทำความเข้าใจวิดีโอ — เป็นจุดเดียวที่มีการเปรียบเทียบแบบตัวต่อตัวอย่างแท้จริง และในพื้นที่นั้น โมเดลออมนิเป็นฝ่ายได้เปรียบในประเด็นต้นทุนและระยะเวลา ขณะที่เรือธงเป็นฝ่ายได้เปรียบในประเด็นการให้เหตุผลและน้ำหนักแบบเปิด รันทั้งสองตัวบนข้อมูลของคุณเองก่อนตัดสินใจ โมเดลออมนิยังไม่มีการประเมินที่เป็นอิสระ และข้อได้เปรียบด้านราคาในวันเปิดตัวก็เป็นสิ่งประเภทที่ควรยืนยันกับบิลจริงมากกว่าคำประกาศ

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube