
Qwen3.8-Omni-Flash กับ Qwen 3.8: บิลด์เฉพาะทาง ปะทะ บิลด์เรือธง
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 984 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 196 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
ถ้าอยากได้เวอร์ชันสั้น ๆ: Qwen3.8-Omni-Flashมีราคาถูกกว่าราวสิบสามเท่าต่อโทเคนเมื่อเทียบกับQwen 3.8และเป็นรุ่นเดียวในสองรุ่นนี้ที่ออกแบบมาให้รองรับออดิโอวิดีโอได้นานถึงหนึ่งชั่วโมงโดยไม่สะดุด — ในขณะที่ Qwen 3.8 ซึ่งเป็นแกนเปิดขนาด 2.4 ล้านล้านพารามิเตอร์ที่อยู่บนสุดของสาย Qwen3.8 คือรุ่นที่คุณใช้เมื่อคำตอบต้องถูกต้องมากกว่าจะถูก และเป็นรุ่นเดียวในสองรุ่นนี้ที่คุณดาวน์โหลดน้ำหนักโมเดลได้ ทั้งสองรุ่นมีความยาวคอนเท็กซ์เท่ากัน อยู่ตระกูลเดียวกัน และมีช่วงเปิดตัวระหว่างเดือนสิงหาคมถึงกันยายน พวกมันไม่ใช่ของที่ใช้แทนกันได้ และคุณค่าทั้งหมดของการเปรียบเทียบนี้อยู่ที่การรู้ว่าจริง ๆ แล้วคุณกำลังถามคำถามอะไรอยู่
เพื่อให้แม่นยำเรื่องชื่อ เพราะตระกูลนี้มีสมาชิก crowded กันเยอะ Qwen 3.8ในที่นี้หมายถึงแกนกลางแบบเปิดตระกูล mixture-of-experts ขนาด 2.4T-A95B — โมเดลที่อยู่เบื้องหลังเอนด์พอยต์ Qwen3.8-Max ซึ่ง Alibaba เปิดตัวเมื่อวันที่ 3 สิงหาคม 2026 และเผยแพร่เวตเมื่อวันที่ 12 สิงหาคม และซึ่ง Artificial Analysis จัดอันดับไว้ที่ 40 ในดัชนี Intelligence Index ของตน Qwen3.8-Omni-Flashคือโมเดล omni-modal แบบเนทีฟที่ Alibaba นำออกให้บริการผ่าน API เมื่อวันที่ 18 กันยายน 2026 สร้างขึ้นบนสายสถาปัตยกรรม Qwen3.8-Flash รับข้อความ ภาพ เสียง และวิดีโอเข้า แล้วส่งคืนข้อความ ทุกอย่างเกี่ยวกับโมเดลเรือธงเป็นข้อมูลที่ผู้ขายรายงานเองหรือจัดอันดับโดยอิสระ ตามที่ระบุไว้ ส่วนทุกอย่างเกี่ยวกับโมเดล omni เป็นข้อมูลที่ผู้ขายรายงานเองเพียงอย่างเดียว เพราะเพิ่งเปิดตัวได้ไม่กี่ชั่วโมงและยังไม่มีใครนอก Alibaba วัดผลมัน
สองโมเดล หนึ่งตระกูล กับบรีฟการออกแบบที่ตรงกันข้าม
สิ่งล่อใจคือการอ่านสิ่งนี้เป็นโมเดลขนาดใหญ่และโมเดลขนาดเล็กจากรุ่นเดียวกัน เหมือนกับที่คุณอ่าน Qwen3.8-Max เทียบกับ Qwen3.8-Flash การอ่านเช่นนั้นผิดในแบบที่ต้องเสียค่าใช้จ่าย แกนหลักของ Qwen 3.8 คือเครื่องยนต์การให้เหตุผลที่บังเอิญรับภาพและวิดีโอได้ ปริมาณงานของมันวัดเป็นโทเค็นต่อวินาทีสำหรับปัญหายาก ราคาของมันถูกตั้งค่าให้สะท้อนต้นทุนการคำนวณของการส่งผ่านไปข้างหน้าของพารามิเตอร์ที่ใช้งาน 95 พันล้านพารามิเตอร์ และแผ่นประเมินของมันคือรายการของบอร์ดการให้เหตุผลและการเขียนโค้ด Qwen3.8-Omni-Flash เป็นเครื่องยนต์การรับรู้และการกระทำที่บังเอิญให้เหตุผลได้ ราคาของมันถูกตั้งค่าเทียบกับต้นทุนการนำเข้าสื่อหลายชั่วโมง และแผ่นประเมินของมันคือรายการของบอร์ดเสียง วิดีโอ และการเรียกใช้เครื่องมือ ตัวหนึ่งถูกปรับให้เหมาะสมสำหรับความลึกต่อโทเค็น อีกตัวถูกปรับให้เหมาะสมสำหรับโทเค็นต่อชั่วโมงของเนื้อหา
ความแตกต่างนั้นปรากฏชัดที่สุดในจุดที่การตลาดไม่ได้พูดถึง ทั้งสองโมเดลรับได้ประมาณหนึ่งล้านโทเค็น และทั้งคู่รับวิดีโอ แต่ Qwen3.8-Omni-Flash ถูกออกแบบมาโดยเฉพาะเพื่อจัดการกับปัญหาด้านระยะเวลา — รองรับเสียงและวิดีโอต่อเนื่องได้นานถึงหนึ่งชั่วโมงในการเรียกใช้ครั้งเดียว พร้อมโหมด Agentic Understanding ซึ่งโมเดลเลือกว่าจะสุ่มตัวอย่างส่วนใดแทนที่จะประมวลผลทุกเฟรม ลดจำนวนโทเค็นต่อคิวรีจาก 145,736 เหลือ 79,117 พร้อมทั้งเพิ่มความแม่นยำบน OmniVideoBench จาก 63.4 เป็น 67.8. Qwen 3.8ไม่มีกลไกที่เผยแพร่เทียบเท่า การป้อนวิดีโอสองชั่วโมงให้กับมันเป็นไปได้ในทางทฤษฎี แต่การทำเช่นนั้นในราคาที่ผ่านการตรวจสอบของทีมการเงินเป็นอีกคำถามหนึ่ง และนั่นคือคำถามที่โมเดล omni ถูกสร้างขึ้นมาเพื่อตอบ
มิติที่เป็นตัวชี้ขาดจริง ๆ
• ราคา — Qwen3.8-Omni-Flash $0.15 ต่ออินพุตหนึ่งล้าน และ $0.47 ต่อเอาต์พุตหนึ่งล้าน เทียบกับ Qwen 3.8 ที่ $2.00 และ $6.00 การอ่านแคช: $0.016 เทียบกับ $0.25
• น้ำหนักโมเดลแบบเปิด — Qwen 3.8 เผยแพร่น้ำหนักโมเดลเมื่อวันที่ 12 สิงหาคม 2026 ภายใต้ใบอนุญาตแบบกำหนดเอง; Qwen3.8-Omni-Flash ให้บริการผ่าน API เท่านั้น และ Alibaba ยังไม่ประกาศว่าจะเปิดให้เผยแพร่
• บริบท — หนึ่งล้านโทเค็นทั้งสองฝั่ง; อินพุตสูงสุด 991K บนโมเดล omni พร้อมเอาต์พุตสูงสุด 131K และงบประมาณการให้เหตุผล 262K
• ระยะเวลาสื่อ — สูงสุดหนึ่งชั่วโมงของเสียงและวิดีโอต่อเนื่องในการเรียกแบบ omni ครั้งเดียว; รุ่นเรือธงมีเอกสารระบุสำหรับอินพุตวิดีโอ โดยไม่มีข้อมูลค่าใช้จ่ายต่อชั่วโมงประกอบ
• รูปแบบเอาต์พุต — ข้อความทั้งสองฝั่ง ทั้งคู่ไม่สร้างเสียงพูด แม้ว่าจะมีที่มาจากโมเดล omni
• คะแนนอิสระ — Qwen 3.8 อยู่ที่ 40 บน Artificial Analysis Intelligence Index ส่วน Qwen3.8-Omni-Flash ยังไม่มีคะแนนอิสระใด ๆ ทั้งสิ้น

ทำไมตาราง benchmark จึงไม่สามารถชี้ขาดเรื่องนี้ได้
ยังไม่มีตารางเปรียบเทียบแบบวัดกันตรง ๆ และอีกไม่นานก็คงจะยังไม่มี เอกสารเปิดตัวของ Alibaba สำหรับ Qwen3.8-Omni-Flashนั้นใช้เป็นเกณฑ์เปรียบเทียบกับ Qwen3.5-Omni-Plus ซึ่งเป็นรุ่นก่อนหน้าโดยตรงเท่านั้น และกับ Gemini 3.8 Flash ส่วนตัวเลขของเรือธงนั้นมาจากชุดการประเมินด้านการให้เหตุผลและการเขียนโค้ดอีกชุดหนึ่งทั้งหมด สองตารางนี้ไม่มีแถวใดร่วมกันเลย ใครก็ตามที่เผยแพร่ตารางซึ่งนำทั้งสองมาไว้ข้างกันบนแกนเดียวกัน แกนนั้นก็คือสิ่งที่พวกเขาประกอบขึ้นมาเอง
สิ่งที่พูดได้อย่างตรงไปตรงมาคือมันเป็นไปในเชิงทิศทาง จากตัวเลขของผู้ขายเอง โมเดล omni ถือเป็นก้าวที่ใหญ่เมื่อเทียบกับสาย omni ที่มันเข้ามาแทนที่ — โดยมีค่าเฉลี่ยเพิ่มขึ้นเกิน 26% จากการประเมินประมาณสามสิบรายการ โดย WildClawBench-MM อยู่ที่ 71.0, UniClawBench อยู่ที่ 69.6, LongAudioSpan อยู่ที่ 82.7 — และเป็นความก้าวหน้าที่จริงแต่เพียงบางส่วนเมื่อเทียบกับ Gemini 3.8 Flash โดยนำบนบอร์ดที่เน้นเสียงอย่าง SpotSoundBench (67.2 ต่อ 39.7) และ MMAU (81.8 ต่อ 76.9) และตามหลังใน AgenticVBench ที่เน้นการให้เหตุผลจากวิดีโอโดยแท้ (36.8 ต่อ 45.0) ในฝั่งเรือธง คะแนน Index ของ Qwen 3.8 ที่ 40 นั้นเป็นการวัดที่เป็นอิสระ และมีค่ามากกว่าสิ่งใด ๆ ข้างต้น สิ่งเหล่านั้นเป็นหลักฐานคนละประเภท และไม่ควรนำมาเฉลี่ยรวมกัน

การเปรียบเทียบต้นทุนแบบแสดงวิธีคำนวณ โดยระบุสมมติฐานไว้อย่างชัดเจน
ลองพิจารณางานวิเคราะห์เอกสารยาวและวิดีโอ: อินพุต 300,000 โทเคน และเอาต์พุต 20,000 โทเคน ซึ่งเป็นปริมาณที่น่าจะเป็นไปได้สำหรับการประชุมที่บันทึกไว้ 90 นาทีพร้อมสไลด์ เมื่อใช้ Qwen3.8-Omni-Flash จะคิดเป็น 300,000 × $0.15 ต่อล้าน = $0.045 สำหรับอินพุต และ 20,000 × $0.47 ต่อล้าน = $0.0094 สำหรับเอาต์พุต ดังนั้นประมาณ 5.4 เซนต์ เมื่อใช้ Qwen 3.8 การเรียกเดียวกันจะคิดเป็น 300,000 × $2.00 ต่อล้าน = $0.60 และ 20,000 × $6.00 ต่อล้าน = $0.12 หรือประมาณ 72 เซนต์ ต้นทุนสูงกว่าสิบสามเท่าเล็กน้อยสำหรับจำนวนโทเคนเดียวกัน
ตัวเลขที่เปลี่ยนการตัดสินใจไม่ใช่อัตราส่วน แต่คือปริมาณ ที่งานแบบนี้หนึ่งร้อยงานต่อวัน นั่นคือประมาณ 5 ดอลลาร์ต่อวัน เทียบกับประมาณ 72 ดอลลาร์ต่อวัน — ความแตกต่างระหว่างฟีเจอร์ที่คุณส่งมอบ กับฟีเจอร์ที่คุณลดขอบเขตลง แต่ถ้างานคือการสกัดข้อมูลยาก ๆ หนึ่งครั้งจากสัญญาขนาด 300K โทเค็น ซึ่งคำตอบที่ผิดมีค่าใช้จ่ายเป็นเวลาตรวจทานโดยมนุษย์หนึ่งชั่วโมง ค่าใช้จ่ายที่แพงกว่า 13 เท่าก็ไม่มีความสำคัญ และโมเดลที่ให้เหตุผลแข็งแกร่งกว่าจะชนะตรงความผิดพลาดครั้งแรกที่มันไม่ทำ ตั้งสมมติฐานก่อนที่คุณจะดูราคา ไม่ใช่หลังจากนั้น
จุดที่แต่ละตัวชนะจริง ๆ
Qwen3.8-Omni-Flash ชนะในทุกงานที่นับเวลากันเป็นชั่วโมง ไม่ว่าจะเป็นการถอดเสียงบันทึกการประชุมพร้อมการแยกแยะผู้พูด (diarisation) และการสกัดงานที่ต้องติดตามผล การสรุปวิดีโอยาว รายงานวิจัยเชิงเสียงและภาพ ไปป์ไลน์การใส่คำบรรยาย และเอเจนต์ใด ๆ ที่ต้องตัดสินใจเองว่าวินาทีไหนของไฟล์บันทึกมีความสำคัญ การปรับปรุงด้านการแยกแยะผู้พูดตามที่ผู้ขายรายงานไว้ — อัตราความผิดพลาดในการระบุผู้พูดของ AliMeeting ลดลงจาก 88.11 เหลือ 3.35 — เป็นส่วนต่างแบบที่เปลี่ยนไปป์ไลน์ซึ่งต้องมีคนตรวจสอบให้กลายเป็นไปป์ไลน์อัตโนมัติ แม้ว่าการวิเคราะห์เชิงเทคนิคฉบับภาษาจีนเกี่ยวกับการเปิดตัวครั้งนี้จะโต้แย้งว่าผลที่ได้ส่วนใหญ่มาจากงานวิศวกรรมส่วนหน้าและงานวิศวกรรมการแยกแยะผู้พูดที่ห่อหุ้มโมเดลไว้ มากกว่าจะมาจากตัวโมเดลเอง ดังนั้นควรทดสอบวัดผลกับเสียงของคุณเองก่อนจะยุติขั้นตอนการตรวจสอบโดยมนุษย์ โมเดล omni ยังชนะอย่างชัดเจนในด้านราคาสำหรับงานข้อความปริมาณมากใด ๆ ที่คุณภาพข้อความของมันเพียงพอ ซึ่งอาลีบาบาอ้างว่าเทียบได้กับโมเดลข้อความล้วนขนาดเดียวกัน — เป็นข้ออ้างที่ยังไม่มีการทำซ้ำ และควรทดสอบมากกว่าที่จะสันนิษฐานเอา
Qwen 3.8 ชนะในทุกที่ที่ผลลัพธ์ถูกตัดสินมากกว่านับเป็นตัวเลข: การให้เหตุผลที่ยาก งานเอเจนต์ระยะยาว งานเขียนโค้ดขนาดใหญ่ การวิเคราะห์เอกสารระดับล้านโทเคนที่การสังเคราะห์คือผลิตภัณฑ์ มันยังชนะในมิติที่ไม่เกี่ยวข้องกับเบนช์มาร์กเลย — มันเป็น โอเพนเวท หากข้อจำกัดของคุณคือการเก็บข้อมูลให้อยู่ในประเทศ การปรับใช้บนเครื่องภายในองค์กร การไฟน์ทูน หรือเพียงแค่ไม่อยากให้มีผู้ขายรายใดอยู่ในเส้นทางการอนุมาน โมเดลออมนิก็ไม่ใช่ตัวเลือกเลยตั้งแต่แรก และไม่มีข้อได้เปรียบด้านราคาใด ๆ ที่ปิดช่องว่างนั้นได้ ข้อจำกัดเพียงข้อเดียวนั้นตัดสินการนำไปใช้งานจริงได้มากกว่าตัวเลขทั้งหมดข้างต้น
Running them without two contracts
ความยุ่งยากในทางปฏิบัติของการเปรียบเทียบแบบนี้แทบไม่เคยอยู่ที่การเลือกโมเดล แต่อยู่ที่คุณต้องผสานรวมผู้ให้บริการสองราย ความสัมพันธ์ด้านการเรียกเก็บเงินสองชุด และโค้ดไคลเอนต์สองชุด เพื่อค้นหาว่าจริง ๆ แล้วคุณต้องการตัวไหนQwen3.8-Max — เอนด์พอยต์ที่บรรจุแกนเปิดขนาด 2.4 ล้านล้านพารามิเตอร์ — เปิดให้ใช้งานแล้วบน OrcaRouterภายใต้รหัสโมเดลqwen/qwen3.8-max ในราคา $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $6.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน พร้อมบริบทหนึ่งล้านโทเคน และรองรับอินพุตข้อความ รูปภาพ และวิดีโอ ควบคู่ไปกับโมเดลอื่นอีกกว่า 200 โมเดลบนคีย์เดียวในราคาตามรายการของผู้ให้บริการ โดยไม่บวกเพิ่ม 0% และมีระบบสลับไปยังผู้ให้บริการรายอื่นอัตโนมัติหากเอนด์พอยต์เสื่อมประสิทธิภาพQwen3.8-Omni-Flashไม่ได้อยู่ในแค็ตตาล็อกนั้น — มันทำงานบนแพลตฟอร์มของ Alibaba เอง — ดังนั้นการตั้งค่าที่ตรงไปตรงมาในวันนี้คือใช้เรือธงบนเส้นทางของเรา และเรียกโมเดล omni โดยตรง โดยเลเยอร์การจัดเส้นทางให้ที่สำหรับวางโมเดลที่แพ้ในการทดสอบ เมื่อคุณทดสอบเสร็จแล้ว

คำตัดสิน
เลือก Qwen3.8-Omni-Flash เมื่ออินพุตยาว เอาต์พุตสั้น และปริมาณทำให้ราคาต่อหน่วยเป็นข้อจำกัดที่ชี้ขาด เลือก Qwen 3.8 เมื่ออินพุตหนาแน่น เอาต์พุตคือตัวผลิตภัณฑ์ และไม่ว่าจะเป็นความถูกต้องหรือการควบคุมการนำไปใช้งาน ล้วนเป็นสิ่งที่ไม่สามารถต่อรองได้ พื้นที่ที่ทับซ้อนกัน — การทำความเข้าใจวิดีโอ — เป็นจุดเดียวที่มีการเปรียบเทียบแบบตัวต่อตัวอย่างแท้จริง และในพื้นที่นั้น โมเดลออมนิเป็นฝ่ายได้เปรียบในประเด็นต้นทุนและระยะเวลา ขณะที่เรือธงเป็นฝ่ายได้เปรียบในประเด็นการให้เหตุผลและน้ำหนักแบบเปิด รันทั้งสองตัวบนข้อมูลของคุณเองก่อนตัดสินใจ โมเดลออมนิยังไม่มีการประเมินที่เป็นอิสระ และข้อได้เปรียบด้านราคาในวันเปิดตัวก็เป็นสิ่งประเภทที่ควรยืนยันกับบิลจริงมากกว่าคำประกาศ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
