
Qwen3.8-Omni-Flash ผ่านไปห้าวัน: ประตูเดียว ไม่มีเวต และคะแนนชุดแรกที่ไม่ใช่ของ Alibaba
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ห้าวันหลังจากที่ผู้ให้บริการเปิด Qwen3.8-Omni-Flash ให้กับลูกค้า API โมเดลนี้ก็ยังมีบ้านอยู่เพียงแห่งเดียวเท่านั้น มันทำงานบนแพลตฟอร์ม Qianwen ของผู้ให้บริการเองและบนบริการคลาวด์ Bailian ของบริษัท รายการต่าง ๆ จากบุคคลที่สามที่ปรากฏขึ้นนับตั้งแต่เปิดตัวเป็นเพียงพร็อกซีที่อยู่หน้าเอนด์พอยต์เดียวกัน ไม่ใช่ที่อยู่แห่งที่สองของโมเดลนี้ ไม่มีการเปิดเผยเวตใด ๆ ตัวเลขในวันเปิดตัว — การลดต้นทุนค่าออดิโอหนึ่งชั่วโมงลง 98% การเพิ่มขึ้นเฉลี่ย 26% เมื่อเทียบกับ Qwen3.5-Omni-Plus คอนเท็กซ์หนึ่งล้านโทเคน เอาต์พุตแบบข้อความเท่านั้น — ยังคงเป็นตัวเลขของผู้ให้บริการเองและยังไม่มีการทำซ้ำให้เห็นที่อื่น สิ่งที่เปลี่ยนไปจริง ๆ ในห้าวันนี้ไม่ใช่ตัวโมเดล แต่เป็นพื้นดินรอบ ๆ ตัวมันต่างหาก: มีชั้นบาง ๆ ของคะแนนจากบุคคลที่สามปรากฏขึ้น การสนับสนุนของเฟรมเวิร์กมาถึงตั้งแต่วันแรก และการเปรียบเทียบที่ทุกคนเอื้อมไปหยิบใช้คือการเทียบกับ Gemini 3.8 Flash มากกว่า Qwen3.8-Flash ที่โมเดลนี้ถูกสร้างขึ้นมาคู่กัน แต่ละเรื่องเหล่านี้สมควรได้รับการพิจารณาให้ละเอียดกว่าที่การรายงานข่าวตอนเปิดตัวได้ทำไว้
ประตูบานนี้เป็นประตูที่ดี และมันเป็นบานเดียวเท่านั้น
ความพร้อมใช้งานกว้างขวางขึ้นโดยไม่ได้กลายเป็นหลายเจ้า โมเดลตอบคำขอที่อยู่ในรูปแบบ OpenAI ได้โดยไม่เปลี่ยนแปลง ซึ่งหมายความว่าโค้ดไคลเอนต์ที่มีอยู่ใช้งานได้เป็นส่วนใหญ่ สิ่งที่พังคือเอนด์พอยต์ เพราะโฮสต์ระหว่างประเทศและโฮสต์ในจีนแผ่นดินใหญ่เป็นบริการแยกกันที่มีการคิดค่าบริการแยกกัน โค้ดที่ชี้ไปยังค่าเริ่มต้นจะล้มเหลวหรือถูกคิดเงินในสกุลเงินที่ผิด และเรื่องราคาต่อชั่วโมงจะใช้ได้เฉพาะฝั่งระหว่างประเทศเท่านั้น ไลบรารีไคลเอนต์โอเพนซอร์สมีการรองรับโมเดลนี้ตั้งแต่วันแรก ซึ่งมีประโยชน์จริงและก็ไม่ได้เป็นผู้ให้บริการรายที่สอง: ไลบรารีที่สื่อสารกับ Bailian เป็นเพียงตัวห่ออำนวยความสะดวกสำหรับแหล่งซัพพลายแหล่งเดียวเดียวกัน
นั่นคือความเสี่ยงเชิงโครงสร้างที่ควรค่าแก่การเอ่ยถึง โมเดลจากแหล่งเดียวไม่มีเส้นทางสำรองสำหรับกรณีล้มเหลว หาก endpoint จำกัดอัตราการเรียกใช้งาน เสื่อมประสิทธิภาพลง หรือภูมิภาคใดภูมิภาคหนึ่งดับไป ก็ไม่มีที่ให้ไป และการสนับสนุนจากไลบรารีฝั่งไคลเอนต์ไม่ว่าจะมากเพียงใดก็ไม่อาจเปลี่ยนข้อเท็จจริงนี้ได้ นี่ก็เป็นเหตุผลที่เราระบุจุดยืนของเราอย่างตรงไปตรงมาแทนที่จะปล่อยให้เข้าใจเป็นอย่างอื่น: Qwen3.8-Omni-Flashไม่ได้อยู่ในแค็ตตาล็อกของเรา เราไม่ได้โฮสต์โมเดลนี้ และผู้อ่านที่สมัครโดยคาดว่าจะเราเตอร์ไปยังโมเดลนี้จะถูกทำให้เข้าใจผิด สิ่งที่เราเตอร์ได้คือโมเดลอื่น ๆ ในตระกูลเดียวกัน — Qwen3.8-FlashและQwen3.8-Maxต่างเปิดให้ใช้งานอยู่บนAPI ของเรา — และ OrcaRouter ส่งผ่านราคาตามรายการของผู้ให้บริการโดยไม่บวกราคาเพิ่ม 0% ดังนั้นเมื่อราคา omni ของ Alibaba ปรับเปลี่ยน หรือในวันที่โมเดล omni พร้อมให้เราเตอร์ได้ การเปลี่ยนแปลงจะไปถึงลูกค้าในวันเดียวกัน แทนที่จะเป็นตอนต่อสัญญาครั้งถัดไป

คะแนนชุดแรกที่ไม่ใช่ของ Alibaba นั้นเบาบาง และไม่น่าประทับใจเลย
ยังไม่มีข้อมูลใด ๆ เกี่ยวกับโมเดลนี้บน Artificial Analysis และเมื่อผ่านไปห้าวัน การไม่มีข้อมูลนั้นก็คือพาดหัวที่ตรงไปตรงมา: ลีดเดอร์บอร์ดที่ทุกคนอ้างอิงสำหรับโมเดลที่ใกล้เคียงยังไม่มีแถวสำหรับรุ่น omni ช่องว่างนี้ถูกเติมเต็มด้วยสิ่งอื่น แพลตฟอร์มประเมินจากบุคคลที่สามเริ่มเผยแพร่การรันทดสอบกับโมเดลนี้ และบทสรุปของมันน่าอ่านก็เพราะสิ่งที่มันไม่ได้บอกไว้มากมายนั่นเอง รายงานระบุว่าการจำแนกอีเมลมีความแม่นยำ 99.0% (เปอร์เซ็นไทล์ที่ 86) จริยธรรม 95.0% (เปอร์เซ็นไทล์ที่ 23) และการให้เหตุผล 56.0% ซึ่งจัดอยู่ในเปอร์เซ็นไทล์ที่ 28 และเรียกว่าเป็นจุดอ่อนที่น่าสังเกต ความเร็วอยู่ในเปอร์เซ็นไทล์ที่ 21 ต้นทุนอยู่ในเปอร์เซ็นไทล์ที่ 58 โดยมีอัตราความสำเร็จโดยรวม 89%
จงปฏิบัติต่อข้อมูลเหล่านั้นด้วยความระมัดระวังอย่างแท้จริง และไม่ใช่เพียงเพราะขนาดตัวอย่างเล็กเท่านั้น หน้าเดียวกันนั้นระบุวันเปิดตัวของโมเดลว่าเป็นวันที่ 20 กันยายน ซึ่งเป็นสองวันหลังจาก Alibaba เปิดตัวมัน ไม่ได้ให้วันที่รันสำหรับผลลัพธ์ใด ๆ และแสดงตาราง benchmark เปล่า ๆ ใต้บทสรุปที่อธิบายตัวเลขซึ่งไม่มีอยู่ในตาราง นั่นคือลักษณะของฮาร์เนสระยะเริ่มต้นที่ถูกกำกับดูแลเพียงเล็กน้อย มากกว่าจะเป็นการประเมินที่วัดผลจริง และการตีความอย่างซื่อตรงก็คือ ข้อมูลเหล่านี้เป็นจุดข้อมูลชุดแรกที่ไม่ใช่จากผู้ขาย มากกว่าจะเป็นชุดแรกที่เชื่อถือได้ พวกมันเป็นเหตุผลให้คุณทดลองใช้โมเดลด้วยตนเอง ไม่ใช่เหตุผลให้สรุปสิ่งใด ทิศทางนั้นสอดคล้องกับสิ่งที่เอกสารของเจ้าของโมเดลสื่อเป็นนัยผ่านการไม่กล่าวถึง นั่นคือ นี่เป็นโมเดลด้านการรับรู้และสื่อแบบยาว และกระดานที่เน้นการให้เหตุผลไม่ใช่จุดที่มันถูกมุ่งเป้าไว้
นอกจากนี้ยังมีกับดักในผลการค้นหาที่จะดักจับผู้คนในอีกไม่กี่สัปดาห์ข้างหน้า Qwen 3.8 ซึ่งเป็นโมเดลข้อความ มีค่า Artificial Analysis Intelligence Index อยู่ในช่วงสี่สิบ และตัวเลขนั้นถูกยกมาอ้างในบทสรุปมากกว่าหนึ่งฉบับ ราวกับว่ามันอธิบายโมเดล omni แต่มันไม่ใช่ พวกมันเป็นโมเดลที่แตกต่างกันซึ่งมีหน้าที่ต่างกัน และโมเดล omni ยังไม่มีดัชนีใด ๆ เลยในตอนนี้

ตารางเบนช์มาร์กยังคงเป็นผู้ขายรายเดียวที่เปรียบเทียบกับตัวเอง
ตัวเลขจากการเปิดตัว — การปรับปรุงโดยเฉลี่ยมากกว่า 26% จากการประเมินราวสามสิบรายการ — วัดเทียบกับQwen3.5-Omni-Plus นั่นบอกคุณว่าตระกูลนี้ขยับไปแล้ว แต่ไม่ได้บอกว่าตัวแบบอยู่ตรงจุดใดเมื่อเทียบกับสิ่งที่คุณอาจจ่ายเงินอยู่แล้ว และการเปรียบเทียบแบบเลือกสรรที่เผยแพร่ควบคู่กันมาก็ไม่ได้ปิดช่องว่างนั้นเช่นกัน ภาพที่ผู้ขายรายงานเทียบกับGemini 3.8 Flashคือชัยชนะที่แท้จริงบนการทดสอบด้านเสียง และเป็นความพ่ายแพ้บนการทดสอบที่วัดงานวิดีโอเชิงเอเจนต์: WildClawBench-MM 71.0 เทียบกับ 58.9 และ SpotSoundBench 67.2 เทียบกับ 39.7 ในด้านหนึ่ง AgenticVBench 36.8 เทียบกับ 45.0 และ OmniGAIA 74.0 เทียบกับ 78.6 ในอีกด้านหนึ่ง ภาษาที่ Alibaba ใช้สรุปเอง — ประสิทธิภาพด้านเสียง-วิดีโอที่ "เข้าใกล้" Gemini ขณะที่ประสิทธิภาพด้านเสียงโดยรวมเกินกว่านั้น — รอบคอบกว่าพาดหัวข่าวที่เกิดขึ้น และเวอร์ชันที่รอบคอบคือเวอร์ชันที่ถูกต้อง
• บริบท — 1M โทเคน โดยมีอินพุตสูงสุดประมาณ 991K (ประมาณ 983K ในโหมดคิด) และเอาต์พุตสูงสุด 131K
• รูปแบบข้อมูล (Modality) — ข้อความ รูปภาพ เสียง และวิดีโอเป็นอินพุต; เอาต์พุตเป็นข้อความเท่านั้น โมเดลพื้นฐานไม่มีการสร้างเสียงพูด
• ระยะเวลา — สูงสุดหนึ่งชั่วโมงของเสียงหรือเสียงวิดีโอแบบต่อเนื่องต่อการเรียกหนึ่งครั้ง ซึ่งเป็นสิ่งที่ทำให้การประชุมและการทำงานกับสื่อความยาวนานเป็นไปได้โดยไม่ต้องแบ่งเป็นส่วนย่อย
• ความครอบคลุมด้านภาษา — การรู้จำครอบคลุม 74 ภาษา บวกกับภาษาถิ่นจีนอีก 39 ถิ่นในสื่อเปิดตัว โดยมีตัวเลขที่กว้างกว่านั้น (113 ภาษาและภาษาถิ่น) ซึ่งอ้างไว้ที่อื่นสำหรับอินพุตเสียง
• รายละเอียดอินพุต — รองรับเสียงเชิงพื้นที่แบบสเตอริโอและแบบสี่ช่องสัญญาณ โดยรุ่น Realtime ได้รับการอธิบายว่าเป็นโมเดล omni-modal ตัวแรกที่สามารถระบุตำแหน่งเป้าหมายจากเสียงของมันได้
• ราคา — $0.15 ต่อ 1 ล้านโทเค็นอินพุต, $0.016 สำหรับแคช, $0.47 เอาต์พุตในฝั่งนานาชาติ และรายการราคาแผ่นดินใหญ่แยกต่างหากซึ่งไม่สามารถเปรียบเทียบได้
98% นั้นเป็นเรื่องจริง และมันไม่ใช่บิลของคุณ
ตามวิธีการของ Alibaba เอง — ตัวอย่างสองนาทีคูณด้วยสามสิบ วิดีโอที่สุ่มตัวอย่างที่ 720p และหนึ่งเฟรมต่อวินาที — หนึ่งชั่วโมงของอินพุตเสียงลดลงจาก $0.28 เหลือต่ำกว่า $0.01 และหนึ่งชั่วโมงของเสียงและวิดีโอรวมกันจาก $3.27 เหลือ $0.20 นั่นเป็นการลดลงที่มาก เจาะจง และรายงานโดยผู้ขาย และเป็นการลดลงในรายการเดียว เลขคณิตที่สำคัญคือสัดส่วนของปริมาณงานของคุณที่รายการนั้นคิดเป็น ไปป์ไลน์ที่ใช้โทเคนส่วนใหญ่ไปกับเอาต์พุต กับบริบทที่แคชไว้ หรือกับเฟรมวิดีโอที่สุ่มตัวอย่างหนาแน่นกว่าหนึ่งเฟรมต่อวินาที จะเห็นเปอร์เซ็นต์การเปลี่ยนแปลงในใบแจ้งหนี้น้อยกว่าที่พาดหัวสัญญาไว้มาก และพาดหัวนั้นเกี่ยวกับอินพุตเสียง ไม่ใช่เกี่ยวกับยอดรวม เพิ่มเอาต์พุตแบบข้อความล้วนเข้าไป ช่องว่างก็กว้างขึ้นอีกครั้ง: อะไรก็ตามที่ต้องพูดตอบกลับต้องใช้โมเดลที่สอง และโมเดลนั้นถูกคิดค่าบริการแยกต่างหาก
นี่คือส่วนหนึ่งของภาพรวมที่การจัดเส้นทางพิสูจน์คุณค่าของตัวเอง คุณค่าของเราเตอร์แบบส่งผ่านไม่ได้อยู่ที่ส่วนลด — แต่อยู่ที่การที่คุณจ่ายตามรายการราคาของผู้ขายเอง และเวิร์กโหลดสามารถกระจายไปยังหลายโมเดลได้ เพื่อให้โมเดลจากแหล่งเดียวเป็นเพียงองค์ประกอบ ไม่ใช่สิ่งที่ต้องพึ่งพา โมเดล omni ที่เป็นเพียงสิ่งเดียวที่คุณเรียกใช้ได้คือจุดล้มเหลวจุดเดียวทั้งในชั้นความพร้อมใช้งานและชั้นราคา

ห้าวันของการผลิตจะบอกอะไรคุณได้จริง ๆ
สามสิ่งที่จะไขคำถามที่ยังค้างคา การวัดผลการแยกผู้พูดของ AliMeeting โดยอิสระ — อัตราความผิดพลาดที่ลดลงจาก 88.11 เป็น 3.35 และ cpWER จาก 89.61 เป็น 17.18 — จะแสดงว่าผลนั้นเป็นของโมเดลหรือเป็นของวิศวกรรมการแยกผู้พูดและส่วนหน้าที่ห่อหุ้มโมเดล ซึ่งอย่างน้อยก็มีบทวิเคราะห์ทางเทคนิคของจีนชิ้นหนึ่งที่ให้เครดิตกับส่วนหลังเป็นหลัก การทดสอบซ้ำของการลดโทเคนในโหมดเอเจนติก ซึ่งความแม่นยำเพิ่มขึ้นจาก 63.4 เป็น 67.8 บน OmniVideoBench ในขณะที่โทเคนต่อคำถามลดลงจาก 145,736 เป็น 79,117 จะยืนยันข้ออ้างที่มีประโยชน์ที่สุดในรีลีสนี้: ว่าโมเดลสามารถดีขึ้นและถูกลงในเวลาเดียวกัน และแถวใน Artificial Analysis หรือ arena จะเปลี่ยนตัวเลขจากผู้ขายทั้งหมดข้างต้นให้เป็นสิ่งที่เปรียบเทียบได้ ซึ่งเป็นเงื่อนไขเบื้องต้นสำหรับการที่โมเดลจะถูกเลือกใช้มากกว่าถูกทดลองใช้
จนถึงตอนนั้น แนวทางที่สมเหตุสมผลคือแนวทางที่ใช้กับโมเดลอายุห้าวันใดๆ ที่มีโฮสต์เดียวและไม่มีการประเมินอิสระ: คุ้มค่าที่จะวัดกับเสียงและวิดีโอของคุณเอง ไม่คุ้มค่าที่จะทำให้เป็นเส้นทางเดียวในไปป์ไลน์ของคุณ ถ้าภาระงานของคุณคือการประชุมแบบยาวหรือการวิเคราะห์สื่อเป็นภาษาจีนหรืออังกฤษ และค่าใช้จ่ายของคุณมาจากชั่วโมงอินพุตเป็นหลักมากกว่าโทเค็นเอาต์พุต ความคุ้มค่าตรงนี้ก็แข็งแกร่งพอที่จะทำให้การทดสอบในสัปดาห์นี้สมเหตุสมผล ถ้าภาระงานของคุณต้องการเสียงพูดกลับ หรือต้องการทางเลือกสำรองเมื่อผู้ให้บริการเสื่อมประสิทธิภาพ โมเดลในสภาพที่เป็นอยู่ในวันนี้ไม่สามารถเป็นคำตอบทั้งหมดได้ — และไม่ว่าการสนับสนุนเฟรมเวิร์กแบบ day-zero จะมีมากเพียงใด ก็ไม่เปลี่ยนแปลงสิ่งนั้น
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
