
Qwen3.8-Omni-Flash มาแล้ว: คอนเท็กซ์ 1M โทเคน, เสียงถูกลง 98%, เอาต์พุตข้อความเท่านั้น
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
การเปิดตัวครั้งนี้เปิด Qwen3.8-Omni-Flash ให้ลูกค้า API ในวันนี้ 18 กันยายน 2026 และตัวเลขที่นำมาโชว์เป็นอันดับแรกคือบิลค่าใช้จ่าย ไม่ใช่คะแนน benchmark ต่อชั่วโมงของอินพุตเสียง Qwen ระบุว่าโมเดลใหม่มีค่าใช้จ่าย ลดลง 98% เมื่อเทียบกับรุ่นก่อนหน้าอย่าง Qwen3.5-Omni-Plus ส่วนต่อชั่วโมงของเสียงและวิดีโอรวมกันนั้น ลดลง 93% ทุกอย่างที่เหลือในประกาศล้วนสืบเนื่องมาจากกรอบการนำเสนอนี้ Qwen3.8-Omni-Flash เป็นโมเดล omni-modal แบบเนทีฟ — รับข้อความ รูปภาพ เสียง และวิดีโอเข้า มีบริบทหนึ่งล้านโทเคน รองรับเสียงและวิดีโอต่อเนื่องได้ถึงหนึ่งชั่วโมงเต็มในการเรียกใช้ครั้งเดียว — และ Alibaba วางขายโมเดลนี้ไม่ใช่ในฐานะตัวบรรยายสื่อที่ดีกว่า แต่เป็นโมเดล Qwen ตัวแรกที่สร้างขึ้นเพื่อ ลงมือทำสิ่งต่าง ๆ กับสื่อนั้น คำโปรยคือ "Omni Senses. Agentic Delivery." ข้อจำกัดซึ่งระบุไว้ตรง ๆ ในเอกสารชุดเดียวกันคือ โมเดลนี้ตอบกลับเป็นข้อความเท่านั้น มันได้ยินและมองเห็น แต่ไม่พูด
ไม่มีสิ่งใดด้านล่างนี้ที่ได้รับการตรวจสอบซ้ำอย่างอิสระ โมเดลนี้เพิ่งเปิดตัวได้เพียงไม่กี่ชั่วโมง ยังไม่มีการประเมินจากบุคคลที่สาม และตัวเลข benchmark กับราคาทุกตัวในเอกสารเปิดตัวล้วนเป็นของ Alibaba เอง ในจุดที่ตัวเลขเป็นข้อมูลที่ผู้ขายรายงาน บทความนี้ระบุไว้ในประโยคที่มีตัวเลขนั้น ส่วนในจุดที่ข้อวิเคราะห์มาจากนักวิจารณ์มากกว่าผู้ขาย ก็มีการระบุที่มา และสิ่งเดียวคือสิ่งที่ตรวจสอบได้อย่างอิสระในวันนี้ — นั่นคือโมเดลนี้ให้บริการอยู่จริงบนแพลตฟอร์มของ Alibaba และไม่ได้อยู่ในแคตตาล็อกของใครอื่น — กลับเป็นสิ่งที่งานเปิดตัวสนใจจะพูดถึงน้อยที่สุด
สิ่งที่ส่งมอบจริง
สเปกชีตนี้สะอาดผิดปกติสำหรับการเปิดตัวโมเดลแบบ omni-modal ซึ่งนั่นเองคือประเด็นสำคัญ: โมเดล omni รุ่นก่อนหน้าในตระกูลนี้ถูกประกอบขึ้นจากตัวเข้ารหัสการรับรู้แยกส่วนที่นำมาต่อพ่วงเข้ากับ LLM สำหรับข้อความ ส่วนรุ่นนี้สร้างขึ้นโดยตรงบนสายสถาปัตยกรรม Qwen3.8-Flash โดยจัดการมอดาลิตีแบบเนทีฟแทนที่จะนำมาต่อเติมทีหลัง
• อินพุต — ข้อความ รูปภาพ เสียง และวิดีโอ โดยรองรับเสียงสเตอริโอและเสียงเชิงพื้นที่แบบสี่แชนแนล เอาต์พุตเป็นข้อความเท่านั้น
• บริบท — หนึ่งล้านโทเค็น โดยมีอินพุตสูงสุดที่ประมาณ 991K (ประมาณ 983K ในโหมดคิด) เอาต์พุตสูงสุดที่ 131K และงบประมาณการให้เหตุผลที่สูงถึง 262K
• ระยะเวลา — สูงสุดหนึ่งชั่วโมงของเสียงหรือออดิโอวิดีโอแบบต่อเนื่องต่อการโทรหนึ่งครั้ง ซึ่งเป็นตัวเลขที่ทำให้กรณีการใช้งานการประชุมและวิดีโอแบบยาวเป็นไปได้โดยไม่ต้องแบ่งท่อน
• ความครอบคลุมด้านเสียงพูด — การรู้จำเสียงใน 74 ภาษา และการสร้างเสียงพูดใน 29 ภาษาในเครื่องมือที่แวดล้อมอยู่;รายงานภาษาจีนฉบับหนึ่งเกี่ยวกับการเปิดตัวนี้ระบุว่า 113 ภาษาและภาษาถิ่นสำหรับการป้อนข้อมูลเสียง
• การพร้อมใช้งาน — แพลตฟอร์ม Qianwen AI และ Alibaba Cloud Model Studio (Bailian) ภายใต้ API id qwen3-8-omni-flash ยังไม่มีการเปิดเผยเวต โดยเวอร์ชัน Realtime ถูกอธิบายว่าเป็นโมเดล omni-modal ตัวแรกที่มีความสามารถในการระบุตำแหน่งแหล่งกำเนิดเสียง

98% เป็นข้ออ้างเรื่องต้นทุน และการคำนวณที่อยู่เบื้องหลังก็คุ้มค่าที่จะดู
การลดต้นทุนของออดิโอหนึ่งชั่วโมงลง 98% เป็นตัวเลขที่ใหญ่กว่าการลดราคาต่อโทเคนลง 98% มากนัก และช่องว่างระหว่างสองสิ่งนี้คือจุดที่ประกาศนี้เข้าไปทำงาน ตัวเลขต่อชั่วโมงนั้นได้มาจากการคิดราคาตัวอย่างความยาวสองนาทีแล้วคูณด้วยสามสิบ โดยวิดีโอถูกสุ่มตัวอย่างที่720p และหนึ่งเฟรมต่อวินาที นั่นเป็นวิธีที่ชอบด้วยเหตุผลในการอ้างอิงภาระงานการผลิต และ它也เป็นคำอธิบายถึงสิ่งที่โมเดลถูกสั่งให้ดูด้วย: หนึ่งเฟรมต่อวินาทีเพียงพอที่จะรู้ว่ามีการพูดอะไรและเกิดอะไรขึ้นบนหน้าจอโดยคร่าว แต่ไม่เพียงพอเลยที่จะตรวจสอบการทำงานระดับเฟรม ตัดสินคุณภาพการตัดต่อ หรือจับข้อบกพร่องเพียงเฟรมเดียว มีการเปลี่ยนแปลงสองอย่างที่ถูกคูณเข้าด้วยกัน — การลดราคาต่อหน่วยจริง และนโยบายการสุ่มตัวอย่างที่ดุดันกว่ามาก — และมีเพียงอย่างแรกเท่านั้นที่เป็นการปรับปรุงโมเดล
ราคาต่อหน่วยนั้นเป็นตัวเลขที่ชัดเจน ราคาระหว่างประเทศกำหนดไว้ที่ $0.15 ต่อล้านโทเคนอินพุต, $0.016 ต่อล้านโทเคนอินพุตที่แคชไว้ และ $0.47 ต่อล้านโทเคนเอาต์พุต ส่วนราคา Bailian ภายในประเทศกำหนดไว้ที่ ¥0.8 ต่อล้าน สำหรับอินพุตแบบมัลติโมดัล ลดลงจากประมาณ ¥18 โปรดทราบว่าระบบการเรียกเก็บเงินระหว่างประเทศและจีนแผ่นดินใหญ่แยกจากกัน และตัวเลขเหล่านี้ใช้แทนกันไม่ได้ ผู้ใดนำมาเปรียบเทียบโดยตรงจะได้คำตอบที่ผิด
นี่คือส่วนของข่าวประชาสัมพันธ์ที่การกำหนดเส้นทาง (routing) มีความสำคัญกว่าปกติ OrcaRouter ส่งผ่านราคาตามที่ผู้ให้บริการระบุไว้ โดยบวกเพิ่มเพียง0% เท่านั้น ดังนั้นการลดราคาของผู้จำหน่ายในลักษณะนี้จึงไปถึงมือลูกค้าของเราทันทีในวันที่ประกาศออก ไม่ต้องรอถึงการต่อสัญญาครั้งถัดไป ตัวอย่างเปรียบเทียบที่ตรวจสอบได้จริงมีอยู่แล้วในแคตตาล็อกของเราเอง: Qwen3.8-Flash ซึ่งเป็นโมเดลมัลติโมดัลที่สร้างเคียงข้างกันกับตัวนี้ สามารถกำหนดเส้นทางได้แล้ววันนี้ในราคา 0.15 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 0.47 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน — เป็นราคาตามที่ Alibaba ประกาศสำหรับโมเดล omni ตัวใหม่ — และมีปริมาณการรับส่งข้อมูลถึง 2.47 พันล้านโทเคนผ่าน API ของเราในเจ็ดวันก่อนที่จะเขียนข้อความนี้ ซึ่งเป็นตัวชี้วัดที่ยุติธรรมว่าลูกค้ากลุ่มนี้มีความต้องการมากเพียงใด ตัวโมเดล omni เองยังไม่มีอยู่ในแคตตาล็อกของเรา และจนกว่าจะมี มันก็ทำงานอยู่บนแพลตฟอร์มของ Alibaba เองเท่านั้น ไม่มีที่อื่น เราจะไม่แสร้งทำเป็นว่าเป็นอย่างอื่น
ทุกเบนช์มาร์กในการเปิดตัวเปรียบเทียบเพียงสิ่งเดียว
พาดหัวข่าวคือการปรับปรุงเฉลี่ยที่มากกว่า 26% จากการประเมินประมาณ 30 รายการ — และทุกการประเมินนั้นเทียบกับ Qwen3.5-Omni-Plus นั่นคือค่าพื้นฐานที่เหมาะสมสำหรับการเปิดตัว และเป็นค่าพื้นฐานที่แคบ: มันบอกคุณว่าตระกูลนี้ขยับไปแล้ว ไม่ได้บอกว่ามันไปอยู่ตรงไหนเมื่อเทียบกับอะไรก็ตามที่คุณอาจจ่ายเงินอยู่แล้ว
ตัวเลขแต่ละรายการ ซึ่งเป็นข้อมูลที่ผู้ขายรายงานเองทั้งหมด: WildClawBench-MM 71.0 เพิ่มขึ้น 36.5 จุด และเป็นการขยับที่มากที่สุดในชุดนี้ UniClawBench 69.6; AgenticVBench เพิ่มขึ้น 22.3 จุด แตะ 36.8; LongAudioSpan 82.7 เพิ่มขึ้น 8.3; OmniVideoBench 63.4 เพิ่มขึ้น 9.6; OmniCap-IF 28.2 คู่ที่น่าตกใจที่สุดคือการแยกผู้พูด (speaker diarisation) บน AliMeeting ซึ่งอัตราความผิดพลาดลดลงจาก 88.11 เหลือ 3.35 และ cpWER จาก 89.61 เหลือ 17.18 — เป็นการกระโดดที่มากพอจนควรค่าแก่การตรวจสอบอย่างละเอียดมากกว่าการปรบมือ บทวิเคราะห์ทางเทคนิคภาษาจีนเกี่ยวกับการเปิดตัวครั้งนี้โต้แย้งในประเด็นนั้นพอดี โดยมองว่าการปรับปรุงดังกล่าวมาจากงานวิศวกรรมด้านฟรอนต์เอนด์และการแยกผู้พูดที่ห่อหุ้มโมเดลอยู่เป็นหลัก มากกว่าจะมาจากความสามารถในการให้เหตุผลของโมเดลเอง และเตือนว่าตัวระบบดูเหมือนเชี่ยวชาญเฉพาะด้านการได้ยิน แต่การให้เหตุผลเชิงลึกจากวิดีโอกลับอ่อนกว่าค่อนข้างชัดเจน นั่นเป็นมุมมองของนักวิจารณ์ ไม่ใช่การทำซ้ำผลด้วยการวัดจริง แต่ขนาดของส่วนต่างที่ต่างกันก็เป็นเหตุผลที่ทำให้ต้องจดจำไว้

ตัวเลขอีกตัวที่ควรค่าแก่การจดจำไม่ใช่คะแนนเลย ในโหมดที่ Alibaba เรียกว่า Agentic Understanding โมเดลจะตัดสินใจด้วยตัวเองว่าจะดูและฟังอะไร แทนที่จะประมวลผลทุกเฟรม โดยรวบรวมหลักฐานเป็นรอบจากหยาบไปละเอียด บน OmniVideoBench โหมดนั้นเพิ่มความแม่นยำจาก 63.4 เป็น 67.8 พร้อมกับลดโทเคนต่อคำค้นหาจาก 145,736 เหลือ 79,117 — ลดลง 45.7% ความแม่นยำเพิ่มขึ้นและต้นทุนลดลงพร้อมกันเป็นคำกล่าวอ้างที่แข็งแกร่งที่สุดในการเปิดตัว และเป็นสิ่งที่สนับสนุนการนำเสนอแบบเอเจนติกโดยตรงที่สุด
การเปรียบเทียบ Gemini นั้นแคบกว่าที่การรายงานข่าวชี้ให้เห็น
จุดยืนของ Alibaba คือความสามารถด้านเสียงและวิดีโอ "เข้าใกล้" Gemini 3.8 Flash ขณะที่ประสิทธิภาพด้านเสียงโดยรวมนั้นเหนือกว่า เมื่อตัดกรอบการนำเสนอออกไป การเปรียบเทียบที่ผู้ขายรายงานเองก็มีหน้าตาแบบนี้ WildClawBench-MM: 71.0 เทียบกับ 58.9 SpotSoundBench: 67.2 เทียบกับ 39.7 MMAU: 81.8 เทียบกับ 76.9 DailyOmni: 85.1 เทียบกับ 84.0 นี่คือช่องว่างที่มีอยู่จริงในด้านเสียงและการใช้เครื่องมือที่เน้นเสียงเป็นหลัก แต่ก็เป็นการเลือกหยิบมาแสดงเช่นกัน บน AgenticVBench ซึ่งเป็นบอร์ดวัดการให้เหตุผลเชิงวิดีโอล้วน ลำดับกลับกัน — Gemini อยู่ที่ 45.0 เทียบกับ 36.8 ของ Qwen — และคำชี้แจงของ Alibaba เองก็ยอมรับว่า Gemini ยังนำอยู่ในการทดสอบความเข้าใจวิดีโอหลายรายการ บทสรุปที่สมเหตุสมผลคือ Qwen คว้าครึ่งที่เป็นเสียงของ omni ไปได้ และยังตามหลังอยู่ในครึ่งที่เป็นวิดีโอ ซึ่งเป็นข้อกล่าวอ้างที่ต่างจากสิ่งที่พาดหัวข่าวนำไปใช้
"โมเดลออมนิโหมดัลตัวแรกของ Qwen" ต้องมีคำขยายความ
กรอบความคิดที่ว่า Qwen3.8-Omni-Flash เป็นโมเดล omni-modal ตัวแรกของ Qwen นั้นถูกเผยแพร่ไปอย่างกว้างขวางในวันนี้ และเป็นเรื่องที่ควรพูดกันให้แม่นยำ เพราะตระกูลนี้มีรุ่นก่อนหน้าที่มีสิทธิ์อ้างตำแหน่งนั้นได้อย่างสมเหตุสมผล Qwen2.5-Omni ซึ่งเป็นโมเดลน้ำหนักเปิดขนาด 7B ที่เปิดตัวในเดือนมีนาคม 2025 ภายใต้สถาปัตยกรรม Thinker-Talker ก็รับข้อความ รูปภาพ เสียง และวิดีโอเป็นอินพุตเช่นกัน — และมันสร้างเสียงพูดได้เช่นเดียวกับข้อความ สิ่งที่เป็น "ครั้งแรก" อย่างแท้จริงในที่นี้คือ เนทีฟ omni-modality: โมเดลเดียวที่สร้างขึ้นบน Qwen3.8-Flash เป็นพื้นฐาน แทนที่จะเป็น LLM สำหรับข้อความที่มีตัวเข้ารหัสการรับรู้ต่อพ่วงไว้ พร้อมด้วยโจทย์การออกแบบที่ยึดเอเจนต์เป็นหลักตั้งแต่ต้น ทั้งสองข้อความเป็นความจริง มีเพียงข้อเดียวเท่านั้นที่ถูกพูดซ้ำไปทั่ว หากคุณกำลังประเมินโมเดลนี้บนสมมติฐานว่าไม่เคยมีโมเดล omni ของ Qwen มาก่อนจนถึงสัปดาห์นี้ คุณจะตีราคาเส้นทางการอัปเกรดจาก Qwen2.5-Omni ผิด ซึ่งเป็นการเปรียบเทียบที่เราได้เขียนไว้แยกต่างหาก
ชุดเครื่องมือคือจุดที่ข้ออ้างเรื่องเอเจนต์อยู่จริง
มีสองสิ่งที่ถูกปล่อยออกมาพร้อมกับโมเดล และสิ่งเหล่านี้สำคัญกว่าที่การ์ดโมเดลบ่งชี้ เพราะมันคือสิ่งที่เปลี่ยนการรับรู้ให้กลายเป็นการส่งมอบ Qwen-MM-Plugins เป็นชุดปลั๊กอินมัลติโมดัลสำหรับชุดรันเอเจนต์ ที่มอบความสามารถในการเข้าใจภาพ เสียง วิดีโอ และเอกสารให้กับเอเจนต์ภายนอก พร้อมทั้งหน่วยความจำวิดีโอยาวและการตัดต่อวิดีโอ โดยประกาศว่ารองรับ Codex, Claude Code, Qwen Code, Gemini CLI และอื่น ๆ อีกหลายตัว และมีเครื่องมือที่ระบุชื่อไว้อย่างชัดเจน其中包括 Video2Note ซึ่งเปลี่ยนวิดีโอหลายชั่วโมงให้กลายเป็นบันทึก PDF ที่มีภาพประกอบ Qwen-Live Harness เป็นรันไทม์โอเพนซอร์สสำหรับการปฏิสัมพันธ์แบบออมนิโหมดัลแบบเรียลไทม์อย่างต่อเนื่อง ทำหน้าที่เป็นเลเยอร์จัดตารางเวลาที่ผู้ใช้สนทนาแบบสด ๆ และมอบหมายงานที่หนักกว่าให้กับเอเจนต์เบื้องหลัง ข้อควรระวังหนึ่งจากรายงานข่าววันเปิดตัว: หน้า GitHub ของ Qwen-Live Harness ตอบกลับเป็น 404 เมื่อ Gigazine เข้าไปตรวจสอบ ดังนั้นให้ถือว่าเครื่องมือนี้เป็นเพียงการประกาศเปิดตัว ยังไม่ได้รับการยืนยัน จนกว่าคลังโค้ดจะใช้งานได้
ประโยคที่การเปิดตัวฝังกลบไว้: มันไม่พูด
สำหรับโมเดลที่รุ่นก่อนหน้าสามารถสร้างเสียงพูดได้ ความจริงที่ว่า Qwen3.8-Omni-Flash เป็นแบบรับข้อมูลหลายรูปแบบเข้าและส่งออกเป็นข้อความ คือบรรทัดที่ส่งผลกระทบมากที่สุดในสเปก และมันปรากฏอยู่ในเอกสารต่าง ๆ ส่วนใหญ่ในฐานะเชิงอรรถเท่านั้น ซึ่งหมายความว่าโมเดลนี้ไม่สามารถนำไปใส่ในผลิตภัณฑ์แบบเสียงต่อเสียงได้ด้วยตัวเอง การพากย์ เอเจนต์เสียง หรือการสนทนาแบบเรียลไทม์ใด ๆ ที่สร้างขึ้นบนโมเดลนี้ จำเป็นต้องมีขั้นตอนแปลงข้อความเป็นเสียงพูดจากภายนอก และสำหรับวิดีโอ ต้องมีตัวเรนเดอร์จากภายนอก — ซึ่งเป็นเหตุผลที่ชุดปลั๊กอินและชุดทดสอบสดมีอยู่ ผลลัพธ์ในทางปฏิบัติคือไปป์ไลน์ที่มีชิ้นส่วนเคลื่อนไหวมากกว่า "โมเดลออมนิเพียงตัวเดียว" และมีเวลาแฝงที่ต้องจัดสรรงบประมาณไปยังทุกส่วนเหล่านั้น
มีการสาธิตช่องว่างอย่างคมคาย และสิ่งที่โมเดลนี้ทำได้ดี ที่ซ่อนอยู่ในรีลีส ในการทดลอง "โมเดลปรับแต่งโมเดล" Qwen3.8-Omni-Flash ปรับปรุงการรู้จำภาษาถิ่นเสฉวนของ Qwen2.5-Omni-3B ได้เองโดยอัตโนมัติ โดยลดอัตราความผิดพลาดระดับอักขระจาก 25.79% เหลือ 15.30%ภายในสิบสองชั่วโมง และสร้างตัวอย่างฝึก 3,413 ตัวอย่างในสี่รอบ โมเดลที่สามารถวินิจฉัยและซ่อมแซมการจัดการภาษาถิ่นของรุ่นน้องที่เล็กกว่าได้ กำลังทำสิ่งที่ API ถอดเสียงทำไม่ได้ นั่นต่างหาก ไม่ใช่ตาราง benchmark ที่เป็นข้อโต้แย้งที่ชัดเจนที่สุดสำหรับสิ่งที่ "agentic" ควรหมายถึงในที่นี้

อะไรที่จะเปลี่ยนการอ่านของเรา
การประเมินสถานการณ์อย่างตรงไปตรงมาคือ นี่เป็นการเปิดตัวที่ระบุสเปกไว้ดี มีจุดขายด้านราคาที่น่าสนใจ ไม่มีการประเมินโดยอิสระ และมีข้อจำกัดเชิงโครงสร้างอย่างน้อยหนึ่งข้อที่ประกาศได้ทำให้ดูเบาลง มีสามสิ่งที่จะคลี่คลายเรื่องนี้ได้ การมีรายการใน Artificial Analysis หรือ LMArena จะเปลี่ยนตัวเลขจากผู้ขายให้เป็นตัวเลขที่เทียบเคียงกันได้ และตอนนี้ยังไม่มีเลย การทดสอบโดยบุคคลที่สามต่อการลดโทเคน 45.7% — ข้ออ้างที่ว่าความแม่นยำเพิ่มขึ้นในขณะที่ต้นทุนลดลง — จะยืนยันผลลัพธ์ที่มีประโยชน์ที่สุดและดูไม่หวือหวาที่สุดในข่าวเปิดตัวนี้ และการวัดผลอย่างอิสระของการแยกผู้พูด (diarisation) ของ AliMeeting จะแสดงว่าการลดลง 88 จุดเป็นของโมเดลหรือเป็นของไปป์ไลน์ที่อยู่รอบ ๆ ตัวมัน
จนถึงตอนนั้น แนวทางที่สมเหตุสมผลก็คือแนวทางที่ใช้ได้กับโมเดลใด ๆ ในวันแรกของมัน นั่นคือ คุ้มที่จะทดสอบ แต่ไม่คุ้มที่จะเดิมพันเส้นทางสำหรับงานโปรดักชัน หากคุณกำลังส่งงานผ่าน OrcaRouter อยู่แล้ว สิ่งที่ทำได้จริงคือคงปริมาณงานไว้บนโมเดลที่คุณวัดผลไว้แล้ว และมอง Qwen3.8-Omni-Flash เป็นตัวเลือกที่ควรนำมาลองเทียบกับโมเดลเหล่านั้นด้วยเสียงและวิดีโอของคุณเอง มากกว่าจะเทียบบนตาราง benchmark ของผู้ให้บริการรายใดรายหนึ่ง หากกรณีการใช้งานของคุณคือการวิเคราะห์การประชุมหรือสื่อความยาวมากทั้งภาษาจีนและภาษาอังกฤษ ความคุ้มค่าเชิงโทเคนตรงนี้ก็แข็งแรงพอที่จะทำให้การทดสอบตอนนี้คุ้มค่า
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
