
พบกับ Qwen3.8-LiveTranslate: ครึ่งวินาทีที่ทำให้การตีความด้วย AI อยู่ในจังหวะของมนุษย์
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-LiveTranslate เปิดตัวเมื่อวันที่ 19 กันยายน 2026 และประกาศทั้งหมดสรุปเหลือเพียงการลบครั้งเดียว ค่าความหน่วงเฉลี่ย — LAAL ซึ่งเป็นระยะห่างเฉลี่ยระหว่างคำที่ออกจากปากผู้พูดกับคำแปลที่ไปถึงหูผู้ฟัง — ลดลงจาก 2.8 วินาทีในรุ่นก่อนหน้าเหลือ 2.3 วินาที ล่ามมืออาชีพทำงานด้วยช่วงเวลาจากหูถึงเสียงพูด (ear-to-voice span) ประมาณ 2 ถึง 3 วินาที นั่นคือเรื่องทั้งหมด ไม่ใช่ว่าเครื่องเร็วขึ้น แต่คือความหน่วงของมันตอนนี้อยู่ในช่วงที่ผู้ฟังเลิกสังเกตว่าเป็นเครื่องแล้ว ตัวเลขตอนเปิดตัวระบุว่าคุณภาพการแปล FLEURS ของรุ่นก่อนหน้าอยู่ที่ 83.0 xCOMET-XXL ส่วนรุ่นนี้ถูกกล่าวอ้างว่าอยู่ที่ 85.7 ตัวเลขทั้งสองเป็นของผู้ขาย ผลิตจากชุดการประเมินของผู้ขายเอง และยังไม่มีหน่วยงานอิสระใดทำซ้ำได้ — ซึ่งเป็นข้อควรระวังที่สำคัญที่สุดเพียงข้อเดียวในบทความนี้
สิ่งที่ทำให้การเปิดตัวครั้งนี้น่าอ่านต่อจากพาดหัวข่าวก็คือกลไก Qwen ไม่ได้ลดความหน่วงด้วยการทำให้ตัวรู้จำเร็วขึ้นหรือตัวสังเคราะห์เบาลง หากแต่มันลบรอยต่อระหว่างทั้งสองออกไป
สิ่งที่เปลี่ยนไปจริง ๆ: รอยต่อหายไปแล้ว
การตีความแบบพร้อมกันแบบคลาสสิกเป็นไปป์ไลน์สามขั้นตอนที่ประกอบขึ้นด้วยวิธีเดียวกันมาเป็นทศวรรษ: การรู้จำเสียงอัตโนมัติถอดเสียงสตรีม การแปลด้วยเครื่องแปลงข้อความที่ถอดความ และข้อความเป็นเสียงอ่านผลลัพธ์ออกมาดัง ๆ แต่ละขั้นตอนเป็นโมเดลแยกต่างหากที่มีงบเวลาหน่วงของตัวเอง และการส่งต่อแต่ละครั้งสูญเสียบางสิ่ง — ทำนองเสียงในขั้นแรก อัตลักษณ์ของผู้พูดในขั้นที่สาม และเวลาหน่วงคงที่สองสามร้อยมิลลิวินาทีที่ทุกขอบเขตซึ่งโมดูลต้องรอโทเค็นเพียงพอที่จะมั่นใจ
Qwen3.8-LiveTranslate แทนที่การทำงานแบบคาสเคดนั้นด้วยสิ่งที่ผู้จำหน่ายเรียกว่า สถาปัตยกรรม Interleave ที่สร้างอยู่บนแกนหลัก Hybrid MoE ซึ่งแบ่งออกเป็นสองโมดูลที่ทำงานร่วมกัน:
• Thinker — จัดเรียงวิดีโอ เสียง ข้อความต้นฉบับ และคำแปลให้เป็นลำดับเหตุและผลเดียว สลับกันตามลำดับเวลา และสร้างความเข้าใจพร้อมคำแปลแบบครบวงจรในรอบเดียวแทนที่จะเป็นสามรอบ
• Talker — นำข้อความที่แปลแล้วไปรวมกับต้นฉบับของเสียง แล้วสังเคราะห์เสียงพูดที่คงไว้ซึ่งโทนเสียงของผู้พูดต้นทาง จึงทำให้เสียงพากย์นั้นฟังออกว่าเป็นคนเดียวกับผู้ที่พูด
ข้ออ้างเชิงสถาปัตยกรรมคือ เพราะการรู้จำ การแปล และการสังเคราะห์ใช้กรอบการสร้างแบบจำลองลำดับเดียวกัน แทนที่จะส่งข้อความข้ามขอบเขตระหว่างโมดูล ระบบจึงเลิกจ่ายภาษีระหว่างโมดูลสองครั้งต่อหนึ่งคำพูด นั่นเป็นคำอธิบายที่เป็นไปได้ว่าทำไม 0.5 วินาทีจึงเกิดขึ้น และมันก็เป็นข้ออ้างแบบที่กล่าวอ้างได้ง่ายแต่ตรวจสอบได้แพงพอดี จงถือว่ามันเป็นคำอธิบายของผู้ขาย ไม่ใช่ผลลัพธ์ที่ยืนยันแล้ว
สามความสามารถที่เป็นของใหม่จริง ๆ
ความครอบคลุมด้านภาษาไม่ได้เปลี่ยนแปลงไปไหน: จดจำภาษาต้นทางได้ 60 ภาษา และมี 29 ภาษาที่พร้อมใช้สำหรับเอาต์พุตเสียงพูด — เป็นจำนวนเดียวกับ Qwen3.5-LiveTranslate ส่วนสิ่งใหม่ที่น่าสนใจล้วนเกี่ยวกับสิ่งที่เกิดขึ้นเมื่อมีคนพูดมากกว่าหนึ่งคน
• การแยกผู้พูดแบบเรียลไทม์ — แต่ละประโยคจะถูกระบุว่าเป็นของผู้พูดคนใดในขณะที่กำลังพูด และการจำลองน้ำเสียงถูกอธิบายว่ามีความเสถียรกว่าเมื่อมีการสลับการพูด Qwen รายงานตัวเองว่ามีอัตราความผิดพลาดในการแยกผู้พูด 9.7% บนชุดทดสอบผู้พูดหลายคนแบบยาวของตัวเอง เทียบกับ 30.6% สำหรับ Seed LiveInterpret 2.0 ตัวเลขทั้งสองมาจาก Qwen
• ต้นฉบับและคำแปลอยู่ในเฟรมเดียวกัน — โมเดลส่งออกบทถอดความต้นฉบับและข้อความที่แปลแล้วบนไทม์ไลน์เดียวกัน ซึ่งเป็นสิ่งที่ทำให้คำบรรยายคู่สองภาษาบนหน้าจอเป็นไปได้โดยไม่ต้องจัดตำแหน่งรอบที่สอง
• การแยกความกำกวมด้วยบริบทยาว — บริบทที่มาก่อนหน้าจะถูกส่งต่อมา เพื่อให้ชื่อ คำนำหน้า และศัพท์เฉพาะทางคงความสอดคล้องกัน สิ่งนี้คือสิ่งที่สำคัญที่สุดในทางปฏิบัติ: ความล้มเหลวแบบคลาสสิกของการล่ามแบบทันควันไม่ใช่การใช้คำผิด แต่เป็นการที่บุคคลคนเดียวกันถูกเรียกด้วยวิธีที่แตกต่างกันถึงสามแบบในการประชุมครั้งเดียว
Diarization เป็นสิ่งที่สร้างความแตกต่างอย่างแท้จริงในกรณีนี้ Gemini 3.5 Live Translate โมเดลแปลงเสียงเป็นเสียงแบบเรียลไทม์ของ Google ที่เป็นคู่แข่งกัน มีบันทึกว่าประสบปัญหากับการผลัดกันพูด — มันอาจลำบากในการรู้ว่าผู้พูดหยุดจริง ๆ แล้วเมื่อใด Qwen กำลังอ้างคุณสมบัติตรงกันข้ามเป็นจุดเด่น ไม่มีบริษัทใดเผยแพร่การเปรียบเทียบแบบตรง ๆ ที่จะตัดสินเรื่องนี้ได้

อ่านคำกล่าวอ้างเกี่ยวกับ benchmark อย่างตรงไปตรงมา
Qwen ถูกทดสอบบนสองชุด และสมควรแยกทั้งสองออกจากกัน เพราะมันวัดสิ่งที่แตกต่างกัน
• FLEURS, 70 ทิศทางภาษา — เกณฑ์มาตรฐานเสียงหลายภาษาที่เปิดเผยต่อสาธารณะและใช้กันอย่างแพร่หลาย Qwen อ้างว่ามีความเป็นผู้นำเหนือทั้งรุ่นก่อนหน้าของตัวเองและสิ่งที่มันเรียกว่าระบบแปลแบบเรียลไทม์กระแสหลักในปัจจุบัน ในด้านคุณภาพการแปล ความหน่วงเฉลี่ย ความแม่นยำในการรู้จำเสียง และคุณภาพการสังเคราะห์เสียง การเปรียบเทียบ xCOMET-XXL ที่ 85.7 ต่อ 83.0 อยู่ที่นี่
• Omnilingua-MSpeaker, 14 ทิศทางภาษา — ชุดประเมินเสียงยาวแบบหลายผู้พูดของ Qwen เอง บริษัทอ้างว่ามีความตรงตามต้นฉบับ ความลื่นไหล และความกระชับดีกว่า พร้อมอัตราความผิดพลาดในการแยกผู้พูดที่ต่ำลง เบนช์มาร์กที่ผู้ขายสร้างขึ้นเองไม่ได้ไร้ค่า แต่ก็ไม่ใช่หลักฐานเช่นกัน: มันถูกออกแบบโดยคนที่โมเดลของพวกเขากำลังถูกให้คะแนนด้วยมัน
สรุปตามตรงคือ FLEURS เป็นของจริงและเปิดเผยต่อสาธารณะ ดังนั้น 85.7 อย่างน้อยก็ตรวจสอบได้ในหลักการ ส่วน Omnilingua-MSpeaker ไม่เป็นเช่นนั้น ดังนั้นชัยชนะด้านการแยกผู้พูดจึงเป็นเพียงข้อกล่าวอ้างจนกว่าจะมีคนรันซ้ำ ณ เวลาที่เขียนนี้ ยังไม่มีบุคคลที่สามเผยแพร่ตัวเลขของ Qwen3.8-LiveTranslate และโมเดลนี้เพิ่งเปิดตัวได้เพียงไม่กี่ชั่วโมง
ค่าใช้จ่ายของ API และตัวเลขหนึ่งตัวที่จะเล่นงานคุณ
Qwen3.8-LiveTranslate เป็นโมเดลแบบปิด (closed-weight) และให้บริการผ่าน API เท่านั้น โดยทำงานบน WebSocket Realtime API ภายใต้รหัสโมเดล qwen3.8-livetranslate-flash-realtime ไม่ใช่ผ่านปลายทาง HTTP ธรรมดา การคิดค่าบริการเป็นรายล้านโทเคน และเนื่องจากโทเคนเสียงมีความหนาแน่นสูง อัตราที่ประกาศไว้จึงดูน่าตกใจเมื่อเทียบกับโมเดลข้อความ จนกว่าคุณจะนึกออกว่าโทเคนเสียงคืออะไร:
• ภูมิภาคสิงคโปร์ — อินพุตเสียง $7.50, อินพุตภาพ $0.55, เอาต์พุตข้อความ $20.00, เอาต์พุตเสียง $30.00 ต่อล้านโทเคน
• ภูมิภาคปักกิ่ง — อินพุตเสียง ¥40 อินพุตรูปภาพ ¥3.3 เอาต์พุตข้อความ ¥100 เอาต์พุตเสียง ¥160 ต่อล้านโทเค็น ซึ่งคิดเป็นประมาณ $5.65 / $0.47 / $14.13 / $22.61 ที่อัตราแลกเปลี่ยนปัจจุบัน
• บริบท — รวม 53,248 โทเคน แบ่งเป็นอินพุตสูงสุด 49,152 และเอาต์พุตสูงสุด 4,096
• ขีดจำกัดอัตรา — 10 คำขอต่อนาที และ 100,000 โทเคนต่อนาที เหมือนกันในทั้งสองภูมิภาค
เพดานอัตรานั้นคือตัวเลขที่ต้องขีดเส้นใต้ไว้ สิบคำขอต่อนาทีถือว่าเหลือเฟือสำหรับห้องประชุมเพียงไม่กี่ห้อง และยังห่างไกลจากคำว่าพอสำหรับการติดตั้งใช้งานในศูนย์ติดต่อลูกค้า หรือการถ่ายทอดสดที่มีสตรีมพร้อมกันหลายพันสตรีม Qwen คงราคาของอินเทอร์เฟซให้แทบไม่ต่างจากรุ่นก่อน — อัตราในปักกิ่งไม่เปลี่ยนแปลง และสิงคโปร์ถูกกว่าเล็กน้อย — แต่โมเดลที่พร้อมในเชิงสถาปัตยกรรมสำหรับการขยายขนาดกลับถูกจัดสรรให้ใช้งานเหมือนเป็นพรีวิว ใครก็ตามที่วางแผนรับมือทราฟฟิกสำหรับโปรดักชันควรอ่านเพดาน 10 RPM เป็นข้อจำกัดที่มีผลผูกพัน ไม่ใช่ราคาต่อโทเคน

การเรียกใช้งานมันไม่เหมือนกับการเรียกใช้งานโมเดลแชต
Realtime API ขับเคลื่อนด้วยเหตุการณ์ ซึ่งเป็นแบบจำลองทางความคิดที่แตกต่างจากเอนด์พอยต์ completion คุณเปิดซ็อกเก็ต รับsession.created จากนั้นส่งเหตุการณ์ session.update เพื่อกำหนดค่าเซสชันก่อนที่เสียงใด ๆ จะเริ่มส่ง
• target_language เป็นค่าที่จำเป็น และต้องตั้งค่าก่อนข้อมูลเสียงชิ้นแรก — ไม่มีค่าเป้าหมายเริ่มต้นโดยนัย
• source_language ไม่บังคับ และค่าเริ่มต้นคือการตรวจจับอัตโนมัติ
• output_modalities ใช้เลือก ["text"] สำหรับข้อความถอดเสียงเท่านั้น หรือ ["text","audio"] สำหรับเสียงพูดที่แปลแล้ว
• input_audio_buffer.append ส่งชิ้นข้อมูล PCM ที่เข้ารหัสแบบ base64 ขึ้นไป; response.text.delta และ response.audio.delta กลับลงมา โดยมี response.done เป็นการบ่งบอกจุดสิ้นสุดของเทิร์น.
บันทึกเชิงปฏิบัติสองข้อ ข้อแรก เบราว์เซอร์ไม่สามารถตั้งค่าAuthorizationเป็นเฮดเดอร์บนแฮนด์เชก WebSocket ได้ ดังนั้นจึงต้องเปิดการเชื่อมต่อจากฝั่งเซิร์ฟเวอร์และรีเลย์เสียงไปยังไคลเอนต์ผ่านซ็อกเก็ตของคุณเอง — นี่ไม่ใช่สิ่งที่คุณต่อตรงเข้าไปในฟรอนต์เอนด์ ข้อที่สอง Qwen เตือนอย่างชัดเจนว่าชุดพารามิเตอร์และอีเวนต์แตกต่างจากรุ่น LiveTranslate ก่อนหน้า ดังนั้นโค้ดใด ๆ ที่เขียนไว้กับ Qwen3.5-LiveTranslate จำเป็นต้องตรวจสอบใหม่แทนที่จะชี้ไปใหม่ มีปลายทางทดลองใช้ฟรีทำงานอยู่ที่ omni.qwen.ai/live-translate หากคุณต้องการฟังความหน่วงก่อนที่จะลงเวลาในงานวิศวกรรม
สิ่งที่มันจงใจไม่ทำ
Qwen ระบุว่าความสามารถหลายอย่างใช้งานไม่ได้ และรายการนี้ก็ทำให้เห็นภาพชัดเจนขึ้น ไม่มีการเรียกใช้ฟังก์ชัน ไม่มีเอาต์พุตแบบมีโครงสร้าง ไม่มีการค้นหาเว็บ ไม่มีการทำต่อเนื่องจากคำนำหน้า การแคชบริบท หรือการอนุมานแบบแบตช์ และไม่มีการปรับละเอียด (fine-tuning)
นี่คือผู้เชี่ยวชาญเฉพาะทาง ไม่ใช่ผู้รู้รอบด้านที่สวมบทบาทล่าม มันจะไม่รันลูปเอเจนต์ของคุณ และจะไม่ใช่โมเดลที่สรุปการประชุม จงออกแบบให้สอดคล้องกัน: ล่ามจะสร้างทรานสคริปต์และสตรีมเสียงที่แปลแล้ว และทุกอย่างที่อยู่ปลายน้ำจากตรงนั้น — ตัวสกัดรายการงานที่ต้องดำเนินการ ตัวบังคับใช้คลังคำศัพท์ และการเขียนกลับเข้า CRM — เป็นหน้าที่ของโมเดลข้อความแยกต่างหาก
การแบ่งหน้าที่เช่นนี้คือจุดที่เราเตอร์พิสูจน์คุณค่าของตัวเอง Qwen3.8-LiveTranslate เองมีให้ใช้งานผ่าน API ของผู้จำหน่ายเองและแพลตฟอร์มบุคคลที่สามหลายแห่ง แต่ปัจจุบันยังไม่มีอยู่ในแค็ตตาล็อกของ OrcaRouter และเราจะไม่เสแสร้งว่ามี สิ่งที่ OrcaRouter มีให้บริการจริงคือสแตกโดยรอบ — รวมถึงเรือธง Qwen3.8-Max ของ Alibaba เอง ซึ่งเป็นโมเดล sparse mixture-of-experts ขนาด 2.4 ล้านล้านพารามิเตอร์ ที่มีบริบทขนาด 1M โทเคน ในราคา $2.00 ต่ออินพุตหนึ่งล้านโทเคน และ $6.00 ต่อเอาต์พุตหนึ่งล้านโทเคน คิดค่าบริการตามราคาตามรายการของผู้ให้บริการ โดยไม่มีมาร์กอัปใด ๆการเก็บอินเทอร์พรีเตอร์และโมเดลที่บริโภคเอาต์พุตของมันไว้หลังเอนด์พอยต์เดียวและคีย์เดียว หมายความว่าไปป์ไลน์ทรานสคริปต์ไม่จำเป็นต้องมีสัญญาที่สองเมื่อคุณสลับตัวสรุป และการ failover อัตโนมัติช่วยให้ครึ่งปลายน้ำของระบบยังทำงานอยู่เมื่อผู้ให้บริการรายเดียวสะดุด — ซึ่งที่ 10 คำขอต่อนาที ถือเป็นสถานการณ์ที่ควรวางแผนรับมือไว้ มากกว่าจะปล่อยให้ต้องมาเจอเอง

สิ่งที่ควรดูต่อไป
สองสิ่งจะเปลี่ยนการเปิดตัวนี้จากข้ออ้างที่มีเหตุผลหนักแน่นให้กลายเป็นข้อเท็จจริงที่ยุติแล้ว สิ่งแรกคือการวัดความหน่วงแบบอิสระ: LAAL เป็นเมตริกที่นิยามไว้อย่างชัดเจน และใครก็ตามที่มีปลายทางทดลองและชุดนาฬิกาจับเวลาก็สามารถสร้างตัวเลขที่ Qwen ไม่ได้เป็นผู้จัดทำได้ สิ่งที่สองคือแผนงานที่ Qwen ประกาศไว้เอง — การผลักดันให้ใกล้ขีดจำกัดล่างของความหน่วง หน่วยความจำระยะยาวข้ามเซสชัน และความครอบคลุมของภาษาหางยาวและภาษาถิ่นระดับภูมิภาค รายการภาษาหางยาวเป็นสิ่งที่ควรใช้ยึดเป็นข้อผูกมัดกับพวกเขา เพราะ 60 ภาษาต้นทางเป็นจำนวนที่น่านับถือซึ่งแอบกีดกันผู้พูดส่วนใหญ่ของโลกออกไป และช่องว่างระหว่างเดโมที่ทำงานได้ในภาษาจีนกลางและภาษาอังกฤษกับเดโมที่ทำงานได้ในภาษาโยรูบาหรือภาษาเคชัวคือจุดที่ผลิตภัณฑ์ล่ามแบบเรียลไทม์เคยหยุดชะงักในอดีต
ในตอนนี้ จุดยืนที่สมเหตุสมผลคือ Qwen3.8-LiveTranslate เป็นโมเดลแปลแบบพร้อมกันตัวแรกที่ตัวเลขหลักถูกวางกรอบเทียบกับล่ามมนุษย์ แทนที่จะเทียบกับรุ่นก่อนหน้าของตัวเอง — และการวางกรอบแบบนั้นเป็นบททดสอบที่ผ่านได้ยากกว่าบททดสอบที่มันเข้าแทนที่มาก มันยังไม่ผ่านบททดสอบนั้น มันเพียงแค่สมัครใจเข้าสอบเท่านั้น
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
