การ์ดชื่อเรื่องที่อ่านว่า Qwen3.8-LiveTranslate พร้อมคำโปรย 'ครึ่งวินาทีที่ทำให้การตีความด้วย AI อยู่ในจังหวะเดียวกับมนุษย์' และชิปสถิติสามอัน: ความหน่วงเฉลี่ยจาก 2.8 วินาที เหลือ 2.3 วินาที, ภาษาต้นทาง 60 ภาษา, ภาษาเอาต์พุตเสียงพูด 29 ภาษา
Engineering & Research

พบกับ Qwen3.8-LiveTranslate: ครึ่งวินาทีที่ทำให้การตีความด้วย AI อยู่ในจังหวะของมนุษย์

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Qwen3.8-LiveTranslate เปิดตัวเมื่อวันที่ 19 กันยายน 2026 และประกาศทั้งหมดสรุปเหลือเพียงการลบครั้งเดียว ค่าความหน่วงเฉลี่ย — LAAL ซึ่งเป็นระยะห่างเฉลี่ยระหว่างคำที่ออกจากปากผู้พูดกับคำแปลที่ไปถึงหูผู้ฟัง — ลดลงจาก 2.8 วินาทีในรุ่นก่อนหน้าเหลือ 2.3 วินาที ล่ามมืออาชีพทำงานด้วยช่วงเวลาจากหูถึงเสียงพูด (ear-to-voice span) ประมาณ 2 ถึง 3 วินาที นั่นคือเรื่องทั้งหมด ไม่ใช่ว่าเครื่องเร็วขึ้น แต่คือความหน่วงของมันตอนนี้อยู่ในช่วงที่ผู้ฟังเลิกสังเกตว่าเป็นเครื่องแล้ว ตัวเลขตอนเปิดตัวระบุว่าคุณภาพการแปล FLEURS ของรุ่นก่อนหน้าอยู่ที่ 83.0 xCOMET-XXL ส่วนรุ่นนี้ถูกกล่าวอ้างว่าอยู่ที่ 85.7 ตัวเลขทั้งสองเป็นของผู้ขาย ผลิตจากชุดการประเมินของผู้ขายเอง และยังไม่มีหน่วยงานอิสระใดทำซ้ำได้ — ซึ่งเป็นข้อควรระวังที่สำคัญที่สุดเพียงข้อเดียวในบทความนี้

สิ่งที่ทำให้การเปิดตัวครั้งนี้น่าอ่านต่อจากพาดหัวข่าวก็คือกลไก Qwen ไม่ได้ลดความหน่วงด้วยการทำให้ตัวรู้จำเร็วขึ้นหรือตัวสังเคราะห์เบาลง หากแต่มันลบรอยต่อระหว่างทั้งสองออกไป

สิ่งที่เปลี่ยนไปจริง ๆ: รอยต่อหายไปแล้ว

การตีความแบบพร้อมกันแบบคลาสสิกเป็นไปป์ไลน์สามขั้นตอนที่ประกอบขึ้นด้วยวิธีเดียวกันมาเป็นทศวรรษ: การรู้จำเสียงอัตโนมัติถอดเสียงสตรีม การแปลด้วยเครื่องแปลงข้อความที่ถอดความ และข้อความเป็นเสียงอ่านผลลัพธ์ออกมาดัง ๆ แต่ละขั้นตอนเป็นโมเดลแยกต่างหากที่มีงบเวลาหน่วงของตัวเอง และการส่งต่อแต่ละครั้งสูญเสียบางสิ่ง — ทำนองเสียงในขั้นแรก อัตลักษณ์ของผู้พูดในขั้นที่สาม และเวลาหน่วงคงที่สองสามร้อยมิลลิวินาทีที่ทุกขอบเขตซึ่งโมดูลต้องรอโทเค็นเพียงพอที่จะมั่นใจ

Qwen3.8-LiveTranslate แทนที่การทำงานแบบคาสเคดนั้นด้วยสิ่งที่ผู้จำหน่ายเรียกว่า สถาปัตยกรรม Interleave ที่สร้างอยู่บนแกนหลัก Hybrid MoE ซึ่งแบ่งออกเป็นสองโมดูลที่ทำงานร่วมกัน:

Thinker — จัดเรียงวิดีโอ เสียง ข้อความต้นฉบับ และคำแปลให้เป็นลำดับเหตุและผลเดียว สลับกันตามลำดับเวลา และสร้างความเข้าใจพร้อมคำแปลแบบครบวงจรในรอบเดียวแทนที่จะเป็นสามรอบ

Talker — นำข้อความที่แปลแล้วไปรวมกับต้นฉบับของเสียง แล้วสังเคราะห์เสียงพูดที่คงไว้ซึ่งโทนเสียงของผู้พูดต้นทาง จึงทำให้เสียงพากย์นั้นฟังออกว่าเป็นคนเดียวกับผู้ที่พูด

ข้ออ้างเชิงสถาปัตยกรรมคือ เพราะการรู้จำ การแปล และการสังเคราะห์ใช้กรอบการสร้างแบบจำลองลำดับเดียวกัน แทนที่จะส่งข้อความข้ามขอบเขตระหว่างโมดูล ระบบจึงเลิกจ่ายภาษีระหว่างโมดูลสองครั้งต่อหนึ่งคำพูด นั่นเป็นคำอธิบายที่เป็นไปได้ว่าทำไม 0.5 วินาทีจึงเกิดขึ้น และมันก็เป็นข้ออ้างแบบที่กล่าวอ้างได้ง่ายแต่ตรวจสอบได้แพงพอดี จงถือว่ามันเป็นคำอธิบายของผู้ขาย ไม่ใช่ผลลัพธ์ที่ยืนยันแล้ว

สามความสามารถที่เป็นของใหม่จริง ๆ

ความครอบคลุมด้านภาษาไม่ได้เปลี่ยนแปลงไปไหน: จดจำภาษาต้นทางได้ 60 ภาษา และมี 29 ภาษาที่พร้อมใช้สำหรับเอาต์พุตเสียงพูด — เป็นจำนวนเดียวกับ Qwen3.5-LiveTranslate ส่วนสิ่งใหม่ที่น่าสนใจล้วนเกี่ยวกับสิ่งที่เกิดขึ้นเมื่อมีคนพูดมากกว่าหนึ่งคน

การแยกผู้พูดแบบเรียลไทม์ — แต่ละประโยคจะถูกระบุว่าเป็นของผู้พูดคนใดในขณะที่กำลังพูด และการจำลองน้ำเสียงถูกอธิบายว่ามีความเสถียรกว่าเมื่อมีการสลับการพูด Qwen รายงานตัวเองว่ามีอัตราความผิดพลาดในการแยกผู้พูด 9.7% บนชุดทดสอบผู้พูดหลายคนแบบยาวของตัวเอง เทียบกับ 30.6% สำหรับ Seed LiveInterpret 2.0 ตัวเลขทั้งสองมาจาก Qwen

ต้นฉบับและคำแปลอยู่ในเฟรมเดียวกัน — โมเดลส่งออกบทถอดความต้นฉบับและข้อความที่แปลแล้วบนไทม์ไลน์เดียวกัน ซึ่งเป็นสิ่งที่ทำให้คำบรรยายคู่สองภาษาบนหน้าจอเป็นไปได้โดยไม่ต้องจัดตำแหน่งรอบที่สอง

การแยกความกำกวมด้วยบริบทยาว — บริบทที่มาก่อนหน้าจะถูกส่งต่อมา เพื่อให้ชื่อ คำนำหน้า และศัพท์เฉพาะทางคงความสอดคล้องกัน สิ่งนี้คือสิ่งที่สำคัญที่สุดในทางปฏิบัติ: ความล้มเหลวแบบคลาสสิกของการล่ามแบบทันควันไม่ใช่การใช้คำผิด แต่เป็นการที่บุคคลคนเดียวกันถูกเรียกด้วยวิธีที่แตกต่างกันถึงสามแบบในการประชุมครั้งเดียว

Diarization เป็นสิ่งที่สร้างความแตกต่างอย่างแท้จริงในกรณีนี้ Gemini 3.5 Live Translate โมเดลแปลงเสียงเป็นเสียงแบบเรียลไทม์ของ Google ที่เป็นคู่แข่งกัน มีบันทึกว่าประสบปัญหากับการผลัดกันพูด — มันอาจลำบากในการรู้ว่าผู้พูดหยุดจริง ๆ แล้วเมื่อใด Qwen กำลังอ้างคุณสมบัติตรงกันข้ามเป็นจุดเด่น ไม่มีบริษัทใดเผยแพร่การเปรียบเทียบแบบตรง ๆ ที่จะตัดสินเรื่องนี้ได้

Screenshot of Alibaba Qwen team's own announcement page for Qwen3.8-LiveTranslate, showing the release headline, the Interleave architecture description with Thinker and Talker modules, and the stated average lagging figure of 2.3 seconds.

อ่านคำกล่าวอ้างเกี่ยวกับ benchmark อย่างตรงไปตรงมา

Qwen ถูกทดสอบบนสองชุด และสมควรแยกทั้งสองออกจากกัน เพราะมันวัดสิ่งที่แตกต่างกัน

FLEURS, 70 ทิศทางภาษา — เกณฑ์มาตรฐานเสียงหลายภาษาที่เปิดเผยต่อสาธารณะและใช้กันอย่างแพร่หลาย Qwen อ้างว่ามีความเป็นผู้นำเหนือทั้งรุ่นก่อนหน้าของตัวเองและสิ่งที่มันเรียกว่าระบบแปลแบบเรียลไทม์กระแสหลักในปัจจุบัน ในด้านคุณภาพการแปล ความหน่วงเฉลี่ย ความแม่นยำในการรู้จำเสียง และคุณภาพการสังเคราะห์เสียง การเปรียบเทียบ xCOMET-XXL ที่ 85.7 ต่อ 83.0 อยู่ที่นี่

Omnilingua-MSpeaker, 14 ทิศทางภาษา — ชุดประเมินเสียงยาวแบบหลายผู้พูดของ Qwen เอง บริษัทอ้างว่ามีความตรงตามต้นฉบับ ความลื่นไหล และความกระชับดีกว่า พร้อมอัตราความผิดพลาดในการแยกผู้พูดที่ต่ำลง เบนช์มาร์กที่ผู้ขายสร้างขึ้นเองไม่ได้ไร้ค่า แต่ก็ไม่ใช่หลักฐานเช่นกัน: มันถูกออกแบบโดยคนที่โมเดลของพวกเขากำลังถูกให้คะแนนด้วยมัน

สรุปตามตรงคือ FLEURS เป็นของจริงและเปิดเผยต่อสาธารณะ ดังนั้น 85.7 อย่างน้อยก็ตรวจสอบได้ในหลักการ ส่วน Omnilingua-MSpeaker ไม่เป็นเช่นนั้น ดังนั้นชัยชนะด้านการแยกผู้พูดจึงเป็นเพียงข้อกล่าวอ้างจนกว่าจะมีคนรันซ้ำ ณ เวลาที่เขียนนี้ ยังไม่มีบุคคลที่สามเผยแพร่ตัวเลขของ Qwen3.8-LiveTranslate และโมเดลนี้เพิ่งเปิดตัวได้เพียงไม่กี่ชั่วโมง

ค่าใช้จ่ายของ API และตัวเลขหนึ่งตัวที่จะเล่นงานคุณ

Qwen3.8-LiveTranslate เป็นโมเดลแบบปิด (closed-weight) และให้บริการผ่าน API เท่านั้น โดยทำงานบน WebSocket Realtime API ภายใต้รหัสโมเดล qwen3.8-livetranslate-flash-realtime ไม่ใช่ผ่านปลายทาง HTTP ธรรมดา การคิดค่าบริการเป็นรายล้านโทเคน และเนื่องจากโทเคนเสียงมีความหนาแน่นสูง อัตราที่ประกาศไว้จึงดูน่าตกใจเมื่อเทียบกับโมเดลข้อความ จนกว่าคุณจะนึกออกว่าโทเคนเสียงคืออะไร:

ภูมิภาคสิงคโปร์ — อินพุตเสียง $7.50, อินพุตภาพ $0.55, เอาต์พุตข้อความ $20.00, เอาต์พุตเสียง $30.00 ต่อล้านโทเคน

ภูมิภาคปักกิ่ง — อินพุตเสียง ¥40 อินพุตรูปภาพ ¥3.3 เอาต์พุตข้อความ ¥100 เอาต์พุตเสียง ¥160 ต่อล้านโทเค็น ซึ่งคิดเป็นประมาณ $5.65 / $0.47 / $14.13 / $22.61 ที่อัตราแลกเปลี่ยนปัจจุบัน

บริบท — รวม 53,248 โทเคน แบ่งเป็นอินพุตสูงสุด 49,152 และเอาต์พุตสูงสุด 4,096

ขีดจำกัดอัตรา — 10 คำขอต่อนาที และ 100,000 โทเคนต่อนาที เหมือนกันในทั้งสองภูมิภาค

เพดานอัตรานั้นคือตัวเลขที่ต้องขีดเส้นใต้ไว้ สิบคำขอต่อนาทีถือว่าเหลือเฟือสำหรับห้องประชุมเพียงไม่กี่ห้อง และยังห่างไกลจากคำว่าพอสำหรับการติดตั้งใช้งานในศูนย์ติดต่อลูกค้า หรือการถ่ายทอดสดที่มีสตรีมพร้อมกันหลายพันสตรีม Qwen คงราคาของอินเทอร์เฟซให้แทบไม่ต่างจากรุ่นก่อน — อัตราในปักกิ่งไม่เปลี่ยนแปลง และสิงคโปร์ถูกกว่าเล็กน้อย — แต่โมเดลที่พร้อมในเชิงสถาปัตยกรรมสำหรับการขยายขนาดกลับถูกจัดสรรให้ใช้งานเหมือนเป็นพรีวิว ใครก็ตามที่วางแผนรับมือทราฟฟิกสำหรับโปรดักชันควรอ่านเพดาน 10 RPM เป็นข้อจำกัดที่มีผลผูกพัน ไม่ใช่ราคาต่อโทเคน

Single-column scoreboard for Qwen3.8-LiveTranslate listing average lag (LAAL) 2.3 seconds, languages 60 source and 29 spoken, context 53,248 tokens, input audio plus image, output text plus audio, and weights closed and API-only, with a footer reading 'All figures vendor-reported; no independent replication yet.'

การเรียกใช้งานมันไม่เหมือนกับการเรียกใช้งานโมเดลแชต

Realtime API ขับเคลื่อนด้วยเหตุการณ์ ซึ่งเป็นแบบจำลองทางความคิดที่แตกต่างจากเอนด์พอยต์ completion คุณเปิดซ็อกเก็ต รับsession.created จากนั้นส่งเหตุการณ์ session.update เพื่อกำหนดค่าเซสชันก่อนที่เสียงใด ๆ จะเริ่มส่ง

target_language เป็นค่าที่จำเป็น และต้องตั้งค่าก่อนข้อมูลเสียงชิ้นแรก — ไม่มีค่าเป้าหมายเริ่มต้นโดยนัย

source_language ไม่บังคับ และค่าเริ่มต้นคือการตรวจจับอัตโนมัติ

output_modalities ใช้เลือก ["text"] สำหรับข้อความถอดเสียงเท่านั้น หรือ ["text","audio"] สำหรับเสียงพูดที่แปลแล้ว

input_audio_buffer.append ส่งชิ้นข้อมูล PCM ที่เข้ารหัสแบบ base64 ขึ้นไป; response.text.delta และ response.audio.delta กลับลงมา โดยมี response.done เป็นการบ่งบอกจุดสิ้นสุดของเทิร์น.

บันทึกเชิงปฏิบัติสองข้อ ข้อแรก เบราว์เซอร์ไม่สามารถตั้งค่าAuthorizationเป็นเฮดเดอร์บนแฮนด์เชก WebSocket ได้ ดังนั้นจึงต้องเปิดการเชื่อมต่อจากฝั่งเซิร์ฟเวอร์และรีเลย์เสียงไปยังไคลเอนต์ผ่านซ็อกเก็ตของคุณเอง — นี่ไม่ใช่สิ่งที่คุณต่อตรงเข้าไปในฟรอนต์เอนด์ ข้อที่สอง Qwen เตือนอย่างชัดเจนว่าชุดพารามิเตอร์และอีเวนต์แตกต่างจากรุ่น LiveTranslate ก่อนหน้า ดังนั้นโค้ดใด ๆ ที่เขียนไว้กับ Qwen3.5-LiveTranslate จำเป็นต้องตรวจสอบใหม่แทนที่จะชี้ไปใหม่ มีปลายทางทดลองใช้ฟรีทำงานอยู่ที่ omni.qwen.ai/live-translate หากคุณต้องการฟังความหน่วงก่อนที่จะลงเวลาในงานวิศวกรรม

สิ่งที่มันจงใจไม่ทำ

Qwen ระบุว่าความสามารถหลายอย่างใช้งานไม่ได้ และรายการนี้ก็ทำให้เห็นภาพชัดเจนขึ้น ไม่มีการเรียกใช้ฟังก์ชัน ไม่มีเอาต์พุตแบบมีโครงสร้าง ไม่มีการค้นหาเว็บ ไม่มีการทำต่อเนื่องจากคำนำหน้า การแคชบริบท หรือการอนุมานแบบแบตช์ และไม่มีการปรับละเอียด (fine-tuning)

นี่คือผู้เชี่ยวชาญเฉพาะทาง ไม่ใช่ผู้รู้รอบด้านที่สวมบทบาทล่าม มันจะไม่รันลูปเอเจนต์ของคุณ และจะไม่ใช่โมเดลที่สรุปการประชุม จงออกแบบให้สอดคล้องกัน: ล่ามจะสร้างทรานสคริปต์และสตรีมเสียงที่แปลแล้ว และทุกอย่างที่อยู่ปลายน้ำจากตรงนั้น — ตัวสกัดรายการงานที่ต้องดำเนินการ ตัวบังคับใช้คลังคำศัพท์ และการเขียนกลับเข้า CRM — เป็นหน้าที่ของโมเดลข้อความแยกต่างหาก

การแบ่งหน้าที่เช่นนี้คือจุดที่เราเตอร์พิสูจน์คุณค่าของตัวเอง Qwen3.8-LiveTranslate เองมีให้ใช้งานผ่าน API ของผู้จำหน่ายเองและแพลตฟอร์มบุคคลที่สามหลายแห่ง แต่ปัจจุบันยังไม่มีอยู่ในแค็ตตาล็อกของ OrcaRouter และเราจะไม่เสแสร้งว่ามี สิ่งที่ OrcaRouter มีให้บริการจริงคือสแตกโดยรอบ — รวมถึงเรือธง Qwen3.8-Max ของ Alibaba เอง ซึ่งเป็นโมเดล sparse mixture-of-experts ขนาด 2.4 ล้านล้านพารามิเตอร์ ที่มีบริบทขนาด 1M โทเคน ในราคา $2.00 ต่ออินพุตหนึ่งล้านโทเคน และ $6.00 ต่อเอาต์พุตหนึ่งล้านโทเคน คิดค่าบริการตามราคาตามรายการของผู้ให้บริการ โดยไม่มีมาร์กอัปใด ๆการเก็บอินเทอร์พรีเตอร์และโมเดลที่บริโภคเอาต์พุตของมันไว้หลังเอนด์พอยต์เดียวและคีย์เดียว หมายความว่าไปป์ไลน์ทรานสคริปต์ไม่จำเป็นต้องมีสัญญาที่สองเมื่อคุณสลับตัวสรุป และการ failover อัตโนมัติช่วยให้ครึ่งปลายน้ำของระบบยังทำงานอยู่เมื่อผู้ให้บริการรายเดียวสะดุด — ซึ่งที่ 10 คำขอต่อนาที ถือเป็นสถานการณ์ที่ควรวางแผนรับมือไว้ มากกว่าจะปล่อยให้ต้องมาเจอเอง

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

สิ่งที่ควรดูต่อไป

สองสิ่งจะเปลี่ยนการเปิดตัวนี้จากข้ออ้างที่มีเหตุผลหนักแน่นให้กลายเป็นข้อเท็จจริงที่ยุติแล้ว สิ่งแรกคือการวัดความหน่วงแบบอิสระ: LAAL เป็นเมตริกที่นิยามไว้อย่างชัดเจน และใครก็ตามที่มีปลายทางทดลองและชุดนาฬิกาจับเวลาก็สามารถสร้างตัวเลขที่ Qwen ไม่ได้เป็นผู้จัดทำได้ สิ่งที่สองคือแผนงานที่ Qwen ประกาศไว้เอง — การผลักดันให้ใกล้ขีดจำกัดล่างของความหน่วง หน่วยความจำระยะยาวข้ามเซสชัน และความครอบคลุมของภาษาหางยาวและภาษาถิ่นระดับภูมิภาค รายการภาษาหางยาวเป็นสิ่งที่ควรใช้ยึดเป็นข้อผูกมัดกับพวกเขา เพราะ 60 ภาษาต้นทางเป็นจำนวนที่น่านับถือซึ่งแอบกีดกันผู้พูดส่วนใหญ่ของโลกออกไป และช่องว่างระหว่างเดโมที่ทำงานได้ในภาษาจีนกลางและภาษาอังกฤษกับเดโมที่ทำงานได้ในภาษาโยรูบาหรือภาษาเคชัวคือจุดที่ผลิตภัณฑ์ล่ามแบบเรียลไทม์เคยหยุดชะงักในอดีต

ในตอนนี้ จุดยืนที่สมเหตุสมผลคือ Qwen3.8-LiveTranslate เป็นโมเดลแปลแบบพร้อมกันตัวแรกที่ตัวเลขหลักถูกวางกรอบเทียบกับล่ามมนุษย์ แทนที่จะเทียบกับรุ่นก่อนหน้าของตัวเอง — และการวางกรอบแบบนั้นเป็นบททดสอบที่ผ่านได้ยากกว่าบททดสอบที่มันเข้าแทนที่มาก มันยังไม่ผ่านบททดสอบนั้น มันเพียงแค่สมัครใจเข้าสอบเท่านั้น

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube