การ์ดชื่อเรื่องที่อ่านว่า 'Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate' พร้อมคำบรรยายว่า 'หนึ่งส่งตัวเลข อีกหนึ่งส่งแผนที่'
Guides & Insights

Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate: ตัวหนึ่งส่งตัวเลข อีกตัวส่งแผนที่

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

โมเดลแปลเสียงแบบเรียลไทม์ชั้นนำสองตัวมีความเห็นไม่ตรงกันว่าพวกมันยินดีให้วัดผลกันที่อะไร และความไม่ตรงกันนั้นมีประโยชน์มากกว่าการเปรียบเทียบสเปกใด ๆ Qwen3.8-LiveTranslate ซึ่งเปิดตัวเมื่อวันที่ 19 กันยายน 2026 นำเสนอด้วยตัวเลขแข็งเพียงตัวเดียว คือความหน่วงเฉลี่ย 2.3 วินาที ลดลงจาก 2.8 ในรุ่นก่อนหน้า Gemini 3.5 Live Translate โมเดลเสียงเป็นเสียงของผู้ขายรายนี้ที่ประกาศเมื่อเดือนมิถุนายน 2026 และยังใช้ ID โมเดลแบบพรีวิว นำเสนอด้วยความครอบคลุม — มากกว่า 70 ภาษา ตรวจจับอัตโนมัติ สลับภาษาได้กลางบทสนทนา และผสานรวมเข้ากับแอป Translate และ Meet ของผู้ขาย บริษัทหนึ่งเผยแพร่ตัวเลขความหน่วงที่สามารถถูกตรวจสอบได้ อีกบริษัทหนึ่งเผยแพร่จำนวนภาษา หากคุณกำลังเลือกระหว่างสองตัวนี้ การเข้าใจว่าทำไมสิ่งเหล่านั้นจึงเป็นคำสัญญาคนละแบบสำคัญกว่าว่ารายการไหนยาวกว่า

สองสถาปัตยกรรมที่เห็นตรงกันเฉพาะเป้าหมายเท่านั้น

โมเดลทั้งสองมีอยู่เพื่อกำจัดพฤติกรรมเดียวกัน นั่นคือนักแปลแบบผลัดกันพูดที่รอให้คุณพูดจบประโยคก่อนจึงจะเอ่ยอะไรออกมา ช่วงหยุดชะงักนั้นเองที่ทำให้การตีความของเครื่องจักรรู้สึกเหมือนการตีความของเครื่องจักร

Qwen3.8-LiveTranslate ไปถึงจุดนั้นได้ด้วยสถาปัตยกรรม Interleave บนแกนหลัก Hybrid MoE ซึ่งแยกออกเป็นโมดูล Thinker ที่หลอมรวมเสียง วิดีโอ ข้อความต้นทาง และคำแปลเข้าเป็นลำดับเชิงเหตุปัจจัยเดียว และโมดูล Talker ที่สังเคราะห์คำแปลขึ้นใหม่ด้วยโทนเสียงของผู้พูดต้นฉบับ คำกล่าวอ้างคือการยุบรวมการรู้จำ การแปล และการสังเคราะห์ให้เป็นลำดับเดียว ช่วยขจัดความหน่วงและการสูญเสียเชิงความหมายที่ไปป์ไลน์สามขั้นตอนต้องจ่าย ณ ขอบเขตของทุกโมดูล

Gemini 3.5 Live Translate ยึดจุดยืนแบบ end-to-end เดียวกันจากอีกทิศทางหนึ่ง: มันถูกสร้างบน Gemini 3 Pro ในฐานะโมเดลเสียงเป็นเสียงโดยกำเนิด โดยสตรีมต่อเนื่องผ่าน Gemini Live API แทนที่จะรันลำดับขั้น ASR → MT → TTS แยกส่วนกัน ในทางปฏิบัติ คุณจะถือ WebSocket สองทิศทางแบบถาวรไว้ ผลักชังก์เสียง 100 ms ขึ้นไป และดึงชังก์เสียงที่แปลแล้วลงมา ไม่มีโมเดลใดทำแบบเก่าอีกต่อไป ตอนนี้ทั้งคู่ทำแบบใหม่แล้ว ความแตกต่างทั้งหมดอยู่ที่รายละเอียดระดับรอง

การเปรียบเทียบความหน่วงไม่ใช่การเสมอกันอย่างที่ดูเหมือน

Google อธิบายว่า Gemini 3.5 Live Translate ทำงานโดย "ตามหลังผู้พูดอยู่ไม่กี่วินาที" Google ยังไม่ได้เผยแพร่ตัวเลข LAAL หรือตัวชี้วัดความหน่วงแบบมีชื่อเรียกและทำซ้ำได้อื่นใด สำหรับโมเดลนี้ ส่วน Qwen ได้เผยแพร่ค่า 2.3 วินาที พร้อมทั้งนิยามว่าค่านั้นหมายถึงอะไร

ความไม่สมมาตรนี้ถูกทำให้กลายเป็นประโยคง่ายๆ ว่า "ทั้งสองอยู่ที่ประมาณสองถึงสามวินาที" การตีความนั้นไม่มีอะไรที่บริษัทใดบริษัทหนึ่งกล่าวไว้สนับสนุน วลีของ Google สอดคล้องกับ 2 วินาที และสอดคล้องกับ 4; บริษัทเพียงแค่ปฏิเสธที่จะถูกตรึงให้แน่ชัด การเปรียบเทียบที่สามารถทำได้จริงในวันนี้คือ:

ตัวชี้วัดความหน่วงที่เผยแพร่ — Qwen3.8-LiveTranslate: LAAL 2.3 วินาที ตามรายงานของผู้ให้บริการ Gemini 3.5 Live Translate: ไม่มีการเผยแพร่

การวัดค่าความหน่วงอย่างอิสระ — ไม่มีเลย สำหรับโมเดลทั้งสอง ไม่มีบุคคลที่สามรายใดเผยแพร่ผลการเปรียบเทียบแบบตัวต่อตัว

ข้อสรุปที่ซื่อตรงคือ ในด้านความหน่วง (latency) Qwen ได้กล่าวอ้างที่สามารถพิสูจน์หักล้างได้ ส่วน Google กล่าวอ้างแบบคลุมเครือ นั่นเป็นคะแนนบวกให้ Qwen ในเรื่องความโปร่งใส และเป็นศูนย์คะแนนพอดีในเรื่องประสิทธิภาพจนกว่าจะมีใครวัดทั้งสองเจ้า ถ้าความหน่วงเป็นปัจจัยชี้ขาดสำหรับการนำไปใช้งานของคุณ สถานะของหลักฐานในปัจจุบันยังไม่สนับสนุนการตัดสินใจซื้อในทิศทางใดทิศทางหนึ่งเลย

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: latency LAAL 2.3s, languages 60 source and 29 spoken, speaker ID real-time diarization, input audio plus image, status generally available, watermark none stated. Gemini 3.5 Live Translate column: latency not published, languages 70-plus supported, speaker ID weak turn-taking, input audio only, status preview, watermark SynthID on all audio. Footer reads 'Qwen figures vendor-reported; Gemini per Google docs. No independent head-to-head.'

การเทียบ 60 ภาษากับ 70 กว่าภาษาเป็นกระดานคะแนนที่ไม่ถูกต้อง

จำนวนภาษามักถูกอ้างอิงอยู่เสมอ และมันทำให้เข้าใจผิดได้ทั้งสองทาง

Qwen3.8-LiveTranslate จดจำภาษาต้นทางได้ 60 ภาษา และสร้างเอาต์พุตเสียงพูดใน 29 ภาษาในนั้น Gemini 3.5 Live Translate รองรับมากกว่า 70 ภาษาพร้อมการตรวจจับอัตโนมัติ และใน Google Meet สิ่งนี้ขยายไปถึงชุดค่าผสมภาษามากกว่า 2,000 ชุด ซึ่งก่อนหน้านี้มีขีดจำกัดอยู่ที่การแปลที่อิงภาษาอังกฤษครอบคลุม 5 ภาษา

อ่านตัวเลขที่สองอย่างละเอียดก่อนที่จะถือว่ามันเป็นชัยชนะสามเท่า ตัวเลข 2,000 กว่าของ Google นับเป็นคู่ลำดับ — ทุกภาษาต้นทางจับคู่กับทุกภาษาเป้าหมาย — ซึ่งเป็นตัวชี้วัดความครอบคลุมที่ถูกต้องและมีประโยชน์อย่างแท้จริง แต่ไม่สามารถเทียบได้กับการนับจำนวนภาษาเดียว และรายการของ Google แม้จะกว้างกว่า แต่ก็ให้น้ำหนักอย่างมากกับภาษาที่มีจำนวนผู้พูดมาก: อาฟริกานส์, อาหรับ, เบงกาลี, ดัตช์, อังกฤษ, ฝรั่งเศส, เยอรมัน, ฮินดี, อินโดนีเซีย, อิตาลี, ญี่ปุ่น, เกาหลี, มาเลย์, เปอร์เซีย, โปแลนด์, โปรตุเกส, รัสเซีย, สเปน, สวาฮิลี, ทมิฬ, เตลูกู, ไทย, ตุรกี, ยูเครน, อูรดู, เวียดนาม, ซูลู ภาษาที่มีเอาต์พุตเสียงพูด 29 ภาษาของ Qwen นั้นแคบกว่านั้นอีก และรายการของผู้จำหน่ายทั้งสองรายไม่ใช่คำตอบที่จริงจังสำหรับหางยาว — ภาษาถิ่นระดับภูมิภาคและภาษาที่มีทรัพยากรต่ำซึ่งเครื่องมือแปลความหมายเคยล้มเหลวอย่างหนักที่สุด ทั้งสองบริษัทกล่าวว่าพวกเขากำลังดำเนินการอยู่ แต่ยังไม่มีใครส่งมอบได้

จุดที่ทั้งสองแตกต่างกันจริงๆ: ห้องที่เต็มไปด้วยผู้คน

จุดเดียวที่โมเดลเหล่านี้ให้คำมั่นที่แตกต่างกันอย่างแท้จริงคือการจัดการผู้พูดหลายคน และมันเป็นความแตกต่างที่มีแนวโน้มมากที่สุดที่จะชี้ขาดการนำไปใช้งานจริง

Qwen3.8-LiveTranslate มาพร้อมการแยกผู้พูดแบบเรียลไทม์ โดยแต่ละประโยคจะถูกระบุว่าเป็นของผู้พูดคนใดทันทีที่มาถึง และการจำลองเสียงถูกอธิบายว่ามีความเสถียรเมื่อมีการสลับรอบพูด Qwen รายงานเองว่ามีอัตราความผิดพลาดในการแยกผู้พูด 9.7% บนชุดทดสอบเสียงหลายผู้พูดแบบยาวของตัวเอง เทียบกับ 30.6% ของ Seed LiveInterpret 2.0 — ซึ่งเป็นการเปรียบเทียบของผู้ขายบนการประเมินที่ผู้ขายจัดทำเอง ดังนั้นให้ถือเป็นคำกล่าวอ้างที่แนบตัวเลขมาด้วย มากกว่าจะเป็นผลลัพธ์ โมเดลยังส่งออกข้อความต้นฉบับและคำแปลบนไทม์ไลน์เดียวกัน ซึ่งเป็นสิ่งที่ทำให้คำบรรยายสองภาษาที่ซิงโครไนซ์เป็นไปได้โดยไม่ต้องมีขั้นตอนการจัดแนวแยกต่างหาก

Gemini 3.5 Live Translate ให้น้ำหนักในทางตรงกันข้าม จุดแข็งที่บันทึกไว้คือการรักษาสัมผัสเสียง (prosody) — การคงไว้ซึ่งระดับเสียง จังหวะ การออกเสียงสูงต่ำ และระดับอารมณ์ของผู้พูด เพื่อให้เสียงที่แปลคงความรู้สึกของต้นฉบับไว้ จุดอ่อนที่บันทึกไว้คือจุดที่การแยกเสียงผู้พูด (diarization) จะช่วยได้พอดี: การโคลนเสียงที่ไม่สม่ำเสมอซึ่งอาจคลาดเคลื่อนหลังจากหยุดนานหรือเลือกเพศผิด, การสลับบทสนทนาที่อ่อนแอโดยไม่มีสัญญาณสิ้นสุดประโยคที่ชัดเจน, ปัญหากับสำเนียงที่หนักและคู่ภาษาที่ใกล้เคียงกัน เช่น สเปนกับโปรตุเกส, และการจัดการเสียงรบกวนพื้นหลังที่ไม่สมบูรณ์ Google ยังจำกัดเซสชันเสียงล้วนไว้ที่ 15 นาที เว้นแต่จะขยายเวลา และประทับลายน้ำ SynthID ลงบนทุกสตรีมเสียงที่สร้างขึ้น ซึ่งในปัจจุบันไม่สามารถลบออกได้

การระบุผู้พูดหลายคน — Qwen: การแยกเสียงผู้พูดแบบเรียลไทม์ อ้างว่า DER 9.7% Gemini: มีเอกสารระบุว่าการผลัดกันพูดอ่อนแอ ไม่มีการอ้างความสามารถด้านการแยกเสียงผู้พูด

ความเที่ยงตรงของเสียง — Qwen: การจำลองลักษณะเสียงต้นฉบับผ่านโมดูล Talker; Gemini: การรักษาทำนองเสียง ระดับเสียง และจังหวะการพูด; มีการบันทึกถึงการเพี้ยนของการโคลนเสียง

เอาต์พุตสองภาษา — Qwen: ข้อความต้นฉบับและคำแปลถูกส่งออกบนไทม์ไลน์เดียวกัน Gemini: การถอดเสียงอินพุตและเอาต์พุตแบบเลือกได้ กำหนดค่าแยกตามเซสชัน

การใส่ลายน้ำ — Qwen: ไม่ระบุไว้ Gemini: ใช้ SynthID กับเสียงที่สร้างขึ้นทั้งหมด ไม่มีช่องทางในการลบออก

ระยะเวลาของเซสชัน — Qwen: ไม่ระบุ Gemini: จำกัดไว้ที่ 15 นาทีสำหรับเซสชันเสียงล้วน

ประเภทอินพุต — Qwen: เสียงและภาพ Gemini: เสียงเท่านั้น ไม่มีอินพุตข้อความ

Screenshot of Google's own Gemini Live API documentation for live translation, showing the speech-to-speech streaming setup, the supported-language list, and the documented session constraints for the preview model.

ค่าใช้จ่ายจริงในการรันแต่ละอันคือเท่าไร

Qwen3.8-LiveTranslate คิดราคาต่อล้านโทเคนผ่าน WebSocket Realtime API ในภูมิภาคสิงคโปร์: อินพุตเสียง $7.50, อินพุตภาพ $0.55, เอาต์พุตข้อความ $20.00, เอาต์พุตเสียง $30.00 ในปักกิ่ง: ¥40 / ¥3.3 / ¥100 / ¥160 ต่อล้าน — ประมาณ $5.65 / $0.47 / $14.13 / $22.61 คอนเท็กซ์ของโมเดลคือ 53,248 โทเคน และขีดจำกัดอัตราคือ 10 คำขอต่อนาที และ 100,000 โทเคนต่อนาทีในทั้งสองภูมิภาค

เพดาน 10 RPM เป็นตัวเลขที่ส่งผลกระทบมากที่สุดในเรทการ์ด เงื่อนไขทางการค้าของ Gemini 3.5 Live Translate ไม่ได้เผยแพร่ในลักษณะเดียวกัน ซึ่งตัวมันเองเป็นสัญญาณเกี่ยวกับความสมบูรณ์: Google กำลังเผยแพร่ผ่าน Live API และ AI Studio ในรูปแบบพับลิกพรีวิว, Google Meet ในรูปแบบไพรเวทพรีวิวสำหรับลูกค้า Workspace บางรายที่ได้รับเลือก, และแอป Translate บน Android และ iOS ราคาพรีวิวและขีดจำกัดอัตราพรีวิวอาจเปลี่ยนแปลงได้โดยไม่ต้องแจ้งให้ทราบล่วงหน้า และ Google ยังไม่ได้กำหนดวันวางจำหน่ายทั่วไป (GA)

ดังนั้น การเปรียบเทียบต้นทุนตอนนี้คือระหว่างโมเดลที่มีราคาเผยแพร่แล้วและมีเพดานการทำงานพร้อมกันแบบตายตัว กับโมเดลที่ไม่มีราคาเผยแพร่และมีเพดานที่ไม่ได้ระบุไว้ หากคุณต้องจำลองเศรษฐศาสตร์ต่อหน่วยในไตรมาสนี้ มีเพียงตัวเดียวเท่านั้นที่จัดงบได้

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint and the published per-million-token pricing for audio input, image input, text output and audio output.

สิ่งที่การทดสอบที่เป็นอิสระจะต้องแสดงให้เห็น

ทุกอย่างข้างต้นสร้างขึ้นจากประกาศของสองผู้ขายเอง เพราะยังไม่มีใครรันโมเดลเหล่านี้เทียบกัน ผลลัพธ์ที่จะตัดสินการเปรียบเทียบนี้ได้จริงต้องมีสี่สิ่ง และยังไม่มีสิ่งใดในนั้นเลย:

• LAAL วัดด้วยวิธีเดียวกันบนทั้งสองโมเดล บนเสียงเดียวกัน และในคู่ภาษาเดียวกัน — ตัวเลข 2.3 วินาทีของ Qwen ไม่สามารถนำไปเปรียบเทียบกับสิ่งใดที่ Google ปฏิเสธที่จะระบุได้

• อัตราความผิดพลาดในการแยกผู้พูด (Diarization error rate) บนคลังข้อมูลหลายผู้พูดที่ใช้ร่วมกัน ไม่ใช่บนชุด Omnilingua-MSpeaker ของ Qwen เอง

• ความเสถียรของการโคลนเสียงตลอดเซสชันที่ยาวนาน ซึ่งเป็นจุดที่เอกสารของ Gemini เองชี้ถึงการคลาดเคลื่อน และเป็นจุดที่ Qwen กล่าวอ้างได้อย่างมั่นใจที่สุด

• พฤติกรรม ณ ขีดจำกัดการทำงานพร้อมกัน — ว่า 10 RPM ของ Qwen จะรับไหวภายใต้โหลดการประชุมจริงหรือไม่ และโควต้าพรีวิวของ Gemini จะอยู่รอดเมื่อเจอการใช้งานจริงในโปรดักชันหรือไม่

ตราบใดที่การทดสอบนั้นยังไม่มี จุดยืนที่ป้องกันได้ก็แคบ: Qwen เผยแพร่มากกว่าและสัญญาสิ่งที่เจาะจงมากกว่า; Google มีความครอบคลุมภาษาที่กว้างกว่าและฐานการกระจายที่โมเดลแบบ API-only ไม่มีทางเทียบได้

เลือกอันไหนดี

จงพิจารณาโครงสร้างของปัญหาของคุณ ไม่ใช่ที่กระดานคะแนน เพราะกระดานคะแนนยังไม่น่าเชื่อถือ

หากภาระงานของคุณมีหลายฝ่ายและเรื่องการระบุที่มามีความสำคัญ — การถอดเสียงการประชุม การเสวนาเป็นคณะ ห้องพิจารณาคดี อะไรก็ตามที่การรู้ว่า ใครเป็นผู้พูดประโยคที่แปลแล้วคือส่วนหนึ่งของคุณค่า — Qwen3.8-LiveTranslate เป็นเพียงตัวเดียวในสองตัวนี้ที่อ้างว่ามีความสามารถดังกล่าว และจุดอ่อนเรื่องการผลัดกันพูดที่เป็นที่บันทึกไว้ของ Gemini ก็ชี้ไปในทางเดียวกัน หากภาระงานของคุณครอบคลุมหลายภาษา มุ่งสู่ผู้บริโภค และอยู่ในระบบนิเวศของ Google อยู่แล้ว ภาษากว่า 70 ภาษาของ Gemini 3.5 Live Translate และการมีอยู่ในแอป Translate และ Meet ถือเป็นข้อได้เปรียบที่คู่แข่งแบบ API-only ไม่มีใครเทียบได้ในด้านการกระจาย

หากคุณกำลังสร้างผลิตภัณฑ์จริง ไม่ใช่แค่ซื้อเดโมมาลอง ควรทราบไว้ว่าทั้งสองตัวเป็นผู้เชี่ยวชาญเฉพาะทางแคบ ๆ ทั้งคู่ ไม่ได้รัน agent loop ไม่ได้สรุปความ และ Qwen3.8-LiveTranslate รองรับอย่างชัดเจนว่าไม่มี function calling ไม่มี structured output ไม่มี context caching และไม่รองรับ fine-tuning ตัวล่ามแปลเป็นเพียงส่วนหน้าของไปป์ไลน์คุณ ไม่ใช่ทั้งหมดของระบบ และ OrcaRouter ไม่ใช่ที่สำหรับเรียกใช้โมเดลแปลทั้งสองตัวในตอนนี้ — ทั้งคู่ยังไม่อยู่ในแคตตาล็อกของเรา และเรายอมพูดตรง ๆ อย่างนั้นดีกว่าปล่อยให้เข้าใจผิด สิ่งที่เรามีให้คือส่วนหนึ่งของสแตกที่นำบทถอดเสียงไปใช้ต่อ: คีย์เดียวใช้ได้กับโมเดลกว่า 200 ตัว ในราคาตามที่ผู้ให้บริการประกาศไว้ โดยไม่บวกเพิ่มแม้แต่นิดเดียว เพื่อให้ตัวสรุป ตัวบังคับใช้อภิธานศัพท์ หรือเอเจนต์ปลายน้ำที่อ่านบทถอดเสียงนั้น สามารถสลับเปลี่ยนหรือ failover ได้โดยไม่ต้องแตะสัญญากับผู้ขายรายที่สอง

ด้านล่างของมัน

Qwen3.8-LiveTranslate กับ Gemini 3.5 Live Translate ใกล้เคียงกันมากพอในแง่พื้นฐาน จนการตลาดกลายเป็นสิ่งที่สร้างความแตกต่าง: เจ้าหนึ่งเปิดเผยตัวเลขความหน่วงและตารางอัตราค่าบริการ อีกเจ้าหนึ่งเปิดเผยแผนที่ภาษาและระบบนิเวศ ทั้งคู่ยังไม่ส่งตัวเองเข้าสู่การทดสอบโดยอิสระ เวอร์ชันของการเปรียบเทียบนี้ที่น่าอ่าน คือเวอร์ชันที่จะถูกเขียนขึ้นหลังจากมีคนรันทั้งสองตัวบนเสียงเดียวกัน — และเมื่อดูว่าหมวดหมู่นี้เคลื่อนไหวเร็วแค่ไหน นั่นอาจไม่ไกลเกินไปนัก

การเปรียบเทียบในบทความนี้3

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube