
Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate: ตัวหนึ่งส่งตัวเลข อีกตัวส่งแผนที่
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
โมเดลแปลเสียงแบบเรียลไทม์ชั้นนำสองตัวมีความเห็นไม่ตรงกันว่าพวกมันยินดีให้วัดผลกันที่อะไร และความไม่ตรงกันนั้นมีประโยชน์มากกว่าการเปรียบเทียบสเปกใด ๆ Qwen3.8-LiveTranslate ซึ่งเปิดตัวเมื่อวันที่ 19 กันยายน 2026 นำเสนอด้วยตัวเลขแข็งเพียงตัวเดียว คือความหน่วงเฉลี่ย 2.3 วินาที ลดลงจาก 2.8 ในรุ่นก่อนหน้า Gemini 3.5 Live Translate โมเดลเสียงเป็นเสียงของผู้ขายรายนี้ที่ประกาศเมื่อเดือนมิถุนายน 2026 และยังใช้ ID โมเดลแบบพรีวิว นำเสนอด้วยความครอบคลุม — มากกว่า 70 ภาษา ตรวจจับอัตโนมัติ สลับภาษาได้กลางบทสนทนา และผสานรวมเข้ากับแอป Translate และ Meet ของผู้ขาย บริษัทหนึ่งเผยแพร่ตัวเลขความหน่วงที่สามารถถูกตรวจสอบได้ อีกบริษัทหนึ่งเผยแพร่จำนวนภาษา หากคุณกำลังเลือกระหว่างสองตัวนี้ การเข้าใจว่าทำไมสิ่งเหล่านั้นจึงเป็นคำสัญญาคนละแบบสำคัญกว่าว่ารายการไหนยาวกว่า
สองสถาปัตยกรรมที่เห็นตรงกันเฉพาะเป้าหมายเท่านั้น
โมเดลทั้งสองมีอยู่เพื่อกำจัดพฤติกรรมเดียวกัน นั่นคือนักแปลแบบผลัดกันพูดที่รอให้คุณพูดจบประโยคก่อนจึงจะเอ่ยอะไรออกมา ช่วงหยุดชะงักนั้นเองที่ทำให้การตีความของเครื่องจักรรู้สึกเหมือนการตีความของเครื่องจักร
Qwen3.8-LiveTranslate ไปถึงจุดนั้นได้ด้วยสถาปัตยกรรม Interleave บนแกนหลัก Hybrid MoE ซึ่งแยกออกเป็นโมดูล Thinker ที่หลอมรวมเสียง วิดีโอ ข้อความต้นทาง และคำแปลเข้าเป็นลำดับเชิงเหตุปัจจัยเดียว และโมดูล Talker ที่สังเคราะห์คำแปลขึ้นใหม่ด้วยโทนเสียงของผู้พูดต้นฉบับ คำกล่าวอ้างคือการยุบรวมการรู้จำ การแปล และการสังเคราะห์ให้เป็นลำดับเดียว ช่วยขจัดความหน่วงและการสูญเสียเชิงความหมายที่ไปป์ไลน์สามขั้นตอนต้องจ่าย ณ ขอบเขตของทุกโมดูล
Gemini 3.5 Live Translate ยึดจุดยืนแบบ end-to-end เดียวกันจากอีกทิศทางหนึ่ง: มันถูกสร้างบน Gemini 3 Pro ในฐานะโมเดลเสียงเป็นเสียงโดยกำเนิด โดยสตรีมต่อเนื่องผ่าน Gemini Live API แทนที่จะรันลำดับขั้น ASR → MT → TTS แยกส่วนกัน ในทางปฏิบัติ คุณจะถือ WebSocket สองทิศทางแบบถาวรไว้ ผลักชังก์เสียง 100 ms ขึ้นไป และดึงชังก์เสียงที่แปลแล้วลงมา ไม่มีโมเดลใดทำแบบเก่าอีกต่อไป ตอนนี้ทั้งคู่ทำแบบใหม่แล้ว ความแตกต่างทั้งหมดอยู่ที่รายละเอียดระดับรอง
การเปรียบเทียบความหน่วงไม่ใช่การเสมอกันอย่างที่ดูเหมือน
Google อธิบายว่า Gemini 3.5 Live Translate ทำงานโดย "ตามหลังผู้พูดอยู่ไม่กี่วินาที" Google ยังไม่ได้เผยแพร่ตัวเลข LAAL หรือตัวชี้วัดความหน่วงแบบมีชื่อเรียกและทำซ้ำได้อื่นใด สำหรับโมเดลนี้ ส่วน Qwen ได้เผยแพร่ค่า 2.3 วินาที พร้อมทั้งนิยามว่าค่านั้นหมายถึงอะไร
ความไม่สมมาตรนี้ถูกทำให้กลายเป็นประโยคง่ายๆ ว่า "ทั้งสองอยู่ที่ประมาณสองถึงสามวินาที" การตีความนั้นไม่มีอะไรที่บริษัทใดบริษัทหนึ่งกล่าวไว้สนับสนุน วลีของ Google สอดคล้องกับ 2 วินาที และสอดคล้องกับ 4; บริษัทเพียงแค่ปฏิเสธที่จะถูกตรึงให้แน่ชัด การเปรียบเทียบที่สามารถทำได้จริงในวันนี้คือ:
• ตัวชี้วัดความหน่วงที่เผยแพร่ — Qwen3.8-LiveTranslate: LAAL 2.3 วินาที ตามรายงานของผู้ให้บริการ Gemini 3.5 Live Translate: ไม่มีการเผยแพร่
• การวัดค่าความหน่วงอย่างอิสระ — ไม่มีเลย สำหรับโมเดลทั้งสอง ไม่มีบุคคลที่สามรายใดเผยแพร่ผลการเปรียบเทียบแบบตัวต่อตัว
ข้อสรุปที่ซื่อตรงคือ ในด้านความหน่วง (latency) Qwen ได้กล่าวอ้างที่สามารถพิสูจน์หักล้างได้ ส่วน Google กล่าวอ้างแบบคลุมเครือ นั่นเป็นคะแนนบวกให้ Qwen ในเรื่องความโปร่งใส และเป็นศูนย์คะแนนพอดีในเรื่องประสิทธิภาพจนกว่าจะมีใครวัดทั้งสองเจ้า ถ้าความหน่วงเป็นปัจจัยชี้ขาดสำหรับการนำไปใช้งานของคุณ สถานะของหลักฐานในปัจจุบันยังไม่สนับสนุนการตัดสินใจซื้อในทิศทางใดทิศทางหนึ่งเลย

การเทียบ 60 ภาษากับ 70 กว่าภาษาเป็นกระดานคะแนนที่ไม่ถูกต้อง
จำนวนภาษามักถูกอ้างอิงอยู่เสมอ และมันทำให้เข้าใจผิดได้ทั้งสองทาง
Qwen3.8-LiveTranslate จดจำภาษาต้นทางได้ 60 ภาษา และสร้างเอาต์พุตเสียงพูดใน 29 ภาษาในนั้น Gemini 3.5 Live Translate รองรับมากกว่า 70 ภาษาพร้อมการตรวจจับอัตโนมัติ และใน Google Meet สิ่งนี้ขยายไปถึงชุดค่าผสมภาษามากกว่า 2,000 ชุด ซึ่งก่อนหน้านี้มีขีดจำกัดอยู่ที่การแปลที่อิงภาษาอังกฤษครอบคลุม 5 ภาษา
อ่านตัวเลขที่สองอย่างละเอียดก่อนที่จะถือว่ามันเป็นชัยชนะสามเท่า ตัวเลข 2,000 กว่าของ Google นับเป็นคู่ลำดับ — ทุกภาษาต้นทางจับคู่กับทุกภาษาเป้าหมาย — ซึ่งเป็นตัวชี้วัดความครอบคลุมที่ถูกต้องและมีประโยชน์อย่างแท้จริง แต่ไม่สามารถเทียบได้กับการนับจำนวนภาษาเดียว และรายการของ Google แม้จะกว้างกว่า แต่ก็ให้น้ำหนักอย่างมากกับภาษาที่มีจำนวนผู้พูดมาก: อาฟริกานส์, อาหรับ, เบงกาลี, ดัตช์, อังกฤษ, ฝรั่งเศส, เยอรมัน, ฮินดี, อินโดนีเซีย, อิตาลี, ญี่ปุ่น, เกาหลี, มาเลย์, เปอร์เซีย, โปแลนด์, โปรตุเกส, รัสเซีย, สเปน, สวาฮิลี, ทมิฬ, เตลูกู, ไทย, ตุรกี, ยูเครน, อูรดู, เวียดนาม, ซูลู ภาษาที่มีเอาต์พุตเสียงพูด 29 ภาษาของ Qwen นั้นแคบกว่านั้นอีก และรายการของผู้จำหน่ายทั้งสองรายไม่ใช่คำตอบที่จริงจังสำหรับหางยาว — ภาษาถิ่นระดับภูมิภาคและภาษาที่มีทรัพยากรต่ำซึ่งเครื่องมือแปลความหมายเคยล้มเหลวอย่างหนักที่สุด ทั้งสองบริษัทกล่าวว่าพวกเขากำลังดำเนินการอยู่ แต่ยังไม่มีใครส่งมอบได้
จุดที่ทั้งสองแตกต่างกันจริงๆ: ห้องที่เต็มไปด้วยผู้คน
จุดเดียวที่โมเดลเหล่านี้ให้คำมั่นที่แตกต่างกันอย่างแท้จริงคือการจัดการผู้พูดหลายคน และมันเป็นความแตกต่างที่มีแนวโน้มมากที่สุดที่จะชี้ขาดการนำไปใช้งานจริง
Qwen3.8-LiveTranslate มาพร้อมการแยกผู้พูดแบบเรียลไทม์ โดยแต่ละประโยคจะถูกระบุว่าเป็นของผู้พูดคนใดทันทีที่มาถึง และการจำลองเสียงถูกอธิบายว่ามีความเสถียรเมื่อมีการสลับรอบพูด Qwen รายงานเองว่ามีอัตราความผิดพลาดในการแยกผู้พูด 9.7% บนชุดทดสอบเสียงหลายผู้พูดแบบยาวของตัวเอง เทียบกับ 30.6% ของ Seed LiveInterpret 2.0 — ซึ่งเป็นการเปรียบเทียบของผู้ขายบนการประเมินที่ผู้ขายจัดทำเอง ดังนั้นให้ถือเป็นคำกล่าวอ้างที่แนบตัวเลขมาด้วย มากกว่าจะเป็นผลลัพธ์ โมเดลยังส่งออกข้อความต้นฉบับและคำแปลบนไทม์ไลน์เดียวกัน ซึ่งเป็นสิ่งที่ทำให้คำบรรยายสองภาษาที่ซิงโครไนซ์เป็นไปได้โดยไม่ต้องมีขั้นตอนการจัดแนวแยกต่างหาก
Gemini 3.5 Live Translate ให้น้ำหนักในทางตรงกันข้าม จุดแข็งที่บันทึกไว้คือการรักษาสัมผัสเสียง (prosody) — การคงไว้ซึ่งระดับเสียง จังหวะ การออกเสียงสูงต่ำ และระดับอารมณ์ของผู้พูด เพื่อให้เสียงที่แปลคงความรู้สึกของต้นฉบับไว้ จุดอ่อนที่บันทึกไว้คือจุดที่การแยกเสียงผู้พูด (diarization) จะช่วยได้พอดี: การโคลนเสียงที่ไม่สม่ำเสมอซึ่งอาจคลาดเคลื่อนหลังจากหยุดนานหรือเลือกเพศผิด, การสลับบทสนทนาที่อ่อนแอโดยไม่มีสัญญาณสิ้นสุดประโยคที่ชัดเจน, ปัญหากับสำเนียงที่หนักและคู่ภาษาที่ใกล้เคียงกัน เช่น สเปนกับโปรตุเกส, และการจัดการเสียงรบกวนพื้นหลังที่ไม่สมบูรณ์ Google ยังจำกัดเซสชันเสียงล้วนไว้ที่ 15 นาที เว้นแต่จะขยายเวลา และประทับลายน้ำ SynthID ลงบนทุกสตรีมเสียงที่สร้างขึ้น ซึ่งในปัจจุบันไม่สามารถลบออกได้
• การระบุผู้พูดหลายคน — Qwen: การแยกเสียงผู้พูดแบบเรียลไทม์ อ้างว่า DER 9.7% Gemini: มีเอกสารระบุว่าการผลัดกันพูดอ่อนแอ ไม่มีการอ้างความสามารถด้านการแยกเสียงผู้พูด
• ความเที่ยงตรงของเสียง — Qwen: การจำลองลักษณะเสียงต้นฉบับผ่านโมดูล Talker; Gemini: การรักษาทำนองเสียง ระดับเสียง และจังหวะการพูด; มีการบันทึกถึงการเพี้ยนของการโคลนเสียง
• เอาต์พุตสองภาษา — Qwen: ข้อความต้นฉบับและคำแปลถูกส่งออกบนไทม์ไลน์เดียวกัน Gemini: การถอดเสียงอินพุตและเอาต์พุตแบบเลือกได้ กำหนดค่าแยกตามเซสชัน
• การใส่ลายน้ำ — Qwen: ไม่ระบุไว้ Gemini: ใช้ SynthID กับเสียงที่สร้างขึ้นทั้งหมด ไม่มีช่องทางในการลบออก
• ระยะเวลาของเซสชัน — Qwen: ไม่ระบุ Gemini: จำกัดไว้ที่ 15 นาทีสำหรับเซสชันเสียงล้วน
• ประเภทอินพุต — Qwen: เสียงและภาพ Gemini: เสียงเท่านั้น ไม่มีอินพุตข้อความ

ค่าใช้จ่ายจริงในการรันแต่ละอันคือเท่าไร
Qwen3.8-LiveTranslate คิดราคาต่อล้านโทเคนผ่าน WebSocket Realtime API ในภูมิภาคสิงคโปร์: อินพุตเสียง $7.50, อินพุตภาพ $0.55, เอาต์พุตข้อความ $20.00, เอาต์พุตเสียง $30.00 ในปักกิ่ง: ¥40 / ¥3.3 / ¥100 / ¥160 ต่อล้าน — ประมาณ $5.65 / $0.47 / $14.13 / $22.61 คอนเท็กซ์ของโมเดลคือ 53,248 โทเคน และขีดจำกัดอัตราคือ 10 คำขอต่อนาที และ 100,000 โทเคนต่อนาทีในทั้งสองภูมิภาค
เพดาน 10 RPM เป็นตัวเลขที่ส่งผลกระทบมากที่สุดในเรทการ์ด เงื่อนไขทางการค้าของ Gemini 3.5 Live Translate ไม่ได้เผยแพร่ในลักษณะเดียวกัน ซึ่งตัวมันเองเป็นสัญญาณเกี่ยวกับความสมบูรณ์: Google กำลังเผยแพร่ผ่าน Live API และ AI Studio ในรูปแบบพับลิกพรีวิว, Google Meet ในรูปแบบไพรเวทพรีวิวสำหรับลูกค้า Workspace บางรายที่ได้รับเลือก, และแอป Translate บน Android และ iOS ราคาพรีวิวและขีดจำกัดอัตราพรีวิวอาจเปลี่ยนแปลงได้โดยไม่ต้องแจ้งให้ทราบล่วงหน้า และ Google ยังไม่ได้กำหนดวันวางจำหน่ายทั่วไป (GA)
ดังนั้น การเปรียบเทียบต้นทุนตอนนี้คือระหว่างโมเดลที่มีราคาเผยแพร่แล้วและมีเพดานการทำงานพร้อมกันแบบตายตัว กับโมเดลที่ไม่มีราคาเผยแพร่และมีเพดานที่ไม่ได้ระบุไว้ หากคุณต้องจำลองเศรษฐศาสตร์ต่อหน่วยในไตรมาสนี้ มีเพียงตัวเดียวเท่านั้นที่จัดงบได้

สิ่งที่การทดสอบที่เป็นอิสระจะต้องแสดงให้เห็น
ทุกอย่างข้างต้นสร้างขึ้นจากประกาศของสองผู้ขายเอง เพราะยังไม่มีใครรันโมเดลเหล่านี้เทียบกัน ผลลัพธ์ที่จะตัดสินการเปรียบเทียบนี้ได้จริงต้องมีสี่สิ่ง และยังไม่มีสิ่งใดในนั้นเลย:
• LAAL วัดด้วยวิธีเดียวกันบนทั้งสองโมเดล บนเสียงเดียวกัน และในคู่ภาษาเดียวกัน — ตัวเลข 2.3 วินาทีของ Qwen ไม่สามารถนำไปเปรียบเทียบกับสิ่งใดที่ Google ปฏิเสธที่จะระบุได้
• อัตราความผิดพลาดในการแยกผู้พูด (Diarization error rate) บนคลังข้อมูลหลายผู้พูดที่ใช้ร่วมกัน ไม่ใช่บนชุด Omnilingua-MSpeaker ของ Qwen เอง
• ความเสถียรของการโคลนเสียงตลอดเซสชันที่ยาวนาน ซึ่งเป็นจุดที่เอกสารของ Gemini เองชี้ถึงการคลาดเคลื่อน และเป็นจุดที่ Qwen กล่าวอ้างได้อย่างมั่นใจที่สุด
• พฤติกรรม ณ ขีดจำกัดการทำงานพร้อมกัน — ว่า 10 RPM ของ Qwen จะรับไหวภายใต้โหลดการประชุมจริงหรือไม่ และโควต้าพรีวิวของ Gemini จะอยู่รอดเมื่อเจอการใช้งานจริงในโปรดักชันหรือไม่
ตราบใดที่การทดสอบนั้นยังไม่มี จุดยืนที่ป้องกันได้ก็แคบ: Qwen เผยแพร่มากกว่าและสัญญาสิ่งที่เจาะจงมากกว่า; Google มีความครอบคลุมภาษาที่กว้างกว่าและฐานการกระจายที่โมเดลแบบ API-only ไม่มีทางเทียบได้
เลือกอันไหนดี
จงพิจารณาโครงสร้างของปัญหาของคุณ ไม่ใช่ที่กระดานคะแนน เพราะกระดานคะแนนยังไม่น่าเชื่อถือ
หากภาระงานของคุณมีหลายฝ่ายและเรื่องการระบุที่มามีความสำคัญ — การถอดเสียงการประชุม การเสวนาเป็นคณะ ห้องพิจารณาคดี อะไรก็ตามที่การรู้ว่า ใครเป็นผู้พูดประโยคที่แปลแล้วคือส่วนหนึ่งของคุณค่า — Qwen3.8-LiveTranslate เป็นเพียงตัวเดียวในสองตัวนี้ที่อ้างว่ามีความสามารถดังกล่าว และจุดอ่อนเรื่องการผลัดกันพูดที่เป็นที่บันทึกไว้ของ Gemini ก็ชี้ไปในทางเดียวกัน หากภาระงานของคุณครอบคลุมหลายภาษา มุ่งสู่ผู้บริโภค และอยู่ในระบบนิเวศของ Google อยู่แล้ว ภาษากว่า 70 ภาษาของ Gemini 3.5 Live Translate และการมีอยู่ในแอป Translate และ Meet ถือเป็นข้อได้เปรียบที่คู่แข่งแบบ API-only ไม่มีใครเทียบได้ในด้านการกระจาย
หากคุณกำลังสร้างผลิตภัณฑ์จริง ไม่ใช่แค่ซื้อเดโมมาลอง ควรทราบไว้ว่าทั้งสองตัวเป็นผู้เชี่ยวชาญเฉพาะทางแคบ ๆ ทั้งคู่ ไม่ได้รัน agent loop ไม่ได้สรุปความ และ Qwen3.8-LiveTranslate รองรับอย่างชัดเจนว่าไม่มี function calling ไม่มี structured output ไม่มี context caching และไม่รองรับ fine-tuning ตัวล่ามแปลเป็นเพียงส่วนหน้าของไปป์ไลน์คุณ ไม่ใช่ทั้งหมดของระบบ และ OrcaRouter ไม่ใช่ที่สำหรับเรียกใช้โมเดลแปลทั้งสองตัวในตอนนี้ — ทั้งคู่ยังไม่อยู่ในแคตตาล็อกของเรา และเรายอมพูดตรง ๆ อย่างนั้นดีกว่าปล่อยให้เข้าใจผิด สิ่งที่เรามีให้คือส่วนหนึ่งของสแตกที่นำบทถอดเสียงไปใช้ต่อ: คีย์เดียวใช้ได้กับโมเดลกว่า 200 ตัว ในราคาตามที่ผู้ให้บริการประกาศไว้ โดยไม่บวกเพิ่มแม้แต่นิดเดียว เพื่อให้ตัวสรุป ตัวบังคับใช้อภิธานศัพท์ หรือเอเจนต์ปลายน้ำที่อ่านบทถอดเสียงนั้น สามารถสลับเปลี่ยนหรือ failover ได้โดยไม่ต้องแตะสัญญากับผู้ขายรายที่สอง
ด้านล่างของมัน
Qwen3.8-LiveTranslate กับ Gemini 3.5 Live Translate ใกล้เคียงกันมากพอในแง่พื้นฐาน จนการตลาดกลายเป็นสิ่งที่สร้างความแตกต่าง: เจ้าหนึ่งเปิดเผยตัวเลขความหน่วงและตารางอัตราค่าบริการ อีกเจ้าหนึ่งเปิดเผยแผนที่ภาษาและระบบนิเวศ ทั้งคู่ยังไม่ส่งตัวเองเข้าสู่การทดสอบโดยอิสระ เวอร์ชันของการเปรียบเทียบนี้ที่น่าอ่าน คือเวอร์ชันที่จะถูกเขียนขึ้นหลังจากมีคนรันทั้งสองตัวบนเสียงเดียวกัน — และเมื่อดูว่าหมวดหมู่นี้เคลื่อนไหวเร็วแค่ไหน นั่นอาจไม่ไกลเกินไปนัก
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
