การ์ดชื่อเรื่องที่เขียนว่า 'Qwen3.8-LiveTranslate vs Qwen 3.8' พร้อมคำบรรยายว่า 'ชื่อชนกัน ไม่ใช่การต่อสู้ที่ยุติธรรม'
Guides & Insights

Qwen3.8-LiveTranslate กับ Qwen 3.8: การชนกันของชื่อ ไม่ใช่การแข่งขันที่ยุติธรรม

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ค้นหาหนึ่งในโมเดลเหล่านี้ แล้วคุณจะเห็นอีกตัวหนึ่ง Qwen3.8-LiveTranslate ซึ่งเปิดตัวเมื่อวันที่ 19 กันยายน 2026 และ Qwen3.8-Max — โมเดลที่คนส่วนใหญ่หมายถึงเมื่อเขียนว่า "Qwen 3.8" โดยไม่มีคำต่อท้าย เปิดให้ใช้งานทั่วไปตั้งแต่ 3 สิงหาคม 2026 และรีเฟรชเป็น Qwen3.8-Max-0902 เมื่อวันที่ 2 กันยายน — มีเพียงคำนำหน้ารุ่นที่ใช้ร่วมกัน และแทบไม่มีอะไรเหมือนกันเลย ตัวหนึ่งเป็นระบบแปลแบบทันทีที่รับเสียงเข้าและส่งออกเสียงแปลพร้อมข้อความ โดยคิดค่าบริการผ่าน WebSocket ภายใต้ ID qwen3.8-livetranslate-flash-realtime ส่วนอีกตัวหนึ่งเป็นโมเดลเอนกประสงค์แบบ sparse mixture-of-experts ที่มีพารามิเตอร์ 2.4 ล้านล้านตัว พร้อมหน้าต่างบริบทขนาด 1M โทเคน ซึ่งไม่ได้ยินอะไรเลยแม้แต่นิดเดียว การนำทั้งสองมาเทียบกันแบบตัวต่อตัวจึงเป็นความผิดพลาดเชิงหมวดหมู่ และข้อเท็จจริงที่ว่าผู้คนจำนวนมากตกอยู่ในความผิดพลาดนั้นคือประเด็นจริงของเรื่องนี้: ปัจจุบันผู้ขายส่งมอบผลิตภัณฑ์ที่แตกต่างกันอย่างน้อยสี่อย่างภายใต้ชื่อ Qwen 3.8 และรูปแบบการตั้งชื่อไม่ได้บอกคุณว่าคุณต้องการตัวไหน

แต่ละอย่างจริงๆ แล้วคืออะไร

generation Qwen 3.8 ถูกปล่อยออกมาเป็นลำดับชั้นตลอดครึ่งหลังของปี 2026 และแต่ละชั้นนั้นไม่สามารถใช้แทนกันได้

Qwen3.8-Max เป็นเรือธงแบบโฮสต์: โมเดล MoE แบบสปาร์สที่มีพารามิเตอร์รวมประมาณ 2.4 ล้านล้านตัว และมีพารามิเตอร์ที่ใช้งานจริงประมาณ 95 พันล้านตัวต่อการประมวลผลไปข้างหน้าหนึ่งครั้ง มีคอนเท็กซ์ 1 ล้านโทเคน และรองรับอินพุตทั้งข้อความ รูปภาพ และวิดีโอ โดยเอาต์พุตเป็นข้อความเท่านั้น ราคาอยู่ที่ $2.00 ต่ออินพุตหนึ่งล้านโทเคน และ $6.00 ต่อเอาต์พุตหนึ่งล้านโทเคน โดยการอ่านแคชอยู่ที่ $0.250 ต่อล้าน คะแนนที่ผู้ขายรายงานระบุว่าได้ 86.6 บน Terminal-Bench 2.1, 92.6 บน GPQA Diamond, 67.7 บน SWE-bench Pro และ 43.6 บน Humanity's Last Exam

Qwen3.8-2.4T-A95Bเป็นเวอร์ชันที่เปิดน้ำหนัก (open-weight) ของเจเนอเรชันเดียวกัน เผยแพร่เมื่อวันที่ 12 สิงหาคม 2026: มี routed expert จำนวน 512 ตัวกระจายอยู่ใน 92 เลเยอร์ โดย 69 เลเยอร์ในนั้นใช้ linear attention และมีน้ำหนักประมาณ 4.89 TB นี่คือโมเดลที่คนส่วนใหญ่หมายถึงเมื่อพูดว่า "Qwen 3.8" ในกรณีที่พวกเขากำลังพูดถึงการรันด้วยตัวเองมากกว่าการเรียกใช้ผ่าน API

Qwen3.8-27B เป็นเช็กพอยต์แบบเปิดขนาดเล็กในตระกูลเดียวกัน และ Qwen3.8-LiveTranslate เป็นตัวเฉพาะทาง — นักแปลที่ใช้สถาปัตยกรรม Interleave สร้างขึ้นบนการออกแบบ Hybrid MoE Thinker–Talker โดยรองรับการรู้จำภาษาต้นทาง 60 ภาษา และมี 29 ภาษาที่พร้อมใช้งานสำหรับการส่งออกเสียง

แกนที่แบ่งแยกทั้งสองออกจากกันไม่ใช่ขนาด แต่เป็นโมดัลลิตี Qwen3.8-Max ไม่มีเส้นทางรับอินพุตเสียงและไม่มีเอาต์พุตเสียงเลย การขอให้มันตีความบทสนทนาแบบสด ๆ ไม่ใช่เรื่องของการพรอมป์ให้ดีขึ้น ความสามารถนั้นไม่มีอยู่ในตัวโมเดลตั้งแต่แรก

ความแตกต่างของสเปก

เมื่อวางเทียบกัน สองรุ่นนี้แทบไม่ทับซ้อนกันในมิติใด ๆ ที่ผู้ซื้อให้ความสำคัญ:

งานหลัก — Qwen3.8-LiveTranslate: การแปลเสียงเป็นเสียงแบบพร้อมกัน Qwen3.8-Max: การให้เหตุผลทั่วไป การเขียนโค้ด งานแบบเอเจนต์ และงานข้อความแบบมัลติโมดัล

รูปแบบอินพุต — Qwen3.8-LiveTranslate: เสียงและภาพ Qwen3.8-Max: ข้อความ ภาพ และวิดีโอ

รูปแบบเอาต์พุต — Qwen3.8-LiveTranslate: ข้อความและเสียงสังเคราะห์ Qwen3.8-Max: ข้อความเท่านั้น

หน้าต่างบริบท — Qwen3.8-LiveTranslate: 53,248 โทเคน (ขาเข้า 49,152 / ขาออก 4,096) Qwen3.8-Max: 1,000,000 โทเคน

เวท — Qwen3.8-LiveTranslate: ปิด ใช้ได้ผ่าน API เท่านั้น Qwen3.8-Max: โฮสต์ โดยมีคู่พี่น้องแบบเปิด Qwen3.8-2.4T-A95B ที่เผยแพร่ภายใต้รุ่นเดียวกัน

ขีดจำกัดอัตราการใช้งาน — Qwen3.8-LiveTranslate: 10 คำขอ และ 100,000 โทเคนต่อนาที Qwen3.8-Max: ปริมาณการประมวลผลแบบโฮสต์มาตรฐาน ไม่มีเพดานแบบเรียลไทม์ต่อคำขอ

ความแตกต่างด้าน context คือสิ่งที่ทำให้คนประหลาดใจ Qwen3.8-Max รองรับหนึ่งล้านโทเคน ส่วนล่ามรองรับประมาณห้าเปอร์เซ็นต์ของจำนวนนั้น แต่ล่ามแบบเรียลไทม์ไม่จำเป็นต้องมี context ยาว — มันต้องการหน่วยความจำที่สั้นและเร็วมาก เพดานอินพุต 49,152 โทเคนของมันถูกกำหนดขนาดไว้เพื่อพาบทสนทนาช่วงหลายนาทีล่าสุดไปข้างหน้า เพื่อรักษาชื่อและคำศัพท์เฉพาะให้สอดคล้องกัน ซึ่งนั่นก็คือหน้าที่ของ "long-context disambiguation" พอดี การตัดสินล่ามจากตัวเลข context ก็เหมือนการตัดสินเครื่องยนต์แข่งจากถังน้ำมัน

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: primary job live interpretation, input audio plus image, output text plus audio, context 53,248 tokens, weights closed and API-only, audio in and out $7.50 and $30.00. Qwen3.8-Max column: primary job general reasoning, input text plus image plus video, output text only, context 1,000,000 tokens, weights hosted with the open sibling 2.4T-A95B, text in and out $2.00 and $6.00. Footer reads 'LiveTranslate per Alibaba Cloud; Qwen3.8-Max per OrcaRouter. Neither independently audited.'

ทำไมการเปรียบเทียบราคาจึงเป็นกับดัก

เมื่อคิดในอัตราต่อหนึ่งล้านโทเคน อินเทอร์พรีเตอร์ดูมีราคาแพงขึ้นอย่างมากเมื่อเทียบกับรุ่นเรือธง: 7.50 ดอลลาร์ต่อโทเคนอินพุตเสียงหนึ่งล้านโทเคน เทียบกับ 2.00 ดอลลาร์ต่อโทเคนอินพุตข้อความหนึ่งล้านโทเคน และ 30.00 ดอลลาร์ต่อเอาต์พุตเสียงหนึ่งล้านโทเคน เทียบกับ 6.00 ดอลลาร์ต่อเอาต์พุตข้อความหนึ่งล้านโทเคน

การเปรียบเทียบนั้นไม่มีความหมาย และมันเป็นข้อผิดพลาดที่พบได้บ่อยที่สุดเพียงหนึ่งเดียวเกี่ยวกับโมเดลประเภทนี้ โทเค็นเสียงและโทเค็นข้อความไม่ใช่หน่วยเดียวกัน คำพูดถูกเข้ารหัสเป็นโทเค็นเสียงด้วยความหนาแน่นที่ไม่มีความสัมพันธ์ใด ๆ กับเนื้อหาเดียวกันเมื่อเขียนออกมา — บทสนทนาหนึ่งนาทีใช้โทเค็นเสียงมากมายมหาศาลกว่าที่บทถอดความของมันใช้โทเค็นข้อความ และเสียงเอาต์พุตยังเพิ่มสตรีมที่สองเข้าไปอีก การนำอัตราทั้งสองมาแสดงเคียงกันบ่งชี้ถึงอัตราส่วนต้นทุนที่ไม่มีอยู่จริงในทางปฏิบัติ

ความแตกต่างเชิงโครงสร้างสำคัญกว่าความแตกต่างด้านราคา Qwen คิดค่าบริการอินเทอร์พรีเตอร์เป็นรายโทเคน ขณะที่ตลาดเสียงแบบเรียลไทม์จำนวนมากคิดค่าบริการเป็นรายนาทีของเซสชัน โมเดลการคิดราคาสองแบบนี้ทำงานแตกต่างกันโดยสิ้นเชิงเมื่อเสียงของคุณเบาลง เซสชันของคุณสั้นลง หรือผู้พูดของคุณหยุดชั่วคราว — มิเตอร์แบบรายนาทีคิดเงินสำหรับความเงียบ ส่วนมิเตอร์แบบรายโทเคนไม่คิด หากคุณกำลังสร้างโมเดลต้นทุน คำถามไม่ใช่ว่าอัตราใดต่ำกว่า แต่เป็นว่ามิเตอร์ใดลงโทษลักษณะการใช้งานของคุณ และให้สังเกตการแบ่งตามภูมิภาค: ราคาในปักกิ่งอยู่ที่ ¥40 / ¥3.3 / ¥100 / ¥160 ต่อล้านสำหรับอินพุตเสียง อินพุตภาพ เอาต์พุตข้อความ และเอาต์พุตเสียงตามลำดับ ซึ่งต่ำกว่าอัตราของสิงคโปร์อย่างมีนัยสำคัญ ซึ่งเป็นความแตกต่างแบบที่มองเห็นได้ก็ต่อเมื่อคุณเปรียบเทียบทั้งสองแบบทีละบรรทัด

อีกหนึ่งข้อที่ทำให้ล่ามได้เปรียบด้านต้นทุน: Qwen รักษาอัตราเหล่านี้ให้แทบคงที่เมื่อเทียบกับ Qwen3.5-LiveTranslate โดยปักกิ่งไม่เปลี่ยนแปลง และสิงคโปร์ถูกลงเล็กน้อย การที่รุ่นใหม่เปิดตัวโดยไม่ขึ้นราคาไม่ใช่เรื่องปกติในตลาดนี้

Open weights กับ API-only ต่างหากคือเส้นแบ่งที่แท้จริง

หากคุณกำลังเลือกระหว่างสองตัวเลือกนี้โดยยึดหลักการมากกว่าขีดความสามารถ ปัจจัยชี้ขาดก็คือเรื่องการอนุญาตให้ใช้สิทธิ

Qwen3.8-Max มีให้บริการแบบโฮสต์ และเวตระดับ Max ของรุ่นนี้ถูกเปิดซอร์สเป็น Qwen3.8-2.4T-A95B ในเดือนสิงหาคม เส้นทางนั้นมีอยู่จริง แต่มันไม่ใช่เส้นทางที่ทำได้ง่าย ๆ: เวต 4.89 TB คือฮาร์ดแวร์ระดับศูนย์ข้อมูล และสัญญาอนุญาตแบบเปิดเวตกำหนดให้องค์กรที่มีรายได้เกิน 50 ล้านดอลลาร์ในรอบสิบสองเดือนต้องขอสัญญาอนุญาตเชิงพาณิชย์จาก Alibaba Cloud

Qwen3.8-LiveTranslate ไม่มีเส้นทางดังกล่าว มันเป็นแบบ closed-weight และให้บริการผ่าน API เท่านั้น เข้าถึงได้ผ่าน WebSocket Realtime API ซึ่งจำเป็นต้องตั้งค่า target_language ใน session.update ก่อนที่เสียงใด ๆ จะเริ่มส่ง และไม่รองรับ function calling ไม่มี structured output ไม่มี context caching ไม่มี batch inference และไม่มี fine-tuning หากความต้องการของคุณคือการรันอินเทอร์พรีเตอร์บนฮาร์ดแวร์ของคุณเอง โมเดลนี้ไม่ตอบโจทย์ และต่อให้ทำวิศวกรรมมากเพียงใดก็ไม่อาจเปลี่ยนข้อเท็จจริงนี้ได้

นั่นสำคัญสำหรับผู้ซื้อประเภทหนึ่งโดยเฉพาะ: ผู้ที่ไม่สามารถส่งเสียงไปยังบุคคลที่สามได้ — โรงพยาบาล สำนักงานกฎหมาย ผู้รับเหมาของรัฐบาล สำหรับคนอื่น ๆ คำถามในทางปฏิบัติคือ ล่ามดีพอที่จะคุ้มค่ากับการพึ่งพาหรือไม่ และคำตอบสำหรับเรื่องนั้นคือการวัดที่ Qwen ยังไม่เปิดให้ใครทำได้

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint, the required target_language session parameter, and the published per-million-token rates.

เลือกตามงาน ไม่ใช่ตามชื่อ

คำตอบที่ถูกต้องสำหรับ "Qwen3.8-LiveTranslate หรือ Qwen 3.8" คือคุณน่าจะต้องได้คำตอบของคำถามอื่น

• หากงานคือการแปลแบบสด — การประชุม สายสนทนา หรือการถ่ายทอดสด — มีเพียงตัวเดียวเท่านั้นที่ทำได้ และมันไม่ใช่รุ่นเรือธง

ถ้างานคือการสรุปสิ่งที่ถูกพูด การดึงรายการสิ่งที่ต้องดำเนินการ การตอบคำถามเกี่ยวกับบทถอดเสียง หรือการเขียนข้อความติดตามผล — มีเพียงโมเดลเรือธงเท่านั้นที่ทำได้ และมันไม่ใช่ล่าม

• หากงานนี้เป็นทั้งสองอย่าง คุณกำลังสร้างไปป์ไลน์ และคุณจะต้องจ่ายเงินให้ผู้ขายสองรายพร้อมสัญญาสองฉบับและชุดข้อมูลรับรองสองชุด เว้นแต่คุณจะรวมเข้าด้วยกันอย่างตั้งใจ

กรณีที่สามเป็นกรณีที่พบได้ทั่วไป และเป็นจุดที่การรันทั้งสองครึ่งไว้หลังปลายทางเดียวไม่ได้เป็นเพียงความสะดวกอีกต่อไป แต่เริ่มเป็นสถาปัตยกรรม Qwen3.8-Max อยู่บน OrcaRouter ในราคาตามรายการของผู้ให้บริการที่ $2.00 ต่ออินพุตหนึ่งล้านโทเค็น และ $6.00 ต่อเอาต์พุตหนึ่งล้านโทเค็น โดยมีการส่งผ่านโดยไม่บวกเพิ่ม ดังนั้นการลดราคาของ Qwen จึงสะท้อนมาถึงบิลของคุณภายในวันเดียวกัน แทนที่จะเป็นตอนต่อสัญญาครั้งถัดไป และการสลับไปยังระบบสำรองอัตโนมัติหมายความว่าครึ่งที่ทำหน้าที่สรุปของไปป์ไลน์จะไม่ดับไปเมื่อผู้ให้บริการรายหนึ่งมีช่วงเวลาที่มีปัญหา

เพื่อให้ชัดเจนถึงอีกครึ่งหนึ่ง เพราะความแตกต่างนี้สำคัญ: Qwen3.8-LiveTranslate ไม่ได้อยู่ในแค็ตตาล็อกของเรา แต่มีให้ใช้ผ่าน Model Studio API ของ Alibaba เอง และเอนด์พอยต์ทดลองของผู้จำหน่ายที่ omni.qwen.ai/live-translate และเราจะไม่สื่อเป็นนัยว่าเราจัดเส้นทางไปยังโมเดลที่เราไม่ได้ให้บริการ สิ่งที่คุณวางไว้หลังคีย์เดียวได้ในวันนี้คือสแต็กปลายน้ำ — โมเดลที่นำผลลัพธ์ที่ล่ามสร้างขึ้นไปใช้

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

ปัญหาการตั้งชื่อคือข้อค้นพบที่แท้จริง

สี่โมเดล หนึ่งคำนำหน้า และไม่มีธรรมเนียมคำต่อท้ายที่ผู้อ่านจะพึ่งพาได้ "Qwen 3.8" อาจหมายถึงโมเดลเรือธงที่โฮสต์ไว้, เช็กพอยต์แบบเปิดขนาด 2.4T, โมเดลเล็ก 27B, หรือโมเดลแปลภาษา ขึ้นอยู่กับว่าใครเป็นคนพิมพ์และเพิ่งอ่านอะไรมาเป็นครั้งสุดท้าย ตารางเบนช์มาร์กที่เผยแพร่ไว้ช่วยไม่ได้ เพราะโมเดลเรือธงมีข้อมูลเหล่านั้น ส่วนโมเดลแปลภาษาส่วนใหญ่ไม่มี: Qwen3.8-Max สามารถถูกจัดอันดับบน Terminal-Bench หรือ GPQA Diamond ได้ ขณะที่หลักฐานของ Qwen3.8-LiveTranslate ได้แก่ ความล่าช้าเฉลี่ย 2.3 วินาที, ค่า xCOMET-XXL 85.7 บน FLEURS ที่ผู้ขายรายงานเอง, และอัตราความผิดพลาดในการแยกผู้พูด 9.7% ที่รายงานเอง โดยไม่มีการทำซ้ำอย่างเป็นอิสระ

ดังนั้นการเปรียบเทียบที่หน้านี้ตั้งขึ้นมาเพื่อตอบ จึงแท้จริงแล้วเป็นคำเตือน ก่อนที่คุณจะเปรียบเทียบ Qwen 3.8 กับสิ่งใด จงระบุให้ชัดว่าคุณหมายถึง Qwen 3.8 ตัวไหน ถ้ามันรับเสียงได้ มันคือล่าม และเป็นผู้เชี่ยวชาญที่คุณซื้อมาเพื่องานเดียว ถ้ามันรับวิดีโอได้ มันคือเรือธง และเป็นโมเดลอเนกประสงค์ที่คุณซื้อมาเพื่องานอื่นอีกยี่สิบอย่าง การประเมินใดที่ปนทั้งสองแบบเข้าด้วยกันจะให้ข้อสรุปที่ไม่เกี่ยวกับทั้งสองตัวเลย

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube