
Realtime-Venus vs Qwen-Audio-3.0-TTS: ตัวหนึ่งอ่านสคริปต์ของคุณ อีกตัวต้องได้ยินคุณ
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
การเปรียบเทียบที่ชวนใจให้ทำระหว่าง Realtime-Venus กับ Qwen-Audio-3.0-TTS คือราคาต่อชั่วโมงของเสียง และมันให้คำตอบที่ดูสะอาดหมดจดซึ่งผิดทั้งหมด Qwen-Audio-3.0-TTS-Plus สังเคราะห์เสียงพูดในราคาประมาณ $27.6 ต่อล้านตัวอักษร ซึ่งคิดออกมาได้ใกล้เคียง $1.66 สำหรับเสียงที่เสร็จแล้วหนึ่งชั่วโมง Realtime-Venus ระบบ full-duplex ขนาด 9B ที่ทีม Venus ของ Ant Group สร้างร่วมกับ Tsinghua University ไม่มีราคาเลยเพราะไม่มีบริการโฮสต์ — แต่หากโฮสต์เอง คุณจะต้องเสียค่า GPU node ที่ทำงานตลอดเวลา ซึ่งอย่างน้อยก็มากกว่าหนึ่งอันดับขนาดต่อชั่วโมง ตัวสังเคราะห์เสียงชนะในแง่เลขคณิต เลขคณิตนั้นกำลังวัดผลิตภัณฑ์สองอย่างที่แตกต่างกัน: Qwen-Audio-3.0-TTS รับข้อความและส่งคืนเสียง ส่วน Realtime-Venus รับเสียงและวิดีโอแล้วส่งคืนบทสนทนา คำถามที่แยกพวกมันออกจากกันจริง ๆ ไม่ใช่สิ่งที่พวกมันส่งออกมา แต่คือว่ามีอะไรต้องพูดตอบกลับหรือไม่
อินพุตคือความแตกต่างทั้งหมด
Qwen-Audio-3.0-TTS ซึ่งเปิดตัวโดย Tongyi Lab ของ Alibaba Cloud เมื่อวันที่ 20 กรกฎาคม 2026 เป็นโมเดลแปลงข้อความเป็นเสียงที่เปิดให้ใช้งานผ่าน API แบบโฮสต์โดยไม่มีเวตแบบเปิด ข้อความถูกส่งเข้าผ่านเอนด์พอยต์ HTTP และเสียงถูกส่งออกมา ไม่มีเส้นทางอินพุตเสียง ไม่มีเทิร์นให้ผลัดกันพูด ไม่มีทรานสคริปต์ให้ส่งคืน และไม่มีแนวคิดเรื่องการถูกขัดจังหวะ — โมเดลนี้ไม่เคยได้ยินอะไรเลย โครงสร้างต้นทุนทั้งหมดของมันคือแท่นพิมพ์: ตัวอักษรเข้า เสียงออก
ในทางตรงกันข้าม Realtime-Venus ฟังอยู่ตลอดเวลา เช็กพอยต์แบบเสียงและภาพมีตัวเข้ารหัสภาพ SigLIP2 สำหรับเฟรมแบบสตรีมมิ่ง และตัวเข้ารหัสเสียง Whisper-Medium ที่ป้อนเข้าสู่แบ็กโบน Qwen3-8B โดยเช็กพอยต์ทั้งสองรันลูปการโต้ตอบความยาวหนึ่งวินาทีซึ่งอัปเดตสถานะการสนทนาอย่างต่อเนื่องและตัดสินใจว่าจะพูดหรือเงียบ มันสร้างเสียงพูดผ่านโทเคน S3 แบบไม่ต่อเนื่องและตัวถอดรหัส flow-matching แบบสตรีมมิ่ง แทนที่จะเป็นขั้นตอนการสังเคราะห์แยกต่างหาก และสามารถส่งคืนข้อความพร้อมกับรูปคลื่นเสียงได้
นั่นไม่ใช่ความแตกต่างด้านฟีเจอร์ มันคือความแตกต่างระหว่างองค์ประกอบหนึ่งกับระบบหนึ่ง ลองวางสองสิ่งนี้เคียงข้างกัน แล้วสิ่งหนึ่งสามารถนำไปเสียบเข้ากับไปป์ไลน์ที่มีตัวรู้จำเสียงและโมเดลภาษาตั้งอยู่ด้านหน้าแล้วได้ ส่วนอีกสิ่งหนึ่งแทนที่ทั้งสามอย่าง
ตัวอย่างที่ลงรายละเอียดทำให้เห็นภาพชัดเจน
ลองนึกถึงสายสนับสนุนสักสาย ลูกค้าโทรเข้ามา อธิบายปัญหาอย่างไม่ชัดเจน หยุดกลางประโยคเพื่อหาหมายเลขบัญชี ถูกประกาศเบื้องหลังขัดจังหวะ แล้วถามคำถามต่อก่อนที่เจ้าหน้าที่จะตอบเสร็จ
ระบบที่สร้างบน Qwen-Audio-3.0-TTS จัดการเรื่องนี้เป็นผู้ขายสามรายและบิลสามใบ: ตัวรู้จำเสียงเปลี่ยนคำพูดของผู้โทรเป็นข้อความ โมเดลภาษาตัดสินใจว่าจะพูดอะไร และ Qwen-Audio-3.0-TTS พูดสิ่งนั้นออกมา แต่ละช่วงที่ส่งต่อเพิ่มความหน่วง และแต่ละรอยต่อคือจุดที่ทำนองเสียงตายลง ความล้มเหลวสำคัญนั้นเป็นเชิงโครงสร้าง — ขา TTS ไม่สามารถได้ยินช่วงหยุดกลางประโยคที่มันกำลังพูดอยู่ ดังนั้นการพูดแทรก (barge-in) จึงต้องถูกจัดการโดยบางสิ่งด้านหน้ามัน
Realtime-Venus จัดการสายเดียวกันในฐานะโมเดลเดียว โดยไม่มีตัวตรวจจับกิจกรรมเสียงภายนอก ไม่มีการส่งต่อ ตัวเลขจาก Full-Duplex-Bench v1.5 ของมัน — การตอบสนองต่อการขัดจังหวะ 75% และอัตราการพูดต่อ 97% ภายใต้เสียงตอบรับ 88% ภายใต้คำพูดที่มุ่งไปยังผู้อื่น และ 86% ภายใต้เสียงพูดพื้นหลัง — เป็นเมตริกที่อธิบายสถานการณ์นี้ได้อย่างแม่นยำพอดี พวกมันยังเป็นข้อมูลที่รายงานเอง จากรายงานทางเทคนิคของโมเดลเอง โดยไม่มีการทำซ้ำจากภายนอก จงอ่านพวกมันในฐานะข้ออ้างเชิงการออกแบบ ไม่ใช่การวัด
คุณภาพเสียง: อันหนึ่งมี Elo ส่วนอีกอันไม่มีอะไรเลย
นี่คือส่วนที่ไม่สมดุลที่สุดของการเปรียบเทียบ และมันเอื้อประโยชน์ต่อ Alibaba อย่างมาก
• คะแนนอิสระ — Qwen-Audio-3.0-TTS-Plus อยู่ในอันดับสองบน Provider Voice Arena ของ Artificial Analysis ด้วยคะแนน Elo 1,259 จากตัวอย่าง 1,544 รายการ ณ วันที่ 18 กันยายน 2026 ตามหลัง Cartesia Sonic 3.6 ที่ 1,277 และนำหน้า Inworld Realtime TTS-2 ที่ 1,247 และ Speechify Simba 3.2 ที่ 1,241
• จุดเริ่มต้น — คอลัมน์ release ของอารีนาเองระบุโมเดลนี้เป็นรายการเดือนกันยายน 2026 ซึ่งเป็นเทียร์ตามที่ให้คะแนนอยู่ในปัจจุบัน ไม่ใช่วันเปิดตัว 20 กรกฎาคม 2026 ไม่ว่าจะขยับไปเมื่อใด มันก็ครองสองอันดับแรกมาตลอด
• Realtime-Venus — ไม่มีการส่งเข้า arena ไม่มีการประเมินเสียงโดยบุคคลที่สาม ไม่มีอะไรทั้งนั้น ตัวเลขเดียวที่เกี่ยวข้องกับเสียงของมันคือคะแนน VoiceBench AlpacaEval ที่รายงานด้วยตนเองเท่ากับ 4.81 ซึ่งรายงานระบุว่าตรงกับตัวเลขเปรียบเทียบที่ดีที่สุด
• นั่นหมายความว่า — ไม่มีใครนอกเหนือจากผู้เขียนได้ตัดสินว่า Realtime-Venus ฟังดูดีหรือไม่ นั่นไม่ใช่ข้อตำหนิต่อมัน แต่เป็นเพียงสิ่งที่ไม่ทราบ และสิ่งที่ไม่ทราบก็แตกต่างจากสิ่งที่ไม่ดี แต่ถ้าคุณภาพเสียงคือสิ่งที่ต้องส่งมอบ การซื้อโมเดลที่ได้คะแนน Elo ย่อมดีกว่าการรับโมเดลที่ไม่มีคะแนนด้วยความเชื่อใจ


ภาษา เสียง และการควบคุมการแสดงออก
โมเดลของ Alibaba ถูกสร้างมาเพื่อความหลากหลายของรูปแบบการส่งมอบ โดยมีเสียงให้เลือกมากกว่าหนึ่งพันเสียง ครอบคลุม 16 ภาษา รวมถึงพื้นที่ภาษาถิ่นจีน 20 แห่ง และเปิดให้ใช้แท็กอินไลน์ 86 แท็กสำหรับอารมณ์และการส่งเสียง ซึ่งเป็นพื้นผิวการควบคุมที่คุณเขียนลงในตัวข้อความเอง พร้อมด้วยคำสั่งการส่งเสียงแบบภาษาธรรมชาติ เอาต์พุตให้ความละเอียดสูงสุดถึง 48 kHz เพิ่มขึ้นจาก 24 kHz ในรุ่นก่อน และการสังเคราะห์ครั้งเดียวสามารถยาวได้ถึงสามนาที ระดับ Flash ตั้งเป้าที่ประมาณ 300 มิลลิวินาทีถึงแพ็กเก็ตแรกสำหรับการเล่นแบบเรียลไทม์ ส่วนระดับ Plus เป็นระดับคุณภาพและสร้างเสียงที่ราวสิบหกตัวอักษรต่อวินาที ซึ่งช้าพอที่จะมีผลในผลิตภัณฑ์แบบไลฟ์ และแทบไม่รู้สึกเลยในการเรนเดอร์แบบแบตช์
Realtime-Venus มีเอกสารเป็นภาษาอังกฤษและภาษาจีน จัดส่งเสียงอ้างอิงหนึ่งเสียงมาพร้อมกับน้ำหนักโมเดล และให้ตัวถอดรหัสจากโทเคนเป็นรูปคลื่นแก่คุณ แทนที่จะเป็นไลบรารีเสียง ความสามารถในการแสดงออกในความหมายแบบ Qwen — แท็ก คำสั่ง พรีเซ็ตนับพัน — ไม่มีสิ่งที่เทียบเท่าในที่นี้ สิ่งที่มันมีแทนก็คือความสามารถในการเปลี่ยนการถ่ายทอดเสียงเพื่อตอบสนองต่อสิ่งที่มันกำลังได้ยิน ซึ่งเป็นรูปแบบการควบคุมการแสดงออกที่แตกต่างออกไป และยากกว่ามากที่จะใส่ลงในสเปกชีต
ต้นทุนของแต่ละเส้นทาง พูดตามตรง
มีข้อควรระวังที่สำคัญจริง ๆ เกี่ยวกับตัวเลขของ Alibaba ก่อนที่ใครจะนำไปใช้ตั้งงบประมาณ ราคา 27.6 ดอลลาร์ต่อล้านตัวอักษรที่ถูกอ้างอิงกันอย่างแพร่หลายนั้นไม่ได้ตรงกับหน้าตาราคาของ Alibaba เองในทุกช่วงเวลาที่บันทึกไว้ และแต่ละระดับราคาก็คิดแยกจากกัน ควรตรวจสอบตัวเลขดังกล่าวในระดับบัญชีของคุณ แทนที่จะเชื่อตารางเปรียบเทียบ รวมถึงตารางนี้ด้วย
Realtime-Venus ไม่มีราคาตั้ง เพราะไม่มีอะไรให้ซื้อ ค่าใช้จ่ายคือเช็กพอยต์ขนาด 9B สองชุดใน BF16 — น้ำหนักประมาณสิบแปดกิกะไบต์ต่อชุดก่อนจะนับหน่วยความจำสำหรับ activation — บวกกับลูปสตรีมมิ่งแบบต่อเนื่อง ซึ่งหมายถึงโหนด GPU ที่เรียกเก็บเงินเป็นรายเดือนไม่ว่าจะมีใครเรียกใช้หรือไม่ ที่ปริมาณการใช้งานสม่ำเสมอ มันถูกกว่าต่อบทสนทนาเมื่อเทียบกับ voice API แบบคิดตามการใช้งาน ที่ปริมาณการใช้งานเป็นช่วง ๆ มันแย่กว่ามาก และจุดตัดคือคำถามทางการเงินเดียวที่สำคัญ
ยังมีเส้นทางที่สามที่หลายทีมจะลงเอยด้วย และมันคุ้มค่าที่จะเอ่ยชื่อเพราะมันเปลี่ยนรูปทรงของการตัดสินใจ ถ้าคุณยังใช้โครงสร้างแบบคาสเคด ขาเดียวที่จำเป็นต้องเป็นโมเดลแบบโฮสต์คือขากลาง — ขาการให้เหตุผล OrcaRouter ไม่ได้ให้บริการทั้ง Qwen-Audio-3.0-TTS และ Realtime-Venus เลเยอร์เสียงทั้งสองอยู่นอกเหนือจากสิ่งที่เราให้บริการ และเรายอมพูดตรง ๆ แบบนั้นมากกว่าจะปล่อยให้เข้าใจเป็นอย่างอื่น ขาการให้เหตุผลคือส่วนที่เราครอบคลุมจริง: โมเดลข้อความเกือบ 200 รุ่นภายใต้คีย์เดียว ในราคาตามที่ผู้ให้บริการประกาศไว้ โดยไม่บวกเพิ่มเลย การสลับไปใช้ระบบสำรองอัตโนมัติข้ามผู้ให้บริการต้นทาง เพื่อให้ช่วงบ่ายที่ผู้ให้บริการรายหนึ่งมีปัญห ไมทำให้สายที่กำลังสนทนาอยู่หลุด DSL สำหรับจัดเส้นทางที่ประกอบโมเดลหลายตัวเข้าเป็นการเรียกครั้งเดียว และการหลอมรวมโมเดล เมื่อการตัดสินใจหนึ่งครั้งควรค่าแก่ความเห็นมากกว่าหนึ่งเสียง ในโครงสร้างแบบคาสเคด นี่คือขาที่คุณอยากสลับได้มากที่สุดโดยไม่ต้องเจรจาสัญญา และเป็นขาที่ส่วนลดราคาจากผู้ขายมีผลในวันเดียวกัน แทนที่จะรอถึงรอบต่อสัญญา

การโคลนนิ่งเป็นดาบสองคม
Qwen-Audio-3.0-TTS สามารถโคลนเสียงจากตัวอย่างอ้างอิงสั้น ๆ ได้แบบข้ามภาษา และมีเอกสารระบุว่าทนทานต่ออินพุตที่มีเสียงรบกวนหรือก้อง นั่นคือความสามารถที่มีประโยชน์เชิงพาณิชย์มากที่สุดเพียงหนึ่งเดียวในการเปรียบเทียบ และเป็นขอบเขตการปฏิบัติตามข้อกำหนดที่ใหญ่ที่สุด ผลิตภัณฑ์ที่สามารถจำลองผู้พูดคนใดก็ได้จากเสียงสิบวินาที มีคำตอบที่ยาวกว่ามากสำหรับคำถามที่ว่า "เสียงนั้นเป็นของใคร และใครเป็นผู้ยินยอม" เมื่อเทียบกับผลิตภัณฑ์ที่พูดได้เฉพาะในพรีเซ็ตของผู้ขายเท่านั้น
Realtime-Venus มาพร้อมเสียงอ้างอิงควบคู่กับเวทของโมเดล คุณสามารถโคลนโดยใช้เสียงนั้นได้หากคุณมีไฟล์เสียงและการรันเทรน แต่ไม่มีส่วนใดในรีลีสนี้ที่ถูกออกแบบมาเพื่อทำให้เรื่องนั้นง่าย — ซึ่งสำหรับการติดตั้งแบบโฮสต์เองภายในขอบเขตด้านการปฏิบัติตามข้อกำหนดแล้ว อาจกล่าวได้ว่าเป็นค่าเริ่มต้นที่ปลอดภัยกว่า
คุณกำลังซื้ออันไหนจริงๆ
ซื้อ Qwen-Audio-3.0-TTS เมื่อผลลัพธ์คือเสียง การบรรยาย การโลคัลไลเซชัน การช่วยการเข้าถึง การพากย์เสียง เวิร์กโฟลว์ใดก็ตามที่ข้อความมีอยู่ก่อนเสียง และตัวชี้วัดคือคุณภาพต่อชั่วโมงที่เรนเดอร์ เริ่มต้นที่ Flash หากเพลย์แบ็กเป็นแบบสด ย้ายไป Plus เมื่อเสียงเองคือผลิตภัณฑ์ และกำหนดราคาเวิร์กโฟลว์การโคลนแยกต่างหากจากไลบรารีพรีเซ็ต
เลือกใช้ Realtime-Venus เมื่ออินพุตเป็นบุคคลและระบบต้องทำตัวเหมือนผู้ฟัง การช่วยเหลือที่รับรู้กล้อง การโต้ตอบแบบไม่ใช้มือ อะไรก็ตามที่มนุษย์จะพูดขัดกลางประโยคและคาดหวังให้ระบบจัดการได้ ข้อแลกเปลี่ยนนั้นชัดเจน: คุณต้องสละเสียงที่ได้รับการจัดอันดับ Elo พรีเซ็ตนับพัน และตัวเลือกแบบโฮสต์ใด ๆ และแลกมาด้วยตัวเดียวในสองตัวนั้นที่สามารถได้ยินคุณ
ผลิตภัณฑ์ส่วนใหญ่ต้องการทั้งสองแบบ แต่ในตำแหน่งที่แตกต่างกัน สิ่งที่พวกมันไม่ควรใช้ร่วมกันคือโมเดลต้นทุน — ราคาต่อชั่วโมงเสียงเป็นตัวชี้วัดที่ถูกต้องสำหรับโมเดลเพียงหนึ่งในสองแบบนี้เท่านั้น และไม่ใช่แบบที่กำลังสนทนาอยู่
