การ์ดชื่อเรื่องหลักสำหรับ 'Realtime-Venus vs Qwen-Audio-3.0-TTS' พร้อมคำโปรยใต้ชื่อ 'ตัวเรนเดอร์กับตัวรับฟังไม่ใช่การซื้อแบบเดียวกัน' โดยมีการ์ดสามใบที่อ่านว่า 'Qwen-Audio-3.0-TTS-Plus: Elo 1,259 เป็นอันดับสองใน Artificial Analysis Provider Voice Arena', 'Realtime-Venus: ไม่มีคะแนนคุณภาพเสียงอยู่เลยแม้แต่รายการเดียว' และ 'อินพุตคือความต่างทั้งหมด: ข้อความล้วน เทียบกับเสียง วิดีโอ และข้อความ' เหนือแถบส่วนท้ายที่อ่านว่า 'ตัวเลขของ Qwen อ้างอิงตาม Artificial Analysis; ตัวเลขของ Realtime-Venus มาจากรายงานทางเทคนิคของตัวเอง ซึ่งยังไม่มีการทำซ้ำ' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Realtime-Venus vs Qwen-Audio-3.0-TTS: ตัวหนึ่งอ่านสคริปต์ของคุณ อีกตัวต้องได้ยินคุณ

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การเปรียบเทียบที่ชวนใจให้ทำระหว่าง Realtime-Venus กับ Qwen-Audio-3.0-TTS คือราคาต่อชั่วโมงของเสียง และมันให้คำตอบที่ดูสะอาดหมดจดซึ่งผิดทั้งหมด Qwen-Audio-3.0-TTS-Plus สังเคราะห์เสียงพูดในราคาประมาณ $27.6 ต่อล้านตัวอักษร ซึ่งคิดออกมาได้ใกล้เคียง $1.66 สำหรับเสียงที่เสร็จแล้วหนึ่งชั่วโมง Realtime-Venus ระบบ full-duplex ขนาด 9B ที่ทีม Venus ของ Ant Group สร้างร่วมกับ Tsinghua University ไม่มีราคาเลยเพราะไม่มีบริการโฮสต์ — แต่หากโฮสต์เอง คุณจะต้องเสียค่า GPU node ที่ทำงานตลอดเวลา ซึ่งอย่างน้อยก็มากกว่าหนึ่งอันดับขนาดต่อชั่วโมง ตัวสังเคราะห์เสียงชนะในแง่เลขคณิต เลขคณิตนั้นกำลังวัดผลิตภัณฑ์สองอย่างที่แตกต่างกัน: Qwen-Audio-3.0-TTS รับข้อความและส่งคืนเสียง ส่วน Realtime-Venus รับเสียงและวิดีโอแล้วส่งคืนบทสนทนา คำถามที่แยกพวกมันออกจากกันจริง ๆ ไม่ใช่สิ่งที่พวกมันส่งออกมา แต่คือว่ามีอะไรต้องพูดตอบกลับหรือไม่

อินพุตคือความแตกต่างทั้งหมด

Qwen-Audio-3.0-TTS ซึ่งเปิดตัวโดย Tongyi Lab ของ Alibaba Cloud เมื่อวันที่ 20 กรกฎาคม 2026 เป็นโมเดลแปลงข้อความเป็นเสียงที่เปิดให้ใช้งานผ่าน API แบบโฮสต์โดยไม่มีเวตแบบเปิด ข้อความถูกส่งเข้าผ่านเอนด์พอยต์ HTTP และเสียงถูกส่งออกมา ไม่มีเส้นทางอินพุตเสียง ไม่มีเทิร์นให้ผลัดกันพูด ไม่มีทรานสคริปต์ให้ส่งคืน และไม่มีแนวคิดเรื่องการถูกขัดจังหวะ — โมเดลนี้ไม่เคยได้ยินอะไรเลย โครงสร้างต้นทุนทั้งหมดของมันคือแท่นพิมพ์: ตัวอักษรเข้า เสียงออก

ในทางตรงกันข้าม Realtime-Venus ฟังอยู่ตลอดเวลา เช็กพอยต์แบบเสียงและภาพมีตัวเข้ารหัสภาพ SigLIP2 สำหรับเฟรมแบบสตรีมมิ่ง และตัวเข้ารหัสเสียง Whisper-Medium ที่ป้อนเข้าสู่แบ็กโบน Qwen3-8B โดยเช็กพอยต์ทั้งสองรันลูปการโต้ตอบความยาวหนึ่งวินาทีซึ่งอัปเดตสถานะการสนทนาอย่างต่อเนื่องและตัดสินใจว่าจะพูดหรือเงียบ มันสร้างเสียงพูดผ่านโทเคน S3 แบบไม่ต่อเนื่องและตัวถอดรหัส flow-matching แบบสตรีมมิ่ง แทนที่จะเป็นขั้นตอนการสังเคราะห์แยกต่างหาก และสามารถส่งคืนข้อความพร้อมกับรูปคลื่นเสียงได้

นั่นไม่ใช่ความแตกต่างด้านฟีเจอร์ มันคือความแตกต่างระหว่างองค์ประกอบหนึ่งกับระบบหนึ่ง ลองวางสองสิ่งนี้เคียงข้างกัน แล้วสิ่งหนึ่งสามารถนำไปเสียบเข้ากับไปป์ไลน์ที่มีตัวรู้จำเสียงและโมเดลภาษาตั้งอยู่ด้านหน้าแล้วได้ ส่วนอีกสิ่งหนึ่งแทนที่ทั้งสามอย่าง

ตัวอย่างที่ลงรายละเอียดทำให้เห็นภาพชัดเจน

ลองนึกถึงสายสนับสนุนสักสาย ลูกค้าโทรเข้ามา อธิบายปัญหาอย่างไม่ชัดเจน หยุดกลางประโยคเพื่อหาหมายเลขบัญชี ถูกประกาศเบื้องหลังขัดจังหวะ แล้วถามคำถามต่อก่อนที่เจ้าหน้าที่จะตอบเสร็จ

ระบบที่สร้างบน Qwen-Audio-3.0-TTS จัดการเรื่องนี้เป็นผู้ขายสามรายและบิลสามใบ: ตัวรู้จำเสียงเปลี่ยนคำพูดของผู้โทรเป็นข้อความ โมเดลภาษาตัดสินใจว่าจะพูดอะไร และ Qwen-Audio-3.0-TTS พูดสิ่งนั้นออกมา แต่ละช่วงที่ส่งต่อเพิ่มความหน่วง และแต่ละรอยต่อคือจุดที่ทำนองเสียงตายลง ความล้มเหลวสำคัญนั้นเป็นเชิงโครงสร้าง — ขา TTS ไม่สามารถได้ยินช่วงหยุดกลางประโยคที่มันกำลังพูดอยู่ ดังนั้นการพูดแทรก (barge-in) จึงต้องถูกจัดการโดยบางสิ่งด้านหน้ามัน

Realtime-Venus จัดการสายเดียวกันในฐานะโมเดลเดียว โดยไม่มีตัวตรวจจับกิจกรรมเสียงภายนอก ไม่มีการส่งต่อ ตัวเลขจาก Full-Duplex-Bench v1.5 ของมัน — การตอบสนองต่อการขัดจังหวะ 75% และอัตราการพูดต่อ 97% ภายใต้เสียงตอบรับ 88% ภายใต้คำพูดที่มุ่งไปยังผู้อื่น และ 86% ภายใต้เสียงพูดพื้นหลัง — เป็นเมตริกที่อธิบายสถานการณ์นี้ได้อย่างแม่นยำพอดี พวกมันยังเป็นข้อมูลที่รายงานเอง จากรายงานทางเทคนิคของโมเดลเอง โดยไม่มีการทำซ้ำจากภายนอก จงอ่านพวกมันในฐานะข้ออ้างเชิงการออกแบบ ไม่ใช่การวัด

คุณภาพเสียง: อันหนึ่งมี Elo ส่วนอีกอันไม่มีอะไรเลย

นี่คือส่วนที่ไม่สมดุลที่สุดของการเปรียบเทียบ และมันเอื้อประโยชน์ต่อ Alibaba อย่างมาก

• คะแนนอิสระ — Qwen-Audio-3.0-TTS-Plus อยู่ในอันดับสองบน Provider Voice Arena ของ Artificial Analysis ด้วยคะแนน Elo 1,259 จากตัวอย่าง 1,544 รายการ ณ วันที่ 18 กันยายน 2026 ตามหลัง Cartesia Sonic 3.6 ที่ 1,277 และนำหน้า Inworld Realtime TTS-2 ที่ 1,247 และ Speechify Simba 3.2 ที่ 1,241

• จุดเริ่มต้น — คอลัมน์ release ของอารีนาเองระบุโมเดลนี้เป็นรายการเดือนกันยายน 2026 ซึ่งเป็นเทียร์ตามที่ให้คะแนนอยู่ในปัจจุบัน ไม่ใช่วันเปิดตัว 20 กรกฎาคม 2026 ไม่ว่าจะขยับไปเมื่อใด มันก็ครองสองอันดับแรกมาตลอด

• Realtime-Venus — ไม่มีการส่งเข้า arena ไม่มีการประเมินเสียงโดยบุคคลที่สาม ไม่มีอะไรทั้งนั้น ตัวเลขเดียวที่เกี่ยวข้องกับเสียงของมันคือคะแนน VoiceBench AlpacaEval ที่รายงานด้วยตนเองเท่ากับ 4.81 ซึ่งรายงานระบุว่าตรงกับตัวเลขเปรียบเทียบที่ดีที่สุด

• นั่นหมายความว่า — ไม่มีใครนอกเหนือจากผู้เขียนได้ตัดสินว่า Realtime-Venus ฟังดูดีหรือไม่ นั่นไม่ใช่ข้อตำหนิต่อมัน แต่เป็นเพียงสิ่งที่ไม่ทราบ และสิ่งที่ไม่ทราบก็แตกต่างจากสิ่งที่ไม่ดี แต่ถ้าคุณภาพเสียงคือสิ่งที่ต้องส่งมอบ การซื้อโมเดลที่ได้คะแนน Elo ย่อมดีกว่าการรับโมเดลที่ไม่มีคะแนนด้วยความเชื่อใจ

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured 18 September 2026, showing the ranked table: Cartesia Sonic 3.6 first at Elo 1,277 with 1,810 samples, released August 2026 at $49.0 per million characters; Alibaba's Qwen-Audio-3.0-TTS-Plus second at Elo 1,259 with 1,544 samples and $27.6 per million characters; Inworld Realtime TTS-2 third at Elo 1,247; SpeechifyAI Simba 3.2 fourth at Elo 1,241; VUI Labs Luna TTS fifth at Elo 1,231; Inworld Realtime TTS-2 Flash sixth at Elo 1,216; StepFun StepAudio 2.5 TTS seventh at Elo 1,209; and BreezeBlue Breeze TTS 2 eighth at Elo 1,207 with an Open Weights badge.A two-column comparison scoreboard titled 'Realtime-Venus vs Qwen-Audio-3.0-TTS — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Job: full-duplex conversation', 'Input: audio, video and text', 'Output: text and speech', 'Independent voice score: none', 'Availability: Apache-2.0 weights, no API', 'Price: none published'. The right column, labelled Qwen-Audio-3.0-TTS, reads 'Job: text-to-speech rendering', 'Input: text only', 'Output: audio', 'Independent voice score: Elo 1,259, second of 20-plus', 'Availability: hosted API since 20 July 2026', 'Price: about $27.6 per 1M characters'. The footer reads 'Qwen figures per Artificial Analysis and Alibaba Cloud documentation; Realtime-Venus figures from its technical report, unreproduced.'

ภาษา เสียง และการควบคุมการแสดงออก

โมเดลของ Alibaba ถูกสร้างมาเพื่อความหลากหลายของรูปแบบการส่งมอบ โดยมีเสียงให้เลือกมากกว่าหนึ่งพันเสียง ครอบคลุม 16 ภาษา รวมถึงพื้นที่ภาษาถิ่นจีน 20 แห่ง และเปิดให้ใช้แท็กอินไลน์ 86 แท็กสำหรับอารมณ์และการส่งเสียง ซึ่งเป็นพื้นผิวการควบคุมที่คุณเขียนลงในตัวข้อความเอง พร้อมด้วยคำสั่งการส่งเสียงแบบภาษาธรรมชาติ เอาต์พุตให้ความละเอียดสูงสุดถึง 48 kHz เพิ่มขึ้นจาก 24 kHz ในรุ่นก่อน และการสังเคราะห์ครั้งเดียวสามารถยาวได้ถึงสามนาที ระดับ Flash ตั้งเป้าที่ประมาณ 300 มิลลิวินาทีถึงแพ็กเก็ตแรกสำหรับการเล่นแบบเรียลไทม์ ส่วนระดับ Plus เป็นระดับคุณภาพและสร้างเสียงที่ราวสิบหกตัวอักษรต่อวินาที ซึ่งช้าพอที่จะมีผลในผลิตภัณฑ์แบบไลฟ์ และแทบไม่รู้สึกเลยในการเรนเดอร์แบบแบตช์

Realtime-Venus มีเอกสารเป็นภาษาอังกฤษและภาษาจีน จัดส่งเสียงอ้างอิงหนึ่งเสียงมาพร้อมกับน้ำหนักโมเดล และให้ตัวถอดรหัสจากโทเคนเป็นรูปคลื่นแก่คุณ แทนที่จะเป็นไลบรารีเสียง ความสามารถในการแสดงออกในความหมายแบบ Qwen — แท็ก คำสั่ง พรีเซ็ตนับพัน — ไม่มีสิ่งที่เทียบเท่าในที่นี้ สิ่งที่มันมีแทนก็คือความสามารถในการเปลี่ยนการถ่ายทอดเสียงเพื่อตอบสนองต่อสิ่งที่มันกำลังได้ยิน ซึ่งเป็นรูปแบบการควบคุมการแสดงออกที่แตกต่างออกไป และยากกว่ามากที่จะใส่ลงในสเปกชีต

ต้นทุนของแต่ละเส้นทาง พูดตามตรง

มีข้อควรระวังที่สำคัญจริง ๆ เกี่ยวกับตัวเลขของ Alibaba ก่อนที่ใครจะนำไปใช้ตั้งงบประมาณ ราคา 27.6 ดอลลาร์ต่อล้านตัวอักษรที่ถูกอ้างอิงกันอย่างแพร่หลายนั้นไม่ได้ตรงกับหน้าตาราคาของ Alibaba เองในทุกช่วงเวลาที่บันทึกไว้ และแต่ละระดับราคาก็คิดแยกจากกัน ควรตรวจสอบตัวเลขดังกล่าวในระดับบัญชีของคุณ แทนที่จะเชื่อตารางเปรียบเทียบ รวมถึงตารางนี้ด้วย

Realtime-Venus ไม่มีราคาตั้ง เพราะไม่มีอะไรให้ซื้อ ค่าใช้จ่ายคือเช็กพอยต์ขนาด 9B สองชุดใน BF16 — น้ำหนักประมาณสิบแปดกิกะไบต์ต่อชุดก่อนจะนับหน่วยความจำสำหรับ activation — บวกกับลูปสตรีมมิ่งแบบต่อเนื่อง ซึ่งหมายถึงโหนด GPU ที่เรียกเก็บเงินเป็นรายเดือนไม่ว่าจะมีใครเรียกใช้หรือไม่ ที่ปริมาณการใช้งานสม่ำเสมอ มันถูกกว่าต่อบทสนทนาเมื่อเทียบกับ voice API แบบคิดตามการใช้งาน ที่ปริมาณการใช้งานเป็นช่วง ๆ มันแย่กว่ามาก และจุดตัดคือคำถามทางการเงินเดียวที่สำคัญ

ยังมีเส้นทางที่สามที่หลายทีมจะลงเอยด้วย และมันคุ้มค่าที่จะเอ่ยชื่อเพราะมันเปลี่ยนรูปทรงของการตัดสินใจ ถ้าคุณยังใช้โครงสร้างแบบคาสเคด ขาเดียวที่จำเป็นต้องเป็นโมเดลแบบโฮสต์คือขากลาง — ขาการให้เหตุผล OrcaRouter ไม่ได้ให้บริการทั้ง Qwen-Audio-3.0-TTS และ Realtime-Venus เลเยอร์เสียงทั้งสองอยู่นอกเหนือจากสิ่งที่เราให้บริการ และเรายอมพูดตรง ๆ แบบนั้นมากกว่าจะปล่อยให้เข้าใจเป็นอย่างอื่น ขาการให้เหตุผลคือส่วนที่เราครอบคลุมจริง: โมเดลข้อความเกือบ 200 รุ่นภายใต้คีย์เดียว ในราคาตามที่ผู้ให้บริการประกาศไว้ โดยไม่บวกเพิ่มเลย การสลับไปใช้ระบบสำรองอัตโนมัติข้ามผู้ให้บริการต้นทาง เพื่อให้ช่วงบ่ายที่ผู้ให้บริการรายหนึ่งมีปัญห ไมทำให้สายที่กำลังสนทนาอยู่หลุด DSL สำหรับจัดเส้นทางที่ประกอบโมเดลหลายตัวเข้าเป็นการเรียกครั้งเดียว และการหลอมรวมโมเดล เมื่อการตัดสินใจหนึ่งครั้งควรค่าแก่ความเห็นมากกว่าหนึ่งเสียง ในโครงสร้างแบบคาสเคด นี่คือขาที่คุณอยากสลับได้มากที่สุดโดยไม่ต้องเจรจาสัญญา และเป็นขาที่ส่วนลดราคาจากผู้ขายมีผลในวันเดียวกัน แทนที่จะรอถึงรอบต่อสัญญา

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge alongside the Any-to-Any, Safetensors, audio, video, streaming and full-duplex tags, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

การโคลนนิ่งเป็นดาบสองคม

Qwen-Audio-3.0-TTS สามารถโคลนเสียงจากตัวอย่างอ้างอิงสั้น ๆ ได้แบบข้ามภาษา และมีเอกสารระบุว่าทนทานต่ออินพุตที่มีเสียงรบกวนหรือก้อง นั่นคือความสามารถที่มีประโยชน์เชิงพาณิชย์มากที่สุดเพียงหนึ่งเดียวในการเปรียบเทียบ และเป็นขอบเขตการปฏิบัติตามข้อกำหนดที่ใหญ่ที่สุด ผลิตภัณฑ์ที่สามารถจำลองผู้พูดคนใดก็ได้จากเสียงสิบวินาที มีคำตอบที่ยาวกว่ามากสำหรับคำถามที่ว่า "เสียงนั้นเป็นของใคร และใครเป็นผู้ยินยอม" เมื่อเทียบกับผลิตภัณฑ์ที่พูดได้เฉพาะในพรีเซ็ตของผู้ขายเท่านั้น

Realtime-Venus มาพร้อมเสียงอ้างอิงควบคู่กับเวทของโมเดล คุณสามารถโคลนโดยใช้เสียงนั้นได้หากคุณมีไฟล์เสียงและการรันเทรน แต่ไม่มีส่วนใดในรีลีสนี้ที่ถูกออกแบบมาเพื่อทำให้เรื่องนั้นง่าย — ซึ่งสำหรับการติดตั้งแบบโฮสต์เองภายในขอบเขตด้านการปฏิบัติตามข้อกำหนดแล้ว อาจกล่าวได้ว่าเป็นค่าเริ่มต้นที่ปลอดภัยกว่า

คุณกำลังซื้ออันไหนจริงๆ

ซื้อ Qwen-Audio-3.0-TTS เมื่อผลลัพธ์คือเสียง การบรรยาย การโลคัลไลเซชัน การช่วยการเข้าถึง การพากย์เสียง เวิร์กโฟลว์ใดก็ตามที่ข้อความมีอยู่ก่อนเสียง และตัวชี้วัดคือคุณภาพต่อชั่วโมงที่เรนเดอร์ เริ่มต้นที่ Flash หากเพลย์แบ็กเป็นแบบสด ย้ายไป Plus เมื่อเสียงเองคือผลิตภัณฑ์ และกำหนดราคาเวิร์กโฟลว์การโคลนแยกต่างหากจากไลบรารีพรีเซ็ต

เลือกใช้ Realtime-Venus เมื่ออินพุตเป็นบุคคลและระบบต้องทำตัวเหมือนผู้ฟัง การช่วยเหลือที่รับรู้กล้อง การโต้ตอบแบบไม่ใช้มือ อะไรก็ตามที่มนุษย์จะพูดขัดกลางประโยคและคาดหวังให้ระบบจัดการได้ ข้อแลกเปลี่ยนนั้นชัดเจน: คุณต้องสละเสียงที่ได้รับการจัดอันดับ Elo พรีเซ็ตนับพัน และตัวเลือกแบบโฮสต์ใด ๆ และแลกมาด้วยตัวเดียวในสองตัวนั้นที่สามารถได้ยินคุณ

ผลิตภัณฑ์ส่วนใหญ่ต้องการทั้งสองแบบ แต่ในตำแหน่งที่แตกต่างกัน สิ่งที่พวกมันไม่ควรใช้ร่วมกันคือโมเดลต้นทุน — ราคาต่อชั่วโมงเสียงเป็นตัวชี้วัดที่ถูกต้องสำหรับโมเดลเพียงหนึ่งในสองแบบนี้เท่านั้น และไม่ใช่แบบที่กำลังสนทนาอยู่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube