การ์ดชื่อเรื่องหลักสำหรับ 'GPT-Live-1 vs Qwen-Audio-3.0-TTS' พร้อมคำโปรยใต้ชื่อว่า 'ตัวหนึ่งสนทนาโต้ตอบได้ ตัวหนึ่งอ่านสคริปต์' พร้อมป้ายที่เขียนว่า 'ไม่ใช่ตัวแทนกันได้ - คนละงาน คนละบิล' และการ์ดสามใบ: 'Qwen-Audio-3.0-TTS Plus — Elo 1,232 อยู่อันดับสี่บน AA Provider Voice Arena ราคา $27.6 ต่อ 1 ล้านตัวอักษร', 'GPT-Live-1 — $0.05 ต่อนาทีเสียง สื่อสารสองทางพร้อมกัน $3.00 ต่อชั่วโมงของสายที่เปิดค้างไว้' และ 'ข้อแม้ — ประมาณ 16 ตัวอักษรต่อวินาทีในฝั่งผู้บรรยาย ข้อความเข้า เสียงออก' เหนือแถบส่วนท้ายที่เขียนว่า 'ตัวเลขของ Qwen อ้างอิงจาก Artificial Analysis; ตัวเลขของ GPT-Live-1 เป็นข้อมูลที่ OpenAI รายงานเอง' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

GPT-Live-1 กับ Qwen-Audio-3.0-TTS: การสนทนาและผู้บรรยายไม่ใช่รายการเดียวกัน

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด
A two-column scoreboard titled 'GPT-Live-1 vs Qwen-Audio-3.0-TTS - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Input: audio and text', 'Price: $0.05 per voice minute', 'Interruption handling: native', 'Voices: 12, no cloning', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Qwen-Audio-3.0-TTS: 'Job: text-to-speech rendering', 'Input: text only', 'Price: $27.6 per 1M characters, about $1.66 per hour of audio', 'Interruption handling: not applicable, it never hears', 'Voices: 16 languages, cloning from short samples', 'Independent score: Elo 1,232, fourth on the AA Provider Voice Arena'. Footer: 'Qwen pricing and Elo per Artificial Analysis; GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced.'

วาง GPT-Live-1 กับ Qwen-Audio-3.0-TTS เทียบกันในแง่ราคาต่อชั่วโมงของเสียง แล้วความต่างก็ดูจะชี้ขาด: Qwen-Audio-3.0-TTS-Plus ของ Alibaba สร้างเสียงพูดที่ราคา $27.6 ต่อล้านตัวอักษร หรือคิดเป็นเสียงประมาณ $1.66 ต่อชั่วโมง ขณะที่ GPT-Live-1 ของ OpenAI คิดค่าบริการ $3.00 สำหรับหนึ่งชั่วโมงของการเปิดสายต่อเนื่อง ผู้บรรยายถูกกว่า ผู้บรรยายจึงชนะ — ยกเว้นว่านี่คือการเปรียบเทียบที่ผิด และเหตุผลที่มันผิดก็คือสิ่งที่มีประโยชน์ที่สุดที่ใคร ๆ ก็ได้จากการเทียบกันครั้งนี้ Qwen-Audio-3.0-TTS เป็นโมเดลแปลงข้อความเป็นเสียง GPT-Live-1 เป็นโมเดลสนทนาแบบฟูลดูเพล็กซ์ ตัวหนึ่งอ่านสิ่งที่คุณเขียน อีกตัวต้องตัดสินใจ หลายครั้งต่อวินาที ว่าคุณพูดจบหรือยัง

อันหนึ่งเรนเดอร์ อีกอันหนึ่งสนทนา

การแปลงข้อความเป็นเสียงรับข้อความเข้าและส่งเสียงออก ไม่มีเสียงอินพุต ไม่มีรอบสนทนาให้ต้องผลัดกันพูด ไม่มีแนวคิดเรื่องการถูกขัดจังหวะ และไม่มีข้อความถอดเสียงให้ส่งกลับ เพราะโมเดลไม่เคยได้ยินอะไรเลย โมเดลต้นทุนของมันคือแท่นพิมพ์: หน้าเข้า เสียงออก คุณภาพและปริมาณงานคือตัวเลขเพียงสองตัวที่สำคัญ และคุณวัดทั้งสองอย่างได้ก่อนปล่อยผลิตภัณฑ์

โมเดลสนทนาแบบฟูลดูเพล็กซ์จะประมวลผลเสียงที่เข้ามาในขณะเดียวกันกับที่กำลังสร้างเสียงออกไป หน้าที่ของมันครอบคลุมส่วนต่างๆ ของการสนทนาที่ไม่เกี่ยวกับถ้อยคำเลย เช่น การหยุดชั่วคราวเมื่อผู้ใช้หยุด การพูดต่อผ่านเสียงตอบรับอย่าง "อือ" แทนที่จะตีความว่าเป็นการขัดจังหวะ การยอมสละสิทธิ์การพูดกลางประโยค และการเรียกใช้เครื่องมือโดยไม่ทำให้บทสนทนาขาดตอน GPT-Live-1 ทำได้ทั้งหมดนั้น และยังส่งบทถอดเสียงจากการรู้จำเสียงพูดกลับมาพร้อมกับเซสชันด้วย ซึ่งมันทำได้ก็เพราะมันฟังอยู่ตลอดเวลา

หากผลิตภัณฑ์ของคุณอ่านบทความออกเสียง แปลงเอกสารเป็นเสียง หรือบรรยายวิดีโอ GPT-Live-1 เป็นเครื่องมือที่ไม่เหมาะสม เมื่อราคาต่อชั่วโมงสูงกว่าถึงสี่เท่า หากผลิตภัณฑ์ของคุณรับสายโทรศัพท์ Qwen-Audio-3.0-TTS เป็นเพียงหนึ่งในสามของไปป์ไลน์ที่ยังต้องใช้โมเดล ASR และโมเดลภาษาเพื่อกลายเป็นการสนทนา

ในกรณีที่ Qwen-Audio-3.0-TTS เป็นคำตอบที่ดีที่สุดอย่างแท้จริง

เหตุผลที่โมเดลของ Alibaba น่าสนใจไม่ใช่เรื่องการตลาด เปิดตัวเมื่อวันที่ 20 กรกฎาคม 2026 โดย Tongyi Lab ของ Alibaba และเปิดให้ใช้งานเป็น API แบบปิดที่โฮสต์ผ่าน Alibaba Cloud Model Studio รุ่น Plus ขึ้นอันดับหนึ่งบน text-to-speech arena ของ Artificial Analysis เมื่อเปิดตัว อย่างไรก็ตาม ลีดเดอร์บอร์ดเป็นเป้าหมายที่เคลื่อนไหว และอันนี้ก็ขยับแล้ว: ณ กันยายน 2026 Qwen-Audio-3.0-TTS-Plus อยู่อันดับสี่บน Provider Voice Arena ด้วยคะแนน Elo 1,232 จาก 2,306 ตัวอย่าง ตามหลัง Cartesia Sonic 3.6 ที่ 1,275, Inworld Realtime TTS-2 ที่ 1,244 และ Simba 3.2 ของ Speechify ที่ 1,233 — สามโมเดลจากเดือนสิงหาคมและกรกฎาคมที่เปิดตัวหลังจากนั้น การอยู่อันดับสี่จากมากกว่ายี่สิบโมเดล แม้เสียตำแหน่งผู้นำไปแล้วแต่ยังคงได้เปรียบด้านราคา ยังถือเป็นตำแหน่งที่แข็งแกร่ง เพียงแต่ไม่ใช่ตำแหน่งที่สื่อตอนเปิดตัวบรรยายไว้

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured September 2026, showing the top four: Cartesia Sonic 3.6 first at Elo 1,275 and $49.0 per million characters, Inworld Realtime TTS-2 second at 1,244, SpeechifyAI Simba 3.2 third at 1,233, and Alibaba's Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,232 with a confidence interval of -14/14, 2,306 samples, a July 2026 release and $27.6 per million characters.

ครองความเป็นผู้นำใน 10 จาก 16 ภาษาที่รองรับ เพิ่มภูมิภาคภาษาถิ่นจีน 20 แห่ง รองรับการโคลนเสียงจากตัวอย่างสั้น รวมถึงการโคลนข้ามภาษา และมีแท็กอารมณ์และการออกเสียงแบบอินไลน์ถึง 86 แท็ก

ข้อแม้เหล่านี้เจาะจงมากพอที่จะวางแผนรับมือได้

• อัตราความเร็วในการประมวลผล (Throughput) — Plus สร้างข้อความได้ประมาณ 16 ตัวอักษรต่อวินาที เทียบกับ 30.2 สำหรับ Simba 3.2, 27 สำหรับ Gemini 3.1 Flash TTS และประมาณ 120 สำหรับ Sonic 3.5 สำหรับการเรนเดอร์แบบเป็นชุด ตัวเลขนี้แทบไม่มีความหมาย แต่สำหรับผลิตภัณฑ์ที่ใช้งานแบบเรียลไทม์ นี่คือตัวเลขที่กำหนดขนาดบัฟเฟอร์ของคุณ

• เอกสารราคา — ตัวเลข 27.6 ดอลลาร์ต่อล้านอักขระที่ถูกอ้างอิงกันอย่างแพร่หลายนั้น ไม่ตรงกับหน้าตาราคาของ Alibaba เองในทุก snapshot ซึ่ง ณ บางช่วงเวลาก็ระบุตัวเลขที่ต่ำกว่าสำหรับทั้งสองระดับ ดังนั้นก่อนจะคาดการณ์ ให้ตรวจสอบตัวเลขปัจจุบันในระดับบัญชีของคุณเอง ไม่ใช่ตัวเลขจาก leaderboard

• คลังเสียง — แม้จะรองรับ 16 ภาษา แต่เสียงพรีเซ็ตสาธารณะเกือบทั้งหมดเป็นภาษาจีนและอังกฤษ ส่วนอีกสิบสี่ภาษาที่เหลือจะใช้งานได้ผ่านขั้นตอนการโคลนเสียงเท่านั้น ไม่ได้มีแบบสำเร็จรูป

• การจำกัดฟีเจอร์ — แท็กอารมณ์แบบอินไลน์ 86 แท็กทำงานได้เฉพาะในโหมดสตรีมมิ่งทิศทางเดียวเท่านั้น ดังนั้นการควบคุมการแสดงออกจึงไม่คงอยู่ในทุกเส้นทางการผสานรวม

• ระดับ — Flash ตั้งเป้าความหน่วงของแพ็กเก็ตแรกไว้ที่ประมาณ 300 ms สำหรับการใช้งานแบบเรียลไทม์ ส่วน Plus เป็นระดับที่เน้นคุณภาพ ทั้งสองเป็นผลิตภัณฑ์ที่แตกต่างกันแต่ใช้ชื่อเดียวกัน และการเลือกผิดอันเป็นความผิดพลาดแรกที่พบบ่อย

ฉบับที่ตรงไปตรงมาของร่างกฎหมายแคสเคด

นี่คือสิ่งที่การเปรียบเทียบรายชั่วโมงละไว้ ผลิตภัณฑ์สนทนาที่สร้างบนโมเดล TTS เป็นระบบแบบแคสเคด: โมเดล ASR เปลี่ยนเสียงพูดของผู้โทรเป็นข้อความ โมเดลภาษาตัดสินใจว่าจะพูดอะไร และโมเดล TTS พูดข้อความนั้นออกมา สามผู้ขาย สามบิล สามงบความหน่วงที่บวกรวมกัน และการส่งต่อในแต่ละรอยต่อที่ทำนองเสียงตายไป ส่วน TTS อาจมีค่าใช้จ่าย $1.66 ต่อชั่วโมงเสียง อีกสองส่วนที่เหลือคือที่ที่เงินและความผิดพลาดอยู่จริง ๆ — และโมเดลแบบแคสเคดไม่สามารถได้ยินช่วงหยุดกลางประโยคที่มันกำลังพูดอยู่

GPT-Live-1 รวมสามส่วนเข้าเป็นเซสชันเดียวและมิเตอร์เดียว ในราคา $0.05 ต่อนาทีของเสียง โดยคิดค่าแบ็กเอนด์การให้เหตุผลแยกต่างหาก รายละเอียดสองข้อทำให้บิลนั้นเที่ยงตรง การเริ่มต้นเซสชันคิดค่าเสียง 15 วินาทีล่วงหน้า โดยถือเป็นเครดิตหักลบกับระยะเวลาที่ใช้ในภายหลัง ไม่ใช่บวกเพิ่มเข้าไปในระยะเวลานั้น และแบ็กเอนด์เป็นมิเตอร์ตัวที่สอง: ทุกการเรียกใช้การให้เหตุผลที่มอบหมาย ทุกการเรียกใช้เครื่องมือ และการค้นหาเว็บ จะคิดค่าตามอัตราปกติของโมเดลนั้น ดังนั้นการมอบหมายให้ไปที่ตัวให้เหตุผลระดับแนวหน้าที่ค้นหาทุกเทิร์นจึงสร้างการเรียกที่มีค่าใช้จ่ายสูงอยู่เบื้องหลังเลเยอร์เสียงราคาถูก

สิ่งที่บอร์ดจัดอันดับอิสระพูดถึงสองรุ่นนี้ให้แง่คิดอย่างยิ่ง เพราะพวกมันวัดคนละสิ่ง และไม่มีบอร์ดใดยกยอสิ่งที่ตนวัด Qwen-Audio-3.0-TTS-Plus อยู่อันดับสี่ด้านคุณภาพ และเกือบท้ายตารางด้านทรูพุต GPT-Live-1 อยู่อันดับเจ็ดจากสิบเอ็ดใน Speech to Speech Index ของ Artificial Analysis ที่ 69.8% — ตามหลัง GPT-Realtime-2.1 ที่มันเข้าไปแทนที่ ซึ่งอยู่ที่ 73.9% — ขณะที่ถูกคิดค่าบริการในระดับต่ำสุดของช่วงต้นทุนต่อชั่วโมงเสียงอินพุตของดัชนีนี้ คือ $4.42 เทียบกับ $10.75 ของ GPT-Realtime-2.1 ไม่มีโมเดลใดคว้าอันดับสูงสุดในหมวดของตัวเอง ทั้งคู่มีราคาถูกกว่าสิ่งที่มันถูกสร้างขึ้นมาเพื่อเอาชนะ

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with companion cost and speed charts showing GPT-Live-1 at $4.42 per hour of input audio and 0.78 seconds to first audio.

มิเตอร์ตัวที่สองคือจุดที่ชั้นการกำหนดเส้นทางกลายเป็นข้อตัดสินใจด้านการออกแบบ มากกว่าจะเป็นเพียงการปรับให้เหมาะที่สุด OrcaRouter ไม่ได้ให้บริการทั้ง GPT-Live-1 และ Qwen-Audio-3.0-TTS — ชั้นเสียงในทั้งสองกรณีอยู่นอกเหนือการเข้าถึงของเรา และเราไม่ได้กำหนดเส้นทางส่วนนี้เลย แต่ขา reasoning นั้นไม่ใช่ โมเดลราว 190 ตัวจากผู้ให้บริการต้นทางสิบเอ็ดราย ตั้งอยู่เบื้องหลังคีย์เดียว ในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม และเมื่อผู้ให้บริการลดราคา ก็มีผลในวันเดียวกัน แทนที่จะรอถึงการต่อสัญญาครั้งถัดไป สำหรับสถาปัตยกรรมแบบ cascade สิ่งนี้ครอบคลุมขากลางได้อย่างสมบูรณ์: เก็บตัวเลือก ASR สองตัวและโมเดล reasoning สามตัวไว้เบื้องหลัง endpoint เดียว ทดสอบ A/B กันด้วยทราฟฟิกจริง และปล่อยให้ automatic failover รองรับช่วงที่ต้นทางมีปัญหาบ่ายนั้นไว้โดยไม่ทำให้สายหลุด

การโคลนเสียงเป็นความสามารถที่สร้างประโยชน์เชิงพาณิชย์ได้มากที่สุดของ Qwen-Audio-3.0-TTS และเป็นจุดที่ต้องคำนึงถึงเรื่องการปฏิบัติตามกฎระเบียบมากที่สุดด้วย เสียงอ้างอิงเพียงสิบวินาทีก็เพียงพอที่จะจำลองเสียงผู้พูดได้ ข้ามภาษาได้ด้วย ซึ่งพลิกโฉมวงการโลคัลไลเซชันอย่างสิ้นเชิง และกลายเป็นความเสี่ยงในทุกที่ที่เรื่องอัตลักษณ์ตัวตนมีความสำคัญ OpenAI เปิดตัว GPT-Live-1 โดยไม่มีฟีเจอร์โคลนเสียงและไม่มีเสียงแบบกำหนดเองเลย — มีเสียงจาก API ให้เลือก 12 เสียง และมีเพียงเท่านั้น

ความไม่สมมาตรนั้นเป็นเรื่องง่ายที่จะมองข้ามในการเปรียบเทียบคุณสมบัติ และเป็นเรื่องยากที่จะมองข้ามในการทบทวนความเสี่ยง ผลิตภัณฑ์ที่พูดได้เพียงหนึ่งในสิบสองเสียงของผู้ให้บริการ มีคำตอบสำหรับ "นั่นคือเสียงของใคร และใครได้ให้ความยินยอมกับเสียงนั้น" ที่สั้นกว่ามากเมื่อเทียบกับผลิตภัณฑ์ที่สามารถจำลองเสียงใดก็ได้จากตัวอย่าง หากคุณต้องการการโคลนนิง การตัดสินใจเรื่องไปป์ไลน์ก็ถูกกำหนดไว้ให้คุณแล้ว และคำถามจะกลายเป็นว่าอะไรเป็นตัวกำกับมัน หากคุณไม่ต้องการ ข้อจำกัดของ GPT-Live-1 นั้นคุ้มค่าที่จะอ่านในฐานะกลไกควบคุมที่คุณไม่จำเป็นต้องสร้างเอง

ซื้ออันไหนดี

ซื้อ Qwen-Audio-3.0-TTS หากผลลัพธ์คือเนื้อหา: การบรรยาย, การแปลและปรับให้เข้ากับท้องถิ่น, เสียงเพื่อการเข้าถึง, การพากย์เสียง, หรือเวิร์กโฟลว์ใด ๆ ที่ข้อความมีอยู่ก่อนเสียง และคุณภาพต่อชั่วโมงที่เรนเดอร์เป็นตัวชี้วัด เริ่มต้นที่ Flash หากคุณต้องการเล่นแบบเรียลไทม์ ย้ายไปที่ Plus เมื่อเสียงเองคือสิ่งที่จะส่งมอบ และกำหนดราคาเวิร์กโฟลว์การโคลนเสียงแยกจากเสียงพรีเซ็ต

ซื้อ GPT-Live-1 หากอินพุตเป็นบุคคล รองรับสายซัพพอร์ต ขั้นตอนการจอง การสัมภาษณ์รับเข้า หรืออะไรก็ตามที่พยางค์แรกของผู้ใช้มาถึงขณะที่โมเดลกำลังพูดอยู่กลางประโยค และระบบต้องทำตัวเป็นผู้ฟังมากกว่าผู้พูด มันมีค่าใช้จ่ายต่อชั่วโมงเสียงสูงกว่า และเป็นตัวเดียวในสองตัวที่สามารถถูกขัดจังหวะได้

ทั้งสองเป็นส่วนเสริมกันบ่อยกว่าที่จะเป็นคู่แข่งกันมาก: ผลิตภัณฑ์จำนวนมากต้องการให้ Qwen-Audio-3.0-TTS อ่านเอกสาร และโมเดลดูเพล็กซ์จัดการสายที่ตามมา สิ่งที่พวกมันไม่ควรใช้ร่วมกันคือโมเดลต้นทุน การคิดต่อชั่วโมงเสียงเป็นตัวชี้วัดที่เหมาะสมสำหรับเพียงหนึ่งในสองสิ่งนี้เท่านั้น

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube