
GPT-Live-1 กับ Qwen-Audio-3.0-TTS: การสนทนาและผู้บรรยายไม่ใช่รายการเดียวกัน
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด

วาง GPT-Live-1 กับ Qwen-Audio-3.0-TTS เทียบกันในแง่ราคาต่อชั่วโมงของเสียง แล้วความต่างก็ดูจะชี้ขาด: Qwen-Audio-3.0-TTS-Plus ของ Alibaba สร้างเสียงพูดที่ราคา $27.6 ต่อล้านตัวอักษร หรือคิดเป็นเสียงประมาณ $1.66 ต่อชั่วโมง ขณะที่ GPT-Live-1 ของ OpenAI คิดค่าบริการ $3.00 สำหรับหนึ่งชั่วโมงของการเปิดสายต่อเนื่อง ผู้บรรยายถูกกว่า ผู้บรรยายจึงชนะ — ยกเว้นว่านี่คือการเปรียบเทียบที่ผิด และเหตุผลที่มันผิดก็คือสิ่งที่มีประโยชน์ที่สุดที่ใคร ๆ ก็ได้จากการเทียบกันครั้งนี้ Qwen-Audio-3.0-TTS เป็นโมเดลแปลงข้อความเป็นเสียง GPT-Live-1 เป็นโมเดลสนทนาแบบฟูลดูเพล็กซ์ ตัวหนึ่งอ่านสิ่งที่คุณเขียน อีกตัวต้องตัดสินใจ หลายครั้งต่อวินาที ว่าคุณพูดจบหรือยัง
อันหนึ่งเรนเดอร์ อีกอันหนึ่งสนทนา
การแปลงข้อความเป็นเสียงรับข้อความเข้าและส่งเสียงออก ไม่มีเสียงอินพุต ไม่มีรอบสนทนาให้ต้องผลัดกันพูด ไม่มีแนวคิดเรื่องการถูกขัดจังหวะ และไม่มีข้อความถอดเสียงให้ส่งกลับ เพราะโมเดลไม่เคยได้ยินอะไรเลย โมเดลต้นทุนของมันคือแท่นพิมพ์: หน้าเข้า เสียงออก คุณภาพและปริมาณงานคือตัวเลขเพียงสองตัวที่สำคัญ และคุณวัดทั้งสองอย่างได้ก่อนปล่อยผลิตภัณฑ์
โมเดลสนทนาแบบฟูลดูเพล็กซ์จะประมวลผลเสียงที่เข้ามาในขณะเดียวกันกับที่กำลังสร้างเสียงออกไป หน้าที่ของมันครอบคลุมส่วนต่างๆ ของการสนทนาที่ไม่เกี่ยวกับถ้อยคำเลย เช่น การหยุดชั่วคราวเมื่อผู้ใช้หยุด การพูดต่อผ่านเสียงตอบรับอย่าง "อือ" แทนที่จะตีความว่าเป็นการขัดจังหวะ การยอมสละสิทธิ์การพูดกลางประโยค และการเรียกใช้เครื่องมือโดยไม่ทำให้บทสนทนาขาดตอน GPT-Live-1 ทำได้ทั้งหมดนั้น และยังส่งบทถอดเสียงจากการรู้จำเสียงพูดกลับมาพร้อมกับเซสชันด้วย ซึ่งมันทำได้ก็เพราะมันฟังอยู่ตลอดเวลา
หากผลิตภัณฑ์ของคุณอ่านบทความออกเสียง แปลงเอกสารเป็นเสียง หรือบรรยายวิดีโอ GPT-Live-1 เป็นเครื่องมือที่ไม่เหมาะสม เมื่อราคาต่อชั่วโมงสูงกว่าถึงสี่เท่า หากผลิตภัณฑ์ของคุณรับสายโทรศัพท์ Qwen-Audio-3.0-TTS เป็นเพียงหนึ่งในสามของไปป์ไลน์ที่ยังต้องใช้โมเดล ASR และโมเดลภาษาเพื่อกลายเป็นการสนทนา
ในกรณีที่ Qwen-Audio-3.0-TTS เป็นคำตอบที่ดีที่สุดอย่างแท้จริง
เหตุผลที่โมเดลของ Alibaba น่าสนใจไม่ใช่เรื่องการตลาด เปิดตัวเมื่อวันที่ 20 กรกฎาคม 2026 โดย Tongyi Lab ของ Alibaba และเปิดให้ใช้งานเป็น API แบบปิดที่โฮสต์ผ่าน Alibaba Cloud Model Studio รุ่น Plus ขึ้นอันดับหนึ่งบน text-to-speech arena ของ Artificial Analysis เมื่อเปิดตัว อย่างไรก็ตาม ลีดเดอร์บอร์ดเป็นเป้าหมายที่เคลื่อนไหว และอันนี้ก็ขยับแล้ว: ณ กันยายน 2026 Qwen-Audio-3.0-TTS-Plus อยู่อันดับสี่บน Provider Voice Arena ด้วยคะแนน Elo 1,232 จาก 2,306 ตัวอย่าง ตามหลัง Cartesia Sonic 3.6 ที่ 1,275, Inworld Realtime TTS-2 ที่ 1,244 และ Simba 3.2 ของ Speechify ที่ 1,233 — สามโมเดลจากเดือนสิงหาคมและกรกฎาคมที่เปิดตัวหลังจากนั้น การอยู่อันดับสี่จากมากกว่ายี่สิบโมเดล แม้เสียตำแหน่งผู้นำไปแล้วแต่ยังคงได้เปรียบด้านราคา ยังถือเป็นตำแหน่งที่แข็งแกร่ง เพียงแต่ไม่ใช่ตำแหน่งที่สื่อตอนเปิดตัวบรรยายไว้

ครองความเป็นผู้นำใน 10 จาก 16 ภาษาที่รองรับ เพิ่มภูมิภาคภาษาถิ่นจีน 20 แห่ง รองรับการโคลนเสียงจากตัวอย่างสั้น รวมถึงการโคลนข้ามภาษา และมีแท็กอารมณ์และการออกเสียงแบบอินไลน์ถึง 86 แท็ก
ข้อแม้เหล่านี้เจาะจงมากพอที่จะวางแผนรับมือได้
• อัตราความเร็วในการประมวลผล (Throughput) — Plus สร้างข้อความได้ประมาณ 16 ตัวอักษรต่อวินาที เทียบกับ 30.2 สำหรับ Simba 3.2, 27 สำหรับ Gemini 3.1 Flash TTS และประมาณ 120 สำหรับ Sonic 3.5 สำหรับการเรนเดอร์แบบเป็นชุด ตัวเลขนี้แทบไม่มีความหมาย แต่สำหรับผลิตภัณฑ์ที่ใช้งานแบบเรียลไทม์ นี่คือตัวเลขที่กำหนดขนาดบัฟเฟอร์ของคุณ
• เอกสารราคา — ตัวเลข 27.6 ดอลลาร์ต่อล้านอักขระที่ถูกอ้างอิงกันอย่างแพร่หลายนั้น ไม่ตรงกับหน้าตาราคาของ Alibaba เองในทุก snapshot ซึ่ง ณ บางช่วงเวลาก็ระบุตัวเลขที่ต่ำกว่าสำหรับทั้งสองระดับ ดังนั้นก่อนจะคาดการณ์ ให้ตรวจสอบตัวเลขปัจจุบันในระดับบัญชีของคุณเอง ไม่ใช่ตัวเลขจาก leaderboard
• คลังเสียง — แม้จะรองรับ 16 ภาษา แต่เสียงพรีเซ็ตสาธารณะเกือบทั้งหมดเป็นภาษาจีนและอังกฤษ ส่วนอีกสิบสี่ภาษาที่เหลือจะใช้งานได้ผ่านขั้นตอนการโคลนเสียงเท่านั้น ไม่ได้มีแบบสำเร็จรูป
• การจำกัดฟีเจอร์ — แท็กอารมณ์แบบอินไลน์ 86 แท็กทำงานได้เฉพาะในโหมดสตรีมมิ่งทิศทางเดียวเท่านั้น ดังนั้นการควบคุมการแสดงออกจึงไม่คงอยู่ในทุกเส้นทางการผสานรวม
• ระดับ — Flash ตั้งเป้าความหน่วงของแพ็กเก็ตแรกไว้ที่ประมาณ 300 ms สำหรับการใช้งานแบบเรียลไทม์ ส่วน Plus เป็นระดับที่เน้นคุณภาพ ทั้งสองเป็นผลิตภัณฑ์ที่แตกต่างกันแต่ใช้ชื่อเดียวกัน และการเลือกผิดอันเป็นความผิดพลาดแรกที่พบบ่อย
ฉบับที่ตรงไปตรงมาของร่างกฎหมายแคสเคด
นี่คือสิ่งที่การเปรียบเทียบรายชั่วโมงละไว้ ผลิตภัณฑ์สนทนาที่สร้างบนโมเดล TTS เป็นระบบแบบแคสเคด: โมเดล ASR เปลี่ยนเสียงพูดของผู้โทรเป็นข้อความ โมเดลภาษาตัดสินใจว่าจะพูดอะไร และโมเดล TTS พูดข้อความนั้นออกมา สามผู้ขาย สามบิล สามงบความหน่วงที่บวกรวมกัน และการส่งต่อในแต่ละรอยต่อที่ทำนองเสียงตายไป ส่วน TTS อาจมีค่าใช้จ่าย $1.66 ต่อชั่วโมงเสียง อีกสองส่วนที่เหลือคือที่ที่เงินและความผิดพลาดอยู่จริง ๆ — และโมเดลแบบแคสเคดไม่สามารถได้ยินช่วงหยุดกลางประโยคที่มันกำลังพูดอยู่
GPT-Live-1 รวมสามส่วนเข้าเป็นเซสชันเดียวและมิเตอร์เดียว ในราคา $0.05 ต่อนาทีของเสียง โดยคิดค่าแบ็กเอนด์การให้เหตุผลแยกต่างหาก รายละเอียดสองข้อทำให้บิลนั้นเที่ยงตรง การเริ่มต้นเซสชันคิดค่าเสียง 15 วินาทีล่วงหน้า โดยถือเป็นเครดิตหักลบกับระยะเวลาที่ใช้ในภายหลัง ไม่ใช่บวกเพิ่มเข้าไปในระยะเวลานั้น และแบ็กเอนด์เป็นมิเตอร์ตัวที่สอง: ทุกการเรียกใช้การให้เหตุผลที่มอบหมาย ทุกการเรียกใช้เครื่องมือ และการค้นหาเว็บ จะคิดค่าตามอัตราปกติของโมเดลนั้น ดังนั้นการมอบหมายให้ไปที่ตัวให้เหตุผลระดับแนวหน้าที่ค้นหาทุกเทิร์นจึงสร้างการเรียกที่มีค่าใช้จ่ายสูงอยู่เบื้องหลังเลเยอร์เสียงราคาถูก
สิ่งที่บอร์ดจัดอันดับอิสระพูดถึงสองรุ่นนี้ให้แง่คิดอย่างยิ่ง เพราะพวกมันวัดคนละสิ่ง และไม่มีบอร์ดใดยกยอสิ่งที่ตนวัด Qwen-Audio-3.0-TTS-Plus อยู่อันดับสี่ด้านคุณภาพ และเกือบท้ายตารางด้านทรูพุต GPT-Live-1 อยู่อันดับเจ็ดจากสิบเอ็ดใน Speech to Speech Index ของ Artificial Analysis ที่ 69.8% — ตามหลัง GPT-Realtime-2.1 ที่มันเข้าไปแทนที่ ซึ่งอยู่ที่ 73.9% — ขณะที่ถูกคิดค่าบริการในระดับต่ำสุดของช่วงต้นทุนต่อชั่วโมงเสียงอินพุตของดัชนีนี้ คือ $4.42 เทียบกับ $10.75 ของ GPT-Realtime-2.1 ไม่มีโมเดลใดคว้าอันดับสูงสุดในหมวดของตัวเอง ทั้งคู่มีราคาถูกกว่าสิ่งที่มันถูกสร้างขึ้นมาเพื่อเอาชนะ

มิเตอร์ตัวที่สองคือจุดที่ชั้นการกำหนดเส้นทางกลายเป็นข้อตัดสินใจด้านการออกแบบ มากกว่าจะเป็นเพียงการปรับให้เหมาะที่สุด OrcaRouter ไม่ได้ให้บริการทั้ง GPT-Live-1 และ Qwen-Audio-3.0-TTS — ชั้นเสียงในทั้งสองกรณีอยู่นอกเหนือการเข้าถึงของเรา และเราไม่ได้กำหนดเส้นทางส่วนนี้เลย แต่ขา reasoning นั้นไม่ใช่ โมเดลราว 190 ตัวจากผู้ให้บริการต้นทางสิบเอ็ดราย ตั้งอยู่เบื้องหลังคีย์เดียว ในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม และเมื่อผู้ให้บริการลดราคา ก็มีผลในวันเดียวกัน แทนที่จะรอถึงการต่อสัญญาครั้งถัดไป สำหรับสถาปัตยกรรมแบบ cascade สิ่งนี้ครอบคลุมขากลางได้อย่างสมบูรณ์: เก็บตัวเลือก ASR สองตัวและโมเดล reasoning สามตัวไว้เบื้องหลัง endpoint เดียว ทดสอบ A/B กันด้วยทราฟฟิกจริง และปล่อยให้ automatic failover รองรับช่วงที่ต้นทางมีปัญหาบ่ายนั้นไว้โดยไม่ทำให้สายหลุด
คำถามเรื่องความยินยอมกลับเป็นไปในทางตรงกันข้าม
การโคลนเสียงเป็นความสามารถที่สร้างประโยชน์เชิงพาณิชย์ได้มากที่สุดของ Qwen-Audio-3.0-TTS และเป็นจุดที่ต้องคำนึงถึงเรื่องการปฏิบัติตามกฎระเบียบมากที่สุดด้วย เสียงอ้างอิงเพียงสิบวินาทีก็เพียงพอที่จะจำลองเสียงผู้พูดได้ ข้ามภาษาได้ด้วย ซึ่งพลิกโฉมวงการโลคัลไลเซชันอย่างสิ้นเชิง และกลายเป็นความเสี่ยงในทุกที่ที่เรื่องอัตลักษณ์ตัวตนมีความสำคัญ OpenAI เปิดตัว GPT-Live-1 โดยไม่มีฟีเจอร์โคลนเสียงและไม่มีเสียงแบบกำหนดเองเลย — มีเสียงจาก API ให้เลือก 12 เสียง และมีเพียงเท่านั้น
ความไม่สมมาตรนั้นเป็นเรื่องง่ายที่จะมองข้ามในการเปรียบเทียบคุณสมบัติ และเป็นเรื่องยากที่จะมองข้ามในการทบทวนความเสี่ยง ผลิตภัณฑ์ที่พูดได้เพียงหนึ่งในสิบสองเสียงของผู้ให้บริการ มีคำตอบสำหรับ "นั่นคือเสียงของใคร และใครได้ให้ความยินยอมกับเสียงนั้น" ที่สั้นกว่ามากเมื่อเทียบกับผลิตภัณฑ์ที่สามารถจำลองเสียงใดก็ได้จากตัวอย่าง หากคุณต้องการการโคลนนิง การตัดสินใจเรื่องไปป์ไลน์ก็ถูกกำหนดไว้ให้คุณแล้ว และคำถามจะกลายเป็นว่าอะไรเป็นตัวกำกับมัน หากคุณไม่ต้องการ ข้อจำกัดของ GPT-Live-1 นั้นคุ้มค่าที่จะอ่านในฐานะกลไกควบคุมที่คุณไม่จำเป็นต้องสร้างเอง
ซื้ออันไหนดี
ซื้อ Qwen-Audio-3.0-TTS หากผลลัพธ์คือเนื้อหา: การบรรยาย, การแปลและปรับให้เข้ากับท้องถิ่น, เสียงเพื่อการเข้าถึง, การพากย์เสียง, หรือเวิร์กโฟลว์ใด ๆ ที่ข้อความมีอยู่ก่อนเสียง และคุณภาพต่อชั่วโมงที่เรนเดอร์เป็นตัวชี้วัด เริ่มต้นที่ Flash หากคุณต้องการเล่นแบบเรียลไทม์ ย้ายไปที่ Plus เมื่อเสียงเองคือสิ่งที่จะส่งมอบ และกำหนดราคาเวิร์กโฟลว์การโคลนเสียงแยกจากเสียงพรีเซ็ต
ซื้อ GPT-Live-1 หากอินพุตเป็นบุคคล รองรับสายซัพพอร์ต ขั้นตอนการจอง การสัมภาษณ์รับเข้า หรืออะไรก็ตามที่พยางค์แรกของผู้ใช้มาถึงขณะที่โมเดลกำลังพูดอยู่กลางประโยค และระบบต้องทำตัวเป็นผู้ฟังมากกว่าผู้พูด มันมีค่าใช้จ่ายต่อชั่วโมงเสียงสูงกว่า และเป็นตัวเดียวในสองตัวที่สามารถถูกขัดจังหวะได้
ทั้งสองเป็นส่วนเสริมกันบ่อยกว่าที่จะเป็นคู่แข่งกันมาก: ผลิตภัณฑ์จำนวนมากต้องการให้ Qwen-Audio-3.0-TTS อ่านเอกสาร และโมเดลดูเพล็กซ์จัดการสายที่ตามมา สิ่งที่พวกมันไม่ควรใช้ร่วมกันคือโมเดลต้นทุน การคิดต่อชั่วโมงเสียงเป็นตัวชี้วัดที่เหมาะสมสำหรับเพียงหนึ่งในสองสิ่งนี้เท่านั้น
