
GPT-Live-1 vs Inworld Realtime TTS-2: สงครามราคาเรื่องเสียง กับค่าพรีเมียมของการฟัง
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
Inworld Realtime TTS-2 เปิดให้ใช้งานทั่วไปอย่างเป็นทางการแล้ว พร้อมกับสิ่งที่ตลาดเสียงพูดยังขาดหายไป นั่นคืออัตราค่าบริการที่เปิดเผยต่อสาธารณะ โมเดลเรือธงราคา 25 ดอลลาร์ต่อหนึ่งล้านตัวอักษรแบบ on-demand ส่วน Inworld Realtime TTS-2 Flash ที่เร็วกว่า ราคา 15 ดอลลาร์ และทั้งคู่มีราคาลดหลั่นลงตามระดับปริมาณการใช้งานไปจนถึง 12.50 และ 7 ดอลลาร์ ด้วยคะแนน Elo 1,244 และอันดับสองบน speech arena ของ Artificial Analysis นั่นทำให้โมเดลเรือธงมีราคาประมาณครึ่งหนึ่งของผู้นำใน arena ปัจจุบัน และเป็นหนึ่งในวิธีที่ถูกที่สุดในการซื้อเสียงระดับท็อปไฟว์ GPT-Live-1 เป็นอีกโมเดลหนึ่งในการเปรียบเทียบนี้ และเป็นข้อเสนอที่ตรงกันข้าม — 0.05 ดอลลาร์ต่อนาทีของเสียง ไม่นับเป็นตัวอักษร และไม่มีทางซื้อมันได้โดยไม่ซื้อการฟัง การสลับบทสนทนา และการจัดการการขัดจังหวะที่มาพร้อมกันไปด้วย
สิ่งที่น่าสนใจในการเปรียบเทียบทั้งสองก็คือ ช่องว่างราคาดูเหมือนจะมหาศาล แล้วจากนั้นก็หายไปเกือบหมด Synthesis กำลังอยู่ในสงครามราคา ส่วน Conversation ไม่ใช่
สิ่งที่ Inworld เปิดตัวจริง ๆ
ตระกูล TTS-2 เริ่มต้นในฐานะพรีวิวงานวิจัยในเดือนพฤษภาคม 2026 พร้อมคำกล่าวอ้างที่เฉพาะเจาะจงว่า นี่คือโมเดลที่ไม่ได้สร้างเสียงพูดโดยลำพัง มันรับเทิร์นก่อนหน้าของบทสนทนาเป็นอินพุตเสียง วิเคราะห์โทนเสียงและจังหวะ แล้วปรับวิธีตอบสนอง จุดยืนเช่นนั้น — ความตระหนักรู้เชิงบทสนทนามากกว่าคุณภาพเสียงที่คมชัดขึ้น — คือสิ่งที่ทำให้มันแตกต่างจากเอนจินบรรยายที่ครองตลาดการสังเคราะห์เสียงพูดตลอดปี 2025
การเปิดให้ใช้ทั่วไปได้เปลี่ยนพรีวิวให้กลายเป็นกลุ่มผลิตภัณฑ์ และแนบรายการราคามาด้วย Flash คือตัวเลือกที่เน้นทรูพุต โดย Inworld ระบุว่าเวลาถึงไบต์แรกฝั่งเซิร์ฟเวอร์อยู่ที่ประมาณ 20 มิลลิวินาที ณ เปอร์เซ็นไทล์ที่ 90 เทียบกับ 100 มิลลิวินาทีสำหรับรุ่นเรือธง และค่ามัธยฐานของการไปถึงเสียงแรกต่ำกว่า 200 มิลลิวินาที ตัวเลขเหล่านั้นเป็นตัวเลขจากผู้ขายในเอกสารของ Inworld เอง ส่วนการวัดจากบุคคลที่สามเพียงรายการเดียวที่เผยแพร่อยู่ ซึ่งมาจาก Coval ระบุว่า Flash อยู่ที่ประมาณ 25 มิลลิวินาที และรุ่นเรือธงอยู่ในหลักร้อยต้น ๆ ยังไม่มีการตรวจสอบทั้งสองแหล่งนี้อย่างอิสระแบบครบวงจรตั้งแต่ต้นจนจบ
ฟีเจอร์ที่น่าสังเกตมากที่สุดไม่เกี่ยวกับความหน่วงเลย Inworld เพิ่มโหมดอ่านตามตัวอักษร เพื่อให้หมายเลขคำสั่งซื้อ รหัสยืนยัน ที่อยู่ และซีเรียลถูกอ่านกลับแบบทีละตัวอักษร แทนที่จะถูกปรับให้เป็นรูปแบบที่ฟังดูเป็นธรรมชาติแต่ผิด สำหรับเอเจนต์เสียงที่เพิ่งรับจองไป แท็กเดียวนี้คือความแตกต่างระหว่างผลิตภัณฑ์ที่ใช้งานได้จริง กับเดโมที่ถูกส่งต่อไปให้มนุษย์

ทีละมิติ
• ประเภท — GPT-Live-1: การพูดแบบฟูลดูเพล็กซ์จากเสียงเป็นเสียงในโมเดลเดียว เทียบกับ Inworld Realtime TTS-2: โมเดลแปลงข้อความเป็นเสียง โดยมีฟูลดูเพล็กซ์ให้ใช้แยกต่างหากผ่าน Realtime API ของ Inworld
• หน่วยราคา — GPT-Live-1: $0.05 ต่อนาทีเสียง คิดค่าบริการเป็นรายวินาที แบ็กเอนด์การให้เหตุผลคิดค่าบริการแยกต่างหาก เทียบกับ Inworld Realtime TTS-2: $25 ต่อล้านตัวอักษรแบบ on demand, $20 สำหรับแผน Creator และ $12.50 สำหรับระดับสูงสุด โดย Flash อยู่ที่ $15, $10 และ $7
• คุณภาพอิสระ — GPT-Live-1: 70.3% บน Speech to Speech Index อยู่อันดับที่ 6 ร่วมจากทั้งหมด 14 เทียบกับ Inworld Realtime TTS-2: Elo 1,244 จาก 1,091 ตัวอย่าง และเป็นอันดับที่ 2 บน Artificial Analysis Provider Voice arena โดย Flash อยู่ที่ Elo 1,211 จาก 1,626 ตัวอย่าง และเป็นอันดับที่ 6
• การขัดจังหวะ — GPT-Live-1: เป็นแบบเนทีฟ โดยตัดสินใจภายในโมเดลหลายครั้งต่อวินาที เทียบกับ Inworld Realtime TTS-2: ไม่ใช่คุณสมบัติของโมเดล TTS; Realtime API ของ Inworld รองรับการพูดแทรก (barge-in) ด้วยความหน่วงในการขัดจังหวะประมาณ 100 มิลลิวินาที ผ่านซ็อกเก็ตเดียวที่ใช้โปรโตคอล OpenAI Realtime
• ความหน่วง — GPT-Live-1: ความหน่วงในการสลับผลัดกันพูด 0.798 วินาที ในการทดสอบของ OpenAI เอง ไม่มีการเผยแพร่เวลาถึงเสียงแรก เทียบกับ Inworld Realtime TTS-2: 100 มิลลิวินาทีฝั่งเซิร์ฟเวอร์ที่เปอร์เซ็นไทล์ที่ 90, Flash ที่ 20 โดยมีค่ามัธยฐานต่ำกว่าหนึ่งวินาทีถึงชิ้นส่วนเสียงแรกตลอดทั้งไปป์ไลน์ Realtime API ทั้งหมด
• ภาษา — GPT-Live-1: ภาษาหลักได้รับการรองรับอย่างดี แต่ความสม่ำเสมอจะลดลงเมื่อพ้นจากภาษาหลักเหล่านั้น เมื่อเทียบกับ Inworld Realtime TTS-2: รองรับกว่า 200 โลแคล โดย 15 โลแคลมีคุณภาพระดับ Tier 1 และอีก 79 โลแคลอยู่ในระดับ Tier 2 พร้อมอัตลักษณ์เสียงเดียวที่คงไว้ได้ในทุกโลแคล
• เสียงและการโคลน — GPT-Live-1: พรีเซ็ตสิบสองแบบ ไม่มีการโคลน เทียบกับ Inworld Realtime TTS-2: เสียงในตัว 282 เสียง การโคลนแบบ zero-shot ทันทีจากเสียงที่ได้รับอนุญาต 5 ถึง 15 วินาที การโคลนระดับมืออาชีพและการควบคุมการส่งเสียงแบบเต็มรูปแบบเฉพาะในรุ่นเรือธงเท่านั้น
• การปรับใช้ — GPT-Live-1: โฮสต์เท่านั้น, ปลายทางเดียว, ไม่มีระดับฟรี, การทำงานพร้อมกันถูกจำกัดที่ 25 ถึง 500 เซสชัน เทียบกับ Inworld Realtime TTS-2: API แบบโฮสต์พร้อมคอนเทนเนอร์ภายในองค์กรแบบจำกัดการเข้าถึงที่ต้องใช้ H100 และระดับฟรีแบบตามต้องการที่รวมการสังเคราะห์เสียงได้สูงสุดประมาณ 70 นาที

คำถามเรื่องดูเพล็กซ์ ตอบอย่างแม่นยำ
การเขียนบทเปรียบเทียบนี้ให้ง่ายว่า "ตัวหนึ่งฟัง อีกตัวพูดอย่างเดียว" นั้นทำได้ง่าย และมันจะผิดในแบบที่สำคัญ ในworld's โมเดลแปลงข้อความเป็นเสียงพูดเป็นแบบข้อความเข้า เสียงออก แต่ Inworld ยังขาย Realtime API ที่ทำงานผ่านการเชื่อมต่อ WebSocket, WebRTC หรือ SIP เพียงชุดเดียว และเป็นฟูลดูเพล็กซ์ในความหมายที่นักพัฒนาสนใจจริง ๆ นั่นคือ รองรับการตรวจจับเสียงพูดเชิงความหมาย (semantic voice-activity detection) พร้อมการตั้งค่าระดับความไวที่ปรับได้ รองรับการควบคุมการผลัดกันพูดด้วยตนเอง และขัดจังหวะเมื่อมีการพูดแทรกภายในประมาณ 100 มิลลิวินาที โดยเข้ากันได้กับโปรโตคอลของอินเทอร์เฟซ OpenAI Realtime ซึ่งทำให้การย้ายระบบเป็นเพียงการตั้งค่า ไม่ใช่การเขียนใหม่ทั้งหมด
สิ่งที่ Inworld's Realtime API ไม่ใช่ ก็คือโมเดลเสียงเป็นเสียงแบบเนทีฟ มันเป็นแบบคาสเคด — โมเดลรู้จำเสียงที่สลับเปลี่ยนได้ โมเดลภาษาที่คุณเลือก และตัวสังเคราะห์เสียง — ซึ่งถูกประสานงานอยู่ภายใน connection เดียว นั่นคือทางเลือกเชิงสถาปัตยกรรมที่ชอบด้วยเหตุผล และเป็นทางเลือกเดียวกับที่ voice agent ในงานโปรดักชันส่วนใหญ่ใช้ เพียงแต่มันเป็นคนละแนวทางกับ GPT-Live-1 ซึ่งมีโมเดลเดียวเป็นตัวตัดสินว่าเมื่อใดจะปล่อยเทิร์น
ความแตกต่างในทางปฏิบัติจะปรากฏชัดเมื่อผู้โทรขัดจังหวะกลางประโยค ในระบบแบบคาสเคด การขัดจังหวะจะถูกตรวจจับ การสร้างจะถูกยกเลิก และรอบใหม่จะเริ่มต้น — ซึ่งเป็นลำดับที่ทำงานได้ดี แต่ต้องแลกมาด้วยการไปกลับหนึ่งรอบ ในโมเดลแบบต้นทางถึงปลายทาง การตัดสินใจเกิดขึ้นอย่างต่อเนื่องอยู่แล้ว แบบแรกคือระบบที่ตอบสนองอย่างรวดเร็ว แบบหลังคือระบบที่ไม่เคยหยุดฟัง

ลองคำนวณตัวเลขดู เพราะหน่วยซ่อนคำตอบไว้
เสียงพูดจะอยู่ที่ประมาณ 150 คำต่อนาที และภาษาอังกฤษมีค่าเฉลี่ยประมาณ 5.5 ตัวอักษรต่อคำ ดังนั้นเอาต์พุตเสียงพูดหนึ่งนาทีจึงมีประมาณ 800 ถึง 900 ตัวอักษร ที่ราคา $25 ต่อล้าน Inworld Realtime TTS-2 สร้างเสียงพูดหนึ่งนาทีในราคาประมาณสองเซนต์ ที่ราคา $15 ของ Flash จะต่ำกว่าหนึ่งเซนต์ครึ่ง
เมื่อเทียบกับราคา $0.05 ต่อนาทีเสียงของ GPT-Live-1 แล้ว ดูเหมือนจะเป็นความพ่ายแพ้อย่างราบคาบ — จนกว่าคุณจะประเมินราคาส่วนที่เหลือที่ GPT-Live-1 กำลังทำอยู่ Realtime API ของ Inworld ยังต้องใช้การรู้จำเสียงพูดและโมเดลภาษา ซึ่งคิดค่าบริการแยกกัน และทั้งคู่ก็มีความหน่วงในตัวเอง เมื่อรวมเข้าไปแล้ว ค่าใช้จ่ายต่อนาทีของระบบแบบ Cascade จะพุ่งเกินห้าเซนต์สำหรับการโทรใด ๆ ที่มีคำถามจริง ๆ ค่าพรีเมียมของโมเดลแบบ end-to-end ไม่ได้อยู่ที่เสียง แต่อยู่ที่การผลัดกันพูด และมันมีค่าใช้จ่ายประมาณเท่ากับขั้นตอนการรู้จำเสียงพูดที่คุณไม่ต้องซื้ออีกต่อไป
จุดที่แคสเคดชนะอย่างเด็ดขาดคือปริมาณงานที่ไม่ต้องมีการสนทนา การโทรแจ้งเตือน การยืนยันการจัดส่ง การเตือนนัดหมาย ระบบ IVR แบบสคริปต์ — อะไรก็ตามที่ข้อความถูกกำหนดไว้ล่วงหน้าก่อนเริ่มสาย และไม่มีใครจะขัดจังหวะ ในกรณีเหล่านี้ การคิดราคาตามจำนวนตัวอักษรที่ 7 ถึง 15 ดอลลาร์ต่อล้านตัวอักษรย่อมถูกกว่าการคิดราคาต่อนาทีแบบดูเพล็กซ์ และการจ่ายเงินสำหรับการผลัดกันพูดที่คุณไม่เคยใช้เลยก็คือความสิ้นเปลือง
ยังมีเส้นทางสายกลางอีกเส้นทางหนึ่งที่กรอบคิดแบบสองโมเดลซ่อนเอาไว้ ถ้าคุณกำลังประกอบเป็นคาสเคดอยู่แล้ว ชั้นการสังเคราะห์เสียงพูดก็ไม่จำเป็นต้องมาจากผู้ขายเสียงโดยเฉพาะ โมเดล TTS ของ OpenAI เองและโมเดลตัวอย่าง TTS ของ Gemini จาก Google ก็เป็น API endpoint ธรรมดา ๆ และถูกจัดเส้นทางไว้ โดยมีโมเดลราว 190 ตัวจากผู้ให้บริการต้นทางสิบเอ็ดรายอยู่เบื้องหลังคีย์ OrcaRouter เพียงคีย์เดียว ในราคาตามที่ผู้ให้บริการประกาศไว้โดยไม่บวกเพิ่มเลย — ดังนั้นโมเดลสังเคราะห์เสียงจึงอยู่ในแค็ตตาล็อกเดียวกัน ใช้คีย์เดียวกัน และอยู่ในบิลเดียวกัน กับโมเดลการให้เหตุผลที่มันป้อนข้อมูลให้ พร้อมระบบสลับอัตโนมัติหาก endpoint ใดเสื่อมประสิทธิภาพลงกลางการดีพลอย นี่เป็นขั้นตอนที่งามน้อยที่สุดของสแตกเสียง และเป็นขั้นที่รวมศูนย์ได้ง่ายที่สุด ทั้ง Realtime TTS-2 ของ Inworld และ Live Sessions endpoint ของ GPT-Live-1 ไม่มีให้ใช้ในลักษณะนั้น สองตัวนั้นเป็นของผู้ขายของตัวเอง
เลือกอันไหนดี
เลือก Inworld Realtime TTS-2 หากปริมาณคือสิ่งสำคัญและการสนทนาเป็นแบบมีสคริปต์ สำหรับเอเจนต์ที่รับปริมาณงานสูง การแจ้งเตือน ผลิตภัณฑ์หลายภาษาที่ 200 โลแคลและการคงอัตลักษณ์เสียงเดียวเป็นเรื่องสำคัญ หรือการติดตั้งใช้งานใดก็ตามที่ต้องใช้คอนเทนเนอร์แบบ on-premises คุณจะได้เสียงระดับท็อปสองของอารีนาในราคาประมาณครึ่งหนึ่งของผู้นำ แพ็กเกจฟรีสำหรับสร้างต้นแบบ ฟีเจอร์โคลนเสียงที่ GPT-Live-1 ไม่มีให้เลย และ Realtime API ที่จัดการการขัดจังหวะได้อย่างเชี่ยวชาญในรูปแบบ cascade ที่คุณอาจใช้งานอยู่แล้ว
เลือก GPT-Live-1 หากการขัดจังหวะคือผลิตภัณฑ์ สายที่หลุดสคริปต์ ผู้โทรที่พูดทับเอเจนต์ เวิร์กโฟลว์ที่การผลัดกันพูดเป็นความแตกต่างระหว่างบทสนทนากับเมนู คุณจ่ายอัตราต่อนาทีที่ไม่ลดลงเมื่อการพูดถูกลง คุณสละการโคลนนิ่งและ 200 ภาษา และคุณได้รอยต่อกลับคืนมา
สงครามราคาในด้านการสังเคราะห์เสียงเป็นเรื่องจริง และเป็นข่าวดีสำหรับใครก็ตามที่กำลังสร้างวอยซ์เอเจนต์ — เสียงระดับห้าอันดับแรกตอนนี้มีราคาเพียงหนึ่งในห้าของเมื่อสิบแปดเดือนก่อน แต่ก็ไม่ได้ทำให้การเปรียบเทียบนี้ได้ข้อสรุป เพราะสิ่งที่ GPT-Live-1 เรียกเก็บเงิน กับสิ่งที่ Inworld กำลังลดราคา ไม่ใช่สิ่งเดียวกัน
