การ์ดชื่อเรื่องหลักสำหรับ 'GPT-Live-1 vs Inworld Realtime TTS-2' พร้อมคำบรรยายย่อย 'การสังเคราะห์เสียงกำลังถูกลง แต่การได้ยินยังคงแพงอยู่' โดยมีการ์ดสามใบที่ระบุข้อความว่า 'Inworld Realtime TTS-2: $25 ต่อ 1 ล้านตัวอักษร ลดหลั่นลงมาถึง $12.50', 'Inworld Realtime TTS-2 Flash: $15 ต่อ 1 ล้านตัวอักษร ลดหลั่นลงมาถึง $7', 'GPT-Live-1: $0.05 ต่อนาทีเสียง บวกกับเหตุผลเบื้องหลัง' เหนือแถบส่วนท้ายที่ระบุข้อความว่า 'ราคาของ Inworld เผยแพร่โดยผู้จำหน่าย กันยายน 2026; ราคาของ GPT-Live-1 เป็นไปตามเอกสารของ OpenAI' โลโก้ OrcaRouter ถูกจัดวางซ้อนในมุมขวาล่าง
Guides & Insights

GPT-Live-1 vs Inworld Realtime TTS-2: สงครามราคาเรื่องเสียง กับค่าพรีเมียมของการฟัง

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Inworld Realtime TTS-2 เปิดให้ใช้งานทั่วไปอย่างเป็นทางการแล้ว พร้อมกับสิ่งที่ตลาดเสียงพูดยังขาดหายไป นั่นคืออัตราค่าบริการที่เปิดเผยต่อสาธารณะ โมเดลเรือธงราคา 25 ดอลลาร์ต่อหนึ่งล้านตัวอักษรแบบ on-demand ส่วน Inworld Realtime TTS-2 Flash ที่เร็วกว่า ราคา 15 ดอลลาร์ และทั้งคู่มีราคาลดหลั่นลงตามระดับปริมาณการใช้งานไปจนถึง 12.50 และ 7 ดอลลาร์ ด้วยคะแนน Elo 1,244 และอันดับสองบน speech arena ของ Artificial Analysis นั่นทำให้โมเดลเรือธงมีราคาประมาณครึ่งหนึ่งของผู้นำใน arena ปัจจุบัน และเป็นหนึ่งในวิธีที่ถูกที่สุดในการซื้อเสียงระดับท็อปไฟว์ GPT-Live-1 เป็นอีกโมเดลหนึ่งในการเปรียบเทียบนี้ และเป็นข้อเสนอที่ตรงกันข้าม — 0.05 ดอลลาร์ต่อนาทีของเสียง ไม่นับเป็นตัวอักษร และไม่มีทางซื้อมันได้โดยไม่ซื้อการฟัง การสลับบทสนทนา และการจัดการการขัดจังหวะที่มาพร้อมกันไปด้วย

สิ่งที่น่าสนใจในการเปรียบเทียบทั้งสองก็คือ ช่องว่างราคาดูเหมือนจะมหาศาล แล้วจากนั้นก็หายไปเกือบหมด Synthesis กำลังอยู่ในสงครามราคา ส่วน Conversation ไม่ใช่

สิ่งที่ Inworld เปิดตัวจริง ๆ

ตระกูล TTS-2 เริ่มต้นในฐานะพรีวิวงานวิจัยในเดือนพฤษภาคม 2026 พร้อมคำกล่าวอ้างที่เฉพาะเจาะจงว่า นี่คือโมเดลที่ไม่ได้สร้างเสียงพูดโดยลำพัง มันรับเทิร์นก่อนหน้าของบทสนทนาเป็นอินพุตเสียง วิเคราะห์โทนเสียงและจังหวะ แล้วปรับวิธีตอบสนอง จุดยืนเช่นนั้น — ความตระหนักรู้เชิงบทสนทนามากกว่าคุณภาพเสียงที่คมชัดขึ้น — คือสิ่งที่ทำให้มันแตกต่างจากเอนจินบรรยายที่ครองตลาดการสังเคราะห์เสียงพูดตลอดปี 2025

การเปิดให้ใช้ทั่วไปได้เปลี่ยนพรีวิวให้กลายเป็นกลุ่มผลิตภัณฑ์ และแนบรายการราคามาด้วย Flash คือตัวเลือกที่เน้นทรูพุต โดย Inworld ระบุว่าเวลาถึงไบต์แรกฝั่งเซิร์ฟเวอร์อยู่ที่ประมาณ 20 มิลลิวินาที ณ เปอร์เซ็นไทล์ที่ 90 เทียบกับ 100 มิลลิวินาทีสำหรับรุ่นเรือธง และค่ามัธยฐานของการไปถึงเสียงแรกต่ำกว่า 200 มิลลิวินาที ตัวเลขเหล่านั้นเป็นตัวเลขจากผู้ขายในเอกสารของ Inworld เอง ส่วนการวัดจากบุคคลที่สามเพียงรายการเดียวที่เผยแพร่อยู่ ซึ่งมาจาก Coval ระบุว่า Flash อยู่ที่ประมาณ 25 มิลลิวินาที และรุ่นเรือธงอยู่ในหลักร้อยต้น ๆ ยังไม่มีการตรวจสอบทั้งสองแหล่งนี้อย่างอิสระแบบครบวงจรตั้งแต่ต้นจนจบ

ฟีเจอร์ที่น่าสังเกตมากที่สุดไม่เกี่ยวกับความหน่วงเลย Inworld เพิ่มโหมดอ่านตามตัวอักษร เพื่อให้หมายเลขคำสั่งซื้อ รหัสยืนยัน ที่อยู่ และซีเรียลถูกอ่านกลับแบบทีละตัวอักษร แทนที่จะถูกปรับให้เป็นรูปแบบที่ฟังดูเป็นธรรมชาติแต่ผิด สำหรับเอเจนต์เสียงที่เพิ่งรับจองไป แท็กเดียวนี้คือความแตกต่างระหว่างผลิตภัณฑ์ที่ใช้งานได้จริง กับเดโมที่ถูกส่งต่อไปให้มนุษย์

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

ทีละมิติ

• ประเภท — GPT-Live-1: การพูดแบบฟูลดูเพล็กซ์จากเสียงเป็นเสียงในโมเดลเดียว เทียบกับ Inworld Realtime TTS-2: โมเดลแปลงข้อความเป็นเสียง โดยมีฟูลดูเพล็กซ์ให้ใช้แยกต่างหากผ่าน Realtime API ของ Inworld

• หน่วยราคา — GPT-Live-1: $0.05 ต่อนาทีเสียง คิดค่าบริการเป็นรายวินาที แบ็กเอนด์การให้เหตุผลคิดค่าบริการแยกต่างหาก เทียบกับ Inworld Realtime TTS-2: $25 ต่อล้านตัวอักษรแบบ on demand, $20 สำหรับแผน Creator และ $12.50 สำหรับระดับสูงสุด โดย Flash อยู่ที่ $15, $10 และ $7

• คุณภาพอิสระ — GPT-Live-1: 70.3% บน Speech to Speech Index อยู่อันดับที่ 6 ร่วมจากทั้งหมด 14 เทียบกับ Inworld Realtime TTS-2: Elo 1,244 จาก 1,091 ตัวอย่าง และเป็นอันดับที่ 2 บน Artificial Analysis Provider Voice arena โดย Flash อยู่ที่ Elo 1,211 จาก 1,626 ตัวอย่าง และเป็นอันดับที่ 6

• การขัดจังหวะ — GPT-Live-1: เป็นแบบเนทีฟ โดยตัดสินใจภายในโมเดลหลายครั้งต่อวินาที เทียบกับ Inworld Realtime TTS-2: ไม่ใช่คุณสมบัติของโมเดล TTS; Realtime API ของ Inworld รองรับการพูดแทรก (barge-in) ด้วยความหน่วงในการขัดจังหวะประมาณ 100 มิลลิวินาที ผ่านซ็อกเก็ตเดียวที่ใช้โปรโตคอล Open​AI Realtime

• ความหน่วง — GPT-Live-1: ความหน่วงในการสลับผลัดกันพูด 0.798 วินาที ในการทดสอบของ Open​AI เอง ไม่มีการเผยแพร่เวลาถึงเสียงแรก เทียบกับ Inworld Realtime TTS-2: 100 มิลลิวินาทีฝั่งเซิร์ฟเวอร์ที่เปอร์เซ็นไทล์ที่ 90, Flash ที่ 20 โดยมีค่ามัธยฐานต่ำกว่าหนึ่งวินาทีถึงชิ้นส่วนเสียงแรกตลอดทั้งไปป์ไลน์ Realtime API ทั้งหมด

• ภาษา — GPT-Live-1: ภาษาหลักได้รับการรองรับอย่างดี แต่ความสม่ำเสมอจะลดลงเมื่อพ้นจากภาษาหลักเหล่านั้น เมื่อเทียบกับ Inworld Realtime TTS-2: รองรับกว่า 200 โลแคล โดย 15 โลแคลมีคุณภาพระดับ Tier 1 และอีก 79 โลแคลอยู่ในระดับ Tier 2 พร้อมอัตลักษณ์เสียงเดียวที่คงไว้ได้ในทุกโลแคล

• เสียงและการโคลน — GPT-Live-1: พรีเซ็ตสิบสองแบบ ไม่มีการโคลน เทียบกับ Inworld Realtime TTS-2: เสียงในตัว 282 เสียง การโคลนแบบ zero-shot ทันทีจากเสียงที่ได้รับอนุญาต 5 ถึง 15 วินาที การโคลนระดับมืออาชีพและการควบคุมการส่งเสียงแบบเต็มรูปแบบเฉพาะในรุ่นเรือธงเท่านั้น

• การปรับใช้ — GPT-Live-1: โฮสต์เท่านั้น, ปลายทางเดียว, ไม่มีระดับฟรี, การทำงานพร้อมกันถูกจำกัดที่ 25 ถึง 500 เซสชัน เทียบกับ Inworld Realtime TTS-2: API แบบโฮสต์พร้อมคอนเทนเนอร์ภายในองค์กรแบบจำกัดการเข้าถึงที่ต้องใช้ H100 และระดับฟรีแบบตามต้องการที่รวมการสังเคราะห์เสียงได้สูงสุดประมาณ 70 นาที

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Inworld Realtime TTS-2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Languages: major languages only'. The right column, labelled Inworld Realtime TTS-2, reads 'Kind: text-to-speech; duplex via the separate Realtime API', 'Price: $25 per 1M characters, from $12.50 on volume', 'Time to first byte: 100 ms p90, 20 ms for Flash (vendor)', 'Barge-in: ~100 ms, cascade-level', 'Independent score: Elo 1,244, #2 on the AA Provider Voice arena', 'Languages: 200+ locales, 15 at Tier 1 quality'. The footer reads 'Inworld latency and pricing vendor-published; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

คำถามเรื่องดูเพล็กซ์ ตอบอย่างแม่นยำ

การเขียนบทเปรียบเทียบนี้ให้ง่ายว่า "ตัวหนึ่งฟัง อีกตัวพูดอย่างเดียว" นั้นทำได้ง่าย และมันจะผิดในแบบที่สำคัญ ในworld's โมเดลแปลงข้อความเป็นเสียงพูดเป็นแบบข้อความเข้า เสียงออก แต่ Inworld ยังขาย Realtime API ที่ทำงานผ่านการเชื่อมต่อ WebSocket, WebRTC หรือ SIP เพียงชุดเดียว และเป็นฟูลดูเพล็กซ์ในความหมายที่นักพัฒนาสนใจจริง ๆ นั่นคือ รองรับการตรวจจับเสียงพูดเชิงความหมาย (semantic voice-activity detection) พร้อมการตั้งค่าระดับความไวที่ปรับได้ รองรับการควบคุมการผลัดกันพูดด้วยตนเอง และขัดจังหวะเมื่อมีการพูดแทรกภายในประมาณ 100 มิลลิวินาที โดยเข้ากันได้กับโปรโตคอลของอินเทอร์เฟซ OpenAI Realtime ซึ่งทำให้การย้ายระบบเป็นเพียงการตั้งค่า ไม่ใช่การเขียนใหม่ทั้งหมด

สิ่งที่ Inworld's Realtime API ไม่ใช่ ก็คือโมเดลเสียงเป็นเสียงแบบเนทีฟ มันเป็นแบบคาสเคด — โมเดลรู้จำเสียงที่สลับเปลี่ยนได้ โมเดลภาษาที่คุณเลือก และตัวสังเคราะห์เสียง — ซึ่งถูกประสานงานอยู่ภายใน connection เดียว นั่นคือทางเลือกเชิงสถาปัตยกรรมที่ชอบด้วยเหตุผล และเป็นทางเลือกเดียวกับที่ voice agent ในงานโปรดักชันส่วนใหญ่ใช้ เพียงแต่มันเป็นคนละแนวทางกับ GPT-Live-1 ซึ่งมีโมเดลเดียวเป็นตัวตัดสินว่าเมื่อใดจะปล่อยเทิร์น

ความแตกต่างในทางปฏิบัติจะปรากฏชัดเมื่อผู้โทรขัดจังหวะกลางประโยค ในระบบแบบคาสเคด การขัดจังหวะจะถูกตรวจจับ การสร้างจะถูกยกเลิก และรอบใหม่จะเริ่มต้น — ซึ่งเป็นลำดับที่ทำงานได้ดี แต่ต้องแลกมาด้วยการไปกลับหนึ่งรอบ ในโมเดลแบบต้นทางถึงปลายทาง การตัดสินใจเกิดขึ้นอย่างต่อเนื่องอยู่แล้ว แบบแรกคือระบบที่ตอบสนองอย่างรวดเร็ว แบบหลังคือระบบที่ไม่เคยหยุดฟัง

A screenshot of Inworld AI's official pricing page, showing per-million-character rates for its speech models. The On-Demand column lists TTS-2 at $25 per 1M characters, TTS-2 Flash at $15, STT-1 at $0.15 per hour and LLMs at cost, alongside the inclusions 'Up to 70 min TTS included', '100 custom voices', 'Voice cloning & voice design', 'Realtime API access', '220+ LLM models via Router' and 'Commercial license'. The Creator column at $25 per month shows TTS-2 reduced to $20 and Flash to $10, with 500 custom voices and up to 33% off TTS and STT rates.

ลองคำนวณตัวเลขดู เพราะหน่วยซ่อนคำตอบไว้

เสียงพูดจะอยู่ที่ประมาณ 150 คำต่อนาที และภาษาอังกฤษมีค่าเฉลี่ยประมาณ 5.5 ตัวอักษรต่อคำ ดังนั้นเอาต์พุตเสียงพูดหนึ่งนาทีจึงมีประมาณ 800 ถึง 900 ตัวอักษร ที่ราคา $25 ต่อล้าน Inworld Realtime TTS-2 สร้างเสียงพูดหนึ่งนาทีในราคาประมาณสองเซนต์ ที่ราคา $15 ของ Flash จะต่ำกว่าหนึ่งเซนต์ครึ่ง

เมื่อเทียบกับราคา $0.05 ต่อนาทีเสียงของ GPT-Live-1 แล้ว ดูเหมือนจะเป็นความพ่ายแพ้อย่างราบคาบ — จนกว่าคุณจะประเมินราคาส่วนที่เหลือที่ GPT-Live-1 กำลังทำอยู่ Realtime API ของ Inworld ยังต้องใช้การรู้จำเสียงพูดและโมเดลภาษา ซึ่งคิดค่าบริการแยกกัน และทั้งคู่ก็มีความหน่วงในตัวเอง เมื่อรวมเข้าไปแล้ว ค่าใช้จ่ายต่อนาทีของระบบแบบ Cascade จะพุ่งเกินห้าเซนต์สำหรับการโทรใด ๆ ที่มีคำถามจริง ๆ ค่าพรีเมียมของโมเดลแบบ end-to-end ไม่ได้อยู่ที่เสียง แต่อยู่ที่การผลัดกันพูด และมันมีค่าใช้จ่ายประมาณเท่ากับขั้นตอนการรู้จำเสียงพูดที่คุณไม่ต้องซื้ออีกต่อไป

จุดที่แคสเคดชนะอย่างเด็ดขาดคือปริมาณงานที่ไม่ต้องมีการสนทนา การโทรแจ้งเตือน การยืนยันการจัดส่ง การเตือนนัดหมาย ระบบ IVR แบบสคริปต์ — อะไรก็ตามที่ข้อความถูกกำหนดไว้ล่วงหน้าก่อนเริ่มสาย และไม่มีใครจะขัดจังหวะ ในกรณีเหล่านี้ การคิดราคาตามจำนวนตัวอักษรที่ 7 ถึง 15 ดอลลาร์ต่อล้านตัวอักษรย่อมถูกกว่าการคิดราคาต่อนาทีแบบดูเพล็กซ์ และการจ่ายเงินสำหรับการผลัดกันพูดที่คุณไม่เคยใช้เลยก็คือความสิ้นเปลือง

ยังมีเส้นทางสายกลางอีกเส้นทางหนึ่งที่กรอบคิดแบบสองโมเดลซ่อนเอาไว้ ถ้าคุณกำลังประกอบเป็นคาสเคดอยู่แล้ว ชั้นการสังเคราะห์เสียงพูดก็ไม่จำเป็นต้องมาจากผู้ขายเสียงโดยเฉพาะ โมเดล TTS ของ OpenAI เองและโมเดลตัวอย่าง TTS ของ Gemini จาก Google ก็เป็น API endpoint ธรรมดา ๆ และถูกจัดเส้นทางไว้ โดยมีโมเดลราว 190 ตัวจากผู้ให้บริการต้นทางสิบเอ็ดรายอยู่เบื้องหลังคีย์ OrcaRouter เพียงคีย์เดียว ในราคาตามที่ผู้ให้บริการประกาศไว้โดยไม่บวกเพิ่มเลย — ดังนั้นโมเดลสังเคราะห์เสียงจึงอยู่ในแค็ตตาล็อกเดียวกัน ใช้คีย์เดียวกัน และอยู่ในบิลเดียวกัน กับโมเดลการให้เหตุผลที่มันป้อนข้อมูลให้ พร้อมระบบสลับอัตโนมัติหาก endpoint ใดเสื่อมประสิทธิภาพลงกลางการดีพลอย นี่เป็นขั้นตอนที่งามน้อยที่สุดของสแตกเสียง และเป็นขั้นที่รวมศูนย์ได้ง่ายที่สุด ทั้ง Realtime TTS-2 ของ Inworld และ Live Sessions endpoint ของ GPT-Live-1 ไม่มีให้ใช้ในลักษณะนั้น สองตัวนั้นเป็นของผู้ขายของตัวเอง

เลือกอันไหนดี

เลือก Inworld Realtime TTS-2 หากปริมาณคือสิ่งสำคัญและการสนทนาเป็นแบบมีสคริปต์ สำหรับเอเจนต์ที่รับปริมาณงานสูง การแจ้งเตือน ผลิตภัณฑ์หลายภาษาที่ 200 โลแคลและการคงอัตลักษณ์เสียงเดียวเป็นเรื่องสำคัญ หรือการติดตั้งใช้งานใดก็ตามที่ต้องใช้คอนเทนเนอร์แบบ on-premises คุณจะได้เสียงระดับท็อปสองของอารีนาในราคาประมาณครึ่งหนึ่งของผู้นำ แพ็กเกจฟรีสำหรับสร้างต้นแบบ ฟีเจอร์โคลนเสียงที่ GPT-Live-1 ไม่มีให้เลย และ Realtime API ที่จัดการการขัดจังหวะได้อย่างเชี่ยวชาญในรูปแบบ cascade ที่คุณอาจใช้งานอยู่แล้ว

เลือก GPT-Live-1 หากการขัดจังหวะคือผลิตภัณฑ์ สายที่หลุดสคริปต์ ผู้โทรที่พูดทับเอเจนต์ เวิร์กโฟลว์ที่การผลัดกันพูดเป็นความแตกต่างระหว่างบทสนทนากับเมนู คุณจ่ายอัตราต่อนาทีที่ไม่ลดลงเมื่อการพูดถูกลง คุณสละการโคลนนิ่งและ 200 ภาษา และคุณได้รอยต่อกลับคืนมา

สงครามราคาในด้านการสังเคราะห์เสียงเป็นเรื่องจริง และเป็นข่าวดีสำหรับใครก็ตามที่กำลังสร้างวอยซ์เอเจนต์ — เสียงระดับห้าอันดับแรกตอนนี้มีราคาเพียงหนึ่งในห้าของเมื่อสิบแปดเดือนก่อน แต่ก็ไม่ได้ทำให้การเปรียบเทียบนี้ได้ข้อสรุป เพราะสิ่งที่ GPT-Live-1 เรียกเก็บเงิน กับสิ่งที่ Inworld กำลังลดราคา ไม่ใช่สิ่งเดียวกัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube