
Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: เสียงที่รับฟัง ปะทะ ราชาแห่งสนามประลอง
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
มีทฤษฎีที่แข่งขันกันสองทฤษฎีว่าทำไมเสียงสังเคราะห์จึงให้ความรู้สึกเหมือนมนุษย์ และตอนนี้ตัวอย่างเชิงพาณิชย์ที่ดีที่สุดของแต่ละทฤษฎีก็คือ Inworld Realtime TTS-2และCartesia Sonic 3.6. ทฤษฎีของ Cartesia คือความเป็นมนุษย์อยู่ที่ตัวเสียง: ถ้าทำให้โทนเสียง ระดับเสียงสูงต่ำ และจังหวะเวลาแยกไม่ออกจากเสียงของคนจริง ผู้ฟังก็จะจัดอันดับให้เป็นที่หนึ่ง — ซึ่งคือสิ่งที่ Sonic 3.6 ทำได้ในเดือนสิงหาคม เมื่อพุ่งขึ้นสู่อันดับหนึ่งของ Provider Voice arena ของ Artificial Analysis ด้วย Elo 1,282. ส่วนทฤษฎีของ Inworld คือความเป็นมนุษย์อยู่ที่การฟัง: TTS-2 ปรับวิธีการพูดตามเสียงจริงของบทสนทนาที่เกิดขึ้นก่อนหน้า ดังนั้นมันจึงไม่เพียงแค่ฟังดูเหมือนคน แต่ยังโต้ตอบเหมือนคนด้วย. สัปดาห์นี้ทั้งสองทฤษฎีปะทะกันบนลีดเดอร์บอร์ด: การให้คะแนนใหม่ครั้งเดียวกันที่ทำให้ Inworld Realtime TTS-2 ได้อันดับ #2 บนลีดเดอร์บอร์ดผู้ให้บริการ ด้วย Elo 1,252 ยังทำให้มันได้อันดับ #1 บน Controlled Voice arena — ลีดเดอร์บอร์ดที่ Cartesia เคยเป็นจ่าฝูง — ด้วย Elo 1,123 เทียบกับ 1,119 ของ Sonic 3.6. โมเดลหนึ่งครองบัลลังก์ฝั่ง Provider Voice ส่วนอีกโมเดลเพิ่งคว้าบัลลังก์ฝั่ง Controlled Voice ไป
นี่ไม่ใช่การเปรียบเทียบที่ฝ่ายหนึ่งผิดอย่างเห็นได้ชัด โมเดลทั้งสองถูกสร้างขึ้นสำหรับงานที่ทับซ้อนกันแต่ไม่เหมือนกันทั้งหมด และความต่างของราคา — Sonic 3.6 ที่ $49.0 ต่อล้านตัวอักษร เทียบกับ Inworld Realtime TTS-2 ในราคา $25 แบบคิดตามการใช้งาน — มีนัยสำคัญพอที่การตัดสินใจจะต้องชั่งน้ำหนักทั้งเรื่องงบประมาณและคุณภาพ
สองทฤษฎีของเสียงที่ฟังดูเหมือนมนุษย์
Cartesia เปิดตัว Sonic 3.6 อย่างเงียบ ๆ ในเดือนสิงหาคม 2026 ซึ่งเป็นการออกรุ่นย่อยที่พัฒนา Sonic 3.5 ให้ดีขึ้นโดยไม่เปลี่ยนราคาหรือแนวทางสถาปัตยกรรมเดิม จุดพัฒนาที่เห็นได้ชัดอยู่ในสิ่งที่ Cartesia ต้องการ: โมเดลกระโดดขึ้นไปที่ Elo 1,282 ใน Provider Voice arena ของ Artificial Analysis — ซึ่งทุกโมเดลใช้เสียงเนทีฟของตัวเอง — และครองตำแหน่งสูงสุดใน Controlled Voice arena ตลอดเดือนสิงหาคม บนกระดาน controlled โมเดลทุกตัวถูกโคลนลงบนลำโพงอ้างอิง 8 ตัวเดียวกัน ดังนั้นมงกุฎดังกล่าวจึงเป็นการตัดสินที่ตัวเอนจินสังเคราะห์เสียงเอง โดยไม่ขึ้นกับนักพากย์ หลังจากการประเมินคะแนนรอบ general availability ใหม่ของ Inworld ในสัปดาห์นี้ Cartesia ยังคงนำบนกระดาน provider แต่ Sonic 3.6 ตอนนี้รั้งอันดับ #2 บนกระดาน controlled ที่ Elo 1,119 ตามหลัง Inworld Realtime TTS-2 ที่ 1,123 อยู่ 4 แต้ม
Inworld Realtime TTS-2 มาจากแนวคิดที่แตกต่างจากรุ่นอื่น ๆ สายผลิตภัณฑ์รุ่นก่อนคือ TTS 1.5 ใช้ช่วงต้นปี 2026 อยู่ใกล้จุดสูงสุดของสนามแข่งขันเดียวกัน และการเปิดตัวอย่างงานวิจัยของ TTS-2 แสดงค่า Elo 1,209 บนกระดานผู้ให้บริการในเดือนมิถุนายน นับตั้งแต่นั้นโมเดล GA ก็ไต่สูงขึ้น: บนกระดานปัจจุบันมันอยู่ที่ 1,252 ใน Provider Voice (อันดับ 2 ตามหลัง Sonic 3.6 ที่ 1,282) และ 1,123 ใน Controlled Voice (อันดับ 1) แต่จุดที่ทำให้เรือธงรุ่นนี้แตกต่างจริง ๆ ไม่ใช่ค่า Elo แต่เป็นเพราะโมเดลรับเทิร์นก่อนหน้าของบทสนทนาเป็นอินพุตเสียง แล้วใช้สิ่งนั้นกำหนดวิธีการส่งไลน์ถัดไป Cartesia ปรับอารมณ์จากบทถอดเสียง ส่วน Inworld ฟังว่าสิ่งสุดท้ายถูกพูดออกมาอย่างไร
กระดานคะแนนที่ระบุอย่างตรงไปตรงมา
ค่าElo มาจากสนามทดสอบเสียงพูด (speech arenas) ของArtificial Analysis โดยอ่านจากกระดานสดในเดือนกันยายน 2026 ค่าหน่วง (latency) อ้างอิงจากข้อมูลที่ผู้ผลิตแจ้งไว้ เว้นแต่จะระบุไว้เป็นอย่างอื่น และยังไม่มีการตรวจสอบค่าหน่วงโดยอิสระจากบุคคลที่สามสำหรับทั้งสองโมเดล
• คุณภาพอิสระ — Cartesia Sonic 3.6: Elo 1,282 (#1, เสียงผู้ให้บริการ) และ 1,119 (#2, เสียงควบคุม) เทียบกับ Inworld Realtime TTS-2: Elo 1,252 (#2, เสียงผู้ให้บริการ) และ 1,123 (#1, เสียงควบคุม)
• ราคาต่อ 1 ล้านตัวอักษร — $49.0 (ติดตามโดย Artificial Analysis) เทียบกับ $25 แบบ on demand, $20.8 แบบผสมตามที่ Artificial Analysis ติดตามไว้ ลดเหลือ $12.50 เมื่อใช้ในปริมาณมาก (ผู้ขาย)
เวลาจนถึงเสียงแรก — ต่ำกว่า 90 มิลลิวินาที (ตามที่ผู้ผลิตระบุ) เทียบกับค่ามัธยฐานต่ำกว่า 200 มิลลิวินาที และค่าที่ p99 ต่ำกว่า 100 มิลลิวินาที จากการทดสอบเปิดตัวของ Inworld (ตามที่ผู้ผลิตระบุ); โซลูชันความหน่วงต่ำของ Inworld ที่เทียบเคียง Sonic คือระดับ TTS-2 Flash แยกต่างหาก ซึ่งมีเวลาจนถึงไบต์แรกประมาณ 25 มิลลิวินาที
• ภาษา — มีการแปลเป็นภาษาท้องถิ่น 42 ภาษา เทียบกับ 100+ ภาษาสำหรับการควบคุมการจัดส่ง โดยที่ Inworld อ้างถึงคุณสมบัติ one-voice-identity ซึ่งครอบคลุมถึง 200+ ตำแหน่งที่ตั้ง (ตามที่ผู้ขายระบุ)
• การโคลนเสียงแบบทันที — ใช้เสียงประมาณ 10 วินาที เทียบกับ 5–15 วินาที พร้อมทั้งโหมดเบต้าสำหรับการโคลนเสียงระดับมืออาชีพ ซึ่งใช้เสียงประมาณ 10 นาทีเพื่อให้ได้เสียงโคลนที่มีความเที่ยงตรงสูงขึ้น
• การควบคุมการส่งมอบ — แท็กในทรานสคริปต์แบบอินไลน์ เช่น [laughter] บวกกับการปรับระดับเสียงและความเร็ว เทียบกับการควบคุมด้วยภาษาอังกฤษธรรมดา เช่น "[calm, reassuring]" หรือ [whisper] คำสั่งระดับคำขอ และโหมดความเสถียรสามโหมดตั้งแต่ Stable ถึง Expressive

ทำไม "การฟังการสนทนา" จึงเป็นคนละแกนกัน
ตารางคะแนนด้านบนวัดว่าเสียงหนึ่งๆ ฟังดูเป็นอย่างไรเมื่ออยู่อย่างโดดเดี่ยว มิติที่โมเดลทั้งสองแตกต่างกันอย่างแท้จริงไม่ปรากฏบนลีดเดอร์บอร์ดใดๆ เลย เพราะมันมีอยู่เพียงในบทสนทนาที่ดำเนินไปหลายเทิร์นเท่านั้น
อินเวิลด์ เรียลไทม์ TTS-2 ถูกสร้างขึ้นสำหรับกรณีที่บุคคลเพิ่งพูดบางอย่างกับมัน โมเดลจะประมวลผลเสียงของเทิร์นก่อนหน้า — ไม่ใช่แค่บทถอดความ — วิเคราะห์น้ำเสียง จังหวะ และสภาวะทางอารมณ์ และเลือกสภาวะการตอบสนองก่อนที่จะพูด หากผู้โทรรู้สึกหงุดหงิด รูปแบบการพูดก็จะเปลี่ยนไป หากพวกเขารู้สึกผ่อนคลาย มันก็จะเปลี่ยนกลับ นั่นคือเหตุผลที่ Inworld ทำการตลาดโมเดลนี้สำหรับเอเจนต์ คู่สนทนา และเกม มากกว่าสำหรับงานบรรยาย: ฟีเจอร์นี้ไร้ความหมายในการแปลงข้อความเป็นเสียงแบบครั้งเดียว แต่มีความหมายในการสนทนา
Cartesia Sonic 3.6 ทำงานแตกต่างออกไป มันเป็นสตรีมมิงเอนจินที่รวดเร็วและมีคุณภาพสูง และข้ออ้างของ Cartesia เองคือการปรับอารมณ์อัตโนมัติจากบทถอดเสียง — มันอ่านคำพูดแล้วปรับเสียงตาม สิ่งที่มันไม่ได้ทำคือการฟังเสียงของเทิร์นก่อนหน้า ภายในคำพูดเดียว (utterance) ทั้งสองอาจฟังดูใกล้เคียงกัน แต่เมื่อเทียบในระดับบทสนทนา Inworld กำลังสร้างโมเดลบางอย่างที่ Sonic ไม่ได้พยายามทำ หากผลิตภัณฑ์ของคุณเป็นเสียงพากย์แบบเทิร์นเดียว โมเดลนั้นคือภาระส่วนเกิน แต่ถ้าเป็นเอเจนต์สด มันคือตัวผลิตภัณฑ์เอง

ความเร็ว ราคา และข้อควรระวังเกี่ยวกับ Flash
ในเรื่องความหน่วงโดยแท้จริงแล้ว Cartesia ครองตำแหน่งผู้ถือสิทธิ์อวดอ้าง: เวลาจนถึงเสียงแรกที่ต่ำกว่า 90 มิลลิวินาทีเป็นตัวเลขที่ผู้ผลิตประกาศ แต่ก็เป็นตัวเลขที่บริษัทจัดส่งมาตั้งแต่รุ่น Sonic 3 และยังไม่มีใครเผยแพร่ผลตรวจสอบที่ขัดแย้ง Inworld เปิดตัวเรือธงที่ให้คำตอบในระดับการสนทนาคล้ายกันที่ต่ำกว่า 200 มิลลิวินาที ซึ่งถือว่าเพียงพอสำหรับเอเจนต์สด จุดเล่นด้านความหน่วงที่แท้จริงของ Inworld คือระดับ Flash ที่วางจำหน่ายพร้อมกับโมเดล GA ซึ่งเป็นโมเดลแยกต่างหากที่ใช้เวลาจนถึงไบต์แรกประมาณ 25 มิลลิวินาที ออกแบบมาสำหรับปริมาณงานสูงที่ต้นทุนและความหน่วงระดับ Sonic มีความสำคัญมากกว่าความสามารถในการถ่ายทอดอารมณ์ ข้อแม้คือ Flash เป็นสมาชิกรุ่นที่ถูกตัดทอนของครอบครัวเดียวกัน: รองรับการโคลนเสียงทันทีและเสียงที่ไม่ใช่คำพูดแบบอินไลน์ แต่ไม่รองรับการโคลนเสียงระดับมืออาชีพและไม่มีการควบคุมด้วยภาษาธรรมชาติเต็มรูปแบบ
ราคากลับทิศทาง Sonic 3.6 คิดค่าใช้จ่าย 49.0 ดอลลาร์ต่อล้านตัวอักษร ซึ่งสูงกว่าอัตราแบบจ่ายตามการใช้งานของ Inworld ที่ 25 ดอลลาร์ประมาณสองเท่า และเกือบสี่เท่าของแพ็กเกจระดับสูงสุดที่ 12.50 ดอลลาร์ ช่องว่างด้านคุณภาพระหว่างทั้งสองจากกระดานคะแนนที่ทั้งคู่ปรากฏ ไม่ได้ทำให้ส่วนต่างหลายเท่าเช่นนั้นคุ้มค่าสำหรับผู้ซื้อที่ใช้ปริมาณสูง สำหรับเอเจนต์เสียงแบบเรียลไทม์ที่สร้างตัวอักษรหลายพันตัวต่อการสนทนา ส่วนต่างต่อตัวอักษรนี้คือความแตกต่างระหว่างเศรษฐศาสตร์ต่อหน่วยที่แข็งแรงกับที่บางเฉียบ
เลือกอันไหน
• เลือก Cartesia Sonic 3.6 หากสิ่งที่คุณต้องการคือมงกุฎบนบอร์ดผู้ให้บริการ — เสียงที่ได้คะแนนสูงสุดโดยใช้เสียงเนทีฟของตัวเอง Elo 1,282 สำหรับเสียงพูดสั้น ๆ ที่สมบูรณ์ในตัวเอง เช่น คำตอบผู้ช่วย บทพูดในเกม และการอ่านสถานะ ในราคา $49 ต่อล้านตัวอักษร คุณต้องจ่ายเพื่อมงกุฎนี้ และมันยังคงเป็นโมเดลที่ต้องเอาชนะบนบอร์ดนั้น
• เลือก Inworld Realtime TTS-2 หากผลิตภัณฑ์คือการสนทนาแบบหลายเทิร์น ซึ่งการส่งเสียงควรตอบสนองต่อคู่สนทนาอีกฝั่งหนึ่ง เช่น สายสนับสนุนลูกค้า เพื่อนคู่ใจ การสัมภาษณ์ หรือการสอนพิเศษ ปัจจุบันโมเดลนี้ครองตำแหน่งผู้นำบนกระดานจัดอันดับแบบควบคุม ซึ่งทุกโมเดลใช้เสียงอ้างอิงแปดเสียงชุดเดียวกัน และทำได้ในราคาประมาณครึ่งเดียวพร้อมกับฟังเสียงของบทสนทนานั้นด้วย
• สร้างสวิตช์ไว้ในระบบจัดเส้นทาง หากคุณไม่สามารถรู้ล่วงหน้าได้ว่าการโทรแต่ละครั้งต้องใช้เสียงแบบใด โมเดลทั้งสองยังไม่มีอยู่ใน OrcaRouter ณ เวลาที่เขียนบทความนี้ — Sonic เข้าถึงได้ผ่าน API ของ Cartesia เองและแพลตฟอร์มภายนอกอีกหลายแห่ง ส่วน Inworld เข้าถึงผ่าน API ของตัวเอง — แต่เลเยอร์การจัดเส้นทางคือโครงสร้างที่ทำให้บทสนทนาเริ่มต้นด้วยเสียงหนึ่งแล้วสลับไปยังอีกเสียงหนึ่งได้โดยอัตโนมัติเมื่อเกิดปัญหา โดยราคาที่ประกาศไว้ของผู้ให้บริการแต่ละรายจะถูกส่งผ่านที่มาร์กอัป 0% และในวันที่หนึ่งในบอร์ดเหล่านี้พลิกกลับมาอีกครั้ง — ซึ่งสัปดาห์นี้ก็เกิดขึ้นแล้ว — ทางเลือกก็จะกลายเป็นเพียงการเปลี่ยนคอนฟิกแทนที่จะต้องเขียนโค้ดใหม่.
เวอร์ชันสั้น
นี่คือการแยกทางกันอย่างแท้จริง และคำตอบที่ตรงไปตรงมาก็คือ การแยกทางครั้งนี้เป็นเรื่องของการผลัดกันพูด ไม่ใช่คุณภาพเสียง หากคุณต้องการเสียงสแตนด์อโลนที่ทำคะแนนได้ดีที่สุดโดยใช้เสียงเนทีฟของตัวเอง Cartesia Sonic 3.6 ครองตำแหน่งผู้ให้บริการอันดับหนึ่งด้วย Elo 1,282 และคิดค่าบริการ 49 ดอลลาร์ต่อล้านตัวอักษร หากคุณต้องการเสียงที่ตอบสนองต่อวิธีที่ถูกพูดด้วย Inworld Realtime TTS-2 เพิ่งเข้าสู่สถานะ GA อย่างเป็นทางการในสัปดาห์นี้ ที่ราคา 25 ดอลลาร์แบบจ่ายตามการใช้งาน และครองตำแหน่งผู้นำบนกระดานทดสอบแบบควบคุมที่ทั้งสองโมเดลถูกนำมาเปรียบเทียบด้วยเสียงชุดเดียวกัน พร้อมทั้งมีคุณสมบัติการรับรู้บริบทการสนทนาที่ยังไม่มีสนามทดสอบใดวัดได้ครบถ้วน ตอนนี้กระดานคะแนนถูกแบ่งออกเป็นสองส่วนระหว่างสองโมเดล — ซึ่งเป็นภาพที่ตรงไปตรงมาที่สุดของตลาดที่คำว่า "ดีที่สุด" ขึ้นอยู่กับแบบทดสอบที่ใช้

