การ์ดไตเติลฮีโร่สำหรับ 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — เสียงที่ฟัง vs ราชาแห่งอารีน่า' โดยมีการ์ดซ้าย 'Cartesia Sonic 3.6 — Provider #1 · Elo 1,282 · $49 / 1M chars' และการ์ดขวา 'Inworld Realtime TTS-2 — Controlled #1 · Elo 1,123 · $25 / 1M chars' ชิปสถิติ 'แยกมงกุฎ — อารีน่า Provider vs Controlled' และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: เสียงที่รับฟัง ปะทะ ราชาแห่งสนามประลอง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

มีทฤษฎีที่แข่งขันกันสองทฤษฎีว่าทำไมเสียงสังเคราะห์จึงให้ความรู้สึกเหมือนมนุษย์ และตอนนี้ตัวอย่างเชิงพาณิชย์ที่ดีที่สุดของแต่ละทฤษฎีก็คือ Inworld Realtime TTS-2และCartesia Sonic 3.6. ทฤษฎีของ Cartesia คือความเป็นมนุษย์อยู่ที่ตัวเสียง: ถ้าทำให้โทนเสียง ระดับเสียงสูงต่ำ และจังหวะเวลาแยกไม่ออกจากเสียงของคนจริง ผู้ฟังก็จะจัดอันดับให้เป็นที่หนึ่ง — ซึ่งคือสิ่งที่ Sonic 3.6 ทำได้ในเดือนสิงหาคม เมื่อพุ่งขึ้นสู่อันดับหนึ่งของ Provider Voice arena ของ Artificial Analysis ด้วย Elo 1,282. ส่วนทฤษฎีของ Inworld คือความเป็นมนุษย์อยู่ที่การฟัง: TTS-2 ปรับวิธีการพูดตามเสียงจริงของบทสนทนาที่เกิดขึ้นก่อนหน้า ดังนั้นมันจึงไม่เพียงแค่ฟังดูเหมือนคน แต่ยังโต้ตอบเหมือนคนด้วย. สัปดาห์นี้ทั้งสองทฤษฎีปะทะกันบนลีดเดอร์บอร์ด: การให้คะแนนใหม่ครั้งเดียวกันที่ทำให้ Inworld Realtime TTS-2 ได้อันดับ #2 บนลีดเดอร์บอร์ดผู้ให้บริการ ด้วย Elo 1,252 ยังทำให้มันได้อันดับ #1 บน Controlled Voice arena — ลีดเดอร์บอร์ดที่ Cartesia เคยเป็นจ่าฝูง — ด้วย Elo 1,123 เทียบกับ 1,119 ของ Sonic 3.6. โมเดลหนึ่งครองบัลลังก์ฝั่ง Provider Voice ส่วนอีกโมเดลเพิ่งคว้าบัลลังก์ฝั่ง Controlled Voice ไป

นี่ไม่ใช่การเปรียบเทียบที่ฝ่ายหนึ่งผิดอย่างเห็นได้ชัด โมเดลทั้งสองถูกสร้างขึ้นสำหรับงานที่ทับซ้อนกันแต่ไม่เหมือนกันทั้งหมด และความต่างของราคา — Sonic 3.6 ที่ $49.0 ต่อล้านตัวอักษร เทียบกับ Inworld Realtime TTS-2 ในราคา $25 แบบคิดตามการใช้งาน — มีนัยสำคัญพอที่การตัดสินใจจะต้องชั่งน้ำหนักทั้งเรื่องงบประมาณและคุณภาพ

สองทฤษฎีของเสียงที่ฟังดูเหมือนมนุษย์

Cartesia เปิดตัว Sonic 3.6 อย่างเงียบ ๆ ในเดือนสิงหาคม 2026 ซึ่งเป็นการออกรุ่นย่อยที่พัฒนา Sonic 3.5 ให้ดีขึ้นโดยไม่เปลี่ยนราคาหรือแนวทางสถาปัตยกรรมเดิม จุดพัฒนาที่เห็นได้ชัดอยู่ในสิ่งที่ Cartesia ต้องการ: โมเดลกระโดดขึ้นไปที่ Elo 1,282 ใน Provider Voice arena ของ Artificial Analysis — ซึ่งทุกโมเดลใช้เสียงเนทีฟของตัวเอง — และครองตำแหน่งสูงสุดใน Controlled Voice arena ตลอดเดือนสิงหาคม บนกระดาน controlled โมเดลทุกตัวถูกโคลนลงบนลำโพงอ้างอิง 8 ตัวเดียวกัน ดังนั้นมงกุฎดังกล่าวจึงเป็นการตัดสินที่ตัวเอนจินสังเคราะห์เสียงเอง โดยไม่ขึ้นกับนักพากย์ หลังจากการประเมินคะแนนรอบ general availability ใหม่ของ Inworld ในสัปดาห์นี้ Cartesia ยังคงนำบนกระดาน provider แต่ Sonic 3.6 ตอนนี้รั้งอันดับ #2 บนกระดาน controlled ที่ Elo 1,119 ตามหลัง Inworld Realtime TTS-2 ที่ 1,123 อยู่ 4 แต้ม

Inworld Realtime TTS-2 มาจากแนวคิดที่แตกต่างจากรุ่นอื่น ๆ สายผลิตภัณฑ์รุ่นก่อนคือ TTS 1.5 ใช้ช่วงต้นปี 2026 อยู่ใกล้จุดสูงสุดของสนามแข่งขันเดียวกัน และการเปิดตัวอย่างงานวิจัยของ TTS-2 แสดงค่า Elo 1,209 บนกระดานผู้ให้บริการในเดือนมิถุนายน นับตั้งแต่นั้นโมเดล GA ก็ไต่สูงขึ้น: บนกระดานปัจจุบันมันอยู่ที่ 1,252 ใน Provider Voice (อันดับ 2 ตามหลัง Sonic 3.6 ที่ 1,282) และ 1,123 ใน Controlled Voice (อันดับ 1) แต่จุดที่ทำให้เรือธงรุ่นนี้แตกต่างจริง ๆ ไม่ใช่ค่า Elo แต่เป็นเพราะโมเดลรับเทิร์นก่อนหน้าของบทสนทนาเป็นอินพุตเสียง แล้วใช้สิ่งนั้นกำหนดวิธีการส่งไลน์ถัดไป Cartesia ปรับอารมณ์จากบทถอดเสียง ส่วน Inworld ฟังว่าสิ่งสุดท้ายถูกพูดออกมาอย่างไร

กระดานคะแนนที่ระบุอย่างตรงไปตรงมา

ค่าElo มาจากสนามทดสอบเสียงพูด (speech arenas) ของArtificial Analysis โดยอ่านจากกระดานสดในเดือนกันยายน 2026 ค่าหน่วง (latency) อ้างอิงจากข้อมูลที่ผู้ผลิตแจ้งไว้ เว้นแต่จะระบุไว้เป็นอย่างอื่น และยังไม่มีการตรวจสอบค่าหน่วงโดยอิสระจากบุคคลที่สามสำหรับทั้งสองโมเดล

• คุณภาพอิสระ — Cartesia Sonic 3.6: Elo 1,282 (#1, เสียงผู้ให้บริการ) และ 1,119 (#2, เสียงควบคุม) เทียบกับ Inworld Realtime TTS-2: Elo 1,252 (#2, เสียงผู้ให้บริการ) และ 1,123 (#1, เสียงควบคุม)

• ราคาต่อ 1 ล้านตัวอักษร — $49.0 (ติดตามโดย Artificial Analysis) เทียบกับ $25 แบบ on demand, $20.8 แบบผสมตามที่ Artificial Analysis ติดตามไว้ ลดเหลือ $12.50 เมื่อใช้ในปริมาณมาก (ผู้ขาย)

เวลาจนถึงเสียงแรก — ต่ำกว่า 90 มิลลิวินาที (ตามที่ผู้ผลิตระบุ) เทียบกับค่ามัธยฐานต่ำกว่า 200 มิลลิวินาที และค่าที่ p99 ต่ำกว่า 100 มิลลิวินาที จากการทดสอบเปิดตัวของ Inworld (ตามที่ผู้ผลิตระบุ); โซลูชันความหน่วงต่ำของ Inworld ที่เทียบเคียง Sonic คือระดับ TTS-2 Flash แยกต่างหาก ซึ่งมีเวลาจนถึงไบต์แรกประมาณ 25 มิลลิวินาที

• ภาษา — มีการแปลเป็นภาษาท้องถิ่น 42 ภาษา เทียบกับ 100+ ภาษาสำหรับการควบคุมการจัดส่ง โดยที่ Inworld อ้างถึงคุณสมบัติ one-voice-identity ซึ่งครอบคลุมถึง 200+ ตำแหน่งที่ตั้ง (ตามที่ผู้ขายระบุ)

• การโคลนเสียงแบบทันที — ใช้เสียงประมาณ 10 วินาที เทียบกับ 5–15 วินาที พร้อมทั้งโหมดเบต้าสำหรับการโคลนเสียงระดับมืออาชีพ ซึ่งใช้เสียงประมาณ 10 นาทีเพื่อให้ได้เสียงโคลนที่มีความเที่ยงตรงสูงขึ้น

• การควบคุมการส่งมอบ — แท็กในทรานสคริปต์แบบอินไลน์ เช่น [laughter] บวกกับการปรับระดับเสียงและความเร็ว เทียบกับการควบคุมด้วยภาษาอังกฤษธรรมดา เช่น "[calm, reassuring]" หรือ [whisper] คำสั่งระดับคำขอ และโหมดความเสถียรสามโหมดตั้งแต่ Stable ถึง Expressive

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

ทำไม "การฟังการสนทนา" จึงเป็นคนละแกนกัน

ตารางคะแนนด้านบนวัดว่าเสียงหนึ่งๆ ฟังดูเป็นอย่างไรเมื่ออยู่อย่างโดดเดี่ยว มิติที่โมเดลทั้งสองแตกต่างกันอย่างแท้จริงไม่ปรากฏบนลีดเดอร์บอร์ดใดๆ เลย เพราะมันมีอยู่เพียงในบทสนทนาที่ดำเนินไปหลายเทิร์นเท่านั้น

อินเวิลด์ เรียลไทม์ TTS-2 ถูกสร้างขึ้นสำหรับกรณีที่บุคคลเพิ่งพูดบางอย่างกับมัน โมเดลจะประมวลผลเสียงของเทิร์นก่อนหน้า — ไม่ใช่แค่บทถอดความ — วิเคราะห์น้ำเสียง จังหวะ และสภาวะทางอารมณ์ และเลือกสภาวะการตอบสนองก่อนที่จะพูด หากผู้โทรรู้สึกหงุดหงิด รูปแบบการพูดก็จะเปลี่ยนไป หากพวกเขารู้สึกผ่อนคลาย มันก็จะเปลี่ยนกลับ นั่นคือเหตุผลที่ Inworld ทำการตลาดโมเดลนี้สำหรับเอเจนต์ คู่สนทนา และเกม มากกว่าสำหรับงานบรรยาย: ฟีเจอร์นี้ไร้ความหมายในการแปลงข้อความเป็นเสียงแบบครั้งเดียว แต่มีความหมายในการสนทนา

Cartesia Sonic 3.6 ทำงานแตกต่างออกไป มันเป็นสตรีมมิงเอนจินที่รวดเร็วและมีคุณภาพสูง และข้ออ้างของ Cartesia เองคือการปรับอารมณ์อัตโนมัติจากบทถอดเสียง — มันอ่านคำพูดแล้วปรับเสียงตาม สิ่งที่มันไม่ได้ทำคือการฟังเสียงของเทิร์นก่อนหน้า ภายในคำพูดเดียว (utterance) ทั้งสองอาจฟังดูใกล้เคียงกัน แต่เมื่อเทียบในระดับบทสนทนา Inworld กำลังสร้างโมเดลบางอย่างที่ Sonic ไม่ได้พยายามทำ หากผลิตภัณฑ์ของคุณเป็นเสียงพากย์แบบเทิร์นเดียว โมเดลนั้นคือภาระส่วนเกิน แต่ถ้าเป็นเอเจนต์สด มันคือตัวผลิตภัณฑ์เอง

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

ความเร็ว ราคา และข้อควรระวังเกี่ยวกับ Flash

ในเรื่องความหน่วงโดยแท้จริงแล้ว Cartesia ครองตำแหน่งผู้ถือสิทธิ์อวดอ้าง: เวลาจนถึงเสียงแรกที่ต่ำกว่า 90 มิลลิวินาทีเป็นตัวเลขที่ผู้ผลิตประกาศ แต่ก็เป็นตัวเลขที่บริษัทจัดส่งมาตั้งแต่รุ่น Sonic 3 และยังไม่มีใครเผยแพร่ผลตรวจสอบที่ขัดแย้ง Inworld เปิดตัวเรือธงที่ให้คำตอบในระดับการสนทนาคล้ายกันที่ต่ำกว่า 200 มิลลิวินาที ซึ่งถือว่าเพียงพอสำหรับเอเจนต์สด จุดเล่นด้านความหน่วงที่แท้จริงของ Inworld คือระดับ Flash ที่วางจำหน่ายพร้อมกับโมเดล GA ซึ่งเป็นโมเดลแยกต่างหากที่ใช้เวลาจนถึงไบต์แรกประมาณ 25 มิลลิวินาที ออกแบบมาสำหรับปริมาณงานสูงที่ต้นทุนและความหน่วงระดับ Sonic มีความสำคัญมากกว่าความสามารถในการถ่ายทอดอารมณ์ ข้อแม้คือ Flash เป็นสมาชิกรุ่นที่ถูกตัดทอนของครอบครัวเดียวกัน: รองรับการโคลนเสียงทันทีและเสียงที่ไม่ใช่คำพูดแบบอินไลน์ แต่ไม่รองรับการโคลนเสียงระดับมืออาชีพและไม่มีการควบคุมด้วยภาษาธรรมชาติเต็มรูปแบบ

ราคากลับทิศทาง Sonic 3.6 คิดค่าใช้จ่าย 49.0 ดอลลาร์ต่อล้านตัวอักษร ซึ่งสูงกว่าอัตราแบบจ่ายตามการใช้งานของ Inworld ที่ 25 ดอลลาร์ประมาณสองเท่า และเกือบสี่เท่าของแพ็กเกจระดับสูงสุดที่ 12.50 ดอลลาร์ ช่องว่างด้านคุณภาพระหว่างทั้งสองจากกระดานคะแนนที่ทั้งคู่ปรากฏ ไม่ได้ทำให้ส่วนต่างหลายเท่าเช่นนั้นคุ้มค่าสำหรับผู้ซื้อที่ใช้ปริมาณสูง สำหรับเอเจนต์เสียงแบบเรียลไทม์ที่สร้างตัวอักษรหลายพันตัวต่อการสนทนา ส่วนต่างต่อตัวอักษรนี้คือความแตกต่างระหว่างเศรษฐศาสตร์ต่อหน่วยที่แข็งแรงกับที่บางเฉียบ

เลือกอันไหน

เลือก Cartesia Sonic 3.6 หากสิ่งที่คุณต้องการคือมงกุฎบนบอร์ดผู้ให้บริการ — เสียงที่ได้คะแนนสูงสุดโดยใช้เสียงเนทีฟของตัวเอง Elo 1,282 สำหรับเสียงพูดสั้น ๆ ที่สมบูรณ์ในตัวเอง เช่น คำตอบผู้ช่วย บทพูดในเกม และการอ่านสถานะ ในราคา $49 ต่อล้านตัวอักษร คุณต้องจ่ายเพื่อมงกุฎนี้ และมันยังคงเป็นโมเดลที่ต้องเอาชนะบนบอร์ดนั้น

เลือก Inworld Realtime TTS-2 หากผลิตภัณฑ์คือการสนทนาแบบหลายเทิร์น ซึ่งการส่งเสียงควรตอบสนองต่อคู่สนทนาอีกฝั่งหนึ่ง เช่น สายสนับสนุนลูกค้า เพื่อนคู่ใจ การสัมภาษณ์ หรือการสอนพิเศษ ปัจจุบันโมเดลนี้ครองตำแหน่งผู้นำบนกระดานจัดอันดับแบบควบคุม ซึ่งทุกโมเดลใช้เสียงอ้างอิงแปดเสียงชุดเดียวกัน และทำได้ในราคาประมาณครึ่งเดียวพร้อมกับฟังเสียงของบทสนทนานั้นด้วย

สร้างสวิตช์ไว้ในระบบจัดเส้นทาง หากคุณไม่สามารถรู้ล่วงหน้าได้ว่าการโทรแต่ละครั้งต้องใช้เสียงแบบใด โมเดลทั้งสองยังไม่มีอยู่ใน OrcaRouter ณ เวลาที่เขียนบทความนี้ — Sonic เข้าถึงได้ผ่าน API ของ Cartesia เองและแพลตฟอร์มภายนอกอีกหลายแห่ง ส่วน Inworld เข้าถึงผ่าน API ของตัวเอง — แต่เลเยอร์การจัดเส้นทางคือโครงสร้างที่ทำให้บทสนทนาเริ่มต้นด้วยเสียงหนึ่งแล้วสลับไปยังอีกเสียงหนึ่งได้โดยอัตโนมัติเมื่อเกิดปัญหา โดยราคาที่ประกาศไว้ของผู้ให้บริการแต่ละรายจะถูกส่งผ่านที่มาร์กอัป 0% และในวันที่หนึ่งในบอร์ดเหล่านี้พลิกกลับมาอีกครั้ง — ซึ่งสัปดาห์นี้ก็เกิดขึ้นแล้ว — ทางเลือกก็จะกลายเป็นเพียงการเปลี่ยนคอนฟิกแทนที่จะต้องเขียนโค้ดใหม่.

เวอร์ชันสั้น

นี่คือการแยกทางกันอย่างแท้จริง และคำตอบที่ตรงไปตรงมาก็คือ การแยกทางครั้งนี้เป็นเรื่องของการผลัดกันพูด ไม่ใช่คุณภาพเสียง หากคุณต้องการเสียงสแตนด์อโลนที่ทำคะแนนได้ดีที่สุดโดยใช้เสียงเนทีฟของตัวเอง Cartesia Sonic 3.6 ครองตำแหน่งผู้ให้บริการอันดับหนึ่งด้วย Elo 1,282 และคิดค่าบริการ 49 ดอลลาร์ต่อล้านตัวอักษร หากคุณต้องการเสียงที่ตอบสนองต่อวิธีที่ถูกพูดด้วย Inworld Realtime TTS-2 เพิ่งเข้าสู่สถานะ GA อย่างเป็นทางการในสัปดาห์นี้ ที่ราคา 25 ดอลลาร์แบบจ่ายตามการใช้งาน และครองตำแหน่งผู้นำบนกระดานทดสอบแบบควบคุมที่ทั้งสองโมเดลถูกนำมาเปรียบเทียบด้วยเสียงชุดเดียวกัน พร้อมทั้งมีคุณสมบัติการรับรู้บริบทการสนทนาที่ยังไม่มีสนามทดสอบใดวัดได้ครบถ้วน ตอนนี้กระดานคะแนนถูกแบ่งออกเป็นสองส่วนระหว่างสองโมเดล — ซึ่งเป็นภาพที่ตรงไปตรงมาที่สุดของตลาดที่คำว่า "ดีที่สุด" ขึ้นอยู่กับแบบทดสอบที่ใช้

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube