כרטיס כותרת ראשי עבור 'Inworld Realtime TTS-2 לעומת Cartesia Sonic 3.6 — הקול שמקשיב לעומת מלך הזירות', עם כרטיס שמאלי 'Cartesia Sonic 3.6 — Provider #1 · Elo 1,282 · $49 / 1M תווים' וכרטיס ימני 'Inworld Realtime TTS-2 — Controlled #1 · Elo 1,123 · $25 / 1M תווים', צ'יפ נתון 'כתרים מחולקים — זירות Provider לעומת Controlled', ולוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Inworld Realtime TTS-2 מול Cartesia Sonic 3.6: הקול שמקשיב לעומת מלך הזירות

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

יש שתי תאוריות מתחרות בשאלה מדוע קול סינתטי נחווה כאנושי, וכרגע שתי הדוגמאות המסחריות הטובות ביותר של כל אחת מהן הן Inworld Realtime TTS-2 ו-Cartesia Sonic 3.6. התאוריה של Cartesia היא שהאנושיות נמצאת באודיו: אם הופכים את הגוון, את הפרוזודיה ואת התזמון לבלתי ניתנים להבחנה מאלה של אדם, המאזינים ידרגו אותך במקום הראשון — וזה מה שעשתה Sonic 3.6 באוגוסט, כשקפצה לפסגת זירת ה-Provider Voice של Artificial Analysis עם Elo 1,282. התאוריה של Inworld היא שהאנושיות נמצאת בהאזנה: TTS-2 מתנה את ההגשה שלו באודיו הממשי של השיחה שהתנהלה לפניו, כך שהוא לא רק נשמע כמו אדם, הוא גם מגיב כמו אחד. השבוע שתי התאוריות התנגשו על לוח התוצאות: אותו ניקוד מחדש שהציב את Inworld Realtime TTS-2 במקום השני בלוח הספקים, עם Elo 1,252, הציב אותו גם במקום הראשון בזירת ה-Controlled Voice — הלוח ש-Cartesia הובילה — עם 1,123 מול 1,119 של Sonic 3.6. דגם אחד מחזיק בכתר של לוח הספקים. השני זה עתה לקח את הכתר של ה-Controlled Voice.

זו לא התמודדות שבה צד אחד הוא בבירור הלא-צודק. שני המודלים נבנו למשימות חופפות אך לא זהות, והפער במחיר — סוניק 3.6 ב־49.0 דולר למיליון תווים לעומת 25 דולר לפי דרישה עבור Inworld Realtime TTS-2 — הוא אמיתי מספיק כדי שלהחלטה יש מרכיב תקציבי לצד מרכיב איכותי.

שתי תיאוריות על קול שנשמע אנושי

Cartesia שחררה בשקט את Sonic 3.6 באוגוסט 2026, מהדורת נקודה ששיפרה את Sonic 3.5 מבלי לשנות את המחיר או את סיפור הארכיטקטורה. השיפור ניכר במקום שבו Cartesia הייתה זקוקה לו: המודל קפץ ל-Elo 1,282 בזירת ה-Provider Voice של Artificial Analysis — שבה כל מודל משתמש בקולות מקוריים משלו — והוא שמר על ראשות זירת ה-Controlled Voice לאורך אוגוסט. בלוח המבוקר כל מודל משובט על אותם שמונה רמקולי ייחוס, כך שהכתר הזה הוא פסק דין על מנוע הסינתזה עצמו, בלי תלות בכישרון הקולי. לאחר הניקוד מחדש של Inworld לזמינות הכללית השבוע, Cartesia עדיין מובילה בלוח הספקים, אבל Sonic 3.6 נמצאת כעת במקום ה-2 בלוח המבוקר עם Elo 1,119, ארבע נקודות מאחורי Inworld Realtime TTS-2 שעומד על 1,123.

Inworld Realtime TTS-2 מגיע ממסורת אחרת. הקו שקדם לו, TTS 1.5, שהה בראשית 2026 בצמרת אותן זירות, ובתצוגת המחקר של TTS-2 נמדד Elo של 1,209 בלוח הספקים ביוני. מאז טיפס מודל ה-GA: בלוחות הנוכחיים הוא עומד על 1,252 ב-Provider Voice (מקום 2, מאחורי Sonic 3.6 עם 1,282) ועל 1,123 ב-Controlled Voice (מקום 1). עם זאת, הבידול האמיתי של דגם הדגל אינו ה-Elo שלו, אלא העובדה שהמודל מקבל את תורות השיחה הקודמות כקלט אודיו ומאפשר לכך לעצב את הדרך שבה הוא משמיע את המשפט הבא. Cartesia מכייל את הרגש מתוך התמליל. Inworld מקשיבה לאופן שבו נאמר הדבר האחרון.

לוח התוצאות, מסומן בכנות

נתוני ה־Elo מגיעים מזירות הדיבור של Artificial Analysis, ונקראו מהלוחות החיים בספטמבר 2026. נתוני ההשהיה מדווחים על ידי הספקים אלא אם צוין אחרת, ולא פורסמה ביקורת השהיה בלתי תלויה עבור אף אחד מהמודלים.

• איכות עצמאית — Cartesia Sonic 3.6: Elo 1,282 (#1, Provider Voice) ו-1,119 (#2, Controlled Voice) לעומת Inworld Realtime TTS-2: Elo 1,252 (#2, Provider Voice) ו-1,123 (#1, Controlled Voice)

• מחיר למיליון תווים — $49.0 (לפי מעקב של Artificial Analysis) לעומת $25 לפי דרישה, $20.8 ממוצע משוקלל לפי מעקב של Artificial Analysis, ויורד עד $12.50 בכמות (הספק).

• זמן עד לאודיו ראשון — פחות מ-90 מילישניות (לפי הצהרת הספק) לעומת חציון של פחות מ-200 מילישניות ופחות מ-100 מילישניות באחוזון 99 בבדיקות ההשקה של Inworld (לפי הצהרת הספק); המענה בעל ההשהיה הנמוכה של Inworld ל-Sonic הוא שכבת TTS-2 Flash הנפרדת, עם כ-25 מילישניות עד לבייט ראשון.

• שפות — 42 שפות בלוקליזציה מלאה לעומת 100+ שפות להכוונת אספקה, כשהטענה של Inworld בדבר זהות קול אחת משתרעת על 200+ לוקאלים (לפי הצהרת הספק)

• שכפול קול מיידי — כ-10 שניות של אודיו לעומת 5–15 שניות, בתוספת גרסת בטא לשכפול מקצועי הדורשת כ-10 דקות של אודיו לשכפולים באיכות גבוהה יותר

• בקרת הגשה — תגי תמלול מוטבעים כמו [laughter], בתוספת ויסות עוצמה ומהירות, לעומת הנחיה באנגלית פשוטה כמו "[calm, reassuring]" או [whisper], הוראות ברמת בקשה, ושלושה מצבי יציבות מ-Stable ל-Expressive

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

למה "ההקשבה לשיחה" היא ציר שונה?

לוח התוצאות שלמעלה מודד כיצד קול נשמע בבידוד. הממד שבו שני המודלים באמת נבדלים אינו מופיע באף לוח תוצאות, כיוון שהוא קיים רק על פני מספר תורות.

Inworld Realtime TTS-2 בנוי למקרה שבו אדם בדיוק אמר משהו אליו. המודל קולט את האודיו של סיבובי השיחה הקודמים — לא רק תמליל שלהם — מנתח את הטון, הקצב והמצב הרגשי, ובוחר מצב תגובה לפני שהוא מדבר. אם המתקשר מתוסכל, סגנון הדיבור משתנה; אם הוא רגוע, הסגנון חוזר לקדמותו. זו הסיבה ש-Inworld משווקת את המודל לסוכנים, לבני לוויה ולמשחקים, ולא לקריינות: התכונה חסרת משמעות בקריאה חד-פעמית להמרת טקסט לאודיו, אך משמעותית בשיחה.

Cartesia Sonic 3.6 פועל אחרת. זהו מנוע סטרימינג מהיר ואיכותי, והטענה של Cartesia עצמה היא כיול רגשי אוטומטי מהתמליל — הוא קורא את המילים ומתאם את עצמו בהתאם. מה שהוא לא עושה הוא להאזין לאודיו של התורות הקודמות. בתוך אמירה בודדת, השניים יכולים להישמע דומים; לאורך שיחה, Inworld ממדלת משהו ש-Sonic אינו מנסה לעשות. אם המוצר שלך הוא קריינות של תור אחד, המידול הזה הוא תקורה. אם הוא סוכן חי, הוא המוצר.

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

מהירות, מחיר, ואזהרת הפלאש

בנוגע לשהייה טהורה, Cartesia מחזיק בזכויות ההתפארות: זמן עד לאודיו ראשון של מתחת ל-90 אלפיות השנייה הוא הצהרת ספק, אבל זה הנתון שהחברה שולחת מאז דור Sonic 3, ואף אחד לא פרסם ביקורת סותרת. הדגל של Inworld עונה במחלקת שיחה דומה במתחת ל-200 אלפיות השנייה, וזה בסדר לסוכנים חיים. משחק השהייה האמיתי של Inworld הוא שכבת Flash שנשלחה לצד מודל GA — מודל נפרד עם זמן עד לבייט ראשון של כ-25 אלפיות השנייה, המיועד לעומסים בנפח גבוה שבהם עלות ושהייה ברמת Sonic חשובות יותר מיכולת ביטוי. הסייג הוא ש-Flash הוא חבר מצומצם במשפחה: שיבוט מיידי ואמירות לא-מילוליות מובנות, אבל לא שיבוט מקצועי ולא היגוי מלא בשפה טבעית.

לעומת זאת, בכל הנוגע למחיר, התמונה הפוכה: Sonic 3.6 עולה 49.0 דולר למיליון תווים — בערך פי שניים מתעריף השימוש לפי דרישה של Inworld (25 דולר), וכמעט פי ארבעה מהדרגה הגבוהה ביותר שלה (12.50 דולר). פער האיכות בין השניים, בלוחות הדירוג שבהם שניהם מופיעים, אינו מצדיק מכפלת מחיר כזו עבור רוכש בהיקף גדול. עבור סוכן קולי בזמן אמת שמייצר אלפי תווים בכל שיחה, פער המחיר לתו הוא ההבדל בין כלכלת יחידה בריאה לכלכלה דלה.

מה לבחור

בחרו ב-Cartesia Sonic 3.6 אם כתר לוח-הספקים הוא מה שאתם רוצים — הקול בעל הניקוד הגבוה ביותר שמשתמש בקולות המקוריים שלו, Elo 1,282, לאמירות קצרות ועצמאיות כמו תשובות עוזר, שורות משחק וקריאות מצב. במחיר של $49 למיליון תווים אתם משלמים על הכתר, והוא נותר המודל שיש לנצח בלוח הזה.

בחר ב-Inworld Realtime TTS-2 אם המוצר הוא שיחה רב-סיבובית שבה הדיבור צריך להגיב לאדם שממול — שיחות תמיכה, בן לוויה, ראיון, שיעור פרטי. הוא כעת מוביל את לוח הדירוג המבוקר, שבו כל מודל מדבר באותם שמונה קולות ייחוס, וזאת בכמחצית המחיר תוך כדי הקשבה לאודיו של השיחה.

הטמע את מנגנון ההחלפה בשכבת הניתוב אם לא ניתן לדעת מראש איזה סוג קול שיחה דורשת. נכון לכתיבת שורות אלה, אף אחד מהמודלים אינו כלול ב-OrcaRouter — Sonic זמין דרך ה-API של Cartesia עצמה ומספר פלטפורמות של צד שלישי, ו-Inworld דרך ה-API שלו — אבל שכבת ניתוב היא בדיוק המבנה שמאפשר לשיחה להתחיל בקול אחד ולעבור לקול השני, כשמחיר הרשימה של כל ספק מועבר הלאה ללא תוספת (0%). ביום שאחד הלוחות האלה מתהפך שוב — והשבוע זה קרה — הבחירה הופכת לשינוי תצורה במקום לשכתוב.

הגרסה הקצרה

מדובר בפיצול אמיתי, והתשובה הכנה היא שהפיצול נוגע לתורות השיחה (turn-taking), לא לאיכות השמע. אם אתם צריכים קול עצמאי עם הציון הגבוה ביותר שמשתמש בקולות המובנים שלו, Cartesia Sonic 3.6 מחזיק בכתר הספקים עם Elo של 1,282 וגובה עבורו 49 דולר למיליון תווים. אם אתם צריכים קול שמגיב לאופן שבו דיברו אליו, Inworld Realtime TTS-2 הגיע השבוע לזמינות כללית (GA) במחיר של 25 דולר לפי דרישה, מוביל את הדירוג המבוקר שבו שני המודלים נבחנים עם אותם קולות, ומציע תכונת מודעות שיחתית שאף זירת השוואה אינה מודדת במלואה. לוחות הדירוג מפוצלים כעת בין שני המודלים — וזו התמונה הכנה ביותר האפשרית של שוק שבו "הטוב ביותר" תלוי במבחן.

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.