כרטיס כותרת ראשי עבור 'GPT-Live-1 מול Inworld Realtime TTS-2', עם כתובית משנה 'הסינתזה נעשית זולה; השמיעה עדיין יקרה', ושלושה כרטיסים ובהם כתוב 'Inworld Realtime TTS-2: $25 ל-1 מיליון תווים, בירידה מדורגת ל-$12.50', 'Inworld Realtime TTS-2 Flash: $15 ל-1 מיליון תווים, בירידה מדורגת ל-$7', 'GPT-Live-1: $0.05 לדקת קול, בתוספת הנימוק שמאחוריו', מעל פס תחתון ובו כתוב 'תמחור Inworld פורסם על ידי הספק, ספטמבר 2026; תמחור GPT-Live-1 לפי התיעוד של OpenAI.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

GPT-Live-1 לעומת Inworld Realtime TTS-2: מלחמת מחירים על קולות, פרמיה על הקשבה

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Inworld Realtime TTS-2 הגיע לזמינות כללית עם משהו ששוק הקול חסר: מחירון מפורסם. דגם הדגל עולה $25 למיליון תווים לפי דרישה, ה"אח" המהיר שלו Inworld Realtime TTS-2 Flash עולה $15, ושניהם יורדים דרך מדרגות נפח ל-$12.50 ול-$7, בהתאמה. כשהוא ממוקם ב-Elo 1,244 ובמקום השני בזירת הדיבור של Artificial Analysis, זה הופך את דגם הדגל לבערך חצי מהמחיר של מוביל הזירה הנוכחי ולאחת הדרכים הזולות ביותר לרכוש קול מהחמישייה המובילה. GPT-Live-1 הוא הדגם האחר בהשוואה הזו וההצעה ההפוכה — $0.05 לדקת קול, בלי תווים בכלל, ואין דרך לקנות אותו בלי לקנות גם את ההאזנה, את ניהול התורות ואת הטיפול בקטיעות שמגיעים יחד איתו.

הדבר המעניין בהשוואה ביניהם הוא שפער המחירים נראה עצום ואז ברובו מתנדף. סינתזה נמצאת במלחמת מחירים. שיחה לא.

מה Inworld באמת שחררה

קו TTS-2 החל כתצוגה מקדימה מחקרית במאי 2026 עם טענה ספציפית: שזהו מודל שאינו מייצר דיבור באופן מבודד. הוא לוקח את תורי השיחה הקודמים כקלט אודיו, שוקל את הטון והקצב, ומתאים את אופן תגובתו. המיצוב הזה — מודעות שיחתית ולא אודיו נקי יותר — הוא מה שהבדיל אותו ממנועי הקריינות ששלטו בהמרת טקסט לדיבור במהלך 2025.

זמינות כללית הפכה את התצוגה המקדימה למשפחה וצירפה רשימת מחירים. Flash הוא מהלך התפוקה, כאשר Inworld מציינת זמן של כ-20 מילישניות עד בית ראשון בצד השרת באחוזון ה-90, לעומת 100 מילישניות בדגם הדגל וחציון של פחות מ-200 מילישניות עד לשמע הראשון. אלה נתוני ספק מהתיעוד של Inworld עצמה; המדידה היחידה של צד שלישי שנמצאת במחזור, מבית Coval, מציבה את Flash בכ-25 מילישניות ואת דגם הדגל במאות הנמוכות. אף אחד מהם לא עבר ביקורת עצמאית מקצה לקצה.

התכונה שהכי שווה לציין אינה קשורה כלל להשהיה. Inworld הוסיפה מצב מילולי כך שמספרי הזמנות, קודי אישור, כתובות ומספרים סידוריים נקראים בחזרה תו-אחר-תו במקום לעבור נרמול למשהו שנשמע טבעי אבל שגוי. עבור סוכן קולי שזה עתה קיבל הזמנה, התג הבודד הזה הוא ההבדל בין מוצר עובד לבין דמו שמועבר לטיפול אנושי.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

מימד אחר מימד

• סוג — GPT-Live-1: דיבור-לדיבור full-duplex במודל אחד לעומת Inworld Realtime TTS-2: מודל טקסט-לדיבור, עם דופלקס זמין בנפרד דרך Inworld's Realtime API

• מחיר ליחידה — GPT-Live-1: $0.05 לדקת קול, בחיוב לפי שנייה, מנוע החשיבה מחויב בנפרד לעומת Inworld Realtime TTS-2: $25 למיליון תווים לפי דרישה, $20 במסלול Creator ו-$12.50 בדרגה העליונה, כאשר Flash מתומחר ב-$15, $10 ו-$7

• איכות עצמאית — GPT-Live-1: 70.3% במדד Speech to Speech, מקום שישי משותף מתוך ארבעה־עשר לעומת Inworld Realtime TTS-2: Elo 1,244 מ־1,091 דגימות ובמקום השני ב־Artificial Analysis Provider Voice arena, כאשר Flash עם Elo 1,211 מ־1,626 דגימות ובמקום השישי

• הפרעה — GPT-Live-1: מובנית, נקבעת בתוך המודל פעמים רבות בשנייה לעומת Inworld Realtime TTS-2: אינה תכונה של מודל ה-TTS; ה-Realtime API של Inworld תומך בהתפרצות (barge-in) עם השהיית הפרעה של כ-100 מילישניות, דרך סוקט יחיד שמדבר בפרוטוקול OpenAI Realtime

• השהיה — GPT-Live-1: 0.798 שניות השהיית חילופי תורות בבדיקות של OpenAI עצמה, לא פורסם זמן עד לאודיו הראשון לעומת Inworld Realtime TTS-2: 100 מילישניות בצד השרת באחוזון ה-90, Flash ב-20, עם חציון של מתחת לשנייה לקטע האודיו הראשון לאורך כל צינור ה-Realtime API

• שפות — GPT-Live-1: שפות עיקריות מטופלות היטב, אך לא אחיד מעבר להן לעומת Inworld Realtime TTS-2: מעל 200 לוקאלים, עם 15 באיכות דרג 1 ו-79 נוספים בדרג 2, וזהות קולית אחת נשמרת בכולם

• קולות ושיבוט — GPT-Live-1: שנים עשר פריסטים, ללא שיבוט לעומת Inworld Realtime TTS-2: 282 קולות מובנים, שיבוט zero-shot מיידי מ-5 עד 15 שניות של אודיו מורשה, שיבוט מקצועי ושליטה מלאה בהגשה רק בדגם הדגל

• פריסה — GPT-Live-1: אירוח בלבד, נקודת קצה אחת, ללא שכבה חינמית, מקביליות מוגבלת ל-25 עד 500 סשנים, לעומת Inworld Realtime TTS-2: API מתארח בתוספת מכולה מקומית בגישה מוגבלת הדורשת H100, ושכבה חינמית לפי דרישה הכוללת עד כ-70 דקות של סינתזה

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Inworld Realtime TTS-2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Languages: major languages only'. The right column, labelled Inworld Realtime TTS-2, reads 'Kind: text-to-speech; duplex via the separate Realtime API', 'Price: $25 per 1M characters, from $12.50 on volume', 'Time to first byte: 100 ms p90, 20 ms for Flash (vendor)', 'Barge-in: ~100 ms, cascade-level', 'Independent score: Elo 1,244, #2 on the AA Provider Voice arena', 'Languages: 200+ locales, 15 at Tier 1 quality'. The footer reads 'Inworld latency and pricing vendor-published; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

שאלת הדופלקס, נענית במדויק

קל היה לנסח את ההשוואה הזו כ"אחד מקשיב, השני רק מדבר", וזה היה שגוי באופן שמשנה. המודלים של Inworld להמרת טקסט לדיבור הם טקסט נכנס, אודיו יוצא. אבל Inworld מוכרת גם Realtime API שפועלת על חיבור WebSocket, WebRTC או SIP בודד והיא דופלקסית מלאה במובן שחשוב לבונה: היא כוללת זיהוי פעילות דיבור סמנטי עם הגדרת נכונות מתכווננת, תומכת בשליטה ידנית בתורות, ומפסיקה עם חפיפת דיבור תוך כ-100 מילישניות. היא תואמת פרוטוקול לממשק ה-Realtime של OpenAI, מה שהופך את המעבר לתרגיל קונפיגורציה ולא לכתיבה מחדש.

מה ש-Inworld's Realtime API אינו הוא מודל דיבור-לדיבור נייטיבי. הוא קסקדה — מודל זיהוי דיבור שניתן להחליפו, מודל שפה לפי בחירתך, וסינתיסייזר — המתוזמרת בתוך חיבור אחד. זו בחירה ארכיטקטונית לגיטימית, והיא אותה בחירה שרוב סוכני הקול בסביבת ייצור עושים. היא פשוט שונה מזו של GPT-Live-1, שבו מודל יחיד מחליט מתי למסור את התור.

ההבדל המעשי מתגלה כאשר המתקשר מפריע באמצע משפט. בקסקדה, ההפרעה מזוהה, היצירה מבוטלת, ומתחיל תור חדש — רצף שעובד היטב ועולה לך בהלוך ושוב אחד. במודל מקצה־לקצה, ההחלטה כבר התקבלה ברציפות. הראשונה היא מערכת שמגיבה במהירות. האחרונה היא מערכת שמעולם לא הפסיקה להקשיב.

A screenshot of Inworld AI's official pricing page, showing per-million-character rates for its speech models. The On-Demand column lists TTS-2 at $25 per 1M characters, TTS-2 Flash at $15, STT-1 at $0.15 per hour and LLMs at cost, alongside the inclusions 'Up to 70 min TTS included', '100 custom voices', 'Voice cloning & voice design', 'Realtime API access', '220+ LLM models via Router' and 'Commercial license'. The Creator column at $25 per month shows TTS-2 reduced to $20 and Flash to $10, with 500 custom voices and up to 33% off TTS and STT rates.

מריצים את המספרים, כי היחידות מסתירות את התשובה

דיבור נע בקצב של כ-150 מילים בדקה, ובאנגלית יש בממוצע כחמישה וחצי תווים למילה, כך שדקה של פלט מדובר היא כ-800 עד 900 תווים. בתעריף של 25 דולר למיליון, Inworld Realtime TTS-2 מייצר דקת דיבור תמורת כשני סנטים. בתעריף של 15 דולר של Flash, זה פחות מסנט וחצי.

מול 0.05 דולר לדקת קול של GPT-Live-1, זה נראה כמו מפלה מוחצת — עד שתמחרו את כל השאר ש-GPT-Live-1 עושה. ה-Realtime API של Inworld עדיין זקוק לזיהוי דיבור ולמודל שפה, ששניהם מחויבים בנפרד, ושניהם נושאים השהיה משלהם. כשמכניסים אותם לחשבון, העלות לדקה של הקסקדה מטפסת מעל לניקל עבור כל שיחה שכוללת שאלה אמיתית. הפרמיה של המודל מקצה לקצה אינה עבור הקול. היא עבור חלוקת התורות, והיא בערך העלות של שלב זיהוי הדיבור שאתם כבר לא קונים.

המקום שבו הקסקייד מנצח באופן מכריע הוא בנפח ללא שיחה. שיחות התראה, אישורי מסירה, תזכורות לפגישות, IVR מתוסרט — כל דבר שבו הטקסט ידוע לפני שהשיחה מתחילה ואף אחד לא הולך להפריע. שם, תמחור לפי תווים של 7 עד 15 דולר למיליון הוא פשוט זול יותר מדופלקס לפי דקה, ותשלום על חילופי תורות שלעולם לא תעשה בהם שימוש הוא בזבוז.

קיים גם נתיב אמצעי שהמסגור הדו־מודלי מסתיר. אם ממילא אתם מרכיבים מפל (cascade), שכבת הדיבור לא חייבת להגיע מספק קולי ייעודי: מודלי ה־TTS של OpenAI עצמה ומודלי ה־TTS בתצוגה המקדימה של Gemini מבית Google הם נקודות קצה רגילות של API, והם מנותבים. בסביבות 190 מודלים מאחד עשר ספקים במעלה הזרם יושבים מאחורי מפתח OrcaRouter אחד במחיר המחירון של הספק ובלי תוספת — כך שמודל סינתזה יכול לשבת באותו קטלוג, על אותו מפתח ואותה חשבונית, כמו מודל ההיסק שהוא מזין, עם מעבר אוטומטי לגיבוי אם נקודת קצה אחת נחלשת באמצע הפריסה. זהו השלב הכי פחות זוהר במערכת קולית והקל ביותר לאיחוד. לא ה־Realtime TTS-2 של Inworld ולא נקודת הקצה Live Sessions של GPT-Live-1 זמינים בדרך הזאת; השניים האלה שייכים לספקים שלהם.

איזה אחד לבחור?

בחרו ב-Inworld Realtime TTS-2 אם הנפח הוא העיקר והשיחה מתוסרטת. סוכנים בעלי תפוקה גבוהה, התראות, מוצרים רב-לשוניים שבהם חשובים 200 לוקאלים וזהות קולית אחת שנשמרת, או כל פריסה שזקוקה לקונטיינר באתר הלקוח. אתם מקבלים קול בטופ-2 של הארנה בכחצי מהמחיר של המוביל, מסלול חינמי לאב-טיפוס, שכפול ש-GPT-Live-1 אינו מציע כלל, ו-Realtime API שמתמודד היטב עם קטיעות בתבנית הקסקדה שאתם כנראה כבר מריצים.

בחרו ב-GPT-Live-1 אם ההפרעה היא המוצר. שיחות שיוצאות מהתסריט, מתקשרים שמדברים מעל הסוכן, תהליכי עבודה שבהם חלופת התורות היא ההבדל בין שיחה לתפריט. אתם משלמים תעריף לפי דקה שלא יורד כשהדיבור נעשה זול, אתם מוותרים על שיבוט ועל 200 שפות, ואתם קונים בחזרה את התפרים.

מלחמת המחירים בסינתזה היא אמיתית, והיא חדשות טובות לכל מי שבונה סוכן קולי — קול מהחמישייה המובילה עולה כיום חמישית ממה שעלה לפני שמונה-עשרה חודשים. היא פשוט לא פותרת את ההשוואה הזאת, מפני שהדבר שעבורו GPT-Live-1 גובה כסף אינו הדבר ש-Inworld נותנת עליו הנחה.