
GPT-Live-1 מול Cartesia Sonic 3.6: לוח ה-TTS מספר אחת לא מודד קטיעות
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
Cartesia Sonic 3.6 מוביל כיום בשתי זירות המרת טקסט לדיבור של Artificial Analysis — 1,275 Elo בלוח Provider Voice, וראשון גם בלוח Controlled Voice, לפני כל מנוע מסחרי שיש סביבו פלטפורמה גדולה יותר. GPT-Live-1 אינו מדורג באף אחד מהשניים, משום שהוא אינו מודל של המרת טקסט לדיבור. הוא נמצא במקום השישי במשותף מתוך ארבעה עשר בלוח אחר של Artificial Analysis, מדד הדיבור לדיבור (Speech to Speech Index), עם 70.3%. בקריאה משותפת, שתי העובדות הללו מתארות את הפיצול האמיתי בין המוצרים הללו: סביר מאוד ש-Sonic 3.6 הוא הקול הטוב יותר, ו-GPT-Live-1 הוא היחיד מבין השניים שמסוגל לשמוע את המתקשר מתחיל לדבר ומפסיק.
Both are live and both are commercially available — Sonic 3.6 on Cartesia's own API since its stable snapshot landed on August 27, 2026, GPT-Live-1 on OpenAI's developer API since September 10, 2026, at $0.05 per voice minute. Choosing between them is not a quality decision. It is a decision about which half of a voice agent you are buying.
שתי זירות, שתי שאלות, ולמה הפיצול אמיתי
Artificial Analysis מפעילה את לוחות הדיבור שלה באופן שכדאי להבין לפני שמצטטים לך Elo כזה או אחר. זירת Provider Voice מדרגת מנועים לפי הקולות המקוריים של כל ספק — היא מודדת את הקול שמקבלים בפועל מהקופסה, וזה המספר שמעניין קונה. זירת Controlled Voice משכפלת כל מודל על אותם שמונה קולות ייחוס, כך שמאזינים משווים את מנוע הסינתזה ולא את הכישרון הקולי. Sonic 3.6 מוביל בשניהם, וזה נדיר יותר ממה שזה נשמע: לשני הלוחות היו אלופים שונים במשך רוב שנת 2026.
אף אחד מהלוחות אינו מכיל דגימה אחת של מודל שנקטע. הם מודדים איך נשמעת דיבור, בבידוד, למאזין. מדד ה-Speech to Speech Index בנוי אחרת — הוא שוקל חשיבה דיבורית, ביצועים סוכניים, העדפת זירה והצלחת משימות לכדי נתון אחד, והוא מקבל רק מודלים שהם דיבור-אל-דיבור באופן טבעי. ל-Cartesia אין רשומה שם. לא מפני ש-Sonic 3.6 גרוע, אלא מפני שלמנוע טקסט-לדיבור אין מה להגיש.
אז 1,275 ו-70.3% אינם מספרים מתחרים, וכל השוואה שמעמידה אותם על אותו קו משקרת לך בשקט. מה שהם קובעים יחד הוא שאיכות חדלה להיות הציר שסביבו סובבת ההחלטה הזו.

מימד אחר מימד
• Kind — GPT-Live-1: דיבור-לדיבור בדופלקס מלא, מודל אחד לכל הלולאה לעומת Cartesia Sonic 3.6: טקסט-לדיבור בזרימה, בשילוב עם זיהוי דיבור Ink-2 עבור סוכנים
• איכות עצמאית — GPT-Live-1: 70.3% במדד Speech to Speech, מקום שישי משותף מתוך ארבעה עשר לעומת Cartesia Sonic 3.6: 1,275 Elo בלוח ה-Provider Voice, מתוך 1,755 דגימות, וגם ראשון בלוח ה-Controlled Voice
• טיפול בהפרעות — GPT-Live-1: תכונה של המודל, שמחליטה פעמים רבות בשנייה אם לוותר על התור, לעומת Cartesia Sonic 3.6: תבנית אינטגרציה, שבה הלקוח מבטל את הקשר הסינתזה ונשען על חותמות זמן ברמת המילה כדי לחתוך ברגע הנכון
• מחיר — GPT-Live-1: $0.05 לדקת קול, בחיוב לפי שנייה, כאשר מנוע החשיבה מחויב בנפרד לעומת Cartesia Sonic 3.6: כ-$49 למיליון תווים במסגרת תוכניות קרדיט, בתוספת $0.06 לדקת משך שיחת סוכן ו-$0.014 לדקה עבור מספר טלפון של Cartesia
• Latency — GPT-Live-1: no model-level figure published; turn-taking latency given as 0.798 seconds in OpenAI's own testing vs Cartesia Sonic 3.6: under 90 milliseconds time-to-first-audio, vendor-stated and not independently measured end to end
• תפוקה — GPT-Live-1: סשנים במקביל, מוגבל ל-25 ברמה 1 ו-500 ברמה 5, ללא רמה חינמית לעומת Cartesia Sonic 3.6: כ-132 תווים בשנייה, בערך כפול מקצב v3 של ElevenLabs באותה השוואה, עם רמה חינמית של 20,000 קרדיטים חודשיים
• שפות — GPT-Live-1: שטף לא אחיד מחוץ לשפות המרכזיות בכיסוי ההשקה לעומת Cartesia Sonic 3.6: 44 שפות ב-61 לוקאלים, עם אודיה ואורדו שנוספו במהדורה הזו
• שליטה קולית — GPT-Live-1: שנים עשר פריסטים, טון וקצב באמצעות הנחיה, ללא שיבוט לעומת Cartesia Sonic 3.6: יותר מ-500 קולות מוגדרים מראש, שיבוט מיידי, שיבוט מקצועי בחבילות מתקדמות, חותמות זמן ברמת המילה והפונ�מה, וללא SSML — המודל מתאים את הקצב מהטקסט עצמו

Barge-in הוא תכונה של הארכיטקטורה, לא תיבת סימון.
הדבר הנפוץ ביותר שקונים טועים בו בהשוואה הזו הוא להתייחס לתמיכה בהפרעה כאל ערך בוליאני. התיעוד של Cartesia גלוי לגבי אופן הפעולה של הגרסה שלה: כאשר המתקשר מדבר מעל הסוכן, הלקוח שולח ביטול עבור הקשר הסינתזה הנוכחי, וחותמות הזמן ברמת המילה שמוחזרות בחיבור ה-WebSocket הן מה שמאפשר לעצור את ההשמעה בהברה הנכונה. זהו תכנון מוכשר, וכך רוב סוכני הקול בייצור מתמודדים כיום עם התפרצויות.
It is still a design in which the decision to stop talking was made by your application, using a voice-activity signal, at whatever latency the round trip allows. GPT-Live-1 moves that decision inside the model. It is continuously deciding whether to keep listening, pause, take the turn or hand it over, which is why OpenAI's own figures report 80.1% interactivity against 45.4% for GPT-Realtime-2.1 on Full Duplex Bench v1.5, with turn-taking latency of 0.798 seconds against 1.41. Those numbers are OpenAI's, published with the release and not reproduced by anyone outside the company — but the architectural difference behind them is not in dispute, and it is the one thing a cascade cannot approximate by tuning.
המקום שבו הקסקדה מנצחת הוא כל מה שבמורד הזרם מהמשפט. הזמן עד לאודיו הראשון של Cartesia — מתחת ל־90 אלפיות השנייה — הוא נתון של ספק והוא מודד את המודל, לא את השיחה: המספר שהמתקשר חווה כולל גם זיהוי דיבור, זיהוי תורי שיחה, זמן היצירה של מודל השפה, העברה ברשת וחציצת אודיו. זו בדיוק הסיבה שכדאי לבנות קסקדה כשצריך לשלוט בכל שלב — מודל קטן ומהיר לתורי שיחה פשוטים, מודל חזית לקשים, וסינתיסייזר שלעולם לא גורם לך להמתין.
שלב הביניים הזה הוא החלק היחיד מכל אחת מהמחסניות שהוא באמת נייד, והוא החלק שמכריע גם את האיכות וגם את העלות של השיחה. בערך 190 מודלים מאחד-עשר ספקי upstream יושבים מאחורי מפתח OrcaRouter אחד במחיר המחירון של הספק וללא תוספת, וה-DSL של הניתוב מאפשר לנקודת קצה בודדת לשלוח תורות פשוטים למודל זול ולהסלים את המסובכים למודל חוד — הדפוס שסוכן קולי באמת רוצה, מיושם על השלב שהכי משתנה. לא ניתן להגיע אל Sonic 3.6 ואל GPT-Live-1 דרך שכבת ניתוב; שכבות הקול שייכות לספקים שלהן.

לנהל את הכסף
שני מודלי התמחור אינם תואמים, ולכן כדאי לבצע את ההמרה כראוי. קצב הדיבור הוא בערך 150 מילים בדקה, ובאנגלית יש בממוצע כחמישה וחצי תווים למילה, כך שדקה של פלט מדובר היא בסביבות 800 עד 900 תווים. במחיר של 49 דולר למיליון תווים, הסינתזה של Cartesia עולה כארבעה סנטים לדקת אודיו.
ואז מגיע שאר המפל. Cartesia גובה $0.06 עבור כל דקה של משך שיחה עם סוכן קולי, ו־$0.014 לדקה אם אתה משתמש במספר הטלפון שלה, בנוסף לחיוב לפי תווים. הוסיפו זיהוי דיבור ומודל שפה עבור הטקסט, ותעברו את עשרת הסנטים לדקה לפני שמישהו בכלל אמר משהו קשה. ה־$0.05 של GPT-Live-1 לדקת קול מכסה את ההקשבה, את חילופי התורות ואת הדיבור, כאשר ההסקה המואצלת מחויבת בנפרד לפי התעריף הרגיל של מודל הבקאנד — שעבור שיחת הזמנה עם חיפוש או שניים מצורפים הוא מספר ממשי, לא שגיאת עיגול.
נקודת ההצטלבות נמצאת בנפח ובדרגת הקושי. שיחות קצרות, חזרתיות ובנפח גבוה — אישורים, התראות, חיפושים פשוטים — מעדיפות את הקסקדה, מפני שמודל זול שעונה על שאלה מתוסרטת הוא הדבר הזול ביותר בהשוואה הזו. שיחות שבהן המתקשר יוצא מהתסריט, מדבר מעל הסוכן, או משנה את דעתו באמצע המשפט מעדיפות את המודל מקצה לקצה, מפני שצורת הכשל של הקסקדה שם אינה תשובה שגויה, אלא תשובה מביכה.
איזה אחד לבחור?
בחר ב-Cartesia Sonic 3.6 אם אתה רוצה את הקול בעל הניקוד הגבוה ביותר הזמין ואתה מוכן לקחת על עצמך את היגיון השיחה. זו הבחירה הנכונה לקריינות, לסוכנים מתוסרטים בנפח גבוה, לצוותים עם צינור זיהוי דיבור קיים, ולכל מי שזקוק לחותמות זמן ברמת המילה שמאפשרות טיפול מדויק בהפרעות. אתה מקבל מסלול חינמי, יותר מ-500 קולות, שיבוט, 44 שפות ואת הפסגה של שני לוחות האיכות, ואתה שומר על שליטה בכל שלב.
בחר ב-GPT-Live-1 אם ההפרעה היא המוצר. כל מקרה שבו שמדברים מעליך הוא המקרה הרגיל ולא מקרה קצה, ושבו העברת תור של 0.8 שניות עדיפה על התחלה של 90 אלפיות שנייה במשפט שאף אחד לא סיים לשאול. אתה מקבל מודל סגור, מתארח, לפי דקה, עם שנים עשר קולות וללא שיבוט, ואתה מקבל שציון האיכות העצמאי שלו הוא באמצע הטבלה.
הפיתוי הוא לקרוא 1,275 מול 70.3% ולהכריז שזה מוכרע. זה לא, וההבדל בין שני המספרים האלה הוא כל הוויכוח: האחד מודד איך קול נשמע, האחר מודד אם שווה לדבר איתו.
