כרטיס כותרת ראשי עבור 'GPT-Live-1 vs Cartesia Sonic 3.6', עם כותרת משנה 'הקול הנשמע הטוב ביותר אינו זה שמסוגל לשמוע אותך', הנושא שלושה כרטיסים שעליהם כתוב 'Cartesia Sonic 3.6: 1,275 Elo, מקום 1 בשתי זירות הדיבור של Artificial Analysis', 'GPT-Live-1: 70.3% ב-Speech to Speech Index, מקום 6 משותף מתוך 14', 'לוחות תוצאות שונים, מפני שהם מודדים דברים שונים', מעל פס תחתון שעליו כתוב 'נתוני הזירה לפי Artificial Analysis; נתוני האינטראקטיביות של GPT-Live-1 מדווחים על ידי OpenAI.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

GPT-Live-1 מול Cartesia Sonic 3.6: לוח ה-TTS מספר אחת לא מודד קטיעות

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Cartesia Sonic 3.6 מוביל כיום בשתי זירות המרת טקסט לדיבור של Artificial Analysis — 1,275 Elo בלוח Provider Voice, וראשון גם בלוח Controlled Voice, לפני כל מנוע מסחרי שיש סביבו פלטפורמה גדולה יותר. GPT-Live-1 אינו מדורג באף אחד מהשניים, משום שהוא אינו מודל של המרת טקסט לדיבור. הוא נמצא במקום השישי במשותף מתוך ארבעה עשר בלוח אחר של Artificial Analysis, מדד הדיבור לדיבור (Speech to Speech Index), עם 70.3%. בקריאה משותפת, שתי העובדות הללו מתארות את הפיצול האמיתי בין המוצרים הללו: סביר מאוד ש-Sonic 3.6 הוא הקול הטוב יותר, ו-GPT-Live-1 הוא היחיד מבין השניים שמסוגל לשמוע את המתקשר מתחיל לדבר ומפסיק.

Both are live and both are commercially available — Sonic 3.6 on Cartesia's own API since its stable snapshot landed on August 27, 2026, GPT-Live-1 on Open​AI's developer API since September 10, 2026, at $0.05 per voice minute. Choosing between them is not a quality decision. It is a decision about which half of a voice agent you are buying.

שתי זירות, שתי שאלות, ולמה הפיצול אמיתי

Artificial Analysis מפעילה את לוחות הדיבור שלה באופן שכדאי להבין לפני שמצטטים לך Elo כזה או אחר. זירת Provider Voice מדרגת מנועים לפי הקולות המקוריים של כל ספק — היא מודדת את הקול שמקבלים בפועל מהקופסה, וזה המספר שמעניין קונה. זירת Controlled Voice משכפלת כל מודל על אותם שמונה קולות ייחוס, כך שמאזינים משווים את מנוע הסינתזה ולא את הכישרון הקולי. Sonic 3.6 מוביל בשניהם, וזה נדיר יותר ממה שזה נשמע: לשני הלוחות היו אלופים שונים במשך רוב שנת 2026.

אף אחד מהלוחות אינו מכיל דגימה אחת של מודל שנקטע. הם מודדים איך נשמעת דיבור, בבידוד, למאזין. מדד ה-Speech to Speech Index בנוי אחרת — הוא שוקל חשיבה דיבורית, ביצועים סוכניים, העדפת זירה והצלחת משימות לכדי נתון אחד, והוא מקבל רק מודלים שהם דיבור-אל-דיבור באופן טבעי. ל-Cartesia אין רשומה שם. לא מפני ש-Sonic 3.6 גרוע, אלא מפני שלמנוע טקסט-לדיבור אין מה להגיש.

אז 1,275 ו-70.3% אינם מספרים מתחרים, וכל השוואה שמעמידה אותם על אותו קו משקרת לך בשקט. מה שהם קובעים יחד הוא שאיכות חדלה להיות הציר שסביבו סובבת ההחלטה הזו.

A screenshot of the Artificial Analysis Speech to Speech Index chart, ranking fourteen natively speech-to-speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7% and Gemini 2.5 Flash at 52.8%. A companion panel charts cost per hour of input audio across the same field.

מימד אחר מימד

• Kind — GPT-Live-1: דיבור-לדיבור בדופלקס מלא, מודל אחד לכל הלולאה לעומת Cartesia Sonic 3.6: טקסט-לדיבור בזרימה, בשילוב עם זיהוי דיבור Ink-2 עבור סוכנים

• איכות עצמאית — GPT-Live-1: 70.3% במדד Speech to Speech, מקום שישי משותף מתוך ארבעה עשר לעומת Cartesia Sonic 3.6: 1,275 Elo בלוח ה-Provider Voice, מתוך 1,755 דגימות, וגם ראשון בלוח ה-Controlled Voice

• טיפול בהפרעות — GPT-Live-1: תכונה של המודל, שמחליטה פעמים רבות בשנייה אם לוותר על התור, לעומת Cartesia Sonic 3.6: תבנית אינטגרציה, שבה הלקוח מבטל את הקשר הסינתזה ונשען על חותמות זמן ברמת המילה כדי לחתוך ברגע הנכון

• מחיר — GPT-Live-1: $0.05 לדקת קול, בחיוב לפי שנייה, כאשר מנוע החשיבה מחויב בנפרד לעומת Cartesia Sonic 3.6: כ-$49 למיליון תווים במסגרת תוכניות קרדיט, בתוספת $0.06 לדקת משך שיחת סוכן ו-$0.014 לדקה עבור מספר טלפון של Cartesia

• Latency — GPT-Live-1: no model-level figure published; turn-taking latency given as 0.798 seconds in Open​AI's own testing vs Cartesia Sonic 3.6: under 90 milliseconds time-to-first-audio, vendor-stated and not independently measured end to end

• תפוקה — GPT-Live-1: סשנים במקביל, מוגבל ל-25 ברמה 1 ו-500 ברמה 5, ללא רמה חינמית לעומת Cartesia Sonic 3.6: כ-132 תווים בשנייה, בערך כפול מקצב v3 של ElevenLabs באותה השוואה, עם רמה חינמית של 20,000 קרדיטים חודשיים

• שפות — GPT-Live-1: שטף לא אחיד מחוץ לשפות המרכזיות בכיסוי ההשקה לעומת Cartesia Sonic 3.6: 44 שפות ב-61 לוקאלים, עם אודיה ואורדו שנוספו במהדורה הזו

• שליטה קולית — GPT-Live-1: שנים עשר פריסטים, טון וקצב באמצעות הנחיה, ללא שיבוט לעומת Cartesia Sonic 3.6: יותר מ-500 קולות מוגדרים מראש, שיבוט מיידי, שיבוט מקצועי בחבילות מתקדמות, חותמות זמן ברמת המילה והפונ�מה, וללא SSML — המודל מתאים את הקצב מהטקסט עצמו

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Cartesia Sonic 3.6 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Voices: 12 presets, no cloning'. The right column, labelled Cartesia Sonic 3.6, reads 'Kind: streaming text-to-speech', 'Price: ~$49 per 1M characters, plus $0.06 per agent minute', 'Time to first audio: under 90 ms, vendor-stated', 'Throughput: ~132 characters per second', 'Independent score: 1,275 Elo, #1 on the AA Provider Voice arena', 'Voices: 500+ presets, cloning, word timestamps'. The footer reads 'Sonic 3.6 latency vendor-stated; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Barge-in הוא תכונה של הארכיטקטורה, לא תיבת סימון.

הדבר הנפוץ ביותר שקונים טועים בו בהשוואה הזו הוא להתייחס לתמיכה בהפרעה כאל ערך בוליאני. התיעוד של Cartesia גלוי לגבי אופן הפעולה של הגרסה שלה: כאשר המתקשר מדבר מעל הסוכן, הלקוח שולח ביטול עבור הקשר הסינתזה הנוכחי, וחותמות הזמן ברמת המילה שמוחזרות בחיבור ה-WebSocket הן מה שמאפשר לעצור את ההשמעה בהברה הנכונה. זהו תכנון מוכשר, וכך רוב סוכני הקול בייצור מתמודדים כיום עם התפרצויות.

It is still a design in which the decision to stop talking was made by your application, using a voice-activity signal, at whatever latency the round trip allows. GPT-Live-1 moves that decision inside the model. It is continuously deciding whether to keep listening, pause, take the turn or hand it over, which is why Open​AI's own figures report 80.1% interactivity against 45.4% for GPT-Realtime-2.1 on Full Duplex Bench v1.5, with turn-taking latency of 0.798 seconds against 1.41. Those numbers are Open​AI's, published with the release and not reproduced by anyone outside the company — but the architectural difference behind them is not in dispute, and it is the one thing a cascade cannot approximate by tuning.

המקום שבו הקסקדה מנצחת הוא כל מה שבמורד הזרם מהמשפט. הזמן עד לאודיו הראשון של Cartesia — מתחת ל־90 אלפיות השנייה — הוא נתון של ספק והוא מודד את המודל, לא את השיחה: המספר שהמתקשר חווה כולל גם זיהוי דיבור, זיהוי תורי שיחה, זמן היצירה של מודל השפה, העברה ברשת וחציצת אודיו. זו בדיוק הסיבה שכדאי לבנות קסקדה כשצריך לשלוט בכל שלב — מודל קטן ומהיר לתורי שיחה פשוטים, מודל חזית לקשים, וסינתיסייזר שלעולם לא גורם לך להמתין.

שלב הביניים הזה הוא החלק היחיד מכל אחת מהמחסניות שהוא באמת נייד, והוא החלק שמכריע גם את האיכות וגם את העלות של השיחה. בערך 190 מודלים מאחד-עשר ספקי upstream יושבים מאחורי מפתח OrcaRouter אחד במחיר המחירון של הספק וללא תוספת, וה-DSL של הניתוב מאפשר לנקודת קצה בודדת לשלוח תורות פשוטים למודל זול ולהסלים את המסובכים למודל חוד — הדפוס שסוכן קולי באמת רוצה, מיושם על השלב שהכי משתנה. לא ניתן להגיע אל Sonic 3.6 ואל GPT-Live-1 דרך שכבת ניתוב; שכבות הקול שייכות לספקים שלהן.

A screenshot of Cartesia's official Sonic 3.6 product page, showing the post title 'Introducing Sonic-3.6' dated Aug 27, 2026, the claim that listeners preferred it in up to 93% of blind head-to-head tests across fifteen locales, and the statement that Sonic-3.6 'takes #1 on the Artificial Analysis leaderboard across both the controlled and provider voice boards'. Below it, an embedded Controlled Voice leaderboard lists Sonic 3.6 first ahead of Sonic 3.5, Eleven v3, StepAudio 2.5 and Realtime TTS 1.5.

לנהל את הכסף

שני מודלי התמחור אינם תואמים, ולכן כדאי לבצע את ההמרה כראוי. קצב הדיבור הוא בערך 150 מילים בדקה, ובאנגלית יש בממוצע כחמישה וחצי תווים למילה, כך שדקה של פלט מדובר היא בסביבות 800 עד 900 תווים. במחיר של 49 דולר למיליון תווים, הסינתזה של Cartesia עולה כארבעה סנטים לדקת אודיו.

ואז מגיע שאר המפל. Cartesia גובה $0.06 עבור כל דקה של משך שיחה עם סוכן קולי, ו־$0.014 לדקה אם אתה משתמש במספר הטלפון שלה, בנוסף לחיוב לפי תווים. הוסיפו זיהוי דיבור ומודל שפה עבור הטקסט, ותעברו את עשרת הסנטים לדקה לפני שמישהו בכלל אמר משהו קשה. ה־$0.05 של GPT-Live-1 לדקת קול מכסה את ההקשבה, את חילופי התורות ואת הדיבור, כאשר ההסקה המואצלת מחויבת בנפרד לפי התעריף הרגיל של מודל הבקאנד — שעבור שיחת הזמנה עם חיפוש או שניים מצורפים הוא מספר ממשי, לא שגיאת עיגול.

נקודת ההצטלבות נמצאת בנפח ובדרגת הקושי. שיחות קצרות, חזרתיות ובנפח גבוה — אישורים, התראות, חיפושים פשוטים — מעדיפות את הקסקדה, מפני שמודל זול שעונה על שאלה מתוסרטת הוא הדבר הזול ביותר בהשוואה הזו. שיחות שבהן המתקשר יוצא מהתסריט, מדבר מעל הסוכן, או משנה את דעתו באמצע המשפט מעדיפות את המודל מקצה לקצה, מפני שצורת הכשל של הקסקדה שם אינה תשובה שגויה, אלא תשובה מביכה.

איזה אחד לבחור?

בחר ב-Cartesia Sonic 3.6 אם אתה רוצה את הקול בעל הניקוד הגבוה ביותר הזמין ואתה מוכן לקחת על עצמך את היגיון השיחה. זו הבחירה הנכונה לקריינות, לסוכנים מתוסרטים בנפח גבוה, לצוותים עם צינור זיהוי דיבור קיים, ולכל מי שזקוק לחותמות זמן ברמת המילה שמאפשרות טיפול מדויק בהפרעות. אתה מקבל מסלול חינמי, יותר מ-500 קולות, שיבוט, 44 שפות ואת הפסגה של שני לוחות האיכות, ואתה שומר על שליטה בכל שלב.

בחר ב-GPT-Live-1 אם ההפרעה היא המוצר. כל מקרה שבו שמדברים מעליך הוא המקרה הרגיל ולא מקרה קצה, ושבו העברת תור של 0.8 שניות עדיפה על התחלה של 90 אלפיות שנייה במשפט שאף אחד לא סיים לשאול. אתה מקבל מודל סגור, מתארח, לפי דקה, עם שנים עשר קולות וללא שיבוט, ואתה מקבל שציון האיכות העצמאי שלו הוא באמצע הטבלה.

הפיתוי הוא לקרוא 1,275 מול 70.3% ולהכריז שזה מוכרע. זה לא, וההבדל בין שני המספרים האלה הוא כל הוויכוח: האחד מודד איך קול נשמע, האחר מודד אם שווה לדבר איתו.