כרטיס כותרת ראשי עבור 'GPT-Live-1 נגד Sesame Preview', עם כותרת משנה 'הקול הטוב ביותר כאן הוא זה בלי API', עם תג שעליו כתוב 'אחד חינמי וסגור, אחד בתשלום וניתן לקריאה' ושלושה כרטיסים: 'Sesame Preview — אפליקציה חינמית, בלי API, קול הייצור טרם שוחרר', 'GPT-Live-1 — ‏$0.05 לדקת קול, API ציבורי מאז 10 בספטמבר 2026' ו'החלק שניתן לבנות של Sesame — ‏CSM-1B, ‏Apache-2.0, מיליארד פרמטרים, ‏$7 למיליון תווים או אירוח עצמי', מעל פס תחתון שעליו כתוב 'לקול הייצור של Sesame אין מדד ביצועים מפורסם; נתוני הקול של GPT-Live-1 הם דיווח של OpenAI.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

GPT-Live-1 לעומת Sesame Preview: הקול הטוב ביותר בהשוואה הזו הוא זה שאי אפשר לקנות

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

שאל כל מי שהשתמש בשניהם והדירוג אינו צמוד: Sesame Preview הוא העוזר הקולי המשכנע ביותר שרוב האנשים דיברו איתו. הוא גם זה שאי אפשר לבנות עליו. GPT-Live-1 ו-Sesame Preview מושווים כל הזמן — שניהם שיחתיים, שניהם מתמודדים עם הפרעות, שניהם נשמעים כמו אדם ולא כמו תפריט טלפוני — אך הם מוצעים בדרכים הפוכות. GPT-Live-1 הוא מודל מתארח ששוכרים לפי דקה, שניתן לפנות אליו באופן ציבורי מאז 10 בספטמבר 2026. Sesame Preview הוא אפליקציית צרכנים חינמית בלי API בכלל, והקול שאנשים מתרשמים ממנו פועל על מודל פרודקשן שמעולם לא שוחרר.

מה כל אחד הוא בפועל

• GPT-Live-1 — מודל הקול הדו-כיווני המלא של OpenAI, ב-ChatGPT מאז 8 ביולי 2026, וב-API מאז 10 בספטמבר במחיר 0.05 דולר לדקת קול. שנים-עשר קולות API, ללא שיבוט, ללא קלט תמונה או וידאו, תמלולים וטקסט תגובה מוחזרים עם כל סשן.

• Sesame Preview — העוזר הקולי לצרכנים של Sesame. חינם ב-iOS מאז מאי 2026, זמין באופן נרחב ב-Android מאז תחילת אוגוסט 2026, בנוסף לתצוגה מקדימה באינטרנט עם דגש קולי. ארבעה סוכנים — Maya, Miles, Simone ו-Charlie — אנגלית בלבד, עם הגבלת שיחה של 30 דקות שיורדת ל-5 דקות כאשר לא מחוברים.

• CSM-1B — החלק של Sesame שהוא בקוד פתוח: מודל דיבור שיחתי בגודל 1B שיצא לאור תחת Apache 2.0 ב-23 באפריל 2026, בנוי על תשתית בארכיטקטורת Llama עם מפענח נפרד וקודק Mimi של Kyutai, ומפיק דיבור אנגלי מונו ב-24 kHz מהקשר של בערך 4K טוקנים.

שלוש השורות שלמעלה הן כל צורת ההחלטה. חברה אחת מוכרת מודל לפי דקה. האחרת מחלקת אפליקציה בחינם ומפרסמת בקוד פתוח מודל קטן יותר, שאינו זה שבאפליקציה.

הפער בין הדמו להורדה

Sesame הייתה ישירה באופן יוצא דופן לגבי זה, וזו העובדה היחידה והחשובה ביותר עבור כל מי שמעריך את הזוג. הקול באפליקציית Preview — זה שהפיק את הסרטונים הוויראליים ואת הביקורות על "מצב הקול הטוב ביותר בקטגוריה" — הוא מודל הפקה סגור וגדול יותר. CSM-1B הוא צ'קפוינט פתוח עם מיליארד פרמטרים מאותה מעבדה, ולפי הערכתם של אנשים שהריצו את שניהם, הוא קול חלש יותר באופן מובהק. הסשנים ב-Preview גם מוגבלים במספר ובאנגלית בלבד, ואין ביצוע משימות: הסוכנים מדברים, הם לא מזמינים, קונים או מגישים שום דבר.

זה משאיר למפתחים הצעה אמיתית אך צרה יותר: צ'קפוינט של דיבור שיחתי הניתן לאירוח עצמי ללא דמי רישיון, המתארח אצל ספק הסקה חיצוני אחד במחיר של 7 דולר למיליון תווים — בערך 0.35 דולר לשעה של אודיו מסונתז — או בחינם על החומרה שלכם. איש לא פרסם בנצ'מרק עצמאי עבור קול ה-Preview או CSM-1B, כך שכל טענת איכות לכאן או לכאן היא התרשמות משמיעה, לא מדידה. Sesame גם לא פרסמה תמחור ציבורי, לא מסלול ארגוני ולא תוכנית מונטיזציה; הכיוון המוצהר של החברה הוא שותפויות מחקר ומוצר חומרה מתוכנן.

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

מה קונים תמורת $0.05 לדקה ושאין בחינם

הפיץ' של GPT-Live-1 למפתח אינו שהוא נשמע טוב יותר, כי אי אפשר לנצח בטיעון הזה מול מודל סגור שאיש לא יכול למדוד. הוא שהדבר ניתן להפעלה ומתומחר. באופן קונקרטי, מה שאתה מקבל כשהמונה רץ:

• סשן שאתה שולט בו — מזהה מודל אחד, נקודת קצה אחת של Live Sessions, דוגמת האינטגרציה שפורסמה שרצה על WebRTC, וסשן שאתה מגדיר עם הוראות, קולות ובלוק האצלה.

• טיפול בהפרעות כהתנהגות מתועדת — 80.1% אינטראקטיביות ב-Full Duplex Bench v1.5 לעומת 45.4% עבור GPT-Realtime-2.1, עם השהיית חילופי תורות של 0.798 שניות ו-87% הצלחה בקריאה לכלים. כל שלושת המספרים הם המספרים של OpenAI עצמה, שפורסמו עם השחרור ולא שוחזרו על ידי איש בזמן כתיבת שורות אלה.

• מנוע הנמקה אחורי שאתה בוחר — שכבת הקול מעבירה עבודה כבדה על פני גבול אסינכרוני למודל נפרד הנקוב בהגדרות הסשן, שממשיך לעבוד בזמן שהשיחה נמשכת. בדוגמה שבתיעוד של Ope​nAI המנוע האחורי הזה הוא GPT-5.6 Terra; בהשקה לצרכנים ביולי הוא היה GPT-5.5.

• תמלולים, טקסט תגובה וחיוב בתצורת טלפוניה — $3.00 עבור שעה של קו פתוח רצוף, בחיוב לפי שנייה, כאשר 15 שניות של אתחול סשן מזוכות ולא מתווספות.

Sesame נותנת לך שיחה טובה יותר ואף אחד מאלה. אם אתה בונה מוצר, "שיחה טובה יותר, בלי API, בלי מחיר, בלי בנצ'מרק, אנגלית בלבד, תקרה של 30 דקות" זו לא השוואה — זו רשימת המתנה.

יש כיום נתון על GPT-Live-1 שלא היה קיים בהשקה הצרכנית שלו, והוא משקל הנגד הכנה לכל מה שלמעלה. מדד Speech to Speech Index של Artificial Analysis מעניק ל-GPT-Live-1 ציון של 69.8% — שביעי מבין אחד עשר מודלים, אחרי GPT-Realtime-2.1 עם 73.9% ואחרי Grok Voice Think Fast 2.0 עם 79.0%. אז גם המודל שאפשר לקנות אינו הטוב ביותר בלוח העצמאי. מה שהלוח לא יכול למדוד הוא הדבר שבו Sesame למעשה מנצחת: אף אחד מאחד עשר המודלים במדד הזה לא דורג לפי איך שזה מרגיש לדבר איתו, ולקול של Sesame Preview אין שורה בשום מקום.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

החלק בסטאק שאינו של אף אחת מהחברות

כאן שתי האפשרויות מתכנסות, וכאן ההחלטה מפסיקה להיות בינארית. לא Sesame Preview ולא GPT-Live-1 מהווים סוכן שלם. הסוכנים של Sesame לא מבצעים משימות; GPT-Live-1 מפנה במפורש כל דבר שדורש הסקה, אחזור או כלי למודל backend. בשני העיצובים העבודה המעניינת מתרחשת מאחורי הקול, בקריאה למודל טקסט פשוט, והשכבה הזו ניידת באופן ששכבת הקול אינה ניידת — ניתן להעביר backend בלי להקליט מחדש אפילו פרומפט אחד עבור מודל הדיבור.

הבקאנד הזה הוא גם המקום שבו OrcaRouter מועיל, וכדאי להיות מדויקים לגבי מה אנחנו כן ומה אנחנו לא מעבירים. אנחנו לא מנתבים את GPT-Live-1: נקודת הקצה Live Sessions היא של OpenAI, ושכבת הקול שם מחוץ להישג יד. אנחנו גם לא מנתבים את מודל הייצור של Sesame, מהסיבה הפשוטה יותר שהוא מעולם לא הוצע כ-API. מה שכן אנחנו מנתבים הוא השכבה ששני המוצרים מעבירים אליה עבודה. בערך 190 מודלים מאחד-עשר ספקי upstream רצים מאחורי מפתח אחד במחיר המחירון של הספק וללא תוספת, עם failover אוטומטי בין ספקים ו-DSL לניתוב שיכול להרכיב כמה מודלים לקריאה אחת. עבור צוות שבונה על פרונט-אנד קולי לא מוכח, זה הגידור שמשנה: אפשר להחליף או לנטוש את שכבת הדיבור בלי לקחת איתה את שכבת ההיסק, ואת המודל שעליו הימרתם במרץ אפשר להחליף ביוני על ידי עריכת שורה אחת.

מה לצפות

שלושה דברים היו משנים את ההשוואה הזו, ואף אחד מהם עדיין לא בידי איש. Sesame API — אפילו בתשלום — היה הופך בן רגע את הקול החזק ביותר בקטגוריה לאפשרות ברת-בנייה, והיה מציב מחיר אמיתי לצד ה-$0.05 של GPT-Live-1. בנצ'מרק שפורסם של קול ה-Preview יהפוך רושם מהאזנה למספר, והערכות בלתי תלויות נוטות להיות לא-מחמיאות לקולות שהתחרו אך ורק בהדגמות. והשחזור החיצוני הראשון של נתוני האינטראקטיביות והשהיה של OpenAI יכריע אם דופלקס מלא הוא פער יכולות אמיתי או הערכה שנבחרה היטב.

עד אז, החלוקה הכנה היא זו. אם אתם בוחרים קול לעצמכם, השתמשו ב-Sesame Preview — הוא חינמי, הוא טוב יותר, וזה לא עולה לכם דבר להעדיף אותו. אם אתם בוחרים קול למוצר שאתם חייבים לשגר, למכור ולתמוך בו, GPT-Live-1 הוא היחיד מבין השניים שאפשר ממש לקנות, והעובדה שהוא לא זה שנשמע טוב יותר היא מחיר הכניסה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית