כרטיס כותרת גיבור שנוצר עבור StepAudio 3 Realtime מול Sesame Preview, עם הכיתוב הקטן 'OrcaRouter · מכ"ם מודלים — ראש בראש', הכותרת הראשית 'StepAudio 3 Realtime מול Sesame Preview' והכתובית 'הקול שכולם מהללים מול זה שיש לו ציון בלוח הדירוג', מעל שני כרטיסי מודל מעוגלים משני צדיו של סימן מול.
Guides & Insights

StepAudio 3 Realtime מול Sesame Preview: הקול שכולם משבחים לעומת זה שיש לו ציון

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

במשך רוב שנת 2026, הטענה החזקה ביותר שמישהו יכול היה להשמיע על AI קולי הייתה רושם מהאזנה. העוזר של Sesame נשמע אנושי יותר מכל דבר אחר, ומספיק אנשים אמרו זאת כך שזה הפך לנקודת הייחוס — בלי מדד, בלי מספר, ובלי דרך לבדוק. ב-15 בספטמבר 2026, StepAudio 3 Realtime הגיע מ-StepFun עם מספר שמצורף לגרסה הניתנת למדידה הקרובה ביותר של אותה איכות: 98.9% בהערכת Conversational Dynamics של Artificial Analysis, מקום ראשון. Sesame Preview אינו נמצא בלוח הזה.

החלק המעניין אינו בכך שאחד ניצח את האחר, אלא בכך שהאיכות שבזכותה התפרסם Sesame היא כעת משהו שצד שלישי מדרג, והמודל בעל המוניטין מעולם לא נמדד מולה.

מה כל אחד מאלה באמת

הם לא אותו סוג של אובייקט, וזה קובע יותר לגבי ההשוואה מכל ציון.

Sesame Preview הוא עוזר קולי לצרכנים. הוא חינמי ב-iOS מאז מאי 2026 ובאופן נרחב ב-Android מאז תחילת אוגוסט 2026, ובנוי סביב ארבעה סוכנים בעלי שמות — Maya, Miles, Simone ו-Charlie — ששומרים על הקשר בין הפעלות, מחפשים באינטרנט וקובעים תזכורות. הוא מיועד לאנגלית בלבד. שיחות מוגבלות לתקרה של 30 דקות, שמצטמצמת לחמש דקות כשמנותקים מהחשבון. אין API לקול הייצור שלו, אין מסלול ארגוני ואין תמחור ציבורי.

StepAudio 3 Realtime הוא ממשק למפתחים. זהו אחד מחמישה מודלים במשפחת StepAudio 3, שכולם שוחררו באותו יום וכולם פעילים בפלטפורמה הפתוחה של StepFun כממשקי API מסחריים. הוא מטפל בשיחה דופלקס מלאה נייטיבית, מבצע היסק ישירות על הדיבור במקום לתמלל תחילה, ותומך בקריאה לכלים ובביצוע אסינכרוני של משימות ארוכות בזמן שהשיחה נמשכת. הוא מיועד בעדיפות ראשונה לסינית. הוא אינו מודל עם משקולות פתוחות, והוא נמצא כעת בתמחור תצוגה מקדימה חינמית לזמן מוגבל, בלי שנמסר תעריף לאחר התצוגה המקדימה.

על אחד מאלה אפשר לבנות. את האחר אפשר לבקר.

הדבר המדיד ש-Sesame מפורסמת בזכותו

Conversational Dynamics הוא בנצ'מרק ספציפי, וכדאי לדעת מה הוא כולל. הוא מדרג חילופי תורות, התמודדות עם הפסקות, התאוששות מקטיעות, והאם מודל מפרש נכון תגובת חיזוק קצרה — "uh-huh", "right", "mm" — כעידוד ולא כניסיון לתפוס את רצפת השיחה. אלה בדיוק ההתנהגויות שמאזינים מתארים כשהם אומרים שקול מרגיש אנושי ולא רובוטי, ואלה ההתנהגויות שהופכות עוזר לנעים לשיחה ולא רק למדויק.

StepAudio 3 Realtime מוביל את הטבלה הזו עם 98.9%, לפני Qwen Audio 3.0 Realtime Plus עם 98.4% ו-GPT-Realtime-2 עם 95.3%. הוא גם מתברג ראשון ב-Speech Reasoning עם 99.7% כפי שצוטט על ידי StepFun, ומאחורי זה עומדת הטענה הארכיטקטונית שלפיה הסקה על אודיו גולמי משמרת טון והדגשה ששלב תמלול היה משטח — ההבדל בין לשמוע סרקזם לבין לשמוע מחמאה.

הנה הצגה כנה של התוצאה הזו. הבנצ'מרק הוא הדבר הקרוב ביותר שיש לתעשייה למדידה של מה ש-Sesame זוכה לשבחים עליו, ו-Sesame לא הוכנס אליו. זו אינה הוכחה ש-StepAudio 3 Realtime נשמע טוב יותר מ-Sesame. זו הוכחה שאחת מהטענות האלה ניתנת לבדיקה והאחרת, עד כה, לא — ושהטענה הניתנת לבדיקה נמצאת כעת בידי מודל שרוב האנשים מעולם לא דיברו איתו.

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

אי-הסימטריה בזמינות, שהיא ההחלטה האמיתית

כל מה שלמעלה מעניין. החלק הזה הוא מכריע.

הקול של Sesame — זה שאנשים מתלהבים ממנו — הוא מודל ייצור סגור וגדול יותר, ש-Sesame מעולם לא הוציאה כ-API. אי אפשר לקנות אותו, לקבל עליו רישיון או לקרוא לו מתוך המוצר שלך. אם קראת שתזמון השיחה של Sesame הוא הטוב ביותר שקיים והסקת שת�וכל להשיג אותו, המסקנה אינה נובעת מהראיות.

מה ש-Sesame למעשה שחררה כקוד פתוח הוא CSM-1B, שיצא תחת רישיון Apache-2.0. זהו בלוק סינתזה, לא עוזר: שלד Llama מנבא את ספר הקודים הראשון של Mimi, ומפענח Llama קטן יותר מנבא את השאר, שאותו קודק Mimi מפיק כצורת גל של 24 קילו-הרץ. הוא מיועד לאנגלית בלבד, הוא משכפל קול מקטע ייחוס באורך 10 עד 15 שניות, והוא לא יכול ליצור טקסט בכלל — מצמידים אותו למודל שפה נפרד. אנשים שהריצו את שניהם מתארים את הקול של CSM-1B כחלש באופן מובהק מזה של אפליקציית Preview, וכרטיס המודל אומר בקול רם את מה שבדרך כלל שותקים עליו: גרסה שעברה כיוונון עדין של CSM מפעילה את ההדגמה האינטראקטיבית, ואותה גרסה אינה הצ'קפוינט שאפשר להוריד.

ל-StepAudio 3 Realtime אין שמץ מהעמימות הזו. זהו API מסחרי שמאחוריו עומדת משפחת מודלים שפורסמה, סט יכולות מוצהר, ודירוגים של צדדים שלישיים שאפשר לחפש. הוא גם נותן עדיפות לסינית, מתומחר במחיר תצוגה מקדימה, ורושם זמן עד לאודיו ראשון של 8.83 שניות באותו לוח דירוג שבו הוא מנצח בדינמיקה שיחתית — לעומת 1.18 שניות של Gemini 3.8 Live ו-1.24 עד 1.34 שניות של GPT-Live-1. כל מה שהוא מציע באיכות שיחתית, הוא טרם הוכיח שהוא מסוגל לספק אותו במהירות שיחתית מחוץ לסביבת ההגשה של StepFun עצמה.

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

מה לעשות עם זה אם אתם בוחרים סטאק קולי

התחל בהפרדה בין שתי השאלות. "איך שיחה אמורה להרגיש?" ו"מה אני יכול לשחרר?" יש להן תשובות שונות, ורק אחת מהן היא החלטת רכש.

אם אתם מכיילים את הטעם — מחליטים כמה חמימות צריך שיהיה למוצר שלכם, כמה שקט נוח, וכמה מהר סוכן צריך לפנות את הדיבור — Sesame Preview הוא חינמי, מצוין באמת, ומקום טוב להעביר בו אחר צהריים. השתמשו בו כנקודת ייחוס. אל תתכננו אינטגרציה סביבו, כי אין עם מה להשתלב.

אם אתם משיקים, StepAudio 3 Realtime הוא מועמד אמיתי עם הסתייגויות אמיתיות: תמחור תצוגה מקדימה, כיסוי בעדיפות לסינית, אין ציון מדד ב-Artificial Analysis, ושאלת השיהוי נותרה פתוחה. בדקו את השיהוי לפני איכות השיחה. מודל שמנצח במבחן חלוקת התורות אך לוקח לו רוב משך של משפט להתחיל לדבר הוא מודל שאולי לעולם לא תזכו להדגים את איכותו הטובה ביותר.

ואם הקול המוכן לייצור של Sesame יקבל אי פעם API, כל ההשוואה הזאת תרוץ מחדש — כי המבחן שיכריע את זה כבר קיים, ו-Sesame תצטרך סוף סוף להופיע בו.

היכן ניתוב מתאים, והיכן הוא לא

סוכני קול אינם מודל אחד. בין אם אתם מריצים את StepAudio 3 Realtime או כל דבר אחר, השיחה מעבירה כל הזמן עבודה למודלים רגילים של טקסט — חיפוש, חילוץ, קריאת הסקה שרצה מאחורי השהיה מוחזקת. שכבת ההאצלה הזו היא המקום שבו חיה שונות העלויות, ושבו שעה רעה של ספק אחד הופכת להשבתה שלכם.

ליתר דיוק לגבי הכיסוי של מה שאנחנו מציעים: נקודות הקצה החיות והקוליות במשפחת StepAudio 3 אינן ב-OrcaRouter, וגם לא שום דבר ש-Sesame בנתה. מה שכן נמצא ב-OrcaRouter הוא שכבת הטקסט שסוכן קולי מאציל לה — כמעט 200 מודלים מאחורי API אחד, מעבר אוטומטי בעת כשל, DSL לניתוב שמחבר כמה מהם לקריאה אחת, ומיזוג מודלים כשהשיפוט של מודל בודד אינו מספיק, עם מחיר המחירון של הספק המועבר הלאה ללא תוספת.

הפיצול הזה הוא מה שהופך את שאלת הזמינות לפחות הרת אסון ממה שהיא נראית. מודל הקול הוא החלטה שאפשר לשוב ולבחון; שכבת ההאצלה היא זו שמתייקר לפרק, והיא זו ששווה להעמיד מאחורי ראוטר לפני שמתחייבים לספק קול כלשהו.

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

פסק הדין

Sesame Preview מנצח בדבר שאי אפשר למדוד ומפסיד בכל דבר שאפשר לקנות. זה הקול הנשמע הטוב ביותר שזמין, הוא בחינם, ואי אפשר להכניס אותו לפרודקשן — ועכשיו, כשצד שלישי מדרג את האיכות שהוא מפורסם בה, ההיעדרות שלו מלוח התוצאות הזה היא פער בראיות, לא יתרון מוגן.

StepAudio 3 Realtime מנצח בזמינות, ביכולת מדידה וביכולות, ומעלה שאלות פתוחות אמיתיות בנוגע למחיר, לכיסוי שפות ולשהות. זהו היחיד מבין השניים שעליו ניתן לבנות כבר היום, מה שמכריע את השאלה המעשית מהר יותר מכל מבחן ביצועים.

מה שכדאי לראות הוא פשוט, וזה עובד לשני הכיוונים: ציון Conversational Dynamics לקול הפרודקשן של Sesame, או נתון השהיה ל-StepAudio 3 Realtime שמציב אותו באותו טווח כמו המודלים שהוא כרגע עוקף באיכות. כל אחד מהם יהפוך את זה מהשוואה בין מדידה למוניטין לעימות ראש בראש אמיתי.