
StepAudio 3 Realtime מול Sesame Preview: הקול שכולם משבחים לעומת זה שיש לו ציון
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
במשך רוב שנת 2026, הטענה החזקה ביותר שמישהו יכול היה להשמיע על AI קולי הייתה רושם מהאזנה. העוזר של Sesame נשמע אנושי יותר מכל דבר אחר, ומספיק אנשים אמרו זאת כך שזה הפך לנקודת הייחוס — בלי מדד, בלי מספר, ובלי דרך לבדוק. ב-15 בספטמבר 2026, StepAudio 3 Realtime הגיע מ-StepFun עם מספר שמצורף לגרסה הניתנת למדידה הקרובה ביותר של אותה איכות: 98.9% בהערכת Conversational Dynamics של Artificial Analysis, מקום ראשון. Sesame Preview אינו נמצא בלוח הזה.
החלק המעניין אינו בכך שאחד ניצח את האחר, אלא בכך שהאיכות שבזכותה התפרסם Sesame היא כעת משהו שצד שלישי מדרג, והמודל בעל המוניטין מעולם לא נמדד מולה.
מה כל אחד מאלה באמת
הם לא אותו סוג של אובייקט, וזה קובע יותר לגבי ההשוואה מכל ציון.
Sesame Preview הוא עוזר קולי לצרכנים. הוא חינמי ב-iOS מאז מאי 2026 ובאופן נרחב ב-Android מאז תחילת אוגוסט 2026, ובנוי סביב ארבעה סוכנים בעלי שמות — Maya, Miles, Simone ו-Charlie — ששומרים על הקשר בין הפעלות, מחפשים באינטרנט וקובעים תזכורות. הוא מיועד לאנגלית בלבד. שיחות מוגבלות לתקרה של 30 דקות, שמצטמצמת לחמש דקות כשמנותקים מהחשבון. אין API לקול הייצור שלו, אין מסלול ארגוני ואין תמחור ציבורי.
StepAudio 3 Realtime הוא ממשק למפתחים. זהו אחד מחמישה מודלים במשפחת StepAudio 3, שכולם שוחררו באותו יום וכולם פעילים בפלטפורמה הפתוחה של StepFun כממשקי API מסחריים. הוא מטפל בשיחה דופלקס מלאה נייטיבית, מבצע היסק ישירות על הדיבור במקום לתמלל תחילה, ותומך בקריאה לכלים ובביצוע אסינכרוני של משימות ארוכות בזמן שהשיחה נמשכת. הוא מיועד בעדיפות ראשונה לסינית. הוא אינו מודל עם משקולות פתוחות, והוא נמצא כעת בתמחור תצוגה מקדימה חינמית לזמן מוגבל, בלי שנמסר תעריף לאחר התצוגה המקדימה.
על אחד מאלה אפשר לבנות. את האחר אפשר לבקר.
הדבר המדיד ש-Sesame מפורסמת בזכותו
Conversational Dynamics הוא בנצ'מרק ספציפי, וכדאי לדעת מה הוא כולל. הוא מדרג חילופי תורות, התמודדות עם הפסקות, התאוששות מקטיעות, והאם מודל מפרש נכון תגובת חיזוק קצרה — "uh-huh", "right", "mm" — כעידוד ולא כניסיון לתפוס את רצפת השיחה. אלה בדיוק ההתנהגויות שמאזינים מתארים כשהם אומרים שקול מרגיש אנושי ולא רובוטי, ואלה ההתנהגויות שהופכות עוזר לנעים לשיחה ולא רק למדויק.
StepAudio 3 Realtime מוביל את הטבלה הזו עם 98.9%, לפני Qwen Audio 3.0 Realtime Plus עם 98.4% ו-GPT-Realtime-2 עם 95.3%. הוא גם מתברג ראשון ב-Speech Reasoning עם 99.7% כפי שצוטט על ידי StepFun, ומאחורי זה עומדת הטענה הארכיטקטונית שלפיה הסקה על אודיו גולמי משמרת טון והדגשה ששלב תמלול היה משטח — ההבדל בין לשמוע סרקזם לבין לשמוע מחמאה.
הנה הצגה כנה של התוצאה הזו. הבנצ'מרק הוא הדבר הקרוב ביותר שיש לתעשייה למדידה של מה ש-Sesame זוכה לשבחים עליו, ו-Sesame לא הוכנס אליו. זו אינה הוכחה ש-StepAudio 3 Realtime נשמע טוב יותר מ-Sesame. זו הוכחה שאחת מהטענות האלה ניתנת לבדיקה והאחרת, עד כה, לא — ושהטענה הניתנת לבדיקה נמצאת כעת בידי מודל שרוב האנשים מעולם לא דיברו איתו.

אי-הסימטריה בזמינות, שהיא ההחלטה האמיתית
כל מה שלמעלה מעניין. החלק הזה הוא מכריע.
הקול של Sesame — זה שאנשים מתלהבים ממנו — הוא מודל ייצור סגור וגדול יותר, ש-Sesame מעולם לא הוציאה כ-API. אי אפשר לקנות אותו, לקבל עליו רישיון או לקרוא לו מתוך המוצר שלך. אם קראת שתזמון השיחה של Sesame הוא הטוב ביותר שקיים והסקת שת�וכל להשיג אותו, המסקנה אינה נובעת מהראיות.
מה ש-Sesame למעשה שחררה כקוד פתוח הוא CSM-1B, שיצא תחת רישיון Apache-2.0. זהו בלוק סינתזה, לא עוזר: שלד Llama מנבא את ספר הקודים הראשון של Mimi, ומפענח Llama קטן יותר מנבא את השאר, שאותו קודק Mimi מפיק כצורת גל של 24 קילו-הרץ. הוא מיועד לאנגלית בלבד, הוא משכפל קול מקטע ייחוס באורך 10 עד 15 שניות, והוא לא יכול ליצור טקסט בכלל — מצמידים אותו למודל שפה נפרד. אנשים שהריצו את שניהם מתארים את הקול של CSM-1B כחלש באופן מובהק מזה של אפליקציית Preview, וכרטיס המודל אומר בקול רם את מה שבדרך כלל שותקים עליו: גרסה שעברה כיוונון עדין של CSM מפעילה את ההדגמה האינטראקטיבית, ואותה גרסה אינה הצ'קפוינט שאפשר להוריד.
ל-StepAudio 3 Realtime אין שמץ מהעמימות הזו. זהו API מסחרי שמאחוריו עומדת משפחת מודלים שפורסמה, סט יכולות מוצהר, ודירוגים של צדדים שלישיים שאפשר לחפש. הוא גם נותן עדיפות לסינית, מתומחר במחיר תצוגה מקדימה, ורושם זמן עד לאודיו ראשון של 8.83 שניות באותו לוח דירוג שבו הוא מנצח בדינמיקה שיחתית — לעומת 1.18 שניות של Gemini 3.8 Live ו-1.24 עד 1.34 שניות של GPT-Live-1. כל מה שהוא מציע באיכות שיחתית, הוא טרם הוכיח שהוא מסוגל לספק אותו במהירות שיחתית מחוץ לסביבת ההגשה של StepFun עצמה.

מה לעשות עם זה אם אתם בוחרים סטאק קולי
התחל בהפרדה בין שתי השאלות. "איך שיחה אמורה להרגיש?" ו"מה אני יכול לשחרר?" יש להן תשובות שונות, ורק אחת מהן היא החלטת רכש.
אם אתם מכיילים את הטעם — מחליטים כמה חמימות צריך שיהיה למוצר שלכם, כמה שקט נוח, וכמה מהר סוכן צריך לפנות את הדיבור — Sesame Preview הוא חינמי, מצוין באמת, ומקום טוב להעביר בו אחר צהריים. השתמשו בו כנקודת ייחוס. אל תתכננו אינטגרציה סביבו, כי אין עם מה להשתלב.
אם אתם משיקים, StepAudio 3 Realtime הוא מועמד אמיתי עם הסתייגויות אמיתיות: תמחור תצוגה מקדימה, כיסוי בעדיפות לסינית, אין ציון מדד ב-Artificial Analysis, ושאלת השיהוי נותרה פתוחה. בדקו את השיהוי לפני איכות השיחה. מודל שמנצח במבחן חלוקת התורות אך לוקח לו רוב משך של משפט להתחיל לדבר הוא מודל שאולי לעולם לא תזכו להדגים את איכותו הטובה ביותר.
ואם הקול המוכן לייצור של Sesame יקבל אי פעם API, כל ההשוואה הזאת תרוץ מחדש — כי המבחן שיכריע את זה כבר קיים, ו-Sesame תצטרך סוף סוף להופיע בו.
היכן ניתוב מתאים, והיכן הוא לא
סוכני קול אינם מודל אחד. בין אם אתם מריצים את StepAudio 3 Realtime או כל דבר אחר, השיחה מעבירה כל הזמן עבודה למודלים רגילים של טקסט — חיפוש, חילוץ, קריאת הסקה שרצה מאחורי השהיה מוחזקת. שכבת ההאצלה הזו היא המקום שבו חיה שונות העלויות, ושבו שעה רעה של ספק אחד הופכת להשבתה שלכם.
ליתר דיוק לגבי הכיסוי של מה שאנחנו מציעים: נקודות הקצה החיות והקוליות במשפחת StepAudio 3 אינן ב-OrcaRouter, וגם לא שום דבר ש-Sesame בנתה. מה שכן נמצא ב-OrcaRouter הוא שכבת הטקסט שסוכן קולי מאציל לה — כמעט 200 מודלים מאחורי API אחד, מעבר אוטומטי בעת כשל, DSL לניתוב שמחבר כמה מהם לקריאה אחת, ומיזוג מודלים כשהשיפוט של מודל בודד אינו מספיק, עם מחיר המחירון של הספק המועבר הלאה ללא תוספת.
הפיצול הזה הוא מה שהופך את שאלת הזמינות לפחות הרת אסון ממה שהיא נראית. מודל הקול הוא החלטה שאפשר לשוב ולבחון; שכבת ההאצלה היא זו שמתייקר לפרק, והיא זו ששווה להעמיד מאחורי ראוטר לפני שמתחייבים לספק קול כלשהו.

פסק הדין
Sesame Preview מנצח בדבר שאי אפשר למדוד ומפסיד בכל דבר שאפשר לקנות. זה הקול הנשמע הטוב ביותר שזמין, הוא בחינם, ואי אפשר להכניס אותו לפרודקשן — ועכשיו, כשצד שלישי מדרג את האיכות שהוא מפורסם בה, ההיעדרות שלו מלוח התוצאות הזה היא פער בראיות, לא יתרון מוגן.
StepAudio 3 Realtime מנצח בזמינות, ביכולת מדידה וביכולות, ומעלה שאלות פתוחות אמיתיות בנוגע למחיר, לכיסוי שפות ולשהות. זהו היחיד מבין השניים שעליו ניתן לבנות כבר היום, מה שמכריע את השאלה המעשית מהר יותר מכל מבחן ביצועים.
מה שכדאי לראות הוא פשוט, וזה עובד לשני הכיוונים: ציון Conversational Dynamics לקול הפרודקשן של Sesame, או נתון השהיה ל-StepAudio 3 Realtime שמציב אותו באותו טווח כמו המודלים שהוא כרגע עוקף באיכות. כל אחד מהם יהפוך את זה מהשוואה בין מדידה למוניטין לעימות ראש בראש אמיתי.
