כרטיס כותרת ראשי עבור 'Realtime-Venus נגד Sesame Preview', עם כתובית משנה 'שתי מעבדות, אותה מלכודת, כיוונים מנוגדים', עם שלושה כרטיסים שקוראים 'Sesame Preview: אפליקציה חינמית, ארבעה סוכנים, ללא API מאז מאי 2026', 'Realtime-Venus: משקלים ברישיון Apache-2.0, ללא מוצר, ללא הכרזה', ו'אף אחד מהשניים לא מפרסם ציון קולי מאומת באופן עצמאי', מעל רצועת כותרת תחתונה שקוראת 'היכולות של Sesame לפי תיעוד התצוגה המקדימה לנייד שלה עצמה; נתוני Realtime-Venus מתוך הדוח הטכני שלה, ללא שחזור.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Realtime-Venus לעומת Sesame Preview: הדבר שאפשר להשיג אינו הדבר הטוב

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Realtime-Venus ו-Sesame Preview נבנו על ידי מעבדות עם רעיונות שונים לחלוטין לגבי לשם מה נועד מודל קולי, והן נקלעו לאותה מלכודת בדיוק מכיוונים מנוגדים. Sesame Preview היא אפליקציה חינמית לצרכנים — iOS מאז מאי 2026, Android מאז תחילת אוגוסט — עם ארבעה סוכנים שיחתיים, חיפוש אינטרנט חי במהלך שיחות, וקול שמבקרים כינו מהטובים ביותר בתחום. המשקלים הפתוחים ש-Sesame פרסמה הם מודל אחר, קטן יותר, שהחברה עצמה אינה מציגה כקול ששמעתם בהדגמה. Realtime-Venus, המערכת הדופלקסית המלאה בגודל 9B מצוות Venus של Ant Group ומאוניברסיטת Tsinghua, פעל בכיוון ההפוך: הארטיפקטים הניתנים להורדה הם הדבר האמיתי, ואין מוצר בכלל. בשני המקרים, הפער בין מה שזמין למה שמרשים הוא הדבר השימושי ביותר להבין לפני שאתם מתכננים משהו סביב אחד מהשניים.

מה כל אחד הוא בפועל

A screenshot of the Sesame mobile preview page, captured 18 September 2026, showing the header navigation with Blog, Team, Mobile Preview and Research Preview, the headline 'Personal agents for curious people', the line 'Preview available now on iOS and Android', and both the App Store and Google Play download badges.

Sesame Preview הוא מוצר. Sesame היא מעבדה בסן פרנסיסקו, שנוסדה ב-2023 על ידי ברנדן איריב, אנקיט קומאר וראיין בראון, בגיבוי a16z, Sequoia, Spark ו-Matrix, והעוזר הקולי לצרכנים שלה מגיע עם ארבע דמויות — מאיה, מיילס, סימון וצ'ארלי — שלכל אחת מהן מזג וקול ייחודיים. הסוכן יכול לחפש באינטרנט תוך כדי שיחה, לרשום הערות ותזכורות, ולשלוח סיכום לאחר שיחה. הזיכרון הוא לכל סוכן בנפרד ומסתנכרן בין הווב לנייד כשאתה מחובר, עם מצב בסתר שקורא זיכרונות קודמים בלי לכתוב חדשים. הוא חינמי, אינו מציג פרסומות, והחברה אומרת שהיא אינה מוכרת נתונים.

Realtime-Venus הוא שחרור מחקרי. שני צ'קפוינטים של 9B תחת רישיון Apache-2.0 ב-Hugging Face — Realtime-Venus-Omni לאינטראקציה אודיו-ויזואלית ו-Realtime-Venus-Audio לאינטראקציה דיבורית — בנוסף לדוח טכני שהוגש ל-arXiv ב-12 בספטמבר 2026, דף פרויקט, ומאגר מלווה המכיל את רכיב Realtime-Venus-Harness. אין אפליקציה, אין API, אין מחיר, ואין הודעה מהספק. המאגר אינו נפרס על ידי אף ספק הסקה, ואין מעקב אחר הורדות.

המלכודת, בשני הכיוונים

הגרסה של Sesame היא צורת ה״כיבוס הפתוח״ הקלאסית, ו-Sesame כנה לגבי זה יותר מרוב האחרים. הצ'קפוינט של CSM שהמעבדה שחררה תחת Apache-2.0 הוא מודל בסיסי ליצירת דיבור — עמוד שדרה של Llama שמזין מפענח Mimi-codec — והתיעוד מציין במפורש שהוא אינו הקול של האפליקציה ואינו מערכת דיבור-לדיבור מקצה לקצה. הוא אינו יכול ליצור טקסט, והוא מאומן על נתונים שהם בעיקר באנגלית, עם יכולת מוגבלת מחוץ לכך. מה שמפעיל את Sesame Preview הוא מודל פרודקשן גדול יותר שטרם שוחרר. אז אם יצאת לחפש את הקול מהדמו, מצאת את השושלת המחקרית שלו ולא את הדבר עצמו. כאשר אחד מארבעת הסוכנים עונה לקריאה שלך, אתה שומע משהו שאינך יכול להוריד.

הגרסה של Realtime-Venus היא תמונת ראי, ואולי המוזרה יותר. כל מה שפורסם הוא אמיתי: משקלים אמיתיים, קוד אמיתי, דוח אמיתי, רישיון מתירני. מה שחסר הוא כל דרך להשתמש בו שאינה כרוכה בהחזקת GPU. שני צ׳קפוינטים של 9B ב-BF16 הם בערך שמונה-עשר ג׳יגה-בייט של משקלים כל אחד לפני זיכרון אקטיבציה, ושניהם מיועדים להריץ לולאת סטרימינג רציפה של שנייה אחת עם קלט אודיו וווידאו חי. זו פריסה ברמת שרת. אפליקציית צרכן שמעבירה את אותה יכולת לטלפון עושה משהו שהמהדורה הזו אינה מנסה לעשות, והפער בין מודל שניתן להורדה לבין מודל שניתן להרצה הוא בדיוק המקום שבו רוב האנשים שרוצים אותו ייתקעו.

יכולת המדידה היא ההבדל החד יותר

לאף אחד מהמודלים אין ציון עצמאי לאיכות הקול, אך הסיבות שונות.

• Sesame Preview — אין רשומה בזירה, אין הערכה מפורסמת של קול הייצור. המוניטין שלו נשען על מבקרים ועל השפעת ההדגמה המקורית על מאזינים, שהיא ראיה אמיתית מסוג כלשהו ובלתי מכומתת לחלוטין.

• CSM-1B — נקודת הביקורת הפתוחה היא מודל יצירה בסיסי; היא אינה נמדדת מול מערכות שיחתיות משום שהיא אינה כזו.

• Realtime-Venus — נתון קולי אחד בדיווח עצמי, ציון VoiceBench AlpacaEval של 4.81, שהדוח שלה מתאר כמתאים למספר ההשוואה הטוב ביותר. אף צד שלישי לא העריך אותה.

• מה שאף אחד מהשניים לא נותן לך — מספר שהופק בידי מי שאין לו שום אינטרס בתוצאה. אם איכות הקול היא הקריטריון שלך ברכישה, כל ההשוואה אינה ניתנת לניקוד, והמהלך ההגון הוא להאזין לשניהם ולהחליט בעצמך, במקום להישען על טבלה.

חילופי תורות, כשלשניהם יש משהו להוכיח

המוניטין של Sesame נבנה בדיוק על זה. ההדגמה שהפכה את המעבדה למפורסמת הייתה קול עם נשימה, היסוס ותזמון קטיעות משכנע דיו עד כדי כך שהמאזינים הניחו שאדם נמצא על הקו. זו טענה על דינמיקה שיחתית, וזה הדבר שעליו נמכר המוצר.

Realtime-Venus מציגה את אותה טענה עם מספרים מצורפים. ב-Full-Duplex-Bench v1.5 צ'ק-פוינט השמע שלה מדווח שהוא מגיב ל-75% מהפרעות המשתמש, עם שיעורי המשכיות של 97% תחת בקאצ'אנלים, 88% תחת דיבור המיועד לזולת ו-86% תחת דיבור רקע — ולפי הנטען הוא עולה על Gemini 3.1 Live ועל GPT-4o בכל שלושת מדדי ההמשכיות. הנתונים האלה מגיעים מהדוח שלה עצמה, ואף אחד לא שחזר אותם.

אז ההשוואה היא בין הדגמה בלי מספר לבין מספר בלי הדגמה, וזה מצב מביך באמת להיות בו ותיאור הוגן של האופן שבו כל הקטגוריה הזו מדווחת על עצמה כרגע. הדבר היחיד שאפשר לומר בביטחון הוא שאף אחת מהטענות לא שרדה בדיקה של גורם חיצוני, ושיעור המשכיות של 97% בערוצים עורפיים גבוה מספיק כדי להצדיק בדיקה כזו לפני שמצטטים אותו כדבר מוסכם.

A two-column comparison scoreboard titled 'Realtime-Venus vs Sesame Preview — the scoreboard'. The left column, labelled Realtime-Venus, reads 'What it is: research release, Apache-2.0 weights', 'Product: none', 'Agents or voices: one reference voice', 'Languages: English and Chinese', 'Independent voice score: none', 'Runs on: a GPU node you own'. The right column, labelled Sesame Preview, reads 'What it is: free consumer app, closed production voice', 'Product: iOS since May 2026, Android since early August', 'Agents or voices: Maya, Miles, Simone, Charlie', 'Languages: English only', 'Independent voice score: none', 'Runs on: your phone'. The footer reads 'Sesame capabilities per its own mobile preview documentation; Realtime-Venus figures from its technical report, unreproduced.'

מה שאתה יכול לבנות בפועל

Sesame Preview לא נותן לבונה דבר. אין API, אין מזהה מודל, אין מחירון ואין תוכנית מוצהרת לכך. שיחות מוגבלות לשלושים דקות כשמחוברים וחמש אחרת, אנגלית היא השפה היחידה הנתמכת רשמית, והסוכן יחקור ויזכור אך לא יבצע משימות — הוא לא יזמין את הטיסה. שכבת החינם היא המוצר. זו הצעה צרכנית טובה בהחלט ומבוי סתום לאינטגרציה.

Realtime-Venus נותן לבונה כל מה שצריך מלבד מקום להריץ אותו. המשקלים ברישיון מתירני, הקוד נטען באמצעות קריאות Transformers סטנדרטיות, סטרימינג דופלקס מלא נכנסים אליו בהחלפת מתודה אחת, והלולאה המתועדת היא שנייה אחת של prefill בזרימה ואחריה יצירה בזרימה, שוב ושוב. זיכרון וידאו ארוך מופעל באמצעות פרמטר memory-minutes ומתואר כ-training-free, דבר יוצא דופן ליכולת שבדרך כלל דורשת fine-tuning. שתי הסתייגויות מתועדות ולא נותרות להתגלות בדיעבד: מגבלת פריימים שחותכת בשקט וידאו ארוך אלא אם קבוע מועלה לפני ייבוא ה-utility, ודרישת גופן CJK לכתוביות שאינן לטיניות המוטמעות בוידאו דופלקס.

מה ששום דבר מזה לא משנה הוא שההארנס — הרכיב שמבצע את ההאצלות האסינכרוניות שהן החלק הייחודי ביותר בארכיטקטורה — נמצא במאגר GitHub נפרד, מתועד הרבה פחות מהמודל, והוא החלק שמוכנותו לייצור היא הקשה ביותר לשיפוט. בפריסה אמיתית, זרוע ההאצלה היא הסקת טקסט רגילה שיושבת מאחורי ממשק שיחה. OrcaRouter אינו כולל לא את Realtime-Venus ולא את Sesame Preview; שתי שכבות הקול נמצאות מחוץ למה שאנחנו מספקים, ואנחנו אומרים זאת בפשטות במקום לרמוז על יחסי אירוח שאינם קיימים. כמעט 200 מודלי טקסט מאחורי מפתח אחד במחיר המחירון של הספק וללא תוספת מחיר הוא החצי של אותה ארכיטקטורה שאנחנו כן מכסים, עם מעבר אוטומטי לגיבוי כך שמשימה מואצלת שורדת השבתה במעלה הזרם, DSL לניתוב שמחבר כמה מודלים לקריאה אחת, ומיזוג מודלים שבו שיקול הדעת של מודל אחד אינו מספיק. זהו החלק הניתן לרכישה של עיצוב שהחלק המעניין בו אינו למכירה.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge with the Any-to-Any, Transformers, Safetensors, audio, video, speech and streaming tags, and a side panel stating 'This model isn't deployed by any Inference Provider.'

ההמלצה הכנה

אם אתם צרכנים שרוצים את הקול השיחתי בעל הצליל הטוב ביותר שזמין כיום, ושאינכם צריכים לשלב אותו, Sesame Preview הוא חינמי, הוא זמין בשתי הפלטפורמות לנייד, והמוניטין שלו מוצדק עד כדי כך שמבקרים ממשיכים לומר זאת. השתמשו בו ותיהנו ממנו.

אם אתם חוקרים או צוות הנדסה עתיר משאבים, וזקוקים לסטאק אודיו-ויזואלי פתוח בדופלקס מלא שתוכלו לבחון ולכוונן, Realtime-Venus הוא אחת מהאפשרויות האמיתיות הבודדות, והעובדה שהבנצ'מרקים שלו מדווחים באופן עצמי לא משנה את העובדה שהמשקלים פתוחים באמת והארכיטקטורה מתועדת באמת.

אם אתם צוות מוצר שמחפש שכבת קול להשקה ברבעון הזה, אף אחד מאלה אינו התשובה שלכם, והתובנה השימושית מההשוואה ביניהם היא למה. מעבדה אחת בנתה משהו מצוין והשאירה את החלק הטוב סגור; האחרת פרסמה הכול והשאירה לכם לספק את התשתית. הקטגוריה הוכיחה שהיא יכולה ליצור קול ששווה להקשיב לו, אך טרם החליטה אם אותו קול צריך להיות ניתן לרכישה בכל צורה שאינה אפליקציה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית