
Realtime-Venus לעומת Sesame Preview: הדבר שאפשר להשיג אינו הדבר הטוב
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus ו-Sesame Preview נבנו על ידי מעבדות עם רעיונות שונים לחלוטין לגבי לשם מה נועד מודל קולי, והן נקלעו לאותה מלכודת בדיוק מכיוונים מנוגדים. Sesame Preview היא אפליקציה חינמית לצרכנים — iOS מאז מאי 2026, Android מאז תחילת אוגוסט — עם ארבעה סוכנים שיחתיים, חיפוש אינטרנט חי במהלך שיחות, וקול שמבקרים כינו מהטובים ביותר בתחום. המשקלים הפתוחים ש-Sesame פרסמה הם מודל אחר, קטן יותר, שהחברה עצמה אינה מציגה כקול ששמעתם בהדגמה. Realtime-Venus, המערכת הדופלקסית המלאה בגודל 9B מצוות Venus של Ant Group ומאוניברסיטת Tsinghua, פעל בכיוון ההפוך: הארטיפקטים הניתנים להורדה הם הדבר האמיתי, ואין מוצר בכלל. בשני המקרים, הפער בין מה שזמין למה שמרשים הוא הדבר השימושי ביותר להבין לפני שאתם מתכננים משהו סביב אחד מהשניים.
מה כל אחד הוא בפועל

Sesame Preview הוא מוצר. Sesame היא מעבדה בסן פרנסיסקו, שנוסדה ב-2023 על ידי ברנדן איריב, אנקיט קומאר וראיין בראון, בגיבוי a16z, Sequoia, Spark ו-Matrix, והעוזר הקולי לצרכנים שלה מגיע עם ארבע דמויות — מאיה, מיילס, סימון וצ'ארלי — שלכל אחת מהן מזג וקול ייחודיים. הסוכן יכול לחפש באינטרנט תוך כדי שיחה, לרשום הערות ותזכורות, ולשלוח סיכום לאחר שיחה. הזיכרון הוא לכל סוכן בנפרד ומסתנכרן בין הווב לנייד כשאתה מחובר, עם מצב בסתר שקורא זיכרונות קודמים בלי לכתוב חדשים. הוא חינמי, אינו מציג פרסומות, והחברה אומרת שהיא אינה מוכרת נתונים.
Realtime-Venus הוא שחרור מחקרי. שני צ'קפוינטים של 9B תחת רישיון Apache-2.0 ב-Hugging Face — Realtime-Venus-Omni לאינטראקציה אודיו-ויזואלית ו-Realtime-Venus-Audio לאינטראקציה דיבורית — בנוסף לדוח טכני שהוגש ל-arXiv ב-12 בספטמבר 2026, דף פרויקט, ומאגר מלווה המכיל את רכיב Realtime-Venus-Harness. אין אפליקציה, אין API, אין מחיר, ואין הודעה מהספק. המאגר אינו נפרס על ידי אף ספק הסקה, ואין מעקב אחר הורדות.
המלכודת, בשני הכיוונים
הגרסה של Sesame היא צורת ה״כיבוס הפתוח״ הקלאסית, ו-Sesame כנה לגבי זה יותר מרוב האחרים. הצ'קפוינט של CSM שהמעבדה שחררה תחת Apache-2.0 הוא מודל בסיסי ליצירת דיבור — עמוד שדרה של Llama שמזין מפענח Mimi-codec — והתיעוד מציין במפורש שהוא אינו הקול של האפליקציה ואינו מערכת דיבור-לדיבור מקצה לקצה. הוא אינו יכול ליצור טקסט, והוא מאומן על נתונים שהם בעיקר באנגלית, עם יכולת מוגבלת מחוץ לכך. מה שמפעיל את Sesame Preview הוא מודל פרודקשן גדול יותר שטרם שוחרר. אז אם יצאת לחפש את הקול מהדמו, מצאת את השושלת המחקרית שלו ולא את הדבר עצמו. כאשר אחד מארבעת הסוכנים עונה לקריאה שלך, אתה שומע משהו שאינך יכול להוריד.
הגרסה של Realtime-Venus היא תמונת ראי, ואולי המוזרה יותר. כל מה שפורסם הוא אמיתי: משקלים אמיתיים, קוד אמיתי, דוח אמיתי, רישיון מתירני. מה שחסר הוא כל דרך להשתמש בו שאינה כרוכה בהחזקת GPU. שני צ׳קפוינטים של 9B ב-BF16 הם בערך שמונה-עשר ג׳יגה-בייט של משקלים כל אחד לפני זיכרון אקטיבציה, ושניהם מיועדים להריץ לולאת סטרימינג רציפה של שנייה אחת עם קלט אודיו וווידאו חי. זו פריסה ברמת שרת. אפליקציית צרכן שמעבירה את אותה יכולת לטלפון עושה משהו שהמהדורה הזו אינה מנסה לעשות, והפער בין מודל שניתן להורדה לבין מודל שניתן להרצה הוא בדיוק המקום שבו רוב האנשים שרוצים אותו ייתקעו.
יכולת המדידה היא ההבדל החד יותר
לאף אחד מהמודלים אין ציון עצמאי לאיכות הקול, אך הסיבות שונות.
• Sesame Preview — אין רשומה בזירה, אין הערכה מפורסמת של קול הייצור. המוניטין שלו נשען על מבקרים ועל השפעת ההדגמה המקורית על מאזינים, שהיא ראיה אמיתית מסוג כלשהו ובלתי מכומתת לחלוטין.
• CSM-1B — נקודת הביקורת הפתוחה היא מודל יצירה בסיסי; היא אינה נמדדת מול מערכות שיחתיות משום שהיא אינה כזו.
• Realtime-Venus — נתון קולי אחד בדיווח עצמי, ציון VoiceBench AlpacaEval של 4.81, שהדוח שלה מתאר כמתאים למספר ההשוואה הטוב ביותר. אף צד שלישי לא העריך אותה.
• מה שאף אחד מהשניים לא נותן לך — מספר שהופק בידי מי שאין לו שום אינטרס בתוצאה. אם איכות הקול היא הקריטריון שלך ברכישה, כל ההשוואה אינה ניתנת לניקוד, והמהלך ההגון הוא להאזין לשניהם ולהחליט בעצמך, במקום להישען על טבלה.
חילופי תורות, כשלשניהם יש משהו להוכיח
המוניטין של Sesame נבנה בדיוק על זה. ההדגמה שהפכה את המעבדה למפורסמת הייתה קול עם נשימה, היסוס ותזמון קטיעות משכנע דיו עד כדי כך שהמאזינים הניחו שאדם נמצא על הקו. זו טענה על דינמיקה שיחתית, וזה הדבר שעליו נמכר המוצר.
Realtime-Venus מציגה את אותה טענה עם מספרים מצורפים. ב-Full-Duplex-Bench v1.5 צ'ק-פוינט השמע שלה מדווח שהוא מגיב ל-75% מהפרעות המשתמש, עם שיעורי המשכיות של 97% תחת בקאצ'אנלים, 88% תחת דיבור המיועד לזולת ו-86% תחת דיבור רקע — ולפי הנטען הוא עולה על Gemini 3.1 Live ועל GPT-4o בכל שלושת מדדי ההמשכיות. הנתונים האלה מגיעים מהדוח שלה עצמה, ואף אחד לא שחזר אותם.
אז ההשוואה היא בין הדגמה בלי מספר לבין מספר בלי הדגמה, וזה מצב מביך באמת להיות בו ותיאור הוגן של האופן שבו כל הקטגוריה הזו מדווחת על עצמה כרגע. הדבר היחיד שאפשר לומר בביטחון הוא שאף אחת מהטענות לא שרדה בדיקה של גורם חיצוני, ושיעור המשכיות של 97% בערוצים עורפיים גבוה מספיק כדי להצדיק בדיקה כזו לפני שמצטטים אותו כדבר מוסכם.

מה שאתה יכול לבנות בפועל
Sesame Preview לא נותן לבונה דבר. אין API, אין מזהה מודל, אין מחירון ואין תוכנית מוצהרת לכך. שיחות מוגבלות לשלושים דקות כשמחוברים וחמש אחרת, אנגלית היא השפה היחידה הנתמכת רשמית, והסוכן יחקור ויזכור אך לא יבצע משימות — הוא לא יזמין את הטיסה. שכבת החינם היא המוצר. זו הצעה צרכנית טובה בהחלט ומבוי סתום לאינטגרציה.
Realtime-Venus נותן לבונה כל מה שצריך מלבד מקום להריץ אותו. המשקלים ברישיון מתירני, הקוד נטען באמצעות קריאות Transformers סטנדרטיות, סטרימינג דופלקס מלא נכנסים אליו בהחלפת מתודה אחת, והלולאה המתועדת היא שנייה אחת של prefill בזרימה ואחריה יצירה בזרימה, שוב ושוב. זיכרון וידאו ארוך מופעל באמצעות פרמטר memory-minutes ומתואר כ-training-free, דבר יוצא דופן ליכולת שבדרך כלל דורשת fine-tuning. שתי הסתייגויות מתועדות ולא נותרות להתגלות בדיעבד: מגבלת פריימים שחותכת בשקט וידאו ארוך אלא אם קבוע מועלה לפני ייבוא ה-utility, ודרישת גופן CJK לכתוביות שאינן לטיניות המוטמעות בוידאו דופלקס.
מה ששום דבר מזה לא משנה הוא שההארנס — הרכיב שמבצע את ההאצלות האסינכרוניות שהן החלק הייחודי ביותר בארכיטקטורה — נמצא במאגר GitHub נפרד, מתועד הרבה פחות מהמודל, והוא החלק שמוכנותו לייצור היא הקשה ביותר לשיפוט. בפריסה אמיתית, זרוע ההאצלה היא הסקת טקסט רגילה שיושבת מאחורי ממשק שיחה. OrcaRouter אינו כולל לא את Realtime-Venus ולא את Sesame Preview; שתי שכבות הקול נמצאות מחוץ למה שאנחנו מספקים, ואנחנו אומרים זאת בפשטות במקום לרמוז על יחסי אירוח שאינם קיימים. כמעט 200 מודלי טקסט מאחורי מפתח אחד במחיר המחירון של הספק וללא תוספת מחיר הוא החצי של אותה ארכיטקטורה שאנחנו כן מכסים, עם מעבר אוטומטי לגיבוי כך שמשימה מואצלת שורדת השבתה במעלה הזרם, DSL לניתוב שמחבר כמה מודלים לקריאה אחת, ומיזוג מודלים שבו שיקול הדעת של מודל אחד אינו מספיק. זהו החלק הניתן לרכישה של עיצוב שהחלק המעניין בו אינו למכירה.

ההמלצה הכנה
אם אתם צרכנים שרוצים את הקול השיחתי בעל הצליל הטוב ביותר שזמין כיום, ושאינכם צריכים לשלב אותו, Sesame Preview הוא חינמי, הוא זמין בשתי הפלטפורמות לנייד, והמוניטין שלו מוצדק עד כדי כך שמבקרים ממשיכים לומר זאת. השתמשו בו ותיהנו ממנו.
אם אתם חוקרים או צוות הנדסה עתיר משאבים, וזקוקים לסטאק אודיו-ויזואלי פתוח בדופלקס מלא שתוכלו לבחון ולכוונן, Realtime-Venus הוא אחת מהאפשרויות האמיתיות הבודדות, והעובדה שהבנצ'מרקים שלו מדווחים באופן עצמי לא משנה את העובדה שהמשקלים פתוחים באמת והארכיטקטורה מתועדת באמת.
אם אתם צוות מוצר שמחפש שכבת קול להשקה ברבעון הזה, אף אחד מאלה אינו התשובה שלכם, והתובנה השימושית מההשוואה ביניהם היא למה. מעבדה אחת בנתה משהו מצוין והשאירה את החלק הטוב סגור; האחרת פרסמה הכול והשאירה לכם לספק את התשתית. הקטגוריה הוכיחה שהיא יכולה ליצור קול ששווה להקשיב לו, אך טרם החליטה אם אותו קול צריך להיות ניתן לרכישה בכל צורה שאינה אפליקציה.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
