
Sesame Preview לעומת NVIDIA NemotronLabs VoiceChat 11B: הקול שאי אפשר לקבל עבורו רישיון, והקול שאי אפשר לשחרר
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekחדשDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- qwenחדשQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3055אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
- z-aiZ.ai: GLM 5.22026-06-1653אינטליגנציה69כתיבת קוד60מתמטיקה
לשניים ממודלי הקול המדוברים ביותר של 2026 יש דבר משותף שאף סיקור השקה לא יספר לכם: אי אפשר להכניס אף אחד מהם למוצר.Sesame Previewהוא העוזר הצרכני החינמי שהקול השיחתי שלו גרם ל-TestingCatalog לכנות אותו "אחד ממצבי הקול הטובים ביותר בשוק", ולמודל הייצור שמאחוריו אין API, אין מזהה מודל, ואין רישיון שאפשר לקנות — החברה פשוט לא שחררה אותו.NVIDIA NemotronLabs VoiceChat 11Bהוא תמונת המראה: המשקלים ציבוריים, העיצוב הדו-כיווני המלא הוא אכן ראשון מסוגו, והרישיון קובע שימוש למחקר בלבד, כך שאיש אינו יכול להפיץ אותו באופן חוקי. האחד הוא קול שאפשר לשמוע אבל לא לשכור. השני הוא קול שאפשר להחזיק אבל לא למכור. זוהי השוואה בין שתי דלתות נעולות, והשאלה השימושית היא מול איזה מנעול אתה עומד.
שתי דלתות נעולות, עם מנעולים שונים.
התחילו מהצורה של כל אחד, כי השמות מסתירים כמה שני המוצרים שונים. Sesame Preview הוא אפליקציה, לא API. הוא כולל ארבעה סוכנים בעלי אישיויות מובחנות — Maya (חמה ויצירתית), Miles (רגוע וחד), Simone (סקרנית ואינטלקטואלית), Charlie (שנון וחם) — כל אחד עם קול משלו וזיכרון משלו שמסתנכרנים בין אינטרנט למובייל כשאתם מחוברים. הוא מחפש באינטרנט, צולל לעומק, רושם הערות ותזכורות, ושולח סיכום אחרי כל שיחה. התצוגה המקדימה חינמית ללא רמת תשלום, באנגלית בלבד, מוגבלת ל-30 דקות לשיחה כשמחוברים (ולחמש דקות אחרת), ובמכוון אינה מבצעת משימות: היא תעשה סיעור מוחות ותחקור, אבל לא תזמין לך טיסה. לא קיים מפתח API בשום מקום במוצר — קול הייצור הוא תכונה של האפליקציה, לא נקודת קצה.

NVIDIA NemotronLabs VoiceChat 11B הוא הצורה ההפוכה: checkpoint, לא מוצר. הוא הגיע ל־Hugging Face ב־3 באוגוסט 2026 ללא הכרזה — אין פוסט השקה, אין דוח טכני, אין ציוץ; כרטיס המודל הוא ההכרזה. זהו מודל דיבור full-duplex עם 11B פרמטרים (ניתחנו את כותרת safetensors וספרינו 11.095 מיליארד פרמטרים על פני 1,626 טנסורים) הבנוי כערימה אחת: מקודד Fast Conformer שלועס אודיו של 16 קילוהרץ במסגרות של 80 אלפיות שנייה עם אפס הקשר ימני, עמוד שדרה מסוג Nemotron Nano 9B v2 שעושה את החשיבה, מפענח NVIDIA TTS שכותב אודיו של 22.05 קילוהרץ, מפענח RNN-T שמתמלל את המשתמש, וערוץ פלט נפרד הפולט סקריפטים לקריאת כלים מבלי לזהם את התשובה המדוברת. הוא מקשיב ומדבר בו זמנית, ניתן להפריע לו באמצע מילה, ו־NVIDIA משווקת אותו כמודל ה־full-duplex הפתוח הראשון עם קריאת כלים. האם הטענה הזו שורדת מגע עם המציאות הוא הנושא של חלק נפרד בהמשך.
המדד שבו הם חלוקים — שני מועמדים ל"שיחה הטובה ביותר," שני תקני ראיות שבורים.
שני הדגמים שמים את כל המוניטין שלהם על אותו דבר: איכות השיחה — תורנות דיבור, הפרעות, תזמון טבעי, התחושה של שיחה אמיתית. זו הסיבה שהם שייכים לאותה כותרת מלכתחילה. וכאן גם ההשוואה נעשית מוזרה, כי אי אפשר לתת ניקוד הולם לאף אחד מהמועמדים.
ל-Sesame Preview אין מספר בשום מקום. המודל היצרני אינו מושק ואינו רשום — אין מזהה מודל, אין רישום בלוח המובילים של Artificial Analysis לדיבור-לדיבור, אין יעד השהיה, ואין מדד ביצועים כלשהו. ההערה של TestingCatalog ש"זו אחת ממצבי הקול הטובים ביותר בשוק" היא הסכמת מבקרים, לא מדידה, ואין דרך לבצע השוואת A/B עיוורת מול כל דבר אחר. מודל ה-Sesame היחיד שכל אחד יכול להריץ באופן עצמאי הוא CSM-1B הבסיסי עם משקלים פתוחים, וזהו checkpoint של טקסט-לדיבור, לא הקול של האפליקציה.
ל-NVIDIA NemotronLabs VoiceChat 11B יש בדיוק את הבעיה ההפוכה: יש לו מספרים, אבל המספרים מפוצלים בין שני סטנדרטים של ראיות שאינם מתיישבים זה עם זה. NVIDIA מדווחת על 448 אלפיות שנייה כדי לבצע תור חלק, 480 אלפיות שנייה כדי לפנות את התור כשמפריעים לו, ושיעור השתלטות מושלם של 1.0 על הפרעה של המשתמש — כולם נמדדו על ידי היצרן במדד Full-Duplex-Bench 1.0 של NVIDIA עצמה, ואף אחד מהם לא שוחזר באופן עצמאי. המדידות העצמאיות של משפחה זו רשומות תחת שם וספירת פרמטרים שונים — "Nemotron 3 VoiceChat (V1)" בגודל 12B, תווית ש-NVIDIA מעולם לא יישרה עם נקודת הביקורת של 11B ב-Hugging Face — והן אינן מחמיאות בצד ההבנה: 29.2% ב-Big Bench Audio לפי Artificial Analysis, לעומת 37.0% בכרטיס של NVIDIA עצמה. במדד VoiceBench המשפחה משיגה ציון 58.10, התוצאה הפתוחה הטובה ביותר בתחום ה-full-duplex. כך שאותו מודל הוא גם מוביל בין נקודות הביקורת הפתוחות של full-duplex וגם מפגר ביחס של בערך שלושה-לאחד אחרי המובילים בזמן אמת המתארחים, בכל הנוגע להבנת מה שהוא שומע.

ההתפצלות, אם כן, אינה בשאלה מי טוב יותר. אלא ששני המועמדים לשיחה הטובה ביותר של 2026 נשפטים על סמך ראיות הפוכות וחסרות באותה מידה. הקול שמבקרים אומרים שהוא מרגיש הכי אנושי אין לו שום מדידה כלל, והקול שיש לו ערכים בפועל בטבלת הדירוג הוא זה שחולשותיו חשופות. אי אפשר להשוות מוניטין למספר, וכאן יש רק מספר אחד — וזה לא המחמיא.
גישה — הורדה מחנות האפליקציות, או build בגודל 80 ג'יגה-בייט
אם אתה רוצה לנסות כל אחת מהן, קו הזינוק שונה באופן שחשוב יותר מכל מפרט.
Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.
NVIDIA NemotronLabs VoiceChat 11B אינו הורדה שאפשר פשוט להריץ — הוא build שצריך להקים. Hugging Face מציינת שהמודל "אינו פרוס על ידי שום Inference Provider"; NVIDIA לא אירחה אותו; ו-config.json במאגר הוא קובץ תצורת אימון של NeMo, כך שאין checkpoint של Transformers שאפשר להפנות אליו את AutoModel. הנתיב הנתמך הוא סביבת conda המקובעת ל-Python 3.12, PyTorch 2.10 ו-Transformers 4.56, עם causal-conv1d ו-mamba-ssm מהודרים מקוד המקור, על GPU של 80 GB (A100, H100, H200, B200, או RTX 6000) המריץ vLLM — או קונטיינר NGC NIM של NVIDIA, שחושף WebSocket תואם OpenAI Realtime בנתיב /v1/realtime ברגע שנמצאים על החומרה הזו. מונה ההורדות מספר את סיפור הגישה: בערך 80 הורדות בחודש הראשון של המודל, לעומת 107 לייקים. אנשים הוסיפו אותו לסימניות; כמעט אף אחד לא הריץ אותו. הערה כנה אחת לחוקר שכן מריץ: עמוד השדרה ההסקתי שעליו נשען ה-checkpoint הזה, Nemotron Nano 9B v2, הוא עצמו מודל מתארח שאפשר לקרוא לו עוד היום — אבל המודל הדופלקסי שמסביבו לא, והפער הזה הוא כל העניין.

מחיר — אפליקציה חינמית, משקולות חינמיות, וחשבון 80 ג'יגה־בייט
שני הדגמים הם "חינמיים", והמילה עושה את אותה כמות של עבודה מטעה בשני המקרים.
Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.
אמת המידה הכנה ליום שבו כל אחת מאלה תהפוך לזמינה לרכישה: יהיה מודל הקול המתארח אשר יהיה שתבחרו, מחיר המחירון של הספק הוא מה שעליכם לשלם, ללא תוספת מרווח ניתוב על גביו — ההעברה הישירה שגורמת לקיצוץ מחיר של ספק להופיע בחשבונית שלכם באותו היום במקום לאחר מחזור חוזה. אף אחד מהמודלים בקטע זה אינו ניתן לקריאה דרך OrcaRouter: לקול הייצור של Sesame אין API כלל, ו-NVIDIA NemotronLabs VoiceChat 11B אינו ניתן לקריאה בשום דרך. אמת המידה היא עבור הקול שתוכלו לקנות בפועל, והיא בדיוק הסטנדרט שהופך בסיס TTS של 7 דולר למיליון תווים או API עתידי באיכות Sesame לקל לתמחור ביושר.
Memory — האפליקציה שזוכרת לעומת המודל ששוכח
כאן הפער הוא קניון, וזו הסיבה הקונקרטית ביותר לכך ששניים אלה אינם תחליפים. Sesame Preview האפליקציה זוכרת: כל סוכן נושא זיכרון אישי שמסתנכרן בין האינטרנט למובייל כשאתה מחובר, שיחות יכולות להימשך עד 30 דקות, ומצב גלישה בסתר קורא זיכרונות עבר מבלי ליצור חדשים. לעומת זאת, ל-CSM-1B הפתוח יש חלון הקשר של 4K — בערך שלוש עד ארבע דקות של טקסט — ואין לו אוזניים לשמוע אותך בכלל.
NVIDIA NemotronLabs VoiceChat 11B מחזיק לכל היותר כשתי דקות של הקשר אודיו — מעמיס הנתונים של האימון מגביל את ההשמעות ל-142.39 שניות, והכרטיס מזהיר ששיחה מעבר לחלון של שתי דקות עלולה לא להישמר. עבור שיחת תמיכה שצריכה לזכור מה סוכם לפני ארבע דקות, תקרה זו פוסלת כשלעצמה. הוסיפו קול יחיד קבוע (Aria) ללא שיבוט בנקודת הביקורת ששוחררה, והמודל שפתוח לגבי הארכיטקטורה שלו הוא גם המודל שלא יכול לזכור לקוח או לשנות את קולו.
במה כל אחד מהם באמת גרוע
מאופק, כי השוואה שנעצרת בחוזקות היא שיווק:
• Sesame Preview:אין API — אי אפשר לשים את הקול הזה במוצר, ומודל הייצור לא שוחרר ולא קיבל ציון. אנגלית בלבד, אין ביצוע משימות, מגבלת שיחה של 30 דקות, ואין בנצ'מרק עצמאי מכל סוג. המודל הפתוח היחיד, CSM-1B, כולל חלון הקשר של 4K, ללא קריאת כלים, ללא צד האזנה, ואינו הקול של האפליקציה.
• NVIDIA NemotronLabs VoiceChat 11B:רישיון למחקר בלבד (OpenMDW v1.1) — אפשר להוריד, לחקור ולכוונן אותו, אבל אסור לשחרר אותו, וכך גם לכל מי שבונה עליו. אין נקודת קצה מתארחת, כך ש"לנסות אותו" פירושו GPU של 80 GB ובנייה מהמקור. אנגלית בלבד, תקרת זיכרון של כ־2 דקות, קול קבוע אחד. NVIDIA מציינת שהוא עשוי להציג ביצועים נמוכים מהמודל הבסיסי שלו בידע ובמילוי הוראות, כשחשיבה רב־שלבית וחשבון צוינו כחלשים. הוא יכול לקטוע אותך באמצע משפט, להידרדר לג'יבריש שאין ממנו התאוששות או לדיבור עצמי אחרי כמה סבבים, להשמיט מילים בתמלול, ובמפורש אינו מתאים לחדרים רועשים או מהדהדים. קריאת כלים עובדת רק עם הנחיות ותגובות ב־ASCII בלבד, מגיעה לחמישה כלים לכל היותר בכל סשן, ודיוק הארגומנטים (44.2%) ושיעור ההצלחה בניסיון הראשון (33%) משמעותם שהוא אמין יותר בבחירת הכלי הנכון מאשר במילוי הארגומנטים שלו.
מי צריך לבחור איזה
מכיוון שאף אחד מהם אינו ניתן לקריאה, התשובה הכנה מתחילה ממה שאתה מנסה לעשות.
• חווה את הקול עם הביקורות הטובות ביותר של 2026: Sesame Preview, חינם, היום — כיישום. ארבעת הסוכנים, הטיפול בהפרעות, השימושיות במצב נהיגה – שהמבקרים מרבים לצטט: זהו מוצר צרכני, והערך שלו הוא בדיוק הדבר שאי אפשר למדוד.
• למדו מידול דיבור דופלקס מלא:NVIDIA NemotronLabs VoiceChat 11B מהווה את ההורדה המעניינת ביותר בקטגוריה — צ'קפוינט פתוח של 11B עם ערוץ קריאה לכלים תקין, כ-550,000 שעות של אודיו אימון מעורב, והתוצאה הפתוחה הטובה ביותר ב-VoiceBench במצב דופלקס מלא עד כה, והכל בעלות של אפס דולרים עבור המשקלים. הרישיון למחקר בלבד אינו מהווה אילוץ על עבודה זו.
• Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.
• השיקו מוצר קולי ברבעון הזה:אף אחד מאלה. אתם צריכים מודל דיבור-לדיבור בזמן אמת מתארח עם רישיון מסחרי, והדרך הבטוחה לאמץ מודל שלא התחייבתם אליו כנתיב ייצור היא לנתב אליו לצד מודל מוכח עם מעבר אוטומטי למקרה תקלה, כך שקול לא מוכח לעולם לא יפיל שיחה חיה. API אחד על פני יותר מ-200 מודלים מתארחים במחיר מחירון של הספק, ללא תוספת מחיר, הוא מה שהופך ניסיון של קול שזה עתה התאפשר לשינוי תצורה ולא לשכתוב.
התבנית הזו ראויה לשם כי היא תחזור על עצמה. שני הדגמים האלה נמצאים במרחק אירוע אחד מלהיות ניתנים לקריאה — Sesame ביום שבו תשיק מזהה דגם או API, NVIDIA NemotronLabs VoiceChat 11B ביום שבו NVIDIA תפרסם רישיון מסחרי או שמישהו יארח אותו. כשזה יקרה, המהלך הנכון הוא לא לעקור את ערימת הקול הנוכחית שלך. {{1}}המהלך הנכון הוא להוסיף את הקול החדש לצד הישן ולנתב עם failover, {{/1}}{{KEEP}}exactly as you would for any new, unproven model{{/KEEP}}{{2}}. אלה שני הקולות הבלתי-ניתנים-למשלוח הטובים ביותר של 2026; התשתית למשלוח השלישי כבר קיימת{{/2}}.
מה ישנה את ההשוואה הזו?
ארבעה אירועים ישכתבו את המאמר הזה. ממשק API או מזהה מודל לקול הייצור של Sesame — ברגע שזה יקרה, Sesame תפסיק להיות אפליקציה ותהפוך למתחרה ששוק ה-voice-API המאוחסן חיכה לה. רישיון מסחרי או נקודת קצה מאוחסנת עבור NVIDIA NemotronLabs VoiceChat 11B, שיהפכו תוצר מחקרי למוצר אמיתי בין לילה. ציון בלתי תלוי לקול של Sesame — רישום בלוח הדיבור-לדיבור של Artificial Analysis ייתן לטענת "הקול הטוב ביותר" משהו לבדוק מולו. ודוח טכני מ-NVIDIA שיישב בין ה-checkpoint של 11B לבין הערכים של "Nemotron 3 VoiceChat (V1)" בגרסת 12B אשר לוחות הדירוג מודדים, שהוא התנאי המוקדם לסמוך על כל המספרים של המשפחה. עד שיגיע אחד מאלה, הסיכום המדויק פשוט: שני הקולות המעניינים ביותר לשיחות של 2026 נעולים שניהם — האחד על ידי חברה שלא תמכור, והשני על ידי רישיון שלא ישוחרר.
שאלות נפוצות
האם אני יכול להשתמש בקול של כל אחד מהמודלים בתוך האפליקציה שלי?
No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.
איזה משני אלה בעצם נשמע יותר אנושי?
לא ידוע, מטעמים שונים לכל אחד. ל-Sesame Preview אין ציון עצמאי כלל — "אחד ממצבי הקול הטובים ביותר בשוק" של TestingCatalog הוא קונצנזוס של מבקרים, לא מדידה. תזמון השיחה של NVIDIA NemotronLabs VoiceChat 11B (448 אלפיות שנייה לנטילת תור, 480 אלפיות שנייה לויתור בעת קטיעה) מדווח על ידי NVIDIA ולא שוחזר, ומדד ה-Big Bench Audio העצמאי שלו (29.2%, לפי Artificial Analysis, רשום תחת "Nemotron 3 VoiceChat (V1)") מודד הבנה, לא את נעימות הקול. לאחד יש מוניטין שאפשר לשמוע; לשני יש מספרים שעונים על שאלה אחרת.
האם NVIDIA NemotronLabs VoiceChat 11B באמת בחינם?
המשקלים הם בחינם; המודל לא זול. הרצתו דורשת GPU של 80 ג'יגה-בייט (בערך 2–3 דולר לשעה לפי דרישה, 1,500–2,200 דולר לחודש אם הוא נשמר פעיל ברציפות) ובנייה מקוד המקור, ורישיון OpenMDW v1.1 מגביל אותו למטרות מחקר בלבד — כך שגם אחרי ההוצאה הזו, אתה לא יכול להעמיד אותו בפני לקוחות באופן חוקי.
