כרטיס hero מיוצר עבור 'Gemini 3.8 TTS vs Sesame Preview' על רקע לבן עם הדגשות גרדיאנט עדינות בכחול וציאן. הכרטיס השמאלי 'Gemini 3.8 Flash TTS' מפרט Elo 1,260 במקום 2, 8 קולות ארנה, נקודת קצה API ו-$16.50 למיליון תווים מנורמלים; הכרטיס הימני 'Sesame' מתפצל ל'אפליקציית Preview — חינם, אנגלית בלבד, ללא API, ללא מזהה מודל' ול'נקודת ביקורת CSM-1B — Apache 2.0, 2B פרמטרים, עמוד שדרה Llama'. שורת כותרת תחתונה מציינת 'Elo לפי Artificial Analysis Provider Voice Arena, ספטמבר 2026; פרטי CSM-1B לפי כרטיס המודל שלו.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Gemini 3.8 TTS מול Sesame Preview: אחד מהם הוא הורדה, והשני הוא אפליקציה

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

חפשו השוואה בין Gemini 3.8 Flash TTSלבין Sesame Preview ותמצאו המון טקסטים שמתייחסים אליהם כשני מוצרים באותה קטגוריה. הם לא, וההבדל אינו טכני בלבד. Gemini 3.8 Flash TTS הוא נקודת קצה של API: יש לו מזהה מודל, מחירון מפורסם, שורה בלוח המובילים במקום השני עם Elo של 1,260 על פני 1,999 דגימות ב-Artificial Analysis Provider Voice Arena, ופורמט בקשה מתועד. Sesame Preview הוא אפליקציית עוזר קולי חינמית לצרכנים עם סוכנים בעלי שמות, שיחות מרובות-תורות ומגבלת שיחה של 30 דקות. אין לה API, אין מזהה מודל, אין תוכנית חיוב ואין ניקוד בלוח הזה.

הארטיפקט האחד של Sesame שאפשר ממש לבנות עליו הוא שוב משהו אחר: CSM-1B, צ'קפוינט Apache 2.0 ב-Hugging Face שמייצר קודי אודיו מטקסט באמצעות עמוד שדרה של Llama ומפענח אודיו Mimi. זה לא הקול שאנשים מדברים עליו כשהם מתארים כמה אנושית האפליקציה נשמעת. אז ההשוואה מתכנסת לשאלה שאפשר לענות עליה: האם אתם רוצים לשכור מודל דיבור, או שאתם רוצים להוריד אחד?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

שני דברים בשם Sesame, ורק אחד מהם בר־בנייה

מתן השמות הוא מקור רוב הבלבול, לכן הפרידו אותו לפני שתמשיכו.

• Sesame Preview — האפליקציה. חינמית לשימוש, סוכנים בשם Maya, Miles, Simone ו-Charlie, שיחה מרובת תורות עם הקשר שנשמר בין התורות, חיפוש באינטרנט ותזכורות כיכולות, אנגלית בלבד, מגבלה של 30 דקות לשיחה. אין משטח מפתחים: אין מול מה לבצע אימות, אין מה למדוד, אין נקודת קצה לקרוא לה.

• CSM-1B — הצ'קפוינט. פורסם ב-Hugging Face תחת sesame/csm-1b עם רישיון Apache 2.0, עמוד שדרה של Llama ומפענח קטן יותר שמייצר קודי אודיו של Mimi. בערך 2 מיליארד פרמטרים, אנגלית, משקולות F32, והוא רץ דרך Hugging Face Transformers. כרטיס המודל מתעד את גרסת ה-1B שיצאה במרץ 2025 ואת התמיכה הנייטיבית ב-Transformers שהגיעה במאי 2025.

שני אלה חולקים חברה ושושלת מחקרית, וזה בערך המקום שבו הקשר נגמר. האפליקציה היא מוצר; הצ'קפוינט הוא תוצר מהמחקר שקדם לו. מבקרים שמשבחים את הזיכרון השיחתי של האפליקציה מתארים מערכת עם שליפה וניהול מצב סביב מודל דיבור, ולא תכונה של צ'קפוינט ה-2B שניתן להוריד.

מה בעצם נמצא בצ'קפוינט?

CSM-1B הוא מודל טקסט-לדיבור במובן הארכיטקטוני שחשוב לכל מי שמתכנן להריץ אותו: הוא מקבל טקסט והקשר שמע כקלט ופולט קודי אודיו RVQ, שאותם המפענח הופך לצורת גל. העובדות המעשיות מכרטיס המודל:

• רישיון — Apache 2.0. זו השורה רבת ההשלכות ביותר בעמוד. שלא כמו רישיונות למשקלי מודל המיועדים למחקר בלבד, Apache 2.0 מתיר שימוש מסחרי ללא הסכם נפרד, מה שהופך את CSM-1B לאחד מצ'קפוינטי הדיבור הפתוחים הבודדים שאפשר להשתמש בהם באמת.

• גודל — כ-2B פרמטרים ב-F32. גדול מספיק כדי להזדקק לחומרה אמיתית לכל דבר במקביל, וקטן מספיק כדי לרוץ על מאיץ בודד לצורכי פיתוח.

• שפה — אנגלית, לפי הכרטיס. לא מודל רב־לשוני.

• תפוצה — 141,461 הורדות בחודש האחרון בזמן כתיבת שורות אלה, עם כ-245,000 לייקים במאגר. זהו צ'קפוינט בשימוש נרחב לפי הסטנדרטים של מודלי דיבור פתוחים, וזה הטיעון החזק ביותר לכך שלארטיפקט יש בסיס משתמשים אמיתי, בלתי תלוי בסיקור העיתונאי של האפליקציה.

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

מה שהכרטיס לא נותן לך הוא טענת איכות שאפשר להשוות לכל דבר. אין שורת ארינה, אין מבחן ספק שמשוחזר על ידי צד שלישי, ואין הערכה מפורסמת של האופן שבו הפלט של הצ'קפוינט קשור לזה של האפליקציה. כל מי שאומר לך שהמודל להורדה נשמע כמו האפליקציה מסיק זאת מהשם.

מדוע אין השוואה ישירה, ומדוע זה אינו פער מחקרי

אין השוואה בין Gemini 3.8 TTS ל-Sesame Preview בלוחות הדירוג, כי לא יכולה להיות כזו. הזירה מדרגת מודלים בכך שהיא מאפשרת למאזינים להשוות קטעים שהופקו על ידי נקודת קצה מתארחת. לאחד הצדדים בזיווג הזה אין נקודת קצה, ולכן לא ניתן לרשום אותו.

כדאי לדייק בכך, מכיוון ש״אין השוואה ראש בראש״ מתואר לעתים קרובות כאילו הנתונים חסרים. הנתונים אינם חסרים. הם בלתי מוגדרים. לשני הדברים המושווים אין משטח מדיד משותף:

• Gemini 3.8 Flash TTS מדורג לפי הקולות המתארחים המקוריים שלו. ל-Sesame Preview אין קולות מקוריים לדירוג במובן הזה — יש לו סוכנים.

• Gemini 3.8 Flash TTS מפרסם מחירון בטוקנים. Sesame Preview חינמי ואינו מפרסם דבר, כי אין מה לחייב.

• Gemini 3.8 Flash TTS מקבל תסריט ומחזיר אודיו. Sesame Preview מקבל שיחה ומחזיר שיחה, עם כל אחזור וזיכרון שהאפליקציה מוסיפה מעליהם.

הדבר הקרוב ביותר להשוואה לגיטימית הוא בין Gemini 3.8 Flash TTS ל-CSM-1B, וגם זה לא מאוזן: לאחד יש Elo עצמאי ותעריפון של ספק, ולשני אין אף אחד מהם. מה שאפשר להשוות הוא צורת ההתחייבות — API מחויב לפי שימוש מול צ'קפוינט שניתן להוריד — וההשוואה הזו לא זקוקה ללוח דירוג.

הצד היחיד של זה שיש עליו מספרים

כל דבר כמותי בזיווג הזה נמצא בצד של גוגל, וזו בעצמה הנקודה.

ב-Artificial Analysis Provider Voice Arena, שנלכד ב-24 בספטמבר 2026, Gemini 3.8 Flash TTS נמצא במקום 2 עם Elo של 1,260 על פני 1,999 דגימות ו-8 קולות בזירה, ושוחרר ב-23 בספטמבר 2026. ה-Gemini 3.8 Flash-Lite TTS האח שלו נמצא במקום 6 עם 1,235. Google מחייבת עבור Flash TTS 0.50 דולר למיליון אסימוני טקסט בקלט ו-9.00 דולר למיליון אסימוני אודיו בפלט עד 31 בדצמבר 2026, ואז 18.00 דולר, כאשר Flash-Lite TTS במחיר 0.50 דולר ו-6.00 דולר, ואז 12.00 דולר; Artificial Analysis מנרמלת אותם ל-16.50 דולר ו-11.00 דולר למיליון תווים כדי שיוכלו לחלוק לוח דירוג עם מודלים שמחייבים ביחידות אחרות. הנרמול הזה הוא האריתמטיקה של הלוח, לא ציטוט של Google.

לעומת זאת, ל-CSM-1B אין מחיר כי אין לו מונה. יש לו מספר הורדות, רישיון ומספר פרמטרים. אם מסגרת קבלת ההחלטות שלך זקוקה ל-Elo, ההשוואה הזו לא תספק אחד עבור צד Sesame, והמסקנה הכנה היא ששתי האפשרויות נבחנות לפי קריטריונים שונים ולא שאחת מהן לא הוכחה.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

אם מה שרצית היה חוויית האפליקציה

הרבה אנשים שמחפשים את ההשוואה הזו לא בוחרים מודל בכלל. הם השתמשו באפליקציית Sesame, אהבו את תחושת השיחה, ורוצים את זה במוצר שלהם. זו בעיה אחרת, וההורדה לא תפתור אותה.

מה שגורם לאפליקציה להרגיש כפי שהיא מרגישה הוא בעיקר לא מודל הדיבור. הקשר מתמשך בין תורי שיחה, ההחלטה לחפש באינטרנט באמצע השיחה, התזמון של מתי סוכן מדבר — אלה הם אורקסטרציה, ואף אחד מהם לא נמצא בצ׳ק-פוינט של 2B. הורדת CSM-1B נותנת לך קול. בניית ההתנהגות של האפליקציה על גביו היא ההנדסה שלך, ומגבלת השיחה של 30 דקות והיעדר API אומרים שלא תוכל לשכור גם את הגרסה המוגמרת.

אם מה שרצית היה מודל דיבור שאפשר לקרוא לו, התשובה הכנה היא ש-Gemini 3.8 Flash TTS הוא האפשרות עם ממשק מתועד, מחיר מפורסם, ציון בלתי תלוי, ודיאלוג בין שני דוברים בבקשה אחת. אם מה שרצית היה משקולות שאפשר לשמור, CSM-1B תחת Apache 2.0 הוא האחד מבין השניים שאפשר להחזיק בו בפועל — והתמורה היא שאתה מספק בעצמך את החומרה, את מערך ההגשה ואת כל הבטחת האיכות.

OrcaRouter לא מארחת אף אחד מאלה. המודל של Google נקרא דרך ה-API של Google עצמה ודרך הממשקים הנקובים בהודעתה מ-23 בספטמבר; CSM-1B הוא צ'קפוינט שאתם מריצים בעצמכם. תפקידה של OrcaRouter הוא השכבה שמעל לבחירה הזו: למעלה מ-200 מודלים מאחורי מפתח אחד במחיר המחירון של הספק וללא תוספת, כך ששינוי בתעריף של ספק נכנס לתוקף באותו היום, מעבר אוטומטי בעת כשל כך שמסלול ניסיוני אינו תלות בייצור, ו-DSL לניתוב שמחבר מודלים לקריאה אחת כאשר קול בודד אינו כל העבודה.

הגרסה הקצרה של ההשוואה הזו היא שהיא בעצם לא באמת השוואה. לצד אחד יש מחירון ו-Elo; לצד השני יש רישיון ומספר הורדות. בחרו את זה שאת העמודה שלו אתם באמת יכולים למלא.