
HeyGen Voice מול Sesame Preview: הקול שאפשר לקנות לעומת הקול שאפשר רק לדבר איתו
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
זו לא השוואה בין מודלים, ולהעמיד פנים אחרת תהיה הטעות האמיתית היחידה האפשרית כאן. HeyGen Voice הוא מנוע API — מדורג במקום הראשון בזירת ה-Controlled Voice של Artificial Analysis עם 1,202 Elo, נגיש דרך נקודות הקצה v3 של HeyGen, נמכר לפי קרדיט, ניתן לשכפול מהקלטה אחת. Sesame Preview הוא עוזר קולי חינמי לצרכנים שאליו מגיעים על ידי פתיחת דף אינטרנט ושיחה עם אחת מארבע פרסונות בעלות שם, ללא נקודת קצה ציבורית, ללא מזהה מודל, וללא מחיר שבו ניתן לשכור אותו. אחד מהם אפשר לשחרר. האחר הוא הסיבה שאתה יודע איך נשמע קול שיחתי טוב, ולעולם לא הדבר שאתה פורס.
מה כל אחד הוא בפועל
Sesame Preview הוא הדגמה של דיבור שיחתי. מגיעים אליו דרך האתר של החברה עצמה, משוחחים עם מאיה, מיילס, סימון או צ'ארלי, והחוויה מותאמת בכוונה לידידותיות ולכושר הבעה — החברה אומרת זאת במפורש כשהיא מסבירה מדוע בני הלוויה מתנהגים כפי שהם מתנהגים. כיום זה באנגלית בלבד, כשהצוות מציין שיכולת רב-לשונית מופיעה באקראי כתוצאה מזיהום נתונים ו"אינה מתפקדת היטב עדיין", ושהרחבה מעבר לעשרים שפות היא תוכנית לעתיד. הניסוח של החברה עצמה הוא עבודה בעיצומה: "אנחנו עדיין לא שם."
מתחת לדמו נמצא ה-Conversational Speech Model, ארכיטקטורת טקסט-ודיבור מולטימודלית הבנויה משני טרנספורמרים אוטורגרסיביים בסגנון Llama. היא מגיעה בשלושה גדלים — Tiny עם עמוד שדרה של 1B ומפענח של 100M, Small ב-3B ו-250M, Medium ב-8B ו-300M — כאשר כל אחד מהם מאומן באורך רצף של 2,048 טוקנים, בערך שתי דקות של אודיו, במשך חמישה אפוקים על פני כמיליון שעות של דיבור בעיקר באנגלית. רכיבי המחקר המרכזיים פתוחים בקוד פתוח תחת Apache 2.0, ויש מאגר GitHub עבורם. הדמו — הדבר שאנשים באמת משבחים — אינו זה. לדמו אין API ציבורי.
HeyGen Voice הוא ההסדר ההפוך. אין אפליקציית צרכן חינמית שניתן לנסות; יש API מתועד עם קטלוג קולות, נקודת קצה לדיבור, נתיבי שיבוט וחשבון לתשלום. מה שאי אפשר לעשות הוא לפתוח אותו בדפדפן ולנהל איתו שיחה לפי גחמה.
למה בכלל משווים בין השניים
הם מושווים זה לזה מכיוון ששניהם מוצגים כראיה לכך שדיבור סינתטי חצה משהו. Sesame Preview איפס מחדש את הציפיות לגבי איך אודיו שיחתי יכול להישמע — התגובות כשהוא הושק נסבו סביב עד כמה הוא נשמע כמו אדם ולא כמו מנוע טקסט-לדיבור. ה-1,202 של HeyGen Voice בלוח המבוקר הוא אותה טענה בצורה מספרית: מקום ראשון מבין ארבעים ושתיים רשומות כאשר כל מודל מדבר באותם שמונה קולות ייחוס משובטים.
ההבדל הוא במה שאפשר לעשות עם הטענה לאחר מכן. מיקום בלוח ניתן לשחזור, ניתן לבדיקה, ומקושר לנקודת קצה. רושם מדמו אינו אף אחד מהדברים האלה — וחשוב מכך, Sesame Preview לא מופיע כלל בלוח המבוקר, כך שאין Elo להשוות מול 1,202. ההשוואה שאנשים רוצים לעשות אינה זמינה, לא משום ש-Sesame הפסיד אותה, אלא משום שהמודל מעולם לא הוכנס.
לוח התוצאות

• Elo קולי מבוקר — HeyGen Voice: 1,202, #1 מתוך 42. Sesame Preview: לא מופיע.
• גישה — HeyGen Voice: API v3 מתועד, POST /v3/voices/speech. Sesame Preview: אפליקציית ווב לצרכנים ואפליקציית iOS; אין נקודת קצה ציבורית.
• מחיר — HeyGen Voice: $30.00 ל-1M תווים לפי ההמרה של הארנה עצמה של תמחור הקרדיטים; HeyGen אינה מפרסמת תעריף לקול. Sesame Preview: בחינם, ואינו ניתן לרכישה בשום מחיר.
• בחירת קול — HeyGen Voice: יותר מ-300 קולות מוכנים מראש, עיצוב קול לפי תיאור טקסטואלי, שיבוט מיידי ומקצועי. Sesame Preview: ארבע פרסונות קבועות.
• שפות — HeyGen Voice: "עשרות שפות", המספר לא פורסם. Sesame Preview: אנגלית בלבד, עם תמיכה רב-לשונית שאינה מספקת כיום, לפי הודאת החברה עצמה.
• משקלים פתוחים — HeyGen Voice: אין. Sesame Preview: CSM שוחרר תחת Apache 2.0 בגדלים 1B, 3B ו-8B.

הפרט של Apache 2.0 הוא זה שחשוב
מתחת לפסיקה של „אין API” קבורה העובדה ש-Sesame הוציאה בקוד פתוח את מודל המחקר תחת Apache 2.0 — רישיון מתירני, בשלושה גדלים, עם גרסת 1B קטנה מספיק כדי לפעול בלי מרכז נתונים. זו הצעה שונה בתכלית מהדמו, וזהו הנתיב היחיד שבו משהו שמזכיר את הקול של Sesame Preview מגיע למוצר שיצא לשוק.
שתי הסתייגויות שומרות על זה הוגן. רכיבי CSM ששוחררו הם ארטיפקטים מחקריים: החברה מציינת שהמודלים מטפלים בתוכן דיבור אך לא במבנה שיחה, ומצביעה על מודלים דופלקסיים מלאים כעבודה עתידית — כך שהמשקלים ששוחררו אינם החוויה האינטראקטיבית. ושלד 8B שרץ מקומית הוא מבנה עלויות שונה מ־19.30 דולר למיליון תווים של הסקה מתארחת, שזה מה שהמתחרה הזול ביותר מהדרג העליון בזירה גובה. לאירוח עצמי אין חיוב לפי תו, אבל יש לו חיוב ממשי לפי שעת GPU.
עבור מי שבונה, זה ממסגר מחדש את השאלה. אם מה שהרשים אותך ב-Sesame Preview הייתה השיחה, המשקלים הפתוחים לא נותנים לך אותה. אם מה שהרשים אותך היה איכות הקול של מודל הדיבור עצמו, ייתכן שהם כן — ואת זה ניתן לבדוק באופן שדמו לא.
איך נראה שילוח ב-HeyGen Voice
ההבדלים המעשיים הם ההבדלים הרגילים. ה-API של HeyGen מקבל בחירת קול, טקסט, ומהירות אופציונלית בין 0.5 ל-1.5 וגובה צליל של ±50 חצאי טונים, עם BCP-47 לוקאל כרמז. קולות מותאמים אישית מגיעים בשלוש דרכים: מסלול עיצוב מבוסס תיאור שמחזיר עד שלוש אפשרויות מדורגות מפרומפט שמוגבל ל-1,000 תווים, שיבוט מיידי מהקלטה אחת, ושיבוט מקצועי שאומן על עשרים דקות או יותר. מסנן המנוע בנקודת הקצה של הקולות מקבל גם מנועים שאינם של HeyGen, כך שהפלטפורמה אינה גן מוקף חומה סביב המודל של עצמה.
שום דבר מזה לא קיים בצד של Sesame, וזה אינו חסרון של Sesame Preview — זו מהותו של הדבר. דמו שמוטב להראות מה אפשרי לא אמור לשאת SLA.
החשבון, לעומת זאת, הוא החצי הרך יותר. HeyGen מוכרת קרדיטים — 600 תמורת 29 דולר לחודש, 1,000 תמורת 49 דולר, 1,500 תמורת 149 דולר — ומציינת שהצריכה משתנה בהתאם למודל, למשך ולמורכבות, מבלי לפרסם תעריף קולי. הסכום של 30.00 דולר למיליון תווים שהארנה מפרטת הוא ההמרה של Artificial Analysis לאותם קרדיטים, לא ציטוט מ-HeyGen. אז המודל שאפשר לשחרר מתומחר, אבל לפי חשבון של מישהו אחר — וזה טיעון בעד פיילוט מדוד ולא ביקורת על המנוע.

מה בעצם לעשות עם דמו שאתה מעריץ?
המהלך השימושי הוא להפריד בין שני הדברים ש-Sesame Preview מציג. ההתנהגות השיחתית — חילופי תורות, זיכרון, התחושה שאתה מדבר עם מישהו — היא תוצר של מערכת שטרם שוחררה ואין לה נקודת קצה. איכות הדיבור היא החלק שעומדות מאחוריו משקולות Apache 2.0, והחלק שאתה יכול להעריך על האודיו שלך בלי לבקש רשות מאף אחד.
לכל מה שבאמצע, מסלול ההגירה הוא השגרתי: להשיק על מנוע שיש לו API ודירוג, ולתכנן כך שאימוץ המודל של Sesame, אם הוא אי פעם יושק מסחרית, יהיה שינוי בתצורה ולא שכתוב מחדש. פירוש הדבר הוא הפשטה מעל ספק הקול מהיום הראשון — ממשק אחד, מפתח אחד, והמנוע נבחר לפי תצורה. שכבת הניתוב של OrcaRouter בנויה בדיוק לזה: ספקים רבים מאחורי נקודת קצה אחת במחיר המחירון של הספק וללא תוספת, מעבר אוטומטי לגיבוי כשספק נתקע, ו-DSL לניתוב שמאפשר להחליף את המנוע שמאחורי קול בלי לגעת בקוד היישום. הנקודה אינה שהיא מארחת מודל של Sesame — היא לא — אלא שביום שבו קול שאתם מעריכים יהפוך לזמין לרכישה, העלות של לנסות אותו צריכה להיות שורה בקובץ תצורה.
הסגירה הכנה
Sesame Preview אינה מתחרה ל-HeyGen Voice ואין להעריך אותה ככזו. זוהי הדגמה חינמית, באנגלית בלבד, עם ארבע פרסונות, שבמקרה איפסה מחדש את הציפיות לאודיו שיחתי, ושבמקרה שחררה משקולות מחקר ברישיון מתירני בשלושה גדלים. HeyGen Voice הוא המנוע המדורג במקום הראשון בטבלת הדירוג היחידה לדיבור שמחזיקה את הקול קבוע, נמכר באמצעות API שאתה יכול לקרוא לו היום, במחיר שאינך יכול עדיין לחשב.
אם אתה צריך קול שתוכל לשגר כבר ברבעון הזה, ההחלטה אינה בין שני אלה — היא בין HeyGen Voice לבין שאר המנועים המתומחרים בזירה. אם אתה ממתין ל-Sesame, המתן למשקולות, לא לאפליקציה.
