
HeyGen Voice مقابل Sesame Preview: الصوت الذي يمكنك شراؤه مقابل الصوت الذي لا يمكنك سوى التحدث إليه
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
هذه ليست مقارنة بين نماذج، والتظاهر بغير ذلك سيكون الخطأ الحقيقي الوحيد المتاح هنا. HeyGen Voice هو محرك API — احتل المرتبة الأولى في ساحة Controlled Voice التابعة لـ Artificial Analysis عند 1,202 Elo، ويُتاح عبر نقاط نهاية v3 الخاصة بـ HeyGen، ويُباع حسب الرصيد، وقابل للاستنساخ من تسجيل واحد. Sesame Preview هو مساعد صوتي استهلاكي مجاني تصل إليه بفتح صفحة ويب والتحدث إلى إحدى أربع شخصيات مُسمّاة، بلا نقطة نهاية عامة، ولا معرّف نموذج، ولا سعر يمكن استئجاره به. أحدهما يمكنك شحنه. أما الآخر فهو السبب في أنك تعرف كيف يبدو الصوت الحواري الجيد، وليس أبدًا الشيء الذي تنشره.
ما هو كل واحد منها في الحقيقة
Sesame Preview هو عرض توضيحي للكلام التحاوري. تصل إليه عبر موقع الشركة نفسه، وتتحدث إلى Maya أو Miles أو Simone أو Charlie، والتجربة مُحسّنة عمدًا لتكون ودودة ومعبّرة — والشركة تقول ذلك صراحة عند وصف سبب تصرف الرفقاء على هذا النحو. وهو متاح باللغة الإنجليزية فقط اليوم، مع إشارة الفريق إلى أن القدرة متعددة اللغات تظهر عرضًا نتيجة تلوث البيانات وأنها "لا تؤدي أداءً جيدًا بعد"، وأن التوسع إلى أكثر من عشرين لغة خطة مستقبلية. وصياغة الشركة نفسها هي عمل قيد التقدم: "لم نصل إلى هناك بعد."
تحت العرض التوضيحي يوجد Conversational Speech Model، وهي بنية متعددة الوسائط للنص والكلام مبنية من محوّلين انحداريين ذاتيًا على طراز Llama. وهي متاحة بثلاثة أحجام — Tiny بشبكة أساسية 1B ومفكك 100M، وSmall بسعة 3B و250M، وMedium بسعة 8B و300M — كل منها مُدرَّب بطول تسلسل 2,048 رمزًا، أي نحو دقيقتين من الصوت، لمدة خمس دورات تدريبية على مدى نحو مليون ساعة من الكلام الإنجليزي في معظمه. المكوّنات البحثية الرئيسية مفتوحة المصدر بموجب Apache 2.0، ويوجد مستودع GitHub لها. أما العرض التوضيحي — الشيء الذي يمدحه الناس فعلاً — فليس ذلك. لا يمتلك العرض التوضيحي واجهة برمجة تطبيقات عامة.
HeyGen Voice هو الترتيب المعاكس. لا يوجد تطبيق مجاني للمستهلك لتجربته؛ هناك API موثّق مع كتالوج صوتي، ونقطة نهاية للكلام، ومسارات استنساخ، وفاتورة. ما لا يمكنك فعله هو فتحه في متصفح وإجراء محادثة معه بشكل عفوي.
لماذا يتم المقارنة بين الاثنين على أي حال
يتم مقارنتهما لأن كليهما يُقدَّم كدليل على أن الكلام الاصطناعي قد تجاوز شيئًا ما. لقد أعاد Sesame Preview ضبط التوقعات بشأن ما يمكن أن يبدو عليه الصوت الحواري — وكانت ردود الفعل عند صدوره تدور حول مدى شبهه بشخص حقيقي بدلًا من محرك تحويل النص إلى كلام. إن حصول HeyGen Voice على 1,202 في اللوحة المضبوطة هو الادعاء نفسه بصيغة رقمية: المركز الأول بين اثنتين وأربعين مشاركة حين تتحدث كل النماذج بالأصوات المرجعية الثمانية المستنسخة نفسها.
الفرق هو ما يمكنك فعله بالادعاء بعد ذلك. إنّ موضعًا على لوحة النتائج قابل لإعادة الإنتاج، وقابل للاختبار، ومرتبط بنقطة نهاية. أما انطباع العرض التوضيحي فلا يمتلك أيًّا من ذلك — والأهم من ذلك، لا يظهر Sesame Preview على لوحة النتائج الخاضعة للتحكم على الإطلاق، لذا لا يوجد Elo يمكن مقارنته بـ 1,202. المقارنة التي يريد الناس إجراءها غير متاحة، ليس لأن Sesame خسرها، بل لأن النموذج لم يُدرَج قط.
لوحة النتائج

• إيلو الصوت المتحكَّم فيه — صوت HeyGen: 1,202، رقم 1 من 42. Sesame Preview: غير مُدرَج.
• الوصول — HeyGen Voice: واجهة برمجة تطبيقات v3 موثّقة، POST /v3/voices/speech. Sesame Preview: تطبيق ويب للمستهلكين وiOS؛ لا توجد نقطة نهاية عامة.
• السعر — HeyGen Voice: 30.00 دولار لكل مليون حرف بناءً على تحويل arena نفسه لتسعير الرصيد؛ ولا تنشر HeyGen أي سعر للصوت. Sesame Preview: مجاني، وغير قابل للشراء بأي سعر.
• اختيار الصوت — HeyGen Voice: أكثر من 300 صوت جاهز مسبقًا، تصميم صوت موصوف نصيًا، استنساخ فوري واحترافي. Sesame Preview: أربع شخصيات ثابتة.
• اللغات — HeyGen Voice: "عشرات اللغات"، والعدد غير منشور. Sesame Preview: الإنجليزية فقط، مع دعم متعدد اللغات دون المستوى المطلوب اليوم وفقًا لاعتراف الشركة نفسها.
• أوزان مفتوحة — HeyGen Voice: لا شيء. Sesame Preview: تم إصدار CSM بموجب Apache 2.0 بأحجام 1B و3B و8B.

تفصيل Apache 2.0 هو ما يهم
تحت حكم «لا API» تكمن حقيقة أن Sesame جعلت نموذج البحث مفتوح المصدر بموجب Apache 2.0 — رخصة متساهلة، بثلاثة أحجام، مع نسخة 1B صغيرة بما يكفي لتعمل دون مركز بيانات. هذا طرح مختلف حقًا عن العرض التجريبي، وهو السبيل الوحيد الذي ينتهي به أي شيء يشبه صوت Sesame Preview إلى منتج مُشحون.
هناك تحفظان يحافظان على المصداقية. إن مكوّنات CSM المُصدَرة هي أعمال بحثية: تشير الشركة إلى أن النماذج تتعامل مع محتوى الكلام ولكن ليس مع بنية المحادثة، وتتجه نحو نماذج ثنائية الاتجاه بالكامل كعمل مستقبلي — لذا فإن الأوزان المُصدَرة ليست التجربة التفاعلية. كما أن نموذجاً أساسياً بحجم 8B يعمل محلياً يمثل هيكل تكلفة مختلفاً عن 19.30 دولاراً لكل مليون حرف من الاستدلال المستضاف، وهو ما يتقاضاه أرخص منافس من الطبقة الأولى في الساحة. لا تفرض الاستضافة الذاتية فاتورة لكل حرف، بل فاتورة حقيقية جداً لكل ساعة GPU.
بالنسبة لمن يبني، هذا يعيد صياغة السؤال. إذا كان ما أثار إعجابك في Sesame Preview هو المحادثة، فإن الأوزان المفتوحة لا تمنحك إياها. وإذا كان ما أثار إعجابك هو جودة الصوت لنموذج الكلام نفسه، فقد تمنحك إياها — وهذا قابل للاختبار بطريقة لا يكون فيها العرض التجريبي كذلك.
كيف يبدو الشحن على HeyGen Voice
الاختلافات العملية هي الاختلافات العادية. تستقبل واجهة برمجة تطبيقات HeyGen اختيار صوت، ونصاً، واختيارية سرعة بين 0.5 و1.5 ونغمة عبر ±50 نصف نغمة، مع تلميح لـ BCP-47 الإعدادات المحلية تلميح. تأتي الأصوات المخصصة بثلاث طرق: مسار تصميم مدفوع بالوصف يعيد ما يصل إلى ثلاثة خيارات مرتبة من موجه يقتصر على 1000 حرف، ونسخ فوري من تسجيل واحد، ونسخ احترافي مدرب على عشرين دقيقة أو أكثر. المحرك الذي يرشح على نقطة نهاية الأصوات يقبل أيضاً محركات غير HeyGen، لذا فإن المنصة ليست حديقة مسورة حول نموذجها الخاص.
لا يوجد أي من ذلك على جانب Sesame، وهو ليس تقصيرًا من Sesame Preview — بل هذا ما عليه الأمر. لا ينبغي لعرض تجريبي مُحسَّن لإظهار ما هو ممكن أن يحمل SLA.
الفاتورة، مع ذلك، هي النصف الأقل صلابة. يبيع HeyGen أرصدة — 600 مقابل 29 دولارًا شهريًا، و1,000 مقابل 49 دولارًا، و1,500 مقابل 149 دولارًا — ويذكر أن الاستهلاك يختلف حسب النموذج والمدة والتعقيد، دون نشر تعرفة للصوت. أما سعر 30.00 دولارًا لكل مليون حرف الذي تدرجه الساحة فهو تحويل أجرته Artificial Analysis لتلك الأرصدة، وليس اقتباسًا من HeyGen. لذا فإن النموذج الذي يمكنك إطلاقه له سعر، لكنه مبني على حسابات شخص آخر — وهو ما يعد حجة لصالح تجربة أولية مُقاسة بدلًا من انتقاد المحرك.

ما الذي يجب فعله فعلاً مع عرض تجريبي يُعجبك؟
الخطوة المفيدة هي الفصل بين الأمرين اللذين يوضحهما Sesame Preview. فالسلوك الحواري — تناوب الأدوار، والذاكرة، والإحساس بأنك تتحدث إلى شخص ما — هو نتاج نظام لم يُطرح بعد وليس له نقطة نهاية. أما جودة الكلام فهي الجزء الذي تقف خلفه أوزان Apache 2.0، والجزء الذي يمكنك تقييمه على صوتك الخاص دون طلب إذن من أي أحد.
أما بالنسبة لكل ما يقع بين ذلك، فإن مسار الترحيل هو المسار العادي المألوف: أطلق على محرك يمتلك واجهة برمجية وتصنيفًا، وصمّم بحيث يكون تبنّي نموذج Sesame، إذا طُرح تجاريًا يومًا ما، تغييرًا في الإعدادات لا إعادة كتابة. وهذا يعني تجريدًا فوق مزوّد الصوت من اليوم الأول — واجهة واحدة، مفتاح واحد، والمحرك يُختار عبر الإعدادات. طُبقة التوجيه في OrcaRouter مبنية لهذا الغرض تحديدًا: مزوّدون كثر خلف نقطة نهاية واحدة بسعر قائمة المزوّد دون أي هامش ربح، وتحويل تلقائي عند تعطّل أحد المورّدين، ولغة DSL للتوجيه تتيح لك تبديل المحرك وراء صوت ما دون لمس شيفرة التطبيق. الفكرة ليست أنه يستضيف نموذج Sesame — فهو لا يفعل ذلك — بل أنه في اليوم الذي يصبح فيه صوت تُعجب به متاحًا للشراء، ينبغي أن تكون تكلفة تجربته سطرًا في ملف إعدادات.
الختام الصادق
إن Sesame Preview ليس منافسًا لـ HeyGen Voice، ولا ينبغي تقييمه بوصفه كذلك. فهو عرض تجريبي مجاني، باللغة الإنجليزية فقط، بأربع شخصيات، وقد صادف أنه أعاد ضبط التوقعات بشأن الصوت الحواري، وصادف أنه أتاح أوزانًا بحثية مرخّصة بترخيص متسامح وبثلاثة أحجام. أما HeyGen Voice فهو المحرك الأعلى تصنيفًا على لوحة الصدارة الصوتية الوحيدة التي تُبقي الصوت ثابتًا، ويُباع عبر واجهة برمجة تطبيقات (API) يمكنك استدعاؤها اليوم، بسعر لا يمكنك حسابه بعد.
إذا كنت بحاجة إلى صوت يمكنك إطلاقه هذا الربع، فالقرار ليس بين هذين الاثنين — بل بين HeyGen Voice والمحركات الأخرى المسعّرة على الساحة. وإذا كنت تنتظر Sesame، فانتظر الأوزان، لا التطبيق.
