بطاقة رئيسية مُولّدة بعنوان "HeyGen Voice مقابل Sesame Preview"، تُقابل بين واجهة برمجة تطبيقات صوتية موثّقة تحمل تصنيف Elo مقيسًا وعرض تجريبي موجّه للمستهلك بلا نقطة وصول عامة، وموسومة بتاريخ Artificial Analysis هو 9 أكتوبر 2026. يظهر شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

HeyGen Voice مقابل Sesame Preview: الصوت الذي يمكنك شراؤه مقابل الصوت الذي لا يمكنك سوى التحدث إليه

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

هذه ليست مقارنة بين نماذج، والتظاهر بغير ذلك سيكون الخطأ الحقيقي الوحيد المتاح هنا. HeyGen Voice هو محرك API — احتل المرتبة الأولى في ساحة Controlled Voice التابعة لـ Artificial Analysis عند 1,202 Elo، ويُتاح عبر نقاط نهاية v3 الخاصة بـ HeyGen، ويُباع حسب الرصيد، وقابل للاستنساخ من تسجيل واحد. Sesame Preview هو مساعد صوتي استهلاكي مجاني تصل إليه بفتح صفحة ويب والتحدث إلى إحدى أربع شخصيات مُسمّاة، بلا نقطة نهاية عامة، ولا معرّف نموذج، ولا سعر يمكن استئجاره به. أحدهما يمكنك شحنه. أما الآخر فهو السبب في أنك تعرف كيف يبدو الصوت الحواري الجيد، وليس أبدًا الشيء الذي تنشره.

ما هو كل واحد منها في الحقيقة

Sesame Preview هو عرض توضيحي للكلام التحاوري. تصل إليه عبر موقع الشركة نفسه، وتتحدث إلى Maya أو Miles أو Simone أو Charlie، والتجربة مُحسّنة عمدًا لتكون ودودة ومعبّرة — والشركة تقول ذلك صراحة عند وصف سبب تصرف الرفقاء على هذا النحو. وهو متاح باللغة الإنجليزية فقط اليوم، مع إشارة الفريق إلى أن القدرة متعددة اللغات تظهر عرضًا نتيجة تلوث البيانات وأنها "لا تؤدي أداءً جيدًا بعد"، وأن التوسع إلى أكثر من عشرين لغة خطة مستقبلية. وصياغة الشركة نفسها هي عمل قيد التقدم: "لم نصل إلى هناك بعد."

تحت العرض التوضيحي يوجد Conversational Speech Model، وهي بنية متعددة الوسائط للنص والكلام مبنية من محوّلين انحداريين ذاتيًا على طراز Llama. وهي متاحة بثلاثة أحجام — Tiny بشبكة أساسية 1B ومفكك 100M، وSmall بسعة 3B و250M، وMedium بسعة 8B و300M — كل منها مُدرَّب بطول تسلسل 2,048 رمزًا، أي نحو دقيقتين من الصوت، لمدة خمس دورات تدريبية على مدى نحو مليون ساعة من الكلام الإنجليزي في معظمه. المكوّنات البحثية الرئيسية مفتوحة المصدر بموجب Apache 2.0، ويوجد مستودع GitHub لها. أما العرض التوضيحي — الشيء الذي يمدحه الناس فعلاً — فليس ذلك. لا يمتلك العرض التوضيحي واجهة برمجة تطبيقات عامة.

HeyGen Voice هو الترتيب المعاكس. لا يوجد تطبيق مجاني للمستهلك لتجربته؛ هناك API موثّق مع كتالوج صوتي، ونقطة نهاية للكلام، ومسارات استنساخ، وفاتورة. ما لا يمكنك فعله هو فتحه في متصفح وإجراء محادثة معه بشكل عفوي.

لماذا يتم المقارنة بين الاثنين على أي حال

يتم مقارنتهما لأن كليهما يُقدَّم كدليل على أن الكلام الاصطناعي قد تجاوز شيئًا ما. لقد أعاد Sesame Preview ضبط التوقعات بشأن ما يمكن أن يبدو عليه الصوت الحواري — وكانت ردود الفعل عند صدوره تدور حول مدى شبهه بشخص حقيقي بدلًا من محرك تحويل النص إلى كلام. إن حصول HeyGen Voice على 1,202 في اللوحة المضبوطة هو الادعاء نفسه بصيغة رقمية: المركز الأول بين اثنتين وأربعين مشاركة حين تتحدث كل النماذج بالأصوات المرجعية الثمانية المستنسخة نفسها.

الفرق هو ما يمكنك فعله بالادعاء بعد ذلك. إنّ موضعًا على لوحة النتائج قابل لإعادة الإنتاج، وقابل للاختبار، ومرتبط بنقطة نهاية. أما انطباع العرض التوضيحي فلا يمتلك أيًّا من ذلك — والأهم من ذلك، لا يظهر Sesame Preview على لوحة النتائج الخاضعة للتحكم على الإطلاق، لذا لا يوجد Elo يمكن مقارنته بـ 1,202. المقارنة التي يريد الناس إجراءها غير متاحة، ليس لأن Sesame خسرها، بل لأن النموذج لم يُدرَج قط.

لوحة النتائج

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• إيلو الصوت المتحكَّم فيه — صوت HeyGen: 1,202، رقم 1 من 42. Sesame Preview: غير مُدرَج.

• الوصول — HeyGen Voice: واجهة برمجة تطبيقات v3 موثّقة، POST /v3/voices/speech. Sesame Preview: تطبيق ويب للمستهلكين وiOS؛ لا توجد نقطة نهاية عامة.

• السعر — HeyGen Voice: ‏30.00 دولار لكل مليون حرف بناءً على تحويل arena نفسه لتسعير الرصيد؛ ولا تنشر HeyGen أي سعر للصوت. Sesame Preview: مجاني، وغير قابل للشراء بأي سعر.

• اختيار الصوت — HeyGen Voice: أكثر من 300 صوت جاهز مسبقًا، تصميم صوت موصوف نصيًا، استنساخ فوري واحترافي. Sesame Preview: أربع شخصيات ثابتة.

• اللغات — HeyGen Voice: "عشرات اللغات"، والعدد غير منشور. Sesame Preview: الإنجليزية فقط، مع دعم متعدد اللغات دون المستوى المطلوب اليوم وفقًا لاعتراف الشركة نفسها.

• أوزان مفتوحة — HeyGen Voice: لا شيء. Sesame Preview: تم إصدار CSM بموجب Apache 2.0 بأحجام 1B و3B و8B.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

تفصيل Apache 2.0 هو ما يهم

تحت حكم «لا API» تكمن حقيقة أن Sesame جعلت نموذج البحث مفتوح المصدر بموجب Apache 2.0 — رخصة متساهلة، بثلاثة أحجام، مع نسخة 1B صغيرة بما يكفي لتعمل دون مركز بيانات. هذا طرح مختلف حقًا عن العرض التجريبي، وهو السبيل الوحيد الذي ينتهي به أي شيء يشبه صوت Sesame Preview إلى منتج مُشحون.

هناك تحفظان يحافظان على المصداقية. إن مكوّنات CSM المُصدَرة هي أعمال بحثية: تشير الشركة إلى أن النماذج تتعامل مع محتوى الكلام ولكن ليس مع بنية المحادثة، وتتجه نحو نماذج ثنائية الاتجاه بالكامل كعمل مستقبلي — لذا فإن الأوزان المُصدَرة ليست التجربة التفاعلية. كما أن نموذجاً أساسياً بحجم 8B يعمل محلياً يمثل هيكل تكلفة مختلفاً عن 19.30 دولاراً لكل مليون حرف من الاستدلال المستضاف، وهو ما يتقاضاه أرخص منافس من الطبقة الأولى في الساحة. لا تفرض الاستضافة الذاتية فاتورة لكل حرف، بل فاتورة حقيقية جداً لكل ساعة GPU.

بالنسبة لمن يبني، هذا يعيد صياغة السؤال. إذا كان ما أثار إعجابك في Sesame Preview هو المحادثة، فإن الأوزان المفتوحة لا تمنحك إياها. وإذا كان ما أثار إعجابك هو جودة الصوت لنموذج الكلام نفسه، فقد تمنحك إياها — وهذا قابل للاختبار بطريقة لا يكون فيها العرض التجريبي كذلك.

كيف يبدو الشحن على HeyGen Voice

الاختلافات العملية هي الاختلافات العادية. تستقبل واجهة برمجة تطبيقات HeyGen اختيار صوت، ونصاً، واختيارية سرعة بين 0.5 و1.5 ونغمة عبر ±50 نصف نغمة، مع تلميح لـ BCP-47 الإعدادات المحلية تلميح. تأتي الأصوات المخصصة بثلاث طرق: مسار تصميم مدفوع بالوصف يعيد ما يصل إلى ثلاثة خيارات مرتبة من موجه يقتصر على 1000 حرف، ونسخ فوري من تسجيل واحد، ونسخ احترافي مدرب على عشرين دقيقة أو أكثر. المحرك الذي يرشح على نقطة نهاية الأصوات يقبل أيضاً محركات غير HeyGen، لذا فإن المنصة ليست حديقة مسورة حول نموذجها الخاص.

لا يوجد أي من ذلك على جانب Sesame، وهو ليس تقصيرًا من Sesame Preview — بل هذا ما عليه الأمر. لا ينبغي لعرض تجريبي مُحسَّن لإظهار ما هو ممكن أن يحمل SLA.

الفاتورة، مع ذلك، هي النصف الأقل صلابة. يبيع HeyGen أرصدة — 600 مقابل 29 دولارًا شهريًا، و1,000 مقابل 49 دولارًا، و1,500 مقابل 149 دولارًا — ويذكر أن الاستهلاك يختلف حسب النموذج والمدة والتعقيد، دون نشر تعرفة للصوت. أما سعر 30.00 دولارًا لكل مليون حرف الذي تدرجه الساحة فهو تحويل أجرته Artificial Analysis لتلك الأرصدة، وليس اقتباسًا من HeyGen. لذا فإن النموذج الذي يمكنك إطلاقه له سعر، لكنه مبني على حسابات شخص آخر — وهو ما يعد حجة لصالح تجربة أولية مُقاسة بدلًا من انتقاد المحرك.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

ما الذي يجب فعله فعلاً مع عرض تجريبي يُعجبك؟

الخطوة المفيدة هي الفصل بين الأمرين اللذين يوضحهما Sesame Preview. فالسلوك الحواري — تناوب الأدوار، والذاكرة، والإحساس بأنك تتحدث إلى شخص ما — هو نتاج نظام لم يُطرح بعد وليس له نقطة نهاية. أما جودة الكلام فهي الجزء الذي تقف خلفه أوزان Apache 2.0، والجزء الذي يمكنك تقييمه على صوتك الخاص دون طلب إذن من أي أحد.

أما بالنسبة لكل ما يقع بين ذلك، فإن مسار الترحيل هو المسار العادي المألوف: أطلق على محرك يمتلك واجهة برمجية وتصنيفًا، وصمّم بحيث يكون تبنّي نموذج Sesame، إذا طُرح تجاريًا يومًا ما، تغييرًا في الإعدادات لا إعادة كتابة. وهذا يعني تجريدًا فوق مزوّد الصوت من اليوم الأول — واجهة واحدة، مفتاح واحد، والمحرك يُختار عبر الإعدادات. طُبقة التوجيه في OrcaRouter مبنية لهذا الغرض تحديدًا: مزوّدون كثر خلف نقطة نهاية واحدة بسعر قائمة المزوّد دون أي هامش ربح، وتحويل تلقائي عند تعطّل أحد المورّدين، ولغة DSL للتوجيه تتيح لك تبديل المحرك وراء صوت ما دون لمس شيفرة التطبيق. الفكرة ليست أنه يستضيف نموذج Sesame — فهو لا يفعل ذلك — بل أنه في اليوم الذي يصبح فيه صوت تُعجب به متاحًا للشراء، ينبغي أن تكون تكلفة تجربته سطرًا في ملف إعدادات.

الختام الصادق

إن Sesame Preview ليس منافسًا لـ HeyGen Voice، ولا ينبغي تقييمه بوصفه كذلك. فهو عرض تجريبي مجاني، باللغة الإنجليزية فقط، بأربع شخصيات، وقد صادف أنه أعاد ضبط التوقعات بشأن الصوت الحواري، وصادف أنه أتاح أوزانًا بحثية مرخّصة بترخيص متسامح وبثلاثة أحجام. أما HeyGen Voice فهو المحرك الأعلى تصنيفًا على لوحة الصدارة الصوتية الوحيدة التي تُبقي الصوت ثابتًا، ويُباع عبر واجهة برمجة تطبيقات (API) يمكنك استدعاؤها اليوم، بسعر لا يمكنك حسابه بعد.

إذا كنت بحاجة إلى صوت يمكنك إطلاقه هذا الربع، فالقرار ليس بين هذين الاثنين — بل بين HeyGen Voice والمحركات الأخرى المسعّرة على الساحة. وإذا كنت تنتظر Sesame، فانتظر الأوزان، لا التطبيق.