بطاقة عنوان رئيسية لـ 'GPT-Live-1 مقابل Sesame Preview'، بعنوان فرعي 'أفضل صوت هنا هو الذي لا يملك واجهة برمجة تطبيقات'، مع شارة تقول 'أحدهما مجاني ومغلق، والآخر مدفوع وقابل للاستدعاء' وثلاث بطاقات: 'Sesame Preview — تطبيق مجاني، بلا واجهة برمجة تطبيقات، الصوت الإنتاجي غير مُصدَر'، 'GPT-Live-1 — 0.05 دولار لكل دقيقة صوتية، واجهة برمجة تطبيقات عامة منذ 10 سبتمبر 2026' و'الجزء القابل للبناء من Sesame — CSM-1B، Apache-2.0، مليار معامل، 7 دولارات لكل مليون حرف أو الاستضافة الذاتية'، فوق شريط تذييل يقول 'الصوت الإنتاجي لـ Sesame ليس له معيار منشور؛ أرقام صوت GPT-Live-1 مُبلَّغ عنها من OpenAI.' شعار OrcaRouter مركّب في أسفل اليمين.
Guides & Insights

GPT-Live-1 مقابل Sesame Preview: أفضل صوت في هذه المقارنة هو الذي لا يمكنك شراؤه

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

اسأل أي شخص جرّب كليهما، وستجد أن الفارق في الترتيب ليس ضئيلًا: Sesame Preview هو أكثر مساعد صوتي مقنع تحدّث إليه معظم الناس. وهو أيضًا المساعد الذي لا يمكنك البناء عليه. يجري مقارنة GPT-Live-1 وSesame Preview باستمرار — فكلاهما حواري، وكلاهما يتعامل مع المقاطعة، وكلاهما يبدو كإنسان لا كشجرة هاتفية — لكنهما يُطرحان بطريقتين متناقضتين. GPT-Live-1 نموذج مستضاف تستأجره بالدقيقة، ومتاح للاستدعاء العام منذ 10 سبتمبر 2026. أما Sesame Preview فهو تطبيق مجاني للمستهلكين بلا أي API على الإطلاق، والصوت الذي ينال إعجاب الناس يعمل على نموذج إنتاجي لم يُطرح قط.

ما هو كل واحد منها في الحقيقة

• GPT-Live-1 — نموذج OpenAI الصوتي ثنائي الاتجاه الكامل، متاح في ChatGPT منذ 8 يوليو 2026، وفي API منذ 10 سبتمبر بسعر 0.05 دولار لكل دقيقة صوتية. اثنا عشر صوتًا في API، دون استنساخ، ودون إدخال للصور أو الفيديو، ويُعاد النص المكتوب ونص الرد مع كل جلسة.

• معاينة Sesame — المساعد الصوتي للمستهلكين من Sesame. مجاني على iOS منذ مايو 2026، ومتاح على نطاق واسع على Android منذ أوائل أغسطس 2026، بالإضافة إلى معاينة ويب تُعطي الأولوية للصوت. أربعة وكلاء — Maya وMiles وSimone وCharlie — باللغة الإنجليزية فقط، مع حد أقصى للمكالمة يبلغ 30 دقيقة ينخفض إلى 5 دقائق عند تسجيل الخروج.

• CSM-1B — الجزء المفتوح من Sesame: نموذج كلام حواري بحجم 1B صدر بموجب رخصة Apache 2.0 في 23 أبريل 2026، مبني على بنية Llama الأساسية مع مفكك ترميز منفصل ومرمّز Mimi الخاص بـ Kyutai، وينتج كلامًا إنجليزيًا أحادي القناة بتردد 24 kHz من سياق يبلغ نحو 4 آلاف رمز.

الأسطر الثلاثة أعلاه هي الشكل الكامل للقرار. شركة واحدة تبيع نموذجًا بالدقيقة. والأخرى تمنح تطبيقًا مجانًا وتفتح مصدر نموذج أصغر ليس هو النموذج الموجود في التطبيق.

الفجوة بين العرض التجريبي والتحميل

كانت Sesame صريحة بشكل غير معتاد بشأن هذا، وهي الحقيقة الوحيدة الأكثر أهمية لأي شخص يقيّم هذا الثنائي. الصوت في تطبيق Preview — ذلك الذي أنتج المقاطع المنتشرة ومراجعات «وضع الصوت الأفضل في فئته» — هو نموذج إنتاجي أكبر ومغلق. أما CSM-1B فهو نقطة تحقق مفتوحة بعدد 1B من المعلمات من المختبر نفسه، ووفق تقييم الأشخاص الذين شغّلوا كليهما، فهو صوت أضعف بشكل واضح. كما أن الجلسات على Preview محدودة بسقف أقصى ومحصورة في اللغة الإنجليزية، ولا يوجد تنفيذ للمهام: الوكلاء يتحدثون فقط، ولا يحجزون أو يشترون أو يقدمون أي أوراق.

وهذا يترك للمطورين عرضًا حقيقيًا لكنه أضيق: نقطة تحقق صوتية حوارية قابلة للاستضافة الذاتية من دون رسوم ترخيص، تُستضاف عبر مزوّد استدلال خارجي واحد مقابل 7 دولارات لكل مليون حرف — أي نحو 0.35 دولار لكل ساعة من الصوت المُصنَّع — أو مجانًا على عتادك الخاص. لم ينشر أحد اختبارًا مرجعيًا مستقلًا سواء لصوت Preview أو CSM-1B، لذا فإن أي ادعاء بشأن الجودة في أي من الاتجاهين هو انطباع سماعي، لا قياس. كذلك لم تنشر Sesame أي تسعير علني، ولا طبقة للمؤسسات، ولا خطة لتحقيق الدخل؛ والتوجه المعلن للشركة هو شراكات بحثية ومنتج عتادي مخطط له.

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

ما الذي يوفره 0.05 دولار في الدقيقة ولا يوفره المجاني

عرض GPT-Live-1 لمطوّر ليس أنه يبدو أفضل، لأن هذه الحجة لا يمكن كسبها ضد نموذج مغلق لا يستطيع أحد قياسه. بل إن الشيء قابل للاستدعاء ومسعّر. وبشكل ملموس، ما تحصل عليه مقابل استمرار دوران العدّاد:

• جلسة تتحكم بها — معرّف نموذج واحد، ونقطة نهاية واحدة لـ Live Sessions، ومثال التكامل المنشور الذي يعمل عبر WebRTC، وجلسة تقوم بتكوينها باستخدام التعليمات والأصوات وكتلة تفويض.

• التعامل مع المقاطعة كسلوك موثّق — تفاعلية بنسبة 80.1% على Full Duplex Bench v1.5 مقابل 45.4% لـ GPT-Realtime-2.1، مع زمن انتقال لتبادل الأدوار قدره 0.798 ثانية ونجاح بنسبة 87% في استدعاء الأدوات. جميع هذه الأرقام الثلاثة هي أرقام OpenAI نفسها، نُشرت مع الإصدار ولم يُعِد إنتاجها أحد حتى وقت كتابة هذا النص.

• خلفية استدلال تختارها — تُسلّم طبقة الصوت العمل الثقيل عبر حدود غير متزامنة إلى نموذج منفصل مُسمّى في إعدادات الجلسة، فيواصل العمل بينما تستمر المحادثة. في مثال توثيق OpenAI، تكون تلك الخلفية GPT-5.6 Terra؛ وعند إطلاق المستهلك في يوليو كانت GPT-5.5.

• النصوص المكتوبة ونص الاستجابة والفوترة على غرار الاتصالات الهاتفية — 3.00 دولارات مقابل ساعة من الخط المفتوح المتواصل، تُحتسب بالثانية، مع احتساب 15 ثانية لتهيئة الجلسة كرصيد بدلًا من إضافتها.

تمنحك Sesame محادثة أفضل ولا أياً من تلك. إذا كنت تبني منتجاً، فإن «محادثة أفضل، بلا API، بلا سعر، بلا معيار أداء، الإنجليزية فقط، حد 30 دقيقة» ليس مقارنة — بل قائمة انتظار.

يوجد الآن رقم على GPT-Live-1 لم يكن موجودًا عند إطلاقه للمستهلكين، وهو الموازن الصادق لكل ما ورد أعلاه. يمنح مؤشر Speech to Speech Index التابع لـ Artificial Analysis نموذج GPT-Live-1 نسبة 69.8% — أي في المرتبة السابعة من بين أحد عشر نموذجًا، خلف GPT-Realtime-2.1 عند 73.9% وخلف Grok Voice Think Fast 2.0 عند 79.0%. لذا فإن النموذج الذي يمكنك شراؤه ليس الأفضل على اللوحة المستقلة أيضًا. وما لا تستطيع اللوحة تقييمه هو الأمر الذي يتفوق فيه Sesame فعليًا: لم يُقيَّم أي من النماذج الأحد عشر على ذلك المؤشر بناءً على شعور التحدث إليه، ولصوت Sesame Preview ليس له صف في أي مكان.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

الجزء من المكدس الذي لا ينتمي إلى أي من الشركتين

هنا يتقارب الخياران، وهنا يتوقف القرار عن كونه ثنائيًا. لا Sesame Preview ولا GPT-Live-1 وكيل كامل. فكلاء Sesame لا ينفّذون المهام؛ أما GPT-Live-1 فيفوّض صراحةً أي شيء يتطلب استدلالًا أو استرجاعًا أو أداة إلى نموذج خلفي. في كلا التصميمين، يحدث العمل المثير للاهتمام خلف الصوت، في استدعاء نموذج نصي عادي، وهذه الطبقة قابلة للنقل بطريقة لا تكون فيها طبقة الصوت كذلك — يمكنك نقل الواجهة الخلفية دون إعادة تسجيل مُوجِّه واحد لنموذج الكلام.

في تلك الواجهة الخلفية أيضًا يصبح OrcaRouter مفيدًا، ويستحق الأمر أن نكون دقيقين بشأن ما نوجّهه وما لا نوجّهه. نحن لا نوجّه GPT-Live-1: فنقطة نهاية Live Sessions مملوكة لـ OpenAI، وطبقة الصوت هناك خارج متناولنا. كما لا نوجّه نموذج Sesame الإنتاجي، لسبب أبسط هو أنه لم يُطرح قط كواجهة برمجية API. ما نوجّهه هو الطبقة التي يسلّم إليها كلا المنتجين العمل. نحو 190 نموذجًا من أحد عشر مزوّدًا upstream تعمل خلف مفتاح واحد بسعر قائمة المزوّد دون هامش ربح، مع تحويل تلقائي عند الفشل بين المزوّدين ولغة توجيه DSL يمكنها تركيب عدة نماذج في استدعاء واحد. وبالنسبة لفريق يبني على واجهة صوتية أمامية غير مُثبتة، فهذا هو التحوّط المهم: يمكن استبدال طبقة الكلام أو تركها معزولة دون أن تأخذ طبقة الاستدلال معها، ويمكن في يونيو استبدال النموذج الذي راهنت عليه في مارس بتعديل سطر واحد.

ماذا تشاهد

ثلاثة أمور قد تغيّر هذه المقارنة، وليس أي منها بيد أي أحد حتى الآن. واجهة برمجة تطبيقات Sesame — حتى وإن كانت مدفوعة — ستحوّل فورًا أقوى صوت في الفئة إلى خيار قابل للبناء، وستضع سعرًا حقيقيًا إلى جانب سعر GPT-Live-1 البالغ $0.05. ومن شأن معيار أداء منشور لصوت Preview أن يحوّل انطباع السماع إلى رقم، وتميل التقييمات المستقلة إلى القسوة على الأصوات التي لم تتنافس يومًا إلا في العروض التوضيحية. وأول إعادة إنتاج خارجية لأرقام التفاعلية وزمن الاستجابة الخاصة بـ OpenAI ستحسم ما إذا كان الازدواج الكامل فجوة قدرات حقيقية أم تقييمًا مُحكم الاختيار.

حتى ذلك الحين، فإن التقسيم الصادق هو هذا. إذا كنت تختار صوتًا لنفسك، فاستخدم Sesame Preview — فهو مجاني، وهو أفضل، ولا يكلفك شيئًا أن تفضّله. وإذا كنت تختار صوتًا لمنتج عليك شحنه وبيعه ودعمه، فإن GPT-Live-1 هو الوحيد من بين الاثنين الذي يمكنك شراؤه فعليًا، وكونه ليس الصوت الأفضل سماعًا هو ثمن الدخول.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا