
GPT-Live-1 مقابل Sesame Preview: أفضل صوت في هذه المقارنة هو الذي لا يمكنك شراؤه
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة

اسأل أي شخص جرّب كليهما، وستجد أن الفارق في الترتيب ليس ضئيلًا: Sesame Preview هو أكثر مساعد صوتي مقنع تحدّث إليه معظم الناس. وهو أيضًا المساعد الذي لا يمكنك البناء عليه. يجري مقارنة GPT-Live-1 وSesame Preview باستمرار — فكلاهما حواري، وكلاهما يتعامل مع المقاطعة، وكلاهما يبدو كإنسان لا كشجرة هاتفية — لكنهما يُطرحان بطريقتين متناقضتين. GPT-Live-1 نموذج مستضاف تستأجره بالدقيقة، ومتاح للاستدعاء العام منذ 10 سبتمبر 2026. أما Sesame Preview فهو تطبيق مجاني للمستهلكين بلا أي API على الإطلاق، والصوت الذي ينال إعجاب الناس يعمل على نموذج إنتاجي لم يُطرح قط.
ما هو كل واحد منها في الحقيقة
• GPT-Live-1 — نموذج OpenAI الصوتي ثنائي الاتجاه الكامل، متاح في ChatGPT منذ 8 يوليو 2026، وفي API منذ 10 سبتمبر بسعر 0.05 دولار لكل دقيقة صوتية. اثنا عشر صوتًا في API، دون استنساخ، ودون إدخال للصور أو الفيديو، ويُعاد النص المكتوب ونص الرد مع كل جلسة.
• معاينة Sesame — المساعد الصوتي للمستهلكين من Sesame. مجاني على iOS منذ مايو 2026، ومتاح على نطاق واسع على Android منذ أوائل أغسطس 2026، بالإضافة إلى معاينة ويب تُعطي الأولوية للصوت. أربعة وكلاء — Maya وMiles وSimone وCharlie — باللغة الإنجليزية فقط، مع حد أقصى للمكالمة يبلغ 30 دقيقة ينخفض إلى 5 دقائق عند تسجيل الخروج.
• CSM-1B — الجزء المفتوح من Sesame: نموذج كلام حواري بحجم 1B صدر بموجب رخصة Apache 2.0 في 23 أبريل 2026، مبني على بنية Llama الأساسية مع مفكك ترميز منفصل ومرمّز Mimi الخاص بـ Kyutai، وينتج كلامًا إنجليزيًا أحادي القناة بتردد 24 kHz من سياق يبلغ نحو 4 آلاف رمز.
الأسطر الثلاثة أعلاه هي الشكل الكامل للقرار. شركة واحدة تبيع نموذجًا بالدقيقة. والأخرى تمنح تطبيقًا مجانًا وتفتح مصدر نموذج أصغر ليس هو النموذج الموجود في التطبيق.
الفجوة بين العرض التجريبي والتحميل
كانت Sesame صريحة بشكل غير معتاد بشأن هذا، وهي الحقيقة الوحيدة الأكثر أهمية لأي شخص يقيّم هذا الثنائي. الصوت في تطبيق Preview — ذلك الذي أنتج المقاطع المنتشرة ومراجعات «وضع الصوت الأفضل في فئته» — هو نموذج إنتاجي أكبر ومغلق. أما CSM-1B فهو نقطة تحقق مفتوحة بعدد 1B من المعلمات من المختبر نفسه، ووفق تقييم الأشخاص الذين شغّلوا كليهما، فهو صوت أضعف بشكل واضح. كما أن الجلسات على Preview محدودة بسقف أقصى ومحصورة في اللغة الإنجليزية، ولا يوجد تنفيذ للمهام: الوكلاء يتحدثون فقط، ولا يحجزون أو يشترون أو يقدمون أي أوراق.
وهذا يترك للمطورين عرضًا حقيقيًا لكنه أضيق: نقطة تحقق صوتية حوارية قابلة للاستضافة الذاتية من دون رسوم ترخيص، تُستضاف عبر مزوّد استدلال خارجي واحد مقابل 7 دولارات لكل مليون حرف — أي نحو 0.35 دولار لكل ساعة من الصوت المُصنَّع — أو مجانًا على عتادك الخاص. لم ينشر أحد اختبارًا مرجعيًا مستقلًا سواء لصوت Preview أو CSM-1B، لذا فإن أي ادعاء بشأن الجودة في أي من الاتجاهين هو انطباع سماعي، لا قياس. كذلك لم تنشر Sesame أي تسعير علني، ولا طبقة للمؤسسات، ولا خطة لتحقيق الدخل؛ والتوجه المعلن للشركة هو شراكات بحثية ومنتج عتادي مخطط له.

ما الذي يوفره 0.05 دولار في الدقيقة ولا يوفره المجاني
عرض GPT-Live-1 لمطوّر ليس أنه يبدو أفضل، لأن هذه الحجة لا يمكن كسبها ضد نموذج مغلق لا يستطيع أحد قياسه. بل إن الشيء قابل للاستدعاء ومسعّر. وبشكل ملموس، ما تحصل عليه مقابل استمرار دوران العدّاد:
• جلسة تتحكم بها — معرّف نموذج واحد، ونقطة نهاية واحدة لـ Live Sessions، ومثال التكامل المنشور الذي يعمل عبر WebRTC، وجلسة تقوم بتكوينها باستخدام التعليمات والأصوات وكتلة تفويض.
• التعامل مع المقاطعة كسلوك موثّق — تفاعلية بنسبة 80.1% على Full Duplex Bench v1.5 مقابل 45.4% لـ GPT-Realtime-2.1، مع زمن انتقال لتبادل الأدوار قدره 0.798 ثانية ونجاح بنسبة 87% في استدعاء الأدوات. جميع هذه الأرقام الثلاثة هي أرقام OpenAI نفسها، نُشرت مع الإصدار ولم يُعِد إنتاجها أحد حتى وقت كتابة هذا النص.
• خلفية استدلال تختارها — تُسلّم طبقة الصوت العمل الثقيل عبر حدود غير متزامنة إلى نموذج منفصل مُسمّى في إعدادات الجلسة، فيواصل العمل بينما تستمر المحادثة. في مثال توثيق OpenAI، تكون تلك الخلفية GPT-5.6 Terra؛ وعند إطلاق المستهلك في يوليو كانت GPT-5.5.
• النصوص المكتوبة ونص الاستجابة والفوترة على غرار الاتصالات الهاتفية — 3.00 دولارات مقابل ساعة من الخط المفتوح المتواصل، تُحتسب بالثانية، مع احتساب 15 ثانية لتهيئة الجلسة كرصيد بدلًا من إضافتها.
تمنحك Sesame محادثة أفضل ولا أياً من تلك. إذا كنت تبني منتجاً، فإن «محادثة أفضل، بلا API، بلا سعر، بلا معيار أداء، الإنجليزية فقط، حد 30 دقيقة» ليس مقارنة — بل قائمة انتظار.
يوجد الآن رقم على GPT-Live-1 لم يكن موجودًا عند إطلاقه للمستهلكين، وهو الموازن الصادق لكل ما ورد أعلاه. يمنح مؤشر Speech to Speech Index التابع لـ Artificial Analysis نموذج GPT-Live-1 نسبة 69.8% — أي في المرتبة السابعة من بين أحد عشر نموذجًا، خلف GPT-Realtime-2.1 عند 73.9% وخلف Grok Voice Think Fast 2.0 عند 79.0%. لذا فإن النموذج الذي يمكنك شراؤه ليس الأفضل على اللوحة المستقلة أيضًا. وما لا تستطيع اللوحة تقييمه هو الأمر الذي يتفوق فيه Sesame فعليًا: لم يُقيَّم أي من النماذج الأحد عشر على ذلك المؤشر بناءً على شعور التحدث إليه، ولصوت Sesame Preview ليس له صف في أي مكان.

الجزء من المكدس الذي لا ينتمي إلى أي من الشركتين
هنا يتقارب الخياران، وهنا يتوقف القرار عن كونه ثنائيًا. لا Sesame Preview ولا GPT-Live-1 وكيل كامل. فكلاء Sesame لا ينفّذون المهام؛ أما GPT-Live-1 فيفوّض صراحةً أي شيء يتطلب استدلالًا أو استرجاعًا أو أداة إلى نموذج خلفي. في كلا التصميمين، يحدث العمل المثير للاهتمام خلف الصوت، في استدعاء نموذج نصي عادي، وهذه الطبقة قابلة للنقل بطريقة لا تكون فيها طبقة الصوت كذلك — يمكنك نقل الواجهة الخلفية دون إعادة تسجيل مُوجِّه واحد لنموذج الكلام.
في تلك الواجهة الخلفية أيضًا يصبح OrcaRouter مفيدًا، ويستحق الأمر أن نكون دقيقين بشأن ما نوجّهه وما لا نوجّهه. نحن لا نوجّه GPT-Live-1: فنقطة نهاية Live Sessions مملوكة لـ OpenAI، وطبقة الصوت هناك خارج متناولنا. كما لا نوجّه نموذج Sesame الإنتاجي، لسبب أبسط هو أنه لم يُطرح قط كواجهة برمجية API. ما نوجّهه هو الطبقة التي يسلّم إليها كلا المنتجين العمل. نحو 190 نموذجًا من أحد عشر مزوّدًا upstream تعمل خلف مفتاح واحد بسعر قائمة المزوّد دون هامش ربح، مع تحويل تلقائي عند الفشل بين المزوّدين ولغة توجيه DSL يمكنها تركيب عدة نماذج في استدعاء واحد. وبالنسبة لفريق يبني على واجهة صوتية أمامية غير مُثبتة، فهذا هو التحوّط المهم: يمكن استبدال طبقة الكلام أو تركها معزولة دون أن تأخذ طبقة الاستدلال معها، ويمكن في يونيو استبدال النموذج الذي راهنت عليه في مارس بتعديل سطر واحد.
ماذا تشاهد
ثلاثة أمور قد تغيّر هذه المقارنة، وليس أي منها بيد أي أحد حتى الآن. واجهة برمجة تطبيقات Sesame — حتى وإن كانت مدفوعة — ستحوّل فورًا أقوى صوت في الفئة إلى خيار قابل للبناء، وستضع سعرًا حقيقيًا إلى جانب سعر GPT-Live-1 البالغ $0.05. ومن شأن معيار أداء منشور لصوت Preview أن يحوّل انطباع السماع إلى رقم، وتميل التقييمات المستقلة إلى القسوة على الأصوات التي لم تتنافس يومًا إلا في العروض التوضيحية. وأول إعادة إنتاج خارجية لأرقام التفاعلية وزمن الاستجابة الخاصة بـ OpenAI ستحسم ما إذا كان الازدواج الكامل فجوة قدرات حقيقية أم تقييمًا مُحكم الاختيار.
حتى ذلك الحين، فإن التقسيم الصادق هو هذا. إذا كنت تختار صوتًا لنفسك، فاستخدم Sesame Preview — فهو مجاني، وهو أفضل، ولا يكلفك شيئًا أن تفضّله. وإذا كنت تختار صوتًا لمنتج عليك شحنه وبيعه ودعمه، فإن GPT-Live-1 هو الوحيد من بين الاثنين الذي يمكنك شراؤه فعليًا، وكونه ليس الصوت الأفضل سماعًا هو ثمن الدخول.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
