
StepAudio 3 Realtime مقابل Sesame Preview: الصوت الذي يمدحه الجميع مقابل الصوت الذي يمتلك تقييمًا
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
خلال معظم عام 2026، كان أقوى ادعاء يمكن لأي شخص تقديمه عن الذكاء الاصطناعي الصوتي مجرد انطباع سماعي. كان مساعد Sesame يبدو أكثر بشرية من أي شيء آخر، وقال عدد كافٍ من الناس ذلك حتى أصبح النقطة المرجعية — بلا معيار، وبلا رقم، وبلا وسيلة للتحقق. في 15 سبتمبر 2026، StepAudio 3 Realtimeوصل من StepFun مع رقم مرتبط بأقرب نسخة قابلة للقياس من تلك الجودة: 98.9% في تقييم Conversational Dynamics من Artificial Analysis، المركز الأول. Sesame Previewليس على تلك اللوحة.
الجزء المثير للاهتمام ليس أن أحدهما تغلّب على الآخر، بل أن الجودة التي اشتهرت بها Sesame أصبحت الآن شيئًا يقيّمه طرف ثالث، والنموذج ذو السمعة لم يُقَس عليها قط.
ما هو كل واحد من هذه في الواقع
إنهما ليسا من النوع نفسه من الأشياء، وهذا يحدد من المقارنة أكثر مما تفعله أي درجة.
Sesame Preview هو مساعد صوتي للمستهلكين. مجاني على iOS منذ مايو 2026، وعلى نطاق واسع على Android منذ أوائل أغسطس 2026، وقد بُني حول أربعة وكلاء بأسماء — Maya وMiles وSimone وCharlie — يحافظون على السياق عبر الجلسات، ويبحثون على الويب ويضبطون التذكيرات. وهو بالإنجليزية فقط. تمتد المكالمات إلى سقف 30 دقيقة، ينخفض إلى خمس دقائق عند تسجيل الخروج. لا توجد واجهة برمجة تطبيقات (API) لصوته الإنتاجي، ولا طبقة للمؤسسات، ولا تسعير معلن.
StepAudio 3 Realtime واجهة للمطورين. وهو أحد خمسة نماذج في عائلة StepAudio 3، جميعها صدرت في اليوم نفسه وجميعها متاحة على منصة StepFun المفتوحة كواجهات API تجارية. يتعامل مع المحادثات الأصلية كاملة الازدواجية، ويستدل مباشرة من الكلام بدلاً من نسخه أولاً، ويدعم استدعاء الأدوات والتنفيذ غير المتزامن للمهام الطويلة أثناء استمرار المحادثة. وهو موجّه للصينية أولاً. وهو ليس مفتوح الأوزان، وهو حالياً بأسعار معاينة مجانية لفترة محدودة دون الإعلان عن سعر بعد المعاينة.
أحدهما يمكنك البناء عليه، والآخر يمكنك زيارته.
الشيء القابل للقياس الذي تشتهر به Sesame
Conversational Dynamics هو معيار قياسي محدد، ويستحق أن تعرف ما يتضمنه. فهو يقيّم تناوب الأدوار، والتعامل مع فترات التوقف، والتعافي بعد المقاطعة، وما إذا كان النموذج يفسّر إشارة حوارية قصيرة — «أها»، «صحيح»، «مم» — تفسيرًا صحيحًا باعتبارها تشجيعًا لا محاولة للاستحواذ على دفة الحوار. وهذه تحديدًا هي السلوكيات التي يصفها المستمعون عندما يقولون إن صوتًا ما يبدو بشريًا لا آليًا، وهي السلوكيات التي تجعل مساعدًا ممتعًا في الحديث معه لا مجرد دقيق.
يتصدّر StepAudio 3 Realtime لوحة الصدارة تلك بنسبة 98.9%، متقدماً على Qwen Audio 3.0 Realtime Plus بنسبة 98.4% وGPT-Realtime-2 بنسبة 95.3%. كما يحتل المركز الأول في Speech Reasoning بنسبة 99.7% وفق ما أوردته StepFun، ويكمن خلف ذلك ادعاء معماري مفاده أن الاستدلال على الصوت الخام يحافظ على النبرة والتشديد اللذين قد تسطّحهما خطوة النسخ — الفرق بين سماع السخرية وسماع مجاملة.
إليك الصياغة الصادقة لتلك النتيجة. هذا المعيار هو أقرب ما لدى المجال إلى قياس لما يُمدح به Sesame، ولم يُدرَج Sesame فيه. وهذا ليس دليلاً على أن StepAudio 3 Realtime يبدو أفضل صوتاً من Sesame. بل هو دليل على أن أحد هذين الادعاءين قابل للتحقق، بينما الآخر، حتى الآن، ليس كذلك — وأن الادعاء القابل للتحقق يحمله حالياً نموذج لم يتحدث إليه معظم الناس.

عدم تماثل التوافر، وهو القرار الحقيقي
كل ما سبق مثير للاهتمام. هذا الجزء حاسم.
صوت Sesame — ذاك الذي يُثني عليه الناس — هو نموذج إنتاجي أكبر ومغلق لم تُصدره Sesame قط كواجهة برمجة تطبيقات. لا يمكنك شراؤه، ولا الحصول على ترخيص له، ولا استدعاؤه من منتجك الخاص. وإذا قرأت أن التوقيت الحواري لدى Sesame هو الأفضل المتاح، واستنتجت أن بإمكانك الحصول عليه، فإن هذا الاستنتاج لا يستند إلى الأدلة.
ما فتحت Sesame مصدره فعليًا هو CSM-1B، الصادر تحت ترخيص Apache-2.0. إنه كتلة تركيب صوتي، وليس مساعدًا: بنية Llama أساسية تتوقع أول دفتر شيفرات Mimi، ومُفكِّك ترميز Llama أصغر يتوقع الباقي، ثم يقوم مرمّز Mimi بتحويله إلى موجة صوتية بتردد 24 kHz. إنه إنجليزي فقط، ويستنسخ صوتًا من مقطع مرجعي مدته 10 إلى 15 ثانية، ولا يمكنه توليد نص على الإطلاق — بل تقرنه بنموذج لغوي منفصل. أولئك الذين شغّلوا كليهما يصفون صوت CSM-1B بأنه أضعف بوضوح من صوت تطبيق Preview، وتقول بطاقة النموذج الجزء المكتوم بصوت عالٍ: نسخة مضبوطة ضبطًا دقيقًا من CSM تشغّل العرض التفاعلي، وتلك النسخة ليست نقطة التحقق التي يمكنك تنزيلها.
لا يعتري StepAudio 3 Realtime أي من هذا الغموض. فهو واجهة برمجية تجارية تقف خلفها عائلة نماذج منشورة، ومجموعة قدرات معلنة، ومواضع تصنيف من أطراف ثالثة يمكنك البحث عنها. وهو أيضًا موجّه للصينية أولًا، وبسعر إصدار معاينة، ويسجّل زمنًا حتى أول صوت قدره 8.83 ثانية على لوحة الصدارة نفسها التي يتفوق فيها في الديناميكية الحوارية — مقابل 1.18 ثانية لدى Gemini 3.8 Live و1.24 إلى 1.34 ثانية لدى GPT-Live-1. ومهما كان ما يقدمه من جودة حوارية، فإنه لم يُثبت بعد أنه قادر على تقديمها بسرعة الحوار خارج بيئة التقديم الخاصة بـ StepFun.

ماذا تفعل بهذا إذا كنت تختار حزمة تقنيات صوتية؟
ابدأ بفصل السؤالين. "ما الإحساس الذي ينبغي أن تمنحه المحادثة؟" و"ما الذي يمكنني إطلاقه؟" لهما إجابتان مختلفتان، وواحد منهما فقط قرار شرائي.
إذا كنت تضبط الذوق — لتقرر مقدار الدفء الذي ينبغي أن يتمتع به منتجك، وكم من الصمت يكون مريحًا، وبأي سرعة ينبغي للوكيل أن يتنازل عن الكلمة — فإن Sesame Preview مجاني، وممتاز حقًا، ومكان جيد لقضاء فترة بعد الظهر. استخدمه كنقطة مرجعية. لا تخطط لبناء تكامل حوله، لأنه لا يوجد شيء يمكن التكامل معه.
إذا كنت تستعد للإطلاق، فإن StepAudio 3 Realtime مرشّح حقيقي مع تحفّظات حقيقية: تسعير المعاينة، وتغطية تضع الصينية أولاً، ولا درجة مؤشر على Artificial Analysis، ومسألة زمن الاستجابة غير محسومة. اختبر زمن الاستجابة قبل جودة المحادثة. النموذج الذي يفوز بمعيار تناوب الأدوار لكنه يستغرق ما يعادل معظم جملة قبل أن يبدأ التحدث هو نموذج قد لا تتاح لك أبداً فرصة إظهار أفضل جودة لديه.
وإذا حصل صوت Sesame الإنتاجي يومًا ما على API، فستُعاد هذه المقارنة بأكملها — لأن المعيار الذي سيحسم الأمر موجود بالفعل، وسيتعيّن على Sesame أخيرًا أن يظهر فيه.
أين يناسب التوجيه، وأين لا يناسب
وكلاء الصوت ليسوا نموذجًا واحدًا. سواء كنت تشغّل StepAudio 3 Realtime أو أي شيء آخر، فإن المحادثة تُحيل العمل باستمرار إلى نماذج نصية عادية — بحث، أو استخراج، أو استدعاء استدلالي يعمل خلف وقفة مُمسَكة. طبقة التفويض هذه هي حيث يعيش تباين التكلفة، وحيث تتحوّل ساعة سيئة لدى مزوّد واحد إلى انقطاع لديك.
لكي نكون دقيقين بشأن تغطيتنا الخاصة: نقاط النهاية الحية والصوتية في عائلة StepAudio 3 ليست على OrcaRouter، ولا أي شيء ممّا بنته Sesame. ما يوجد على OrcaRouter هو طبقة النص التي يفوّض إليها وكيل صوتي — نحو 200 نموذج خلف واجهة API واحدة، وتحويل تلقائي عند الفشل، لغة DSL للتوجيه تجمع عدة نماذج في استدعاء واحد، ودمج النماذج عندما لا يكون حكم نموذج واحد كافيًا، مع تمرير سعر قائمة المزوّد دون أي هامش ربح.
هذا التقسيم هو ما يجعل مسألة الإتاحة أقل فتكًا مما تبدو عليه. إن نموذج الصوت قرار يمكنك إعادة النظر فيه؛ أما طبقة التفويض فهي التي يصبح فكّها مكلفًا، وهي الجديرة بأن توضع خلف موجّه قبل أن تلتزم بأي مورّد أصوات.

الحكم
يفوز Sesame Preview في الأمر الذي لا يمكن قياسه، ويخسر في كل ما يمكن شراؤه. فهو أفضل صوت متاح من حيث الجرس، وهو مجاني، ولا يمكنك وضعه في الإنتاج — والآن بعد أن أصبح طرف ثالث يقيّم الجودة التي اشتهر بها، فإن غيابه عن لوحة النتائج تلك فجوة في الأدلة، لا تفوقًا محميًا.
يتفوق StepAudio 3 Realtime في التوافر وقابلية القياس والقدرات، ويحمل أسئلة مفتوحة حقيقية حول السعر والتغطية اللغوية وزمن الاستجابة. إنه الوحيد من بين الاثنين الذي يمكنك البناء عليه اليوم، وهو ما يحسم المسألة العملية أسرع من أي اختبار أداء.
ما يجب مراقبته بسيط، وهو ذو حدّين: درجة ديناميكيات المحادثة لصوت Sesame الإنتاجي، أو رقم زمن الاستجابة لـ StepAudio 3 Realtime الذي يضعه في النطاق نفسه للنماذج التي يتفوّق عليها حاليًا في الجودة. أيٌّ منهما سيحوّل هذا من مقارنة بين قياس وسمعة إلى مواجهة مباشرة فعلية.
