
GPT-Live-1 مقابل SeedRealtime: SeedRealtime هو النموذج الأكثر طموحًا، ولا يمكنك شراؤه
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 لكل مليون رمز
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
مقارنة GPT-Live-1 وSeedRealtime من حيث القدرات تُفضي إلى إجابة غير مريحة، لأن النموذجين لا يتنافسان بالمعايير نفسها. GPT-Live-1 هو نموذج الصوت ثنائي الاتجاه الكامل من OpenAI، طُرح داخل ChatGPT في 8 يوليو 2026، وأُتيح للمطورين عبر Live Sessions API في 10 سبتمبر 2026، مع 12 صوتًا، وسعر معلن لكل دقيقة، وثغرة واحدة كبيرة: إدخال الصور والفيديو غير مدعوم صراحةً. أما SeedRealtime، الذي أطلقه فريق Seed التابع لـ ByteDance في 5 أغسطس 2026، فقد بُني بالكامل حول تلك الثغرة. إنه نموذج أصلي ثنائي الاتجاه الكامل للصوت والصورة يرى ويسمع ويتحدث ضمن بنية واحدة من الطرف إلى الطرف — وهو متاح فقط داخل تطبيق Doubao الموجّه للمستهلكين، بلا واجهة برمجة تطبيقات عامة، ولا أوزان مفتوحة، ولا تقرير تقني، ولا عدد معلمات منشور.
ما يمكن لكل واحد منها إدراكه فعليًا
أوضح طريقة لرؤية الفجوة هي أن تسأل عمّا يعرفه كل نموذج عن الغرفة التي يوجد فيها.
يسمع GPT-Live-1. هذا هو سطح الإدخال بأكمله. يدخل الصوت والنص، ويخرج الصوت والنص، وتُدرج وثائق OpenAI الصورة والفيديو على أنهما غير مدعومين. إنه يتعامل مع آليات المحادثة الخاصة بالسمع ببراعة شديدة — فهو يقرر عدة مرات في الثانية ما إذا كان يواصل الاستماع أو يتوقف مؤقتًا أو يقاطع أو يستدعي أداة، ويحافظ على الازدواج الكامل كي يواصل معالجة الصوت الوارد أثناء تحدثه. كما يعيد نصوص التعرف على الكلام إلى جانب الصوت، وهي من التفاصيل غير اللامعة التي توفر أسبوعًا من عمل التكامل.
يسمع SeedRealtime ويرى، في نموذج واحد بدلاً من خط معالجة متسلسل. تصف ByteDance بنية موحّدة تتعامل مع الصوت والفيديو والنص معًا، فتحلّ الغموض بالسياق البصري — بتمييز الكلمات المتجانسة، وفهم ما يشير إليه «هذا» من المشهد والإيماءة والنظرة والفعل السابق — وتُجري الإدراك والفهم واتخاذ القرار والتعبير على التوازي لا بالتتابع. تشمل العروض التوضيحية المنشورة لـ ByteDance عشاءً جماعيًا صاخبًا يتعين على النموذج فيه ربط الأصوات بالهويات، وزيارة متحف، وتصحيح سير عمل إعداد الإسبريسو، وكبح التداخل في مطار مع الاحتفاظ بذاكرة خارج الشاشة وإجراء بحث عبر الإنترنت.
• المدخلات — GPT-Live-1 الصوت والنص فقط، والصورة والفيديو غير مدعومين صراحةً، مقابل SeedRealtime الذي يدمج الصوت والفيديو والنص في نموذج واحد
• تناوب الأدوار — يقرر GPT-Live-1 داخليًا، عدة مرات في الثانية، مقابل أن SeedRealtime ينقل تناوب الأدوار إلى داخل النموذج ويزيل كاشف النشاط الصوتي الخارجي بالكامل
• السلوك الاستباقي — GPT-Live-1 يستجيب ويفوّض ويستدعي الأدوات مقابل SeedRealtime الذي يُوصف بأنه يتحدث من تلقاء نفسه دون تحفيز عندما يظهر كائن مستهدف في مجال الرؤية
• الإتاحة — GPT-Live-1 متاح بشكل عام في API الخاص بـ OpenAI بسعر 0.05 دولار في الدقيقة مقابل SeedRealtime المجاني داخل Doubao، مع عدم وجود API وعدم وجود جدول زمني له

تسير جودة الأدلة في الاتجاه المعاكس للطموح
هنا تتوقف المقارنة عن إطراء ByteDance.
تنشر OpenAI أرقامًا. وهي أرقامها الخاصة، وهي تقارن GPT-Live-1 بـ GPT-Realtime-2.1 بدلًا من مقارنته بمنافس، ولم يكرّرها أي مختبر مستقل — 80.1% في التفاعلية كاملة الازدواج مقابل 45.4%، وزمن استجابة تناوب الأدوار انخفض من 1.4 ثانية إلى 0.8، ودقة استدعاء الأدوات من 60% إلى 87%. أن تكون الأرقام صادرة عن المورّد وغير مُكرّرة هو تحفّظ حقيقي، وهو تحفّظ يمكن على الأقل ربطه برقم.
لا تنشر ByteDance شيئًا تقريبًا. الادّعاء المركزي بشأن SeedRealtime هو تقييم بشري من طرف إلى طرف يقول إنه يقلّل إلى النصف مشكلات إيقاع المحادثة السمعية البصرية مقارنةً بأنظمة ASR-plus-vision-plus-TTS المتتالية — مقاطعات أقل في منتصف الجملة، وردود بطيئة أقل بعد التوقف، وتفعيلات خاطئة أقل من الضجيج الخلفي. لا يوجد حجم عيّنة، ولا منهجية، ولا رقم دقيق للتحسين، ولا رقم كمون على الإطلاق. ولا يوجد أيضًا عدد للمعلمات ولا تقرير تقني.
والنتيجة هي أنّ النموذج ذا المعمارية الأكثر إثارة للاهتمام هو النموذج الذي يمكنك تقييمه بأقل قدر. وهذا لا يعني القول إنه يؤدي أداءً أسوأ — فالعروض التوضيحية مذهلة حقًا، والكتابة الهندسية حول المدخلات السمعية البصرية المجزأة والتوليد المتدفق تشير إلى نظام حقيقي لا إلى مجرد عرض توضيحي — لكنه يعني أن أي مقارنة بين هذين الاثنين من حيث الجودة هي حاليًا مقارنة بين نموذج موثّق ومقطع فيديو مثير للإعجاب.
لماذا لا تُعد فجوة API تفصيلاً
تم طرح SeedRealtime بالكامل داخل Doubao منذ 5 أغسطس 2026، في كل من الصوت والفيديو، مجانًا. ولا يملك نقطة نهاية على Volcano Engine أو BytePlus، ولا طبقة مدفوعة، ولا حصة معلنة، ولا جدولًا زمنيًا معلنًا لفتح الوصول إلى المطورين. وتذكر خارطة طريق ByteDance زمن انتقال أقل، وتتبعًا أدق للمتحدث، ومهامًا متصلة بالأدوات؛ لكنها لا تذكر تاريخًا.
هناك تحفظ بشأن الوصول يزيد الأمر سوءًا. Doubao هو منتج يستهدف البر الرئيسي للصين أولًا، وعادةً ما يتطلب رقم هاتف محمول من البر الرئيسي للتسجيل، دون الإعلان عن نسخة إنجليزية محلية. وبالنسبة لفريق خارج الصين، فإن SeedRealtime ليس مجرد API لم يُطلق بعد — بل لا يمكن الوصول إليه كمنتج أيضًا.
ضع ذلك في مقابل عبء التكامل الخاص بـ GPT-Live-1 نفسه، فتصبح المقايضة ملموسة. واجهة OpenAI البرمجية ضيقة بطرق تفاجئ الناس: معرّف نموذج واحد، ونقطة نهاية واحدة عند v1/live/sessions، ونقل WebRTC مع معالجة الأحداث على قناة بيانات، ولا مسار عبر Chat Completions أو Responses أو Realtime أو Batch أو نقاط نهاية الضبط الدقيق. تُقاس حدود المعدل بعدد الجلسات المتزامنة — 25 في الطبقة 1، وترتفع عبر 50 و200 و300 و500 — بدلًا من الطلبات في الدقيقة، ولا تستطيع الطبقة المجانية استدعاء النموذج على الإطلاق. هذا تكامل جديد، وما زال تكاملًا يمكنك البدء فيه بعد ظهر هذا اليوم.

جوابان لمشكلة التفويض نفسها
كلا النموذجين يرفضان التصميم المتتالي القديم، حيث يعمل التعرف على الكلام ونموذج لغوي وتخليق الكلام بالتتابع مع ما يقرب من 1.7 ثانية من الصمت التام بين الأدوار. يرفضانه بشكل مختلف، والاختلاف يخبرك أيهما مصمم لمكالمة هاتفية وأيهما مصمم لغرفة.
يقسّم GPT-Live-1 العمل عموديًا. طبقة صوتية سريعة تدير المحادثة؛ وأي شيء أثقل — البحث على الويب، أو التفكير الأعمق، أو العمل الوكيلي — يُحال إلى نموذج استدلال منفصل عبر Responses API بينما تستمر المحادثة. مثال WebRTC المنشور من OpenAI يربط ذلك الجزء الخلفي بـ GPT-5.6 Terra. والنتيجة هي أن نصف التفكير عبارة عن استدعاء عادي لنموذج نصي، يُسعَّر لكل رمز، وبالتالي شيء يمكنك اختياره وتبديله وتوجيهه بشكل مستقل عن طبقة الصوت. بالنسبة لخط دعم، هذا هو الشكل الصحيح: الصوت هو الواجهة، والاستدلال هو المنتج.
يبقي SeedRealtime كل شيء في شبكة واحدة، وهذا ما يسمح له بالنظر إلى إيماءة وهي في منتصف الجملة. وهو أيضًا ما يجعله مستحيل التفكيك — فلا يمكنك تبديل نصف الاستدلال، لأنه لا يوجد نصف استدلال، ولا يمكنك تشغيله في أي مكان، لأنه لا يوجد أي مكان لتشغيله.
إذا كنت تبني وكيلاً صوتياً اليوم، فإن هذا التمييز هو القرار كله. واحد فقط من هذين هو مكوّن يمكنك وضعه في بنية معمارية. GPT-5.6 Terra، الواجهة الخلفية في مثال التفويض لدى OpenAI، يُقدَّم عبر OrcaRouter بسعر 2.00 دولار لكل مليون رمز إدخال و12.00 دولار لكل مليون رمز إخراج مع سياق يبلغ 1 مليون رمز وكلا /v1/chat/completions و /v1/responses متاحين — إلى جانب ما يقرب من 190 نموذجًا آخر على مفتاح واحد، لذا يمكن تقسيم طبقة الاستدلال خلف وكيل صوتي وتسعيرها والتبديل عند الفشل دون المساس بمسار الصوت. لا يتم تقديم GPT-Live-1 ولا SeedRealtime عبر OrcaRouter؛ فهما من مصدر واحد من البائعين أنفسهم، ولا يمكن لأي موجّه تغيير ذلك.

ما الذي سيغيّر الإجابة؟
ثلاثة أمور، بترتيب الاحتمال.
• واجهة برمجة تطبيقات للمطورين من ByteDance. إذا ظهر SeedRealtime على Volcano Engine أو BytePlus بسعر منشور، فإنه يتوقف عن كونه دراسة حالة ويصبح منتجًا مختلفًا حقًا — ازدواج كامل سمعي بصري دون أي منافس مُستضاف في الغرب. تلك هي الإشارة التي يجب مراقبتها، ولم تظهر بعد.
• الرؤية تصل إلى واجهة برمجة تطبيقات صوتية مستضافة. يوضّح توثيق GPT-Live-1 صراحةً أن الصورة والفيديو غير مدعومين، وهو ما يُقرأ على أنه ليس سهوًا بقدر ما هو حدّ متعمّد للإصدار الأول. إذا أطلقت OpenAI واجهة الفيديو التي كانت تعرضها في مكان آخر داخل ChatGPT، فإن فجوة القدرات التي تجعل SeedRealtime مثيرًا للاهتمام تضيق بشكل كبير.
• أي قياس مستقل لـ SeedRealtime. رقم كمون من طرف ثالث أو عدد معلمات سيتيح مقارنة الاثنين على أساس شيء آخر غير الطموح.
الحكم العملي لأي شخص يبني الآن موجز. GPT-Live-1 هو الوحيد بين هذين الاثنين الذي يمكنك نشره، وبتكلفة 0.05 دولار للدقيقة تُحتسب بالثانية، مع اثني عشر صوتًا ونقطة نهاية موثّقة، فهو خيار افتراضي معقول للصوت الحواري. SeedRealtime هو النموذج الأكثر إثارة للاهتمام، وقد يكون بالفعل الأكثر قدرة؛ وهو أيضًا، في الوقت الحالي، عرض توضيحي لما تبدو عليه بنية سمعية-بصرية موحّدة أكثر من كونه منتجًا يمكنك وضعه أمام عميل. صنّفه تحت ما ينبغي متابعته، لا ما ينبغي البناء عليه.
