بطاقة عنوان رئيسية تحمل النص 'GPT-Live-1 مقابل SeedRealtime' مع عنوان فرعي 'النموذج الأكثر طموحاً الذي لا يمكنك استدعائه' وسطر 'متاح بشكل عام في API مقابل تطبيق Doubao فقط'، فوق لوحتين: اللوحة اليسرى تعرض مدخلاً مفتوحاً مع رمز قوس API وشارة 'API'، واللوحة اليمنى تعرض المدخل نفسه مع قفل معلق عبره وشارة 'NO API'، كل منهما يحمل أيقونة صوت وكاميرا تجمع بين شكل موجة وفتحة عدسة، مع شعار OrcaRouter مركب في الزاوية.
Guides & Insights

GPT-Live-1 مقابل SeedRealtime: SeedRealtime هو النموذج الأكثر طموحًا، ولا يمكنك شراؤه

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

مقارنة GPT-Live-1 وSeedRealtime من حيث القدرات تُفضي إلى إجابة غير مريحة، لأن النموذجين لا يتنافسان بالمعايير نفسها. GPT-Live-1 هو نموذج الصوت ثنائي الاتجاه الكامل من Ope​nAI، طُرح داخل ChatGPT في 8 يوليو 2026، وأُتيح للمطورين عبر Live Sessions API في 10 سبتمبر 2026، مع 12 صوتًا، وسعر معلن لكل دقيقة، وثغرة واحدة كبيرة: إدخال الصور والفيديو غير مدعوم صراحةً. أما SeedRealtime، الذي أطلقه فريق Seed التابع لـ ByteDance في 5 أغسطس 2026، فقد بُني بالكامل حول تلك الثغرة. إنه نموذج أصلي ثنائي الاتجاه الكامل للصوت والصورة يرى ويسمع ويتحدث ضمن بنية واحدة من الطرف إلى الطرف — وهو متاح فقط داخل تطبيق Doubao الموجّه للمستهلكين، بلا واجهة برمجة تطبيقات عامة، ولا أوزان مفتوحة، ولا تقرير تقني، ولا عدد معلمات منشور.

ما يمكن لكل واحد منها إدراكه فعليًا

أوضح طريقة لرؤية الفجوة هي أن تسأل عمّا يعرفه كل نموذج عن الغرفة التي يوجد فيها.

يسمع GPT-Live-1. هذا هو سطح الإدخال بأكمله. يدخل الصوت والنص، ويخرج الصوت والنص، وتُدرج وثائق OpenAI الصورة والفيديو على أنهما غير مدعومين. إنه يتعامل مع آليات المحادثة الخاصة بالسمع ببراعة شديدة — فهو يقرر عدة مرات في الثانية ما إذا كان يواصل الاستماع أو يتوقف مؤقتًا أو يقاطع أو يستدعي أداة، ويحافظ على الازدواج الكامل كي يواصل معالجة الصوت الوارد أثناء تحدثه. كما يعيد نصوص التعرف على الكلام إلى جانب الصوت، وهي من التفاصيل غير اللامعة التي توفر أسبوعًا من عمل التكامل.

يسمع SeedRealtime ويرى، في نموذج واحد بدلاً من خط معالجة متسلسل. تصف ByteDance بنية موحّدة تتعامل مع الصوت والفيديو والنص معًا، فتحلّ الغموض بالسياق البصري — بتمييز الكلمات المتجانسة، وفهم ما يشير إليه «هذا» من المشهد والإيماءة والنظرة والفعل السابق — وتُجري الإدراك والفهم واتخاذ القرار والتعبير على التوازي لا بالتتابع. تشمل العروض التوضيحية المنشورة لـ ByteDance عشاءً جماعيًا صاخبًا يتعين على النموذج فيه ربط الأصوات بالهويات، وزيارة متحف، وتصحيح سير عمل إعداد الإسبريسو، وكبح التداخل في مطار مع الاحتفاظ بذاكرة خارج الشاشة وإجراء بحث عبر الإنترنت.

• المدخلات — GPT-Live-1 الصوت والنص فقط، والصورة والفيديو غير مدعومين صراحةً، مقابل SeedRealtime الذي يدمج الصوت والفيديو والنص في نموذج واحد

• تناوب الأدوار — يقرر GPT-Live-1 داخليًا، عدة مرات في الثانية، مقابل أن SeedRealtime ينقل تناوب الأدوار إلى داخل النموذج ويزيل كاشف النشاط الصوتي الخارجي بالكامل

• السلوك الاستباقي — GPT-Live-1 يستجيب ويفوّض ويستدعي الأدوات مقابل SeedRealtime الذي يُوصف بأنه يتحدث من تلقاء نفسه دون تحفيز عندما يظهر كائن مستهدف في مجال الرؤية

• الإتاحة — GPT-Live-1 متاح بشكل عام في API الخاص بـ Ope​nAI بسعر 0.05 دولار في الدقيقة مقابل SeedRealtime المجاني داخل Doubao، مع عدم وجود API وعدم وجود جدول زمني له

A two-column comparison scoreboard titled 'GPT-Live-1 vs SeedRealtime - the scoreboard'. The GPT-Live-1 column lists Availability GA, published rate; Price $0.05 / minute; Inputs audio and text; Video understanding not supported; Tool calling delegated to backend model; Evidence vendor benchmarks, unreproduced. The SeedRealtime column lists Availability Doubao app only, no API; Price free in app, no developer price; Inputs audio, video and text; Video understanding core capability; Tool calling tool calls woven into responses; Evidence one human-eval claim, no methodology. A footer reads 'SeedRealtime has no published parameter count, no technical report and no independent benchmarks.'

تسير جودة الأدلة في الاتجاه المعاكس للطموح

هنا تتوقف المقارنة عن إطراء ByteDance.

تنشر OpenAI أرقامًا. وهي أرقامها الخاصة، وهي تقارن GPT-Live-1 بـ GPT-Realtime-2.1 بدلًا من مقارنته بمنافس، ولم يكرّرها أي مختبر مستقل — 80.1% في التفاعلية كاملة الازدواج مقابل 45.4%، وزمن استجابة تناوب الأدوار انخفض من 1.4 ثانية إلى 0.8، ودقة استدعاء الأدوات من 60% إلى 87%. أن تكون الأرقام صادرة عن المورّد وغير مُكرّرة هو تحفّظ حقيقي، وهو تحفّظ يمكن على الأقل ربطه برقم.

لا تنشر ByteDance شيئًا تقريبًا. الادّعاء المركزي بشأن SeedRealtime هو تقييم بشري من طرف إلى طرف يقول إنه يقلّل إلى النصف مشكلات إيقاع المحادثة السمعية البصرية مقارنةً بأنظمة ASR-plus-vision-plus-TTS المتتالية — مقاطعات أقل في منتصف الجملة، وردود بطيئة أقل بعد التوقف، وتفعيلات خاطئة أقل من الضجيج الخلفي. لا يوجد حجم عيّنة، ولا منهجية، ولا رقم دقيق للتحسين، ولا رقم كمون على الإطلاق. ولا يوجد أيضًا عدد للمعلمات ولا تقرير تقني.

والنتيجة هي أنّ النموذج ذا المعمارية الأكثر إثارة للاهتمام هو النموذج الذي يمكنك تقييمه بأقل قدر. وهذا لا يعني القول إنه يؤدي أداءً أسوأ — فالعروض التوضيحية مذهلة حقًا، والكتابة الهندسية حول المدخلات السمعية البصرية المجزأة والتوليد المتدفق تشير إلى نظام حقيقي لا إلى مجرد عرض توضيحي — لكنه يعني أن أي مقارنة بين هذين الاثنين من حيث الجودة هي حاليًا مقارنة بين نموذج موثّق ومقطع فيديو مثير للإعجاب.

لماذا لا تُعد فجوة API تفصيلاً

تم طرح SeedRealtime بالكامل داخل Doubao منذ 5 أغسطس 2026، في كل من الصوت والفيديو، مجانًا. ولا يملك نقطة نهاية على Volcano Engine أو BytePlus، ولا طبقة مدفوعة، ولا حصة معلنة، ولا جدولًا زمنيًا معلنًا لفتح الوصول إلى المطورين. وتذكر خارطة طريق ByteDance زمن انتقال أقل، وتتبعًا أدق للمتحدث، ومهامًا متصلة بالأدوات؛ لكنها لا تذكر تاريخًا.

هناك تحفظ بشأن الوصول يزيد الأمر سوءًا. Doubao هو منتج يستهدف البر الرئيسي للصين أولًا، وعادةً ما يتطلب رقم هاتف محمول من البر الرئيسي للتسجيل، دون الإعلان عن نسخة إنجليزية محلية. وبالنسبة لفريق خارج الصين، فإن SeedRealtime ليس مجرد API لم يُطلق بعد — بل لا يمكن الوصول إليه كمنتج أيضًا.

ضع ذلك في مقابل عبء التكامل الخاص بـ GPT-Live-1 نفسه، فتصبح المقايضة ملموسة. واجهة OpenAI البرمجية ضيقة بطرق تفاجئ الناس: معرّف نموذج واحد، ونقطة نهاية واحدة عند v1/live/sessions، ونقل WebRTC مع معالجة الأحداث على قناة بيانات، ولا مسار عبر Chat Completions أو Responses أو Realtime أو Batch أو نقاط نهاية الضبط الدقيق. تُقاس حدود المعدل بعدد الجلسات المتزامنة — 25 في الطبقة 1، وترتفع عبر 50 و200 و300 و500 — بدلًا من الطلبات في الدقيقة، ولا تستطيع الطبقة المجانية استدعاء النموذج على الإطلاق. هذا تكامل جديد، وما زال تكاملًا يمكنك البدء فيه بعد ظهر هذا اليوم.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

جوابان لمشكلة التفويض نفسها

كلا النموذجين يرفضان التصميم المتتالي القديم، حيث يعمل التعرف على الكلام ونموذج لغوي وتخليق الكلام بالتتابع مع ما يقرب من 1.7 ثانية من الصمت التام بين الأدوار. يرفضانه بشكل مختلف، والاختلاف يخبرك أيهما مصمم لمكالمة هاتفية وأيهما مصمم لغرفة.

يقسّم GPT-Live-1 العمل عموديًا. طبقة صوتية سريعة تدير المحادثة؛ وأي شيء أثقل — البحث على الويب، أو التفكير الأعمق، أو العمل الوكيلي — يُحال إلى نموذج استدلال منفصل عبر Responses API بينما تستمر المحادثة. مثال WebRTC المنشور من OpenAI يربط ذلك الجزء الخلفي بـ GPT-5.6 Terra. والنتيجة هي أن نصف التفكير عبارة عن استدعاء عادي لنموذج نصي، يُسعَّر لكل رمز، وبالتالي شيء يمكنك اختياره وتبديله وتوجيهه بشكل مستقل عن طبقة الصوت. بالنسبة لخط دعم، هذا هو الشكل الصحيح: الصوت هو الواجهة، والاستدلال هو المنتج.

يبقي SeedRealtime كل شيء في شبكة واحدة، وهذا ما يسمح له بالنظر إلى إيماءة وهي في منتصف الجملة. وهو أيضًا ما يجعله مستحيل التفكيك — فلا يمكنك تبديل نصف الاستدلال، لأنه لا يوجد نصف استدلال، ولا يمكنك تشغيله في أي مكان، لأنه لا يوجد أي مكان لتشغيله.

إذا كنت تبني وكيلاً صوتياً اليوم، فإن هذا التمييز هو القرار كله. واحد فقط من هذين هو مكوّن يمكنك وضعه في بنية معمارية. GPT-5.6 Terra، الواجهة الخلفية في مثال التفويض لدى Ope​nAI، يُقدَّم عبر OrcaRouter بسعر 2.00 دولار لكل مليون رمز إدخال و12.00 دولار لكل مليون رمز إخراج مع سياق يبلغ 1 مليون رمز وكلا /v1/chat/completions و /v1/responses متاحين — إلى جانب ما يقرب من 190 نموذجًا آخر على مفتاح واحد، لذا يمكن تقسيم طبقة الاستدلال خلف وكيل صوتي وتسعيرها والتبديل عند الفشل دون المساس بمسار الصوت. لا يتم تقديم GPT-Live-1 ولا SeedRealtime عبر OrcaRouter؛ فهما من مصدر واحد من البائعين أنفسهم، ولا يمكن لأي موجّه تغيير ذلك.

A screenshot of ByteDance Seed's official SeedRealtime product page in its English locale, showing the date August 5, 2026, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM', the description that it can jointly understand audio, visual and temporal information to deliver a watch, listen and speak experience, and an EN language toggle active in the header.

ما الذي سيغيّر الإجابة؟

ثلاثة أمور، بترتيب الاحتمال.

• واجهة برمجة تطبيقات للمطورين من ByteDance. إذا ظهر SeedRealtime على Volcano Engine أو BytePlus بسعر منشور، فإنه يتوقف عن كونه دراسة حالة ويصبح منتجًا مختلفًا حقًا — ازدواج كامل سمعي بصري دون أي منافس مُستضاف في الغرب. تلك هي الإشارة التي يجب مراقبتها، ولم تظهر بعد.

• الرؤية تصل إلى واجهة برمجة تطبيقات صوتية مستضافة. يوضّح توثيق GPT-Live-1 صراحةً أن الصورة والفيديو غير مدعومين، وهو ما يُقرأ على أنه ليس سهوًا بقدر ما هو حدّ متعمّد للإصدار الأول. إذا أطلقت OpenAI واجهة الفيديو التي كانت تعرضها في مكان آخر داخل ChatGPT، فإن فجوة القدرات التي تجعل SeedRealtime مثيرًا للاهتمام تضيق بشكل كبير.

• أي قياس مستقل لـ SeedRealtime. رقم كمون من طرف ثالث أو عدد معلمات سيتيح مقارنة الاثنين على أساس شيء آخر غير الطموح.

الحكم العملي لأي شخص يبني الآن موجز. GPT-Live-1 هو الوحيد بين هذين الاثنين الذي يمكنك نشره، وبتكلفة 0.05 دولار للدقيقة تُحتسب بالثانية، مع اثني عشر صوتًا ونقطة نهاية موثّقة، فهو خيار افتراضي معقول للصوت الحواري. SeedRealtime هو النموذج الأكثر إثارة للاهتمام، وقد يكون بالفعل الأكثر قدرة؛ وهو أيضًا، في الوقت الحالي، عرض توضيحي لما تبدو عليه بنية سمعية-بصرية موحّدة أكثر من كونه منتجًا يمكنك وضعه أمام عميل. صنّفه تحت ما ينبغي متابعته، لا ما ينبغي البناء عليه.