بطاقة رئيسية مُنشأة لـ 'Gemini 3.8 Live with Live Avatar' على خلفية بيضاء مع لمسات متدرجة ناعمة باللونين الأزرق والسماوي. ثلاث بطاقات مكدسة مكتوب عليها '15 سبتمبر 2026 — Gemini 3.8 Live و 3.8 Live Extended Thinking يتوفران عبر Live API'، و'24 سبتمبر 2026 — الإعلان عن Live Avatar، Gemini Enterprise'، و'اليوم — الأفاتار قدرة مؤسسية، وليس معرّف نموذج'. سطر التذييل مكتوب عليه 'التواريخ وفقًا لـ Google DeepMind.' شعار OrcaRouter مُدمج في الزاوية السفلية اليمنى.
Guides & Insights

Gemini 3.8 Live مع Live Avatar: Google تمنح نموذجها الصوتي وجهًا

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

صدر Gemini 3.8 Live وGemini 3.8 Live Extended Thinking في 15 سبتمبر 2026 — وهما نقطتا النهاية الأصليتان للحوار المباشر التي فتحتها Google على واجهة برمجة التطبيقات الخاصة بالمورّد، إحداهما مُحسّنة لزمن الاستجابة والأخرى للتأمّل. وفي 24 سبتمبر، أعلنت الشركة عن Gemini 3.8 Live with Live Avatar، الذي يقرن توليد الفيديو شبه الفوري بحلقة الكلام نفسها بحيث يكون للنموذج وجه أثناء تحدّثه. لم يتغيّر أي شيء بشأن مُعرّفي النموذجين. الذي تغيّر هو الشكل الذي يُسمح للمحادثة أن تبدو عليه، و— بشكل أكثر أثرًا — ما يُسمح للنموذج بفعله بالمحادثة أثناء استمرارها.

ما الذي تم شحنه فعليًا في 24 سبتمبر

منشور DeepMind قصير ومحدد، ويستحق أن نفصل ما يدّعيه عما يعنيه. يقول Google عن Live Avatar، بكلماته: إنه «يمنح الذكاء الاصطناعي الحواري من Gemini حضورًا بصريًا شبه فوري في الوقت الحقيقي» عبر اقتران توليد الفيديو في الوقت الحقيقي بمنظومة الصوت الحالية. وتصف الشركة مزامنة دقيقة للشفاه، وتعبيرات طبيعية، وتبادلًا سلسًا للأدوار في الحديث، وتقدّم مثالين على النشر: خدمة العملاء والجولات التفاعلية. ثم تقول الجملة الأكثر أهمية لأي شخص يخطط لعملية بناء — «بدءًا من اليوم، أصبح Gemini 3.8 Live with Live Avatar متاحًا في Gemini Enterprise».

تلك هي قصة التوافر كاملة. فـ Live Avatar ليس معرّف طراز في Gemini API. لا تزال قائمة الطرازات الصوتية في الـAPI تضم gemini-3.8-live وgemini-3.8-live-extended-thinking ولا يوجد صف للصورة الرمزية، كما لا تتضمن بطاقة الأسعار أي بند للصورة الرمزية. تأتي هذه الميزة داخل Gemini Enterprise، ما يعني أن الجمهور المستهدف من الإعلان هم المشترون في المؤسسات والمطوّرون الذين يدمجون بالنيابة عنهم، لا المطوّر الفرد الذي يستدعي Live API بمفتاح اليوم.

اثنان من ادعاءات المنشور يستحقان الاقتباس بدقة، لأن كليهما أقوى من لغة الإطلاق المعتادة. الأول: Live Avatar «تتميز بمزامنة أصلية متعددة اللغات من الكلام إلى الكلام» و«يمكنها الانتقال بسلاسة عبر 97 لغة دون تدهور دقة الفيديو أو إحداث انحراف بصري». رقم 97 هو عدد اللغات نفسه الذي ادّعاه إطلاق 15 سبتمبر للنماذج الأساسية للحوار المباشر، لذا هذا هو ادعاء تعدد اللغات القائم نفسه معاداً صياغته مع قيد جديد مرفق به — يجب أن تواكب مزامنة الشفاه وتحريك الوجه تغيّر اللغة في منتصف الجملة. الثاني: كل المخرجات تحمل علامة مائية باستخدام SynthID، «منسوجة مباشرة داخل مخرجات الصوت والفيديو». كلا المسارين، وليس الصوت فقط.

القدرة الجديدة حقًا هي تلك الموجودة في الوسط

تجاوز الجانب البصري، وستجد أن الفقرة الأكثر إثارة للاهتمام هي المتعلقة باستدعاءات الأدوات. تقول Google إن Live Avatar مدعوم بـ«استدعاء الأدوات غير المتزامن» الذي يمكنه «تشغيل استدعاءات الأدوات وجلب البيانات في الخلفية أثناء مواصلة الحوار النشط، والتعامل مع المهام المعقدة مع ضمان تدفق محادثة غير منقطع». المثال العملي هو تسجيل وصول نزيل فندق حيث يستدعي النموذج الأدوات في الخلفية ويواصل الحديث.

هذا فرق معماري حقيقي عن بنية الطلب/الاستجابة التي تُبنى حولها معظم تكاملات الصوت، وهو الجزء الذي تترتب عليه كلفة. التنفيذ غير المتزامن يعني أن النموذج يقوم بعمل لا يظهره النص. في مسار نصي، كنت سترى استدعاء الأداة كدور في المحادثة. أما هنا فيحدث تحت محادثة لا تزال جارية، وهو ما يطرح الأسئلة نفسها التي يطرحها أي تنفيذ متوازٍ: ماذا يحدث إذا فشل استدعاء الأداة بصمت في منتصف الجملة، وكيف يعرف المتصل ذلك؟ لا يقول منشور Google ذلك، وبطاقة النموذج هي الموضع الذي ينبغي البحث فيه عن ذلك. اعتبر ادعاء «تدفق المحادثة دون انقطاع» مُبلَّغًا عنه من المورّد وغير مختبر من أي طرف ثالث يمكننا العثور عليه.

الصور الرمزية المعدّة مسبقًا، وقائمة السماح التي تحدّ من النصف المثير للاهتمام

لقصة التخصيص مستويان، وواحد فقط منهما متاح للعموم. يحصل كل نشر مؤسسي على "مكتبة من الصور الرمزية المتنوعة الجاهزة". أما الصور الرمزية المخصصة — التي تُولَّد "من صورة مرجعية عالية الجودة" مع "الحفاظ على تشابه المرجع، أو تصميم العلامة التجارية، أو هوية الشخصية" — فهي خلف بوابة، وتقول Google بوضوح: "إنشاء الصور الرمزية المخصصة متاح حاليًا فقط عبر الإدراج في القائمة المسموح بها للمؤسسات".

إذن، القدرة التي سترغب معظم الفرق فعلاً في امتلاكها، تلك التي تتيح لصورة رمزية أن تتطابق مع علامة تجارية أو شخصية محددة بالاسم، هي القدرة التي لا يمكنك الاستفادة منها بالخدمة الذاتية. وإذا كانت خطتك تعتمد على مقدّم اصطناعي يشبه تميمتك، فأنت تنتظر قرارًا بشأن قائمة السماح، لا إصدار نموذج. هذه حقيقة تخص المشتريات لا حقيقة تقنية، وهي من النوع الذي يتأخر ربع سنة بهدوء.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

أين يقع بالنسبة إلى بقية السطر

لم يصل Live Avatar إلى عائلة منتجات فارغة، وأسهل ما يمكن رؤيته للموضع الذي يشغله هو عند مقارنته بالأشقاء الذين طُرحوا في الأسبوعين نفسهما.

• يُتاح كـ — Gemini 3.8 Live مع Live Avatar هو قدرة مؤسسية داخل Gemini Enterprise مقابل Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking وهما نقطتا نهاية في Gemini API بمعرّفات نموذج وأسعار منشورة لكل دقيقة
• قابل للاستدعاء من المطوّرين — Live Avatar لا، لا معرّف نموذج ولا بند في بطاقة الأسعار مقابل نقطتي نهاية Live نعم، gemini-3.8-live و gemini-3.8-live-extended-thinking
• المخرجات — Live Avatar صوت بالإضافة إلى فيديو متزامن مقابل نقطتي نهاية Live الصوت فقط
• الادعاء اللغوي — Live Avatar ‏97 لغة مع مزامنة الشفاه واستمرارية التعبيرات مقابل نقطتي نهاية Live ‏97 لغة مع تبديل تلقائي أثناء المحادثة
• العلامة المائية — Live Avatar SynthID على مسار الصوت ومسار الفيديو معًا مقابل نقطتي نهاية Live SynthID على الصوت المُنشأ

نقطتا النهاية Live نفساهما هما الثنائي الموثق جيدًا. تُظهر القياسات المستقلة أنهما متباعدتان جدًا على بعض المحاور ومتقاربتان على محاور أخرى: في مؤشر Artificial Analysis Speech to Speech Index، يأتي Gemini 3.8 Live Extended Thinking (High) عند 82.6 مقابل Gemini 3.8 Live عند 76.0، وهي فجوة مبنية في معظمها على جودة الاستدلال لا على الديناميكيات الحوارية، حيث ينقلب الترتيب. أما أرقام Google الخاصة فتضعهما عند 68.6% و30.1% في إكمال مهام τ-Voice، وعند 98% و92% في Big Bench Audio. ويرث Live Avatar أيًّا منهما تستدعيه تحته، ويرث تسعيرهما أيضًا، لأن الصورة الرمزية طبقة عرض فوق حلقة المحادثة نفسها.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

ما لا يغيّره هذا

لا يجعل النماذج أفضل. Live Avatar هو طبقة عرض وتنسيق: أرقام الجودة الخاصة بـ Gemini 3.8 Live هي نفسها كما كانت في 15 سبتمبر، وأي شخص يحتاج إلى الأقوى بين المتغيرين لا يزال عليه اختيار Extended Thinking وتقبّل زمن الاستجابة الخاص به. ولا يضع الفيديو في API. ولا يغيّر سعر التحدث إلى النموذج، الذي لا يزال يُحتسب وفق أسعار الصوت لكل دقيقة في Live API — 0.005 دولار لكل دقيقة من الصوت الوارد و0.018 دولار لكل دقيقة من الصوت الصادر — مع كون توليد الفيديو الخاص بالأفاتار غير مُسعَّر علنًا لأنه لا يُباع بشكل منفصل.

ما يغيّره فعلًا هو مجموعة المنتجات التي يمكن بناؤها من دون طبقة عرض منفصلة. وكيل الدعم الذي كان في السابق يتحدث ويترك لوحة فارغة على الشاشة يمكنه الآن أن يعرض وجهًا أثناء عمله، ولم يعد العمل الذي يقوم به في الخلفية يظهر كوقت ميت. هذا تغيير ذو مغزى في شكل الواجهة وتغيير متواضع في النموذج الأساسي. ويمكن أن يكون كلا هذين صحيحًا في الوقت نفسه.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

ما يجب مشاهدته، وملاحظة توجيه واحدة

ثلاثة أمور ستنقل هذا من كونه إعلانًا إلى قرار بناء. يجب أن يُفتح باب إدراج الصور الرمزية المخصصة في القائمة المسموح بها، لأن الصور الرمزية الجاهزة مجرد عرض تجريبي، بينما الصور الرمزية المخصصة منتج. ويجب أن يحصل مسار الفيديو على سعر، لأنه لا يمكن لأحد وضع نموذج لاقتصاديات الوحدة على مخرَج بلا سعر. ويجب أن تظهر نقطة نهاية خاصة بالأفاتار في قائمة نماذج API، لأن هذا هو الفرق بين ميزة مؤسسية وشيء يمكن للمطور استدعاؤه الليلة.

من جانبنا، هناك أمر يستحق التوضيح بدقة، لأنه من السهل افتراض خلاف ذلك: لا يوجّه OrcaRouter نقاط نهاية Gemini 3.8 Live أو Live Avatar، ولا ينبغي قراءة أي شيء هنا على أنه ادعاء بأنه يفعل ذلك. ما نوفره بالفعل هو بقية سلسلة 3.8 من Google — google/gemini-3.8-flash من بينها — إلى جانب كتالوج يضم أكثر من 200 نموذج من مفتاح واحد بسعر قائمة المزوّد دون أي هامش ربح. إذا كان Live Avatar يدفع بمعماريتك نحو وكيل يجب عليه أن يستدل بشأن ما قاله العميل، فإن الجانب الاستدلالي في تلك المنظومة هو الجانب الذي يمكنك توحيده اليوم.