بطاقة عنوان رئيسية تعرض 'Gemini Agentic Video Understanding' مع شارة 'إمكانية جديدة' وعنوانًا فرعيًا: 'وضع واجهة البرمجة الذي يخفض تكلفة تحليل الفيديو بمقدار الثلثين'، مع ثلاث رقاقات تعرض: 'ينطبق على Gemini 3.7 Flash وGemini 3.6 Flash وGemini 3.5 Flash-Lite'، و'أُعلن في 1 سبتمبر 2026'، و'المعالجة: وكيلية'، وشعار OrcaRouter في أسفل اليمين.
Guides & Insights

وصل فهم الفيديو الوكيلي من Gemini: وضع API الذي يخفض تكلفة تحليل الفيديو بمقدار الثلثين

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 1 سبتمبر 2026، قدّمت Google الفهم الوكيل للفيديو لـ Gemini 3.7 Flash، Gemini 3.6 Flash، وGemini 3.5 Flash-Lite — وهو وضع جديد في Gemini API لم يعد يعامل الفيديو كمجموعة من الإطارات، بل كوثيقة قابلة للبحث. إعلان Google DeepMind، الذي كتبه مدير أول للمنتجات Rohan Doshi ومدير الأبحاث Mario Lučić، هو أول تغيير رئيسي في طريقة قراءة Gemini للفيديو منذ أن أصبح بإمكان النماذج تلقي هذا المدخل أصلًا: فبدلًا من أن يستهلك النموذج بصمت عيّنة ثابتة من الإطارات، يقرر النموذج الآن، أثناء الإجابة، ما الذي ينظر إليه، وبأي سرعة، وعبر أيٍّ من ثلاث قنوات — الإطارات المرئية أو الصوت أو النصوص المكتوبة. التأثير الأبرز، وهو منقول بالكامل عن البائع ولم يتم تكراره بشكل مستقل بعد، هو أن تحليل الفيديو يصبح أرخص بنسبة تصل إلى 66%، ويستهلك توكنات أقل بنسبة تصل إلى 88%، ويجيب بدقة أعلى بنسبة تصل إلى 7% مقارنةً بخط الأساس السابق الذي يعتمد على تحليل الإطارات إطارًا بإطار والذي يستبدله هذا الوضع.

ماذا يغيّر بالفعل مفهوم "agentic" في الكواليس؟

السلوك القديم هو ما تسميه Google الآن "المعالجة الثابتة": تُرسل إلى Gemini مقطع فيديو، فيقوم بأخذ عينات من الإطارات بمعدل ثابت — الافتراضي هو إطار واحد في الثانية — ويمرر العينة كاملة عبر النموذج، ثم يجيب بناءً على ما التقطته تلك الشبكة الثابتة. وهذا يترك ثغرتين بنيويتين. أي تغيير في الحالة يحدث بين إطارين تمت أخذ عينات منهما يكون غير موجود بالنسبة للنموذج. وفيديو مدته ساعتان تم أخذ عينات منه بمعدل إطار واحد في الثانية يكلف ثروة من الرموز، معظمها يُنفق على لقطات لا علاقة لها بالسؤال.

يفهم الفيديو عبر الوكلاء (Agentic video understanding) عبر استبدال الشبكة الثابتة بحلقة تكرارية. يقرن النموذج تفكيره الأساسي بأدوات فيديو أصلية تتيح له أن يقرر ديناميكيًا ما الذي يشاهده، وبأي سرعة يشاهده، ومن خلال أي نمط حسّي يفحصه — الإطارات المرئية، أو المسار الصوتي، أو النص الحرفي. يستدعي أداة داخلية لتحميل المقاطع ذات الصلة فقط من الملف، ويجلب اللحظات والإشارات التي يحتاجها السؤال فعليًا، ثم يفكر في ما جمعه. تصفه Google بأنه نفس النمط المعماري لميزة الرؤية عبر الوكلاء (Agentic vision) التي أصدرتها سابقًا: لم يعد النموذج مستهلكًا سلبيًا للوسائط؛ بل أصبح وكيلًا يستعلم من الوسائط باعتبارها أداة.

النتيجة العملية هي أن سؤال «ماذا رأى النموذج؟» لم يعد مسألة حظٍّ في أخذ العينات. فالسؤال عن مشهد يستغرق جزءًا من الثانية، أو عيبٍ بالكاد يُرى، أو كلمةٍ منطوقة وسط ضجيج الخلفية، أصبح قابلاً للإجابة لأن النموذج يستطيع إعادة مسح النافذة الزمنية نفسها بدقةٍ أعلى ومعدلٍ أعلى، في النمط الذي توجد فيه الإجابة.

Generated infographic titled 'Agentic vs static video processing — what changes'. Left column 'Static (before)': 'Fixed 1 FPS frame grid', 'Every frame billable', 'Misses between-frame moments', '2-hour video = millions of tokens'. Right column 'Agentic (now)': 'Model decides what to watch', 'Loads only relevant segments', 'Searches frames + audio + transcript', 'Up to 88% fewer tokens'. Footer: 'All deltas vendor-reported by Google, unreproduced.'

الأرقام، مصنفة كما هي.

مقارنة جوجل الخاصة للمعايير بين المعالجة الوكيلية والمعالجة الثابتة هي جوهر الإعلان، ويجب أن تُقرأ باعتبارها ادعاءً من البائع حتى يقوم طرف خارجي بتكرارها. في مجموعة الاختبارات الداخلية لديها:

• التكلفة — انخفاض في تكلفة التحليل يصل إلى 66%، بفضل تحميل النموذج للمقاطع التي يحتاجها فقط بدلاً من العينة الثابتة بأكملها.

• الرموز — انخفاض استهلاك الرموز بنسبة تصل إلى 88%، مع تحقيق أكبر توفير في الفيديوهات الطويلة: حيث يذكر الإعلان على وجه التحديد أدلة مدتها 10 دقائق وصولًا إلى تسجيلات تستمر لساعات متعددة.

• الدقة — أفضل بنسبة تصل إلى 7% في المهام نفسها، لأن الأحداث دون الثانية وبين الإطارات تصبح مرئية بدلاً من أن تضيع في فجوات أخذ العينات.

تضع Google نموذج Gemini 3.7 Flash على أنه يقع على "حدود باريتو بين الدقة والتكلفة" للنماذج المختبرة — بعبارة بسيطة، أفضل إجابة مقابل الدولار بين الثلاثة. كما تسمّي أربعة شركاء وصول مبكر — Ponder وRevyl وMosaic وResemble.AI — الذين كانوا يبنون على هذا الوضع قبل الإتاحة العامة، وهو نوع التفاصيل التي تشير إلى استخدام إنتاجي حقيقي وليس مجرد عرض شرائح. لم تُنشر نتائج أي من هؤلاء الشركاء، لذا فإن الموقف الموثوق هو: الآلية حقيقية، والاتجاه صحيح بوضوح، والنسب المئوية المحددة تخص Google حتى تُقاس بشكل مستقل.

حالات الاستخدام التي بُنيَت من أجلها الميزة

يقسم الإعلان القدرة إلى أربع فئات، ترتبط كل منها بعبء عمل ملموس يمكن للمطور تقديمه:

• استرجاع اللحظات دون الثانية — تحديد دقيق لتغيّرات الحالة في كسور الثانية وحدود القطع الضيّقة التي تفوتها شبكة بمعدّل إطار واحد في الثانية تمامًا. وهذه هي حالة استخدام التحرير الآلي للفيديو: العثور على الإطار المحدّد الذي يحدث فيه تغيير المشهد.

• البحث عن إبرة في كومة قش داخل فيديو طويل — الإجابة عن سؤال محدد حول فيديو يمتد لساعات متعددة دون استهلاك ملايين التوكنات. وهذا هو الفرق بين «شاهد هذه المكالمة التي تدوم 3 ساعات» و«هل وافق العميل على التجديد في هذه المكالمة التي تدوم 3 ساعات؟»

• كشف الشذوذ — يعيد النموذج أخذ عينات من النوافذ الزمنية المثيرة للاهتمام بمعدل إطارات أعلى لفحص الحركة السريعة والعيوب البصرية الدقيقة. وتعد مراقبة الجودة في التصنيع، وتحليل الرياضة، ولقطات المراقبة الأمنية الأهداف الواضحة.

• عدّ الأفعال والأشياء — تتبّع الحركات الجسدية المتكررة والأشياء المميزة عبر الزمن، وهو ما يقلّل أخذُ العينات الثابتة من تقديره عندما يتحرك المُعدود أسرع من معدل أخذ العينات.

ما هي الموديلات، وما تكلفتها؟

تعتمد الميزة على مستوى Flash، والفروق السعرية بين النماذج الثلاثة هي ما يحدد أيها ستُوجَّه إليه:

• Gemini 3.7 Flash — 0.75 دولار للإدخال / 3.75 دولار للإخراج لكل مليون توكن بالسعر الترويجي، مؤكد حتى 31 ديسمبر 2026، وبعدها يتضاعف إلى 1.50 دولار / 7.50 دولار. وهو الأفضل من حيث الدقة مقابل التكلفة بين الثلاثة.

Gemini 3.6 Flash — $1.50 / $7.50 لكل مليون توكن. الخيار المستقر غير الترويجي ضمن الثلاثي.

Gemini 3.5 Flash-Lite — $0.30 / $2.50 لكل مليون توكن. الخيار الاقتصادي، لفرز الفيديو عالي الحجم حيث يكون أرخص توكن هو الأساس.

نظرًا لأن الميزة تستخدم التسعير القياسي لرموز Gemini API دون أي رسوم إضافية، فإن تخفيض الرموز بنسبة 88% ينعكس مباشرة على هذه الأسعار. عبء العمل الذي كان تحليله الثابت يكلف 100 دولار ينبغي أن يكلف نحو 12 إلى 34 دولارًا في المعالجة الوكيلية على النموذج نفسه، قبل تحقيق أي مكاسب في الدقة — وهو الجوهر الحقيقي لأي شخص يستنزف خط معالجته الحالي الرموز في إعادة الرفع أو أخذ عينات الإطارات من فيديو طويل.

كيفية تشغيله

يتم تفعيل هذا الوضع باستخدام علامة إعداد واحدة — مرّر قيمة processing كـ "agentic" في الطلب — ويعمل بنفس مدخلات وتسعير واجهة API القياسية. لا يوجد endpoint منفصل، ولا بُعد فوترة جديد، ولا حصة خاصة. يعتمد مسار Python على واجهة interactions في حزمة google-genai SDK، على سبيل المثال مع نموذج "gemini-3.7-flash" وإدخال يتكون من فيديو وتعليمات نصية؛ ويمكن أن يكون الفيديو مرفوعًا مباشرةً، أو باستخدام URI لـ Cloud Storage، أو URL عام عبر HTTP، أو رابط YouTube حسب السطح الذي تستدعيه.

قيدان عمليان يجدر بك معرفتهما قبل البناء: تخضع ملفات الفيديو لحدود حجم المنصة (على مسار منصة Enterprise Agent Platform، حوالي 15 ميغابايت لكل ملف)، وتدعم منصة Gemini Enterprise Agent Platform تنسيقات الحاويات الشائعة — MP4 وMOV وAVI وWebM وWMV وMPEG — لذا فإن التعامل مع التنسيقات يتم قبل استدعاء API، وليس داخله.

أين يعمل الآن، وإلى أين يتجه

عند الإطلاق، يتوفر الفهم الوكيل للفيديو للفيديوهات المرفوعة وفيديوهات YouTube عبر Gemini API في Google AI Studio وعبر Gemini Enterprise Agent Platform — أي واجهة المطوّرين والمؤسسات. وقد أُعلن عن طرحين موجهين للمستهلكين لكنهما غير متاحين بعد: تطبيق Gemini، حيث سيُطرح قريبًا لجميع المستخدمين على نموذجي Flash وFlash-Lite، وميزة "Ask YouTube" في صفحة مشاهدة الفيديو على YouTube، والتي تقول Google إنها ستصل في الأشهر المقبلة. وبالنسبة للمطوّر الذي يقيّم الميزة، فإن API هو المكان الحقيقي لاختبارها اليوم؛ أما أسطح المستهلكين فهي خطوة التوزيع التي ستجعل هذا المصطلح أمرًا مألوفًا.

هناك أيضًا إشارة من النظام البيئي تستحق الملاحظة: نظرًا لأن هذه القدرة تأتي كوضع API قياسي، فإن مشاريع خوادم MCP وأُطر عمل الوكلاء التي تغلّف فهم فيديوهات Gemini — إطار GenV لتحليلات الاجتماعات، وحزم MCP لأبحاث الفيديو، ومهارات Gemini للفيديو التي ظهرت خلال الأشهر الماضية — يمكنها تبنّيها دون تغيير بنيتها. إن ترقية الوضع، وليس حزمة تطوير برمجيات جديدة، هي ما يتيح الانخفاض في التكلفة.

ما الذي يجب التحقق منه قبل الوثوق في النسب المئوية

كل رقم في الإعلان — 66% و88% و7% وادعاء حدّ باريتو — هو رقم من جوجل نفسها، تم قياسه على مجموعة اختبار خاصة بجوجل، ولم يُعاد إنتاج أيٌّ منه خارج الشركة. الاتجاه ليس موضع شك: حلقة وكيلية (agentic) تحمّل فقط المقاطع ذات الصلة لا يمكن إلا أن تتفوق على شبكة ثابتة تحمّل كل شيء. أما الحجم فهو السؤال المفتوح، وسيختلف باختلاف عبء العمل — مقطع فيديو مدته دقيقتان مع سؤال واحد لن يحقق توفيرًا بنسبة 88% في الرموز (tokens)، لأنه لا يوجد الكثير مما يمكن تخطيه؛ أما مكالمة مدتها ثلاث ساعات مع سؤال موجّه واحد فستحققه. الاختبار الصحيح هو الفيديو الطويل الخاص بك، يُشغَّل مرة تحت المعالجة الثابتة ومرة تحت المعالجة الوكيلية، على النموذج نفسه، مع عدّ الرموز الحقيقية والدولارات الحقيقية.

Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of $0.75 per 1M input and $3.75 per 1M output tokens.

اقتصاديات هذا الاختبار هي بالضبط حيث تستحق طبقة التوجيه عناءها. Gemini 3.6 Flash و Gemini 3.5 Flash-Lite — وهما اثنان من النماذج الثلاثة التي تنطبق عليها هذه الميزة — يتم تقديمهما على OrcaRouter بسعر Google المعلن مع تمريره بهامش ربح 0%، لذا فإن تخفيض سعر تحليل الفيديو يصبح ساريًا على جانبنا في نفس اليوم الذي يصبح فيه ساريًا لدى Google؛ أما Gemini 3.7 Flash، النموذج الثالث والأحدث، فهو متاح عبر واجهة برمجة تطبيقات Google الخاصة ومنصات خارجية متعددة. وبما أن الفهم الوكيلي للفيديو هو قدرة تم إطلاقها للتو وفروقها الحقيقية في العالم الواقعي غير موثقة بعد، فهو الحالة النموذجية للتحويل التلقائي عند الفشل: وجّه جزءًا من حركة بيانات الفيديو إلى الوضع الوكيلي، ودع الموجّه يتراجع إلى نموذج مُثبت عند الأخطاء أو حدود المعدل أو التراجعات الواضحة في الجودة، وأبقِ المسار الأساسي يعمل حتى يكسب الوضع الجديد حركة البيانات.

Screenshot of the OrcaRouter model page for google/gemini-3.6-flash showing a 1M-token context window, $1.50 per 1M input and $7.50 per 1M output tokens, and Vision/Audio/Video/Tools/Reasoning capability chips.

التغيير أكثر من مجرد إضافة ميزة. لقد كان الفيديو هو المدخل متعدد الوسائط غير الملائم لمدة عامين — معبّرًا بشكل هائل، ومكلفًا بشكل هائل في التحليل، ويُقرأ فعليًا مع فقدان في أخذ العينات. فهم الفيديو الوكيل (Agentic) هو أول إجابة جادة من Google للمشكلات الثلاث جميعًا في وقت واحد، وهو متاح على الفئة الأرخص من سلسلة نماذجها بدلاً من النموذج الرئيسي. بالنسبة للفرق التي كانت تتجنب أعباء عمل الفيديو بسبب فاتورة التوكنات، فإن هذا الوضع يستحق إعادة حساب التكلفة اليوم.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube