
הבנת הווידאו האוטונומית של Gemini הגיעה: מצב ה-API שמקצץ את עלות ניתוח הווידאו בשני שלישים
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0259אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0258אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0166אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
ב-1 בספטמבר 2026, Google הציגה הבנת וידאו אגנטית עבור Gemini 3.7 Flash, Gemini 3.6 Flash, וגם Gemini 3.5 Flash-Lite — מצב חדש ב-Gemini API שמפסיק להתייחס לסרטון כאל ערימת פריימים ומתחיל להתייחס אליו כאל מסמך ניתן לחיפוש. ההכרזה של Google DeepMind, שנכתבה על ידי מנהל המוצר הבכיר Rohan Doshi ומנהל המחקר Mario Lučić, היא השינוי הגדול הראשון באופן שבו Gemini קורא וידאו מאז שהמודלים קיבלו קלט וידאו מלכתחילה: במקום שמודל יעכל בשקט מדגם קבוע של פריימים, המודל מחליט כעת, תוך כדי מתן תשובה, במה להסתכל, באיזו מהירות, ובאיזה מתוך שלושה ערוצים — פריימים ויזואליים, אודיו או תמלילים. ההשפעה הבולטת, כולה מדווחת על ידי הספק ואף חלק ממנה לא שוחזר עדיין באופן עצמאי, היא שניתוח וידאו זול בעד 66%, צורך עד 88% פחות טוקנים, ומספק תשובות מדויקות יותר בעד 7% מאשר קו הבסיס של פריים-אחר-פריים שהוא מחליף.
מה "אייג'נטיק" באמת משנה מתחת למכסה המנוע
ההתנהגות הישנה היא מה שגוגל מכנה כעת עיבוד "סטטי": מזינים ל-Gemini סרטון, והוא דוגם פריימים בקצב קבוע — ברירת המחדל היא פריים אחד לשנייה — מריץ את כל המדגם דרך המודל, ועונה לפי מה שהרשת הקבועה הזו תפסה. לכך יש שתי נקודות עיוורות מבניות. שינוי מצב שמתרחש בין שני פריימים שנדגמו פשוט לא קיים עבור המודל. וסרטון של שעתיים שנדגם ב-1 FPS עולה הון בטוקנים, שרובם מבוזבזים על קטעים שלא היה להם קשר לשאלה.
הבנת וידאו אגנטית מחליפה את הרשת הקבועה בלולאה. המודל משלב את החשיבה הליבה שלו עם כלי וידאו מקוריים המאפשרים לו להחליט באופן דינמי מה לצפות, באיזו מהירות לצפות בו, ובאיזו מודאליות לבחון אותו — פריימים ויזואליים, רצועת השמע או התמליל. הוא מפעיל כלי פנימי כדי לטעון רק את הקטעים הרלוונטיים של הקובץ, לשלוף את הרגעים והאותות שהשאלה באמת צריכה, ולאחר מכן מבצע חשיבה על מה ששלף. גוגל מתארת את זה כתבנית ארכיטקטונית זהה לתכונת הראייה האגנטית ששחררה מוקדם יותר: המודל אינו עוד צרכן פסיבי של מדיה; הוא סוכן שמבצע שאילתות על המדיה כמו על כלי.
התוצאה המעשית היא ש"מה ראה המודל?" מפסיק להיות עניין של מזל בדגימה. שאלה על חיתוך של שבריר שנייה, פגם בקושי נראה, או מילה שנאמרה על רקע רעש היא ניתנת לתשובה, כי המודל יכול לסרוק מחדש את החלון המדויק ברזולוציה ובקצב גבוהים יותר, בערוץ שבו נמצאת התשובה.

המספרים, המתויגים כפי שהם
השוואת הבנצ'מרק של גוגל עצמה בין עיבוד אגנטי לעיבוד סטטי היא הליבה של ההכרזה, ויש לקרוא אותה כטענת ספק עד שגורם חיצוני ישחזר אותה. על ערכת הבדיקות הפנימית שלה:
• עלות — עד 66% נמוכה יותר בעלות הניתוח, הודות למודל שטוען רק את המקטעים שהוא צריך במקום את כל המדגם הקבוע.
• טוקנים — עד 88% פחות צריכת טוקנים, עם החיסכון הגדול ביותר בוידאו ארוך: ההכרזה מציינת ספציפית מדריכים של 10 דקות ועד להקלטות של שעות רבות.
• דיוק — עד 7% טוב יותר באותן משימות, מכיוון שאירועים תת-שנייתיים ובין-פריימים הופכים לגלויים במקום ליפול בפערי הדגימה.
גוגל ממקמת את Gemini 3.7 Flash על "גבול פארטו של דיוק-לעלות" במודלים שנבדקו — במילים פשוטות, התשובה הטובה ביותר לכל דולר מבין השלושה. היא גם מציינת ארבעה שותפי גישה מוקדמת — Ponder, Revyl, Mosaic ו-Resemble.AI — שבנו על המודל לפני הזמינות הכללית, וזה סוג הפרטים שמרמז על שימוש ייצור אמיתי ולא על מצגת. התוצאות של אף אחד מהשותפים האלה לא פורסמו, כך שהעמדה האמינה היא: המנגנון אמיתי, הכיוון נכון בעליל, והאחוזים הספציפיים הם של גוגל עד שיימדדו באופן בלתי תלוי.
מקרי השימוש שהתכונה נבנתה עבורם
ההכרזה מקבצת את היכולת לארבע קטגוריות, שכל אחת מהן מתאימה לעומס עבודה קונקרטי שמפתח יכול לשחרר:
• אחזור רגעים תת-שנייתי — איתור מדויק של שינויי מצב של שבריר שנייה וגבולות חיתוך הדוקים שרשת של 1 FPS מפספסת לחלוטין. זהו מקרה השימוש של עריכת וידאו אוטומטית: מציאת הפריים המדויק שבו מתרחש שינוי סצנה.
• חיפוש מחט בערימת שחת בפורמט ארוך — מענה לשאלה ספציפית על סרטון בן שעות רבות ללא צריכת מיליוני טוקנים. זה ההבדל בין "צפה בשיחה בת 3 השעות" לבין "האם הלקוח הסכים לחידוש החוזה בשיחה בת 3 השעות."
• זיהוי חריגות — המודל דוגם מחדש חלונות זמן מעניינים בקצב פריימים גבוה יותר כדי לבחון תנועה מהירה ופגמים חזותיים עדינים. בקרת איכות בייצור, ניתוח ספורט וצילומי אבטחה הם היעדים הברורים.
• ספירת פעולות ועצמים — מעקב אחר תנועות פיזיות חוזרות ועצמים נפרדים לאורך זמן, שדגימה סטטית מחסירה כאשר הדבר הנספר נע מהר יותר מקצב הדגימה.
אילו דגמים, וכמה הם עולים
התכונה כלולה בדרגת ה-Flash, ופיזור המחירים בין שלושת הדגמים חשוב לבחירה לאן לכוון אותה:
• Gemini 3.7 Flash — 0.75$ קלט / 3.75$ פלט למיליון טוקנים במחיר מבצעי, מאושר עד 31 בדצמבר 2026, ולאחר מכן הוא מוכפל ל-1.50$ / 7.50$. המוביל ביחס הדיוק-לעלות מבין השלושה.
• Gemini 3.6 Flash — $1.50 / $7.50 למיליון טוקנים. האפשרות היציבה והלא-מבצעית בשלישייה.
Gemini 3.5 Flash-Lite — $0.30 / $2.50 למיליון טוקנים. המסלול התקציבי, למיון וידאו בנפח גבוה, שבו הטוקן הזול ביותר הוא כל העניין.
מכיוון שהתכונה משתמשת בתמחור האסימונים הסטנדרטי של Gemini API ללא עמלה נוספת, הפחתת האסימונים של 88% מתבטאת ישירות בתעריפים האלה. עומס עבודה שעלה 100 דולר לניתוח סטטי אמור לעלות בערך 12 עד 34 דולר בעיבוד אייג'נטי על אותו מודל, לפני כל שיפור בדיוק — וזה הסיפור האמיתי לכל מי שהפייפרליין שלו כרגע שורף אסימונים על העלאה חוזרת או דגימת פריימים של וידאו ארוך.
איך להפעיל את זה
המצב מופעל באמצעות דגל תצורה בודד — העבר את העיבוד "agentic" בבקשה — והוא עובד עם אותם קלטים ואותו תמחור כמו ה-API הרגיל. אין נקודת קצה נפרדת, אין מימד חיוב חדש, אין מכסה מיוחדת. הנתיב של Python משתמש ב-API האינטראקציות של ה-SDK של google-genai, לדוגמה עם מודל "gemini-3.7-flash" וקלט של וידאו יחד עם הנחיית טקסט; הווידאו יכול להיות העלאה ישירה, URI של Cloud Storage, כתובת HTTP ציבורית, או כתובת YouTube, בהתאם לממשק שאליו אתה קורא.
שני אילוצים מעשיים שכדאי להכיר לפני שבונים: קבצי וידאו כפופים למגבלות הגודל של הפלטפורמה (במסלול Enterprise Agent Platform, בערך 15 MB לקובץ), ו-Gemini Enterprise Agent Platform תומכת בפורמטי הקונטיינר הנפוצים — MP4, MOV, AVI, WebM, WMV, MPEG — אז הטיפול בפורמטים מתרחש לפני קריאת ה-API, לא בתוכה.
איפה זה רץ עכשיו, ולאן זה הולך
בהשקה, הבנת וידאו אייג'נטית זמינה להעלאות וידאו ולסרטוני יוטיוב דרך Gemini API ב-Google AI Studio ודרך Gemini Enterprise Agent Platform — זה המשטח למפתחים ולארגונים. שתי השקות צרכניות הוכרזו אך עדיין לא פעילות: אפליקציית Gemini, שבה התכונה תתגלגל בקרוב לכל המשתמשים בדגמי Flash ו-Flash-Lite, והתכונה "Ask YouTube" בדף צפיית הווידאו ביוטיוב, שלפי גוגל תגיע בחודשים הקרובים. למפתח שמעריך את התכונה, ה-API הוא המקום הכנה לבדוק אותה היום; המשטחים הצרכניים הם מהלך ההפצה שיהפוך את הביטוי למוכר.
יש גם אות מהאקוסיסטם שכדאי לשים לב אליו: מכיוון שהיכולת מסופקת כמצב API סטנדרטי, פרויקטי ה-MCP-server וה-agent-framework שעוטפים את הבנת הווידאו של Gemini — מסגרת ה-GenV לניתוח פגישות, חבילות ה-MCP לחקר וידאו, ומיומנויות הווידאו של Gemini שהופיעו במהלך החודשים האחרונים — יכולים לאמץ אותה ללא שינוי בארכיטקטורה שלהם. שדרוג המצב, לא SDK חדש, הוא מה שמאפשר את ירידת העלות.
מה לבדוק לפני שמאמינים באחוזים
כל מספר בהכרזה — ה-66%, ה-88%, ה-7%, טענת חזית פארטו — הוא מספר של גוגל עצמה, שנמדד על ערכת הבדיקות של גוגל עצמה, ואף אחד מהם לא שוחזר מחוץ לחברה. הכיוון אינו מוטל בספק: לולאה איג'נטית שטוענת רק מקטעים רלוונטיים אינה יכולה אלא לנצח רשת קבועה שטוענת הכול. ההיקף הוא השאלה הפתוחה, והוא ישתנה לפי עומס העבודה — קליפ של 2 דקות עם שאלה אחת לא יראה חיסכון של 88% בטוקנים, כי אין הרבה מה לדלג עליו; שיחה של 3 שעות עם שאלה ממוקדת אחת — כן. הבדיקה הנכונה היא הווידאו הארוך שלך, הפעלה אחת בעיבוד סטטי והפעלה אחת בעיבוד איג'נטי, על אותו מודל, תוך ספירת טוקנים אמיתיים ודולרים אמיתיים.

הכלכלה של המבחן הזה היא בדיוק המקום שבו שכבת ניתוב מוכיחה את ערכה. Gemini 3.6 Flash ו‑Gemini 3.5 Flash‑Lite — שניים משלושת המודלים שהתכונה הזו חלה עליהם — מוגשים ב‑OrcaRouter במחיר המחירון של Google, מועבר ב‑0% תוספת, כך שהנחת מחיר לניתוח וידאו פעילה אצלנו באותו היום שבו היא פעילה אצל Google; Gemini 3.7 Flash, השלישי והחדש ביותר, זמין דרך ה‑API של Google עצמה ובכמה פלטפורמות צד־שלישי. ומכיוון שהבנת וידאו אייג'נטית היא יכולת שזה עתה שוחררה, שהפערים שלה בעולם האמיתי אינם מאומתים, זהו המקרה המובהק למעבר אוטומטי: לנתב חלק מתעבורת הווידאו למצב האייג'נטי, לתת לנתב לחזור למודל מוכח על שגיאות, הגבלות קצב או רגרסיות איכות ברורות, ולהשאיר את הנתיב הבסיסי פעיל עד שהמצב החדש יזכה בתעבורה.

השינוי הוא יותר מהוספת תכונה. וידאו היה הקלט המולטימודלי המביך במשך שנתיים — אקספרסיבי מאוד, יקר מאוד לניתוח, ובפועל נקרא עם אובדן דגימה. הבנת וידאו מבוססת סוכנים היא התשובה הרצינית הראשונה של גוגל לשלוש הבעיות בבת אחת, והיא נוחתת בשכבה הזולה ביותר של קו הדגמים שלה במקום בדגם הדגל. עבור צוותים שנמנעו מעומסי וידאו בגלל חשבון הטוקנים, המצב הזה שווה לחשב מחדש את הכדאיות היום.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
