ג'מיני ילמד לבחור בעצמו באילו חלקים של הסרטון לצפות
גוגל מציגה יכולת ניתוח וידאו סוכני, שמפחיתה משמעותית את צריכת הטוקנים והעלות ומשפרת את דיוק התשובות
- קובי ברקת
- כ' אלול התשפ"ו
גוגל הכריזה אתמול על יכולת חדשה בשם Agentic Video Understanding עבור Gemini, שנועדה לשנות את הדרך שבה מודלי AI מנתחים סרטונים.
במקום לעבור על סרטון בקצב קבוע ולנתח מספר קבוע של פריימים בכל שנייה, Gemini יכול לבחור בעצמו אילו חלקים בסרטון דורשים צפייה מעמיקה יותר ואילו חלקים אפשר לעבד במהירות.
לפי Google, המערכת בוחנת יחד את התמונה, האודיו והתמלול, ומחליטה באופן דינמי היכן להאט, לחזור אחורה או להתמקד במקטע מסוים כדי למצוא את המידע הרלוונטי.
הבעיה בשיטה הרגילה היא כפולה: בסרטונים מהירים אפשר לפספס רגע חשוב, ובסרטונים ארוכים מבוזבזים טוקנים רבים גם על חלקים שאינם קשורים לשאלה. הניתוח הסוכני אמור להתמודד עם שתי הבעיות האלה.
בבדיקות של Google, השיטה החדשה הפחיתה את צריכת הטוקנים בעד 88% ואת עלות הניתוח בעד 66%, ובמקביל שיפרה את הדיוק בעד 7%.
היכולת יכולה לסייע במיוחד במשימות כמו איתור רגע קצר בתוך סרטון ארוך, זיהוי חריגה בתנועה, ספירת פעולות חוזרות או בדיקה חוזרת של אירוע מהיר בכמה קצבי פריימים.
בשלב זה היכולת זמינה למפתחים דרך Gemini API ב-Google AI Studio וב-Gemini Enterprise Agent Platform, עבור מודלי Gemini 3.7 Flash, Gemini 3.6 Flash ו-Gemini 3.5 Flash Lite.
בהמשך Google מתכננת להביא את הטכנולוגיה גם לאפליקציית Gemini במודלי Flash ו-Flash Lite, ובהמשך לשלב אותה גם ב-Ask YouTube, כדי לשפר תשובות על מה שמתרחש בפועל בתוך סרטונים.


הוספת תגובה
לכתבה זו טרם התפרסמו תגובות