Google 為多款 Gemini 模型加入代理式(agent-based)影片分析功能。與以往以固定頻率逐幀掃描影片不同,新系統能自主搜尋相關片段。Google 表示,此舉可大幅減少 Token 用量及相關成本。
最新版本的 Gemini 3.7 Flash、3.6 Flash 及 3.5 Flash-Lite 模型,能夠辨識短於一秒的時刻,包括狀態改變或剪輯轉場,這些細節在以每秒一幀的處理速度下往往會遺漏。Google 指稱,這使自動影片編輯變得更為精準。
該系統能在數小時的長片中鎖定個別場景,而無需消耗數百萬 Token。它透過以更高幀率重新取樣可疑的時間窗口來發現異常,並能準確計算隨時間重複出現的動作和個別物體。相較於過去預設每秒取樣一幀的靜態處理方式,代理式變體將模型的推理能力直接與原生影片工具結合。模型會自行決定查看哪些部分、以何種速度以及透過哪種模態(如影格、音訊或文字記錄)進行分析,僅擷取特定任務所需的時刻和訊號。
Gemini 現在僅載入影片中重要的部分,利用內部工具擷取相關片段。這種方法基於 Google 早前為 Gemini 3 Flash 推出的「代理式視覺」技術,該技術允許模型編寫並執行 Python 程式碼以縮放、裁剪和標註影像。效率提升在長視頻中尤為顯著,涵蓋從十分鐘教學到九十分鐘講座及數小時錄像。在 Google 自家的基準測試(包括 LongVideoBench)中,採用代理式分析的 Gemini 3.7 Flash 在整體質量上得分最高,並在準確度與成本效益之間取得最佳平衡。
該功能已在 Google AI Studio 及 Gemini Enterprise Agent Platform 上的 Gemini API 正式推出,支援上傳影片及 YouTube 影片。開發人員可在 API 設定中將處理模式設為「agentic」,並按標準 Gemini API Token 費率付費,無需額外費用。Google 計劃將這些改進應用於其自有產品,未來數月內,代理式影片分析也將用於播放頁面的「Ask YouTube」功能,提供更貼合影片實際內容的答案。