Google добавил новую функцию для анализа видео в Gemini 

agentic video diagram.width 2000.format webp

Google запустил агентное понимание видео — новую функцию для моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Она снижает расход токенов на анализ видео до 88%, стоимость обработки — до 66%, а точность повышает до 7%.

Обычная обработка видео идет с фиксированной частотой — по умолчанию один кадр в секунду, параметр можно менять через API. Агентное понимание видео работает иначе: модель сама решает, какие фрагменты видео смотреть, с какой скоростью и через какой канал — кадры, звук или транскрипт, — и запрашивает только нужные моменты. Функция похожа на агентное распознавание изображений, которое Google выпустил ранее и которое совмещает выполнение кода с нативным пониманием изображений в моделях Gemini.

Наибольший эффект агентное понимание видео дает на длинных роликах — от десятиминутных инструкций до полуторачасовых лекций и многочасовых записей. При обычной обработке таких видео разработчикам приходится выбирать между высокими затратами токенов и потерей важных деталей.

Среди новых возможностей — точный поиск конкретного момента с точностью до долей секунды, поиск ответа на сложный запрос в многочасовом видео без расхода миллионов токенов, обнаружение аномалий за счет пересъемки интересных отрезков с повышенной частотой кадров и точный подсчет повторяющихся действий и объектов.

Функция уже доступна для загруженных видео и роликов с YouTube через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Тарификация не изменилась — используются стандартные цены Gemini API, отдельной платы за функцию нет. Чтобы включить ее, нужно указать значение processing на agentic в настройках API.

В ближайшее время агентное понимание видео появится у всех пользователей приложения Gemini для моделей линейки Flash и Flash-Lite, а также будет использоваться в функции Ask YouTube на странице просмотра видео.

Источник: Google