Команда Kandinsky научила нейросети «понимать» течение времени при генерации видео

Обсудить
Команда Kandinsky научила нейросети «понимать» течение времени при генерации видео
Реклама. АО «ТаймВэб». erid: 2W5zFJ7iPGV

Команда Kandinsky разработала легкую надстройку к генеративным нейросетям под названием Time Adapter. Она решает распространенную проблему при генерации видео: плохое понимание моделями течения времени в ролике при достаточно качественной передаче картинки в отдельных кадрах. 

Раньше нейросети при генерации видео не всегда корректно передавали скорость происходящего, например, растягивая быстрые действия или ускоряя медленные события. То есть сгенерированные дождь и туман могли двигаться слишком медленно или рывками, а движения человека выглядели неестественными.

Причина такой проблемы – архитектура моделей и принцип обучения, где приоритет отдавался эстетике отдельного кадра, а не полной физической достоверности происходящего. Поэтому нейросети не умеют напрямую управлять динамикой событий, разрушая естественный темп происходящего.

Модуль Time Adapter подключается к готовой нейросети, при этом он достаточно компактен и занимает менее 1% от размера основной модели. Он включает два независимых блока – первый управляет частотой кадров, регулируя ее в диапазоне от 15 до 60 кадров в секунду, а другой регулирует динамику происходящего в сцене.

Time Adapter можно будет внедрить в такие сценарии: 

  • создание физически достоверных синтетических данных для обучения физического ИИ;
  • генерация пользовательских роликов без артефактов движения с произвольной динамичностью;
  • создание рекламных, кино- и музыкальных роликов со строгим контролем темпа – под монтаж, музыку и бриф;
  • упрощение обработки видео – получение эффектов замедления, ускорения и плавных переходов по темпу прямо в генерации, без привлечения отдельного специалиста по монтажу.

В Time Adapter предусмотрели два режима использования. В первом модуль обучается и затем подключается к заранее обученной модели генерации видео: в этом случае движения становятся плавнее, а общий характер генерации не меняется. Во втором режиме модель дообучается совместно с адаптером, и в этом случае меняется не только плавность движения, но и физика сцены. 

Команда выложила код бесплатно для разработчиков на Hugging Face под открытой лицензией MIT. Научная статья о разработанном подходе была представлена на конференции по машинному обучению ICML.

Изображение на обложке: Kandinsky Lab

Если человек настраивает сервер, это не новость; новость – если сервер настраивает человека.
Новый подкаст от Timeweb

Комментарии

С помощью соцсетей
У меня нет аккаунта Зарегистрироваться
С помощью соцсетей
У меня уже есть аккаунт Войти
Инструкции по восстановлению пароля высланы на Ваш адрес электронной почты.
Пожалуйста, укажите email вашего аккаунта
Ваш баланс 10 ТК
1 ТК = 1 ₽
О том, как заработать и потратить Таймкарму, читайте в этой статье
Чтобы потратить Таймкарму, зарегистрируйтесь на нашем сайте