Команда Kandinsky разработала легкую надстройку к генеративным нейросетям под названием Time Adapter. Она решает распространенную проблему при генерации видео: плохое понимание моделями течения времени в ролике при достаточно качественной передаче картинки в отдельных кадрах.
Раньше нейросети при генерации видео не всегда корректно передавали скорость происходящего, например, растягивая быстрые действия или ускоряя медленные события. То есть сгенерированные дождь и туман могли двигаться слишком медленно или рывками, а движения человека выглядели неестественными.
Причина такой проблемы – архитектура моделей и принцип обучения, где приоритет отдавался эстетике отдельного кадра, а не полной физической достоверности происходящего. Поэтому нейросети не умеют напрямую управлять динамикой событий, разрушая естественный темп происходящего.
Модуль Time Adapter подключается к готовой нейросети, при этом он достаточно компактен и занимает менее 1% от размера основной модели. Он включает два независимых блока – первый управляет частотой кадров, регулируя ее в диапазоне от 15 до 60 кадров в секунду, а другой регулирует динамику происходящего в сцене.
Time Adapter можно будет внедрить в такие сценарии:
- создание физически достоверных синтетических данных для обучения физического ИИ;
- генерация пользовательских роликов без артефактов движения с произвольной динамичностью;
- создание рекламных, кино- и музыкальных роликов со строгим контролем темпа – под монтаж, музыку и бриф;
- упрощение обработки видео – получение эффектов замедления, ускорения и плавных переходов по темпу прямо в генерации, без привлечения отдельного специалиста по монтажу.
В Time Adapter предусмотрели два режима использования. В первом модуль обучается и затем подключается к заранее обученной модели генерации видео: в этом случае движения становятся плавнее, а общий характер генерации не меняется. Во втором режиме модель дообучается совместно с адаптером, и в этом случае меняется не только плавность движения, но и физика сцены.
Команда выложила код бесплатно для разработчиков на Hugging Face под открытой лицензией MIT. Научная статья о разработанном подходе была представлена на конференции по машинному обучению ICML.
Изображение на обложке: Kandinsky Lab
Комментарии