Генерация видео со звуком: что умеет Kandinsky 6.0 Video
«Сбер» обновил Kandinsky 6.0 Video — теперь модель умеет генерировать не только изображение, но и звук. Она создаёт короткие ролики с диалогами, звуковыми эффектами и фоновой музыкой, синхронизируя их с происходящим в кадре. Например, речь героя сопровождается движением губ.
Как это работает
Для генерации достаточно описать сцену текстом или загрузить первый кадр. Отдельно можно задать, какие звуки должны происходить в ролике. Максимальная длительность пока ограничена пятью секундами, но разработчики планируют её увеличить.
Модель способна создавать разные типы звука: от речи и цифровых эффектов до шагов, шума ветра и звука проезжающей машины. Качество аудио — 44 кГц. При необходимости видео можно сгенерировать вообще без звуковой дорожки.
Сам ролик может быть в разрешении до Full HD. В GigaChat перед отправкой запроса можно выбрать качество: SD ускоряет генерацию, а HD и Full HD дают более чёткое и детализированное изображение.
Что внутри
Kandinsky 6.0 Video состоит из двух связанных модулей — для генерации видео и звука. Звуковой модуль обучали более чем на 20 млн видео со звуковой дорожкой. За счёт этого модель одновременно учитывает визуальную сцену и соответствующий ей аудиоряд.
Модель уже доступна в ИИ-помощнике GigaChat. Для разработчиков её выпустили под лицензией MIT, поэтому её можно бесплатно интегрировать в собственные продукты.

Комментарии
Написать комментарийВойти