Генерация видео со звуком: что умеет Kandinsky 6.0 Video
Редакция Пиксель Вайб
Редакция Пиксель Вайб

Генерация видео со звуком: что умеет Kandinsky 6.0 Video

«Сбер» обновил Kandinsky 6.0 Video — теперь модель умеет генерировать не только изображение, но и звук. Она создаёт короткие ролики с диалогами, звуковыми эффектами и фоновой музыкой, синхронизируя их с происходящим в кадре. Например, речь героя сопровождается движением губ.

Как это работает

Для генерации достаточно описать сцену текстом или загрузить первый кадр. Отдельно можно задать, какие звуки должны происходить в ролике. Максимальная длительность пока ограничена пятью секундами, но разработчики планируют её увеличить.

Модель способна создавать разные типы звука: от речи и цифровых эффектов до шагов, шума ветра и звука проезжающей машины. Качество аудио — 44 кГц. При необходимости видео можно сгенерировать вообще без звуковой дорожки.

Сам ролик может быть в разрешении до Full HD. В GigaChat перед отправкой запроса можно выбрать качество: SD ускоряет генерацию, а HD и Full HD дают более чёткое и детализированное изображение.

Что внутри

Kandinsky 6.0 Video состоит из двух связанных модулей — для генерации видео и звука. Звуковой модуль обучали более чем на 20 млн видео со звуковой дорожкой. За счёт этого модель одновременно учитывает визуальную сцену и соответствующий ей аудиоряд.

Модель уже доступна в ИИ-помощнике GigaChat. Для разработчиков её выпустили под лицензией MIT, поэтому её можно бесплатно интегрировать в собственные продукты.

Комментарии

Написать комментарийВойти