Москва6 октВести."Сбер" официально выпустил обновленную генеративную модель Kandinsky 6.0 Video. Принципиальное обновление состоит в том, что нейросеть теперь может по текстовому запросу или от предложенной картинки не только создать визуальную часть видео, но и подставить к ней соответствующую аудиодорожку. Подробностями в интервью ИС "Вести" поделился технический директор Kandinsky, управляющий директор по исследованию данных "Сбера" Денис Димитров.

Мы учили модель пять секунд генерировать. Она умеет работать с пятисекундным кусочком видео и только его расшумлять… Это можно продолжать, потому что модель умеет обусловливаться на первый кадр и можно сгенерировать пятисекундный кусочек, потом последний кадр подать в новую генерацию и продолжить таким образом. Но модель генерирует фактически пять секунд за раз

рассказал он

Видеоряд большей продолжительности таким образом сгенерировать пока невозможно, потому что это потребует больших вычислительных затрат.

То есть за раз минутный ролик выдавать нельзя. Поэтому, когда мы сейчас думаем о минутной генерации видео, мы вынуждены модель переобучать под так называемый авторегрессионный режим работы, когда модель уже генерирует кадр за кадром происходящее

добавил специалист

В новой версии Kandinsky Video обещают большее соответствие сгенерированных видео законам физики. Однако нулевая вероятность неестественного поведения объектов в кадре не гарантируется, так как четко прописанных правил поведения нет.

Сотни миллионов видео, на которых модель учится, эту физику содержат. Но лучшим способом физику прокачивают данные динамичные, то есть где очевидны сложные движения с пересечением каких-то объектов… Мы таких видео подсобрали больше, доучили на этих данных, модель прокачалась, потому что данных стало больше, без изменения архитектуры

подчеркнул Димитров

Также в "Сбере" отметили, что сторонние разработчики смогут брать модель Kandinsky 6.0 Video за основу и доделывать ее под свои нужды и продукты, так как лицензия полностью открыта.