Китайський гігант електронної комерції Alibaba інвестує в створення відеороликів за допомогою штучного інтелекту
Alibaba, китайська багатонаціональна компанія, найбільш відома своїми операціями в сфері електронної комерції, також активно інвестує в проєкти з технологічного розвитку. Дослідники Інституту інтелектуальних обчислень компанії представили свою нову систему штучного інтелекту для генерації відео, під назвою EMO.
EMO, або Emote Portrait Alive, - це "фреймворк для генерації портретних відео з експресією, керованих аудіо". Він перетворює одне статичне зображення та голосовий супровід на анімоване відео аватара з мімікою та позами.

Дослідницька група створила численні приклади роботи EMO, зокрема анімування персонажа згенерованого штучним інтелектом, яка носить окуляри від OpenAI's Sora, та змушує її співати пісню "Don't Start Now" Dua Lipa. На щастя, цей персонаж - один із найменш лякаючих творінь Sora.
Інший приклад демонструє анімацію сгенерованої штучним інтелектом фотографії Мона Лізи да Вінчі, яка співає пісню "Flowers" Miley Cyrus, у виконанні YUQI. В іншому ролику Одрі Хепберн співає кавер на пісню Еда Ширана. YouTube-канал RINKI зібрав усі демонстраційні ролики Alibaba та масштабував їх до 4K.
Важливою особливістю EMO є можливість синхронізувати губи у синтезованому відеокліпі з реальним аудіо. Таким чином, модель підтримує пісні різними мовами. Вона також працює з численними художніми стилями, чи то фотографія, живопис чи аніме. Крім того, EMO може працювати з іншими аудіозаписами, наприклад, зі звичайною мовою.
Теоретично, аудіозапис не обов'язково має бути "аутентичним". Лише цього тижня компанія Adobe представила нову платформу штучного інтелекту, яка може створювати музику з текстових запитів. А як добре відомо таким знаменитостям, як Тейлор Свіфт, для людей не складає великої проблеми генерувати реалістичні голоси.
Модель, побудована на основі Stable Diffusion, не є першою у своєму роді, але, мабуть, найефективнішою. У цій початковій роботі є помітні недосконалості, зокрема досить сильне пом'якшення шкіри людей та іноді різкі рухи губ. Проте загальна точність рухів губ у відповідь на вхідний аудіозапис є вражаючою.
Повні результати досліджень Інституту інтелектуальних обчислень Alibaba опубліковані на Github, а пов'язана з ними наукова стаття доступна на ArXiv.
