Команда Google DeepMind презентувала інноваційну технологію трансформації відеоконтенту в аудіо (V2A), яка дозволяє здійснювати синхронізоване створення аудіовізуального матеріалу.
Про це повідомляють в в блозі DeepMind.
Ця технологія об’єднує відеопікселі з текстовими підказками на природній мові, щоб формувати багатий звуковий ландшафт, який відповідає подіям на екрані.
Технологія V2A сумісна з існуючими моделями відеогенерації. У поєднанні з цими моделями V2A може створювати сцени, що супроводжуються драматичними музичними композиціями, реалістичними звуковими ефектами або діалогами, що точно передають характер і настрій відео.
Крім того, новий штучний інтелект здатний створювати звукові доріжки для різноманітних традиційних матеріалів, таких як архівні записи, німі фільми та інше. Технологія V2A може генерувати необмежену кількість аудіотреків для будь-якого відеоролика, при цьому користувачі мають можливість давати технології відповідні підказки. Деякі приклади роботи цієї технології наведені нижче.
Для навчання технології розробники використовували анотації, створені штучним інтелектом, які включали детальні описи звукових ефектів і розшифровки діалогів, а також різноманітні відео та аудіо дані. В результаті, нейромережа навчилася асоціювати конкретні звукові події з відповідними візуальними сценами, реагуючи на інформацію, надану в анотаціях або транскриптах. Текстові підказки можна додавати за бажанням, але це не є обов’язковим.
Водночас є кілька проблем, над якими зараз працює команда Google. Зокрема, йдеться про зниження якості відео при кінцевому результаті та неточності в синхронізації губ під час відтворення згенерованих діалогів.

