Команда дослідників з Вашингтонського університету створила інноваційні систему штучного інтелекту “Target Speech Hearing“.
Про це повідомляє сайт Вашингтонського університету.
Ця система дозволяє користувачам навушників ідентифікувати голос мовця у юрбі протягом трьох-п’яти секунд фіксування погляду на ньому. Після цього система “Target Speech Hearing” ізолює та підсилює голос зареєстрованої людини, блокуючи всі інші звуки навколишнього середовища. Це дозволяє користувачеві чітко чути лише потрібний голос навіть у шумних місцях та під час руху.
Результати дослідження були представлені на конференції ACM CHI, присвяченій людським факторам у обчислювальних системах. Важливо зазначити, що код для прототипу пристрою є доступним для інших розробників, однак система наразі не продається комерційно.
“Зазвичай ми уявляємо штучний інтелект як чат-ботів, що відповідають на питання. Але цей проєкт демонструє, як ШІ може трансформувати слухове сприйняття, налаштовуючи його під уподобання користувача. З нашими пристроями ви зможете чітко чути одного мовця навіть у шумному середовищі“, — пояснив старший автор дослідження, професор Університету Вісконсіна в Школі комп’ютерних наук та інженерії Пола Г. Аллена Шьям Голлакота.
Щоб скористатися системою, користувачі навушників з мікрофонами натискають кнопку та спрямовують голову на мовця. Голосові хвилі від мовця повинні одночасно досягти мікрофонів з обох сторін навушників, з похибкою до 16 градусів. Навушники передають цей сигнал на вбудований комп’ютер, де програмне забезпечення на основі машинного навчання аналізує голосові патерни мовця. Система фіксується на голосі та продовжує його відтворення, навіть якщо мовець і слухач рухаються. Здатність системи розпізнавати голос покращується з кожним сказаним словом, оскільки вона отримує більше даних для навчання.
Команда протестувала систему на 21 суб’єкті, які оцінили чіткість голосу зареєстрованих мовців майже вдвічі вище, ніж нефільтрованого звуку.

