ElevenLabs представила дві нові моделі синтезу мовлення: ElevenLabs v4 та v4 Turbo. Вони отримали ширші можливості для керування інтонацією та виразністю голосу, швидшу генерацію і підтримку понад 90 мов. Компанія також заявляє про швидше клонування голосу та меншу затримку під час роботи голосових агентів ШІ.
Нові голосові моделі
Головна зміна у v4 стосується того, наскільки детально можна керувати звучанням голосу. Модель враховує контекст тексту, тому під час озвучення може змінювати подачу залежно від змісту. Це має допомогти, коли один і той самий голос читає не просто окремі речення, а довгі діалоги чи цілі сценарії.
Ще одна можливість стосується тегів для керування виразністю. Вони з’явилися ще у попередній версії, але тепер їх можна комбінувати між собою та задавати послідовність, якої модель має дотримуватися під час озвучення.
Зміни торкнулися і клонування голосів. Для створення копії голосу v4 достатньо приблизно 10 секунд аудіозапису. Раніше для цього могло знадобитися більше матеріалу.
Модель також розширила мовну підтримку. Попередня версія працювала приблизно з 70 мовами, тоді як v4 підтримує понад 90. ElevenLabs окремо відзначає покращення якості для японської, бразильської португальської, мандаринської та кантонської мов.
Для голосових агентів ШІ важлива ще одна зміна: зменшилася затримка між запитом користувача та відповіддю системи. v4 може починати генерувати аудіо ще тоді, коли мовна модель продовжує формувати відповідь. Завдяки цьому діалог має звучати природніше, без довгих пауз.
Модель також розрахована на складніші розмовні сценарії. Так, ElevenLabs говорить про обробку конфліктних ситуацій, ескалацій та утримання клієнтів. Це особливо актуально для компаній, які використовують голосових агентів у службах підтримки та продажах.

