Головна проблема голосових AI: вони майже не вміють слухати
Голосові моделі стали настільки реалістичними, що інколи важко відрізнити їх від людини. Вони жартують, відповідають без затримок і підтримують діалог. Але, як наголошує CEO Hume AI Ендрю Еттінгер, це вирішує лише половину задачі: «voice actually has a listening problem because it just reads the transcript».
Команда Hume AI кілька років досліджує те, що зазвичай губиться, коли ми зводимо розмову до тексту: інтонації, емоції, паузи, акценти, шум довкола, міміка. Простий приклад — фраза «I’m fine». У транскрипті все виглядає спокійно, але в реальності голос може звучати налякано, роздратовано чи пригнічено. Люди тисячі років «кодували» сенси в тоні голосу, а більшість сучасних систем це просто ігнорує.
Ця різниця стає критичною, коли голосовий AI виходить за межі демо і потрапляє у банківські сервіси, медицину, контакт-центри чи стає голосовим інтерфейсом до інших агентів. Система може бездоганно розпізнати слова, але повністю провалити розуміння стану людини — і, відповідно, дати холодну, недоречну або навіть небезпечну відповідь.
Hume пропонує дивитися на голосовий AI не через «красу» синтетичного голосу, а через досвід користувача в реальній розмові. Вони оцінюють, чи модель чує, як саме ви сказали фразу, чи утримує цей контекст протягом довгої сесії, чи коректно реагує на шум, перебивання, акценти, емоційні зміни. Це вже не завдання «зробити голос, як у диктора», а багатовимірна задача — навчити систему по-людськи слухати.
Цікаво, що, за словами Еттінгера, компанії вже сидять на «золотій жилі» даних — роки записів дзвінків у контакт-центрах. Саме там є живі діалоги з реальними емоціями, перебиваннями та помилками. Але щоб перетворити це на якісні голосові агенти, потрібно змінити сам підхід до тестування: від сухих метрик точності транскрипції до оцінки того, чи досягла розмова бажаного результату для людини.
Чому це важливо
Якщо голос стане основним способом взаємодії з AI — а до цього все йде — виграють не ті системи, що «красиво звучать» перші 30 секунд, а ті, що здатні адекватно тримати розмову 30 хвилин. Для українського ринку це особливо актуально: у нас складні акценти, двомовність, часті фонові шуми, емоційно напружені дзвінки до банків, служб підтримки, державних сервісів.
- Оцінка за досвідом, а не за текстом. Тестувати голосові моделі лише по транскриптах — хибний шлях. Потрібно дивитися, чи людина реально отримала те, за чим зверталась.
- Емоційна чутливість як базова вимога. У медичних консультаціях, фінансових питаннях чи кризових ситуаціях «непомічена» тривога або розпач — це не дрібниця, а ризик.
- Власні бенчмарки замість загальних лідербордів. Еттінгер прогнозує, що компанії все більше створюватимуть приватні сценарії оцінки під своїх клієнтів і мову/культуру, а не орієнтуватимуться лише на публічні рейтинги.
- Українські дані мають значення. Якщо ви будуєте голосові сервіси для локального ринку, варто вже зараз думати, як збирати й анонімізувати реальні діалоги українською та суржиком, з нашими типовими «еее», паузами та емоційними патернами.
На мій погляд, наступний етап гонки голосових AI — це не ще один «людяний» голос, а системи, які не лише говорять, а й по-справжньому слухають. І тут у бізнесів, що працюють з реальними дзвінками українських клієнтів, є унікальна перевага — вони вже мають дані, яких бракує глобальним моделям.
Джерело: The Neuron (https://www.theneurondaily.com/p/hume-ai-voice-has-a-listening-problem)