LVA в ЗМІ

LVA аналіз голосу. Принцип роботи та застосування. – Digital Trends

Люк Дормель

Я добре пам’ятаю, як уперше побачив технологію розпізнавання мовлення в дії. Це сталося у кабінеті моєї початкової школи в середині 1990-х на комп’ютері Macintosh. Письменник-фантаст Артур К. Кларк одного разу написав: «будь-яку достатньо розвинену технологію неможливо відрізнити від магії» — і це було чарівно, бачити слова, що з’являються на екрані, без потреби фізично набирати їх на клавіатурі.

Через кілька десятиліть ще більше наших пристроїв матимуть помічників зі штучним інтелектом (ШІ), таких як Siri від Apple або Alexa від Amazon. Ці інструменти, створені за допомогою найновіших технологій штучного інтелекту здатні не просто транскрибувати слова. Вони також можуть розуміти значення цих слів та виконувати дії.

Але голос може зробити набагато більше. Одна з причин збільшення популярності таких інструментів, як Zoom, що широко використовувався під час пандемії — це особливості вербальної комунікації. Тоном свого голосу ми можемо передати не менше інформації, ніж обраними словами.

Однак це здебільшого ігнорується поточним поколінням інструментів розпізнавання голосу. Nemesysco — ізраїльська технологічна компанія, що спеціалізується на виявленні емоцій по голосу хоче виправити цю помилку. У такий спосіб, технологія розпізнавання голосу може вийти на новий рівень, створивши розумне розпізнавання голосу, яке не просто розуміє нас, а дійсно і глибоко розуміє нас. Це, на думку компанії, може зробити розумних помічників завтрашнього дня ще розумнішими і запропонувати нові способи їх взаємодії зі світом. І навіть потенційно допомогти вирішити, чи отримаєте ви підвищення по роботі, яке ви так прагнули. Будьте готові до світу «ефективного обчислення».

Приховування своїх емоцій

Я відчуваю стрес. Насправді це лише частина повної картини. Я почуваюся напруженим, радісним, агресивним, засмученим і бадьорим, а також пристрасним, щасливим, залученим, нерішучим, тривожним, сумним. І ще напевно є купа всіх інших емоцій, які Амір Ліберман, засновник і генеральний директор Nemesysco, не вимірював. 

Усе, що робить Nemesysco, коли йдеться про кількісну оцінку емоційності, базується на звуках голосу речника, на відміну від технології розпізнавання настрою, що наприклад відстежує канали Twitter, аби визначити широку палітру емоційних реакцій людей на важливі новини. Ви можете говорити про незаповнений подіями ранок четверга або найгірший день у вашому житті; важливо не те, що ви говорите, а те, як ви це говорите. Хоч я і намагаюся говорити рівно, але в очікуваних вами точках мого монологу дещо підвищуються біомаркери стресу, розваги та інших індикаторів.

За словами Лібермана, Ш.I. багаторвіневого аналізу голосу Nemesysco здатний розпізнати 51 параметр голосу, що можна виділити та пов’язати, загалом, із 16-тьма емоціями. «Їх унікальність полягає в тому, що всі вони неконтрольовані, усі непомітні». «І всі вони стосуються справжніх емоцій, а не тих, що ми намагаємося транслювати».

Від детекторів брехні до 11 025 точок даних 

24 роки тому компанія Nemesysco почала розробляти свій інструмент розпізнавання емоцій по голосу для сил безпеки. «Ніколи не мав наміру заробити на цьому ані цента», — зауважує Ліберман. «Ідея полягала в тому, щоб запобігти терору, створивши детектор брехні, який буде легко використовувати при в’їзді в Ізраїль».

Свого часу ідея вирішення цієї проблеми завдяки Ш.І. була наче дурний жарт. «Коли ми починали, Ш.І. було поганим словом”, — згадав він. «Коли я казав: «ми будемо використовувати штучний інтелект та емоції», люди казали мені: «Що б ти не робив, не згадуй штучний інтелект»… 

Відтоді технологія Nemesysco вийшла далеко за межі бінарної передумови «правда чи брехня», на якій була заснована. Але частково лишається уявлення про пошук істини та криміналістичне дослідження тонкощів мовлення через непомітно продемонстровані голосові патерни, про які люди навіть не підозрюють. «Коли ви говорите про емоції в голосі, існує дуже важлива різниця між тим, що ми намагаємося транслювати, і тим, що ми насправді відчуваємо всередині», — сказав Ліберман. «У багатьох випадках ми намагаємося замаскувати свої голос і почуття».

Людині зазвичай важко виявити емоції по формі звукової хвилі. Система Nemesysco використовує частоту дискретизації 11 кГц, що призводить до генерації 11 025 точок даних щосекунди. Виявити емоції в цій трясовині точок даних — все одно, що знайти голку в копиці сіна. «Звичайно, комп’ютери роблять це набагато краще та швидше». Для виявлення більшості емоцій необхідне машинне навчання Ш.I. Як зазначив Ліберман: «Ми використовуємо машинне навчання, щоб ідентифікувати агресію, смуток, щастя. Це дуже складні емоції з точки зору їх комплексності в нашому розумі. Нам спочатку було дуже важко їх виявити».

«Телефон, який дійсно стане вашим другом»

Письменниками-фантастами давно досліджується ідея надати машинам можливість відчувати емоції. Візьмемо такого персонажа, як Дейта, андроїда із фільму «Зоряний шлях: Наступне покоління». Незалежно від того, наскільки він  зручний накопичувач інформації, на ранньому етапі він має проблеми у спілкуванні з екіпажем «Ентерпрайзу», оскільки не розуміє певних нюансів людської поведінки.  

Демонстрація аналітики емоцій з Nemesysco 27s QA5

Здебільшого нам обіцяють, що справжній штучний інтелект побудований на здатності моделювати або симулювати когнітивні здібності людини. Нема настільки ж людської когнітивної здібності, ніж вираження емоцій. Можливість надати машинам здатність відчувати емоції – не означає зробити емоційними саме машини. Технологія виявлення емоцій може допомогти нам досягти кращого розуміння самих себе, потенційно здійснити хитрий маневр — надати об’єктивні, а не суб’єктивні дані про емоції. «Якщо ви не можете виміряти щось, ви не можете цим керувати», як говорить стара приказка.

У деяких випадках розуміння емоційного стану користувачів може допомогти зробити технологію більш інтуїтивно зрозумілою або, можливо, більш безпечною. «Я твердо переконаний, що прийняття рішень за допомогою Ш.І. без урахування мого емоційного стану та особливостей особистості, ніколи не будуть такими ж вірними, як з урахуванням цього», — говорить Ліберман.

Він розглядає і потенційні застосування: робот, що розважає ваших дітей, спостерігаючи за їхнім самопочуттям; додаток, який допомагає оптимізувати настрій, аби ви зосередились на своїх цілях; автомобіль із режимом автопілота, що обмежує вашу швидкість або керує замість вас, коли знає, що ви в стресовому стані. 

Ваше наступне підвищення по роботі

Наразі великим поштовхом для компанії є використання технологій Nemesysco для потенційної допомоги у прийнятті рішень щодо просування людей по службі.

Ідея, що нам відмовили у працевлаштуванні через наш голос, який звучить так ніби ми не праві – це суцільний жах 

Амір Ліберман

Все не так просто. Ідея полягає не в тому, що голос людини визначає ймовірність отримання нею підвищення по роботі, а радше в тому, що це один із багатьох факторів, що може вплинути на подібне рішення. Під час співбесіди вас можуть запитати про ваш нещодавній досвід керуванням командою людей у ​​певній ситуації. Якщо голос виражає ентузіазм і впевненість, коли ви розповідаєте свою історію, це може вказувати на вашу придатність. Якщо ваші голосові сигнали свідчать про тривогу і смуток, це може означати протилежне.

«Згуртувавши ці емоції в один звіт, ми можемо сказати, що вам насправді подобається, а що ні» 

Амір Ліберман

Сентографи скрізь

У 1967 році вчений і винахідник австрійського походження, Манфред Клайнс, побудував машину для вимірювання емоцій. Клайнс — вундеркінд, який одного разу отримав лист щодо своєї гри на фортепіано від свого шанувальника Альберта Ейнштейна. Він назвав свою машину «сентограф», від латинського слова sentire, що означає «відчувати». Сентограф вимірював зміни спрямованого тиску, що спричиняла людина, яка тисне клавушу. Повідомлялось, що одне натискання пальцем могло виявити гнів, благоговіння, секс, радість і смуток. Результати були опубліковані в 1976 році у книзі Клайнса під назвою Sentics.

Робота Клайнса над “сентистикою” не мала великого успіху  за його життя. Однак сьогодні сфера «ефективного обчислення» (англ. – affective computing) продовжує набирати обертів. Дослідники стверджують, що вони можуть точно передбачити емоційний стан по виразу обличчя, частоті серцевих скорочень, артеріальному тиску, навіть по використанню додатків і записам телефонних розмов. І, звичайно,  завдяки голосу.

Одна з найскладніших сфер у новому світі технологій розпізнавання емоцій — забезпечення точності. Особливо у порівнянні із значно простішим розпізнаванням мовлення. Інструмент диктування або успішно фіксує озвучені слова, або ні. Набагато складнішою є ідея поринути в емоції, які навіть сам користувач не усвідомлює, і не знає про що вони свідчать. Є причина, чому детектор брехні не допускається до суду. Головним пріоритетом має бути впевненість, що ці інструменти дійсно працюють і не схильні до упередженості.

У презентації компанії зазначається, що «немає вікових, статевих чи етнічних упереджень», вона «міжкультурна,  міжетнічна та однакова для всіх». Це життєво важливо, тому що подібні інструменти виходять за межі лабораторних дослідницьких проектів і охоплюють все більше сфер нашого життя.

Голосовий Ш.І. тренувався на реальних людях, що виражали щирі емоційні реакції. «Ніщо в нашому дослідженні не було проведено на підставі фальшивих голосів», — сказав Амір. «Усе, що ми робили, кожна модель, яку ми створювали, усе базувалось на справжніх емоціях, зібраних у реальних ситуаціях».

Відстеження емоцій завдяки Ш.І. — наближається. Подібно до того, як розпізнавання мовлення, що колись було науково-фантастичною мрією, над якою старанно працювали кілька провідних дослідницьких лабораторій, тепер доступне на наших телефонах. Так само буде і з емоційним штучним інтелектом. Він стане частиною нашого повсякденного життя. Звісно, якщо це ще досі не так.

Посилання на першоджерело:

https://www.digitaltrends.com/cool-tech/emotion-sensing-ai-voice-analysis/

Leave a comment

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *