Айтылған тіркеуден акустикалық масаңдықты анықтау

SafeVoice — бірнеше секунд қарапайым сөйлеуден ықтимал алкогольдік масаңдықты белгілейтін меншікті сөйлеу интеллектісінің қозғалтқышы. Инвазивті емес, нөлдік арнайы аппараттық құрал, айтылған сөзден басқа ештеңе қажет емес.

Масаң персонал алдын алуға болатын өнеркәсіптік оқиғалардың жетекші және жеткіліксіз бақыланатын қозғаушы күші болып қала береді. Алкоголь белгілер көзге көрінбей тұрып реакция жылдамдығын, кеңістіктік пайымдауды және ұсақ моториканы бұзады. Дәстүрлі бақылаулар — мерзімді алкотестерлер мен визуалды бақылаушы тексерулері — үзік-үзік, инвазивті, ауысым қақпаларындағы кедергілер және айналып өтуге оңай. Нәтиже — операциялық соқыр аймақ: жоғары қауіпті күйлер үздіксіз тоқтатуға ең қиын болып қалады.

Дауыс — бұл олқылықты жоюға арналған тамаша сигнал. Жұмысшылар ауысым бойы Push-to-Talk радиоларын, кіру интеркомдарын және дауыстық интерфейстерді табиғи қолданады. Алкоголь акустикалық биомеханиканы тұрақты өзгертеді — артикуляция жылдамдығын, фонация уақытын, просодияны және спектрлік дауыс сапасын бұзады — бұл биомаркерлерді мамандандырылған модель бірнеше секунд аудиодан шығарады.

SafeVoice екі толықтырушы архитектурада орналастырылады.

SafeVoice-Ref нақты уақыттағы дауысты жұмысшының тіркелген сау базалық сызығымен салыстырады — ауысым басындағы кіру скринингі үшін өте қолайлы.

SafeVoice-Solo тіркелген базалық сызықсыз нөлдік атумен жұмыс істейді, ауысым бойы күнделікті радиобайланыс кезінде жеке сөйлеу үзінділерін бағалайды.

Неміс алкоголь тілі корпусының бөлінген тест бөлімі, стандартты ашық эталон, өлшенбеген орташа еске түсірумен (UAR) бағаланған. Алдыңғы жұмыстармен салыстыру терезе бойынша метриканы қолданады — әр айтылымға бір шешім, дауыс берусіз — өйткені алдыңғы жұмыстар дауыс бермейді.

Не құрдық

Сөйлеушіге қатысты дифференциалдық кодтау

Аудионы оқшау жіктеудің орнына, SafeVoice-Ref сөйлеуді жеке тұлғаның базалық профилімен салыстырады. Сөйлеушіаралық акустикалық дисперсияны жою Өлшенбеген орташа еске түсіруде (UAR) дереу ~5 баллдық өсім береді — біздің ең әсерлі архитектуралық кезеңіміз.

Қос модельді архитектуралар, біріктірілген мүмкіндіктер жинағы

Ref те, Solo да бірдей төмен деңгейлі акустикалық көріністерді қолданады. SafeVoice-Ref жылдам бір реттік тіркеу арқылы дәлдікті арттырады, ал SafeVoice-Solo нөлдік операциялық үйкелісті басымдыққа қояды, тарихи деректерсіз кез келген сөйлеушіні дереу скринингтен өткізеді.

Толық тірек бейімделуі

Стандартты тәжірибе кіші корпустарда алдын ала оқытылған тіректерді мұздатуды ұсынады. Біздің эмпирикалық сынақтарымыз керісінше дәлелдеді: скрининг дәлдігі жұқа баптау тереңдігімен өсті, жартылай қабат мұздатумен салыстырғанда толық ұштан-ұшқа тірек бейімделуінде ~7 баллға секірді.

Көп масштабты мүмкіндіктер агрегациясы

Акустикалық биомаркерлер әртүрлі уақыттық ажыратымдылықтарда болады. Төменгі тірек қабаттары ұсақ артикуляциялық және дауыс жолы динамикасын сақтайды, ал жоғары қабаттар просодиялық ағын мен сөз тіркесі ырғағын модельдейді. Көп деңгейлі біріктіруден кейінгі мұқият пулинг ең диагностикалық кадрларды динамикалық өлшейді.

Ауыр өнеркәсіптік шу оқу бағдарламалары

Біз синтетикалық ақ шуды айналып өтіп, кең өнеркәсіптік аудио оқу бағдарламаларын таңдадық — ауыр техника, көлік гүрілі, қоршаған ортадағы әңгіме шуы және құрылымдық реверберация. Бұл таза базалық дәлдікті төмендетпей, қатал дала жағдайларындағы өнімділік алшақтығын жапты.

Көп терезелі консенсус декодтауы

Өткінші шыңдардың немесе тамақ тазалаудың жалған дабыл тудыруын болдырмау үшін, қорытынды құбыры әр айтылымға бірнеше қабаттасатын талдау терезелерін бағалайды. Консенсус дауыс беруді қолдану UAR-ға 1–2 балл қосады және анықтауды нақты әлемдік акустикалық шыңдарға ерекше төзімді етеді.

Өлшенген нәтижелер

Акустикалық жағдайлар бойынша нашарлау

Консенсус UAR (MV@5), анықтамалық негіздегі / анықтамасыз. Дәлдік төмендейтін жағдайларды қоса жарияланған.

Жүйе не болып табылады — және не емес

SafeVoice қандағы алкоголь концентрациясын өлшемейді және жұмысшыны жұмыстан шеттетуге негіз бола алмайды. Бұл белгіленген әдістермен тексеру үшін кімнің назар аударуға лайық екенін көрсететін бірінші деңгейдегі скрининг құралы. Салыстыру алкотестермен емес, бүгінгі күні қолданылатын баламамен жасалуы керек: бақылаушының бақылауы, ол шамамен оқытылмаған тыңдау деңгейінде жұмыс істейді.

Барлық нәтижелер бір корпустан алынған — German Alcohol Language Corpus, 162 сөйлеушіден жазылған, әр сөйлеушінің қандағы және демдегі алкоголь шындық көрсеткіштерімен. Бұл осы тапсырма үшін эталондық бенчмарк, бірақ ол бір корпус және жоғарыдағы барлық салыстырулар оның ұсталған тест бөлімінде жасалған.

Біз дәлдік төмендейтін жағдайларды басты көрсеткіштермен бірге жариялаймыз және қабылдамағандарымызды да жариялаймыз: қосымша эмоция және қандағы алкоголь регрессия бастары (теріс әсер), ішінара магистральды мұздату (шамамен жеті ұпай нашар), шешім шегінің баптауы (симптомдық түзету, 0.2 ұпай тұрарлық) және эталонсыз модель үшін сөйлеуші эмбеддингінің шарттауы — шынайы 0.6 ұпайлық өсім, бірақ пайдаланушыға тіркелуді қажет етіп, Solo-ның нөлдік үйкеліс артықшылығын жойғандықтан алынып тасталды.

Қалай қолданылады

Ауысым басындағы жұмысқа жарамдылық тексеруі: тіркелген базаға қарсы қысқа дауыстық кіру

Кәдімгі радио трафигі үстінен үздіксіз пассивті бақылау, тіркелусіз

Тиісті бақылаушыға адам шешімі үшін бағытталған калибрленген белгі

CPU-да жұмыс істейді, талдау терезесіне бір секундтан аз кідіріспен

Демографиялық контекст қолжетімсіз болғанда біртіндеп нашарлайды

XENOM платформасы арқылы нысанның басқа операциялық сигналдарымен бірге көрсетіледі