Akustiskā reibuma noteikšana no izrunātas reģistrācijas

SafeVoice — patentēts runas intelekta dzinējs, kas atzīmē iespējamu alkohola reibumu tikai no dažām sekundēm parastas runas. Neinvazīvs, nulle specializētas aparatūras, nepieciešama tikai izrunāta frāze.

Reibumā esošs personāls joprojām ir vadošais un nepietiekami instrumentēts novēršamo industriālo incidentu cēlonis. Alkohols pasliktina reakcijas ātrumu, telpisko spriestspēju un smalko motoriku ilgi pirms simptomi kļūst vizuāli pamanāmi. Tradicionālās kontroles — periodiski alkometri un vizuālas uzraugu pārbaudes — ir periodiskas, invazīvas, rada šaurus punktus pie maiņu vārtiem un ir viegli apiet. Rezultāts ir operacionāla aklā zona: augsta riska stāvokļi paliek visgrūtāk nepārtraukti pārtveramie.

Balss ir ideāls signāls šīs plaisas novēršanai. Darbinieki dabiski izmanto Push-to-Talk radio, piekļūst domofoniem un balss saskarnēm visas maiņas laikā. Alkohols konsekventi maina akustisko biomehāniku — pasliktinot artikulācijas ātrumu, fonācijas laiku, prozodiju un spektrālo balss kvalitāti — biomarķieri, ko specializēts modelis iegūst no sekundēm audio.

SafeVoice tiek izvietots divās papildinošās arhitektūrās.

SafeVoice-Ref salīdzina reāllaika balsi ar darbinieka reģistrēto skaidrā stāvokļa bāzes līniju — ideāli piemērots piekļuves skrīningam maiņas sākumā.

SafeVoice-Solo darbojas zero-shot bez reģistrētas bāzes līnijas, novērtējot atsevišķus runas uzliesmojumus ikdienas radio sakaros visas maiņas laikā.

Atliktais testa sadalījums no German Alcohol Language Corpus, standarta publiskā etalona, vērtēts pēc unweighted average recall (UAR). Salīdzinājumi ar iepriekšējo mākslu izmanto per-window metriku — viens lēmums katram izteikumam, bez balsojuma — jo iepriekšējā māksla nebalso.

Ko mēs uzbūvējām

Runātāja relatīvā diferenciālā kodēšana

Tā vietā, lai klasificētu audio izolēti, SafeVoice-Ref salīdzina runu ar indivīda bāzes profilu. Starp-runātāju akustiskās dispersijas novēršana dod tūlītēju ~5 punktu pieaugumu Unweighted Average Recall (UAR) — mūsu ietekmīgākais arhitektūras pavērsiens.

Divu modeļu arhitektūras, vienots pazīmju steks

Gan Ref, gan Solo izmanto tās pašas zema līmeņa akustiskās reprezentācijas. SafeVoice-Ref maksimizē precizitāti ar ātru vienreizēju reģistrāciju, savukārt SafeVoice-Solo prioritizē nulles operacionālo berzi, skrīnējot jebkuru runātāju nekavējoties bez vēsturiskiem datiem.

Pilna pamata mugurkaula adaptācija

Standarta prakse iesaka sasaldēt iepriekš apmācītus mugurkaulus mazos korpusos. Mūsu empīriskie pētījumi pierādīja pretējo: skrīninga precizitāte pieauga līdz ar smalkās noregulēšanas dziļumu, lecot ~7 punktus pilnas gala-līdz-galam mugurkaula adaptācijas gadījumā salīdzinājumā ar daļēju slāņu sasaldēšanu.

Daudzskalu pazīmju apkopošana

Akustiskie biomarķieri pastāv dažādās laika izšķirtspējās. Zemākie mugurkaula slāņi saglabā smalkas artikulācijas un balss trakta dinamikas, savukārt augstākie slāņi modelē prozodisko plūsmu un frāzēšanas ritmu. Daudzlīmeņu saplūšana, kam seko uzmanīga apkopošana, dinamiski sver visdiagnostiskākos kadrus.

Smaga industriālā trokšņa mācību programmas

Mēs apgājām sintētisko balto troksni par labu plašām industriālām audio mācību programmām — smaga tehnika, transportlīdzekļu rūkoņa, apkārtējās pūļa čalas un strukturāla reverberācija. Tas novērsa veiktspējas plaisu skarbos lauka apstākļos, nepasliktinot tīro bāzes precizitāti.

Vairāku logu konsensa dekodēšana

Lai novērstu pārejošu smailu vai rīkles skrubināšanas izraisītus viltus trauksmes signālus, secinājumu cauruļvads vērtē vairākus pārklājošus analīzes logus katram izteikumam. Konsensa balsojuma piemērošana pievieno 1–2 punktus UAR un padara noteikšanu ārkārtīgi noturīgu pret reālās pasaules akustiskajām smailēm.

Izmērītie rezultāti

Pasliktināšanās dažādos akustiskos apstākļos

Konsensa UAR (MV@5), uz atsauci balstīts / bez atsauces. Publicēts, iekļaujot apstākļus, kur precizitāte krītas.

Kas sistēma ir — un kas nav

SafeVoice nemēra alkohola koncentrāciju asinīs un nevar kalpot par pamatu darbinieka atstādināšanai no pienākumiem. Tas ir pirmās līnijas skrīninga rīks, kas norāda, kurš ir pelnījis uzmanību, pārbaudei ar noteiktiem līdzekļiem. Attiecīgais salīdzinājums nav ar alkometru, bet gan ar šodien izmantoto alternatīvu: uzrauga novērojumu, kas darbojas aptuveni neapmācītas klausīšanās līmenī.

Visi rezultāti nāk no viena korpusa — German Alcohol Language Corpus, kas ierakstīts no 162 runātājiem ar katra runātāja asiņu un izelpas alkohola patieso vērtību. Tas ir atsauces etalons šim uzdevumam, taču tas ir viens korpuss, un katrs iepriekš minētais salīdzinājums ir veikts uz tā atdalītā testa sadalījuma.

Mēs publicējam apstākļus, kur precizitāte degradējas, līdzās galvenajiem rādītājiem, un mēs publicējam to, ko noraidījām: papildu emociju un asins-alkohola regresijas galvas (negatīvs efekts), daļēju mugurkaula iesaldēšanu (apmēram par septiņiem punktiem sliktāk), lēmuma sliekšņa regulēšanu (simptoma labojums 0,2 punktu vērtībā) un runātāja ieguluma kondicionēšanu bezatsauces modelim — patiess 0,6 punktu ieguvums, kas tika atmests, jo tas būtu prasījis katra lietotāja reģistrēšanu un iznīcinātu Solo nulles berzes priekšrocību.

Kā to lieto

Maiņas sākuma darba spējas pārbaude: īsa runāta reģistrēšanās pret reģistrētu bāzes līniju

Nepārtraukta pasīvā uzraudzība pār ikdienas radio satiksmi, bez reģistrēšanās

Kalibrēts karodziņš, kas novirzīts atbilstošajam uzraugam cilvēka lēmuma pieņemšanai

Darbojas uz CPU ar mazāk nekā vienu sekundi aizturi uz analīzes logu

Degradējas graciozi, kad demogrāfiskais konteksts nav pieejams

Parādīts caur XENOM platformu līdzās objekta citiem operacionālajiem signāliem