SafeVoice — patentēts runas intelekta dzinējs, kas atzīmē iespējamu alkohola reibumu tikai no dažām sekundēm parastas runas. Neinvazīvs, nulle specializētas aparatūras, nepieciešama tikai izrunāta frāze.
Reibumā esošs personāls joprojām ir vadošais un nepietiekami instrumentēts novēršamo industriālo incidentu cēlonis. Alkohols pasliktina reakcijas ātrumu, telpisko spriestspēju un smalko motoriku ilgi pirms simptomi kļūst vizuāli pamanāmi. Tradicionālās kontroles — periodiski alkometri un vizuālas uzraugu pārbaudes — ir periodiskas, invazīvas, rada šaurus punktus pie maiņu vārtiem un ir viegli apiet. Rezultāts ir operacionāla aklā zona: augsta riska stāvokļi paliek visgrūtāk nepārtraukti pārtveramie.
Balss ir ideāls signāls šīs plaisas novēršanai. Darbinieki dabiski izmanto Push-to-Talk radio, piekļūst domofoniem un balss saskarnēm visas maiņas laikā. Alkohols konsekventi maina akustisko biomehāniku — pasliktinot artikulācijas ātrumu, fonācijas laiku, prozodiju un spektrālo balss kvalitāti — biomarķieri, ko specializēts modelis iegūst no sekundēm audio.
SafeVoice tiek izvietots divās papildinošās arhitektūrās.
SafeVoice-Ref salīdzina reāllaika balsi ar darbinieka reģistrēto skaidrā stāvokļa bāzes līniju — ideāli piemērots piekļuves skrīningam maiņas sākumā.
SafeVoice-Solo darbojas zero-shot bez reģistrētas bāzes līnijas, novērtējot atsevišķus runas uzliesmojumus ikdienas radio sakaros visas maiņas laikā.
Atliktais testa sadalījums no German Alcohol Language Corpus, standarta publiskā etalona, vērtēts pēc unweighted average recall (UAR). Salīdzinājumi ar iepriekšējo mākslu izmanto per-window metriku — viens lēmums katram izteikumam, bez balsojuma — jo iepriekšējā māksla nebalso.
Tā vietā, lai klasificētu audio izolēti, SafeVoice-Ref salīdzina runu ar indivīda bāzes profilu. Starp-runātāju akustiskās dispersijas novēršana dod tūlītēju ~5 punktu pieaugumu Unweighted Average Recall (UAR) — mūsu ietekmīgākais arhitektūras pavērsiens.
Gan Ref, gan Solo izmanto tās pašas zema līmeņa akustiskās reprezentācijas. SafeVoice-Ref maksimizē precizitāti ar ātru vienreizēju reģistrāciju, savukārt SafeVoice-Solo prioritizē nulles operacionālo berzi, skrīnējot jebkuru runātāju nekavējoties bez vēsturiskiem datiem.
Standarta prakse iesaka sasaldēt iepriekš apmācītus mugurkaulus mazos korpusos. Mūsu empīriskie pētījumi pierādīja pretējo: skrīninga precizitāte pieauga līdz ar smalkās noregulēšanas dziļumu, lecot ~7 punktus pilnas gala-līdz-galam mugurkaula adaptācijas gadījumā salīdzinājumā ar daļēju slāņu sasaldēšanu.
Akustiskie biomarķieri pastāv dažādās laika izšķirtspējās. Zemākie mugurkaula slāņi saglabā smalkas artikulācijas un balss trakta dinamikas, savukārt augstākie slāņi modelē prozodisko plūsmu un frāzēšanas ritmu. Daudzlīmeņu saplūšana, kam seko uzmanīga apkopošana, dinamiski sver visdiagnostiskākos kadrus.
Mēs apgājām sintētisko balto troksni par labu plašām industriālām audio mācību programmām — smaga tehnika, transportlīdzekļu rūkoņa, apkārtējās pūļa čalas un strukturāla reverberācija. Tas novērsa veiktspējas plaisu skarbos lauka apstākļos, nepasliktinot tīro bāzes precizitāti.
Lai novērstu pārejošu smailu vai rīkles skrubināšanas izraisītus viltus trauksmes signālus, secinājumu cauruļvads vērtē vairākus pārklājošus analīzes logus katram izteikumam. Konsensa balsojuma piemērošana pievieno 1–2 punktus UAR un padara noteikšanu ārkārtīgi noturīgu pret reālās pasaules akustiskajām smailēm.
Konsensa UAR (MV@5), uz atsauci balstīts / bez atsauces. Publicēts, iekļaujot apstākļus, kur precizitāte krītas.
SafeVoice nemēra alkohola koncentrāciju asinīs un nevar kalpot par pamatu darbinieka atstādināšanai no pienākumiem. Tas ir pirmās līnijas skrīninga rīks, kas norāda, kurš ir pelnījis uzmanību, pārbaudei ar noteiktiem līdzekļiem. Attiecīgais salīdzinājums nav ar alkometru, bet gan ar šodien izmantoto alternatīvu: uzrauga novērojumu, kas darbojas aptuveni neapmācītas klausīšanās līmenī.
Visi rezultāti nāk no viena korpusa — German Alcohol Language Corpus, kas ierakstīts no 162 runātājiem ar katra runātāja asiņu un izelpas alkohola patieso vērtību. Tas ir atsauces etalons šim uzdevumam, taču tas ir viens korpuss, un katrs iepriekš minētais salīdzinājums ir veikts uz tā atdalītā testa sadalījuma.
Mēs publicējam apstākļus, kur precizitāte degradējas, līdzās galvenajiem rādītājiem, un mēs publicējam to, ko noraidījām: papildu emociju un asins-alkohola regresijas galvas (negatīvs efekts), daļēju mugurkaula iesaldēšanu (apmēram par septiņiem punktiem sliktāk), lēmuma sliekšņa regulēšanu (simptoma labojums 0,2 punktu vērtībā) un runātāja ieguluma kondicionēšanu bezatsauces modelim — patiess 0,6 punktu ieguvums, kas tika atmests, jo tas būtu prasījis katra lietotāja reģistrēšanu un iznīcinātu Solo nulles berzes priekšrocību.
Maiņas sākuma darba spējas pārbaude: īsa runāta reģistrēšanās pret reģistrētu bāzes līniju
Nepārtraukta pasīvā uzraudzība pār ikdienas radio satiksmi, bez reģistrēšanās
Kalibrēts karodziņš, kas novirzīts atbilstošajam uzraugam cilvēka lēmuma pieņemšanai
Darbojas uz CPU ar mazāk nekā vienu sekundi aizturi uz analīzes logu
Degradējas graciozi, kad demogrāfiskais konteksts nav pieejams
Parādīts caur XENOM platformu līdzās objekta citiem operacionālajiem signāliem