SafeVoice — vlastiti govorno-inteligencijski pogon koji označava vjerojatnu alkoholnu oštećenost iz samo nekoliko sekundi običnog govora. Neinvazivan, bez specijaliziranog hardvera, ne treba ništa više od izgovorene fraze.
Oštećeno osoblje ostaje vodeći i nedovoljno instrumentiran uzrok spriječivih industrijskih incidenata. Alkohol degradira brzinu reakcije, prostorno prosuđivanje i finu motoriku mnogo prije nego što simptomi postanu vizualno vidljivi. Tradicionalne kontrole — povremeni alkotestovi i vizualne provjere nadzornika — povremene su, invazivne, uska grla na ulazima u smjene i lako ih je zaobići. Rezultat je operativna slijepa točka: visokorizična stanja ostaju najteža za kontinuirano presretanje.
Glas je idealan signal za uklanjanje ove praznine. Radnici prirodno koriste Push-to-Talk radije, interkome i glasovna sučelja tijekom smjene. Alkohol dosljedno mijenja akustičku biomehaniku — oštećujući brzinu artikulacije, vrijeme fonacije, prozodiju i spektralnu kvalitetu glasa — biomarkere koje specijalizirani model izvlači iz sekundi zvuka.
SafeVoice se implementira u dvije komplementarne arhitekture.
SafeVoice-Ref uspoređuje glas u stvarnom vremenu s pohranjenom trijeznom osnovom radnika — idealno za probir pri pristupu na početku smjene.
SafeVoice-Solo radi bez pohranjene osnove, procjenjujući pojedinačne govorne isječke tijekom rutinskih radio komunikacija kroz smjenu.
Izdvojeni testni dio German Alcohol Language Corpus-a, standardnog javnog mjerila, bodovan neponderiranim prosječnim opozivom (UAR). Usporedbe s prethodnim radovima koriste metriku po prozoru — jedna odluka po iskazu, bez glasovanja — jer prethodni radovi ne glasuju.
Umjesto klasificiranja zvuka izolirano, SafeVoice-Ref uspoređuje govor s osnovnim profilom pojedinca. Uklanjanje međugovorničke akustičke varijance daje neposredni dobitak od ~5 postotnih bodova u neponderiranom prosječnom opozivu (UAR) — naša najutjecajnija arhitektonska prekretnica.
I Ref i Solo koriste iste niskorazinske akustičke reprezentacije. SafeVoice-Ref maksimizira preciznost brzim jednokratnim upisom, dok SafeVoice-Solo prioritizira nulto operativno trenje, probirući bilo kojeg govornika odmah bez povijesnih podataka.
Standardna praksa sugerira zamrzavanje prethodno obučenih osnovnih modela na malim korpusima. Naša empirijska ispitivanja dokazala su suprotno: točnost probira skalirala je s dubinom finog podešavanja, skačući ~7 bodova pod potpunom end-to-end adaptacijom osnovnog modela u usporedbi s djelomičnim zamrzavanjem slojeva.
Akustički biomarkeri postoje na različitim vremenskim razlučivostima. Niži slojevi osnovnog modela zadržavaju finu artikulacijsku dinamiku i dinamiku vokalnog trakta, dok viši slojevi modeliraju prozodijski tok i ritam fraziranja. Fuzija na više razina praćena pažljivim objedinjavanjem dinamički ponderira najdijagnostičkije okvire.
Zaobišli smo sintetički bijeli šum u korist opsežnih industrijskih audio kurikuluma — teški strojevi, tutnjava vozila, ambijentalna gužva i strukturna reverberacija. Ovo je zatvorilo jaz u performansama u teškim terenskim uvjetima bez degradacije točnosti na čistoj osnovi.
Kako bi se spriječilo da prolazni skokovi ili kašljanje pokrenu lažne alarme, cjevovod zaključivanja boduje više preklapajućih prozora analize po iskazu. Primjena konsenzusnog glasovanja dodaje 1–2 boda UAR-a i čini detekciju iznimno otpornom na stvarne akustičke skokove.
Konsenzus UAR (MV@5), na temelju reference / bez reference. Objavljeno uključujući uvjete u kojima točnost pada.
SafeVoice ne mjeri koncentraciju alkohola u krvi i ne može poslužiti kao osnova za udaljavanje radnika s dužnosti. To je alat za probir prve linije koji ukazuje na to tko zaslužuje pozornost, radi provjere utvrđenim sredstvima. Relevantna usporedba nije s alkotestom nego s alternativom koja se danas koristi: promatranjem nadzornika, koje djeluje otprilike na razini neuvježbanog slušanja.
Svi rezultati dolaze iz jednog korpusa — njemačkog Alcohol Language Corpusa, snimljenog od 162 govornika uz stvarnu vrijednost alkohola u krvi i dahu po govorniku. To je referentno mjerilo za ovaj zadatak, ali to je jedan korpus i svaka gornja usporedba napravljena je na njegovom izdvojenom testnom dijelu.
Objavljujemo uvjete u kojima se točnost smanjuje zajedno s glavnim brojkama i objavljujemo što smo odbacili: pomoćne grane za emocije i regresiju alkohola u krvi (negativan učinak), djelomično zamrzavanje okosnice (oko sedam bodova lošije), podešavanje praga odluke (popravak simptoma vrijedan 0,2 boda) i uvjetovanje ugrađivanjem govornika za model bez reference — stvarni dobitak od 0,6 bodova, odbačen jer bi zahtijevao upis po korisniku i uništio prednost Solo bez trenja.
Provjera sposobnosti za rad na početku smjene: kratka izgovorena prijava u odnosu na upisanu osnovnu vrijednost
Kontinuirano pasivno praćenje rutinskog radijskog prometa, bez upisa
Kalibrirana zastavica proslijeđena odgovarajućem nadzorniku na ljudsku odluku
Radi na CPU-u s manje od jedne sekunde kašnjenja po prozoru analize
Gradi se postupno kada demografski kontekst nije dostupan
Prikazuje se kroz platformu XENOM zajedno s ostalim operativnim signalima gradilišta