Akusztikus befolyásoltság-észlelés egy elhangzott bejelentkezésből

SafeVoice — egy saját fejlesztésű beszédintelligencia-motor, amely néhány másodpercnyi hétköznapi beszédből jelzi a valószínű alkoholos befolyásoltságot. Nem invazív, nulla speciális hardvert igényel, semmi másra nincs szükség, mint egy kimondott mondatra.

A befolyásolt állapotú személyzet továbbra is a megelőzhető ipari incidensek egyik vezető és alulműszerezett okozója. Az alkohol a reakciósebességet, a térbeli ítélőképességet és a finommotorikát már jóval azelőtt rontja, hogy a tünetek vizuálisan nyilvánvalóvá válnának. A hagyományos ellenőrzések — időszakos alkoholszondák és vizuális felügyelői ellenőrzések — szakaszosak, invazívak, szűk keresztmetszetek a műszakkapuknál, és könnyen kijátszhatók. Az eredmény egy üzemeltetési vakfolt: a magas kockázatú állapotokat a legnehezebb folyamatosan elfogni.

A hang az ideális jel ennek a résnek a megszüntetésére. A dolgozók természetesen használnak Push-to-Talk rádiókat, kaputelefonokat és hanginterfészeket a műszak során. Az alkohol következetesen megváltoztatja az akusztikus biomechanikát — rontja az artikulációs sebességet, a fonáció időzítését, a prozódiát és a spektrális hangminőséget —, olyan biomarkereket, amelyeket egy speciális modell másodperceknyi hangból kinyer.

A SafeVoice két kiegészítő architektúrában telepíthető.

A SafeVoice-Ref a valós idejű hangot a dolgozó regisztrált józan alapvonalához hasonlítja — ideális műszakkezdési beléptetési szűréshez.

A SafeVoice-Solo zero-shot módon, regisztrált alapvonal nélkül működik, és egyes beszédkitöréseket értékel a rutin rádiós kommunikáció során a műszak folyamán.

A German Alcohol Language Corpus, a szabványos nyilvános benchmark, kihagyott tesztrésze, súlyozatlan átlagos visszahívással (UAR) pontozva. A korábbi munkákkal való összehasonlítás az ablakonkénti metrikát használja — egyetlen döntés megnyilatkozásonként, szavazás nélkül —, mert a korábbi munkák nem szavaznak.

Amit építettünk

Beszélőhöz viszonyított differenciális kódolás

Ahelyett, hogy a hangot elszigetelten osztályoznánk, a SafeVoice-Ref a beszédet az egyén alapvonali profiljához viszonyítva értékeli. A beszélők közötti akusztikus variancia kiküszöbölése azonnali ~5 pontos javulást eredményez az Unweighted Average Recall (UAR) értékben — ez a legnagyobb hatású építészeti mérföldkövünk.

Kettős modellarchitektúrák, egységes jellemzőkészlet

Mind a Ref, mind a Solo ugyanazokat az alacsony szintű akusztikus reprezentációkat használja. A SafeVoice-Ref a gyors egyszeri regisztráció révén maximalizálja a pontosságot, míg a SafeVoice-Solo a nulla üzemeltetési súrlódást helyezi előtérbe, és bármely beszélőt azonnal szűr, előzményadatok nélkül.

Teljes gerinchálózat-adaptáció

A bevett gyakorlat szerint az előtanított gerinchálózatokat kis korpuszokon le kell fagyasztani. Empirikus vizsgálataink az ellenkezőjét bizonyították: a szűrési pontosság a finomhangolás mélységével nőtt, ~7 pontot ugrott teljes végpontok közötti gerinchálózat-adaptáció esetén a részleges rétegfagyasztáshoz képest.

Többskálájú jellemzőaggregáció

Az akusztikus biomarkerek eltérő időbeli felbontásokon léteznek. Az alacsonyabb gerinchálózati rétegek megtartják a finom artikulációs és hangcsatorna-dinamikát, míg a magasabb rétegek a prozódiai folyamatot és a frázisritmust modellezik. A többszintű fúzió, amelyet figyelmes összevonás követ, dinamikusan súlyozza a leginkább diagnosztikus képkockákat.

Nehéz ipari zaj tananyagok

A szintetikus fehér zajt kiterjedt ipari hang tananyagok javára kerültük el — nehézgépek, járműzúgás, környezeti tömegzaj és szerkezeti visszhang. Ez megszüntette a teljesítménykülönbséget zord terepi körülmények között a tiszta alapvonali pontosság romlása nélkül.

Többablakos konszenzusos dekódolás

Hogy a tranziens kiugrások vagy a torokköszörülés ne váltson ki téves riasztást, a következtetési folyamat több átfedő elemzési ablakot pontoz ki megnyilatkozásonként. A konszenzusos szavazás alkalmazása 1–2 pont UAR-t ad hozzá, és a detektálást rendkívül ellenállóvá teszi a valós akusztikus kiugrásokkal szemben.

Mért eredmények

Romlás akusztikus körülmények között

Konszenzus UAR (MV@5), referencia-alapú / referencia-mentes. Közzétéve azokkal a feltételekkel együtt, ahol a pontosság csökken.

Mi a rendszer — és mi nem

A SafeVoice nem méri a véralkohol-koncentrációt, és nem szolgálhat alapul a dolgozó munkából való kivonásához. Ez egy első vonalbeli szűrőeszköz, amely jelzi, kik igényelnek figyelmet, a megerősítéshez bevett módszerekkel. A releváns összehasonlítás nem az alkoholszondával, hanem a ma használt alternatívával való: a felügyelői megfigyeléssel, amely nagyjából a képzetlen hallgatás szintjén teljesít.

Minden eredmény egyetlen korpuszból származik — a German Alcohol Language Corpusból, amelyet 162 beszélőtől rögzítettek, személyenkénti vér- és leheletalkohol-alapigazsággal. Ez a referencia-benchmark ehhez a feladathoz, de egyetlen korpusz, és minden fenti összehasonlítás a visszatartott tesztrészen készült.

Közzétesszük azokat a feltételeket, ahol a pontosság romlik, a fő számok mellett, és közzétesszük, mit vetettünk el: kiegészítő érzelem- és véralkohol-regressziós fejek (negatív hatás), részleges gerinchálózat-fagyasztás (körülbelül hét ponttal rosszabb), döntési küszöb hangolása (tüneti javítás, 0,2 pontot ér), és beszélő-beágyazás kondicionálás a referencia-mentes modellhez — valódi 0,6 pontos nyereség, elvetve, mert felhasználónkénti regisztrációt igényelt volna, és megsemmisítette volna a Solo súrlódásmentes előnyét.

Hogyan használják

Műszakkezdési alkalmassági ellenőrzés: rövid hangos bejelentkezés egy regisztrált alapvonallal szemben

Folyamatos passzív megfigyelés a rutin rádióforgalom felett, regisztráció nélkül

Kalibrált jelzés az illetékes felügyelőhöz irányítva emberi döntéshez

CPU-n fut, elemzési ablakonként egy másodpercnél kisebb késleltetéssel

Kecsesen romlik, ha a demográfiai kontextus nem áll rendelkezésre

A XENOM platformon keresztül jelenik meg, a telephely egyéb működési jelei mellett