SafeVoice — egy saját fejlesztésű beszédintelligencia-motor, amely néhány másodpercnyi hétköznapi beszédből jelzi a valószínű alkoholos befolyásoltságot. Nem invazív, nulla speciális hardvert igényel, semmi másra nincs szükség, mint egy kimondott mondatra.
A befolyásolt állapotú személyzet továbbra is a megelőzhető ipari incidensek egyik vezető és alulműszerezett okozója. Az alkohol a reakciósebességet, a térbeli ítélőképességet és a finommotorikát már jóval azelőtt rontja, hogy a tünetek vizuálisan nyilvánvalóvá válnának. A hagyományos ellenőrzések — időszakos alkoholszondák és vizuális felügyelői ellenőrzések — szakaszosak, invazívak, szűk keresztmetszetek a műszakkapuknál, és könnyen kijátszhatók. Az eredmény egy üzemeltetési vakfolt: a magas kockázatú állapotokat a legnehezebb folyamatosan elfogni.
A hang az ideális jel ennek a résnek a megszüntetésére. A dolgozók természetesen használnak Push-to-Talk rádiókat, kaputelefonokat és hanginterfészeket a műszak során. Az alkohol következetesen megváltoztatja az akusztikus biomechanikát — rontja az artikulációs sebességet, a fonáció időzítését, a prozódiát és a spektrális hangminőséget —, olyan biomarkereket, amelyeket egy speciális modell másodperceknyi hangból kinyer.
A SafeVoice két kiegészítő architektúrában telepíthető.
A SafeVoice-Ref a valós idejű hangot a dolgozó regisztrált józan alapvonalához hasonlítja — ideális műszakkezdési beléptetési szűréshez.
A SafeVoice-Solo zero-shot módon, regisztrált alapvonal nélkül működik, és egyes beszédkitöréseket értékel a rutin rádiós kommunikáció során a műszak folyamán.
A German Alcohol Language Corpus, a szabványos nyilvános benchmark, kihagyott tesztrésze, súlyozatlan átlagos visszahívással (UAR) pontozva. A korábbi munkákkal való összehasonlítás az ablakonkénti metrikát használja — egyetlen döntés megnyilatkozásonként, szavazás nélkül —, mert a korábbi munkák nem szavaznak.
Ahelyett, hogy a hangot elszigetelten osztályoznánk, a SafeVoice-Ref a beszédet az egyén alapvonali profiljához viszonyítva értékeli. A beszélők közötti akusztikus variancia kiküszöbölése azonnali ~5 pontos javulást eredményez az Unweighted Average Recall (UAR) értékben — ez a legnagyobb hatású építészeti mérföldkövünk.
Mind a Ref, mind a Solo ugyanazokat az alacsony szintű akusztikus reprezentációkat használja. A SafeVoice-Ref a gyors egyszeri regisztráció révén maximalizálja a pontosságot, míg a SafeVoice-Solo a nulla üzemeltetési súrlódást helyezi előtérbe, és bármely beszélőt azonnal szűr, előzményadatok nélkül.
A bevett gyakorlat szerint az előtanított gerinchálózatokat kis korpuszokon le kell fagyasztani. Empirikus vizsgálataink az ellenkezőjét bizonyították: a szűrési pontosság a finomhangolás mélységével nőtt, ~7 pontot ugrott teljes végpontok közötti gerinchálózat-adaptáció esetén a részleges rétegfagyasztáshoz képest.
Az akusztikus biomarkerek eltérő időbeli felbontásokon léteznek. Az alacsonyabb gerinchálózati rétegek megtartják a finom artikulációs és hangcsatorna-dinamikát, míg a magasabb rétegek a prozódiai folyamatot és a frázisritmust modellezik. A többszintű fúzió, amelyet figyelmes összevonás követ, dinamikusan súlyozza a leginkább diagnosztikus képkockákat.
A szintetikus fehér zajt kiterjedt ipari hang tananyagok javára kerültük el — nehézgépek, járműzúgás, környezeti tömegzaj és szerkezeti visszhang. Ez megszüntette a teljesítménykülönbséget zord terepi körülmények között a tiszta alapvonali pontosság romlása nélkül.
Hogy a tranziens kiugrások vagy a torokköszörülés ne váltson ki téves riasztást, a következtetési folyamat több átfedő elemzési ablakot pontoz ki megnyilatkozásonként. A konszenzusos szavazás alkalmazása 1–2 pont UAR-t ad hozzá, és a detektálást rendkívül ellenállóvá teszi a valós akusztikus kiugrásokkal szemben.
Konszenzus UAR (MV@5), referencia-alapú / referencia-mentes. Közzétéve azokkal a feltételekkel együtt, ahol a pontosság csökken.
A SafeVoice nem méri a véralkohol-koncentrációt, és nem szolgálhat alapul a dolgozó munkából való kivonásához. Ez egy első vonalbeli szűrőeszköz, amely jelzi, kik igényelnek figyelmet, a megerősítéshez bevett módszerekkel. A releváns összehasonlítás nem az alkoholszondával, hanem a ma használt alternatívával való: a felügyelői megfigyeléssel, amely nagyjából a képzetlen hallgatás szintjén teljesít.
Minden eredmény egyetlen korpuszból származik — a German Alcohol Language Corpusból, amelyet 162 beszélőtől rögzítettek, személyenkénti vér- és leheletalkohol-alapigazsággal. Ez a referencia-benchmark ehhez a feladathoz, de egyetlen korpusz, és minden fenti összehasonlítás a visszatartott tesztrészen készült.
Közzétesszük azokat a feltételeket, ahol a pontosság romlik, a fő számok mellett, és közzétesszük, mit vetettünk el: kiegészítő érzelem- és véralkohol-regressziós fejek (negatív hatás), részleges gerinchálózat-fagyasztás (körülbelül hét ponttal rosszabb), döntési küszöb hangolása (tüneti javítás, 0,2 pontot ér), és beszélő-beágyazás kondicionálás a referencia-mentes modellhez — valódi 0,6 pontos nyereség, elvetve, mert felhasználónkénti regisztrációt igényelt volna, és megsemmisítette volna a Solo súrlódásmentes előnyét.
Műszakkezdési alkalmassági ellenőrzés: rövid hangos bejelentkezés egy regisztrált alapvonallal szemben
Folyamatos passzív megfigyelés a rutin rádióforgalom felett, regisztráció nélkül
Kalibrált jelzés az illetékes felügyelőhöz irányítva emberi döntéshez
CPU-n fut, elemzési ablakonként egy másodpercnél kisebb késleltetéssel
Kecsesen romlik, ha a demográfiai kontextus nem áll rendelkezésre
A XENOM platformon keresztül jelenik meg, a telephely egyéb működési jelei mellett