SafeVoice — vlastný rečovo-inteligenčný engine, ktorý označí pravdepodobné alkoholové ovplyvnenie z niekoľkých sekúnd bežnej reči. Neinvazívny, bez špecializovaného hardvéru, nevyžaduje nič viac než vyslovenú frázu.
Ovplyvnený personál zostáva hlavným a nedostatočne monitorovaným zdrojom predchádzateľných priemyselných incidentov. Alkohol zhoršuje reakčný čas, priestorový úsudok a jemnú motoriku dlho predtým, ako sa symptómy stanú vizuálne zjavnými. Tradičné kontroly — periodické alkohol testery a vizuálne kontroly nadriadeným — sú prerušované, invazívne, úzke miesta pri vstupných bránach a ľahko sa obchádzajú. Výsledkom je prevádzková slepá škvrna: vysoko rizikové stavy zostávajú najťažšie zachytiteľné nepretržite.
Hlas je ideálny signál na odstránenie tejto medzery. Pracovníci prirodzene používajú Push-to-Talk vysielačky, prístupové interkomy a hlasové rozhrania počas celej zmeny. Alkohol konzistentne mení akustickú biomechaniku — zhoršuje rýchlosť artikulácie, načasovanie fonácie, prozódiu a spektrálnu kvalitu hlasu — biomarkery, ktoré špecializovaný model extrahuje z niekoľkých sekúnd zvuku.
SafeVoice sa nasadzuje v dvoch komplementárnych architektúrach.
SafeVoice-Ref porovnáva hlas v reálnom čase s registrovanou triezvou základnou líniou pracovníka — ideálny na skríning prístupu na začiatku zmeny.
SafeVoice-Solo pracuje zero-shot bez registrovanej základnej línie a hodnotí jednotlivé rečové úseky počas bežnej rádiovej komunikácie v priebehu zmeny.
Vyčlenená testovacia časť German Alcohol Language Corpus, štandardného verejného benchmarku, hodnotená pomocou unweighted average recall (UAR). Porovnania s predchádzajúcim stavom techniky používajú metriku na okno — jedno rozhodnutie na prejav, bez hlasovania — pretože predchádzajúci stav techniky nehlasuje.
Namiesto izolovanej klasifikácie zvuku SafeVoice-Ref porovnáva reč s individuálnym profilom základnej línie. Odstránenie medzirečníkovej akustickej variability prináša okamžitý zisk približne 5 bodov v Unweighted Average Recall (UAR) — naše najvýznamnejšie architektonické míľniky.
Oba modely Ref aj Solo využívajú rovnaké nízkoúrovňové akustické reprezentácie. SafeVoice-Ref maximalizuje presnosť prostredníctvom rýchlej jednorazovej registrácie, zatiaľ čo SafeVoice-Solo uprednostňuje nulové prevádzkové trenie a skrínuje akéhokoľvek rečníka okamžite bez historických údajov.
Štandardná prax odporúča zmraziť predtrénované chrbtové siete na malých korpusoch. Naše empirické testy preukázali opak: presnosť skríningu rástla s hĺbkou doladenia, pričom pri plnej end-to-end adaptácii chrbtovej siete vyskočila približne o 7 bodov v porovnaní s čiastočným zmrazením vrstiev.
Akustické biomarkery existujú v rôznych časových rozlíšeniach. Nižšie vrstvy chrbtovej siete si zachovávajú jemnú artikulačnú a vokálnu dynamiku, zatiaľ čo vyššie vrstvy modelujú prozodický tok a rytmus frázovania. Viacúrovňová fúzia nasledovaná pozorným zlučovaním dynamicky váži najdiagnostickejšie snímky.
Obišli sme syntetický biely šum v prospech rozsiahlych priemyselných zvukových osnov — ťažké stroje, dunenie vozidiel, okolitý hovor davu a štrukturálny dozvuk. To uzavrelo výkonnostnú medzeru v náročných poľných podmienkach bez zhoršenia čistej základnej presnosti.
Aby sa zabránilo falošným poplachom z prechodných špičiek alebo odkašliavania, inferenčný reťazec hodnotí viacero prekrývajúcich sa analytických okien na každý prejav. Použitie konsenzuálneho hlasovania pridáva 1–2 body UAR a robí detekciu mimoriadne odolnou voči reálnym akustickým špičkám.
Konsenzuálne UAR (MV@5), s referenciou / bez referencie. Publikované vrátane podmienok, kde presnosť klesá.
SafeVoice nemeria koncentráciu alkoholu v krvi a nemôže slúžiť ako dôvod na odvolanie pracovníka z výkonu služby. Je to prvostupňový skríningový nástroj, ktorý naznačuje, kto si vyžaduje pozornosť, na overenie zavedenými prostriedkami. Relevantné porovnanie nie je s alkohol testerom, ale s dnes používanou alternatívou: pozorovaním nadriadeným, ktoré dosahuje približne úroveň neškoleného počúvania.
Všetky výsledky pochádzajú z jedného korpusu — German Alcohol Language Corpus, zaznamenaného od 162 rečníkov s per-speaker referenčnými hodnotami alkoholu v krvi a v dychu. Je to referenčný benchmark pre túto úlohu, ale je to jediný korpus a každé porovnanie vyššie je vykonané na jeho vyhradenej testovacej časti.
Zverejňujeme podmienky, pri ktorých presnosť klesá, spolu s hlavnými číslami, a zverejňujeme aj to, čo sme zamietli: pomocné hlavy pre emócie a regresiu alkoholu v krvi (negatívny efekt), čiastočné zmrazenie chrbtice (približne o sedem bodov horšie), ladenie rozhodovacieho prahu (oprava symptómu v hodnote 0,2 bodu) a podmienenie rečníckym embeddingom pre model bez referencie — skutočný zisk 0,6 bodu, vyradený, pretože by vyžadoval registráciu používateľa a zničil by výhodu nulového trenia systému Solo.
Kontrola spôsobilosti na začiatku zmeny: krátke hovorené prihlásenie oproti zaregistrovanej základnej línii
Nepretržité pasívne monitorovanie bežnej rádiovej prevádzky, bez registrácie
Kalibrované upozornenie smerované príslušnému nadriadenému na ľudské rozhodnutie
Beží na CPU s latenciou pod jednu sekundu na analytické okno
Degraduje elegantne, keď demografický kontext nie je k dispozícii
Sprístupnené prostredníctvom platformy XENOM spolu s ostatnými prevádzkovými signálmi lokality