Akustická detekcia ovplyvnenia z hovoreného hlásenia

SafeVoice — vlastný rečovo-inteligenčný engine, ktorý označí pravdepodobné alkoholové ovplyvnenie z niekoľkých sekúnd bežnej reči. Neinvazívny, bez špecializovaného hardvéru, nevyžaduje nič viac než vyslovenú frázu.

Ovplyvnený personál zostáva hlavným a nedostatočne monitorovaným zdrojom predchádzateľných priemyselných incidentov. Alkohol zhoršuje reakčný čas, priestorový úsudok a jemnú motoriku dlho predtým, ako sa symptómy stanú vizuálne zjavnými. Tradičné kontroly — periodické alkohol testery a vizuálne kontroly nadriadeným — sú prerušované, invazívne, úzke miesta pri vstupných bránach a ľahko sa obchádzajú. Výsledkom je prevádzková slepá škvrna: vysoko rizikové stavy zostávajú najťažšie zachytiteľné nepretržite.

Hlas je ideálny signál na odstránenie tejto medzery. Pracovníci prirodzene používajú Push-to-Talk vysielačky, prístupové interkomy a hlasové rozhrania počas celej zmeny. Alkohol konzistentne mení akustickú biomechaniku — zhoršuje rýchlosť artikulácie, načasovanie fonácie, prozódiu a spektrálnu kvalitu hlasu — biomarkery, ktoré špecializovaný model extrahuje z niekoľkých sekúnd zvuku.

SafeVoice sa nasadzuje v dvoch komplementárnych architektúrach.

SafeVoice-Ref porovnáva hlas v reálnom čase s registrovanou triezvou základnou líniou pracovníka — ideálny na skríning prístupu na začiatku zmeny.

SafeVoice-Solo pracuje zero-shot bez registrovanej základnej línie a hodnotí jednotlivé rečové úseky počas bežnej rádiovej komunikácie v priebehu zmeny.

Vyčlenená testovacia časť German Alcohol Language Corpus, štandardného verejného benchmarku, hodnotená pomocou unweighted average recall (UAR). Porovnania s predchádzajúcim stavom techniky používajú metriku na okno — jedno rozhodnutie na prejav, bez hlasovania — pretože predchádzajúci stav techniky nehlasuje.

Čo sme vybudovali

Diferenciálny kódovací prístup relatívny voči rečníkovi

Namiesto izolovanej klasifikácie zvuku SafeVoice-Ref porovnáva reč s individuálnym profilom základnej línie. Odstránenie medzirečníkovej akustickej variability prináša okamžitý zisk približne 5 bodov v Unweighted Average Recall (UAR) — naše najvýznamnejšie architektonické míľniky.

Duálne modelové architektúry, jednotný príznakový zásobník

Oba modely Ref aj Solo využívajú rovnaké nízkoúrovňové akustické reprezentácie. SafeVoice-Ref maximalizuje presnosť prostredníctvom rýchlej jednorazovej registrácie, zatiaľ čo SafeVoice-Solo uprednostňuje nulové prevádzkové trenie a skrínuje akéhokoľvek rečníka okamžite bez historických údajov.

Plná adaptácia chrbticovej siete

Štandardná prax odporúča zmraziť predtrénované chrbtové siete na malých korpusoch. Naše empirické testy preukázali opak: presnosť skríningu rástla s hĺbkou doladenia, pričom pri plnej end-to-end adaptácii chrbtovej siete vyskočila približne o 7 bodov v porovnaní s čiastočným zmrazením vrstiev.

Viacškálová agregácia príznakov

Akustické biomarkery existujú v rôznych časových rozlíšeniach. Nižšie vrstvy chrbtovej siete si zachovávajú jemnú artikulačnú a vokálnu dynamiku, zatiaľ čo vyššie vrstvy modelujú prozodický tok a rytmus frázovania. Viacúrovňová fúzia nasledovaná pozorným zlučovaním dynamicky váži najdiagnostickejšie snímky.

Tréningové osnovy s ťažkým priemyselným hlukom

Obišli sme syntetický biely šum v prospech rozsiahlych priemyselných zvukových osnov — ťažké stroje, dunenie vozidiel, okolitý hovor davu a štrukturálny dozvuk. To uzavrelo výkonnostnú medzeru v náročných poľných podmienkach bez zhoršenia čistej základnej presnosti.

Konsenzuálne dekódovanie viacerých okien

Aby sa zabránilo falošným poplachom z prechodných špičiek alebo odkašliavania, inferenčný reťazec hodnotí viacero prekrývajúcich sa analytických okien na každý prejav. Použitie konsenzuálneho hlasovania pridáva 1–2 body UAR a robí detekciu mimoriadne odolnou voči reálnym akustickým špičkám.

Namerané výsledky

Degradácia v rôznych akustických podmienkach

Konsenzuálne UAR (MV@5), s referenciou / bez referencie. Publikované vrátane podmienok, kde presnosť klesá.

Čo systém je — a čo nie je

SafeVoice nemeria koncentráciu alkoholu v krvi a nemôže slúžiť ako dôvod na odvolanie pracovníka z výkonu služby. Je to prvostupňový skríningový nástroj, ktorý naznačuje, kto si vyžaduje pozornosť, na overenie zavedenými prostriedkami. Relevantné porovnanie nie je s alkohol testerom, ale s dnes používanou alternatívou: pozorovaním nadriadeným, ktoré dosahuje približne úroveň neškoleného počúvania.

Všetky výsledky pochádzajú z jedného korpusu — German Alcohol Language Corpus, zaznamenaného od 162 rečníkov s per-speaker referenčnými hodnotami alkoholu v krvi a v dychu. Je to referenčný benchmark pre túto úlohu, ale je to jediný korpus a každé porovnanie vyššie je vykonané na jeho vyhradenej testovacej časti.

Zverejňujeme podmienky, pri ktorých presnosť klesá, spolu s hlavnými číslami, a zverejňujeme aj to, čo sme zamietli: pomocné hlavy pre emócie a regresiu alkoholu v krvi (negatívny efekt), čiastočné zmrazenie chrbtice (približne o sedem bodov horšie), ladenie rozhodovacieho prahu (oprava symptómu v hodnote 0,2 bodu) a podmienenie rečníckym embeddingom pre model bez referencie — skutočný zisk 0,6 bodu, vyradený, pretože by vyžadoval registráciu používateľa a zničil by výhodu nulového trenia systému Solo.

Ako sa používa

Kontrola spôsobilosti na začiatku zmeny: krátke hovorené prihlásenie oproti zaregistrovanej základnej línii

Nepretržité pasívne monitorovanie bežnej rádiovej prevádzky, bez registrácie

Kalibrované upozornenie smerované príslušnému nadriadenému na ľudské rozhodnutie

Beží na CPU s latenciou pod jednu sekundu na analytické okno

Degraduje elegantne, keď demografický kontext nie je k dispozícii

Sprístupnené prostredníctvom platformy XENOM spolu s ostatnými prevádzkovými signálmi lokality