Akustinis apsvaigimo aptikimas iš pasakyto prisistatymo

SafeVoice — patentuotas kalbos intelekto variklis, pažymintis tikėtiną alkoholio apsvaigimą vos iš kelių sekundžių įprastos kalbos. Neinvazinis, nereikalaujantis jokios specializuotos įrangos, tereikia ištartos frazės.

Apsvaigęs personalas išlieka pagrindine ir nepakankamai stebima išvengiamų pramoninių incidentų priežastimi. Alkoholis blogina reakcijos greitį, erdvinį vertinimą ir smulkiąją motoriką dar ilgai prieš tai, kai simptomai tampa vizualiai pastebimi. Tradicinės kontrolės priemonės — periodiniai alkotesteriai ir vizualiniai prižiūrėtojų patikrinimai — yra epizodinės, invazinės, sukelia kliūtis prie pamainos vartų ir lengvai apeinamos. Rezultatas — veiklos akloji zona: didelės rizikos būsenas nuolat perimti sunkiausia.

Balsas yra idealus signalas šiam tarpui panaikinti. Darbuotojai visos pamainos metu natūraliai naudoja „Push-to-Talk“ radijo imtuvus, domofonus ir balso sąsajas. Alkoholis nuosekliai keičia akustinę biomechaniką — blogina artikuliacijos greitį, fonacijos laiką, prozodiją ir spektrinę balso kokybę — biomarkeriai, kuriuos specializuotas modelis išgauna iš kelių sekundžių garso.

SafeVoice diegiamas dviem papildomomis architektūromis.

SafeVoice-Ref lygina realaus laiko balsą su darbuotojo užregistruotu blaiviu baziniu profiliu — idealiai tinka prieigos prie pamainos pradžios patikrai.

SafeVoice-Solo veikia be pradinio apmokymo, be užregistruoto bazinio profilio, vertindamas pavienes kalbos atkarpas įprastų radijo pokalbių metu visos pamainos metu.

Atidėtas testinis Vokiečių alkoholio kalbos korpuso padalinys, standartinis viešas etalonas, vertinamas nesvertiniu vidutiniu atšaukimu (UAR). Palyginimai su ankstesniais darbais naudoja vieno lango metriką — vienas sprendimas pasakymui, be balsavimo — nes ankstesni darbai nebalsuoja.

Ką mes sukūrėme

Nuo kalbėtojo priklausomas diferencinis kodavimas

Užuot klasifikavęs garsą atskirai, SafeVoice-Ref lygina kalbą su asmens baziniu profiliu. Pašalinus tarpkalbėtojų akustinę dispersiją, gaunamas nedelsiamas ~5 punktų prieaugis prie nesvertinio vidutinio atšaukimo (UAR) — mūsų svarbiausias architektūrinis etapas.

Dvi modelių architektūros, vieningas požymių rinkinys

Ir Ref, ir Solo naudoja tuos pačius žemo lygio akustinius vaizdus. SafeVoice-Ref maksimizuoja tikslumą greitu vienkartiniu registravimu, o SafeVoice-Solo teikia pirmenybę nulinei veiklos trinčiai, tikrindamas bet kurį kalbėtoją nedelsiant, be istorinių duomenų.

Viso pagrindinio modelio pritaikymas

Įprasta praktika siūlo užšaldyti iš anksto apmokytus pagrindinius modelius mažuose duomenų rinkiniuose. Mūsų empiriniai tyrimai įrodė priešingai: patikros tikslumas augo didėjant derinimo gyliui, šoktelėdamas ~7 punktais visiškai pritaikant pagrindinį modelį nuo galo iki galo, palyginti su daliniu sluoksnių užšaldymu.

Daugiaskalė požymių agregacija

Akustiniai biomarkeriai egzistuoja skirtingose laikinėse skiriamosiose gebose. Žemesni pagrindinio modelio sluoksniai išlaiko smulkią artikuliacijos ir balso trakto dinamiką, o aukštesni sluoksniai modeliuoja prozodinį srautą ir frazavimo ritmą. Daugialypė sintezė ir dėmesingas telkimas dinamiškai sveria diagnostiškiausius kadrus.

Sunkiojo pramoninio triukšmo mokymo programos

Aplenkėme sintetinį baltąjį triukšmą ir pasirinkome plačias pramoninio garso mokymo programas — sunkiąją techniką, transporto priemonių dundesį, aplinkos minios šurmulį ir konstrukcinį aidėjimą. Tai panaikino veiklos atotrūkį atšiauriomis lauko sąlygomis, nesumažinant švaraus bazinio tikslumo.

Kelių langų konsensuso dekodavimas

Kad trumpalaikiai šuoliai ar gerklės valymas nesukeltų klaidingų aliarmų, išvadų konvejeris vertina kelis persidengiančius analizės langus kiekvienam pasakymui. Konsensuso balsavimo taikymas prideda 1–2 UAR punktus ir daro aptikimą išskirtinai atsparų realaus pasaulio akustiniams šuoliams.

Išmatuoti rezultatai

Tikslumo kritimas įvairiomis akustinėmis sąlygomis

Konsensuso UAR (MV@5), su baziniu profiliu / be jo. Skelbiama įskaitant sąlygas, kuriomis tikslumas krinta.

Kas sistema yra — ir kas nėra

SafeVoice nematuoja alkoholio koncentracijos kraujyje ir negali būti pagrindas nušalinti darbuotoją nuo pareigų. Tai pirmos eilės atrankos įrankis, nurodantis, kam reikia dėmesio, o patikrinimas atliekamas nustatytais būdais. Svarbus palyginimas ne su alkotesteriu, o su šiandien naudojama alternatyva: vadovo stebėjimu, kuris veikia maždaug neapmokyto klausymo lygiu.

Visi rezultatai gauti iš vieno tekstyno — German Alcohol Language Corpus, įrašyto iš 162 kalbėtojų, kiekvienam kalbėtojui turint kraujo ir iškvepiamo oro alkoholio pamatinius duomenis. Tai šios užduoties etaloninis tekstynas, tačiau jis yra vienintelis, ir visi aukščiau pateikti palyginimai atlikti naudojant jo atidėtąją testavimo dalį.

Skelbiame sąlygas, kuriomis tikslumas blogėja, kartu su pagrindiniais rodikliais, taip pat skelbiame, ką atmetėme: papildomas emocijų ir alkoholio koncentracijos kraujyje regresijos galvutes (neigiamas poveikis), dalinį pagrindo įšaldymą (apie septyniais punktais blogiau), sprendimo slenksčio derinimą (simptominis pataisymas, vertas 0,2 punkto) ir kalbėtojo įterpinių sąlygojimą modeliui be pamatinio įrašo — tikras 0,6 punkto prieaugis, atmestas, nes būtų reikėjęs kiekvieno vartotojo registracijos ir sunaikinęs Solo nulinės trinties pranašumą.

Kaip tai naudojama

Pasirengimo darbui patikra pamainos pradžioje: trumpas balsu pasakytas prisijungimas pagal užregistruotą pradinį įrašą

Nuolatinis pasyvus stebėjimas įprasto radijo eterio metu, be registracijos

Kalibruotas įspėjimas, perduodamas atitinkamam vadovui žmogiškam sprendimui priimti

Veikia centriniame procesoriuje, analizės lango delsa mažesnė nei viena sekundė

Palaipsniui blogėja, kai demografinis kontekstas neprieinamas

Pateikiama per XENOM platformą kartu su kitais objekto veiklos signalais