Akustická detekce zhoršeného stavu z mluveného hlášení

SafeVoice — proprietární engine pro řečovou inteligenci, který označuje pravděpodobnou přítomnost alkoholu z pouhých několika sekund běžné řeči. Neinvazivní, bez speciálního hardwaru, nepotřebuje nic víc než mluvenou frázi.

Personál se zhoršeným stavem zůstává hlavním a nedostatečně měřeným zdrojem preventabilních průmyslových incidentů. Alkohol zhoršuje reakční rychlost, prostorový úsudek a jemnou motoriku dlouho předtím, než se příznaky stanou vizuálně zjevnými. Tradiční kontroly — periodické dechové zkoušky a vizuální kontroly nadřízených — jsou přerušované, invazivní, vytvářejí úzká místa u bran směn a snadno se obcházejí. Výsledkem je provozní slepá skvrna: vysoce rizikové stavy zůstávají nejhůře průběžně zachytitelné.

Hlas je ideální signál k odstranění této mezery. Pracovníci přirozeně používají vysílačky Push-to-Talk, interkomy a hlasová rozhraní po celou směnu. Alkohol soustavně mění akustickou biomechaniku — zhoršuje rychlost artikulace, načasování fonace, prozódii a spektrální kvalitu hlasu — biomarkery, které specializovaný model extrahuje ze sekund zvuku.

SafeVoice se nasazuje ve dvou doplňkových architekturách.

SafeVoice-Ref porovnává hlas v reálném čase se zapsanou střízlivou základní linií pracovníka — ideální pro screening přístupu na začátku směny.

SafeVoice-Solo funguje bez referenční linie a hodnotí jednotlivé řečové úseky během běžné rádiové komunikace v průběhu směny.

Vyčleněný testovací split German Alcohol Language Corpus, standardního veřejného benchmarku, hodnocený neváženým průměrným recall (UAR). Srovnání s předchozím stavem poznání používá metriku na okno — jedno rozhodnutí na promluvu, bez hlasování — protože předchozí stav poznání nehlasuje.

Co jsme postavili

Diferenciální kódování relativní k mluvčímu

Místo izolované klasifikace zvuku porovnává SafeVoice-Ref řeč s individuálním profilem mluvčího. Eliminace akustické variance mezi mluvčími přináší okamžitý zisk ~5 bodů v neváženém průměrném recallu (UAR) — náš nejvýznamnější architektonický milník.

Dvě architektury modelů, jednotná sada příznaků

Ref i Solo využívají stejné nízkoúrovňové akustické reprezentace. SafeVoice-Ref maximalizuje přesnost rychlým jednorázovým zápisem, zatímco SafeVoice-Solo upřednostňuje nulové provozní tření a hodnotí jakéhokoli mluvčího okamžitě bez historických dat.

Plná adaptace páteřního modelu

Standardní praxe doporučuje zmrazit předtrénované páteřní modely na malých korpusech. Naše empirické testy prokázaly opak: přesnost screeningu rostla s hloubkou dolaďování a poskočila o ~7 bodů při plné end-to-end adaptaci páteřního modelu ve srovnání s částečným zmrazením vrstev.

Víceškálová agregace příznaků

Akustické biomarkery existují v různých časových rozlišeních. Nižší vrstvy páteřního modelu zachovávají jemnou dynamiku artikulace a hlasového traktu, zatímco vyšší vrstvy modelují prozodický tok a rytmus frázování. Víceúrovňová fúze následovaná pozorným sdružováním dynamicky váží nejvíce diagnostické snímky.

Učební plány s těžkým průmyslovým hlukem

Obešli jsme syntetický bílý šum ve prospěch rozsáhlých průmyslových zvukových korpusů — těžké stroje, dunění vozidel, okolní hluk davu a strukturální dozvuk. Tím se uzavřela výkonnostní mezera v náročných terénních podmínkách bez zhoršení přesnosti na čistých nahrávkách.

Konsenzuální dekódování s více okny

Aby se zabránilo falešným poplachům z přechodných špiček nebo odkašlávání, vyhodnocuje inferenční pipeline více překrývajících se oken na jednu promluvu. Aplikace konsenzuálního hlasování přidává 1–2 body UAR a činí detekci výjimečně odolnou vůči skutečným akustickým špičkám.

Naměřené výsledky

Zhoršení v různých akustických podmínkách

Konsenzuální UAR (MV@5), s referencí / bez reference. Publikováno včetně podmínek, kde přesnost klesá.

Co systém je — a co není

SafeVoice neměří koncentraci alkoholu v krvi a nemůže sloužit jako důvod k vyřazení pracovníka ze služby. Je to screeningový nástroj první linie, který ukazuje, kdo si zaslouží pozornost, k ověření zavedenými prostředky. Relevantní srovnání není s alkoholtesterem, ale s dnes používanou alternativou: pozorováním nadřízeným, které funguje zhruba na úrovni netrénovaného poslechu.

Všechny výsledky pocházejí z jednoho korpusu — German Alcohol Language Corpus, nahraného od 162 mluvčích s hodnotami alkoholu v krvi a dechu jednotlivých mluvčích jako referenční pravdou. Je to referenční benchmark pro tuto úlohu, ale je to jediný korpus a každé výše uvedené srovnání je provedeno na jeho vyčleněné testovací části.

Zveřejňujeme podmínky, za kterých přesnost klesá, spolu s hlavními čísly, a zveřejňujeme i to, co jsme odmítli: pomocné hlavy pro emoce a regresi alkoholu v krvi (negativní efekt), částečné zmrazení páteřní sítě (asi o sedm bodů horší), ladění rozhodovacího prahu (symptomatická oprava za 0,2 bodu) a podmínění speaker embeddingem pro model bez reference — skutečný zisk 0,6 bodu, zahozený, protože by vyžadoval registraci jednotlivých uživatelů a zničil by výhodu nulového tření modelu Solo.

Jak se používá

Kontrola způsobilosti na začátku směny: krátké hlasové přihlášení oproti registrované referenci

Průběžné pasivní monitorování běžného rádiového provozu bez registrace

Kalibrované upozornění předané příslušnému nadřízenému k lidskému rozhodnutí

Běží na CPU s latencí pod jednu sekundu na analytické okno

Degraduje elegantně, když demografický kontext není k dispozici

Zobrazuje se prostřednictvím platformy XENOM spolu s dalšími provozními signály pracoviště