SafeVoice — un motor proprietar de inteligență vocală care semnalează afectarea alcoolică probabilă din doar câteva secunde de vorbire obișnuită. Non-invaziv, zero hardware specializat, necesitând doar o frază rostită.
Personalul afectat rămâne un factor principal și slab instrumentat al incidentelor industriale prevenibile. Alcoolul degradează viteza de reacție, judecata spațială și controlul motor fin cu mult înainte ca simptomele să devină vizibile. Controalele tradiționale — etiloteste periodice și verificări vizuale ale supraveghetorilor — sunt intermitente, invazive, blocaje la porțile de schimb și ușor de evitat. Rezultatul este un punct mort operațional: stările de risc ridicat rămân cele mai greu de interceptat continuu.
Vocea este semnalul ideal pentru a elimina acest gol. Muncitorii folosesc în mod natural radiouri Push-to-Talk, interfoane de acces și interfețe vocale pe tot parcursul schimbului. Alcoolul modifică constant biomecanica acustică — afectând viteza de articulare, sincronizarea fonației, prozodia și calitatea spectrală a vocii — biomarkeri pe care un model specializat îi extrage din secunde de audio.
SafeVoice se implementează în două arhitecturi complementare.
SafeVoice-Ref compară vocea în timp real cu linia de bază sobră înregistrată a muncitorului — ideal pentru screeningul de acces la începutul schimbului.
SafeVoice-Solo operează zero-shot, fără linie de bază înregistrată, evaluând secvențe unice de vorbire în timpul comunicațiilor radio de rutină pe tot parcursul schimbului.
Diviziune de test reținută din German Alcohol Language Corpus, benchmark-ul public standard, punctată prin unweighted average recall (UAR). Comparațiile cu arta anterioară folosesc metrica per fereastră — o singură decizie per rostire, fără vot — deoarece arta anterioară nu votează.
În loc să clasifice audio în mod izolat, SafeVoice-Ref compară vorbirea cu profilul de bază al individului. Eliminarea varianței acustice între vorbitori aduce un câștig imediat de aproximativ 5 puncte în Unweighted Average Recall (UAR) — cel mai important reper arhitectural al nostru.
Atât Ref cât și Solo folosesc aceleași reprezentări acustice de nivel scăzut. SafeVoice-Ref maximizează precizia printr-o înregistrare unică rapidă, în timp ce SafeVoice-Solo prioritizează frecare operațională zero, evaluând orice vorbitor imediat, fără date istorice.
Practica standard sugerează înghețarea coloanelor vertebrale pre-antrenate pe corpusuri mici. Studiile noastre empirice au dovedit contrariul: acuratețea screeningului a crescut odată cu adâncimea de ajustare fină, sărind cu aproximativ 7 puncte la adaptarea completă end-to-end a coloanei vertebrale, comparativ cu înghețarea parțială a straturilor.
Biomarkerii acustici există la rezoluții temporale distincte. Straturile inferioare ale coloanei vertebrale păstrează dinamica fină articulatorie și a tractului vocal, în timp ce straturile superioare modelează fluxul prozodic și ritmul frazării. Fuziunea pe mai multe niveluri, urmată de pooling atent, ponderă dinamic cadrele cele mai diagnostice.
Am evitat zgomotul alb sintetic în favoarea unor cursuri audio industriale extinse — mașini grele, zgomot de vehicule, murmur de mulțime ambientală și reverberație structurală. Acest lucru a închis decalajul de performanță în condiții dure de teren fără a degrada acuratețea de bază în condiții curate.
Pentru a împiedica vârfurile tranzitorii sau dresul vocii să declanșeze alarme false, pipeline-ul de inferență punctează mai multe ferestre de analiză suprapuse per rostire. Aplicarea votului prin consens adaugă 1–2 puncte de UAR și face detecția excepțional de rezistentă la vârfurile acustice din lumea reală.
UAR de consens (MV@5), bazat pe referință / fără referință. Publicat inclusiv cu condițiile în care acuratețea scade.
SafeVoice nu măsoară concentrația de alcool în sânge și nu poate servi drept temei pentru retragerea unui lucrător din activitate. Este un instrument de triere de primă linie care indică cine necesită atenție, pentru verificare prin metode consacrate. Comparația relevantă nu este cu un aparat etilotest, ci cu alternativa folosită în prezent: observarea de către supervizor, care se situează aproximativ la nivelul ascultării neinstruite.
Toate rezultatele provin dintr-un singur corpus — German Alcohol Language Corpus, înregistrat de la 162 de vorbitori cu valorile reale de referință pentru alcoolul din sânge și din respirație per vorbitor. Este etalonul de referință pentru această sarcină, dar este un singur corpus, iar fiecare comparație de mai sus este făcută pe secțiunea sa de test exlusă din antrenare.
Publicăm condițiile în care acuratețea scade alături de cifrele principale și publicăm ce am respins: capete auxiliare de emoție și regresie a alcoolemiei (efect negativ), înghețarea parțială a backbone-ului (cu aproximativ șapte puncte mai slab), ajustarea pragului de decizie (o remediere de simptom care valorează 0,2 puncte) și condiționarea cu înglobarea vorbitorului pentru modelul fără referință — un câștig real de 0,6 puncte, abandonat deoarece ar fi necesitat înrolarea fiecărui utilizator și ar fi distrus avantajul de frecare zero al Solo.
Verificare de aptitudine la începutul turei: o scurtă înregistrare vocală comparată cu o referință de bază înrolată
Monitorizare pasivă continuă asupra traficului radio de rutină, fără înrolare
O alertă calibrată direcționată către supervizorul corespunzător pentru o decizie umană
Rulează pe CPU cu mai puțin de o secundă latență per fereastră de analiză
Se degradează treptat atunci când contextul demografic este indisponibil
Afișat prin platforma XENOM alături de celelalte semnale operaționale ale șantierului