SafeVoice — μια ιδιόκτητη μηχανή νοημοσύνης ομιλίας που επισημαίνει πιθανή μέθη από αλκοόλ από μερικά δευτερόλεπτα συνηθισμένης ομιλίας. Μη επεμβατική, μηδενικός εξειδικευμένος εξοπλισμός, δεν χρειάζεται τίποτα περισσότερο από μια προφορική φράση.
Το προσωπικό με μειωμένη ικανότητα παραμένει κύριος και υποεργαλειοποιημένος παράγοντας πρόκλησης προλήψιμων βιομηχανικών ατυχημάτων. Το αλκοόλ υποβαθμίζει την ταχύτητα αντίδρασης, τη χωρική κρίση και τον λεπτό κινητικό έλεγχο πολύ πριν τα συμπτώματα γίνουν οπτικά εμφανή. Οι παραδοσιακοί έλεγχοι — περιοδικά αλκοτέστ και οπτικοί έλεγχοι εποπτών — είναι διαλείποντες, επεμβατικοί, σημεία συμφόρησης στις πύλες βάρδιας και εύκολοι να παρακαμφθούν. Το αποτέλεσμα είναι ένα επιχειρησιακό τυφλό σημείο: οι καταστάσεις υψηλού κινδύνου παραμένουν οι πιο δύσκολες να αναχαιτιστούν συνεχώς.
Η φωνή είναι το ιδανικό σήμα για την εξάλειψη αυτού του κενού. Οι εργαζόμενοι χρησιμοποιούν φυσικά ασύρματα Push-to-Talk, ενδοεπικοινωνίες πρόσβασης και διεπαφές φωνής καθ' όλη τη βάρδιά τους. Το αλκοόλ μεταβάλλει με συνέπεια την ακουστική εμβιομηχανική — μειώνοντας την ταχύτητα άρθρωσης, τον συγχρονισμό φώνησης, την προσωδία και τη φασματική ποιότητα φωνής — βιοδείκτες που ένα εξειδικευμένο μοντέλο εξάγει από δευτερόλεπτα ήχου.
Το SafeVoice αναπτύσσεται σε δύο συμπληρωματικές αρχιτεκτονικές.
Το SafeVoice-Ref συγκρίνει τη φωνή σε πραγματικό χρόνο με το καταχωρημένο νηφάλιο βασικό προφίλ του εργαζομένου — ιδανικό για εξέταση πρόσβασης κατά την έναρξη βάρδιας.
Το SafeVoice-Solo λειτουργεί zero-shot χωρίς καταχωρημένο βασικό προφίλ, αξιολογώντας μεμονωμένες εκρήξεις ομιλίας κατά τη διάρκεια τακτικών ραδιοεπικοινωνιών καθ' όλη τη βάρδια.
Διαχωρισμένο σύνολο δοκιμής του Γερμανικού Σώματος Γλώσσας Αλκοόλ, το τυπικό δημόσιο σημείο αναφοράς, βαθμολογημένο με μη σταθμισμένη μέση ανάκληση (UAR). Οι συγκρίσεις με προηγούμενη τεχνική χρησιμοποιούν τη μετρική ανά παράθυρο — μία απόφαση ανά εκφώνηση, χωρίς ψηφοφορία — επειδή η προηγούμενη τεχνική δεν ψηφίζει.
Αντί να ταξινομεί τον ήχο μεμονωμένα, το SafeVoice-Ref συγκρίνει την ομιλία με το βασικό προφίλ του ατόμου. Η εξάλειψη της δια-ομιλητικής ακουστικής διακύμανσης αποφέρει άμεσο κέρδος ~5 μονάδων στη Μη Σταθμισμένη Μέση Ανάκληση (UAR) — το πιο σημαντικό αρχιτεκτονικό μας ορόσημο.
Τόσο το Ref όσο και το Solo αξιοποιούν τις ίδιες ακουστικές αναπαραστάσεις χαμηλού επιπέδου. Το SafeVoice-Ref μεγιστοποιεί την ακρίβεια μέσω γρήγορης μίας φοράς εγγραφής, ενώ το SafeVoice-Solo δίνει προτεραιότητα στη μηδενική επιχειρησιακή τριβή, εξετάζοντας οποιονδήποτε ομιλητή άμεσα χωρίς ιστορικά δεδομένα.
Η τυπική πρακτική προτείνει το πάγωμα των προεκπαιδευμένων βασικών μοντέλων σε μικρά σώματα δεδομένων. Οι εμπειρικές μας δοκιμές απέδειξαν το αντίθετο: η ακρίβεια εξέτασης κλιμακώθηκε με το βάθος λεπτομερούς ρύθμισης, με άλμα ~7 μονάδων υπό πλήρη προσαρμογή βασικού μοντέλου από άκρο σε άκρο σε σύγκριση με μερικό πάγωμα επιπέδων.
Οι ακουστικοί βιοδείκτες υπάρχουν σε διακριτές χρονικές αναλύσεις. Τα κατώτερα επίπεδα βασικού μοντέλου διατηρούν λεπτές δυναμικές άρθρωσης και φωνητικού σωλήνα, ενώ τα ανώτερα επίπεδα μοντελοποιούν την προσωδιακή ροή και τον ρυθμό φράσεων. Η πολυεπίπεδη σύντηξη ακολουθούμενη από προσεκτική ομαδοποίηση σταθμίζει δυναμικά τα πιο διαγνωστικά πλαίσια.
Παρακάμψαμε τον συνθετικό λευκό θόρυβο υπέρ εκτενών βιομηχανικών προγραμμάτων εκμάθησης ήχου — βαριά μηχανήματα, βουητό οχημάτων, περιβαλλοντική φλυαρία πλήθους και δομική αντήχηση. Αυτό έκλεισε το χάσμα απόδοσης σε σκληρές συνθήκες πεδίου χωρίς να υποβαθμίσει την καθαρή βασική ακρίβεια.
Για να αποφευχθεί η ενεργοποίηση ψευδών συναγερμών από παροδικές αιχμές ή καθαρισμό λαιμού, ο αγωγός εξαγωγής συμπερασμάτων βαθμολογεί πολλαπλά επικαλυπτόμενα παράθυρα ανάλυσης ανά εκφώνηση. Η εφαρμογή ψηφοφορίας συναίνεσης προσθέτει 1–2 μονάδες UAR και καθιστά την ανίχνευση εξαιρετικά ανθεκτική σε πραγματικές ακουστικές αιχμές.
Συναινετική UAR (MV@5), βάσει αναφοράς / χωρίς αναφορά. Δημοσιευμένο συμπεριλαμβανομένων των συνθηκών όπου η ακρίβεια πέφτει.
Το SafeVoice δεν μετρά τη συγκέντρωση αλκοόλ στο αίμα και δεν μπορεί να αποτελέσει λόγο απομάκρυνσης εργαζομένου από τα καθήκοντά του. Είναι ένα εργαλείο πρώτης γραμμής ελέγχου που υποδεικνύει ποιος χρήζει προσοχής, για επαλήθευση με καθιερωμένα μέσα. Η σχετική σύγκριση δεν είναι με αλκοολόμετρο αλλά με την εναλλακτική που χρησιμοποιείται σήμερα: την παρατήρηση από επόπτη, η οποία αποδίδει περίπου στο επίπεδο της μη εκπαιδευμένης ακρόασης.
Όλα τα αποτελέσματα προέρχονται από ένα σώμα δεδομένων — το German Alcohol Language Corpus, καταγεγραμμένο από 162 ομιλητές με πραγματικές τιμές αλκοόλ αίματος και εκπνοής ανά ομιλητή. Είναι το σημείο αναφοράς για αυτή την εργασία, αλλά είναι ένα μόνο σώμα δεδομένων, και κάθε παραπάνω σύγκριση γίνεται στο διαχωρισμένο υποσύνολο δοκιμής του.
Δημοσιεύουμε τις συνθήκες όπου η ακρίβεια υποβαθμίζεται δίπλα στα κύρια νούμερα, και δημοσιεύουμε όσα απορρίψαμε: βοηθητικές κεφαλές συναισθήματος και παλινδρόμησης αλκοόλ αίματος (αρνητική επίδραση), μερικό πάγωμα του βασικού μοντέλου (περίπου επτά μονάδες χειρότερα), ρύθμιση κατωφλιού απόφασης (μια συμπτωματική διόρθωση αξίας 0.2 μονάδων), και προετοιμασία με ενσωμάτωση ομιλητή για το μοντέλο χωρίς αναφορά — ένα πραγματικό κέρδος 0.6 μονάδων, που απορρίφθηκε επειδή θα απαιτούσε εγγραφή ανά χρήστη και θα κατέστρεφε το πλεονέκτημα μηδενικής τριβής του Solo.
Έλεγχος καταλληλότητας για εργασία στην έναρξη βάρδιας: μια σύντομη προφορική δήλωση έναντι καταχωρημένης βάσης αναφοράς
Συνεχής παθητική παρακολούθηση κατά τη διάρκεια συνήθους ραδιοεπικοινωνίας, χωρίς εγγραφή
Βαθμονομημένη ειδοποίηση που δρομολογείται στον κατάλληλο επόπτη για ανθρώπινη απόφαση
Λειτουργεί σε CPU με καθυστέρηση κάτω του ενός δευτερολέπτου ανά παράθυρο ανάλυσης
Υποβαθμίζεται ομαλά όταν το δημογραφικό πλαίσιο δεν είναι διαθέσιμο
Εμφανίζεται μέσω της πλατφόρμας XENOM δίπλα στα υπόλοιπα επιχειρησιακά σήματα του εργοταξίου