Το R&D του XENOM Επιτυγχάνει Κορυφαίες Επιδόσεις στη Μη Επεμβατική Φωνητική Ανίχνευση

Η ομιλία μεταφέρει περισσότερα από λέξεις. Η αλκοολική μέθη αφήνει μετρήσιμα ίχνη στην άρθρωση, τον ρυθμό και τη φασματική μικροδιακύμανση — σήματα που το ανθρώπινο αυτί καταγράφει στην καλύτερη περίπτωση αναξιόπιστα.

Η ομάδα R&D του XENOM έχει εκπαιδεύσει ένα ιδιόκτητο μοντέλο βαθιάς μάθησης για την ανίχνευση αυτών των ακουστικών βιοδεικτών και το έχει αξιολογήσει στο Alcohol Language Corpus, το καθιερωμένο δημόσιο σημείο αναφοράς για αυτήν την εργασία.

Με αυστηρή σύγκριση όμοιων μεγεθών — μη σταθμισμένος μέσος όρος ανάκλησης ανά παράθυρο, μία απόφαση ανά εκφώνηση χωρίς ψηφοφορία, ακριβώς όπως μετράται η προηγούμενη εργασία — η διαμόρφωση με αναφορά φτάνει το 86,3% UAR. Η διαμόρφωση χωρίς αναφορά, η οποία δεν απαιτεί καταχωρημένη βάση και αποφασίζει από ένα μόνο δείγμα ομιλίας, φτάνει το 81,9%. Στο σημείο λειτουργίας ανάπτυξης, όπου το σύστημα συνδυάζει πολλά παράθυρα μιας ηχογράφησης σε απόφαση συναίνεσης, αυτά αυξάνονται σε 87,6% και 82,5% αντίστοιχα.

Για πλαίσιο: η επίσημη βάση αναφοράς του Interspeech 2011 Speaker-State Challenge σε αυτό το σώμα κειμένων βρίσκεται στο 65,9% UAR, τα προηγούμενα δημοσιευμένα κορυφαία αποτελέσματα κορυφώνονται περίπου στο 73–75%, και μη εκπαιδευμένοι ανθρώπινοι ακροατές βαθμολογούν περίπου 60–65%.

Το σύστημα λειτουργεί ως παθητικό επίπεδο πάνω από τη συνήθη ραδιοεπικοινωνία. Οι εργαζόμενοι μιλούν όπως πάντα· καμία πρόσθετη διαδικασία, καμία διακοπή της εργασίας, κανένα ξεχωριστό σημείο ελέγχου.

Τι είναι το σύστημα — και τι δεν είναι. Δεν μετρά τη συγκέντρωση αλκοόλ στο αίμα και δεν μπορεί να χρησιμεύσει ως λόγος απομάκρυνσης εργαζομένου από τα καθήκοντά του. Είναι εργαλείο διαλογής πρώτης γραμμής που υποδεικνύει ποιοι χρήζουν προσοχής, για επαλήθευση με καθιερωμένα μέσα. Η σχετική σύγκριση δεν είναι με αλκοολόμετρο, αλλά με την εναλλακτική που χρησιμοποιείται σήμερα: την παρατήρηση από επόπτη, η οποία αποδίδει περίπου στο επίπεδο της μη εκπαιδευμένης ακρόασης.

Έχουμε δημοσιεύσει πλήρη αποτελέσματα σε διάφορες ακουστικές συνθήκες — συμπεριλαμβανομένων εκείνων όπου η ακρίβεια υποβαθμίζεται — μαζί με τις επιφυλάξεις συγκρισιμότητας και τους γνωστούς περιορισμούς της μεθόδου.