აკუსტიკური ინტოქსიკაციის გამოვლენა სალაპარაკო შემოწმებიდან

SafeVoice — საკუთრივი მეტყველების ინტელექტის ძრავა, რომელიც მონიშნავს ალკოჰოლური ინტოქსიკაციის სავარაუდო ნიშნებს მხოლოდ რამდენიმე წამის ჩვეულებრივი მეტყველებიდან. არაინვაზიური, ნულოვანი სპეციალიზებული აპარატურით, მხოლოდ წარმოთქმული ფრაზაა საჭირო.

ინტოქსიკაციის მქონე პერსონალი რჩება წამყვან და არასაკმარისად ინსტრუმენტირებულ მამოძრავებლად თავიდან აცილებადი სამრეწველო ინციდენტებისა. ალკოჰოლი აქვეითებს რეაქციის სიჩქარეს, სივრცით განსჯას და წვრილ მოტორიკას სიმპტომების ვიზუალურად გამოჩენამდე დიდი ხნით ადრე. ტრადიციული კონტროლი — პერიოდული ალკოტესტერები და ვიზუალური ზედამხედველის შემოწმებები — წყვეტილია, ინვაზიურია, ბოსტნეულია ცვლის კარიბჭესთან და ადვილად გვერდის ავლით. შედეგი არის ოპერაციული ბრმა წერტილი: მაღალი რისკის მდგომარეობები რჩება ყველაზე რთულად უწყვეტად დასაჭერად.

ხმა არის იდეალური სიგნალი ამ ხარვეზის აღმოსაფხვრელად. მუშები ბუნებრივად იყენებენ Push-to-Talk რადიოებს, წვდებიან ინტერკომებსა და ხმოვან ინტერფეისებს მთელი ცვლის განმავლობაში. ალკოჰოლი თანმიმდევრულად ცვლის აკუსტიკურ ბიომექანიკას — აქვეითებს არტიკულაციის სიჩქარეს, ფონაციის დროითობას, პროსოდიასა და სპექტრულ ხმის ხარისხს — ბიომარკერებს, რომლებსაც სპეციალიზებული მოდელი გამოიტანს წამების აუდიოდან.

SafeVoice განლაგებულია ორ დამატებით არქიტექტურაში.

SafeVoice-Ref ადარებს რეალურ დროში ხმას მუშის რეგისტრირებულ ფხიზელ საბაზისო პროფილთან — იდეალურია ცვლის დაწყების წვდომის სკრინინგისთვის.

SafeVoice-Solo მუშაობს ნულოვანი შოთით, რეგისტრირებული საბაზისო პროფილის გარეშე, აფასებს მეტყველების ცალკეულ ბურსტებს რუტინული რადიო კომუნიკაციის დროს მთელი ცვლის განმავლობაში.

Held-out ტესტის გაყოფა German Alcohol Language Corpus-დან, სტანდარტული საჯარო ბენჩმარკი, შეფასებული unweighted average recall-ით (UAR). წინა ხელოვნებასთან შედარებები იყენებენ per-window მეტრიკას — ერთი გადაწყვეტილება თითო გამოთქმაზე, ხმის მიცემის გარეშე — რადგან წინა ხელოვნება არ იძლევა ხმას.

რა ავაშენეთ

მოსაუბრეზე დაფუძნებული დიფერენციალური კოდირება

აუდიოს იზოლირებულად კლასიფიკაციის ნაცვლად, SafeVoice-Ref ადარებს მეტყველებას ინდივიდის საბაზისო პროფილთან. მოსაუბრეებს შორის აკუსტიკური ვარიაციის აღმოფხვრა იძლევა დაუყოვნებლივ ~5-ქულიან მოგებას Unweighted Average Recall-ში (UAR) — ჩვენი ყველაზე მნიშვნელოვანი არქიტექტურული ეტაპი.

ორმაგი მოდელის არქიტექტურები, ერთიანი ფუნქციური სტეკი

ორივე Ref და Solo იყენებს ერთსა და იმავე დაბალი დონის აკუსტიკურ წარმოდგენებს. SafeVoice-Ref მაქსიმიზირებს სიზუსტეს სწრაფი ერთჯერადი რეგისტრაციით, ხოლო SafeVoice-Solo პრიორიტეტად ანიჭებს ნულოვან ოპერაციულ ხახუნს, ასკრინინგებს ნებისმიერ მოსაუბრეს დაუყოვნებლივ ისტორიული მონაცემების გარეშე.

სრული backbone ადაპტაცია

სტანდარტული პრაქტიკა გვთავაზობს წინასწარ გაწვრთნილი backbone-ების გაყინვას მცირე კორპუსებზე. ჩვენმა ემპირიულმა სვიპებმა საპირისპირო დაამტკიცა: სკრინინგის სიზუსტე იზრდებოდა წვრილად გაწვრთნის სიღრმესთან ერთად, ~7 ქულით გადახტა სრული end-to-end backbone ადაპტაციისას ნაწილობრივი ფენის გაყინვასთან შედარებით.

მრავალმასშტაბიანი ფუნქციური აგრეგაცია

აკუსტიკური ბიომარკერები არსებობს განსხვავებულ დროით გარჩევადობებზე. ქვედა backbone ფენები ინარჩუნებენ წვრილ არტიკულაციურ და ვოკალური ტრაქტის დინამიკას, ხოლო უმაღლესი ფენები მოდელირებენ პროსოდიულ დინებასა და ფრაზირების რიტმს. მრავალდონიანი შერწყმა და ყურადღებიანი პულინგი დინამიურად აწონის ყველაზე დიაგნოსტიკურ ფრეიმებს.

მძიმე სამრეწველო ხმაურის სასწავლო კურიკულუმები

ჩვენ გვერდი ავუარეთ სინთეზურ თეთრ ხმაურს ვრცელი სამრეწველო აუდიო კურიკულუმების სასარგებლოდ — მძიმე მანქანები, სატრანსპორტო გუგუნი, გარემო ბრბოს ლაპარაკი და სტრუქტურული რევერბერაცია. ამან დახურა შესრულების სხვაობა მკაცრ საველე პირობებში სუფთა საბაზისო სიზუსტის გაუარესების გარეშე.

მრავალფანჯრიანი კონსენსუსის დეკოდირება

იმისთვის, რომ გარდამავალმა მწვერვალებმა ან ყელის გაწმენდამ არ გამოიწვიოს ცრუ სიგნალიზაცია, ინფერენციის მილსადენი აფასებს მრავალ გადაფარვად საანალიზო ფანჯარას თითო გამოთქმაზე. კონსენსუსის ხმის მიცემა ამატებს 1–2 ქულას UAR-ში და ხდის გამოვლენას განსაკუთრებულად მდგრადს რეალურ აკუსტიკურ მწვერვალებზე.

გაზომილი შედეგები

დეგრადაცია აკუსტიკურ პირობებში

კონსენსუსის UAR (MV@5), საბაზისოზე დაფუძნებული / საბაზისოს გარეშე. გამოქვეყნებულია იმ პირობების ჩათვლით, სადაც სიზუსტე ეცემა.

რა არის სისტემა — და რა არ არის

SafeVoice არ ზომავს სისხლში ალკოჰოლის კონცენტრაციას და ვერ გახდება მუშაკის მოვალეობიდან ჩამოცილების საფუძველი. ეს არის პირველადი შემოწმების ინსტრუმენტი, რომელიც მიუთითებს, ვინ იმსახურებს ყურადღებას, დადგენილი საშუალებებით გადამოწმებისთვის. შესაბამისი შედარება არ არის ალკოტესტერთან, არამედ დღეს არსებულ ალტერნატივასთან: ზედამხედველის დაკვირვებასთან, რომელიც დაახლოებით დაუმუშავებელი მოსმენის დონეზე მუშაობს.

ყველა შედეგი მოდის ერთი კორპუსიდან — გერმანული ალკოჰოლური ენის კორპუსიდან, ჩაწერილი 162 მოსაუბრისგან, თითოეული მოსაუბრის სისხლში და ამოსუნთქვაში ალკოჰოლის საცნობარო მონაცემებით. ეს არის საცნობარო ბენჩმარკი ამ ამოცანისთვის, მაგრამ ეს არის ერთი კორპუსი, და ზემოთ მოცემული ყველა შედარება შესრულებულია მის გამოყოფილ სატესტო ნაწილზე.

ჩვენ ვაქვეყნებთ პირობებს, სადაც სიზუსტე უარესდება, მთავარ მაჩვენებლებთან ერთად, და ვაქვეყნებთ იმას, რაც უარვყავით: დამხმარე ემოციის და სისხლში ალკოჰოლის რეგრესიის სათავეები (უარყოფითი ეფექტი), ნაწილობრივი ხერხემლის გაყინვა (დაახლოებით შვიდი ქულით უარესი), გადაწყვეტილების ზღურბლის დაყენება (სიმპტომის გამოსწორება, ღირს 0.2 ქულა), და მოსაუბრის ემბედინგის კონდიცირება საცნობარო გარეშე მოდელისთვის — რეალური 0.6 ქულიანი მოგება, უარყოფილი, რადგან საჭიროებდა თითოეული მომხმარებლის რეგისტრაციას და გაანადგურებდა Solo-ს ნულოვანი ხახუნის უპირატესობას.

როგორ გამოიყენება

ცვლის დაწყების ვარგისიანობის შემოწმება: მოკლე ხმოვანი რეგისტრაცია ჩარიცხულ საბაზისო ნიმუშთან შედარებით

უწყვეტი პასიური მონიტორინგი რუტინულ რადიოტრაფიკზე, რეგისტრაციის გარეშე

კალიბრირებული სიგნალი, მიმართული შესაბამის ზედამხედველთან ადამიანური გადაწყვეტილებისთვის

მუშაობს CPU-ზე, ანალიზის თითოეულ ფანჯარაზე ერთ წამზე ნაკლები დაყოვნებით

ღირსეულად უარესდება, როცა დემოგრაფიული კონტექსტი მიუწვდომელია

გამოტანილია XENOM პლატფორმის მეშვეობით, საიტის სხვა ოპერაციულ სიგნალებთან ერთად