സംസാരിച്ച ചെക്ക്-ഇന്നിൽ നിന്നുള്ള അക്കോസ്റ്റിക് ദുർബലത കണ്ടെത്തൽ

SafeVoice — കുറച്ച് സെക്കൻഡ് സാധാരണ സംസാരത്തിൽ നിന്ന് സാധ്യതയുള്ള മദ്യപാന ദുർബലത ഫ്ലാഗ് ചെയ്യുന്ന ഒരു പ്രൊപ്രൈറ്ററി സ്പീച്ച്-ഇന്റലിജൻസ് എഞ്ചിൻ. നോൺ-ഇൻവേസീവ്, സീറോ പ്രത്യേക ഹാർഡ്വെയർ, സംസാരിച്ച ഒരു വാക്യം മതി.

ദുർബലരായ ഉദ്യോഗസ്ഥർ തടയാവുന്ന വ്യാവസായിക സംഭവങ്ങളുടെ പ്രധാനവും ഉപകരണങ്ങൾ കുറവുള്ളതുമായ കാരണമായി തുടരുന്നു. ലക്ഷണങ്ങൾ ദൃശ്യമാകുന്നതിന് വളരെ മുമ്പേ മദ്യം പ്രതികരണ വേഗത, സ്പേഷ്യൽ വിലയിരുത്തൽ, സൂക്ഷ്മ ചലന നിയന്ത്രണം എന്നിവയെ തകരാറിലാക്കുന്നു. പരമ്പരാഗത നിയന്ത്രണങ്ങൾ — ഇടയ്ക്കിടെയുള്ള ബ്രീത്തലൈസറുകളും ദൃശ്യ സൂപ്പർവൈസർ പരിശോധനകളും — ഇടയ്ക്കിടെയുള്ളതും, ആക്രമണാത്മകവും, ഷിഫ്റ്റ് ഗേറ്റുകളിൽ തടസ്സങ്ങളും, ഒഴിവാക്കാൻ എളുപ്പവുമാണ്. ഫലം ഒരു പ്രവർത്തന അന്ധ മേഖലയാണ്: ഉയർന്ന അപകടസാധ്യതയുള്ള അവസ്ഥകൾ തുടർച്ചയായി തടയാൻ ഏറ്റവും ബുദ്ധിമുട്ടായി തുടരുന്നു.

ഈ വിടവ് ഇല്ലാതാക്കാൻ ശബ്ദമാണ് അനുയോജ്യമായ സിഗ്നൽ. തൊഴിലാളികൾ സ്വാഭാവികമായും പുഷ്-ടു-ടോക്ക് റേഡിയോകൾ, ആക്സസ് ഇന്റർകോമുകൾ, വോയ്സ് ഇന്റർഫേസുകൾ എന്നിവ ഷിഫ്റ്റിലുടനീളം ഉപയോഗിക്കുന്നു. മദ്യം സ്ഥിരമായി അക്കോസ്റ്റിക് ബയോമെക്കാനിക്സിനെ മാറ്റുന്നു — ഉച്ചാരണ വേഗത, ഫോണേഷൻ സമയം, പ്രോസഡി, സ്പെക്ട്രൽ ശബ്ദ ഗുണനിലവാരം എന്നിവയെ തകരാറിലാക്കുന്നു — കുറച്ച് സെക്കൻഡ് ഓഡിയോയിൽ നിന്ന് ഒരു പ്രത്യേക മോഡൽ വേർതിരിച്ചെടുക്കുന്ന ബയോമാർക്കറുകൾ.

SafeVoice രണ്ട് പരസ്പരപൂരക ആർക്കിടെക്ചറുകളിൽ വിന്യസിക്കുന്നു.

SafeVoice-Ref തത്സമയ ശബ്ദത്തെ തൊഴിലാളിയുടെ എൻറോൾ ചെയ്ത സോബർ ബേസ്ലൈനുമായി താരതമ്യം ചെയ്യുന്നു — ഷിഫ്റ്റ്-സ്റ്റാർട്ട് ആക്സസ് സ്ക്രീനിംഗിന് അനുയോജ്യം.

SafeVoice-Solo എൻറോൾ ചെയ്ത ബേസ്ലൈനില്ലാതെ സീറോ-ഷോട്ടായി പ്രവർത്തിക്കുന്നു, ഷിഫ്റ്റിലുടനീളം സാധാരണ റേഡിയോ ആശയവിനിമയങ്ങളിൽ ഒറ്റ സംസാര ബർസ്റ്റുകൾ വിലയിരുത്തുന്നു.

ജർമ്മൻ ആൽക്കഹോൾ ലാംഗ്വേജ് കോർപ്പസിന്റെ ഹെൽഡ്-ഔട്ട് ടെസ്റ്റ് സ്പ്ലിറ്റ്, സ്റ്റാൻഡേർഡ് പബ്ലിക് ബെഞ്ച്മാർക്ക്, അൺവെയ്റ്റഡ് ആവറേജ് റീകോൾ (UAR) ഉപയോഗിച്ച് സ്കോർ ചെയ്തത്. മുൻകാല കലയുമായുള്ള താരതമ്യങ്ങൾ പെർ-വിൻഡോ മെട്രിക് ഉപയോഗിക്കുന്നു — ഓരോ ഉച്ചാരണത്തിനും ഒരൊറ്റ തീരുമാനം, വോട്ടിംഗ് ഇല്ല — കാരണം മുൻകാല കല വോട്ട് ചെയ്യുന്നില്ല.

ഞങ്ങൾ നിർമ്മിച്ചത്

സ്പീക്കർ-ആപേക്ഷിക ഡിഫറൻഷ്യൽ എൻകോഡിംഗ്

ഓഡിയോ ഒറ്റയ്ക്ക് വർഗ്ഗീകരിക്കുന്നതിന് പകരം, SafeVoice-Ref വ്യക്തിയുടെ ബേസ്ലൈൻ പ്രൊഫൈലിനെതിരെ സംസാരം മാനദണ്ഡമാക്കുന്നു. ഇന്റർ-സ്പീക്കർ അക്കോസ്റ്റിക് വ്യത്യാസം ഇല്ലാതാക്കുന്നത് അൺവെയ്റ്റഡ് ആവറേജ് റീകോൾ (UAR)-ൽ ഏകദേശം 5 പോയിന്റ് ഉടനടി നേട്ടം നൽകുന്നു — ഞങ്ങളുടെ ഏറ്റവും സ്വാധീനമുള്ള ആർക്കിടെക്ചറൽ നാഴികക്കല്ല്.

ഇരട്ട മോഡൽ ആർക്കിടെക്ചറുകൾ, ഏകീകൃത ഫീച്ചർ സ്റ്റാക്ക്

Ref, Solo എന്നിവ ഒരേ ലോ-ലെവൽ അക്കോസ്റ്റിക് പ്രതിനിധാനങ്ങൾ പ്രയോജനപ്പെടുത്തുന്നു. SafeVoice-Ref ദ്രുത ഒറ്റത്തവണ എൻറോൾമെന്റിലൂടെ കൃത്യത പരമാവധിയാക്കുന്നു, SafeVoice-Solo ചരിത്ര ഡാറ്റയില്ലാതെ ഏത് സ്പീക്കറെയും ഉടൻ സ്ക്രീൻ ചെയ്ത് സീറോ പ്രവർത്തന ഘർഷണത്തിന് മുൻഗണന നൽകുന്നു.

പൂർണ്ണ ബാക്ക്ബോൺ അഡാപ്റ്റേഷൻ

ചെറിയ കോർപ്പറകളിൽ പ്രീ-ട്രെയിൻഡ് ബാക്ക്ബോണുകൾ ഫ്രീസ് ചെയ്യാൻ സ്റ്റാൻഡേർഡ് പ്രാക്ടീസ് നിർദ്ദേശിക്കുന്നു. ഞങ്ങളുടെ അനുഭവ സ്വീപ്പുകൾ വിപരീതമാണ് തെളിയിച്ചത്: ഭാഗിക ലെയർ ഫ്രീസിംഗിനെ അപേക്ഷിച്ച് പൂർണ്ണ എൻഡ്-ടു-എൻഡ് ബാക്ക്ബോൺ അഡാപ്റ്റേഷനിൽ സ്ക്രീനിംഗ് കൃത്യത ഫൈൻ-ട്യൂണിംഗ് ആഴത്തിനൊപ്പം ഏകദേശം 7 പോയിന്റ് കുതിച്ചുയർന്നു.

മൾട്ടി-സ്കെയിൽ ഫീച്ചർ അഗ്രഗേഷൻ

അക്കോസ്റ്റിക് ബയോമാർക്കറുകൾ വ്യത്യസ്ത താൽക്കാലിക റെസല്യൂഷനുകളിൽ നിലനിൽക്കുന്നു. താഴ്ന്ന ബാക്ക്ബോൺ ലെയറുകൾ സൂക്ഷ്മമായ ഉച്ചാരണ, വോക്കൽ ട്രാക്റ്റ് ചലനങ്ങൾ നിലനിർത്തുന്നു, ഉയർന്ന ലെയറുകൾ പ്രോസഡിക് ഫ്ലോയും വാക്യ താളവും മോഡൽ ചെയ്യുന്നു. മൾട്ടി-ലെവൽ ഫ്യൂഷനും തുടർന്നുള്ള ശ്രദ്ധാപൂർവ്വമായ പൂളിംഗും ഏറ്റവും രോഗനിർണയ മൂല്യമുള്ള ഫ്രെയിമുകളെ ചലനാത്മകമായി വെയ്റ്റ് ചെയ്യുന്നു.

കനത്ത വ്യാവസായിക ശബ്ദ പാഠ്യപദ്ധതികൾ

കൃത്രിമ വൈറ്റ് നോയ്സിന് പകരം വിപുലമായ വ്യാവസായിക ഓഡിയോ പാഠ്യപദ്ധതികൾ ഉപയോഗിച്ചു — കനത്ത യന്ത്രങ്ങൾ, വാഹന മുഴക്കം, ആംബിയന്റ് ജനക്കൂട്ട സംസാരം, ഘടനാപരമായ പ്രതിധ്വനി. ശുദ്ധമായ ബേസ്ലൈൻ കൃത്യത കുറയ്ക്കാതെ കഠിനമായ ഫീൽഡ് അവസ്ഥകളിലെ പ്രകടന വിടവ് ഇത് അടച്ചു.

മൾട്ടി-വിൻഡോ കൺസെൻസസ് ഡീകോഡിംഗ്

ക്ഷണികമായ സ്പൈക്കുകളോ തൊണ്ട വൃത്തിയാക്കലോ തെറ്റായ അലാറങ്ങൾ സൃഷ്ടിക്കാതിരിക്കാൻ, ഇൻഫറൻസ് പൈപ്പ്ലൈൻ ഓരോ ഉച്ചാരണത്തിനും ഒന്നിലധികം ഓവർലാപ്പിംഗ് വിശകലന വിൻഡോകൾ സ്കോർ ചെയ്യുന്നു. കൺസെൻസസ് വോട്ടിംഗ് പ്രയോഗിക്കുന്നത് 1–2 പോയിന്റ് UAR ചേർക്കുകയും യഥാർത്ഥ ലോക അക്കോസ്റ്റിക് സ്പൈക്കുകൾക്കെതിരെ കണ്ടെത്തലിനെ അസാധാരണമാംവിധം പ്രതിരോധശേഷിയുള്ളതാക്കുകയും ചെയ്യുന്നു.

അളന്ന ഫലങ്ങൾ

അക്കോസ്റ്റിക് അവസ്ഥകളിലുടനീളമുള്ള തകർച്ച

കൺസെൻസസ് UAR (MV@5), റഫറൻസ്-അധിഷ്ഠിത / റഫറൻസ്-രഹിത. കൃത്യത കുറയുന്ന അവസ്ഥകൾ ഉൾപ്പെടെ പ്രസിദ്ധീകരിച്ചത്.

സിസ്റ്റം എന്താണ് — എന്തല്ല

SafeVoice രക്തത്തിലെ ആൽക്കഹോൾ സാന്ദ്രത അളക്കുന്നില്ല, ഒരു തൊഴിലാളിയെ ഡ്യൂട്ടിയിൽ നിന്ന് നീക്കം ചെയ്യുന്നതിനുള്ള അടിസ്ഥാനമായി ഉപയോഗിക്കാനും കഴിയില്ല. സ്ഥാപിത മാർഗങ്ങളിലൂടെ സ്ഥിരീകരണത്തിനായി ആരാണ് ശ്രദ്ധ അർഹിക്കുന്നതെന്ന് സൂചിപ്പിക്കുന്ന ഒരു ഫസ്റ്റ്-ലൈൻ സ്ക്രീനിംഗ് ഉപകരണമാണിത്. പ്രസക്തമായ താരതമ്യം ബ്രീത്തലൈസറുമായിട്ടല്ല, മറിച്ച് ഇന്ന് ഉപയോഗത്തിലുള്ള ബദലുമായാണ്: സൂപ്പർവൈസർ നിരീക്ഷണം, അത് ഏകദേശം പരിശീലനമില്ലാത്ത ശ്രവണത്തിന്റെ നിലവാരത്തിലാണ് പ്രവർത്തിക്കുന്നത്.

എല്ലാ ഫലങ്ങളും ഒരു കോർപ്പസിൽ നിന്നാണ് വരുന്നത് — ജർമ്മൻ ആൽക്കഹോൾ ലാംഗ്വേജ് കോർപ്പസ്, 162 സ്പീക്കറുകളിൽ നിന്ന് ഓരോ സ്പീക്കറുടെയും രക്ത- ശ്വാസ-ആൽക്കഹോൾ ഗ്രൗണ്ട് ട്രൂത്ത് സഹിതം റെക്കോർഡ് ചെയ്തത്. ഈ ടാസ്ക്കിന്റെ റഫറൻസ് ബെഞ്ച്മാർക്കാണ് ഇത്, എന്നാൽ ഇത് ഒരൊറ്റ കോർപ്പസാണ്, മുകളിലുള്ള എല്ലാ താരതമ്യങ്ങളും അതിന്റെ ഹെൽഡ്-ഔട്ട് ടെസ്റ്റ് സ്പ്ലിറ്റിലാണ് നടത്തിയത്.

കൃത്യത കുറയുന്ന അവസ്ഥകൾ ഹെഡ്ലൈൻ കണക്കുകൾക്കൊപ്പം ഞങ്ങൾ പ്രസിദ്ധീകരിക്കുന്നു, ഞങ്ങൾ നിരസിച്ചവയും പ്രസിദ്ധീകരിക്കുന്നു: സഹായ വികാര- രക്ത-ആൽക്കഹോൾ-റിഗ്രഷൻ ഹെഡുകൾ (നെഗറ്റീവ് ഇഫക്റ്റ്), ഭാഗിക ബാക്ക്ബോൺ ഫ്രീസിംഗ് (ഏകദേശം ഏഴ് പോയിന്റ് മോശം), ഡിസിഷൻ-ത്രെഷോൾഡ് ട്യൂണിംഗ് (0.2 പോയിന്റ് വിലയുള്ള ഒരു ലക്ഷണ പരിഹാരം), റഫറൻസ്-ഫ്രീ മോഡലിനായുള്ള സ്പീക്കർ-എംബെഡിംഗ് കണ്ടീഷനിംഗ് — ഒരു യഥാർത്ഥ 0.6-പോയിന്റ് നേട്ടം, ഉപയോക്താവിന് എൻറോൾമെന്റ് ആവശ്യമായി വരുമായിരുന്നതിനാലും Solo-യുടെ സീറോ-ഫ്രിക്ഷൻ നേട്ടം നശിപ്പിക്കുമായിരുന്നതിനാലും ഉപേക്ഷിച്ചു.

ഇത് എങ്ങനെ ഉപയോഗിക്കുന്നു

ഷിഫ്റ്റ്-ആരംഭ ഫിറ്റ്നസ്-ഫോർ-ഡ്യൂട്ടി പരിശോധന: എൻറോൾ ചെയ്ത ബേസ്ലൈനിനെതിരെ ഒരു ചെറിയ സംസാരിച്ചുള്ള സൈൻ-ഇൻ

പതിവ് റേഡിയോ ട്രാഫിക്കിൽ തുടർച്ചയായ പാസീവ് നിരീക്ഷണം, എൻറോൾമെന്റ് ഇല്ലാതെ

മനുഷ്യ തീരുമാനത്തിനായി ഉചിതമായ സൂപ്പർവൈസർക്ക് റൂട്ട് ചെയ്ത ഒരു കാലിബ്രേറ്റഡ് ഫ്ലാഗ്

ഓരോ വിശകലന വിൻഡോയ്ക്കും ഒരു സെക്കൻഡിൽ താഴെ ലേറ്റൻസിയോടെ CPU-യിൽ പ്രവർത്തിക്കുന്നു

ഡെമോഗ്രാഫിക് സന്ദർഭം ലഭ്യമല്ലാത്തപ്പോൾ ഗ്രേസ്ഫുള്ളായി ഡീഗ്രേഡ് ചെയ്യുന്നു

XENOM പ്ലാറ്റ്ഫോമിലൂടെ സൈറ്റിന്റെ മറ്റ് പ്രവർത്തന സിഗ്നലുകൾക്കൊപ്പം പ്രദർശിപ്പിക്കുന്നു