ပြောဆိုသော check-in မှ အသံပိုင်းဆိုင်ရာ မူးယစ်မှုရှာဖွေခြင်း

SafeVoice — စက္ကန့်အနည်းငယ်မျှသော သာမန်စကားပြောမှ အရက်မူးယစ်မှုဖြစ်နိုင်ခြေကို အလံပြသော မူပိုင်စကားပြောဉာဏ်ရည်အင်ဂျင်တစ်ခု။ ထိုးဖောက်မှုမရှိ၊ အထူးဟာ့ဒ်ဝဲ သုညလိုအပ်ပြီး ပြောဆိုသော စကားစုတစ်ခုထက် ပိုမလိုအပ်ပါ။

မူးယစ်နေသော ဝန်ထမ်းများသည် ကြိုတင်ကာကွယ်နိုင်သော စက်မှုမတော်တဆမှုများ၏ ဦးဆောင်အကြောင်းရင်းဖြစ်ပြီး ကိရိယာတပ်ဆင်မှု အားနည်းနေသည်။ အရက်သည် အမြင်အာရုံလက္ခဏာများမပေါ်မီ ကြာမြင့်စွာကတည်းက တုံ့ပြန်မှုအမြန်နှုန်း၊ နေရာဆိုင်ရာ ဆုံးဖြတ်ချက်နှင့် ကြွက်သားလှုပ်ရှားမှုထိန်းချုပ်မှုကို ကျဆင်းစေသည်။ သမားရိုးကျ ထိန်းချုပ်မှုများ — အခါအားလျော်စွာ breathalyzer စစ်ဆေးခြင်းနှင့် အမြင်အာရုံကြီးကြပ်စစ်ဆေးခြင်းတို့သည် — အဆက်မပြတ်မဟုတ်၊ ထိုးဖောက်မှုရှိပြီး၊ အဆိုင်းဂိတ်များတွင် ပိတ်ဆို့မှုများဖြစ်စေကာ ရှောင်လွှဲရန် လွယ်ကူသည်။ ရလဒ်မှာ လုပ်ငန်းလည်ပတ်မှုဆိုင်ရာ ကန်းကွက်တစ်ခုဖြစ်သည်- အန္တရာယ်မြင့်မားသော အခြေအနေများကို စဉ်ဆက်မပြတ် ကြားဖြတ်ရှာဖွေရန် အခက်ဆုံးအဖြစ် ဆက်လက်တည်ရှိနေသည်။

အသံသည် ဤကွာဟချက်ကို ဖယ်ရှားရန် အကောင်းဆုံး အချက်ပြဖြစ်သည်။ အလုပ်သမားများသည် အဆိုင်းတစ်လျှောက် Push-to-Talk ရေဒီယိုများ၊ အင်တာကွန်းများနှင့် အသံအင်တာဖေ့စ်များကို သဘာဝကျကျ အသုံးပြုကြသည်။ အရက်သည် အသံထွက်ပိုင်းဆိုင်ရာ ဇီဝစက်မှုပညာကို တသမတ်တည်း ပြောင်းလဲစေသည် — အသံထွက်မြန်နှုန်း၊ အသံပြုချိန်၊ စည်းချက်နှင့် အသံအရည်အသွေးတို့ကို ထိခိုက်စေသည် — ထို biomarkers များကို အထူးပြုမော်ဒယ်က စက္ကန့်ပိုင်းအတွင်း အသံဖိုင်မှ ထုတ်ယူပါသည်။

SafeVoice ကို ဖြည့်စွက်ဗိသုကာနှစ်ခုဖြင့် ဖြန့်ကျက်ပါသည်။

SafeVoice-Ref သည် အချိန်နှင့်တပြေးညီ အသံကို အလုပ်သမား၏ စာရင်းသွင်းထားသော သတိရှိသော အခြေခံအချက်နှင့် နှိုင်းယှဉ်သည် — အဆိုင်းစတင်ဝင်ရောက်မှု စစ်ဆေးခြင်းအတွက် အကောင်းဆုံးဖြစ်သည်။

SafeVoice-Solo သည် စာရင်းသွင်းထားသော အခြေခံအချက်မရှိဘဲ zero-shot လုပ်ဆောင်ပြီး အဆိုင်းတစ်လျှောက် ပုံမှန်ရေဒီယိုဆက်သွယ်မှုများအတွင်း တစ်ခုတည်းသော စကားပြောအပိုင်းများကို အကဲဖြတ်ပါသည်။

German Alcohol Language Corpus ၏ Held-out test split၊ စံပြ အများသုံး benchmark ကို unweighted average recall (UAR) ဖြင့် အမှတ်ပေးသည်။ ယခင်သုတေသနများနှင့် နှိုင်းယှဉ်မှုများသည် per-window metric ကို အသုံးပြုသည် — တစ်ကြိမ်စကားပြောလျှင် ဆုံးဖြတ်ချက်တစ်ခု၊ voting မရှိ — အကြောင်းမှာ ယခင်သုတေသနများသည် voting မလုပ်သောကြောင့်ဖြစ်သည်။

ကျွန်ုပ်တို့ တည်ဆောက်ခဲ့သည့်အရာ

စကားပြောသူ-နှိုင်းရ ကွဲပြားသော ကုဒ်ပြောင်းခြင်း

အသံကို သီးခြားခွဲခြားခြင်းအစား SafeVoice-Ref သည် စကားပြောကို တစ်ဦးချင်း၏ အခြေခံပရိုဖိုင်နှင့် နှိုင်းယှဉ်စစ်ဆေးသည်။ စကားပြောသူကြား အသံပိုင်းဆိုင်ရာ ကွဲလွဲမှုကို ဖယ်ရှားခြင်းဖြင့် Unweighted Average Recall (UAR) တွင် ချက်ချင်း ~5-point တိုးတက်မှုကို ရရှိစေသည် — ကျွန်ုပ်တို့၏ အထင်ရှားဆုံး ဗိသုကာဆိုင်ရာ မှတ်တိုင်ဖြစ်သည်။

မော်ဒယ်ဗိသုကာနှစ်မျိုး၊ ပေါင်းစည်းထားသော Feature အစုအဝေး

Ref နှင့် Solo နှစ်ခုစလုံးသည် တူညီသော အနိမ့်အဆင့် အသံပိုင်းဆိုင်ရာ ကိုယ်စားပြုချက်များကို အသုံးပြုသည်။ SafeVoice-Ref သည် လျင်မြန်သော တစ်ကြိမ်တည်းစာရင်းသွင်းမှုဖြင့် တိကျမှုကို အမြင့်ဆုံးဖြစ်စေပြီး SafeVoice-Solo သည် လုပ်ငန်းလည်ပတ်မှုဆိုင်ရာ အဆီးအတားကင်းမှုကို ဦးစားပေးကာ သမိုင်းဒေတာမရှိဘဲ မည်သည့်စကားပြောသူကိုမဆို ချက်ချင်း စစ်ဆေးသည်။

Backbone အပြည့်အဝ လိုက်လျောညီထွေဖြစ်အောင်ပြုလုပ်ခြင်း

စံအလေ့အကျင့်အရ သေးငယ်သော ဒေတာအစုအဝေးများတွင် ကြိုတင်လေ့ကျင့်ထားသော backbone များကို အေးခဲထားရန် အကြံပြုသည်။ ကျွန်ုပ်တို့၏ လက်တွေ့စမ်းသပ်မှုများက ဆန့်ကျင်ဘက်ကို သက်သေပြခဲ့သည်- စစ်ဆေးမှုတိကျမှုသည် fine-tuning အတိမ်အနက်နှင့်အတူ တိုးတက်လာပြီး တစ်စိတ်တစ်ပိုင်း layer အေးခဲခြင်းနှင့် နှိုင်းယှဉ်ပါက အပြည့်အဝ end-to-end backbone လိုက်လျောညီထွေဖြစ်အောင်လုပ်ခြင်းဖြင့် ~7 points ခုန်တက်သွားသည်။

စကေးမျိုးစုံ Feature စုစည်းခြင်း

အသံပိုင်းဆိုင်ရာ biomarkers များသည် မတူညီသော အချိန်ဆိုင်ရာ resolution များတွင် တည်ရှိသည်။ အောက်ပိုင်း backbone layers များသည် အသံထွက်နှင့် အသံအိုးဒိုင်းနမစ်များ၏ အသေးစိတ်ကို ထိန်းသိမ်းထားပြီး အထက်ပိုင်း layers များသည် စည်းချက်စီးဆင်းမှုနှင့် စကားစုခွဲခြားမှုပုံစံများကို ပုံစံပြသည်။ Multi-level fusion ပြီးနောက် attentive pooling သည် အရေးအကြီးဆုံး frame များကို ဒိုင်းနမစ်နည်းဖြင့် အလေးချိန်သတ်မှတ်ပေးသည်။

အကြီးစားစက်မှုဆူညံသံ သင်ရိုးညွှန်းတမ်း

ကျွန်ုပ်တို့သည် ဓာတုအဖြူရောင်ဆူညံသံကို ရှောင်ရှားပြီး ကျယ်ပြန့်သော စက်မှုအသံသင်ရိုးများ — အကြီးစားစက်ယန္တရားများ၊ ယာဉ်အင်ဂျင်သံ၊ ပတ်ဝန်းကျင်လူအုပ်ဆူညံသံနှင့် structural reverberation တို့ကို ဦးစားပေးခဲ့သည်။ ဤသည်က သန့်ရှင်းသော အခြေခံတိကျမှုကို မကျဆင်းစေဘဲ ကြမ်းတမ်းသော ကွင်းဆင်းအခြေအနေများတွင် စွမ်းဆောင်ရည်ကွာဟချက်ကို ပိတ်ပေးခဲ့သည်။

ပြတင်းပေါက်မျိုးစုံ သဘောတူ ကုဒ်ဖွင့်ခြင်း

ယာယီ spikes များ သို့မဟုတ် လည်ချောင်းရှင်းခြင်းများသည် မှားယွင်းသော အချက်ပေးမှုများကို မဖြစ်စေရန် inference pipeline သည် စကားစုတစ်ခုလျှင် ထပ်နေသော ခွဲခြမ်းစိတ်ဖြာပြတင်းပေါက်များစွာကို အမှတ်ပေးသည်။ Consensus voting ကို အသုံးပြုခြင်းသည် UAR ၏ 1–2 points ကို ထပ်ပေါင်းပေးပြီး လက်တွေ့ကမ္ဘာ အသံဆိုင်ရာ spikes များအတွက် ထူးခြားစွာ ခံနိုင်ရည်ရှိစေသည်။

တိုင်းတာထားသော ရလဒ်များ

အသံပိုင်းဆိုင်ရာ အခြေအနေများတွင် စွမ်းဆောင်ရည်ကျဆင်းမှု

Consensus UAR (MV@5)၊ အခြေခံရည်ညွှန်းချက် / ရည်ညွှန်းချက်မဲ့။ တိကျမှုကျဆင်းသော အခြေအနေများအပါအဝင် ထုတ်ပြန်ထားသည်။

စနစ်က ဘာဖြစ်သည် — ဘာမဟုတ်သည်

SafeVoice သည် သွေးတွင်း အယ်လ်ကိုဟော ပါဝင်မှုကို တိုင်းတာခြင်း မဟုတ်ဘဲ အလုပ်သမားတစ်ဦးကို တာဝန်မှ ဖယ်ရှားရန် အကြောင်းပြချက်အဖြစ် အသုံးမပြုနိုင်ပါ။ ၎င်းသည် မည်သူ့ကို အာရုံစိုက်သင့်သည်ကို ညွှန်ပြပေးသည့် ပထမအဆင့် စစ်ဆေးရေးကိရိယာဖြစ်ပြီး တည်ဆဲနည်းလမ်းများဖြင့် အတည်ပြုရန် ဖြစ်သည်။ သက်ဆိုင်ရာ နှိုင်းယှဉ်မှုမှာ breathalyzer နှင့် မဟုတ်ဘဲ ယနေ့အသုံးပြုနေသော အခြားနည်းလမ်းဖြစ်သည့် ကြီးကြပ်သူ၏ စောင့်ကြည့်လေ့လာမှုနှင့် ဖြစ်ပြီး ၎င်းသည် လေ့ကျင့်မထားသော နားထောင်မှုအဆင့်ခန့်သာ စွမ်းဆောင်နိုင်သည်။

ရလဒ်အားလုံးသည် ကော်ပိုရာတစ်ခုတည်းမှ လာသည် — German Alcohol Language Corpus ဖြစ်ပြီး စပီကာ 162 ဦးထံမှ မှတ်တမ်းတင်ထားကာ စပီကာတစ်ဦးချင်းစီ၏ သွေးနှင့် အသက်ရှူ အာရုံခံ အယ်လ်ကိုဟော အမှန်တရားများ ပါဝင်သည်။ ဤလုပ်ငန်းအတွက် ရည်ညွှန်းစံနှုန်းဖြစ်သော်လည်း ကော်ပိုရာတစ်ခုတည်းသာ ဖြစ်ပြီး အထက်ပါ နှိုင်းယှဉ်မှုအားလုံးကို ၎င်း၏ သီးသန့်ထားသော စမ်းသပ်ခွဲမှုအပေါ် ပြုလုပ်ထားသည်။

တိကျမှု ကျဆင်းသွားသည့် အခြေအနေများကို အဓိကကိန်းဂဏန်းများနှင့်အတူ ထုတ်ပြန်ပြီး ကျွန်ုပ်တို့ ပယ်ချခဲ့သည်များကိုလည်း ထုတ်ပြန်သည်- အရန်စိတ်ခံစားမှုနှင့် သွေးအယ်လ်ကိုဟော-ဆုတ်ယုတ်မှု ခေါင်းစီးများ (ဆိုးကျိုးသက်ရောက်မှု)၊ တစ်စိတ်တစ်ပိုင်း backbone အေးခဲခြင်း (ခုနစ်မှတ်ခန့် ပိုဆိုး)၊ ဆုံးဖြတ်ချက်-သတ်မှတ်ချက် ချိန်ညှိခြင်း (0.2 မှတ်သာ အကျိုးရှိသော လက္ခဏာပြင်ဆင်မှု)၊ နှင့် ရည်ညွှန်းမဲ့မော်ဒယ်အတွက် စပီကာ-embedding သတ်မှတ်ခြင်း — အမှန်တကယ် 0.6 မှတ် တိုးတက်မှုဖြစ်သော်လည်း အသုံးပြုသူတစ်ဦးချင်း စာရင်းသွင်းရန် လိုအပ်ပြီး Solo ၏ ပွတ်တိုက်မှုကင်းသော အားသာချက်ကို ဖျက်ဆီးနိုင်သောကြောင့် စွန့်ပစ်ခဲ့သည်။

အသုံးပြုပုံ

ဆိုင်းစတင်ချိန် တာဝန်ထမ်းဆောင်နိုင်မှု စစ်ဆေးခြင်း- စာရင်းသွင်းထားသော အခြေခံအသံနှင့် နှိုင်းယှဉ်၍ တိုတောင်းသော အသံဖြင့် ဝင်ရောက်မှု

ပုံမှန် ရေဒီယို အသွားအလာတွင် စာရင်းသွင်းမှုမလိုဘဲ ဆက်တိုက် passive စောင့်ကြည့်မှု

လူသားဆုံးဖြတ်ချက်အတွက် သင့်လျော်သော ကြီးကြပ်သူထံ ပေးပို့သော ချိန်ညှိထားသည့် သတိပေးချက်

ခွဲခြမ်းစိတ်ဖြာမှု window တစ်ခုလျှင် တစ်စက္ကန့်အောက် latency ဖြင့် CPU ပေါ်တွင် လည်ပတ်သည်

လူဦးရေဆိုင်ရာ အကြောင်းအရာ မရရှိနိုင်သည့်အခါ သင့်တင့်စွာ ကျဆင်းသွားသည်

XENOM ပလက်ဖောင်းမှတစ်ဆင့် ဆိုက်၏ အခြားလည်ပတ်မှုဆိုင်ရာ အချက်ပြများနှင့်အတူ ပြသသည်