SafeVoice — ເຄື່ອງຈັກອັດສະລິຍະດ້ານສຽງເວົ້າທີ່ເປັນກຳມະສິດ ທີ່ສະແດງຕົວຊີ້ວັດການບົກຜ່ອງຈາກແອນກໍຮໍທີ່ເປັນໄປໄດ້ ຈາກຄຳເວົ້າທຳມະດາພຽງບໍ່ເທົ່າໃດວິນາທີ. ບໍ່ລຸກລ້ຳ, ບໍ່ຕ້ອງໃຊ້ຮາດແວພິເສດ, ຕ້ອງການພຽງແຕ່ຄຳເວົ້າບາງຄຳ.
ບຸກຄະລາກອນທີ່ບົກຜ່ອງຍັງຄົງເປັນສາເຫດຫຼັກ ແລະ ມີເຄື່ອງມືບໍ່ພຽງພໍ ຂອງເຫດການອຸດສາຫະກຳທີ່ປ້ອງກັນໄດ້. ແອນກໍຮໍຫຼຸດຄວາມໄວປະຕິກິລິຍາ, ການຕັດສິນໄລຍະຫ່າງ, ແລະ ການຄວບຄຸມກ້າມຊີ້ນລະອຽດ ດົນກ່ອນທີ່ອາການຈະປາກົດໃຫ້ເຫັນດ້ວຍສາຍຕາ. ການຄວບຄຸມແບບດັ້ງເດີມ — ເຄື່ອງເປົ່າວັດແອນກໍຮໍຕາມຄາບເວລາ ແລະ ການກວດສອບດ້ວຍສາຍຕາຂອງຜູ້ຄຸມງານ — ເປັນໄລຍະໆ, ລຸກລ້ຳ, ສ້າງຄໍຂວດຢູ່ປະຕູກະທັດ, ແລະ ຫຼີກລ່ຽງໄດ້ງ່າຍ. ຜົນລັບແມ່ນຈຸດບອດຂອງການດຳເນີນງານ: ສະພາວະທີ່ມີຄວາມສ່ຽງສູງຍັງຄົງເປັນສິ່ງທີ່ຍາກທີ່ສຸດທີ່ຈະກວດຈັບຢ່າງຕໍ່ເນື່ອງ.
ສຽງເວົ້າແມ່ນສັນຍານທີ່ເໝາະສົມທີ່ສຸດ ເພື່ອກຳຈັດຊ່ອງຫວ່າງນີ້. ຜູ້ອອກແຮງງານໃຊ້ວິທະຍຸ Push-to-Talk, ອິນເຕີຄອມ, ແລະ ອິນເຕີເຟດສຽງຕາມທຳມະຊາດຕະຫຼອດກະທັດ. ແອນກໍຮໍປ່ຽນແປງຊີວະກົນຈັກທາງສຽງຢ່າງຕໍ່ເນື່ອງ — ບົກຜ່ອງຄວາມໄວການອອກສຽງ, ຈັງຫວະການອອກສຽງ, ສຽງສູງຕໍ່າ, ແລະ ຄຸນນະພາບສຽງທາງສະເປັກຕຣອນ — ຕົວຊີ້ວັດທາງຊີວະພາບ ທີ່ໂມເດວພິເສດສະກັດອອກຈາກສຽງບໍ່ເທົ່າໃດວິນາທີ.
SafeVoice ຖືກນຳໄປໃຊ້ໃນສອງສະຖາປັດຕະຍະກຳທີ່ເສີມກັນ.
SafeVoice-Ref ປຽບທຽບສຽງແບບເວລາຈິງ ກັບພື້ນຖານສຽງທີ່ບໍ່ດື່ມຂອງຜູ້ອອກແຮງງານທີ່ລົງທະບຽນໄວ້ — ເໝາະສຳລັບການກວດສອບການເຂົ້າເຖິງຕອນເລີ່ມກະທັດ.
SafeVoice-Solo ເຮັດວຽກແບບ zero-shot ໂດຍບໍ່ມີພື້ນຖານທີ່ລົງທະບຽນໄວ້, ປະເມີນຊ່ວງສຽງເວົ້າດ່ຽວ ໃນລະຫວ່າງການສື່ສານທາງວິທະຍຸປົກກະຕິຕະຫຼອດກະທັດ.
ການແບ່ງການທົດສອບທີ່ເກັບໄວ້ຂອງ German Alcohol Language Corpus, ມາດຕະຖານສາທາລະນະມາດຕະຖານ, ໃຫ້ຄະແນນດ້ວຍ Unweighted Average Recall (UAR). ການປຽບທຽບກັບງານກ່ອນໜ້າໃຊ້ມາດຕະຖານຕໍ່ໜ້າຕ່າງ — ການຕັດສິນດ່ຽວຕໍ່ຄຳເວົ້າ, ບໍ່ມີການລົງຄະແນນ — ເພາະວ່າງານກ່ອນໜ້າບໍ່ມີການລົງຄະແນນ.
ແທນທີ່ຈະຈັດປະເພດສຽງແບບດ່ຽວ, SafeVoice-Ref ຈະປຽບທຽບສຽງເວົ້າກັບໂປຣໄຟລ໌ພື້ນຖານຂອງບຸກຄົນ. ການກຳຈັດຄວາມແຕກຕ່າງທາງສຽງລະຫວ່າງຜູ້ເວົ້າ ໃຫ້ຜົນກຳໄລປະມານ 5 ຈຸດໃນ Unweighted Average Recall (UAR) ທັນທີ — ເປັນຈຸດສຳຄັນທາງສະຖາປັດຕະຍະກຳທີ່ມີຜົນກະທົບຫຼາຍທີ່ສຸດຂອງພວກເຮົາ.
ທັງ Ref ແລະ Solo ໃຊ້ຕົວແທນທາງສຽງລະດັບຕໍ່າດຽວກັນ. SafeVoice-Ref ເຮັດໃຫ້ຄວາມແມ່ນຍຳສູງສຸດ ຜ່ານການລົງທະບຽນຄັ້ງດຽວທີ່ວ່ອງໄວ, ໃນຂະນະທີ່ SafeVoice-Solo ໃຫ້ຄວາມສຳຄັນກັບການບໍ່ມີຄວາມຂັດແຍ່ງໃນການດຳເນີນງານ, ກວດສອບຜູ້ເວົ້າຄົນໃດກໍໄດ້ທັນທີ ໂດຍບໍ່ມີຂໍ້ມູນປະຫວັດ.
ການປະຕິບັດມາດຕະຖານແນະນຳໃຫ້ຕັ້ງຄ່າ backbone ທີ່ຝຶກມາກ່ອນແລ້ວ ກັບຊຸດຂໍ້ມູນຂະໜາດນ້ອຍ. ການກວາດທາງປະຈັກພະຍານຂອງພວກເຮົາພິສູດວ່າກົງກັນຂ້າມ: ຄວາມແມ່ນຍຳຂອງການກວດສອບເພີ່ມຂຶ້ນຕາມຄວາມເລິກຂອງການປັບລະອຽດ, ເພີ່ມຂຶ້ນປະມານ 7 ຈຸດ ພາຍໃຕ້ການປັບຕົວ backbone ແບບ end-to-end ເຕັມທີ່ ເມື່ອທຽບກັບການຕັ້ງຄ່າຊັ້ນບາງສ່ວນໃຫ້ຄົງທີ່.
ຕົວຊີ້ວັດທາງຊີວະພາບທາງສຽງມີຢູ່ໃນມາດຕາສ່ວນເວລາທີ່ແຕກຕ່າງກັນ. ຊັ້ນ backbone ລຸ່ມເກັບຮັກສາລາຍລະອຽດການອອກສຽງ ແລະ ການເຄື່ອນໄຫວຂອງຊ່ອງສຽງ, ໃນຂະນະທີ່ຊັ້ນສູງຈຳລອງການໄຫຼຂອງສຽງສູງຕໍ່າ ແລະ ຈັງຫວະການຈັດວະລີ. ການລວມຫຼາຍລະດັບ ຕາມດ້ວຍ attentive pooling ຈະຖ່ວງນ້ຳໜັກເຟຣມທີ່ມີການວິນິດໄສຫຼາຍທີ່ສຸດແບບໄດນາມິກ.
ພວກເຮົາຂ້າມສຽງລົບກວນສີຂາວສັງເຄາະ ມາໃຊ້ຫຼັກສູດສຽງອຸດສາຫະກຳທີ່ກວ້າງຂວາງແທນ — ເຄື່ອງຈັກໜັກ, ສຽງດັງຂອງຍານພາຫະນະ, ສຽງລົມກັນຂອງຝູງຊົນ, ແລະ ສຽງກ້ອງກັງວານຂອງໂຄງສ້າງ. ນີ້ປິດຊ່ອງຫວ່າງປະສິດທິພາບໃນສະພາບສະໜາມທີ່ໂຫດຮ້າຍ ໂດຍບໍ່ຫຼຸດຄວາມແມ່ນຍຳຂອງພື້ນຖານທີ່ສະອາດ.
ເພື່ອປ້ອງກັນການກະຕຸກຊົ່ວຄາວ ຫຼື ການກະແຮ່ຄໍ ຈາກການກະຕຸ້ນການແຈ້ງເຕືອນທີ່ຜິດພາດ, ທໍ່ການອ້າງອີງຈະໃຫ້ຄະແນນຫຼາຍໜ້າຕ່າງການວິເຄາະທີ່ຊ້ອນກັນຕໍ່ໜຶ່ງຄຳເວົ້າ. ການໃຊ້ການລົງຄະແນນແບບເຫັນດີຈະເພີ່ມ UAR 1–2 ຈຸດ ແລະ ເຮັດໃຫ້ການກວດຈັບທົນທານຕໍ່ການກະຕຸກທາງສຽງໃນໂລກຈິງຢ່າງພິເສດ.
Consensus UAR (MV@5), ແບບອີງຕາມບຸກຄົນ / ແບບບໍ່ອີງຕາມບຸກຄົນ. ເຜີຍແຜ່ລວມທັງສະພາບທີ່ຄວາມແມ່ນຍຳຫຼຸດລົງ.
SafeVoice ບໍ່ໄດ້ວັດແທກຄວາມເຂັ້ມຂຸ້ນຂອງແອວກໍຮໍໃນເລືອດ ແລະ ບໍ່ສາມາດໃຊ້ເປັນເຫດຜົນໃນການຖອດພະນັກງານອອກຈາກໜ້າທີ່ໄດ້. ມັນເປັນເຄື່ອງມືກວດກາເບື້ອງຕົ້ນທີ່ຊີ້ບອກວ່າໃຜຄວນໄດ້ຮັບຄວາມສົນໃຈ, ເພື່ອການຢືນຢັນດ້ວຍວິທີທີ່ຖືກສ້າງຕັ້ງໄວ້. ການປຽບທຽບທີ່ກ່ຽວຂ້ອງບໍ່ແມ່ນກັບເຄື່ອງວັດແອວກໍຮໍໃນລົມຫາຍໃຈ ແຕ່ແມ່ນກັບທາງເລືອກທີ່ໃຊ້ຢູ່ໃນປະຈຸບັນ: ການສັງເກດການຂອງຫົວໜ້າງານ, ເຊິ່ງມີປະສິດທິພາບປະມານລະດັບຂອງການຟັງແບບບໍ່ໄດ້ຮັບການຝຶກອົບຮົມ.
ຜົນໄດ້ຮັບທັງໝົດມາຈາກຊຸດຂໍ້ມູນດຽວ — German Alcohol Language Corpus, ບັນທຶກຈາກຜູ້ເວົ້າ 162 ຄົນ ພ້ອມດ້ວຍຂໍ້ມູນອ້າງອີງແອວກໍຮໍໃນເລືອດ ແລະ ລົມຫາຍໃຈຕໍ່ຜູ້ເວົ້າ. ມັນເປັນມາດຕະຖານອ້າງອີງສຳລັບວຽກນີ້, ແຕ່ມັນເປັນຊຸດຂໍ້ມູນດຽວ, ແລະ ທຸກໆການປຽບທຽບຂ້າງເທິງແມ່ນເຮັດຢູ່ໃນສ່ວນທົດສອບທີ່ຖືກແຍກໄວ້.
ພວກເຮົາເຜີຍແຜ່ເງື່ອນໄຂທີ່ຄວາມຖືກຕ້ອງຫຼຸດລົງຄຽງຄູ່ກັບຕົວເລກຫຼັກ, ແລະ ພວກເຮົາເຜີຍແຜ່ສິ່ງທີ່ພວກເຮົາປະຕິເສດ: ຫົວຂໍ້ອາລົມເສີມ ແລະ ການຖົດຖອຍຂອງແອວກໍຮໍໃນເລືອດ (ຜົນກະທົບທາງລົບ), ການແຊ່ແຂງກະດູກສັນຫຼັງບາງສ່ວນ (ຮ້າຍແຮງກວ່າປະມານເຈັດຈຸດ), ການປັບຈຸດເລີ່ມຕົ້ນການຕັດສິນ (ການແກ້ໄຂອາການທີ່ມີຄ່າ 0.2 ຈຸດ), ແລະ ການກຳນົດເງື່ອນໄຂການຝັງຕົວຜູ້ເວົ້າສຳລັບແບບຈຳລອງທີ່ບໍ່ຕ້ອງການອ້າງອີງ — ເປັນຜົນກຳໄລແທ້ 0.6 ຈຸດ, ຖືກປະຖິ້ມເພາະມັນຈະຕ້ອງມີການລົງທະບຽນຕໍ່ຜູ້ໃຊ້ ແລະ ທຳລາຍຂໍ້ໄດ້ປຽບທີ່ບໍ່ມີແຮງສຽດທານຂອງ Solo.
ການກວດສອບຄວາມພ້ອມໃນການປະຕິບັດໜ້າທີ່ຕອນເລີ່ມກະທັດ: ການເຂົ້າສູ່ລະບົບດ້ວຍສຽງເວົ້າສັ້ນໆ ທຽບກັບຂໍ້ມູນອ້າງອີງທີ່ລົງທະບຽນໄວ້
ການຕິດຕາມກວດກາແບບຕັ້ງຮັບຢ່າງຕໍ່ເນື່ອງຜ່ານການຈາລະຈອນວິທະຍຸປົກກະຕິ, ໂດຍບໍ່ມີການລົງທະບຽນ
ການແຈ້ງເຕືອນທີ່ຖືກປັບທຽບສົ່ງຕໍ່ໄປຍັງຫົວໜ້າງານທີ່ກ່ຽວຂ້ອງ ເພື່ອການຕັດສິນໃຈຂອງມະນຸດ
ເຮັດວຽກຢູ່ເທິງ CPU ດ້ວຍຄວາມໜ່ວງໜ່ວງຕ່ຳກວ່າໜຶ່ງວິນາທີຕໍ່ໜ້າຕ່າງການວິເຄາະ
ຫຼຸດປະສິດທິພາບລົງຢ່າງຄ່ອຍເປັນຄ່ອຍໄປ ເມື່ອບໍ່ມີບໍລິບົດທາງປະຊາກອນ
ສະແດງຜ່ານແພລດຟອມ XENOM ຄຽງຄູ່ກັບສັນຍານປະຕິບັດການອື່ນໆຂອງສະຖານທີ່