ຄຳເວົ້າມີຫຼາຍກວ່າຄຳສັບ. ອາການເມົາເຫຼົ້າປະຖິ້ມຮ່ອງຮອຍທີ່ວັດແທກໄດ້ໃນການອອກສຽງ, ຈັງຫວະ ແລະ ການປ່ຽນແປງເລັກນ້ອຍທາງສະເປັກທຣັມ — ສັນຍານທີ່ຫູມະນຸດລົງທະບຽນໄດ້ຢ່າງບໍ່ໜ້າເຊື່ອຖືໃນກໍລະນີດີທີ່ສຸດ.
ທີມ R&D ຂອງ XENOM ໄດ້ຝຶກອົບຮົມໂມເດລ deep learning ທີ່ເປັນກຳມະສິດ ເພື່ອກວດພົບ biomarkers ທາງສຽງເຫຼົ່ານີ້ ແລະ ໄດ້ປະເມີນຜົນກັບ Alcohol Language Corpus, ເຊິ່ງເປັນ benchmark ສາທາລະນະມາດຕະຖານສຳລັບງານນີ້.
ການໃຫ້ຄະແນນຢ່າງເຂັ້ມງວດແບບ like-for-like — ຄ່າສະເລ່ຍ recall ແບບບໍ່ຖ່ວງນ້ຳໜັກຕໍ່ window, ການຕັດສິນໃຈດຽວຕໍ່ຄຳເວົ້າໂດຍບໍ່ມີການລົງຄະແນນ, ຕາມວິທີທີ່ວຽກກ່ອນໜ້າຖືກວັດແທກ — ການຕັ້ງຄ່າແບບອີງໃສ່ reference ໄດ້ UAR 86.3%. ການຕັ້ງຄ່າແບບ reference-free, ເຊິ່ງບໍ່ຕ້ອງການ baseline ທີ່ລົງທະບຽນໄວ້ ແລະ ຕັດສິນຈາກຕົວຢ່າງຄຳເວົ້າເພຍວດຽວ, ໄດ້ 81.9%. ທີ່ຈຸດປະຕິບັດການນຳໃຊ້, ບ່ອນທີ່ລະບົບລວມ window ຫຼາຍໆອັນຂອງການບັນທຶກເຂົ້າເປັນການຕັດສິນໃຈ consensus, ຄ່າເຫຼົ່ານີ້ເພີ່ມຂຶ້ນເປັນ 87.6% ແລະ 82.5% ຕາມລຳດັບ.
ສຳລັບບໍລິບົດ: baseline ຢ່າງເປັນທາງການຂອງ Interspeech 2011 Speaker-State Challenge ໃນ corpus ນີ້ຢູ່ທີ່ 65.9% UAR, ຜົນລັບ state-of-the-art ທີ່ເຜີຍແຜ່ກ່ອນໜ້າສູງສຸດປະມານ 73–75%, ແລະ ຜູ້ຟັງທີ່ບໍ່ໄດ້ຮັບການຝຶກອົບຮົມໄດ້ຄະແນນປະມານ 60–65%.
ລະບົບເຮັດວຽກເປັນຊັ້ນ passive ທີ່ຊ້ອນຢູ່ເທິງການສື່ສານທາງວິທະຍຸປົກກະຕິ. ຜູ້ອອກແຮງງານເວົ້າຕາມປົກກະຕິ; ບໍ່ມີຂັ້ນຕອນເພີ່ມເຕີມ, ບໍ່ມີການຂັດຈັງຫວະງານ, ບໍ່ມີຈຸດກວດແຍກຕ່າງຫາກ.
ລະບົບເປັນແນວໃດ — ແລະ ບໍ່ແມ່ນຫຍັງ. ມັນບໍ່ໄດ້ວັດຄວາມເຂັ້ມຂົ້ນຂອງແອວກໍຮໍໃນເລືອດ ແລະ ບໍ່ສາມາດໃຊ້ເປັນພື້ນຖານໃນການປົດຜູ້ອອກແຮງງານອອກຈາກໜ້າທີ່. ມັນເປັນເຄື່ອງມືກວດກາແບບທຳອິດທີ່ຊີ້ບອກວ່າໃຜຄວນໄດ້ຮັບຄວາມສົນໃຈ, ເພື່ອການກວດສອບໂດຍວິທີທີ່ຖືກສ້າງຕັ້ງຂຶ້ນ. ການປຽບທຽບທີ່ກ່ຽວຂ້ອງບໍ່ແມ່ນກັບ breathalyzer, ແຕ່ກັບທາງເລືອກທີ່ໃຊ້ໃນປະຈຸບັນ: ການສັງເກດຂອງຜູ້ຄຸມງານ, ເຊິ່ງປະຕິບັດໄດ້ໃນລະດັບປະມານການຟັງທີ່ບໍ່ໄດ້ຮັບການຝຶກອົບຮົມ.
ພວກເຮົາໄດ້ເຜີຍແຜ່ຜົນລັບເຕັມຮູບແບບໃນສະພາບສຽງຕ່າງໆ — ລວມທັງບ່ອນທີ່ຄວາມຖືກຕ້ອງຫຼຸດລົງ — ພ້ອມກັບຂໍ້ຄວນລະວັງດ້ານການປຽບທຽບ ແລະ ຂໍ້ຈຳກັດທີ່ຮູ້ແລ້ວຂອງວິທີການ.