A I&D da XENOM atinge o estado da arte no rastreio não invasivo por voz

A fala transporta mais do que palavras. A intoxicação alcoólica deixa vestígios mensuráveis na articulação, no ritmo e na micro variação espectral — sinais que o ouvido humano regista, na melhor das hipóteses, de forma pouco fiável.

A equipa de I&D da XENOM treinou um modelo proprietário de aprendizagem profunda para detetar estes biomarcadores acústicos e avaliou-o no Alcohol Language Corpus, o benchmark público padrão para esta tarefa.

Pontuado estritamente em termos comparáveis — recall médio não ponderado por janela, uma única decisão por enunciado sem votação, exatamente como o trabalho anterior é medido — a configuração baseada em referência atinge 86,3% de UAR. A configuração sem referência, que não requer uma linha de base registada e decide a partir de uma única amostra falada, atinge 81,9%. No ponto de funcionamento de implementação, onde o sistema combina várias janelas de uma gravação numa decisão por consenso, estes valores sobem para 87,6% e 82,5%, respetivamente.

Para contextualizar: a base oficial do Interspeech 2011 Speaker-State Challenge neste corpus situa-se nos 65,9% de UAR, os melhores resultados do estado da arte publicados anteriormente atingem cerca de 73–75%, e os ouvintes humanos não treinados pontuam cerca de 60–65%.

O sistema funciona como uma camada passiva sobre o tráfego de rádio de rotina. Os trabalhadores falam como sempre fazem; sem procedimentos adicionais, sem interrupção da tarefa, sem pontos de verificação separados.

O que o sistema é — e o que não é. Não mede a concentração de álcool no sangue e não pode servir de fundamento para afastar um trabalhador do serviço. É uma ferramenta de rastreio de primeira linha que indica quem merece atenção, para verificação pelos meios estabelecidos. A comparação relevante não é com um alcoolímetro, mas com a alternativa usada atualmente: a observação do supervisor, que tem um desempenho aproximadamente ao nível da escuta não treinada.

Publicámos resultados completos em várias condições acústicas — incluindo aquelas em que a precisão se degrada — juntamente com as ressalvas de comparabilidade e as limitações conhecidas do método.