Inteligência artificial do Google consegue separar vozes em uma multidão
A inteligência artificial do Google já é bastante avançada em se tratando de imagens. Ela é capaz de tirar fotos e editá-las sem a ajuda de ninguém. Agora, ela também está sendo treinada para esclarecer o que está sendo dito em um vídeo com muitas pessoas falando ao mesmo tempo.
O sistema é capaz de isolar diferentes vozes somente ao focar no rosto das pessoas. Para chegar a esse ponto, os pesquisadores fizeram a IA reconhecer falas individuais em cerca de 100 mil vídeos. O processo resultou em duas mil horas de falas sem a interferência de músicas, auditórios ou outros indivíduos.
Em seguida, houve a simulação de um cenário em que esses vídeos foram reproduzidos ao mesmo tempo. Para dificultar o trabalho, os pesquisadores também incluíram um ruído sem fala ao fundo. A tarefa era ensinar a inteligência artificial a isolar as vozes em diferentes faixas de áudio.
A técnica combina sinais sonoros e visuais para separar a fala. “Os movimentos da boca de uma pessoa, por exemplo, devem se correlacionar com os sons produzidos enquanto ela está falando”, explicam os pesquisadores.
O Google diz que está “explorando as oportunidades” para aplicar esta ferramenta. Ela poderá ser usada em serviços como Hangouts e Duo. O objetivo é permitir que os usuários escutem melhor uma pessoa que está em um local barulhento, como no vídeo abaixo:
Outro vídeo mostra que a ferramenta também consegue separar as vozes quando um auditório é responsável pelo barulho ao fundo:
Além do desenvolvimento, o Google também terá que lidar com questões relacionadas à privacidade. A depender do avanço, um sistema como esse poderia ser usado para espionar conversas de terceiros em um ambiente público, por exemplo.
Com informações: Google, Engadget, Android Police.
Leia | Como usar a função de texto falado no TikTok [Voz do Google]